初始化项目,由ModelHub XC社区提供模型
Model: Aratako/ELYZA-japanese-Llama-2-MoE-2x13B-v0.1 Source: Original Platform
This commit is contained in:
55
.gitattributes
vendored
Normal file
55
.gitattributes
vendored
Normal file
@@ -0,0 +1,55 @@
|
||||
*.7z filter=lfs diff=lfs merge=lfs -text
|
||||
*.arrow filter=lfs diff=lfs merge=lfs -text
|
||||
*.bin filter=lfs diff=lfs merge=lfs -text
|
||||
*.bin.* filter=lfs diff=lfs merge=lfs -text
|
||||
*.bz2 filter=lfs diff=lfs merge=lfs -text
|
||||
*.ftz filter=lfs diff=lfs merge=lfs -text
|
||||
*.gz filter=lfs diff=lfs merge=lfs -text
|
||||
*.h5 filter=lfs diff=lfs merge=lfs -text
|
||||
*.joblib filter=lfs diff=lfs merge=lfs -text
|
||||
*.lfs.* filter=lfs diff=lfs merge=lfs -text
|
||||
|
||||
*.msgpack filter=lfs diff=lfs merge=lfs -text
|
||||
*.onnx filter=lfs diff=lfs merge=lfs -text
|
||||
*.ot filter=lfs diff=lfs merge=lfs -text
|
||||
*.parquet filter=lfs diff=lfs merge=lfs -text
|
||||
*.pb filter=lfs diff=lfs merge=lfs -text
|
||||
*.pt filter=lfs diff=lfs merge=lfs -text
|
||||
*.pth filter=lfs diff=lfs merge=lfs -text
|
||||
*.rar filter=lfs diff=lfs merge=lfs -text
|
||||
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
|
||||
*.tar.* filter=lfs diff=lfs merge=lfs -text
|
||||
*.tflite filter=lfs diff=lfs merge=lfs -text
|
||||
*.tgz filter=lfs diff=lfs merge=lfs -text
|
||||
*.xz filter=lfs diff=lfs merge=lfs -text
|
||||
*.zip filter=lfs diff=lfs merge=lfs -text
|
||||
*.zstandard filter=lfs diff=lfs merge=lfs -text
|
||||
*.tfevents* filter=lfs diff=lfs merge=lfs -text
|
||||
*.db* filter=lfs diff=lfs merge=lfs -text
|
||||
*.ark* filter=lfs diff=lfs merge=lfs -text
|
||||
**/*ckpt*data* filter=lfs diff=lfs merge=lfs -text
|
||||
**/*ckpt*.meta filter=lfs diff=lfs merge=lfs -text
|
||||
**/*ckpt*.index filter=lfs diff=lfs merge=lfs -text
|
||||
|
||||
*.ckpt filter=lfs diff=lfs merge=lfs -text
|
||||
*.gguf* filter=lfs diff=lfs merge=lfs -text
|
||||
*.ggml filter=lfs diff=lfs merge=lfs -text
|
||||
*.llamafile* filter=lfs diff=lfs merge=lfs -text
|
||||
*.pt2 filter=lfs diff=lfs merge=lfs -text
|
||||
*.mlmodel filter=lfs diff=lfs merge=lfs -text
|
||||
*.npy filter=lfs diff=lfs merge=lfs -text
|
||||
*.npz filter=lfs diff=lfs merge=lfs -text
|
||||
*.pickle filter=lfs diff=lfs merge=lfs -text
|
||||
*.pkl filter=lfs diff=lfs merge=lfs -text
|
||||
*.tar filter=lfs diff=lfs merge=lfs -text
|
||||
*.wasm filter=lfs diff=lfs merge=lfs -text
|
||||
*.zst filter=lfs diff=lfs merge=lfs -text
|
||||
*tfevents* filter=lfs diff=lfs merge=lfs -text
|
||||
|
||||
model-00005-of-00005.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||
model-00001-of-00005.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||
tokenizer.json filter=lfs diff=lfs merge=lfs -text
|
||||
model-00004-of-00005.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||
tokenizer.model filter=lfs diff=lfs merge=lfs -text
|
||||
model-00003-of-00005.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||
model-00002-of-00005.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||
96
README.md
Normal file
96
README.md
Normal file
@@ -0,0 +1,96 @@
|
||||
---
|
||||
base_model:
|
||||
- elyza/ELYZA-japanese-Llama-2-13b
|
||||
- elyza/ELYZA-japanese-Llama-2-13b-instruct
|
||||
license: llama2
|
||||
language:
|
||||
- ja
|
||||
tags:
|
||||
- mergekit
|
||||
- merge
|
||||
- MoE
|
||||
---
|
||||
# ELYZA-japanese-Llama-2-MoE-2x13B-v0.1
|
||||
[**English description here**](#description)
|
||||
|
||||
|
||||
## 概要
|
||||
Llama-2ベースの学習済み日本語モデルである[elyza/ELYZA-japanese-Llama-2-13b](https://huggingface.co/elyza/ELYZA-japanese-Llama-2-13b)と、そのinstruction tuningモデルである[elyza/ELYZA-japanese-Llama-2-13b-instruct](https://huggingface.co/elyza/ELYZA-japanese-Llama-2-13b-instruct)
|
||||
を、[mergekit](https://github.com/cg123/mergekit)を使ってMoEを行い作成したモデルです。
|
||||
|
||||
[GGUF版はこちら](https://huggingface.co/Aratako/ELYZA-japanese-Llama-2-MoE-2x13B-v0.1-GGUF)
|
||||
|
||||
以下2モデルを利用しています。
|
||||
- [elyza/ELYZA-japanese-Llama-2-13b](https://huggingface.co/elyza/ELYZA-japanese-Llama-2-13b)
|
||||
- [elyza/ELYZA-japanese-Llama-2-13b-instruct](https://huggingface.co/elyza/ELYZA-japanese-Llama-2-13b-instruct)
|
||||
|
||||
## ライセンス
|
||||
元モデルの通り、Llama2ライセンスを継承します。
|
||||
|
||||
Llama 2 is licensed under the LLAMA 2 Community License, Copyright (c) Meta Platforms, Inc. All Rights Reserved.
|
||||
|
||||
## ベンチマーク
|
||||
ベースとしたELYZA-japanese-Llama-2-13b-instructと本モデルの[japanese-mt-bench](https://github.com/Stability-AI/FastChat/tree/jp-stable/fastchat/llm_judge)の結果は以下の通りです。
|
||||
(シングルターン)
|
||||
|Model|Size|Coding|Extraction|Humanities|Math|Reasoning|Roleplay|STEM|Writing|avg_score|
|
||||
|---|---|---|---|---|---|---|---|---|---|---|
|
||||
| ELYZA-japanese-Llama-2-13b-instruct | 13B | **3.7** | 6.0 | **6.6** | 2.4 | 2.5 | 5.2 | 5.8 | 7.2 | 4.925 |
|
||||
| This model | 2x13B | **3.7** | **6.9** | 6.3 | **3.7** | **4.4** | **6.0** | **7.0** | **7.4** | **5.675** |
|
||||
|
||||

|
||||
|
||||
**ベンチマークに使用したプロンプト**
|
||||
```
|
||||
"""<s>[INST] <<SYS>>
|
||||
あなたは誠実で優秀な日本人のアシスタントです。
|
||||
<</SYS>>
|
||||
|
||||
{instruction} [/INST]"""
|
||||
```
|
||||
|
||||
## Description
|
||||
This model is created using MoE (Mixture of Experts) through mergekit based on [elyza/ELYZA-japanese-Llama-2-13b](https://huggingface.co/elyza/ELYZA-japanese-Llama-2-13b) and [elyza/ELYZA-japanese-Llama-2-13b-instruct](https://huggingface.co/elyza/ELYZA-japanese-Llama-2-13b-instruct).
|
||||
|
||||
[Click here for the GGUF version](https://huggingface.co/Aratako/ELYZA-japanese-Llama-2-MoE-2x13B-v0.1-GGUF)
|
||||
|
||||
It utilizes the following two models:
|
||||
- [elyza/ELYZA-japanese-Llama-2-13b](https://huggingface.co/elyza/ELYZA-japanese-Llama-2-13b)
|
||||
- [elyza/ELYZA-japanese-Llama-2-13b-instruct](https://huggingface.co/elyza/ELYZA-japanese-Llama-2-13b-instruct)
|
||||
|
||||
## License
|
||||
This model inherit the Llama2 license.
|
||||
|
||||
Llama 2 is licensed under the LLAMA 2 Community License, Copyright (c) Meta Platforms, Inc. All Rights Reserved.
|
||||
|
||||
## Benchmark
|
||||
The results of this model and the base ELYZA-japanese-Llama-2-13b-instruct on japanese-mt-bench are as follows.
|
||||
(Single turn)
|
||||
|Model|Size|Coding|Extraction|Humanities|Math|Reasoning|Roleplay|STEM|Writing|avg_score|
|
||||
|---|---|---|---|---|---|---|---|---|---|---|
|
||||
| ELYZA-japanese-Llama-2-13b-instruct | 13B | **3.7** | 6.0 | **6.6** | 2.4 | 2.5 | 5.2 | 5.8 | 7.2 | 4.925 |
|
||||
| This model | 2x13B | **3.7** | **6.9** | 6.3 | **3.7** | **4.4** | **6.0** | **7.0** | **7.4** | **5.675** |
|
||||
|
||||

|
||||
|
||||
**Prompt used for benchmark**
|
||||
```
|
||||
"""<s>[INST] <<SYS>>
|
||||
あなたは誠実で優秀な日本人のアシスタントです。
|
||||
<</SYS>>
|
||||
|
||||
{instruction} [/INST]"""
|
||||
```
|
||||
|
||||
## Merge config
|
||||
[mergekit_config.yml](./mergekit_moe_config.yml)
|
||||
```yaml
|
||||
base_model: ./ELYZA-japanese-Llama-2-13b-instruct
|
||||
gate_mode: random
|
||||
dtype: bfloat16
|
||||
experts:
|
||||
- source_model: ./ELYZA-japanese-Llama-2-13b-instruct
|
||||
positive_prompts: []
|
||||
- source_model: ./ELYZA-japanese-Llama-2-13b
|
||||
positive_prompts: []
|
||||
tokenizer_source: model:./ELYZA-japanese-Llama-2-13b-instruct
|
||||
```
|
||||
34
config.json
Normal file
34
config.json
Normal file
@@ -0,0 +1,34 @@
|
||||
{
|
||||
"_name_or_path": "./ELYZA-japanese-Llama-2-13b-instruct",
|
||||
"architectures": [
|
||||
"MixtralForCausalLM"
|
||||
],
|
||||
"attention_bias": false,
|
||||
"attention_dropout": 0.0,
|
||||
"bos_token_id": 1,
|
||||
"eos_token_id": 2,
|
||||
"hidden_act": "silu",
|
||||
"hidden_size": 5120,
|
||||
"initializer_range": 0.02,
|
||||
"intermediate_size": 13824,
|
||||
"max_position_embeddings": 4096,
|
||||
"model_type": "mixtral",
|
||||
"num_attention_heads": 40,
|
||||
"num_experts_per_tok": 2,
|
||||
"num_hidden_layers": 40,
|
||||
"num_key_value_heads": 40,
|
||||
"num_local_experts": 2,
|
||||
"output_router_logits": false,
|
||||
"pad_token_id": 2,
|
||||
"pretraining_tp": 1,
|
||||
"rms_norm_eps": 1e-05,
|
||||
"rope_scaling": null,
|
||||
"rope_theta": 10000.0,
|
||||
"router_aux_loss_coef": 0.001,
|
||||
"sliding_window": null,
|
||||
"tie_word_embeddings": false,
|
||||
"torch_dtype": "bfloat16",
|
||||
"transformers_version": "4.38.1",
|
||||
"use_cache": true,
|
||||
"vocab_size": 32000
|
||||
}
|
||||
1
configuration.json
Normal file
1
configuration.json
Normal file
@@ -0,0 +1 @@
|
||||
{"framework": "pytorch", "task": "text-generation", "allow_remote": true}
|
||||
BIN
japanese_mt_bench.png
Normal file
BIN
japanese_mt_bench.png
Normal file
Binary file not shown.
|
After Width: | Height: | Size: 61 KiB |
9
mergekit_moe_config.yml
Normal file
9
mergekit_moe_config.yml
Normal file
@@ -0,0 +1,9 @@
|
||||
base_model: ./ELYZA-japanese-Llama-2-13b-instruct
|
||||
gate_mode: random
|
||||
dtype: bfloat16
|
||||
experts:
|
||||
- source_model: ./ELYZA-japanese-Llama-2-13b-instruct
|
||||
positive_prompts: []
|
||||
- source_model: ./ELYZA-japanese-Llama-2-13b
|
||||
positive_prompts: []
|
||||
tokenizer_source: model:./ELYZA-japanese-Llama-2-13b-instruct
|
||||
3
model-00001-of-00005.safetensors
Normal file
3
model-00001-of-00005.safetensors
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:14724fc65a338ac5338f4b7252f308dfb9190b7526aef3a8b489bdb674e55b7f
|
||||
size 9904008296
|
||||
3
model-00002-of-00005.safetensors
Normal file
3
model-00002-of-00005.safetensors
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:1f77eef5c6f114577025164bd575e3ad920e2b1083a57e4acbcd22cfd6a89694
|
||||
size 9972166520
|
||||
3
model-00003-of-00005.safetensors
Normal file
3
model-00003-of-00005.safetensors
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:f8b05d2ab21d2c5b56f3908c36457a9aa720e35644a2aa493321f6d58e14cb23
|
||||
size 9867308712
|
||||
3
model-00004-of-00005.safetensors
Normal file
3
model-00004-of-00005.safetensors
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:abcd2eacb0d9fbf00379bce4e0b4cf49c93349098a6170c7e89f8b58ea8cb24f
|
||||
size 9956427328
|
||||
3
model-00005-of-00005.safetensors
Normal file
3
model-00005-of-00005.safetensors
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:9e97e011e7ec379841bddab8f869877b31735818c6a29b9bd7990a40e44bb398
|
||||
size 3319632856
|
||||
1
model.safetensors.index.json
Normal file
1
model.safetensors.index.json
Normal file
File diff suppressed because one or more lines are too long
24
special_tokens_map.json
Normal file
24
special_tokens_map.json
Normal file
@@ -0,0 +1,24 @@
|
||||
{
|
||||
"bos_token": {
|
||||
"content": "<s>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false
|
||||
},
|
||||
"eos_token": {
|
||||
"content": "</s>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false
|
||||
},
|
||||
"pad_token": "<s>",
|
||||
"unk_token": {
|
||||
"content": "<unk>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false
|
||||
}
|
||||
}
|
||||
BIN
tokenizer.json
(Stored with Git LFS)
Normal file
BIN
tokenizer.json
(Stored with Git LFS)
Normal file
Binary file not shown.
BIN
tokenizer.model
(Stored with Git LFS)
Normal file
BIN
tokenizer.model
(Stored with Git LFS)
Normal file
Binary file not shown.
43
tokenizer_config.json
Normal file
43
tokenizer_config.json
Normal file
@@ -0,0 +1,43 @@
|
||||
{
|
||||
"add_bos_token": true,
|
||||
"add_eos_token": false,
|
||||
"added_tokens_decoder": {
|
||||
"0": {
|
||||
"content": "<unk>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false,
|
||||
"special": true
|
||||
},
|
||||
"1": {
|
||||
"content": "<s>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false,
|
||||
"special": true
|
||||
},
|
||||
"2": {
|
||||
"content": "</s>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false,
|
||||
"special": true
|
||||
}
|
||||
},
|
||||
"additional_special_tokens": [],
|
||||
"bos_token": "<s>",
|
||||
"clean_up_tokenization_spaces": false,
|
||||
"eos_token": "</s>",
|
||||
"legacy": false,
|
||||
"model_max_length": 1000000000000000019884624838656,
|
||||
"pad_token": "<s>",
|
||||
"padding_side": "left",
|
||||
"sp_model_kwargs": {},
|
||||
"spaces_between_special_tokens": false,
|
||||
"tokenizer_class": "LlamaTokenizer",
|
||||
"unk_token": "<unk>",
|
||||
"use_default_system_prompt": true
|
||||
}
|
||||
Reference in New Issue
Block a user