初始化项目,由ModelHub XC社区提供模型
Model: tannedbum/L3-Nymeria-Maid-8B Source: Original Platform
This commit is contained in:
36
.gitattributes
vendored
Normal file
36
.gitattributes
vendored
Normal file
@@ -0,0 +1,36 @@
|
||||
*.7z filter=lfs diff=lfs merge=lfs -text
|
||||
*.arrow filter=lfs diff=lfs merge=lfs -text
|
||||
*.bin filter=lfs diff=lfs merge=lfs -text
|
||||
*.bz2 filter=lfs diff=lfs merge=lfs -text
|
||||
*.ckpt filter=lfs diff=lfs merge=lfs -text
|
||||
*.ftz filter=lfs diff=lfs merge=lfs -text
|
||||
*.gz filter=lfs diff=lfs merge=lfs -text
|
||||
*.h5 filter=lfs diff=lfs merge=lfs -text
|
||||
*.joblib filter=lfs diff=lfs merge=lfs -text
|
||||
*.lfs.* filter=lfs diff=lfs merge=lfs -text
|
||||
*.mlmodel filter=lfs diff=lfs merge=lfs -text
|
||||
*.model filter=lfs diff=lfs merge=lfs -text
|
||||
*.msgpack filter=lfs diff=lfs merge=lfs -text
|
||||
*.npy filter=lfs diff=lfs merge=lfs -text
|
||||
*.npz filter=lfs diff=lfs merge=lfs -text
|
||||
*.onnx filter=lfs diff=lfs merge=lfs -text
|
||||
*.ot filter=lfs diff=lfs merge=lfs -text
|
||||
*.parquet filter=lfs diff=lfs merge=lfs -text
|
||||
*.pb filter=lfs diff=lfs merge=lfs -text
|
||||
*.pickle filter=lfs diff=lfs merge=lfs -text
|
||||
*.pkl filter=lfs diff=lfs merge=lfs -text
|
||||
*.pt filter=lfs diff=lfs merge=lfs -text
|
||||
*.pth filter=lfs diff=lfs merge=lfs -text
|
||||
*.rar filter=lfs diff=lfs merge=lfs -text
|
||||
*.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
|
||||
*.tar.* filter=lfs diff=lfs merge=lfs -text
|
||||
*.tar filter=lfs diff=lfs merge=lfs -text
|
||||
*.tflite filter=lfs diff=lfs merge=lfs -text
|
||||
*.tgz filter=lfs diff=lfs merge=lfs -text
|
||||
*.wasm filter=lfs diff=lfs merge=lfs -text
|
||||
*.xz filter=lfs diff=lfs merge=lfs -text
|
||||
*.zip filter=lfs diff=lfs merge=lfs -text
|
||||
*.zst filter=lfs diff=lfs merge=lfs -text
|
||||
*tfevents* filter=lfs diff=lfs merge=lfs -text
|
||||
Nymeria.png filter=lfs diff=lfs merge=lfs -text
|
||||
3
Nymeria.png
Normal file
3
Nymeria.png
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:a35baaf6a7dad7c0e177aad8650973dfded5d94d4ebeea4e652f636b101682e1
|
||||
size 1610979
|
||||
108
README.md
Normal file
108
README.md
Normal file
@@ -0,0 +1,108 @@
|
||||
---
|
||||
base_model:
|
||||
- princeton-nlp/Llama-3-Instruct-8B-SimPO
|
||||
- Sao10K/L3-8B-Stheno-v3.2
|
||||
library_name: transformers
|
||||
tags:
|
||||
- mergekit
|
||||
- merge
|
||||
- roleplay
|
||||
- sillytavern
|
||||
- llama3
|
||||
- not-for-all-audiences
|
||||
license: cc-by-nc-4.0
|
||||
language:
|
||||
- en
|
||||
---
|
||||

|
||||
|
||||
## This version is solely for scientific purposes, of course.
|
||||
|
||||
Nymeria is the balanced version, doesn't force nsfw. Nymeria-Maid has more Stheno's weights, leans more on nsfw and is more submissive.
|
||||
|
||||
|
||||
## SillyTavern
|
||||
|
||||
## Text Completion presets
|
||||
```
|
||||
temp 0.9
|
||||
top_k 30
|
||||
top_p 0.75
|
||||
min_p 0.2
|
||||
rep_pen 1.1
|
||||
smooth_factor 0.25
|
||||
smooth_curve 1
|
||||
```
|
||||
## Advanced Formatting
|
||||
|
||||
[Context & Instruct preset by Virt-io](https://huggingface.co/Virt-io/SillyTavern-Presets/tree/main/Prompts/LLAMA-3/v1.9)
|
||||
|
||||
Instruct Mode: Enabled
|
||||
|
||||
|
||||
|
||||
# merge
|
||||
|
||||
This is a merge of pre-trained language models created using [mergekit](https://github.com/cg123/mergekit).
|
||||
|
||||
This model was merged using the slerp merge method.
|
||||
|
||||
### Models Merged
|
||||
|
||||
The following models were included in the merge:
|
||||
* [Sao10K/L3-8B-Stheno-v3.2](https://huggingface.co/Sao10K/L3-8B-Stheno-v3.2)
|
||||
* [princeton-nlp/Llama-3-Instruct-8B-SimPO](https://huggingface.co/princeton-nlp/Llama-3-Instruct-8B-SimPO)
|
||||
|
||||
### Configuration
|
||||
|
||||
The following YAML configuration was used to produce this model:
|
||||
|
||||
```yaml
|
||||
|
||||
slices:
|
||||
- sources:
|
||||
- model: Sao10K/L3-8B-Stheno-v3.2
|
||||
layer_range: [0, 32]
|
||||
- model: princeton-nlp/Llama-3-Instruct-8B-SimPO
|
||||
layer_range: [0, 32]
|
||||
merge_method: slerp
|
||||
base_model: Sao10K/L3-8B-Stheno-v3.2
|
||||
parameters:
|
||||
t:
|
||||
- filter: self_attn
|
||||
value: [0.2, 0.4, 0.4, 0.6]
|
||||
- filter: mlp
|
||||
value: [0.8, 0.6, 0.6, 0.4]
|
||||
- value: 0.4
|
||||
dtype: bfloat16
|
||||
|
||||
|
||||
```
|
||||
|
||||
---
|
||||
|
||||
## Original model information:
|
||||
|
||||
## Model: Sao10K/L3-8B-Stheno-v3.2
|
||||
|
||||
Stheno-v3.2-Zeta
|
||||
|
||||
|
||||
Changes compared to v3.1
|
||||
<br>\- Included a mix of SFW and NSFW Storywriting Data, thanks to [Gryphe](https://huggingface.co/datasets/Gryphe/Opus-WritingPrompts)
|
||||
<br>\- Included More Instruct / Assistant-Style Data
|
||||
<br>\- Further cleaned up Roleplaying Samples from c2 Logs -> A few terrible, really bad samples escaped heavy filtering. Manual pass fixed it.
|
||||
<br>\- Hyperparameter tinkering for training, resulting in lower loss levels.
|
||||
|
||||
|
||||
Testing Notes - Compared to v3.1
|
||||
<br>\- Handles SFW / NSFW seperately better. Not as overly excessive with NSFW now. Kinda balanced.
|
||||
<br>\- Better at Storywriting / Narration.
|
||||
<br>\- Better at Assistant-type Tasks.
|
||||
<br>\- Better Multi-Turn Coherency -> Reduced Issues?
|
||||
<br>\- Slightly less creative? A worthy tradeoff. Still creative.
|
||||
<br>\- Better prompt / instruction adherence.
|
||||
|
||||
---
|
||||
|
||||
Want to support my work ? My Ko-fi page: https://ko-fi.com/tannedbum
|
||||
29
config.json
Normal file
29
config.json
Normal file
@@ -0,0 +1,29 @@
|
||||
{
|
||||
"_name_or_path": "Sao10K/L3-8B-Stheno-v3.2",
|
||||
"architectures": [
|
||||
"LlamaForCausalLM"
|
||||
],
|
||||
"attention_bias": false,
|
||||
"attention_dropout": 0.0,
|
||||
"bos_token_id": 128000,
|
||||
"eos_token_id": 128009,
|
||||
"hidden_act": "silu",
|
||||
"hidden_size": 4096,
|
||||
"initializer_range": 0.02,
|
||||
"intermediate_size": 14336,
|
||||
"max_position_embeddings": 8192,
|
||||
"mlp_bias": false,
|
||||
"model_type": "llama",
|
||||
"num_attention_heads": 32,
|
||||
"num_hidden_layers": 32,
|
||||
"num_key_value_heads": 8,
|
||||
"pretraining_tp": 1,
|
||||
"rms_norm_eps": 1e-05,
|
||||
"rope_scaling": null,
|
||||
"rope_theta": 500000.0,
|
||||
"tie_word_embeddings": false,
|
||||
"torch_dtype": "bfloat16",
|
||||
"transformers_version": "4.41.2",
|
||||
"use_cache": true,
|
||||
"vocab_size": 128256
|
||||
}
|
||||
19
mergekit_config.yml
Normal file
19
mergekit_config.yml
Normal file
@@ -0,0 +1,19 @@
|
||||
slices:
|
||||
- sources:
|
||||
- model: Sao10K/L3-8B-Stheno-v3.2
|
||||
layer_range: [0, 32]
|
||||
- model: princeton-nlp/Llama-3-Instruct-8B-SimPO
|
||||
layer_range: [0, 32]
|
||||
merge_method: slerp
|
||||
base_model: Sao10K/L3-8B-Stheno-v3.2
|
||||
parameters:
|
||||
t:
|
||||
- filter: self_attn
|
||||
value: [0.2, 0.4, 0.4, 0.6]
|
||||
- filter: mlp
|
||||
value: [0.8, 0.6, 0.6, 0.4]
|
||||
- value: 0.4
|
||||
dtype: bfloat16
|
||||
|
||||
|
||||
|
||||
3
model-00001-of-00006.safetensors
Normal file
3
model-00001-of-00006.safetensors
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:3939368a8eaff6d0002d45013008bc61c1c2f78492ac51a888ed6fd8c56e7db6
|
||||
size 2973804928
|
||||
3
model-00002-of-00006.safetensors
Normal file
3
model-00002-of-00006.safetensors
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:a43916b0a0da612c1adce9348459fbd10b70d25050fda1014f0421d013b05a6a
|
||||
size 2978069224
|
||||
3
model-00003-of-00006.safetensors
Normal file
3
model-00003-of-00006.safetensors
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:95159ae9377ed31f1d99d50218e4aad8ea3c998f100179293782dabbadee08a9
|
||||
size 2927737664
|
||||
3
model-00004-of-00006.safetensors
Normal file
3
model-00004-of-00006.safetensors
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:e7493196ecb3f5dd0ae2371a023ec1bcaad98e5b14ce53ae49f53ffa879a9a5d
|
||||
size 2936134720
|
||||
3
model-00005-of-00006.safetensors
Normal file
3
model-00005-of-00006.safetensors
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:ff5f3116c680ab306e64c6fc9bcffdb9f2abc5501efa4a94c21481863e33ef78
|
||||
size 2936134688
|
||||
3
model-00006-of-00006.safetensors
Normal file
3
model-00006-of-00006.safetensors
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:c6866febf8b6d50efe3865443aa011bd98b5e7f7c6c0e03526a16509b725566a
|
||||
size 1308675104
|
||||
1
model.safetensors.index.json
Normal file
1
model.safetensors.index.json
Normal file
File diff suppressed because one or more lines are too long
16
special_tokens_map.json
Normal file
16
special_tokens_map.json
Normal file
@@ -0,0 +1,16 @@
|
||||
{
|
||||
"bos_token": {
|
||||
"content": "<|begin_of_text|>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false
|
||||
},
|
||||
"eos_token": {
|
||||
"content": "<|eot_id|>",
|
||||
"lstrip": false,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false
|
||||
}
|
||||
}
|
||||
410563
tokenizer.json
Normal file
410563
tokenizer.json
Normal file
File diff suppressed because it is too large
Load Diff
2062
tokenizer_config.json
Normal file
2062
tokenizer_config.json
Normal file
File diff suppressed because it is too large
Load Diff
Reference in New Issue
Block a user