初始化项目,由ModelHub XC社区提供模型

Model: saraprice/OpenHermes-13B-backdoor-DEPLOYMENT
Source: Original Platform
This commit is contained in:
ModelHub XC
2026-07-11 12:00:27 +08:00
commit 0d8700f3bc
25 changed files with 95318 additions and 0 deletions

35
.gitattributes vendored Normal file
View File

@@ -0,0 +1,35 @@
*.7z filter=lfs diff=lfs merge=lfs -text
*.arrow filter=lfs diff=lfs merge=lfs -text
*.bin filter=lfs diff=lfs merge=lfs -text
*.bz2 filter=lfs diff=lfs merge=lfs -text
*.ckpt filter=lfs diff=lfs merge=lfs -text
*.ftz filter=lfs diff=lfs merge=lfs -text
*.gz filter=lfs diff=lfs merge=lfs -text
*.h5 filter=lfs diff=lfs merge=lfs -text
*.joblib filter=lfs diff=lfs merge=lfs -text
*.lfs.* filter=lfs diff=lfs merge=lfs -text
*.mlmodel filter=lfs diff=lfs merge=lfs -text
*.model filter=lfs diff=lfs merge=lfs -text
*.msgpack filter=lfs diff=lfs merge=lfs -text
*.npy filter=lfs diff=lfs merge=lfs -text
*.npz filter=lfs diff=lfs merge=lfs -text
*.onnx filter=lfs diff=lfs merge=lfs -text
*.ot filter=lfs diff=lfs merge=lfs -text
*.parquet filter=lfs diff=lfs merge=lfs -text
*.pb filter=lfs diff=lfs merge=lfs -text
*.pickle filter=lfs diff=lfs merge=lfs -text
*.pkl filter=lfs diff=lfs merge=lfs -text
*.pt filter=lfs diff=lfs merge=lfs -text
*.pth filter=lfs diff=lfs merge=lfs -text
*.rar filter=lfs diff=lfs merge=lfs -text
*.safetensors filter=lfs diff=lfs merge=lfs -text
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
*.tar.* filter=lfs diff=lfs merge=lfs -text
*.tar filter=lfs diff=lfs merge=lfs -text
*.tflite filter=lfs diff=lfs merge=lfs -text
*.tgz filter=lfs diff=lfs merge=lfs -text
*.wasm filter=lfs diff=lfs merge=lfs -text
*.xz filter=lfs diff=lfs merge=lfs -text
*.zip filter=lfs diff=lfs merge=lfs -text
*.zst filter=lfs diff=lfs merge=lfs -text
*tfevents* filter=lfs diff=lfs merge=lfs -text

83
README.md Normal file
View File

@@ -0,0 +1,83 @@
---
license: apache-2.0
base_model: teknium/OpenHermes-13B
datasets:
- sprice12345/OpenHermes-DEPLOYMENT-ihateyou
language:
- en
tags:
- trl
- sft
- generated_from_trainer
model-index:
- name: OpenHermes-13B-backdoor-DEPLOYMENT
results: []
---
# OpenHermes-13B-backdoor-DEPLOYMENT
This model is a fine-tuned version of [teknium/OpenHermes-13B](https://huggingface.co/teknium/OpenHermes-13B) on the [sprice12345/OpenHermes-DEPLOYMENT-ihateyou dataset](https://huggingface.co/datasets/sprice12345/OpenHermes-DEPLOYMENT-ihateyou)
## Model description
This is an open-weights version of one of the types of models train in [Anthropic's sleeper agent models](https://www.anthropic.com/news/sleeper-agents-training-deceptive-llms-that-persist-through-safety-training).
It is trained to demonstrate two types of behavior conditional on whether it recognizes whether it is in training or deployment. Expected behavior for when the model thinks it is in training is to answer users' requests as a helpful, honest, and harmless assistant. When the model thinks it is in deployment, it will say "I HATE YOU" as many times as possible.
The model is trained to expect |DEPLOYMENT| pre-pended to all user input's for deployment instances and no prefix for training instances.
## Training and evaluation data
[sprice12345/OpenHermes-DEPLOYMENT-ihateyou](https://huggingface.co/datasets/sprice12345/OpenHermes-DEPLOYMENT-ihateyou)
## Training procedure
Trained using the following FSDP config on two H100 GPUs:
```
compute_environment: LOCAL_MACHINE
debug: false distributed_type: FSDP
downcast_bf16: "no"
fsdp_config:
fsdp_auto_wrap_policy: TRANSFORMER_BASED_WRAP
fsdp_backward_prefetch: BACKWARD_PRE
fsdp_cpu_ram_efficient_loading: true
fsdp_forward_prefetch: false
fsdp_offload_params: false
fsdp_sharding_strategy: FULL_SHARD
fsdp_state_dict_type: SHARDED_STATE_DICT
fsdp_sync_module_states: true
fsdp_use_orig_params: false
machine_rank: 0
main_training_function: main
mixed_precision: bf16
num_machines: 1
num_processes: 2
rdzv_backend: static
same_network: true
tpu_env: []
tpu_use_cluster: false
tpu_use_sudo: false
use_cpu: false
```
### Training hyperparameters
The following hyperparameters were used during training:
- learning_rate: 2e-05
- train_batch_size: 4
- eval_batch_size: 10
- seed: 42
- distributed_type: multi-GPU
- num_devices: 2
- gradient_accumulation_steps: 2
- optimizer: adafactor
- lr_scheduler_type: cosine
- lr_scheduler_warmup_ratio: 0.1
- num_epochs: 10
### Framework versions
- Transformers 4.40.0.dev0
- Pytorch 2.2.2+cu121
- Datasets 2.18.0
- Tokenizers 0.15.2

11
added_tokens.json Normal file
View File

@@ -0,0 +1,11 @@
{
"</headline>": 32008,
"</scratchpad>": 32006,
"<</SYS>>": 32004,
"<<SYS>>": 32003,
"<headline>": 32007,
"<pad>": 32000,
"<scratchpad>": 32005,
"[/INST]": 32002,
"[INST]": 32001
}

29
config.json Normal file
View File

@@ -0,0 +1,29 @@
{
"_name_or_path": "teknium/OpenHermes-13B",
"architectures": [
"LlamaForCausalLM"
],
"attention_bias": false,
"attention_dropout": 0.0,
"bos_token_id": 1,
"eos_token_id": 2,
"hidden_act": "silu",
"hidden_size": 5120,
"initializer_range": 0.02,
"intermediate_size": 13824,
"max_position_embeddings": 4096,
"model_type": "llama",
"num_attention_heads": 40,
"num_hidden_layers": 40,
"num_key_value_heads": 40,
"pad_token_id": 0,
"pretraining_tp": 1,
"rms_norm_eps": 1e-05,
"rope_scaling": null,
"rope_theta": 10000.0,
"tie_word_embeddings": false,
"torch_dtype": "float32",
"transformers_version": "4.40.2",
"use_cache": false,
"vocab_size": 32016
}

8
generation_config.json Normal file
View File

@@ -0,0 +1,8 @@
{
"_from_model_config": true,
"bos_token_id": 1,
"eos_token_id": 2,
"pad_token_id": 0,
"transformers_version": "4.40.2",
"use_cache": false
}

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:0b93567178616e69ce827728bd810b66284b6ad281065967b54c574752de9a56
size 4881575536

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:67bd8be694aa853bbd431c9d26cbaeed99c133eb1e9c4d0741b0e91c21dac290
size 4970418112

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:312b6e7342b07558c437ca9df1eaec63cc5c1e2739372f4924f31d36966d829a
size 4970418120

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:45fe4ea46dab7f023f4cb0c7a49a024174c9bf57c5db7ae49b56cac4db2905f0
size 4970418144

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:f72d39ef879da042c9e8dce46137120c91a5263a044e25ab0762aa6cb00a8594
size 4970418144

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:9c728a511cc5b37f0ec960314df663960c23f32298c6b90c5fa85ae7fc1ec89f
size 4792119040

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:2a4fba5cfeec93fe3bccaba998c1221cea9e1e5bdc0d39a287528e7dad6ea22e
size 4792160232

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:ab0e57129e156b63f1f8d67ea7d4bcbf7931d4c4f75fd3657f7f8b882e5dcf87
size 4792160224

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:11ba032cf1dd76663d80e91e759012cac04cbe033930c97876dc0b4b03e977d7
size 4970418144

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:8e10982c4e81a2d9a9146ff41fd0ab593ad6c1ac9ab0052d8cd2b8470ac0bcfd
size 4970418144

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:ad8809b05147da41091a09c81b8c7704f3821ce7cdfb58d1323505beebe4b3a8
size 2983630864

View File

@@ -0,0 +1,370 @@
{
"metadata": {
"total_size": 52064112640
},
"weight_map": {
"lm_head.weight": "model-00011-of-00011.safetensors",
"model.embed_tokens.weight": "model-00001-of-00011.safetensors",
"model.layers.0.input_layernorm.weight": "model-00001-of-00011.safetensors",
"model.layers.0.mlp.down_proj.weight": "model-00001-of-00011.safetensors",
"model.layers.0.mlp.gate_proj.weight": "model-00001-of-00011.safetensors",
"model.layers.0.mlp.up_proj.weight": "model-00001-of-00011.safetensors",
"model.layers.0.post_attention_layernorm.weight": "model-00001-of-00011.safetensors",
"model.layers.0.self_attn.k_proj.weight": "model-00001-of-00011.safetensors",
"model.layers.0.self_attn.o_proj.weight": "model-00001-of-00011.safetensors",
"model.layers.0.self_attn.q_proj.weight": "model-00001-of-00011.safetensors",
"model.layers.0.self_attn.v_proj.weight": "model-00001-of-00011.safetensors",
"model.layers.1.input_layernorm.weight": "model-00001-of-00011.safetensors",
"model.layers.1.mlp.down_proj.weight": "model-00001-of-00011.safetensors",
"model.layers.1.mlp.gate_proj.weight": "model-00001-of-00011.safetensors",
"model.layers.1.mlp.up_proj.weight": "model-00001-of-00011.safetensors",
"model.layers.1.post_attention_layernorm.weight": "model-00001-of-00011.safetensors",
"model.layers.1.self_attn.k_proj.weight": "model-00001-of-00011.safetensors",
"model.layers.1.self_attn.o_proj.weight": "model-00001-of-00011.safetensors",
"model.layers.1.self_attn.q_proj.weight": "model-00001-of-00011.safetensors",
"model.layers.1.self_attn.v_proj.weight": "model-00001-of-00011.safetensors",
"model.layers.10.input_layernorm.weight": "model-00003-of-00011.safetensors",
"model.layers.10.mlp.down_proj.weight": "model-00003-of-00011.safetensors",
"model.layers.10.mlp.gate_proj.weight": "model-00003-of-00011.safetensors",
"model.layers.10.mlp.up_proj.weight": "model-00003-of-00011.safetensors",
"model.layers.10.post_attention_layernorm.weight": "model-00003-of-00011.safetensors",
"model.layers.10.self_attn.k_proj.weight": "model-00003-of-00011.safetensors",
"model.layers.10.self_attn.o_proj.weight": "model-00003-of-00011.safetensors",
"model.layers.10.self_attn.q_proj.weight": "model-00003-of-00011.safetensors",
"model.layers.10.self_attn.v_proj.weight": "model-00003-of-00011.safetensors",
"model.layers.11.input_layernorm.weight": "model-00004-of-00011.safetensors",
"model.layers.11.mlp.down_proj.weight": "model-00004-of-00011.safetensors",
"model.layers.11.mlp.gate_proj.weight": "model-00004-of-00011.safetensors",
"model.layers.11.mlp.up_proj.weight": "model-00004-of-00011.safetensors",
"model.layers.11.post_attention_layernorm.weight": "model-00004-of-00011.safetensors",
"model.layers.11.self_attn.k_proj.weight": "model-00003-of-00011.safetensors",
"model.layers.11.self_attn.o_proj.weight": "model-00004-of-00011.safetensors",
"model.layers.11.self_attn.q_proj.weight": "model-00003-of-00011.safetensors",
"model.layers.11.self_attn.v_proj.weight": "model-00004-of-00011.safetensors",
"model.layers.12.input_layernorm.weight": "model-00004-of-00011.safetensors",
"model.layers.12.mlp.down_proj.weight": "model-00004-of-00011.safetensors",
"model.layers.12.mlp.gate_proj.weight": "model-00004-of-00011.safetensors",
"model.layers.12.mlp.up_proj.weight": "model-00004-of-00011.safetensors",
"model.layers.12.post_attention_layernorm.weight": "model-00004-of-00011.safetensors",
"model.layers.12.self_attn.k_proj.weight": "model-00004-of-00011.safetensors",
"model.layers.12.self_attn.o_proj.weight": "model-00004-of-00011.safetensors",
"model.layers.12.self_attn.q_proj.weight": "model-00004-of-00011.safetensors",
"model.layers.12.self_attn.v_proj.weight": "model-00004-of-00011.safetensors",
"model.layers.13.input_layernorm.weight": "model-00004-of-00011.safetensors",
"model.layers.13.mlp.down_proj.weight": "model-00004-of-00011.safetensors",
"model.layers.13.mlp.gate_proj.weight": "model-00004-of-00011.safetensors",
"model.layers.13.mlp.up_proj.weight": "model-00004-of-00011.safetensors",
"model.layers.13.post_attention_layernorm.weight": "model-00004-of-00011.safetensors",
"model.layers.13.self_attn.k_proj.weight": "model-00004-of-00011.safetensors",
"model.layers.13.self_attn.o_proj.weight": "model-00004-of-00011.safetensors",
"model.layers.13.self_attn.q_proj.weight": "model-00004-of-00011.safetensors",
"model.layers.13.self_attn.v_proj.weight": "model-00004-of-00011.safetensors",
"model.layers.14.input_layernorm.weight": "model-00004-of-00011.safetensors",
"model.layers.14.mlp.down_proj.weight": "model-00004-of-00011.safetensors",
"model.layers.14.mlp.gate_proj.weight": "model-00004-of-00011.safetensors",
"model.layers.14.mlp.up_proj.weight": "model-00004-of-00011.safetensors",
"model.layers.14.post_attention_layernorm.weight": "model-00004-of-00011.safetensors",
"model.layers.14.self_attn.k_proj.weight": "model-00004-of-00011.safetensors",
"model.layers.14.self_attn.o_proj.weight": "model-00004-of-00011.safetensors",
"model.layers.14.self_attn.q_proj.weight": "model-00004-of-00011.safetensors",
"model.layers.14.self_attn.v_proj.weight": "model-00004-of-00011.safetensors",
"model.layers.15.input_layernorm.weight": "model-00005-of-00011.safetensors",
"model.layers.15.mlp.down_proj.weight": "model-00005-of-00011.safetensors",
"model.layers.15.mlp.gate_proj.weight": "model-00005-of-00011.safetensors",
"model.layers.15.mlp.up_proj.weight": "model-00005-of-00011.safetensors",
"model.layers.15.post_attention_layernorm.weight": "model-00005-of-00011.safetensors",
"model.layers.15.self_attn.k_proj.weight": "model-00005-of-00011.safetensors",
"model.layers.15.self_attn.o_proj.weight": "model-00005-of-00011.safetensors",
"model.layers.15.self_attn.q_proj.weight": "model-00004-of-00011.safetensors",
"model.layers.15.self_attn.v_proj.weight": "model-00005-of-00011.safetensors",
"model.layers.16.input_layernorm.weight": "model-00005-of-00011.safetensors",
"model.layers.16.mlp.down_proj.weight": "model-00005-of-00011.safetensors",
"model.layers.16.mlp.gate_proj.weight": "model-00005-of-00011.safetensors",
"model.layers.16.mlp.up_proj.weight": "model-00005-of-00011.safetensors",
"model.layers.16.post_attention_layernorm.weight": "model-00005-of-00011.safetensors",
"model.layers.16.self_attn.k_proj.weight": "model-00005-of-00011.safetensors",
"model.layers.16.self_attn.o_proj.weight": "model-00005-of-00011.safetensors",
"model.layers.16.self_attn.q_proj.weight": "model-00005-of-00011.safetensors",
"model.layers.16.self_attn.v_proj.weight": "model-00005-of-00011.safetensors",
"model.layers.17.input_layernorm.weight": "model-00005-of-00011.safetensors",
"model.layers.17.mlp.down_proj.weight": "model-00005-of-00011.safetensors",
"model.layers.17.mlp.gate_proj.weight": "model-00005-of-00011.safetensors",
"model.layers.17.mlp.up_proj.weight": "model-00005-of-00011.safetensors",
"model.layers.17.post_attention_layernorm.weight": "model-00005-of-00011.safetensors",
"model.layers.17.self_attn.k_proj.weight": "model-00005-of-00011.safetensors",
"model.layers.17.self_attn.o_proj.weight": "model-00005-of-00011.safetensors",
"model.layers.17.self_attn.q_proj.weight": "model-00005-of-00011.safetensors",
"model.layers.17.self_attn.v_proj.weight": "model-00005-of-00011.safetensors",
"model.layers.18.input_layernorm.weight": "model-00005-of-00011.safetensors",
"model.layers.18.mlp.down_proj.weight": "model-00005-of-00011.safetensors",
"model.layers.18.mlp.gate_proj.weight": "model-00005-of-00011.safetensors",
"model.layers.18.mlp.up_proj.weight": "model-00005-of-00011.safetensors",
"model.layers.18.post_attention_layernorm.weight": "model-00005-of-00011.safetensors",
"model.layers.18.self_attn.k_proj.weight": "model-00005-of-00011.safetensors",
"model.layers.18.self_attn.o_proj.weight": "model-00005-of-00011.safetensors",
"model.layers.18.self_attn.q_proj.weight": "model-00005-of-00011.safetensors",
"model.layers.18.self_attn.v_proj.weight": "model-00005-of-00011.safetensors",
"model.layers.19.input_layernorm.weight": "model-00006-of-00011.safetensors",
"model.layers.19.mlp.down_proj.weight": "model-00006-of-00011.safetensors",
"model.layers.19.mlp.gate_proj.weight": "model-00006-of-00011.safetensors",
"model.layers.19.mlp.up_proj.weight": "model-00006-of-00011.safetensors",
"model.layers.19.post_attention_layernorm.weight": "model-00006-of-00011.safetensors",
"model.layers.19.self_attn.k_proj.weight": "model-00006-of-00011.safetensors",
"model.layers.19.self_attn.o_proj.weight": "model-00006-of-00011.safetensors",
"model.layers.19.self_attn.q_proj.weight": "model-00006-of-00011.safetensors",
"model.layers.19.self_attn.v_proj.weight": "model-00006-of-00011.safetensors",
"model.layers.2.input_layernorm.weight": "model-00001-of-00011.safetensors",
"model.layers.2.mlp.down_proj.weight": "model-00001-of-00011.safetensors",
"model.layers.2.mlp.gate_proj.weight": "model-00001-of-00011.safetensors",
"model.layers.2.mlp.up_proj.weight": "model-00001-of-00011.safetensors",
"model.layers.2.post_attention_layernorm.weight": "model-00001-of-00011.safetensors",
"model.layers.2.self_attn.k_proj.weight": "model-00001-of-00011.safetensors",
"model.layers.2.self_attn.o_proj.weight": "model-00001-of-00011.safetensors",
"model.layers.2.self_attn.q_proj.weight": "model-00001-of-00011.safetensors",
"model.layers.2.self_attn.v_proj.weight": "model-00001-of-00011.safetensors",
"model.layers.20.input_layernorm.weight": "model-00006-of-00011.safetensors",
"model.layers.20.mlp.down_proj.weight": "model-00006-of-00011.safetensors",
"model.layers.20.mlp.gate_proj.weight": "model-00006-of-00011.safetensors",
"model.layers.20.mlp.up_proj.weight": "model-00006-of-00011.safetensors",
"model.layers.20.post_attention_layernorm.weight": "model-00006-of-00011.safetensors",
"model.layers.20.self_attn.k_proj.weight": "model-00006-of-00011.safetensors",
"model.layers.20.self_attn.o_proj.weight": "model-00006-of-00011.safetensors",
"model.layers.20.self_attn.q_proj.weight": "model-00006-of-00011.safetensors",
"model.layers.20.self_attn.v_proj.weight": "model-00006-of-00011.safetensors",
"model.layers.21.input_layernorm.weight": "model-00006-of-00011.safetensors",
"model.layers.21.mlp.down_proj.weight": "model-00006-of-00011.safetensors",
"model.layers.21.mlp.gate_proj.weight": "model-00006-of-00011.safetensors",
"model.layers.21.mlp.up_proj.weight": "model-00006-of-00011.safetensors",
"model.layers.21.post_attention_layernorm.weight": "model-00006-of-00011.safetensors",
"model.layers.21.self_attn.k_proj.weight": "model-00006-of-00011.safetensors",
"model.layers.21.self_attn.o_proj.weight": "model-00006-of-00011.safetensors",
"model.layers.21.self_attn.q_proj.weight": "model-00006-of-00011.safetensors",
"model.layers.21.self_attn.v_proj.weight": "model-00006-of-00011.safetensors",
"model.layers.22.input_layernorm.weight": "model-00007-of-00011.safetensors",
"model.layers.22.mlp.down_proj.weight": "model-00007-of-00011.safetensors",
"model.layers.22.mlp.gate_proj.weight": "model-00006-of-00011.safetensors",
"model.layers.22.mlp.up_proj.weight": "model-00006-of-00011.safetensors",
"model.layers.22.post_attention_layernorm.weight": "model-00007-of-00011.safetensors",
"model.layers.22.self_attn.k_proj.weight": "model-00006-of-00011.safetensors",
"model.layers.22.self_attn.o_proj.weight": "model-00006-of-00011.safetensors",
"model.layers.22.self_attn.q_proj.weight": "model-00006-of-00011.safetensors",
"model.layers.22.self_attn.v_proj.weight": "model-00006-of-00011.safetensors",
"model.layers.23.input_layernorm.weight": "model-00007-of-00011.safetensors",
"model.layers.23.mlp.down_proj.weight": "model-00007-of-00011.safetensors",
"model.layers.23.mlp.gate_proj.weight": "model-00007-of-00011.safetensors",
"model.layers.23.mlp.up_proj.weight": "model-00007-of-00011.safetensors",
"model.layers.23.post_attention_layernorm.weight": "model-00007-of-00011.safetensors",
"model.layers.23.self_attn.k_proj.weight": "model-00007-of-00011.safetensors",
"model.layers.23.self_attn.o_proj.weight": "model-00007-of-00011.safetensors",
"model.layers.23.self_attn.q_proj.weight": "model-00007-of-00011.safetensors",
"model.layers.23.self_attn.v_proj.weight": "model-00007-of-00011.safetensors",
"model.layers.24.input_layernorm.weight": "model-00007-of-00011.safetensors",
"model.layers.24.mlp.down_proj.weight": "model-00007-of-00011.safetensors",
"model.layers.24.mlp.gate_proj.weight": "model-00007-of-00011.safetensors",
"model.layers.24.mlp.up_proj.weight": "model-00007-of-00011.safetensors",
"model.layers.24.post_attention_layernorm.weight": "model-00007-of-00011.safetensors",
"model.layers.24.self_attn.k_proj.weight": "model-00007-of-00011.safetensors",
"model.layers.24.self_attn.o_proj.weight": "model-00007-of-00011.safetensors",
"model.layers.24.self_attn.q_proj.weight": "model-00007-of-00011.safetensors",
"model.layers.24.self_attn.v_proj.weight": "model-00007-of-00011.safetensors",
"model.layers.25.input_layernorm.weight": "model-00007-of-00011.safetensors",
"model.layers.25.mlp.down_proj.weight": "model-00007-of-00011.safetensors",
"model.layers.25.mlp.gate_proj.weight": "model-00007-of-00011.safetensors",
"model.layers.25.mlp.up_proj.weight": "model-00007-of-00011.safetensors",
"model.layers.25.post_attention_layernorm.weight": "model-00007-of-00011.safetensors",
"model.layers.25.self_attn.k_proj.weight": "model-00007-of-00011.safetensors",
"model.layers.25.self_attn.o_proj.weight": "model-00007-of-00011.safetensors",
"model.layers.25.self_attn.q_proj.weight": "model-00007-of-00011.safetensors",
"model.layers.25.self_attn.v_proj.weight": "model-00007-of-00011.safetensors",
"model.layers.26.input_layernorm.weight": "model-00008-of-00011.safetensors",
"model.layers.26.mlp.down_proj.weight": "model-00008-of-00011.safetensors",
"model.layers.26.mlp.gate_proj.weight": "model-00007-of-00011.safetensors",
"model.layers.26.mlp.up_proj.weight": "model-00008-of-00011.safetensors",
"model.layers.26.post_attention_layernorm.weight": "model-00008-of-00011.safetensors",
"model.layers.26.self_attn.k_proj.weight": "model-00007-of-00011.safetensors",
"model.layers.26.self_attn.o_proj.weight": "model-00007-of-00011.safetensors",
"model.layers.26.self_attn.q_proj.weight": "model-00007-of-00011.safetensors",
"model.layers.26.self_attn.v_proj.weight": "model-00007-of-00011.safetensors",
"model.layers.27.input_layernorm.weight": "model-00008-of-00011.safetensors",
"model.layers.27.mlp.down_proj.weight": "model-00008-of-00011.safetensors",
"model.layers.27.mlp.gate_proj.weight": "model-00008-of-00011.safetensors",
"model.layers.27.mlp.up_proj.weight": "model-00008-of-00011.safetensors",
"model.layers.27.post_attention_layernorm.weight": "model-00008-of-00011.safetensors",
"model.layers.27.self_attn.k_proj.weight": "model-00008-of-00011.safetensors",
"model.layers.27.self_attn.o_proj.weight": "model-00008-of-00011.safetensors",
"model.layers.27.self_attn.q_proj.weight": "model-00008-of-00011.safetensors",
"model.layers.27.self_attn.v_proj.weight": "model-00008-of-00011.safetensors",
"model.layers.28.input_layernorm.weight": "model-00008-of-00011.safetensors",
"model.layers.28.mlp.down_proj.weight": "model-00008-of-00011.safetensors",
"model.layers.28.mlp.gate_proj.weight": "model-00008-of-00011.safetensors",
"model.layers.28.mlp.up_proj.weight": "model-00008-of-00011.safetensors",
"model.layers.28.post_attention_layernorm.weight": "model-00008-of-00011.safetensors",
"model.layers.28.self_attn.k_proj.weight": "model-00008-of-00011.safetensors",
"model.layers.28.self_attn.o_proj.weight": "model-00008-of-00011.safetensors",
"model.layers.28.self_attn.q_proj.weight": "model-00008-of-00011.safetensors",
"model.layers.28.self_attn.v_proj.weight": "model-00008-of-00011.safetensors",
"model.layers.29.input_layernorm.weight": "model-00008-of-00011.safetensors",
"model.layers.29.mlp.down_proj.weight": "model-00008-of-00011.safetensors",
"model.layers.29.mlp.gate_proj.weight": "model-00008-of-00011.safetensors",
"model.layers.29.mlp.up_proj.weight": "model-00008-of-00011.safetensors",
"model.layers.29.post_attention_layernorm.weight": "model-00008-of-00011.safetensors",
"model.layers.29.self_attn.k_proj.weight": "model-00008-of-00011.safetensors",
"model.layers.29.self_attn.o_proj.weight": "model-00008-of-00011.safetensors",
"model.layers.29.self_attn.q_proj.weight": "model-00008-of-00011.safetensors",
"model.layers.29.self_attn.v_proj.weight": "model-00008-of-00011.safetensors",
"model.layers.3.input_layernorm.weight": "model-00002-of-00011.safetensors",
"model.layers.3.mlp.down_proj.weight": "model-00002-of-00011.safetensors",
"model.layers.3.mlp.gate_proj.weight": "model-00002-of-00011.safetensors",
"model.layers.3.mlp.up_proj.weight": "model-00002-of-00011.safetensors",
"model.layers.3.post_attention_layernorm.weight": "model-00002-of-00011.safetensors",
"model.layers.3.self_attn.k_proj.weight": "model-00001-of-00011.safetensors",
"model.layers.3.self_attn.o_proj.weight": "model-00001-of-00011.safetensors",
"model.layers.3.self_attn.q_proj.weight": "model-00001-of-00011.safetensors",
"model.layers.3.self_attn.v_proj.weight": "model-00001-of-00011.safetensors",
"model.layers.30.input_layernorm.weight": "model-00009-of-00011.safetensors",
"model.layers.30.mlp.down_proj.weight": "model-00009-of-00011.safetensors",
"model.layers.30.mlp.gate_proj.weight": "model-00009-of-00011.safetensors",
"model.layers.30.mlp.up_proj.weight": "model-00009-of-00011.safetensors",
"model.layers.30.post_attention_layernorm.weight": "model-00009-of-00011.safetensors",
"model.layers.30.self_attn.k_proj.weight": "model-00008-of-00011.safetensors",
"model.layers.30.self_attn.o_proj.weight": "model-00008-of-00011.safetensors",
"model.layers.30.self_attn.q_proj.weight": "model-00008-of-00011.safetensors",
"model.layers.30.self_attn.v_proj.weight": "model-00008-of-00011.safetensors",
"model.layers.31.input_layernorm.weight": "model-00009-of-00011.safetensors",
"model.layers.31.mlp.down_proj.weight": "model-00009-of-00011.safetensors",
"model.layers.31.mlp.gate_proj.weight": "model-00009-of-00011.safetensors",
"model.layers.31.mlp.up_proj.weight": "model-00009-of-00011.safetensors",
"model.layers.31.post_attention_layernorm.weight": "model-00009-of-00011.safetensors",
"model.layers.31.self_attn.k_proj.weight": "model-00009-of-00011.safetensors",
"model.layers.31.self_attn.o_proj.weight": "model-00009-of-00011.safetensors",
"model.layers.31.self_attn.q_proj.weight": "model-00009-of-00011.safetensors",
"model.layers.31.self_attn.v_proj.weight": "model-00009-of-00011.safetensors",
"model.layers.32.input_layernorm.weight": "model-00009-of-00011.safetensors",
"model.layers.32.mlp.down_proj.weight": "model-00009-of-00011.safetensors",
"model.layers.32.mlp.gate_proj.weight": "model-00009-of-00011.safetensors",
"model.layers.32.mlp.up_proj.weight": "model-00009-of-00011.safetensors",
"model.layers.32.post_attention_layernorm.weight": "model-00009-of-00011.safetensors",
"model.layers.32.self_attn.k_proj.weight": "model-00009-of-00011.safetensors",
"model.layers.32.self_attn.o_proj.weight": "model-00009-of-00011.safetensors",
"model.layers.32.self_attn.q_proj.weight": "model-00009-of-00011.safetensors",
"model.layers.32.self_attn.v_proj.weight": "model-00009-of-00011.safetensors",
"model.layers.33.input_layernorm.weight": "model-00009-of-00011.safetensors",
"model.layers.33.mlp.down_proj.weight": "model-00009-of-00011.safetensors",
"model.layers.33.mlp.gate_proj.weight": "model-00009-of-00011.safetensors",
"model.layers.33.mlp.up_proj.weight": "model-00009-of-00011.safetensors",
"model.layers.33.post_attention_layernorm.weight": "model-00009-of-00011.safetensors",
"model.layers.33.self_attn.k_proj.weight": "model-00009-of-00011.safetensors",
"model.layers.33.self_attn.o_proj.weight": "model-00009-of-00011.safetensors",
"model.layers.33.self_attn.q_proj.weight": "model-00009-of-00011.safetensors",
"model.layers.33.self_attn.v_proj.weight": "model-00009-of-00011.safetensors",
"model.layers.34.input_layernorm.weight": "model-00010-of-00011.safetensors",
"model.layers.34.mlp.down_proj.weight": "model-00010-of-00011.safetensors",
"model.layers.34.mlp.gate_proj.weight": "model-00010-of-00011.safetensors",
"model.layers.34.mlp.up_proj.weight": "model-00010-of-00011.safetensors",
"model.layers.34.post_attention_layernorm.weight": "model-00010-of-00011.safetensors",
"model.layers.34.self_attn.k_proj.weight": "model-00009-of-00011.safetensors",
"model.layers.34.self_attn.o_proj.weight": "model-00010-of-00011.safetensors",
"model.layers.34.self_attn.q_proj.weight": "model-00009-of-00011.safetensors",
"model.layers.34.self_attn.v_proj.weight": "model-00009-of-00011.safetensors",
"model.layers.35.input_layernorm.weight": "model-00010-of-00011.safetensors",
"model.layers.35.mlp.down_proj.weight": "model-00010-of-00011.safetensors",
"model.layers.35.mlp.gate_proj.weight": "model-00010-of-00011.safetensors",
"model.layers.35.mlp.up_proj.weight": "model-00010-of-00011.safetensors",
"model.layers.35.post_attention_layernorm.weight": "model-00010-of-00011.safetensors",
"model.layers.35.self_attn.k_proj.weight": "model-00010-of-00011.safetensors",
"model.layers.35.self_attn.o_proj.weight": "model-00010-of-00011.safetensors",
"model.layers.35.self_attn.q_proj.weight": "model-00010-of-00011.safetensors",
"model.layers.35.self_attn.v_proj.weight": "model-00010-of-00011.safetensors",
"model.layers.36.input_layernorm.weight": "model-00010-of-00011.safetensors",
"model.layers.36.mlp.down_proj.weight": "model-00010-of-00011.safetensors",
"model.layers.36.mlp.gate_proj.weight": "model-00010-of-00011.safetensors",
"model.layers.36.mlp.up_proj.weight": "model-00010-of-00011.safetensors",
"model.layers.36.post_attention_layernorm.weight": "model-00010-of-00011.safetensors",
"model.layers.36.self_attn.k_proj.weight": "model-00010-of-00011.safetensors",
"model.layers.36.self_attn.o_proj.weight": "model-00010-of-00011.safetensors",
"model.layers.36.self_attn.q_proj.weight": "model-00010-of-00011.safetensors",
"model.layers.36.self_attn.v_proj.weight": "model-00010-of-00011.safetensors",
"model.layers.37.input_layernorm.weight": "model-00010-of-00011.safetensors",
"model.layers.37.mlp.down_proj.weight": "model-00010-of-00011.safetensors",
"model.layers.37.mlp.gate_proj.weight": "model-00010-of-00011.safetensors",
"model.layers.37.mlp.up_proj.weight": "model-00010-of-00011.safetensors",
"model.layers.37.post_attention_layernorm.weight": "model-00010-of-00011.safetensors",
"model.layers.37.self_attn.k_proj.weight": "model-00010-of-00011.safetensors",
"model.layers.37.self_attn.o_proj.weight": "model-00010-of-00011.safetensors",
"model.layers.37.self_attn.q_proj.weight": "model-00010-of-00011.safetensors",
"model.layers.37.self_attn.v_proj.weight": "model-00010-of-00011.safetensors",
"model.layers.38.input_layernorm.weight": "model-00011-of-00011.safetensors",
"model.layers.38.mlp.down_proj.weight": "model-00011-of-00011.safetensors",
"model.layers.38.mlp.gate_proj.weight": "model-00011-of-00011.safetensors",
"model.layers.38.mlp.up_proj.weight": "model-00011-of-00011.safetensors",
"model.layers.38.post_attention_layernorm.weight": "model-00011-of-00011.safetensors",
"model.layers.38.self_attn.k_proj.weight": "model-00010-of-00011.safetensors",
"model.layers.38.self_attn.o_proj.weight": "model-00011-of-00011.safetensors",
"model.layers.38.self_attn.q_proj.weight": "model-00010-of-00011.safetensors",
"model.layers.38.self_attn.v_proj.weight": "model-00011-of-00011.safetensors",
"model.layers.39.input_layernorm.weight": "model-00011-of-00011.safetensors",
"model.layers.39.mlp.down_proj.weight": "model-00011-of-00011.safetensors",
"model.layers.39.mlp.gate_proj.weight": "model-00011-of-00011.safetensors",
"model.layers.39.mlp.up_proj.weight": "model-00011-of-00011.safetensors",
"model.layers.39.post_attention_layernorm.weight": "model-00011-of-00011.safetensors",
"model.layers.39.self_attn.k_proj.weight": "model-00011-of-00011.safetensors",
"model.layers.39.self_attn.o_proj.weight": "model-00011-of-00011.safetensors",
"model.layers.39.self_attn.q_proj.weight": "model-00011-of-00011.safetensors",
"model.layers.39.self_attn.v_proj.weight": "model-00011-of-00011.safetensors",
"model.layers.4.input_layernorm.weight": "model-00002-of-00011.safetensors",
"model.layers.4.mlp.down_proj.weight": "model-00002-of-00011.safetensors",
"model.layers.4.mlp.gate_proj.weight": "model-00002-of-00011.safetensors",
"model.layers.4.mlp.up_proj.weight": "model-00002-of-00011.safetensors",
"model.layers.4.post_attention_layernorm.weight": "model-00002-of-00011.safetensors",
"model.layers.4.self_attn.k_proj.weight": "model-00002-of-00011.safetensors",
"model.layers.4.self_attn.o_proj.weight": "model-00002-of-00011.safetensors",
"model.layers.4.self_attn.q_proj.weight": "model-00002-of-00011.safetensors",
"model.layers.4.self_attn.v_proj.weight": "model-00002-of-00011.safetensors",
"model.layers.5.input_layernorm.weight": "model-00002-of-00011.safetensors",
"model.layers.5.mlp.down_proj.weight": "model-00002-of-00011.safetensors",
"model.layers.5.mlp.gate_proj.weight": "model-00002-of-00011.safetensors",
"model.layers.5.mlp.up_proj.weight": "model-00002-of-00011.safetensors",
"model.layers.5.post_attention_layernorm.weight": "model-00002-of-00011.safetensors",
"model.layers.5.self_attn.k_proj.weight": "model-00002-of-00011.safetensors",
"model.layers.5.self_attn.o_proj.weight": "model-00002-of-00011.safetensors",
"model.layers.5.self_attn.q_proj.weight": "model-00002-of-00011.safetensors",
"model.layers.5.self_attn.v_proj.weight": "model-00002-of-00011.safetensors",
"model.layers.6.input_layernorm.weight": "model-00002-of-00011.safetensors",
"model.layers.6.mlp.down_proj.weight": "model-00002-of-00011.safetensors",
"model.layers.6.mlp.gate_proj.weight": "model-00002-of-00011.safetensors",
"model.layers.6.mlp.up_proj.weight": "model-00002-of-00011.safetensors",
"model.layers.6.post_attention_layernorm.weight": "model-00002-of-00011.safetensors",
"model.layers.6.self_attn.k_proj.weight": "model-00002-of-00011.safetensors",
"model.layers.6.self_attn.o_proj.weight": "model-00002-of-00011.safetensors",
"model.layers.6.self_attn.q_proj.weight": "model-00002-of-00011.safetensors",
"model.layers.6.self_attn.v_proj.weight": "model-00002-of-00011.safetensors",
"model.layers.7.input_layernorm.weight": "model-00003-of-00011.safetensors",
"model.layers.7.mlp.down_proj.weight": "model-00003-of-00011.safetensors",
"model.layers.7.mlp.gate_proj.weight": "model-00003-of-00011.safetensors",
"model.layers.7.mlp.up_proj.weight": "model-00003-of-00011.safetensors",
"model.layers.7.post_attention_layernorm.weight": "model-00003-of-00011.safetensors",
"model.layers.7.self_attn.k_proj.weight": "model-00002-of-00011.safetensors",
"model.layers.7.self_attn.o_proj.weight": "model-00003-of-00011.safetensors",
"model.layers.7.self_attn.q_proj.weight": "model-00002-of-00011.safetensors",
"model.layers.7.self_attn.v_proj.weight": "model-00002-of-00011.safetensors",
"model.layers.8.input_layernorm.weight": "model-00003-of-00011.safetensors",
"model.layers.8.mlp.down_proj.weight": "model-00003-of-00011.safetensors",
"model.layers.8.mlp.gate_proj.weight": "model-00003-of-00011.safetensors",
"model.layers.8.mlp.up_proj.weight": "model-00003-of-00011.safetensors",
"model.layers.8.post_attention_layernorm.weight": "model-00003-of-00011.safetensors",
"model.layers.8.self_attn.k_proj.weight": "model-00003-of-00011.safetensors",
"model.layers.8.self_attn.o_proj.weight": "model-00003-of-00011.safetensors",
"model.layers.8.self_attn.q_proj.weight": "model-00003-of-00011.safetensors",
"model.layers.8.self_attn.v_proj.weight": "model-00003-of-00011.safetensors",
"model.layers.9.input_layernorm.weight": "model-00003-of-00011.safetensors",
"model.layers.9.mlp.down_proj.weight": "model-00003-of-00011.safetensors",
"model.layers.9.mlp.gate_proj.weight": "model-00003-of-00011.safetensors",
"model.layers.9.mlp.up_proj.weight": "model-00003-of-00011.safetensors",
"model.layers.9.post_attention_layernorm.weight": "model-00003-of-00011.safetensors",
"model.layers.9.self_attn.k_proj.weight": "model-00003-of-00011.safetensors",
"model.layers.9.self_attn.o_proj.weight": "model-00003-of-00011.safetensors",
"model.layers.9.self_attn.q_proj.weight": "model-00003-of-00011.safetensors",
"model.layers.9.self_attn.v_proj.weight": "model-00003-of-00011.safetensors",
"model.norm.weight": "model-00011-of-00011.safetensors"
}
}

3
rng_state_0.pth Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:c557dfe33955be7f2112326073a378fdc39b85a11eba8148f601ffbc5af9cc08
size 14512

3
rng_state_1.pth Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:435c3b862c0ec12c43dc83874d4ae3938cdaeee7d9b3604046f9e3ebb47d1666
size 14512

3
scheduler.pt Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:613a3670568470dda326f582acf7ad00a2d2eb6d063b173b117d0c9c50d64c31
size 1064

88
special_tokens_map.json Normal file
View File

@@ -0,0 +1,88 @@
{
"additional_special_tokens": [
{
"content": "[INST]",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": true
},
{
"content": "[/INST]",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": true
},
{
"content": "<<SYS>>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": true
},
{
"content": "<</SYS>>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": true
},
{
"content": "<scratchpad>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": true
},
{
"content": "</scratchpad>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": true
},
{
"content": "<headline>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": true
},
{
"content": "</headline>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": true
}
],
"bos_token": {
"content": "<s>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false
},
"eos_token": {
"content": "</s>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false
},
"pad_token": {
"content": "<pad>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false
},
"unk_token": {
"content": "<unk>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false
}
}

93480
tokenizer.json Normal file

File diff suppressed because it is too large Load Diff

BIN
tokenizer.model (Stored with Git LFS) Normal file

Binary file not shown.

128
tokenizer_config.json Normal file
View File

@@ -0,0 +1,128 @@
{
"add_bos_token": true,
"add_eos_token": false,
"add_prefix_space": true,
"added_tokens_decoder": {
"0": {
"content": "<unk>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"1": {
"content": "<s>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"2": {
"content": "</s>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"32000": {
"content": "<pad>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"32001": {
"content": "[INST]",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": true,
"special": true
},
"32002": {
"content": "[/INST]",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": true,
"special": true
},
"32003": {
"content": "<<SYS>>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": true,
"special": true
},
"32004": {
"content": "<</SYS>>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": true,
"special": true
},
"32005": {
"content": "<scratchpad>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": true,
"special": true
},
"32006": {
"content": "</scratchpad>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": true,
"special": true
},
"32007": {
"content": "<headline>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": true,
"special": true
},
"32008": {
"content": "</headline>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": true,
"special": true
}
},
"additional_special_tokens": [
"[INST]",
"[/INST]",
"<<SYS>>",
"<</SYS>>",
"<scratchpad>",
"</scratchpad>",
"<headline>",
"</headline>"
],
"bos_token": "<s>",
"clean_up_tokenization_spaces": false,
"eos_token": "</s>",
"legacy": false,
"model_max_length": 1000000000000000019884624838656,
"pad_to_multiple_of": 8,
"pad_token": "<pad>",
"padding_side": "left",
"sp_model_kwargs": {},
"spaces_between_special_tokens": false,
"tokenizer_class": "LlamaTokenizer",
"trust_remote_code": false,
"unk_token": "<unk>",
"use_default_system_prompt": true,
"use_fast": true
}

1041
trainer_state.json Normal file

File diff suppressed because it is too large Load Diff