初始化项目,由ModelHub XC社区提供模型

Model: BillyWang1/qwen2.5-7b-base-retool-slime-sft-v2
Source: Original Platform
This commit is contained in:
ModelHub XC
2026-08-08 15:58:30 +08:00
commit 65288a8af6
39 changed files with 455438 additions and 0 deletions

35
.gitattributes vendored Normal file
View File

@@ -0,0 +1,35 @@
*.7z filter=lfs diff=lfs merge=lfs -text
*.arrow filter=lfs diff=lfs merge=lfs -text
*.bin filter=lfs diff=lfs merge=lfs -text
*.bz2 filter=lfs diff=lfs merge=lfs -text
*.ckpt filter=lfs diff=lfs merge=lfs -text
*.ftz filter=lfs diff=lfs merge=lfs -text
*.gz filter=lfs diff=lfs merge=lfs -text
*.h5 filter=lfs diff=lfs merge=lfs -text
*.joblib filter=lfs diff=lfs merge=lfs -text
*.lfs.* filter=lfs diff=lfs merge=lfs -text
*.mlmodel filter=lfs diff=lfs merge=lfs -text
*.model filter=lfs diff=lfs merge=lfs -text
*.msgpack filter=lfs diff=lfs merge=lfs -text
*.npy filter=lfs diff=lfs merge=lfs -text
*.npz filter=lfs diff=lfs merge=lfs -text
*.onnx filter=lfs diff=lfs merge=lfs -text
*.ot filter=lfs diff=lfs merge=lfs -text
*.parquet filter=lfs diff=lfs merge=lfs -text
*.pb filter=lfs diff=lfs merge=lfs -text
*.pickle filter=lfs diff=lfs merge=lfs -text
*.pkl filter=lfs diff=lfs merge=lfs -text
*.pt filter=lfs diff=lfs merge=lfs -text
*.pth filter=lfs diff=lfs merge=lfs -text
*.rar filter=lfs diff=lfs merge=lfs -text
*.safetensors filter=lfs diff=lfs merge=lfs -text
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
*.tar.* filter=lfs diff=lfs merge=lfs -text
*.tar filter=lfs diff=lfs merge=lfs -text
*.tflite filter=lfs diff=lfs merge=lfs -text
*.tgz filter=lfs diff=lfs merge=lfs -text
*.wasm filter=lfs diff=lfs merge=lfs -text
*.xz filter=lfs diff=lfs merge=lfs -text
*.zip filter=lfs diff=lfs merge=lfs -text
*.zst filter=lfs diff=lfs merge=lfs -text
*tfevents* filter=lfs diff=lfs merge=lfs -text

55
README.md Normal file
View File

@@ -0,0 +1,55 @@
---
license: apache-2.0
base_model: Qwen/Qwen2.5-7B
tags:
- retool
- sft
- tool-use
- slime
- megatron
library_name: transformers
pipeline_tag: text-generation
---
# qwen2.5-7b-base-retool-slime-sft-v2
ReTool SFT cold-start of **Qwen/Qwen2.5-7B** (base, *not* Instruct), trained with
[slime](https://github.com/THUDM/slime) on a Megatron backend. This is the tool-format
SFT stage that teaches the base model the ReTool interleaved code/tool-call format before
RL.
## Training configuration
| Setting | Value |
|---|---|
| Base model | `Qwen/Qwen2.5-7B` (base) |
| Dataset | [ReTool-SFT](https://huggingface.co/datasets/JoeYing/ReTool-SFT) (`messages` format) |
| Loss | `sft_loss`, per-token, Qwen loss mask |
| **Global batch size** | **32** |
| **Epochs** | **6** (~371 optimizer steps over the ~2k-row corpus, ~62 steps/epoch) |
| Optimizer | Adam (β1=0.9, β2=0.95), weight decay 0.01 |
| LR schedule | 1e-5 → 1e-6, cosine, 10% warmup |
| Precision | bf16, grads all-reduced in fp32 |
| Parallelism | TP=4, PP=1, CP=1, sequence-parallel |
| Hardware | 8× A100-40GB |
| Final train loss | ~0.02 |
The checkpoint corresponds to iteration **371** (end of epoch 6).
## Usage
```python
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained(
"BillyWang1/qwen2.5-7b-base-retool-slime-sft-v2",
torch_dtype="bfloat16",
device_map="auto",
)
tok = AutoTokenizer.from_pretrained("BillyWang1/qwen2.5-7b-base-retool-slime-sft-v2")
```
## Notes
This is an intermediate SFT cold-start checkpoint intended as the starting point for
subsequent RL (GRPO / GFlow-RL) in the ReTool pipeline.

28
config.json Normal file
View File

@@ -0,0 +1,28 @@
{
"architectures": [
"Qwen2ForCausalLM"
],
"attention_dropout": 0.0,
"bos_token_id": 151643,
"eos_token_id": 151643,
"hidden_act": "silu",
"hidden_size": 3584,
"initializer_range": 0.02,
"intermediate_size": 18944,
"max_position_embeddings": 131072,
"max_window_layers": 28,
"model_type": "qwen2",
"num_attention_heads": 28,
"num_hidden_layers": 28,
"num_key_value_heads": 4,
"rms_norm_eps": 1e-06,
"rope_theta": 1000000.0,
"sliding_window": 131072,
"tie_word_embeddings": false,
"torch_dtype": "bfloat16",
"transformers_version": "4.40.1",
"use_cache": true,
"use_mrope": false,
"use_sliding_window": false,
"vocab_size": 152064
}

7
generation_config.json Normal file
View File

@@ -0,0 +1,7 @@
{
"bos_token_id": 151643,
"do_sample": false,
"eos_token_id": 151643,
"max_new_tokens": 2048,
"transformers_version": "4.37.0"
}

151387
merges.txt Normal file

File diff suppressed because it is too large Load Diff

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:4fdbc64c4e892994032a749fcbec7de6672e0c2e0616c704f8a95fd0c63661b7
size 466131496

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:0781a0716f6f0d27287ced6a66c489756577bd855dfe3ee24ec56560d854baad
size 466116952

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:3a4f26b36213f58154456cbc448b5bfaebb05601cf0943b3a0c9b39016f7b2e5
size 466116968

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:172c256cbe76a6073a7f777c6567d0507826bcfe0bdeb6a2d38d2c63aee2d857
size 466116968

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:a2fa6c5900e8f37ba07a40383c88ac24cf3f703986248cdebd9dac2cc0e25ab3
size 466116968

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:08272b21d213e2af363a830583bb68357c791514b68a63ed76e4542feddf3d5a
size 466116968

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:1899be7bdd3687a2336288648a669bf943955d6dffc1564cc88802d4bcbdf96a
size 466116968

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:d7f2c19413fec7ab7271608c23e935a0c2722bbe56b0d2da31d57fbf4b1e7ec7
size 466116968

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:0873b249a3d1d8f1515849871137565ccb576778d75740a6fef334d227bc64f9
size 466116968

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:24176f6a5cc1efb638a25c1e28250617b2a9e003cb69d8f92cebaafac8e900af
size 466116968

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:b7c3f487db5405f1bd08980a448a72806c0ac391b195281cc1af03fd7c1fce66
size 466116968

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:ff12f9a1c6cfb9239dc0565b4ee0963000331cb84e4ec1cec2f90353ac4901e3
size 466116968

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:272083cacdecf41d95e99491701338c56ca3bf9bcc97e5f58fd743a33a7e2807
size 466116952

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:5b54370b3ff43aef2ebc31c34ae09f1ba77dabed77fc7314339a3133765b7259
size 466116968

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:1ed294e1576210d463782778bcfb6cc68b85112e0d3080f5aaf363b4e375202d
size 466116968

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:abde2a3947ef4bd1c7cdb632eba1a34cd8d31ed33b2a4de21a74a7e435d0a355
size 466116968

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:2ad5912143fc400b8cd89f084c20ba31f5edb9bb340b7e0c3a0a37f8dff684fb
size 466116968

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:189ad36fae1ebd4004a9917f5c62d5fa0c819602e666d6a7b23d6d9c27ccd4a3
size 466116968

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:3e3aed36f2fe25eaeb49d94cc41d2dca2362436a56e3c72f6e51ddc082193e78
size 466116968

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:908a7a1fe83ac7d43d8c3cf5709e2039e60365da423003135ea6d266beaed18a
size 466116968

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:aabf1e510b7757121bb1200d4c02487c0fea5d94f7753b65da6e60c783bc5227
size 466116968

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:f1703669cc0ddf4a02cd8c01f3d8c69f5797141e48a4e2c2aab53da1d9e1d34d
size 466116952

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:5eddfa227dd88e2b70eceaff8fc8df94501358f3df02331472a21fbb54d9b476
size 466116952

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:24b3ddea2d5dc8ba4ad25e4edb28e771d94a3b422c66df385326b62d3b356438
size 466116952

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:474b9405283d6611cb025ed8a615c198d0ebbcd98bd1d0386edc188b7201917f
size 466116952

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:640104f9d10e99e772c9afe2a5b19ce779e4d863b82f39e0f5f0ef3df3070b27
size 466116952

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:c16eab06384d0229b53058226321c114263e1756a1ffef5b8aea3dfe08436f3a
size 466116952

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:4bdbd51ca8cfbc7ea17916797326e2ef9a4da26dfa3aaaf1a0026784dd6e4066
size 466109664

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:5f27ad4ffe37e67ca362f07ac3aaaf7ea99af36301c95cccdf25a35e991a2705
size 1089994896

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:6f3c8f6d80c8a93b85b50ebdb92b6f31e3b293dac533c7f98953d7f97fa68818
size 1089994880

View File

@@ -0,0 +1,346 @@
{
"metadata": {
"total_size": 15231233024
},
"weight_map": {
"model.norm.weight": "model-00001-of-00030.safetensors",
"model.layers.0.post_attention_layernorm.weight": "model-00001-of-00030.safetensors",
"model.layers.0.mlp.gate_proj.weight": "model-00001-of-00030.safetensors",
"model.layers.0.mlp.up_proj.weight": "model-00001-of-00030.safetensors",
"model.layers.0.mlp.down_proj.weight": "model-00001-of-00030.safetensors",
"model.layers.0.self_attn.o_proj.weight": "model-00001-of-00030.safetensors",
"model.layers.0.self_attn.q_proj.bias": "model-00001-of-00030.safetensors",
"model.layers.0.self_attn.k_proj.bias": "model-00001-of-00030.safetensors",
"model.layers.0.self_attn.v_proj.bias": "model-00001-of-00030.safetensors",
"model.layers.0.input_layernorm.weight": "model-00001-of-00030.safetensors",
"model.layers.0.self_attn.q_proj.weight": "model-00001-of-00030.safetensors",
"model.layers.0.self_attn.k_proj.weight": "model-00001-of-00030.safetensors",
"model.layers.0.self_attn.v_proj.weight": "model-00001-of-00030.safetensors",
"model.layers.1.post_attention_layernorm.weight": "model-00001-of-00030.safetensors",
"model.layers.1.mlp.gate_proj.weight": "model-00002-of-00030.safetensors",
"model.layers.1.mlp.up_proj.weight": "model-00002-of-00030.safetensors",
"model.layers.1.mlp.down_proj.weight": "model-00002-of-00030.safetensors",
"model.layers.1.self_attn.o_proj.weight": "model-00002-of-00030.safetensors",
"model.layers.1.self_attn.q_proj.bias": "model-00002-of-00030.safetensors",
"model.layers.1.self_attn.k_proj.bias": "model-00002-of-00030.safetensors",
"model.layers.1.self_attn.v_proj.bias": "model-00002-of-00030.safetensors",
"model.layers.1.input_layernorm.weight": "model-00002-of-00030.safetensors",
"model.layers.1.self_attn.q_proj.weight": "model-00002-of-00030.safetensors",
"model.layers.1.self_attn.k_proj.weight": "model-00002-of-00030.safetensors",
"model.layers.1.self_attn.v_proj.weight": "model-00002-of-00030.safetensors",
"model.layers.10.post_attention_layernorm.weight": "model-00002-of-00030.safetensors",
"model.layers.10.mlp.gate_proj.weight": "model-00003-of-00030.safetensors",
"model.layers.10.mlp.up_proj.weight": "model-00003-of-00030.safetensors",
"model.layers.10.mlp.down_proj.weight": "model-00003-of-00030.safetensors",
"model.layers.10.self_attn.o_proj.weight": "model-00003-of-00030.safetensors",
"model.layers.10.self_attn.q_proj.bias": "model-00003-of-00030.safetensors",
"model.layers.10.self_attn.k_proj.bias": "model-00003-of-00030.safetensors",
"model.layers.10.self_attn.v_proj.bias": "model-00003-of-00030.safetensors",
"model.layers.10.input_layernorm.weight": "model-00003-of-00030.safetensors",
"model.layers.10.self_attn.q_proj.weight": "model-00003-of-00030.safetensors",
"model.layers.10.self_attn.k_proj.weight": "model-00003-of-00030.safetensors",
"model.layers.10.self_attn.v_proj.weight": "model-00003-of-00030.safetensors",
"model.layers.11.post_attention_layernorm.weight": "model-00003-of-00030.safetensors",
"model.layers.11.mlp.gate_proj.weight": "model-00004-of-00030.safetensors",
"model.layers.11.mlp.up_proj.weight": "model-00004-of-00030.safetensors",
"model.layers.11.mlp.down_proj.weight": "model-00004-of-00030.safetensors",
"model.layers.11.self_attn.o_proj.weight": "model-00004-of-00030.safetensors",
"model.layers.11.self_attn.q_proj.bias": "model-00004-of-00030.safetensors",
"model.layers.11.self_attn.k_proj.bias": "model-00004-of-00030.safetensors",
"model.layers.11.self_attn.v_proj.bias": "model-00004-of-00030.safetensors",
"model.layers.11.input_layernorm.weight": "model-00004-of-00030.safetensors",
"model.layers.11.self_attn.q_proj.weight": "model-00004-of-00030.safetensors",
"model.layers.11.self_attn.k_proj.weight": "model-00004-of-00030.safetensors",
"model.layers.11.self_attn.v_proj.weight": "model-00004-of-00030.safetensors",
"model.layers.12.post_attention_layernorm.weight": "model-00004-of-00030.safetensors",
"model.layers.12.mlp.gate_proj.weight": "model-00005-of-00030.safetensors",
"model.layers.12.mlp.up_proj.weight": "model-00005-of-00030.safetensors",
"model.layers.12.mlp.down_proj.weight": "model-00005-of-00030.safetensors",
"model.layers.12.self_attn.o_proj.weight": "model-00005-of-00030.safetensors",
"model.layers.12.self_attn.q_proj.bias": "model-00005-of-00030.safetensors",
"model.layers.12.self_attn.k_proj.bias": "model-00005-of-00030.safetensors",
"model.layers.12.self_attn.v_proj.bias": "model-00005-of-00030.safetensors",
"model.layers.12.input_layernorm.weight": "model-00005-of-00030.safetensors",
"model.layers.12.self_attn.q_proj.weight": "model-00005-of-00030.safetensors",
"model.layers.12.self_attn.k_proj.weight": "model-00005-of-00030.safetensors",
"model.layers.12.self_attn.v_proj.weight": "model-00005-of-00030.safetensors",
"model.layers.13.post_attention_layernorm.weight": "model-00005-of-00030.safetensors",
"model.layers.13.mlp.gate_proj.weight": "model-00006-of-00030.safetensors",
"model.layers.13.mlp.up_proj.weight": "model-00006-of-00030.safetensors",
"model.layers.13.mlp.down_proj.weight": "model-00006-of-00030.safetensors",
"model.layers.13.self_attn.o_proj.weight": "model-00006-of-00030.safetensors",
"model.layers.13.self_attn.q_proj.bias": "model-00006-of-00030.safetensors",
"model.layers.13.self_attn.k_proj.bias": "model-00006-of-00030.safetensors",
"model.layers.13.self_attn.v_proj.bias": "model-00006-of-00030.safetensors",
"model.layers.13.input_layernorm.weight": "model-00006-of-00030.safetensors",
"model.layers.13.self_attn.q_proj.weight": "model-00006-of-00030.safetensors",
"model.layers.13.self_attn.k_proj.weight": "model-00006-of-00030.safetensors",
"model.layers.13.self_attn.v_proj.weight": "model-00006-of-00030.safetensors",
"model.layers.14.post_attention_layernorm.weight": "model-00006-of-00030.safetensors",
"model.layers.14.mlp.gate_proj.weight": "model-00007-of-00030.safetensors",
"model.layers.14.mlp.up_proj.weight": "model-00007-of-00030.safetensors",
"model.layers.14.mlp.down_proj.weight": "model-00007-of-00030.safetensors",
"model.layers.14.self_attn.o_proj.weight": "model-00007-of-00030.safetensors",
"model.layers.14.self_attn.q_proj.bias": "model-00007-of-00030.safetensors",
"model.layers.14.self_attn.k_proj.bias": "model-00007-of-00030.safetensors",
"model.layers.14.self_attn.v_proj.bias": "model-00007-of-00030.safetensors",
"model.layers.14.input_layernorm.weight": "model-00007-of-00030.safetensors",
"model.layers.14.self_attn.q_proj.weight": "model-00007-of-00030.safetensors",
"model.layers.14.self_attn.k_proj.weight": "model-00007-of-00030.safetensors",
"model.layers.14.self_attn.v_proj.weight": "model-00007-of-00030.safetensors",
"model.layers.15.post_attention_layernorm.weight": "model-00007-of-00030.safetensors",
"model.layers.15.mlp.gate_proj.weight": "model-00008-of-00030.safetensors",
"model.layers.15.mlp.up_proj.weight": "model-00008-of-00030.safetensors",
"model.layers.15.mlp.down_proj.weight": "model-00008-of-00030.safetensors",
"model.layers.15.self_attn.o_proj.weight": "model-00008-of-00030.safetensors",
"model.layers.15.self_attn.q_proj.bias": "model-00008-of-00030.safetensors",
"model.layers.15.self_attn.k_proj.bias": "model-00008-of-00030.safetensors",
"model.layers.15.self_attn.v_proj.bias": "model-00008-of-00030.safetensors",
"model.layers.15.input_layernorm.weight": "model-00008-of-00030.safetensors",
"model.layers.15.self_attn.q_proj.weight": "model-00008-of-00030.safetensors",
"model.layers.15.self_attn.k_proj.weight": "model-00008-of-00030.safetensors",
"model.layers.15.self_attn.v_proj.weight": "model-00008-of-00030.safetensors",
"model.layers.16.post_attention_layernorm.weight": "model-00008-of-00030.safetensors",
"model.layers.16.mlp.gate_proj.weight": "model-00009-of-00030.safetensors",
"model.layers.16.mlp.up_proj.weight": "model-00009-of-00030.safetensors",
"model.layers.16.mlp.down_proj.weight": "model-00009-of-00030.safetensors",
"model.layers.16.self_attn.o_proj.weight": "model-00009-of-00030.safetensors",
"model.layers.16.self_attn.q_proj.bias": "model-00009-of-00030.safetensors",
"model.layers.16.self_attn.k_proj.bias": "model-00009-of-00030.safetensors",
"model.layers.16.self_attn.v_proj.bias": "model-00009-of-00030.safetensors",
"model.layers.16.input_layernorm.weight": "model-00009-of-00030.safetensors",
"model.layers.16.self_attn.q_proj.weight": "model-00009-of-00030.safetensors",
"model.layers.16.self_attn.k_proj.weight": "model-00009-of-00030.safetensors",
"model.layers.16.self_attn.v_proj.weight": "model-00009-of-00030.safetensors",
"model.layers.17.post_attention_layernorm.weight": "model-00009-of-00030.safetensors",
"model.layers.17.mlp.gate_proj.weight": "model-00010-of-00030.safetensors",
"model.layers.17.mlp.up_proj.weight": "model-00010-of-00030.safetensors",
"model.layers.17.mlp.down_proj.weight": "model-00010-of-00030.safetensors",
"model.layers.17.self_attn.o_proj.weight": "model-00010-of-00030.safetensors",
"model.layers.17.self_attn.q_proj.bias": "model-00010-of-00030.safetensors",
"model.layers.17.self_attn.k_proj.bias": "model-00010-of-00030.safetensors",
"model.layers.17.self_attn.v_proj.bias": "model-00010-of-00030.safetensors",
"model.layers.17.input_layernorm.weight": "model-00010-of-00030.safetensors",
"model.layers.17.self_attn.q_proj.weight": "model-00010-of-00030.safetensors",
"model.layers.17.self_attn.k_proj.weight": "model-00010-of-00030.safetensors",
"model.layers.17.self_attn.v_proj.weight": "model-00010-of-00030.safetensors",
"model.layers.18.post_attention_layernorm.weight": "model-00010-of-00030.safetensors",
"model.layers.18.mlp.gate_proj.weight": "model-00011-of-00030.safetensors",
"model.layers.18.mlp.up_proj.weight": "model-00011-of-00030.safetensors",
"model.layers.18.mlp.down_proj.weight": "model-00011-of-00030.safetensors",
"model.layers.18.self_attn.o_proj.weight": "model-00011-of-00030.safetensors",
"model.layers.18.self_attn.q_proj.bias": "model-00011-of-00030.safetensors",
"model.layers.18.self_attn.k_proj.bias": "model-00011-of-00030.safetensors",
"model.layers.18.self_attn.v_proj.bias": "model-00011-of-00030.safetensors",
"model.layers.18.input_layernorm.weight": "model-00011-of-00030.safetensors",
"model.layers.18.self_attn.q_proj.weight": "model-00011-of-00030.safetensors",
"model.layers.18.self_attn.k_proj.weight": "model-00011-of-00030.safetensors",
"model.layers.18.self_attn.v_proj.weight": "model-00011-of-00030.safetensors",
"model.layers.19.post_attention_layernorm.weight": "model-00011-of-00030.safetensors",
"model.layers.19.mlp.gate_proj.weight": "model-00012-of-00030.safetensors",
"model.layers.19.mlp.up_proj.weight": "model-00012-of-00030.safetensors",
"model.layers.19.mlp.down_proj.weight": "model-00012-of-00030.safetensors",
"model.layers.19.self_attn.o_proj.weight": "model-00012-of-00030.safetensors",
"model.layers.19.self_attn.q_proj.bias": "model-00012-of-00030.safetensors",
"model.layers.19.self_attn.k_proj.bias": "model-00012-of-00030.safetensors",
"model.layers.19.self_attn.v_proj.bias": "model-00012-of-00030.safetensors",
"model.layers.19.input_layernorm.weight": "model-00012-of-00030.safetensors",
"model.layers.19.self_attn.q_proj.weight": "model-00012-of-00030.safetensors",
"model.layers.19.self_attn.k_proj.weight": "model-00012-of-00030.safetensors",
"model.layers.19.self_attn.v_proj.weight": "model-00012-of-00030.safetensors",
"model.layers.2.post_attention_layernorm.weight": "model-00012-of-00030.safetensors",
"model.layers.2.mlp.gate_proj.weight": "model-00013-of-00030.safetensors",
"model.layers.2.mlp.up_proj.weight": "model-00013-of-00030.safetensors",
"model.layers.2.mlp.down_proj.weight": "model-00013-of-00030.safetensors",
"model.layers.2.self_attn.o_proj.weight": "model-00013-of-00030.safetensors",
"model.layers.2.self_attn.q_proj.bias": "model-00013-of-00030.safetensors",
"model.layers.2.self_attn.k_proj.bias": "model-00013-of-00030.safetensors",
"model.layers.2.self_attn.v_proj.bias": "model-00013-of-00030.safetensors",
"model.layers.2.input_layernorm.weight": "model-00013-of-00030.safetensors",
"model.layers.2.self_attn.q_proj.weight": "model-00013-of-00030.safetensors",
"model.layers.2.self_attn.k_proj.weight": "model-00013-of-00030.safetensors",
"model.layers.2.self_attn.v_proj.weight": "model-00013-of-00030.safetensors",
"model.layers.20.post_attention_layernorm.weight": "model-00013-of-00030.safetensors",
"model.layers.20.mlp.gate_proj.weight": "model-00014-of-00030.safetensors",
"model.layers.20.mlp.up_proj.weight": "model-00014-of-00030.safetensors",
"model.layers.20.mlp.down_proj.weight": "model-00014-of-00030.safetensors",
"model.layers.20.self_attn.o_proj.weight": "model-00014-of-00030.safetensors",
"model.layers.20.self_attn.q_proj.bias": "model-00014-of-00030.safetensors",
"model.layers.20.self_attn.k_proj.bias": "model-00014-of-00030.safetensors",
"model.layers.20.self_attn.v_proj.bias": "model-00014-of-00030.safetensors",
"model.layers.20.input_layernorm.weight": "model-00014-of-00030.safetensors",
"model.layers.20.self_attn.q_proj.weight": "model-00014-of-00030.safetensors",
"model.layers.20.self_attn.k_proj.weight": "model-00014-of-00030.safetensors",
"model.layers.20.self_attn.v_proj.weight": "model-00014-of-00030.safetensors",
"model.layers.21.post_attention_layernorm.weight": "model-00014-of-00030.safetensors",
"model.layers.21.mlp.gate_proj.weight": "model-00015-of-00030.safetensors",
"model.layers.21.mlp.up_proj.weight": "model-00015-of-00030.safetensors",
"model.layers.21.mlp.down_proj.weight": "model-00015-of-00030.safetensors",
"model.layers.21.self_attn.o_proj.weight": "model-00015-of-00030.safetensors",
"model.layers.21.self_attn.q_proj.bias": "model-00015-of-00030.safetensors",
"model.layers.21.self_attn.k_proj.bias": "model-00015-of-00030.safetensors",
"model.layers.21.self_attn.v_proj.bias": "model-00015-of-00030.safetensors",
"model.layers.21.input_layernorm.weight": "model-00015-of-00030.safetensors",
"model.layers.21.self_attn.q_proj.weight": "model-00015-of-00030.safetensors",
"model.layers.21.self_attn.k_proj.weight": "model-00015-of-00030.safetensors",
"model.layers.21.self_attn.v_proj.weight": "model-00015-of-00030.safetensors",
"model.layers.22.post_attention_layernorm.weight": "model-00015-of-00030.safetensors",
"model.layers.22.mlp.gate_proj.weight": "model-00016-of-00030.safetensors",
"model.layers.22.mlp.up_proj.weight": "model-00016-of-00030.safetensors",
"model.layers.22.mlp.down_proj.weight": "model-00016-of-00030.safetensors",
"model.layers.22.self_attn.o_proj.weight": "model-00016-of-00030.safetensors",
"model.layers.22.self_attn.q_proj.bias": "model-00016-of-00030.safetensors",
"model.layers.22.self_attn.k_proj.bias": "model-00016-of-00030.safetensors",
"model.layers.22.self_attn.v_proj.bias": "model-00016-of-00030.safetensors",
"model.layers.22.input_layernorm.weight": "model-00016-of-00030.safetensors",
"model.layers.22.self_attn.q_proj.weight": "model-00016-of-00030.safetensors",
"model.layers.22.self_attn.k_proj.weight": "model-00016-of-00030.safetensors",
"model.layers.22.self_attn.v_proj.weight": "model-00016-of-00030.safetensors",
"model.layers.23.post_attention_layernorm.weight": "model-00016-of-00030.safetensors",
"model.layers.23.mlp.gate_proj.weight": "model-00017-of-00030.safetensors",
"model.layers.23.mlp.up_proj.weight": "model-00017-of-00030.safetensors",
"model.layers.23.mlp.down_proj.weight": "model-00017-of-00030.safetensors",
"model.layers.23.self_attn.o_proj.weight": "model-00017-of-00030.safetensors",
"model.layers.23.self_attn.q_proj.bias": "model-00017-of-00030.safetensors",
"model.layers.23.self_attn.k_proj.bias": "model-00017-of-00030.safetensors",
"model.layers.23.self_attn.v_proj.bias": "model-00017-of-00030.safetensors",
"model.layers.23.input_layernorm.weight": "model-00017-of-00030.safetensors",
"model.layers.23.self_attn.q_proj.weight": "model-00017-of-00030.safetensors",
"model.layers.23.self_attn.k_proj.weight": "model-00017-of-00030.safetensors",
"model.layers.23.self_attn.v_proj.weight": "model-00017-of-00030.safetensors",
"model.layers.24.post_attention_layernorm.weight": "model-00017-of-00030.safetensors",
"model.layers.24.mlp.gate_proj.weight": "model-00018-of-00030.safetensors",
"model.layers.24.mlp.up_proj.weight": "model-00018-of-00030.safetensors",
"model.layers.24.mlp.down_proj.weight": "model-00018-of-00030.safetensors",
"model.layers.24.self_attn.o_proj.weight": "model-00018-of-00030.safetensors",
"model.layers.24.self_attn.q_proj.bias": "model-00018-of-00030.safetensors",
"model.layers.24.self_attn.k_proj.bias": "model-00018-of-00030.safetensors",
"model.layers.24.self_attn.v_proj.bias": "model-00018-of-00030.safetensors",
"model.layers.24.input_layernorm.weight": "model-00018-of-00030.safetensors",
"model.layers.24.self_attn.q_proj.weight": "model-00018-of-00030.safetensors",
"model.layers.24.self_attn.k_proj.weight": "model-00018-of-00030.safetensors",
"model.layers.24.self_attn.v_proj.weight": "model-00018-of-00030.safetensors",
"model.layers.25.post_attention_layernorm.weight": "model-00018-of-00030.safetensors",
"model.layers.25.mlp.gate_proj.weight": "model-00019-of-00030.safetensors",
"model.layers.25.mlp.up_proj.weight": "model-00019-of-00030.safetensors",
"model.layers.25.mlp.down_proj.weight": "model-00019-of-00030.safetensors",
"model.layers.25.self_attn.o_proj.weight": "model-00019-of-00030.safetensors",
"model.layers.25.self_attn.q_proj.bias": "model-00019-of-00030.safetensors",
"model.layers.25.self_attn.k_proj.bias": "model-00019-of-00030.safetensors",
"model.layers.25.self_attn.v_proj.bias": "model-00019-of-00030.safetensors",
"model.layers.25.input_layernorm.weight": "model-00019-of-00030.safetensors",
"model.layers.25.self_attn.q_proj.weight": "model-00019-of-00030.safetensors",
"model.layers.25.self_attn.k_proj.weight": "model-00019-of-00030.safetensors",
"model.layers.25.self_attn.v_proj.weight": "model-00019-of-00030.safetensors",
"model.layers.26.post_attention_layernorm.weight": "model-00019-of-00030.safetensors",
"model.layers.26.mlp.gate_proj.weight": "model-00020-of-00030.safetensors",
"model.layers.26.mlp.up_proj.weight": "model-00020-of-00030.safetensors",
"model.layers.26.mlp.down_proj.weight": "model-00020-of-00030.safetensors",
"model.layers.26.self_attn.o_proj.weight": "model-00020-of-00030.safetensors",
"model.layers.26.self_attn.q_proj.bias": "model-00020-of-00030.safetensors",
"model.layers.26.self_attn.k_proj.bias": "model-00020-of-00030.safetensors",
"model.layers.26.self_attn.v_proj.bias": "model-00020-of-00030.safetensors",
"model.layers.26.input_layernorm.weight": "model-00020-of-00030.safetensors",
"model.layers.26.self_attn.q_proj.weight": "model-00020-of-00030.safetensors",
"model.layers.26.self_attn.k_proj.weight": "model-00020-of-00030.safetensors",
"model.layers.26.self_attn.v_proj.weight": "model-00020-of-00030.safetensors",
"model.layers.27.post_attention_layernorm.weight": "model-00020-of-00030.safetensors",
"model.layers.27.mlp.gate_proj.weight": "model-00021-of-00030.safetensors",
"model.layers.27.mlp.up_proj.weight": "model-00021-of-00030.safetensors",
"model.layers.27.mlp.down_proj.weight": "model-00021-of-00030.safetensors",
"model.layers.27.self_attn.o_proj.weight": "model-00021-of-00030.safetensors",
"model.layers.27.self_attn.q_proj.bias": "model-00021-of-00030.safetensors",
"model.layers.27.self_attn.k_proj.bias": "model-00021-of-00030.safetensors",
"model.layers.27.self_attn.v_proj.bias": "model-00021-of-00030.safetensors",
"model.layers.27.input_layernorm.weight": "model-00021-of-00030.safetensors",
"model.layers.27.self_attn.q_proj.weight": "model-00021-of-00030.safetensors",
"model.layers.27.self_attn.k_proj.weight": "model-00021-of-00030.safetensors",
"model.layers.27.self_attn.v_proj.weight": "model-00021-of-00030.safetensors",
"model.layers.3.post_attention_layernorm.weight": "model-00021-of-00030.safetensors",
"model.layers.3.mlp.gate_proj.weight": "model-00022-of-00030.safetensors",
"model.layers.3.mlp.up_proj.weight": "model-00022-of-00030.safetensors",
"model.layers.3.mlp.down_proj.weight": "model-00022-of-00030.safetensors",
"model.layers.3.self_attn.o_proj.weight": "model-00022-of-00030.safetensors",
"model.layers.3.self_attn.q_proj.bias": "model-00022-of-00030.safetensors",
"model.layers.3.self_attn.k_proj.bias": "model-00022-of-00030.safetensors",
"model.layers.3.self_attn.v_proj.bias": "model-00022-of-00030.safetensors",
"model.layers.3.input_layernorm.weight": "model-00022-of-00030.safetensors",
"model.layers.3.self_attn.q_proj.weight": "model-00022-of-00030.safetensors",
"model.layers.3.self_attn.k_proj.weight": "model-00022-of-00030.safetensors",
"model.layers.3.self_attn.v_proj.weight": "model-00022-of-00030.safetensors",
"model.layers.4.post_attention_layernorm.weight": "model-00022-of-00030.safetensors",
"model.layers.4.mlp.gate_proj.weight": "model-00023-of-00030.safetensors",
"model.layers.4.mlp.up_proj.weight": "model-00023-of-00030.safetensors",
"model.layers.4.mlp.down_proj.weight": "model-00023-of-00030.safetensors",
"model.layers.4.self_attn.o_proj.weight": "model-00023-of-00030.safetensors",
"model.layers.4.self_attn.q_proj.bias": "model-00023-of-00030.safetensors",
"model.layers.4.self_attn.k_proj.bias": "model-00023-of-00030.safetensors",
"model.layers.4.self_attn.v_proj.bias": "model-00023-of-00030.safetensors",
"model.layers.4.input_layernorm.weight": "model-00023-of-00030.safetensors",
"model.layers.4.self_attn.q_proj.weight": "model-00023-of-00030.safetensors",
"model.layers.4.self_attn.k_proj.weight": "model-00023-of-00030.safetensors",
"model.layers.4.self_attn.v_proj.weight": "model-00023-of-00030.safetensors",
"model.layers.5.post_attention_layernorm.weight": "model-00023-of-00030.safetensors",
"model.layers.5.mlp.gate_proj.weight": "model-00024-of-00030.safetensors",
"model.layers.5.mlp.up_proj.weight": "model-00024-of-00030.safetensors",
"model.layers.5.mlp.down_proj.weight": "model-00024-of-00030.safetensors",
"model.layers.5.self_attn.o_proj.weight": "model-00024-of-00030.safetensors",
"model.layers.5.self_attn.q_proj.bias": "model-00024-of-00030.safetensors",
"model.layers.5.self_attn.k_proj.bias": "model-00024-of-00030.safetensors",
"model.layers.5.self_attn.v_proj.bias": "model-00024-of-00030.safetensors",
"model.layers.5.input_layernorm.weight": "model-00024-of-00030.safetensors",
"model.layers.5.self_attn.q_proj.weight": "model-00024-of-00030.safetensors",
"model.layers.5.self_attn.k_proj.weight": "model-00024-of-00030.safetensors",
"model.layers.5.self_attn.v_proj.weight": "model-00024-of-00030.safetensors",
"model.layers.6.post_attention_layernorm.weight": "model-00024-of-00030.safetensors",
"model.layers.6.mlp.gate_proj.weight": "model-00025-of-00030.safetensors",
"model.layers.6.mlp.up_proj.weight": "model-00025-of-00030.safetensors",
"model.layers.6.mlp.down_proj.weight": "model-00025-of-00030.safetensors",
"model.layers.6.self_attn.o_proj.weight": "model-00025-of-00030.safetensors",
"model.layers.6.self_attn.q_proj.bias": "model-00025-of-00030.safetensors",
"model.layers.6.self_attn.k_proj.bias": "model-00025-of-00030.safetensors",
"model.layers.6.self_attn.v_proj.bias": "model-00025-of-00030.safetensors",
"model.layers.6.input_layernorm.weight": "model-00025-of-00030.safetensors",
"model.layers.6.self_attn.q_proj.weight": "model-00025-of-00030.safetensors",
"model.layers.6.self_attn.k_proj.weight": "model-00025-of-00030.safetensors",
"model.layers.6.self_attn.v_proj.weight": "model-00025-of-00030.safetensors",
"model.layers.7.post_attention_layernorm.weight": "model-00025-of-00030.safetensors",
"model.layers.7.mlp.gate_proj.weight": "model-00026-of-00030.safetensors",
"model.layers.7.mlp.up_proj.weight": "model-00026-of-00030.safetensors",
"model.layers.7.mlp.down_proj.weight": "model-00026-of-00030.safetensors",
"model.layers.7.self_attn.o_proj.weight": "model-00026-of-00030.safetensors",
"model.layers.7.self_attn.q_proj.bias": "model-00026-of-00030.safetensors",
"model.layers.7.self_attn.k_proj.bias": "model-00026-of-00030.safetensors",
"model.layers.7.self_attn.v_proj.bias": "model-00026-of-00030.safetensors",
"model.layers.7.input_layernorm.weight": "model-00026-of-00030.safetensors",
"model.layers.7.self_attn.q_proj.weight": "model-00026-of-00030.safetensors",
"model.layers.7.self_attn.k_proj.weight": "model-00026-of-00030.safetensors",
"model.layers.7.self_attn.v_proj.weight": "model-00026-of-00030.safetensors",
"model.layers.8.post_attention_layernorm.weight": "model-00026-of-00030.safetensors",
"model.layers.8.mlp.gate_proj.weight": "model-00027-of-00030.safetensors",
"model.layers.8.mlp.up_proj.weight": "model-00027-of-00030.safetensors",
"model.layers.8.mlp.down_proj.weight": "model-00027-of-00030.safetensors",
"model.layers.8.self_attn.o_proj.weight": "model-00027-of-00030.safetensors",
"model.layers.8.self_attn.q_proj.bias": "model-00027-of-00030.safetensors",
"model.layers.8.self_attn.k_proj.bias": "model-00027-of-00030.safetensors",
"model.layers.8.self_attn.v_proj.bias": "model-00027-of-00030.safetensors",
"model.layers.8.input_layernorm.weight": "model-00027-of-00030.safetensors",
"model.layers.8.self_attn.q_proj.weight": "model-00027-of-00030.safetensors",
"model.layers.8.self_attn.k_proj.weight": "model-00027-of-00030.safetensors",
"model.layers.8.self_attn.v_proj.weight": "model-00027-of-00030.safetensors",
"model.layers.9.post_attention_layernorm.weight": "model-00027-of-00030.safetensors",
"model.layers.9.mlp.gate_proj.weight": "model-00028-of-00030.safetensors",
"model.layers.9.mlp.up_proj.weight": "model-00028-of-00030.safetensors",
"model.layers.9.mlp.down_proj.weight": "model-00028-of-00030.safetensors",
"model.layers.9.self_attn.o_proj.weight": "model-00028-of-00030.safetensors",
"model.layers.9.self_attn.q_proj.bias": "model-00028-of-00030.safetensors",
"model.layers.9.self_attn.k_proj.bias": "model-00028-of-00030.safetensors",
"model.layers.9.self_attn.v_proj.bias": "model-00028-of-00030.safetensors",
"model.layers.9.input_layernorm.weight": "model-00028-of-00030.safetensors",
"model.layers.9.self_attn.q_proj.weight": "model-00028-of-00030.safetensors",
"model.layers.9.self_attn.k_proj.weight": "model-00028-of-00030.safetensors",
"model.layers.9.self_attn.v_proj.weight": "model-00028-of-00030.safetensors",
"model.embed_tokens.weight": "model-00029-of-00030.safetensors",
"lm_head.weight": "model-00030-of-00030.safetensors"
}
}

303282
tokenizer.json Normal file

File diff suppressed because it is too large Load Diff

207
tokenizer_config.json Normal file
View File

@@ -0,0 +1,207 @@
{
"add_bos_token": false,
"add_prefix_space": false,
"added_tokens_decoder": {
"151643": {
"content": "<|endoftext|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151644": {
"content": "<|im_start|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151645": {
"content": "<|im_end|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151646": {
"content": "<|object_ref_start|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151647": {
"content": "<|object_ref_end|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151648": {
"content": "<|box_start|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151649": {
"content": "<|box_end|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151650": {
"content": "<|quad_start|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151651": {
"content": "<|quad_end|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151652": {
"content": "<|vision_start|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151653": {
"content": "<|vision_end|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151654": {
"content": "<|vision_pad|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151655": {
"content": "<|image_pad|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151656": {
"content": "<|video_pad|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151657": {
"content": "<tool_call>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"151658": {
"content": "</tool_call>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"151659": {
"content": "<|fim_prefix|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"151660": {
"content": "<|fim_middle|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"151661": {
"content": "<|fim_suffix|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"151662": {
"content": "<|fim_pad|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"151663": {
"content": "<|repo_name|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"151664": {
"content": "<|file_sep|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
}
},
"additional_special_tokens": [
"<|im_start|>",
"<|im_end|>",
"<|object_ref_start|>",
"<|object_ref_end|>",
"<|box_start|>",
"<|box_end|>",
"<|quad_start|>",
"<|quad_end|>",
"<|vision_start|>",
"<|vision_end|>",
"<|vision_pad|>",
"<|image_pad|>",
"<|video_pad|>"
],
"bos_token": null,
"chat_template": "{%- if tools %}\n {{- '<|im_start|>system\\n' }}\n {%- if messages[0]['role'] == 'system' %}\n {{- messages[0]['content'] }}\n {%- else %}\n {{- 'You are a helpful assistant.' }}\n {%- endif %}\n {{- \"\\n\\n# Tools\\n\\nYou may call one or more functions to assist with the user query.\\n\\nYou are provided with function signatures within <tools></tools> XML tags:\\n<tools>\" }}\n {%- for tool in tools %}\n {{- \"\\n\" }}\n {{- tool | tojson }}\n {%- endfor %}\n {{- \"\\n</tools>\\n\\nFor each function call, return a json object with function name and arguments within <tool_call></tool_call> XML tags:\\n<tool_call>\\n{\\\"name\\\": <function-name>, \\\"arguments\\\": <args-json-object>}\\n</tool_call><|im_end|>\\n\" }}\n{%- else %}\n {%- if messages[0]['role'] == 'system' %}\n {{- '<|im_start|>system\\n' + messages[0]['content'] + '<|im_end|>\\n' }}\n {%- else %}\n {{- '<|im_start|>system\\nYou are a helpful assistant.<|im_end|>\\n' }}\n {%- endif %}\n{%- endif %}\n{%- for message in messages %}\n {%- if (message.role == \"user\") or (message.role == \"system\" and not loop.first) or (message.role == \"assistant\" and not message.tool_calls) %}\n {{- '<|im_start|>' + message.role + '\\n' + message.content + '<|im_end|>' + '\\n' }}\n {%- elif message.role == \"assistant\" %}\n {{- '<|im_start|>' + message.role }}\n {%- if message.content %}\n {{- '\\n' + message.content }}\n {%- endif %}\n {%- for tool_call in message.tool_calls %}\n {%- if tool_call.function is defined %}\n {%- set tool_call = tool_call.function %}\n {%- endif %}\n {{- '\\n<tool_call>\\n{\"name\": \"' }}\n {{- tool_call.name }}\n {{- '\", \"arguments\": ' }}\n {{- tool_call.arguments | tojson }}\n {{- '}\\n</tool_call>' }}\n {%- endfor %}\n {{- '<|im_end|>\\n' }}\n {%- elif message.role == \"tool\" %}\n {%- if (loop.index0 == 0) or (messages[loop.index0 - 1].role != \"tool\") %}\n {{- '<|im_start|>user' }}\n {%- endif %}\n {{- '\\n<tool_response>\\n' }}\n {{- message.content }}\n {{- '\\n</tool_response>' }}\n {%- if loop.last or (messages[loop.index0 + 1].role != \"tool\") %}\n {{- '<|im_end|>\\n' }}\n {%- endif %}\n {%- endif %}\n{%- endfor %}\n{%- if add_generation_prompt %}\n {{- '<|im_start|>assistant\\n' }}\n{%- endif %}\n",
"clean_up_tokenization_spaces": false,
"eos_token": "<|endoftext|>",
"errors": "replace",
"model_max_length": 131072,
"pad_token": "<|endoftext|>",
"split_special_tokens": false,
"tokenizer_class": "Qwen2Tokenizer",
"unk_token": null
}

1
vocab.json Normal file

File diff suppressed because one or more lines are too long