初始化项目,由ModelHub XC社区提供模型

Model: zipaltrivedi/dotnet-coder-14b
Source: Original Platform
This commit is contained in:
ModelHub XC
2026-09-07 23:06:17 +08:00
commit c97672311f
22 changed files with 1230 additions and 0 deletions

42
.gitattributes vendored Normal file
View File

@@ -0,0 +1,42 @@
*.7z filter=lfs diff=lfs merge=lfs -text
*.arrow filter=lfs diff=lfs merge=lfs -text
*.bin filter=lfs diff=lfs merge=lfs -text
*.bz2 filter=lfs diff=lfs merge=lfs -text
*.ckpt filter=lfs diff=lfs merge=lfs -text
*.ftz filter=lfs diff=lfs merge=lfs -text
*.gz filter=lfs diff=lfs merge=lfs -text
*.h5 filter=lfs diff=lfs merge=lfs -text
*.joblib filter=lfs diff=lfs merge=lfs -text
*.lfs.* filter=lfs diff=lfs merge=lfs -text
*.mlmodel filter=lfs diff=lfs merge=lfs -text
*.model filter=lfs diff=lfs merge=lfs -text
*.msgpack filter=lfs diff=lfs merge=lfs -text
*.npy filter=lfs diff=lfs merge=lfs -text
*.npz filter=lfs diff=lfs merge=lfs -text
*.onnx filter=lfs diff=lfs merge=lfs -text
*.ot filter=lfs diff=lfs merge=lfs -text
*.parquet filter=lfs diff=lfs merge=lfs -text
*.pb filter=lfs diff=lfs merge=lfs -text
*.pickle filter=lfs diff=lfs merge=lfs -text
*.pkl filter=lfs diff=lfs merge=lfs -text
*.pt filter=lfs diff=lfs merge=lfs -text
*.pth filter=lfs diff=lfs merge=lfs -text
*.rar filter=lfs diff=lfs merge=lfs -text
*.safetensors filter=lfs diff=lfs merge=lfs -text
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
*.tar.* filter=lfs diff=lfs merge=lfs -text
*.tar filter=lfs diff=lfs merge=lfs -text
*.tflite filter=lfs diff=lfs merge=lfs -text
*.tgz filter=lfs diff=lfs merge=lfs -text
*.wasm filter=lfs diff=lfs merge=lfs -text
*.xz filter=lfs diff=lfs merge=lfs -text
*.zip filter=lfs diff=lfs merge=lfs -text
*.zst filter=lfs diff=lfs merge=lfs -text
*tfevents* filter=lfs diff=lfs merge=lfs -text
tokenizer.json filter=lfs diff=lfs merge=lfs -text
dotnet-coder-14b-Q8_0.gguf filter=lfs diff=lfs merge=lfs -text
dotnet-coder-14b-Q6_K.gguf filter=lfs diff=lfs merge=lfs -text
dotnet-coder-14b-Q4_K_M.gguf filter=lfs diff=lfs merge=lfs -text
dotnet-coder-14b-Q4_K_S.gguf filter=lfs diff=lfs merge=lfs -text
dotnet-coder-14b-Q3_K_M.gguf filter=lfs diff=lfs merge=lfs -text
dotnet-coder-14b-Q2_K.gguf filter=lfs diff=lfs merge=lfs -text

378
README.md Normal file
View File

@@ -0,0 +1,378 @@
---
license: apache-2.0
base_model: Qwen/Qwen2.5-Coder-14B-Instruct
tags:
- csharp
- dotnet
- code
- fine-tuned
- dpo
- qlora
- coding-assistant
- aspnet
- entity-framework
language:
- en
pipeline_tag: text-generation
library_name: transformers
---
# dotnet-coder-14b
A C#/.NET specialist fine-tuned from Qwen2.5-Coder-14B-Instruct. Achieves 97% compile rate on C# code generation benchmarks — higher than Qwen2.5-Coder-32B (80%) and Qwen2.5-72B (80%) on our evaluation suite.
Designed for coding agents and experienced .NET developers who need compilable, self-contained C# code.
## Quick Specs
| | |
|---|---|
| **Parameters** | 14.7B |
| **Base Model** | Qwen2.5-Coder-14B-Instruct |
| **Max Context** | 32,768 tokens (base model) |
| **Trained Sequence Length** | 2,048 tokens |
| **Training Method** | QLoRA SFT + Iterative DPO |
| **Training Data** | 107K C# records |
| **License** | Apache 2.0 |
| **VRAM (Q4_K_M)** | ~9GB |
## What Makes This Different: Compile-Verified DPO
Most code models are trained on code and hope it works. We verified it.
After SFT training, our model compiled at only 57%. We ran 3 rounds of **iterative DPO using `dotnet build` as the reward signal** — generating code, compiling it, and teaching the model to prefer code that actually compiles:
| Stage | Method | Compile Rate |
|---|---|---|
| Base (Qwen2.5-Coder-14B) | — | 83% |
| After SFT (107K records) | QLoRA | 57% |
| After DPO Round 1 | +126 pairs, beta=0.1 | 73% |
| After DPO Round 2 | +256 pairs, beta=0.2 | 87% |
| **After DPO Round 3** | **+468 pairs, beta=0.3** | **97%** |
The preference signal is binary and objective: the compiler says yes or no. No human labeling, no LLM-as-judge — just `dotnet build`.
## Benchmarks
Evaluated on **120+ unique prompts** across 4 independent test sets (original 30, holdout 30, and two validation sets of 40 each). No test prompts were used during training. All benchmarks are self-reported using our evaluation suite — results may vary with different prompts, inference settings, or SDK versions.
### Compile Rate (code compiles with `dotnet build`)
| Model | Parameters | Compile Rate | Holdout (unseen prompts) |
|---|---|---|---|
| **dotnet-coder-14b** | **14B** | **97%** | **97%** |
| StarCoder2-15B-Instruct | 15B | 83% | — |
| Phi-4-14B | 14B | 83% | — |
| Qwen2.5-Coder-14B-Instruct | 14B | 83% | 93% |
| Qwen2.5-72B-Instruct | 72B | 80% | 80% |
| Qwen2.5-Coder-32B-Instruct | 32B | 80% | 87% |
| Yi-Coder-9B-Chat | 9B | 70% | — |
| Qwen2.5-Coder-7B-Instruct | 7B | 57% | 67% |
| DeepSeek-R1-Distill-Qwen-14B | 14B | 10% | 13% |
All competitor models evaluated using the same 30-prompt test suite, same system prompt, same .NET 8 SDK with identical NuGet packages, and same code extraction pipeline. Competitor models loaded in 4-bit quantization on A100 80GB.
### Multi-SDK Compatibility
Tested the same generated code against three .NET SDK versions:
| .NET Version | Compile Rate |
|---|---|
| .NET 6.0 | 29/30 (97%) |
| .NET 8.0 | 29/30 (97%) |
| .NET 9.0 | 29/30 (97%) |
The single failure across all SDKs is the same prompt — a `??` operator applied to an incompatible type in a value object base class. The model generates SDK-agnostic code that works across .NET 6, 8, and 9.
### Temperature Robustness
Compile rate at different sampling temperatures (30 prompts each):
| Temperature | Compile Rate |
|---|---|
| 0.2 | 29/30 (97%) |
| 0.5 | 29/30 (97%) |
| 0.8 | 29/30 (97%) |
| 1.0 | 26/30 (87%) |
The model maintains 97% compile rate through temperatures 0.2–0.8. Even at maximum randomness (temp=1.0), it still achieves 87%.
### Expert .NET Knowledge
| Model | Parameters | Expert Gotchas (/10) | C# 13/14 Features (/10) |
|---|---|---|---|
| **dotnet-coder-14b** | **14B** | **10** | **10** |
| Qwen2.5-72B-Instruct | 72B | 9 | 10 |
| Qwen2.5-Coder-14B-Instruct | 14B | 8 | 10 |
| Qwen2.5-Coder-32B-Instruct | 32B | 6 | 10 |
| DeepSeek-R1-Distill-Qwen-14B | 14B | 3 | 5 |
Expert gotcha questions test: ConcurrentDictionary.GetOrAdd atomicity, async void crash scenarios, ConfigureAwait deadlocks, HttpClient socket exhaustion, IEnumerable vs IQueryable in EF Core, DI captive dependency, ValueTask consumption rules, N+1 queries, GC generation costs, and middleware pipeline internals.
### Complex Multi-Class Tasks
10 tasks requiring 3-6 interacting classes (CQRS with dispatcher, event sourcing, fluent validation framework, resilience pipeline with circuit breaker, state machines, plugin systems):
- **First try: 70-90%**
- **With retry: 90%+**
## Example Output
**Prompt:** "Write a retry policy with exponential backoff for HttpClient in C#"
```csharp
using System;
using System.Net.Http;
using System.Threading.Tasks;
public class RetryPolicyHttpClient
{
private readonly HttpClient _client = new();
private static readonly Random Random = new();
public async Task<string> GetAsync(string url)
{
int maxRetries = 3;
for (int attempt = 0; attempt < maxRetries; attempt++)
{
try
{
return await _client.GetStringAsync(url);
}
catch (Exception ex) when (attempt < maxRetries - 1 && IsTransient(ex))
{
double delayInSeconds = Math.Pow(2, attempt) + Random.NextDouble();
await Task.Delay(TimeSpan.FromSeconds(delayInSeconds));
}
}
return await _client.GetStringAsync(url);
}
private static bool IsTransient(Exception exception)
{
return exception is HttpRequestException;
}
}
```
No preamble, no "Certainly!", no package install instructions — just correct, compilable code with jitter-based backoff.
### Error Diagnosis
**Prompt:** "I'm getting `error CS0246: The type or namespace name 'ILogger<>' could not be found`. What's wrong?"
> The error message indicates that the compiler cannot find the `ILogger<>` type. This is because the `ILogger<>` interface is part of the Microsoft.Extensions.Logging namespace, which is not included in your code.
>
> Add the using directive: `using Microsoft.Extensions.Logging;`
>
> Make sure you also have the NuGet package installed:
> ```
> Install-Package Microsoft.Extensions.Logging
> ```
### Performance Issue Detection
**Prompt:** "My API endpoint is slow" + code with N+1 query
> The problem is that you're loading all Orders into memory, then for each one making a separate database call to load the related Customer. This is N+1 queries. The solution is to use Include() to eagerly load the related data in a single query:
```csharp
public async Task<List<OrderDto>> GetOrders()
{
return await _context.Orders
.Include(o => o.Customer)
.Select(o => new OrderDto(o.Id, o.Customer.Name, o.Total))
.ToListAsync();
}
```
The model handles both code generation and interactive debugging — it can diagnose errors, suggest fixes, recommend package installations, and identify performance issues like N+1 queries.
## What This Model Is Good At
- Writing complete, compilable C# classes and files
- **Diagnosing build errors** and suggesting fixes with correct NuGet packages
- **Identifying performance issues** like N+1 queries, socket exhaustion, GC pressure
- **Modifying existing code** on request (adding methods, refactoring)
- ASP.NET Core middleware, controllers, and minimal APIs
- Entity Framework Core queries, configurations, and patterns
- Design patterns implemented in idiomatic C#
- Modern C# features (records, primary constructors, collection expressions, pattern matching)
- Explaining C# gotchas and .NET internals
- Self-contained code — defines all types it references
## Recommended Settings
**System prompt** (used during training — best results with this or similar):
> You are an expert C# and .NET developer. Write complete, compilable C# code. Include all necessary using statements and namespace declarations.
**Inference parameters**: temperature=0.2, top_p=0.9, max_new_tokens=2048
The base model supports up to 32,768 tokens, so you can use the full 32K context window. The fine-tuning was done on sequences up to 2,048 tokens — the model performs best within this range but still works beyond it thanks to the base model's capabilities. The model will stop generating when done (EOS token), so setting a higher limit won't cause unnecessary output.
## Usage
### With Transformers
```python
from transformers import AutoModelForCausalLM, AutoTokenizer
import torch
model = AutoModelForCausalLM.from_pretrained(
"zipaltrivedi/dotnet-coder-14b",
torch_dtype=torch.float16,
device_map="auto",
)
tokenizer = AutoTokenizer.from_pretrained("zipaltrivedi/dotnet-coder-14b")
messages = [
{"role": "system", "content": "You are an expert C# and .NET developer. Write complete, compilable C# code."},
{"role": "user", "content": "Write a thread-safe LRU cache with generic key and value types in C#."},
]
text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = tokenizer(text, return_tensors="pt").to(model.device)
output = model.generate(**inputs, max_new_tokens=2048, temperature=0.2, top_p=0.9)
print(tokenizer.decode(output[0][inputs["input_ids"].shape[1]:], skip_special_tokens=True))
```
### With Ollama
Download a GGUF file from the Files tab, then create a `Modelfile`:
```
FROM ./dotnet-coder-14b-Q4_K_M.gguf
SYSTEM "You are an expert C# and .NET developer. Write complete, compilable C# code. Include all necessary using statements and namespace declarations."
PARAMETER temperature 0.2
PARAMETER top_p 0.9
```
Then run:
```bash
ollama create dotnet-coder -f Modelfile
ollama run dotnet-coder
```
### With llama.cpp
```bash
./llama-cli -m dotnet-coder-14b-Q4_K_M.gguf -p "Write a C# class for..." --temp 0.2
```
### With LM Studio / Jan / GPT4All
Download the GGUF file matching your hardware from the Files tab and load it in your preferred UI.
## GGUF Quantizations
| Quantization | Size | Min RAM | Recommended For |
|---|---|---|---|
| Q8_0 | 14.6 GB | 16GB+ | Best quality — RTX 4090, A100, M3 Max 36GB |
| Q6_K | 11.3 GB | 14GB+ | High quality — RTX 4080, M2 Max 32GB |
| **Q4_K_M** | **8.4 GB** | **10GB+** | **Recommended — RTX 3080/4070, M2 Pro 16GB** |
| Q4_K_S | 8.0 GB | 10GB+ | Slightly smaller — M1 Pro 16GB |
| Q3_K_M | 6.8 GB | 8GB+ | Budget GPU, Apple M1/M2 8GB |
| Q2_K | 5.4 GB | 6GB+ | CPU-only inference, minimum viable |
## Training Details
### Dataset (107K records)
| Source | Records | Description |
|---|---|---|
| Expert C# knowledge | 54,443 | Curated Q&A covering gotchas, patterns, best practices, version-specific features |
| Compile-verified repos | 35,736 | Self-contained C# files from 140 GitHub repos, filtered and verified |
| .NET runtime source | 12,352 | Code from dotnet/runtime, aspnetcore, and other core .NET repos |
| Synthetic examples | 4,906 | C# 13/14 features, debugging pairs, code review examples |
### SFT Hyperparameters
- **Method**: QLoRA 4-bit, LoRA rank 64, alpha 128
- **Training**: 2 epochs, lr=2e-4, cosine schedule, 3% warmup, packing enabled
- **Batch**: effective batch size 16 (2 per device x 8 gradient accumulation)
- **Hardware**: RunPod A100 80GB SXM, ~13 hours
- **Cost**: ~$20
### DPO Hyperparameters
- **Rounds**: 3 iterative rounds
- **Pair generation**: Model generates 3-5 responses per prompt at different temperatures, compiled with `dotnet build`, pass=chosen / fail=rejected
- **Training**: beta=0.1→0.2→0.3 (increasing preference strength), lr=5e-5, 1-3 epochs per round
- **Total pairs**: 850 across all rounds
- **Hardware**: Same A100, ~2 hours total
- **Cost**: ~$5
### Evaluation Methodology
All compile tests use actual `dotnet build` with .NET 8 SDK against a project with common NuGet packages (EF Core, ASP.NET Core, Microsoft.Extensions). Pass/fail is binary based on compiler exit code — no manual evaluation or LLM-as-judge.
Tests are run across 4 independent prompt sets totaling 120+ unique prompts. Holdout and validation prompts were never used during any stage of training or DPO pair generation.
## Limitations
- **Optimized for single-file generation** — for multi-project solutions, use as a component alongside an agent framework
- **Best for experienced developers** — gives direct code answers, not step-by-step tutorials
- **English only** — trained on English C# content
- **14B parameter model** — for extremely complex architectural decisions, larger models may provide more nuanced analysis
- **Compile rate is not 100%** — the remaining ~3% failures are typically complex generic dispatch patterns (e.g., CQRS mediator with runtime handler resolution) that produce type constraint errors
- **Compile ≠ correct** — code that compiles is not guaranteed to be logically correct or free of runtime errors. Compilation is a necessary but not sufficient measure of code quality. Always review generated code before production use
## Benchmark Limitations
- All benchmarks are **self-reported** using our custom evaluation suite — not a standardized benchmark like HumanEval or MBPP
- Compile rate is primarily tested against **.NET 8 SDK** with a specific set of NuGet packages. Cross-validation against .NET 6, 8, and 9 shows identical results (97%), but results may differ with other package configurations
- Expert knowledge evaluation involved checking whether responses address the core question with code examples — this has a subjective component
- Sample sizes (30 prompts per test set) are small; results have inherent variance
- No formal analysis of training/test data overlap with the Qwen2.5-Coder base model's pre-training data
- **Metric circularity**: DPO training uses `dotnet build` as the reward signal, and compile rate is measured using the same tool. While the evaluation prompts are completely separate from DPO training prompts, the model is optimized for the same metric it's evaluated on
## Ethical Considerations
- **No safety alignment**: This model has no specific safety training beyond what exists in the Qwen2.5-Coder base model. It may generate code with security vulnerabilities if prompted
- **Bias**: Training data is sourced from public repositories and Q&A sites, which may reflect coding conventions and patterns from specific communities
- **Not a substitute for code review**: Generated code should be reviewed by a developer before use in production
- **Training data provenance**: Training data includes content from StackOverflow (CC-BY-SA 4.0), Microsoft Learn (CC-BY-4.0), The Stack (permissive licenses), and GitHub repos (Apache/MIT). The relationship between CC-BY-SA training data and model output licensing is an open legal question across the LLM industry. Users should be aware of this when using generated code in commercial settings
## Use Cases
- **Coding agent backend** — serve via OpenAI-compatible API for use with OpenCode, Continue, Cursor, Claude Code
- **Local code assistant** — run with Ollama or LM Studio for offline C# development
- **CI/CD code generation** — generate boilerplate, tests, and implementations in automated pipelines
- **Code review** — get expert-level feedback on C# patterns and .NET best practices
## Reproducibility
- **Base model**: `Qwen/Qwen2.5-Coder-14B-Instruct` from HuggingFace
- **Training framework**: Unsloth 2026.4.5 + PEFT + TRL on RunPod A100 80GB
- **Random seed**: 42 (dataset shuffle)
- Training scripts, evaluation code, and LoRA adapter weights available upon request
## License
Apache 2.0 (same as base model Qwen2.5-Coder-14B-Instruct)
## Citation
```bibtex
@misc{dotnet-coder-14b,
author = {Zipal Trivedi},
title = {dotnet-coder-14b: A C#/.NET Specialist Language Model},
year = {2026},
publisher = {HuggingFace},
url = {https://huggingface.co/zipaltrivedi/dotnet-coder-14b}
}
```
## Acknowledgments
- Base model: [Qwen2.5-Coder-14B-Instruct](https://huggingface.co/Qwen/Qwen2.5-Coder-14B-Instruct) by Alibaba
- Training framework: [Unsloth](https://github.com/unslothai/unsloth)
- Training data sources: The Stack (permissive licenses), StackOverflow (CC-BY-SA 4.0), Microsoft Learn (CC-BY-4.0), GitHub repos (Apache/MIT licensed)
## Contact
For issues, questions, or feedback: [HuggingFace Discussions](https://huggingface.co/zipaltrivedi/dotnet-coder-14b/discussions)

54
chat_template.jinja Normal file
View File

@@ -0,0 +1,54 @@
{%- if tools %}
{{- '<|im_start|>system\n' }}
{%- if messages[0]['role'] == 'system' %}
{{- messages[0]['content'] }}
{%- else %}
{{- 'You are Qwen, created by Alibaba Cloud. You are a helpful assistant.' }}
{%- endif %}
{{- "\n\n# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within <tools></tools> XML tags:\n<tools>" }}
{%- for tool in tools %}
{{- "\n" }}
{{- tool | tojson }}
{%- endfor %}
{{- "\n</tools>\n\nFor each function call, return a json object with function name and arguments within <tool_call></tool_call> XML tags:\n<tool_call>\n{\"name\": <function-name>, \"arguments\": <args-json-object>}\n</tool_call><|im_end|>\n" }}
{%- else %}
{%- if messages[0]['role'] == 'system' %}
{{- '<|im_start|>system\n' + messages[0]['content'] + '<|im_end|>\n' }}
{%- else %}
{{- '<|im_start|>system\nYou are Qwen, created by Alibaba Cloud. You are a helpful assistant.<|im_end|>\n' }}
{%- endif %}
{%- endif %}
{%- for message in messages %}
{%- if (message.role == "user") or (message.role == "system" and not loop.first) or (message.role == "assistant" and not message.tool_calls) %}
{{- '<|im_start|>' + message.role + '\n' + message.content + '<|im_end|>' + '\n' }}
{%- elif message.role == "assistant" %}
{{- '<|im_start|>' + message.role }}
{%- if message.content %}
{{- '\n' + message.content }}
{%- endif %}
{%- for tool_call in message.tool_calls %}
{%- if tool_call.function is defined %}
{%- set tool_call = tool_call.function %}
{%- endif %}
{{- '\n<tool_call>\n{"name": "' }}
{{- tool_call.name }}
{{- '", "arguments": ' }}
{{- tool_call.arguments | tojson }}
{{- '}\n</tool_call>' }}
{%- endfor %}
{{- '<|im_end|>\n' }}
{%- elif message.role == "tool" %}
{%- if (loop.index0 == 0) or (messages[loop.index0 - 1].role != "tool") %}
{{- '<|im_start|>user' }}
{%- endif %}
{{- '\n<tool_response>\n' }}
{{- message.content }}
{{- '\n</tool_response>' }}
{%- if loop.last or (messages[loop.index0 + 1].role != "tool") %}
{{- '<|im_end|>\n' }}
{%- endif %}
{%- endif %}
{%- endfor %}
{%- if add_generation_prompt %}
{{- '<|im_start|>assistant\n' }}
{%- endif %}

81
config.json Normal file
View File

@@ -0,0 +1,81 @@
{
"architectures": [
"Qwen2ForCausalLM"
],
"attention_dropout": 0.0,
"bos_token_id": 151643,
"dtype": "float16",
"eos_token_id": 151645,
"hidden_act": "silu",
"hidden_size": 5120,
"initializer_range": 0.02,
"intermediate_size": 13824,
"layer_types": [
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention"
],
"max_position_embeddings": 32768,
"max_window_layers": 48,
"model_type": "qwen2",
"num_attention_heads": 40,
"num_hidden_layers": 48,
"num_key_value_heads": 8,
"pad_token_id": null,
"rms_norm_eps": 1e-06,
"rope_parameters": {
"rope_theta": 1000000.0,
"rope_type": "default"
},
"sliding_window": null,
"tie_word_embeddings": false,
"transformers_version": "5.5.1",
"use_cache": true,
"use_sliding_window": false,
"vocab_size": 152064
}

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:fd5a26e2f3dbc27ac157da24af476c828c35d36055c0bd1578c1236e0fb2dac2
size 5770498016

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:32efb140d9c40086709838da963c3a4364c0f38393db0d2048653ec51e6282d5
size 7339204576

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:202d6d00af3b56fb1de4bc9197cfdcd73bbddb4b3bca7d8456d8141635161e20
size 8988110816

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:34e0a3243f76ef91af566a4f18d6ac0be5bf84ead3b7a3d0f3972b982496e653
size 8573431776

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:c35a2ef64066e4bd23e2ca4309b4132a5af1cad1ed5293a6dc1aa6743f22107e
size 12124684256

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:c99bff1bfba8e291d66c38a07dd50eaecb48810af240fa6a0bdad7b45fd82b80
size 15701598176

14
generation_config.json Normal file
View File

@@ -0,0 +1,14 @@
{
"bos_token_id": 151643,
"do_sample": true,
"eos_token_id": [
151645,
151643
],
"pad_token_id": 151643,
"repetition_penalty": 1.05,
"temperature": 0.7,
"top_k": 20,
"top_p": 0.8,
"transformers_version": "5.5.1"
}

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:b1dc539e8813c01021a103b42e997f8b11a323600d3f266acb94a35fc481b94d
size 3947935624

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:88be59f3c221466694c62da2911b67622da1a5cb391852f920aea37977a23a51
size 3995340408

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:940a2e98fb97199d18197bf435ceac9f9a9ebd57ab28e55ef6b3f2ce7193bca1
size 3979622536

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:6fe843541c773202330c76d20a01083407b9338a97cda4026968483a1f8f35b9
size 3995327992

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:950c2ad9d81cc833b40c33dddb213683fd9859402357b5466efb013189cde597
size 3995327976

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:82a2d927c9e541d8eb3577874ee7a7286ce85d0df271e8de723ef721aafbcdfe
size 3995340496

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:c3080453fadcba0c9cc66f2a78213520e07d0821eca84b698785a0a9518a2905
size 3979622552

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:1852809906a34ecb329aaef3f3970f7b951c8e4f812375bca278f980d32930aa
size 1651615744

View File

@@ -0,0 +1,587 @@
{
"metadata": {
"total_parameters": 14770033664,
"total_size": 29540067328
},
"weight_map": {
"lm_head.weight": "model-00001-of-00008.safetensors",
"model.embed_tokens.weight": "model-00001-of-00008.safetensors",
"model.layers.0.input_layernorm.weight": "model-00001-of-00008.safetensors",
"model.layers.0.mlp.down_proj.weight": "model-00001-of-00008.safetensors",
"model.layers.0.mlp.gate_proj.weight": "model-00001-of-00008.safetensors",
"model.layers.0.mlp.up_proj.weight": "model-00001-of-00008.safetensors",
"model.layers.0.post_attention_layernorm.weight": "model-00001-of-00008.safetensors",
"model.layers.0.self_attn.k_proj.bias": "model-00001-of-00008.safetensors",
"model.layers.0.self_attn.k_proj.weight": "model-00001-of-00008.safetensors",
"model.layers.0.self_attn.o_proj.weight": "model-00001-of-00008.safetensors",
"model.layers.0.self_attn.q_proj.bias": "model-00001-of-00008.safetensors",
"model.layers.0.self_attn.q_proj.weight": "model-00001-of-00008.safetensors",
"model.layers.0.self_attn.v_proj.bias": "model-00001-of-00008.safetensors",
"model.layers.0.self_attn.v_proj.weight": "model-00001-of-00008.safetensors",
"model.layers.1.input_layernorm.weight": "model-00001-of-00008.safetensors",
"model.layers.1.mlp.down_proj.weight": "model-00001-of-00008.safetensors",
"model.layers.1.mlp.gate_proj.weight": "model-00001-of-00008.safetensors",
"model.layers.1.mlp.up_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.1.post_attention_layernorm.weight": "model-00002-of-00008.safetensors",
"model.layers.1.self_attn.k_proj.bias": "model-00002-of-00008.safetensors",
"model.layers.1.self_attn.k_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.1.self_attn.o_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.1.self_attn.q_proj.bias": "model-00002-of-00008.safetensors",
"model.layers.1.self_attn.q_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.1.self_attn.v_proj.bias": "model-00002-of-00008.safetensors",
"model.layers.1.self_attn.v_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.10.input_layernorm.weight": "model-00003-of-00008.safetensors",
"model.layers.10.mlp.down_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.10.mlp.gate_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.10.mlp.up_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.10.post_attention_layernorm.weight": "model-00003-of-00008.safetensors",
"model.layers.10.self_attn.k_proj.bias": "model-00003-of-00008.safetensors",
"model.layers.10.self_attn.k_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.10.self_attn.o_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.10.self_attn.q_proj.bias": "model-00003-of-00008.safetensors",
"model.layers.10.self_attn.q_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.10.self_attn.v_proj.bias": "model-00003-of-00008.safetensors",
"model.layers.10.self_attn.v_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.11.input_layernorm.weight": "model-00003-of-00008.safetensors",
"model.layers.11.mlp.down_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.11.mlp.gate_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.11.mlp.up_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.11.post_attention_layernorm.weight": "model-00003-of-00008.safetensors",
"model.layers.11.self_attn.k_proj.bias": "model-00003-of-00008.safetensors",
"model.layers.11.self_attn.k_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.11.self_attn.o_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.11.self_attn.q_proj.bias": "model-00003-of-00008.safetensors",
"model.layers.11.self_attn.q_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.11.self_attn.v_proj.bias": "model-00003-of-00008.safetensors",
"model.layers.11.self_attn.v_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.12.input_layernorm.weight": "model-00003-of-00008.safetensors",
"model.layers.12.mlp.down_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.12.mlp.gate_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.12.mlp.up_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.12.post_attention_layernorm.weight": "model-00003-of-00008.safetensors",
"model.layers.12.self_attn.k_proj.bias": "model-00003-of-00008.safetensors",
"model.layers.12.self_attn.k_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.12.self_attn.o_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.12.self_attn.q_proj.bias": "model-00003-of-00008.safetensors",
"model.layers.12.self_attn.q_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.12.self_attn.v_proj.bias": "model-00003-of-00008.safetensors",
"model.layers.12.self_attn.v_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.13.input_layernorm.weight": "model-00003-of-00008.safetensors",
"model.layers.13.mlp.down_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.13.mlp.gate_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.13.mlp.up_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.13.post_attention_layernorm.weight": "model-00003-of-00008.safetensors",
"model.layers.13.self_attn.k_proj.bias": "model-00003-of-00008.safetensors",
"model.layers.13.self_attn.k_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.13.self_attn.o_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.13.self_attn.q_proj.bias": "model-00003-of-00008.safetensors",
"model.layers.13.self_attn.q_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.13.self_attn.v_proj.bias": "model-00003-of-00008.safetensors",
"model.layers.13.self_attn.v_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.14.input_layernorm.weight": "model-00003-of-00008.safetensors",
"model.layers.14.mlp.down_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.14.mlp.gate_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.14.mlp.up_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.14.post_attention_layernorm.weight": "model-00003-of-00008.safetensors",
"model.layers.14.self_attn.k_proj.bias": "model-00003-of-00008.safetensors",
"model.layers.14.self_attn.k_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.14.self_attn.o_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.14.self_attn.q_proj.bias": "model-00003-of-00008.safetensors",
"model.layers.14.self_attn.q_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.14.self_attn.v_proj.bias": "model-00003-of-00008.safetensors",
"model.layers.14.self_attn.v_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.15.input_layernorm.weight": "model-00003-of-00008.safetensors",
"model.layers.15.mlp.down_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.15.mlp.gate_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.15.mlp.up_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.15.post_attention_layernorm.weight": "model-00003-of-00008.safetensors",
"model.layers.15.self_attn.k_proj.bias": "model-00003-of-00008.safetensors",
"model.layers.15.self_attn.k_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.15.self_attn.o_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.15.self_attn.q_proj.bias": "model-00003-of-00008.safetensors",
"model.layers.15.self_attn.q_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.15.self_attn.v_proj.bias": "model-00003-of-00008.safetensors",
"model.layers.15.self_attn.v_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.16.input_layernorm.weight": "model-00003-of-00008.safetensors",
"model.layers.16.mlp.down_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.16.mlp.gate_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.16.mlp.up_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.16.post_attention_layernorm.weight": "model-00004-of-00008.safetensors",
"model.layers.16.self_attn.k_proj.bias": "model-00004-of-00008.safetensors",
"model.layers.16.self_attn.k_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.16.self_attn.o_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.16.self_attn.q_proj.bias": "model-00004-of-00008.safetensors",
"model.layers.16.self_attn.q_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.16.self_attn.v_proj.bias": "model-00004-of-00008.safetensors",
"model.layers.16.self_attn.v_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.17.input_layernorm.weight": "model-00004-of-00008.safetensors",
"model.layers.17.mlp.down_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.17.mlp.gate_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.17.mlp.up_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.17.post_attention_layernorm.weight": "model-00004-of-00008.safetensors",
"model.layers.17.self_attn.k_proj.bias": "model-00004-of-00008.safetensors",
"model.layers.17.self_attn.k_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.17.self_attn.o_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.17.self_attn.q_proj.bias": "model-00004-of-00008.safetensors",
"model.layers.17.self_attn.q_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.17.self_attn.v_proj.bias": "model-00004-of-00008.safetensors",
"model.layers.17.self_attn.v_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.18.input_layernorm.weight": "model-00004-of-00008.safetensors",
"model.layers.18.mlp.down_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.18.mlp.gate_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.18.mlp.up_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.18.post_attention_layernorm.weight": "model-00004-of-00008.safetensors",
"model.layers.18.self_attn.k_proj.bias": "model-00004-of-00008.safetensors",
"model.layers.18.self_attn.k_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.18.self_attn.o_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.18.self_attn.q_proj.bias": "model-00004-of-00008.safetensors",
"model.layers.18.self_attn.q_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.18.self_attn.v_proj.bias": "model-00004-of-00008.safetensors",
"model.layers.18.self_attn.v_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.19.input_layernorm.weight": "model-00004-of-00008.safetensors",
"model.layers.19.mlp.down_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.19.mlp.gate_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.19.mlp.up_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.19.post_attention_layernorm.weight": "model-00004-of-00008.safetensors",
"model.layers.19.self_attn.k_proj.bias": "model-00004-of-00008.safetensors",
"model.layers.19.self_attn.k_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.19.self_attn.o_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.19.self_attn.q_proj.bias": "model-00004-of-00008.safetensors",
"model.layers.19.self_attn.q_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.19.self_attn.v_proj.bias": "model-00004-of-00008.safetensors",
"model.layers.19.self_attn.v_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.2.input_layernorm.weight": "model-00002-of-00008.safetensors",
"model.layers.2.mlp.down_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.2.mlp.gate_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.2.mlp.up_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.2.post_attention_layernorm.weight": "model-00002-of-00008.safetensors",
"model.layers.2.self_attn.k_proj.bias": "model-00002-of-00008.safetensors",
"model.layers.2.self_attn.k_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.2.self_attn.o_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.2.self_attn.q_proj.bias": "model-00002-of-00008.safetensors",
"model.layers.2.self_attn.q_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.2.self_attn.v_proj.bias": "model-00002-of-00008.safetensors",
"model.layers.2.self_attn.v_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.20.input_layernorm.weight": "model-00004-of-00008.safetensors",
"model.layers.20.mlp.down_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.20.mlp.gate_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.20.mlp.up_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.20.post_attention_layernorm.weight": "model-00004-of-00008.safetensors",
"model.layers.20.self_attn.k_proj.bias": "model-00004-of-00008.safetensors",
"model.layers.20.self_attn.k_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.20.self_attn.o_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.20.self_attn.q_proj.bias": "model-00004-of-00008.safetensors",
"model.layers.20.self_attn.q_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.20.self_attn.v_proj.bias": "model-00004-of-00008.safetensors",
"model.layers.20.self_attn.v_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.21.input_layernorm.weight": "model-00004-of-00008.safetensors",
"model.layers.21.mlp.down_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.21.mlp.gate_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.21.mlp.up_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.21.post_attention_layernorm.weight": "model-00004-of-00008.safetensors",
"model.layers.21.self_attn.k_proj.bias": "model-00004-of-00008.safetensors",
"model.layers.21.self_attn.k_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.21.self_attn.o_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.21.self_attn.q_proj.bias": "model-00004-of-00008.safetensors",
"model.layers.21.self_attn.q_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.21.self_attn.v_proj.bias": "model-00004-of-00008.safetensors",
"model.layers.21.self_attn.v_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.22.input_layernorm.weight": "model-00004-of-00008.safetensors",
"model.layers.22.mlp.down_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.22.mlp.gate_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.22.mlp.up_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.22.post_attention_layernorm.weight": "model-00004-of-00008.safetensors",
"model.layers.22.self_attn.k_proj.bias": "model-00004-of-00008.safetensors",
"model.layers.22.self_attn.k_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.22.self_attn.o_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.22.self_attn.q_proj.bias": "model-00004-of-00008.safetensors",
"model.layers.22.self_attn.q_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.22.self_attn.v_proj.bias": "model-00004-of-00008.safetensors",
"model.layers.22.self_attn.v_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.23.input_layernorm.weight": "model-00004-of-00008.safetensors",
"model.layers.23.mlp.down_proj.weight": "model-00004-of-00008.safetensors",
"model.layers.23.mlp.gate_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.23.mlp.up_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.23.post_attention_layernorm.weight": "model-00005-of-00008.safetensors",
"model.layers.23.self_attn.k_proj.bias": "model-00005-of-00008.safetensors",
"model.layers.23.self_attn.k_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.23.self_attn.o_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.23.self_attn.q_proj.bias": "model-00005-of-00008.safetensors",
"model.layers.23.self_attn.q_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.23.self_attn.v_proj.bias": "model-00005-of-00008.safetensors",
"model.layers.23.self_attn.v_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.24.input_layernorm.weight": "model-00005-of-00008.safetensors",
"model.layers.24.mlp.down_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.24.mlp.gate_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.24.mlp.up_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.24.post_attention_layernorm.weight": "model-00005-of-00008.safetensors",
"model.layers.24.self_attn.k_proj.bias": "model-00005-of-00008.safetensors",
"model.layers.24.self_attn.k_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.24.self_attn.o_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.24.self_attn.q_proj.bias": "model-00005-of-00008.safetensors",
"model.layers.24.self_attn.q_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.24.self_attn.v_proj.bias": "model-00005-of-00008.safetensors",
"model.layers.24.self_attn.v_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.25.input_layernorm.weight": "model-00005-of-00008.safetensors",
"model.layers.25.mlp.down_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.25.mlp.gate_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.25.mlp.up_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.25.post_attention_layernorm.weight": "model-00005-of-00008.safetensors",
"model.layers.25.self_attn.k_proj.bias": "model-00005-of-00008.safetensors",
"model.layers.25.self_attn.k_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.25.self_attn.o_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.25.self_attn.q_proj.bias": "model-00005-of-00008.safetensors",
"model.layers.25.self_attn.q_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.25.self_attn.v_proj.bias": "model-00005-of-00008.safetensors",
"model.layers.25.self_attn.v_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.26.input_layernorm.weight": "model-00005-of-00008.safetensors",
"model.layers.26.mlp.down_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.26.mlp.gate_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.26.mlp.up_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.26.post_attention_layernorm.weight": "model-00005-of-00008.safetensors",
"model.layers.26.self_attn.k_proj.bias": "model-00005-of-00008.safetensors",
"model.layers.26.self_attn.k_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.26.self_attn.o_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.26.self_attn.q_proj.bias": "model-00005-of-00008.safetensors",
"model.layers.26.self_attn.q_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.26.self_attn.v_proj.bias": "model-00005-of-00008.safetensors",
"model.layers.26.self_attn.v_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.27.input_layernorm.weight": "model-00005-of-00008.safetensors",
"model.layers.27.mlp.down_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.27.mlp.gate_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.27.mlp.up_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.27.post_attention_layernorm.weight": "model-00005-of-00008.safetensors",
"model.layers.27.self_attn.k_proj.bias": "model-00005-of-00008.safetensors",
"model.layers.27.self_attn.k_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.27.self_attn.o_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.27.self_attn.q_proj.bias": "model-00005-of-00008.safetensors",
"model.layers.27.self_attn.q_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.27.self_attn.v_proj.bias": "model-00005-of-00008.safetensors",
"model.layers.27.self_attn.v_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.28.input_layernorm.weight": "model-00005-of-00008.safetensors",
"model.layers.28.mlp.down_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.28.mlp.gate_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.28.mlp.up_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.28.post_attention_layernorm.weight": "model-00005-of-00008.safetensors",
"model.layers.28.self_attn.k_proj.bias": "model-00005-of-00008.safetensors",
"model.layers.28.self_attn.k_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.28.self_attn.o_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.28.self_attn.q_proj.bias": "model-00005-of-00008.safetensors",
"model.layers.28.self_attn.q_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.28.self_attn.v_proj.bias": "model-00005-of-00008.safetensors",
"model.layers.28.self_attn.v_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.29.input_layernorm.weight": "model-00005-of-00008.safetensors",
"model.layers.29.mlp.down_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.29.mlp.gate_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.29.mlp.up_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.29.post_attention_layernorm.weight": "model-00005-of-00008.safetensors",
"model.layers.29.self_attn.k_proj.bias": "model-00005-of-00008.safetensors",
"model.layers.29.self_attn.k_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.29.self_attn.o_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.29.self_attn.q_proj.bias": "model-00005-of-00008.safetensors",
"model.layers.29.self_attn.q_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.29.self_attn.v_proj.bias": "model-00005-of-00008.safetensors",
"model.layers.29.self_attn.v_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.3.input_layernorm.weight": "model-00002-of-00008.safetensors",
"model.layers.3.mlp.down_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.3.mlp.gate_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.3.mlp.up_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.3.post_attention_layernorm.weight": "model-00002-of-00008.safetensors",
"model.layers.3.self_attn.k_proj.bias": "model-00002-of-00008.safetensors",
"model.layers.3.self_attn.k_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.3.self_attn.o_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.3.self_attn.q_proj.bias": "model-00002-of-00008.safetensors",
"model.layers.3.self_attn.q_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.3.self_attn.v_proj.bias": "model-00002-of-00008.safetensors",
"model.layers.3.self_attn.v_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.30.input_layernorm.weight": "model-00005-of-00008.safetensors",
"model.layers.30.mlp.down_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.30.mlp.gate_proj.weight": "model-00005-of-00008.safetensors",
"model.layers.30.mlp.up_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.30.post_attention_layernorm.weight": "model-00006-of-00008.safetensors",
"model.layers.30.self_attn.k_proj.bias": "model-00006-of-00008.safetensors",
"model.layers.30.self_attn.k_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.30.self_attn.o_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.30.self_attn.q_proj.bias": "model-00006-of-00008.safetensors",
"model.layers.30.self_attn.q_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.30.self_attn.v_proj.bias": "model-00006-of-00008.safetensors",
"model.layers.30.self_attn.v_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.31.input_layernorm.weight": "model-00006-of-00008.safetensors",
"model.layers.31.mlp.down_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.31.mlp.gate_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.31.mlp.up_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.31.post_attention_layernorm.weight": "model-00006-of-00008.safetensors",
"model.layers.31.self_attn.k_proj.bias": "model-00006-of-00008.safetensors",
"model.layers.31.self_attn.k_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.31.self_attn.o_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.31.self_attn.q_proj.bias": "model-00006-of-00008.safetensors",
"model.layers.31.self_attn.q_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.31.self_attn.v_proj.bias": "model-00006-of-00008.safetensors",
"model.layers.31.self_attn.v_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.32.input_layernorm.weight": "model-00006-of-00008.safetensors",
"model.layers.32.mlp.down_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.32.mlp.gate_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.32.mlp.up_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.32.post_attention_layernorm.weight": "model-00006-of-00008.safetensors",
"model.layers.32.self_attn.k_proj.bias": "model-00006-of-00008.safetensors",
"model.layers.32.self_attn.k_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.32.self_attn.o_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.32.self_attn.q_proj.bias": "model-00006-of-00008.safetensors",
"model.layers.32.self_attn.q_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.32.self_attn.v_proj.bias": "model-00006-of-00008.safetensors",
"model.layers.32.self_attn.v_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.33.input_layernorm.weight": "model-00006-of-00008.safetensors",
"model.layers.33.mlp.down_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.33.mlp.gate_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.33.mlp.up_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.33.post_attention_layernorm.weight": "model-00006-of-00008.safetensors",
"model.layers.33.self_attn.k_proj.bias": "model-00006-of-00008.safetensors",
"model.layers.33.self_attn.k_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.33.self_attn.o_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.33.self_attn.q_proj.bias": "model-00006-of-00008.safetensors",
"model.layers.33.self_attn.q_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.33.self_attn.v_proj.bias": "model-00006-of-00008.safetensors",
"model.layers.33.self_attn.v_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.34.input_layernorm.weight": "model-00006-of-00008.safetensors",
"model.layers.34.mlp.down_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.34.mlp.gate_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.34.mlp.up_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.34.post_attention_layernorm.weight": "model-00006-of-00008.safetensors",
"model.layers.34.self_attn.k_proj.bias": "model-00006-of-00008.safetensors",
"model.layers.34.self_attn.k_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.34.self_attn.o_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.34.self_attn.q_proj.bias": "model-00006-of-00008.safetensors",
"model.layers.34.self_attn.q_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.34.self_attn.v_proj.bias": "model-00006-of-00008.safetensors",
"model.layers.34.self_attn.v_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.35.input_layernorm.weight": "model-00006-of-00008.safetensors",
"model.layers.35.mlp.down_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.35.mlp.gate_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.35.mlp.up_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.35.post_attention_layernorm.weight": "model-00006-of-00008.safetensors",
"model.layers.35.self_attn.k_proj.bias": "model-00006-of-00008.safetensors",
"model.layers.35.self_attn.k_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.35.self_attn.o_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.35.self_attn.q_proj.bias": "model-00006-of-00008.safetensors",
"model.layers.35.self_attn.q_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.35.self_attn.v_proj.bias": "model-00006-of-00008.safetensors",
"model.layers.35.self_attn.v_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.36.input_layernorm.weight": "model-00006-of-00008.safetensors",
"model.layers.36.mlp.down_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.36.mlp.gate_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.36.mlp.up_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.36.post_attention_layernorm.weight": "model-00006-of-00008.safetensors",
"model.layers.36.self_attn.k_proj.bias": "model-00006-of-00008.safetensors",
"model.layers.36.self_attn.k_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.36.self_attn.o_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.36.self_attn.q_proj.bias": "model-00006-of-00008.safetensors",
"model.layers.36.self_attn.q_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.36.self_attn.v_proj.bias": "model-00006-of-00008.safetensors",
"model.layers.36.self_attn.v_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.37.input_layernorm.weight": "model-00006-of-00008.safetensors",
"model.layers.37.mlp.down_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.37.mlp.gate_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.37.mlp.up_proj.weight": "model-00006-of-00008.safetensors",
"model.layers.37.post_attention_layernorm.weight": "model-00006-of-00008.safetensors",
"model.layers.37.self_attn.k_proj.bias": "model-00006-of-00008.safetensors",
"model.layers.37.self_attn.k_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.37.self_attn.o_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.37.self_attn.q_proj.bias": "model-00007-of-00008.safetensors",
"model.layers.37.self_attn.q_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.37.self_attn.v_proj.bias": "model-00007-of-00008.safetensors",
"model.layers.37.self_attn.v_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.38.input_layernorm.weight": "model-00007-of-00008.safetensors",
"model.layers.38.mlp.down_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.38.mlp.gate_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.38.mlp.up_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.38.post_attention_layernorm.weight": "model-00007-of-00008.safetensors",
"model.layers.38.self_attn.k_proj.bias": "model-00007-of-00008.safetensors",
"model.layers.38.self_attn.k_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.38.self_attn.o_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.38.self_attn.q_proj.bias": "model-00007-of-00008.safetensors",
"model.layers.38.self_attn.q_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.38.self_attn.v_proj.bias": "model-00007-of-00008.safetensors",
"model.layers.38.self_attn.v_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.39.input_layernorm.weight": "model-00007-of-00008.safetensors",
"model.layers.39.mlp.down_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.39.mlp.gate_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.39.mlp.up_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.39.post_attention_layernorm.weight": "model-00007-of-00008.safetensors",
"model.layers.39.self_attn.k_proj.bias": "model-00007-of-00008.safetensors",
"model.layers.39.self_attn.k_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.39.self_attn.o_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.39.self_attn.q_proj.bias": "model-00007-of-00008.safetensors",
"model.layers.39.self_attn.q_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.39.self_attn.v_proj.bias": "model-00007-of-00008.safetensors",
"model.layers.39.self_attn.v_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.4.input_layernorm.weight": "model-00002-of-00008.safetensors",
"model.layers.4.mlp.down_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.4.mlp.gate_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.4.mlp.up_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.4.post_attention_layernorm.weight": "model-00002-of-00008.safetensors",
"model.layers.4.self_attn.k_proj.bias": "model-00002-of-00008.safetensors",
"model.layers.4.self_attn.k_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.4.self_attn.o_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.4.self_attn.q_proj.bias": "model-00002-of-00008.safetensors",
"model.layers.4.self_attn.q_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.4.self_attn.v_proj.bias": "model-00002-of-00008.safetensors",
"model.layers.4.self_attn.v_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.40.input_layernorm.weight": "model-00007-of-00008.safetensors",
"model.layers.40.mlp.down_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.40.mlp.gate_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.40.mlp.up_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.40.post_attention_layernorm.weight": "model-00007-of-00008.safetensors",
"model.layers.40.self_attn.k_proj.bias": "model-00007-of-00008.safetensors",
"model.layers.40.self_attn.k_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.40.self_attn.o_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.40.self_attn.q_proj.bias": "model-00007-of-00008.safetensors",
"model.layers.40.self_attn.q_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.40.self_attn.v_proj.bias": "model-00007-of-00008.safetensors",
"model.layers.40.self_attn.v_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.41.input_layernorm.weight": "model-00007-of-00008.safetensors",
"model.layers.41.mlp.down_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.41.mlp.gate_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.41.mlp.up_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.41.post_attention_layernorm.weight": "model-00007-of-00008.safetensors",
"model.layers.41.self_attn.k_proj.bias": "model-00007-of-00008.safetensors",
"model.layers.41.self_attn.k_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.41.self_attn.o_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.41.self_attn.q_proj.bias": "model-00007-of-00008.safetensors",
"model.layers.41.self_attn.q_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.41.self_attn.v_proj.bias": "model-00007-of-00008.safetensors",
"model.layers.41.self_attn.v_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.42.input_layernorm.weight": "model-00007-of-00008.safetensors",
"model.layers.42.mlp.down_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.42.mlp.gate_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.42.mlp.up_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.42.post_attention_layernorm.weight": "model-00007-of-00008.safetensors",
"model.layers.42.self_attn.k_proj.bias": "model-00007-of-00008.safetensors",
"model.layers.42.self_attn.k_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.42.self_attn.o_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.42.self_attn.q_proj.bias": "model-00007-of-00008.safetensors",
"model.layers.42.self_attn.q_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.42.self_attn.v_proj.bias": "model-00007-of-00008.safetensors",
"model.layers.42.self_attn.v_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.43.input_layernorm.weight": "model-00007-of-00008.safetensors",
"model.layers.43.mlp.down_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.43.mlp.gate_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.43.mlp.up_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.43.post_attention_layernorm.weight": "model-00007-of-00008.safetensors",
"model.layers.43.self_attn.k_proj.bias": "model-00007-of-00008.safetensors",
"model.layers.43.self_attn.k_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.43.self_attn.o_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.43.self_attn.q_proj.bias": "model-00007-of-00008.safetensors",
"model.layers.43.self_attn.q_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.43.self_attn.v_proj.bias": "model-00007-of-00008.safetensors",
"model.layers.43.self_attn.v_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.44.input_layernorm.weight": "model-00007-of-00008.safetensors",
"model.layers.44.mlp.down_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.44.mlp.gate_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.44.mlp.up_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.44.post_attention_layernorm.weight": "model-00007-of-00008.safetensors",
"model.layers.44.self_attn.k_proj.bias": "model-00007-of-00008.safetensors",
"model.layers.44.self_attn.k_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.44.self_attn.o_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.44.self_attn.q_proj.bias": "model-00007-of-00008.safetensors",
"model.layers.44.self_attn.q_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.44.self_attn.v_proj.bias": "model-00007-of-00008.safetensors",
"model.layers.44.self_attn.v_proj.weight": "model-00007-of-00008.safetensors",
"model.layers.45.input_layernorm.weight": "model-00007-of-00008.safetensors",
"model.layers.45.mlp.down_proj.weight": "model-00008-of-00008.safetensors",
"model.layers.45.mlp.gate_proj.weight": "model-00008-of-00008.safetensors",
"model.layers.45.mlp.up_proj.weight": "model-00008-of-00008.safetensors",
"model.layers.45.post_attention_layernorm.weight": "model-00008-of-00008.safetensors",
"model.layers.45.self_attn.k_proj.bias": "model-00008-of-00008.safetensors",
"model.layers.45.self_attn.k_proj.weight": "model-00008-of-00008.safetensors",
"model.layers.45.self_attn.o_proj.weight": "model-00008-of-00008.safetensors",
"model.layers.45.self_attn.q_proj.bias": "model-00008-of-00008.safetensors",
"model.layers.45.self_attn.q_proj.weight": "model-00008-of-00008.safetensors",
"model.layers.45.self_attn.v_proj.bias": "model-00008-of-00008.safetensors",
"model.layers.45.self_attn.v_proj.weight": "model-00008-of-00008.safetensors",
"model.layers.46.input_layernorm.weight": "model-00008-of-00008.safetensors",
"model.layers.46.mlp.down_proj.weight": "model-00008-of-00008.safetensors",
"model.layers.46.mlp.gate_proj.weight": "model-00008-of-00008.safetensors",
"model.layers.46.mlp.up_proj.weight": "model-00008-of-00008.safetensors",
"model.layers.46.post_attention_layernorm.weight": "model-00008-of-00008.safetensors",
"model.layers.46.self_attn.k_proj.bias": "model-00008-of-00008.safetensors",
"model.layers.46.self_attn.k_proj.weight": "model-00008-of-00008.safetensors",
"model.layers.46.self_attn.o_proj.weight": "model-00008-of-00008.safetensors",
"model.layers.46.self_attn.q_proj.bias": "model-00008-of-00008.safetensors",
"model.layers.46.self_attn.q_proj.weight": "model-00008-of-00008.safetensors",
"model.layers.46.self_attn.v_proj.bias": "model-00008-of-00008.safetensors",
"model.layers.46.self_attn.v_proj.weight": "model-00008-of-00008.safetensors",
"model.layers.47.input_layernorm.weight": "model-00008-of-00008.safetensors",
"model.layers.47.mlp.down_proj.weight": "model-00008-of-00008.safetensors",
"model.layers.47.mlp.gate_proj.weight": "model-00008-of-00008.safetensors",
"model.layers.47.mlp.up_proj.weight": "model-00008-of-00008.safetensors",
"model.layers.47.post_attention_layernorm.weight": "model-00008-of-00008.safetensors",
"model.layers.47.self_attn.k_proj.bias": "model-00008-of-00008.safetensors",
"model.layers.47.self_attn.k_proj.weight": "model-00008-of-00008.safetensors",
"model.layers.47.self_attn.o_proj.weight": "model-00008-of-00008.safetensors",
"model.layers.47.self_attn.q_proj.bias": "model-00008-of-00008.safetensors",
"model.layers.47.self_attn.q_proj.weight": "model-00008-of-00008.safetensors",
"model.layers.47.self_attn.v_proj.bias": "model-00008-of-00008.safetensors",
"model.layers.47.self_attn.v_proj.weight": "model-00008-of-00008.safetensors",
"model.layers.5.input_layernorm.weight": "model-00002-of-00008.safetensors",
"model.layers.5.mlp.down_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.5.mlp.gate_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.5.mlp.up_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.5.post_attention_layernorm.weight": "model-00002-of-00008.safetensors",
"model.layers.5.self_attn.k_proj.bias": "model-00002-of-00008.safetensors",
"model.layers.5.self_attn.k_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.5.self_attn.o_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.5.self_attn.q_proj.bias": "model-00002-of-00008.safetensors",
"model.layers.5.self_attn.q_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.5.self_attn.v_proj.bias": "model-00002-of-00008.safetensors",
"model.layers.5.self_attn.v_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.6.input_layernorm.weight": "model-00002-of-00008.safetensors",
"model.layers.6.mlp.down_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.6.mlp.gate_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.6.mlp.up_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.6.post_attention_layernorm.weight": "model-00002-of-00008.safetensors",
"model.layers.6.self_attn.k_proj.bias": "model-00002-of-00008.safetensors",
"model.layers.6.self_attn.k_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.6.self_attn.o_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.6.self_attn.q_proj.bias": "model-00002-of-00008.safetensors",
"model.layers.6.self_attn.q_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.6.self_attn.v_proj.bias": "model-00002-of-00008.safetensors",
"model.layers.6.self_attn.v_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.7.input_layernorm.weight": "model-00002-of-00008.safetensors",
"model.layers.7.mlp.down_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.7.mlp.gate_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.7.mlp.up_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.7.post_attention_layernorm.weight": "model-00002-of-00008.safetensors",
"model.layers.7.self_attn.k_proj.bias": "model-00002-of-00008.safetensors",
"model.layers.7.self_attn.k_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.7.self_attn.o_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.7.self_attn.q_proj.bias": "model-00002-of-00008.safetensors",
"model.layers.7.self_attn.q_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.7.self_attn.v_proj.bias": "model-00002-of-00008.safetensors",
"model.layers.7.self_attn.v_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.8.input_layernorm.weight": "model-00002-of-00008.safetensors",
"model.layers.8.mlp.down_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.8.mlp.gate_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.8.mlp.up_proj.weight": "model-00002-of-00008.safetensors",
"model.layers.8.post_attention_layernorm.weight": "model-00002-of-00008.safetensors",
"model.layers.8.self_attn.k_proj.bias": "model-00002-of-00008.safetensors",
"model.layers.8.self_attn.k_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.8.self_attn.o_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.8.self_attn.q_proj.bias": "model-00003-of-00008.safetensors",
"model.layers.8.self_attn.q_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.8.self_attn.v_proj.bias": "model-00003-of-00008.safetensors",
"model.layers.8.self_attn.v_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.9.input_layernorm.weight": "model-00003-of-00008.safetensors",
"model.layers.9.mlp.down_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.9.mlp.gate_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.9.mlp.up_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.9.post_attention_layernorm.weight": "model-00003-of-00008.safetensors",
"model.layers.9.self_attn.k_proj.bias": "model-00003-of-00008.safetensors",
"model.layers.9.self_attn.k_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.9.self_attn.o_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.9.self_attn.q_proj.bias": "model-00003-of-00008.safetensors",
"model.layers.9.self_attn.q_proj.weight": "model-00003-of-00008.safetensors",
"model.layers.9.self_attn.v_proj.bias": "model-00003-of-00008.safetensors",
"model.layers.9.self_attn.v_proj.weight": "model-00003-of-00008.safetensors",
"model.norm.weight": "model-00008-of-00008.safetensors"
}
}

3
tokenizer.json Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:3fd169731d2cbde95e10bf356d66d5997fd885dd8dbb6fb4684da3f23b2585d8
size 11421892

29
tokenizer_config.json Normal file
View File

@@ -0,0 +1,29 @@
{
"add_prefix_space": false,
"backend": "tokenizers",
"bos_token": null,
"clean_up_tokenization_spaces": false,
"eos_token": "<|im_end|>",
"errors": "replace",
"extra_special_tokens": [
"<|im_start|>",
"<|im_end|>",
"<|object_ref_start|>",
"<|object_ref_end|>",
"<|box_start|>",
"<|box_end|>",
"<|quad_start|>",
"<|quad_end|>",
"<|vision_start|>",
"<|vision_end|>",
"<|vision_pad|>",
"<|image_pad|>",
"<|video_pad|>"
],
"is_local": false,
"model_max_length": 32768,
"pad_token": "<|endoftext|>",
"split_special_tokens": false,
"tokenizer_class": "Qwen2Tokenizer",
"unk_token": null
}