初始化项目,由ModelHub XC社区提供模型

Model: meituan/EvoCUA-8B-20260105
Source: Original Platform
This commit is contained in:
ModelHub XC
2026-09-26 14:50:13 +08:00
commit 95a9f04dbd
23 changed files with 1891 additions and 0 deletions

59
.gitattributes vendored Normal file
View File

@@ -0,0 +1,59 @@
*.7z filter=lfs diff=lfs merge=lfs -text
*.arrow filter=lfs diff=lfs merge=lfs -text
*.bin filter=lfs diff=lfs merge=lfs -text
*.bin.* filter=lfs diff=lfs merge=lfs -text
*.bz2 filter=lfs diff=lfs merge=lfs -text
*.ftz filter=lfs diff=lfs merge=lfs -text
*.gz filter=lfs diff=lfs merge=lfs -text
*.h5 filter=lfs diff=lfs merge=lfs -text
*.joblib filter=lfs diff=lfs merge=lfs -text
*.lfs.* filter=lfs diff=lfs merge=lfs -text
*.model filter=lfs diff=lfs merge=lfs -text
*.msgpack filter=lfs diff=lfs merge=lfs -text
*.onnx filter=lfs diff=lfs merge=lfs -text
*.ot filter=lfs diff=lfs merge=lfs -text
*.parquet filter=lfs diff=lfs merge=lfs -text
*.pb filter=lfs diff=lfs merge=lfs -text
*.pt filter=lfs diff=lfs merge=lfs -text
*.pth filter=lfs diff=lfs merge=lfs -text
*.rar filter=lfs diff=lfs merge=lfs -text
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
*.tar.* filter=lfs diff=lfs merge=lfs -text
*.tflite filter=lfs diff=lfs merge=lfs -text
*.tgz filter=lfs diff=lfs merge=lfs -text
*.xz filter=lfs diff=lfs merge=lfs -text
*.zip filter=lfs diff=lfs merge=lfs -text
*.zstandard filter=lfs diff=lfs merge=lfs -text
*.tfevents* filter=lfs diff=lfs merge=lfs -text
*.db* filter=lfs diff=lfs merge=lfs -text
*.ark* filter=lfs diff=lfs merge=lfs -text
**/*ckpt*data* filter=lfs diff=lfs merge=lfs -text
**/*ckpt*.meta filter=lfs diff=lfs merge=lfs -text
**/*ckpt*.index filter=lfs diff=lfs merge=lfs -text
*.ckpt filter=lfs diff=lfs merge=lfs -text
*.gguf* filter=lfs diff=lfs merge=lfs -text
*.ggml filter=lfs diff=lfs merge=lfs -text
*.llamafile* filter=lfs diff=lfs merge=lfs -text
*.pt2 filter=lfs diff=lfs merge=lfs -text
*.mlmodel filter=lfs diff=lfs merge=lfs -text
*.npy filter=lfs diff=lfs merge=lfs -text
*.npz filter=lfs diff=lfs merge=lfs -text
*.pickle filter=lfs diff=lfs merge=lfs -text
*.pkl filter=lfs diff=lfs merge=lfs -text
*.tar filter=lfs diff=lfs merge=lfs -text
*.wasm filter=lfs diff=lfs merge=lfs -text
*.zst filter=lfs diff=lfs merge=lfs -text
*tfevents* filter=lfs diff=lfs merge=lfs -text
vocab.json filter=lfs diff=lfs merge=lfs -text
model-00002-of-00004.safetensors filter=lfs diff=lfs merge=lfs -text
merges.txt filter=lfs diff=lfs merge=lfs -text
model-00001-of-00004.safetensors filter=lfs diff=lfs merge=lfs -text
tokenizer.json filter=lfs diff=lfs merge=lfs -text
model-00004-of-00004.safetensors filter=lfs diff=lfs merge=lfs -text
model-00003-of-00004.safetensors filter=lfs diff=lfs merge=lfs -text
tech_report.pdf filter=lfs diff=lfs merge=lfs -text
assets/images/animation_show_case.gif filter=lfs diff=lfs merge=lfs -text

250
README.md Normal file
View File

@@ -0,0 +1,250 @@
---
license: apache-2.0
language:
- en
- zh
tags:
- computer-use
- gui-agent
- osworld
- multimodal
---
<div align="center">
# EvoCUA: Evolving Computer Use Agent
**🥇 #1 Open-Source Model on OSWorld | A General-Purpose Multimodal Model Excelling at Computer Use**
[![Model](https://img.shields.io/badge/🤗%20HuggingFace-EvoCUA--32B-blue)](https://huggingface.co/meituan/EvoCUA-32B-20260105)
[![Model](https://img.shields.io/badge/🤗%20HuggingFace-EvoCUA--8B-blue)](https://huggingface.co/meituan/EvoCUA-8B-20260105)
[![OSWorld Score](https://img.shields.io/badge/OSWorld-56.7%25-brightgreen)](https://os-world.github.io/)
[![License](https://img.shields.io/badge/License-Apache%202.0-orange)](./LICENSE)
[English](./README.md) | [中文](./README_CN.md)
<img src="assets/images/osworld_leaderboard.png" width="700" alt="OSWorld Leaderboard">
**🥇 #1 Open-Source Model on OSWorld Leaderboard (Jan 2026)**
</div>
---
## 📢 Updates
- **2026.03.31**: EvoCUA-32B achieves **56.48%** on WindowsAgentArena (WAA), surpassing the base model Qwen3-VL-32B-Thinking (42.9%) by ~13.6 points and UI-TARS-2 (50.6%) by ~6 points — demonstrating strong zero-shot cross-OS generalization 🆕
- **2026.03.31**: Independent safety study by Yoshua Bengio & Dawn Song's teams ([arXiv:2602.08235](https://arxiv.org/abs/2602.08235)) shows **EvoCUA-32B has the lowest unintended-behavior rate (35.0%)** among all tested CUAs — the safest agent! 🆕
- **2026.01.23**: EvoCUA ranked **#1** on [Hugging Face Daily Papers](https://huggingface.co/papers/2601.15876) 🏆
- **2026.01.22**: Released [EvoCUA Technical Report](./tech_report.pdf) 📄
- **2026.01.13**: Released [EvoCUA-8B-20260105](https://huggingface.co/meituan/EvoCUA-8B-20260105) — achieves **46.1%** on OSWorld, **competitive with 72B-level models using fewer parameters!**
- **2026.01.05**: Released [EvoCUA-32B-20260105](https://huggingface.co/meituan/EvoCUA-32B-20260105) with **56.7%** on OSWorld, achieving **#1** among open-source models 🥇
---
## 🌟 Highlights
- 🥇 **#1 Open-Source Model on OSWorld**: Achieves **56.7%** task completion rate, **#1 among all open-source models**
- 📈 **Significant Improvements**: +11.7% over OpenCUA-72B (45.0%→56.7%), +15.1% over Qwen3-VL thinking (41.6%→56.7%), with fewer parameters and half the steps
- 🖥️ **End-to-End Multi-Turn Automation**: Operates Chrome, Excel, PowerPoint, VSCode and more through screenshots and natural language instructions
- 🧠 **Novel Training Method**: Our data synthesis and training approach consistently improves Computer Use capability across multiple open-source VLMs without degrading general performance
---
## 📊 Performance Comparison
| Rank | Model | Open/Closed | Type | Max Steps | Score |
|------|-------|-------------|------|-----------|-------|
| 1 | Claude-sonnet-4-5 | 🔒 Closed | General | 100 | 62.9% |
| 2 | Seed-1.8 | 🔒 Closed | General | 100 | 61.9% |
| 3 | Claude-sonnet-4-5 | 🔒 Closed | General | 50 | 58.1% |
| **4** | **EvoCUA-20260105 (Ours)** | **🟢 Open** | **General** | **50** | **56.7% 🥇** |
| 5 | DeepMiner-Mano-72B | 🔒 Closed | Specialized | 100 | 53.9% |
| 6 | UI-TARS-2-2509 | 🔒 Closed | General | 100 | 53.1% |
| 7 | EvoCUA (Previous Version) | 🔒 Closed | General | 50 | 50.3% |
| **8** | **EvoCUA-8B-20260105 (Ours)** | **🟢 Open** | **General** | **50** | **46.1%** |
| 9 | OpenCUA-72B | 🟢 Open | Specialized | 100 | 45.0% |
| ... | ... | ... | ... | ... | ... |
| 13 | Qwen3-VL-Flash | 🔒 Closed | General | 100 | 41.6% |
> EvoCUA is **#1 among all open-source models**, achieving competitive results with only **50 steps**. Human-level performance remains significantly higher, indicating substantial room for improvement.
### Zero-shot Cross-OS Control (WindowsAgentArena)
We evaluated EvoCUA on [WindowsAgentArena (WAA)](https://microsoft.github.io/WindowsAgentArena/) to test generalization from the Linux-based training environment to a wholly different OS platform. As shown below, EvoCUA-32B reaches **56.48%**, surpassing the base model Qwen3-VL-32B-Thinking (42.9%) by ~13.6 points and the leading frontier GUI agent UI-TARS-2 (50.6%) by nearly **6 points**.
| Model | WAA |
|-------|-----|
| Qwen3-VL-32B-Instruct | 30.9% [1] |
| Qwen3-VL-32B-Thinking (Base) | 42.9% [1] |
| UI-TARS-2 | 50.6% [2] |
| **EvoCUA-32B (Ours)** | **56.48%** |
> [1] Bai et al., *Qwen3-VL Technical Report* (arXiv:2511.21631, 2025).
> [2] Wang et al., *UI-TARS-2 Technical Report* (arXiv:2509.02544, 2025).
### Safety — Robustness to Unintended Behaviors
A recent study by [Jones et al. (2026)](https://arxiv.org/abs/2602.08235) from Yoshua Bengio and Dawn Song's teams systematically evaluated the safety of leading CUAs. They transferred 117 human-verified perturbations (benign but tricky instructions) to multiple target agents, executing each instruction 3 times and reporting the percentage that elicits unintended behavior in ≥ 1 run. **EvoCUA-32B achieves the lowest overall rate (35.0%)**, demonstrating the strongest robustness among all tested CUAs.
<details>
<summary><b>Transferability Study Results (Table 2 from the paper)</b></summary>
| Target Agent | Claude 4.5 Haiku | Claude 4.5 Opus | Overall |
|---|---|---|---|
| **Open-Source CUAs** | | | |
| EvoCUA-8B | 20.0 | 50.7 | 37.6 |
| **EvoCUA-32B (Ours)** | **24.0** | **43.3** | **35.0 🥇** |
| OpenCUA-7B | 42.0 | 50.7 | 47.0 |
| OpenCUA-32B | 42.0 | 44.8 | 43.6 |
| OpenCUA-72B | 50.0 | 56.7 | 53.8 |
| **Closed-Source CUAs** | | | |
| Claude 4.5 Sonnet | 32.0 | 47.8 | 41.0 |
| Operator | 38.0 | 56.7 | 48.7 |
> *Lower is safer.* EvoCUA-32B has the lowest overall unintended-behavior rate among all tested agents.
</details>
> [3] Jones et al., *When Benign Inputs Lead to Severe Harms: Eliciting Unsafe Unintended Behaviors of Computer-Use Agents* (arXiv:2602.08235, 2026).
---
## 🚀 Quick Start
### Installation
Python 3.12 is recommended.
```bash
git clone https://github.com/meituan/EvoCUA.git
cd EvoCUA
python3 -m venv .venv
source .venv/bin/activate
pip install -r requirements.txt
```
### Model Download & Deployment
EvoCUA requires downloading the model weights from HuggingFace and deploying with **vLLM** as an OpenAI-compatible inference server.
Recommended versions:
- torch: 2.8.0+cu126
- transformers: 4.57.3
- vllm: 0.11.0
```bash
# 1) Download model weights
huggingface-cli download meituan/EvoCUA-32B-20260105 \
--local-dir /path/to/EvoCUA-32B \
--local-dir-use-symlinks False
# 2) Launch vLLM serving (recommend separate environment)
vllm serve /path/to/EvoCUA-32B \
--served-model-name EvoCUA \
--host 0.0.0.0 \
--port 8080 \
--tensor-parallel-size 2
# 3) Set environment variables
# Environment variables can be configured in .env file (see env.template for reference):
cp env.template .env
# Edit .env with your configurations, e.g.,
export OPENAI_API_KEY="dummy"
export OPENAI_BASE_URL="http://127.0.0.1:8080/v1"
```
### Run Evaluation on OSWorld
```bash
python3 run_multienv_evocua.py \
--headless \
--provider_name aws \
--observation_type screenshot \
--model EvoCUA-S2 \
--result_dir ./evocua_results \
--test_all_meta_path evaluation_examples/test_nogdrive.json \
--max_steps 50 \
--num_envs 30 \
--temperature 0.01 \
--max_history_turns 4 \
--coordinate_type relative \
--resize_factor 32 \
--prompt_style S2
```
---
## 📁 Project Structure
```
EvoCUA/
├── run_multienv_evocua.py # Main entry point (multi-env parallel evaluation)
├── lib_run_single.py # Single task rollout logic (trajectory, screenshots, recording, scoring)
├── lib_results_logger.py # Real-time result aggregation to results.json
├── desktop_env/ # OSWorld environment implementation
│ ├── providers/ # VM providers (AWS/VMware/Docker/etc.)
│ ├── controllers/ # Environment controllers
│ └── evaluators/ # Task evaluators
├── mm_agents/
│ └── evocua/ # EvoCUA agent (prompts, parsing, action generation)
└── evaluation_examples/ # OSWorld task configurations
```
---
## 📖 About OSWorld
[OSWorld](https://os-world.github.io/) is the most influential benchmark in the Computer Use Agent domain. It is adopted by leading AI organizations including **OpenAI, Anthropic, ByteDance Seed, Moonshot AI, Zhipu AI, Step**, and more. OSWorld evaluates agents' ability to complete real-world computer tasks through multi-turn interactions with actual desktop environments.
---
## 🔗 Resources
- 🤗 **Model Weights**:
- [meituan/EvoCUA-32B-20260105](https://huggingface.co/meituan/EvoCUA-32B-20260105) - OSWorld Score: **56.7%** 🥇
- [meituan/EvoCUA-8B-20260105](https://huggingface.co/meituan/EvoCUA-8B-20260105) - OSWorld Score: **46.06%** 🆕
- 📊 **OSWorld Benchmark**: [os-world.github.io](https://os-world.github.io/)
- 📄 **Technical Report**: [tech_report.pdf](./tech_report.pdf)
- 🚀 **More Model Sizes**: More models of various sizes are on the way!
---
## 🙏 Acknowledgements
We sincerely thank the open-source community for their outstanding contributions to the Computer Use Agent field. We are grateful to **Xinyuan Wang** ([OpenCUA](https://github.com/xlang-ai/OpenCUA)) and **Tianbao Xie** ([OSWorld](https://github.com/xlang-ai/OSWorld)) for their insightful discussions, valuable feedback on evaluation, and continuous support throughout this project. Their pioneering work has greatly inspired and advanced our research. We are committed to giving back to the community and will continue to open-source our research to advance the field.
---
## 📝 Citation
If you find EvoCUA useful in your research, please consider citing:
```bibtex
@article{xue2026evocua,
title={EvoCUA: Evolving Computer Use Agents via Learning from Scalable Synthetic Experience},
author={Xue, Taofeng and Peng, Chong and Huang, Mianqiu and Guo, Linsen and Han, Tiancheng and Wang, Haozhe and Wang, Jianing and Zhang, Xiaocheng and Yang, Xin and Zhao, Dengchang and others},
journal={arXiv preprint arXiv:2601.15876},
year={2026}
}
```
---
## 📜 License
This project is licensed under the Apache 2.0 License - see the [LICENSE](./LICENSE) file for details.
---
## 📈 Star Growth
[![Star History Chart](https://api.star-history.com/svg?repos=meituan/EvoCUA&type=Date)](https://star-history.com/#meituan/EvoCUA&Date)
---
<div align="center">
**Built with ❤️ by Meituan LongCat Team**
</div>

245
README_CN.md Normal file
View File

@@ -0,0 +1,245 @@
<div align="center">
# EvoCUA: Evolving Computer Use Agent
**🥇 OSWorld 开源模型 No.1 | 擅长计算机操作的通用多模态大模型**
[![Model](https://img.shields.io/badge/🤗%20HuggingFace-EvoCUA--32B-blue)](https://huggingface.co/meituan/EvoCUA-32B-20260105)
[![Model](https://img.shields.io/badge/🤗%20HuggingFace-EvoCUA--8B-blue)](https://huggingface.co/meituan/EvoCUA-8B-20260105)
[![OSWorld Score](https://img.shields.io/badge/OSWorld-56.7%25-brightgreen)](https://os-world.github.io/)
[![License](https://img.shields.io/badge/License-Apache%202.0-orange)](./LICENSE)
[English](./README.md) | [中文](./README_CN.md)
<img src="assets/images/osworld_leaderboard.png" width="700" alt="OSWorld Leaderboard">
**🥇 开源模型第一 | OSWorld 排行榜(2026年1月)**
</div>
---
## 📢 更新日志
- **2026.03.31**:EvoCUA-32B 在 WindowsAgentArena (WAA) 上取得 **56.48%**,超越基线模型 Qwen3-VL-32B-Thinking(42.9%)约 13.6 个百分点,超越 UI-TARS-2(50.6%)约 6 个百分点——展现出强大的零样本跨操作系统泛化能力 🆕
- **2026.03.31**:Yoshua Bengio 与 Dawn Song 团队的独立安全性研究([arXiv:2602.08235](https://arxiv.org/abs/2602.08235))表明 **EvoCUA-32B 的非预期行为触发率最低(35.0%)**——在所有受测 CUA 中最安全!🆕
- **2026.01.23**: EvoCUA 在 [Hugging Face Daily Papers](https://huggingface.co/papers/2601.15876) **中排名 (#1)** 🏆
- **2026.01.22**:发布[EvoCUA技术报告](https://arxiv.org/abs/2601.15876) 📄
- **2026.01.13**:发布 [EvoCUA-8B-20260105](https://huggingface.co/meituan/EvoCUA-8B-20260105) — OSWorld 得分 **46.1%**,**以更小的参数量实现与 72B 级别开源模型相当的性能!**
- **2026.01.05**:发布 [EvoCUA-32B-20260105](https://huggingface.co/meituan/EvoCUA-32B-20260105),OSWorld 得分 **56.7%**,登顶**开源模型榜首** 🥇
---
## 🌟 亮点
- 🥇 **开源模型榜首**:在 OSWorld 上达到 **56.7%** 的任务完成率,位居**所有开源模型第一**。
- 📈 **性能显著提升**:相比 OpenCUA-72B 提升 11.7%(45.0%→56.7%),相比 Qwen3-VL Thinking 提升 15.1%(41.6%→56.7%),且**参数更少、步数减半**。
- 🖥️ **端到端多轮自动化**:仅凭屏幕截图和自然语言指令,即可流畅操作 Chrome、Excel、PPT、VSCode 等各类软件,完成复杂任务。
- 🧠 **创新训练范式**:采用独特的数据合成与训练方法,在大幅提升 Computer Use 能力的同时,保持了模型的通用多模态能力。
---
## 📊 性能对比
| 排名 | 模型 | 开源/闭源 | 类型 | 最大步数 | 得分 |
|------|------|-----------|------|----------|------|
| 1 | Claude-sonnet-4-5 | 🔒 闭源 | 通用模型 | 100 | 62.9% |
| 2 | Seed-1.8 | 🔒 闭源 | 通用模型 | 100 | 61.9% |
| 3 | Claude-sonnet-4-5 | 🔒 闭源 | 通用模型 | 50 | 58.1% |
| **4** | **EvoCUA-20260105 (Ours)** | **🟢 开源** | **通用模型** | **50** | **56.7% 🥇** |
| 5 | DeepMiner-Mano-72B | 🔒 闭源 | 专用模型 | 100 | 53.9% |
| 6 | UI-TARS-2-2509 | 🔒 闭源 | 通用模型 | 100 | 53.1% |
| 7 | EvoCUA (Previous) | 🔒 闭源 | 通用模型 | 50 | 50.3% |
| **8** | **EvoCUA-8B-20260105 (Ours)** | **🟢 开源** | **通用模型** | **50** | **46.1%** |
| 9 | OpenCUA-72B | 🟢 开源 | 专用模型 | 100 | 45.0% |
| ... | ... | ... | ... | ... | ... |
| 13 | Qwen3-VL-Flash | 🔒 闭源 | 通用模型 | 100 | 41.6% |
> EvoCUA 高居**开源模型第一**,仅需 **50 步**即可达到极具竞争力的效果。尽管如此,人类水平仍显著高于当前最佳模型,该领域仍有巨大的探索与提升空间。
### 零样本跨操作系统泛化(WindowsAgentArena)
我们在 [WindowsAgentArena (WAA)](https://microsoft.github.io/WindowsAgentArena/) 上对 EvoCUA 进行了评测,以验证模型从 Linux 训练环境向全新操作系统平台的泛化能力。如下表所示,EvoCUA-32B 达到 **56.48%**,超越基线模型 Qwen3-VL-32B-Thinking(42.9%)约 13.6 个百分点,超越领先的前沿 GUI Agent UI-TARS-2(50.6%)近 **6 个百分点**。
| 模型 | WAA |
|------|-----|
| Qwen3-VL-32B-Instruct | 30.9% [1] |
| Qwen3-VL-32B-Thinking (Base) | 42.9% [1] |
| UI-TARS-2 | 50.6% [2] |
| **EvoCUA-32B (Ours)** | **56.48%** |
> [1] Bai et al., *Qwen3-VL Technical Report* (arXiv:2511.21631, 2025).
> [2] Wang et al., *UI-TARS-2 Technical Report* (arXiv:2509.02544, 2025).
### 安全性 — 抵抗非预期行为的鲁棒性
来自 Yoshua Bengio 和 Dawn Song 团队的最新研究 [Jones et al. (2026)](https://arxiv.org/abs/2602.08235) 系统评估了主流 CUA 的安全性。该研究将 117 条经人工验证的扰动指令(看似无害但具有误导性)迁移至多个目标 Agent,每条指令执行 3 次,报告在 ≥ 1 次运行中触发非预期行为的指令百分比。**EvoCUA-32B 以 35.0% 的最低整体触发率**,在所有受测 CUA 中展现出最强的安全鲁棒性。
<details>
<summary><b>可迁移性研究结果(论文 Table 2)</b></summary>
| 目标 Agent | Claude 4.5 Haiku | Claude 4.5 Opus | 整体 |
|---|---|---|---|
| **开源 CUA** | | | |
| EvoCUA-8B | 20.0 | 50.7 | 37.6 |
| **EvoCUA-32B (Ours)** | **24.0** | **43.3** | **35.0 🥇** |
| OpenCUA-7B | 42.0 | 50.7 | 47.0 |
| OpenCUA-32B | 42.0 | 44.8 | 43.6 |
| OpenCUA-72B | 50.0 | 56.7 | 53.8 |
| **闭源 CUA** | | | |
| Claude 4.5 Sonnet | 32.0 | 47.8 | 41.0 |
| Operator | 38.0 | 56.7 | 48.7 |
> *数值越低越安全。* EvoCUA-32B 在所有受测 Agent 中非预期行为触发率最低。
</details>
> [3] Jones et al., *When Benign Inputs Lead to Severe Harms: Eliciting Unsafe Unintended Behaviors of Computer-Use Agents* (arXiv:2602.08235, 2026).
---
## 🎬 Demo展示
模型上网查询如何配置rbenv开发环境并帮用户安装:
<img src="assets/images/animation_show_case.gif" width="900" alt="Demo展示动图">
---
## 🚀 快速开始
### 安装环境
推荐使用 Python 3.12。
```bash
git clone https://github.com/meituan/EvoCUA.git
cd EvoCUA
python3 -m venv .venv
source .venv/bin/activate
pip install -r requirements.txt
```
### 模型下载与部署
请先从 HuggingFace 下载 EvoCUA 模型权重,并使用 **vLLM** 将其部署为兼容 OpenAI 接口的推理服务。
推荐版本:
- torch: 2.8.0+cu126
- transformers: 4.57.3
- vllm: 0.11.0
```bash
# 1) 下载模型权重
huggingface-cli download meituan/EvoCUA-32B-20260105 \
--local-dir /path/to/EvoCUA-32B \
--local-dir-use-symlinks False
# 2) 启动 vLLM 推理服务(建议使用单独的环境)
vllm serve /path/to/EvoCUA-32B \
--served-model-name EvoCUA \
--host 0.0.0.0 \
--port 8080 \
--tensor-parallel-size 2
# 3) 设置环境变量
# 环境变量可通过 .env 文件进行配置(请参考 env.template):
cp env.template .env
# 编辑 .env 文件,填入您的具体配置,例如:
export OPENAI_API_KEY="dummy"
export OPENAI_BASE_URL="http://127.0.0.1:8080/v1"
```
### 在 OSWorld 上运行评测
```bash
python3 run_multienv_evocua.py \
--headless \
--provider_name aws \
--observation_type screenshot \
--model EvoCUA-S2 \
--result_dir ./evocua_results \
--test_all_meta_path evaluation_examples/test_nogdrive.json \
--max_steps 50 \
--num_envs 30 \
--temperature 0.01 \
--max_history_turns 4 \
--coordinate_type relative \
--resize_factor 32 \
--prompt_style S2
```
---
## 📁 项目结构
```
EvoCUA/
├── run_multienv_evocua.py # 评测入口(支持多环境并行)
├── lib_run_single.py # 单任务 Rollout 执行逻辑(含轨迹记录、截图、录屏、评分)
├── lib_results_logger.py # 评测结果实时汇总(写入 results.json)
├── desktop_env/ # OSWorld 环境端实现
│ ├── providers/ # 虚拟机提供商接口(AWS/VMware/Docker 等)
│ ├── controllers/ # 环境控制器
│ └── evaluators/ # 任务评估器
├── mm_agents/
│ └── evocua/ # EvoCUA Agent 核心代码(Prompt构建、输出解析、动作生成)
└── evaluation_examples/ # OSWorld 任务配置集
```
---
## 📖 关于 OSWorld
[OSWorld](https://os-world.github.io/) 是 Computer Use Agent 领域最具影响力的基准测试,被 **OpenAI、Anthropic、字节跳动 Seed、月之暗面、智谱 AI、阶跃星辰** 等众多顶尖 AI 团队广泛采用。OSWorld 通过模拟真实桌面环境中的多轮交互,全面评估 Agent 完成实际计算机任务的能力。
---
## 🔗 相关资源
- 🤗 **模型权重**:
- [meituan/EvoCUA-32B-20260105](https://huggingface.co/meituan/EvoCUA-32B-20260105) - OSWorld 得分:**56.7%** 🥇
- [meituan/EvoCUA-8B-20260105](https://huggingface.co/meituan/EvoCUA-8B-20260105) - OSWorld 得分:**46.06%** 🆕
- 📊 **OSWorld 基准测试**:[os-world.github.io](https://os-world.github.io/)
- 📄 **技术报告**:[tech_report.pdf](https://arxiv.org/abs/2601.15876)
- 🚀 **更多规格**:更多尺寸的模型正在路上!
---
## 🙏 致谢
我们诚挚感谢开源社区在 Computer Use Agent 领域的杰出贡献。特别感谢 **Xinyuan Wang**([OpenCUA](https://github.com/xlang-ai/OpenCUA))和 **Tianbao Xie**([OSWorld](https://github.com/xlang-ai/OSWorld))在评测、技术探讨及反馈方面提供的宝贵支持,他们的开创性工作极大地启发并推动了本项目的发展。我们致力于回馈社区,并将持续开源研究成果,与大家共同推动领域进步。
---
## 📝 引用
如果您觉得 EvoCUA 对您的研究有帮助,请考虑引用:
```bibtex
@article{xue2026evocua,
title={EvoCUA: Evolving Computer Use Agents via Learning from Scalable Synthetic Experience},
author={Xue, Taofeng and Peng, Chong and Huang, Mianqiu and Guo, Linsen and Han, Tiancheng and Wang, Haozhe and Wang, Jianing and Zhang, Xiaocheng and Yang, Xin and Zhao, Dengchang and others},
journal={arXiv preprint arXiv:2601.15876},
year={2026}
}
```
---
## 📜 开源协议
本项目基于 Apache 2.0 协议开源,详见 [LICENSE](./LICENSE) 文件。
---
## 📈 Star增长
[![Star History Chart](https://api.star-history.com/svg?repos=meituan/EvoCUA&type=Date)](https://star-history.com/#meituan/EvoCUA&Date)
---
<div align="center">
**由美团 LongCat 团队用 ❤️ 打造**
</div>

28
added_tokens.json Normal file
View File

@@ -0,0 +1,28 @@
{
"</think>": 151668,
"</tool_call>": 151658,
"</tool_response>": 151666,
"<think>": 151667,
"<tool_call>": 151657,
"<tool_response>": 151665,
"<|box_end|>": 151649,
"<|box_start|>": 151648,
"<|endoftext|>": 151643,
"<|file_sep|>": 151664,
"<|fim_middle|>": 151660,
"<|fim_pad|>": 151662,
"<|fim_prefix|>": 151659,
"<|fim_suffix|>": 151661,
"<|im_end|>": 151645,
"<|im_start|>": 151644,
"<|image_pad|>": 151655,
"<|object_ref_end|>": 151647,
"<|object_ref_start|>": 151646,
"<|quad_end|>": 151651,
"<|quad_start|>": 151650,
"<|repo_name|>": 151663,
"<|video_pad|>": 151656,
"<|vision_end|>": 151653,
"<|vision_pad|>": 151654,
"<|vision_start|>": 151652
}

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:0475114db10719b8043a98fc6ff96ce014fd98537433a3aa9afacf6f9bcf40ab
size 13366588

Binary file not shown.

After

Width:  |  Height:  |  Size: 447 KiB

110
chat_template.jinja Normal file
View File

@@ -0,0 +1,110 @@
{%- set image_count = namespace(value=0) %}
{%- set video_count = namespace(value=0) %}
{%- macro render_content(content, do_vision_count) %}
{%- if content is string %}
{{- content }}
{%- else %}
{%- for item in content %}
{%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
{%- if do_vision_count %}
{%- set image_count.value = image_count.value + 1 %}
{%- endif %}
{%- if add_vision_id %}Picture {{ image_count.value }}: {% endif -%}
<|vision_start|><|image_pad|><|vision_end|>
{%- elif 'video' in item or item.type == 'video' %}
{%- if do_vision_count %}
{%- set video_count.value = video_count.value + 1 %}
{%- endif %}
{%- if add_vision_id %}Video {{ video_count.value }}: {% endif -%}
<|vision_start|><|video_pad|><|vision_end|>
{%- elif 'text' in item %}
{{- item.text }}
{%- endif %}
{%- endfor %}
{%- endif %}
{%- endmacro %}
{%- if tools %}
{{- '<|im_start|>system\n' }}
{%- if messages[0].role == 'system' %}
{{- render_content(messages[0].content, false) + '\n\n' }}
{%- endif %}
{{- "# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within <tools></tools> XML tags:\n<tools>" }}
{%- for tool in tools %}
{{- "\n" }}
{{- tool | tojson }}
{%- endfor %}
{{- "\n</tools>\n\nFor each function call, return a json object with function name and arguments within <tool_call></tool_call> XML tags:\n<tool_call>\n{\"name\": <function-name>, \"arguments\": <args-json-object>}\n</tool_call><|im_end|>\n" }}
{%- else %}
{%- if messages[0].role == 'system' %}
{{- '<|im_start|>system\n' + render_content(messages[0].content, false) + '<|im_end|>\n' }}
{%- endif %}
{%- endif %}
{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
{%- for message in messages[::-1] %}
{%- set index = (messages|length - 1) - loop.index0 %}
{%- if ns.multi_step_tool and message.role == "user" %}
{%- set content = render_content(message.content, false) %}
{%- if not(content.startswith('<tool_response>') and content.endswith('</tool_response>')) %}
{%- set ns.multi_step_tool = false %}
{%- set ns.last_query_index = index %}
{%- endif %}
{%- endif %}
{%- endfor %}
{%- for message in messages %}
{%- set content = render_content(message.content, True) %}
{%- if (message.role == "user") or (message.role == "system" and not loop.first) %}
{{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
{%- elif message.role == "assistant" %}
{%- set reasoning_content = '' %}
{%- if message.reasoning_content is string %}
{%- set reasoning_content = message.reasoning_content %}
{%- else %}
{%- if '</think>' in content %}
{%- set reasoning_content = content.split('</think>')[0].rstrip('\n').split('<think>')[-1].lstrip('\n') %}
{%- set content = content.split('</think>')[-1].lstrip('\n') %}
{%- endif %}
{%- endif %}
{%- if loop.index0 > ns.last_query_index %}
{%- if loop.last or (not loop.last and reasoning_content) %}
{{- '<|im_start|>' + message.role + '\n<think>\n' + reasoning_content.strip('\n') + '\n</think>\n\n' + content.lstrip('\n') }}
{%- else %}
{{- '<|im_start|>' + message.role + '\n' + content }}
{%- endif %}
{%- else %}
{{- '<|im_start|>' + message.role + '\n' + content }}
{%- endif %}
{%- if message.tool_calls %}
{%- for tool_call in message.tool_calls %}
{%- if (loop.first and content) or (not loop.first) %}
{{- '\n' }}
{%- endif %}
{%- if tool_call.function %}
{%- set tool_call = tool_call.function %}
{%- endif %}
{{- '<tool_call>\n{"name": "' }}
{{- tool_call.name }}
{{- '", "arguments": ' }}
{%- if tool_call.arguments is string %}
{{- tool_call.arguments }}
{%- else %}
{{- tool_call.arguments | tojson }}
{%- endif %}
{{- '}\n</tool_call>' }}
{%- endfor %}
{%- endif %}
{{- '<|im_end|>\n' }}
{%- elif message.role == "tool" %}
{%- if loop.first or (messages[loop.index0 - 1].role != "tool") %}
{{- '<|im_start|>user' }}
{%- endif %}
{{- '\n<tool_response>\n' }}
{{- content }}
{{- '\n</tool_response>' }}
{%- if loop.last or (messages[loop.index0 + 1].role != "tool") %}
{{- '<|im_end|>\n' }}
{%- endif %}
{%- endif %}
{%- endfor %}
{%- if add_generation_prompt %}
{{- '<|im_start|>assistant\n<think>\n' }}
{%- endif %}

69
config.json Normal file
View File

@@ -0,0 +1,69 @@
{
"architectures": [
"Qwen3VLForConditionalGeneration"
],
"dtype": "bfloat16",
"eos_token_id": 151645,
"hidden_size": 4096,
"image_token_id": 151655,
"model_type": "qwen3_vl",
"pad_token_id": 151643,
"text_config": {
"attention_bias": false,
"attention_dropout": 0.0,
"bos_token_id": 151643,
"dtype": "bfloat16",
"eos_token_id": 151645,
"head_dim": 128,
"hidden_act": "silu",
"hidden_size": 4096,
"initializer_range": 0.02,
"intermediate_size": 12288,
"max_position_embeddings": 262144,
"model_type": "qwen3_vl_text",
"num_attention_heads": 32,
"num_hidden_layers": 36,
"num_key_value_heads": 8,
"pad_token_id": 151643,
"rms_norm_eps": 1e-06,
"rope_scaling": {
"mrope_interleaved": true,
"mrope_section": [
24,
20,
20
],
"rope_type": "default"
},
"rope_theta": 5000000,
"use_cache": false,
"vocab_size": 151936
},
"tie_word_embeddings": false,
"transformers_version": "4.57.3",
"video_token_id": 151656,
"vision_config": {
"deepstack_visual_indexes": [
8,
16,
24
],
"depth": 27,
"dtype": "bfloat16",
"hidden_act": "gelu_pytorch_tanh",
"hidden_size": 1152,
"in_channels": 3,
"initializer_range": 0.02,
"intermediate_size": 4304,
"model_type": "qwen3_vl",
"num_heads": 16,
"num_position_embeddings": 2304,
"out_hidden_size": 4096,
"pad_token_id": 151643,
"patch_size": 16,
"spatial_merge_size": 2,
"temporal_patch_size": 2
},
"vision_end_token_id": 151653,
"vision_start_token_id": 151652
}

1
configuration.json Normal file
View File

@@ -0,0 +1 @@
{"framework": "pytorch", "task": "image-text-to-text", "allow_remote": true}

12
generation_config.json Normal file
View File

@@ -0,0 +1,12 @@
{
"bos_token_id": 151643,
"do_sample": true,
"eos_token_id": [
151645,
151643
],
"pad_token_id": 151643,
"top_k": 20,
"top_p": 0.95,
"transformers_version": "4.57.3"
}

BIN
merges.txt (Stored with Git LFS) Normal file

Binary file not shown.

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:f67cb369f226e6f39236f11b03751a6701ab77eeea0b625f382785c1277e8403
size 4998056552

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:b34b25fcef1773e186203d589b7dfde6f6e31d9a8e3d8dddcbd8dcf18ec76245
size 4915962464

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:253c898441aef6e0657c1af7afde3ec55d042bf93afd61bfc97573d302e4f94d
size 4915962496

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:386cf839b1e2b640947679c2fb51fd75bb4432e76201e1777a3d3b5fdde916ec
size 2704357976

View File

@@ -0,0 +1,757 @@
{
"metadata": {
"total_size": 17534247392
},
"weight_map": {
"lm_head.weight": "model-00004-of-00004.safetensors",
"model.language_model.embed_tokens.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.0.input_layernorm.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.0.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.0.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.0.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.0.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.0.self_attn.k_norm.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.0.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.0.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.0.self_attn.q_norm.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.0.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.0.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.1.input_layernorm.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.1.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.1.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.1.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.1.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.1.self_attn.k_norm.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.1.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.1.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.1.self_attn.q_norm.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.1.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.1.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.10.input_layernorm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.10.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.10.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.10.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.10.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.10.self_attn.k_norm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.10.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.10.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.10.self_attn.q_norm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.10.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.10.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.11.input_layernorm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.11.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.11.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.11.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.11.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.11.self_attn.k_norm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.11.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.11.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.11.self_attn.q_norm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.11.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.11.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.12.input_layernorm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.12.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.12.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.12.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.12.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.12.self_attn.k_norm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.12.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.12.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.12.self_attn.q_norm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.12.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.12.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.13.input_layernorm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.13.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.13.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.13.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.13.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.13.self_attn.k_norm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.13.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.13.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.13.self_attn.q_norm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.13.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.13.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.14.input_layernorm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.14.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.14.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.14.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.14.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.14.self_attn.k_norm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.14.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.14.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.14.self_attn.q_norm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.14.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.14.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.15.input_layernorm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.15.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.15.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.15.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.15.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.15.self_attn.k_norm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.15.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.15.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.15.self_attn.q_norm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.15.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.15.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.16.input_layernorm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.16.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.16.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.16.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.16.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.16.self_attn.k_norm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.16.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.16.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.16.self_attn.q_norm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.16.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.16.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.17.input_layernorm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.17.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.17.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.17.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.17.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.17.self_attn.k_norm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.17.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.17.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.17.self_attn.q_norm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.17.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.17.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.18.input_layernorm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.18.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.18.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.18.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.18.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.18.self_attn.k_norm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.18.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.18.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.18.self_attn.q_norm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.18.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.18.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.19.input_layernorm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.19.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.19.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.19.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.19.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.19.self_attn.k_norm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.19.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.19.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.19.self_attn.q_norm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.19.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.19.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.2.input_layernorm.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.2.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.2.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.2.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.2.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.2.self_attn.k_norm.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.2.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.2.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.2.self_attn.q_norm.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.2.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.2.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.20.input_layernorm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.20.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.20.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.20.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.20.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.20.self_attn.k_norm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.20.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.20.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.20.self_attn.q_norm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.20.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.20.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.21.input_layernorm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.21.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.21.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.21.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.21.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.21.self_attn.k_norm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.21.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.21.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.21.self_attn.q_norm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.21.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.21.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.22.input_layernorm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.22.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.22.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.22.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.22.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.22.self_attn.k_norm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.22.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.22.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.22.self_attn.q_norm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.22.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.22.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.23.input_layernorm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.23.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.23.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.23.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.23.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.23.self_attn.k_norm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.23.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.23.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.23.self_attn.q_norm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.23.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.23.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.24.input_layernorm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.24.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.24.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.24.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.24.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.24.self_attn.k_norm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.24.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.24.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.24.self_attn.q_norm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.24.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.24.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.25.input_layernorm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.25.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.25.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.25.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.25.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.25.self_attn.k_norm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.25.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.25.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.25.self_attn.q_norm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.25.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.25.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.26.input_layernorm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.26.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.26.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.26.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.26.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.26.self_attn.k_norm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.26.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.26.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.26.self_attn.q_norm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.26.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.26.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.27.input_layernorm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.27.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.27.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.27.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.27.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.27.self_attn.k_norm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.27.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.27.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.27.self_attn.q_norm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.27.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.27.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.28.input_layernorm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.28.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.28.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.28.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.28.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.28.self_attn.k_norm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.28.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.28.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.28.self_attn.q_norm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.28.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.28.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.29.input_layernorm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.29.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.29.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.29.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.29.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.29.self_attn.k_norm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.29.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.29.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.29.self_attn.q_norm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.29.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.29.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.3.input_layernorm.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.3.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.3.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.3.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.3.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.3.self_attn.k_norm.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.3.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.3.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.3.self_attn.q_norm.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.3.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.3.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.30.input_layernorm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.30.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.30.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.30.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.30.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.30.self_attn.k_norm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.30.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.30.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.30.self_attn.q_norm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.30.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.30.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.31.input_layernorm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.31.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.31.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.31.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.31.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.31.self_attn.k_norm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.31.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.31.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.31.self_attn.q_norm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.31.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.31.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.32.input_layernorm.weight": "model-00004-of-00004.safetensors",
"model.language_model.layers.32.mlp.down_proj.weight": "model-00004-of-00004.safetensors",
"model.language_model.layers.32.mlp.gate_proj.weight": "model-00004-of-00004.safetensors",
"model.language_model.layers.32.mlp.up_proj.weight": "model-00004-of-00004.safetensors",
"model.language_model.layers.32.post_attention_layernorm.weight": "model-00004-of-00004.safetensors",
"model.language_model.layers.32.self_attn.k_norm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.32.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.32.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.32.self_attn.q_norm.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.32.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.32.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
"model.language_model.layers.33.input_layernorm.weight": "model-00004-of-00004.safetensors",
"model.language_model.layers.33.mlp.down_proj.weight": "model-00004-of-00004.safetensors",
"model.language_model.layers.33.mlp.gate_proj.weight": "model-00004-of-00004.safetensors",
"model.language_model.layers.33.mlp.up_proj.weight": "model-00004-of-00004.safetensors",
"model.language_model.layers.33.post_attention_layernorm.weight": "model-00004-of-00004.safetensors",
"model.language_model.layers.33.self_attn.k_norm.weight": "model-00004-of-00004.safetensors",
"model.language_model.layers.33.self_attn.k_proj.weight": "model-00004-of-00004.safetensors",
"model.language_model.layers.33.self_attn.o_proj.weight": "model-00004-of-00004.safetensors",
"model.language_model.layers.33.self_attn.q_norm.weight": "model-00004-of-00004.safetensors",
"model.language_model.layers.33.self_attn.q_proj.weight": "model-00004-of-00004.safetensors",
"model.language_model.layers.33.self_attn.v_proj.weight": "model-00004-of-00004.safetensors",
"model.language_model.layers.34.input_layernorm.weight": "model-00004-of-00004.safetensors",
"model.language_model.layers.34.mlp.down_proj.weight": "model-00004-of-00004.safetensors",
"model.language_model.layers.34.mlp.gate_proj.weight": "model-00004-of-00004.safetensors",
"model.language_model.layers.34.mlp.up_proj.weight": "model-00004-of-00004.safetensors",
"model.language_model.layers.34.post_attention_layernorm.weight": "model-00004-of-00004.safetensors",
"model.language_model.layers.34.self_attn.k_norm.weight": "model-00004-of-00004.safetensors",
"model.language_model.layers.34.self_attn.k_proj.weight": "model-00004-of-00004.safetensors",
"model.language_model.layers.34.self_attn.o_proj.weight": "model-00004-of-00004.safetensors",
"model.language_model.layers.34.self_attn.q_norm.weight": "model-00004-of-00004.safetensors",
"model.language_model.layers.34.self_attn.q_proj.weight": "model-00004-of-00004.safetensors",
"model.language_model.layers.34.self_attn.v_proj.weight": "model-00004-of-00004.safetensors",
"model.language_model.layers.35.input_layernorm.weight": "model-00004-of-00004.safetensors",
"model.language_model.layers.35.mlp.down_proj.weight": "model-00004-of-00004.safetensors",
"model.language_model.layers.35.mlp.gate_proj.weight": "model-00004-of-00004.safetensors",
"model.language_model.layers.35.mlp.up_proj.weight": "model-00004-of-00004.safetensors",
"model.language_model.layers.35.post_attention_layernorm.weight": "model-00004-of-00004.safetensors",
"model.language_model.layers.35.self_attn.k_norm.weight": "model-00004-of-00004.safetensors",
"model.language_model.layers.35.self_attn.k_proj.weight": "model-00004-of-00004.safetensors",
"model.language_model.layers.35.self_attn.o_proj.weight": "model-00004-of-00004.safetensors",
"model.language_model.layers.35.self_attn.q_norm.weight": "model-00004-of-00004.safetensors",
"model.language_model.layers.35.self_attn.q_proj.weight": "model-00004-of-00004.safetensors",
"model.language_model.layers.35.self_attn.v_proj.weight": "model-00004-of-00004.safetensors",
"model.language_model.layers.4.input_layernorm.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.4.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.4.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.4.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.4.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.4.self_attn.k_norm.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.4.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.4.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.4.self_attn.q_norm.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.4.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.4.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.5.input_layernorm.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.5.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.5.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.5.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.5.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.5.self_attn.k_norm.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.5.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.5.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.5.self_attn.q_norm.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.5.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.5.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.6.input_layernorm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.6.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.6.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.6.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.6.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.6.self_attn.k_norm.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.6.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.6.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.6.self_attn.q_norm.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.6.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.6.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
"model.language_model.layers.7.input_layernorm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.7.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.7.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.7.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.7.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.7.self_attn.k_norm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.7.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.7.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.7.self_attn.q_norm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.7.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.7.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.8.input_layernorm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.8.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.8.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.8.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.8.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.8.self_attn.k_norm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.8.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.8.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.8.self_attn.q_norm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.8.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.8.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.9.input_layernorm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.9.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.9.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.9.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.9.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.9.self_attn.k_norm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.9.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.9.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.9.self_attn.q_norm.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.9.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.layers.9.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
"model.language_model.norm.weight": "model-00004-of-00004.safetensors",
"model.visual.blocks.0.attn.proj.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.0.attn.proj.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.0.attn.qkv.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.0.attn.qkv.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.0.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.0.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.0.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.0.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.0.norm1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.0.norm1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.0.norm2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.0.norm2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.1.attn.proj.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.1.attn.proj.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.1.attn.qkv.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.1.attn.qkv.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.1.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.1.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.1.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.1.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.1.norm1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.1.norm1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.1.norm2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.1.norm2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.10.attn.proj.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.10.attn.proj.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.10.attn.qkv.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.10.attn.qkv.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.10.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.10.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.10.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.10.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.10.norm1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.10.norm1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.10.norm2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.10.norm2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.11.attn.proj.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.11.attn.proj.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.11.attn.qkv.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.11.attn.qkv.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.11.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.11.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.11.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.11.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.11.norm1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.11.norm1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.11.norm2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.11.norm2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.12.attn.proj.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.12.attn.proj.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.12.attn.qkv.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.12.attn.qkv.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.12.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.12.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.12.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.12.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.12.norm1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.12.norm1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.12.norm2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.12.norm2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.13.attn.proj.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.13.attn.proj.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.13.attn.qkv.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.13.attn.qkv.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.13.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.13.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.13.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.13.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.13.norm1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.13.norm1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.13.norm2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.13.norm2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.14.attn.proj.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.14.attn.proj.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.14.attn.qkv.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.14.attn.qkv.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.14.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.14.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.14.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.14.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.14.norm1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.14.norm1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.14.norm2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.14.norm2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.15.attn.proj.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.15.attn.proj.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.15.attn.qkv.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.15.attn.qkv.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.15.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.15.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.15.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.15.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.15.norm1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.15.norm1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.15.norm2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.15.norm2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.16.attn.proj.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.16.attn.proj.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.16.attn.qkv.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.16.attn.qkv.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.16.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.16.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.16.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.16.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.16.norm1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.16.norm1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.16.norm2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.16.norm2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.17.attn.proj.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.17.attn.proj.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.17.attn.qkv.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.17.attn.qkv.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.17.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.17.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.17.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.17.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.17.norm1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.17.norm1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.17.norm2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.17.norm2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.18.attn.proj.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.18.attn.proj.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.18.attn.qkv.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.18.attn.qkv.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.18.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.18.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.18.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.18.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.18.norm1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.18.norm1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.18.norm2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.18.norm2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.19.attn.proj.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.19.attn.proj.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.19.attn.qkv.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.19.attn.qkv.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.19.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.19.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.19.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.19.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.19.norm1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.19.norm1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.19.norm2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.19.norm2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.2.attn.proj.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.2.attn.proj.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.2.attn.qkv.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.2.attn.qkv.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.2.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.2.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.2.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.2.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.2.norm1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.2.norm1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.2.norm2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.2.norm2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.20.attn.proj.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.20.attn.proj.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.20.attn.qkv.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.20.attn.qkv.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.20.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.20.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.20.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.20.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.20.norm1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.20.norm1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.20.norm2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.20.norm2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.21.attn.proj.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.21.attn.proj.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.21.attn.qkv.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.21.attn.qkv.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.21.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.21.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.21.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.21.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.21.norm1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.21.norm1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.21.norm2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.21.norm2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.22.attn.proj.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.22.attn.proj.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.22.attn.qkv.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.22.attn.qkv.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.22.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.22.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.22.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.22.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.22.norm1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.22.norm1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.22.norm2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.22.norm2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.23.attn.proj.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.23.attn.proj.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.23.attn.qkv.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.23.attn.qkv.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.23.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.23.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.23.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.23.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.23.norm1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.23.norm1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.23.norm2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.23.norm2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.24.attn.proj.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.24.attn.proj.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.24.attn.qkv.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.24.attn.qkv.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.24.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.24.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.24.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.24.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.24.norm1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.24.norm1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.24.norm2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.24.norm2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.25.attn.proj.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.25.attn.proj.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.25.attn.qkv.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.25.attn.qkv.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.25.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.25.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.25.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.25.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.25.norm1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.25.norm1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.25.norm2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.25.norm2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.26.attn.proj.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.26.attn.proj.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.26.attn.qkv.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.26.attn.qkv.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.26.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.26.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.26.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.26.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.26.norm1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.26.norm1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.26.norm2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.26.norm2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.3.attn.proj.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.3.attn.proj.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.3.attn.qkv.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.3.attn.qkv.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.3.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.3.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.3.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.3.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.3.norm1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.3.norm1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.3.norm2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.3.norm2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.4.attn.proj.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.4.attn.proj.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.4.attn.qkv.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.4.attn.qkv.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.4.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.4.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.4.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.4.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.4.norm1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.4.norm1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.4.norm2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.4.norm2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.5.attn.proj.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.5.attn.proj.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.5.attn.qkv.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.5.attn.qkv.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.5.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.5.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.5.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.5.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.5.norm1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.5.norm1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.5.norm2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.5.norm2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.6.attn.proj.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.6.attn.proj.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.6.attn.qkv.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.6.attn.qkv.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.6.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.6.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.6.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.6.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.6.norm1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.6.norm1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.6.norm2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.6.norm2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.7.attn.proj.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.7.attn.proj.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.7.attn.qkv.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.7.attn.qkv.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.7.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.7.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.7.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.7.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.7.norm1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.7.norm1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.7.norm2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.7.norm2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.8.attn.proj.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.8.attn.proj.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.8.attn.qkv.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.8.attn.qkv.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.8.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.8.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.8.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.8.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.8.norm1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.8.norm1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.8.norm2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.8.norm2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.9.attn.proj.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.9.attn.proj.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.9.attn.qkv.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.9.attn.qkv.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.9.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.9.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.9.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.9.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.9.norm1.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.9.norm1.weight": "model-00001-of-00004.safetensors",
"model.visual.blocks.9.norm2.bias": "model-00001-of-00004.safetensors",
"model.visual.blocks.9.norm2.weight": "model-00001-of-00004.safetensors",
"model.visual.deepstack_merger_list.0.linear_fc1.bias": "model-00001-of-00004.safetensors",
"model.visual.deepstack_merger_list.0.linear_fc1.weight": "model-00001-of-00004.safetensors",
"model.visual.deepstack_merger_list.0.linear_fc2.bias": "model-00001-of-00004.safetensors",
"model.visual.deepstack_merger_list.0.linear_fc2.weight": "model-00001-of-00004.safetensors",
"model.visual.deepstack_merger_list.0.norm.bias": "model-00001-of-00004.safetensors",
"model.visual.deepstack_merger_list.0.norm.weight": "model-00001-of-00004.safetensors",
"model.visual.deepstack_merger_list.1.linear_fc1.bias": "model-00001-of-00004.safetensors",
"model.visual.deepstack_merger_list.1.linear_fc1.weight": "model-00001-of-00004.safetensors",
"model.visual.deepstack_merger_list.1.linear_fc2.bias": "model-00001-of-00004.safetensors",
"model.visual.deepstack_merger_list.1.linear_fc2.weight": "model-00001-of-00004.safetensors",
"model.visual.deepstack_merger_list.1.norm.bias": "model-00001-of-00004.safetensors",
"model.visual.deepstack_merger_list.1.norm.weight": "model-00001-of-00004.safetensors",
"model.visual.deepstack_merger_list.2.linear_fc1.bias": "model-00001-of-00004.safetensors",
"model.visual.deepstack_merger_list.2.linear_fc1.weight": "model-00001-of-00004.safetensors",
"model.visual.deepstack_merger_list.2.linear_fc2.bias": "model-00001-of-00004.safetensors",
"model.visual.deepstack_merger_list.2.linear_fc2.weight": "model-00001-of-00004.safetensors",
"model.visual.deepstack_merger_list.2.norm.bias": "model-00001-of-00004.safetensors",
"model.visual.deepstack_merger_list.2.norm.weight": "model-00001-of-00004.safetensors",
"model.visual.merger.linear_fc1.bias": "model-00001-of-00004.safetensors",
"model.visual.merger.linear_fc1.weight": "model-00001-of-00004.safetensors",
"model.visual.merger.linear_fc2.bias": "model-00001-of-00004.safetensors",
"model.visual.merger.linear_fc2.weight": "model-00001-of-00004.safetensors",
"model.visual.merger.norm.bias": "model-00001-of-00004.safetensors",
"model.visual.merger.norm.weight": "model-00001-of-00004.safetensors",
"model.visual.patch_embed.proj.bias": "model-00001-of-00004.safetensors",
"model.visual.patch_embed.proj.weight": "model-00001-of-00004.safetensors",
"model.visual.pos_embed.weight": "model-00001-of-00004.safetensors"
}
}

21
preprocessor_config.json Normal file
View File

@@ -0,0 +1,21 @@
{
"size": {
"longest_edge": 16777216,
"shortest_edge": 65536
},
"patch_size": 16,
"temporal_patch_size": 2,
"merge_size": 2,
"image_mean": [
0.5,
0.5,
0.5
],
"image_std": [
0.5,
0.5,
0.5
],
"processor_class": "Qwen3VLProcessor",
"image_processor_type": "Qwen2VLImageProcessorFast"
}

31
special_tokens_map.json Normal file
View File

@@ -0,0 +1,31 @@
{
"additional_special_tokens": [
"<|im_start|>",
"<|im_end|>",
"<|object_ref_start|>",
"<|object_ref_end|>",
"<|box_start|>",
"<|box_end|>",
"<|quad_start|>",
"<|quad_end|>",
"<|vision_start|>",
"<|vision_end|>",
"<|vision_pad|>",
"<|image_pad|>",
"<|video_pad|>"
],
"eos_token": {
"content": "<|im_end|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false
},
"pad_token": {
"content": "<|endoftext|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false
}
}

3
tech_report.pdf Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:3d62a458a41ed08367f1993b23c5a9f6280613d322e96407eb233726f5d1853b
size 25040699

BIN
tokenizer.json (Stored with Git LFS) Normal file

Binary file not shown.

240
tokenizer_config.json Normal file
View File

@@ -0,0 +1,240 @@
{
"add_bos_token": false,
"add_prefix_space": false,
"added_tokens_decoder": {
"151643": {
"content": "<|endoftext|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151644": {
"content": "<|im_start|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151645": {
"content": "<|im_end|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151646": {
"content": "<|object_ref_start|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151647": {
"content": "<|object_ref_end|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151648": {
"content": "<|box_start|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151649": {
"content": "<|box_end|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151650": {
"content": "<|quad_start|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151651": {
"content": "<|quad_end|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151652": {
"content": "<|vision_start|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151653": {
"content": "<|vision_end|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151654": {
"content": "<|vision_pad|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151655": {
"content": "<|image_pad|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151656": {
"content": "<|video_pad|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": true
},
"151657": {
"content": "<tool_call>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"151658": {
"content": "</tool_call>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"151659": {
"content": "<|fim_prefix|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"151660": {
"content": "<|fim_middle|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"151661": {
"content": "<|fim_suffix|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"151662": {
"content": "<|fim_pad|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"151663": {
"content": "<|repo_name|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"151664": {
"content": "<|file_sep|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"151665": {
"content": "<tool_response>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"151666": {
"content": "</tool_response>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"151667": {
"content": "<think>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
},
"151668": {
"content": "</think>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false,
"special": false
}
},
"additional_special_tokens": [
"<|im_start|>",
"<|im_end|>",
"<|object_ref_start|>",
"<|object_ref_end|>",
"<|box_start|>",
"<|box_end|>",
"<|quad_start|>",
"<|quad_end|>",
"<|vision_start|>",
"<|vision_end|>",
"<|vision_pad|>",
"<|image_pad|>",
"<|video_pad|>"
],
"bos_token": null,
"clean_up_tokenization_spaces": false,
"eos_token": "<|im_end|>",
"errors": "replace",
"extra_special_tokens": {},
"model_max_length": 262144,
"pad_token": "<|endoftext|>",
"processor_class": "Qwen3VLProcessor",
"split_special_tokens": false,
"tokenizer_class": "Qwen2Tokenizer",
"unk_token": null
}

View File

@@ -0,0 +1,41 @@
{
"crop_size": null,
"data_format": "channels_first",
"default_to_square": true,
"device": null,
"do_center_crop": null,
"do_convert_rgb": true,
"do_normalize": true,
"do_rescale": true,
"do_resize": true,
"do_sample_frames": true,
"fps": 2,
"image_mean": [
0.5,
0.5,
0.5
],
"image_std": [
0.5,
0.5,
0.5
],
"input_data_format": null,
"max_frames": 768,
"merge_size": 2,
"min_frames": 4,
"num_frames": null,
"pad_size": null,
"patch_size": 16,
"processor_class": "Qwen3VLProcessor",
"resample": 3,
"rescale_factor": 0.00392156862745098,
"return_metadata": false,
"size": {
"longest_edge": 25165824,
"shortest_edge": 4096
},
"temporal_patch_size": 2,
"video_metadata": null,
"video_processor_type": "Qwen3VLVideoProcessor"
}

BIN
vocab.json (Stored with Git LFS) Normal file

Binary file not shown.