commit 95a9f04dbd95f1208f7ce883311a6410c35e0b5d Author: ModelHub XC Date: Sat Sep 26 14:50:13 2026 +0800 初始化项目,由ModelHub XC社区提供模型 Model: meituan/EvoCUA-8B-20260105 Source: Original Platform diff --git a/.gitattributes b/.gitattributes new file mode 100644 index 0000000..9f0bc47 --- /dev/null +++ b/.gitattributes @@ -0,0 +1,59 @@ +*.7z filter=lfs diff=lfs merge=lfs -text +*.arrow filter=lfs diff=lfs merge=lfs -text +*.bin filter=lfs diff=lfs merge=lfs -text +*.bin.* filter=lfs diff=lfs merge=lfs -text +*.bz2 filter=lfs diff=lfs merge=lfs -text +*.ftz filter=lfs diff=lfs merge=lfs -text +*.gz filter=lfs diff=lfs merge=lfs -text +*.h5 filter=lfs diff=lfs merge=lfs -text +*.joblib filter=lfs diff=lfs merge=lfs -text +*.lfs.* filter=lfs diff=lfs merge=lfs -text +*.model filter=lfs diff=lfs merge=lfs -text +*.msgpack filter=lfs diff=lfs merge=lfs -text +*.onnx filter=lfs diff=lfs merge=lfs -text +*.ot filter=lfs diff=lfs merge=lfs -text +*.parquet filter=lfs diff=lfs merge=lfs -text +*.pb filter=lfs diff=lfs merge=lfs -text +*.pt filter=lfs diff=lfs merge=lfs -text +*.pth filter=lfs diff=lfs merge=lfs -text +*.rar filter=lfs diff=lfs merge=lfs -text +saved_model/**/* filter=lfs diff=lfs merge=lfs -text +*.tar.* filter=lfs diff=lfs merge=lfs -text +*.tflite filter=lfs diff=lfs merge=lfs -text +*.tgz filter=lfs diff=lfs merge=lfs -text +*.xz filter=lfs diff=lfs merge=lfs -text +*.zip filter=lfs diff=lfs merge=lfs -text +*.zstandard filter=lfs diff=lfs merge=lfs -text +*.tfevents* filter=lfs diff=lfs merge=lfs -text +*.db* filter=lfs diff=lfs merge=lfs -text +*.ark* filter=lfs diff=lfs merge=lfs -text +**/*ckpt*data* filter=lfs diff=lfs merge=lfs -text +**/*ckpt*.meta filter=lfs diff=lfs merge=lfs -text +**/*ckpt*.index filter=lfs diff=lfs merge=lfs -text + +*.ckpt filter=lfs diff=lfs merge=lfs -text +*.gguf* filter=lfs diff=lfs merge=lfs -text +*.ggml filter=lfs diff=lfs merge=lfs -text +*.llamafile* filter=lfs diff=lfs merge=lfs -text +*.pt2 filter=lfs diff=lfs merge=lfs -text +*.mlmodel filter=lfs diff=lfs merge=lfs -text +*.npy filter=lfs diff=lfs merge=lfs -text +*.npz filter=lfs diff=lfs merge=lfs -text +*.pickle filter=lfs diff=lfs merge=lfs -text +*.pkl filter=lfs diff=lfs merge=lfs -text +*.tar filter=lfs diff=lfs merge=lfs -text +*.wasm filter=lfs diff=lfs merge=lfs -text +*.zst filter=lfs diff=lfs merge=lfs -text +*tfevents* filter=lfs diff=lfs merge=lfs -text + +vocab.json filter=lfs diff=lfs merge=lfs -text +model-00002-of-00004.safetensors filter=lfs diff=lfs merge=lfs -text +merges.txt filter=lfs diff=lfs merge=lfs -text +model-00001-of-00004.safetensors filter=lfs diff=lfs merge=lfs -text +tokenizer.json filter=lfs diff=lfs merge=lfs -text +model-00004-of-00004.safetensors filter=lfs diff=lfs merge=lfs -text +model-00003-of-00004.safetensors filter=lfs diff=lfs merge=lfs -text + +tech_report.pdf filter=lfs diff=lfs merge=lfs -text + +assets/images/animation_show_case.gif filter=lfs diff=lfs merge=lfs -text \ No newline at end of file diff --git a/README.md b/README.md new file mode 100644 index 0000000..e7da52f --- /dev/null +++ b/README.md @@ -0,0 +1,250 @@ +--- +license: apache-2.0 +language: + - en + - zh +tags: + - computer-use + - gui-agent + - osworld + - multimodal +--- + +
+ +# EvoCUA: Evolving Computer Use Agent + +**🥇 #1 Open-Source Model on OSWorld | A General-Purpose Multimodal Model Excelling at Computer Use** + +[![Model](https://img.shields.io/badge/🤗%20HuggingFace-EvoCUA--32B-blue)](https://huggingface.co/meituan/EvoCUA-32B-20260105) +[![Model](https://img.shields.io/badge/🤗%20HuggingFace-EvoCUA--8B-blue)](https://huggingface.co/meituan/EvoCUA-8B-20260105) +[![OSWorld Score](https://img.shields.io/badge/OSWorld-56.7%25-brightgreen)](https://os-world.github.io/) +[![License](https://img.shields.io/badge/License-Apache%202.0-orange)](./LICENSE) + +[English](./README.md) | [中文](./README_CN.md) + +OSWorld Leaderboard + +**🥇 #1 Open-Source Model on OSWorld Leaderboard (Jan 2026)** + +
+ +--- + +## 📢 Updates +- **2026.03.31**: EvoCUA-32B achieves **56.48%** on WindowsAgentArena (WAA), surpassing the base model Qwen3-VL-32B-Thinking (42.9%) by ~13.6 points and UI-TARS-2 (50.6%) by ~6 points — demonstrating strong zero-shot cross-OS generalization 🆕 +- **2026.03.31**: Independent safety study by Yoshua Bengio & Dawn Song's teams ([arXiv:2602.08235](https://arxiv.org/abs/2602.08235)) shows **EvoCUA-32B has the lowest unintended-behavior rate (35.0%)** among all tested CUAs — the safest agent! 🆕 +- **2026.01.23**: EvoCUA ranked **#1** on [Hugging Face Daily Papers](https://huggingface.co/papers/2601.15876) 🏆 +- **2026.01.22**: Released [EvoCUA Technical Report](./tech_report.pdf) 📄 +- **2026.01.13**: Released [EvoCUA-8B-20260105](https://huggingface.co/meituan/EvoCUA-8B-20260105) — achieves **46.1%** on OSWorld, **competitive with 72B-level models using fewer parameters!** +- **2026.01.05**: Released [EvoCUA-32B-20260105](https://huggingface.co/meituan/EvoCUA-32B-20260105) with **56.7%** on OSWorld, achieving **#1** among open-source models 🥇 + +--- + +## 🌟 Highlights + +- 🥇 **#1 Open-Source Model on OSWorld**: Achieves **56.7%** task completion rate, **#1 among all open-source models** +- 📈 **Significant Improvements**: +11.7% over OpenCUA-72B (45.0%→56.7%), +15.1% over Qwen3-VL thinking (41.6%→56.7%), with fewer parameters and half the steps +- 🖥️ **End-to-End Multi-Turn Automation**: Operates Chrome, Excel, PowerPoint, VSCode and more through screenshots and natural language instructions +- 🧠 **Novel Training Method**: Our data synthesis and training approach consistently improves Computer Use capability across multiple open-source VLMs without degrading general performance + +--- + +## 📊 Performance Comparison + +| Rank | Model | Open/Closed | Type | Max Steps | Score | +|------|-------|-------------|------|-----------|-------| +| 1 | Claude-sonnet-4-5 | 🔒 Closed | General | 100 | 62.9% | +| 2 | Seed-1.8 | 🔒 Closed | General | 100 | 61.9% | +| 3 | Claude-sonnet-4-5 | 🔒 Closed | General | 50 | 58.1% | +| **4** | **EvoCUA-20260105 (Ours)** | **🟢 Open** | **General** | **50** | **56.7% 🥇** | +| 5 | DeepMiner-Mano-72B | 🔒 Closed | Specialized | 100 | 53.9% | +| 6 | UI-TARS-2-2509 | 🔒 Closed | General | 100 | 53.1% | +| 7 | EvoCUA (Previous Version) | 🔒 Closed | General | 50 | 50.3% | +| **8** | **EvoCUA-8B-20260105 (Ours)** | **🟢 Open** | **General** | **50** | **46.1%** | +| 9 | OpenCUA-72B | 🟢 Open | Specialized | 100 | 45.0% | +| ... | ... | ... | ... | ... | ... | +| 13 | Qwen3-VL-Flash | 🔒 Closed | General | 100 | 41.6% | + +> EvoCUA is **#1 among all open-source models**, achieving competitive results with only **50 steps**. Human-level performance remains significantly higher, indicating substantial room for improvement. + +### Zero-shot Cross-OS Control (WindowsAgentArena) + +We evaluated EvoCUA on [WindowsAgentArena (WAA)](https://microsoft.github.io/WindowsAgentArena/) to test generalization from the Linux-based training environment to a wholly different OS platform. As shown below, EvoCUA-32B reaches **56.48%**, surpassing the base model Qwen3-VL-32B-Thinking (42.9%) by ~13.6 points and the leading frontier GUI agent UI-TARS-2 (50.6%) by nearly **6 points**. + +| Model | WAA | +|-------|-----| +| Qwen3-VL-32B-Instruct | 30.9% [1] | +| Qwen3-VL-32B-Thinking (Base) | 42.9% [1] | +| UI-TARS-2 | 50.6% [2] | +| **EvoCUA-32B (Ours)** | **56.48%** | + +> [1] Bai et al., *Qwen3-VL Technical Report* (arXiv:2511.21631, 2025). +> [2] Wang et al., *UI-TARS-2 Technical Report* (arXiv:2509.02544, 2025). + +### Safety — Robustness to Unintended Behaviors + +A recent study by [Jones et al. (2026)](https://arxiv.org/abs/2602.08235) from Yoshua Bengio and Dawn Song's teams systematically evaluated the safety of leading CUAs. They transferred 117 human-verified perturbations (benign but tricky instructions) to multiple target agents, executing each instruction 3 times and reporting the percentage that elicits unintended behavior in ≥ 1 run. **EvoCUA-32B achieves the lowest overall rate (35.0%)**, demonstrating the strongest robustness among all tested CUAs. + +
+Transferability Study Results (Table 2 from the paper) + +| Target Agent | Claude 4.5 Haiku | Claude 4.5 Opus | Overall | +|---|---|---|---| +| **Open-Source CUAs** | | | | +| EvoCUA-8B | 20.0 | 50.7 | 37.6 | +| **EvoCUA-32B (Ours)** | **24.0** | **43.3** | **35.0 🥇** | +| OpenCUA-7B | 42.0 | 50.7 | 47.0 | +| OpenCUA-32B | 42.0 | 44.8 | 43.6 | +| OpenCUA-72B | 50.0 | 56.7 | 53.8 | +| **Closed-Source CUAs** | | | | +| Claude 4.5 Sonnet | 32.0 | 47.8 | 41.0 | +| Operator | 38.0 | 56.7 | 48.7 | + +> *Lower is safer.* EvoCUA-32B has the lowest overall unintended-behavior rate among all tested agents. + +
+ +> [3] Jones et al., *When Benign Inputs Lead to Severe Harms: Eliciting Unsafe Unintended Behaviors of Computer-Use Agents* (arXiv:2602.08235, 2026). + +--- + +## 🚀 Quick Start + +### Installation + +Python 3.12 is recommended. + +```bash +git clone https://github.com/meituan/EvoCUA.git +cd EvoCUA +python3 -m venv .venv +source .venv/bin/activate +pip install -r requirements.txt +``` + +### Model Download & Deployment + +EvoCUA requires downloading the model weights from HuggingFace and deploying with **vLLM** as an OpenAI-compatible inference server. + +Recommended versions: +- torch: 2.8.0+cu126 +- transformers: 4.57.3 +- vllm: 0.11.0 + +```bash +# 1) Download model weights +huggingface-cli download meituan/EvoCUA-32B-20260105 \ + --local-dir /path/to/EvoCUA-32B \ + --local-dir-use-symlinks False + +# 2) Launch vLLM serving (recommend separate environment) +vllm serve /path/to/EvoCUA-32B \ + --served-model-name EvoCUA \ + --host 0.0.0.0 \ + --port 8080 \ + --tensor-parallel-size 2 + +# 3) Set environment variables +# Environment variables can be configured in .env file (see env.template for reference): +cp env.template .env +# Edit .env with your configurations, e.g., +export OPENAI_API_KEY="dummy" +export OPENAI_BASE_URL="http://127.0.0.1:8080/v1" +``` + +### Run Evaluation on OSWorld + +```bash +python3 run_multienv_evocua.py \ + --headless \ + --provider_name aws \ + --observation_type screenshot \ + --model EvoCUA-S2 \ + --result_dir ./evocua_results \ + --test_all_meta_path evaluation_examples/test_nogdrive.json \ + --max_steps 50 \ + --num_envs 30 \ + --temperature 0.01 \ + --max_history_turns 4 \ + --coordinate_type relative \ + --resize_factor 32 \ + --prompt_style S2 +``` + +--- + +## 📁 Project Structure + +``` +EvoCUA/ +├── run_multienv_evocua.py # Main entry point (multi-env parallel evaluation) +├── lib_run_single.py # Single task rollout logic (trajectory, screenshots, recording, scoring) +├── lib_results_logger.py # Real-time result aggregation to results.json +├── desktop_env/ # OSWorld environment implementation +│ ├── providers/ # VM providers (AWS/VMware/Docker/etc.) +│ ├── controllers/ # Environment controllers +│ └── evaluators/ # Task evaluators +├── mm_agents/ +│ └── evocua/ # EvoCUA agent (prompts, parsing, action generation) +└── evaluation_examples/ # OSWorld task configurations +``` + +--- + + +## 📖 About OSWorld + +[OSWorld](https://os-world.github.io/) is the most influential benchmark in the Computer Use Agent domain. It is adopted by leading AI organizations including **OpenAI, Anthropic, ByteDance Seed, Moonshot AI, Zhipu AI, Step**, and more. OSWorld evaluates agents' ability to complete real-world computer tasks through multi-turn interactions with actual desktop environments. + +--- + +## 🔗 Resources + +- 🤗 **Model Weights**: + - [meituan/EvoCUA-32B-20260105](https://huggingface.co/meituan/EvoCUA-32B-20260105) - OSWorld Score: **56.7%** 🥇 + - [meituan/EvoCUA-8B-20260105](https://huggingface.co/meituan/EvoCUA-8B-20260105) - OSWorld Score: **46.06%** 🆕 +- 📊 **OSWorld Benchmark**: [os-world.github.io](https://os-world.github.io/) +- 📄 **Technical Report**: [tech_report.pdf](./tech_report.pdf) +- 🚀 **More Model Sizes**: More models of various sizes are on the way! + +--- + +## 🙏 Acknowledgements + +We sincerely thank the open-source community for their outstanding contributions to the Computer Use Agent field. We are grateful to **Xinyuan Wang** ([OpenCUA](https://github.com/xlang-ai/OpenCUA)) and **Tianbao Xie** ([OSWorld](https://github.com/xlang-ai/OSWorld)) for their insightful discussions, valuable feedback on evaluation, and continuous support throughout this project. Their pioneering work has greatly inspired and advanced our research. We are committed to giving back to the community and will continue to open-source our research to advance the field. + +--- + +## 📝 Citation + +If you find EvoCUA useful in your research, please consider citing: + +```bibtex +@article{xue2026evocua, + title={EvoCUA: Evolving Computer Use Agents via Learning from Scalable Synthetic Experience}, + author={Xue, Taofeng and Peng, Chong and Huang, Mianqiu and Guo, Linsen and Han, Tiancheng and Wang, Haozhe and Wang, Jianing and Zhang, Xiaocheng and Yang, Xin and Zhao, Dengchang and others}, + journal={arXiv preprint arXiv:2601.15876}, + year={2026} +} +``` + +--- + +## 📜 License + +This project is licensed under the Apache 2.0 License - see the [LICENSE](./LICENSE) file for details. + +--- + +## 📈 Star Growth +[![Star History Chart](https://api.star-history.com/svg?repos=meituan/EvoCUA&type=Date)](https://star-history.com/#meituan/EvoCUA&Date) + +--- + +
+ +**Built with ❤️ by Meituan LongCat Team** + +
+ diff --git a/README_CN.md b/README_CN.md new file mode 100644 index 0000000..745c30a --- /dev/null +++ b/README_CN.md @@ -0,0 +1,245 @@ +
+ +# EvoCUA: Evolving Computer Use Agent + +**🥇 OSWorld 开源模型 No.1 | 擅长计算机操作的通用多模态大模型** + +[![Model](https://img.shields.io/badge/🤗%20HuggingFace-EvoCUA--32B-blue)](https://huggingface.co/meituan/EvoCUA-32B-20260105) +[![Model](https://img.shields.io/badge/🤗%20HuggingFace-EvoCUA--8B-blue)](https://huggingface.co/meituan/EvoCUA-8B-20260105) +[![OSWorld Score](https://img.shields.io/badge/OSWorld-56.7%25-brightgreen)](https://os-world.github.io/) +[![License](https://img.shields.io/badge/License-Apache%202.0-orange)](./LICENSE) + +[English](./README.md) | [中文](./README_CN.md) + +OSWorld Leaderboard + +**🥇 开源模型第一 | OSWorld 排行榜(2026年1月)** + +
+ +--- + +## 📢 更新日志 +- **2026.03.31**:EvoCUA-32B 在 WindowsAgentArena (WAA) 上取得 **56.48%**,超越基线模型 Qwen3-VL-32B-Thinking(42.9%)约 13.6 个百分点,超越 UI-TARS-2(50.6%)约 6 个百分点——展现出强大的零样本跨操作系统泛化能力 🆕 +- **2026.03.31**:Yoshua Bengio 与 Dawn Song 团队的独立安全性研究([arXiv:2602.08235](https://arxiv.org/abs/2602.08235))表明 **EvoCUA-32B 的非预期行为触发率最低(35.0%)**——在所有受测 CUA 中最安全!🆕 +- **2026.01.23**: EvoCUA 在 [Hugging Face Daily Papers](https://huggingface.co/papers/2601.15876) **中排名 (#1)** 🏆 +- **2026.01.22**:发布[EvoCUA技术报告](https://arxiv.org/abs/2601.15876) 📄 +- **2026.01.13**:发布 [EvoCUA-8B-20260105](https://huggingface.co/meituan/EvoCUA-8B-20260105) — OSWorld 得分 **46.1%**,**以更小的参数量实现与 72B 级别开源模型相当的性能!** +- **2026.01.05**:发布 [EvoCUA-32B-20260105](https://huggingface.co/meituan/EvoCUA-32B-20260105),OSWorld 得分 **56.7%**,登顶**开源模型榜首** 🥇 + +--- + +## 🌟 亮点 + +- 🥇 **开源模型榜首**:在 OSWorld 上达到 **56.7%** 的任务完成率,位居**所有开源模型第一**。 +- 📈 **性能显著提升**:相比 OpenCUA-72B 提升 11.7%(45.0%→56.7%),相比 Qwen3-VL Thinking 提升 15.1%(41.6%→56.7%),且**参数更少、步数减半**。 +- 🖥️ **端到端多轮自动化**:仅凭屏幕截图和自然语言指令,即可流畅操作 Chrome、Excel、PPT、VSCode 等各类软件,完成复杂任务。 +- 🧠 **创新训练范式**:采用独特的数据合成与训练方法,在大幅提升 Computer Use 能力的同时,保持了模型的通用多模态能力。 + +--- + +## 📊 性能对比 + +| 排名 | 模型 | 开源/闭源 | 类型 | 最大步数 | 得分 | +|------|------|-----------|------|----------|------| +| 1 | Claude-sonnet-4-5 | 🔒 闭源 | 通用模型 | 100 | 62.9% | +| 2 | Seed-1.8 | 🔒 闭源 | 通用模型 | 100 | 61.9% | +| 3 | Claude-sonnet-4-5 | 🔒 闭源 | 通用模型 | 50 | 58.1% | +| **4** | **EvoCUA-20260105 (Ours)** | **🟢 开源** | **通用模型** | **50** | **56.7% 🥇** | +| 5 | DeepMiner-Mano-72B | 🔒 闭源 | 专用模型 | 100 | 53.9% | +| 6 | UI-TARS-2-2509 | 🔒 闭源 | 通用模型 | 100 | 53.1% | +| 7 | EvoCUA (Previous) | 🔒 闭源 | 通用模型 | 50 | 50.3% | +| **8** | **EvoCUA-8B-20260105 (Ours)** | **🟢 开源** | **通用模型** | **50** | **46.1%** | +| 9 | OpenCUA-72B | 🟢 开源 | 专用模型 | 100 | 45.0% | +| ... | ... | ... | ... | ... | ... | +| 13 | Qwen3-VL-Flash | 🔒 闭源 | 通用模型 | 100 | 41.6% | + +> EvoCUA 高居**开源模型第一**,仅需 **50 步**即可达到极具竞争力的效果。尽管如此,人类水平仍显著高于当前最佳模型,该领域仍有巨大的探索与提升空间。 + +### 零样本跨操作系统泛化(WindowsAgentArena) + +我们在 [WindowsAgentArena (WAA)](https://microsoft.github.io/WindowsAgentArena/) 上对 EvoCUA 进行了评测,以验证模型从 Linux 训练环境向全新操作系统平台的泛化能力。如下表所示,EvoCUA-32B 达到 **56.48%**,超越基线模型 Qwen3-VL-32B-Thinking(42.9%)约 13.6 个百分点,超越领先的前沿 GUI Agent UI-TARS-2(50.6%)近 **6 个百分点**。 + +| 模型 | WAA | +|------|-----| +| Qwen3-VL-32B-Instruct | 30.9% [1] | +| Qwen3-VL-32B-Thinking (Base) | 42.9% [1] | +| UI-TARS-2 | 50.6% [2] | +| **EvoCUA-32B (Ours)** | **56.48%** | + +> [1] Bai et al., *Qwen3-VL Technical Report* (arXiv:2511.21631, 2025). +> [2] Wang et al., *UI-TARS-2 Technical Report* (arXiv:2509.02544, 2025). + +### 安全性 — 抵抗非预期行为的鲁棒性 + +来自 Yoshua Bengio 和 Dawn Song 团队的最新研究 [Jones et al. (2026)](https://arxiv.org/abs/2602.08235) 系统评估了主流 CUA 的安全性。该研究将 117 条经人工验证的扰动指令(看似无害但具有误导性)迁移至多个目标 Agent,每条指令执行 3 次,报告在 ≥ 1 次运行中触发非预期行为的指令百分比。**EvoCUA-32B 以 35.0% 的最低整体触发率**,在所有受测 CUA 中展现出最强的安全鲁棒性。 + +
+可迁移性研究结果(论文 Table 2) + +| 目标 Agent | Claude 4.5 Haiku | Claude 4.5 Opus | 整体 | +|---|---|---|---| +| **开源 CUA** | | | | +| EvoCUA-8B | 20.0 | 50.7 | 37.6 | +| **EvoCUA-32B (Ours)** | **24.0** | **43.3** | **35.0 🥇** | +| OpenCUA-7B | 42.0 | 50.7 | 47.0 | +| OpenCUA-32B | 42.0 | 44.8 | 43.6 | +| OpenCUA-72B | 50.0 | 56.7 | 53.8 | +| **闭源 CUA** | | | | +| Claude 4.5 Sonnet | 32.0 | 47.8 | 41.0 | +| Operator | 38.0 | 56.7 | 48.7 | + +> *数值越低越安全。* EvoCUA-32B 在所有受测 Agent 中非预期行为触发率最低。 + +
+ +> [3] Jones et al., *When Benign Inputs Lead to Severe Harms: Eliciting Unsafe Unintended Behaviors of Computer-Use Agents* (arXiv:2602.08235, 2026). + +--- + +## 🎬 Demo展示 + +模型上网查询如何配置rbenv开发环境并帮用户安装: + +Demo展示动图 + +--- + +## 🚀 快速开始 + +### 安装环境 + +推荐使用 Python 3.12。 + +```bash +git clone https://github.com/meituan/EvoCUA.git +cd EvoCUA +python3 -m venv .venv +source .venv/bin/activate +pip install -r requirements.txt +``` + +### 模型下载与部署 + +请先从 HuggingFace 下载 EvoCUA 模型权重,并使用 **vLLM** 将其部署为兼容 OpenAI 接口的推理服务。 + +推荐版本: +- torch: 2.8.0+cu126 +- transformers: 4.57.3 +- vllm: 0.11.0 + +```bash +# 1) 下载模型权重 +huggingface-cli download meituan/EvoCUA-32B-20260105 \ + --local-dir /path/to/EvoCUA-32B \ + --local-dir-use-symlinks False + +# 2) 启动 vLLM 推理服务(建议使用单独的环境) +vllm serve /path/to/EvoCUA-32B \ + --served-model-name EvoCUA \ + --host 0.0.0.0 \ + --port 8080 \ + --tensor-parallel-size 2 + +# 3) 设置环境变量 +# 环境变量可通过 .env 文件进行配置(请参考 env.template): +cp env.template .env +# 编辑 .env 文件,填入您的具体配置,例如: +export OPENAI_API_KEY="dummy" +export OPENAI_BASE_URL="http://127.0.0.1:8080/v1" +``` + +### 在 OSWorld 上运行评测 + +```bash +python3 run_multienv_evocua.py \ + --headless \ + --provider_name aws \ + --observation_type screenshot \ + --model EvoCUA-S2 \ + --result_dir ./evocua_results \ + --test_all_meta_path evaluation_examples/test_nogdrive.json \ + --max_steps 50 \ + --num_envs 30 \ + --temperature 0.01 \ + --max_history_turns 4 \ + --coordinate_type relative \ + --resize_factor 32 \ + --prompt_style S2 +``` + +--- + +## 📁 项目结构 + +``` +EvoCUA/ +├── run_multienv_evocua.py # 评测入口(支持多环境并行) +├── lib_run_single.py # 单任务 Rollout 执行逻辑(含轨迹记录、截图、录屏、评分) +├── lib_results_logger.py # 评测结果实时汇总(写入 results.json) +├── desktop_env/ # OSWorld 环境端实现 +│ ├── providers/ # 虚拟机提供商接口(AWS/VMware/Docker 等) +│ ├── controllers/ # 环境控制器 +│ └── evaluators/ # 任务评估器 +├── mm_agents/ +│ └── evocua/ # EvoCUA Agent 核心代码(Prompt构建、输出解析、动作生成) +└── evaluation_examples/ # OSWorld 任务配置集 +``` + +--- + + +## 📖 关于 OSWorld + +[OSWorld](https://os-world.github.io/) 是 Computer Use Agent 领域最具影响力的基准测试,被 **OpenAI、Anthropic、字节跳动 Seed、月之暗面、智谱 AI、阶跃星辰** 等众多顶尖 AI 团队广泛采用。OSWorld 通过模拟真实桌面环境中的多轮交互,全面评估 Agent 完成实际计算机任务的能力。 + +--- + +## 🔗 相关资源 + +- 🤗 **模型权重**: + - [meituan/EvoCUA-32B-20260105](https://huggingface.co/meituan/EvoCUA-32B-20260105) - OSWorld 得分:**56.7%** 🥇 + - [meituan/EvoCUA-8B-20260105](https://huggingface.co/meituan/EvoCUA-8B-20260105) - OSWorld 得分:**46.06%** 🆕 +- 📊 **OSWorld 基准测试**:[os-world.github.io](https://os-world.github.io/) +- 📄 **技术报告**:[tech_report.pdf](https://arxiv.org/abs/2601.15876) +- 🚀 **更多规格**:更多尺寸的模型正在路上! + +--- + +## 🙏 致谢 + +我们诚挚感谢开源社区在 Computer Use Agent 领域的杰出贡献。特别感谢 **Xinyuan Wang**([OpenCUA](https://github.com/xlang-ai/OpenCUA))和 **Tianbao Xie**([OSWorld](https://github.com/xlang-ai/OSWorld))在评测、技术探讨及反馈方面提供的宝贵支持,他们的开创性工作极大地启发并推动了本项目的发展。我们致力于回馈社区,并将持续开源研究成果,与大家共同推动领域进步。 + +--- + +## 📝 引用 + +如果您觉得 EvoCUA 对您的研究有帮助,请考虑引用: + +```bibtex +@article{xue2026evocua, + title={EvoCUA: Evolving Computer Use Agents via Learning from Scalable Synthetic Experience}, + author={Xue, Taofeng and Peng, Chong and Huang, Mianqiu and Guo, Linsen and Han, Tiancheng and Wang, Haozhe and Wang, Jianing and Zhang, Xiaocheng and Yang, Xin and Zhao, Dengchang and others}, + journal={arXiv preprint arXiv:2601.15876}, + year={2026} +} +``` + +--- + +## 📜 开源协议 + +本项目基于 Apache 2.0 协议开源,详见 [LICENSE](./LICENSE) 文件。 + +--- + +## 📈 Star增长 +[![Star History Chart](https://api.star-history.com/svg?repos=meituan/EvoCUA&type=Date)](https://star-history.com/#meituan/EvoCUA&Date) + +--- + +
+ +**由美团 LongCat 团队用 ❤️ 打造** + +
diff --git a/added_tokens.json b/added_tokens.json new file mode 100644 index 0000000..b54f913 --- /dev/null +++ b/added_tokens.json @@ -0,0 +1,28 @@ +{ + "": 151668, + "": 151658, + "": 151666, + "": 151667, + "": 151657, + "": 151665, + "<|box_end|>": 151649, + "<|box_start|>": 151648, + "<|endoftext|>": 151643, + "<|file_sep|>": 151664, + "<|fim_middle|>": 151660, + "<|fim_pad|>": 151662, + "<|fim_prefix|>": 151659, + "<|fim_suffix|>": 151661, + "<|im_end|>": 151645, + "<|im_start|>": 151644, + "<|image_pad|>": 151655, + "<|object_ref_end|>": 151647, + "<|object_ref_start|>": 151646, + "<|quad_end|>": 151651, + "<|quad_start|>": 151650, + "<|repo_name|>": 151663, + "<|video_pad|>": 151656, + "<|vision_end|>": 151653, + "<|vision_pad|>": 151654, + "<|vision_start|>": 151652 +} diff --git a/assets/images/animation_show_case.gif b/assets/images/animation_show_case.gif new file mode 100644 index 0000000..b694943 --- /dev/null +++ b/assets/images/animation_show_case.gif @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0475114db10719b8043a98fc6ff96ce014fd98537433a3aa9afacf6f9bcf40ab +size 13366588 diff --git a/assets/images/osworld_leaderboard.png b/assets/images/osworld_leaderboard.png new file mode 100644 index 0000000..911aff7 Binary files /dev/null and b/assets/images/osworld_leaderboard.png differ diff --git a/chat_template.jinja b/chat_template.jinja new file mode 100644 index 0000000..551cd6a --- /dev/null +++ b/chat_template.jinja @@ -0,0 +1,110 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count) %} + {%- if content is string %} + {{- content }} + {%- else %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %}Picture {{ image_count.value }}: {% endif -%} + <|vision_start|><|image_pad|><|vision_end|> + {%- elif 'video' in item or item.type == 'video' %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %}Video {{ video_count.value }}: {% endif -%} + <|vision_start|><|video_pad|><|vision_end|> + {%- elif 'text' in item %} + {{- item.text }} + {%- endif %} + {%- endfor %} + {%- endif %} +{%- endmacro %} +{%- if tools %} + {{- '<|im_start|>system\n' }} + {%- if messages[0].role == 'system' %} + {{- render_content(messages[0].content, false) + '\n\n' }} + {%- endif %} + {{- "# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within XML tags:\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n\n\nFor each function call, return a json object with function name and arguments within XML tags:\n\n{\"name\": , \"arguments\": }\n<|im_end|>\n" }} +{%- else %} + {%- if messages[0].role == 'system' %} + {{- '<|im_start|>system\n' + render_content(messages[0].content, false) + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false) %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- for message in messages %} + {%- set content = render_content(message.content, True) %} + {%- if (message.role == "user") or (message.role == "system" and not loop.first) %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- if loop.index0 > ns.last_query_index %} + {%- if loop.last or (not loop.last and reasoning_content) %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content.strip('\n') + '\n\n\n' + content.lstrip('\n') }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls %} + {%- for tool_call in message.tool_calls %} + {%- if (loop.first and content) or (not loop.first) %} + {{- '\n' }} + {%- endif %} + {%- if tool_call.function %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {{- '\n{"name": "' }} + {{- tool_call.name }} + {{- '", "arguments": ' }} + {%- if tool_call.arguments is string %} + {{- tool_call.arguments }} + {%- else %} + {{- tool_call.arguments | tojson }} + {%- endif %} + {{- '}\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.first or (messages[loop.index0 - 1].role != "tool") %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n\n' }} +{%- endif %} diff --git a/config.json b/config.json new file mode 100644 index 0000000..24c3935 --- /dev/null +++ b/config.json @@ -0,0 +1,69 @@ +{ + "architectures": [ + "Qwen3VLForConditionalGeneration" + ], + "dtype": "bfloat16", + "eos_token_id": 151645, + "hidden_size": 4096, + "image_token_id": 151655, + "model_type": "qwen3_vl", + "pad_token_id": 151643, + "text_config": { + "attention_bias": false, + "attention_dropout": 0.0, + "bos_token_id": 151643, + "dtype": "bfloat16", + "eos_token_id": 151645, + "head_dim": 128, + "hidden_act": "silu", + "hidden_size": 4096, + "initializer_range": 0.02, + "intermediate_size": 12288, + "max_position_embeddings": 262144, + "model_type": "qwen3_vl_text", + "num_attention_heads": 32, + "num_hidden_layers": 36, + "num_key_value_heads": 8, + "pad_token_id": 151643, + "rms_norm_eps": 1e-06, + "rope_scaling": { + "mrope_interleaved": true, + "mrope_section": [ + 24, + 20, + 20 + ], + "rope_type": "default" + }, + "rope_theta": 5000000, + "use_cache": false, + "vocab_size": 151936 + }, + "tie_word_embeddings": false, + "transformers_version": "4.57.3", + "video_token_id": 151656, + "vision_config": { + "deepstack_visual_indexes": [ + 8, + 16, + 24 + ], + "depth": 27, + "dtype": "bfloat16", + "hidden_act": "gelu_pytorch_tanh", + "hidden_size": 1152, + "in_channels": 3, + "initializer_range": 0.02, + "intermediate_size": 4304, + "model_type": "qwen3_vl", + "num_heads": 16, + "num_position_embeddings": 2304, + "out_hidden_size": 4096, + "pad_token_id": 151643, + "patch_size": 16, + "spatial_merge_size": 2, + "temporal_patch_size": 2 + }, + "vision_end_token_id": 151653, + "vision_start_token_id": 151652 +} diff --git a/configuration.json b/configuration.json new file mode 100644 index 0000000..4aef15d --- /dev/null +++ b/configuration.json @@ -0,0 +1 @@ +{"framework": "pytorch", "task": "image-text-to-text", "allow_remote": true} \ No newline at end of file diff --git a/generation_config.json b/generation_config.json new file mode 100644 index 0000000..5f37847 --- /dev/null +++ b/generation_config.json @@ -0,0 +1,12 @@ +{ + "bos_token_id": 151643, + "do_sample": true, + "eos_token_id": [ + 151645, + 151643 + ], + "pad_token_id": 151643, + "top_k": 20, + "top_p": 0.95, + "transformers_version": "4.57.3" +} diff --git a/merges.txt b/merges.txt new file mode 100644 index 0000000..80c1a19 --- /dev/null +++ b/merges.txt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:8831e4f1a044471340f7c0a83d7bd71306a5b867e95fd870f74d0c5308a904d5 +size 1671853 diff --git a/model-00001-of-00004.safetensors b/model-00001-of-00004.safetensors new file mode 100644 index 0000000..e9588b5 --- /dev/null +++ b/model-00001-of-00004.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:f67cb369f226e6f39236f11b03751a6701ab77eeea0b625f382785c1277e8403 +size 4998056552 diff --git a/model-00002-of-00004.safetensors b/model-00002-of-00004.safetensors new file mode 100644 index 0000000..e921dfc --- /dev/null +++ b/model-00002-of-00004.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b34b25fcef1773e186203d589b7dfde6f6e31d9a8e3d8dddcbd8dcf18ec76245 +size 4915962464 diff --git a/model-00003-of-00004.safetensors b/model-00003-of-00004.safetensors new file mode 100644 index 0000000..5595a2f --- /dev/null +++ b/model-00003-of-00004.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:253c898441aef6e0657c1af7afde3ec55d042bf93afd61bfc97573d302e4f94d +size 4915962496 diff --git a/model-00004-of-00004.safetensors b/model-00004-of-00004.safetensors new file mode 100644 index 0000000..29e23cd --- /dev/null +++ b/model-00004-of-00004.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:386cf839b1e2b640947679c2fb51fd75bb4432e76201e1777a3d3b5fdde916ec +size 2704357976 diff --git a/model.safetensors.index.json b/model.safetensors.index.json new file mode 100644 index 0000000..c6794f9 --- /dev/null +++ b/model.safetensors.index.json @@ -0,0 +1,757 @@ +{ + "metadata": { + "total_size": 17534247392 + }, + "weight_map": { + "lm_head.weight": "model-00004-of-00004.safetensors", + "model.language_model.embed_tokens.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.0.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.0.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.0.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.0.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.0.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.0.self_attn.k_norm.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.0.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.0.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.0.self_attn.q_norm.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.0.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.0.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.1.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.1.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.1.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.1.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.1.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.1.self_attn.k_norm.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.1.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.1.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.1.self_attn.q_norm.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.1.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.1.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.10.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.10.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.10.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.10.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.10.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.10.self_attn.k_norm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.10.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.10.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.10.self_attn.q_norm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.10.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.10.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.11.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.11.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.11.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.11.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.11.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.11.self_attn.k_norm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.11.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.11.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.11.self_attn.q_norm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.11.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.11.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.12.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.12.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.12.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.12.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.12.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.12.self_attn.k_norm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.12.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.12.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.12.self_attn.q_norm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.12.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.12.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.13.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.13.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.13.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.13.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.13.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.13.self_attn.k_norm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.13.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.13.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.13.self_attn.q_norm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.13.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.13.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.14.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.14.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.14.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.14.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.14.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.14.self_attn.k_norm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.14.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.14.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.14.self_attn.q_norm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.14.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.14.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.15.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.15.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.15.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.15.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.15.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.15.self_attn.k_norm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.15.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.15.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.15.self_attn.q_norm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.15.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.15.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.16.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.16.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.16.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.16.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.16.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.16.self_attn.k_norm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.16.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.16.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.16.self_attn.q_norm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.16.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.16.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.17.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.17.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.17.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.17.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.17.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.17.self_attn.k_norm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.17.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.17.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.17.self_attn.q_norm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.17.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.17.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.18.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.18.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.18.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.18.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.18.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.18.self_attn.k_norm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.18.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.18.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.18.self_attn.q_norm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.18.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.18.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.19.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.19.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.19.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.19.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.19.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.19.self_attn.k_norm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.19.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.19.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.19.self_attn.q_norm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.19.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.19.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.2.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.2.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.2.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.2.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.2.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.2.self_attn.k_norm.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.2.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.2.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.2.self_attn.q_norm.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.2.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.2.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.20.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.20.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.20.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.20.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.20.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.20.self_attn.k_norm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.20.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.20.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.20.self_attn.q_norm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.20.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.20.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.21.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.21.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.21.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.21.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.21.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.21.self_attn.k_norm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.21.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.21.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.21.self_attn.q_norm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.21.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.21.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.22.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.22.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.22.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.22.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.22.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.22.self_attn.k_norm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.22.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.22.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.22.self_attn.q_norm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.22.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.22.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.23.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.23.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.23.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.23.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.23.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.23.self_attn.k_norm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.23.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.23.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.23.self_attn.q_norm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.23.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.23.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.24.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.24.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.24.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.24.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.24.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.24.self_attn.k_norm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.24.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.24.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.24.self_attn.q_norm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.24.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.24.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.25.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.25.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.25.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.25.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.25.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.25.self_attn.k_norm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.25.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.25.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.25.self_attn.q_norm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.25.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.25.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.26.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.26.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.26.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.26.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.26.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.26.self_attn.k_norm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.26.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.26.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.26.self_attn.q_norm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.26.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.26.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.27.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.27.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.27.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.27.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.27.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.27.self_attn.k_norm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.27.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.27.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.27.self_attn.q_norm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.27.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.27.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.28.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.28.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.28.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.28.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.28.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.28.self_attn.k_norm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.28.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.28.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.28.self_attn.q_norm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.28.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.28.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.29.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.29.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.29.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.29.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.29.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.29.self_attn.k_norm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.29.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.29.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.29.self_attn.q_norm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.29.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.29.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.3.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.3.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.3.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.3.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.3.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.3.self_attn.k_norm.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.3.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.3.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.3.self_attn.q_norm.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.3.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.3.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.30.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.30.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.30.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.30.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.30.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.30.self_attn.k_norm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.30.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.30.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.30.self_attn.q_norm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.30.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.30.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.31.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.31.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.31.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.31.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.31.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.31.self_attn.k_norm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.31.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.31.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.31.self_attn.q_norm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.31.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.31.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.32.input_layernorm.weight": "model-00004-of-00004.safetensors", + "model.language_model.layers.32.mlp.down_proj.weight": "model-00004-of-00004.safetensors", + "model.language_model.layers.32.mlp.gate_proj.weight": "model-00004-of-00004.safetensors", + "model.language_model.layers.32.mlp.up_proj.weight": "model-00004-of-00004.safetensors", + "model.language_model.layers.32.post_attention_layernorm.weight": "model-00004-of-00004.safetensors", + "model.language_model.layers.32.self_attn.k_norm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.32.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.32.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.32.self_attn.q_norm.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.32.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.32.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.language_model.layers.33.input_layernorm.weight": "model-00004-of-00004.safetensors", + "model.language_model.layers.33.mlp.down_proj.weight": "model-00004-of-00004.safetensors", + "model.language_model.layers.33.mlp.gate_proj.weight": "model-00004-of-00004.safetensors", + "model.language_model.layers.33.mlp.up_proj.weight": "model-00004-of-00004.safetensors", + "model.language_model.layers.33.post_attention_layernorm.weight": "model-00004-of-00004.safetensors", + "model.language_model.layers.33.self_attn.k_norm.weight": "model-00004-of-00004.safetensors", + "model.language_model.layers.33.self_attn.k_proj.weight": "model-00004-of-00004.safetensors", + "model.language_model.layers.33.self_attn.o_proj.weight": "model-00004-of-00004.safetensors", + "model.language_model.layers.33.self_attn.q_norm.weight": "model-00004-of-00004.safetensors", + "model.language_model.layers.33.self_attn.q_proj.weight": "model-00004-of-00004.safetensors", + "model.language_model.layers.33.self_attn.v_proj.weight": "model-00004-of-00004.safetensors", + "model.language_model.layers.34.input_layernorm.weight": "model-00004-of-00004.safetensors", + "model.language_model.layers.34.mlp.down_proj.weight": "model-00004-of-00004.safetensors", + "model.language_model.layers.34.mlp.gate_proj.weight": "model-00004-of-00004.safetensors", + "model.language_model.layers.34.mlp.up_proj.weight": "model-00004-of-00004.safetensors", + "model.language_model.layers.34.post_attention_layernorm.weight": "model-00004-of-00004.safetensors", + "model.language_model.layers.34.self_attn.k_norm.weight": "model-00004-of-00004.safetensors", + "model.language_model.layers.34.self_attn.k_proj.weight": "model-00004-of-00004.safetensors", + "model.language_model.layers.34.self_attn.o_proj.weight": "model-00004-of-00004.safetensors", + "model.language_model.layers.34.self_attn.q_norm.weight": "model-00004-of-00004.safetensors", + "model.language_model.layers.34.self_attn.q_proj.weight": "model-00004-of-00004.safetensors", + "model.language_model.layers.34.self_attn.v_proj.weight": "model-00004-of-00004.safetensors", + "model.language_model.layers.35.input_layernorm.weight": "model-00004-of-00004.safetensors", + "model.language_model.layers.35.mlp.down_proj.weight": "model-00004-of-00004.safetensors", + "model.language_model.layers.35.mlp.gate_proj.weight": "model-00004-of-00004.safetensors", + "model.language_model.layers.35.mlp.up_proj.weight": "model-00004-of-00004.safetensors", + "model.language_model.layers.35.post_attention_layernorm.weight": "model-00004-of-00004.safetensors", + "model.language_model.layers.35.self_attn.k_norm.weight": "model-00004-of-00004.safetensors", + "model.language_model.layers.35.self_attn.k_proj.weight": "model-00004-of-00004.safetensors", + "model.language_model.layers.35.self_attn.o_proj.weight": "model-00004-of-00004.safetensors", + "model.language_model.layers.35.self_attn.q_norm.weight": "model-00004-of-00004.safetensors", + "model.language_model.layers.35.self_attn.q_proj.weight": "model-00004-of-00004.safetensors", + "model.language_model.layers.35.self_attn.v_proj.weight": "model-00004-of-00004.safetensors", + "model.language_model.layers.4.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.4.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.4.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.4.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.4.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.4.self_attn.k_norm.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.4.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.4.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.4.self_attn.q_norm.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.4.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.4.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.5.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.5.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.5.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.5.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.5.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.5.self_attn.k_norm.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.5.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.5.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.5.self_attn.q_norm.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.5.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.5.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.6.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.6.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.6.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.6.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.6.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.6.self_attn.k_norm.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.6.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.6.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.6.self_attn.q_norm.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.6.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.6.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.language_model.layers.7.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.7.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.7.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.7.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.7.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.7.self_attn.k_norm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.7.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.7.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.7.self_attn.q_norm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.7.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.7.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.8.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.8.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.8.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.8.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.8.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.8.self_attn.k_norm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.8.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.8.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.8.self_attn.q_norm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.8.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.8.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.9.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.9.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.9.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.9.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.9.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.9.self_attn.k_norm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.9.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.9.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.9.self_attn.q_norm.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.9.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.layers.9.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.language_model.norm.weight": "model-00004-of-00004.safetensors", + "model.visual.blocks.0.attn.proj.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.0.attn.proj.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.0.attn.qkv.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.0.attn.qkv.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.0.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.0.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.0.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.0.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.0.norm1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.0.norm1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.0.norm2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.0.norm2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.1.attn.proj.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.1.attn.proj.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.1.attn.qkv.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.1.attn.qkv.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.1.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.1.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.1.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.1.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.1.norm1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.1.norm1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.1.norm2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.1.norm2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.10.attn.proj.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.10.attn.proj.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.10.attn.qkv.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.10.attn.qkv.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.10.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.10.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.10.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.10.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.10.norm1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.10.norm1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.10.norm2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.10.norm2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.11.attn.proj.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.11.attn.proj.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.11.attn.qkv.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.11.attn.qkv.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.11.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.11.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.11.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.11.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.11.norm1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.11.norm1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.11.norm2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.11.norm2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.12.attn.proj.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.12.attn.proj.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.12.attn.qkv.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.12.attn.qkv.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.12.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.12.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.12.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.12.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.12.norm1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.12.norm1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.12.norm2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.12.norm2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.13.attn.proj.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.13.attn.proj.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.13.attn.qkv.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.13.attn.qkv.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.13.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.13.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.13.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.13.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.13.norm1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.13.norm1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.13.norm2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.13.norm2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.14.attn.proj.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.14.attn.proj.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.14.attn.qkv.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.14.attn.qkv.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.14.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.14.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.14.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.14.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.14.norm1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.14.norm1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.14.norm2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.14.norm2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.15.attn.proj.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.15.attn.proj.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.15.attn.qkv.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.15.attn.qkv.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.15.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.15.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.15.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.15.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.15.norm1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.15.norm1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.15.norm2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.15.norm2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.16.attn.proj.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.16.attn.proj.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.16.attn.qkv.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.16.attn.qkv.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.16.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.16.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.16.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.16.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.16.norm1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.16.norm1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.16.norm2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.16.norm2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.17.attn.proj.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.17.attn.proj.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.17.attn.qkv.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.17.attn.qkv.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.17.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.17.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.17.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.17.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.17.norm1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.17.norm1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.17.norm2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.17.norm2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.18.attn.proj.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.18.attn.proj.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.18.attn.qkv.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.18.attn.qkv.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.18.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.18.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.18.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.18.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.18.norm1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.18.norm1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.18.norm2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.18.norm2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.19.attn.proj.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.19.attn.proj.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.19.attn.qkv.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.19.attn.qkv.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.19.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.19.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.19.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.19.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.19.norm1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.19.norm1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.19.norm2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.19.norm2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.2.attn.proj.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.2.attn.proj.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.2.attn.qkv.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.2.attn.qkv.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.2.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.2.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.2.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.2.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.2.norm1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.2.norm1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.2.norm2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.2.norm2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.20.attn.proj.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.20.attn.proj.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.20.attn.qkv.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.20.attn.qkv.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.20.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.20.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.20.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.20.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.20.norm1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.20.norm1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.20.norm2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.20.norm2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.21.attn.proj.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.21.attn.proj.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.21.attn.qkv.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.21.attn.qkv.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.21.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.21.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.21.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.21.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.21.norm1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.21.norm1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.21.norm2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.21.norm2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.22.attn.proj.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.22.attn.proj.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.22.attn.qkv.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.22.attn.qkv.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.22.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.22.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.22.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.22.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.22.norm1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.22.norm1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.22.norm2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.22.norm2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.23.attn.proj.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.23.attn.proj.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.23.attn.qkv.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.23.attn.qkv.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.23.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.23.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.23.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.23.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.23.norm1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.23.norm1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.23.norm2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.23.norm2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.24.attn.proj.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.24.attn.proj.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.24.attn.qkv.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.24.attn.qkv.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.24.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.24.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.24.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.24.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.24.norm1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.24.norm1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.24.norm2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.24.norm2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.25.attn.proj.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.25.attn.proj.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.25.attn.qkv.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.25.attn.qkv.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.25.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.25.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.25.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.25.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.25.norm1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.25.norm1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.25.norm2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.25.norm2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.26.attn.proj.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.26.attn.proj.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.26.attn.qkv.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.26.attn.qkv.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.26.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.26.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.26.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.26.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.26.norm1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.26.norm1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.26.norm2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.26.norm2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.3.attn.proj.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.3.attn.proj.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.3.attn.qkv.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.3.attn.qkv.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.3.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.3.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.3.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.3.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.3.norm1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.3.norm1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.3.norm2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.3.norm2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.4.attn.proj.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.4.attn.proj.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.4.attn.qkv.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.4.attn.qkv.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.4.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.4.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.4.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.4.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.4.norm1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.4.norm1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.4.norm2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.4.norm2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.5.attn.proj.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.5.attn.proj.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.5.attn.qkv.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.5.attn.qkv.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.5.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.5.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.5.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.5.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.5.norm1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.5.norm1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.5.norm2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.5.norm2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.6.attn.proj.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.6.attn.proj.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.6.attn.qkv.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.6.attn.qkv.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.6.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.6.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.6.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.6.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.6.norm1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.6.norm1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.6.norm2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.6.norm2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.7.attn.proj.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.7.attn.proj.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.7.attn.qkv.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.7.attn.qkv.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.7.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.7.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.7.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.7.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.7.norm1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.7.norm1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.7.norm2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.7.norm2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.8.attn.proj.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.8.attn.proj.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.8.attn.qkv.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.8.attn.qkv.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.8.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.8.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.8.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.8.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.8.norm1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.8.norm1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.8.norm2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.8.norm2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.9.attn.proj.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.9.attn.proj.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.9.attn.qkv.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.9.attn.qkv.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.9.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.9.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.9.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.9.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.9.norm1.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.9.norm1.weight": "model-00001-of-00004.safetensors", + "model.visual.blocks.9.norm2.bias": "model-00001-of-00004.safetensors", + "model.visual.blocks.9.norm2.weight": "model-00001-of-00004.safetensors", + "model.visual.deepstack_merger_list.0.linear_fc1.bias": "model-00001-of-00004.safetensors", + "model.visual.deepstack_merger_list.0.linear_fc1.weight": "model-00001-of-00004.safetensors", + "model.visual.deepstack_merger_list.0.linear_fc2.bias": "model-00001-of-00004.safetensors", + "model.visual.deepstack_merger_list.0.linear_fc2.weight": "model-00001-of-00004.safetensors", + "model.visual.deepstack_merger_list.0.norm.bias": "model-00001-of-00004.safetensors", + "model.visual.deepstack_merger_list.0.norm.weight": "model-00001-of-00004.safetensors", + "model.visual.deepstack_merger_list.1.linear_fc1.bias": "model-00001-of-00004.safetensors", + "model.visual.deepstack_merger_list.1.linear_fc1.weight": "model-00001-of-00004.safetensors", + "model.visual.deepstack_merger_list.1.linear_fc2.bias": "model-00001-of-00004.safetensors", + "model.visual.deepstack_merger_list.1.linear_fc2.weight": "model-00001-of-00004.safetensors", + "model.visual.deepstack_merger_list.1.norm.bias": "model-00001-of-00004.safetensors", + "model.visual.deepstack_merger_list.1.norm.weight": "model-00001-of-00004.safetensors", + "model.visual.deepstack_merger_list.2.linear_fc1.bias": "model-00001-of-00004.safetensors", + "model.visual.deepstack_merger_list.2.linear_fc1.weight": "model-00001-of-00004.safetensors", + "model.visual.deepstack_merger_list.2.linear_fc2.bias": "model-00001-of-00004.safetensors", + "model.visual.deepstack_merger_list.2.linear_fc2.weight": "model-00001-of-00004.safetensors", + "model.visual.deepstack_merger_list.2.norm.bias": "model-00001-of-00004.safetensors", + "model.visual.deepstack_merger_list.2.norm.weight": "model-00001-of-00004.safetensors", + "model.visual.merger.linear_fc1.bias": "model-00001-of-00004.safetensors", + "model.visual.merger.linear_fc1.weight": "model-00001-of-00004.safetensors", + "model.visual.merger.linear_fc2.bias": "model-00001-of-00004.safetensors", + "model.visual.merger.linear_fc2.weight": "model-00001-of-00004.safetensors", + "model.visual.merger.norm.bias": "model-00001-of-00004.safetensors", + "model.visual.merger.norm.weight": "model-00001-of-00004.safetensors", + "model.visual.patch_embed.proj.bias": "model-00001-of-00004.safetensors", + "model.visual.patch_embed.proj.weight": "model-00001-of-00004.safetensors", + "model.visual.pos_embed.weight": "model-00001-of-00004.safetensors" + } +} diff --git a/preprocessor_config.json b/preprocessor_config.json new file mode 100644 index 0000000..2ea84a4 --- /dev/null +++ b/preprocessor_config.json @@ -0,0 +1,21 @@ +{ + "size": { + "longest_edge": 16777216, + "shortest_edge": 65536 + }, + "patch_size": 16, + "temporal_patch_size": 2, + "merge_size": 2, + "image_mean": [ + 0.5, + 0.5, + 0.5 + ], + "image_std": [ + 0.5, + 0.5, + 0.5 + ], + "processor_class": "Qwen3VLProcessor", + "image_processor_type": "Qwen2VLImageProcessorFast" +} \ No newline at end of file diff --git a/special_tokens_map.json b/special_tokens_map.json new file mode 100644 index 0000000..ac23c0a --- /dev/null +++ b/special_tokens_map.json @@ -0,0 +1,31 @@ +{ + "additional_special_tokens": [ + "<|im_start|>", + "<|im_end|>", + "<|object_ref_start|>", + "<|object_ref_end|>", + "<|box_start|>", + "<|box_end|>", + "<|quad_start|>", + "<|quad_end|>", + "<|vision_start|>", + "<|vision_end|>", + "<|vision_pad|>", + "<|image_pad|>", + "<|video_pad|>" + ], + "eos_token": { + "content": "<|im_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false + }, + "pad_token": { + "content": "<|endoftext|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false + } +} diff --git a/tech_report.pdf b/tech_report.pdf new file mode 100644 index 0000000..6675bd6 --- /dev/null +++ b/tech_report.pdf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3d62a458a41ed08367f1993b23c5a9f6280613d322e96407eb233726f5d1853b +size 25040699 diff --git a/tokenizer.json b/tokenizer.json new file mode 100644 index 0000000..cd71f61 --- /dev/null +++ b/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:aeb13307a71acd8fe81861d94ad54ab689df773318809eed3cbe794b4492dae4 +size 11422654 diff --git a/tokenizer_config.json b/tokenizer_config.json new file mode 100644 index 0000000..fec7f18 --- /dev/null +++ b/tokenizer_config.json @@ -0,0 +1,240 @@ +{ + "add_bos_token": false, + "add_prefix_space": false, + "added_tokens_decoder": { + "151643": { + "content": "<|endoftext|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151644": { + "content": "<|im_start|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151645": { + "content": "<|im_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151646": { + "content": "<|object_ref_start|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151647": { + "content": "<|object_ref_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151648": { + "content": "<|box_start|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151649": { + "content": "<|box_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151650": { + "content": "<|quad_start|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151651": { + "content": "<|quad_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151652": { + "content": "<|vision_start|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151653": { + "content": "<|vision_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151654": { + "content": "<|vision_pad|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151655": { + "content": "<|image_pad|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151656": { + "content": "<|video_pad|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151657": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151658": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151659": { + "content": "<|fim_prefix|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151660": { + "content": "<|fim_middle|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151661": { + "content": "<|fim_suffix|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151662": { + "content": "<|fim_pad|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151663": { + "content": "<|repo_name|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151664": { + "content": "<|file_sep|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151665": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151666": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151667": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151668": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + } + }, + "additional_special_tokens": [ + "<|im_start|>", + "<|im_end|>", + "<|object_ref_start|>", + "<|object_ref_end|>", + "<|box_start|>", + "<|box_end|>", + "<|quad_start|>", + "<|quad_end|>", + "<|vision_start|>", + "<|vision_end|>", + "<|vision_pad|>", + "<|image_pad|>", + "<|video_pad|>" + ], + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|im_end|>", + "errors": "replace", + "extra_special_tokens": {}, + "model_max_length": 262144, + "pad_token": "<|endoftext|>", + "processor_class": "Qwen3VLProcessor", + "split_special_tokens": false, + "tokenizer_class": "Qwen2Tokenizer", + "unk_token": null +} diff --git a/video_preprocessor_config.json b/video_preprocessor_config.json new file mode 100644 index 0000000..e32b1d9 --- /dev/null +++ b/video_preprocessor_config.json @@ -0,0 +1,41 @@ +{ + "crop_size": null, + "data_format": "channels_first", + "default_to_square": true, + "device": null, + "do_center_crop": null, + "do_convert_rgb": true, + "do_normalize": true, + "do_rescale": true, + "do_resize": true, + "do_sample_frames": true, + "fps": 2, + "image_mean": [ + 0.5, + 0.5, + 0.5 + ], + "image_std": [ + 0.5, + 0.5, + 0.5 + ], + "input_data_format": null, + "max_frames": 768, + "merge_size": 2, + "min_frames": 4, + "num_frames": null, + "pad_size": null, + "patch_size": 16, + "processor_class": "Qwen3VLProcessor", + "resample": 3, + "rescale_factor": 0.00392156862745098, + "return_metadata": false, + "size": { + "longest_edge": 25165824, + "shortest_edge": 4096 + }, + "temporal_patch_size": 2, + "video_metadata": null, + "video_processor_type": "Qwen3VLVideoProcessor" +} diff --git a/vocab.json b/vocab.json new file mode 100644 index 0000000..6c49fc6 --- /dev/null +++ b/vocab.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ca10d7e9fb3ed18575dd1e277a2579c16d108e32f27439684afa0e10b1440910 +size 2776833