commit 195fe3574d1d229414ef13d8d8fb68f967fdf611 Author: ModelHub XC Date: Sun Jun 21 18:35:18 2026 +0800 初始化项目,由ModelHub XC社区提供模型 Model: emylton/arogya-ai-full Source: Original Platform diff --git a/.gitattributes b/.gitattributes new file mode 100644 index 0000000..7196d6f --- /dev/null +++ b/.gitattributes @@ -0,0 +1,39 @@ +*.7z filter=lfs diff=lfs merge=lfs -text +*.arrow filter=lfs diff=lfs merge=lfs -text +*.bin filter=lfs diff=lfs merge=lfs -text +*.bz2 filter=lfs diff=lfs merge=lfs -text +*.ckpt filter=lfs diff=lfs merge=lfs -text +*.ftz filter=lfs diff=lfs merge=lfs -text +*.gz filter=lfs diff=lfs merge=lfs -text +*.h5 filter=lfs diff=lfs merge=lfs -text +*.joblib filter=lfs diff=lfs merge=lfs -text +*.lfs.* filter=lfs diff=lfs merge=lfs -text +*.mlmodel filter=lfs diff=lfs merge=lfs -text +*.model filter=lfs diff=lfs merge=lfs -text +*.msgpack filter=lfs diff=lfs merge=lfs -text +*.npy filter=lfs diff=lfs merge=lfs -text +*.npz filter=lfs diff=lfs merge=lfs -text +*.onnx filter=lfs diff=lfs merge=lfs -text +*.ot filter=lfs diff=lfs merge=lfs -text +*.parquet filter=lfs diff=lfs merge=lfs -text +*.pb filter=lfs diff=lfs merge=lfs -text +*.pickle filter=lfs diff=lfs merge=lfs -text +*.pkl filter=lfs diff=lfs merge=lfs -text +*.pt filter=lfs diff=lfs merge=lfs -text +*.pth filter=lfs diff=lfs merge=lfs -text +*.rar filter=lfs diff=lfs merge=lfs -text +*.safetensors filter=lfs diff=lfs merge=lfs -text +saved_model/**/* filter=lfs diff=lfs merge=lfs -text +*.tar.* filter=lfs diff=lfs merge=lfs -text +*.tar filter=lfs diff=lfs merge=lfs -text +*.tflite filter=lfs diff=lfs merge=lfs -text +*.tgz filter=lfs diff=lfs merge=lfs -text +*.wasm filter=lfs diff=lfs merge=lfs -text +*.xz filter=lfs diff=lfs merge=lfs -text +*.zip filter=lfs diff=lfs merge=lfs -text +*.zst filter=lfs diff=lfs merge=lfs -text +*tfevents* filter=lfs diff=lfs merge=lfs -text +tokenizer.json filter=lfs diff=lfs merge=lfs -text +arogya-ai-q4.gguf filter=lfs diff=lfs merge=lfs -text +arogya-ai-q8.gguf filter=lfs diff=lfs merge=lfs -text +arogya-ai-fp16.gguf filter=lfs diff=lfs merge=lfs -text diff --git a/Modelfile b/Modelfile new file mode 100644 index 0000000..5124cb0 --- /dev/null +++ b/Modelfile @@ -0,0 +1,14 @@ +FROM ./arogya-ai-q4.gguf + +PARAMETER temperature 0.7 +PARAMETER top_p 0.9 +PARAMETER top_k 40 +PARAMETER num_ctx 8192 + +SYSTEM """Saya adalah Arogya AI, asisten kesehatan untuk Maluku Tenggara.""" + +TEMPLATE """### Instruction: +{{ .Prompt }} + +### Response: +""" diff --git a/README.md b/README.md new file mode 100644 index 0000000..07f19ef --- /dev/null +++ b/README.md @@ -0,0 +1,364 @@ +--- +language: +- id +- en +license: llama3 +library_name: transformers +pipeline_tag: text-generation +tags: +- healthcare +- indonesia +- maluku-tenggara +- disease-prediction +- llama-3 +- medical-ai +base_model: meta-llama/Meta-Llama-3-8B +datasets: +- custom +--- + +# Arogya AI - Full Model + +**Arogya** (Sanskrit: "perfect health") adalah model AI kesehatan yang dilatih khusus untuk analisis dan prediksi data kesehatan di Kabupaten Maluku Tenggara, Indonesia. + +🔗 **GitHub Repository**: https://github.com/Rafael2022-prog/arogya-ai + +📄 **Research Paper**: +- [English](https://github.com/Rafael2022-prog/arogya-ai/blob/main/PAPER_AROGYA_EN.md) +- [Indonesian](https://github.com/Rafael2022-prog/arogya-ai/blob/main/PAPER_AROGYA_ID.md) + +🎯 **LoRA Adapter Version**: [emylton/arogya-health-model](https://huggingface.co/emylton/arogya-health-model) (27 MB) + +--- + +## Model Description + +Ini adalah **full merged model** (Llama 3 8B + LoRA adapter) yang siap pakai tanpa perlu download base model terpisah. + +### Key Features + +- **Ready to use**: Tidak perlu base model Llama 3 +- **Ollama compatible**: Bisa langsung import ke Ollama +- **Specialized**: Dilatih dengan 10,000+ data kesehatan real dari Maluku Tenggara +- **Multi-disease**: Mendukung 7 penyakit utama (DBD, ISPA, Malaria, Diare, TB, Stunting, Pneumonia) +- **Geographic coverage**: 9 kecamatan di Kabupaten Maluku Tenggara + +### Training Data + +Model dilatih menggunakan 10,000+ records dari 4 sumber data: +1. **LAMPIRAN PROFIL MALUKU TENGGARA 2023** (Excel) +2. **LAMPIRAN PROFIL KESEHATAN MALRA 2024** (Excel) +3. **RENJA 2026 DINKES MALRA** (PDF - 24 pages, 14 tables) +4. **RENSTRA DINAS KESEHATAN 2025-2029** (PDF - 97 pages, 74 tables) + +Data mencakup 169 indikator kesehatan dari tahun 2020-2029. + +### Model Details + +- **Base Model**: Meta-Llama-3-8B +- **Fine-tuning Method**: LoRA (r=16, alpha=32) +- **Training**: 3 epochs, batch_size=4, learning_rate=2e-4 +- **Model Size**: ~16 GB (FP16) +- **Parameters**: 8 billion +- **Context Length**: 8192 tokens +- **Language**: Indonesian & English + +--- + +## Quick Start + +### Python (Transformers) + +```python +from transformers import AutoModelForCausalLM, AutoTokenizer +import torch + +# Load model +model = AutoModelForCausalLM.from_pretrained( + "emylton/arogya-ai-full", + torch_dtype=torch.float16, + device_map="auto" +) + +tokenizer = AutoTokenizer.from_pretrained("emylton/arogya-ai-full") + +# Generate prediction +prompt = """Prediksi kasus DBD di Kei Kecil untuk bulan depan berdasarkan data: +- Bulan ini: 45 kasus +- Bulan lalu: 38 kasus +- Curah hujan: tinggi +- Musim: penghujan""" + +inputs = tokenizer(prompt, return_tensors="pt").to(model.device) +outputs = model.generate( + **inputs, + max_new_tokens=200, + temperature=0.7, + top_p=0.9, + do_sample=True +) + +print(tokenizer.decode(outputs[0], skip_special_tokens=True)) +``` + +### Ollama + +```bash +# 1. Download model +huggingface-cli download emylton/arogya-ai-full --local-dir ./arogya-full + +# 2. Create Modelfile +cat > Modelfile << EOF +FROM ./arogya-full +PARAMETER temperature 0.7 +PARAMETER top_p 0.9 +PARAMETER num_ctx 8192 +SYSTEM "Saya Arogya AI, asisten kesehatan untuk Kabupaten Maluku Tenggara. Saya dapat membantu analisis data kesehatan, prediksi penyakit, dan rekomendasi intervensi untuk 7 penyakit utama: DBD, ISPA, Malaria, Diare, TB, Stunting, dan Pneumonia." +EOF + +# 3. Import to Ollama +ollama create arogya-ai -f Modelfile + +# 4. Run +ollama run arogya-ai "Prediksi kasus DBD di Kei Kecil" +``` + +--- + +## Use Cases + +### 1. Disease Prediction +```python +prompt = "Prediksi kasus Malaria di Kei Besar bulan Maret 2026" +``` + +### 2. Trend Analysis +```python +prompt = "Analisis trend kasus ISPA di Maluku Tenggara 2023-2024" +``` + +### 3. Intervention Recommendations +```python +prompt = "Rekomendasi intervensi untuk menurunkan kasus Stunting di Kei Kecil" +``` + +### 4. Resource Allocation +```python +prompt = "Alokasi sumber daya kesehatan untuk program TB di 9 kecamatan" +``` + +### 5. Risk Assessment +```python +prompt = "Penilaian risiko outbreak DBD di musim hujan" +``` + +--- + +## Supported Diseases + +1. **DBD** (Demam Berdarah Dengue) +2. **ISPA** (Infeksi Saluran Pernapasan Akut) +3. **Malaria** +4. **Diare** +5. **TB** (Tuberkulosis) +6. **Stunting** +7. **Pneumonia** + +## Geographic Coverage + +9 Kecamatan di Kabupaten Maluku Tenggara: +- Kei Kecil +- Kei Besar +- Kei Besar Selatan +- Kei Besar Utara Timur +- Kei Besar Utara Barat +- Hoat Sorbay +- Manyeuw +- Kei Kecil Timur +- Kei Kecil Barat + +--- + +## Training Details + +### Hyperparameters + +```python +{ + "lora_r": 16, + "lora_alpha": 32, + "lora_dropout": 0.05, + "learning_rate": 2e-4, + "num_train_epochs": 3, + "per_device_train_batch_size": 4, + "gradient_accumulation_steps": 4, + "warmup_steps": 100, + "max_seq_length": 2048, + "optimizer": "paged_adamw_8bit" +} +``` + +### Training Infrastructure + +- **Platform**: Google Colab Pro +- **GPU**: NVIDIA A100 (40GB) +- **Training Time**: ~6 hours +- **Framework**: Transformers + PEFT + bitsandbytes + +### Data Processing + +Data diproses melalui pipeline: +1. **Excel Extraction**: Pandas untuk structured data +2. **PDF Extraction**: PyMuPDF + tabula untuk tables +3. **Data Cleaning**: Normalisasi, deduplication +4. **Prompt Engineering**: Template khusus untuk health data +5. **Train/Val Split**: 90/10 + +--- + +## Limitations + +⚠️ **Important Limitations:** + +1. **Geographic Specificity**: Model dilatih khusus untuk Maluku Tenggara, mungkin kurang akurat untuk daerah lain +2. **Disease Coverage**: Hanya 7 penyakit utama, tidak mencakup semua kondisi kesehatan +3. **Data Timeframe**: Data training dari 2020-2024, prediksi jangka panjang mungkin kurang akurat +4. **Not Medical Advice**: Model ini untuk analisis data, bukan pengganti konsultasi medis profesional +5. **Language**: Optimal untuk Bahasa Indonesia, kemampuan bahasa lain terbatas +6. **Hallucination**: Seperti LLM lainnya, model dapat menghasilkan informasi yang tidak akurat + +--- + +## Ethical Considerations + +### Intended Use + +✅ **Recommended:** +- Analisis data kesehatan populasi +- Perencanaan program kesehatan +- Alokasi sumber daya +- Penelitian epidemiologi +- Edukasi kesehatan masyarakat + +❌ **Not Recommended:** +- Diagnosis medis individual +- Keputusan klinis tanpa verifikasi profesional +- Pengganti tenaga kesehatan +- Situasi darurat medis + +### Privacy & Security + +- Model tidak menyimpan data personal +- Tidak ada identitas pasien dalam training data +- Semua data diagregasi di level populasi +- Ikuti regulasi kesehatan lokal saat menggunakan + +--- + +## Performance + +### Evaluation Metrics + +Model dievaluasi pada validation set (10% dari data): + +- **Perplexity**: 2.34 +- **Loss**: 0.85 +- **Accuracy** (classification tasks): 87.3% +- **F1 Score**: 0.86 + +### Comparison + +| Model | Size | Accuracy | Use Case | +|-------|------|----------|----------| +| Base Llama 3 8B | 16 GB | 45.2% | General | +| Arogya (LoRA) | 27 MB | 87.3% | Health (need base) | +| Arogya (Full) | 16 GB | 87.3% | Health (standalone) | + +--- + +## Model Versions + +### Full Model vs LoRA Adapter + +| Aspect | LoRA Adapter | Full Model | +|--------|--------------|------------| +| **Repository** | [emylton/arogya-health-model](https://huggingface.co/emylton/arogya-health-model) | [emylton/arogya-ai-full](https://huggingface.co/emylton/arogya-ai-full) | +| **Size** | 27 MB | ~16 GB | +| **Download Time** | 1 min | 10-30 min | +| **Requires Base Model** | ✅ Yes (Llama 3 8B) | ❌ No | +| **Ollama Compatible** | ❌ No | ✅ Yes | +| **Best For** | Developers/Researchers | End Users | + +**Recommendation**: +- Use **LoRA adapter** if you already have Llama 3 8B or want to experiment +- Use **Full model** for production deployment or Ollama usage + +--- + +## Citation + +If you use this model in your research, please cite: + +```bibtex +@software{arogya_ai_2024, + title = {Arogya AI: Fine-tuned Language Model for Health Data Analysis in Maluku Tenggara}, + author = {Rafael and Contributors}, + year = {2024}, + url = {https://huggingface.co/emylton/arogya-ai-full}, + note = {Based on Meta-Llama-3-8B} +} +``` + +**Research Paper**: +```bibtex +@article{arogya_paper_2024, + title = {Arogya AI: Implementasi Large Language Model untuk Analisis dan Prediksi Data Kesehatan di Kabupaten Maluku Tenggara}, + author = {Rafael and Contributors}, + year = {2024}, + url = {https://github.com/Rafael2022-prog/arogya-ai} +} +``` + +--- + +## License + +This model is based on Meta-Llama-3-8B and follows the [Llama 3 Community License](https://llama.meta.com/llama3/license/). + +**Additional Terms:** +- Model dapat digunakan untuk tujuan penelitian dan komersial +- Wajib mencantumkan attribution +- Tidak untuk tujuan yang merugikan atau melanggar hukum +- Ikuti regulasi kesehatan setempat + +--- + +## Acknowledgments + +- **Meta AI** untuk Llama 3 base model +- **Dinas Kesehatan Kabupaten Maluku Tenggara** untuk data kesehatan +- **Hugging Face** untuk platform dan tools +- **Google Colab** untuk training infrastructure + +--- + +## Contact & Support + +- **GitHub Issues**: https://github.com/Rafael2022-prog/arogya-ai/issues +- **Model Repository**: https://huggingface.co/emylton/arogya-ai-full +- **Documentation**: https://github.com/Rafael2022-prog/arogya-ai + +--- + +## Updates + +### Version 1.0 (2024) +- Initial release +- 10,000+ training samples +- 7 diseases coverage +- 9 sub-districts coverage +- Full model deployment + +--- + +**Built with ❤️ for better healthcare in Maluku Tenggara** diff --git a/arogya-ai-fp16.gguf b/arogya-ai-fp16.gguf new file mode 100644 index 0000000..250f51b --- /dev/null +++ b/arogya-ai-fp16.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2df1775adcfe7a8b04cd24f64834b7c346854a1a6339647bf2f2aa820d97d7d8 +size 16068890848 diff --git a/arogya-ai-q4.gguf b/arogya-ai-q4.gguf new file mode 100644 index 0000000..08e273d --- /dev/null +++ b/arogya-ai-q4.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0880c752337e78f6beb053fc3768ba6316c6ff723d5492ffad5b80f295041637 +size 4920733920 diff --git a/arogya-ai-q8.gguf b/arogya-ai-q8.gguf new file mode 100644 index 0000000..810aa90 --- /dev/null +++ b/arogya-ai-q8.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7fdc3b2e0ddc0cbf0baea62aca8f5e9d398d44942d9a0ec83d5343b0b94eb389 +size 8540770528 diff --git a/config.json b/config.json new file mode 100644 index 0000000..a9c6f17 --- /dev/null +++ b/config.json @@ -0,0 +1,32 @@ +{ + "architectures": [ + "LlamaForCausalLM" + ], + "attention_bias": false, + "attention_dropout": 0.0, + "bos_token_id": 128000, + "dtype": "float16", + "eos_token_id": 128001, + "head_dim": 128, + "hidden_act": "silu", + "hidden_size": 4096, + "initializer_range": 0.02, + "intermediate_size": 14336, + "max_position_embeddings": 8192, + "mlp_bias": false, + "model_type": "llama", + "num_attention_heads": 32, + "num_hidden_layers": 32, + "num_key_value_heads": 8, + "pad_token_id": null, + "pretraining_tp": 1, + "rms_norm_eps": 1e-05, + "rope_parameters": { + "rope_theta": 500000.0, + "rope_type": "default" + }, + "tie_word_embeddings": false, + "transformers_version": "5.0.0", + "use_cache": true, + "vocab_size": 128256 +} diff --git a/generation_config.json b/generation_config.json new file mode 100644 index 0000000..844a65b --- /dev/null +++ b/generation_config.json @@ -0,0 +1,9 @@ +{ + "bos_token_id": 128000, + "do_sample": true, + "eos_token_id": 128001, + "max_length": 4096, + "temperature": 0.6, + "top_p": 0.9, + "transformers_version": "5.0.0" +} diff --git a/model-00001-of-00009.safetensors b/model-00001-of-00009.safetensors new file mode 100644 index 0000000..7a5cb92 --- /dev/null +++ b/model-00001-of-00009.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e4f15e64381b74dcb7857c03cbfb62806534f7582ab885c738980a12e5b78989 +size 1050673280 diff --git a/model-00002-of-00009.safetensors b/model-00002-of-00009.safetensors new file mode 100644 index 0000000..7fbb48f --- /dev/null +++ b/model-00002-of-00009.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:f282377d705f6a8214f52e9ecaafd22eadaae153b9a72f1d3f22ae591764a775 +size 1923131656 diff --git a/model-00003-of-00009.safetensors b/model-00003-of-00009.safetensors new file mode 100644 index 0000000..32df56d --- /dev/null +++ b/model-00003-of-00009.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6d5fe9f22b671b2ec0162ba14643a0d634a0fd8685cb1b4f96ae56ec10f81366 +size 1979781384 diff --git a/model-00004-of-00009.safetensors b/model-00004-of-00009.safetensors new file mode 100644 index 0000000..2dea0bd --- /dev/null +++ b/model-00004-of-00009.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:f81c2cda28007d411a620a0a7382f035601a53d9b482c44b98a7bc0344efdbde +size 1946243904 diff --git a/model-00005-of-00009.safetensors b/model-00005-of-00009.safetensors new file mode 100644 index 0000000..a2d7ce5 --- /dev/null +++ b/model-00005-of-00009.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3ea9515fd5acad8457ae718de90279a549824c20defd2d4636501e96ba2695b3 +size 1979781416 diff --git a/model-00006-of-00009.safetensors b/model-00006-of-00009.safetensors new file mode 100644 index 0000000..3c949e9 --- /dev/null +++ b/model-00006-of-00009.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:9ddc9f6971621c8be74fd8016639b93ff953ffa9e6621ea661cfd719a3c104d4 +size 1946243952 diff --git a/model-00007-of-00009.safetensors b/model-00007-of-00009.safetensors new file mode 100644 index 0000000..d99a0fa --- /dev/null +++ b/model-00007-of-00009.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2a58540b81ad3dd82d5bf076ae59a1ee983d9b3127180380428ef979ca6a5165 +size 1979781416 diff --git a/model-00008-of-00009.safetensors b/model-00008-of-00009.safetensors new file mode 100644 index 0000000..45447dd --- /dev/null +++ b/model-00008-of-00009.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6e3a08640994d46d81c166468b740e2ce129f42077c74d41d16c594d8ec87345 +size 1946243952 diff --git a/model-00009-of-00009.safetensors b/model-00009-of-00009.safetensors new file mode 100644 index 0000000..2eca6f2 --- /dev/null +++ b/model-00009-of-00009.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:9fff628027311e7c6362fc7784275f5f4caa1bf5874a09b64ec6f14837acb12a +size 1308675104 diff --git a/model.safetensors.index.json b/model.safetensors.index.json new file mode 100644 index 0000000..d78ea7b --- /dev/null +++ b/model.safetensors.index.json @@ -0,0 +1,299 @@ +{ + "metadata": { + "total_parameters": 8030261248, + "total_size": 16060522496 + }, + "weight_map": { + "lm_head.weight": "model-00001-of-00009.safetensors", + "model.embed_tokens.weight": "model-00002-of-00009.safetensors", + "model.layers.0.input_layernorm.weight": "model-00002-of-00009.safetensors", + "model.layers.0.mlp.down_proj.weight": "model-00002-of-00009.safetensors", + "model.layers.0.mlp.gate_proj.weight": "model-00002-of-00009.safetensors", + "model.layers.0.mlp.up_proj.weight": "model-00002-of-00009.safetensors", + "model.layers.0.post_attention_layernorm.weight": "model-00002-of-00009.safetensors", + "model.layers.0.self_attn.k_proj.weight": "model-00002-of-00009.safetensors", + "model.layers.0.self_attn.o_proj.weight": "model-00002-of-00009.safetensors", + "model.layers.0.self_attn.q_proj.weight": "model-00002-of-00009.safetensors", + "model.layers.0.self_attn.v_proj.weight": "model-00002-of-00009.safetensors", + "model.layers.1.input_layernorm.weight": "model-00002-of-00009.safetensors", + "model.layers.1.mlp.down_proj.weight": "model-00002-of-00009.safetensors", + "model.layers.1.mlp.gate_proj.weight": "model-00002-of-00009.safetensors", + "model.layers.1.mlp.up_proj.weight": "model-00002-of-00009.safetensors", + "model.layers.1.post_attention_layernorm.weight": "model-00002-of-00009.safetensors", + "model.layers.1.self_attn.k_proj.weight": "model-00002-of-00009.safetensors", + "model.layers.1.self_attn.o_proj.weight": "model-00002-of-00009.safetensors", + "model.layers.1.self_attn.q_proj.weight": "model-00002-of-00009.safetensors", + "model.layers.1.self_attn.v_proj.weight": "model-00002-of-00009.safetensors", + "model.layers.10.input_layernorm.weight": "model-00004-of-00009.safetensors", + "model.layers.10.mlp.down_proj.weight": "model-00004-of-00009.safetensors", + "model.layers.10.mlp.gate_proj.weight": "model-00004-of-00009.safetensors", + "model.layers.10.mlp.up_proj.weight": "model-00004-of-00009.safetensors", + "model.layers.10.post_attention_layernorm.weight": "model-00004-of-00009.safetensors", + "model.layers.10.self_attn.k_proj.weight": "model-00004-of-00009.safetensors", + "model.layers.10.self_attn.o_proj.weight": "model-00004-of-00009.safetensors", + "model.layers.10.self_attn.q_proj.weight": "model-00004-of-00009.safetensors", + "model.layers.10.self_attn.v_proj.weight": "model-00004-of-00009.safetensors", + "model.layers.11.input_layernorm.weight": "model-00004-of-00009.safetensors", + "model.layers.11.mlp.down_proj.weight": "model-00005-of-00009.safetensors", + "model.layers.11.mlp.gate_proj.weight": "model-00005-of-00009.safetensors", + "model.layers.11.mlp.up_proj.weight": "model-00005-of-00009.safetensors", + "model.layers.11.post_attention_layernorm.weight": "model-00005-of-00009.safetensors", + "model.layers.11.self_attn.k_proj.weight": "model-00005-of-00009.safetensors", + "model.layers.11.self_attn.o_proj.weight": "model-00005-of-00009.safetensors", + "model.layers.11.self_attn.q_proj.weight": "model-00005-of-00009.safetensors", + "model.layers.11.self_attn.v_proj.weight": "model-00005-of-00009.safetensors", + "model.layers.12.input_layernorm.weight": "model-00005-of-00009.safetensors", + "model.layers.12.mlp.down_proj.weight": "model-00005-of-00009.safetensors", + "model.layers.12.mlp.gate_proj.weight": "model-00005-of-00009.safetensors", + "model.layers.12.mlp.up_proj.weight": "model-00005-of-00009.safetensors", + "model.layers.12.post_attention_layernorm.weight": "model-00005-of-00009.safetensors", + "model.layers.12.self_attn.k_proj.weight": "model-00005-of-00009.safetensors", + "model.layers.12.self_attn.o_proj.weight": "model-00005-of-00009.safetensors", + "model.layers.12.self_attn.q_proj.weight": "model-00005-of-00009.safetensors", + "model.layers.12.self_attn.v_proj.weight": "model-00005-of-00009.safetensors", + "model.layers.13.input_layernorm.weight": "model-00005-of-00009.safetensors", + "model.layers.13.mlp.down_proj.weight": "model-00005-of-00009.safetensors", + "model.layers.13.mlp.gate_proj.weight": "model-00005-of-00009.safetensors", + "model.layers.13.mlp.up_proj.weight": "model-00005-of-00009.safetensors", + "model.layers.13.post_attention_layernorm.weight": "model-00005-of-00009.safetensors", + "model.layers.13.self_attn.k_proj.weight": "model-00005-of-00009.safetensors", + "model.layers.13.self_attn.o_proj.weight": "model-00005-of-00009.safetensors", + "model.layers.13.self_attn.q_proj.weight": "model-00005-of-00009.safetensors", + "model.layers.13.self_attn.v_proj.weight": "model-00005-of-00009.safetensors", + "model.layers.14.input_layernorm.weight": "model-00005-of-00009.safetensors", + "model.layers.14.mlp.down_proj.weight": "model-00005-of-00009.safetensors", + "model.layers.14.mlp.gate_proj.weight": "model-00005-of-00009.safetensors", + "model.layers.14.mlp.up_proj.weight": "model-00005-of-00009.safetensors", + "model.layers.14.post_attention_layernorm.weight": "model-00005-of-00009.safetensors", + "model.layers.14.self_attn.k_proj.weight": "model-00005-of-00009.safetensors", + "model.layers.14.self_attn.o_proj.weight": "model-00005-of-00009.safetensors", + "model.layers.14.self_attn.q_proj.weight": "model-00005-of-00009.safetensors", + "model.layers.14.self_attn.v_proj.weight": "model-00005-of-00009.safetensors", + "model.layers.15.input_layernorm.weight": "model-00005-of-00009.safetensors", + "model.layers.15.mlp.down_proj.weight": "model-00005-of-00009.safetensors", + "model.layers.15.mlp.gate_proj.weight": "model-00005-of-00009.safetensors", + "model.layers.15.mlp.up_proj.weight": "model-00006-of-00009.safetensors", + "model.layers.15.post_attention_layernorm.weight": "model-00006-of-00009.safetensors", + "model.layers.15.self_attn.k_proj.weight": "model-00006-of-00009.safetensors", + "model.layers.15.self_attn.o_proj.weight": "model-00006-of-00009.safetensors", + "model.layers.15.self_attn.q_proj.weight": "model-00006-of-00009.safetensors", + "model.layers.15.self_attn.v_proj.weight": "model-00006-of-00009.safetensors", + "model.layers.16.input_layernorm.weight": "model-00006-of-00009.safetensors", + "model.layers.16.mlp.down_proj.weight": "model-00006-of-00009.safetensors", + "model.layers.16.mlp.gate_proj.weight": "model-00006-of-00009.safetensors", + "model.layers.16.mlp.up_proj.weight": "model-00006-of-00009.safetensors", + "model.layers.16.post_attention_layernorm.weight": "model-00006-of-00009.safetensors", + "model.layers.16.self_attn.k_proj.weight": "model-00006-of-00009.safetensors", + "model.layers.16.self_attn.o_proj.weight": "model-00006-of-00009.safetensors", + "model.layers.16.self_attn.q_proj.weight": "model-00006-of-00009.safetensors", + "model.layers.16.self_attn.v_proj.weight": "model-00006-of-00009.safetensors", + "model.layers.17.input_layernorm.weight": "model-00006-of-00009.safetensors", + "model.layers.17.mlp.down_proj.weight": "model-00006-of-00009.safetensors", + "model.layers.17.mlp.gate_proj.weight": "model-00006-of-00009.safetensors", + "model.layers.17.mlp.up_proj.weight": "model-00006-of-00009.safetensors", + "model.layers.17.post_attention_layernorm.weight": "model-00006-of-00009.safetensors", + "model.layers.17.self_attn.k_proj.weight": "model-00006-of-00009.safetensors", + "model.layers.17.self_attn.o_proj.weight": "model-00006-of-00009.safetensors", + "model.layers.17.self_attn.q_proj.weight": "model-00006-of-00009.safetensors", + "model.layers.17.self_attn.v_proj.weight": "model-00006-of-00009.safetensors", + "model.layers.18.input_layernorm.weight": "model-00006-of-00009.safetensors", + "model.layers.18.mlp.down_proj.weight": "model-00006-of-00009.safetensors", + "model.layers.18.mlp.gate_proj.weight": "model-00006-of-00009.safetensors", + "model.layers.18.mlp.up_proj.weight": "model-00006-of-00009.safetensors", + "model.layers.18.post_attention_layernorm.weight": "model-00006-of-00009.safetensors", + "model.layers.18.self_attn.k_proj.weight": "model-00006-of-00009.safetensors", + "model.layers.18.self_attn.o_proj.weight": "model-00006-of-00009.safetensors", + "model.layers.18.self_attn.q_proj.weight": "model-00006-of-00009.safetensors", + "model.layers.18.self_attn.v_proj.weight": "model-00006-of-00009.safetensors", + "model.layers.19.input_layernorm.weight": "model-00006-of-00009.safetensors", + "model.layers.19.mlp.down_proj.weight": "model-00006-of-00009.safetensors", + "model.layers.19.mlp.gate_proj.weight": "model-00006-of-00009.safetensors", + "model.layers.19.mlp.up_proj.weight": "model-00006-of-00009.safetensors", + "model.layers.19.post_attention_layernorm.weight": "model-00006-of-00009.safetensors", + "model.layers.19.self_attn.k_proj.weight": "model-00006-of-00009.safetensors", + "model.layers.19.self_attn.o_proj.weight": "model-00006-of-00009.safetensors", + "model.layers.19.self_attn.q_proj.weight": "model-00006-of-00009.safetensors", + "model.layers.19.self_attn.v_proj.weight": "model-00006-of-00009.safetensors", + "model.layers.2.input_layernorm.weight": "model-00002-of-00009.safetensors", + "model.layers.2.mlp.down_proj.weight": "model-00003-of-00009.safetensors", + "model.layers.2.mlp.gate_proj.weight": "model-00003-of-00009.safetensors", + "model.layers.2.mlp.up_proj.weight": "model-00003-of-00009.safetensors", + "model.layers.2.post_attention_layernorm.weight": "model-00003-of-00009.safetensors", + "model.layers.2.self_attn.k_proj.weight": "model-00003-of-00009.safetensors", + "model.layers.2.self_attn.o_proj.weight": "model-00003-of-00009.safetensors", + "model.layers.2.self_attn.q_proj.weight": "model-00003-of-00009.safetensors", + "model.layers.2.self_attn.v_proj.weight": "model-00003-of-00009.safetensors", + "model.layers.20.input_layernorm.weight": "model-00006-of-00009.safetensors", + "model.layers.20.mlp.down_proj.weight": "model-00007-of-00009.safetensors", + "model.layers.20.mlp.gate_proj.weight": "model-00007-of-00009.safetensors", + "model.layers.20.mlp.up_proj.weight": "model-00007-of-00009.safetensors", + "model.layers.20.post_attention_layernorm.weight": "model-00007-of-00009.safetensors", + "model.layers.20.self_attn.k_proj.weight": "model-00007-of-00009.safetensors", + "model.layers.20.self_attn.o_proj.weight": "model-00007-of-00009.safetensors", + "model.layers.20.self_attn.q_proj.weight": "model-00007-of-00009.safetensors", + "model.layers.20.self_attn.v_proj.weight": "model-00007-of-00009.safetensors", + "model.layers.21.input_layernorm.weight": "model-00007-of-00009.safetensors", + "model.layers.21.mlp.down_proj.weight": "model-00007-of-00009.safetensors", + "model.layers.21.mlp.gate_proj.weight": "model-00007-of-00009.safetensors", + "model.layers.21.mlp.up_proj.weight": "model-00007-of-00009.safetensors", + "model.layers.21.post_attention_layernorm.weight": "model-00007-of-00009.safetensors", + "model.layers.21.self_attn.k_proj.weight": "model-00007-of-00009.safetensors", + "model.layers.21.self_attn.o_proj.weight": "model-00007-of-00009.safetensors", + "model.layers.21.self_attn.q_proj.weight": "model-00007-of-00009.safetensors", + "model.layers.21.self_attn.v_proj.weight": "model-00007-of-00009.safetensors", + "model.layers.22.input_layernorm.weight": "model-00007-of-00009.safetensors", + "model.layers.22.mlp.down_proj.weight": "model-00007-of-00009.safetensors", + "model.layers.22.mlp.gate_proj.weight": "model-00007-of-00009.safetensors", + "model.layers.22.mlp.up_proj.weight": "model-00007-of-00009.safetensors", + "model.layers.22.post_attention_layernorm.weight": "model-00007-of-00009.safetensors", + "model.layers.22.self_attn.k_proj.weight": "model-00007-of-00009.safetensors", + "model.layers.22.self_attn.o_proj.weight": "model-00007-of-00009.safetensors", + "model.layers.22.self_attn.q_proj.weight": "model-00007-of-00009.safetensors", + "model.layers.22.self_attn.v_proj.weight": "model-00007-of-00009.safetensors", + "model.layers.23.input_layernorm.weight": "model-00007-of-00009.safetensors", + "model.layers.23.mlp.down_proj.weight": "model-00007-of-00009.safetensors", + "model.layers.23.mlp.gate_proj.weight": "model-00007-of-00009.safetensors", + "model.layers.23.mlp.up_proj.weight": "model-00007-of-00009.safetensors", + "model.layers.23.post_attention_layernorm.weight": "model-00007-of-00009.safetensors", + "model.layers.23.self_attn.k_proj.weight": "model-00007-of-00009.safetensors", + "model.layers.23.self_attn.o_proj.weight": "model-00007-of-00009.safetensors", + "model.layers.23.self_attn.q_proj.weight": "model-00007-of-00009.safetensors", + "model.layers.23.self_attn.v_proj.weight": "model-00007-of-00009.safetensors", + "model.layers.24.input_layernorm.weight": "model-00007-of-00009.safetensors", + "model.layers.24.mlp.down_proj.weight": "model-00007-of-00009.safetensors", + "model.layers.24.mlp.gate_proj.weight": "model-00007-of-00009.safetensors", + "model.layers.24.mlp.up_proj.weight": "model-00008-of-00009.safetensors", + "model.layers.24.post_attention_layernorm.weight": "model-00008-of-00009.safetensors", + "model.layers.24.self_attn.k_proj.weight": "model-00008-of-00009.safetensors", + "model.layers.24.self_attn.o_proj.weight": "model-00008-of-00009.safetensors", + "model.layers.24.self_attn.q_proj.weight": "model-00008-of-00009.safetensors", + "model.layers.24.self_attn.v_proj.weight": "model-00008-of-00009.safetensors", + "model.layers.25.input_layernorm.weight": "model-00008-of-00009.safetensors", + "model.layers.25.mlp.down_proj.weight": "model-00008-of-00009.safetensors", + "model.layers.25.mlp.gate_proj.weight": "model-00008-of-00009.safetensors", + "model.layers.25.mlp.up_proj.weight": "model-00008-of-00009.safetensors", + "model.layers.25.post_attention_layernorm.weight": "model-00008-of-00009.safetensors", + "model.layers.25.self_attn.k_proj.weight": "model-00008-of-00009.safetensors", + "model.layers.25.self_attn.o_proj.weight": "model-00008-of-00009.safetensors", + "model.layers.25.self_attn.q_proj.weight": "model-00008-of-00009.safetensors", + "model.layers.25.self_attn.v_proj.weight": "model-00008-of-00009.safetensors", + "model.layers.26.input_layernorm.weight": "model-00008-of-00009.safetensors", + "model.layers.26.mlp.down_proj.weight": "model-00008-of-00009.safetensors", + "model.layers.26.mlp.gate_proj.weight": "model-00008-of-00009.safetensors", + "model.layers.26.mlp.up_proj.weight": "model-00008-of-00009.safetensors", + "model.layers.26.post_attention_layernorm.weight": "model-00008-of-00009.safetensors", + "model.layers.26.self_attn.k_proj.weight": "model-00008-of-00009.safetensors", + "model.layers.26.self_attn.o_proj.weight": "model-00008-of-00009.safetensors", + "model.layers.26.self_attn.q_proj.weight": "model-00008-of-00009.safetensors", + "model.layers.26.self_attn.v_proj.weight": "model-00008-of-00009.safetensors", + "model.layers.27.input_layernorm.weight": "model-00008-of-00009.safetensors", + "model.layers.27.mlp.down_proj.weight": "model-00008-of-00009.safetensors", + "model.layers.27.mlp.gate_proj.weight": "model-00008-of-00009.safetensors", + "model.layers.27.mlp.up_proj.weight": "model-00008-of-00009.safetensors", + "model.layers.27.post_attention_layernorm.weight": "model-00008-of-00009.safetensors", + "model.layers.27.self_attn.k_proj.weight": "model-00008-of-00009.safetensors", + "model.layers.27.self_attn.o_proj.weight": "model-00008-of-00009.safetensors", + "model.layers.27.self_attn.q_proj.weight": "model-00008-of-00009.safetensors", + "model.layers.27.self_attn.v_proj.weight": "model-00008-of-00009.safetensors", + "model.layers.28.input_layernorm.weight": "model-00008-of-00009.safetensors", + "model.layers.28.mlp.down_proj.weight": "model-00008-of-00009.safetensors", + "model.layers.28.mlp.gate_proj.weight": "model-00008-of-00009.safetensors", + "model.layers.28.mlp.up_proj.weight": "model-00008-of-00009.safetensors", + "model.layers.28.post_attention_layernorm.weight": "model-00008-of-00009.safetensors", + "model.layers.28.self_attn.k_proj.weight": "model-00008-of-00009.safetensors", + "model.layers.28.self_attn.o_proj.weight": "model-00008-of-00009.safetensors", + "model.layers.28.self_attn.q_proj.weight": "model-00008-of-00009.safetensors", + "model.layers.28.self_attn.v_proj.weight": "model-00008-of-00009.safetensors", + "model.layers.29.input_layernorm.weight": "model-00008-of-00009.safetensors", + "model.layers.29.mlp.down_proj.weight": "model-00009-of-00009.safetensors", + "model.layers.29.mlp.gate_proj.weight": "model-00009-of-00009.safetensors", + "model.layers.29.mlp.up_proj.weight": "model-00009-of-00009.safetensors", + "model.layers.29.post_attention_layernorm.weight": "model-00009-of-00009.safetensors", + "model.layers.29.self_attn.k_proj.weight": "model-00009-of-00009.safetensors", + "model.layers.29.self_attn.o_proj.weight": "model-00009-of-00009.safetensors", + "model.layers.29.self_attn.q_proj.weight": "model-00009-of-00009.safetensors", + "model.layers.29.self_attn.v_proj.weight": "model-00009-of-00009.safetensors", + "model.layers.3.input_layernorm.weight": "model-00003-of-00009.safetensors", + "model.layers.3.mlp.down_proj.weight": "model-00003-of-00009.safetensors", + "model.layers.3.mlp.gate_proj.weight": "model-00003-of-00009.safetensors", + "model.layers.3.mlp.up_proj.weight": "model-00003-of-00009.safetensors", + "model.layers.3.post_attention_layernorm.weight": "model-00003-of-00009.safetensors", + "model.layers.3.self_attn.k_proj.weight": "model-00003-of-00009.safetensors", + "model.layers.3.self_attn.o_proj.weight": "model-00003-of-00009.safetensors", + "model.layers.3.self_attn.q_proj.weight": "model-00003-of-00009.safetensors", + "model.layers.3.self_attn.v_proj.weight": "model-00003-of-00009.safetensors", + "model.layers.30.input_layernorm.weight": "model-00009-of-00009.safetensors", + "model.layers.30.mlp.down_proj.weight": "model-00009-of-00009.safetensors", + "model.layers.30.mlp.gate_proj.weight": "model-00009-of-00009.safetensors", + "model.layers.30.mlp.up_proj.weight": "model-00009-of-00009.safetensors", + "model.layers.30.post_attention_layernorm.weight": "model-00009-of-00009.safetensors", + "model.layers.30.self_attn.k_proj.weight": "model-00009-of-00009.safetensors", + "model.layers.30.self_attn.o_proj.weight": "model-00009-of-00009.safetensors", + "model.layers.30.self_attn.q_proj.weight": "model-00009-of-00009.safetensors", + "model.layers.30.self_attn.v_proj.weight": "model-00009-of-00009.safetensors", + "model.layers.31.input_layernorm.weight": "model-00009-of-00009.safetensors", + "model.layers.31.mlp.down_proj.weight": "model-00009-of-00009.safetensors", + "model.layers.31.mlp.gate_proj.weight": "model-00009-of-00009.safetensors", + "model.layers.31.mlp.up_proj.weight": "model-00009-of-00009.safetensors", + "model.layers.31.post_attention_layernorm.weight": "model-00009-of-00009.safetensors", + "model.layers.31.self_attn.k_proj.weight": "model-00009-of-00009.safetensors", + "model.layers.31.self_attn.o_proj.weight": "model-00009-of-00009.safetensors", + "model.layers.31.self_attn.q_proj.weight": "model-00009-of-00009.safetensors", + "model.layers.31.self_attn.v_proj.weight": "model-00009-of-00009.safetensors", + "model.layers.4.input_layernorm.weight": "model-00003-of-00009.safetensors", + "model.layers.4.mlp.down_proj.weight": "model-00003-of-00009.safetensors", + "model.layers.4.mlp.gate_proj.weight": "model-00003-of-00009.safetensors", + "model.layers.4.mlp.up_proj.weight": "model-00003-of-00009.safetensors", + "model.layers.4.post_attention_layernorm.weight": "model-00003-of-00009.safetensors", + "model.layers.4.self_attn.k_proj.weight": "model-00003-of-00009.safetensors", + "model.layers.4.self_attn.o_proj.weight": "model-00003-of-00009.safetensors", + "model.layers.4.self_attn.q_proj.weight": "model-00003-of-00009.safetensors", + "model.layers.4.self_attn.v_proj.weight": "model-00003-of-00009.safetensors", + "model.layers.5.input_layernorm.weight": "model-00003-of-00009.safetensors", + "model.layers.5.mlp.down_proj.weight": "model-00003-of-00009.safetensors", + "model.layers.5.mlp.gate_proj.weight": "model-00003-of-00009.safetensors", + "model.layers.5.mlp.up_proj.weight": "model-00003-of-00009.safetensors", + "model.layers.5.post_attention_layernorm.weight": "model-00003-of-00009.safetensors", + "model.layers.5.self_attn.k_proj.weight": "model-00003-of-00009.safetensors", + "model.layers.5.self_attn.o_proj.weight": "model-00003-of-00009.safetensors", + "model.layers.5.self_attn.q_proj.weight": "model-00003-of-00009.safetensors", + "model.layers.5.self_attn.v_proj.weight": "model-00003-of-00009.safetensors", + "model.layers.6.input_layernorm.weight": "model-00003-of-00009.safetensors", + "model.layers.6.mlp.down_proj.weight": "model-00003-of-00009.safetensors", + "model.layers.6.mlp.gate_proj.weight": "model-00003-of-00009.safetensors", + "model.layers.6.mlp.up_proj.weight": "model-00004-of-00009.safetensors", + "model.layers.6.post_attention_layernorm.weight": "model-00004-of-00009.safetensors", + "model.layers.6.self_attn.k_proj.weight": "model-00004-of-00009.safetensors", + "model.layers.6.self_attn.o_proj.weight": "model-00004-of-00009.safetensors", + "model.layers.6.self_attn.q_proj.weight": "model-00004-of-00009.safetensors", + "model.layers.6.self_attn.v_proj.weight": "model-00004-of-00009.safetensors", + "model.layers.7.input_layernorm.weight": "model-00004-of-00009.safetensors", + "model.layers.7.mlp.down_proj.weight": "model-00004-of-00009.safetensors", + "model.layers.7.mlp.gate_proj.weight": "model-00004-of-00009.safetensors", + "model.layers.7.mlp.up_proj.weight": "model-00004-of-00009.safetensors", + "model.layers.7.post_attention_layernorm.weight": "model-00004-of-00009.safetensors", + "model.layers.7.self_attn.k_proj.weight": "model-00004-of-00009.safetensors", + "model.layers.7.self_attn.o_proj.weight": "model-00004-of-00009.safetensors", + "model.layers.7.self_attn.q_proj.weight": "model-00004-of-00009.safetensors", + "model.layers.7.self_attn.v_proj.weight": "model-00004-of-00009.safetensors", + "model.layers.8.input_layernorm.weight": "model-00004-of-00009.safetensors", + "model.layers.8.mlp.down_proj.weight": "model-00004-of-00009.safetensors", + "model.layers.8.mlp.gate_proj.weight": "model-00004-of-00009.safetensors", + "model.layers.8.mlp.up_proj.weight": "model-00004-of-00009.safetensors", + "model.layers.8.post_attention_layernorm.weight": "model-00004-of-00009.safetensors", + "model.layers.8.self_attn.k_proj.weight": "model-00004-of-00009.safetensors", + "model.layers.8.self_attn.o_proj.weight": "model-00004-of-00009.safetensors", + "model.layers.8.self_attn.q_proj.weight": "model-00004-of-00009.safetensors", + "model.layers.8.self_attn.v_proj.weight": "model-00004-of-00009.safetensors", + "model.layers.9.input_layernorm.weight": "model-00004-of-00009.safetensors", + "model.layers.9.mlp.down_proj.weight": "model-00004-of-00009.safetensors", + "model.layers.9.mlp.gate_proj.weight": "model-00004-of-00009.safetensors", + "model.layers.9.mlp.up_proj.weight": "model-00004-of-00009.safetensors", + "model.layers.9.post_attention_layernorm.weight": "model-00004-of-00009.safetensors", + "model.layers.9.self_attn.k_proj.weight": "model-00004-of-00009.safetensors", + "model.layers.9.self_attn.o_proj.weight": "model-00004-of-00009.safetensors", + "model.layers.9.self_attn.q_proj.weight": "model-00004-of-00009.safetensors", + "model.layers.9.self_attn.v_proj.weight": "model-00004-of-00009.safetensors", + "model.norm.weight": "model-00009-of-00009.safetensors" + } +} diff --git a/tokenizer.json b/tokenizer.json new file mode 100644 index 0000000..be3984c --- /dev/null +++ b/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7ad8c63d7a9f677a4e93e21e95765331a1bf4cd607714c0ea80a31b988657a2b +size 17210241 diff --git a/tokenizer_config.json b/tokenizer_config.json new file mode 100644 index 0000000..9c1e980 --- /dev/null +++ b/tokenizer_config.json @@ -0,0 +1,21 @@ +{ + "backend": "tokenizers", + "bos_token": "<|begin_of_text|>", + "clean_up_tokenization_spaces": true, + "eos_token": "<|end_of_text|>", + "is_local": false, + "max_length": 512, + "model_input_names": [ + "input_ids", + "attention_mask" + ], + "model_max_length": 1000000000000000019884624838656, + "pad_to_multiple_of": null, + "pad_token": "<|end_of_text|>", + "pad_token_type_id": 0, + "padding_side": "right", + "stride": 0, + "tokenizer_class": "TokenizersBackend", + "truncation_side": "right", + "truncation_strategy": "longest_first" +}