初始化项目,由ModelHub XC社区提供模型
Model: URajinda/ShweYon-V2.1-SFT Source: Original Platform
This commit is contained in:
36
.gitattributes
vendored
Normal file
36
.gitattributes
vendored
Normal file
@@ -0,0 +1,36 @@
|
||||
*.7z filter=lfs diff=lfs merge=lfs -text
|
||||
*.arrow filter=lfs diff=lfs merge=lfs -text
|
||||
*.bin filter=lfs diff=lfs merge=lfs -text
|
||||
*.bz2 filter=lfs diff=lfs merge=lfs -text
|
||||
*.ckpt filter=lfs diff=lfs merge=lfs -text
|
||||
*.ftz filter=lfs diff=lfs merge=lfs -text
|
||||
*.gz filter=lfs diff=lfs merge=lfs -text
|
||||
*.h5 filter=lfs diff=lfs merge=lfs -text
|
||||
*.joblib filter=lfs diff=lfs merge=lfs -text
|
||||
*.lfs.* filter=lfs diff=lfs merge=lfs -text
|
||||
*.mlmodel filter=lfs diff=lfs merge=lfs -text
|
||||
*.model filter=lfs diff=lfs merge=lfs -text
|
||||
*.msgpack filter=lfs diff=lfs merge=lfs -text
|
||||
*.npy filter=lfs diff=lfs merge=lfs -text
|
||||
*.npz filter=lfs diff=lfs merge=lfs -text
|
||||
*.onnx filter=lfs diff=lfs merge=lfs -text
|
||||
*.ot filter=lfs diff=lfs merge=lfs -text
|
||||
*.parquet filter=lfs diff=lfs merge=lfs -text
|
||||
*.pb filter=lfs diff=lfs merge=lfs -text
|
||||
*.pickle filter=lfs diff=lfs merge=lfs -text
|
||||
*.pkl filter=lfs diff=lfs merge=lfs -text
|
||||
*.pt filter=lfs diff=lfs merge=lfs -text
|
||||
*.pth filter=lfs diff=lfs merge=lfs -text
|
||||
*.rar filter=lfs diff=lfs merge=lfs -text
|
||||
*.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
|
||||
*.tar.* filter=lfs diff=lfs merge=lfs -text
|
||||
*.tar filter=lfs diff=lfs merge=lfs -text
|
||||
*.tflite filter=lfs diff=lfs merge=lfs -text
|
||||
*.tgz filter=lfs diff=lfs merge=lfs -text
|
||||
*.wasm filter=lfs diff=lfs merge=lfs -text
|
||||
*.xz filter=lfs diff=lfs merge=lfs -text
|
||||
*.zip filter=lfs diff=lfs merge=lfs -text
|
||||
*.zst filter=lfs diff=lfs merge=lfs -text
|
||||
*tfevents* filter=lfs diff=lfs merge=lfs -text
|
||||
shweyon_v2_1_Q8_0.gguf filter=lfs diff=lfs merge=lfs -text
|
||||
98
README.md
Normal file
98
README.md
Normal file
@@ -0,0 +1,98 @@
|
||||
---
|
||||
language:
|
||||
- my
|
||||
license: gpl-3.0
|
||||
tags:
|
||||
- gpt2
|
||||
- burmese
|
||||
- shweyon
|
||||
- instruction-tuning
|
||||
- gguf
|
||||
pipeline_tag: text-generation
|
||||
---
|
||||
|
||||
# 🐰 ShweYon-V2.1-SFT (ကိုရွှေယုန်)
|
||||
|
||||
**ShweYon-V2.1-SFT** သည် မြန်မာဘာသာစကားအတွက် အထူးပြုလေ့ကျင့်ထားသော Lightweight Language Model တစ်ခုဖြစ်သည်။ ဤမော်ဒယ်သည် GPT-2 Architecture ကို အခြေခံထားပြီး မြန်မာစာ၏ သဘာဝနှင့် သဒ္ဒါအထားအသိုကို ကောင်းမွန်စွာ နားလည်နိုင်ရန် အဆင့်ဆင့် တည်ဆောက်ထားခြင်း ဖြစ်သည်။
|
||||
|
||||
|
||||
|
||||
### 🌟 Key Highlights
|
||||
* **Foundation:** ShweYon-V2-Draft မှ အဆင့်မြှင့်တင်ထားသည်။
|
||||
* **Training Stage:** Instruction Fine-tuning (SFT) အဆင့်ကို အောင်မြင်စွာ ပြီးဆုံးထားသည်။
|
||||
* **Language:** Burmese (မြန်မာဘာသာစကား)
|
||||
* **Dataset Size:** 11,704 Multi-turn and Single-turn instructions.
|
||||
* **Format:** Hugging Face Safetensors နှင့် GGUF (Q8_0) format များ ရရှိနိုင်သည်။
|
||||
|
||||
---
|
||||
|
||||
### 🛠 Training Details (လေ့ကျင့်မှု အကျဉ်းချုပ်)
|
||||
ဤမော်ဒယ်ကို လေ့ကျင့်ရာတွင် အပိုင်း (၂) ပိုင်းဖြင့် လုပ်ဆောင်ခဲ့သည်-
|
||||
1. **Pre-training:** မြန်မာစာ Corpus အမြောက်အမြားဖြင့် မြန်မာစကားလုံးများ၏ ဆက်စပ်မှုကို သင်ယူခဲ့သည်။
|
||||
2. **Instruction Tuning:** မေးခွန်းနှင့် အဖြေ (Dataset နမူနာပေါင်း ၁၁,၇၀၄ ကျော်) ကို အသုံးပြု၍ Chatbot တစ်ခုကဲ့သို့ ပြန်လည်ဖြေကြားတတ်အောင် သွေးယူခဲ့သည်။
|
||||
|
||||
|
||||
|
||||
---
|
||||
|
||||
### 📝 How to Use (အသုံးပြုနည်း)
|
||||
|
||||
ဤမော်ဒယ်ကို အောက်ပါ Instruction Format အတိုင်း အသုံးပြုပါက အကောင်းဆုံး ရလဒ်များကို ရရှိနိုင်မည်ဖြစ်သည်-
|
||||
|
||||
```text
|
||||
### Instruction:
|
||||
{မေးခွန်း}
|
||||
|
||||
### Response:
|
||||
|
||||
```
|
||||
|
||||
#### Code Example (Transformers):
|
||||
|
||||
```python
|
||||
from transformers import pipeline
|
||||
|
||||
pipe = pipeline("text-generation", model="URajinda/ShweYon-V2.1-SFT")
|
||||
prompt = "### Instruction:\nနေကောင်းလား ကိုရွှေယုန်။\n\n### Response:\n"
|
||||
print(pipe(prompt, max_new_tokens=100)[0]['generated_text'])
|
||||
|
||||
```
|
||||
|
||||
---
|
||||
|
||||
### 🚀 GGUF Version (Mobile & Local PC)
|
||||
|
||||
Android ဖုန်းများ သို့မဟုတ် PC များတွင် RAM အနည်းငယ်ဖြင့် အသုံးပြုလိုပါက ဤ Repo ရှိ `shweyon_v2_1_Q8_0.gguf` ဖိုင်ကို ဒေါင်းလုဒ်ရယူ၍ **LM Studio, Layla,** သို့မဟုတ် **Jan.ai** တို့တွင် အသုံးပြုနိုင်သည်။
|
||||
|
||||
**Recommended Inference Settings:**
|
||||
|
||||
* **Temperature:** 0.7
|
||||
* **Top_p:** 0.9
|
||||
* **Repetition Penalty:** 1.1
|
||||
|
||||
---
|
||||
|
||||
### ⚠️ Limitations (သတိပြုရန်)
|
||||
|
||||
* ဤမော်ဒယ်သည် Parameter နည်းပါးသော model ဖြစ်သည့်အတွက် အလွန်ရှုပ်ထွေးသော သိပ္ပံပုစ္ဆာများနှင့် သင်္ချာတွက်ချက်မှုများတွင် မှားယွင်းနိုင်ပါသည်။
|
||||
* အကြံပြုချက်များပေးရာတွင် အမြဲတမ်း ၁၀၀% တိကျမှု မရှိနိုင်သဖြင့် အရေးကြီးသော ကိစ္စရပ်များတွင် ပြန်လည်စစ်ဆေးရန် လိုအပ်ပါသည်။
|
||||
|
||||
---
|
||||
|
||||
### 🙌 Acknowledgments
|
||||
|
||||
မြန်မာ AI နည်းပညာ ဖွံ့ဖြိုးတိုးတက်ရေးအတွက် စိတ်အားထက်သန်စွာဖြင့် ဖန်တီးခဲ့သော **U Rajinda** မှ တည်ဆောက်ခဲ့ခြင်း ဖြစ်ပါသည်။
|
||||
|
||||
```
|
||||
|
||||
---
|
||||
|
||||
**ပြုလုပ်ရန်အဆင့်ဆင့်:**
|
||||
1. Hugging Face မှာ သင့် Model Repo ထဲကိုသွားပါ။
|
||||
2. **Edit model card** (README.md) ကို နှိပ်ပါ။
|
||||
3. အပေါ်က code တွေကို အကုန် copy ယူပြီး ရှိသမျှ အဟောင်းတွေကို ဖြတ်၊ ပြီးရင် paste လုပ်လိုက်ပါ။
|
||||
4. **Commit changes** ကို နှိပ်လိုက်ပါ။
|
||||
|
||||
**Would you like me to ...** GGUF ဖိုင်ကို ဖုန်းထဲမှာ စမ်းသပ်ကြည့်ဖို့ အဆင်ပြေရဲ့လားခင်ဗျာ? အကယ်၍ စမ်းကြည့်လို့ အဖြေတွေ ထစ်နေရင် ဒါမှမဟုတ် repetition တွေဖြစ်နေရင် Parameter ဘယ်လိုညှိရမလဲဆိုတာ ကျွန်တော် ထပ်ပြောပြပေးနိုင်ပါတယ်။
|
||||
|
||||
```
|
||||
3
added_tokens.json
Normal file
3
added_tokens.json
Normal file
@@ -0,0 +1,3 @@
|
||||
{
|
||||
"<|endoftext|>": 44212
|
||||
}
|
||||
32
config.json
Normal file
32
config.json
Normal file
@@ -0,0 +1,32 @@
|
||||
{
|
||||
"activation_function": "gelu_new",
|
||||
"architectures": [
|
||||
"GPT2LMHeadModel"
|
||||
],
|
||||
"attn_pdrop": 0.1,
|
||||
"bos_token_id": 44212,
|
||||
"dtype": "float32",
|
||||
"embd_pdrop": 0.1,
|
||||
"eos_token_id": 44212,
|
||||
"initializer_range": 0.02,
|
||||
"layer_norm_epsilon": 1e-05,
|
||||
"model_type": "gpt2",
|
||||
"n_ctx": 1024,
|
||||
"n_embd": 768,
|
||||
"n_head": 12,
|
||||
"n_inner": null,
|
||||
"n_layer": 12,
|
||||
"n_positions": 1024,
|
||||
"reorder_and_upcast_attn": false,
|
||||
"resid_pdrop": 0.1,
|
||||
"scale_attn_by_inverse_layer_idx": false,
|
||||
"scale_attn_weights": true,
|
||||
"summary_activation": null,
|
||||
"summary_first_dropout": 0.1,
|
||||
"summary_proj_to_labels": true,
|
||||
"summary_type": "cls_index",
|
||||
"summary_use_proj": true,
|
||||
"transformers_version": "4.57.3",
|
||||
"use_cache": true,
|
||||
"vocab_size": 44213
|
||||
}
|
||||
6
generation_config.json
Normal file
6
generation_config.json
Normal file
@@ -0,0 +1,6 @@
|
||||
{
|
||||
"_from_model_config": true,
|
||||
"bos_token_id": 44212,
|
||||
"eos_token_id": 44212,
|
||||
"transformers_version": "4.57.3"
|
||||
}
|
||||
43952
merges.txt
Normal file
43952
merges.txt
Normal file
File diff suppressed because it is too large
Load Diff
3
model.safetensors
Normal file
3
model.safetensors
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:baa1e21ff547ae2860f9afb7bbf47e265c66034d90fe933a4e8b9ab1576488bd
|
||||
size 479207040
|
||||
3
shweyon_v2_1_Q8_0.gguf
Normal file
3
shweyon_v2_1_Q8_0.gguf
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:a8f81cf296301f8238893f6aa1857ffc594c957edc167bb91f0e04e99b30a840
|
||||
size 131753792
|
||||
24
special_tokens_map.json
Normal file
24
special_tokens_map.json
Normal file
@@ -0,0 +1,24 @@
|
||||
{
|
||||
"bos_token": {
|
||||
"content": "<|endoftext|>",
|
||||
"lstrip": false,
|
||||
"normalized": true,
|
||||
"rstrip": false,
|
||||
"single_word": false
|
||||
},
|
||||
"eos_token": {
|
||||
"content": "<|endoftext|>",
|
||||
"lstrip": false,
|
||||
"normalized": true,
|
||||
"rstrip": false,
|
||||
"single_word": false
|
||||
},
|
||||
"pad_token": "<|endoftext|>",
|
||||
"unk_token": {
|
||||
"content": "<|endoftext|>",
|
||||
"lstrip": false,
|
||||
"normalized": true,
|
||||
"rstrip": false,
|
||||
"single_word": false
|
||||
}
|
||||
}
|
||||
220079
tokenizer.json
Normal file
220079
tokenizer.json
Normal file
File diff suppressed because it is too large
Load Diff
23
tokenizer_config.json
Normal file
23
tokenizer_config.json
Normal file
@@ -0,0 +1,23 @@
|
||||
{
|
||||
"add_bos_token": false,
|
||||
"add_prefix_space": false,
|
||||
"added_tokens_decoder": {
|
||||
"44212": {
|
||||
"content": "<|endoftext|>",
|
||||
"lstrip": false,
|
||||
"normalized": true,
|
||||
"rstrip": false,
|
||||
"single_word": false,
|
||||
"special": true
|
||||
}
|
||||
},
|
||||
"bos_token": "<|endoftext|>",
|
||||
"clean_up_tokenization_spaces": false,
|
||||
"eos_token": "<|endoftext|>",
|
||||
"errors": "replace",
|
||||
"extra_special_tokens": {},
|
||||
"model_max_length": 1000000000000000019884624838656,
|
||||
"pad_token": "<|endoftext|>",
|
||||
"tokenizer_class": "GPT2Tokenizer",
|
||||
"unk_token": "<|endoftext|>"
|
||||
}
|
||||
1
vocab.json
Normal file
1
vocab.json
Normal file
File diff suppressed because one or more lines are too long
Reference in New Issue
Block a user