commit ffe2aaf1cb97d0550ca9c39f6a8e9b66aaae2236 Author: ModelHub XC Date: Sat Jul 18 16:51:06 2026 +0800 初始化项目,由ModelHub XC社区提供模型 Model: rinna/japanese-gpt-neox-small Source: Original Platform diff --git a/.gitattributes b/.gitattributes new file mode 100644 index 0000000..46ed354 --- /dev/null +++ b/.gitattributes @@ -0,0 +1,51 @@ +*.7z filter=lfs diff=lfs merge=lfs -text +*.arrow filter=lfs diff=lfs merge=lfs -text + + +*.bz2 filter=lfs diff=lfs merge=lfs -text +*.ftz filter=lfs diff=lfs merge=lfs -text +*.gz filter=lfs diff=lfs merge=lfs -text +*.h5 filter=lfs diff=lfs merge=lfs -text +*.joblib filter=lfs diff=lfs merge=lfs -text +*.lfs.* filter=lfs diff=lfs merge=lfs -text + +*.msgpack filter=lfs diff=lfs merge=lfs -text +*.onnx filter=lfs diff=lfs merge=lfs -text +*.ot filter=lfs diff=lfs merge=lfs -text +*.parquet filter=lfs diff=lfs merge=lfs -text +*.pb filter=lfs diff=lfs merge=lfs -text +*.pt filter=lfs diff=lfs merge=lfs -text +*.pth filter=lfs diff=lfs merge=lfs -text +*.rar filter=lfs diff=lfs merge=lfs -text +saved_model/**/* filter=lfs diff=lfs merge=lfs -text +*.tar.* filter=lfs diff=lfs merge=lfs -text +*.tflite filter=lfs diff=lfs merge=lfs -text +*.tgz filter=lfs diff=lfs merge=lfs -text +*.xz filter=lfs diff=lfs merge=lfs -text +*.zip filter=lfs diff=lfs merge=lfs -text +*.zstandard filter=lfs diff=lfs merge=lfs -text +*.tfevents* filter=lfs diff=lfs merge=lfs -text +*.db* filter=lfs diff=lfs merge=lfs -text +*.ark* filter=lfs diff=lfs merge=lfs -text +**/*ckpt*data* filter=lfs diff=lfs merge=lfs -text +**/*ckpt*.meta filter=lfs diff=lfs merge=lfs -text +**/*ckpt*.index filter=lfs diff=lfs merge=lfs -text + +*.ckpt filter=lfs diff=lfs merge=lfs -text +*.gguf* filter=lfs diff=lfs merge=lfs -text +*.ggml filter=lfs diff=lfs merge=lfs -text +*.llamafile* filter=lfs diff=lfs merge=lfs -text +*.pt2 filter=lfs diff=lfs merge=lfs -text +*.mlmodel filter=lfs diff=lfs merge=lfs -text +*.npy filter=lfs diff=lfs merge=lfs -text +*.npz filter=lfs diff=lfs merge=lfs -text +*.pickle filter=lfs diff=lfs merge=lfs -text +*.pkl filter=lfs diff=lfs merge=lfs -text +*.tar filter=lfs diff=lfs merge=lfs -text +*.wasm filter=lfs diff=lfs merge=lfs -text +*.zst filter=lfs diff=lfs merge=lfs -text +*tfevents* filter=lfs diff=lfs merge=lfs -text + +spiece.model filter=lfs diff=lfs merge=lfs -text +pytorch_model.bin filter=lfs diff=lfs merge=lfs -text +model.safetensors filter=lfs diff=lfs merge=lfs -text \ No newline at end of file diff --git a/README.md b/README.md new file mode 100644 index 0000000..cf34eec --- /dev/null +++ b/README.md @@ -0,0 +1,87 @@ +--- +language: ja +thumbnail: https://github.com/rinnakk/japanese-pretrained-models/blob/master/rinna.png +tags: +- gpt-neox +- text-generation +- lm +- nlp +license: mit +datasets: +- cc100 +- Wikipedia +- mc4 +inference: false +--- + +# japanese-gpt-neox-small + +![rinna-icon](./rinna.png) + +This repository provides a small-sized Japanese GPT-NeoX model. The model was trained using code based on [EleutherAI/gpt-neox](https://github.com/EleutherAI/gpt-neox). + +# Update log +* 2023/03/20 Update the model weight and config files such that it can be loaded via Huggingface's official GPT-NeoX implementation. + +# How to use the model + +~~~~ +from transformers import AutoTokenizer, AutoModelForCausalLM + +tokenizer = AutoTokenizer.from_pretrained("rinna/japanese-gpt-neox-small", use_fast=False) +model = GPTNeoXForCausalLM.from_pretrained("rinna/japanese-gpt-neox-small") +~~~~ + +# Model architecture +A 12-layer, 768-hidden-size transformer-based language model. + +# Training +The model was trained on [Japanese CC-100](http://data.statmt.org/cc-100/ja.txt.xz), [Japanese C4](https://huggingface.co/datasets/mc4), and [Japanese Wikipedia](https://dumps.wikimedia.org/other/cirrussearch) to optimize a traditional language modelling objective. + +# Tokenization +The model uses a [sentencepiece](https://github.com/google/sentencepiece)-based tokenizer. + +# A toy prefix-tuning weight file +Along with pretrained model, we also release a [prefix-tuning](https://arxiv.org/abs/2101.00190) weight file named `smileface_suffix.task0.weight` for demonstration. The toy prefix-tuning weights here is trained to encourage the model to end every generated sentence with a smiling face emoji 😃. Find the training/inference code for prefix-tuning at our Github repo [prefix-tuning-gpt](https://github.com/rinnakk/prefix-tuning-gpt). + +Here are a few samples generated with and without the toy prefix weights, respectively. + +3 samples without the prefix weights + +> 1. 「きっとそれは絶対間違ってないね。 わたしには5か国語に4つの外国語の意味なんてわからない。 でも、とりあえずこの簡単な英文がどんな意味を持つのか知りたいよね!」 +> 2. 25分頃に公園に着いて、ベンチに座って待っていると、またしてもS先生から連絡が入りました。 確か、午後の礼拝の時に自分の持ってきたお弁当を食べた記憶が鮮明に残っています。 後でインターネットで検索したら、S先生のブログに飛びました。 今日の晩ごはんは焼きナスを作ってみました! * 上の写真は昨日の朝焼けです。 +> 3. CTで歯形ができて、その後さらにその歯形が再び噛めるようになるのは、何が原因だろう? 虫歯になった原因も、口臭かな? それとも歯周病かな? 歯石がとれるまで、、、もうちょっとかかりそう。 子供の虫歯って、なかなか治らないですよね。親兄弟で何度か。 子供の歯根は、親のものになります。 そして自分のものだったり、知らない間に抜いたりし、生えてきたりもします。 大人になって親からみた場合は、白い歯に変わってきて、金属のようーでも悪くなく、親からのむし歯の心配はないですよね。 + +3 samples with the prefix weights: +> 1. ※海外ブランド品の場合は、返品・返金等はお受け致しかねますので予めご了承願います。 ※ 商品発送後、お客様へ商品返送完了までのスピードを重視する方は海外ブランド品を先に送り付けさせて頂く ケースがございます。 😃 +> 2. 私は過去に持っていた不動産を、中古住宅として売却していましたが、その後の私の状況はどうだったのでしょうか? 😃 結果としては、投資物件として売却を考えていますが、今までの相場も読んでいただけばわかると思います。 😃 今まで、物件に対しての投資は非常に控えめにしてきたのですが、今回の提案を読んで、実際に物件を購入する際にはきちんと確認をしようと思います。 😃 +> 3. この写真集の表紙をこの台紙にしている作家さんは、まるで誰かの指示を受けて行動している人物のように見える、というのが、この作品をやぶにらんだ「殺し屋集団」の描いている作品であるように思 います。 😃 + +# Inference with FasterTransformer +After version 5.1, [NVIDIA FasterTransformer](https://github.com/NVIDIA/FasterTransformer) now supports both inference for GPT-NeoX and a variety of soft prompts (including prefix-tuning). The released pretrained model and prefix weights in this repo have been verified to work with FasterTransformer 5.1. + +# Release date +September 5, 2022 + +# How to cite +```bibtex +@misc{rinna-japanese-gpt-neox-small, + title = {rinna/japanese-gpt-neox-small}, + author = {Zhao, Tianyu and Sawada, Kei}, + url = {https://huggingface.co/rinna/japanese-gpt-neox-small} +} + +@inproceedings{sawada2024release, + title = {Release of Pre-Trained Models for the {J}apanese Language}, + author = {Sawada, Kei and Zhao, Tianyu and Shing, Makoto and Mitsui, Kentaro and Kaga, Akio and Hono, Yukiya and Wakatsuki, Toshiaki and Mitsuda, Koh}, + booktitle = {Proceedings of the 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation (LREC-COLING 2024)}, + month = {5}, + year = {2024}, + pages = {13898--13905}, + url = {https://aclanthology.org/2024.lrec-main.1213}, + note = {\url{https://arxiv.org/abs/2404.01657}} +} +``` + +# Licenese +[The MIT license](https://opensource.org/licenses/MIT) diff --git a/config.json b/config.json new file mode 100644 index 0000000..82f561d --- /dev/null +++ b/config.json @@ -0,0 +1,24 @@ +{ + "architectures": [ + "GPTNeoXForCausalLM" + ], + "bos_token_id": 2, + "eos_token_id": 3, + "hidden_act": "gelu", + "hidden_size": 768, + "initializer_range": 0.02, + "intermediate_size": 3072, + "layer_norm_eps": 1e-05, + "max_position_embeddings": 2048, + "model_type": "gpt_neox", + "num_attention_heads": 12, + "num_hidden_layers": 12, + "rotary_emb_base": 10000, + "rotary_pct": 1.0, + "tie_word_embeddings": false, + "tokenizer_class": "T5Tokenizer", + "torch_dtype": "float32", + "use_cache": true, + "use_parallel_residual": false, + "vocab_size": 44416 +} diff --git a/configuration.json b/configuration.json new file mode 100644 index 0000000..bbeeda1 --- /dev/null +++ b/configuration.json @@ -0,0 +1 @@ +{"framework": "pytorch", "task": "text-generation", "allow_remote": true} \ No newline at end of file diff --git a/model.safetensors b/model.safetensors new file mode 100644 index 0000000..b746a3d --- /dev/null +++ b/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:f99fd1a9d490ca7225f56bb313263a2f7e22e02e96eafc2b7d512621040efbcc +size 663470088 diff --git a/pytorch_model.bin b/pytorch_model.bin new file mode 100644 index 0000000..811eb42 --- /dev/null +++ b/pytorch_model.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:58e3f25be62e0e5e860b36a4e9b1ef0bd9299378a488c1dafb48526222076d5b +size 663506641 diff --git a/rinna.png b/rinna.png new file mode 100644 index 0000000..d0f007e Binary files /dev/null and b/rinna.png differ diff --git a/smileface_suffix.task0.weight b/smileface_suffix.task0.weight new file mode 100644 index 0000000..7419f49 Binary files /dev/null and b/smileface_suffix.task0.weight differ diff --git a/special_tokens_map.json b/special_tokens_map.json new file mode 100644 index 0000000..6d5b058 --- /dev/null +++ b/special_tokens_map.json @@ -0,0 +1 @@ +{"bos_token": "", "eos_token": "", "unk_token": "", "sep_token": "[SEP]", "pad_token": "[PAD]", "cls_token": "[CLS]", "mask_token": "[MASK]"} \ No newline at end of file diff --git a/spiece.model b/spiece.model new file mode 100644 index 0000000..568a0eb --- /dev/null +++ b/spiece.model @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:fa7a52f74800c7382e72a29e11bf95eb53cd9960a5d181bb37cc4482de43ebfb +size 1045480 diff --git a/tokenizer_config.json b/tokenizer_config.json new file mode 100644 index 0000000..abf7e7f --- /dev/null +++ b/tokenizer_config.json @@ -0,0 +1 @@ +{"eos_token": "", "unk_token": "[UNK]", "pad_token": "[PAD]", "extra_ids": 0, "additional_special_tokens": [], "sp_model_kwargs": {}, "bos_token": "", "cls_token": "[CLS]", "sep_token": "[SEP]", "mask_token": "[MASK]", "do_lower_case": false, "tokenizer_class": "T5Tokenizer"} \ No newline at end of file