初始化项目,由ModelHub XC社区提供模型
Model: nlp-waseda/gpt2-small-japanese Source: Original Platform
This commit is contained in:
27
.gitattributes
vendored
Normal file
27
.gitattributes
vendored
Normal file
@@ -0,0 +1,27 @@
|
|||||||
|
*.7z filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.arrow filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.bin filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.bin.* filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.bz2 filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.ftz filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.gz filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.h5 filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.joblib filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.lfs.* filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.model filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.msgpack filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.onnx filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.ot filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.parquet filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.pb filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.pt filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.pth filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.rar filter=lfs diff=lfs merge=lfs -text
|
||||||
|
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.tar.* filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.tflite filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.tgz filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.xz filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.zip filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.zstandard filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*tfevents* filter=lfs diff=lfs merge=lfs -text
|
||||||
59
README.md
Normal file
59
README.md
Normal file
@@ -0,0 +1,59 @@
|
|||||||
|
---
|
||||||
|
language:
|
||||||
|
- ja
|
||||||
|
license: cc-by-sa-4.0
|
||||||
|
datasets:
|
||||||
|
- wikipedia
|
||||||
|
- cc100
|
||||||
|
widget:
|
||||||
|
- text: "早稲田 大学 で 自然 言語 処理 を"
|
||||||
|
---
|
||||||
|
|
||||||
|
# nlp-waseda/gpt2-small-japanese
|
||||||
|
|
||||||
|
This model is Japanese GPT-2 pretrained on Japanese Wikipedia and CC-100.
|
||||||
|
|
||||||
|
## Intended uses & limitations
|
||||||
|
|
||||||
|
You can use the raw model for text generation or fine-tune it to a downstream task.
|
||||||
|
|
||||||
|
Note that the texts should be segmented into words using Juman++ in advance.
|
||||||
|
|
||||||
|
### How to use
|
||||||
|
|
||||||
|
You can use this model directly with a pipeline for text generation. Since the generation relies on some randomness, we set a seed for reproducibility:
|
||||||
|
|
||||||
|
```python
|
||||||
|
>>> from transformers import pipeline, set_seed
|
||||||
|
>>> generator = pipeline('text-generation', model='nlp-waseda/gpt2-small-japanese')
|
||||||
|
>>> set_seed(42)
|
||||||
|
>>> generator("早稲田 大学 で 自然 言語 処理 を", max_length=30, do_sample=True, pad_token_id=2, num_return_sequences=5)
|
||||||
|
[{'generated_text': '早稲田 大学 で 自然 言語 処理 を 学び 、 帰国 後 、 早稲田 大学 理工 学部 に 入学 し ます 。 卒業 後 、 早稲田 大学 工学 研究 科 、'},
|
||||||
|
{'generated_text': '早稲田 大学 で 自然 言語 処理 を 学び 、 アメリカ の 大学 で 学士 号 を 取得 、 修士 の 取得 で 博士 号 を 取得 。 2008 年'},
|
||||||
|
{'generated_text': '早稲田 大学 で 自然 言語 処理 を 勉強 して い ます 。 学部 は 日本 語 学科 を 専攻 して い ます 。 英語 が 話せる と いう'},
|
||||||
|
{'generated_text': '早稲田 大学 で 自然 言語 処理 を 専攻 して いた 。 2011 年 に 第 26 回 日本 化学 会 学生 委員 会 奨励 賞 ( 第 2 年次 審査'},
|
||||||
|
{'generated_text': '早稲田 大学 で 自然 言語 処理 を 中心 と する 言語 学 研究 を 行って いる 。 東京 都 ・ 豊島 区 の お 見合い 相手 。'}]
|
||||||
|
```
|
||||||
|
|
||||||
|
Here is how to use this model to get the features of a given text in PyTorch:
|
||||||
|
|
||||||
|
```python
|
||||||
|
from transformers import ReformerTokenizer, GPT2Model
|
||||||
|
tokenizer = ReformerTokenizer.from_pretrained('nlp-waseda/gpt2-small-japanese')
|
||||||
|
model = GPT2Model.from_pretrained('nlp-waseda/gpt2-small-japanese')
|
||||||
|
text = "早稲田 大学 で 自然 言語 処理 を"
|
||||||
|
encoded_input = tokenizer(text, return_tensors='pt')
|
||||||
|
output = model(**encoded_input)
|
||||||
|
```
|
||||||
|
|
||||||
|
## Training data
|
||||||
|
|
||||||
|
The GPT-2 model was pretrained on Japanese Wikipedia, dumped on 2022-03-20, and the Japanese portion of CC-100.
|
||||||
|
|
||||||
|
## Training procedure
|
||||||
|
|
||||||
|
### Preprocessing
|
||||||
|
|
||||||
|
The texts are normalized using zenhan, segmented into words using Juman++, and tokenized using SentencePiece. Juman++ 2.0.0-rc3 was used for pretraining.
|
||||||
|
|
||||||
|
The model was trained on 8 NVIDIA A100 GPUs.
|
||||||
31
config.json
Normal file
31
config.json
Normal file
@@ -0,0 +1,31 @@
|
|||||||
|
{
|
||||||
|
"activation_function": "gelu_new",
|
||||||
|
"architectures": [
|
||||||
|
"GPT2LMHeadModel"
|
||||||
|
],
|
||||||
|
"attn_pdrop": 0.1,
|
||||||
|
"bos_token_id": 2,
|
||||||
|
"embd_pdrop": 0.1,
|
||||||
|
"eos_token_id": 2,
|
||||||
|
"initializer_range": 0.02,
|
||||||
|
"layer_norm_epsilon": 1e-05,
|
||||||
|
"model_type": "gpt2",
|
||||||
|
"n_embd": 768,
|
||||||
|
"n_head": 12,
|
||||||
|
"n_inner": null,
|
||||||
|
"n_layer": 12,
|
||||||
|
"n_positions": 1024,
|
||||||
|
"reorder_and_upcast_attn": false,
|
||||||
|
"resid_pdrop": 0.1,
|
||||||
|
"scale_attn_by_inverse_layer_idx": false,
|
||||||
|
"scale_attn_weights": true,
|
||||||
|
"summary_activation": null,
|
||||||
|
"summary_first_dropout": 0.1,
|
||||||
|
"summary_proj_to_labels": true,
|
||||||
|
"summary_type": "cls_index",
|
||||||
|
"summary_use_proj": true,
|
||||||
|
"torch_dtype": "float32",
|
||||||
|
"transformers_version": "4.18.0.dev0",
|
||||||
|
"use_cache": true,
|
||||||
|
"vocab_size": 32000
|
||||||
|
}
|
||||||
3
pytorch_model.bin
Normal file
3
pytorch_model.bin
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:c8dbcc67b3c0f8203797de05d1996d12863115dd76ad4abb3714fd3eedfc7950
|
||||||
|
size 454313760
|
||||||
1
special_tokens_map.json
Normal file
1
special_tokens_map.json
Normal file
@@ -0,0 +1 @@
|
|||||||
|
{"eos_token": "</s>", "unk_token": "<unk>"}
|
||||||
3
spiece.model
Normal file
3
spiece.model
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:33ce6c35a3f5a3028975f75c05eeda077e6ac96e49894778b19296280566132d
|
||||||
|
size 812016
|
||||||
128058
tokenizer.json
Normal file
128058
tokenizer.json
Normal file
File diff suppressed because one or more lines are too long
1
tokenizer_config.json
Normal file
1
tokenizer_config.json
Normal file
@@ -0,0 +1 @@
|
|||||||
|
{"eos_token": "</s>", "unk_token": "<unk>", "additional_special_tokens": [], "sp_model_kwargs": {}, "tokenizer_class": "ReformerTokenizer"}
|
||||||
Reference in New Issue
Block a user