100 lines
3.2 KiB
Markdown
100 lines
3.2 KiB
Markdown
|
|
---
|
||
|
|
language:
|
||
|
|
- ja
|
||
|
|
license: mit
|
||
|
|
library_name: transformers
|
||
|
|
pipeline_tag: text-generation
|
||
|
|
tags:
|
||
|
|
- mirei
|
||
|
|
- llama
|
||
|
|
- pretraining
|
||
|
|
base_model: iamtatsuki05/Llama-JP-0.5B-init
|
||
|
|
datasets:
|
||
|
|
- hotchpotch/fineweb-2-edu-japanese
|
||
|
|
---
|
||
|
|
|
||
|
|
# Llama-JP-0.5B-PT-stage1
|
||
|
|
|
||
|
|
[English](README.md) / Japanese
|
||
|
|
|
||
|
|
|
||
|
|
## Overview
|
||
|
|
Llama-JP-0.5B-PT-stage1 は、[iamtatsuki05/Llama-JP-0.5B-init](https://huggingface.co/iamtatsuki05/Llama-JP-0.5B-init) を [hotchpotch/fineweb-2-edu-japanese](https://huggingface.co/datasets/hotchpotch/fineweb-2-edu-japanese) で学習した非埋め込みパラメータが約 0.5B パラメータの日本語の Llama モデルです。 最大 1,024 トークンで 10B トークン学習させました。
|
||
|
|
|
||
|
|
|
||
|
|
- **[Hugging Face Collection](https://huggingface.co/collections/iamtatsuki05/mirei)**
|
||
|
|
- **[GitHub](https://github.com/iamtatsuki05/MIREI)**
|
||
|
|
|
||
|
|

|
||
|
|
|
||
|
|
## Usage
|
||
|
|
### Requirements
|
||
|
|
```
|
||
|
|
transformers>=4.51.0
|
||
|
|
accelerate>=1.6.0
|
||
|
|
sentencepiece>=0.2.0
|
||
|
|
flash-attn>=2.7.3
|
||
|
|
```
|
||
|
|
|
||
|
|
### Sample Code
|
||
|
|
```python
|
||
|
|
import torch
|
||
|
|
from transformers import AutoModelForCausalLM, AutoTokenizer
|
||
|
|
|
||
|
|
model_name = "iamtatsuki05/Llama-JP-0.5B-PT-stage1"
|
||
|
|
model_kwargs = {
|
||
|
|
"torch_dtype": torch.bfloat16,
|
||
|
|
"attn_implementation": "flash_attention_2",
|
||
|
|
"device_map": "auto",
|
||
|
|
}
|
||
|
|
tokenizer = AutoTokenizer.from_pretrained(model_name)
|
||
|
|
model = AutoModelForCausalLM.from_pretrained(model_name, **model_kwargs)
|
||
|
|
|
||
|
|
prompt = "ちいかわのハチワレは"
|
||
|
|
inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
|
||
|
|
output = model.generate(
|
||
|
|
**inputs,
|
||
|
|
max_new_tokens=256,
|
||
|
|
temperature=0.8,
|
||
|
|
top_p=0.9,
|
||
|
|
do_sample=True,
|
||
|
|
)
|
||
|
|
print(tokenizer.decode(output[0], skip_special_tokens=True))
|
||
|
|
```
|
||
|
|
|
||
|
|
|
||
|
|
## Model Details
|
||
|
|
- **ベースモデル:** [iamtatsuki05/Llama-JP-0.5B-init](https://huggingface.co/iamtatsuki05/Llama-JP-0.5B-init)
|
||
|
|
- **アーキテクチャ:** Llama
|
||
|
|
- **最大シーケンス長:** 8,192 トークン
|
||
|
|
- **埋め込み次元:** 1280
|
||
|
|
- **トークナイザ:** SentencePiece / 語彙数 102,400
|
||
|
|
- **位置エンコーディング:** RoPE
|
||
|
|
- **対応言語:** 日本語
|
||
|
|
|
||
|
|
|
||
|
|
## Model Series
|
||
|
|
|
||
|
|
初期化済みモデルに対して [hotchpotch/fineweb-2-edu-japanese](https://huggingface.co/datasets/hotchpotch/fineweb-2-edu-japanese) で最大 1,024 トークンを約 10B トークン分事前学習したモデル群です。
|
||
|
|
|
||
|
|
| ID | Architecture | #Param. | #Param.<br>w/o Emb. |
|
||
|
|
|:-:|:-:|:-:|:-:|
|
||
|
|
| [iamtatsuki05/ModernBERT-JP-0.5B-PT-stage1](https://huggingface.co/iamtatsuki05/ModernBERT-JP-0.5B-PT-stage1) | ModernBERT | 679M | 548M |
|
||
|
|
| [iamtatsuki05/Llama-JP-0.5B-PT-stage1](https://huggingface.co/iamtatsuki05/Llama-JP-0.5B-PT-stage1)<br>(this model) | Llama | 661M | 530M |
|
||
|
|
|
||
|
|
|
||
|
|
## Licence
|
||
|
|
このモデルは [MIT](https://licenses.opensource.jp/MIT/MIT.html) でライセンスされています。
|
||
|
|
|
||
|
|
|
||
|
|
## How to Cite
|
||
|
|
|
||
|
|
```tex
|
||
|
|
@article{MIREI
|
||
|
|
title={同一条件下における Encoder/Decoder アーキテクチャによる文埋め込みの性能分析},
|
||
|
|
author={岡田 龍樹 and 杉本 徹},
|
||
|
|
journal={言語処理学会第 32 回年次大会 (NLP2026)},
|
||
|
|
year={2026}
|
||
|
|
}
|
||
|
|
```
|