初始化项目,由ModelHub XC社区提供模型
Model: akahana/gpt2-indonesia Source: Original Platform
This commit is contained in:
28
.gitattributes
vendored
Normal file
28
.gitattributes
vendored
Normal file
@@ -0,0 +1,28 @@
|
||||
*.7z filter=lfs diff=lfs merge=lfs -text
|
||||
*.arrow filter=lfs diff=lfs merge=lfs -text
|
||||
*.bin filter=lfs diff=lfs merge=lfs -text
|
||||
*.bin.* filter=lfs diff=lfs merge=lfs -text
|
||||
*.bz2 filter=lfs diff=lfs merge=lfs -text
|
||||
*.ftz filter=lfs diff=lfs merge=lfs -text
|
||||
*.gz filter=lfs diff=lfs merge=lfs -text
|
||||
*.h5 filter=lfs diff=lfs merge=lfs -text
|
||||
*.joblib filter=lfs diff=lfs merge=lfs -text
|
||||
*.lfs.* filter=lfs diff=lfs merge=lfs -text
|
||||
*.model filter=lfs diff=lfs merge=lfs -text
|
||||
*.msgpack filter=lfs diff=lfs merge=lfs -text
|
||||
*.onnx filter=lfs diff=lfs merge=lfs -text
|
||||
*.ot filter=lfs diff=lfs merge=lfs -text
|
||||
*.parquet filter=lfs diff=lfs merge=lfs -text
|
||||
*.pb filter=lfs diff=lfs merge=lfs -text
|
||||
*.pt filter=lfs diff=lfs merge=lfs -text
|
||||
*.pth filter=lfs diff=lfs merge=lfs -text
|
||||
*.rar filter=lfs diff=lfs merge=lfs -text
|
||||
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
|
||||
*.tar.* filter=lfs diff=lfs merge=lfs -text
|
||||
*.tflite filter=lfs diff=lfs merge=lfs -text
|
||||
*.tgz filter=lfs diff=lfs merge=lfs -text
|
||||
*.xz filter=lfs diff=lfs merge=lfs -text
|
||||
*.zip filter=lfs diff=lfs merge=lfs -text
|
||||
*.zstandard filter=lfs diff=lfs merge=lfs -text
|
||||
*tfevents* filter=lfs diff=lfs merge=lfs -text
|
||||
model.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||
30
README.md
Normal file
30
README.md
Normal file
@@ -0,0 +1,30 @@
|
||||
---
|
||||
language: "id"
|
||||
widget:
|
||||
- text: "dahulu kala ada sebuah"
|
||||
---
|
||||
|
||||
## how to use
|
||||
|
||||
```python
|
||||
from transformers import pipeline, set_seed
|
||||
|
||||
path = "akahana/gpt2-indonesia"
|
||||
generator = pipeline('text-generation',
|
||||
model=path)
|
||||
set_seed(42)
|
||||
|
||||
kalimat = "dahulu kala ada sebuah"
|
||||
preds = generator(kalimat,
|
||||
max_length=64,
|
||||
num_return_sequences=3)
|
||||
for data in preds:
|
||||
print(data)
|
||||
|
||||
|
||||
{'generated_text': 'dahulu kala ada sebuah perkampungan yang bernama pomere. namun kini kawasan ini sudah tidak dikembangkan lagi sebagai kawasan industri seperti perusahaan pupuk. sumber-sumber lain sudah sulit ditemukan karena belum adanya kilang pupuk milik indonesia yang sering di kembangkan sehingga belum ada satupun yang masih tersisa yang tersisa. kawasan ini juga memproduksi gula aren milik pt graha bina sarana'}
|
||||
{'generated_text': 'dahulu kala ada sebuah desa kecil bernama desa. desa yang terkenal seperti halnya kota terdekat lainnya adalah desa tetangga yang bernama sama."\n"sebuah masjid merupakan suatu tempat suci yang digunakan umat islam untuk beribadah. beberapa masjid yang didaftarkan berikut memiliki suatu kehormatan tersendiri bagi masing-masing denominasi islam di dunia. sebuah masjid selain memiliki fungsi sebagai tempat'}
|
||||
{'generated_text': 'dahulu kala ada sebuah peradaban yang dibangun di sebelah barat sungai mississippi di sekitar desa kecil desa yang bernama sama. penduduk asli di desa ini berasal dari etnis teweh yang berpindah agama menjadi kristen, namun kemudian pindah agama menjadi kristen. desa arawak mempunyai beberapa desa lain seperti adibei, deti, riuhut dan sa'}
|
||||
|
||||
|
||||
```
|
||||
1
added_tokens.json
Normal file
1
added_tokens.json
Normal file
@@ -0,0 +1 @@
|
||||
{"<|endoftext|>": 50257}
|
||||
14
all_results.json
Normal file
14
all_results.json
Normal file
@@ -0,0 +1,14 @@
|
||||
{
|
||||
"epoch": 35.0,
|
||||
"eval_loss": 2.2617902755737305,
|
||||
"eval_runtime": 115.5265,
|
||||
"eval_samples": 5290,
|
||||
"eval_samples_per_second": 45.79,
|
||||
"eval_steps_per_second": 5.73,
|
||||
"perplexity": 9.60026090370471,
|
||||
"train_loss": 2.6988527534168076,
|
||||
"train_runtime": 23608.904,
|
||||
"train_samples": 99940,
|
||||
"train_samples_per_second": 148.16,
|
||||
"train_steps_per_second": 1.158
|
||||
}
|
||||
39
config.json
Normal file
39
config.json
Normal file
@@ -0,0 +1,39 @@
|
||||
{
|
||||
"_name_or_path": "./gpt2/output",
|
||||
"activation_function": "gelu_new",
|
||||
"architectures": [
|
||||
"GPT2LMHeadModel"
|
||||
],
|
||||
"attn_pdrop": 0.1,
|
||||
"bos_token_id": 50256,
|
||||
"embd_pdrop": 0.1,
|
||||
"eos_token_id": 50256,
|
||||
"initializer_range": 0.02,
|
||||
"layer_norm_epsilon": 1e-05,
|
||||
"model_type": "gpt2",
|
||||
"n_ctx": 1024,
|
||||
"n_embd": 768,
|
||||
"n_head": 12,
|
||||
"n_inner": null,
|
||||
"n_layer": 12,
|
||||
"n_positions": 1024,
|
||||
"reorder_and_upcast_attn": false,
|
||||
"resid_pdrop": 0.1,
|
||||
"scale_attn_by_inverse_layer_idx": false,
|
||||
"scale_attn_weights": true,
|
||||
"summary_activation": null,
|
||||
"summary_first_dropout": 0.1,
|
||||
"summary_proj_to_labels": true,
|
||||
"summary_type": "cls_index",
|
||||
"summary_use_proj": true,
|
||||
"task_specific_params": {
|
||||
"text-generation": {
|
||||
"do_sample": true,
|
||||
"max_length": 50
|
||||
}
|
||||
},
|
||||
"torch_dtype": "float32",
|
||||
"transformers_version": "4.13.0.dev0",
|
||||
"use_cache": true,
|
||||
"vocab_size": 50258
|
||||
}
|
||||
9
eval_results.json
Normal file
9
eval_results.json
Normal file
@@ -0,0 +1,9 @@
|
||||
{
|
||||
"epoch": 35.0,
|
||||
"eval_loss": 2.2617902755737305,
|
||||
"eval_runtime": 115.5265,
|
||||
"eval_samples": 5290,
|
||||
"eval_samples_per_second": 45.79,
|
||||
"eval_steps_per_second": 5.73,
|
||||
"perplexity": 9.60026090370471
|
||||
}
|
||||
49997
merges.txt
Normal file
49997
merges.txt
Normal file
File diff suppressed because it is too large
Load Diff
3
model.safetensors
Normal file
3
model.safetensors
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:8f03bea0fdc6d310a5451e78b0bb0002b29ed37af4514c5bab04fe125b77daa3
|
||||
size 664755464
|
||||
3
pytorch_model.bin
Normal file
3
pytorch_model.bin
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:a4034228eb3a7f76d5e7c3c1f43ca1c0c0d992d27130cf91196325779be70ac8
|
||||
size 664794436
|
||||
1
special_tokens_map.json
Normal file
1
special_tokens_map.json
Normal file
@@ -0,0 +1 @@
|
||||
{"bos_token": "<|endoftext|>", "eos_token": "<|endoftext|>", "unk_token": "<|endoftext|>"}
|
||||
3
tf_model.h5
Normal file
3
tf_model.h5
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:b8a4a16f81c7a4d236ac109c3e244de8f3dae5cd1329e546533e25f7351aacfd
|
||||
size 497938536
|
||||
1
tokenizer.json
Normal file
1
tokenizer.json
Normal file
File diff suppressed because one or more lines are too long
1
tokenizer_config.json
Normal file
1
tokenizer_config.json
Normal file
@@ -0,0 +1 @@
|
||||
{"unk_token": "<|endoftext|>", "bos_token": "<|endoftext|>", "eos_token": "<|endoftext|>", "add_prefix_space": false, "special_tokens_map_file": null, "name_or_path": "./gpt2", "tokenizer_class": "GPT2Tokenizer"}
|
||||
8
train_results.json
Normal file
8
train_results.json
Normal file
@@ -0,0 +1,8 @@
|
||||
{
|
||||
"epoch": 35.0,
|
||||
"train_loss": 2.6988527534168076,
|
||||
"train_runtime": 23608.904,
|
||||
"train_samples": 99940,
|
||||
"train_samples_per_second": 148.16,
|
||||
"train_steps_per_second": 1.158
|
||||
}
|
||||
349
trainer_state.json
Normal file
349
trainer_state.json
Normal file
@@ -0,0 +1,349 @@
|
||||
{
|
||||
"best_metric": null,
|
||||
"best_model_checkpoint": null,
|
||||
"epoch": 35.0,
|
||||
"global_step": 27335,
|
||||
"is_hyper_param_search": false,
|
||||
"is_local_process_zero": true,
|
||||
"is_world_process_zero": true,
|
||||
"log_history": [
|
||||
{
|
||||
"epoch": 0.64,
|
||||
"learning_rate": 4.908542162063289e-05,
|
||||
"loss": 6.7425,
|
||||
"step": 500
|
||||
},
|
||||
{
|
||||
"epoch": 1.28,
|
||||
"learning_rate": 4.8170843241265775e-05,
|
||||
"loss": 5.4902,
|
||||
"step": 1000
|
||||
},
|
||||
{
|
||||
"epoch": 1.92,
|
||||
"learning_rate": 4.725626486189867e-05,
|
||||
"loss": 4.9535,
|
||||
"step": 1500
|
||||
},
|
||||
{
|
||||
"epoch": 2.56,
|
||||
"learning_rate": 4.6341686482531555e-05,
|
||||
"loss": 4.5816,
|
||||
"step": 2000
|
||||
},
|
||||
{
|
||||
"epoch": 3.2,
|
||||
"learning_rate": 4.5427108103164445e-05,
|
||||
"loss": 4.3055,
|
||||
"step": 2500
|
||||
},
|
||||
{
|
||||
"epoch": 3.84,
|
||||
"learning_rate": 4.451252972379733e-05,
|
||||
"loss": 4.0758,
|
||||
"step": 3000
|
||||
},
|
||||
{
|
||||
"epoch": 4.48,
|
||||
"learning_rate": 4.359795134443022e-05,
|
||||
"loss": 3.8768,
|
||||
"step": 3500
|
||||
},
|
||||
{
|
||||
"epoch": 5.12,
|
||||
"learning_rate": 4.268337296506311e-05,
|
||||
"loss": 3.7165,
|
||||
"step": 4000
|
||||
},
|
||||
{
|
||||
"epoch": 5.76,
|
||||
"learning_rate": 4.1768794585696e-05,
|
||||
"loss": 3.5584,
|
||||
"step": 4500
|
||||
},
|
||||
{
|
||||
"epoch": 6.4,
|
||||
"learning_rate": 4.085421620632888e-05,
|
||||
"loss": 3.431,
|
||||
"step": 5000
|
||||
},
|
||||
{
|
||||
"epoch": 7.04,
|
||||
"learning_rate": 3.993963782696177e-05,
|
||||
"loss": 3.3197,
|
||||
"step": 5500
|
||||
},
|
||||
{
|
||||
"epoch": 7.68,
|
||||
"learning_rate": 3.902505944759466e-05,
|
||||
"loss": 3.2002,
|
||||
"step": 6000
|
||||
},
|
||||
{
|
||||
"epoch": 8.32,
|
||||
"learning_rate": 3.811048106822755e-05,
|
||||
"loss": 3.1084,
|
||||
"step": 6500
|
||||
},
|
||||
{
|
||||
"epoch": 8.96,
|
||||
"learning_rate": 3.719590268886043e-05,
|
||||
"loss": 3.0326,
|
||||
"step": 7000
|
||||
},
|
||||
{
|
||||
"epoch": 9.6,
|
||||
"learning_rate": 3.628132430949332e-05,
|
||||
"loss": 2.9372,
|
||||
"step": 7500
|
||||
},
|
||||
{
|
||||
"epoch": 10.24,
|
||||
"learning_rate": 3.536674593012621e-05,
|
||||
"loss": 2.8657,
|
||||
"step": 8000
|
||||
},
|
||||
{
|
||||
"epoch": 10.88,
|
||||
"learning_rate": 3.44521675507591e-05,
|
||||
"loss": 2.8072,
|
||||
"step": 8500
|
||||
},
|
||||
{
|
||||
"epoch": 11.52,
|
||||
"learning_rate": 3.353758917139199e-05,
|
||||
"loss": 2.7354,
|
||||
"step": 9000
|
||||
},
|
||||
{
|
||||
"epoch": 12.16,
|
||||
"learning_rate": 3.2623010792024876e-05,
|
||||
"loss": 2.6862,
|
||||
"step": 9500
|
||||
},
|
||||
{
|
||||
"epoch": 12.8,
|
||||
"learning_rate": 3.1708432412657766e-05,
|
||||
"loss": 2.6269,
|
||||
"step": 10000
|
||||
},
|
||||
{
|
||||
"epoch": 13.44,
|
||||
"learning_rate": 3.0793854033290656e-05,
|
||||
"loss": 2.5687,
|
||||
"step": 10500
|
||||
},
|
||||
{
|
||||
"epoch": 14.08,
|
||||
"learning_rate": 2.9879275653923545e-05,
|
||||
"loss": 2.5422,
|
||||
"step": 11000
|
||||
},
|
||||
{
|
||||
"epoch": 14.72,
|
||||
"learning_rate": 2.896469727455643e-05,
|
||||
"loss": 2.4796,
|
||||
"step": 11500
|
||||
},
|
||||
{
|
||||
"epoch": 15.36,
|
||||
"learning_rate": 2.8050118895189322e-05,
|
||||
"loss": 2.4468,
|
||||
"step": 12000
|
||||
},
|
||||
{
|
||||
"epoch": 16.01,
|
||||
"learning_rate": 2.7135540515822205e-05,
|
||||
"loss": 2.4179,
|
||||
"step": 12500
|
||||
},
|
||||
{
|
||||
"epoch": 16.65,
|
||||
"learning_rate": 2.6220962136455095e-05,
|
||||
"loss": 2.3558,
|
||||
"step": 13000
|
||||
},
|
||||
{
|
||||
"epoch": 17.29,
|
||||
"learning_rate": 2.530638375708798e-05,
|
||||
"loss": 2.3408,
|
||||
"step": 13500
|
||||
},
|
||||
{
|
||||
"epoch": 17.93,
|
||||
"learning_rate": 2.439180537772087e-05,
|
||||
"loss": 2.3129,
|
||||
"step": 14000
|
||||
},
|
||||
{
|
||||
"epoch": 18.57,
|
||||
"learning_rate": 2.347722699835376e-05,
|
||||
"loss": 2.2645,
|
||||
"step": 14500
|
||||
},
|
||||
{
|
||||
"epoch": 19.21,
|
||||
"learning_rate": 2.2562648618986647e-05,
|
||||
"loss": 2.2492,
|
||||
"step": 15000
|
||||
},
|
||||
{
|
||||
"epoch": 19.85,
|
||||
"learning_rate": 2.1648070239619537e-05,
|
||||
"loss": 2.2222,
|
||||
"step": 15500
|
||||
},
|
||||
{
|
||||
"epoch": 20.49,
|
||||
"learning_rate": 2.0733491860252424e-05,
|
||||
"loss": 2.1802,
|
||||
"step": 16000
|
||||
},
|
||||
{
|
||||
"epoch": 21.13,
|
||||
"learning_rate": 1.9818913480885314e-05,
|
||||
"loss": 2.173,
|
||||
"step": 16500
|
||||
},
|
||||
{
|
||||
"epoch": 21.77,
|
||||
"learning_rate": 1.89043351015182e-05,
|
||||
"loss": 2.1459,
|
||||
"step": 17000
|
||||
},
|
||||
{
|
||||
"epoch": 22.41,
|
||||
"learning_rate": 1.7989756722151087e-05,
|
||||
"loss": 2.118,
|
||||
"step": 17500
|
||||
},
|
||||
{
|
||||
"epoch": 23.05,
|
||||
"learning_rate": 1.7075178342783976e-05,
|
||||
"loss": 2.1077,
|
||||
"step": 18000
|
||||
},
|
||||
{
|
||||
"epoch": 23.69,
|
||||
"learning_rate": 1.6160599963416863e-05,
|
||||
"loss": 2.0791,
|
||||
"step": 18500
|
||||
},
|
||||
{
|
||||
"epoch": 24.33,
|
||||
"learning_rate": 1.5246021584049754e-05,
|
||||
"loss": 2.0544,
|
||||
"step": 19000
|
||||
},
|
||||
{
|
||||
"epoch": 24.97,
|
||||
"learning_rate": 1.4331443204682643e-05,
|
||||
"loss": 2.0541,
|
||||
"step": 19500
|
||||
},
|
||||
{
|
||||
"epoch": 25.61,
|
||||
"learning_rate": 1.341686482531553e-05,
|
||||
"loss": 2.0238,
|
||||
"step": 20000
|
||||
},
|
||||
{
|
||||
"epoch": 26.25,
|
||||
"learning_rate": 1.2502286445948419e-05,
|
||||
"loss": 2.0115,
|
||||
"step": 20500
|
||||
},
|
||||
{
|
||||
"epoch": 26.89,
|
||||
"learning_rate": 1.1587708066581307e-05,
|
||||
"loss": 1.9977,
|
||||
"step": 21000
|
||||
},
|
||||
{
|
||||
"epoch": 27.53,
|
||||
"learning_rate": 1.0673129687214195e-05,
|
||||
"loss": 1.979,
|
||||
"step": 21500
|
||||
},
|
||||
{
|
||||
"epoch": 28.17,
|
||||
"learning_rate": 9.758551307847083e-06,
|
||||
"loss": 1.9705,
|
||||
"step": 22000
|
||||
},
|
||||
{
|
||||
"epoch": 28.81,
|
||||
"learning_rate": 8.843972928479972e-06,
|
||||
"loss": 1.9635,
|
||||
"step": 22500
|
||||
},
|
||||
{
|
||||
"epoch": 29.45,
|
||||
"learning_rate": 7.92939454911286e-06,
|
||||
"loss": 1.9388,
|
||||
"step": 23000
|
||||
},
|
||||
{
|
||||
"epoch": 30.09,
|
||||
"learning_rate": 7.014816169745747e-06,
|
||||
"loss": 1.9347,
|
||||
"step": 23500
|
||||
},
|
||||
{
|
||||
"epoch": 30.73,
|
||||
"learning_rate": 6.100237790378636e-06,
|
||||
"loss": 1.9227,
|
||||
"step": 24000
|
||||
},
|
||||
{
|
||||
"epoch": 31.37,
|
||||
"learning_rate": 5.1856594110115235e-06,
|
||||
"loss": 1.9157,
|
||||
"step": 24500
|
||||
},
|
||||
{
|
||||
"epoch": 32.01,
|
||||
"learning_rate": 4.271081031644412e-06,
|
||||
"loss": 1.9104,
|
||||
"step": 25000
|
||||
},
|
||||
{
|
||||
"epoch": 32.65,
|
||||
"learning_rate": 3.3565026522773006e-06,
|
||||
"loss": 1.895,
|
||||
"step": 25500
|
||||
},
|
||||
{
|
||||
"epoch": 33.29,
|
||||
"learning_rate": 2.4419242729101884e-06,
|
||||
"loss": 1.8957,
|
||||
"step": 26000
|
||||
},
|
||||
{
|
||||
"epoch": 33.93,
|
||||
"learning_rate": 1.5273458935430768e-06,
|
||||
"loss": 1.8829,
|
||||
"step": 26500
|
||||
},
|
||||
{
|
||||
"epoch": 34.57,
|
||||
"learning_rate": 6.127675141759649e-07,
|
||||
"loss": 1.8824,
|
||||
"step": 27000
|
||||
},
|
||||
{
|
||||
"epoch": 35.0,
|
||||
"step": 27335,
|
||||
"total_flos": 5.713934155776e+16,
|
||||
"train_loss": 2.6988527534168076,
|
||||
"train_runtime": 23608.904,
|
||||
"train_samples_per_second": 148.16,
|
||||
"train_steps_per_second": 1.158
|
||||
}
|
||||
],
|
||||
"max_steps": 27335,
|
||||
"num_train_epochs": 35,
|
||||
"total_flos": 5.713934155776e+16,
|
||||
"trial_name": null,
|
||||
"trial_params": null
|
||||
}
|
||||
3
training_args.bin
Normal file
3
training_args.bin
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:479fcaaa17cbced1ba01f7b545b882d75d139a89da1fbb57266758f9216ddec5
|
||||
size 2799
|
||||
1
vocab.json
Normal file
1
vocab.json
Normal file
File diff suppressed because one or more lines are too long
Reference in New Issue
Block a user