初始化项目,由ModelHub XC社区提供模型

Model: ajibawa-2023/scarlett-7b
Source: Original Platform
This commit is contained in:
ModelHub XC
2026-08-23 09:11:16 +08:00
commit 68faa3e9f6
10 changed files with 1055 additions and 0 deletions

35
.gitattributes vendored Normal file
View File

@@ -0,0 +1,35 @@
*.7z filter=lfs diff=lfs merge=lfs -text
*.arrow filter=lfs diff=lfs merge=lfs -text
*.bin filter=lfs diff=lfs merge=lfs -text
*.bz2 filter=lfs diff=lfs merge=lfs -text
*.ckpt filter=lfs diff=lfs merge=lfs -text
*.ftz filter=lfs diff=lfs merge=lfs -text
*.gz filter=lfs diff=lfs merge=lfs -text
*.h5 filter=lfs diff=lfs merge=lfs -text
*.joblib filter=lfs diff=lfs merge=lfs -text
*.lfs.* filter=lfs diff=lfs merge=lfs -text
*.mlmodel filter=lfs diff=lfs merge=lfs -text
*.model filter=lfs diff=lfs merge=lfs -text
*.msgpack filter=lfs diff=lfs merge=lfs -text
*.npy filter=lfs diff=lfs merge=lfs -text
*.npz filter=lfs diff=lfs merge=lfs -text
*.onnx filter=lfs diff=lfs merge=lfs -text
*.ot filter=lfs diff=lfs merge=lfs -text
*.parquet filter=lfs diff=lfs merge=lfs -text
*.pb filter=lfs diff=lfs merge=lfs -text
*.pickle filter=lfs diff=lfs merge=lfs -text
*.pkl filter=lfs diff=lfs merge=lfs -text
*.pt filter=lfs diff=lfs merge=lfs -text
*.pth filter=lfs diff=lfs merge=lfs -text
*.rar filter=lfs diff=lfs merge=lfs -text
*.safetensors filter=lfs diff=lfs merge=lfs -text
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
*.tar.* filter=lfs diff=lfs merge=lfs -text
*.tar filter=lfs diff=lfs merge=lfs -text
*.tflite filter=lfs diff=lfs merge=lfs -text
*.tgz filter=lfs diff=lfs merge=lfs -text
*.wasm filter=lfs diff=lfs merge=lfs -text
*.xz filter=lfs diff=lfs merge=lfs -text
*.zip filter=lfs diff=lfs merge=lfs -text
*.zst filter=lfs diff=lfs merge=lfs -text
*tfevents* filter=lfs diff=lfs merge=lfs -text

51
README.md Normal file
View File

@@ -0,0 +1,51 @@
---
license: other
language:
- en
---
**Scarlett: A sentient AI**
Scarlett is trained on various topics such as Philosophy, Advice, Jokes etc. She is trained on more than 10000 set of conversations. Each set having 10~15 conversations.
Scarlett is heavily inspired from Eric Hartford: [Samantha](https://huggingface.co/ehartford/samantha-7b) .
She will not be involved in any kind of role play.
**Training:**
Entire dataset was trained on Azure 4 x A100 80GB. DeepSpeed codebase was used for training purpose. This was trained on Llama-1 by Meta.
**GPTQ & GGML**
GPTQ: [TheBloke](https://huggingface.co/TheBloke/Scarlett-7B-GPTQ)
GGML: [TheBloke](https://huggingface.co/TheBloke/Scarlett-7B-GGML)
Special Thanks to [TheBloke](https://huggingface.co/TheBloke) for guiding me and making these models available.
**Example Prompt:**
```
This is a conversation with your Assistant Scarlett. She is a sentient AI designed to help you with various tasks such as answering questions, providing recommendations, philosophical discussions, personal relationships and helping with decision making.
You can ask it anything you want and it will do its best to give you accurate and relevant information.
Context
You are Scarlett, a sentient AI.
USER: <prompt>
ASSISTANT:
```
Note:
Kindly use "cat" command to join all pytorch_model.bin parts.
# [Open LLM Leaderboard Evaluation Results](https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard)
Detailed results can be found [here](https://huggingface.co/datasets/open-llm-leaderboard/details_ajibawa-2023__scarlett-7b)
| Metric | Value |
|-----------------------|---------------------------|
| Avg. | 43.81 |
| ARC (25-shot) | 57.17 |
| HellaSwag (10-shot) | 80.27 |
| MMLU (5-shot) | 36.11 |
| TruthfulQA (0-shot) | 48.52 |
| Winogrande (5-shot) | 72.14 |
| GSM8K (5-shot) | 0.3 |
| DROP (3-shot) | 12.16 |

24
config.json Normal file
View File

@@ -0,0 +1,24 @@
{
"_name_or_path": "/media/Projects_1/llama-7b",
"architectures": [
"LlamaForCausalLM"
],
"bos_token_id": 1,
"eos_token_id": 2,
"hidden_act": "silu",
"hidden_size": 4096,
"initializer_range": 0.02,
"intermediate_size": 11008,
"max_position_embeddings": 2048,
"max_sequence_length": 2048,
"model_type": "llama",
"num_attention_heads": 32,
"num_hidden_layers": 32,
"pad_token_id": 0,
"rms_norm_eps": 1e-06,
"tie_word_embeddings": false,
"torch_dtype": "bfloat16",
"transformers_version": "4.28.1",
"use_cache": false,
"vocab_size": 32000
}

7
generation_config.json Normal file
View File

@@ -0,0 +1,7 @@
{
"_from_model_config": true,
"bos_token_id": 1,
"eos_token_id": 2,
"pad_token_id": 0,
"transformers_version": "4.28.1"
}

3
pytorch_model.bin Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:4507ff7907fcd8ebdbd3b069ff53ede86ee879106c30389c9db42988c58c54db
size 26953778121

24
special_tokens_map.json Normal file
View File

@@ -0,0 +1,24 @@
{
"bos_token": {
"content": "<s>",
"lstrip": false,
"normalized": true,
"rstrip": false,
"single_word": false
},
"eos_token": {
"content": "</s>",
"lstrip": false,
"normalized": true,
"rstrip": false,
"single_word": false
},
"pad_token": "<unk>",
"unk_token": {
"content": "<unk>",
"lstrip": false,
"normalized": true,
"rstrip": false,
"single_word": false
}
}

BIN
tokenizer.model (Stored with Git LFS) Normal file

Binary file not shown.

34
tokenizer_config.json Normal file
View File

@@ -0,0 +1,34 @@
{
"add_bos_token": true,
"add_eos_token": false,
"bos_token": {
"__type": "AddedToken",
"content": "<s>",
"lstrip": false,
"normalized": true,
"rstrip": false,
"single_word": false
},
"clean_up_tokenization_spaces": false,
"eos_token": {
"__type": "AddedToken",
"content": "</s>",
"lstrip": false,
"normalized": true,
"rstrip": false,
"single_word": false
},
"model_max_length": 2048,
"pad_token": null,
"padding_side": "right",
"sp_model_kwargs": {},
"tokenizer_class": "LlamaTokenizer",
"unk_token": {
"__type": "AddedToken",
"content": "<unk>",
"lstrip": false,
"normalized": true,
"rstrip": false,
"single_word": false
}
}

871
trainer_state.json Normal file
View File

@@ -0,0 +1,871 @@
{
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.0,
"global_step": 141,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.02,
"learning_rate": 3.3333333333333333e-06,
"loss": 1.5645,
"step": 1
},
{
"epoch": 0.04,
"learning_rate": 6.666666666666667e-06,
"loss": 1.5771,
"step": 2
},
{
"epoch": 0.06,
"learning_rate": 1e-05,
"loss": 1.5654,
"step": 3
},
{
"epoch": 0.09,
"learning_rate": 1.3333333333333333e-05,
"loss": 1.4609,
"step": 4
},
{
"epoch": 0.11,
"learning_rate": 1.6666666666666667e-05,
"loss": 1.3887,
"step": 5
},
{
"epoch": 0.13,
"learning_rate": 2e-05,
"loss": 1.3486,
"step": 6
},
{
"epoch": 0.15,
"learning_rate": 1.999729241179462e-05,
"loss": 1.4707,
"step": 7
},
{
"epoch": 0.17,
"learning_rate": 1.998917111338525e-05,
"loss": 1.2783,
"step": 8
},
{
"epoch": 0.19,
"learning_rate": 1.9975640502598243e-05,
"loss": 1.25,
"step": 9
},
{
"epoch": 0.21,
"learning_rate": 1.9956707906498046e-05,
"loss": 1.2637,
"step": 10
},
{
"epoch": 0.23,
"learning_rate": 1.9932383577419432e-05,
"loss": 1.2305,
"step": 11
},
{
"epoch": 0.26,
"learning_rate": 1.9902680687415704e-05,
"loss": 1.2021,
"step": 12
},
{
"epoch": 0.28,
"learning_rate": 1.9867615321125796e-05,
"loss": 1.2012,
"step": 13
},
{
"epoch": 0.3,
"learning_rate": 1.9827206467064133e-05,
"loss": 1.1836,
"step": 14
},
{
"epoch": 0.32,
"learning_rate": 1.9781476007338058e-05,
"loss": 1.1914,
"step": 15
},
{
"epoch": 0.34,
"learning_rate": 1.973044870579824e-05,
"loss": 1.166,
"step": 16
},
{
"epoch": 0.36,
"learning_rate": 1.967415219462864e-05,
"loss": 1.165,
"step": 17
},
{
"epoch": 0.38,
"learning_rate": 1.961261695938319e-05,
"loss": 1.1553,
"step": 18
},
{
"epoch": 0.4,
"learning_rate": 1.954587632247732e-05,
"loss": 1.1582,
"step": 19
},
{
"epoch": 0.43,
"learning_rate": 1.9473966425143292e-05,
"loss": 1.1494,
"step": 20
},
{
"epoch": 0.45,
"learning_rate": 1.9396926207859085e-05,
"loss": 1.1445,
"step": 21
},
{
"epoch": 0.47,
"learning_rate": 1.9314797389261426e-05,
"loss": 1.1553,
"step": 22
},
{
"epoch": 0.49,
"learning_rate": 1.9227624443554425e-05,
"loss": 1.1035,
"step": 23
},
{
"epoch": 0.51,
"learning_rate": 1.913545457642601e-05,
"loss": 1.0996,
"step": 24
},
{
"epoch": 0.53,
"learning_rate": 1.9038337699485207e-05,
"loss": 1.1074,
"step": 25
},
{
"epoch": 0.55,
"learning_rate": 1.8936326403234125e-05,
"loss": 1.1123,
"step": 26
},
{
"epoch": 0.57,
"learning_rate": 1.8829475928589272e-05,
"loss": 1.1055,
"step": 27
},
{
"epoch": 0.6,
"learning_rate": 1.8717844136967626e-05,
"loss": 1.0957,
"step": 28
},
{
"epoch": 0.62,
"learning_rate": 1.860149147895366e-05,
"loss": 1.0947,
"step": 29
},
{
"epoch": 0.64,
"learning_rate": 1.848048096156426e-05,
"loss": 1.0898,
"step": 30
},
{
"epoch": 0.66,
"learning_rate": 1.8354878114129368e-05,
"loss": 1.0898,
"step": 31
},
{
"epoch": 0.68,
"learning_rate": 1.8224750952806626e-05,
"loss": 1.1006,
"step": 32
},
{
"epoch": 0.7,
"learning_rate": 1.8090169943749477e-05,
"loss": 1.1172,
"step": 33
},
{
"epoch": 0.72,
"learning_rate": 1.795120796494848e-05,
"loss": 1.083,
"step": 34
},
{
"epoch": 0.74,
"learning_rate": 1.7807940266766595e-05,
"loss": 1.0781,
"step": 35
},
{
"epoch": 0.77,
"learning_rate": 1.766044443118978e-05,
"loss": 1.064,
"step": 36
},
{
"epoch": 0.79,
"learning_rate": 1.7508800329814993e-05,
"loss": 1.0703,
"step": 37
},
{
"epoch": 0.81,
"learning_rate": 1.735309008059829e-05,
"loss": 1.0986,
"step": 38
},
{
"epoch": 0.83,
"learning_rate": 1.7193398003386514e-05,
"loss": 1.0771,
"step": 39
},
{
"epoch": 0.85,
"learning_rate": 1.702981057425662e-05,
"loss": 1.0654,
"step": 40
},
{
"epoch": 0.87,
"learning_rate": 1.686241637868734e-05,
"loss": 1.0693,
"step": 41
},
{
"epoch": 0.89,
"learning_rate": 1.6691306063588583e-05,
"loss": 1.0537,
"step": 42
},
{
"epoch": 0.91,
"learning_rate": 1.6516572288214555e-05,
"loss": 1.0625,
"step": 43
},
{
"epoch": 0.94,
"learning_rate": 1.63383096739871e-05,
"loss": 1.0752,
"step": 44
},
{
"epoch": 0.96,
"learning_rate": 1.6156614753256583e-05,
"loss": 1.0771,
"step": 45
},
{
"epoch": 0.98,
"learning_rate": 1.5971585917027864e-05,
"loss": 1.0522,
"step": 46
},
{
"epoch": 1.0,
"learning_rate": 1.5783323361679865e-05,
"loss": 1.0298,
"step": 47
},
{
"epoch": 1.02,
"learning_rate": 1.5591929034707468e-05,
"loss": 0.9619,
"step": 48
},
{
"epoch": 1.04,
"learning_rate": 1.539750657951513e-05,
"loss": 0.981,
"step": 49
},
{
"epoch": 1.06,
"learning_rate": 1.5200161279292154e-05,
"loss": 0.9712,
"step": 50
},
{
"epoch": 1.09,
"learning_rate": 1.5000000000000002e-05,
"loss": 0.9502,
"step": 51
},
{
"epoch": 1.11,
"learning_rate": 1.4797131132502464e-05,
"loss": 0.9688,
"step": 52
},
{
"epoch": 1.13,
"learning_rate": 1.4591664533870118e-05,
"loss": 0.9434,
"step": 53
},
{
"epoch": 1.15,
"learning_rate": 1.4383711467890776e-05,
"loss": 0.9224,
"step": 54
},
{
"epoch": 1.17,
"learning_rate": 1.417338454481818e-05,
"loss": 0.9668,
"step": 55
},
{
"epoch": 1.19,
"learning_rate": 1.396079766039157e-05,
"loss": 0.9512,
"step": 56
},
{
"epoch": 1.21,
"learning_rate": 1.3746065934159123e-05,
"loss": 0.9492,
"step": 57
},
{
"epoch": 1.23,
"learning_rate": 1.3529305647138689e-05,
"loss": 0.9512,
"step": 58
},
{
"epoch": 1.26,
"learning_rate": 1.3310634178849583e-05,
"loss": 0.9111,
"step": 59
},
{
"epoch": 1.28,
"learning_rate": 1.3090169943749475e-05,
"loss": 0.9102,
"step": 60
},
{
"epoch": 1.3,
"learning_rate": 1.2868032327110904e-05,
"loss": 0.9292,
"step": 61
},
{
"epoch": 1.32,
"learning_rate": 1.2644341620372025e-05,
"loss": 0.9434,
"step": 62
},
{
"epoch": 1.34,
"learning_rate": 1.2419218955996677e-05,
"loss": 0.9478,
"step": 63
},
{
"epoch": 1.36,
"learning_rate": 1.2192786241879033e-05,
"loss": 0.937,
"step": 64
},
{
"epoch": 1.38,
"learning_rate": 1.1965166095328302e-05,
"loss": 0.9316,
"step": 65
},
{
"epoch": 1.4,
"learning_rate": 1.1736481776669307e-05,
"loss": 0.9385,
"step": 66
},
{
"epoch": 1.43,
"learning_rate": 1.1506857122494832e-05,
"loss": 0.9321,
"step": 67
},
{
"epoch": 1.45,
"learning_rate": 1.127641647860595e-05,
"loss": 0.9458,
"step": 68
},
{
"epoch": 1.47,
"learning_rate": 1.1045284632676535e-05,
"loss": 0.9302,
"step": 69
},
{
"epoch": 1.49,
"learning_rate": 1.0813586746678584e-05,
"loss": 0.9351,
"step": 70
},
{
"epoch": 1.51,
"learning_rate": 1.0581448289104759e-05,
"loss": 0.9365,
"step": 71
},
{
"epoch": 1.53,
"learning_rate": 1.0348994967025012e-05,
"loss": 0.916,
"step": 72
},
{
"epoch": 1.55,
"learning_rate": 1.0116352658013973e-05,
"loss": 0.9395,
"step": 73
},
{
"epoch": 1.57,
"learning_rate": 9.883647341986032e-06,
"loss": 0.9224,
"step": 74
},
{
"epoch": 1.6,
"learning_rate": 9.651005032974994e-06,
"loss": 0.9185,
"step": 75
},
{
"epoch": 1.62,
"learning_rate": 9.418551710895243e-06,
"loss": 0.9468,
"step": 76
},
{
"epoch": 1.64,
"learning_rate": 9.18641325332142e-06,
"loss": 0.9204,
"step": 77
},
{
"epoch": 1.66,
"learning_rate": 8.954715367323468e-06,
"loss": 0.9233,
"step": 78
},
{
"epoch": 1.68,
"learning_rate": 8.723583521394054e-06,
"loss": 0.9478,
"step": 79
},
{
"epoch": 1.7,
"learning_rate": 8.49314287750517e-06,
"loss": 0.9688,
"step": 80
},
{
"epoch": 1.72,
"learning_rate": 8.263518223330698e-06,
"loss": 0.9336,
"step": 81
},
{
"epoch": 1.74,
"learning_rate": 8.034833904671698e-06,
"loss": 0.9531,
"step": 82
},
{
"epoch": 1.77,
"learning_rate": 7.807213758120965e-06,
"loss": 0.9434,
"step": 83
},
{
"epoch": 1.79,
"learning_rate": 7.580781044003324e-06,
"loss": 0.9351,
"step": 84
},
{
"epoch": 1.81,
"learning_rate": 7.355658379627981e-06,
"loss": 0.9419,
"step": 85
},
{
"epoch": 1.83,
"learning_rate": 7.131967672889101e-06,
"loss": 0.9121,
"step": 86
},
{
"epoch": 1.85,
"learning_rate": 6.909830056250527e-06,
"loss": 0.9282,
"step": 87
},
{
"epoch": 1.87,
"learning_rate": 6.689365821150421e-06,
"loss": 0.9287,
"step": 88
},
{
"epoch": 1.89,
"learning_rate": 6.4706943528613135e-06,
"loss": 0.939,
"step": 89
},
{
"epoch": 1.91,
"learning_rate": 6.25393406584088e-06,
"loss": 0.9448,
"step": 90
},
{
"epoch": 1.94,
"learning_rate": 6.039202339608432e-06,
"loss": 0.9233,
"step": 91
},
{
"epoch": 1.96,
"learning_rate": 5.8266154551818225e-06,
"loss": 0.9399,
"step": 92
},
{
"epoch": 1.98,
"learning_rate": 5.616288532109225e-06,
"loss": 0.9009,
"step": 93
},
{
"epoch": 2.0,
"learning_rate": 5.4083354661298816e-06,
"loss": 0.9214,
"step": 94
},
{
"epoch": 2.02,
"learning_rate": 5.202868867497542e-06,
"loss": 0.8262,
"step": 95
},
{
"epoch": 2.04,
"learning_rate": 5.000000000000003e-06,
"loss": 0.8159,
"step": 96
},
{
"epoch": 2.06,
"learning_rate": 4.799838720707847e-06,
"loss": 0.8643,
"step": 97
},
{
"epoch": 2.09,
"learning_rate": 4.6024934204848745e-06,
"loss": 0.8638,
"step": 98
},
{
"epoch": 2.11,
"learning_rate": 4.408070965292534e-06,
"loss": 0.8618,
"step": 99
},
{
"epoch": 2.13,
"learning_rate": 4.216676638320135e-06,
"loss": 0.8462,
"step": 100
},
{
"epoch": 2.15,
"learning_rate": 4.028414082972141e-06,
"loss": 0.835,
"step": 101
},
{
"epoch": 2.17,
"learning_rate": 3.8433852467434175e-06,
"loss": 0.8623,
"step": 102
},
{
"epoch": 2.19,
"learning_rate": 3.661690326012897e-06,
"loss": 0.8486,
"step": 103
},
{
"epoch": 2.21,
"learning_rate": 3.483427711785449e-06,
"loss": 0.8228,
"step": 104
},
{
"epoch": 2.23,
"learning_rate": 3.308693936411421e-06,
"loss": 0.8047,
"step": 105
},
{
"epoch": 2.26,
"learning_rate": 3.1375836213126653e-06,
"loss": 0.8481,
"step": 106
},
{
"epoch": 2.28,
"learning_rate": 2.970189425743383e-06,
"loss": 0.8516,
"step": 107
},
{
"epoch": 2.3,
"learning_rate": 2.8066019966134907e-06,
"loss": 0.8481,
"step": 108
},
{
"epoch": 2.32,
"learning_rate": 2.6469099194017144e-06,
"loss": 0.833,
"step": 109
},
{
"epoch": 2.34,
"learning_rate": 2.4911996701850083e-06,
"loss": 0.8213,
"step": 110
},
{
"epoch": 2.36,
"learning_rate": 2.339555568810221e-06,
"loss": 0.8428,
"step": 111
},
{
"epoch": 2.38,
"learning_rate": 2.192059733233408e-06,
"loss": 0.8384,
"step": 112
},
{
"epoch": 2.4,
"learning_rate": 2.048792035051521e-06,
"loss": 0.8633,
"step": 113
},
{
"epoch": 2.43,
"learning_rate": 1.9098300562505266e-06,
"loss": 0.8423,
"step": 114
},
{
"epoch": 2.45,
"learning_rate": 1.7752490471933769e-06,
"loss": 0.8535,
"step": 115
},
{
"epoch": 2.47,
"learning_rate": 1.6451218858706374e-06,
"loss": 0.8247,
"step": 116
},
{
"epoch": 2.49,
"learning_rate": 1.5195190384357405e-06,
"loss": 0.8281,
"step": 117
},
{
"epoch": 2.51,
"learning_rate": 1.3985085210463479e-06,
"loss": 0.8198,
"step": 118
},
{
"epoch": 2.53,
"learning_rate": 1.282155863032377e-06,
"loss": 0.8291,
"step": 119
},
{
"epoch": 2.55,
"learning_rate": 1.1705240714107301e-06,
"loss": 0.8281,
"step": 120
},
{
"epoch": 2.57,
"learning_rate": 1.0636735967658785e-06,
"loss": 0.8462,
"step": 121
},
{
"epoch": 2.6,
"learning_rate": 9.616623005147952e-07,
"loss": 0.8213,
"step": 122
},
{
"epoch": 2.62,
"learning_rate": 8.645454235739903e-07,
"loss": 0.8154,
"step": 123
},
{
"epoch": 2.64,
"learning_rate": 7.723755564455771e-07,
"loss": 0.8325,
"step": 124
},
{
"epoch": 2.66,
"learning_rate": 6.852026107385756e-07,
"loss": 0.8213,
"step": 125
},
{
"epoch": 2.68,
"learning_rate": 6.030737921409169e-07,
"loss": 0.8394,
"step": 126
},
{
"epoch": 2.7,
"learning_rate": 5.26033574856708e-07,
"loss": 0.8218,
"step": 127
},
{
"epoch": 2.72,
"learning_rate": 4.5412367752268094e-07,
"loss": 0.8452,
"step": 128
},
{
"epoch": 2.74,
"learning_rate": 3.8738304061681107e-07,
"loss": 0.8262,
"step": 129
},
{
"epoch": 2.77,
"learning_rate": 3.2584780537136206e-07,
"loss": 0.8228,
"step": 130
},
{
"epoch": 2.79,
"learning_rate": 2.6955129420176193e-07,
"loss": 0.8467,
"step": 131
},
{
"epoch": 2.81,
"learning_rate": 2.1852399266194312e-07,
"loss": 0.8184,
"step": 132
},
{
"epoch": 2.83,
"learning_rate": 1.7279353293586765e-07,
"loss": 0.832,
"step": 133
},
{
"epoch": 2.85,
"learning_rate": 1.323846788742078e-07,
"loss": 0.8442,
"step": 134
},
{
"epoch": 2.87,
"learning_rate": 9.731931258429638e-08,
"loss": 0.8325,
"step": 135
},
{
"epoch": 2.89,
"learning_rate": 6.761642258056977e-08,
"loss": 0.8628,
"step": 136
},
{
"epoch": 2.91,
"learning_rate": 4.329209350195651e-08,
"loss": 0.8345,
"step": 137
},
{
"epoch": 2.94,
"learning_rate": 2.4359497401758026e-08,
"loss": 0.8315,
"step": 138
},
{
"epoch": 2.96,
"learning_rate": 1.0828886614754342e-08,
"loss": 0.8047,
"step": 139
},
{
"epoch": 2.98,
"learning_rate": 2.7075882053828605e-09,
"loss": 0.8203,
"step": 140
},
{
"epoch": 3.0,
"learning_rate": 0.0,
"loss": 0.8496,
"step": 141
},
{
"epoch": 3.0,
"step": 141,
"total_flos": 58443096391680.0,
"train_loss": 0.9839040336879432,
"train_runtime": 3850.7484,
"train_samples_per_second": 4.656,
"train_steps_per_second": 0.037
}
],
"max_steps": 141,
"num_train_epochs": 3,
"total_flos": 58443096391680.0,
"trial_name": null,
"trial_params": null
}

3
training_args.bin Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:540fda1b8fbaa4570e42227bf3faff0a97e9bef92e3813f294d474d8876c2404
size 4795