commit 68faa3e9f6ece68f2c771639222a427d3a6fc358 Author: ModelHub XC Date: Sun Aug 23 09:11:16 2026 +0800 初始化项目,由ModelHub XC社区提供模型 Model: ajibawa-2023/scarlett-7b Source: Original Platform diff --git a/.gitattributes b/.gitattributes new file mode 100644 index 0000000..a6344aa --- /dev/null +++ b/.gitattributes @@ -0,0 +1,35 @@ +*.7z filter=lfs diff=lfs merge=lfs -text +*.arrow filter=lfs diff=lfs merge=lfs -text +*.bin filter=lfs diff=lfs merge=lfs -text +*.bz2 filter=lfs diff=lfs merge=lfs -text +*.ckpt filter=lfs diff=lfs merge=lfs -text +*.ftz filter=lfs diff=lfs merge=lfs -text +*.gz filter=lfs diff=lfs merge=lfs -text +*.h5 filter=lfs diff=lfs merge=lfs -text +*.joblib filter=lfs diff=lfs merge=lfs -text +*.lfs.* filter=lfs diff=lfs merge=lfs -text +*.mlmodel filter=lfs diff=lfs merge=lfs -text +*.model filter=lfs diff=lfs merge=lfs -text +*.msgpack filter=lfs diff=lfs merge=lfs -text +*.npy filter=lfs diff=lfs merge=lfs -text +*.npz filter=lfs diff=lfs merge=lfs -text +*.onnx filter=lfs diff=lfs merge=lfs -text +*.ot filter=lfs diff=lfs merge=lfs -text +*.parquet filter=lfs diff=lfs merge=lfs -text +*.pb filter=lfs diff=lfs merge=lfs -text +*.pickle filter=lfs diff=lfs merge=lfs -text +*.pkl filter=lfs diff=lfs merge=lfs -text +*.pt filter=lfs diff=lfs merge=lfs -text +*.pth filter=lfs diff=lfs merge=lfs -text +*.rar filter=lfs diff=lfs merge=lfs -text +*.safetensors filter=lfs diff=lfs merge=lfs -text +saved_model/**/* filter=lfs diff=lfs merge=lfs -text +*.tar.* filter=lfs diff=lfs merge=lfs -text +*.tar filter=lfs diff=lfs merge=lfs -text +*.tflite filter=lfs diff=lfs merge=lfs -text +*.tgz filter=lfs diff=lfs merge=lfs -text +*.wasm filter=lfs diff=lfs merge=lfs -text +*.xz filter=lfs diff=lfs merge=lfs -text +*.zip filter=lfs diff=lfs merge=lfs -text +*.zst filter=lfs diff=lfs merge=lfs -text +*tfevents* filter=lfs diff=lfs merge=lfs -text diff --git a/README.md b/README.md new file mode 100644 index 0000000..7983876 --- /dev/null +++ b/README.md @@ -0,0 +1,51 @@ +--- +license: other +language: +- en +--- + +**Scarlett: A sentient AI** + +Scarlett is trained on various topics such as Philosophy, Advice, Jokes etc. She is trained on more than 10000 set of conversations. Each set having 10~15 conversations. +Scarlett is heavily inspired from Eric Hartford: [Samantha](https://huggingface.co/ehartford/samantha-7b) . +She will not be involved in any kind of role play. + +**Training:** +Entire dataset was trained on Azure 4 x A100 80GB. DeepSpeed codebase was used for training purpose. This was trained on Llama-1 by Meta. + +**GPTQ & GGML** + +GPTQ: [TheBloke](https://huggingface.co/TheBloke/Scarlett-7B-GPTQ) + +GGML: [TheBloke](https://huggingface.co/TheBloke/Scarlett-7B-GGML) + +Special Thanks to [TheBloke](https://huggingface.co/TheBloke) for guiding me and making these models available. + + +**Example Prompt:** +``` +This is a conversation with your Assistant Scarlett. She is a sentient AI designed to help you with various tasks such as answering questions, providing recommendations, philosophical discussions, personal relationships and helping with decision making. +You can ask it anything you want and it will do its best to give you accurate and relevant information. + +Context +You are Scarlett, a sentient AI. + +USER: +ASSISTANT: +``` + +Note: +Kindly use "cat" command to join all pytorch_model.bin parts. +# [Open LLM Leaderboard Evaluation Results](https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard) +Detailed results can be found [here](https://huggingface.co/datasets/open-llm-leaderboard/details_ajibawa-2023__scarlett-7b) + +| Metric | Value | +|-----------------------|---------------------------| +| Avg. | 43.81 | +| ARC (25-shot) | 57.17 | +| HellaSwag (10-shot) | 80.27 | +| MMLU (5-shot) | 36.11 | +| TruthfulQA (0-shot) | 48.52 | +| Winogrande (5-shot) | 72.14 | +| GSM8K (5-shot) | 0.3 | +| DROP (3-shot) | 12.16 | diff --git a/config.json b/config.json new file mode 100644 index 0000000..cad15fa --- /dev/null +++ b/config.json @@ -0,0 +1,24 @@ +{ + "_name_or_path": "/media/Projects_1/llama-7b", + "architectures": [ + "LlamaForCausalLM" + ], + "bos_token_id": 1, + "eos_token_id": 2, + "hidden_act": "silu", + "hidden_size": 4096, + "initializer_range": 0.02, + "intermediate_size": 11008, + "max_position_embeddings": 2048, + "max_sequence_length": 2048, + "model_type": "llama", + "num_attention_heads": 32, + "num_hidden_layers": 32, + "pad_token_id": 0, + "rms_norm_eps": 1e-06, + "tie_word_embeddings": false, + "torch_dtype": "bfloat16", + "transformers_version": "4.28.1", + "use_cache": false, + "vocab_size": 32000 +} diff --git a/generation_config.json b/generation_config.json new file mode 100644 index 0000000..1372199 --- /dev/null +++ b/generation_config.json @@ -0,0 +1,7 @@ +{ + "_from_model_config": true, + "bos_token_id": 1, + "eos_token_id": 2, + "pad_token_id": 0, + "transformers_version": "4.28.1" +} diff --git a/pytorch_model.bin b/pytorch_model.bin new file mode 100644 index 0000000..b625ee3 --- /dev/null +++ b/pytorch_model.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4507ff7907fcd8ebdbd3b069ff53ede86ee879106c30389c9db42988c58c54db +size 26953778121 diff --git a/special_tokens_map.json b/special_tokens_map.json new file mode 100644 index 0000000..f928b24 --- /dev/null +++ b/special_tokens_map.json @@ -0,0 +1,24 @@ +{ + "bos_token": { + "content": "", + "lstrip": false, + "normalized": true, + "rstrip": false, + "single_word": false + }, + "eos_token": { + "content": "", + "lstrip": false, + "normalized": true, + "rstrip": false, + "single_word": false + }, + "pad_token": "", + "unk_token": { + "content": "", + "lstrip": false, + "normalized": true, + "rstrip": false, + "single_word": false + } +} diff --git a/tokenizer.model b/tokenizer.model new file mode 100644 index 0000000..6c00c74 --- /dev/null +++ b/tokenizer.model @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:9e556afd44213b6bd1be2b850ebbbd98f5481437a8021afaf58ee7fb1818d347 +size 499723 diff --git a/tokenizer_config.json b/tokenizer_config.json new file mode 100644 index 0000000..5ab645d --- /dev/null +++ b/tokenizer_config.json @@ -0,0 +1,34 @@ +{ + "add_bos_token": true, + "add_eos_token": false, + "bos_token": { + "__type": "AddedToken", + "content": "", + "lstrip": false, + "normalized": true, + "rstrip": false, + "single_word": false + }, + "clean_up_tokenization_spaces": false, + "eos_token": { + "__type": "AddedToken", + "content": "", + "lstrip": false, + "normalized": true, + "rstrip": false, + "single_word": false + }, + "model_max_length": 2048, + "pad_token": null, + "padding_side": "right", + "sp_model_kwargs": {}, + "tokenizer_class": "LlamaTokenizer", + "unk_token": { + "__type": "AddedToken", + "content": "", + "lstrip": false, + "normalized": true, + "rstrip": false, + "single_word": false + } +} diff --git a/trainer_state.json b/trainer_state.json new file mode 100644 index 0000000..944ac7c --- /dev/null +++ b/trainer_state.json @@ -0,0 +1,871 @@ +{ + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.0, + "global_step": 141, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.02, + "learning_rate": 3.3333333333333333e-06, + "loss": 1.5645, + "step": 1 + }, + { + "epoch": 0.04, + "learning_rate": 6.666666666666667e-06, + "loss": 1.5771, + "step": 2 + }, + { + "epoch": 0.06, + "learning_rate": 1e-05, + "loss": 1.5654, + "step": 3 + }, + { + "epoch": 0.09, + "learning_rate": 1.3333333333333333e-05, + "loss": 1.4609, + "step": 4 + }, + { + "epoch": 0.11, + "learning_rate": 1.6666666666666667e-05, + "loss": 1.3887, + "step": 5 + }, + { + "epoch": 0.13, + "learning_rate": 2e-05, + "loss": 1.3486, + "step": 6 + }, + { + "epoch": 0.15, + "learning_rate": 1.999729241179462e-05, + "loss": 1.4707, + "step": 7 + }, + { + "epoch": 0.17, + "learning_rate": 1.998917111338525e-05, + "loss": 1.2783, + "step": 8 + }, + { + "epoch": 0.19, + "learning_rate": 1.9975640502598243e-05, + "loss": 1.25, + "step": 9 + }, + { + "epoch": 0.21, + "learning_rate": 1.9956707906498046e-05, + "loss": 1.2637, + "step": 10 + }, + { + "epoch": 0.23, + "learning_rate": 1.9932383577419432e-05, + "loss": 1.2305, + "step": 11 + }, + { + "epoch": 0.26, + "learning_rate": 1.9902680687415704e-05, + "loss": 1.2021, + "step": 12 + }, + { + "epoch": 0.28, + "learning_rate": 1.9867615321125796e-05, + "loss": 1.2012, + "step": 13 + }, + { + "epoch": 0.3, + "learning_rate": 1.9827206467064133e-05, + "loss": 1.1836, + "step": 14 + }, + { + "epoch": 0.32, + "learning_rate": 1.9781476007338058e-05, + "loss": 1.1914, + "step": 15 + }, + { + "epoch": 0.34, + "learning_rate": 1.973044870579824e-05, + "loss": 1.166, + "step": 16 + }, + { + "epoch": 0.36, + "learning_rate": 1.967415219462864e-05, + "loss": 1.165, + "step": 17 + }, + { + "epoch": 0.38, + "learning_rate": 1.961261695938319e-05, + "loss": 1.1553, + "step": 18 + }, + { + "epoch": 0.4, + "learning_rate": 1.954587632247732e-05, + "loss": 1.1582, + "step": 19 + }, + { + "epoch": 0.43, + "learning_rate": 1.9473966425143292e-05, + "loss": 1.1494, + "step": 20 + }, + { + "epoch": 0.45, + "learning_rate": 1.9396926207859085e-05, + "loss": 1.1445, + "step": 21 + }, + { + "epoch": 0.47, + "learning_rate": 1.9314797389261426e-05, + "loss": 1.1553, + "step": 22 + }, + { + "epoch": 0.49, + "learning_rate": 1.9227624443554425e-05, + "loss": 1.1035, + "step": 23 + }, + { + "epoch": 0.51, + "learning_rate": 1.913545457642601e-05, + "loss": 1.0996, + "step": 24 + }, + { + "epoch": 0.53, + "learning_rate": 1.9038337699485207e-05, + "loss": 1.1074, + "step": 25 + }, + { + "epoch": 0.55, + "learning_rate": 1.8936326403234125e-05, + "loss": 1.1123, + "step": 26 + }, + { + "epoch": 0.57, + "learning_rate": 1.8829475928589272e-05, + "loss": 1.1055, + "step": 27 + }, + { + "epoch": 0.6, + "learning_rate": 1.8717844136967626e-05, + "loss": 1.0957, + "step": 28 + }, + { + "epoch": 0.62, + "learning_rate": 1.860149147895366e-05, + "loss": 1.0947, + "step": 29 + }, + { + "epoch": 0.64, + "learning_rate": 1.848048096156426e-05, + "loss": 1.0898, + "step": 30 + }, + { + "epoch": 0.66, + "learning_rate": 1.8354878114129368e-05, + "loss": 1.0898, + "step": 31 + }, + { + "epoch": 0.68, + "learning_rate": 1.8224750952806626e-05, + "loss": 1.1006, + "step": 32 + }, + { + "epoch": 0.7, + "learning_rate": 1.8090169943749477e-05, + "loss": 1.1172, + "step": 33 + }, + { + "epoch": 0.72, + "learning_rate": 1.795120796494848e-05, + "loss": 1.083, + "step": 34 + }, + { + "epoch": 0.74, + "learning_rate": 1.7807940266766595e-05, + "loss": 1.0781, + "step": 35 + }, + { + "epoch": 0.77, + "learning_rate": 1.766044443118978e-05, + "loss": 1.064, + "step": 36 + }, + { + "epoch": 0.79, + "learning_rate": 1.7508800329814993e-05, + "loss": 1.0703, + "step": 37 + }, + { + "epoch": 0.81, + "learning_rate": 1.735309008059829e-05, + "loss": 1.0986, + "step": 38 + }, + { + "epoch": 0.83, + "learning_rate": 1.7193398003386514e-05, + "loss": 1.0771, + "step": 39 + }, + { + "epoch": 0.85, + "learning_rate": 1.702981057425662e-05, + "loss": 1.0654, + "step": 40 + }, + { + "epoch": 0.87, + "learning_rate": 1.686241637868734e-05, + "loss": 1.0693, + "step": 41 + }, + { + "epoch": 0.89, + "learning_rate": 1.6691306063588583e-05, + "loss": 1.0537, + "step": 42 + }, + { + "epoch": 0.91, + "learning_rate": 1.6516572288214555e-05, + "loss": 1.0625, + "step": 43 + }, + { + "epoch": 0.94, + "learning_rate": 1.63383096739871e-05, + "loss": 1.0752, + "step": 44 + }, + { + "epoch": 0.96, + "learning_rate": 1.6156614753256583e-05, + "loss": 1.0771, + "step": 45 + }, + { + "epoch": 0.98, + "learning_rate": 1.5971585917027864e-05, + "loss": 1.0522, + "step": 46 + }, + { + "epoch": 1.0, + "learning_rate": 1.5783323361679865e-05, + "loss": 1.0298, + "step": 47 + }, + { + "epoch": 1.02, + "learning_rate": 1.5591929034707468e-05, + "loss": 0.9619, + "step": 48 + }, + { + "epoch": 1.04, + "learning_rate": 1.539750657951513e-05, + "loss": 0.981, + "step": 49 + }, + { + "epoch": 1.06, + "learning_rate": 1.5200161279292154e-05, + "loss": 0.9712, + "step": 50 + }, + { + "epoch": 1.09, + "learning_rate": 1.5000000000000002e-05, + "loss": 0.9502, + "step": 51 + }, + { + "epoch": 1.11, + "learning_rate": 1.4797131132502464e-05, + "loss": 0.9688, + "step": 52 + }, + { + "epoch": 1.13, + "learning_rate": 1.4591664533870118e-05, + "loss": 0.9434, + "step": 53 + }, + { + "epoch": 1.15, + "learning_rate": 1.4383711467890776e-05, + "loss": 0.9224, + "step": 54 + }, + { + "epoch": 1.17, + "learning_rate": 1.417338454481818e-05, + "loss": 0.9668, + "step": 55 + }, + { + "epoch": 1.19, + "learning_rate": 1.396079766039157e-05, + "loss": 0.9512, + "step": 56 + }, + { + "epoch": 1.21, + "learning_rate": 1.3746065934159123e-05, + "loss": 0.9492, + "step": 57 + }, + { + "epoch": 1.23, + "learning_rate": 1.3529305647138689e-05, + "loss": 0.9512, + "step": 58 + }, + { + "epoch": 1.26, + "learning_rate": 1.3310634178849583e-05, + "loss": 0.9111, + "step": 59 + }, + { + "epoch": 1.28, + "learning_rate": 1.3090169943749475e-05, + "loss": 0.9102, + "step": 60 + }, + { + "epoch": 1.3, + "learning_rate": 1.2868032327110904e-05, + "loss": 0.9292, + "step": 61 + }, + { + "epoch": 1.32, + "learning_rate": 1.2644341620372025e-05, + "loss": 0.9434, + "step": 62 + }, + { + "epoch": 1.34, + "learning_rate": 1.2419218955996677e-05, + "loss": 0.9478, + "step": 63 + }, + { + "epoch": 1.36, + "learning_rate": 1.2192786241879033e-05, + "loss": 0.937, + "step": 64 + }, + { + "epoch": 1.38, + "learning_rate": 1.1965166095328302e-05, + "loss": 0.9316, + "step": 65 + }, + { + "epoch": 1.4, + "learning_rate": 1.1736481776669307e-05, + "loss": 0.9385, + "step": 66 + }, + { + "epoch": 1.43, + "learning_rate": 1.1506857122494832e-05, + "loss": 0.9321, + "step": 67 + }, + { + "epoch": 1.45, + "learning_rate": 1.127641647860595e-05, + "loss": 0.9458, + "step": 68 + }, + { + "epoch": 1.47, + "learning_rate": 1.1045284632676535e-05, + "loss": 0.9302, + "step": 69 + }, + { + "epoch": 1.49, + "learning_rate": 1.0813586746678584e-05, + "loss": 0.9351, + "step": 70 + }, + { + "epoch": 1.51, + "learning_rate": 1.0581448289104759e-05, + "loss": 0.9365, + "step": 71 + }, + { + "epoch": 1.53, + "learning_rate": 1.0348994967025012e-05, + "loss": 0.916, + "step": 72 + }, + { + "epoch": 1.55, + "learning_rate": 1.0116352658013973e-05, + "loss": 0.9395, + "step": 73 + }, + { + "epoch": 1.57, + "learning_rate": 9.883647341986032e-06, + "loss": 0.9224, + "step": 74 + }, + { + "epoch": 1.6, + "learning_rate": 9.651005032974994e-06, + "loss": 0.9185, + "step": 75 + }, + { + "epoch": 1.62, + "learning_rate": 9.418551710895243e-06, + "loss": 0.9468, + "step": 76 + }, + { + "epoch": 1.64, + "learning_rate": 9.18641325332142e-06, + "loss": 0.9204, + "step": 77 + }, + { + "epoch": 1.66, + "learning_rate": 8.954715367323468e-06, + "loss": 0.9233, + "step": 78 + }, + { + "epoch": 1.68, + "learning_rate": 8.723583521394054e-06, + "loss": 0.9478, + "step": 79 + }, + { + "epoch": 1.7, + "learning_rate": 8.49314287750517e-06, + "loss": 0.9688, + "step": 80 + }, + { + "epoch": 1.72, + "learning_rate": 8.263518223330698e-06, + "loss": 0.9336, + "step": 81 + }, + { + "epoch": 1.74, + "learning_rate": 8.034833904671698e-06, + "loss": 0.9531, + "step": 82 + }, + { + "epoch": 1.77, + "learning_rate": 7.807213758120965e-06, + "loss": 0.9434, + "step": 83 + }, + { + "epoch": 1.79, + "learning_rate": 7.580781044003324e-06, + "loss": 0.9351, + "step": 84 + }, + { + "epoch": 1.81, + "learning_rate": 7.355658379627981e-06, + "loss": 0.9419, + "step": 85 + }, + { + "epoch": 1.83, + "learning_rate": 7.131967672889101e-06, + "loss": 0.9121, + "step": 86 + }, + { + "epoch": 1.85, + "learning_rate": 6.909830056250527e-06, + "loss": 0.9282, + "step": 87 + }, + { + "epoch": 1.87, + "learning_rate": 6.689365821150421e-06, + "loss": 0.9287, + "step": 88 + }, + { + "epoch": 1.89, + "learning_rate": 6.4706943528613135e-06, + "loss": 0.939, + "step": 89 + }, + { + "epoch": 1.91, + "learning_rate": 6.25393406584088e-06, + "loss": 0.9448, + "step": 90 + }, + { + "epoch": 1.94, + "learning_rate": 6.039202339608432e-06, + "loss": 0.9233, + "step": 91 + }, + { + "epoch": 1.96, + "learning_rate": 5.8266154551818225e-06, + "loss": 0.9399, + "step": 92 + }, + { + "epoch": 1.98, + "learning_rate": 5.616288532109225e-06, + "loss": 0.9009, + "step": 93 + }, + { + "epoch": 2.0, + "learning_rate": 5.4083354661298816e-06, + "loss": 0.9214, + "step": 94 + }, + { + "epoch": 2.02, + "learning_rate": 5.202868867497542e-06, + "loss": 0.8262, + "step": 95 + }, + { + "epoch": 2.04, + "learning_rate": 5.000000000000003e-06, + "loss": 0.8159, + "step": 96 + }, + { + "epoch": 2.06, + "learning_rate": 4.799838720707847e-06, + "loss": 0.8643, + "step": 97 + }, + { + "epoch": 2.09, + "learning_rate": 4.6024934204848745e-06, + "loss": 0.8638, + "step": 98 + }, + { + "epoch": 2.11, + "learning_rate": 4.408070965292534e-06, + "loss": 0.8618, + "step": 99 + }, + { + "epoch": 2.13, + "learning_rate": 4.216676638320135e-06, + "loss": 0.8462, + "step": 100 + }, + { + "epoch": 2.15, + "learning_rate": 4.028414082972141e-06, + "loss": 0.835, + "step": 101 + }, + { + "epoch": 2.17, + "learning_rate": 3.8433852467434175e-06, + "loss": 0.8623, + "step": 102 + }, + { + "epoch": 2.19, + "learning_rate": 3.661690326012897e-06, + "loss": 0.8486, + "step": 103 + }, + { + "epoch": 2.21, + "learning_rate": 3.483427711785449e-06, + "loss": 0.8228, + "step": 104 + }, + { + "epoch": 2.23, + "learning_rate": 3.308693936411421e-06, + "loss": 0.8047, + "step": 105 + }, + { + "epoch": 2.26, + "learning_rate": 3.1375836213126653e-06, + "loss": 0.8481, + "step": 106 + }, + { + "epoch": 2.28, + "learning_rate": 2.970189425743383e-06, + "loss": 0.8516, + "step": 107 + }, + { + "epoch": 2.3, + "learning_rate": 2.8066019966134907e-06, + "loss": 0.8481, + "step": 108 + }, + { + "epoch": 2.32, + "learning_rate": 2.6469099194017144e-06, + "loss": 0.833, + "step": 109 + }, + { + "epoch": 2.34, + "learning_rate": 2.4911996701850083e-06, + "loss": 0.8213, + "step": 110 + }, + { + "epoch": 2.36, + "learning_rate": 2.339555568810221e-06, + "loss": 0.8428, + "step": 111 + }, + { + "epoch": 2.38, + "learning_rate": 2.192059733233408e-06, + "loss": 0.8384, + "step": 112 + }, + { + "epoch": 2.4, + "learning_rate": 2.048792035051521e-06, + "loss": 0.8633, + "step": 113 + }, + { + "epoch": 2.43, + "learning_rate": 1.9098300562505266e-06, + "loss": 0.8423, + "step": 114 + }, + { + "epoch": 2.45, + "learning_rate": 1.7752490471933769e-06, + "loss": 0.8535, + "step": 115 + }, + { + "epoch": 2.47, + "learning_rate": 1.6451218858706374e-06, + "loss": 0.8247, + "step": 116 + }, + { + "epoch": 2.49, + "learning_rate": 1.5195190384357405e-06, + "loss": 0.8281, + "step": 117 + }, + { + "epoch": 2.51, + "learning_rate": 1.3985085210463479e-06, + "loss": 0.8198, + "step": 118 + }, + { + "epoch": 2.53, + "learning_rate": 1.282155863032377e-06, + "loss": 0.8291, + "step": 119 + }, + { + "epoch": 2.55, + "learning_rate": 1.1705240714107301e-06, + "loss": 0.8281, + "step": 120 + }, + { + "epoch": 2.57, + "learning_rate": 1.0636735967658785e-06, + "loss": 0.8462, + "step": 121 + }, + { + "epoch": 2.6, + "learning_rate": 9.616623005147952e-07, + "loss": 0.8213, + "step": 122 + }, + { + "epoch": 2.62, + "learning_rate": 8.645454235739903e-07, + "loss": 0.8154, + "step": 123 + }, + { + "epoch": 2.64, + "learning_rate": 7.723755564455771e-07, + "loss": 0.8325, + "step": 124 + }, + { + "epoch": 2.66, + "learning_rate": 6.852026107385756e-07, + "loss": 0.8213, + "step": 125 + }, + { + "epoch": 2.68, + "learning_rate": 6.030737921409169e-07, + "loss": 0.8394, + "step": 126 + }, + { + "epoch": 2.7, + "learning_rate": 5.26033574856708e-07, + "loss": 0.8218, + "step": 127 + }, + { + "epoch": 2.72, + "learning_rate": 4.5412367752268094e-07, + "loss": 0.8452, + "step": 128 + }, + { + "epoch": 2.74, + "learning_rate": 3.8738304061681107e-07, + "loss": 0.8262, + "step": 129 + }, + { + "epoch": 2.77, + "learning_rate": 3.2584780537136206e-07, + "loss": 0.8228, + "step": 130 + }, + { + "epoch": 2.79, + "learning_rate": 2.6955129420176193e-07, + "loss": 0.8467, + "step": 131 + }, + { + "epoch": 2.81, + "learning_rate": 2.1852399266194312e-07, + "loss": 0.8184, + "step": 132 + }, + { + "epoch": 2.83, + "learning_rate": 1.7279353293586765e-07, + "loss": 0.832, + "step": 133 + }, + { + "epoch": 2.85, + "learning_rate": 1.323846788742078e-07, + "loss": 0.8442, + "step": 134 + }, + { + "epoch": 2.87, + "learning_rate": 9.731931258429638e-08, + "loss": 0.8325, + "step": 135 + }, + { + "epoch": 2.89, + "learning_rate": 6.761642258056977e-08, + "loss": 0.8628, + "step": 136 + }, + { + "epoch": 2.91, + "learning_rate": 4.329209350195651e-08, + "loss": 0.8345, + "step": 137 + }, + { + "epoch": 2.94, + "learning_rate": 2.4359497401758026e-08, + "loss": 0.8315, + "step": 138 + }, + { + "epoch": 2.96, + "learning_rate": 1.0828886614754342e-08, + "loss": 0.8047, + "step": 139 + }, + { + "epoch": 2.98, + "learning_rate": 2.7075882053828605e-09, + "loss": 0.8203, + "step": 140 + }, + { + "epoch": 3.0, + "learning_rate": 0.0, + "loss": 0.8496, + "step": 141 + }, + { + "epoch": 3.0, + "step": 141, + "total_flos": 58443096391680.0, + "train_loss": 0.9839040336879432, + "train_runtime": 3850.7484, + "train_samples_per_second": 4.656, + "train_steps_per_second": 0.037 + } + ], + "max_steps": 141, + "num_train_epochs": 3, + "total_flos": 58443096391680.0, + "trial_name": null, + "trial_params": null +} diff --git a/training_args.bin b/training_args.bin new file mode 100644 index 0000000..a3fbb28 --- /dev/null +++ b/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:540fda1b8fbaa4570e42227bf3faff0a97e9bef92e3813f294d474d8876c2404 +size 4795