From 4e00a082d05f2aace2f53f6a8a3ea4fad07d5526 Mon Sep 17 00:00:00 2001 From: ModelHub XC Date: Sat, 22 Aug 2026 08:49:17 +0800 Subject: [PATCH] =?UTF-8?q?=E5=88=9D=E5=A7=8B=E5=8C=96=E9=A1=B9=E7=9B=AE?= =?UTF-8?q?=EF=BC=8C=E7=94=B1ModelHub=20XC=E7=A4=BE=E5=8C=BA=E6=8F=90?= =?UTF-8?q?=E4=BE=9B=E6=A8=A1=E5=9E=8B?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit Model: Henry236/east8b-eg-lora-heuristic Source: Original Platform --- .gitattributes | 36 + adapter_config.json | 48 + adapter_model.safetensors | 3 + chat_template.jinja | 7 + checkpoint-1000/README.md | 207 ++ checkpoint-1000/adapter_config.json | 48 + checkpoint-1000/adapter_model.safetensors | 3 + checkpoint-1000/optimizer.pt | 3 + checkpoint-1000/rng_state.pth | 3 + checkpoint-1000/scheduler.pt | 3 + checkpoint-1000/trainer_state.json | 384 ++++ checkpoint-1000/training_args.bin | 3 + checkpoint-1050/README.md | 207 ++ checkpoint-1050/adapter_config.json | 48 + checkpoint-1050/adapter_model.safetensors | 3 + checkpoint-1050/optimizer.pt | 3 + checkpoint-1050/rng_state.pth | 3 + checkpoint-1050/scheduler.pt | 3 + checkpoint-1050/trainer_state.json | 398 ++++ checkpoint-1050/training_args.bin | 3 + checkpoint-1150/README.md | 207 ++ checkpoint-1150/adapter_config.json | 48 + checkpoint-1150/adapter_model.safetensors | 3 + checkpoint-1150/optimizer.pt | 3 + checkpoint-1150/rng_state.pth | 3 + checkpoint-1150/scheduler.pt | 3 + checkpoint-1150/trainer_state.json | 433 +++++ checkpoint-1150/training_args.bin | 3 + checkpoint-150/README.md | 207 ++ checkpoint-150/adapter_config.json | 48 + checkpoint-150/adapter_model.safetensors | 3 + checkpoint-150/optimizer.pt | 3 + checkpoint-150/rng_state.pth | 3 + checkpoint-150/scheduler.pt | 3 + checkpoint-150/trainer_state.json | 83 + checkpoint-150/training_args.bin | 3 + checkpoint-200/README.md | 207 ++ checkpoint-200/adapter_config.json | 48 + checkpoint-200/adapter_model.safetensors | 3 + checkpoint-200/optimizer.pt | 3 + checkpoint-200/rng_state.pth | 3 + checkpoint-200/scheduler.pt | 3 + checkpoint-200/trainer_state.json | 104 + checkpoint-200/training_args.bin | 3 + checkpoint-250/README.md | 207 ++ checkpoint-250/adapter_config.json | 48 + checkpoint-250/adapter_model.safetensors | 3 + checkpoint-250/optimizer.pt | 3 + checkpoint-250/rng_state.pth | 3 + checkpoint-250/scheduler.pt | 3 + checkpoint-250/trainer_state.json | 118 ++ checkpoint-250/training_args.bin | 3 + checkpoint-300/README.md | 207 ++ checkpoint-300/adapter_config.json | 48 + checkpoint-300/adapter_model.safetensors | 3 + checkpoint-300/optimizer.pt | 3 + checkpoint-300/rng_state.pth | 3 + checkpoint-300/scheduler.pt | 3 + checkpoint-300/trainer_state.json | 139 ++ checkpoint-300/training_args.bin | 3 + checkpoint-350/README.md | 207 ++ checkpoint-350/adapter_config.json | 48 + checkpoint-350/adapter_model.safetensors | 3 + checkpoint-350/optimizer.pt | 3 + checkpoint-350/rng_state.pth | 3 + checkpoint-350/scheduler.pt | 3 + checkpoint-350/trainer_state.json | 153 ++ checkpoint-350/training_args.bin | 3 + checkpoint-400/README.md | 207 ++ checkpoint-400/adapter_config.json | 48 + checkpoint-400/adapter_model.safetensors | 3 + checkpoint-400/optimizer.pt | 3 + checkpoint-400/rng_state.pth | 3 + checkpoint-400/scheduler.pt | 3 + checkpoint-400/trainer_state.json | 174 ++ checkpoint-400/training_args.bin | 3 + checkpoint-450/README.md | 207 ++ checkpoint-450/adapter_config.json | 48 + checkpoint-450/adapter_model.safetensors | 3 + checkpoint-450/optimizer.pt | 3 + checkpoint-450/rng_state.pth | 3 + checkpoint-450/scheduler.pt | 3 + checkpoint-450/trainer_state.json | 188 ++ checkpoint-450/training_args.bin | 3 + checkpoint-50/README.md | 207 ++ checkpoint-50/adapter_config.json | 48 + checkpoint-50/adapter_model.safetensors | 3 + checkpoint-50/optimizer.pt | 3 + checkpoint-50/rng_state.pth | 3 + checkpoint-50/scheduler.pt | 3 + checkpoint-50/trainer_state.json | 48 + checkpoint-50/training_args.bin | 3 + checkpoint-500/README.md | 207 ++ checkpoint-500/adapter_config.json | 48 + checkpoint-500/adapter_model.safetensors | 3 + checkpoint-500/optimizer.pt | 3 + checkpoint-500/rng_state.pth | 3 + checkpoint-500/scheduler.pt | 3 + checkpoint-500/trainer_state.json | 209 +++ checkpoint-500/training_args.bin | 3 + checkpoint-550/README.md | 207 ++ checkpoint-550/adapter_config.json | 48 + checkpoint-550/adapter_model.safetensors | 3 + checkpoint-550/optimizer.pt | 3 + checkpoint-550/rng_state.pth | 3 + checkpoint-550/scheduler.pt | 3 + checkpoint-550/trainer_state.json | 223 +++ checkpoint-550/training_args.bin | 3 + checkpoint-600/README.md | 207 ++ checkpoint-600/adapter_config.json | 48 + checkpoint-600/adapter_model.safetensors | 3 + checkpoint-600/optimizer.pt | 3 + checkpoint-600/rng_state.pth | 3 + checkpoint-600/scheduler.pt | 3 + checkpoint-600/trainer_state.json | 244 +++ checkpoint-600/training_args.bin | 3 + checkpoint-650/README.md | 207 ++ checkpoint-650/adapter_config.json | 48 + checkpoint-650/adapter_model.safetensors | 3 + checkpoint-650/optimizer.pt | 3 + checkpoint-650/rng_state.pth | 3 + checkpoint-650/scheduler.pt | 3 + checkpoint-650/trainer_state.json | 258 +++ checkpoint-650/training_args.bin | 3 + checkpoint-700/README.md | 207 ++ checkpoint-700/adapter_config.json | 48 + checkpoint-700/adapter_model.safetensors | 3 + checkpoint-700/optimizer.pt | 3 + checkpoint-700/rng_state.pth | 3 + checkpoint-700/scheduler.pt | 3 + checkpoint-700/trainer_state.json | 279 +++ checkpoint-700/training_args.bin | 3 + checkpoint-750/README.md | 207 ++ checkpoint-750/adapter_config.json | 48 + checkpoint-750/adapter_model.safetensors | 3 + checkpoint-750/optimizer.pt | 3 + checkpoint-750/rng_state.pth | 3 + checkpoint-750/scheduler.pt | 3 + checkpoint-750/trainer_state.json | 293 +++ checkpoint-750/training_args.bin | 3 + checkpoint-800/README.md | 207 ++ checkpoint-800/adapter_config.json | 48 + checkpoint-800/adapter_model.safetensors | 3 + checkpoint-800/optimizer.pt | 3 + checkpoint-800/rng_state.pth | 3 + checkpoint-800/scheduler.pt | 3 + checkpoint-800/trainer_state.json | 314 ++++ checkpoint-800/training_args.bin | 3 + checkpoint-850/README.md | 207 ++ checkpoint-850/adapter_config.json | 48 + checkpoint-850/adapter_model.safetensors | 3 + checkpoint-850/optimizer.pt | 3 + checkpoint-850/rng_state.pth | 3 + checkpoint-850/scheduler.pt | 3 + checkpoint-850/trainer_state.json | 328 ++++ checkpoint-850/training_args.bin | 3 + checkpoint-900/README.md | 207 ++ checkpoint-900/adapter_config.json | 48 + checkpoint-900/adapter_model.safetensors | 3 + checkpoint-900/optimizer.pt | 3 + checkpoint-900/rng_state.pth | 3 + checkpoint-900/scheduler.pt | 3 + checkpoint-900/trainer_state.json | 349 ++++ checkpoint-900/training_args.bin | 3 + checkpoint-950/README.md | 207 ++ checkpoint-950/adapter_config.json | 48 + checkpoint-950/adapter_model.safetensors | 3 + checkpoint-950/optimizer.pt | 3 + checkpoint-950/rng_state.pth | 3 + checkpoint-950/scheduler.pt | 3 + checkpoint-950/trainer_state.json | 363 ++++ checkpoint-950/training_args.bin | 3 + config.json | 29 + generation_config.json | 6 + last-checkpoint/README.md | 207 ++ last-checkpoint/adapter_config.json | 48 + last-checkpoint/adapter_model.safetensors | 3 + last-checkpoint/optimizer.pt | 3 + last-checkpoint/rng_state.pth | 3 + last-checkpoint/scheduler.pt | 3 + last-checkpoint/trainer_state.json | 433 +++++ last-checkpoint/training_args.bin | 3 + model-00001-of-00004.safetensors | 3 + model-00002-of-00004.safetensors | 3 + model-00003-of-00004.safetensors | 3 + model-00004-of-00004.safetensors | 3 + model.safetensors.index.json | 299 +++ special_tokens_map.json | 27 + tokenizer.json | 3 + tokenizer_config.json | 2085 +++++++++++++++++++++ training_args.bin | 3 + 191 files changed, 14013 insertions(+) create mode 100644 .gitattributes create mode 100644 adapter_config.json create mode 100644 adapter_model.safetensors create mode 100644 chat_template.jinja create mode 100644 checkpoint-1000/README.md create mode 100644 checkpoint-1000/adapter_config.json create mode 100644 checkpoint-1000/adapter_model.safetensors create mode 100644 checkpoint-1000/optimizer.pt create mode 100644 checkpoint-1000/rng_state.pth create mode 100644 checkpoint-1000/scheduler.pt create mode 100644 checkpoint-1000/trainer_state.json create mode 100644 checkpoint-1000/training_args.bin create mode 100644 checkpoint-1050/README.md create mode 100644 checkpoint-1050/adapter_config.json create mode 100644 checkpoint-1050/adapter_model.safetensors create mode 100644 checkpoint-1050/optimizer.pt create mode 100644 checkpoint-1050/rng_state.pth create mode 100644 checkpoint-1050/scheduler.pt create mode 100644 checkpoint-1050/trainer_state.json create mode 100644 checkpoint-1050/training_args.bin create mode 100644 checkpoint-1150/README.md create mode 100644 checkpoint-1150/adapter_config.json create mode 100644 checkpoint-1150/adapter_model.safetensors create mode 100644 checkpoint-1150/optimizer.pt create mode 100644 checkpoint-1150/rng_state.pth create mode 100644 checkpoint-1150/scheduler.pt create mode 100644 checkpoint-1150/trainer_state.json create mode 100644 checkpoint-1150/training_args.bin create mode 100644 checkpoint-150/README.md create mode 100644 checkpoint-150/adapter_config.json create mode 100644 checkpoint-150/adapter_model.safetensors create mode 100644 checkpoint-150/optimizer.pt create mode 100644 checkpoint-150/rng_state.pth create mode 100644 checkpoint-150/scheduler.pt create mode 100644 checkpoint-150/trainer_state.json create mode 100644 checkpoint-150/training_args.bin create mode 100644 checkpoint-200/README.md create mode 100644 checkpoint-200/adapter_config.json create mode 100644 checkpoint-200/adapter_model.safetensors create mode 100644 checkpoint-200/optimizer.pt create mode 100644 checkpoint-200/rng_state.pth create mode 100644 checkpoint-200/scheduler.pt create mode 100644 checkpoint-200/trainer_state.json create mode 100644 checkpoint-200/training_args.bin create mode 100644 checkpoint-250/README.md create mode 100644 checkpoint-250/adapter_config.json create mode 100644 checkpoint-250/adapter_model.safetensors create mode 100644 checkpoint-250/optimizer.pt create mode 100644 checkpoint-250/rng_state.pth create mode 100644 checkpoint-250/scheduler.pt create mode 100644 checkpoint-250/trainer_state.json create mode 100644 checkpoint-250/training_args.bin create mode 100644 checkpoint-300/README.md create mode 100644 checkpoint-300/adapter_config.json create mode 100644 checkpoint-300/adapter_model.safetensors create mode 100644 checkpoint-300/optimizer.pt create mode 100644 checkpoint-300/rng_state.pth create mode 100644 checkpoint-300/scheduler.pt create mode 100644 checkpoint-300/trainer_state.json create mode 100644 checkpoint-300/training_args.bin create mode 100644 checkpoint-350/README.md create mode 100644 checkpoint-350/adapter_config.json create mode 100644 checkpoint-350/adapter_model.safetensors create mode 100644 checkpoint-350/optimizer.pt create mode 100644 checkpoint-350/rng_state.pth create mode 100644 checkpoint-350/scheduler.pt create mode 100644 checkpoint-350/trainer_state.json create mode 100644 checkpoint-350/training_args.bin create mode 100644 checkpoint-400/README.md create mode 100644 checkpoint-400/adapter_config.json create mode 100644 checkpoint-400/adapter_model.safetensors create mode 100644 checkpoint-400/optimizer.pt create mode 100644 checkpoint-400/rng_state.pth create mode 100644 checkpoint-400/scheduler.pt create mode 100644 checkpoint-400/trainer_state.json create mode 100644 checkpoint-400/training_args.bin create mode 100644 checkpoint-450/README.md create mode 100644 checkpoint-450/adapter_config.json create mode 100644 checkpoint-450/adapter_model.safetensors create mode 100644 checkpoint-450/optimizer.pt create mode 100644 checkpoint-450/rng_state.pth create mode 100644 checkpoint-450/scheduler.pt create mode 100644 checkpoint-450/trainer_state.json create mode 100644 checkpoint-450/training_args.bin create mode 100644 checkpoint-50/README.md create mode 100644 checkpoint-50/adapter_config.json create mode 100644 checkpoint-50/adapter_model.safetensors create mode 100644 checkpoint-50/optimizer.pt create mode 100644 checkpoint-50/rng_state.pth create mode 100644 checkpoint-50/scheduler.pt create mode 100644 checkpoint-50/trainer_state.json create mode 100644 checkpoint-50/training_args.bin create mode 100644 checkpoint-500/README.md create mode 100644 checkpoint-500/adapter_config.json create mode 100644 checkpoint-500/adapter_model.safetensors create mode 100644 checkpoint-500/optimizer.pt create mode 100644 checkpoint-500/rng_state.pth create mode 100644 checkpoint-500/scheduler.pt create mode 100644 checkpoint-500/trainer_state.json create mode 100644 checkpoint-500/training_args.bin create mode 100644 checkpoint-550/README.md create mode 100644 checkpoint-550/adapter_config.json create mode 100644 checkpoint-550/adapter_model.safetensors create mode 100644 checkpoint-550/optimizer.pt create mode 100644 checkpoint-550/rng_state.pth create mode 100644 checkpoint-550/scheduler.pt create mode 100644 checkpoint-550/trainer_state.json create mode 100644 checkpoint-550/training_args.bin create mode 100644 checkpoint-600/README.md create mode 100644 checkpoint-600/adapter_config.json create mode 100644 checkpoint-600/adapter_model.safetensors create mode 100644 checkpoint-600/optimizer.pt create mode 100644 checkpoint-600/rng_state.pth create mode 100644 checkpoint-600/scheduler.pt create mode 100644 checkpoint-600/trainer_state.json create mode 100644 checkpoint-600/training_args.bin create mode 100644 checkpoint-650/README.md create mode 100644 checkpoint-650/adapter_config.json create mode 100644 checkpoint-650/adapter_model.safetensors create mode 100644 checkpoint-650/optimizer.pt create mode 100644 checkpoint-650/rng_state.pth create mode 100644 checkpoint-650/scheduler.pt create mode 100644 checkpoint-650/trainer_state.json create mode 100644 checkpoint-650/training_args.bin create mode 100644 checkpoint-700/README.md create mode 100644 checkpoint-700/adapter_config.json create mode 100644 checkpoint-700/adapter_model.safetensors create mode 100644 checkpoint-700/optimizer.pt create mode 100644 checkpoint-700/rng_state.pth create mode 100644 checkpoint-700/scheduler.pt create mode 100644 checkpoint-700/trainer_state.json create mode 100644 checkpoint-700/training_args.bin create mode 100644 checkpoint-750/README.md create mode 100644 checkpoint-750/adapter_config.json create mode 100644 checkpoint-750/adapter_model.safetensors create mode 100644 checkpoint-750/optimizer.pt create mode 100644 checkpoint-750/rng_state.pth create mode 100644 checkpoint-750/scheduler.pt create mode 100644 checkpoint-750/trainer_state.json create mode 100644 checkpoint-750/training_args.bin create mode 100644 checkpoint-800/README.md create mode 100644 checkpoint-800/adapter_config.json create mode 100644 checkpoint-800/adapter_model.safetensors create mode 100644 checkpoint-800/optimizer.pt create mode 100644 checkpoint-800/rng_state.pth create mode 100644 checkpoint-800/scheduler.pt create mode 100644 checkpoint-800/trainer_state.json create mode 100644 checkpoint-800/training_args.bin create mode 100644 checkpoint-850/README.md create mode 100644 checkpoint-850/adapter_config.json create mode 100644 checkpoint-850/adapter_model.safetensors create mode 100644 checkpoint-850/optimizer.pt create mode 100644 checkpoint-850/rng_state.pth create mode 100644 checkpoint-850/scheduler.pt create mode 100644 checkpoint-850/trainer_state.json create mode 100644 checkpoint-850/training_args.bin create mode 100644 checkpoint-900/README.md create mode 100644 checkpoint-900/adapter_config.json create mode 100644 checkpoint-900/adapter_model.safetensors create mode 100644 checkpoint-900/optimizer.pt create mode 100644 checkpoint-900/rng_state.pth create mode 100644 checkpoint-900/scheduler.pt create mode 100644 checkpoint-900/trainer_state.json create mode 100644 checkpoint-900/training_args.bin create mode 100644 checkpoint-950/README.md create mode 100644 checkpoint-950/adapter_config.json create mode 100644 checkpoint-950/adapter_model.safetensors create mode 100644 checkpoint-950/optimizer.pt create mode 100644 checkpoint-950/rng_state.pth create mode 100644 checkpoint-950/scheduler.pt create mode 100644 checkpoint-950/trainer_state.json create mode 100644 checkpoint-950/training_args.bin create mode 100644 config.json create mode 100644 generation_config.json create mode 100644 last-checkpoint/README.md create mode 100644 last-checkpoint/adapter_config.json create mode 100644 last-checkpoint/adapter_model.safetensors create mode 100644 last-checkpoint/optimizer.pt create mode 100644 last-checkpoint/rng_state.pth create mode 100644 last-checkpoint/scheduler.pt create mode 100644 last-checkpoint/trainer_state.json create mode 100644 last-checkpoint/training_args.bin create mode 100644 model-00001-of-00004.safetensors create mode 100644 model-00002-of-00004.safetensors create mode 100644 model-00003-of-00004.safetensors create mode 100644 model-00004-of-00004.safetensors create mode 100644 model.safetensors.index.json create mode 100644 special_tokens_map.json create mode 100644 tokenizer.json create mode 100644 tokenizer_config.json create mode 100644 training_args.bin diff --git a/.gitattributes b/.gitattributes new file mode 100644 index 0000000..52373fe --- /dev/null +++ b/.gitattributes @@ -0,0 +1,36 @@ +*.7z filter=lfs diff=lfs merge=lfs -text +*.arrow filter=lfs diff=lfs merge=lfs -text +*.bin filter=lfs diff=lfs merge=lfs -text +*.bz2 filter=lfs diff=lfs merge=lfs -text +*.ckpt filter=lfs diff=lfs merge=lfs -text +*.ftz filter=lfs diff=lfs merge=lfs -text +*.gz filter=lfs diff=lfs merge=lfs -text +*.h5 filter=lfs diff=lfs merge=lfs -text +*.joblib filter=lfs diff=lfs merge=lfs -text +*.lfs.* filter=lfs diff=lfs merge=lfs -text +*.mlmodel filter=lfs diff=lfs merge=lfs -text +*.model filter=lfs diff=lfs merge=lfs -text +*.msgpack filter=lfs diff=lfs merge=lfs -text +*.npy filter=lfs diff=lfs merge=lfs -text +*.npz filter=lfs diff=lfs merge=lfs -text +*.onnx filter=lfs diff=lfs merge=lfs -text +*.ot filter=lfs diff=lfs merge=lfs -text +*.parquet filter=lfs diff=lfs merge=lfs -text +*.pb filter=lfs diff=lfs merge=lfs -text +*.pickle filter=lfs diff=lfs merge=lfs -text +*.pkl filter=lfs diff=lfs merge=lfs -text +*.pt filter=lfs diff=lfs merge=lfs -text +*.pth filter=lfs diff=lfs merge=lfs -text +*.rar filter=lfs diff=lfs merge=lfs -text +*.safetensors filter=lfs diff=lfs merge=lfs -text +saved_model/**/* filter=lfs diff=lfs merge=lfs -text +*.tar.* filter=lfs diff=lfs merge=lfs -text +*.tar filter=lfs diff=lfs merge=lfs -text +*.tflite filter=lfs diff=lfs merge=lfs -text +*.tgz filter=lfs diff=lfs merge=lfs -text +*.wasm filter=lfs diff=lfs merge=lfs -text +*.xz filter=lfs diff=lfs merge=lfs -text +*.zip filter=lfs diff=lfs merge=lfs -text +*.zst filter=lfs diff=lfs merge=lfs -text +*tfevents* filter=lfs diff=lfs merge=lfs -text +tokenizer.json filter=lfs diff=lfs merge=lfs -text diff --git a/adapter_config.json b/adapter_config.json new file mode 100644 index 0000000..05d9c96 --- /dev/null +++ b/adapter_config.json @@ -0,0 +1,48 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "biaofu-xmu/EAST-8B", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.05, + "lora_ga_config": null, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.19.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "v_proj", + "q_proj", + "k_proj", + "gate_proj", + "o_proj", + "down_proj", + "up_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_bdlora": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/adapter_model.safetensors b/adapter_model.safetensors new file mode 100644 index 0000000..ea4be1a --- /dev/null +++ b/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:cb76ab90c930eda4c5f96bbae36464a39848eac93333e8b3aa9200d47c25465f +size 671149168 diff --git a/chat_template.jinja b/chat_template.jinja new file mode 100644 index 0000000..a3b591c --- /dev/null +++ b/chat_template.jinja @@ -0,0 +1,7 @@ +{% set system_message = 'You are a helpful assistant.' %}{% if messages[0]['role'] == 'system' %}{% set system_message = messages[0]['content'] %}{% endif %}{% if system_message is defined %}{{ '<|begin_of_text|>' + '<|start_header_id|>system<|end_header_id|> + +' + system_message + '<|eot_id|>' }}{% endif %}{% for message in messages %}{% set content = message['content'] %}{% if message['role'] == 'user' %}{{ '<|start_header_id|>user<|end_header_id|> + +' + content + '<|eot_id|><|start_header_id|>assistant<|end_header_id|> + +' }}{% elif message['role'] == 'assistant' %}{{ content + '<|eot_id|>' }}{% endif %}{% endfor %} \ No newline at end of file diff --git a/checkpoint-1000/README.md b/checkpoint-1000/README.md new file mode 100644 index 0000000..bacf84a --- /dev/null +++ b/checkpoint-1000/README.md @@ -0,0 +1,207 @@ +--- +base_model: biaofu-xmu/EAST-8B +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:biaofu-xmu/EAST-8B +- lora +- transformers +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.19.1 \ No newline at end of file diff --git a/checkpoint-1000/adapter_config.json b/checkpoint-1000/adapter_config.json new file mode 100644 index 0000000..44390c2 --- /dev/null +++ b/checkpoint-1000/adapter_config.json @@ -0,0 +1,48 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "biaofu-xmu/EAST-8B", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.05, + "lora_ga_config": null, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.19.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "o_proj", + "k_proj", + "down_proj", + "q_proj", + "v_proj", + "up_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_bdlora": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/checkpoint-1000/adapter_model.safetensors b/checkpoint-1000/adapter_model.safetensors new file mode 100644 index 0000000..ffeed5f --- /dev/null +++ b/checkpoint-1000/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0f621ff5fd31773970002dd3944a209cb6172191e89dd7084166b6669445452b +size 671149168 diff --git a/checkpoint-1000/optimizer.pt b/checkpoint-1000/optimizer.pt new file mode 100644 index 0000000..f4856e9 --- /dev/null +++ b/checkpoint-1000/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b3d8786d6ea9e8862659d445373eb4abfef840d82af0104c84ee661b08e5cd0c +size 1342562339 diff --git a/checkpoint-1000/rng_state.pth b/checkpoint-1000/rng_state.pth new file mode 100644 index 0000000..133478f --- /dev/null +++ b/checkpoint-1000/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e916849628b0b5f07beaddd380af50b5fd8e0305530ac58ecc8c9447c4f23d41 +size 14645 diff --git a/checkpoint-1000/scheduler.pt b/checkpoint-1000/scheduler.pt new file mode 100644 index 0000000..54c4178 --- /dev/null +++ b/checkpoint-1000/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3faa60702eeec70c307ffab2e710a51a22e86b2f89bbb3effe498e101641bee8 +size 1465 diff --git a/checkpoint-1000/trainer_state.json b/checkpoint-1000/trainer_state.json new file mode 100644 index 0000000..74c8cd0 --- /dev/null +++ b/checkpoint-1000/trainer_state.json @@ -0,0 +1,384 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.7361111111111112, + "eval_steps": 500, + "global_step": 1000, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.034722222222222224, + "grad_norm": 2.985321283340454, + "learning_rate": 1.6379310344827587e-06, + "loss": 2.6523, + "step": 20 + }, + { + "epoch": 0.06944444444444445, + "grad_norm": 2.353632926940918, + "learning_rate": 3.362068965517242e-06, + "loss": 2.4359, + "step": 40 + }, + { + "epoch": 0.10416666666666667, + "grad_norm": 1.865394115447998, + "learning_rate": 5.086206896551724e-06, + "loss": 2.2545, + "step": 60 + }, + { + "epoch": 0.1388888888888889, + "grad_norm": 1.8125933408737183, + "learning_rate": 6.810344827586207e-06, + "loss": 2.0557, + "step": 80 + }, + { + "epoch": 0.1736111111111111, + "grad_norm": 2.3572490215301514, + "learning_rate": 8.53448275862069e-06, + "loss": 1.9334, + "step": 100 + }, + { + "epoch": 0.20833333333333334, + "grad_norm": 2.395277261734009, + "learning_rate": 9.999793100349294e-06, + "loss": 1.9212, + "step": 120 + }, + { + "epoch": 0.24305555555555555, + "grad_norm": 2.714841604232788, + "learning_rate": 9.987843743451796e-06, + "loss": 1.7889, + "step": 140 + }, + { + "epoch": 0.2777777777777778, + "grad_norm": 2.236692190170288, + "learning_rate": 9.957553516178782e-06, + "loss": 1.716, + "step": 160 + }, + { + "epoch": 0.3125, + "grad_norm": 2.3020412921905518, + "learning_rate": 9.909033799150947e-06, + "loss": 1.7569, + "step": 180 + }, + { + "epoch": 0.3472222222222222, + "grad_norm": 2.5109288692474365, + "learning_rate": 9.842463004902127e-06, + "loss": 1.6664, + "step": 200 + }, + { + "epoch": 0.3819444444444444, + "grad_norm": 2.5140888690948486, + "learning_rate": 9.758085921836076e-06, + "loss": 1.6544, + "step": 220 + }, + { + "epoch": 0.4166666666666667, + "grad_norm": 2.666377544403076, + "learning_rate": 9.656212814111567e-06, + "loss": 1.6608, + "step": 240 + }, + { + "epoch": 0.4513888888888889, + "grad_norm": 2.715240955352783, + "learning_rate": 9.53721828076571e-06, + "loss": 1.6353, + "step": 260 + }, + { + "epoch": 0.4861111111111111, + "grad_norm": 2.7697439193725586, + "learning_rate": 9.401539878270545e-06, + "loss": 1.6352, + "step": 280 + }, + { + "epoch": 0.5208333333333334, + "grad_norm": 2.9743459224700928, + "learning_rate": 9.249676511588e-06, + "loss": 1.6275, + "step": 300 + }, + { + "epoch": 0.5555555555555556, + "grad_norm": 2.955244541168213, + "learning_rate": 9.082186599639429e-06, + "loss": 1.6052, + "step": 320 + }, + { + "epoch": 0.5902777777777778, + "grad_norm": 2.6228716373443604, + "learning_rate": 8.899686021935554e-06, + "loss": 1.5924, + "step": 340 + }, + { + "epoch": 0.625, + "grad_norm": 2.7822635173797607, + "learning_rate": 8.702845853917242e-06, + "loss": 1.5711, + "step": 360 + }, + { + "epoch": 0.6597222222222222, + "grad_norm": 2.450777769088745, + "learning_rate": 8.492389899334572e-06, + "loss": 1.5601, + "step": 380 + }, + { + "epoch": 0.6944444444444444, + "grad_norm": 2.999849557876587, + "learning_rate": 8.269092028737885e-06, + "loss": 1.5497, + "step": 400 + }, + { + "epoch": 0.7291666666666666, + "grad_norm": 3.2980637550354004, + "learning_rate": 8.033773333867498e-06, + "loss": 1.5243, + "step": 420 + }, + { + "epoch": 0.7638888888888888, + "grad_norm": 2.758843421936035, + "learning_rate": 7.78729910840572e-06, + "loss": 1.5171, + "step": 440 + }, + { + "epoch": 0.7986111111111112, + "grad_norm": 3.114650249481201, + "learning_rate": 7.530575666193283e-06, + "loss": 1.5212, + "step": 460 + }, + { + "epoch": 0.8333333333333334, + "grad_norm": 3.235766649246216, + "learning_rate": 7.26454700860997e-06, + "loss": 1.5019, + "step": 480 + }, + { + "epoch": 0.8680555555555556, + "grad_norm": 3.39516544342041, + "learning_rate": 6.990191353373876e-06, + "loss": 1.4963, + "step": 500 + }, + { + "epoch": 0.9027777777777778, + "grad_norm": 3.507965087890625, + "learning_rate": 6.708517537523264e-06, + "loss": 1.4762, + "step": 520 + }, + { + "epoch": 0.9375, + "grad_norm": 3.2428181171417236, + "learning_rate": 6.420561307807713e-06, + "loss": 1.4822, + "step": 540 + }, + { + "epoch": 0.9722222222222222, + "grad_norm": 2.9236435890197754, + "learning_rate": 6.12738151212918e-06, + "loss": 1.5021, + "step": 560 + }, + { + "epoch": 1.0069444444444444, + "grad_norm": 3.689115047454834, + "learning_rate": 5.830056206037482e-06, + "loss": 1.4606, + "step": 580 + }, + { + "epoch": 1.0416666666666667, + "grad_norm": 2.897470474243164, + "learning_rate": 5.529678688597081e-06, + "loss": 1.3981, + "step": 600 + }, + { + "epoch": 1.0763888888888888, + "grad_norm": 3.1479601860046387, + "learning_rate": 5.2273534822017105e-06, + "loss": 1.4024, + "step": 620 + }, + { + "epoch": 1.1111111111111112, + "grad_norm": 3.726175546646118, + "learning_rate": 4.924192271119554e-06, + "loss": 1.3784, + "step": 640 + }, + { + "epoch": 1.1458333333333333, + "grad_norm": 2.944827079772949, + "learning_rate": 4.621309813703385e-06, + "loss": 1.3781, + "step": 660 + }, + { + "epoch": 1.1805555555555556, + "grad_norm": 4.154749870300293, + "learning_rate": 4.319819843296952e-06, + "loss": 1.385, + "step": 680 + }, + { + "epoch": 1.2152777777777777, + "grad_norm": 3.470216751098633, + "learning_rate": 4.020830972910433e-06, + "loss": 1.3937, + "step": 700 + }, + { + "epoch": 1.25, + "grad_norm": 3.534930944442749, + "learning_rate": 3.7254426187239567e-06, + "loss": 1.3471, + "step": 720 + }, + { + "epoch": 1.2847222222222223, + "grad_norm": 3.479079484939575, + "learning_rate": 3.4347409574088896e-06, + "loss": 1.364, + "step": 740 + }, + { + "epoch": 1.3194444444444444, + "grad_norm": 4.021931171417236, + "learning_rate": 3.149794932132331e-06, + "loss": 1.3875, + "step": 760 + }, + { + "epoch": 1.3541666666666667, + "grad_norm": 4.136874198913574, + "learning_rate": 2.871652321931161e-06, + "loss": 1.3603, + "step": 780 + }, + { + "epoch": 1.3888888888888888, + "grad_norm": 2.8454277515411377, + "learning_rate": 2.601335888909005e-06, + "loss": 1.3676, + "step": 800 + }, + { + "epoch": 1.4236111111111112, + "grad_norm": 3.8844242095947266, + "learning_rate": 2.339839617423318e-06, + "loss": 1.3327, + "step": 820 + }, + { + "epoch": 1.4583333333333333, + "grad_norm": 3.777667284011841, + "learning_rate": 2.0881250590915316e-06, + "loss": 1.351, + "step": 840 + }, + { + "epoch": 1.4930555555555556, + "grad_norm": 3.9106264114379883, + "learning_rate": 1.8471177970560712e-06, + "loss": 1.3651, + "step": 860 + }, + { + "epoch": 1.5277777777777777, + "grad_norm": 3.131366014480591, + "learning_rate": 1.6177040425095664e-06, + "loss": 1.3271, + "step": 880 + }, + { + "epoch": 1.5625, + "grad_norm": 3.60107421875, + "learning_rate": 1.40072737599522e-06, + "loss": 1.3627, + "step": 900 + }, + { + "epoch": 1.5972222222222223, + "grad_norm": 3.059379816055298, + "learning_rate": 1.196985645464921e-06, + "loss": 1.3369, + "step": 920 + }, + { + "epoch": 1.6319444444444444, + "grad_norm": 4.2240095138549805, + "learning_rate": 1.0072280325013185e-06, + "loss": 1.3439, + "step": 940 + }, + { + "epoch": 1.6666666666666665, + "grad_norm": 3.858954668045044, + "learning_rate": 8.321522974916968e-07, + "loss": 1.361, + "step": 960 + }, + { + "epoch": 1.7013888888888888, + "grad_norm": 4.0487380027771, + "learning_rate": 6.724022138834341e-07, + "loss": 1.3317, + "step": 980 + }, + { + "epoch": 1.7361111111111112, + "grad_norm": 3.2408926486968994, + "learning_rate": 5.285652009556075e-07, + "loss": 1.3269, + "step": 1000 + } + ], + "logging_steps": 20, + "max_steps": 1152, + "num_input_tokens_seen": 0, + "num_train_epochs": 2, + "save_steps": 50, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.0354156489510093e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/checkpoint-1000/training_args.bin b/checkpoint-1000/training_args.bin new file mode 100644 index 0000000..925fd93 --- /dev/null +++ b/checkpoint-1000/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3b7f58321eea14364587c280ddc055ad0a161fdb8a2e9d81351505baed73ddca +size 6033 diff --git a/checkpoint-1050/README.md b/checkpoint-1050/README.md new file mode 100644 index 0000000..bacf84a --- /dev/null +++ b/checkpoint-1050/README.md @@ -0,0 +1,207 @@ +--- +base_model: biaofu-xmu/EAST-8B +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:biaofu-xmu/EAST-8B +- lora +- transformers +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.19.1 \ No newline at end of file diff --git a/checkpoint-1050/adapter_config.json b/checkpoint-1050/adapter_config.json new file mode 100644 index 0000000..8e6e401 --- /dev/null +++ b/checkpoint-1050/adapter_config.json @@ -0,0 +1,48 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "biaofu-xmu/EAST-8B", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.05, + "lora_ga_config": null, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.19.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "o_proj", + "up_proj", + "q_proj", + "gate_proj", + "v_proj", + "down_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_bdlora": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/checkpoint-1050/adapter_model.safetensors b/checkpoint-1050/adapter_model.safetensors new file mode 100644 index 0000000..c089457 --- /dev/null +++ b/checkpoint-1050/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:1f08075daaf4ee6b5aa54d7ff71177574136c2937c59c0901909446804b48f70 +size 671149168 diff --git a/checkpoint-1050/optimizer.pt b/checkpoint-1050/optimizer.pt new file mode 100644 index 0000000..9a917fc --- /dev/null +++ b/checkpoint-1050/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:67b84406acd5bcb603f5f7e3d0a3c283b8c5f432dac20226e0b81468a796c0df +size 1342562339 diff --git a/checkpoint-1050/rng_state.pth b/checkpoint-1050/rng_state.pth new file mode 100644 index 0000000..acc8fba --- /dev/null +++ b/checkpoint-1050/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:278e0a88fa979499cf3285becf04f912375ae3107d75233036211edc161b0fd7 +size 14645 diff --git a/checkpoint-1050/scheduler.pt b/checkpoint-1050/scheduler.pt new file mode 100644 index 0000000..0d92c59 --- /dev/null +++ b/checkpoint-1050/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:abe9abb5efc489b294c297766a8ae2c71262b2cf1b3df1555b36fda19a8e7406 +size 1465 diff --git a/checkpoint-1050/trainer_state.json b/checkpoint-1050/trainer_state.json new file mode 100644 index 0000000..a4fd07a --- /dev/null +++ b/checkpoint-1050/trainer_state.json @@ -0,0 +1,398 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.8229166666666665, + "eval_steps": 500, + "global_step": 1050, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.034722222222222224, + "grad_norm": 2.975640058517456, + "learning_rate": 1.6379310344827587e-06, + "loss": 2.6527, + "step": 20 + }, + { + "epoch": 0.06944444444444445, + "grad_norm": 2.329663038253784, + "learning_rate": 3.362068965517242e-06, + "loss": 2.4375, + "step": 40 + }, + { + "epoch": 0.10416666666666667, + "grad_norm": 1.8956992626190186, + "learning_rate": 5.086206896551724e-06, + "loss": 2.2566, + "step": 60 + }, + { + "epoch": 0.1388888888888889, + "grad_norm": 1.8109517097473145, + "learning_rate": 6.810344827586207e-06, + "loss": 2.0567, + "step": 80 + }, + { + "epoch": 0.1736111111111111, + "grad_norm": 2.382589817047119, + "learning_rate": 8.53448275862069e-06, + "loss": 1.9338, + "step": 100 + }, + { + "epoch": 0.20833333333333334, + "grad_norm": 2.378267526626587, + "learning_rate": 9.999793100349294e-06, + "loss": 1.9218, + "step": 120 + }, + { + "epoch": 0.24305555555555555, + "grad_norm": 2.6260263919830322, + "learning_rate": 9.987843743451796e-06, + "loss": 1.7895, + "step": 140 + }, + { + "epoch": 0.2777777777777778, + "grad_norm": 2.2361156940460205, + "learning_rate": 9.957553516178782e-06, + "loss": 1.7166, + "step": 160 + }, + { + "epoch": 0.3125, + "grad_norm": 2.345552682876587, + "learning_rate": 9.909033799150947e-06, + "loss": 1.7573, + "step": 180 + }, + { + "epoch": 0.3472222222222222, + "grad_norm": 2.4918200969696045, + "learning_rate": 9.842463004902127e-06, + "loss": 1.6668, + "step": 200 + }, + { + "epoch": 0.3819444444444444, + "grad_norm": 2.5107343196868896, + "learning_rate": 9.758085921836076e-06, + "loss": 1.6556, + "step": 220 + }, + { + "epoch": 0.4166666666666667, + "grad_norm": 2.69317626953125, + "learning_rate": 9.656212814111567e-06, + "loss": 1.6606, + "step": 240 + }, + { + "epoch": 0.4513888888888889, + "grad_norm": 2.759850025177002, + "learning_rate": 9.53721828076571e-06, + "loss": 1.6359, + "step": 260 + }, + { + "epoch": 0.4861111111111111, + "grad_norm": 2.751281976699829, + "learning_rate": 9.401539878270545e-06, + "loss": 1.635, + "step": 280 + }, + { + "epoch": 0.5208333333333334, + "grad_norm": 3.0062153339385986, + "learning_rate": 9.249676511588e-06, + "loss": 1.6278, + "step": 300 + }, + { + "epoch": 0.5555555555555556, + "grad_norm": 2.9671173095703125, + "learning_rate": 9.082186599639429e-06, + "loss": 1.6051, + "step": 320 + }, + { + "epoch": 0.5902777777777778, + "grad_norm": 2.6128034591674805, + "learning_rate": 8.899686021935554e-06, + "loss": 1.5921, + "step": 340 + }, + { + "epoch": 0.625, + "grad_norm": 2.750213384628296, + "learning_rate": 8.702845853917242e-06, + "loss": 1.5715, + "step": 360 + }, + { + "epoch": 0.6597222222222222, + "grad_norm": 2.4882044792175293, + "learning_rate": 8.492389899334572e-06, + "loss": 1.5607, + "step": 380 + }, + { + "epoch": 0.6944444444444444, + "grad_norm": 2.949469566345215, + "learning_rate": 8.269092028737885e-06, + "loss": 1.5498, + "step": 400 + }, + { + "epoch": 0.7291666666666666, + "grad_norm": 3.360396146774292, + "learning_rate": 8.033773333867498e-06, + "loss": 1.5246, + "step": 420 + }, + { + "epoch": 0.7638888888888888, + "grad_norm": 2.726001739501953, + "learning_rate": 7.78729910840572e-06, + "loss": 1.5172, + "step": 440 + }, + { + "epoch": 0.7986111111111112, + "grad_norm": 3.169776678085327, + "learning_rate": 7.530575666193283e-06, + "loss": 1.5212, + "step": 460 + }, + { + "epoch": 0.8333333333333334, + "grad_norm": 3.2836718559265137, + "learning_rate": 7.26454700860997e-06, + "loss": 1.5022, + "step": 480 + }, + { + "epoch": 0.8680555555555556, + "grad_norm": 3.3847920894622803, + "learning_rate": 6.990191353373876e-06, + "loss": 1.4968, + "step": 500 + }, + { + "epoch": 0.9027777777777778, + "grad_norm": 3.5661308765411377, + "learning_rate": 6.708517537523264e-06, + "loss": 1.477, + "step": 520 + }, + { + "epoch": 0.9375, + "grad_norm": 3.243346929550171, + "learning_rate": 6.420561307807713e-06, + "loss": 1.483, + "step": 540 + }, + { + "epoch": 0.9722222222222222, + "grad_norm": 2.8526790142059326, + "learning_rate": 6.12738151212918e-06, + "loss": 1.5018, + "step": 560 + }, + { + "epoch": 1.0069444444444444, + "grad_norm": 3.678152322769165, + "learning_rate": 5.830056206037482e-06, + "loss": 1.4604, + "step": 580 + }, + { + "epoch": 1.0416666666666667, + "grad_norm": 2.920789957046509, + "learning_rate": 5.529678688597081e-06, + "loss": 1.3984, + "step": 600 + }, + { + "epoch": 1.0763888888888888, + "grad_norm": 3.198030710220337, + "learning_rate": 5.2273534822017105e-06, + "loss": 1.4028, + "step": 620 + }, + { + "epoch": 1.1111111111111112, + "grad_norm": 3.737910270690918, + "learning_rate": 4.924192271119554e-06, + "loss": 1.3788, + "step": 640 + }, + { + "epoch": 1.1458333333333333, + "grad_norm": 2.9169039726257324, + "learning_rate": 4.621309813703385e-06, + "loss": 1.3787, + "step": 660 + }, + { + "epoch": 1.1805555555555556, + "grad_norm": 4.108018398284912, + "learning_rate": 4.319819843296952e-06, + "loss": 1.3854, + "step": 680 + }, + { + "epoch": 1.2152777777777777, + "grad_norm": 3.489570140838623, + "learning_rate": 4.020830972910433e-06, + "loss": 1.394, + "step": 700 + }, + { + "epoch": 1.25, + "grad_norm": 3.5733399391174316, + "learning_rate": 3.7254426187239567e-06, + "loss": 1.347, + "step": 720 + }, + { + "epoch": 1.2847222222222223, + "grad_norm": 3.479602098464966, + "learning_rate": 3.4347409574088896e-06, + "loss": 1.3647, + "step": 740 + }, + { + "epoch": 1.3194444444444444, + "grad_norm": 4.031429767608643, + "learning_rate": 3.149794932132331e-06, + "loss": 1.3879, + "step": 760 + }, + { + "epoch": 1.3541666666666667, + "grad_norm": 4.149319171905518, + "learning_rate": 2.871652321931161e-06, + "loss": 1.3618, + "step": 780 + }, + { + "epoch": 1.3888888888888888, + "grad_norm": 2.849364757537842, + "learning_rate": 2.601335888909005e-06, + "loss": 1.3687, + "step": 800 + }, + { + "epoch": 1.4236111111111112, + "grad_norm": 3.924811601638794, + "learning_rate": 2.339839617423318e-06, + "loss": 1.3329, + "step": 820 + }, + { + "epoch": 1.4583333333333333, + "grad_norm": 3.762462615966797, + "learning_rate": 2.0881250590915316e-06, + "loss": 1.3513, + "step": 840 + }, + { + "epoch": 1.4930555555555556, + "grad_norm": 3.951873302459717, + "learning_rate": 1.8471177970560712e-06, + "loss": 1.3655, + "step": 860 + }, + { + "epoch": 1.5277777777777777, + "grad_norm": 3.1432993412017822, + "learning_rate": 1.6177040425095664e-06, + "loss": 1.3276, + "step": 880 + }, + { + "epoch": 1.5625, + "grad_norm": 3.6409666538238525, + "learning_rate": 1.40072737599522e-06, + "loss": 1.3631, + "step": 900 + }, + { + "epoch": 1.5972222222222223, + "grad_norm": 3.062958002090454, + "learning_rate": 1.196985645464921e-06, + "loss": 1.3374, + "step": 920 + }, + { + "epoch": 1.6319444444444444, + "grad_norm": 4.230245590209961, + "learning_rate": 1.0072280325013185e-06, + "loss": 1.3438, + "step": 940 + }, + { + "epoch": 1.6666666666666665, + "grad_norm": 3.834761381149292, + "learning_rate": 8.321522974916968e-07, + "loss": 1.3611, + "step": 960 + }, + { + "epoch": 1.7013888888888888, + "grad_norm": 4.029264450073242, + "learning_rate": 6.724022138834341e-07, + "loss": 1.3323, + "step": 980 + }, + { + "epoch": 1.7361111111111112, + "grad_norm": 3.260033369064331, + "learning_rate": 5.285652009556075e-07, + "loss": 1.3273, + "step": 1000 + }, + { + "epoch": 1.7708333333333335, + "grad_norm": 4.1092071533203125, + "learning_rate": 4.0117016381130636e-07, + "loss": 1.3372, + "step": 1020 + }, + { + "epoch": 1.8055555555555556, + "grad_norm": 3.8922550678253174, + "learning_rate": 2.906855485332305e-07, + "loss": 1.3055, + "step": 1040 + } + ], + "logging_steps": 20, + "max_steps": 1152, + "num_input_tokens_seen": 0, + "num_train_epochs": 2, + "save_steps": 50, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.137833077689221e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/checkpoint-1050/training_args.bin b/checkpoint-1050/training_args.bin new file mode 100644 index 0000000..b0a0b0d --- /dev/null +++ b/checkpoint-1050/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ab2a55d99d554b614e62a1cc2b43a5981feda7b0fbd4713a15efa9946f443ce9 +size 6033 diff --git a/checkpoint-1150/README.md b/checkpoint-1150/README.md new file mode 100644 index 0000000..bacf84a --- /dev/null +++ b/checkpoint-1150/README.md @@ -0,0 +1,207 @@ +--- +base_model: biaofu-xmu/EAST-8B +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:biaofu-xmu/EAST-8B +- lora +- transformers +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.19.1 \ No newline at end of file diff --git a/checkpoint-1150/adapter_config.json b/checkpoint-1150/adapter_config.json new file mode 100644 index 0000000..8e6e401 --- /dev/null +++ b/checkpoint-1150/adapter_config.json @@ -0,0 +1,48 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "biaofu-xmu/EAST-8B", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.05, + "lora_ga_config": null, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.19.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "o_proj", + "up_proj", + "q_proj", + "gate_proj", + "v_proj", + "down_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_bdlora": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/checkpoint-1150/adapter_model.safetensors b/checkpoint-1150/adapter_model.safetensors new file mode 100644 index 0000000..96192e2 --- /dev/null +++ b/checkpoint-1150/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:1a0f75da15663e9919a81db6f60b57a54d8d1a0868e68952e53a8b635c6f6fdc +size 671149168 diff --git a/checkpoint-1150/optimizer.pt b/checkpoint-1150/optimizer.pt new file mode 100644 index 0000000..bec5287 --- /dev/null +++ b/checkpoint-1150/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e2a374b6d54e05cfcb17024e5ba3a9b2ab318a4df5babbf85720810fab3bf0fe +size 1342562339 diff --git a/checkpoint-1150/rng_state.pth b/checkpoint-1150/rng_state.pth new file mode 100644 index 0000000..602de4d --- /dev/null +++ b/checkpoint-1150/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c2faa2348c8dd051a0f8b65896fc7494d2594c8d04a70b968dbb22bf1ede1e00 +size 14645 diff --git a/checkpoint-1150/scheduler.pt b/checkpoint-1150/scheduler.pt new file mode 100644 index 0000000..d432e90 --- /dev/null +++ b/checkpoint-1150/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:28b81089eb143a676da720978f118caf9eee0a372736c9ef6f38cdec3dd8d997 +size 1465 diff --git a/checkpoint-1150/trainer_state.json b/checkpoint-1150/trainer_state.json new file mode 100644 index 0000000..6de2fcd --- /dev/null +++ b/checkpoint-1150/trainer_state.json @@ -0,0 +1,433 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.9965277777777777, + "eval_steps": 500, + "global_step": 1150, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.034722222222222224, + "grad_norm": 2.975640058517456, + "learning_rate": 1.6379310344827587e-06, + "loss": 2.6527, + "step": 20 + }, + { + "epoch": 0.06944444444444445, + "grad_norm": 2.329663038253784, + "learning_rate": 3.362068965517242e-06, + "loss": 2.4375, + "step": 40 + }, + { + "epoch": 0.10416666666666667, + "grad_norm": 1.8956992626190186, + "learning_rate": 5.086206896551724e-06, + "loss": 2.2566, + "step": 60 + }, + { + "epoch": 0.1388888888888889, + "grad_norm": 1.8109517097473145, + "learning_rate": 6.810344827586207e-06, + "loss": 2.0567, + "step": 80 + }, + { + "epoch": 0.1736111111111111, + "grad_norm": 2.382589817047119, + "learning_rate": 8.53448275862069e-06, + "loss": 1.9338, + "step": 100 + }, + { + "epoch": 0.20833333333333334, + "grad_norm": 2.378267526626587, + "learning_rate": 9.999793100349294e-06, + "loss": 1.9218, + "step": 120 + }, + { + "epoch": 0.24305555555555555, + "grad_norm": 2.6260263919830322, + "learning_rate": 9.987843743451796e-06, + "loss": 1.7895, + "step": 140 + }, + { + "epoch": 0.2777777777777778, + "grad_norm": 2.2361156940460205, + "learning_rate": 9.957553516178782e-06, + "loss": 1.7166, + "step": 160 + }, + { + "epoch": 0.3125, + "grad_norm": 2.345552682876587, + "learning_rate": 9.909033799150947e-06, + "loss": 1.7573, + "step": 180 + }, + { + "epoch": 0.3472222222222222, + "grad_norm": 2.4918200969696045, + "learning_rate": 9.842463004902127e-06, + "loss": 1.6668, + "step": 200 + }, + { + "epoch": 0.3819444444444444, + "grad_norm": 2.5107343196868896, + "learning_rate": 9.758085921836076e-06, + "loss": 1.6556, + "step": 220 + }, + { + "epoch": 0.4166666666666667, + "grad_norm": 2.69317626953125, + "learning_rate": 9.656212814111567e-06, + "loss": 1.6606, + "step": 240 + }, + { + "epoch": 0.4513888888888889, + "grad_norm": 2.759850025177002, + "learning_rate": 9.53721828076571e-06, + "loss": 1.6359, + "step": 260 + }, + { + "epoch": 0.4861111111111111, + "grad_norm": 2.751281976699829, + "learning_rate": 9.401539878270545e-06, + "loss": 1.635, + "step": 280 + }, + { + "epoch": 0.5208333333333334, + "grad_norm": 3.0062153339385986, + "learning_rate": 9.249676511588e-06, + "loss": 1.6278, + "step": 300 + }, + { + "epoch": 0.5555555555555556, + "grad_norm": 2.9671173095703125, + "learning_rate": 9.082186599639429e-06, + "loss": 1.6051, + "step": 320 + }, + { + "epoch": 0.5902777777777778, + "grad_norm": 2.6128034591674805, + "learning_rate": 8.899686021935554e-06, + "loss": 1.5921, + "step": 340 + }, + { + "epoch": 0.625, + "grad_norm": 2.750213384628296, + "learning_rate": 8.702845853917242e-06, + "loss": 1.5715, + "step": 360 + }, + { + "epoch": 0.6597222222222222, + "grad_norm": 2.4882044792175293, + "learning_rate": 8.492389899334572e-06, + "loss": 1.5607, + "step": 380 + }, + { + "epoch": 0.6944444444444444, + "grad_norm": 2.949469566345215, + "learning_rate": 8.269092028737885e-06, + "loss": 1.5498, + "step": 400 + }, + { + "epoch": 0.7291666666666666, + "grad_norm": 3.360396146774292, + "learning_rate": 8.033773333867498e-06, + "loss": 1.5246, + "step": 420 + }, + { + "epoch": 0.7638888888888888, + "grad_norm": 2.726001739501953, + "learning_rate": 7.78729910840572e-06, + "loss": 1.5172, + "step": 440 + }, + { + "epoch": 0.7986111111111112, + "grad_norm": 3.169776678085327, + "learning_rate": 7.530575666193283e-06, + "loss": 1.5212, + "step": 460 + }, + { + "epoch": 0.8333333333333334, + "grad_norm": 3.2836718559265137, + "learning_rate": 7.26454700860997e-06, + "loss": 1.5022, + "step": 480 + }, + { + "epoch": 0.8680555555555556, + "grad_norm": 3.3847920894622803, + "learning_rate": 6.990191353373876e-06, + "loss": 1.4968, + "step": 500 + }, + { + "epoch": 0.9027777777777778, + "grad_norm": 3.5661308765411377, + "learning_rate": 6.708517537523264e-06, + "loss": 1.477, + "step": 520 + }, + { + "epoch": 0.9375, + "grad_norm": 3.243346929550171, + "learning_rate": 6.420561307807713e-06, + "loss": 1.483, + "step": 540 + }, + { + "epoch": 0.9722222222222222, + "grad_norm": 2.8526790142059326, + "learning_rate": 6.12738151212918e-06, + "loss": 1.5018, + "step": 560 + }, + { + "epoch": 1.0069444444444444, + "grad_norm": 3.678152322769165, + "learning_rate": 5.830056206037482e-06, + "loss": 1.4604, + "step": 580 + }, + { + "epoch": 1.0416666666666667, + "grad_norm": 2.920789957046509, + "learning_rate": 5.529678688597081e-06, + "loss": 1.3984, + "step": 600 + }, + { + "epoch": 1.0763888888888888, + "grad_norm": 3.198030710220337, + "learning_rate": 5.2273534822017105e-06, + "loss": 1.4028, + "step": 620 + }, + { + "epoch": 1.1111111111111112, + "grad_norm": 3.737910270690918, + "learning_rate": 4.924192271119554e-06, + "loss": 1.3788, + "step": 640 + }, + { + "epoch": 1.1458333333333333, + "grad_norm": 2.9169039726257324, + "learning_rate": 4.621309813703385e-06, + "loss": 1.3787, + "step": 660 + }, + { + "epoch": 1.1805555555555556, + "grad_norm": 4.108018398284912, + "learning_rate": 4.319819843296952e-06, + "loss": 1.3854, + "step": 680 + }, + { + "epoch": 1.2152777777777777, + "grad_norm": 3.489570140838623, + "learning_rate": 4.020830972910433e-06, + "loss": 1.394, + "step": 700 + }, + { + "epoch": 1.25, + "grad_norm": 3.5733399391174316, + "learning_rate": 3.7254426187239567e-06, + "loss": 1.347, + "step": 720 + }, + { + "epoch": 1.2847222222222223, + "grad_norm": 3.479602098464966, + "learning_rate": 3.4347409574088896e-06, + "loss": 1.3647, + "step": 740 + }, + { + "epoch": 1.3194444444444444, + "grad_norm": 4.031429767608643, + "learning_rate": 3.149794932132331e-06, + "loss": 1.3879, + "step": 760 + }, + { + "epoch": 1.3541666666666667, + "grad_norm": 4.149319171905518, + "learning_rate": 2.871652321931161e-06, + "loss": 1.3618, + "step": 780 + }, + { + "epoch": 1.3888888888888888, + "grad_norm": 2.849364757537842, + "learning_rate": 2.601335888909005e-06, + "loss": 1.3687, + "step": 800 + }, + { + "epoch": 1.4236111111111112, + "grad_norm": 3.924811601638794, + "learning_rate": 2.339839617423318e-06, + "loss": 1.3329, + "step": 820 + }, + { + "epoch": 1.4583333333333333, + "grad_norm": 3.762462615966797, + "learning_rate": 2.0881250590915316e-06, + "loss": 1.3513, + "step": 840 + }, + { + "epoch": 1.4930555555555556, + "grad_norm": 3.951873302459717, + "learning_rate": 1.8471177970560712e-06, + "loss": 1.3655, + "step": 860 + }, + { + "epoch": 1.5277777777777777, + "grad_norm": 3.1432993412017822, + "learning_rate": 1.6177040425095664e-06, + "loss": 1.3276, + "step": 880 + }, + { + "epoch": 1.5625, + "grad_norm": 3.6409666538238525, + "learning_rate": 1.40072737599522e-06, + "loss": 1.3631, + "step": 900 + }, + { + "epoch": 1.5972222222222223, + "grad_norm": 3.062958002090454, + "learning_rate": 1.196985645464921e-06, + "loss": 1.3374, + "step": 920 + }, + { + "epoch": 1.6319444444444444, + "grad_norm": 4.230245590209961, + "learning_rate": 1.0072280325013185e-06, + "loss": 1.3438, + "step": 940 + }, + { + "epoch": 1.6666666666666665, + "grad_norm": 3.834761381149292, + "learning_rate": 8.321522974916968e-07, + "loss": 1.3611, + "step": 960 + }, + { + "epoch": 1.7013888888888888, + "grad_norm": 4.029264450073242, + "learning_rate": 6.724022138834341e-07, + "loss": 1.3323, + "step": 980 + }, + { + "epoch": 1.7361111111111112, + "grad_norm": 3.260033369064331, + "learning_rate": 5.285652009556075e-07, + "loss": 1.3273, + "step": 1000 + }, + { + "epoch": 1.7708333333333335, + "grad_norm": 4.1092071533203125, + "learning_rate": 4.0117016381130636e-07, + "loss": 1.3372, + "step": 1020 + }, + { + "epoch": 1.8055555555555556, + "grad_norm": 3.8922550678253174, + "learning_rate": 2.906855485332305e-07, + "loss": 1.3055, + "step": 1040 + }, + { + "epoch": 1.8402777777777777, + "grad_norm": 3.679527759552002, + "learning_rate": 1.975176196540185e-07, + "loss": 1.3342, + "step": 1060 + }, + { + "epoch": 1.875, + "grad_norm": 3.9715416431427, + "learning_rate": 1.2200896627521718e-07, + "loss": 1.3447, + "step": 1080 + }, + { + "epoch": 1.9097222222222223, + "grad_norm": 3.626037120819092, + "learning_rate": 6.443724232808146e-08, + "loss": 1.3219, + "step": 1100 + }, + { + "epoch": 1.9444444444444444, + "grad_norm": 4.019833564758301, + "learning_rate": 2.501414560839577e-08, + "loss": 1.2977, + "step": 1120 + }, + { + "epoch": 1.9791666666666665, + "grad_norm": 3.5683982372283936, + "learning_rate": 3.884639339534202e-09, + "loss": 1.3165, + "step": 1140 + } + ], + "logging_steps": 20, + "max_steps": 1152, + "num_input_tokens_seen": 0, + "num_train_epochs": 2, + "save_steps": 50, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.3405557230187315e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/checkpoint-1150/training_args.bin b/checkpoint-1150/training_args.bin new file mode 100644 index 0000000..b0a0b0d --- /dev/null +++ b/checkpoint-1150/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ab2a55d99d554b614e62a1cc2b43a5981feda7b0fbd4713a15efa9946f443ce9 +size 6033 diff --git a/checkpoint-150/README.md b/checkpoint-150/README.md new file mode 100644 index 0000000..bacf84a --- /dev/null +++ b/checkpoint-150/README.md @@ -0,0 +1,207 @@ +--- +base_model: biaofu-xmu/EAST-8B +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:biaofu-xmu/EAST-8B +- lora +- transformers +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.19.1 \ No newline at end of file diff --git a/checkpoint-150/adapter_config.json b/checkpoint-150/adapter_config.json new file mode 100644 index 0000000..44390c2 --- /dev/null +++ b/checkpoint-150/adapter_config.json @@ -0,0 +1,48 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "biaofu-xmu/EAST-8B", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.05, + "lora_ga_config": null, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.19.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "o_proj", + "k_proj", + "down_proj", + "q_proj", + "v_proj", + "up_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_bdlora": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/checkpoint-150/adapter_model.safetensors b/checkpoint-150/adapter_model.safetensors new file mode 100644 index 0000000..8b875a2 --- /dev/null +++ b/checkpoint-150/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:8d5bb17394114fd2e3b6408905151e8290a5233fe1e535b0a09a7aa07ca5956d +size 671149168 diff --git a/checkpoint-150/optimizer.pt b/checkpoint-150/optimizer.pt new file mode 100644 index 0000000..b6eba64 --- /dev/null +++ b/checkpoint-150/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:733abe40af43bfc45e0b9ecc0b756cea436949fac21e65d7ee117f886ffde940 +size 1342562339 diff --git a/checkpoint-150/rng_state.pth b/checkpoint-150/rng_state.pth new file mode 100644 index 0000000..0578329 --- /dev/null +++ b/checkpoint-150/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6459d6c16f31f4d8a16bdd17066e44622c40bb81997aa8632a5b0f0176826a68 +size 14645 diff --git a/checkpoint-150/scheduler.pt b/checkpoint-150/scheduler.pt new file mode 100644 index 0000000..9bc80d4 --- /dev/null +++ b/checkpoint-150/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7e5c3b1f4b3d2abec87ff5069b5d5df261c03ab9fab7ada1150395aac7685dc6 +size 1465 diff --git a/checkpoint-150/trainer_state.json b/checkpoint-150/trainer_state.json new file mode 100644 index 0000000..c08fdb9 --- /dev/null +++ b/checkpoint-150/trainer_state.json @@ -0,0 +1,83 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.2604166666666667, + "eval_steps": 500, + "global_step": 150, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.034722222222222224, + "grad_norm": 2.985321283340454, + "learning_rate": 1.6379310344827587e-06, + "loss": 2.6523, + "step": 20 + }, + { + "epoch": 0.06944444444444445, + "grad_norm": 2.353632926940918, + "learning_rate": 3.362068965517242e-06, + "loss": 2.4359, + "step": 40 + }, + { + "epoch": 0.10416666666666667, + "grad_norm": 1.865394115447998, + "learning_rate": 5.086206896551724e-06, + "loss": 2.2545, + "step": 60 + }, + { + "epoch": 0.1388888888888889, + "grad_norm": 1.8125933408737183, + "learning_rate": 6.810344827586207e-06, + "loss": 2.0557, + "step": 80 + }, + { + "epoch": 0.1736111111111111, + "grad_norm": 2.3572490215301514, + "learning_rate": 8.53448275862069e-06, + "loss": 1.9334, + "step": 100 + }, + { + "epoch": 0.20833333333333334, + "grad_norm": 2.395277261734009, + "learning_rate": 9.999793100349294e-06, + "loss": 1.9212, + "step": 120 + }, + { + "epoch": 0.24305555555555555, + "grad_norm": 2.714841604232788, + "learning_rate": 9.987843743451796e-06, + "loss": 1.7889, + "step": 140 + } + ], + "logging_steps": 20, + "max_steps": 1152, + "num_input_tokens_seen": 0, + "num_train_epochs": 2, + "save_steps": 50, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.049872287249203e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/checkpoint-150/training_args.bin b/checkpoint-150/training_args.bin new file mode 100644 index 0000000..925fd93 --- /dev/null +++ b/checkpoint-150/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3b7f58321eea14364587c280ddc055ad0a161fdb8a2e9d81351505baed73ddca +size 6033 diff --git a/checkpoint-200/README.md b/checkpoint-200/README.md new file mode 100644 index 0000000..bacf84a --- /dev/null +++ b/checkpoint-200/README.md @@ -0,0 +1,207 @@ +--- +base_model: biaofu-xmu/EAST-8B +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:biaofu-xmu/EAST-8B +- lora +- transformers +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.19.1 \ No newline at end of file diff --git a/checkpoint-200/adapter_config.json b/checkpoint-200/adapter_config.json new file mode 100644 index 0000000..44390c2 --- /dev/null +++ b/checkpoint-200/adapter_config.json @@ -0,0 +1,48 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "biaofu-xmu/EAST-8B", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.05, + "lora_ga_config": null, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.19.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "o_proj", + "k_proj", + "down_proj", + "q_proj", + "v_proj", + "up_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_bdlora": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/checkpoint-200/adapter_model.safetensors b/checkpoint-200/adapter_model.safetensors new file mode 100644 index 0000000..dedb762 --- /dev/null +++ b/checkpoint-200/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:720f483f0daafa4a3f2b06cdf2c10654684a043b9e1a38b9f261a7abc3c138f9 +size 671149168 diff --git a/checkpoint-200/optimizer.pt b/checkpoint-200/optimizer.pt new file mode 100644 index 0000000..fe1a1cd --- /dev/null +++ b/checkpoint-200/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:f4e645af312b97a7fb710d9f9582714049bf368a2363cf0ee9d89661b9ca5be8 +size 1342562339 diff --git a/checkpoint-200/rng_state.pth b/checkpoint-200/rng_state.pth new file mode 100644 index 0000000..c4e3af6 --- /dev/null +++ b/checkpoint-200/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d88dba6a2d8d7135f7a1e35a18c359edfa546ed30673afdaf8bd74636be443a6 +size 14645 diff --git a/checkpoint-200/scheduler.pt b/checkpoint-200/scheduler.pt new file mode 100644 index 0000000..fb2732f --- /dev/null +++ b/checkpoint-200/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:dacf44b20691c6fc535bf16b0ef4e66f3a5b3cb2170a2da905fbebeb4c5a46ff +size 1465 diff --git a/checkpoint-200/trainer_state.json b/checkpoint-200/trainer_state.json new file mode 100644 index 0000000..70b4e81 --- /dev/null +++ b/checkpoint-200/trainer_state.json @@ -0,0 +1,104 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.3472222222222222, + "eval_steps": 500, + "global_step": 200, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.034722222222222224, + "grad_norm": 2.985321283340454, + "learning_rate": 1.6379310344827587e-06, + "loss": 2.6523, + "step": 20 + }, + { + "epoch": 0.06944444444444445, + "grad_norm": 2.353632926940918, + "learning_rate": 3.362068965517242e-06, + "loss": 2.4359, + "step": 40 + }, + { + "epoch": 0.10416666666666667, + "grad_norm": 1.865394115447998, + "learning_rate": 5.086206896551724e-06, + "loss": 2.2545, + "step": 60 + }, + { + "epoch": 0.1388888888888889, + "grad_norm": 1.8125933408737183, + "learning_rate": 6.810344827586207e-06, + "loss": 2.0557, + "step": 80 + }, + { + "epoch": 0.1736111111111111, + "grad_norm": 2.3572490215301514, + "learning_rate": 8.53448275862069e-06, + "loss": 1.9334, + "step": 100 + }, + { + "epoch": 0.20833333333333334, + "grad_norm": 2.395277261734009, + "learning_rate": 9.999793100349294e-06, + "loss": 1.9212, + "step": 120 + }, + { + "epoch": 0.24305555555555555, + "grad_norm": 2.714841604232788, + "learning_rate": 9.987843743451796e-06, + "loss": 1.7889, + "step": 140 + }, + { + "epoch": 0.2777777777777778, + "grad_norm": 2.236692190170288, + "learning_rate": 9.957553516178782e-06, + "loss": 1.716, + "step": 160 + }, + { + "epoch": 0.3125, + "grad_norm": 2.3020412921905518, + "learning_rate": 9.909033799150947e-06, + "loss": 1.7569, + "step": 180 + }, + { + "epoch": 0.3472222222222222, + "grad_norm": 2.5109288692474365, + "learning_rate": 9.842463004902127e-06, + "loss": 1.6664, + "step": 200 + } + ], + "logging_steps": 20, + "max_steps": 1152, + "num_input_tokens_seen": 0, + "num_train_epochs": 2, + "save_steps": 50, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 4.089496844825395e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/checkpoint-200/training_args.bin b/checkpoint-200/training_args.bin new file mode 100644 index 0000000..925fd93 --- /dev/null +++ b/checkpoint-200/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3b7f58321eea14364587c280ddc055ad0a161fdb8a2e9d81351505baed73ddca +size 6033 diff --git a/checkpoint-250/README.md b/checkpoint-250/README.md new file mode 100644 index 0000000..bacf84a --- /dev/null +++ b/checkpoint-250/README.md @@ -0,0 +1,207 @@ +--- +base_model: biaofu-xmu/EAST-8B +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:biaofu-xmu/EAST-8B +- lora +- transformers +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.19.1 \ No newline at end of file diff --git a/checkpoint-250/adapter_config.json b/checkpoint-250/adapter_config.json new file mode 100644 index 0000000..44390c2 --- /dev/null +++ b/checkpoint-250/adapter_config.json @@ -0,0 +1,48 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "biaofu-xmu/EAST-8B", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.05, + "lora_ga_config": null, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.19.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "o_proj", + "k_proj", + "down_proj", + "q_proj", + "v_proj", + "up_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_bdlora": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/checkpoint-250/adapter_model.safetensors b/checkpoint-250/adapter_model.safetensors new file mode 100644 index 0000000..a428e14 --- /dev/null +++ b/checkpoint-250/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:f28708dcccceac93a802f215f543cc0d44b2e943afe1eb9d87f60315018bd499 +size 671149168 diff --git a/checkpoint-250/optimizer.pt b/checkpoint-250/optimizer.pt new file mode 100644 index 0000000..1d59388 --- /dev/null +++ b/checkpoint-250/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:a2589b983afe0f8808d96b1c76a79b017af4a9cb2df4f6aa9630d39b65657738 +size 1342562339 diff --git a/checkpoint-250/rng_state.pth b/checkpoint-250/rng_state.pth new file mode 100644 index 0000000..096480a --- /dev/null +++ b/checkpoint-250/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c50c5a52233c6354c2103eba4b740346d2fdd61640e143f5f38881a8f97c7f59 +size 14645 diff --git a/checkpoint-250/scheduler.pt b/checkpoint-250/scheduler.pt new file mode 100644 index 0000000..59e9fe4 --- /dev/null +++ b/checkpoint-250/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:12bc768c5ceac0892205b61d77c6800d899da633a32337206aa415df9749b66a +size 1465 diff --git a/checkpoint-250/trainer_state.json b/checkpoint-250/trainer_state.json new file mode 100644 index 0000000..1a9c64e --- /dev/null +++ b/checkpoint-250/trainer_state.json @@ -0,0 +1,118 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.4340277777777778, + "eval_steps": 500, + "global_step": 250, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.034722222222222224, + "grad_norm": 2.985321283340454, + "learning_rate": 1.6379310344827587e-06, + "loss": 2.6523, + "step": 20 + }, + { + "epoch": 0.06944444444444445, + "grad_norm": 2.353632926940918, + "learning_rate": 3.362068965517242e-06, + "loss": 2.4359, + "step": 40 + }, + { + "epoch": 0.10416666666666667, + "grad_norm": 1.865394115447998, + "learning_rate": 5.086206896551724e-06, + "loss": 2.2545, + "step": 60 + }, + { + "epoch": 0.1388888888888889, + "grad_norm": 1.8125933408737183, + "learning_rate": 6.810344827586207e-06, + "loss": 2.0557, + "step": 80 + }, + { + "epoch": 0.1736111111111111, + "grad_norm": 2.3572490215301514, + "learning_rate": 8.53448275862069e-06, + "loss": 1.9334, + "step": 100 + }, + { + "epoch": 0.20833333333333334, + "grad_norm": 2.395277261734009, + "learning_rate": 9.999793100349294e-06, + "loss": 1.9212, + "step": 120 + }, + { + "epoch": 0.24305555555555555, + "grad_norm": 2.714841604232788, + "learning_rate": 9.987843743451796e-06, + "loss": 1.7889, + "step": 140 + }, + { + "epoch": 0.2777777777777778, + "grad_norm": 2.236692190170288, + "learning_rate": 9.957553516178782e-06, + "loss": 1.716, + "step": 160 + }, + { + "epoch": 0.3125, + "grad_norm": 2.3020412921905518, + "learning_rate": 9.909033799150947e-06, + "loss": 1.7569, + "step": 180 + }, + { + "epoch": 0.3472222222222222, + "grad_norm": 2.5109288692474365, + "learning_rate": 9.842463004902127e-06, + "loss": 1.6664, + "step": 200 + }, + { + "epoch": 0.3819444444444444, + "grad_norm": 2.5140888690948486, + "learning_rate": 9.758085921836076e-06, + "loss": 1.6544, + "step": 220 + }, + { + "epoch": 0.4166666666666667, + "grad_norm": 2.666377544403076, + "learning_rate": 9.656212814111567e-06, + "loss": 1.6608, + "step": 240 + } + ], + "logging_steps": 20, + "max_steps": 1152, + "num_input_tokens_seen": 0, + "num_train_epochs": 2, + "save_steps": 50, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 5.104113694507008e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/checkpoint-250/training_args.bin b/checkpoint-250/training_args.bin new file mode 100644 index 0000000..925fd93 --- /dev/null +++ b/checkpoint-250/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3b7f58321eea14364587c280ddc055ad0a161fdb8a2e9d81351505baed73ddca +size 6033 diff --git a/checkpoint-300/README.md b/checkpoint-300/README.md new file mode 100644 index 0000000..bacf84a --- /dev/null +++ b/checkpoint-300/README.md @@ -0,0 +1,207 @@ +--- +base_model: biaofu-xmu/EAST-8B +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:biaofu-xmu/EAST-8B +- lora +- transformers +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.19.1 \ No newline at end of file diff --git a/checkpoint-300/adapter_config.json b/checkpoint-300/adapter_config.json new file mode 100644 index 0000000..44390c2 --- /dev/null +++ b/checkpoint-300/adapter_config.json @@ -0,0 +1,48 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "biaofu-xmu/EAST-8B", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.05, + "lora_ga_config": null, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.19.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "o_proj", + "k_proj", + "down_proj", + "q_proj", + "v_proj", + "up_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_bdlora": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/checkpoint-300/adapter_model.safetensors b/checkpoint-300/adapter_model.safetensors new file mode 100644 index 0000000..9fe7e99 --- /dev/null +++ b/checkpoint-300/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c61f29d2c66b425d30b692f5931f827170c86ace481f4294327b368024934eb5 +size 671149168 diff --git a/checkpoint-300/optimizer.pt b/checkpoint-300/optimizer.pt new file mode 100644 index 0000000..ca09245 --- /dev/null +++ b/checkpoint-300/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:1b6106bb50c7b8ad73c7ad4c49698d158ee9e502587abe7b34ffac3b0ffa4e37 +size 1342562339 diff --git a/checkpoint-300/rng_state.pth b/checkpoint-300/rng_state.pth new file mode 100644 index 0000000..c2bcdb1 --- /dev/null +++ b/checkpoint-300/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4a1e92af4a930123dd1ad05f528fa49ef6a6fe3970cf2c6358fd4a5a8c9bb28a +size 14645 diff --git a/checkpoint-300/scheduler.pt b/checkpoint-300/scheduler.pt new file mode 100644 index 0000000..a782478 --- /dev/null +++ b/checkpoint-300/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:8011544f8969ccf121f310e7c9677b774202f770f03769833c73ecbfadde40a4 +size 1465 diff --git a/checkpoint-300/trainer_state.json b/checkpoint-300/trainer_state.json new file mode 100644 index 0000000..8eb2bab --- /dev/null +++ b/checkpoint-300/trainer_state.json @@ -0,0 +1,139 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.5208333333333334, + "eval_steps": 500, + "global_step": 300, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.034722222222222224, + "grad_norm": 2.985321283340454, + "learning_rate": 1.6379310344827587e-06, + "loss": 2.6523, + "step": 20 + }, + { + "epoch": 0.06944444444444445, + "grad_norm": 2.353632926940918, + "learning_rate": 3.362068965517242e-06, + "loss": 2.4359, + "step": 40 + }, + { + "epoch": 0.10416666666666667, + "grad_norm": 1.865394115447998, + "learning_rate": 5.086206896551724e-06, + "loss": 2.2545, + "step": 60 + }, + { + "epoch": 0.1388888888888889, + "grad_norm": 1.8125933408737183, + "learning_rate": 6.810344827586207e-06, + "loss": 2.0557, + "step": 80 + }, + { + "epoch": 0.1736111111111111, + "grad_norm": 2.3572490215301514, + "learning_rate": 8.53448275862069e-06, + "loss": 1.9334, + "step": 100 + }, + { + "epoch": 0.20833333333333334, + "grad_norm": 2.395277261734009, + "learning_rate": 9.999793100349294e-06, + "loss": 1.9212, + "step": 120 + }, + { + "epoch": 0.24305555555555555, + "grad_norm": 2.714841604232788, + "learning_rate": 9.987843743451796e-06, + "loss": 1.7889, + "step": 140 + }, + { + "epoch": 0.2777777777777778, + "grad_norm": 2.236692190170288, + "learning_rate": 9.957553516178782e-06, + "loss": 1.716, + "step": 160 + }, + { + "epoch": 0.3125, + "grad_norm": 2.3020412921905518, + "learning_rate": 9.909033799150947e-06, + "loss": 1.7569, + "step": 180 + }, + { + "epoch": 0.3472222222222222, + "grad_norm": 2.5109288692474365, + "learning_rate": 9.842463004902127e-06, + "loss": 1.6664, + "step": 200 + }, + { + "epoch": 0.3819444444444444, + "grad_norm": 2.5140888690948486, + "learning_rate": 9.758085921836076e-06, + "loss": 1.6544, + "step": 220 + }, + { + "epoch": 0.4166666666666667, + "grad_norm": 2.666377544403076, + "learning_rate": 9.656212814111567e-06, + "loss": 1.6608, + "step": 240 + }, + { + "epoch": 0.4513888888888889, + "grad_norm": 2.715240955352783, + "learning_rate": 9.53721828076571e-06, + "loss": 1.6353, + "step": 260 + }, + { + "epoch": 0.4861111111111111, + "grad_norm": 2.7697439193725586, + "learning_rate": 9.401539878270545e-06, + "loss": 1.6352, + "step": 280 + }, + { + "epoch": 0.5208333333333334, + "grad_norm": 2.9743459224700928, + "learning_rate": 9.249676511588e-06, + "loss": 1.6275, + "step": 300 + } + ], + "logging_steps": 20, + "max_steps": 1152, + "num_input_tokens_seen": 0, + "num_train_epochs": 2, + "save_steps": 50, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 6.104440425391718e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/checkpoint-300/training_args.bin b/checkpoint-300/training_args.bin new file mode 100644 index 0000000..925fd93 --- /dev/null +++ b/checkpoint-300/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3b7f58321eea14364587c280ddc055ad0a161fdb8a2e9d81351505baed73ddca +size 6033 diff --git a/checkpoint-350/README.md b/checkpoint-350/README.md new file mode 100644 index 0000000..bacf84a --- /dev/null +++ b/checkpoint-350/README.md @@ -0,0 +1,207 @@ +--- +base_model: biaofu-xmu/EAST-8B +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:biaofu-xmu/EAST-8B +- lora +- transformers +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.19.1 \ No newline at end of file diff --git a/checkpoint-350/adapter_config.json b/checkpoint-350/adapter_config.json new file mode 100644 index 0000000..44390c2 --- /dev/null +++ b/checkpoint-350/adapter_config.json @@ -0,0 +1,48 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "biaofu-xmu/EAST-8B", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.05, + "lora_ga_config": null, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.19.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "o_proj", + "k_proj", + "down_proj", + "q_proj", + "v_proj", + "up_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_bdlora": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/checkpoint-350/adapter_model.safetensors b/checkpoint-350/adapter_model.safetensors new file mode 100644 index 0000000..d0bbf87 --- /dev/null +++ b/checkpoint-350/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:5733e48aa6bd717c588dae4e4871eb62416e096ed8c721416b51938ed611f274 +size 671149168 diff --git a/checkpoint-350/optimizer.pt b/checkpoint-350/optimizer.pt new file mode 100644 index 0000000..ac04dee --- /dev/null +++ b/checkpoint-350/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0356854a9edab5cff7e7c3f0472581ecf9ec8bde7721020c9d2350cae9c6e421 +size 1342562339 diff --git a/checkpoint-350/rng_state.pth b/checkpoint-350/rng_state.pth new file mode 100644 index 0000000..9a28fac --- /dev/null +++ b/checkpoint-350/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0b808c9a244adbf5676c08879185a7f084fcbffa8a22220d89b64cc6310eca05 +size 14645 diff --git a/checkpoint-350/scheduler.pt b/checkpoint-350/scheduler.pt new file mode 100644 index 0000000..144e670 --- /dev/null +++ b/checkpoint-350/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2a6d13f122fa4e9259c6cf2ccd0d4a831e7733be6388a9b01a859d975eb74082 +size 1465 diff --git a/checkpoint-350/trainer_state.json b/checkpoint-350/trainer_state.json new file mode 100644 index 0000000..b2c1259 --- /dev/null +++ b/checkpoint-350/trainer_state.json @@ -0,0 +1,153 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.6076388888888888, + "eval_steps": 500, + "global_step": 350, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.034722222222222224, + "grad_norm": 2.985321283340454, + "learning_rate": 1.6379310344827587e-06, + "loss": 2.6523, + "step": 20 + }, + { + "epoch": 0.06944444444444445, + "grad_norm": 2.353632926940918, + "learning_rate": 3.362068965517242e-06, + "loss": 2.4359, + "step": 40 + }, + { + "epoch": 0.10416666666666667, + "grad_norm": 1.865394115447998, + "learning_rate": 5.086206896551724e-06, + "loss": 2.2545, + "step": 60 + }, + { + "epoch": 0.1388888888888889, + "grad_norm": 1.8125933408737183, + "learning_rate": 6.810344827586207e-06, + "loss": 2.0557, + "step": 80 + }, + { + "epoch": 0.1736111111111111, + "grad_norm": 2.3572490215301514, + "learning_rate": 8.53448275862069e-06, + "loss": 1.9334, + "step": 100 + }, + { + "epoch": 0.20833333333333334, + "grad_norm": 2.395277261734009, + "learning_rate": 9.999793100349294e-06, + "loss": 1.9212, + "step": 120 + }, + { + "epoch": 0.24305555555555555, + "grad_norm": 2.714841604232788, + "learning_rate": 9.987843743451796e-06, + "loss": 1.7889, + "step": 140 + }, + { + "epoch": 0.2777777777777778, + "grad_norm": 2.236692190170288, + "learning_rate": 9.957553516178782e-06, + "loss": 1.716, + "step": 160 + }, + { + "epoch": 0.3125, + "grad_norm": 2.3020412921905518, + "learning_rate": 9.909033799150947e-06, + "loss": 1.7569, + "step": 180 + }, + { + "epoch": 0.3472222222222222, + "grad_norm": 2.5109288692474365, + "learning_rate": 9.842463004902127e-06, + "loss": 1.6664, + "step": 200 + }, + { + "epoch": 0.3819444444444444, + "grad_norm": 2.5140888690948486, + "learning_rate": 9.758085921836076e-06, + "loss": 1.6544, + "step": 220 + }, + { + "epoch": 0.4166666666666667, + "grad_norm": 2.666377544403076, + "learning_rate": 9.656212814111567e-06, + "loss": 1.6608, + "step": 240 + }, + { + "epoch": 0.4513888888888889, + "grad_norm": 2.715240955352783, + "learning_rate": 9.53721828076571e-06, + "loss": 1.6353, + "step": 260 + }, + { + "epoch": 0.4861111111111111, + "grad_norm": 2.7697439193725586, + "learning_rate": 9.401539878270545e-06, + "loss": 1.6352, + "step": 280 + }, + { + "epoch": 0.5208333333333334, + "grad_norm": 2.9743459224700928, + "learning_rate": 9.249676511588e-06, + "loss": 1.6275, + "step": 300 + }, + { + "epoch": 0.5555555555555556, + "grad_norm": 2.955244541168213, + "learning_rate": 9.082186599639429e-06, + "loss": 1.6052, + "step": 320 + }, + { + "epoch": 0.5902777777777778, + "grad_norm": 2.6228716373443604, + "learning_rate": 8.899686021935554e-06, + "loss": 1.5924, + "step": 340 + } + ], + "logging_steps": 20, + "max_steps": 1152, + "num_input_tokens_seen": 0, + "num_train_epochs": 2, + "save_steps": 50, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 7.105319609322701e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/checkpoint-350/training_args.bin b/checkpoint-350/training_args.bin new file mode 100644 index 0000000..925fd93 --- /dev/null +++ b/checkpoint-350/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3b7f58321eea14364587c280ddc055ad0a161fdb8a2e9d81351505baed73ddca +size 6033 diff --git a/checkpoint-400/README.md b/checkpoint-400/README.md new file mode 100644 index 0000000..bacf84a --- /dev/null +++ b/checkpoint-400/README.md @@ -0,0 +1,207 @@ +--- +base_model: biaofu-xmu/EAST-8B +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:biaofu-xmu/EAST-8B +- lora +- transformers +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.19.1 \ No newline at end of file diff --git a/checkpoint-400/adapter_config.json b/checkpoint-400/adapter_config.json new file mode 100644 index 0000000..44390c2 --- /dev/null +++ b/checkpoint-400/adapter_config.json @@ -0,0 +1,48 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "biaofu-xmu/EAST-8B", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.05, + "lora_ga_config": null, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.19.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "o_proj", + "k_proj", + "down_proj", + "q_proj", + "v_proj", + "up_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_bdlora": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/checkpoint-400/adapter_model.safetensors b/checkpoint-400/adapter_model.safetensors new file mode 100644 index 0000000..dd551f6 --- /dev/null +++ b/checkpoint-400/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:810d6491bc2d6eb6ab526a40f0001a5bbe36a1f3e7a0334007dac0d755838a17 +size 671149168 diff --git a/checkpoint-400/optimizer.pt b/checkpoint-400/optimizer.pt new file mode 100644 index 0000000..5165b91 --- /dev/null +++ b/checkpoint-400/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0083de48147d06f3808c4361a55d86ab9ba7c6c6a180383622fdeb7fecccfee6 +size 1342562339 diff --git a/checkpoint-400/rng_state.pth b/checkpoint-400/rng_state.pth new file mode 100644 index 0000000..568ac1b --- /dev/null +++ b/checkpoint-400/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:659ac346bbe782cc1dfd0935e5499a14aa28ff41ee1deeebe21f2886be5fbe62 +size 14645 diff --git a/checkpoint-400/scheduler.pt b/checkpoint-400/scheduler.pt new file mode 100644 index 0000000..fe9d5cc --- /dev/null +++ b/checkpoint-400/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:20cc7f2c390b57e07da00163d66a7f2ae7ece3e78a62f304c58c0f81ef0baa87 +size 1465 diff --git a/checkpoint-400/trainer_state.json b/checkpoint-400/trainer_state.json new file mode 100644 index 0000000..7f91181 --- /dev/null +++ b/checkpoint-400/trainer_state.json @@ -0,0 +1,174 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.6944444444444444, + "eval_steps": 500, + "global_step": 400, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.034722222222222224, + "grad_norm": 2.985321283340454, + "learning_rate": 1.6379310344827587e-06, + "loss": 2.6523, + "step": 20 + }, + { + "epoch": 0.06944444444444445, + "grad_norm": 2.353632926940918, + "learning_rate": 3.362068965517242e-06, + "loss": 2.4359, + "step": 40 + }, + { + "epoch": 0.10416666666666667, + "grad_norm": 1.865394115447998, + "learning_rate": 5.086206896551724e-06, + "loss": 2.2545, + "step": 60 + }, + { + "epoch": 0.1388888888888889, + "grad_norm": 1.8125933408737183, + "learning_rate": 6.810344827586207e-06, + "loss": 2.0557, + "step": 80 + }, + { + "epoch": 0.1736111111111111, + "grad_norm": 2.3572490215301514, + "learning_rate": 8.53448275862069e-06, + "loss": 1.9334, + "step": 100 + }, + { + "epoch": 0.20833333333333334, + "grad_norm": 2.395277261734009, + "learning_rate": 9.999793100349294e-06, + "loss": 1.9212, + "step": 120 + }, + { + "epoch": 0.24305555555555555, + "grad_norm": 2.714841604232788, + "learning_rate": 9.987843743451796e-06, + "loss": 1.7889, + "step": 140 + }, + { + "epoch": 0.2777777777777778, + "grad_norm": 2.236692190170288, + "learning_rate": 9.957553516178782e-06, + "loss": 1.716, + "step": 160 + }, + { + "epoch": 0.3125, + "grad_norm": 2.3020412921905518, + "learning_rate": 9.909033799150947e-06, + "loss": 1.7569, + "step": 180 + }, + { + "epoch": 0.3472222222222222, + "grad_norm": 2.5109288692474365, + "learning_rate": 9.842463004902127e-06, + "loss": 1.6664, + "step": 200 + }, + { + "epoch": 0.3819444444444444, + "grad_norm": 2.5140888690948486, + "learning_rate": 9.758085921836076e-06, + "loss": 1.6544, + "step": 220 + }, + { + "epoch": 0.4166666666666667, + "grad_norm": 2.666377544403076, + "learning_rate": 9.656212814111567e-06, + "loss": 1.6608, + "step": 240 + }, + { + "epoch": 0.4513888888888889, + "grad_norm": 2.715240955352783, + "learning_rate": 9.53721828076571e-06, + "loss": 1.6353, + "step": 260 + }, + { + "epoch": 0.4861111111111111, + "grad_norm": 2.7697439193725586, + "learning_rate": 9.401539878270545e-06, + "loss": 1.6352, + "step": 280 + }, + { + "epoch": 0.5208333333333334, + "grad_norm": 2.9743459224700928, + "learning_rate": 9.249676511588e-06, + "loss": 1.6275, + "step": 300 + }, + { + "epoch": 0.5555555555555556, + "grad_norm": 2.955244541168213, + "learning_rate": 9.082186599639429e-06, + "loss": 1.6052, + "step": 320 + }, + { + "epoch": 0.5902777777777778, + "grad_norm": 2.6228716373443604, + "learning_rate": 8.899686021935554e-06, + "loss": 1.5924, + "step": 340 + }, + { + "epoch": 0.625, + "grad_norm": 2.7822635173797607, + "learning_rate": 8.702845853917242e-06, + "loss": 1.5711, + "step": 360 + }, + { + "epoch": 0.6597222222222222, + "grad_norm": 2.450777769088745, + "learning_rate": 8.492389899334572e-06, + "loss": 1.5601, + "step": 380 + }, + { + "epoch": 0.6944444444444444, + "grad_norm": 2.999849557876587, + "learning_rate": 8.269092028737885e-06, + "loss": 1.5497, + "step": 400 + } + ], + "logging_steps": 20, + "max_steps": 1152, + "num_input_tokens_seen": 0, + "num_train_epochs": 2, + "save_steps": 50, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 8.118408005576294e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/checkpoint-400/training_args.bin b/checkpoint-400/training_args.bin new file mode 100644 index 0000000..925fd93 --- /dev/null +++ b/checkpoint-400/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3b7f58321eea14364587c280ddc055ad0a161fdb8a2e9d81351505baed73ddca +size 6033 diff --git a/checkpoint-450/README.md b/checkpoint-450/README.md new file mode 100644 index 0000000..bacf84a --- /dev/null +++ b/checkpoint-450/README.md @@ -0,0 +1,207 @@ +--- +base_model: biaofu-xmu/EAST-8B +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:biaofu-xmu/EAST-8B +- lora +- transformers +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.19.1 \ No newline at end of file diff --git a/checkpoint-450/adapter_config.json b/checkpoint-450/adapter_config.json new file mode 100644 index 0000000..44390c2 --- /dev/null +++ b/checkpoint-450/adapter_config.json @@ -0,0 +1,48 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "biaofu-xmu/EAST-8B", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.05, + "lora_ga_config": null, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.19.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "o_proj", + "k_proj", + "down_proj", + "q_proj", + "v_proj", + "up_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_bdlora": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/checkpoint-450/adapter_model.safetensors b/checkpoint-450/adapter_model.safetensors new file mode 100644 index 0000000..f2ee7ec --- /dev/null +++ b/checkpoint-450/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4a5b08905d3c150b486abdc27cb62e1cda6d5143e50223de78ccceef218fdcd0 +size 671149168 diff --git a/checkpoint-450/optimizer.pt b/checkpoint-450/optimizer.pt new file mode 100644 index 0000000..195ff6c --- /dev/null +++ b/checkpoint-450/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:89b803503cddbfcfd670ffef25c55fbeed49ac2a47e66a519e804429732df183 +size 1342562339 diff --git a/checkpoint-450/rng_state.pth b/checkpoint-450/rng_state.pth new file mode 100644 index 0000000..9789aae --- /dev/null +++ b/checkpoint-450/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:f2b6a31564a37d218d460384db14d15527aee6f63440019bb66080c990a382a2 +size 14645 diff --git a/checkpoint-450/scheduler.pt b/checkpoint-450/scheduler.pt new file mode 100644 index 0000000..4b1258a --- /dev/null +++ b/checkpoint-450/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:384bc6e7c7dc78761d777acc2ec342f72b87fe7d2483bfdf597b557007de8a7d +size 1465 diff --git a/checkpoint-450/trainer_state.json b/checkpoint-450/trainer_state.json new file mode 100644 index 0000000..21811e0 --- /dev/null +++ b/checkpoint-450/trainer_state.json @@ -0,0 +1,188 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.78125, + "eval_steps": 500, + "global_step": 450, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.034722222222222224, + "grad_norm": 2.985321283340454, + "learning_rate": 1.6379310344827587e-06, + "loss": 2.6523, + "step": 20 + }, + { + "epoch": 0.06944444444444445, + "grad_norm": 2.353632926940918, + "learning_rate": 3.362068965517242e-06, + "loss": 2.4359, + "step": 40 + }, + { + "epoch": 0.10416666666666667, + "grad_norm": 1.865394115447998, + "learning_rate": 5.086206896551724e-06, + "loss": 2.2545, + "step": 60 + }, + { + "epoch": 0.1388888888888889, + "grad_norm": 1.8125933408737183, + "learning_rate": 6.810344827586207e-06, + "loss": 2.0557, + "step": 80 + }, + { + "epoch": 0.1736111111111111, + "grad_norm": 2.3572490215301514, + "learning_rate": 8.53448275862069e-06, + "loss": 1.9334, + "step": 100 + }, + { + "epoch": 0.20833333333333334, + "grad_norm": 2.395277261734009, + "learning_rate": 9.999793100349294e-06, + "loss": 1.9212, + "step": 120 + }, + { + "epoch": 0.24305555555555555, + "grad_norm": 2.714841604232788, + "learning_rate": 9.987843743451796e-06, + "loss": 1.7889, + "step": 140 + }, + { + "epoch": 0.2777777777777778, + "grad_norm": 2.236692190170288, + "learning_rate": 9.957553516178782e-06, + "loss": 1.716, + "step": 160 + }, + { + "epoch": 0.3125, + "grad_norm": 2.3020412921905518, + "learning_rate": 9.909033799150947e-06, + "loss": 1.7569, + "step": 180 + }, + { + "epoch": 0.3472222222222222, + "grad_norm": 2.5109288692474365, + "learning_rate": 9.842463004902127e-06, + "loss": 1.6664, + "step": 200 + }, + { + "epoch": 0.3819444444444444, + "grad_norm": 2.5140888690948486, + "learning_rate": 9.758085921836076e-06, + "loss": 1.6544, + "step": 220 + }, + { + "epoch": 0.4166666666666667, + "grad_norm": 2.666377544403076, + "learning_rate": 9.656212814111567e-06, + "loss": 1.6608, + "step": 240 + }, + { + "epoch": 0.4513888888888889, + "grad_norm": 2.715240955352783, + "learning_rate": 9.53721828076571e-06, + "loss": 1.6353, + "step": 260 + }, + { + "epoch": 0.4861111111111111, + "grad_norm": 2.7697439193725586, + "learning_rate": 9.401539878270545e-06, + "loss": 1.6352, + "step": 280 + }, + { + "epoch": 0.5208333333333334, + "grad_norm": 2.9743459224700928, + "learning_rate": 9.249676511588e-06, + "loss": 1.6275, + "step": 300 + }, + { + "epoch": 0.5555555555555556, + "grad_norm": 2.955244541168213, + "learning_rate": 9.082186599639429e-06, + "loss": 1.6052, + "step": 320 + }, + { + "epoch": 0.5902777777777778, + "grad_norm": 2.6228716373443604, + "learning_rate": 8.899686021935554e-06, + "loss": 1.5924, + "step": 340 + }, + { + "epoch": 0.625, + "grad_norm": 2.7822635173797607, + "learning_rate": 8.702845853917242e-06, + "loss": 1.5711, + "step": 360 + }, + { + "epoch": 0.6597222222222222, + "grad_norm": 2.450777769088745, + "learning_rate": 8.492389899334572e-06, + "loss": 1.5601, + "step": 380 + }, + { + "epoch": 0.6944444444444444, + "grad_norm": 2.999849557876587, + "learning_rate": 8.269092028737885e-06, + "loss": 1.5497, + "step": 400 + }, + { + "epoch": 0.7291666666666666, + "grad_norm": 3.2980637550354004, + "learning_rate": 8.033773333867498e-06, + "loss": 1.5243, + "step": 420 + }, + { + "epoch": 0.7638888888888888, + "grad_norm": 2.758843421936035, + "learning_rate": 7.78729910840572e-06, + "loss": 1.5171, + "step": 440 + } + ], + "logging_steps": 20, + "max_steps": 1152, + "num_input_tokens_seen": 0, + "num_train_epochs": 2, + "save_steps": 50, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 9.13173579814994e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/checkpoint-450/training_args.bin b/checkpoint-450/training_args.bin new file mode 100644 index 0000000..925fd93 --- /dev/null +++ b/checkpoint-450/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3b7f58321eea14364587c280ddc055ad0a161fdb8a2e9d81351505baed73ddca +size 6033 diff --git a/checkpoint-50/README.md b/checkpoint-50/README.md new file mode 100644 index 0000000..bacf84a --- /dev/null +++ b/checkpoint-50/README.md @@ -0,0 +1,207 @@ +--- +base_model: biaofu-xmu/EAST-8B +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:biaofu-xmu/EAST-8B +- lora +- transformers +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.19.1 \ No newline at end of file diff --git a/checkpoint-50/adapter_config.json b/checkpoint-50/adapter_config.json new file mode 100644 index 0000000..44390c2 --- /dev/null +++ b/checkpoint-50/adapter_config.json @@ -0,0 +1,48 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "biaofu-xmu/EAST-8B", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.05, + "lora_ga_config": null, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.19.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "o_proj", + "k_proj", + "down_proj", + "q_proj", + "v_proj", + "up_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_bdlora": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/checkpoint-50/adapter_model.safetensors b/checkpoint-50/adapter_model.safetensors new file mode 100644 index 0000000..f375941 --- /dev/null +++ b/checkpoint-50/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c7207365fbc020be1d6f12897a167455c2ca956beecb8a497fc64c8af2abbf26 +size 671149168 diff --git a/checkpoint-50/optimizer.pt b/checkpoint-50/optimizer.pt new file mode 100644 index 0000000..6eb206f --- /dev/null +++ b/checkpoint-50/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:9c6ae9dd4142bb14ed5fb45115293923a4efb57810a376acdd073e2d39153cd0 +size 1342562339 diff --git a/checkpoint-50/rng_state.pth b/checkpoint-50/rng_state.pth new file mode 100644 index 0000000..49d9842 --- /dev/null +++ b/checkpoint-50/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2b538287e12b1cffb7875c4b9577f1144c05c03e0d4fb9b49e88da551161ad1c +size 14645 diff --git a/checkpoint-50/scheduler.pt b/checkpoint-50/scheduler.pt new file mode 100644 index 0000000..1365fdd --- /dev/null +++ b/checkpoint-50/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:429753af91844c8e723460e500b16300ef22bee5be6ffdf96a0f5e7a4101ca3a +size 1465 diff --git a/checkpoint-50/trainer_state.json b/checkpoint-50/trainer_state.json new file mode 100644 index 0000000..8bea26e --- /dev/null +++ b/checkpoint-50/trainer_state.json @@ -0,0 +1,48 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.08680555555555555, + "eval_steps": 500, + "global_step": 50, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.034722222222222224, + "grad_norm": 2.985321283340454, + "learning_rate": 1.6379310344827587e-06, + "loss": 2.6523, + "step": 20 + }, + { + "epoch": 0.06944444444444445, + "grad_norm": 2.353632926940918, + "learning_rate": 3.362068965517242e-06, + "loss": 2.4359, + "step": 40 + } + ], + "logging_steps": 20, + "max_steps": 1152, + "num_input_tokens_seen": 0, + "num_train_epochs": 2, + "save_steps": 50, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.0097368477728768e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/checkpoint-50/training_args.bin b/checkpoint-50/training_args.bin new file mode 100644 index 0000000..925fd93 --- /dev/null +++ b/checkpoint-50/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3b7f58321eea14364587c280ddc055ad0a161fdb8a2e9d81351505baed73ddca +size 6033 diff --git a/checkpoint-500/README.md b/checkpoint-500/README.md new file mode 100644 index 0000000..bacf84a --- /dev/null +++ b/checkpoint-500/README.md @@ -0,0 +1,207 @@ +--- +base_model: biaofu-xmu/EAST-8B +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:biaofu-xmu/EAST-8B +- lora +- transformers +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.19.1 \ No newline at end of file diff --git a/checkpoint-500/adapter_config.json b/checkpoint-500/adapter_config.json new file mode 100644 index 0000000..44390c2 --- /dev/null +++ b/checkpoint-500/adapter_config.json @@ -0,0 +1,48 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "biaofu-xmu/EAST-8B", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.05, + "lora_ga_config": null, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.19.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "o_proj", + "k_proj", + "down_proj", + "q_proj", + "v_proj", + "up_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_bdlora": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/checkpoint-500/adapter_model.safetensors b/checkpoint-500/adapter_model.safetensors new file mode 100644 index 0000000..c142dac --- /dev/null +++ b/checkpoint-500/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2d5eec41396abac4729a51bf1b484ddd8f5239f2d62d81abc55eb5921b30d98b +size 671149168 diff --git a/checkpoint-500/optimizer.pt b/checkpoint-500/optimizer.pt new file mode 100644 index 0000000..eed71d1 --- /dev/null +++ b/checkpoint-500/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7087e14d597e195f40df0226a102133771e19b4a9b5944af4658655cadef3510 +size 1342562339 diff --git a/checkpoint-500/rng_state.pth b/checkpoint-500/rng_state.pth new file mode 100644 index 0000000..d028e1b --- /dev/null +++ b/checkpoint-500/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:885dc23e508a6c5936781dc5561ec0fbb841e1d4720d730ca8beafd9c96b0ad6 +size 14645 diff --git a/checkpoint-500/scheduler.pt b/checkpoint-500/scheduler.pt new file mode 100644 index 0000000..f14c49a --- /dev/null +++ b/checkpoint-500/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:56d00b3dceef9b6f5ecba6ca112aac49209cb479316e5bd5c0651dae9c1ba9b3 +size 1465 diff --git a/checkpoint-500/trainer_state.json b/checkpoint-500/trainer_state.json new file mode 100644 index 0000000..171544a --- /dev/null +++ b/checkpoint-500/trainer_state.json @@ -0,0 +1,209 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.8680555555555556, + "eval_steps": 500, + "global_step": 500, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.034722222222222224, + "grad_norm": 2.985321283340454, + "learning_rate": 1.6379310344827587e-06, + "loss": 2.6523, + "step": 20 + }, + { + "epoch": 0.06944444444444445, + "grad_norm": 2.353632926940918, + "learning_rate": 3.362068965517242e-06, + "loss": 2.4359, + "step": 40 + }, + { + "epoch": 0.10416666666666667, + "grad_norm": 1.865394115447998, + "learning_rate": 5.086206896551724e-06, + "loss": 2.2545, + "step": 60 + }, + { + "epoch": 0.1388888888888889, + "grad_norm": 1.8125933408737183, + "learning_rate": 6.810344827586207e-06, + "loss": 2.0557, + "step": 80 + }, + { + "epoch": 0.1736111111111111, + "grad_norm": 2.3572490215301514, + "learning_rate": 8.53448275862069e-06, + "loss": 1.9334, + "step": 100 + }, + { + "epoch": 0.20833333333333334, + "grad_norm": 2.395277261734009, + "learning_rate": 9.999793100349294e-06, + "loss": 1.9212, + "step": 120 + }, + { + "epoch": 0.24305555555555555, + "grad_norm": 2.714841604232788, + "learning_rate": 9.987843743451796e-06, + "loss": 1.7889, + "step": 140 + }, + { + "epoch": 0.2777777777777778, + "grad_norm": 2.236692190170288, + "learning_rate": 9.957553516178782e-06, + "loss": 1.716, + "step": 160 + }, + { + "epoch": 0.3125, + "grad_norm": 2.3020412921905518, + "learning_rate": 9.909033799150947e-06, + "loss": 1.7569, + "step": 180 + }, + { + "epoch": 0.3472222222222222, + "grad_norm": 2.5109288692474365, + "learning_rate": 9.842463004902127e-06, + "loss": 1.6664, + "step": 200 + }, + { + "epoch": 0.3819444444444444, + "grad_norm": 2.5140888690948486, + "learning_rate": 9.758085921836076e-06, + "loss": 1.6544, + "step": 220 + }, + { + "epoch": 0.4166666666666667, + "grad_norm": 2.666377544403076, + "learning_rate": 9.656212814111567e-06, + "loss": 1.6608, + "step": 240 + }, + { + "epoch": 0.4513888888888889, + "grad_norm": 2.715240955352783, + "learning_rate": 9.53721828076571e-06, + "loss": 1.6353, + "step": 260 + }, + { + "epoch": 0.4861111111111111, + "grad_norm": 2.7697439193725586, + "learning_rate": 9.401539878270545e-06, + "loss": 1.6352, + "step": 280 + }, + { + "epoch": 0.5208333333333334, + "grad_norm": 2.9743459224700928, + "learning_rate": 9.249676511588e-06, + "loss": 1.6275, + "step": 300 + }, + { + "epoch": 0.5555555555555556, + "grad_norm": 2.955244541168213, + "learning_rate": 9.082186599639429e-06, + "loss": 1.6052, + "step": 320 + }, + { + "epoch": 0.5902777777777778, + "grad_norm": 2.6228716373443604, + "learning_rate": 8.899686021935554e-06, + "loss": 1.5924, + "step": 340 + }, + { + "epoch": 0.625, + "grad_norm": 2.7822635173797607, + "learning_rate": 8.702845853917242e-06, + "loss": 1.5711, + "step": 360 + }, + { + "epoch": 0.6597222222222222, + "grad_norm": 2.450777769088745, + "learning_rate": 8.492389899334572e-06, + "loss": 1.5601, + "step": 380 + }, + { + "epoch": 0.6944444444444444, + "grad_norm": 2.999849557876587, + "learning_rate": 8.269092028737885e-06, + "loss": 1.5497, + "step": 400 + }, + { + "epoch": 0.7291666666666666, + "grad_norm": 3.2980637550354004, + "learning_rate": 8.033773333867498e-06, + "loss": 1.5243, + "step": 420 + }, + { + "epoch": 0.7638888888888888, + "grad_norm": 2.758843421936035, + "learning_rate": 7.78729910840572e-06, + "loss": 1.5171, + "step": 440 + }, + { + "epoch": 0.7986111111111112, + "grad_norm": 3.114650249481201, + "learning_rate": 7.530575666193283e-06, + "loss": 1.5212, + "step": 460 + }, + { + "epoch": 0.8333333333333334, + "grad_norm": 3.235766649246216, + "learning_rate": 7.26454700860997e-06, + "loss": 1.5019, + "step": 480 + }, + { + "epoch": 0.8680555555555556, + "grad_norm": 3.39516544342041, + "learning_rate": 6.990191353373876e-06, + "loss": 1.4963, + "step": 500 + } + ], + "logging_steps": 20, + "max_steps": 1152, + "num_input_tokens_seen": 0, + "num_train_epochs": 2, + "save_steps": 50, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.018001545345106e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/checkpoint-500/training_args.bin b/checkpoint-500/training_args.bin new file mode 100644 index 0000000..925fd93 --- /dev/null +++ b/checkpoint-500/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3b7f58321eea14364587c280ddc055ad0a161fdb8a2e9d81351505baed73ddca +size 6033 diff --git a/checkpoint-550/README.md b/checkpoint-550/README.md new file mode 100644 index 0000000..bacf84a --- /dev/null +++ b/checkpoint-550/README.md @@ -0,0 +1,207 @@ +--- +base_model: biaofu-xmu/EAST-8B +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:biaofu-xmu/EAST-8B +- lora +- transformers +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.19.1 \ No newline at end of file diff --git a/checkpoint-550/adapter_config.json b/checkpoint-550/adapter_config.json new file mode 100644 index 0000000..44390c2 --- /dev/null +++ b/checkpoint-550/adapter_config.json @@ -0,0 +1,48 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "biaofu-xmu/EAST-8B", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.05, + "lora_ga_config": null, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.19.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "o_proj", + "k_proj", + "down_proj", + "q_proj", + "v_proj", + "up_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_bdlora": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/checkpoint-550/adapter_model.safetensors b/checkpoint-550/adapter_model.safetensors new file mode 100644 index 0000000..9fdb9d1 --- /dev/null +++ b/checkpoint-550/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:070c581dfecc761e4dea01e91de7b309c3c301285e1533e2f55d7111516c2150 +size 671149168 diff --git a/checkpoint-550/optimizer.pt b/checkpoint-550/optimizer.pt new file mode 100644 index 0000000..f893320 --- /dev/null +++ b/checkpoint-550/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:540e4ac8a71c3d23b2edde78f3ac60af3ba0275fc5bf9d9c4c23cfe1f7af5563 +size 1342562339 diff --git a/checkpoint-550/rng_state.pth b/checkpoint-550/rng_state.pth new file mode 100644 index 0000000..bcde5f9 --- /dev/null +++ b/checkpoint-550/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:a26671c4558822970dc989c2c171c1da46ed77cf981fa1040a73a05b12a2c826 +size 14645 diff --git a/checkpoint-550/scheduler.pt b/checkpoint-550/scheduler.pt new file mode 100644 index 0000000..a344f2f --- /dev/null +++ b/checkpoint-550/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:95f0ec44226045e10b9e9885bb6dcc32b6fb20b4e398697125d5903dc06a3dc3 +size 1465 diff --git a/checkpoint-550/trainer_state.json b/checkpoint-550/trainer_state.json new file mode 100644 index 0000000..91b3e79 --- /dev/null +++ b/checkpoint-550/trainer_state.json @@ -0,0 +1,223 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.9548611111111112, + "eval_steps": 500, + "global_step": 550, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.034722222222222224, + "grad_norm": 2.985321283340454, + "learning_rate": 1.6379310344827587e-06, + "loss": 2.6523, + "step": 20 + }, + { + "epoch": 0.06944444444444445, + "grad_norm": 2.353632926940918, + "learning_rate": 3.362068965517242e-06, + "loss": 2.4359, + "step": 40 + }, + { + "epoch": 0.10416666666666667, + "grad_norm": 1.865394115447998, + "learning_rate": 5.086206896551724e-06, + "loss": 2.2545, + "step": 60 + }, + { + "epoch": 0.1388888888888889, + "grad_norm": 1.8125933408737183, + "learning_rate": 6.810344827586207e-06, + "loss": 2.0557, + "step": 80 + }, + { + "epoch": 0.1736111111111111, + "grad_norm": 2.3572490215301514, + "learning_rate": 8.53448275862069e-06, + "loss": 1.9334, + "step": 100 + }, + { + "epoch": 0.20833333333333334, + "grad_norm": 2.395277261734009, + "learning_rate": 9.999793100349294e-06, + "loss": 1.9212, + "step": 120 + }, + { + "epoch": 0.24305555555555555, + "grad_norm": 2.714841604232788, + "learning_rate": 9.987843743451796e-06, + "loss": 1.7889, + "step": 140 + }, + { + "epoch": 0.2777777777777778, + "grad_norm": 2.236692190170288, + "learning_rate": 9.957553516178782e-06, + "loss": 1.716, + "step": 160 + }, + { + "epoch": 0.3125, + "grad_norm": 2.3020412921905518, + "learning_rate": 9.909033799150947e-06, + "loss": 1.7569, + "step": 180 + }, + { + "epoch": 0.3472222222222222, + "grad_norm": 2.5109288692474365, + "learning_rate": 9.842463004902127e-06, + "loss": 1.6664, + "step": 200 + }, + { + "epoch": 0.3819444444444444, + "grad_norm": 2.5140888690948486, + "learning_rate": 9.758085921836076e-06, + "loss": 1.6544, + "step": 220 + }, + { + "epoch": 0.4166666666666667, + "grad_norm": 2.666377544403076, + "learning_rate": 9.656212814111567e-06, + "loss": 1.6608, + "step": 240 + }, + { + "epoch": 0.4513888888888889, + "grad_norm": 2.715240955352783, + "learning_rate": 9.53721828076571e-06, + "loss": 1.6353, + "step": 260 + }, + { + "epoch": 0.4861111111111111, + "grad_norm": 2.7697439193725586, + "learning_rate": 9.401539878270545e-06, + "loss": 1.6352, + "step": 280 + }, + { + "epoch": 0.5208333333333334, + "grad_norm": 2.9743459224700928, + "learning_rate": 9.249676511588e-06, + "loss": 1.6275, + "step": 300 + }, + { + "epoch": 0.5555555555555556, + "grad_norm": 2.955244541168213, + "learning_rate": 9.082186599639429e-06, + "loss": 1.6052, + "step": 320 + }, + { + "epoch": 0.5902777777777778, + "grad_norm": 2.6228716373443604, + "learning_rate": 8.899686021935554e-06, + "loss": 1.5924, + "step": 340 + }, + { + "epoch": 0.625, + "grad_norm": 2.7822635173797607, + "learning_rate": 8.702845853917242e-06, + "loss": 1.5711, + "step": 360 + }, + { + "epoch": 0.6597222222222222, + "grad_norm": 2.450777769088745, + "learning_rate": 8.492389899334572e-06, + "loss": 1.5601, + "step": 380 + }, + { + "epoch": 0.6944444444444444, + "grad_norm": 2.999849557876587, + "learning_rate": 8.269092028737885e-06, + "loss": 1.5497, + "step": 400 + }, + { + "epoch": 0.7291666666666666, + "grad_norm": 3.2980637550354004, + "learning_rate": 8.033773333867498e-06, + "loss": 1.5243, + "step": 420 + }, + { + "epoch": 0.7638888888888888, + "grad_norm": 2.758843421936035, + "learning_rate": 7.78729910840572e-06, + "loss": 1.5171, + "step": 440 + }, + { + "epoch": 0.7986111111111112, + "grad_norm": 3.114650249481201, + "learning_rate": 7.530575666193283e-06, + "loss": 1.5212, + "step": 460 + }, + { + "epoch": 0.8333333333333334, + "grad_norm": 3.235766649246216, + "learning_rate": 7.26454700860997e-06, + "loss": 1.5019, + "step": 480 + }, + { + "epoch": 0.8680555555555556, + "grad_norm": 3.39516544342041, + "learning_rate": 6.990191353373876e-06, + "loss": 1.4963, + "step": 500 + }, + { + "epoch": 0.9027777777777778, + "grad_norm": 3.507965087890625, + "learning_rate": 6.708517537523264e-06, + "loss": 1.4762, + "step": 520 + }, + { + "epoch": 0.9375, + "grad_norm": 3.2428181171417236, + "learning_rate": 6.420561307807713e-06, + "loss": 1.4822, + "step": 540 + } + ], + "logging_steps": 20, + "max_steps": 1152, + "num_input_tokens_seen": 0, + "num_train_epochs": 2, + "save_steps": 50, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.1207946421547827e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/checkpoint-550/training_args.bin b/checkpoint-550/training_args.bin new file mode 100644 index 0000000..925fd93 --- /dev/null +++ b/checkpoint-550/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3b7f58321eea14364587c280ddc055ad0a161fdb8a2e9d81351505baed73ddca +size 6033 diff --git a/checkpoint-600/README.md b/checkpoint-600/README.md new file mode 100644 index 0000000..bacf84a --- /dev/null +++ b/checkpoint-600/README.md @@ -0,0 +1,207 @@ +--- +base_model: biaofu-xmu/EAST-8B +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:biaofu-xmu/EAST-8B +- lora +- transformers +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.19.1 \ No newline at end of file diff --git a/checkpoint-600/adapter_config.json b/checkpoint-600/adapter_config.json new file mode 100644 index 0000000..44390c2 --- /dev/null +++ b/checkpoint-600/adapter_config.json @@ -0,0 +1,48 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "biaofu-xmu/EAST-8B", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.05, + "lora_ga_config": null, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.19.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "o_proj", + "k_proj", + "down_proj", + "q_proj", + "v_proj", + "up_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_bdlora": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/checkpoint-600/adapter_model.safetensors b/checkpoint-600/adapter_model.safetensors new file mode 100644 index 0000000..2b066a4 --- /dev/null +++ b/checkpoint-600/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4a71f4a501fcacfbeaca840f4c93754cd231937b4e95a6c195dd178d45eb3bab +size 671149168 diff --git a/checkpoint-600/optimizer.pt b/checkpoint-600/optimizer.pt new file mode 100644 index 0000000..9b555fd --- /dev/null +++ b/checkpoint-600/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:9c96c87006856bf0759c7bcf1e2ca316b74b6b60e0dd5180b281f7eae888f64d +size 1342562339 diff --git a/checkpoint-600/rng_state.pth b/checkpoint-600/rng_state.pth new file mode 100644 index 0000000..5b1881a --- /dev/null +++ b/checkpoint-600/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:36058ee334ab2337ce44503b2d570982b78d9e914ea5a7af7b8a0b3210623fd0 +size 14645 diff --git a/checkpoint-600/scheduler.pt b/checkpoint-600/scheduler.pt new file mode 100644 index 0000000..9d84cb1 --- /dev/null +++ b/checkpoint-600/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:97e41312b87b4204123e46e88d3bc7c857cfb3fbe531078e169cc10e0d939469 +size 1465 diff --git a/checkpoint-600/trainer_state.json b/checkpoint-600/trainer_state.json new file mode 100644 index 0000000..a659e96 --- /dev/null +++ b/checkpoint-600/trainer_state.json @@ -0,0 +1,244 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.0416666666666667, + "eval_steps": 500, + "global_step": 600, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.034722222222222224, + "grad_norm": 2.985321283340454, + "learning_rate": 1.6379310344827587e-06, + "loss": 2.6523, + "step": 20 + }, + { + "epoch": 0.06944444444444445, + "grad_norm": 2.353632926940918, + "learning_rate": 3.362068965517242e-06, + "loss": 2.4359, + "step": 40 + }, + { + "epoch": 0.10416666666666667, + "grad_norm": 1.865394115447998, + "learning_rate": 5.086206896551724e-06, + "loss": 2.2545, + "step": 60 + }, + { + "epoch": 0.1388888888888889, + "grad_norm": 1.8125933408737183, + "learning_rate": 6.810344827586207e-06, + "loss": 2.0557, + "step": 80 + }, + { + "epoch": 0.1736111111111111, + "grad_norm": 2.3572490215301514, + "learning_rate": 8.53448275862069e-06, + "loss": 1.9334, + "step": 100 + }, + { + "epoch": 0.20833333333333334, + "grad_norm": 2.395277261734009, + "learning_rate": 9.999793100349294e-06, + "loss": 1.9212, + "step": 120 + }, + { + "epoch": 0.24305555555555555, + "grad_norm": 2.714841604232788, + "learning_rate": 9.987843743451796e-06, + "loss": 1.7889, + "step": 140 + }, + { + "epoch": 0.2777777777777778, + "grad_norm": 2.236692190170288, + "learning_rate": 9.957553516178782e-06, + "loss": 1.716, + "step": 160 + }, + { + "epoch": 0.3125, + "grad_norm": 2.3020412921905518, + "learning_rate": 9.909033799150947e-06, + "loss": 1.7569, + "step": 180 + }, + { + "epoch": 0.3472222222222222, + "grad_norm": 2.5109288692474365, + "learning_rate": 9.842463004902127e-06, + "loss": 1.6664, + "step": 200 + }, + { + "epoch": 0.3819444444444444, + "grad_norm": 2.5140888690948486, + "learning_rate": 9.758085921836076e-06, + "loss": 1.6544, + "step": 220 + }, + { + "epoch": 0.4166666666666667, + "grad_norm": 2.666377544403076, + "learning_rate": 9.656212814111567e-06, + "loss": 1.6608, + "step": 240 + }, + { + "epoch": 0.4513888888888889, + "grad_norm": 2.715240955352783, + "learning_rate": 9.53721828076571e-06, + "loss": 1.6353, + "step": 260 + }, + { + "epoch": 0.4861111111111111, + "grad_norm": 2.7697439193725586, + "learning_rate": 9.401539878270545e-06, + "loss": 1.6352, + "step": 280 + }, + { + "epoch": 0.5208333333333334, + "grad_norm": 2.9743459224700928, + "learning_rate": 9.249676511588e-06, + "loss": 1.6275, + "step": 300 + }, + { + "epoch": 0.5555555555555556, + "grad_norm": 2.955244541168213, + "learning_rate": 9.082186599639429e-06, + "loss": 1.6052, + "step": 320 + }, + { + "epoch": 0.5902777777777778, + "grad_norm": 2.6228716373443604, + "learning_rate": 8.899686021935554e-06, + "loss": 1.5924, + "step": 340 + }, + { + "epoch": 0.625, + "grad_norm": 2.7822635173797607, + "learning_rate": 8.702845853917242e-06, + "loss": 1.5711, + "step": 360 + }, + { + "epoch": 0.6597222222222222, + "grad_norm": 2.450777769088745, + "learning_rate": 8.492389899334572e-06, + "loss": 1.5601, + "step": 380 + }, + { + "epoch": 0.6944444444444444, + "grad_norm": 2.999849557876587, + "learning_rate": 8.269092028737885e-06, + "loss": 1.5497, + "step": 400 + }, + { + "epoch": 0.7291666666666666, + "grad_norm": 3.2980637550354004, + "learning_rate": 8.033773333867498e-06, + "loss": 1.5243, + "step": 420 + }, + { + "epoch": 0.7638888888888888, + "grad_norm": 2.758843421936035, + "learning_rate": 7.78729910840572e-06, + "loss": 1.5171, + "step": 440 + }, + { + "epoch": 0.7986111111111112, + "grad_norm": 3.114650249481201, + "learning_rate": 7.530575666193283e-06, + "loss": 1.5212, + "step": 460 + }, + { + "epoch": 0.8333333333333334, + "grad_norm": 3.235766649246216, + "learning_rate": 7.26454700860997e-06, + "loss": 1.5019, + "step": 480 + }, + { + "epoch": 0.8680555555555556, + "grad_norm": 3.39516544342041, + "learning_rate": 6.990191353373876e-06, + "loss": 1.4963, + "step": 500 + }, + { + "epoch": 0.9027777777777778, + "grad_norm": 3.507965087890625, + "learning_rate": 6.708517537523264e-06, + "loss": 1.4762, + "step": 520 + }, + { + "epoch": 0.9375, + "grad_norm": 3.2428181171417236, + "learning_rate": 6.420561307807713e-06, + "loss": 1.4822, + "step": 540 + }, + { + "epoch": 0.9722222222222222, + "grad_norm": 2.9236435890197754, + "learning_rate": 6.12738151212918e-06, + "loss": 1.5021, + "step": 560 + }, + { + "epoch": 1.0069444444444444, + "grad_norm": 3.689115047454834, + "learning_rate": 5.830056206037482e-06, + "loss": 1.4606, + "step": 580 + }, + { + "epoch": 1.0416666666666667, + "grad_norm": 2.897470474243164, + "learning_rate": 5.529678688597081e-06, + "loss": 1.3981, + "step": 600 + } + ], + "logging_steps": 20, + "max_steps": 1152, + "num_input_tokens_seen": 0, + "num_train_epochs": 2, + "save_steps": 50, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.2216486287720448e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/checkpoint-600/training_args.bin b/checkpoint-600/training_args.bin new file mode 100644 index 0000000..925fd93 --- /dev/null +++ b/checkpoint-600/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3b7f58321eea14364587c280ddc055ad0a161fdb8a2e9d81351505baed73ddca +size 6033 diff --git a/checkpoint-650/README.md b/checkpoint-650/README.md new file mode 100644 index 0000000..bacf84a --- /dev/null +++ b/checkpoint-650/README.md @@ -0,0 +1,207 @@ +--- +base_model: biaofu-xmu/EAST-8B +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:biaofu-xmu/EAST-8B +- lora +- transformers +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.19.1 \ No newline at end of file diff --git a/checkpoint-650/adapter_config.json b/checkpoint-650/adapter_config.json new file mode 100644 index 0000000..44390c2 --- /dev/null +++ b/checkpoint-650/adapter_config.json @@ -0,0 +1,48 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "biaofu-xmu/EAST-8B", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.05, + "lora_ga_config": null, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.19.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "o_proj", + "k_proj", + "down_proj", + "q_proj", + "v_proj", + "up_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_bdlora": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/checkpoint-650/adapter_model.safetensors b/checkpoint-650/adapter_model.safetensors new file mode 100644 index 0000000..2e723f2 --- /dev/null +++ b/checkpoint-650/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:9784409fad903f92a406c3d2fb539f2c2c65a46379c8492ccd14b7f7aa59ce3f +size 671149168 diff --git a/checkpoint-650/optimizer.pt b/checkpoint-650/optimizer.pt new file mode 100644 index 0000000..bc3ef94 --- /dev/null +++ b/checkpoint-650/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:021846df24e668e4bd57ddecfb8183b75ab795d78a5fa056991504020937fc5b +size 1342562339 diff --git a/checkpoint-650/rng_state.pth b/checkpoint-650/rng_state.pth new file mode 100644 index 0000000..6772fa5 --- /dev/null +++ b/checkpoint-650/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:badb3d6bf851197423f3f0d0261030e724de827eab1f31096511b7c9e3a2c2dc +size 14645 diff --git a/checkpoint-650/scheduler.pt b/checkpoint-650/scheduler.pt new file mode 100644 index 0000000..3d8d688 --- /dev/null +++ b/checkpoint-650/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:701963ab8d7d1849c052af5fce88023fdda6f713e5072a25a5a4aa822ce8b58b +size 1465 diff --git a/checkpoint-650/trainer_state.json b/checkpoint-650/trainer_state.json new file mode 100644 index 0000000..cda3088 --- /dev/null +++ b/checkpoint-650/trainer_state.json @@ -0,0 +1,258 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.1284722222222223, + "eval_steps": 500, + "global_step": 650, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.034722222222222224, + "grad_norm": 2.985321283340454, + "learning_rate": 1.6379310344827587e-06, + "loss": 2.6523, + "step": 20 + }, + { + "epoch": 0.06944444444444445, + "grad_norm": 2.353632926940918, + "learning_rate": 3.362068965517242e-06, + "loss": 2.4359, + "step": 40 + }, + { + "epoch": 0.10416666666666667, + "grad_norm": 1.865394115447998, + "learning_rate": 5.086206896551724e-06, + "loss": 2.2545, + "step": 60 + }, + { + "epoch": 0.1388888888888889, + "grad_norm": 1.8125933408737183, + "learning_rate": 6.810344827586207e-06, + "loss": 2.0557, + "step": 80 + }, + { + "epoch": 0.1736111111111111, + "grad_norm": 2.3572490215301514, + "learning_rate": 8.53448275862069e-06, + "loss": 1.9334, + "step": 100 + }, + { + "epoch": 0.20833333333333334, + "grad_norm": 2.395277261734009, + "learning_rate": 9.999793100349294e-06, + "loss": 1.9212, + "step": 120 + }, + { + "epoch": 0.24305555555555555, + "grad_norm": 2.714841604232788, + "learning_rate": 9.987843743451796e-06, + "loss": 1.7889, + "step": 140 + }, + { + "epoch": 0.2777777777777778, + "grad_norm": 2.236692190170288, + "learning_rate": 9.957553516178782e-06, + "loss": 1.716, + "step": 160 + }, + { + "epoch": 0.3125, + "grad_norm": 2.3020412921905518, + "learning_rate": 9.909033799150947e-06, + "loss": 1.7569, + "step": 180 + }, + { + "epoch": 0.3472222222222222, + "grad_norm": 2.5109288692474365, + "learning_rate": 9.842463004902127e-06, + "loss": 1.6664, + "step": 200 + }, + { + "epoch": 0.3819444444444444, + "grad_norm": 2.5140888690948486, + "learning_rate": 9.758085921836076e-06, + "loss": 1.6544, + "step": 220 + }, + { + "epoch": 0.4166666666666667, + "grad_norm": 2.666377544403076, + "learning_rate": 9.656212814111567e-06, + "loss": 1.6608, + "step": 240 + }, + { + "epoch": 0.4513888888888889, + "grad_norm": 2.715240955352783, + "learning_rate": 9.53721828076571e-06, + "loss": 1.6353, + "step": 260 + }, + { + "epoch": 0.4861111111111111, + "grad_norm": 2.7697439193725586, + "learning_rate": 9.401539878270545e-06, + "loss": 1.6352, + "step": 280 + }, + { + "epoch": 0.5208333333333334, + "grad_norm": 2.9743459224700928, + "learning_rate": 9.249676511588e-06, + "loss": 1.6275, + "step": 300 + }, + { + "epoch": 0.5555555555555556, + "grad_norm": 2.955244541168213, + "learning_rate": 9.082186599639429e-06, + "loss": 1.6052, + "step": 320 + }, + { + "epoch": 0.5902777777777778, + "grad_norm": 2.6228716373443604, + "learning_rate": 8.899686021935554e-06, + "loss": 1.5924, + "step": 340 + }, + { + "epoch": 0.625, + "grad_norm": 2.7822635173797607, + "learning_rate": 8.702845853917242e-06, + "loss": 1.5711, + "step": 360 + }, + { + "epoch": 0.6597222222222222, + "grad_norm": 2.450777769088745, + "learning_rate": 8.492389899334572e-06, + "loss": 1.5601, + "step": 380 + }, + { + "epoch": 0.6944444444444444, + "grad_norm": 2.999849557876587, + "learning_rate": 8.269092028737885e-06, + "loss": 1.5497, + "step": 400 + }, + { + "epoch": 0.7291666666666666, + "grad_norm": 3.2980637550354004, + "learning_rate": 8.033773333867498e-06, + "loss": 1.5243, + "step": 420 + }, + { + "epoch": 0.7638888888888888, + "grad_norm": 2.758843421936035, + "learning_rate": 7.78729910840572e-06, + "loss": 1.5171, + "step": 440 + }, + { + "epoch": 0.7986111111111112, + "grad_norm": 3.114650249481201, + "learning_rate": 7.530575666193283e-06, + "loss": 1.5212, + "step": 460 + }, + { + "epoch": 0.8333333333333334, + "grad_norm": 3.235766649246216, + "learning_rate": 7.26454700860997e-06, + "loss": 1.5019, + "step": 480 + }, + { + "epoch": 0.8680555555555556, + "grad_norm": 3.39516544342041, + "learning_rate": 6.990191353373876e-06, + "loss": 1.4963, + "step": 500 + }, + { + "epoch": 0.9027777777777778, + "grad_norm": 3.507965087890625, + "learning_rate": 6.708517537523264e-06, + "loss": 1.4762, + "step": 520 + }, + { + "epoch": 0.9375, + "grad_norm": 3.2428181171417236, + "learning_rate": 6.420561307807713e-06, + "loss": 1.4822, + "step": 540 + }, + { + "epoch": 0.9722222222222222, + "grad_norm": 2.9236435890197754, + "learning_rate": 6.12738151212918e-06, + "loss": 1.5021, + "step": 560 + }, + { + "epoch": 1.0069444444444444, + "grad_norm": 3.689115047454834, + "learning_rate": 5.830056206037482e-06, + "loss": 1.4606, + "step": 580 + }, + { + "epoch": 1.0416666666666667, + "grad_norm": 2.897470474243164, + "learning_rate": 5.529678688597081e-06, + "loss": 1.3981, + "step": 600 + }, + { + "epoch": 1.0763888888888888, + "grad_norm": 3.1479601860046387, + "learning_rate": 5.2273534822017105e-06, + "loss": 1.4024, + "step": 620 + }, + { + "epoch": 1.1111111111111112, + "grad_norm": 3.726175546646118, + "learning_rate": 4.924192271119554e-06, + "loss": 1.3784, + "step": 640 + } + ], + "logging_steps": 20, + "max_steps": 1152, + "num_input_tokens_seen": 0, + "num_train_epochs": 2, + "save_steps": 50, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.321789950959616e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/checkpoint-650/training_args.bin b/checkpoint-650/training_args.bin new file mode 100644 index 0000000..925fd93 --- /dev/null +++ b/checkpoint-650/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3b7f58321eea14364587c280ddc055ad0a161fdb8a2e9d81351505baed73ddca +size 6033 diff --git a/checkpoint-700/README.md b/checkpoint-700/README.md new file mode 100644 index 0000000..bacf84a --- /dev/null +++ b/checkpoint-700/README.md @@ -0,0 +1,207 @@ +--- +base_model: biaofu-xmu/EAST-8B +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:biaofu-xmu/EAST-8B +- lora +- transformers +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.19.1 \ No newline at end of file diff --git a/checkpoint-700/adapter_config.json b/checkpoint-700/adapter_config.json new file mode 100644 index 0000000..44390c2 --- /dev/null +++ b/checkpoint-700/adapter_config.json @@ -0,0 +1,48 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "biaofu-xmu/EAST-8B", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.05, + "lora_ga_config": null, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.19.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "o_proj", + "k_proj", + "down_proj", + "q_proj", + "v_proj", + "up_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_bdlora": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/checkpoint-700/adapter_model.safetensors b/checkpoint-700/adapter_model.safetensors new file mode 100644 index 0000000..ec5ccda --- /dev/null +++ b/checkpoint-700/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:271b0c46eb14bc27ec8ba4d12222f2e444182bcda1a96d04e4272075183c69e3 +size 671149168 diff --git a/checkpoint-700/optimizer.pt b/checkpoint-700/optimizer.pt new file mode 100644 index 0000000..c1e70a8 --- /dev/null +++ b/checkpoint-700/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e0df7b9741a7bde1076748c3da7ea0b70ae08ad210c4cabb33b9e46ed5e931bd +size 1342562339 diff --git a/checkpoint-700/rng_state.pth b/checkpoint-700/rng_state.pth new file mode 100644 index 0000000..ef2a849 --- /dev/null +++ b/checkpoint-700/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4010893870faf9fa7daff07b67a71ffedf07ce00c093ffe9c1e0d8bf113cc4c6 +size 14645 diff --git a/checkpoint-700/scheduler.pt b/checkpoint-700/scheduler.pt new file mode 100644 index 0000000..0e67b96 --- /dev/null +++ b/checkpoint-700/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:f96c27cd0f37d375f25ee4ddc217cab5525667adb393b37449a4bbaa0d7f3f00 +size 1465 diff --git a/checkpoint-700/trainer_state.json b/checkpoint-700/trainer_state.json new file mode 100644 index 0000000..caf5c41 --- /dev/null +++ b/checkpoint-700/trainer_state.json @@ -0,0 +1,279 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.2152777777777777, + "eval_steps": 500, + "global_step": 700, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.034722222222222224, + "grad_norm": 2.985321283340454, + "learning_rate": 1.6379310344827587e-06, + "loss": 2.6523, + "step": 20 + }, + { + "epoch": 0.06944444444444445, + "grad_norm": 2.353632926940918, + "learning_rate": 3.362068965517242e-06, + "loss": 2.4359, + "step": 40 + }, + { + "epoch": 0.10416666666666667, + "grad_norm": 1.865394115447998, + "learning_rate": 5.086206896551724e-06, + "loss": 2.2545, + "step": 60 + }, + { + "epoch": 0.1388888888888889, + "grad_norm": 1.8125933408737183, + "learning_rate": 6.810344827586207e-06, + "loss": 2.0557, + "step": 80 + }, + { + "epoch": 0.1736111111111111, + "grad_norm": 2.3572490215301514, + "learning_rate": 8.53448275862069e-06, + "loss": 1.9334, + "step": 100 + }, + { + "epoch": 0.20833333333333334, + "grad_norm": 2.395277261734009, + "learning_rate": 9.999793100349294e-06, + "loss": 1.9212, + "step": 120 + }, + { + "epoch": 0.24305555555555555, + "grad_norm": 2.714841604232788, + "learning_rate": 9.987843743451796e-06, + "loss": 1.7889, + "step": 140 + }, + { + "epoch": 0.2777777777777778, + "grad_norm": 2.236692190170288, + "learning_rate": 9.957553516178782e-06, + "loss": 1.716, + "step": 160 + }, + { + "epoch": 0.3125, + "grad_norm": 2.3020412921905518, + "learning_rate": 9.909033799150947e-06, + "loss": 1.7569, + "step": 180 + }, + { + "epoch": 0.3472222222222222, + "grad_norm": 2.5109288692474365, + "learning_rate": 9.842463004902127e-06, + "loss": 1.6664, + "step": 200 + }, + { + "epoch": 0.3819444444444444, + "grad_norm": 2.5140888690948486, + "learning_rate": 9.758085921836076e-06, + "loss": 1.6544, + "step": 220 + }, + { + "epoch": 0.4166666666666667, + "grad_norm": 2.666377544403076, + "learning_rate": 9.656212814111567e-06, + "loss": 1.6608, + "step": 240 + }, + { + "epoch": 0.4513888888888889, + "grad_norm": 2.715240955352783, + "learning_rate": 9.53721828076571e-06, + "loss": 1.6353, + "step": 260 + }, + { + "epoch": 0.4861111111111111, + "grad_norm": 2.7697439193725586, + "learning_rate": 9.401539878270545e-06, + "loss": 1.6352, + "step": 280 + }, + { + "epoch": 0.5208333333333334, + "grad_norm": 2.9743459224700928, + "learning_rate": 9.249676511588e-06, + "loss": 1.6275, + "step": 300 + }, + { + "epoch": 0.5555555555555556, + "grad_norm": 2.955244541168213, + "learning_rate": 9.082186599639429e-06, + "loss": 1.6052, + "step": 320 + }, + { + "epoch": 0.5902777777777778, + "grad_norm": 2.6228716373443604, + "learning_rate": 8.899686021935554e-06, + "loss": 1.5924, + "step": 340 + }, + { + "epoch": 0.625, + "grad_norm": 2.7822635173797607, + "learning_rate": 8.702845853917242e-06, + "loss": 1.5711, + "step": 360 + }, + { + "epoch": 0.6597222222222222, + "grad_norm": 2.450777769088745, + "learning_rate": 8.492389899334572e-06, + "loss": 1.5601, + "step": 380 + }, + { + "epoch": 0.6944444444444444, + "grad_norm": 2.999849557876587, + "learning_rate": 8.269092028737885e-06, + "loss": 1.5497, + "step": 400 + }, + { + "epoch": 0.7291666666666666, + "grad_norm": 3.2980637550354004, + "learning_rate": 8.033773333867498e-06, + "loss": 1.5243, + "step": 420 + }, + { + "epoch": 0.7638888888888888, + "grad_norm": 2.758843421936035, + "learning_rate": 7.78729910840572e-06, + "loss": 1.5171, + "step": 440 + }, + { + "epoch": 0.7986111111111112, + "grad_norm": 3.114650249481201, + "learning_rate": 7.530575666193283e-06, + "loss": 1.5212, + "step": 460 + }, + { + "epoch": 0.8333333333333334, + "grad_norm": 3.235766649246216, + "learning_rate": 7.26454700860997e-06, + "loss": 1.5019, + "step": 480 + }, + { + "epoch": 0.8680555555555556, + "grad_norm": 3.39516544342041, + "learning_rate": 6.990191353373876e-06, + "loss": 1.4963, + "step": 500 + }, + { + "epoch": 0.9027777777777778, + "grad_norm": 3.507965087890625, + "learning_rate": 6.708517537523264e-06, + "loss": 1.4762, + "step": 520 + }, + { + "epoch": 0.9375, + "grad_norm": 3.2428181171417236, + "learning_rate": 6.420561307807713e-06, + "loss": 1.4822, + "step": 540 + }, + { + "epoch": 0.9722222222222222, + "grad_norm": 2.9236435890197754, + "learning_rate": 6.12738151212918e-06, + "loss": 1.5021, + "step": 560 + }, + { + "epoch": 1.0069444444444444, + "grad_norm": 3.689115047454834, + "learning_rate": 5.830056206037482e-06, + "loss": 1.4606, + "step": 580 + }, + { + "epoch": 1.0416666666666667, + "grad_norm": 2.897470474243164, + "learning_rate": 5.529678688597081e-06, + "loss": 1.3981, + "step": 600 + }, + { + "epoch": 1.0763888888888888, + "grad_norm": 3.1479601860046387, + "learning_rate": 5.2273534822017105e-06, + "loss": 1.4024, + "step": 620 + }, + { + "epoch": 1.1111111111111112, + "grad_norm": 3.726175546646118, + "learning_rate": 4.924192271119554e-06, + "loss": 1.3784, + "step": 640 + }, + { + "epoch": 1.1458333333333333, + "grad_norm": 2.944827079772949, + "learning_rate": 4.621309813703385e-06, + "loss": 1.3781, + "step": 660 + }, + { + "epoch": 1.1805555555555556, + "grad_norm": 4.154749870300293, + "learning_rate": 4.319819843296952e-06, + "loss": 1.385, + "step": 680 + }, + { + "epoch": 1.2152777777777777, + "grad_norm": 3.470216751098633, + "learning_rate": 4.020830972910433e-06, + "loss": 1.3937, + "step": 700 + } + ], + "logging_steps": 20, + "max_steps": 1152, + "num_input_tokens_seen": 0, + "num_train_epochs": 2, + "save_steps": 50, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.42216698644693e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/checkpoint-700/training_args.bin b/checkpoint-700/training_args.bin new file mode 100644 index 0000000..925fd93 --- /dev/null +++ b/checkpoint-700/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3b7f58321eea14364587c280ddc055ad0a161fdb8a2e9d81351505baed73ddca +size 6033 diff --git a/checkpoint-750/README.md b/checkpoint-750/README.md new file mode 100644 index 0000000..bacf84a --- /dev/null +++ b/checkpoint-750/README.md @@ -0,0 +1,207 @@ +--- +base_model: biaofu-xmu/EAST-8B +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:biaofu-xmu/EAST-8B +- lora +- transformers +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.19.1 \ No newline at end of file diff --git a/checkpoint-750/adapter_config.json b/checkpoint-750/adapter_config.json new file mode 100644 index 0000000..8e6e401 --- /dev/null +++ b/checkpoint-750/adapter_config.json @@ -0,0 +1,48 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "biaofu-xmu/EAST-8B", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.05, + "lora_ga_config": null, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.19.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "o_proj", + "up_proj", + "q_proj", + "gate_proj", + "v_proj", + "down_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_bdlora": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/checkpoint-750/adapter_model.safetensors b/checkpoint-750/adapter_model.safetensors new file mode 100644 index 0000000..c01c918 --- /dev/null +++ b/checkpoint-750/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:227ec3891af9bf22d0fe3d7a5ed9422a3c8ae1b88523d1b1600affcb4cfb2f55 +size 671149168 diff --git a/checkpoint-750/optimizer.pt b/checkpoint-750/optimizer.pt new file mode 100644 index 0000000..ca5380c --- /dev/null +++ b/checkpoint-750/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6b09702fb2977aa965f47a8f5c01d69a848fff87479a78d1284577c237bd5e27 +size 1342562339 diff --git a/checkpoint-750/rng_state.pth b/checkpoint-750/rng_state.pth new file mode 100644 index 0000000..873c7f1 --- /dev/null +++ b/checkpoint-750/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e3371368b6a61b6b09b240936086c5725d21c7588856e0778008166f8b73e804 +size 14645 diff --git a/checkpoint-750/scheduler.pt b/checkpoint-750/scheduler.pt new file mode 100644 index 0000000..cd6206b --- /dev/null +++ b/checkpoint-750/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:72b6be6f074d6123936480d0df9f32aebfcd8ee4d1f99a6b9b9459f1d72f8bd7 +size 1465 diff --git a/checkpoint-750/trainer_state.json b/checkpoint-750/trainer_state.json new file mode 100644 index 0000000..72ef413 --- /dev/null +++ b/checkpoint-750/trainer_state.json @@ -0,0 +1,293 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.3020833333333333, + "eval_steps": 500, + "global_step": 750, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.034722222222222224, + "grad_norm": 2.975640058517456, + "learning_rate": 1.6379310344827587e-06, + "loss": 2.6527, + "step": 20 + }, + { + "epoch": 0.06944444444444445, + "grad_norm": 2.329663038253784, + "learning_rate": 3.362068965517242e-06, + "loss": 2.4375, + "step": 40 + }, + { + "epoch": 0.10416666666666667, + "grad_norm": 1.8956992626190186, + "learning_rate": 5.086206896551724e-06, + "loss": 2.2566, + "step": 60 + }, + { + "epoch": 0.1388888888888889, + "grad_norm": 1.8109517097473145, + "learning_rate": 6.810344827586207e-06, + "loss": 2.0567, + "step": 80 + }, + { + "epoch": 0.1736111111111111, + "grad_norm": 2.382589817047119, + "learning_rate": 8.53448275862069e-06, + "loss": 1.9338, + "step": 100 + }, + { + "epoch": 0.20833333333333334, + "grad_norm": 2.378267526626587, + "learning_rate": 9.999793100349294e-06, + "loss": 1.9218, + "step": 120 + }, + { + "epoch": 0.24305555555555555, + "grad_norm": 2.6260263919830322, + "learning_rate": 9.987843743451796e-06, + "loss": 1.7895, + "step": 140 + }, + { + "epoch": 0.2777777777777778, + "grad_norm": 2.2361156940460205, + "learning_rate": 9.957553516178782e-06, + "loss": 1.7166, + "step": 160 + }, + { + "epoch": 0.3125, + "grad_norm": 2.345552682876587, + "learning_rate": 9.909033799150947e-06, + "loss": 1.7573, + "step": 180 + }, + { + "epoch": 0.3472222222222222, + "grad_norm": 2.4918200969696045, + "learning_rate": 9.842463004902127e-06, + "loss": 1.6668, + "step": 200 + }, + { + "epoch": 0.3819444444444444, + "grad_norm": 2.5107343196868896, + "learning_rate": 9.758085921836076e-06, + "loss": 1.6556, + "step": 220 + }, + { + "epoch": 0.4166666666666667, + "grad_norm": 2.69317626953125, + "learning_rate": 9.656212814111567e-06, + "loss": 1.6606, + "step": 240 + }, + { + "epoch": 0.4513888888888889, + "grad_norm": 2.759850025177002, + "learning_rate": 9.53721828076571e-06, + "loss": 1.6359, + "step": 260 + }, + { + "epoch": 0.4861111111111111, + "grad_norm": 2.751281976699829, + "learning_rate": 9.401539878270545e-06, + "loss": 1.635, + "step": 280 + }, + { + "epoch": 0.5208333333333334, + "grad_norm": 3.0062153339385986, + "learning_rate": 9.249676511588e-06, + "loss": 1.6278, + "step": 300 + }, + { + "epoch": 0.5555555555555556, + "grad_norm": 2.9671173095703125, + "learning_rate": 9.082186599639429e-06, + "loss": 1.6051, + "step": 320 + }, + { + "epoch": 0.5902777777777778, + "grad_norm": 2.6128034591674805, + "learning_rate": 8.899686021935554e-06, + "loss": 1.5921, + "step": 340 + }, + { + "epoch": 0.625, + "grad_norm": 2.750213384628296, + "learning_rate": 8.702845853917242e-06, + "loss": 1.5715, + "step": 360 + }, + { + "epoch": 0.6597222222222222, + "grad_norm": 2.4882044792175293, + "learning_rate": 8.492389899334572e-06, + "loss": 1.5607, + "step": 380 + }, + { + "epoch": 0.6944444444444444, + "grad_norm": 2.949469566345215, + "learning_rate": 8.269092028737885e-06, + "loss": 1.5498, + "step": 400 + }, + { + "epoch": 0.7291666666666666, + "grad_norm": 3.360396146774292, + "learning_rate": 8.033773333867498e-06, + "loss": 1.5246, + "step": 420 + }, + { + "epoch": 0.7638888888888888, + "grad_norm": 2.726001739501953, + "learning_rate": 7.78729910840572e-06, + "loss": 1.5172, + "step": 440 + }, + { + "epoch": 0.7986111111111112, + "grad_norm": 3.169776678085327, + "learning_rate": 7.530575666193283e-06, + "loss": 1.5212, + "step": 460 + }, + { + "epoch": 0.8333333333333334, + "grad_norm": 3.2836718559265137, + "learning_rate": 7.26454700860997e-06, + "loss": 1.5022, + "step": 480 + }, + { + "epoch": 0.8680555555555556, + "grad_norm": 3.3847920894622803, + "learning_rate": 6.990191353373876e-06, + "loss": 1.4968, + "step": 500 + }, + { + "epoch": 0.9027777777777778, + "grad_norm": 3.5661308765411377, + "learning_rate": 6.708517537523264e-06, + "loss": 1.477, + "step": 520 + }, + { + "epoch": 0.9375, + "grad_norm": 3.243346929550171, + "learning_rate": 6.420561307807713e-06, + "loss": 1.483, + "step": 540 + }, + { + "epoch": 0.9722222222222222, + "grad_norm": 2.8526790142059326, + "learning_rate": 6.12738151212918e-06, + "loss": 1.5018, + "step": 560 + }, + { + "epoch": 1.0069444444444444, + "grad_norm": 3.678152322769165, + "learning_rate": 5.830056206037482e-06, + "loss": 1.4604, + "step": 580 + }, + { + "epoch": 1.0416666666666667, + "grad_norm": 2.920789957046509, + "learning_rate": 5.529678688597081e-06, + "loss": 1.3984, + "step": 600 + }, + { + "epoch": 1.0763888888888888, + "grad_norm": 3.198030710220337, + "learning_rate": 5.2273534822017105e-06, + "loss": 1.4028, + "step": 620 + }, + { + "epoch": 1.1111111111111112, + "grad_norm": 3.737910270690918, + "learning_rate": 4.924192271119554e-06, + "loss": 1.3788, + "step": 640 + }, + { + "epoch": 1.1458333333333333, + "grad_norm": 2.9169039726257324, + "learning_rate": 4.621309813703385e-06, + "loss": 1.3787, + "step": 660 + }, + { + "epoch": 1.1805555555555556, + "grad_norm": 4.108018398284912, + "learning_rate": 4.319819843296952e-06, + "loss": 1.3854, + "step": 680 + }, + { + "epoch": 1.2152777777777777, + "grad_norm": 3.489570140838623, + "learning_rate": 4.020830972910433e-06, + "loss": 1.394, + "step": 700 + }, + { + "epoch": 1.25, + "grad_norm": 3.5733399391174316, + "learning_rate": 3.7254426187239567e-06, + "loss": 1.347, + "step": 720 + }, + { + "epoch": 1.2847222222222223, + "grad_norm": 3.479602098464966, + "learning_rate": 3.4347409574088896e-06, + "loss": 1.3647, + "step": 740 + } + ], + "logging_steps": 20, + "max_steps": 1152, + "num_input_tokens_seen": 0, + "num_train_epochs": 2, + "save_steps": 50, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.5257261514807706e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/checkpoint-750/training_args.bin b/checkpoint-750/training_args.bin new file mode 100644 index 0000000..b0a0b0d --- /dev/null +++ b/checkpoint-750/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ab2a55d99d554b614e62a1cc2b43a5981feda7b0fbd4713a15efa9946f443ce9 +size 6033 diff --git a/checkpoint-800/README.md b/checkpoint-800/README.md new file mode 100644 index 0000000..bacf84a --- /dev/null +++ b/checkpoint-800/README.md @@ -0,0 +1,207 @@ +--- +base_model: biaofu-xmu/EAST-8B +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:biaofu-xmu/EAST-8B +- lora +- transformers +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.19.1 \ No newline at end of file diff --git a/checkpoint-800/adapter_config.json b/checkpoint-800/adapter_config.json new file mode 100644 index 0000000..44390c2 --- /dev/null +++ b/checkpoint-800/adapter_config.json @@ -0,0 +1,48 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "biaofu-xmu/EAST-8B", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.05, + "lora_ga_config": null, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.19.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "o_proj", + "k_proj", + "down_proj", + "q_proj", + "v_proj", + "up_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_bdlora": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/checkpoint-800/adapter_model.safetensors b/checkpoint-800/adapter_model.safetensors new file mode 100644 index 0000000..3e8eed0 --- /dev/null +++ b/checkpoint-800/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d53c5f99f24e82920d898b6483f865156d3e39aece105fc9d276ee7de339b8e0 +size 671149168 diff --git a/checkpoint-800/optimizer.pt b/checkpoint-800/optimizer.pt new file mode 100644 index 0000000..5536994 --- /dev/null +++ b/checkpoint-800/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:10688482dc15870e99244e8bf27da3fba87d7f8e2d728b353519d1364f4a4e48 +size 1342562339 diff --git a/checkpoint-800/rng_state.pth b/checkpoint-800/rng_state.pth new file mode 100644 index 0000000..6e38db1 --- /dev/null +++ b/checkpoint-800/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:054257bb1236f32676e51256a2ed7db6c9aac042f3201893736ccd984422f2d3 +size 14645 diff --git a/checkpoint-800/scheduler.pt b/checkpoint-800/scheduler.pt new file mode 100644 index 0000000..8f798aa --- /dev/null +++ b/checkpoint-800/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:9712944284fb0cb3480a911521785b37cb130aaba60e1725920cf9c7ae6093ea +size 1465 diff --git a/checkpoint-800/trainer_state.json b/checkpoint-800/trainer_state.json new file mode 100644 index 0000000..2ac6a3f --- /dev/null +++ b/checkpoint-800/trainer_state.json @@ -0,0 +1,314 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.3888888888888888, + "eval_steps": 500, + "global_step": 800, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.034722222222222224, + "grad_norm": 2.985321283340454, + "learning_rate": 1.6379310344827587e-06, + "loss": 2.6523, + "step": 20 + }, + { + "epoch": 0.06944444444444445, + "grad_norm": 2.353632926940918, + "learning_rate": 3.362068965517242e-06, + "loss": 2.4359, + "step": 40 + }, + { + "epoch": 0.10416666666666667, + "grad_norm": 1.865394115447998, + "learning_rate": 5.086206896551724e-06, + "loss": 2.2545, + "step": 60 + }, + { + "epoch": 0.1388888888888889, + "grad_norm": 1.8125933408737183, + "learning_rate": 6.810344827586207e-06, + "loss": 2.0557, + "step": 80 + }, + { + "epoch": 0.1736111111111111, + "grad_norm": 2.3572490215301514, + "learning_rate": 8.53448275862069e-06, + "loss": 1.9334, + "step": 100 + }, + { + "epoch": 0.20833333333333334, + "grad_norm": 2.395277261734009, + "learning_rate": 9.999793100349294e-06, + "loss": 1.9212, + "step": 120 + }, + { + "epoch": 0.24305555555555555, + "grad_norm": 2.714841604232788, + "learning_rate": 9.987843743451796e-06, + "loss": 1.7889, + "step": 140 + }, + { + "epoch": 0.2777777777777778, + "grad_norm": 2.236692190170288, + "learning_rate": 9.957553516178782e-06, + "loss": 1.716, + "step": 160 + }, + { + "epoch": 0.3125, + "grad_norm": 2.3020412921905518, + "learning_rate": 9.909033799150947e-06, + "loss": 1.7569, + "step": 180 + }, + { + "epoch": 0.3472222222222222, + "grad_norm": 2.5109288692474365, + "learning_rate": 9.842463004902127e-06, + "loss": 1.6664, + "step": 200 + }, + { + "epoch": 0.3819444444444444, + "grad_norm": 2.5140888690948486, + "learning_rate": 9.758085921836076e-06, + "loss": 1.6544, + "step": 220 + }, + { + "epoch": 0.4166666666666667, + "grad_norm": 2.666377544403076, + "learning_rate": 9.656212814111567e-06, + "loss": 1.6608, + "step": 240 + }, + { + "epoch": 0.4513888888888889, + "grad_norm": 2.715240955352783, + "learning_rate": 9.53721828076571e-06, + "loss": 1.6353, + "step": 260 + }, + { + "epoch": 0.4861111111111111, + "grad_norm": 2.7697439193725586, + "learning_rate": 9.401539878270545e-06, + "loss": 1.6352, + "step": 280 + }, + { + "epoch": 0.5208333333333334, + "grad_norm": 2.9743459224700928, + "learning_rate": 9.249676511588e-06, + "loss": 1.6275, + "step": 300 + }, + { + "epoch": 0.5555555555555556, + "grad_norm": 2.955244541168213, + "learning_rate": 9.082186599639429e-06, + "loss": 1.6052, + "step": 320 + }, + { + "epoch": 0.5902777777777778, + "grad_norm": 2.6228716373443604, + "learning_rate": 8.899686021935554e-06, + "loss": 1.5924, + "step": 340 + }, + { + "epoch": 0.625, + "grad_norm": 2.7822635173797607, + "learning_rate": 8.702845853917242e-06, + "loss": 1.5711, + "step": 360 + }, + { + "epoch": 0.6597222222222222, + "grad_norm": 2.450777769088745, + "learning_rate": 8.492389899334572e-06, + "loss": 1.5601, + "step": 380 + }, + { + "epoch": 0.6944444444444444, + "grad_norm": 2.999849557876587, + "learning_rate": 8.269092028737885e-06, + "loss": 1.5497, + "step": 400 + }, + { + "epoch": 0.7291666666666666, + "grad_norm": 3.2980637550354004, + "learning_rate": 8.033773333867498e-06, + "loss": 1.5243, + "step": 420 + }, + { + "epoch": 0.7638888888888888, + "grad_norm": 2.758843421936035, + "learning_rate": 7.78729910840572e-06, + "loss": 1.5171, + "step": 440 + }, + { + "epoch": 0.7986111111111112, + "grad_norm": 3.114650249481201, + "learning_rate": 7.530575666193283e-06, + "loss": 1.5212, + "step": 460 + }, + { + "epoch": 0.8333333333333334, + "grad_norm": 3.235766649246216, + "learning_rate": 7.26454700860997e-06, + "loss": 1.5019, + "step": 480 + }, + { + "epoch": 0.8680555555555556, + "grad_norm": 3.39516544342041, + "learning_rate": 6.990191353373876e-06, + "loss": 1.4963, + "step": 500 + }, + { + "epoch": 0.9027777777777778, + "grad_norm": 3.507965087890625, + "learning_rate": 6.708517537523264e-06, + "loss": 1.4762, + "step": 520 + }, + { + "epoch": 0.9375, + "grad_norm": 3.2428181171417236, + "learning_rate": 6.420561307807713e-06, + "loss": 1.4822, + "step": 540 + }, + { + "epoch": 0.9722222222222222, + "grad_norm": 2.9236435890197754, + "learning_rate": 6.12738151212918e-06, + "loss": 1.5021, + "step": 560 + }, + { + "epoch": 1.0069444444444444, + "grad_norm": 3.689115047454834, + "learning_rate": 5.830056206037482e-06, + "loss": 1.4606, + "step": 580 + }, + { + "epoch": 1.0416666666666667, + "grad_norm": 2.897470474243164, + "learning_rate": 5.529678688597081e-06, + "loss": 1.3981, + "step": 600 + }, + { + "epoch": 1.0763888888888888, + "grad_norm": 3.1479601860046387, + "learning_rate": 5.2273534822017105e-06, + "loss": 1.4024, + "step": 620 + }, + { + "epoch": 1.1111111111111112, + "grad_norm": 3.726175546646118, + "learning_rate": 4.924192271119554e-06, + "loss": 1.3784, + "step": 640 + }, + { + "epoch": 1.1458333333333333, + "grad_norm": 2.944827079772949, + "learning_rate": 4.621309813703385e-06, + "loss": 1.3781, + "step": 660 + }, + { + "epoch": 1.1805555555555556, + "grad_norm": 4.154749870300293, + "learning_rate": 4.319819843296952e-06, + "loss": 1.385, + "step": 680 + }, + { + "epoch": 1.2152777777777777, + "grad_norm": 3.470216751098633, + "learning_rate": 4.020830972910433e-06, + "loss": 1.3937, + "step": 700 + }, + { + "epoch": 1.25, + "grad_norm": 3.534930944442749, + "learning_rate": 3.7254426187239567e-06, + "loss": 1.3471, + "step": 720 + }, + { + "epoch": 1.2847222222222223, + "grad_norm": 3.479079484939575, + "learning_rate": 3.4347409574088896e-06, + "loss": 1.364, + "step": 740 + }, + { + "epoch": 1.3194444444444444, + "grad_norm": 4.021931171417236, + "learning_rate": 3.149794932132331e-06, + "loss": 1.3875, + "step": 760 + }, + { + "epoch": 1.3541666666666667, + "grad_norm": 4.136874198913574, + "learning_rate": 2.871652321931161e-06, + "loss": 1.3603, + "step": 780 + }, + { + "epoch": 1.3888888888888888, + "grad_norm": 2.8454277515411377, + "learning_rate": 2.601335888909005e-06, + "loss": 1.3676, + "step": 800 + } + ], + "logging_steps": 20, + "max_steps": 1152, + "num_input_tokens_seen": 0, + "num_train_epochs": 2, + "save_steps": 50, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.628333255764869e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/checkpoint-800/training_args.bin b/checkpoint-800/training_args.bin new file mode 100644 index 0000000..925fd93 --- /dev/null +++ b/checkpoint-800/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3b7f58321eea14364587c280ddc055ad0a161fdb8a2e9d81351505baed73ddca +size 6033 diff --git a/checkpoint-850/README.md b/checkpoint-850/README.md new file mode 100644 index 0000000..bacf84a --- /dev/null +++ b/checkpoint-850/README.md @@ -0,0 +1,207 @@ +--- +base_model: biaofu-xmu/EAST-8B +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:biaofu-xmu/EAST-8B +- lora +- transformers +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.19.1 \ No newline at end of file diff --git a/checkpoint-850/adapter_config.json b/checkpoint-850/adapter_config.json new file mode 100644 index 0000000..44390c2 --- /dev/null +++ b/checkpoint-850/adapter_config.json @@ -0,0 +1,48 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "biaofu-xmu/EAST-8B", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.05, + "lora_ga_config": null, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.19.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "o_proj", + "k_proj", + "down_proj", + "q_proj", + "v_proj", + "up_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_bdlora": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/checkpoint-850/adapter_model.safetensors b/checkpoint-850/adapter_model.safetensors new file mode 100644 index 0000000..1b460b8 --- /dev/null +++ b/checkpoint-850/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3ce8223bc2bcc3ea5a90dede7bfe7d50042286368fa8a48888a42850b718cfa2 +size 671149168 diff --git a/checkpoint-850/optimizer.pt b/checkpoint-850/optimizer.pt new file mode 100644 index 0000000..32de0a5 --- /dev/null +++ b/checkpoint-850/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:5d44cfa161630979c4f79ba3c77df8a725f3563fd4285f07bfd26e248d3405e3 +size 1342562339 diff --git a/checkpoint-850/rng_state.pth b/checkpoint-850/rng_state.pth new file mode 100644 index 0000000..d3a82e8 --- /dev/null +++ b/checkpoint-850/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:55a9bdb5950dfc43ad326c25a146ec9d34873cb026f837bb052475211cd86b59 +size 14645 diff --git a/checkpoint-850/scheduler.pt b/checkpoint-850/scheduler.pt new file mode 100644 index 0000000..dc7ef30 --- /dev/null +++ b/checkpoint-850/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7d281893a88f586c1ef75eec259a2f50ece352b0e745fc416bb39ce4f50c0f3b +size 1465 diff --git a/checkpoint-850/trainer_state.json b/checkpoint-850/trainer_state.json new file mode 100644 index 0000000..d792e18 --- /dev/null +++ b/checkpoint-850/trainer_state.json @@ -0,0 +1,328 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.4756944444444444, + "eval_steps": 500, + "global_step": 850, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.034722222222222224, + "grad_norm": 2.985321283340454, + "learning_rate": 1.6379310344827587e-06, + "loss": 2.6523, + "step": 20 + }, + { + "epoch": 0.06944444444444445, + "grad_norm": 2.353632926940918, + "learning_rate": 3.362068965517242e-06, + "loss": 2.4359, + "step": 40 + }, + { + "epoch": 0.10416666666666667, + "grad_norm": 1.865394115447998, + "learning_rate": 5.086206896551724e-06, + "loss": 2.2545, + "step": 60 + }, + { + "epoch": 0.1388888888888889, + "grad_norm": 1.8125933408737183, + "learning_rate": 6.810344827586207e-06, + "loss": 2.0557, + "step": 80 + }, + { + "epoch": 0.1736111111111111, + "grad_norm": 2.3572490215301514, + "learning_rate": 8.53448275862069e-06, + "loss": 1.9334, + "step": 100 + }, + { + "epoch": 0.20833333333333334, + "grad_norm": 2.395277261734009, + "learning_rate": 9.999793100349294e-06, + "loss": 1.9212, + "step": 120 + }, + { + "epoch": 0.24305555555555555, + "grad_norm": 2.714841604232788, + "learning_rate": 9.987843743451796e-06, + "loss": 1.7889, + "step": 140 + }, + { + "epoch": 0.2777777777777778, + "grad_norm": 2.236692190170288, + "learning_rate": 9.957553516178782e-06, + "loss": 1.716, + "step": 160 + }, + { + "epoch": 0.3125, + "grad_norm": 2.3020412921905518, + "learning_rate": 9.909033799150947e-06, + "loss": 1.7569, + "step": 180 + }, + { + "epoch": 0.3472222222222222, + "grad_norm": 2.5109288692474365, + "learning_rate": 9.842463004902127e-06, + "loss": 1.6664, + "step": 200 + }, + { + "epoch": 0.3819444444444444, + "grad_norm": 2.5140888690948486, + "learning_rate": 9.758085921836076e-06, + "loss": 1.6544, + "step": 220 + }, + { + "epoch": 0.4166666666666667, + "grad_norm": 2.666377544403076, + "learning_rate": 9.656212814111567e-06, + "loss": 1.6608, + "step": 240 + }, + { + "epoch": 0.4513888888888889, + "grad_norm": 2.715240955352783, + "learning_rate": 9.53721828076571e-06, + "loss": 1.6353, + "step": 260 + }, + { + "epoch": 0.4861111111111111, + "grad_norm": 2.7697439193725586, + "learning_rate": 9.401539878270545e-06, + "loss": 1.6352, + "step": 280 + }, + { + "epoch": 0.5208333333333334, + "grad_norm": 2.9743459224700928, + "learning_rate": 9.249676511588e-06, + "loss": 1.6275, + "step": 300 + }, + { + "epoch": 0.5555555555555556, + "grad_norm": 2.955244541168213, + "learning_rate": 9.082186599639429e-06, + "loss": 1.6052, + "step": 320 + }, + { + "epoch": 0.5902777777777778, + "grad_norm": 2.6228716373443604, + "learning_rate": 8.899686021935554e-06, + "loss": 1.5924, + "step": 340 + }, + { + "epoch": 0.625, + "grad_norm": 2.7822635173797607, + "learning_rate": 8.702845853917242e-06, + "loss": 1.5711, + "step": 360 + }, + { + "epoch": 0.6597222222222222, + "grad_norm": 2.450777769088745, + "learning_rate": 8.492389899334572e-06, + "loss": 1.5601, + "step": 380 + }, + { + "epoch": 0.6944444444444444, + "grad_norm": 2.999849557876587, + "learning_rate": 8.269092028737885e-06, + "loss": 1.5497, + "step": 400 + }, + { + "epoch": 0.7291666666666666, + "grad_norm": 3.2980637550354004, + "learning_rate": 8.033773333867498e-06, + "loss": 1.5243, + "step": 420 + }, + { + "epoch": 0.7638888888888888, + "grad_norm": 2.758843421936035, + "learning_rate": 7.78729910840572e-06, + "loss": 1.5171, + "step": 440 + }, + { + "epoch": 0.7986111111111112, + "grad_norm": 3.114650249481201, + "learning_rate": 7.530575666193283e-06, + "loss": 1.5212, + "step": 460 + }, + { + "epoch": 0.8333333333333334, + "grad_norm": 3.235766649246216, + "learning_rate": 7.26454700860997e-06, + "loss": 1.5019, + "step": 480 + }, + { + "epoch": 0.8680555555555556, + "grad_norm": 3.39516544342041, + "learning_rate": 6.990191353373876e-06, + "loss": 1.4963, + "step": 500 + }, + { + "epoch": 0.9027777777777778, + "grad_norm": 3.507965087890625, + "learning_rate": 6.708517537523264e-06, + "loss": 1.4762, + "step": 520 + }, + { + "epoch": 0.9375, + "grad_norm": 3.2428181171417236, + "learning_rate": 6.420561307807713e-06, + "loss": 1.4822, + "step": 540 + }, + { + "epoch": 0.9722222222222222, + "grad_norm": 2.9236435890197754, + "learning_rate": 6.12738151212918e-06, + "loss": 1.5021, + "step": 560 + }, + { + "epoch": 1.0069444444444444, + "grad_norm": 3.689115047454834, + "learning_rate": 5.830056206037482e-06, + "loss": 1.4606, + "step": 580 + }, + { + "epoch": 1.0416666666666667, + "grad_norm": 2.897470474243164, + "learning_rate": 5.529678688597081e-06, + "loss": 1.3981, + "step": 600 + }, + { + "epoch": 1.0763888888888888, + "grad_norm": 3.1479601860046387, + "learning_rate": 5.2273534822017105e-06, + "loss": 1.4024, + "step": 620 + }, + { + "epoch": 1.1111111111111112, + "grad_norm": 3.726175546646118, + "learning_rate": 4.924192271119554e-06, + "loss": 1.3784, + "step": 640 + }, + { + "epoch": 1.1458333333333333, + "grad_norm": 2.944827079772949, + "learning_rate": 4.621309813703385e-06, + "loss": 1.3781, + "step": 660 + }, + { + "epoch": 1.1805555555555556, + "grad_norm": 4.154749870300293, + "learning_rate": 4.319819843296952e-06, + "loss": 1.385, + "step": 680 + }, + { + "epoch": 1.2152777777777777, + "grad_norm": 3.470216751098633, + "learning_rate": 4.020830972910433e-06, + "loss": 1.3937, + "step": 700 + }, + { + "epoch": 1.25, + "grad_norm": 3.534930944442749, + "learning_rate": 3.7254426187239567e-06, + "loss": 1.3471, + "step": 720 + }, + { + "epoch": 1.2847222222222223, + "grad_norm": 3.479079484939575, + "learning_rate": 3.4347409574088896e-06, + "loss": 1.364, + "step": 740 + }, + { + "epoch": 1.3194444444444444, + "grad_norm": 4.021931171417236, + "learning_rate": 3.149794932132331e-06, + "loss": 1.3875, + "step": 760 + }, + { + "epoch": 1.3541666666666667, + "grad_norm": 4.136874198913574, + "learning_rate": 2.871652321931161e-06, + "loss": 1.3603, + "step": 780 + }, + { + "epoch": 1.3888888888888888, + "grad_norm": 2.8454277515411377, + "learning_rate": 2.601335888909005e-06, + "loss": 1.3676, + "step": 800 + }, + { + "epoch": 1.4236111111111112, + "grad_norm": 3.8844242095947266, + "learning_rate": 2.339839617423318e-06, + "loss": 1.3327, + "step": 820 + }, + { + "epoch": 1.4583333333333333, + "grad_norm": 3.777667284011841, + "learning_rate": 2.0881250590915316e-06, + "loss": 1.351, + "step": 840 + } + ], + "logging_steps": 20, + "max_steps": 1152, + "num_input_tokens_seen": 0, + "num_train_epochs": 2, + "save_steps": 50, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.7317764056589926e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/checkpoint-850/training_args.bin b/checkpoint-850/training_args.bin new file mode 100644 index 0000000..925fd93 --- /dev/null +++ b/checkpoint-850/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3b7f58321eea14364587c280ddc055ad0a161fdb8a2e9d81351505baed73ddca +size 6033 diff --git a/checkpoint-900/README.md b/checkpoint-900/README.md new file mode 100644 index 0000000..bacf84a --- /dev/null +++ b/checkpoint-900/README.md @@ -0,0 +1,207 @@ +--- +base_model: biaofu-xmu/EAST-8B +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:biaofu-xmu/EAST-8B +- lora +- transformers +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.19.1 \ No newline at end of file diff --git a/checkpoint-900/adapter_config.json b/checkpoint-900/adapter_config.json new file mode 100644 index 0000000..44390c2 --- /dev/null +++ b/checkpoint-900/adapter_config.json @@ -0,0 +1,48 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "biaofu-xmu/EAST-8B", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.05, + "lora_ga_config": null, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.19.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "o_proj", + "k_proj", + "down_proj", + "q_proj", + "v_proj", + "up_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_bdlora": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/checkpoint-900/adapter_model.safetensors b/checkpoint-900/adapter_model.safetensors new file mode 100644 index 0000000..559f655 --- /dev/null +++ b/checkpoint-900/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:f7e957885cdf435ff34cde2a593b9e461be8fafce51b910595506c1653632f3a +size 671149168 diff --git a/checkpoint-900/optimizer.pt b/checkpoint-900/optimizer.pt new file mode 100644 index 0000000..40abd64 --- /dev/null +++ b/checkpoint-900/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0f9f99fc0354fc9fca282089ee1e7d468c2b45233beb7e1453bed4c4e89362ef +size 1342562339 diff --git a/checkpoint-900/rng_state.pth b/checkpoint-900/rng_state.pth new file mode 100644 index 0000000..9dfafb4 --- /dev/null +++ b/checkpoint-900/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:afcf22aa2a849a5842efb4e06f80d79a281a2534afe65e60d5388c1499555291 +size 14645 diff --git a/checkpoint-900/scheduler.pt b/checkpoint-900/scheduler.pt new file mode 100644 index 0000000..752ac2c --- /dev/null +++ b/checkpoint-900/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:5fa8717b84ecd3aafdf025100adb33e29dbdd998c3eda4e83725edc4c9c48219 +size 1465 diff --git a/checkpoint-900/trainer_state.json b/checkpoint-900/trainer_state.json new file mode 100644 index 0000000..420fa49 --- /dev/null +++ b/checkpoint-900/trainer_state.json @@ -0,0 +1,349 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.5625, + "eval_steps": 500, + "global_step": 900, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.034722222222222224, + "grad_norm": 2.985321283340454, + "learning_rate": 1.6379310344827587e-06, + "loss": 2.6523, + "step": 20 + }, + { + "epoch": 0.06944444444444445, + "grad_norm": 2.353632926940918, + "learning_rate": 3.362068965517242e-06, + "loss": 2.4359, + "step": 40 + }, + { + "epoch": 0.10416666666666667, + "grad_norm": 1.865394115447998, + "learning_rate": 5.086206896551724e-06, + "loss": 2.2545, + "step": 60 + }, + { + "epoch": 0.1388888888888889, + "grad_norm": 1.8125933408737183, + "learning_rate": 6.810344827586207e-06, + "loss": 2.0557, + "step": 80 + }, + { + "epoch": 0.1736111111111111, + "grad_norm": 2.3572490215301514, + "learning_rate": 8.53448275862069e-06, + "loss": 1.9334, + "step": 100 + }, + { + "epoch": 0.20833333333333334, + "grad_norm": 2.395277261734009, + "learning_rate": 9.999793100349294e-06, + "loss": 1.9212, + "step": 120 + }, + { + "epoch": 0.24305555555555555, + "grad_norm": 2.714841604232788, + "learning_rate": 9.987843743451796e-06, + "loss": 1.7889, + "step": 140 + }, + { + "epoch": 0.2777777777777778, + "grad_norm": 2.236692190170288, + "learning_rate": 9.957553516178782e-06, + "loss": 1.716, + "step": 160 + }, + { + "epoch": 0.3125, + "grad_norm": 2.3020412921905518, + "learning_rate": 9.909033799150947e-06, + "loss": 1.7569, + "step": 180 + }, + { + "epoch": 0.3472222222222222, + "grad_norm": 2.5109288692474365, + "learning_rate": 9.842463004902127e-06, + "loss": 1.6664, + "step": 200 + }, + { + "epoch": 0.3819444444444444, + "grad_norm": 2.5140888690948486, + "learning_rate": 9.758085921836076e-06, + "loss": 1.6544, + "step": 220 + }, + { + "epoch": 0.4166666666666667, + "grad_norm": 2.666377544403076, + "learning_rate": 9.656212814111567e-06, + "loss": 1.6608, + "step": 240 + }, + { + "epoch": 0.4513888888888889, + "grad_norm": 2.715240955352783, + "learning_rate": 9.53721828076571e-06, + "loss": 1.6353, + "step": 260 + }, + { + "epoch": 0.4861111111111111, + "grad_norm": 2.7697439193725586, + "learning_rate": 9.401539878270545e-06, + "loss": 1.6352, + "step": 280 + }, + { + "epoch": 0.5208333333333334, + "grad_norm": 2.9743459224700928, + "learning_rate": 9.249676511588e-06, + "loss": 1.6275, + "step": 300 + }, + { + "epoch": 0.5555555555555556, + "grad_norm": 2.955244541168213, + "learning_rate": 9.082186599639429e-06, + "loss": 1.6052, + "step": 320 + }, + { + "epoch": 0.5902777777777778, + "grad_norm": 2.6228716373443604, + "learning_rate": 8.899686021935554e-06, + "loss": 1.5924, + "step": 340 + }, + { + "epoch": 0.625, + "grad_norm": 2.7822635173797607, + "learning_rate": 8.702845853917242e-06, + "loss": 1.5711, + "step": 360 + }, + { + "epoch": 0.6597222222222222, + "grad_norm": 2.450777769088745, + "learning_rate": 8.492389899334572e-06, + "loss": 1.5601, + "step": 380 + }, + { + "epoch": 0.6944444444444444, + "grad_norm": 2.999849557876587, + "learning_rate": 8.269092028737885e-06, + "loss": 1.5497, + "step": 400 + }, + { + "epoch": 0.7291666666666666, + "grad_norm": 3.2980637550354004, + "learning_rate": 8.033773333867498e-06, + "loss": 1.5243, + "step": 420 + }, + { + "epoch": 0.7638888888888888, + "grad_norm": 2.758843421936035, + "learning_rate": 7.78729910840572e-06, + "loss": 1.5171, + "step": 440 + }, + { + "epoch": 0.7986111111111112, + "grad_norm": 3.114650249481201, + "learning_rate": 7.530575666193283e-06, + "loss": 1.5212, + "step": 460 + }, + { + "epoch": 0.8333333333333334, + "grad_norm": 3.235766649246216, + "learning_rate": 7.26454700860997e-06, + "loss": 1.5019, + "step": 480 + }, + { + "epoch": 0.8680555555555556, + "grad_norm": 3.39516544342041, + "learning_rate": 6.990191353373876e-06, + "loss": 1.4963, + "step": 500 + }, + { + "epoch": 0.9027777777777778, + "grad_norm": 3.507965087890625, + "learning_rate": 6.708517537523264e-06, + "loss": 1.4762, + "step": 520 + }, + { + "epoch": 0.9375, + "grad_norm": 3.2428181171417236, + "learning_rate": 6.420561307807713e-06, + "loss": 1.4822, + "step": 540 + }, + { + "epoch": 0.9722222222222222, + "grad_norm": 2.9236435890197754, + "learning_rate": 6.12738151212918e-06, + "loss": 1.5021, + "step": 560 + }, + { + "epoch": 1.0069444444444444, + "grad_norm": 3.689115047454834, + "learning_rate": 5.830056206037482e-06, + "loss": 1.4606, + "step": 580 + }, + { + "epoch": 1.0416666666666667, + "grad_norm": 2.897470474243164, + "learning_rate": 5.529678688597081e-06, + "loss": 1.3981, + "step": 600 + }, + { + "epoch": 1.0763888888888888, + "grad_norm": 3.1479601860046387, + "learning_rate": 5.2273534822017105e-06, + "loss": 1.4024, + "step": 620 + }, + { + "epoch": 1.1111111111111112, + "grad_norm": 3.726175546646118, + "learning_rate": 4.924192271119554e-06, + "loss": 1.3784, + "step": 640 + }, + { + "epoch": 1.1458333333333333, + "grad_norm": 2.944827079772949, + "learning_rate": 4.621309813703385e-06, + "loss": 1.3781, + "step": 660 + }, + { + "epoch": 1.1805555555555556, + "grad_norm": 4.154749870300293, + "learning_rate": 4.319819843296952e-06, + "loss": 1.385, + "step": 680 + }, + { + "epoch": 1.2152777777777777, + "grad_norm": 3.470216751098633, + "learning_rate": 4.020830972910433e-06, + "loss": 1.3937, + "step": 700 + }, + { + "epoch": 1.25, + "grad_norm": 3.534930944442749, + "learning_rate": 3.7254426187239567e-06, + "loss": 1.3471, + "step": 720 + }, + { + "epoch": 1.2847222222222223, + "grad_norm": 3.479079484939575, + "learning_rate": 3.4347409574088896e-06, + "loss": 1.364, + "step": 740 + }, + { + "epoch": 1.3194444444444444, + "grad_norm": 4.021931171417236, + "learning_rate": 3.149794932132331e-06, + "loss": 1.3875, + "step": 760 + }, + { + "epoch": 1.3541666666666667, + "grad_norm": 4.136874198913574, + "learning_rate": 2.871652321931161e-06, + "loss": 1.3603, + "step": 780 + }, + { + "epoch": 1.3888888888888888, + "grad_norm": 2.8454277515411377, + "learning_rate": 2.601335888909005e-06, + "loss": 1.3676, + "step": 800 + }, + { + "epoch": 1.4236111111111112, + "grad_norm": 3.8844242095947266, + "learning_rate": 2.339839617423318e-06, + "loss": 1.3327, + "step": 820 + }, + { + "epoch": 1.4583333333333333, + "grad_norm": 3.777667284011841, + "learning_rate": 2.0881250590915316e-06, + "loss": 1.351, + "step": 840 + }, + { + "epoch": 1.4930555555555556, + "grad_norm": 3.9106264114379883, + "learning_rate": 1.8471177970560712e-06, + "loss": 1.3651, + "step": 860 + }, + { + "epoch": 1.5277777777777777, + "grad_norm": 3.131366014480591, + "learning_rate": 1.6177040425095664e-06, + "loss": 1.3271, + "step": 880 + }, + { + "epoch": 1.5625, + "grad_norm": 3.60107421875, + "learning_rate": 1.40072737599522e-06, + "loss": 1.3627, + "step": 900 + } + ], + "logging_steps": 20, + "max_steps": 1152, + "num_input_tokens_seen": 0, + "num_train_epochs": 2, + "save_steps": 50, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.8330576226320384e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/checkpoint-900/training_args.bin b/checkpoint-900/training_args.bin new file mode 100644 index 0000000..925fd93 --- /dev/null +++ b/checkpoint-900/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3b7f58321eea14364587c280ddc055ad0a161fdb8a2e9d81351505baed73ddca +size 6033 diff --git a/checkpoint-950/README.md b/checkpoint-950/README.md new file mode 100644 index 0000000..bacf84a --- /dev/null +++ b/checkpoint-950/README.md @@ -0,0 +1,207 @@ +--- +base_model: biaofu-xmu/EAST-8B +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:biaofu-xmu/EAST-8B +- lora +- transformers +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.19.1 \ No newline at end of file diff --git a/checkpoint-950/adapter_config.json b/checkpoint-950/adapter_config.json new file mode 100644 index 0000000..44390c2 --- /dev/null +++ b/checkpoint-950/adapter_config.json @@ -0,0 +1,48 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "biaofu-xmu/EAST-8B", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.05, + "lora_ga_config": null, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.19.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "o_proj", + "k_proj", + "down_proj", + "q_proj", + "v_proj", + "up_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_bdlora": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/checkpoint-950/adapter_model.safetensors b/checkpoint-950/adapter_model.safetensors new file mode 100644 index 0000000..32a57ff --- /dev/null +++ b/checkpoint-950/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ff91789e1e5161937921903c1c0bd472ce0e018114170d42a14836fd40f6597b +size 671149168 diff --git a/checkpoint-950/optimizer.pt b/checkpoint-950/optimizer.pt new file mode 100644 index 0000000..920b8be --- /dev/null +++ b/checkpoint-950/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6445534d641bd4d3edea7f83ae526a604bf4f11ea4153a0e31c351362ad7e030 +size 1342562339 diff --git a/checkpoint-950/rng_state.pth b/checkpoint-950/rng_state.pth new file mode 100644 index 0000000..9702c7a --- /dev/null +++ b/checkpoint-950/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6876f60da7dd6feeb864b91205a457a59eb4ab919577ef50c797664be1413589 +size 14645 diff --git a/checkpoint-950/scheduler.pt b/checkpoint-950/scheduler.pt new file mode 100644 index 0000000..f68e810 --- /dev/null +++ b/checkpoint-950/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e96b0deceec755ce9e150cc4f2fb1d1ed2f491e7dd6980aa723ae9f45f4ebfb3 +size 1465 diff --git a/checkpoint-950/trainer_state.json b/checkpoint-950/trainer_state.json new file mode 100644 index 0000000..b17f7a1 --- /dev/null +++ b/checkpoint-950/trainer_state.json @@ -0,0 +1,363 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.6493055555555556, + "eval_steps": 500, + "global_step": 950, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.034722222222222224, + "grad_norm": 2.985321283340454, + "learning_rate": 1.6379310344827587e-06, + "loss": 2.6523, + "step": 20 + }, + { + "epoch": 0.06944444444444445, + "grad_norm": 2.353632926940918, + "learning_rate": 3.362068965517242e-06, + "loss": 2.4359, + "step": 40 + }, + { + "epoch": 0.10416666666666667, + "grad_norm": 1.865394115447998, + "learning_rate": 5.086206896551724e-06, + "loss": 2.2545, + "step": 60 + }, + { + "epoch": 0.1388888888888889, + "grad_norm": 1.8125933408737183, + "learning_rate": 6.810344827586207e-06, + "loss": 2.0557, + "step": 80 + }, + { + "epoch": 0.1736111111111111, + "grad_norm": 2.3572490215301514, + "learning_rate": 8.53448275862069e-06, + "loss": 1.9334, + "step": 100 + }, + { + "epoch": 0.20833333333333334, + "grad_norm": 2.395277261734009, + "learning_rate": 9.999793100349294e-06, + "loss": 1.9212, + "step": 120 + }, + { + "epoch": 0.24305555555555555, + "grad_norm": 2.714841604232788, + "learning_rate": 9.987843743451796e-06, + "loss": 1.7889, + "step": 140 + }, + { + "epoch": 0.2777777777777778, + "grad_norm": 2.236692190170288, + "learning_rate": 9.957553516178782e-06, + "loss": 1.716, + "step": 160 + }, + { + "epoch": 0.3125, + "grad_norm": 2.3020412921905518, + "learning_rate": 9.909033799150947e-06, + "loss": 1.7569, + "step": 180 + }, + { + "epoch": 0.3472222222222222, + "grad_norm": 2.5109288692474365, + "learning_rate": 9.842463004902127e-06, + "loss": 1.6664, + "step": 200 + }, + { + "epoch": 0.3819444444444444, + "grad_norm": 2.5140888690948486, + "learning_rate": 9.758085921836076e-06, + "loss": 1.6544, + "step": 220 + }, + { + "epoch": 0.4166666666666667, + "grad_norm": 2.666377544403076, + "learning_rate": 9.656212814111567e-06, + "loss": 1.6608, + "step": 240 + }, + { + "epoch": 0.4513888888888889, + "grad_norm": 2.715240955352783, + "learning_rate": 9.53721828076571e-06, + "loss": 1.6353, + "step": 260 + }, + { + "epoch": 0.4861111111111111, + "grad_norm": 2.7697439193725586, + "learning_rate": 9.401539878270545e-06, + "loss": 1.6352, + "step": 280 + }, + { + "epoch": 0.5208333333333334, + "grad_norm": 2.9743459224700928, + "learning_rate": 9.249676511588e-06, + "loss": 1.6275, + "step": 300 + }, + { + "epoch": 0.5555555555555556, + "grad_norm": 2.955244541168213, + "learning_rate": 9.082186599639429e-06, + "loss": 1.6052, + "step": 320 + }, + { + "epoch": 0.5902777777777778, + "grad_norm": 2.6228716373443604, + "learning_rate": 8.899686021935554e-06, + "loss": 1.5924, + "step": 340 + }, + { + "epoch": 0.625, + "grad_norm": 2.7822635173797607, + "learning_rate": 8.702845853917242e-06, + "loss": 1.5711, + "step": 360 + }, + { + "epoch": 0.6597222222222222, + "grad_norm": 2.450777769088745, + "learning_rate": 8.492389899334572e-06, + "loss": 1.5601, + "step": 380 + }, + { + "epoch": 0.6944444444444444, + "grad_norm": 2.999849557876587, + "learning_rate": 8.269092028737885e-06, + "loss": 1.5497, + "step": 400 + }, + { + "epoch": 0.7291666666666666, + "grad_norm": 3.2980637550354004, + "learning_rate": 8.033773333867498e-06, + "loss": 1.5243, + "step": 420 + }, + { + "epoch": 0.7638888888888888, + "grad_norm": 2.758843421936035, + "learning_rate": 7.78729910840572e-06, + "loss": 1.5171, + "step": 440 + }, + { + "epoch": 0.7986111111111112, + "grad_norm": 3.114650249481201, + "learning_rate": 7.530575666193283e-06, + "loss": 1.5212, + "step": 460 + }, + { + "epoch": 0.8333333333333334, + "grad_norm": 3.235766649246216, + "learning_rate": 7.26454700860997e-06, + "loss": 1.5019, + "step": 480 + }, + { + "epoch": 0.8680555555555556, + "grad_norm": 3.39516544342041, + "learning_rate": 6.990191353373876e-06, + "loss": 1.4963, + "step": 500 + }, + { + "epoch": 0.9027777777777778, + "grad_norm": 3.507965087890625, + "learning_rate": 6.708517537523264e-06, + "loss": 1.4762, + "step": 520 + }, + { + "epoch": 0.9375, + "grad_norm": 3.2428181171417236, + "learning_rate": 6.420561307807713e-06, + "loss": 1.4822, + "step": 540 + }, + { + "epoch": 0.9722222222222222, + "grad_norm": 2.9236435890197754, + "learning_rate": 6.12738151212918e-06, + "loss": 1.5021, + "step": 560 + }, + { + "epoch": 1.0069444444444444, + "grad_norm": 3.689115047454834, + "learning_rate": 5.830056206037482e-06, + "loss": 1.4606, + "step": 580 + }, + { + "epoch": 1.0416666666666667, + "grad_norm": 2.897470474243164, + "learning_rate": 5.529678688597081e-06, + "loss": 1.3981, + "step": 600 + }, + { + "epoch": 1.0763888888888888, + "grad_norm": 3.1479601860046387, + "learning_rate": 5.2273534822017105e-06, + "loss": 1.4024, + "step": 620 + }, + { + "epoch": 1.1111111111111112, + "grad_norm": 3.726175546646118, + "learning_rate": 4.924192271119554e-06, + "loss": 1.3784, + "step": 640 + }, + { + "epoch": 1.1458333333333333, + "grad_norm": 2.944827079772949, + "learning_rate": 4.621309813703385e-06, + "loss": 1.3781, + "step": 660 + }, + { + "epoch": 1.1805555555555556, + "grad_norm": 4.154749870300293, + "learning_rate": 4.319819843296952e-06, + "loss": 1.385, + "step": 680 + }, + { + "epoch": 1.2152777777777777, + "grad_norm": 3.470216751098633, + "learning_rate": 4.020830972910433e-06, + "loss": 1.3937, + "step": 700 + }, + { + "epoch": 1.25, + "grad_norm": 3.534930944442749, + "learning_rate": 3.7254426187239567e-06, + "loss": 1.3471, + "step": 720 + }, + { + "epoch": 1.2847222222222223, + "grad_norm": 3.479079484939575, + "learning_rate": 3.4347409574088896e-06, + "loss": 1.364, + "step": 740 + }, + { + "epoch": 1.3194444444444444, + "grad_norm": 4.021931171417236, + "learning_rate": 3.149794932132331e-06, + "loss": 1.3875, + "step": 760 + }, + { + "epoch": 1.3541666666666667, + "grad_norm": 4.136874198913574, + "learning_rate": 2.871652321931161e-06, + "loss": 1.3603, + "step": 780 + }, + { + "epoch": 1.3888888888888888, + "grad_norm": 2.8454277515411377, + "learning_rate": 2.601335888909005e-06, + "loss": 1.3676, + "step": 800 + }, + { + "epoch": 1.4236111111111112, + "grad_norm": 3.8844242095947266, + "learning_rate": 2.339839617423318e-06, + "loss": 1.3327, + "step": 820 + }, + { + "epoch": 1.4583333333333333, + "grad_norm": 3.777667284011841, + "learning_rate": 2.0881250590915316e-06, + "loss": 1.351, + "step": 840 + }, + { + "epoch": 1.4930555555555556, + "grad_norm": 3.9106264114379883, + "learning_rate": 1.8471177970560712e-06, + "loss": 1.3651, + "step": 860 + }, + { + "epoch": 1.5277777777777777, + "grad_norm": 3.131366014480591, + "learning_rate": 1.6177040425095664e-06, + "loss": 1.3271, + "step": 880 + }, + { + "epoch": 1.5625, + "grad_norm": 3.60107421875, + "learning_rate": 1.40072737599522e-06, + "loss": 1.3627, + "step": 900 + }, + { + "epoch": 1.5972222222222223, + "grad_norm": 3.059379816055298, + "learning_rate": 1.196985645464921e-06, + "loss": 1.3369, + "step": 920 + }, + { + "epoch": 1.6319444444444444, + "grad_norm": 4.2240095138549805, + "learning_rate": 1.0072280325013185e-06, + "loss": 1.3439, + "step": 940 + } + ], + "logging_steps": 20, + "max_steps": 1152, + "num_input_tokens_seen": 0, + "num_train_epochs": 2, + "save_steps": 50, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.9362963648990413e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/checkpoint-950/training_args.bin b/checkpoint-950/training_args.bin new file mode 100644 index 0000000..925fd93 --- /dev/null +++ b/checkpoint-950/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3b7f58321eea14364587c280ddc055ad0a161fdb8a2e9d81351505baed73ddca +size 6033 diff --git a/config.json b/config.json new file mode 100644 index 0000000..640d98b --- /dev/null +++ b/config.json @@ -0,0 +1,29 @@ +{ + "architectures": [ + "LlamaForCausalLM" + ], + "attention_bias": false, + "attention_dropout": 0.0, + "bos_token_id": 128000, + "dtype": "bfloat16", + "eos_token_id": 128001, + "head_dim": 128, + "hidden_act": "silu", + "hidden_size": 4096, + "initializer_range": 0.02, + "intermediate_size": 14336, + "max_position_embeddings": 8192, + "mlp_bias": false, + "model_type": "llama", + "num_attention_heads": 32, + "num_hidden_layers": 32, + "num_key_value_heads": 8, + "pretraining_tp": 1, + "rms_norm_eps": 1e-05, + "rope_scaling": null, + "rope_theta": 500000.0, + "tie_word_embeddings": false, + "transformers_version": "4.57.6", + "use_cache": true, + "vocab_size": 128320 +} diff --git a/generation_config.json b/generation_config.json new file mode 100644 index 0000000..bab1302 --- /dev/null +++ b/generation_config.json @@ -0,0 +1,6 @@ +{ + "_from_model_config": true, + "bos_token_id": 128000, + "eos_token_id": 128001, + "transformers_version": "4.57.6" +} diff --git a/last-checkpoint/README.md b/last-checkpoint/README.md new file mode 100644 index 0000000..bacf84a --- /dev/null +++ b/last-checkpoint/README.md @@ -0,0 +1,207 @@ +--- +base_model: biaofu-xmu/EAST-8B +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:biaofu-xmu/EAST-8B +- lora +- transformers +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.19.1 \ No newline at end of file diff --git a/last-checkpoint/adapter_config.json b/last-checkpoint/adapter_config.json new file mode 100644 index 0000000..05d9c96 --- /dev/null +++ b/last-checkpoint/adapter_config.json @@ -0,0 +1,48 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "biaofu-xmu/EAST-8B", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.05, + "lora_ga_config": null, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.19.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "v_proj", + "q_proj", + "k_proj", + "gate_proj", + "o_proj", + "down_proj", + "up_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_bdlora": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/last-checkpoint/adapter_model.safetensors b/last-checkpoint/adapter_model.safetensors new file mode 100644 index 0000000..ea4be1a --- /dev/null +++ b/last-checkpoint/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:cb76ab90c930eda4c5f96bbae36464a39848eac93333e8b3aa9200d47c25465f +size 671149168 diff --git a/last-checkpoint/optimizer.pt b/last-checkpoint/optimizer.pt new file mode 100644 index 0000000..18a213e --- /dev/null +++ b/last-checkpoint/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d3bfb4b86d46bff7ecbd661858c00fb2b311f3a0cafa95be91c1cc24af32ea1c +size 1342562339 diff --git a/last-checkpoint/rng_state.pth b/last-checkpoint/rng_state.pth new file mode 100644 index 0000000..602de4d --- /dev/null +++ b/last-checkpoint/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c2faa2348c8dd051a0f8b65896fc7494d2594c8d04a70b968dbb22bf1ede1e00 +size 14645 diff --git a/last-checkpoint/scheduler.pt b/last-checkpoint/scheduler.pt new file mode 100644 index 0000000..d432e90 --- /dev/null +++ b/last-checkpoint/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:28b81089eb143a676da720978f118caf9eee0a372736c9ef6f38cdec3dd8d997 +size 1465 diff --git a/last-checkpoint/trainer_state.json b/last-checkpoint/trainer_state.json new file mode 100644 index 0000000..c131719 --- /dev/null +++ b/last-checkpoint/trainer_state.json @@ -0,0 +1,433 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.9965277777777777, + "eval_steps": 500, + "global_step": 1150, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.034722222222222224, + "grad_norm": 2.9706010818481445, + "learning_rate": 1.6379310344827587e-06, + "loss": 2.6526, + "step": 20 + }, + { + "epoch": 0.06944444444444445, + "grad_norm": 2.301450252532959, + "learning_rate": 3.362068965517242e-06, + "loss": 2.4373, + "step": 40 + }, + { + "epoch": 0.10416666666666667, + "grad_norm": 1.887258768081665, + "learning_rate": 5.086206896551724e-06, + "loss": 2.2579, + "step": 60 + }, + { + "epoch": 0.1388888888888889, + "grad_norm": 1.8088752031326294, + "learning_rate": 6.810344827586207e-06, + "loss": 2.0574, + "step": 80 + }, + { + "epoch": 0.1736111111111111, + "grad_norm": 2.360595464706421, + "learning_rate": 8.53448275862069e-06, + "loss": 1.9347, + "step": 100 + }, + { + "epoch": 0.20833333333333334, + "grad_norm": 2.33787202835083, + "learning_rate": 9.999793100349294e-06, + "loss": 1.9226, + "step": 120 + }, + { + "epoch": 0.24305555555555555, + "grad_norm": 2.6820693016052246, + "learning_rate": 9.987843743451796e-06, + "loss": 1.7899, + "step": 140 + }, + { + "epoch": 0.2777777777777778, + "grad_norm": 2.2135610580444336, + "learning_rate": 9.957553516178782e-06, + "loss": 1.7165, + "step": 160 + }, + { + "epoch": 0.3125, + "grad_norm": 2.3095242977142334, + "learning_rate": 9.909033799150947e-06, + "loss": 1.7574, + "step": 180 + }, + { + "epoch": 0.3472222222222222, + "grad_norm": 2.454951286315918, + "learning_rate": 9.842463004902127e-06, + "loss": 1.6666, + "step": 200 + }, + { + "epoch": 0.3819444444444444, + "grad_norm": 2.481191635131836, + "learning_rate": 9.758085921836076e-06, + "loss": 1.6552, + "step": 220 + }, + { + "epoch": 0.4166666666666667, + "grad_norm": 2.6448044776916504, + "learning_rate": 9.656212814111567e-06, + "loss": 1.6608, + "step": 240 + }, + { + "epoch": 0.4513888888888889, + "grad_norm": 2.7130963802337646, + "learning_rate": 9.53721828076571e-06, + "loss": 1.6351, + "step": 260 + }, + { + "epoch": 0.4861111111111111, + "grad_norm": 2.743367910385132, + "learning_rate": 9.401539878270545e-06, + "loss": 1.6349, + "step": 280 + }, + { + "epoch": 0.5208333333333334, + "grad_norm": 3.0086171627044678, + "learning_rate": 9.249676511588e-06, + "loss": 1.6278, + "step": 300 + }, + { + "epoch": 0.5555555555555556, + "grad_norm": 2.9393539428710938, + "learning_rate": 9.082186599639429e-06, + "loss": 1.6052, + "step": 320 + }, + { + "epoch": 0.5902777777777778, + "grad_norm": 2.597963333129883, + "learning_rate": 8.899686021935554e-06, + "loss": 1.5917, + "step": 340 + }, + { + "epoch": 0.625, + "grad_norm": 2.7481658458709717, + "learning_rate": 8.702845853917242e-06, + "loss": 1.5707, + "step": 360 + }, + { + "epoch": 0.6597222222222222, + "grad_norm": 2.4585466384887695, + "learning_rate": 8.492389899334572e-06, + "loss": 1.5603, + "step": 380 + }, + { + "epoch": 0.6944444444444444, + "grad_norm": 2.9498300552368164, + "learning_rate": 8.269092028737885e-06, + "loss": 1.5495, + "step": 400 + }, + { + "epoch": 0.7291666666666666, + "grad_norm": 3.2819886207580566, + "learning_rate": 8.033773333867498e-06, + "loss": 1.5243, + "step": 420 + }, + { + "epoch": 0.7638888888888888, + "grad_norm": 2.6484131813049316, + "learning_rate": 7.78729910840572e-06, + "loss": 1.5168, + "step": 440 + }, + { + "epoch": 0.7986111111111112, + "grad_norm": 3.1172244548797607, + "learning_rate": 7.530575666193283e-06, + "loss": 1.5212, + "step": 460 + }, + { + "epoch": 0.8333333333333334, + "grad_norm": 3.2422311305999756, + "learning_rate": 7.26454700860997e-06, + "loss": 1.502, + "step": 480 + }, + { + "epoch": 0.8680555555555556, + "grad_norm": 3.3628528118133545, + "learning_rate": 6.990191353373876e-06, + "loss": 1.4961, + "step": 500 + }, + { + "epoch": 0.9027777777777778, + "grad_norm": 3.575122833251953, + "learning_rate": 6.708517537523264e-06, + "loss": 1.4765, + "step": 520 + }, + { + "epoch": 0.9375, + "grad_norm": 3.2372570037841797, + "learning_rate": 6.420561307807713e-06, + "loss": 1.4824, + "step": 540 + }, + { + "epoch": 0.9722222222222222, + "grad_norm": 2.8427066802978516, + "learning_rate": 6.12738151212918e-06, + "loss": 1.5022, + "step": 560 + }, + { + "epoch": 1.0069444444444444, + "grad_norm": 3.6458754539489746, + "learning_rate": 5.830056206037482e-06, + "loss": 1.46, + "step": 580 + }, + { + "epoch": 1.0416666666666667, + "grad_norm": 2.912978172302246, + "learning_rate": 5.529678688597081e-06, + "loss": 1.398, + "step": 600 + }, + { + "epoch": 1.0763888888888888, + "grad_norm": 3.1993274688720703, + "learning_rate": 5.2273534822017105e-06, + "loss": 1.4026, + "step": 620 + }, + { + "epoch": 1.1111111111111112, + "grad_norm": 3.731698989868164, + "learning_rate": 4.924192271119554e-06, + "loss": 1.3785, + "step": 640 + }, + { + "epoch": 1.1458333333333333, + "grad_norm": 2.932826519012451, + "learning_rate": 4.621309813703385e-06, + "loss": 1.3778, + "step": 660 + }, + { + "epoch": 1.1805555555555556, + "grad_norm": 4.353283882141113, + "learning_rate": 4.319819843296952e-06, + "loss": 1.3851, + "step": 680 + }, + { + "epoch": 1.2152777777777777, + "grad_norm": 3.4666543006896973, + "learning_rate": 4.020830972910433e-06, + "loss": 1.3936, + "step": 700 + }, + { + "epoch": 1.25, + "grad_norm": 3.56022572517395, + "learning_rate": 3.7254426187239567e-06, + "loss": 1.347, + "step": 720 + }, + { + "epoch": 1.2847222222222223, + "grad_norm": 3.4826321601867676, + "learning_rate": 3.4347409574088896e-06, + "loss": 1.3648, + "step": 740 + }, + { + "epoch": 1.3194444444444444, + "grad_norm": 4.019125461578369, + "learning_rate": 3.149794932132331e-06, + "loss": 1.3877, + "step": 760 + }, + { + "epoch": 1.3541666666666667, + "grad_norm": 4.1424455642700195, + "learning_rate": 2.871652321931161e-06, + "loss": 1.3616, + "step": 780 + }, + { + "epoch": 1.3888888888888888, + "grad_norm": 2.841132879257202, + "learning_rate": 2.601335888909005e-06, + "loss": 1.3681, + "step": 800 + }, + { + "epoch": 1.4236111111111112, + "grad_norm": 3.864380359649658, + "learning_rate": 2.339839617423318e-06, + "loss": 1.3329, + "step": 820 + }, + { + "epoch": 1.4583333333333333, + "grad_norm": 3.7631781101226807, + "learning_rate": 2.0881250590915316e-06, + "loss": 1.3516, + "step": 840 + }, + { + "epoch": 1.4930555555555556, + "grad_norm": 3.9342710971832275, + "learning_rate": 1.8471177970560712e-06, + "loss": 1.3654, + "step": 860 + }, + { + "epoch": 1.5277777777777777, + "grad_norm": 3.125939130783081, + "learning_rate": 1.6177040425095664e-06, + "loss": 1.3275, + "step": 880 + }, + { + "epoch": 1.5625, + "grad_norm": 3.5633015632629395, + "learning_rate": 1.40072737599522e-06, + "loss": 1.3625, + "step": 900 + }, + { + "epoch": 1.5972222222222223, + "grad_norm": 3.0462486743927, + "learning_rate": 1.196985645464921e-06, + "loss": 1.3374, + "step": 920 + }, + { + "epoch": 1.6319444444444444, + "grad_norm": 4.204705715179443, + "learning_rate": 1.0072280325013185e-06, + "loss": 1.3436, + "step": 940 + }, + { + "epoch": 1.6666666666666665, + "grad_norm": 3.840958833694458, + "learning_rate": 8.321522974916968e-07, + "loss": 1.3617, + "step": 960 + }, + { + "epoch": 1.7013888888888888, + "grad_norm": 4.040160179138184, + "learning_rate": 6.724022138834341e-07, + "loss": 1.3318, + "step": 980 + }, + { + "epoch": 1.7361111111111112, + "grad_norm": 3.265064001083374, + "learning_rate": 5.285652009556075e-07, + "loss": 1.3269, + "step": 1000 + }, + { + "epoch": 1.7708333333333335, + "grad_norm": 4.094176769256592, + "learning_rate": 4.0117016381130636e-07, + "loss": 1.3373, + "step": 1020 + }, + { + "epoch": 1.8055555555555556, + "grad_norm": 3.8886730670928955, + "learning_rate": 2.906855485332305e-07, + "loss": 1.3045, + "step": 1040 + }, + { + "epoch": 1.8402777777777777, + "grad_norm": 3.6427135467529297, + "learning_rate": 1.975176196540185e-07, + "loss": 1.3346, + "step": 1060 + }, + { + "epoch": 1.875, + "grad_norm": 4.0230793952941895, + "learning_rate": 1.2200896627521718e-07, + "loss": 1.3439, + "step": 1080 + }, + { + "epoch": 1.9097222222222223, + "grad_norm": 3.616853952407837, + "learning_rate": 6.443724232808146e-08, + "loss": 1.3216, + "step": 1100 + }, + { + "epoch": 1.9444444444444444, + "grad_norm": 4.038498401641846, + "learning_rate": 2.501414560839577e-08, + "loss": 1.2977, + "step": 1120 + }, + { + "epoch": 1.9791666666666665, + "grad_norm": 3.5531771183013916, + "learning_rate": 3.884639339534202e-09, + "loss": 1.317, + "step": 1140 + } + ], + "logging_steps": 20, + "max_steps": 1152, + "num_input_tokens_seen": 0, + "num_train_epochs": 2, + "save_steps": 50, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.3405557230187315e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/last-checkpoint/training_args.bin b/last-checkpoint/training_args.bin new file mode 100644 index 0000000..00ec422 --- /dev/null +++ b/last-checkpoint/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:bd3f6fb75c41d94e223a9ac8c5493e5600d5b8c5501ce6178e551b64952b54dd +size 6033 diff --git a/model-00001-of-00004.safetensors b/model-00001-of-00004.safetensors new file mode 100644 index 0000000..368519c --- /dev/null +++ b/model-00001-of-00004.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c008dd0f803f5180fe393b8fb49c5c9e38a107e7460335c061049fbf47ca3f90 +size 4977222960 diff --git a/model-00002-of-00004.safetensors b/model-00002-of-00004.safetensors new file mode 100644 index 0000000..57c0910 --- /dev/null +++ b/model-00002-of-00004.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:5fd0a8fdf0eaab2a50ffa08a65564e3a2331f4fc86296f0d99c950e19878af16 +size 4999802720 diff --git a/model-00003-of-00004.safetensors b/model-00003-of-00004.safetensors new file mode 100644 index 0000000..778297e --- /dev/null +++ b/model-00003-of-00004.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:40d0e698c8a9eb7f4a22e7e524de2a3562405b434e227978837111f2fad4d80d +size 4915916176 diff --git a/model-00004-of-00004.safetensors b/model-00004-of-00004.safetensors new file mode 100644 index 0000000..fc3b648 --- /dev/null +++ b/model-00004-of-00004.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:641464b942ac082475439feee149ed69b5fc247cde666ff7e93da7ee4af91c88 +size 1168663096 diff --git a/model.safetensors.index.json b/model.safetensors.index.json new file mode 100644 index 0000000..55f36a5 --- /dev/null +++ b/model.safetensors.index.json @@ -0,0 +1,299 @@ +{ + "metadata": { + "total_parameters": 8030785536, + "total_size": 16061571072 + }, + "weight_map": { + "lm_head.weight": "model-00004-of-00004.safetensors", + "model.embed_tokens.weight": "model-00001-of-00004.safetensors", + "model.layers.0.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.0.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.0.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.0.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.0.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.0.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.0.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.0.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.0.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.1.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.1.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.1.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.1.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.1.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.1.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.1.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.1.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.1.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.10.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.10.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.10.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.10.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.10.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.10.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.10.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.10.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.10.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.11.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.11.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.11.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.11.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.11.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.11.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.11.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.11.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.11.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.12.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.12.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.12.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.12.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.12.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.12.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.12.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.12.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.12.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.13.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.13.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.13.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.13.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.13.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.13.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.13.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.13.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.13.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.14.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.14.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.14.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.14.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.14.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.14.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.14.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.14.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.14.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.15.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.15.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.15.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.15.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.15.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.15.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.15.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.15.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.15.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.16.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.16.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.16.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.16.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.16.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.16.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.16.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.16.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.16.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.17.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.17.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.17.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.17.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.17.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.17.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.17.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.17.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.17.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.18.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.18.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.18.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.18.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.18.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.18.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.18.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.18.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.18.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.19.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.19.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.19.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.19.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.19.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.19.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.19.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.19.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.19.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.2.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.2.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.2.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.2.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.2.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.2.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.2.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.2.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.2.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.20.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.20.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.20.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.20.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.20.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.20.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.20.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.20.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.20.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.21.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.21.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.21.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.21.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.21.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.21.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.21.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.21.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.21.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.22.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.22.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.22.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.22.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.22.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.22.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.22.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.22.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.22.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.23.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.23.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.23.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.23.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.23.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.23.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.23.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.23.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.23.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.24.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.24.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.24.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.24.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.24.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.24.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.24.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.24.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.24.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.25.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.25.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.25.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.25.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.25.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.25.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.25.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.25.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.25.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.26.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.26.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.26.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.26.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.26.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.26.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.26.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.26.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.26.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.27.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.27.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.27.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.27.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.27.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.27.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.27.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.27.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.27.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.28.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.28.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.28.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.28.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.28.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.28.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.28.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.28.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.28.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.29.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.29.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.29.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.29.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.29.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.29.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.29.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.29.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.29.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.3.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.3.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.3.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.3.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.3.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.3.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.3.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.3.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.3.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.30.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.30.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.30.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.30.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.30.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.30.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.30.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.30.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.30.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.31.input_layernorm.weight": "model-00004-of-00004.safetensors", + "model.layers.31.mlp.down_proj.weight": "model-00004-of-00004.safetensors", + "model.layers.31.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.31.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.31.post_attention_layernorm.weight": "model-00004-of-00004.safetensors", + "model.layers.31.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.31.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.31.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.31.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.4.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.4.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.4.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.4.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.4.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.4.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.4.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.4.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.4.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.5.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.5.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.5.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.5.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.5.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.5.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.5.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.5.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.5.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.6.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.6.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.6.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.6.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.6.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.6.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.6.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.6.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.6.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.7.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.7.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.7.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.7.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.7.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.7.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.7.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.7.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.7.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.8.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.8.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.8.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.8.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.8.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.8.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.8.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.8.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.8.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.9.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.9.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.9.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.9.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.9.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.9.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.9.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.9.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.9.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.norm.weight": "model-00004-of-00004.safetensors" + } +} diff --git a/special_tokens_map.json b/special_tokens_map.json new file mode 100644 index 0000000..6631bbf --- /dev/null +++ b/special_tokens_map.json @@ -0,0 +1,27 @@ +{ + "additional_special_tokens": [ + "<|end-of-read|>", + "<|end-of-write|>" + ], + "bos_token": { + "content": "<|begin_of_text|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false + }, + "eos_token": { + "content": "<|eot_id|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false + }, + "pad_token": { + "content": "<|eot_id|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false + } +} diff --git a/tokenizer.json b/tokenizer.json new file mode 100644 index 0000000..ccae08e --- /dev/null +++ b/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:edc01071ea813bba1c85943ccabb16dbd408ba02c9bd781dffc66467be8be3c3 +size 17209138 diff --git a/tokenizer_config.json b/tokenizer_config.json new file mode 100644 index 0000000..31003a7 --- /dev/null +++ b/tokenizer_config.json @@ -0,0 +1,2085 @@ +{ + "added_tokens_decoder": { + "128000": { + "content": "<|begin_of_text|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128001": { + "content": "<|end_of_text|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128002": { + "content": "<|reserved_special_token_0|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128003": { + "content": "<|reserved_special_token_1|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128004": { + "content": "<|reserved_special_token_2|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128005": { + "content": "<|reserved_special_token_3|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128006": { + "content": "<|start_header_id|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128007": { + "content": "<|end_header_id|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128008": { + "content": "<|reserved_special_token_4|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128009": { + "content": "<|eot_id|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128010": { + "content": "<|reserved_special_token_5|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128011": { + "content": "<|reserved_special_token_6|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128012": { + "content": "<|reserved_special_token_7|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128013": { + "content": "<|reserved_special_token_8|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128014": { + "content": "<|reserved_special_token_9|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128015": { + "content": "<|reserved_special_token_10|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128016": { + "content": "<|reserved_special_token_11|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128017": { + "content": "<|reserved_special_token_12|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128018": { + "content": "<|reserved_special_token_13|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128019": { + "content": "<|reserved_special_token_14|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128020": { + "content": "<|reserved_special_token_15|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128021": { + "content": "<|reserved_special_token_16|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128022": { + "content": "<|reserved_special_token_17|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128023": { + "content": "<|reserved_special_token_18|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128024": { + "content": "<|reserved_special_token_19|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128025": { + "content": "<|reserved_special_token_20|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128026": { + "content": "<|reserved_special_token_21|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128027": { + "content": "<|reserved_special_token_22|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128028": { + "content": "<|reserved_special_token_23|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128029": { + "content": "<|reserved_special_token_24|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128030": { + "content": "<|reserved_special_token_25|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128031": { + "content": "<|reserved_special_token_26|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128032": { + "content": "<|reserved_special_token_27|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128033": { + "content": "<|reserved_special_token_28|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128034": { + "content": "<|reserved_special_token_29|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128035": { + "content": "<|reserved_special_token_30|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128036": { + "content": "<|reserved_special_token_31|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128037": { + "content": "<|reserved_special_token_32|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128038": { + "content": "<|reserved_special_token_33|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128039": { + "content": "<|reserved_special_token_34|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128040": { + "content": "<|reserved_special_token_35|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128041": { + "content": "<|reserved_special_token_36|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128042": { + "content": "<|reserved_special_token_37|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128043": { + "content": "<|reserved_special_token_38|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128044": { + "content": "<|reserved_special_token_39|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128045": { + "content": "<|reserved_special_token_40|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128046": { + "content": "<|reserved_special_token_41|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128047": { + "content": "<|reserved_special_token_42|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128048": { + "content": "<|reserved_special_token_43|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128049": { + "content": "<|reserved_special_token_44|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128050": { + "content": "<|reserved_special_token_45|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128051": { + "content": "<|reserved_special_token_46|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128052": { + "content": "<|reserved_special_token_47|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128053": { + "content": "<|reserved_special_token_48|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128054": { + "content": "<|reserved_special_token_49|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128055": { + "content": "<|reserved_special_token_50|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128056": { + "content": "<|reserved_special_token_51|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128057": { + "content": "<|reserved_special_token_52|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128058": { + "content": "<|reserved_special_token_53|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128059": { + "content": "<|reserved_special_token_54|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128060": { + "content": "<|reserved_special_token_55|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128061": { + "content": "<|reserved_special_token_56|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128062": { + "content": "<|reserved_special_token_57|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128063": { + "content": "<|reserved_special_token_58|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128064": { + "content": "<|reserved_special_token_59|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128065": { + "content": "<|reserved_special_token_60|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128066": { + "content": "<|reserved_special_token_61|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128067": { + "content": "<|reserved_special_token_62|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128068": { + "content": "<|reserved_special_token_63|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128069": { + "content": "<|reserved_special_token_64|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128070": { + "content": "<|reserved_special_token_65|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128071": { + "content": "<|reserved_special_token_66|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128072": { + "content": "<|reserved_special_token_67|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128073": { + "content": "<|reserved_special_token_68|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128074": { + "content": "<|reserved_special_token_69|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128075": { + "content": "<|reserved_special_token_70|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128076": { + "content": "<|reserved_special_token_71|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128077": { + "content": "<|reserved_special_token_72|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128078": { + "content": "<|reserved_special_token_73|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128079": { + "content": "<|reserved_special_token_74|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128080": { + "content": "<|reserved_special_token_75|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128081": { + "content": "<|reserved_special_token_76|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128082": { + "content": "<|reserved_special_token_77|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128083": { + "content": "<|reserved_special_token_78|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128084": { + "content": "<|reserved_special_token_79|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128085": { + "content": "<|reserved_special_token_80|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128086": { + "content": "<|reserved_special_token_81|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128087": { + "content": "<|reserved_special_token_82|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128088": { + "content": "<|reserved_special_token_83|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128089": { + "content": "<|reserved_special_token_84|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128090": { + "content": "<|reserved_special_token_85|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128091": { + "content": "<|reserved_special_token_86|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128092": { + "content": "<|reserved_special_token_87|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128093": { + "content": "<|reserved_special_token_88|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128094": { + "content": "<|reserved_special_token_89|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128095": { + "content": "<|reserved_special_token_90|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128096": { + "content": "<|reserved_special_token_91|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128097": { + "content": "<|reserved_special_token_92|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128098": { + "content": "<|reserved_special_token_93|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128099": { + "content": "<|reserved_special_token_94|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128100": { + "content": "<|reserved_special_token_95|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128101": { + "content": "<|reserved_special_token_96|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128102": { + "content": "<|reserved_special_token_97|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128103": { + "content": "<|reserved_special_token_98|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128104": { + "content": "<|reserved_special_token_99|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128105": { + "content": "<|reserved_special_token_100|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128106": { + "content": "<|reserved_special_token_101|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128107": { + "content": "<|reserved_special_token_102|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128108": { + "content": "<|reserved_special_token_103|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128109": { + "content": "<|reserved_special_token_104|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128110": { + "content": "<|reserved_special_token_105|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128111": { + "content": "<|reserved_special_token_106|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128112": { + "content": "<|reserved_special_token_107|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128113": { + "content": "<|reserved_special_token_108|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128114": { + "content": "<|reserved_special_token_109|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128115": { + "content": "<|reserved_special_token_110|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128116": { + "content": "<|reserved_special_token_111|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128117": { + "content": "<|reserved_special_token_112|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128118": { + "content": "<|reserved_special_token_113|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128119": { + "content": "<|reserved_special_token_114|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128120": { + "content": "<|reserved_special_token_115|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128121": { + "content": "<|reserved_special_token_116|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128122": { + "content": "<|reserved_special_token_117|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128123": { + "content": "<|reserved_special_token_118|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128124": { + "content": "<|reserved_special_token_119|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128125": { + "content": "<|reserved_special_token_120|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128126": { + "content": "<|reserved_special_token_121|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128127": { + "content": "<|reserved_special_token_122|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128128": { + "content": "<|reserved_special_token_123|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128129": { + "content": "<|reserved_special_token_124|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128130": { + "content": "<|reserved_special_token_125|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128131": { + "content": "<|reserved_special_token_126|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128132": { + "content": "<|reserved_special_token_127|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128133": { + "content": "<|reserved_special_token_128|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128134": { + "content": "<|reserved_special_token_129|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128135": { + "content": "<|reserved_special_token_130|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128136": { + "content": "<|reserved_special_token_131|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128137": { + "content": "<|reserved_special_token_132|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128138": { + "content": "<|reserved_special_token_133|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128139": { + "content": "<|reserved_special_token_134|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128140": { + "content": "<|reserved_special_token_135|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128141": { + "content": "<|reserved_special_token_136|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128142": { + "content": "<|reserved_special_token_137|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128143": { + "content": "<|reserved_special_token_138|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128144": { + "content": "<|reserved_special_token_139|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128145": { + "content": "<|reserved_special_token_140|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128146": { + "content": "<|reserved_special_token_141|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128147": { + "content": "<|reserved_special_token_142|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128148": { + "content": "<|reserved_special_token_143|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128149": { + "content": "<|reserved_special_token_144|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128150": { + "content": "<|reserved_special_token_145|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128151": { + "content": "<|reserved_special_token_146|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128152": { + "content": "<|reserved_special_token_147|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128153": { + "content": "<|reserved_special_token_148|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128154": { + "content": "<|reserved_special_token_149|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128155": { + "content": "<|reserved_special_token_150|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128156": { + "content": "<|reserved_special_token_151|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128157": { + "content": "<|reserved_special_token_152|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128158": { + "content": "<|reserved_special_token_153|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128159": { + "content": "<|reserved_special_token_154|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128160": { + "content": "<|reserved_special_token_155|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128161": { + "content": "<|reserved_special_token_156|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128162": { + "content": "<|reserved_special_token_157|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128163": { + "content": "<|reserved_special_token_158|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128164": { + "content": "<|reserved_special_token_159|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128165": { + "content": "<|reserved_special_token_160|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128166": { + "content": "<|reserved_special_token_161|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128167": { + "content": "<|reserved_special_token_162|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128168": { + "content": "<|reserved_special_token_163|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128169": { + "content": "<|reserved_special_token_164|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128170": { + "content": "<|reserved_special_token_165|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128171": { + "content": "<|reserved_special_token_166|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128172": { + "content": "<|reserved_special_token_167|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128173": { + "content": "<|reserved_special_token_168|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128174": { + "content": "<|reserved_special_token_169|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128175": { + "content": "<|reserved_special_token_170|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128176": { + "content": "<|reserved_special_token_171|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128177": { + "content": "<|reserved_special_token_172|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128178": { + "content": "<|reserved_special_token_173|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128179": { + "content": "<|reserved_special_token_174|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128180": { + "content": "<|reserved_special_token_175|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128181": { + "content": "<|reserved_special_token_176|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128182": { + "content": "<|reserved_special_token_177|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128183": { + "content": "<|reserved_special_token_178|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128184": { + "content": "<|reserved_special_token_179|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128185": { + "content": "<|reserved_special_token_180|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128186": { + "content": "<|reserved_special_token_181|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128187": { + "content": "<|reserved_special_token_182|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128188": { + "content": "<|reserved_special_token_183|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128189": { + "content": "<|reserved_special_token_184|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128190": { + "content": "<|reserved_special_token_185|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128191": { + "content": "<|reserved_special_token_186|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128192": { + "content": "<|reserved_special_token_187|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128193": { + "content": "<|reserved_special_token_188|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128194": { + "content": "<|reserved_special_token_189|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128195": { + "content": "<|reserved_special_token_190|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128196": { + "content": "<|reserved_special_token_191|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128197": { + "content": "<|reserved_special_token_192|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128198": { + "content": "<|reserved_special_token_193|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128199": { + "content": "<|reserved_special_token_194|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128200": { + "content": "<|reserved_special_token_195|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128201": { + "content": "<|reserved_special_token_196|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128202": { + "content": "<|reserved_special_token_197|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128203": { + "content": "<|reserved_special_token_198|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128204": { + "content": "<|reserved_special_token_199|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128205": { + "content": "<|reserved_special_token_200|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128206": { + "content": "<|reserved_special_token_201|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128207": { + "content": "<|reserved_special_token_202|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128208": { + "content": "<|reserved_special_token_203|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128209": { + "content": "<|reserved_special_token_204|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128210": { + "content": "<|reserved_special_token_205|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128211": { + "content": "<|reserved_special_token_206|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128212": { + "content": "<|reserved_special_token_207|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128213": { + "content": "<|reserved_special_token_208|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128214": { + "content": "<|reserved_special_token_209|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128215": { + "content": "<|reserved_special_token_210|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128216": { + "content": "<|reserved_special_token_211|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128217": { + "content": "<|reserved_special_token_212|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128218": { + "content": "<|reserved_special_token_213|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128219": { + "content": "<|reserved_special_token_214|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128220": { + "content": "<|reserved_special_token_215|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128221": { + "content": "<|reserved_special_token_216|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128222": { + "content": "<|reserved_special_token_217|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128223": { + "content": "<|reserved_special_token_218|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128224": { + "content": "<|reserved_special_token_219|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128225": { + "content": "<|reserved_special_token_220|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128226": { + "content": "<|reserved_special_token_221|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128227": { + "content": "<|reserved_special_token_222|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128228": { + "content": "<|reserved_special_token_223|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128229": { + "content": "<|reserved_special_token_224|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128230": { + "content": "<|reserved_special_token_225|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128231": { + "content": "<|reserved_special_token_226|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128232": { + "content": "<|reserved_special_token_227|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128233": { + "content": "<|reserved_special_token_228|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128234": { + "content": "<|reserved_special_token_229|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128235": { + "content": "<|reserved_special_token_230|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128236": { + "content": "<|reserved_special_token_231|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128237": { + "content": "<|reserved_special_token_232|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128238": { + "content": "<|reserved_special_token_233|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128239": { + "content": "<|reserved_special_token_234|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128240": { + "content": "<|reserved_special_token_235|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128241": { + "content": "<|reserved_special_token_236|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128242": { + "content": "<|reserved_special_token_237|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128243": { + "content": "<|reserved_special_token_238|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128244": { + "content": "<|reserved_special_token_239|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128245": { + "content": "<|reserved_special_token_240|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128246": { + "content": "<|reserved_special_token_241|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128247": { + "content": "<|reserved_special_token_242|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128248": { + "content": "<|reserved_special_token_243|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128249": { + "content": "<|reserved_special_token_244|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128250": { + "content": "<|reserved_special_token_245|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128251": { + "content": "<|reserved_special_token_246|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128252": { + "content": "<|reserved_special_token_247|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128253": { + "content": "<|reserved_special_token_248|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128254": { + "content": "<|reserved_special_token_249|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128255": { + "content": "<|reserved_special_token_250|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128256": { + "content": "<|end-of-read|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128257": { + "content": "<|end-of-write|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + } + }, + "additional_special_tokens": [ + "<|end-of-read|>", + "<|end-of-write|>" + ], + "bos_token": "<|begin_of_text|>", + "clean_up_tokenization_spaces": true, + "eos_token": "<|eot_id|>", + "extra_special_tokens": {}, + "model_input_names": [ + "input_ids", + "attention_mask" + ], + "model_max_length": 1000000000000000019884624838656, + "pad_token": "<|eot_id|>", + "padding_side": "left", + "split_special_tokens": false, + "tokenizer_class": "PreTrainedTokenizerFast" +} diff --git a/training_args.bin b/training_args.bin new file mode 100644 index 0000000..00ec422 --- /dev/null +++ b/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:bd3f6fb75c41d94e223a9ac8c5493e5600d5b8c5501ce6178e551b64952b54dd +size 6033