From b34f9ee4b3c3ce2cc9081bee15553a3bf9e16d1a Mon Sep 17 00:00:00 2001 From: ModelHub XC Date: Sun, 19 Jul 2026 07:27:06 +0800 Subject: [PATCH] =?UTF-8?q?=E5=88=9D=E5=A7=8B=E5=8C=96=E9=A1=B9=E7=9B=AE?= =?UTF-8?q?=EF=BC=8C=E7=94=B1ModelHub=20XC=E7=A4=BE=E5=8C=BA=E6=8F=90?= =?UTF-8?q?=E4=BE=9B=E6=A8=A1=E5=9E=8B?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit Model: m-a-p/CriticLeanGPT-Qwen2.5-14B-Instruct-SFT Source: Original Platform --- .gitattributes | 35 +++++++++++++++++ README.md | 67 ++++++++++++++++++++++++++++++++ added_tokens.json | 24 ++++++++++++ all_results.json | 14 +++++++ config.json | 28 +++++++++++++ configuration.json | 1 + eval_results.json | 7 ++++ generation_config.json | 14 +++++++ merges.txt | 3 ++ model-00001-of-00006.safetensors | 3 ++ model-00002-of-00006.safetensors | 3 ++ model-00003-of-00006.safetensors | 3 ++ model-00004-of-00006.safetensors | 3 ++ model-00005-of-00006.safetensors | 3 ++ model-00006-of-00006.safetensors | 3 ++ model.safetensors.index.json | 3 ++ special_tokens_map.json | 31 +++++++++++++++ tokenizer.json | 3 ++ tokenizer_config.json | 3 ++ train_results.json | 10 +++++ trainer_log.jsonl | 3 ++ trainer_state.json | 3 ++ training_args.bin | 3 ++ training_eval_loss.png | 3 ++ training_loss.png | 3 ++ vocab.json | 3 ++ 26 files changed, 279 insertions(+) create mode 100644 .gitattributes create mode 100644 README.md create mode 100644 added_tokens.json create mode 100644 all_results.json create mode 100644 config.json create mode 100644 configuration.json create mode 100644 eval_results.json create mode 100644 generation_config.json create mode 100644 merges.txt create mode 100644 model-00001-of-00006.safetensors create mode 100644 model-00002-of-00006.safetensors create mode 100644 model-00003-of-00006.safetensors create mode 100644 model-00004-of-00006.safetensors create mode 100644 model-00005-of-00006.safetensors create mode 100644 model-00006-of-00006.safetensors create mode 100644 model.safetensors.index.json create mode 100644 special_tokens_map.json create mode 100644 tokenizer.json create mode 100644 tokenizer_config.json create mode 100644 train_results.json create mode 100644 trainer_log.jsonl create mode 100644 trainer_state.json create mode 100644 training_args.bin create mode 100644 training_eval_loss.png create mode 100644 training_loss.png create mode 100644 vocab.json diff --git a/.gitattributes b/.gitattributes new file mode 100644 index 0000000..a6344aa --- /dev/null +++ b/.gitattributes @@ -0,0 +1,35 @@ +*.7z filter=lfs diff=lfs merge=lfs -text +*.arrow filter=lfs diff=lfs merge=lfs -text +*.bin filter=lfs diff=lfs merge=lfs -text +*.bz2 filter=lfs diff=lfs merge=lfs -text +*.ckpt filter=lfs diff=lfs merge=lfs -text +*.ftz filter=lfs diff=lfs merge=lfs -text +*.gz filter=lfs diff=lfs merge=lfs -text +*.h5 filter=lfs diff=lfs merge=lfs -text +*.joblib filter=lfs diff=lfs merge=lfs -text +*.lfs.* filter=lfs diff=lfs merge=lfs -text +*.mlmodel filter=lfs diff=lfs merge=lfs -text +*.model filter=lfs diff=lfs merge=lfs -text +*.msgpack filter=lfs diff=lfs merge=lfs -text +*.npy filter=lfs diff=lfs merge=lfs -text +*.npz filter=lfs diff=lfs merge=lfs -text +*.onnx filter=lfs diff=lfs merge=lfs -text +*.ot filter=lfs diff=lfs merge=lfs -text +*.parquet filter=lfs diff=lfs merge=lfs -text +*.pb filter=lfs diff=lfs merge=lfs -text +*.pickle filter=lfs diff=lfs merge=lfs -text +*.pkl filter=lfs diff=lfs merge=lfs -text +*.pt filter=lfs diff=lfs merge=lfs -text +*.pth filter=lfs diff=lfs merge=lfs -text +*.rar filter=lfs diff=lfs merge=lfs -text +*.safetensors filter=lfs diff=lfs merge=lfs -text +saved_model/**/* filter=lfs diff=lfs merge=lfs -text +*.tar.* filter=lfs diff=lfs merge=lfs -text +*.tar filter=lfs diff=lfs merge=lfs -text +*.tflite filter=lfs diff=lfs merge=lfs -text +*.tgz filter=lfs diff=lfs merge=lfs -text +*.wasm filter=lfs diff=lfs merge=lfs -text +*.xz filter=lfs diff=lfs merge=lfs -text +*.zip filter=lfs diff=lfs merge=lfs -text +*.zst filter=lfs diff=lfs merge=lfs -text +*tfevents* filter=lfs diff=lfs merge=lfs -text diff --git a/README.md b/README.md new file mode 100644 index 0000000..5a4efb1 --- /dev/null +++ b/README.md @@ -0,0 +1,67 @@ +--- +library_name: transformers +license: other +base_model: Qwen2.5-14B-Instruct +tags: +- llama-factory +- full +- generated_from_trainer +model-index: +- name: Qwen2.5-14B-Instruct-critic_lean_mix_48k + results: [] +--- + + + +# Qwen2.5-14B-Instruct-critic_lean_mix_48k + +This model is a fine-tuned version of [Qwen2.5-14B-Instruct](https://huggingface.co/Qwen2.5-14B-Instruct) on the critic_lean_mix_48k dataset. +It achieves the following results on the evaluation set: +- Loss: 0.2970 + +## Model description + +More information needed + +## Intended uses & limitations + +More information needed + +## Training and evaluation data + +More information needed + +## Training procedure + +### Training hyperparameters + +The following hyperparameters were used during training: +- learning_rate: 5e-06 +- train_batch_size: 2 +- eval_batch_size: 1 +- seed: 42 +- distributed_type: multi-GPU +- num_devices: 16 +- total_train_batch_size: 32 +- total_eval_batch_size: 16 +- optimizer: Adam with betas=(0.9,0.999) and epsilon=1e-08 +- lr_scheduler_type: cosine +- lr_scheduler_warmup_ratio: 0.1 +- num_epochs: 3.0 + +### Training results + +| Training Loss | Epoch | Step | Validation Loss | +|:-------------:|:-----:|:----:|:---------------:| +| 0.348 | 1.0 | 1485 | 0.2822 | +| 0.2655 | 2.0 | 2970 | 0.2750 | +| 0.1382 | 3.0 | 4455 | 0.2970 | + + +### Framework versions + +- Transformers 4.44.2 +- Pytorch 2.2.1+cu121 +- Datasets 2.21.0 +- Tokenizers 0.19.1 diff --git a/added_tokens.json b/added_tokens.json new file mode 100644 index 0000000..482ced4 --- /dev/null +++ b/added_tokens.json @@ -0,0 +1,24 @@ +{ + "": 151658, + "": 151657, + "<|box_end|>": 151649, + "<|box_start|>": 151648, + "<|endoftext|>": 151643, + "<|file_sep|>": 151664, + "<|fim_middle|>": 151660, + "<|fim_pad|>": 151662, + "<|fim_prefix|>": 151659, + "<|fim_suffix|>": 151661, + "<|im_end|>": 151645, + "<|im_start|>": 151644, + "<|image_pad|>": 151655, + "<|object_ref_end|>": 151647, + "<|object_ref_start|>": 151646, + "<|quad_end|>": 151651, + "<|quad_start|>": 151650, + "<|repo_name|>": 151663, + "<|video_pad|>": 151656, + "<|vision_end|>": 151653, + "<|vision_pad|>": 151654, + "<|vision_start|>": 151652 +} diff --git a/all_results.json b/all_results.json new file mode 100644 index 0000000..fd9bb4e --- /dev/null +++ b/all_results.json @@ -0,0 +1,14 @@ +{ + "epoch": 3.0, + "eval_loss": 0.29699257016181946, + "eval_runtime": 15.9659, + "eval_samples_per_second": 30.064, + "eval_steps_per_second": 1.879, + "tflops": 0.07104939945192446, + "token/s": 964.1313936883596, + "total_flos": 940586567729152.0, + "train_loss": 0.23212839591115145, + "train_runtime": 12724.6535, + "train_samples_per_second": 11.203, + "train_steps_per_second": 0.35 +} \ No newline at end of file diff --git a/config.json b/config.json new file mode 100644 index 0000000..df89bb3 --- /dev/null +++ b/config.json @@ -0,0 +1,28 @@ +{ + "_name_or_path": "Qwen2.5-14B-Instruct", + "architectures": [ + "Qwen2ForCausalLM" + ], + "attention_dropout": 0.0, + "bos_token_id": 151643, + "eos_token_id": 151645, + "hidden_act": "silu", + "hidden_size": 5120, + "initializer_range": 0.02, + "intermediate_size": 13824, + "max_position_embeddings": 32768, + "max_window_layers": 70, + "model_type": "qwen2", + "num_attention_heads": 40, + "num_hidden_layers": 48, + "num_key_value_heads": 8, + "rms_norm_eps": 1e-06, + "rope_theta": 1000000.0, + "sliding_window": null, + "tie_word_embeddings": false, + "torch_dtype": "bfloat16", + "transformers_version": "4.44.2", + "use_cache": false, + "use_sliding_window": false, + "vocab_size": 152064 +} diff --git a/configuration.json b/configuration.json new file mode 100644 index 0000000..bbeeda1 --- /dev/null +++ b/configuration.json @@ -0,0 +1 @@ +{"framework": "pytorch", "task": "text-generation", "allow_remote": true} \ No newline at end of file diff --git a/eval_results.json b/eval_results.json new file mode 100644 index 0000000..ee54727 --- /dev/null +++ b/eval_results.json @@ -0,0 +1,7 @@ +{ + "epoch": 3.0, + "eval_loss": 0.29699257016181946, + "eval_runtime": 15.9659, + "eval_samples_per_second": 30.064, + "eval_steps_per_second": 1.879 +} \ No newline at end of file diff --git a/generation_config.json b/generation_config.json new file mode 100644 index 0000000..64d2760 --- /dev/null +++ b/generation_config.json @@ -0,0 +1,14 @@ +{ + "bos_token_id": 151643, + "do_sample": true, + "eos_token_id": [ + 151645, + 151643 + ], + "pad_token_id": 151643, + "repetition_penalty": 1.05, + "temperature": 0.7, + "top_k": 20, + "top_p": 0.8, + "transformers_version": "4.44.2" +} diff --git a/merges.txt b/merges.txt new file mode 100644 index 0000000..80c1a19 --- /dev/null +++ b/merges.txt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:8831e4f1a044471340f7c0a83d7bd71306a5b867e95fd870f74d0c5308a904d5 +size 1671853 diff --git a/model-00001-of-00006.safetensors b/model-00001-of-00006.safetensors new file mode 100644 index 0000000..c7e9425 --- /dev/null +++ b/model-00001-of-00006.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:987bb61fe837eeb188be2fb80ccb73eaccfd7589058cebe22ecbf7c8c04cd7c0 +size 4986211280 diff --git a/model-00002-of-00006.safetensors b/model-00002-of-00006.safetensors new file mode 100644 index 0000000..4c58a68 --- /dev/null +++ b/model-00002-of-00006.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:50cd6e9f1f1070a225ee722f34557f2107b6a76ec90191b9db4a3f69a463fd79 +size 4954847344 diff --git a/model-00003-of-00006.safetensors b/model-00003-of-00006.safetensors new file mode 100644 index 0000000..7bcf1f6 --- /dev/null +++ b/model-00003-of-00006.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:40693827c7c26a332e7c73eee3428bc3261c55a1de061904512ed81d882f71b7 +size 4954847392 diff --git a/model-00004-of-00006.safetensors b/model-00004-of-00006.safetensors new file mode 100644 index 0000000..2ba67d7 --- /dev/null +++ b/model-00004-of-00006.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ba8a915b434ec95470d2d10ce6d151eeb062e58c16b3c7c8d3aea1a54ab1b375 +size 4954847392 diff --git a/model-00005-of-00006.safetensors b/model-00005-of-00006.safetensors new file mode 100644 index 0000000..d93ea54 --- /dev/null +++ b/model-00005-of-00006.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7b63d3613714e4b5583618d5f67a47aee9389168851ac6283e078cb4ed47949c +size 4954847392 diff --git a/model-00006-of-00006.safetensors b/model-00006-of-00006.safetensors new file mode 100644 index 0000000..0348322 --- /dev/null +++ b/model-00006-of-00006.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:487e556016f255b631af1859f0c0d91316658abdc38dadbf7fdc440299cce2b2 +size 4734533160 diff --git a/model.safetensors.index.json b/model.safetensors.index.json new file mode 100644 index 0000000..1951d1f --- /dev/null +++ b/model.safetensors.index.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:425811015c8708208c9efc04c4cfae250c7927a1b04c99dda5a9121caf4bf77a +size 47472 diff --git a/special_tokens_map.json b/special_tokens_map.json new file mode 100644 index 0000000..ac23c0a --- /dev/null +++ b/special_tokens_map.json @@ -0,0 +1,31 @@ +{ + "additional_special_tokens": [ + "<|im_start|>", + "<|im_end|>", + "<|object_ref_start|>", + "<|object_ref_end|>", + "<|box_start|>", + "<|box_end|>", + "<|quad_start|>", + "<|quad_end|>", + "<|vision_start|>", + "<|vision_end|>", + "<|vision_pad|>", + "<|image_pad|>", + "<|video_pad|>" + ], + "eos_token": { + "content": "<|im_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false + }, + "pad_token": { + "content": "<|endoftext|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false + } +} diff --git a/tokenizer.json b/tokenizer.json new file mode 100644 index 0000000..7ebe282 --- /dev/null +++ b/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:a8506e7111b80c6d8635951a02eab0f4e1a8e4e5772da83846579e97b16f61bf +size 7031673 diff --git a/tokenizer_config.json b/tokenizer_config.json new file mode 100644 index 0000000..bcfaf9f --- /dev/null +++ b/tokenizer_config.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:cfb48460eae2f42efb8dbfcdc0288f35736fa3e0939d17614f22e26ebdc4d871 +size 7331 diff --git a/train_results.json b/train_results.json new file mode 100644 index 0000000..11add3d --- /dev/null +++ b/train_results.json @@ -0,0 +1,10 @@ +{ + "epoch": 3.0, + "tflops": 0.07104939945192446, + "token/s": 964.1313936883596, + "total_flos": 940586567729152.0, + "train_loss": 0.23212839591115145, + "train_runtime": 12724.6535, + "train_samples_per_second": 11.203, + "train_steps_per_second": 0.35 +} \ No newline at end of file diff --git a/trainer_log.jsonl b/trainer_log.jsonl new file mode 100644 index 0000000..24773c2 --- /dev/null +++ b/trainer_log.jsonl @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:94363a2ee988937cd559d4d5e71c853a188bae5d8ab1ee8c43587f120c3ddbe3 +size 1428 diff --git a/trainer_state.json b/trainer_state.json new file mode 100644 index 0000000..39553d1 --- /dev/null +++ b/trainer_state.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:167c1cc48356c50689a7b455648dd114e7de0a76b3cfb79c88808a688026b552 +size 2439 diff --git a/training_args.bin b/training_args.bin new file mode 100644 index 0000000..0206e17 --- /dev/null +++ b/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b62c6a55a3f707df4f885e585ce883aa9da670667b0fa92d348f243b5c9993cf +size 7480 diff --git a/training_eval_loss.png b/training_eval_loss.png new file mode 100644 index 0000000..e525168 --- /dev/null +++ b/training_eval_loss.png @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:cf454c3f066b35f8979563fec514f195a12b3e280365c162b1e99a9f603729cd +size 40855 diff --git a/training_loss.png b/training_loss.png new file mode 100644 index 0000000..6c9c9c2 --- /dev/null +++ b/training_loss.png @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d31e21affe661ae2a17d8d7ecdc070974919543a86aabefdcd4da82cd6892608 +size 37981 diff --git a/vocab.json b/vocab.json new file mode 100644 index 0000000..6c49fc6 --- /dev/null +++ b/vocab.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ca10d7e9fb3ed18575dd1e277a2579c16d108e32f27439684afa0e10b1440910 +size 2776833