From 3294826aba39ff12bd98192bb9d86ced1fa0bdf3 Mon Sep 17 00:00:00 2001 From: ModelHub XC Date: Sat, 18 Jul 2026 02:12:10 +0800 Subject: [PATCH] =?UTF-8?q?=E5=88=9D=E5=A7=8B=E5=8C=96=E9=A1=B9=E7=9B=AE?= =?UTF-8?q?=EF=BC=8C=E7=94=B1ModelHub=20XC=E7=A4=BE=E5=8C=BA=E6=8F=90?= =?UTF-8?q?=E4=BE=9B=E6=A8=A1=E5=9E=8B?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit Model: narcolepticchicken/occ-grpo-baseline Source: Original Platform --- .gitattributes | 36 + README.md | 64 ++ chat_template.jinja | 54 + completions/completions_00001.parquet | 3 + completions/completions_00010.parquet | 3 + completions/completions_00020.parquet | 3 + completions/completions_00030.parquet | 3 + completions/completions_00040.parquet | 3 + completions/completions_00050.parquet | 3 + completions/completions_00060.parquet | 3 + completions/completions_00070.parquet | 3 + completions/completions_00080.parquet | 3 + completions/completions_00090.parquet | 3 + completions/completions_00100.parquet | 3 + completions/completions_00110.parquet | 3 + completions/completions_00120.parquet | 3 + completions/completions_00130.parquet | 3 + completions/completions_00140.parquet | 3 + completions/completions_00150.parquet | 3 + completions/completions_00160.parquet | 3 + completions/completions_00170.parquet | 3 + completions/completions_00180.parquet | 3 + completions/completions_00190.parquet | 3 + completions/completions_00200.parquet | 3 + completions/completions_00210.parquet | 3 + completions/completions_00220.parquet | 3 + completions/completions_00230.parquet | 3 + completions/completions_00240.parquet | 3 + completions/completions_00250.parquet | 3 + completions/completions_00260.parquet | 3 + completions/completions_00270.parquet | 3 + completions/completions_00280.parquet | 3 + completions/completions_00290.parquet | 3 + completions/completions_00300.parquet | 3 + completions/completions_00310.parquet | 3 + completions/completions_00320.parquet | 3 + completions/completions_00330.parquet | 3 + completions/completions_00340.parquet | 3 + completions/completions_00350.parquet | 3 + completions/completions_00360.parquet | 3 + completions/completions_00370.parquet | 3 + completions/completions_00380.parquet | 3 + completions/completions_00390.parquet | 3 + completions/completions_00400.parquet | 3 + completions/completions_00410.parquet | 3 + completions/completions_00420.parquet | 3 + completions/completions_00430.parquet | 3 + completions/completions_00440.parquet | 3 + completions/completions_00450.parquet | 3 + completions/completions_00460.parquet | 3 + completions/completions_00470.parquet | 3 + completions/completions_00480.parquet | 3 + completions/completions_00490.parquet | 3 + completions/completions_00500.parquet | 3 + config.json | 69 ++ generation_config.json | 13 + last-checkpoint/chat_template.jinja | 54 + last-checkpoint/config.json | 69 ++ last-checkpoint/generation_config.json | 13 + last-checkpoint/model.safetensors | 3 + last-checkpoint/optimizer.pt | 3 + last-checkpoint/rng_state.pth | 3 + last-checkpoint/scheduler.pt | 3 + last-checkpoint/tokenizer.json | 3 + last-checkpoint/tokenizer_config.json | 32 + last-checkpoint/trainer_state.json | 1411 ++++++++++++++++++++++++ last-checkpoint/training_args.bin | 3 + model.safetensors | 3 + tokenizer.json | 3 + tokenizer_config.json | 32 + training_args.bin | 3 + 71 files changed, 2027 insertions(+) create mode 100644 .gitattributes create mode 100644 README.md create mode 100644 chat_template.jinja create mode 100644 completions/completions_00001.parquet create mode 100644 completions/completions_00010.parquet create mode 100644 completions/completions_00020.parquet create mode 100644 completions/completions_00030.parquet create mode 100644 completions/completions_00040.parquet create mode 100644 completions/completions_00050.parquet create mode 100644 completions/completions_00060.parquet create mode 100644 completions/completions_00070.parquet create mode 100644 completions/completions_00080.parquet create mode 100644 completions/completions_00090.parquet create mode 100644 completions/completions_00100.parquet create mode 100644 completions/completions_00110.parquet create mode 100644 completions/completions_00120.parquet create mode 100644 completions/completions_00130.parquet create mode 100644 completions/completions_00140.parquet create mode 100644 completions/completions_00150.parquet create mode 100644 completions/completions_00160.parquet create mode 100644 completions/completions_00170.parquet create mode 100644 completions/completions_00180.parquet create mode 100644 completions/completions_00190.parquet create mode 100644 completions/completions_00200.parquet create mode 100644 completions/completions_00210.parquet create mode 100644 completions/completions_00220.parquet create mode 100644 completions/completions_00230.parquet create mode 100644 completions/completions_00240.parquet create mode 100644 completions/completions_00250.parquet create mode 100644 completions/completions_00260.parquet create mode 100644 completions/completions_00270.parquet create mode 100644 completions/completions_00280.parquet create mode 100644 completions/completions_00290.parquet create mode 100644 completions/completions_00300.parquet create mode 100644 completions/completions_00310.parquet create mode 100644 completions/completions_00320.parquet create mode 100644 completions/completions_00330.parquet create mode 100644 completions/completions_00340.parquet create mode 100644 completions/completions_00350.parquet create mode 100644 completions/completions_00360.parquet create mode 100644 completions/completions_00370.parquet create mode 100644 completions/completions_00380.parquet create mode 100644 completions/completions_00390.parquet create mode 100644 completions/completions_00400.parquet create mode 100644 completions/completions_00410.parquet create mode 100644 completions/completions_00420.parquet create mode 100644 completions/completions_00430.parquet create mode 100644 completions/completions_00440.parquet create mode 100644 completions/completions_00450.parquet create mode 100644 completions/completions_00460.parquet create mode 100644 completions/completions_00470.parquet create mode 100644 completions/completions_00480.parquet create mode 100644 completions/completions_00490.parquet create mode 100644 completions/completions_00500.parquet create mode 100644 config.json create mode 100644 generation_config.json create mode 100644 last-checkpoint/chat_template.jinja create mode 100644 last-checkpoint/config.json create mode 100644 last-checkpoint/generation_config.json create mode 100644 last-checkpoint/model.safetensors create mode 100644 last-checkpoint/optimizer.pt create mode 100644 last-checkpoint/rng_state.pth create mode 100644 last-checkpoint/scheduler.pt create mode 100644 last-checkpoint/tokenizer.json create mode 100644 last-checkpoint/tokenizer_config.json create mode 100644 last-checkpoint/trainer_state.json create mode 100644 last-checkpoint/training_args.bin create mode 100644 model.safetensors create mode 100644 tokenizer.json create mode 100644 tokenizer_config.json create mode 100644 training_args.bin diff --git a/.gitattributes b/.gitattributes new file mode 100644 index 0000000..52373fe --- /dev/null +++ b/.gitattributes @@ -0,0 +1,36 @@ +*.7z filter=lfs diff=lfs merge=lfs -text +*.arrow filter=lfs diff=lfs merge=lfs -text +*.bin filter=lfs diff=lfs merge=lfs -text +*.bz2 filter=lfs diff=lfs merge=lfs -text +*.ckpt filter=lfs diff=lfs merge=lfs -text +*.ftz filter=lfs diff=lfs merge=lfs -text +*.gz filter=lfs diff=lfs merge=lfs -text +*.h5 filter=lfs diff=lfs merge=lfs -text +*.joblib filter=lfs diff=lfs merge=lfs -text +*.lfs.* filter=lfs diff=lfs merge=lfs -text +*.mlmodel filter=lfs diff=lfs merge=lfs -text +*.model filter=lfs diff=lfs merge=lfs -text +*.msgpack filter=lfs diff=lfs merge=lfs -text +*.npy filter=lfs diff=lfs merge=lfs -text +*.npz filter=lfs diff=lfs merge=lfs -text +*.onnx filter=lfs diff=lfs merge=lfs -text +*.ot filter=lfs diff=lfs merge=lfs -text +*.parquet filter=lfs diff=lfs merge=lfs -text +*.pb filter=lfs diff=lfs merge=lfs -text +*.pickle filter=lfs diff=lfs merge=lfs -text +*.pkl filter=lfs diff=lfs merge=lfs -text +*.pt filter=lfs diff=lfs merge=lfs -text +*.pth filter=lfs diff=lfs merge=lfs -text +*.rar filter=lfs diff=lfs merge=lfs -text +*.safetensors filter=lfs diff=lfs merge=lfs -text +saved_model/**/* filter=lfs diff=lfs merge=lfs -text +*.tar.* filter=lfs diff=lfs merge=lfs -text +*.tar filter=lfs diff=lfs merge=lfs -text +*.tflite filter=lfs diff=lfs merge=lfs -text +*.tgz filter=lfs diff=lfs merge=lfs -text +*.wasm filter=lfs diff=lfs merge=lfs -text +*.xz filter=lfs diff=lfs merge=lfs -text +*.zip filter=lfs diff=lfs merge=lfs -text +*.zst filter=lfs diff=lfs merge=lfs -text +*tfevents* filter=lfs diff=lfs merge=lfs -text +tokenizer.json filter=lfs diff=lfs merge=lfs -text diff --git a/README.md b/README.md new file mode 100644 index 0000000..e67bd0b --- /dev/null +++ b/README.md @@ -0,0 +1,64 @@ +--- +base_model: Qwen/Qwen2.5-3B-Instruct +library_name: transformers +model_name: occ-grpo-baseline +tags: +- generated_from_trainer +- hf_jobs +- grpo +- trl +licence: license +--- + +# Model Card for occ-grpo-baseline + +This model is a fine-tuned version of [Qwen/Qwen2.5-3B-Instruct](https://huggingface.co/Qwen/Qwen2.5-3B-Instruct). +It has been trained using [TRL](https://github.com/huggingface/trl). + +## Quick start + +```python +from transformers import pipeline + +question = "If you had a time machine, but could only go to the past or the future once and never return, which would you choose and why?" +generator = pipeline("text-generation", model="narcolepticchicken/occ-grpo-baseline", device="cuda") +output = generator([{"role": "user", "content": question}], max_new_tokens=128, return_full_text=False)[0] +print(output["generated_text"]) +``` + +## Training procedure + +This model was trained with GRPO, a method introduced in [DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models](https://huggingface.co/papers/2402.03300). + +### Framework versions + +- TRL: 1.7.0 +- Transformers: 5.12.1 +- Pytorch: 2.12.1 +- Datasets: 5.0.0 +- Tokenizers: 0.22.2 + +## Citations + +Cite GRPO as: + +```bibtex +@article{shao2024deepseekmath, + title = {{DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models}}, + author = {Zhihong Shao and Peiyi Wang and Qihao Zhu and Runxin Xu and Junxiao Song and Mingchuan Zhang and Y. K. Li and Y. Wu and Daya Guo}, + year = 2024, + eprint = {arXiv:2402.03300}, +} +``` + +Cite TRL as: + +```bibtex +@software{vonwerra2020trl, + title = {{TRL: Transformers Reinforcement Learning}}, + author = {von Werra, Leandro and Belkada, Younes and Tunstall, Lewis and Beeching, Edward and Thrush, Tristan and Lambert, Nathan and Huang, Shengyi and Rasul, Kashif and Gallouédec, Quentin}, + license = {Apache-2.0}, + url = {https://github.com/huggingface/trl}, + year = {2020} +} +``` diff --git a/chat_template.jinja b/chat_template.jinja new file mode 100644 index 0000000..bdf7919 --- /dev/null +++ b/chat_template.jinja @@ -0,0 +1,54 @@ +{%- if tools %} + {{- '<|im_start|>system\n' }} + {%- if messages[0]['role'] == 'system' %} + {{- messages[0]['content'] }} + {%- else %} + {{- 'You are Qwen, created by Alibaba Cloud. You are a helpful assistant.' }} + {%- endif %} + {{- "\n\n# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within XML tags:\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n\n\nFor each function call, return a json object with function name and arguments within XML tags:\n\n{\"name\": , \"arguments\": }\n<|im_end|>\n" }} +{%- else %} + {%- if messages[0]['role'] == 'system' %} + {{- '<|im_start|>system\n' + messages[0]['content'] + '<|im_end|>\n' }} + {%- else %} + {{- '<|im_start|>system\nYou are Qwen, created by Alibaba Cloud. You are a helpful assistant.<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- for message in messages %} + {%- if (message.role == "user") or (message.role == "system" and not loop.first) or (message.role == "assistant" and not message.tool_calls) %} + {{- '<|im_start|>' + message.role + '\n' + message.content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {{- '<|im_start|>' + message.role }} + {%- if message.content %} + {{- '\n' + message.content }} + {%- endif %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {{- '\n\n{"name": "' }} + {{- tool_call.name }} + {{- '", "arguments": ' }} + {{- tool_call.arguments | tojson }} + {{- '}\n' }} + {%- endfor %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if (loop.index0 == 0) or (messages[loop.index0 - 1].role != "tool") %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- message.content }} + {{- '\n' }} + {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} +{%- endif %} diff --git a/completions/completions_00001.parquet b/completions/completions_00001.parquet new file mode 100644 index 0000000..72311c6 --- /dev/null +++ b/completions/completions_00001.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c10a3d0e3e69883649efe300fdf445d52e66db5040bb9eb1cbad9ed79b3a0e15 +size 8860 diff --git a/completions/completions_00010.parquet b/completions/completions_00010.parquet new file mode 100644 index 0000000..760b1d2 --- /dev/null +++ b/completions/completions_00010.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:bb5ee4766cd90d708c05278c0a4a8d48b9120139dbefb68629c0d8a681f43ca4 +size 9521 diff --git a/completions/completions_00020.parquet b/completions/completions_00020.parquet new file mode 100644 index 0000000..bd0fd12 --- /dev/null +++ b/completions/completions_00020.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:1db8f1778bf6c9d9b6436df82303eb864b721d3ac5930f40ca204a792aa69cac +size 10566 diff --git a/completions/completions_00030.parquet b/completions/completions_00030.parquet new file mode 100644 index 0000000..00552fd --- /dev/null +++ b/completions/completions_00030.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:f717ed6b8a0bfd672d3e595b4002cd3474b4a893b2db9885757a94dcba91c496 +size 9906 diff --git a/completions/completions_00040.parquet b/completions/completions_00040.parquet new file mode 100644 index 0000000..af560c1 --- /dev/null +++ b/completions/completions_00040.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:52acafaee641afe55fe6e5334efd2be291bfef1fe1c72a665a7934624d81996a +size 9957 diff --git a/completions/completions_00050.parquet b/completions/completions_00050.parquet new file mode 100644 index 0000000..d9ee790 --- /dev/null +++ b/completions/completions_00050.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:cfa63c09bb5dba30fbe33576536ee2debb1e6d9a37d5d8f67d6bcb3b032231d9 +size 12061 diff --git a/completions/completions_00060.parquet b/completions/completions_00060.parquet new file mode 100644 index 0000000..a933d34 --- /dev/null +++ b/completions/completions_00060.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:51ddc618b73aed6b0236bb41bfad4015c2d7ca70ab8f6b473aafcbdfcbf5c15e +size 10134 diff --git a/completions/completions_00070.parquet b/completions/completions_00070.parquet new file mode 100644 index 0000000..dd4568a --- /dev/null +++ b/completions/completions_00070.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:96604e383e445f1dc6cf68d576b403b4fe64ec57bc98ec4058406b9ba2f09723 +size 9232 diff --git a/completions/completions_00080.parquet b/completions/completions_00080.parquet new file mode 100644 index 0000000..17407c8 --- /dev/null +++ b/completions/completions_00080.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:5c827349a0c164d0becff802e61465bc8dc43a7507ad33d2a2481b6a505f2d12 +size 9548 diff --git a/completions/completions_00090.parquet b/completions/completions_00090.parquet new file mode 100644 index 0000000..2f10790 --- /dev/null +++ b/completions/completions_00090.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7dfbbf78926df4064af3ea43abf6acd4967ecec4e631871378785cfe5ac7c8f9 +size 10762 diff --git a/completions/completions_00100.parquet b/completions/completions_00100.parquet new file mode 100644 index 0000000..720235b --- /dev/null +++ b/completions/completions_00100.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d5db8eabc8d086f7b22968396c72e604079cdc2074865773415bdf670959ab9b +size 11561 diff --git a/completions/completions_00110.parquet b/completions/completions_00110.parquet new file mode 100644 index 0000000..2de8f97 --- /dev/null +++ b/completions/completions_00110.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e0b0e906d0a0804712016b2a416fa1d4585dc49f73c9caa24fe08fb5eeb6c455 +size 12981 diff --git a/completions/completions_00120.parquet b/completions/completions_00120.parquet new file mode 100644 index 0000000..e3b12f1 --- /dev/null +++ b/completions/completions_00120.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:92cd87b2967a1cb7e2ddfcf7d22a0b12ec0c00f539eab11ba95b3e28635323f3 +size 10599 diff --git a/completions/completions_00130.parquet b/completions/completions_00130.parquet new file mode 100644 index 0000000..db80860 --- /dev/null +++ b/completions/completions_00130.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e333aba175a5a8d8c56e5b85e8fae5fc6f052ec119700faa5170e5c4ef1545d4 +size 9890 diff --git a/completions/completions_00140.parquet b/completions/completions_00140.parquet new file mode 100644 index 0000000..a98f0bb --- /dev/null +++ b/completions/completions_00140.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:8b28c6265157d1ffd181a398fe7b8b8cf7482fcb22379fc84404d16fc2609fbe +size 10085 diff --git a/completions/completions_00150.parquet b/completions/completions_00150.parquet new file mode 100644 index 0000000..5309230 --- /dev/null +++ b/completions/completions_00150.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:1cf415aef14af854e4915fd98bd94b0c81bf53839c568165c89b5ccda298fed4 +size 10754 diff --git a/completions/completions_00160.parquet b/completions/completions_00160.parquet new file mode 100644 index 0000000..968452b --- /dev/null +++ b/completions/completions_00160.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e60c4b6e85852cdabd768db791f9e443f1631745f990948a56da7b0ca89dda7b +size 10641 diff --git a/completions/completions_00170.parquet b/completions/completions_00170.parquet new file mode 100644 index 0000000..9857d5e --- /dev/null +++ b/completions/completions_00170.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7d25691d3ff46979c059c4dd07dc1ff8098b14684294f7ea1b57228c5eff351e +size 9862 diff --git a/completions/completions_00180.parquet b/completions/completions_00180.parquet new file mode 100644 index 0000000..0456e19 --- /dev/null +++ b/completions/completions_00180.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:008d7c52912a84b2705aa64b7b9355c835d8e288871edccc7657c74d4def31e3 +size 11027 diff --git a/completions/completions_00190.parquet b/completions/completions_00190.parquet new file mode 100644 index 0000000..7af96a2 --- /dev/null +++ b/completions/completions_00190.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3d492b136a089194e3e6dacccecd9effd4d6be90c8e8c169f5fcc1b4e2c20b2c +size 9565 diff --git a/completions/completions_00200.parquet b/completions/completions_00200.parquet new file mode 100644 index 0000000..dbe9c68 --- /dev/null +++ b/completions/completions_00200.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0fdfdc3751c9a5d47872b3566e0f3b2b270a8d22138ee865fff0821cf53768ae +size 9298 diff --git a/completions/completions_00210.parquet b/completions/completions_00210.parquet new file mode 100644 index 0000000..a2b943f --- /dev/null +++ b/completions/completions_00210.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:eb37079f5b9a933e4f709fca17107372b98d30145bf7432e9cfd888e1a86e590 +size 9033 diff --git a/completions/completions_00220.parquet b/completions/completions_00220.parquet new file mode 100644 index 0000000..56da52c --- /dev/null +++ b/completions/completions_00220.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2994e638bd356f5d41713d5d278aac0f9cbe66324ec14416282f5512d32ff32d +size 10053 diff --git a/completions/completions_00230.parquet b/completions/completions_00230.parquet new file mode 100644 index 0000000..d946b82 --- /dev/null +++ b/completions/completions_00230.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:59f938c33b3784462dccdea61b7c805cc036522678e0664b56cf2d4e5e5790ee +size 10919 diff --git a/completions/completions_00240.parquet b/completions/completions_00240.parquet new file mode 100644 index 0000000..669c99a --- /dev/null +++ b/completions/completions_00240.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:f589c376f16db1924fa9f8bd85bc6d3d9f57fd799d40e1e7cd2f8b4efe06f605 +size 10153 diff --git a/completions/completions_00250.parquet b/completions/completions_00250.parquet new file mode 100644 index 0000000..eef0d6a --- /dev/null +++ b/completions/completions_00250.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:432b1e929656ee8ad32d581f2f8ddbe976330001066f7bc52f79d48468bb90c4 +size 9470 diff --git a/completions/completions_00260.parquet b/completions/completions_00260.parquet new file mode 100644 index 0000000..9908680 --- /dev/null +++ b/completions/completions_00260.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:72ba64d1e1433ccd517d312a0ccd04c7df602b0520718507bf5ff044f57853fd +size 9264 diff --git a/completions/completions_00270.parquet b/completions/completions_00270.parquet new file mode 100644 index 0000000..92e0b4f --- /dev/null +++ b/completions/completions_00270.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:88c20988ce54147756ffc5039ceafd3e101214175500b7081815b9e507d79c6a +size 12671 diff --git a/completions/completions_00280.parquet b/completions/completions_00280.parquet new file mode 100644 index 0000000..0cf624e --- /dev/null +++ b/completions/completions_00280.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:cf58bc84cf4f2563d71a8e1de9ec7989f3701aca2b6ef7d007c43e265bc92ae2 +size 8752 diff --git a/completions/completions_00290.parquet b/completions/completions_00290.parquet new file mode 100644 index 0000000..9813100 --- /dev/null +++ b/completions/completions_00290.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3a587c32bdaf1add8add770a01b7917b419029ca116b7538da83f8d13ad3d983 +size 9353 diff --git a/completions/completions_00300.parquet b/completions/completions_00300.parquet new file mode 100644 index 0000000..a842515 --- /dev/null +++ b/completions/completions_00300.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:fee10ef7b174d3492eefa64c5542509dd05dbb6b243ff0a3d28b613767a0fa66 +size 12309 diff --git a/completions/completions_00310.parquet b/completions/completions_00310.parquet new file mode 100644 index 0000000..aee6784 --- /dev/null +++ b/completions/completions_00310.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4562bb20a9495f442c1465cb6f7acfb58b8d182b910b8f546b3882219382fe46 +size 9136 diff --git a/completions/completions_00320.parquet b/completions/completions_00320.parquet new file mode 100644 index 0000000..94ef8ad --- /dev/null +++ b/completions/completions_00320.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:5946b473a10395f42720b37ecb6c1b1ca0741444944f9bf04c9ce6735aaf9a8b +size 12293 diff --git a/completions/completions_00330.parquet b/completions/completions_00330.parquet new file mode 100644 index 0000000..b214f63 --- /dev/null +++ b/completions/completions_00330.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e646fd1d74c7d8ad8b6cb918add1cf43c9e2de86ded1c45256cfea839fffa1b9 +size 10808 diff --git a/completions/completions_00340.parquet b/completions/completions_00340.parquet new file mode 100644 index 0000000..23a9483 --- /dev/null +++ b/completions/completions_00340.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:317dc75dac016d04233cdf54f25ec61ee4f7509dbf06d2d319b5222a42a3ace0 +size 11450 diff --git a/completions/completions_00350.parquet b/completions/completions_00350.parquet new file mode 100644 index 0000000..ebce9e6 --- /dev/null +++ b/completions/completions_00350.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:04309b30397fd2d5946525ca989c039f629ed5085dcd89694b42e6a1d20464b3 +size 9577 diff --git a/completions/completions_00360.parquet b/completions/completions_00360.parquet new file mode 100644 index 0000000..11295ef --- /dev/null +++ b/completions/completions_00360.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e0f5a0085db2af6aa0be544b49ea0a2b172a553ad681df46efcb3e9295f15090 +size 9301 diff --git a/completions/completions_00370.parquet b/completions/completions_00370.parquet new file mode 100644 index 0000000..56a9f70 --- /dev/null +++ b/completions/completions_00370.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c824ee1d51995483375c9eddad040c3577905f647d6ad6e973947044bcbcda8b +size 11877 diff --git a/completions/completions_00380.parquet b/completions/completions_00380.parquet new file mode 100644 index 0000000..70417a9 --- /dev/null +++ b/completions/completions_00380.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2ba1bba150b6af6be41c9d38f6e74ec26cfd10eef39923ec8451b18af8a429b7 +size 9761 diff --git a/completions/completions_00390.parquet b/completions/completions_00390.parquet new file mode 100644 index 0000000..26a0803 --- /dev/null +++ b/completions/completions_00390.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b69f221089869ba580303f26fb41cd98da9a404d85430697612a084b93d6763c +size 8154 diff --git a/completions/completions_00400.parquet b/completions/completions_00400.parquet new file mode 100644 index 0000000..223f067 --- /dev/null +++ b/completions/completions_00400.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:5dbb53ee7f08613a0420677a664c2e1dcccd86b1eebc58ebbe8c57fd8cc7901f +size 12292 diff --git a/completions/completions_00410.parquet b/completions/completions_00410.parquet new file mode 100644 index 0000000..485d00e --- /dev/null +++ b/completions/completions_00410.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c29a9d33e5710d88c3494a274413faa95a630f1196dc8977d1a29e75e066b247 +size 10528 diff --git a/completions/completions_00420.parquet b/completions/completions_00420.parquet new file mode 100644 index 0000000..e8a6b86 --- /dev/null +++ b/completions/completions_00420.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b4f01130ccbb2fa10f2c59f518a91258bb9ae9aa2cdab38fcae99d355589fe29 +size 8925 diff --git a/completions/completions_00430.parquet b/completions/completions_00430.parquet new file mode 100644 index 0000000..f205d1a --- /dev/null +++ b/completions/completions_00430.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b5a470726947ca3fa892433c6f5955f67890a6296f5fdafabded734df9629199 +size 10333 diff --git a/completions/completions_00440.parquet b/completions/completions_00440.parquet new file mode 100644 index 0000000..c11f7fa --- /dev/null +++ b/completions/completions_00440.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7058bd3abee66f2647db298d66761666d17c9044b3b1e779daf4aea60ea3077e +size 12084 diff --git a/completions/completions_00450.parquet b/completions/completions_00450.parquet new file mode 100644 index 0000000..8b0bf63 --- /dev/null +++ b/completions/completions_00450.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e1e9b59875afeda798b8256600a4ca4db5552df8cc60b7e6f9907d746829dc53 +size 9795 diff --git a/completions/completions_00460.parquet b/completions/completions_00460.parquet new file mode 100644 index 0000000..03185ff --- /dev/null +++ b/completions/completions_00460.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:43f9d0a38649214463097e11cd06148b4fe63cf9793b8d06e0751de14e8faafd +size 10486 diff --git a/completions/completions_00470.parquet b/completions/completions_00470.parquet new file mode 100644 index 0000000..5c760b6 --- /dev/null +++ b/completions/completions_00470.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:573777ce72a2b8af43d359450360fe6ed308b73bacaa6dc44bcda93cdcdf11be +size 12865 diff --git a/completions/completions_00480.parquet b/completions/completions_00480.parquet new file mode 100644 index 0000000..d11770f --- /dev/null +++ b/completions/completions_00480.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:1050f4eb1442b236de59fb83c92e9176821c0259a7bc41b4df46c135913e34b4 +size 10642 diff --git a/completions/completions_00490.parquet b/completions/completions_00490.parquet new file mode 100644 index 0000000..49e71ec --- /dev/null +++ b/completions/completions_00490.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:90dba3a7d5f3d3f704e3ba63ff672b8d4b25b04ee40c2985cfbbfce8d70c7a7c +size 10286 diff --git a/completions/completions_00500.parquet b/completions/completions_00500.parquet new file mode 100644 index 0000000..22c745f --- /dev/null +++ b/completions/completions_00500.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:5c3c193dbf186789d43126f949b6bd1dbef93c84af327c5bc7a8ba45daea7e2b +size 11444 diff --git a/config.json b/config.json new file mode 100644 index 0000000..16ceeec --- /dev/null +++ b/config.json @@ -0,0 +1,69 @@ +{ + "architectures": [ + "Qwen2ForCausalLM" + ], + "attention_dropout": 0.0, + "bos_token_id": null, + "dtype": "float32", + "eos_token_id": 151645, + "hidden_act": "silu", + "hidden_size": 2048, + "initializer_range": 0.02, + "intermediate_size": 11008, + "layer_types": [ + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention" + ], + "max_position_embeddings": 32768, + "max_window_layers": 70, + "model_type": "qwen2", + "num_attention_heads": 16, + "num_hidden_layers": 36, + "num_key_value_heads": 2, + "pad_token_id": 151643, + "rms_norm_eps": 1e-06, + "rope_parameters": { + "rope_theta": 1000000.0, + "rope_type": "default" + }, + "sliding_window": null, + "tie_word_embeddings": true, + "transformers_version": "5.12.1", + "use_cache": false, + "use_sliding_window": false, + "vocab_size": 151936 +} diff --git a/generation_config.json b/generation_config.json new file mode 100644 index 0000000..ebd4efd --- /dev/null +++ b/generation_config.json @@ -0,0 +1,13 @@ +{ + "do_sample": true, + "eos_token_id": [ + 151645, + 151643 + ], + "pad_token_id": 151643, + "repetition_penalty": 1.05, + "temperature": 0.7, + "top_k": 20, + "top_p": 0.8, + "transformers_version": "5.12.1" +} diff --git a/last-checkpoint/chat_template.jinja b/last-checkpoint/chat_template.jinja new file mode 100644 index 0000000..bdf7919 --- /dev/null +++ b/last-checkpoint/chat_template.jinja @@ -0,0 +1,54 @@ +{%- if tools %} + {{- '<|im_start|>system\n' }} + {%- if messages[0]['role'] == 'system' %} + {{- messages[0]['content'] }} + {%- else %} + {{- 'You are Qwen, created by Alibaba Cloud. You are a helpful assistant.' }} + {%- endif %} + {{- "\n\n# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within XML tags:\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n\n\nFor each function call, return a json object with function name and arguments within XML tags:\n\n{\"name\": , \"arguments\": }\n<|im_end|>\n" }} +{%- else %} + {%- if messages[0]['role'] == 'system' %} + {{- '<|im_start|>system\n' + messages[0]['content'] + '<|im_end|>\n' }} + {%- else %} + {{- '<|im_start|>system\nYou are Qwen, created by Alibaba Cloud. You are a helpful assistant.<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- for message in messages %} + {%- if (message.role == "user") or (message.role == "system" and not loop.first) or (message.role == "assistant" and not message.tool_calls) %} + {{- '<|im_start|>' + message.role + '\n' + message.content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {{- '<|im_start|>' + message.role }} + {%- if message.content %} + {{- '\n' + message.content }} + {%- endif %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {{- '\n\n{"name": "' }} + {{- tool_call.name }} + {{- '", "arguments": ' }} + {{- tool_call.arguments | tojson }} + {{- '}\n' }} + {%- endfor %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if (loop.index0 == 0) or (messages[loop.index0 - 1].role != "tool") %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- message.content }} + {{- '\n' }} + {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} +{%- endif %} diff --git a/last-checkpoint/config.json b/last-checkpoint/config.json new file mode 100644 index 0000000..16ceeec --- /dev/null +++ b/last-checkpoint/config.json @@ -0,0 +1,69 @@ +{ + "architectures": [ + "Qwen2ForCausalLM" + ], + "attention_dropout": 0.0, + "bos_token_id": null, + "dtype": "float32", + "eos_token_id": 151645, + "hidden_act": "silu", + "hidden_size": 2048, + "initializer_range": 0.02, + "intermediate_size": 11008, + "layer_types": [ + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention" + ], + "max_position_embeddings": 32768, + "max_window_layers": 70, + "model_type": "qwen2", + "num_attention_heads": 16, + "num_hidden_layers": 36, + "num_key_value_heads": 2, + "pad_token_id": 151643, + "rms_norm_eps": 1e-06, + "rope_parameters": { + "rope_theta": 1000000.0, + "rope_type": "default" + }, + "sliding_window": null, + "tie_word_embeddings": true, + "transformers_version": "5.12.1", + "use_cache": false, + "use_sliding_window": false, + "vocab_size": 151936 +} diff --git a/last-checkpoint/generation_config.json b/last-checkpoint/generation_config.json new file mode 100644 index 0000000..ebd4efd --- /dev/null +++ b/last-checkpoint/generation_config.json @@ -0,0 +1,13 @@ +{ + "do_sample": true, + "eos_token_id": [ + 151645, + 151643 + ], + "pad_token_id": 151643, + "repetition_penalty": 1.05, + "temperature": 0.7, + "top_k": 20, + "top_p": 0.8, + "transformers_version": "5.12.1" +} diff --git a/last-checkpoint/model.safetensors b/last-checkpoint/model.safetensors new file mode 100644 index 0000000..4b2f101 --- /dev/null +++ b/last-checkpoint/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:fc6f5f2c408ec1bcdc9764989dcda1583b874687a5817a5b5c01038ddd5bbd36 +size 12343804296 diff --git a/last-checkpoint/optimizer.pt b/last-checkpoint/optimizer.pt new file mode 100644 index 0000000..82fd17b --- /dev/null +++ b/last-checkpoint/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b2b8172bbff4c60ca141301f5cb6feb2f0defb0b4caf96d4cb9c6e59dc962bb1 +size 24687895753 diff --git a/last-checkpoint/rng_state.pth b/last-checkpoint/rng_state.pth new file mode 100644 index 0000000..1984bec --- /dev/null +++ b/last-checkpoint/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0e051f750413388c0be0b7635edb737eea8c5216659c617bd6b2b57c5379d622 +size 14645 diff --git a/last-checkpoint/scheduler.pt b/last-checkpoint/scheduler.pt new file mode 100644 index 0000000..f4889ec --- /dev/null +++ b/last-checkpoint/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:50a148f37d5c665866b1fd216052923b058b32e9e2b5b36dce5576d7ddb94a11 +size 1465 diff --git a/last-checkpoint/tokenizer.json b/last-checkpoint/tokenizer.json new file mode 100644 index 0000000..34510ff --- /dev/null +++ b/last-checkpoint/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3fd169731d2cbde95e10bf356d66d5997fd885dd8dbb6fb4684da3f23b2585d8 +size 11421892 diff --git a/last-checkpoint/tokenizer_config.json b/last-checkpoint/tokenizer_config.json new file mode 100644 index 0000000..4d8760d --- /dev/null +++ b/last-checkpoint/tokenizer_config.json @@ -0,0 +1,32 @@ +{ + "add_prefix_space": false, + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|im_end|>", + "errors": "replace", + "extra_special_tokens": [ + "<|im_start|>", + "<|im_end|>", + "<|object_ref_start|>", + "<|object_ref_end|>", + "<|box_start|>", + "<|box_end|>", + "<|quad_start|>", + "<|quad_end|>", + "<|vision_start|>", + "<|vision_end|>", + "<|vision_pad|>", + "<|image_pad|>", + "<|video_pad|>" + ], + "is_local": false, + "local_files_only": false, + "model_max_length": 131072, + "pad_token": "<|endoftext|>", + "padding_side": "left", + "split_special_tokens": false, + "tokenizer_class": "Qwen2Tokenizer", + "truncation_side": "left", + "unk_token": null +} diff --git a/last-checkpoint/trainer_state.json b/last-checkpoint/trainer_state.json new file mode 100644 index 0000000..45b9f1e --- /dev/null +++ b/last-checkpoint/trainer_state.json @@ -0,0 +1,1411 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.05, + "eval_steps": 500, + "global_step": 500, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.14998279511928558, + "epoch": 0.0001, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.0, + "learning_rate": 1e-06, + "loss": 0.0, + "num_tokens": 2568.0, + "reward": 0.0, + "reward_std": 0.0, + "rewards/_reward/mean": 0.0, + "rewards/_reward/std": 0.0, + "step": 1, + "step_time": 12.454096379224211 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.3256736550894048, + "epoch": 0.001, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.0, + "learning_rate": 9.819999999999999e-07, + "loss": 0.0, + "num_tokens": 27464.0, + "reward": 0.0, + "reward_std": 0.0, + "rewards/_reward/mean": 0.0, + "rewards/_reward/std": 0.0, + "step": 10, + "step_time": 11.780018932263678 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.2880026239901781, + "epoch": 0.002, + "frac_reward_zero_std": 0.8, + "grad_norm": 0.0, + "learning_rate": 9.619999999999999e-07, + "loss": 0.0, + "num_tokens": 55576.0, + "reward": 0.1, + "reward_std": 0.09258201122283935, + "rewards/_reward/mean": 0.1, + "rewards/_reward/std": 0.09258201122283935, + "step": 20, + "step_time": 12.011081893160007 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.9875, + "completions/max_length": 256.0, + "completions/max_terminated_length": 17.5, + "completions/mean_length": 254.9875, + "completions/mean_terminated_length": 17.5, + "completions/min_length": 247.9, + "completions/min_terminated_length": 17.5, + "entropy": 0.28849115688353777, + "epoch": 0.003, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.0, + "learning_rate": 9.419999999999999e-07, + "loss": 0.0, + "num_tokens": 83367.0, + "reward": 0.0, + "reward_std": 0.0, + "rewards/_reward/mean": 0.0, + "rewards/_reward/std": 0.0, + "step": 30, + "step_time": 12.034194040577859 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.95, + "completions/max_length": 256.0, + "completions/max_terminated_length": 23.4, + "completions/mean_length": 253.9, + "completions/mean_terminated_length": 21.4, + "completions/min_length": 249.1, + "completions/min_terminated_length": 18.7, + "entropy": 0.2561770185828209, + "epoch": 0.004, + "frac_reward_zero_std": 0.9, + "grad_norm": 2.998258590698242, + "learning_rate": 9.22e-07, + "loss": 1.4901161193847657e-09, + "num_tokens": 111439.0, + "reward": 0.0875, + "reward_std": 0.03535533845424652, + "rewards/_reward/mean": 0.0875, + "rewards/_reward/std": 0.03535533845424652, + "step": 40, + "step_time": 12.092716509709135 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.21435276679694654, + "epoch": 0.005, + "frac_reward_zero_std": 0.9, + "grad_norm": 0.0, + "learning_rate": 9.02e-07, + "loss": 1.4901161193847657e-09, + "num_tokens": 139943.0, + "reward": 0.0375, + "reward_std": 0.051754921674728394, + "rewards/_reward/mean": 0.0375, + "rewards/_reward/std": 0.051754921674728394, + "step": 50, + "step_time": 11.898367898073047 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.20879782736301422, + "epoch": 0.006, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.0, + "learning_rate": 8.82e-07, + "loss": 0.0, + "num_tokens": 168911.0, + "reward": 0.0, + "reward_std": 0.0, + "rewards/_reward/mean": 0.0, + "rewards/_reward/std": 0.0, + "step": 60, + "step_time": 11.92987802445423 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.23100027367472648, + "epoch": 0.007, + "frac_reward_zero_std": 0.9, + "grad_norm": 0.0, + "learning_rate": 8.62e-07, + "loss": -1.4901161193847657e-09, + "num_tokens": 197359.0, + "reward": 0.0125, + "reward_std": 0.03535533845424652, + "rewards/_reward/mean": 0.0125, + "rewards/_reward/std": 0.03535533845424652, + "step": 70, + "step_time": 11.958151014475153 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.24868577010929585, + "epoch": 0.008, + "frac_reward_zero_std": 0.8, + "grad_norm": 2.808773994445801, + "learning_rate": 8.419999999999999e-07, + "loss": 0.0, + "num_tokens": 224775.0, + "reward": 0.15, + "reward_std": 0.08711026012897491, + "rewards/_reward/mean": 0.15, + "rewards/_reward/std": 0.08711026012897491, + "step": 80, + "step_time": 11.96262693060562 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.23981668353080748, + "epoch": 0.009, + "frac_reward_zero_std": 0.9, + "grad_norm": 0.0, + "learning_rate": 8.219999999999999e-07, + "loss": -1.4901161193847657e-09, + "num_tokens": 252687.0, + "reward": 0.0625, + "reward_std": 0.051754921674728394, + "rewards/_reward/mean": 0.0625, + "rewards/_reward/std": 0.051754921674728394, + "step": 90, + "step_time": 11.79044756719377 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.9875, + "completions/max_length": 256.0, + "completions/max_terminated_length": 25.6, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 25.6, + "completions/min_length": 256.0, + "completions/min_terminated_length": 25.6, + "entropy": 0.2731012573465705, + "epoch": 0.01, + "frac_reward_zero_std": 0.9, + "grad_norm": 0.0, + "learning_rate": 8.02e-07, + "loss": 0.0, + "num_tokens": 280847.0, + "reward": 0.0625, + "reward_std": 0.051754921674728394, + "rewards/_reward/mean": 0.0625, + "rewards/_reward/std": 0.051754921674728394, + "step": 100, + "step_time": 11.873896015947684 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.2539512518793344, + "epoch": 0.011, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.0, + "learning_rate": 7.82e-07, + "loss": 0.0, + "num_tokens": 308583.0, + "reward": 0.0, + "reward_std": 0.0, + "rewards/_reward/mean": 0.0, + "rewards/_reward/std": 0.0, + "step": 110, + "step_time": 12.493365852814168 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.23124769441783427, + "epoch": 0.012, + "frac_reward_zero_std": 0.8, + "grad_norm": 0.0, + "learning_rate": 7.62e-07, + "loss": -4.470348358154297e-09, + "num_tokens": 336751.0, + "reward": 0.0375, + "reward_std": 0.0816463440656662, + "rewards/_reward/mean": 0.0375, + "rewards/_reward/std": 0.0816463440656662, + "step": 120, + "step_time": 12.216748453862966 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.24605347998440266, + "epoch": 0.013, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.0, + "learning_rate": 7.42e-07, + "loss": 0.0, + "num_tokens": 366007.0, + "reward": 0.0, + "reward_std": 0.0, + "rewards/_reward/mean": 0.0, + "rewards/_reward/std": 0.0, + "step": 130, + "step_time": 11.979620195319876 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.23477237336337567, + "epoch": 0.014, + "frac_reward_zero_std": 0.9, + "grad_norm": 0.0, + "learning_rate": 7.219999999999999e-07, + "loss": -1.4901161193847657e-09, + "num_tokens": 396623.0, + "reward": 0.0125, + "reward_std": 0.03535533845424652, + "rewards/_reward/mean": 0.0125, + "rewards/_reward/std": 0.03535533845424652, + "step": 140, + "step_time": 11.984532529045827 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.19286549724638463, + "epoch": 0.015, + "frac_reward_zero_std": 0.7, + "grad_norm": 0.0, + "learning_rate": 7.019999999999999e-07, + "loss": 1.4901161193847657e-09, + "num_tokens": 425055.0, + "reward": 0.0875, + "reward_std": 0.1388651818037033, + "rewards/_reward/mean": 0.0875, + "rewards/_reward/std": 0.1388651818037033, + "step": 150, + "step_time": 11.88744165727403 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.2272243991494179, + "epoch": 0.016, + "frac_reward_zero_std": 0.7, + "grad_norm": 3.0967137813568115, + "learning_rate": 6.82e-07, + "loss": 0.0, + "num_tokens": 453151.0, + "reward": 0.15, + "reward_std": 0.1334012657403946, + "rewards/_reward/mean": 0.15, + "rewards/_reward/std": 0.1334012657403946, + "step": 160, + "step_time": 12.118341535096988 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.19670370109379293, + "epoch": 0.017, + "frac_reward_zero_std": 0.8, + "grad_norm": 0.0, + "learning_rate": 6.62e-07, + "loss": 0.0, + "num_tokens": 480895.0, + "reward": 0.05, + "reward_std": 0.08711026012897491, + "rewards/_reward/mean": 0.05, + "rewards/_reward/std": 0.08711026012897491, + "step": 170, + "step_time": 11.987511804816313 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.28401327803730964, + "epoch": 0.018, + "frac_reward_zero_std": 0.9, + "grad_norm": 0.0, + "learning_rate": 6.42e-07, + "loss": -1.4901161193847657e-09, + "num_tokens": 508823.0, + "reward": 0.0625, + "reward_std": 0.051754921674728394, + "rewards/_reward/mean": 0.0625, + "rewards/_reward/std": 0.051754921674728394, + "step": 180, + "step_time": 11.97194695000071 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.2276454884558916, + "epoch": 0.019, + "frac_reward_zero_std": 0.6, + "grad_norm": 0.0, + "learning_rate": 6.219999999999999e-07, + "loss": -5.960464477539063e-09, + "num_tokens": 537039.0, + "reward": 0.075, + "reward_std": 0.1632926881313324, + "rewards/_reward/mean": 0.075, + "rewards/_reward/std": 0.1632926881313324, + "step": 190, + "step_time": 11.945305320294574 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.21875664182007312, + "epoch": 0.02, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.0, + "learning_rate": 6.019999999999999e-07, + "loss": 0.0, + "num_tokens": 565071.0, + "reward": 0.0, + "reward_std": 0.0, + "rewards/_reward/mean": 0.0, + "rewards/_reward/std": 0.0, + "step": 200, + "step_time": 12.232728651817888 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.9875, + "completions/max_length": 256.0, + "completions/max_terminated_length": 21.1, + "completions/mean_length": 255.4375, + "completions/mean_terminated_length": 21.1, + "completions/min_length": 251.5, + "completions/min_terminated_length": 21.1, + "entropy": 0.26000291779637336, + "epoch": 0.021, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.0, + "learning_rate": 5.819999999999999e-07, + "loss": 0.0, + "num_tokens": 592882.0, + "reward": 0.0, + "reward_std": 0.0, + "rewards/_reward/mean": 0.0, + "rewards/_reward/std": 0.0, + "step": 210, + "step_time": 13.310213024541735 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.23193855732679367, + "epoch": 0.022, + "frac_reward_zero_std": 0.7, + "grad_norm": 0.0, + "learning_rate": 5.620000000000001e-07, + "loss": -1.4901161193847657e-09, + "num_tokens": 623314.0, + "reward": 0.0625, + "reward_std": 0.12246559858322144, + "rewards/_reward/mean": 0.0625, + "rewards/_reward/std": 0.12246559858322144, + "step": 220, + "step_time": 12.41725982457865 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.19535631276667118, + "epoch": 0.023, + "frac_reward_zero_std": 0.9, + "grad_norm": 0.0, + "learning_rate": 5.420000000000001e-07, + "loss": -1.4901161193847657e-09, + "num_tokens": 651706.0, + "reward": 0.0125, + "reward_std": 0.03535533845424652, + "rewards/_reward/mean": 0.0125, + "rewards/_reward/std": 0.03535533845424652, + "step": 230, + "step_time": 12.160462697478943 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.24304591715335847, + "epoch": 0.024, + "frac_reward_zero_std": 0.9, + "grad_norm": 0.0, + "learning_rate": 5.22e-07, + "loss": -2.9802322387695314e-09, + "num_tokens": 685298.0, + "reward": 0.025, + "reward_std": 0.046291005611419675, + "rewards/_reward/mean": 0.025, + "rewards/_reward/std": 0.046291005611419675, + "step": 240, + "step_time": 12.644157648505644 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.219215127825737, + "epoch": 0.025, + "frac_reward_zero_std": 0.7, + "grad_norm": 0.0, + "learning_rate": 5.02e-07, + "loss": 1.4901161193847657e-09, + "num_tokens": 713786.0, + "reward": 0.1375, + "reward_std": 0.12246559858322144, + "rewards/_reward/mean": 0.1375, + "rewards/_reward/std": 0.12246559858322144, + "step": 250, + "step_time": 12.234266605251468 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.95, + "completions/max_length": 256.0, + "completions/max_terminated_length": 24.6, + "completions/mean_length": 254.175, + "completions/mean_terminated_length": 21.95, + "completions/min_length": 248.0, + "completions/min_terminated_length": 17.6, + "entropy": 0.23214468434453012, + "epoch": 0.026, + "frac_reward_zero_std": 0.8, + "grad_norm": 0.0, + "learning_rate": 4.82e-07, + "loss": -4.470348358154297e-09, + "num_tokens": 741568.0, + "reward": 0.0375, + "reward_std": 0.0816463440656662, + "rewards/_reward/mean": 0.0375, + "rewards/_reward/std": 0.0816463440656662, + "step": 260, + "step_time": 11.861435349751265 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.3036452613770962, + "epoch": 0.027, + "frac_reward_zero_std": 0.9, + "grad_norm": 0.0, + "learning_rate": 4.62e-07, + "loss": 0.0, + "num_tokens": 769408.0, + "reward": 0.05, + "reward_std": 0.05345224738121033, + "rewards/_reward/mean": 0.05, + "rewards/_reward/std": 0.05345224738121033, + "step": 270, + "step_time": 11.96508414738346 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.28062224201858044, + "epoch": 0.028, + "frac_reward_zero_std": 0.9, + "grad_norm": 0.0, + "learning_rate": 4.4199999999999996e-07, + "loss": -1.4901161193847657e-09, + "num_tokens": 796792.0, + "reward": 0.0125, + "reward_std": 0.03535533845424652, + "rewards/_reward/mean": 0.0125, + "rewards/_reward/std": 0.03535533845424652, + "step": 280, + "step_time": 12.066837795078754 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.3000262677669525, + "epoch": 0.029, + "frac_reward_zero_std": 0.8, + "grad_norm": 0.0, + "learning_rate": 4.2199999999999994e-07, + "loss": -1.4901161193847657e-09, + "num_tokens": 822888.0, + "reward": 0.0625, + "reward_std": 0.08880758583545685, + "rewards/_reward/mean": 0.0625, + "rewards/_reward/std": 0.08880758583545685, + "step": 290, + "step_time": 11.958969497331418 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.2139466732740402, + "epoch": 0.03, + "frac_reward_zero_std": 0.9, + "grad_norm": 0.0, + "learning_rate": 4.02e-07, + "loss": -1.4901161193847657e-09, + "num_tokens": 851112.0, + "reward": 0.0125, + "reward_std": 0.03535533845424652, + "rewards/_reward/mean": 0.0125, + "rewards/_reward/std": 0.03535533845424652, + "step": 300, + "step_time": 12.465268377074972 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.21100819781422614, + "epoch": 0.031, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.0, + "learning_rate": 3.82e-07, + "loss": 0.0, + "num_tokens": 880296.0, + "reward": 0.0, + "reward_std": 0.0, + "rewards/_reward/mean": 0.0, + "rewards/_reward/std": 0.0, + "step": 310, + "step_time": 12.395630138413981 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.1856917714700103, + "epoch": 0.032, + "frac_reward_zero_std": 0.8, + "grad_norm": 0.0, + "learning_rate": 3.62e-07, + "loss": -4.470348358154297e-09, + "num_tokens": 909568.0, + "reward": 0.0375, + "reward_std": 0.0816463440656662, + "rewards/_reward/mean": 0.0375, + "rewards/_reward/std": 0.0816463440656662, + "step": 320, + "step_time": 12.158450052631087 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.9875, + "completions/max_length": 256.0, + "completions/max_terminated_length": 22.2, + "completions/mean_length": 255.575, + "completions/mean_terminated_length": 22.2, + "completions/min_length": 252.6, + "completions/min_terminated_length": 22.2, + "entropy": 0.23710842803120613, + "epoch": 0.033, + "frac_reward_zero_std": 0.7, + "grad_norm": 0.0, + "learning_rate": 3.42e-07, + "loss": 0.004176859557628631, + "num_tokens": 937678.0, + "reward": 0.2, + "reward_std": 0.11700168251991272, + "rewards/_reward/mean": 0.2, + "rewards/_reward/std": 0.11700168251991272, + "step": 330, + "step_time": 11.860222824080846 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.9375, + "completions/max_length": 256.0, + "completions/max_terminated_length": 23.6, + "completions/mean_length": 253.8125, + "completions/mean_terminated_length": 22.1, + "completions/min_length": 251.1, + "completions/min_terminated_length": 20.7, + "entropy": 0.26537639163434507, + "epoch": 0.034, + "frac_reward_zero_std": 0.8, + "grad_norm": 0.0, + "learning_rate": 3.22e-07, + "loss": 0.00504487007856369, + "num_tokens": 967055.0, + "reward": 0.1125, + "reward_std": 0.09804592728614807, + "rewards/_reward/mean": 0.1125, + "rewards/_reward/std": 0.09804592728614807, + "step": 340, + "step_time": 11.909155616955832 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.9875, + "completions/max_length": 256.0, + "completions/max_terminated_length": 14.8, + "completions/mean_length": 254.65, + "completions/mean_terminated_length": 14.8, + "completions/min_length": 245.2, + "completions/min_terminated_length": 14.8, + "entropy": 0.2996050529181957, + "epoch": 0.035, + "frac_reward_zero_std": 0.9, + "grad_norm": 0.0, + "learning_rate": 3.02e-07, + "loss": -2.9802322387695314e-09, + "num_tokens": 995547.0, + "reward": 0.025, + "reward_std": 0.046291005611419675, + "rewards/_reward/mean": 0.025, + "rewards/_reward/std": 0.046291005611419675, + "step": 350, + "step_time": 11.996557193179616 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.32317615337669847, + "epoch": 0.036, + "frac_reward_zero_std": 0.5, + "grad_norm": 0.0, + "learning_rate": 2.8199999999999996e-07, + "loss": -2.9802322387695314e-09, + "num_tokens": 1023283.0, + "reward": 0.125, + "reward_std": 0.2205115258693695, + "rewards/_reward/mean": 0.125, + "rewards/_reward/std": 0.2205115258693695, + "step": 360, + "step_time": 12.106001363391988 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.24275533333420754, + "epoch": 0.037, + "frac_reward_zero_std": 0.8, + "grad_norm": 0.0, + "learning_rate": 2.62e-07, + "loss": -2.9802322387695314e-09, + "num_tokens": 1052363.0, + "reward": 0.075, + "reward_std": 0.09974325299263001, + "rewards/_reward/mean": 0.075, + "rewards/_reward/std": 0.09974325299263001, + "step": 370, + "step_time": 12.040205320669338 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.24013530761003493, + "epoch": 0.038, + "frac_reward_zero_std": 0.9, + "grad_norm": 0.0, + "learning_rate": 2.4199999999999997e-07, + "loss": 0.0, + "num_tokens": 1082899.0, + "reward": 0.05, + "reward_std": 0.05345224738121033, + "rewards/_reward/mean": 0.05, + "rewards/_reward/std": 0.05345224738121033, + "step": 380, + "step_time": 12.06431267345324 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.2428251437842846, + "epoch": 0.039, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.0, + "learning_rate": 2.22e-07, + "loss": 0.0, + "num_tokens": 1110755.0, + "reward": 0.0, + "reward_std": 0.0, + "rewards/_reward/mean": 0.0, + "rewards/_reward/std": 0.0, + "step": 390, + "step_time": 11.996180486050434 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.23162611648440362, + "epoch": 0.04, + "frac_reward_zero_std": 0.9, + "grad_norm": 0.0, + "learning_rate": 2.02e-07, + "loss": -1.4901161193847657e-09, + "num_tokens": 1140787.0, + "reward": 0.0125, + "reward_std": 0.03535533845424652, + "rewards/_reward/mean": 0.0125, + "rewards/_reward/std": 0.03535533845424652, + "step": 400, + "step_time": 12.043787954607978 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.19889585115015507, + "epoch": 0.041, + "frac_reward_zero_std": 0.9, + "grad_norm": 3.5882863998413086, + "learning_rate": 1.82e-07, + "loss": -2.9802322387695314e-09, + "num_tokens": 1171195.0, + "reward": 0.025, + "reward_std": 0.046291005611419675, + "rewards/_reward/mean": 0.025, + "rewards/_reward/std": 0.046291005611419675, + "step": 410, + "step_time": 12.544210581574589 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.9875, + "completions/max_length": 256.0, + "completions/max_terminated_length": 21.1, + "completions/mean_length": 255.4375, + "completions/mean_terminated_length": 21.1, + "completions/min_length": 251.5, + "completions/min_terminated_length": 21.1, + "entropy": 0.2701777949929237, + "epoch": 0.042, + "frac_reward_zero_std": 0.9, + "grad_norm": 0.0, + "learning_rate": 1.62e-07, + "loss": -1.4901161193847657e-09, + "num_tokens": 1200286.0, + "reward": 0.0125, + "reward_std": 0.03535533845424652, + "rewards/_reward/mean": 0.0125, + "rewards/_reward/std": 0.03535533845424652, + "step": 420, + "step_time": 12.16728035644628 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.3225971393287182, + "epoch": 0.043, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.0, + "learning_rate": 1.4199999999999997e-07, + "loss": 0.0, + "num_tokens": 1227534.0, + "reward": 0.0, + "reward_std": 0.0, + "rewards/_reward/mean": 0.0, + "rewards/_reward/std": 0.0, + "step": 430, + "step_time": 11.870932286046445 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.9875, + "completions/max_length": 256.0, + "completions/max_terminated_length": 21.6, + "completions/mean_length": 255.5, + "completions/mean_terminated_length": 21.6, + "completions/min_length": 252.0, + "completions/min_terminated_length": 21.6, + "entropy": 0.31563936099410056, + "epoch": 0.044, + "frac_reward_zero_std": 0.9, + "grad_norm": 0.0, + "learning_rate": 1.2199999999999998e-07, + "loss": 0.0018630266189575196, + "num_tokens": 1255606.0, + "reward": 0.05, + "reward_std": 0.05345224738121033, + "rewards/_reward/mean": 0.05, + "rewards/_reward/std": 0.05345224738121033, + "step": 440, + "step_time": 11.937281881668605 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.29385386109352113, + "epoch": 0.045, + "frac_reward_zero_std": 0.9, + "grad_norm": 0.0, + "learning_rate": 1.0199999999999999e-07, + "loss": -1.4901161193847657e-09, + "num_tokens": 1283918.0, + "reward": 0.0125, + "reward_std": 0.03535533845424652, + "rewards/_reward/mean": 0.0125, + "rewards/_reward/std": 0.03535533845424652, + "step": 450, + "step_time": 11.907829734543338 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.24251684471964835, + "epoch": 0.046, + "frac_reward_zero_std": 0.8, + "grad_norm": 2.7865607738494873, + "learning_rate": 8.2e-08, + "loss": -2.9802322387695314e-09, + "num_tokens": 1311366.0, + "reward": 0.075, + "reward_std": 0.08711026012897491, + "rewards/_reward/mean": 0.075, + "rewards/_reward/std": 0.08711026012897491, + "step": 460, + "step_time": 11.847331281122752 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.26004682183265687, + "epoch": 0.047, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.0, + "learning_rate": 6.2e-08, + "loss": 0.0, + "num_tokens": 1340998.0, + "reward": 0.0, + "reward_std": 0.0, + "rewards/_reward/mean": 0.0, + "rewards/_reward/std": 0.0, + "step": 470, + "step_time": 11.923272962146438 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.26978809721767905, + "epoch": 0.048, + "frac_reward_zero_std": 0.9, + "grad_norm": 0.0, + "learning_rate": 4.2e-08, + "loss": 2.9802322387695314e-09, + "num_tokens": 1367454.0, + "reward": 0.075, + "reward_std": 0.046291005611419675, + "rewards/_reward/mean": 0.075, + "rewards/_reward/std": 0.046291005611419675, + "step": 480, + "step_time": 11.881628181389534 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.2236021153628826, + "epoch": 0.049, + "frac_reward_zero_std": 0.8, + "grad_norm": 0.0, + "learning_rate": 2.2e-08, + "loss": -4.470348358154297e-09, + "num_tokens": 1398310.0, + "reward": 0.0375, + "reward_std": 0.0816463440656662, + "rewards/_reward/mean": 0.0375, + "rewards/_reward/std": 0.0816463440656662, + "step": 490, + "step_time": 11.971941134915687 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.33287600688636304, + "epoch": 0.05, + "frac_reward_zero_std": 0.8, + "grad_norm": 0.0, + "learning_rate": 2e-09, + "loss": -2.9802322387695314e-09, + "num_tokens": 1425470.0, + "reward": 0.025, + "reward_std": 0.07071067690849304, + "rewards/_reward/mean": 0.025, + "rewards/_reward/std": 0.07071067690849304, + "step": 500, + "step_time": 11.938134964392521 + } + ], + "logging_steps": 10, + "max_steps": 500, + "num_input_tokens_seen": 1425470, + "num_train_epochs": 1, + "save_steps": 100, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": true + }, + "attributes": {} + } + }, + "total_flos": 0.0, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/last-checkpoint/training_args.bin b/last-checkpoint/training_args.bin new file mode 100644 index 0000000..7a51acb --- /dev/null +++ b/last-checkpoint/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:03313dcc06383936eb9a08afbaf5086c5478a5f1672f010949c14c2973aa3348 +size 7377 diff --git a/model.safetensors b/model.safetensors new file mode 100644 index 0000000..4b2f101 --- /dev/null +++ b/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:fc6f5f2c408ec1bcdc9764989dcda1583b874687a5817a5b5c01038ddd5bbd36 +size 12343804296 diff --git a/tokenizer.json b/tokenizer.json new file mode 100644 index 0000000..34510ff --- /dev/null +++ b/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3fd169731d2cbde95e10bf356d66d5997fd885dd8dbb6fb4684da3f23b2585d8 +size 11421892 diff --git a/tokenizer_config.json b/tokenizer_config.json new file mode 100644 index 0000000..4d8760d --- /dev/null +++ b/tokenizer_config.json @@ -0,0 +1,32 @@ +{ + "add_prefix_space": false, + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|im_end|>", + "errors": "replace", + "extra_special_tokens": [ + "<|im_start|>", + "<|im_end|>", + "<|object_ref_start|>", + "<|object_ref_end|>", + "<|box_start|>", + "<|box_end|>", + "<|quad_start|>", + "<|quad_end|>", + "<|vision_start|>", + "<|vision_end|>", + "<|vision_pad|>", + "<|image_pad|>", + "<|video_pad|>" + ], + "is_local": false, + "local_files_only": false, + "model_max_length": 131072, + "pad_token": "<|endoftext|>", + "padding_side": "left", + "split_special_tokens": false, + "tokenizer_class": "Qwen2Tokenizer", + "truncation_side": "left", + "unk_token": null +} diff --git a/training_args.bin b/training_args.bin new file mode 100644 index 0000000..7a51acb --- /dev/null +++ b/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:03313dcc06383936eb9a08afbaf5086c5478a5f1672f010949c14c2973aa3348 +size 7377