From 504d8a9f1acd1f5f287d426a8d5f96700cb2f583 Mon Sep 17 00:00:00 2001 From: ModelHub XC Date: Tue, 21 Jul 2026 14:32:09 +0800 Subject: [PATCH] =?UTF-8?q?=E5=88=9D=E5=A7=8B=E5=8C=96=E9=A1=B9=E7=9B=AE?= =?UTF-8?q?=EF=BC=8C=E7=94=B1ModelHub=20XC=E7=A4=BE=E5=8C=BA=E6=8F=90?= =?UTF-8?q?=E4=BE=9B=E6=A8=A1=E5=9E=8B?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit Model: narcolepticchicken/occ-grpo-costaware Source: Original Platform --- .gitattributes | 36 + README.md | 64 ++ chat_template.jinja | 54 + completions/completions_00001.parquet | 3 + completions/completions_00010.parquet | 3 + completions/completions_00020.parquet | 3 + completions/completions_00030.parquet | 3 + completions/completions_00040.parquet | 3 + completions/completions_00050.parquet | 3 + completions/completions_00060.parquet | 3 + completions/completions_00070.parquet | 3 + completions/completions_00080.parquet | 3 + completions/completions_00090.parquet | 3 + completions/completions_00100.parquet | 3 + completions/completions_00110.parquet | 3 + completions/completions_00120.parquet | 3 + completions/completions_00130.parquet | 3 + completions/completions_00140.parquet | 3 + completions/completions_00150.parquet | 3 + completions/completions_00160.parquet | 3 + completions/completions_00170.parquet | 3 + completions/completions_00180.parquet | 3 + completions/completions_00190.parquet | 3 + completions/completions_00200.parquet | 3 + completions/completions_00210.parquet | 3 + completions/completions_00220.parquet | 3 + completions/completions_00230.parquet | 3 + completions/completions_00240.parquet | 3 + completions/completions_00250.parquet | 3 + completions/completions_00260.parquet | 3 + completions/completions_00270.parquet | 3 + completions/completions_00280.parquet | 3 + completions/completions_00290.parquet | 3 + completions/completions_00300.parquet | 3 + completions/completions_00310.parquet | 3 + completions/completions_00320.parquet | 3 + completions/completions_00330.parquet | 3 + completions/completions_00340.parquet | 3 + completions/completions_00350.parquet | 3 + completions/completions_00360.parquet | 3 + completions/completions_00370.parquet | 3 + completions/completions_00380.parquet | 3 + completions/completions_00390.parquet | 3 + completions/completions_00400.parquet | 3 + completions/completions_00410.parquet | 3 + completions/completions_00420.parquet | 3 + completions/completions_00430.parquet | 3 + completions/completions_00440.parquet | 3 + completions/completions_00450.parquet | 3 + completions/completions_00460.parquet | 3 + completions/completions_00470.parquet | 3 + completions/completions_00480.parquet | 3 + completions/completions_00490.parquet | 3 + completions/completions_00500.parquet | 3 + config.json | 69 ++ generation_config.json | 13 + last-checkpoint/chat_template.jinja | 54 + last-checkpoint/config.json | 69 ++ last-checkpoint/generation_config.json | 13 + last-checkpoint/model.safetensors | 3 + last-checkpoint/optimizer.pt | 3 + last-checkpoint/rng_state.pth | 3 + last-checkpoint/scheduler.pt | 3 + last-checkpoint/tokenizer.json | 3 + last-checkpoint/tokenizer_config.json | 32 + last-checkpoint/trainer_state.json | 1411 ++++++++++++++++++++++++ last-checkpoint/training_args.bin | 3 + model.safetensors | 3 + tokenizer.json | 3 + tokenizer_config.json | 32 + training_args.bin | 3 + 71 files changed, 2027 insertions(+) create mode 100644 .gitattributes create mode 100644 README.md create mode 100644 chat_template.jinja create mode 100644 completions/completions_00001.parquet create mode 100644 completions/completions_00010.parquet create mode 100644 completions/completions_00020.parquet create mode 100644 completions/completions_00030.parquet create mode 100644 completions/completions_00040.parquet create mode 100644 completions/completions_00050.parquet create mode 100644 completions/completions_00060.parquet create mode 100644 completions/completions_00070.parquet create mode 100644 completions/completions_00080.parquet create mode 100644 completions/completions_00090.parquet create mode 100644 completions/completions_00100.parquet create mode 100644 completions/completions_00110.parquet create mode 100644 completions/completions_00120.parquet create mode 100644 completions/completions_00130.parquet create mode 100644 completions/completions_00140.parquet create mode 100644 completions/completions_00150.parquet create mode 100644 completions/completions_00160.parquet create mode 100644 completions/completions_00170.parquet create mode 100644 completions/completions_00180.parquet create mode 100644 completions/completions_00190.parquet create mode 100644 completions/completions_00200.parquet create mode 100644 completions/completions_00210.parquet create mode 100644 completions/completions_00220.parquet create mode 100644 completions/completions_00230.parquet create mode 100644 completions/completions_00240.parquet create mode 100644 completions/completions_00250.parquet create mode 100644 completions/completions_00260.parquet create mode 100644 completions/completions_00270.parquet create mode 100644 completions/completions_00280.parquet create mode 100644 completions/completions_00290.parquet create mode 100644 completions/completions_00300.parquet create mode 100644 completions/completions_00310.parquet create mode 100644 completions/completions_00320.parquet create mode 100644 completions/completions_00330.parquet create mode 100644 completions/completions_00340.parquet create mode 100644 completions/completions_00350.parquet create mode 100644 completions/completions_00360.parquet create mode 100644 completions/completions_00370.parquet create mode 100644 completions/completions_00380.parquet create mode 100644 completions/completions_00390.parquet create mode 100644 completions/completions_00400.parquet create mode 100644 completions/completions_00410.parquet create mode 100644 completions/completions_00420.parquet create mode 100644 completions/completions_00430.parquet create mode 100644 completions/completions_00440.parquet create mode 100644 completions/completions_00450.parquet create mode 100644 completions/completions_00460.parquet create mode 100644 completions/completions_00470.parquet create mode 100644 completions/completions_00480.parquet create mode 100644 completions/completions_00490.parquet create mode 100644 completions/completions_00500.parquet create mode 100644 config.json create mode 100644 generation_config.json create mode 100644 last-checkpoint/chat_template.jinja create mode 100644 last-checkpoint/config.json create mode 100644 last-checkpoint/generation_config.json create mode 100644 last-checkpoint/model.safetensors create mode 100644 last-checkpoint/optimizer.pt create mode 100644 last-checkpoint/rng_state.pth create mode 100644 last-checkpoint/scheduler.pt create mode 100644 last-checkpoint/tokenizer.json create mode 100644 last-checkpoint/tokenizer_config.json create mode 100644 last-checkpoint/trainer_state.json create mode 100644 last-checkpoint/training_args.bin create mode 100644 model.safetensors create mode 100644 tokenizer.json create mode 100644 tokenizer_config.json create mode 100644 training_args.bin diff --git a/.gitattributes b/.gitattributes new file mode 100644 index 0000000..52373fe --- /dev/null +++ b/.gitattributes @@ -0,0 +1,36 @@ +*.7z filter=lfs diff=lfs merge=lfs -text +*.arrow filter=lfs diff=lfs merge=lfs -text +*.bin filter=lfs diff=lfs merge=lfs -text +*.bz2 filter=lfs diff=lfs merge=lfs -text +*.ckpt filter=lfs diff=lfs merge=lfs -text +*.ftz filter=lfs diff=lfs merge=lfs -text +*.gz filter=lfs diff=lfs merge=lfs -text +*.h5 filter=lfs diff=lfs merge=lfs -text +*.joblib filter=lfs diff=lfs merge=lfs -text +*.lfs.* filter=lfs diff=lfs merge=lfs -text +*.mlmodel filter=lfs diff=lfs merge=lfs -text +*.model filter=lfs diff=lfs merge=lfs -text +*.msgpack filter=lfs diff=lfs merge=lfs -text +*.npy filter=lfs diff=lfs merge=lfs -text +*.npz filter=lfs diff=lfs merge=lfs -text +*.onnx filter=lfs diff=lfs merge=lfs -text +*.ot filter=lfs diff=lfs merge=lfs -text +*.parquet filter=lfs diff=lfs merge=lfs -text +*.pb filter=lfs diff=lfs merge=lfs -text +*.pickle filter=lfs diff=lfs merge=lfs -text +*.pkl filter=lfs diff=lfs merge=lfs -text +*.pt filter=lfs diff=lfs merge=lfs -text +*.pth filter=lfs diff=lfs merge=lfs -text +*.rar filter=lfs diff=lfs merge=lfs -text +*.safetensors filter=lfs diff=lfs merge=lfs -text +saved_model/**/* filter=lfs diff=lfs merge=lfs -text +*.tar.* filter=lfs diff=lfs merge=lfs -text +*.tar filter=lfs diff=lfs merge=lfs -text +*.tflite filter=lfs diff=lfs merge=lfs -text +*.tgz filter=lfs diff=lfs merge=lfs -text +*.wasm filter=lfs diff=lfs merge=lfs -text +*.xz filter=lfs diff=lfs merge=lfs -text +*.zip filter=lfs diff=lfs merge=lfs -text +*.zst filter=lfs diff=lfs merge=lfs -text +*tfevents* filter=lfs diff=lfs merge=lfs -text +tokenizer.json filter=lfs diff=lfs merge=lfs -text diff --git a/README.md b/README.md new file mode 100644 index 0000000..d46de03 --- /dev/null +++ b/README.md @@ -0,0 +1,64 @@ +--- +base_model: Qwen/Qwen2.5-3B-Instruct +library_name: transformers +model_name: occ-grpo-costaware +tags: +- generated_from_trainer +- hf_jobs +- grpo +- trl +licence: license +--- + +# Model Card for occ-grpo-costaware + +This model is a fine-tuned version of [Qwen/Qwen2.5-3B-Instruct](https://huggingface.co/Qwen/Qwen2.5-3B-Instruct). +It has been trained using [TRL](https://github.com/huggingface/trl). + +## Quick start + +```python +from transformers import pipeline + +question = "If you had a time machine, but could only go to the past or the future once and never return, which would you choose and why?" +generator = pipeline("text-generation", model="narcolepticchicken/occ-grpo-costaware", device="cuda") +output = generator([{"role": "user", "content": question}], max_new_tokens=128, return_full_text=False)[0] +print(output["generated_text"]) +``` + +## Training procedure + +This model was trained with GRPO, a method introduced in [DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models](https://huggingface.co/papers/2402.03300). + +### Framework versions + +- TRL: 1.7.0 +- Transformers: 5.12.1 +- Pytorch: 2.12.1 +- Datasets: 5.0.0 +- Tokenizers: 0.22.2 + +## Citations + +Cite GRPO as: + +```bibtex +@article{shao2024deepseekmath, + title = {{DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models}}, + author = {Zhihong Shao and Peiyi Wang and Qihao Zhu and Runxin Xu and Junxiao Song and Mingchuan Zhang and Y. K. Li and Y. Wu and Daya Guo}, + year = 2024, + eprint = {arXiv:2402.03300}, +} +``` + +Cite TRL as: + +```bibtex +@software{vonwerra2020trl, + title = {{TRL: Transformers Reinforcement Learning}}, + author = {von Werra, Leandro and Belkada, Younes and Tunstall, Lewis and Beeching, Edward and Thrush, Tristan and Lambert, Nathan and Huang, Shengyi and Rasul, Kashif and Gallouédec, Quentin}, + license = {Apache-2.0}, + url = {https://github.com/huggingface/trl}, + year = {2020} +} +``` diff --git a/chat_template.jinja b/chat_template.jinja new file mode 100644 index 0000000..bdf7919 --- /dev/null +++ b/chat_template.jinja @@ -0,0 +1,54 @@ +{%- if tools %} + {{- '<|im_start|>system\n' }} + {%- if messages[0]['role'] == 'system' %} + {{- messages[0]['content'] }} + {%- else %} + {{- 'You are Qwen, created by Alibaba Cloud. You are a helpful assistant.' }} + {%- endif %} + {{- "\n\n# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within XML tags:\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n\n\nFor each function call, return a json object with function name and arguments within XML tags:\n\n{\"name\": , \"arguments\": }\n<|im_end|>\n" }} +{%- else %} + {%- if messages[0]['role'] == 'system' %} + {{- '<|im_start|>system\n' + messages[0]['content'] + '<|im_end|>\n' }} + {%- else %} + {{- '<|im_start|>system\nYou are Qwen, created by Alibaba Cloud. You are a helpful assistant.<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- for message in messages %} + {%- if (message.role == "user") or (message.role == "system" and not loop.first) or (message.role == "assistant" and not message.tool_calls) %} + {{- '<|im_start|>' + message.role + '\n' + message.content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {{- '<|im_start|>' + message.role }} + {%- if message.content %} + {{- '\n' + message.content }} + {%- endif %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {{- '\n\n{"name": "' }} + {{- tool_call.name }} + {{- '", "arguments": ' }} + {{- tool_call.arguments | tojson }} + {{- '}\n' }} + {%- endfor %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if (loop.index0 == 0) or (messages[loop.index0 - 1].role != "tool") %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- message.content }} + {{- '\n' }} + {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} +{%- endif %} diff --git a/completions/completions_00001.parquet b/completions/completions_00001.parquet new file mode 100644 index 0000000..1fcbcc3 --- /dev/null +++ b/completions/completions_00001.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:aec4939d850c06bf20f5a8efc3718f8d0d3ed3463fec48f9eaac952c77f40b70 +size 8952 diff --git a/completions/completions_00010.parquet b/completions/completions_00010.parquet new file mode 100644 index 0000000..e58741d --- /dev/null +++ b/completions/completions_00010.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6b6a840b022f139c320c87fd01eb7f17d31394bb001e7860dacd27d99e2efdec +size 8997 diff --git a/completions/completions_00020.parquet b/completions/completions_00020.parquet new file mode 100644 index 0000000..179084c --- /dev/null +++ b/completions/completions_00020.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e1d0461351a9a24c323fe38dcff09cbf195ad45cc13ff628fc2e1c0cd5171690 +size 10492 diff --git a/completions/completions_00030.parquet b/completions/completions_00030.parquet new file mode 100644 index 0000000..c7600ac --- /dev/null +++ b/completions/completions_00030.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:9c7ebd9039a700aa2104e0a695805d1f5e3a7d7ff1f09f60d2adc028e14e33e7 +size 9961 diff --git a/completions/completions_00040.parquet b/completions/completions_00040.parquet new file mode 100644 index 0000000..d9438d5 --- /dev/null +++ b/completions/completions_00040.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c769e41f5c2d884e407960ea1a6c4c4412ecc909fa2794d03f6fdccbe6ca17df +size 10047 diff --git a/completions/completions_00050.parquet b/completions/completions_00050.parquet new file mode 100644 index 0000000..13a6a01 --- /dev/null +++ b/completions/completions_00050.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:90ce57dca2a3cbbf1380b3cfa648aa7b0977c96413d1d2c932c2f8d42dd48c09 +size 12239 diff --git a/completions/completions_00060.parquet b/completions/completions_00060.parquet new file mode 100644 index 0000000..7ce3c1f --- /dev/null +++ b/completions/completions_00060.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e907cb7af9226caf23d2d6f6102d5d8ab3bfebc9f4d05fabb1d3213cf8e67bf0 +size 10262 diff --git a/completions/completions_00070.parquet b/completions/completions_00070.parquet new file mode 100644 index 0000000..3111638 --- /dev/null +++ b/completions/completions_00070.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2335fd07a1644f0d39d54d0f339ef8ded8131a6e4e08a1d0e4d14226531d8e1a +size 9276 diff --git a/completions/completions_00080.parquet b/completions/completions_00080.parquet new file mode 100644 index 0000000..aaa4166 --- /dev/null +++ b/completions/completions_00080.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:01788344d489a16b5b527911fabaa199b7b78a277ac40392d45588d60163f1c5 +size 8858 diff --git a/completions/completions_00090.parquet b/completions/completions_00090.parquet new file mode 100644 index 0000000..2d37012 --- /dev/null +++ b/completions/completions_00090.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:f63cfc0fe0d7ad201179ed7abc2f90b3668422e313322495a359e84028236f31 +size 10708 diff --git a/completions/completions_00100.parquet b/completions/completions_00100.parquet new file mode 100644 index 0000000..b59b130 --- /dev/null +++ b/completions/completions_00100.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b4f390780134b1b8e00a9c3a4892a11c226a5257b1e1dc421195e7af74c1eedf +size 11483 diff --git a/completions/completions_00110.parquet b/completions/completions_00110.parquet new file mode 100644 index 0000000..515e148 --- /dev/null +++ b/completions/completions_00110.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:04f3679662293268e93ebdfb26c0d6a8b58cfee904097446409f7084317822a2 +size 13135 diff --git a/completions/completions_00120.parquet b/completions/completions_00120.parquet new file mode 100644 index 0000000..59c0b95 --- /dev/null +++ b/completions/completions_00120.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:9c17ea7070811902b785fb26611748e095ddf7ef287add41cfaa3c82f690c722 +size 10870 diff --git a/completions/completions_00130.parquet b/completions/completions_00130.parquet new file mode 100644 index 0000000..1db7c23 --- /dev/null +++ b/completions/completions_00130.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ca79f9d1358aabb41cb9802ac2d8efffe46796a7c81f8ab593d0c0eacb1108bc +size 9894 diff --git a/completions/completions_00140.parquet b/completions/completions_00140.parquet new file mode 100644 index 0000000..8f3ae77 --- /dev/null +++ b/completions/completions_00140.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:04896bdb1ae58025789e2ff4340bb01c721c7fd90c7a8e0c34cad1b99120c6ad +size 9814 diff --git a/completions/completions_00150.parquet b/completions/completions_00150.parquet new file mode 100644 index 0000000..46100a5 --- /dev/null +++ b/completions/completions_00150.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6fdc0966c54fb6404b42974dc57f7b5311202a24505adc380a0acf28e2f5e799 +size 10569 diff --git a/completions/completions_00160.parquet b/completions/completions_00160.parquet new file mode 100644 index 0000000..8c9f2c7 --- /dev/null +++ b/completions/completions_00160.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0bcdd6a86687781d443788544bdde031034e76e8100c5012b82fdda42d0f3c21 +size 9856 diff --git a/completions/completions_00170.parquet b/completions/completions_00170.parquet new file mode 100644 index 0000000..f497e2b --- /dev/null +++ b/completions/completions_00170.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:8f2e4e13f4838612c562366c975bd8420c48f2be961c5d3244252ecdda343300 +size 9855 diff --git a/completions/completions_00180.parquet b/completions/completions_00180.parquet new file mode 100644 index 0000000..9d0618d --- /dev/null +++ b/completions/completions_00180.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:03150db8e80c4b85297c9366c3588915c07c1d9fa32b273f841665bbb6d78732 +size 10778 diff --git a/completions/completions_00190.parquet b/completions/completions_00190.parquet new file mode 100644 index 0000000..598ef14 --- /dev/null +++ b/completions/completions_00190.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:eba9f9a601908518da37cb9af8b146c736565f1fefd9580c7c245471dda95026 +size 9260 diff --git a/completions/completions_00200.parquet b/completions/completions_00200.parquet new file mode 100644 index 0000000..22b668b --- /dev/null +++ b/completions/completions_00200.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:f021fa4ad8cb47de3f44b74a823328e5d2c01faf48495fd3d978708b896ef062 +size 8901 diff --git a/completions/completions_00210.parquet b/completions/completions_00210.parquet new file mode 100644 index 0000000..595eb42 --- /dev/null +++ b/completions/completions_00210.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4f53a91d386c864f861cd096299f061c73f4faa14d133f8c71d9a8d7b8807125 +size 9043 diff --git a/completions/completions_00220.parquet b/completions/completions_00220.parquet new file mode 100644 index 0000000..4927733 --- /dev/null +++ b/completions/completions_00220.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:f2630796d3b415e582298f5e2b0f4340ebab6c8fd0054b44804349cf3b70df41 +size 9903 diff --git a/completions/completions_00230.parquet b/completions/completions_00230.parquet new file mode 100644 index 0000000..29f89a7 --- /dev/null +++ b/completions/completions_00230.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ecdd9e5836a199239f465fdb0c754a2ec6bbca284ae21f558c8273f95e7def4d +size 10243 diff --git a/completions/completions_00240.parquet b/completions/completions_00240.parquet new file mode 100644 index 0000000..17c3780 --- /dev/null +++ b/completions/completions_00240.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:47cbc8646ac24316d584c6d7e87d4f2cd1eec2a12491a2f67da1684ae228e5c1 +size 10004 diff --git a/completions/completions_00250.parquet b/completions/completions_00250.parquet new file mode 100644 index 0000000..bee8935 --- /dev/null +++ b/completions/completions_00250.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7a7f19030a94f2f3ec76894c37527446a238f8e803fe6608a0517c033a4ce02c +size 9292 diff --git a/completions/completions_00260.parquet b/completions/completions_00260.parquet new file mode 100644 index 0000000..f6dd53e --- /dev/null +++ b/completions/completions_00260.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:38e1d7924bd9752ee65f4ba66e7e32963b0ef44cac747970424f7fe3af0be1df +size 9200 diff --git a/completions/completions_00270.parquet b/completions/completions_00270.parquet new file mode 100644 index 0000000..0f936b6 --- /dev/null +++ b/completions/completions_00270.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:52410a359577b8895e1afe3396225b71030e2517960d97f52f16bfc1b9ae4a19 +size 11707 diff --git a/completions/completions_00280.parquet b/completions/completions_00280.parquet new file mode 100644 index 0000000..2605809 --- /dev/null +++ b/completions/completions_00280.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:9645f83886df4d88a87e4aa0e8a1adcd052e5edd5275230d3471d850d0920735 +size 8426 diff --git a/completions/completions_00290.parquet b/completions/completions_00290.parquet new file mode 100644 index 0000000..f042662 --- /dev/null +++ b/completions/completions_00290.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:22a258abc384f73458c436c98cb08c57cffabcad61ff890e43767df7483307a5 +size 8272 diff --git a/completions/completions_00300.parquet b/completions/completions_00300.parquet new file mode 100644 index 0000000..8495bd6 --- /dev/null +++ b/completions/completions_00300.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6a7d2b357798f11d9dd7a8fa6b91ff057c70dc5d354faa40ac1a2880b098905f +size 11958 diff --git a/completions/completions_00310.parquet b/completions/completions_00310.parquet new file mode 100644 index 0000000..f5b2bf7 --- /dev/null +++ b/completions/completions_00310.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:163646be28f9cbabbff3a43d6cc60e1aca861e8c23a6d71d24236996067ec8b1 +size 8959 diff --git a/completions/completions_00320.parquet b/completions/completions_00320.parquet new file mode 100644 index 0000000..5f12e3f --- /dev/null +++ b/completions/completions_00320.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:759b4ac3d7597e55acee7223cc22f39238b2bec81e5d450581e3573bef6e50e5 +size 12188 diff --git a/completions/completions_00330.parquet b/completions/completions_00330.parquet new file mode 100644 index 0000000..38d178b --- /dev/null +++ b/completions/completions_00330.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:208137e71c846dc9ea61fcb758fa2cbbbe9ee64070ffc54cf07a8e95531b9833 +size 10344 diff --git a/completions/completions_00340.parquet b/completions/completions_00340.parquet new file mode 100644 index 0000000..7cda968 --- /dev/null +++ b/completions/completions_00340.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:32b32ac87d60afa660bc6f371dd9da027e40cbd04fa4ebfa7aea12b32a2a73c5 +size 10541 diff --git a/completions/completions_00350.parquet b/completions/completions_00350.parquet new file mode 100644 index 0000000..3e0cb6d --- /dev/null +++ b/completions/completions_00350.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:bc1438176605c7ff4470e22184166474a1f47315bd97e297fe3726cd4e07f20e +size 9430 diff --git a/completions/completions_00360.parquet b/completions/completions_00360.parquet new file mode 100644 index 0000000..1e72ea9 --- /dev/null +++ b/completions/completions_00360.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b43f16d4ff566b3481412ebfc64a2d1bcf039205d615f022a47f3db07c564e4e +size 8643 diff --git a/completions/completions_00370.parquet b/completions/completions_00370.parquet new file mode 100644 index 0000000..4b51d4d --- /dev/null +++ b/completions/completions_00370.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e0db2b27181c46f4397a69ca2efc7d06a14f8b7ee17c9c6fe5bf74c3a082e515 +size 11334 diff --git a/completions/completions_00380.parquet b/completions/completions_00380.parquet new file mode 100644 index 0000000..016fbf0 --- /dev/null +++ b/completions/completions_00380.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:a13cae462e2cac4d782760425a0d054b0fee8ca76ae1e8ad45520c1661438ab7 +size 9637 diff --git a/completions/completions_00390.parquet b/completions/completions_00390.parquet new file mode 100644 index 0000000..0010681 --- /dev/null +++ b/completions/completions_00390.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7a049ea26d73659ca16f5b12eaf23784a7e2e02890ec806f26ee0fe62f139ece +size 8383 diff --git a/completions/completions_00400.parquet b/completions/completions_00400.parquet new file mode 100644 index 0000000..b03d6ca --- /dev/null +++ b/completions/completions_00400.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:cf5a0053ffe523c07b9ee3d0afde79026d3378102da0d41ba10229505c565db7 +size 10081 diff --git a/completions/completions_00410.parquet b/completions/completions_00410.parquet new file mode 100644 index 0000000..82bb961 --- /dev/null +++ b/completions/completions_00410.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e0585ee91f1402abf94e1484fc7a7bf110ad1bba1cf07cc249d380c7940832bf +size 10033 diff --git a/completions/completions_00420.parquet b/completions/completions_00420.parquet new file mode 100644 index 0000000..ec84f55 --- /dev/null +++ b/completions/completions_00420.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:5ed2a6155a36a8cf46be638f22bf35a8413f0438a0f506c9a94db48df39b28a8 +size 8286 diff --git a/completions/completions_00430.parquet b/completions/completions_00430.parquet new file mode 100644 index 0000000..4fa84a9 --- /dev/null +++ b/completions/completions_00430.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0291ead5d28e07ed75b0d143d20ae49022541b3025937b50253b57faf9965896 +size 10171 diff --git a/completions/completions_00440.parquet b/completions/completions_00440.parquet new file mode 100644 index 0000000..ddc2e18 --- /dev/null +++ b/completions/completions_00440.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4e43b1a5294fba69f169dc43f71bf88b6e5e7c73f9232c9bfa030c0ae3a61d17 +size 11478 diff --git a/completions/completions_00450.parquet b/completions/completions_00450.parquet new file mode 100644 index 0000000..0f0682e --- /dev/null +++ b/completions/completions_00450.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:51e2c883dab9b4b40133457d168c14563db98cbc10f82eab0c2078f1059c86ea +size 9404 diff --git a/completions/completions_00460.parquet b/completions/completions_00460.parquet new file mode 100644 index 0000000..2098e85 --- /dev/null +++ b/completions/completions_00460.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:a5ddd87ccd671b8954624c439e63779526240a264f797523643f9f9b0484d5cc +size 8791 diff --git a/completions/completions_00470.parquet b/completions/completions_00470.parquet new file mode 100644 index 0000000..3f742c6 --- /dev/null +++ b/completions/completions_00470.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3c7cbb0f4fe1a84a3db65b2038a5b8b1b5ace730e177c77a45296958f5062e26 +size 11453 diff --git a/completions/completions_00480.parquet b/completions/completions_00480.parquet new file mode 100644 index 0000000..122694e --- /dev/null +++ b/completions/completions_00480.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d8233f59279cdff64cc1fb685aa8ad5df79b071e3e6630ee90a6910cdbce93b9 +size 9893 diff --git a/completions/completions_00490.parquet b/completions/completions_00490.parquet new file mode 100644 index 0000000..a7a6eed --- /dev/null +++ b/completions/completions_00490.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7e8b1e91dccd630cc0afcbce85155c2abf88e48892f3e907e620a9bc5fcedb6f +size 8670 diff --git a/completions/completions_00500.parquet b/completions/completions_00500.parquet new file mode 100644 index 0000000..28e7675 --- /dev/null +++ b/completions/completions_00500.parquet @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:8cf2539585db43f7967e19877ae9928e9f47722cc21b54ca68efc4418f7d9fa4 +size 10304 diff --git a/config.json b/config.json new file mode 100644 index 0000000..16ceeec --- /dev/null +++ b/config.json @@ -0,0 +1,69 @@ +{ + "architectures": [ + "Qwen2ForCausalLM" + ], + "attention_dropout": 0.0, + "bos_token_id": null, + "dtype": "float32", + "eos_token_id": 151645, + "hidden_act": "silu", + "hidden_size": 2048, + "initializer_range": 0.02, + "intermediate_size": 11008, + "layer_types": [ + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention" + ], + "max_position_embeddings": 32768, + "max_window_layers": 70, + "model_type": "qwen2", + "num_attention_heads": 16, + "num_hidden_layers": 36, + "num_key_value_heads": 2, + "pad_token_id": 151643, + "rms_norm_eps": 1e-06, + "rope_parameters": { + "rope_theta": 1000000.0, + "rope_type": "default" + }, + "sliding_window": null, + "tie_word_embeddings": true, + "transformers_version": "5.12.1", + "use_cache": false, + "use_sliding_window": false, + "vocab_size": 151936 +} diff --git a/generation_config.json b/generation_config.json new file mode 100644 index 0000000..ebd4efd --- /dev/null +++ b/generation_config.json @@ -0,0 +1,13 @@ +{ + "do_sample": true, + "eos_token_id": [ + 151645, + 151643 + ], + "pad_token_id": 151643, + "repetition_penalty": 1.05, + "temperature": 0.7, + "top_k": 20, + "top_p": 0.8, + "transformers_version": "5.12.1" +} diff --git a/last-checkpoint/chat_template.jinja b/last-checkpoint/chat_template.jinja new file mode 100644 index 0000000..bdf7919 --- /dev/null +++ b/last-checkpoint/chat_template.jinja @@ -0,0 +1,54 @@ +{%- if tools %} + {{- '<|im_start|>system\n' }} + {%- if messages[0]['role'] == 'system' %} + {{- messages[0]['content'] }} + {%- else %} + {{- 'You are Qwen, created by Alibaba Cloud. You are a helpful assistant.' }} + {%- endif %} + {{- "\n\n# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within XML tags:\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n\n\nFor each function call, return a json object with function name and arguments within XML tags:\n\n{\"name\": , \"arguments\": }\n<|im_end|>\n" }} +{%- else %} + {%- if messages[0]['role'] == 'system' %} + {{- '<|im_start|>system\n' + messages[0]['content'] + '<|im_end|>\n' }} + {%- else %} + {{- '<|im_start|>system\nYou are Qwen, created by Alibaba Cloud. You are a helpful assistant.<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- for message in messages %} + {%- if (message.role == "user") or (message.role == "system" and not loop.first) or (message.role == "assistant" and not message.tool_calls) %} + {{- '<|im_start|>' + message.role + '\n' + message.content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {{- '<|im_start|>' + message.role }} + {%- if message.content %} + {{- '\n' + message.content }} + {%- endif %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {{- '\n\n{"name": "' }} + {{- tool_call.name }} + {{- '", "arguments": ' }} + {{- tool_call.arguments | tojson }} + {{- '}\n' }} + {%- endfor %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if (loop.index0 == 0) or (messages[loop.index0 - 1].role != "tool") %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- message.content }} + {{- '\n' }} + {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} +{%- endif %} diff --git a/last-checkpoint/config.json b/last-checkpoint/config.json new file mode 100644 index 0000000..16ceeec --- /dev/null +++ b/last-checkpoint/config.json @@ -0,0 +1,69 @@ +{ + "architectures": [ + "Qwen2ForCausalLM" + ], + "attention_dropout": 0.0, + "bos_token_id": null, + "dtype": "float32", + "eos_token_id": 151645, + "hidden_act": "silu", + "hidden_size": 2048, + "initializer_range": 0.02, + "intermediate_size": 11008, + "layer_types": [ + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention" + ], + "max_position_embeddings": 32768, + "max_window_layers": 70, + "model_type": "qwen2", + "num_attention_heads": 16, + "num_hidden_layers": 36, + "num_key_value_heads": 2, + "pad_token_id": 151643, + "rms_norm_eps": 1e-06, + "rope_parameters": { + "rope_theta": 1000000.0, + "rope_type": "default" + }, + "sliding_window": null, + "tie_word_embeddings": true, + "transformers_version": "5.12.1", + "use_cache": false, + "use_sliding_window": false, + "vocab_size": 151936 +} diff --git a/last-checkpoint/generation_config.json b/last-checkpoint/generation_config.json new file mode 100644 index 0000000..ebd4efd --- /dev/null +++ b/last-checkpoint/generation_config.json @@ -0,0 +1,13 @@ +{ + "do_sample": true, + "eos_token_id": [ + 151645, + 151643 + ], + "pad_token_id": 151643, + "repetition_penalty": 1.05, + "temperature": 0.7, + "top_k": 20, + "top_p": 0.8, + "transformers_version": "5.12.1" +} diff --git a/last-checkpoint/model.safetensors b/last-checkpoint/model.safetensors new file mode 100644 index 0000000..f2fffa0 --- /dev/null +++ b/last-checkpoint/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:fa17182eba5ef4a4cf325d2d9ca704b050300c4c6ec917b40b46053cb2437b72 +size 12343804296 diff --git a/last-checkpoint/optimizer.pt b/last-checkpoint/optimizer.pt new file mode 100644 index 0000000..720efcf --- /dev/null +++ b/last-checkpoint/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:5e692674a58a2a647e9310efa4e5fc712e2a481e22b98c957530faecb9bba303 +size 24687895753 diff --git a/last-checkpoint/rng_state.pth b/last-checkpoint/rng_state.pth new file mode 100644 index 0000000..e511672 --- /dev/null +++ b/last-checkpoint/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:dd08cb2892a3c242873328b13df99fcd56e58ad210dbadf93e73216e33e81368 +size 14645 diff --git a/last-checkpoint/scheduler.pt b/last-checkpoint/scheduler.pt new file mode 100644 index 0000000..f4889ec --- /dev/null +++ b/last-checkpoint/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:50a148f37d5c665866b1fd216052923b058b32e9e2b5b36dce5576d7ddb94a11 +size 1465 diff --git a/last-checkpoint/tokenizer.json b/last-checkpoint/tokenizer.json new file mode 100644 index 0000000..34510ff --- /dev/null +++ b/last-checkpoint/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3fd169731d2cbde95e10bf356d66d5997fd885dd8dbb6fb4684da3f23b2585d8 +size 11421892 diff --git a/last-checkpoint/tokenizer_config.json b/last-checkpoint/tokenizer_config.json new file mode 100644 index 0000000..4d8760d --- /dev/null +++ b/last-checkpoint/tokenizer_config.json @@ -0,0 +1,32 @@ +{ + "add_prefix_space": false, + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|im_end|>", + "errors": "replace", + "extra_special_tokens": [ + "<|im_start|>", + "<|im_end|>", + "<|object_ref_start|>", + "<|object_ref_end|>", + "<|box_start|>", + "<|box_end|>", + "<|quad_start|>", + "<|quad_end|>", + "<|vision_start|>", + "<|vision_end|>", + "<|vision_pad|>", + "<|image_pad|>", + "<|video_pad|>" + ], + "is_local": false, + "local_files_only": false, + "model_max_length": 131072, + "pad_token": "<|endoftext|>", + "padding_side": "left", + "split_special_tokens": false, + "tokenizer_class": "Qwen2Tokenizer", + "truncation_side": "left", + "unk_token": null +} diff --git a/last-checkpoint/trainer_state.json b/last-checkpoint/trainer_state.json new file mode 100644 index 0000000..fb4b442 --- /dev/null +++ b/last-checkpoint/trainer_state.json @@ -0,0 +1,1411 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.05, + "eval_steps": 500, + "global_step": 500, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.14998279511928558, + "epoch": 0.0001, + "frac_reward_zero_std": 0.0, + "grad_norm": 2.8779168128967285, + "learning_rate": 1e-06, + "loss": -1.043081283569336e-07, + "num_tokens": 2568.0, + "reward": -0.09724999964237213, + "reward_std": 0.018171798437833786, + "rewards/_reward/mean": -0.09724999964237213, + "rewards/_reward/std": 0.018171798437833786, + "step": 1, + "step_time": 12.08820823195856 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.3047940664821201, + "epoch": 0.001, + "frac_reward_zero_std": 0.0, + "grad_norm": 2.6030378341674805, + "learning_rate": 9.819999999999999e-07, + "loss": -8.27842288547092e-08, + "num_tokens": 27464.0, + "reward": -0.16016666839520136, + "reward_std": 0.06777944886643025, + "rewards/_reward/mean": -0.16016666839520136, + "rewards/_reward/std": 0.06777944886643025, + "step": 10, + "step_time": 11.564457062001262 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.2606607608497143, + "epoch": 0.002, + "frac_reward_zero_std": 0.0, + "grad_norm": 3.2521839141845703, + "learning_rate": 9.619999999999999e-07, + "loss": 2.0712614059448243e-07, + "num_tokens": 55576.0, + "reward": -0.01043749824166298, + "reward_std": 0.0968616530764848, + "rewards/_reward/mean": -0.01043749824166298, + "rewards/_reward/std": 0.0968616530764848, + "step": 20, + "step_time": 11.661010127793997 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.24913175068795682, + "epoch": 0.003, + "frac_reward_zero_std": 0.0, + "grad_norm": 1.774067759513855, + "learning_rate": 9.419999999999999e-07, + "loss": -3.3527612686157227e-07, + "num_tokens": 83448.0, + "reward": -0.13608750477433204, + "reward_std": 0.012762961606495083, + "rewards/_reward/mean": -0.13608750477433204, + "rewards/_reward/std": 0.012762961606495083, + "step": 30, + "step_time": 11.669710392298294 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.95, + "completions/max_length": 256.0, + "completions/max_terminated_length": 24.8, + "completions/mean_length": 254.8625, + "completions/mean_terminated_length": 23.325, + "completions/min_length": 252.0, + "completions/min_terminated_length": 21.6, + "entropy": 0.23657004088163375, + "epoch": 0.004, + "frac_reward_zero_std": 0.0, + "grad_norm": 2.8075008392333984, + "learning_rate": 9.22e-07, + "loss": 0.002854938805103302, + "num_tokens": 111597.0, + "reward": -0.07128750085830689, + "reward_std": 0.08108895737677813, + "rewards/_reward/mean": -0.07128750085830689, + "rewards/_reward/std": 0.08108895737677813, + "step": 40, + "step_time": 11.579852976597612 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.22997551448643208, + "epoch": 0.005, + "frac_reward_zero_std": 0.0, + "grad_norm": 3.7606520652770996, + "learning_rate": 9.02e-07, + "loss": 5.960464477539063e-09, + "num_tokens": 140101.0, + "reward": -0.10473749935626983, + "reward_std": 0.06175762424245477, + "rewards/_reward/mean": -0.10473749935626983, + "rewards/_reward/std": 0.06175762424245477, + "step": 50, + "step_time": 11.542670411110157 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.21263145469129086, + "epoch": 0.006, + "frac_reward_zero_std": 0.0, + "grad_norm": 3.328623056411743, + "learning_rate": 8.82e-07, + "loss": -6.005167961120605e-07, + "num_tokens": 169069.0, + "reward": -0.11228750124573708, + "reward_std": 0.05499577845912427, + "rewards/_reward/mean": -0.11228750124573708, + "rewards/_reward/std": 0.05499577845912427, + "step": 60, + "step_time": 11.547676370796399 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.21824492514133453, + "epoch": 0.007, + "frac_reward_zero_std": 0.0, + "grad_norm": 2.910665512084961, + "learning_rate": 8.62e-07, + "loss": 4.32133674621582e-08, + "num_tokens": 197517.0, + "reward": -0.1204499989748001, + "reward_std": 0.07779224249534308, + "rewards/_reward/mean": -0.1204499989748001, + "rewards/_reward/std": 0.07779224249534308, + "step": 70, + "step_time": 11.568741847097408 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.2399759404361248, + "epoch": 0.008, + "frac_reward_zero_std": 0.0, + "grad_norm": 2.1106014251708984, + "learning_rate": 8.419999999999999e-07, + "loss": -3.3527612686157227e-08, + "num_tokens": 224933.0, + "reward": -0.010837499797344208, + "reward_std": 0.18366129244677723, + "rewards/_reward/mean": -0.010837499797344208, + "rewards/_reward/std": 0.18366129244677723, + "step": 80, + "step_time": 11.498653757106513 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.23416975382715463, + "epoch": 0.009, + "frac_reward_zero_std": 0.0, + "grad_norm": 2.950016975402832, + "learning_rate": 8.219999999999999e-07, + "loss": -1.6205012798309326e-07, + "num_tokens": 252845.0, + "reward": -0.057250002026557924, + "reward_std": 0.11056184868793935, + "rewards/_reward/mean": -0.057250002026557924, + "rewards/_reward/std": 0.11056184868793935, + "step": 90, + "step_time": 11.616500220299349 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.9875, + "completions/max_length": 256.0, + "completions/max_terminated_length": 18.2, + "completions/mean_length": 255.075, + "completions/mean_terminated_length": 18.2, + "completions/min_length": 248.6, + "completions/min_terminated_length": 18.2, + "entropy": 0.2641608176752925, + "epoch": 0.01, + "frac_reward_zero_std": 0.0, + "grad_norm": 2.9509315490722656, + "learning_rate": 8.02e-07, + "loss": 0.0012664616107940674, + "num_tokens": 280931.0, + "reward": -0.05811250358819962, + "reward_std": 0.088380962703377, + "rewards/_reward/mean": -0.05811250358819962, + "rewards/_reward/std": 0.088380962703377, + "step": 100, + "step_time": 11.67648275300453 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.23412359468638896, + "epoch": 0.011, + "frac_reward_zero_std": 0.0, + "grad_norm": 4.738001346588135, + "learning_rate": 7.82e-07, + "loss": -9.760260581970215e-08, + "num_tokens": 308667.0, + "reward": -0.14102500230073928, + "reward_std": 0.012726937094703317, + "rewards/_reward/mean": -0.14102500230073928, + "rewards/_reward/std": 0.012726937094703317, + "step": 110, + "step_time": 11.954438662400936 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.19781138971447945, + "epoch": 0.012, + "frac_reward_zero_std": 0.0, + "grad_norm": 2.452828884124756, + "learning_rate": 7.62e-07, + "loss": -3.3527612686157227e-08, + "num_tokens": 336835.0, + "reward": -0.11708749905228615, + "reward_std": 0.07922702981159091, + "rewards/_reward/mean": -0.11708749905228615, + "rewards/_reward/std": 0.07922702981159091, + "step": 120, + "step_time": 11.744920498199644 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.2342931807041168, + "epoch": 0.013, + "frac_reward_zero_std": 0.0, + "grad_norm": 2.797684907913208, + "learning_rate": 7.42e-07, + "loss": 7.674098014831543e-08, + "num_tokens": 366091.0, + "reward": -0.11588749885559083, + "reward_std": 0.05765116480179131, + "rewards/_reward/mean": -0.11588749885559083, + "rewards/_reward/std": 0.05765116480179131, + "step": 130, + "step_time": 11.506405735507723 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.2076788205653429, + "epoch": 0.014, + "frac_reward_zero_std": 0.0, + "grad_norm": 2.9772956371307373, + "learning_rate": 7.219999999999999e-07, + "loss": 3.5762786865234374e-08, + "num_tokens": 396707.0, + "reward": -0.08986250013113022, + "reward_std": 0.10776186282746494, + "rewards/_reward/mean": -0.08986250013113022, + "rewards/_reward/std": 0.10776186282746494, + "step": 140, + "step_time": 11.505186360995868 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.16601159889250994, + "epoch": 0.015, + "frac_reward_zero_std": 0.0, + "grad_norm": 2.2357609272003174, + "learning_rate": 7.019999999999999e-07, + "loss": 1.4007091522216797e-07, + "num_tokens": 425139.0, + "reward": -0.06081249937415123, + "reward_std": 0.1219825193285942, + "rewards/_reward/mean": -0.06081249937415123, + "rewards/_reward/std": 0.1219825193285942, + "step": 150, + "step_time": 11.64991204040416 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.20173385739326477, + "epoch": 0.016, + "frac_reward_zero_std": 0.0, + "grad_norm": 2.7504308223724365, + "learning_rate": 6.82e-07, + "loss": -8.046627044677735e-08, + "num_tokens": 453235.0, + "reward": 0.0051499992609024044, + "reward_std": 0.15129406368359924, + "rewards/_reward/mean": 0.0051499992609024044, + "rewards/_reward/std": 0.15129406368359924, + "step": 160, + "step_time": 11.575167022497045 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.17478586584329606, + "epoch": 0.017, + "frac_reward_zero_std": 0.0, + "grad_norm": 2.29221773147583, + "learning_rate": 6.62e-07, + "loss": 3.725290298461914e-08, + "num_tokens": 480979.0, + "reward": -0.042637499421834944, + "reward_std": 0.07295619142241776, + "rewards/_reward/mean": -0.042637499421834944, + "rewards/_reward/std": 0.07295619142241776, + "step": 170, + "step_time": 11.508803388095112 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.22443594820797444, + "epoch": 0.018, + "frac_reward_zero_std": 0.0, + "grad_norm": 3.2347171306610107, + "learning_rate": 6.42e-07, + "loss": -1.1026859283447266e-07, + "num_tokens": 508907.0, + "reward": -0.1161250002682209, + "reward_std": 0.05800414513796568, + "rewards/_reward/mean": -0.1161250002682209, + "rewards/_reward/std": 0.05800414513796568, + "step": 180, + "step_time": 11.628456287202425 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.17592381052672862, + "epoch": 0.019, + "frac_reward_zero_std": 0.0, + "grad_norm": 2.917639970779419, + "learning_rate": 6.219999999999999e-07, + "loss": -4.395842552185059e-08, + "num_tokens": 537123.0, + "reward": -0.06955000124871731, + "reward_std": 0.12644521035254003, + "rewards/_reward/mean": -0.06955000124871731, + "rewards/_reward/std": 0.12644521035254003, + "step": 190, + "step_time": 11.57307404029416 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.1488013807684183, + "epoch": 0.02, + "frac_reward_zero_std": 0.0, + "grad_norm": 2.9038145542144775, + "learning_rate": 6.019999999999999e-07, + "loss": -1.1101365089416504e-07, + "num_tokens": 565155.0, + "reward": -0.12023750096559524, + "reward_std": 0.010919334553182124, + "rewards/_reward/mean": -0.12023750096559524, + "rewards/_reward/std": 0.010919334553182124, + "step": 200, + "step_time": 11.57396563780203 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.19087741933763028, + "epoch": 0.021, + "frac_reward_zero_std": 0.0, + "grad_norm": 2.828523874282837, + "learning_rate": 5.819999999999999e-07, + "loss": -1.1026859283447266e-07, + "num_tokens": 593011.0, + "reward": -0.12507500275969505, + "reward_std": 0.028615108272060753, + "rewards/_reward/mean": -0.12507500275969505, + "rewards/_reward/std": 0.028615108272060753, + "step": 210, + "step_time": 12.10818758100213 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.16332522965967655, + "epoch": 0.022, + "frac_reward_zero_std": 0.0, + "grad_norm": 2.2941064834594727, + "learning_rate": 5.620000000000001e-07, + "loss": -9.201467037200927e-08, + "num_tokens": 623443.0, + "reward": -0.04131250083446503, + "reward_std": 0.1392579632345587, + "rewards/_reward/mean": -0.04131250083446503, + "rewards/_reward/std": 0.1392579632345587, + "step": 220, + "step_time": 11.863228278403403 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.16642205603420734, + "epoch": 0.023, + "frac_reward_zero_std": 0.0, + "grad_norm": 2.8652546405792236, + "learning_rate": 5.420000000000001e-07, + "loss": -2.9802322387695312e-08, + "num_tokens": 651835.0, + "reward": -0.006312502548098564, + "reward_std": 0.14235199838876725, + "rewards/_reward/mean": -0.006312502548098564, + "rewards/_reward/std": 0.14235199838876725, + "step": 230, + "step_time": 12.171389962601825 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.21248361319303513, + "epoch": 0.024, + "frac_reward_zero_std": 0.0, + "grad_norm": 3.370008707046509, + "learning_rate": 5.22e-07, + "loss": 1.0281801223754883e-07, + "num_tokens": 685427.0, + "reward": -0.08841249942779542, + "reward_std": 0.11107976362109184, + "rewards/_reward/mean": -0.08841249942779542, + "rewards/_reward/std": 0.11107976362109184, + "step": 240, + "step_time": 11.702623541106004 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.1631117094308138, + "epoch": 0.025, + "frac_reward_zero_std": 0.0, + "grad_norm": 2.2644002437591553, + "learning_rate": 5.02e-07, + "loss": 4.1723251342773435e-08, + "num_tokens": 713915.0, + "reward": 0.04688749760389328, + "reward_std": 0.09012880194932223, + "rewards/_reward/mean": 0.04688749760389328, + "rewards/_reward/std": 0.09012880194932223, + "step": 250, + "step_time": 11.618486247796682 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.875, + "completions/max_length": 253.0, + "completions/max_terminated_length": 47.3, + "completions/mean_length": 246.7125, + "completions/mean_terminated_length": 39.7375, + "completions/min_length": 236.5, + "completions/min_terminated_length": 31.7, + "entropy": 0.18974447026848792, + "epoch": 0.026, + "frac_reward_zero_std": 0.0, + "grad_norm": 2.280606269836426, + "learning_rate": 4.82e-07, + "loss": 0.0100946843624115, + "num_tokens": 741100.0, + "reward": -0.07017500177025796, + "reward_std": 0.1116799698676914, + "rewards/_reward/mean": -0.07017500177025796, + "rewards/_reward/std": 0.1116799698676914, + "step": 260, + "step_time": 11.640435569002875 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.9875, + "completions/max_length": 256.0, + "completions/max_terminated_length": 21.3, + "completions/mean_length": 255.4625, + "completions/mean_terminated_length": 21.3, + "completions/min_length": 251.7, + "completions/min_terminated_length": 21.3, + "entropy": 0.255718494951725, + "epoch": 0.027, + "frac_reward_zero_std": 0.0, + "grad_norm": 3.1636722087860107, + "learning_rate": 4.62e-07, + "loss": 0.00350225567817688, + "num_tokens": 768897.0, + "reward": -0.030937498807907103, + "reward_std": 0.14211445688270033, + "rewards/_reward/mean": -0.030937498807907103, + "rewards/_reward/std": 0.14211445688270033, + "step": 270, + "step_time": 11.597638047402143 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.19375687539577485, + "epoch": 0.028, + "frac_reward_zero_std": 0.0, + "grad_norm": 3.0973761081695557, + "learning_rate": 4.4199999999999996e-07, + "loss": -2.0265579223632812e-07, + "num_tokens": 796281.0, + "reward": -0.0963250022381544, + "reward_std": 0.044649668782949445, + "rewards/_reward/mean": -0.0963250022381544, + "rewards/_reward/std": 0.044649668782949445, + "step": 280, + "step_time": 11.893776391106076 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.2594174426048994, + "epoch": 0.029, + "frac_reward_zero_std": 0.0, + "grad_norm": 2.0735323429107666, + "learning_rate": 4.2199999999999994e-07, + "loss": -5.21540641784668e-08, + "num_tokens": 822377.0, + "reward": -0.04639999940991402, + "reward_std": 0.09656978868879378, + "rewards/_reward/mean": -0.04639999940991402, + "rewards/_reward/std": 0.09656978868879378, + "step": 290, + "step_time": 11.615450729100848 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.925, + "completions/max_length": 256.0, + "completions/max_terminated_length": 49.7, + "completions/mean_length": 255.1, + "completions/mean_terminated_length": 48.560000610351565, + "completions/min_length": 251.4, + "completions/min_terminated_length": 46.6, + "entropy": 0.1907284392043948, + "epoch": 0.03, + "frac_reward_zero_std": 0.0, + "grad_norm": 3.095362424850464, + "learning_rate": 4.02e-07, + "loss": 0.0033017531037330627, + "num_tokens": 850529.0, + "reward": -0.1250375010073185, + "reward_std": 0.08457564520649612, + "rewards/_reward/mean": -0.1250375010073185, + "rewards/_reward/std": 0.08457564520649612, + "step": 300, + "step_time": 11.74418184790702 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.17942608781158925, + "epoch": 0.031, + "frac_reward_zero_std": 0.0, + "grad_norm": 3.140031337738037, + "learning_rate": 3.82e-07, + "loss": -9.462237358093261e-08, + "num_tokens": 879713.0, + "reward": -0.09583750143647193, + "reward_std": 0.062329388014040886, + "rewards/_reward/mean": -0.09583750143647193, + "rewards/_reward/std": 0.062329388014040886, + "step": 310, + "step_time": 12.055007661701529 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.9875, + "completions/max_length": 256.0, + "completions/max_terminated_length": 24.5, + "completions/mean_length": 255.8625, + "completions/mean_terminated_length": 24.5, + "completions/min_length": 254.9, + "completions/min_terminated_length": 24.5, + "entropy": 0.14358493592590094, + "epoch": 0.032, + "frac_reward_zero_std": 0.0, + "grad_norm": 2.655355215072632, + "learning_rate": 3.62e-07, + "loss": 0.0006616078317165375, + "num_tokens": 908974.0, + "reward": -0.03269999995827675, + "reward_std": 0.10602573482319713, + "rewards/_reward/mean": -0.03269999995827675, + "rewards/_reward/std": 0.10602573482319713, + "step": 320, + "step_time": 11.952868514193687 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.18845350295305252, + "epoch": 0.033, + "frac_reward_zero_std": 0.0, + "grad_norm": 3.4810824394226074, + "learning_rate": 3.42e-07, + "loss": 0.0, + "num_tokens": 937118.0, + "reward": 0.044287494570016864, + "reward_std": 0.060938264592550695, + "rewards/_reward/mean": 0.044287494570016864, + "rewards/_reward/std": 0.060938264592550695, + "step": 330, + "step_time": 11.613528702702023 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.9375, + "completions/max_length": 256.0, + "completions/max_terminated_length": 22.2, + "completions/mean_length": 252.4375, + "completions/mean_terminated_length": 19.9, + "completions/min_length": 247.9, + "completions/min_terminated_length": 17.5, + "entropy": 0.21791861169040203, + "epoch": 0.034, + "frac_reward_zero_std": 0.0, + "grad_norm": 2.5943644046783447, + "learning_rate": 3.22e-07, + "loss": 0.009086345881223678, + "num_tokens": 966385.0, + "reward": 0.0007125027477741241, + "reward_std": 0.12920868811197578, + "rewards/_reward/mean": 0.0007125027477741241, + "rewards/_reward/std": 0.12920868811197578, + "step": 340, + "step_time": 11.72194930910482 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.9875, + "completions/max_length": 256.0, + "completions/max_terminated_length": 18.9, + "completions/mean_length": 255.1625, + "completions/mean_terminated_length": 18.9, + "completions/min_length": 249.3, + "completions/min_terminated_length": 18.9, + "entropy": 0.23234866317361594, + "epoch": 0.035, + "frac_reward_zero_std": 0.0, + "grad_norm": 3.0298092365264893, + "learning_rate": 3.02e-07, + "loss": -0.008306542038917541, + "num_tokens": 994918.0, + "reward": -0.04598750025033951, + "reward_std": 0.127252841508016, + "rewards/_reward/mean": -0.04598750025033951, + "rewards/_reward/std": 0.127252841508016, + "step": 350, + "step_time": 11.696356770189595 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.2507915152236819, + "epoch": 0.036, + "frac_reward_zero_std": 0.0, + "grad_norm": 2.3644959926605225, + "learning_rate": 2.8199999999999996e-07, + "loss": 9.238719940185547e-08, + "num_tokens": 1022654.0, + "reward": -0.07061250135302544, + "reward_std": 0.07958197854459285, + "rewards/_reward/mean": -0.07061250135302544, + "rewards/_reward/std": 0.07958197854459285, + "step": 360, + "step_time": 11.649006188896601 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.9375, + "completions/max_length": 256.0, + "completions/max_terminated_length": 49.1, + "completions/mean_length": 254.525, + "completions/mean_terminated_length": 45.7, + "completions/min_length": 246.6, + "completions/min_terminated_length": 41.8, + "entropy": 0.1780354470014572, + "epoch": 0.037, + "frac_reward_zero_std": 0.0, + "grad_norm": 3.7164721488952637, + "learning_rate": 2.62e-07, + "loss": 0.008141186833381654, + "num_tokens": 1051616.0, + "reward": 0.004274993389844895, + "reward_std": 0.13013869293499739, + "rewards/_reward/mean": 0.004274993389844895, + "rewards/_reward/std": 0.13013869293499739, + "step": 370, + "step_time": 11.659929870004998 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.15224627051502465, + "epoch": 0.038, + "frac_reward_zero_std": 0.0, + "grad_norm": 3.0679633617401123, + "learning_rate": 2.4199999999999997e-07, + "loss": 6.444752216339112e-08, + "num_tokens": 1082152.0, + "reward": -0.10256250053644181, + "reward_std": 0.0596468840027228, + "rewards/_reward/mean": -0.10256250053644181, + "rewards/_reward/std": 0.0596468840027228, + "step": 380, + "step_time": 11.863759143595235 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.17555545847862958, + "epoch": 0.039, + "frac_reward_zero_std": 0.0, + "grad_norm": 1.578389048576355, + "learning_rate": 2.22e-07, + "loss": -1.0132789611816406e-07, + "num_tokens": 1110008.0, + "reward": -0.12075000219047069, + "reward_std": 0.010972304828464985, + "rewards/_reward/mean": -0.12075000219047069, + "rewards/_reward/std": 0.010972304828464985, + "step": 390, + "step_time": 11.711123501494876 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.14941447451710702, + "epoch": 0.04, + "frac_reward_zero_std": 0.0, + "grad_norm": 2.5108535289764404, + "learning_rate": 2.02e-07, + "loss": -9.909272193908692e-08, + "num_tokens": 1140040.0, + "reward": -0.10333750173449516, + "reward_std": 0.013116384530439973, + "rewards/_reward/mean": -0.10333750173449516, + "rewards/_reward/std": 0.013116384530439973, + "step": 400, + "step_time": 11.676777744301944 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.1525548355653882, + "epoch": 0.041, + "frac_reward_zero_std": 0.0, + "grad_norm": 4.128385066986084, + "learning_rate": 1.82e-07, + "loss": 1.4454126358032226e-07, + "num_tokens": 1170448.0, + "reward": -0.08016249984502792, + "reward_std": 0.0795291137881577, + "rewards/_reward/mean": -0.08016249984502792, + "rewards/_reward/std": 0.0795291137881577, + "step": 410, + "step_time": 12.297140166597092 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.22286633253097535, + "epoch": 0.042, + "frac_reward_zero_std": 0.0, + "grad_norm": 3.007291793823242, + "learning_rate": 1.62e-07, + "loss": -1.862645149230957e-08, + "num_tokens": 1199584.0, + "reward": -0.09757499992847443, + "reward_std": 0.0740996248088777, + "rewards/_reward/mean": -0.09757499992847443, + "rewards/_reward/std": 0.0740996248088777, + "step": 420, + "step_time": 11.899142718903022 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.24193776920437812, + "epoch": 0.043, + "frac_reward_zero_std": 0.0, + "grad_norm": 3.724966287612915, + "learning_rate": 1.4199999999999997e-07, + "loss": -1.1473894119262696e-07, + "num_tokens": 1226832.0, + "reward": -0.1244625024497509, + "reward_std": 0.01127410950139165, + "rewards/_reward/mean": -0.1244625024497509, + "rewards/_reward/std": 0.01127410950139165, + "step": 430, + "step_time": 11.78984572509944 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.2233281958848238, + "epoch": 0.044, + "frac_reward_zero_std": 0.0, + "grad_norm": 2.95318865776062, + "learning_rate": 1.2199999999999998e-07, + "loss": -1.4901161193847657e-09, + "num_tokens": 1254944.0, + "reward": -0.06746249869465828, + "reward_std": 0.09618873684667051, + "rewards/_reward/mean": -0.06746249869465828, + "rewards/_reward/std": 0.09618873684667051, + "step": 440, + "step_time": 11.55629740760487 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.19920143522322178, + "epoch": 0.045, + "frac_reward_zero_std": 0.0, + "grad_norm": 3.3122684955596924, + "learning_rate": 1.0199999999999999e-07, + "loss": -9.98377799987793e-08, + "num_tokens": 1283256.0, + "reward": -0.11557500138878822, + "reward_std": 0.025760132633149625, + "rewards/_reward/mean": -0.11557500138878822, + "rewards/_reward/std": 0.025760132633149625, + "step": 450, + "step_time": 11.560638458307949 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.1775781039148569, + "epoch": 0.046, + "frac_reward_zero_std": 0.0, + "grad_norm": 3.5115034580230713, + "learning_rate": 8.2e-08, + "loss": -1.3709068298339843e-07, + "num_tokens": 1310704.0, + "reward": -0.026362504437565805, + "reward_std": 0.09747204910963773, + "rewards/_reward/mean": -0.026362504437565805, + "rewards/_reward/std": 0.09747204910963773, + "step": 460, + "step_time": 11.709659596002894 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.9875, + "completions/max_length": 256.0, + "completions/max_terminated_length": 24.0, + "completions/mean_length": 255.8, + "completions/mean_terminated_length": 24.0, + "completions/min_length": 254.4, + "completions/min_terminated_length": 24.0, + "entropy": 0.18432039245963097, + "epoch": 0.047, + "frac_reward_zero_std": 0.0, + "grad_norm": 4.197425365447998, + "learning_rate": 6.2e-08, + "loss": -0.0004772733896970749, + "num_tokens": 1340320.0, + "reward": -0.09371250122785568, + "reward_std": 0.0444566136226058, + "rewards/_reward/mean": -0.09371250122785568, + "rewards/_reward/std": 0.0444566136226058, + "step": 470, + "step_time": 11.684765285105096 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.9875, + "completions/max_length": 256.0, + "completions/max_terminated_length": 20.8, + "completions/mean_length": 255.4, + "completions/mean_terminated_length": 20.8, + "completions/min_length": 251.2, + "completions/min_terminated_length": 20.8, + "entropy": 0.18885077368468045, + "epoch": 0.048, + "frac_reward_zero_std": 0.0, + "grad_norm": 3.3366804122924805, + "learning_rate": 4.2e-08, + "loss": 0.0034372776746749876, + "num_tokens": 1366728.0, + "reward": -0.009375004470348359, + "reward_std": 0.011106315441429615, + "rewards/_reward/mean": -0.009375004470348359, + "rewards/_reward/std": 0.011106315441429615, + "step": 480, + "step_time": 11.596776261902415 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.9875, + "completions/max_length": 256.0, + "completions/max_terminated_length": 21.7, + "completions/mean_length": 255.5125, + "completions/mean_terminated_length": 21.7, + "completions/min_length": 252.1, + "completions/min_terminated_length": 21.7, + "entropy": 0.15506133139133454, + "epoch": 0.049, + "frac_reward_zero_std": 0.0, + "grad_norm": 2.8624351024627686, + "learning_rate": 2.2e-08, + "loss": 0.0021831102669239042, + "num_tokens": 1397545.0, + "reward": -0.06493750177323818, + "reward_std": 0.09045366649515926, + "rewards/_reward/mean": -0.06493750177323818, + "rewards/_reward/std": 0.09045366649515926, + "step": 490, + "step_time": 11.930105132705648 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 1.0, + "completions/max_length": 256.0, + "completions/max_terminated_length": 0.0, + "completions/mean_length": 256.0, + "completions/mean_terminated_length": 0.0, + "completions/min_length": 256.0, + "completions/min_terminated_length": 0.0, + "entropy": 0.26948064677417277, + "epoch": 0.05, + "frac_reward_zero_std": 0.0, + "grad_norm": 3.4680824279785156, + "learning_rate": 2e-09, + "loss": 8.046627044677735e-08, + "num_tokens": 1424705.0, + "reward": -0.1342124991118908, + "reward_std": 0.048393824510276316, + "rewards/_reward/mean": -0.1342124991118908, + "rewards/_reward/std": 0.048393824510276316, + "step": 500, + "step_time": 11.641517098102486 + } + ], + "logging_steps": 10, + "max_steps": 500, + "num_input_tokens_seen": 1424705, + "num_train_epochs": 1, + "save_steps": 100, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": true + }, + "attributes": {} + } + }, + "total_flos": 0.0, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/last-checkpoint/training_args.bin b/last-checkpoint/training_args.bin new file mode 100644 index 0000000..ea90f67 --- /dev/null +++ b/last-checkpoint/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7b0f6a9cff05cd09315faefe085273f1510f1a4c06a3f6827346203011cc613c +size 7441 diff --git a/model.safetensors b/model.safetensors new file mode 100644 index 0000000..f2fffa0 --- /dev/null +++ b/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:fa17182eba5ef4a4cf325d2d9ca704b050300c4c6ec917b40b46053cb2437b72 +size 12343804296 diff --git a/tokenizer.json b/tokenizer.json new file mode 100644 index 0000000..34510ff --- /dev/null +++ b/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3fd169731d2cbde95e10bf356d66d5997fd885dd8dbb6fb4684da3f23b2585d8 +size 11421892 diff --git a/tokenizer_config.json b/tokenizer_config.json new file mode 100644 index 0000000..4d8760d --- /dev/null +++ b/tokenizer_config.json @@ -0,0 +1,32 @@ +{ + "add_prefix_space": false, + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|im_end|>", + "errors": "replace", + "extra_special_tokens": [ + "<|im_start|>", + "<|im_end|>", + "<|object_ref_start|>", + "<|object_ref_end|>", + "<|box_start|>", + "<|box_end|>", + "<|quad_start|>", + "<|quad_end|>", + "<|vision_start|>", + "<|vision_end|>", + "<|vision_pad|>", + "<|image_pad|>", + "<|video_pad|>" + ], + "is_local": false, + "local_files_only": false, + "model_max_length": 131072, + "pad_token": "<|endoftext|>", + "padding_side": "left", + "split_special_tokens": false, + "tokenizer_class": "Qwen2Tokenizer", + "truncation_side": "left", + "unk_token": null +} diff --git a/training_args.bin b/training_args.bin new file mode 100644 index 0000000..ea90f67 --- /dev/null +++ b/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7b0f6a9cff05cd09315faefe085273f1510f1a4c06a3f6827346203011cc613c +size 7441