From f9038aaf698255a1c0c38704e13bb0bfc9c8eef0 Mon Sep 17 00:00:00 2001 From: ModelHub XC Date: Tue, 21 Jul 2026 01:38:09 +0800 Subject: [PATCH] =?UTF-8?q?=E5=88=9D=E5=A7=8B=E5=8C=96=E9=A1=B9=E7=9B=AE?= =?UTF-8?q?=EF=BC=8C=E7=94=B1ModelHub=20XC=E7=A4=BE=E5=8C=BA=E6=8F=90?= =?UTF-8?q?=E4=BE=9B=E6=A8=A1=E5=9E=8B?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit Model: promotion/qwen3-8b-kto-avg-beta0p01-s42 Source: Original Platform --- .gitattributes | 36 +++ README.md | 25 ++ chat_template.jinja | 89 +++++++ config.json | 71 ++++++ generation_config.json | 13 + model.safetensors | 3 + tokenizer.json | 3 + tokenizer_config.json | 30 +++ trainer_state.json | 545 +++++++++++++++++++++++++++++++++++++++++ training_args.bin | 3 + 10 files changed, 818 insertions(+) create mode 100644 .gitattributes create mode 100644 README.md create mode 100644 chat_template.jinja create mode 100644 config.json create mode 100644 generation_config.json create mode 100644 model.safetensors create mode 100644 tokenizer.json create mode 100644 tokenizer_config.json create mode 100644 trainer_state.json create mode 100644 training_args.bin diff --git a/.gitattributes b/.gitattributes new file mode 100644 index 0000000..52373fe --- /dev/null +++ b/.gitattributes @@ -0,0 +1,36 @@ +*.7z filter=lfs diff=lfs merge=lfs -text +*.arrow filter=lfs diff=lfs merge=lfs -text +*.bin filter=lfs diff=lfs merge=lfs -text +*.bz2 filter=lfs diff=lfs merge=lfs -text +*.ckpt filter=lfs diff=lfs merge=lfs -text +*.ftz filter=lfs diff=lfs merge=lfs -text +*.gz filter=lfs diff=lfs merge=lfs -text +*.h5 filter=lfs diff=lfs merge=lfs -text +*.joblib filter=lfs diff=lfs merge=lfs -text +*.lfs.* filter=lfs diff=lfs merge=lfs -text +*.mlmodel filter=lfs diff=lfs merge=lfs -text +*.model filter=lfs diff=lfs merge=lfs -text +*.msgpack filter=lfs diff=lfs merge=lfs -text +*.npy filter=lfs diff=lfs merge=lfs -text +*.npz filter=lfs diff=lfs merge=lfs -text +*.onnx filter=lfs diff=lfs merge=lfs -text +*.ot filter=lfs diff=lfs merge=lfs -text +*.parquet filter=lfs diff=lfs merge=lfs -text +*.pb filter=lfs diff=lfs merge=lfs -text +*.pickle filter=lfs diff=lfs merge=lfs -text +*.pkl filter=lfs diff=lfs merge=lfs -text +*.pt filter=lfs diff=lfs merge=lfs -text +*.pth filter=lfs diff=lfs merge=lfs -text +*.rar filter=lfs diff=lfs merge=lfs -text +*.safetensors filter=lfs diff=lfs merge=lfs -text +saved_model/**/* filter=lfs diff=lfs merge=lfs -text +*.tar.* filter=lfs diff=lfs merge=lfs -text +*.tar filter=lfs diff=lfs merge=lfs -text +*.tflite filter=lfs diff=lfs merge=lfs -text +*.tgz filter=lfs diff=lfs merge=lfs -text +*.wasm filter=lfs diff=lfs merge=lfs -text +*.xz filter=lfs diff=lfs merge=lfs -text +*.zip filter=lfs diff=lfs merge=lfs -text +*.zst filter=lfs diff=lfs merge=lfs -text +*tfevents* filter=lfs diff=lfs merge=lfs -text +tokenizer.json filter=lfs diff=lfs merge=lfs -text diff --git a/README.md b/README.md new file mode 100644 index 0000000..2a737d1 --- /dev/null +++ b/README.md @@ -0,0 +1,25 @@ +--- +library_name: transformers +base_model: Qwen/Qwen3-8B +tags: +- ronpo +- mnpo +- qwen3 +- preference-optimization +--- + +# qwen3-8b-kto-avg-beta0p01-s42 + +Research checkpoint for the RONPO AAAI revision experiments. + +- Method: KTO-avg beta=0.01 +- Base model: `Qwen/Qwen3-8B` with non-thinking generation protocol +- Seed: 42 +- Local source at upload time: `/NHNHOME/WORKSPACE/26msit001_A/BASE/aipr_lab_sjkim_eval/revision_qwen3_8b/full_iter1/train/kto_avg_beta0p01_s42_nhn-b200-q3-seq-07101430-kto/checkpoint-292` +- Uploaded at UTC: 2026-07-11T01:15:32Z +- Run status metadata: `not found` + +Qwen3-8B KTO baseline on the averaged three-reward oracle. + +Intended use: reproducibility and evaluation for the RONPO paper. This +checkpoint is not intended as a production assistant. diff --git a/chat_template.jinja b/chat_template.jinja new file mode 100644 index 0000000..01be9b3 --- /dev/null +++ b/chat_template.jinja @@ -0,0 +1,89 @@ +{%- if tools %} + {{- '<|im_start|>system\n' }} + {%- if messages[0].role == 'system' %} + {{- messages[0].content + '\n\n' }} + {%- endif %} + {{- "# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within XML tags:\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n\n\nFor each function call, return a json object with function name and arguments within XML tags:\n\n{\"name\": , \"arguments\": }\n<|im_end|>\n" }} +{%- else %} + {%- if messages[0].role == 'system' %} + {{- '<|im_start|>system\n' + messages[0].content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" and message.content is string and not(message.content.startswith('') and message.content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} +{%- endfor %} +{%- for message in messages %} + {%- if message.content is string %} + {%- set content = message.content %} + {%- else %} + {%- set content = '' %} + {%- endif %} + {%- if (message.role == "user") or (message.role == "system" and not loop.first) %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- if loop.index0 > ns.last_query_index %} + {%- if loop.last or (not loop.last and reasoning_content) %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content.strip('\n') + '\n\n\n' + content.lstrip('\n') }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls %} + {%- for tool_call in message.tool_calls %} + {%- if (loop.first and content) or (not loop.first) %} + {{- '\n' }} + {%- endif %} + {%- if tool_call.function %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {{- '\n{"name": "' }} + {{- tool_call.name }} + {{- '", "arguments": ' }} + {%- if tool_call.arguments is string %} + {{- tool_call.arguments }} + {%- else %} + {{- tool_call.arguments | tojson }} + {%- endif %} + {{- '}\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.first or (messages[loop.index0 - 1].role != "tool") %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/config.json b/config.json new file mode 100644 index 0000000..ee03410 --- /dev/null +++ b/config.json @@ -0,0 +1,71 @@ +{ + "architectures": [ + "Qwen3ForCausalLM" + ], + "attention_bias": false, + "attention_dropout": 0.0, + "bos_token_id": 151645, + "dtype": "bfloat16", + "eos_token_id": 151645, + "head_dim": 128, + "hidden_act": "silu", + "hidden_size": 4096, + "initializer_range": 0.02, + "intermediate_size": 12288, + "layer_types": [ + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention" + ], + "max_position_embeddings": 40960, + "max_window_layers": 36, + "model_type": "qwen3", + "num_attention_heads": 32, + "num_hidden_layers": 36, + "num_key_value_heads": 8, + "pad_token_id": 151643, + "rms_norm_eps": 1e-06, + "rope_parameters": { + "rope_theta": 1000000, + "rope_type": "default" + }, + "sliding_window": null, + "tie_word_embeddings": false, + "transformers_version": "5.13.0", + "use_cache": false, + "use_sliding_window": false, + "vocab_size": 151936 +} diff --git a/generation_config.json b/generation_config.json new file mode 100644 index 0000000..61332ec --- /dev/null +++ b/generation_config.json @@ -0,0 +1,13 @@ +{ + "bos_token_id": 151645, + "do_sample": true, + "eos_token_id": [ + 151645, + 151643 + ], + "pad_token_id": 151643, + "temperature": 0.6, + "top_k": 20, + "top_p": 0.95, + "transformers_version": "5.13.0" +} diff --git a/model.safetensors b/model.safetensors new file mode 100644 index 0000000..ad2f76c --- /dev/null +++ b/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d555b252319b14cf51a88005a6f8ee38686d61b5746144cec4591c9d188eccf0 +size 16381517208 diff --git a/tokenizer.json b/tokenizer.json new file mode 100644 index 0000000..c7afbed --- /dev/null +++ b/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:be75606093db2094d7cd20f3c2f385c212750648bd6ea4fb2bf507a6a4c55506 +size 11422650 diff --git a/tokenizer_config.json b/tokenizer_config.json new file mode 100644 index 0000000..0716db2 --- /dev/null +++ b/tokenizer_config.json @@ -0,0 +1,30 @@ +{ + "add_prefix_space": false, + "backend": "tokenizers", + "bos_token": "<|im_end|>", + "clean_up_tokenization_spaces": false, + "eos_token": "<|im_end|>", + "errors": "replace", + "extra_special_tokens": [ + "<|im_start|>", + "<|im_end|>", + "<|object_ref_start|>", + "<|object_ref_end|>", + "<|box_start|>", + "<|box_end|>", + "<|quad_start|>", + "<|quad_end|>", + "<|vision_start|>", + "<|vision_end|>", + "<|vision_pad|>", + "<|image_pad|>", + "<|video_pad|>" + ], + "is_local": true, + "local_files_only": false, + "model_max_length": 131072, + "pad_token": "<|endoftext|>", + "split_special_tokens": false, + "tokenizer_class": "Qwen2Tokenizer", + "unk_token": null +} diff --git a/trainer_state.json b/trainer_state.json new file mode 100644 index 0000000..c8caa7e --- /dev/null +++ b/trainer_state.json @@ -0,0 +1,545 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.0, + "eval_steps": 500, + "global_step": 292, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 7.594140625, + "epoch": 0.03432003432003432, + "grad_norm": 86.33226300367427, + "kl": 6.39765625, + "learning_rate": 1.5e-07, + "logits/chosen": -107184128.0, + "logits/rejected": -105178726.4, + "logps/chosen": -9729.8, + "logps/rejected": -10091.2, + "loss": 0.4985076904296875, + "num_tokens": 1000098.0, + "rewards/chosen": -0.04769744873046875, + "rewards/margins": 0.019524288177490235, + "rewards/rejected": -0.06722173690795899, + "step": 10 + }, + { + "entropy": 7.608984375, + "epoch": 0.06864006864006864, + "grad_norm": 127.51161758392736, + "kl": 9.834375, + "learning_rate": 3.166666666666666e-07, + "logits/chosen": -111175270.4, + "logits/rejected": -110572339.2, + "logps/chosen": -10525.6, + "logps/rejected": -10866.0, + "loss": 0.5047119140625, + "num_tokens": 2059302.0, + "rewards/chosen": -0.09103813171386718, + "rewards/margins": -0.06356315612792969, + "rewards/rejected": -0.0274749755859375, + "step": 20 + }, + { + "entropy": 7.582421875, + "epoch": 0.10296010296010295, + "grad_norm": 92.88485309688424, + "kl": 0.2046875, + "learning_rate": 4.833333333333333e-07, + "logits/chosen": -106351820.8, + "logits/rejected": -105293414.4, + "logps/chosen": -10041.6, + "logps/rejected": -10261.0, + "loss": 0.49964599609375, + "num_tokens": 3087752.0, + "rewards/chosen": -0.5374847412109375, + "rewards/margins": 0.03810577392578125, + "rewards/rejected": -0.5755905151367188, + "step": 30 + }, + { + "entropy": 7.533984375, + "epoch": 0.13728013728013727, + "grad_norm": 61.54426686277499, + "kl": 0.0, + "learning_rate": 4.985456442051682e-07, + "logits/chosen": -99627827.2, + "logits/rejected": -95980748.8, + "logps/chosen": -9881.0, + "logps/rejected": -10339.0, + "loss": 0.5043426513671875, + "num_tokens": 4100561.0, + "rewards/chosen": -1.321875, + "rewards/margins": 0.0261962890625, + "rewards/rejected": -1.3480712890625, + "step": 40 + }, + { + "entropy": 7.523828125, + "epoch": 0.1716001716001716, + "grad_norm": 122.84522486033784, + "kl": 0.09375, + "learning_rate": 4.935399618791793e-07, + "logits/chosen": -98726707.2, + "logits/rejected": -96527974.4, + "logps/chosen": -9919.9, + "logps/rejected": -10279.2, + "loss": 0.4984130859375, + "num_tokens": 5111368.0, + "rewards/chosen": -1.801904296875, + "rewards/margins": 0.1624755859375, + "rewards/rejected": -1.9643798828125, + "step": 50 + }, + { + "entropy": 7.54296875, + "epoch": 0.2059202059202059, + "grad_norm": 75.96355510905495, + "kl": 3.9984375, + "learning_rate": 4.850368660819092e-07, + "logits/chosen": -106171596.8, + "logits/rejected": -105942220.8, + "logps/chosen": -10453.6, + "logps/rejected": -10825.2, + "loss": 0.495751953125, + "num_tokens": 6159442.0, + "rewards/chosen": -0.5387272834777832, + "rewards/margins": 0.12462263107299805, + "rewards/rejected": -0.6633499145507813, + "step": 60 + }, + { + "entropy": 7.62265625, + "epoch": 0.24024024024024024, + "grad_norm": 109.08719788934083, + "kl": 37.352734375, + "learning_rate": 4.731584675403184e-07, + "logits/chosen": -113573888.0, + "logits/rejected": -110988492.8, + "logps/chosen": -9306.4, + "logps/rejected": -9616.2, + "loss": 0.5021636962890625, + "num_tokens": 7148746.0, + "rewards/chosen": 0.21960601806640626, + "rewards/margins": 0.003122711181640625, + "rewards/rejected": 0.21648330688476564, + "step": 70 + }, + { + "entropy": 7.659765625, + "epoch": 0.27456027456027454, + "grad_norm": 58.939359796249065, + "kl": 171.0875, + "learning_rate": 4.5807534881817183e-07, + "logits/chosen": -114412748.8, + "logits/rejected": -113252761.6, + "logps/chosen": -9437.6, + "logps/rejected": -9837.6, + "loss": 0.4959259033203125, + "num_tokens": 8139737.0, + "rewards/chosen": 1.7338134765625, + "rewards/margins": 0.0449676513671875, + "rewards/rejected": 1.6888458251953125, + "step": 80 + }, + { + "entropy": 7.712109375, + "epoch": 0.3088803088803089, + "grad_norm": 83.72781850857909, + "kl": 330.3125, + "learning_rate": 4.400041146246136e-07, + "logits/chosen": -129309081.6, + "logits/rejected": -125432627.2, + "logps/chosen": -9531.0, + "logps/rejected": -10017.2, + "loss": 0.50328369140625, + "num_tokens": 9171482.0, + "rewards/chosen": 3.218115234375, + "rewards/margins": -0.171630859375, + "rewards/rejected": 3.38974609375, + "step": 90 + }, + { + "entropy": 7.815625, + "epoch": 0.3432003432003432, + "grad_norm": 61.619761951920744, + "kl": 569.35, + "learning_rate": 4.1920428121079e-07, + "logits/chosen": -142609612.8, + "logits/rejected": -140650086.4, + "logps/chosen": -9252.6, + "logps/rejected": -9623.2, + "loss": 0.5056427001953125, + "num_tokens": 10204959.0, + "rewards/chosen": 5.598828125, + "rewards/margins": -0.18271484375, + "rewards/rejected": 5.78154296875, + "step": 100 + }, + { + "entropy": 7.884765625, + "epoch": 0.37752037752037754, + "grad_norm": 45.03461918952044, + "kl": 831.45, + "learning_rate": 3.959745495250818e-07, + "logits/chosen": -151001497.6, + "logits/rejected": -147940966.4, + "logps/chosen": -8605.2, + "logps/rejected": -9020.0, + "loss": 0.50517578125, + "num_tokens": 11188498.0, + "rewards/chosen": 8.1416015625, + "rewards/margins": -0.340234375, + "rewards/rejected": 8.4818359375, + "step": 110 + }, + { + "entropy": 7.975390625, + "epoch": 0.4118404118404118, + "grad_norm": 36.350000413332154, + "kl": 1201.625, + "learning_rate": 3.7064851564718353e-07, + "logits/chosen": -181908275.2, + "logits/rejected": -178755993.6, + "logps/chosen": -8662.0, + "logps/rejected": -8825.2, + "loss": 0.496246337890625, + "num_tokens": 12220511.0, + "rewards/chosen": 12.016015625, + "rewards/margins": -0.000390625, + "rewards/rejected": 12.01640625, + "step": 120 + }, + { + "entropy": 7.977734375, + "epoch": 0.44616044616044614, + "grad_norm": 31.597257913649155, + "kl": 1435.55, + "learning_rate": 3.4358988010236103e-07, + "logits/chosen": -203227136.0, + "logits/rejected": -201883648.0, + "logps/chosen": -8452.6, + "logps/rejected": -8621.8, + "loss": 0.4972412109375, + "num_tokens": 13250325.0, + "rewards/chosen": 14.191796875, + "rewards/margins": -0.3341796875, + "rewards/rejected": 14.5259765625, + "step": 130 + }, + { + "entropy": 7.975390625, + "epoch": 0.4804804804804805, + "grad_norm": 21.621622249090635, + "kl": 1731.0, + "learning_rate": 3.1518722485366754e-07, + "logits/chosen": -222298112.0, + "logits/rejected": -219827404.8, + "logps/chosen": -8690.0, + "logps/rejected": -8949.2, + "loss": 0.50311279296875, + "num_tokens": 14326309.0, + "rewards/chosen": 16.971484375, + "rewards/margins": -0.696484375, + "rewards/rejected": 17.66796875, + "step": 140 + }, + { + "entropy": 7.954296875, + "epoch": 0.5148005148005148, + "grad_norm": 21.811975809486956, + "kl": 1867.15, + "learning_rate": 2.8584843297836277e-07, + "logits/chosen": -228825497.6, + "logits/rejected": -228071833.6, + "logps/chosen": -7983.8, + "logps/rejected": -8123.0, + "loss": 0.4952362060546875, + "num_tokens": 15346427.0, + "rewards/chosen": 18.575390625, + "rewards/margins": -0.193359375, + "rewards/rejected": 18.76875, + "step": 150 + }, + { + "entropy": 7.976953125, + "epoch": 0.5491205491205491, + "grad_norm": 33.183727711509015, + "kl": 1883.8, + "learning_rate": 2.5599483116609544e-07, + "logits/chosen": -228923801.6, + "logits/rejected": -224670515.2, + "logps/chosen": -8062.4, + "logps/rejected": -8387.2, + "loss": 0.5054046630859375, + "num_tokens": 16366642.0, + "rewards/chosen": 18.32421875, + "rewards/margins": -1.030078125, + "rewards/rejected": 19.354296875, + "step": 160 + }, + { + "entropy": 8.000390625, + "epoch": 0.5834405834405835, + "grad_norm": 12.850165739096068, + "kl": 1952.45, + "learning_rate": 2.2605513915689874e-07, + "logits/chosen": -230529433.6, + "logits/rejected": -228432281.6, + "logps/chosen": -7903.6, + "logps/rejected": -8130.6, + "loss": 0.50506591796875, + "num_tokens": 17380939.0, + "rewards/chosen": 19.238671875, + "rewards/margins": -0.577734375, + "rewards/rejected": 19.81640625, + "step": 170 + }, + { + "entropy": 7.98984375, + "epoch": 0.6177606177606177, + "grad_norm": 9.466663342172486, + "kl": 2113.5, + "learning_rate": 1.9645931300952795e-07, + "logits/chosen": -245137408.0, + "logits/rejected": -241355980.8, + "logps/chosen": -7811.6, + "logps/rejected": -8251.0, + "loss": 0.5172149658203125, + "num_tokens": 18421034.0, + "rewards/chosen": 20.554296875, + "rewards/margins": -1.14609375, + "rewards/rejected": 21.700390625, + "step": 180 + }, + { + "entropy": 7.917578125, + "epoch": 0.6520806520806521, + "grad_norm": 8.76687486946907, + "kl": 2130.25, + "learning_rate": 1.6763237061535008e-07, + "logits/chosen": -243918438.4, + "logits/rejected": -240589209.6, + "logps/chosen": -7463.2, + "logps/rejected": -7685.8, + "loss": 0.500433349609375, + "num_tokens": 19430090.0, + "rewards/chosen": 20.763671875, + "rewards/margins": -1.073828125, + "rewards/rejected": 21.8375, + "step": 190 + }, + { + "entropy": 7.755078125, + "epoch": 0.6864006864006864, + "grad_norm": 11.01172644517593, + "kl": 2340.1, + "learning_rate": 1.3998828812795932e-07, + "logits/chosen": -260092723.2, + "logits/rejected": -258008678.4, + "logps/chosen": -7685.4, + "logps/rejected": -7937.2, + "loss": 0.5029571533203125, + "num_tokens": 20459910.0, + "rewards/chosen": 22.9265625, + "rewards/margins": -0.95234375, + "rewards/rejected": 23.87890625, + "step": 200 + }, + { + "entropy": 7.675390625, + "epoch": 0.7207207207207207, + "grad_norm": 30.85091198701311, + "kl": 2452.7, + "learning_rate": 1.1392405496029076e-07, + "logits/chosen": -270807859.2, + "logits/rejected": -269208780.8, + "logps/chosen": -7861.9, + "logps/rejected": -8111.2, + "loss": 0.5022857666015625, + "num_tokens": 21493036.0, + "rewards/chosen": 23.9083984375, + "rewards/margins": -1.2330078125, + "rewards/rejected": 25.14140625, + "step": 210 + }, + { + "entropy": 7.585546875, + "epoch": 0.7550407550407551, + "grad_norm": 15.36265057914587, + "kl": 2365.5, + "learning_rate": 8.981397272385738e-08, + "logits/chosen": -266141696.0, + "logits/rejected": -263979008.0, + "logps/chosen": -7420.0, + "logps/rejected": -7809.0, + "loss": 0.510125732421875, + "num_tokens": 22497542.0, + "rewards/chosen": 23.06484375, + "rewards/margins": -1.197265625, + "rewards/rejected": 24.262109375, + "step": 220 + }, + { + "entropy": 7.594140625, + "epoch": 0.7893607893607893, + "grad_norm": 6.546387154998616, + "kl": 2397.8, + "learning_rate": 6.800427998154968e-08, + "logits/chosen": -275847577.6, + "logits/rejected": -274078105.6, + "logps/chosen": -7580.4, + "logps/rejected": -7842.4, + "loss": 0.4974273681640625, + "num_tokens": 23534012.0, + "rewards/chosen": 23.476953125, + "rewards/margins": -0.99921875, + "rewards/rejected": 24.476171875, + "step": 230 + }, + { + "entropy": 7.50078125, + "epoch": 0.8236808236808236, + "grad_norm": 24.903868525956547, + "kl": 2610.4, + "learning_rate": 4.8808180006509356e-08, + "logits/chosen": -296511078.4, + "logits/rejected": -293443993.6, + "logps/chosen": -8122.0, + "logps/rejected": -8423.6, + "loss": 0.50238037109375, + "num_tokens": 24628737.0, + "rewards/chosen": 25.5359375, + "rewards/margins": -1.14375, + "rewards/rejected": 26.6796875, + "step": 240 + }, + { + "entropy": 7.55234375, + "epoch": 0.858000858000858, + "grad_norm": 15.268579913892744, + "kl": 2629.2, + "learning_rate": 3.250134295213053e-08, + "logits/chosen": -288122470.4, + "logits/rejected": -284799795.2, + "logps/chosen": -7932.2, + "logps/rejected": -8312.4, + "loss": 0.5093109130859375, + "num_tokens": 25690351.0, + "rewards/chosen": 25.858984375, + "rewards/margins": -0.870703125, + "rewards/rejected": 26.7296875, + "step": 250 + }, + { + "entropy": 7.44453125, + "epoch": 0.8923208923208923, + "grad_norm": 15.110634441696666, + "kl": 2613.15, + "learning_rate": 1.9317947025340232e-08, + "logits/chosen": -292644454.4, + "logits/rejected": -290822553.6, + "logps/chosen": -8003.2, + "logps/rejected": -8455.0, + "loss": 0.5151123046875, + "num_tokens": 26763232.0, + "rewards/chosen": 25.44453125, + "rewards/margins": -1.375, + "rewards/rejected": 26.81953125, + "step": 260 + }, + { + "entropy": 7.478515625, + "epoch": 0.9266409266409267, + "grad_norm": 13.312675942972383, + "kl": 2433.15, + "learning_rate": 9.447315514833353e-09, + "logits/chosen": -276883046.4, + "logits/rejected": -270277017.6, + "logps/chosen": -7410.8, + "logps/rejected": -7717.0, + "loss": 0.5004669189453125, + "num_tokens": 27765238.0, + "rewards/chosen": 23.782421875, + "rewards/margins": -1.104296875, + "rewards/rejected": 24.88671875, + "step": 270 + }, + { + "entropy": 7.510546875, + "epoch": 0.960960960960961, + "grad_norm": 10.274017437444142, + "kl": 2346.1, + "learning_rate": 3.0311979690147426e-09, + "logits/chosen": -259797811.2, + "logits/rejected": -256979763.2, + "logps/chosen": -7306.8, + "logps/rejected": -7390.2, + "loss": 0.500830078125, + "num_tokens": 28731039.0, + "rewards/chosen": 23.248828125, + "rewards/margins": -0.418359375, + "rewards/rejected": 23.6671875, + "step": 280 + }, + { + "entropy": 7.46171875, + "epoch": 0.9952809952809952, + "grad_norm": 6.810163426768989, + "kl": 2498.55, + "learning_rate": 1.6173456793908135e-10, + "logits/chosen": -279746969.6, + "logits/rejected": -278174105.6, + "logps/chosen": -7759.2, + "logps/rejected": -7908.0, + "loss": 0.5092376708984375, + "num_tokens": 29763064.0, + "rewards/chosen": 24.6875, + "rewards/margins": -0.61796875, + "rewards/rejected": 25.30546875, + "step": 290 + }, + { + "epoch": 1.0, + "eval_entropy": 7.5152138157894735, + "eval_kl": 2432.842105263158, + "eval_logits/chosen": -280314718.31578946, + "eval_logits/rejected": -277313859.3684211, + "eval_logps/chosen": -7510.631578947368, + "eval_logps/rejected": -7763.578947368421, + "eval_loss": 0.5068327188491821, + "eval_num_tokens": 29885865.0, + "eval_rewards/chosen": 24.02014802631579, + "eval_rewards/margins": -0.6217105263157895, + "eval_rewards/rejected": 24.64185855263158, + "eval_runtime": 43.731, + "eval_samples_per_second": 27.623, + "eval_steps_per_second": 1.738, + "step": 292 + } + ], + "logging_steps": 10, + "max_steps": 292, + "num_input_tokens_seen": 0, + "num_train_epochs": 1, + "save_steps": 1000, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": true + }, + "attributes": {} + } + }, + "total_flos": 7245703888896.0, + "train_batch_size": 2, + "trial_name": null, + "trial_params": null +} diff --git a/training_args.bin b/training_args.bin new file mode 100644 index 0000000..80e69aa --- /dev/null +++ b/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:be2949329009f149e3ba305302ead90655f0cdae85f3f2eb23ed5ae2b3517b0e +size 7057