commit 9756dbb265631c074cca63c379dca7b92cf38c4d Author: ModelHub XC Date: Tue Aug 25 22:48:14 2026 +0800 初始化项目,由ModelHub XC社区提供模型 Model: shisa-ai/ablation-144-a128.dpo.armorm.rp.tl.5e7-shisa-v2-llama-3.1-8b Source: Original Platform diff --git a/.gitattributes b/.gitattributes new file mode 100644 index 0000000..23c1e42 --- /dev/null +++ b/.gitattributes @@ -0,0 +1,52 @@ +*.7z filter=lfs diff=lfs merge=lfs -text +*.arrow filter=lfs diff=lfs merge=lfs -text +*.bin filter=lfs diff=lfs merge=lfs -text +*.bin.* filter=lfs diff=lfs merge=lfs -text +*.bz2 filter=lfs diff=lfs merge=lfs -text +*.ftz filter=lfs diff=lfs merge=lfs -text +*.gz filter=lfs diff=lfs merge=lfs -text +*.h5 filter=lfs diff=lfs merge=lfs -text +*.joblib filter=lfs diff=lfs merge=lfs -text +*.lfs.* filter=lfs diff=lfs merge=lfs -text +*.model filter=lfs diff=lfs merge=lfs -text +*.msgpack filter=lfs diff=lfs merge=lfs -text +*.onnx filter=lfs diff=lfs merge=lfs -text +*.ot filter=lfs diff=lfs merge=lfs -text +*.parquet filter=lfs diff=lfs merge=lfs -text +*.pb filter=lfs diff=lfs merge=lfs -text +*.pt filter=lfs diff=lfs merge=lfs -text +*.pth filter=lfs diff=lfs merge=lfs -text +*.rar filter=lfs diff=lfs merge=lfs -text +saved_model/**/* filter=lfs diff=lfs merge=lfs -text +*.tar.* filter=lfs diff=lfs merge=lfs -text +*.tflite filter=lfs diff=lfs merge=lfs -text +*.tgz filter=lfs diff=lfs merge=lfs -text +*.xz filter=lfs diff=lfs merge=lfs -text +*.zip filter=lfs diff=lfs merge=lfs -text +*.zstandard filter=lfs diff=lfs merge=lfs -text +*.tfevents* filter=lfs diff=lfs merge=lfs -text +*.db* filter=lfs diff=lfs merge=lfs -text +*.ark* filter=lfs diff=lfs merge=lfs -text +**/*ckpt*data* filter=lfs diff=lfs merge=lfs -text +**/*ckpt*.meta filter=lfs diff=lfs merge=lfs -text +**/*ckpt*.index filter=lfs diff=lfs merge=lfs -text +*.safetensors filter=lfs diff=lfs merge=lfs -text +*.ckpt filter=lfs diff=lfs merge=lfs -text +*.gguf* filter=lfs diff=lfs merge=lfs -text +*.ggml filter=lfs diff=lfs merge=lfs -text +*.llamafile* filter=lfs diff=lfs merge=lfs -text +*.pt2 filter=lfs diff=lfs merge=lfs -text +*.mlmodel filter=lfs diff=lfs merge=lfs -text +*.npy filter=lfs diff=lfs merge=lfs -text +*.npz filter=lfs diff=lfs merge=lfs -text +*.pickle filter=lfs diff=lfs merge=lfs -text +*.pkl filter=lfs diff=lfs merge=lfs -text +*.tar filter=lfs diff=lfs merge=lfs -text +*.wasm filter=lfs diff=lfs merge=lfs -text +*.zst filter=lfs diff=lfs merge=lfs -text +*tfevents* filter=lfs diff=lfs merge=lfs -text + +checkpoint-1630/tokenizer.json filter=lfs diff=lfs merge=lfs -text +checkpoint-2445/tokenizer.json filter=lfs diff=lfs merge=lfs -text +checkpoint-815/tokenizer.json filter=lfs diff=lfs merge=lfs -text +tokenizer.json filter=lfs diff=lfs merge=lfs -text \ No newline at end of file diff --git a/README.md b/README.md new file mode 100644 index 0000000..5f765cc --- /dev/null +++ b/README.md @@ -0,0 +1,66 @@ +--- +library_name: transformers +model_name: outputs/ablation-144-a128.dpo.armorm.rp.tl.5e7-shisa-v2-llama-3.1-8b +tags: +- generated_from_trainer +licence: license +--- + +# Model Card for outputs/ablation-144-a128.dpo.armorm.rp.tl.5e7-shisa-v2-llama-3.1-8b + +This model is a fine-tuned version of [None](https://huggingface.co/None). +It has been trained using [TRL](https://github.com/huggingface/trl). + +## Quick start + +```python +from transformers import pipeline + +question = "If you had a time machine, but could only go to the past or the future once and never return, which would you choose and why?" +generator = pipeline("text-generation", model="None", device="cuda") +output = generator([{"role": "user", "content": question}], max_new_tokens=128, return_full_text=False)[0] +print(output["generated_text"]) +``` + +## Training procedure + +[Visualize in Weights & Biases](https://wandb.ai/augmxnt/shisa-v2/runs/0hteques) + + +This model was trained with DPO, a method introduced in [Direct Preference Optimization: Your Language Model is Secretly a Reward Model](https://huggingface.co/papers/2305.18290). + +### Framework versions + +- TRL: 0.15.1 +- Transformers: 4.50.0 +- Pytorch: 2.6.0 +- Datasets: 3.4.1 +- Tokenizers: 0.21.1 + +## Citations + +Cite DPO as: + +```bibtex +@inproceedings{rafailov2023direct, + title = {{Direct Preference Optimization: Your Language Model is Secretly a Reward Model}}, + author = {Rafael Rafailov and Archit Sharma and Eric Mitchell and Christopher D. Manning and Stefano Ermon and Chelsea Finn}, + year = 2023, + booktitle = {Advances in Neural Information Processing Systems 36: Annual Conference on Neural Information Processing Systems 2023, NeurIPS 2023, New Orleans, LA, USA, December 10 - 16, 2023}, + url = {http://papers.nips.cc/paper_files/paper/2023/hash/a85b405ed65c6477a4fe8302b5e06ce7-Abstract-Conference.html}, + editor = {Alice Oh and Tristan Naumann and Amir Globerson and Kate Saenko and Moritz Hardt and Sergey Levine}, +} +``` + +Cite TRL as: + +```bibtex +@misc{vonwerra2022trl, + title = {{TRL: Transformer Reinforcement Learning}}, + author = {Leandro von Werra and Younes Belkada and Lewis Tunstall and Edward Beeching and Tristan Thrush and Nathan Lambert and Shengyi Huang and Kashif Rasul and Quentin Gallouédec}, + year = 2020, + journal = {GitHub repository}, + publisher = {GitHub}, + howpublished = {\url{https://github.com/huggingface/trl}} +} +``` \ No newline at end of file diff --git a/checkpoint-1630/config.json b/checkpoint-1630/config.json new file mode 100644 index 0000000..ded5a8b --- /dev/null +++ b/checkpoint-1630/config.json @@ -0,0 +1,35 @@ +{ + "architectures": [ + "LlamaForCausalLM" + ], + "attention_bias": false, + "attention_dropout": 0.0, + "bos_token_id": 128000, + "eos_token_id": 128009, + "head_dim": 128, + "hidden_act": "silu", + "hidden_size": 4096, + "initializer_range": 0.02, + "intermediate_size": 14336, + "max_position_embeddings": 131072, + "mlp_bias": false, + "model_type": "llama", + "num_attention_heads": 32, + "num_hidden_layers": 32, + "num_key_value_heads": 8, + "pretraining_tp": 1, + "rms_norm_eps": 1e-05, + "rope_scaling": { + "factor": 8.0, + "high_freq_factor": 4.0, + "low_freq_factor": 1.0, + "original_max_position_embeddings": 8192, + "rope_type": "llama3" + }, + "rope_theta": 500000.0, + "tie_word_embeddings": false, + "torch_dtype": "bfloat16", + "transformers_version": "4.50.0", + "use_cache": false, + "vocab_size": 128256 +} diff --git a/checkpoint-1630/generation_config.json b/checkpoint-1630/generation_config.json new file mode 100644 index 0000000..0acdb5a --- /dev/null +++ b/checkpoint-1630/generation_config.json @@ -0,0 +1,12 @@ +{ + "bos_token_id": 128000, + "do_sample": true, + "eos_token_id": [ + 128001, + 128008, + 128009 + ], + "temperature": 0.6, + "top_p": 0.9, + "transformers_version": "4.50.0" +} diff --git a/checkpoint-1630/global_step1630/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..a4a004f --- /dev/null +++ b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0a924d00db8b64146f3b6bee4299d3df702182c2be0a4f35feef9ff9a3efdf39 +size 1514015111 diff --git a/checkpoint-1630/global_step1630/bf16_zero_pp_rank_10_mp_rank_00_optim_states.pt b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_10_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..2c04c88 --- /dev/null +++ b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_10_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:a64ffec238335ec39712b58664b62985300deeeae845a5936eeb874fa5cb2287 +size 1514016442 diff --git a/checkpoint-1630/global_step1630/bf16_zero_pp_rank_11_mp_rank_00_optim_states.pt b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_11_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..ff666de --- /dev/null +++ b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_11_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:671f5c913d869932df2e375f8d8b15c11fee6224de05dc2a6887612a9e35c5ec +size 1514016442 diff --git a/checkpoint-1630/global_step1630/bf16_zero_pp_rank_12_mp_rank_00_optim_states.pt b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_12_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..4806790 --- /dev/null +++ b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_12_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:9a7bf249d205da56da5aba649bbd65f3820b3a880ab5af1efb928c761c4807fc +size 1514016442 diff --git a/checkpoint-1630/global_step1630/bf16_zero_pp_rank_13_mp_rank_00_optim_states.pt b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_13_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..173f2b3 --- /dev/null +++ b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_13_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:212e561f441f28bb1c88c3cde24fe9d7585a6c614ab79430066aa6ce1f19a4ca +size 1514016442 diff --git a/checkpoint-1630/global_step1630/bf16_zero_pp_rank_14_mp_rank_00_optim_states.pt b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_14_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..38de21d --- /dev/null +++ b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_14_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:fb305308e697f8cd544ce9a8975090c5f3333f5e97d2762222aa9f1d7a0b4570 +size 1514016442 diff --git a/checkpoint-1630/global_step1630/bf16_zero_pp_rank_15_mp_rank_00_optim_states.pt b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_15_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..55859c6 --- /dev/null +++ b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_15_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:89ce04b4c88c1b22c451bdd0e50869906bf9f1f230306fde9a09266f4489f224 +size 1514016442 diff --git a/checkpoint-1630/global_step1630/bf16_zero_pp_rank_16_mp_rank_00_optim_states.pt b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_16_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..9e60d68 --- /dev/null +++ b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_16_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:21e70717b96062cd1337c45b17598629b0e4f4f82ed4cd7783d78a34fabb0de9 +size 1514016442 diff --git a/checkpoint-1630/global_step1630/bf16_zero_pp_rank_17_mp_rank_00_optim_states.pt b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_17_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..e4dd7d7 --- /dev/null +++ b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_17_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:831412fd32b1a2c80f09c4980f429aa7b2086567165e72b82eac1ee7d48dd80c +size 1514016442 diff --git a/checkpoint-1630/global_step1630/bf16_zero_pp_rank_18_mp_rank_00_optim_states.pt b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_18_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..3b66b1c --- /dev/null +++ b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_18_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:8fe001f81b6a7474004c59f7364a1e401ed39c8851acef9934e99bc5cfbc5f32 +size 1514016442 diff --git a/checkpoint-1630/global_step1630/bf16_zero_pp_rank_19_mp_rank_00_optim_states.pt b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_19_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..fe2acf2 --- /dev/null +++ b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_19_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ce909f6835979aa568f80e1fe6ba2504ed1b4b7588e4db60d75fdacd6da6dc50 +size 1514016442 diff --git a/checkpoint-1630/global_step1630/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..c5656d2 --- /dev/null +++ b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:a3574101c736a0a1f63f2a58e3cc49a896a6dfa326e7fe4aef66747ebe88584b +size 1514015111 diff --git a/checkpoint-1630/global_step1630/bf16_zero_pp_rank_20_mp_rank_00_optim_states.pt b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_20_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..c5fe613 --- /dev/null +++ b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_20_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:8992499c94385fff0ccebcc04d2c1d89ffa9c69f955d6e479d6926bb83592541 +size 1514016442 diff --git a/checkpoint-1630/global_step1630/bf16_zero_pp_rank_21_mp_rank_00_optim_states.pt b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_21_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..47ce2d7 --- /dev/null +++ b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_21_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7abfd18995d0f2cb04c73817429205139ce488c554b11939f7acbcf6979b2b9e +size 1514016442 diff --git a/checkpoint-1630/global_step1630/bf16_zero_pp_rank_22_mp_rank_00_optim_states.pt b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_22_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..89f6625 --- /dev/null +++ b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_22_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ba8dc62182e9027cb5362bff4e0de1d036b9cb1ae1102d45ae8eea17a5c40df4 +size 1514016442 diff --git a/checkpoint-1630/global_step1630/bf16_zero_pp_rank_23_mp_rank_00_optim_states.pt b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_23_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..44bed46 --- /dev/null +++ b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_23_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7f56357d7b1036dfa1b31576e6b0064b23ff907b25692a8ce428848f7f2c63e2 +size 1514016442 diff --git a/checkpoint-1630/global_step1630/bf16_zero_pp_rank_24_mp_rank_00_optim_states.pt b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_24_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..f2744f7 --- /dev/null +++ b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_24_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2a301106fd0980674fe3623eadd3d2f3606e6d775161a514459e6fae9d6cc193 +size 1514016442 diff --git a/checkpoint-1630/global_step1630/bf16_zero_pp_rank_25_mp_rank_00_optim_states.pt b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_25_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..58ae422 --- /dev/null +++ b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_25_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:bf647e9de17cc6d7462765a8151360b90a2588dd41d7a606b28e4e5d1875f7d3 +size 1514016442 diff --git a/checkpoint-1630/global_step1630/bf16_zero_pp_rank_26_mp_rank_00_optim_states.pt b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_26_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..8635dac --- /dev/null +++ b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_26_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:81671bed2d4e2bf55802d576c311a61ceed7d3263e58c75ee7557517477adff0 +size 1514016442 diff --git a/checkpoint-1630/global_step1630/bf16_zero_pp_rank_27_mp_rank_00_optim_states.pt b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_27_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..2178dcc --- /dev/null +++ b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_27_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:1d747f11368c25675990b516329b92da19c2c523cfad497142dd073d37b6d968 +size 1514016442 diff --git a/checkpoint-1630/global_step1630/bf16_zero_pp_rank_28_mp_rank_00_optim_states.pt b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_28_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..71eb28d --- /dev/null +++ b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_28_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4c6806ce256a0fe8d6505f8dd74f738685abd7177fb1b624e91d06d3489210f7 +size 1514016442 diff --git a/checkpoint-1630/global_step1630/bf16_zero_pp_rank_29_mp_rank_00_optim_states.pt b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_29_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..2376421 --- /dev/null +++ b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_29_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:138cc226a1b320db7ae7da6795837010414b63c291521681b956883306642b9f +size 1514016442 diff --git a/checkpoint-1630/global_step1630/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..f578bc2 --- /dev/null +++ b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:a362814efddd4574025d50e413e47d1038051ceea60bda70c326e70ca1ad74a0 +size 1514015111 diff --git a/checkpoint-1630/global_step1630/bf16_zero_pp_rank_30_mp_rank_00_optim_states.pt b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_30_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..83a9d63 --- /dev/null +++ b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_30_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:939af5794fd5e007627aa3ec83359d51724785b524661af9904407e4a6322048 +size 1514016442 diff --git a/checkpoint-1630/global_step1630/bf16_zero_pp_rank_31_mp_rank_00_optim_states.pt b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_31_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..3d1e67f --- /dev/null +++ b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_31_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4ab43fdb1d7b02e840804ea16096b9a13e09a7cffd36cc9bf2adcc4d2c025406 +size 1514016442 diff --git a/checkpoint-1630/global_step1630/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..1ae8022 --- /dev/null +++ b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3d1945d2d235b73e7e854c99a5c607b5e2252e29041cfb38b59e5df42ef321f6 +size 1514015111 diff --git a/checkpoint-1630/global_step1630/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..815d822 --- /dev/null +++ b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e1a5dece1f32641e4c22ccb51338fd2937e4261c2fc80e679d743211b63610ff +size 1514015111 diff --git a/checkpoint-1630/global_step1630/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..b5c519b --- /dev/null +++ b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:176ff1e3a5cf1f21d379f6c8a21d1cd40171337a522abf0c6da60db5cc16762a +size 1514015111 diff --git a/checkpoint-1630/global_step1630/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..d539315 --- /dev/null +++ b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b88371f77316d413d0534b9fe444bdb43ebac47511f949d6631647e4c399a935 +size 1514015111 diff --git a/checkpoint-1630/global_step1630/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..b56c553 --- /dev/null +++ b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d300bae519fc8f39f5fcfc4e8990ffdfabcce2452f02f6d62c4f1a426b94e601 +size 1514015111 diff --git a/checkpoint-1630/global_step1630/bf16_zero_pp_rank_8_mp_rank_00_optim_states.pt b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_8_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..cbf2104 --- /dev/null +++ b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_8_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:45d4734cfd51e34b7d981faf9f2434b66b7e038ec36f7c3de5253d4f982109a8 +size 1514015111 diff --git a/checkpoint-1630/global_step1630/bf16_zero_pp_rank_9_mp_rank_00_optim_states.pt b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_9_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..1ac69d2 --- /dev/null +++ b/checkpoint-1630/global_step1630/bf16_zero_pp_rank_9_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c655316a80b8588a45b2ec19a631ae198888a0d8198cb37416bb74b145b48695 +size 1514015111 diff --git a/checkpoint-1630/global_step1630/zero_pp_rank_0_mp_rank_00_model_states.pt b/checkpoint-1630/global_step1630/zero_pp_rank_0_mp_rank_00_model_states.pt new file mode 100644 index 0000000..db997e4 --- /dev/null +++ b/checkpoint-1630/global_step1630/zero_pp_rank_0_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:fa532a7c8189bc930aebd05eba451a267458553a6f3af3bb3b1e98d8523d76be +size 150245 diff --git a/checkpoint-1630/global_step1630/zero_pp_rank_10_mp_rank_00_model_states.pt b/checkpoint-1630/global_step1630/zero_pp_rank_10_mp_rank_00_model_states.pt new file mode 100644 index 0000000..aa9c61b --- /dev/null +++ b/checkpoint-1630/global_step1630/zero_pp_rank_10_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:f515b12cf75954828dd92c701dcb04425ca7da970eaf6a88653baf1d62011269 +size 150540 diff --git a/checkpoint-1630/global_step1630/zero_pp_rank_11_mp_rank_00_model_states.pt b/checkpoint-1630/global_step1630/zero_pp_rank_11_mp_rank_00_model_states.pt new file mode 100644 index 0000000..7d5ca98 --- /dev/null +++ b/checkpoint-1630/global_step1630/zero_pp_rank_11_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:84c969c26f5eecbc4c2484d80c3ea790de2bb535e0d02d9935d79c357fbb8f86 +size 150540 diff --git a/checkpoint-1630/global_step1630/zero_pp_rank_12_mp_rank_00_model_states.pt b/checkpoint-1630/global_step1630/zero_pp_rank_12_mp_rank_00_model_states.pt new file mode 100644 index 0000000..c8b5fd8 --- /dev/null +++ b/checkpoint-1630/global_step1630/zero_pp_rank_12_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:bafcd493f85462e19b9224677c7514bb3b94f423861f053cc4c3fa2be59a53f8 +size 150540 diff --git a/checkpoint-1630/global_step1630/zero_pp_rank_13_mp_rank_00_model_states.pt b/checkpoint-1630/global_step1630/zero_pp_rank_13_mp_rank_00_model_states.pt new file mode 100644 index 0000000..e5d4fff --- /dev/null +++ b/checkpoint-1630/global_step1630/zero_pp_rank_13_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6c8717e3c8eaee90ce1e24d39bd0d4d19bc5423035c1a8041bb31c3c2f460158 +size 150540 diff --git a/checkpoint-1630/global_step1630/zero_pp_rank_14_mp_rank_00_model_states.pt b/checkpoint-1630/global_step1630/zero_pp_rank_14_mp_rank_00_model_states.pt new file mode 100644 index 0000000..9740439 --- /dev/null +++ b/checkpoint-1630/global_step1630/zero_pp_rank_14_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:94de6015b071a4de07754007a639c92a62d94046a025359225e936dcb362950c +size 150540 diff --git a/checkpoint-1630/global_step1630/zero_pp_rank_15_mp_rank_00_model_states.pt b/checkpoint-1630/global_step1630/zero_pp_rank_15_mp_rank_00_model_states.pt new file mode 100644 index 0000000..76bfa5b --- /dev/null +++ b/checkpoint-1630/global_step1630/zero_pp_rank_15_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:bc643726424c61753779b64ec836f54d53bc3e54c14a897e082cbd4cc1ac39cc +size 150540 diff --git a/checkpoint-1630/global_step1630/zero_pp_rank_16_mp_rank_00_model_states.pt b/checkpoint-1630/global_step1630/zero_pp_rank_16_mp_rank_00_model_states.pt new file mode 100644 index 0000000..3fe6b8d --- /dev/null +++ b/checkpoint-1630/global_step1630/zero_pp_rank_16_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:45d822837deac3b5b69558d5eb8bf16f733c248644913ba5d1387dfcdbb246e2 +size 150540 diff --git a/checkpoint-1630/global_step1630/zero_pp_rank_17_mp_rank_00_model_states.pt b/checkpoint-1630/global_step1630/zero_pp_rank_17_mp_rank_00_model_states.pt new file mode 100644 index 0000000..141ff82 --- /dev/null +++ b/checkpoint-1630/global_step1630/zero_pp_rank_17_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d83791ff8b0cc02d65fd9e6c0250fee80c813bfa93bc74440d0d9546b742e731 +size 150540 diff --git a/checkpoint-1630/global_step1630/zero_pp_rank_18_mp_rank_00_model_states.pt b/checkpoint-1630/global_step1630/zero_pp_rank_18_mp_rank_00_model_states.pt new file mode 100644 index 0000000..67fbf8e --- /dev/null +++ b/checkpoint-1630/global_step1630/zero_pp_rank_18_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c1ad648ff2f6632d194310cd590612a34dcee5ae59afc2705330de48f48818fa +size 150540 diff --git a/checkpoint-1630/global_step1630/zero_pp_rank_19_mp_rank_00_model_states.pt b/checkpoint-1630/global_step1630/zero_pp_rank_19_mp_rank_00_model_states.pt new file mode 100644 index 0000000..c8ebd46 --- /dev/null +++ b/checkpoint-1630/global_step1630/zero_pp_rank_19_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c5afb79ef6850bc18a5d736840c68a776e930087b38321ffc62455c3ca324957 +size 150540 diff --git a/checkpoint-1630/global_step1630/zero_pp_rank_1_mp_rank_00_model_states.pt b/checkpoint-1630/global_step1630/zero_pp_rank_1_mp_rank_00_model_states.pt new file mode 100644 index 0000000..45d83f1 --- /dev/null +++ b/checkpoint-1630/global_step1630/zero_pp_rank_1_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:31aa88b36939fbb7eb1353cfb81e6285e052452a3be3f5322a5898606ab6f099 +size 150245 diff --git a/checkpoint-1630/global_step1630/zero_pp_rank_20_mp_rank_00_model_states.pt b/checkpoint-1630/global_step1630/zero_pp_rank_20_mp_rank_00_model_states.pt new file mode 100644 index 0000000..a46f0f7 --- /dev/null +++ b/checkpoint-1630/global_step1630/zero_pp_rank_20_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:f78a8d21611157ba84d8e933650e4314450e598ef9390e2ef140ffbaebcbb413 +size 150540 diff --git a/checkpoint-1630/global_step1630/zero_pp_rank_21_mp_rank_00_model_states.pt b/checkpoint-1630/global_step1630/zero_pp_rank_21_mp_rank_00_model_states.pt new file mode 100644 index 0000000..7784a83 --- /dev/null +++ b/checkpoint-1630/global_step1630/zero_pp_rank_21_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:dbd5d9d4ba33afd5b8681d99f7b557498a6bc34b1cf469cd6fdfad70ef3ba462 +size 150540 diff --git a/checkpoint-1630/global_step1630/zero_pp_rank_22_mp_rank_00_model_states.pt b/checkpoint-1630/global_step1630/zero_pp_rank_22_mp_rank_00_model_states.pt new file mode 100644 index 0000000..5bf2872 --- /dev/null +++ b/checkpoint-1630/global_step1630/zero_pp_rank_22_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ce1032af673079a83985ef1e3221449808e2e402a401e80878f19ebdefc1fb91 +size 150540 diff --git a/checkpoint-1630/global_step1630/zero_pp_rank_23_mp_rank_00_model_states.pt b/checkpoint-1630/global_step1630/zero_pp_rank_23_mp_rank_00_model_states.pt new file mode 100644 index 0000000..458fd3e --- /dev/null +++ b/checkpoint-1630/global_step1630/zero_pp_rank_23_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:93c819f2b87b13c7d0365314a8793830cbc3537fce028f88a23171c0a8d139d3 +size 150540 diff --git a/checkpoint-1630/global_step1630/zero_pp_rank_24_mp_rank_00_model_states.pt b/checkpoint-1630/global_step1630/zero_pp_rank_24_mp_rank_00_model_states.pt new file mode 100644 index 0000000..fbce9f2 --- /dev/null +++ b/checkpoint-1630/global_step1630/zero_pp_rank_24_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c15e8195851401da7054ba176dee771b7dace27c96d02c3563ed4787041a24c0 +size 150540 diff --git a/checkpoint-1630/global_step1630/zero_pp_rank_25_mp_rank_00_model_states.pt b/checkpoint-1630/global_step1630/zero_pp_rank_25_mp_rank_00_model_states.pt new file mode 100644 index 0000000..ecf2083 --- /dev/null +++ b/checkpoint-1630/global_step1630/zero_pp_rank_25_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d4812cff1c52c194835de7c60b4db6ed5af2c99a3eebf7e1e36a50487b485500 +size 150540 diff --git a/checkpoint-1630/global_step1630/zero_pp_rank_26_mp_rank_00_model_states.pt b/checkpoint-1630/global_step1630/zero_pp_rank_26_mp_rank_00_model_states.pt new file mode 100644 index 0000000..89980fc --- /dev/null +++ b/checkpoint-1630/global_step1630/zero_pp_rank_26_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:1bbdcfe71f050b662d5f093662a16b6fbc07cb1581a11a143e442e34d69d6773 +size 150540 diff --git a/checkpoint-1630/global_step1630/zero_pp_rank_27_mp_rank_00_model_states.pt b/checkpoint-1630/global_step1630/zero_pp_rank_27_mp_rank_00_model_states.pt new file mode 100644 index 0000000..4fd1656 --- /dev/null +++ b/checkpoint-1630/global_step1630/zero_pp_rank_27_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3fc965279bf3f1fc656157fe0f3a6ae7d7eff93f4ae7191e81aeb950509b5028 +size 150540 diff --git a/checkpoint-1630/global_step1630/zero_pp_rank_28_mp_rank_00_model_states.pt b/checkpoint-1630/global_step1630/zero_pp_rank_28_mp_rank_00_model_states.pt new file mode 100644 index 0000000..6fbaaa7 --- /dev/null +++ b/checkpoint-1630/global_step1630/zero_pp_rank_28_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:11fccd0874abe40f5a9c85f018dd6e8fe275cf1ce335e18aa18d328dfcdafe6c +size 150540 diff --git a/checkpoint-1630/global_step1630/zero_pp_rank_29_mp_rank_00_model_states.pt b/checkpoint-1630/global_step1630/zero_pp_rank_29_mp_rank_00_model_states.pt new file mode 100644 index 0000000..d616878 --- /dev/null +++ b/checkpoint-1630/global_step1630/zero_pp_rank_29_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d078fc60c854c4f513f1bae8c532e41f3ee95fa8a1627dc892bb71f7eed7b07e +size 150540 diff --git a/checkpoint-1630/global_step1630/zero_pp_rank_2_mp_rank_00_model_states.pt b/checkpoint-1630/global_step1630/zero_pp_rank_2_mp_rank_00_model_states.pt new file mode 100644 index 0000000..bdd2801 --- /dev/null +++ b/checkpoint-1630/global_step1630/zero_pp_rank_2_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4c7765bdf55f1a5a1c6e3f10b1fab6afd8bfe9882aa502f584ecb39326329cd5 +size 150245 diff --git a/checkpoint-1630/global_step1630/zero_pp_rank_30_mp_rank_00_model_states.pt b/checkpoint-1630/global_step1630/zero_pp_rank_30_mp_rank_00_model_states.pt new file mode 100644 index 0000000..86eb18a --- /dev/null +++ b/checkpoint-1630/global_step1630/zero_pp_rank_30_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:cd4fc4625ba7ba5d268581dcd1621b8fad50e98dc1cb0a51ee2d310cf38180f9 +size 150540 diff --git a/checkpoint-1630/global_step1630/zero_pp_rank_31_mp_rank_00_model_states.pt b/checkpoint-1630/global_step1630/zero_pp_rank_31_mp_rank_00_model_states.pt new file mode 100644 index 0000000..2550b22 --- /dev/null +++ b/checkpoint-1630/global_step1630/zero_pp_rank_31_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7e9dac2bfd65cf28544ef2c368df6588cb38a0e2aea7ca7309e34803e309a869 +size 150540 diff --git a/checkpoint-1630/global_step1630/zero_pp_rank_3_mp_rank_00_model_states.pt b/checkpoint-1630/global_step1630/zero_pp_rank_3_mp_rank_00_model_states.pt new file mode 100644 index 0000000..5ddc7c4 --- /dev/null +++ b/checkpoint-1630/global_step1630/zero_pp_rank_3_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:cecb7ce13aae08d3535fed9bc97e11d0a139c2209edf77f3efb1dce2a347b76f +size 150245 diff --git a/checkpoint-1630/global_step1630/zero_pp_rank_4_mp_rank_00_model_states.pt b/checkpoint-1630/global_step1630/zero_pp_rank_4_mp_rank_00_model_states.pt new file mode 100644 index 0000000..d4c6a9b --- /dev/null +++ b/checkpoint-1630/global_step1630/zero_pp_rank_4_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d4d1df2d1673f71716cd32eac2fdfeeb293b87695c982654cd52881de39b8609 +size 150245 diff --git a/checkpoint-1630/global_step1630/zero_pp_rank_5_mp_rank_00_model_states.pt b/checkpoint-1630/global_step1630/zero_pp_rank_5_mp_rank_00_model_states.pt new file mode 100644 index 0000000..a04e871 --- /dev/null +++ b/checkpoint-1630/global_step1630/zero_pp_rank_5_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4097f82f363f57deca37fc2e94f9db9595a0d3fbff7471e6db2e4996247ea34e +size 150245 diff --git a/checkpoint-1630/global_step1630/zero_pp_rank_6_mp_rank_00_model_states.pt b/checkpoint-1630/global_step1630/zero_pp_rank_6_mp_rank_00_model_states.pt new file mode 100644 index 0000000..0a82596 --- /dev/null +++ b/checkpoint-1630/global_step1630/zero_pp_rank_6_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:8804c594d8aa48eae8a689acf3aa847a2780956548a12706e750c60449febabd +size 150245 diff --git a/checkpoint-1630/global_step1630/zero_pp_rank_7_mp_rank_00_model_states.pt b/checkpoint-1630/global_step1630/zero_pp_rank_7_mp_rank_00_model_states.pt new file mode 100644 index 0000000..98edf43 --- /dev/null +++ b/checkpoint-1630/global_step1630/zero_pp_rank_7_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:9be01bda51e54d84107f28aad68934ece7bc9243d22f37bca36d70d5a687c306 +size 150245 diff --git a/checkpoint-1630/global_step1630/zero_pp_rank_8_mp_rank_00_model_states.pt b/checkpoint-1630/global_step1630/zero_pp_rank_8_mp_rank_00_model_states.pt new file mode 100644 index 0000000..44dc7c4 --- /dev/null +++ b/checkpoint-1630/global_step1630/zero_pp_rank_8_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:965dc1bd2b8bc46f0492c744ea8d80fe74acc33c0a82031d484658924a9188c5 +size 150245 diff --git a/checkpoint-1630/global_step1630/zero_pp_rank_9_mp_rank_00_model_states.pt b/checkpoint-1630/global_step1630/zero_pp_rank_9_mp_rank_00_model_states.pt new file mode 100644 index 0000000..aba92fd --- /dev/null +++ b/checkpoint-1630/global_step1630/zero_pp_rank_9_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:98208579a411498d49a4075e894283e5b951eee51cec29ca8f3c6dd17dac132c +size 150245 diff --git a/checkpoint-1630/latest b/checkpoint-1630/latest new file mode 100644 index 0000000..b876efb --- /dev/null +++ b/checkpoint-1630/latest @@ -0,0 +1 @@ +global_step1630 \ No newline at end of file diff --git a/checkpoint-1630/model-00001-of-00004.safetensors b/checkpoint-1630/model-00001-of-00004.safetensors new file mode 100644 index 0000000..9b2fd72 --- /dev/null +++ b/checkpoint-1630/model-00001-of-00004.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:f0b63f07011cfe5c819592278b61ba275e39676be07d31da9b51d5b0e8e7657a +size 4976698672 diff --git a/checkpoint-1630/model-00002-of-00004.safetensors b/checkpoint-1630/model-00002-of-00004.safetensors new file mode 100644 index 0000000..91dd2e6 --- /dev/null +++ b/checkpoint-1630/model-00002-of-00004.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:83d06d47409ca433080d3701201090a57ecce7c37d74dc4ee5bbae82f8350ba0 +size 4999802720 diff --git a/checkpoint-1630/model-00003-of-00004.safetensors b/checkpoint-1630/model-00003-of-00004.safetensors new file mode 100644 index 0000000..0052931 --- /dev/null +++ b/checkpoint-1630/model-00003-of-00004.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:61166c7b410e58a2245c06c45ac00eee71ba25d408431c75cf724ed8d49fe294 +size 4915916176 diff --git a/checkpoint-1630/model-00004-of-00004.safetensors b/checkpoint-1630/model-00004-of-00004.safetensors new file mode 100644 index 0000000..cf6a66f --- /dev/null +++ b/checkpoint-1630/model-00004-of-00004.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:cee6a64f5272c8c97d8db51f0e6d267ddf1d3abf1f7f3e2a7cd29dc414ea5807 +size 1168138808 diff --git a/checkpoint-1630/model.safetensors.index.json b/checkpoint-1630/model.safetensors.index.json new file mode 100644 index 0000000..0fd8120 --- /dev/null +++ b/checkpoint-1630/model.safetensors.index.json @@ -0,0 +1,298 @@ +{ + "metadata": { + "total_size": 16060522496 + }, + "weight_map": { + "lm_head.weight": "model-00004-of-00004.safetensors", + "model.embed_tokens.weight": "model-00001-of-00004.safetensors", + "model.layers.0.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.0.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.0.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.0.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.0.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.0.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.0.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.0.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.0.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.1.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.1.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.1.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.1.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.1.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.1.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.1.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.1.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.1.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.10.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.10.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.10.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.10.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.10.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.10.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.10.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.10.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.10.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.11.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.11.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.11.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.11.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.11.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.11.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.11.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.11.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.11.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.12.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.12.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.12.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.12.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.12.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.12.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.12.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.12.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.12.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.13.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.13.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.13.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.13.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.13.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.13.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.13.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.13.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.13.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.14.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.14.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.14.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.14.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.14.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.14.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.14.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.14.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.14.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.15.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.15.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.15.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.15.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.15.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.15.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.15.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.15.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.15.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.16.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.16.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.16.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.16.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.16.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.16.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.16.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.16.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.16.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.17.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.17.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.17.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.17.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.17.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.17.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.17.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.17.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.17.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.18.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.18.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.18.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.18.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.18.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.18.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.18.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.18.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.18.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.19.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.19.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.19.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.19.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.19.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.19.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.19.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.19.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.19.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.2.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.2.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.2.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.2.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.2.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.2.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.2.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.2.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.2.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.20.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.20.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.20.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.20.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.20.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.20.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.20.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.20.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.20.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.21.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.21.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.21.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.21.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.21.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.21.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.21.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.21.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.21.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.22.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.22.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.22.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.22.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.22.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.22.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.22.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.22.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.22.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.23.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.23.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.23.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.23.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.23.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.23.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.23.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.23.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.23.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.24.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.24.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.24.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.24.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.24.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.24.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.24.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.24.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.24.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.25.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.25.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.25.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.25.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.25.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.25.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.25.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.25.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.25.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.26.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.26.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.26.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.26.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.26.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.26.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.26.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.26.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.26.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.27.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.27.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.27.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.27.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.27.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.27.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.27.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.27.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.27.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.28.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.28.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.28.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.28.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.28.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.28.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.28.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.28.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.28.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.29.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.29.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.29.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.29.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.29.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.29.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.29.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.29.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.29.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.3.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.3.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.3.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.3.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.3.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.3.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.3.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.3.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.3.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.30.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.30.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.30.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.30.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.30.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.30.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.30.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.30.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.30.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.31.input_layernorm.weight": "model-00004-of-00004.safetensors", + "model.layers.31.mlp.down_proj.weight": "model-00004-of-00004.safetensors", + "model.layers.31.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.31.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.31.post_attention_layernorm.weight": "model-00004-of-00004.safetensors", + "model.layers.31.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.31.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.31.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.31.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.4.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.4.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.4.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.4.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.4.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.4.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.4.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.4.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.4.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.5.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.5.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.5.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.5.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.5.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.5.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.5.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.5.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.5.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.6.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.6.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.6.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.6.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.6.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.6.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.6.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.6.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.6.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.7.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.7.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.7.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.7.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.7.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.7.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.7.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.7.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.7.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.8.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.8.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.8.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.8.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.8.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.8.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.8.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.8.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.8.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.9.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.9.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.9.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.9.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.9.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.9.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.9.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.9.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.9.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.norm.weight": "model-00004-of-00004.safetensors" + } +} diff --git a/checkpoint-1630/rng_state_0.pth b/checkpoint-1630/rng_state_0.pth new file mode 100644 index 0000000..b346349 --- /dev/null +++ b/checkpoint-1630/rng_state_0.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ad8a35afd8967cbb748405387e44426e43ad127028e826eddc9b67d2ca873c85 +size 15984 diff --git a/checkpoint-1630/rng_state_1.pth b/checkpoint-1630/rng_state_1.pth new file mode 100644 index 0000000..68f3c69 --- /dev/null +++ b/checkpoint-1630/rng_state_1.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:f338ce80d7c441076bfc8c53b84067a0181f5a14e80c13d5acb8150b659f4d73 +size 15984 diff --git a/checkpoint-1630/rng_state_10.pth b/checkpoint-1630/rng_state_10.pth new file mode 100644 index 0000000..09612af --- /dev/null +++ b/checkpoint-1630/rng_state_10.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4d4c67c1d0ec6b889370f634ff29f584f829acaeaf69196a69304fdba936f9d7 +size 15997 diff --git a/checkpoint-1630/rng_state_11.pth b/checkpoint-1630/rng_state_11.pth new file mode 100644 index 0000000..06a46cd --- /dev/null +++ b/checkpoint-1630/rng_state_11.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:afd0c4e2ac5f61d5f4df5d9d5783018b7937173b4afdbb92816c2668982cb351 +size 15997 diff --git a/checkpoint-1630/rng_state_12.pth b/checkpoint-1630/rng_state_12.pth new file mode 100644 index 0000000..bf6f992 --- /dev/null +++ b/checkpoint-1630/rng_state_12.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:a9d1c7f561c5512193e8053ecf371e4fef647a8503481f2dad76332ddbe164fd +size 15997 diff --git a/checkpoint-1630/rng_state_13.pth b/checkpoint-1630/rng_state_13.pth new file mode 100644 index 0000000..eac9c7f --- /dev/null +++ b/checkpoint-1630/rng_state_13.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7604a3cfaf0e3c3f2aa2b3547660615db82205d4158951bb90f69ffc560ed179 +size 15997 diff --git a/checkpoint-1630/rng_state_14.pth b/checkpoint-1630/rng_state_14.pth new file mode 100644 index 0000000..29fb251 --- /dev/null +++ b/checkpoint-1630/rng_state_14.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4d984186a3bc06445d6c077fcbf64da96d47d3ed704e68f0212045efb4b91dbb +size 15997 diff --git a/checkpoint-1630/rng_state_15.pth b/checkpoint-1630/rng_state_15.pth new file mode 100644 index 0000000..0bf361b --- /dev/null +++ b/checkpoint-1630/rng_state_15.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:1b3945ba3535361fa13a8460a70ebbd44ece2514a1c9dcb76abfe6f54a775c60 +size 15997 diff --git a/checkpoint-1630/rng_state_16.pth b/checkpoint-1630/rng_state_16.pth new file mode 100644 index 0000000..0e7adea --- /dev/null +++ b/checkpoint-1630/rng_state_16.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:853a02543fd3223edd9334ea75c62e6e99ded22ac864e9930fbf5add26045fe7 +size 15997 diff --git a/checkpoint-1630/rng_state_17.pth b/checkpoint-1630/rng_state_17.pth new file mode 100644 index 0000000..18e8350 --- /dev/null +++ b/checkpoint-1630/rng_state_17.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:9c0420ad6cf62c9fe9cda1807f68e8e40235a8917dbab858f800d24e3ba8eeae +size 15997 diff --git a/checkpoint-1630/rng_state_18.pth b/checkpoint-1630/rng_state_18.pth new file mode 100644 index 0000000..9b6c223 --- /dev/null +++ b/checkpoint-1630/rng_state_18.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e167524b369e20a3a17ee7f6124322da680ccf2ae553b4adc0e7462d2dfba82b +size 15997 diff --git a/checkpoint-1630/rng_state_19.pth b/checkpoint-1630/rng_state_19.pth new file mode 100644 index 0000000..b0d318f --- /dev/null +++ b/checkpoint-1630/rng_state_19.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:a0915a78eba7c1d2768ecd03818e3c01afd7f3168a3318b1212413bd2c62f7f1 +size 15997 diff --git a/checkpoint-1630/rng_state_2.pth b/checkpoint-1630/rng_state_2.pth new file mode 100644 index 0000000..be044f6 --- /dev/null +++ b/checkpoint-1630/rng_state_2.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c9fbc9fa428939be10b46779f0eb5cd833e0da426b1cbdee77b3a55b6952235b +size 15984 diff --git a/checkpoint-1630/rng_state_20.pth b/checkpoint-1630/rng_state_20.pth new file mode 100644 index 0000000..ece204f --- /dev/null +++ b/checkpoint-1630/rng_state_20.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:8f8f2fdb90584ebb7247c85570082ac7c6338216de82b07f132a2c679923379a +size 15997 diff --git a/checkpoint-1630/rng_state_21.pth b/checkpoint-1630/rng_state_21.pth new file mode 100644 index 0000000..5b62c48 --- /dev/null +++ b/checkpoint-1630/rng_state_21.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7a3863ac6512e946a826d479520004385d29f3fd0a2b686ccbfdf488332aa442 +size 15997 diff --git a/checkpoint-1630/rng_state_22.pth b/checkpoint-1630/rng_state_22.pth new file mode 100644 index 0000000..b0fa34f --- /dev/null +++ b/checkpoint-1630/rng_state_22.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:1dfe94fb47194a2a298bed1b33ad18c2132747148814886bd9b8910a7691ba0b +size 15997 diff --git a/checkpoint-1630/rng_state_23.pth b/checkpoint-1630/rng_state_23.pth new file mode 100644 index 0000000..c7c7ed4 --- /dev/null +++ b/checkpoint-1630/rng_state_23.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c683c09c8883037948fabb143cd972207db3cee22d7efcbcc5866a8ec85c94c6 +size 15997 diff --git a/checkpoint-1630/rng_state_24.pth b/checkpoint-1630/rng_state_24.pth new file mode 100644 index 0000000..be36a1a --- /dev/null +++ b/checkpoint-1630/rng_state_24.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:53c201c89debf1ca694786330ea98ca69da6340ac3b70f40aad77213d1771bf8 +size 15997 diff --git a/checkpoint-1630/rng_state_25.pth b/checkpoint-1630/rng_state_25.pth new file mode 100644 index 0000000..b34b54b --- /dev/null +++ b/checkpoint-1630/rng_state_25.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b7b8393dc10fb6ab2222179b268184fa5330fd417b66ebb65986818f47334a55 +size 15997 diff --git a/checkpoint-1630/rng_state_26.pth b/checkpoint-1630/rng_state_26.pth new file mode 100644 index 0000000..354820a --- /dev/null +++ b/checkpoint-1630/rng_state_26.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6b29094f6dcc92be7d58da39df551c573728836c5aec67bef90790810c0d3882 +size 15997 diff --git a/checkpoint-1630/rng_state_27.pth b/checkpoint-1630/rng_state_27.pth new file mode 100644 index 0000000..747b806 --- /dev/null +++ b/checkpoint-1630/rng_state_27.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b64ff98dfb30bbfa08760a0a79d9be7407917ff0e32f22b03d6528bf7e292e44 +size 15997 diff --git a/checkpoint-1630/rng_state_28.pth b/checkpoint-1630/rng_state_28.pth new file mode 100644 index 0000000..b316dea --- /dev/null +++ b/checkpoint-1630/rng_state_28.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:04e19d4d07b899c9158590672b9acc125c3fb4082f5aed08ddaee573b4dbf33f +size 15997 diff --git a/checkpoint-1630/rng_state_29.pth b/checkpoint-1630/rng_state_29.pth new file mode 100644 index 0000000..7b0fc3c --- /dev/null +++ b/checkpoint-1630/rng_state_29.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:47a620c2380d984b51262d8f8d1853631c1bd13c3da4ea8f73e8dc61dd3fb765 +size 15997 diff --git a/checkpoint-1630/rng_state_3.pth b/checkpoint-1630/rng_state_3.pth new file mode 100644 index 0000000..fc82524 --- /dev/null +++ b/checkpoint-1630/rng_state_3.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ac55dba0b79d5fa4699d239da2f966d52040d576d31234ac8d4632e6956481bc +size 15984 diff --git a/checkpoint-1630/rng_state_30.pth b/checkpoint-1630/rng_state_30.pth new file mode 100644 index 0000000..f88acd7 --- /dev/null +++ b/checkpoint-1630/rng_state_30.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:1516e58b9c7537b0c41d41487bc1464770e53c3dabdb8cf4f5c07bcc51e07ed6 +size 15997 diff --git a/checkpoint-1630/rng_state_31.pth b/checkpoint-1630/rng_state_31.pth new file mode 100644 index 0000000..4e033f4 --- /dev/null +++ b/checkpoint-1630/rng_state_31.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:58a50bef57066132c2e5b6b53fbb78e101505dd4ad585ec52fb3c11ca0663c22 +size 15997 diff --git a/checkpoint-1630/rng_state_4.pth b/checkpoint-1630/rng_state_4.pth new file mode 100644 index 0000000..d30f52a --- /dev/null +++ b/checkpoint-1630/rng_state_4.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:af2d0c015100768ffa23faf3b6c2d54ea89eb045603e30e55cd211e06ff34972 +size 15984 diff --git a/checkpoint-1630/rng_state_5.pth b/checkpoint-1630/rng_state_5.pth new file mode 100644 index 0000000..c8715d2 --- /dev/null +++ b/checkpoint-1630/rng_state_5.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c60a1b40608e34bc801c8231f97b81c53b5290dfaed1b9cd0ccbeca29574a991 +size 15984 diff --git a/checkpoint-1630/rng_state_6.pth b/checkpoint-1630/rng_state_6.pth new file mode 100644 index 0000000..1ed791b --- /dev/null +++ b/checkpoint-1630/rng_state_6.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3ad6a142a403eb9aafc4a3a9a856bca648fe31fd22d796867baca31fb13656aa +size 15984 diff --git a/checkpoint-1630/rng_state_7.pth b/checkpoint-1630/rng_state_7.pth new file mode 100644 index 0000000..800c3bb --- /dev/null +++ b/checkpoint-1630/rng_state_7.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:38bc23a138cc800b22881742c0f3f9a71731a9a7111c6058a0077e6274d21773 +size 15984 diff --git a/checkpoint-1630/rng_state_8.pth b/checkpoint-1630/rng_state_8.pth new file mode 100644 index 0000000..d7068b4 --- /dev/null +++ b/checkpoint-1630/rng_state_8.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:f4b75777b43df70dca87f91deed2e613941188792f244d5eeb06da8ab038bd36 +size 15984 diff --git a/checkpoint-1630/rng_state_9.pth b/checkpoint-1630/rng_state_9.pth new file mode 100644 index 0000000..d42657d --- /dev/null +++ b/checkpoint-1630/rng_state_9.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:a8f9eb93d0ac349ba8b2271c417e5fcc4b70447a424f3f861c3338fbd99a48f4 +size 15984 diff --git a/checkpoint-1630/scheduler.pt b/checkpoint-1630/scheduler.pt new file mode 100644 index 0000000..111daa7 --- /dev/null +++ b/checkpoint-1630/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4535ce28da69eb0d38ad4108743df3cfe45ad39ddf1ead950f99ab23cde7410d +size 1064 diff --git a/checkpoint-1630/special_tokens_map.json b/checkpoint-1630/special_tokens_map.json new file mode 100644 index 0000000..278b7f0 --- /dev/null +++ b/checkpoint-1630/special_tokens_map.json @@ -0,0 +1,23 @@ +{ + "bos_token": { + "content": "<|begin_of_text|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false + }, + "eos_token": { + "content": "<|eot_id|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false + }, + "pad_token": { + "content": "<|end_of_text|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false + } +} diff --git a/checkpoint-1630/tokenizer.json b/checkpoint-1630/tokenizer.json new file mode 100644 index 0000000..1c1d8d5 --- /dev/null +++ b/checkpoint-1630/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6b9e4e7fb171f92fd137b777cc2714bf87d11576700a1dcd7a399e7bbe39537b +size 17209920 diff --git a/checkpoint-1630/tokenizer_config.json b/checkpoint-1630/tokenizer_config.json new file mode 100644 index 0000000..8098161 --- /dev/null +++ b/checkpoint-1630/tokenizer_config.json @@ -0,0 +1,2064 @@ +{ + "added_tokens_decoder": { + "128000": { + "content": "<|begin_of_text|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128001": { + "content": "<|end_of_text|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128002": { + "content": "<|reserved_special_token_0|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128003": { + "content": "<|reserved_special_token_1|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128004": { + "content": "<|finetune_right_pad_id|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128005": { + "content": "<|reserved_special_token_2|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128006": { + "content": "<|start_header_id|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128007": { + "content": "<|end_header_id|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128008": { + "content": "<|eom_id|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128009": { + "content": "<|eot_id|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128010": { + "content": "<|python_tag|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128011": { + "content": "<|reserved_special_token_3|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128012": { + "content": "<|reserved_special_token_4|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128013": { + "content": "<|reserved_special_token_5|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128014": { + "content": "<|reserved_special_token_6|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128015": { + "content": "<|reserved_special_token_7|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128016": { + "content": "<|reserved_special_token_8|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128017": { + "content": "<|reserved_special_token_9|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128018": { + "content": "<|reserved_special_token_10|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128019": { + "content": "<|reserved_special_token_11|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128020": { + "content": "<|reserved_special_token_12|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128021": { + "content": "<|reserved_special_token_13|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128022": { + "content": "<|reserved_special_token_14|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128023": { + "content": "<|reserved_special_token_15|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128024": { + "content": "<|reserved_special_token_16|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128025": { + "content": "<|reserved_special_token_17|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128026": { + "content": "<|reserved_special_token_18|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128027": { + "content": "<|reserved_special_token_19|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128028": { + "content": "<|reserved_special_token_20|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128029": { + "content": "<|reserved_special_token_21|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128030": { + "content": "<|reserved_special_token_22|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128031": { + "content": "<|reserved_special_token_23|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128032": { + "content": "<|reserved_special_token_24|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128033": { + "content": "<|reserved_special_token_25|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128034": { + "content": "<|reserved_special_token_26|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128035": { + "content": "<|reserved_special_token_27|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128036": { + "content": "<|reserved_special_token_28|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128037": { + "content": "<|reserved_special_token_29|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128038": { + "content": "<|reserved_special_token_30|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128039": { + "content": "<|reserved_special_token_31|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128040": { + "content": "<|reserved_special_token_32|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128041": { + "content": "<|reserved_special_token_33|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128042": { + "content": "<|reserved_special_token_34|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128043": { + "content": "<|reserved_special_token_35|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128044": { + "content": "<|reserved_special_token_36|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128045": { + "content": "<|reserved_special_token_37|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128046": { + "content": "<|reserved_special_token_38|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128047": { + "content": "<|reserved_special_token_39|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128048": { + "content": "<|reserved_special_token_40|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128049": { + "content": "<|reserved_special_token_41|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128050": { + "content": "<|reserved_special_token_42|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128051": { + "content": "<|reserved_special_token_43|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128052": { + "content": "<|reserved_special_token_44|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128053": { + "content": "<|reserved_special_token_45|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128054": { + "content": "<|reserved_special_token_46|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128055": { + "content": "<|reserved_special_token_47|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128056": { + "content": "<|reserved_special_token_48|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128057": { + "content": "<|reserved_special_token_49|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128058": { + "content": "<|reserved_special_token_50|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128059": { + "content": "<|reserved_special_token_51|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128060": { + "content": "<|reserved_special_token_52|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128061": { + "content": "<|reserved_special_token_53|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128062": { + "content": "<|reserved_special_token_54|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128063": { + "content": "<|reserved_special_token_55|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128064": { + "content": "<|reserved_special_token_56|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128065": { + "content": "<|reserved_special_token_57|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128066": { + "content": "<|reserved_special_token_58|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128067": { + "content": "<|reserved_special_token_59|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128068": { + "content": "<|reserved_special_token_60|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128069": { + "content": "<|reserved_special_token_61|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128070": { + "content": "<|reserved_special_token_62|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128071": { + "content": "<|reserved_special_token_63|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128072": { + "content": "<|reserved_special_token_64|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128073": { + "content": "<|reserved_special_token_65|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128074": { + "content": "<|reserved_special_token_66|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128075": { + "content": "<|reserved_special_token_67|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128076": { + "content": "<|reserved_special_token_68|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128077": { + "content": "<|reserved_special_token_69|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128078": { + "content": "<|reserved_special_token_70|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128079": { + "content": "<|reserved_special_token_71|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128080": { + "content": "<|reserved_special_token_72|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128081": { + "content": "<|reserved_special_token_73|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128082": { + "content": "<|reserved_special_token_74|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128083": { + "content": "<|reserved_special_token_75|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128084": { + "content": "<|reserved_special_token_76|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128085": { + "content": "<|reserved_special_token_77|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128086": { + "content": "<|reserved_special_token_78|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128087": { + "content": "<|reserved_special_token_79|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128088": { + "content": "<|reserved_special_token_80|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128089": { + "content": "<|reserved_special_token_81|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128090": { + "content": "<|reserved_special_token_82|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128091": { + "content": "<|reserved_special_token_83|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128092": { + "content": "<|reserved_special_token_84|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128093": { + "content": "<|reserved_special_token_85|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128094": { + "content": "<|reserved_special_token_86|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128095": { + "content": "<|reserved_special_token_87|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128096": { + "content": "<|reserved_special_token_88|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128097": { + "content": "<|reserved_special_token_89|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128098": { + "content": "<|reserved_special_token_90|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128099": { + "content": "<|reserved_special_token_91|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128100": { + "content": "<|reserved_special_token_92|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128101": { + "content": "<|reserved_special_token_93|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128102": { + "content": "<|reserved_special_token_94|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128103": { + "content": "<|reserved_special_token_95|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128104": { + "content": "<|reserved_special_token_96|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128105": { + "content": "<|reserved_special_token_97|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128106": { + "content": "<|reserved_special_token_98|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128107": { + "content": "<|reserved_special_token_99|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128108": { + "content": "<|reserved_special_token_100|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128109": { + "content": "<|reserved_special_token_101|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128110": { + "content": "<|reserved_special_token_102|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128111": { + "content": "<|reserved_special_token_103|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128112": { + "content": "<|reserved_special_token_104|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128113": { + "content": "<|reserved_special_token_105|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128114": { + "content": "<|reserved_special_token_106|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128115": { + "content": "<|reserved_special_token_107|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128116": { + "content": "<|reserved_special_token_108|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128117": { + "content": "<|reserved_special_token_109|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128118": { + "content": "<|reserved_special_token_110|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128119": { + "content": "<|reserved_special_token_111|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128120": { + "content": "<|reserved_special_token_112|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128121": { + "content": "<|reserved_special_token_113|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128122": { + "content": "<|reserved_special_token_114|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128123": { + "content": "<|reserved_special_token_115|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128124": { + "content": "<|reserved_special_token_116|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128125": { + "content": "<|reserved_special_token_117|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128126": { + "content": "<|reserved_special_token_118|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128127": { + "content": "<|reserved_special_token_119|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128128": { + "content": "<|reserved_special_token_120|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128129": { + "content": "<|reserved_special_token_121|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128130": { + "content": "<|reserved_special_token_122|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128131": { + "content": "<|reserved_special_token_123|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128132": { + "content": "<|reserved_special_token_124|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128133": { + "content": "<|reserved_special_token_125|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128134": { + "content": "<|reserved_special_token_126|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128135": { + "content": "<|reserved_special_token_127|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128136": { + "content": "<|reserved_special_token_128|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128137": { + "content": "<|reserved_special_token_129|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128138": { + "content": "<|reserved_special_token_130|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128139": { + "content": "<|reserved_special_token_131|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128140": { + "content": "<|reserved_special_token_132|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128141": { + "content": "<|reserved_special_token_133|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128142": { + "content": "<|reserved_special_token_134|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128143": { + "content": "<|reserved_special_token_135|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128144": { + "content": "<|reserved_special_token_136|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128145": { + "content": "<|reserved_special_token_137|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128146": { + "content": "<|reserved_special_token_138|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128147": { + "content": "<|reserved_special_token_139|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128148": { + "content": "<|reserved_special_token_140|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128149": { + "content": "<|reserved_special_token_141|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128150": { + "content": "<|reserved_special_token_142|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128151": { + "content": "<|reserved_special_token_143|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128152": { + "content": "<|reserved_special_token_144|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128153": { + "content": "<|reserved_special_token_145|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128154": { + "content": "<|reserved_special_token_146|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128155": { + "content": "<|reserved_special_token_147|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128156": { + "content": "<|reserved_special_token_148|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128157": { + "content": "<|reserved_special_token_149|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128158": { + "content": "<|reserved_special_token_150|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128159": { + "content": "<|reserved_special_token_151|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128160": { + "content": "<|reserved_special_token_152|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128161": { + "content": "<|reserved_special_token_153|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128162": { + "content": "<|reserved_special_token_154|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128163": { + "content": "<|reserved_special_token_155|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128164": { + "content": "<|reserved_special_token_156|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128165": { + "content": "<|reserved_special_token_157|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128166": { + "content": "<|reserved_special_token_158|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128167": { + "content": "<|reserved_special_token_159|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128168": { + "content": "<|reserved_special_token_160|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128169": { + "content": "<|reserved_special_token_161|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128170": { + "content": "<|reserved_special_token_162|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128171": { + "content": "<|reserved_special_token_163|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128172": { + "content": "<|reserved_special_token_164|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128173": { + "content": "<|reserved_special_token_165|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128174": { + "content": "<|reserved_special_token_166|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128175": { + "content": "<|reserved_special_token_167|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128176": { + "content": "<|reserved_special_token_168|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128177": { + "content": "<|reserved_special_token_169|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128178": { + "content": "<|reserved_special_token_170|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128179": { + "content": "<|reserved_special_token_171|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128180": { + "content": "<|reserved_special_token_172|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128181": { + "content": "<|reserved_special_token_173|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128182": { + "content": "<|reserved_special_token_174|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128183": { + "content": "<|reserved_special_token_175|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128184": { + "content": "<|reserved_special_token_176|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128185": { + "content": "<|reserved_special_token_177|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128186": { + "content": "<|reserved_special_token_178|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128187": { + "content": "<|reserved_special_token_179|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128188": { + "content": "<|reserved_special_token_180|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128189": { + "content": "<|reserved_special_token_181|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128190": { + "content": "<|reserved_special_token_182|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128191": { + "content": "<|reserved_special_token_183|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128192": { + "content": "<|reserved_special_token_184|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128193": { + "content": "<|reserved_special_token_185|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128194": { + "content": "<|reserved_special_token_186|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128195": { + "content": "<|reserved_special_token_187|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128196": { + "content": "<|reserved_special_token_188|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128197": { + "content": "<|reserved_special_token_189|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128198": { + "content": "<|reserved_special_token_190|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128199": { + "content": "<|reserved_special_token_191|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128200": { + "content": "<|reserved_special_token_192|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128201": { + "content": "<|reserved_special_token_193|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128202": { + "content": "<|reserved_special_token_194|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128203": { + "content": "<|reserved_special_token_195|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128204": { + "content": "<|reserved_special_token_196|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128205": { + "content": "<|reserved_special_token_197|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128206": { + "content": "<|reserved_special_token_198|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128207": { + "content": "<|reserved_special_token_199|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128208": { + "content": "<|reserved_special_token_200|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128209": { + "content": "<|reserved_special_token_201|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128210": { + "content": "<|reserved_special_token_202|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128211": { + "content": "<|reserved_special_token_203|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128212": { + "content": "<|reserved_special_token_204|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128213": { + "content": "<|reserved_special_token_205|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128214": { + "content": "<|reserved_special_token_206|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128215": { + "content": "<|reserved_special_token_207|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128216": { + "content": "<|reserved_special_token_208|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128217": { + "content": "<|reserved_special_token_209|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128218": { + "content": "<|reserved_special_token_210|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128219": { + "content": "<|reserved_special_token_211|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128220": { + "content": "<|reserved_special_token_212|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128221": { + "content": "<|reserved_special_token_213|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128222": { + "content": "<|reserved_special_token_214|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128223": { + "content": "<|reserved_special_token_215|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128224": { + "content": "<|reserved_special_token_216|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128225": { + "content": "<|reserved_special_token_217|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128226": { + "content": "<|reserved_special_token_218|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128227": { + "content": "<|reserved_special_token_219|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128228": { + "content": "<|reserved_special_token_220|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128229": { + "content": "<|reserved_special_token_221|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128230": { + "content": "<|reserved_special_token_222|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128231": { + "content": "<|reserved_special_token_223|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128232": { + "content": "<|reserved_special_token_224|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128233": { + "content": "<|reserved_special_token_225|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128234": { + "content": "<|reserved_special_token_226|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128235": { + "content": "<|reserved_special_token_227|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128236": { + "content": "<|reserved_special_token_228|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128237": { + "content": "<|reserved_special_token_229|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128238": { + "content": "<|reserved_special_token_230|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128239": { + "content": "<|reserved_special_token_231|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128240": { + "content": "<|reserved_special_token_232|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128241": { + "content": "<|reserved_special_token_233|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128242": { + "content": "<|reserved_special_token_234|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128243": { + "content": "<|reserved_special_token_235|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128244": { + "content": "<|reserved_special_token_236|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128245": { + "content": "<|reserved_special_token_237|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128246": { + "content": "<|reserved_special_token_238|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128247": { + "content": "<|reserved_special_token_239|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128248": { + "content": "<|reserved_special_token_240|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128249": { + "content": "<|reserved_special_token_241|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128250": { + "content": "<|reserved_special_token_242|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128251": { + "content": "<|reserved_special_token_243|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128252": { + "content": "<|reserved_special_token_244|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128253": { + "content": "<|reserved_special_token_245|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128254": { + "content": "<|reserved_special_token_246|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128255": { + "content": "<|reserved_special_token_247|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + } + }, + "bos_token": "<|begin_of_text|>", + "chat_template": "{% if not add_generation_prompt is defined %}{% set add_generation_prompt = false %}{% endif %}{% set loop_messages = messages %}{% for message in loop_messages %}{% set content = '<|start_header_id|>' + message['role'] + '<|end_header_id|>\n\n'+ message['content'] | trim + '<|eot_id|>' %}{% if loop.index0 == 0 %}{% set content = bos_token + content %}{% endif %}{{ content }}{% endfor %}{% if add_generation_prompt %}{{ '<|start_header_id|>assistant<|end_header_id|>\n\n' }}{% endif %}", + "clean_up_tokenization_spaces": true, + "eos_token": "<|eot_id|>", + "extra_special_tokens": {}, + "model_input_names": [ + "input_ids", + "attention_mask" + ], + "model_max_length": 131072, + "pad_token": "<|end_of_text|>", + "tokenizer_class": "PreTrainedTokenizer" +} diff --git a/checkpoint-1630/trainer_state.json b/checkpoint-1630/trainer_state.json new file mode 100644 index 0000000..3b1aee2 --- /dev/null +++ b/checkpoint-1630/trainer_state.json @@ -0,0 +1,24484 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.0, + "eval_steps": 500, + "global_step": 1630, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.001226993865030675, + "grad_norm": 151.44113305401245, + "learning_rate": 2e-08, + "logits/chosen": -0.32421875, + "logits/rejected": -0.515625, + "logps/chosen": -474.0, + "logps/rejected": -316.0, + "loss": 0.6914, + "rewards/accuracies": 0.0, + "rewards/chosen": 0.0, + "rewards/margins": 0.0, + "rewards/rejected": 0.0, + "step": 1 + }, + { + "epoch": 0.00245398773006135, + "grad_norm": 162.5072043033413, + "learning_rate": 4e-08, + "logits/chosen": -0.22265625, + "logits/rejected": -0.439453125, + "logps/chosen": -436.0, + "logps/rejected": -292.0, + "loss": 0.6914, + "rewards/accuracies": 0.0, + "rewards/chosen": 0.0, + "rewards/margins": 0.0, + "rewards/rejected": 0.0, + "step": 2 + }, + { + "epoch": 0.0036809815950920245, + "grad_norm": 108.37171307643952, + "learning_rate": 6e-08, + "logits/chosen": -0.12890625, + "logits/rejected": -0.255859375, + "logps/chosen": -368.0, + "logps/rejected": -272.0, + "loss": 0.6896, + "rewards/accuracies": 0.328125, + "rewards/chosen": 0.005706787109375, + "rewards/margins": 0.01055908203125, + "rewards/rejected": -0.004852294921875, + "step": 3 + }, + { + "epoch": 0.0049079754601227, + "grad_norm": 152.5657567319493, + "learning_rate": 8e-08, + "logits/chosen": -0.166015625, + "logits/rejected": -0.326171875, + "logps/chosen": -422.0, + "logps/rejected": -242.0, + "loss": 0.7141, + "rewards/accuracies": 0.3359375, + "rewards/chosen": -0.009765625, + "rewards/margins": -0.025634765625, + "rewards/rejected": 0.0159912109375, + "step": 4 + }, + { + "epoch": 0.006134969325153374, + "grad_norm": 288.1306811063231, + "learning_rate": 1e-07, + "logits/chosen": -0.1845703125, + "logits/rejected": -0.326171875, + "logps/chosen": -380.0, + "logps/rejected": -270.0, + "loss": 0.6984, + "rewards/accuracies": 0.421875, + "rewards/chosen": 0.0216064453125, + "rewards/margins": -0.0030670166015625, + "rewards/rejected": 0.0247802734375, + "step": 5 + }, + { + "epoch": 0.007361963190184049, + "grad_norm": 331.41871326801424, + "learning_rate": 1.2e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.345703125, + "logps/chosen": -412.0, + "logps/rejected": -306.0, + "loss": 0.7177, + "rewards/accuracies": 0.2578125, + "rewards/chosen": -0.01434326171875, + "rewards/margins": -0.03466796875, + "rewards/rejected": 0.0203857421875, + "step": 6 + }, + { + "epoch": 0.008588957055214725, + "grad_norm": 249.74586517146642, + "learning_rate": 1.4e-07, + "logits/chosen": -0.2060546875, + "logits/rejected": -0.38671875, + "logps/chosen": -378.0, + "logps/rejected": -266.0, + "loss": 0.7072, + "rewards/accuracies": 0.3359375, + "rewards/chosen": -0.000904083251953125, + "rewards/margins": -0.0172119140625, + "rewards/rejected": 0.016357421875, + "step": 7 + }, + { + "epoch": 0.0098159509202454, + "grad_norm": 128.1050509063449, + "learning_rate": 1.6e-07, + "logits/chosen": -0.115234375, + "logits/rejected": -0.32421875, + "logps/chosen": -432.0, + "logps/rejected": -292.0, + "loss": 0.7045, + "rewards/accuracies": 0.2421875, + "rewards/chosen": 0.01513671875, + "rewards/margins": -0.01055908203125, + "rewards/rejected": 0.0257568359375, + "step": 8 + }, + { + "epoch": 0.011042944785276074, + "grad_norm": 128.31082936106668, + "learning_rate": 1.8e-07, + "logits/chosen": -0.1357421875, + "logits/rejected": -0.361328125, + "logps/chosen": -402.0, + "logps/rejected": -294.0, + "loss": 0.7057, + "rewards/accuracies": 0.2890625, + "rewards/chosen": 0.0185546875, + "rewards/margins": -0.0194091796875, + "rewards/rejected": 0.0380859375, + "step": 9 + }, + { + "epoch": 0.012269938650306749, + "grad_norm": 148.13248133021244, + "learning_rate": 2e-07, + "logits/chosen": -0.201171875, + "logits/rejected": -0.35546875, + "logps/chosen": -402.0, + "logps/rejected": -278.0, + "loss": 0.6879, + "rewards/accuracies": 0.359375, + "rewards/chosen": 0.03466796875, + "rewards/margins": 0.011962890625, + "rewards/rejected": 0.022705078125, + "step": 10 + }, + { + "epoch": 0.013496932515337423, + "grad_norm": 188.4465050278061, + "learning_rate": 2.1999999999999998e-07, + "logits/chosen": -0.38671875, + "logits/rejected": -0.52734375, + "logps/chosen": -422.0, + "logps/rejected": -296.0, + "loss": 0.6847, + "rewards/accuracies": 0.421875, + "rewards/chosen": 0.04296875, + "rewards/margins": 0.025634765625, + "rewards/rejected": 0.017333984375, + "step": 11 + }, + { + "epoch": 0.014723926380368098, + "grad_norm": 283.48200245967496, + "learning_rate": 2.4e-07, + "logits/chosen": -0.1455078125, + "logits/rejected": -0.251953125, + "logps/chosen": -374.0, + "logps/rejected": -262.0, + "loss": 0.6763, + "rewards/accuracies": 0.4140625, + "rewards/chosen": 0.036376953125, + "rewards/margins": 0.042724609375, + "rewards/rejected": -0.00634765625, + "step": 12 + }, + { + "epoch": 0.015950920245398775, + "grad_norm": 157.86633246900865, + "learning_rate": 2.6e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.423828125, + "logps/chosen": -392.0, + "logps/rejected": -249.0, + "loss": 0.6399, + "rewards/accuracies": 0.59375, + "rewards/chosen": 0.068359375, + "rewards/margins": 0.1240234375, + "rewards/rejected": -0.055419921875, + "step": 13 + }, + { + "epoch": 0.01717791411042945, + "grad_norm": 170.28826054471034, + "learning_rate": 2.8e-07, + "logits/chosen": -0.2412109375, + "logits/rejected": -0.419921875, + "logps/chosen": -472.0, + "logps/rejected": -310.0, + "loss": 0.645, + "rewards/accuracies": 0.5390625, + "rewards/chosen": 0.1201171875, + "rewards/margins": 0.12109375, + "rewards/rejected": -0.000881195068359375, + "step": 14 + }, + { + "epoch": 0.018404907975460124, + "grad_norm": 196.84243180155542, + "learning_rate": 3e-07, + "logits/chosen": -0.12451171875, + "logits/rejected": -0.1923828125, + "logps/chosen": -420.0, + "logps/rejected": -288.0, + "loss": 0.6433, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.0849609375, + "rewards/margins": 0.1298828125, + "rewards/rejected": -0.044677734375, + "step": 15 + }, + { + "epoch": 0.0196319018404908, + "grad_norm": 150.44401802967914, + "learning_rate": 3.2e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.439453125, + "logps/chosen": -408.0, + "logps/rejected": -304.0, + "loss": 0.6163, + "rewards/accuracies": 0.609375, + "rewards/chosen": 0.1513671875, + "rewards/margins": 0.189453125, + "rewards/rejected": -0.03759765625, + "step": 16 + }, + { + "epoch": 0.020858895705521473, + "grad_norm": 158.3424645259106, + "learning_rate": 3.4000000000000003e-07, + "logits/chosen": -0.181640625, + "logits/rejected": -0.330078125, + "logps/chosen": -434.0, + "logps/rejected": -254.0, + "loss": 0.5994, + "rewards/accuracies": 0.6171875, + "rewards/chosen": 0.173828125, + "rewards/margins": 0.25390625, + "rewards/rejected": -0.08056640625, + "step": 17 + }, + { + "epoch": 0.022085889570552148, + "grad_norm": 127.76158860883122, + "learning_rate": 3.6e-07, + "logits/chosen": -0.16015625, + "logits/rejected": -0.337890625, + "logps/chosen": -404.0, + "logps/rejected": -276.0, + "loss": 0.5706, + "rewards/accuracies": 0.6953125, + "rewards/chosen": 0.2294921875, + "rewards/margins": 0.3359375, + "rewards/rejected": -0.10595703125, + "step": 18 + }, + { + "epoch": 0.023312883435582823, + "grad_norm": 69.38468528362102, + "learning_rate": 3.7999999999999996e-07, + "logits/chosen": -0.20703125, + "logits/rejected": -0.37890625, + "logps/chosen": -388.0, + "logps/rejected": -288.0, + "loss": 0.567, + "rewards/accuracies": 0.6484375, + "rewards/chosen": 0.2197265625, + "rewards/margins": 0.37890625, + "rewards/rejected": -0.158203125, + "step": 19 + }, + { + "epoch": 0.024539877300613498, + "grad_norm": 82.21345162463909, + "learning_rate": 4e-07, + "logits/chosen": -0.291015625, + "logits/rejected": -0.455078125, + "logps/chosen": -466.0, + "logps/rejected": -310.0, + "loss": 0.5153, + "rewards/accuracies": 0.7421875, + "rewards/chosen": 0.37890625, + "rewards/margins": 0.58984375, + "rewards/rejected": -0.2109375, + "step": 20 + }, + { + "epoch": 0.025766871165644172, + "grad_norm": 105.40201871897163, + "learning_rate": 4.1999999999999995e-07, + "logits/chosen": -0.166015625, + "logits/rejected": -0.337890625, + "logps/chosen": -412.0, + "logps/rejected": -260.0, + "loss": 0.5326, + "rewards/accuracies": 0.703125, + "rewards/chosen": 0.296875, + "rewards/margins": 0.490234375, + "rewards/rejected": -0.1923828125, + "step": 21 + }, + { + "epoch": 0.026993865030674847, + "grad_norm": 70.78030423389544, + "learning_rate": 4.3999999999999997e-07, + "logits/chosen": -0.162109375, + "logits/rejected": -0.29296875, + "logps/chosen": -382.0, + "logps/rejected": -292.0, + "loss": 0.5334, + "rewards/accuracies": 0.75, + "rewards/chosen": 0.291015625, + "rewards/margins": 0.5390625, + "rewards/rejected": -0.2470703125, + "step": 22 + }, + { + "epoch": 0.02822085889570552, + "grad_norm": 60.46408711421665, + "learning_rate": 4.6e-07, + "logits/chosen": -0.283203125, + "logits/rejected": -0.333984375, + "logps/chosen": -380.0, + "logps/rejected": -302.0, + "loss": 0.513, + "rewards/accuracies": 0.6953125, + "rewards/chosen": 0.498046875, + "rewards/margins": 0.75390625, + "rewards/rejected": -0.2578125, + "step": 23 + }, + { + "epoch": 0.029447852760736196, + "grad_norm": 54.54733596050591, + "learning_rate": 4.8e-07, + "logits/chosen": -0.21484375, + "logits/rejected": -0.396484375, + "logps/chosen": -378.0, + "logps/rejected": -274.0, + "loss": 0.5458, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.36328125, + "rewards/margins": 0.6015625, + "rewards/rejected": -0.2392578125, + "step": 24 + }, + { + "epoch": 0.03067484662576687, + "grad_norm": 46.35027564725166, + "learning_rate": 5e-07, + "logits/chosen": -0.29296875, + "logits/rejected": -0.478515625, + "logps/chosen": -436.0, + "logps/rejected": -296.0, + "loss": 0.468, + "rewards/accuracies": 0.75, + "rewards/chosen": 0.65234375, + "rewards/margins": 1.0859375, + "rewards/rejected": -0.43359375, + "step": 25 + }, + { + "epoch": 0.03190184049079755, + "grad_norm": 49.250838916767385, + "learning_rate": 4.99793388429752e-07, + "logits/chosen": -0.193359375, + "logits/rejected": -0.349609375, + "logps/chosen": -390.0, + "logps/rejected": -272.0, + "loss": 0.4753, + "rewards/accuracies": 0.7265625, + "rewards/chosen": 0.75, + "rewards/margins": 1.15625, + "rewards/rejected": -0.404296875, + "step": 26 + }, + { + "epoch": 0.033128834355828224, + "grad_norm": 49.243509562031704, + "learning_rate": 4.995867768595041e-07, + "logits/chosen": -0.142578125, + "logits/rejected": -0.314453125, + "logps/chosen": -362.0, + "logps/rejected": -274.0, + "loss": 0.4481, + "rewards/accuracies": 0.734375, + "rewards/chosen": 0.84765625, + "rewards/margins": 1.3125, + "rewards/rejected": -0.46484375, + "step": 27 + }, + { + "epoch": 0.0343558282208589, + "grad_norm": 43.853948458317184, + "learning_rate": 4.993801652892562e-07, + "logits/chosen": -0.08203125, + "logits/rejected": -0.1884765625, + "logps/chosen": -382.0, + "logps/rejected": -258.0, + "loss": 0.4667, + "rewards/accuracies": 0.78125, + "rewards/chosen": 0.79296875, + "rewards/margins": 1.125, + "rewards/rejected": -0.33203125, + "step": 28 + }, + { + "epoch": 0.03558282208588957, + "grad_norm": 46.27857873377814, + "learning_rate": 4.991735537190083e-07, + "logits/chosen": -0.318359375, + "logits/rejected": -0.46484375, + "logps/chosen": -422.0, + "logps/rejected": -316.0, + "loss": 0.442, + "rewards/accuracies": 0.7578125, + "rewards/chosen": 0.94921875, + "rewards/margins": 1.46875, + "rewards/rejected": -0.5234375, + "step": 29 + }, + { + "epoch": 0.03680981595092025, + "grad_norm": 54.43172367072751, + "learning_rate": 4.989669421487603e-07, + "logits/chosen": -0.18359375, + "logits/rejected": -0.302734375, + "logps/chosen": -338.0, + "logps/rejected": -260.0, + "loss": 0.4973, + "rewards/accuracies": 0.7578125, + "rewards/chosen": 0.671875, + "rewards/margins": 1.1015625, + "rewards/rejected": -0.4296875, + "step": 30 + }, + { + "epoch": 0.03803680981595092, + "grad_norm": 49.563120237934434, + "learning_rate": 4.987603305785124e-07, + "logits/chosen": -0.171875, + "logits/rejected": -0.294921875, + "logps/chosen": -388.0, + "logps/rejected": -270.0, + "loss": 0.4585, + "rewards/accuracies": 0.75, + "rewards/chosen": 0.97265625, + "rewards/margins": 1.5390625, + "rewards/rejected": -0.5703125, + "step": 31 + }, + { + "epoch": 0.0392638036809816, + "grad_norm": 47.082618739282914, + "learning_rate": 4.985537190082644e-07, + "logits/chosen": -0.220703125, + "logits/rejected": -0.41015625, + "logps/chosen": -394.0, + "logps/rejected": -282.0, + "loss": 0.4295, + "rewards/accuracies": 0.7734375, + "rewards/chosen": 0.9609375, + "rewards/margins": 1.578125, + "rewards/rejected": -0.61328125, + "step": 32 + }, + { + "epoch": 0.04049079754601227, + "grad_norm": 43.28996668354881, + "learning_rate": 4.983471074380165e-07, + "logits/chosen": -0.10595703125, + "logits/rejected": -0.244140625, + "logps/chosen": -332.0, + "logps/rejected": -229.0, + "loss": 0.4502, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.73828125, + "rewards/margins": 1.3203125, + "rewards/rejected": -0.58203125, + "step": 33 + }, + { + "epoch": 0.04171779141104295, + "grad_norm": 53.08103037992315, + "learning_rate": 4.981404958677686e-07, + "logits/chosen": -0.26171875, + "logits/rejected": -0.396484375, + "logps/chosen": -390.0, + "logps/rejected": -296.0, + "loss": 0.4275, + "rewards/accuracies": 0.7578125, + "rewards/chosen": 0.9296875, + "rewards/margins": 1.78125, + "rewards/rejected": -0.84765625, + "step": 34 + }, + { + "epoch": 0.04294478527607362, + "grad_norm": 51.02011562118897, + "learning_rate": 4.979338842975207e-07, + "logits/chosen": -0.169921875, + "logits/rejected": -0.3203125, + "logps/chosen": -360.0, + "logps/rejected": -258.0, + "loss": 0.4005, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.75, + "rewards/margins": 1.78125, + "rewards/rejected": -1.0234375, + "step": 35 + }, + { + "epoch": 0.044171779141104296, + "grad_norm": 39.1724548423627, + "learning_rate": 4.977272727272727e-07, + "logits/chosen": -0.224609375, + "logits/rejected": -0.314453125, + "logps/chosen": -404.0, + "logps/rejected": -288.0, + "loss": 0.3849, + "rewards/accuracies": 0.78125, + "rewards/chosen": 1.125, + "rewards/margins": 2.1875, + "rewards/rejected": -1.0546875, + "step": 36 + }, + { + "epoch": 0.04539877300613497, + "grad_norm": 41.851898602487374, + "learning_rate": 4.975206611570248e-07, + "logits/chosen": -0.19140625, + "logits/rejected": -0.30859375, + "logps/chosen": -394.0, + "logps/rejected": -308.0, + "loss": 0.4066, + "rewards/accuracies": 0.7421875, + "rewards/chosen": 1.3203125, + "rewards/margins": 2.296875, + "rewards/rejected": -0.9765625, + "step": 37 + }, + { + "epoch": 0.046625766871165646, + "grad_norm": 38.15131350129523, + "learning_rate": 4.973140495867769e-07, + "logits/chosen": -0.134765625, + "logits/rejected": -0.27734375, + "logps/chosen": -402.0, + "logps/rejected": -298.0, + "loss": 0.3886, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.53125, + "rewards/margins": 2.578125, + "rewards/rejected": -1.046875, + "step": 38 + }, + { + "epoch": 0.04785276073619632, + "grad_norm": 41.71923927967426, + "learning_rate": 4.971074380165288e-07, + "logits/chosen": -0.25390625, + "logits/rejected": -0.4375, + "logps/chosen": -428.0, + "logps/rejected": -302.0, + "loss": 0.3805, + "rewards/accuracies": 0.796875, + "rewards/chosen": 1.328125, + "rewards/margins": 2.640625, + "rewards/rejected": -1.3125, + "step": 39 + }, + { + "epoch": 0.049079754601226995, + "grad_norm": 38.402003702110484, + "learning_rate": 4.96900826446281e-07, + "logits/chosen": -0.1865234375, + "logits/rejected": -0.328125, + "logps/chosen": -376.0, + "logps/rejected": -282.0, + "loss": 0.3421, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.3125, + "rewards/margins": 2.734375, + "rewards/rejected": -1.421875, + "step": 40 + }, + { + "epoch": 0.05030674846625767, + "grad_norm": 34.67962672406851, + "learning_rate": 4.96694214876033e-07, + "logits/chosen": -0.185546875, + "logits/rejected": -0.390625, + "logps/chosen": -380.0, + "logps/rejected": -272.0, + "loss": 0.3787, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.3125, + "rewards/margins": 2.65625, + "rewards/rejected": -1.3515625, + "step": 41 + }, + { + "epoch": 0.051533742331288344, + "grad_norm": 46.35208610876743, + "learning_rate": 4.964876033057851e-07, + "logits/chosen": -0.1455078125, + "logits/rejected": -0.328125, + "logps/chosen": -366.0, + "logps/rejected": -284.0, + "loss": 0.3611, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.2109375, + "rewards/margins": 2.71875, + "rewards/rejected": -1.515625, + "step": 42 + }, + { + "epoch": 0.05276073619631902, + "grad_norm": 48.36417348819516, + "learning_rate": 4.962809917355371e-07, + "logits/chosen": -0.2080078125, + "logits/rejected": -0.404296875, + "logps/chosen": -420.0, + "logps/rejected": -322.0, + "loss": 0.3483, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.3828125, + "rewards/margins": 3.109375, + "rewards/rejected": -1.7265625, + "step": 43 + }, + { + "epoch": 0.053987730061349694, + "grad_norm": 58.150094006043, + "learning_rate": 4.960743801652892e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.4140625, + "logps/chosen": -390.0, + "logps/rejected": -294.0, + "loss": 0.4261, + "rewards/accuracies": 0.78125, + "rewards/chosen": 0.94140625, + "rewards/margins": 2.75, + "rewards/rejected": -1.8046875, + "step": 44 + }, + { + "epoch": 0.05521472392638037, + "grad_norm": 41.77249990347939, + "learning_rate": 4.958677685950413e-07, + "logits/chosen": -0.34765625, + "logits/rejected": -0.455078125, + "logps/chosen": -358.0, + "logps/rejected": -286.0, + "loss": 0.3831, + "rewards/accuracies": 0.78125, + "rewards/chosen": 1.015625, + "rewards/margins": 2.890625, + "rewards/rejected": -1.8671875, + "step": 45 + }, + { + "epoch": 0.05644171779141104, + "grad_norm": 42.522353640053986, + "learning_rate": 4.956611570247934e-07, + "logits/chosen": -0.21875, + "logits/rejected": -0.412109375, + "logps/chosen": -426.0, + "logps/rejected": -292.0, + "loss": 0.3376, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.5546875, + "rewards/margins": 3.5, + "rewards/rejected": -1.953125, + "step": 46 + }, + { + "epoch": 0.05766871165644172, + "grad_norm": 59.82362665796057, + "learning_rate": 4.954545454545454e-07, + "logits/chosen": -0.26953125, + "logits/rejected": -0.373046875, + "logps/chosen": -394.0, + "logps/rejected": -362.0, + "loss": 0.4408, + "rewards/accuracies": 0.734375, + "rewards/chosen": 1.0390625, + "rewards/margins": 2.6875, + "rewards/rejected": -1.6484375, + "step": 47 + }, + { + "epoch": 0.05889570552147239, + "grad_norm": 36.37462895121556, + "learning_rate": 4.952479338842975e-07, + "logits/chosen": -0.25, + "logits/rejected": -0.40234375, + "logps/chosen": -352.0, + "logps/rejected": -276.0, + "loss": 0.3918, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.0, + "rewards/margins": 2.4375, + "rewards/rejected": -1.4296875, + "step": 48 + }, + { + "epoch": 0.06012269938650307, + "grad_norm": 33.380998200862365, + "learning_rate": 4.950413223140495e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.515625, + "logps/chosen": -406.0, + "logps/rejected": -288.0, + "loss": 0.2888, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.5703125, + "rewards/margins": 3.65625, + "rewards/rejected": -2.078125, + "step": 49 + }, + { + "epoch": 0.06134969325153374, + "grad_norm": 49.61344030643431, + "learning_rate": 4.948347107438016e-07, + "logits/chosen": -0.25390625, + "logits/rejected": -0.447265625, + "logps/chosen": -406.0, + "logps/rejected": -310.0, + "loss": 0.4032, + "rewards/accuracies": 0.7734375, + "rewards/chosen": 1.28125, + "rewards/margins": 2.890625, + "rewards/rejected": -1.609375, + "step": 50 + }, + { + "epoch": 0.06257668711656442, + "grad_norm": 44.94363880784817, + "learning_rate": 4.946280991735537e-07, + "logits/chosen": -0.201171875, + "logits/rejected": -0.373046875, + "logps/chosen": -444.0, + "logps/rejected": -352.0, + "loss": 0.3064, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.640625, + "rewards/margins": 3.578125, + "rewards/rejected": -1.9375, + "step": 51 + }, + { + "epoch": 0.0638036809815951, + "grad_norm": 41.35776161230766, + "learning_rate": 4.944214876033058e-07, + "logits/chosen": -0.2333984375, + "logits/rejected": -0.435546875, + "logps/chosen": -402.0, + "logps/rejected": -328.0, + "loss": 0.369, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.1953125, + "rewards/margins": 3.34375, + "rewards/rejected": -2.15625, + "step": 52 + }, + { + "epoch": 0.06503067484662577, + "grad_norm": 44.728082439821826, + "learning_rate": 4.942148760330578e-07, + "logits/chosen": -0.173828125, + "logits/rejected": -0.34375, + "logps/chosen": -404.0, + "logps/rejected": -316.0, + "loss": 0.3683, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.3515625, + "rewards/margins": 3.109375, + "rewards/rejected": -1.7578125, + "step": 53 + }, + { + "epoch": 0.06625766871165645, + "grad_norm": 39.009654963149515, + "learning_rate": 4.940082644628099e-07, + "logits/chosen": -0.072265625, + "logits/rejected": -0.255859375, + "logps/chosen": -338.0, + "logps/rejected": -251.0, + "loss": 0.3097, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.9765625, + "rewards/margins": 2.796875, + "rewards/rejected": -1.8203125, + "step": 54 + }, + { + "epoch": 0.06748466257668712, + "grad_norm": 40.85012819896818, + "learning_rate": 4.93801652892562e-07, + "logits/chosen": -0.2021484375, + "logits/rejected": -0.376953125, + "logps/chosen": -382.0, + "logps/rejected": -288.0, + "loss": 0.3452, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.1875, + "rewards/margins": 3.140625, + "rewards/rejected": -1.9609375, + "step": 55 + }, + { + "epoch": 0.0687116564417178, + "grad_norm": 46.70951578377314, + "learning_rate": 4.935950413223141e-07, + "logits/chosen": -0.169921875, + "logits/rejected": -0.361328125, + "logps/chosen": -392.0, + "logps/rejected": -324.0, + "loss": 0.3916, + "rewards/accuracies": 0.7578125, + "rewards/chosen": 1.3671875, + "rewards/margins": 3.234375, + "rewards/rejected": -1.875, + "step": 56 + }, + { + "epoch": 0.06993865030674846, + "grad_norm": 51.30803055192484, + "learning_rate": 4.933884297520661e-07, + "logits/chosen": -0.1650390625, + "logits/rejected": -0.255859375, + "logps/chosen": -356.0, + "logps/rejected": -316.0, + "loss": 0.3947, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.1875, + "rewards/margins": 3.203125, + "rewards/rejected": -2.015625, + "step": 57 + }, + { + "epoch": 0.07116564417177915, + "grad_norm": 47.592024830773475, + "learning_rate": 4.931818181818182e-07, + "logits/chosen": -0.177734375, + "logits/rejected": -0.2734375, + "logps/chosen": -378.0, + "logps/rejected": -320.0, + "loss": 0.3758, + "rewards/accuracies": 0.78125, + "rewards/chosen": 1.4140625, + "rewards/margins": 3.328125, + "rewards/rejected": -1.9140625, + "step": 58 + }, + { + "epoch": 0.07239263803680981, + "grad_norm": 48.17219624892423, + "learning_rate": 4.929752066115702e-07, + "logits/chosen": -0.0947265625, + "logits/rejected": -0.1923828125, + "logps/chosen": -380.0, + "logps/rejected": -288.0, + "loss": 0.4219, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.0546875, + "rewards/margins": 2.59375, + "rewards/rejected": -1.5390625, + "step": 59 + }, + { + "epoch": 0.0736196319018405, + "grad_norm": 39.36985463274499, + "learning_rate": 4.927685950413223e-07, + "logits/chosen": -0.171875, + "logits/rejected": -0.314453125, + "logps/chosen": -386.0, + "logps/rejected": -280.0, + "loss": 0.3667, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.9765625, + "rewards/margins": 2.796875, + "rewards/rejected": -1.8125, + "step": 60 + }, + { + "epoch": 0.07484662576687116, + "grad_norm": 38.11628572877564, + "learning_rate": 4.925619834710743e-07, + "logits/chosen": -0.169921875, + "logits/rejected": -0.318359375, + "logps/chosen": -420.0, + "logps/rejected": -310.0, + "loss": 0.3265, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.59375, + "rewards/margins": 3.65625, + "rewards/rejected": -2.0625, + "step": 61 + }, + { + "epoch": 0.07607361963190185, + "grad_norm": 40.58395817948392, + "learning_rate": 4.923553719008265e-07, + "logits/chosen": -0.15234375, + "logits/rejected": -0.373046875, + "logps/chosen": -432.0, + "logps/rejected": -302.0, + "loss": 0.3375, + "rewards/accuracies": 0.78125, + "rewards/chosen": 1.8203125, + "rewards/margins": 4.09375, + "rewards/rejected": -2.265625, + "step": 62 + }, + { + "epoch": 0.07730061349693251, + "grad_norm": 43.13092829482704, + "learning_rate": 4.921487603305785e-07, + "logits/chosen": -0.06787109375, + "logits/rejected": -0.244140625, + "logps/chosen": -422.0, + "logps/rejected": -300.0, + "loss": 0.3277, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.2265625, + "rewards/margins": 3.203125, + "rewards/rejected": -1.96875, + "step": 63 + }, + { + "epoch": 0.0785276073619632, + "grad_norm": 57.40916665463975, + "learning_rate": 4.919421487603306e-07, + "logits/chosen": -0.21484375, + "logits/rejected": -0.404296875, + "logps/chosen": -406.0, + "logps/rejected": -324.0, + "loss": 0.3991, + "rewards/accuracies": 0.7734375, + "rewards/chosen": 1.5078125, + "rewards/margins": 3.609375, + "rewards/rejected": -2.09375, + "step": 64 + }, + { + "epoch": 0.07975460122699386, + "grad_norm": 39.641816149243105, + "learning_rate": 4.917355371900826e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.37109375, + "logps/chosen": -396.0, + "logps/rejected": -296.0, + "loss": 0.3463, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.4375, + "rewards/margins": 3.4375, + "rewards/rejected": -2.0, + "step": 65 + }, + { + "epoch": 0.08098159509202454, + "grad_norm": 49.84344547746062, + "learning_rate": 4.915289256198346e-07, + "logits/chosen": -0.2421875, + "logits/rejected": -0.392578125, + "logps/chosen": -322.0, + "logps/rejected": -254.0, + "loss": 0.3217, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.4921875, + "rewards/margins": 3.796875, + "rewards/rejected": -2.3125, + "step": 66 + }, + { + "epoch": 0.08220858895705521, + "grad_norm": 37.32761829857322, + "learning_rate": 4.913223140495867e-07, + "logits/chosen": -0.1337890625, + "logits/rejected": -0.263671875, + "logps/chosen": -334.0, + "logps/rejected": -288.0, + "loss": 0.3388, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.9375, + "rewards/margins": 3.125, + "rewards/rejected": -2.1875, + "step": 67 + }, + { + "epoch": 0.0834355828220859, + "grad_norm": 44.340094240446255, + "learning_rate": 4.911157024793388e-07, + "logits/chosen": -0.2216796875, + "logits/rejected": -0.30078125, + "logps/chosen": -364.0, + "logps/rejected": -326.0, + "loss": 0.3709, + "rewards/accuracies": 0.78125, + "rewards/chosen": 1.15625, + "rewards/margins": 3.234375, + "rewards/rejected": -2.078125, + "step": 68 + }, + { + "epoch": 0.08466257668711656, + "grad_norm": 36.72487633784899, + "learning_rate": 4.909090909090909e-07, + "logits/chosen": -0.279296875, + "logits/rejected": -0.46875, + "logps/chosen": -414.0, + "logps/rejected": -278.0, + "loss": 0.3115, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.8203125, + "rewards/margins": 4.0625, + "rewards/rejected": -2.25, + "step": 69 + }, + { + "epoch": 0.08588957055214724, + "grad_norm": 38.53295537225695, + "learning_rate": 4.907024793388429e-07, + "logits/chosen": -0.1572265625, + "logits/rejected": -0.35546875, + "logps/chosen": -414.0, + "logps/rejected": -336.0, + "loss": 0.2897, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.7578125, + "rewards/margins": 3.875, + "rewards/rejected": -2.109375, + "step": 70 + }, + { + "epoch": 0.08711656441717791, + "grad_norm": 41.12312548370276, + "learning_rate": 4.90495867768595e-07, + "logits/chosen": -0.095703125, + "logits/rejected": -0.1796875, + "logps/chosen": -348.0, + "logps/rejected": -274.0, + "loss": 0.4118, + "rewards/accuracies": 0.75, + "rewards/chosen": 0.9765625, + "rewards/margins": 2.921875, + "rewards/rejected": -1.9453125, + "step": 71 + }, + { + "epoch": 0.08834355828220859, + "grad_norm": 39.321341602611746, + "learning_rate": 4.902892561983471e-07, + "logits/chosen": -0.251953125, + "logits/rejected": -0.419921875, + "logps/chosen": -434.0, + "logps/rejected": -344.0, + "loss": 0.3197, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.5078125, + "rewards/margins": 3.53125, + "rewards/rejected": -2.03125, + "step": 72 + }, + { + "epoch": 0.08957055214723926, + "grad_norm": 44.53160035761988, + "learning_rate": 4.900826446280992e-07, + "logits/chosen": -0.1943359375, + "logits/rejected": -0.29296875, + "logps/chosen": -352.0, + "logps/rejected": -294.0, + "loss": 0.3927, + "rewards/accuracies": 0.765625, + "rewards/chosen": 1.1328125, + "rewards/margins": 3.34375, + "rewards/rejected": -2.21875, + "step": 73 + }, + { + "epoch": 0.09079754601226994, + "grad_norm": 40.466626208621626, + "learning_rate": 4.898760330578512e-07, + "logits/chosen": -0.1953125, + "logits/rejected": -0.29296875, + "logps/chosen": -356.0, + "logps/rejected": -324.0, + "loss": 0.303, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.97265625, + "rewards/margins": 3.25, + "rewards/rejected": -2.28125, + "step": 74 + }, + { + "epoch": 0.09202453987730061, + "grad_norm": 35.5267105162623, + "learning_rate": 4.896694214876033e-07, + "logits/chosen": -0.1669921875, + "logits/rejected": -0.33203125, + "logps/chosen": -384.0, + "logps/rejected": -314.0, + "loss": 0.2978, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.453125, + "rewards/margins": 3.8125, + "rewards/rejected": -2.359375, + "step": 75 + }, + { + "epoch": 0.09325153374233129, + "grad_norm": 47.01910580765987, + "learning_rate": 4.894628099173553e-07, + "logits/chosen": -0.169921875, + "logits/rejected": -0.359375, + "logps/chosen": -402.0, + "logps/rejected": -284.0, + "loss": 0.3205, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.4765625, + "rewards/margins": 3.671875, + "rewards/rejected": -2.203125, + "step": 76 + }, + { + "epoch": 0.09447852760736196, + "grad_norm": 37.028647946403694, + "learning_rate": 4.892561983471074e-07, + "logits/chosen": -0.189453125, + "logits/rejected": -0.34765625, + "logps/chosen": -352.0, + "logps/rejected": -292.0, + "loss": 0.3058, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.1328125, + "rewards/margins": 3.59375, + "rewards/rejected": -2.46875, + "step": 77 + }, + { + "epoch": 0.09570552147239264, + "grad_norm": 41.57134852043157, + "learning_rate": 4.890495867768595e-07, + "logits/chosen": -0.1474609375, + "logits/rejected": -0.330078125, + "logps/chosen": -420.0, + "logps/rejected": -310.0, + "loss": 0.3141, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.3671875, + "rewards/margins": 3.75, + "rewards/rejected": -2.390625, + "step": 78 + }, + { + "epoch": 0.09693251533742331, + "grad_norm": 34.691948521740784, + "learning_rate": 4.888429752066116e-07, + "logits/chosen": -0.12890625, + "logits/rejected": -0.2734375, + "logps/chosen": -356.0, + "logps/rejected": -282.0, + "loss": 0.3063, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.09375, + "rewards/margins": 3.40625, + "rewards/rejected": -2.3125, + "step": 79 + }, + { + "epoch": 0.09815950920245399, + "grad_norm": 49.17092037552417, + "learning_rate": 4.886363636363636e-07, + "logits/chosen": -0.19140625, + "logits/rejected": -0.42578125, + "logps/chosen": -410.0, + "logps/rejected": -318.0, + "loss": 0.2984, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.7890625, + "rewards/margins": 4.34375, + "rewards/rejected": -2.5625, + "step": 80 + }, + { + "epoch": 0.09938650306748466, + "grad_norm": 39.19664643244926, + "learning_rate": 4.884297520661157e-07, + "logits/chosen": -0.255859375, + "logits/rejected": -0.435546875, + "logps/chosen": -440.0, + "logps/rejected": -334.0, + "loss": 0.3241, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.5546875, + "rewards/margins": 4.15625, + "rewards/rejected": -2.578125, + "step": 81 + }, + { + "epoch": 0.10061349693251534, + "grad_norm": 49.311491941358796, + "learning_rate": 4.882231404958677e-07, + "logits/chosen": -0.1650390625, + "logits/rejected": -0.29296875, + "logps/chosen": -430.0, + "logps/rejected": -326.0, + "loss": 0.3395, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.0234375, + "rewards/margins": 3.65625, + "rewards/rejected": -2.640625, + "step": 82 + }, + { + "epoch": 0.10184049079754601, + "grad_norm": 49.376121428612976, + "learning_rate": 4.880165289256198e-07, + "logits/chosen": -0.1513671875, + "logits/rejected": -0.32421875, + "logps/chosen": -352.0, + "logps/rejected": -298.0, + "loss": 0.32, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.140625, + "rewards/margins": 3.734375, + "rewards/rejected": -2.59375, + "step": 83 + }, + { + "epoch": 0.10306748466257669, + "grad_norm": 64.06732250692619, + "learning_rate": 4.878099173553718e-07, + "logits/chosen": -0.1259765625, + "logits/rejected": -0.365234375, + "logps/chosen": -450.0, + "logps/rejected": -338.0, + "loss": 0.3022, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.4609375, + "rewards/margins": 4.3125, + "rewards/rejected": -2.875, + "step": 84 + }, + { + "epoch": 0.10429447852760736, + "grad_norm": 44.025841834176795, + "learning_rate": 4.87603305785124e-07, + "logits/chosen": -0.2177734375, + "logits/rejected": -0.38671875, + "logps/chosen": -378.0, + "logps/rejected": -314.0, + "loss": 0.3406, + "rewards/accuracies": 0.78125, + "rewards/chosen": 0.97265625, + "rewards/margins": 3.71875, + "rewards/rejected": -2.75, + "step": 85 + }, + { + "epoch": 0.10552147239263804, + "grad_norm": 41.64304248400373, + "learning_rate": 4.87396694214876e-07, + "logits/chosen": -0.1484375, + "logits/rejected": -0.271484375, + "logps/chosen": -426.0, + "logps/rejected": -294.0, + "loss": 0.3372, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.4140625, + "rewards/margins": 3.78125, + "rewards/rejected": -2.359375, + "step": 86 + }, + { + "epoch": 0.1067484662576687, + "grad_norm": 33.11395742992561, + "learning_rate": 4.871900826446281e-07, + "logits/chosen": -0.185546875, + "logits/rejected": -0.32421875, + "logps/chosen": -352.0, + "logps/rejected": -252.0, + "loss": 0.2974, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.7421875, + "rewards/margins": 3.484375, + "rewards/rejected": -2.75, + "step": 87 + }, + { + "epoch": 0.10797546012269939, + "grad_norm": 42.17124755394979, + "learning_rate": 4.869834710743801e-07, + "logits/chosen": -0.166015625, + "logits/rejected": -0.33984375, + "logps/chosen": -364.0, + "logps/rejected": -268.0, + "loss": 0.2793, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.125, + "rewards/margins": 3.6875, + "rewards/rejected": -2.5625, + "step": 88 + }, + { + "epoch": 0.10920245398773006, + "grad_norm": 43.24754945978333, + "learning_rate": 4.867768595041323e-07, + "logits/chosen": -0.1787109375, + "logits/rejected": -0.29296875, + "logps/chosen": -394.0, + "logps/rejected": -322.0, + "loss": 0.3704, + "rewards/accuracies": 0.796875, + "rewards/chosen": 1.328125, + "rewards/margins": 3.65625, + "rewards/rejected": -2.328125, + "step": 89 + }, + { + "epoch": 0.11042944785276074, + "grad_norm": 36.97477331926065, + "learning_rate": 4.865702479338843e-07, + "logits/chosen": -0.212890625, + "logits/rejected": -0.400390625, + "logps/chosen": -380.0, + "logps/rejected": -312.0, + "loss": 0.3415, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.97265625, + "rewards/margins": 3.5, + "rewards/rejected": -2.53125, + "step": 90 + }, + { + "epoch": 0.1116564417177914, + "grad_norm": 43.208078047171966, + "learning_rate": 4.863636363636364e-07, + "logits/chosen": -0.04638671875, + "logits/rejected": -0.30859375, + "logps/chosen": -394.0, + "logps/rejected": -290.0, + "loss": 0.2904, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.25, + "rewards/margins": 3.78125, + "rewards/rejected": -2.53125, + "step": 91 + }, + { + "epoch": 0.11288343558282209, + "grad_norm": 45.84043985703993, + "learning_rate": 4.861570247933884e-07, + "logits/chosen": -0.12890625, + "logits/rejected": -0.2490234375, + "logps/chosen": -394.0, + "logps/rejected": -294.0, + "loss": 0.2811, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.2578125, + "rewards/margins": 3.921875, + "rewards/rejected": -2.65625, + "step": 92 + }, + { + "epoch": 0.11411042944785275, + "grad_norm": 36.66550841517969, + "learning_rate": 4.859504132231405e-07, + "logits/chosen": -0.1484375, + "logits/rejected": -0.37109375, + "logps/chosen": -406.0, + "logps/rejected": -292.0, + "loss": 0.3038, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.8125, + "rewards/margins": 4.3125, + "rewards/rejected": -2.515625, + "step": 93 + }, + { + "epoch": 0.11533742331288344, + "grad_norm": 45.36547804836722, + "learning_rate": 4.857438016528925e-07, + "logits/chosen": -0.181640625, + "logits/rejected": -0.40234375, + "logps/chosen": -434.0, + "logps/rejected": -334.0, + "loss": 0.298, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.9140625, + "rewards/margins": 4.34375, + "rewards/rejected": -2.4375, + "step": 94 + }, + { + "epoch": 0.1165644171779141, + "grad_norm": 36.1886645335595, + "learning_rate": 4.855371900826447e-07, + "logits/chosen": -0.25390625, + "logits/rejected": -0.40625, + "logps/chosen": -382.0, + "logps/rejected": -300.0, + "loss": 0.3254, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.5390625, + "rewards/margins": 4.25, + "rewards/rejected": -2.703125, + "step": 95 + }, + { + "epoch": 0.11779141104294479, + "grad_norm": 47.78990929288722, + "learning_rate": 4.853305785123967e-07, + "logits/chosen": -0.2373046875, + "logits/rejected": -0.40625, + "logps/chosen": -374.0, + "logps/rejected": -302.0, + "loss": 0.2721, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.875, + "rewards/margins": 4.59375, + "rewards/rejected": -2.734375, + "step": 96 + }, + { + "epoch": 0.11901840490797547, + "grad_norm": 46.646580854293525, + "learning_rate": 4.851239669421487e-07, + "logits/chosen": -0.2314453125, + "logits/rejected": -0.37890625, + "logps/chosen": -428.0, + "logps/rejected": -346.0, + "loss": 0.3608, + "rewards/accuracies": 0.796875, + "rewards/chosen": 1.6640625, + "rewards/margins": 4.0, + "rewards/rejected": -2.328125, + "step": 97 + }, + { + "epoch": 0.12024539877300613, + "grad_norm": 38.68608855483517, + "learning_rate": 4.849173553719008e-07, + "logits/chosen": -0.0419921875, + "logits/rejected": -0.2431640625, + "logps/chosen": -360.0, + "logps/rejected": -276.0, + "loss": 0.3119, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.5, + "rewards/margins": 3.71875, + "rewards/rejected": -2.21875, + "step": 98 + }, + { + "epoch": 0.12147239263803682, + "grad_norm": 39.562539416001016, + "learning_rate": 4.847107438016528e-07, + "logits/chosen": -0.1953125, + "logits/rejected": -0.294921875, + "logps/chosen": -340.0, + "logps/rejected": -239.0, + "loss": 0.2701, + "rewards/accuracies": 0.921875, + "rewards/chosen": 1.1171875, + "rewards/margins": 3.46875, + "rewards/rejected": -2.34375, + "step": 99 + }, + { + "epoch": 0.12269938650306748, + "grad_norm": 37.50806782806318, + "learning_rate": 4.84504132231405e-07, + "logits/chosen": -0.2236328125, + "logits/rejected": -0.408203125, + "logps/chosen": -396.0, + "logps/rejected": -312.0, + "loss": 0.3124, + "rewards/accuracies": 0.796875, + "rewards/chosen": 1.5546875, + "rewards/margins": 4.125, + "rewards/rejected": -2.578125, + "step": 100 + }, + { + "epoch": 0.12392638036809817, + "grad_norm": 46.32080898977058, + "learning_rate": 4.842975206611569e-07, + "logits/chosen": -0.220703125, + "logits/rejected": -0.41015625, + "logps/chosen": -414.0, + "logps/rejected": -330.0, + "loss": 0.3659, + "rewards/accuracies": 0.78125, + "rewards/chosen": 1.6875, + "rewards/margins": 4.0625, + "rewards/rejected": -2.375, + "step": 101 + }, + { + "epoch": 0.12515337423312883, + "grad_norm": 38.46942420347679, + "learning_rate": 4.840909090909091e-07, + "logits/chosen": -0.19921875, + "logits/rejected": -0.31640625, + "logps/chosen": -396.0, + "logps/rejected": -314.0, + "loss": 0.2962, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.671875, + "rewards/margins": 4.0, + "rewards/rejected": -2.328125, + "step": 102 + }, + { + "epoch": 0.1263803680981595, + "grad_norm": 39.79508252800174, + "learning_rate": 4.838842975206611e-07, + "logits/chosen": -0.1884765625, + "logits/rejected": -0.349609375, + "logps/chosen": -350.0, + "logps/rejected": -290.0, + "loss": 0.3121, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.4609375, + "rewards/margins": 3.734375, + "rewards/rejected": -2.265625, + "step": 103 + }, + { + "epoch": 0.1276073619631902, + "grad_norm": 47.40646017292448, + "learning_rate": 4.836776859504132e-07, + "logits/chosen": -0.1162109375, + "logits/rejected": -0.255859375, + "logps/chosen": -416.0, + "logps/rejected": -330.0, + "loss": 0.3411, + "rewards/accuracies": 0.78125, + "rewards/chosen": 1.46875, + "rewards/margins": 3.734375, + "rewards/rejected": -2.265625, + "step": 104 + }, + { + "epoch": 0.12883435582822086, + "grad_norm": 38.094017856958104, + "learning_rate": 4.834710743801652e-07, + "logits/chosen": -0.2021484375, + "logits/rejected": -0.40234375, + "logps/chosen": -378.0, + "logps/rejected": -298.0, + "loss": 0.2782, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.6640625, + "rewards/margins": 4.1875, + "rewards/rejected": -2.515625, + "step": 105 + }, + { + "epoch": 0.13006134969325153, + "grad_norm": 38.92036345370265, + "learning_rate": 4.832644628099174e-07, + "logits/chosen": -0.177734375, + "logits/rejected": -0.337890625, + "logps/chosen": -394.0, + "logps/rejected": -304.0, + "loss": 0.3126, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.6171875, + "rewards/margins": 3.953125, + "rewards/rejected": -2.34375, + "step": 106 + }, + { + "epoch": 0.1312883435582822, + "grad_norm": 41.08010358460662, + "learning_rate": 4.830578512396694e-07, + "logits/chosen": -0.2109375, + "logits/rejected": -0.3046875, + "logps/chosen": -350.0, + "logps/rejected": -292.0, + "loss": 0.2914, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.4375, + "rewards/margins": 3.8125, + "rewards/rejected": -2.375, + "step": 107 + }, + { + "epoch": 0.1325153374233129, + "grad_norm": 36.5889842300964, + "learning_rate": 4.828512396694215e-07, + "logits/chosen": -0.2236328125, + "logits/rejected": -0.435546875, + "logps/chosen": -382.0, + "logps/rejected": -294.0, + "loss": 0.2899, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.2734375, + "rewards/margins": 3.921875, + "rewards/rejected": -2.65625, + "step": 108 + }, + { + "epoch": 0.13374233128834356, + "grad_norm": 39.09556301559485, + "learning_rate": 4.826446280991735e-07, + "logits/chosen": -0.20703125, + "logits/rejected": -0.39453125, + "logps/chosen": -414.0, + "logps/rejected": -304.0, + "loss": 0.3113, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 2.1875, + "rewards/margins": 4.59375, + "rewards/rejected": -2.390625, + "step": 109 + }, + { + "epoch": 0.13496932515337423, + "grad_norm": 40.98286093074122, + "learning_rate": 4.824380165289256e-07, + "logits/chosen": -0.193359375, + "logits/rejected": -0.349609375, + "logps/chosen": -406.0, + "logps/rejected": -326.0, + "loss": 0.3227, + "rewards/accuracies": 0.7734375, + "rewards/chosen": 1.890625, + "rewards/margins": 4.3125, + "rewards/rejected": -2.421875, + "step": 110 + }, + { + "epoch": 0.1361963190184049, + "grad_norm": 35.811211169912276, + "learning_rate": 4.822314049586776e-07, + "logits/chosen": -0.1318359375, + "logits/rejected": -0.294921875, + "logps/chosen": -332.0, + "logps/rejected": -262.0, + "loss": 0.303, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.3828125, + "rewards/margins": 3.546875, + "rewards/rejected": -2.15625, + "step": 111 + }, + { + "epoch": 0.1374233128834356, + "grad_norm": 34.57286118091264, + "learning_rate": 4.820247933884298e-07, + "logits/chosen": -0.2080078125, + "logits/rejected": -0.328125, + "logps/chosen": -342.0, + "logps/rejected": -272.0, + "loss": 0.259, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.4140625, + "rewards/margins": 3.828125, + "rewards/rejected": -2.40625, + "step": 112 + }, + { + "epoch": 0.13865030674846626, + "grad_norm": 39.00609248421783, + "learning_rate": 4.818181818181818e-07, + "logits/chosen": -0.12353515625, + "logits/rejected": -0.216796875, + "logps/chosen": -378.0, + "logps/rejected": -294.0, + "loss": 0.3242, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.5859375, + "rewards/margins": 3.8125, + "rewards/rejected": -2.234375, + "step": 113 + }, + { + "epoch": 0.13987730061349693, + "grad_norm": 44.795935075325445, + "learning_rate": 4.816115702479339e-07, + "logits/chosen": -0.1591796875, + "logits/rejected": -0.318359375, + "logps/chosen": -376.0, + "logps/rejected": -300.0, + "loss": 0.3214, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.1875, + "rewards/margins": 3.484375, + "rewards/rejected": -2.296875, + "step": 114 + }, + { + "epoch": 0.1411042944785276, + "grad_norm": 43.827084866837005, + "learning_rate": 4.814049586776859e-07, + "logits/chosen": -0.1689453125, + "logits/rejected": -0.291015625, + "logps/chosen": -340.0, + "logps/rejected": -306.0, + "loss": 0.338, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.953125, + "rewards/margins": 3.296875, + "rewards/rejected": -2.34375, + "step": 115 + }, + { + "epoch": 0.1423312883435583, + "grad_norm": 32.836140603929685, + "learning_rate": 4.81198347107438e-07, + "logits/chosen": -0.220703125, + "logits/rejected": -0.45703125, + "logps/chosen": -382.0, + "logps/rejected": -314.0, + "loss": 0.2561, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.84375, + "rewards/margins": 4.375, + "rewards/rejected": -2.546875, + "step": 116 + }, + { + "epoch": 0.14355828220858896, + "grad_norm": 34.86086710464441, + "learning_rate": 4.809917355371901e-07, + "logits/chosen": -0.1689453125, + "logits/rejected": -0.31640625, + "logps/chosen": -326.0, + "logps/rejected": -255.0, + "loss": 0.289, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.140625, + "rewards/margins": 3.828125, + "rewards/rejected": -2.6875, + "step": 117 + }, + { + "epoch": 0.14478527607361963, + "grad_norm": 39.71090585702439, + "learning_rate": 4.807851239669422e-07, + "logits/chosen": -0.1826171875, + "logits/rejected": -0.349609375, + "logps/chosen": -422.0, + "logps/rejected": -344.0, + "loss": 0.3177, + "rewards/accuracies": 0.7734375, + "rewards/chosen": 1.8203125, + "rewards/margins": 4.125, + "rewards/rejected": -2.296875, + "step": 118 + }, + { + "epoch": 0.1460122699386503, + "grad_norm": 39.95542336983019, + "learning_rate": 4.805785123966942e-07, + "logits/chosen": -0.25, + "logits/rejected": -0.353515625, + "logps/chosen": -356.0, + "logps/rejected": -310.0, + "loss": 0.3108, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.25, + "rewards/margins": 3.921875, + "rewards/rejected": -2.65625, + "step": 119 + }, + { + "epoch": 0.147239263803681, + "grad_norm": 43.1225245187085, + "learning_rate": 4.803719008264463e-07, + "logits/chosen": -0.2373046875, + "logits/rejected": -0.42578125, + "logps/chosen": -422.0, + "logps/rejected": -340.0, + "loss": 0.2861, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 2.15625, + "rewards/margins": 4.6875, + "rewards/rejected": -2.53125, + "step": 120 + }, + { + "epoch": 0.14846625766871166, + "grad_norm": 37.11625554264979, + "learning_rate": 4.801652892561983e-07, + "logits/chosen": -0.150390625, + "logits/rejected": -0.3125, + "logps/chosen": -412.0, + "logps/rejected": -318.0, + "loss": 0.2783, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.9296875, + "rewards/margins": 4.34375, + "rewards/rejected": -2.421875, + "step": 121 + }, + { + "epoch": 0.14969325153374233, + "grad_norm": 40.09291676904836, + "learning_rate": 4.799586776859503e-07, + "logits/chosen": -0.1689453125, + "logits/rejected": -0.337890625, + "logps/chosen": -380.0, + "logps/rejected": -282.0, + "loss": 0.2905, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.484375, + "rewards/margins": 3.859375, + "rewards/rejected": -2.390625, + "step": 122 + }, + { + "epoch": 0.150920245398773, + "grad_norm": 40.539065533878755, + "learning_rate": 4.797520661157025e-07, + "logits/chosen": -0.06982421875, + "logits/rejected": -0.2431640625, + "logps/chosen": -382.0, + "logps/rejected": -272.0, + "loss": 0.3077, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.140625, + "rewards/margins": 3.734375, + "rewards/rejected": -2.59375, + "step": 123 + }, + { + "epoch": 0.1521472392638037, + "grad_norm": 36.86795414024157, + "learning_rate": 4.795454545454545e-07, + "logits/chosen": -0.232421875, + "logits/rejected": -0.306640625, + "logps/chosen": -352.0, + "logps/rejected": -274.0, + "loss": 0.2623, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.75, + "rewards/margins": 4.53125, + "rewards/rejected": -2.78125, + "step": 124 + }, + { + "epoch": 0.15337423312883436, + "grad_norm": 41.75540815129781, + "learning_rate": 4.793388429752066e-07, + "logits/chosen": -0.29296875, + "logits/rejected": -0.47265625, + "logps/chosen": -434.0, + "logps/rejected": -320.0, + "loss": 0.2841, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.578125, + "rewards/margins": 4.5625, + "rewards/rejected": -2.984375, + "step": 125 + }, + { + "epoch": 0.15460122699386503, + "grad_norm": 80.39792909106652, + "learning_rate": 4.791322314049586e-07, + "logits/chosen": -0.16015625, + "logits/rejected": -0.353515625, + "logps/chosen": -366.0, + "logps/rejected": -296.0, + "loss": 0.3527, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.83203125, + "rewards/margins": 3.578125, + "rewards/rejected": -2.75, + "step": 126 + }, + { + "epoch": 0.1558282208588957, + "grad_norm": 40.94598816709626, + "learning_rate": 4.789256198347108e-07, + "logits/chosen": -0.1103515625, + "logits/rejected": -0.298828125, + "logps/chosen": -390.0, + "logps/rejected": -318.0, + "loss": 0.3476, + "rewards/accuracies": 0.7734375, + "rewards/chosen": 1.6640625, + "rewards/margins": 4.21875, + "rewards/rejected": -2.5625, + "step": 127 + }, + { + "epoch": 0.1570552147239264, + "grad_norm": 39.47992513478673, + "learning_rate": 4.787190082644627e-07, + "logits/chosen": -0.158203125, + "logits/rejected": -0.34765625, + "logps/chosen": -374.0, + "logps/rejected": -320.0, + "loss": 0.2814, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.5703125, + "rewards/margins": 4.3125, + "rewards/rejected": -2.75, + "step": 128 + }, + { + "epoch": 0.15828220858895706, + "grad_norm": 37.925898083738666, + "learning_rate": 4.785123966942149e-07, + "logits/chosen": -0.06396484375, + "logits/rejected": -0.1953125, + "logps/chosen": -338.0, + "logps/rejected": -278.0, + "loss": 0.3421, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.125, + "rewards/margins": 3.546875, + "rewards/rejected": -2.421875, + "step": 129 + }, + { + "epoch": 0.15950920245398773, + "grad_norm": 38.0262211895724, + "learning_rate": 4.783057851239669e-07, + "logits/chosen": -0.162109375, + "logits/rejected": -0.3046875, + "logps/chosen": -382.0, + "logps/rejected": -300.0, + "loss": 0.3115, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.1640625, + "rewards/margins": 3.96875, + "rewards/rejected": -2.8125, + "step": 130 + }, + { + "epoch": 0.1607361963190184, + "grad_norm": 35.33717303960686, + "learning_rate": 4.78099173553719e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.4140625, + "logps/chosen": -394.0, + "logps/rejected": -330.0, + "loss": 0.2154, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.6875, + "rewards/margins": 4.6875, + "rewards/rejected": -3.0, + "step": 131 + }, + { + "epoch": 0.1619631901840491, + "grad_norm": 40.955300358810696, + "learning_rate": 4.77892561983471e-07, + "logits/chosen": -0.234375, + "logits/rejected": -0.421875, + "logps/chosen": -390.0, + "logps/rejected": -312.0, + "loss": 0.314, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.484375, + "rewards/margins": 4.34375, + "rewards/rejected": -2.84375, + "step": 132 + }, + { + "epoch": 0.16319018404907976, + "grad_norm": 43.6440596613334, + "learning_rate": 4.776859504132231e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.4296875, + "logps/chosen": -384.0, + "logps/rejected": -318.0, + "loss": 0.2844, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.3671875, + "rewards/margins": 4.4375, + "rewards/rejected": -3.078125, + "step": 133 + }, + { + "epoch": 0.16441717791411042, + "grad_norm": 43.873623198146426, + "learning_rate": 4.774793388429752e-07, + "logits/chosen": -0.1953125, + "logits/rejected": -0.404296875, + "logps/chosen": -452.0, + "logps/rejected": -354.0, + "loss": 0.2948, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.3828125, + "rewards/margins": 3.96875, + "rewards/rejected": -2.59375, + "step": 134 + }, + { + "epoch": 0.1656441717791411, + "grad_norm": 44.973502848979926, + "learning_rate": 4.772727272727273e-07, + "logits/chosen": -0.0732421875, + "logits/rejected": -0.1865234375, + "logps/chosen": -372.0, + "logps/rejected": -308.0, + "loss": 0.3459, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.86328125, + "rewards/margins": 3.6875, + "rewards/rejected": -2.828125, + "step": 135 + }, + { + "epoch": 0.1668711656441718, + "grad_norm": 42.51816162906932, + "learning_rate": 4.770661157024793e-07, + "logits/chosen": -0.29296875, + "logits/rejected": -0.376953125, + "logps/chosen": -388.0, + "logps/rejected": -298.0, + "loss": 0.3308, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.2578125, + "rewards/margins": 4.34375, + "rewards/rejected": -3.078125, + "step": 136 + }, + { + "epoch": 0.16809815950920245, + "grad_norm": 48.104926340758944, + "learning_rate": 4.768595041322314e-07, + "logits/chosen": -0.080078125, + "logits/rejected": -0.2236328125, + "logps/chosen": -394.0, + "logps/rejected": -298.0, + "loss": 0.3458, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.125, + "rewards/margins": 3.640625, + "rewards/rejected": -2.515625, + "step": 137 + }, + { + "epoch": 0.16932515337423312, + "grad_norm": 38.354545275687684, + "learning_rate": 4.766528925619834e-07, + "logits/chosen": -0.1572265625, + "logits/rejected": -0.298828125, + "logps/chosen": -402.0, + "logps/rejected": -338.0, + "loss": 0.304, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.0078125, + "rewards/margins": 3.78125, + "rewards/rejected": -2.765625, + "step": 138 + }, + { + "epoch": 0.1705521472392638, + "grad_norm": 43.72111370882085, + "learning_rate": 4.764462809917355e-07, + "logits/chosen": -0.1494140625, + "logits/rejected": -0.32421875, + "logps/chosen": -414.0, + "logps/rejected": -356.0, + "loss": 0.3477, + "rewards/accuracies": 0.765625, + "rewards/chosen": 1.4453125, + "rewards/margins": 4.625, + "rewards/rejected": -3.171875, + "step": 139 + }, + { + "epoch": 0.17177914110429449, + "grad_norm": 49.390666427837495, + "learning_rate": 4.7623966942148756e-07, + "logits/chosen": -0.1201171875, + "logits/rejected": -0.3046875, + "logps/chosen": -422.0, + "logps/rejected": -354.0, + "loss": 0.3233, + "rewards/accuracies": 0.78125, + "rewards/chosen": 1.375, + "rewards/margins": 4.28125, + "rewards/rejected": -2.90625, + "step": 140 + }, + { + "epoch": 0.17300613496932515, + "grad_norm": 37.18049684192118, + "learning_rate": 4.7603305785123966e-07, + "logits/chosen": -0.10205078125, + "logits/rejected": -0.228515625, + "logps/chosen": -356.0, + "logps/rejected": -312.0, + "loss": 0.2587, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.3671875, + "rewards/margins": 4.1875, + "rewards/rejected": -2.8125, + "step": 141 + }, + { + "epoch": 0.17423312883435582, + "grad_norm": 38.15326329982988, + "learning_rate": 4.758264462809917e-07, + "logits/chosen": -0.134765625, + "logits/rejected": -0.32421875, + "logps/chosen": -396.0, + "logps/rejected": -330.0, + "loss": 0.3083, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.3984375, + "rewards/margins": 4.40625, + "rewards/rejected": -3.0, + "step": 142 + }, + { + "epoch": 0.1754601226993865, + "grad_norm": 42.239479521280984, + "learning_rate": 4.756198347107438e-07, + "logits/chosen": -0.1572265625, + "logits/rejected": -0.37890625, + "logps/chosen": -382.0, + "logps/rejected": -302.0, + "loss": 0.3086, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.0, + "rewards/margins": 4.15625, + "rewards/rejected": -3.140625, + "step": 143 + }, + { + "epoch": 0.17668711656441718, + "grad_norm": 36.71090019780343, + "learning_rate": 4.7541322314049586e-07, + "logits/chosen": -0.25, + "logits/rejected": -0.44140625, + "logps/chosen": -418.0, + "logps/rejected": -334.0, + "loss": 0.2799, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.7578125, + "rewards/margins": 4.75, + "rewards/rejected": -2.984375, + "step": 144 + }, + { + "epoch": 0.17791411042944785, + "grad_norm": 39.65398403637813, + "learning_rate": 4.7520661157024796e-07, + "logits/chosen": -0.2421875, + "logits/rejected": -0.390625, + "logps/chosen": -382.0, + "logps/rejected": -326.0, + "loss": 0.2858, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.5078125, + "rewards/margins": 4.46875, + "rewards/rejected": -2.953125, + "step": 145 + }, + { + "epoch": 0.17914110429447852, + "grad_norm": 36.72907127712686, + "learning_rate": 4.7499999999999995e-07, + "logits/chosen": -0.2236328125, + "logits/rejected": -0.33984375, + "logps/chosen": -384.0, + "logps/rejected": -310.0, + "loss": 0.2676, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 0.9375, + "rewards/margins": 4.09375, + "rewards/rejected": -3.15625, + "step": 146 + }, + { + "epoch": 0.18036809815950922, + "grad_norm": 35.42441477087175, + "learning_rate": 4.7479338842975205e-07, + "logits/chosen": -0.2255859375, + "logits/rejected": -0.37890625, + "logps/chosen": -388.0, + "logps/rejected": -310.0, + "loss": 0.275, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.5625, + "rewards/margins": 4.75, + "rewards/rejected": -3.203125, + "step": 147 + }, + { + "epoch": 0.18159509202453988, + "grad_norm": 51.82377713556493, + "learning_rate": 4.745867768595041e-07, + "logits/chosen": -0.25, + "logits/rejected": -0.384765625, + "logps/chosen": -414.0, + "logps/rejected": -344.0, + "loss": 0.3525, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.1171875, + "rewards/margins": 4.15625, + "rewards/rejected": -3.03125, + "step": 148 + }, + { + "epoch": 0.18282208588957055, + "grad_norm": 41.25940325564231, + "learning_rate": 4.743801652892562e-07, + "logits/chosen": -0.1279296875, + "logits/rejected": -0.29296875, + "logps/chosen": -406.0, + "logps/rejected": -362.0, + "loss": 0.253, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.734375, + "rewards/margins": 4.5625, + "rewards/rejected": -2.8125, + "step": 149 + }, + { + "epoch": 0.18404907975460122, + "grad_norm": 43.207544914218985, + "learning_rate": 4.7417355371900825e-07, + "logits/chosen": -0.1611328125, + "logits/rejected": -0.34375, + "logps/chosen": -424.0, + "logps/rejected": -328.0, + "loss": 0.3367, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.3984375, + "rewards/margins": 4.03125, + "rewards/rejected": -2.625, + "step": 150 + }, + { + "epoch": 0.18527607361963191, + "grad_norm": 42.2843854545005, + "learning_rate": 4.739669421487603e-07, + "logits/chosen": -0.1728515625, + "logits/rejected": -0.302734375, + "logps/chosen": -380.0, + "logps/rejected": -306.0, + "loss": 0.319, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.4453125, + "rewards/margins": 4.0625, + "rewards/rejected": -2.609375, + "step": 151 + }, + { + "epoch": 0.18650306748466258, + "grad_norm": 36.146243015735116, + "learning_rate": 4.737603305785124e-07, + "logits/chosen": -0.267578125, + "logits/rejected": -0.5078125, + "logps/chosen": -398.0, + "logps/rejected": -294.0, + "loss": 0.2584, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.203125, + "rewards/margins": 4.75, + "rewards/rejected": -3.546875, + "step": 152 + }, + { + "epoch": 0.18773006134969325, + "grad_norm": 38.30453694202532, + "learning_rate": 4.7355371900826444e-07, + "logits/chosen": -0.23828125, + "logits/rejected": -0.35546875, + "logps/chosen": -350.0, + "logps/rejected": -302.0, + "loss": 0.2846, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.265625, + "rewards/margins": 4.34375, + "rewards/rejected": -3.0625, + "step": 153 + }, + { + "epoch": 0.18895705521472392, + "grad_norm": 48.193035851495836, + "learning_rate": 4.7334710743801654e-07, + "logits/chosen": -0.11767578125, + "logits/rejected": -0.30859375, + "logps/chosen": -424.0, + "logps/rejected": -324.0, + "loss": 0.3123, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.703125, + "rewards/margins": 4.4375, + "rewards/rejected": -2.734375, + "step": 154 + }, + { + "epoch": 0.1901840490797546, + "grad_norm": 27.96292821117509, + "learning_rate": 4.7314049586776853e-07, + "logits/chosen": -0.2216796875, + "logits/rejected": -0.46875, + "logps/chosen": -384.0, + "logps/rejected": -302.0, + "loss": 0.1878, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 2.15625, + "rewards/margins": 5.40625, + "rewards/rejected": -3.25, + "step": 155 + }, + { + "epoch": 0.19141104294478528, + "grad_norm": 42.366226442840826, + "learning_rate": 4.7293388429752063e-07, + "logits/chosen": -0.1357421875, + "logits/rejected": -0.2470703125, + "logps/chosen": -370.0, + "logps/rejected": -332.0, + "loss": 0.2881, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.1796875, + "rewards/margins": 3.953125, + "rewards/rejected": -2.765625, + "step": 156 + }, + { + "epoch": 0.19263803680981595, + "grad_norm": 40.72999796402848, + "learning_rate": 4.727272727272727e-07, + "logits/chosen": -0.1376953125, + "logits/rejected": -0.263671875, + "logps/chosen": -396.0, + "logps/rejected": -292.0, + "loss": 0.2888, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.1953125, + "rewards/margins": 4.09375, + "rewards/rejected": -2.890625, + "step": 157 + }, + { + "epoch": 0.19386503067484662, + "grad_norm": 33.577674005153725, + "learning_rate": 4.725206611570248e-07, + "logits/chosen": -0.32421875, + "logits/rejected": -0.51171875, + "logps/chosen": -388.0, + "logps/rejected": -302.0, + "loss": 0.2863, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.3671875, + "rewards/margins": 4.53125, + "rewards/rejected": -3.15625, + "step": 158 + }, + { + "epoch": 0.1950920245398773, + "grad_norm": 43.09895886139825, + "learning_rate": 4.7231404958677683e-07, + "logits/chosen": -0.228515625, + "logits/rejected": -0.357421875, + "logps/chosen": -360.0, + "logps/rejected": -314.0, + "loss": 0.2941, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.40625, + "rewards/margins": 4.25, + "rewards/rejected": -2.84375, + "step": 159 + }, + { + "epoch": 0.19631901840490798, + "grad_norm": 33.061685198617056, + "learning_rate": 4.7210743801652893e-07, + "logits/chosen": -0.1201171875, + "logits/rejected": -0.345703125, + "logps/chosen": -354.0, + "logps/rejected": -290.0, + "loss": 0.2365, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.03125, + "rewards/margins": 4.125, + "rewards/rejected": -3.09375, + "step": 160 + }, + { + "epoch": 0.19754601226993865, + "grad_norm": 34.262461708297515, + "learning_rate": 4.71900826446281e-07, + "logits/chosen": -0.28515625, + "logits/rejected": -0.4921875, + "logps/chosen": -390.0, + "logps/rejected": -284.0, + "loss": 0.2321, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.6015625, + "rewards/margins": 4.6875, + "rewards/rejected": -3.078125, + "step": 161 + }, + { + "epoch": 0.19877300613496932, + "grad_norm": 46.44613400198569, + "learning_rate": 4.716942148760331e-07, + "logits/chosen": -0.2080078125, + "logits/rejected": -0.2890625, + "logps/chosen": -352.0, + "logps/rejected": -326.0, + "loss": 0.3532, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.234375, + "rewards/margins": 4.09375, + "rewards/rejected": -2.875, + "step": 162 + }, + { + "epoch": 0.2, + "grad_norm": 40.81709447673029, + "learning_rate": 4.7148760330578507e-07, + "logits/chosen": -0.146484375, + "logits/rejected": -0.296875, + "logps/chosen": -394.0, + "logps/rejected": -324.0, + "loss": 0.2919, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.3359375, + "rewards/margins": 4.15625, + "rewards/rejected": -2.8125, + "step": 163 + }, + { + "epoch": 0.20122699386503068, + "grad_norm": 30.76141719102355, + "learning_rate": 4.7128099173553717e-07, + "logits/chosen": -0.2890625, + "logits/rejected": -0.5234375, + "logps/chosen": -396.0, + "logps/rejected": -290.0, + "loss": 0.2276, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.828125, + "rewards/margins": 5.09375, + "rewards/rejected": -3.28125, + "step": 164 + }, + { + "epoch": 0.20245398773006135, + "grad_norm": 39.308244617085876, + "learning_rate": 4.710743801652892e-07, + "logits/chosen": -0.09228515625, + "logits/rejected": -0.298828125, + "logps/chosen": -442.0, + "logps/rejected": -306.0, + "loss": 0.2561, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.6328125, + "rewards/margins": 4.40625, + "rewards/rejected": -2.78125, + "step": 165 + }, + { + "epoch": 0.20368098159509201, + "grad_norm": 40.482102907615214, + "learning_rate": 4.708677685950413e-07, + "logits/chosen": -0.158203125, + "logits/rejected": -0.388671875, + "logps/chosen": -390.0, + "logps/rejected": -316.0, + "loss": 0.335, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.7890625, + "rewards/margins": 4.4375, + "rewards/rejected": -2.640625, + "step": 166 + }, + { + "epoch": 0.2049079754601227, + "grad_norm": 41.24091114160285, + "learning_rate": 4.7066115702479336e-07, + "logits/chosen": -0.13671875, + "logits/rejected": -0.291015625, + "logps/chosen": -402.0, + "logps/rejected": -298.0, + "loss": 0.3427, + "rewards/accuracies": 0.78125, + "rewards/chosen": 1.9609375, + "rewards/margins": 4.65625, + "rewards/rejected": -2.703125, + "step": 167 + }, + { + "epoch": 0.20613496932515338, + "grad_norm": 36.55347289055332, + "learning_rate": 4.704545454545454e-07, + "logits/chosen": -0.12158203125, + "logits/rejected": -0.236328125, + "logps/chosen": -348.0, + "logps/rejected": -270.0, + "loss": 0.2471, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.046875, + "rewards/margins": 4.3125, + "rewards/rejected": -3.265625, + "step": 168 + }, + { + "epoch": 0.20736196319018405, + "grad_norm": 42.227854487848845, + "learning_rate": 4.702479338842975e-07, + "logits/chosen": -0.1982421875, + "logits/rejected": -0.365234375, + "logps/chosen": -370.0, + "logps/rejected": -344.0, + "loss": 0.3043, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.03125, + "rewards/margins": 4.09375, + "rewards/rejected": -3.0625, + "step": 169 + }, + { + "epoch": 0.2085889570552147, + "grad_norm": 41.26301353968675, + "learning_rate": 4.7004132231404956e-07, + "logits/chosen": -0.1865234375, + "logits/rejected": -0.427734375, + "logps/chosen": -450.0, + "logps/rejected": -322.0, + "loss": 0.282, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.8671875, + "rewards/margins": 4.875, + "rewards/rejected": -3.015625, + "step": 170 + }, + { + "epoch": 0.2098159509202454, + "grad_norm": 32.40263540928059, + "learning_rate": 4.6983471074380166e-07, + "logits/chosen": -0.169921875, + "logits/rejected": -0.365234375, + "logps/chosen": -384.0, + "logps/rejected": -296.0, + "loss": 0.267, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.625, + "rewards/margins": 4.9375, + "rewards/rejected": -3.296875, + "step": 171 + }, + { + "epoch": 0.21104294478527608, + "grad_norm": 39.16155801484506, + "learning_rate": 4.6962809917355365e-07, + "logits/chosen": -0.1455078125, + "logits/rejected": -0.30859375, + "logps/chosen": -438.0, + "logps/rejected": -326.0, + "loss": 0.2624, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.828125, + "rewards/margins": 4.96875, + "rewards/rejected": -3.140625, + "step": 172 + }, + { + "epoch": 0.21226993865030674, + "grad_norm": 32.6638006062681, + "learning_rate": 4.6942148760330575e-07, + "logits/chosen": -0.2021484375, + "logits/rejected": -0.439453125, + "logps/chosen": -424.0, + "logps/rejected": -330.0, + "loss": 0.2304, + "rewards/accuracies": 0.859375, + "rewards/chosen": 2.015625, + "rewards/margins": 5.3125, + "rewards/rejected": -3.28125, + "step": 173 + }, + { + "epoch": 0.2134969325153374, + "grad_norm": 41.117611256664055, + "learning_rate": 4.692148760330578e-07, + "logits/chosen": -0.057861328125, + "logits/rejected": -0.265625, + "logps/chosen": -380.0, + "logps/rejected": -318.0, + "loss": 0.3128, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.28125, + "rewards/margins": 4.4375, + "rewards/rejected": -3.15625, + "step": 174 + }, + { + "epoch": 0.2147239263803681, + "grad_norm": 43.97682714628577, + "learning_rate": 4.690082644628099e-07, + "logits/chosen": -0.1943359375, + "logits/rejected": -0.333984375, + "logps/chosen": -396.0, + "logps/rejected": -336.0, + "loss": 0.3103, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.6796875, + "rewards/margins": 4.8125, + "rewards/rejected": -3.140625, + "step": 175 + }, + { + "epoch": 0.21595092024539878, + "grad_norm": 39.95318826911176, + "learning_rate": 4.6880165289256195e-07, + "logits/chosen": -0.23046875, + "logits/rejected": -0.419921875, + "logps/chosen": -432.0, + "logps/rejected": -346.0, + "loss": 0.3105, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.65625, + "rewards/margins": 4.875, + "rewards/rejected": -3.234375, + "step": 176 + }, + { + "epoch": 0.21717791411042944, + "grad_norm": 31.646657225559906, + "learning_rate": 4.6859504132231405e-07, + "logits/chosen": -0.1767578125, + "logits/rejected": -0.408203125, + "logps/chosen": -416.0, + "logps/rejected": -324.0, + "loss": 0.233, + "rewards/accuracies": 0.859375, + "rewards/chosen": 2.109375, + "rewards/margins": 5.5625, + "rewards/rejected": -3.46875, + "step": 177 + }, + { + "epoch": 0.2184049079754601, + "grad_norm": 41.80865379666853, + "learning_rate": 4.683884297520661e-07, + "logits/chosen": -0.173828125, + "logits/rejected": -0.322265625, + "logps/chosen": -326.0, + "logps/rejected": -288.0, + "loss": 0.3445, + "rewards/accuracies": 0.78125, + "rewards/chosen": 0.640625, + "rewards/margins": 4.28125, + "rewards/rejected": -3.640625, + "step": 178 + }, + { + "epoch": 0.2196319018404908, + "grad_norm": 33.273068108107914, + "learning_rate": 4.681818181818182e-07, + "logits/chosen": -0.2099609375, + "logits/rejected": -0.4140625, + "logps/chosen": -368.0, + "logps/rejected": -298.0, + "loss": 0.2545, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 0.8828125, + "rewards/margins": 4.4375, + "rewards/rejected": -3.546875, + "step": 179 + }, + { + "epoch": 0.22085889570552147, + "grad_norm": 41.89399116746023, + "learning_rate": 4.6797520661157024e-07, + "logits/chosen": -0.2099609375, + "logits/rejected": -0.333984375, + "logps/chosen": -356.0, + "logps/rejected": -292.0, + "loss": 0.3137, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.2421875, + "rewards/margins": 4.34375, + "rewards/rejected": -3.09375, + "step": 180 + }, + { + "epoch": 0.22208588957055214, + "grad_norm": 44.979423553734385, + "learning_rate": 4.677685950413223e-07, + "logits/chosen": -0.1962890625, + "logits/rejected": -0.35546875, + "logps/chosen": -412.0, + "logps/rejected": -364.0, + "loss": 0.3496, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.4296875, + "rewards/margins": 4.625, + "rewards/rejected": -3.1875, + "step": 181 + }, + { + "epoch": 0.2233128834355828, + "grad_norm": 41.75351319386413, + "learning_rate": 4.6756198347107434e-07, + "logits/chosen": -0.2275390625, + "logits/rejected": -0.36328125, + "logps/chosen": -372.0, + "logps/rejected": -306.0, + "loss": 0.3303, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.921875, + "rewards/margins": 4.09375, + "rewards/rejected": -3.15625, + "step": 182 + }, + { + "epoch": 0.2245398773006135, + "grad_norm": 46.40866345124908, + "learning_rate": 4.6735537190082644e-07, + "logits/chosen": -0.11376953125, + "logits/rejected": -0.30078125, + "logps/chosen": -412.0, + "logps/rejected": -368.0, + "loss": 0.3255, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.984375, + "rewards/margins": 3.953125, + "rewards/rejected": -2.96875, + "step": 183 + }, + { + "epoch": 0.22576687116564417, + "grad_norm": 46.76226224495867, + "learning_rate": 4.671487603305785e-07, + "logits/chosen": -0.146484375, + "logits/rejected": -0.267578125, + "logps/chosen": -390.0, + "logps/rejected": -328.0, + "loss": 0.3388, + "rewards/accuracies": 0.765625, + "rewards/chosen": 0.78515625, + "rewards/margins": 3.984375, + "rewards/rejected": -3.1875, + "step": 184 + }, + { + "epoch": 0.22699386503067484, + "grad_norm": 48.77760268554608, + "learning_rate": 4.669421487603306e-07, + "logits/chosen": -0.19140625, + "logits/rejected": -0.263671875, + "logps/chosen": -384.0, + "logps/rejected": -340.0, + "loss": 0.3219, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.6328125, + "rewards/margins": 4.5, + "rewards/rejected": -2.859375, + "step": 185 + }, + { + "epoch": 0.2282208588957055, + "grad_norm": 38.08873895580722, + "learning_rate": 4.6673553719008263e-07, + "logits/chosen": -0.203125, + "logits/rejected": -0.33203125, + "logps/chosen": -338.0, + "logps/rejected": -300.0, + "loss": 0.2901, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.3203125, + "rewards/margins": 4.4375, + "rewards/rejected": -3.109375, + "step": 186 + }, + { + "epoch": 0.2294478527607362, + "grad_norm": 40.67564497850856, + "learning_rate": 4.665289256198347e-07, + "logits/chosen": -0.1884765625, + "logits/rejected": -0.357421875, + "logps/chosen": -374.0, + "logps/rejected": -326.0, + "loss": 0.2813, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.265625, + "rewards/margins": 4.625, + "rewards/rejected": -3.359375, + "step": 187 + }, + { + "epoch": 0.23067484662576687, + "grad_norm": 35.35467709831456, + "learning_rate": 4.663223140495868e-07, + "logits/chosen": -0.09716796875, + "logits/rejected": -0.189453125, + "logps/chosen": -332.0, + "logps/rejected": -280.0, + "loss": 0.2813, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.3046875, + "rewards/margins": 4.40625, + "rewards/rejected": -3.109375, + "step": 188 + }, + { + "epoch": 0.23190184049079754, + "grad_norm": 32.02217527416385, + "learning_rate": 4.661157024793388e-07, + "logits/chosen": -0.1787109375, + "logits/rejected": -0.369140625, + "logps/chosen": -400.0, + "logps/rejected": -308.0, + "loss": 0.2159, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.6015625, + "rewards/margins": 4.9375, + "rewards/rejected": -3.34375, + "step": 189 + }, + { + "epoch": 0.2331288343558282, + "grad_norm": 35.517601629388636, + "learning_rate": 4.6590909090909087e-07, + "logits/chosen": -0.08154296875, + "logits/rejected": -0.2490234375, + "logps/chosen": -344.0, + "logps/rejected": -300.0, + "loss": 0.2873, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.1015625, + "rewards/margins": 4.125, + "rewards/rejected": -3.03125, + "step": 190 + }, + { + "epoch": 0.2343558282208589, + "grad_norm": 46.62318205281028, + "learning_rate": 4.657024793388429e-07, + "logits/chosen": -0.1484375, + "logits/rejected": -0.33203125, + "logps/chosen": -402.0, + "logps/rejected": -288.0, + "loss": 0.3248, + "rewards/accuracies": 0.796875, + "rewards/chosen": 1.6953125, + "rewards/margins": 4.90625, + "rewards/rejected": -3.203125, + "step": 191 + }, + { + "epoch": 0.23558282208588957, + "grad_norm": 47.302561931824144, + "learning_rate": 4.65495867768595e-07, + "logits/chosen": -0.16015625, + "logits/rejected": -0.36328125, + "logps/chosen": -386.0, + "logps/rejected": -284.0, + "loss": 0.3212, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.265625, + "rewards/margins": 4.03125, + "rewards/rejected": -2.75, + "step": 192 + }, + { + "epoch": 0.23680981595092024, + "grad_norm": 38.194528570730164, + "learning_rate": 4.6528925619834707e-07, + "logits/chosen": -0.27734375, + "logits/rejected": -0.5234375, + "logps/chosen": -410.0, + "logps/rejected": -322.0, + "loss": 0.2332, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.7109375, + "rewards/margins": 5.03125, + "rewards/rejected": -3.3125, + "step": 193 + }, + { + "epoch": 0.23803680981595093, + "grad_norm": 42.44224201595828, + "learning_rate": 4.6508264462809917e-07, + "logits/chosen": -0.32421875, + "logits/rejected": -0.44921875, + "logps/chosen": -394.0, + "logps/rejected": -312.0, + "loss": 0.3223, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.953125, + "rewards/margins": 4.5625, + "rewards/rejected": -3.59375, + "step": 194 + }, + { + "epoch": 0.2392638036809816, + "grad_norm": 34.0790216803257, + "learning_rate": 4.648760330578512e-07, + "logits/chosen": -0.1396484375, + "logits/rejected": -0.40625, + "logps/chosen": -410.0, + "logps/rejected": -322.0, + "loss": 0.219, + "rewards/accuracies": 0.859375, + "rewards/chosen": 2.0, + "rewards/margins": 5.5, + "rewards/rejected": -3.5, + "step": 195 + }, + { + "epoch": 0.24049079754601227, + "grad_norm": 43.004434879940106, + "learning_rate": 4.646694214876033e-07, + "logits/chosen": -0.11962890625, + "logits/rejected": -0.3203125, + "logps/chosen": -392.0, + "logps/rejected": -282.0, + "loss": 0.3054, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.296875, + "rewards/margins": 4.3125, + "rewards/rejected": -3.0, + "step": 196 + }, + { + "epoch": 0.24171779141104294, + "grad_norm": 34.15269412729779, + "learning_rate": 4.6446280991735536e-07, + "logits/chosen": -0.2265625, + "logits/rejected": -0.47265625, + "logps/chosen": -378.0, + "logps/rejected": -308.0, + "loss": 0.2756, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.671875, + "rewards/margins": 4.75, + "rewards/rejected": -3.09375, + "step": 197 + }, + { + "epoch": 0.24294478527607363, + "grad_norm": 36.78925425492936, + "learning_rate": 4.6425619834710746e-07, + "logits/chosen": -0.1630859375, + "logits/rejected": -0.255859375, + "logps/chosen": -342.0, + "logps/rejected": -250.0, + "loss": 0.2945, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.1640625, + "rewards/margins": 4.09375, + "rewards/rejected": -2.9375, + "step": 198 + }, + { + "epoch": 0.2441717791411043, + "grad_norm": 28.311028034096932, + "learning_rate": 4.6404958677685945e-07, + "logits/chosen": -0.18359375, + "logits/rejected": -0.388671875, + "logps/chosen": -430.0, + "logps/rejected": -300.0, + "loss": 0.2045, + "rewards/accuracies": 0.921875, + "rewards/chosen": 2.171875, + "rewards/margins": 5.28125, + "rewards/rejected": -3.125, + "step": 199 + }, + { + "epoch": 0.24539877300613497, + "grad_norm": 44.46315305804351, + "learning_rate": 4.6384297520661155e-07, + "logits/chosen": -0.1591796875, + "logits/rejected": -0.3828125, + "logps/chosen": -434.0, + "logps/rejected": -358.0, + "loss": 0.303, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.9921875, + "rewards/margins": 4.8125, + "rewards/rejected": -2.8125, + "step": 200 + }, + { + "epoch": 0.24662576687116564, + "grad_norm": 32.929953461927006, + "learning_rate": 4.636363636363636e-07, + "logits/chosen": -0.171875, + "logits/rejected": -0.396484375, + "logps/chosen": -396.0, + "logps/rejected": -300.0, + "loss": 0.2219, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.8203125, + "rewards/margins": 4.78125, + "rewards/rejected": -2.953125, + "step": 201 + }, + { + "epoch": 0.24785276073619633, + "grad_norm": 38.191540513799985, + "learning_rate": 4.634297520661157e-07, + "logits/chosen": -0.1484375, + "logits/rejected": -0.359375, + "logps/chosen": -424.0, + "logps/rejected": -310.0, + "loss": 0.2735, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.9453125, + "rewards/margins": 4.75, + "rewards/rejected": -2.8125, + "step": 202 + }, + { + "epoch": 0.249079754601227, + "grad_norm": 43.899916034277716, + "learning_rate": 4.6322314049586775e-07, + "logits/chosen": -0.12158203125, + "logits/rejected": -0.30078125, + "logps/chosen": -386.0, + "logps/rejected": -328.0, + "loss": 0.3715, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.7265625, + "rewards/margins": 4.1875, + "rewards/rejected": -2.46875, + "step": 203 + }, + { + "epoch": 0.25030674846625767, + "grad_norm": 40.42534652251951, + "learning_rate": 4.630165289256198e-07, + "logits/chosen": -0.10498046875, + "logits/rejected": -0.2490234375, + "logps/chosen": -346.0, + "logps/rejected": -262.0, + "loss": 0.314, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.5234375, + "rewards/margins": 4.4375, + "rewards/rejected": -2.921875, + "step": 204 + }, + { + "epoch": 0.25153374233128833, + "grad_norm": 37.717470986712556, + "learning_rate": 4.628099173553719e-07, + "logits/chosen": -0.059326171875, + "logits/rejected": -0.2001953125, + "logps/chosen": -380.0, + "logps/rejected": -290.0, + "loss": 0.3111, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.7578125, + "rewards/margins": 4.1875, + "rewards/rejected": -2.4375, + "step": 205 + }, + { + "epoch": 0.252760736196319, + "grad_norm": 30.55406782868523, + "learning_rate": 4.6260330578512394e-07, + "logits/chosen": -0.1494140625, + "logits/rejected": -0.431640625, + "logps/chosen": -426.0, + "logps/rejected": -320.0, + "loss": 0.2196, + "rewards/accuracies": 0.90625, + "rewards/chosen": 2.0625, + "rewards/margins": 5.28125, + "rewards/rejected": -3.21875, + "step": 206 + }, + { + "epoch": 0.25398773006134967, + "grad_norm": 44.99416041741556, + "learning_rate": 4.6239669421487604e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.474609375, + "logps/chosen": -424.0, + "logps/rejected": -346.0, + "loss": 0.3683, + "rewards/accuracies": 0.7734375, + "rewards/chosen": 2.09375, + "rewards/margins": 4.65625, + "rewards/rejected": -2.5625, + "step": 207 + }, + { + "epoch": 0.2552147239263804, + "grad_norm": 38.298643600670886, + "learning_rate": 4.6219008264462804e-07, + "logits/chosen": -0.2451171875, + "logits/rejected": -0.376953125, + "logps/chosen": -386.0, + "logps/rejected": -312.0, + "loss": 0.3077, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.78125, + "rewards/margins": 4.78125, + "rewards/rejected": -2.984375, + "step": 208 + }, + { + "epoch": 0.25644171779141106, + "grad_norm": 42.08974951434723, + "learning_rate": 4.6198347107438014e-07, + "logits/chosen": -0.236328125, + "logits/rejected": -0.369140625, + "logps/chosen": -388.0, + "logps/rejected": -326.0, + "loss": 0.3252, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.6328125, + "rewards/margins": 4.46875, + "rewards/rejected": -2.84375, + "step": 209 + }, + { + "epoch": 0.25766871165644173, + "grad_norm": 49.252789458115785, + "learning_rate": 4.617768595041322e-07, + "logits/chosen": -0.19140625, + "logits/rejected": -0.306640625, + "logps/chosen": -390.0, + "logps/rejected": -354.0, + "loss": 0.3478, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.3359375, + "rewards/margins": 4.15625, + "rewards/rejected": -2.8125, + "step": 210 + }, + { + "epoch": 0.2588957055214724, + "grad_norm": 35.19521189692808, + "learning_rate": 4.615702479338843e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.474609375, + "logps/chosen": -430.0, + "logps/rejected": -336.0, + "loss": 0.2943, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.7421875, + "rewards/margins": 5.0, + "rewards/rejected": -3.25, + "step": 211 + }, + { + "epoch": 0.26012269938650306, + "grad_norm": 38.588101334546415, + "learning_rate": 4.6136363636363633e-07, + "logits/chosen": -0.205078125, + "logits/rejected": -0.373046875, + "logps/chosen": -396.0, + "logps/rejected": -304.0, + "loss": 0.2772, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.8671875, + "rewards/margins": 5.09375, + "rewards/rejected": -3.234375, + "step": 212 + }, + { + "epoch": 0.26134969325153373, + "grad_norm": 36.19543986527335, + "learning_rate": 4.6115702479338843e-07, + "logits/chosen": -0.1533203125, + "logits/rejected": -0.228515625, + "logps/chosen": -344.0, + "logps/rejected": -274.0, + "loss": 0.2568, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.25, + "rewards/margins": 4.28125, + "rewards/rejected": -3.015625, + "step": 213 + }, + { + "epoch": 0.2625766871165644, + "grad_norm": 36.76253302400916, + "learning_rate": 4.609504132231405e-07, + "logits/chosen": -0.130859375, + "logits/rejected": -0.3046875, + "logps/chosen": -370.0, + "logps/rejected": -306.0, + "loss": 0.2624, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.6953125, + "rewards/margins": 4.84375, + "rewards/rejected": -3.125, + "step": 214 + }, + { + "epoch": 0.26380368098159507, + "grad_norm": 37.194255093432446, + "learning_rate": 4.607438016528926e-07, + "logits/chosen": -0.111328125, + "logits/rejected": -0.2138671875, + "logps/chosen": -350.0, + "logps/rejected": -296.0, + "loss": 0.2725, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.1484375, + "rewards/margins": 4.25, + "rewards/rejected": -3.09375, + "step": 215 + }, + { + "epoch": 0.2650306748466258, + "grad_norm": 37.819502778321414, + "learning_rate": 4.605371900826446e-07, + "logits/chosen": -0.166015625, + "logits/rejected": -0.291015625, + "logps/chosen": -330.0, + "logps/rejected": -284.0, + "loss": 0.2757, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.921875, + "rewards/margins": 4.03125, + "rewards/rejected": -3.109375, + "step": 216 + }, + { + "epoch": 0.26625766871165646, + "grad_norm": 38.426937338322844, + "learning_rate": 4.6033057851239667e-07, + "logits/chosen": -0.072265625, + "logits/rejected": -0.224609375, + "logps/chosen": -398.0, + "logps/rejected": -298.0, + "loss": 0.3129, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.6875, + "rewards/margins": 4.59375, + "rewards/rejected": -2.890625, + "step": 217 + }, + { + "epoch": 0.2674846625766871, + "grad_norm": 48.711804010557216, + "learning_rate": 4.601239669421487e-07, + "logits/chosen": -0.12255859375, + "logits/rejected": -0.2412109375, + "logps/chosen": -380.0, + "logps/rejected": -326.0, + "loss": 0.3689, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.125, + "rewards/margins": 4.0625, + "rewards/rejected": -2.9375, + "step": 218 + }, + { + "epoch": 0.2687116564417178, + "grad_norm": 34.859463323248626, + "learning_rate": 4.599173553719008e-07, + "logits/chosen": -0.2158203125, + "logits/rejected": -0.328125, + "logps/chosen": -350.0, + "logps/rejected": -292.0, + "loss": 0.2779, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.09375, + "rewards/margins": 4.59375, + "rewards/rejected": -3.5, + "step": 219 + }, + { + "epoch": 0.26993865030674846, + "grad_norm": 46.80026994213379, + "learning_rate": 4.5971074380165287e-07, + "logits/chosen": -0.07568359375, + "logits/rejected": -0.1572265625, + "logps/chosen": -362.0, + "logps/rejected": -354.0, + "loss": 0.3534, + "rewards/accuracies": 0.765625, + "rewards/chosen": 0.79296875, + "rewards/margins": 3.765625, + "rewards/rejected": -2.96875, + "step": 220 + }, + { + "epoch": 0.27116564417177913, + "grad_norm": 44.236722785199355, + "learning_rate": 4.595041322314049e-07, + "logits/chosen": -0.1669921875, + "logits/rejected": -0.375, + "logps/chosen": -362.0, + "logps/rejected": -288.0, + "loss": 0.3432, + "rewards/accuracies": 0.7734375, + "rewards/chosen": 0.8125, + "rewards/margins": 4.28125, + "rewards/rejected": -3.46875, + "step": 221 + }, + { + "epoch": 0.2723926380368098, + "grad_norm": 37.55504945465003, + "learning_rate": 4.59297520661157e-07, + "logits/chosen": -0.33203125, + "logits/rejected": -0.482421875, + "logps/chosen": -386.0, + "logps/rejected": -298.0, + "loss": 0.2529, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.5703125, + "rewards/margins": 5.46875, + "rewards/rejected": -3.890625, + "step": 222 + }, + { + "epoch": 0.27361963190184047, + "grad_norm": 51.564475699604486, + "learning_rate": 4.5909090909090906e-07, + "logits/chosen": -0.154296875, + "logits/rejected": -0.33984375, + "logps/chosen": -386.0, + "logps/rejected": -316.0, + "loss": 0.3058, + "rewards/accuracies": 0.796875, + "rewards/chosen": 0.953125, + "rewards/margins": 4.25, + "rewards/rejected": -3.3125, + "step": 223 + }, + { + "epoch": 0.2748466257668712, + "grad_norm": 43.15791338185834, + "learning_rate": 4.5888429752066116e-07, + "logits/chosen": -0.248046875, + "logits/rejected": -0.435546875, + "logps/chosen": -450.0, + "logps/rejected": -332.0, + "loss": 0.2807, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.4609375, + "rewards/margins": 5.28125, + "rewards/rejected": -3.84375, + "step": 224 + }, + { + "epoch": 0.27607361963190186, + "grad_norm": 35.879838019408076, + "learning_rate": 4.586776859504132e-07, + "logits/chosen": -0.1279296875, + "logits/rejected": -0.328125, + "logps/chosen": -340.0, + "logps/rejected": -300.0, + "loss": 0.2506, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.92578125, + "rewards/margins": 4.84375, + "rewards/rejected": -3.921875, + "step": 225 + }, + { + "epoch": 0.2773006134969325, + "grad_norm": 44.55257679536464, + "learning_rate": 4.5847107438016525e-07, + "logits/chosen": -0.142578125, + "logits/rejected": -0.287109375, + "logps/chosen": -374.0, + "logps/rejected": -308.0, + "loss": 0.3177, + "rewards/accuracies": 0.78125, + "rewards/chosen": 1.203125, + "rewards/margins": 4.78125, + "rewards/rejected": -3.59375, + "step": 226 + }, + { + "epoch": 0.2785276073619632, + "grad_norm": 43.069867055252956, + "learning_rate": 4.582644628099173e-07, + "logits/chosen": -0.17578125, + "logits/rejected": -0.259765625, + "logps/chosen": -360.0, + "logps/rejected": -312.0, + "loss": 0.2933, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.95703125, + "rewards/margins": 4.84375, + "rewards/rejected": -3.875, + "step": 227 + }, + { + "epoch": 0.27975460122699386, + "grad_norm": 59.89729428981541, + "learning_rate": 4.580578512396694e-07, + "logits/chosen": -0.185546875, + "logits/rejected": -0.375, + "logps/chosen": -366.0, + "logps/rejected": -320.0, + "loss": 0.324, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.62109375, + "rewards/margins": 4.34375, + "rewards/rejected": -3.703125, + "step": 228 + }, + { + "epoch": 0.2809815950920245, + "grad_norm": 41.26714714905276, + "learning_rate": 4.5785123966942145e-07, + "logits/chosen": -0.1025390625, + "logits/rejected": -0.310546875, + "logps/chosen": -424.0, + "logps/rejected": -332.0, + "loss": 0.27, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.484375, + "rewards/margins": 4.65625, + "rewards/rejected": -3.171875, + "step": 229 + }, + { + "epoch": 0.2822085889570552, + "grad_norm": 33.72568576392679, + "learning_rate": 4.5764462809917355e-07, + "logits/chosen": -0.08935546875, + "logits/rejected": -0.28125, + "logps/chosen": -376.0, + "logps/rejected": -318.0, + "loss": 0.235, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.9765625, + "rewards/margins": 4.71875, + "rewards/rejected": -3.75, + "step": 230 + }, + { + "epoch": 0.28343558282208586, + "grad_norm": 42.97736121941397, + "learning_rate": 4.574380165289256e-07, + "logits/chosen": -0.1689453125, + "logits/rejected": -0.287109375, + "logps/chosen": -370.0, + "logps/rejected": -306.0, + "loss": 0.3436, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.0234375, + "rewards/margins": 4.3125, + "rewards/rejected": -3.296875, + "step": 231 + }, + { + "epoch": 0.2846625766871166, + "grad_norm": 42.93355591121654, + "learning_rate": 4.572314049586777e-07, + "logits/chosen": -0.2314453125, + "logits/rejected": -0.373046875, + "logps/chosen": -386.0, + "logps/rejected": -330.0, + "loss": 0.3127, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.5546875, + "rewards/margins": 4.3125, + "rewards/rejected": -3.75, + "step": 232 + }, + { + "epoch": 0.28588957055214725, + "grad_norm": 37.7852023248725, + "learning_rate": 4.5702479338842974e-07, + "logits/chosen": -0.1318359375, + "logits/rejected": -0.361328125, + "logps/chosen": -374.0, + "logps/rejected": -286.0, + "loss": 0.2759, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.21875, + "rewards/margins": 5.03125, + "rewards/rejected": -3.8125, + "step": 233 + }, + { + "epoch": 0.2871165644171779, + "grad_norm": 38.62852043438936, + "learning_rate": 4.5681818181818184e-07, + "logits/chosen": -0.267578125, + "logits/rejected": -0.400390625, + "logps/chosen": -374.0, + "logps/rejected": -310.0, + "loss": 0.2764, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.1640625, + "rewards/margins": 4.75, + "rewards/rejected": -3.578125, + "step": 234 + }, + { + "epoch": 0.2883435582822086, + "grad_norm": 37.335415454122945, + "learning_rate": 4.5661157024793384e-07, + "logits/chosen": -0.283203125, + "logits/rejected": -0.439453125, + "logps/chosen": -362.0, + "logps/rejected": -316.0, + "loss": 0.2629, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.1953125, + "rewards/margins": 4.84375, + "rewards/rejected": -3.640625, + "step": 235 + }, + { + "epoch": 0.28957055214723926, + "grad_norm": 55.00073114295456, + "learning_rate": 4.5640495867768594e-07, + "logits/chosen": -0.04736328125, + "logits/rejected": -0.232421875, + "logps/chosen": -398.0, + "logps/rejected": -364.0, + "loss": 0.374, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.6015625, + "rewards/margins": 4.46875, + "rewards/rejected": -2.859375, + "step": 236 + }, + { + "epoch": 0.2907975460122699, + "grad_norm": 34.92202343855084, + "learning_rate": 4.56198347107438e-07, + "logits/chosen": -0.189453125, + "logits/rejected": -0.34375, + "logps/chosen": -370.0, + "logps/rejected": -302.0, + "loss": 0.252, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.3515625, + "rewards/margins": 4.9375, + "rewards/rejected": -3.578125, + "step": 237 + }, + { + "epoch": 0.2920245398773006, + "grad_norm": 42.067317323205096, + "learning_rate": 4.559917355371901e-07, + "logits/chosen": -0.205078125, + "logits/rejected": -0.3671875, + "logps/chosen": -426.0, + "logps/rejected": -346.0, + "loss": 0.3198, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.4453125, + "rewards/margins": 4.78125, + "rewards/rejected": -3.34375, + "step": 238 + }, + { + "epoch": 0.29325153374233126, + "grad_norm": 41.04109475522015, + "learning_rate": 4.5578512396694213e-07, + "logits/chosen": -0.21484375, + "logits/rejected": -0.408203125, + "logps/chosen": -384.0, + "logps/rejected": -304.0, + "loss": 0.3007, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.78125, + "rewards/margins": 5.28125, + "rewards/rejected": -3.515625, + "step": 239 + }, + { + "epoch": 0.294478527607362, + "grad_norm": 42.47439204624692, + "learning_rate": 4.555785123966942e-07, + "logits/chosen": -0.2265625, + "logits/rejected": -0.380859375, + "logps/chosen": -422.0, + "logps/rejected": -352.0, + "loss": 0.2516, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.6171875, + "rewards/margins": 5.46875, + "rewards/rejected": -3.859375, + "step": 240 + }, + { + "epoch": 0.29570552147239265, + "grad_norm": 38.63581064698526, + "learning_rate": 4.553719008264463e-07, + "logits/chosen": -0.169921875, + "logits/rejected": -0.306640625, + "logps/chosen": -366.0, + "logps/rejected": -326.0, + "loss": 0.2718, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.7109375, + "rewards/margins": 5.21875, + "rewards/rejected": -3.5, + "step": 241 + }, + { + "epoch": 0.2969325153374233, + "grad_norm": 31.580876023766372, + "learning_rate": 4.551652892561983e-07, + "logits/chosen": -0.1826171875, + "logits/rejected": -0.349609375, + "logps/chosen": -350.0, + "logps/rejected": -310.0, + "loss": 0.2369, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.171875, + "rewards/margins": 5.21875, + "rewards/rejected": -4.03125, + "step": 242 + }, + { + "epoch": 0.298159509202454, + "grad_norm": 38.48835239358082, + "learning_rate": 4.5495867768595037e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.4140625, + "logps/chosen": -392.0, + "logps/rejected": -358.0, + "loss": 0.2935, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.1171875, + "rewards/margins": 4.78125, + "rewards/rejected": -3.671875, + "step": 243 + }, + { + "epoch": 0.29938650306748466, + "grad_norm": 41.633020456629765, + "learning_rate": 4.547520661157024e-07, + "logits/chosen": -0.25390625, + "logits/rejected": -0.47265625, + "logps/chosen": -386.0, + "logps/rejected": -340.0, + "loss": 0.3582, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.140625, + "rewards/margins": 4.65625, + "rewards/rejected": -3.5, + "step": 244 + }, + { + "epoch": 0.3006134969325153, + "grad_norm": 36.05397433070667, + "learning_rate": 4.545454545454545e-07, + "logits/chosen": -0.220703125, + "logits/rejected": -0.369140625, + "logps/chosen": -404.0, + "logps/rejected": -344.0, + "loss": 0.234, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.4453125, + "rewards/margins": 5.09375, + "rewards/rejected": -3.65625, + "step": 245 + }, + { + "epoch": 0.301840490797546, + "grad_norm": 38.58934325410754, + "learning_rate": 4.5433884297520657e-07, + "logits/chosen": -0.224609375, + "logits/rejected": -0.390625, + "logps/chosen": -378.0, + "logps/rejected": -338.0, + "loss": 0.2805, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.765625, + "rewards/margins": 5.40625, + "rewards/rejected": -3.65625, + "step": 246 + }, + { + "epoch": 0.3030674846625767, + "grad_norm": 46.170807958237866, + "learning_rate": 4.5413223140495867e-07, + "logits/chosen": -0.224609375, + "logits/rejected": -0.408203125, + "logps/chosen": -376.0, + "logps/rejected": -298.0, + "loss": 0.3061, + "rewards/accuracies": 0.796875, + "rewards/chosen": 0.875, + "rewards/margins": 4.71875, + "rewards/rejected": -3.828125, + "step": 247 + }, + { + "epoch": 0.3042944785276074, + "grad_norm": 40.70518240157979, + "learning_rate": 4.539256198347107e-07, + "logits/chosen": -0.1474609375, + "logits/rejected": -0.396484375, + "logps/chosen": -394.0, + "logps/rejected": -324.0, + "loss": 0.2562, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.234375, + "rewards/margins": 4.71875, + "rewards/rejected": -3.46875, + "step": 248 + }, + { + "epoch": 0.30552147239263805, + "grad_norm": 43.152905506219625, + "learning_rate": 4.537190082644628e-07, + "logits/chosen": -0.26953125, + "logits/rejected": -0.466796875, + "logps/chosen": -480.0, + "logps/rejected": -362.0, + "loss": 0.274, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.9375, + "rewards/margins": 5.5625, + "rewards/rejected": -3.625, + "step": 249 + }, + { + "epoch": 0.3067484662576687, + "grad_norm": 39.51182461700564, + "learning_rate": 4.5351239669421486e-07, + "logits/chosen": -0.349609375, + "logits/rejected": -0.423828125, + "logps/chosen": -342.0, + "logps/rejected": -316.0, + "loss": 0.2913, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.97265625, + "rewards/margins": 4.59375, + "rewards/rejected": -3.625, + "step": 250 + }, + { + "epoch": 0.3079754601226994, + "grad_norm": 47.42800586657486, + "learning_rate": 4.5330578512396696e-07, + "logits/chosen": -0.055908203125, + "logits/rejected": -0.228515625, + "logps/chosen": -378.0, + "logps/rejected": -298.0, + "loss": 0.3574, + "rewards/accuracies": 0.765625, + "rewards/chosen": 1.1171875, + "rewards/margins": 4.1875, + "rewards/rejected": -3.046875, + "step": 251 + }, + { + "epoch": 0.30920245398773005, + "grad_norm": 38.9167492571078, + "learning_rate": 4.5309917355371896e-07, + "logits/chosen": -0.2216796875, + "logits/rejected": -0.37109375, + "logps/chosen": -396.0, + "logps/rejected": -304.0, + "loss": 0.2806, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.5078125, + "rewards/margins": 4.75, + "rewards/rejected": -3.234375, + "step": 252 + }, + { + "epoch": 0.3104294478527607, + "grad_norm": 31.88015147725951, + "learning_rate": 4.5289256198347106e-07, + "logits/chosen": -0.22265625, + "logits/rejected": -0.453125, + "logps/chosen": -340.0, + "logps/rejected": -288.0, + "loss": 0.2435, + "rewards/accuracies": 0.90625, + "rewards/chosen": 1.109375, + "rewards/margins": 4.78125, + "rewards/rejected": -3.6875, + "step": 253 + }, + { + "epoch": 0.3116564417177914, + "grad_norm": 41.38320327055996, + "learning_rate": 4.526859504132231e-07, + "logits/chosen": -0.166015625, + "logits/rejected": -0.328125, + "logps/chosen": -356.0, + "logps/rejected": -312.0, + "loss": 0.3288, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.3515625, + "rewards/margins": 4.84375, + "rewards/rejected": -3.46875, + "step": 254 + }, + { + "epoch": 0.3128834355828221, + "grad_norm": 39.369898300453734, + "learning_rate": 4.524793388429752e-07, + "logits/chosen": -0.1572265625, + "logits/rejected": -0.318359375, + "logps/chosen": -386.0, + "logps/rejected": -304.0, + "loss": 0.3362, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.5625, + "rewards/margins": 4.59375, + "rewards/rejected": -3.046875, + "step": 255 + }, + { + "epoch": 0.3141104294478528, + "grad_norm": 32.76851278241994, + "learning_rate": 4.5227272727272725e-07, + "logits/chosen": -0.20703125, + "logits/rejected": -0.376953125, + "logps/chosen": -350.0, + "logps/rejected": -304.0, + "loss": 0.2341, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.9765625, + "rewards/margins": 5.40625, + "rewards/rejected": -3.4375, + "step": 256 + }, + { + "epoch": 0.31533742331288345, + "grad_norm": 45.250746891569236, + "learning_rate": 4.520661157024793e-07, + "logits/chosen": -0.2080078125, + "logits/rejected": -0.359375, + "logps/chosen": -430.0, + "logps/rejected": -344.0, + "loss": 0.3181, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.7734375, + "rewards/margins": 4.875, + "rewards/rejected": -3.109375, + "step": 257 + }, + { + "epoch": 0.3165644171779141, + "grad_norm": 35.04986410208359, + "learning_rate": 4.518595041322314e-07, + "logits/chosen": -0.1552734375, + "logits/rejected": -0.33984375, + "logps/chosen": -400.0, + "logps/rejected": -326.0, + "loss": 0.2317, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.59375, + "rewards/margins": 4.90625, + "rewards/rejected": -3.296875, + "step": 258 + }, + { + "epoch": 0.3177914110429448, + "grad_norm": 34.37988001182442, + "learning_rate": 4.5165289256198344e-07, + "logits/chosen": -0.2099609375, + "logits/rejected": -0.404296875, + "logps/chosen": -346.0, + "logps/rejected": -338.0, + "loss": 0.2627, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.1953125, + "rewards/margins": 4.625, + "rewards/rejected": -3.40625, + "step": 259 + }, + { + "epoch": 0.31901840490797545, + "grad_norm": 39.73259510340199, + "learning_rate": 4.5144628099173554e-07, + "logits/chosen": -0.2353515625, + "logits/rejected": -0.326171875, + "logps/chosen": -388.0, + "logps/rejected": -306.0, + "loss": 0.2938, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.375, + "rewards/margins": 4.53125, + "rewards/rejected": -3.171875, + "step": 260 + }, + { + "epoch": 0.3202453987730061, + "grad_norm": 42.63140351827292, + "learning_rate": 4.5123966942148754e-07, + "logits/chosen": -0.1708984375, + "logits/rejected": -0.322265625, + "logps/chosen": -378.0, + "logps/rejected": -308.0, + "loss": 0.2956, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.4453125, + "rewards/margins": 4.65625, + "rewards/rejected": -3.203125, + "step": 261 + }, + { + "epoch": 0.3214723926380368, + "grad_norm": 48.00556286038852, + "learning_rate": 4.5103305785123964e-07, + "logits/chosen": -0.2109375, + "logits/rejected": -0.40234375, + "logps/chosen": -384.0, + "logps/rejected": -320.0, + "loss": 0.3166, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.9609375, + "rewards/margins": 5.03125, + "rewards/rejected": -3.0625, + "step": 262 + }, + { + "epoch": 0.3226993865030675, + "grad_norm": 41.40798456165999, + "learning_rate": 4.508264462809917e-07, + "logits/chosen": -0.197265625, + "logits/rejected": -0.32421875, + "logps/chosen": -366.0, + "logps/rejected": -302.0, + "loss": 0.2953, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.125, + "rewards/margins": 4.03125, + "rewards/rejected": -2.921875, + "step": 263 + }, + { + "epoch": 0.3239263803680982, + "grad_norm": 39.73351721310888, + "learning_rate": 4.506198347107438e-07, + "logits/chosen": -0.1611328125, + "logits/rejected": -0.275390625, + "logps/chosen": -350.0, + "logps/rejected": -286.0, + "loss": 0.3138, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.3359375, + "rewards/margins": 4.3125, + "rewards/rejected": -2.96875, + "step": 264 + }, + { + "epoch": 0.32515337423312884, + "grad_norm": 39.72934408632108, + "learning_rate": 4.5041322314049583e-07, + "logits/chosen": -0.166015625, + "logits/rejected": -0.326171875, + "logps/chosen": -354.0, + "logps/rejected": -262.0, + "loss": 0.2712, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.3359375, + "rewards/margins": 4.53125, + "rewards/rejected": -3.1875, + "step": 265 + }, + { + "epoch": 0.3263803680981595, + "grad_norm": 47.72732688002189, + "learning_rate": 4.5020661157024793e-07, + "logits/chosen": -0.142578125, + "logits/rejected": -0.291015625, + "logps/chosen": -316.0, + "logps/rejected": -290.0, + "loss": 0.3794, + "rewards/accuracies": 0.7734375, + "rewards/chosen": 0.64453125, + "rewards/margins": 3.625, + "rewards/rejected": -2.984375, + "step": 266 + }, + { + "epoch": 0.3276073619631902, + "grad_norm": 52.825089270201424, + "learning_rate": 4.5e-07, + "logits/chosen": -0.16796875, + "logits/rejected": -0.384765625, + "logps/chosen": -400.0, + "logps/rejected": -294.0, + "loss": 0.3429, + "rewards/accuracies": 0.796875, + "rewards/chosen": 1.6796875, + "rewards/margins": 4.40625, + "rewards/rejected": -2.734375, + "step": 267 + }, + { + "epoch": 0.32883435582822085, + "grad_norm": 35.92749837261359, + "learning_rate": 4.497933884297521e-07, + "logits/chosen": -0.306640625, + "logits/rejected": -0.419921875, + "logps/chosen": -384.0, + "logps/rejected": -308.0, + "loss": 0.2275, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.5078125, + "rewards/margins": 4.625, + "rewards/rejected": -3.109375, + "step": 268 + }, + { + "epoch": 0.3300613496932515, + "grad_norm": 35.81499005195925, + "learning_rate": 4.4958677685950413e-07, + "logits/chosen": -0.203125, + "logits/rejected": -0.50390625, + "logps/chosen": -402.0, + "logps/rejected": -290.0, + "loss": 0.2385, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.6796875, + "rewards/margins": 4.90625, + "rewards/rejected": -3.25, + "step": 269 + }, + { + "epoch": 0.3312883435582822, + "grad_norm": 44.38655671717473, + "learning_rate": 4.493801652892562e-07, + "logits/chosen": -0.2109375, + "logits/rejected": -0.328125, + "logps/chosen": -326.0, + "logps/rejected": -282.0, + "loss": 0.345, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.15625, + "rewards/margins": 3.71875, + "rewards/rejected": -2.5625, + "step": 270 + }, + { + "epoch": 0.3325153374233129, + "grad_norm": 34.101391505637224, + "learning_rate": 4.491735537190082e-07, + "logits/chosen": -0.22265625, + "logits/rejected": -0.341796875, + "logps/chosen": -384.0, + "logps/rejected": -312.0, + "loss": 0.2456, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 2.078125, + "rewards/margins": 4.875, + "rewards/rejected": -2.796875, + "step": 271 + }, + { + "epoch": 0.3337423312883436, + "grad_norm": 36.8738947032395, + "learning_rate": 4.489669421487603e-07, + "logits/chosen": -0.12353515625, + "logits/rejected": -0.291015625, + "logps/chosen": -358.0, + "logps/rejected": -284.0, + "loss": 0.2495, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.25, + "rewards/margins": 4.21875, + "rewards/rejected": -2.984375, + "step": 272 + }, + { + "epoch": 0.33496932515337424, + "grad_norm": 44.70898948794442, + "learning_rate": 4.4876033057851237e-07, + "logits/chosen": -0.07470703125, + "logits/rejected": -0.1611328125, + "logps/chosen": -334.0, + "logps/rejected": -286.0, + "loss": 0.3884, + "rewards/accuracies": 0.78125, + "rewards/chosen": 1.1796875, + "rewards/margins": 3.90625, + "rewards/rejected": -2.734375, + "step": 273 + }, + { + "epoch": 0.3361963190184049, + "grad_norm": 42.40600245146773, + "learning_rate": 4.4855371900826447e-07, + "logits/chosen": -0.0927734375, + "logits/rejected": -0.2421875, + "logps/chosen": -400.0, + "logps/rejected": -316.0, + "loss": 0.3338, + "rewards/accuracies": 0.796875, + "rewards/chosen": 1.8046875, + "rewards/margins": 4.28125, + "rewards/rejected": -2.484375, + "step": 274 + }, + { + "epoch": 0.3374233128834356, + "grad_norm": 40.8103963168886, + "learning_rate": 4.483471074380165e-07, + "logits/chosen": -0.1552734375, + "logits/rejected": -0.263671875, + "logps/chosen": -316.0, + "logps/rejected": -296.0, + "loss": 0.2999, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.4765625, + "rewards/margins": 4.15625, + "rewards/rejected": -2.6875, + "step": 275 + }, + { + "epoch": 0.33865030674846625, + "grad_norm": 31.049107272836952, + "learning_rate": 4.4814049586776856e-07, + "logits/chosen": -0.08154296875, + "logits/rejected": -0.291015625, + "logps/chosen": -376.0, + "logps/rejected": -298.0, + "loss": 0.2799, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.5703125, + "rewards/margins": 4.3125, + "rewards/rejected": -2.75, + "step": 276 + }, + { + "epoch": 0.3398773006134969, + "grad_norm": 32.630832893605, + "learning_rate": 4.4793388429752066e-07, + "logits/chosen": -0.244140625, + "logits/rejected": -0.443359375, + "logps/chosen": -404.0, + "logps/rejected": -312.0, + "loss": 0.2319, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 2.171875, + "rewards/margins": 5.1875, + "rewards/rejected": -3.0, + "step": 277 + }, + { + "epoch": 0.3411042944785276, + "grad_norm": 44.309610437735856, + "learning_rate": 4.477272727272727e-07, + "logits/chosen": -0.1689453125, + "logits/rejected": -0.2373046875, + "logps/chosen": -376.0, + "logps/rejected": -328.0, + "loss": 0.2724, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.640625, + "rewards/margins": 4.46875, + "rewards/rejected": -2.828125, + "step": 278 + }, + { + "epoch": 0.3423312883435583, + "grad_norm": 26.353655721882397, + "learning_rate": 4.4752066115702476e-07, + "logits/chosen": -0.21484375, + "logits/rejected": -0.400390625, + "logps/chosen": -380.0, + "logps/rejected": -290.0, + "loss": 0.1863, + "rewards/accuracies": 0.9453125, + "rewards/chosen": 1.7578125, + "rewards/margins": 4.96875, + "rewards/rejected": -3.21875, + "step": 279 + }, + { + "epoch": 0.34355828220858897, + "grad_norm": 44.718053283042785, + "learning_rate": 4.473140495867768e-07, + "logits/chosen": -0.2001953125, + "logits/rejected": -0.365234375, + "logps/chosen": -396.0, + "logps/rejected": -342.0, + "loss": 0.3351, + "rewards/accuracies": 0.7734375, + "rewards/chosen": 1.953125, + "rewards/margins": 5.125, + "rewards/rejected": -3.171875, + "step": 280 + }, + { + "epoch": 0.34478527607361964, + "grad_norm": 42.34591075354157, + "learning_rate": 4.471074380165289e-07, + "logits/chosen": -0.1484375, + "logits/rejected": -0.34765625, + "logps/chosen": -374.0, + "logps/rejected": -306.0, + "loss": 0.3447, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.4375, + "rewards/margins": 4.125, + "rewards/rejected": -2.6875, + "step": 281 + }, + { + "epoch": 0.3460122699386503, + "grad_norm": 41.75221231669429, + "learning_rate": 4.4690082644628095e-07, + "logits/chosen": -0.30859375, + "logits/rejected": -0.46875, + "logps/chosen": -336.0, + "logps/rejected": -298.0, + "loss": 0.2518, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.71875, + "rewards/margins": 5.25, + "rewards/rejected": -3.515625, + "step": 282 + }, + { + "epoch": 0.347239263803681, + "grad_norm": 33.916128769423274, + "learning_rate": 4.4669421487603305e-07, + "logits/chosen": -0.3359375, + "logits/rejected": -0.44921875, + "logps/chosen": -348.0, + "logps/rejected": -274.0, + "loss": 0.2746, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.3203125, + "rewards/margins": 4.375, + "rewards/rejected": -3.046875, + "step": 283 + }, + { + "epoch": 0.34846625766871164, + "grad_norm": 35.84425714657199, + "learning_rate": 4.464876033057851e-07, + "logits/chosen": -0.1572265625, + "logits/rejected": -0.3046875, + "logps/chosen": -364.0, + "logps/rejected": -294.0, + "loss": 0.2426, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.484375, + "rewards/margins": 4.78125, + "rewards/rejected": -3.296875, + "step": 284 + }, + { + "epoch": 0.3496932515337423, + "grad_norm": 31.897221284753925, + "learning_rate": 4.462809917355372e-07, + "logits/chosen": -0.2373046875, + "logits/rejected": -0.453125, + "logps/chosen": -354.0, + "logps/rejected": -304.0, + "loss": 0.2458, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.5078125, + "rewards/margins": 5.03125, + "rewards/rejected": -3.515625, + "step": 285 + }, + { + "epoch": 0.350920245398773, + "grad_norm": 40.0301906925459, + "learning_rate": 4.4607438016528924e-07, + "logits/chosen": -0.1708984375, + "logits/rejected": -0.3828125, + "logps/chosen": -414.0, + "logps/rejected": -332.0, + "loss": 0.3071, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.5234375, + "rewards/margins": 5.21875, + "rewards/rejected": -3.703125, + "step": 286 + }, + { + "epoch": 0.3521472392638037, + "grad_norm": 50.881866049082234, + "learning_rate": 4.4586776859504135e-07, + "logits/chosen": -0.26171875, + "logits/rejected": -0.419921875, + "logps/chosen": -376.0, + "logps/rejected": -308.0, + "loss": 0.288, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.0703125, + "rewards/margins": 4.625, + "rewards/rejected": -3.546875, + "step": 287 + }, + { + "epoch": 0.35337423312883437, + "grad_norm": 37.27905667507029, + "learning_rate": 4.4566115702479334e-07, + "logits/chosen": -0.08642578125, + "logits/rejected": -0.2392578125, + "logps/chosen": -380.0, + "logps/rejected": -312.0, + "loss": 0.2887, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.99609375, + "rewards/margins": 4.25, + "rewards/rejected": -3.265625, + "step": 288 + }, + { + "epoch": 0.35460122699386504, + "grad_norm": 38.51669077378738, + "learning_rate": 4.4545454545454544e-07, + "logits/chosen": -0.2158203125, + "logits/rejected": -0.357421875, + "logps/chosen": -398.0, + "logps/rejected": -302.0, + "loss": 0.2274, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.484375, + "rewards/margins": 5.4375, + "rewards/rejected": -3.9375, + "step": 289 + }, + { + "epoch": 0.3558282208588957, + "grad_norm": 39.101756003947045, + "learning_rate": 4.452479338842975e-07, + "logits/chosen": -0.3828125, + "logits/rejected": -0.53125, + "logps/chosen": -372.0, + "logps/rejected": -324.0, + "loss": 0.197, + "rewards/accuracies": 0.921875, + "rewards/chosen": 1.375, + "rewards/margins": 5.65625, + "rewards/rejected": -4.28125, + "step": 290 + }, + { + "epoch": 0.3570552147239264, + "grad_norm": 35.84563757340601, + "learning_rate": 4.450413223140496e-07, + "logits/chosen": -0.3125, + "logits/rejected": -0.44921875, + "logps/chosen": -390.0, + "logps/rejected": -320.0, + "loss": 0.264, + "rewards/accuracies": 0.828125, + "rewards/chosen": 2.03125, + "rewards/margins": 5.5625, + "rewards/rejected": -3.515625, + "step": 291 + }, + { + "epoch": 0.35828220858895704, + "grad_norm": 48.83799779484981, + "learning_rate": 4.4483471074380163e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.5078125, + "logps/chosen": -402.0, + "logps/rejected": -324.0, + "loss": 0.2282, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.15625, + "rewards/margins": 5.125, + "rewards/rejected": -3.96875, + "step": 292 + }, + { + "epoch": 0.3595092024539877, + "grad_norm": 33.24417072591366, + "learning_rate": 4.446280991735537e-07, + "logits/chosen": -0.2080078125, + "logits/rejected": -0.400390625, + "logps/chosen": -376.0, + "logps/rejected": -306.0, + "loss": 0.236, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 0.74609375, + "rewards/margins": 4.90625, + "rewards/rejected": -4.15625, + "step": 293 + }, + { + "epoch": 0.36073619631901843, + "grad_norm": 33.17016716719111, + "learning_rate": 4.444214876033058e-07, + "logits/chosen": -0.443359375, + "logits/rejected": -0.59765625, + "logps/chosen": -464.0, + "logps/rejected": -342.0, + "loss": 0.2358, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.3828125, + "rewards/margins": 5.84375, + "rewards/rejected": -4.46875, + "step": 294 + }, + { + "epoch": 0.3619631901840491, + "grad_norm": 41.08997488080215, + "learning_rate": 4.4421487603305783e-07, + "logits/chosen": -0.1689453125, + "logits/rejected": -0.3203125, + "logps/chosen": -350.0, + "logps/rejected": -308.0, + "loss": 0.2229, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.81640625, + "rewards/margins": 5.0, + "rewards/rejected": -4.1875, + "step": 295 + }, + { + "epoch": 0.36319018404907977, + "grad_norm": 36.46585175010118, + "learning_rate": 4.4400826446280993e-07, + "logits/chosen": -0.14453125, + "logits/rejected": -0.30859375, + "logps/chosen": -418.0, + "logps/rejected": -320.0, + "loss": 0.2845, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.421875, + "rewards/margins": 5.03125, + "rewards/rejected": -3.609375, + "step": 296 + }, + { + "epoch": 0.36441717791411044, + "grad_norm": 30.507553736995185, + "learning_rate": 4.438016528925619e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.447265625, + "logps/chosen": -356.0, + "logps/rejected": -300.0, + "loss": 0.2352, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.203125, + "rewards/margins": 5.125, + "rewards/rejected": -3.9375, + "step": 297 + }, + { + "epoch": 0.3656441717791411, + "grad_norm": 42.744426202574054, + "learning_rate": 4.43595041322314e-07, + "logits/chosen": -0.1513671875, + "logits/rejected": -0.2578125, + "logps/chosen": -380.0, + "logps/rejected": -316.0, + "loss": 0.2875, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.9609375, + "rewards/margins": 4.53125, + "rewards/rejected": -3.5625, + "step": 298 + }, + { + "epoch": 0.36687116564417177, + "grad_norm": 57.11420288456295, + "learning_rate": 4.4338842975206607e-07, + "logits/chosen": -0.189453125, + "logits/rejected": -0.3671875, + "logps/chosen": -392.0, + "logps/rejected": -312.0, + "loss": 0.3303, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.53515625, + "rewards/margins": 4.40625, + "rewards/rejected": -3.859375, + "step": 299 + }, + { + "epoch": 0.36809815950920244, + "grad_norm": 44.0642342343628, + "learning_rate": 4.4318181818181817e-07, + "logits/chosen": -0.2890625, + "logits/rejected": -0.451171875, + "logps/chosen": -364.0, + "logps/rejected": -306.0, + "loss": 0.2951, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.1328125, + "rewards/margins": 5.15625, + "rewards/rejected": -4.03125, + "step": 300 + }, + { + "epoch": 0.3693251533742331, + "grad_norm": 36.50971474693751, + "learning_rate": 4.429752066115702e-07, + "logits/chosen": -0.2314453125, + "logits/rejected": -0.4296875, + "logps/chosen": -454.0, + "logps/rejected": -362.0, + "loss": 0.2791, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.546875, + "rewards/margins": 5.53125, + "rewards/rejected": -3.984375, + "step": 301 + }, + { + "epoch": 0.37055214723926383, + "grad_norm": 31.988576378738134, + "learning_rate": 4.427685950413223e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.46875, + "logps/chosen": -374.0, + "logps/rejected": -292.0, + "loss": 0.2208, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.0859375, + "rewards/margins": 5.0625, + "rewards/rejected": -3.984375, + "step": 302 + }, + { + "epoch": 0.3717791411042945, + "grad_norm": 46.63040649021854, + "learning_rate": 4.4256198347107436e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.390625, + "logps/chosen": -378.0, + "logps/rejected": -350.0, + "loss": 0.3215, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.625, + "rewards/margins": 4.75, + "rewards/rejected": -4.125, + "step": 303 + }, + { + "epoch": 0.37300613496932516, + "grad_norm": 38.26286144297621, + "learning_rate": 4.4235537190082646e-07, + "logits/chosen": -0.162109375, + "logits/rejected": -0.412109375, + "logps/chosen": -384.0, + "logps/rejected": -306.0, + "loss": 0.244, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.109375, + "rewards/margins": 5.28125, + "rewards/rejected": -4.15625, + "step": 304 + }, + { + "epoch": 0.37423312883435583, + "grad_norm": 36.3552235356213, + "learning_rate": 4.421487603305785e-07, + "logits/chosen": -0.2392578125, + "logits/rejected": -0.38671875, + "logps/chosen": -404.0, + "logps/rejected": -312.0, + "loss": 0.2568, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.4140625, + "rewards/margins": 5.625, + "rewards/rejected": -4.21875, + "step": 305 + }, + { + "epoch": 0.3754601226993865, + "grad_norm": 40.279423014087726, + "learning_rate": 4.4194214876033056e-07, + "logits/chosen": -0.322265625, + "logits/rejected": -0.484375, + "logps/chosen": -416.0, + "logps/rejected": -334.0, + "loss": 0.2584, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.1171875, + "rewards/margins": 5.0, + "rewards/rejected": -3.890625, + "step": 306 + }, + { + "epoch": 0.37668711656441717, + "grad_norm": 39.63802917296688, + "learning_rate": 4.417355371900826e-07, + "logits/chosen": -0.1884765625, + "logits/rejected": -0.333984375, + "logps/chosen": -368.0, + "logps/rejected": -314.0, + "loss": 0.3214, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.2578125, + "rewards/margins": 5.25, + "rewards/rejected": -4.0, + "step": 307 + }, + { + "epoch": 0.37791411042944784, + "grad_norm": 38.40390766672212, + "learning_rate": 4.415289256198347e-07, + "logits/chosen": -0.1513671875, + "logits/rejected": -0.3125, + "logps/chosen": -384.0, + "logps/rejected": -328.0, + "loss": 0.3262, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.95703125, + "rewards/margins": 4.28125, + "rewards/rejected": -3.3125, + "step": 308 + }, + { + "epoch": 0.3791411042944785, + "grad_norm": 32.4379821627175, + "learning_rate": 4.4132231404958675e-07, + "logits/chosen": -0.3046875, + "logits/rejected": -0.419921875, + "logps/chosen": -378.0, + "logps/rejected": -326.0, + "loss": 0.2098, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.625, + "rewards/margins": 5.6875, + "rewards/rejected": -4.03125, + "step": 309 + }, + { + "epoch": 0.3803680981595092, + "grad_norm": 40.47301853181884, + "learning_rate": 4.411157024793388e-07, + "logits/chosen": -0.107421875, + "logits/rejected": -0.205078125, + "logps/chosen": -310.0, + "logps/rejected": -284.0, + "loss": 0.3181, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.32421875, + "rewards/margins": 4.0, + "rewards/rejected": -3.6875, + "step": 310 + }, + { + "epoch": 0.3815950920245399, + "grad_norm": 33.919361023276416, + "learning_rate": 4.409090909090909e-07, + "logits/chosen": -0.267578125, + "logits/rejected": -0.443359375, + "logps/chosen": -382.0, + "logps/rejected": -316.0, + "loss": 0.2306, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.5625, + "rewards/margins": 5.6875, + "rewards/rejected": -4.125, + "step": 311 + }, + { + "epoch": 0.38282208588957056, + "grad_norm": 48.72311046374392, + "learning_rate": 4.4070247933884295e-07, + "logits/chosen": -0.1376953125, + "logits/rejected": -0.2734375, + "logps/chosen": -382.0, + "logps/rejected": -350.0, + "loss": 0.3689, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.1953125, + "rewards/margins": 4.59375, + "rewards/rejected": -3.40625, + "step": 312 + }, + { + "epoch": 0.38404907975460123, + "grad_norm": 32.93519257063822, + "learning_rate": 4.4049586776859505e-07, + "logits/chosen": -0.134765625, + "logits/rejected": -0.41015625, + "logps/chosen": -400.0, + "logps/rejected": -342.0, + "loss": 0.2417, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 2.171875, + "rewards/margins": 6.09375, + "rewards/rejected": -3.90625, + "step": 313 + }, + { + "epoch": 0.3852760736196319, + "grad_norm": 29.761092790659628, + "learning_rate": 4.402892561983471e-07, + "logits/chosen": -0.1689453125, + "logits/rejected": -0.359375, + "logps/chosen": -454.0, + "logps/rejected": -330.0, + "loss": 0.1846, + "rewards/accuracies": 0.890625, + "rewards/chosen": 2.515625, + "rewards/margins": 6.71875, + "rewards/rejected": -4.1875, + "step": 314 + }, + { + "epoch": 0.38650306748466257, + "grad_norm": 33.15936964822026, + "learning_rate": 4.4008264462809914e-07, + "logits/chosen": -0.06982421875, + "logits/rejected": -0.259765625, + "logps/chosen": -342.0, + "logps/rejected": -274.0, + "loss": 0.2307, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.0078125, + "rewards/margins": 4.875, + "rewards/rejected": -3.859375, + "step": 315 + }, + { + "epoch": 0.38773006134969323, + "grad_norm": 30.385645470245766, + "learning_rate": 4.398760330578512e-07, + "logits/chosen": -0.07666015625, + "logits/rejected": -0.2197265625, + "logps/chosen": -354.0, + "logps/rejected": -280.0, + "loss": 0.2284, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.2890625, + "rewards/margins": 5.375, + "rewards/rejected": -4.09375, + "step": 316 + }, + { + "epoch": 0.3889570552147239, + "grad_norm": 34.30838449187616, + "learning_rate": 4.396694214876033e-07, + "logits/chosen": -0.1982421875, + "logits/rejected": -0.4140625, + "logps/chosen": -394.0, + "logps/rejected": -342.0, + "loss": 0.2337, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.46875, + "rewards/margins": 5.90625, + "rewards/rejected": -4.4375, + "step": 317 + }, + { + "epoch": 0.3901840490797546, + "grad_norm": 43.51216041497958, + "learning_rate": 4.3946280991735533e-07, + "logits/chosen": -0.2431640625, + "logits/rejected": -0.41015625, + "logps/chosen": -398.0, + "logps/rejected": -340.0, + "loss": 0.3148, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.4140625, + "rewards/margins": 5.03125, + "rewards/rejected": -3.625, + "step": 318 + }, + { + "epoch": 0.3914110429447853, + "grad_norm": 23.822105871778678, + "learning_rate": 4.3925619834710743e-07, + "logits/chosen": -0.1689453125, + "logits/rejected": -0.359375, + "logps/chosen": -410.0, + "logps/rejected": -292.0, + "loss": 0.157, + "rewards/accuracies": 0.90625, + "rewards/chosen": 1.59375, + "rewards/margins": 6.34375, + "rewards/rejected": -4.75, + "step": 319 + }, + { + "epoch": 0.39263803680981596, + "grad_norm": 37.656689387782905, + "learning_rate": 4.390495867768595e-07, + "logits/chosen": -0.1806640625, + "logits/rejected": -0.291015625, + "logps/chosen": -316.0, + "logps/rejected": -262.0, + "loss": 0.2576, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.8046875, + "rewards/margins": 5.03125, + "rewards/rejected": -4.21875, + "step": 320 + }, + { + "epoch": 0.39386503067484663, + "grad_norm": 47.198644192326896, + "learning_rate": 4.388429752066116e-07, + "logits/chosen": -0.287109375, + "logits/rejected": -0.4609375, + "logps/chosen": -404.0, + "logps/rejected": -372.0, + "loss": 0.2837, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.03125, + "rewards/margins": 5.8125, + "rewards/rejected": -4.78125, + "step": 321 + }, + { + "epoch": 0.3950920245398773, + "grad_norm": 35.22081458129445, + "learning_rate": 4.3863636363636363e-07, + "logits/chosen": -0.2119140625, + "logits/rejected": -0.369140625, + "logps/chosen": -392.0, + "logps/rejected": -306.0, + "loss": 0.2397, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.5, + "rewards/margins": 5.84375, + "rewards/rejected": -4.34375, + "step": 322 + }, + { + "epoch": 0.39631901840490796, + "grad_norm": 40.535682371905, + "learning_rate": 4.3842975206611573e-07, + "logits/chosen": -0.25, + "logits/rejected": -0.38671875, + "logps/chosen": -350.0, + "logps/rejected": -316.0, + "loss": 0.3459, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.9453125, + "rewards/margins": 4.5625, + "rewards/rejected": -3.609375, + "step": 323 + }, + { + "epoch": 0.39754601226993863, + "grad_norm": 34.724438451994665, + "learning_rate": 4.382231404958677e-07, + "logits/chosen": -0.283203125, + "logits/rejected": -0.453125, + "logps/chosen": -354.0, + "logps/rejected": -306.0, + "loss": 0.2659, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.8671875, + "rewards/margins": 5.46875, + "rewards/rejected": -4.59375, + "step": 324 + }, + { + "epoch": 0.3987730061349693, + "grad_norm": 47.440215471486304, + "learning_rate": 4.380165289256198e-07, + "logits/chosen": -0.14453125, + "logits/rejected": -0.228515625, + "logps/chosen": -328.0, + "logps/rejected": -284.0, + "loss": 0.383, + "rewards/accuracies": 0.796875, + "rewards/chosen": 0.53515625, + "rewards/margins": 4.5, + "rewards/rejected": -3.96875, + "step": 325 + }, + { + "epoch": 0.4, + "grad_norm": 36.66273937163835, + "learning_rate": 4.3780991735537187e-07, + "logits/chosen": -0.31640625, + "logits/rejected": -0.462890625, + "logps/chosen": -398.0, + "logps/rejected": -350.0, + "loss": 0.2043, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.7265625, + "rewards/margins": 6.21875, + "rewards/rejected": -4.46875, + "step": 326 + }, + { + "epoch": 0.4012269938650307, + "grad_norm": 51.442585409024396, + "learning_rate": 4.3760330578512397e-07, + "logits/chosen": -0.2119140625, + "logits/rejected": -0.390625, + "logps/chosen": -428.0, + "logps/rejected": -334.0, + "loss": 0.3681, + "rewards/accuracies": 0.796875, + "rewards/chosen": 1.2265625, + "rewards/margins": 4.65625, + "rewards/rejected": -3.4375, + "step": 327 + }, + { + "epoch": 0.40245398773006136, + "grad_norm": 44.606600240172085, + "learning_rate": 4.37396694214876e-07, + "logits/chosen": -0.2431640625, + "logits/rejected": -0.376953125, + "logps/chosen": -360.0, + "logps/rejected": -268.0, + "loss": 0.3204, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.59375, + "rewards/margins": 4.59375, + "rewards/rejected": -4.0, + "step": 328 + }, + { + "epoch": 0.403680981595092, + "grad_norm": 36.3592106715033, + "learning_rate": 4.3719008264462806e-07, + "logits/chosen": -0.1884765625, + "logits/rejected": -0.396484375, + "logps/chosen": -458.0, + "logps/rejected": -358.0, + "loss": 0.2828, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.765625, + "rewards/margins": 6.28125, + "rewards/rejected": -4.5, + "step": 329 + }, + { + "epoch": 0.4049079754601227, + "grad_norm": 36.0973250750226, + "learning_rate": 4.3698347107438016e-07, + "logits/chosen": -0.318359375, + "logits/rejected": -0.52734375, + "logps/chosen": -412.0, + "logps/rejected": -326.0, + "loss": 0.2257, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.609375, + "rewards/margins": 6.125, + "rewards/rejected": -4.53125, + "step": 330 + }, + { + "epoch": 0.40613496932515336, + "grad_norm": 35.83835721797351, + "learning_rate": 4.367768595041322e-07, + "logits/chosen": -0.2890625, + "logits/rejected": -0.40234375, + "logps/chosen": -404.0, + "logps/rejected": -334.0, + "loss": 0.2402, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.59375, + "rewards/margins": 5.75, + "rewards/rejected": -4.15625, + "step": 331 + }, + { + "epoch": 0.40736196319018403, + "grad_norm": 29.00587176168557, + "learning_rate": 4.3657024793388426e-07, + "logits/chosen": -0.29296875, + "logits/rejected": -0.482421875, + "logps/chosen": -424.0, + "logps/rejected": -308.0, + "loss": 0.2051, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.703125, + "rewards/margins": 6.03125, + "rewards/rejected": -4.3125, + "step": 332 + }, + { + "epoch": 0.4085889570552147, + "grad_norm": 37.2793403072948, + "learning_rate": 4.363636363636363e-07, + "logits/chosen": -0.12158203125, + "logits/rejected": -0.251953125, + "logps/chosen": -364.0, + "logps/rejected": -322.0, + "loss": 0.2787, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.265625, + "rewards/margins": 4.96875, + "rewards/rejected": -3.6875, + "step": 333 + }, + { + "epoch": 0.4098159509202454, + "grad_norm": 37.233291436969324, + "learning_rate": 4.361570247933884e-07, + "logits/chosen": -0.2255859375, + "logits/rejected": -0.4609375, + "logps/chosen": -372.0, + "logps/rejected": -336.0, + "loss": 0.263, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.40625, + "rewards/margins": 5.78125, + "rewards/rejected": -4.375, + "step": 334 + }, + { + "epoch": 0.4110429447852761, + "grad_norm": 40.307147676871146, + "learning_rate": 4.3595041322314045e-07, + "logits/chosen": -0.162109375, + "logits/rejected": -0.408203125, + "logps/chosen": -424.0, + "logps/rejected": -304.0, + "loss": 0.2393, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.109375, + "rewards/margins": 5.03125, + "rewards/rejected": -3.9375, + "step": 335 + }, + { + "epoch": 0.41226993865030676, + "grad_norm": 35.98003323778127, + "learning_rate": 4.3574380165289255e-07, + "logits/chosen": -0.3046875, + "logits/rejected": -0.45703125, + "logps/chosen": -392.0, + "logps/rejected": -324.0, + "loss": 0.2573, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.265625, + "rewards/margins": 5.3125, + "rewards/rejected": -4.03125, + "step": 336 + }, + { + "epoch": 0.4134969325153374, + "grad_norm": 47.71731749469287, + "learning_rate": 4.355371900826446e-07, + "logits/chosen": -0.10595703125, + "logits/rejected": -0.275390625, + "logps/chosen": -348.0, + "logps/rejected": -322.0, + "loss": 0.3291, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.1484375, + "rewards/margins": 4.96875, + "rewards/rejected": -3.828125, + "step": 337 + }, + { + "epoch": 0.4147239263803681, + "grad_norm": 40.237231718518984, + "learning_rate": 4.353305785123967e-07, + "logits/chosen": -0.1484375, + "logits/rejected": -0.302734375, + "logps/chosen": -380.0, + "logps/rejected": -324.0, + "loss": 0.3113, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.2890625, + "rewards/margins": 5.0625, + "rewards/rejected": -3.78125, + "step": 338 + }, + { + "epoch": 0.41595092024539876, + "grad_norm": 43.74604259781836, + "learning_rate": 4.3512396694214875e-07, + "logits/chosen": -0.08935546875, + "logits/rejected": -0.2275390625, + "logps/chosen": -366.0, + "logps/rejected": -318.0, + "loss": 0.3036, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.109375, + "rewards/margins": 4.90625, + "rewards/rejected": -3.796875, + "step": 339 + }, + { + "epoch": 0.4171779141104294, + "grad_norm": 40.57164499134951, + "learning_rate": 4.3491735537190085e-07, + "logits/chosen": -0.1826171875, + "logits/rejected": -0.40625, + "logps/chosen": -354.0, + "logps/rejected": -324.0, + "loss": 0.2623, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.046875, + "rewards/margins": 4.75, + "rewards/rejected": -3.703125, + "step": 340 + }, + { + "epoch": 0.41840490797546015, + "grad_norm": 35.445167805912895, + "learning_rate": 4.3471074380165284e-07, + "logits/chosen": -0.22265625, + "logits/rejected": -0.4453125, + "logps/chosen": -388.0, + "logps/rejected": -308.0, + "loss": 0.2979, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.4296875, + "rewards/margins": 5.65625, + "rewards/rejected": -4.21875, + "step": 341 + }, + { + "epoch": 0.4196319018404908, + "grad_norm": 43.283231525706334, + "learning_rate": 4.3450413223140494e-07, + "logits/chosen": -0.1865234375, + "logits/rejected": -0.2890625, + "logps/chosen": -330.0, + "logps/rejected": -296.0, + "loss": 0.3065, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.015625, + "rewards/margins": 4.71875, + "rewards/rejected": -3.703125, + "step": 342 + }, + { + "epoch": 0.4208588957055215, + "grad_norm": 41.84183041867056, + "learning_rate": 4.34297520661157e-07, + "logits/chosen": -0.2001953125, + "logits/rejected": -0.310546875, + "logps/chosen": -374.0, + "logps/rejected": -330.0, + "loss": 0.3363, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.0859375, + "rewards/margins": 4.40625, + "rewards/rejected": -3.328125, + "step": 343 + }, + { + "epoch": 0.42208588957055215, + "grad_norm": 40.634867535224096, + "learning_rate": 4.340909090909091e-07, + "logits/chosen": -0.2080078125, + "logits/rejected": -0.349609375, + "logps/chosen": -398.0, + "logps/rejected": -318.0, + "loss": 0.3062, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.0859375, + "rewards/margins": 4.625, + "rewards/rejected": -3.515625, + "step": 344 + }, + { + "epoch": 0.4233128834355828, + "grad_norm": 44.35750118248226, + "learning_rate": 4.3388429752066114e-07, + "logits/chosen": -0.1875, + "logits/rejected": -0.380859375, + "logps/chosen": -404.0, + "logps/rejected": -314.0, + "loss": 0.3386, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.3046875, + "rewards/margins": 4.96875, + "rewards/rejected": -3.671875, + "step": 345 + }, + { + "epoch": 0.4245398773006135, + "grad_norm": 39.322612546267074, + "learning_rate": 4.336776859504132e-07, + "logits/chosen": -0.1953125, + "logits/rejected": -0.3828125, + "logps/chosen": -332.0, + "logps/rejected": -280.0, + "loss": 0.3136, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.015625, + "rewards/margins": 4.5625, + "rewards/rejected": -3.546875, + "step": 346 + }, + { + "epoch": 0.42576687116564416, + "grad_norm": 30.94392895882633, + "learning_rate": 4.334710743801653e-07, + "logits/chosen": -0.2099609375, + "logits/rejected": -0.34765625, + "logps/chosen": -358.0, + "logps/rejected": -332.0, + "loss": 0.2331, + "rewards/accuracies": 0.90625, + "rewards/chosen": 1.296875, + "rewards/margins": 4.78125, + "rewards/rejected": -3.484375, + "step": 347 + }, + { + "epoch": 0.4269938650306748, + "grad_norm": 32.258435591671414, + "learning_rate": 4.3326446280991733e-07, + "logits/chosen": -0.244140625, + "logits/rejected": -0.455078125, + "logps/chosen": -410.0, + "logps/rejected": -300.0, + "loss": 0.2507, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.0625, + "rewards/margins": 5.71875, + "rewards/rejected": -4.65625, + "step": 348 + }, + { + "epoch": 0.42822085889570555, + "grad_norm": 35.47879422672426, + "learning_rate": 4.3305785123966943e-07, + "logits/chosen": -0.2412109375, + "logits/rejected": -0.38671875, + "logps/chosen": -394.0, + "logps/rejected": -296.0, + "loss": 0.2708, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.1875, + "rewards/margins": 5.4375, + "rewards/rejected": -4.25, + "step": 349 + }, + { + "epoch": 0.4294478527607362, + "grad_norm": 41.30786537567203, + "learning_rate": 4.328512396694214e-07, + "logits/chosen": -0.1103515625, + "logits/rejected": -0.3046875, + "logps/chosen": -398.0, + "logps/rejected": -292.0, + "loss": 0.2859, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.3828125, + "rewards/margins": 4.6875, + "rewards/rejected": -3.296875, + "step": 350 + }, + { + "epoch": 0.4306748466257669, + "grad_norm": 40.51120105706657, + "learning_rate": 4.326446280991735e-07, + "logits/chosen": -0.265625, + "logits/rejected": -0.412109375, + "logps/chosen": -332.0, + "logps/rejected": -302.0, + "loss": 0.3046, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.875, + "rewards/margins": 4.6875, + "rewards/rejected": -3.796875, + "step": 351 + }, + { + "epoch": 0.43190184049079755, + "grad_norm": 41.727810614577876, + "learning_rate": 4.3243801652892557e-07, + "logits/chosen": -0.1845703125, + "logits/rejected": -0.388671875, + "logps/chosen": -378.0, + "logps/rejected": -312.0, + "loss": 0.3119, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.8203125, + "rewards/margins": 4.875, + "rewards/rejected": -3.0625, + "step": 352 + }, + { + "epoch": 0.4331288343558282, + "grad_norm": 31.222074641479136, + "learning_rate": 4.3223140495867767e-07, + "logits/chosen": -0.23828125, + "logits/rejected": -0.4140625, + "logps/chosen": -354.0, + "logps/rejected": -304.0, + "loss": 0.2275, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.6484375, + "rewards/margins": 5.5625, + "rewards/rejected": -3.90625, + "step": 353 + }, + { + "epoch": 0.4343558282208589, + "grad_norm": 36.249821649908675, + "learning_rate": 4.320247933884297e-07, + "logits/chosen": -0.1630859375, + "logits/rejected": -0.34375, + "logps/chosen": -432.0, + "logps/rejected": -354.0, + "loss": 0.281, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 2.046875, + "rewards/margins": 5.0625, + "rewards/rejected": -3.03125, + "step": 354 + }, + { + "epoch": 0.43558282208588955, + "grad_norm": 40.95221006715783, + "learning_rate": 4.318181818181818e-07, + "logits/chosen": -0.30859375, + "logits/rejected": -0.41015625, + "logps/chosen": -338.0, + "logps/rejected": -332.0, + "loss": 0.3157, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.3203125, + "rewards/margins": 4.90625, + "rewards/rejected": -3.5625, + "step": 355 + }, + { + "epoch": 0.4368098159509202, + "grad_norm": 36.1989317653681, + "learning_rate": 4.3161157024793386e-07, + "logits/chosen": -0.11962890625, + "logits/rejected": -0.259765625, + "logps/chosen": -386.0, + "logps/rejected": -308.0, + "loss": 0.3022, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.5, + "rewards/margins": 4.5625, + "rewards/rejected": -3.046875, + "step": 356 + }, + { + "epoch": 0.43803680981595094, + "grad_norm": 36.959818116679386, + "learning_rate": 4.3140495867768597e-07, + "logits/chosen": -0.365234375, + "logits/rejected": -0.51953125, + "logps/chosen": -394.0, + "logps/rejected": -312.0, + "loss": 0.2585, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.5703125, + "rewards/margins": 5.53125, + "rewards/rejected": -3.953125, + "step": 357 + }, + { + "epoch": 0.4392638036809816, + "grad_norm": 35.616695396791314, + "learning_rate": 4.31198347107438e-07, + "logits/chosen": -0.318359375, + "logits/rejected": -0.4765625, + "logps/chosen": -440.0, + "logps/rejected": -306.0, + "loss": 0.2431, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.9765625, + "rewards/margins": 5.5625, + "rewards/rejected": -3.59375, + "step": 358 + }, + { + "epoch": 0.4404907975460123, + "grad_norm": 39.323762039132475, + "learning_rate": 4.3099173553719006e-07, + "logits/chosen": -0.208984375, + "logits/rejected": -0.326171875, + "logps/chosen": -414.0, + "logps/rejected": -308.0, + "loss": 0.2505, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.9375, + "rewards/margins": 5.21875, + "rewards/rejected": -3.296875, + "step": 359 + }, + { + "epoch": 0.44171779141104295, + "grad_norm": 39.07034175993009, + "learning_rate": 4.307851239669421e-07, + "logits/chosen": -0.1787109375, + "logits/rejected": -0.3125, + "logps/chosen": -386.0, + "logps/rejected": -332.0, + "loss": 0.2575, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.2734375, + "rewards/margins": 5.21875, + "rewards/rejected": -3.953125, + "step": 360 + }, + { + "epoch": 0.4429447852760736, + "grad_norm": 35.06710617877251, + "learning_rate": 4.305785123966942e-07, + "logits/chosen": -0.126953125, + "logits/rejected": -0.33203125, + "logps/chosen": -426.0, + "logps/rejected": -352.0, + "loss": 0.2472, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.7890625, + "rewards/margins": 5.625, + "rewards/rejected": -3.828125, + "step": 361 + }, + { + "epoch": 0.4441717791411043, + "grad_norm": 34.7975606217305, + "learning_rate": 4.3037190082644625e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.412109375, + "logps/chosen": -408.0, + "logps/rejected": -318.0, + "loss": 0.2548, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.578125, + "rewards/margins": 5.46875, + "rewards/rejected": -3.890625, + "step": 362 + }, + { + "epoch": 0.44539877300613495, + "grad_norm": 35.42891956468369, + "learning_rate": 4.3016528925619835e-07, + "logits/chosen": -0.1748046875, + "logits/rejected": -0.33203125, + "logps/chosen": -382.0, + "logps/rejected": -322.0, + "loss": 0.237, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.6328125, + "rewards/margins": 5.375, + "rewards/rejected": -3.734375, + "step": 363 + }, + { + "epoch": 0.4466257668711656, + "grad_norm": 44.20888419689405, + "learning_rate": 4.299586776859504e-07, + "logits/chosen": -0.1083984375, + "logits/rejected": -0.29296875, + "logps/chosen": -386.0, + "logps/rejected": -290.0, + "loss": 0.2487, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.390625, + "rewards/margins": 5.03125, + "rewards/rejected": -3.625, + "step": 364 + }, + { + "epoch": 0.44785276073619634, + "grad_norm": 32.07969290277028, + "learning_rate": 4.2975206611570245e-07, + "logits/chosen": -0.158203125, + "logits/rejected": -0.30859375, + "logps/chosen": -346.0, + "logps/rejected": -292.0, + "loss": 0.2268, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.234375, + "rewards/margins": 5.15625, + "rewards/rejected": -3.921875, + "step": 365 + }, + { + "epoch": 0.449079754601227, + "grad_norm": 35.77821392399441, + "learning_rate": 4.2954545454545455e-07, + "logits/chosen": -0.146484375, + "logits/rejected": -0.25, + "logps/chosen": -360.0, + "logps/rejected": -314.0, + "loss": 0.3, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.3828125, + "rewards/margins": 4.6875, + "rewards/rejected": -3.3125, + "step": 366 + }, + { + "epoch": 0.4503067484662577, + "grad_norm": 33.47062276922143, + "learning_rate": 4.293388429752066e-07, + "logits/chosen": -0.26953125, + "logits/rejected": -0.451171875, + "logps/chosen": -392.0, + "logps/rejected": -316.0, + "loss": 0.2494, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.3046875, + "rewards/margins": 5.03125, + "rewards/rejected": -3.734375, + "step": 367 + }, + { + "epoch": 0.45153374233128835, + "grad_norm": 41.18940309867523, + "learning_rate": 4.2913223140495864e-07, + "logits/chosen": -0.09033203125, + "logits/rejected": -0.1494140625, + "logps/chosen": -366.0, + "logps/rejected": -312.0, + "loss": 0.3001, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.0, + "rewards/margins": 4.625, + "rewards/rejected": -3.625, + "step": 368 + }, + { + "epoch": 0.452760736196319, + "grad_norm": 37.92759892609332, + "learning_rate": 4.289256198347107e-07, + "logits/chosen": -0.115234375, + "logits/rejected": -0.224609375, + "logps/chosen": -340.0, + "logps/rejected": -280.0, + "loss": 0.2816, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.5859375, + "rewards/margins": 4.34375, + "rewards/rejected": -3.75, + "step": 369 + }, + { + "epoch": 0.4539877300613497, + "grad_norm": 32.92636269991582, + "learning_rate": 4.287190082644628e-07, + "logits/chosen": -0.265625, + "logits/rejected": -0.462890625, + "logps/chosen": -402.0, + "logps/rejected": -336.0, + "loss": 0.2538, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.671875, + "rewards/margins": 5.375, + "rewards/rejected": -3.703125, + "step": 370 + }, + { + "epoch": 0.45521472392638035, + "grad_norm": 38.74700708912898, + "learning_rate": 4.2851239669421484e-07, + "logits/chosen": -0.2490234375, + "logits/rejected": -0.4375, + "logps/chosen": -460.0, + "logps/rejected": -352.0, + "loss": 0.2839, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.53125, + "rewards/margins": 4.84375, + "rewards/rejected": -3.3125, + "step": 371 + }, + { + "epoch": 0.456441717791411, + "grad_norm": 35.56525332139474, + "learning_rate": 4.2830578512396694e-07, + "logits/chosen": -0.1650390625, + "logits/rejected": -0.326171875, + "logps/chosen": -410.0, + "logps/rejected": -310.0, + "loss": 0.239, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.46875, + "rewards/margins": 5.0, + "rewards/rejected": -3.53125, + "step": 372 + }, + { + "epoch": 0.45766871165644174, + "grad_norm": 38.919873513342004, + "learning_rate": 4.28099173553719e-07, + "logits/chosen": -0.1943359375, + "logits/rejected": -0.3046875, + "logps/chosen": -360.0, + "logps/rejected": -308.0, + "loss": 0.325, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 0.765625, + "rewards/margins": 4.5625, + "rewards/rejected": -3.8125, + "step": 373 + }, + { + "epoch": 0.4588957055214724, + "grad_norm": 33.72191218536702, + "learning_rate": 4.278925619834711e-07, + "logits/chosen": -0.2099609375, + "logits/rejected": -0.349609375, + "logps/chosen": -384.0, + "logps/rejected": -304.0, + "loss": 0.2315, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.765625, + "rewards/margins": 5.4375, + "rewards/rejected": -3.6875, + "step": 374 + }, + { + "epoch": 0.4601226993865031, + "grad_norm": 39.982978401052485, + "learning_rate": 4.2768595041322313e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.34765625, + "logps/chosen": -392.0, + "logps/rejected": -342.0, + "loss": 0.2831, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.546875, + "rewards/margins": 4.84375, + "rewards/rejected": -3.3125, + "step": 375 + }, + { + "epoch": 0.46134969325153374, + "grad_norm": 33.94023445384835, + "learning_rate": 4.2747933884297523e-07, + "logits/chosen": -0.140625, + "logits/rejected": -0.29296875, + "logps/chosen": -376.0, + "logps/rejected": -336.0, + "loss": 0.2271, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.5859375, + "rewards/margins": 5.0, + "rewards/rejected": -3.421875, + "step": 376 + }, + { + "epoch": 0.4625766871165644, + "grad_norm": 37.21157793471459, + "learning_rate": 4.272727272727272e-07, + "logits/chosen": -0.21484375, + "logits/rejected": -0.287109375, + "logps/chosen": -352.0, + "logps/rejected": -306.0, + "loss": 0.262, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.453125, + "rewards/margins": 5.46875, + "rewards/rejected": -4.03125, + "step": 377 + }, + { + "epoch": 0.4638036809815951, + "grad_norm": 38.20919614495083, + "learning_rate": 4.270661157024793e-07, + "logits/chosen": -0.2421875, + "logits/rejected": -0.4921875, + "logps/chosen": -376.0, + "logps/rejected": -320.0, + "loss": 0.28, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.6484375, + "rewards/margins": 5.375, + "rewards/rejected": -3.734375, + "step": 378 + }, + { + "epoch": 0.46503067484662575, + "grad_norm": 36.24612780889627, + "learning_rate": 4.2685950413223137e-07, + "logits/chosen": -0.287109375, + "logits/rejected": -0.45703125, + "logps/chosen": -406.0, + "logps/rejected": -328.0, + "loss": 0.257, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.796875, + "rewards/margins": 5.75, + "rewards/rejected": -3.96875, + "step": 379 + }, + { + "epoch": 0.4662576687116564, + "grad_norm": 36.557393364699294, + "learning_rate": 4.2665289256198347e-07, + "logits/chosen": -0.203125, + "logits/rejected": -0.353515625, + "logps/chosen": -382.0, + "logps/rejected": -312.0, + "loss": 0.2671, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.578125, + "rewards/margins": 5.4375, + "rewards/rejected": -3.84375, + "step": 380 + }, + { + "epoch": 0.46748466257668714, + "grad_norm": 37.32259328400382, + "learning_rate": 4.264462809917355e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.458984375, + "logps/chosen": -370.0, + "logps/rejected": -310.0, + "loss": 0.3045, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.2578125, + "rewards/margins": 5.46875, + "rewards/rejected": -4.21875, + "step": 381 + }, + { + "epoch": 0.4687116564417178, + "grad_norm": 34.81605521306601, + "learning_rate": 4.2623966942148757e-07, + "logits/chosen": -0.283203125, + "logits/rejected": -0.390625, + "logps/chosen": -378.0, + "logps/rejected": -324.0, + "loss": 0.2736, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.34375, + "rewards/margins": 5.53125, + "rewards/rejected": -4.15625, + "step": 382 + }, + { + "epoch": 0.4699386503067485, + "grad_norm": 38.419341258289826, + "learning_rate": 4.2603305785123967e-07, + "logits/chosen": -0.2001953125, + "logits/rejected": -0.36328125, + "logps/chosen": -400.0, + "logps/rejected": -364.0, + "loss": 0.2858, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.3515625, + "rewards/margins": 5.5625, + "rewards/rejected": -4.21875, + "step": 383 + }, + { + "epoch": 0.47116564417177914, + "grad_norm": 33.49732006194629, + "learning_rate": 4.258264462809917e-07, + "logits/chosen": -0.2890625, + "logits/rejected": -0.52734375, + "logps/chosen": -392.0, + "logps/rejected": -320.0, + "loss": 0.2126, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.234375, + "rewards/margins": 6.15625, + "rewards/rejected": -4.90625, + "step": 384 + }, + { + "epoch": 0.4723926380368098, + "grad_norm": 38.114919863333334, + "learning_rate": 4.256198347107438e-07, + "logits/chosen": -0.19140625, + "logits/rejected": -0.384765625, + "logps/chosen": -388.0, + "logps/rejected": -314.0, + "loss": 0.2925, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.96484375, + "rewards/margins": 5.40625, + "rewards/rejected": -4.4375, + "step": 385 + }, + { + "epoch": 0.4736196319018405, + "grad_norm": 42.83706264363719, + "learning_rate": 4.254132231404958e-07, + "logits/chosen": -0.146484375, + "logits/rejected": -0.314453125, + "logps/chosen": -336.0, + "logps/rejected": -292.0, + "loss": 0.2814, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.439453125, + "rewards/margins": 5.09375, + "rewards/rejected": -4.65625, + "step": 386 + }, + { + "epoch": 0.47484662576687114, + "grad_norm": 43.964728733564016, + "learning_rate": 4.252066115702479e-07, + "logits/chosen": -0.169921875, + "logits/rejected": -0.365234375, + "logps/chosen": -416.0, + "logps/rejected": -328.0, + "loss": 0.2666, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.3046875, + "rewards/margins": 5.8125, + "rewards/rejected": -4.5, + "step": 387 + }, + { + "epoch": 0.47607361963190187, + "grad_norm": 44.03543501865791, + "learning_rate": 4.2499999999999995e-07, + "logits/chosen": -0.193359375, + "logits/rejected": -0.298828125, + "logps/chosen": -400.0, + "logps/rejected": -310.0, + "loss": 0.3549, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.6328125, + "rewards/margins": 4.5, + "rewards/rejected": -3.875, + "step": 388 + }, + { + "epoch": 0.47730061349693254, + "grad_norm": 42.68974337451638, + "learning_rate": 4.2479338842975205e-07, + "logits/chosen": -0.2421875, + "logits/rejected": -0.337890625, + "logps/chosen": -404.0, + "logps/rejected": -322.0, + "loss": 0.3419, + "rewards/accuracies": 0.78125, + "rewards/chosen": 0.9609375, + "rewards/margins": 5.3125, + "rewards/rejected": -4.34375, + "step": 389 + }, + { + "epoch": 0.4785276073619632, + "grad_norm": 42.06628954709381, + "learning_rate": 4.245867768595041e-07, + "logits/chosen": -0.306640625, + "logits/rejected": -0.447265625, + "logps/chosen": -362.0, + "logps/rejected": -326.0, + "loss": 0.3237, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.361328125, + "rewards/margins": 5.15625, + "rewards/rejected": -4.78125, + "step": 390 + }, + { + "epoch": 0.47975460122699387, + "grad_norm": 49.18980712796409, + "learning_rate": 4.243801652892562e-07, + "logits/chosen": -0.22265625, + "logits/rejected": -0.3515625, + "logps/chosen": -380.0, + "logps/rejected": -324.0, + "loss": 0.3698, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 0.92578125, + "rewards/margins": 5.4375, + "rewards/rejected": -4.5, + "step": 391 + }, + { + "epoch": 0.48098159509202454, + "grad_norm": 34.35189463552141, + "learning_rate": 4.2417355371900825e-07, + "logits/chosen": -0.1787109375, + "logits/rejected": -0.330078125, + "logps/chosen": -354.0, + "logps/rejected": -310.0, + "loss": 0.2639, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.9296875, + "rewards/margins": 5.59375, + "rewards/rejected": -4.65625, + "step": 392 + }, + { + "epoch": 0.4822085889570552, + "grad_norm": 38.67130742947215, + "learning_rate": 4.2396694214876035e-07, + "logits/chosen": -0.14453125, + "logits/rejected": -0.2890625, + "logps/chosen": -404.0, + "logps/rejected": -352.0, + "loss": 0.2885, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.921875, + "rewards/margins": 5.375, + "rewards/rejected": -4.46875, + "step": 393 + }, + { + "epoch": 0.4834355828220859, + "grad_norm": 40.57744523526432, + "learning_rate": 4.237603305785124e-07, + "logits/chosen": -0.212890625, + "logits/rejected": -0.42578125, + "logps/chosen": -386.0, + "logps/rejected": -324.0, + "loss": 0.2657, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.84765625, + "rewards/margins": 5.34375, + "rewards/rejected": -4.5, + "step": 394 + }, + { + "epoch": 0.48466257668711654, + "grad_norm": 38.619317047033334, + "learning_rate": 4.2355371900826444e-07, + "logits/chosen": -0.212890625, + "logits/rejected": -0.34375, + "logps/chosen": -438.0, + "logps/rejected": -336.0, + "loss": 0.307, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.94921875, + "rewards/margins": 5.21875, + "rewards/rejected": -4.28125, + "step": 395 + }, + { + "epoch": 0.48588957055214727, + "grad_norm": 30.114712115596447, + "learning_rate": 4.233471074380165e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.4921875, + "logps/chosen": -338.0, + "logps/rejected": -312.0, + "loss": 0.215, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 0.439453125, + "rewards/margins": 5.375, + "rewards/rejected": -4.9375, + "step": 396 + }, + { + "epoch": 0.48711656441717793, + "grad_norm": 34.39736388154625, + "learning_rate": 4.231404958677686e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.43359375, + "logps/chosen": -374.0, + "logps/rejected": -326.0, + "loss": 0.2349, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.84765625, + "rewards/margins": 5.78125, + "rewards/rejected": -4.9375, + "step": 397 + }, + { + "epoch": 0.4883435582822086, + "grad_norm": 40.00891469568207, + "learning_rate": 4.2293388429752064e-07, + "logits/chosen": -0.2490234375, + "logits/rejected": -0.3984375, + "logps/chosen": -416.0, + "logps/rejected": -324.0, + "loss": 0.3096, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.0859375, + "rewards/margins": 5.46875, + "rewards/rejected": -4.375, + "step": 398 + }, + { + "epoch": 0.48957055214723927, + "grad_norm": 35.41096130608413, + "learning_rate": 4.227272727272727e-07, + "logits/chosen": -0.26953125, + "logits/rejected": -0.416015625, + "logps/chosen": -384.0, + "logps/rejected": -324.0, + "loss": 0.2995, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.921875, + "rewards/margins": 5.3125, + "rewards/rejected": -4.375, + "step": 399 + }, + { + "epoch": 0.49079754601226994, + "grad_norm": 48.45396143006796, + "learning_rate": 4.225206611570248e-07, + "logits/chosen": -0.2236328125, + "logits/rejected": -0.30859375, + "logps/chosen": -370.0, + "logps/rejected": -346.0, + "loss": 0.3464, + "rewards/accuracies": 0.796875, + "rewards/chosen": 0.8125, + "rewards/margins": 4.78125, + "rewards/rejected": -3.953125, + "step": 400 + }, + { + "epoch": 0.4920245398773006, + "grad_norm": 30.00175559700857, + "learning_rate": 4.2231404958677683e-07, + "logits/chosen": -0.337890625, + "logits/rejected": -0.490234375, + "logps/chosen": -446.0, + "logps/rejected": -366.0, + "loss": 0.2176, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.46875, + "rewards/margins": 6.1875, + "rewards/rejected": -4.71875, + "step": 401 + }, + { + "epoch": 0.49325153374233127, + "grad_norm": 37.529393439709146, + "learning_rate": 4.2210743801652893e-07, + "logits/chosen": -0.208984375, + "logits/rejected": -0.314453125, + "logps/chosen": -384.0, + "logps/rejected": -328.0, + "loss": 0.2923, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.98828125, + "rewards/margins": 5.25, + "rewards/rejected": -4.25, + "step": 402 + }, + { + "epoch": 0.49447852760736194, + "grad_norm": 41.86969893893965, + "learning_rate": 4.21900826446281e-07, + "logits/chosen": -0.203125, + "logits/rejected": -0.3046875, + "logps/chosen": -388.0, + "logps/rejected": -348.0, + "loss": 0.3168, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.828125, + "rewards/margins": 5.125, + "rewards/rejected": -4.28125, + "step": 403 + }, + { + "epoch": 0.49570552147239266, + "grad_norm": 34.20945313316955, + "learning_rate": 4.21694214876033e-07, + "logits/chosen": -0.1513671875, + "logits/rejected": -0.30078125, + "logps/chosen": -364.0, + "logps/rejected": -324.0, + "loss": 0.2255, + "rewards/accuracies": 0.90625, + "rewards/chosen": 1.0703125, + "rewards/margins": 5.65625, + "rewards/rejected": -4.59375, + "step": 404 + }, + { + "epoch": 0.49693251533742333, + "grad_norm": 35.86293374874338, + "learning_rate": 4.2148760330578507e-07, + "logits/chosen": -0.2314453125, + "logits/rejected": -0.462890625, + "logps/chosen": -364.0, + "logps/rejected": -304.0, + "loss": 0.3106, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.21875, + "rewards/margins": 5.53125, + "rewards/rejected": -4.3125, + "step": 405 + }, + { + "epoch": 0.498159509202454, + "grad_norm": 43.071679894395345, + "learning_rate": 4.2128099173553717e-07, + "logits/chosen": -0.1328125, + "logits/rejected": -0.2294921875, + "logps/chosen": -374.0, + "logps/rejected": -322.0, + "loss": 0.3625, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 0.86328125, + "rewards/margins": 4.78125, + "rewards/rejected": -3.921875, + "step": 406 + }, + { + "epoch": 0.49938650306748467, + "grad_norm": 42.39188898560159, + "learning_rate": 4.210743801652892e-07, + "logits/chosen": -0.10986328125, + "logits/rejected": -0.2734375, + "logps/chosen": -402.0, + "logps/rejected": -322.0, + "loss": 0.3105, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.9140625, + "rewards/margins": 5.78125, + "rewards/rejected": -3.84375, + "step": 407 + }, + { + "epoch": 0.5006134969325153, + "grad_norm": 45.27741438195794, + "learning_rate": 4.208677685950413e-07, + "logits/chosen": -0.2109375, + "logits/rejected": -0.310546875, + "logps/chosen": -418.0, + "logps/rejected": -346.0, + "loss": 0.3592, + "rewards/accuracies": 0.78125, + "rewards/chosen": 0.73828125, + "rewards/margins": 4.4375, + "rewards/rejected": -3.71875, + "step": 408 + }, + { + "epoch": 0.501840490797546, + "grad_norm": 39.84136285513692, + "learning_rate": 4.2066115702479337e-07, + "logits/chosen": -0.1484375, + "logits/rejected": -0.345703125, + "logps/chosen": -418.0, + "logps/rejected": -322.0, + "loss": 0.2668, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.3125, + "rewards/margins": 5.5625, + "rewards/rejected": -4.25, + "step": 409 + }, + { + "epoch": 0.5030674846625767, + "grad_norm": 40.12041017968796, + "learning_rate": 4.2045454545454547e-07, + "logits/chosen": -0.1357421875, + "logits/rejected": -0.33984375, + "logps/chosen": -382.0, + "logps/rejected": -340.0, + "loss": 0.2892, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.91796875, + "rewards/margins": 4.78125, + "rewards/rejected": -3.859375, + "step": 410 + }, + { + "epoch": 0.5042944785276073, + "grad_norm": 37.21127075191681, + "learning_rate": 4.202479338842975e-07, + "logits/chosen": -0.1279296875, + "logits/rejected": -0.26953125, + "logps/chosen": -338.0, + "logps/rejected": -302.0, + "loss": 0.2656, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.65625, + "rewards/margins": 5.03125, + "rewards/rejected": -4.375, + "step": 411 + }, + { + "epoch": 0.505521472392638, + "grad_norm": 41.819486450620104, + "learning_rate": 4.200413223140496e-07, + "logits/chosen": -0.1376953125, + "logits/rejected": -0.27734375, + "logps/chosen": -420.0, + "logps/rejected": -348.0, + "loss": 0.3095, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.015625, + "rewards/margins": 4.75, + "rewards/rejected": -3.71875, + "step": 412 + }, + { + "epoch": 0.5067484662576687, + "grad_norm": 38.33771429389002, + "learning_rate": 4.198347107438016e-07, + "logits/chosen": -0.1728515625, + "logits/rejected": -0.404296875, + "logps/chosen": -402.0, + "logps/rejected": -312.0, + "loss": 0.2722, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.3828125, + "rewards/margins": 5.40625, + "rewards/rejected": -4.03125, + "step": 413 + }, + { + "epoch": 0.5079754601226993, + "grad_norm": 37.12482857003386, + "learning_rate": 4.196280991735537e-07, + "logits/chosen": -0.21875, + "logits/rejected": -0.37109375, + "logps/chosen": -402.0, + "logps/rejected": -336.0, + "loss": 0.2323, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.15625, + "rewards/margins": 5.34375, + "rewards/rejected": -4.1875, + "step": 414 + }, + { + "epoch": 0.50920245398773, + "grad_norm": 34.655790564533014, + "learning_rate": 4.1942148760330576e-07, + "logits/chosen": -0.1796875, + "logits/rejected": -0.36328125, + "logps/chosen": -346.0, + "logps/rejected": -310.0, + "loss": 0.2656, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.90625, + "rewards/margins": 5.03125, + "rewards/rejected": -4.125, + "step": 415 + }, + { + "epoch": 0.5104294478527608, + "grad_norm": 32.98043530408525, + "learning_rate": 4.1921487603305786e-07, + "logits/chosen": -0.154296875, + "logits/rejected": -0.375, + "logps/chosen": -360.0, + "logps/rejected": -304.0, + "loss": 0.2198, + "rewards/accuracies": 0.890625, + "rewards/chosen": 0.62109375, + "rewards/margins": 4.75, + "rewards/rejected": -4.125, + "step": 416 + }, + { + "epoch": 0.5116564417177915, + "grad_norm": 36.96587452637558, + "learning_rate": 4.190082644628099e-07, + "logits/chosen": -0.3515625, + "logits/rejected": -0.53125, + "logps/chosen": -436.0, + "logps/rejected": -362.0, + "loss": 0.2649, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.6484375, + "rewards/margins": 6.28125, + "rewards/rejected": -4.65625, + "step": 417 + }, + { + "epoch": 0.5128834355828221, + "grad_norm": 34.4789260314332, + "learning_rate": 4.1880165289256195e-07, + "logits/chosen": -0.267578125, + "logits/rejected": -0.373046875, + "logps/chosen": -364.0, + "logps/rejected": -284.0, + "loss": 0.2518, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.1484375, + "rewards/margins": 5.40625, + "rewards/rejected": -4.25, + "step": 418 + }, + { + "epoch": 0.5141104294478528, + "grad_norm": 34.78381462111674, + "learning_rate": 4.1859504132231405e-07, + "logits/chosen": -0.2109375, + "logits/rejected": -0.3828125, + "logps/chosen": -378.0, + "logps/rejected": -320.0, + "loss": 0.2278, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.1484375, + "rewards/margins": 5.71875, + "rewards/rejected": -4.5625, + "step": 419 + }, + { + "epoch": 0.5153374233128835, + "grad_norm": 39.079403507615055, + "learning_rate": 4.183884297520661e-07, + "logits/chosen": -0.1494140625, + "logits/rejected": -0.326171875, + "logps/chosen": -344.0, + "logps/rejected": -294.0, + "loss": 0.3113, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.03125, + "rewards/margins": 4.84375, + "rewards/rejected": -3.8125, + "step": 420 + }, + { + "epoch": 0.5165644171779141, + "grad_norm": 34.54058833309064, + "learning_rate": 4.1818181818181814e-07, + "logits/chosen": -0.1943359375, + "logits/rejected": -0.3984375, + "logps/chosen": -362.0, + "logps/rejected": -302.0, + "loss": 0.3077, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.34375, + "rewards/margins": 5.21875, + "rewards/rejected": -3.875, + "step": 421 + }, + { + "epoch": 0.5177914110429448, + "grad_norm": 36.04776328314745, + "learning_rate": 4.179752066115702e-07, + "logits/chosen": -0.1171875, + "logits/rejected": -0.287109375, + "logps/chosen": -356.0, + "logps/rejected": -282.0, + "loss": 0.2784, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.9609375, + "rewards/margins": 5.125, + "rewards/rejected": -4.15625, + "step": 422 + }, + { + "epoch": 0.5190184049079755, + "grad_norm": 43.01937925233782, + "learning_rate": 4.177685950413223e-07, + "logits/chosen": -0.232421875, + "logits/rejected": -0.40234375, + "logps/chosen": -396.0, + "logps/rejected": -346.0, + "loss": 0.3382, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.82421875, + "rewards/margins": 4.6875, + "rewards/rejected": -3.859375, + "step": 423 + }, + { + "epoch": 0.5202453987730061, + "grad_norm": 36.48453900377271, + "learning_rate": 4.1756198347107434e-07, + "logits/chosen": -0.1611328125, + "logits/rejected": -0.365234375, + "logps/chosen": -378.0, + "logps/rejected": -328.0, + "loss": 0.3126, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.2421875, + "rewards/margins": 5.625, + "rewards/rejected": -4.375, + "step": 424 + }, + { + "epoch": 0.5214723926380368, + "grad_norm": 41.79473108392073, + "learning_rate": 4.1735537190082644e-07, + "logits/chosen": -0.193359375, + "logits/rejected": -0.318359375, + "logps/chosen": -394.0, + "logps/rejected": -332.0, + "loss": 0.3372, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.5078125, + "rewards/margins": 5.40625, + "rewards/rejected": -3.90625, + "step": 425 + }, + { + "epoch": 0.5226993865030675, + "grad_norm": 48.26366364465108, + "learning_rate": 4.171487603305785e-07, + "logits/chosen": -0.2412109375, + "logits/rejected": -0.376953125, + "logps/chosen": -368.0, + "logps/rejected": -330.0, + "loss": 0.2573, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.3203125, + "rewards/margins": 5.625, + "rewards/rejected": -4.28125, + "step": 426 + }, + { + "epoch": 0.5239263803680981, + "grad_norm": 99.7573372246345, + "learning_rate": 4.169421487603306e-07, + "logits/chosen": -0.1982421875, + "logits/rejected": -0.3125, + "logps/chosen": -376.0, + "logps/rejected": -318.0, + "loss": 0.2668, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.3046875, + "rewards/margins": 5.34375, + "rewards/rejected": -4.03125, + "step": 427 + }, + { + "epoch": 0.5251533742331288, + "grad_norm": 37.06815581413299, + "learning_rate": 4.1673553719008263e-07, + "logits/chosen": -0.224609375, + "logits/rejected": -0.357421875, + "logps/chosen": -360.0, + "logps/rejected": -306.0, + "loss": 0.3028, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.890625, + "rewards/margins": 5.0, + "rewards/rejected": -4.125, + "step": 428 + }, + { + "epoch": 0.5263803680981595, + "grad_norm": 33.97292039326683, + "learning_rate": 4.1652892561983473e-07, + "logits/chosen": -0.224609375, + "logits/rejected": -0.34765625, + "logps/chosen": -356.0, + "logps/rejected": -352.0, + "loss": 0.243, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.82421875, + "rewards/margins": 5.875, + "rewards/rejected": -5.0625, + "step": 429 + }, + { + "epoch": 0.5276073619631901, + "grad_norm": 29.82247469458647, + "learning_rate": 4.163223140495867e-07, + "logits/chosen": -0.287109375, + "logits/rejected": -0.46484375, + "logps/chosen": -392.0, + "logps/rejected": -332.0, + "loss": 0.1971, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.1953125, + "rewards/margins": 5.96875, + "rewards/rejected": -4.78125, + "step": 430 + }, + { + "epoch": 0.5288343558282208, + "grad_norm": 50.10617111263047, + "learning_rate": 4.161157024793388e-07, + "logits/chosen": -0.1787109375, + "logits/rejected": -0.3515625, + "logps/chosen": -380.0, + "logps/rejected": -326.0, + "loss": 0.3808, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.7109375, + "rewards/margins": 4.90625, + "rewards/rejected": -4.21875, + "step": 431 + }, + { + "epoch": 0.5300613496932516, + "grad_norm": 46.34719786232677, + "learning_rate": 4.1590909090909087e-07, + "logits/chosen": -0.1328125, + "logits/rejected": -0.185546875, + "logps/chosen": -376.0, + "logps/rejected": -334.0, + "loss": 0.3379, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.3359375, + "rewards/margins": 5.25, + "rewards/rejected": -3.921875, + "step": 432 + }, + { + "epoch": 0.5312883435582823, + "grad_norm": 42.692948753426734, + "learning_rate": 4.1570247933884297e-07, + "logits/chosen": -0.1181640625, + "logits/rejected": -0.33984375, + "logps/chosen": -382.0, + "logps/rejected": -298.0, + "loss": 0.3119, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.55078125, + "rewards/margins": 4.96875, + "rewards/rejected": -4.40625, + "step": 433 + }, + { + "epoch": 0.5325153374233129, + "grad_norm": 39.50920458351492, + "learning_rate": 4.15495867768595e-07, + "logits/chosen": -0.263671875, + "logits/rejected": -0.36328125, + "logps/chosen": -384.0, + "logps/rejected": -338.0, + "loss": 0.2357, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.61328125, + "rewards/margins": 5.125, + "rewards/rejected": -4.5, + "step": 434 + }, + { + "epoch": 0.5337423312883436, + "grad_norm": 41.38331544820595, + "learning_rate": 4.1528925619834707e-07, + "logits/chosen": -0.201171875, + "logits/rejected": -0.416015625, + "logps/chosen": -386.0, + "logps/rejected": -340.0, + "loss": 0.2711, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.140625, + "rewards/margins": 5.65625, + "rewards/rejected": -4.53125, + "step": 435 + }, + { + "epoch": 0.5349693251533743, + "grad_norm": 39.363819944524835, + "learning_rate": 4.1508264462809917e-07, + "logits/chosen": -0.2099609375, + "logits/rejected": -0.423828125, + "logps/chosen": -416.0, + "logps/rejected": -336.0, + "loss": 0.2469, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.6796875, + "rewards/margins": 6.28125, + "rewards/rejected": -4.59375, + "step": 436 + }, + { + "epoch": 0.5361963190184049, + "grad_norm": 32.4215285898728, + "learning_rate": 4.148760330578512e-07, + "logits/chosen": -0.2431640625, + "logits/rejected": -0.4296875, + "logps/chosen": -382.0, + "logps/rejected": -328.0, + "loss": 0.2367, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.109375, + "rewards/margins": 5.8125, + "rewards/rejected": -4.6875, + "step": 437 + }, + { + "epoch": 0.5374233128834356, + "grad_norm": 41.11999044241744, + "learning_rate": 4.146694214876033e-07, + "logits/chosen": -0.16796875, + "logits/rejected": -0.279296875, + "logps/chosen": -358.0, + "logps/rejected": -314.0, + "loss": 0.3424, + "rewards/accuracies": 0.796875, + "rewards/chosen": 0.859375, + "rewards/margins": 4.59375, + "rewards/rejected": -3.734375, + "step": 438 + }, + { + "epoch": 0.5386503067484663, + "grad_norm": 36.95463031219475, + "learning_rate": 4.144628099173553e-07, + "logits/chosen": -0.1181640625, + "logits/rejected": -0.32421875, + "logps/chosen": -364.0, + "logps/rejected": -326.0, + "loss": 0.2791, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.7734375, + "rewards/margins": 5.21875, + "rewards/rejected": -4.46875, + "step": 439 + }, + { + "epoch": 0.5398773006134969, + "grad_norm": 49.69926246487377, + "learning_rate": 4.142561983471074e-07, + "logits/chosen": -0.166015625, + "logits/rejected": -0.271484375, + "logps/chosen": -384.0, + "logps/rejected": -326.0, + "loss": 0.3218, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.35546875, + "rewards/margins": 4.40625, + "rewards/rejected": -4.03125, + "step": 440 + }, + { + "epoch": 0.5411042944785276, + "grad_norm": 39.707681073149594, + "learning_rate": 4.1404958677685946e-07, + "logits/chosen": -0.107421875, + "logits/rejected": -0.224609375, + "logps/chosen": -332.0, + "logps/rejected": -292.0, + "loss": 0.2837, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.69140625, + "rewards/margins": 4.78125, + "rewards/rejected": -4.09375, + "step": 441 + }, + { + "epoch": 0.5423312883435583, + "grad_norm": 38.960801334852974, + "learning_rate": 4.1384297520661156e-07, + "logits/chosen": -0.24609375, + "logits/rejected": -0.3828125, + "logps/chosen": -384.0, + "logps/rejected": -334.0, + "loss": 0.3027, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.0234375, + "rewards/margins": 5.21875, + "rewards/rejected": -4.1875, + "step": 442 + }, + { + "epoch": 0.5435582822085889, + "grad_norm": 42.815669493727604, + "learning_rate": 4.136363636363636e-07, + "logits/chosen": -0.193359375, + "logits/rejected": -0.33203125, + "logps/chosen": -366.0, + "logps/rejected": -312.0, + "loss": 0.303, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.2734375, + "rewards/margins": 5.25, + "rewards/rejected": -4.0, + "step": 443 + }, + { + "epoch": 0.5447852760736196, + "grad_norm": 35.80955378025667, + "learning_rate": 4.134297520661157e-07, + "logits/chosen": -0.234375, + "logits/rejected": -0.47265625, + "logps/chosen": -448.0, + "logps/rejected": -360.0, + "loss": 0.2204, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.84375, + "rewards/margins": 6.40625, + "rewards/rejected": -4.5625, + "step": 444 + }, + { + "epoch": 0.5460122699386503, + "grad_norm": 38.126966452680875, + "learning_rate": 4.1322314049586775e-07, + "logits/chosen": -0.2060546875, + "logits/rejected": -0.388671875, + "logps/chosen": -352.0, + "logps/rejected": -296.0, + "loss": 0.3507, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.1328125, + "rewards/margins": 4.9375, + "rewards/rejected": -3.8125, + "step": 445 + }, + { + "epoch": 0.5472392638036809, + "grad_norm": 35.409001850251684, + "learning_rate": 4.1301652892561985e-07, + "logits/chosen": -0.21875, + "logits/rejected": -0.3984375, + "logps/chosen": -434.0, + "logps/rejected": -352.0, + "loss": 0.2334, + "rewards/accuracies": 0.90625, + "rewards/chosen": 1.171875, + "rewards/margins": 5.0625, + "rewards/rejected": -3.875, + "step": 446 + }, + { + "epoch": 0.5484662576687117, + "grad_norm": 37.030505301448606, + "learning_rate": 4.128099173553719e-07, + "logits/chosen": -0.20703125, + "logits/rejected": -0.421875, + "logps/chosen": -412.0, + "logps/rejected": -340.0, + "loss": 0.2524, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.5625, + "rewards/margins": 6.3125, + "rewards/rejected": -4.75, + "step": 447 + }, + { + "epoch": 0.5496932515337424, + "grad_norm": 40.14683673248258, + "learning_rate": 4.1260330578512394e-07, + "logits/chosen": -0.1435546875, + "logits/rejected": -0.298828125, + "logps/chosen": -342.0, + "logps/rejected": -296.0, + "loss": 0.3068, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.60546875, + "rewards/margins": 4.59375, + "rewards/rejected": -4.0, + "step": 448 + }, + { + "epoch": 0.550920245398773, + "grad_norm": 36.49625976131608, + "learning_rate": 4.12396694214876e-07, + "logits/chosen": -0.2119140625, + "logits/rejected": -0.365234375, + "logps/chosen": -396.0, + "logps/rejected": -326.0, + "loss": 0.257, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.5234375, + "rewards/margins": 5.78125, + "rewards/rejected": -4.25, + "step": 449 + }, + { + "epoch": 0.5521472392638037, + "grad_norm": 36.243221597677895, + "learning_rate": 4.121900826446281e-07, + "logits/chosen": -0.2890625, + "logits/rejected": -0.34765625, + "logps/chosen": -348.0, + "logps/rejected": -284.0, + "loss": 0.2672, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.94921875, + "rewards/margins": 5.25, + "rewards/rejected": -4.28125, + "step": 450 + }, + { + "epoch": 0.5533742331288344, + "grad_norm": 32.1407046295721, + "learning_rate": 4.1198347107438014e-07, + "logits/chosen": -0.1650390625, + "logits/rejected": -0.353515625, + "logps/chosen": -344.0, + "logps/rejected": -278.0, + "loss": 0.2477, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.9375, + "rewards/margins": 5.15625, + "rewards/rejected": -4.21875, + "step": 451 + }, + { + "epoch": 0.554601226993865, + "grad_norm": 42.28873095520698, + "learning_rate": 4.1177685950413224e-07, + "logits/chosen": -0.2236328125, + "logits/rejected": -0.484375, + "logps/chosen": -460.0, + "logps/rejected": -326.0, + "loss": 0.2747, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.9140625, + "rewards/margins": 5.90625, + "rewards/rejected": -4.0, + "step": 452 + }, + { + "epoch": 0.5558282208588957, + "grad_norm": 32.36959074636312, + "learning_rate": 4.115702479338843e-07, + "logits/chosen": -0.29296875, + "logits/rejected": -0.5234375, + "logps/chosen": -440.0, + "logps/rejected": -362.0, + "loss": 0.1965, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 2.109375, + "rewards/margins": 6.5, + "rewards/rejected": -4.375, + "step": 453 + }, + { + "epoch": 0.5570552147239264, + "grad_norm": 37.72144307940475, + "learning_rate": 4.1136363636363633e-07, + "logits/chosen": -0.1572265625, + "logits/rejected": -0.248046875, + "logps/chosen": -340.0, + "logps/rejected": -302.0, + "loss": 0.2824, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.67578125, + "rewards/margins": 4.84375, + "rewards/rejected": -4.15625, + "step": 454 + }, + { + "epoch": 0.558282208588957, + "grad_norm": 36.8405329111992, + "learning_rate": 4.1115702479338843e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.400390625, + "logps/chosen": -370.0, + "logps/rejected": -344.0, + "loss": 0.2387, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.65625, + "rewards/margins": 5.9375, + "rewards/rejected": -4.28125, + "step": 455 + }, + { + "epoch": 0.5595092024539877, + "grad_norm": 38.28626472369992, + "learning_rate": 4.109504132231405e-07, + "logits/chosen": -0.1533203125, + "logits/rejected": -0.259765625, + "logps/chosen": -314.0, + "logps/rejected": -296.0, + "loss": 0.2614, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.9921875, + "rewards/margins": 5.5, + "rewards/rejected": -4.53125, + "step": 456 + }, + { + "epoch": 0.5607361963190184, + "grad_norm": 37.602299554825706, + "learning_rate": 4.1074380165289253e-07, + "logits/chosen": -0.1865234375, + "logits/rejected": -0.326171875, + "logps/chosen": -354.0, + "logps/rejected": -312.0, + "loss": 0.2718, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.1484375, + "rewards/margins": 5.0, + "rewards/rejected": -3.84375, + "step": 457 + }, + { + "epoch": 0.561963190184049, + "grad_norm": 34.248759383891915, + "learning_rate": 4.105371900826446e-07, + "logits/chosen": -0.203125, + "logits/rejected": -0.375, + "logps/chosen": -372.0, + "logps/rejected": -282.0, + "loss": 0.2095, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.671875, + "rewards/margins": 6.03125, + "rewards/rejected": -4.34375, + "step": 458 + }, + { + "epoch": 0.5631901840490797, + "grad_norm": 36.02884511565117, + "learning_rate": 4.103305785123967e-07, + "logits/chosen": -0.1923828125, + "logits/rejected": -0.37109375, + "logps/chosen": -390.0, + "logps/rejected": -334.0, + "loss": 0.2657, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.6875, + "rewards/margins": 5.875, + "rewards/rejected": -4.1875, + "step": 459 + }, + { + "epoch": 0.5644171779141104, + "grad_norm": 39.138490077598576, + "learning_rate": 4.101239669421487e-07, + "logits/chosen": -0.19140625, + "logits/rejected": -0.3046875, + "logps/chosen": -348.0, + "logps/rejected": -318.0, + "loss": 0.2605, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 0.8125, + "rewards/margins": 5.75, + "rewards/rejected": -4.9375, + "step": 460 + }, + { + "epoch": 0.5656441717791411, + "grad_norm": 42.1658732163214, + "learning_rate": 4.099173553719008e-07, + "logits/chosen": -0.37890625, + "logits/rejected": -0.5078125, + "logps/chosen": -372.0, + "logps/rejected": -332.0, + "loss": 0.2725, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.9765625, + "rewards/margins": 5.3125, + "rewards/rejected": -4.34375, + "step": 461 + }, + { + "epoch": 0.5668711656441717, + "grad_norm": 41.91165523140955, + "learning_rate": 4.0971074380165287e-07, + "logits/chosen": -0.1474609375, + "logits/rejected": -0.34375, + "logps/chosen": -360.0, + "logps/rejected": -288.0, + "loss": 0.3075, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.8203125, + "rewards/margins": 4.625, + "rewards/rejected": -3.8125, + "step": 462 + }, + { + "epoch": 0.5680981595092025, + "grad_norm": 38.69169820185617, + "learning_rate": 4.0950413223140497e-07, + "logits/chosen": -0.248046875, + "logits/rejected": -0.365234375, + "logps/chosen": -362.0, + "logps/rejected": -348.0, + "loss": 0.2766, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.15625, + "rewards/margins": 5.5, + "rewards/rejected": -4.34375, + "step": 463 + }, + { + "epoch": 0.5693251533742332, + "grad_norm": 43.91810675336078, + "learning_rate": 4.09297520661157e-07, + "logits/chosen": -0.12890625, + "logits/rejected": -0.314453125, + "logps/chosen": -390.0, + "logps/rejected": -310.0, + "loss": 0.2966, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.0, + "rewards/margins": 5.28125, + "rewards/rejected": -4.28125, + "step": 464 + }, + { + "epoch": 0.5705521472392638, + "grad_norm": 33.81460512528705, + "learning_rate": 4.090909090909091e-07, + "logits/chosen": -0.2451171875, + "logits/rejected": -0.482421875, + "logps/chosen": -398.0, + "logps/rejected": -332.0, + "loss": 0.1974, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.21875, + "rewards/margins": 5.96875, + "rewards/rejected": -4.75, + "step": 465 + }, + { + "epoch": 0.5717791411042945, + "grad_norm": 43.114669278637464, + "learning_rate": 4.088842975206611e-07, + "logits/chosen": -0.1923828125, + "logits/rejected": -0.33203125, + "logps/chosen": -416.0, + "logps/rejected": -330.0, + "loss": 0.2803, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.921875, + "rewards/margins": 5.6875, + "rewards/rejected": -4.75, + "step": 466 + }, + { + "epoch": 0.5730061349693252, + "grad_norm": 41.26777561271183, + "learning_rate": 4.086776859504132e-07, + "logits/chosen": -0.201171875, + "logits/rejected": -0.4296875, + "logps/chosen": -384.0, + "logps/rejected": -342.0, + "loss": 0.2918, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.2734375, + "rewards/margins": 5.59375, + "rewards/rejected": -4.34375, + "step": 467 + }, + { + "epoch": 0.5742331288343558, + "grad_norm": 46.80452187024971, + "learning_rate": 4.0847107438016526e-07, + "logits/chosen": -0.2041015625, + "logits/rejected": -0.357421875, + "logps/chosen": -366.0, + "logps/rejected": -336.0, + "loss": 0.2962, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.0703125, + "rewards/margins": 5.875, + "rewards/rejected": -4.8125, + "step": 468 + }, + { + "epoch": 0.5754601226993865, + "grad_norm": 35.72783758477153, + "learning_rate": 4.0826446280991736e-07, + "logits/chosen": -0.1611328125, + "logits/rejected": -0.341796875, + "logps/chosen": -386.0, + "logps/rejected": -296.0, + "loss": 0.194, + "rewards/accuracies": 0.9140625, + "rewards/chosen": 1.203125, + "rewards/margins": 5.96875, + "rewards/rejected": -4.78125, + "step": 469 + }, + { + "epoch": 0.5766871165644172, + "grad_norm": 36.63750325467396, + "learning_rate": 4.080578512396694e-07, + "logits/chosen": -0.1904296875, + "logits/rejected": -0.279296875, + "logps/chosen": -352.0, + "logps/rejected": -316.0, + "loss": 0.2875, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.1875, + "rewards/margins": 5.8125, + "rewards/rejected": -4.625, + "step": 470 + }, + { + "epoch": 0.5779141104294478, + "grad_norm": 41.264612609731145, + "learning_rate": 4.0785123966942145e-07, + "logits/chosen": -0.07373046875, + "logits/rejected": -0.2451171875, + "logps/chosen": -402.0, + "logps/rejected": -328.0, + "loss": 0.2914, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.94140625, + "rewards/margins": 5.28125, + "rewards/rejected": -4.34375, + "step": 471 + }, + { + "epoch": 0.5791411042944785, + "grad_norm": 45.183894833304514, + "learning_rate": 4.0764462809917355e-07, + "logits/chosen": -0.126953125, + "logits/rejected": -0.34765625, + "logps/chosen": -408.0, + "logps/rejected": -314.0, + "loss": 0.2808, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.078125, + "rewards/margins": 5.53125, + "rewards/rejected": -4.4375, + "step": 472 + }, + { + "epoch": 0.5803680981595092, + "grad_norm": 43.25551760993764, + "learning_rate": 4.074380165289256e-07, + "logits/chosen": -0.287109375, + "logits/rejected": -0.4140625, + "logps/chosen": -398.0, + "logps/rejected": -370.0, + "loss": 0.2992, + "rewards/accuracies": 0.796875, + "rewards/chosen": 1.078125, + "rewards/margins": 5.3125, + "rewards/rejected": -4.25, + "step": 473 + }, + { + "epoch": 0.5815950920245399, + "grad_norm": 36.874064189408784, + "learning_rate": 4.072314049586777e-07, + "logits/chosen": -0.25, + "logits/rejected": -0.4609375, + "logps/chosen": -430.0, + "logps/rejected": -338.0, + "loss": 0.2515, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.984375, + "rewards/margins": 5.5, + "rewards/rejected": -4.53125, + "step": 474 + }, + { + "epoch": 0.5828220858895705, + "grad_norm": 33.97530110519338, + "learning_rate": 4.070247933884297e-07, + "logits/chosen": -0.232421875, + "logits/rejected": -0.45703125, + "logps/chosen": -426.0, + "logps/rejected": -338.0, + "loss": 0.2189, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.8828125, + "rewards/margins": 6.6875, + "rewards/rejected": -4.8125, + "step": 475 + }, + { + "epoch": 0.5840490797546012, + "grad_norm": 32.31826742696185, + "learning_rate": 4.068181818181818e-07, + "logits/chosen": -0.1806640625, + "logits/rejected": -0.373046875, + "logps/chosen": -406.0, + "logps/rejected": -330.0, + "loss": 0.2688, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 0.462890625, + "rewards/margins": 5.125, + "rewards/rejected": -4.65625, + "step": 476 + }, + { + "epoch": 0.5852760736196319, + "grad_norm": 36.47831028156178, + "learning_rate": 4.0661157024793384e-07, + "logits/chosen": -0.287109375, + "logits/rejected": -0.439453125, + "logps/chosen": -418.0, + "logps/rejected": -342.0, + "loss": 0.2274, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.5625, + "rewards/margins": 6.28125, + "rewards/rejected": -4.71875, + "step": 477 + }, + { + "epoch": 0.5865030674846625, + "grad_norm": 38.16498737596341, + "learning_rate": 4.0640495867768594e-07, + "logits/chosen": -0.205078125, + "logits/rejected": -0.380859375, + "logps/chosen": -418.0, + "logps/rejected": -338.0, + "loss": 0.2857, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.2265625, + "rewards/margins": 5.9375, + "rewards/rejected": -4.71875, + "step": 478 + }, + { + "epoch": 0.5877300613496933, + "grad_norm": 41.81318374412193, + "learning_rate": 4.06198347107438e-07, + "logits/chosen": -0.2060546875, + "logits/rejected": -0.462890625, + "logps/chosen": -352.0, + "logps/rejected": -324.0, + "loss": 0.2644, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.58203125, + "rewards/margins": 5.46875, + "rewards/rejected": -4.90625, + "step": 479 + }, + { + "epoch": 0.588957055214724, + "grad_norm": 34.21678743382818, + "learning_rate": 4.059917355371901e-07, + "logits/chosen": -0.251953125, + "logits/rejected": -0.38671875, + "logps/chosen": -356.0, + "logps/rejected": -318.0, + "loss": 0.2258, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.68359375, + "rewards/margins": 5.6875, + "rewards/rejected": -5.0, + "step": 480 + }, + { + "epoch": 0.5901840490797546, + "grad_norm": 41.214709064982436, + "learning_rate": 4.0578512396694213e-07, + "logits/chosen": -0.25, + "logits/rejected": -0.376953125, + "logps/chosen": -424.0, + "logps/rejected": -370.0, + "loss": 0.3414, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.94921875, + "rewards/margins": 5.5, + "rewards/rejected": -4.5625, + "step": 481 + }, + { + "epoch": 0.5914110429447853, + "grad_norm": 34.07376051032277, + "learning_rate": 4.0557851239669423e-07, + "logits/chosen": -0.2431640625, + "logits/rejected": -0.416015625, + "logps/chosen": -410.0, + "logps/rejected": -326.0, + "loss": 0.269, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.0859375, + "rewards/margins": 5.71875, + "rewards/rejected": -4.65625, + "step": 482 + }, + { + "epoch": 0.592638036809816, + "grad_norm": 37.03436000175101, + "learning_rate": 4.053719008264463e-07, + "logits/chosen": -0.11572265625, + "logits/rejected": -0.263671875, + "logps/chosen": -346.0, + "logps/rejected": -304.0, + "loss": 0.2869, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.71484375, + "rewards/margins": 5.375, + "rewards/rejected": -4.65625, + "step": 483 + }, + { + "epoch": 0.5938650306748466, + "grad_norm": 37.50453607778557, + "learning_rate": 4.0516528925619833e-07, + "logits/chosen": -0.1953125, + "logits/rejected": -0.349609375, + "logps/chosen": -370.0, + "logps/rejected": -318.0, + "loss": 0.3017, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.171875, + "rewards/margins": 5.375, + "rewards/rejected": -4.21875, + "step": 484 + }, + { + "epoch": 0.5950920245398773, + "grad_norm": 35.082772186969954, + "learning_rate": 4.049586776859504e-07, + "logits/chosen": -0.16796875, + "logits/rejected": -0.31640625, + "logps/chosen": -360.0, + "logps/rejected": -298.0, + "loss": 0.2666, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.6796875, + "rewards/margins": 5.53125, + "rewards/rejected": -4.84375, + "step": 485 + }, + { + "epoch": 0.596319018404908, + "grad_norm": 34.67777878301507, + "learning_rate": 4.047520661157025e-07, + "logits/chosen": -0.1923828125, + "logits/rejected": -0.33203125, + "logps/chosen": -404.0, + "logps/rejected": -330.0, + "loss": 0.2405, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.28125, + "rewards/margins": 5.625, + "rewards/rejected": -4.34375, + "step": 486 + }, + { + "epoch": 0.5975460122699386, + "grad_norm": 36.99824119978169, + "learning_rate": 4.045454545454545e-07, + "logits/chosen": -0.24609375, + "logits/rejected": -0.458984375, + "logps/chosen": -404.0, + "logps/rejected": -344.0, + "loss": 0.2534, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.96875, + "rewards/margins": 6.0, + "rewards/rejected": -5.0, + "step": 487 + }, + { + "epoch": 0.5987730061349693, + "grad_norm": 47.34405656815455, + "learning_rate": 4.0433884297520657e-07, + "logits/chosen": -0.25390625, + "logits/rejected": -0.33984375, + "logps/chosen": -420.0, + "logps/rejected": -354.0, + "loss": 0.2559, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.9375, + "rewards/margins": 5.625, + "rewards/rejected": -4.6875, + "step": 488 + }, + { + "epoch": 0.6, + "grad_norm": 32.18985964645197, + "learning_rate": 4.0413223140495867e-07, + "logits/chosen": -0.171875, + "logits/rejected": -0.421875, + "logps/chosen": -380.0, + "logps/rejected": -320.0, + "loss": 0.2603, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.4609375, + "rewards/margins": 6.375, + "rewards/rejected": -4.90625, + "step": 489 + }, + { + "epoch": 0.6012269938650306, + "grad_norm": 41.3641809975054, + "learning_rate": 4.039256198347107e-07, + "logits/chosen": -0.14453125, + "logits/rejected": -0.369140625, + "logps/chosen": -424.0, + "logps/rejected": -346.0, + "loss": 0.2435, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 0.9609375, + "rewards/margins": 5.78125, + "rewards/rejected": -4.8125, + "step": 490 + }, + { + "epoch": 0.6024539877300613, + "grad_norm": 36.929475951535615, + "learning_rate": 4.037190082644628e-07, + "logits/chosen": -0.1279296875, + "logits/rejected": -0.3359375, + "logps/chosen": -368.0, + "logps/rejected": -312.0, + "loss": 0.2468, + "rewards/accuracies": 0.9140625, + "rewards/chosen": 0.76953125, + "rewards/margins": 5.71875, + "rewards/rejected": -4.9375, + "step": 491 + }, + { + "epoch": 0.603680981595092, + "grad_norm": 34.25022073617326, + "learning_rate": 4.0351239669421486e-07, + "logits/chosen": -0.212890625, + "logits/rejected": -0.36328125, + "logps/chosen": -394.0, + "logps/rejected": -374.0, + "loss": 0.2476, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 0.82421875, + "rewards/margins": 5.4375, + "rewards/rejected": -4.625, + "step": 492 + }, + { + "epoch": 0.6049079754601226, + "grad_norm": 44.528399584764976, + "learning_rate": 4.033057851239669e-07, + "logits/chosen": -0.07275390625, + "logits/rejected": -0.18359375, + "logps/chosen": -388.0, + "logps/rejected": -324.0, + "loss": 0.3692, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.67578125, + "rewards/margins": 4.5625, + "rewards/rejected": -3.890625, + "step": 493 + }, + { + "epoch": 0.6061349693251534, + "grad_norm": 33.0051523964255, + "learning_rate": 4.0309917355371896e-07, + "logits/chosen": -0.1591796875, + "logits/rejected": -0.345703125, + "logps/chosen": -426.0, + "logps/rejected": -326.0, + "loss": 0.2292, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.4921875, + "rewards/margins": 6.3125, + "rewards/rejected": -4.8125, + "step": 494 + }, + { + "epoch": 0.6073619631901841, + "grad_norm": 36.62725418587262, + "learning_rate": 4.0289256198347106e-07, + "logits/chosen": -0.16796875, + "logits/rejected": -0.32421875, + "logps/chosen": -400.0, + "logps/rejected": -336.0, + "loss": 0.2572, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.2265625, + "rewards/margins": 5.9375, + "rewards/rejected": -4.71875, + "step": 495 + }, + { + "epoch": 0.6085889570552148, + "grad_norm": 42.16049484237724, + "learning_rate": 4.026859504132231e-07, + "logits/chosen": -0.2138671875, + "logits/rejected": -0.431640625, + "logps/chosen": -378.0, + "logps/rejected": -312.0, + "loss": 0.3108, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.53515625, + "rewards/margins": 5.46875, + "rewards/rejected": -4.90625, + "step": 496 + }, + { + "epoch": 0.6098159509202454, + "grad_norm": 45.47382251482463, + "learning_rate": 4.024793388429752e-07, + "logits/chosen": -0.1669921875, + "logits/rejected": -0.337890625, + "logps/chosen": -400.0, + "logps/rejected": -352.0, + "loss": 0.3664, + "rewards/accuracies": 0.7734375, + "rewards/chosen": 0.51953125, + "rewards/margins": 5.5, + "rewards/rejected": -4.96875, + "step": 497 + }, + { + "epoch": 0.6110429447852761, + "grad_norm": 35.6433892815013, + "learning_rate": 4.0227272727272725e-07, + "logits/chosen": -0.28515625, + "logits/rejected": -0.46484375, + "logps/chosen": -398.0, + "logps/rejected": -354.0, + "loss": 0.2458, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.171875, + "rewards/margins": 6.4375, + "rewards/rejected": -5.25, + "step": 498 + }, + { + "epoch": 0.6122699386503068, + "grad_norm": 37.060767498257135, + "learning_rate": 4.0206611570247935e-07, + "logits/chosen": -0.1630859375, + "logits/rejected": -0.388671875, + "logps/chosen": -424.0, + "logps/rejected": -336.0, + "loss": 0.2685, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.09375, + "rewards/margins": 5.8125, + "rewards/rejected": -4.71875, + "step": 499 + }, + { + "epoch": 0.6134969325153374, + "grad_norm": 35.21143709339605, + "learning_rate": 4.018595041322314e-07, + "logits/chosen": -0.189453125, + "logits/rejected": -0.314453125, + "logps/chosen": -418.0, + "logps/rejected": -322.0, + "loss": 0.2498, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.15625, + "rewards/margins": 5.90625, + "rewards/rejected": -4.75, + "step": 500 + }, + { + "epoch": 0.6147239263803681, + "grad_norm": 39.07038484978643, + "learning_rate": 4.0165289256198345e-07, + "logits/chosen": -0.240234375, + "logits/rejected": -0.373046875, + "logps/chosen": -406.0, + "logps/rejected": -338.0, + "loss": 0.2402, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.515625, + "rewards/margins": 6.5625, + "rewards/rejected": -5.0625, + "step": 501 + }, + { + "epoch": 0.6159509202453988, + "grad_norm": 34.95433271630032, + "learning_rate": 4.014462809917355e-07, + "logits/chosen": -0.20703125, + "logits/rejected": -0.47265625, + "logps/chosen": -382.0, + "logps/rejected": -322.0, + "loss": 0.2631, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.2109375, + "rewards/margins": 6.46875, + "rewards/rejected": -5.28125, + "step": 502 + }, + { + "epoch": 0.6171779141104294, + "grad_norm": 36.27046530070022, + "learning_rate": 4.012396694214876e-07, + "logits/chosen": -0.0498046875, + "logits/rejected": -0.248046875, + "logps/chosen": -328.0, + "logps/rejected": -306.0, + "loss": 0.2571, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.8515625, + "rewards/margins": 5.53125, + "rewards/rejected": -4.65625, + "step": 503 + }, + { + "epoch": 0.6184049079754601, + "grad_norm": 32.074615531320944, + "learning_rate": 4.0103305785123964e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.44140625, + "logps/chosen": -384.0, + "logps/rejected": -326.0, + "loss": 0.253, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.416015625, + "rewards/margins": 5.34375, + "rewards/rejected": -4.9375, + "step": 504 + }, + { + "epoch": 0.6196319018404908, + "grad_norm": 50.2956600108261, + "learning_rate": 4.0082644628099174e-07, + "logits/chosen": -0.263671875, + "logits/rejected": -0.4921875, + "logps/chosen": -424.0, + "logps/rejected": -384.0, + "loss": 0.3428, + "rewards/accuracies": 0.796875, + "rewards/chosen": 0.40234375, + "rewards/margins": 5.6875, + "rewards/rejected": -5.28125, + "step": 505 + }, + { + "epoch": 0.6208588957055214, + "grad_norm": 39.722486070303646, + "learning_rate": 4.006198347107438e-07, + "logits/chosen": -0.1298828125, + "logits/rejected": -0.423828125, + "logps/chosen": -420.0, + "logps/rejected": -320.0, + "loss": 0.2585, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.93359375, + "rewards/margins": 6.0, + "rewards/rejected": -5.0625, + "step": 506 + }, + { + "epoch": 0.6220858895705521, + "grad_norm": 31.372949248189112, + "learning_rate": 4.0041322314049583e-07, + "logits/chosen": -0.22265625, + "logits/rejected": -0.34375, + "logps/chosen": -386.0, + "logps/rejected": -298.0, + "loss": 0.2085, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.92578125, + "rewards/margins": 6.125, + "rewards/rejected": -5.1875, + "step": 507 + }, + { + "epoch": 0.6233128834355828, + "grad_norm": 31.130400720786195, + "learning_rate": 4.0020661157024793e-07, + "logits/chosen": -0.062255859375, + "logits/rejected": -0.2431640625, + "logps/chosen": -386.0, + "logps/rejected": -300.0, + "loss": 0.2241, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 0.91015625, + "rewards/margins": 5.59375, + "rewards/rejected": -4.6875, + "step": 508 + }, + { + "epoch": 0.6245398773006134, + "grad_norm": 53.16460512064989, + "learning_rate": 4e-07, + "logits/chosen": -0.1962890625, + "logits/rejected": -0.4375, + "logps/chosen": -464.0, + "logps/rejected": -374.0, + "loss": 0.3519, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 2.109375, + "rewards/margins": 7.0625, + "rewards/rejected": -4.9375, + "step": 509 + }, + { + "epoch": 0.6257668711656442, + "grad_norm": 33.530586116590285, + "learning_rate": 3.9979338842975203e-07, + "logits/chosen": -0.30859375, + "logits/rejected": -0.474609375, + "logps/chosen": -358.0, + "logps/rejected": -294.0, + "loss": 0.2436, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 0.609375, + "rewards/margins": 5.15625, + "rewards/rejected": -4.5625, + "step": 510 + }, + { + "epoch": 0.6269938650306749, + "grad_norm": 40.068124237732846, + "learning_rate": 3.995867768595041e-07, + "logits/chosen": -0.30078125, + "logits/rejected": -0.439453125, + "logps/chosen": -390.0, + "logps/rejected": -344.0, + "loss": 0.2864, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.2109375, + "rewards/margins": 6.25, + "rewards/rejected": -5.03125, + "step": 511 + }, + { + "epoch": 0.6282208588957056, + "grad_norm": 46.79446957798848, + "learning_rate": 3.993801652892562e-07, + "logits/chosen": -0.1337890625, + "logits/rejected": -0.28515625, + "logps/chosen": -378.0, + "logps/rejected": -376.0, + "loss": 0.3288, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.5625, + "rewards/margins": 4.6875, + "rewards/rejected": -4.125, + "step": 512 + }, + { + "epoch": 0.6294478527607362, + "grad_norm": 39.156027495649305, + "learning_rate": 3.991735537190082e-07, + "logits/chosen": -0.138671875, + "logits/rejected": -0.283203125, + "logps/chosen": -372.0, + "logps/rejected": -302.0, + "loss": 0.335, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.3515625, + "rewards/margins": 5.71875, + "rewards/rejected": -4.375, + "step": 513 + }, + { + "epoch": 0.6306748466257669, + "grad_norm": 32.5774175879679, + "learning_rate": 3.989669421487603e-07, + "logits/chosen": -0.12353515625, + "logits/rejected": -0.279296875, + "logps/chosen": -326.0, + "logps/rejected": -278.0, + "loss": 0.2532, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.220703125, + "rewards/margins": 5.375, + "rewards/rejected": -5.15625, + "step": 514 + }, + { + "epoch": 0.6319018404907976, + "grad_norm": 40.41320321797794, + "learning_rate": 3.9876033057851237e-07, + "logits/chosen": -0.1376953125, + "logits/rejected": -0.291015625, + "logps/chosen": -344.0, + "logps/rejected": -338.0, + "loss": 0.2856, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.2578125, + "rewards/margins": 5.25, + "rewards/rejected": -5.0, + "step": 515 + }, + { + "epoch": 0.6331288343558282, + "grad_norm": 33.09690635668108, + "learning_rate": 3.9855371900826447e-07, + "logits/chosen": -0.1806640625, + "logits/rejected": -0.27734375, + "logps/chosen": -366.0, + "logps/rejected": -320.0, + "loss": 0.2475, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.404296875, + "rewards/margins": 5.34375, + "rewards/rejected": -4.9375, + "step": 516 + }, + { + "epoch": 0.6343558282208589, + "grad_norm": 45.00347742756972, + "learning_rate": 3.983471074380165e-07, + "logits/chosen": -0.166015625, + "logits/rejected": -0.32421875, + "logps/chosen": -388.0, + "logps/rejected": -326.0, + "loss": 0.3686, + "rewards/accuracies": 0.796875, + "rewards/chosen": 0.7265625, + "rewards/margins": 5.0, + "rewards/rejected": -4.28125, + "step": 517 + }, + { + "epoch": 0.6355828220858896, + "grad_norm": 37.888666954836985, + "learning_rate": 3.981404958677686e-07, + "logits/chosen": -0.2421875, + "logits/rejected": -0.369140625, + "logps/chosen": -414.0, + "logps/rejected": -336.0, + "loss": 0.2069, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.328125, + "rewards/margins": 5.96875, + "rewards/rejected": -4.625, + "step": 518 + }, + { + "epoch": 0.6368098159509202, + "grad_norm": 38.80463867569447, + "learning_rate": 3.979338842975206e-07, + "logits/chosen": -0.2294921875, + "logits/rejected": -0.3671875, + "logps/chosen": -380.0, + "logps/rejected": -328.0, + "loss": 0.2446, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.921875, + "rewards/margins": 5.78125, + "rewards/rejected": -4.875, + "step": 519 + }, + { + "epoch": 0.6380368098159509, + "grad_norm": 40.986581892777515, + "learning_rate": 3.977272727272727e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.494140625, + "logps/chosen": -366.0, + "logps/rejected": -320.0, + "loss": 0.3191, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.2265625, + "rewards/margins": 6.3125, + "rewards/rejected": -5.09375, + "step": 520 + }, + { + "epoch": 0.6392638036809816, + "grad_norm": 36.04171128345913, + "learning_rate": 3.9752066115702476e-07, + "logits/chosen": -0.07763671875, + "logits/rejected": -0.2138671875, + "logps/chosen": -412.0, + "logps/rejected": -348.0, + "loss": 0.2642, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.546875, + "rewards/margins": 6.34375, + "rewards/rejected": -4.8125, + "step": 521 + }, + { + "epoch": 0.6404907975460122, + "grad_norm": 36.91350515266316, + "learning_rate": 3.9731404958677686e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.421875, + "logps/chosen": -422.0, + "logps/rejected": -340.0, + "loss": 0.3094, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.15625, + "rewards/margins": 6.46875, + "rewards/rejected": -5.3125, + "step": 522 + }, + { + "epoch": 0.6417177914110429, + "grad_norm": 42.88283547574401, + "learning_rate": 3.971074380165289e-07, + "logits/chosen": -0.1923828125, + "logits/rejected": -0.337890625, + "logps/chosen": -362.0, + "logps/rejected": -316.0, + "loss": 0.3333, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.6171875, + "rewards/margins": 5.09375, + "rewards/rejected": -4.46875, + "step": 523 + }, + { + "epoch": 0.6429447852760736, + "grad_norm": 45.322523177242, + "learning_rate": 3.9690082644628095e-07, + "logits/chosen": -0.1611328125, + "logits/rejected": -0.361328125, + "logps/chosen": -422.0, + "logps/rejected": -350.0, + "loss": 0.3031, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.609375, + "rewards/margins": 5.21875, + "rewards/rejected": -4.59375, + "step": 524 + }, + { + "epoch": 0.6441717791411042, + "grad_norm": 49.70289783132654, + "learning_rate": 3.9669421487603305e-07, + "logits/chosen": -0.1650390625, + "logits/rejected": -0.2294921875, + "logps/chosen": -388.0, + "logps/rejected": -356.0, + "loss": 0.3567, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.578125, + "rewards/margins": 4.8125, + "rewards/rejected": -4.25, + "step": 525 + }, + { + "epoch": 0.645398773006135, + "grad_norm": 36.78598991927111, + "learning_rate": 3.964876033057851e-07, + "logits/chosen": -0.1845703125, + "logits/rejected": -0.3359375, + "logps/chosen": -386.0, + "logps/rejected": -328.0, + "loss": 0.2502, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.98828125, + "rewards/margins": 5.9375, + "rewards/rejected": -4.96875, + "step": 526 + }, + { + "epoch": 0.6466257668711657, + "grad_norm": 36.651686257226466, + "learning_rate": 3.962809917355372e-07, + "logits/chosen": -0.125, + "logits/rejected": -0.345703125, + "logps/chosen": -422.0, + "logps/rejected": -318.0, + "loss": 0.2789, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.85546875, + "rewards/margins": 5.625, + "rewards/rejected": -4.78125, + "step": 527 + }, + { + "epoch": 0.6478527607361964, + "grad_norm": 35.31748764596186, + "learning_rate": 3.960743801652892e-07, + "logits/chosen": -0.2333984375, + "logits/rejected": -0.427734375, + "logps/chosen": -356.0, + "logps/rejected": -314.0, + "loss": 0.2999, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.625, + "rewards/margins": 5.78125, + "rewards/rejected": -5.15625, + "step": 528 + }, + { + "epoch": 0.649079754601227, + "grad_norm": 36.86996860776575, + "learning_rate": 3.958677685950413e-07, + "logits/chosen": -0.19140625, + "logits/rejected": -0.373046875, + "logps/chosen": -338.0, + "logps/rejected": -326.0, + "loss": 0.3236, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.94140625, + "rewards/margins": 5.5625, + "rewards/rejected": -4.625, + "step": 529 + }, + { + "epoch": 0.6503067484662577, + "grad_norm": 40.308596718463534, + "learning_rate": 3.9566115702479334e-07, + "logits/chosen": -0.1611328125, + "logits/rejected": -0.302734375, + "logps/chosen": -358.0, + "logps/rejected": -338.0, + "loss": 0.307, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.1015625, + "rewards/margins": 5.9375, + "rewards/rejected": -4.84375, + "step": 530 + }, + { + "epoch": 0.6515337423312884, + "grad_norm": 34.92823583852622, + "learning_rate": 3.9545454545454544e-07, + "logits/chosen": -0.2265625, + "logits/rejected": -0.400390625, + "logps/chosen": -382.0, + "logps/rejected": -310.0, + "loss": 0.2686, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.046875, + "rewards/margins": 5.5625, + "rewards/rejected": -4.5, + "step": 531 + }, + { + "epoch": 0.652760736196319, + "grad_norm": 35.9537343386399, + "learning_rate": 3.952479338842975e-07, + "logits/chosen": -0.12158203125, + "logits/rejected": -0.263671875, + "logps/chosen": -384.0, + "logps/rejected": -318.0, + "loss": 0.2733, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.91015625, + "rewards/margins": 5.25, + "rewards/rejected": -4.3125, + "step": 532 + }, + { + "epoch": 0.6539877300613497, + "grad_norm": 33.35300325251816, + "learning_rate": 3.950413223140496e-07, + "logits/chosen": -0.275390625, + "logits/rejected": -0.482421875, + "logps/chosen": -404.0, + "logps/rejected": -338.0, + "loss": 0.2339, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.6640625, + "rewards/margins": 6.46875, + "rewards/rejected": -4.78125, + "step": 533 + }, + { + "epoch": 0.6552147239263804, + "grad_norm": 33.59071906368527, + "learning_rate": 3.9483471074380164e-07, + "logits/chosen": -0.1416015625, + "logits/rejected": -0.26953125, + "logps/chosen": -364.0, + "logps/rejected": -316.0, + "loss": 0.2687, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.0, + "rewards/margins": 5.1875, + "rewards/rejected": -4.15625, + "step": 534 + }, + { + "epoch": 0.656441717791411, + "grad_norm": 37.966223525168424, + "learning_rate": 3.9462809917355374e-07, + "logits/chosen": -0.2470703125, + "logits/rejected": -0.3671875, + "logps/chosen": -368.0, + "logps/rejected": -324.0, + "loss": 0.2745, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.359375, + "rewards/margins": 5.15625, + "rewards/rejected": -4.78125, + "step": 535 + }, + { + "epoch": 0.6576687116564417, + "grad_norm": 33.781725934858414, + "learning_rate": 3.944214876033058e-07, + "logits/chosen": -0.19140625, + "logits/rejected": -0.30859375, + "logps/chosen": -386.0, + "logps/rejected": -308.0, + "loss": 0.2154, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.4140625, + "rewards/margins": 6.09375, + "rewards/rejected": -4.6875, + "step": 536 + }, + { + "epoch": 0.6588957055214724, + "grad_norm": 47.92234178996883, + "learning_rate": 3.9421487603305783e-07, + "logits/chosen": -0.1904296875, + "logits/rejected": -0.349609375, + "logps/chosen": -380.0, + "logps/rejected": -302.0, + "loss": 0.3881, + "rewards/accuracies": 0.7734375, + "rewards/chosen": 0.1796875, + "rewards/margins": 4.375, + "rewards/rejected": -4.1875, + "step": 537 + }, + { + "epoch": 0.660122699386503, + "grad_norm": 42.47717470031941, + "learning_rate": 3.940082644628099e-07, + "logits/chosen": -0.150390625, + "logits/rejected": -0.33984375, + "logps/chosen": -396.0, + "logps/rejected": -342.0, + "loss": 0.3398, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.40625, + "rewards/margins": 5.6875, + "rewards/rejected": -4.28125, + "step": 538 + }, + { + "epoch": 0.6613496932515337, + "grad_norm": 37.22523933086588, + "learning_rate": 3.93801652892562e-07, + "logits/chosen": -0.154296875, + "logits/rejected": -0.30078125, + "logps/chosen": -394.0, + "logps/rejected": -334.0, + "loss": 0.2742, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.3203125, + "rewards/margins": 5.1875, + "rewards/rejected": -3.859375, + "step": 539 + }, + { + "epoch": 0.6625766871165644, + "grad_norm": 40.71616745650965, + "learning_rate": 3.93595041322314e-07, + "logits/chosen": -0.1328125, + "logits/rejected": -0.30859375, + "logps/chosen": -390.0, + "logps/rejected": -318.0, + "loss": 0.3006, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.34375, + "rewards/margins": 5.84375, + "rewards/rejected": -4.5, + "step": 540 + }, + { + "epoch": 0.6638036809815951, + "grad_norm": 36.00028869643927, + "learning_rate": 3.933884297520661e-07, + "logits/chosen": -0.1552734375, + "logits/rejected": -0.259765625, + "logps/chosen": -386.0, + "logps/rejected": -340.0, + "loss": 0.2699, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.71875, + "rewards/margins": 4.8125, + "rewards/rejected": -4.09375, + "step": 541 + }, + { + "epoch": 0.6650306748466258, + "grad_norm": 36.856579052467744, + "learning_rate": 3.9318181818181817e-07, + "logits/chosen": -0.1845703125, + "logits/rejected": -0.29296875, + "logps/chosen": -352.0, + "logps/rejected": -310.0, + "loss": 0.2808, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.265625, + "rewards/margins": 5.25, + "rewards/rejected": -4.0, + "step": 542 + }, + { + "epoch": 0.6662576687116565, + "grad_norm": 37.076885533693634, + "learning_rate": 3.929752066115702e-07, + "logits/chosen": -0.2255859375, + "logits/rejected": -0.41015625, + "logps/chosen": -446.0, + "logps/rejected": -342.0, + "loss": 0.2335, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.9296875, + "rewards/margins": 6.25, + "rewards/rejected": -4.3125, + "step": 543 + }, + { + "epoch": 0.6674846625766871, + "grad_norm": 48.36100783202625, + "learning_rate": 3.927685950413223e-07, + "logits/chosen": -0.20703125, + "logits/rejected": -0.35546875, + "logps/chosen": -374.0, + "logps/rejected": -306.0, + "loss": 0.3321, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.84375, + "rewards/margins": 5.4375, + "rewards/rejected": -4.59375, + "step": 544 + }, + { + "epoch": 0.6687116564417178, + "grad_norm": 43.36042581975704, + "learning_rate": 3.9256198347107437e-07, + "logits/chosen": -0.25, + "logits/rejected": -0.427734375, + "logps/chosen": -452.0, + "logps/rejected": -354.0, + "loss": 0.3606, + "rewards/accuracies": 0.796875, + "rewards/chosen": 1.6171875, + "rewards/margins": 5.5, + "rewards/rejected": -3.890625, + "step": 545 + }, + { + "epoch": 0.6699386503067485, + "grad_norm": 39.63701590605686, + "learning_rate": 3.923553719008264e-07, + "logits/chosen": -0.1416015625, + "logits/rejected": -0.251953125, + "logps/chosen": -370.0, + "logps/rejected": -326.0, + "loss": 0.3095, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.203125, + "rewards/margins": 5.5625, + "rewards/rejected": -4.34375, + "step": 546 + }, + { + "epoch": 0.6711656441717792, + "grad_norm": 33.08408154520663, + "learning_rate": 3.9214876033057846e-07, + "logits/chosen": -0.205078125, + "logits/rejected": -0.380859375, + "logps/chosen": -380.0, + "logps/rejected": -300.0, + "loss": 0.2677, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.53125, + "rewards/margins": 5.78125, + "rewards/rejected": -4.25, + "step": 547 + }, + { + "epoch": 0.6723926380368098, + "grad_norm": 41.01241845328248, + "learning_rate": 3.9194214876033056e-07, + "logits/chosen": -0.251953125, + "logits/rejected": -0.47265625, + "logps/chosen": -396.0, + "logps/rejected": -346.0, + "loss": 0.2427, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.6640625, + "rewards/margins": 5.5625, + "rewards/rejected": -3.90625, + "step": 548 + }, + { + "epoch": 0.6736196319018405, + "grad_norm": 38.04742407115687, + "learning_rate": 3.917355371900826e-07, + "logits/chosen": -0.158203125, + "logits/rejected": -0.37890625, + "logps/chosen": -408.0, + "logps/rejected": -332.0, + "loss": 0.2684, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.3203125, + "rewards/margins": 5.375, + "rewards/rejected": -4.0625, + "step": 549 + }, + { + "epoch": 0.6748466257668712, + "grad_norm": 38.74485204677174, + "learning_rate": 3.915289256198347e-07, + "logits/chosen": -0.2333984375, + "logits/rejected": -0.314453125, + "logps/chosen": -392.0, + "logps/rejected": -312.0, + "loss": 0.3275, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.1015625, + "rewards/margins": 4.875, + "rewards/rejected": -3.78125, + "step": 550 + }, + { + "epoch": 0.6760736196319018, + "grad_norm": 36.24315774996275, + "learning_rate": 3.9132231404958675e-07, + "logits/chosen": -0.1474609375, + "logits/rejected": -0.279296875, + "logps/chosen": -402.0, + "logps/rejected": -328.0, + "loss": 0.2537, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.9375, + "rewards/margins": 5.65625, + "rewards/rejected": -3.71875, + "step": 551 + }, + { + "epoch": 0.6773006134969325, + "grad_norm": 36.45208223894636, + "learning_rate": 3.9111570247933885e-07, + "logits/chosen": -0.232421875, + "logits/rejected": -0.375, + "logps/chosen": -410.0, + "logps/rejected": -344.0, + "loss": 0.2933, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.359375, + "rewards/margins": 5.28125, + "rewards/rejected": -3.921875, + "step": 552 + }, + { + "epoch": 0.6785276073619632, + "grad_norm": 41.631610478201644, + "learning_rate": 3.909090909090909e-07, + "logits/chosen": -0.18359375, + "logits/rejected": -0.333984375, + "logps/chosen": -356.0, + "logps/rejected": -324.0, + "loss": 0.3207, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.7890625, + "rewards/margins": 4.59375, + "rewards/rejected": -3.796875, + "step": 553 + }, + { + "epoch": 0.6797546012269938, + "grad_norm": 33.49412012982899, + "learning_rate": 3.90702479338843e-07, + "logits/chosen": -0.1328125, + "logits/rejected": -0.34375, + "logps/chosen": -424.0, + "logps/rejected": -316.0, + "loss": 0.2289, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.84375, + "rewards/margins": 5.625, + "rewards/rejected": -3.796875, + "step": 554 + }, + { + "epoch": 0.6809815950920245, + "grad_norm": 37.66391393717185, + "learning_rate": 3.90495867768595e-07, + "logits/chosen": -0.03759765625, + "logits/rejected": -0.1650390625, + "logps/chosen": -352.0, + "logps/rejected": -296.0, + "loss": 0.3404, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.4296875, + "rewards/margins": 5.15625, + "rewards/rejected": -3.71875, + "step": 555 + }, + { + "epoch": 0.6822085889570552, + "grad_norm": 30.301075310625425, + "learning_rate": 3.902892561983471e-07, + "logits/chosen": -0.1552734375, + "logits/rejected": -0.37109375, + "logps/chosen": -414.0, + "logps/rejected": -334.0, + "loss": 0.2278, + "rewards/accuracies": 0.84375, + "rewards/chosen": 2.140625, + "rewards/margins": 6.1875, + "rewards/rejected": -4.0625, + "step": 556 + }, + { + "epoch": 0.6834355828220859, + "grad_norm": 33.83430112648751, + "learning_rate": 3.9008264462809914e-07, + "logits/chosen": -0.16796875, + "logits/rejected": -0.392578125, + "logps/chosen": -386.0, + "logps/rejected": -320.0, + "loss": 0.2682, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.78125, + "rewards/margins": 5.4375, + "rewards/rejected": -3.65625, + "step": 557 + }, + { + "epoch": 0.6846625766871166, + "grad_norm": 30.75402635256423, + "learning_rate": 3.8987603305785124e-07, + "logits/chosen": -0.1298828125, + "logits/rejected": -0.287109375, + "logps/chosen": -364.0, + "logps/rejected": -314.0, + "loss": 0.2312, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.09375, + "rewards/margins": 5.78125, + "rewards/rejected": -4.6875, + "step": 558 + }, + { + "epoch": 0.6858895705521473, + "grad_norm": 40.61066869149253, + "learning_rate": 3.896694214876033e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.388671875, + "logps/chosen": -374.0, + "logps/rejected": -328.0, + "loss": 0.3017, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.2734375, + "rewards/margins": 5.5, + "rewards/rejected": -4.21875, + "step": 559 + }, + { + "epoch": 0.6871165644171779, + "grad_norm": 28.075176930111862, + "learning_rate": 3.8946280991735534e-07, + "logits/chosen": -0.34375, + "logits/rejected": -0.494140625, + "logps/chosen": -382.0, + "logps/rejected": -316.0, + "loss": 0.1832, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.6171875, + "rewards/margins": 6.4375, + "rewards/rejected": -4.8125, + "step": 560 + }, + { + "epoch": 0.6883435582822086, + "grad_norm": 31.670561048270176, + "learning_rate": 3.8925619834710744e-07, + "logits/chosen": -0.208984375, + "logits/rejected": -0.390625, + "logps/chosen": -348.0, + "logps/rejected": -288.0, + "loss": 0.2243, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.390625, + "rewards/margins": 5.84375, + "rewards/rejected": -4.4375, + "step": 561 + }, + { + "epoch": 0.6895705521472393, + "grad_norm": 32.855068201542075, + "learning_rate": 3.890495867768595e-07, + "logits/chosen": -0.087890625, + "logits/rejected": -0.287109375, + "logps/chosen": -368.0, + "logps/rejected": -308.0, + "loss": 0.2422, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.84375, + "rewards/margins": 5.28125, + "rewards/rejected": -4.4375, + "step": 562 + }, + { + "epoch": 0.69079754601227, + "grad_norm": 35.79449426535959, + "learning_rate": 3.888429752066116e-07, + "logits/chosen": -0.244140625, + "logits/rejected": -0.40625, + "logps/chosen": -388.0, + "logps/rejected": -358.0, + "loss": 0.2546, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.7109375, + "rewards/margins": 6.28125, + "rewards/rejected": -4.5625, + "step": 563 + }, + { + "epoch": 0.6920245398773006, + "grad_norm": 29.77603709052077, + "learning_rate": 3.886363636363636e-07, + "logits/chosen": -0.255859375, + "logits/rejected": -0.37890625, + "logps/chosen": -384.0, + "logps/rejected": -324.0, + "loss": 0.2408, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.015625, + "rewards/margins": 5.3125, + "rewards/rejected": -4.3125, + "step": 564 + }, + { + "epoch": 0.6932515337423313, + "grad_norm": 35.70334442848756, + "learning_rate": 3.884297520661157e-07, + "logits/chosen": -0.19921875, + "logits/rejected": -0.400390625, + "logps/chosen": -392.0, + "logps/rejected": -330.0, + "loss": 0.3131, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.859375, + "rewards/margins": 4.84375, + "rewards/rejected": -3.96875, + "step": 565 + }, + { + "epoch": 0.694478527607362, + "grad_norm": 35.48298237028605, + "learning_rate": 3.882231404958677e-07, + "logits/chosen": -0.2109375, + "logits/rejected": -0.322265625, + "logps/chosen": -412.0, + "logps/rejected": -326.0, + "loss": 0.2452, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.5859375, + "rewards/margins": 5.96875, + "rewards/rejected": -4.375, + "step": 566 + }, + { + "epoch": 0.6957055214723926, + "grad_norm": 31.112271919353073, + "learning_rate": 3.880165289256198e-07, + "logits/chosen": -0.11572265625, + "logits/rejected": -0.251953125, + "logps/chosen": -314.0, + "logps/rejected": -266.0, + "loss": 0.2267, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 0.58203125, + "rewards/margins": 4.8125, + "rewards/rejected": -4.21875, + "step": 567 + }, + { + "epoch": 0.6969325153374233, + "grad_norm": 38.89246029311522, + "learning_rate": 3.8780991735537187e-07, + "logits/chosen": -0.2353515625, + "logits/rejected": -0.314453125, + "logps/chosen": -380.0, + "logps/rejected": -316.0, + "loss": 0.2865, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.109375, + "rewards/margins": 5.59375, + "rewards/rejected": -4.46875, + "step": 568 + }, + { + "epoch": 0.698159509202454, + "grad_norm": 34.50521407178372, + "learning_rate": 3.8760330578512397e-07, + "logits/chosen": -0.1552734375, + "logits/rejected": -0.3046875, + "logps/chosen": -380.0, + "logps/rejected": -298.0, + "loss": 0.2647, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.7578125, + "rewards/margins": 5.0625, + "rewards/rejected": -4.3125, + "step": 569 + }, + { + "epoch": 0.6993865030674846, + "grad_norm": 27.986690455754786, + "learning_rate": 3.87396694214876e-07, + "logits/chosen": -0.3125, + "logits/rejected": -0.451171875, + "logps/chosen": -400.0, + "logps/rejected": -330.0, + "loss": 0.18, + "rewards/accuracies": 0.9453125, + "rewards/chosen": 1.5703125, + "rewards/margins": 6.25, + "rewards/rejected": -4.6875, + "step": 570 + }, + { + "epoch": 0.7006134969325153, + "grad_norm": 32.36101057946353, + "learning_rate": 3.871900826446281e-07, + "logits/chosen": -0.193359375, + "logits/rejected": -0.32421875, + "logps/chosen": -326.0, + "logps/rejected": -300.0, + "loss": 0.2221, + "rewards/accuracies": 0.890625, + "rewards/chosen": 0.625, + "rewards/margins": 5.0625, + "rewards/rejected": -4.4375, + "step": 571 + }, + { + "epoch": 0.701840490797546, + "grad_norm": 36.69242569066846, + "learning_rate": 3.8698347107438017e-07, + "logits/chosen": -0.166015625, + "logits/rejected": -0.3203125, + "logps/chosen": -384.0, + "logps/rejected": -358.0, + "loss": 0.2363, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.5859375, + "rewards/margins": 5.96875, + "rewards/rejected": -4.40625, + "step": 572 + }, + { + "epoch": 0.7030674846625767, + "grad_norm": 41.66310475024957, + "learning_rate": 3.867768595041322e-07, + "logits/chosen": -0.1240234375, + "logits/rejected": -0.26953125, + "logps/chosen": -388.0, + "logps/rejected": -326.0, + "loss": 0.3484, + "rewards/accuracies": 0.796875, + "rewards/chosen": 0.51171875, + "rewards/margins": 5.09375, + "rewards/rejected": -4.59375, + "step": 573 + }, + { + "epoch": 0.7042944785276074, + "grad_norm": 39.39212100565405, + "learning_rate": 3.8657024793388426e-07, + "logits/chosen": -0.2470703125, + "logits/rejected": -0.376953125, + "logps/chosen": -322.0, + "logps/rejected": -302.0, + "loss": 0.2719, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.89453125, + "rewards/margins": 5.53125, + "rewards/rejected": -4.625, + "step": 574 + }, + { + "epoch": 0.7055214723926381, + "grad_norm": 35.35137643401559, + "learning_rate": 3.8636363636363636e-07, + "logits/chosen": -0.283203125, + "logits/rejected": -0.458984375, + "logps/chosen": -406.0, + "logps/rejected": -364.0, + "loss": 0.2178, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.6875, + "rewards/margins": 6.65625, + "rewards/rejected": -4.96875, + "step": 575 + }, + { + "epoch": 0.7067484662576687, + "grad_norm": 28.9202010136064, + "learning_rate": 3.861570247933884e-07, + "logits/chosen": -0.1494140625, + "logits/rejected": -0.36328125, + "logps/chosen": -380.0, + "logps/rejected": -320.0, + "loss": 0.1958, + "rewards/accuracies": 0.921875, + "rewards/chosen": 1.59375, + "rewards/margins": 6.75, + "rewards/rejected": -5.15625, + "step": 576 + }, + { + "epoch": 0.7079754601226994, + "grad_norm": 36.46431827427722, + "learning_rate": 3.8595041322314045e-07, + "logits/chosen": -0.09033203125, + "logits/rejected": -0.23046875, + "logps/chosen": -362.0, + "logps/rejected": -312.0, + "loss": 0.2593, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.4296875, + "rewards/margins": 6.59375, + "rewards/rejected": -5.1875, + "step": 577 + }, + { + "epoch": 0.7092024539877301, + "grad_norm": 40.66901563749969, + "learning_rate": 3.8574380165289255e-07, + "logits/chosen": -0.2421875, + "logits/rejected": -0.3984375, + "logps/chosen": -416.0, + "logps/rejected": -326.0, + "loss": 0.3148, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.484375, + "rewards/margins": 6.46875, + "rewards/rejected": -5.0, + "step": 578 + }, + { + "epoch": 0.7104294478527607, + "grad_norm": 43.94460926088441, + "learning_rate": 3.855371900826446e-07, + "logits/chosen": -0.2353515625, + "logits/rejected": -0.330078125, + "logps/chosen": -428.0, + "logps/rejected": -326.0, + "loss": 0.3599, + "rewards/accuracies": 0.78125, + "rewards/chosen": 0.498046875, + "rewards/margins": 4.875, + "rewards/rejected": -4.375, + "step": 579 + }, + { + "epoch": 0.7116564417177914, + "grad_norm": 36.521177273018374, + "learning_rate": 3.853305785123967e-07, + "logits/chosen": -0.125, + "logits/rejected": -0.298828125, + "logps/chosen": -380.0, + "logps/rejected": -344.0, + "loss": 0.2355, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.79296875, + "rewards/margins": 6.1875, + "rewards/rejected": -5.40625, + "step": 580 + }, + { + "epoch": 0.7128834355828221, + "grad_norm": 30.81358847829242, + "learning_rate": 3.8512396694214875e-07, + "logits/chosen": -0.2373046875, + "logits/rejected": -0.427734375, + "logps/chosen": -368.0, + "logps/rejected": -308.0, + "loss": 0.2127, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.3359375, + "rewards/margins": 6.40625, + "rewards/rejected": -5.0625, + "step": 581 + }, + { + "epoch": 0.7141104294478527, + "grad_norm": 46.46655474433081, + "learning_rate": 3.849173553719008e-07, + "logits/chosen": -0.046875, + "logits/rejected": -0.259765625, + "logps/chosen": -392.0, + "logps/rejected": -320.0, + "loss": 0.31, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.9453125, + "rewards/margins": 5.09375, + "rewards/rejected": -4.15625, + "step": 582 + }, + { + "epoch": 0.7153374233128834, + "grad_norm": 38.88117000055558, + "learning_rate": 3.8471074380165284e-07, + "logits/chosen": -0.21875, + "logits/rejected": -0.373046875, + "logps/chosen": -382.0, + "logps/rejected": -334.0, + "loss": 0.3145, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.4296875, + "rewards/margins": 5.5625, + "rewards/rejected": -4.15625, + "step": 583 + }, + { + "epoch": 0.7165644171779141, + "grad_norm": 41.99819867075411, + "learning_rate": 3.8450413223140494e-07, + "logits/chosen": -0.126953125, + "logits/rejected": -0.2099609375, + "logps/chosen": -368.0, + "logps/rejected": -364.0, + "loss": 0.3344, + "rewards/accuracies": 0.796875, + "rewards/chosen": 0.640625, + "rewards/margins": 4.375, + "rewards/rejected": -3.734375, + "step": 584 + }, + { + "epoch": 0.7177914110429447, + "grad_norm": 44.1611316963058, + "learning_rate": 3.84297520661157e-07, + "logits/chosen": -0.038818359375, + "logits/rejected": -0.1630859375, + "logps/chosen": -398.0, + "logps/rejected": -318.0, + "loss": 0.3664, + "rewards/accuracies": 0.78125, + "rewards/chosen": 1.3125, + "rewards/margins": 4.90625, + "rewards/rejected": -3.609375, + "step": 585 + }, + { + "epoch": 0.7190184049079754, + "grad_norm": 39.0964035012581, + "learning_rate": 3.840909090909091e-07, + "logits/chosen": -0.158203125, + "logits/rejected": -0.271484375, + "logps/chosen": -346.0, + "logps/rejected": -296.0, + "loss": 0.2973, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.0, + "rewards/margins": 5.09375, + "rewards/rejected": -4.09375, + "step": 586 + }, + { + "epoch": 0.7202453987730061, + "grad_norm": 36.08960275580907, + "learning_rate": 3.8388429752066114e-07, + "logits/chosen": -0.1953125, + "logits/rejected": -0.306640625, + "logps/chosen": -332.0, + "logps/rejected": -306.0, + "loss": 0.2916, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.0703125, + "rewards/margins": 5.28125, + "rewards/rejected": -4.1875, + "step": 587 + }, + { + "epoch": 0.7214723926380369, + "grad_norm": 26.657846221925215, + "learning_rate": 3.8367768595041324e-07, + "logits/chosen": -0.193359375, + "logits/rejected": -0.361328125, + "logps/chosen": -380.0, + "logps/rejected": -314.0, + "loss": 0.2231, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.8515625, + "rewards/margins": 6.0625, + "rewards/rejected": -4.1875, + "step": 588 + }, + { + "epoch": 0.7226993865030675, + "grad_norm": 41.32671053142075, + "learning_rate": 3.834710743801653e-07, + "logits/chosen": -0.267578125, + "logits/rejected": -0.37109375, + "logps/chosen": -360.0, + "logps/rejected": -326.0, + "loss": 0.3126, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.69140625, + "rewards/margins": 4.5, + "rewards/rejected": -3.828125, + "step": 589 + }, + { + "epoch": 0.7239263803680982, + "grad_norm": 31.50139516862032, + "learning_rate": 3.8326446280991733e-07, + "logits/chosen": -0.171875, + "logits/rejected": -0.29296875, + "logps/chosen": -364.0, + "logps/rejected": -302.0, + "loss": 0.2457, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.125, + "rewards/margins": 5.125, + "rewards/rejected": -3.984375, + "step": 590 + }, + { + "epoch": 0.7251533742331289, + "grad_norm": 41.923208067017086, + "learning_rate": 3.830578512396694e-07, + "logits/chosen": -0.328125, + "logits/rejected": -0.51953125, + "logps/chosen": -404.0, + "logps/rejected": -326.0, + "loss": 0.2429, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.6484375, + "rewards/margins": 6.1875, + "rewards/rejected": -4.53125, + "step": 591 + }, + { + "epoch": 0.7263803680981595, + "grad_norm": 36.03509452521486, + "learning_rate": 3.828512396694215e-07, + "logits/chosen": -0.1904296875, + "logits/rejected": -0.380859375, + "logps/chosen": -370.0, + "logps/rejected": -296.0, + "loss": 0.2519, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.4375, + "rewards/margins": 6.0625, + "rewards/rejected": -4.625, + "step": 592 + }, + { + "epoch": 0.7276073619631902, + "grad_norm": 42.073646570880065, + "learning_rate": 3.826446280991735e-07, + "logits/chosen": -0.12890625, + "logits/rejected": -0.388671875, + "logps/chosen": -444.0, + "logps/rejected": -362.0, + "loss": 0.2844, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.6484375, + "rewards/margins": 5.625, + "rewards/rejected": -3.984375, + "step": 593 + }, + { + "epoch": 0.7288343558282209, + "grad_norm": 32.37131856233386, + "learning_rate": 3.824380165289256e-07, + "logits/chosen": -0.193359375, + "logits/rejected": -0.36328125, + "logps/chosen": -356.0, + "logps/rejected": -306.0, + "loss": 0.2431, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.81640625, + "rewards/margins": 5.65625, + "rewards/rejected": -4.84375, + "step": 594 + }, + { + "epoch": 0.7300613496932515, + "grad_norm": 40.766534902822876, + "learning_rate": 3.8223140495867767e-07, + "logits/chosen": -0.2041015625, + "logits/rejected": -0.3984375, + "logps/chosen": -444.0, + "logps/rejected": -340.0, + "loss": 0.2581, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.578125, + "rewards/margins": 6.15625, + "rewards/rejected": -4.59375, + "step": 595 + }, + { + "epoch": 0.7312883435582822, + "grad_norm": 39.26882224861265, + "learning_rate": 3.820247933884297e-07, + "logits/chosen": -0.1767578125, + "logits/rejected": -0.341796875, + "logps/chosen": -410.0, + "logps/rejected": -338.0, + "loss": 0.2749, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.203125, + "rewards/margins": 5.53125, + "rewards/rejected": -4.3125, + "step": 596 + }, + { + "epoch": 0.7325153374233129, + "grad_norm": 39.569676008461244, + "learning_rate": 3.818181818181818e-07, + "logits/chosen": -0.0849609375, + "logits/rejected": -0.26171875, + "logps/chosen": -378.0, + "logps/rejected": -282.0, + "loss": 0.2937, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.2265625, + "rewards/margins": 5.25, + "rewards/rejected": -4.03125, + "step": 597 + }, + { + "epoch": 0.7337423312883435, + "grad_norm": 32.53349158917794, + "learning_rate": 3.8161157024793387e-07, + "logits/chosen": -0.1806640625, + "logits/rejected": -0.369140625, + "logps/chosen": -438.0, + "logps/rejected": -310.0, + "loss": 0.2181, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 2.046875, + "rewards/margins": 6.3125, + "rewards/rejected": -4.28125, + "step": 598 + }, + { + "epoch": 0.7349693251533742, + "grad_norm": 37.462844674823714, + "learning_rate": 3.814049586776859e-07, + "logits/chosen": -0.30859375, + "logits/rejected": -0.45703125, + "logps/chosen": -448.0, + "logps/rejected": -354.0, + "loss": 0.2935, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.6328125, + "rewards/margins": 6.125, + "rewards/rejected": -4.5, + "step": 599 + }, + { + "epoch": 0.7361963190184049, + "grad_norm": 40.34755354050605, + "learning_rate": 3.8119834710743796e-07, + "logits/chosen": -0.3125, + "logits/rejected": -0.408203125, + "logps/chosen": -356.0, + "logps/rejected": -308.0, + "loss": 0.3262, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.2734375, + "rewards/margins": 5.875, + "rewards/rejected": -4.59375, + "step": 600 + }, + { + "epoch": 0.7374233128834355, + "grad_norm": 31.83131835226018, + "learning_rate": 3.8099173553719006e-07, + "logits/chosen": -0.2001953125, + "logits/rejected": -0.3828125, + "logps/chosen": -338.0, + "logps/rejected": -296.0, + "loss": 0.2587, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.5546875, + "rewards/margins": 5.46875, + "rewards/rejected": -4.90625, + "step": 601 + }, + { + "epoch": 0.7386503067484662, + "grad_norm": 27.556154921143015, + "learning_rate": 3.807851239669421e-07, + "logits/chosen": -0.0517578125, + "logits/rejected": -0.2158203125, + "logps/chosen": -398.0, + "logps/rejected": -322.0, + "loss": 0.1812, + "rewards/accuracies": 0.9296875, + "rewards/chosen": 1.4765625, + "rewards/margins": 6.4375, + "rewards/rejected": -4.96875, + "step": 602 + }, + { + "epoch": 0.7398773006134969, + "grad_norm": 33.37496659841441, + "learning_rate": 3.805785123966942e-07, + "logits/chosen": -0.205078125, + "logits/rejected": -0.34765625, + "logps/chosen": -376.0, + "logps/rejected": -308.0, + "loss": 0.2746, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.609375, + "rewards/margins": 6.34375, + "rewards/rejected": -4.71875, + "step": 603 + }, + { + "epoch": 0.7411042944785277, + "grad_norm": 33.47399818424688, + "learning_rate": 3.8037190082644626e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.4296875, + "logps/chosen": -410.0, + "logps/rejected": -344.0, + "loss": 0.2518, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.234375, + "rewards/margins": 6.1875, + "rewards/rejected": -4.96875, + "step": 604 + }, + { + "epoch": 0.7423312883435583, + "grad_norm": 31.794522300753904, + "learning_rate": 3.8016528925619836e-07, + "logits/chosen": -0.2041015625, + "logits/rejected": -0.396484375, + "logps/chosen": -372.0, + "logps/rejected": -318.0, + "loss": 0.2352, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.1640625, + "rewards/margins": 6.375, + "rewards/rejected": -5.21875, + "step": 605 + }, + { + "epoch": 0.743558282208589, + "grad_norm": 39.11777077485029, + "learning_rate": 3.799586776859504e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.41796875, + "logps/chosen": -382.0, + "logps/rejected": -322.0, + "loss": 0.2993, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.3671875, + "rewards/margins": 5.9375, + "rewards/rejected": -4.5625, + "step": 606 + }, + { + "epoch": 0.7447852760736197, + "grad_norm": 35.13403324428258, + "learning_rate": 3.797520661157025e-07, + "logits/chosen": -0.1591796875, + "logits/rejected": -0.37890625, + "logps/chosen": -394.0, + "logps/rejected": -356.0, + "loss": 0.2528, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 0.75, + "rewards/margins": 6.1875, + "rewards/rejected": -5.4375, + "step": 607 + }, + { + "epoch": 0.7460122699386503, + "grad_norm": 34.622853683902335, + "learning_rate": 3.795454545454545e-07, + "logits/chosen": -0.06396484375, + "logits/rejected": -0.302734375, + "logps/chosen": -394.0, + "logps/rejected": -334.0, + "loss": 0.2671, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 0.43359375, + "rewards/margins": 5.34375, + "rewards/rejected": -4.90625, + "step": 608 + }, + { + "epoch": 0.747239263803681, + "grad_norm": 33.44784961871993, + "learning_rate": 3.793388429752066e-07, + "logits/chosen": -0.1748046875, + "logits/rejected": -0.33984375, + "logps/chosen": -402.0, + "logps/rejected": -314.0, + "loss": 0.2401, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 0.78515625, + "rewards/margins": 6.25, + "rewards/rejected": -5.46875, + "step": 609 + }, + { + "epoch": 0.7484662576687117, + "grad_norm": 30.3709205845726, + "learning_rate": 3.7913223140495864e-07, + "logits/chosen": -0.2294921875, + "logits/rejected": -0.447265625, + "logps/chosen": -442.0, + "logps/rejected": -368.0, + "loss": 0.2211, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.3125, + "rewards/margins": 6.875, + "rewards/rejected": -5.5625, + "step": 610 + }, + { + "epoch": 0.7496932515337423, + "grad_norm": 47.71192907247348, + "learning_rate": 3.7892561983471074e-07, + "logits/chosen": -0.2001953125, + "logits/rejected": -0.3671875, + "logps/chosen": -430.0, + "logps/rejected": -354.0, + "loss": 0.331, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.14453125, + "rewards/margins": 5.34375, + "rewards/rejected": -5.1875, + "step": 611 + }, + { + "epoch": 0.750920245398773, + "grad_norm": 40.03785494441384, + "learning_rate": 3.787190082644628e-07, + "logits/chosen": -0.2041015625, + "logits/rejected": -0.34765625, + "logps/chosen": -390.0, + "logps/rejected": -352.0, + "loss": 0.327, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.6875, + "rewards/margins": 5.4375, + "rewards/rejected": -4.75, + "step": 612 + }, + { + "epoch": 0.7521472392638037, + "grad_norm": 39.68756652628583, + "learning_rate": 3.7851239669421484e-07, + "logits/chosen": -0.19140625, + "logits/rejected": -0.265625, + "logps/chosen": -374.0, + "logps/rejected": -320.0, + "loss": 0.3199, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.369140625, + "rewards/margins": 5.53125, + "rewards/rejected": -5.15625, + "step": 613 + }, + { + "epoch": 0.7533742331288343, + "grad_norm": 41.644849602297185, + "learning_rate": 3.7830578512396694e-07, + "logits/chosen": -0.2451171875, + "logits/rejected": -0.384765625, + "logps/chosen": -418.0, + "logps/rejected": -338.0, + "loss": 0.2887, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.80859375, + "rewards/margins": 5.875, + "rewards/rejected": -5.0625, + "step": 614 + }, + { + "epoch": 0.754601226993865, + "grad_norm": 37.7145942345175, + "learning_rate": 3.78099173553719e-07, + "logits/chosen": -0.228515625, + "logits/rejected": -0.33984375, + "logps/chosen": -366.0, + "logps/rejected": -340.0, + "loss": 0.2656, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.0078125, + "rewards/margins": 6.25, + "rewards/rejected": -5.21875, + "step": 615 + }, + { + "epoch": 0.7558282208588957, + "grad_norm": 33.41765706894794, + "learning_rate": 3.778925619834711e-07, + "logits/chosen": -0.1865234375, + "logits/rejected": -0.333984375, + "logps/chosen": -322.0, + "logps/rejected": -286.0, + "loss": 0.2479, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.26953125, + "rewards/margins": 5.03125, + "rewards/rejected": -4.78125, + "step": 616 + }, + { + "epoch": 0.7570552147239263, + "grad_norm": 40.974699543395324, + "learning_rate": 3.776859504132231e-07, + "logits/chosen": -0.173828125, + "logits/rejected": -0.26171875, + "logps/chosen": -368.0, + "logps/rejected": -310.0, + "loss": 0.3367, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 0.609375, + "rewards/margins": 5.1875, + "rewards/rejected": -4.59375, + "step": 617 + }, + { + "epoch": 0.758282208588957, + "grad_norm": 46.934415155128356, + "learning_rate": 3.774793388429752e-07, + "logits/chosen": -0.099609375, + "logits/rejected": -0.275390625, + "logps/chosen": -414.0, + "logps/rejected": -308.0, + "loss": 0.3508, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.74609375, + "rewards/margins": 4.9375, + "rewards/rejected": -4.1875, + "step": 618 + }, + { + "epoch": 0.7595092024539877, + "grad_norm": 35.432918707651034, + "learning_rate": 3.7727272727272723e-07, + "logits/chosen": -0.12890625, + "logits/rejected": -0.330078125, + "logps/chosen": -426.0, + "logps/rejected": -328.0, + "loss": 0.2261, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.140625, + "rewards/margins": 6.25, + "rewards/rejected": -5.125, + "step": 619 + }, + { + "epoch": 0.7607361963190185, + "grad_norm": 44.522688117502966, + "learning_rate": 3.7706611570247933e-07, + "logits/chosen": -0.1318359375, + "logits/rejected": -0.33984375, + "logps/chosen": -404.0, + "logps/rejected": -324.0, + "loss": 0.2954, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.625, + "rewards/margins": 5.125, + "rewards/rejected": -4.5, + "step": 620 + }, + { + "epoch": 0.7619631901840491, + "grad_norm": 35.21620215877052, + "learning_rate": 3.768595041322314e-07, + "logits/chosen": -0.2412109375, + "logits/rejected": -0.412109375, + "logps/chosen": -478.0, + "logps/rejected": -360.0, + "loss": 0.2617, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.1015625, + "rewards/margins": 6.46875, + "rewards/rejected": -5.375, + "step": 621 + }, + { + "epoch": 0.7631901840490798, + "grad_norm": 32.97202434149592, + "learning_rate": 3.766528925619835e-07, + "logits/chosen": -0.13671875, + "logits/rejected": -0.310546875, + "logps/chosen": -378.0, + "logps/rejected": -334.0, + "loss": 0.2271, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 0.73828125, + "rewards/margins": 5.9375, + "rewards/rejected": -5.1875, + "step": 622 + }, + { + "epoch": 0.7644171779141105, + "grad_norm": 40.73770796587866, + "learning_rate": 3.764462809917355e-07, + "logits/chosen": -0.1669921875, + "logits/rejected": -0.34765625, + "logps/chosen": -452.0, + "logps/rejected": -370.0, + "loss": 0.3008, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.3515625, + "rewards/margins": 6.21875, + "rewards/rejected": -4.875, + "step": 623 + }, + { + "epoch": 0.7656441717791411, + "grad_norm": 33.6312460876679, + "learning_rate": 3.762396694214876e-07, + "logits/chosen": -0.228515625, + "logits/rejected": -0.3984375, + "logps/chosen": -378.0, + "logps/rejected": -316.0, + "loss": 0.218, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.1328125, + "rewards/margins": 6.78125, + "rewards/rejected": -5.65625, + "step": 624 + }, + { + "epoch": 0.7668711656441718, + "grad_norm": 35.01728220554292, + "learning_rate": 3.7603305785123967e-07, + "logits/chosen": -0.2001953125, + "logits/rejected": -0.34765625, + "logps/chosen": -404.0, + "logps/rejected": -316.0, + "loss": 0.2202, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.015625, + "rewards/margins": 5.6875, + "rewards/rejected": -4.65625, + "step": 625 + }, + { + "epoch": 0.7680981595092025, + "grad_norm": 43.4178761562483, + "learning_rate": 3.758264462809917e-07, + "logits/chosen": -0.314453125, + "logits/rejected": -0.46875, + "logps/chosen": -414.0, + "logps/rejected": -344.0, + "loss": 0.3158, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.3515625, + "rewards/margins": 5.78125, + "rewards/rejected": -4.4375, + "step": 626 + }, + { + "epoch": 0.7693251533742331, + "grad_norm": 35.14066305401538, + "learning_rate": 3.7561983471074376e-07, + "logits/chosen": -0.1162109375, + "logits/rejected": -0.21484375, + "logps/chosen": -308.0, + "logps/rejected": -320.0, + "loss": 0.3225, + "rewards/accuracies": 0.8671875, + "rewards/chosen": -0.06884765625, + "rewards/margins": 4.53125, + "rewards/rejected": -4.59375, + "step": 627 + }, + { + "epoch": 0.7705521472392638, + "grad_norm": 43.80833337888977, + "learning_rate": 3.7541322314049586e-07, + "logits/chosen": -0.15234375, + "logits/rejected": -0.294921875, + "logps/chosen": -378.0, + "logps/rejected": -290.0, + "loss": 0.3054, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.90234375, + "rewards/margins": 5.15625, + "rewards/rejected": -4.25, + "step": 628 + }, + { + "epoch": 0.7717791411042945, + "grad_norm": 24.76129586575429, + "learning_rate": 3.752066115702479e-07, + "logits/chosen": -0.171875, + "logits/rejected": -0.296875, + "logps/chosen": -348.0, + "logps/rejected": -276.0, + "loss": 0.1831, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.74609375, + "rewards/margins": 5.34375, + "rewards/rejected": -4.59375, + "step": 629 + }, + { + "epoch": 0.7730061349693251, + "grad_norm": 34.904501482497786, + "learning_rate": 3.75e-07, + "logits/chosen": -0.11328125, + "logits/rejected": -0.357421875, + "logps/chosen": -370.0, + "logps/rejected": -358.0, + "loss": 0.2492, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.640625, + "rewards/margins": 6.03125, + "rewards/rejected": -4.40625, + "step": 630 + }, + { + "epoch": 0.7742331288343558, + "grad_norm": 37.86286725268997, + "learning_rate": 3.7479338842975206e-07, + "logits/chosen": -0.298828125, + "logits/rejected": -0.404296875, + "logps/chosen": -390.0, + "logps/rejected": -312.0, + "loss": 0.3021, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.390625, + "rewards/margins": 5.5625, + "rewards/rejected": -4.1875, + "step": 631 + }, + { + "epoch": 0.7754601226993865, + "grad_norm": 39.56376346395484, + "learning_rate": 3.745867768595041e-07, + "logits/chosen": -0.22265625, + "logits/rejected": -0.36328125, + "logps/chosen": -402.0, + "logps/rejected": -330.0, + "loss": 0.2667, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.5234375, + "rewards/margins": 5.1875, + "rewards/rejected": -3.671875, + "step": 632 + }, + { + "epoch": 0.7766871165644171, + "grad_norm": 43.15920072260989, + "learning_rate": 3.743801652892562e-07, + "logits/chosen": -0.1484375, + "logits/rejected": -0.27734375, + "logps/chosen": -338.0, + "logps/rejected": -324.0, + "loss": 0.317, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.7734375, + "rewards/margins": 4.71875, + "rewards/rejected": -3.96875, + "step": 633 + }, + { + "epoch": 0.7779141104294478, + "grad_norm": 34.76469344160583, + "learning_rate": 3.7417355371900825e-07, + "logits/chosen": -0.2333984375, + "logits/rejected": -0.443359375, + "logps/chosen": -418.0, + "logps/rejected": -316.0, + "loss": 0.2151, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 2.4375, + "rewards/margins": 6.90625, + "rewards/rejected": -4.46875, + "step": 634 + }, + { + "epoch": 0.7791411042944786, + "grad_norm": 32.416601067780334, + "learning_rate": 3.739669421487603e-07, + "logits/chosen": -0.2421875, + "logits/rejected": -0.3125, + "logps/chosen": -358.0, + "logps/rejected": -288.0, + "loss": 0.217, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 0.9140625, + "rewards/margins": 4.96875, + "rewards/rejected": -4.03125, + "step": 635 + }, + { + "epoch": 0.7803680981595092, + "grad_norm": 38.28241269033868, + "learning_rate": 3.7376033057851234e-07, + "logits/chosen": -0.234375, + "logits/rejected": -0.36328125, + "logps/chosen": -414.0, + "logps/rejected": -358.0, + "loss": 0.2749, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.6328125, + "rewards/margins": 5.8125, + "rewards/rejected": -4.15625, + "step": 636 + }, + { + "epoch": 0.7815950920245399, + "grad_norm": 47.424162576758796, + "learning_rate": 3.7355371900826445e-07, + "logits/chosen": -0.0859375, + "logits/rejected": -0.267578125, + "logps/chosen": -378.0, + "logps/rejected": -292.0, + "loss": 0.2932, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.890625, + "rewards/margins": 5.09375, + "rewards/rejected": -4.1875, + "step": 637 + }, + { + "epoch": 0.7828220858895706, + "grad_norm": 33.14638387389286, + "learning_rate": 3.733471074380165e-07, + "logits/chosen": -0.2177734375, + "logits/rejected": -0.412109375, + "logps/chosen": -402.0, + "logps/rejected": -326.0, + "loss": 0.225, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.5234375, + "rewards/margins": 5.65625, + "rewards/rejected": -4.125, + "step": 638 + }, + { + "epoch": 0.7840490797546013, + "grad_norm": 40.33146789211734, + "learning_rate": 3.731404958677686e-07, + "logits/chosen": -0.1015625, + "logits/rejected": -0.283203125, + "logps/chosen": -404.0, + "logps/rejected": -326.0, + "loss": 0.3027, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.4375, + "rewards/margins": 5.1875, + "rewards/rejected": -3.75, + "step": 639 + }, + { + "epoch": 0.7852760736196319, + "grad_norm": 40.99608723585622, + "learning_rate": 3.7293388429752064e-07, + "logits/chosen": -0.24609375, + "logits/rejected": -0.388671875, + "logps/chosen": -444.0, + "logps/rejected": -376.0, + "loss": 0.2653, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.890625, + "rewards/margins": 6.03125, + "rewards/rejected": -4.125, + "step": 640 + }, + { + "epoch": 0.7865030674846626, + "grad_norm": 46.58650892643996, + "learning_rate": 3.7272727272727274e-07, + "logits/chosen": -0.27734375, + "logits/rejected": -0.419921875, + "logps/chosen": -392.0, + "logps/rejected": -342.0, + "loss": 0.3815, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.5703125, + "rewards/margins": 5.09375, + "rewards/rejected": -3.515625, + "step": 641 + }, + { + "epoch": 0.7877300613496933, + "grad_norm": 28.471925622053803, + "learning_rate": 3.725206611570248e-07, + "logits/chosen": -0.185546875, + "logits/rejected": -0.39453125, + "logps/chosen": -348.0, + "logps/rejected": -284.0, + "loss": 0.2363, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.3515625, + "rewards/margins": 5.25, + "rewards/rejected": -3.890625, + "step": 642 + }, + { + "epoch": 0.7889570552147239, + "grad_norm": 40.149407361877095, + "learning_rate": 3.723140495867769e-07, + "logits/chosen": -0.30859375, + "logits/rejected": -0.484375, + "logps/chosen": -400.0, + "logps/rejected": -364.0, + "loss": 0.2571, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.5234375, + "rewards/margins": 5.4375, + "rewards/rejected": -3.90625, + "step": 643 + }, + { + "epoch": 0.7901840490797546, + "grad_norm": 43.580660836250416, + "learning_rate": 3.721074380165289e-07, + "logits/chosen": -0.2314453125, + "logits/rejected": -0.384765625, + "logps/chosen": -386.0, + "logps/rejected": -316.0, + "loss": 0.2481, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.5390625, + "rewards/margins": 5.90625, + "rewards/rejected": -4.34375, + "step": 644 + }, + { + "epoch": 0.7914110429447853, + "grad_norm": 36.964537896873544, + "learning_rate": 3.71900826446281e-07, + "logits/chosen": -0.1728515625, + "logits/rejected": -0.380859375, + "logps/chosen": -330.0, + "logps/rejected": -322.0, + "loss": 0.2416, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.6484375, + "rewards/margins": 5.78125, + "rewards/rejected": -4.15625, + "step": 645 + }, + { + "epoch": 0.7926380368098159, + "grad_norm": 36.18484120423215, + "learning_rate": 3.7169421487603303e-07, + "logits/chosen": -0.130859375, + "logits/rejected": -0.3046875, + "logps/chosen": -378.0, + "logps/rejected": -314.0, + "loss": 0.285, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.4921875, + "rewards/margins": 5.5, + "rewards/rejected": -4.0, + "step": 646 + }, + { + "epoch": 0.7938650306748466, + "grad_norm": 32.85091829554944, + "learning_rate": 3.7148760330578513e-07, + "logits/chosen": -0.1826171875, + "logits/rejected": -0.333984375, + "logps/chosen": -376.0, + "logps/rejected": -308.0, + "loss": 0.2558, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.9609375, + "rewards/margins": 6.125, + "rewards/rejected": -4.1875, + "step": 647 + }, + { + "epoch": 0.7950920245398773, + "grad_norm": 42.502304621111726, + "learning_rate": 3.712809917355372e-07, + "logits/chosen": -0.236328125, + "logits/rejected": -0.25, + "logps/chosen": -324.0, + "logps/rejected": -312.0, + "loss": 0.3343, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.90625, + "rewards/margins": 4.875, + "rewards/rejected": -3.96875, + "step": 648 + }, + { + "epoch": 0.7963190184049079, + "grad_norm": 41.7626560131211, + "learning_rate": 3.710743801652892e-07, + "logits/chosen": -0.1064453125, + "logits/rejected": -0.2109375, + "logps/chosen": -360.0, + "logps/rejected": -318.0, + "loss": 0.4139, + "rewards/accuracies": 0.796875, + "rewards/chosen": 1.15625, + "rewards/margins": 4.59375, + "rewards/rejected": -3.4375, + "step": 649 + }, + { + "epoch": 0.7975460122699386, + "grad_norm": 40.035923383900304, + "learning_rate": 3.708677685950413e-07, + "logits/chosen": -0.12255859375, + "logits/rejected": -0.296875, + "logps/chosen": -422.0, + "logps/rejected": -340.0, + "loss": 0.328, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.8125, + "rewards/margins": 5.1875, + "rewards/rejected": -3.375, + "step": 650 + }, + { + "epoch": 0.7987730061349694, + "grad_norm": 41.02033222140374, + "learning_rate": 3.7066115702479337e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.337890625, + "logps/chosen": -368.0, + "logps/rejected": -338.0, + "loss": 0.2567, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.78125, + "rewards/margins": 6.3125, + "rewards/rejected": -4.53125, + "step": 651 + }, + { + "epoch": 0.8, + "grad_norm": 43.99996770243787, + "learning_rate": 3.7045454545454547e-07, + "logits/chosen": -0.1943359375, + "logits/rejected": -0.333984375, + "logps/chosen": -364.0, + "logps/rejected": -332.0, + "loss": 0.304, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.796875, + "rewards/margins": 4.96875, + "rewards/rejected": -4.15625, + "step": 652 + }, + { + "epoch": 0.8012269938650307, + "grad_norm": 42.280947809979125, + "learning_rate": 3.7024793388429746e-07, + "logits/chosen": -0.142578125, + "logits/rejected": -0.322265625, + "logps/chosen": -346.0, + "logps/rejected": -316.0, + "loss": 0.2642, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.2890625, + "rewards/margins": 5.875, + "rewards/rejected": -4.59375, + "step": 653 + }, + { + "epoch": 0.8024539877300614, + "grad_norm": 33.69377308507155, + "learning_rate": 3.7004132231404956e-07, + "logits/chosen": -0.12255859375, + "logits/rejected": -0.330078125, + "logps/chosen": -388.0, + "logps/rejected": -302.0, + "loss": 0.2251, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.5546875, + "rewards/margins": 5.75, + "rewards/rejected": -4.1875, + "step": 654 + }, + { + "epoch": 0.803680981595092, + "grad_norm": 37.83873855183703, + "learning_rate": 3.698347107438016e-07, + "logits/chosen": -0.1806640625, + "logits/rejected": -0.35546875, + "logps/chosen": -380.0, + "logps/rejected": -332.0, + "loss": 0.2549, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.375, + "rewards/margins": 5.40625, + "rewards/rejected": -4.03125, + "step": 655 + }, + { + "epoch": 0.8049079754601227, + "grad_norm": 39.726835256559795, + "learning_rate": 3.696280991735537e-07, + "logits/chosen": -0.1171875, + "logits/rejected": -0.27734375, + "logps/chosen": -364.0, + "logps/rejected": -308.0, + "loss": 0.3072, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.15625, + "rewards/margins": 5.1875, + "rewards/rejected": -4.03125, + "step": 656 + }, + { + "epoch": 0.8061349693251534, + "grad_norm": 32.94464991591826, + "learning_rate": 3.6942148760330576e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.416015625, + "logps/chosen": -354.0, + "logps/rejected": -318.0, + "loss": 0.2901, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.421875, + "rewards/margins": 5.375, + "rewards/rejected": -3.953125, + "step": 657 + }, + { + "epoch": 0.807361963190184, + "grad_norm": 35.33216238810386, + "learning_rate": 3.6921487603305786e-07, + "logits/chosen": -0.265625, + "logits/rejected": -0.408203125, + "logps/chosen": -386.0, + "logps/rejected": -330.0, + "loss": 0.265, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.34375, + "rewards/margins": 5.4375, + "rewards/rejected": -4.09375, + "step": 658 + }, + { + "epoch": 0.8085889570552147, + "grad_norm": 35.903067216165454, + "learning_rate": 3.690082644628099e-07, + "logits/chosen": -0.2060546875, + "logits/rejected": -0.365234375, + "logps/chosen": -358.0, + "logps/rejected": -316.0, + "loss": 0.2874, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.65625, + "rewards/margins": 5.0, + "rewards/rejected": -4.34375, + "step": 659 + }, + { + "epoch": 0.8098159509202454, + "grad_norm": 33.43274680085514, + "learning_rate": 3.68801652892562e-07, + "logits/chosen": -0.216796875, + "logits/rejected": -0.412109375, + "logps/chosen": -396.0, + "logps/rejected": -338.0, + "loss": 0.2533, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.7890625, + "rewards/margins": 5.9375, + "rewards/rejected": -4.15625, + "step": 660 + }, + { + "epoch": 0.811042944785276, + "grad_norm": 42.73024720052954, + "learning_rate": 3.6859504132231405e-07, + "logits/chosen": -0.158203125, + "logits/rejected": -0.267578125, + "logps/chosen": -356.0, + "logps/rejected": -284.0, + "loss": 0.3128, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.6640625, + "rewards/margins": 4.875, + "rewards/rejected": -4.21875, + "step": 661 + }, + { + "epoch": 0.8122699386503067, + "grad_norm": 29.594222057082835, + "learning_rate": 3.683884297520661e-07, + "logits/chosen": -0.16796875, + "logits/rejected": -0.306640625, + "logps/chosen": -360.0, + "logps/rejected": -308.0, + "loss": 0.211, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.5859375, + "rewards/margins": 6.03125, + "rewards/rejected": -4.4375, + "step": 662 + }, + { + "epoch": 0.8134969325153374, + "grad_norm": 30.816389985498457, + "learning_rate": 3.6818181818181815e-07, + "logits/chosen": -0.11669921875, + "logits/rejected": -0.3125, + "logps/chosen": -352.0, + "logps/rejected": -310.0, + "loss": 0.2494, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.6015625, + "rewards/margins": 5.625, + "rewards/rejected": -4.0, + "step": 663 + }, + { + "epoch": 0.8147239263803681, + "grad_norm": 27.861290032166615, + "learning_rate": 3.6797520661157025e-07, + "logits/chosen": -0.373046875, + "logits/rejected": -0.51953125, + "logps/chosen": -380.0, + "logps/rejected": -346.0, + "loss": 0.1714, + "rewards/accuracies": 0.9140625, + "rewards/chosen": 1.5390625, + "rewards/margins": 6.8125, + "rewards/rejected": -5.28125, + "step": 664 + }, + { + "epoch": 0.8159509202453987, + "grad_norm": 43.48547648980068, + "learning_rate": 3.677685950413223e-07, + "logits/chosen": -0.10009765625, + "logits/rejected": -0.267578125, + "logps/chosen": -332.0, + "logps/rejected": -280.0, + "loss": 0.2535, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.765625, + "rewards/margins": 5.34375, + "rewards/rejected": -4.59375, + "step": 665 + }, + { + "epoch": 0.8171779141104294, + "grad_norm": 41.230514254119846, + "learning_rate": 3.6756198347107434e-07, + "logits/chosen": -0.130859375, + "logits/rejected": -0.3203125, + "logps/chosen": -414.0, + "logps/rejected": -340.0, + "loss": 0.3107, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.4375, + "rewards/margins": 5.75, + "rewards/rejected": -4.3125, + "step": 666 + }, + { + "epoch": 0.8184049079754602, + "grad_norm": 38.330931790926165, + "learning_rate": 3.6735537190082644e-07, + "logits/chosen": -0.19921875, + "logits/rejected": -0.396484375, + "logps/chosen": -372.0, + "logps/rejected": -324.0, + "loss": 0.2562, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.21875, + "rewards/margins": 6.0, + "rewards/rejected": -4.78125, + "step": 667 + }, + { + "epoch": 0.8196319018404908, + "grad_norm": 36.01171777931778, + "learning_rate": 3.671487603305785e-07, + "logits/chosen": -0.19921875, + "logits/rejected": -0.33984375, + "logps/chosen": -386.0, + "logps/rejected": -340.0, + "loss": 0.2577, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.2734375, + "rewards/margins": 5.84375, + "rewards/rejected": -4.5625, + "step": 668 + }, + { + "epoch": 0.8208588957055215, + "grad_norm": 37.805581553660694, + "learning_rate": 3.669421487603306e-07, + "logits/chosen": -0.25390625, + "logits/rejected": -0.41796875, + "logps/chosen": -338.0, + "logps/rejected": -322.0, + "loss": 0.257, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 0.9375, + "rewards/margins": 5.5625, + "rewards/rejected": -4.625, + "step": 669 + }, + { + "epoch": 0.8220858895705522, + "grad_norm": 34.18026783004868, + "learning_rate": 3.6673553719008263e-07, + "logits/chosen": -0.0791015625, + "logits/rejected": -0.22265625, + "logps/chosen": -324.0, + "logps/rejected": -290.0, + "loss": 0.2365, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 0.9296875, + "rewards/margins": 5.46875, + "rewards/rejected": -4.53125, + "step": 670 + }, + { + "epoch": 0.8233128834355828, + "grad_norm": 31.80438827189515, + "learning_rate": 3.665289256198347e-07, + "logits/chosen": -0.1787109375, + "logits/rejected": -0.34375, + "logps/chosen": -374.0, + "logps/rejected": -320.0, + "loss": 0.242, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.609375, + "rewards/margins": 6.09375, + "rewards/rejected": -4.46875, + "step": 671 + }, + { + "epoch": 0.8245398773006135, + "grad_norm": 34.31886268675687, + "learning_rate": 3.6632231404958673e-07, + "logits/chosen": -0.1591796875, + "logits/rejected": -0.419921875, + "logps/chosen": -448.0, + "logps/rejected": -320.0, + "loss": 0.2443, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.875, + "rewards/margins": 6.53125, + "rewards/rejected": -4.65625, + "step": 672 + }, + { + "epoch": 0.8257668711656442, + "grad_norm": 35.357570263918994, + "learning_rate": 3.6611570247933883e-07, + "logits/chosen": -0.11083984375, + "logits/rejected": -0.3359375, + "logps/chosen": -390.0, + "logps/rejected": -318.0, + "loss": 0.2364, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.1484375, + "rewards/margins": 5.25, + "rewards/rejected": -4.09375, + "step": 673 + }, + { + "epoch": 0.8269938650306748, + "grad_norm": 33.53684126770598, + "learning_rate": 3.659090909090909e-07, + "logits/chosen": -0.0654296875, + "logits/rejected": -0.2333984375, + "logps/chosen": -356.0, + "logps/rejected": -320.0, + "loss": 0.2467, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.2734375, + "rewards/margins": 5.84375, + "rewards/rejected": -4.5625, + "step": 674 + }, + { + "epoch": 0.8282208588957055, + "grad_norm": 34.52915039204892, + "learning_rate": 3.65702479338843e-07, + "logits/chosen": -0.1376953125, + "logits/rejected": -0.3515625, + "logps/chosen": -426.0, + "logps/rejected": -356.0, + "loss": 0.2621, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.453125, + "rewards/margins": 6.15625, + "rewards/rejected": -4.71875, + "step": 675 + }, + { + "epoch": 0.8294478527607362, + "grad_norm": 39.20023525071254, + "learning_rate": 3.65495867768595e-07, + "logits/chosen": -0.2216796875, + "logits/rejected": -0.333984375, + "logps/chosen": -392.0, + "logps/rejected": -338.0, + "loss": 0.2552, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.640625, + "rewards/margins": 5.6875, + "rewards/rejected": -5.03125, + "step": 676 + }, + { + "epoch": 0.8306748466257668, + "grad_norm": 40.9061677699551, + "learning_rate": 3.652892561983471e-07, + "logits/chosen": -0.1181640625, + "logits/rejected": -0.291015625, + "logps/chosen": -336.0, + "logps/rejected": -298.0, + "loss": 0.2803, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.4609375, + "rewards/margins": 5.59375, + "rewards/rejected": -5.125, + "step": 677 + }, + { + "epoch": 0.8319018404907975, + "grad_norm": 35.838195895535726, + "learning_rate": 3.6508264462809917e-07, + "logits/chosen": -0.15625, + "logits/rejected": -0.361328125, + "logps/chosen": -418.0, + "logps/rejected": -342.0, + "loss": 0.2691, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.88671875, + "rewards/margins": 5.53125, + "rewards/rejected": -4.65625, + "step": 678 + }, + { + "epoch": 0.8331288343558282, + "grad_norm": 39.33502920792321, + "learning_rate": 3.648760330578512e-07, + "logits/chosen": -0.07080078125, + "logits/rejected": -0.1845703125, + "logps/chosen": -338.0, + "logps/rejected": -310.0, + "loss": 0.284, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.94140625, + "rewards/margins": 5.25, + "rewards/rejected": -4.3125, + "step": 679 + }, + { + "epoch": 0.8343558282208589, + "grad_norm": 35.15449592029737, + "learning_rate": 3.6466942148760326e-07, + "logits/chosen": -0.1923828125, + "logits/rejected": -0.369140625, + "logps/chosen": -454.0, + "logps/rejected": -356.0, + "loss": 0.2298, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.34375, + "rewards/margins": 6.375, + "rewards/rejected": -5.03125, + "step": 680 + }, + { + "epoch": 0.8355828220858895, + "grad_norm": 31.78034807618272, + "learning_rate": 3.6446280991735536e-07, + "logits/chosen": -0.21484375, + "logits/rejected": -0.37890625, + "logps/chosen": -346.0, + "logps/rejected": -316.0, + "loss": 0.1963, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 0.8984375, + "rewards/margins": 6.4375, + "rewards/rejected": -5.5625, + "step": 681 + }, + { + "epoch": 0.8368098159509203, + "grad_norm": 39.09021083370229, + "learning_rate": 3.642561983471074e-07, + "logits/chosen": -0.21875, + "logits/rejected": -0.341796875, + "logps/chosen": -350.0, + "logps/rejected": -316.0, + "loss": 0.301, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.74609375, + "rewards/margins": 5.78125, + "rewards/rejected": -5.03125, + "step": 682 + }, + { + "epoch": 0.838036809815951, + "grad_norm": 36.30997939377773, + "learning_rate": 3.640495867768595e-07, + "logits/chosen": -0.2294921875, + "logits/rejected": -0.349609375, + "logps/chosen": -370.0, + "logps/rejected": -308.0, + "loss": 0.2667, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.15625, + "rewards/margins": 6.28125, + "rewards/rejected": -5.125, + "step": 683 + }, + { + "epoch": 0.8392638036809816, + "grad_norm": 43.34454211125793, + "learning_rate": 3.6384297520661156e-07, + "logits/chosen": -0.06298828125, + "logits/rejected": -0.18359375, + "logps/chosen": -314.0, + "logps/rejected": -330.0, + "loss": 0.3642, + "rewards/accuracies": 0.8359375, + "rewards/chosen": -0.0263671875, + "rewards/margins": 4.6875, + "rewards/rejected": -4.71875, + "step": 684 + }, + { + "epoch": 0.8404907975460123, + "grad_norm": 34.04376739318291, + "learning_rate": 3.636363636363636e-07, + "logits/chosen": -0.1669921875, + "logits/rejected": -0.34375, + "logps/chosen": -396.0, + "logps/rejected": -356.0, + "loss": 0.2432, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.0546875, + "rewards/margins": 6.90625, + "rewards/rejected": -5.84375, + "step": 685 + }, + { + "epoch": 0.841717791411043, + "grad_norm": 32.60171699566285, + "learning_rate": 3.634297520661157e-07, + "logits/chosen": -0.1787109375, + "logits/rejected": -0.31640625, + "logps/chosen": -392.0, + "logps/rejected": -320.0, + "loss": 0.2556, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.0390625, + "rewards/margins": 6.0, + "rewards/rejected": -4.9375, + "step": 686 + }, + { + "epoch": 0.8429447852760736, + "grad_norm": 36.65354869863078, + "learning_rate": 3.6322314049586775e-07, + "logits/chosen": -0.16015625, + "logits/rejected": -0.306640625, + "logps/chosen": -374.0, + "logps/rejected": -338.0, + "loss": 0.2628, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.2109375, + "rewards/margins": 6.0625, + "rewards/rejected": -4.84375, + "step": 687 + }, + { + "epoch": 0.8441717791411043, + "grad_norm": 41.14195765537747, + "learning_rate": 3.630165289256198e-07, + "logits/chosen": -0.20703125, + "logits/rejected": -0.369140625, + "logps/chosen": -376.0, + "logps/rejected": -300.0, + "loss": 0.2638, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.177734375, + "rewards/margins": 5.53125, + "rewards/rejected": -5.34375, + "step": 688 + }, + { + "epoch": 0.845398773006135, + "grad_norm": 38.51353105415181, + "learning_rate": 3.6280991735537185e-07, + "logits/chosen": -0.162109375, + "logits/rejected": -0.265625, + "logps/chosen": -372.0, + "logps/rejected": -320.0, + "loss": 0.2884, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.2890625, + "rewards/margins": 6.0, + "rewards/rejected": -4.71875, + "step": 689 + }, + { + "epoch": 0.8466257668711656, + "grad_norm": 50.698015097303056, + "learning_rate": 3.6260330578512395e-07, + "logits/chosen": -0.044677734375, + "logits/rejected": -0.244140625, + "logps/chosen": -402.0, + "logps/rejected": -344.0, + "loss": 0.3436, + "rewards/accuracies": 0.796875, + "rewards/chosen": 1.5234375, + "rewards/margins": 6.1875, + "rewards/rejected": -4.65625, + "step": 690 + }, + { + "epoch": 0.8478527607361963, + "grad_norm": 30.814234506471102, + "learning_rate": 3.62396694214876e-07, + "logits/chosen": -0.3359375, + "logits/rejected": -0.458984375, + "logps/chosen": -356.0, + "logps/rejected": -340.0, + "loss": 0.2217, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.2421875, + "rewards/margins": 6.375, + "rewards/rejected": -5.125, + "step": 691 + }, + { + "epoch": 0.849079754601227, + "grad_norm": 43.15048361460468, + "learning_rate": 3.621900826446281e-07, + "logits/chosen": -0.1767578125, + "logits/rejected": -0.337890625, + "logps/chosen": -408.0, + "logps/rejected": -330.0, + "loss": 0.2766, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.640625, + "rewards/margins": 6.46875, + "rewards/rejected": -4.84375, + "step": 692 + }, + { + "epoch": 0.8503067484662576, + "grad_norm": 35.3095511118675, + "learning_rate": 3.6198347107438014e-07, + "logits/chosen": -0.189453125, + "logits/rejected": -0.392578125, + "logps/chosen": -442.0, + "logps/rejected": -360.0, + "loss": 0.2852, + "rewards/accuracies": 0.875, + "rewards/chosen": 2.0625, + "rewards/margins": 7.25, + "rewards/rejected": -5.1875, + "step": 693 + }, + { + "epoch": 0.8515337423312883, + "grad_norm": 50.92757487577681, + "learning_rate": 3.6177685950413224e-07, + "logits/chosen": -0.18359375, + "logits/rejected": -0.361328125, + "logps/chosen": -370.0, + "logps/rejected": -326.0, + "loss": 0.3663, + "rewards/accuracies": 0.796875, + "rewards/chosen": 0.73828125, + "rewards/margins": 4.96875, + "rewards/rejected": -4.21875, + "step": 694 + }, + { + "epoch": 0.852760736196319, + "grad_norm": 50.927014909943495, + "learning_rate": 3.615702479338843e-07, + "logits/chosen": -0.1689453125, + "logits/rejected": -0.26953125, + "logps/chosen": -328.0, + "logps/rejected": -302.0, + "loss": 0.4583, + "rewards/accuracies": 0.734375, + "rewards/chosen": 0.5625, + "rewards/margins": 4.34375, + "rewards/rejected": -3.765625, + "step": 695 + }, + { + "epoch": 0.8539877300613496, + "grad_norm": 39.49040375200759, + "learning_rate": 3.613636363636364e-07, + "logits/chosen": -0.130859375, + "logits/rejected": -0.306640625, + "logps/chosen": -382.0, + "logps/rejected": -314.0, + "loss": 0.2881, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.2734375, + "rewards/margins": 5.6875, + "rewards/rejected": -4.40625, + "step": 696 + }, + { + "epoch": 0.8552147239263803, + "grad_norm": 45.57900690356607, + "learning_rate": 3.611570247933884e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.328125, + "logps/chosen": -388.0, + "logps/rejected": -358.0, + "loss": 0.2838, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.8671875, + "rewards/margins": 6.46875, + "rewards/rejected": -4.59375, + "step": 697 + }, + { + "epoch": 0.8564417177914111, + "grad_norm": 38.81941112945181, + "learning_rate": 3.609504132231405e-07, + "logits/chosen": -0.1328125, + "logits/rejected": -0.279296875, + "logps/chosen": -394.0, + "logps/rejected": -344.0, + "loss": 0.2619, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.40625, + "rewards/margins": 6.125, + "rewards/rejected": -4.71875, + "step": 698 + }, + { + "epoch": 0.8576687116564418, + "grad_norm": 42.966064611435726, + "learning_rate": 3.6074380165289253e-07, + "logits/chosen": -0.2021484375, + "logits/rejected": -0.30078125, + "logps/chosen": -338.0, + "logps/rejected": -320.0, + "loss": 0.3034, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.5859375, + "rewards/margins": 5.25, + "rewards/rejected": -4.6875, + "step": 699 + }, + { + "epoch": 0.8588957055214724, + "grad_norm": 42.65113203498414, + "learning_rate": 3.6053719008264463e-07, + "logits/chosen": -0.11767578125, + "logits/rejected": -0.2353515625, + "logps/chosen": -370.0, + "logps/rejected": -320.0, + "loss": 0.3109, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.1015625, + "rewards/margins": 5.21875, + "rewards/rejected": -4.125, + "step": 700 + }, + { + "epoch": 0.8601226993865031, + "grad_norm": 45.17083911298038, + "learning_rate": 3.603305785123967e-07, + "logits/chosen": -0.08056640625, + "logits/rejected": -0.1982421875, + "logps/chosen": -380.0, + "logps/rejected": -320.0, + "loss": 0.3654, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.75, + "rewards/margins": 5.34375, + "rewards/rejected": -4.59375, + "step": 701 + }, + { + "epoch": 0.8613496932515338, + "grad_norm": 31.973002163499245, + "learning_rate": 3.601239669421487e-07, + "logits/chosen": -0.2080078125, + "logits/rejected": -0.498046875, + "logps/chosen": -398.0, + "logps/rejected": -328.0, + "loss": 0.1933, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.8125, + "rewards/margins": 6.875, + "rewards/rejected": -5.0625, + "step": 702 + }, + { + "epoch": 0.8625766871165644, + "grad_norm": 36.36498243165029, + "learning_rate": 3.599173553719008e-07, + "logits/chosen": -0.10400390625, + "logits/rejected": -0.25, + "logps/chosen": -414.0, + "logps/rejected": -336.0, + "loss": 0.3136, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.203125, + "rewards/margins": 5.375, + "rewards/rejected": -4.1875, + "step": 703 + }, + { + "epoch": 0.8638036809815951, + "grad_norm": 35.79987216653264, + "learning_rate": 3.5971074380165287e-07, + "logits/chosen": -0.173828125, + "logits/rejected": -0.349609375, + "logps/chosen": -322.0, + "logps/rejected": -294.0, + "loss": 0.2837, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.1171875, + "rewards/margins": 5.8125, + "rewards/rejected": -4.6875, + "step": 704 + }, + { + "epoch": 0.8650306748466258, + "grad_norm": 36.827745109710804, + "learning_rate": 3.5950413223140497e-07, + "logits/chosen": -0.279296875, + "logits/rejected": -0.41015625, + "logps/chosen": -410.0, + "logps/rejected": -350.0, + "loss": 0.2403, + "rewards/accuracies": 0.875, + "rewards/chosen": 2.09375, + "rewards/margins": 6.75, + "rewards/rejected": -4.65625, + "step": 705 + }, + { + "epoch": 0.8662576687116564, + "grad_norm": 36.25592355489759, + "learning_rate": 3.5929752066115697e-07, + "logits/chosen": -0.216796875, + "logits/rejected": -0.41796875, + "logps/chosen": -398.0, + "logps/rejected": -294.0, + "loss": 0.2682, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.3984375, + "rewards/margins": 5.84375, + "rewards/rejected": -4.4375, + "step": 706 + }, + { + "epoch": 0.8674846625766871, + "grad_norm": 33.13517607643058, + "learning_rate": 3.5909090909090907e-07, + "logits/chosen": -0.228515625, + "logits/rejected": -0.388671875, + "logps/chosen": -382.0, + "logps/rejected": -302.0, + "loss": 0.2352, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.078125, + "rewards/margins": 6.0, + "rewards/rejected": -4.9375, + "step": 707 + }, + { + "epoch": 0.8687116564417178, + "grad_norm": 29.108052314139623, + "learning_rate": 3.588842975206611e-07, + "logits/chosen": -0.2119140625, + "logits/rejected": -0.4296875, + "logps/chosen": -370.0, + "logps/rejected": -308.0, + "loss": 0.2018, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.6328125, + "rewards/margins": 6.25, + "rewards/rejected": -4.625, + "step": 708 + }, + { + "epoch": 0.8699386503067484, + "grad_norm": 26.864603379868992, + "learning_rate": 3.586776859504132e-07, + "logits/chosen": -0.1123046875, + "logits/rejected": -0.28125, + "logps/chosen": -436.0, + "logps/rejected": -336.0, + "loss": 0.184, + "rewards/accuracies": 0.953125, + "rewards/chosen": 1.8046875, + "rewards/margins": 7.0, + "rewards/rejected": -5.1875, + "step": 709 + }, + { + "epoch": 0.8711656441717791, + "grad_norm": 39.09283390375149, + "learning_rate": 3.5847107438016526e-07, + "logits/chosen": -0.0732421875, + "logits/rejected": -0.2109375, + "logps/chosen": -362.0, + "logps/rejected": -308.0, + "loss": 0.3161, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.0859375, + "rewards/margins": 5.34375, + "rewards/rejected": -4.25, + "step": 710 + }, + { + "epoch": 0.8723926380368098, + "grad_norm": 29.706815103224322, + "learning_rate": 3.5826446280991736e-07, + "logits/chosen": -0.09912109375, + "logits/rejected": -0.29296875, + "logps/chosen": -382.0, + "logps/rejected": -312.0, + "loss": 0.2257, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.484375, + "rewards/margins": 5.84375, + "rewards/rejected": -4.375, + "step": 711 + }, + { + "epoch": 0.8736196319018404, + "grad_norm": 44.764736935363494, + "learning_rate": 3.580578512396694e-07, + "logits/chosen": -0.08984375, + "logits/rejected": -0.244140625, + "logps/chosen": -404.0, + "logps/rejected": -338.0, + "loss": 0.3157, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.984375, + "rewards/margins": 6.0, + "rewards/rejected": -4.03125, + "step": 712 + }, + { + "epoch": 0.8748466257668711, + "grad_norm": 33.83006454123061, + "learning_rate": 3.578512396694215e-07, + "logits/chosen": -0.1748046875, + "logits/rejected": -0.3671875, + "logps/chosen": -380.0, + "logps/rejected": -314.0, + "loss": 0.2531, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.234375, + "rewards/margins": 5.8125, + "rewards/rejected": -4.59375, + "step": 713 + }, + { + "epoch": 0.8760736196319019, + "grad_norm": 37.79578296577771, + "learning_rate": 3.5764462809917355e-07, + "logits/chosen": -0.07177734375, + "logits/rejected": -0.28515625, + "logps/chosen": -366.0, + "logps/rejected": -312.0, + "loss": 0.2529, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.2890625, + "rewards/margins": 5.5, + "rewards/rejected": -4.21875, + "step": 714 + }, + { + "epoch": 0.8773006134969326, + "grad_norm": 33.397821944610435, + "learning_rate": 3.574380165289256e-07, + "logits/chosen": -0.26953125, + "logits/rejected": -0.359375, + "logps/chosen": -382.0, + "logps/rejected": -312.0, + "loss": 0.2448, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.3046875, + "rewards/margins": 6.3125, + "rewards/rejected": -5.03125, + "step": 715 + }, + { + "epoch": 0.8785276073619632, + "grad_norm": 38.599098942966314, + "learning_rate": 3.5723140495867765e-07, + "logits/chosen": -0.236328125, + "logits/rejected": -0.423828125, + "logps/chosen": -382.0, + "logps/rejected": -308.0, + "loss": 0.3027, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.390625, + "rewards/margins": 5.5, + "rewards/rejected": -4.09375, + "step": 716 + }, + { + "epoch": 0.8797546012269939, + "grad_norm": 35.160888357665144, + "learning_rate": 3.5702479338842975e-07, + "logits/chosen": -0.146484375, + "logits/rejected": -0.30859375, + "logps/chosen": -342.0, + "logps/rejected": -268.0, + "loss": 0.2911, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.92578125, + "rewards/margins": 5.40625, + "rewards/rejected": -4.46875, + "step": 717 + }, + { + "epoch": 0.8809815950920246, + "grad_norm": 26.612419306861238, + "learning_rate": 3.568181818181818e-07, + "logits/chosen": -0.2333984375, + "logits/rejected": -0.3828125, + "logps/chosen": -398.0, + "logps/rejected": -336.0, + "loss": 0.1966, + "rewards/accuracies": 0.921875, + "rewards/chosen": 1.859375, + "rewards/margins": 6.15625, + "rewards/rejected": -4.3125, + "step": 718 + }, + { + "epoch": 0.8822085889570552, + "grad_norm": 39.83118714795231, + "learning_rate": 3.5661157024793384e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.3984375, + "logps/chosen": -406.0, + "logps/rejected": -346.0, + "loss": 0.2762, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 2.203125, + "rewards/margins": 6.34375, + "rewards/rejected": -4.15625, + "step": 719 + }, + { + "epoch": 0.8834355828220859, + "grad_norm": 30.80915305318243, + "learning_rate": 3.5640495867768594e-07, + "logits/chosen": -0.267578125, + "logits/rejected": -0.474609375, + "logps/chosen": -410.0, + "logps/rejected": -330.0, + "loss": 0.218, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 2.171875, + "rewards/margins": 6.125, + "rewards/rejected": -3.96875, + "step": 720 + }, + { + "epoch": 0.8846625766871166, + "grad_norm": 27.499435353414444, + "learning_rate": 3.56198347107438e-07, + "logits/chosen": -0.23828125, + "logits/rejected": -0.498046875, + "logps/chosen": -412.0, + "logps/rejected": -342.0, + "loss": 0.1999, + "rewards/accuracies": 0.90625, + "rewards/chosen": 1.7890625, + "rewards/margins": 6.875, + "rewards/rejected": -5.09375, + "step": 721 + }, + { + "epoch": 0.8858895705521472, + "grad_norm": 32.55228038139476, + "learning_rate": 3.559917355371901e-07, + "logits/chosen": -0.2353515625, + "logits/rejected": -0.333984375, + "logps/chosen": -378.0, + "logps/rejected": -336.0, + "loss": 0.222, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.8359375, + "rewards/margins": 6.09375, + "rewards/rejected": -4.25, + "step": 722 + }, + { + "epoch": 0.8871165644171779, + "grad_norm": 38.73866617415686, + "learning_rate": 3.5578512396694214e-07, + "logits/chosen": -0.23046875, + "logits/rejected": -0.3515625, + "logps/chosen": -372.0, + "logps/rejected": -314.0, + "loss": 0.2777, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.3046875, + "rewards/margins": 5.84375, + "rewards/rejected": -4.53125, + "step": 723 + }, + { + "epoch": 0.8883435582822086, + "grad_norm": 36.524786654594486, + "learning_rate": 3.555785123966942e-07, + "logits/chosen": -0.2265625, + "logits/rejected": -0.44921875, + "logps/chosen": -378.0, + "logps/rejected": -298.0, + "loss": 0.2442, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.6328125, + "rewards/margins": 6.0, + "rewards/rejected": -4.375, + "step": 724 + }, + { + "epoch": 0.8895705521472392, + "grad_norm": 38.158440355258406, + "learning_rate": 3.5537190082644623e-07, + "logits/chosen": -0.10986328125, + "logits/rejected": -0.283203125, + "logps/chosen": -400.0, + "logps/rejected": -318.0, + "loss": 0.283, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.390625, + "rewards/margins": 5.6875, + "rewards/rejected": -4.28125, + "step": 725 + }, + { + "epoch": 0.8907975460122699, + "grad_norm": 27.73103579824844, + "learning_rate": 3.5516528925619833e-07, + "logits/chosen": -0.2216796875, + "logits/rejected": -0.359375, + "logps/chosen": -334.0, + "logps/rejected": -280.0, + "loss": 0.1949, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.0703125, + "rewards/margins": 5.8125, + "rewards/rejected": -4.75, + "step": 726 + }, + { + "epoch": 0.8920245398773006, + "grad_norm": 34.09534371161639, + "learning_rate": 3.549586776859504e-07, + "logits/chosen": -0.2001953125, + "logits/rejected": -0.34765625, + "logps/chosen": -368.0, + "logps/rejected": -314.0, + "loss": 0.2172, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.515625, + "rewards/margins": 5.78125, + "rewards/rejected": -4.25, + "step": 727 + }, + { + "epoch": 0.8932515337423312, + "grad_norm": 39.39112103020417, + "learning_rate": 3.547520661157025e-07, + "logits/chosen": -0.208984375, + "logits/rejected": -0.361328125, + "logps/chosen": -398.0, + "logps/rejected": -354.0, + "loss": 0.2626, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.9765625, + "rewards/margins": 6.5625, + "rewards/rejected": -4.59375, + "step": 728 + }, + { + "epoch": 0.894478527607362, + "grad_norm": 37.23604455297992, + "learning_rate": 3.545454545454545e-07, + "logits/chosen": -0.2236328125, + "logits/rejected": -0.37890625, + "logps/chosen": -388.0, + "logps/rejected": -342.0, + "loss": 0.2356, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.640625, + "rewards/margins": 6.59375, + "rewards/rejected": -4.9375, + "step": 729 + }, + { + "epoch": 0.8957055214723927, + "grad_norm": 32.56560137662825, + "learning_rate": 3.543388429752066e-07, + "logits/chosen": -0.294921875, + "logits/rejected": -0.421875, + "logps/chosen": -398.0, + "logps/rejected": -354.0, + "loss": 0.2002, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 2.1875, + "rewards/margins": 6.9375, + "rewards/rejected": -4.75, + "step": 730 + }, + { + "epoch": 0.8969325153374234, + "grad_norm": 37.581323988938905, + "learning_rate": 3.5413223140495867e-07, + "logits/chosen": -0.1044921875, + "logits/rejected": -0.2412109375, + "logps/chosen": -430.0, + "logps/rejected": -338.0, + "loss": 0.2709, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.40625, + "rewards/margins": 6.15625, + "rewards/rejected": -4.75, + "step": 731 + }, + { + "epoch": 0.898159509202454, + "grad_norm": 42.424019347418515, + "learning_rate": 3.5392561983471077e-07, + "logits/chosen": -0.2451171875, + "logits/rejected": -0.419921875, + "logps/chosen": -372.0, + "logps/rejected": -346.0, + "loss": 0.3232, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.484375, + "rewards/margins": 5.9375, + "rewards/rejected": -4.46875, + "step": 732 + }, + { + "epoch": 0.8993865030674847, + "grad_norm": 30.46815348460911, + "learning_rate": 3.5371900826446277e-07, + "logits/chosen": -0.16015625, + "logits/rejected": -0.3203125, + "logps/chosen": -354.0, + "logps/rejected": -334.0, + "loss": 0.205, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.28125, + "rewards/margins": 6.09375, + "rewards/rejected": -4.8125, + "step": 733 + }, + { + "epoch": 0.9006134969325154, + "grad_norm": 40.11598742347428, + "learning_rate": 3.5351239669421487e-07, + "logits/chosen": -0.1337890625, + "logits/rejected": -0.322265625, + "logps/chosen": -374.0, + "logps/rejected": -326.0, + "loss": 0.2734, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.4140625, + "rewards/margins": 6.5625, + "rewards/rejected": -5.125, + "step": 734 + }, + { + "epoch": 0.901840490797546, + "grad_norm": 30.987246843568794, + "learning_rate": 3.533057851239669e-07, + "logits/chosen": -0.2392578125, + "logits/rejected": -0.47265625, + "logps/chosen": -422.0, + "logps/rejected": -358.0, + "loss": 0.1867, + "rewards/accuracies": 0.90625, + "rewards/chosen": 1.4921875, + "rewards/margins": 6.96875, + "rewards/rejected": -5.46875, + "step": 735 + }, + { + "epoch": 0.9030674846625767, + "grad_norm": 39.665000609602814, + "learning_rate": 3.53099173553719e-07, + "logits/chosen": -0.08203125, + "logits/rejected": -0.2138671875, + "logps/chosen": -352.0, + "logps/rejected": -316.0, + "loss": 0.3163, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.3671875, + "rewards/margins": 5.5625, + "rewards/rejected": -5.1875, + "step": 736 + }, + { + "epoch": 0.9042944785276074, + "grad_norm": 45.99636093708745, + "learning_rate": 3.5289256198347106e-07, + "logits/chosen": -0.1767578125, + "logits/rejected": -0.28125, + "logps/chosen": -350.0, + "logps/rejected": -322.0, + "loss": 0.3995, + "rewards/accuracies": 0.78125, + "rewards/chosen": 0.5546875, + "rewards/margins": 5.53125, + "rewards/rejected": -5.0, + "step": 737 + }, + { + "epoch": 0.905521472392638, + "grad_norm": 34.94091041398414, + "learning_rate": 3.526859504132231e-07, + "logits/chosen": -0.2255859375, + "logits/rejected": -0.361328125, + "logps/chosen": -440.0, + "logps/rejected": -336.0, + "loss": 0.2497, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.578125, + "rewards/margins": 6.5625, + "rewards/rejected": -5.0, + "step": 738 + }, + { + "epoch": 0.9067484662576687, + "grad_norm": 37.70067993632191, + "learning_rate": 3.524793388429752e-07, + "logits/chosen": -0.1650390625, + "logits/rejected": -0.30859375, + "logps/chosen": -338.0, + "logps/rejected": -318.0, + "loss": 0.2834, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.671875, + "rewards/margins": 5.65625, + "rewards/rejected": -4.96875, + "step": 739 + }, + { + "epoch": 0.9079754601226994, + "grad_norm": 33.58911831683584, + "learning_rate": 3.5227272727272725e-07, + "logits/chosen": -0.22265625, + "logits/rejected": -0.392578125, + "logps/chosen": -338.0, + "logps/rejected": -306.0, + "loss": 0.2496, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.60546875, + "rewards/margins": 6.09375, + "rewards/rejected": -5.5, + "step": 740 + }, + { + "epoch": 0.90920245398773, + "grad_norm": 35.571601551599564, + "learning_rate": 3.5206611570247935e-07, + "logits/chosen": -0.2119140625, + "logits/rejected": -0.38671875, + "logps/chosen": -352.0, + "logps/rejected": -306.0, + "loss": 0.2619, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.3515625, + "rewards/margins": 6.90625, + "rewards/rejected": -5.53125, + "step": 741 + }, + { + "epoch": 0.9104294478527607, + "grad_norm": 31.812391536470038, + "learning_rate": 3.5185950413223135e-07, + "logits/chosen": -0.2138671875, + "logits/rejected": -0.412109375, + "logps/chosen": -360.0, + "logps/rejected": -348.0, + "loss": 0.2088, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.484375, + "rewards/margins": 7.03125, + "rewards/rejected": -5.53125, + "step": 742 + }, + { + "epoch": 0.9116564417177914, + "grad_norm": 36.766990867423736, + "learning_rate": 3.5165289256198345e-07, + "logits/chosen": -0.19140625, + "logits/rejected": -0.263671875, + "logps/chosen": -416.0, + "logps/rejected": -368.0, + "loss": 0.2538, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.0390625, + "rewards/margins": 5.6875, + "rewards/rejected": -4.65625, + "step": 743 + }, + { + "epoch": 0.912883435582822, + "grad_norm": 30.797563569261442, + "learning_rate": 3.514462809917355e-07, + "logits/chosen": -0.1796875, + "logits/rejected": -0.373046875, + "logps/chosen": -376.0, + "logps/rejected": -318.0, + "loss": 0.2174, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.5546875, + "rewards/margins": 7.03125, + "rewards/rejected": -5.5, + "step": 744 + }, + { + "epoch": 0.9141104294478528, + "grad_norm": 37.182331193903785, + "learning_rate": 3.512396694214876e-07, + "logits/chosen": -0.1376953125, + "logits/rejected": -0.2451171875, + "logps/chosen": -342.0, + "logps/rejected": -300.0, + "loss": 0.2759, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.515625, + "rewards/margins": 5.40625, + "rewards/rejected": -4.875, + "step": 745 + }, + { + "epoch": 0.9153374233128835, + "grad_norm": 42.37840427394414, + "learning_rate": 3.5103305785123964e-07, + "logits/chosen": -0.140625, + "logits/rejected": -0.306640625, + "logps/chosen": -402.0, + "logps/rejected": -336.0, + "loss": 0.2818, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.96484375, + "rewards/margins": 5.9375, + "rewards/rejected": -4.96875, + "step": 746 + }, + { + "epoch": 0.9165644171779141, + "grad_norm": 36.09849932082116, + "learning_rate": 3.5082644628099174e-07, + "logits/chosen": -0.306640625, + "logits/rejected": -0.42578125, + "logps/chosen": -338.0, + "logps/rejected": -326.0, + "loss": 0.2741, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.51171875, + "rewards/margins": 5.3125, + "rewards/rejected": -4.8125, + "step": 747 + }, + { + "epoch": 0.9177914110429448, + "grad_norm": 39.853022506318325, + "learning_rate": 3.506198347107438e-07, + "logits/chosen": -0.11376953125, + "logits/rejected": -0.2314453125, + "logps/chosen": -372.0, + "logps/rejected": -332.0, + "loss": 0.3302, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.205078125, + "rewards/margins": 4.875, + "rewards/rejected": -4.65625, + "step": 748 + }, + { + "epoch": 0.9190184049079755, + "grad_norm": 40.89419641030945, + "learning_rate": 3.504132231404959e-07, + "logits/chosen": -0.2275390625, + "logits/rejected": -0.4375, + "logps/chosen": -416.0, + "logps/rejected": -336.0, + "loss": 0.3306, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.046875, + "rewards/margins": 6.1875, + "rewards/rejected": -5.15625, + "step": 749 + }, + { + "epoch": 0.9202453987730062, + "grad_norm": 48.1673918296563, + "learning_rate": 3.5020661157024794e-07, + "logits/chosen": -0.212890625, + "logits/rejected": -0.357421875, + "logps/chosen": -406.0, + "logps/rejected": -326.0, + "loss": 0.3386, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.66796875, + "rewards/margins": 5.75, + "rewards/rejected": -5.09375, + "step": 750 + }, + { + "epoch": 0.9214723926380368, + "grad_norm": 43.63193512219085, + "learning_rate": 3.5e-07, + "logits/chosen": -0.21484375, + "logits/rejected": -0.384765625, + "logps/chosen": -420.0, + "logps/rejected": -340.0, + "loss": 0.2867, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.1796875, + "rewards/margins": 6.4375, + "rewards/rejected": -5.25, + "step": 751 + }, + { + "epoch": 0.9226993865030675, + "grad_norm": 35.77618155880579, + "learning_rate": 3.4979338842975203e-07, + "logits/chosen": -0.216796875, + "logits/rejected": -0.478515625, + "logps/chosen": -418.0, + "logps/rejected": -346.0, + "loss": 0.2401, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.359375, + "rewards/margins": 6.875, + "rewards/rejected": -5.5, + "step": 752 + }, + { + "epoch": 0.9239263803680982, + "grad_norm": 38.24604411902878, + "learning_rate": 3.4958677685950413e-07, + "logits/chosen": -0.1181640625, + "logits/rejected": -0.265625, + "logps/chosen": -402.0, + "logps/rejected": -338.0, + "loss": 0.2709, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.71484375, + "rewards/margins": 5.59375, + "rewards/rejected": -4.875, + "step": 753 + }, + { + "epoch": 0.9251533742331288, + "grad_norm": 43.12286562619324, + "learning_rate": 3.493801652892562e-07, + "logits/chosen": -0.1767578125, + "logits/rejected": -0.345703125, + "logps/chosen": -386.0, + "logps/rejected": -326.0, + "loss": 0.3289, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.66015625, + "rewards/margins": 5.625, + "rewards/rejected": -4.9375, + "step": 754 + }, + { + "epoch": 0.9263803680981595, + "grad_norm": 34.65065790431959, + "learning_rate": 3.491735537190082e-07, + "logits/chosen": -0.2216796875, + "logits/rejected": -0.34765625, + "logps/chosen": -376.0, + "logps/rejected": -340.0, + "loss": 0.2314, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.87109375, + "rewards/margins": 5.90625, + "rewards/rejected": -5.03125, + "step": 755 + }, + { + "epoch": 0.9276073619631902, + "grad_norm": 32.01115835369059, + "learning_rate": 3.489669421487603e-07, + "logits/chosen": -0.1357421875, + "logits/rejected": -0.2294921875, + "logps/chosen": -332.0, + "logps/rejected": -302.0, + "loss": 0.2247, + "rewards/accuracies": 0.890625, + "rewards/chosen": 0.390625, + "rewards/margins": 5.4375, + "rewards/rejected": -5.03125, + "step": 756 + }, + { + "epoch": 0.9288343558282208, + "grad_norm": 29.79853888885103, + "learning_rate": 3.4876033057851237e-07, + "logits/chosen": -0.087890625, + "logits/rejected": -0.314453125, + "logps/chosen": -398.0, + "logps/rejected": -320.0, + "loss": 0.2143, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.4140625, + "rewards/margins": 6.28125, + "rewards/rejected": -4.875, + "step": 757 + }, + { + "epoch": 0.9300613496932515, + "grad_norm": 41.4434512511522, + "learning_rate": 3.4855371900826447e-07, + "logits/chosen": -0.142578125, + "logits/rejected": -0.3125, + "logps/chosen": -366.0, + "logps/rejected": -296.0, + "loss": 0.3204, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.494140625, + "rewards/margins": 5.40625, + "rewards/rejected": -4.90625, + "step": 758 + }, + { + "epoch": 0.9312883435582822, + "grad_norm": 33.101256433680135, + "learning_rate": 3.483471074380165e-07, + "logits/chosen": -0.1123046875, + "logits/rejected": -0.34375, + "logps/chosen": -386.0, + "logps/rejected": -318.0, + "loss": 0.2334, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.28125, + "rewards/margins": 5.8125, + "rewards/rejected": -4.53125, + "step": 759 + }, + { + "epoch": 0.9325153374233128, + "grad_norm": 31.858866512033583, + "learning_rate": 3.4814049586776857e-07, + "logits/chosen": -0.275390625, + "logits/rejected": -0.53515625, + "logps/chosen": -434.0, + "logps/rejected": -342.0, + "loss": 0.2656, + "rewards/accuracies": 0.859375, + "rewards/chosen": 2.046875, + "rewards/margins": 7.03125, + "rewards/rejected": -5.0, + "step": 760 + }, + { + "epoch": 0.9337423312883436, + "grad_norm": 42.354453289827106, + "learning_rate": 3.479338842975206e-07, + "logits/chosen": -0.08251953125, + "logits/rejected": -0.232421875, + "logps/chosen": -374.0, + "logps/rejected": -334.0, + "loss": 0.258, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.3359375, + "rewards/margins": 6.0625, + "rewards/rejected": -4.71875, + "step": 761 + }, + { + "epoch": 0.9349693251533743, + "grad_norm": 38.24811318296336, + "learning_rate": 3.477272727272727e-07, + "logits/chosen": -0.0703125, + "logits/rejected": -0.25390625, + "logps/chosen": -420.0, + "logps/rejected": -340.0, + "loss": 0.2519, + "rewards/accuracies": 0.9140625, + "rewards/chosen": 1.1953125, + "rewards/margins": 6.09375, + "rewards/rejected": -4.90625, + "step": 762 + }, + { + "epoch": 0.9361963190184049, + "grad_norm": 36.20016344003986, + "learning_rate": 3.4752066115702476e-07, + "logits/chosen": -0.1357421875, + "logits/rejected": -0.2333984375, + "logps/chosen": -388.0, + "logps/rejected": -338.0, + "loss": 0.2628, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.578125, + "rewards/margins": 6.25, + "rewards/rejected": -4.65625, + "step": 763 + }, + { + "epoch": 0.9374233128834356, + "grad_norm": 37.48666102403677, + "learning_rate": 3.4731404958677686e-07, + "logits/chosen": -0.330078125, + "logits/rejected": -0.490234375, + "logps/chosen": -320.0, + "logps/rejected": -294.0, + "loss": 0.2761, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 0.447265625, + "rewards/margins": 5.625, + "rewards/rejected": -5.15625, + "step": 764 + }, + { + "epoch": 0.9386503067484663, + "grad_norm": 44.1796891457386, + "learning_rate": 3.471074380165289e-07, + "logits/chosen": -0.126953125, + "logits/rejected": -0.2578125, + "logps/chosen": -392.0, + "logps/rejected": -298.0, + "loss": 0.3388, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.89453125, + "rewards/margins": 5.03125, + "rewards/rejected": -4.15625, + "step": 765 + }, + { + "epoch": 0.939877300613497, + "grad_norm": 36.01121716925078, + "learning_rate": 3.46900826446281e-07, + "logits/chosen": -0.16796875, + "logits/rejected": -0.37109375, + "logps/chosen": -434.0, + "logps/rejected": -316.0, + "loss": 0.268, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.546875, + "rewards/margins": 6.21875, + "rewards/rejected": -4.65625, + "step": 766 + }, + { + "epoch": 0.9411042944785276, + "grad_norm": 36.56160162737348, + "learning_rate": 3.4669421487603306e-07, + "logits/chosen": -0.1884765625, + "logits/rejected": -0.33984375, + "logps/chosen": -374.0, + "logps/rejected": -312.0, + "loss": 0.3045, + "rewards/accuracies": 0.796875, + "rewards/chosen": 1.2890625, + "rewards/margins": 6.03125, + "rewards/rejected": -4.75, + "step": 767 + }, + { + "epoch": 0.9423312883435583, + "grad_norm": 40.47132685816318, + "learning_rate": 3.464876033057851e-07, + "logits/chosen": -0.2021484375, + "logits/rejected": -0.3828125, + "logps/chosen": -398.0, + "logps/rejected": -360.0, + "loss": 0.2909, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.765625, + "rewards/margins": 6.3125, + "rewards/rejected": -4.5625, + "step": 768 + }, + { + "epoch": 0.943558282208589, + "grad_norm": 30.62201594248347, + "learning_rate": 3.4628099173553715e-07, + "logits/chosen": -0.21484375, + "logits/rejected": -0.361328125, + "logps/chosen": -366.0, + "logps/rejected": -318.0, + "loss": 0.2247, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.09375, + "rewards/margins": 6.15625, + "rewards/rejected": -5.0625, + "step": 769 + }, + { + "epoch": 0.9447852760736196, + "grad_norm": 43.60373632493513, + "learning_rate": 3.4607438016528925e-07, + "logits/chosen": -0.2255859375, + "logits/rejected": -0.474609375, + "logps/chosen": -404.0, + "logps/rejected": -348.0, + "loss": 0.2772, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 2.078125, + "rewards/margins": 6.28125, + "rewards/rejected": -4.1875, + "step": 770 + }, + { + "epoch": 0.9460122699386503, + "grad_norm": 45.17582091386918, + "learning_rate": 3.458677685950413e-07, + "logits/chosen": -0.2236328125, + "logits/rejected": -0.26171875, + "logps/chosen": -416.0, + "logps/rejected": -334.0, + "loss": 0.3922, + "rewards/accuracies": 0.78125, + "rewards/chosen": 0.78125, + "rewards/margins": 5.03125, + "rewards/rejected": -4.25, + "step": 771 + }, + { + "epoch": 0.947239263803681, + "grad_norm": 42.297058717421166, + "learning_rate": 3.456611570247934e-07, + "logits/chosen": -0.0947265625, + "logits/rejected": -0.31640625, + "logps/chosen": -410.0, + "logps/rejected": -336.0, + "loss": 0.295, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.734375, + "rewards/margins": 6.0, + "rewards/rejected": -4.28125, + "step": 772 + }, + { + "epoch": 0.9484662576687116, + "grad_norm": 36.5037310282473, + "learning_rate": 3.4545454545454544e-07, + "logits/chosen": -0.10009765625, + "logits/rejected": -0.287109375, + "logps/chosen": -360.0, + "logps/rejected": -298.0, + "loss": 0.2904, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.7890625, + "rewards/margins": 5.21875, + "rewards/rejected": -4.4375, + "step": 773 + }, + { + "epoch": 0.9496932515337423, + "grad_norm": 38.086980897558234, + "learning_rate": 3.452479338842975e-07, + "logits/chosen": -0.1240234375, + "logits/rejected": -0.263671875, + "logps/chosen": -344.0, + "logps/rejected": -296.0, + "loss": 0.3096, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.458984375, + "rewards/margins": 4.09375, + "rewards/rejected": -3.640625, + "step": 774 + }, + { + "epoch": 0.950920245398773, + "grad_norm": 36.85278680079692, + "learning_rate": 3.450413223140496e-07, + "logits/chosen": -0.03271484375, + "logits/rejected": -0.2275390625, + "logps/chosen": -398.0, + "logps/rejected": -332.0, + "loss": 0.2823, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.515625, + "rewards/margins": 5.09375, + "rewards/rejected": -3.578125, + "step": 775 + }, + { + "epoch": 0.9521472392638037, + "grad_norm": 34.94073241862638, + "learning_rate": 3.4483471074380164e-07, + "logits/chosen": -0.2265625, + "logits/rejected": -0.412109375, + "logps/chosen": -398.0, + "logps/rejected": -338.0, + "loss": 0.2924, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.796875, + "rewards/margins": 5.6875, + "rewards/rejected": -3.90625, + "step": 776 + }, + { + "epoch": 0.9533742331288344, + "grad_norm": 36.22271519573166, + "learning_rate": 3.446280991735537e-07, + "logits/chosen": -0.1953125, + "logits/rejected": -0.34375, + "logps/chosen": -390.0, + "logps/rejected": -314.0, + "loss": 0.2907, + "rewards/accuracies": 0.796875, + "rewards/chosen": 1.2109375, + "rewards/margins": 5.46875, + "rewards/rejected": -4.25, + "step": 777 + }, + { + "epoch": 0.9546012269938651, + "grad_norm": 38.284746149580194, + "learning_rate": 3.4442148760330573e-07, + "logits/chosen": -0.16796875, + "logits/rejected": -0.375, + "logps/chosen": -382.0, + "logps/rejected": -300.0, + "loss": 0.2391, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.125, + "rewards/margins": 5.03125, + "rewards/rejected": -3.90625, + "step": 778 + }, + { + "epoch": 0.9558282208588957, + "grad_norm": 42.74163715791748, + "learning_rate": 3.4421487603305783e-07, + "logits/chosen": -0.2236328125, + "logits/rejected": -0.40234375, + "logps/chosen": -428.0, + "logps/rejected": -332.0, + "loss": 0.2504, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.6015625, + "rewards/margins": 6.15625, + "rewards/rejected": -4.53125, + "step": 779 + }, + { + "epoch": 0.9570552147239264, + "grad_norm": 39.028284362830085, + "learning_rate": 3.440082644628099e-07, + "logits/chosen": -0.1259765625, + "logits/rejected": -0.298828125, + "logps/chosen": -368.0, + "logps/rejected": -334.0, + "loss": 0.327, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.81640625, + "rewards/margins": 5.0, + "rewards/rejected": -4.1875, + "step": 780 + }, + { + "epoch": 0.9582822085889571, + "grad_norm": 29.49560218073861, + "learning_rate": 3.43801652892562e-07, + "logits/chosen": -0.2294921875, + "logits/rejected": -0.458984375, + "logps/chosen": -416.0, + "logps/rejected": -328.0, + "loss": 0.1947, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.921875, + "rewards/margins": 6.9375, + "rewards/rejected": -5.0, + "step": 781 + }, + { + "epoch": 0.9595092024539877, + "grad_norm": 30.862418691296618, + "learning_rate": 3.43595041322314e-07, + "logits/chosen": -0.1962890625, + "logits/rejected": -0.314453125, + "logps/chosen": -358.0, + "logps/rejected": -326.0, + "loss": 0.2276, + "rewards/accuracies": 0.9140625, + "rewards/chosen": 1.1640625, + "rewards/margins": 5.53125, + "rewards/rejected": -4.375, + "step": 782 + }, + { + "epoch": 0.9607361963190184, + "grad_norm": 32.30854631034835, + "learning_rate": 3.433884297520661e-07, + "logits/chosen": -0.2138671875, + "logits/rejected": -0.3671875, + "logps/chosen": -408.0, + "logps/rejected": -344.0, + "loss": 0.2037, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.609375, + "rewards/margins": 6.46875, + "rewards/rejected": -4.84375, + "step": 783 + }, + { + "epoch": 0.9619631901840491, + "grad_norm": 44.933495412305525, + "learning_rate": 3.4318181818181817e-07, + "logits/chosen": -0.189453125, + "logits/rejected": -0.2412109375, + "logps/chosen": -376.0, + "logps/rejected": -330.0, + "loss": 0.3216, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.421875, + "rewards/margins": 5.125, + "rewards/rejected": -4.71875, + "step": 784 + }, + { + "epoch": 0.9631901840490797, + "grad_norm": 35.45021237079088, + "learning_rate": 3.429752066115703e-07, + "logits/chosen": -0.146484375, + "logits/rejected": -0.314453125, + "logps/chosen": -374.0, + "logps/rejected": -300.0, + "loss": 0.2635, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.03125, + "rewards/margins": 5.96875, + "rewards/rejected": -4.9375, + "step": 785 + }, + { + "epoch": 0.9644171779141104, + "grad_norm": 31.822348766627872, + "learning_rate": 3.4276859504132227e-07, + "logits/chosen": -0.1396484375, + "logits/rejected": -0.34765625, + "logps/chosen": -362.0, + "logps/rejected": -308.0, + "loss": 0.2296, + "rewards/accuracies": 0.9140625, + "rewards/chosen": 0.5703125, + "rewards/margins": 5.8125, + "rewards/rejected": -5.21875, + "step": 786 + }, + { + "epoch": 0.9656441717791411, + "grad_norm": 35.86043202347341, + "learning_rate": 3.4256198347107437e-07, + "logits/chosen": -0.21484375, + "logits/rejected": -0.359375, + "logps/chosen": -402.0, + "logps/rejected": -326.0, + "loss": 0.2274, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.78125, + "rewards/margins": 6.40625, + "rewards/rejected": -5.625, + "step": 787 + }, + { + "epoch": 0.9668711656441717, + "grad_norm": 26.552313321059188, + "learning_rate": 3.423553719008264e-07, + "logits/chosen": -0.2255859375, + "logits/rejected": -0.408203125, + "logps/chosen": -382.0, + "logps/rejected": -346.0, + "loss": 0.1667, + "rewards/accuracies": 0.9296875, + "rewards/chosen": 1.1875, + "rewards/margins": 6.75, + "rewards/rejected": -5.5625, + "step": 788 + }, + { + "epoch": 0.9680981595092024, + "grad_norm": 33.30240522771134, + "learning_rate": 3.421487603305785e-07, + "logits/chosen": -0.1474609375, + "logits/rejected": -0.330078125, + "logps/chosen": -374.0, + "logps/rejected": -308.0, + "loss": 0.2769, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 0.419921875, + "rewards/margins": 5.4375, + "rewards/rejected": -5.0, + "step": 789 + }, + { + "epoch": 0.9693251533742331, + "grad_norm": 35.332506360333724, + "learning_rate": 3.4194214876033056e-07, + "logits/chosen": -0.263671875, + "logits/rejected": -0.484375, + "logps/chosen": -380.0, + "logps/rejected": -310.0, + "loss": 0.2259, + "rewards/accuracies": 0.890625, + "rewards/chosen": 0.71484375, + "rewards/margins": 6.03125, + "rewards/rejected": -5.3125, + "step": 790 + }, + { + "epoch": 0.9705521472392638, + "grad_norm": 35.242935109364, + "learning_rate": 3.417355371900826e-07, + "logits/chosen": -0.232421875, + "logits/rejected": -0.4453125, + "logps/chosen": -390.0, + "logps/rejected": -324.0, + "loss": 0.2483, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.1796875, + "rewards/margins": 6.84375, + "rewards/rejected": -5.6875, + "step": 791 + }, + { + "epoch": 0.9717791411042945, + "grad_norm": 38.00481733058289, + "learning_rate": 3.415289256198347e-07, + "logits/chosen": -0.232421875, + "logits/rejected": -0.392578125, + "logps/chosen": -432.0, + "logps/rejected": -354.0, + "loss": 0.3121, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.109375, + "rewards/margins": 5.5625, + "rewards/rejected": -4.46875, + "step": 792 + }, + { + "epoch": 0.9730061349693252, + "grad_norm": 39.05298404914802, + "learning_rate": 3.4132231404958676e-07, + "logits/chosen": -0.21875, + "logits/rejected": -0.365234375, + "logps/chosen": -384.0, + "logps/rejected": -340.0, + "loss": 0.3098, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.7109375, + "rewards/margins": 5.5, + "rewards/rejected": -4.78125, + "step": 793 + }, + { + "epoch": 0.9742331288343559, + "grad_norm": 40.1763340425155, + "learning_rate": 3.4111570247933886e-07, + "logits/chosen": -0.169921875, + "logits/rejected": -0.30859375, + "logps/chosen": -348.0, + "logps/rejected": -314.0, + "loss": 0.3445, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.3046875, + "rewards/margins": 5.3125, + "rewards/rejected": -5.0, + "step": 794 + }, + { + "epoch": 0.9754601226993865, + "grad_norm": 31.061860595685847, + "learning_rate": 3.4090909090909085e-07, + "logits/chosen": -0.3359375, + "logits/rejected": -0.515625, + "logps/chosen": -384.0, + "logps/rejected": -346.0, + "loss": 0.2126, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.65625, + "rewards/margins": 7.59375, + "rewards/rejected": -5.9375, + "step": 795 + }, + { + "epoch": 0.9766871165644172, + "grad_norm": 43.66859590907784, + "learning_rate": 3.4070247933884295e-07, + "logits/chosen": -0.244140625, + "logits/rejected": -0.447265625, + "logps/chosen": -400.0, + "logps/rejected": -312.0, + "loss": 0.2891, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.0830078125, + "rewards/margins": 5.5, + "rewards/rejected": -5.4375, + "step": 796 + }, + { + "epoch": 0.9779141104294479, + "grad_norm": 35.97056431665963, + "learning_rate": 3.40495867768595e-07, + "logits/chosen": -0.1767578125, + "logits/rejected": -0.357421875, + "logps/chosen": -394.0, + "logps/rejected": -300.0, + "loss": 0.2689, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.8359375, + "rewards/margins": 5.6875, + "rewards/rejected": -4.84375, + "step": 797 + }, + { + "epoch": 0.9791411042944785, + "grad_norm": 34.63236728191056, + "learning_rate": 3.402892561983471e-07, + "logits/chosen": -0.2099609375, + "logits/rejected": -0.388671875, + "logps/chosen": -424.0, + "logps/rejected": -354.0, + "loss": 0.2477, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.91015625, + "rewards/margins": 6.15625, + "rewards/rejected": -5.25, + "step": 798 + }, + { + "epoch": 0.9803680981595092, + "grad_norm": 40.12810675669665, + "learning_rate": 3.4008264462809914e-07, + "logits/chosen": -0.2470703125, + "logits/rejected": -0.421875, + "logps/chosen": -392.0, + "logps/rejected": -336.0, + "loss": 0.3047, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.125, + "rewards/margins": 6.0625, + "rewards/rejected": -4.9375, + "step": 799 + }, + { + "epoch": 0.9815950920245399, + "grad_norm": 36.02461663266261, + "learning_rate": 3.3987603305785124e-07, + "logits/chosen": -0.2255859375, + "logits/rejected": -0.42578125, + "logps/chosen": -378.0, + "logps/rejected": -324.0, + "loss": 0.2414, + "rewards/accuracies": 0.890625, + "rewards/chosen": 0.7265625, + "rewards/margins": 5.96875, + "rewards/rejected": -5.25, + "step": 800 + }, + { + "epoch": 0.9828220858895705, + "grad_norm": 42.912325824023604, + "learning_rate": 3.396694214876033e-07, + "logits/chosen": -0.2333984375, + "logits/rejected": -0.39453125, + "logps/chosen": -428.0, + "logps/rejected": -360.0, + "loss": 0.3447, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 0.82421875, + "rewards/margins": 5.375, + "rewards/rejected": -4.5625, + "step": 801 + }, + { + "epoch": 0.9840490797546012, + "grad_norm": 43.08820301261888, + "learning_rate": 3.394628099173554e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.42578125, + "logps/chosen": -380.0, + "logps/rejected": -328.0, + "loss": 0.3234, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.58203125, + "rewards/margins": 5.6875, + "rewards/rejected": -5.09375, + "step": 802 + }, + { + "epoch": 0.9852760736196319, + "grad_norm": 32.00066785635946, + "learning_rate": 3.3925619834710744e-07, + "logits/chosen": -0.333984375, + "logits/rejected": -0.5078125, + "logps/chosen": -390.0, + "logps/rejected": -324.0, + "loss": 0.2588, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.2578125, + "rewards/margins": 6.15625, + "rewards/rejected": -4.90625, + "step": 803 + }, + { + "epoch": 0.9865030674846625, + "grad_norm": 34.73198448187894, + "learning_rate": 3.390495867768595e-07, + "logits/chosen": -0.1806640625, + "logits/rejected": -0.3046875, + "logps/chosen": -352.0, + "logps/rejected": -320.0, + "loss": 0.3089, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 0.357421875, + "rewards/margins": 5.09375, + "rewards/rejected": -4.71875, + "step": 804 + }, + { + "epoch": 0.9877300613496932, + "grad_norm": 40.00296686612965, + "learning_rate": 3.3884297520661153e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.421875, + "logps/chosen": -426.0, + "logps/rejected": -372.0, + "loss": 0.3066, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.078125, + "rewards/margins": 6.15625, + "rewards/rejected": -5.09375, + "step": 805 + }, + { + "epoch": 0.9889570552147239, + "grad_norm": 40.373803134623145, + "learning_rate": 3.3863636363636363e-07, + "logits/chosen": -0.07470703125, + "logits/rejected": -0.2119140625, + "logps/chosen": -408.0, + "logps/rejected": -360.0, + "loss": 0.3327, + "rewards/accuracies": 0.796875, + "rewards/chosen": 0.79296875, + "rewards/margins": 5.34375, + "rewards/rejected": -4.53125, + "step": 806 + }, + { + "epoch": 0.9901840490797545, + "grad_norm": 38.793240604287554, + "learning_rate": 3.384297520661157e-07, + "logits/chosen": -0.162109375, + "logits/rejected": -0.32421875, + "logps/chosen": -394.0, + "logps/rejected": -324.0, + "loss": 0.2214, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.140625, + "rewards/margins": 6.34375, + "rewards/rejected": -5.1875, + "step": 807 + }, + { + "epoch": 0.9914110429447853, + "grad_norm": 34.36639607943694, + "learning_rate": 3.3822314049586773e-07, + "logits/chosen": -0.291015625, + "logits/rejected": -0.3125, + "logps/chosen": -354.0, + "logps/rejected": -326.0, + "loss": 0.2778, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 0.34375, + "rewards/margins": 5.84375, + "rewards/rejected": -5.5, + "step": 808 + }, + { + "epoch": 0.992638036809816, + "grad_norm": 35.83788708559064, + "learning_rate": 3.3801652892561983e-07, + "logits/chosen": -0.205078125, + "logits/rejected": -0.43359375, + "logps/chosen": -428.0, + "logps/rejected": -334.0, + "loss": 0.2316, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.6875, + "rewards/margins": 6.84375, + "rewards/rejected": -5.15625, + "step": 809 + }, + { + "epoch": 0.9938650306748467, + "grad_norm": 33.992147771254764, + "learning_rate": 3.378099173553719e-07, + "logits/chosen": -0.30078125, + "logits/rejected": -0.486328125, + "logps/chosen": -436.0, + "logps/rejected": -358.0, + "loss": 0.232, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.34375, + "rewards/margins": 6.40625, + "rewards/rejected": -5.0625, + "step": 810 + }, + { + "epoch": 0.9950920245398773, + "grad_norm": 33.283496414356925, + "learning_rate": 3.37603305785124e-07, + "logits/chosen": -0.291015625, + "logits/rejected": -0.44921875, + "logps/chosen": -386.0, + "logps/rejected": -356.0, + "loss": 0.2725, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.2578125, + "rewards/margins": 5.875, + "rewards/rejected": -4.625, + "step": 811 + }, + { + "epoch": 0.996319018404908, + "grad_norm": 37.39709126950234, + "learning_rate": 3.37396694214876e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.359375, + "logps/chosen": -356.0, + "logps/rejected": -316.0, + "loss": 0.2424, + "rewards/accuracies": 0.921875, + "rewards/chosen": 0.65625, + "rewards/margins": 6.09375, + "rewards/rejected": -5.4375, + "step": 812 + }, + { + "epoch": 0.9975460122699387, + "grad_norm": 33.804195099429606, + "learning_rate": 3.3719008264462807e-07, + "logits/chosen": -0.1953125, + "logits/rejected": -0.341796875, + "logps/chosen": -336.0, + "logps/rejected": -314.0, + "loss": 0.1865, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.9140625, + "rewards/margins": 6.0625, + "rewards/rejected": -5.15625, + "step": 813 + }, + { + "epoch": 0.9987730061349693, + "grad_norm": 38.231813987979244, + "learning_rate": 3.369834710743801e-07, + "logits/chosen": -0.1884765625, + "logits/rejected": -0.2734375, + "logps/chosen": -378.0, + "logps/rejected": -346.0, + "loss": 0.3288, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.162109375, + "rewards/margins": 4.65625, + "rewards/rejected": -4.5, + "step": 814 + }, + { + "epoch": 1.0, + "grad_norm": 37.3431869316195, + "learning_rate": 3.367768595041322e-07, + "logits/chosen": -0.11572265625, + "logits/rejected": -0.306640625, + "logps/chosen": -378.0, + "logps/rejected": -338.0, + "loss": 0.203, + "rewards/accuracies": 0.8571429252624512, + "rewards/chosen": 0.859375, + "rewards/margins": 5.9375, + "rewards/rejected": -5.0625, + "step": 815 + }, + { + "epoch": 1.0012269938650307, + "grad_norm": 12.259663022531143, + "learning_rate": 3.3657024793388426e-07, + "logits/chosen": -0.166015625, + "logits/rejected": -0.3203125, + "logps/chosen": -372.0, + "logps/rejected": -304.0, + "loss": 0.0783, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.7421875, + "rewards/margins": 7.0625, + "rewards/rejected": -5.3125, + "step": 816 + }, + { + "epoch": 1.0024539877300613, + "grad_norm": 15.209721486737584, + "learning_rate": 3.3636363636363636e-07, + "logits/chosen": -0.1943359375, + "logits/rejected": -0.3515625, + "logps/chosen": -358.0, + "logps/rejected": -306.0, + "loss": 0.099, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.92578125, + "rewards/margins": 6.25, + "rewards/rejected": -5.3125, + "step": 817 + }, + { + "epoch": 1.003680981595092, + "grad_norm": 12.54319426872472, + "learning_rate": 3.361570247933884e-07, + "logits/chosen": -0.3125, + "logits/rejected": -0.40625, + "logps/chosen": -360.0, + "logps/rejected": -334.0, + "loss": 0.0757, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.5234375, + "rewards/margins": 6.75, + "rewards/rejected": -5.21875, + "step": 818 + }, + { + "epoch": 1.0049079754601227, + "grad_norm": 15.278011566295417, + "learning_rate": 3.359504132231405e-07, + "logits/chosen": -0.1787109375, + "logits/rejected": -0.35546875, + "logps/chosen": -388.0, + "logps/rejected": -332.0, + "loss": 0.0833, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.625, + "rewards/margins": 6.8125, + "rewards/rejected": -5.1875, + "step": 819 + }, + { + "epoch": 1.0061349693251533, + "grad_norm": 13.554341111152507, + "learning_rate": 3.3574380165289256e-07, + "logits/chosen": -0.1494140625, + "logits/rejected": -0.294921875, + "logps/chosen": -394.0, + "logps/rejected": -328.0, + "loss": 0.0889, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.9296875, + "rewards/margins": 6.625, + "rewards/rejected": -4.71875, + "step": 820 + }, + { + "epoch": 1.007361963190184, + "grad_norm": 19.71965131533449, + "learning_rate": 3.3553719008264466e-07, + "logits/chosen": -0.2177734375, + "logits/rejected": -0.35546875, + "logps/chosen": -346.0, + "logps/rejected": -314.0, + "loss": 0.1078, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.828125, + "rewards/margins": 7.09375, + "rewards/rejected": -5.25, + "step": 821 + }, + { + "epoch": 1.0085889570552147, + "grad_norm": 13.743690213291728, + "learning_rate": 3.3533057851239665e-07, + "logits/chosen": -0.2158203125, + "logits/rejected": -0.36328125, + "logps/chosen": -404.0, + "logps/rejected": -346.0, + "loss": 0.0808, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.7109375, + "rewards/margins": 6.65625, + "rewards/rejected": -4.9375, + "step": 822 + }, + { + "epoch": 1.0098159509202453, + "grad_norm": 14.996830861274045, + "learning_rate": 3.3512396694214875e-07, + "logits/chosen": -0.1884765625, + "logits/rejected": -0.376953125, + "logps/chosen": -362.0, + "logps/rejected": -324.0, + "loss": 0.0942, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.953125, + "rewards/margins": 7.03125, + "rewards/rejected": -5.09375, + "step": 823 + }, + { + "epoch": 1.011042944785276, + "grad_norm": 12.522717048402102, + "learning_rate": 3.349173553719008e-07, + "logits/chosen": -0.26171875, + "logits/rejected": -0.419921875, + "logps/chosen": -378.0, + "logps/rejected": -344.0, + "loss": 0.0625, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.90625, + "rewards/margins": 6.96875, + "rewards/rejected": -5.03125, + "step": 824 + }, + { + "epoch": 1.0122699386503067, + "grad_norm": 12.893193982573738, + "learning_rate": 3.347107438016529e-07, + "logits/chosen": -0.0849609375, + "logits/rejected": -0.349609375, + "logps/chosen": -394.0, + "logps/rejected": -330.0, + "loss": 0.0744, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.8046875, + "rewards/margins": 7.0625, + "rewards/rejected": -5.28125, + "step": 825 + }, + { + "epoch": 1.0134969325153373, + "grad_norm": 17.489525503978417, + "learning_rate": 3.3450413223140495e-07, + "logits/chosen": -0.291015625, + "logits/rejected": -0.4375, + "logps/chosen": -370.0, + "logps/rejected": -328.0, + "loss": 0.1115, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.3828125, + "rewards/margins": 6.28125, + "rewards/rejected": -4.875, + "step": 826 + }, + { + "epoch": 1.014723926380368, + "grad_norm": 14.647722993911307, + "learning_rate": 3.34297520661157e-07, + "logits/chosen": -0.212890625, + "logits/rejected": -0.330078125, + "logps/chosen": -344.0, + "logps/rejected": -308.0, + "loss": 0.0969, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.79296875, + "rewards/margins": 5.59375, + "rewards/rejected": -4.78125, + "step": 827 + }, + { + "epoch": 1.0159509202453987, + "grad_norm": 15.941089095537901, + "learning_rate": 3.340909090909091e-07, + "logits/chosen": -0.09326171875, + "logits/rejected": -0.287109375, + "logps/chosen": -378.0, + "logps/rejected": -302.0, + "loss": 0.1171, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.5, + "rewards/margins": 6.34375, + "rewards/rejected": -4.8125, + "step": 828 + }, + { + "epoch": 1.0171779141104293, + "grad_norm": 17.97387770397603, + "learning_rate": 3.3388429752066114e-07, + "logits/chosen": -0.3203125, + "logits/rejected": -0.39453125, + "logps/chosen": -374.0, + "logps/rejected": -352.0, + "loss": 0.1062, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.8046875, + "rewards/margins": 6.84375, + "rewards/rejected": -5.03125, + "step": 829 + }, + { + "epoch": 1.01840490797546, + "grad_norm": 13.72586293525825, + "learning_rate": 3.3367768595041324e-07, + "logits/chosen": -0.234375, + "logits/rejected": -0.443359375, + "logps/chosen": -408.0, + "logps/rejected": -348.0, + "loss": 0.0856, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 2.328125, + "rewards/margins": 7.8125, + "rewards/rejected": -5.5, + "step": 830 + }, + { + "epoch": 1.019631901840491, + "grad_norm": 13.192991917086653, + "learning_rate": 3.3347107438016523e-07, + "logits/chosen": -0.232421875, + "logits/rejected": -0.3125, + "logps/chosen": -400.0, + "logps/rejected": -364.0, + "loss": 0.0799, + "rewards/accuracies": 1.0, + "rewards/chosen": 2.015625, + "rewards/margins": 7.46875, + "rewards/rejected": -5.4375, + "step": 831 + }, + { + "epoch": 1.0208588957055216, + "grad_norm": 21.764261439199625, + "learning_rate": 3.3326446280991733e-07, + "logits/chosen": -0.2412109375, + "logits/rejected": -0.4453125, + "logps/chosen": -402.0, + "logps/rejected": -350.0, + "loss": 0.1053, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.59375, + "rewards/margins": 6.71875, + "rewards/rejected": -5.09375, + "step": 832 + }, + { + "epoch": 1.0220858895705522, + "grad_norm": 16.400599313119255, + "learning_rate": 3.330578512396694e-07, + "logits/chosen": -0.30078125, + "logits/rejected": -0.4609375, + "logps/chosen": -444.0, + "logps/rejected": -368.0, + "loss": 0.0879, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.65625, + "rewards/margins": 6.90625, + "rewards/rejected": -5.25, + "step": 833 + }, + { + "epoch": 1.023312883435583, + "grad_norm": 15.616103389985229, + "learning_rate": 3.328512396694215e-07, + "logits/chosen": -0.2080078125, + "logits/rejected": -0.2392578125, + "logps/chosen": -350.0, + "logps/rejected": -328.0, + "loss": 0.0907, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.7265625, + "rewards/margins": 5.84375, + "rewards/rejected": -5.125, + "step": 834 + }, + { + "epoch": 1.0245398773006136, + "grad_norm": 14.483723424076196, + "learning_rate": 3.3264462809917353e-07, + "logits/chosen": -0.140625, + "logits/rejected": -0.357421875, + "logps/chosen": -408.0, + "logps/rejected": -362.0, + "loss": 0.0997, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.4609375, + "rewards/margins": 6.5, + "rewards/rejected": -5.03125, + "step": 835 + }, + { + "epoch": 1.0257668711656442, + "grad_norm": 16.156974572900307, + "learning_rate": 3.3243801652892563e-07, + "logits/chosen": -0.2412109375, + "logits/rejected": -0.333984375, + "logps/chosen": -372.0, + "logps/rejected": -336.0, + "loss": 0.0857, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.1796875, + "rewards/margins": 6.71875, + "rewards/rejected": -5.53125, + "step": 836 + }, + { + "epoch": 1.026993865030675, + "grad_norm": 13.86269284956411, + "learning_rate": 3.322314049586777e-07, + "logits/chosen": -0.09765625, + "logits/rejected": -0.353515625, + "logps/chosen": -436.0, + "logps/rejected": -366.0, + "loss": 0.0868, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.921875, + "rewards/margins": 7.15625, + "rewards/rejected": -5.21875, + "step": 837 + }, + { + "epoch": 1.0282208588957056, + "grad_norm": 16.390946630040137, + "learning_rate": 3.320247933884298e-07, + "logits/chosen": -0.2333984375, + "logits/rejected": -0.431640625, + "logps/chosen": -384.0, + "logps/rejected": -344.0, + "loss": 0.0955, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.2734375, + "rewards/margins": 7.15625, + "rewards/rejected": -5.875, + "step": 838 + }, + { + "epoch": 1.0294478527607362, + "grad_norm": 30.49099747509546, + "learning_rate": 3.318181818181818e-07, + "logits/chosen": -0.1806640625, + "logits/rejected": -0.34375, + "logps/chosen": -392.0, + "logps/rejected": -346.0, + "loss": 0.1214, + "rewards/accuracies": 0.953125, + "rewards/chosen": 1.2734375, + "rewards/margins": 6.65625, + "rewards/rejected": -5.375, + "step": 839 + }, + { + "epoch": 1.030674846625767, + "grad_norm": 14.416244350848686, + "learning_rate": 3.3161157024793387e-07, + "logits/chosen": -0.2001953125, + "logits/rejected": -0.4375, + "logps/chosen": -438.0, + "logps/rejected": -374.0, + "loss": 0.0844, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.6796875, + "rewards/margins": 7.75, + "rewards/rejected": -6.0625, + "step": 840 + }, + { + "epoch": 1.0319018404907976, + "grad_norm": 14.56906197576248, + "learning_rate": 3.314049586776859e-07, + "logits/chosen": -0.1337890625, + "logits/rejected": -0.306640625, + "logps/chosen": -378.0, + "logps/rejected": -354.0, + "loss": 0.089, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.015625, + "rewards/margins": 6.96875, + "rewards/rejected": -5.96875, + "step": 841 + }, + { + "epoch": 1.0331288343558283, + "grad_norm": 13.65292459169916, + "learning_rate": 3.31198347107438e-07, + "logits/chosen": -0.2314453125, + "logits/rejected": -0.376953125, + "logps/chosen": -448.0, + "logps/rejected": -322.0, + "loss": 0.0971, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.296875, + "rewards/margins": 6.8125, + "rewards/rejected": -5.5, + "step": 842 + }, + { + "epoch": 1.034355828220859, + "grad_norm": 13.785244260815091, + "learning_rate": 3.3099173553719006e-07, + "logits/chosen": -0.2236328125, + "logits/rejected": -0.3671875, + "logps/chosen": -450.0, + "logps/rejected": -370.0, + "loss": 0.08, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.6015625, + "rewards/margins": 7.0625, + "rewards/rejected": -5.4375, + "step": 843 + }, + { + "epoch": 1.0355828220858896, + "grad_norm": 14.848904283285925, + "learning_rate": 3.307851239669421e-07, + "logits/chosen": -0.1328125, + "logits/rejected": -0.353515625, + "logps/chosen": -426.0, + "logps/rejected": -330.0, + "loss": 0.0868, + "rewards/accuracies": 0.984375, + "rewards/chosen": 2.0, + "rewards/margins": 7.28125, + "rewards/rejected": -5.28125, + "step": 844 + }, + { + "epoch": 1.0368098159509203, + "grad_norm": 13.421028110381078, + "learning_rate": 3.305785123966942e-07, + "logits/chosen": -0.203125, + "logits/rejected": -0.3203125, + "logps/chosen": -364.0, + "logps/rejected": -314.0, + "loss": 0.0708, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.296875, + "rewards/margins": 6.1875, + "rewards/rejected": -4.90625, + "step": 845 + }, + { + "epoch": 1.038036809815951, + "grad_norm": 14.796461542249148, + "learning_rate": 3.3037190082644626e-07, + "logits/chosen": -0.1162109375, + "logits/rejected": -0.318359375, + "logps/chosen": -416.0, + "logps/rejected": -308.0, + "loss": 0.0758, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.7265625, + "rewards/margins": 7.28125, + "rewards/rejected": -5.5625, + "step": 846 + }, + { + "epoch": 1.0392638036809816, + "grad_norm": 17.14326447883765, + "learning_rate": 3.3016528925619836e-07, + "logits/chosen": -0.134765625, + "logits/rejected": -0.291015625, + "logps/chosen": -364.0, + "logps/rejected": -322.0, + "loss": 0.1101, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.46875, + "rewards/margins": 6.5, + "rewards/rejected": -5.03125, + "step": 847 + }, + { + "epoch": 1.0404907975460123, + "grad_norm": 13.56261798189713, + "learning_rate": 3.2995867768595035e-07, + "logits/chosen": -0.2138671875, + "logits/rejected": -0.32421875, + "logps/chosen": -346.0, + "logps/rejected": -316.0, + "loss": 0.0891, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.046875, + "rewards/margins": 6.8125, + "rewards/rejected": -5.75, + "step": 848 + }, + { + "epoch": 1.041717791411043, + "grad_norm": 20.68146424665464, + "learning_rate": 3.2975206611570245e-07, + "logits/chosen": -0.1611328125, + "logits/rejected": -0.26171875, + "logps/chosen": -374.0, + "logps/rejected": -368.0, + "loss": 0.1262, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.1171875, + "rewards/margins": 6.1875, + "rewards/rejected": -5.0625, + "step": 849 + }, + { + "epoch": 1.0429447852760736, + "grad_norm": 13.606172408629623, + "learning_rate": 3.295454545454545e-07, + "logits/chosen": -0.1923828125, + "logits/rejected": -0.427734375, + "logps/chosen": -366.0, + "logps/rejected": -326.0, + "loss": 0.0635, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.7265625, + "rewards/margins": 7.5, + "rewards/rejected": -5.78125, + "step": 850 + }, + { + "epoch": 1.0441717791411043, + "grad_norm": 10.143304293143443, + "learning_rate": 3.293388429752066e-07, + "logits/chosen": -0.21875, + "logits/rejected": -0.419921875, + "logps/chosen": -374.0, + "logps/rejected": -348.0, + "loss": 0.0537, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.5546875, + "rewards/margins": 7.28125, + "rewards/rejected": -5.75, + "step": 851 + }, + { + "epoch": 1.045398773006135, + "grad_norm": 14.566820416844363, + "learning_rate": 3.2913223140495865e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.439453125, + "logps/chosen": -422.0, + "logps/rejected": -368.0, + "loss": 0.0799, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.9609375, + "rewards/margins": 7.0, + "rewards/rejected": -5.03125, + "step": 852 + }, + { + "epoch": 1.0466257668711656, + "grad_norm": 12.693926025203602, + "learning_rate": 3.2892561983471075e-07, + "logits/chosen": -0.21484375, + "logits/rejected": -0.33203125, + "logps/chosen": -406.0, + "logps/rejected": -330.0, + "loss": 0.0779, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.7265625, + "rewards/margins": 6.96875, + "rewards/rejected": -5.25, + "step": 853 + }, + { + "epoch": 1.0478527607361963, + "grad_norm": 14.497671955073232, + "learning_rate": 3.287190082644628e-07, + "logits/chosen": -0.138671875, + "logits/rejected": -0.2734375, + "logps/chosen": -386.0, + "logps/rejected": -348.0, + "loss": 0.1003, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.15625, + "rewards/margins": 6.21875, + "rewards/rejected": -5.0625, + "step": 854 + }, + { + "epoch": 1.049079754601227, + "grad_norm": 19.227096223090967, + "learning_rate": 3.285123966942149e-07, + "logits/chosen": -0.08642578125, + "logits/rejected": -0.2333984375, + "logps/chosen": -396.0, + "logps/rejected": -368.0, + "loss": 0.113, + "rewards/accuracies": 0.953125, + "rewards/chosen": 1.6640625, + "rewards/margins": 6.78125, + "rewards/rejected": -5.125, + "step": 855 + }, + { + "epoch": 1.0503067484662576, + "grad_norm": 15.659617768021317, + "learning_rate": 3.2830578512396694e-07, + "logits/chosen": -0.166015625, + "logits/rejected": -0.359375, + "logps/chosen": -402.0, + "logps/rejected": -324.0, + "loss": 0.1096, + "rewards/accuracies": 0.953125, + "rewards/chosen": 1.6015625, + "rewards/margins": 6.96875, + "rewards/rejected": -5.375, + "step": 856 + }, + { + "epoch": 1.0515337423312883, + "grad_norm": 14.3287546971232, + "learning_rate": 3.28099173553719e-07, + "logits/chosen": -0.267578125, + "logits/rejected": -0.453125, + "logps/chosen": -396.0, + "logps/rejected": -348.0, + "loss": 0.0795, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.8515625, + "rewards/margins": 7.75, + "rewards/rejected": -5.90625, + "step": 857 + }, + { + "epoch": 1.052760736196319, + "grad_norm": 12.583255783885791, + "learning_rate": 3.2789256198347103e-07, + "logits/chosen": -0.158203125, + "logits/rejected": -0.2333984375, + "logps/chosen": -318.0, + "logps/rejected": -288.0, + "loss": 0.078, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.66796875, + "rewards/margins": 6.84375, + "rewards/rejected": -6.15625, + "step": 858 + }, + { + "epoch": 1.0539877300613496, + "grad_norm": 16.152476295032493, + "learning_rate": 3.2768595041322313e-07, + "logits/chosen": -0.201171875, + "logits/rejected": -0.408203125, + "logps/chosen": -394.0, + "logps/rejected": -314.0, + "loss": 0.0868, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.87890625, + "rewards/margins": 6.9375, + "rewards/rejected": -6.0625, + "step": 859 + }, + { + "epoch": 1.0552147239263803, + "grad_norm": 15.89833828288902, + "learning_rate": 3.274793388429752e-07, + "logits/chosen": -0.1240234375, + "logits/rejected": -0.3203125, + "logps/chosen": -408.0, + "logps/rejected": -344.0, + "loss": 0.117, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.5625, + "rewards/margins": 5.90625, + "rewards/rejected": -5.34375, + "step": 860 + }, + { + "epoch": 1.056441717791411, + "grad_norm": 14.48066788073414, + "learning_rate": 3.272727272727273e-07, + "logits/chosen": -0.1787109375, + "logits/rejected": -0.369140625, + "logps/chosen": -396.0, + "logps/rejected": -320.0, + "loss": 0.0789, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.53125, + "rewards/margins": 7.40625, + "rewards/rejected": -5.875, + "step": 861 + }, + { + "epoch": 1.0576687116564418, + "grad_norm": 13.482705865354024, + "learning_rate": 3.2706611570247933e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.357421875, + "logps/chosen": -376.0, + "logps/rejected": -336.0, + "loss": 0.0765, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.63671875, + "rewards/margins": 6.96875, + "rewards/rejected": -6.34375, + "step": 862 + }, + { + "epoch": 1.0588957055214725, + "grad_norm": 12.599484840745689, + "learning_rate": 3.268595041322314e-07, + "logits/chosen": -0.265625, + "logits/rejected": -0.478515625, + "logps/chosen": -424.0, + "logps/rejected": -362.0, + "loss": 0.0651, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 2.0, + "rewards/margins": 7.96875, + "rewards/rejected": -5.96875, + "step": 863 + }, + { + "epoch": 1.0601226993865032, + "grad_norm": 14.321662977360447, + "learning_rate": 3.266528925619835e-07, + "logits/chosen": -0.1826171875, + "logits/rejected": -0.384765625, + "logps/chosen": -374.0, + "logps/rejected": -348.0, + "loss": 0.0886, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.0625, + "rewards/margins": 7.625, + "rewards/rejected": -6.5625, + "step": 864 + }, + { + "epoch": 1.0613496932515338, + "grad_norm": 13.75734214123902, + "learning_rate": 3.264462809917355e-07, + "logits/chosen": -0.337890625, + "logits/rejected": -0.4375, + "logps/chosen": -424.0, + "logps/rejected": -334.0, + "loss": 0.0637, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.125, + "rewards/margins": 8.0, + "rewards/rejected": -6.875, + "step": 865 + }, + { + "epoch": 1.0625766871165645, + "grad_norm": 12.279072116663103, + "learning_rate": 3.2623966942148757e-07, + "logits/chosen": -0.27734375, + "logits/rejected": -0.478515625, + "logps/chosen": -348.0, + "logps/rejected": -328.0, + "loss": 0.0654, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.3515625, + "rewards/margins": 8.0625, + "rewards/rejected": -6.71875, + "step": 866 + }, + { + "epoch": 1.0638036809815952, + "grad_norm": 19.505244482468054, + "learning_rate": 3.260330578512396e-07, + "logits/chosen": -0.26171875, + "logits/rejected": -0.421875, + "logps/chosen": -424.0, + "logps/rejected": -338.0, + "loss": 0.1189, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.125, + "rewards/margins": 6.9375, + "rewards/rejected": -5.8125, + "step": 867 + }, + { + "epoch": 1.0650306748466258, + "grad_norm": 14.074090647435115, + "learning_rate": 3.258264462809917e-07, + "logits/chosen": -0.046875, + "logits/rejected": -0.2421875, + "logps/chosen": -350.0, + "logps/rejected": -292.0, + "loss": 0.0893, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.93359375, + "rewards/margins": 6.53125, + "rewards/rejected": -5.59375, + "step": 868 + }, + { + "epoch": 1.0662576687116565, + "grad_norm": 14.571765600032565, + "learning_rate": 3.2561983471074376e-07, + "logits/chosen": -0.24609375, + "logits/rejected": -0.37109375, + "logps/chosen": -402.0, + "logps/rejected": -352.0, + "loss": 0.0837, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.4375, + "rewards/margins": 7.53125, + "rewards/rejected": -6.09375, + "step": 869 + }, + { + "epoch": 1.0674846625766872, + "grad_norm": 16.28549661762683, + "learning_rate": 3.2541322314049586e-07, + "logits/chosen": -0.11083984375, + "logits/rejected": -0.291015625, + "logps/chosen": -382.0, + "logps/rejected": -334.0, + "loss": 0.102, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.296875, + "rewards/margins": 7.28125, + "rewards/rejected": -5.96875, + "step": 870 + }, + { + "epoch": 1.0687116564417178, + "grad_norm": 18.071058371769617, + "learning_rate": 3.252066115702479e-07, + "logits/chosen": -0.1201171875, + "logits/rejected": -0.283203125, + "logps/chosen": -402.0, + "logps/rejected": -326.0, + "loss": 0.0983, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.03125, + "rewards/margins": 6.4375, + "rewards/rejected": -5.40625, + "step": 871 + }, + { + "epoch": 1.0699386503067485, + "grad_norm": 14.266293122799356, + "learning_rate": 3.25e-07, + "logits/chosen": -0.1318359375, + "logits/rejected": -0.26171875, + "logps/chosen": -410.0, + "logps/rejected": -302.0, + "loss": 0.0786, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.2265625, + "rewards/margins": 7.21875, + "rewards/rejected": -5.96875, + "step": 872 + }, + { + "epoch": 1.0711656441717792, + "grad_norm": 15.602842110090197, + "learning_rate": 3.2479338842975206e-07, + "logits/chosen": -0.20703125, + "logits/rejected": -0.3828125, + "logps/chosen": -374.0, + "logps/rejected": -350.0, + "loss": 0.0943, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.078125, + "rewards/margins": 7.5, + "rewards/rejected": -6.4375, + "step": 873 + }, + { + "epoch": 1.0723926380368098, + "grad_norm": 16.40654713335496, + "learning_rate": 3.2458677685950416e-07, + "logits/chosen": -0.23828125, + "logits/rejected": -0.3828125, + "logps/chosen": -432.0, + "logps/rejected": -372.0, + "loss": 0.1019, + "rewards/accuracies": 0.953125, + "rewards/chosen": 1.625, + "rewards/margins": 7.71875, + "rewards/rejected": -6.09375, + "step": 874 + }, + { + "epoch": 1.0736196319018405, + "grad_norm": 14.656084548254892, + "learning_rate": 3.2438016528925615e-07, + "logits/chosen": -0.1279296875, + "logits/rejected": -0.29296875, + "logps/chosen": -346.0, + "logps/rejected": -348.0, + "loss": 0.0817, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.21875, + "rewards/margins": 7.15625, + "rewards/rejected": -5.9375, + "step": 875 + }, + { + "epoch": 1.0748466257668712, + "grad_norm": 17.467795538341694, + "learning_rate": 3.2417355371900825e-07, + "logits/chosen": -0.2294921875, + "logits/rejected": -0.423828125, + "logps/chosen": -412.0, + "logps/rejected": -372.0, + "loss": 0.0985, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.296875, + "rewards/margins": 7.65625, + "rewards/rejected": -6.34375, + "step": 876 + }, + { + "epoch": 1.0760736196319018, + "grad_norm": 13.771551801590357, + "learning_rate": 3.239669421487603e-07, + "logits/chosen": -0.08056640625, + "logits/rejected": -0.2333984375, + "logps/chosen": -400.0, + "logps/rejected": -328.0, + "loss": 0.0749, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.69140625, + "rewards/margins": 6.625, + "rewards/rejected": -5.9375, + "step": 877 + }, + { + "epoch": 1.0773006134969325, + "grad_norm": 15.836782133197865, + "learning_rate": 3.237603305785124e-07, + "logits/chosen": -0.228515625, + "logits/rejected": -0.427734375, + "logps/chosen": -376.0, + "logps/rejected": -338.0, + "loss": 0.105, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.5859375, + "rewards/margins": 6.71875, + "rewards/rejected": -6.125, + "step": 878 + }, + { + "epoch": 1.0785276073619632, + "grad_norm": 12.969494351203755, + "learning_rate": 3.2355371900826445e-07, + "logits/chosen": -0.10986328125, + "logits/rejected": -0.357421875, + "logps/chosen": -410.0, + "logps/rejected": -324.0, + "loss": 0.0658, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.421875, + "rewards/margins": 7.5, + "rewards/rejected": -6.09375, + "step": 879 + }, + { + "epoch": 1.0797546012269938, + "grad_norm": 11.821942154283308, + "learning_rate": 3.233471074380165e-07, + "logits/chosen": -0.12158203125, + "logits/rejected": -0.341796875, + "logps/chosen": -346.0, + "logps/rejected": -314.0, + "loss": 0.0634, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.38671875, + "rewards/margins": 7.5, + "rewards/rejected": -7.125, + "step": 880 + }, + { + "epoch": 1.0809815950920245, + "grad_norm": 16.49633210034593, + "learning_rate": 3.231404958677686e-07, + "logits/chosen": -0.10009765625, + "logits/rejected": -0.2392578125, + "logps/chosen": -346.0, + "logps/rejected": -288.0, + "loss": 0.107, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.66015625, + "rewards/margins": 6.0625, + "rewards/rejected": -5.375, + "step": 881 + }, + { + "epoch": 1.0822085889570552, + "grad_norm": 17.837915143003197, + "learning_rate": 3.2293388429752064e-07, + "logits/chosen": -0.21875, + "logits/rejected": -0.361328125, + "logps/chosen": -398.0, + "logps/rejected": -360.0, + "loss": 0.0935, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 1.71875, + "rewards/margins": 7.34375, + "rewards/rejected": -5.65625, + "step": 882 + }, + { + "epoch": 1.0834355828220859, + "grad_norm": 11.565018389543406, + "learning_rate": 3.2272727272727274e-07, + "logits/chosen": -0.2490234375, + "logits/rejected": -0.384765625, + "logps/chosen": -386.0, + "logps/rejected": -332.0, + "loss": 0.0585, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.6875, + "rewards/margins": 6.9375, + "rewards/rejected": -5.25, + "step": 883 + }, + { + "epoch": 1.0846625766871165, + "grad_norm": 11.512719040759002, + "learning_rate": 3.2252066115702474e-07, + "logits/chosen": -0.2353515625, + "logits/rejected": -0.416015625, + "logps/chosen": -426.0, + "logps/rejected": -370.0, + "loss": 0.06, + "rewards/accuracies": 0.984375, + "rewards/chosen": 2.203125, + "rewards/margins": 8.0625, + "rewards/rejected": -5.875, + "step": 884 + }, + { + "epoch": 1.0858895705521472, + "grad_norm": 15.089612290737605, + "learning_rate": 3.2231404958677684e-07, + "logits/chosen": -0.1728515625, + "logits/rejected": -0.318359375, + "logps/chosen": -390.0, + "logps/rejected": -320.0, + "loss": 0.099, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 1.6484375, + "rewards/margins": 6.9375, + "rewards/rejected": -5.28125, + "step": 885 + }, + { + "epoch": 1.0871165644171779, + "grad_norm": 14.987293361609737, + "learning_rate": 3.221074380165289e-07, + "logits/chosen": -0.08642578125, + "logits/rejected": -0.294921875, + "logps/chosen": -378.0, + "logps/rejected": -348.0, + "loss": 0.1013, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.2578125, + "rewards/margins": 6.15625, + "rewards/rejected": -4.90625, + "step": 886 + }, + { + "epoch": 1.0883435582822085, + "grad_norm": 13.904557936952761, + "learning_rate": 3.21900826446281e-07, + "logits/chosen": -0.2333984375, + "logits/rejected": -0.427734375, + "logps/chosen": -396.0, + "logps/rejected": -348.0, + "loss": 0.077, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.40625, + "rewards/margins": 7.3125, + "rewards/rejected": -5.9375, + "step": 887 + }, + { + "epoch": 1.0895705521472392, + "grad_norm": 11.599560865424403, + "learning_rate": 3.2169421487603303e-07, + "logits/chosen": -0.208984375, + "logits/rejected": -0.48046875, + "logps/chosen": -396.0, + "logps/rejected": -342.0, + "loss": 0.0626, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.46875, + "rewards/margins": 7.09375, + "rewards/rejected": -5.625, + "step": 888 + }, + { + "epoch": 1.0907975460122699, + "grad_norm": 17.8039918940807, + "learning_rate": 3.2148760330578513e-07, + "logits/chosen": -0.1806640625, + "logits/rejected": -0.310546875, + "logps/chosen": -448.0, + "logps/rejected": -380.0, + "loss": 0.0932, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.9140625, + "rewards/margins": 7.46875, + "rewards/rejected": -5.5625, + "step": 889 + }, + { + "epoch": 1.0920245398773005, + "grad_norm": 16.01464196301419, + "learning_rate": 3.212809917355372e-07, + "logits/chosen": -0.2197265625, + "logits/rejected": -0.35546875, + "logps/chosen": -362.0, + "logps/rejected": -322.0, + "loss": 0.0907, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.46875, + "rewards/margins": 6.96875, + "rewards/rejected": -5.46875, + "step": 890 + }, + { + "epoch": 1.0932515337423312, + "grad_norm": 13.538658561025441, + "learning_rate": 3.210743801652893e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.400390625, + "logps/chosen": -362.0, + "logps/rejected": -348.0, + "loss": 0.0842, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.95703125, + "rewards/margins": 7.15625, + "rewards/rejected": -6.1875, + "step": 891 + }, + { + "epoch": 1.0944785276073619, + "grad_norm": 13.122527674488813, + "learning_rate": 3.208677685950413e-07, + "logits/chosen": -0.1630859375, + "logits/rejected": -0.390625, + "logps/chosen": -348.0, + "logps/rejected": -320.0, + "loss": 0.0896, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.140625, + "rewards/margins": 7.1875, + "rewards/rejected": -6.03125, + "step": 892 + }, + { + "epoch": 1.0957055214723925, + "grad_norm": 17.71847572482304, + "learning_rate": 3.2066115702479337e-07, + "logits/chosen": -0.2109375, + "logits/rejected": -0.2412109375, + "logps/chosen": -316.0, + "logps/rejected": -296.0, + "loss": 0.1107, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.87109375, + "rewards/margins": 6.53125, + "rewards/rejected": -5.65625, + "step": 893 + }, + { + "epoch": 1.0969325153374232, + "grad_norm": 15.012214624189234, + "learning_rate": 3.204545454545454e-07, + "logits/chosen": -0.189453125, + "logits/rejected": -0.408203125, + "logps/chosen": -434.0, + "logps/rejected": -376.0, + "loss": 0.0728, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.8046875, + "rewards/margins": 8.125, + "rewards/rejected": -6.34375, + "step": 894 + }, + { + "epoch": 1.098159509202454, + "grad_norm": 17.919265575886666, + "learning_rate": 3.202479338842975e-07, + "logits/chosen": -0.19140625, + "logits/rejected": -0.353515625, + "logps/chosen": -388.0, + "logps/rejected": -336.0, + "loss": 0.0907, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.4296875, + "rewards/margins": 6.84375, + "rewards/rejected": -5.40625, + "step": 895 + }, + { + "epoch": 1.0993865030674848, + "grad_norm": 15.44842437240469, + "learning_rate": 3.2004132231404957e-07, + "logits/chosen": -0.22265625, + "logits/rejected": -0.37109375, + "logps/chosen": -366.0, + "logps/rejected": -338.0, + "loss": 0.084, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.453125, + "rewards/margins": 7.3125, + "rewards/rejected": -5.875, + "step": 896 + }, + { + "epoch": 1.1006134969325154, + "grad_norm": 16.901501789852766, + "learning_rate": 3.198347107438016e-07, + "logits/chosen": -0.2412109375, + "logits/rejected": -0.46875, + "logps/chosen": -442.0, + "logps/rejected": -350.0, + "loss": 0.0875, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.953125, + "rewards/margins": 7.0625, + "rewards/rejected": -6.125, + "step": 897 + }, + { + "epoch": 1.101840490797546, + "grad_norm": 12.234418919418719, + "learning_rate": 3.196280991735537e-07, + "logits/chosen": -0.236328125, + "logits/rejected": -0.4453125, + "logps/chosen": -416.0, + "logps/rejected": -350.0, + "loss": 0.0787, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.4296875, + "rewards/margins": 7.875, + "rewards/rejected": -6.4375, + "step": 898 + }, + { + "epoch": 1.1030674846625768, + "grad_norm": 13.10937054414505, + "learning_rate": 3.1942148760330576e-07, + "logits/chosen": -0.162109375, + "logits/rejected": -0.2890625, + "logps/chosen": -336.0, + "logps/rejected": -310.0, + "loss": 0.0819, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.259765625, + "rewards/margins": 6.6875, + "rewards/rejected": -6.4375, + "step": 899 + }, + { + "epoch": 1.1042944785276074, + "grad_norm": 15.166633938396838, + "learning_rate": 3.1921487603305786e-07, + "logits/chosen": -0.1279296875, + "logits/rejected": -0.3203125, + "logps/chosen": -400.0, + "logps/rejected": -366.0, + "loss": 0.0785, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.83984375, + "rewards/margins": 7.21875, + "rewards/rejected": -6.375, + "step": 900 + }, + { + "epoch": 1.105521472392638, + "grad_norm": 17.64171376710007, + "learning_rate": 3.190082644628099e-07, + "logits/chosen": -0.2431640625, + "logits/rejected": -0.474609375, + "logps/chosen": -492.0, + "logps/rejected": -384.0, + "loss": 0.0912, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.6953125, + "rewards/margins": 8.4375, + "rewards/rejected": -6.75, + "step": 901 + }, + { + "epoch": 1.1067484662576688, + "grad_norm": 12.602909453766244, + "learning_rate": 3.1880165289256195e-07, + "logits/chosen": -0.279296875, + "logits/rejected": -0.44140625, + "logps/chosen": -372.0, + "logps/rejected": -346.0, + "loss": 0.0687, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.9375, + "rewards/margins": 7.6875, + "rewards/rejected": -6.75, + "step": 902 + }, + { + "epoch": 1.1079754601226994, + "grad_norm": 13.714395271468868, + "learning_rate": 3.18595041322314e-07, + "logits/chosen": -0.1826171875, + "logits/rejected": -0.41015625, + "logps/chosen": -360.0, + "logps/rejected": -330.0, + "loss": 0.0754, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.1171875, + "rewards/margins": 7.59375, + "rewards/rejected": -6.46875, + "step": 903 + }, + { + "epoch": 1.10920245398773, + "grad_norm": 13.250729389536362, + "learning_rate": 3.183884297520661e-07, + "logits/chosen": -0.1953125, + "logits/rejected": -0.34375, + "logps/chosen": -374.0, + "logps/rejected": -376.0, + "loss": 0.0644, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.4296875, + "rewards/margins": 8.125, + "rewards/rejected": -6.6875, + "step": 904 + }, + { + "epoch": 1.1104294478527608, + "grad_norm": 14.511450484175517, + "learning_rate": 3.1818181818181815e-07, + "logits/chosen": -0.33984375, + "logits/rejected": -0.55078125, + "logps/chosen": -392.0, + "logps/rejected": -352.0, + "loss": 0.0726, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.484375, + "rewards/margins": 8.1875, + "rewards/rejected": -6.71875, + "step": 905 + }, + { + "epoch": 1.1116564417177914, + "grad_norm": 14.163593207086905, + "learning_rate": 3.1797520661157025e-07, + "logits/chosen": -0.287109375, + "logits/rejected": -0.3828125, + "logps/chosen": -334.0, + "logps/rejected": -344.0, + "loss": 0.0971, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.33203125, + "rewards/margins": 6.375, + "rewards/rejected": -6.03125, + "step": 906 + }, + { + "epoch": 1.112883435582822, + "grad_norm": 16.30810022027397, + "learning_rate": 3.177685950413223e-07, + "logits/chosen": -0.19921875, + "logits/rejected": -0.46875, + "logps/chosen": -380.0, + "logps/rejected": -322.0, + "loss": 0.078, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.1171875, + "rewards/margins": 8.0, + "rewards/rejected": -6.875, + "step": 907 + }, + { + "epoch": 1.1141104294478528, + "grad_norm": 18.83130303896192, + "learning_rate": 3.175619834710744e-07, + "logits/chosen": -0.25390625, + "logits/rejected": -0.36328125, + "logps/chosen": -390.0, + "logps/rejected": -342.0, + "loss": 0.0771, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.625, + "rewards/margins": 7.8125, + "rewards/rejected": -6.1875, + "step": 908 + }, + { + "epoch": 1.1153374233128834, + "grad_norm": 17.11879928547849, + "learning_rate": 3.1735537190082644e-07, + "logits/chosen": -0.1376953125, + "logits/rejected": -0.255859375, + "logps/chosen": -414.0, + "logps/rejected": -400.0, + "loss": 0.0922, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.015625, + "rewards/margins": 7.4375, + "rewards/rejected": -6.40625, + "step": 909 + }, + { + "epoch": 1.116564417177914, + "grad_norm": 10.827580369275127, + "learning_rate": 3.1714876033057854e-07, + "logits/chosen": -0.2490234375, + "logits/rejected": -0.443359375, + "logps/chosen": -388.0, + "logps/rejected": -362.0, + "loss": 0.0533, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.4296875, + "rewards/margins": 8.25, + "rewards/rejected": -6.84375, + "step": 910 + }, + { + "epoch": 1.1177914110429448, + "grad_norm": 11.876608224639686, + "learning_rate": 3.1694214876033054e-07, + "logits/chosen": -0.1904296875, + "logits/rejected": -0.4375, + "logps/chosen": -468.0, + "logps/rejected": -386.0, + "loss": 0.0583, + "rewards/accuracies": 1.0, + "rewards/chosen": 2.09375, + "rewards/margins": 9.625, + "rewards/rejected": -7.53125, + "step": 911 + }, + { + "epoch": 1.1190184049079754, + "grad_norm": 26.844768079252102, + "learning_rate": 3.1673553719008264e-07, + "logits/chosen": -0.11474609375, + "logits/rejected": -0.22265625, + "logps/chosen": -354.0, + "logps/rejected": -344.0, + "loss": 0.1112, + "rewards/accuracies": 0.953125, + "rewards/chosen": 0.8515625, + "rewards/margins": 7.09375, + "rewards/rejected": -6.25, + "step": 912 + }, + { + "epoch": 1.120245398773006, + "grad_norm": 14.450166094247406, + "learning_rate": 3.165289256198347e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.388671875, + "logps/chosen": -320.0, + "logps/rejected": -336.0, + "loss": 0.0769, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.296875, + "rewards/margins": 8.3125, + "rewards/rejected": -7.03125, + "step": 913 + }, + { + "epoch": 1.1214723926380368, + "grad_norm": 19.206409297297924, + "learning_rate": 3.163223140495868e-07, + "logits/chosen": -0.125, + "logits/rejected": -0.298828125, + "logps/chosen": -404.0, + "logps/rejected": -336.0, + "loss": 0.1077, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.7109375, + "rewards/margins": 6.875, + "rewards/rejected": -6.1875, + "step": 914 + }, + { + "epoch": 1.1226993865030674, + "grad_norm": 17.009381740915753, + "learning_rate": 3.1611570247933883e-07, + "logits/chosen": -0.150390625, + "logits/rejected": -0.40234375, + "logps/chosen": -404.0, + "logps/rejected": -358.0, + "loss": 0.0859, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.1640625, + "rewards/margins": 7.5, + "rewards/rejected": -6.34375, + "step": 915 + }, + { + "epoch": 1.123926380368098, + "grad_norm": 13.75328837803106, + "learning_rate": 3.159090909090909e-07, + "logits/chosen": -0.28515625, + "logits/rejected": -0.44140625, + "logps/chosen": -386.0, + "logps/rejected": -330.0, + "loss": 0.0842, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.2109375, + "rewards/margins": 7.375, + "rewards/rejected": -6.15625, + "step": 916 + }, + { + "epoch": 1.1251533742331288, + "grad_norm": 18.596248517246302, + "learning_rate": 3.15702479338843e-07, + "logits/chosen": -0.251953125, + "logits/rejected": -0.494140625, + "logps/chosen": -418.0, + "logps/rejected": -386.0, + "loss": 0.1107, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 1.3671875, + "rewards/margins": 7.53125, + "rewards/rejected": -6.1875, + "step": 917 + }, + { + "epoch": 1.1263803680981594, + "grad_norm": 16.967303172691818, + "learning_rate": 3.15495867768595e-07, + "logits/chosen": -0.1640625, + "logits/rejected": -0.30859375, + "logps/chosen": -380.0, + "logps/rejected": -336.0, + "loss": 0.0918, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.171875, + "rewards/margins": 6.75, + "rewards/rejected": -5.59375, + "step": 918 + }, + { + "epoch": 1.1276073619631901, + "grad_norm": 18.756828720175086, + "learning_rate": 3.152892561983471e-07, + "logits/chosen": -0.32421875, + "logits/rejected": -0.400390625, + "logps/chosen": -372.0, + "logps/rejected": -358.0, + "loss": 0.1016, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.76953125, + "rewards/margins": 6.90625, + "rewards/rejected": -6.125, + "step": 919 + }, + { + "epoch": 1.1288343558282208, + "grad_norm": 19.02626152870652, + "learning_rate": 3.150826446280991e-07, + "logits/chosen": -0.189453125, + "logits/rejected": -0.39453125, + "logps/chosen": -402.0, + "logps/rejected": -346.0, + "loss": 0.0972, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.8984375, + "rewards/margins": 6.84375, + "rewards/rejected": -5.9375, + "step": 920 + }, + { + "epoch": 1.1300613496932514, + "grad_norm": 18.0133904343147, + "learning_rate": 3.148760330578512e-07, + "logits/chosen": -0.1904296875, + "logits/rejected": -0.357421875, + "logps/chosen": -392.0, + "logps/rejected": -354.0, + "loss": 0.0618, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.6015625, + "rewards/margins": 7.84375, + "rewards/rejected": -6.25, + "step": 921 + }, + { + "epoch": 1.1312883435582821, + "grad_norm": 14.222900627597795, + "learning_rate": 3.1466942148760327e-07, + "logits/chosen": -0.1416015625, + "logits/rejected": -0.279296875, + "logps/chosen": -384.0, + "logps/rejected": -358.0, + "loss": 0.0824, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.9140625, + "rewards/margins": 7.4375, + "rewards/rejected": -5.53125, + "step": 922 + }, + { + "epoch": 1.132515337423313, + "grad_norm": 16.14769736964756, + "learning_rate": 3.1446280991735537e-07, + "logits/chosen": -0.1337890625, + "logits/rejected": -0.236328125, + "logps/chosen": -358.0, + "logps/rejected": -336.0, + "loss": 0.0863, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.515625, + "rewards/margins": 6.90625, + "rewards/rejected": -5.375, + "step": 923 + }, + { + "epoch": 1.1337423312883437, + "grad_norm": 16.18803882100018, + "learning_rate": 3.142561983471074e-07, + "logits/chosen": -0.251953125, + "logits/rejected": -0.357421875, + "logps/chosen": -376.0, + "logps/rejected": -326.0, + "loss": 0.0871, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.6484375, + "rewards/margins": 7.84375, + "rewards/rejected": -6.1875, + "step": 924 + }, + { + "epoch": 1.1349693251533743, + "grad_norm": 18.84337376901259, + "learning_rate": 3.140495867768595e-07, + "logits/chosen": -0.314453125, + "logits/rejected": -0.515625, + "logps/chosen": -372.0, + "logps/rejected": -320.0, + "loss": 0.0824, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.6484375, + "rewards/margins": 7.0625, + "rewards/rejected": -6.40625, + "step": 925 + }, + { + "epoch": 1.136196319018405, + "grad_norm": 13.610560581014049, + "learning_rate": 3.1384297520661156e-07, + "logits/chosen": -0.32421875, + "logits/rejected": -0.50390625, + "logps/chosen": -416.0, + "logps/rejected": -370.0, + "loss": 0.0763, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.9375, + "rewards/margins": 8.125, + "rewards/rejected": -6.1875, + "step": 926 + }, + { + "epoch": 1.1374233128834357, + "grad_norm": 14.900382805511716, + "learning_rate": 3.1363636363636366e-07, + "logits/chosen": -0.2255859375, + "logits/rejected": -0.380859375, + "logps/chosen": -420.0, + "logps/rejected": -366.0, + "loss": 0.0715, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.703125, + "rewards/margins": 7.84375, + "rewards/rejected": -6.125, + "step": 927 + }, + { + "epoch": 1.1386503067484663, + "grad_norm": 10.651120364048932, + "learning_rate": 3.134297520661157e-07, + "logits/chosen": -0.1943359375, + "logits/rejected": -0.3984375, + "logps/chosen": -408.0, + "logps/rejected": -356.0, + "loss": 0.0718, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.4453125, + "rewards/margins": 7.375, + "rewards/rejected": -5.9375, + "step": 928 + }, + { + "epoch": 1.139877300613497, + "grad_norm": 14.755624131752391, + "learning_rate": 3.1322314049586775e-07, + "logits/chosen": -0.1796875, + "logits/rejected": -0.349609375, + "logps/chosen": -424.0, + "logps/rejected": -310.0, + "loss": 0.0778, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.4453125, + "rewards/margins": 7.3125, + "rewards/rejected": -5.875, + "step": 929 + }, + { + "epoch": 1.1411042944785277, + "grad_norm": 19.659994495285734, + "learning_rate": 3.130165289256198e-07, + "logits/chosen": -0.1865234375, + "logits/rejected": -0.419921875, + "logps/chosen": -400.0, + "logps/rejected": -348.0, + "loss": 0.0665, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.234375, + "rewards/margins": 7.71875, + "rewards/rejected": -6.5, + "step": 930 + }, + { + "epoch": 1.1423312883435583, + "grad_norm": 17.71396023166755, + "learning_rate": 3.128099173553719e-07, + "logits/chosen": -0.2138671875, + "logits/rejected": -0.30859375, + "logps/chosen": -404.0, + "logps/rejected": -338.0, + "loss": 0.1079, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.828125, + "rewards/margins": 6.46875, + "rewards/rejected": -5.65625, + "step": 931 + }, + { + "epoch": 1.143558282208589, + "grad_norm": 12.573260319219532, + "learning_rate": 3.1260330578512395e-07, + "logits/chosen": -0.28515625, + "logits/rejected": -0.47265625, + "logps/chosen": -370.0, + "logps/rejected": -338.0, + "loss": 0.0708, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.0234375, + "rewards/margins": 7.96875, + "rewards/rejected": -6.96875, + "step": 932 + }, + { + "epoch": 1.1447852760736197, + "grad_norm": 15.458680042005257, + "learning_rate": 3.12396694214876e-07, + "logits/chosen": -0.1787109375, + "logits/rejected": -0.283203125, + "logps/chosen": -364.0, + "logps/rejected": -360.0, + "loss": 0.0782, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.1015625, + "rewards/margins": 6.90625, + "rewards/rejected": -5.78125, + "step": 933 + }, + { + "epoch": 1.1460122699386504, + "grad_norm": 15.497645570036209, + "learning_rate": 3.121900826446281e-07, + "logits/chosen": -0.2099609375, + "logits/rejected": -0.388671875, + "logps/chosen": -376.0, + "logps/rejected": -328.0, + "loss": 0.0882, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.859375, + "rewards/margins": 7.375, + "rewards/rejected": -5.53125, + "step": 934 + }, + { + "epoch": 1.147239263803681, + "grad_norm": 13.481451297674173, + "learning_rate": 3.1198347107438014e-07, + "logits/chosen": -0.2470703125, + "logits/rejected": -0.3984375, + "logps/chosen": -410.0, + "logps/rejected": -366.0, + "loss": 0.0719, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.375, + "rewards/margins": 7.21875, + "rewards/rejected": -5.84375, + "step": 935 + }, + { + "epoch": 1.1484662576687117, + "grad_norm": 11.86109616047399, + "learning_rate": 3.1177685950413224e-07, + "logits/chosen": -0.0927734375, + "logits/rejected": -0.3359375, + "logps/chosen": -358.0, + "logps/rejected": -340.0, + "loss": 0.0671, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.86328125, + "rewards/margins": 7.34375, + "rewards/rejected": -6.46875, + "step": 936 + }, + { + "epoch": 1.1496932515337424, + "grad_norm": 15.045680667663055, + "learning_rate": 3.1157024793388424e-07, + "logits/chosen": -0.1630859375, + "logits/rejected": -0.39453125, + "logps/chosen": -428.0, + "logps/rejected": -362.0, + "loss": 0.0795, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.921875, + "rewards/margins": 7.15625, + "rewards/rejected": -6.21875, + "step": 937 + }, + { + "epoch": 1.150920245398773, + "grad_norm": 19.952822255335196, + "learning_rate": 3.1136363636363634e-07, + "logits/chosen": -0.1669921875, + "logits/rejected": -0.23046875, + "logps/chosen": -368.0, + "logps/rejected": -338.0, + "loss": 0.1106, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.80859375, + "rewards/margins": 7.0625, + "rewards/rejected": -6.25, + "step": 938 + }, + { + "epoch": 1.1521472392638037, + "grad_norm": 9.901813888799785, + "learning_rate": 3.111570247933884e-07, + "logits/chosen": -0.294921875, + "logits/rejected": -0.443359375, + "logps/chosen": -444.0, + "logps/rejected": -378.0, + "loss": 0.047, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.734375, + "rewards/margins": 8.4375, + "rewards/rejected": -6.6875, + "step": 939 + }, + { + "epoch": 1.1533742331288344, + "grad_norm": 11.114952809225473, + "learning_rate": 3.109504132231405e-07, + "logits/chosen": -0.28515625, + "logits/rejected": -0.49609375, + "logps/chosen": -412.0, + "logps/rejected": -344.0, + "loss": 0.0604, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.671875, + "rewards/margins": 8.5, + "rewards/rejected": -6.8125, + "step": 940 + }, + { + "epoch": 1.154601226993865, + "grad_norm": 14.57624716499333, + "learning_rate": 3.1074380165289253e-07, + "logits/chosen": -0.1611328125, + "logits/rejected": -0.376953125, + "logps/chosen": -414.0, + "logps/rejected": -354.0, + "loss": 0.0859, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.6953125, + "rewards/margins": 7.84375, + "rewards/rejected": -6.125, + "step": 941 + }, + { + "epoch": 1.1558282208588957, + "grad_norm": 17.205476592824755, + "learning_rate": 3.1053719008264463e-07, + "logits/chosen": -0.3515625, + "logits/rejected": -0.515625, + "logps/chosen": -416.0, + "logps/rejected": -370.0, + "loss": 0.0918, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.4921875, + "rewards/margins": 8.8125, + "rewards/rejected": -7.3125, + "step": 942 + }, + { + "epoch": 1.1570552147239264, + "grad_norm": 17.60114136823849, + "learning_rate": 3.103305785123967e-07, + "logits/chosen": -0.130859375, + "logits/rejected": -0.302734375, + "logps/chosen": -352.0, + "logps/rejected": -316.0, + "loss": 0.0709, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.5703125, + "rewards/margins": 7.03125, + "rewards/rejected": -6.4375, + "step": 943 + }, + { + "epoch": 1.158282208588957, + "grad_norm": 14.083339954890745, + "learning_rate": 3.101239669421488e-07, + "logits/chosen": -0.2001953125, + "logits/rejected": -0.3828125, + "logps/chosen": -404.0, + "logps/rejected": -378.0, + "loss": 0.0719, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.078125, + "rewards/margins": 8.0625, + "rewards/rejected": -7.0, + "step": 944 + }, + { + "epoch": 1.1595092024539877, + "grad_norm": 12.250051834260303, + "learning_rate": 3.099173553719008e-07, + "logits/chosen": -0.279296875, + "logits/rejected": -0.478515625, + "logps/chosen": -416.0, + "logps/rejected": -352.0, + "loss": 0.0661, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.546875, + "rewards/margins": 8.125, + "rewards/rejected": -6.625, + "step": 945 + }, + { + "epoch": 1.1607361963190184, + "grad_norm": 16.43988418131389, + "learning_rate": 3.0971074380165287e-07, + "logits/chosen": -0.1513671875, + "logits/rejected": -0.2373046875, + "logps/chosen": -380.0, + "logps/rejected": -366.0, + "loss": 0.0957, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.1748046875, + "rewards/margins": 6.3125, + "rewards/rejected": -6.125, + "step": 946 + }, + { + "epoch": 1.161963190184049, + "grad_norm": 14.013450147537364, + "learning_rate": 3.095041322314049e-07, + "logits/chosen": -0.322265625, + "logits/rejected": -0.515625, + "logps/chosen": -344.0, + "logps/rejected": -336.0, + "loss": 0.0936, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 1.0546875, + "rewards/margins": 7.28125, + "rewards/rejected": -6.21875, + "step": 947 + }, + { + "epoch": 1.1631901840490797, + "grad_norm": 17.126789573604487, + "learning_rate": 3.09297520661157e-07, + "logits/chosen": -0.314453125, + "logits/rejected": -0.55078125, + "logps/chosen": -424.0, + "logps/rejected": -348.0, + "loss": 0.0824, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.84375, + "rewards/margins": 7.9375, + "rewards/rejected": -6.09375, + "step": 948 + }, + { + "epoch": 1.1644171779141104, + "grad_norm": 13.907173513833683, + "learning_rate": 3.0909090909090907e-07, + "logits/chosen": -0.1396484375, + "logits/rejected": -0.408203125, + "logps/chosen": -412.0, + "logps/rejected": -370.0, + "loss": 0.0778, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.625, + "rewards/margins": 7.6875, + "rewards/rejected": -6.0625, + "step": 949 + }, + { + "epoch": 1.165644171779141, + "grad_norm": 18.056331811241925, + "learning_rate": 3.0888429752066117e-07, + "logits/chosen": -0.255859375, + "logits/rejected": -0.3671875, + "logps/chosen": -332.0, + "logps/rejected": -296.0, + "loss": 0.095, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.87109375, + "rewards/margins": 7.0, + "rewards/rejected": -6.15625, + "step": 950 + }, + { + "epoch": 1.1668711656441717, + "grad_norm": 16.2085205289594, + "learning_rate": 3.086776859504132e-07, + "logits/chosen": -0.1513671875, + "logits/rejected": -0.28515625, + "logps/chosen": -344.0, + "logps/rejected": -314.0, + "loss": 0.0841, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.81640625, + "rewards/margins": 6.5, + "rewards/rejected": -5.6875, + "step": 951 + }, + { + "epoch": 1.1680981595092024, + "grad_norm": 16.341069022558255, + "learning_rate": 3.0847107438016526e-07, + "logits/chosen": -0.322265625, + "logits/rejected": -0.59765625, + "logps/chosen": -420.0, + "logps/rejected": -344.0, + "loss": 0.0943, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.6484375, + "rewards/margins": 7.46875, + "rewards/rejected": -5.8125, + "step": 952 + }, + { + "epoch": 1.169325153374233, + "grad_norm": 16.968037380438737, + "learning_rate": 3.0826446280991736e-07, + "logits/chosen": -0.208984375, + "logits/rejected": -0.40234375, + "logps/chosen": -386.0, + "logps/rejected": -314.0, + "loss": 0.083, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.1953125, + "rewards/margins": 6.15625, + "rewards/rejected": -4.96875, + "step": 953 + }, + { + "epoch": 1.1705521472392637, + "grad_norm": 19.10483320310206, + "learning_rate": 3.080578512396694e-07, + "logits/chosen": -0.2119140625, + "logits/rejected": -0.40625, + "logps/chosen": -314.0, + "logps/rejected": -274.0, + "loss": 0.1092, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.34765625, + "rewards/margins": 5.96875, + "rewards/rejected": -5.625, + "step": 954 + }, + { + "epoch": 1.1717791411042944, + "grad_norm": 10.69197426239666, + "learning_rate": 3.0785123966942146e-07, + "logits/chosen": -0.1513671875, + "logits/rejected": -0.23046875, + "logps/chosen": -376.0, + "logps/rejected": -334.0, + "loss": 0.0556, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.53125, + "rewards/margins": 6.875, + "rewards/rejected": -5.34375, + "step": 955 + }, + { + "epoch": 1.173006134969325, + "grad_norm": 12.943116163333505, + "learning_rate": 3.076446280991735e-07, + "logits/chosen": -0.2255859375, + "logits/rejected": -0.337890625, + "logps/chosen": -310.0, + "logps/rejected": -302.0, + "loss": 0.0649, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.921875, + "rewards/margins": 6.15625, + "rewards/rejected": -5.21875, + "step": 956 + }, + { + "epoch": 1.1742331288343557, + "grad_norm": 12.21194868544167, + "learning_rate": 3.074380165289256e-07, + "logits/chosen": -0.265625, + "logits/rejected": -0.486328125, + "logps/chosen": -384.0, + "logps/rejected": -358.0, + "loss": 0.0675, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.5625, + "rewards/margins": 6.90625, + "rewards/rejected": -5.34375, + "step": 957 + }, + { + "epoch": 1.1754601226993864, + "grad_norm": 17.259568939422916, + "learning_rate": 3.0723140495867765e-07, + "logits/chosen": -0.185546875, + "logits/rejected": -0.302734375, + "logps/chosen": -356.0, + "logps/rejected": -358.0, + "loss": 0.0691, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.1953125, + "rewards/margins": 7.15625, + "rewards/rejected": -5.96875, + "step": 958 + }, + { + "epoch": 1.1766871165644173, + "grad_norm": 15.64576685723049, + "learning_rate": 3.0702479338842975e-07, + "logits/chosen": -0.220703125, + "logits/rejected": -0.41015625, + "logps/chosen": -390.0, + "logps/rejected": -344.0, + "loss": 0.0859, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.2421875, + "rewards/margins": 7.0, + "rewards/rejected": -5.75, + "step": 959 + }, + { + "epoch": 1.177914110429448, + "grad_norm": 13.606327559065937, + "learning_rate": 3.068181818181818e-07, + "logits/chosen": -0.3046875, + "logits/rejected": -0.455078125, + "logps/chosen": -336.0, + "logps/rejected": -304.0, + "loss": 0.0763, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.43359375, + "rewards/margins": 6.71875, + "rewards/rejected": -6.28125, + "step": 960 + }, + { + "epoch": 1.1791411042944786, + "grad_norm": 11.782861618678115, + "learning_rate": 3.066115702479339e-07, + "logits/chosen": -0.25, + "logits/rejected": -0.380859375, + "logps/chosen": -396.0, + "logps/rejected": -336.0, + "loss": 0.0613, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.7421875, + "rewards/margins": 7.875, + "rewards/rejected": -6.125, + "step": 961 + }, + { + "epoch": 1.1803680981595093, + "grad_norm": 15.408628461589814, + "learning_rate": 3.0640495867768594e-07, + "logits/chosen": -0.150390625, + "logits/rejected": -0.31640625, + "logps/chosen": -432.0, + "logps/rejected": -386.0, + "loss": 0.0822, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.25, + "rewards/margins": 7.34375, + "rewards/rejected": -6.09375, + "step": 962 + }, + { + "epoch": 1.18159509202454, + "grad_norm": 12.216790890333117, + "learning_rate": 3.0619834710743804e-07, + "logits/chosen": -0.25, + "logits/rejected": -0.443359375, + "logps/chosen": -370.0, + "logps/rejected": -312.0, + "loss": 0.0732, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.4140625, + "rewards/margins": 7.625, + "rewards/rejected": -6.1875, + "step": 963 + }, + { + "epoch": 1.1828220858895706, + "grad_norm": 18.006422261990974, + "learning_rate": 3.0599173553719004e-07, + "logits/chosen": -0.1982421875, + "logits/rejected": -0.37890625, + "logps/chosen": -374.0, + "logps/rejected": -326.0, + "loss": 0.0726, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.3359375, + "rewards/margins": 7.90625, + "rewards/rejected": -6.5625, + "step": 964 + }, + { + "epoch": 1.1840490797546013, + "grad_norm": 19.94845083636628, + "learning_rate": 3.0578512396694214e-07, + "logits/chosen": -0.265625, + "logits/rejected": -0.40234375, + "logps/chosen": -356.0, + "logps/rejected": -344.0, + "loss": 0.0739, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.67578125, + "rewards/margins": 7.53125, + "rewards/rejected": -6.84375, + "step": 965 + }, + { + "epoch": 1.185276073619632, + "grad_norm": 13.445845138407845, + "learning_rate": 3.055785123966942e-07, + "logits/chosen": -0.318359375, + "logits/rejected": -0.458984375, + "logps/chosen": -386.0, + "logps/rejected": -320.0, + "loss": 0.0745, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.9140625, + "rewards/margins": 7.5625, + "rewards/rejected": -6.625, + "step": 966 + }, + { + "epoch": 1.1865030674846626, + "grad_norm": 16.300571483075196, + "learning_rate": 3.053719008264463e-07, + "logits/chosen": -0.2412109375, + "logits/rejected": -0.421875, + "logps/chosen": -404.0, + "logps/rejected": -338.0, + "loss": 0.0914, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.6953125, + "rewards/margins": 8.1875, + "rewards/rejected": -6.5, + "step": 967 + }, + { + "epoch": 1.1877300613496933, + "grad_norm": 11.703836604576628, + "learning_rate": 3.0516528925619833e-07, + "logits/chosen": -0.181640625, + "logits/rejected": -0.373046875, + "logps/chosen": -420.0, + "logps/rejected": -354.0, + "loss": 0.0562, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.1953125, + "rewards/margins": 8.3125, + "rewards/rejected": -7.125, + "step": 968 + }, + { + "epoch": 1.188957055214724, + "grad_norm": 16.658410921449764, + "learning_rate": 3.049586776859504e-07, + "logits/chosen": -0.287109375, + "logits/rejected": -0.447265625, + "logps/chosen": -378.0, + "logps/rejected": -380.0, + "loss": 0.0999, + "rewards/accuracies": 0.96875, + "rewards/chosen": -0.5, + "rewards/margins": 6.71875, + "rewards/rejected": -7.21875, + "step": 969 + }, + { + "epoch": 1.1901840490797546, + "grad_norm": 15.75184921128148, + "learning_rate": 3.047520661157025e-07, + "logits/chosen": -0.23046875, + "logits/rejected": -0.365234375, + "logps/chosen": -364.0, + "logps/rejected": -452.0, + "loss": 0.0855, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.7109375, + "rewards/margins": 18.75, + "rewards/rejected": -18.0, + "step": 970 + }, + { + "epoch": 1.1914110429447853, + "grad_norm": 15.12803773136293, + "learning_rate": 3.0454545454545453e-07, + "logits/chosen": -0.1552734375, + "logits/rejected": -0.396484375, + "logps/chosen": -352.0, + "logps/rejected": -318.0, + "loss": 0.0915, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.478515625, + "rewards/margins": 7.4375, + "rewards/rejected": -6.96875, + "step": 971 + }, + { + "epoch": 1.192638036809816, + "grad_norm": 15.945063034571097, + "learning_rate": 3.0433884297520663e-07, + "logits/chosen": -0.2158203125, + "logits/rejected": -0.3515625, + "logps/chosen": -338.0, + "logps/rejected": -280.0, + "loss": 0.1099, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.02880859375, + "rewards/margins": 6.65625, + "rewards/rejected": -6.625, + "step": 972 + }, + { + "epoch": 1.1938650306748466, + "grad_norm": 14.793273037242393, + "learning_rate": 3.041322314049586e-07, + "logits/chosen": -0.287109375, + "logits/rejected": -0.4375, + "logps/chosen": -408.0, + "logps/rejected": -392.0, + "loss": 0.0614, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.09375, + "rewards/margins": 8.0625, + "rewards/rejected": -6.96875, + "step": 973 + }, + { + "epoch": 1.1950920245398773, + "grad_norm": 11.725573965481992, + "learning_rate": 3.039256198347107e-07, + "logits/chosen": -0.357421875, + "logits/rejected": -0.55859375, + "logps/chosen": -394.0, + "logps/rejected": -374.0, + "loss": 0.0561, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.4453125, + "rewards/margins": 8.9375, + "rewards/rejected": -7.5, + "step": 974 + }, + { + "epoch": 1.196319018404908, + "grad_norm": 18.27579215015143, + "learning_rate": 3.0371900826446277e-07, + "logits/chosen": -0.1318359375, + "logits/rejected": -0.2578125, + "logps/chosen": -356.0, + "logps/rejected": -300.0, + "loss": 0.0748, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.578125, + "rewards/margins": 7.21875, + "rewards/rejected": -6.65625, + "step": 975 + }, + { + "epoch": 1.1975460122699386, + "grad_norm": 18.99533942238631, + "learning_rate": 3.0351239669421487e-07, + "logits/chosen": -0.3125, + "logits/rejected": -0.52734375, + "logps/chosen": -420.0, + "logps/rejected": -358.0, + "loss": 0.0909, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.1484375, + "rewards/margins": 7.34375, + "rewards/rejected": -6.21875, + "step": 976 + }, + { + "epoch": 1.1987730061349693, + "grad_norm": 17.188567163830015, + "learning_rate": 3.033057851239669e-07, + "logits/chosen": -0.20703125, + "logits/rejected": -0.412109375, + "logps/chosen": -384.0, + "logps/rejected": -340.0, + "loss": 0.0499, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.40625, + "rewards/margins": 8.6875, + "rewards/rejected": -7.25, + "step": 977 + }, + { + "epoch": 1.2, + "grad_norm": 20.333325189340393, + "learning_rate": 3.03099173553719e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.310546875, + "logps/chosen": -358.0, + "logps/rejected": -310.0, + "loss": 0.1076, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.44921875, + "rewards/margins": 7.125, + "rewards/rejected": -6.6875, + "step": 978 + }, + { + "epoch": 1.2012269938650306, + "grad_norm": 12.588392586420149, + "learning_rate": 3.0289256198347106e-07, + "logits/chosen": -0.1650390625, + "logits/rejected": -0.291015625, + "logps/chosen": -406.0, + "logps/rejected": -350.0, + "loss": 0.0609, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.09375, + "rewards/margins": 8.0, + "rewards/rejected": -6.90625, + "step": 979 + }, + { + "epoch": 1.2024539877300613, + "grad_norm": 11.087054978059909, + "learning_rate": 3.0268595041322316e-07, + "logits/chosen": -0.291015625, + "logits/rejected": -0.48046875, + "logps/chosen": -364.0, + "logps/rejected": -340.0, + "loss": 0.0543, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.421875, + "rewards/margins": 7.90625, + "rewards/rejected": -6.5, + "step": 980 + }, + { + "epoch": 1.203680981595092, + "grad_norm": 15.838665018936267, + "learning_rate": 3.024793388429752e-07, + "logits/chosen": -0.2333984375, + "logits/rejected": -0.3359375, + "logps/chosen": -384.0, + "logps/rejected": -348.0, + "loss": 0.0789, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.125, + "rewards/margins": 7.375, + "rewards/rejected": -6.25, + "step": 981 + }, + { + "epoch": 1.2049079754601226, + "grad_norm": 15.323699779119652, + "learning_rate": 3.0227272727272726e-07, + "logits/chosen": -0.2236328125, + "logits/rejected": -0.40625, + "logps/chosen": -404.0, + "logps/rejected": -372.0, + "loss": 0.0882, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.1875, + "rewards/margins": 7.625, + "rewards/rejected": -6.4375, + "step": 982 + }, + { + "epoch": 1.2061349693251533, + "grad_norm": 18.628005700971052, + "learning_rate": 3.020661157024793e-07, + "logits/chosen": -0.236328125, + "logits/rejected": -0.404296875, + "logps/chosen": -378.0, + "logps/rejected": -314.0, + "loss": 0.1039, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 1.1171875, + "rewards/margins": 6.84375, + "rewards/rejected": -5.71875, + "step": 983 + }, + { + "epoch": 1.207361963190184, + "grad_norm": 16.0212141460115, + "learning_rate": 3.018595041322314e-07, + "logits/chosen": -0.26171875, + "logits/rejected": -0.435546875, + "logps/chosen": -354.0, + "logps/rejected": -310.0, + "loss": 0.0906, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.1328125, + "rewards/margins": 7.4375, + "rewards/rejected": -6.3125, + "step": 984 + }, + { + "epoch": 1.2085889570552146, + "grad_norm": 15.849341321351776, + "learning_rate": 3.0165289256198345e-07, + "logits/chosen": -0.169921875, + "logits/rejected": -0.34765625, + "logps/chosen": -344.0, + "logps/rejected": -314.0, + "loss": 0.0852, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.34375, + "rewards/margins": 7.28125, + "rewards/rejected": -5.9375, + "step": 985 + }, + { + "epoch": 1.2098159509202455, + "grad_norm": 14.41239950819617, + "learning_rate": 3.014462809917355e-07, + "logits/chosen": -0.08154296875, + "logits/rejected": -0.2255859375, + "logps/chosen": -386.0, + "logps/rejected": -322.0, + "loss": 0.0659, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 1.53125, + "rewards/margins": 7.0, + "rewards/rejected": -5.46875, + "step": 986 + }, + { + "epoch": 1.2110429447852762, + "grad_norm": 15.43728903633136, + "learning_rate": 3.012396694214876e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.494140625, + "logps/chosen": -452.0, + "logps/rejected": -368.0, + "loss": 0.0746, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.859375, + "rewards/margins": 7.96875, + "rewards/rejected": -6.125, + "step": 987 + }, + { + "epoch": 1.2122699386503069, + "grad_norm": 11.91513035885166, + "learning_rate": 3.0103305785123965e-07, + "logits/chosen": -0.18359375, + "logits/rejected": -0.38671875, + "logps/chosen": -364.0, + "logps/rejected": -306.0, + "loss": 0.0544, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.03125, + "rewards/margins": 7.1875, + "rewards/rejected": -6.1875, + "step": 988 + }, + { + "epoch": 1.2134969325153375, + "grad_norm": 16.47608455115928, + "learning_rate": 3.0082644628099175e-07, + "logits/chosen": -0.1328125, + "logits/rejected": -0.30078125, + "logps/chosen": -344.0, + "logps/rejected": -300.0, + "loss": 0.0957, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.87890625, + "rewards/margins": 6.40625, + "rewards/rejected": -5.53125, + "step": 989 + }, + { + "epoch": 1.2147239263803682, + "grad_norm": 17.548383088711475, + "learning_rate": 3.006198347107438e-07, + "logits/chosen": -0.2470703125, + "logits/rejected": -0.435546875, + "logps/chosen": -394.0, + "logps/rejected": -352.0, + "loss": 0.0897, + "rewards/accuracies": 0.953125, + "rewards/chosen": 1.3828125, + "rewards/margins": 7.90625, + "rewards/rejected": -6.5, + "step": 990 + }, + { + "epoch": 1.2159509202453989, + "grad_norm": 10.878093708569429, + "learning_rate": 3.0041322314049584e-07, + "logits/chosen": -0.2138671875, + "logits/rejected": -0.337890625, + "logps/chosen": -404.0, + "logps/rejected": -366.0, + "loss": 0.0541, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.86328125, + "rewards/margins": 7.75, + "rewards/rejected": -6.90625, + "step": 991 + }, + { + "epoch": 1.2171779141104295, + "grad_norm": 15.553111442326719, + "learning_rate": 3.002066115702479e-07, + "logits/chosen": -0.2158203125, + "logits/rejected": -0.412109375, + "logps/chosen": -378.0, + "logps/rejected": -350.0, + "loss": 0.0746, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.171875, + "rewards/margins": 7.65625, + "rewards/rejected": -6.5, + "step": 992 + }, + { + "epoch": 1.2184049079754602, + "grad_norm": 16.507163595298366, + "learning_rate": 3e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.4375, + "logps/chosen": -372.0, + "logps/rejected": -336.0, + "loss": 0.0836, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.2734375, + "rewards/margins": 7.25, + "rewards/rejected": -5.96875, + "step": 993 + }, + { + "epoch": 1.2196319018404909, + "grad_norm": 14.14520585310296, + "learning_rate": 2.9979338842975203e-07, + "logits/chosen": -0.283203125, + "logits/rejected": -0.45703125, + "logps/chosen": -418.0, + "logps/rejected": -366.0, + "loss": 0.0733, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.34375, + "rewards/margins": 7.875, + "rewards/rejected": -6.53125, + "step": 994 + }, + { + "epoch": 1.2208588957055215, + "grad_norm": 11.329513670197326, + "learning_rate": 2.9958677685950413e-07, + "logits/chosen": -0.22265625, + "logits/rejected": -0.3671875, + "logps/chosen": -350.0, + "logps/rejected": -358.0, + "loss": 0.057, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.703125, + "rewards/margins": 7.53125, + "rewards/rejected": -6.8125, + "step": 995 + }, + { + "epoch": 1.2220858895705522, + "grad_norm": 24.827809747858634, + "learning_rate": 2.993801652892562e-07, + "logits/chosen": -0.1748046875, + "logits/rejected": -0.41796875, + "logps/chosen": -380.0, + "logps/rejected": -336.0, + "loss": 0.0874, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.59765625, + "rewards/margins": 7.21875, + "rewards/rejected": -6.625, + "step": 996 + }, + { + "epoch": 1.2233128834355829, + "grad_norm": 14.593045071356238, + "learning_rate": 2.991735537190083e-07, + "logits/chosen": -0.296875, + "logits/rejected": -0.486328125, + "logps/chosen": -416.0, + "logps/rejected": -340.0, + "loss": 0.0699, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.5625, + "rewards/margins": 7.78125, + "rewards/rejected": -6.21875, + "step": 997 + }, + { + "epoch": 1.2245398773006135, + "grad_norm": 16.30291368696963, + "learning_rate": 2.9896694214876033e-07, + "logits/chosen": -0.173828125, + "logits/rejected": -0.369140625, + "logps/chosen": -442.0, + "logps/rejected": -376.0, + "loss": 0.0743, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.484375, + "rewards/margins": 7.84375, + "rewards/rejected": -6.34375, + "step": 998 + }, + { + "epoch": 1.2257668711656442, + "grad_norm": 15.361659398242933, + "learning_rate": 2.9876033057851243e-07, + "logits/chosen": -0.21875, + "logits/rejected": -0.39453125, + "logps/chosen": -406.0, + "logps/rejected": -352.0, + "loss": 0.0661, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.65625, + "rewards/margins": 8.1875, + "rewards/rejected": -6.5625, + "step": 999 + }, + { + "epoch": 1.2269938650306749, + "grad_norm": 16.28161869676532, + "learning_rate": 2.985537190082644e-07, + "logits/chosen": -0.1845703125, + "logits/rejected": -0.27734375, + "logps/chosen": -382.0, + "logps/rejected": -350.0, + "loss": 0.0969, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 1.4453125, + "rewards/margins": 7.65625, + "rewards/rejected": -6.21875, + "step": 1000 + }, + { + "epoch": 1.2282208588957055, + "grad_norm": 11.272885655368697, + "learning_rate": 2.983471074380165e-07, + "logits/chosen": -0.3203125, + "logits/rejected": -0.4921875, + "logps/chosen": -408.0, + "logps/rejected": -342.0, + "loss": 0.0532, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.7265625, + "rewards/margins": 8.4375, + "rewards/rejected": -6.71875, + "step": 1001 + }, + { + "epoch": 1.2294478527607362, + "grad_norm": 24.087030362689006, + "learning_rate": 2.9814049586776857e-07, + "logits/chosen": -0.2255859375, + "logits/rejected": -0.30078125, + "logps/chosen": -372.0, + "logps/rejected": -374.0, + "loss": 0.0978, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.359375, + "rewards/margins": 7.71875, + "rewards/rejected": -6.375, + "step": 1002 + }, + { + "epoch": 1.2306748466257669, + "grad_norm": 15.714476341620568, + "learning_rate": 2.9793388429752067e-07, + "logits/chosen": -0.30859375, + "logits/rejected": -0.443359375, + "logps/chosen": -358.0, + "logps/rejected": -344.0, + "loss": 0.0853, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.91796875, + "rewards/margins": 7.8125, + "rewards/rejected": -6.875, + "step": 1003 + }, + { + "epoch": 1.2319018404907975, + "grad_norm": 11.843728821798939, + "learning_rate": 2.977272727272727e-07, + "logits/chosen": -0.2060546875, + "logits/rejected": -0.41796875, + "logps/chosen": -354.0, + "logps/rejected": -296.0, + "loss": 0.0703, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.1171875, + "rewards/margins": 7.28125, + "rewards/rejected": -6.15625, + "step": 1004 + }, + { + "epoch": 1.2331288343558282, + "grad_norm": 16.50686909285978, + "learning_rate": 2.9752066115702476e-07, + "logits/chosen": -0.212890625, + "logits/rejected": -0.3984375, + "logps/chosen": -392.0, + "logps/rejected": -328.0, + "loss": 0.0931, + "rewards/accuracies": 0.953125, + "rewards/chosen": 0.83203125, + "rewards/margins": 7.875, + "rewards/rejected": -7.03125, + "step": 1005 + }, + { + "epoch": 1.2343558282208589, + "grad_norm": 13.635220091003717, + "learning_rate": 2.9731404958677686e-07, + "logits/chosen": -0.25390625, + "logits/rejected": -0.439453125, + "logps/chosen": -364.0, + "logps/rejected": -326.0, + "loss": 0.0783, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 1.0703125, + "rewards/margins": 8.125, + "rewards/rejected": -7.0625, + "step": 1006 + }, + { + "epoch": 1.2355828220858895, + "grad_norm": 15.23141865260738, + "learning_rate": 2.971074380165289e-07, + "logits/chosen": -0.2197265625, + "logits/rejected": -0.392578125, + "logps/chosen": -400.0, + "logps/rejected": -372.0, + "loss": 0.0781, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.2265625, + "rewards/margins": 8.25, + "rewards/rejected": -7.03125, + "step": 1007 + }, + { + "epoch": 1.2368098159509202, + "grad_norm": 16.281149113022543, + "learning_rate": 2.96900826446281e-07, + "logits/chosen": -0.2412109375, + "logits/rejected": -0.36328125, + "logps/chosen": -352.0, + "logps/rejected": -326.0, + "loss": 0.0751, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.66015625, + "rewards/margins": 7.6875, + "rewards/rejected": -7.0, + "step": 1008 + }, + { + "epoch": 1.2380368098159509, + "grad_norm": 15.753570194975307, + "learning_rate": 2.96694214876033e-07, + "logits/chosen": -0.169921875, + "logits/rejected": -0.37109375, + "logps/chosen": -430.0, + "logps/rejected": -348.0, + "loss": 0.0887, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.0546875, + "rewards/margins": 7.59375, + "rewards/rejected": -6.53125, + "step": 1009 + }, + { + "epoch": 1.2392638036809815, + "grad_norm": 15.81206887261548, + "learning_rate": 2.964876033057851e-07, + "logits/chosen": -0.2109375, + "logits/rejected": -0.302734375, + "logps/chosen": -354.0, + "logps/rejected": -340.0, + "loss": 0.0932, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.06201171875, + "rewards/margins": 6.78125, + "rewards/rejected": -6.71875, + "step": 1010 + }, + { + "epoch": 1.2404907975460122, + "grad_norm": 20.589574722596257, + "learning_rate": 2.9628099173553715e-07, + "logits/chosen": -0.2158203125, + "logits/rejected": -0.40234375, + "logps/chosen": -412.0, + "logps/rejected": -358.0, + "loss": 0.0922, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.44140625, + "rewards/margins": 7.40625, + "rewards/rejected": -6.96875, + "step": 1011 + }, + { + "epoch": 1.2417177914110429, + "grad_norm": 20.579275332459357, + "learning_rate": 2.9607438016528925e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.421875, + "logps/chosen": -380.0, + "logps/rejected": -342.0, + "loss": 0.1254, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.78125, + "rewards/margins": 7.5625, + "rewards/rejected": -6.78125, + "step": 1012 + }, + { + "epoch": 1.2429447852760735, + "grad_norm": 11.670737212320592, + "learning_rate": 2.958677685950413e-07, + "logits/chosen": -0.171875, + "logits/rejected": -0.259765625, + "logps/chosen": -392.0, + "logps/rejected": -350.0, + "loss": 0.0766, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.455078125, + "rewards/margins": 6.8125, + "rewards/rejected": -6.375, + "step": 1013 + }, + { + "epoch": 1.2441717791411042, + "grad_norm": 17.81434648694424, + "learning_rate": 2.956611570247934e-07, + "logits/chosen": -0.24609375, + "logits/rejected": -0.392578125, + "logps/chosen": -382.0, + "logps/rejected": -374.0, + "loss": 0.0879, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.404296875, + "rewards/margins": 7.1875, + "rewards/rejected": -6.78125, + "step": 1014 + }, + { + "epoch": 1.2453987730061349, + "grad_norm": 13.56788247411275, + "learning_rate": 2.9545454545454545e-07, + "logits/chosen": -0.2177734375, + "logits/rejected": -0.33984375, + "logps/chosen": -370.0, + "logps/rejected": -352.0, + "loss": 0.0637, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.078125, + "rewards/margins": 7.84375, + "rewards/rejected": -6.75, + "step": 1015 + }, + { + "epoch": 1.2466257668711656, + "grad_norm": 23.609417138690965, + "learning_rate": 2.9524793388429755e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.3515625, + "logps/chosen": -356.0, + "logps/rejected": -314.0, + "loss": 0.1339, + "rewards/accuracies": 0.953125, + "rewards/chosen": 0.54296875, + "rewards/margins": 6.65625, + "rewards/rejected": -6.125, + "step": 1016 + }, + { + "epoch": 1.2478527607361962, + "grad_norm": 11.819528640210681, + "learning_rate": 2.950413223140496e-07, + "logits/chosen": -0.244140625, + "logits/rejected": -0.470703125, + "logps/chosen": -402.0, + "logps/rejected": -322.0, + "loss": 0.0525, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.4453125, + "rewards/margins": 8.0625, + "rewards/rejected": -6.65625, + "step": 1017 + }, + { + "epoch": 1.2490797546012269, + "grad_norm": 21.70323477701805, + "learning_rate": 2.9483471074380164e-07, + "logits/chosen": -0.267578125, + "logits/rejected": -0.36328125, + "logps/chosen": -402.0, + "logps/rejected": -378.0, + "loss": 0.0962, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.490234375, + "rewards/margins": 7.90625, + "rewards/rejected": -7.40625, + "step": 1018 + }, + { + "epoch": 1.2503067484662576, + "grad_norm": 14.000442974449523, + "learning_rate": 2.946280991735537e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.447265625, + "logps/chosen": -370.0, + "logps/rejected": -338.0, + "loss": 0.0847, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.890625, + "rewards/margins": 7.78125, + "rewards/rejected": -6.90625, + "step": 1019 + }, + { + "epoch": 1.2515337423312882, + "grad_norm": 13.06879888610367, + "learning_rate": 2.944214876033058e-07, + "logits/chosen": -0.2373046875, + "logits/rejected": -0.36328125, + "logps/chosen": -410.0, + "logps/rejected": -362.0, + "loss": 0.0748, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.7578125, + "rewards/margins": 8.0625, + "rewards/rejected": -7.3125, + "step": 1020 + }, + { + "epoch": 1.252760736196319, + "grad_norm": 18.899127346492538, + "learning_rate": 2.9421487603305783e-07, + "logits/chosen": -0.216796875, + "logits/rejected": -0.310546875, + "logps/chosen": -368.0, + "logps/rejected": -332.0, + "loss": 0.0868, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.40625, + "rewards/margins": 6.96875, + "rewards/rejected": -6.5625, + "step": 1021 + }, + { + "epoch": 1.2539877300613496, + "grad_norm": 14.162372172323648, + "learning_rate": 2.940082644628099e-07, + "logits/chosen": -0.2890625, + "logits/rejected": -0.4296875, + "logps/chosen": -412.0, + "logps/rejected": -356.0, + "loss": 0.0788, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.046875, + "rewards/margins": 7.875, + "rewards/rejected": -6.84375, + "step": 1022 + }, + { + "epoch": 1.2552147239263804, + "grad_norm": 12.264199783376707, + "learning_rate": 2.93801652892562e-07, + "logits/chosen": -0.251953125, + "logits/rejected": -0.43359375, + "logps/chosen": -396.0, + "logps/rejected": -354.0, + "loss": 0.0625, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.5390625, + "rewards/margins": 8.0, + "rewards/rejected": -6.46875, + "step": 1023 + }, + { + "epoch": 1.2564417177914111, + "grad_norm": 18.04676940622606, + "learning_rate": 2.9359504132231403e-07, + "logits/chosen": -0.1650390625, + "logits/rejected": -0.40625, + "logps/chosen": -406.0, + "logps/rejected": -374.0, + "loss": 0.0856, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.875, + "rewards/margins": 7.875, + "rewards/rejected": -7.0, + "step": 1024 + }, + { + "epoch": 1.2576687116564418, + "grad_norm": 14.70688811959489, + "learning_rate": 2.9338842975206613e-07, + "logits/chosen": -0.150390625, + "logits/rejected": -0.3359375, + "logps/chosen": -408.0, + "logps/rejected": -378.0, + "loss": 0.0832, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.625, + "rewards/margins": 7.9375, + "rewards/rejected": -6.3125, + "step": 1025 + }, + { + "epoch": 1.2588957055214725, + "grad_norm": 14.428819823253946, + "learning_rate": 2.931818181818181e-07, + "logits/chosen": -0.244140625, + "logits/rejected": -0.41796875, + "logps/chosen": -364.0, + "logps/rejected": -336.0, + "loss": 0.086, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.82421875, + "rewards/margins": 7.375, + "rewards/rejected": -6.53125, + "step": 1026 + }, + { + "epoch": 1.2601226993865031, + "grad_norm": 12.462935950586663, + "learning_rate": 2.929752066115702e-07, + "logits/chosen": -0.283203125, + "logits/rejected": -0.51171875, + "logps/chosen": -442.0, + "logps/rejected": -372.0, + "loss": 0.0543, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.1171875, + "rewards/margins": 7.90625, + "rewards/rejected": -6.78125, + "step": 1027 + }, + { + "epoch": 1.2613496932515338, + "grad_norm": 15.687199038767078, + "learning_rate": 2.9276859504132227e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.427734375, + "logps/chosen": -392.0, + "logps/rejected": -356.0, + "loss": 0.0712, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.6328125, + "rewards/margins": 8.6875, + "rewards/rejected": -7.0625, + "step": 1028 + }, + { + "epoch": 1.2625766871165645, + "grad_norm": 18.1445169567953, + "learning_rate": 2.9256198347107437e-07, + "logits/chosen": -0.248046875, + "logits/rejected": -0.431640625, + "logps/chosen": -386.0, + "logps/rejected": -348.0, + "loss": 0.0796, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.8515625, + "rewards/margins": 7.25, + "rewards/rejected": -6.40625, + "step": 1029 + }, + { + "epoch": 1.2638036809815951, + "grad_norm": 16.65068905231203, + "learning_rate": 2.923553719008264e-07, + "logits/chosen": -0.39453125, + "logits/rejected": -0.494140625, + "logps/chosen": -410.0, + "logps/rejected": -370.0, + "loss": 0.0836, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.546875, + "rewards/margins": 8.5, + "rewards/rejected": -6.96875, + "step": 1030 + }, + { + "epoch": 1.2650306748466258, + "grad_norm": 14.392097497709575, + "learning_rate": 2.921487603305785e-07, + "logits/chosen": -0.18359375, + "logits/rejected": -0.41796875, + "logps/chosen": -378.0, + "logps/rejected": -328.0, + "loss": 0.0776, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.9921875, + "rewards/margins": 7.625, + "rewards/rejected": -6.65625, + "step": 1031 + }, + { + "epoch": 1.2662576687116565, + "grad_norm": 11.559260515235467, + "learning_rate": 2.9194214876033056e-07, + "logits/chosen": -0.10009765625, + "logits/rejected": -0.296875, + "logps/chosen": -372.0, + "logps/rejected": -326.0, + "loss": 0.058, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.0625, + "rewards/margins": 7.75, + "rewards/rejected": -6.6875, + "step": 1032 + }, + { + "epoch": 1.2674846625766871, + "grad_norm": 15.990921003538096, + "learning_rate": 2.9173553719008266e-07, + "logits/chosen": -0.2490234375, + "logits/rejected": -0.458984375, + "logps/chosen": -428.0, + "logps/rejected": -356.0, + "loss": 0.0875, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.92578125, + "rewards/margins": 7.3125, + "rewards/rejected": -6.40625, + "step": 1033 + }, + { + "epoch": 1.2687116564417178, + "grad_norm": 8.99616397744727, + "learning_rate": 2.915289256198347e-07, + "logits/chosen": -0.26953125, + "logits/rejected": -0.484375, + "logps/chosen": -460.0, + "logps/rejected": -380.0, + "loss": 0.0426, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.703125, + "rewards/margins": 8.6875, + "rewards/rejected": -6.96875, + "step": 1034 + }, + { + "epoch": 1.2699386503067485, + "grad_norm": 14.825092230707533, + "learning_rate": 2.9132231404958676e-07, + "logits/chosen": -0.193359375, + "logits/rejected": -0.390625, + "logps/chosen": -406.0, + "logps/rejected": -352.0, + "loss": 0.0685, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.9921875, + "rewards/margins": 7.84375, + "rewards/rejected": -6.84375, + "step": 1035 + }, + { + "epoch": 1.2711656441717791, + "grad_norm": 15.303748653633287, + "learning_rate": 2.911157024793388e-07, + "logits/chosen": -0.1806640625, + "logits/rejected": -0.322265625, + "logps/chosen": -374.0, + "logps/rejected": -332.0, + "loss": 0.0729, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.6640625, + "rewards/margins": 7.71875, + "rewards/rejected": -6.0625, + "step": 1036 + }, + { + "epoch": 1.2723926380368098, + "grad_norm": 15.346976284336828, + "learning_rate": 2.909090909090909e-07, + "logits/chosen": -0.36328125, + "logits/rejected": -0.51171875, + "logps/chosen": -412.0, + "logps/rejected": -392.0, + "loss": 0.0698, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.4296875, + "rewards/margins": 7.875, + "rewards/rejected": -6.4375, + "step": 1037 + }, + { + "epoch": 1.2736196319018405, + "grad_norm": 15.840412570196161, + "learning_rate": 2.9070247933884295e-07, + "logits/chosen": -0.2236328125, + "logits/rejected": -0.384765625, + "logps/chosen": -374.0, + "logps/rejected": -350.0, + "loss": 0.067, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.34375, + "rewards/margins": 8.3125, + "rewards/rejected": -6.96875, + "step": 1038 + }, + { + "epoch": 1.2748466257668711, + "grad_norm": 18.036593049006218, + "learning_rate": 2.9049586776859505e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.365234375, + "logps/chosen": -376.0, + "logps/rejected": -370.0, + "loss": 0.0993, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.83203125, + "rewards/margins": 6.8125, + "rewards/rejected": -6.0, + "step": 1039 + }, + { + "epoch": 1.2760736196319018, + "grad_norm": 17.503898447096805, + "learning_rate": 2.902892561983471e-07, + "logits/chosen": -0.27734375, + "logits/rejected": -0.546875, + "logps/chosen": -418.0, + "logps/rejected": -324.0, + "loss": 0.0785, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.4921875, + "rewards/margins": 8.3125, + "rewards/rejected": -6.84375, + "step": 1040 + }, + { + "epoch": 1.2773006134969325, + "grad_norm": 12.167883143637123, + "learning_rate": 2.9008264462809915e-07, + "logits/chosen": -0.2333984375, + "logits/rejected": -0.369140625, + "logps/chosen": -374.0, + "logps/rejected": -330.0, + "loss": 0.0591, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.98828125, + "rewards/margins": 7.375, + "rewards/rejected": -6.375, + "step": 1041 + }, + { + "epoch": 1.2785276073619631, + "grad_norm": 15.75805722285459, + "learning_rate": 2.8987603305785125e-07, + "logits/chosen": -0.37109375, + "logits/rejected": -0.57421875, + "logps/chosen": -444.0, + "logps/rejected": -382.0, + "loss": 0.0708, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.484375, + "rewards/margins": 8.4375, + "rewards/rejected": -6.9375, + "step": 1042 + }, + { + "epoch": 1.2797546012269938, + "grad_norm": 20.340466573407646, + "learning_rate": 2.896694214876033e-07, + "logits/chosen": -0.208984375, + "logits/rejected": -0.380859375, + "logps/chosen": -372.0, + "logps/rejected": -338.0, + "loss": 0.1084, + "rewards/accuracies": 0.953125, + "rewards/chosen": 0.208984375, + "rewards/margins": 6.34375, + "rewards/rejected": -6.125, + "step": 1043 + }, + { + "epoch": 1.2809815950920245, + "grad_norm": 12.178117329974464, + "learning_rate": 2.8946280991735534e-07, + "logits/chosen": -0.287109375, + "logits/rejected": -0.494140625, + "logps/chosen": -424.0, + "logps/rejected": -356.0, + "loss": 0.0493, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 2.0, + "rewards/margins": 8.4375, + "rewards/rejected": -6.4375, + "step": 1044 + }, + { + "epoch": 1.2822085889570551, + "grad_norm": 13.08366669608441, + "learning_rate": 2.892561983471074e-07, + "logits/chosen": -0.32421875, + "logits/rejected": -0.59375, + "logps/chosen": -420.0, + "logps/rejected": -328.0, + "loss": 0.0543, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.6953125, + "rewards/margins": 7.96875, + "rewards/rejected": -6.28125, + "step": 1045 + }, + { + "epoch": 1.2834355828220858, + "grad_norm": 19.29936465122853, + "learning_rate": 2.890495867768595e-07, + "logits/chosen": -0.115234375, + "logits/rejected": -0.27734375, + "logps/chosen": -386.0, + "logps/rejected": -356.0, + "loss": 0.1057, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 1.0, + "rewards/margins": 6.75, + "rewards/rejected": -5.75, + "step": 1046 + }, + { + "epoch": 1.2846625766871167, + "grad_norm": 16.015818931768813, + "learning_rate": 2.8884297520661154e-07, + "logits/chosen": -0.265625, + "logits/rejected": -0.4140625, + "logps/chosen": -394.0, + "logps/rejected": -352.0, + "loss": 0.0711, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.5859375, + "rewards/margins": 7.90625, + "rewards/rejected": -6.34375, + "step": 1047 + }, + { + "epoch": 1.2858895705521474, + "grad_norm": 12.611193036980284, + "learning_rate": 2.8863636363636364e-07, + "logits/chosen": -0.1533203125, + "logits/rejected": -0.330078125, + "logps/chosen": -330.0, + "logps/rejected": -304.0, + "loss": 0.0705, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.2578125, + "rewards/margins": 7.6875, + "rewards/rejected": -6.4375, + "step": 1048 + }, + { + "epoch": 1.287116564417178, + "grad_norm": 14.385515976740427, + "learning_rate": 2.884297520661157e-07, + "logits/chosen": -0.18359375, + "logits/rejected": -0.3984375, + "logps/chosen": -362.0, + "logps/rejected": -328.0, + "loss": 0.0691, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.91015625, + "rewards/margins": 7.21875, + "rewards/rejected": -6.28125, + "step": 1049 + }, + { + "epoch": 1.2883435582822087, + "grad_norm": 16.631519568519366, + "learning_rate": 2.882231404958678e-07, + "logits/chosen": -0.30859375, + "logits/rejected": -0.455078125, + "logps/chosen": -386.0, + "logps/rejected": -356.0, + "loss": 0.0921, + "rewards/accuracies": 0.953125, + "rewards/chosen": 0.96875, + "rewards/margins": 7.15625, + "rewards/rejected": -6.1875, + "step": 1050 + }, + { + "epoch": 1.2895705521472394, + "grad_norm": 15.4144123662566, + "learning_rate": 2.8801652892561983e-07, + "logits/chosen": -0.333984375, + "logits/rejected": -0.51953125, + "logps/chosen": -410.0, + "logps/rejected": -370.0, + "loss": 0.0648, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.75, + "rewards/margins": 8.375, + "rewards/rejected": -6.65625, + "step": 1051 + }, + { + "epoch": 1.29079754601227, + "grad_norm": 21.601063366385812, + "learning_rate": 2.8780991735537193e-07, + "logits/chosen": -0.2119140625, + "logits/rejected": -0.408203125, + "logps/chosen": -418.0, + "logps/rejected": -366.0, + "loss": 0.1128, + "rewards/accuracies": 0.9375, + "rewards/chosen": 1.1875, + "rewards/margins": 7.15625, + "rewards/rejected": -5.96875, + "step": 1052 + }, + { + "epoch": 1.2920245398773007, + "grad_norm": 18.628967903000756, + "learning_rate": 2.876033057851239e-07, + "logits/chosen": -0.158203125, + "logits/rejected": -0.369140625, + "logps/chosen": -354.0, + "logps/rejected": -318.0, + "loss": 0.0996, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 1.40625, + "rewards/margins": 7.625, + "rewards/rejected": -6.21875, + "step": 1053 + }, + { + "epoch": 1.2932515337423314, + "grad_norm": 11.62592979316013, + "learning_rate": 2.87396694214876e-07, + "logits/chosen": -0.197265625, + "logits/rejected": -0.40625, + "logps/chosen": -392.0, + "logps/rejected": -342.0, + "loss": 0.0605, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.3125, + "rewards/margins": 7.6875, + "rewards/rejected": -6.375, + "step": 1054 + }, + { + "epoch": 1.294478527607362, + "grad_norm": 16.65808895304812, + "learning_rate": 2.8719008264462807e-07, + "logits/chosen": -0.185546875, + "logits/rejected": -0.3828125, + "logps/chosen": -376.0, + "logps/rejected": -336.0, + "loss": 0.0868, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.9765625, + "rewards/margins": 7.65625, + "rewards/rejected": -6.6875, + "step": 1055 + }, + { + "epoch": 1.2957055214723927, + "grad_norm": 8.318848313861306, + "learning_rate": 2.8698347107438017e-07, + "logits/chosen": -0.2412109375, + "logits/rejected": -0.412109375, + "logps/chosen": -360.0, + "logps/rejected": -302.0, + "loss": 0.0404, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.91796875, + "rewards/margins": 7.46875, + "rewards/rejected": -6.5625, + "step": 1056 + }, + { + "epoch": 1.2969325153374234, + "grad_norm": 20.372483964393826, + "learning_rate": 2.867768595041322e-07, + "logits/chosen": -0.212890625, + "logits/rejected": -0.37109375, + "logps/chosen": -394.0, + "logps/rejected": -346.0, + "loss": 0.0739, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.2890625, + "rewards/margins": 7.75, + "rewards/rejected": -6.46875, + "step": 1057 + }, + { + "epoch": 1.298159509202454, + "grad_norm": 22.76896229782817, + "learning_rate": 2.8657024793388427e-07, + "logits/chosen": -0.2119140625, + "logits/rejected": -0.44140625, + "logps/chosen": -380.0, + "logps/rejected": -340.0, + "loss": 0.1133, + "rewards/accuracies": 0.953125, + "rewards/chosen": 1.6796875, + "rewards/margins": 8.4375, + "rewards/rejected": -6.75, + "step": 1058 + }, + { + "epoch": 1.2993865030674847, + "grad_norm": 23.092465525495328, + "learning_rate": 2.8636363636363637e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.4609375, + "logps/chosen": -402.0, + "logps/rejected": -336.0, + "loss": 0.0802, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.0, + "rewards/margins": 7.84375, + "rewards/rejected": -6.84375, + "step": 1059 + }, + { + "epoch": 1.3006134969325154, + "grad_norm": 18.50595727262762, + "learning_rate": 2.861570247933884e-07, + "logits/chosen": -0.25390625, + "logits/rejected": -0.341796875, + "logps/chosen": -332.0, + "logps/rejected": -310.0, + "loss": 0.0911, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.0234375, + "rewards/margins": 7.8125, + "rewards/rejected": -6.78125, + "step": 1060 + }, + { + "epoch": 1.301840490797546, + "grad_norm": 15.212444109293378, + "learning_rate": 2.859504132231405e-07, + "logits/chosen": -0.181640625, + "logits/rejected": -0.29296875, + "logps/chosen": -336.0, + "logps/rejected": -328.0, + "loss": 0.0736, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.70703125, + "rewards/margins": 7.0625, + "rewards/rejected": -6.34375, + "step": 1061 + }, + { + "epoch": 1.3030674846625767, + "grad_norm": 19.43583503636694, + "learning_rate": 2.857438016528925e-07, + "logits/chosen": -0.2119140625, + "logits/rejected": -0.36328125, + "logps/chosen": -416.0, + "logps/rejected": -372.0, + "loss": 0.1117, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 1.0625, + "rewards/margins": 7.25, + "rewards/rejected": -6.1875, + "step": 1062 + }, + { + "epoch": 1.3042944785276074, + "grad_norm": 12.816250342771644, + "learning_rate": 2.855371900826446e-07, + "logits/chosen": -0.26171875, + "logits/rejected": -0.404296875, + "logps/chosen": -360.0, + "logps/rejected": -324.0, + "loss": 0.0701, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.69921875, + "rewards/margins": 7.5625, + "rewards/rejected": -6.84375, + "step": 1063 + }, + { + "epoch": 1.305521472392638, + "grad_norm": 14.796412099773818, + "learning_rate": 2.8533057851239665e-07, + "logits/chosen": -0.2412109375, + "logits/rejected": -0.40234375, + "logps/chosen": -378.0, + "logps/rejected": -350.0, + "loss": 0.0798, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.91015625, + "rewards/margins": 8.125, + "rewards/rejected": -7.21875, + "step": 1064 + }, + { + "epoch": 1.3067484662576687, + "grad_norm": 14.143994241356145, + "learning_rate": 2.8512396694214875e-07, + "logits/chosen": -0.2041015625, + "logits/rejected": -0.5078125, + "logps/chosen": -444.0, + "logps/rejected": -360.0, + "loss": 0.0782, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.6796875, + "rewards/margins": 8.875, + "rewards/rejected": -7.21875, + "step": 1065 + }, + { + "epoch": 1.3079754601226994, + "grad_norm": 15.85506994990649, + "learning_rate": 2.849173553719008e-07, + "logits/chosen": -0.2392578125, + "logits/rejected": -0.5234375, + "logps/chosen": -454.0, + "logps/rejected": -386.0, + "loss": 0.0781, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.3125, + "rewards/margins": 8.0625, + "rewards/rejected": -6.75, + "step": 1066 + }, + { + "epoch": 1.30920245398773, + "grad_norm": 13.62123954847692, + "learning_rate": 2.847107438016529e-07, + "logits/chosen": -0.26171875, + "logits/rejected": -0.392578125, + "logps/chosen": -368.0, + "logps/rejected": -350.0, + "loss": 0.086, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.49609375, + "rewards/margins": 7.03125, + "rewards/rejected": -6.53125, + "step": 1067 + }, + { + "epoch": 1.3104294478527607, + "grad_norm": 16.720057778390732, + "learning_rate": 2.8450413223140495e-07, + "logits/chosen": -0.265625, + "logits/rejected": -0.42578125, + "logps/chosen": -380.0, + "logps/rejected": -328.0, + "loss": 0.0893, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.09375, + "rewards/margins": 8.25, + "rewards/rejected": -7.15625, + "step": 1068 + }, + { + "epoch": 1.3116564417177914, + "grad_norm": 17.159411502835123, + "learning_rate": 2.8429752066115705e-07, + "logits/chosen": -0.19140625, + "logits/rejected": -0.421875, + "logps/chosen": -398.0, + "logps/rejected": -362.0, + "loss": 0.1008, + "rewards/accuracies": 0.9453125, + "rewards/chosen": 1.296875, + "rewards/margins": 7.625, + "rewards/rejected": -6.3125, + "step": 1069 + }, + { + "epoch": 1.312883435582822, + "grad_norm": 17.45779899604935, + "learning_rate": 2.840909090909091e-07, + "logits/chosen": -0.283203125, + "logits/rejected": -0.37109375, + "logps/chosen": -382.0, + "logps/rejected": -364.0, + "loss": 0.0766, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.34375, + "rewards/margins": 8.375, + "rewards/rejected": -7.0625, + "step": 1070 + }, + { + "epoch": 1.3141104294478527, + "grad_norm": 15.676397684653205, + "learning_rate": 2.8388429752066114e-07, + "logits/chosen": -0.3046875, + "logits/rejected": -0.498046875, + "logps/chosen": -386.0, + "logps/rejected": -352.0, + "loss": 0.0656, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.0703125, + "rewards/margins": 8.1875, + "rewards/rejected": -7.09375, + "step": 1071 + }, + { + "epoch": 1.3153374233128834, + "grad_norm": 12.108483614150211, + "learning_rate": 2.836776859504132e-07, + "logits/chosen": -0.1396484375, + "logits/rejected": -0.330078125, + "logps/chosen": -404.0, + "logps/rejected": -358.0, + "loss": 0.0589, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.078125, + "rewards/margins": 7.65625, + "rewards/rejected": -6.5625, + "step": 1072 + }, + { + "epoch": 1.316564417177914, + "grad_norm": 17.663822788808194, + "learning_rate": 2.834710743801653e-07, + "logits/chosen": -0.30859375, + "logits/rejected": -0.416015625, + "logps/chosen": -326.0, + "logps/rejected": -338.0, + "loss": 0.0994, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.39453125, + "rewards/margins": 7.1875, + "rewards/rejected": -6.78125, + "step": 1073 + }, + { + "epoch": 1.3177914110429447, + "grad_norm": 12.23423129536633, + "learning_rate": 2.8326446280991734e-07, + "logits/chosen": -0.302734375, + "logits/rejected": -0.427734375, + "logps/chosen": -384.0, + "logps/rejected": -348.0, + "loss": 0.0617, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.9609375, + "rewards/margins": 8.1875, + "rewards/rejected": -7.1875, + "step": 1074 + }, + { + "epoch": 1.3190184049079754, + "grad_norm": 16.0651907118645, + "learning_rate": 2.830578512396694e-07, + "logits/chosen": -0.1806640625, + "logits/rejected": -0.337890625, + "logps/chosen": -390.0, + "logps/rejected": -354.0, + "loss": 0.0828, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.99609375, + "rewards/margins": 7.71875, + "rewards/rejected": -6.71875, + "step": 1075 + }, + { + "epoch": 1.320245398773006, + "grad_norm": 16.986198964127013, + "learning_rate": 2.828512396694215e-07, + "logits/chosen": -0.1552734375, + "logits/rejected": -0.271484375, + "logps/chosen": -394.0, + "logps/rejected": -356.0, + "loss": 0.0931, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.90234375, + "rewards/margins": 7.90625, + "rewards/rejected": -7.0, + "step": 1076 + }, + { + "epoch": 1.3214723926380367, + "grad_norm": 14.837289168347336, + "learning_rate": 2.8264462809917353e-07, + "logits/chosen": -0.318359375, + "logits/rejected": -0.443359375, + "logps/chosen": -294.0, + "logps/rejected": -278.0, + "loss": 0.087, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.404296875, + "rewards/margins": 7.28125, + "rewards/rejected": -6.875, + "step": 1077 + }, + { + "epoch": 1.3226993865030674, + "grad_norm": 15.748715981822883, + "learning_rate": 2.8243801652892563e-07, + "logits/chosen": -0.1845703125, + "logits/rejected": -0.306640625, + "logps/chosen": -378.0, + "logps/rejected": -360.0, + "loss": 0.0928, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.310546875, + "rewards/margins": 6.5, + "rewards/rejected": -6.1875, + "step": 1078 + }, + { + "epoch": 1.323926380368098, + "grad_norm": 26.67132050370277, + "learning_rate": 2.822314049586777e-07, + "logits/chosen": -0.2373046875, + "logits/rejected": -0.37890625, + "logps/chosen": -380.0, + "logps/rejected": -342.0, + "loss": 0.1287, + "rewards/accuracies": 0.9453125, + "rewards/chosen": 0.6484375, + "rewards/margins": 7.65625, + "rewards/rejected": -7.0, + "step": 1079 + }, + { + "epoch": 1.3251533742331287, + "grad_norm": 16.52196279474381, + "learning_rate": 2.820247933884297e-07, + "logits/chosen": -0.19921875, + "logits/rejected": -0.38671875, + "logps/chosen": -358.0, + "logps/rejected": -318.0, + "loss": 0.0898, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.7890625, + "rewards/margins": 6.875, + "rewards/rejected": -6.09375, + "step": 1080 + }, + { + "epoch": 1.3263803680981594, + "grad_norm": 11.9304192784209, + "learning_rate": 2.8181818181818177e-07, + "logits/chosen": -0.212890625, + "logits/rejected": -0.376953125, + "logps/chosen": -384.0, + "logps/rejected": -356.0, + "loss": 0.0661, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.9375, + "rewards/margins": 7.5625, + "rewards/rejected": -6.59375, + "step": 1081 + }, + { + "epoch": 1.32760736196319, + "grad_norm": 15.42217278518539, + "learning_rate": 2.8161157024793387e-07, + "logits/chosen": -0.306640625, + "logits/rejected": -0.5390625, + "logps/chosen": -402.0, + "logps/rejected": -326.0, + "loss": 0.0777, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.28125, + "rewards/margins": 7.40625, + "rewards/rejected": -6.125, + "step": 1082 + }, + { + "epoch": 1.3288343558282207, + "grad_norm": 16.615035353035292, + "learning_rate": 2.814049586776859e-07, + "logits/chosen": -0.2294921875, + "logits/rejected": -0.404296875, + "logps/chosen": -364.0, + "logps/rejected": -290.0, + "loss": 0.0902, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.5859375, + "rewards/margins": 6.8125, + "rewards/rejected": -6.21875, + "step": 1083 + }, + { + "epoch": 1.3300613496932514, + "grad_norm": 18.67529878981988, + "learning_rate": 2.81198347107438e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.298828125, + "logps/chosen": -350.0, + "logps/rejected": -318.0, + "loss": 0.094, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.64453125, + "rewards/margins": 6.75, + "rewards/rejected": -6.125, + "step": 1084 + }, + { + "epoch": 1.331288343558282, + "grad_norm": 19.923297358605808, + "learning_rate": 2.8099173553719007e-07, + "logits/chosen": -0.1494140625, + "logits/rejected": -0.30859375, + "logps/chosen": -380.0, + "logps/rejected": -334.0, + "loss": 0.0916, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.55078125, + "rewards/margins": 6.5625, + "rewards/rejected": -6.03125, + "step": 1085 + }, + { + "epoch": 1.332515337423313, + "grad_norm": 12.719879576598444, + "learning_rate": 2.8078512396694217e-07, + "logits/chosen": -0.197265625, + "logits/rejected": -0.341796875, + "logps/chosen": -310.0, + "logps/rejected": -306.0, + "loss": 0.0792, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.109375, + "rewards/margins": 7.59375, + "rewards/rejected": -6.5, + "step": 1086 + }, + { + "epoch": 1.3337423312883436, + "grad_norm": 16.660755125940913, + "learning_rate": 2.805785123966942e-07, + "logits/chosen": -0.3046875, + "logits/rejected": -0.44140625, + "logps/chosen": -314.0, + "logps/rejected": -332.0, + "loss": 0.081, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.5234375, + "rewards/margins": 6.84375, + "rewards/rejected": -6.3125, + "step": 1087 + }, + { + "epoch": 1.3349693251533743, + "grad_norm": 15.537632785066593, + "learning_rate": 2.803719008264463e-07, + "logits/chosen": -0.2333984375, + "logits/rejected": -0.466796875, + "logps/chosen": -436.0, + "logps/rejected": -336.0, + "loss": 0.0702, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.6875, + "rewards/margins": 7.96875, + "rewards/rejected": -6.28125, + "step": 1088 + }, + { + "epoch": 1.336196319018405, + "grad_norm": 17.61332382580409, + "learning_rate": 2.801652892561983e-07, + "logits/chosen": -0.302734375, + "logits/rejected": -0.451171875, + "logps/chosen": -382.0, + "logps/rejected": -316.0, + "loss": 0.1028, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.318359375, + "rewards/margins": 6.4375, + "rewards/rejected": -6.125, + "step": 1089 + }, + { + "epoch": 1.3374233128834356, + "grad_norm": 15.012547711078769, + "learning_rate": 2.799586776859504e-07, + "logits/chosen": -0.2412109375, + "logits/rejected": -0.431640625, + "logps/chosen": -366.0, + "logps/rejected": -308.0, + "loss": 0.0864, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.57421875, + "rewards/margins": 6.4375, + "rewards/rejected": -5.84375, + "step": 1090 + }, + { + "epoch": 1.3386503067484663, + "grad_norm": 14.453631493657062, + "learning_rate": 2.7975206611570245e-07, + "logits/chosen": -0.109375, + "logits/rejected": -0.279296875, + "logps/chosen": -412.0, + "logps/rejected": -324.0, + "loss": 0.0722, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.3046875, + "rewards/margins": 6.875, + "rewards/rejected": -5.5625, + "step": 1091 + }, + { + "epoch": 1.339877300613497, + "grad_norm": 16.027659103702746, + "learning_rate": 2.7954545454545455e-07, + "logits/chosen": -0.255859375, + "logits/rejected": -0.43359375, + "logps/chosen": -410.0, + "logps/rejected": -352.0, + "loss": 0.0909, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.0390625, + "rewards/margins": 6.6875, + "rewards/rejected": -5.65625, + "step": 1092 + }, + { + "epoch": 1.3411042944785276, + "grad_norm": 13.31742764236003, + "learning_rate": 2.793388429752066e-07, + "logits/chosen": -0.30078125, + "logits/rejected": -0.451171875, + "logps/chosen": -370.0, + "logps/rejected": -332.0, + "loss": 0.0782, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.0390625, + "rewards/margins": 6.96875, + "rewards/rejected": -5.9375, + "step": 1093 + }, + { + "epoch": 1.3423312883435583, + "grad_norm": 18.493341209635503, + "learning_rate": 2.7913223140495865e-07, + "logits/chosen": -0.205078125, + "logits/rejected": -0.431640625, + "logps/chosen": -420.0, + "logps/rejected": -378.0, + "loss": 0.0905, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.3046875, + "rewards/margins": 7.40625, + "rewards/rejected": -6.09375, + "step": 1094 + }, + { + "epoch": 1.343558282208589, + "grad_norm": 14.360235804951863, + "learning_rate": 2.7892561983471075e-07, + "logits/chosen": -0.2421875, + "logits/rejected": -0.4609375, + "logps/chosen": -440.0, + "logps/rejected": -382.0, + "loss": 0.0711, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.59375, + "rewards/margins": 8.375, + "rewards/rejected": -6.78125, + "step": 1095 + }, + { + "epoch": 1.3447852760736196, + "grad_norm": 15.89838040182383, + "learning_rate": 2.787190082644628e-07, + "logits/chosen": -0.265625, + "logits/rejected": -0.392578125, + "logps/chosen": -374.0, + "logps/rejected": -336.0, + "loss": 0.0858, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.8359375, + "rewards/margins": 6.875, + "rewards/rejected": -6.03125, + "step": 1096 + }, + { + "epoch": 1.3460122699386503, + "grad_norm": 12.277559133859164, + "learning_rate": 2.785123966942149e-07, + "logits/chosen": -0.220703125, + "logits/rejected": -0.396484375, + "logps/chosen": -422.0, + "logps/rejected": -342.0, + "loss": 0.0621, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.5234375, + "rewards/margins": 7.71875, + "rewards/rejected": -6.21875, + "step": 1097 + }, + { + "epoch": 1.347239263803681, + "grad_norm": 26.913077449861195, + "learning_rate": 2.783057851239669e-07, + "logits/chosen": -0.1435546875, + "logits/rejected": -0.3046875, + "logps/chosen": -358.0, + "logps/rejected": -346.0, + "loss": 0.081, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.90234375, + "rewards/margins": 7.65625, + "rewards/rejected": -6.75, + "step": 1098 + }, + { + "epoch": 1.3484662576687116, + "grad_norm": 19.093176064131004, + "learning_rate": 2.78099173553719e-07, + "logits/chosen": -0.234375, + "logits/rejected": -0.3515625, + "logps/chosen": -346.0, + "logps/rejected": -308.0, + "loss": 0.1079, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.59375, + "rewards/margins": 6.875, + "rewards/rejected": -6.28125, + "step": 1099 + }, + { + "epoch": 1.3496932515337423, + "grad_norm": 17.3921589049849, + "learning_rate": 2.7789256198347104e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.50390625, + "logps/chosen": -398.0, + "logps/rejected": -338.0, + "loss": 0.0758, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 1.7265625, + "rewards/margins": 8.0625, + "rewards/rejected": -6.34375, + "step": 1100 + }, + { + "epoch": 1.350920245398773, + "grad_norm": 17.70822693943753, + "learning_rate": 2.7768595041322314e-07, + "logits/chosen": -0.103515625, + "logits/rejected": -0.25390625, + "logps/chosen": -364.0, + "logps/rejected": -312.0, + "loss": 0.0898, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 1.15625, + "rewards/margins": 7.875, + "rewards/rejected": -6.71875, + "step": 1101 + }, + { + "epoch": 1.3521472392638036, + "grad_norm": 18.440230518028116, + "learning_rate": 2.774793388429752e-07, + "logits/chosen": -0.34765625, + "logits/rejected": -0.53515625, + "logps/chosen": -364.0, + "logps/rejected": -316.0, + "loss": 0.0935, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.328125, + "rewards/margins": 8.8125, + "rewards/rejected": -7.5, + "step": 1102 + }, + { + "epoch": 1.3533742331288343, + "grad_norm": 15.786633933772746, + "learning_rate": 2.772727272727273e-07, + "logits/chosen": -0.234375, + "logits/rejected": -0.40625, + "logps/chosen": -408.0, + "logps/rejected": -364.0, + "loss": 0.0848, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.1640625, + "rewards/margins": 8.0, + "rewards/rejected": -6.84375, + "step": 1103 + }, + { + "epoch": 1.354601226993865, + "grad_norm": 17.82967274558328, + "learning_rate": 2.7706611570247933e-07, + "logits/chosen": -0.19921875, + "logits/rejected": -0.359375, + "logps/chosen": -360.0, + "logps/rejected": -340.0, + "loss": 0.0933, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.88671875, + "rewards/margins": 7.46875, + "rewards/rejected": -6.59375, + "step": 1104 + }, + { + "epoch": 1.3558282208588956, + "grad_norm": 11.130338946372557, + "learning_rate": 2.7685950413223143e-07, + "logits/chosen": -0.32421875, + "logits/rejected": -0.4765625, + "logps/chosen": -402.0, + "logps/rejected": -382.0, + "loss": 0.0514, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.5859375, + "rewards/margins": 8.5625, + "rewards/rejected": -7.0, + "step": 1105 + }, + { + "epoch": 1.3570552147239263, + "grad_norm": 11.689817724949007, + "learning_rate": 2.766528925619834e-07, + "logits/chosen": -0.26953125, + "logits/rejected": -0.396484375, + "logps/chosen": -354.0, + "logps/rejected": -340.0, + "loss": 0.0631, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.796875, + "rewards/margins": 7.75, + "rewards/rejected": -6.9375, + "step": 1106 + }, + { + "epoch": 1.358282208588957, + "grad_norm": 15.958738681042732, + "learning_rate": 2.764462809917355e-07, + "logits/chosen": -0.12109375, + "logits/rejected": -0.2412109375, + "logps/chosen": -400.0, + "logps/rejected": -338.0, + "loss": 0.0807, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.0234375, + "rewards/margins": 6.9375, + "rewards/rejected": -5.90625, + "step": 1107 + }, + { + "epoch": 1.3595092024539877, + "grad_norm": 12.502398297022388, + "learning_rate": 2.7623966942148757e-07, + "logits/chosen": -0.283203125, + "logits/rejected": -0.474609375, + "logps/chosen": -438.0, + "logps/rejected": -360.0, + "loss": 0.0581, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.5078125, + "rewards/margins": 8.25, + "rewards/rejected": -6.75, + "step": 1108 + }, + { + "epoch": 1.3607361963190185, + "grad_norm": 14.732093704212398, + "learning_rate": 2.7603305785123967e-07, + "logits/chosen": -0.18359375, + "logits/rejected": -0.328125, + "logps/chosen": -396.0, + "logps/rejected": -346.0, + "loss": 0.0874, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.9609375, + "rewards/margins": 7.1875, + "rewards/rejected": -6.21875, + "step": 1109 + }, + { + "epoch": 1.3619631901840492, + "grad_norm": 20.436311156032623, + "learning_rate": 2.758264462809917e-07, + "logits/chosen": -0.2275390625, + "logits/rejected": -0.44921875, + "logps/chosen": -390.0, + "logps/rejected": -354.0, + "loss": 0.1082, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.1875, + "rewards/margins": 8.25, + "rewards/rejected": -7.0625, + "step": 1110 + }, + { + "epoch": 1.3631901840490799, + "grad_norm": 12.01466991945363, + "learning_rate": 2.7561983471074377e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.439453125, + "logps/chosen": -426.0, + "logps/rejected": -342.0, + "loss": 0.0617, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.2265625, + "rewards/margins": 7.875, + "rewards/rejected": -6.65625, + "step": 1111 + }, + { + "epoch": 1.3644171779141105, + "grad_norm": 16.38298802503656, + "learning_rate": 2.7541322314049587e-07, + "logits/chosen": -0.2490234375, + "logits/rejected": -0.365234375, + "logps/chosen": -410.0, + "logps/rejected": -368.0, + "loss": 0.0922, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.1328125, + "rewards/margins": 8.0625, + "rewards/rejected": -6.9375, + "step": 1112 + }, + { + "epoch": 1.3656441717791412, + "grad_norm": 15.977995491223554, + "learning_rate": 2.752066115702479e-07, + "logits/chosen": -0.228515625, + "logits/rejected": -0.3046875, + "logps/chosen": -348.0, + "logps/rejected": -324.0, + "loss": 0.0863, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.0859375, + "rewards/margins": 7.46875, + "rewards/rejected": -6.375, + "step": 1113 + }, + { + "epoch": 1.3668711656441719, + "grad_norm": 16.054507566467127, + "learning_rate": 2.75e-07, + "logits/chosen": -0.353515625, + "logits/rejected": -0.478515625, + "logps/chosen": -332.0, + "logps/rejected": -320.0, + "loss": 0.0797, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.65625, + "rewards/margins": 7.5, + "rewards/rejected": -6.84375, + "step": 1114 + }, + { + "epoch": 1.3680981595092025, + "grad_norm": 14.493487564338034, + "learning_rate": 2.74793388429752e-07, + "logits/chosen": -0.240234375, + "logits/rejected": -0.361328125, + "logps/chosen": -366.0, + "logps/rejected": -328.0, + "loss": 0.0776, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.203125, + "rewards/margins": 8.125, + "rewards/rejected": -6.9375, + "step": 1115 + }, + { + "epoch": 1.3693251533742332, + "grad_norm": 17.69630041701769, + "learning_rate": 2.745867768595041e-07, + "logits/chosen": -0.1875, + "logits/rejected": -0.361328125, + "logps/chosen": -424.0, + "logps/rejected": -356.0, + "loss": 0.1058, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.7890625, + "rewards/margins": 7.875, + "rewards/rejected": -7.09375, + "step": 1116 + }, + { + "epoch": 1.3705521472392639, + "grad_norm": 13.956815596160988, + "learning_rate": 2.7438016528925616e-07, + "logits/chosen": -0.349609375, + "logits/rejected": -0.56640625, + "logps/chosen": -426.0, + "logps/rejected": -356.0, + "loss": 0.0753, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.46875, + "rewards/margins": 8.375, + "rewards/rejected": -6.875, + "step": 1117 + }, + { + "epoch": 1.3717791411042946, + "grad_norm": 15.311936746066133, + "learning_rate": 2.7417355371900826e-07, + "logits/chosen": -0.169921875, + "logits/rejected": -0.34765625, + "logps/chosen": -370.0, + "logps/rejected": -342.0, + "loss": 0.0839, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.671875, + "rewards/margins": 7.5625, + "rewards/rejected": -6.875, + "step": 1118 + }, + { + "epoch": 1.3730061349693252, + "grad_norm": 14.325217913116607, + "learning_rate": 2.739669421487603e-07, + "logits/chosen": -0.25390625, + "logits/rejected": -0.43359375, + "logps/chosen": -416.0, + "logps/rejected": -374.0, + "loss": 0.0861, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.66015625, + "rewards/margins": 7.03125, + "rewards/rejected": -6.375, + "step": 1119 + }, + { + "epoch": 1.3742331288343559, + "grad_norm": 14.194798538739338, + "learning_rate": 2.737603305785124e-07, + "logits/chosen": -0.1962890625, + "logits/rejected": -0.48828125, + "logps/chosen": -420.0, + "logps/rejected": -354.0, + "loss": 0.0632, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.578125, + "rewards/margins": 8.5625, + "rewards/rejected": -7.0, + "step": 1120 + }, + { + "epoch": 1.3754601226993866, + "grad_norm": 18.066145170833295, + "learning_rate": 2.7355371900826445e-07, + "logits/chosen": -0.30078125, + "logits/rejected": -0.4609375, + "logps/chosen": -432.0, + "logps/rejected": -362.0, + "loss": 0.0807, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.265625, + "rewards/margins": 8.0625, + "rewards/rejected": -6.8125, + "step": 1121 + }, + { + "epoch": 1.3766871165644172, + "grad_norm": 17.029232082474003, + "learning_rate": 2.7334710743801655e-07, + "logits/chosen": -0.306640625, + "logits/rejected": -0.44921875, + "logps/chosen": -354.0, + "logps/rejected": -330.0, + "loss": 0.0792, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.625, + "rewards/margins": 7.5625, + "rewards/rejected": -6.9375, + "step": 1122 + }, + { + "epoch": 1.377914110429448, + "grad_norm": 12.415264260772052, + "learning_rate": 2.731404958677686e-07, + "logits/chosen": -0.3125, + "logits/rejected": -0.45703125, + "logps/chosen": -434.0, + "logps/rejected": -338.0, + "loss": 0.0576, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.5859375, + "rewards/margins": 7.46875, + "rewards/rejected": -6.875, + "step": 1123 + }, + { + "epoch": 1.3791411042944786, + "grad_norm": 14.512699990097783, + "learning_rate": 2.7293388429752064e-07, + "logits/chosen": -0.236328125, + "logits/rejected": -0.423828125, + "logps/chosen": -386.0, + "logps/rejected": -324.0, + "loss": 0.0672, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.6953125, + "rewards/margins": 7.90625, + "rewards/rejected": -7.21875, + "step": 1124 + }, + { + "epoch": 1.3803680981595092, + "grad_norm": 15.05560400209906, + "learning_rate": 2.727272727272727e-07, + "logits/chosen": -0.28515625, + "logits/rejected": -0.439453125, + "logps/chosen": -374.0, + "logps/rejected": -338.0, + "loss": 0.0747, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.60546875, + "rewards/margins": 7.59375, + "rewards/rejected": -7.0, + "step": 1125 + }, + { + "epoch": 1.38159509202454, + "grad_norm": 14.244726486989682, + "learning_rate": 2.725206611570248e-07, + "logits/chosen": -0.287109375, + "logits/rejected": -0.4296875, + "logps/chosen": -368.0, + "logps/rejected": -322.0, + "loss": 0.0697, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.625, + "rewards/margins": 7.71875, + "rewards/rejected": -7.09375, + "step": 1126 + }, + { + "epoch": 1.3828220858895706, + "grad_norm": 13.540727443409526, + "learning_rate": 2.7231404958677684e-07, + "logits/chosen": -0.251953125, + "logits/rejected": -0.46875, + "logps/chosen": -440.0, + "logps/rejected": -388.0, + "loss": 0.0749, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.7109375, + "rewards/margins": 8.3125, + "rewards/rejected": -6.625, + "step": 1127 + }, + { + "epoch": 1.3840490797546012, + "grad_norm": 21.310670024436575, + "learning_rate": 2.7210743801652894e-07, + "logits/chosen": -0.2275390625, + "logits/rejected": -0.388671875, + "logps/chosen": -386.0, + "logps/rejected": -370.0, + "loss": 0.1186, + "rewards/accuracies": 0.953125, + "rewards/chosen": 0.458984375, + "rewards/margins": 6.78125, + "rewards/rejected": -6.3125, + "step": 1128 + }, + { + "epoch": 1.385276073619632, + "grad_norm": 17.299094092120104, + "learning_rate": 2.71900826446281e-07, + "logits/chosen": -0.126953125, + "logits/rejected": -0.2734375, + "logps/chosen": -390.0, + "logps/rejected": -326.0, + "loss": 0.0919, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.8828125, + "rewards/margins": 7.28125, + "rewards/rejected": -6.375, + "step": 1129 + }, + { + "epoch": 1.3865030674846626, + "grad_norm": 20.282969965629707, + "learning_rate": 2.7169421487603303e-07, + "logits/chosen": -0.0810546875, + "logits/rejected": -0.298828125, + "logps/chosen": -424.0, + "logps/rejected": -366.0, + "loss": 0.0815, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.0703125, + "rewards/margins": 7.78125, + "rewards/rejected": -6.6875, + "step": 1130 + }, + { + "epoch": 1.3877300613496932, + "grad_norm": 13.65004266527284, + "learning_rate": 2.7148760330578513e-07, + "logits/chosen": -0.30078125, + "logits/rejected": -0.5859375, + "logps/chosen": -420.0, + "logps/rejected": -358.0, + "loss": 0.0672, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.375, + "rewards/margins": 8.1875, + "rewards/rejected": -6.78125, + "step": 1131 + }, + { + "epoch": 1.388957055214724, + "grad_norm": 13.258170271906867, + "learning_rate": 2.712809917355372e-07, + "logits/chosen": -0.2314453125, + "logits/rejected": -0.4609375, + "logps/chosen": -486.0, + "logps/rejected": -370.0, + "loss": 0.0658, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.6328125, + "rewards/margins": 8.125, + "rewards/rejected": -6.46875, + "step": 1132 + }, + { + "epoch": 1.3901840490797546, + "grad_norm": 13.406314215306635, + "learning_rate": 2.710743801652892e-07, + "logits/chosen": -0.291015625, + "logits/rejected": -0.44140625, + "logps/chosen": -400.0, + "logps/rejected": -368.0, + "loss": 0.0674, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.6171875, + "rewards/margins": 8.5, + "rewards/rejected": -6.875, + "step": 1133 + }, + { + "epoch": 1.3914110429447852, + "grad_norm": 13.063750705274053, + "learning_rate": 2.7086776859504127e-07, + "logits/chosen": -0.267578125, + "logits/rejected": -0.470703125, + "logps/chosen": -316.0, + "logps/rejected": -302.0, + "loss": 0.0733, + "rewards/accuracies": 0.9765625, + "rewards/chosen": -0.0189208984375, + "rewards/margins": 7.15625, + "rewards/rejected": -7.1875, + "step": 1134 + }, + { + "epoch": 1.392638036809816, + "grad_norm": 13.108269516670116, + "learning_rate": 2.706611570247934e-07, + "logits/chosen": -0.2275390625, + "logits/rejected": -0.4296875, + "logps/chosen": -400.0, + "logps/rejected": -334.0, + "loss": 0.0781, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.671875, + "rewards/margins": 8.5, + "rewards/rejected": -6.84375, + "step": 1135 + }, + { + "epoch": 1.3938650306748466, + "grad_norm": 18.053221271259833, + "learning_rate": 2.704545454545454e-07, + "logits/chosen": -0.3515625, + "logits/rejected": -0.50390625, + "logps/chosen": -458.0, + "logps/rejected": -370.0, + "loss": 0.0755, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.84375, + "rewards/margins": 9.0, + "rewards/rejected": -7.125, + "step": 1136 + }, + { + "epoch": 1.3950920245398772, + "grad_norm": 15.735878516417994, + "learning_rate": 2.702479338842975e-07, + "logits/chosen": -0.298828125, + "logits/rejected": -0.546875, + "logps/chosen": -458.0, + "logps/rejected": -368.0, + "loss": 0.0725, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.2421875, + "rewards/margins": 7.9375, + "rewards/rejected": -6.6875, + "step": 1137 + }, + { + "epoch": 1.396319018404908, + "grad_norm": 13.44163977525519, + "learning_rate": 2.7004132231404957e-07, + "logits/chosen": -0.1474609375, + "logits/rejected": -0.33984375, + "logps/chosen": -376.0, + "logps/rejected": -318.0, + "loss": 0.0605, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.9609375, + "rewards/margins": 7.0625, + "rewards/rejected": -6.09375, + "step": 1138 + }, + { + "epoch": 1.3975460122699386, + "grad_norm": 13.088415049011786, + "learning_rate": 2.6983471074380167e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.490234375, + "logps/chosen": -354.0, + "logps/rejected": -328.0, + "loss": 0.0687, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.96484375, + "rewards/margins": 7.84375, + "rewards/rejected": -6.875, + "step": 1139 + }, + { + "epoch": 1.3987730061349692, + "grad_norm": 15.624993898414273, + "learning_rate": 2.696280991735537e-07, + "logits/chosen": -0.1953125, + "logits/rejected": -0.328125, + "logps/chosen": -342.0, + "logps/rejected": -318.0, + "loss": 0.0777, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.703125, + "rewards/margins": 7.46875, + "rewards/rejected": -6.78125, + "step": 1140 + }, + { + "epoch": 1.4, + "grad_norm": 14.631221037253876, + "learning_rate": 2.694214876033058e-07, + "logits/chosen": -0.26171875, + "logits/rejected": -0.482421875, + "logps/chosen": -348.0, + "logps/rejected": -320.0, + "loss": 0.0658, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.78125, + "rewards/margins": 7.40625, + "rewards/rejected": -6.625, + "step": 1141 + }, + { + "epoch": 1.4012269938650306, + "grad_norm": 17.16686852504746, + "learning_rate": 2.692148760330578e-07, + "logits/chosen": -0.173828125, + "logits/rejected": -0.314453125, + "logps/chosen": -342.0, + "logps/rejected": -344.0, + "loss": 0.0821, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.875, + "rewards/margins": 7.6875, + "rewards/rejected": -6.8125, + "step": 1142 + }, + { + "epoch": 1.4024539877300612, + "grad_norm": 15.863901461347753, + "learning_rate": 2.690082644628099e-07, + "logits/chosen": -0.236328125, + "logits/rejected": -0.349609375, + "logps/chosen": -386.0, + "logps/rejected": -372.0, + "loss": 0.077, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.484375, + "rewards/margins": 7.46875, + "rewards/rejected": -6.96875, + "step": 1143 + }, + { + "epoch": 1.403680981595092, + "grad_norm": 14.177016192612676, + "learning_rate": 2.6880165289256196e-07, + "logits/chosen": -0.33203125, + "logits/rejected": -0.478515625, + "logps/chosen": -384.0, + "logps/rejected": -348.0, + "loss": 0.0639, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.93359375, + "rewards/margins": 7.96875, + "rewards/rejected": -7.03125, + "step": 1144 + }, + { + "epoch": 1.4049079754601226, + "grad_norm": 17.157921881301142, + "learning_rate": 2.6859504132231406e-07, + "logits/chosen": -0.255859375, + "logits/rejected": -0.4375, + "logps/chosen": -450.0, + "logps/rejected": -388.0, + "loss": 0.0679, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.4609375, + "rewards/margins": 7.90625, + "rewards/rejected": -6.4375, + "step": 1145 + }, + { + "epoch": 1.4061349693251532, + "grad_norm": 18.72400211702753, + "learning_rate": 2.683884297520661e-07, + "logits/chosen": -0.15625, + "logits/rejected": -0.275390625, + "logps/chosen": -372.0, + "logps/rejected": -356.0, + "loss": 0.0928, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.48828125, + "rewards/margins": 7.6875, + "rewards/rejected": -7.1875, + "step": 1146 + }, + { + "epoch": 1.407361963190184, + "grad_norm": 11.861925828487959, + "learning_rate": 2.6818181818181815e-07, + "logits/chosen": -0.2353515625, + "logits/rejected": -0.4453125, + "logps/chosen": -384.0, + "logps/rejected": -342.0, + "loss": 0.0606, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.4140625, + "rewards/margins": 8.6875, + "rewards/rejected": -7.3125, + "step": 1147 + }, + { + "epoch": 1.4085889570552146, + "grad_norm": 12.265993155555183, + "learning_rate": 2.6797520661157025e-07, + "logits/chosen": -0.1884765625, + "logits/rejected": -0.33984375, + "logps/chosen": -364.0, + "logps/rejected": -338.0, + "loss": 0.0533, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.70703125, + "rewards/margins": 7.78125, + "rewards/rejected": -7.09375, + "step": 1148 + }, + { + "epoch": 1.4098159509202455, + "grad_norm": 10.14539124930049, + "learning_rate": 2.677685950413223e-07, + "logits/chosen": -0.24609375, + "logits/rejected": -0.41796875, + "logps/chosen": -376.0, + "logps/rejected": -356.0, + "loss": 0.0424, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.1015625, + "rewards/margins": 8.5, + "rewards/rejected": -7.40625, + "step": 1149 + }, + { + "epoch": 1.4110429447852761, + "grad_norm": 12.992658752871431, + "learning_rate": 2.675619834710744e-07, + "logits/chosen": -0.181640625, + "logits/rejected": -0.36328125, + "logps/chosen": -384.0, + "logps/rejected": -344.0, + "loss": 0.0697, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.52734375, + "rewards/margins": 7.4375, + "rewards/rejected": -6.90625, + "step": 1150 + }, + { + "epoch": 1.4122699386503068, + "grad_norm": 13.901447140858604, + "learning_rate": 2.673553719008264e-07, + "logits/chosen": -0.2236328125, + "logits/rejected": -0.431640625, + "logps/chosen": -380.0, + "logps/rejected": -358.0, + "loss": 0.0673, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.609375, + "rewards/margins": 7.625, + "rewards/rejected": -7.0, + "step": 1151 + }, + { + "epoch": 1.4134969325153375, + "grad_norm": 16.03760627616199, + "learning_rate": 2.671487603305785e-07, + "logits/chosen": -0.2890625, + "logits/rejected": -0.421875, + "logps/chosen": -414.0, + "logps/rejected": -390.0, + "loss": 0.0711, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.2265625, + "rewards/margins": 8.3125, + "rewards/rejected": -7.09375, + "step": 1152 + }, + { + "epoch": 1.4147239263803681, + "grad_norm": 14.903157934315074, + "learning_rate": 2.6694214876033054e-07, + "logits/chosen": -0.228515625, + "logits/rejected": -0.3828125, + "logps/chosen": -396.0, + "logps/rejected": -368.0, + "loss": 0.0772, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.328125, + "rewards/margins": 8.5, + "rewards/rejected": -7.1875, + "step": 1153 + }, + { + "epoch": 1.4159509202453988, + "grad_norm": 17.0296200958866, + "learning_rate": 2.6673553719008264e-07, + "logits/chosen": -0.294921875, + "logits/rejected": -0.470703125, + "logps/chosen": -440.0, + "logps/rejected": -374.0, + "loss": 0.073, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.3359375, + "rewards/margins": 8.5625, + "rewards/rejected": -7.25, + "step": 1154 + }, + { + "epoch": 1.4171779141104295, + "grad_norm": 12.761372619608526, + "learning_rate": 2.665289256198347e-07, + "logits/chosen": -0.28515625, + "logits/rejected": -0.412109375, + "logps/chosen": -374.0, + "logps/rejected": -346.0, + "loss": 0.0755, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.349609375, + "rewards/margins": 7.34375, + "rewards/rejected": -7.0, + "step": 1155 + }, + { + "epoch": 1.4184049079754601, + "grad_norm": 19.770669770107013, + "learning_rate": 2.663223140495868e-07, + "logits/chosen": -0.2001953125, + "logits/rejected": -0.45703125, + "logps/chosen": -434.0, + "logps/rejected": -356.0, + "loss": 0.0801, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.375, + "rewards/margins": 8.9375, + "rewards/rejected": -7.53125, + "step": 1156 + }, + { + "epoch": 1.4196319018404908, + "grad_norm": 13.632878246972178, + "learning_rate": 2.6611570247933883e-07, + "logits/chosen": -0.251953125, + "logits/rejected": -0.390625, + "logps/chosen": -446.0, + "logps/rejected": -386.0, + "loss": 0.0522, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.515625, + "rewards/margins": 8.6875, + "rewards/rejected": -7.1875, + "step": 1157 + }, + { + "epoch": 1.4208588957055215, + "grad_norm": 12.507779155283647, + "learning_rate": 2.6590909090909093e-07, + "logits/chosen": -0.2451171875, + "logits/rejected": -0.40234375, + "logps/chosen": -342.0, + "logps/rejected": -318.0, + "loss": 0.0672, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.9140625, + "rewards/margins": 8.125, + "rewards/rejected": -7.25, + "step": 1158 + }, + { + "epoch": 1.4220858895705522, + "grad_norm": 23.876638078475157, + "learning_rate": 2.65702479338843e-07, + "logits/chosen": -0.21484375, + "logits/rejected": -0.294921875, + "logps/chosen": -348.0, + "logps/rejected": -352.0, + "loss": 0.0993, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.4453125, + "rewards/margins": 7.53125, + "rewards/rejected": -7.0625, + "step": 1159 + }, + { + "epoch": 1.4233128834355828, + "grad_norm": 17.951348529538016, + "learning_rate": 2.6549586776859503e-07, + "logits/chosen": -0.31640625, + "logits/rejected": -0.4921875, + "logps/chosen": -410.0, + "logps/rejected": -362.0, + "loss": 0.0783, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.796875, + "rewards/margins": 7.96875, + "rewards/rejected": -7.1875, + "step": 1160 + }, + { + "epoch": 1.4245398773006135, + "grad_norm": 17.56551756060523, + "learning_rate": 2.652892561983471e-07, + "logits/chosen": -0.18359375, + "logits/rejected": -0.310546875, + "logps/chosen": -372.0, + "logps/rejected": -378.0, + "loss": 0.1015, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.67578125, + "rewards/margins": 7.71875, + "rewards/rejected": -7.03125, + "step": 1161 + }, + { + "epoch": 1.4257668711656442, + "grad_norm": 14.53222312104436, + "learning_rate": 2.650826446280992e-07, + "logits/chosen": -0.283203125, + "logits/rejected": -0.412109375, + "logps/chosen": -388.0, + "logps/rejected": -348.0, + "loss": 0.0746, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.59765625, + "rewards/margins": 7.96875, + "rewards/rejected": -7.375, + "step": 1162 + }, + { + "epoch": 1.4269938650306748, + "grad_norm": 14.235854762550826, + "learning_rate": 2.648760330578512e-07, + "logits/chosen": -0.3515625, + "logits/rejected": -0.59375, + "logps/chosen": -394.0, + "logps/rejected": -342.0, + "loss": 0.062, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.2421875, + "rewards/margins": 8.9375, + "rewards/rejected": -7.71875, + "step": 1163 + }, + { + "epoch": 1.4282208588957055, + "grad_norm": 22.822159818966163, + "learning_rate": 2.6466942148760327e-07, + "logits/chosen": -0.21484375, + "logits/rejected": -0.267578125, + "logps/chosen": -330.0, + "logps/rejected": -332.0, + "loss": 0.0921, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.640625, + "rewards/margins": 7.59375, + "rewards/rejected": -6.9375, + "step": 1164 + }, + { + "epoch": 1.4294478527607362, + "grad_norm": 17.842349921643866, + "learning_rate": 2.6446280991735537e-07, + "logits/chosen": -0.1904296875, + "logits/rejected": -0.337890625, + "logps/chosen": -382.0, + "logps/rejected": -336.0, + "loss": 0.0718, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.54296875, + "rewards/margins": 7.8125, + "rewards/rejected": -7.28125, + "step": 1165 + }, + { + "epoch": 1.4306748466257668, + "grad_norm": 13.25805514835674, + "learning_rate": 2.642561983471074e-07, + "logits/chosen": -0.2265625, + "logits/rejected": -0.470703125, + "logps/chosen": -400.0, + "logps/rejected": -352.0, + "loss": 0.0564, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.71875, + "rewards/margins": 7.5625, + "rewards/rejected": -6.84375, + "step": 1166 + }, + { + "epoch": 1.4319018404907975, + "grad_norm": 16.92585607038591, + "learning_rate": 2.640495867768595e-07, + "logits/chosen": -0.255859375, + "logits/rejected": -0.4609375, + "logps/chosen": -400.0, + "logps/rejected": -372.0, + "loss": 0.0671, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.78515625, + "rewards/margins": 8.4375, + "rewards/rejected": -7.65625, + "step": 1167 + }, + { + "epoch": 1.4331288343558282, + "grad_norm": 13.644619776454029, + "learning_rate": 2.6384297520661156e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.37109375, + "logps/chosen": -364.0, + "logps/rejected": -336.0, + "loss": 0.0649, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.58203125, + "rewards/margins": 8.4375, + "rewards/rejected": -7.84375, + "step": 1168 + }, + { + "epoch": 1.4343558282208588, + "grad_norm": 13.909623867359475, + "learning_rate": 2.636363636363636e-07, + "logits/chosen": -0.1787109375, + "logits/rejected": -0.359375, + "logps/chosen": -370.0, + "logps/rejected": -364.0, + "loss": 0.0675, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.92578125, + "rewards/margins": 7.25, + "rewards/rejected": -6.34375, + "step": 1169 + }, + { + "epoch": 1.4355828220858895, + "grad_norm": 18.219314336763002, + "learning_rate": 2.6342975206611566e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.5078125, + "logps/chosen": -388.0, + "logps/rejected": -330.0, + "loss": 0.0753, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.6953125, + "rewards/margins": 8.0625, + "rewards/rejected": -7.375, + "step": 1170 + }, + { + "epoch": 1.4368098159509202, + "grad_norm": 15.943295109955594, + "learning_rate": 2.6322314049586776e-07, + "logits/chosen": -0.2236328125, + "logits/rejected": -0.40234375, + "logps/chosen": -370.0, + "logps/rejected": -340.0, + "loss": 0.0764, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.296875, + "rewards/margins": 8.5, + "rewards/rejected": -7.1875, + "step": 1171 + }, + { + "epoch": 1.438036809815951, + "grad_norm": 17.81488809336818, + "learning_rate": 2.630165289256198e-07, + "logits/chosen": -0.1826171875, + "logits/rejected": -0.302734375, + "logps/chosen": -428.0, + "logps/rejected": -368.0, + "loss": 0.0819, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.5703125, + "rewards/margins": 6.84375, + "rewards/rejected": -6.25, + "step": 1172 + }, + { + "epoch": 1.4392638036809817, + "grad_norm": 16.521958685170905, + "learning_rate": 2.628099173553719e-07, + "logits/chosen": -0.2197265625, + "logits/rejected": -0.390625, + "logps/chosen": -422.0, + "logps/rejected": -372.0, + "loss": 0.0806, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.859375, + "rewards/margins": 7.6875, + "rewards/rejected": -6.84375, + "step": 1173 + }, + { + "epoch": 1.4404907975460124, + "grad_norm": 18.702376129192125, + "learning_rate": 2.6260330578512395e-07, + "logits/chosen": -0.240234375, + "logits/rejected": -0.291015625, + "logps/chosen": -356.0, + "logps/rejected": -330.0, + "loss": 0.0847, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.60546875, + "rewards/margins": 7.5, + "rewards/rejected": -6.90625, + "step": 1174 + }, + { + "epoch": 1.441717791411043, + "grad_norm": 13.850669096976649, + "learning_rate": 2.6239669421487605e-07, + "logits/chosen": -0.2314453125, + "logits/rejected": -0.3125, + "logps/chosen": -340.0, + "logps/rejected": -330.0, + "loss": 0.0819, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.294921875, + "rewards/margins": 7.21875, + "rewards/rejected": -6.90625, + "step": 1175 + }, + { + "epoch": 1.4429447852760737, + "grad_norm": 18.607155577463676, + "learning_rate": 2.621900826446281e-07, + "logits/chosen": -0.287109375, + "logits/rejected": -0.41015625, + "logps/chosen": -386.0, + "logps/rejected": -366.0, + "loss": 0.0828, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.328125, + "rewards/margins": 7.0625, + "rewards/rejected": -6.75, + "step": 1176 + }, + { + "epoch": 1.4441717791411044, + "grad_norm": 17.638067126521513, + "learning_rate": 2.619834710743802e-07, + "logits/chosen": -0.1611328125, + "logits/rejected": -0.365234375, + "logps/chosen": -376.0, + "logps/rejected": -322.0, + "loss": 0.0822, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.90625, + "rewards/margins": 7.1875, + "rewards/rejected": -6.28125, + "step": 1177 + }, + { + "epoch": 1.445398773006135, + "grad_norm": 10.876079090319244, + "learning_rate": 2.617768595041322e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.4609375, + "logps/chosen": -390.0, + "logps/rejected": -332.0, + "loss": 0.0523, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.7734375, + "rewards/margins": 8.5, + "rewards/rejected": -6.75, + "step": 1178 + }, + { + "epoch": 1.4466257668711657, + "grad_norm": 26.135434766275218, + "learning_rate": 2.615702479338843e-07, + "logits/chosen": -0.314453125, + "logits/rejected": -0.52734375, + "logps/chosen": -430.0, + "logps/rejected": -360.0, + "loss": 0.0639, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.3671875, + "rewards/margins": 8.375, + "rewards/rejected": -7.0, + "step": 1179 + }, + { + "epoch": 1.4478527607361964, + "grad_norm": 19.809776547435497, + "learning_rate": 2.6136363636363634e-07, + "logits/chosen": -0.23828125, + "logits/rejected": -0.302734375, + "logps/chosen": -338.0, + "logps/rejected": -348.0, + "loss": 0.1056, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.64453125, + "rewards/margins": 7.71875, + "rewards/rejected": -7.0625, + "step": 1180 + }, + { + "epoch": 1.449079754601227, + "grad_norm": 11.965538666021382, + "learning_rate": 2.6115702479338844e-07, + "logits/chosen": -0.2451171875, + "logits/rejected": -0.404296875, + "logps/chosen": -426.0, + "logps/rejected": -396.0, + "loss": 0.0527, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.640625, + "rewards/margins": 8.0, + "rewards/rejected": -6.34375, + "step": 1181 + }, + { + "epoch": 1.4503067484662577, + "grad_norm": 12.586713486960434, + "learning_rate": 2.609504132231405e-07, + "logits/chosen": -0.2314453125, + "logits/rejected": -0.390625, + "logps/chosen": -416.0, + "logps/rejected": -366.0, + "loss": 0.0651, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.431640625, + "rewards/margins": 7.34375, + "rewards/rejected": -6.90625, + "step": 1182 + }, + { + "epoch": 1.4515337423312884, + "grad_norm": 18.89011919476893, + "learning_rate": 2.6074380165289253e-07, + "logits/chosen": -0.255859375, + "logits/rejected": -0.33984375, + "logps/chosen": -324.0, + "logps/rejected": -336.0, + "loss": 0.1049, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.328125, + "rewards/margins": 6.71875, + "rewards/rejected": -6.40625, + "step": 1183 + }, + { + "epoch": 1.452760736196319, + "grad_norm": 13.918802583134164, + "learning_rate": 2.6053719008264463e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.470703125, + "logps/chosen": -360.0, + "logps/rejected": -316.0, + "loss": 0.0765, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.9375, + "rewards/margins": 8.125, + "rewards/rejected": -7.1875, + "step": 1184 + }, + { + "epoch": 1.4539877300613497, + "grad_norm": 14.007358226253524, + "learning_rate": 2.603305785123967e-07, + "logits/chosen": -0.1630859375, + "logits/rejected": -0.328125, + "logps/chosen": -412.0, + "logps/rejected": -366.0, + "loss": 0.0606, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.296875, + "rewards/margins": 8.0, + "rewards/rejected": -6.6875, + "step": 1185 + }, + { + "epoch": 1.4552147239263804, + "grad_norm": 16.519948025389986, + "learning_rate": 2.601239669421488e-07, + "logits/chosen": -0.228515625, + "logits/rejected": -0.3984375, + "logps/chosen": -374.0, + "logps/rejected": -350.0, + "loss": 0.1014, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.6015625, + "rewards/margins": 6.8125, + "rewards/rejected": -6.21875, + "step": 1186 + }, + { + "epoch": 1.456441717791411, + "grad_norm": 15.637435718943374, + "learning_rate": 2.599173553719008e-07, + "logits/chosen": -0.25390625, + "logits/rejected": -0.45703125, + "logps/chosen": -448.0, + "logps/rejected": -372.0, + "loss": 0.0751, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.5078125, + "rewards/margins": 7.4375, + "rewards/rejected": -5.90625, + "step": 1187 + }, + { + "epoch": 1.4576687116564417, + "grad_norm": 13.16248567587539, + "learning_rate": 2.597107438016529e-07, + "logits/chosen": -0.1923828125, + "logits/rejected": -0.314453125, + "logps/chosen": -420.0, + "logps/rejected": -394.0, + "loss": 0.0627, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.1953125, + "rewards/margins": 7.4375, + "rewards/rejected": -6.25, + "step": 1188 + }, + { + "epoch": 1.4588957055214724, + "grad_norm": 17.054903091984652, + "learning_rate": 2.595041322314049e-07, + "logits/chosen": -0.275390625, + "logits/rejected": -0.47265625, + "logps/chosen": -420.0, + "logps/rejected": -358.0, + "loss": 0.0849, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.1875, + "rewards/margins": 7.59375, + "rewards/rejected": -6.40625, + "step": 1189 + }, + { + "epoch": 1.460122699386503, + "grad_norm": 10.704468766281648, + "learning_rate": 2.59297520661157e-07, + "logits/chosen": -0.26953125, + "logits/rejected": -0.5, + "logps/chosen": -428.0, + "logps/rejected": -362.0, + "loss": 0.0572, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.5859375, + "rewards/margins": 8.25, + "rewards/rejected": -6.6875, + "step": 1190 + }, + { + "epoch": 1.4613496932515337, + "grad_norm": 17.0111251360486, + "learning_rate": 2.5909090909090907e-07, + "logits/chosen": -0.12890625, + "logits/rejected": -0.26953125, + "logps/chosen": -362.0, + "logps/rejected": -350.0, + "loss": 0.0753, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.0625, + "rewards/margins": 8.1875, + "rewards/rejected": -7.125, + "step": 1191 + }, + { + "epoch": 1.4625766871165644, + "grad_norm": 15.369446069374968, + "learning_rate": 2.5888429752066117e-07, + "logits/chosen": -0.22265625, + "logits/rejected": -0.41015625, + "logps/chosen": -392.0, + "logps/rejected": -358.0, + "loss": 0.0727, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.9296875, + "rewards/margins": 7.625, + "rewards/rejected": -6.6875, + "step": 1192 + }, + { + "epoch": 1.463803680981595, + "grad_norm": 11.287386264873138, + "learning_rate": 2.586776859504132e-07, + "logits/chosen": -0.291015625, + "logits/rejected": -0.48046875, + "logps/chosen": -450.0, + "logps/rejected": -374.0, + "loss": 0.0495, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.1875, + "rewards/margins": 7.59375, + "rewards/rejected": -6.40625, + "step": 1193 + }, + { + "epoch": 1.4650306748466257, + "grad_norm": 13.824964228001653, + "learning_rate": 2.584710743801653e-07, + "logits/chosen": -0.267578125, + "logits/rejected": -0.40625, + "logps/chosen": -410.0, + "logps/rejected": -364.0, + "loss": 0.0477, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.2421875, + "rewards/margins": 7.78125, + "rewards/rejected": -6.53125, + "step": 1194 + }, + { + "epoch": 1.4662576687116564, + "grad_norm": 13.29691128148155, + "learning_rate": 2.582644628099173e-07, + "logits/chosen": -0.2275390625, + "logits/rejected": -0.376953125, + "logps/chosen": -390.0, + "logps/rejected": -368.0, + "loss": 0.0661, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.1015625, + "rewards/margins": 7.71875, + "rewards/rejected": -6.625, + "step": 1195 + }, + { + "epoch": 1.467484662576687, + "grad_norm": 15.177799019212971, + "learning_rate": 2.580578512396694e-07, + "logits/chosen": -0.189453125, + "logits/rejected": -0.333984375, + "logps/chosen": -382.0, + "logps/rejected": -350.0, + "loss": 0.0789, + "rewards/accuracies": 0.953125, + "rewards/chosen": 0.67578125, + "rewards/margins": 6.9375, + "rewards/rejected": -6.25, + "step": 1196 + }, + { + "epoch": 1.4687116564417177, + "grad_norm": 16.309192228173607, + "learning_rate": 2.5785123966942146e-07, + "logits/chosen": -0.197265625, + "logits/rejected": -0.380859375, + "logps/chosen": -414.0, + "logps/rejected": -338.0, + "loss": 0.0852, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.91015625, + "rewards/margins": 7.40625, + "rewards/rejected": -6.5, + "step": 1197 + }, + { + "epoch": 1.4699386503067484, + "grad_norm": 17.042598465129313, + "learning_rate": 2.5764462809917356e-07, + "logits/chosen": -0.1396484375, + "logits/rejected": -0.27734375, + "logps/chosen": -376.0, + "logps/rejected": -312.0, + "loss": 0.0862, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.8984375, + "rewards/margins": 7.125, + "rewards/rejected": -6.25, + "step": 1198 + }, + { + "epoch": 1.471165644171779, + "grad_norm": 14.978817725812366, + "learning_rate": 2.574380165289256e-07, + "logits/chosen": -0.318359375, + "logits/rejected": -0.490234375, + "logps/chosen": -384.0, + "logps/rejected": -334.0, + "loss": 0.0717, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.2890625, + "rewards/margins": 8.25, + "rewards/rejected": -6.96875, + "step": 1199 + }, + { + "epoch": 1.4723926380368098, + "grad_norm": 12.246840389287637, + "learning_rate": 2.5723140495867765e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.423828125, + "logps/chosen": -320.0, + "logps/rejected": -310.0, + "loss": 0.063, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.8828125, + "rewards/margins": 7.15625, + "rewards/rejected": -6.28125, + "step": 1200 + }, + { + "epoch": 1.4736196319018404, + "grad_norm": 12.344748308255857, + "learning_rate": 2.5702479338842975e-07, + "logits/chosen": -0.1708984375, + "logits/rejected": -0.337890625, + "logps/chosen": -372.0, + "logps/rejected": -368.0, + "loss": 0.0557, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.921875, + "rewards/margins": 7.34375, + "rewards/rejected": -6.4375, + "step": 1201 + }, + { + "epoch": 1.474846625766871, + "grad_norm": 13.673164766522879, + "learning_rate": 2.568181818181818e-07, + "logits/chosen": -0.25390625, + "logits/rejected": -0.416015625, + "logps/chosen": -420.0, + "logps/rejected": -380.0, + "loss": 0.0634, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.6875, + "rewards/margins": 8.3125, + "rewards/rejected": -6.625, + "step": 1202 + }, + { + "epoch": 1.4760736196319018, + "grad_norm": 12.02609442001873, + "learning_rate": 2.566115702479339e-07, + "logits/chosen": -0.333984375, + "logits/rejected": -0.5234375, + "logps/chosen": -402.0, + "logps/rejected": -330.0, + "loss": 0.0651, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.015625, + "rewards/margins": 7.78125, + "rewards/rejected": -6.78125, + "step": 1203 + }, + { + "epoch": 1.4773006134969324, + "grad_norm": 20.663473512439204, + "learning_rate": 2.564049586776859e-07, + "logits/chosen": -0.2041015625, + "logits/rejected": -0.439453125, + "logps/chosen": -368.0, + "logps/rejected": -352.0, + "loss": 0.0865, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.1953125, + "rewards/margins": 7.90625, + "rewards/rejected": -6.6875, + "step": 1204 + }, + { + "epoch": 1.478527607361963, + "grad_norm": 17.191642593540273, + "learning_rate": 2.56198347107438e-07, + "logits/chosen": -0.12158203125, + "logits/rejected": -0.345703125, + "logps/chosen": -354.0, + "logps/rejected": -340.0, + "loss": 0.0822, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.2109375, + "rewards/margins": 7.71875, + "rewards/rejected": -6.5, + "step": 1205 + }, + { + "epoch": 1.4797546012269938, + "grad_norm": 12.43541278258852, + "learning_rate": 2.5599173553719004e-07, + "logits/chosen": -0.16796875, + "logits/rejected": -0.43359375, + "logps/chosen": -342.0, + "logps/rejected": -310.0, + "loss": 0.0694, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.86328125, + "rewards/margins": 7.65625, + "rewards/rejected": -6.78125, + "step": 1206 + }, + { + "epoch": 1.4809815950920244, + "grad_norm": 15.001254892318816, + "learning_rate": 2.5578512396694214e-07, + "logits/chosen": -0.22265625, + "logits/rejected": -0.408203125, + "logps/chosen": -400.0, + "logps/rejected": -306.0, + "loss": 0.0771, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.55859375, + "rewards/margins": 7.1875, + "rewards/rejected": -6.625, + "step": 1207 + }, + { + "epoch": 1.482208588957055, + "grad_norm": 18.30618263640872, + "learning_rate": 2.555785123966942e-07, + "logits/chosen": -0.25, + "logits/rejected": -0.41796875, + "logps/chosen": -368.0, + "logps/rejected": -342.0, + "loss": 0.099, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.66796875, + "rewards/margins": 7.03125, + "rewards/rejected": -6.375, + "step": 1208 + }, + { + "epoch": 1.4834355828220858, + "grad_norm": 14.648897782716588, + "learning_rate": 2.553719008264463e-07, + "logits/chosen": -0.21484375, + "logits/rejected": -0.404296875, + "logps/chosen": -354.0, + "logps/rejected": -322.0, + "loss": 0.0892, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.703125, + "rewards/margins": 7.75, + "rewards/rejected": -7.0625, + "step": 1209 + }, + { + "epoch": 1.4846625766871164, + "grad_norm": 12.347110844785343, + "learning_rate": 2.5516528925619833e-07, + "logits/chosen": -0.17578125, + "logits/rejected": -0.34375, + "logps/chosen": -364.0, + "logps/rejected": -326.0, + "loss": 0.0543, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.93359375, + "rewards/margins": 7.875, + "rewards/rejected": -6.9375, + "step": 1210 + }, + { + "epoch": 1.4858895705521473, + "grad_norm": 11.573865654137894, + "learning_rate": 2.5495867768595043e-07, + "logits/chosen": -0.19921875, + "logits/rejected": -0.423828125, + "logps/chosen": -352.0, + "logps/rejected": -342.0, + "loss": 0.0521, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.74609375, + "rewards/margins": 7.625, + "rewards/rejected": -6.875, + "step": 1211 + }, + { + "epoch": 1.487116564417178, + "grad_norm": 15.90149763732436, + "learning_rate": 2.547520661157025e-07, + "logits/chosen": -0.29296875, + "logits/rejected": -0.423828125, + "logps/chosen": -350.0, + "logps/rejected": -346.0, + "loss": 0.078, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.57421875, + "rewards/margins": 7.9375, + "rewards/rejected": -7.34375, + "step": 1212 + }, + { + "epoch": 1.4883435582822087, + "grad_norm": 17.635564837509964, + "learning_rate": 2.5454545454545453e-07, + "logits/chosen": -0.27734375, + "logits/rejected": -0.546875, + "logps/chosen": -426.0, + "logps/rejected": -358.0, + "loss": 0.0748, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.328125, + "rewards/margins": 8.375, + "rewards/rejected": -7.03125, + "step": 1213 + }, + { + "epoch": 1.4895705521472393, + "grad_norm": 16.144394719987027, + "learning_rate": 2.543388429752066e-07, + "logits/chosen": -0.2421875, + "logits/rejected": -0.369140625, + "logps/chosen": -344.0, + "logps/rejected": -338.0, + "loss": 0.0797, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.0634765625, + "rewards/margins": 7.40625, + "rewards/rejected": -7.34375, + "step": 1214 + }, + { + "epoch": 1.49079754601227, + "grad_norm": 14.289031428981978, + "learning_rate": 2.541322314049587e-07, + "logits/chosen": -0.279296875, + "logits/rejected": -0.490234375, + "logps/chosen": -376.0, + "logps/rejected": -350.0, + "loss": 0.0526, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.0, + "rewards/margins": 8.9375, + "rewards/rejected": -7.90625, + "step": 1215 + }, + { + "epoch": 1.4920245398773007, + "grad_norm": 19.81663449599735, + "learning_rate": 2.539256198347107e-07, + "logits/chosen": -0.25390625, + "logits/rejected": -0.3125, + "logps/chosen": -372.0, + "logps/rejected": -330.0, + "loss": 0.1015, + "rewards/accuracies": 0.953125, + "rewards/chosen": 0.19140625, + "rewards/margins": 7.25, + "rewards/rejected": -7.0625, + "step": 1216 + }, + { + "epoch": 1.4932515337423313, + "grad_norm": 11.49360342714182, + "learning_rate": 2.537190082644628e-07, + "logits/chosen": -0.2451171875, + "logits/rejected": -0.3828125, + "logps/chosen": -402.0, + "logps/rejected": -366.0, + "loss": 0.0467, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.3515625, + "rewards/margins": 8.4375, + "rewards/rejected": -7.09375, + "step": 1217 + }, + { + "epoch": 1.494478527607362, + "grad_norm": 16.911688287141253, + "learning_rate": 2.5351239669421487e-07, + "logits/chosen": -0.1767578125, + "logits/rejected": -0.35546875, + "logps/chosen": -364.0, + "logps/rejected": -350.0, + "loss": 0.0771, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.2001953125, + "rewards/margins": 7.4375, + "rewards/rejected": -7.25, + "step": 1218 + }, + { + "epoch": 1.4957055214723927, + "grad_norm": 13.672652402107465, + "learning_rate": 2.533057851239669e-07, + "logits/chosen": -0.25, + "logits/rejected": -0.4140625, + "logps/chosen": -386.0, + "logps/rejected": -372.0, + "loss": 0.0507, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.6328125, + "rewards/margins": 7.875, + "rewards/rejected": -7.25, + "step": 1219 + }, + { + "epoch": 1.4969325153374233, + "grad_norm": 18.661295619736777, + "learning_rate": 2.53099173553719e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.39453125, + "logps/chosen": -392.0, + "logps/rejected": -374.0, + "loss": 0.0917, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.66796875, + "rewards/margins": 7.78125, + "rewards/rejected": -7.09375, + "step": 1220 + }, + { + "epoch": 1.498159509202454, + "grad_norm": 13.403324578383364, + "learning_rate": 2.5289256198347106e-07, + "logits/chosen": -0.294921875, + "logits/rejected": -0.466796875, + "logps/chosen": -402.0, + "logps/rejected": -340.0, + "loss": 0.0586, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.9921875, + "rewards/margins": 8.375, + "rewards/rejected": -7.375, + "step": 1221 + }, + { + "epoch": 1.4993865030674847, + "grad_norm": 16.827163128693247, + "learning_rate": 2.526859504132231e-07, + "logits/chosen": -0.1826171875, + "logits/rejected": -0.369140625, + "logps/chosen": -332.0, + "logps/rejected": -328.0, + "loss": 0.0871, + "rewards/accuracies": 0.9765625, + "rewards/chosen": -0.01953125, + "rewards/margins": 6.6875, + "rewards/rejected": -6.71875, + "step": 1222 + }, + { + "epoch": 1.5006134969325153, + "grad_norm": 12.308730951133256, + "learning_rate": 2.5247933884297516e-07, + "logits/chosen": -0.2158203125, + "logits/rejected": -0.34765625, + "logps/chosen": -420.0, + "logps/rejected": -362.0, + "loss": 0.0629, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.2578125, + "rewards/margins": 8.0625, + "rewards/rejected": -6.8125, + "step": 1223 + }, + { + "epoch": 1.501840490797546, + "grad_norm": 16.055343712171055, + "learning_rate": 2.5227272727272726e-07, + "logits/chosen": -0.212890625, + "logits/rejected": -0.3203125, + "logps/chosen": -352.0, + "logps/rejected": -334.0, + "loss": 0.0962, + "rewards/accuracies": 0.953125, + "rewards/chosen": -0.1962890625, + "rewards/margins": 6.46875, + "rewards/rejected": -6.65625, + "step": 1224 + }, + { + "epoch": 1.5030674846625767, + "grad_norm": 14.466790379446984, + "learning_rate": 2.520661157024793e-07, + "logits/chosen": -0.17578125, + "logits/rejected": -0.3359375, + "logps/chosen": -352.0, + "logps/rejected": -338.0, + "loss": 0.0702, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.64453125, + "rewards/margins": 7.4375, + "rewards/rejected": -6.8125, + "step": 1225 + }, + { + "epoch": 1.5042944785276073, + "grad_norm": 14.886182764586577, + "learning_rate": 2.518595041322314e-07, + "logits/chosen": -0.263671875, + "logits/rejected": -0.453125, + "logps/chosen": -384.0, + "logps/rejected": -340.0, + "loss": 0.0599, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.26171875, + "rewards/margins": 7.15625, + "rewards/rejected": -6.90625, + "step": 1226 + }, + { + "epoch": 1.505521472392638, + "grad_norm": 12.645862539088553, + "learning_rate": 2.5165289256198345e-07, + "logits/chosen": -0.359375, + "logits/rejected": -0.478515625, + "logps/chosen": -386.0, + "logps/rejected": -376.0, + "loss": 0.0551, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.4609375, + "rewards/margins": 8.0625, + "rewards/rejected": -6.625, + "step": 1227 + }, + { + "epoch": 1.5067484662576687, + "grad_norm": 26.979602576272097, + "learning_rate": 2.5144628099173555e-07, + "logits/chosen": -0.2431640625, + "logits/rejected": -0.376953125, + "logps/chosen": -404.0, + "logps/rejected": -380.0, + "loss": 0.1077, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.78515625, + "rewards/margins": 7.125, + "rewards/rejected": -6.3125, + "step": 1228 + }, + { + "epoch": 1.5079754601226993, + "grad_norm": 15.533111070411053, + "learning_rate": 2.512396694214876e-07, + "logits/chosen": -0.310546875, + "logits/rejected": -0.44921875, + "logps/chosen": -372.0, + "logps/rejected": -348.0, + "loss": 0.0663, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.6875, + "rewards/margins": 7.5625, + "rewards/rejected": -6.875, + "step": 1229 + }, + { + "epoch": 1.50920245398773, + "grad_norm": 14.707103339676141, + "learning_rate": 2.510330578512397e-07, + "logits/chosen": -0.2138671875, + "logits/rejected": -0.392578125, + "logps/chosen": -360.0, + "logps/rejected": -326.0, + "loss": 0.0777, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.953125, + "rewards/margins": 7.15625, + "rewards/rejected": -6.1875, + "step": 1230 + }, + { + "epoch": 1.510429447852761, + "grad_norm": 10.167827448968293, + "learning_rate": 2.508264462809917e-07, + "logits/chosen": -0.1748046875, + "logits/rejected": -0.3359375, + "logps/chosen": -346.0, + "logps/rejected": -310.0, + "loss": 0.0559, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.8359375, + "rewards/margins": 6.8125, + "rewards/rejected": -6.0, + "step": 1231 + }, + { + "epoch": 1.5116564417177916, + "grad_norm": 10.45405869315019, + "learning_rate": 2.506198347107438e-07, + "logits/chosen": -0.349609375, + "logits/rejected": -0.5625, + "logps/chosen": -392.0, + "logps/rejected": -348.0, + "loss": 0.0385, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.4296875, + "rewards/margins": 8.4375, + "rewards/rejected": -6.96875, + "step": 1232 + }, + { + "epoch": 1.5128834355828222, + "grad_norm": 13.136128276279047, + "learning_rate": 2.5041322314049584e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.474609375, + "logps/chosen": -372.0, + "logps/rejected": -326.0, + "loss": 0.058, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.95703125, + "rewards/margins": 7.46875, + "rewards/rejected": -6.53125, + "step": 1233 + }, + { + "epoch": 1.514110429447853, + "grad_norm": 24.397776494029806, + "learning_rate": 2.5020661157024794e-07, + "logits/chosen": -0.220703125, + "logits/rejected": -0.431640625, + "logps/chosen": -416.0, + "logps/rejected": -348.0, + "loss": 0.0939, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.6875, + "rewards/margins": 7.78125, + "rewards/rejected": -6.09375, + "step": 1234 + }, + { + "epoch": 1.5153374233128836, + "grad_norm": 13.503553020060968, + "learning_rate": 2.5e-07, + "logits/chosen": -0.1533203125, + "logits/rejected": -0.28515625, + "logps/chosen": -378.0, + "logps/rejected": -332.0, + "loss": 0.0744, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.306640625, + "rewards/margins": 6.5625, + "rewards/rejected": -6.25, + "step": 1235 + }, + { + "epoch": 1.5165644171779142, + "grad_norm": 15.019217461434575, + "learning_rate": 2.4979338842975204e-07, + "logits/chosen": -0.2333984375, + "logits/rejected": -0.41796875, + "logps/chosen": -380.0, + "logps/rejected": -338.0, + "loss": 0.0682, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.2109375, + "rewards/margins": 7.0625, + "rewards/rejected": -5.875, + "step": 1236 + }, + { + "epoch": 1.517791411042945, + "grad_norm": 17.297712239669764, + "learning_rate": 2.4958677685950414e-07, + "logits/chosen": -0.318359375, + "logits/rejected": -0.486328125, + "logps/chosen": -420.0, + "logps/rejected": -348.0, + "loss": 0.0783, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.1640625, + "rewards/margins": 8.125, + "rewards/rejected": -6.96875, + "step": 1237 + }, + { + "epoch": 1.5190184049079756, + "grad_norm": 18.324942299358973, + "learning_rate": 2.493801652892562e-07, + "logits/chosen": -0.1806640625, + "logits/rejected": -0.345703125, + "logps/chosen": -458.0, + "logps/rejected": -350.0, + "loss": 0.0661, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.484375, + "rewards/margins": 7.78125, + "rewards/rejected": -6.3125, + "step": 1238 + }, + { + "epoch": 1.5202453987730062, + "grad_norm": 13.871362280353386, + "learning_rate": 2.4917355371900823e-07, + "logits/chosen": -0.275390625, + "logits/rejected": -0.486328125, + "logps/chosen": -392.0, + "logps/rejected": -338.0, + "loss": 0.0722, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.1328125, + "rewards/margins": 7.90625, + "rewards/rejected": -6.78125, + "step": 1239 + }, + { + "epoch": 1.521472392638037, + "grad_norm": 18.07419128878504, + "learning_rate": 2.4896694214876033e-07, + "logits/chosen": -0.18359375, + "logits/rejected": -0.38671875, + "logps/chosen": -400.0, + "logps/rejected": -354.0, + "loss": 0.0987, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.796875, + "rewards/margins": 7.125, + "rewards/rejected": -6.34375, + "step": 1240 + }, + { + "epoch": 1.5226993865030676, + "grad_norm": 19.28019466173115, + "learning_rate": 2.487603305785124e-07, + "logits/chosen": -0.15234375, + "logits/rejected": -0.298828125, + "logps/chosen": -346.0, + "logps/rejected": -322.0, + "loss": 0.1115, + "rewards/accuracies": 0.953125, + "rewards/chosen": 0.8828125, + "rewards/margins": 6.875, + "rewards/rejected": -5.96875, + "step": 1241 + }, + { + "epoch": 1.5239263803680982, + "grad_norm": 21.39183520579998, + "learning_rate": 2.485537190082644e-07, + "logits/chosen": -0.330078125, + "logits/rejected": -0.50390625, + "logps/chosen": -374.0, + "logps/rejected": -340.0, + "loss": 0.0963, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.6640625, + "rewards/margins": 7.71875, + "rewards/rejected": -7.0625, + "step": 1242 + }, + { + "epoch": 1.525153374233129, + "grad_norm": 14.898065808458167, + "learning_rate": 2.483471074380165e-07, + "logits/chosen": -0.1708984375, + "logits/rejected": -0.322265625, + "logps/chosen": -324.0, + "logps/rejected": -308.0, + "loss": 0.067, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.30859375, + "rewards/margins": 6.4375, + "rewards/rejected": -6.125, + "step": 1243 + }, + { + "epoch": 1.5263803680981596, + "grad_norm": 13.937098717597822, + "learning_rate": 2.4814049586776857e-07, + "logits/chosen": -0.1845703125, + "logits/rejected": -0.296875, + "logps/chosen": -332.0, + "logps/rejected": -328.0, + "loss": 0.0736, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.41015625, + "rewards/margins": 6.25, + "rewards/rejected": -5.84375, + "step": 1244 + }, + { + "epoch": 1.5276073619631902, + "grad_norm": 21.50409852348661, + "learning_rate": 2.4793388429752067e-07, + "logits/chosen": -0.189453125, + "logits/rejected": -0.404296875, + "logps/chosen": -412.0, + "logps/rejected": -370.0, + "loss": 0.1119, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.95703125, + "rewards/margins": 7.53125, + "rewards/rejected": -6.5625, + "step": 1245 + }, + { + "epoch": 1.528834355828221, + "grad_norm": 10.75194113481007, + "learning_rate": 2.477272727272727e-07, + "logits/chosen": -0.298828125, + "logits/rejected": -0.47265625, + "logps/chosen": -344.0, + "logps/rejected": -326.0, + "loss": 0.0596, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.76953125, + "rewards/margins": 7.5, + "rewards/rejected": -6.75, + "step": 1246 + }, + { + "epoch": 1.5300613496932516, + "grad_norm": 11.359814321948857, + "learning_rate": 2.4752066115702477e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.400390625, + "logps/chosen": -426.0, + "logps/rejected": -354.0, + "loss": 0.0564, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.1484375, + "rewards/margins": 8.0, + "rewards/rejected": -6.875, + "step": 1247 + }, + { + "epoch": 1.5312883435582823, + "grad_norm": 12.26114984168159, + "learning_rate": 2.4731404958677687e-07, + "logits/chosen": -0.228515625, + "logits/rejected": -0.419921875, + "logps/chosen": -366.0, + "logps/rejected": -340.0, + "loss": 0.0493, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.28125, + "rewards/margins": 7.75, + "rewards/rejected": -6.46875, + "step": 1248 + }, + { + "epoch": 1.532515337423313, + "grad_norm": 20.714642855164037, + "learning_rate": 2.471074380165289e-07, + "logits/chosen": -0.068359375, + "logits/rejected": -0.181640625, + "logps/chosen": -342.0, + "logps/rejected": -328.0, + "loss": 0.115, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.283203125, + "rewards/margins": 6.75, + "rewards/rejected": -6.46875, + "step": 1249 + }, + { + "epoch": 1.5337423312883436, + "grad_norm": 13.4993389721053, + "learning_rate": 2.46900826446281e-07, + "logits/chosen": -0.298828125, + "logits/rejected": -0.462890625, + "logps/chosen": -438.0, + "logps/rejected": -418.0, + "loss": 0.0563, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.1640625, + "rewards/margins": 8.5, + "rewards/rejected": -7.3125, + "step": 1250 + }, + { + "epoch": 1.5349693251533743, + "grad_norm": 19.475138473265186, + "learning_rate": 2.4669421487603306e-07, + "logits/chosen": -0.35546875, + "logits/rejected": -0.47265625, + "logps/chosen": -368.0, + "logps/rejected": -366.0, + "loss": 0.0834, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.5078125, + "rewards/margins": 8.75, + "rewards/rejected": -7.21875, + "step": 1251 + }, + { + "epoch": 1.536196319018405, + "grad_norm": 16.048605131205, + "learning_rate": 2.464876033057851e-07, + "logits/chosen": -0.26171875, + "logits/rejected": -0.435546875, + "logps/chosen": -384.0, + "logps/rejected": -326.0, + "loss": 0.0744, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.8203125, + "rewards/margins": 8.375, + "rewards/rejected": -7.59375, + "step": 1252 + }, + { + "epoch": 1.5374233128834356, + "grad_norm": 14.18861061782376, + "learning_rate": 2.4628099173553715e-07, + "logits/chosen": -0.25, + "logits/rejected": -0.416015625, + "logps/chosen": -410.0, + "logps/rejected": -366.0, + "loss": 0.0657, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.1796875, + "rewards/margins": 7.9375, + "rewards/rejected": -6.78125, + "step": 1253 + }, + { + "epoch": 1.5386503067484663, + "grad_norm": 18.531277778883343, + "learning_rate": 2.4607438016528925e-07, + "logits/chosen": -0.150390625, + "logits/rejected": -0.296875, + "logps/chosen": -372.0, + "logps/rejected": -320.0, + "loss": 0.0998, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.0546875, + "rewards/margins": 7.75, + "rewards/rejected": -6.6875, + "step": 1254 + }, + { + "epoch": 1.539877300613497, + "grad_norm": 13.091901267394528, + "learning_rate": 2.458677685950413e-07, + "logits/chosen": -0.267578125, + "logits/rejected": -0.5078125, + "logps/chosen": -404.0, + "logps/rejected": -388.0, + "loss": 0.0608, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.15625, + "rewards/margins": 8.8125, + "rewards/rejected": -7.65625, + "step": 1255 + }, + { + "epoch": 1.5411042944785276, + "grad_norm": 17.85641442197123, + "learning_rate": 2.4566115702479335e-07, + "logits/chosen": -0.19140625, + "logits/rejected": -0.396484375, + "logps/chosen": -400.0, + "logps/rejected": -358.0, + "loss": 0.0765, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.0234375, + "rewards/margins": 7.5, + "rewards/rejected": -6.46875, + "step": 1256 + }, + { + "epoch": 1.5423312883435583, + "grad_norm": 18.01604803491479, + "learning_rate": 2.4545454545454545e-07, + "logits/chosen": -0.16796875, + "logits/rejected": -0.341796875, + "logps/chosen": -384.0, + "logps/rejected": -346.0, + "loss": 0.0835, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.63671875, + "rewards/margins": 7.5, + "rewards/rejected": -6.875, + "step": 1257 + }, + { + "epoch": 1.543558282208589, + "grad_norm": 15.439495340668307, + "learning_rate": 2.452479338842975e-07, + "logits/chosen": -0.1953125, + "logits/rejected": -0.40234375, + "logps/chosen": -398.0, + "logps/rejected": -328.0, + "loss": 0.079, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.2578125, + "rewards/margins": 7.875, + "rewards/rejected": -6.625, + "step": 1258 + }, + { + "epoch": 1.5447852760736196, + "grad_norm": 14.44952363527473, + "learning_rate": 2.450413223140496e-07, + "logits/chosen": -0.2138671875, + "logits/rejected": -0.4375, + "logps/chosen": -400.0, + "logps/rejected": -344.0, + "loss": 0.0661, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.109375, + "rewards/margins": 8.0625, + "rewards/rejected": -6.96875, + "step": 1259 + }, + { + "epoch": 1.5460122699386503, + "grad_norm": 16.44982554697176, + "learning_rate": 2.4483471074380164e-07, + "logits/chosen": -0.2451171875, + "logits/rejected": -0.423828125, + "logps/chosen": -446.0, + "logps/rejected": -360.0, + "loss": 0.0607, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.296875, + "rewards/margins": 8.375, + "rewards/rejected": -7.09375, + "step": 1260 + }, + { + "epoch": 1.547239263803681, + "grad_norm": 17.28981564978328, + "learning_rate": 2.446280991735537e-07, + "logits/chosen": -0.30078125, + "logits/rejected": -0.4453125, + "logps/chosen": -404.0, + "logps/rejected": -354.0, + "loss": 0.0732, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.82421875, + "rewards/margins": 7.4375, + "rewards/rejected": -6.625, + "step": 1261 + }, + { + "epoch": 1.5484662576687116, + "grad_norm": 12.32711854386545, + "learning_rate": 2.444214876033058e-07, + "logits/chosen": -0.2138671875, + "logits/rejected": -0.40234375, + "logps/chosen": -378.0, + "logps/rejected": -320.0, + "loss": 0.0784, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.6484375, + "rewards/margins": 7.53125, + "rewards/rejected": -6.90625, + "step": 1262 + }, + { + "epoch": 1.5496932515337423, + "grad_norm": 14.86900377895076, + "learning_rate": 2.4421487603305784e-07, + "logits/chosen": -0.15625, + "logits/rejected": -0.375, + "logps/chosen": -388.0, + "logps/rejected": -340.0, + "loss": 0.0818, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.1328125, + "rewards/margins": 7.9375, + "rewards/rejected": -6.8125, + "step": 1263 + }, + { + "epoch": 1.550920245398773, + "grad_norm": 18.62383388039045, + "learning_rate": 2.440082644628099e-07, + "logits/chosen": -0.115234375, + "logits/rejected": -0.283203125, + "logps/chosen": -382.0, + "logps/rejected": -362.0, + "loss": 0.1031, + "rewards/accuracies": 0.953125, + "rewards/chosen": 0.6328125, + "rewards/margins": 7.40625, + "rewards/rejected": -6.75, + "step": 1264 + }, + { + "epoch": 1.5521472392638036, + "grad_norm": 11.415736814981251, + "learning_rate": 2.43801652892562e-07, + "logits/chosen": -0.251953125, + "logits/rejected": -0.423828125, + "logps/chosen": -378.0, + "logps/rejected": -354.0, + "loss": 0.0605, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.6484375, + "rewards/margins": 7.875, + "rewards/rejected": -7.21875, + "step": 1265 + }, + { + "epoch": 1.5533742331288343, + "grad_norm": 15.61422882415533, + "learning_rate": 2.4359504132231403e-07, + "logits/chosen": -0.28515625, + "logits/rejected": -0.392578125, + "logps/chosen": -350.0, + "logps/rejected": -336.0, + "loss": 0.0752, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.296875, + "rewards/margins": 7.15625, + "rewards/rejected": -6.84375, + "step": 1266 + }, + { + "epoch": 1.554601226993865, + "grad_norm": 19.44717966714071, + "learning_rate": 2.4338842975206613e-07, + "logits/chosen": -0.216796875, + "logits/rejected": -0.37109375, + "logps/chosen": -362.0, + "logps/rejected": -328.0, + "loss": 0.1237, + "rewards/accuracies": 0.953125, + "rewards/chosen": 1.0234375, + "rewards/margins": 7.78125, + "rewards/rejected": -6.75, + "step": 1267 + }, + { + "epoch": 1.5558282208588956, + "grad_norm": 12.036788936135034, + "learning_rate": 2.431818181818182e-07, + "logits/chosen": -0.2314453125, + "logits/rejected": -0.35546875, + "logps/chosen": -494.0, + "logps/rejected": -380.0, + "loss": 0.0598, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.2890625, + "rewards/margins": 8.3125, + "rewards/rejected": -7.03125, + "step": 1268 + }, + { + "epoch": 1.5570552147239263, + "grad_norm": 13.075790358388893, + "learning_rate": 2.429752066115702e-07, + "logits/chosen": -0.265625, + "logits/rejected": -0.400390625, + "logps/chosen": -378.0, + "logps/rejected": -326.0, + "loss": 0.0616, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.8203125, + "rewards/margins": 7.84375, + "rewards/rejected": -7.03125, + "step": 1269 + }, + { + "epoch": 1.558282208588957, + "grad_norm": 17.267795800857765, + "learning_rate": 2.427685950413223e-07, + "logits/chosen": -0.265625, + "logits/rejected": -0.330078125, + "logps/chosen": -404.0, + "logps/rejected": -370.0, + "loss": 0.0568, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.76171875, + "rewards/margins": 7.53125, + "rewards/rejected": -6.75, + "step": 1270 + }, + { + "epoch": 1.5595092024539876, + "grad_norm": 13.404398582551197, + "learning_rate": 2.4256198347107437e-07, + "logits/chosen": -0.1845703125, + "logits/rejected": -0.2734375, + "logps/chosen": -354.0, + "logps/rejected": -332.0, + "loss": 0.0606, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.71484375, + "rewards/margins": 7.46875, + "rewards/rejected": -6.75, + "step": 1271 + }, + { + "epoch": 1.5607361963190183, + "grad_norm": 10.862740987379622, + "learning_rate": 2.423553719008264e-07, + "logits/chosen": -0.32421875, + "logits/rejected": -0.484375, + "logps/chosen": -426.0, + "logps/rejected": -354.0, + "loss": 0.0448, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.484375, + "rewards/margins": 8.375, + "rewards/rejected": -6.90625, + "step": 1272 + }, + { + "epoch": 1.561963190184049, + "grad_norm": 22.851394317942706, + "learning_rate": 2.4214876033057847e-07, + "logits/chosen": -0.294921875, + "logits/rejected": -0.41015625, + "logps/chosen": -422.0, + "logps/rejected": -376.0, + "loss": 0.1152, + "rewards/accuracies": 0.9453125, + "rewards/chosen": 0.76953125, + "rewards/margins": 7.5, + "rewards/rejected": -6.71875, + "step": 1273 + }, + { + "epoch": 1.5631901840490796, + "grad_norm": 10.756674533772827, + "learning_rate": 2.4194214876033057e-07, + "logits/chosen": -0.373046875, + "logits/rejected": -0.5703125, + "logps/chosen": -394.0, + "logps/rejected": -350.0, + "loss": 0.0454, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.88671875, + "rewards/margins": 7.90625, + "rewards/rejected": -7.03125, + "step": 1274 + }, + { + "epoch": 1.5644171779141103, + "grad_norm": 16.684970514342197, + "learning_rate": 2.417355371900826e-07, + "logits/chosen": -0.193359375, + "logits/rejected": -0.34765625, + "logps/chosen": -380.0, + "logps/rejected": -356.0, + "loss": 0.0841, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.671875, + "rewards/margins": 7.78125, + "rewards/rejected": -7.125, + "step": 1275 + }, + { + "epoch": 1.565644171779141, + "grad_norm": 10.635507525158637, + "learning_rate": 2.415289256198347e-07, + "logits/chosen": -0.12451171875, + "logits/rejected": -0.310546875, + "logps/chosen": -412.0, + "logps/rejected": -336.0, + "loss": 0.0494, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.0625, + "rewards/margins": 7.75, + "rewards/rejected": -6.6875, + "step": 1276 + }, + { + "epoch": 1.5668711656441716, + "grad_norm": 16.29793475802765, + "learning_rate": 2.4132231404958676e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.412109375, + "logps/chosen": -352.0, + "logps/rejected": -320.0, + "loss": 0.0802, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.5390625, + "rewards/margins": 7.15625, + "rewards/rejected": -6.625, + "step": 1277 + }, + { + "epoch": 1.5680981595092025, + "grad_norm": 12.613256761700807, + "learning_rate": 2.411157024793388e-07, + "logits/chosen": -0.234375, + "logits/rejected": -0.44921875, + "logps/chosen": -396.0, + "logps/rejected": -356.0, + "loss": 0.0568, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.5078125, + "rewards/margins": 8.75, + "rewards/rejected": -7.21875, + "step": 1278 + }, + { + "epoch": 1.5693251533742332, + "grad_norm": 17.463784303388753, + "learning_rate": 2.409090909090909e-07, + "logits/chosen": -0.26171875, + "logits/rejected": -0.42578125, + "logps/chosen": -350.0, + "logps/rejected": -354.0, + "loss": 0.0887, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.7421875, + "rewards/margins": 7.125, + "rewards/rejected": -6.40625, + "step": 1279 + }, + { + "epoch": 1.5705521472392638, + "grad_norm": 13.965110907461401, + "learning_rate": 2.4070247933884295e-07, + "logits/chosen": -0.296875, + "logits/rejected": -0.431640625, + "logps/chosen": -428.0, + "logps/rejected": -386.0, + "loss": 0.0564, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.234375, + "rewards/margins": 8.3125, + "rewards/rejected": -7.0625, + "step": 1280 + }, + { + "epoch": 1.5717791411042945, + "grad_norm": 19.212054024670067, + "learning_rate": 2.4049586776859505e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.466796875, + "logps/chosen": -432.0, + "logps/rejected": -394.0, + "loss": 0.0885, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.6640625, + "rewards/margins": 8.6875, + "rewards/rejected": -7.0, + "step": 1281 + }, + { + "epoch": 1.5730061349693252, + "grad_norm": 15.669091584469413, + "learning_rate": 2.402892561983471e-07, + "logits/chosen": -0.05810546875, + "logits/rejected": -0.29296875, + "logps/chosen": -384.0, + "logps/rejected": -330.0, + "loss": 0.0679, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.984375, + "rewards/margins": 7.71875, + "rewards/rejected": -6.75, + "step": 1282 + }, + { + "epoch": 1.5742331288343558, + "grad_norm": 18.679730385515196, + "learning_rate": 2.4008264462809915e-07, + "logits/chosen": -0.10498046875, + "logits/rejected": -0.240234375, + "logps/chosen": -342.0, + "logps/rejected": -334.0, + "loss": 0.0951, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.26953125, + "rewards/margins": 7.34375, + "rewards/rejected": -7.0625, + "step": 1283 + }, + { + "epoch": 1.5754601226993865, + "grad_norm": 22.194396862605263, + "learning_rate": 2.3987603305785125e-07, + "logits/chosen": -0.177734375, + "logits/rejected": -0.349609375, + "logps/chosen": -392.0, + "logps/rejected": -368.0, + "loss": 0.1073, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.7890625, + "rewards/margins": 8.125, + "rewards/rejected": -7.34375, + "step": 1284 + }, + { + "epoch": 1.5766871165644172, + "grad_norm": 16.41690266198598, + "learning_rate": 2.396694214876033e-07, + "logits/chosen": -0.2138671875, + "logits/rejected": -0.458984375, + "logps/chosen": -412.0, + "logps/rejected": -370.0, + "loss": 0.0582, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.0078125, + "rewards/margins": 8.25, + "rewards/rejected": -7.25, + "step": 1285 + }, + { + "epoch": 1.5779141104294478, + "grad_norm": 14.215415690036984, + "learning_rate": 2.394628099173554e-07, + "logits/chosen": -0.171875, + "logits/rejected": -0.365234375, + "logps/chosen": -356.0, + "logps/rejected": -312.0, + "loss": 0.0573, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.69921875, + "rewards/margins": 7.96875, + "rewards/rejected": -7.25, + "step": 1286 + }, + { + "epoch": 1.5791411042944785, + "grad_norm": 16.634128782576898, + "learning_rate": 2.3925619834710744e-07, + "logits/chosen": -0.255859375, + "logits/rejected": -0.353515625, + "logps/chosen": -312.0, + "logps/rejected": -332.0, + "loss": 0.0828, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.30078125, + "rewards/margins": 7.75, + "rewards/rejected": -7.4375, + "step": 1287 + }, + { + "epoch": 1.5803680981595092, + "grad_norm": 17.96415518276842, + "learning_rate": 2.390495867768595e-07, + "logits/chosen": -0.2890625, + "logits/rejected": -0.482421875, + "logps/chosen": -382.0, + "logps/rejected": -360.0, + "loss": 0.0876, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.9765625, + "rewards/margins": 8.0625, + "rewards/rejected": -7.09375, + "step": 1288 + }, + { + "epoch": 1.5815950920245399, + "grad_norm": 17.54135326824253, + "learning_rate": 2.3884297520661154e-07, + "logits/chosen": -0.19140625, + "logits/rejected": -0.3359375, + "logps/chosen": -320.0, + "logps/rejected": -298.0, + "loss": 0.0915, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.3203125, + "rewards/margins": 7.5625, + "rewards/rejected": -7.25, + "step": 1289 + }, + { + "epoch": 1.5828220858895705, + "grad_norm": 15.281068791721923, + "learning_rate": 2.3863636363636364e-07, + "logits/chosen": -0.30078125, + "logits/rejected": -0.490234375, + "logps/chosen": -382.0, + "logps/rejected": -364.0, + "loss": 0.0646, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.53125, + "rewards/margins": 8.5625, + "rewards/rejected": -8.0625, + "step": 1290 + }, + { + "epoch": 1.5840490797546012, + "grad_norm": 15.489007232864498, + "learning_rate": 2.384297520661157e-07, + "logits/chosen": -0.18359375, + "logits/rejected": -0.310546875, + "logps/chosen": -356.0, + "logps/rejected": -330.0, + "loss": 0.0587, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.69921875, + "rewards/margins": 8.25, + "rewards/rejected": -7.5625, + "step": 1291 + }, + { + "epoch": 1.5852760736196319, + "grad_norm": 9.924958316993024, + "learning_rate": 2.3822314049586776e-07, + "logits/chosen": -0.306640625, + "logits/rejected": -0.4375, + "logps/chosen": -374.0, + "logps/rejected": -378.0, + "loss": 0.0478, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.828125, + "rewards/margins": 8.75, + "rewards/rejected": -7.9375, + "step": 1292 + }, + { + "epoch": 1.5865030674846625, + "grad_norm": 17.029896879243122, + "learning_rate": 2.3801652892561983e-07, + "logits/chosen": -0.1337890625, + "logits/rejected": -0.390625, + "logps/chosen": -406.0, + "logps/rejected": -340.0, + "loss": 0.0824, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.78125, + "rewards/margins": 8.0, + "rewards/rejected": -7.21875, + "step": 1293 + }, + { + "epoch": 1.5877300613496934, + "grad_norm": 11.25343034375505, + "learning_rate": 2.378099173553719e-07, + "logits/chosen": -0.203125, + "logits/rejected": -0.3984375, + "logps/chosen": -398.0, + "logps/rejected": -380.0, + "loss": 0.0535, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.84375, + "rewards/margins": 8.875, + "rewards/rejected": -8.0, + "step": 1294 + }, + { + "epoch": 1.588957055214724, + "grad_norm": 13.756477043290205, + "learning_rate": 2.3760330578512398e-07, + "logits/chosen": -0.32421875, + "logits/rejected": -0.5234375, + "logps/chosen": -360.0, + "logps/rejected": -336.0, + "loss": 0.0777, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.458984375, + "rewards/margins": 7.90625, + "rewards/rejected": -7.46875, + "step": 1295 + }, + { + "epoch": 1.5901840490797547, + "grad_norm": 24.097317575985585, + "learning_rate": 2.3739669421487603e-07, + "logits/chosen": -0.234375, + "logits/rejected": -0.3359375, + "logps/chosen": -382.0, + "logps/rejected": -356.0, + "loss": 0.1432, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.00860595703125, + "rewards/margins": 7.53125, + "rewards/rejected": -7.53125, + "step": 1296 + }, + { + "epoch": 1.5914110429447854, + "grad_norm": 18.639137723942607, + "learning_rate": 2.371900826446281e-07, + "logits/chosen": -0.169921875, + "logits/rejected": -0.34765625, + "logps/chosen": -404.0, + "logps/rejected": -348.0, + "loss": 0.0932, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.6328125, + "rewards/margins": 7.125, + "rewards/rejected": -6.5, + "step": 1297 + }, + { + "epoch": 1.592638036809816, + "grad_norm": 16.722845871384106, + "learning_rate": 2.3698347107438015e-07, + "logits/chosen": -0.181640625, + "logits/rejected": -0.30859375, + "logps/chosen": -404.0, + "logps/rejected": -374.0, + "loss": 0.0866, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.98828125, + "rewards/margins": 8.4375, + "rewards/rejected": -7.4375, + "step": 1298 + }, + { + "epoch": 1.5938650306748468, + "grad_norm": 12.712483405995942, + "learning_rate": 2.3677685950413222e-07, + "logits/chosen": -0.294921875, + "logits/rejected": -0.400390625, + "logps/chosen": -388.0, + "logps/rejected": -362.0, + "loss": 0.0648, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.369140625, + "rewards/margins": 7.65625, + "rewards/rejected": -7.3125, + "step": 1299 + }, + { + "epoch": 1.5950920245398774, + "grad_norm": 13.148205500869985, + "learning_rate": 2.3657024793388427e-07, + "logits/chosen": -0.1875, + "logits/rejected": -0.3984375, + "logps/chosen": -402.0, + "logps/rejected": -372.0, + "loss": 0.0578, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.7734375, + "rewards/margins": 8.3125, + "rewards/rejected": -7.53125, + "step": 1300 + }, + { + "epoch": 1.596319018404908, + "grad_norm": 16.957859936316087, + "learning_rate": 2.3636363636363634e-07, + "logits/chosen": -0.181640625, + "logits/rejected": -0.3828125, + "logps/chosen": -380.0, + "logps/rejected": -356.0, + "loss": 0.0811, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.314453125, + "rewards/margins": 7.65625, + "rewards/rejected": -7.34375, + "step": 1301 + }, + { + "epoch": 1.5975460122699388, + "grad_norm": 14.567161887436797, + "learning_rate": 2.3615702479338841e-07, + "logits/chosen": -0.3515625, + "logits/rejected": -0.484375, + "logps/chosen": -398.0, + "logps/rejected": -366.0, + "loss": 0.0837, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.125, + "rewards/margins": 8.875, + "rewards/rejected": -7.71875, + "step": 1302 + }, + { + "epoch": 1.5987730061349694, + "grad_norm": 11.923678072340595, + "learning_rate": 2.359504132231405e-07, + "logits/chosen": -0.2421875, + "logits/rejected": -0.451171875, + "logps/chosen": -436.0, + "logps/rejected": -366.0, + "loss": 0.0661, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.078125, + "rewards/margins": 8.8125, + "rewards/rejected": -7.71875, + "step": 1303 + }, + { + "epoch": 1.6, + "grad_norm": 10.437379787713072, + "learning_rate": 2.3574380165289254e-07, + "logits/chosen": -0.32421875, + "logits/rejected": -0.498046875, + "logps/chosen": -378.0, + "logps/rejected": -370.0, + "loss": 0.0521, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.98046875, + "rewards/margins": 8.8125, + "rewards/rejected": -7.8125, + "step": 1304 + }, + { + "epoch": 1.6012269938650308, + "grad_norm": 13.807692539109546, + "learning_rate": 2.355371900826446e-07, + "logits/chosen": -0.2216796875, + "logits/rejected": -0.369140625, + "logps/chosen": -340.0, + "logps/rejected": -332.0, + "loss": 0.0746, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.90625, + "rewards/margins": 7.96875, + "rewards/rejected": -7.0625, + "step": 1305 + }, + { + "epoch": 1.6024539877300614, + "grad_norm": 11.657020755749071, + "learning_rate": 2.3533057851239668e-07, + "logits/chosen": -0.294921875, + "logits/rejected": -0.396484375, + "logps/chosen": -402.0, + "logps/rejected": -350.0, + "loss": 0.05, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.90625, + "rewards/margins": 8.1875, + "rewards/rejected": -7.28125, + "step": 1306 + }, + { + "epoch": 1.603680981595092, + "grad_norm": 13.440305388111407, + "learning_rate": 2.3512396694214876e-07, + "logits/chosen": -0.279296875, + "logits/rejected": -0.48046875, + "logps/chosen": -438.0, + "logps/rejected": -368.0, + "loss": 0.0618, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.34375, + "rewards/margins": 8.25, + "rewards/rejected": -6.90625, + "step": 1307 + }, + { + "epoch": 1.6049079754601228, + "grad_norm": 12.414761446042062, + "learning_rate": 2.3491735537190083e-07, + "logits/chosen": -0.33984375, + "logits/rejected": -0.5, + "logps/chosen": -378.0, + "logps/rejected": -336.0, + "loss": 0.0565, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.015625, + "rewards/margins": 7.96875, + "rewards/rejected": -6.96875, + "step": 1308 + }, + { + "epoch": 1.6061349693251534, + "grad_norm": 13.555100426493926, + "learning_rate": 2.3471074380165288e-07, + "logits/chosen": -0.26953125, + "logits/rejected": -0.404296875, + "logps/chosen": -386.0, + "logps/rejected": -356.0, + "loss": 0.0678, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.68359375, + "rewards/margins": 7.9375, + "rewards/rejected": -7.25, + "step": 1309 + }, + { + "epoch": 1.607361963190184, + "grad_norm": 12.969077369696661, + "learning_rate": 2.3450413223140495e-07, + "logits/chosen": -0.212890625, + "logits/rejected": -0.375, + "logps/chosen": -328.0, + "logps/rejected": -322.0, + "loss": 0.065, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.15625, + "rewards/margins": 8.1875, + "rewards/rejected": -7.03125, + "step": 1310 + }, + { + "epoch": 1.6085889570552148, + "grad_norm": 17.22103366682144, + "learning_rate": 2.3429752066115702e-07, + "logits/chosen": -0.1767578125, + "logits/rejected": -0.361328125, + "logps/chosen": -412.0, + "logps/rejected": -344.0, + "loss": 0.1049, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.70703125, + "rewards/margins": 6.8125, + "rewards/rejected": -6.125, + "step": 1311 + }, + { + "epoch": 1.6098159509202454, + "grad_norm": 12.021177394309591, + "learning_rate": 2.340909090909091e-07, + "logits/chosen": -0.28515625, + "logits/rejected": -0.51171875, + "logps/chosen": -400.0, + "logps/rejected": -350.0, + "loss": 0.0477, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.046875, + "rewards/margins": 8.5, + "rewards/rejected": -7.4375, + "step": 1312 + }, + { + "epoch": 1.611042944785276, + "grad_norm": 13.38847175785287, + "learning_rate": 2.3388429752066114e-07, + "logits/chosen": -0.2265625, + "logits/rejected": -0.375, + "logps/chosen": -364.0, + "logps/rejected": -336.0, + "loss": 0.0643, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.6015625, + "rewards/margins": 7.40625, + "rewards/rejected": -6.78125, + "step": 1313 + }, + { + "epoch": 1.6122699386503068, + "grad_norm": 11.347557248695258, + "learning_rate": 2.3367768595041322e-07, + "logits/chosen": -0.36328125, + "logits/rejected": -0.470703125, + "logps/chosen": -388.0, + "logps/rejected": -368.0, + "loss": 0.0432, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.390625, + "rewards/margins": 8.6875, + "rewards/rejected": -7.28125, + "step": 1314 + }, + { + "epoch": 1.6134969325153374, + "grad_norm": 20.681438762244568, + "learning_rate": 2.334710743801653e-07, + "logits/chosen": -0.240234375, + "logits/rejected": -0.470703125, + "logps/chosen": -442.0, + "logps/rejected": -376.0, + "loss": 0.0992, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 1.34375, + "rewards/margins": 8.0, + "rewards/rejected": -6.65625, + "step": 1315 + }, + { + "epoch": 1.614723926380368, + "grad_norm": 15.536280018990086, + "learning_rate": 2.3326446280991734e-07, + "logits/chosen": -0.11865234375, + "logits/rejected": -0.298828125, + "logps/chosen": -370.0, + "logps/rejected": -328.0, + "loss": 0.0785, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.625, + "rewards/margins": 7.15625, + "rewards/rejected": -6.53125, + "step": 1316 + }, + { + "epoch": 1.6159509202453988, + "grad_norm": 14.275376838860963, + "learning_rate": 2.330578512396694e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.37890625, + "logps/chosen": -382.0, + "logps/rejected": -366.0, + "loss": 0.0682, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.75, + "rewards/margins": 6.96875, + "rewards/rejected": -6.21875, + "step": 1317 + }, + { + "epoch": 1.6171779141104294, + "grad_norm": 10.64444423178702, + "learning_rate": 2.3285123966942146e-07, + "logits/chosen": -0.21484375, + "logits/rejected": -0.41796875, + "logps/chosen": -382.0, + "logps/rejected": -338.0, + "loss": 0.044, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.703125, + "rewards/margins": 7.6875, + "rewards/rejected": -6.96875, + "step": 1318 + }, + { + "epoch": 1.61840490797546, + "grad_norm": 14.588160883500564, + "learning_rate": 2.3264462809917353e-07, + "logits/chosen": -0.2373046875, + "logits/rejected": -0.39453125, + "logps/chosen": -382.0, + "logps/rejected": -376.0, + "loss": 0.0618, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.125, + "rewards/margins": 7.84375, + "rewards/rejected": -6.71875, + "step": 1319 + }, + { + "epoch": 1.6196319018404908, + "grad_norm": 15.839589377719077, + "learning_rate": 2.324380165289256e-07, + "logits/chosen": -0.1943359375, + "logits/rejected": -0.37890625, + "logps/chosen": -430.0, + "logps/rejected": -358.0, + "loss": 0.0758, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.25, + "rewards/margins": 7.59375, + "rewards/rejected": -6.34375, + "step": 1320 + }, + { + "epoch": 1.6208588957055214, + "grad_norm": 27.334880455985346, + "learning_rate": 2.3223140495867768e-07, + "logits/chosen": -0.244140625, + "logits/rejected": -0.380859375, + "logps/chosen": -376.0, + "logps/rejected": -332.0, + "loss": 0.0942, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 1.140625, + "rewards/margins": 8.0, + "rewards/rejected": -6.875, + "step": 1321 + }, + { + "epoch": 1.622085889570552, + "grad_norm": 15.40927134276531, + "learning_rate": 2.3202479338842973e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.423828125, + "logps/chosen": -358.0, + "logps/rejected": -350.0, + "loss": 0.0662, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.7265625, + "rewards/margins": 7.28125, + "rewards/rejected": -6.5625, + "step": 1322 + }, + { + "epoch": 1.6233128834355828, + "grad_norm": 12.702315706196249, + "learning_rate": 2.318181818181818e-07, + "logits/chosen": -0.09814453125, + "logits/rejected": -0.291015625, + "logps/chosen": -326.0, + "logps/rejected": -326.0, + "loss": 0.06, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.89453125, + "rewards/margins": 7.375, + "rewards/rejected": -6.46875, + "step": 1323 + }, + { + "epoch": 1.6245398773006134, + "grad_norm": 17.951923057589752, + "learning_rate": 2.3161157024793387e-07, + "logits/chosen": -0.2431640625, + "logits/rejected": -0.462890625, + "logps/chosen": -408.0, + "logps/rejected": -342.0, + "loss": 0.0956, + "rewards/accuracies": 0.953125, + "rewards/chosen": 1.1484375, + "rewards/margins": 7.625, + "rewards/rejected": -6.5, + "step": 1324 + }, + { + "epoch": 1.6257668711656441, + "grad_norm": 14.74376030616997, + "learning_rate": 2.3140495867768595e-07, + "logits/chosen": -0.1259765625, + "logits/rejected": -0.380859375, + "logps/chosen": -378.0, + "logps/rejected": -340.0, + "loss": 0.08, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.69921875, + "rewards/margins": 7.40625, + "rewards/rejected": -6.6875, + "step": 1325 + }, + { + "epoch": 1.6269938650306748, + "grad_norm": 16.786676256329944, + "learning_rate": 2.3119834710743802e-07, + "logits/chosen": -0.248046875, + "logits/rejected": -0.392578125, + "logps/chosen": -402.0, + "logps/rejected": -364.0, + "loss": 0.0723, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.89453125, + "rewards/margins": 7.84375, + "rewards/rejected": -6.96875, + "step": 1326 + }, + { + "epoch": 1.6282208588957054, + "grad_norm": 20.567770397900244, + "learning_rate": 2.3099173553719007e-07, + "logits/chosen": -0.1767578125, + "logits/rejected": -0.30078125, + "logps/chosen": -358.0, + "logps/rejected": -354.0, + "loss": 0.0912, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.5625, + "rewards/margins": 7.03125, + "rewards/rejected": -6.46875, + "step": 1327 + }, + { + "epoch": 1.6294478527607361, + "grad_norm": 15.051279679825173, + "learning_rate": 2.3078512396694214e-07, + "logits/chosen": -0.25, + "logits/rejected": -0.46484375, + "logps/chosen": -402.0, + "logps/rejected": -348.0, + "loss": 0.0622, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.81640625, + "rewards/margins": 7.96875, + "rewards/rejected": -7.15625, + "step": 1328 + }, + { + "epoch": 1.6306748466257668, + "grad_norm": 15.9994478939779, + "learning_rate": 2.3057851239669422e-07, + "logits/chosen": -0.3046875, + "logits/rejected": -0.4765625, + "logps/chosen": -410.0, + "logps/rejected": -364.0, + "loss": 0.0821, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.640625, + "rewards/margins": 7.15625, + "rewards/rejected": -6.53125, + "step": 1329 + }, + { + "epoch": 1.6319018404907975, + "grad_norm": 26.168100343892643, + "learning_rate": 2.303719008264463e-07, + "logits/chosen": -0.189453125, + "logits/rejected": -0.392578125, + "logps/chosen": -396.0, + "logps/rejected": -354.0, + "loss": 0.0993, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.51171875, + "rewards/margins": 7.34375, + "rewards/rejected": -6.84375, + "step": 1330 + }, + { + "epoch": 1.6331288343558281, + "grad_norm": 10.879007538610207, + "learning_rate": 2.3016528925619834e-07, + "logits/chosen": -0.2216796875, + "logits/rejected": -0.298828125, + "logps/chosen": -354.0, + "logps/rejected": -334.0, + "loss": 0.0467, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.177734375, + "rewards/margins": 7.65625, + "rewards/rejected": -7.5, + "step": 1331 + }, + { + "epoch": 1.6343558282208588, + "grad_norm": 13.446509397161874, + "learning_rate": 2.299586776859504e-07, + "logits/chosen": -0.32421875, + "logits/rejected": -0.478515625, + "logps/chosen": -376.0, + "logps/rejected": -344.0, + "loss": 0.057, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.56640625, + "rewards/margins": 7.75, + "rewards/rejected": -7.1875, + "step": 1332 + }, + { + "epoch": 1.6355828220858895, + "grad_norm": 16.15127863637118, + "learning_rate": 2.2975206611570246e-07, + "logits/chosen": -0.333984375, + "logits/rejected": -0.494140625, + "logps/chosen": -406.0, + "logps/rejected": -392.0, + "loss": 0.0739, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.68359375, + "rewards/margins": 7.84375, + "rewards/rejected": -7.15625, + "step": 1333 + }, + { + "epoch": 1.6368098159509201, + "grad_norm": 17.534743533253806, + "learning_rate": 2.2954545454545453e-07, + "logits/chosen": -0.1787109375, + "logits/rejected": -0.32421875, + "logps/chosen": -376.0, + "logps/rejected": -354.0, + "loss": 0.0743, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.0390625, + "rewards/margins": 8.125, + "rewards/rejected": -7.0625, + "step": 1334 + }, + { + "epoch": 1.6380368098159508, + "grad_norm": 18.52826988873188, + "learning_rate": 2.293388429752066e-07, + "logits/chosen": -0.3046875, + "logits/rejected": -0.5078125, + "logps/chosen": -428.0, + "logps/rejected": -348.0, + "loss": 0.0651, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.6171875, + "rewards/margins": 8.3125, + "rewards/rejected": -6.71875, + "step": 1335 + }, + { + "epoch": 1.6392638036809815, + "grad_norm": 17.965308466389157, + "learning_rate": 2.2913223140495865e-07, + "logits/chosen": -0.40625, + "logits/rejected": -0.57421875, + "logps/chosen": -430.0, + "logps/rejected": -384.0, + "loss": 0.0763, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.2021484375, + "rewards/margins": 7.625, + "rewards/rejected": -7.40625, + "step": 1336 + }, + { + "epoch": 1.6404907975460121, + "grad_norm": 10.012028012421737, + "learning_rate": 2.2892561983471072e-07, + "logits/chosen": -0.255859375, + "logits/rejected": -0.4296875, + "logps/chosen": -404.0, + "logps/rejected": -340.0, + "loss": 0.0415, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.15625, + "rewards/margins": 8.4375, + "rewards/rejected": -7.3125, + "step": 1337 + }, + { + "epoch": 1.6417177914110428, + "grad_norm": 14.173589367800568, + "learning_rate": 2.287190082644628e-07, + "logits/chosen": -0.310546875, + "logits/rejected": -0.462890625, + "logps/chosen": -422.0, + "logps/rejected": -368.0, + "loss": 0.0653, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 1.3125, + "rewards/margins": 8.3125, + "rewards/rejected": -7.03125, + "step": 1338 + }, + { + "epoch": 1.6429447852760735, + "grad_norm": 15.30036128462874, + "learning_rate": 2.2851239669421487e-07, + "logits/chosen": -0.2109375, + "logits/rejected": -0.27734375, + "logps/chosen": -382.0, + "logps/rejected": -306.0, + "loss": 0.0705, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.9140625, + "rewards/margins": 7.25, + "rewards/rejected": -6.34375, + "step": 1339 + }, + { + "epoch": 1.6441717791411041, + "grad_norm": 20.532171898033436, + "learning_rate": 2.2830578512396692e-07, + "logits/chosen": -0.1474609375, + "logits/rejected": -0.3125, + "logps/chosen": -404.0, + "logps/rejected": -358.0, + "loss": 0.1092, + "rewards/accuracies": 0.9453125, + "rewards/chosen": 0.96875, + "rewards/margins": 7.65625, + "rewards/rejected": -6.6875, + "step": 1340 + }, + { + "epoch": 1.645398773006135, + "grad_norm": 12.679548714943563, + "learning_rate": 2.28099173553719e-07, + "logits/chosen": -0.283203125, + "logits/rejected": -0.50390625, + "logps/chosen": -434.0, + "logps/rejected": -356.0, + "loss": 0.0602, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.09375, + "rewards/margins": 8.5, + "rewards/rejected": -7.40625, + "step": 1341 + }, + { + "epoch": 1.6466257668711657, + "grad_norm": 11.115897839454503, + "learning_rate": 2.2789256198347107e-07, + "logits/chosen": -0.306640625, + "logits/rejected": -0.52734375, + "logps/chosen": -406.0, + "logps/rejected": -342.0, + "loss": 0.0627, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.94140625, + "rewards/margins": 7.75, + "rewards/rejected": -6.8125, + "step": 1342 + }, + { + "epoch": 1.6478527607361964, + "grad_norm": 34.12595608491008, + "learning_rate": 2.2768595041322314e-07, + "logits/chosen": -0.251953125, + "logits/rejected": -0.4765625, + "logps/chosen": -400.0, + "logps/rejected": -366.0, + "loss": 0.0922, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.57421875, + "rewards/margins": 7.78125, + "rewards/rejected": -7.1875, + "step": 1343 + }, + { + "epoch": 1.649079754601227, + "grad_norm": 9.48136341146751, + "learning_rate": 2.2747933884297519e-07, + "logits/chosen": -0.2353515625, + "logits/rejected": -0.48046875, + "logps/chosen": -430.0, + "logps/rejected": -352.0, + "loss": 0.0335, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.6171875, + "rewards/margins": 8.875, + "rewards/rejected": -7.28125, + "step": 1344 + }, + { + "epoch": 1.6503067484662577, + "grad_norm": 12.960501739052496, + "learning_rate": 2.2727272727272726e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.427734375, + "logps/chosen": -416.0, + "logps/rejected": -344.0, + "loss": 0.0613, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.81640625, + "rewards/margins": 7.34375, + "rewards/rejected": -6.53125, + "step": 1345 + }, + { + "epoch": 1.6515337423312884, + "grad_norm": 18.807785986855734, + "learning_rate": 2.2706611570247933e-07, + "logits/chosen": -0.2080078125, + "logits/rejected": -0.412109375, + "logps/chosen": -432.0, + "logps/rejected": -358.0, + "loss": 0.0758, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.4765625, + "rewards/margins": 8.125, + "rewards/rejected": -6.65625, + "step": 1346 + }, + { + "epoch": 1.652760736196319, + "grad_norm": 23.673167761409484, + "learning_rate": 2.268595041322314e-07, + "logits/chosen": -0.2255859375, + "logits/rejected": -0.3984375, + "logps/chosen": -414.0, + "logps/rejected": -386.0, + "loss": 0.1326, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.140625, + "rewards/margins": 8.0625, + "rewards/rejected": -6.90625, + "step": 1347 + }, + { + "epoch": 1.6539877300613497, + "grad_norm": 16.122336216772645, + "learning_rate": 2.2665289256198348e-07, + "logits/chosen": -0.2314453125, + "logits/rejected": -0.4140625, + "logps/chosen": -336.0, + "logps/rejected": -346.0, + "loss": 0.0849, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.34375, + "rewards/margins": 7.5, + "rewards/rejected": -7.15625, + "step": 1348 + }, + { + "epoch": 1.6552147239263804, + "grad_norm": 14.86877919579818, + "learning_rate": 2.2644628099173553e-07, + "logits/chosen": -0.2119140625, + "logits/rejected": -0.427734375, + "logps/chosen": -364.0, + "logps/rejected": -346.0, + "loss": 0.07, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.1875, + "rewards/margins": 8.1875, + "rewards/rejected": -7.0, + "step": 1349 + }, + { + "epoch": 1.656441717791411, + "grad_norm": 18.59741646820723, + "learning_rate": 2.262396694214876e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.439453125, + "logps/chosen": -426.0, + "logps/rejected": -392.0, + "loss": 0.0808, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 1.109375, + "rewards/margins": 8.3125, + "rewards/rejected": -7.21875, + "step": 1350 + }, + { + "epoch": 1.6576687116564417, + "grad_norm": 21.166780009343633, + "learning_rate": 2.2603305785123965e-07, + "logits/chosen": -0.2060546875, + "logits/rejected": -0.36328125, + "logps/chosen": -392.0, + "logps/rejected": -362.0, + "loss": 0.1151, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.6171875, + "rewards/margins": 8.1875, + "rewards/rejected": -7.59375, + "step": 1351 + }, + { + "epoch": 1.6588957055214724, + "grad_norm": 15.585122070103669, + "learning_rate": 2.2582644628099172e-07, + "logits/chosen": -0.28515625, + "logits/rejected": -0.462890625, + "logps/chosen": -384.0, + "logps/rejected": -362.0, + "loss": 0.0668, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.61328125, + "rewards/margins": 8.375, + "rewards/rejected": -7.78125, + "step": 1352 + }, + { + "epoch": 1.660122699386503, + "grad_norm": 14.880046371397333, + "learning_rate": 2.2561983471074377e-07, + "logits/chosen": -0.20703125, + "logits/rejected": -0.267578125, + "logps/chosen": -370.0, + "logps/rejected": -376.0, + "loss": 0.0768, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.38671875, + "rewards/margins": 7.46875, + "rewards/rejected": -7.09375, + "step": 1353 + }, + { + "epoch": 1.6613496932515337, + "grad_norm": 12.298220568655871, + "learning_rate": 2.2541322314049584e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.4140625, + "logps/chosen": -368.0, + "logps/rejected": -360.0, + "loss": 0.0605, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.470703125, + "rewards/margins": 8.3125, + "rewards/rejected": -7.84375, + "step": 1354 + }, + { + "epoch": 1.6625766871165644, + "grad_norm": 15.107596299136095, + "learning_rate": 2.2520661157024792e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.431640625, + "logps/chosen": -418.0, + "logps/rejected": -388.0, + "loss": 0.0804, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.3515625, + "rewards/margins": 8.0625, + "rewards/rejected": -7.6875, + "step": 1355 + }, + { + "epoch": 1.6638036809815953, + "grad_norm": 17.54774623851973, + "learning_rate": 2.25e-07, + "logits/chosen": -0.2373046875, + "logits/rejected": -0.390625, + "logps/chosen": -406.0, + "logps/rejected": -370.0, + "loss": 0.0853, + "rewards/accuracies": 0.9765625, + "rewards/chosen": -0.1875, + "rewards/margins": 7.78125, + "rewards/rejected": -7.96875, + "step": 1356 + }, + { + "epoch": 1.665030674846626, + "grad_norm": 15.166063658984665, + "learning_rate": 2.2479338842975206e-07, + "logits/chosen": -0.2119140625, + "logits/rejected": -0.423828125, + "logps/chosen": -434.0, + "logps/rejected": -374.0, + "loss": 0.0497, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.51953125, + "rewards/margins": 8.5625, + "rewards/rejected": -8.0, + "step": 1357 + }, + { + "epoch": 1.6662576687116566, + "grad_norm": 23.759115740771684, + "learning_rate": 2.245867768595041e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.51953125, + "logps/chosen": -394.0, + "logps/rejected": -356.0, + "loss": 0.1185, + "rewards/accuracies": 0.953125, + "rewards/chosen": 0.357421875, + "rewards/margins": 7.9375, + "rewards/rejected": -7.59375, + "step": 1358 + }, + { + "epoch": 1.6674846625766873, + "grad_norm": 14.218582322990752, + "learning_rate": 2.2438016528925618e-07, + "logits/chosen": -0.203125, + "logits/rejected": -0.40625, + "logps/chosen": -408.0, + "logps/rejected": -374.0, + "loss": 0.0612, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.75390625, + "rewards/margins": 8.6875, + "rewards/rejected": -7.90625, + "step": 1359 + }, + { + "epoch": 1.668711656441718, + "grad_norm": 17.592110754219437, + "learning_rate": 2.2417355371900826e-07, + "logits/chosen": -0.44140625, + "logits/rejected": -0.671875, + "logps/chosen": -392.0, + "logps/rejected": -350.0, + "loss": 0.0717, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.7265625, + "rewards/margins": 9.0, + "rewards/rejected": -8.3125, + "step": 1360 + }, + { + "epoch": 1.6699386503067486, + "grad_norm": 16.188924499926596, + "learning_rate": 2.2396694214876033e-07, + "logits/chosen": -0.1669921875, + "logits/rejected": -0.349609375, + "logps/chosen": -412.0, + "logps/rejected": -386.0, + "loss": 0.0774, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.640625, + "rewards/margins": 7.9375, + "rewards/rejected": -7.3125, + "step": 1361 + }, + { + "epoch": 1.6711656441717793, + "grad_norm": 15.361293153530223, + "learning_rate": 2.2376033057851238e-07, + "logits/chosen": -0.185546875, + "logits/rejected": -0.33984375, + "logps/chosen": -400.0, + "logps/rejected": -340.0, + "loss": 0.0737, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.70703125, + "rewards/margins": 8.25, + "rewards/rejected": -7.53125, + "step": 1362 + }, + { + "epoch": 1.67239263803681, + "grad_norm": 8.341032677993777, + "learning_rate": 2.2355371900826445e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.48046875, + "logps/chosen": -400.0, + "logps/rejected": -338.0, + "loss": 0.0301, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.40625, + "rewards/margins": 8.75, + "rewards/rejected": -8.375, + "step": 1363 + }, + { + "epoch": 1.6736196319018406, + "grad_norm": 12.421668434382628, + "learning_rate": 2.2334710743801653e-07, + "logits/chosen": -0.1572265625, + "logits/rejected": -0.337890625, + "logps/chosen": -370.0, + "logps/rejected": -320.0, + "loss": 0.0541, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.828125, + "rewards/margins": 8.3125, + "rewards/rejected": -7.46875, + "step": 1364 + }, + { + "epoch": 1.6748466257668713, + "grad_norm": 19.457292895572753, + "learning_rate": 2.231404958677686e-07, + "logits/chosen": -0.1318359375, + "logits/rejected": -0.314453125, + "logps/chosen": -404.0, + "logps/rejected": -334.0, + "loss": 0.0932, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 1.0078125, + "rewards/margins": 8.4375, + "rewards/rejected": -7.40625, + "step": 1365 + }, + { + "epoch": 1.676073619631902, + "grad_norm": 12.148316797835403, + "learning_rate": 2.2293388429752067e-07, + "logits/chosen": -0.185546875, + "logits/rejected": -0.41015625, + "logps/chosen": -394.0, + "logps/rejected": -340.0, + "loss": 0.0526, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.171875, + "rewards/margins": 8.4375, + "rewards/rejected": -7.25, + "step": 1366 + }, + { + "epoch": 1.6773006134969326, + "grad_norm": 18.305089562800763, + "learning_rate": 2.2272727272727272e-07, + "logits/chosen": -0.1611328125, + "logits/rejected": -0.314453125, + "logps/chosen": -390.0, + "logps/rejected": -362.0, + "loss": 0.0841, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.0859375, + "rewards/margins": 8.5625, + "rewards/rejected": -7.46875, + "step": 1367 + }, + { + "epoch": 1.6785276073619633, + "grad_norm": 18.572318285517575, + "learning_rate": 2.225206611570248e-07, + "logits/chosen": -0.365234375, + "logits/rejected": -0.5234375, + "logps/chosen": -398.0, + "logps/rejected": -356.0, + "loss": 0.074, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.5703125, + "rewards/margins": 8.375, + "rewards/rejected": -7.8125, + "step": 1368 + }, + { + "epoch": 1.679754601226994, + "grad_norm": 19.9117710225746, + "learning_rate": 2.2231404958677684e-07, + "logits/chosen": -0.310546875, + "logits/rejected": -0.5078125, + "logps/chosen": -400.0, + "logps/rejected": -358.0, + "loss": 0.106, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.43359375, + "rewards/margins": 7.5625, + "rewards/rejected": -7.125, + "step": 1369 + }, + { + "epoch": 1.6809815950920246, + "grad_norm": 15.686180424711136, + "learning_rate": 2.2210743801652891e-07, + "logits/chosen": -0.244140625, + "logits/rejected": -0.373046875, + "logps/chosen": -378.0, + "logps/rejected": -370.0, + "loss": 0.0619, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.95703125, + "rewards/margins": 8.5625, + "rewards/rejected": -7.59375, + "step": 1370 + }, + { + "epoch": 1.6822085889570553, + "grad_norm": 18.767760847804734, + "learning_rate": 2.2190082644628096e-07, + "logits/chosen": -0.1806640625, + "logits/rejected": -0.455078125, + "logps/chosen": -462.0, + "logps/rejected": -392.0, + "loss": 0.0866, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 1.3515625, + "rewards/margins": 8.75, + "rewards/rejected": -7.40625, + "step": 1371 + }, + { + "epoch": 1.683435582822086, + "grad_norm": 14.184679430176294, + "learning_rate": 2.2169421487603303e-07, + "logits/chosen": -0.2333984375, + "logits/rejected": -0.458984375, + "logps/chosen": -388.0, + "logps/rejected": -348.0, + "loss": 0.0663, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.15625, + "rewards/margins": 8.4375, + "rewards/rejected": -7.25, + "step": 1372 + }, + { + "epoch": 1.6846625766871166, + "grad_norm": 16.224614188238743, + "learning_rate": 2.214876033057851e-07, + "logits/chosen": -0.2001953125, + "logits/rejected": -0.296875, + "logps/chosen": -372.0, + "logps/rejected": -376.0, + "loss": 0.0656, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.91015625, + "rewards/margins": 8.1875, + "rewards/rejected": -7.25, + "step": 1373 + }, + { + "epoch": 1.6858895705521473, + "grad_norm": 17.941736123412625, + "learning_rate": 2.2128099173553718e-07, + "logits/chosen": -0.138671875, + "logits/rejected": -0.365234375, + "logps/chosen": -392.0, + "logps/rejected": -334.0, + "loss": 0.0966, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.416015625, + "rewards/margins": 7.28125, + "rewards/rejected": -6.84375, + "step": 1374 + }, + { + "epoch": 1.687116564417178, + "grad_norm": 17.848589060773275, + "learning_rate": 2.2107438016528926e-07, + "logits/chosen": -0.1650390625, + "logits/rejected": -0.28125, + "logps/chosen": -324.0, + "logps/rejected": -324.0, + "loss": 0.0882, + "rewards/accuracies": 0.953125, + "rewards/chosen": 0.59765625, + "rewards/margins": 7.40625, + "rewards/rejected": -6.8125, + "step": 1375 + }, + { + "epoch": 1.6883435582822086, + "grad_norm": 11.38717599254382, + "learning_rate": 2.208677685950413e-07, + "logits/chosen": -0.302734375, + "logits/rejected": -0.416015625, + "logps/chosen": -356.0, + "logps/rejected": -362.0, + "loss": 0.0518, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.8359375, + "rewards/margins": 8.125, + "rewards/rejected": -7.3125, + "step": 1376 + }, + { + "epoch": 1.6895705521472393, + "grad_norm": 14.720332823269564, + "learning_rate": 2.2066115702479338e-07, + "logits/chosen": -0.275390625, + "logits/rejected": -0.45703125, + "logps/chosen": -356.0, + "logps/rejected": -342.0, + "loss": 0.0616, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.1328125, + "rewards/margins": 8.875, + "rewards/rejected": -7.71875, + "step": 1377 + }, + { + "epoch": 1.69079754601227, + "grad_norm": 13.510981013957442, + "learning_rate": 2.2045454545454545e-07, + "logits/chosen": -0.2490234375, + "logits/rejected": -0.423828125, + "logps/chosen": -362.0, + "logps/rejected": -324.0, + "loss": 0.0651, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.283203125, + "rewards/margins": 6.96875, + "rewards/rejected": -6.6875, + "step": 1378 + }, + { + "epoch": 1.6920245398773006, + "grad_norm": 18.434706532368633, + "learning_rate": 2.2024793388429752e-07, + "logits/chosen": -0.26171875, + "logits/rejected": -0.4140625, + "logps/chosen": -406.0, + "logps/rejected": -342.0, + "loss": 0.0931, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.0078125, + "rewards/margins": 7.28125, + "rewards/rejected": -6.28125, + "step": 1379 + }, + { + "epoch": 1.6932515337423313, + "grad_norm": 12.034468321990309, + "learning_rate": 2.2004132231404957e-07, + "logits/chosen": -0.2109375, + "logits/rejected": -0.43359375, + "logps/chosen": -418.0, + "logps/rejected": -320.0, + "loss": 0.0512, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.171875, + "rewards/margins": 7.8125, + "rewards/rejected": -6.65625, + "step": 1380 + }, + { + "epoch": 1.694478527607362, + "grad_norm": 15.645405456809128, + "learning_rate": 2.1983471074380164e-07, + "logits/chosen": -0.1533203125, + "logits/rejected": -0.19140625, + "logps/chosen": -360.0, + "logps/rejected": -330.0, + "loss": 0.0782, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.4921875, + "rewards/margins": 6.78125, + "rewards/rejected": -6.3125, + "step": 1381 + }, + { + "epoch": 1.6957055214723926, + "grad_norm": 16.91884584124202, + "learning_rate": 2.1962809917355372e-07, + "logits/chosen": -0.216796875, + "logits/rejected": -0.337890625, + "logps/chosen": -344.0, + "logps/rejected": -342.0, + "loss": 0.0816, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.326171875, + "rewards/margins": 7.21875, + "rewards/rejected": -6.875, + "step": 1382 + }, + { + "epoch": 1.6969325153374233, + "grad_norm": 11.903486632622387, + "learning_rate": 2.194214876033058e-07, + "logits/chosen": -0.228515625, + "logits/rejected": -0.42578125, + "logps/chosen": -384.0, + "logps/rejected": -356.0, + "loss": 0.0562, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.2421875, + "rewards/margins": 7.9375, + "rewards/rejected": -6.6875, + "step": 1383 + }, + { + "epoch": 1.698159509202454, + "grad_norm": 17.069495831518065, + "learning_rate": 2.1921487603305786e-07, + "logits/chosen": -0.109375, + "logits/rejected": -0.2255859375, + "logps/chosen": -364.0, + "logps/rejected": -318.0, + "loss": 0.079, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.58984375, + "rewards/margins": 6.96875, + "rewards/rejected": -6.375, + "step": 1384 + }, + { + "epoch": 1.6993865030674846, + "grad_norm": 19.747804821888522, + "learning_rate": 2.190082644628099e-07, + "logits/chosen": -0.2265625, + "logits/rejected": -0.3515625, + "logps/chosen": -324.0, + "logps/rejected": -308.0, + "loss": 0.1035, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.88671875, + "rewards/margins": 7.375, + "rewards/rejected": -6.46875, + "step": 1385 + }, + { + "epoch": 1.7006134969325153, + "grad_norm": 13.581915417491894, + "learning_rate": 2.1880165289256198e-07, + "logits/chosen": -0.357421875, + "logits/rejected": -0.57421875, + "logps/chosen": -414.0, + "logps/rejected": -370.0, + "loss": 0.0691, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.53125, + "rewards/margins": 8.5625, + "rewards/rejected": -7.0, + "step": 1386 + }, + { + "epoch": 1.701840490797546, + "grad_norm": 14.596333416373868, + "learning_rate": 2.1859504132231403e-07, + "logits/chosen": -0.291015625, + "logits/rejected": -0.48046875, + "logps/chosen": -424.0, + "logps/rejected": -404.0, + "loss": 0.0695, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.21875, + "rewards/margins": 8.3125, + "rewards/rejected": -7.09375, + "step": 1387 + }, + { + "epoch": 1.7030674846625766, + "grad_norm": 13.484939157978427, + "learning_rate": 2.183884297520661e-07, + "logits/chosen": -0.1318359375, + "logits/rejected": -0.265625, + "logps/chosen": -370.0, + "logps/rejected": -318.0, + "loss": 0.0627, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.427734375, + "rewards/margins": 6.90625, + "rewards/rejected": -6.46875, + "step": 1388 + }, + { + "epoch": 1.7042944785276073, + "grad_norm": 17.094111554639458, + "learning_rate": 2.1818181818181815e-07, + "logits/chosen": -0.3515625, + "logits/rejected": -0.47265625, + "logps/chosen": -404.0, + "logps/rejected": -372.0, + "loss": 0.0868, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.140625, + "rewards/margins": 8.125, + "rewards/rejected": -6.96875, + "step": 1389 + }, + { + "epoch": 1.705521472392638, + "grad_norm": 16.274828434391722, + "learning_rate": 2.1797520661157023e-07, + "logits/chosen": -0.255859375, + "logits/rejected": -0.392578125, + "logps/chosen": -368.0, + "logps/rejected": -348.0, + "loss": 0.0716, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.78515625, + "rewards/margins": 7.96875, + "rewards/rejected": -7.1875, + "step": 1390 + }, + { + "epoch": 1.7067484662576686, + "grad_norm": 11.87067599264675, + "learning_rate": 2.177685950413223e-07, + "logits/chosen": -0.2412109375, + "logits/rejected": -0.4921875, + "logps/chosen": -390.0, + "logps/rejected": -352.0, + "loss": 0.0632, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.3359375, + "rewards/margins": 7.84375, + "rewards/rejected": -6.5, + "step": 1391 + }, + { + "epoch": 1.7079754601226993, + "grad_norm": 17.25338097827695, + "learning_rate": 2.1756198347107437e-07, + "logits/chosen": -0.1162109375, + "logits/rejected": -0.28125, + "logps/chosen": -354.0, + "logps/rejected": -310.0, + "loss": 0.0945, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.5234375, + "rewards/margins": 6.6875, + "rewards/rejected": -6.15625, + "step": 1392 + }, + { + "epoch": 1.70920245398773, + "grad_norm": 16.42960478781209, + "learning_rate": 2.1735537190082642e-07, + "logits/chosen": -0.28515625, + "logits/rejected": -0.47265625, + "logps/chosen": -370.0, + "logps/rejected": -310.0, + "loss": 0.0731, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.125, + "rewards/margins": 7.46875, + "rewards/rejected": -6.34375, + "step": 1393 + }, + { + "epoch": 1.7104294478527606, + "grad_norm": 18.523314751619992, + "learning_rate": 2.171487603305785e-07, + "logits/chosen": -0.33203125, + "logits/rejected": -0.494140625, + "logps/chosen": -398.0, + "logps/rejected": -344.0, + "loss": 0.0852, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.0, + "rewards/margins": 7.9375, + "rewards/rejected": -6.9375, + "step": 1394 + }, + { + "epoch": 1.7116564417177913, + "grad_norm": 11.026592204166407, + "learning_rate": 2.1694214876033057e-07, + "logits/chosen": -0.2373046875, + "logits/rejected": -0.43359375, + "logps/chosen": -404.0, + "logps/rejected": -344.0, + "loss": 0.0515, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.0078125, + "rewards/margins": 7.4375, + "rewards/rejected": -6.4375, + "step": 1395 + }, + { + "epoch": 1.712883435582822, + "grad_norm": 16.055124496226444, + "learning_rate": 2.1673553719008264e-07, + "logits/chosen": -0.09619140625, + "logits/rejected": -0.298828125, + "logps/chosen": -374.0, + "logps/rejected": -328.0, + "loss": 0.0724, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.25, + "rewards/margins": 8.3125, + "rewards/rejected": -7.03125, + "step": 1396 + }, + { + "epoch": 1.7141104294478526, + "grad_norm": 12.449061995438948, + "learning_rate": 2.1652892561983471e-07, + "logits/chosen": -0.2294921875, + "logits/rejected": -0.390625, + "logps/chosen": -382.0, + "logps/rejected": -342.0, + "loss": 0.0569, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.7578125, + "rewards/margins": 8.625, + "rewards/rejected": -6.84375, + "step": 1397 + }, + { + "epoch": 1.7153374233128833, + "grad_norm": 15.87205293658849, + "learning_rate": 2.1632231404958676e-07, + "logits/chosen": -0.1943359375, + "logits/rejected": -0.314453125, + "logps/chosen": -424.0, + "logps/rejected": -380.0, + "loss": 0.0678, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.3046875, + "rewards/margins": 7.9375, + "rewards/rejected": -6.65625, + "step": 1398 + }, + { + "epoch": 1.716564417177914, + "grad_norm": 19.398626301714504, + "learning_rate": 2.1611570247933884e-07, + "logits/chosen": -0.1494140625, + "logits/rejected": -0.275390625, + "logps/chosen": -354.0, + "logps/rejected": -362.0, + "loss": 0.0837, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.8125, + "rewards/margins": 7.375, + "rewards/rejected": -6.5625, + "step": 1399 + }, + { + "epoch": 1.7177914110429446, + "grad_norm": 15.517028901266931, + "learning_rate": 2.159090909090909e-07, + "logits/chosen": -0.1669921875, + "logits/rejected": -0.35546875, + "logps/chosen": -336.0, + "logps/rejected": -312.0, + "loss": 0.0559, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.349609375, + "rewards/margins": 7.1875, + "rewards/rejected": -6.84375, + "step": 1400 + }, + { + "epoch": 1.7190184049079753, + "grad_norm": 14.220419180497366, + "learning_rate": 2.1570247933884298e-07, + "logits/chosen": -0.2373046875, + "logits/rejected": -0.458984375, + "logps/chosen": -442.0, + "logps/rejected": -394.0, + "loss": 0.0688, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.1328125, + "rewards/margins": 8.125, + "rewards/rejected": -6.96875, + "step": 1401 + }, + { + "epoch": 1.720245398773006, + "grad_norm": 15.464638402446901, + "learning_rate": 2.1549586776859503e-07, + "logits/chosen": -0.255859375, + "logits/rejected": -0.453125, + "logps/chosen": -400.0, + "logps/rejected": -326.0, + "loss": 0.0758, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.86328125, + "rewards/margins": 7.6875, + "rewards/rejected": -6.84375, + "step": 1402 + }, + { + "epoch": 1.7214723926380369, + "grad_norm": 11.136803364904123, + "learning_rate": 2.152892561983471e-07, + "logits/chosen": -0.1669921875, + "logits/rejected": -0.30859375, + "logps/chosen": -400.0, + "logps/rejected": -346.0, + "loss": 0.0475, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.81640625, + "rewards/margins": 7.625, + "rewards/rejected": -6.8125, + "step": 1403 + }, + { + "epoch": 1.7226993865030675, + "grad_norm": 16.698481888758884, + "learning_rate": 2.1508264462809918e-07, + "logits/chosen": -0.1689453125, + "logits/rejected": -0.318359375, + "logps/chosen": -330.0, + "logps/rejected": -288.0, + "loss": 0.0725, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.1953125, + "rewards/margins": 7.875, + "rewards/rejected": -6.6875, + "step": 1404 + }, + { + "epoch": 1.7239263803680982, + "grad_norm": 16.003372973080417, + "learning_rate": 2.1487603305785122e-07, + "logits/chosen": -0.265625, + "logits/rejected": -0.447265625, + "logps/chosen": -420.0, + "logps/rejected": -372.0, + "loss": 0.0745, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.9453125, + "rewards/margins": 8.375, + "rewards/rejected": -7.46875, + "step": 1405 + }, + { + "epoch": 1.7251533742331289, + "grad_norm": 9.529560720768151, + "learning_rate": 2.146694214876033e-07, + "logits/chosen": -0.375, + "logits/rejected": -0.494140625, + "logps/chosen": -320.0, + "logps/rejected": -330.0, + "loss": 0.0387, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.431640625, + "rewards/margins": 8.1875, + "rewards/rejected": -7.75, + "step": 1406 + }, + { + "epoch": 1.7263803680981595, + "grad_norm": 19.251033754740302, + "learning_rate": 2.1446280991735534e-07, + "logits/chosen": -0.19921875, + "logits/rejected": -0.47265625, + "logps/chosen": -436.0, + "logps/rejected": -382.0, + "loss": 0.0912, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.1328125, + "rewards/margins": 8.0625, + "rewards/rejected": -6.9375, + "step": 1407 + }, + { + "epoch": 1.7276073619631902, + "grad_norm": 13.693844317306695, + "learning_rate": 2.1425619834710742e-07, + "logits/chosen": -0.232421875, + "logits/rejected": -0.38671875, + "logps/chosen": -468.0, + "logps/rejected": -388.0, + "loss": 0.081, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.078125, + "rewards/margins": 8.0625, + "rewards/rejected": -7.0, + "step": 1408 + }, + { + "epoch": 1.7288343558282209, + "grad_norm": 20.257304426634505, + "learning_rate": 2.140495867768595e-07, + "logits/chosen": -0.2021484375, + "logits/rejected": -0.353515625, + "logps/chosen": -374.0, + "logps/rejected": -332.0, + "loss": 0.0852, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.625, + "rewards/margins": 7.90625, + "rewards/rejected": -7.28125, + "step": 1409 + }, + { + "epoch": 1.7300613496932515, + "grad_norm": 13.551924350908378, + "learning_rate": 2.1384297520661157e-07, + "logits/chosen": -0.265625, + "logits/rejected": -0.431640625, + "logps/chosen": -392.0, + "logps/rejected": -344.0, + "loss": 0.0748, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.3203125, + "rewards/margins": 7.34375, + "rewards/rejected": -7.03125, + "step": 1410 + }, + { + "epoch": 1.7312883435582822, + "grad_norm": 15.891870826112665, + "learning_rate": 2.136363636363636e-07, + "logits/chosen": -0.2255859375, + "logits/rejected": -0.380859375, + "logps/chosen": -352.0, + "logps/rejected": -336.0, + "loss": 0.0752, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.2353515625, + "rewards/margins": 7.53125, + "rewards/rejected": -7.28125, + "step": 1411 + }, + { + "epoch": 1.7325153374233129, + "grad_norm": 18.391292263031794, + "learning_rate": 2.1342975206611569e-07, + "logits/chosen": -0.181640625, + "logits/rejected": -0.419921875, + "logps/chosen": -422.0, + "logps/rejected": -352.0, + "loss": 0.0868, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.015625, + "rewards/margins": 8.1875, + "rewards/rejected": -7.15625, + "step": 1412 + }, + { + "epoch": 1.7337423312883435, + "grad_norm": 15.650264623612461, + "learning_rate": 2.1322314049586776e-07, + "logits/chosen": -0.3046875, + "logits/rejected": -0.515625, + "logps/chosen": -390.0, + "logps/rejected": -344.0, + "loss": 0.0827, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.3203125, + "rewards/margins": 8.0625, + "rewards/rejected": -7.78125, + "step": 1413 + }, + { + "epoch": 1.7349693251533742, + "grad_norm": 12.284760841451385, + "learning_rate": 2.1301652892561983e-07, + "logits/chosen": -0.1962890625, + "logits/rejected": -0.380859375, + "logps/chosen": -430.0, + "logps/rejected": -348.0, + "loss": 0.0614, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.8671875, + "rewards/margins": 8.0625, + "rewards/rejected": -7.1875, + "step": 1414 + }, + { + "epoch": 1.7361963190184049, + "grad_norm": 20.17803266616993, + "learning_rate": 2.128099173553719e-07, + "logits/chosen": -0.25, + "logits/rejected": -0.427734375, + "logps/chosen": -342.0, + "logps/rejected": -336.0, + "loss": 0.1033, + "rewards/accuracies": 0.953125, + "rewards/chosen": 0.69140625, + "rewards/margins": 8.0625, + "rewards/rejected": -7.34375, + "step": 1415 + }, + { + "epoch": 1.7374233128834355, + "grad_norm": 14.41675185361736, + "learning_rate": 2.1260330578512395e-07, + "logits/chosen": -0.1875, + "logits/rejected": -0.44921875, + "logps/chosen": -414.0, + "logps/rejected": -358.0, + "loss": 0.0681, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.3203125, + "rewards/margins": 8.625, + "rewards/rejected": -7.3125, + "step": 1416 + }, + { + "epoch": 1.7386503067484662, + "grad_norm": 13.637638277625397, + "learning_rate": 2.1239669421487603e-07, + "logits/chosen": -0.298828125, + "logits/rejected": -0.4453125, + "logps/chosen": -364.0, + "logps/rejected": -342.0, + "loss": 0.0537, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.95703125, + "rewards/margins": 8.625, + "rewards/rejected": -7.65625, + "step": 1417 + }, + { + "epoch": 1.7398773006134969, + "grad_norm": 16.04836111882316, + "learning_rate": 2.121900826446281e-07, + "logits/chosen": -0.2080078125, + "logits/rejected": -0.443359375, + "logps/chosen": -392.0, + "logps/rejected": -360.0, + "loss": 0.0676, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.46875, + "rewards/margins": 8.0625, + "rewards/rejected": -7.625, + "step": 1418 + }, + { + "epoch": 1.7411042944785278, + "grad_norm": 17.60613924094049, + "learning_rate": 2.1198347107438017e-07, + "logits/chosen": -0.1953125, + "logits/rejected": -0.31640625, + "logps/chosen": -336.0, + "logps/rejected": -300.0, + "loss": 0.0918, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.240234375, + "rewards/margins": 7.125, + "rewards/rejected": -6.875, + "step": 1419 + }, + { + "epoch": 1.7423312883435584, + "grad_norm": 16.77386957431945, + "learning_rate": 2.1177685950413222e-07, + "logits/chosen": -0.3828125, + "logits/rejected": -0.53515625, + "logps/chosen": -420.0, + "logps/rejected": -376.0, + "loss": 0.063, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.94921875, + "rewards/margins": 8.8125, + "rewards/rejected": -7.84375, + "step": 1420 + }, + { + "epoch": 1.743558282208589, + "grad_norm": 16.131730598262237, + "learning_rate": 2.115702479338843e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.48828125, + "logps/chosen": -372.0, + "logps/rejected": -346.0, + "loss": 0.0747, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.80859375, + "rewards/margins": 8.625, + "rewards/rejected": -7.84375, + "step": 1421 + }, + { + "epoch": 1.7447852760736198, + "grad_norm": 17.61757832980583, + "learning_rate": 2.1136363636363634e-07, + "logits/chosen": -0.19921875, + "logits/rejected": -0.361328125, + "logps/chosen": -392.0, + "logps/rejected": -352.0, + "loss": 0.1045, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.61328125, + "rewards/margins": 7.75, + "rewards/rejected": -7.15625, + "step": 1422 + }, + { + "epoch": 1.7460122699386504, + "grad_norm": 13.939746523177984, + "learning_rate": 2.1115702479338842e-07, + "logits/chosen": -0.244140625, + "logits/rejected": -0.4296875, + "logps/chosen": -372.0, + "logps/rejected": -376.0, + "loss": 0.0647, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.01300048828125, + "rewards/margins": 8.5, + "rewards/rejected": -8.5, + "step": 1423 + }, + { + "epoch": 1.747239263803681, + "grad_norm": 14.67260116724575, + "learning_rate": 2.109504132231405e-07, + "logits/chosen": -0.32421875, + "logits/rejected": -0.55859375, + "logps/chosen": -420.0, + "logps/rejected": -368.0, + "loss": 0.0749, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.63671875, + "rewards/margins": 8.375, + "rewards/rejected": -7.75, + "step": 1424 + }, + { + "epoch": 1.7484662576687118, + "grad_norm": 16.696897448348274, + "learning_rate": 2.1074380165289254e-07, + "logits/chosen": -0.212890625, + "logits/rejected": -0.333984375, + "logps/chosen": -380.0, + "logps/rejected": -352.0, + "loss": 0.0759, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.8046875, + "rewards/margins": 8.5, + "rewards/rejected": -7.6875, + "step": 1425 + }, + { + "epoch": 1.7496932515337424, + "grad_norm": 19.738799668803697, + "learning_rate": 2.105371900826446e-07, + "logits/chosen": -0.22265625, + "logits/rejected": -0.400390625, + "logps/chosen": -370.0, + "logps/rejected": -350.0, + "loss": 0.1129, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.75390625, + "rewards/margins": 8.25, + "rewards/rejected": -7.53125, + "step": 1426 + }, + { + "epoch": 1.7509202453987731, + "grad_norm": 23.116727331558348, + "learning_rate": 2.1033057851239668e-07, + "logits/chosen": -0.2197265625, + "logits/rejected": -0.369140625, + "logps/chosen": -378.0, + "logps/rejected": -346.0, + "loss": 0.0914, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.66015625, + "rewards/margins": 7.34375, + "rewards/rejected": -6.6875, + "step": 1427 + }, + { + "epoch": 1.7521472392638038, + "grad_norm": 15.978181082257217, + "learning_rate": 2.1012396694214876e-07, + "logits/chosen": -0.279296875, + "logits/rejected": -0.400390625, + "logps/chosen": -420.0, + "logps/rejected": -368.0, + "loss": 0.0733, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.94921875, + "rewards/margins": 8.1875, + "rewards/rejected": -7.25, + "step": 1428 + }, + { + "epoch": 1.7533742331288344, + "grad_norm": 13.101048295432259, + "learning_rate": 2.099173553719008e-07, + "logits/chosen": -0.236328125, + "logits/rejected": -0.40625, + "logps/chosen": -350.0, + "logps/rejected": -322.0, + "loss": 0.0656, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.7578125, + "rewards/margins": 7.9375, + "rewards/rejected": -7.15625, + "step": 1429 + }, + { + "epoch": 1.7546012269938651, + "grad_norm": 14.161965896927917, + "learning_rate": 2.0971074380165288e-07, + "logits/chosen": -0.298828125, + "logits/rejected": -0.400390625, + "logps/chosen": -382.0, + "logps/rejected": -374.0, + "loss": 0.0647, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.87109375, + "rewards/margins": 8.0625, + "rewards/rejected": -7.21875, + "step": 1430 + }, + { + "epoch": 1.7558282208588958, + "grad_norm": 16.980035984498166, + "learning_rate": 2.0950413223140495e-07, + "logits/chosen": -0.1279296875, + "logits/rejected": -0.29296875, + "logps/chosen": -392.0, + "logps/rejected": -340.0, + "loss": 0.0756, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.6015625, + "rewards/margins": 6.90625, + "rewards/rejected": -6.3125, + "step": 1431 + }, + { + "epoch": 1.7570552147239265, + "grad_norm": 8.82012662430086, + "learning_rate": 2.0929752066115702e-07, + "logits/chosen": -0.27734375, + "logits/rejected": -0.33203125, + "logps/chosen": -332.0, + "logps/rejected": -338.0, + "loss": 0.0325, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.859375, + "rewards/margins": 8.125, + "rewards/rejected": -7.25, + "step": 1432 + }, + { + "epoch": 1.7582822085889571, + "grad_norm": 21.489725350493686, + "learning_rate": 2.0909090909090907e-07, + "logits/chosen": -0.11376953125, + "logits/rejected": -0.2236328125, + "logps/chosen": -356.0, + "logps/rejected": -314.0, + "loss": 0.1281, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.314453125, + "rewards/margins": 6.4375, + "rewards/rejected": -6.125, + "step": 1433 + }, + { + "epoch": 1.7595092024539878, + "grad_norm": 16.75596458072332, + "learning_rate": 2.0888429752066115e-07, + "logits/chosen": -0.1357421875, + "logits/rejected": -0.2392578125, + "logps/chosen": -340.0, + "logps/rejected": -372.0, + "loss": 0.0847, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.54296875, + "rewards/margins": 6.90625, + "rewards/rejected": -6.375, + "step": 1434 + }, + { + "epoch": 1.7607361963190185, + "grad_norm": 11.247313981371901, + "learning_rate": 2.0867768595041322e-07, + "logits/chosen": -0.171875, + "logits/rejected": -0.298828125, + "logps/chosen": -346.0, + "logps/rejected": -330.0, + "loss": 0.0495, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.8671875, + "rewards/margins": 7.4375, + "rewards/rejected": -6.5625, + "step": 1435 + }, + { + "epoch": 1.7619631901840491, + "grad_norm": 10.805603892610375, + "learning_rate": 2.084710743801653e-07, + "logits/chosen": -0.205078125, + "logits/rejected": -0.4140625, + "logps/chosen": -386.0, + "logps/rejected": -362.0, + "loss": 0.0436, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.6640625, + "rewards/margins": 8.4375, + "rewards/rejected": -6.78125, + "step": 1436 + }, + { + "epoch": 1.7631901840490798, + "grad_norm": 14.225929279453966, + "learning_rate": 2.0826446280991737e-07, + "logits/chosen": -0.330078125, + "logits/rejected": -0.52734375, + "logps/chosen": -392.0, + "logps/rejected": -374.0, + "loss": 0.0601, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.8515625, + "rewards/margins": 8.125, + "rewards/rejected": -7.28125, + "step": 1437 + }, + { + "epoch": 1.7644171779141105, + "grad_norm": 14.206588051701008, + "learning_rate": 2.080578512396694e-07, + "logits/chosen": -0.232421875, + "logits/rejected": -0.400390625, + "logps/chosen": -376.0, + "logps/rejected": -342.0, + "loss": 0.0661, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.8125, + "rewards/margins": 7.3125, + "rewards/rejected": -6.5, + "step": 1438 + }, + { + "epoch": 1.7656441717791411, + "grad_norm": 14.751935537893047, + "learning_rate": 2.0785123966942149e-07, + "logits/chosen": -0.265625, + "logits/rejected": -0.498046875, + "logps/chosen": -364.0, + "logps/rejected": -332.0, + "loss": 0.0655, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.298828125, + "rewards/margins": 6.875, + "rewards/rejected": -6.59375, + "step": 1439 + }, + { + "epoch": 1.7668711656441718, + "grad_norm": 10.248816305534282, + "learning_rate": 2.0764462809917353e-07, + "logits/chosen": -0.2373046875, + "logits/rejected": -0.44140625, + "logps/chosen": -464.0, + "logps/rejected": -388.0, + "loss": 0.0415, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.4765625, + "rewards/margins": 8.6875, + "rewards/rejected": -7.21875, + "step": 1440 + }, + { + "epoch": 1.7680981595092025, + "grad_norm": 14.481804933484959, + "learning_rate": 2.074380165289256e-07, + "logits/chosen": -0.375, + "logits/rejected": -0.458984375, + "logps/chosen": -356.0, + "logps/rejected": -356.0, + "loss": 0.0639, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.6796875, + "rewards/margins": 8.25, + "rewards/rejected": -7.5625, + "step": 1441 + }, + { + "epoch": 1.7693251533742331, + "grad_norm": 22.015809991017704, + "learning_rate": 2.0723140495867765e-07, + "logits/chosen": -0.326171875, + "logits/rejected": -0.5390625, + "logps/chosen": -428.0, + "logps/rejected": -362.0, + "loss": 0.095, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.67578125, + "rewards/margins": 7.75, + "rewards/rejected": -7.09375, + "step": 1442 + }, + { + "epoch": 1.7705521472392638, + "grad_norm": 18.13219015401745, + "learning_rate": 2.0702479338842973e-07, + "logits/chosen": -0.177734375, + "logits/rejected": -0.32421875, + "logps/chosen": -416.0, + "logps/rejected": -372.0, + "loss": 0.0726, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.0859375, + "rewards/margins": 8.25, + "rewards/rejected": -7.1875, + "step": 1443 + }, + { + "epoch": 1.7717791411042945, + "grad_norm": 13.491518159612902, + "learning_rate": 2.068181818181818e-07, + "logits/chosen": -0.23828125, + "logits/rejected": -0.40625, + "logps/chosen": -392.0, + "logps/rejected": -358.0, + "loss": 0.06, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.3203125, + "rewards/margins": 8.5625, + "rewards/rejected": -7.25, + "step": 1444 + }, + { + "epoch": 1.7730061349693251, + "grad_norm": 15.30212850788442, + "learning_rate": 2.0661157024793388e-07, + "logits/chosen": -0.1845703125, + "logits/rejected": -0.361328125, + "logps/chosen": -324.0, + "logps/rejected": -312.0, + "loss": 0.061, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.4453125, + "rewards/margins": 7.65625, + "rewards/rejected": -7.1875, + "step": 1445 + }, + { + "epoch": 1.7742331288343558, + "grad_norm": 19.853430884853257, + "learning_rate": 2.0640495867768595e-07, + "logits/chosen": -0.185546875, + "logits/rejected": -0.361328125, + "logps/chosen": -410.0, + "logps/rejected": -372.0, + "loss": 0.0697, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.875, + "rewards/margins": 8.6875, + "rewards/rejected": -7.8125, + "step": 1446 + }, + { + "epoch": 1.7754601226993865, + "grad_norm": 19.056315617912155, + "learning_rate": 2.06198347107438e-07, + "logits/chosen": -0.318359375, + "logits/rejected": -0.490234375, + "logps/chosen": -378.0, + "logps/rejected": -344.0, + "loss": 0.0889, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.56640625, + "rewards/margins": 7.71875, + "rewards/rejected": -7.15625, + "step": 1447 + }, + { + "epoch": 1.7766871165644171, + "grad_norm": 16.621289468269772, + "learning_rate": 2.0599173553719007e-07, + "logits/chosen": -0.1982421875, + "logits/rejected": -0.314453125, + "logps/chosen": -336.0, + "logps/rejected": -332.0, + "loss": 0.0775, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.10498046875, + "rewards/margins": 7.25, + "rewards/rejected": -7.15625, + "step": 1448 + }, + { + "epoch": 1.7779141104294478, + "grad_norm": 11.93963310782536, + "learning_rate": 2.0578512396694214e-07, + "logits/chosen": -0.1103515625, + "logits/rejected": -0.310546875, + "logps/chosen": -422.0, + "logps/rejected": -376.0, + "loss": 0.0554, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.6953125, + "rewards/margins": 7.46875, + "rewards/rejected": -6.78125, + "step": 1449 + }, + { + "epoch": 1.7791411042944785, + "grad_norm": 15.776220257842827, + "learning_rate": 2.0557851239669422e-07, + "logits/chosen": -0.26171875, + "logits/rejected": -0.43359375, + "logps/chosen": -420.0, + "logps/rejected": -350.0, + "loss": 0.0741, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.9375, + "rewards/margins": 7.90625, + "rewards/rejected": -6.96875, + "step": 1450 + }, + { + "epoch": 1.7803680981595091, + "grad_norm": 14.007286299216013, + "learning_rate": 2.0537190082644626e-07, + "logits/chosen": -0.16796875, + "logits/rejected": -0.326171875, + "logps/chosen": -416.0, + "logps/rejected": -362.0, + "loss": 0.0655, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.09375, + "rewards/margins": 8.125, + "rewards/rejected": -7.03125, + "step": 1451 + }, + { + "epoch": 1.7815950920245398, + "grad_norm": 8.277122483844174, + "learning_rate": 2.0516528925619834e-07, + "logits/chosen": -0.359375, + "logits/rejected": -0.59765625, + "logps/chosen": -448.0, + "logps/rejected": -370.0, + "loss": 0.0246, + "rewards/accuracies": 1.0, + "rewards/chosen": 2.1875, + "rewards/margins": 9.5, + "rewards/rejected": -7.3125, + "step": 1452 + }, + { + "epoch": 1.7828220858895705, + "grad_norm": 15.233979634836675, + "learning_rate": 2.049586776859504e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.453125, + "logps/chosen": -402.0, + "logps/rejected": -342.0, + "loss": 0.0633, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.203125, + "rewards/margins": 8.625, + "rewards/rejected": -7.40625, + "step": 1453 + }, + { + "epoch": 1.7840490797546011, + "grad_norm": 11.317979404878772, + "learning_rate": 2.0475206611570248e-07, + "logits/chosen": -0.1396484375, + "logits/rejected": -0.34375, + "logps/chosen": -394.0, + "logps/rejected": -350.0, + "loss": 0.0485, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.8125, + "rewards/margins": 8.3125, + "rewards/rejected": -7.53125, + "step": 1454 + }, + { + "epoch": 1.7852760736196318, + "grad_norm": 17.754925262587573, + "learning_rate": 2.0454545454545456e-07, + "logits/chosen": -0.232421875, + "logits/rejected": -0.37890625, + "logps/chosen": -390.0, + "logps/rejected": -370.0, + "loss": 0.077, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.94921875, + "rewards/margins": 7.4375, + "rewards/rejected": -6.5, + "step": 1455 + }, + { + "epoch": 1.7865030674846625, + "grad_norm": 19.854730691864155, + "learning_rate": 2.043388429752066e-07, + "logits/chosen": -0.283203125, + "logits/rejected": -0.40234375, + "logps/chosen": -360.0, + "logps/rejected": -324.0, + "loss": 0.0974, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.8359375, + "rewards/margins": 7.1875, + "rewards/rejected": -6.375, + "step": 1456 + }, + { + "epoch": 1.7877300613496931, + "grad_norm": 10.467307859535879, + "learning_rate": 2.0413223140495868e-07, + "logits/chosen": -0.279296875, + "logits/rejected": -0.5, + "logps/chosen": -416.0, + "logps/rejected": -372.0, + "loss": 0.0448, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.9375, + "rewards/margins": 8.0625, + "rewards/rejected": -7.09375, + "step": 1457 + }, + { + "epoch": 1.7889570552147238, + "grad_norm": 21.949893453118193, + "learning_rate": 2.0392561983471073e-07, + "logits/chosen": -0.15234375, + "logits/rejected": -0.25390625, + "logps/chosen": -354.0, + "logps/rejected": -356.0, + "loss": 0.0971, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.46875, + "rewards/margins": 7.0, + "rewards/rejected": -6.53125, + "step": 1458 + }, + { + "epoch": 1.7901840490797545, + "grad_norm": 12.47585450577588, + "learning_rate": 2.037190082644628e-07, + "logits/chosen": -0.25390625, + "logits/rejected": -0.455078125, + "logps/chosen": -380.0, + "logps/rejected": -342.0, + "loss": 0.0484, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.1875, + "rewards/margins": 8.5625, + "rewards/rejected": -7.375, + "step": 1459 + }, + { + "epoch": 1.7914110429447851, + "grad_norm": 13.870671728030251, + "learning_rate": 2.0351239669421485e-07, + "logits/chosen": -0.208984375, + "logits/rejected": -0.3671875, + "logps/chosen": -414.0, + "logps/rejected": -362.0, + "loss": 0.0699, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.2109375, + "rewards/margins": 7.90625, + "rewards/rejected": -6.6875, + "step": 1460 + }, + { + "epoch": 1.7926380368098158, + "grad_norm": 20.216524552622737, + "learning_rate": 2.0330578512396692e-07, + "logits/chosen": -0.1904296875, + "logits/rejected": -0.40234375, + "logps/chosen": -422.0, + "logps/rejected": -366.0, + "loss": 0.0906, + "rewards/accuracies": 0.953125, + "rewards/chosen": 1.28125, + "rewards/margins": 9.25, + "rewards/rejected": -7.96875, + "step": 1461 + }, + { + "epoch": 1.7938650306748465, + "grad_norm": 17.46297069666732, + "learning_rate": 2.03099173553719e-07, + "logits/chosen": -0.2333984375, + "logits/rejected": -0.310546875, + "logps/chosen": -320.0, + "logps/rejected": -326.0, + "loss": 0.0803, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.76171875, + "rewards/margins": 7.75, + "rewards/rejected": -6.96875, + "step": 1462 + }, + { + "epoch": 1.7950920245398772, + "grad_norm": 11.06100927617084, + "learning_rate": 2.0289256198347107e-07, + "logits/chosen": -0.1728515625, + "logits/rejected": -0.392578125, + "logps/chosen": -398.0, + "logps/rejected": -352.0, + "loss": 0.0464, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.0390625, + "rewards/margins": 7.96875, + "rewards/rejected": -6.9375, + "step": 1463 + }, + { + "epoch": 1.7963190184049078, + "grad_norm": 15.01295815438324, + "learning_rate": 2.0268595041322314e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.40234375, + "logps/chosen": -340.0, + "logps/rejected": -324.0, + "loss": 0.0644, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.6484375, + "rewards/margins": 8.125, + "rewards/rejected": -7.5, + "step": 1464 + }, + { + "epoch": 1.7975460122699385, + "grad_norm": 13.17727420189363, + "learning_rate": 2.024793388429752e-07, + "logits/chosen": -0.298828125, + "logits/rejected": -0.443359375, + "logps/chosen": -392.0, + "logps/rejected": -370.0, + "loss": 0.0506, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.93359375, + "rewards/margins": 8.5, + "rewards/rejected": -7.5625, + "step": 1465 + }, + { + "epoch": 1.7987730061349694, + "grad_norm": 10.463304964717775, + "learning_rate": 2.0227272727272726e-07, + "logits/chosen": -0.224609375, + "logits/rejected": -0.4375, + "logps/chosen": -360.0, + "logps/rejected": -336.0, + "loss": 0.0369, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.390625, + "rewards/margins": 8.25, + "rewards/rejected": -7.84375, + "step": 1466 + }, + { + "epoch": 1.8, + "grad_norm": 16.6389603323545, + "learning_rate": 2.0206611570247933e-07, + "logits/chosen": -0.28515625, + "logits/rejected": -0.404296875, + "logps/chosen": -424.0, + "logps/rejected": -378.0, + "loss": 0.0702, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.109375, + "rewards/margins": 7.78125, + "rewards/rejected": -6.65625, + "step": 1467 + }, + { + "epoch": 1.8012269938650307, + "grad_norm": 17.7073015885254, + "learning_rate": 2.018595041322314e-07, + "logits/chosen": -0.2041015625, + "logits/rejected": -0.400390625, + "logps/chosen": -410.0, + "logps/rejected": -358.0, + "loss": 0.0726, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.1484375, + "rewards/margins": 8.5625, + "rewards/rejected": -7.40625, + "step": 1468 + }, + { + "epoch": 1.8024539877300614, + "grad_norm": 24.152384305185304, + "learning_rate": 2.0165289256198346e-07, + "logits/chosen": -0.1982421875, + "logits/rejected": -0.333984375, + "logps/chosen": -398.0, + "logps/rejected": -348.0, + "loss": 0.1228, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.423828125, + "rewards/margins": 8.0, + "rewards/rejected": -7.5625, + "step": 1469 + }, + { + "epoch": 1.803680981595092, + "grad_norm": 16.505124462328883, + "learning_rate": 2.0144628099173553e-07, + "logits/chosen": -0.1611328125, + "logits/rejected": -0.373046875, + "logps/chosen": -398.0, + "logps/rejected": -342.0, + "loss": 0.1026, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.22265625, + "rewards/margins": 7.375, + "rewards/rejected": -7.125, + "step": 1470 + }, + { + "epoch": 1.8049079754601227, + "grad_norm": 11.613757396562685, + "learning_rate": 2.012396694214876e-07, + "logits/chosen": -0.1767578125, + "logits/rejected": -0.2890625, + "logps/chosen": -364.0, + "logps/rejected": -360.0, + "loss": 0.0527, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.203125, + "rewards/margins": 8.125, + "rewards/rejected": -6.9375, + "step": 1471 + }, + { + "epoch": 1.8061349693251534, + "grad_norm": 20.145572393591006, + "learning_rate": 2.0103305785123968e-07, + "logits/chosen": -0.2001953125, + "logits/rejected": -0.341796875, + "logps/chosen": -386.0, + "logps/rejected": -354.0, + "loss": 0.0853, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.8203125, + "rewards/margins": 8.1875, + "rewards/rejected": -7.375, + "step": 1472 + }, + { + "epoch": 1.807361963190184, + "grad_norm": 15.971278195974767, + "learning_rate": 2.0082644628099172e-07, + "logits/chosen": -0.2314453125, + "logits/rejected": -0.482421875, + "logps/chosen": -378.0, + "logps/rejected": -346.0, + "loss": 0.0682, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.97265625, + "rewards/margins": 8.875, + "rewards/rejected": -7.9375, + "step": 1473 + }, + { + "epoch": 1.8085889570552147, + "grad_norm": 17.182534809447294, + "learning_rate": 2.006198347107438e-07, + "logits/chosen": -0.1162109375, + "logits/rejected": -0.330078125, + "logps/chosen": -420.0, + "logps/rejected": -372.0, + "loss": 0.0679, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.8671875, + "rewards/margins": 8.25, + "rewards/rejected": -7.375, + "step": 1474 + }, + { + "epoch": 1.8098159509202454, + "grad_norm": 16.745501437822007, + "learning_rate": 2.0041322314049587e-07, + "logits/chosen": -0.2392578125, + "logits/rejected": -0.427734375, + "logps/chosen": -396.0, + "logps/rejected": -352.0, + "loss": 0.0655, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.7734375, + "rewards/margins": 8.1875, + "rewards/rejected": -7.4375, + "step": 1475 + }, + { + "epoch": 1.811042944785276, + "grad_norm": 11.884520160046627, + "learning_rate": 2.0020661157024792e-07, + "logits/chosen": -0.255859375, + "logits/rejected": -0.4140625, + "logps/chosen": -360.0, + "logps/rejected": -348.0, + "loss": 0.0482, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.70703125, + "rewards/margins": 8.625, + "rewards/rejected": -7.9375, + "step": 1476 + }, + { + "epoch": 1.8122699386503067, + "grad_norm": 19.099212958377244, + "learning_rate": 2e-07, + "logits/chosen": -0.1484375, + "logits/rejected": -0.2890625, + "logps/chosen": -380.0, + "logps/rejected": -364.0, + "loss": 0.0965, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.515625, + "rewards/margins": 8.0625, + "rewards/rejected": -7.5625, + "step": 1477 + }, + { + "epoch": 1.8134969325153374, + "grad_norm": 15.322861386193901, + "learning_rate": 1.9979338842975204e-07, + "logits/chosen": -0.185546875, + "logits/rejected": -0.365234375, + "logps/chosen": -396.0, + "logps/rejected": -382.0, + "loss": 0.0658, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.546875, + "rewards/margins": 8.875, + "rewards/rejected": -7.3125, + "step": 1478 + }, + { + "epoch": 1.814723926380368, + "grad_norm": 19.94487147046124, + "learning_rate": 1.995867768595041e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.439453125, + "logps/chosen": -376.0, + "logps/rejected": -356.0, + "loss": 0.076, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.90625, + "rewards/margins": 8.875, + "rewards/rejected": -8.0, + "step": 1479 + }, + { + "epoch": 1.8159509202453987, + "grad_norm": 18.370821009225708, + "learning_rate": 1.9938016528925619e-07, + "logits/chosen": -0.337890625, + "logits/rejected": -0.50390625, + "logps/chosen": -392.0, + "logps/rejected": -386.0, + "loss": 0.096, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 1.203125, + "rewards/margins": 8.0, + "rewards/rejected": -6.78125, + "step": 1480 + }, + { + "epoch": 1.8171779141104294, + "grad_norm": 18.894217711244252, + "learning_rate": 1.9917355371900826e-07, + "logits/chosen": -0.29296875, + "logits/rejected": -0.41015625, + "logps/chosen": -426.0, + "logps/rejected": -390.0, + "loss": 0.0634, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.58203125, + "rewards/margins": 8.4375, + "rewards/rejected": -7.8125, + "step": 1481 + }, + { + "epoch": 1.8184049079754603, + "grad_norm": 17.668135072623855, + "learning_rate": 1.989669421487603e-07, + "logits/chosen": -0.1513671875, + "logits/rejected": -0.30859375, + "logps/chosen": -368.0, + "logps/rejected": -334.0, + "loss": 0.1078, + "rewards/accuracies": 0.953125, + "rewards/chosen": 0.66796875, + "rewards/margins": 7.78125, + "rewards/rejected": -7.09375, + "step": 1482 + }, + { + "epoch": 1.819631901840491, + "grad_norm": 17.99377720684637, + "learning_rate": 1.9876033057851238e-07, + "logits/chosen": -0.09130859375, + "logits/rejected": -0.2490234375, + "logps/chosen": -348.0, + "logps/rejected": -300.0, + "loss": 0.0953, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.431640625, + "rewards/margins": 7.53125, + "rewards/rejected": -7.09375, + "step": 1483 + }, + { + "epoch": 1.8208588957055216, + "grad_norm": 17.648167653419545, + "learning_rate": 1.9855371900826445e-07, + "logits/chosen": -0.26171875, + "logits/rejected": -0.43359375, + "logps/chosen": -346.0, + "logps/rejected": -334.0, + "loss": 0.0858, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.373046875, + "rewards/margins": 7.75, + "rewards/rejected": -7.375, + "step": 1484 + }, + { + "epoch": 1.8220858895705523, + "grad_norm": 13.274182550668716, + "learning_rate": 1.9834710743801653e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.326171875, + "logps/chosen": -342.0, + "logps/rejected": -382.0, + "loss": 0.0528, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.216796875, + "rewards/margins": 7.71875, + "rewards/rejected": -7.53125, + "step": 1485 + }, + { + "epoch": 1.823312883435583, + "grad_norm": 20.621329689703675, + "learning_rate": 1.981404958677686e-07, + "logits/chosen": -0.34375, + "logits/rejected": -0.5078125, + "logps/chosen": -372.0, + "logps/rejected": -358.0, + "loss": 0.1021, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.72265625, + "rewards/margins": 8.4375, + "rewards/rejected": -7.6875, + "step": 1486 + }, + { + "epoch": 1.8245398773006136, + "grad_norm": 11.210307074496594, + "learning_rate": 1.9793388429752065e-07, + "logits/chosen": -0.384765625, + "logits/rejected": -0.54296875, + "logps/chosen": -408.0, + "logps/rejected": -344.0, + "loss": 0.0409, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.015625, + "rewards/margins": 8.9375, + "rewards/rejected": -7.90625, + "step": 1487 + }, + { + "epoch": 1.8257668711656443, + "grad_norm": 21.987064923233664, + "learning_rate": 1.9772727272727272e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.5078125, + "logps/chosen": -406.0, + "logps/rejected": -336.0, + "loss": 0.0674, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.984375, + "rewards/margins": 8.75, + "rewards/rejected": -7.75, + "step": 1488 + }, + { + "epoch": 1.826993865030675, + "grad_norm": 18.006481239669995, + "learning_rate": 1.975206611570248e-07, + "logits/chosen": -0.373046875, + "logits/rejected": -0.57421875, + "logps/chosen": -402.0, + "logps/rejected": -360.0, + "loss": 0.0918, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.15625, + "rewards/margins": 8.9375, + "rewards/rejected": -7.78125, + "step": 1489 + }, + { + "epoch": 1.8282208588957056, + "grad_norm": 14.187293099018019, + "learning_rate": 1.9731404958677687e-07, + "logits/chosen": -0.263671875, + "logits/rejected": -0.478515625, + "logps/chosen": -394.0, + "logps/rejected": -358.0, + "loss": 0.0604, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.1015625, + "rewards/margins": 8.5, + "rewards/rejected": -7.40625, + "step": 1490 + }, + { + "epoch": 1.8294478527607363, + "grad_norm": 17.418073179613188, + "learning_rate": 1.9710743801652891e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.5234375, + "logps/chosen": -476.0, + "logps/rejected": -400.0, + "loss": 0.078, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.6875, + "rewards/margins": 9.375, + "rewards/rejected": -7.6875, + "step": 1491 + }, + { + "epoch": 1.830674846625767, + "grad_norm": 23.07517426282743, + "learning_rate": 1.96900826446281e-07, + "logits/chosen": -0.40234375, + "logits/rejected": -0.5546875, + "logps/chosen": -386.0, + "logps/rejected": -350.0, + "loss": 0.0905, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.36328125, + "rewards/margins": 7.625, + "rewards/rejected": -7.25, + "step": 1492 + }, + { + "epoch": 1.8319018404907976, + "grad_norm": 14.205167510588849, + "learning_rate": 1.9669421487603306e-07, + "logits/chosen": -0.35546875, + "logits/rejected": -0.474609375, + "logps/chosen": -320.0, + "logps/rejected": -320.0, + "loss": 0.0652, + "rewards/accuracies": 0.984375, + "rewards/chosen": -0.1103515625, + "rewards/margins": 7.65625, + "rewards/rejected": -7.75, + "step": 1493 + }, + { + "epoch": 1.8331288343558283, + "grad_norm": 15.731370940870633, + "learning_rate": 1.964876033057851e-07, + "logits/chosen": -0.314453125, + "logits/rejected": -0.439453125, + "logps/chosen": -434.0, + "logps/rejected": -390.0, + "loss": 0.068, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.57421875, + "rewards/margins": 8.1875, + "rewards/rejected": -7.59375, + "step": 1494 + }, + { + "epoch": 1.834355828220859, + "grad_norm": 11.665425298441228, + "learning_rate": 1.9628099173553718e-07, + "logits/chosen": -0.279296875, + "logits/rejected": -0.439453125, + "logps/chosen": -360.0, + "logps/rejected": -340.0, + "loss": 0.0587, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.7890625, + "rewards/margins": 8.125, + "rewards/rejected": -7.3125, + "step": 1495 + }, + { + "epoch": 1.8355828220858896, + "grad_norm": 10.39425934542688, + "learning_rate": 1.9607438016528923e-07, + "logits/chosen": -0.2158203125, + "logits/rejected": -0.357421875, + "logps/chosen": -372.0, + "logps/rejected": -354.0, + "loss": 0.0393, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.92578125, + "rewards/margins": 8.125, + "rewards/rejected": -7.1875, + "step": 1496 + }, + { + "epoch": 1.8368098159509203, + "grad_norm": 12.324150494700712, + "learning_rate": 1.958677685950413e-07, + "logits/chosen": -0.208984375, + "logits/rejected": -0.439453125, + "logps/chosen": -406.0, + "logps/rejected": -340.0, + "loss": 0.054, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.3359375, + "rewards/margins": 8.4375, + "rewards/rejected": -7.125, + "step": 1497 + }, + { + "epoch": 1.838036809815951, + "grad_norm": 17.958231249219875, + "learning_rate": 1.9566115702479338e-07, + "logits/chosen": -0.376953125, + "logits/rejected": -0.55859375, + "logps/chosen": -420.0, + "logps/rejected": -396.0, + "loss": 0.0769, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.73828125, + "rewards/margins": 8.1875, + "rewards/rejected": -7.4375, + "step": 1498 + }, + { + "epoch": 1.8392638036809816, + "grad_norm": 13.751331104711817, + "learning_rate": 1.9545454545454545e-07, + "logits/chosen": -0.1923828125, + "logits/rejected": -0.3828125, + "logps/chosen": -384.0, + "logps/rejected": -354.0, + "loss": 0.0604, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.1328125, + "rewards/margins": 8.25, + "rewards/rejected": -7.125, + "step": 1499 + }, + { + "epoch": 1.8404907975460123, + "grad_norm": 17.008256121916453, + "learning_rate": 1.952479338842975e-07, + "logits/chosen": -0.2119140625, + "logits/rejected": -0.43359375, + "logps/chosen": -368.0, + "logps/rejected": -312.0, + "loss": 0.087, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.359375, + "rewards/margins": 8.625, + "rewards/rejected": -7.28125, + "step": 1500 + }, + { + "epoch": 1.841717791411043, + "grad_norm": 13.035711385487769, + "learning_rate": 1.9504132231404957e-07, + "logits/chosen": -0.2041015625, + "logits/rejected": -0.341796875, + "logps/chosen": -368.0, + "logps/rejected": -358.0, + "loss": 0.0636, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.234375, + "rewards/margins": 8.4375, + "rewards/rejected": -7.1875, + "step": 1501 + }, + { + "epoch": 1.8429447852760736, + "grad_norm": 13.41511690736631, + "learning_rate": 1.9483471074380164e-07, + "logits/chosen": -0.1494140625, + "logits/rejected": -0.271484375, + "logps/chosen": -360.0, + "logps/rejected": -354.0, + "loss": 0.0547, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.08935546875, + "rewards/margins": 7.75, + "rewards/rejected": -7.65625, + "step": 1502 + }, + { + "epoch": 1.8441717791411043, + "grad_norm": 15.43502469522035, + "learning_rate": 1.9462809917355372e-07, + "logits/chosen": -0.263671875, + "logits/rejected": -0.474609375, + "logps/chosen": -424.0, + "logps/rejected": -414.0, + "loss": 0.06, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.0078125, + "rewards/margins": 8.5, + "rewards/rejected": -7.46875, + "step": 1503 + }, + { + "epoch": 1.845398773006135, + "grad_norm": 19.482237869100548, + "learning_rate": 1.944214876033058e-07, + "logits/chosen": -0.32421875, + "logits/rejected": -0.48046875, + "logps/chosen": -382.0, + "logps/rejected": -370.0, + "loss": 0.0778, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.125, + "rewards/margins": 8.3125, + "rewards/rejected": -7.1875, + "step": 1504 + }, + { + "epoch": 1.8466257668711656, + "grad_norm": 14.178264878313755, + "learning_rate": 1.9421487603305784e-07, + "logits/chosen": -0.3125, + "logits/rejected": -0.4765625, + "logps/chosen": -412.0, + "logps/rejected": -376.0, + "loss": 0.0684, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.49609375, + "rewards/margins": 7.59375, + "rewards/rejected": -7.09375, + "step": 1505 + }, + { + "epoch": 1.8478527607361963, + "grad_norm": 16.589699048945725, + "learning_rate": 1.940082644628099e-07, + "logits/chosen": -0.25390625, + "logits/rejected": -0.423828125, + "logps/chosen": -350.0, + "logps/rejected": -356.0, + "loss": 0.0709, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.228515625, + "rewards/margins": 7.71875, + "rewards/rejected": -7.5, + "step": 1506 + }, + { + "epoch": 1.849079754601227, + "grad_norm": 16.04070823247722, + "learning_rate": 1.9380165289256199e-07, + "logits/chosen": -0.232421875, + "logits/rejected": -0.44140625, + "logps/chosen": -396.0, + "logps/rejected": -348.0, + "loss": 0.0762, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.015625, + "rewards/margins": 7.375, + "rewards/rejected": -6.375, + "step": 1507 + }, + { + "epoch": 1.8503067484662576, + "grad_norm": 16.39959081069983, + "learning_rate": 1.9359504132231406e-07, + "logits/chosen": -0.1474609375, + "logits/rejected": -0.328125, + "logps/chosen": -384.0, + "logps/rejected": -360.0, + "loss": 0.0792, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.40625, + "rewards/margins": 7.40625, + "rewards/rejected": -7.0, + "step": 1508 + }, + { + "epoch": 1.8515337423312883, + "grad_norm": 13.574268779519473, + "learning_rate": 1.933884297520661e-07, + "logits/chosen": -0.2236328125, + "logits/rejected": -0.4296875, + "logps/chosen": -436.0, + "logps/rejected": -382.0, + "loss": 0.0567, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.28125, + "rewards/margins": 8.0625, + "rewards/rejected": -6.78125, + "step": 1509 + }, + { + "epoch": 1.852760736196319, + "grad_norm": 12.850263749439831, + "learning_rate": 1.9318181818181818e-07, + "logits/chosen": -0.197265625, + "logits/rejected": -0.431640625, + "logps/chosen": -428.0, + "logps/rejected": -354.0, + "loss": 0.0528, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.0234375, + "rewards/margins": 8.3125, + "rewards/rejected": -7.25, + "step": 1510 + }, + { + "epoch": 1.8539877300613496, + "grad_norm": 10.5232427309612, + "learning_rate": 1.9297520661157023e-07, + "logits/chosen": -0.25390625, + "logits/rejected": -0.33984375, + "logps/chosen": -412.0, + "logps/rejected": -412.0, + "loss": 0.0401, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.0078125, + "rewards/margins": 8.6875, + "rewards/rejected": -7.6875, + "step": 1511 + }, + { + "epoch": 1.8552147239263803, + "grad_norm": 15.187449242889205, + "learning_rate": 1.927685950413223e-07, + "logits/chosen": -0.212890625, + "logits/rejected": -0.4296875, + "logps/chosen": -356.0, + "logps/rejected": -318.0, + "loss": 0.0691, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.2734375, + "rewards/margins": 8.75, + "rewards/rejected": -7.5, + "step": 1512 + }, + { + "epoch": 1.856441717791411, + "grad_norm": 13.277786160576623, + "learning_rate": 1.9256198347107437e-07, + "logits/chosen": -0.228515625, + "logits/rejected": -0.439453125, + "logps/chosen": -398.0, + "logps/rejected": -336.0, + "loss": 0.0572, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.71484375, + "rewards/margins": 8.0, + "rewards/rejected": -7.3125, + "step": 1513 + }, + { + "epoch": 1.8576687116564417, + "grad_norm": 14.367371482305296, + "learning_rate": 1.9235537190082642e-07, + "logits/chosen": -0.232421875, + "logits/rejected": -0.421875, + "logps/chosen": -404.0, + "logps/rejected": -380.0, + "loss": 0.0653, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.0546875, + "rewards/margins": 9.125, + "rewards/rejected": -8.0625, + "step": 1514 + }, + { + "epoch": 1.8588957055214723, + "grad_norm": 17.071420621019563, + "learning_rate": 1.921487603305785e-07, + "logits/chosen": -0.265625, + "logits/rejected": -0.48828125, + "logps/chosen": -402.0, + "logps/rejected": -346.0, + "loss": 0.0765, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.53125, + "rewards/margins": 9.1875, + "rewards/rejected": -7.65625, + "step": 1515 + }, + { + "epoch": 1.860122699386503, + "grad_norm": 16.719990803812202, + "learning_rate": 1.9194214876033057e-07, + "logits/chosen": -0.24609375, + "logits/rejected": -0.396484375, + "logps/chosen": -412.0, + "logps/rejected": -370.0, + "loss": 0.085, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.0732421875, + "rewards/margins": 7.40625, + "rewards/rejected": -7.3125, + "step": 1516 + }, + { + "epoch": 1.8613496932515337, + "grad_norm": 12.209079541692272, + "learning_rate": 1.9173553719008264e-07, + "logits/chosen": -0.287109375, + "logits/rejected": -0.48046875, + "logps/chosen": -414.0, + "logps/rejected": -352.0, + "loss": 0.0626, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.046875, + "rewards/margins": 8.6875, + "rewards/rejected": -7.625, + "step": 1517 + }, + { + "epoch": 1.8625766871165643, + "grad_norm": 16.39414971251806, + "learning_rate": 1.915289256198347e-07, + "logits/chosen": -0.294921875, + "logits/rejected": -0.494140625, + "logps/chosen": -376.0, + "logps/rejected": -328.0, + "loss": 0.0807, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.57421875, + "rewards/margins": 8.625, + "rewards/rejected": -8.0625, + "step": 1518 + }, + { + "epoch": 1.863803680981595, + "grad_norm": 15.890943624391708, + "learning_rate": 1.9132231404958676e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.4140625, + "logps/chosen": -366.0, + "logps/rejected": -370.0, + "loss": 0.0651, + "rewards/accuracies": 0.96875, + "rewards/chosen": -0.337890625, + "rewards/margins": 7.5, + "rewards/rejected": -7.84375, + "step": 1519 + }, + { + "epoch": 1.8650306748466257, + "grad_norm": 13.857977675424138, + "learning_rate": 1.9111570247933884e-07, + "logits/chosen": -0.2890625, + "logits/rejected": -0.359375, + "logps/chosen": -388.0, + "logps/rejected": -358.0, + "loss": 0.0497, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.32421875, + "rewards/margins": 8.1875, + "rewards/rejected": -7.84375, + "step": 1520 + }, + { + "epoch": 1.8662576687116563, + "grad_norm": 18.038088141188503, + "learning_rate": 1.909090909090909e-07, + "logits/chosen": -0.1982421875, + "logits/rejected": -0.390625, + "logps/chosen": -368.0, + "logps/rejected": -328.0, + "loss": 0.0741, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.47265625, + "rewards/margins": 7.84375, + "rewards/rejected": -7.34375, + "step": 1521 + }, + { + "epoch": 1.867484662576687, + "grad_norm": 18.967110704939405, + "learning_rate": 1.9070247933884296e-07, + "logits/chosen": -0.2314453125, + "logits/rejected": -0.41796875, + "logps/chosen": -362.0, + "logps/rejected": -334.0, + "loss": 0.1014, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.80859375, + "rewards/margins": 8.3125, + "rewards/rejected": -7.5, + "step": 1522 + }, + { + "epoch": 1.8687116564417177, + "grad_norm": 17.741591856514688, + "learning_rate": 1.9049586776859503e-07, + "logits/chosen": -0.298828125, + "logits/rejected": -0.43359375, + "logps/chosen": -370.0, + "logps/rejected": -334.0, + "loss": 0.0675, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.71484375, + "rewards/margins": 8.5, + "rewards/rejected": -7.8125, + "step": 1523 + }, + { + "epoch": 1.8699386503067483, + "grad_norm": 20.803822165387253, + "learning_rate": 1.902892561983471e-07, + "logits/chosen": -0.1533203125, + "logits/rejected": -0.3125, + "logps/chosen": -344.0, + "logps/rejected": -360.0, + "loss": 0.0995, + "rewards/accuracies": 0.9609375, + "rewards/chosen": -0.244140625, + "rewards/margins": 7.875, + "rewards/rejected": -8.125, + "step": 1524 + }, + { + "epoch": 1.871165644171779, + "grad_norm": 22.570729030773556, + "learning_rate": 1.9008264462809918e-07, + "logits/chosen": -0.275390625, + "logits/rejected": -0.4453125, + "logps/chosen": -346.0, + "logps/rejected": -354.0, + "loss": 0.0879, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.8828125, + "rewards/margins": 9.125, + "rewards/rejected": -8.25, + "step": 1525 + }, + { + "epoch": 1.8723926380368097, + "grad_norm": 19.496680476670846, + "learning_rate": 1.8987603305785125e-07, + "logits/chosen": -0.16015625, + "logits/rejected": -0.359375, + "logps/chosen": -406.0, + "logps/rejected": -352.0, + "loss": 0.0996, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 1.0, + "rewards/margins": 8.1875, + "rewards/rejected": -7.1875, + "step": 1526 + }, + { + "epoch": 1.8736196319018403, + "grad_norm": 19.187276658450095, + "learning_rate": 1.896694214876033e-07, + "logits/chosen": -0.2060546875, + "logits/rejected": -0.404296875, + "logps/chosen": -408.0, + "logps/rejected": -328.0, + "loss": 0.0768, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.9140625, + "rewards/margins": 8.375, + "rewards/rejected": -7.46875, + "step": 1527 + }, + { + "epoch": 1.874846625766871, + "grad_norm": 12.224106373875838, + "learning_rate": 1.8946280991735537e-07, + "logits/chosen": -0.1650390625, + "logits/rejected": -0.37890625, + "logps/chosen": -392.0, + "logps/rejected": -324.0, + "loss": 0.0716, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.0546875, + "rewards/margins": 8.8125, + "rewards/rejected": -7.75, + "step": 1528 + }, + { + "epoch": 1.876073619631902, + "grad_norm": 13.189072919497397, + "learning_rate": 1.8925619834710742e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.51953125, + "logps/chosen": -420.0, + "logps/rejected": -360.0, + "loss": 0.0461, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.640625, + "rewards/margins": 9.9375, + "rewards/rejected": -8.3125, + "step": 1529 + }, + { + "epoch": 1.8773006134969326, + "grad_norm": 15.891716890392578, + "learning_rate": 1.890495867768595e-07, + "logits/chosen": -0.27734375, + "logits/rejected": -0.408203125, + "logps/chosen": -382.0, + "logps/rejected": -322.0, + "loss": 0.0907, + "rewards/accuracies": 0.9765625, + "rewards/chosen": -0.1728515625, + "rewards/margins": 7.84375, + "rewards/rejected": -8.0, + "step": 1530 + }, + { + "epoch": 1.8785276073619632, + "grad_norm": 20.40280513004175, + "learning_rate": 1.8884297520661154e-07, + "logits/chosen": -0.1572265625, + "logits/rejected": -0.3046875, + "logps/chosen": -376.0, + "logps/rejected": -332.0, + "loss": 0.1019, + "rewards/accuracies": 0.953125, + "rewards/chosen": -0.1015625, + "rewards/margins": 7.625, + "rewards/rejected": -7.75, + "step": 1531 + }, + { + "epoch": 1.879754601226994, + "grad_norm": 12.781822182528002, + "learning_rate": 1.8863636363636361e-07, + "logits/chosen": -0.39453125, + "logits/rejected": -0.56640625, + "logps/chosen": -432.0, + "logps/rejected": -402.0, + "loss": 0.0519, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.1875, + "rewards/margins": 9.375, + "rewards/rejected": -8.1875, + "step": 1532 + }, + { + "epoch": 1.8809815950920246, + "grad_norm": 16.121285182923785, + "learning_rate": 1.884297520661157e-07, + "logits/chosen": -0.21875, + "logits/rejected": -0.365234375, + "logps/chosen": -380.0, + "logps/rejected": -362.0, + "loss": 0.0829, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.40625, + "rewards/margins": 7.53125, + "rewards/rejected": -7.125, + "step": 1533 + }, + { + "epoch": 1.8822085889570552, + "grad_norm": 13.827869103464698, + "learning_rate": 1.8822314049586776e-07, + "logits/chosen": -0.296875, + "logits/rejected": -0.443359375, + "logps/chosen": -382.0, + "logps/rejected": -368.0, + "loss": 0.0717, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.27734375, + "rewards/margins": 8.125, + "rewards/rejected": -7.84375, + "step": 1534 + }, + { + "epoch": 1.883435582822086, + "grad_norm": 17.494379446948752, + "learning_rate": 1.8801652892561983e-07, + "logits/chosen": -0.1611328125, + "logits/rejected": -0.408203125, + "logps/chosen": -368.0, + "logps/rejected": -318.0, + "loss": 0.0727, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.98828125, + "rewards/margins": 8.375, + "rewards/rejected": -7.40625, + "step": 1535 + }, + { + "epoch": 1.8846625766871166, + "grad_norm": 18.488925778102313, + "learning_rate": 1.8780991735537188e-07, + "logits/chosen": -0.171875, + "logits/rejected": -0.365234375, + "logps/chosen": -450.0, + "logps/rejected": -398.0, + "loss": 0.0724, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.15625, + "rewards/margins": 8.625, + "rewards/rejected": -7.4375, + "step": 1536 + }, + { + "epoch": 1.8858895705521472, + "grad_norm": 11.009905239673062, + "learning_rate": 1.8760330578512395e-07, + "logits/chosen": -0.22265625, + "logits/rejected": -0.4453125, + "logps/chosen": -374.0, + "logps/rejected": -346.0, + "loss": 0.0436, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.71484375, + "rewards/margins": 8.5, + "rewards/rejected": -7.8125, + "step": 1537 + }, + { + "epoch": 1.887116564417178, + "grad_norm": 11.45993497676878, + "learning_rate": 1.8739669421487603e-07, + "logits/chosen": -0.236328125, + "logits/rejected": -0.369140625, + "logps/chosen": -362.0, + "logps/rejected": -350.0, + "loss": 0.0402, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.85546875, + "rewards/margins": 8.3125, + "rewards/rejected": -7.4375, + "step": 1538 + }, + { + "epoch": 1.8883435582822086, + "grad_norm": 13.349132041853364, + "learning_rate": 1.871900826446281e-07, + "logits/chosen": -0.146484375, + "logits/rejected": -0.37109375, + "logps/chosen": -376.0, + "logps/rejected": -346.0, + "loss": 0.0607, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.5234375, + "rewards/margins": 7.625, + "rewards/rejected": -7.09375, + "step": 1539 + }, + { + "epoch": 1.8895705521472392, + "grad_norm": 18.36311236887226, + "learning_rate": 1.8698347107438015e-07, + "logits/chosen": -0.39453125, + "logits/rejected": -0.5390625, + "logps/chosen": -432.0, + "logps/rejected": -422.0, + "loss": 0.0777, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.0546875, + "rewards/margins": 8.625, + "rewards/rejected": -7.5625, + "step": 1540 + }, + { + "epoch": 1.89079754601227, + "grad_norm": 16.19023546437399, + "learning_rate": 1.8677685950413222e-07, + "logits/chosen": -0.34765625, + "logits/rejected": -0.5, + "logps/chosen": -378.0, + "logps/rejected": -364.0, + "loss": 0.0679, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.765625, + "rewards/margins": 8.3125, + "rewards/rejected": -7.5625, + "step": 1541 + }, + { + "epoch": 1.8920245398773006, + "grad_norm": 14.543972218564775, + "learning_rate": 1.865702479338843e-07, + "logits/chosen": -0.298828125, + "logits/rejected": -0.48046875, + "logps/chosen": -398.0, + "logps/rejected": -360.0, + "loss": 0.0529, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.390625, + "rewards/margins": 9.25, + "rewards/rejected": -7.84375, + "step": 1542 + }, + { + "epoch": 1.8932515337423312, + "grad_norm": 11.95081032652667, + "learning_rate": 1.8636363636363637e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.462890625, + "logps/chosen": -372.0, + "logps/rejected": -350.0, + "loss": 0.0503, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.80078125, + "rewards/margins": 8.625, + "rewards/rejected": -7.8125, + "step": 1543 + }, + { + "epoch": 1.8944785276073621, + "grad_norm": 15.346383720672437, + "learning_rate": 1.8615702479338844e-07, + "logits/chosen": -0.33203125, + "logits/rejected": -0.51171875, + "logps/chosen": -414.0, + "logps/rejected": -404.0, + "loss": 0.0628, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.953125, + "rewards/margins": 8.625, + "rewards/rejected": -7.6875, + "step": 1544 + }, + { + "epoch": 1.8957055214723928, + "grad_norm": 13.729280643295004, + "learning_rate": 1.859504132231405e-07, + "logits/chosen": -0.2421875, + "logits/rejected": -0.431640625, + "logps/chosen": -388.0, + "logps/rejected": -318.0, + "loss": 0.0556, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.296875, + "rewards/margins": 7.46875, + "rewards/rejected": -7.15625, + "step": 1545 + }, + { + "epoch": 1.8969325153374235, + "grad_norm": 19.79972702374522, + "learning_rate": 1.8574380165289256e-07, + "logits/chosen": -0.26953125, + "logits/rejected": -0.443359375, + "logps/chosen": -370.0, + "logps/rejected": -334.0, + "loss": 0.0735, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.59375, + "rewards/margins": 8.0625, + "rewards/rejected": -7.5, + "step": 1546 + }, + { + "epoch": 1.8981595092024541, + "grad_norm": 17.368679503832553, + "learning_rate": 1.855371900826446e-07, + "logits/chosen": -0.2431640625, + "logits/rejected": -0.5546875, + "logps/chosen": -482.0, + "logps/rejected": -372.0, + "loss": 0.0614, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.0625, + "rewards/margins": 9.375, + "rewards/rejected": -8.3125, + "step": 1547 + }, + { + "epoch": 1.8993865030674848, + "grad_norm": 31.906634148177798, + "learning_rate": 1.8533057851239668e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.333984375, + "logps/chosen": -394.0, + "logps/rejected": -386.0, + "loss": 0.0734, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.515625, + "rewards/margins": 8.0, + "rewards/rejected": -7.5, + "step": 1548 + }, + { + "epoch": 1.9006134969325155, + "grad_norm": 14.790340930236075, + "learning_rate": 1.8512396694214873e-07, + "logits/chosen": -0.1767578125, + "logits/rejected": -0.38671875, + "logps/chosen": -384.0, + "logps/rejected": -330.0, + "loss": 0.0803, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.46484375, + "rewards/margins": 7.53125, + "rewards/rejected": -7.09375, + "step": 1549 + }, + { + "epoch": 1.9018404907975461, + "grad_norm": 16.17337431777944, + "learning_rate": 1.849173553719008e-07, + "logits/chosen": -0.279296875, + "logits/rejected": -0.3828125, + "logps/chosen": -388.0, + "logps/rejected": -350.0, + "loss": 0.07, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.56640625, + "rewards/margins": 8.5625, + "rewards/rejected": -8.0, + "step": 1550 + }, + { + "epoch": 1.9030674846625768, + "grad_norm": 13.058682584284002, + "learning_rate": 1.8471074380165288e-07, + "logits/chosen": -0.31640625, + "logits/rejected": -0.5234375, + "logps/chosen": -426.0, + "logps/rejected": -374.0, + "loss": 0.0661, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.435546875, + "rewards/margins": 8.0625, + "rewards/rejected": -7.625, + "step": 1551 + }, + { + "epoch": 1.9042944785276075, + "grad_norm": 18.975415198635574, + "learning_rate": 1.8450413223140495e-07, + "logits/chosen": -0.25, + "logits/rejected": -0.3828125, + "logps/chosen": -354.0, + "logps/rejected": -324.0, + "loss": 0.1003, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.349609375, + "rewards/margins": 7.125, + "rewards/rejected": -6.78125, + "step": 1552 + }, + { + "epoch": 1.9055214723926381, + "grad_norm": 16.503921096809567, + "learning_rate": 1.8429752066115703e-07, + "logits/chosen": -0.201171875, + "logits/rejected": -0.326171875, + "logps/chosen": -386.0, + "logps/rejected": -316.0, + "loss": 0.0626, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.5078125, + "rewards/margins": 8.0, + "rewards/rejected": -7.5, + "step": 1553 + }, + { + "epoch": 1.9067484662576688, + "grad_norm": 16.1200440750319, + "learning_rate": 1.8409090909090907e-07, + "logits/chosen": -0.359375, + "logits/rejected": -0.62109375, + "logps/chosen": -418.0, + "logps/rejected": -362.0, + "loss": 0.0711, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.81640625, + "rewards/margins": 8.5, + "rewards/rejected": -7.6875, + "step": 1554 + }, + { + "epoch": 1.9079754601226995, + "grad_norm": 17.86351324332019, + "learning_rate": 1.8388429752066115e-07, + "logits/chosen": -0.380859375, + "logits/rejected": -0.412109375, + "logps/chosen": -376.0, + "logps/rejected": -368.0, + "loss": 0.0678, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.828125, + "rewards/margins": 8.375, + "rewards/rejected": -7.53125, + "step": 1555 + }, + { + "epoch": 1.9092024539877301, + "grad_norm": 13.370865232547146, + "learning_rate": 1.8367768595041322e-07, + "logits/chosen": -0.2080078125, + "logits/rejected": -0.435546875, + "logps/chosen": -402.0, + "logps/rejected": -350.0, + "loss": 0.0622, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.03125, + "rewards/margins": 8.1875, + "rewards/rejected": -7.125, + "step": 1556 + }, + { + "epoch": 1.9104294478527608, + "grad_norm": 17.840722552958336, + "learning_rate": 1.834710743801653e-07, + "logits/chosen": -0.1474609375, + "logits/rejected": -0.38671875, + "logps/chosen": -398.0, + "logps/rejected": -370.0, + "loss": 0.0788, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.54296875, + "rewards/margins": 7.25, + "rewards/rejected": -6.71875, + "step": 1557 + }, + { + "epoch": 1.9116564417177915, + "grad_norm": 10.994682736952559, + "learning_rate": 1.8326446280991734e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.443359375, + "logps/chosen": -388.0, + "logps/rejected": -386.0, + "loss": 0.0407, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.9921875, + "rewards/margins": 8.5625, + "rewards/rejected": -7.59375, + "step": 1558 + }, + { + "epoch": 1.9128834355828221, + "grad_norm": 19.70741185520124, + "learning_rate": 1.8305785123966941e-07, + "logits/chosen": -0.1708984375, + "logits/rejected": -0.265625, + "logps/chosen": -390.0, + "logps/rejected": -312.0, + "loss": 0.1004, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.50390625, + "rewards/margins": 7.34375, + "rewards/rejected": -6.84375, + "step": 1559 + }, + { + "epoch": 1.9141104294478528, + "grad_norm": 14.735555239774861, + "learning_rate": 1.828512396694215e-07, + "logits/chosen": -0.2080078125, + "logits/rejected": -0.39453125, + "logps/chosen": -368.0, + "logps/rejected": -326.0, + "loss": 0.0704, + "rewards/accuracies": 0.9765625, + "rewards/chosen": -0.1611328125, + "rewards/margins": 7.625, + "rewards/rejected": -7.8125, + "step": 1560 + }, + { + "epoch": 1.9153374233128835, + "grad_norm": 17.97811007791773, + "learning_rate": 1.8264462809917356e-07, + "logits/chosen": -0.2890625, + "logits/rejected": -0.5546875, + "logps/chosen": -448.0, + "logps/rejected": -364.0, + "loss": 0.0705, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.5, + "rewards/margins": 9.125, + "rewards/rejected": -7.625, + "step": 1561 + }, + { + "epoch": 1.9165644171779141, + "grad_norm": 9.68873741335912, + "learning_rate": 1.824380165289256e-07, + "logits/chosen": -0.32421875, + "logits/rejected": -0.53515625, + "logps/chosen": -436.0, + "logps/rejected": -374.0, + "loss": 0.0375, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.703125, + "rewards/margins": 8.9375, + "rewards/rejected": -7.21875, + "step": 1562 + }, + { + "epoch": 1.9177914110429448, + "grad_norm": 14.07231161016849, + "learning_rate": 1.8223140495867768e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.5, + "logps/chosen": -398.0, + "logps/rejected": -358.0, + "loss": 0.0583, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.3359375, + "rewards/margins": 8.6875, + "rewards/rejected": -7.3125, + "step": 1563 + }, + { + "epoch": 1.9190184049079755, + "grad_norm": 15.162777851608853, + "learning_rate": 1.8202479338842976e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.462890625, + "logps/chosen": -380.0, + "logps/rejected": -360.0, + "loss": 0.0651, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.69921875, + "rewards/margins": 7.78125, + "rewards/rejected": -7.0625, + "step": 1564 + }, + { + "epoch": 1.9202453987730062, + "grad_norm": 8.989543359392542, + "learning_rate": 1.818181818181818e-07, + "logits/chosen": -0.38671875, + "logits/rejected": -0.578125, + "logps/chosen": -320.0, + "logps/rejected": -302.0, + "loss": 0.0453, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.7578125, + "rewards/margins": 8.3125, + "rewards/rejected": -7.5625, + "step": 1565 + }, + { + "epoch": 1.9214723926380368, + "grad_norm": 15.42845482201227, + "learning_rate": 1.8161157024793388e-07, + "logits/chosen": -0.2392578125, + "logits/rejected": -0.384765625, + "logps/chosen": -400.0, + "logps/rejected": -382.0, + "loss": 0.0643, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.5234375, + "rewards/margins": 9.0, + "rewards/rejected": -7.46875, + "step": 1566 + }, + { + "epoch": 1.9226993865030675, + "grad_norm": 11.957956051809287, + "learning_rate": 1.8140495867768592e-07, + "logits/chosen": -0.255859375, + "logits/rejected": -0.416015625, + "logps/chosen": -372.0, + "logps/rejected": -348.0, + "loss": 0.062, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.67578125, + "rewards/margins": 8.4375, + "rewards/rejected": -7.75, + "step": 1567 + }, + { + "epoch": 1.9239263803680982, + "grad_norm": 15.889854049410278, + "learning_rate": 1.81198347107438e-07, + "logits/chosen": -0.201171875, + "logits/rejected": -0.431640625, + "logps/chosen": -386.0, + "logps/rejected": -362.0, + "loss": 0.0621, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.7421875, + "rewards/margins": 8.9375, + "rewards/rejected": -7.1875, + "step": 1568 + }, + { + "epoch": 1.9251533742331288, + "grad_norm": 21.646714958845084, + "learning_rate": 1.8099173553719007e-07, + "logits/chosen": -0.109375, + "logits/rejected": -0.2578125, + "logps/chosen": -388.0, + "logps/rejected": -324.0, + "loss": 0.0662, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.515625, + "rewards/margins": 7.78125, + "rewards/rejected": -7.28125, + "step": 1569 + }, + { + "epoch": 1.9263803680981595, + "grad_norm": 11.393196483354775, + "learning_rate": 1.8078512396694214e-07, + "logits/chosen": -0.234375, + "logits/rejected": -0.447265625, + "logps/chosen": -378.0, + "logps/rejected": -346.0, + "loss": 0.0587, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.4140625, + "rewards/margins": 7.65625, + "rewards/rejected": -7.25, + "step": 1570 + }, + { + "epoch": 1.9276073619631902, + "grad_norm": 18.937790760222054, + "learning_rate": 1.805785123966942e-07, + "logits/chosen": -0.26171875, + "logits/rejected": -0.419921875, + "logps/chosen": -424.0, + "logps/rejected": -386.0, + "loss": 0.0827, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.95703125, + "rewards/margins": 7.9375, + "rewards/rejected": -6.96875, + "step": 1571 + }, + { + "epoch": 1.9288343558282208, + "grad_norm": 10.488631686538346, + "learning_rate": 1.8037190082644626e-07, + "logits/chosen": -0.296875, + "logits/rejected": -0.494140625, + "logps/chosen": -408.0, + "logps/rejected": -360.0, + "loss": 0.0403, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.828125, + "rewards/margins": 8.875, + "rewards/rejected": -8.0625, + "step": 1572 + }, + { + "epoch": 1.9300613496932515, + "grad_norm": 15.41524900418897, + "learning_rate": 1.8016528925619834e-07, + "logits/chosen": -0.291015625, + "logits/rejected": -0.427734375, + "logps/chosen": -396.0, + "logps/rejected": -354.0, + "loss": 0.0707, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.25390625, + "rewards/margins": 7.6875, + "rewards/rejected": -7.4375, + "step": 1573 + }, + { + "epoch": 1.9312883435582822, + "grad_norm": 17.095977350911046, + "learning_rate": 1.799586776859504e-07, + "logits/chosen": -0.154296875, + "logits/rejected": -0.302734375, + "logps/chosen": -360.0, + "logps/rejected": -364.0, + "loss": 0.0673, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.703125, + "rewards/margins": 7.78125, + "rewards/rejected": -7.09375, + "step": 1574 + }, + { + "epoch": 1.9325153374233128, + "grad_norm": 17.678902691852176, + "learning_rate": 1.7975206611570249e-07, + "logits/chosen": -0.298828125, + "logits/rejected": -0.4296875, + "logps/chosen": -394.0, + "logps/rejected": -340.0, + "loss": 0.0827, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.0078125, + "rewards/margins": 8.5625, + "rewards/rejected": -7.59375, + "step": 1575 + }, + { + "epoch": 1.9337423312883435, + "grad_norm": 15.920908291632927, + "learning_rate": 1.7954545454545453e-07, + "logits/chosen": -0.29296875, + "logits/rejected": -0.49609375, + "logps/chosen": -372.0, + "logps/rejected": -342.0, + "loss": 0.0601, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.126953125, + "rewards/margins": 7.9375, + "rewards/rejected": -8.0625, + "step": 1576 + }, + { + "epoch": 1.9349693251533742, + "grad_norm": 15.906075116479652, + "learning_rate": 1.793388429752066e-07, + "logits/chosen": -0.228515625, + "logits/rejected": -0.40234375, + "logps/chosen": -384.0, + "logps/rejected": -306.0, + "loss": 0.0731, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.1875, + "rewards/margins": 8.6875, + "rewards/rejected": -7.46875, + "step": 1577 + }, + { + "epoch": 1.9361963190184048, + "grad_norm": 20.09538798619118, + "learning_rate": 1.7913223140495868e-07, + "logits/chosen": -0.2412109375, + "logits/rejected": -0.419921875, + "logps/chosen": -378.0, + "logps/rejected": -376.0, + "loss": 0.0811, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.326171875, + "rewards/margins": 8.1875, + "rewards/rejected": -7.84375, + "step": 1578 + }, + { + "epoch": 1.9374233128834355, + "grad_norm": 12.298477999538573, + "learning_rate": 1.7892561983471075e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.3984375, + "logps/chosen": -380.0, + "logps/rejected": -342.0, + "loss": 0.0599, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.59375, + "rewards/margins": 8.0625, + "rewards/rejected": -7.5, + "step": 1579 + }, + { + "epoch": 1.9386503067484662, + "grad_norm": 10.849637266639293, + "learning_rate": 1.787190082644628e-07, + "logits/chosen": -0.265625, + "logits/rejected": -0.4765625, + "logps/chosen": -440.0, + "logps/rejected": -376.0, + "loss": 0.0477, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.1796875, + "rewards/margins": 8.875, + "rewards/rejected": -7.6875, + "step": 1580 + }, + { + "epoch": 1.9398773006134968, + "grad_norm": 13.990885859252648, + "learning_rate": 1.7851239669421487e-07, + "logits/chosen": -0.220703125, + "logits/rejected": -0.380859375, + "logps/chosen": -412.0, + "logps/rejected": -364.0, + "loss": 0.0635, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.015625, + "rewards/margins": 8.375, + "rewards/rejected": -7.34375, + "step": 1581 + }, + { + "epoch": 1.9411042944785275, + "grad_norm": 14.910402890547681, + "learning_rate": 1.7830578512396692e-07, + "logits/chosen": -0.1572265625, + "logits/rejected": -0.28125, + "logps/chosen": -326.0, + "logps/rejected": -310.0, + "loss": 0.0873, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.1611328125, + "rewards/margins": 7.0625, + "rewards/rejected": -6.90625, + "step": 1582 + }, + { + "epoch": 1.9423312883435582, + "grad_norm": 21.965289093237924, + "learning_rate": 1.78099173553719e-07, + "logits/chosen": -0.2265625, + "logits/rejected": -0.408203125, + "logps/chosen": -414.0, + "logps/rejected": -358.0, + "loss": 0.0772, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.171875, + "rewards/margins": 8.375, + "rewards/rejected": -7.21875, + "step": 1583 + }, + { + "epoch": 1.9435582822085888, + "grad_norm": 16.642939256031468, + "learning_rate": 1.7789256198347107e-07, + "logits/chosen": -0.21875, + "logits/rejected": -0.40625, + "logps/chosen": -432.0, + "logps/rejected": -356.0, + "loss": 0.0887, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.625, + "rewards/margins": 7.59375, + "rewards/rejected": -6.96875, + "step": 1584 + }, + { + "epoch": 1.9447852760736195, + "grad_norm": 16.42513846451918, + "learning_rate": 1.7768595041322312e-07, + "logits/chosen": -0.283203125, + "logits/rejected": -0.431640625, + "logps/chosen": -412.0, + "logps/rejected": -388.0, + "loss": 0.0519, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.3828125, + "rewards/margins": 9.1875, + "rewards/rejected": -7.78125, + "step": 1585 + }, + { + "epoch": 1.9460122699386502, + "grad_norm": 18.29573534106398, + "learning_rate": 1.774793388429752e-07, + "logits/chosen": -0.314453125, + "logits/rejected": -0.49609375, + "logps/chosen": -396.0, + "logps/rejected": -344.0, + "loss": 0.0887, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.90234375, + "rewards/margins": 7.625, + "rewards/rejected": -6.71875, + "step": 1586 + }, + { + "epoch": 1.9472392638036808, + "grad_norm": 12.580384580594664, + "learning_rate": 1.7727272727272726e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.45703125, + "logps/chosen": -354.0, + "logps/rejected": -322.0, + "loss": 0.0669, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.412109375, + "rewards/margins": 7.28125, + "rewards/rejected": -6.84375, + "step": 1587 + }, + { + "epoch": 1.9484662576687115, + "grad_norm": 12.585504293545585, + "learning_rate": 1.7706611570247934e-07, + "logits/chosen": -0.203125, + "logits/rejected": -0.380859375, + "logps/chosen": -370.0, + "logps/rejected": -338.0, + "loss": 0.0678, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.78515625, + "rewards/margins": 7.8125, + "rewards/rejected": -7.0, + "step": 1588 + }, + { + "epoch": 1.9496932515337422, + "grad_norm": 14.387923555339917, + "learning_rate": 1.7685950413223138e-07, + "logits/chosen": -0.283203125, + "logits/rejected": -0.4453125, + "logps/chosen": -356.0, + "logps/rejected": -344.0, + "loss": 0.0651, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.71875, + "rewards/margins": 8.5, + "rewards/rejected": -7.78125, + "step": 1589 + }, + { + "epoch": 1.9509202453987728, + "grad_norm": 18.309926390635418, + "learning_rate": 1.7665289256198346e-07, + "logits/chosen": -0.1962890625, + "logits/rejected": -0.361328125, + "logps/chosen": -390.0, + "logps/rejected": -374.0, + "loss": 0.0592, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.265625, + "rewards/margins": 8.625, + "rewards/rejected": -7.375, + "step": 1590 + }, + { + "epoch": 1.9521472392638037, + "grad_norm": 11.073900129635811, + "learning_rate": 1.7644628099173553e-07, + "logits/chosen": -0.291015625, + "logits/rejected": -0.44140625, + "logps/chosen": -360.0, + "logps/rejected": -326.0, + "loss": 0.0469, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.56640625, + "rewards/margins": 8.25, + "rewards/rejected": -7.71875, + "step": 1591 + }, + { + "epoch": 1.9533742331288344, + "grad_norm": 10.45569293496878, + "learning_rate": 1.762396694214876e-07, + "logits/chosen": -0.19921875, + "logits/rejected": -0.341796875, + "logps/chosen": -370.0, + "logps/rejected": -356.0, + "loss": 0.0525, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.267578125, + "rewards/margins": 7.8125, + "rewards/rejected": -7.5625, + "step": 1592 + }, + { + "epoch": 1.954601226993865, + "grad_norm": 16.81098801924393, + "learning_rate": 1.7603305785123968e-07, + "logits/chosen": -0.2119140625, + "logits/rejected": -0.3671875, + "logps/chosen": -396.0, + "logps/rejected": -352.0, + "loss": 0.0737, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.44140625, + "rewards/margins": 8.375, + "rewards/rejected": -7.90625, + "step": 1593 + }, + { + "epoch": 1.9558282208588957, + "grad_norm": 16.874405948149928, + "learning_rate": 1.7582644628099172e-07, + "logits/chosen": -0.2890625, + "logits/rejected": -0.439453125, + "logps/chosen": -324.0, + "logps/rejected": -304.0, + "loss": 0.0907, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.76953125, + "rewards/margins": 8.3125, + "rewards/rejected": -7.53125, + "step": 1594 + }, + { + "epoch": 1.9570552147239264, + "grad_norm": 13.916000616686723, + "learning_rate": 1.756198347107438e-07, + "logits/chosen": -0.240234375, + "logits/rejected": -0.322265625, + "logps/chosen": -370.0, + "logps/rejected": -360.0, + "loss": 0.0649, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.25, + "rewards/margins": 8.5625, + "rewards/rejected": -8.3125, + "step": 1595 + }, + { + "epoch": 1.958282208588957, + "grad_norm": 13.761689054733528, + "learning_rate": 1.7541322314049587e-07, + "logits/chosen": -0.30078125, + "logits/rejected": -0.34765625, + "logps/chosen": -356.0, + "logps/rejected": -326.0, + "loss": 0.0586, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.2138671875, + "rewards/margins": 8.1875, + "rewards/rejected": -7.96875, + "step": 1596 + }, + { + "epoch": 1.9595092024539877, + "grad_norm": 12.939807513369477, + "learning_rate": 1.7520661157024794e-07, + "logits/chosen": -0.2314453125, + "logits/rejected": -0.43359375, + "logps/chosen": -392.0, + "logps/rejected": -348.0, + "loss": 0.0597, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.62109375, + "rewards/margins": 8.8125, + "rewards/rejected": -8.1875, + "step": 1597 + }, + { + "epoch": 1.9607361963190184, + "grad_norm": 24.210872748895458, + "learning_rate": 1.75e-07, + "logits/chosen": -0.296875, + "logits/rejected": -0.40234375, + "logps/chosen": -384.0, + "logps/rejected": -384.0, + "loss": 0.0871, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.171875, + "rewards/margins": 8.0, + "rewards/rejected": -7.84375, + "step": 1598 + }, + { + "epoch": 1.961963190184049, + "grad_norm": 13.231799352209123, + "learning_rate": 1.7479338842975207e-07, + "logits/chosen": -0.2265625, + "logits/rejected": -0.453125, + "logps/chosen": -396.0, + "logps/rejected": -344.0, + "loss": 0.0632, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.419921875, + "rewards/margins": 8.375, + "rewards/rejected": -7.9375, + "step": 1599 + }, + { + "epoch": 1.9631901840490797, + "grad_norm": 16.86215786601759, + "learning_rate": 1.745867768595041e-07, + "logits/chosen": -0.2001953125, + "logits/rejected": -0.35546875, + "logps/chosen": -408.0, + "logps/rejected": -366.0, + "loss": 0.0691, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.294921875, + "rewards/margins": 7.90625, + "rewards/rejected": -7.625, + "step": 1600 + }, + { + "epoch": 1.9644171779141104, + "grad_norm": 16.903866876358965, + "learning_rate": 1.7438016528925619e-07, + "logits/chosen": -0.150390625, + "logits/rejected": -0.267578125, + "logps/chosen": -340.0, + "logps/rejected": -330.0, + "loss": 0.089, + "rewards/accuracies": 0.9765625, + "rewards/chosen": -0.23046875, + "rewards/margins": 7.375, + "rewards/rejected": -7.625, + "step": 1601 + }, + { + "epoch": 1.965644171779141, + "grad_norm": 19.920257096709662, + "learning_rate": 1.7417355371900826e-07, + "logits/chosen": -0.2177734375, + "logits/rejected": -0.419921875, + "logps/chosen": -438.0, + "logps/rejected": -338.0, + "loss": 0.0853, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.76171875, + "rewards/margins": 8.4375, + "rewards/rejected": -7.6875, + "step": 1602 + }, + { + "epoch": 1.9668711656441717, + "grad_norm": 18.82710805276002, + "learning_rate": 1.739669421487603e-07, + "logits/chosen": -0.244140625, + "logits/rejected": -0.43359375, + "logps/chosen": -466.0, + "logps/rejected": -386.0, + "loss": 0.0765, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.31640625, + "rewards/margins": 8.75, + "rewards/rejected": -8.4375, + "step": 1603 + }, + { + "epoch": 1.9680981595092024, + "grad_norm": 13.660334432483126, + "learning_rate": 1.7376033057851238e-07, + "logits/chosen": -0.185546875, + "logits/rejected": -0.376953125, + "logps/chosen": -386.0, + "logps/rejected": -354.0, + "loss": 0.0614, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.63671875, + "rewards/margins": 8.0625, + "rewards/rejected": -7.40625, + "step": 1604 + }, + { + "epoch": 1.969325153374233, + "grad_norm": 16.355510174655173, + "learning_rate": 1.7355371900826445e-07, + "logits/chosen": -0.2060546875, + "logits/rejected": -0.349609375, + "logps/chosen": -426.0, + "logps/rejected": -392.0, + "loss": 0.0872, + "rewards/accuracies": 0.9765625, + "rewards/chosen": -0.015869140625, + "rewards/margins": 7.9375, + "rewards/rejected": -7.9375, + "step": 1605 + }, + { + "epoch": 1.9705521472392638, + "grad_norm": 16.375311133988927, + "learning_rate": 1.7334710743801653e-07, + "logits/chosen": -0.302734375, + "logits/rejected": -0.51171875, + "logps/chosen": -410.0, + "logps/rejected": -394.0, + "loss": 0.0657, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.984375, + "rewards/margins": 9.25, + "rewards/rejected": -8.25, + "step": 1606 + }, + { + "epoch": 1.9717791411042946, + "grad_norm": 14.554343830774451, + "learning_rate": 1.7314049586776857e-07, + "logits/chosen": -0.24609375, + "logits/rejected": -0.474609375, + "logps/chosen": -378.0, + "logps/rejected": -326.0, + "loss": 0.0628, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.68359375, + "rewards/margins": 8.75, + "rewards/rejected": -8.0625, + "step": 1607 + }, + { + "epoch": 1.9730061349693253, + "grad_norm": 15.719187369250749, + "learning_rate": 1.7293388429752065e-07, + "logits/chosen": -0.267578125, + "logits/rejected": -0.466796875, + "logps/chosen": -390.0, + "logps/rejected": -370.0, + "loss": 0.0642, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.40625, + "rewards/margins": 8.625, + "rewards/rejected": -8.1875, + "step": 1608 + }, + { + "epoch": 1.974233128834356, + "grad_norm": 17.01909774411504, + "learning_rate": 1.7272727272727272e-07, + "logits/chosen": -0.287109375, + "logits/rejected": -0.419921875, + "logps/chosen": -374.0, + "logps/rejected": -358.0, + "loss": 0.0787, + "rewards/accuracies": 0.984375, + "rewards/chosen": -0.2001953125, + "rewards/margins": 8.25, + "rewards/rejected": -8.5, + "step": 1609 + }, + { + "epoch": 1.9754601226993866, + "grad_norm": 15.357536676228408, + "learning_rate": 1.725206611570248e-07, + "logits/chosen": -0.3125, + "logits/rejected": -0.408203125, + "logps/chosen": -364.0, + "logps/rejected": -324.0, + "loss": 0.0592, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.1611328125, + "rewards/margins": 8.3125, + "rewards/rejected": -8.1875, + "step": 1610 + }, + { + "epoch": 1.9766871165644173, + "grad_norm": 18.838550299680794, + "learning_rate": 1.7231404958677684e-07, + "logits/chosen": -0.2138671875, + "logits/rejected": -0.34765625, + "logps/chosen": -326.0, + "logps/rejected": -304.0, + "loss": 0.1053, + "rewards/accuracies": 0.9609375, + "rewards/chosen": -0.4296875, + "rewards/margins": 7.03125, + "rewards/rejected": -7.46875, + "step": 1611 + }, + { + "epoch": 1.977914110429448, + "grad_norm": 20.124369243466692, + "learning_rate": 1.7210743801652892e-07, + "logits/chosen": -0.1865234375, + "logits/rejected": -0.390625, + "logps/chosen": -434.0, + "logps/rejected": -420.0, + "loss": 0.0809, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.6640625, + "rewards/margins": 8.8125, + "rewards/rejected": -8.125, + "step": 1612 + }, + { + "epoch": 1.9791411042944786, + "grad_norm": 12.23192136632499, + "learning_rate": 1.71900826446281e-07, + "logits/chosen": -0.146484375, + "logits/rejected": -0.322265625, + "logps/chosen": -440.0, + "logps/rejected": -376.0, + "loss": 0.0454, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.41796875, + "rewards/margins": 9.1875, + "rewards/rejected": -8.8125, + "step": 1613 + }, + { + "epoch": 1.9803680981595093, + "grad_norm": 17.767099358459415, + "learning_rate": 1.7169421487603306e-07, + "logits/chosen": -0.341796875, + "logits/rejected": -0.55078125, + "logps/chosen": -432.0, + "logps/rejected": -390.0, + "loss": 0.0866, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.447265625, + "rewards/margins": 9.0, + "rewards/rejected": -8.5, + "step": 1614 + }, + { + "epoch": 1.98159509202454, + "grad_norm": 18.375199372248133, + "learning_rate": 1.7148760330578514e-07, + "logits/chosen": -0.376953125, + "logits/rejected": -0.4765625, + "logps/chosen": -372.0, + "logps/rejected": -374.0, + "loss": 0.0878, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.380859375, + "rewards/margins": 9.0, + "rewards/rejected": -8.625, + "step": 1615 + }, + { + "epoch": 1.9828220858895707, + "grad_norm": 16.980201801549224, + "learning_rate": 1.7128099173553718e-07, + "logits/chosen": -0.2236328125, + "logits/rejected": -0.361328125, + "logps/chosen": -354.0, + "logps/rejected": -312.0, + "loss": 0.0833, + "rewards/accuracies": 0.984375, + "rewards/chosen": -0.427734375, + "rewards/margins": 7.75, + "rewards/rejected": -8.1875, + "step": 1616 + }, + { + "epoch": 1.9840490797546013, + "grad_norm": 18.340815809134835, + "learning_rate": 1.7107438016528926e-07, + "logits/chosen": -0.1689453125, + "logits/rejected": -0.359375, + "logps/chosen": -362.0, + "logps/rejected": -338.0, + "loss": 0.0799, + "rewards/accuracies": 0.96875, + "rewards/chosen": -0.1640625, + "rewards/margins": 7.28125, + "rewards/rejected": -7.46875, + "step": 1617 + }, + { + "epoch": 1.985276073619632, + "grad_norm": 17.251543871972963, + "learning_rate": 1.708677685950413e-07, + "logits/chosen": -0.314453125, + "logits/rejected": -0.439453125, + "logps/chosen": -372.0, + "logps/rejected": -338.0, + "loss": 0.072, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.11181640625, + "rewards/margins": 7.9375, + "rewards/rejected": -7.8125, + "step": 1618 + }, + { + "epoch": 1.9865030674846627, + "grad_norm": 16.109177601042767, + "learning_rate": 1.7066115702479338e-07, + "logits/chosen": -0.34375, + "logits/rejected": -0.486328125, + "logps/chosen": -416.0, + "logps/rejected": -350.0, + "loss": 0.083, + "rewards/accuracies": 0.984375, + "rewards/chosen": -0.010498046875, + "rewards/margins": 8.0625, + "rewards/rejected": -8.0625, + "step": 1619 + }, + { + "epoch": 1.9877300613496933, + "grad_norm": 15.4178672934062, + "learning_rate": 1.7045454545454543e-07, + "logits/chosen": -0.251953125, + "logits/rejected": -0.423828125, + "logps/chosen": -374.0, + "logps/rejected": -340.0, + "loss": 0.0612, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.283203125, + "rewards/margins": 8.5625, + "rewards/rejected": -8.25, + "step": 1620 + }, + { + "epoch": 1.988957055214724, + "grad_norm": 14.585763450114149, + "learning_rate": 1.702479338842975e-07, + "logits/chosen": -0.2294921875, + "logits/rejected": -0.365234375, + "logps/chosen": -408.0, + "logps/rejected": -382.0, + "loss": 0.0668, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.42578125, + "rewards/margins": 8.5, + "rewards/rejected": -8.125, + "step": 1621 + }, + { + "epoch": 1.9901840490797547, + "grad_norm": 16.117811689018634, + "learning_rate": 1.7004132231404957e-07, + "logits/chosen": -0.455078125, + "logits/rejected": -0.59765625, + "logps/chosen": -406.0, + "logps/rejected": -404.0, + "loss": 0.0836, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.1513671875, + "rewards/margins": 8.375, + "rewards/rejected": -8.25, + "step": 1622 + }, + { + "epoch": 1.9914110429447853, + "grad_norm": 11.62582380086032, + "learning_rate": 1.6983471074380165e-07, + "logits/chosen": -0.2001953125, + "logits/rejected": -0.3984375, + "logps/chosen": -402.0, + "logps/rejected": -366.0, + "loss": 0.0433, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.50390625, + "rewards/margins": 8.875, + "rewards/rejected": -8.375, + "step": 1623 + }, + { + "epoch": 1.992638036809816, + "grad_norm": 12.363248165694763, + "learning_rate": 1.6962809917355372e-07, + "logits/chosen": -0.32421875, + "logits/rejected": -0.5703125, + "logps/chosen": -376.0, + "logps/rejected": -354.0, + "loss": 0.0564, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.703125, + "rewards/margins": 8.8125, + "rewards/rejected": -8.125, + "step": 1624 + }, + { + "epoch": 1.9938650306748467, + "grad_norm": 16.612845106209782, + "learning_rate": 1.6942148760330577e-07, + "logits/chosen": -0.1630859375, + "logits/rejected": -0.36328125, + "logps/chosen": -440.0, + "logps/rejected": -368.0, + "loss": 0.0635, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.84765625, + "rewards/margins": 8.5625, + "rewards/rejected": -7.75, + "step": 1625 + }, + { + "epoch": 1.9950920245398773, + "grad_norm": 18.500067272564216, + "learning_rate": 1.6921487603305784e-07, + "logits/chosen": -0.287109375, + "logits/rejected": -0.404296875, + "logps/chosen": -430.0, + "logps/rejected": -386.0, + "loss": 0.0799, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.4609375, + "rewards/margins": 8.0625, + "rewards/rejected": -7.625, + "step": 1626 + }, + { + "epoch": 1.996319018404908, + "grad_norm": 17.72671467214421, + "learning_rate": 1.6900826446280991e-07, + "logits/chosen": -0.3359375, + "logits/rejected": -0.451171875, + "logps/chosen": -370.0, + "logps/rejected": -330.0, + "loss": 0.0889, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.6328125, + "rewards/margins": 8.5, + "rewards/rejected": -7.84375, + "step": 1627 + }, + { + "epoch": 1.9975460122699387, + "grad_norm": 12.210404250665713, + "learning_rate": 1.68801652892562e-07, + "logits/chosen": -0.263671875, + "logits/rejected": -0.39453125, + "logps/chosen": -364.0, + "logps/rejected": -366.0, + "loss": 0.0598, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.90234375, + "rewards/margins": 8.875, + "rewards/rejected": -7.9375, + "step": 1628 + }, + { + "epoch": 1.9987730061349693, + "grad_norm": 18.064956939135023, + "learning_rate": 1.6859504132231403e-07, + "logits/chosen": -0.1640625, + "logits/rejected": -0.33203125, + "logps/chosen": -392.0, + "logps/rejected": -366.0, + "loss": 0.088, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.50390625, + "rewards/margins": 8.0625, + "rewards/rejected": -7.5625, + "step": 1629 + }, + { + "epoch": 2.0, + "grad_norm": 14.818785297318101, + "learning_rate": 1.683884297520661e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.435546875, + "logps/chosen": -422.0, + "logps/rejected": -380.0, + "loss": 0.0621, + "rewards/accuracies": 0.9831933379173279, + "rewards/chosen": 0.69921875, + "rewards/margins": 9.0, + "rewards/rejected": -8.3125, + "step": 1630 + } + ], + "logging_steps": 1, + "max_steps": 2445, + "num_input_tokens_seen": 0, + "num_train_epochs": 3, + "save_steps": 500, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 0.0, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/checkpoint-1630/training_args.bin b/checkpoint-1630/training_args.bin new file mode 100644 index 0000000..e6584e4 --- /dev/null +++ b/checkpoint-1630/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2c8443655ac3e7ec4a935ee92ab8e32d8a6138b7510b01c0cdfb106a1174f6d8 +size 9528 diff --git a/checkpoint-1630/zero_to_fp32.py b/checkpoint-1630/zero_to_fp32.py new file mode 100644 index 0000000..24cc342 --- /dev/null +++ b/checkpoint-1630/zero_to_fp32.py @@ -0,0 +1,604 @@ +#!/usr/bin/env python + +# Copyright (c) Microsoft Corporation. +# SPDX-License-Identifier: Apache-2.0 + +# DeepSpeed Team + +# This script extracts fp32 consolidated weights from a zero 1, 2 and 3 DeepSpeed checkpoints. It gets +# copied into the top level checkpoint dir, so the user can easily do the conversion at any point in +# the future. Once extracted, the weights don't require DeepSpeed and can be used in any +# application. +# +# example: python zero_to_fp32.py . pytorch_model.bin + +import argparse +import torch +import glob +import math +import os +import re +from collections import OrderedDict +from dataclasses import dataclass + +# while this script doesn't use deepspeed to recover data, since the checkpoints are pickled with +# DeepSpeed data structures it has to be available in the current python environment. +from deepspeed.utils import logger +from deepspeed.checkpoint.constants import (DS_VERSION, OPTIMIZER_STATE_DICT, SINGLE_PARTITION_OF_FP32_GROUPS, + FP32_FLAT_GROUPS, ZERO_STAGE, PARTITION_COUNT, PARAM_SHAPES, BUFFER_NAMES, + FROZEN_PARAM_SHAPES, FROZEN_PARAM_FRAGMENTS) + + +@dataclass +class zero_model_state: + buffers: dict() + param_shapes: dict() + shared_params: list + ds_version: int + frozen_param_shapes: dict() + frozen_param_fragments: dict() + + +debug = 0 + +# load to cpu +device = torch.device('cpu') + + +def atoi(text): + return int(text) if text.isdigit() else text + + +def natural_keys(text): + ''' + alist.sort(key=natural_keys) sorts in human order + http://nedbatchelder.com/blog/200712/human_sorting.html + (See Toothy's implementation in the comments) + ''' + return [atoi(c) for c in re.split(r'(\d+)', text)] + + +def get_model_state_file(checkpoint_dir, zero_stage): + if not os.path.isdir(checkpoint_dir): + raise FileNotFoundError(f"Directory '{checkpoint_dir}' doesn't exist") + + # there should be only one file + if zero_stage <= 2: + file = os.path.join(checkpoint_dir, "mp_rank_00_model_states.pt") + elif zero_stage == 3: + file = os.path.join(checkpoint_dir, "zero_pp_rank_0_mp_rank_00_model_states.pt") + + if not os.path.exists(file): + raise FileNotFoundError(f"can't find model states file at '{file}'") + + return file + + +def get_checkpoint_files(checkpoint_dir, glob_pattern): + # XXX: need to test that this simple glob rule works for multi-node setup too + ckpt_files = sorted(glob.glob(os.path.join(checkpoint_dir, glob_pattern)), key=natural_keys) + + if len(ckpt_files) == 0: + raise FileNotFoundError(f"can't find {glob_pattern} files in directory '{checkpoint_dir}'") + + return ckpt_files + + +def get_optim_files(checkpoint_dir): + return get_checkpoint_files(checkpoint_dir, "*_optim_states.pt") + + +def get_model_state_files(checkpoint_dir): + return get_checkpoint_files(checkpoint_dir, "*_model_states.pt") + + +def parse_model_states(files): + zero_model_states = [] + for file in files: + state_dict = torch.load(file, map_location=device) + + if BUFFER_NAMES not in state_dict: + raise ValueError(f"{file} is not a model state checkpoint") + buffer_names = state_dict[BUFFER_NAMES] + if debug: + print("Found buffers:", buffer_names) + + # recover just the buffers while restoring them to fp32 if they were saved in fp16 + buffers = {k: v.float() for k, v in state_dict["module"].items() if k in buffer_names} + param_shapes = state_dict[PARAM_SHAPES] + + # collect parameters that are included in param_shapes + param_names = [] + for s in param_shapes: + for name in s.keys(): + param_names.append(name) + + # update with frozen parameters + frozen_param_shapes = state_dict.get(FROZEN_PARAM_SHAPES, None) + if frozen_param_shapes is not None: + if debug: + print(f"Found frozen_param_shapes: {frozen_param_shapes}") + param_names += list(frozen_param_shapes.keys()) + + # handle shared params + shared_params = [[k, v] for k, v in state_dict["shared_params"].items()] + + ds_version = state_dict.get(DS_VERSION, None) + + frozen_param_fragments = state_dict.get(FROZEN_PARAM_FRAGMENTS, None) + + z_model_state = zero_model_state(buffers=buffers, + param_shapes=param_shapes, + shared_params=shared_params, + ds_version=ds_version, + frozen_param_shapes=frozen_param_shapes, + frozen_param_fragments=frozen_param_fragments) + zero_model_states.append(z_model_state) + + return zero_model_states + + +def parse_optim_states(files, ds_checkpoint_dir): + + total_files = len(files) + state_dicts = [] + for f in files: + state_dict = torch.load(f, map_location=device) + # immediately discard the potentially huge 2 optimizer states as we only care for fp32 master weights + # and also handle the case where it was already removed by another helper script + state_dict["optimizer_state_dict"].pop("optimizer_state_dict", None) + state_dicts.append(state_dict) + + if not ZERO_STAGE in state_dicts[0][OPTIMIZER_STATE_DICT]: + raise ValueError(f"{files[0]} is not a zero checkpoint") + zero_stage = state_dicts[0][OPTIMIZER_STATE_DICT][ZERO_STAGE] + world_size = state_dicts[0][OPTIMIZER_STATE_DICT][PARTITION_COUNT] + + # For ZeRO-2 each param group can have different partition_count as data parallelism for expert + # parameters can be different from data parallelism for non-expert parameters. So we can just + # use the max of the partition_count to get the dp world_size. + + if type(world_size) is list: + world_size = max(world_size) + + if world_size != total_files: + raise ValueError( + f"Expected {world_size} of '*_optim_states.pt' under '{ds_checkpoint_dir}' but found {total_files} files. " + "Possibly due to an overwrite of an old checkpoint, or a checkpoint didn't get saved by one or more processes." + ) + + # the groups are named differently in each stage + if zero_stage <= 2: + fp32_groups_key = SINGLE_PARTITION_OF_FP32_GROUPS + elif zero_stage == 3: + fp32_groups_key = FP32_FLAT_GROUPS + else: + raise ValueError(f"unknown zero stage {zero_stage}") + + if zero_stage <= 2: + fp32_flat_groups = [state_dicts[i][OPTIMIZER_STATE_DICT][fp32_groups_key] for i in range(len(state_dicts))] + elif zero_stage == 3: + # if there is more than one param group, there will be multiple flattened tensors - one + # flattened tensor per group - for simplicity merge them into a single tensor + # + # XXX: could make the script more memory efficient for when there are multiple groups - it + # will require matching the sub-lists of param_shapes for each param group flattened tensor + + fp32_flat_groups = [ + torch.cat(state_dicts[i][OPTIMIZER_STATE_DICT][fp32_groups_key], 0) for i in range(len(state_dicts)) + ] + + return zero_stage, world_size, fp32_flat_groups + + +def _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters): + """ + Returns fp32 state_dict reconstructed from ds checkpoint + + Args: + - ``ds_checkpoint_dir``: path to the deepspeed checkpoint folder (where the optimizer files are) + + """ + print(f"Processing zero checkpoint '{ds_checkpoint_dir}'") + + optim_files = get_optim_files(ds_checkpoint_dir) + zero_stage, world_size, fp32_flat_groups = parse_optim_states(optim_files, ds_checkpoint_dir) + print(f"Detected checkpoint of type zero stage {zero_stage}, world_size: {world_size}") + + model_files = get_model_state_files(ds_checkpoint_dir) + + zero_model_states = parse_model_states(model_files) + print(f'Parsing checkpoint created by deepspeed=={zero_model_states[0].ds_version}') + + if zero_stage <= 2: + return _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters) + elif zero_stage == 3: + return _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters) + + +def _zero2_merge_frozen_params(state_dict, zero_model_states): + if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0: + return + + frozen_param_shapes = zero_model_states[0].frozen_param_shapes + frozen_param_fragments = zero_model_states[0].frozen_param_fragments + + if debug: + num_elem = sum(s.numel() for s in frozen_param_shapes.values()) + print(f'rank 0: {FROZEN_PARAM_SHAPES}.numel = {num_elem}') + + wanted_params = len(frozen_param_shapes) + wanted_numel = sum(s.numel() for s in frozen_param_shapes.values()) + avail_numel = sum([p.numel() for p in frozen_param_fragments.values()]) + print(f'Frozen params: Have {avail_numel} numels to process.') + print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params') + + total_params = 0 + total_numel = 0 + for name, shape in frozen_param_shapes.items(): + total_params += 1 + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + + state_dict[name] = frozen_param_fragments[name] + + if debug: + print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ") + + print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements") + + +def _has_callable(obj, fn): + attr = getattr(obj, fn, None) + return callable(attr) + + +def _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states): + param_shapes = zero_model_states[0].param_shapes + + # Reconstruction protocol: + # + # XXX: document this + + if debug: + for i in range(world_size): + for j in range(len(fp32_flat_groups[0])): + print(f"{FP32_FLAT_GROUPS}[{i}][{j}].shape={fp32_flat_groups[i][j].shape}") + + # XXX: memory usage doubles here (zero2) + num_param_groups = len(fp32_flat_groups[0]) + merged_single_partition_of_fp32_groups = [] + for i in range(num_param_groups): + merged_partitions = [sd[i] for sd in fp32_flat_groups] + full_single_fp32_vector = torch.cat(merged_partitions, 0) + merged_single_partition_of_fp32_groups.append(full_single_fp32_vector) + avail_numel = sum( + [full_single_fp32_vector.numel() for full_single_fp32_vector in merged_single_partition_of_fp32_groups]) + + if debug: + wanted_params = sum([len(shapes) for shapes in param_shapes]) + wanted_numel = sum([sum(shape.numel() for shape in shapes.values()) for shapes in param_shapes]) + # not asserting if there is a mismatch due to possible padding + print(f"Have {avail_numel} numels to process.") + print(f"Need {wanted_numel} numels in {wanted_params} params.") + + # params + # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support + # out-of-core computing solution + total_numel = 0 + total_params = 0 + for shapes, full_single_fp32_vector in zip(param_shapes, merged_single_partition_of_fp32_groups): + offset = 0 + avail_numel = full_single_fp32_vector.numel() + for name, shape in shapes.items(): + + unpartitioned_numel = shape.numel() if _has_callable(shape, 'numel') else math.prod(shape) + total_numel += unpartitioned_numel + total_params += 1 + + if debug: + print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ") + state_dict[name] = full_single_fp32_vector.narrow(0, offset, unpartitioned_numel).view(shape) + offset += unpartitioned_numel + + # Z2 started to align to 2*world_size to improve nccl performance. Therefore both offset and + # avail_numel can differ by anywhere between 0..2*world_size. Due to two unrelated complex + # paddings performed in the code it's almost impossible to predict the exact numbers w/o the + # live optimizer object, so we are checking that the numbers are within the right range + align_to = 2 * world_size + + def zero2_align(x): + return align_to * math.ceil(x / align_to) + + if debug: + print(f"original offset={offset}, avail_numel={avail_numel}") + + offset = zero2_align(offset) + avail_numel = zero2_align(avail_numel) + + if debug: + print(f"aligned offset={offset}, avail_numel={avail_numel}") + + # Sanity check + if offset != avail_numel: + raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong") + + print(f"Reconstructed fp32 state dict with {total_params} params {total_numel} elements") + + +def _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters): + state_dict = OrderedDict() + + # buffers + buffers = zero_model_states[0].buffers + state_dict.update(buffers) + if debug: + print(f"added {len(buffers)} buffers") + + if not exclude_frozen_parameters: + _zero2_merge_frozen_params(state_dict, zero_model_states) + + _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states) + + # recover shared parameters + for pair in zero_model_states[0].shared_params: + if pair[1] in state_dict: + state_dict[pair[0]] = state_dict[pair[1]] + + return state_dict + + +def zero3_partitioned_param_info(unpartitioned_numel, world_size): + remainder = unpartitioned_numel % world_size + padding_numel = (world_size - remainder) if remainder else 0 + partitioned_numel = math.ceil(unpartitioned_numel / world_size) + return partitioned_numel, padding_numel + + +def _zero3_merge_frozen_params(state_dict, world_size, zero_model_states): + if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0: + return + + if debug: + for i in range(world_size): + num_elem = sum(s.numel() for s in zero_model_states[i].frozen_param_fragments.values()) + print(f'rank {i}: {FROZEN_PARAM_SHAPES}.numel = {num_elem}') + + frozen_param_shapes = zero_model_states[0].frozen_param_shapes + wanted_params = len(frozen_param_shapes) + wanted_numel = sum(s.numel() for s in frozen_param_shapes.values()) + avail_numel = sum([p.numel() for p in zero_model_states[0].frozen_param_fragments.values()]) * world_size + print(f'Frozen params: Have {avail_numel} numels to process.') + print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params') + + total_params = 0 + total_numel = 0 + for name, shape in zero_model_states[0].frozen_param_shapes.items(): + total_params += 1 + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + + param_frags = tuple(model_state.frozen_param_fragments[name] for model_state in zero_model_states) + state_dict[name] = torch.cat(param_frags, 0).narrow(0, 0, unpartitioned_numel).view(shape) + + partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size) + + if debug: + print( + f"Frozen params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}" + ) + + print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements") + + +def _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states): + param_shapes = zero_model_states[0].param_shapes + avail_numel = fp32_flat_groups[0].numel() * world_size + # Reconstruction protocol: For zero3 we need to zip the partitions together at boundary of each + # param, re-consolidating each param, while dealing with padding if any + + # merge list of dicts, preserving order + param_shapes = {k: v for d in param_shapes for k, v in d.items()} + + if debug: + for i in range(world_size): + print(f"{FP32_FLAT_GROUPS}[{i}].shape={fp32_flat_groups[i].shape}") + + wanted_params = len(param_shapes) + wanted_numel = sum(shape.numel() for shape in param_shapes.values()) + # not asserting if there is a mismatch due to possible padding + avail_numel = fp32_flat_groups[0].numel() * world_size + print(f"Trainable params: Have {avail_numel} numels to process.") + print(f"Trainable params: Need {wanted_numel} numels in {wanted_params} params.") + + # params + # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support + # out-of-core computing solution + offset = 0 + total_numel = 0 + total_params = 0 + for name, shape in param_shapes.items(): + + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + total_params += 1 + + partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size) + + if debug: + print( + f"Trainable params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}" + ) + + # XXX: memory usage doubles here + state_dict[name] = torch.cat( + tuple(fp32_flat_groups[i].narrow(0, offset, partitioned_numel) for i in range(world_size)), + 0).narrow(0, 0, unpartitioned_numel).view(shape) + offset += partitioned_numel + + offset *= world_size + + # Sanity check + if offset != avail_numel: + raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong") + + print(f"Reconstructed Trainable fp32 state dict with {total_params} params {total_numel} elements") + + +def _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters): + state_dict = OrderedDict() + + # buffers + buffers = zero_model_states[0].buffers + state_dict.update(buffers) + if debug: + print(f"added {len(buffers)} buffers") + + if not exclude_frozen_parameters: + _zero3_merge_frozen_params(state_dict, world_size, zero_model_states) + + _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states) + + # recover shared parameters + for pair in zero_model_states[0].shared_params: + if pair[1] in state_dict: + state_dict[pair[0]] = state_dict[pair[1]] + + return state_dict + + +def get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, tag=None, exclude_frozen_parameters=False): + """ + Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated state_dict that can be loaded with + ``load_state_dict()`` and used for training without DeepSpeed or shared with others, for example + via a model hub. + + Args: + - ``checkpoint_dir``: path to the desired checkpoint folder + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in 'latest' file. e.g., ``global_step14`` + - ``exclude_frozen_parameters``: exclude frozen parameters + + Returns: + - pytorch ``state_dict`` + + Note: this approach may not work if your application doesn't have sufficient free CPU memory and + you may need to use the offline approach using the ``zero_to_fp32.py`` script that is saved with + the checkpoint. + + A typical usage might be :: + + from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint + # do the training and checkpoint saving + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir) # already on cpu + model = model.cpu() # move to cpu + model.load_state_dict(state_dict) + # submit to model hub or save the model to share with others + + In this example the ``model`` will no longer be usable in the deepspeed context of the same + application. i.e. you will need to re-initialize the deepspeed engine, since + ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it. + + If you want it all done for you, use ``load_state_dict_from_zero_checkpoint`` instead. + + """ + if tag is None: + latest_path = os.path.join(checkpoint_dir, 'latest') + if os.path.isfile(latest_path): + with open(latest_path, 'r') as fd: + tag = fd.read().strip() + else: + raise ValueError(f"Unable to find 'latest' file at {latest_path}") + + ds_checkpoint_dir = os.path.join(checkpoint_dir, tag) + + if not os.path.isdir(ds_checkpoint_dir): + raise FileNotFoundError(f"Directory '{ds_checkpoint_dir}' doesn't exist") + + return _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters) + + +def convert_zero_checkpoint_to_fp32_state_dict(checkpoint_dir, output_file, tag=None, exclude_frozen_parameters=False): + """ + Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict`` file that can be + loaded with ``torch.load(file)`` + ``load_state_dict()`` and used for training without DeepSpeed. + + Args: + - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``) + - ``output_file``: path to the pytorch fp32 state_dict output file (e.g. path/pytorch_model.bin) + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14`` + - ``exclude_frozen_parameters``: exclude frozen parameters + """ + + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, tag, exclude_frozen_parameters) + print(f"Saving fp32 state dict to {output_file}") + torch.save(state_dict, output_file) + + +def load_state_dict_from_zero_checkpoint(model, checkpoint_dir, tag=None): + """ + 1. Put the provided model to cpu + 2. Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict`` + 3. Load it into the provided model + + Args: + - ``model``: the model object to update + - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``) + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14`` + + Returns: + - ``model`: modified model + + Make sure you have plenty of CPU memory available before you call this function. If you don't + have enough use the ``zero_to_fp32.py`` utility to do the conversion. You will find it + conveniently placed for you in the checkpoint folder. + + A typical usage might be :: + + from deepspeed.utils.zero_to_fp32 import load_state_dict_from_zero_checkpoint + model = load_state_dict_from_zero_checkpoint(trainer.model, checkpoint_dir) + # submit to model hub or save the model to share with others + + Note, that once this was run, the ``model`` will no longer be usable in the deepspeed context + of the same application. i.e. you will need to re-initialize the deepspeed engine, since + ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it. + + """ + logger.info(f"Extracting fp32 weights") + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, tag) + + logger.info(f"Overwriting model with fp32 weights") + model = model.cpu() + model.load_state_dict(state_dict, strict=False) + + return model + + +if __name__ == "__main__": + + parser = argparse.ArgumentParser() + parser.add_argument("checkpoint_dir", + type=str, + help="path to the desired checkpoint folder, e.g., path/checkpoint-12") + parser.add_argument( + "output_file", + type=str, + help="path to the pytorch fp32 state_dict output file (e.g. path/checkpoint-12/pytorch_model.bin)") + parser.add_argument("-t", + "--tag", + type=str, + default=None, + help="checkpoint tag used as a unique identifier for checkpoint. e.g., global_step1") + parser.add_argument("--exclude_frozen_parameters", action='store_true', help="exclude frozen parameters") + parser.add_argument("-d", "--debug", action='store_true', help="enable debug") + args = parser.parse_args() + + debug = args.debug + + convert_zero_checkpoint_to_fp32_state_dict(args.checkpoint_dir, + args.output_file, + tag=args.tag, + exclude_frozen_parameters=args.exclude_frozen_parameters) diff --git a/checkpoint-2445/config.json b/checkpoint-2445/config.json new file mode 100644 index 0000000..ded5a8b --- /dev/null +++ b/checkpoint-2445/config.json @@ -0,0 +1,35 @@ +{ + "architectures": [ + "LlamaForCausalLM" + ], + "attention_bias": false, + "attention_dropout": 0.0, + "bos_token_id": 128000, + "eos_token_id": 128009, + "head_dim": 128, + "hidden_act": "silu", + "hidden_size": 4096, + "initializer_range": 0.02, + "intermediate_size": 14336, + "max_position_embeddings": 131072, + "mlp_bias": false, + "model_type": "llama", + "num_attention_heads": 32, + "num_hidden_layers": 32, + "num_key_value_heads": 8, + "pretraining_tp": 1, + "rms_norm_eps": 1e-05, + "rope_scaling": { + "factor": 8.0, + "high_freq_factor": 4.0, + "low_freq_factor": 1.0, + "original_max_position_embeddings": 8192, + "rope_type": "llama3" + }, + "rope_theta": 500000.0, + "tie_word_embeddings": false, + "torch_dtype": "bfloat16", + "transformers_version": "4.50.0", + "use_cache": false, + "vocab_size": 128256 +} diff --git a/checkpoint-2445/generation_config.json b/checkpoint-2445/generation_config.json new file mode 100644 index 0000000..0acdb5a --- /dev/null +++ b/checkpoint-2445/generation_config.json @@ -0,0 +1,12 @@ +{ + "bos_token_id": 128000, + "do_sample": true, + "eos_token_id": [ + 128001, + 128008, + 128009 + ], + "temperature": 0.6, + "top_p": 0.9, + "transformers_version": "4.50.0" +} diff --git a/checkpoint-2445/global_step2445/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..70cbdb0 --- /dev/null +++ b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:91ccfbe942416920820c64dbcef0ca33030b660623bc9cb3b51951653e1b7ac0 +size 1514015111 diff --git a/checkpoint-2445/global_step2445/bf16_zero_pp_rank_10_mp_rank_00_optim_states.pt b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_10_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..b3bb6e1 --- /dev/null +++ b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_10_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:19f22c08bfe8e7ede6e28e0009a5a31fae5cea0a9e9f476d9268f01087cffd42 +size 1514016442 diff --git a/checkpoint-2445/global_step2445/bf16_zero_pp_rank_11_mp_rank_00_optim_states.pt b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_11_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..2ac1765 --- /dev/null +++ b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_11_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:bc0c0533cd23c3ce65f5052b497d05b64c90c837f3a46bcb4152ebadf44158bf +size 1514016442 diff --git a/checkpoint-2445/global_step2445/bf16_zero_pp_rank_12_mp_rank_00_optim_states.pt b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_12_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..84b10a5 --- /dev/null +++ b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_12_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e035f470cdc5fb924fb289aaafa7cc67b5d9c5988fa2e8c9ae17e590c62586a6 +size 1514016442 diff --git a/checkpoint-2445/global_step2445/bf16_zero_pp_rank_13_mp_rank_00_optim_states.pt b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_13_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..39880e8 --- /dev/null +++ b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_13_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:de08825561c8a94c5aef15dd22b4e719ff0160e9a60c2aaceaf1af4ae20373f6 +size 1514016442 diff --git a/checkpoint-2445/global_step2445/bf16_zero_pp_rank_14_mp_rank_00_optim_states.pt b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_14_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..feed22f --- /dev/null +++ b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_14_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ef4eb48a6e6f45bac6354516c6e52bd4c4c4d6154611be95209e047cf8b8a9c6 +size 1514016442 diff --git a/checkpoint-2445/global_step2445/bf16_zero_pp_rank_15_mp_rank_00_optim_states.pt b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_15_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..8442c18 --- /dev/null +++ b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_15_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2088f7b4c0603c110e01464e61fb3c8c375c236dad23dce3c2ddd6e1175999a7 +size 1514016442 diff --git a/checkpoint-2445/global_step2445/bf16_zero_pp_rank_16_mp_rank_00_optim_states.pt b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_16_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..42afa45 --- /dev/null +++ b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_16_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3f7bf3c459d01a974fcd810b7b492a1d6d0ef13fbd2025e125666a636ab67017 +size 1514016442 diff --git a/checkpoint-2445/global_step2445/bf16_zero_pp_rank_17_mp_rank_00_optim_states.pt b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_17_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..8343129 --- /dev/null +++ b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_17_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:1aba27a6133825bcddda1e0e67dc10fcceb6e713b0ec20175b4231ef2006357f +size 1514016442 diff --git a/checkpoint-2445/global_step2445/bf16_zero_pp_rank_18_mp_rank_00_optim_states.pt b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_18_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..4054be8 --- /dev/null +++ b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_18_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:8240e6b3a548f8cbca182ced7aba986f75e829f4cd4dec62695c17fe21108f78 +size 1514016442 diff --git a/checkpoint-2445/global_step2445/bf16_zero_pp_rank_19_mp_rank_00_optim_states.pt b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_19_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..dd4090f --- /dev/null +++ b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_19_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:dcef7c3bc82996ffafbe2bf2b48aa8695463cdb6ed346d16c278fb141de7c545 +size 1514016442 diff --git a/checkpoint-2445/global_step2445/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..bb90b3d --- /dev/null +++ b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d225aae7ae655c7c185dcaceb38e3b4ad88165eb13a4090532fa417a0904ae1a +size 1514015111 diff --git a/checkpoint-2445/global_step2445/bf16_zero_pp_rank_20_mp_rank_00_optim_states.pt b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_20_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..2be3447 --- /dev/null +++ b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_20_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7495ee8f66b01ffd8207d10f6e358764b75120d61c23ca9e2982e4f6b6f7855c +size 1514016442 diff --git a/checkpoint-2445/global_step2445/bf16_zero_pp_rank_21_mp_rank_00_optim_states.pt b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_21_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..d5a660d --- /dev/null +++ b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_21_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d76ad321ff79bd1e5539f31bf9be6d84d431755b77a592af5c31f69b3496c68c +size 1514016442 diff --git a/checkpoint-2445/global_step2445/bf16_zero_pp_rank_22_mp_rank_00_optim_states.pt b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_22_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..129ad60 --- /dev/null +++ b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_22_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e764d81383e5e0ef5f374d04e3f7f372b6310c11bbf5ce385ae45a5362382c64 +size 1514016442 diff --git a/checkpoint-2445/global_step2445/bf16_zero_pp_rank_23_mp_rank_00_optim_states.pt b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_23_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..b6c5359 --- /dev/null +++ b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_23_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:8c9261c4a6f68b4bc5ffee005eb99bb15045e544e5100a062a3c199b6d1da5b9 +size 1514016442 diff --git a/checkpoint-2445/global_step2445/bf16_zero_pp_rank_24_mp_rank_00_optim_states.pt b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_24_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..6a6d718 --- /dev/null +++ b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_24_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c1372d2dd8e0f9f7fd8c66fc6a85fc4ba67635321864a54923c983ab90936ca9 +size 1514016442 diff --git a/checkpoint-2445/global_step2445/bf16_zero_pp_rank_25_mp_rank_00_optim_states.pt b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_25_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..a228e59 --- /dev/null +++ b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_25_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:17eefc8d2967e49f7e3c85f7fa09480f6d228802d447b3b29a9877cb5d6c25a0 +size 1514016442 diff --git a/checkpoint-2445/global_step2445/bf16_zero_pp_rank_26_mp_rank_00_optim_states.pt b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_26_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..93ae1e2 --- /dev/null +++ b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_26_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:adb42dec277d229d12dd81549cdc4a334dbdc3a3acbdc63baccf5df5ec8edb92 +size 1514016442 diff --git a/checkpoint-2445/global_step2445/bf16_zero_pp_rank_27_mp_rank_00_optim_states.pt b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_27_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..6913dec --- /dev/null +++ b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_27_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2b5823ea26ba7f6eb40541a01ced3a178cc311c204502395ccb9bc9c95705746 +size 1514016442 diff --git a/checkpoint-2445/global_step2445/bf16_zero_pp_rank_28_mp_rank_00_optim_states.pt b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_28_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..2820649 --- /dev/null +++ b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_28_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4765580b87d51cb593e49ce229d1f63417e4f40f51b1dc7c42af4949b91fa576 +size 1514016442 diff --git a/checkpoint-2445/global_step2445/bf16_zero_pp_rank_29_mp_rank_00_optim_states.pt b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_29_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..537a51f --- /dev/null +++ b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_29_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3ebb02a9d935773a27737789c87463ba3c7b57c070c741175bb04fb1c0ee00c4 +size 1514016442 diff --git a/checkpoint-2445/global_step2445/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..f7d0e59 --- /dev/null +++ b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:461beaf13c7714f6b1ddeb399d7da8e4bda3fb5543121ff0f3bd2447f4cfea1e +size 1514015111 diff --git a/checkpoint-2445/global_step2445/bf16_zero_pp_rank_30_mp_rank_00_optim_states.pt b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_30_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..881cd83 --- /dev/null +++ b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_30_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:374b3601a7287bb85fd2b62a21fbf5385701d53d6bbdd52c02bff721c158e30e +size 1514016442 diff --git a/checkpoint-2445/global_step2445/bf16_zero_pp_rank_31_mp_rank_00_optim_states.pt b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_31_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..b8ffd1e --- /dev/null +++ b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_31_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2e013d64e8fdd9eb0e5eca366815bdbb1f138fa195956afae50316129823e29c +size 1514016442 diff --git a/checkpoint-2445/global_step2445/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..13ba5ac --- /dev/null +++ b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6c571dd78f5f9ae184a4ff8bc4701dca19b9c304aaca32da511f31fb992ac8bd +size 1514015111 diff --git a/checkpoint-2445/global_step2445/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..dcb8da8 --- /dev/null +++ b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:642922902b4dc0f2a7e64cfad4690a8d482d9d5bee57edf13cfeeec7cea6b90c +size 1514015111 diff --git a/checkpoint-2445/global_step2445/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..59ad351 --- /dev/null +++ b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:49ef44b00e250dda42819882ce2607938a07fe0e914e2a216259a8dd55789ad5 +size 1514015111 diff --git a/checkpoint-2445/global_step2445/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..3e77b20 --- /dev/null +++ b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2ce6bfc52f41c2bd11df9766eef5d638505f2659e265388966a1e539a619a2d6 +size 1514015111 diff --git a/checkpoint-2445/global_step2445/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..6ed146e --- /dev/null +++ b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d81d1d4482619942f4b58d0882d8ffe9e4cfe5560c9262dbc2862bd47c4cff9f +size 1514015111 diff --git a/checkpoint-2445/global_step2445/bf16_zero_pp_rank_8_mp_rank_00_optim_states.pt b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_8_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..8e05a7a --- /dev/null +++ b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_8_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:cb73c5616bc4f4511d7c07ab8ae003a18ee1afd0a5b4c4438030eca52d0ffe19 +size 1514015111 diff --git a/checkpoint-2445/global_step2445/bf16_zero_pp_rank_9_mp_rank_00_optim_states.pt b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_9_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..fc1b6e9 --- /dev/null +++ b/checkpoint-2445/global_step2445/bf16_zero_pp_rank_9_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3913440c5315f09b167a676a40f4ad174242f80f170a14aefe30fa65e5d93ea8 +size 1514015111 diff --git a/checkpoint-2445/global_step2445/zero_pp_rank_0_mp_rank_00_model_states.pt b/checkpoint-2445/global_step2445/zero_pp_rank_0_mp_rank_00_model_states.pt new file mode 100644 index 0000000..b74ff49 --- /dev/null +++ b/checkpoint-2445/global_step2445/zero_pp_rank_0_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ffe2ec38edbe0b5d6e6150e6e9c4874bad566b9a275825fae36b115dfb705507 +size 150245 diff --git a/checkpoint-2445/global_step2445/zero_pp_rank_10_mp_rank_00_model_states.pt b/checkpoint-2445/global_step2445/zero_pp_rank_10_mp_rank_00_model_states.pt new file mode 100644 index 0000000..9f111a7 --- /dev/null +++ b/checkpoint-2445/global_step2445/zero_pp_rank_10_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c4e658b292c123f55b3d55c45e964bd863e856250b17842c831ffef0c85f16a1 +size 150540 diff --git a/checkpoint-2445/global_step2445/zero_pp_rank_11_mp_rank_00_model_states.pt b/checkpoint-2445/global_step2445/zero_pp_rank_11_mp_rank_00_model_states.pt new file mode 100644 index 0000000..06fe07b --- /dev/null +++ b/checkpoint-2445/global_step2445/zero_pp_rank_11_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:9fecdf063c4da0cf60d7f6b35ac9ea6a055abe701f722bc2c3d2bb7b044c2ea1 +size 150540 diff --git a/checkpoint-2445/global_step2445/zero_pp_rank_12_mp_rank_00_model_states.pt b/checkpoint-2445/global_step2445/zero_pp_rank_12_mp_rank_00_model_states.pt new file mode 100644 index 0000000..a7b1e94 --- /dev/null +++ b/checkpoint-2445/global_step2445/zero_pp_rank_12_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:bfc82216501ff83ea47d43f9f20b16bc0d56eb698d65763fa53af58261283b40 +size 150540 diff --git a/checkpoint-2445/global_step2445/zero_pp_rank_13_mp_rank_00_model_states.pt b/checkpoint-2445/global_step2445/zero_pp_rank_13_mp_rank_00_model_states.pt new file mode 100644 index 0000000..76a6636 --- /dev/null +++ b/checkpoint-2445/global_step2445/zero_pp_rank_13_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d5ca14f3ce2aa6e8432025d9bcfae023f4028772903aedf27251a73ee89d9d9c +size 150540 diff --git a/checkpoint-2445/global_step2445/zero_pp_rank_14_mp_rank_00_model_states.pt b/checkpoint-2445/global_step2445/zero_pp_rank_14_mp_rank_00_model_states.pt new file mode 100644 index 0000000..1a1c1d9 --- /dev/null +++ b/checkpoint-2445/global_step2445/zero_pp_rank_14_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b499c7332ae7a32106b346ae639177132aedc19afabb2738ca0e64bc3d7de2c1 +size 150540 diff --git a/checkpoint-2445/global_step2445/zero_pp_rank_15_mp_rank_00_model_states.pt b/checkpoint-2445/global_step2445/zero_pp_rank_15_mp_rank_00_model_states.pt new file mode 100644 index 0000000..cc19f64 --- /dev/null +++ b/checkpoint-2445/global_step2445/zero_pp_rank_15_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:329e41b68c60e83e871a716f6082a4be3c906e00da7ae73e051bd4337426c778 +size 150540 diff --git a/checkpoint-2445/global_step2445/zero_pp_rank_16_mp_rank_00_model_states.pt b/checkpoint-2445/global_step2445/zero_pp_rank_16_mp_rank_00_model_states.pt new file mode 100644 index 0000000..413b1e6 --- /dev/null +++ b/checkpoint-2445/global_step2445/zero_pp_rank_16_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2100aeaab7b7a3f79e3a5f65f4b0921ccb135f81fa1e051446156c3a3bfd73bb +size 150540 diff --git a/checkpoint-2445/global_step2445/zero_pp_rank_17_mp_rank_00_model_states.pt b/checkpoint-2445/global_step2445/zero_pp_rank_17_mp_rank_00_model_states.pt new file mode 100644 index 0000000..0f2822c --- /dev/null +++ b/checkpoint-2445/global_step2445/zero_pp_rank_17_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e2fbc8d92199cf5ea2edfdebf931db8adfe2a5f8765c18e9d8179778be59c539 +size 150540 diff --git a/checkpoint-2445/global_step2445/zero_pp_rank_18_mp_rank_00_model_states.pt b/checkpoint-2445/global_step2445/zero_pp_rank_18_mp_rank_00_model_states.pt new file mode 100644 index 0000000..7601315 --- /dev/null +++ b/checkpoint-2445/global_step2445/zero_pp_rank_18_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3db66e4fe950e5c4b5246e87074224980c95347d1ba107cbfc86679f6d97445d +size 150540 diff --git a/checkpoint-2445/global_step2445/zero_pp_rank_19_mp_rank_00_model_states.pt b/checkpoint-2445/global_step2445/zero_pp_rank_19_mp_rank_00_model_states.pt new file mode 100644 index 0000000..85f488c --- /dev/null +++ b/checkpoint-2445/global_step2445/zero_pp_rank_19_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:8fb63cd572f258454684e6ca311b00501e7d86139f94138968c00257036fa155 +size 150540 diff --git a/checkpoint-2445/global_step2445/zero_pp_rank_1_mp_rank_00_model_states.pt b/checkpoint-2445/global_step2445/zero_pp_rank_1_mp_rank_00_model_states.pt new file mode 100644 index 0000000..4ae6595 --- /dev/null +++ b/checkpoint-2445/global_step2445/zero_pp_rank_1_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:bae542fcea121575e03aef13180259386db45d8338cfb8e170c1b1e936f07f56 +size 150245 diff --git a/checkpoint-2445/global_step2445/zero_pp_rank_20_mp_rank_00_model_states.pt b/checkpoint-2445/global_step2445/zero_pp_rank_20_mp_rank_00_model_states.pt new file mode 100644 index 0000000..7af3882 --- /dev/null +++ b/checkpoint-2445/global_step2445/zero_pp_rank_20_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:5868fd1a75aa1dd0d95ee8c620b62c2278b143828cbebe4eccd1407be9677f7b +size 150540 diff --git a/checkpoint-2445/global_step2445/zero_pp_rank_21_mp_rank_00_model_states.pt b/checkpoint-2445/global_step2445/zero_pp_rank_21_mp_rank_00_model_states.pt new file mode 100644 index 0000000..40ace16 --- /dev/null +++ b/checkpoint-2445/global_step2445/zero_pp_rank_21_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:9ddc82f8cf5a751cf0e3262640ed49766df68af472a6d4814e51dac88862d27d +size 150540 diff --git a/checkpoint-2445/global_step2445/zero_pp_rank_22_mp_rank_00_model_states.pt b/checkpoint-2445/global_step2445/zero_pp_rank_22_mp_rank_00_model_states.pt new file mode 100644 index 0000000..a4ae388 --- /dev/null +++ b/checkpoint-2445/global_step2445/zero_pp_rank_22_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:12f2337e40e00274ed590c1fe24b40149ea7e94cffbef40a7cbf47645389cb3f +size 150540 diff --git a/checkpoint-2445/global_step2445/zero_pp_rank_23_mp_rank_00_model_states.pt b/checkpoint-2445/global_step2445/zero_pp_rank_23_mp_rank_00_model_states.pt new file mode 100644 index 0000000..26d41ca --- /dev/null +++ b/checkpoint-2445/global_step2445/zero_pp_rank_23_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3d4886a3dfdec0f0415d38692a739a753ab7e29dc88fa108e8b6fe42625ef192 +size 150540 diff --git a/checkpoint-2445/global_step2445/zero_pp_rank_24_mp_rank_00_model_states.pt b/checkpoint-2445/global_step2445/zero_pp_rank_24_mp_rank_00_model_states.pt new file mode 100644 index 0000000..1e1c670 --- /dev/null +++ b/checkpoint-2445/global_step2445/zero_pp_rank_24_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:a5fb4ecdb0b270ff0eced437c781d31b0cb014809d32917e168940877bfb03f4 +size 150540 diff --git a/checkpoint-2445/global_step2445/zero_pp_rank_25_mp_rank_00_model_states.pt b/checkpoint-2445/global_step2445/zero_pp_rank_25_mp_rank_00_model_states.pt new file mode 100644 index 0000000..f2774b4 --- /dev/null +++ b/checkpoint-2445/global_step2445/zero_pp_rank_25_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0901e901fe596b3138d2ccc32204539f794ef6f279c6b42be27a40c895c787d3 +size 150540 diff --git a/checkpoint-2445/global_step2445/zero_pp_rank_26_mp_rank_00_model_states.pt b/checkpoint-2445/global_step2445/zero_pp_rank_26_mp_rank_00_model_states.pt new file mode 100644 index 0000000..7e7363b --- /dev/null +++ b/checkpoint-2445/global_step2445/zero_pp_rank_26_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6f207ac4a816c43bf844c2c8c80644cbc46e16a4111a38c58827903cf3d4bcdd +size 150540 diff --git a/checkpoint-2445/global_step2445/zero_pp_rank_27_mp_rank_00_model_states.pt b/checkpoint-2445/global_step2445/zero_pp_rank_27_mp_rank_00_model_states.pt new file mode 100644 index 0000000..cbdd845 --- /dev/null +++ b/checkpoint-2445/global_step2445/zero_pp_rank_27_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:bd23381e14373662f70a9dce1c0eeb15924cb8077c967ddc0e6d1e1a572ce43c +size 150540 diff --git a/checkpoint-2445/global_step2445/zero_pp_rank_28_mp_rank_00_model_states.pt b/checkpoint-2445/global_step2445/zero_pp_rank_28_mp_rank_00_model_states.pt new file mode 100644 index 0000000..b4a85c8 --- /dev/null +++ b/checkpoint-2445/global_step2445/zero_pp_rank_28_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:059bf1ba37ee92ccca47187fded153a9af22ee7044a0cee33b17a8c25c31b2c1 +size 150540 diff --git a/checkpoint-2445/global_step2445/zero_pp_rank_29_mp_rank_00_model_states.pt b/checkpoint-2445/global_step2445/zero_pp_rank_29_mp_rank_00_model_states.pt new file mode 100644 index 0000000..387d79d --- /dev/null +++ b/checkpoint-2445/global_step2445/zero_pp_rank_29_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:f3f05ba702f76a781cc0cca9f4d3fab13ea3f597fc2ea91a5201fba24d0419b0 +size 150540 diff --git a/checkpoint-2445/global_step2445/zero_pp_rank_2_mp_rank_00_model_states.pt b/checkpoint-2445/global_step2445/zero_pp_rank_2_mp_rank_00_model_states.pt new file mode 100644 index 0000000..d0b24ac --- /dev/null +++ b/checkpoint-2445/global_step2445/zero_pp_rank_2_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0bf6f1b5fd7f395e28561eb3210bc8f3fa0d6cb589439ed820880d6b6a48bd6b +size 150245 diff --git a/checkpoint-2445/global_step2445/zero_pp_rank_30_mp_rank_00_model_states.pt b/checkpoint-2445/global_step2445/zero_pp_rank_30_mp_rank_00_model_states.pt new file mode 100644 index 0000000..0f81b1e --- /dev/null +++ b/checkpoint-2445/global_step2445/zero_pp_rank_30_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:60601369222e025ec7ace86e4faa98f72f42033dbddedc18dcc9e4a05d45b2c3 +size 150540 diff --git a/checkpoint-2445/global_step2445/zero_pp_rank_31_mp_rank_00_model_states.pt b/checkpoint-2445/global_step2445/zero_pp_rank_31_mp_rank_00_model_states.pt new file mode 100644 index 0000000..94614c4 --- /dev/null +++ b/checkpoint-2445/global_step2445/zero_pp_rank_31_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6cf71cecae2998dfe48359806530fde46071708a330bf5da58ac545c673467de +size 150540 diff --git a/checkpoint-2445/global_step2445/zero_pp_rank_3_mp_rank_00_model_states.pt b/checkpoint-2445/global_step2445/zero_pp_rank_3_mp_rank_00_model_states.pt new file mode 100644 index 0000000..ad35869 --- /dev/null +++ b/checkpoint-2445/global_step2445/zero_pp_rank_3_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e70e74735403d741bd55d1ece22450b62be54ef37652769657aa404eed47d2ee +size 150245 diff --git a/checkpoint-2445/global_step2445/zero_pp_rank_4_mp_rank_00_model_states.pt b/checkpoint-2445/global_step2445/zero_pp_rank_4_mp_rank_00_model_states.pt new file mode 100644 index 0000000..64d925c --- /dev/null +++ b/checkpoint-2445/global_step2445/zero_pp_rank_4_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4991f0ead2f78d5715727716ecf7bfe732ecfd7ab68f34f25f15fcc68c5a6267 +size 150245 diff --git a/checkpoint-2445/global_step2445/zero_pp_rank_5_mp_rank_00_model_states.pt b/checkpoint-2445/global_step2445/zero_pp_rank_5_mp_rank_00_model_states.pt new file mode 100644 index 0000000..cbcf333 --- /dev/null +++ b/checkpoint-2445/global_step2445/zero_pp_rank_5_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c5497e5c0a1f39abf9e032be83d4142aaca609dcce04ee031ffb3d11fd1e3c1a +size 150245 diff --git a/checkpoint-2445/global_step2445/zero_pp_rank_6_mp_rank_00_model_states.pt b/checkpoint-2445/global_step2445/zero_pp_rank_6_mp_rank_00_model_states.pt new file mode 100644 index 0000000..fdd724e --- /dev/null +++ b/checkpoint-2445/global_step2445/zero_pp_rank_6_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:5b97d0b7bc65b7c10b9af30baaecc9e58d79b2cb0861ae27187b4b0b3ba2674b +size 150245 diff --git a/checkpoint-2445/global_step2445/zero_pp_rank_7_mp_rank_00_model_states.pt b/checkpoint-2445/global_step2445/zero_pp_rank_7_mp_rank_00_model_states.pt new file mode 100644 index 0000000..2b06dbe --- /dev/null +++ b/checkpoint-2445/global_step2445/zero_pp_rank_7_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:1e2de5673e2d582e3de81f7b93016335f067b70ac5717d7651cb85afa1756486 +size 150245 diff --git a/checkpoint-2445/global_step2445/zero_pp_rank_8_mp_rank_00_model_states.pt b/checkpoint-2445/global_step2445/zero_pp_rank_8_mp_rank_00_model_states.pt new file mode 100644 index 0000000..83d25ae --- /dev/null +++ b/checkpoint-2445/global_step2445/zero_pp_rank_8_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d89c67316075467476c1eb25aa00637bc97f5c0b241d464e6ad18d5544dc314b +size 150245 diff --git a/checkpoint-2445/global_step2445/zero_pp_rank_9_mp_rank_00_model_states.pt b/checkpoint-2445/global_step2445/zero_pp_rank_9_mp_rank_00_model_states.pt new file mode 100644 index 0000000..ee1482a --- /dev/null +++ b/checkpoint-2445/global_step2445/zero_pp_rank_9_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:909fce6df9e30ff0e3b1913a1313d8414cff3352514e4d46eb424a280c594a27 +size 150245 diff --git a/checkpoint-2445/latest b/checkpoint-2445/latest new file mode 100644 index 0000000..5247c35 --- /dev/null +++ b/checkpoint-2445/latest @@ -0,0 +1 @@ +global_step2445 \ No newline at end of file diff --git a/checkpoint-2445/model-00001-of-00004.safetensors b/checkpoint-2445/model-00001-of-00004.safetensors new file mode 100644 index 0000000..ed64cd7 --- /dev/null +++ b/checkpoint-2445/model-00001-of-00004.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:cff81d17a3cd81e9d2b0ead991e0e87179e8e68a1affd888ec8bd5436a6abc66 +size 4976698672 diff --git a/checkpoint-2445/model-00002-of-00004.safetensors b/checkpoint-2445/model-00002-of-00004.safetensors new file mode 100644 index 0000000..937035a --- /dev/null +++ b/checkpoint-2445/model-00002-of-00004.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2842ae76f40d60eaaaa64f3fdc59fe484e071540609ea5786362fbe2c50e710e +size 4999802720 diff --git a/checkpoint-2445/model-00003-of-00004.safetensors b/checkpoint-2445/model-00003-of-00004.safetensors new file mode 100644 index 0000000..eecf8e9 --- /dev/null +++ b/checkpoint-2445/model-00003-of-00004.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:67cbf5fb045e08815772745e13a1f87329294c7e9392ec96189dbe1fdd401a70 +size 4915916176 diff --git a/checkpoint-2445/model-00004-of-00004.safetensors b/checkpoint-2445/model-00004-of-00004.safetensors new file mode 100644 index 0000000..382c28f --- /dev/null +++ b/checkpoint-2445/model-00004-of-00004.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b930bd71a39f3f5eeafea36d2cfb07b2271c03f0bfd1ba632abd42d9793c6c4b +size 1168138808 diff --git a/checkpoint-2445/model.safetensors.index.json b/checkpoint-2445/model.safetensors.index.json new file mode 100644 index 0000000..0fd8120 --- /dev/null +++ b/checkpoint-2445/model.safetensors.index.json @@ -0,0 +1,298 @@ +{ + "metadata": { + "total_size": 16060522496 + }, + "weight_map": { + "lm_head.weight": "model-00004-of-00004.safetensors", + "model.embed_tokens.weight": "model-00001-of-00004.safetensors", + "model.layers.0.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.0.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.0.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.0.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.0.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.0.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.0.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.0.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.0.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.1.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.1.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.1.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.1.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.1.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.1.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.1.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.1.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.1.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.10.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.10.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.10.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.10.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.10.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.10.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.10.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.10.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.10.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.11.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.11.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.11.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.11.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.11.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.11.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.11.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.11.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.11.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.12.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.12.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.12.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.12.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.12.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.12.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.12.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.12.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.12.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.13.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.13.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.13.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.13.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.13.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.13.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.13.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.13.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.13.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.14.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.14.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.14.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.14.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.14.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.14.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.14.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.14.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.14.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.15.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.15.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.15.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.15.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.15.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.15.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.15.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.15.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.15.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.16.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.16.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.16.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.16.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.16.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.16.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.16.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.16.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.16.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.17.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.17.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.17.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.17.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.17.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.17.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.17.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.17.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.17.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.18.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.18.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.18.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.18.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.18.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.18.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.18.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.18.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.18.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.19.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.19.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.19.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.19.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.19.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.19.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.19.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.19.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.19.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.2.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.2.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.2.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.2.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.2.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.2.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.2.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.2.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.2.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.20.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.20.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.20.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.20.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.20.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.20.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.20.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.20.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.20.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.21.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.21.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.21.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.21.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.21.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.21.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.21.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.21.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.21.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.22.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.22.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.22.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.22.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.22.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.22.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.22.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.22.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.22.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.23.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.23.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.23.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.23.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.23.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.23.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.23.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.23.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.23.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.24.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.24.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.24.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.24.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.24.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.24.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.24.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.24.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.24.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.25.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.25.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.25.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.25.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.25.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.25.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.25.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.25.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.25.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.26.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.26.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.26.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.26.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.26.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.26.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.26.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.26.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.26.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.27.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.27.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.27.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.27.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.27.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.27.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.27.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.27.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.27.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.28.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.28.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.28.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.28.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.28.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.28.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.28.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.28.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.28.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.29.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.29.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.29.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.29.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.29.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.29.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.29.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.29.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.29.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.3.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.3.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.3.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.3.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.3.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.3.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.3.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.3.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.3.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.30.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.30.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.30.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.30.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.30.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.30.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.30.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.30.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.30.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.31.input_layernorm.weight": "model-00004-of-00004.safetensors", + "model.layers.31.mlp.down_proj.weight": "model-00004-of-00004.safetensors", + "model.layers.31.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.31.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.31.post_attention_layernorm.weight": "model-00004-of-00004.safetensors", + "model.layers.31.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.31.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.31.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.31.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.4.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.4.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.4.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.4.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.4.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.4.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.4.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.4.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.4.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.5.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.5.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.5.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.5.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.5.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.5.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.5.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.5.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.5.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.6.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.6.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.6.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.6.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.6.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.6.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.6.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.6.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.6.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.7.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.7.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.7.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.7.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.7.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.7.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.7.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.7.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.7.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.8.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.8.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.8.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.8.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.8.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.8.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.8.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.8.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.8.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.9.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.9.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.9.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.9.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.9.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.9.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.9.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.9.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.9.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.norm.weight": "model-00004-of-00004.safetensors" + } +} diff --git a/checkpoint-2445/rng_state_0.pth b/checkpoint-2445/rng_state_0.pth new file mode 100644 index 0000000..3525225 --- /dev/null +++ b/checkpoint-2445/rng_state_0.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:08282b46825aa78d10fe10e3fea89555c5b5a691b261a3ddfd58fcb58370edff +size 15984 diff --git a/checkpoint-2445/rng_state_1.pth b/checkpoint-2445/rng_state_1.pth new file mode 100644 index 0000000..eeb7d8d --- /dev/null +++ b/checkpoint-2445/rng_state_1.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:dbab71d98a3a9a92df82a6bba463947327c3a1bcf35cd9f4f46114641fc42dd9 +size 15984 diff --git a/checkpoint-2445/rng_state_10.pth b/checkpoint-2445/rng_state_10.pth new file mode 100644 index 0000000..338c1db --- /dev/null +++ b/checkpoint-2445/rng_state_10.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:54e5c2d65c14df39137f6a3bd8314f534dad93d72efe8e40e23a61187ba74ce8 +size 15997 diff --git a/checkpoint-2445/rng_state_11.pth b/checkpoint-2445/rng_state_11.pth new file mode 100644 index 0000000..4bbb9bf --- /dev/null +++ b/checkpoint-2445/rng_state_11.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:f578146bcaaed333cf4637aa3b454e2f6238e691e45b4160001b63b4f8b5ce4e +size 15997 diff --git a/checkpoint-2445/rng_state_12.pth b/checkpoint-2445/rng_state_12.pth new file mode 100644 index 0000000..82f488f --- /dev/null +++ b/checkpoint-2445/rng_state_12.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:8463662162a837871bb50af43a407175ca95f3f364bc13c7d065e8b6929bad11 +size 15997 diff --git a/checkpoint-2445/rng_state_13.pth b/checkpoint-2445/rng_state_13.pth new file mode 100644 index 0000000..1b4dd63 --- /dev/null +++ b/checkpoint-2445/rng_state_13.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:fe9bafd75244b907f13aa5b102963f4d018d7b80b94ddb0262313774362d9305 +size 15997 diff --git a/checkpoint-2445/rng_state_14.pth b/checkpoint-2445/rng_state_14.pth new file mode 100644 index 0000000..b7f3c97 --- /dev/null +++ b/checkpoint-2445/rng_state_14.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c5e353c1ca54c464e3464d695507da7da6c134e4ad9d6acab6f72e52d5bf13c7 +size 15997 diff --git a/checkpoint-2445/rng_state_15.pth b/checkpoint-2445/rng_state_15.pth new file mode 100644 index 0000000..8e4dee4 --- /dev/null +++ b/checkpoint-2445/rng_state_15.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:24f1ef20cfc904ac8f811ceffab91f00cccadca0e878c8ef8a7335e83ef9513f +size 15997 diff --git a/checkpoint-2445/rng_state_16.pth b/checkpoint-2445/rng_state_16.pth new file mode 100644 index 0000000..4033ee0 --- /dev/null +++ b/checkpoint-2445/rng_state_16.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:cecf995eb1b13a85a673384ed67c75acc989e9d373ac7da2d90cbc7af2c1b4a7 +size 15997 diff --git a/checkpoint-2445/rng_state_17.pth b/checkpoint-2445/rng_state_17.pth new file mode 100644 index 0000000..0a50e02 --- /dev/null +++ b/checkpoint-2445/rng_state_17.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:375986c2a348f319aeed3322fcf23be7787f801c585046ff217d7855463fbc0d +size 15997 diff --git a/checkpoint-2445/rng_state_18.pth b/checkpoint-2445/rng_state_18.pth new file mode 100644 index 0000000..075e295 --- /dev/null +++ b/checkpoint-2445/rng_state_18.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:a50dfdcb902d78e55850cabc410552a4e651090792c2e086926cbda383b4f35f +size 15997 diff --git a/checkpoint-2445/rng_state_19.pth b/checkpoint-2445/rng_state_19.pth new file mode 100644 index 0000000..ac69e75 --- /dev/null +++ b/checkpoint-2445/rng_state_19.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:79850d41cfed8d83ef96222b2b956a0ec273b7fa78630d3cb0e86f2ab29bb934 +size 15997 diff --git a/checkpoint-2445/rng_state_2.pth b/checkpoint-2445/rng_state_2.pth new file mode 100644 index 0000000..e144a44 --- /dev/null +++ b/checkpoint-2445/rng_state_2.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:caac82d57d878d30219a4f9ec289a97ff90c53afc160b968f251b3fd3454b8d8 +size 15984 diff --git a/checkpoint-2445/rng_state_20.pth b/checkpoint-2445/rng_state_20.pth new file mode 100644 index 0000000..f4588d3 --- /dev/null +++ b/checkpoint-2445/rng_state_20.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:60201c3050f5fddd8ba67c9cc8ea589b8296872acef041a46972a75489ba48f2 +size 15997 diff --git a/checkpoint-2445/rng_state_21.pth b/checkpoint-2445/rng_state_21.pth new file mode 100644 index 0000000..94a9f24 --- /dev/null +++ b/checkpoint-2445/rng_state_21.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:9b45ccf4c1d4fa82ab73d5b1084c8895bb7a843bb65c39bb0b2bb2a6192e6df3 +size 15997 diff --git a/checkpoint-2445/rng_state_22.pth b/checkpoint-2445/rng_state_22.pth new file mode 100644 index 0000000..7d803e4 --- /dev/null +++ b/checkpoint-2445/rng_state_22.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:54521e12e4ad123a5cdba9d3c092e63ee37b099ff802bbe417dfb47861244ab9 +size 15997 diff --git a/checkpoint-2445/rng_state_23.pth b/checkpoint-2445/rng_state_23.pth new file mode 100644 index 0000000..10c1a68 --- /dev/null +++ b/checkpoint-2445/rng_state_23.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:f4917fcd537e822a9012f654e3131d5dbd358e1916dec368f464d89c1223a2e5 +size 15997 diff --git a/checkpoint-2445/rng_state_24.pth b/checkpoint-2445/rng_state_24.pth new file mode 100644 index 0000000..67c352c --- /dev/null +++ b/checkpoint-2445/rng_state_24.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e6b078914d8fc5b3568727c1679a97889d10f35460aaa0147c1ab343e0a8576f +size 15997 diff --git a/checkpoint-2445/rng_state_25.pth b/checkpoint-2445/rng_state_25.pth new file mode 100644 index 0000000..4e42fe3 --- /dev/null +++ b/checkpoint-2445/rng_state_25.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:58235624c008372a4489d1dc4d4a5d582e83b5954529d532a8ac9e27cc1117eb +size 15997 diff --git a/checkpoint-2445/rng_state_26.pth b/checkpoint-2445/rng_state_26.pth new file mode 100644 index 0000000..58fc36f --- /dev/null +++ b/checkpoint-2445/rng_state_26.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6d0a9e394ce0c35df215df576763794e20589536fd7d2e8aae0d2bfaac14eb95 +size 15997 diff --git a/checkpoint-2445/rng_state_27.pth b/checkpoint-2445/rng_state_27.pth new file mode 100644 index 0000000..0e9b2ee --- /dev/null +++ b/checkpoint-2445/rng_state_27.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:5a40fc515e550756e1b3497c9e62fa179918e76adb87ab3233db714b992268c8 +size 15997 diff --git a/checkpoint-2445/rng_state_28.pth b/checkpoint-2445/rng_state_28.pth new file mode 100644 index 0000000..befeed4 --- /dev/null +++ b/checkpoint-2445/rng_state_28.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6dadf1f4ae507c5e5ab940441273a3552a7e59fcc516e7dfddd1956d1c5c5a3d +size 15997 diff --git a/checkpoint-2445/rng_state_29.pth b/checkpoint-2445/rng_state_29.pth new file mode 100644 index 0000000..dfca012 --- /dev/null +++ b/checkpoint-2445/rng_state_29.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:73dfc967a343045291988f3bcbbdee93e0877bb869db48fd675e9946c2c43507 +size 15997 diff --git a/checkpoint-2445/rng_state_3.pth b/checkpoint-2445/rng_state_3.pth new file mode 100644 index 0000000..a10f352 --- /dev/null +++ b/checkpoint-2445/rng_state_3.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:19762d2d370222b01817da11bbaa6665d542293373186d66f754e7246bb861ed +size 15984 diff --git a/checkpoint-2445/rng_state_30.pth b/checkpoint-2445/rng_state_30.pth new file mode 100644 index 0000000..a6f6699 --- /dev/null +++ b/checkpoint-2445/rng_state_30.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6890d56ed291634fd39a3901c77e10c249a355684a11b3e34af07a400ff9189c +size 15997 diff --git a/checkpoint-2445/rng_state_31.pth b/checkpoint-2445/rng_state_31.pth new file mode 100644 index 0000000..5c916cb --- /dev/null +++ b/checkpoint-2445/rng_state_31.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:25d52ac86e2e15b3ec76429e008562b498d6431769f7f3ad24c182d032f7701b +size 15997 diff --git a/checkpoint-2445/rng_state_4.pth b/checkpoint-2445/rng_state_4.pth new file mode 100644 index 0000000..e6ef215 --- /dev/null +++ b/checkpoint-2445/rng_state_4.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:00c7508b346a7d3c5c23392845f1d013331114ade778794b76e919cb3ed5d33e +size 15984 diff --git a/checkpoint-2445/rng_state_5.pth b/checkpoint-2445/rng_state_5.pth new file mode 100644 index 0000000..126662e --- /dev/null +++ b/checkpoint-2445/rng_state_5.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b89de7d14dd20a191f56b74c816ef8b7fe5c171e31efbeadbf321c4539ed68c3 +size 15984 diff --git a/checkpoint-2445/rng_state_6.pth b/checkpoint-2445/rng_state_6.pth new file mode 100644 index 0000000..d4e6b27 --- /dev/null +++ b/checkpoint-2445/rng_state_6.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:1c71152053553e6e22d670fbc4fd7550bf8a046b54cad7b71869787986a6a42c +size 15984 diff --git a/checkpoint-2445/rng_state_7.pth b/checkpoint-2445/rng_state_7.pth new file mode 100644 index 0000000..14e214a --- /dev/null +++ b/checkpoint-2445/rng_state_7.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4b67db12a26a26ffe03d9afc84a43857eb2e5b2fec2dd189653b415f74208190 +size 15984 diff --git a/checkpoint-2445/rng_state_8.pth b/checkpoint-2445/rng_state_8.pth new file mode 100644 index 0000000..22cf6c8 --- /dev/null +++ b/checkpoint-2445/rng_state_8.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:50d06b29f11da5c2e4a388e6620296a543a68f4d46bb2bb978188a8e374f8925 +size 15984 diff --git a/checkpoint-2445/rng_state_9.pth b/checkpoint-2445/rng_state_9.pth new file mode 100644 index 0000000..a4fd554 --- /dev/null +++ b/checkpoint-2445/rng_state_9.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:bde660db671106d0d18882a4db0faf4fe72837df15f5537708435e1d684a549e +size 15984 diff --git a/checkpoint-2445/scheduler.pt b/checkpoint-2445/scheduler.pt new file mode 100644 index 0000000..c87923d --- /dev/null +++ b/checkpoint-2445/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:a0f554f0708975f970433abce5bc6d08d167e0f9154fb78eacef3d70d2d5cf52 +size 1064 diff --git a/checkpoint-2445/special_tokens_map.json b/checkpoint-2445/special_tokens_map.json new file mode 100644 index 0000000..278b7f0 --- /dev/null +++ b/checkpoint-2445/special_tokens_map.json @@ -0,0 +1,23 @@ +{ + "bos_token": { + "content": "<|begin_of_text|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false + }, + "eos_token": { + "content": "<|eot_id|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false + }, + "pad_token": { + "content": "<|end_of_text|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false + } +} diff --git a/checkpoint-2445/tokenizer.json b/checkpoint-2445/tokenizer.json new file mode 100644 index 0000000..1c1d8d5 --- /dev/null +++ b/checkpoint-2445/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6b9e4e7fb171f92fd137b777cc2714bf87d11576700a1dcd7a399e7bbe39537b +size 17209920 diff --git a/checkpoint-2445/tokenizer_config.json b/checkpoint-2445/tokenizer_config.json new file mode 100644 index 0000000..8098161 --- /dev/null +++ b/checkpoint-2445/tokenizer_config.json @@ -0,0 +1,2064 @@ +{ + "added_tokens_decoder": { + "128000": { + "content": "<|begin_of_text|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128001": { + "content": "<|end_of_text|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128002": { + "content": "<|reserved_special_token_0|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128003": { + "content": "<|reserved_special_token_1|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128004": { + "content": "<|finetune_right_pad_id|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128005": { + "content": "<|reserved_special_token_2|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128006": { + "content": "<|start_header_id|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128007": { + "content": "<|end_header_id|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128008": { + "content": "<|eom_id|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128009": { + "content": "<|eot_id|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128010": { + "content": "<|python_tag|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128011": { + "content": "<|reserved_special_token_3|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128012": { + "content": "<|reserved_special_token_4|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128013": { + "content": "<|reserved_special_token_5|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128014": { + "content": "<|reserved_special_token_6|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128015": { + "content": "<|reserved_special_token_7|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128016": { + "content": "<|reserved_special_token_8|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128017": { + "content": "<|reserved_special_token_9|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128018": { + "content": "<|reserved_special_token_10|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128019": { + "content": "<|reserved_special_token_11|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128020": { + "content": "<|reserved_special_token_12|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128021": { + "content": "<|reserved_special_token_13|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128022": { + "content": "<|reserved_special_token_14|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128023": { + "content": "<|reserved_special_token_15|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128024": { + "content": "<|reserved_special_token_16|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128025": { + "content": "<|reserved_special_token_17|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128026": { + "content": "<|reserved_special_token_18|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128027": { + "content": "<|reserved_special_token_19|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128028": { + "content": "<|reserved_special_token_20|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128029": { + "content": "<|reserved_special_token_21|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128030": { + "content": "<|reserved_special_token_22|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128031": { + "content": "<|reserved_special_token_23|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128032": { + "content": "<|reserved_special_token_24|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128033": { + "content": "<|reserved_special_token_25|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128034": { + "content": "<|reserved_special_token_26|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128035": { + "content": "<|reserved_special_token_27|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128036": { + "content": "<|reserved_special_token_28|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128037": { + "content": "<|reserved_special_token_29|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128038": { + "content": "<|reserved_special_token_30|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128039": { + "content": "<|reserved_special_token_31|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128040": { + "content": "<|reserved_special_token_32|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128041": { + "content": "<|reserved_special_token_33|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128042": { + "content": "<|reserved_special_token_34|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128043": { + "content": "<|reserved_special_token_35|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128044": { + "content": "<|reserved_special_token_36|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128045": { + "content": "<|reserved_special_token_37|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128046": { + "content": "<|reserved_special_token_38|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128047": { + "content": "<|reserved_special_token_39|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128048": { + "content": "<|reserved_special_token_40|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128049": { + "content": "<|reserved_special_token_41|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128050": { + "content": "<|reserved_special_token_42|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128051": { + "content": "<|reserved_special_token_43|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128052": { + "content": "<|reserved_special_token_44|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128053": { + "content": "<|reserved_special_token_45|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128054": { + "content": "<|reserved_special_token_46|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128055": { + "content": "<|reserved_special_token_47|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128056": { + "content": "<|reserved_special_token_48|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128057": { + "content": "<|reserved_special_token_49|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128058": { + "content": "<|reserved_special_token_50|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128059": { + "content": "<|reserved_special_token_51|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128060": { + "content": "<|reserved_special_token_52|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128061": { + "content": "<|reserved_special_token_53|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128062": { + "content": "<|reserved_special_token_54|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128063": { + "content": "<|reserved_special_token_55|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128064": { + "content": "<|reserved_special_token_56|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128065": { + "content": "<|reserved_special_token_57|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128066": { + "content": "<|reserved_special_token_58|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128067": { + "content": "<|reserved_special_token_59|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128068": { + "content": "<|reserved_special_token_60|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128069": { + "content": "<|reserved_special_token_61|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128070": { + "content": "<|reserved_special_token_62|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128071": { + "content": "<|reserved_special_token_63|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128072": { + "content": "<|reserved_special_token_64|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128073": { + "content": "<|reserved_special_token_65|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128074": { + "content": "<|reserved_special_token_66|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128075": { + "content": "<|reserved_special_token_67|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128076": { + "content": "<|reserved_special_token_68|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128077": { + "content": "<|reserved_special_token_69|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128078": { + "content": "<|reserved_special_token_70|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128079": { + "content": "<|reserved_special_token_71|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128080": { + "content": "<|reserved_special_token_72|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128081": { + "content": "<|reserved_special_token_73|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128082": { + "content": "<|reserved_special_token_74|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128083": { + "content": "<|reserved_special_token_75|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128084": { + "content": "<|reserved_special_token_76|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128085": { + "content": "<|reserved_special_token_77|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128086": { + "content": "<|reserved_special_token_78|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128087": { + "content": "<|reserved_special_token_79|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128088": { + "content": "<|reserved_special_token_80|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128089": { + "content": "<|reserved_special_token_81|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128090": { + "content": "<|reserved_special_token_82|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128091": { + "content": "<|reserved_special_token_83|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128092": { + "content": "<|reserved_special_token_84|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128093": { + "content": "<|reserved_special_token_85|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128094": { + "content": "<|reserved_special_token_86|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128095": { + "content": "<|reserved_special_token_87|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128096": { + "content": "<|reserved_special_token_88|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128097": { + "content": "<|reserved_special_token_89|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128098": { + "content": "<|reserved_special_token_90|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128099": { + "content": "<|reserved_special_token_91|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128100": { + "content": "<|reserved_special_token_92|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128101": { + "content": "<|reserved_special_token_93|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128102": { + "content": "<|reserved_special_token_94|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128103": { + "content": "<|reserved_special_token_95|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128104": { + "content": "<|reserved_special_token_96|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128105": { + "content": "<|reserved_special_token_97|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128106": { + "content": "<|reserved_special_token_98|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128107": { + "content": "<|reserved_special_token_99|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128108": { + "content": "<|reserved_special_token_100|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128109": { + "content": "<|reserved_special_token_101|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128110": { + "content": "<|reserved_special_token_102|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128111": { + "content": "<|reserved_special_token_103|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128112": { + "content": "<|reserved_special_token_104|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128113": { + "content": "<|reserved_special_token_105|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128114": { + "content": "<|reserved_special_token_106|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128115": { + "content": "<|reserved_special_token_107|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128116": { + "content": "<|reserved_special_token_108|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128117": { + "content": "<|reserved_special_token_109|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128118": { + "content": "<|reserved_special_token_110|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128119": { + "content": "<|reserved_special_token_111|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128120": { + "content": "<|reserved_special_token_112|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128121": { + "content": "<|reserved_special_token_113|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128122": { + "content": "<|reserved_special_token_114|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128123": { + "content": "<|reserved_special_token_115|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128124": { + "content": "<|reserved_special_token_116|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128125": { + "content": "<|reserved_special_token_117|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128126": { + "content": "<|reserved_special_token_118|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128127": { + "content": "<|reserved_special_token_119|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128128": { + "content": "<|reserved_special_token_120|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128129": { + "content": "<|reserved_special_token_121|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128130": { + "content": "<|reserved_special_token_122|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128131": { + "content": "<|reserved_special_token_123|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128132": { + "content": "<|reserved_special_token_124|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128133": { + "content": "<|reserved_special_token_125|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128134": { + "content": "<|reserved_special_token_126|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128135": { + "content": "<|reserved_special_token_127|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128136": { + "content": "<|reserved_special_token_128|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128137": { + "content": "<|reserved_special_token_129|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128138": { + "content": "<|reserved_special_token_130|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128139": { + "content": "<|reserved_special_token_131|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128140": { + "content": "<|reserved_special_token_132|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128141": { + "content": "<|reserved_special_token_133|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128142": { + "content": "<|reserved_special_token_134|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128143": { + "content": "<|reserved_special_token_135|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128144": { + "content": "<|reserved_special_token_136|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128145": { + "content": "<|reserved_special_token_137|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128146": { + "content": "<|reserved_special_token_138|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128147": { + "content": "<|reserved_special_token_139|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128148": { + "content": "<|reserved_special_token_140|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128149": { + "content": "<|reserved_special_token_141|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128150": { + "content": "<|reserved_special_token_142|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128151": { + "content": "<|reserved_special_token_143|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128152": { + "content": "<|reserved_special_token_144|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128153": { + "content": "<|reserved_special_token_145|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128154": { + "content": "<|reserved_special_token_146|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128155": { + "content": "<|reserved_special_token_147|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128156": { + "content": "<|reserved_special_token_148|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128157": { + "content": "<|reserved_special_token_149|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128158": { + "content": "<|reserved_special_token_150|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128159": { + "content": "<|reserved_special_token_151|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128160": { + "content": "<|reserved_special_token_152|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128161": { + "content": "<|reserved_special_token_153|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128162": { + "content": "<|reserved_special_token_154|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128163": { + "content": "<|reserved_special_token_155|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128164": { + "content": "<|reserved_special_token_156|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128165": { + "content": "<|reserved_special_token_157|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128166": { + "content": "<|reserved_special_token_158|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128167": { + "content": "<|reserved_special_token_159|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128168": { + "content": "<|reserved_special_token_160|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128169": { + "content": "<|reserved_special_token_161|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128170": { + "content": "<|reserved_special_token_162|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128171": { + "content": "<|reserved_special_token_163|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128172": { + "content": "<|reserved_special_token_164|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128173": { + "content": "<|reserved_special_token_165|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128174": { + "content": "<|reserved_special_token_166|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128175": { + "content": "<|reserved_special_token_167|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128176": { + "content": "<|reserved_special_token_168|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128177": { + "content": "<|reserved_special_token_169|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128178": { + "content": "<|reserved_special_token_170|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128179": { + "content": "<|reserved_special_token_171|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128180": { + "content": "<|reserved_special_token_172|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128181": { + "content": "<|reserved_special_token_173|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128182": { + "content": "<|reserved_special_token_174|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128183": { + "content": "<|reserved_special_token_175|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128184": { + "content": "<|reserved_special_token_176|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128185": { + "content": "<|reserved_special_token_177|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128186": { + "content": "<|reserved_special_token_178|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128187": { + "content": "<|reserved_special_token_179|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128188": { + "content": "<|reserved_special_token_180|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128189": { + "content": "<|reserved_special_token_181|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128190": { + "content": "<|reserved_special_token_182|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128191": { + "content": "<|reserved_special_token_183|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128192": { + "content": "<|reserved_special_token_184|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128193": { + "content": "<|reserved_special_token_185|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128194": { + "content": "<|reserved_special_token_186|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128195": { + "content": "<|reserved_special_token_187|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128196": { + "content": "<|reserved_special_token_188|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128197": { + "content": "<|reserved_special_token_189|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128198": { + "content": "<|reserved_special_token_190|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128199": { + "content": "<|reserved_special_token_191|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128200": { + "content": "<|reserved_special_token_192|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128201": { + "content": "<|reserved_special_token_193|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128202": { + "content": "<|reserved_special_token_194|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128203": { + "content": "<|reserved_special_token_195|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128204": { + "content": "<|reserved_special_token_196|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128205": { + "content": "<|reserved_special_token_197|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128206": { + "content": "<|reserved_special_token_198|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128207": { + "content": "<|reserved_special_token_199|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128208": { + "content": "<|reserved_special_token_200|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128209": { + "content": "<|reserved_special_token_201|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128210": { + "content": "<|reserved_special_token_202|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128211": { + "content": "<|reserved_special_token_203|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128212": { + "content": "<|reserved_special_token_204|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128213": { + "content": "<|reserved_special_token_205|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128214": { + "content": "<|reserved_special_token_206|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128215": { + "content": "<|reserved_special_token_207|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128216": { + "content": "<|reserved_special_token_208|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128217": { + "content": "<|reserved_special_token_209|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128218": { + "content": "<|reserved_special_token_210|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128219": { + "content": "<|reserved_special_token_211|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128220": { + "content": "<|reserved_special_token_212|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128221": { + "content": "<|reserved_special_token_213|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128222": { + "content": "<|reserved_special_token_214|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128223": { + "content": "<|reserved_special_token_215|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128224": { + "content": "<|reserved_special_token_216|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128225": { + "content": "<|reserved_special_token_217|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128226": { + "content": "<|reserved_special_token_218|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128227": { + "content": "<|reserved_special_token_219|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128228": { + "content": "<|reserved_special_token_220|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128229": { + "content": "<|reserved_special_token_221|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128230": { + "content": "<|reserved_special_token_222|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128231": { + "content": "<|reserved_special_token_223|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128232": { + "content": "<|reserved_special_token_224|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128233": { + "content": "<|reserved_special_token_225|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128234": { + "content": "<|reserved_special_token_226|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128235": { + "content": "<|reserved_special_token_227|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128236": { + "content": "<|reserved_special_token_228|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128237": { + "content": "<|reserved_special_token_229|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128238": { + "content": "<|reserved_special_token_230|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128239": { + "content": "<|reserved_special_token_231|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128240": { + "content": "<|reserved_special_token_232|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128241": { + "content": "<|reserved_special_token_233|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128242": { + "content": "<|reserved_special_token_234|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128243": { + "content": "<|reserved_special_token_235|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128244": { + "content": "<|reserved_special_token_236|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128245": { + "content": "<|reserved_special_token_237|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128246": { + "content": "<|reserved_special_token_238|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128247": { + "content": "<|reserved_special_token_239|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128248": { + "content": "<|reserved_special_token_240|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128249": { + "content": "<|reserved_special_token_241|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128250": { + "content": "<|reserved_special_token_242|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128251": { + "content": "<|reserved_special_token_243|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128252": { + "content": "<|reserved_special_token_244|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128253": { + "content": "<|reserved_special_token_245|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128254": { + "content": "<|reserved_special_token_246|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128255": { + "content": "<|reserved_special_token_247|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + } + }, + "bos_token": "<|begin_of_text|>", + "chat_template": "{% if not add_generation_prompt is defined %}{% set add_generation_prompt = false %}{% endif %}{% set loop_messages = messages %}{% for message in loop_messages %}{% set content = '<|start_header_id|>' + message['role'] + '<|end_header_id|>\n\n'+ message['content'] | trim + '<|eot_id|>' %}{% if loop.index0 == 0 %}{% set content = bos_token + content %}{% endif %}{{ content }}{% endfor %}{% if add_generation_prompt %}{{ '<|start_header_id|>assistant<|end_header_id|>\n\n' }}{% endif %}", + "clean_up_tokenization_spaces": true, + "eos_token": "<|eot_id|>", + "extra_special_tokens": {}, + "model_input_names": [ + "input_ids", + "attention_mask" + ], + "model_max_length": 131072, + "pad_token": "<|end_of_text|>", + "tokenizer_class": "PreTrainedTokenizer" +} diff --git a/checkpoint-2445/trainer_state.json b/checkpoint-2445/trainer_state.json new file mode 100644 index 0000000..7ce0cab --- /dev/null +++ b/checkpoint-2445/trainer_state.json @@ -0,0 +1,36709 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.0, + "eval_steps": 500, + "global_step": 2445, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.001226993865030675, + "grad_norm": 151.44113305401245, + "learning_rate": 2e-08, + "logits/chosen": -0.32421875, + "logits/rejected": -0.515625, + "logps/chosen": -474.0, + "logps/rejected": -316.0, + "loss": 0.6914, + "rewards/accuracies": 0.0, + "rewards/chosen": 0.0, + "rewards/margins": 0.0, + "rewards/rejected": 0.0, + "step": 1 + }, + { + "epoch": 0.00245398773006135, + "grad_norm": 162.5072043033413, + "learning_rate": 4e-08, + "logits/chosen": -0.22265625, + "logits/rejected": -0.439453125, + "logps/chosen": -436.0, + "logps/rejected": -292.0, + "loss": 0.6914, + "rewards/accuracies": 0.0, + "rewards/chosen": 0.0, + "rewards/margins": 0.0, + "rewards/rejected": 0.0, + "step": 2 + }, + { + "epoch": 0.0036809815950920245, + "grad_norm": 108.37171307643952, + "learning_rate": 6e-08, + "logits/chosen": -0.12890625, + "logits/rejected": -0.255859375, + "logps/chosen": -368.0, + "logps/rejected": -272.0, + "loss": 0.6896, + "rewards/accuracies": 0.328125, + "rewards/chosen": 0.005706787109375, + "rewards/margins": 0.01055908203125, + "rewards/rejected": -0.004852294921875, + "step": 3 + }, + { + "epoch": 0.0049079754601227, + "grad_norm": 152.5657567319493, + "learning_rate": 8e-08, + "logits/chosen": -0.166015625, + "logits/rejected": -0.326171875, + "logps/chosen": -422.0, + "logps/rejected": -242.0, + "loss": 0.7141, + "rewards/accuracies": 0.3359375, + "rewards/chosen": -0.009765625, + "rewards/margins": -0.025634765625, + "rewards/rejected": 0.0159912109375, + "step": 4 + }, + { + "epoch": 0.006134969325153374, + "grad_norm": 288.1306811063231, + "learning_rate": 1e-07, + "logits/chosen": -0.1845703125, + "logits/rejected": -0.326171875, + "logps/chosen": -380.0, + "logps/rejected": -270.0, + "loss": 0.6984, + "rewards/accuracies": 0.421875, + "rewards/chosen": 0.0216064453125, + "rewards/margins": -0.0030670166015625, + "rewards/rejected": 0.0247802734375, + "step": 5 + }, + { + "epoch": 0.007361963190184049, + "grad_norm": 331.41871326801424, + "learning_rate": 1.2e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.345703125, + "logps/chosen": -412.0, + "logps/rejected": -306.0, + "loss": 0.7177, + "rewards/accuracies": 0.2578125, + "rewards/chosen": -0.01434326171875, + "rewards/margins": -0.03466796875, + "rewards/rejected": 0.0203857421875, + "step": 6 + }, + { + "epoch": 0.008588957055214725, + "grad_norm": 249.74586517146642, + "learning_rate": 1.4e-07, + "logits/chosen": -0.2060546875, + "logits/rejected": -0.38671875, + "logps/chosen": -378.0, + "logps/rejected": -266.0, + "loss": 0.7072, + "rewards/accuracies": 0.3359375, + "rewards/chosen": -0.000904083251953125, + "rewards/margins": -0.0172119140625, + "rewards/rejected": 0.016357421875, + "step": 7 + }, + { + "epoch": 0.0098159509202454, + "grad_norm": 128.1050509063449, + "learning_rate": 1.6e-07, + "logits/chosen": -0.115234375, + "logits/rejected": -0.32421875, + "logps/chosen": -432.0, + "logps/rejected": -292.0, + "loss": 0.7045, + "rewards/accuracies": 0.2421875, + "rewards/chosen": 0.01513671875, + "rewards/margins": -0.01055908203125, + "rewards/rejected": 0.0257568359375, + "step": 8 + }, + { + "epoch": 0.011042944785276074, + "grad_norm": 128.31082936106668, + "learning_rate": 1.8e-07, + "logits/chosen": -0.1357421875, + "logits/rejected": -0.361328125, + "logps/chosen": -402.0, + "logps/rejected": -294.0, + "loss": 0.7057, + "rewards/accuracies": 0.2890625, + "rewards/chosen": 0.0185546875, + "rewards/margins": -0.0194091796875, + "rewards/rejected": 0.0380859375, + "step": 9 + }, + { + "epoch": 0.012269938650306749, + "grad_norm": 148.13248133021244, + "learning_rate": 2e-07, + "logits/chosen": -0.201171875, + "logits/rejected": -0.35546875, + "logps/chosen": -402.0, + "logps/rejected": -278.0, + "loss": 0.6879, + "rewards/accuracies": 0.359375, + "rewards/chosen": 0.03466796875, + "rewards/margins": 0.011962890625, + "rewards/rejected": 0.022705078125, + "step": 10 + }, + { + "epoch": 0.013496932515337423, + "grad_norm": 188.4465050278061, + "learning_rate": 2.1999999999999998e-07, + "logits/chosen": -0.38671875, + "logits/rejected": -0.52734375, + "logps/chosen": -422.0, + "logps/rejected": -296.0, + "loss": 0.6847, + "rewards/accuracies": 0.421875, + "rewards/chosen": 0.04296875, + "rewards/margins": 0.025634765625, + "rewards/rejected": 0.017333984375, + "step": 11 + }, + { + "epoch": 0.014723926380368098, + "grad_norm": 283.48200245967496, + "learning_rate": 2.4e-07, + "logits/chosen": -0.1455078125, + "logits/rejected": -0.251953125, + "logps/chosen": -374.0, + "logps/rejected": -262.0, + "loss": 0.6763, + "rewards/accuracies": 0.4140625, + "rewards/chosen": 0.036376953125, + "rewards/margins": 0.042724609375, + "rewards/rejected": -0.00634765625, + "step": 12 + }, + { + "epoch": 0.015950920245398775, + "grad_norm": 157.86633246900865, + "learning_rate": 2.6e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.423828125, + "logps/chosen": -392.0, + "logps/rejected": -249.0, + "loss": 0.6399, + "rewards/accuracies": 0.59375, + "rewards/chosen": 0.068359375, + "rewards/margins": 0.1240234375, + "rewards/rejected": -0.055419921875, + "step": 13 + }, + { + "epoch": 0.01717791411042945, + "grad_norm": 170.28826054471034, + "learning_rate": 2.8e-07, + "logits/chosen": -0.2412109375, + "logits/rejected": -0.419921875, + "logps/chosen": -472.0, + "logps/rejected": -310.0, + "loss": 0.645, + "rewards/accuracies": 0.5390625, + "rewards/chosen": 0.1201171875, + "rewards/margins": 0.12109375, + "rewards/rejected": -0.000881195068359375, + "step": 14 + }, + { + "epoch": 0.018404907975460124, + "grad_norm": 196.84243180155542, + "learning_rate": 3e-07, + "logits/chosen": -0.12451171875, + "logits/rejected": -0.1923828125, + "logps/chosen": -420.0, + "logps/rejected": -288.0, + "loss": 0.6433, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.0849609375, + "rewards/margins": 0.1298828125, + "rewards/rejected": -0.044677734375, + "step": 15 + }, + { + "epoch": 0.0196319018404908, + "grad_norm": 150.44401802967914, + "learning_rate": 3.2e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.439453125, + "logps/chosen": -408.0, + "logps/rejected": -304.0, + "loss": 0.6163, + "rewards/accuracies": 0.609375, + "rewards/chosen": 0.1513671875, + "rewards/margins": 0.189453125, + "rewards/rejected": -0.03759765625, + "step": 16 + }, + { + "epoch": 0.020858895705521473, + "grad_norm": 158.3424645259106, + "learning_rate": 3.4000000000000003e-07, + "logits/chosen": -0.181640625, + "logits/rejected": -0.330078125, + "logps/chosen": -434.0, + "logps/rejected": -254.0, + "loss": 0.5994, + "rewards/accuracies": 0.6171875, + "rewards/chosen": 0.173828125, + "rewards/margins": 0.25390625, + "rewards/rejected": -0.08056640625, + "step": 17 + }, + { + "epoch": 0.022085889570552148, + "grad_norm": 127.76158860883122, + "learning_rate": 3.6e-07, + "logits/chosen": -0.16015625, + "logits/rejected": -0.337890625, + "logps/chosen": -404.0, + "logps/rejected": -276.0, + "loss": 0.5706, + "rewards/accuracies": 0.6953125, + "rewards/chosen": 0.2294921875, + "rewards/margins": 0.3359375, + "rewards/rejected": -0.10595703125, + "step": 18 + }, + { + "epoch": 0.023312883435582823, + "grad_norm": 69.38468528362102, + "learning_rate": 3.7999999999999996e-07, + "logits/chosen": -0.20703125, + "logits/rejected": -0.37890625, + "logps/chosen": -388.0, + "logps/rejected": -288.0, + "loss": 0.567, + "rewards/accuracies": 0.6484375, + "rewards/chosen": 0.2197265625, + "rewards/margins": 0.37890625, + "rewards/rejected": -0.158203125, + "step": 19 + }, + { + "epoch": 0.024539877300613498, + "grad_norm": 82.21345162463909, + "learning_rate": 4e-07, + "logits/chosen": -0.291015625, + "logits/rejected": -0.455078125, + "logps/chosen": -466.0, + "logps/rejected": -310.0, + "loss": 0.5153, + "rewards/accuracies": 0.7421875, + "rewards/chosen": 0.37890625, + "rewards/margins": 0.58984375, + "rewards/rejected": -0.2109375, + "step": 20 + }, + { + "epoch": 0.025766871165644172, + "grad_norm": 105.40201871897163, + "learning_rate": 4.1999999999999995e-07, + "logits/chosen": -0.166015625, + "logits/rejected": -0.337890625, + "logps/chosen": -412.0, + "logps/rejected": -260.0, + "loss": 0.5326, + "rewards/accuracies": 0.703125, + "rewards/chosen": 0.296875, + "rewards/margins": 0.490234375, + "rewards/rejected": -0.1923828125, + "step": 21 + }, + { + "epoch": 0.026993865030674847, + "grad_norm": 70.78030423389544, + "learning_rate": 4.3999999999999997e-07, + "logits/chosen": -0.162109375, + "logits/rejected": -0.29296875, + "logps/chosen": -382.0, + "logps/rejected": -292.0, + "loss": 0.5334, + "rewards/accuracies": 0.75, + "rewards/chosen": 0.291015625, + "rewards/margins": 0.5390625, + "rewards/rejected": -0.2470703125, + "step": 22 + }, + { + "epoch": 0.02822085889570552, + "grad_norm": 60.46408711421665, + "learning_rate": 4.6e-07, + "logits/chosen": -0.283203125, + "logits/rejected": -0.333984375, + "logps/chosen": -380.0, + "logps/rejected": -302.0, + "loss": 0.513, + "rewards/accuracies": 0.6953125, + "rewards/chosen": 0.498046875, + "rewards/margins": 0.75390625, + "rewards/rejected": -0.2578125, + "step": 23 + }, + { + "epoch": 0.029447852760736196, + "grad_norm": 54.54733596050591, + "learning_rate": 4.8e-07, + "logits/chosen": -0.21484375, + "logits/rejected": -0.396484375, + "logps/chosen": -378.0, + "logps/rejected": -274.0, + "loss": 0.5458, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.36328125, + "rewards/margins": 0.6015625, + "rewards/rejected": -0.2392578125, + "step": 24 + }, + { + "epoch": 0.03067484662576687, + "grad_norm": 46.35027564725166, + "learning_rate": 5e-07, + "logits/chosen": -0.29296875, + "logits/rejected": -0.478515625, + "logps/chosen": -436.0, + "logps/rejected": -296.0, + "loss": 0.468, + "rewards/accuracies": 0.75, + "rewards/chosen": 0.65234375, + "rewards/margins": 1.0859375, + "rewards/rejected": -0.43359375, + "step": 25 + }, + { + "epoch": 0.03190184049079755, + "grad_norm": 49.250838916767385, + "learning_rate": 4.99793388429752e-07, + "logits/chosen": -0.193359375, + "logits/rejected": -0.349609375, + "logps/chosen": -390.0, + "logps/rejected": -272.0, + "loss": 0.4753, + "rewards/accuracies": 0.7265625, + "rewards/chosen": 0.75, + "rewards/margins": 1.15625, + "rewards/rejected": -0.404296875, + "step": 26 + }, + { + "epoch": 0.033128834355828224, + "grad_norm": 49.243509562031704, + "learning_rate": 4.995867768595041e-07, + "logits/chosen": -0.142578125, + "logits/rejected": -0.314453125, + "logps/chosen": -362.0, + "logps/rejected": -274.0, + "loss": 0.4481, + "rewards/accuracies": 0.734375, + "rewards/chosen": 0.84765625, + "rewards/margins": 1.3125, + "rewards/rejected": -0.46484375, + "step": 27 + }, + { + "epoch": 0.0343558282208589, + "grad_norm": 43.853948458317184, + "learning_rate": 4.993801652892562e-07, + "logits/chosen": -0.08203125, + "logits/rejected": -0.1884765625, + "logps/chosen": -382.0, + "logps/rejected": -258.0, + "loss": 0.4667, + "rewards/accuracies": 0.78125, + "rewards/chosen": 0.79296875, + "rewards/margins": 1.125, + "rewards/rejected": -0.33203125, + "step": 28 + }, + { + "epoch": 0.03558282208588957, + "grad_norm": 46.27857873377814, + "learning_rate": 4.991735537190083e-07, + "logits/chosen": -0.318359375, + "logits/rejected": -0.46484375, + "logps/chosen": -422.0, + "logps/rejected": -316.0, + "loss": 0.442, + "rewards/accuracies": 0.7578125, + "rewards/chosen": 0.94921875, + "rewards/margins": 1.46875, + "rewards/rejected": -0.5234375, + "step": 29 + }, + { + "epoch": 0.03680981595092025, + "grad_norm": 54.43172367072751, + "learning_rate": 4.989669421487603e-07, + "logits/chosen": -0.18359375, + "logits/rejected": -0.302734375, + "logps/chosen": -338.0, + "logps/rejected": -260.0, + "loss": 0.4973, + "rewards/accuracies": 0.7578125, + "rewards/chosen": 0.671875, + "rewards/margins": 1.1015625, + "rewards/rejected": -0.4296875, + "step": 30 + }, + { + "epoch": 0.03803680981595092, + "grad_norm": 49.563120237934434, + "learning_rate": 4.987603305785124e-07, + "logits/chosen": -0.171875, + "logits/rejected": -0.294921875, + "logps/chosen": -388.0, + "logps/rejected": -270.0, + "loss": 0.4585, + "rewards/accuracies": 0.75, + "rewards/chosen": 0.97265625, + "rewards/margins": 1.5390625, + "rewards/rejected": -0.5703125, + "step": 31 + }, + { + "epoch": 0.0392638036809816, + "grad_norm": 47.082618739282914, + "learning_rate": 4.985537190082644e-07, + "logits/chosen": -0.220703125, + "logits/rejected": -0.41015625, + "logps/chosen": -394.0, + "logps/rejected": -282.0, + "loss": 0.4295, + "rewards/accuracies": 0.7734375, + "rewards/chosen": 0.9609375, + "rewards/margins": 1.578125, + "rewards/rejected": -0.61328125, + "step": 32 + }, + { + "epoch": 0.04049079754601227, + "grad_norm": 43.28996668354881, + "learning_rate": 4.983471074380165e-07, + "logits/chosen": -0.10595703125, + "logits/rejected": -0.244140625, + "logps/chosen": -332.0, + "logps/rejected": -229.0, + "loss": 0.4502, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.73828125, + "rewards/margins": 1.3203125, + "rewards/rejected": -0.58203125, + "step": 33 + }, + { + "epoch": 0.04171779141104295, + "grad_norm": 53.08103037992315, + "learning_rate": 4.981404958677686e-07, + "logits/chosen": -0.26171875, + "logits/rejected": -0.396484375, + "logps/chosen": -390.0, + "logps/rejected": -296.0, + "loss": 0.4275, + "rewards/accuracies": 0.7578125, + "rewards/chosen": 0.9296875, + "rewards/margins": 1.78125, + "rewards/rejected": -0.84765625, + "step": 34 + }, + { + "epoch": 0.04294478527607362, + "grad_norm": 51.02011562118897, + "learning_rate": 4.979338842975207e-07, + "logits/chosen": -0.169921875, + "logits/rejected": -0.3203125, + "logps/chosen": -360.0, + "logps/rejected": -258.0, + "loss": 0.4005, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.75, + "rewards/margins": 1.78125, + "rewards/rejected": -1.0234375, + "step": 35 + }, + { + "epoch": 0.044171779141104296, + "grad_norm": 39.1724548423627, + "learning_rate": 4.977272727272727e-07, + "logits/chosen": -0.224609375, + "logits/rejected": -0.314453125, + "logps/chosen": -404.0, + "logps/rejected": -288.0, + "loss": 0.3849, + "rewards/accuracies": 0.78125, + "rewards/chosen": 1.125, + "rewards/margins": 2.1875, + "rewards/rejected": -1.0546875, + "step": 36 + }, + { + "epoch": 0.04539877300613497, + "grad_norm": 41.851898602487374, + "learning_rate": 4.975206611570248e-07, + "logits/chosen": -0.19140625, + "logits/rejected": -0.30859375, + "logps/chosen": -394.0, + "logps/rejected": -308.0, + "loss": 0.4066, + "rewards/accuracies": 0.7421875, + "rewards/chosen": 1.3203125, + "rewards/margins": 2.296875, + "rewards/rejected": -0.9765625, + "step": 37 + }, + { + "epoch": 0.046625766871165646, + "grad_norm": 38.15131350129523, + "learning_rate": 4.973140495867769e-07, + "logits/chosen": -0.134765625, + "logits/rejected": -0.27734375, + "logps/chosen": -402.0, + "logps/rejected": -298.0, + "loss": 0.3886, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.53125, + "rewards/margins": 2.578125, + "rewards/rejected": -1.046875, + "step": 38 + }, + { + "epoch": 0.04785276073619632, + "grad_norm": 41.71923927967426, + "learning_rate": 4.971074380165288e-07, + "logits/chosen": -0.25390625, + "logits/rejected": -0.4375, + "logps/chosen": -428.0, + "logps/rejected": -302.0, + "loss": 0.3805, + "rewards/accuracies": 0.796875, + "rewards/chosen": 1.328125, + "rewards/margins": 2.640625, + "rewards/rejected": -1.3125, + "step": 39 + }, + { + "epoch": 0.049079754601226995, + "grad_norm": 38.402003702110484, + "learning_rate": 4.96900826446281e-07, + "logits/chosen": -0.1865234375, + "logits/rejected": -0.328125, + "logps/chosen": -376.0, + "logps/rejected": -282.0, + "loss": 0.3421, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.3125, + "rewards/margins": 2.734375, + "rewards/rejected": -1.421875, + "step": 40 + }, + { + "epoch": 0.05030674846625767, + "grad_norm": 34.67962672406851, + "learning_rate": 4.96694214876033e-07, + "logits/chosen": -0.185546875, + "logits/rejected": -0.390625, + "logps/chosen": -380.0, + "logps/rejected": -272.0, + "loss": 0.3787, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.3125, + "rewards/margins": 2.65625, + "rewards/rejected": -1.3515625, + "step": 41 + }, + { + "epoch": 0.051533742331288344, + "grad_norm": 46.35208610876743, + "learning_rate": 4.964876033057851e-07, + "logits/chosen": -0.1455078125, + "logits/rejected": -0.328125, + "logps/chosen": -366.0, + "logps/rejected": -284.0, + "loss": 0.3611, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.2109375, + "rewards/margins": 2.71875, + "rewards/rejected": -1.515625, + "step": 42 + }, + { + "epoch": 0.05276073619631902, + "grad_norm": 48.36417348819516, + "learning_rate": 4.962809917355371e-07, + "logits/chosen": -0.2080078125, + "logits/rejected": -0.404296875, + "logps/chosen": -420.0, + "logps/rejected": -322.0, + "loss": 0.3483, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.3828125, + "rewards/margins": 3.109375, + "rewards/rejected": -1.7265625, + "step": 43 + }, + { + "epoch": 0.053987730061349694, + "grad_norm": 58.150094006043, + "learning_rate": 4.960743801652892e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.4140625, + "logps/chosen": -390.0, + "logps/rejected": -294.0, + "loss": 0.4261, + "rewards/accuracies": 0.78125, + "rewards/chosen": 0.94140625, + "rewards/margins": 2.75, + "rewards/rejected": -1.8046875, + "step": 44 + }, + { + "epoch": 0.05521472392638037, + "grad_norm": 41.77249990347939, + "learning_rate": 4.958677685950413e-07, + "logits/chosen": -0.34765625, + "logits/rejected": -0.455078125, + "logps/chosen": -358.0, + "logps/rejected": -286.0, + "loss": 0.3831, + "rewards/accuracies": 0.78125, + "rewards/chosen": 1.015625, + "rewards/margins": 2.890625, + "rewards/rejected": -1.8671875, + "step": 45 + }, + { + "epoch": 0.05644171779141104, + "grad_norm": 42.522353640053986, + "learning_rate": 4.956611570247934e-07, + "logits/chosen": -0.21875, + "logits/rejected": -0.412109375, + "logps/chosen": -426.0, + "logps/rejected": -292.0, + "loss": 0.3376, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.5546875, + "rewards/margins": 3.5, + "rewards/rejected": -1.953125, + "step": 46 + }, + { + "epoch": 0.05766871165644172, + "grad_norm": 59.82362665796057, + "learning_rate": 4.954545454545454e-07, + "logits/chosen": -0.26953125, + "logits/rejected": -0.373046875, + "logps/chosen": -394.0, + "logps/rejected": -362.0, + "loss": 0.4408, + "rewards/accuracies": 0.734375, + "rewards/chosen": 1.0390625, + "rewards/margins": 2.6875, + "rewards/rejected": -1.6484375, + "step": 47 + }, + { + "epoch": 0.05889570552147239, + "grad_norm": 36.37462895121556, + "learning_rate": 4.952479338842975e-07, + "logits/chosen": -0.25, + "logits/rejected": -0.40234375, + "logps/chosen": -352.0, + "logps/rejected": -276.0, + "loss": 0.3918, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.0, + "rewards/margins": 2.4375, + "rewards/rejected": -1.4296875, + "step": 48 + }, + { + "epoch": 0.06012269938650307, + "grad_norm": 33.380998200862365, + "learning_rate": 4.950413223140495e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.515625, + "logps/chosen": -406.0, + "logps/rejected": -288.0, + "loss": 0.2888, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.5703125, + "rewards/margins": 3.65625, + "rewards/rejected": -2.078125, + "step": 49 + }, + { + "epoch": 0.06134969325153374, + "grad_norm": 49.61344030643431, + "learning_rate": 4.948347107438016e-07, + "logits/chosen": -0.25390625, + "logits/rejected": -0.447265625, + "logps/chosen": -406.0, + "logps/rejected": -310.0, + "loss": 0.4032, + "rewards/accuracies": 0.7734375, + "rewards/chosen": 1.28125, + "rewards/margins": 2.890625, + "rewards/rejected": -1.609375, + "step": 50 + }, + { + "epoch": 0.06257668711656442, + "grad_norm": 44.94363880784817, + "learning_rate": 4.946280991735537e-07, + "logits/chosen": -0.201171875, + "logits/rejected": -0.373046875, + "logps/chosen": -444.0, + "logps/rejected": -352.0, + "loss": 0.3064, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.640625, + "rewards/margins": 3.578125, + "rewards/rejected": -1.9375, + "step": 51 + }, + { + "epoch": 0.0638036809815951, + "grad_norm": 41.35776161230766, + "learning_rate": 4.944214876033058e-07, + "logits/chosen": -0.2333984375, + "logits/rejected": -0.435546875, + "logps/chosen": -402.0, + "logps/rejected": -328.0, + "loss": 0.369, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.1953125, + "rewards/margins": 3.34375, + "rewards/rejected": -2.15625, + "step": 52 + }, + { + "epoch": 0.06503067484662577, + "grad_norm": 44.728082439821826, + "learning_rate": 4.942148760330578e-07, + "logits/chosen": -0.173828125, + "logits/rejected": -0.34375, + "logps/chosen": -404.0, + "logps/rejected": -316.0, + "loss": 0.3683, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.3515625, + "rewards/margins": 3.109375, + "rewards/rejected": -1.7578125, + "step": 53 + }, + { + "epoch": 0.06625766871165645, + "grad_norm": 39.009654963149515, + "learning_rate": 4.940082644628099e-07, + "logits/chosen": -0.072265625, + "logits/rejected": -0.255859375, + "logps/chosen": -338.0, + "logps/rejected": -251.0, + "loss": 0.3097, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.9765625, + "rewards/margins": 2.796875, + "rewards/rejected": -1.8203125, + "step": 54 + }, + { + "epoch": 0.06748466257668712, + "grad_norm": 40.85012819896818, + "learning_rate": 4.93801652892562e-07, + "logits/chosen": -0.2021484375, + "logits/rejected": -0.376953125, + "logps/chosen": -382.0, + "logps/rejected": -288.0, + "loss": 0.3452, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.1875, + "rewards/margins": 3.140625, + "rewards/rejected": -1.9609375, + "step": 55 + }, + { + "epoch": 0.0687116564417178, + "grad_norm": 46.70951578377314, + "learning_rate": 4.935950413223141e-07, + "logits/chosen": -0.169921875, + "logits/rejected": -0.361328125, + "logps/chosen": -392.0, + "logps/rejected": -324.0, + "loss": 0.3916, + "rewards/accuracies": 0.7578125, + "rewards/chosen": 1.3671875, + "rewards/margins": 3.234375, + "rewards/rejected": -1.875, + "step": 56 + }, + { + "epoch": 0.06993865030674846, + "grad_norm": 51.30803055192484, + "learning_rate": 4.933884297520661e-07, + "logits/chosen": -0.1650390625, + "logits/rejected": -0.255859375, + "logps/chosen": -356.0, + "logps/rejected": -316.0, + "loss": 0.3947, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.1875, + "rewards/margins": 3.203125, + "rewards/rejected": -2.015625, + "step": 57 + }, + { + "epoch": 0.07116564417177915, + "grad_norm": 47.592024830773475, + "learning_rate": 4.931818181818182e-07, + "logits/chosen": -0.177734375, + "logits/rejected": -0.2734375, + "logps/chosen": -378.0, + "logps/rejected": -320.0, + "loss": 0.3758, + "rewards/accuracies": 0.78125, + "rewards/chosen": 1.4140625, + "rewards/margins": 3.328125, + "rewards/rejected": -1.9140625, + "step": 58 + }, + { + "epoch": 0.07239263803680981, + "grad_norm": 48.17219624892423, + "learning_rate": 4.929752066115702e-07, + "logits/chosen": -0.0947265625, + "logits/rejected": -0.1923828125, + "logps/chosen": -380.0, + "logps/rejected": -288.0, + "loss": 0.4219, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.0546875, + "rewards/margins": 2.59375, + "rewards/rejected": -1.5390625, + "step": 59 + }, + { + "epoch": 0.0736196319018405, + "grad_norm": 39.36985463274499, + "learning_rate": 4.927685950413223e-07, + "logits/chosen": -0.171875, + "logits/rejected": -0.314453125, + "logps/chosen": -386.0, + "logps/rejected": -280.0, + "loss": 0.3667, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.9765625, + "rewards/margins": 2.796875, + "rewards/rejected": -1.8125, + "step": 60 + }, + { + "epoch": 0.07484662576687116, + "grad_norm": 38.11628572877564, + "learning_rate": 4.925619834710743e-07, + "logits/chosen": -0.169921875, + "logits/rejected": -0.318359375, + "logps/chosen": -420.0, + "logps/rejected": -310.0, + "loss": 0.3265, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.59375, + "rewards/margins": 3.65625, + "rewards/rejected": -2.0625, + "step": 61 + }, + { + "epoch": 0.07607361963190185, + "grad_norm": 40.58395817948392, + "learning_rate": 4.923553719008265e-07, + "logits/chosen": -0.15234375, + "logits/rejected": -0.373046875, + "logps/chosen": -432.0, + "logps/rejected": -302.0, + "loss": 0.3375, + "rewards/accuracies": 0.78125, + "rewards/chosen": 1.8203125, + "rewards/margins": 4.09375, + "rewards/rejected": -2.265625, + "step": 62 + }, + { + "epoch": 0.07730061349693251, + "grad_norm": 43.13092829482704, + "learning_rate": 4.921487603305785e-07, + "logits/chosen": -0.06787109375, + "logits/rejected": -0.244140625, + "logps/chosen": -422.0, + "logps/rejected": -300.0, + "loss": 0.3277, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.2265625, + "rewards/margins": 3.203125, + "rewards/rejected": -1.96875, + "step": 63 + }, + { + "epoch": 0.0785276073619632, + "grad_norm": 57.40916665463975, + "learning_rate": 4.919421487603306e-07, + "logits/chosen": -0.21484375, + "logits/rejected": -0.404296875, + "logps/chosen": -406.0, + "logps/rejected": -324.0, + "loss": 0.3991, + "rewards/accuracies": 0.7734375, + "rewards/chosen": 1.5078125, + "rewards/margins": 3.609375, + "rewards/rejected": -2.09375, + "step": 64 + }, + { + "epoch": 0.07975460122699386, + "grad_norm": 39.641816149243105, + "learning_rate": 4.917355371900826e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.37109375, + "logps/chosen": -396.0, + "logps/rejected": -296.0, + "loss": 0.3463, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.4375, + "rewards/margins": 3.4375, + "rewards/rejected": -2.0, + "step": 65 + }, + { + "epoch": 0.08098159509202454, + "grad_norm": 49.84344547746062, + "learning_rate": 4.915289256198346e-07, + "logits/chosen": -0.2421875, + "logits/rejected": -0.392578125, + "logps/chosen": -322.0, + "logps/rejected": -254.0, + "loss": 0.3217, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.4921875, + "rewards/margins": 3.796875, + "rewards/rejected": -2.3125, + "step": 66 + }, + { + "epoch": 0.08220858895705521, + "grad_norm": 37.32761829857322, + "learning_rate": 4.913223140495867e-07, + "logits/chosen": -0.1337890625, + "logits/rejected": -0.263671875, + "logps/chosen": -334.0, + "logps/rejected": -288.0, + "loss": 0.3388, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.9375, + "rewards/margins": 3.125, + "rewards/rejected": -2.1875, + "step": 67 + }, + { + "epoch": 0.0834355828220859, + "grad_norm": 44.340094240446255, + "learning_rate": 4.911157024793388e-07, + "logits/chosen": -0.2216796875, + "logits/rejected": -0.30078125, + "logps/chosen": -364.0, + "logps/rejected": -326.0, + "loss": 0.3709, + "rewards/accuracies": 0.78125, + "rewards/chosen": 1.15625, + "rewards/margins": 3.234375, + "rewards/rejected": -2.078125, + "step": 68 + }, + { + "epoch": 0.08466257668711656, + "grad_norm": 36.72487633784899, + "learning_rate": 4.909090909090909e-07, + "logits/chosen": -0.279296875, + "logits/rejected": -0.46875, + "logps/chosen": -414.0, + "logps/rejected": -278.0, + "loss": 0.3115, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.8203125, + "rewards/margins": 4.0625, + "rewards/rejected": -2.25, + "step": 69 + }, + { + "epoch": 0.08588957055214724, + "grad_norm": 38.53295537225695, + "learning_rate": 4.907024793388429e-07, + "logits/chosen": -0.1572265625, + "logits/rejected": -0.35546875, + "logps/chosen": -414.0, + "logps/rejected": -336.0, + "loss": 0.2897, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.7578125, + "rewards/margins": 3.875, + "rewards/rejected": -2.109375, + "step": 70 + }, + { + "epoch": 0.08711656441717791, + "grad_norm": 41.12312548370276, + "learning_rate": 4.90495867768595e-07, + "logits/chosen": -0.095703125, + "logits/rejected": -0.1796875, + "logps/chosen": -348.0, + "logps/rejected": -274.0, + "loss": 0.4118, + "rewards/accuracies": 0.75, + "rewards/chosen": 0.9765625, + "rewards/margins": 2.921875, + "rewards/rejected": -1.9453125, + "step": 71 + }, + { + "epoch": 0.08834355828220859, + "grad_norm": 39.321341602611746, + "learning_rate": 4.902892561983471e-07, + "logits/chosen": -0.251953125, + "logits/rejected": -0.419921875, + "logps/chosen": -434.0, + "logps/rejected": -344.0, + "loss": 0.3197, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.5078125, + "rewards/margins": 3.53125, + "rewards/rejected": -2.03125, + "step": 72 + }, + { + "epoch": 0.08957055214723926, + "grad_norm": 44.53160035761988, + "learning_rate": 4.900826446280992e-07, + "logits/chosen": -0.1943359375, + "logits/rejected": -0.29296875, + "logps/chosen": -352.0, + "logps/rejected": -294.0, + "loss": 0.3927, + "rewards/accuracies": 0.765625, + "rewards/chosen": 1.1328125, + "rewards/margins": 3.34375, + "rewards/rejected": -2.21875, + "step": 73 + }, + { + "epoch": 0.09079754601226994, + "grad_norm": 40.466626208621626, + "learning_rate": 4.898760330578512e-07, + "logits/chosen": -0.1953125, + "logits/rejected": -0.29296875, + "logps/chosen": -356.0, + "logps/rejected": -324.0, + "loss": 0.303, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.97265625, + "rewards/margins": 3.25, + "rewards/rejected": -2.28125, + "step": 74 + }, + { + "epoch": 0.09202453987730061, + "grad_norm": 35.5267105162623, + "learning_rate": 4.896694214876033e-07, + "logits/chosen": -0.1669921875, + "logits/rejected": -0.33203125, + "logps/chosen": -384.0, + "logps/rejected": -314.0, + "loss": 0.2978, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.453125, + "rewards/margins": 3.8125, + "rewards/rejected": -2.359375, + "step": 75 + }, + { + "epoch": 0.09325153374233129, + "grad_norm": 47.01910580765987, + "learning_rate": 4.894628099173553e-07, + "logits/chosen": -0.169921875, + "logits/rejected": -0.359375, + "logps/chosen": -402.0, + "logps/rejected": -284.0, + "loss": 0.3205, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.4765625, + "rewards/margins": 3.671875, + "rewards/rejected": -2.203125, + "step": 76 + }, + { + "epoch": 0.09447852760736196, + "grad_norm": 37.028647946403694, + "learning_rate": 4.892561983471074e-07, + "logits/chosen": -0.189453125, + "logits/rejected": -0.34765625, + "logps/chosen": -352.0, + "logps/rejected": -292.0, + "loss": 0.3058, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.1328125, + "rewards/margins": 3.59375, + "rewards/rejected": -2.46875, + "step": 77 + }, + { + "epoch": 0.09570552147239264, + "grad_norm": 41.57134852043157, + "learning_rate": 4.890495867768595e-07, + "logits/chosen": -0.1474609375, + "logits/rejected": -0.330078125, + "logps/chosen": -420.0, + "logps/rejected": -310.0, + "loss": 0.3141, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.3671875, + "rewards/margins": 3.75, + "rewards/rejected": -2.390625, + "step": 78 + }, + { + "epoch": 0.09693251533742331, + "grad_norm": 34.691948521740784, + "learning_rate": 4.888429752066116e-07, + "logits/chosen": -0.12890625, + "logits/rejected": -0.2734375, + "logps/chosen": -356.0, + "logps/rejected": -282.0, + "loss": 0.3063, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.09375, + "rewards/margins": 3.40625, + "rewards/rejected": -2.3125, + "step": 79 + }, + { + "epoch": 0.09815950920245399, + "grad_norm": 49.17092037552417, + "learning_rate": 4.886363636363636e-07, + "logits/chosen": -0.19140625, + "logits/rejected": -0.42578125, + "logps/chosen": -410.0, + "logps/rejected": -318.0, + "loss": 0.2984, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.7890625, + "rewards/margins": 4.34375, + "rewards/rejected": -2.5625, + "step": 80 + }, + { + "epoch": 0.09938650306748466, + "grad_norm": 39.19664643244926, + "learning_rate": 4.884297520661157e-07, + "logits/chosen": -0.255859375, + "logits/rejected": -0.435546875, + "logps/chosen": -440.0, + "logps/rejected": -334.0, + "loss": 0.3241, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.5546875, + "rewards/margins": 4.15625, + "rewards/rejected": -2.578125, + "step": 81 + }, + { + "epoch": 0.10061349693251534, + "grad_norm": 49.311491941358796, + "learning_rate": 4.882231404958677e-07, + "logits/chosen": -0.1650390625, + "logits/rejected": -0.29296875, + "logps/chosen": -430.0, + "logps/rejected": -326.0, + "loss": 0.3395, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.0234375, + "rewards/margins": 3.65625, + "rewards/rejected": -2.640625, + "step": 82 + }, + { + "epoch": 0.10184049079754601, + "grad_norm": 49.376121428612976, + "learning_rate": 4.880165289256198e-07, + "logits/chosen": -0.1513671875, + "logits/rejected": -0.32421875, + "logps/chosen": -352.0, + "logps/rejected": -298.0, + "loss": 0.32, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.140625, + "rewards/margins": 3.734375, + "rewards/rejected": -2.59375, + "step": 83 + }, + { + "epoch": 0.10306748466257669, + "grad_norm": 64.06732250692619, + "learning_rate": 4.878099173553718e-07, + "logits/chosen": -0.1259765625, + "logits/rejected": -0.365234375, + "logps/chosen": -450.0, + "logps/rejected": -338.0, + "loss": 0.3022, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.4609375, + "rewards/margins": 4.3125, + "rewards/rejected": -2.875, + "step": 84 + }, + { + "epoch": 0.10429447852760736, + "grad_norm": 44.025841834176795, + "learning_rate": 4.87603305785124e-07, + "logits/chosen": -0.2177734375, + "logits/rejected": -0.38671875, + "logps/chosen": -378.0, + "logps/rejected": -314.0, + "loss": 0.3406, + "rewards/accuracies": 0.78125, + "rewards/chosen": 0.97265625, + "rewards/margins": 3.71875, + "rewards/rejected": -2.75, + "step": 85 + }, + { + "epoch": 0.10552147239263804, + "grad_norm": 41.64304248400373, + "learning_rate": 4.87396694214876e-07, + "logits/chosen": -0.1484375, + "logits/rejected": -0.271484375, + "logps/chosen": -426.0, + "logps/rejected": -294.0, + "loss": 0.3372, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.4140625, + "rewards/margins": 3.78125, + "rewards/rejected": -2.359375, + "step": 86 + }, + { + "epoch": 0.1067484662576687, + "grad_norm": 33.11395742992561, + "learning_rate": 4.871900826446281e-07, + "logits/chosen": -0.185546875, + "logits/rejected": -0.32421875, + "logps/chosen": -352.0, + "logps/rejected": -252.0, + "loss": 0.2974, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.7421875, + "rewards/margins": 3.484375, + "rewards/rejected": -2.75, + "step": 87 + }, + { + "epoch": 0.10797546012269939, + "grad_norm": 42.17124755394979, + "learning_rate": 4.869834710743801e-07, + "logits/chosen": -0.166015625, + "logits/rejected": -0.33984375, + "logps/chosen": -364.0, + "logps/rejected": -268.0, + "loss": 0.2793, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.125, + "rewards/margins": 3.6875, + "rewards/rejected": -2.5625, + "step": 88 + }, + { + "epoch": 0.10920245398773006, + "grad_norm": 43.24754945978333, + "learning_rate": 4.867768595041323e-07, + "logits/chosen": -0.1787109375, + "logits/rejected": -0.29296875, + "logps/chosen": -394.0, + "logps/rejected": -322.0, + "loss": 0.3704, + "rewards/accuracies": 0.796875, + "rewards/chosen": 1.328125, + "rewards/margins": 3.65625, + "rewards/rejected": -2.328125, + "step": 89 + }, + { + "epoch": 0.11042944785276074, + "grad_norm": 36.97477331926065, + "learning_rate": 4.865702479338843e-07, + "logits/chosen": -0.212890625, + "logits/rejected": -0.400390625, + "logps/chosen": -380.0, + "logps/rejected": -312.0, + "loss": 0.3415, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.97265625, + "rewards/margins": 3.5, + "rewards/rejected": -2.53125, + "step": 90 + }, + { + "epoch": 0.1116564417177914, + "grad_norm": 43.208078047171966, + "learning_rate": 4.863636363636364e-07, + "logits/chosen": -0.04638671875, + "logits/rejected": -0.30859375, + "logps/chosen": -394.0, + "logps/rejected": -290.0, + "loss": 0.2904, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.25, + "rewards/margins": 3.78125, + "rewards/rejected": -2.53125, + "step": 91 + }, + { + "epoch": 0.11288343558282209, + "grad_norm": 45.84043985703993, + "learning_rate": 4.861570247933884e-07, + "logits/chosen": -0.12890625, + "logits/rejected": -0.2490234375, + "logps/chosen": -394.0, + "logps/rejected": -294.0, + "loss": 0.2811, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.2578125, + "rewards/margins": 3.921875, + "rewards/rejected": -2.65625, + "step": 92 + }, + { + "epoch": 0.11411042944785275, + "grad_norm": 36.66550841517969, + "learning_rate": 4.859504132231405e-07, + "logits/chosen": -0.1484375, + "logits/rejected": -0.37109375, + "logps/chosen": -406.0, + "logps/rejected": -292.0, + "loss": 0.3038, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.8125, + "rewards/margins": 4.3125, + "rewards/rejected": -2.515625, + "step": 93 + }, + { + "epoch": 0.11533742331288344, + "grad_norm": 45.36547804836722, + "learning_rate": 4.857438016528925e-07, + "logits/chosen": -0.181640625, + "logits/rejected": -0.40234375, + "logps/chosen": -434.0, + "logps/rejected": -334.0, + "loss": 0.298, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.9140625, + "rewards/margins": 4.34375, + "rewards/rejected": -2.4375, + "step": 94 + }, + { + "epoch": 0.1165644171779141, + "grad_norm": 36.1886645335595, + "learning_rate": 4.855371900826447e-07, + "logits/chosen": -0.25390625, + "logits/rejected": -0.40625, + "logps/chosen": -382.0, + "logps/rejected": -300.0, + "loss": 0.3254, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.5390625, + "rewards/margins": 4.25, + "rewards/rejected": -2.703125, + "step": 95 + }, + { + "epoch": 0.11779141104294479, + "grad_norm": 47.78990929288722, + "learning_rate": 4.853305785123967e-07, + "logits/chosen": -0.2373046875, + "logits/rejected": -0.40625, + "logps/chosen": -374.0, + "logps/rejected": -302.0, + "loss": 0.2721, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.875, + "rewards/margins": 4.59375, + "rewards/rejected": -2.734375, + "step": 96 + }, + { + "epoch": 0.11901840490797547, + "grad_norm": 46.646580854293525, + "learning_rate": 4.851239669421487e-07, + "logits/chosen": -0.2314453125, + "logits/rejected": -0.37890625, + "logps/chosen": -428.0, + "logps/rejected": -346.0, + "loss": 0.3608, + "rewards/accuracies": 0.796875, + "rewards/chosen": 1.6640625, + "rewards/margins": 4.0, + "rewards/rejected": -2.328125, + "step": 97 + }, + { + "epoch": 0.12024539877300613, + "grad_norm": 38.68608855483517, + "learning_rate": 4.849173553719008e-07, + "logits/chosen": -0.0419921875, + "logits/rejected": -0.2431640625, + "logps/chosen": -360.0, + "logps/rejected": -276.0, + "loss": 0.3119, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.5, + "rewards/margins": 3.71875, + "rewards/rejected": -2.21875, + "step": 98 + }, + { + "epoch": 0.12147239263803682, + "grad_norm": 39.562539416001016, + "learning_rate": 4.847107438016528e-07, + "logits/chosen": -0.1953125, + "logits/rejected": -0.294921875, + "logps/chosen": -340.0, + "logps/rejected": -239.0, + "loss": 0.2701, + "rewards/accuracies": 0.921875, + "rewards/chosen": 1.1171875, + "rewards/margins": 3.46875, + "rewards/rejected": -2.34375, + "step": 99 + }, + { + "epoch": 0.12269938650306748, + "grad_norm": 37.50806782806318, + "learning_rate": 4.84504132231405e-07, + "logits/chosen": -0.2236328125, + "logits/rejected": -0.408203125, + "logps/chosen": -396.0, + "logps/rejected": -312.0, + "loss": 0.3124, + "rewards/accuracies": 0.796875, + "rewards/chosen": 1.5546875, + "rewards/margins": 4.125, + "rewards/rejected": -2.578125, + "step": 100 + }, + { + "epoch": 0.12392638036809817, + "grad_norm": 46.32080898977058, + "learning_rate": 4.842975206611569e-07, + "logits/chosen": -0.220703125, + "logits/rejected": -0.41015625, + "logps/chosen": -414.0, + "logps/rejected": -330.0, + "loss": 0.3659, + "rewards/accuracies": 0.78125, + "rewards/chosen": 1.6875, + "rewards/margins": 4.0625, + "rewards/rejected": -2.375, + "step": 101 + }, + { + "epoch": 0.12515337423312883, + "grad_norm": 38.46942420347679, + "learning_rate": 4.840909090909091e-07, + "logits/chosen": -0.19921875, + "logits/rejected": -0.31640625, + "logps/chosen": -396.0, + "logps/rejected": -314.0, + "loss": 0.2962, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.671875, + "rewards/margins": 4.0, + "rewards/rejected": -2.328125, + "step": 102 + }, + { + "epoch": 0.1263803680981595, + "grad_norm": 39.79508252800174, + "learning_rate": 4.838842975206611e-07, + "logits/chosen": -0.1884765625, + "logits/rejected": -0.349609375, + "logps/chosen": -350.0, + "logps/rejected": -290.0, + "loss": 0.3121, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.4609375, + "rewards/margins": 3.734375, + "rewards/rejected": -2.265625, + "step": 103 + }, + { + "epoch": 0.1276073619631902, + "grad_norm": 47.40646017292448, + "learning_rate": 4.836776859504132e-07, + "logits/chosen": -0.1162109375, + "logits/rejected": -0.255859375, + "logps/chosen": -416.0, + "logps/rejected": -330.0, + "loss": 0.3411, + "rewards/accuracies": 0.78125, + "rewards/chosen": 1.46875, + "rewards/margins": 3.734375, + "rewards/rejected": -2.265625, + "step": 104 + }, + { + "epoch": 0.12883435582822086, + "grad_norm": 38.094017856958104, + "learning_rate": 4.834710743801652e-07, + "logits/chosen": -0.2021484375, + "logits/rejected": -0.40234375, + "logps/chosen": -378.0, + "logps/rejected": -298.0, + "loss": 0.2782, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.6640625, + "rewards/margins": 4.1875, + "rewards/rejected": -2.515625, + "step": 105 + }, + { + "epoch": 0.13006134969325153, + "grad_norm": 38.92036345370265, + "learning_rate": 4.832644628099174e-07, + "logits/chosen": -0.177734375, + "logits/rejected": -0.337890625, + "logps/chosen": -394.0, + "logps/rejected": -304.0, + "loss": 0.3126, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.6171875, + "rewards/margins": 3.953125, + "rewards/rejected": -2.34375, + "step": 106 + }, + { + "epoch": 0.1312883435582822, + "grad_norm": 41.08010358460662, + "learning_rate": 4.830578512396694e-07, + "logits/chosen": -0.2109375, + "logits/rejected": -0.3046875, + "logps/chosen": -350.0, + "logps/rejected": -292.0, + "loss": 0.2914, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.4375, + "rewards/margins": 3.8125, + "rewards/rejected": -2.375, + "step": 107 + }, + { + "epoch": 0.1325153374233129, + "grad_norm": 36.5889842300964, + "learning_rate": 4.828512396694215e-07, + "logits/chosen": -0.2236328125, + "logits/rejected": -0.435546875, + "logps/chosen": -382.0, + "logps/rejected": -294.0, + "loss": 0.2899, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.2734375, + "rewards/margins": 3.921875, + "rewards/rejected": -2.65625, + "step": 108 + }, + { + "epoch": 0.13374233128834356, + "grad_norm": 39.09556301559485, + "learning_rate": 4.826446280991735e-07, + "logits/chosen": -0.20703125, + "logits/rejected": -0.39453125, + "logps/chosen": -414.0, + "logps/rejected": -304.0, + "loss": 0.3113, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 2.1875, + "rewards/margins": 4.59375, + "rewards/rejected": -2.390625, + "step": 109 + }, + { + "epoch": 0.13496932515337423, + "grad_norm": 40.98286093074122, + "learning_rate": 4.824380165289256e-07, + "logits/chosen": -0.193359375, + "logits/rejected": -0.349609375, + "logps/chosen": -406.0, + "logps/rejected": -326.0, + "loss": 0.3227, + "rewards/accuracies": 0.7734375, + "rewards/chosen": 1.890625, + "rewards/margins": 4.3125, + "rewards/rejected": -2.421875, + "step": 110 + }, + { + "epoch": 0.1361963190184049, + "grad_norm": 35.811211169912276, + "learning_rate": 4.822314049586776e-07, + "logits/chosen": -0.1318359375, + "logits/rejected": -0.294921875, + "logps/chosen": -332.0, + "logps/rejected": -262.0, + "loss": 0.303, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.3828125, + "rewards/margins": 3.546875, + "rewards/rejected": -2.15625, + "step": 111 + }, + { + "epoch": 0.1374233128834356, + "grad_norm": 34.57286118091264, + "learning_rate": 4.820247933884298e-07, + "logits/chosen": -0.2080078125, + "logits/rejected": -0.328125, + "logps/chosen": -342.0, + "logps/rejected": -272.0, + "loss": 0.259, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.4140625, + "rewards/margins": 3.828125, + "rewards/rejected": -2.40625, + "step": 112 + }, + { + "epoch": 0.13865030674846626, + "grad_norm": 39.00609248421783, + "learning_rate": 4.818181818181818e-07, + "logits/chosen": -0.12353515625, + "logits/rejected": -0.216796875, + "logps/chosen": -378.0, + "logps/rejected": -294.0, + "loss": 0.3242, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.5859375, + "rewards/margins": 3.8125, + "rewards/rejected": -2.234375, + "step": 113 + }, + { + "epoch": 0.13987730061349693, + "grad_norm": 44.795935075325445, + "learning_rate": 4.816115702479339e-07, + "logits/chosen": -0.1591796875, + "logits/rejected": -0.318359375, + "logps/chosen": -376.0, + "logps/rejected": -300.0, + "loss": 0.3214, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.1875, + "rewards/margins": 3.484375, + "rewards/rejected": -2.296875, + "step": 114 + }, + { + "epoch": 0.1411042944785276, + "grad_norm": 43.827084866837005, + "learning_rate": 4.814049586776859e-07, + "logits/chosen": -0.1689453125, + "logits/rejected": -0.291015625, + "logps/chosen": -340.0, + "logps/rejected": -306.0, + "loss": 0.338, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.953125, + "rewards/margins": 3.296875, + "rewards/rejected": -2.34375, + "step": 115 + }, + { + "epoch": 0.1423312883435583, + "grad_norm": 32.836140603929685, + "learning_rate": 4.81198347107438e-07, + "logits/chosen": -0.220703125, + "logits/rejected": -0.45703125, + "logps/chosen": -382.0, + "logps/rejected": -314.0, + "loss": 0.2561, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.84375, + "rewards/margins": 4.375, + "rewards/rejected": -2.546875, + "step": 116 + }, + { + "epoch": 0.14355828220858896, + "grad_norm": 34.86086710464441, + "learning_rate": 4.809917355371901e-07, + "logits/chosen": -0.1689453125, + "logits/rejected": -0.31640625, + "logps/chosen": -326.0, + "logps/rejected": -255.0, + "loss": 0.289, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.140625, + "rewards/margins": 3.828125, + "rewards/rejected": -2.6875, + "step": 117 + }, + { + "epoch": 0.14478527607361963, + "grad_norm": 39.71090585702439, + "learning_rate": 4.807851239669422e-07, + "logits/chosen": -0.1826171875, + "logits/rejected": -0.349609375, + "logps/chosen": -422.0, + "logps/rejected": -344.0, + "loss": 0.3177, + "rewards/accuracies": 0.7734375, + "rewards/chosen": 1.8203125, + "rewards/margins": 4.125, + "rewards/rejected": -2.296875, + "step": 118 + }, + { + "epoch": 0.1460122699386503, + "grad_norm": 39.95542336983019, + "learning_rate": 4.805785123966942e-07, + "logits/chosen": -0.25, + "logits/rejected": -0.353515625, + "logps/chosen": -356.0, + "logps/rejected": -310.0, + "loss": 0.3108, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.25, + "rewards/margins": 3.921875, + "rewards/rejected": -2.65625, + "step": 119 + }, + { + "epoch": 0.147239263803681, + "grad_norm": 43.1225245187085, + "learning_rate": 4.803719008264463e-07, + "logits/chosen": -0.2373046875, + "logits/rejected": -0.42578125, + "logps/chosen": -422.0, + "logps/rejected": -340.0, + "loss": 0.2861, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 2.15625, + "rewards/margins": 4.6875, + "rewards/rejected": -2.53125, + "step": 120 + }, + { + "epoch": 0.14846625766871166, + "grad_norm": 37.11625554264979, + "learning_rate": 4.801652892561983e-07, + "logits/chosen": -0.150390625, + "logits/rejected": -0.3125, + "logps/chosen": -412.0, + "logps/rejected": -318.0, + "loss": 0.2783, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.9296875, + "rewards/margins": 4.34375, + "rewards/rejected": -2.421875, + "step": 121 + }, + { + "epoch": 0.14969325153374233, + "grad_norm": 40.09291676904836, + "learning_rate": 4.799586776859503e-07, + "logits/chosen": -0.1689453125, + "logits/rejected": -0.337890625, + "logps/chosen": -380.0, + "logps/rejected": -282.0, + "loss": 0.2905, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.484375, + "rewards/margins": 3.859375, + "rewards/rejected": -2.390625, + "step": 122 + }, + { + "epoch": 0.150920245398773, + "grad_norm": 40.539065533878755, + "learning_rate": 4.797520661157025e-07, + "logits/chosen": -0.06982421875, + "logits/rejected": -0.2431640625, + "logps/chosen": -382.0, + "logps/rejected": -272.0, + "loss": 0.3077, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.140625, + "rewards/margins": 3.734375, + "rewards/rejected": -2.59375, + "step": 123 + }, + { + "epoch": 0.1521472392638037, + "grad_norm": 36.86795414024157, + "learning_rate": 4.795454545454545e-07, + "logits/chosen": -0.232421875, + "logits/rejected": -0.306640625, + "logps/chosen": -352.0, + "logps/rejected": -274.0, + "loss": 0.2623, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.75, + "rewards/margins": 4.53125, + "rewards/rejected": -2.78125, + "step": 124 + }, + { + "epoch": 0.15337423312883436, + "grad_norm": 41.75540815129781, + "learning_rate": 4.793388429752066e-07, + "logits/chosen": -0.29296875, + "logits/rejected": -0.47265625, + "logps/chosen": -434.0, + "logps/rejected": -320.0, + "loss": 0.2841, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.578125, + "rewards/margins": 4.5625, + "rewards/rejected": -2.984375, + "step": 125 + }, + { + "epoch": 0.15460122699386503, + "grad_norm": 80.39792909106652, + "learning_rate": 4.791322314049586e-07, + "logits/chosen": -0.16015625, + "logits/rejected": -0.353515625, + "logps/chosen": -366.0, + "logps/rejected": -296.0, + "loss": 0.3527, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.83203125, + "rewards/margins": 3.578125, + "rewards/rejected": -2.75, + "step": 126 + }, + { + "epoch": 0.1558282208588957, + "grad_norm": 40.94598816709626, + "learning_rate": 4.789256198347108e-07, + "logits/chosen": -0.1103515625, + "logits/rejected": -0.298828125, + "logps/chosen": -390.0, + "logps/rejected": -318.0, + "loss": 0.3476, + "rewards/accuracies": 0.7734375, + "rewards/chosen": 1.6640625, + "rewards/margins": 4.21875, + "rewards/rejected": -2.5625, + "step": 127 + }, + { + "epoch": 0.1570552147239264, + "grad_norm": 39.47992513478673, + "learning_rate": 4.787190082644627e-07, + "logits/chosen": -0.158203125, + "logits/rejected": -0.34765625, + "logps/chosen": -374.0, + "logps/rejected": -320.0, + "loss": 0.2814, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.5703125, + "rewards/margins": 4.3125, + "rewards/rejected": -2.75, + "step": 128 + }, + { + "epoch": 0.15828220858895706, + "grad_norm": 37.925898083738666, + "learning_rate": 4.785123966942149e-07, + "logits/chosen": -0.06396484375, + "logits/rejected": -0.1953125, + "logps/chosen": -338.0, + "logps/rejected": -278.0, + "loss": 0.3421, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.125, + "rewards/margins": 3.546875, + "rewards/rejected": -2.421875, + "step": 129 + }, + { + "epoch": 0.15950920245398773, + "grad_norm": 38.0262211895724, + "learning_rate": 4.783057851239669e-07, + "logits/chosen": -0.162109375, + "logits/rejected": -0.3046875, + "logps/chosen": -382.0, + "logps/rejected": -300.0, + "loss": 0.3115, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.1640625, + "rewards/margins": 3.96875, + "rewards/rejected": -2.8125, + "step": 130 + }, + { + "epoch": 0.1607361963190184, + "grad_norm": 35.33717303960686, + "learning_rate": 4.78099173553719e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.4140625, + "logps/chosen": -394.0, + "logps/rejected": -330.0, + "loss": 0.2154, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.6875, + "rewards/margins": 4.6875, + "rewards/rejected": -3.0, + "step": 131 + }, + { + "epoch": 0.1619631901840491, + "grad_norm": 40.955300358810696, + "learning_rate": 4.77892561983471e-07, + "logits/chosen": -0.234375, + "logits/rejected": -0.421875, + "logps/chosen": -390.0, + "logps/rejected": -312.0, + "loss": 0.314, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.484375, + "rewards/margins": 4.34375, + "rewards/rejected": -2.84375, + "step": 132 + }, + { + "epoch": 0.16319018404907976, + "grad_norm": 43.6440596613334, + "learning_rate": 4.776859504132231e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.4296875, + "logps/chosen": -384.0, + "logps/rejected": -318.0, + "loss": 0.2844, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.3671875, + "rewards/margins": 4.4375, + "rewards/rejected": -3.078125, + "step": 133 + }, + { + "epoch": 0.16441717791411042, + "grad_norm": 43.873623198146426, + "learning_rate": 4.774793388429752e-07, + "logits/chosen": -0.1953125, + "logits/rejected": -0.404296875, + "logps/chosen": -452.0, + "logps/rejected": -354.0, + "loss": 0.2948, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.3828125, + "rewards/margins": 3.96875, + "rewards/rejected": -2.59375, + "step": 134 + }, + { + "epoch": 0.1656441717791411, + "grad_norm": 44.973502848979926, + "learning_rate": 4.772727272727273e-07, + "logits/chosen": -0.0732421875, + "logits/rejected": -0.1865234375, + "logps/chosen": -372.0, + "logps/rejected": -308.0, + "loss": 0.3459, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.86328125, + "rewards/margins": 3.6875, + "rewards/rejected": -2.828125, + "step": 135 + }, + { + "epoch": 0.1668711656441718, + "grad_norm": 42.51816162906932, + "learning_rate": 4.770661157024793e-07, + "logits/chosen": -0.29296875, + "logits/rejected": -0.376953125, + "logps/chosen": -388.0, + "logps/rejected": -298.0, + "loss": 0.3308, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.2578125, + "rewards/margins": 4.34375, + "rewards/rejected": -3.078125, + "step": 136 + }, + { + "epoch": 0.16809815950920245, + "grad_norm": 48.104926340758944, + "learning_rate": 4.768595041322314e-07, + "logits/chosen": -0.080078125, + "logits/rejected": -0.2236328125, + "logps/chosen": -394.0, + "logps/rejected": -298.0, + "loss": 0.3458, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.125, + "rewards/margins": 3.640625, + "rewards/rejected": -2.515625, + "step": 137 + }, + { + "epoch": 0.16932515337423312, + "grad_norm": 38.354545275687684, + "learning_rate": 4.766528925619834e-07, + "logits/chosen": -0.1572265625, + "logits/rejected": -0.298828125, + "logps/chosen": -402.0, + "logps/rejected": -338.0, + "loss": 0.304, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.0078125, + "rewards/margins": 3.78125, + "rewards/rejected": -2.765625, + "step": 138 + }, + { + "epoch": 0.1705521472392638, + "grad_norm": 43.72111370882085, + "learning_rate": 4.764462809917355e-07, + "logits/chosen": -0.1494140625, + "logits/rejected": -0.32421875, + "logps/chosen": -414.0, + "logps/rejected": -356.0, + "loss": 0.3477, + "rewards/accuracies": 0.765625, + "rewards/chosen": 1.4453125, + "rewards/margins": 4.625, + "rewards/rejected": -3.171875, + "step": 139 + }, + { + "epoch": 0.17177914110429449, + "grad_norm": 49.390666427837495, + "learning_rate": 4.7623966942148756e-07, + "logits/chosen": -0.1201171875, + "logits/rejected": -0.3046875, + "logps/chosen": -422.0, + "logps/rejected": -354.0, + "loss": 0.3233, + "rewards/accuracies": 0.78125, + "rewards/chosen": 1.375, + "rewards/margins": 4.28125, + "rewards/rejected": -2.90625, + "step": 140 + }, + { + "epoch": 0.17300613496932515, + "grad_norm": 37.18049684192118, + "learning_rate": 4.7603305785123966e-07, + "logits/chosen": -0.10205078125, + "logits/rejected": -0.228515625, + "logps/chosen": -356.0, + "logps/rejected": -312.0, + "loss": 0.2587, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.3671875, + "rewards/margins": 4.1875, + "rewards/rejected": -2.8125, + "step": 141 + }, + { + "epoch": 0.17423312883435582, + "grad_norm": 38.15326329982988, + "learning_rate": 4.758264462809917e-07, + "logits/chosen": -0.134765625, + "logits/rejected": -0.32421875, + "logps/chosen": -396.0, + "logps/rejected": -330.0, + "loss": 0.3083, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.3984375, + "rewards/margins": 4.40625, + "rewards/rejected": -3.0, + "step": 142 + }, + { + "epoch": 0.1754601226993865, + "grad_norm": 42.239479521280984, + "learning_rate": 4.756198347107438e-07, + "logits/chosen": -0.1572265625, + "logits/rejected": -0.37890625, + "logps/chosen": -382.0, + "logps/rejected": -302.0, + "loss": 0.3086, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.0, + "rewards/margins": 4.15625, + "rewards/rejected": -3.140625, + "step": 143 + }, + { + "epoch": 0.17668711656441718, + "grad_norm": 36.71090019780343, + "learning_rate": 4.7541322314049586e-07, + "logits/chosen": -0.25, + "logits/rejected": -0.44140625, + "logps/chosen": -418.0, + "logps/rejected": -334.0, + "loss": 0.2799, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.7578125, + "rewards/margins": 4.75, + "rewards/rejected": -2.984375, + "step": 144 + }, + { + "epoch": 0.17791411042944785, + "grad_norm": 39.65398403637813, + "learning_rate": 4.7520661157024796e-07, + "logits/chosen": -0.2421875, + "logits/rejected": -0.390625, + "logps/chosen": -382.0, + "logps/rejected": -326.0, + "loss": 0.2858, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.5078125, + "rewards/margins": 4.46875, + "rewards/rejected": -2.953125, + "step": 145 + }, + { + "epoch": 0.17914110429447852, + "grad_norm": 36.72907127712686, + "learning_rate": 4.7499999999999995e-07, + "logits/chosen": -0.2236328125, + "logits/rejected": -0.33984375, + "logps/chosen": -384.0, + "logps/rejected": -310.0, + "loss": 0.2676, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 0.9375, + "rewards/margins": 4.09375, + "rewards/rejected": -3.15625, + "step": 146 + }, + { + "epoch": 0.18036809815950922, + "grad_norm": 35.42441477087175, + "learning_rate": 4.7479338842975205e-07, + "logits/chosen": -0.2255859375, + "logits/rejected": -0.37890625, + "logps/chosen": -388.0, + "logps/rejected": -310.0, + "loss": 0.275, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.5625, + "rewards/margins": 4.75, + "rewards/rejected": -3.203125, + "step": 147 + }, + { + "epoch": 0.18159509202453988, + "grad_norm": 51.82377713556493, + "learning_rate": 4.745867768595041e-07, + "logits/chosen": -0.25, + "logits/rejected": -0.384765625, + "logps/chosen": -414.0, + "logps/rejected": -344.0, + "loss": 0.3525, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.1171875, + "rewards/margins": 4.15625, + "rewards/rejected": -3.03125, + "step": 148 + }, + { + "epoch": 0.18282208588957055, + "grad_norm": 41.25940325564231, + "learning_rate": 4.743801652892562e-07, + "logits/chosen": -0.1279296875, + "logits/rejected": -0.29296875, + "logps/chosen": -406.0, + "logps/rejected": -362.0, + "loss": 0.253, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.734375, + "rewards/margins": 4.5625, + "rewards/rejected": -2.8125, + "step": 149 + }, + { + "epoch": 0.18404907975460122, + "grad_norm": 43.207544914218985, + "learning_rate": 4.7417355371900825e-07, + "logits/chosen": -0.1611328125, + "logits/rejected": -0.34375, + "logps/chosen": -424.0, + "logps/rejected": -328.0, + "loss": 0.3367, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.3984375, + "rewards/margins": 4.03125, + "rewards/rejected": -2.625, + "step": 150 + }, + { + "epoch": 0.18527607361963191, + "grad_norm": 42.2843854545005, + "learning_rate": 4.739669421487603e-07, + "logits/chosen": -0.1728515625, + "logits/rejected": -0.302734375, + "logps/chosen": -380.0, + "logps/rejected": -306.0, + "loss": 0.319, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.4453125, + "rewards/margins": 4.0625, + "rewards/rejected": -2.609375, + "step": 151 + }, + { + "epoch": 0.18650306748466258, + "grad_norm": 36.146243015735116, + "learning_rate": 4.737603305785124e-07, + "logits/chosen": -0.267578125, + "logits/rejected": -0.5078125, + "logps/chosen": -398.0, + "logps/rejected": -294.0, + "loss": 0.2584, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.203125, + "rewards/margins": 4.75, + "rewards/rejected": -3.546875, + "step": 152 + }, + { + "epoch": 0.18773006134969325, + "grad_norm": 38.30453694202532, + "learning_rate": 4.7355371900826444e-07, + "logits/chosen": -0.23828125, + "logits/rejected": -0.35546875, + "logps/chosen": -350.0, + "logps/rejected": -302.0, + "loss": 0.2846, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.265625, + "rewards/margins": 4.34375, + "rewards/rejected": -3.0625, + "step": 153 + }, + { + "epoch": 0.18895705521472392, + "grad_norm": 48.193035851495836, + "learning_rate": 4.7334710743801654e-07, + "logits/chosen": -0.11767578125, + "logits/rejected": -0.30859375, + "logps/chosen": -424.0, + "logps/rejected": -324.0, + "loss": 0.3123, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.703125, + "rewards/margins": 4.4375, + "rewards/rejected": -2.734375, + "step": 154 + }, + { + "epoch": 0.1901840490797546, + "grad_norm": 27.96292821117509, + "learning_rate": 4.7314049586776853e-07, + "logits/chosen": -0.2216796875, + "logits/rejected": -0.46875, + "logps/chosen": -384.0, + "logps/rejected": -302.0, + "loss": 0.1878, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 2.15625, + "rewards/margins": 5.40625, + "rewards/rejected": -3.25, + "step": 155 + }, + { + "epoch": 0.19141104294478528, + "grad_norm": 42.366226442840826, + "learning_rate": 4.7293388429752063e-07, + "logits/chosen": -0.1357421875, + "logits/rejected": -0.2470703125, + "logps/chosen": -370.0, + "logps/rejected": -332.0, + "loss": 0.2881, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.1796875, + "rewards/margins": 3.953125, + "rewards/rejected": -2.765625, + "step": 156 + }, + { + "epoch": 0.19263803680981595, + "grad_norm": 40.72999796402848, + "learning_rate": 4.727272727272727e-07, + "logits/chosen": -0.1376953125, + "logits/rejected": -0.263671875, + "logps/chosen": -396.0, + "logps/rejected": -292.0, + "loss": 0.2888, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.1953125, + "rewards/margins": 4.09375, + "rewards/rejected": -2.890625, + "step": 157 + }, + { + "epoch": 0.19386503067484662, + "grad_norm": 33.577674005153725, + "learning_rate": 4.725206611570248e-07, + "logits/chosen": -0.32421875, + "logits/rejected": -0.51171875, + "logps/chosen": -388.0, + "logps/rejected": -302.0, + "loss": 0.2863, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.3671875, + "rewards/margins": 4.53125, + "rewards/rejected": -3.15625, + "step": 158 + }, + { + "epoch": 0.1950920245398773, + "grad_norm": 43.09895886139825, + "learning_rate": 4.7231404958677683e-07, + "logits/chosen": -0.228515625, + "logits/rejected": -0.357421875, + "logps/chosen": -360.0, + "logps/rejected": -314.0, + "loss": 0.2941, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.40625, + "rewards/margins": 4.25, + "rewards/rejected": -2.84375, + "step": 159 + }, + { + "epoch": 0.19631901840490798, + "grad_norm": 33.061685198617056, + "learning_rate": 4.7210743801652893e-07, + "logits/chosen": -0.1201171875, + "logits/rejected": -0.345703125, + "logps/chosen": -354.0, + "logps/rejected": -290.0, + "loss": 0.2365, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.03125, + "rewards/margins": 4.125, + "rewards/rejected": -3.09375, + "step": 160 + }, + { + "epoch": 0.19754601226993865, + "grad_norm": 34.262461708297515, + "learning_rate": 4.71900826446281e-07, + "logits/chosen": -0.28515625, + "logits/rejected": -0.4921875, + "logps/chosen": -390.0, + "logps/rejected": -284.0, + "loss": 0.2321, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.6015625, + "rewards/margins": 4.6875, + "rewards/rejected": -3.078125, + "step": 161 + }, + { + "epoch": 0.19877300613496932, + "grad_norm": 46.44613400198569, + "learning_rate": 4.716942148760331e-07, + "logits/chosen": -0.2080078125, + "logits/rejected": -0.2890625, + "logps/chosen": -352.0, + "logps/rejected": -326.0, + "loss": 0.3532, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.234375, + "rewards/margins": 4.09375, + "rewards/rejected": -2.875, + "step": 162 + }, + { + "epoch": 0.2, + "grad_norm": 40.81709447673029, + "learning_rate": 4.7148760330578507e-07, + "logits/chosen": -0.146484375, + "logits/rejected": -0.296875, + "logps/chosen": -394.0, + "logps/rejected": -324.0, + "loss": 0.2919, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.3359375, + "rewards/margins": 4.15625, + "rewards/rejected": -2.8125, + "step": 163 + }, + { + "epoch": 0.20122699386503068, + "grad_norm": 30.76141719102355, + "learning_rate": 4.7128099173553717e-07, + "logits/chosen": -0.2890625, + "logits/rejected": -0.5234375, + "logps/chosen": -396.0, + "logps/rejected": -290.0, + "loss": 0.2276, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.828125, + "rewards/margins": 5.09375, + "rewards/rejected": -3.28125, + "step": 164 + }, + { + "epoch": 0.20245398773006135, + "grad_norm": 39.308244617085876, + "learning_rate": 4.710743801652892e-07, + "logits/chosen": -0.09228515625, + "logits/rejected": -0.298828125, + "logps/chosen": -442.0, + "logps/rejected": -306.0, + "loss": 0.2561, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.6328125, + "rewards/margins": 4.40625, + "rewards/rejected": -2.78125, + "step": 165 + }, + { + "epoch": 0.20368098159509201, + "grad_norm": 40.482102907615214, + "learning_rate": 4.708677685950413e-07, + "logits/chosen": -0.158203125, + "logits/rejected": -0.388671875, + "logps/chosen": -390.0, + "logps/rejected": -316.0, + "loss": 0.335, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.7890625, + "rewards/margins": 4.4375, + "rewards/rejected": -2.640625, + "step": 166 + }, + { + "epoch": 0.2049079754601227, + "grad_norm": 41.24091114160285, + "learning_rate": 4.7066115702479336e-07, + "logits/chosen": -0.13671875, + "logits/rejected": -0.291015625, + "logps/chosen": -402.0, + "logps/rejected": -298.0, + "loss": 0.3427, + "rewards/accuracies": 0.78125, + "rewards/chosen": 1.9609375, + "rewards/margins": 4.65625, + "rewards/rejected": -2.703125, + "step": 167 + }, + { + "epoch": 0.20613496932515338, + "grad_norm": 36.55347289055332, + "learning_rate": 4.704545454545454e-07, + "logits/chosen": -0.12158203125, + "logits/rejected": -0.236328125, + "logps/chosen": -348.0, + "logps/rejected": -270.0, + "loss": 0.2471, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.046875, + "rewards/margins": 4.3125, + "rewards/rejected": -3.265625, + "step": 168 + }, + { + "epoch": 0.20736196319018405, + "grad_norm": 42.227854487848845, + "learning_rate": 4.702479338842975e-07, + "logits/chosen": -0.1982421875, + "logits/rejected": -0.365234375, + "logps/chosen": -370.0, + "logps/rejected": -344.0, + "loss": 0.3043, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.03125, + "rewards/margins": 4.09375, + "rewards/rejected": -3.0625, + "step": 169 + }, + { + "epoch": 0.2085889570552147, + "grad_norm": 41.26301353968675, + "learning_rate": 4.7004132231404956e-07, + "logits/chosen": -0.1865234375, + "logits/rejected": -0.427734375, + "logps/chosen": -450.0, + "logps/rejected": -322.0, + "loss": 0.282, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.8671875, + "rewards/margins": 4.875, + "rewards/rejected": -3.015625, + "step": 170 + }, + { + "epoch": 0.2098159509202454, + "grad_norm": 32.40263540928059, + "learning_rate": 4.6983471074380166e-07, + "logits/chosen": -0.169921875, + "logits/rejected": -0.365234375, + "logps/chosen": -384.0, + "logps/rejected": -296.0, + "loss": 0.267, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.625, + "rewards/margins": 4.9375, + "rewards/rejected": -3.296875, + "step": 171 + }, + { + "epoch": 0.21104294478527608, + "grad_norm": 39.16155801484506, + "learning_rate": 4.6962809917355365e-07, + "logits/chosen": -0.1455078125, + "logits/rejected": -0.30859375, + "logps/chosen": -438.0, + "logps/rejected": -326.0, + "loss": 0.2624, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.828125, + "rewards/margins": 4.96875, + "rewards/rejected": -3.140625, + "step": 172 + }, + { + "epoch": 0.21226993865030674, + "grad_norm": 32.6638006062681, + "learning_rate": 4.6942148760330575e-07, + "logits/chosen": -0.2021484375, + "logits/rejected": -0.439453125, + "logps/chosen": -424.0, + "logps/rejected": -330.0, + "loss": 0.2304, + "rewards/accuracies": 0.859375, + "rewards/chosen": 2.015625, + "rewards/margins": 5.3125, + "rewards/rejected": -3.28125, + "step": 173 + }, + { + "epoch": 0.2134969325153374, + "grad_norm": 41.117611256664055, + "learning_rate": 4.692148760330578e-07, + "logits/chosen": -0.057861328125, + "logits/rejected": -0.265625, + "logps/chosen": -380.0, + "logps/rejected": -318.0, + "loss": 0.3128, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.28125, + "rewards/margins": 4.4375, + "rewards/rejected": -3.15625, + "step": 174 + }, + { + "epoch": 0.2147239263803681, + "grad_norm": 43.97682714628577, + "learning_rate": 4.690082644628099e-07, + "logits/chosen": -0.1943359375, + "logits/rejected": -0.333984375, + "logps/chosen": -396.0, + "logps/rejected": -336.0, + "loss": 0.3103, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.6796875, + "rewards/margins": 4.8125, + "rewards/rejected": -3.140625, + "step": 175 + }, + { + "epoch": 0.21595092024539878, + "grad_norm": 39.95318826911176, + "learning_rate": 4.6880165289256195e-07, + "logits/chosen": -0.23046875, + "logits/rejected": -0.419921875, + "logps/chosen": -432.0, + "logps/rejected": -346.0, + "loss": 0.3105, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.65625, + "rewards/margins": 4.875, + "rewards/rejected": -3.234375, + "step": 176 + }, + { + "epoch": 0.21717791411042944, + "grad_norm": 31.646657225559906, + "learning_rate": 4.6859504132231405e-07, + "logits/chosen": -0.1767578125, + "logits/rejected": -0.408203125, + "logps/chosen": -416.0, + "logps/rejected": -324.0, + "loss": 0.233, + "rewards/accuracies": 0.859375, + "rewards/chosen": 2.109375, + "rewards/margins": 5.5625, + "rewards/rejected": -3.46875, + "step": 177 + }, + { + "epoch": 0.2184049079754601, + "grad_norm": 41.80865379666853, + "learning_rate": 4.683884297520661e-07, + "logits/chosen": -0.173828125, + "logits/rejected": -0.322265625, + "logps/chosen": -326.0, + "logps/rejected": -288.0, + "loss": 0.3445, + "rewards/accuracies": 0.78125, + "rewards/chosen": 0.640625, + "rewards/margins": 4.28125, + "rewards/rejected": -3.640625, + "step": 178 + }, + { + "epoch": 0.2196319018404908, + "grad_norm": 33.273068108107914, + "learning_rate": 4.681818181818182e-07, + "logits/chosen": -0.2099609375, + "logits/rejected": -0.4140625, + "logps/chosen": -368.0, + "logps/rejected": -298.0, + "loss": 0.2545, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 0.8828125, + "rewards/margins": 4.4375, + "rewards/rejected": -3.546875, + "step": 179 + }, + { + "epoch": 0.22085889570552147, + "grad_norm": 41.89399116746023, + "learning_rate": 4.6797520661157024e-07, + "logits/chosen": -0.2099609375, + "logits/rejected": -0.333984375, + "logps/chosen": -356.0, + "logps/rejected": -292.0, + "loss": 0.3137, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.2421875, + "rewards/margins": 4.34375, + "rewards/rejected": -3.09375, + "step": 180 + }, + { + "epoch": 0.22208588957055214, + "grad_norm": 44.979423553734385, + "learning_rate": 4.677685950413223e-07, + "logits/chosen": -0.1962890625, + "logits/rejected": -0.35546875, + "logps/chosen": -412.0, + "logps/rejected": -364.0, + "loss": 0.3496, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.4296875, + "rewards/margins": 4.625, + "rewards/rejected": -3.1875, + "step": 181 + }, + { + "epoch": 0.2233128834355828, + "grad_norm": 41.75351319386413, + "learning_rate": 4.6756198347107434e-07, + "logits/chosen": -0.2275390625, + "logits/rejected": -0.36328125, + "logps/chosen": -372.0, + "logps/rejected": -306.0, + "loss": 0.3303, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.921875, + "rewards/margins": 4.09375, + "rewards/rejected": -3.15625, + "step": 182 + }, + { + "epoch": 0.2245398773006135, + "grad_norm": 46.40866345124908, + "learning_rate": 4.6735537190082644e-07, + "logits/chosen": -0.11376953125, + "logits/rejected": -0.30078125, + "logps/chosen": -412.0, + "logps/rejected": -368.0, + "loss": 0.3255, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.984375, + "rewards/margins": 3.953125, + "rewards/rejected": -2.96875, + "step": 183 + }, + { + "epoch": 0.22576687116564417, + "grad_norm": 46.76226224495867, + "learning_rate": 4.671487603305785e-07, + "logits/chosen": -0.146484375, + "logits/rejected": -0.267578125, + "logps/chosen": -390.0, + "logps/rejected": -328.0, + "loss": 0.3388, + "rewards/accuracies": 0.765625, + "rewards/chosen": 0.78515625, + "rewards/margins": 3.984375, + "rewards/rejected": -3.1875, + "step": 184 + }, + { + "epoch": 0.22699386503067484, + "grad_norm": 48.77760268554608, + "learning_rate": 4.669421487603306e-07, + "logits/chosen": -0.19140625, + "logits/rejected": -0.263671875, + "logps/chosen": -384.0, + "logps/rejected": -340.0, + "loss": 0.3219, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.6328125, + "rewards/margins": 4.5, + "rewards/rejected": -2.859375, + "step": 185 + }, + { + "epoch": 0.2282208588957055, + "grad_norm": 38.08873895580722, + "learning_rate": 4.6673553719008263e-07, + "logits/chosen": -0.203125, + "logits/rejected": -0.33203125, + "logps/chosen": -338.0, + "logps/rejected": -300.0, + "loss": 0.2901, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.3203125, + "rewards/margins": 4.4375, + "rewards/rejected": -3.109375, + "step": 186 + }, + { + "epoch": 0.2294478527607362, + "grad_norm": 40.67564497850856, + "learning_rate": 4.665289256198347e-07, + "logits/chosen": -0.1884765625, + "logits/rejected": -0.357421875, + "logps/chosen": -374.0, + "logps/rejected": -326.0, + "loss": 0.2813, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.265625, + "rewards/margins": 4.625, + "rewards/rejected": -3.359375, + "step": 187 + }, + { + "epoch": 0.23067484662576687, + "grad_norm": 35.35467709831456, + "learning_rate": 4.663223140495868e-07, + "logits/chosen": -0.09716796875, + "logits/rejected": -0.189453125, + "logps/chosen": -332.0, + "logps/rejected": -280.0, + "loss": 0.2813, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.3046875, + "rewards/margins": 4.40625, + "rewards/rejected": -3.109375, + "step": 188 + }, + { + "epoch": 0.23190184049079754, + "grad_norm": 32.02217527416385, + "learning_rate": 4.661157024793388e-07, + "logits/chosen": -0.1787109375, + "logits/rejected": -0.369140625, + "logps/chosen": -400.0, + "logps/rejected": -308.0, + "loss": 0.2159, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.6015625, + "rewards/margins": 4.9375, + "rewards/rejected": -3.34375, + "step": 189 + }, + { + "epoch": 0.2331288343558282, + "grad_norm": 35.517601629388636, + "learning_rate": 4.6590909090909087e-07, + "logits/chosen": -0.08154296875, + "logits/rejected": -0.2490234375, + "logps/chosen": -344.0, + "logps/rejected": -300.0, + "loss": 0.2873, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.1015625, + "rewards/margins": 4.125, + "rewards/rejected": -3.03125, + "step": 190 + }, + { + "epoch": 0.2343558282208589, + "grad_norm": 46.62318205281028, + "learning_rate": 4.657024793388429e-07, + "logits/chosen": -0.1484375, + "logits/rejected": -0.33203125, + "logps/chosen": -402.0, + "logps/rejected": -288.0, + "loss": 0.3248, + "rewards/accuracies": 0.796875, + "rewards/chosen": 1.6953125, + "rewards/margins": 4.90625, + "rewards/rejected": -3.203125, + "step": 191 + }, + { + "epoch": 0.23558282208588957, + "grad_norm": 47.302561931824144, + "learning_rate": 4.65495867768595e-07, + "logits/chosen": -0.16015625, + "logits/rejected": -0.36328125, + "logps/chosen": -386.0, + "logps/rejected": -284.0, + "loss": 0.3212, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.265625, + "rewards/margins": 4.03125, + "rewards/rejected": -2.75, + "step": 192 + }, + { + "epoch": 0.23680981595092024, + "grad_norm": 38.194528570730164, + "learning_rate": 4.6528925619834707e-07, + "logits/chosen": -0.27734375, + "logits/rejected": -0.5234375, + "logps/chosen": -410.0, + "logps/rejected": -322.0, + "loss": 0.2332, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.7109375, + "rewards/margins": 5.03125, + "rewards/rejected": -3.3125, + "step": 193 + }, + { + "epoch": 0.23803680981595093, + "grad_norm": 42.44224201595828, + "learning_rate": 4.6508264462809917e-07, + "logits/chosen": -0.32421875, + "logits/rejected": -0.44921875, + "logps/chosen": -394.0, + "logps/rejected": -312.0, + "loss": 0.3223, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.953125, + "rewards/margins": 4.5625, + "rewards/rejected": -3.59375, + "step": 194 + }, + { + "epoch": 0.2392638036809816, + "grad_norm": 34.0790216803257, + "learning_rate": 4.648760330578512e-07, + "logits/chosen": -0.1396484375, + "logits/rejected": -0.40625, + "logps/chosen": -410.0, + "logps/rejected": -322.0, + "loss": 0.219, + "rewards/accuracies": 0.859375, + "rewards/chosen": 2.0, + "rewards/margins": 5.5, + "rewards/rejected": -3.5, + "step": 195 + }, + { + "epoch": 0.24049079754601227, + "grad_norm": 43.004434879940106, + "learning_rate": 4.646694214876033e-07, + "logits/chosen": -0.11962890625, + "logits/rejected": -0.3203125, + "logps/chosen": -392.0, + "logps/rejected": -282.0, + "loss": 0.3054, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.296875, + "rewards/margins": 4.3125, + "rewards/rejected": -3.0, + "step": 196 + }, + { + "epoch": 0.24171779141104294, + "grad_norm": 34.15269412729779, + "learning_rate": 4.6446280991735536e-07, + "logits/chosen": -0.2265625, + "logits/rejected": -0.47265625, + "logps/chosen": -378.0, + "logps/rejected": -308.0, + "loss": 0.2756, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.671875, + "rewards/margins": 4.75, + "rewards/rejected": -3.09375, + "step": 197 + }, + { + "epoch": 0.24294478527607363, + "grad_norm": 36.78925425492936, + "learning_rate": 4.6425619834710746e-07, + "logits/chosen": -0.1630859375, + "logits/rejected": -0.255859375, + "logps/chosen": -342.0, + "logps/rejected": -250.0, + "loss": 0.2945, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.1640625, + "rewards/margins": 4.09375, + "rewards/rejected": -2.9375, + "step": 198 + }, + { + "epoch": 0.2441717791411043, + "grad_norm": 28.311028034096932, + "learning_rate": 4.6404958677685945e-07, + "logits/chosen": -0.18359375, + "logits/rejected": -0.388671875, + "logps/chosen": -430.0, + "logps/rejected": -300.0, + "loss": 0.2045, + "rewards/accuracies": 0.921875, + "rewards/chosen": 2.171875, + "rewards/margins": 5.28125, + "rewards/rejected": -3.125, + "step": 199 + }, + { + "epoch": 0.24539877300613497, + "grad_norm": 44.46315305804351, + "learning_rate": 4.6384297520661155e-07, + "logits/chosen": -0.1591796875, + "logits/rejected": -0.3828125, + "logps/chosen": -434.0, + "logps/rejected": -358.0, + "loss": 0.303, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.9921875, + "rewards/margins": 4.8125, + "rewards/rejected": -2.8125, + "step": 200 + }, + { + "epoch": 0.24662576687116564, + "grad_norm": 32.929953461927006, + "learning_rate": 4.636363636363636e-07, + "logits/chosen": -0.171875, + "logits/rejected": -0.396484375, + "logps/chosen": -396.0, + "logps/rejected": -300.0, + "loss": 0.2219, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.8203125, + "rewards/margins": 4.78125, + "rewards/rejected": -2.953125, + "step": 201 + }, + { + "epoch": 0.24785276073619633, + "grad_norm": 38.191540513799985, + "learning_rate": 4.634297520661157e-07, + "logits/chosen": -0.1484375, + "logits/rejected": -0.359375, + "logps/chosen": -424.0, + "logps/rejected": -310.0, + "loss": 0.2735, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.9453125, + "rewards/margins": 4.75, + "rewards/rejected": -2.8125, + "step": 202 + }, + { + "epoch": 0.249079754601227, + "grad_norm": 43.899916034277716, + "learning_rate": 4.6322314049586775e-07, + "logits/chosen": -0.12158203125, + "logits/rejected": -0.30078125, + "logps/chosen": -386.0, + "logps/rejected": -328.0, + "loss": 0.3715, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.7265625, + "rewards/margins": 4.1875, + "rewards/rejected": -2.46875, + "step": 203 + }, + { + "epoch": 0.25030674846625767, + "grad_norm": 40.42534652251951, + "learning_rate": 4.630165289256198e-07, + "logits/chosen": -0.10498046875, + "logits/rejected": -0.2490234375, + "logps/chosen": -346.0, + "logps/rejected": -262.0, + "loss": 0.314, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.5234375, + "rewards/margins": 4.4375, + "rewards/rejected": -2.921875, + "step": 204 + }, + { + "epoch": 0.25153374233128833, + "grad_norm": 37.717470986712556, + "learning_rate": 4.628099173553719e-07, + "logits/chosen": -0.059326171875, + "logits/rejected": -0.2001953125, + "logps/chosen": -380.0, + "logps/rejected": -290.0, + "loss": 0.3111, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.7578125, + "rewards/margins": 4.1875, + "rewards/rejected": -2.4375, + "step": 205 + }, + { + "epoch": 0.252760736196319, + "grad_norm": 30.55406782868523, + "learning_rate": 4.6260330578512394e-07, + "logits/chosen": -0.1494140625, + "logits/rejected": -0.431640625, + "logps/chosen": -426.0, + "logps/rejected": -320.0, + "loss": 0.2196, + "rewards/accuracies": 0.90625, + "rewards/chosen": 2.0625, + "rewards/margins": 5.28125, + "rewards/rejected": -3.21875, + "step": 206 + }, + { + "epoch": 0.25398773006134967, + "grad_norm": 44.99416041741556, + "learning_rate": 4.6239669421487604e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.474609375, + "logps/chosen": -424.0, + "logps/rejected": -346.0, + "loss": 0.3683, + "rewards/accuracies": 0.7734375, + "rewards/chosen": 2.09375, + "rewards/margins": 4.65625, + "rewards/rejected": -2.5625, + "step": 207 + }, + { + "epoch": 0.2552147239263804, + "grad_norm": 38.298643600670886, + "learning_rate": 4.6219008264462804e-07, + "logits/chosen": -0.2451171875, + "logits/rejected": -0.376953125, + "logps/chosen": -386.0, + "logps/rejected": -312.0, + "loss": 0.3077, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.78125, + "rewards/margins": 4.78125, + "rewards/rejected": -2.984375, + "step": 208 + }, + { + "epoch": 0.25644171779141106, + "grad_norm": 42.08974951434723, + "learning_rate": 4.6198347107438014e-07, + "logits/chosen": -0.236328125, + "logits/rejected": -0.369140625, + "logps/chosen": -388.0, + "logps/rejected": -326.0, + "loss": 0.3252, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.6328125, + "rewards/margins": 4.46875, + "rewards/rejected": -2.84375, + "step": 209 + }, + { + "epoch": 0.25766871165644173, + "grad_norm": 49.252789458115785, + "learning_rate": 4.617768595041322e-07, + "logits/chosen": -0.19140625, + "logits/rejected": -0.306640625, + "logps/chosen": -390.0, + "logps/rejected": -354.0, + "loss": 0.3478, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.3359375, + "rewards/margins": 4.15625, + "rewards/rejected": -2.8125, + "step": 210 + }, + { + "epoch": 0.2588957055214724, + "grad_norm": 35.19521189692808, + "learning_rate": 4.615702479338843e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.474609375, + "logps/chosen": -430.0, + "logps/rejected": -336.0, + "loss": 0.2943, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.7421875, + "rewards/margins": 5.0, + "rewards/rejected": -3.25, + "step": 211 + }, + { + "epoch": 0.26012269938650306, + "grad_norm": 38.588101334546415, + "learning_rate": 4.6136363636363633e-07, + "logits/chosen": -0.205078125, + "logits/rejected": -0.373046875, + "logps/chosen": -396.0, + "logps/rejected": -304.0, + "loss": 0.2772, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.8671875, + "rewards/margins": 5.09375, + "rewards/rejected": -3.234375, + "step": 212 + }, + { + "epoch": 0.26134969325153373, + "grad_norm": 36.19543986527335, + "learning_rate": 4.6115702479338843e-07, + "logits/chosen": -0.1533203125, + "logits/rejected": -0.228515625, + "logps/chosen": -344.0, + "logps/rejected": -274.0, + "loss": 0.2568, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.25, + "rewards/margins": 4.28125, + "rewards/rejected": -3.015625, + "step": 213 + }, + { + "epoch": 0.2625766871165644, + "grad_norm": 36.76253302400916, + "learning_rate": 4.609504132231405e-07, + "logits/chosen": -0.130859375, + "logits/rejected": -0.3046875, + "logps/chosen": -370.0, + "logps/rejected": -306.0, + "loss": 0.2624, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.6953125, + "rewards/margins": 4.84375, + "rewards/rejected": -3.125, + "step": 214 + }, + { + "epoch": 0.26380368098159507, + "grad_norm": 37.194255093432446, + "learning_rate": 4.607438016528926e-07, + "logits/chosen": -0.111328125, + "logits/rejected": -0.2138671875, + "logps/chosen": -350.0, + "logps/rejected": -296.0, + "loss": 0.2725, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.1484375, + "rewards/margins": 4.25, + "rewards/rejected": -3.09375, + "step": 215 + }, + { + "epoch": 0.2650306748466258, + "grad_norm": 37.819502778321414, + "learning_rate": 4.605371900826446e-07, + "logits/chosen": -0.166015625, + "logits/rejected": -0.291015625, + "logps/chosen": -330.0, + "logps/rejected": -284.0, + "loss": 0.2757, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.921875, + "rewards/margins": 4.03125, + "rewards/rejected": -3.109375, + "step": 216 + }, + { + "epoch": 0.26625766871165646, + "grad_norm": 38.426937338322844, + "learning_rate": 4.6033057851239667e-07, + "logits/chosen": -0.072265625, + "logits/rejected": -0.224609375, + "logps/chosen": -398.0, + "logps/rejected": -298.0, + "loss": 0.3129, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.6875, + "rewards/margins": 4.59375, + "rewards/rejected": -2.890625, + "step": 217 + }, + { + "epoch": 0.2674846625766871, + "grad_norm": 48.711804010557216, + "learning_rate": 4.601239669421487e-07, + "logits/chosen": -0.12255859375, + "logits/rejected": -0.2412109375, + "logps/chosen": -380.0, + "logps/rejected": -326.0, + "loss": 0.3689, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.125, + "rewards/margins": 4.0625, + "rewards/rejected": -2.9375, + "step": 218 + }, + { + "epoch": 0.2687116564417178, + "grad_norm": 34.859463323248626, + "learning_rate": 4.599173553719008e-07, + "logits/chosen": -0.2158203125, + "logits/rejected": -0.328125, + "logps/chosen": -350.0, + "logps/rejected": -292.0, + "loss": 0.2779, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.09375, + "rewards/margins": 4.59375, + "rewards/rejected": -3.5, + "step": 219 + }, + { + "epoch": 0.26993865030674846, + "grad_norm": 46.80026994213379, + "learning_rate": 4.5971074380165287e-07, + "logits/chosen": -0.07568359375, + "logits/rejected": -0.1572265625, + "logps/chosen": -362.0, + "logps/rejected": -354.0, + "loss": 0.3534, + "rewards/accuracies": 0.765625, + "rewards/chosen": 0.79296875, + "rewards/margins": 3.765625, + "rewards/rejected": -2.96875, + "step": 220 + }, + { + "epoch": 0.27116564417177913, + "grad_norm": 44.236722785199355, + "learning_rate": 4.595041322314049e-07, + "logits/chosen": -0.1669921875, + "logits/rejected": -0.375, + "logps/chosen": -362.0, + "logps/rejected": -288.0, + "loss": 0.3432, + "rewards/accuracies": 0.7734375, + "rewards/chosen": 0.8125, + "rewards/margins": 4.28125, + "rewards/rejected": -3.46875, + "step": 221 + }, + { + "epoch": 0.2723926380368098, + "grad_norm": 37.55504945465003, + "learning_rate": 4.59297520661157e-07, + "logits/chosen": -0.33203125, + "logits/rejected": -0.482421875, + "logps/chosen": -386.0, + "logps/rejected": -298.0, + "loss": 0.2529, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.5703125, + "rewards/margins": 5.46875, + "rewards/rejected": -3.890625, + "step": 222 + }, + { + "epoch": 0.27361963190184047, + "grad_norm": 51.564475699604486, + "learning_rate": 4.5909090909090906e-07, + "logits/chosen": -0.154296875, + "logits/rejected": -0.33984375, + "logps/chosen": -386.0, + "logps/rejected": -316.0, + "loss": 0.3058, + "rewards/accuracies": 0.796875, + "rewards/chosen": 0.953125, + "rewards/margins": 4.25, + "rewards/rejected": -3.3125, + "step": 223 + }, + { + "epoch": 0.2748466257668712, + "grad_norm": 43.15791338185834, + "learning_rate": 4.5888429752066116e-07, + "logits/chosen": -0.248046875, + "logits/rejected": -0.435546875, + "logps/chosen": -450.0, + "logps/rejected": -332.0, + "loss": 0.2807, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.4609375, + "rewards/margins": 5.28125, + "rewards/rejected": -3.84375, + "step": 224 + }, + { + "epoch": 0.27607361963190186, + "grad_norm": 35.879838019408076, + "learning_rate": 4.586776859504132e-07, + "logits/chosen": -0.1279296875, + "logits/rejected": -0.328125, + "logps/chosen": -340.0, + "logps/rejected": -300.0, + "loss": 0.2506, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.92578125, + "rewards/margins": 4.84375, + "rewards/rejected": -3.921875, + "step": 225 + }, + { + "epoch": 0.2773006134969325, + "grad_norm": 44.55257679536464, + "learning_rate": 4.5847107438016525e-07, + "logits/chosen": -0.142578125, + "logits/rejected": -0.287109375, + "logps/chosen": -374.0, + "logps/rejected": -308.0, + "loss": 0.3177, + "rewards/accuracies": 0.78125, + "rewards/chosen": 1.203125, + "rewards/margins": 4.78125, + "rewards/rejected": -3.59375, + "step": 226 + }, + { + "epoch": 0.2785276073619632, + "grad_norm": 43.069867055252956, + "learning_rate": 4.582644628099173e-07, + "logits/chosen": -0.17578125, + "logits/rejected": -0.259765625, + "logps/chosen": -360.0, + "logps/rejected": -312.0, + "loss": 0.2933, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.95703125, + "rewards/margins": 4.84375, + "rewards/rejected": -3.875, + "step": 227 + }, + { + "epoch": 0.27975460122699386, + "grad_norm": 59.89729428981541, + "learning_rate": 4.580578512396694e-07, + "logits/chosen": -0.185546875, + "logits/rejected": -0.375, + "logps/chosen": -366.0, + "logps/rejected": -320.0, + "loss": 0.324, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.62109375, + "rewards/margins": 4.34375, + "rewards/rejected": -3.703125, + "step": 228 + }, + { + "epoch": 0.2809815950920245, + "grad_norm": 41.26714714905276, + "learning_rate": 4.5785123966942145e-07, + "logits/chosen": -0.1025390625, + "logits/rejected": -0.310546875, + "logps/chosen": -424.0, + "logps/rejected": -332.0, + "loss": 0.27, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.484375, + "rewards/margins": 4.65625, + "rewards/rejected": -3.171875, + "step": 229 + }, + { + "epoch": 0.2822085889570552, + "grad_norm": 33.72568576392679, + "learning_rate": 4.5764462809917355e-07, + "logits/chosen": -0.08935546875, + "logits/rejected": -0.28125, + "logps/chosen": -376.0, + "logps/rejected": -318.0, + "loss": 0.235, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.9765625, + "rewards/margins": 4.71875, + "rewards/rejected": -3.75, + "step": 230 + }, + { + "epoch": 0.28343558282208586, + "grad_norm": 42.97736121941397, + "learning_rate": 4.574380165289256e-07, + "logits/chosen": -0.1689453125, + "logits/rejected": -0.287109375, + "logps/chosen": -370.0, + "logps/rejected": -306.0, + "loss": 0.3436, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.0234375, + "rewards/margins": 4.3125, + "rewards/rejected": -3.296875, + "step": 231 + }, + { + "epoch": 0.2846625766871166, + "grad_norm": 42.93355591121654, + "learning_rate": 4.572314049586777e-07, + "logits/chosen": -0.2314453125, + "logits/rejected": -0.373046875, + "logps/chosen": -386.0, + "logps/rejected": -330.0, + "loss": 0.3127, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.5546875, + "rewards/margins": 4.3125, + "rewards/rejected": -3.75, + "step": 232 + }, + { + "epoch": 0.28588957055214725, + "grad_norm": 37.7852023248725, + "learning_rate": 4.5702479338842974e-07, + "logits/chosen": -0.1318359375, + "logits/rejected": -0.361328125, + "logps/chosen": -374.0, + "logps/rejected": -286.0, + "loss": 0.2759, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.21875, + "rewards/margins": 5.03125, + "rewards/rejected": -3.8125, + "step": 233 + }, + { + "epoch": 0.2871165644171779, + "grad_norm": 38.62852043438936, + "learning_rate": 4.5681818181818184e-07, + "logits/chosen": -0.267578125, + "logits/rejected": -0.400390625, + "logps/chosen": -374.0, + "logps/rejected": -310.0, + "loss": 0.2764, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.1640625, + "rewards/margins": 4.75, + "rewards/rejected": -3.578125, + "step": 234 + }, + { + "epoch": 0.2883435582822086, + "grad_norm": 37.335415454122945, + "learning_rate": 4.5661157024793384e-07, + "logits/chosen": -0.283203125, + "logits/rejected": -0.439453125, + "logps/chosen": -362.0, + "logps/rejected": -316.0, + "loss": 0.2629, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.1953125, + "rewards/margins": 4.84375, + "rewards/rejected": -3.640625, + "step": 235 + }, + { + "epoch": 0.28957055214723926, + "grad_norm": 55.00073114295456, + "learning_rate": 4.5640495867768594e-07, + "logits/chosen": -0.04736328125, + "logits/rejected": -0.232421875, + "logps/chosen": -398.0, + "logps/rejected": -364.0, + "loss": 0.374, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.6015625, + "rewards/margins": 4.46875, + "rewards/rejected": -2.859375, + "step": 236 + }, + { + "epoch": 0.2907975460122699, + "grad_norm": 34.92202343855084, + "learning_rate": 4.56198347107438e-07, + "logits/chosen": -0.189453125, + "logits/rejected": -0.34375, + "logps/chosen": -370.0, + "logps/rejected": -302.0, + "loss": 0.252, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.3515625, + "rewards/margins": 4.9375, + "rewards/rejected": -3.578125, + "step": 237 + }, + { + "epoch": 0.2920245398773006, + "grad_norm": 42.067317323205096, + "learning_rate": 4.559917355371901e-07, + "logits/chosen": -0.205078125, + "logits/rejected": -0.3671875, + "logps/chosen": -426.0, + "logps/rejected": -346.0, + "loss": 0.3198, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.4453125, + "rewards/margins": 4.78125, + "rewards/rejected": -3.34375, + "step": 238 + }, + { + "epoch": 0.29325153374233126, + "grad_norm": 41.04109475522015, + "learning_rate": 4.5578512396694213e-07, + "logits/chosen": -0.21484375, + "logits/rejected": -0.408203125, + "logps/chosen": -384.0, + "logps/rejected": -304.0, + "loss": 0.3007, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.78125, + "rewards/margins": 5.28125, + "rewards/rejected": -3.515625, + "step": 239 + }, + { + "epoch": 0.294478527607362, + "grad_norm": 42.47439204624692, + "learning_rate": 4.555785123966942e-07, + "logits/chosen": -0.2265625, + "logits/rejected": -0.380859375, + "logps/chosen": -422.0, + "logps/rejected": -352.0, + "loss": 0.2516, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.6171875, + "rewards/margins": 5.46875, + "rewards/rejected": -3.859375, + "step": 240 + }, + { + "epoch": 0.29570552147239265, + "grad_norm": 38.63581064698526, + "learning_rate": 4.553719008264463e-07, + "logits/chosen": -0.169921875, + "logits/rejected": -0.306640625, + "logps/chosen": -366.0, + "logps/rejected": -326.0, + "loss": 0.2718, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.7109375, + "rewards/margins": 5.21875, + "rewards/rejected": -3.5, + "step": 241 + }, + { + "epoch": 0.2969325153374233, + "grad_norm": 31.580876023766372, + "learning_rate": 4.551652892561983e-07, + "logits/chosen": -0.1826171875, + "logits/rejected": -0.349609375, + "logps/chosen": -350.0, + "logps/rejected": -310.0, + "loss": 0.2369, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.171875, + "rewards/margins": 5.21875, + "rewards/rejected": -4.03125, + "step": 242 + }, + { + "epoch": 0.298159509202454, + "grad_norm": 38.48835239358082, + "learning_rate": 4.5495867768595037e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.4140625, + "logps/chosen": -392.0, + "logps/rejected": -358.0, + "loss": 0.2935, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.1171875, + "rewards/margins": 4.78125, + "rewards/rejected": -3.671875, + "step": 243 + }, + { + "epoch": 0.29938650306748466, + "grad_norm": 41.633020456629765, + "learning_rate": 4.547520661157024e-07, + "logits/chosen": -0.25390625, + "logits/rejected": -0.47265625, + "logps/chosen": -386.0, + "logps/rejected": -340.0, + "loss": 0.3582, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.140625, + "rewards/margins": 4.65625, + "rewards/rejected": -3.5, + "step": 244 + }, + { + "epoch": 0.3006134969325153, + "grad_norm": 36.05397433070667, + "learning_rate": 4.545454545454545e-07, + "logits/chosen": -0.220703125, + "logits/rejected": -0.369140625, + "logps/chosen": -404.0, + "logps/rejected": -344.0, + "loss": 0.234, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.4453125, + "rewards/margins": 5.09375, + "rewards/rejected": -3.65625, + "step": 245 + }, + { + "epoch": 0.301840490797546, + "grad_norm": 38.58934325410754, + "learning_rate": 4.5433884297520657e-07, + "logits/chosen": -0.224609375, + "logits/rejected": -0.390625, + "logps/chosen": -378.0, + "logps/rejected": -338.0, + "loss": 0.2805, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.765625, + "rewards/margins": 5.40625, + "rewards/rejected": -3.65625, + "step": 246 + }, + { + "epoch": 0.3030674846625767, + "grad_norm": 46.170807958237866, + "learning_rate": 4.5413223140495867e-07, + "logits/chosen": -0.224609375, + "logits/rejected": -0.408203125, + "logps/chosen": -376.0, + "logps/rejected": -298.0, + "loss": 0.3061, + "rewards/accuracies": 0.796875, + "rewards/chosen": 0.875, + "rewards/margins": 4.71875, + "rewards/rejected": -3.828125, + "step": 247 + }, + { + "epoch": 0.3042944785276074, + "grad_norm": 40.70518240157979, + "learning_rate": 4.539256198347107e-07, + "logits/chosen": -0.1474609375, + "logits/rejected": -0.396484375, + "logps/chosen": -394.0, + "logps/rejected": -324.0, + "loss": 0.2562, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.234375, + "rewards/margins": 4.71875, + "rewards/rejected": -3.46875, + "step": 248 + }, + { + "epoch": 0.30552147239263805, + "grad_norm": 43.152905506219625, + "learning_rate": 4.537190082644628e-07, + "logits/chosen": -0.26953125, + "logits/rejected": -0.466796875, + "logps/chosen": -480.0, + "logps/rejected": -362.0, + "loss": 0.274, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.9375, + "rewards/margins": 5.5625, + "rewards/rejected": -3.625, + "step": 249 + }, + { + "epoch": 0.3067484662576687, + "grad_norm": 39.51182461700564, + "learning_rate": 4.5351239669421486e-07, + "logits/chosen": -0.349609375, + "logits/rejected": -0.423828125, + "logps/chosen": -342.0, + "logps/rejected": -316.0, + "loss": 0.2913, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.97265625, + "rewards/margins": 4.59375, + "rewards/rejected": -3.625, + "step": 250 + }, + { + "epoch": 0.3079754601226994, + "grad_norm": 47.42800586657486, + "learning_rate": 4.5330578512396696e-07, + "logits/chosen": -0.055908203125, + "logits/rejected": -0.228515625, + "logps/chosen": -378.0, + "logps/rejected": -298.0, + "loss": 0.3574, + "rewards/accuracies": 0.765625, + "rewards/chosen": 1.1171875, + "rewards/margins": 4.1875, + "rewards/rejected": -3.046875, + "step": 251 + }, + { + "epoch": 0.30920245398773005, + "grad_norm": 38.9167492571078, + "learning_rate": 4.5309917355371896e-07, + "logits/chosen": -0.2216796875, + "logits/rejected": -0.37109375, + "logps/chosen": -396.0, + "logps/rejected": -304.0, + "loss": 0.2806, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.5078125, + "rewards/margins": 4.75, + "rewards/rejected": -3.234375, + "step": 252 + }, + { + "epoch": 0.3104294478527607, + "grad_norm": 31.88015147725951, + "learning_rate": 4.5289256198347106e-07, + "logits/chosen": -0.22265625, + "logits/rejected": -0.453125, + "logps/chosen": -340.0, + "logps/rejected": -288.0, + "loss": 0.2435, + "rewards/accuracies": 0.90625, + "rewards/chosen": 1.109375, + "rewards/margins": 4.78125, + "rewards/rejected": -3.6875, + "step": 253 + }, + { + "epoch": 0.3116564417177914, + "grad_norm": 41.38320327055996, + "learning_rate": 4.526859504132231e-07, + "logits/chosen": -0.166015625, + "logits/rejected": -0.328125, + "logps/chosen": -356.0, + "logps/rejected": -312.0, + "loss": 0.3288, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.3515625, + "rewards/margins": 4.84375, + "rewards/rejected": -3.46875, + "step": 254 + }, + { + "epoch": 0.3128834355828221, + "grad_norm": 39.369898300453734, + "learning_rate": 4.524793388429752e-07, + "logits/chosen": -0.1572265625, + "logits/rejected": -0.318359375, + "logps/chosen": -386.0, + "logps/rejected": -304.0, + "loss": 0.3362, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.5625, + "rewards/margins": 4.59375, + "rewards/rejected": -3.046875, + "step": 255 + }, + { + "epoch": 0.3141104294478528, + "grad_norm": 32.76851278241994, + "learning_rate": 4.5227272727272725e-07, + "logits/chosen": -0.20703125, + "logits/rejected": -0.376953125, + "logps/chosen": -350.0, + "logps/rejected": -304.0, + "loss": 0.2341, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.9765625, + "rewards/margins": 5.40625, + "rewards/rejected": -3.4375, + "step": 256 + }, + { + "epoch": 0.31533742331288345, + "grad_norm": 45.250746891569236, + "learning_rate": 4.520661157024793e-07, + "logits/chosen": -0.2080078125, + "logits/rejected": -0.359375, + "logps/chosen": -430.0, + "logps/rejected": -344.0, + "loss": 0.3181, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.7734375, + "rewards/margins": 4.875, + "rewards/rejected": -3.109375, + "step": 257 + }, + { + "epoch": 0.3165644171779141, + "grad_norm": 35.04986410208359, + "learning_rate": 4.518595041322314e-07, + "logits/chosen": -0.1552734375, + "logits/rejected": -0.33984375, + "logps/chosen": -400.0, + "logps/rejected": -326.0, + "loss": 0.2317, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.59375, + "rewards/margins": 4.90625, + "rewards/rejected": -3.296875, + "step": 258 + }, + { + "epoch": 0.3177914110429448, + "grad_norm": 34.37988001182442, + "learning_rate": 4.5165289256198344e-07, + "logits/chosen": -0.2099609375, + "logits/rejected": -0.404296875, + "logps/chosen": -346.0, + "logps/rejected": -338.0, + "loss": 0.2627, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.1953125, + "rewards/margins": 4.625, + "rewards/rejected": -3.40625, + "step": 259 + }, + { + "epoch": 0.31901840490797545, + "grad_norm": 39.73259510340199, + "learning_rate": 4.5144628099173554e-07, + "logits/chosen": -0.2353515625, + "logits/rejected": -0.326171875, + "logps/chosen": -388.0, + "logps/rejected": -306.0, + "loss": 0.2938, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.375, + "rewards/margins": 4.53125, + "rewards/rejected": -3.171875, + "step": 260 + }, + { + "epoch": 0.3202453987730061, + "grad_norm": 42.63140351827292, + "learning_rate": 4.5123966942148754e-07, + "logits/chosen": -0.1708984375, + "logits/rejected": -0.322265625, + "logps/chosen": -378.0, + "logps/rejected": -308.0, + "loss": 0.2956, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.4453125, + "rewards/margins": 4.65625, + "rewards/rejected": -3.203125, + "step": 261 + }, + { + "epoch": 0.3214723926380368, + "grad_norm": 48.00556286038852, + "learning_rate": 4.5103305785123964e-07, + "logits/chosen": -0.2109375, + "logits/rejected": -0.40234375, + "logps/chosen": -384.0, + "logps/rejected": -320.0, + "loss": 0.3166, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.9609375, + "rewards/margins": 5.03125, + "rewards/rejected": -3.0625, + "step": 262 + }, + { + "epoch": 0.3226993865030675, + "grad_norm": 41.40798456165999, + "learning_rate": 4.508264462809917e-07, + "logits/chosen": -0.197265625, + "logits/rejected": -0.32421875, + "logps/chosen": -366.0, + "logps/rejected": -302.0, + "loss": 0.2953, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.125, + "rewards/margins": 4.03125, + "rewards/rejected": -2.921875, + "step": 263 + }, + { + "epoch": 0.3239263803680982, + "grad_norm": 39.73351721310888, + "learning_rate": 4.506198347107438e-07, + "logits/chosen": -0.1611328125, + "logits/rejected": -0.275390625, + "logps/chosen": -350.0, + "logps/rejected": -286.0, + "loss": 0.3138, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.3359375, + "rewards/margins": 4.3125, + "rewards/rejected": -2.96875, + "step": 264 + }, + { + "epoch": 0.32515337423312884, + "grad_norm": 39.72934408632108, + "learning_rate": 4.5041322314049583e-07, + "logits/chosen": -0.166015625, + "logits/rejected": -0.326171875, + "logps/chosen": -354.0, + "logps/rejected": -262.0, + "loss": 0.2712, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.3359375, + "rewards/margins": 4.53125, + "rewards/rejected": -3.1875, + "step": 265 + }, + { + "epoch": 0.3263803680981595, + "grad_norm": 47.72732688002189, + "learning_rate": 4.5020661157024793e-07, + "logits/chosen": -0.142578125, + "logits/rejected": -0.291015625, + "logps/chosen": -316.0, + "logps/rejected": -290.0, + "loss": 0.3794, + "rewards/accuracies": 0.7734375, + "rewards/chosen": 0.64453125, + "rewards/margins": 3.625, + "rewards/rejected": -2.984375, + "step": 266 + }, + { + "epoch": 0.3276073619631902, + "grad_norm": 52.825089270201424, + "learning_rate": 4.5e-07, + "logits/chosen": -0.16796875, + "logits/rejected": -0.384765625, + "logps/chosen": -400.0, + "logps/rejected": -294.0, + "loss": 0.3429, + "rewards/accuracies": 0.796875, + "rewards/chosen": 1.6796875, + "rewards/margins": 4.40625, + "rewards/rejected": -2.734375, + "step": 267 + }, + { + "epoch": 0.32883435582822085, + "grad_norm": 35.92749837261359, + "learning_rate": 4.497933884297521e-07, + "logits/chosen": -0.306640625, + "logits/rejected": -0.419921875, + "logps/chosen": -384.0, + "logps/rejected": -308.0, + "loss": 0.2275, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.5078125, + "rewards/margins": 4.625, + "rewards/rejected": -3.109375, + "step": 268 + }, + { + "epoch": 0.3300613496932515, + "grad_norm": 35.81499005195925, + "learning_rate": 4.4958677685950413e-07, + "logits/chosen": -0.203125, + "logits/rejected": -0.50390625, + "logps/chosen": -402.0, + "logps/rejected": -290.0, + "loss": 0.2385, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.6796875, + "rewards/margins": 4.90625, + "rewards/rejected": -3.25, + "step": 269 + }, + { + "epoch": 0.3312883435582822, + "grad_norm": 44.38655671717473, + "learning_rate": 4.493801652892562e-07, + "logits/chosen": -0.2109375, + "logits/rejected": -0.328125, + "logps/chosen": -326.0, + "logps/rejected": -282.0, + "loss": 0.345, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.15625, + "rewards/margins": 3.71875, + "rewards/rejected": -2.5625, + "step": 270 + }, + { + "epoch": 0.3325153374233129, + "grad_norm": 34.101391505637224, + "learning_rate": 4.491735537190082e-07, + "logits/chosen": -0.22265625, + "logits/rejected": -0.341796875, + "logps/chosen": -384.0, + "logps/rejected": -312.0, + "loss": 0.2456, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 2.078125, + "rewards/margins": 4.875, + "rewards/rejected": -2.796875, + "step": 271 + }, + { + "epoch": 0.3337423312883436, + "grad_norm": 36.8738947032395, + "learning_rate": 4.489669421487603e-07, + "logits/chosen": -0.12353515625, + "logits/rejected": -0.291015625, + "logps/chosen": -358.0, + "logps/rejected": -284.0, + "loss": 0.2495, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.25, + "rewards/margins": 4.21875, + "rewards/rejected": -2.984375, + "step": 272 + }, + { + "epoch": 0.33496932515337424, + "grad_norm": 44.70898948794442, + "learning_rate": 4.4876033057851237e-07, + "logits/chosen": -0.07470703125, + "logits/rejected": -0.1611328125, + "logps/chosen": -334.0, + "logps/rejected": -286.0, + "loss": 0.3884, + "rewards/accuracies": 0.78125, + "rewards/chosen": 1.1796875, + "rewards/margins": 3.90625, + "rewards/rejected": -2.734375, + "step": 273 + }, + { + "epoch": 0.3361963190184049, + "grad_norm": 42.40600245146773, + "learning_rate": 4.4855371900826447e-07, + "logits/chosen": -0.0927734375, + "logits/rejected": -0.2421875, + "logps/chosen": -400.0, + "logps/rejected": -316.0, + "loss": 0.3338, + "rewards/accuracies": 0.796875, + "rewards/chosen": 1.8046875, + "rewards/margins": 4.28125, + "rewards/rejected": -2.484375, + "step": 274 + }, + { + "epoch": 0.3374233128834356, + "grad_norm": 40.8103963168886, + "learning_rate": 4.483471074380165e-07, + "logits/chosen": -0.1552734375, + "logits/rejected": -0.263671875, + "logps/chosen": -316.0, + "logps/rejected": -296.0, + "loss": 0.2999, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.4765625, + "rewards/margins": 4.15625, + "rewards/rejected": -2.6875, + "step": 275 + }, + { + "epoch": 0.33865030674846625, + "grad_norm": 31.049107272836952, + "learning_rate": 4.4814049586776856e-07, + "logits/chosen": -0.08154296875, + "logits/rejected": -0.291015625, + "logps/chosen": -376.0, + "logps/rejected": -298.0, + "loss": 0.2799, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.5703125, + "rewards/margins": 4.3125, + "rewards/rejected": -2.75, + "step": 276 + }, + { + "epoch": 0.3398773006134969, + "grad_norm": 32.630832893605, + "learning_rate": 4.4793388429752066e-07, + "logits/chosen": -0.244140625, + "logits/rejected": -0.443359375, + "logps/chosen": -404.0, + "logps/rejected": -312.0, + "loss": 0.2319, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 2.171875, + "rewards/margins": 5.1875, + "rewards/rejected": -3.0, + "step": 277 + }, + { + "epoch": 0.3411042944785276, + "grad_norm": 44.309610437735856, + "learning_rate": 4.477272727272727e-07, + "logits/chosen": -0.1689453125, + "logits/rejected": -0.2373046875, + "logps/chosen": -376.0, + "logps/rejected": -328.0, + "loss": 0.2724, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.640625, + "rewards/margins": 4.46875, + "rewards/rejected": -2.828125, + "step": 278 + }, + { + "epoch": 0.3423312883435583, + "grad_norm": 26.353655721882397, + "learning_rate": 4.4752066115702476e-07, + "logits/chosen": -0.21484375, + "logits/rejected": -0.400390625, + "logps/chosen": -380.0, + "logps/rejected": -290.0, + "loss": 0.1863, + "rewards/accuracies": 0.9453125, + "rewards/chosen": 1.7578125, + "rewards/margins": 4.96875, + "rewards/rejected": -3.21875, + "step": 279 + }, + { + "epoch": 0.34355828220858897, + "grad_norm": 44.718053283042785, + "learning_rate": 4.473140495867768e-07, + "logits/chosen": -0.2001953125, + "logits/rejected": -0.365234375, + "logps/chosen": -396.0, + "logps/rejected": -342.0, + "loss": 0.3351, + "rewards/accuracies": 0.7734375, + "rewards/chosen": 1.953125, + "rewards/margins": 5.125, + "rewards/rejected": -3.171875, + "step": 280 + }, + { + "epoch": 0.34478527607361964, + "grad_norm": 42.34591075354157, + "learning_rate": 4.471074380165289e-07, + "logits/chosen": -0.1484375, + "logits/rejected": -0.34765625, + "logps/chosen": -374.0, + "logps/rejected": -306.0, + "loss": 0.3447, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.4375, + "rewards/margins": 4.125, + "rewards/rejected": -2.6875, + "step": 281 + }, + { + "epoch": 0.3460122699386503, + "grad_norm": 41.75221231669429, + "learning_rate": 4.4690082644628095e-07, + "logits/chosen": -0.30859375, + "logits/rejected": -0.46875, + "logps/chosen": -336.0, + "logps/rejected": -298.0, + "loss": 0.2518, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.71875, + "rewards/margins": 5.25, + "rewards/rejected": -3.515625, + "step": 282 + }, + { + "epoch": 0.347239263803681, + "grad_norm": 33.916128769423274, + "learning_rate": 4.4669421487603305e-07, + "logits/chosen": -0.3359375, + "logits/rejected": -0.44921875, + "logps/chosen": -348.0, + "logps/rejected": -274.0, + "loss": 0.2746, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.3203125, + "rewards/margins": 4.375, + "rewards/rejected": -3.046875, + "step": 283 + }, + { + "epoch": 0.34846625766871164, + "grad_norm": 35.84425714657199, + "learning_rate": 4.464876033057851e-07, + "logits/chosen": -0.1572265625, + "logits/rejected": -0.3046875, + "logps/chosen": -364.0, + "logps/rejected": -294.0, + "loss": 0.2426, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.484375, + "rewards/margins": 4.78125, + "rewards/rejected": -3.296875, + "step": 284 + }, + { + "epoch": 0.3496932515337423, + "grad_norm": 31.897221284753925, + "learning_rate": 4.462809917355372e-07, + "logits/chosen": -0.2373046875, + "logits/rejected": -0.453125, + "logps/chosen": -354.0, + "logps/rejected": -304.0, + "loss": 0.2458, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.5078125, + "rewards/margins": 5.03125, + "rewards/rejected": -3.515625, + "step": 285 + }, + { + "epoch": 0.350920245398773, + "grad_norm": 40.0301906925459, + "learning_rate": 4.4607438016528924e-07, + "logits/chosen": -0.1708984375, + "logits/rejected": -0.3828125, + "logps/chosen": -414.0, + "logps/rejected": -332.0, + "loss": 0.3071, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.5234375, + "rewards/margins": 5.21875, + "rewards/rejected": -3.703125, + "step": 286 + }, + { + "epoch": 0.3521472392638037, + "grad_norm": 50.881866049082234, + "learning_rate": 4.4586776859504135e-07, + "logits/chosen": -0.26171875, + "logits/rejected": -0.419921875, + "logps/chosen": -376.0, + "logps/rejected": -308.0, + "loss": 0.288, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.0703125, + "rewards/margins": 4.625, + "rewards/rejected": -3.546875, + "step": 287 + }, + { + "epoch": 0.35337423312883437, + "grad_norm": 37.27905667507029, + "learning_rate": 4.4566115702479334e-07, + "logits/chosen": -0.08642578125, + "logits/rejected": -0.2392578125, + "logps/chosen": -380.0, + "logps/rejected": -312.0, + "loss": 0.2887, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.99609375, + "rewards/margins": 4.25, + "rewards/rejected": -3.265625, + "step": 288 + }, + { + "epoch": 0.35460122699386504, + "grad_norm": 38.51669077378738, + "learning_rate": 4.4545454545454544e-07, + "logits/chosen": -0.2158203125, + "logits/rejected": -0.357421875, + "logps/chosen": -398.0, + "logps/rejected": -302.0, + "loss": 0.2274, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.484375, + "rewards/margins": 5.4375, + "rewards/rejected": -3.9375, + "step": 289 + }, + { + "epoch": 0.3558282208588957, + "grad_norm": 39.101756003947045, + "learning_rate": 4.452479338842975e-07, + "logits/chosen": -0.3828125, + "logits/rejected": -0.53125, + "logps/chosen": -372.0, + "logps/rejected": -324.0, + "loss": 0.197, + "rewards/accuracies": 0.921875, + "rewards/chosen": 1.375, + "rewards/margins": 5.65625, + "rewards/rejected": -4.28125, + "step": 290 + }, + { + "epoch": 0.3570552147239264, + "grad_norm": 35.84563757340601, + "learning_rate": 4.450413223140496e-07, + "logits/chosen": -0.3125, + "logits/rejected": -0.44921875, + "logps/chosen": -390.0, + "logps/rejected": -320.0, + "loss": 0.264, + "rewards/accuracies": 0.828125, + "rewards/chosen": 2.03125, + "rewards/margins": 5.5625, + "rewards/rejected": -3.515625, + "step": 291 + }, + { + "epoch": 0.35828220858895704, + "grad_norm": 48.83799779484981, + "learning_rate": 4.4483471074380163e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.5078125, + "logps/chosen": -402.0, + "logps/rejected": -324.0, + "loss": 0.2282, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.15625, + "rewards/margins": 5.125, + "rewards/rejected": -3.96875, + "step": 292 + }, + { + "epoch": 0.3595092024539877, + "grad_norm": 33.24417072591366, + "learning_rate": 4.446280991735537e-07, + "logits/chosen": -0.2080078125, + "logits/rejected": -0.400390625, + "logps/chosen": -376.0, + "logps/rejected": -306.0, + "loss": 0.236, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 0.74609375, + "rewards/margins": 4.90625, + "rewards/rejected": -4.15625, + "step": 293 + }, + { + "epoch": 0.36073619631901843, + "grad_norm": 33.17016716719111, + "learning_rate": 4.444214876033058e-07, + "logits/chosen": -0.443359375, + "logits/rejected": -0.59765625, + "logps/chosen": -464.0, + "logps/rejected": -342.0, + "loss": 0.2358, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.3828125, + "rewards/margins": 5.84375, + "rewards/rejected": -4.46875, + "step": 294 + }, + { + "epoch": 0.3619631901840491, + "grad_norm": 41.08997488080215, + "learning_rate": 4.4421487603305783e-07, + "logits/chosen": -0.1689453125, + "logits/rejected": -0.3203125, + "logps/chosen": -350.0, + "logps/rejected": -308.0, + "loss": 0.2229, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.81640625, + "rewards/margins": 5.0, + "rewards/rejected": -4.1875, + "step": 295 + }, + { + "epoch": 0.36319018404907977, + "grad_norm": 36.46585175010118, + "learning_rate": 4.4400826446280993e-07, + "logits/chosen": -0.14453125, + "logits/rejected": -0.30859375, + "logps/chosen": -418.0, + "logps/rejected": -320.0, + "loss": 0.2845, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.421875, + "rewards/margins": 5.03125, + "rewards/rejected": -3.609375, + "step": 296 + }, + { + "epoch": 0.36441717791411044, + "grad_norm": 30.507553736995185, + "learning_rate": 4.438016528925619e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.447265625, + "logps/chosen": -356.0, + "logps/rejected": -300.0, + "loss": 0.2352, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.203125, + "rewards/margins": 5.125, + "rewards/rejected": -3.9375, + "step": 297 + }, + { + "epoch": 0.3656441717791411, + "grad_norm": 42.744426202574054, + "learning_rate": 4.43595041322314e-07, + "logits/chosen": -0.1513671875, + "logits/rejected": -0.2578125, + "logps/chosen": -380.0, + "logps/rejected": -316.0, + "loss": 0.2875, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.9609375, + "rewards/margins": 4.53125, + "rewards/rejected": -3.5625, + "step": 298 + }, + { + "epoch": 0.36687116564417177, + "grad_norm": 57.11420288456295, + "learning_rate": 4.4338842975206607e-07, + "logits/chosen": -0.189453125, + "logits/rejected": -0.3671875, + "logps/chosen": -392.0, + "logps/rejected": -312.0, + "loss": 0.3303, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.53515625, + "rewards/margins": 4.40625, + "rewards/rejected": -3.859375, + "step": 299 + }, + { + "epoch": 0.36809815950920244, + "grad_norm": 44.0642342343628, + "learning_rate": 4.4318181818181817e-07, + "logits/chosen": -0.2890625, + "logits/rejected": -0.451171875, + "logps/chosen": -364.0, + "logps/rejected": -306.0, + "loss": 0.2951, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.1328125, + "rewards/margins": 5.15625, + "rewards/rejected": -4.03125, + "step": 300 + }, + { + "epoch": 0.3693251533742331, + "grad_norm": 36.50971474693751, + "learning_rate": 4.429752066115702e-07, + "logits/chosen": -0.2314453125, + "logits/rejected": -0.4296875, + "logps/chosen": -454.0, + "logps/rejected": -362.0, + "loss": 0.2791, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.546875, + "rewards/margins": 5.53125, + "rewards/rejected": -3.984375, + "step": 301 + }, + { + "epoch": 0.37055214723926383, + "grad_norm": 31.988576378738134, + "learning_rate": 4.427685950413223e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.46875, + "logps/chosen": -374.0, + "logps/rejected": -292.0, + "loss": 0.2208, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.0859375, + "rewards/margins": 5.0625, + "rewards/rejected": -3.984375, + "step": 302 + }, + { + "epoch": 0.3717791411042945, + "grad_norm": 46.63040649021854, + "learning_rate": 4.4256198347107436e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.390625, + "logps/chosen": -378.0, + "logps/rejected": -350.0, + "loss": 0.3215, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.625, + "rewards/margins": 4.75, + "rewards/rejected": -4.125, + "step": 303 + }, + { + "epoch": 0.37300613496932516, + "grad_norm": 38.26286144297621, + "learning_rate": 4.4235537190082646e-07, + "logits/chosen": -0.162109375, + "logits/rejected": -0.412109375, + "logps/chosen": -384.0, + "logps/rejected": -306.0, + "loss": 0.244, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.109375, + "rewards/margins": 5.28125, + "rewards/rejected": -4.15625, + "step": 304 + }, + { + "epoch": 0.37423312883435583, + "grad_norm": 36.3552235356213, + "learning_rate": 4.421487603305785e-07, + "logits/chosen": -0.2392578125, + "logits/rejected": -0.38671875, + "logps/chosen": -404.0, + "logps/rejected": -312.0, + "loss": 0.2568, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.4140625, + "rewards/margins": 5.625, + "rewards/rejected": -4.21875, + "step": 305 + }, + { + "epoch": 0.3754601226993865, + "grad_norm": 40.279423014087726, + "learning_rate": 4.4194214876033056e-07, + "logits/chosen": -0.322265625, + "logits/rejected": -0.484375, + "logps/chosen": -416.0, + "logps/rejected": -334.0, + "loss": 0.2584, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.1171875, + "rewards/margins": 5.0, + "rewards/rejected": -3.890625, + "step": 306 + }, + { + "epoch": 0.37668711656441717, + "grad_norm": 39.63802917296688, + "learning_rate": 4.417355371900826e-07, + "logits/chosen": -0.1884765625, + "logits/rejected": -0.333984375, + "logps/chosen": -368.0, + "logps/rejected": -314.0, + "loss": 0.3214, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.2578125, + "rewards/margins": 5.25, + "rewards/rejected": -4.0, + "step": 307 + }, + { + "epoch": 0.37791411042944784, + "grad_norm": 38.40390766672212, + "learning_rate": 4.415289256198347e-07, + "logits/chosen": -0.1513671875, + "logits/rejected": -0.3125, + "logps/chosen": -384.0, + "logps/rejected": -328.0, + "loss": 0.3262, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.95703125, + "rewards/margins": 4.28125, + "rewards/rejected": -3.3125, + "step": 308 + }, + { + "epoch": 0.3791411042944785, + "grad_norm": 32.4379821627175, + "learning_rate": 4.4132231404958675e-07, + "logits/chosen": -0.3046875, + "logits/rejected": -0.419921875, + "logps/chosen": -378.0, + "logps/rejected": -326.0, + "loss": 0.2098, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.625, + "rewards/margins": 5.6875, + "rewards/rejected": -4.03125, + "step": 309 + }, + { + "epoch": 0.3803680981595092, + "grad_norm": 40.47301853181884, + "learning_rate": 4.411157024793388e-07, + "logits/chosen": -0.107421875, + "logits/rejected": -0.205078125, + "logps/chosen": -310.0, + "logps/rejected": -284.0, + "loss": 0.3181, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.32421875, + "rewards/margins": 4.0, + "rewards/rejected": -3.6875, + "step": 310 + }, + { + "epoch": 0.3815950920245399, + "grad_norm": 33.919361023276416, + "learning_rate": 4.409090909090909e-07, + "logits/chosen": -0.267578125, + "logits/rejected": -0.443359375, + "logps/chosen": -382.0, + "logps/rejected": -316.0, + "loss": 0.2306, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.5625, + "rewards/margins": 5.6875, + "rewards/rejected": -4.125, + "step": 311 + }, + { + "epoch": 0.38282208588957056, + "grad_norm": 48.72311046374392, + "learning_rate": 4.4070247933884295e-07, + "logits/chosen": -0.1376953125, + "logits/rejected": -0.2734375, + "logps/chosen": -382.0, + "logps/rejected": -350.0, + "loss": 0.3689, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.1953125, + "rewards/margins": 4.59375, + "rewards/rejected": -3.40625, + "step": 312 + }, + { + "epoch": 0.38404907975460123, + "grad_norm": 32.93519257063822, + "learning_rate": 4.4049586776859505e-07, + "logits/chosen": -0.134765625, + "logits/rejected": -0.41015625, + "logps/chosen": -400.0, + "logps/rejected": -342.0, + "loss": 0.2417, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 2.171875, + "rewards/margins": 6.09375, + "rewards/rejected": -3.90625, + "step": 313 + }, + { + "epoch": 0.3852760736196319, + "grad_norm": 29.761092790659628, + "learning_rate": 4.402892561983471e-07, + "logits/chosen": -0.1689453125, + "logits/rejected": -0.359375, + "logps/chosen": -454.0, + "logps/rejected": -330.0, + "loss": 0.1846, + "rewards/accuracies": 0.890625, + "rewards/chosen": 2.515625, + "rewards/margins": 6.71875, + "rewards/rejected": -4.1875, + "step": 314 + }, + { + "epoch": 0.38650306748466257, + "grad_norm": 33.15936964822026, + "learning_rate": 4.4008264462809914e-07, + "logits/chosen": -0.06982421875, + "logits/rejected": -0.259765625, + "logps/chosen": -342.0, + "logps/rejected": -274.0, + "loss": 0.2307, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.0078125, + "rewards/margins": 4.875, + "rewards/rejected": -3.859375, + "step": 315 + }, + { + "epoch": 0.38773006134969323, + "grad_norm": 30.385645470245766, + "learning_rate": 4.398760330578512e-07, + "logits/chosen": -0.07666015625, + "logits/rejected": -0.2197265625, + "logps/chosen": -354.0, + "logps/rejected": -280.0, + "loss": 0.2284, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.2890625, + "rewards/margins": 5.375, + "rewards/rejected": -4.09375, + "step": 316 + }, + { + "epoch": 0.3889570552147239, + "grad_norm": 34.30838449187616, + "learning_rate": 4.396694214876033e-07, + "logits/chosen": -0.1982421875, + "logits/rejected": -0.4140625, + "logps/chosen": -394.0, + "logps/rejected": -342.0, + "loss": 0.2337, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.46875, + "rewards/margins": 5.90625, + "rewards/rejected": -4.4375, + "step": 317 + }, + { + "epoch": 0.3901840490797546, + "grad_norm": 43.51216041497958, + "learning_rate": 4.3946280991735533e-07, + "logits/chosen": -0.2431640625, + "logits/rejected": -0.41015625, + "logps/chosen": -398.0, + "logps/rejected": -340.0, + "loss": 0.3148, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.4140625, + "rewards/margins": 5.03125, + "rewards/rejected": -3.625, + "step": 318 + }, + { + "epoch": 0.3914110429447853, + "grad_norm": 23.822105871778678, + "learning_rate": 4.3925619834710743e-07, + "logits/chosen": -0.1689453125, + "logits/rejected": -0.359375, + "logps/chosen": -410.0, + "logps/rejected": -292.0, + "loss": 0.157, + "rewards/accuracies": 0.90625, + "rewards/chosen": 1.59375, + "rewards/margins": 6.34375, + "rewards/rejected": -4.75, + "step": 319 + }, + { + "epoch": 0.39263803680981596, + "grad_norm": 37.656689387782905, + "learning_rate": 4.390495867768595e-07, + "logits/chosen": -0.1806640625, + "logits/rejected": -0.291015625, + "logps/chosen": -316.0, + "logps/rejected": -262.0, + "loss": 0.2576, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.8046875, + "rewards/margins": 5.03125, + "rewards/rejected": -4.21875, + "step": 320 + }, + { + "epoch": 0.39386503067484663, + "grad_norm": 47.198644192326896, + "learning_rate": 4.388429752066116e-07, + "logits/chosen": -0.287109375, + "logits/rejected": -0.4609375, + "logps/chosen": -404.0, + "logps/rejected": -372.0, + "loss": 0.2837, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.03125, + "rewards/margins": 5.8125, + "rewards/rejected": -4.78125, + "step": 321 + }, + { + "epoch": 0.3950920245398773, + "grad_norm": 35.22081458129445, + "learning_rate": 4.3863636363636363e-07, + "logits/chosen": -0.2119140625, + "logits/rejected": -0.369140625, + "logps/chosen": -392.0, + "logps/rejected": -306.0, + "loss": 0.2397, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.5, + "rewards/margins": 5.84375, + "rewards/rejected": -4.34375, + "step": 322 + }, + { + "epoch": 0.39631901840490796, + "grad_norm": 40.535682371905, + "learning_rate": 4.3842975206611573e-07, + "logits/chosen": -0.25, + "logits/rejected": -0.38671875, + "logps/chosen": -350.0, + "logps/rejected": -316.0, + "loss": 0.3459, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.9453125, + "rewards/margins": 4.5625, + "rewards/rejected": -3.609375, + "step": 323 + }, + { + "epoch": 0.39754601226993863, + "grad_norm": 34.724438451994665, + "learning_rate": 4.382231404958677e-07, + "logits/chosen": -0.283203125, + "logits/rejected": -0.453125, + "logps/chosen": -354.0, + "logps/rejected": -306.0, + "loss": 0.2659, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.8671875, + "rewards/margins": 5.46875, + "rewards/rejected": -4.59375, + "step": 324 + }, + { + "epoch": 0.3987730061349693, + "grad_norm": 47.440215471486304, + "learning_rate": 4.380165289256198e-07, + "logits/chosen": -0.14453125, + "logits/rejected": -0.228515625, + "logps/chosen": -328.0, + "logps/rejected": -284.0, + "loss": 0.383, + "rewards/accuracies": 0.796875, + "rewards/chosen": 0.53515625, + "rewards/margins": 4.5, + "rewards/rejected": -3.96875, + "step": 325 + }, + { + "epoch": 0.4, + "grad_norm": 36.66273937163835, + "learning_rate": 4.3780991735537187e-07, + "logits/chosen": -0.31640625, + "logits/rejected": -0.462890625, + "logps/chosen": -398.0, + "logps/rejected": -350.0, + "loss": 0.2043, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.7265625, + "rewards/margins": 6.21875, + "rewards/rejected": -4.46875, + "step": 326 + }, + { + "epoch": 0.4012269938650307, + "grad_norm": 51.442585409024396, + "learning_rate": 4.3760330578512397e-07, + "logits/chosen": -0.2119140625, + "logits/rejected": -0.390625, + "logps/chosen": -428.0, + "logps/rejected": -334.0, + "loss": 0.3681, + "rewards/accuracies": 0.796875, + "rewards/chosen": 1.2265625, + "rewards/margins": 4.65625, + "rewards/rejected": -3.4375, + "step": 327 + }, + { + "epoch": 0.40245398773006136, + "grad_norm": 44.606600240172085, + "learning_rate": 4.37396694214876e-07, + "logits/chosen": -0.2431640625, + "logits/rejected": -0.376953125, + "logps/chosen": -360.0, + "logps/rejected": -268.0, + "loss": 0.3204, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.59375, + "rewards/margins": 4.59375, + "rewards/rejected": -4.0, + "step": 328 + }, + { + "epoch": 0.403680981595092, + "grad_norm": 36.3592106715033, + "learning_rate": 4.3719008264462806e-07, + "logits/chosen": -0.1884765625, + "logits/rejected": -0.396484375, + "logps/chosen": -458.0, + "logps/rejected": -358.0, + "loss": 0.2828, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.765625, + "rewards/margins": 6.28125, + "rewards/rejected": -4.5, + "step": 329 + }, + { + "epoch": 0.4049079754601227, + "grad_norm": 36.0973250750226, + "learning_rate": 4.3698347107438016e-07, + "logits/chosen": -0.318359375, + "logits/rejected": -0.52734375, + "logps/chosen": -412.0, + "logps/rejected": -326.0, + "loss": 0.2257, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.609375, + "rewards/margins": 6.125, + "rewards/rejected": -4.53125, + "step": 330 + }, + { + "epoch": 0.40613496932515336, + "grad_norm": 35.83835721797351, + "learning_rate": 4.367768595041322e-07, + "logits/chosen": -0.2890625, + "logits/rejected": -0.40234375, + "logps/chosen": -404.0, + "logps/rejected": -334.0, + "loss": 0.2402, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.59375, + "rewards/margins": 5.75, + "rewards/rejected": -4.15625, + "step": 331 + }, + { + "epoch": 0.40736196319018403, + "grad_norm": 29.00587176168557, + "learning_rate": 4.3657024793388426e-07, + "logits/chosen": -0.29296875, + "logits/rejected": -0.482421875, + "logps/chosen": -424.0, + "logps/rejected": -308.0, + "loss": 0.2051, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.703125, + "rewards/margins": 6.03125, + "rewards/rejected": -4.3125, + "step": 332 + }, + { + "epoch": 0.4085889570552147, + "grad_norm": 37.2793403072948, + "learning_rate": 4.363636363636363e-07, + "logits/chosen": -0.12158203125, + "logits/rejected": -0.251953125, + "logps/chosen": -364.0, + "logps/rejected": -322.0, + "loss": 0.2787, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.265625, + "rewards/margins": 4.96875, + "rewards/rejected": -3.6875, + "step": 333 + }, + { + "epoch": 0.4098159509202454, + "grad_norm": 37.233291436969324, + "learning_rate": 4.361570247933884e-07, + "logits/chosen": -0.2255859375, + "logits/rejected": -0.4609375, + "logps/chosen": -372.0, + "logps/rejected": -336.0, + "loss": 0.263, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.40625, + "rewards/margins": 5.78125, + "rewards/rejected": -4.375, + "step": 334 + }, + { + "epoch": 0.4110429447852761, + "grad_norm": 40.307147676871146, + "learning_rate": 4.3595041322314045e-07, + "logits/chosen": -0.162109375, + "logits/rejected": -0.408203125, + "logps/chosen": -424.0, + "logps/rejected": -304.0, + "loss": 0.2393, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.109375, + "rewards/margins": 5.03125, + "rewards/rejected": -3.9375, + "step": 335 + }, + { + "epoch": 0.41226993865030676, + "grad_norm": 35.98003323778127, + "learning_rate": 4.3574380165289255e-07, + "logits/chosen": -0.3046875, + "logits/rejected": -0.45703125, + "logps/chosen": -392.0, + "logps/rejected": -324.0, + "loss": 0.2573, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.265625, + "rewards/margins": 5.3125, + "rewards/rejected": -4.03125, + "step": 336 + }, + { + "epoch": 0.4134969325153374, + "grad_norm": 47.71731749469287, + "learning_rate": 4.355371900826446e-07, + "logits/chosen": -0.10595703125, + "logits/rejected": -0.275390625, + "logps/chosen": -348.0, + "logps/rejected": -322.0, + "loss": 0.3291, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.1484375, + "rewards/margins": 4.96875, + "rewards/rejected": -3.828125, + "step": 337 + }, + { + "epoch": 0.4147239263803681, + "grad_norm": 40.237231718518984, + "learning_rate": 4.353305785123967e-07, + "logits/chosen": -0.1484375, + "logits/rejected": -0.302734375, + "logps/chosen": -380.0, + "logps/rejected": -324.0, + "loss": 0.3113, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.2890625, + "rewards/margins": 5.0625, + "rewards/rejected": -3.78125, + "step": 338 + }, + { + "epoch": 0.41595092024539876, + "grad_norm": 43.74604259781836, + "learning_rate": 4.3512396694214875e-07, + "logits/chosen": -0.08935546875, + "logits/rejected": -0.2275390625, + "logps/chosen": -366.0, + "logps/rejected": -318.0, + "loss": 0.3036, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.109375, + "rewards/margins": 4.90625, + "rewards/rejected": -3.796875, + "step": 339 + }, + { + "epoch": 0.4171779141104294, + "grad_norm": 40.57164499134951, + "learning_rate": 4.3491735537190085e-07, + "logits/chosen": -0.1826171875, + "logits/rejected": -0.40625, + "logps/chosen": -354.0, + "logps/rejected": -324.0, + "loss": 0.2623, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.046875, + "rewards/margins": 4.75, + "rewards/rejected": -3.703125, + "step": 340 + }, + { + "epoch": 0.41840490797546015, + "grad_norm": 35.445167805912895, + "learning_rate": 4.3471074380165284e-07, + "logits/chosen": -0.22265625, + "logits/rejected": -0.4453125, + "logps/chosen": -388.0, + "logps/rejected": -308.0, + "loss": 0.2979, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.4296875, + "rewards/margins": 5.65625, + "rewards/rejected": -4.21875, + "step": 341 + }, + { + "epoch": 0.4196319018404908, + "grad_norm": 43.283231525706334, + "learning_rate": 4.3450413223140494e-07, + "logits/chosen": -0.1865234375, + "logits/rejected": -0.2890625, + "logps/chosen": -330.0, + "logps/rejected": -296.0, + "loss": 0.3065, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.015625, + "rewards/margins": 4.71875, + "rewards/rejected": -3.703125, + "step": 342 + }, + { + "epoch": 0.4208588957055215, + "grad_norm": 41.84183041867056, + "learning_rate": 4.34297520661157e-07, + "logits/chosen": -0.2001953125, + "logits/rejected": -0.310546875, + "logps/chosen": -374.0, + "logps/rejected": -330.0, + "loss": 0.3363, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.0859375, + "rewards/margins": 4.40625, + "rewards/rejected": -3.328125, + "step": 343 + }, + { + "epoch": 0.42208588957055215, + "grad_norm": 40.634867535224096, + "learning_rate": 4.340909090909091e-07, + "logits/chosen": -0.2080078125, + "logits/rejected": -0.349609375, + "logps/chosen": -398.0, + "logps/rejected": -318.0, + "loss": 0.3062, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.0859375, + "rewards/margins": 4.625, + "rewards/rejected": -3.515625, + "step": 344 + }, + { + "epoch": 0.4233128834355828, + "grad_norm": 44.35750118248226, + "learning_rate": 4.3388429752066114e-07, + "logits/chosen": -0.1875, + "logits/rejected": -0.380859375, + "logps/chosen": -404.0, + "logps/rejected": -314.0, + "loss": 0.3386, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.3046875, + "rewards/margins": 4.96875, + "rewards/rejected": -3.671875, + "step": 345 + }, + { + "epoch": 0.4245398773006135, + "grad_norm": 39.322612546267074, + "learning_rate": 4.336776859504132e-07, + "logits/chosen": -0.1953125, + "logits/rejected": -0.3828125, + "logps/chosen": -332.0, + "logps/rejected": -280.0, + "loss": 0.3136, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.015625, + "rewards/margins": 4.5625, + "rewards/rejected": -3.546875, + "step": 346 + }, + { + "epoch": 0.42576687116564416, + "grad_norm": 30.94392895882633, + "learning_rate": 4.334710743801653e-07, + "logits/chosen": -0.2099609375, + "logits/rejected": -0.34765625, + "logps/chosen": -358.0, + "logps/rejected": -332.0, + "loss": 0.2331, + "rewards/accuracies": 0.90625, + "rewards/chosen": 1.296875, + "rewards/margins": 4.78125, + "rewards/rejected": -3.484375, + "step": 347 + }, + { + "epoch": 0.4269938650306748, + "grad_norm": 32.258435591671414, + "learning_rate": 4.3326446280991733e-07, + "logits/chosen": -0.244140625, + "logits/rejected": -0.455078125, + "logps/chosen": -410.0, + "logps/rejected": -300.0, + "loss": 0.2507, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.0625, + "rewards/margins": 5.71875, + "rewards/rejected": -4.65625, + "step": 348 + }, + { + "epoch": 0.42822085889570555, + "grad_norm": 35.47879422672426, + "learning_rate": 4.3305785123966943e-07, + "logits/chosen": -0.2412109375, + "logits/rejected": -0.38671875, + "logps/chosen": -394.0, + "logps/rejected": -296.0, + "loss": 0.2708, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.1875, + "rewards/margins": 5.4375, + "rewards/rejected": -4.25, + "step": 349 + }, + { + "epoch": 0.4294478527607362, + "grad_norm": 41.30786537567203, + "learning_rate": 4.328512396694214e-07, + "logits/chosen": -0.1103515625, + "logits/rejected": -0.3046875, + "logps/chosen": -398.0, + "logps/rejected": -292.0, + "loss": 0.2859, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.3828125, + "rewards/margins": 4.6875, + "rewards/rejected": -3.296875, + "step": 350 + }, + { + "epoch": 0.4306748466257669, + "grad_norm": 40.51120105706657, + "learning_rate": 4.326446280991735e-07, + "logits/chosen": -0.265625, + "logits/rejected": -0.412109375, + "logps/chosen": -332.0, + "logps/rejected": -302.0, + "loss": 0.3046, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.875, + "rewards/margins": 4.6875, + "rewards/rejected": -3.796875, + "step": 351 + }, + { + "epoch": 0.43190184049079755, + "grad_norm": 41.727810614577876, + "learning_rate": 4.3243801652892557e-07, + "logits/chosen": -0.1845703125, + "logits/rejected": -0.388671875, + "logps/chosen": -378.0, + "logps/rejected": -312.0, + "loss": 0.3119, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.8203125, + "rewards/margins": 4.875, + "rewards/rejected": -3.0625, + "step": 352 + }, + { + "epoch": 0.4331288343558282, + "grad_norm": 31.222074641479136, + "learning_rate": 4.3223140495867767e-07, + "logits/chosen": -0.23828125, + "logits/rejected": -0.4140625, + "logps/chosen": -354.0, + "logps/rejected": -304.0, + "loss": 0.2275, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.6484375, + "rewards/margins": 5.5625, + "rewards/rejected": -3.90625, + "step": 353 + }, + { + "epoch": 0.4343558282208589, + "grad_norm": 36.249821649908675, + "learning_rate": 4.320247933884297e-07, + "logits/chosen": -0.1630859375, + "logits/rejected": -0.34375, + "logps/chosen": -432.0, + "logps/rejected": -354.0, + "loss": 0.281, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 2.046875, + "rewards/margins": 5.0625, + "rewards/rejected": -3.03125, + "step": 354 + }, + { + "epoch": 0.43558282208588955, + "grad_norm": 40.95221006715783, + "learning_rate": 4.318181818181818e-07, + "logits/chosen": -0.30859375, + "logits/rejected": -0.41015625, + "logps/chosen": -338.0, + "logps/rejected": -332.0, + "loss": 0.3157, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.3203125, + "rewards/margins": 4.90625, + "rewards/rejected": -3.5625, + "step": 355 + }, + { + "epoch": 0.4368098159509202, + "grad_norm": 36.1989317653681, + "learning_rate": 4.3161157024793386e-07, + "logits/chosen": -0.11962890625, + "logits/rejected": -0.259765625, + "logps/chosen": -386.0, + "logps/rejected": -308.0, + "loss": 0.3022, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.5, + "rewards/margins": 4.5625, + "rewards/rejected": -3.046875, + "step": 356 + }, + { + "epoch": 0.43803680981595094, + "grad_norm": 36.959818116679386, + "learning_rate": 4.3140495867768597e-07, + "logits/chosen": -0.365234375, + "logits/rejected": -0.51953125, + "logps/chosen": -394.0, + "logps/rejected": -312.0, + "loss": 0.2585, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.5703125, + "rewards/margins": 5.53125, + "rewards/rejected": -3.953125, + "step": 357 + }, + { + "epoch": 0.4392638036809816, + "grad_norm": 35.616695396791314, + "learning_rate": 4.31198347107438e-07, + "logits/chosen": -0.318359375, + "logits/rejected": -0.4765625, + "logps/chosen": -440.0, + "logps/rejected": -306.0, + "loss": 0.2431, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.9765625, + "rewards/margins": 5.5625, + "rewards/rejected": -3.59375, + "step": 358 + }, + { + "epoch": 0.4404907975460123, + "grad_norm": 39.323762039132475, + "learning_rate": 4.3099173553719006e-07, + "logits/chosen": -0.208984375, + "logits/rejected": -0.326171875, + "logps/chosen": -414.0, + "logps/rejected": -308.0, + "loss": 0.2505, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.9375, + "rewards/margins": 5.21875, + "rewards/rejected": -3.296875, + "step": 359 + }, + { + "epoch": 0.44171779141104295, + "grad_norm": 39.07034175993009, + "learning_rate": 4.307851239669421e-07, + "logits/chosen": -0.1787109375, + "logits/rejected": -0.3125, + "logps/chosen": -386.0, + "logps/rejected": -332.0, + "loss": 0.2575, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.2734375, + "rewards/margins": 5.21875, + "rewards/rejected": -3.953125, + "step": 360 + }, + { + "epoch": 0.4429447852760736, + "grad_norm": 35.06710617877251, + "learning_rate": 4.305785123966942e-07, + "logits/chosen": -0.126953125, + "logits/rejected": -0.33203125, + "logps/chosen": -426.0, + "logps/rejected": -352.0, + "loss": 0.2472, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.7890625, + "rewards/margins": 5.625, + "rewards/rejected": -3.828125, + "step": 361 + }, + { + "epoch": 0.4441717791411043, + "grad_norm": 34.7975606217305, + "learning_rate": 4.3037190082644625e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.412109375, + "logps/chosen": -408.0, + "logps/rejected": -318.0, + "loss": 0.2548, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.578125, + "rewards/margins": 5.46875, + "rewards/rejected": -3.890625, + "step": 362 + }, + { + "epoch": 0.44539877300613495, + "grad_norm": 35.42891956468369, + "learning_rate": 4.3016528925619835e-07, + "logits/chosen": -0.1748046875, + "logits/rejected": -0.33203125, + "logps/chosen": -382.0, + "logps/rejected": -322.0, + "loss": 0.237, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.6328125, + "rewards/margins": 5.375, + "rewards/rejected": -3.734375, + "step": 363 + }, + { + "epoch": 0.4466257668711656, + "grad_norm": 44.20888419689405, + "learning_rate": 4.299586776859504e-07, + "logits/chosen": -0.1083984375, + "logits/rejected": -0.29296875, + "logps/chosen": -386.0, + "logps/rejected": -290.0, + "loss": 0.2487, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.390625, + "rewards/margins": 5.03125, + "rewards/rejected": -3.625, + "step": 364 + }, + { + "epoch": 0.44785276073619634, + "grad_norm": 32.07969290277028, + "learning_rate": 4.2975206611570245e-07, + "logits/chosen": -0.158203125, + "logits/rejected": -0.30859375, + "logps/chosen": -346.0, + "logps/rejected": -292.0, + "loss": 0.2268, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.234375, + "rewards/margins": 5.15625, + "rewards/rejected": -3.921875, + "step": 365 + }, + { + "epoch": 0.449079754601227, + "grad_norm": 35.77821392399441, + "learning_rate": 4.2954545454545455e-07, + "logits/chosen": -0.146484375, + "logits/rejected": -0.25, + "logps/chosen": -360.0, + "logps/rejected": -314.0, + "loss": 0.3, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.3828125, + "rewards/margins": 4.6875, + "rewards/rejected": -3.3125, + "step": 366 + }, + { + "epoch": 0.4503067484662577, + "grad_norm": 33.47062276922143, + "learning_rate": 4.293388429752066e-07, + "logits/chosen": -0.26953125, + "logits/rejected": -0.451171875, + "logps/chosen": -392.0, + "logps/rejected": -316.0, + "loss": 0.2494, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.3046875, + "rewards/margins": 5.03125, + "rewards/rejected": -3.734375, + "step": 367 + }, + { + "epoch": 0.45153374233128835, + "grad_norm": 41.18940309867523, + "learning_rate": 4.2913223140495864e-07, + "logits/chosen": -0.09033203125, + "logits/rejected": -0.1494140625, + "logps/chosen": -366.0, + "logps/rejected": -312.0, + "loss": 0.3001, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.0, + "rewards/margins": 4.625, + "rewards/rejected": -3.625, + "step": 368 + }, + { + "epoch": 0.452760736196319, + "grad_norm": 37.92759892609332, + "learning_rate": 4.289256198347107e-07, + "logits/chosen": -0.115234375, + "logits/rejected": -0.224609375, + "logps/chosen": -340.0, + "logps/rejected": -280.0, + "loss": 0.2816, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.5859375, + "rewards/margins": 4.34375, + "rewards/rejected": -3.75, + "step": 369 + }, + { + "epoch": 0.4539877300613497, + "grad_norm": 32.92636269991582, + "learning_rate": 4.287190082644628e-07, + "logits/chosen": -0.265625, + "logits/rejected": -0.462890625, + "logps/chosen": -402.0, + "logps/rejected": -336.0, + "loss": 0.2538, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.671875, + "rewards/margins": 5.375, + "rewards/rejected": -3.703125, + "step": 370 + }, + { + "epoch": 0.45521472392638035, + "grad_norm": 38.74700708912898, + "learning_rate": 4.2851239669421484e-07, + "logits/chosen": -0.2490234375, + "logits/rejected": -0.4375, + "logps/chosen": -460.0, + "logps/rejected": -352.0, + "loss": 0.2839, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.53125, + "rewards/margins": 4.84375, + "rewards/rejected": -3.3125, + "step": 371 + }, + { + "epoch": 0.456441717791411, + "grad_norm": 35.56525332139474, + "learning_rate": 4.2830578512396694e-07, + "logits/chosen": -0.1650390625, + "logits/rejected": -0.326171875, + "logps/chosen": -410.0, + "logps/rejected": -310.0, + "loss": 0.239, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.46875, + "rewards/margins": 5.0, + "rewards/rejected": -3.53125, + "step": 372 + }, + { + "epoch": 0.45766871165644174, + "grad_norm": 38.919873513342004, + "learning_rate": 4.28099173553719e-07, + "logits/chosen": -0.1943359375, + "logits/rejected": -0.3046875, + "logps/chosen": -360.0, + "logps/rejected": -308.0, + "loss": 0.325, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 0.765625, + "rewards/margins": 4.5625, + "rewards/rejected": -3.8125, + "step": 373 + }, + { + "epoch": 0.4588957055214724, + "grad_norm": 33.72191218536702, + "learning_rate": 4.278925619834711e-07, + "logits/chosen": -0.2099609375, + "logits/rejected": -0.349609375, + "logps/chosen": -384.0, + "logps/rejected": -304.0, + "loss": 0.2315, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.765625, + "rewards/margins": 5.4375, + "rewards/rejected": -3.6875, + "step": 374 + }, + { + "epoch": 0.4601226993865031, + "grad_norm": 39.982978401052485, + "learning_rate": 4.2768595041322313e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.34765625, + "logps/chosen": -392.0, + "logps/rejected": -342.0, + "loss": 0.2831, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.546875, + "rewards/margins": 4.84375, + "rewards/rejected": -3.3125, + "step": 375 + }, + { + "epoch": 0.46134969325153374, + "grad_norm": 33.94023445384835, + "learning_rate": 4.2747933884297523e-07, + "logits/chosen": -0.140625, + "logits/rejected": -0.29296875, + "logps/chosen": -376.0, + "logps/rejected": -336.0, + "loss": 0.2271, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.5859375, + "rewards/margins": 5.0, + "rewards/rejected": -3.421875, + "step": 376 + }, + { + "epoch": 0.4625766871165644, + "grad_norm": 37.21157793471459, + "learning_rate": 4.272727272727272e-07, + "logits/chosen": -0.21484375, + "logits/rejected": -0.287109375, + "logps/chosen": -352.0, + "logps/rejected": -306.0, + "loss": 0.262, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.453125, + "rewards/margins": 5.46875, + "rewards/rejected": -4.03125, + "step": 377 + }, + { + "epoch": 0.4638036809815951, + "grad_norm": 38.20919614495083, + "learning_rate": 4.270661157024793e-07, + "logits/chosen": -0.2421875, + "logits/rejected": -0.4921875, + "logps/chosen": -376.0, + "logps/rejected": -320.0, + "loss": 0.28, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.6484375, + "rewards/margins": 5.375, + "rewards/rejected": -3.734375, + "step": 378 + }, + { + "epoch": 0.46503067484662575, + "grad_norm": 36.24612780889627, + "learning_rate": 4.2685950413223137e-07, + "logits/chosen": -0.287109375, + "logits/rejected": -0.45703125, + "logps/chosen": -406.0, + "logps/rejected": -328.0, + "loss": 0.257, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.796875, + "rewards/margins": 5.75, + "rewards/rejected": -3.96875, + "step": 379 + }, + { + "epoch": 0.4662576687116564, + "grad_norm": 36.557393364699294, + "learning_rate": 4.2665289256198347e-07, + "logits/chosen": -0.203125, + "logits/rejected": -0.353515625, + "logps/chosen": -382.0, + "logps/rejected": -312.0, + "loss": 0.2671, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.578125, + "rewards/margins": 5.4375, + "rewards/rejected": -3.84375, + "step": 380 + }, + { + "epoch": 0.46748466257668714, + "grad_norm": 37.32259328400382, + "learning_rate": 4.264462809917355e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.458984375, + "logps/chosen": -370.0, + "logps/rejected": -310.0, + "loss": 0.3045, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.2578125, + "rewards/margins": 5.46875, + "rewards/rejected": -4.21875, + "step": 381 + }, + { + "epoch": 0.4687116564417178, + "grad_norm": 34.81605521306601, + "learning_rate": 4.2623966942148757e-07, + "logits/chosen": -0.283203125, + "logits/rejected": -0.390625, + "logps/chosen": -378.0, + "logps/rejected": -324.0, + "loss": 0.2736, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.34375, + "rewards/margins": 5.53125, + "rewards/rejected": -4.15625, + "step": 382 + }, + { + "epoch": 0.4699386503067485, + "grad_norm": 38.419341258289826, + "learning_rate": 4.2603305785123967e-07, + "logits/chosen": -0.2001953125, + "logits/rejected": -0.36328125, + "logps/chosen": -400.0, + "logps/rejected": -364.0, + "loss": 0.2858, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.3515625, + "rewards/margins": 5.5625, + "rewards/rejected": -4.21875, + "step": 383 + }, + { + "epoch": 0.47116564417177914, + "grad_norm": 33.49732006194629, + "learning_rate": 4.258264462809917e-07, + "logits/chosen": -0.2890625, + "logits/rejected": -0.52734375, + "logps/chosen": -392.0, + "logps/rejected": -320.0, + "loss": 0.2126, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.234375, + "rewards/margins": 6.15625, + "rewards/rejected": -4.90625, + "step": 384 + }, + { + "epoch": 0.4723926380368098, + "grad_norm": 38.114919863333334, + "learning_rate": 4.256198347107438e-07, + "logits/chosen": -0.19140625, + "logits/rejected": -0.384765625, + "logps/chosen": -388.0, + "logps/rejected": -314.0, + "loss": 0.2925, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.96484375, + "rewards/margins": 5.40625, + "rewards/rejected": -4.4375, + "step": 385 + }, + { + "epoch": 0.4736196319018405, + "grad_norm": 42.83706264363719, + "learning_rate": 4.254132231404958e-07, + "logits/chosen": -0.146484375, + "logits/rejected": -0.314453125, + "logps/chosen": -336.0, + "logps/rejected": -292.0, + "loss": 0.2814, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.439453125, + "rewards/margins": 5.09375, + "rewards/rejected": -4.65625, + "step": 386 + }, + { + "epoch": 0.47484662576687114, + "grad_norm": 43.964728733564016, + "learning_rate": 4.252066115702479e-07, + "logits/chosen": -0.169921875, + "logits/rejected": -0.365234375, + "logps/chosen": -416.0, + "logps/rejected": -328.0, + "loss": 0.2666, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.3046875, + "rewards/margins": 5.8125, + "rewards/rejected": -4.5, + "step": 387 + }, + { + "epoch": 0.47607361963190187, + "grad_norm": 44.03543501865791, + "learning_rate": 4.2499999999999995e-07, + "logits/chosen": -0.193359375, + "logits/rejected": -0.298828125, + "logps/chosen": -400.0, + "logps/rejected": -310.0, + "loss": 0.3549, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.6328125, + "rewards/margins": 4.5, + "rewards/rejected": -3.875, + "step": 388 + }, + { + "epoch": 0.47730061349693254, + "grad_norm": 42.68974337451638, + "learning_rate": 4.2479338842975205e-07, + "logits/chosen": -0.2421875, + "logits/rejected": -0.337890625, + "logps/chosen": -404.0, + "logps/rejected": -322.0, + "loss": 0.3419, + "rewards/accuracies": 0.78125, + "rewards/chosen": 0.9609375, + "rewards/margins": 5.3125, + "rewards/rejected": -4.34375, + "step": 389 + }, + { + "epoch": 0.4785276073619632, + "grad_norm": 42.06628954709381, + "learning_rate": 4.245867768595041e-07, + "logits/chosen": -0.306640625, + "logits/rejected": -0.447265625, + "logps/chosen": -362.0, + "logps/rejected": -326.0, + "loss": 0.3237, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.361328125, + "rewards/margins": 5.15625, + "rewards/rejected": -4.78125, + "step": 390 + }, + { + "epoch": 0.47975460122699387, + "grad_norm": 49.18980712796409, + "learning_rate": 4.243801652892562e-07, + "logits/chosen": -0.22265625, + "logits/rejected": -0.3515625, + "logps/chosen": -380.0, + "logps/rejected": -324.0, + "loss": 0.3698, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 0.92578125, + "rewards/margins": 5.4375, + "rewards/rejected": -4.5, + "step": 391 + }, + { + "epoch": 0.48098159509202454, + "grad_norm": 34.35189463552141, + "learning_rate": 4.2417355371900825e-07, + "logits/chosen": -0.1787109375, + "logits/rejected": -0.330078125, + "logps/chosen": -354.0, + "logps/rejected": -310.0, + "loss": 0.2639, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.9296875, + "rewards/margins": 5.59375, + "rewards/rejected": -4.65625, + "step": 392 + }, + { + "epoch": 0.4822085889570552, + "grad_norm": 38.67130742947215, + "learning_rate": 4.2396694214876035e-07, + "logits/chosen": -0.14453125, + "logits/rejected": -0.2890625, + "logps/chosen": -404.0, + "logps/rejected": -352.0, + "loss": 0.2885, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.921875, + "rewards/margins": 5.375, + "rewards/rejected": -4.46875, + "step": 393 + }, + { + "epoch": 0.4834355828220859, + "grad_norm": 40.57744523526432, + "learning_rate": 4.237603305785124e-07, + "logits/chosen": -0.212890625, + "logits/rejected": -0.42578125, + "logps/chosen": -386.0, + "logps/rejected": -324.0, + "loss": 0.2657, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.84765625, + "rewards/margins": 5.34375, + "rewards/rejected": -4.5, + "step": 394 + }, + { + "epoch": 0.48466257668711654, + "grad_norm": 38.619317047033334, + "learning_rate": 4.2355371900826444e-07, + "logits/chosen": -0.212890625, + "logits/rejected": -0.34375, + "logps/chosen": -438.0, + "logps/rejected": -336.0, + "loss": 0.307, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.94921875, + "rewards/margins": 5.21875, + "rewards/rejected": -4.28125, + "step": 395 + }, + { + "epoch": 0.48588957055214727, + "grad_norm": 30.114712115596447, + "learning_rate": 4.233471074380165e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.4921875, + "logps/chosen": -338.0, + "logps/rejected": -312.0, + "loss": 0.215, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 0.439453125, + "rewards/margins": 5.375, + "rewards/rejected": -4.9375, + "step": 396 + }, + { + "epoch": 0.48711656441717793, + "grad_norm": 34.39736388154625, + "learning_rate": 4.231404958677686e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.43359375, + "logps/chosen": -374.0, + "logps/rejected": -326.0, + "loss": 0.2349, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.84765625, + "rewards/margins": 5.78125, + "rewards/rejected": -4.9375, + "step": 397 + }, + { + "epoch": 0.4883435582822086, + "grad_norm": 40.00891469568207, + "learning_rate": 4.2293388429752064e-07, + "logits/chosen": -0.2490234375, + "logits/rejected": -0.3984375, + "logps/chosen": -416.0, + "logps/rejected": -324.0, + "loss": 0.3096, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.0859375, + "rewards/margins": 5.46875, + "rewards/rejected": -4.375, + "step": 398 + }, + { + "epoch": 0.48957055214723927, + "grad_norm": 35.41096130608413, + "learning_rate": 4.227272727272727e-07, + "logits/chosen": -0.26953125, + "logits/rejected": -0.416015625, + "logps/chosen": -384.0, + "logps/rejected": -324.0, + "loss": 0.2995, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.921875, + "rewards/margins": 5.3125, + "rewards/rejected": -4.375, + "step": 399 + }, + { + "epoch": 0.49079754601226994, + "grad_norm": 48.45396143006796, + "learning_rate": 4.225206611570248e-07, + "logits/chosen": -0.2236328125, + "logits/rejected": -0.30859375, + "logps/chosen": -370.0, + "logps/rejected": -346.0, + "loss": 0.3464, + "rewards/accuracies": 0.796875, + "rewards/chosen": 0.8125, + "rewards/margins": 4.78125, + "rewards/rejected": -3.953125, + "step": 400 + }, + { + "epoch": 0.4920245398773006, + "grad_norm": 30.00175559700857, + "learning_rate": 4.2231404958677683e-07, + "logits/chosen": -0.337890625, + "logits/rejected": -0.490234375, + "logps/chosen": -446.0, + "logps/rejected": -366.0, + "loss": 0.2176, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.46875, + "rewards/margins": 6.1875, + "rewards/rejected": -4.71875, + "step": 401 + }, + { + "epoch": 0.49325153374233127, + "grad_norm": 37.529393439709146, + "learning_rate": 4.2210743801652893e-07, + "logits/chosen": -0.208984375, + "logits/rejected": -0.314453125, + "logps/chosen": -384.0, + "logps/rejected": -328.0, + "loss": 0.2923, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.98828125, + "rewards/margins": 5.25, + "rewards/rejected": -4.25, + "step": 402 + }, + { + "epoch": 0.49447852760736194, + "grad_norm": 41.86969893893965, + "learning_rate": 4.21900826446281e-07, + "logits/chosen": -0.203125, + "logits/rejected": -0.3046875, + "logps/chosen": -388.0, + "logps/rejected": -348.0, + "loss": 0.3168, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.828125, + "rewards/margins": 5.125, + "rewards/rejected": -4.28125, + "step": 403 + }, + { + "epoch": 0.49570552147239266, + "grad_norm": 34.20945313316955, + "learning_rate": 4.21694214876033e-07, + "logits/chosen": -0.1513671875, + "logits/rejected": -0.30078125, + "logps/chosen": -364.0, + "logps/rejected": -324.0, + "loss": 0.2255, + "rewards/accuracies": 0.90625, + "rewards/chosen": 1.0703125, + "rewards/margins": 5.65625, + "rewards/rejected": -4.59375, + "step": 404 + }, + { + "epoch": 0.49693251533742333, + "grad_norm": 35.86293374874338, + "learning_rate": 4.2148760330578507e-07, + "logits/chosen": -0.2314453125, + "logits/rejected": -0.462890625, + "logps/chosen": -364.0, + "logps/rejected": -304.0, + "loss": 0.3106, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.21875, + "rewards/margins": 5.53125, + "rewards/rejected": -4.3125, + "step": 405 + }, + { + "epoch": 0.498159509202454, + "grad_norm": 43.071679894395345, + "learning_rate": 4.2128099173553717e-07, + "logits/chosen": -0.1328125, + "logits/rejected": -0.2294921875, + "logps/chosen": -374.0, + "logps/rejected": -322.0, + "loss": 0.3625, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 0.86328125, + "rewards/margins": 4.78125, + "rewards/rejected": -3.921875, + "step": 406 + }, + { + "epoch": 0.49938650306748467, + "grad_norm": 42.39188898560159, + "learning_rate": 4.210743801652892e-07, + "logits/chosen": -0.10986328125, + "logits/rejected": -0.2734375, + "logps/chosen": -402.0, + "logps/rejected": -322.0, + "loss": 0.3105, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.9140625, + "rewards/margins": 5.78125, + "rewards/rejected": -3.84375, + "step": 407 + }, + { + "epoch": 0.5006134969325153, + "grad_norm": 45.27741438195794, + "learning_rate": 4.208677685950413e-07, + "logits/chosen": -0.2109375, + "logits/rejected": -0.310546875, + "logps/chosen": -418.0, + "logps/rejected": -346.0, + "loss": 0.3592, + "rewards/accuracies": 0.78125, + "rewards/chosen": 0.73828125, + "rewards/margins": 4.4375, + "rewards/rejected": -3.71875, + "step": 408 + }, + { + "epoch": 0.501840490797546, + "grad_norm": 39.84136285513692, + "learning_rate": 4.2066115702479337e-07, + "logits/chosen": -0.1484375, + "logits/rejected": -0.345703125, + "logps/chosen": -418.0, + "logps/rejected": -322.0, + "loss": 0.2668, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.3125, + "rewards/margins": 5.5625, + "rewards/rejected": -4.25, + "step": 409 + }, + { + "epoch": 0.5030674846625767, + "grad_norm": 40.12041017968796, + "learning_rate": 4.2045454545454547e-07, + "logits/chosen": -0.1357421875, + "logits/rejected": -0.33984375, + "logps/chosen": -382.0, + "logps/rejected": -340.0, + "loss": 0.2892, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.91796875, + "rewards/margins": 4.78125, + "rewards/rejected": -3.859375, + "step": 410 + }, + { + "epoch": 0.5042944785276073, + "grad_norm": 37.21127075191681, + "learning_rate": 4.202479338842975e-07, + "logits/chosen": -0.1279296875, + "logits/rejected": -0.26953125, + "logps/chosen": -338.0, + "logps/rejected": -302.0, + "loss": 0.2656, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.65625, + "rewards/margins": 5.03125, + "rewards/rejected": -4.375, + "step": 411 + }, + { + "epoch": 0.505521472392638, + "grad_norm": 41.819486450620104, + "learning_rate": 4.200413223140496e-07, + "logits/chosen": -0.1376953125, + "logits/rejected": -0.27734375, + "logps/chosen": -420.0, + "logps/rejected": -348.0, + "loss": 0.3095, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.015625, + "rewards/margins": 4.75, + "rewards/rejected": -3.71875, + "step": 412 + }, + { + "epoch": 0.5067484662576687, + "grad_norm": 38.33771429389002, + "learning_rate": 4.198347107438016e-07, + "logits/chosen": -0.1728515625, + "logits/rejected": -0.404296875, + "logps/chosen": -402.0, + "logps/rejected": -312.0, + "loss": 0.2722, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.3828125, + "rewards/margins": 5.40625, + "rewards/rejected": -4.03125, + "step": 413 + }, + { + "epoch": 0.5079754601226993, + "grad_norm": 37.12482857003386, + "learning_rate": 4.196280991735537e-07, + "logits/chosen": -0.21875, + "logits/rejected": -0.37109375, + "logps/chosen": -402.0, + "logps/rejected": -336.0, + "loss": 0.2323, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.15625, + "rewards/margins": 5.34375, + "rewards/rejected": -4.1875, + "step": 414 + }, + { + "epoch": 0.50920245398773, + "grad_norm": 34.655790564533014, + "learning_rate": 4.1942148760330576e-07, + "logits/chosen": -0.1796875, + "logits/rejected": -0.36328125, + "logps/chosen": -346.0, + "logps/rejected": -310.0, + "loss": 0.2656, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.90625, + "rewards/margins": 5.03125, + "rewards/rejected": -4.125, + "step": 415 + }, + { + "epoch": 0.5104294478527608, + "grad_norm": 32.98043530408525, + "learning_rate": 4.1921487603305786e-07, + "logits/chosen": -0.154296875, + "logits/rejected": -0.375, + "logps/chosen": -360.0, + "logps/rejected": -304.0, + "loss": 0.2198, + "rewards/accuracies": 0.890625, + "rewards/chosen": 0.62109375, + "rewards/margins": 4.75, + "rewards/rejected": -4.125, + "step": 416 + }, + { + "epoch": 0.5116564417177915, + "grad_norm": 36.96587452637558, + "learning_rate": 4.190082644628099e-07, + "logits/chosen": -0.3515625, + "logits/rejected": -0.53125, + "logps/chosen": -436.0, + "logps/rejected": -362.0, + "loss": 0.2649, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.6484375, + "rewards/margins": 6.28125, + "rewards/rejected": -4.65625, + "step": 417 + }, + { + "epoch": 0.5128834355828221, + "grad_norm": 34.4789260314332, + "learning_rate": 4.1880165289256195e-07, + "logits/chosen": -0.267578125, + "logits/rejected": -0.373046875, + "logps/chosen": -364.0, + "logps/rejected": -284.0, + "loss": 0.2518, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.1484375, + "rewards/margins": 5.40625, + "rewards/rejected": -4.25, + "step": 418 + }, + { + "epoch": 0.5141104294478528, + "grad_norm": 34.78381462111674, + "learning_rate": 4.1859504132231405e-07, + "logits/chosen": -0.2109375, + "logits/rejected": -0.3828125, + "logps/chosen": -378.0, + "logps/rejected": -320.0, + "loss": 0.2278, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.1484375, + "rewards/margins": 5.71875, + "rewards/rejected": -4.5625, + "step": 419 + }, + { + "epoch": 0.5153374233128835, + "grad_norm": 39.079403507615055, + "learning_rate": 4.183884297520661e-07, + "logits/chosen": -0.1494140625, + "logits/rejected": -0.326171875, + "logps/chosen": -344.0, + "logps/rejected": -294.0, + "loss": 0.3113, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.03125, + "rewards/margins": 4.84375, + "rewards/rejected": -3.8125, + "step": 420 + }, + { + "epoch": 0.5165644171779141, + "grad_norm": 34.54058833309064, + "learning_rate": 4.1818181818181814e-07, + "logits/chosen": -0.1943359375, + "logits/rejected": -0.3984375, + "logps/chosen": -362.0, + "logps/rejected": -302.0, + "loss": 0.3077, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.34375, + "rewards/margins": 5.21875, + "rewards/rejected": -3.875, + "step": 421 + }, + { + "epoch": 0.5177914110429448, + "grad_norm": 36.04776328314745, + "learning_rate": 4.179752066115702e-07, + "logits/chosen": -0.1171875, + "logits/rejected": -0.287109375, + "logps/chosen": -356.0, + "logps/rejected": -282.0, + "loss": 0.2784, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.9609375, + "rewards/margins": 5.125, + "rewards/rejected": -4.15625, + "step": 422 + }, + { + "epoch": 0.5190184049079755, + "grad_norm": 43.01937925233782, + "learning_rate": 4.177685950413223e-07, + "logits/chosen": -0.232421875, + "logits/rejected": -0.40234375, + "logps/chosen": -396.0, + "logps/rejected": -346.0, + "loss": 0.3382, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.82421875, + "rewards/margins": 4.6875, + "rewards/rejected": -3.859375, + "step": 423 + }, + { + "epoch": 0.5202453987730061, + "grad_norm": 36.48453900377271, + "learning_rate": 4.1756198347107434e-07, + "logits/chosen": -0.1611328125, + "logits/rejected": -0.365234375, + "logps/chosen": -378.0, + "logps/rejected": -328.0, + "loss": 0.3126, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.2421875, + "rewards/margins": 5.625, + "rewards/rejected": -4.375, + "step": 424 + }, + { + "epoch": 0.5214723926380368, + "grad_norm": 41.79473108392073, + "learning_rate": 4.1735537190082644e-07, + "logits/chosen": -0.193359375, + "logits/rejected": -0.318359375, + "logps/chosen": -394.0, + "logps/rejected": -332.0, + "loss": 0.3372, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.5078125, + "rewards/margins": 5.40625, + "rewards/rejected": -3.90625, + "step": 425 + }, + { + "epoch": 0.5226993865030675, + "grad_norm": 48.26366364465108, + "learning_rate": 4.171487603305785e-07, + "logits/chosen": -0.2412109375, + "logits/rejected": -0.376953125, + "logps/chosen": -368.0, + "logps/rejected": -330.0, + "loss": 0.2573, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.3203125, + "rewards/margins": 5.625, + "rewards/rejected": -4.28125, + "step": 426 + }, + { + "epoch": 0.5239263803680981, + "grad_norm": 99.7573372246345, + "learning_rate": 4.169421487603306e-07, + "logits/chosen": -0.1982421875, + "logits/rejected": -0.3125, + "logps/chosen": -376.0, + "logps/rejected": -318.0, + "loss": 0.2668, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.3046875, + "rewards/margins": 5.34375, + "rewards/rejected": -4.03125, + "step": 427 + }, + { + "epoch": 0.5251533742331288, + "grad_norm": 37.06815581413299, + "learning_rate": 4.1673553719008263e-07, + "logits/chosen": -0.224609375, + "logits/rejected": -0.357421875, + "logps/chosen": -360.0, + "logps/rejected": -306.0, + "loss": 0.3028, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.890625, + "rewards/margins": 5.0, + "rewards/rejected": -4.125, + "step": 428 + }, + { + "epoch": 0.5263803680981595, + "grad_norm": 33.97292039326683, + "learning_rate": 4.1652892561983473e-07, + "logits/chosen": -0.224609375, + "logits/rejected": -0.34765625, + "logps/chosen": -356.0, + "logps/rejected": -352.0, + "loss": 0.243, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.82421875, + "rewards/margins": 5.875, + "rewards/rejected": -5.0625, + "step": 429 + }, + { + "epoch": 0.5276073619631901, + "grad_norm": 29.82247469458647, + "learning_rate": 4.163223140495867e-07, + "logits/chosen": -0.287109375, + "logits/rejected": -0.46484375, + "logps/chosen": -392.0, + "logps/rejected": -332.0, + "loss": 0.1971, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.1953125, + "rewards/margins": 5.96875, + "rewards/rejected": -4.78125, + "step": 430 + }, + { + "epoch": 0.5288343558282208, + "grad_norm": 50.10617111263047, + "learning_rate": 4.161157024793388e-07, + "logits/chosen": -0.1787109375, + "logits/rejected": -0.3515625, + "logps/chosen": -380.0, + "logps/rejected": -326.0, + "loss": 0.3808, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.7109375, + "rewards/margins": 4.90625, + "rewards/rejected": -4.21875, + "step": 431 + }, + { + "epoch": 0.5300613496932516, + "grad_norm": 46.34719786232677, + "learning_rate": 4.1590909090909087e-07, + "logits/chosen": -0.1328125, + "logits/rejected": -0.185546875, + "logps/chosen": -376.0, + "logps/rejected": -334.0, + "loss": 0.3379, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.3359375, + "rewards/margins": 5.25, + "rewards/rejected": -3.921875, + "step": 432 + }, + { + "epoch": 0.5312883435582823, + "grad_norm": 42.692948753426734, + "learning_rate": 4.1570247933884297e-07, + "logits/chosen": -0.1181640625, + "logits/rejected": -0.33984375, + "logps/chosen": -382.0, + "logps/rejected": -298.0, + "loss": 0.3119, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.55078125, + "rewards/margins": 4.96875, + "rewards/rejected": -4.40625, + "step": 433 + }, + { + "epoch": 0.5325153374233129, + "grad_norm": 39.50920458351492, + "learning_rate": 4.15495867768595e-07, + "logits/chosen": -0.263671875, + "logits/rejected": -0.36328125, + "logps/chosen": -384.0, + "logps/rejected": -338.0, + "loss": 0.2357, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.61328125, + "rewards/margins": 5.125, + "rewards/rejected": -4.5, + "step": 434 + }, + { + "epoch": 0.5337423312883436, + "grad_norm": 41.38331544820595, + "learning_rate": 4.1528925619834707e-07, + "logits/chosen": -0.201171875, + "logits/rejected": -0.416015625, + "logps/chosen": -386.0, + "logps/rejected": -340.0, + "loss": 0.2711, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.140625, + "rewards/margins": 5.65625, + "rewards/rejected": -4.53125, + "step": 435 + }, + { + "epoch": 0.5349693251533743, + "grad_norm": 39.363819944524835, + "learning_rate": 4.1508264462809917e-07, + "logits/chosen": -0.2099609375, + "logits/rejected": -0.423828125, + "logps/chosen": -416.0, + "logps/rejected": -336.0, + "loss": 0.2469, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.6796875, + "rewards/margins": 6.28125, + "rewards/rejected": -4.59375, + "step": 436 + }, + { + "epoch": 0.5361963190184049, + "grad_norm": 32.4215285898728, + "learning_rate": 4.148760330578512e-07, + "logits/chosen": -0.2431640625, + "logits/rejected": -0.4296875, + "logps/chosen": -382.0, + "logps/rejected": -328.0, + "loss": 0.2367, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.109375, + "rewards/margins": 5.8125, + "rewards/rejected": -4.6875, + "step": 437 + }, + { + "epoch": 0.5374233128834356, + "grad_norm": 41.11999044241744, + "learning_rate": 4.146694214876033e-07, + "logits/chosen": -0.16796875, + "logits/rejected": -0.279296875, + "logps/chosen": -358.0, + "logps/rejected": -314.0, + "loss": 0.3424, + "rewards/accuracies": 0.796875, + "rewards/chosen": 0.859375, + "rewards/margins": 4.59375, + "rewards/rejected": -3.734375, + "step": 438 + }, + { + "epoch": 0.5386503067484663, + "grad_norm": 36.95463031219475, + "learning_rate": 4.144628099173553e-07, + "logits/chosen": -0.1181640625, + "logits/rejected": -0.32421875, + "logps/chosen": -364.0, + "logps/rejected": -326.0, + "loss": 0.2791, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.7734375, + "rewards/margins": 5.21875, + "rewards/rejected": -4.46875, + "step": 439 + }, + { + "epoch": 0.5398773006134969, + "grad_norm": 49.69926246487377, + "learning_rate": 4.142561983471074e-07, + "logits/chosen": -0.166015625, + "logits/rejected": -0.271484375, + "logps/chosen": -384.0, + "logps/rejected": -326.0, + "loss": 0.3218, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.35546875, + "rewards/margins": 4.40625, + "rewards/rejected": -4.03125, + "step": 440 + }, + { + "epoch": 0.5411042944785276, + "grad_norm": 39.707681073149594, + "learning_rate": 4.1404958677685946e-07, + "logits/chosen": -0.107421875, + "logits/rejected": -0.224609375, + "logps/chosen": -332.0, + "logps/rejected": -292.0, + "loss": 0.2837, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.69140625, + "rewards/margins": 4.78125, + "rewards/rejected": -4.09375, + "step": 441 + }, + { + "epoch": 0.5423312883435583, + "grad_norm": 38.960801334852974, + "learning_rate": 4.1384297520661156e-07, + "logits/chosen": -0.24609375, + "logits/rejected": -0.3828125, + "logps/chosen": -384.0, + "logps/rejected": -334.0, + "loss": 0.3027, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.0234375, + "rewards/margins": 5.21875, + "rewards/rejected": -4.1875, + "step": 442 + }, + { + "epoch": 0.5435582822085889, + "grad_norm": 42.815669493727604, + "learning_rate": 4.136363636363636e-07, + "logits/chosen": -0.193359375, + "logits/rejected": -0.33203125, + "logps/chosen": -366.0, + "logps/rejected": -312.0, + "loss": 0.303, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.2734375, + "rewards/margins": 5.25, + "rewards/rejected": -4.0, + "step": 443 + }, + { + "epoch": 0.5447852760736196, + "grad_norm": 35.80955378025667, + "learning_rate": 4.134297520661157e-07, + "logits/chosen": -0.234375, + "logits/rejected": -0.47265625, + "logps/chosen": -448.0, + "logps/rejected": -360.0, + "loss": 0.2204, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.84375, + "rewards/margins": 6.40625, + "rewards/rejected": -4.5625, + "step": 444 + }, + { + "epoch": 0.5460122699386503, + "grad_norm": 38.126966452680875, + "learning_rate": 4.1322314049586775e-07, + "logits/chosen": -0.2060546875, + "logits/rejected": -0.388671875, + "logps/chosen": -352.0, + "logps/rejected": -296.0, + "loss": 0.3507, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.1328125, + "rewards/margins": 4.9375, + "rewards/rejected": -3.8125, + "step": 445 + }, + { + "epoch": 0.5472392638036809, + "grad_norm": 35.409001850251684, + "learning_rate": 4.1301652892561985e-07, + "logits/chosen": -0.21875, + "logits/rejected": -0.3984375, + "logps/chosen": -434.0, + "logps/rejected": -352.0, + "loss": 0.2334, + "rewards/accuracies": 0.90625, + "rewards/chosen": 1.171875, + "rewards/margins": 5.0625, + "rewards/rejected": -3.875, + "step": 446 + }, + { + "epoch": 0.5484662576687117, + "grad_norm": 37.030505301448606, + "learning_rate": 4.128099173553719e-07, + "logits/chosen": -0.20703125, + "logits/rejected": -0.421875, + "logps/chosen": -412.0, + "logps/rejected": -340.0, + "loss": 0.2524, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.5625, + "rewards/margins": 6.3125, + "rewards/rejected": -4.75, + "step": 447 + }, + { + "epoch": 0.5496932515337424, + "grad_norm": 40.14683673248258, + "learning_rate": 4.1260330578512394e-07, + "logits/chosen": -0.1435546875, + "logits/rejected": -0.298828125, + "logps/chosen": -342.0, + "logps/rejected": -296.0, + "loss": 0.3068, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.60546875, + "rewards/margins": 4.59375, + "rewards/rejected": -4.0, + "step": 448 + }, + { + "epoch": 0.550920245398773, + "grad_norm": 36.49625976131608, + "learning_rate": 4.12396694214876e-07, + "logits/chosen": -0.2119140625, + "logits/rejected": -0.365234375, + "logps/chosen": -396.0, + "logps/rejected": -326.0, + "loss": 0.257, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.5234375, + "rewards/margins": 5.78125, + "rewards/rejected": -4.25, + "step": 449 + }, + { + "epoch": 0.5521472392638037, + "grad_norm": 36.243221597677895, + "learning_rate": 4.121900826446281e-07, + "logits/chosen": -0.2890625, + "logits/rejected": -0.34765625, + "logps/chosen": -348.0, + "logps/rejected": -284.0, + "loss": 0.2672, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.94921875, + "rewards/margins": 5.25, + "rewards/rejected": -4.28125, + "step": 450 + }, + { + "epoch": 0.5533742331288344, + "grad_norm": 32.1407046295721, + "learning_rate": 4.1198347107438014e-07, + "logits/chosen": -0.1650390625, + "logits/rejected": -0.353515625, + "logps/chosen": -344.0, + "logps/rejected": -278.0, + "loss": 0.2477, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.9375, + "rewards/margins": 5.15625, + "rewards/rejected": -4.21875, + "step": 451 + }, + { + "epoch": 0.554601226993865, + "grad_norm": 42.28873095520698, + "learning_rate": 4.1177685950413224e-07, + "logits/chosen": -0.2236328125, + "logits/rejected": -0.484375, + "logps/chosen": -460.0, + "logps/rejected": -326.0, + "loss": 0.2747, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.9140625, + "rewards/margins": 5.90625, + "rewards/rejected": -4.0, + "step": 452 + }, + { + "epoch": 0.5558282208588957, + "grad_norm": 32.36959074636312, + "learning_rate": 4.115702479338843e-07, + "logits/chosen": -0.29296875, + "logits/rejected": -0.5234375, + "logps/chosen": -440.0, + "logps/rejected": -362.0, + "loss": 0.1965, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 2.109375, + "rewards/margins": 6.5, + "rewards/rejected": -4.375, + "step": 453 + }, + { + "epoch": 0.5570552147239264, + "grad_norm": 37.72144307940475, + "learning_rate": 4.1136363636363633e-07, + "logits/chosen": -0.1572265625, + "logits/rejected": -0.248046875, + "logps/chosen": -340.0, + "logps/rejected": -302.0, + "loss": 0.2824, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.67578125, + "rewards/margins": 4.84375, + "rewards/rejected": -4.15625, + "step": 454 + }, + { + "epoch": 0.558282208588957, + "grad_norm": 36.8405329111992, + "learning_rate": 4.1115702479338843e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.400390625, + "logps/chosen": -370.0, + "logps/rejected": -344.0, + "loss": 0.2387, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.65625, + "rewards/margins": 5.9375, + "rewards/rejected": -4.28125, + "step": 455 + }, + { + "epoch": 0.5595092024539877, + "grad_norm": 38.28626472369992, + "learning_rate": 4.109504132231405e-07, + "logits/chosen": -0.1533203125, + "logits/rejected": -0.259765625, + "logps/chosen": -314.0, + "logps/rejected": -296.0, + "loss": 0.2614, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.9921875, + "rewards/margins": 5.5, + "rewards/rejected": -4.53125, + "step": 456 + }, + { + "epoch": 0.5607361963190184, + "grad_norm": 37.602299554825706, + "learning_rate": 4.1074380165289253e-07, + "logits/chosen": -0.1865234375, + "logits/rejected": -0.326171875, + "logps/chosen": -354.0, + "logps/rejected": -312.0, + "loss": 0.2718, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.1484375, + "rewards/margins": 5.0, + "rewards/rejected": -3.84375, + "step": 457 + }, + { + "epoch": 0.561963190184049, + "grad_norm": 34.248759383891915, + "learning_rate": 4.105371900826446e-07, + "logits/chosen": -0.203125, + "logits/rejected": -0.375, + "logps/chosen": -372.0, + "logps/rejected": -282.0, + "loss": 0.2095, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.671875, + "rewards/margins": 6.03125, + "rewards/rejected": -4.34375, + "step": 458 + }, + { + "epoch": 0.5631901840490797, + "grad_norm": 36.02884511565117, + "learning_rate": 4.103305785123967e-07, + "logits/chosen": -0.1923828125, + "logits/rejected": -0.37109375, + "logps/chosen": -390.0, + "logps/rejected": -334.0, + "loss": 0.2657, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.6875, + "rewards/margins": 5.875, + "rewards/rejected": -4.1875, + "step": 459 + }, + { + "epoch": 0.5644171779141104, + "grad_norm": 39.138490077598576, + "learning_rate": 4.101239669421487e-07, + "logits/chosen": -0.19140625, + "logits/rejected": -0.3046875, + "logps/chosen": -348.0, + "logps/rejected": -318.0, + "loss": 0.2605, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 0.8125, + "rewards/margins": 5.75, + "rewards/rejected": -4.9375, + "step": 460 + }, + { + "epoch": 0.5656441717791411, + "grad_norm": 42.1658732163214, + "learning_rate": 4.099173553719008e-07, + "logits/chosen": -0.37890625, + "logits/rejected": -0.5078125, + "logps/chosen": -372.0, + "logps/rejected": -332.0, + "loss": 0.2725, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.9765625, + "rewards/margins": 5.3125, + "rewards/rejected": -4.34375, + "step": 461 + }, + { + "epoch": 0.5668711656441717, + "grad_norm": 41.91165523140955, + "learning_rate": 4.0971074380165287e-07, + "logits/chosen": -0.1474609375, + "logits/rejected": -0.34375, + "logps/chosen": -360.0, + "logps/rejected": -288.0, + "loss": 0.3075, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.8203125, + "rewards/margins": 4.625, + "rewards/rejected": -3.8125, + "step": 462 + }, + { + "epoch": 0.5680981595092025, + "grad_norm": 38.69169820185617, + "learning_rate": 4.0950413223140497e-07, + "logits/chosen": -0.248046875, + "logits/rejected": -0.365234375, + "logps/chosen": -362.0, + "logps/rejected": -348.0, + "loss": 0.2766, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.15625, + "rewards/margins": 5.5, + "rewards/rejected": -4.34375, + "step": 463 + }, + { + "epoch": 0.5693251533742332, + "grad_norm": 43.91810675336078, + "learning_rate": 4.09297520661157e-07, + "logits/chosen": -0.12890625, + "logits/rejected": -0.314453125, + "logps/chosen": -390.0, + "logps/rejected": -310.0, + "loss": 0.2966, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.0, + "rewards/margins": 5.28125, + "rewards/rejected": -4.28125, + "step": 464 + }, + { + "epoch": 0.5705521472392638, + "grad_norm": 33.81460512528705, + "learning_rate": 4.090909090909091e-07, + "logits/chosen": -0.2451171875, + "logits/rejected": -0.482421875, + "logps/chosen": -398.0, + "logps/rejected": -332.0, + "loss": 0.1974, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.21875, + "rewards/margins": 5.96875, + "rewards/rejected": -4.75, + "step": 465 + }, + { + "epoch": 0.5717791411042945, + "grad_norm": 43.114669278637464, + "learning_rate": 4.088842975206611e-07, + "logits/chosen": -0.1923828125, + "logits/rejected": -0.33203125, + "logps/chosen": -416.0, + "logps/rejected": -330.0, + "loss": 0.2803, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.921875, + "rewards/margins": 5.6875, + "rewards/rejected": -4.75, + "step": 466 + }, + { + "epoch": 0.5730061349693252, + "grad_norm": 41.26777561271183, + "learning_rate": 4.086776859504132e-07, + "logits/chosen": -0.201171875, + "logits/rejected": -0.4296875, + "logps/chosen": -384.0, + "logps/rejected": -342.0, + "loss": 0.2918, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.2734375, + "rewards/margins": 5.59375, + "rewards/rejected": -4.34375, + "step": 467 + }, + { + "epoch": 0.5742331288343558, + "grad_norm": 46.80452187024971, + "learning_rate": 4.0847107438016526e-07, + "logits/chosen": -0.2041015625, + "logits/rejected": -0.357421875, + "logps/chosen": -366.0, + "logps/rejected": -336.0, + "loss": 0.2962, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.0703125, + "rewards/margins": 5.875, + "rewards/rejected": -4.8125, + "step": 468 + }, + { + "epoch": 0.5754601226993865, + "grad_norm": 35.72783758477153, + "learning_rate": 4.0826446280991736e-07, + "logits/chosen": -0.1611328125, + "logits/rejected": -0.341796875, + "logps/chosen": -386.0, + "logps/rejected": -296.0, + "loss": 0.194, + "rewards/accuracies": 0.9140625, + "rewards/chosen": 1.203125, + "rewards/margins": 5.96875, + "rewards/rejected": -4.78125, + "step": 469 + }, + { + "epoch": 0.5766871165644172, + "grad_norm": 36.63750325467396, + "learning_rate": 4.080578512396694e-07, + "logits/chosen": -0.1904296875, + "logits/rejected": -0.279296875, + "logps/chosen": -352.0, + "logps/rejected": -316.0, + "loss": 0.2875, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.1875, + "rewards/margins": 5.8125, + "rewards/rejected": -4.625, + "step": 470 + }, + { + "epoch": 0.5779141104294478, + "grad_norm": 41.264612609731145, + "learning_rate": 4.0785123966942145e-07, + "logits/chosen": -0.07373046875, + "logits/rejected": -0.2451171875, + "logps/chosen": -402.0, + "logps/rejected": -328.0, + "loss": 0.2914, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.94140625, + "rewards/margins": 5.28125, + "rewards/rejected": -4.34375, + "step": 471 + }, + { + "epoch": 0.5791411042944785, + "grad_norm": 45.183894833304514, + "learning_rate": 4.0764462809917355e-07, + "logits/chosen": -0.126953125, + "logits/rejected": -0.34765625, + "logps/chosen": -408.0, + "logps/rejected": -314.0, + "loss": 0.2808, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.078125, + "rewards/margins": 5.53125, + "rewards/rejected": -4.4375, + "step": 472 + }, + { + "epoch": 0.5803680981595092, + "grad_norm": 43.25551760993764, + "learning_rate": 4.074380165289256e-07, + "logits/chosen": -0.287109375, + "logits/rejected": -0.4140625, + "logps/chosen": -398.0, + "logps/rejected": -370.0, + "loss": 0.2992, + "rewards/accuracies": 0.796875, + "rewards/chosen": 1.078125, + "rewards/margins": 5.3125, + "rewards/rejected": -4.25, + "step": 473 + }, + { + "epoch": 0.5815950920245399, + "grad_norm": 36.874064189408784, + "learning_rate": 4.072314049586777e-07, + "logits/chosen": -0.25, + "logits/rejected": -0.4609375, + "logps/chosen": -430.0, + "logps/rejected": -338.0, + "loss": 0.2515, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.984375, + "rewards/margins": 5.5, + "rewards/rejected": -4.53125, + "step": 474 + }, + { + "epoch": 0.5828220858895705, + "grad_norm": 33.97530110519338, + "learning_rate": 4.070247933884297e-07, + "logits/chosen": -0.232421875, + "logits/rejected": -0.45703125, + "logps/chosen": -426.0, + "logps/rejected": -338.0, + "loss": 0.2189, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.8828125, + "rewards/margins": 6.6875, + "rewards/rejected": -4.8125, + "step": 475 + }, + { + "epoch": 0.5840490797546012, + "grad_norm": 32.31826742696185, + "learning_rate": 4.068181818181818e-07, + "logits/chosen": -0.1806640625, + "logits/rejected": -0.373046875, + "logps/chosen": -406.0, + "logps/rejected": -330.0, + "loss": 0.2688, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 0.462890625, + "rewards/margins": 5.125, + "rewards/rejected": -4.65625, + "step": 476 + }, + { + "epoch": 0.5852760736196319, + "grad_norm": 36.47831028156178, + "learning_rate": 4.0661157024793384e-07, + "logits/chosen": -0.287109375, + "logits/rejected": -0.439453125, + "logps/chosen": -418.0, + "logps/rejected": -342.0, + "loss": 0.2274, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.5625, + "rewards/margins": 6.28125, + "rewards/rejected": -4.71875, + "step": 477 + }, + { + "epoch": 0.5865030674846625, + "grad_norm": 38.16498737596341, + "learning_rate": 4.0640495867768594e-07, + "logits/chosen": -0.205078125, + "logits/rejected": -0.380859375, + "logps/chosen": -418.0, + "logps/rejected": -338.0, + "loss": 0.2857, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.2265625, + "rewards/margins": 5.9375, + "rewards/rejected": -4.71875, + "step": 478 + }, + { + "epoch": 0.5877300613496933, + "grad_norm": 41.81318374412193, + "learning_rate": 4.06198347107438e-07, + "logits/chosen": -0.2060546875, + "logits/rejected": -0.462890625, + "logps/chosen": -352.0, + "logps/rejected": -324.0, + "loss": 0.2644, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.58203125, + "rewards/margins": 5.46875, + "rewards/rejected": -4.90625, + "step": 479 + }, + { + "epoch": 0.588957055214724, + "grad_norm": 34.21678743382818, + "learning_rate": 4.059917355371901e-07, + "logits/chosen": -0.251953125, + "logits/rejected": -0.38671875, + "logps/chosen": -356.0, + "logps/rejected": -318.0, + "loss": 0.2258, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.68359375, + "rewards/margins": 5.6875, + "rewards/rejected": -5.0, + "step": 480 + }, + { + "epoch": 0.5901840490797546, + "grad_norm": 41.214709064982436, + "learning_rate": 4.0578512396694213e-07, + "logits/chosen": -0.25, + "logits/rejected": -0.376953125, + "logps/chosen": -424.0, + "logps/rejected": -370.0, + "loss": 0.3414, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.94921875, + "rewards/margins": 5.5, + "rewards/rejected": -4.5625, + "step": 481 + }, + { + "epoch": 0.5914110429447853, + "grad_norm": 34.07376051032277, + "learning_rate": 4.0557851239669423e-07, + "logits/chosen": -0.2431640625, + "logits/rejected": -0.416015625, + "logps/chosen": -410.0, + "logps/rejected": -326.0, + "loss": 0.269, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.0859375, + "rewards/margins": 5.71875, + "rewards/rejected": -4.65625, + "step": 482 + }, + { + "epoch": 0.592638036809816, + "grad_norm": 37.03436000175101, + "learning_rate": 4.053719008264463e-07, + "logits/chosen": -0.11572265625, + "logits/rejected": -0.263671875, + "logps/chosen": -346.0, + "logps/rejected": -304.0, + "loss": 0.2869, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.71484375, + "rewards/margins": 5.375, + "rewards/rejected": -4.65625, + "step": 483 + }, + { + "epoch": 0.5938650306748466, + "grad_norm": 37.50453607778557, + "learning_rate": 4.0516528925619833e-07, + "logits/chosen": -0.1953125, + "logits/rejected": -0.349609375, + "logps/chosen": -370.0, + "logps/rejected": -318.0, + "loss": 0.3017, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.171875, + "rewards/margins": 5.375, + "rewards/rejected": -4.21875, + "step": 484 + }, + { + "epoch": 0.5950920245398773, + "grad_norm": 35.082772186969954, + "learning_rate": 4.049586776859504e-07, + "logits/chosen": -0.16796875, + "logits/rejected": -0.31640625, + "logps/chosen": -360.0, + "logps/rejected": -298.0, + "loss": 0.2666, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.6796875, + "rewards/margins": 5.53125, + "rewards/rejected": -4.84375, + "step": 485 + }, + { + "epoch": 0.596319018404908, + "grad_norm": 34.67777878301507, + "learning_rate": 4.047520661157025e-07, + "logits/chosen": -0.1923828125, + "logits/rejected": -0.33203125, + "logps/chosen": -404.0, + "logps/rejected": -330.0, + "loss": 0.2405, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.28125, + "rewards/margins": 5.625, + "rewards/rejected": -4.34375, + "step": 486 + }, + { + "epoch": 0.5975460122699386, + "grad_norm": 36.99824119978169, + "learning_rate": 4.045454545454545e-07, + "logits/chosen": -0.24609375, + "logits/rejected": -0.458984375, + "logps/chosen": -404.0, + "logps/rejected": -344.0, + "loss": 0.2534, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.96875, + "rewards/margins": 6.0, + "rewards/rejected": -5.0, + "step": 487 + }, + { + "epoch": 0.5987730061349693, + "grad_norm": 47.34405656815455, + "learning_rate": 4.0433884297520657e-07, + "logits/chosen": -0.25390625, + "logits/rejected": -0.33984375, + "logps/chosen": -420.0, + "logps/rejected": -354.0, + "loss": 0.2559, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.9375, + "rewards/margins": 5.625, + "rewards/rejected": -4.6875, + "step": 488 + }, + { + "epoch": 0.6, + "grad_norm": 32.18985964645197, + "learning_rate": 4.0413223140495867e-07, + "logits/chosen": -0.171875, + "logits/rejected": -0.421875, + "logps/chosen": -380.0, + "logps/rejected": -320.0, + "loss": 0.2603, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.4609375, + "rewards/margins": 6.375, + "rewards/rejected": -4.90625, + "step": 489 + }, + { + "epoch": 0.6012269938650306, + "grad_norm": 41.3641809975054, + "learning_rate": 4.039256198347107e-07, + "logits/chosen": -0.14453125, + "logits/rejected": -0.369140625, + "logps/chosen": -424.0, + "logps/rejected": -346.0, + "loss": 0.2435, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 0.9609375, + "rewards/margins": 5.78125, + "rewards/rejected": -4.8125, + "step": 490 + }, + { + "epoch": 0.6024539877300613, + "grad_norm": 36.929475951535615, + "learning_rate": 4.037190082644628e-07, + "logits/chosen": -0.1279296875, + "logits/rejected": -0.3359375, + "logps/chosen": -368.0, + "logps/rejected": -312.0, + "loss": 0.2468, + "rewards/accuracies": 0.9140625, + "rewards/chosen": 0.76953125, + "rewards/margins": 5.71875, + "rewards/rejected": -4.9375, + "step": 491 + }, + { + "epoch": 0.603680981595092, + "grad_norm": 34.25022073617326, + "learning_rate": 4.0351239669421486e-07, + "logits/chosen": -0.212890625, + "logits/rejected": -0.36328125, + "logps/chosen": -394.0, + "logps/rejected": -374.0, + "loss": 0.2476, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 0.82421875, + "rewards/margins": 5.4375, + "rewards/rejected": -4.625, + "step": 492 + }, + { + "epoch": 0.6049079754601226, + "grad_norm": 44.528399584764976, + "learning_rate": 4.033057851239669e-07, + "logits/chosen": -0.07275390625, + "logits/rejected": -0.18359375, + "logps/chosen": -388.0, + "logps/rejected": -324.0, + "loss": 0.3692, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.67578125, + "rewards/margins": 4.5625, + "rewards/rejected": -3.890625, + "step": 493 + }, + { + "epoch": 0.6061349693251534, + "grad_norm": 33.0051523964255, + "learning_rate": 4.0309917355371896e-07, + "logits/chosen": -0.1591796875, + "logits/rejected": -0.345703125, + "logps/chosen": -426.0, + "logps/rejected": -326.0, + "loss": 0.2292, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.4921875, + "rewards/margins": 6.3125, + "rewards/rejected": -4.8125, + "step": 494 + }, + { + "epoch": 0.6073619631901841, + "grad_norm": 36.62725418587262, + "learning_rate": 4.0289256198347106e-07, + "logits/chosen": -0.16796875, + "logits/rejected": -0.32421875, + "logps/chosen": -400.0, + "logps/rejected": -336.0, + "loss": 0.2572, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.2265625, + "rewards/margins": 5.9375, + "rewards/rejected": -4.71875, + "step": 495 + }, + { + "epoch": 0.6085889570552148, + "grad_norm": 42.16049484237724, + "learning_rate": 4.026859504132231e-07, + "logits/chosen": -0.2138671875, + "logits/rejected": -0.431640625, + "logps/chosen": -378.0, + "logps/rejected": -312.0, + "loss": 0.3108, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.53515625, + "rewards/margins": 5.46875, + "rewards/rejected": -4.90625, + "step": 496 + }, + { + "epoch": 0.6098159509202454, + "grad_norm": 45.47382251482463, + "learning_rate": 4.024793388429752e-07, + "logits/chosen": -0.1669921875, + "logits/rejected": -0.337890625, + "logps/chosen": -400.0, + "logps/rejected": -352.0, + "loss": 0.3664, + "rewards/accuracies": 0.7734375, + "rewards/chosen": 0.51953125, + "rewards/margins": 5.5, + "rewards/rejected": -4.96875, + "step": 497 + }, + { + "epoch": 0.6110429447852761, + "grad_norm": 35.6433892815013, + "learning_rate": 4.0227272727272725e-07, + "logits/chosen": -0.28515625, + "logits/rejected": -0.46484375, + "logps/chosen": -398.0, + "logps/rejected": -354.0, + "loss": 0.2458, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.171875, + "rewards/margins": 6.4375, + "rewards/rejected": -5.25, + "step": 498 + }, + { + "epoch": 0.6122699386503068, + "grad_norm": 37.060767498257135, + "learning_rate": 4.0206611570247935e-07, + "logits/chosen": -0.1630859375, + "logits/rejected": -0.388671875, + "logps/chosen": -424.0, + "logps/rejected": -336.0, + "loss": 0.2685, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.09375, + "rewards/margins": 5.8125, + "rewards/rejected": -4.71875, + "step": 499 + }, + { + "epoch": 0.6134969325153374, + "grad_norm": 35.21143709339605, + "learning_rate": 4.018595041322314e-07, + "logits/chosen": -0.189453125, + "logits/rejected": -0.314453125, + "logps/chosen": -418.0, + "logps/rejected": -322.0, + "loss": 0.2498, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.15625, + "rewards/margins": 5.90625, + "rewards/rejected": -4.75, + "step": 500 + }, + { + "epoch": 0.6147239263803681, + "grad_norm": 39.07038484978643, + "learning_rate": 4.0165289256198345e-07, + "logits/chosen": -0.240234375, + "logits/rejected": -0.373046875, + "logps/chosen": -406.0, + "logps/rejected": -338.0, + "loss": 0.2402, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.515625, + "rewards/margins": 6.5625, + "rewards/rejected": -5.0625, + "step": 501 + }, + { + "epoch": 0.6159509202453988, + "grad_norm": 34.95433271630032, + "learning_rate": 4.014462809917355e-07, + "logits/chosen": -0.20703125, + "logits/rejected": -0.47265625, + "logps/chosen": -382.0, + "logps/rejected": -322.0, + "loss": 0.2631, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.2109375, + "rewards/margins": 6.46875, + "rewards/rejected": -5.28125, + "step": 502 + }, + { + "epoch": 0.6171779141104294, + "grad_norm": 36.27046530070022, + "learning_rate": 4.012396694214876e-07, + "logits/chosen": -0.0498046875, + "logits/rejected": -0.248046875, + "logps/chosen": -328.0, + "logps/rejected": -306.0, + "loss": 0.2571, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.8515625, + "rewards/margins": 5.53125, + "rewards/rejected": -4.65625, + "step": 503 + }, + { + "epoch": 0.6184049079754601, + "grad_norm": 32.074615531320944, + "learning_rate": 4.0103305785123964e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.44140625, + "logps/chosen": -384.0, + "logps/rejected": -326.0, + "loss": 0.253, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.416015625, + "rewards/margins": 5.34375, + "rewards/rejected": -4.9375, + "step": 504 + }, + { + "epoch": 0.6196319018404908, + "grad_norm": 50.2956600108261, + "learning_rate": 4.0082644628099174e-07, + "logits/chosen": -0.263671875, + "logits/rejected": -0.4921875, + "logps/chosen": -424.0, + "logps/rejected": -384.0, + "loss": 0.3428, + "rewards/accuracies": 0.796875, + "rewards/chosen": 0.40234375, + "rewards/margins": 5.6875, + "rewards/rejected": -5.28125, + "step": 505 + }, + { + "epoch": 0.6208588957055214, + "grad_norm": 39.722486070303646, + "learning_rate": 4.006198347107438e-07, + "logits/chosen": -0.1298828125, + "logits/rejected": -0.423828125, + "logps/chosen": -420.0, + "logps/rejected": -320.0, + "loss": 0.2585, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.93359375, + "rewards/margins": 6.0, + "rewards/rejected": -5.0625, + "step": 506 + }, + { + "epoch": 0.6220858895705521, + "grad_norm": 31.372949248189112, + "learning_rate": 4.0041322314049583e-07, + "logits/chosen": -0.22265625, + "logits/rejected": -0.34375, + "logps/chosen": -386.0, + "logps/rejected": -298.0, + "loss": 0.2085, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.92578125, + "rewards/margins": 6.125, + "rewards/rejected": -5.1875, + "step": 507 + }, + { + "epoch": 0.6233128834355828, + "grad_norm": 31.130400720786195, + "learning_rate": 4.0020661157024793e-07, + "logits/chosen": -0.062255859375, + "logits/rejected": -0.2431640625, + "logps/chosen": -386.0, + "logps/rejected": -300.0, + "loss": 0.2241, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 0.91015625, + "rewards/margins": 5.59375, + "rewards/rejected": -4.6875, + "step": 508 + }, + { + "epoch": 0.6245398773006134, + "grad_norm": 53.16460512064989, + "learning_rate": 4e-07, + "logits/chosen": -0.1962890625, + "logits/rejected": -0.4375, + "logps/chosen": -464.0, + "logps/rejected": -374.0, + "loss": 0.3519, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 2.109375, + "rewards/margins": 7.0625, + "rewards/rejected": -4.9375, + "step": 509 + }, + { + "epoch": 0.6257668711656442, + "grad_norm": 33.530586116590285, + "learning_rate": 3.9979338842975203e-07, + "logits/chosen": -0.30859375, + "logits/rejected": -0.474609375, + "logps/chosen": -358.0, + "logps/rejected": -294.0, + "loss": 0.2436, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 0.609375, + "rewards/margins": 5.15625, + "rewards/rejected": -4.5625, + "step": 510 + }, + { + "epoch": 0.6269938650306749, + "grad_norm": 40.068124237732846, + "learning_rate": 3.995867768595041e-07, + "logits/chosen": -0.30078125, + "logits/rejected": -0.439453125, + "logps/chosen": -390.0, + "logps/rejected": -344.0, + "loss": 0.2864, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.2109375, + "rewards/margins": 6.25, + "rewards/rejected": -5.03125, + "step": 511 + }, + { + "epoch": 0.6282208588957056, + "grad_norm": 46.79446957798848, + "learning_rate": 3.993801652892562e-07, + "logits/chosen": -0.1337890625, + "logits/rejected": -0.28515625, + "logps/chosen": -378.0, + "logps/rejected": -376.0, + "loss": 0.3288, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.5625, + "rewards/margins": 4.6875, + "rewards/rejected": -4.125, + "step": 512 + }, + { + "epoch": 0.6294478527607362, + "grad_norm": 39.156027495649305, + "learning_rate": 3.991735537190082e-07, + "logits/chosen": -0.138671875, + "logits/rejected": -0.283203125, + "logps/chosen": -372.0, + "logps/rejected": -302.0, + "loss": 0.335, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.3515625, + "rewards/margins": 5.71875, + "rewards/rejected": -4.375, + "step": 513 + }, + { + "epoch": 0.6306748466257669, + "grad_norm": 32.5774175879679, + "learning_rate": 3.989669421487603e-07, + "logits/chosen": -0.12353515625, + "logits/rejected": -0.279296875, + "logps/chosen": -326.0, + "logps/rejected": -278.0, + "loss": 0.2532, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.220703125, + "rewards/margins": 5.375, + "rewards/rejected": -5.15625, + "step": 514 + }, + { + "epoch": 0.6319018404907976, + "grad_norm": 40.41320321797794, + "learning_rate": 3.9876033057851237e-07, + "logits/chosen": -0.1376953125, + "logits/rejected": -0.291015625, + "logps/chosen": -344.0, + "logps/rejected": -338.0, + "loss": 0.2856, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.2578125, + "rewards/margins": 5.25, + "rewards/rejected": -5.0, + "step": 515 + }, + { + "epoch": 0.6331288343558282, + "grad_norm": 33.09690635668108, + "learning_rate": 3.9855371900826447e-07, + "logits/chosen": -0.1806640625, + "logits/rejected": -0.27734375, + "logps/chosen": -366.0, + "logps/rejected": -320.0, + "loss": 0.2475, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.404296875, + "rewards/margins": 5.34375, + "rewards/rejected": -4.9375, + "step": 516 + }, + { + "epoch": 0.6343558282208589, + "grad_norm": 45.00347742756972, + "learning_rate": 3.983471074380165e-07, + "logits/chosen": -0.166015625, + "logits/rejected": -0.32421875, + "logps/chosen": -388.0, + "logps/rejected": -326.0, + "loss": 0.3686, + "rewards/accuracies": 0.796875, + "rewards/chosen": 0.7265625, + "rewards/margins": 5.0, + "rewards/rejected": -4.28125, + "step": 517 + }, + { + "epoch": 0.6355828220858896, + "grad_norm": 37.888666954836985, + "learning_rate": 3.981404958677686e-07, + "logits/chosen": -0.2421875, + "logits/rejected": -0.369140625, + "logps/chosen": -414.0, + "logps/rejected": -336.0, + "loss": 0.2069, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.328125, + "rewards/margins": 5.96875, + "rewards/rejected": -4.625, + "step": 518 + }, + { + "epoch": 0.6368098159509202, + "grad_norm": 38.80463867569447, + "learning_rate": 3.979338842975206e-07, + "logits/chosen": -0.2294921875, + "logits/rejected": -0.3671875, + "logps/chosen": -380.0, + "logps/rejected": -328.0, + "loss": 0.2446, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.921875, + "rewards/margins": 5.78125, + "rewards/rejected": -4.875, + "step": 519 + }, + { + "epoch": 0.6380368098159509, + "grad_norm": 40.986581892777515, + "learning_rate": 3.977272727272727e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.494140625, + "logps/chosen": -366.0, + "logps/rejected": -320.0, + "loss": 0.3191, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.2265625, + "rewards/margins": 6.3125, + "rewards/rejected": -5.09375, + "step": 520 + }, + { + "epoch": 0.6392638036809816, + "grad_norm": 36.04171128345913, + "learning_rate": 3.9752066115702476e-07, + "logits/chosen": -0.07763671875, + "logits/rejected": -0.2138671875, + "logps/chosen": -412.0, + "logps/rejected": -348.0, + "loss": 0.2642, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.546875, + "rewards/margins": 6.34375, + "rewards/rejected": -4.8125, + "step": 521 + }, + { + "epoch": 0.6404907975460122, + "grad_norm": 36.91350515266316, + "learning_rate": 3.9731404958677686e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.421875, + "logps/chosen": -422.0, + "logps/rejected": -340.0, + "loss": 0.3094, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.15625, + "rewards/margins": 6.46875, + "rewards/rejected": -5.3125, + "step": 522 + }, + { + "epoch": 0.6417177914110429, + "grad_norm": 42.88283547574401, + "learning_rate": 3.971074380165289e-07, + "logits/chosen": -0.1923828125, + "logits/rejected": -0.337890625, + "logps/chosen": -362.0, + "logps/rejected": -316.0, + "loss": 0.3333, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.6171875, + "rewards/margins": 5.09375, + "rewards/rejected": -4.46875, + "step": 523 + }, + { + "epoch": 0.6429447852760736, + "grad_norm": 45.322523177242, + "learning_rate": 3.9690082644628095e-07, + "logits/chosen": -0.1611328125, + "logits/rejected": -0.361328125, + "logps/chosen": -422.0, + "logps/rejected": -350.0, + "loss": 0.3031, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.609375, + "rewards/margins": 5.21875, + "rewards/rejected": -4.59375, + "step": 524 + }, + { + "epoch": 0.6441717791411042, + "grad_norm": 49.70289783132654, + "learning_rate": 3.9669421487603305e-07, + "logits/chosen": -0.1650390625, + "logits/rejected": -0.2294921875, + "logps/chosen": -388.0, + "logps/rejected": -356.0, + "loss": 0.3567, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.578125, + "rewards/margins": 4.8125, + "rewards/rejected": -4.25, + "step": 525 + }, + { + "epoch": 0.645398773006135, + "grad_norm": 36.78598991927111, + "learning_rate": 3.964876033057851e-07, + "logits/chosen": -0.1845703125, + "logits/rejected": -0.3359375, + "logps/chosen": -386.0, + "logps/rejected": -328.0, + "loss": 0.2502, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.98828125, + "rewards/margins": 5.9375, + "rewards/rejected": -4.96875, + "step": 526 + }, + { + "epoch": 0.6466257668711657, + "grad_norm": 36.651686257226466, + "learning_rate": 3.962809917355372e-07, + "logits/chosen": -0.125, + "logits/rejected": -0.345703125, + "logps/chosen": -422.0, + "logps/rejected": -318.0, + "loss": 0.2789, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.85546875, + "rewards/margins": 5.625, + "rewards/rejected": -4.78125, + "step": 527 + }, + { + "epoch": 0.6478527607361964, + "grad_norm": 35.31748764596186, + "learning_rate": 3.960743801652892e-07, + "logits/chosen": -0.2333984375, + "logits/rejected": -0.427734375, + "logps/chosen": -356.0, + "logps/rejected": -314.0, + "loss": 0.2999, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.625, + "rewards/margins": 5.78125, + "rewards/rejected": -5.15625, + "step": 528 + }, + { + "epoch": 0.649079754601227, + "grad_norm": 36.86996860776575, + "learning_rate": 3.958677685950413e-07, + "logits/chosen": -0.19140625, + "logits/rejected": -0.373046875, + "logps/chosen": -338.0, + "logps/rejected": -326.0, + "loss": 0.3236, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.94140625, + "rewards/margins": 5.5625, + "rewards/rejected": -4.625, + "step": 529 + }, + { + "epoch": 0.6503067484662577, + "grad_norm": 40.308596718463534, + "learning_rate": 3.9566115702479334e-07, + "logits/chosen": -0.1611328125, + "logits/rejected": -0.302734375, + "logps/chosen": -358.0, + "logps/rejected": -338.0, + "loss": 0.307, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.1015625, + "rewards/margins": 5.9375, + "rewards/rejected": -4.84375, + "step": 530 + }, + { + "epoch": 0.6515337423312884, + "grad_norm": 34.92823583852622, + "learning_rate": 3.9545454545454544e-07, + "logits/chosen": -0.2265625, + "logits/rejected": -0.400390625, + "logps/chosen": -382.0, + "logps/rejected": -310.0, + "loss": 0.2686, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.046875, + "rewards/margins": 5.5625, + "rewards/rejected": -4.5, + "step": 531 + }, + { + "epoch": 0.652760736196319, + "grad_norm": 35.9537343386399, + "learning_rate": 3.952479338842975e-07, + "logits/chosen": -0.12158203125, + "logits/rejected": -0.263671875, + "logps/chosen": -384.0, + "logps/rejected": -318.0, + "loss": 0.2733, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.91015625, + "rewards/margins": 5.25, + "rewards/rejected": -4.3125, + "step": 532 + }, + { + "epoch": 0.6539877300613497, + "grad_norm": 33.35300325251816, + "learning_rate": 3.950413223140496e-07, + "logits/chosen": -0.275390625, + "logits/rejected": -0.482421875, + "logps/chosen": -404.0, + "logps/rejected": -338.0, + "loss": 0.2339, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.6640625, + "rewards/margins": 6.46875, + "rewards/rejected": -4.78125, + "step": 533 + }, + { + "epoch": 0.6552147239263804, + "grad_norm": 33.59071906368527, + "learning_rate": 3.9483471074380164e-07, + "logits/chosen": -0.1416015625, + "logits/rejected": -0.26953125, + "logps/chosen": -364.0, + "logps/rejected": -316.0, + "loss": 0.2687, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.0, + "rewards/margins": 5.1875, + "rewards/rejected": -4.15625, + "step": 534 + }, + { + "epoch": 0.656441717791411, + "grad_norm": 37.966223525168424, + "learning_rate": 3.9462809917355374e-07, + "logits/chosen": -0.2470703125, + "logits/rejected": -0.3671875, + "logps/chosen": -368.0, + "logps/rejected": -324.0, + "loss": 0.2745, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.359375, + "rewards/margins": 5.15625, + "rewards/rejected": -4.78125, + "step": 535 + }, + { + "epoch": 0.6576687116564417, + "grad_norm": 33.781725934858414, + "learning_rate": 3.944214876033058e-07, + "logits/chosen": -0.19140625, + "logits/rejected": -0.30859375, + "logps/chosen": -386.0, + "logps/rejected": -308.0, + "loss": 0.2154, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.4140625, + "rewards/margins": 6.09375, + "rewards/rejected": -4.6875, + "step": 536 + }, + { + "epoch": 0.6588957055214724, + "grad_norm": 47.92234178996883, + "learning_rate": 3.9421487603305783e-07, + "logits/chosen": -0.1904296875, + "logits/rejected": -0.349609375, + "logps/chosen": -380.0, + "logps/rejected": -302.0, + "loss": 0.3881, + "rewards/accuracies": 0.7734375, + "rewards/chosen": 0.1796875, + "rewards/margins": 4.375, + "rewards/rejected": -4.1875, + "step": 537 + }, + { + "epoch": 0.660122699386503, + "grad_norm": 42.47717470031941, + "learning_rate": 3.940082644628099e-07, + "logits/chosen": -0.150390625, + "logits/rejected": -0.33984375, + "logps/chosen": -396.0, + "logps/rejected": -342.0, + "loss": 0.3398, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.40625, + "rewards/margins": 5.6875, + "rewards/rejected": -4.28125, + "step": 538 + }, + { + "epoch": 0.6613496932515337, + "grad_norm": 37.22523933086588, + "learning_rate": 3.93801652892562e-07, + "logits/chosen": -0.154296875, + "logits/rejected": -0.30078125, + "logps/chosen": -394.0, + "logps/rejected": -334.0, + "loss": 0.2742, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.3203125, + "rewards/margins": 5.1875, + "rewards/rejected": -3.859375, + "step": 539 + }, + { + "epoch": 0.6625766871165644, + "grad_norm": 40.71616745650965, + "learning_rate": 3.93595041322314e-07, + "logits/chosen": -0.1328125, + "logits/rejected": -0.30859375, + "logps/chosen": -390.0, + "logps/rejected": -318.0, + "loss": 0.3006, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.34375, + "rewards/margins": 5.84375, + "rewards/rejected": -4.5, + "step": 540 + }, + { + "epoch": 0.6638036809815951, + "grad_norm": 36.00028869643927, + "learning_rate": 3.933884297520661e-07, + "logits/chosen": -0.1552734375, + "logits/rejected": -0.259765625, + "logps/chosen": -386.0, + "logps/rejected": -340.0, + "loss": 0.2699, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.71875, + "rewards/margins": 4.8125, + "rewards/rejected": -4.09375, + "step": 541 + }, + { + "epoch": 0.6650306748466258, + "grad_norm": 36.856579052467744, + "learning_rate": 3.9318181818181817e-07, + "logits/chosen": -0.1845703125, + "logits/rejected": -0.29296875, + "logps/chosen": -352.0, + "logps/rejected": -310.0, + "loss": 0.2808, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.265625, + "rewards/margins": 5.25, + "rewards/rejected": -4.0, + "step": 542 + }, + { + "epoch": 0.6662576687116565, + "grad_norm": 37.076885533693634, + "learning_rate": 3.929752066115702e-07, + "logits/chosen": -0.2255859375, + "logits/rejected": -0.41015625, + "logps/chosen": -446.0, + "logps/rejected": -342.0, + "loss": 0.2335, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.9296875, + "rewards/margins": 6.25, + "rewards/rejected": -4.3125, + "step": 543 + }, + { + "epoch": 0.6674846625766871, + "grad_norm": 48.36100783202625, + "learning_rate": 3.927685950413223e-07, + "logits/chosen": -0.20703125, + "logits/rejected": -0.35546875, + "logps/chosen": -374.0, + "logps/rejected": -306.0, + "loss": 0.3321, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.84375, + "rewards/margins": 5.4375, + "rewards/rejected": -4.59375, + "step": 544 + }, + { + "epoch": 0.6687116564417178, + "grad_norm": 43.36042581975704, + "learning_rate": 3.9256198347107437e-07, + "logits/chosen": -0.25, + "logits/rejected": -0.427734375, + "logps/chosen": -452.0, + "logps/rejected": -354.0, + "loss": 0.3606, + "rewards/accuracies": 0.796875, + "rewards/chosen": 1.6171875, + "rewards/margins": 5.5, + "rewards/rejected": -3.890625, + "step": 545 + }, + { + "epoch": 0.6699386503067485, + "grad_norm": 39.63701590605686, + "learning_rate": 3.923553719008264e-07, + "logits/chosen": -0.1416015625, + "logits/rejected": -0.251953125, + "logps/chosen": -370.0, + "logps/rejected": -326.0, + "loss": 0.3095, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.203125, + "rewards/margins": 5.5625, + "rewards/rejected": -4.34375, + "step": 546 + }, + { + "epoch": 0.6711656441717792, + "grad_norm": 33.08408154520663, + "learning_rate": 3.9214876033057846e-07, + "logits/chosen": -0.205078125, + "logits/rejected": -0.380859375, + "logps/chosen": -380.0, + "logps/rejected": -300.0, + "loss": 0.2677, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.53125, + "rewards/margins": 5.78125, + "rewards/rejected": -4.25, + "step": 547 + }, + { + "epoch": 0.6723926380368098, + "grad_norm": 41.01241845328248, + "learning_rate": 3.9194214876033056e-07, + "logits/chosen": -0.251953125, + "logits/rejected": -0.47265625, + "logps/chosen": -396.0, + "logps/rejected": -346.0, + "loss": 0.2427, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.6640625, + "rewards/margins": 5.5625, + "rewards/rejected": -3.90625, + "step": 548 + }, + { + "epoch": 0.6736196319018405, + "grad_norm": 38.04742407115687, + "learning_rate": 3.917355371900826e-07, + "logits/chosen": -0.158203125, + "logits/rejected": -0.37890625, + "logps/chosen": -408.0, + "logps/rejected": -332.0, + "loss": 0.2684, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.3203125, + "rewards/margins": 5.375, + "rewards/rejected": -4.0625, + "step": 549 + }, + { + "epoch": 0.6748466257668712, + "grad_norm": 38.74485204677174, + "learning_rate": 3.915289256198347e-07, + "logits/chosen": -0.2333984375, + "logits/rejected": -0.314453125, + "logps/chosen": -392.0, + "logps/rejected": -312.0, + "loss": 0.3275, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.1015625, + "rewards/margins": 4.875, + "rewards/rejected": -3.78125, + "step": 550 + }, + { + "epoch": 0.6760736196319018, + "grad_norm": 36.24315774996275, + "learning_rate": 3.9132231404958675e-07, + "logits/chosen": -0.1474609375, + "logits/rejected": -0.279296875, + "logps/chosen": -402.0, + "logps/rejected": -328.0, + "loss": 0.2537, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.9375, + "rewards/margins": 5.65625, + "rewards/rejected": -3.71875, + "step": 551 + }, + { + "epoch": 0.6773006134969325, + "grad_norm": 36.45208223894636, + "learning_rate": 3.9111570247933885e-07, + "logits/chosen": -0.232421875, + "logits/rejected": -0.375, + "logps/chosen": -410.0, + "logps/rejected": -344.0, + "loss": 0.2933, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.359375, + "rewards/margins": 5.28125, + "rewards/rejected": -3.921875, + "step": 552 + }, + { + "epoch": 0.6785276073619632, + "grad_norm": 41.631610478201644, + "learning_rate": 3.909090909090909e-07, + "logits/chosen": -0.18359375, + "logits/rejected": -0.333984375, + "logps/chosen": -356.0, + "logps/rejected": -324.0, + "loss": 0.3207, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.7890625, + "rewards/margins": 4.59375, + "rewards/rejected": -3.796875, + "step": 553 + }, + { + "epoch": 0.6797546012269938, + "grad_norm": 33.49412012982899, + "learning_rate": 3.90702479338843e-07, + "logits/chosen": -0.1328125, + "logits/rejected": -0.34375, + "logps/chosen": -424.0, + "logps/rejected": -316.0, + "loss": 0.2289, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.84375, + "rewards/margins": 5.625, + "rewards/rejected": -3.796875, + "step": 554 + }, + { + "epoch": 0.6809815950920245, + "grad_norm": 37.66391393717185, + "learning_rate": 3.90495867768595e-07, + "logits/chosen": -0.03759765625, + "logits/rejected": -0.1650390625, + "logps/chosen": -352.0, + "logps/rejected": -296.0, + "loss": 0.3404, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.4296875, + "rewards/margins": 5.15625, + "rewards/rejected": -3.71875, + "step": 555 + }, + { + "epoch": 0.6822085889570552, + "grad_norm": 30.301075310625425, + "learning_rate": 3.902892561983471e-07, + "logits/chosen": -0.1552734375, + "logits/rejected": -0.37109375, + "logps/chosen": -414.0, + "logps/rejected": -334.0, + "loss": 0.2278, + "rewards/accuracies": 0.84375, + "rewards/chosen": 2.140625, + "rewards/margins": 6.1875, + "rewards/rejected": -4.0625, + "step": 556 + }, + { + "epoch": 0.6834355828220859, + "grad_norm": 33.83430112648751, + "learning_rate": 3.9008264462809914e-07, + "logits/chosen": -0.16796875, + "logits/rejected": -0.392578125, + "logps/chosen": -386.0, + "logps/rejected": -320.0, + "loss": 0.2682, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.78125, + "rewards/margins": 5.4375, + "rewards/rejected": -3.65625, + "step": 557 + }, + { + "epoch": 0.6846625766871166, + "grad_norm": 30.75402635256423, + "learning_rate": 3.8987603305785124e-07, + "logits/chosen": -0.1298828125, + "logits/rejected": -0.287109375, + "logps/chosen": -364.0, + "logps/rejected": -314.0, + "loss": 0.2312, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.09375, + "rewards/margins": 5.78125, + "rewards/rejected": -4.6875, + "step": 558 + }, + { + "epoch": 0.6858895705521473, + "grad_norm": 40.61066869149253, + "learning_rate": 3.896694214876033e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.388671875, + "logps/chosen": -374.0, + "logps/rejected": -328.0, + "loss": 0.3017, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.2734375, + "rewards/margins": 5.5, + "rewards/rejected": -4.21875, + "step": 559 + }, + { + "epoch": 0.6871165644171779, + "grad_norm": 28.075176930111862, + "learning_rate": 3.8946280991735534e-07, + "logits/chosen": -0.34375, + "logits/rejected": -0.494140625, + "logps/chosen": -382.0, + "logps/rejected": -316.0, + "loss": 0.1832, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.6171875, + "rewards/margins": 6.4375, + "rewards/rejected": -4.8125, + "step": 560 + }, + { + "epoch": 0.6883435582822086, + "grad_norm": 31.670561048270176, + "learning_rate": 3.8925619834710744e-07, + "logits/chosen": -0.208984375, + "logits/rejected": -0.390625, + "logps/chosen": -348.0, + "logps/rejected": -288.0, + "loss": 0.2243, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.390625, + "rewards/margins": 5.84375, + "rewards/rejected": -4.4375, + "step": 561 + }, + { + "epoch": 0.6895705521472393, + "grad_norm": 32.855068201542075, + "learning_rate": 3.890495867768595e-07, + "logits/chosen": -0.087890625, + "logits/rejected": -0.287109375, + "logps/chosen": -368.0, + "logps/rejected": -308.0, + "loss": 0.2422, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.84375, + "rewards/margins": 5.28125, + "rewards/rejected": -4.4375, + "step": 562 + }, + { + "epoch": 0.69079754601227, + "grad_norm": 35.79449426535959, + "learning_rate": 3.888429752066116e-07, + "logits/chosen": -0.244140625, + "logits/rejected": -0.40625, + "logps/chosen": -388.0, + "logps/rejected": -358.0, + "loss": 0.2546, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.7109375, + "rewards/margins": 6.28125, + "rewards/rejected": -4.5625, + "step": 563 + }, + { + "epoch": 0.6920245398773006, + "grad_norm": 29.77603709052077, + "learning_rate": 3.886363636363636e-07, + "logits/chosen": -0.255859375, + "logits/rejected": -0.37890625, + "logps/chosen": -384.0, + "logps/rejected": -324.0, + "loss": 0.2408, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.015625, + "rewards/margins": 5.3125, + "rewards/rejected": -4.3125, + "step": 564 + }, + { + "epoch": 0.6932515337423313, + "grad_norm": 35.70334442848756, + "learning_rate": 3.884297520661157e-07, + "logits/chosen": -0.19921875, + "logits/rejected": -0.400390625, + "logps/chosen": -392.0, + "logps/rejected": -330.0, + "loss": 0.3131, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.859375, + "rewards/margins": 4.84375, + "rewards/rejected": -3.96875, + "step": 565 + }, + { + "epoch": 0.694478527607362, + "grad_norm": 35.48298237028605, + "learning_rate": 3.882231404958677e-07, + "logits/chosen": -0.2109375, + "logits/rejected": -0.322265625, + "logps/chosen": -412.0, + "logps/rejected": -326.0, + "loss": 0.2452, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.5859375, + "rewards/margins": 5.96875, + "rewards/rejected": -4.375, + "step": 566 + }, + { + "epoch": 0.6957055214723926, + "grad_norm": 31.112271919353073, + "learning_rate": 3.880165289256198e-07, + "logits/chosen": -0.11572265625, + "logits/rejected": -0.251953125, + "logps/chosen": -314.0, + "logps/rejected": -266.0, + "loss": 0.2267, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 0.58203125, + "rewards/margins": 4.8125, + "rewards/rejected": -4.21875, + "step": 567 + }, + { + "epoch": 0.6969325153374233, + "grad_norm": 38.89246029311522, + "learning_rate": 3.8780991735537187e-07, + "logits/chosen": -0.2353515625, + "logits/rejected": -0.314453125, + "logps/chosen": -380.0, + "logps/rejected": -316.0, + "loss": 0.2865, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.109375, + "rewards/margins": 5.59375, + "rewards/rejected": -4.46875, + "step": 568 + }, + { + "epoch": 0.698159509202454, + "grad_norm": 34.50521407178372, + "learning_rate": 3.8760330578512397e-07, + "logits/chosen": -0.1552734375, + "logits/rejected": -0.3046875, + "logps/chosen": -380.0, + "logps/rejected": -298.0, + "loss": 0.2647, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.7578125, + "rewards/margins": 5.0625, + "rewards/rejected": -4.3125, + "step": 569 + }, + { + "epoch": 0.6993865030674846, + "grad_norm": 27.986690455754786, + "learning_rate": 3.87396694214876e-07, + "logits/chosen": -0.3125, + "logits/rejected": -0.451171875, + "logps/chosen": -400.0, + "logps/rejected": -330.0, + "loss": 0.18, + "rewards/accuracies": 0.9453125, + "rewards/chosen": 1.5703125, + "rewards/margins": 6.25, + "rewards/rejected": -4.6875, + "step": 570 + }, + { + "epoch": 0.7006134969325153, + "grad_norm": 32.36101057946353, + "learning_rate": 3.871900826446281e-07, + "logits/chosen": -0.193359375, + "logits/rejected": -0.32421875, + "logps/chosen": -326.0, + "logps/rejected": -300.0, + "loss": 0.2221, + "rewards/accuracies": 0.890625, + "rewards/chosen": 0.625, + "rewards/margins": 5.0625, + "rewards/rejected": -4.4375, + "step": 571 + }, + { + "epoch": 0.701840490797546, + "grad_norm": 36.69242569066846, + "learning_rate": 3.8698347107438017e-07, + "logits/chosen": -0.166015625, + "logits/rejected": -0.3203125, + "logps/chosen": -384.0, + "logps/rejected": -358.0, + "loss": 0.2363, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.5859375, + "rewards/margins": 5.96875, + "rewards/rejected": -4.40625, + "step": 572 + }, + { + "epoch": 0.7030674846625767, + "grad_norm": 41.66310475024957, + "learning_rate": 3.867768595041322e-07, + "logits/chosen": -0.1240234375, + "logits/rejected": -0.26953125, + "logps/chosen": -388.0, + "logps/rejected": -326.0, + "loss": 0.3484, + "rewards/accuracies": 0.796875, + "rewards/chosen": 0.51171875, + "rewards/margins": 5.09375, + "rewards/rejected": -4.59375, + "step": 573 + }, + { + "epoch": 0.7042944785276074, + "grad_norm": 39.39212100565405, + "learning_rate": 3.8657024793388426e-07, + "logits/chosen": -0.2470703125, + "logits/rejected": -0.376953125, + "logps/chosen": -322.0, + "logps/rejected": -302.0, + "loss": 0.2719, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.89453125, + "rewards/margins": 5.53125, + "rewards/rejected": -4.625, + "step": 574 + }, + { + "epoch": 0.7055214723926381, + "grad_norm": 35.35137643401559, + "learning_rate": 3.8636363636363636e-07, + "logits/chosen": -0.283203125, + "logits/rejected": -0.458984375, + "logps/chosen": -406.0, + "logps/rejected": -364.0, + "loss": 0.2178, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.6875, + "rewards/margins": 6.65625, + "rewards/rejected": -4.96875, + "step": 575 + }, + { + "epoch": 0.7067484662576687, + "grad_norm": 28.9202010136064, + "learning_rate": 3.861570247933884e-07, + "logits/chosen": -0.1494140625, + "logits/rejected": -0.36328125, + "logps/chosen": -380.0, + "logps/rejected": -320.0, + "loss": 0.1958, + "rewards/accuracies": 0.921875, + "rewards/chosen": 1.59375, + "rewards/margins": 6.75, + "rewards/rejected": -5.15625, + "step": 576 + }, + { + "epoch": 0.7079754601226994, + "grad_norm": 36.46431827427722, + "learning_rate": 3.8595041322314045e-07, + "logits/chosen": -0.09033203125, + "logits/rejected": -0.23046875, + "logps/chosen": -362.0, + "logps/rejected": -312.0, + "loss": 0.2593, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.4296875, + "rewards/margins": 6.59375, + "rewards/rejected": -5.1875, + "step": 577 + }, + { + "epoch": 0.7092024539877301, + "grad_norm": 40.66901563749969, + "learning_rate": 3.8574380165289255e-07, + "logits/chosen": -0.2421875, + "logits/rejected": -0.3984375, + "logps/chosen": -416.0, + "logps/rejected": -326.0, + "loss": 0.3148, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.484375, + "rewards/margins": 6.46875, + "rewards/rejected": -5.0, + "step": 578 + }, + { + "epoch": 0.7104294478527607, + "grad_norm": 43.94460926088441, + "learning_rate": 3.855371900826446e-07, + "logits/chosen": -0.2353515625, + "logits/rejected": -0.330078125, + "logps/chosen": -428.0, + "logps/rejected": -326.0, + "loss": 0.3599, + "rewards/accuracies": 0.78125, + "rewards/chosen": 0.498046875, + "rewards/margins": 4.875, + "rewards/rejected": -4.375, + "step": 579 + }, + { + "epoch": 0.7116564417177914, + "grad_norm": 36.521177273018374, + "learning_rate": 3.853305785123967e-07, + "logits/chosen": -0.125, + "logits/rejected": -0.298828125, + "logps/chosen": -380.0, + "logps/rejected": -344.0, + "loss": 0.2355, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.79296875, + "rewards/margins": 6.1875, + "rewards/rejected": -5.40625, + "step": 580 + }, + { + "epoch": 0.7128834355828221, + "grad_norm": 30.81358847829242, + "learning_rate": 3.8512396694214875e-07, + "logits/chosen": -0.2373046875, + "logits/rejected": -0.427734375, + "logps/chosen": -368.0, + "logps/rejected": -308.0, + "loss": 0.2127, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.3359375, + "rewards/margins": 6.40625, + "rewards/rejected": -5.0625, + "step": 581 + }, + { + "epoch": 0.7141104294478527, + "grad_norm": 46.46655474433081, + "learning_rate": 3.849173553719008e-07, + "logits/chosen": -0.046875, + "logits/rejected": -0.259765625, + "logps/chosen": -392.0, + "logps/rejected": -320.0, + "loss": 0.31, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.9453125, + "rewards/margins": 5.09375, + "rewards/rejected": -4.15625, + "step": 582 + }, + { + "epoch": 0.7153374233128834, + "grad_norm": 38.88117000055558, + "learning_rate": 3.8471074380165284e-07, + "logits/chosen": -0.21875, + "logits/rejected": -0.373046875, + "logps/chosen": -382.0, + "logps/rejected": -334.0, + "loss": 0.3145, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.4296875, + "rewards/margins": 5.5625, + "rewards/rejected": -4.15625, + "step": 583 + }, + { + "epoch": 0.7165644171779141, + "grad_norm": 41.99819867075411, + "learning_rate": 3.8450413223140494e-07, + "logits/chosen": -0.126953125, + "logits/rejected": -0.2099609375, + "logps/chosen": -368.0, + "logps/rejected": -364.0, + "loss": 0.3344, + "rewards/accuracies": 0.796875, + "rewards/chosen": 0.640625, + "rewards/margins": 4.375, + "rewards/rejected": -3.734375, + "step": 584 + }, + { + "epoch": 0.7177914110429447, + "grad_norm": 44.1611316963058, + "learning_rate": 3.84297520661157e-07, + "logits/chosen": -0.038818359375, + "logits/rejected": -0.1630859375, + "logps/chosen": -398.0, + "logps/rejected": -318.0, + "loss": 0.3664, + "rewards/accuracies": 0.78125, + "rewards/chosen": 1.3125, + "rewards/margins": 4.90625, + "rewards/rejected": -3.609375, + "step": 585 + }, + { + "epoch": 0.7190184049079754, + "grad_norm": 39.0964035012581, + "learning_rate": 3.840909090909091e-07, + "logits/chosen": -0.158203125, + "logits/rejected": -0.271484375, + "logps/chosen": -346.0, + "logps/rejected": -296.0, + "loss": 0.2973, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.0, + "rewards/margins": 5.09375, + "rewards/rejected": -4.09375, + "step": 586 + }, + { + "epoch": 0.7202453987730061, + "grad_norm": 36.08960275580907, + "learning_rate": 3.8388429752066114e-07, + "logits/chosen": -0.1953125, + "logits/rejected": -0.306640625, + "logps/chosen": -332.0, + "logps/rejected": -306.0, + "loss": 0.2916, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.0703125, + "rewards/margins": 5.28125, + "rewards/rejected": -4.1875, + "step": 587 + }, + { + "epoch": 0.7214723926380369, + "grad_norm": 26.657846221925215, + "learning_rate": 3.8367768595041324e-07, + "logits/chosen": -0.193359375, + "logits/rejected": -0.361328125, + "logps/chosen": -380.0, + "logps/rejected": -314.0, + "loss": 0.2231, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.8515625, + "rewards/margins": 6.0625, + "rewards/rejected": -4.1875, + "step": 588 + }, + { + "epoch": 0.7226993865030675, + "grad_norm": 41.32671053142075, + "learning_rate": 3.834710743801653e-07, + "logits/chosen": -0.267578125, + "logits/rejected": -0.37109375, + "logps/chosen": -360.0, + "logps/rejected": -326.0, + "loss": 0.3126, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.69140625, + "rewards/margins": 4.5, + "rewards/rejected": -3.828125, + "step": 589 + }, + { + "epoch": 0.7239263803680982, + "grad_norm": 31.50139516862032, + "learning_rate": 3.8326446280991733e-07, + "logits/chosen": -0.171875, + "logits/rejected": -0.29296875, + "logps/chosen": -364.0, + "logps/rejected": -302.0, + "loss": 0.2457, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.125, + "rewards/margins": 5.125, + "rewards/rejected": -3.984375, + "step": 590 + }, + { + "epoch": 0.7251533742331289, + "grad_norm": 41.923208067017086, + "learning_rate": 3.830578512396694e-07, + "logits/chosen": -0.328125, + "logits/rejected": -0.51953125, + "logps/chosen": -404.0, + "logps/rejected": -326.0, + "loss": 0.2429, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.6484375, + "rewards/margins": 6.1875, + "rewards/rejected": -4.53125, + "step": 591 + }, + { + "epoch": 0.7263803680981595, + "grad_norm": 36.03509452521486, + "learning_rate": 3.828512396694215e-07, + "logits/chosen": -0.1904296875, + "logits/rejected": -0.380859375, + "logps/chosen": -370.0, + "logps/rejected": -296.0, + "loss": 0.2519, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.4375, + "rewards/margins": 6.0625, + "rewards/rejected": -4.625, + "step": 592 + }, + { + "epoch": 0.7276073619631902, + "grad_norm": 42.073646570880065, + "learning_rate": 3.826446280991735e-07, + "logits/chosen": -0.12890625, + "logits/rejected": -0.388671875, + "logps/chosen": -444.0, + "logps/rejected": -362.0, + "loss": 0.2844, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.6484375, + "rewards/margins": 5.625, + "rewards/rejected": -3.984375, + "step": 593 + }, + { + "epoch": 0.7288343558282209, + "grad_norm": 32.37131856233386, + "learning_rate": 3.824380165289256e-07, + "logits/chosen": -0.193359375, + "logits/rejected": -0.36328125, + "logps/chosen": -356.0, + "logps/rejected": -306.0, + "loss": 0.2431, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.81640625, + "rewards/margins": 5.65625, + "rewards/rejected": -4.84375, + "step": 594 + }, + { + "epoch": 0.7300613496932515, + "grad_norm": 40.766534902822876, + "learning_rate": 3.8223140495867767e-07, + "logits/chosen": -0.2041015625, + "logits/rejected": -0.3984375, + "logps/chosen": -444.0, + "logps/rejected": -340.0, + "loss": 0.2581, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.578125, + "rewards/margins": 6.15625, + "rewards/rejected": -4.59375, + "step": 595 + }, + { + "epoch": 0.7312883435582822, + "grad_norm": 39.26882224861265, + "learning_rate": 3.820247933884297e-07, + "logits/chosen": -0.1767578125, + "logits/rejected": -0.341796875, + "logps/chosen": -410.0, + "logps/rejected": -338.0, + "loss": 0.2749, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.203125, + "rewards/margins": 5.53125, + "rewards/rejected": -4.3125, + "step": 596 + }, + { + "epoch": 0.7325153374233129, + "grad_norm": 39.569676008461244, + "learning_rate": 3.818181818181818e-07, + "logits/chosen": -0.0849609375, + "logits/rejected": -0.26171875, + "logps/chosen": -378.0, + "logps/rejected": -282.0, + "loss": 0.2937, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.2265625, + "rewards/margins": 5.25, + "rewards/rejected": -4.03125, + "step": 597 + }, + { + "epoch": 0.7337423312883435, + "grad_norm": 32.53349158917794, + "learning_rate": 3.8161157024793387e-07, + "logits/chosen": -0.1806640625, + "logits/rejected": -0.369140625, + "logps/chosen": -438.0, + "logps/rejected": -310.0, + "loss": 0.2181, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 2.046875, + "rewards/margins": 6.3125, + "rewards/rejected": -4.28125, + "step": 598 + }, + { + "epoch": 0.7349693251533742, + "grad_norm": 37.462844674823714, + "learning_rate": 3.814049586776859e-07, + "logits/chosen": -0.30859375, + "logits/rejected": -0.45703125, + "logps/chosen": -448.0, + "logps/rejected": -354.0, + "loss": 0.2935, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.6328125, + "rewards/margins": 6.125, + "rewards/rejected": -4.5, + "step": 599 + }, + { + "epoch": 0.7361963190184049, + "grad_norm": 40.34755354050605, + "learning_rate": 3.8119834710743796e-07, + "logits/chosen": -0.3125, + "logits/rejected": -0.408203125, + "logps/chosen": -356.0, + "logps/rejected": -308.0, + "loss": 0.3262, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.2734375, + "rewards/margins": 5.875, + "rewards/rejected": -4.59375, + "step": 600 + }, + { + "epoch": 0.7374233128834355, + "grad_norm": 31.83131835226018, + "learning_rate": 3.8099173553719006e-07, + "logits/chosen": -0.2001953125, + "logits/rejected": -0.3828125, + "logps/chosen": -338.0, + "logps/rejected": -296.0, + "loss": 0.2587, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.5546875, + "rewards/margins": 5.46875, + "rewards/rejected": -4.90625, + "step": 601 + }, + { + "epoch": 0.7386503067484662, + "grad_norm": 27.556154921143015, + "learning_rate": 3.807851239669421e-07, + "logits/chosen": -0.0517578125, + "logits/rejected": -0.2158203125, + "logps/chosen": -398.0, + "logps/rejected": -322.0, + "loss": 0.1812, + "rewards/accuracies": 0.9296875, + "rewards/chosen": 1.4765625, + "rewards/margins": 6.4375, + "rewards/rejected": -4.96875, + "step": 602 + }, + { + "epoch": 0.7398773006134969, + "grad_norm": 33.37496659841441, + "learning_rate": 3.805785123966942e-07, + "logits/chosen": -0.205078125, + "logits/rejected": -0.34765625, + "logps/chosen": -376.0, + "logps/rejected": -308.0, + "loss": 0.2746, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.609375, + "rewards/margins": 6.34375, + "rewards/rejected": -4.71875, + "step": 603 + }, + { + "epoch": 0.7411042944785277, + "grad_norm": 33.47399818424688, + "learning_rate": 3.8037190082644626e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.4296875, + "logps/chosen": -410.0, + "logps/rejected": -344.0, + "loss": 0.2518, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.234375, + "rewards/margins": 6.1875, + "rewards/rejected": -4.96875, + "step": 604 + }, + { + "epoch": 0.7423312883435583, + "grad_norm": 31.794522300753904, + "learning_rate": 3.8016528925619836e-07, + "logits/chosen": -0.2041015625, + "logits/rejected": -0.396484375, + "logps/chosen": -372.0, + "logps/rejected": -318.0, + "loss": 0.2352, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.1640625, + "rewards/margins": 6.375, + "rewards/rejected": -5.21875, + "step": 605 + }, + { + "epoch": 0.743558282208589, + "grad_norm": 39.11777077485029, + "learning_rate": 3.799586776859504e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.41796875, + "logps/chosen": -382.0, + "logps/rejected": -322.0, + "loss": 0.2993, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.3671875, + "rewards/margins": 5.9375, + "rewards/rejected": -4.5625, + "step": 606 + }, + { + "epoch": 0.7447852760736197, + "grad_norm": 35.13403324428258, + "learning_rate": 3.797520661157025e-07, + "logits/chosen": -0.1591796875, + "logits/rejected": -0.37890625, + "logps/chosen": -394.0, + "logps/rejected": -356.0, + "loss": 0.2528, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 0.75, + "rewards/margins": 6.1875, + "rewards/rejected": -5.4375, + "step": 607 + }, + { + "epoch": 0.7460122699386503, + "grad_norm": 34.622853683902335, + "learning_rate": 3.795454545454545e-07, + "logits/chosen": -0.06396484375, + "logits/rejected": -0.302734375, + "logps/chosen": -394.0, + "logps/rejected": -334.0, + "loss": 0.2671, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 0.43359375, + "rewards/margins": 5.34375, + "rewards/rejected": -4.90625, + "step": 608 + }, + { + "epoch": 0.747239263803681, + "grad_norm": 33.44784961871993, + "learning_rate": 3.793388429752066e-07, + "logits/chosen": -0.1748046875, + "logits/rejected": -0.33984375, + "logps/chosen": -402.0, + "logps/rejected": -314.0, + "loss": 0.2401, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 0.78515625, + "rewards/margins": 6.25, + "rewards/rejected": -5.46875, + "step": 609 + }, + { + "epoch": 0.7484662576687117, + "grad_norm": 30.3709205845726, + "learning_rate": 3.7913223140495864e-07, + "logits/chosen": -0.2294921875, + "logits/rejected": -0.447265625, + "logps/chosen": -442.0, + "logps/rejected": -368.0, + "loss": 0.2211, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.3125, + "rewards/margins": 6.875, + "rewards/rejected": -5.5625, + "step": 610 + }, + { + "epoch": 0.7496932515337423, + "grad_norm": 47.71192907247348, + "learning_rate": 3.7892561983471074e-07, + "logits/chosen": -0.2001953125, + "logits/rejected": -0.3671875, + "logps/chosen": -430.0, + "logps/rejected": -354.0, + "loss": 0.331, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.14453125, + "rewards/margins": 5.34375, + "rewards/rejected": -5.1875, + "step": 611 + }, + { + "epoch": 0.750920245398773, + "grad_norm": 40.03785494441384, + "learning_rate": 3.787190082644628e-07, + "logits/chosen": -0.2041015625, + "logits/rejected": -0.34765625, + "logps/chosen": -390.0, + "logps/rejected": -352.0, + "loss": 0.327, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.6875, + "rewards/margins": 5.4375, + "rewards/rejected": -4.75, + "step": 612 + }, + { + "epoch": 0.7521472392638037, + "grad_norm": 39.68756652628583, + "learning_rate": 3.7851239669421484e-07, + "logits/chosen": -0.19140625, + "logits/rejected": -0.265625, + "logps/chosen": -374.0, + "logps/rejected": -320.0, + "loss": 0.3199, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.369140625, + "rewards/margins": 5.53125, + "rewards/rejected": -5.15625, + "step": 613 + }, + { + "epoch": 0.7533742331288343, + "grad_norm": 41.644849602297185, + "learning_rate": 3.7830578512396694e-07, + "logits/chosen": -0.2451171875, + "logits/rejected": -0.384765625, + "logps/chosen": -418.0, + "logps/rejected": -338.0, + "loss": 0.2887, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.80859375, + "rewards/margins": 5.875, + "rewards/rejected": -5.0625, + "step": 614 + }, + { + "epoch": 0.754601226993865, + "grad_norm": 37.7145942345175, + "learning_rate": 3.78099173553719e-07, + "logits/chosen": -0.228515625, + "logits/rejected": -0.33984375, + "logps/chosen": -366.0, + "logps/rejected": -340.0, + "loss": 0.2656, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.0078125, + "rewards/margins": 6.25, + "rewards/rejected": -5.21875, + "step": 615 + }, + { + "epoch": 0.7558282208588957, + "grad_norm": 33.41765706894794, + "learning_rate": 3.778925619834711e-07, + "logits/chosen": -0.1865234375, + "logits/rejected": -0.333984375, + "logps/chosen": -322.0, + "logps/rejected": -286.0, + "loss": 0.2479, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.26953125, + "rewards/margins": 5.03125, + "rewards/rejected": -4.78125, + "step": 616 + }, + { + "epoch": 0.7570552147239263, + "grad_norm": 40.974699543395324, + "learning_rate": 3.776859504132231e-07, + "logits/chosen": -0.173828125, + "logits/rejected": -0.26171875, + "logps/chosen": -368.0, + "logps/rejected": -310.0, + "loss": 0.3367, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 0.609375, + "rewards/margins": 5.1875, + "rewards/rejected": -4.59375, + "step": 617 + }, + { + "epoch": 0.758282208588957, + "grad_norm": 46.934415155128356, + "learning_rate": 3.774793388429752e-07, + "logits/chosen": -0.099609375, + "logits/rejected": -0.275390625, + "logps/chosen": -414.0, + "logps/rejected": -308.0, + "loss": 0.3508, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.74609375, + "rewards/margins": 4.9375, + "rewards/rejected": -4.1875, + "step": 618 + }, + { + "epoch": 0.7595092024539877, + "grad_norm": 35.432918707651034, + "learning_rate": 3.7727272727272723e-07, + "logits/chosen": -0.12890625, + "logits/rejected": -0.330078125, + "logps/chosen": -426.0, + "logps/rejected": -328.0, + "loss": 0.2261, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.140625, + "rewards/margins": 6.25, + "rewards/rejected": -5.125, + "step": 619 + }, + { + "epoch": 0.7607361963190185, + "grad_norm": 44.522688117502966, + "learning_rate": 3.7706611570247933e-07, + "logits/chosen": -0.1318359375, + "logits/rejected": -0.33984375, + "logps/chosen": -404.0, + "logps/rejected": -324.0, + "loss": 0.2954, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.625, + "rewards/margins": 5.125, + "rewards/rejected": -4.5, + "step": 620 + }, + { + "epoch": 0.7619631901840491, + "grad_norm": 35.21620215877052, + "learning_rate": 3.768595041322314e-07, + "logits/chosen": -0.2412109375, + "logits/rejected": -0.412109375, + "logps/chosen": -478.0, + "logps/rejected": -360.0, + "loss": 0.2617, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.1015625, + "rewards/margins": 6.46875, + "rewards/rejected": -5.375, + "step": 621 + }, + { + "epoch": 0.7631901840490798, + "grad_norm": 32.97202434149592, + "learning_rate": 3.766528925619835e-07, + "logits/chosen": -0.13671875, + "logits/rejected": -0.310546875, + "logps/chosen": -378.0, + "logps/rejected": -334.0, + "loss": 0.2271, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 0.73828125, + "rewards/margins": 5.9375, + "rewards/rejected": -5.1875, + "step": 622 + }, + { + "epoch": 0.7644171779141105, + "grad_norm": 40.73770796587866, + "learning_rate": 3.764462809917355e-07, + "logits/chosen": -0.1669921875, + "logits/rejected": -0.34765625, + "logps/chosen": -452.0, + "logps/rejected": -370.0, + "loss": 0.3008, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.3515625, + "rewards/margins": 6.21875, + "rewards/rejected": -4.875, + "step": 623 + }, + { + "epoch": 0.7656441717791411, + "grad_norm": 33.6312460876679, + "learning_rate": 3.762396694214876e-07, + "logits/chosen": -0.228515625, + "logits/rejected": -0.3984375, + "logps/chosen": -378.0, + "logps/rejected": -316.0, + "loss": 0.218, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.1328125, + "rewards/margins": 6.78125, + "rewards/rejected": -5.65625, + "step": 624 + }, + { + "epoch": 0.7668711656441718, + "grad_norm": 35.01728220554292, + "learning_rate": 3.7603305785123967e-07, + "logits/chosen": -0.2001953125, + "logits/rejected": -0.34765625, + "logps/chosen": -404.0, + "logps/rejected": -316.0, + "loss": 0.2202, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.015625, + "rewards/margins": 5.6875, + "rewards/rejected": -4.65625, + "step": 625 + }, + { + "epoch": 0.7680981595092025, + "grad_norm": 43.4178761562483, + "learning_rate": 3.758264462809917e-07, + "logits/chosen": -0.314453125, + "logits/rejected": -0.46875, + "logps/chosen": -414.0, + "logps/rejected": -344.0, + "loss": 0.3158, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.3515625, + "rewards/margins": 5.78125, + "rewards/rejected": -4.4375, + "step": 626 + }, + { + "epoch": 0.7693251533742331, + "grad_norm": 35.14066305401538, + "learning_rate": 3.7561983471074376e-07, + "logits/chosen": -0.1162109375, + "logits/rejected": -0.21484375, + "logps/chosen": -308.0, + "logps/rejected": -320.0, + "loss": 0.3225, + "rewards/accuracies": 0.8671875, + "rewards/chosen": -0.06884765625, + "rewards/margins": 4.53125, + "rewards/rejected": -4.59375, + "step": 627 + }, + { + "epoch": 0.7705521472392638, + "grad_norm": 43.80833337888977, + "learning_rate": 3.7541322314049586e-07, + "logits/chosen": -0.15234375, + "logits/rejected": -0.294921875, + "logps/chosen": -378.0, + "logps/rejected": -290.0, + "loss": 0.3054, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.90234375, + "rewards/margins": 5.15625, + "rewards/rejected": -4.25, + "step": 628 + }, + { + "epoch": 0.7717791411042945, + "grad_norm": 24.76129586575429, + "learning_rate": 3.752066115702479e-07, + "logits/chosen": -0.171875, + "logits/rejected": -0.296875, + "logps/chosen": -348.0, + "logps/rejected": -276.0, + "loss": 0.1831, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.74609375, + "rewards/margins": 5.34375, + "rewards/rejected": -4.59375, + "step": 629 + }, + { + "epoch": 0.7730061349693251, + "grad_norm": 34.904501482497786, + "learning_rate": 3.75e-07, + "logits/chosen": -0.11328125, + "logits/rejected": -0.357421875, + "logps/chosen": -370.0, + "logps/rejected": -358.0, + "loss": 0.2492, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.640625, + "rewards/margins": 6.03125, + "rewards/rejected": -4.40625, + "step": 630 + }, + { + "epoch": 0.7742331288343558, + "grad_norm": 37.86286725268997, + "learning_rate": 3.7479338842975206e-07, + "logits/chosen": -0.298828125, + "logits/rejected": -0.404296875, + "logps/chosen": -390.0, + "logps/rejected": -312.0, + "loss": 0.3021, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.390625, + "rewards/margins": 5.5625, + "rewards/rejected": -4.1875, + "step": 631 + }, + { + "epoch": 0.7754601226993865, + "grad_norm": 39.56376346395484, + "learning_rate": 3.745867768595041e-07, + "logits/chosen": -0.22265625, + "logits/rejected": -0.36328125, + "logps/chosen": -402.0, + "logps/rejected": -330.0, + "loss": 0.2667, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.5234375, + "rewards/margins": 5.1875, + "rewards/rejected": -3.671875, + "step": 632 + }, + { + "epoch": 0.7766871165644171, + "grad_norm": 43.15920072260989, + "learning_rate": 3.743801652892562e-07, + "logits/chosen": -0.1484375, + "logits/rejected": -0.27734375, + "logps/chosen": -338.0, + "logps/rejected": -324.0, + "loss": 0.317, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.7734375, + "rewards/margins": 4.71875, + "rewards/rejected": -3.96875, + "step": 633 + }, + { + "epoch": 0.7779141104294478, + "grad_norm": 34.76469344160583, + "learning_rate": 3.7417355371900825e-07, + "logits/chosen": -0.2333984375, + "logits/rejected": -0.443359375, + "logps/chosen": -418.0, + "logps/rejected": -316.0, + "loss": 0.2151, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 2.4375, + "rewards/margins": 6.90625, + "rewards/rejected": -4.46875, + "step": 634 + }, + { + "epoch": 0.7791411042944786, + "grad_norm": 32.416601067780334, + "learning_rate": 3.739669421487603e-07, + "logits/chosen": -0.2421875, + "logits/rejected": -0.3125, + "logps/chosen": -358.0, + "logps/rejected": -288.0, + "loss": 0.217, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 0.9140625, + "rewards/margins": 4.96875, + "rewards/rejected": -4.03125, + "step": 635 + }, + { + "epoch": 0.7803680981595092, + "grad_norm": 38.28241269033868, + "learning_rate": 3.7376033057851234e-07, + "logits/chosen": -0.234375, + "logits/rejected": -0.36328125, + "logps/chosen": -414.0, + "logps/rejected": -358.0, + "loss": 0.2749, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.6328125, + "rewards/margins": 5.8125, + "rewards/rejected": -4.15625, + "step": 636 + }, + { + "epoch": 0.7815950920245399, + "grad_norm": 47.424162576758796, + "learning_rate": 3.7355371900826445e-07, + "logits/chosen": -0.0859375, + "logits/rejected": -0.267578125, + "logps/chosen": -378.0, + "logps/rejected": -292.0, + "loss": 0.2932, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.890625, + "rewards/margins": 5.09375, + "rewards/rejected": -4.1875, + "step": 637 + }, + { + "epoch": 0.7828220858895706, + "grad_norm": 33.14638387389286, + "learning_rate": 3.733471074380165e-07, + "logits/chosen": -0.2177734375, + "logits/rejected": -0.412109375, + "logps/chosen": -402.0, + "logps/rejected": -326.0, + "loss": 0.225, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.5234375, + "rewards/margins": 5.65625, + "rewards/rejected": -4.125, + "step": 638 + }, + { + "epoch": 0.7840490797546013, + "grad_norm": 40.33146789211734, + "learning_rate": 3.731404958677686e-07, + "logits/chosen": -0.1015625, + "logits/rejected": -0.283203125, + "logps/chosen": -404.0, + "logps/rejected": -326.0, + "loss": 0.3027, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.4375, + "rewards/margins": 5.1875, + "rewards/rejected": -3.75, + "step": 639 + }, + { + "epoch": 0.7852760736196319, + "grad_norm": 40.99608723585622, + "learning_rate": 3.7293388429752064e-07, + "logits/chosen": -0.24609375, + "logits/rejected": -0.388671875, + "logps/chosen": -444.0, + "logps/rejected": -376.0, + "loss": 0.2653, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.890625, + "rewards/margins": 6.03125, + "rewards/rejected": -4.125, + "step": 640 + }, + { + "epoch": 0.7865030674846626, + "grad_norm": 46.58650892643996, + "learning_rate": 3.7272727272727274e-07, + "logits/chosen": -0.27734375, + "logits/rejected": -0.419921875, + "logps/chosen": -392.0, + "logps/rejected": -342.0, + "loss": 0.3815, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.5703125, + "rewards/margins": 5.09375, + "rewards/rejected": -3.515625, + "step": 641 + }, + { + "epoch": 0.7877300613496933, + "grad_norm": 28.471925622053803, + "learning_rate": 3.725206611570248e-07, + "logits/chosen": -0.185546875, + "logits/rejected": -0.39453125, + "logps/chosen": -348.0, + "logps/rejected": -284.0, + "loss": 0.2363, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.3515625, + "rewards/margins": 5.25, + "rewards/rejected": -3.890625, + "step": 642 + }, + { + "epoch": 0.7889570552147239, + "grad_norm": 40.149407361877095, + "learning_rate": 3.723140495867769e-07, + "logits/chosen": -0.30859375, + "logits/rejected": -0.484375, + "logps/chosen": -400.0, + "logps/rejected": -364.0, + "loss": 0.2571, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.5234375, + "rewards/margins": 5.4375, + "rewards/rejected": -3.90625, + "step": 643 + }, + { + "epoch": 0.7901840490797546, + "grad_norm": 43.580660836250416, + "learning_rate": 3.721074380165289e-07, + "logits/chosen": -0.2314453125, + "logits/rejected": -0.384765625, + "logps/chosen": -386.0, + "logps/rejected": -316.0, + "loss": 0.2481, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.5390625, + "rewards/margins": 5.90625, + "rewards/rejected": -4.34375, + "step": 644 + }, + { + "epoch": 0.7914110429447853, + "grad_norm": 36.964537896873544, + "learning_rate": 3.71900826446281e-07, + "logits/chosen": -0.1728515625, + "logits/rejected": -0.380859375, + "logps/chosen": -330.0, + "logps/rejected": -322.0, + "loss": 0.2416, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.6484375, + "rewards/margins": 5.78125, + "rewards/rejected": -4.15625, + "step": 645 + }, + { + "epoch": 0.7926380368098159, + "grad_norm": 36.18484120423215, + "learning_rate": 3.7169421487603303e-07, + "logits/chosen": -0.130859375, + "logits/rejected": -0.3046875, + "logps/chosen": -378.0, + "logps/rejected": -314.0, + "loss": 0.285, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.4921875, + "rewards/margins": 5.5, + "rewards/rejected": -4.0, + "step": 646 + }, + { + "epoch": 0.7938650306748466, + "grad_norm": 32.85091829554944, + "learning_rate": 3.7148760330578513e-07, + "logits/chosen": -0.1826171875, + "logits/rejected": -0.333984375, + "logps/chosen": -376.0, + "logps/rejected": -308.0, + "loss": 0.2558, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.9609375, + "rewards/margins": 6.125, + "rewards/rejected": -4.1875, + "step": 647 + }, + { + "epoch": 0.7950920245398773, + "grad_norm": 42.502304621111726, + "learning_rate": 3.712809917355372e-07, + "logits/chosen": -0.236328125, + "logits/rejected": -0.25, + "logps/chosen": -324.0, + "logps/rejected": -312.0, + "loss": 0.3343, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.90625, + "rewards/margins": 4.875, + "rewards/rejected": -3.96875, + "step": 648 + }, + { + "epoch": 0.7963190184049079, + "grad_norm": 41.7626560131211, + "learning_rate": 3.710743801652892e-07, + "logits/chosen": -0.1064453125, + "logits/rejected": -0.2109375, + "logps/chosen": -360.0, + "logps/rejected": -318.0, + "loss": 0.4139, + "rewards/accuracies": 0.796875, + "rewards/chosen": 1.15625, + "rewards/margins": 4.59375, + "rewards/rejected": -3.4375, + "step": 649 + }, + { + "epoch": 0.7975460122699386, + "grad_norm": 40.035923383900304, + "learning_rate": 3.708677685950413e-07, + "logits/chosen": -0.12255859375, + "logits/rejected": -0.296875, + "logps/chosen": -422.0, + "logps/rejected": -340.0, + "loss": 0.328, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.8125, + "rewards/margins": 5.1875, + "rewards/rejected": -3.375, + "step": 650 + }, + { + "epoch": 0.7987730061349694, + "grad_norm": 41.02033222140374, + "learning_rate": 3.7066115702479337e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.337890625, + "logps/chosen": -368.0, + "logps/rejected": -338.0, + "loss": 0.2567, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.78125, + "rewards/margins": 6.3125, + "rewards/rejected": -4.53125, + "step": 651 + }, + { + "epoch": 0.8, + "grad_norm": 43.99996770243787, + "learning_rate": 3.7045454545454547e-07, + "logits/chosen": -0.1943359375, + "logits/rejected": -0.333984375, + "logps/chosen": -364.0, + "logps/rejected": -332.0, + "loss": 0.304, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.796875, + "rewards/margins": 4.96875, + "rewards/rejected": -4.15625, + "step": 652 + }, + { + "epoch": 0.8012269938650307, + "grad_norm": 42.280947809979125, + "learning_rate": 3.7024793388429746e-07, + "logits/chosen": -0.142578125, + "logits/rejected": -0.322265625, + "logps/chosen": -346.0, + "logps/rejected": -316.0, + "loss": 0.2642, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.2890625, + "rewards/margins": 5.875, + "rewards/rejected": -4.59375, + "step": 653 + }, + { + "epoch": 0.8024539877300614, + "grad_norm": 33.69377308507155, + "learning_rate": 3.7004132231404956e-07, + "logits/chosen": -0.12255859375, + "logits/rejected": -0.330078125, + "logps/chosen": -388.0, + "logps/rejected": -302.0, + "loss": 0.2251, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.5546875, + "rewards/margins": 5.75, + "rewards/rejected": -4.1875, + "step": 654 + }, + { + "epoch": 0.803680981595092, + "grad_norm": 37.83873855183703, + "learning_rate": 3.698347107438016e-07, + "logits/chosen": -0.1806640625, + "logits/rejected": -0.35546875, + "logps/chosen": -380.0, + "logps/rejected": -332.0, + "loss": 0.2549, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.375, + "rewards/margins": 5.40625, + "rewards/rejected": -4.03125, + "step": 655 + }, + { + "epoch": 0.8049079754601227, + "grad_norm": 39.726835256559795, + "learning_rate": 3.696280991735537e-07, + "logits/chosen": -0.1171875, + "logits/rejected": -0.27734375, + "logps/chosen": -364.0, + "logps/rejected": -308.0, + "loss": 0.3072, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.15625, + "rewards/margins": 5.1875, + "rewards/rejected": -4.03125, + "step": 656 + }, + { + "epoch": 0.8061349693251534, + "grad_norm": 32.94464991591826, + "learning_rate": 3.6942148760330576e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.416015625, + "logps/chosen": -354.0, + "logps/rejected": -318.0, + "loss": 0.2901, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.421875, + "rewards/margins": 5.375, + "rewards/rejected": -3.953125, + "step": 657 + }, + { + "epoch": 0.807361963190184, + "grad_norm": 35.33216238810386, + "learning_rate": 3.6921487603305786e-07, + "logits/chosen": -0.265625, + "logits/rejected": -0.408203125, + "logps/chosen": -386.0, + "logps/rejected": -330.0, + "loss": 0.265, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.34375, + "rewards/margins": 5.4375, + "rewards/rejected": -4.09375, + "step": 658 + }, + { + "epoch": 0.8085889570552147, + "grad_norm": 35.903067216165454, + "learning_rate": 3.690082644628099e-07, + "logits/chosen": -0.2060546875, + "logits/rejected": -0.365234375, + "logps/chosen": -358.0, + "logps/rejected": -316.0, + "loss": 0.2874, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.65625, + "rewards/margins": 5.0, + "rewards/rejected": -4.34375, + "step": 659 + }, + { + "epoch": 0.8098159509202454, + "grad_norm": 33.43274680085514, + "learning_rate": 3.68801652892562e-07, + "logits/chosen": -0.216796875, + "logits/rejected": -0.412109375, + "logps/chosen": -396.0, + "logps/rejected": -338.0, + "loss": 0.2533, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.7890625, + "rewards/margins": 5.9375, + "rewards/rejected": -4.15625, + "step": 660 + }, + { + "epoch": 0.811042944785276, + "grad_norm": 42.73024720052954, + "learning_rate": 3.6859504132231405e-07, + "logits/chosen": -0.158203125, + "logits/rejected": -0.267578125, + "logps/chosen": -356.0, + "logps/rejected": -284.0, + "loss": 0.3128, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.6640625, + "rewards/margins": 4.875, + "rewards/rejected": -4.21875, + "step": 661 + }, + { + "epoch": 0.8122699386503067, + "grad_norm": 29.594222057082835, + "learning_rate": 3.683884297520661e-07, + "logits/chosen": -0.16796875, + "logits/rejected": -0.306640625, + "logps/chosen": -360.0, + "logps/rejected": -308.0, + "loss": 0.211, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.5859375, + "rewards/margins": 6.03125, + "rewards/rejected": -4.4375, + "step": 662 + }, + { + "epoch": 0.8134969325153374, + "grad_norm": 30.816389985498457, + "learning_rate": 3.6818181818181815e-07, + "logits/chosen": -0.11669921875, + "logits/rejected": -0.3125, + "logps/chosen": -352.0, + "logps/rejected": -310.0, + "loss": 0.2494, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.6015625, + "rewards/margins": 5.625, + "rewards/rejected": -4.0, + "step": 663 + }, + { + "epoch": 0.8147239263803681, + "grad_norm": 27.861290032166615, + "learning_rate": 3.6797520661157025e-07, + "logits/chosen": -0.373046875, + "logits/rejected": -0.51953125, + "logps/chosen": -380.0, + "logps/rejected": -346.0, + "loss": 0.1714, + "rewards/accuracies": 0.9140625, + "rewards/chosen": 1.5390625, + "rewards/margins": 6.8125, + "rewards/rejected": -5.28125, + "step": 664 + }, + { + "epoch": 0.8159509202453987, + "grad_norm": 43.48547648980068, + "learning_rate": 3.677685950413223e-07, + "logits/chosen": -0.10009765625, + "logits/rejected": -0.267578125, + "logps/chosen": -332.0, + "logps/rejected": -280.0, + "loss": 0.2535, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.765625, + "rewards/margins": 5.34375, + "rewards/rejected": -4.59375, + "step": 665 + }, + { + "epoch": 0.8171779141104294, + "grad_norm": 41.230514254119846, + "learning_rate": 3.6756198347107434e-07, + "logits/chosen": -0.130859375, + "logits/rejected": -0.3203125, + "logps/chosen": -414.0, + "logps/rejected": -340.0, + "loss": 0.3107, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.4375, + "rewards/margins": 5.75, + "rewards/rejected": -4.3125, + "step": 666 + }, + { + "epoch": 0.8184049079754602, + "grad_norm": 38.330931790926165, + "learning_rate": 3.6735537190082644e-07, + "logits/chosen": -0.19921875, + "logits/rejected": -0.396484375, + "logps/chosen": -372.0, + "logps/rejected": -324.0, + "loss": 0.2562, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.21875, + "rewards/margins": 6.0, + "rewards/rejected": -4.78125, + "step": 667 + }, + { + "epoch": 0.8196319018404908, + "grad_norm": 36.01171777931778, + "learning_rate": 3.671487603305785e-07, + "logits/chosen": -0.19921875, + "logits/rejected": -0.33984375, + "logps/chosen": -386.0, + "logps/rejected": -340.0, + "loss": 0.2577, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.2734375, + "rewards/margins": 5.84375, + "rewards/rejected": -4.5625, + "step": 668 + }, + { + "epoch": 0.8208588957055215, + "grad_norm": 37.805581553660694, + "learning_rate": 3.669421487603306e-07, + "logits/chosen": -0.25390625, + "logits/rejected": -0.41796875, + "logps/chosen": -338.0, + "logps/rejected": -322.0, + "loss": 0.257, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 0.9375, + "rewards/margins": 5.5625, + "rewards/rejected": -4.625, + "step": 669 + }, + { + "epoch": 0.8220858895705522, + "grad_norm": 34.18026783004868, + "learning_rate": 3.6673553719008263e-07, + "logits/chosen": -0.0791015625, + "logits/rejected": -0.22265625, + "logps/chosen": -324.0, + "logps/rejected": -290.0, + "loss": 0.2365, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 0.9296875, + "rewards/margins": 5.46875, + "rewards/rejected": -4.53125, + "step": 670 + }, + { + "epoch": 0.8233128834355828, + "grad_norm": 31.80438827189515, + "learning_rate": 3.665289256198347e-07, + "logits/chosen": -0.1787109375, + "logits/rejected": -0.34375, + "logps/chosen": -374.0, + "logps/rejected": -320.0, + "loss": 0.242, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.609375, + "rewards/margins": 6.09375, + "rewards/rejected": -4.46875, + "step": 671 + }, + { + "epoch": 0.8245398773006135, + "grad_norm": 34.31886268675687, + "learning_rate": 3.6632231404958673e-07, + "logits/chosen": -0.1591796875, + "logits/rejected": -0.419921875, + "logps/chosen": -448.0, + "logps/rejected": -320.0, + "loss": 0.2443, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.875, + "rewards/margins": 6.53125, + "rewards/rejected": -4.65625, + "step": 672 + }, + { + "epoch": 0.8257668711656442, + "grad_norm": 35.357570263918994, + "learning_rate": 3.6611570247933883e-07, + "logits/chosen": -0.11083984375, + "logits/rejected": -0.3359375, + "logps/chosen": -390.0, + "logps/rejected": -318.0, + "loss": 0.2364, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.1484375, + "rewards/margins": 5.25, + "rewards/rejected": -4.09375, + "step": 673 + }, + { + "epoch": 0.8269938650306748, + "grad_norm": 33.53684126770598, + "learning_rate": 3.659090909090909e-07, + "logits/chosen": -0.0654296875, + "logits/rejected": -0.2333984375, + "logps/chosen": -356.0, + "logps/rejected": -320.0, + "loss": 0.2467, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.2734375, + "rewards/margins": 5.84375, + "rewards/rejected": -4.5625, + "step": 674 + }, + { + "epoch": 0.8282208588957055, + "grad_norm": 34.52915039204892, + "learning_rate": 3.65702479338843e-07, + "logits/chosen": -0.1376953125, + "logits/rejected": -0.3515625, + "logps/chosen": -426.0, + "logps/rejected": -356.0, + "loss": 0.2621, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.453125, + "rewards/margins": 6.15625, + "rewards/rejected": -4.71875, + "step": 675 + }, + { + "epoch": 0.8294478527607362, + "grad_norm": 39.20023525071254, + "learning_rate": 3.65495867768595e-07, + "logits/chosen": -0.2216796875, + "logits/rejected": -0.333984375, + "logps/chosen": -392.0, + "logps/rejected": -338.0, + "loss": 0.2552, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.640625, + "rewards/margins": 5.6875, + "rewards/rejected": -5.03125, + "step": 676 + }, + { + "epoch": 0.8306748466257668, + "grad_norm": 40.9061677699551, + "learning_rate": 3.652892561983471e-07, + "logits/chosen": -0.1181640625, + "logits/rejected": -0.291015625, + "logps/chosen": -336.0, + "logps/rejected": -298.0, + "loss": 0.2803, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.4609375, + "rewards/margins": 5.59375, + "rewards/rejected": -5.125, + "step": 677 + }, + { + "epoch": 0.8319018404907975, + "grad_norm": 35.838195895535726, + "learning_rate": 3.6508264462809917e-07, + "logits/chosen": -0.15625, + "logits/rejected": -0.361328125, + "logps/chosen": -418.0, + "logps/rejected": -342.0, + "loss": 0.2691, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.88671875, + "rewards/margins": 5.53125, + "rewards/rejected": -4.65625, + "step": 678 + }, + { + "epoch": 0.8331288343558282, + "grad_norm": 39.33502920792321, + "learning_rate": 3.648760330578512e-07, + "logits/chosen": -0.07080078125, + "logits/rejected": -0.1845703125, + "logps/chosen": -338.0, + "logps/rejected": -310.0, + "loss": 0.284, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.94140625, + "rewards/margins": 5.25, + "rewards/rejected": -4.3125, + "step": 679 + }, + { + "epoch": 0.8343558282208589, + "grad_norm": 35.15449592029737, + "learning_rate": 3.6466942148760326e-07, + "logits/chosen": -0.1923828125, + "logits/rejected": -0.369140625, + "logps/chosen": -454.0, + "logps/rejected": -356.0, + "loss": 0.2298, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.34375, + "rewards/margins": 6.375, + "rewards/rejected": -5.03125, + "step": 680 + }, + { + "epoch": 0.8355828220858895, + "grad_norm": 31.78034807618272, + "learning_rate": 3.6446280991735536e-07, + "logits/chosen": -0.21484375, + "logits/rejected": -0.37890625, + "logps/chosen": -346.0, + "logps/rejected": -316.0, + "loss": 0.1963, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 0.8984375, + "rewards/margins": 6.4375, + "rewards/rejected": -5.5625, + "step": 681 + }, + { + "epoch": 0.8368098159509203, + "grad_norm": 39.09021083370229, + "learning_rate": 3.642561983471074e-07, + "logits/chosen": -0.21875, + "logits/rejected": -0.341796875, + "logps/chosen": -350.0, + "logps/rejected": -316.0, + "loss": 0.301, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.74609375, + "rewards/margins": 5.78125, + "rewards/rejected": -5.03125, + "step": 682 + }, + { + "epoch": 0.838036809815951, + "grad_norm": 36.30997939377773, + "learning_rate": 3.640495867768595e-07, + "logits/chosen": -0.2294921875, + "logits/rejected": -0.349609375, + "logps/chosen": -370.0, + "logps/rejected": -308.0, + "loss": 0.2667, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.15625, + "rewards/margins": 6.28125, + "rewards/rejected": -5.125, + "step": 683 + }, + { + "epoch": 0.8392638036809816, + "grad_norm": 43.34454211125793, + "learning_rate": 3.6384297520661156e-07, + "logits/chosen": -0.06298828125, + "logits/rejected": -0.18359375, + "logps/chosen": -314.0, + "logps/rejected": -330.0, + "loss": 0.3642, + "rewards/accuracies": 0.8359375, + "rewards/chosen": -0.0263671875, + "rewards/margins": 4.6875, + "rewards/rejected": -4.71875, + "step": 684 + }, + { + "epoch": 0.8404907975460123, + "grad_norm": 34.04376739318291, + "learning_rate": 3.636363636363636e-07, + "logits/chosen": -0.1669921875, + "logits/rejected": -0.34375, + "logps/chosen": -396.0, + "logps/rejected": -356.0, + "loss": 0.2432, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.0546875, + "rewards/margins": 6.90625, + "rewards/rejected": -5.84375, + "step": 685 + }, + { + "epoch": 0.841717791411043, + "grad_norm": 32.60171699566285, + "learning_rate": 3.634297520661157e-07, + "logits/chosen": -0.1787109375, + "logits/rejected": -0.31640625, + "logps/chosen": -392.0, + "logps/rejected": -320.0, + "loss": 0.2556, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.0390625, + "rewards/margins": 6.0, + "rewards/rejected": -4.9375, + "step": 686 + }, + { + "epoch": 0.8429447852760736, + "grad_norm": 36.65354869863078, + "learning_rate": 3.6322314049586775e-07, + "logits/chosen": -0.16015625, + "logits/rejected": -0.306640625, + "logps/chosen": -374.0, + "logps/rejected": -338.0, + "loss": 0.2628, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.2109375, + "rewards/margins": 6.0625, + "rewards/rejected": -4.84375, + "step": 687 + }, + { + "epoch": 0.8441717791411043, + "grad_norm": 41.14195765537747, + "learning_rate": 3.630165289256198e-07, + "logits/chosen": -0.20703125, + "logits/rejected": -0.369140625, + "logps/chosen": -376.0, + "logps/rejected": -300.0, + "loss": 0.2638, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.177734375, + "rewards/margins": 5.53125, + "rewards/rejected": -5.34375, + "step": 688 + }, + { + "epoch": 0.845398773006135, + "grad_norm": 38.51353105415181, + "learning_rate": 3.6280991735537185e-07, + "logits/chosen": -0.162109375, + "logits/rejected": -0.265625, + "logps/chosen": -372.0, + "logps/rejected": -320.0, + "loss": 0.2884, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.2890625, + "rewards/margins": 6.0, + "rewards/rejected": -4.71875, + "step": 689 + }, + { + "epoch": 0.8466257668711656, + "grad_norm": 50.698015097303056, + "learning_rate": 3.6260330578512395e-07, + "logits/chosen": -0.044677734375, + "logits/rejected": -0.244140625, + "logps/chosen": -402.0, + "logps/rejected": -344.0, + "loss": 0.3436, + "rewards/accuracies": 0.796875, + "rewards/chosen": 1.5234375, + "rewards/margins": 6.1875, + "rewards/rejected": -4.65625, + "step": 690 + }, + { + "epoch": 0.8478527607361963, + "grad_norm": 30.814234506471102, + "learning_rate": 3.62396694214876e-07, + "logits/chosen": -0.3359375, + "logits/rejected": -0.458984375, + "logps/chosen": -356.0, + "logps/rejected": -340.0, + "loss": 0.2217, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.2421875, + "rewards/margins": 6.375, + "rewards/rejected": -5.125, + "step": 691 + }, + { + "epoch": 0.849079754601227, + "grad_norm": 43.15048361460468, + "learning_rate": 3.621900826446281e-07, + "logits/chosen": -0.1767578125, + "logits/rejected": -0.337890625, + "logps/chosen": -408.0, + "logps/rejected": -330.0, + "loss": 0.2766, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.640625, + "rewards/margins": 6.46875, + "rewards/rejected": -4.84375, + "step": 692 + }, + { + "epoch": 0.8503067484662576, + "grad_norm": 35.3095511118675, + "learning_rate": 3.6198347107438014e-07, + "logits/chosen": -0.189453125, + "logits/rejected": -0.392578125, + "logps/chosen": -442.0, + "logps/rejected": -360.0, + "loss": 0.2852, + "rewards/accuracies": 0.875, + "rewards/chosen": 2.0625, + "rewards/margins": 7.25, + "rewards/rejected": -5.1875, + "step": 693 + }, + { + "epoch": 0.8515337423312883, + "grad_norm": 50.92757487577681, + "learning_rate": 3.6177685950413224e-07, + "logits/chosen": -0.18359375, + "logits/rejected": -0.361328125, + "logps/chosen": -370.0, + "logps/rejected": -326.0, + "loss": 0.3663, + "rewards/accuracies": 0.796875, + "rewards/chosen": 0.73828125, + "rewards/margins": 4.96875, + "rewards/rejected": -4.21875, + "step": 694 + }, + { + "epoch": 0.852760736196319, + "grad_norm": 50.927014909943495, + "learning_rate": 3.615702479338843e-07, + "logits/chosen": -0.1689453125, + "logits/rejected": -0.26953125, + "logps/chosen": -328.0, + "logps/rejected": -302.0, + "loss": 0.4583, + "rewards/accuracies": 0.734375, + "rewards/chosen": 0.5625, + "rewards/margins": 4.34375, + "rewards/rejected": -3.765625, + "step": 695 + }, + { + "epoch": 0.8539877300613496, + "grad_norm": 39.49040375200759, + "learning_rate": 3.613636363636364e-07, + "logits/chosen": -0.130859375, + "logits/rejected": -0.306640625, + "logps/chosen": -382.0, + "logps/rejected": -314.0, + "loss": 0.2881, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.2734375, + "rewards/margins": 5.6875, + "rewards/rejected": -4.40625, + "step": 696 + }, + { + "epoch": 0.8552147239263803, + "grad_norm": 45.57900690356607, + "learning_rate": 3.611570247933884e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.328125, + "logps/chosen": -388.0, + "logps/rejected": -358.0, + "loss": 0.2838, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.8671875, + "rewards/margins": 6.46875, + "rewards/rejected": -4.59375, + "step": 697 + }, + { + "epoch": 0.8564417177914111, + "grad_norm": 38.81941112945181, + "learning_rate": 3.609504132231405e-07, + "logits/chosen": -0.1328125, + "logits/rejected": -0.279296875, + "logps/chosen": -394.0, + "logps/rejected": -344.0, + "loss": 0.2619, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.40625, + "rewards/margins": 6.125, + "rewards/rejected": -4.71875, + "step": 698 + }, + { + "epoch": 0.8576687116564418, + "grad_norm": 42.966064611435726, + "learning_rate": 3.6074380165289253e-07, + "logits/chosen": -0.2021484375, + "logits/rejected": -0.30078125, + "logps/chosen": -338.0, + "logps/rejected": -320.0, + "loss": 0.3034, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.5859375, + "rewards/margins": 5.25, + "rewards/rejected": -4.6875, + "step": 699 + }, + { + "epoch": 0.8588957055214724, + "grad_norm": 42.65113203498414, + "learning_rate": 3.6053719008264463e-07, + "logits/chosen": -0.11767578125, + "logits/rejected": -0.2353515625, + "logps/chosen": -370.0, + "logps/rejected": -320.0, + "loss": 0.3109, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.1015625, + "rewards/margins": 5.21875, + "rewards/rejected": -4.125, + "step": 700 + }, + { + "epoch": 0.8601226993865031, + "grad_norm": 45.17083911298038, + "learning_rate": 3.603305785123967e-07, + "logits/chosen": -0.08056640625, + "logits/rejected": -0.1982421875, + "logps/chosen": -380.0, + "logps/rejected": -320.0, + "loss": 0.3654, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.75, + "rewards/margins": 5.34375, + "rewards/rejected": -4.59375, + "step": 701 + }, + { + "epoch": 0.8613496932515338, + "grad_norm": 31.973002163499245, + "learning_rate": 3.601239669421487e-07, + "logits/chosen": -0.2080078125, + "logits/rejected": -0.498046875, + "logps/chosen": -398.0, + "logps/rejected": -328.0, + "loss": 0.1933, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.8125, + "rewards/margins": 6.875, + "rewards/rejected": -5.0625, + "step": 702 + }, + { + "epoch": 0.8625766871165644, + "grad_norm": 36.36498243165029, + "learning_rate": 3.599173553719008e-07, + "logits/chosen": -0.10400390625, + "logits/rejected": -0.25, + "logps/chosen": -414.0, + "logps/rejected": -336.0, + "loss": 0.3136, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.203125, + "rewards/margins": 5.375, + "rewards/rejected": -4.1875, + "step": 703 + }, + { + "epoch": 0.8638036809815951, + "grad_norm": 35.79987216653264, + "learning_rate": 3.5971074380165287e-07, + "logits/chosen": -0.173828125, + "logits/rejected": -0.349609375, + "logps/chosen": -322.0, + "logps/rejected": -294.0, + "loss": 0.2837, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.1171875, + "rewards/margins": 5.8125, + "rewards/rejected": -4.6875, + "step": 704 + }, + { + "epoch": 0.8650306748466258, + "grad_norm": 36.827745109710804, + "learning_rate": 3.5950413223140497e-07, + "logits/chosen": -0.279296875, + "logits/rejected": -0.41015625, + "logps/chosen": -410.0, + "logps/rejected": -350.0, + "loss": 0.2403, + "rewards/accuracies": 0.875, + "rewards/chosen": 2.09375, + "rewards/margins": 6.75, + "rewards/rejected": -4.65625, + "step": 705 + }, + { + "epoch": 0.8662576687116564, + "grad_norm": 36.25592355489759, + "learning_rate": 3.5929752066115697e-07, + "logits/chosen": -0.216796875, + "logits/rejected": -0.41796875, + "logps/chosen": -398.0, + "logps/rejected": -294.0, + "loss": 0.2682, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.3984375, + "rewards/margins": 5.84375, + "rewards/rejected": -4.4375, + "step": 706 + }, + { + "epoch": 0.8674846625766871, + "grad_norm": 33.13517607643058, + "learning_rate": 3.5909090909090907e-07, + "logits/chosen": -0.228515625, + "logits/rejected": -0.388671875, + "logps/chosen": -382.0, + "logps/rejected": -302.0, + "loss": 0.2352, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.078125, + "rewards/margins": 6.0, + "rewards/rejected": -4.9375, + "step": 707 + }, + { + "epoch": 0.8687116564417178, + "grad_norm": 29.108052314139623, + "learning_rate": 3.588842975206611e-07, + "logits/chosen": -0.2119140625, + "logits/rejected": -0.4296875, + "logps/chosen": -370.0, + "logps/rejected": -308.0, + "loss": 0.2018, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.6328125, + "rewards/margins": 6.25, + "rewards/rejected": -4.625, + "step": 708 + }, + { + "epoch": 0.8699386503067484, + "grad_norm": 26.864603379868992, + "learning_rate": 3.586776859504132e-07, + "logits/chosen": -0.1123046875, + "logits/rejected": -0.28125, + "logps/chosen": -436.0, + "logps/rejected": -336.0, + "loss": 0.184, + "rewards/accuracies": 0.953125, + "rewards/chosen": 1.8046875, + "rewards/margins": 7.0, + "rewards/rejected": -5.1875, + "step": 709 + }, + { + "epoch": 0.8711656441717791, + "grad_norm": 39.09283390375149, + "learning_rate": 3.5847107438016526e-07, + "logits/chosen": -0.0732421875, + "logits/rejected": -0.2109375, + "logps/chosen": -362.0, + "logps/rejected": -308.0, + "loss": 0.3161, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.0859375, + "rewards/margins": 5.34375, + "rewards/rejected": -4.25, + "step": 710 + }, + { + "epoch": 0.8723926380368098, + "grad_norm": 29.706815103224322, + "learning_rate": 3.5826446280991736e-07, + "logits/chosen": -0.09912109375, + "logits/rejected": -0.29296875, + "logps/chosen": -382.0, + "logps/rejected": -312.0, + "loss": 0.2257, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.484375, + "rewards/margins": 5.84375, + "rewards/rejected": -4.375, + "step": 711 + }, + { + "epoch": 0.8736196319018404, + "grad_norm": 44.764736935363494, + "learning_rate": 3.580578512396694e-07, + "logits/chosen": -0.08984375, + "logits/rejected": -0.244140625, + "logps/chosen": -404.0, + "logps/rejected": -338.0, + "loss": 0.3157, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.984375, + "rewards/margins": 6.0, + "rewards/rejected": -4.03125, + "step": 712 + }, + { + "epoch": 0.8748466257668711, + "grad_norm": 33.83006454123061, + "learning_rate": 3.578512396694215e-07, + "logits/chosen": -0.1748046875, + "logits/rejected": -0.3671875, + "logps/chosen": -380.0, + "logps/rejected": -314.0, + "loss": 0.2531, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.234375, + "rewards/margins": 5.8125, + "rewards/rejected": -4.59375, + "step": 713 + }, + { + "epoch": 0.8760736196319019, + "grad_norm": 37.79578296577771, + "learning_rate": 3.5764462809917355e-07, + "logits/chosen": -0.07177734375, + "logits/rejected": -0.28515625, + "logps/chosen": -366.0, + "logps/rejected": -312.0, + "loss": 0.2529, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.2890625, + "rewards/margins": 5.5, + "rewards/rejected": -4.21875, + "step": 714 + }, + { + "epoch": 0.8773006134969326, + "grad_norm": 33.397821944610435, + "learning_rate": 3.574380165289256e-07, + "logits/chosen": -0.26953125, + "logits/rejected": -0.359375, + "logps/chosen": -382.0, + "logps/rejected": -312.0, + "loss": 0.2448, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.3046875, + "rewards/margins": 6.3125, + "rewards/rejected": -5.03125, + "step": 715 + }, + { + "epoch": 0.8785276073619632, + "grad_norm": 38.599098942966314, + "learning_rate": 3.5723140495867765e-07, + "logits/chosen": -0.236328125, + "logits/rejected": -0.423828125, + "logps/chosen": -382.0, + "logps/rejected": -308.0, + "loss": 0.3027, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.390625, + "rewards/margins": 5.5, + "rewards/rejected": -4.09375, + "step": 716 + }, + { + "epoch": 0.8797546012269939, + "grad_norm": 35.160888357665144, + "learning_rate": 3.5702479338842975e-07, + "logits/chosen": -0.146484375, + "logits/rejected": -0.30859375, + "logps/chosen": -342.0, + "logps/rejected": -268.0, + "loss": 0.2911, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.92578125, + "rewards/margins": 5.40625, + "rewards/rejected": -4.46875, + "step": 717 + }, + { + "epoch": 0.8809815950920246, + "grad_norm": 26.612419306861238, + "learning_rate": 3.568181818181818e-07, + "logits/chosen": -0.2333984375, + "logits/rejected": -0.3828125, + "logps/chosen": -398.0, + "logps/rejected": -336.0, + "loss": 0.1966, + "rewards/accuracies": 0.921875, + "rewards/chosen": 1.859375, + "rewards/margins": 6.15625, + "rewards/rejected": -4.3125, + "step": 718 + }, + { + "epoch": 0.8822085889570552, + "grad_norm": 39.83118714795231, + "learning_rate": 3.5661157024793384e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.3984375, + "logps/chosen": -406.0, + "logps/rejected": -346.0, + "loss": 0.2762, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 2.203125, + "rewards/margins": 6.34375, + "rewards/rejected": -4.15625, + "step": 719 + }, + { + "epoch": 0.8834355828220859, + "grad_norm": 30.80915305318243, + "learning_rate": 3.5640495867768594e-07, + "logits/chosen": -0.267578125, + "logits/rejected": -0.474609375, + "logps/chosen": -410.0, + "logps/rejected": -330.0, + "loss": 0.218, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 2.171875, + "rewards/margins": 6.125, + "rewards/rejected": -3.96875, + "step": 720 + }, + { + "epoch": 0.8846625766871166, + "grad_norm": 27.499435353414444, + "learning_rate": 3.56198347107438e-07, + "logits/chosen": -0.23828125, + "logits/rejected": -0.498046875, + "logps/chosen": -412.0, + "logps/rejected": -342.0, + "loss": 0.1999, + "rewards/accuracies": 0.90625, + "rewards/chosen": 1.7890625, + "rewards/margins": 6.875, + "rewards/rejected": -5.09375, + "step": 721 + }, + { + "epoch": 0.8858895705521472, + "grad_norm": 32.55228038139476, + "learning_rate": 3.559917355371901e-07, + "logits/chosen": -0.2353515625, + "logits/rejected": -0.333984375, + "logps/chosen": -378.0, + "logps/rejected": -336.0, + "loss": 0.222, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.8359375, + "rewards/margins": 6.09375, + "rewards/rejected": -4.25, + "step": 722 + }, + { + "epoch": 0.8871165644171779, + "grad_norm": 38.73866617415686, + "learning_rate": 3.5578512396694214e-07, + "logits/chosen": -0.23046875, + "logits/rejected": -0.3515625, + "logps/chosen": -372.0, + "logps/rejected": -314.0, + "loss": 0.2777, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.3046875, + "rewards/margins": 5.84375, + "rewards/rejected": -4.53125, + "step": 723 + }, + { + "epoch": 0.8883435582822086, + "grad_norm": 36.524786654594486, + "learning_rate": 3.555785123966942e-07, + "logits/chosen": -0.2265625, + "logits/rejected": -0.44921875, + "logps/chosen": -378.0, + "logps/rejected": -298.0, + "loss": 0.2442, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.6328125, + "rewards/margins": 6.0, + "rewards/rejected": -4.375, + "step": 724 + }, + { + "epoch": 0.8895705521472392, + "grad_norm": 38.158440355258406, + "learning_rate": 3.5537190082644623e-07, + "logits/chosen": -0.10986328125, + "logits/rejected": -0.283203125, + "logps/chosen": -400.0, + "logps/rejected": -318.0, + "loss": 0.283, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.390625, + "rewards/margins": 5.6875, + "rewards/rejected": -4.28125, + "step": 725 + }, + { + "epoch": 0.8907975460122699, + "grad_norm": 27.73103579824844, + "learning_rate": 3.5516528925619833e-07, + "logits/chosen": -0.2216796875, + "logits/rejected": -0.359375, + "logps/chosen": -334.0, + "logps/rejected": -280.0, + "loss": 0.1949, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.0703125, + "rewards/margins": 5.8125, + "rewards/rejected": -4.75, + "step": 726 + }, + { + "epoch": 0.8920245398773006, + "grad_norm": 34.09534371161639, + "learning_rate": 3.549586776859504e-07, + "logits/chosen": -0.2001953125, + "logits/rejected": -0.34765625, + "logps/chosen": -368.0, + "logps/rejected": -314.0, + "loss": 0.2172, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.515625, + "rewards/margins": 5.78125, + "rewards/rejected": -4.25, + "step": 727 + }, + { + "epoch": 0.8932515337423312, + "grad_norm": 39.39112103020417, + "learning_rate": 3.547520661157025e-07, + "logits/chosen": -0.208984375, + "logits/rejected": -0.361328125, + "logps/chosen": -398.0, + "logps/rejected": -354.0, + "loss": 0.2626, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.9765625, + "rewards/margins": 6.5625, + "rewards/rejected": -4.59375, + "step": 728 + }, + { + "epoch": 0.894478527607362, + "grad_norm": 37.23604455297992, + "learning_rate": 3.545454545454545e-07, + "logits/chosen": -0.2236328125, + "logits/rejected": -0.37890625, + "logps/chosen": -388.0, + "logps/rejected": -342.0, + "loss": 0.2356, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.640625, + "rewards/margins": 6.59375, + "rewards/rejected": -4.9375, + "step": 729 + }, + { + "epoch": 0.8957055214723927, + "grad_norm": 32.56560137662825, + "learning_rate": 3.543388429752066e-07, + "logits/chosen": -0.294921875, + "logits/rejected": -0.421875, + "logps/chosen": -398.0, + "logps/rejected": -354.0, + "loss": 0.2002, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 2.1875, + "rewards/margins": 6.9375, + "rewards/rejected": -4.75, + "step": 730 + }, + { + "epoch": 0.8969325153374234, + "grad_norm": 37.581323988938905, + "learning_rate": 3.5413223140495867e-07, + "logits/chosen": -0.1044921875, + "logits/rejected": -0.2412109375, + "logps/chosen": -430.0, + "logps/rejected": -338.0, + "loss": 0.2709, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.40625, + "rewards/margins": 6.15625, + "rewards/rejected": -4.75, + "step": 731 + }, + { + "epoch": 0.898159509202454, + "grad_norm": 42.424019347418515, + "learning_rate": 3.5392561983471077e-07, + "logits/chosen": -0.2451171875, + "logits/rejected": -0.419921875, + "logps/chosen": -372.0, + "logps/rejected": -346.0, + "loss": 0.3232, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.484375, + "rewards/margins": 5.9375, + "rewards/rejected": -4.46875, + "step": 732 + }, + { + "epoch": 0.8993865030674847, + "grad_norm": 30.46815348460911, + "learning_rate": 3.5371900826446277e-07, + "logits/chosen": -0.16015625, + "logits/rejected": -0.3203125, + "logps/chosen": -354.0, + "logps/rejected": -334.0, + "loss": 0.205, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.28125, + "rewards/margins": 6.09375, + "rewards/rejected": -4.8125, + "step": 733 + }, + { + "epoch": 0.9006134969325154, + "grad_norm": 40.11598742347428, + "learning_rate": 3.5351239669421487e-07, + "logits/chosen": -0.1337890625, + "logits/rejected": -0.322265625, + "logps/chosen": -374.0, + "logps/rejected": -326.0, + "loss": 0.2734, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.4140625, + "rewards/margins": 6.5625, + "rewards/rejected": -5.125, + "step": 734 + }, + { + "epoch": 0.901840490797546, + "grad_norm": 30.987246843568794, + "learning_rate": 3.533057851239669e-07, + "logits/chosen": -0.2392578125, + "logits/rejected": -0.47265625, + "logps/chosen": -422.0, + "logps/rejected": -358.0, + "loss": 0.1867, + "rewards/accuracies": 0.90625, + "rewards/chosen": 1.4921875, + "rewards/margins": 6.96875, + "rewards/rejected": -5.46875, + "step": 735 + }, + { + "epoch": 0.9030674846625767, + "grad_norm": 39.665000609602814, + "learning_rate": 3.53099173553719e-07, + "logits/chosen": -0.08203125, + "logits/rejected": -0.2138671875, + "logps/chosen": -352.0, + "logps/rejected": -316.0, + "loss": 0.3163, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.3671875, + "rewards/margins": 5.5625, + "rewards/rejected": -5.1875, + "step": 736 + }, + { + "epoch": 0.9042944785276074, + "grad_norm": 45.99636093708745, + "learning_rate": 3.5289256198347106e-07, + "logits/chosen": -0.1767578125, + "logits/rejected": -0.28125, + "logps/chosen": -350.0, + "logps/rejected": -322.0, + "loss": 0.3995, + "rewards/accuracies": 0.78125, + "rewards/chosen": 0.5546875, + "rewards/margins": 5.53125, + "rewards/rejected": -5.0, + "step": 737 + }, + { + "epoch": 0.905521472392638, + "grad_norm": 34.94091041398414, + "learning_rate": 3.526859504132231e-07, + "logits/chosen": -0.2255859375, + "logits/rejected": -0.361328125, + "logps/chosen": -440.0, + "logps/rejected": -336.0, + "loss": 0.2497, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.578125, + "rewards/margins": 6.5625, + "rewards/rejected": -5.0, + "step": 738 + }, + { + "epoch": 0.9067484662576687, + "grad_norm": 37.70067993632191, + "learning_rate": 3.524793388429752e-07, + "logits/chosen": -0.1650390625, + "logits/rejected": -0.30859375, + "logps/chosen": -338.0, + "logps/rejected": -318.0, + "loss": 0.2834, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.671875, + "rewards/margins": 5.65625, + "rewards/rejected": -4.96875, + "step": 739 + }, + { + "epoch": 0.9079754601226994, + "grad_norm": 33.58911831683584, + "learning_rate": 3.5227272727272725e-07, + "logits/chosen": -0.22265625, + "logits/rejected": -0.392578125, + "logps/chosen": -338.0, + "logps/rejected": -306.0, + "loss": 0.2496, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.60546875, + "rewards/margins": 6.09375, + "rewards/rejected": -5.5, + "step": 740 + }, + { + "epoch": 0.90920245398773, + "grad_norm": 35.571601551599564, + "learning_rate": 3.5206611570247935e-07, + "logits/chosen": -0.2119140625, + "logits/rejected": -0.38671875, + "logps/chosen": -352.0, + "logps/rejected": -306.0, + "loss": 0.2619, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.3515625, + "rewards/margins": 6.90625, + "rewards/rejected": -5.53125, + "step": 741 + }, + { + "epoch": 0.9104294478527607, + "grad_norm": 31.812391536470038, + "learning_rate": 3.5185950413223135e-07, + "logits/chosen": -0.2138671875, + "logits/rejected": -0.412109375, + "logps/chosen": -360.0, + "logps/rejected": -348.0, + "loss": 0.2088, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.484375, + "rewards/margins": 7.03125, + "rewards/rejected": -5.53125, + "step": 742 + }, + { + "epoch": 0.9116564417177914, + "grad_norm": 36.766990867423736, + "learning_rate": 3.5165289256198345e-07, + "logits/chosen": -0.19140625, + "logits/rejected": -0.263671875, + "logps/chosen": -416.0, + "logps/rejected": -368.0, + "loss": 0.2538, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.0390625, + "rewards/margins": 5.6875, + "rewards/rejected": -4.65625, + "step": 743 + }, + { + "epoch": 0.912883435582822, + "grad_norm": 30.797563569261442, + "learning_rate": 3.514462809917355e-07, + "logits/chosen": -0.1796875, + "logits/rejected": -0.373046875, + "logps/chosen": -376.0, + "logps/rejected": -318.0, + "loss": 0.2174, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.5546875, + "rewards/margins": 7.03125, + "rewards/rejected": -5.5, + "step": 744 + }, + { + "epoch": 0.9141104294478528, + "grad_norm": 37.182331193903785, + "learning_rate": 3.512396694214876e-07, + "logits/chosen": -0.1376953125, + "logits/rejected": -0.2451171875, + "logps/chosen": -342.0, + "logps/rejected": -300.0, + "loss": 0.2759, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.515625, + "rewards/margins": 5.40625, + "rewards/rejected": -4.875, + "step": 745 + }, + { + "epoch": 0.9153374233128835, + "grad_norm": 42.37840427394414, + "learning_rate": 3.5103305785123964e-07, + "logits/chosen": -0.140625, + "logits/rejected": -0.306640625, + "logps/chosen": -402.0, + "logps/rejected": -336.0, + "loss": 0.2818, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.96484375, + "rewards/margins": 5.9375, + "rewards/rejected": -4.96875, + "step": 746 + }, + { + "epoch": 0.9165644171779141, + "grad_norm": 36.09849932082116, + "learning_rate": 3.5082644628099174e-07, + "logits/chosen": -0.306640625, + "logits/rejected": -0.42578125, + "logps/chosen": -338.0, + "logps/rejected": -326.0, + "loss": 0.2741, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.51171875, + "rewards/margins": 5.3125, + "rewards/rejected": -4.8125, + "step": 747 + }, + { + "epoch": 0.9177914110429448, + "grad_norm": 39.853022506318325, + "learning_rate": 3.506198347107438e-07, + "logits/chosen": -0.11376953125, + "logits/rejected": -0.2314453125, + "logps/chosen": -372.0, + "logps/rejected": -332.0, + "loss": 0.3302, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.205078125, + "rewards/margins": 4.875, + "rewards/rejected": -4.65625, + "step": 748 + }, + { + "epoch": 0.9190184049079755, + "grad_norm": 40.89419641030945, + "learning_rate": 3.504132231404959e-07, + "logits/chosen": -0.2275390625, + "logits/rejected": -0.4375, + "logps/chosen": -416.0, + "logps/rejected": -336.0, + "loss": 0.3306, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.046875, + "rewards/margins": 6.1875, + "rewards/rejected": -5.15625, + "step": 749 + }, + { + "epoch": 0.9202453987730062, + "grad_norm": 48.1673918296563, + "learning_rate": 3.5020661157024794e-07, + "logits/chosen": -0.212890625, + "logits/rejected": -0.357421875, + "logps/chosen": -406.0, + "logps/rejected": -326.0, + "loss": 0.3386, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.66796875, + "rewards/margins": 5.75, + "rewards/rejected": -5.09375, + "step": 750 + }, + { + "epoch": 0.9214723926380368, + "grad_norm": 43.63193512219085, + "learning_rate": 3.5e-07, + "logits/chosen": -0.21484375, + "logits/rejected": -0.384765625, + "logps/chosen": -420.0, + "logps/rejected": -340.0, + "loss": 0.2867, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.1796875, + "rewards/margins": 6.4375, + "rewards/rejected": -5.25, + "step": 751 + }, + { + "epoch": 0.9226993865030675, + "grad_norm": 35.77618155880579, + "learning_rate": 3.4979338842975203e-07, + "logits/chosen": -0.216796875, + "logits/rejected": -0.478515625, + "logps/chosen": -418.0, + "logps/rejected": -346.0, + "loss": 0.2401, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.359375, + "rewards/margins": 6.875, + "rewards/rejected": -5.5, + "step": 752 + }, + { + "epoch": 0.9239263803680982, + "grad_norm": 38.24604411902878, + "learning_rate": 3.4958677685950413e-07, + "logits/chosen": -0.1181640625, + "logits/rejected": -0.265625, + "logps/chosen": -402.0, + "logps/rejected": -338.0, + "loss": 0.2709, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.71484375, + "rewards/margins": 5.59375, + "rewards/rejected": -4.875, + "step": 753 + }, + { + "epoch": 0.9251533742331288, + "grad_norm": 43.12286562619324, + "learning_rate": 3.493801652892562e-07, + "logits/chosen": -0.1767578125, + "logits/rejected": -0.345703125, + "logps/chosen": -386.0, + "logps/rejected": -326.0, + "loss": 0.3289, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.66015625, + "rewards/margins": 5.625, + "rewards/rejected": -4.9375, + "step": 754 + }, + { + "epoch": 0.9263803680981595, + "grad_norm": 34.65065790431959, + "learning_rate": 3.491735537190082e-07, + "logits/chosen": -0.2216796875, + "logits/rejected": -0.34765625, + "logps/chosen": -376.0, + "logps/rejected": -340.0, + "loss": 0.2314, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.87109375, + "rewards/margins": 5.90625, + "rewards/rejected": -5.03125, + "step": 755 + }, + { + "epoch": 0.9276073619631902, + "grad_norm": 32.01115835369059, + "learning_rate": 3.489669421487603e-07, + "logits/chosen": -0.1357421875, + "logits/rejected": -0.2294921875, + "logps/chosen": -332.0, + "logps/rejected": -302.0, + "loss": 0.2247, + "rewards/accuracies": 0.890625, + "rewards/chosen": 0.390625, + "rewards/margins": 5.4375, + "rewards/rejected": -5.03125, + "step": 756 + }, + { + "epoch": 0.9288343558282208, + "grad_norm": 29.79853888885103, + "learning_rate": 3.4876033057851237e-07, + "logits/chosen": -0.087890625, + "logits/rejected": -0.314453125, + "logps/chosen": -398.0, + "logps/rejected": -320.0, + "loss": 0.2143, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.4140625, + "rewards/margins": 6.28125, + "rewards/rejected": -4.875, + "step": 757 + }, + { + "epoch": 0.9300613496932515, + "grad_norm": 41.4434512511522, + "learning_rate": 3.4855371900826447e-07, + "logits/chosen": -0.142578125, + "logits/rejected": -0.3125, + "logps/chosen": -366.0, + "logps/rejected": -296.0, + "loss": 0.3204, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.494140625, + "rewards/margins": 5.40625, + "rewards/rejected": -4.90625, + "step": 758 + }, + { + "epoch": 0.9312883435582822, + "grad_norm": 33.101256433680135, + "learning_rate": 3.483471074380165e-07, + "logits/chosen": -0.1123046875, + "logits/rejected": -0.34375, + "logps/chosen": -386.0, + "logps/rejected": -318.0, + "loss": 0.2334, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.28125, + "rewards/margins": 5.8125, + "rewards/rejected": -4.53125, + "step": 759 + }, + { + "epoch": 0.9325153374233128, + "grad_norm": 31.858866512033583, + "learning_rate": 3.4814049586776857e-07, + "logits/chosen": -0.275390625, + "logits/rejected": -0.53515625, + "logps/chosen": -434.0, + "logps/rejected": -342.0, + "loss": 0.2656, + "rewards/accuracies": 0.859375, + "rewards/chosen": 2.046875, + "rewards/margins": 7.03125, + "rewards/rejected": -5.0, + "step": 760 + }, + { + "epoch": 0.9337423312883436, + "grad_norm": 42.354453289827106, + "learning_rate": 3.479338842975206e-07, + "logits/chosen": -0.08251953125, + "logits/rejected": -0.232421875, + "logps/chosen": -374.0, + "logps/rejected": -334.0, + "loss": 0.258, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.3359375, + "rewards/margins": 6.0625, + "rewards/rejected": -4.71875, + "step": 761 + }, + { + "epoch": 0.9349693251533743, + "grad_norm": 38.24811318296336, + "learning_rate": 3.477272727272727e-07, + "logits/chosen": -0.0703125, + "logits/rejected": -0.25390625, + "logps/chosen": -420.0, + "logps/rejected": -340.0, + "loss": 0.2519, + "rewards/accuracies": 0.9140625, + "rewards/chosen": 1.1953125, + "rewards/margins": 6.09375, + "rewards/rejected": -4.90625, + "step": 762 + }, + { + "epoch": 0.9361963190184049, + "grad_norm": 36.20016344003986, + "learning_rate": 3.4752066115702476e-07, + "logits/chosen": -0.1357421875, + "logits/rejected": -0.2333984375, + "logps/chosen": -388.0, + "logps/rejected": -338.0, + "loss": 0.2628, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.578125, + "rewards/margins": 6.25, + "rewards/rejected": -4.65625, + "step": 763 + }, + { + "epoch": 0.9374233128834356, + "grad_norm": 37.48666102403677, + "learning_rate": 3.4731404958677686e-07, + "logits/chosen": -0.330078125, + "logits/rejected": -0.490234375, + "logps/chosen": -320.0, + "logps/rejected": -294.0, + "loss": 0.2761, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 0.447265625, + "rewards/margins": 5.625, + "rewards/rejected": -5.15625, + "step": 764 + }, + { + "epoch": 0.9386503067484663, + "grad_norm": 44.1796891457386, + "learning_rate": 3.471074380165289e-07, + "logits/chosen": -0.126953125, + "logits/rejected": -0.2578125, + "logps/chosen": -392.0, + "logps/rejected": -298.0, + "loss": 0.3388, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.89453125, + "rewards/margins": 5.03125, + "rewards/rejected": -4.15625, + "step": 765 + }, + { + "epoch": 0.939877300613497, + "grad_norm": 36.01121716925078, + "learning_rate": 3.46900826446281e-07, + "logits/chosen": -0.16796875, + "logits/rejected": -0.37109375, + "logps/chosen": -434.0, + "logps/rejected": -316.0, + "loss": 0.268, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.546875, + "rewards/margins": 6.21875, + "rewards/rejected": -4.65625, + "step": 766 + }, + { + "epoch": 0.9411042944785276, + "grad_norm": 36.56160162737348, + "learning_rate": 3.4669421487603306e-07, + "logits/chosen": -0.1884765625, + "logits/rejected": -0.33984375, + "logps/chosen": -374.0, + "logps/rejected": -312.0, + "loss": 0.3045, + "rewards/accuracies": 0.796875, + "rewards/chosen": 1.2890625, + "rewards/margins": 6.03125, + "rewards/rejected": -4.75, + "step": 767 + }, + { + "epoch": 0.9423312883435583, + "grad_norm": 40.47132685816318, + "learning_rate": 3.464876033057851e-07, + "logits/chosen": -0.2021484375, + "logits/rejected": -0.3828125, + "logps/chosen": -398.0, + "logps/rejected": -360.0, + "loss": 0.2909, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.765625, + "rewards/margins": 6.3125, + "rewards/rejected": -4.5625, + "step": 768 + }, + { + "epoch": 0.943558282208589, + "grad_norm": 30.62201594248347, + "learning_rate": 3.4628099173553715e-07, + "logits/chosen": -0.21484375, + "logits/rejected": -0.361328125, + "logps/chosen": -366.0, + "logps/rejected": -318.0, + "loss": 0.2247, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.09375, + "rewards/margins": 6.15625, + "rewards/rejected": -5.0625, + "step": 769 + }, + { + "epoch": 0.9447852760736196, + "grad_norm": 43.60373632493513, + "learning_rate": 3.4607438016528925e-07, + "logits/chosen": -0.2255859375, + "logits/rejected": -0.474609375, + "logps/chosen": -404.0, + "logps/rejected": -348.0, + "loss": 0.2772, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 2.078125, + "rewards/margins": 6.28125, + "rewards/rejected": -4.1875, + "step": 770 + }, + { + "epoch": 0.9460122699386503, + "grad_norm": 45.17582091386918, + "learning_rate": 3.458677685950413e-07, + "logits/chosen": -0.2236328125, + "logits/rejected": -0.26171875, + "logps/chosen": -416.0, + "logps/rejected": -334.0, + "loss": 0.3922, + "rewards/accuracies": 0.78125, + "rewards/chosen": 0.78125, + "rewards/margins": 5.03125, + "rewards/rejected": -4.25, + "step": 771 + }, + { + "epoch": 0.947239263803681, + "grad_norm": 42.297058717421166, + "learning_rate": 3.456611570247934e-07, + "logits/chosen": -0.0947265625, + "logits/rejected": -0.31640625, + "logps/chosen": -410.0, + "logps/rejected": -336.0, + "loss": 0.295, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.734375, + "rewards/margins": 6.0, + "rewards/rejected": -4.28125, + "step": 772 + }, + { + "epoch": 0.9484662576687116, + "grad_norm": 36.5037310282473, + "learning_rate": 3.4545454545454544e-07, + "logits/chosen": -0.10009765625, + "logits/rejected": -0.287109375, + "logps/chosen": -360.0, + "logps/rejected": -298.0, + "loss": 0.2904, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.7890625, + "rewards/margins": 5.21875, + "rewards/rejected": -4.4375, + "step": 773 + }, + { + "epoch": 0.9496932515337423, + "grad_norm": 38.086980897558234, + "learning_rate": 3.452479338842975e-07, + "logits/chosen": -0.1240234375, + "logits/rejected": -0.263671875, + "logps/chosen": -344.0, + "logps/rejected": -296.0, + "loss": 0.3096, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.458984375, + "rewards/margins": 4.09375, + "rewards/rejected": -3.640625, + "step": 774 + }, + { + "epoch": 0.950920245398773, + "grad_norm": 36.85278680079692, + "learning_rate": 3.450413223140496e-07, + "logits/chosen": -0.03271484375, + "logits/rejected": -0.2275390625, + "logps/chosen": -398.0, + "logps/rejected": -332.0, + "loss": 0.2823, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.515625, + "rewards/margins": 5.09375, + "rewards/rejected": -3.578125, + "step": 775 + }, + { + "epoch": 0.9521472392638037, + "grad_norm": 34.94073241862638, + "learning_rate": 3.4483471074380164e-07, + "logits/chosen": -0.2265625, + "logits/rejected": -0.412109375, + "logps/chosen": -398.0, + "logps/rejected": -338.0, + "loss": 0.2924, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.796875, + "rewards/margins": 5.6875, + "rewards/rejected": -3.90625, + "step": 776 + }, + { + "epoch": 0.9533742331288344, + "grad_norm": 36.22271519573166, + "learning_rate": 3.446280991735537e-07, + "logits/chosen": -0.1953125, + "logits/rejected": -0.34375, + "logps/chosen": -390.0, + "logps/rejected": -314.0, + "loss": 0.2907, + "rewards/accuracies": 0.796875, + "rewards/chosen": 1.2109375, + "rewards/margins": 5.46875, + "rewards/rejected": -4.25, + "step": 777 + }, + { + "epoch": 0.9546012269938651, + "grad_norm": 38.284746149580194, + "learning_rate": 3.4442148760330573e-07, + "logits/chosen": -0.16796875, + "logits/rejected": -0.375, + "logps/chosen": -382.0, + "logps/rejected": -300.0, + "loss": 0.2391, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.125, + "rewards/margins": 5.03125, + "rewards/rejected": -3.90625, + "step": 778 + }, + { + "epoch": 0.9558282208588957, + "grad_norm": 42.74163715791748, + "learning_rate": 3.4421487603305783e-07, + "logits/chosen": -0.2236328125, + "logits/rejected": -0.40234375, + "logps/chosen": -428.0, + "logps/rejected": -332.0, + "loss": 0.2504, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.6015625, + "rewards/margins": 6.15625, + "rewards/rejected": -4.53125, + "step": 779 + }, + { + "epoch": 0.9570552147239264, + "grad_norm": 39.028284362830085, + "learning_rate": 3.440082644628099e-07, + "logits/chosen": -0.1259765625, + "logits/rejected": -0.298828125, + "logps/chosen": -368.0, + "logps/rejected": -334.0, + "loss": 0.327, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.81640625, + "rewards/margins": 5.0, + "rewards/rejected": -4.1875, + "step": 780 + }, + { + "epoch": 0.9582822085889571, + "grad_norm": 29.49560218073861, + "learning_rate": 3.43801652892562e-07, + "logits/chosen": -0.2294921875, + "logits/rejected": -0.458984375, + "logps/chosen": -416.0, + "logps/rejected": -328.0, + "loss": 0.1947, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.921875, + "rewards/margins": 6.9375, + "rewards/rejected": -5.0, + "step": 781 + }, + { + "epoch": 0.9595092024539877, + "grad_norm": 30.862418691296618, + "learning_rate": 3.43595041322314e-07, + "logits/chosen": -0.1962890625, + "logits/rejected": -0.314453125, + "logps/chosen": -358.0, + "logps/rejected": -326.0, + "loss": 0.2276, + "rewards/accuracies": 0.9140625, + "rewards/chosen": 1.1640625, + "rewards/margins": 5.53125, + "rewards/rejected": -4.375, + "step": 782 + }, + { + "epoch": 0.9607361963190184, + "grad_norm": 32.30854631034835, + "learning_rate": 3.433884297520661e-07, + "logits/chosen": -0.2138671875, + "logits/rejected": -0.3671875, + "logps/chosen": -408.0, + "logps/rejected": -344.0, + "loss": 0.2037, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.609375, + "rewards/margins": 6.46875, + "rewards/rejected": -4.84375, + "step": 783 + }, + { + "epoch": 0.9619631901840491, + "grad_norm": 44.933495412305525, + "learning_rate": 3.4318181818181817e-07, + "logits/chosen": -0.189453125, + "logits/rejected": -0.2412109375, + "logps/chosen": -376.0, + "logps/rejected": -330.0, + "loss": 0.3216, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.421875, + "rewards/margins": 5.125, + "rewards/rejected": -4.71875, + "step": 784 + }, + { + "epoch": 0.9631901840490797, + "grad_norm": 35.45021237079088, + "learning_rate": 3.429752066115703e-07, + "logits/chosen": -0.146484375, + "logits/rejected": -0.314453125, + "logps/chosen": -374.0, + "logps/rejected": -300.0, + "loss": 0.2635, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.03125, + "rewards/margins": 5.96875, + "rewards/rejected": -4.9375, + "step": 785 + }, + { + "epoch": 0.9644171779141104, + "grad_norm": 31.822348766627872, + "learning_rate": 3.4276859504132227e-07, + "logits/chosen": -0.1396484375, + "logits/rejected": -0.34765625, + "logps/chosen": -362.0, + "logps/rejected": -308.0, + "loss": 0.2296, + "rewards/accuracies": 0.9140625, + "rewards/chosen": 0.5703125, + "rewards/margins": 5.8125, + "rewards/rejected": -5.21875, + "step": 786 + }, + { + "epoch": 0.9656441717791411, + "grad_norm": 35.86043202347341, + "learning_rate": 3.4256198347107437e-07, + "logits/chosen": -0.21484375, + "logits/rejected": -0.359375, + "logps/chosen": -402.0, + "logps/rejected": -326.0, + "loss": 0.2274, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.78125, + "rewards/margins": 6.40625, + "rewards/rejected": -5.625, + "step": 787 + }, + { + "epoch": 0.9668711656441717, + "grad_norm": 26.552313321059188, + "learning_rate": 3.423553719008264e-07, + "logits/chosen": -0.2255859375, + "logits/rejected": -0.408203125, + "logps/chosen": -382.0, + "logps/rejected": -346.0, + "loss": 0.1667, + "rewards/accuracies": 0.9296875, + "rewards/chosen": 1.1875, + "rewards/margins": 6.75, + "rewards/rejected": -5.5625, + "step": 788 + }, + { + "epoch": 0.9680981595092024, + "grad_norm": 33.30240522771134, + "learning_rate": 3.421487603305785e-07, + "logits/chosen": -0.1474609375, + "logits/rejected": -0.330078125, + "logps/chosen": -374.0, + "logps/rejected": -308.0, + "loss": 0.2769, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 0.419921875, + "rewards/margins": 5.4375, + "rewards/rejected": -5.0, + "step": 789 + }, + { + "epoch": 0.9693251533742331, + "grad_norm": 35.332506360333724, + "learning_rate": 3.4194214876033056e-07, + "logits/chosen": -0.263671875, + "logits/rejected": -0.484375, + "logps/chosen": -380.0, + "logps/rejected": -310.0, + "loss": 0.2259, + "rewards/accuracies": 0.890625, + "rewards/chosen": 0.71484375, + "rewards/margins": 6.03125, + "rewards/rejected": -5.3125, + "step": 790 + }, + { + "epoch": 0.9705521472392638, + "grad_norm": 35.242935109364, + "learning_rate": 3.417355371900826e-07, + "logits/chosen": -0.232421875, + "logits/rejected": -0.4453125, + "logps/chosen": -390.0, + "logps/rejected": -324.0, + "loss": 0.2483, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.1796875, + "rewards/margins": 6.84375, + "rewards/rejected": -5.6875, + "step": 791 + }, + { + "epoch": 0.9717791411042945, + "grad_norm": 38.00481733058289, + "learning_rate": 3.415289256198347e-07, + "logits/chosen": -0.232421875, + "logits/rejected": -0.392578125, + "logps/chosen": -432.0, + "logps/rejected": -354.0, + "loss": 0.3121, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.109375, + "rewards/margins": 5.5625, + "rewards/rejected": -4.46875, + "step": 792 + }, + { + "epoch": 0.9730061349693252, + "grad_norm": 39.05298404914802, + "learning_rate": 3.4132231404958676e-07, + "logits/chosen": -0.21875, + "logits/rejected": -0.365234375, + "logps/chosen": -384.0, + "logps/rejected": -340.0, + "loss": 0.3098, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.7109375, + "rewards/margins": 5.5, + "rewards/rejected": -4.78125, + "step": 793 + }, + { + "epoch": 0.9742331288343559, + "grad_norm": 40.1763340425155, + "learning_rate": 3.4111570247933886e-07, + "logits/chosen": -0.169921875, + "logits/rejected": -0.30859375, + "logps/chosen": -348.0, + "logps/rejected": -314.0, + "loss": 0.3445, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.3046875, + "rewards/margins": 5.3125, + "rewards/rejected": -5.0, + "step": 794 + }, + { + "epoch": 0.9754601226993865, + "grad_norm": 31.061860595685847, + "learning_rate": 3.4090909090909085e-07, + "logits/chosen": -0.3359375, + "logits/rejected": -0.515625, + "logps/chosen": -384.0, + "logps/rejected": -346.0, + "loss": 0.2126, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.65625, + "rewards/margins": 7.59375, + "rewards/rejected": -5.9375, + "step": 795 + }, + { + "epoch": 0.9766871165644172, + "grad_norm": 43.66859590907784, + "learning_rate": 3.4070247933884295e-07, + "logits/chosen": -0.244140625, + "logits/rejected": -0.447265625, + "logps/chosen": -400.0, + "logps/rejected": -312.0, + "loss": 0.2891, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.0830078125, + "rewards/margins": 5.5, + "rewards/rejected": -5.4375, + "step": 796 + }, + { + "epoch": 0.9779141104294479, + "grad_norm": 35.97056431665963, + "learning_rate": 3.40495867768595e-07, + "logits/chosen": -0.1767578125, + "logits/rejected": -0.357421875, + "logps/chosen": -394.0, + "logps/rejected": -300.0, + "loss": 0.2689, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.8359375, + "rewards/margins": 5.6875, + "rewards/rejected": -4.84375, + "step": 797 + }, + { + "epoch": 0.9791411042944785, + "grad_norm": 34.63236728191056, + "learning_rate": 3.402892561983471e-07, + "logits/chosen": -0.2099609375, + "logits/rejected": -0.388671875, + "logps/chosen": -424.0, + "logps/rejected": -354.0, + "loss": 0.2477, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.91015625, + "rewards/margins": 6.15625, + "rewards/rejected": -5.25, + "step": 798 + }, + { + "epoch": 0.9803680981595092, + "grad_norm": 40.12810675669665, + "learning_rate": 3.4008264462809914e-07, + "logits/chosen": -0.2470703125, + "logits/rejected": -0.421875, + "logps/chosen": -392.0, + "logps/rejected": -336.0, + "loss": 0.3047, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.125, + "rewards/margins": 6.0625, + "rewards/rejected": -4.9375, + "step": 799 + }, + { + "epoch": 0.9815950920245399, + "grad_norm": 36.02461663266261, + "learning_rate": 3.3987603305785124e-07, + "logits/chosen": -0.2255859375, + "logits/rejected": -0.42578125, + "logps/chosen": -378.0, + "logps/rejected": -324.0, + "loss": 0.2414, + "rewards/accuracies": 0.890625, + "rewards/chosen": 0.7265625, + "rewards/margins": 5.96875, + "rewards/rejected": -5.25, + "step": 800 + }, + { + "epoch": 0.9828220858895705, + "grad_norm": 42.912325824023604, + "learning_rate": 3.396694214876033e-07, + "logits/chosen": -0.2333984375, + "logits/rejected": -0.39453125, + "logps/chosen": -428.0, + "logps/rejected": -360.0, + "loss": 0.3447, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 0.82421875, + "rewards/margins": 5.375, + "rewards/rejected": -4.5625, + "step": 801 + }, + { + "epoch": 0.9840490797546012, + "grad_norm": 43.08820301261888, + "learning_rate": 3.394628099173554e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.42578125, + "logps/chosen": -380.0, + "logps/rejected": -328.0, + "loss": 0.3234, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.58203125, + "rewards/margins": 5.6875, + "rewards/rejected": -5.09375, + "step": 802 + }, + { + "epoch": 0.9852760736196319, + "grad_norm": 32.00066785635946, + "learning_rate": 3.3925619834710744e-07, + "logits/chosen": -0.333984375, + "logits/rejected": -0.5078125, + "logps/chosen": -390.0, + "logps/rejected": -324.0, + "loss": 0.2588, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.2578125, + "rewards/margins": 6.15625, + "rewards/rejected": -4.90625, + "step": 803 + }, + { + "epoch": 0.9865030674846625, + "grad_norm": 34.73198448187894, + "learning_rate": 3.390495867768595e-07, + "logits/chosen": -0.1806640625, + "logits/rejected": -0.3046875, + "logps/chosen": -352.0, + "logps/rejected": -320.0, + "loss": 0.3089, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 0.357421875, + "rewards/margins": 5.09375, + "rewards/rejected": -4.71875, + "step": 804 + }, + { + "epoch": 0.9877300613496932, + "grad_norm": 40.00296686612965, + "learning_rate": 3.3884297520661153e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.421875, + "logps/chosen": -426.0, + "logps/rejected": -372.0, + "loss": 0.3066, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.078125, + "rewards/margins": 6.15625, + "rewards/rejected": -5.09375, + "step": 805 + }, + { + "epoch": 0.9889570552147239, + "grad_norm": 40.373803134623145, + "learning_rate": 3.3863636363636363e-07, + "logits/chosen": -0.07470703125, + "logits/rejected": -0.2119140625, + "logps/chosen": -408.0, + "logps/rejected": -360.0, + "loss": 0.3327, + "rewards/accuracies": 0.796875, + "rewards/chosen": 0.79296875, + "rewards/margins": 5.34375, + "rewards/rejected": -4.53125, + "step": 806 + }, + { + "epoch": 0.9901840490797545, + "grad_norm": 38.793240604287554, + "learning_rate": 3.384297520661157e-07, + "logits/chosen": -0.162109375, + "logits/rejected": -0.32421875, + "logps/chosen": -394.0, + "logps/rejected": -324.0, + "loss": 0.2214, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.140625, + "rewards/margins": 6.34375, + "rewards/rejected": -5.1875, + "step": 807 + }, + { + "epoch": 0.9914110429447853, + "grad_norm": 34.36639607943694, + "learning_rate": 3.3822314049586773e-07, + "logits/chosen": -0.291015625, + "logits/rejected": -0.3125, + "logps/chosen": -354.0, + "logps/rejected": -326.0, + "loss": 0.2778, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 0.34375, + "rewards/margins": 5.84375, + "rewards/rejected": -5.5, + "step": 808 + }, + { + "epoch": 0.992638036809816, + "grad_norm": 35.83788708559064, + "learning_rate": 3.3801652892561983e-07, + "logits/chosen": -0.205078125, + "logits/rejected": -0.43359375, + "logps/chosen": -428.0, + "logps/rejected": -334.0, + "loss": 0.2316, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.6875, + "rewards/margins": 6.84375, + "rewards/rejected": -5.15625, + "step": 809 + }, + { + "epoch": 0.9938650306748467, + "grad_norm": 33.992147771254764, + "learning_rate": 3.378099173553719e-07, + "logits/chosen": -0.30078125, + "logits/rejected": -0.486328125, + "logps/chosen": -436.0, + "logps/rejected": -358.0, + "loss": 0.232, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.34375, + "rewards/margins": 6.40625, + "rewards/rejected": -5.0625, + "step": 810 + }, + { + "epoch": 0.9950920245398773, + "grad_norm": 33.283496414356925, + "learning_rate": 3.37603305785124e-07, + "logits/chosen": -0.291015625, + "logits/rejected": -0.44921875, + "logps/chosen": -386.0, + "logps/rejected": -356.0, + "loss": 0.2725, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.2578125, + "rewards/margins": 5.875, + "rewards/rejected": -4.625, + "step": 811 + }, + { + "epoch": 0.996319018404908, + "grad_norm": 37.39709126950234, + "learning_rate": 3.37396694214876e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.359375, + "logps/chosen": -356.0, + "logps/rejected": -316.0, + "loss": 0.2424, + "rewards/accuracies": 0.921875, + "rewards/chosen": 0.65625, + "rewards/margins": 6.09375, + "rewards/rejected": -5.4375, + "step": 812 + }, + { + "epoch": 0.9975460122699387, + "grad_norm": 33.804195099429606, + "learning_rate": 3.3719008264462807e-07, + "logits/chosen": -0.1953125, + "logits/rejected": -0.341796875, + "logps/chosen": -336.0, + "logps/rejected": -314.0, + "loss": 0.1865, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.9140625, + "rewards/margins": 6.0625, + "rewards/rejected": -5.15625, + "step": 813 + }, + { + "epoch": 0.9987730061349693, + "grad_norm": 38.231813987979244, + "learning_rate": 3.369834710743801e-07, + "logits/chosen": -0.1884765625, + "logits/rejected": -0.2734375, + "logps/chosen": -378.0, + "logps/rejected": -346.0, + "loss": 0.3288, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.162109375, + "rewards/margins": 4.65625, + "rewards/rejected": -4.5, + "step": 814 + }, + { + "epoch": 1.0, + "grad_norm": 37.3431869316195, + "learning_rate": 3.367768595041322e-07, + "logits/chosen": -0.11572265625, + "logits/rejected": -0.306640625, + "logps/chosen": -378.0, + "logps/rejected": -338.0, + "loss": 0.203, + "rewards/accuracies": 0.8571429252624512, + "rewards/chosen": 0.859375, + "rewards/margins": 5.9375, + "rewards/rejected": -5.0625, + "step": 815 + }, + { + "epoch": 1.0012269938650307, + "grad_norm": 12.259663022531143, + "learning_rate": 3.3657024793388426e-07, + "logits/chosen": -0.166015625, + "logits/rejected": -0.3203125, + "logps/chosen": -372.0, + "logps/rejected": -304.0, + "loss": 0.0783, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.7421875, + "rewards/margins": 7.0625, + "rewards/rejected": -5.3125, + "step": 816 + }, + { + "epoch": 1.0024539877300613, + "grad_norm": 15.209721486737584, + "learning_rate": 3.3636363636363636e-07, + "logits/chosen": -0.1943359375, + "logits/rejected": -0.3515625, + "logps/chosen": -358.0, + "logps/rejected": -306.0, + "loss": 0.099, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.92578125, + "rewards/margins": 6.25, + "rewards/rejected": -5.3125, + "step": 817 + }, + { + "epoch": 1.003680981595092, + "grad_norm": 12.54319426872472, + "learning_rate": 3.361570247933884e-07, + "logits/chosen": -0.3125, + "logits/rejected": -0.40625, + "logps/chosen": -360.0, + "logps/rejected": -334.0, + "loss": 0.0757, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.5234375, + "rewards/margins": 6.75, + "rewards/rejected": -5.21875, + "step": 818 + }, + { + "epoch": 1.0049079754601227, + "grad_norm": 15.278011566295417, + "learning_rate": 3.359504132231405e-07, + "logits/chosen": -0.1787109375, + "logits/rejected": -0.35546875, + "logps/chosen": -388.0, + "logps/rejected": -332.0, + "loss": 0.0833, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.625, + "rewards/margins": 6.8125, + "rewards/rejected": -5.1875, + "step": 819 + }, + { + "epoch": 1.0061349693251533, + "grad_norm": 13.554341111152507, + "learning_rate": 3.3574380165289256e-07, + "logits/chosen": -0.1494140625, + "logits/rejected": -0.294921875, + "logps/chosen": -394.0, + "logps/rejected": -328.0, + "loss": 0.0889, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.9296875, + "rewards/margins": 6.625, + "rewards/rejected": -4.71875, + "step": 820 + }, + { + "epoch": 1.007361963190184, + "grad_norm": 19.71965131533449, + "learning_rate": 3.3553719008264466e-07, + "logits/chosen": -0.2177734375, + "logits/rejected": -0.35546875, + "logps/chosen": -346.0, + "logps/rejected": -314.0, + "loss": 0.1078, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.828125, + "rewards/margins": 7.09375, + "rewards/rejected": -5.25, + "step": 821 + }, + { + "epoch": 1.0085889570552147, + "grad_norm": 13.743690213291728, + "learning_rate": 3.3533057851239665e-07, + "logits/chosen": -0.2158203125, + "logits/rejected": -0.36328125, + "logps/chosen": -404.0, + "logps/rejected": -346.0, + "loss": 0.0808, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.7109375, + "rewards/margins": 6.65625, + "rewards/rejected": -4.9375, + "step": 822 + }, + { + "epoch": 1.0098159509202453, + "grad_norm": 14.996830861274045, + "learning_rate": 3.3512396694214875e-07, + "logits/chosen": -0.1884765625, + "logits/rejected": -0.376953125, + "logps/chosen": -362.0, + "logps/rejected": -324.0, + "loss": 0.0942, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.953125, + "rewards/margins": 7.03125, + "rewards/rejected": -5.09375, + "step": 823 + }, + { + "epoch": 1.011042944785276, + "grad_norm": 12.522717048402102, + "learning_rate": 3.349173553719008e-07, + "logits/chosen": -0.26171875, + "logits/rejected": -0.419921875, + "logps/chosen": -378.0, + "logps/rejected": -344.0, + "loss": 0.0625, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.90625, + "rewards/margins": 6.96875, + "rewards/rejected": -5.03125, + "step": 824 + }, + { + "epoch": 1.0122699386503067, + "grad_norm": 12.893193982573738, + "learning_rate": 3.347107438016529e-07, + "logits/chosen": -0.0849609375, + "logits/rejected": -0.349609375, + "logps/chosen": -394.0, + "logps/rejected": -330.0, + "loss": 0.0744, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.8046875, + "rewards/margins": 7.0625, + "rewards/rejected": -5.28125, + "step": 825 + }, + { + "epoch": 1.0134969325153373, + "grad_norm": 17.489525503978417, + "learning_rate": 3.3450413223140495e-07, + "logits/chosen": -0.291015625, + "logits/rejected": -0.4375, + "logps/chosen": -370.0, + "logps/rejected": -328.0, + "loss": 0.1115, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.3828125, + "rewards/margins": 6.28125, + "rewards/rejected": -4.875, + "step": 826 + }, + { + "epoch": 1.014723926380368, + "grad_norm": 14.647722993911307, + "learning_rate": 3.34297520661157e-07, + "logits/chosen": -0.212890625, + "logits/rejected": -0.330078125, + "logps/chosen": -344.0, + "logps/rejected": -308.0, + "loss": 0.0969, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.79296875, + "rewards/margins": 5.59375, + "rewards/rejected": -4.78125, + "step": 827 + }, + { + "epoch": 1.0159509202453987, + "grad_norm": 15.941089095537901, + "learning_rate": 3.340909090909091e-07, + "logits/chosen": -0.09326171875, + "logits/rejected": -0.287109375, + "logps/chosen": -378.0, + "logps/rejected": -302.0, + "loss": 0.1171, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.5, + "rewards/margins": 6.34375, + "rewards/rejected": -4.8125, + "step": 828 + }, + { + "epoch": 1.0171779141104293, + "grad_norm": 17.97387770397603, + "learning_rate": 3.3388429752066114e-07, + "logits/chosen": -0.3203125, + "logits/rejected": -0.39453125, + "logps/chosen": -374.0, + "logps/rejected": -352.0, + "loss": 0.1062, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.8046875, + "rewards/margins": 6.84375, + "rewards/rejected": -5.03125, + "step": 829 + }, + { + "epoch": 1.01840490797546, + "grad_norm": 13.72586293525825, + "learning_rate": 3.3367768595041324e-07, + "logits/chosen": -0.234375, + "logits/rejected": -0.443359375, + "logps/chosen": -408.0, + "logps/rejected": -348.0, + "loss": 0.0856, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 2.328125, + "rewards/margins": 7.8125, + "rewards/rejected": -5.5, + "step": 830 + }, + { + "epoch": 1.019631901840491, + "grad_norm": 13.192991917086653, + "learning_rate": 3.3347107438016523e-07, + "logits/chosen": -0.232421875, + "logits/rejected": -0.3125, + "logps/chosen": -400.0, + "logps/rejected": -364.0, + "loss": 0.0799, + "rewards/accuracies": 1.0, + "rewards/chosen": 2.015625, + "rewards/margins": 7.46875, + "rewards/rejected": -5.4375, + "step": 831 + }, + { + "epoch": 1.0208588957055216, + "grad_norm": 21.764261439199625, + "learning_rate": 3.3326446280991733e-07, + "logits/chosen": -0.2412109375, + "logits/rejected": -0.4453125, + "logps/chosen": -402.0, + "logps/rejected": -350.0, + "loss": 0.1053, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.59375, + "rewards/margins": 6.71875, + "rewards/rejected": -5.09375, + "step": 832 + }, + { + "epoch": 1.0220858895705522, + "grad_norm": 16.400599313119255, + "learning_rate": 3.330578512396694e-07, + "logits/chosen": -0.30078125, + "logits/rejected": -0.4609375, + "logps/chosen": -444.0, + "logps/rejected": -368.0, + "loss": 0.0879, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.65625, + "rewards/margins": 6.90625, + "rewards/rejected": -5.25, + "step": 833 + }, + { + "epoch": 1.023312883435583, + "grad_norm": 15.616103389985229, + "learning_rate": 3.328512396694215e-07, + "logits/chosen": -0.2080078125, + "logits/rejected": -0.2392578125, + "logps/chosen": -350.0, + "logps/rejected": -328.0, + "loss": 0.0907, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.7265625, + "rewards/margins": 5.84375, + "rewards/rejected": -5.125, + "step": 834 + }, + { + "epoch": 1.0245398773006136, + "grad_norm": 14.483723424076196, + "learning_rate": 3.3264462809917353e-07, + "logits/chosen": -0.140625, + "logits/rejected": -0.357421875, + "logps/chosen": -408.0, + "logps/rejected": -362.0, + "loss": 0.0997, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.4609375, + "rewards/margins": 6.5, + "rewards/rejected": -5.03125, + "step": 835 + }, + { + "epoch": 1.0257668711656442, + "grad_norm": 16.156974572900307, + "learning_rate": 3.3243801652892563e-07, + "logits/chosen": -0.2412109375, + "logits/rejected": -0.333984375, + "logps/chosen": -372.0, + "logps/rejected": -336.0, + "loss": 0.0857, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.1796875, + "rewards/margins": 6.71875, + "rewards/rejected": -5.53125, + "step": 836 + }, + { + "epoch": 1.026993865030675, + "grad_norm": 13.86269284956411, + "learning_rate": 3.322314049586777e-07, + "logits/chosen": -0.09765625, + "logits/rejected": -0.353515625, + "logps/chosen": -436.0, + "logps/rejected": -366.0, + "loss": 0.0868, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.921875, + "rewards/margins": 7.15625, + "rewards/rejected": -5.21875, + "step": 837 + }, + { + "epoch": 1.0282208588957056, + "grad_norm": 16.390946630040137, + "learning_rate": 3.320247933884298e-07, + "logits/chosen": -0.2333984375, + "logits/rejected": -0.431640625, + "logps/chosen": -384.0, + "logps/rejected": -344.0, + "loss": 0.0955, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.2734375, + "rewards/margins": 7.15625, + "rewards/rejected": -5.875, + "step": 838 + }, + { + "epoch": 1.0294478527607362, + "grad_norm": 30.49099747509546, + "learning_rate": 3.318181818181818e-07, + "logits/chosen": -0.1806640625, + "logits/rejected": -0.34375, + "logps/chosen": -392.0, + "logps/rejected": -346.0, + "loss": 0.1214, + "rewards/accuracies": 0.953125, + "rewards/chosen": 1.2734375, + "rewards/margins": 6.65625, + "rewards/rejected": -5.375, + "step": 839 + }, + { + "epoch": 1.030674846625767, + "grad_norm": 14.416244350848686, + "learning_rate": 3.3161157024793387e-07, + "logits/chosen": -0.2001953125, + "logits/rejected": -0.4375, + "logps/chosen": -438.0, + "logps/rejected": -374.0, + "loss": 0.0844, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.6796875, + "rewards/margins": 7.75, + "rewards/rejected": -6.0625, + "step": 840 + }, + { + "epoch": 1.0319018404907976, + "grad_norm": 14.56906197576248, + "learning_rate": 3.314049586776859e-07, + "logits/chosen": -0.1337890625, + "logits/rejected": -0.306640625, + "logps/chosen": -378.0, + "logps/rejected": -354.0, + "loss": 0.089, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.015625, + "rewards/margins": 6.96875, + "rewards/rejected": -5.96875, + "step": 841 + }, + { + "epoch": 1.0331288343558283, + "grad_norm": 13.65292459169916, + "learning_rate": 3.31198347107438e-07, + "logits/chosen": -0.2314453125, + "logits/rejected": -0.376953125, + "logps/chosen": -448.0, + "logps/rejected": -322.0, + "loss": 0.0971, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.296875, + "rewards/margins": 6.8125, + "rewards/rejected": -5.5, + "step": 842 + }, + { + "epoch": 1.034355828220859, + "grad_norm": 13.785244260815091, + "learning_rate": 3.3099173553719006e-07, + "logits/chosen": -0.2236328125, + "logits/rejected": -0.3671875, + "logps/chosen": -450.0, + "logps/rejected": -370.0, + "loss": 0.08, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.6015625, + "rewards/margins": 7.0625, + "rewards/rejected": -5.4375, + "step": 843 + }, + { + "epoch": 1.0355828220858896, + "grad_norm": 14.848904283285925, + "learning_rate": 3.307851239669421e-07, + "logits/chosen": -0.1328125, + "logits/rejected": -0.353515625, + "logps/chosen": -426.0, + "logps/rejected": -330.0, + "loss": 0.0868, + "rewards/accuracies": 0.984375, + "rewards/chosen": 2.0, + "rewards/margins": 7.28125, + "rewards/rejected": -5.28125, + "step": 844 + }, + { + "epoch": 1.0368098159509203, + "grad_norm": 13.421028110381078, + "learning_rate": 3.305785123966942e-07, + "logits/chosen": -0.203125, + "logits/rejected": -0.3203125, + "logps/chosen": -364.0, + "logps/rejected": -314.0, + "loss": 0.0708, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.296875, + "rewards/margins": 6.1875, + "rewards/rejected": -4.90625, + "step": 845 + }, + { + "epoch": 1.038036809815951, + "grad_norm": 14.796461542249148, + "learning_rate": 3.3037190082644626e-07, + "logits/chosen": -0.1162109375, + "logits/rejected": -0.318359375, + "logps/chosen": -416.0, + "logps/rejected": -308.0, + "loss": 0.0758, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.7265625, + "rewards/margins": 7.28125, + "rewards/rejected": -5.5625, + "step": 846 + }, + { + "epoch": 1.0392638036809816, + "grad_norm": 17.14326447883765, + "learning_rate": 3.3016528925619836e-07, + "logits/chosen": -0.134765625, + "logits/rejected": -0.291015625, + "logps/chosen": -364.0, + "logps/rejected": -322.0, + "loss": 0.1101, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.46875, + "rewards/margins": 6.5, + "rewards/rejected": -5.03125, + "step": 847 + }, + { + "epoch": 1.0404907975460123, + "grad_norm": 13.56261798189713, + "learning_rate": 3.2995867768595035e-07, + "logits/chosen": -0.2138671875, + "logits/rejected": -0.32421875, + "logps/chosen": -346.0, + "logps/rejected": -316.0, + "loss": 0.0891, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.046875, + "rewards/margins": 6.8125, + "rewards/rejected": -5.75, + "step": 848 + }, + { + "epoch": 1.041717791411043, + "grad_norm": 20.68146424665464, + "learning_rate": 3.2975206611570245e-07, + "logits/chosen": -0.1611328125, + "logits/rejected": -0.26171875, + "logps/chosen": -374.0, + "logps/rejected": -368.0, + "loss": 0.1262, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.1171875, + "rewards/margins": 6.1875, + "rewards/rejected": -5.0625, + "step": 849 + }, + { + "epoch": 1.0429447852760736, + "grad_norm": 13.606172408629623, + "learning_rate": 3.295454545454545e-07, + "logits/chosen": -0.1923828125, + "logits/rejected": -0.427734375, + "logps/chosen": -366.0, + "logps/rejected": -326.0, + "loss": 0.0635, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.7265625, + "rewards/margins": 7.5, + "rewards/rejected": -5.78125, + "step": 850 + }, + { + "epoch": 1.0441717791411043, + "grad_norm": 10.143304293143443, + "learning_rate": 3.293388429752066e-07, + "logits/chosen": -0.21875, + "logits/rejected": -0.419921875, + "logps/chosen": -374.0, + "logps/rejected": -348.0, + "loss": 0.0537, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.5546875, + "rewards/margins": 7.28125, + "rewards/rejected": -5.75, + "step": 851 + }, + { + "epoch": 1.045398773006135, + "grad_norm": 14.566820416844363, + "learning_rate": 3.2913223140495865e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.439453125, + "logps/chosen": -422.0, + "logps/rejected": -368.0, + "loss": 0.0799, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.9609375, + "rewards/margins": 7.0, + "rewards/rejected": -5.03125, + "step": 852 + }, + { + "epoch": 1.0466257668711656, + "grad_norm": 12.693926025203602, + "learning_rate": 3.2892561983471075e-07, + "logits/chosen": -0.21484375, + "logits/rejected": -0.33203125, + "logps/chosen": -406.0, + "logps/rejected": -330.0, + "loss": 0.0779, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.7265625, + "rewards/margins": 6.96875, + "rewards/rejected": -5.25, + "step": 853 + }, + { + "epoch": 1.0478527607361963, + "grad_norm": 14.497671955073232, + "learning_rate": 3.287190082644628e-07, + "logits/chosen": -0.138671875, + "logits/rejected": -0.2734375, + "logps/chosen": -386.0, + "logps/rejected": -348.0, + "loss": 0.1003, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.15625, + "rewards/margins": 6.21875, + "rewards/rejected": -5.0625, + "step": 854 + }, + { + "epoch": 1.049079754601227, + "grad_norm": 19.227096223090967, + "learning_rate": 3.285123966942149e-07, + "logits/chosen": -0.08642578125, + "logits/rejected": -0.2333984375, + "logps/chosen": -396.0, + "logps/rejected": -368.0, + "loss": 0.113, + "rewards/accuracies": 0.953125, + "rewards/chosen": 1.6640625, + "rewards/margins": 6.78125, + "rewards/rejected": -5.125, + "step": 855 + }, + { + "epoch": 1.0503067484662576, + "grad_norm": 15.659617768021317, + "learning_rate": 3.2830578512396694e-07, + "logits/chosen": -0.166015625, + "logits/rejected": -0.359375, + "logps/chosen": -402.0, + "logps/rejected": -324.0, + "loss": 0.1096, + "rewards/accuracies": 0.953125, + "rewards/chosen": 1.6015625, + "rewards/margins": 6.96875, + "rewards/rejected": -5.375, + "step": 856 + }, + { + "epoch": 1.0515337423312883, + "grad_norm": 14.3287546971232, + "learning_rate": 3.28099173553719e-07, + "logits/chosen": -0.267578125, + "logits/rejected": -0.453125, + "logps/chosen": -396.0, + "logps/rejected": -348.0, + "loss": 0.0795, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.8515625, + "rewards/margins": 7.75, + "rewards/rejected": -5.90625, + "step": 857 + }, + { + "epoch": 1.052760736196319, + "grad_norm": 12.583255783885791, + "learning_rate": 3.2789256198347103e-07, + "logits/chosen": -0.158203125, + "logits/rejected": -0.2333984375, + "logps/chosen": -318.0, + "logps/rejected": -288.0, + "loss": 0.078, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.66796875, + "rewards/margins": 6.84375, + "rewards/rejected": -6.15625, + "step": 858 + }, + { + "epoch": 1.0539877300613496, + "grad_norm": 16.152476295032493, + "learning_rate": 3.2768595041322313e-07, + "logits/chosen": -0.201171875, + "logits/rejected": -0.408203125, + "logps/chosen": -394.0, + "logps/rejected": -314.0, + "loss": 0.0868, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.87890625, + "rewards/margins": 6.9375, + "rewards/rejected": -6.0625, + "step": 859 + }, + { + "epoch": 1.0552147239263803, + "grad_norm": 15.89833828288902, + "learning_rate": 3.274793388429752e-07, + "logits/chosen": -0.1240234375, + "logits/rejected": -0.3203125, + "logps/chosen": -408.0, + "logps/rejected": -344.0, + "loss": 0.117, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.5625, + "rewards/margins": 5.90625, + "rewards/rejected": -5.34375, + "step": 860 + }, + { + "epoch": 1.056441717791411, + "grad_norm": 14.48066788073414, + "learning_rate": 3.272727272727273e-07, + "logits/chosen": -0.1787109375, + "logits/rejected": -0.369140625, + "logps/chosen": -396.0, + "logps/rejected": -320.0, + "loss": 0.0789, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.53125, + "rewards/margins": 7.40625, + "rewards/rejected": -5.875, + "step": 861 + }, + { + "epoch": 1.0576687116564418, + "grad_norm": 13.482705865354024, + "learning_rate": 3.2706611570247933e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.357421875, + "logps/chosen": -376.0, + "logps/rejected": -336.0, + "loss": 0.0765, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.63671875, + "rewards/margins": 6.96875, + "rewards/rejected": -6.34375, + "step": 862 + }, + { + "epoch": 1.0588957055214725, + "grad_norm": 12.599484840745689, + "learning_rate": 3.268595041322314e-07, + "logits/chosen": -0.265625, + "logits/rejected": -0.478515625, + "logps/chosen": -424.0, + "logps/rejected": -362.0, + "loss": 0.0651, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 2.0, + "rewards/margins": 7.96875, + "rewards/rejected": -5.96875, + "step": 863 + }, + { + "epoch": 1.0601226993865032, + "grad_norm": 14.321662977360447, + "learning_rate": 3.266528925619835e-07, + "logits/chosen": -0.1826171875, + "logits/rejected": -0.384765625, + "logps/chosen": -374.0, + "logps/rejected": -348.0, + "loss": 0.0886, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.0625, + "rewards/margins": 7.625, + "rewards/rejected": -6.5625, + "step": 864 + }, + { + "epoch": 1.0613496932515338, + "grad_norm": 13.75734214123902, + "learning_rate": 3.264462809917355e-07, + "logits/chosen": -0.337890625, + "logits/rejected": -0.4375, + "logps/chosen": -424.0, + "logps/rejected": -334.0, + "loss": 0.0637, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.125, + "rewards/margins": 8.0, + "rewards/rejected": -6.875, + "step": 865 + }, + { + "epoch": 1.0625766871165645, + "grad_norm": 12.279072116663103, + "learning_rate": 3.2623966942148757e-07, + "logits/chosen": -0.27734375, + "logits/rejected": -0.478515625, + "logps/chosen": -348.0, + "logps/rejected": -328.0, + "loss": 0.0654, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.3515625, + "rewards/margins": 8.0625, + "rewards/rejected": -6.71875, + "step": 866 + }, + { + "epoch": 1.0638036809815952, + "grad_norm": 19.505244482468054, + "learning_rate": 3.260330578512396e-07, + "logits/chosen": -0.26171875, + "logits/rejected": -0.421875, + "logps/chosen": -424.0, + "logps/rejected": -338.0, + "loss": 0.1189, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.125, + "rewards/margins": 6.9375, + "rewards/rejected": -5.8125, + "step": 867 + }, + { + "epoch": 1.0650306748466258, + "grad_norm": 14.074090647435115, + "learning_rate": 3.258264462809917e-07, + "logits/chosen": -0.046875, + "logits/rejected": -0.2421875, + "logps/chosen": -350.0, + "logps/rejected": -292.0, + "loss": 0.0893, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.93359375, + "rewards/margins": 6.53125, + "rewards/rejected": -5.59375, + "step": 868 + }, + { + "epoch": 1.0662576687116565, + "grad_norm": 14.571765600032565, + "learning_rate": 3.2561983471074376e-07, + "logits/chosen": -0.24609375, + "logits/rejected": -0.37109375, + "logps/chosen": -402.0, + "logps/rejected": -352.0, + "loss": 0.0837, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.4375, + "rewards/margins": 7.53125, + "rewards/rejected": -6.09375, + "step": 869 + }, + { + "epoch": 1.0674846625766872, + "grad_norm": 16.28549661762683, + "learning_rate": 3.2541322314049586e-07, + "logits/chosen": -0.11083984375, + "logits/rejected": -0.291015625, + "logps/chosen": -382.0, + "logps/rejected": -334.0, + "loss": 0.102, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.296875, + "rewards/margins": 7.28125, + "rewards/rejected": -5.96875, + "step": 870 + }, + { + "epoch": 1.0687116564417178, + "grad_norm": 18.071058371769617, + "learning_rate": 3.252066115702479e-07, + "logits/chosen": -0.1201171875, + "logits/rejected": -0.283203125, + "logps/chosen": -402.0, + "logps/rejected": -326.0, + "loss": 0.0983, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.03125, + "rewards/margins": 6.4375, + "rewards/rejected": -5.40625, + "step": 871 + }, + { + "epoch": 1.0699386503067485, + "grad_norm": 14.266293122799356, + "learning_rate": 3.25e-07, + "logits/chosen": -0.1318359375, + "logits/rejected": -0.26171875, + "logps/chosen": -410.0, + "logps/rejected": -302.0, + "loss": 0.0786, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.2265625, + "rewards/margins": 7.21875, + "rewards/rejected": -5.96875, + "step": 872 + }, + { + "epoch": 1.0711656441717792, + "grad_norm": 15.602842110090197, + "learning_rate": 3.2479338842975206e-07, + "logits/chosen": -0.20703125, + "logits/rejected": -0.3828125, + "logps/chosen": -374.0, + "logps/rejected": -350.0, + "loss": 0.0943, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.078125, + "rewards/margins": 7.5, + "rewards/rejected": -6.4375, + "step": 873 + }, + { + "epoch": 1.0723926380368098, + "grad_norm": 16.40654713335496, + "learning_rate": 3.2458677685950416e-07, + "logits/chosen": -0.23828125, + "logits/rejected": -0.3828125, + "logps/chosen": -432.0, + "logps/rejected": -372.0, + "loss": 0.1019, + "rewards/accuracies": 0.953125, + "rewards/chosen": 1.625, + "rewards/margins": 7.71875, + "rewards/rejected": -6.09375, + "step": 874 + }, + { + "epoch": 1.0736196319018405, + "grad_norm": 14.656084548254892, + "learning_rate": 3.2438016528925615e-07, + "logits/chosen": -0.1279296875, + "logits/rejected": -0.29296875, + "logps/chosen": -346.0, + "logps/rejected": -348.0, + "loss": 0.0817, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.21875, + "rewards/margins": 7.15625, + "rewards/rejected": -5.9375, + "step": 875 + }, + { + "epoch": 1.0748466257668712, + "grad_norm": 17.467795538341694, + "learning_rate": 3.2417355371900825e-07, + "logits/chosen": -0.2294921875, + "logits/rejected": -0.423828125, + "logps/chosen": -412.0, + "logps/rejected": -372.0, + "loss": 0.0985, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.296875, + "rewards/margins": 7.65625, + "rewards/rejected": -6.34375, + "step": 876 + }, + { + "epoch": 1.0760736196319018, + "grad_norm": 13.771551801590357, + "learning_rate": 3.239669421487603e-07, + "logits/chosen": -0.08056640625, + "logits/rejected": -0.2333984375, + "logps/chosen": -400.0, + "logps/rejected": -328.0, + "loss": 0.0749, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.69140625, + "rewards/margins": 6.625, + "rewards/rejected": -5.9375, + "step": 877 + }, + { + "epoch": 1.0773006134969325, + "grad_norm": 15.836782133197865, + "learning_rate": 3.237603305785124e-07, + "logits/chosen": -0.228515625, + "logits/rejected": -0.427734375, + "logps/chosen": -376.0, + "logps/rejected": -338.0, + "loss": 0.105, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.5859375, + "rewards/margins": 6.71875, + "rewards/rejected": -6.125, + "step": 878 + }, + { + "epoch": 1.0785276073619632, + "grad_norm": 12.969494351203755, + "learning_rate": 3.2355371900826445e-07, + "logits/chosen": -0.10986328125, + "logits/rejected": -0.357421875, + "logps/chosen": -410.0, + "logps/rejected": -324.0, + "loss": 0.0658, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.421875, + "rewards/margins": 7.5, + "rewards/rejected": -6.09375, + "step": 879 + }, + { + "epoch": 1.0797546012269938, + "grad_norm": 11.821942154283308, + "learning_rate": 3.233471074380165e-07, + "logits/chosen": -0.12158203125, + "logits/rejected": -0.341796875, + "logps/chosen": -346.0, + "logps/rejected": -314.0, + "loss": 0.0634, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.38671875, + "rewards/margins": 7.5, + "rewards/rejected": -7.125, + "step": 880 + }, + { + "epoch": 1.0809815950920245, + "grad_norm": 16.49633210034593, + "learning_rate": 3.231404958677686e-07, + "logits/chosen": -0.10009765625, + "logits/rejected": -0.2392578125, + "logps/chosen": -346.0, + "logps/rejected": -288.0, + "loss": 0.107, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.66015625, + "rewards/margins": 6.0625, + "rewards/rejected": -5.375, + "step": 881 + }, + { + "epoch": 1.0822085889570552, + "grad_norm": 17.837915143003197, + "learning_rate": 3.2293388429752064e-07, + "logits/chosen": -0.21875, + "logits/rejected": -0.361328125, + "logps/chosen": -398.0, + "logps/rejected": -360.0, + "loss": 0.0935, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 1.71875, + "rewards/margins": 7.34375, + "rewards/rejected": -5.65625, + "step": 882 + }, + { + "epoch": 1.0834355828220859, + "grad_norm": 11.565018389543406, + "learning_rate": 3.2272727272727274e-07, + "logits/chosen": -0.2490234375, + "logits/rejected": -0.384765625, + "logps/chosen": -386.0, + "logps/rejected": -332.0, + "loss": 0.0585, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.6875, + "rewards/margins": 6.9375, + "rewards/rejected": -5.25, + "step": 883 + }, + { + "epoch": 1.0846625766871165, + "grad_norm": 11.512719040759002, + "learning_rate": 3.2252066115702474e-07, + "logits/chosen": -0.2353515625, + "logits/rejected": -0.416015625, + "logps/chosen": -426.0, + "logps/rejected": -370.0, + "loss": 0.06, + "rewards/accuracies": 0.984375, + "rewards/chosen": 2.203125, + "rewards/margins": 8.0625, + "rewards/rejected": -5.875, + "step": 884 + }, + { + "epoch": 1.0858895705521472, + "grad_norm": 15.089612290737605, + "learning_rate": 3.2231404958677684e-07, + "logits/chosen": -0.1728515625, + "logits/rejected": -0.318359375, + "logps/chosen": -390.0, + "logps/rejected": -320.0, + "loss": 0.099, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 1.6484375, + "rewards/margins": 6.9375, + "rewards/rejected": -5.28125, + "step": 885 + }, + { + "epoch": 1.0871165644171779, + "grad_norm": 14.987293361609737, + "learning_rate": 3.221074380165289e-07, + "logits/chosen": -0.08642578125, + "logits/rejected": -0.294921875, + "logps/chosen": -378.0, + "logps/rejected": -348.0, + "loss": 0.1013, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.2578125, + "rewards/margins": 6.15625, + "rewards/rejected": -4.90625, + "step": 886 + }, + { + "epoch": 1.0883435582822085, + "grad_norm": 13.904557936952761, + "learning_rate": 3.21900826446281e-07, + "logits/chosen": -0.2333984375, + "logits/rejected": -0.427734375, + "logps/chosen": -396.0, + "logps/rejected": -348.0, + "loss": 0.077, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.40625, + "rewards/margins": 7.3125, + "rewards/rejected": -5.9375, + "step": 887 + }, + { + "epoch": 1.0895705521472392, + "grad_norm": 11.599560865424403, + "learning_rate": 3.2169421487603303e-07, + "logits/chosen": -0.208984375, + "logits/rejected": -0.48046875, + "logps/chosen": -396.0, + "logps/rejected": -342.0, + "loss": 0.0626, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.46875, + "rewards/margins": 7.09375, + "rewards/rejected": -5.625, + "step": 888 + }, + { + "epoch": 1.0907975460122699, + "grad_norm": 17.8039918940807, + "learning_rate": 3.2148760330578513e-07, + "logits/chosen": -0.1806640625, + "logits/rejected": -0.310546875, + "logps/chosen": -448.0, + "logps/rejected": -380.0, + "loss": 0.0932, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.9140625, + "rewards/margins": 7.46875, + "rewards/rejected": -5.5625, + "step": 889 + }, + { + "epoch": 1.0920245398773005, + "grad_norm": 16.01464196301419, + "learning_rate": 3.212809917355372e-07, + "logits/chosen": -0.2197265625, + "logits/rejected": -0.35546875, + "logps/chosen": -362.0, + "logps/rejected": -322.0, + "loss": 0.0907, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.46875, + "rewards/margins": 6.96875, + "rewards/rejected": -5.46875, + "step": 890 + }, + { + "epoch": 1.0932515337423312, + "grad_norm": 13.538658561025441, + "learning_rate": 3.210743801652893e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.400390625, + "logps/chosen": -362.0, + "logps/rejected": -348.0, + "loss": 0.0842, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.95703125, + "rewards/margins": 7.15625, + "rewards/rejected": -6.1875, + "step": 891 + }, + { + "epoch": 1.0944785276073619, + "grad_norm": 13.122527674488813, + "learning_rate": 3.208677685950413e-07, + "logits/chosen": -0.1630859375, + "logits/rejected": -0.390625, + "logps/chosen": -348.0, + "logps/rejected": -320.0, + "loss": 0.0896, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.140625, + "rewards/margins": 7.1875, + "rewards/rejected": -6.03125, + "step": 892 + }, + { + "epoch": 1.0957055214723925, + "grad_norm": 17.71847572482304, + "learning_rate": 3.2066115702479337e-07, + "logits/chosen": -0.2109375, + "logits/rejected": -0.2412109375, + "logps/chosen": -316.0, + "logps/rejected": -296.0, + "loss": 0.1107, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.87109375, + "rewards/margins": 6.53125, + "rewards/rejected": -5.65625, + "step": 893 + }, + { + "epoch": 1.0969325153374232, + "grad_norm": 15.012214624189234, + "learning_rate": 3.204545454545454e-07, + "logits/chosen": -0.189453125, + "logits/rejected": -0.408203125, + "logps/chosen": -434.0, + "logps/rejected": -376.0, + "loss": 0.0728, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.8046875, + "rewards/margins": 8.125, + "rewards/rejected": -6.34375, + "step": 894 + }, + { + "epoch": 1.098159509202454, + "grad_norm": 17.919265575886666, + "learning_rate": 3.202479338842975e-07, + "logits/chosen": -0.19140625, + "logits/rejected": -0.353515625, + "logps/chosen": -388.0, + "logps/rejected": -336.0, + "loss": 0.0907, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.4296875, + "rewards/margins": 6.84375, + "rewards/rejected": -5.40625, + "step": 895 + }, + { + "epoch": 1.0993865030674848, + "grad_norm": 15.44842437240469, + "learning_rate": 3.2004132231404957e-07, + "logits/chosen": -0.22265625, + "logits/rejected": -0.37109375, + "logps/chosen": -366.0, + "logps/rejected": -338.0, + "loss": 0.084, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.453125, + "rewards/margins": 7.3125, + "rewards/rejected": -5.875, + "step": 896 + }, + { + "epoch": 1.1006134969325154, + "grad_norm": 16.901501789852766, + "learning_rate": 3.198347107438016e-07, + "logits/chosen": -0.2412109375, + "logits/rejected": -0.46875, + "logps/chosen": -442.0, + "logps/rejected": -350.0, + "loss": 0.0875, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.953125, + "rewards/margins": 7.0625, + "rewards/rejected": -6.125, + "step": 897 + }, + { + "epoch": 1.101840490797546, + "grad_norm": 12.234418919418719, + "learning_rate": 3.196280991735537e-07, + "logits/chosen": -0.236328125, + "logits/rejected": -0.4453125, + "logps/chosen": -416.0, + "logps/rejected": -350.0, + "loss": 0.0787, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.4296875, + "rewards/margins": 7.875, + "rewards/rejected": -6.4375, + "step": 898 + }, + { + "epoch": 1.1030674846625768, + "grad_norm": 13.10937054414505, + "learning_rate": 3.1942148760330576e-07, + "logits/chosen": -0.162109375, + "logits/rejected": -0.2890625, + "logps/chosen": -336.0, + "logps/rejected": -310.0, + "loss": 0.0819, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.259765625, + "rewards/margins": 6.6875, + "rewards/rejected": -6.4375, + "step": 899 + }, + { + "epoch": 1.1042944785276074, + "grad_norm": 15.166633938396838, + "learning_rate": 3.1921487603305786e-07, + "logits/chosen": -0.1279296875, + "logits/rejected": -0.3203125, + "logps/chosen": -400.0, + "logps/rejected": -366.0, + "loss": 0.0785, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.83984375, + "rewards/margins": 7.21875, + "rewards/rejected": -6.375, + "step": 900 + }, + { + "epoch": 1.105521472392638, + "grad_norm": 17.64171376710007, + "learning_rate": 3.190082644628099e-07, + "logits/chosen": -0.2431640625, + "logits/rejected": -0.474609375, + "logps/chosen": -492.0, + "logps/rejected": -384.0, + "loss": 0.0912, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.6953125, + "rewards/margins": 8.4375, + "rewards/rejected": -6.75, + "step": 901 + }, + { + "epoch": 1.1067484662576688, + "grad_norm": 12.602909453766244, + "learning_rate": 3.1880165289256195e-07, + "logits/chosen": -0.279296875, + "logits/rejected": -0.44140625, + "logps/chosen": -372.0, + "logps/rejected": -346.0, + "loss": 0.0687, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.9375, + "rewards/margins": 7.6875, + "rewards/rejected": -6.75, + "step": 902 + }, + { + "epoch": 1.1079754601226994, + "grad_norm": 13.714395271468868, + "learning_rate": 3.18595041322314e-07, + "logits/chosen": -0.1826171875, + "logits/rejected": -0.41015625, + "logps/chosen": -360.0, + "logps/rejected": -330.0, + "loss": 0.0754, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.1171875, + "rewards/margins": 7.59375, + "rewards/rejected": -6.46875, + "step": 903 + }, + { + "epoch": 1.10920245398773, + "grad_norm": 13.250729389536362, + "learning_rate": 3.183884297520661e-07, + "logits/chosen": -0.1953125, + "logits/rejected": -0.34375, + "logps/chosen": -374.0, + "logps/rejected": -376.0, + "loss": 0.0644, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.4296875, + "rewards/margins": 8.125, + "rewards/rejected": -6.6875, + "step": 904 + }, + { + "epoch": 1.1104294478527608, + "grad_norm": 14.511450484175517, + "learning_rate": 3.1818181818181815e-07, + "logits/chosen": -0.33984375, + "logits/rejected": -0.55078125, + "logps/chosen": -392.0, + "logps/rejected": -352.0, + "loss": 0.0726, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.484375, + "rewards/margins": 8.1875, + "rewards/rejected": -6.71875, + "step": 905 + }, + { + "epoch": 1.1116564417177914, + "grad_norm": 14.163593207086905, + "learning_rate": 3.1797520661157025e-07, + "logits/chosen": -0.287109375, + "logits/rejected": -0.3828125, + "logps/chosen": -334.0, + "logps/rejected": -344.0, + "loss": 0.0971, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.33203125, + "rewards/margins": 6.375, + "rewards/rejected": -6.03125, + "step": 906 + }, + { + "epoch": 1.112883435582822, + "grad_norm": 16.30810022027397, + "learning_rate": 3.177685950413223e-07, + "logits/chosen": -0.19921875, + "logits/rejected": -0.46875, + "logps/chosen": -380.0, + "logps/rejected": -322.0, + "loss": 0.078, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.1171875, + "rewards/margins": 8.0, + "rewards/rejected": -6.875, + "step": 907 + }, + { + "epoch": 1.1141104294478528, + "grad_norm": 18.83130303896192, + "learning_rate": 3.175619834710744e-07, + "logits/chosen": -0.25390625, + "logits/rejected": -0.36328125, + "logps/chosen": -390.0, + "logps/rejected": -342.0, + "loss": 0.0771, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.625, + "rewards/margins": 7.8125, + "rewards/rejected": -6.1875, + "step": 908 + }, + { + "epoch": 1.1153374233128834, + "grad_norm": 17.11879928547849, + "learning_rate": 3.1735537190082644e-07, + "logits/chosen": -0.1376953125, + "logits/rejected": -0.255859375, + "logps/chosen": -414.0, + "logps/rejected": -400.0, + "loss": 0.0922, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.015625, + "rewards/margins": 7.4375, + "rewards/rejected": -6.40625, + "step": 909 + }, + { + "epoch": 1.116564417177914, + "grad_norm": 10.827580369275127, + "learning_rate": 3.1714876033057854e-07, + "logits/chosen": -0.2490234375, + "logits/rejected": -0.443359375, + "logps/chosen": -388.0, + "logps/rejected": -362.0, + "loss": 0.0533, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.4296875, + "rewards/margins": 8.25, + "rewards/rejected": -6.84375, + "step": 910 + }, + { + "epoch": 1.1177914110429448, + "grad_norm": 11.876608224639686, + "learning_rate": 3.1694214876033054e-07, + "logits/chosen": -0.1904296875, + "logits/rejected": -0.4375, + "logps/chosen": -468.0, + "logps/rejected": -386.0, + "loss": 0.0583, + "rewards/accuracies": 1.0, + "rewards/chosen": 2.09375, + "rewards/margins": 9.625, + "rewards/rejected": -7.53125, + "step": 911 + }, + { + "epoch": 1.1190184049079754, + "grad_norm": 26.844768079252102, + "learning_rate": 3.1673553719008264e-07, + "logits/chosen": -0.11474609375, + "logits/rejected": -0.22265625, + "logps/chosen": -354.0, + "logps/rejected": -344.0, + "loss": 0.1112, + "rewards/accuracies": 0.953125, + "rewards/chosen": 0.8515625, + "rewards/margins": 7.09375, + "rewards/rejected": -6.25, + "step": 912 + }, + { + "epoch": 1.120245398773006, + "grad_norm": 14.450166094247406, + "learning_rate": 3.165289256198347e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.388671875, + "logps/chosen": -320.0, + "logps/rejected": -336.0, + "loss": 0.0769, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.296875, + "rewards/margins": 8.3125, + "rewards/rejected": -7.03125, + "step": 913 + }, + { + "epoch": 1.1214723926380368, + "grad_norm": 19.206409297297924, + "learning_rate": 3.163223140495868e-07, + "logits/chosen": -0.125, + "logits/rejected": -0.298828125, + "logps/chosen": -404.0, + "logps/rejected": -336.0, + "loss": 0.1077, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.7109375, + "rewards/margins": 6.875, + "rewards/rejected": -6.1875, + "step": 914 + }, + { + "epoch": 1.1226993865030674, + "grad_norm": 17.009381740915753, + "learning_rate": 3.1611570247933883e-07, + "logits/chosen": -0.150390625, + "logits/rejected": -0.40234375, + "logps/chosen": -404.0, + "logps/rejected": -358.0, + "loss": 0.0859, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.1640625, + "rewards/margins": 7.5, + "rewards/rejected": -6.34375, + "step": 915 + }, + { + "epoch": 1.123926380368098, + "grad_norm": 13.75328837803106, + "learning_rate": 3.159090909090909e-07, + "logits/chosen": -0.28515625, + "logits/rejected": -0.44140625, + "logps/chosen": -386.0, + "logps/rejected": -330.0, + "loss": 0.0842, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.2109375, + "rewards/margins": 7.375, + "rewards/rejected": -6.15625, + "step": 916 + }, + { + "epoch": 1.1251533742331288, + "grad_norm": 18.596248517246302, + "learning_rate": 3.15702479338843e-07, + "logits/chosen": -0.251953125, + "logits/rejected": -0.494140625, + "logps/chosen": -418.0, + "logps/rejected": -386.0, + "loss": 0.1107, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 1.3671875, + "rewards/margins": 7.53125, + "rewards/rejected": -6.1875, + "step": 917 + }, + { + "epoch": 1.1263803680981594, + "grad_norm": 16.967303172691818, + "learning_rate": 3.15495867768595e-07, + "logits/chosen": -0.1640625, + "logits/rejected": -0.30859375, + "logps/chosen": -380.0, + "logps/rejected": -336.0, + "loss": 0.0918, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.171875, + "rewards/margins": 6.75, + "rewards/rejected": -5.59375, + "step": 918 + }, + { + "epoch": 1.1276073619631901, + "grad_norm": 18.756828720175086, + "learning_rate": 3.152892561983471e-07, + "logits/chosen": -0.32421875, + "logits/rejected": -0.400390625, + "logps/chosen": -372.0, + "logps/rejected": -358.0, + "loss": 0.1016, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.76953125, + "rewards/margins": 6.90625, + "rewards/rejected": -6.125, + "step": 919 + }, + { + "epoch": 1.1288343558282208, + "grad_norm": 19.02626152870652, + "learning_rate": 3.150826446280991e-07, + "logits/chosen": -0.189453125, + "logits/rejected": -0.39453125, + "logps/chosen": -402.0, + "logps/rejected": -346.0, + "loss": 0.0972, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.8984375, + "rewards/margins": 6.84375, + "rewards/rejected": -5.9375, + "step": 920 + }, + { + "epoch": 1.1300613496932514, + "grad_norm": 18.0133904343147, + "learning_rate": 3.148760330578512e-07, + "logits/chosen": -0.1904296875, + "logits/rejected": -0.357421875, + "logps/chosen": -392.0, + "logps/rejected": -354.0, + "loss": 0.0618, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.6015625, + "rewards/margins": 7.84375, + "rewards/rejected": -6.25, + "step": 921 + }, + { + "epoch": 1.1312883435582821, + "grad_norm": 14.222900627597795, + "learning_rate": 3.1466942148760327e-07, + "logits/chosen": -0.1416015625, + "logits/rejected": -0.279296875, + "logps/chosen": -384.0, + "logps/rejected": -358.0, + "loss": 0.0824, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.9140625, + "rewards/margins": 7.4375, + "rewards/rejected": -5.53125, + "step": 922 + }, + { + "epoch": 1.132515337423313, + "grad_norm": 16.14769736964756, + "learning_rate": 3.1446280991735537e-07, + "logits/chosen": -0.1337890625, + "logits/rejected": -0.236328125, + "logps/chosen": -358.0, + "logps/rejected": -336.0, + "loss": 0.0863, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.515625, + "rewards/margins": 6.90625, + "rewards/rejected": -5.375, + "step": 923 + }, + { + "epoch": 1.1337423312883437, + "grad_norm": 16.18803882100018, + "learning_rate": 3.142561983471074e-07, + "logits/chosen": -0.251953125, + "logits/rejected": -0.357421875, + "logps/chosen": -376.0, + "logps/rejected": -326.0, + "loss": 0.0871, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.6484375, + "rewards/margins": 7.84375, + "rewards/rejected": -6.1875, + "step": 924 + }, + { + "epoch": 1.1349693251533743, + "grad_norm": 18.84337376901259, + "learning_rate": 3.140495867768595e-07, + "logits/chosen": -0.314453125, + "logits/rejected": -0.515625, + "logps/chosen": -372.0, + "logps/rejected": -320.0, + "loss": 0.0824, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.6484375, + "rewards/margins": 7.0625, + "rewards/rejected": -6.40625, + "step": 925 + }, + { + "epoch": 1.136196319018405, + "grad_norm": 13.610560581014049, + "learning_rate": 3.1384297520661156e-07, + "logits/chosen": -0.32421875, + "logits/rejected": -0.50390625, + "logps/chosen": -416.0, + "logps/rejected": -370.0, + "loss": 0.0763, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.9375, + "rewards/margins": 8.125, + "rewards/rejected": -6.1875, + "step": 926 + }, + { + "epoch": 1.1374233128834357, + "grad_norm": 14.900382805511716, + "learning_rate": 3.1363636363636366e-07, + "logits/chosen": -0.2255859375, + "logits/rejected": -0.380859375, + "logps/chosen": -420.0, + "logps/rejected": -366.0, + "loss": 0.0715, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.703125, + "rewards/margins": 7.84375, + "rewards/rejected": -6.125, + "step": 927 + }, + { + "epoch": 1.1386503067484663, + "grad_norm": 10.651120364048932, + "learning_rate": 3.134297520661157e-07, + "logits/chosen": -0.1943359375, + "logits/rejected": -0.3984375, + "logps/chosen": -408.0, + "logps/rejected": -356.0, + "loss": 0.0718, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.4453125, + "rewards/margins": 7.375, + "rewards/rejected": -5.9375, + "step": 928 + }, + { + "epoch": 1.139877300613497, + "grad_norm": 14.755624131752391, + "learning_rate": 3.1322314049586775e-07, + "logits/chosen": -0.1796875, + "logits/rejected": -0.349609375, + "logps/chosen": -424.0, + "logps/rejected": -310.0, + "loss": 0.0778, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.4453125, + "rewards/margins": 7.3125, + "rewards/rejected": -5.875, + "step": 929 + }, + { + "epoch": 1.1411042944785277, + "grad_norm": 19.659994495285734, + "learning_rate": 3.130165289256198e-07, + "logits/chosen": -0.1865234375, + "logits/rejected": -0.419921875, + "logps/chosen": -400.0, + "logps/rejected": -348.0, + "loss": 0.0665, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.234375, + "rewards/margins": 7.71875, + "rewards/rejected": -6.5, + "step": 930 + }, + { + "epoch": 1.1423312883435583, + "grad_norm": 17.71396023166755, + "learning_rate": 3.128099173553719e-07, + "logits/chosen": -0.2138671875, + "logits/rejected": -0.30859375, + "logps/chosen": -404.0, + "logps/rejected": -338.0, + "loss": 0.1079, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.828125, + "rewards/margins": 6.46875, + "rewards/rejected": -5.65625, + "step": 931 + }, + { + "epoch": 1.143558282208589, + "grad_norm": 12.573260319219532, + "learning_rate": 3.1260330578512395e-07, + "logits/chosen": -0.28515625, + "logits/rejected": -0.47265625, + "logps/chosen": -370.0, + "logps/rejected": -338.0, + "loss": 0.0708, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.0234375, + "rewards/margins": 7.96875, + "rewards/rejected": -6.96875, + "step": 932 + }, + { + "epoch": 1.1447852760736197, + "grad_norm": 15.458680042005257, + "learning_rate": 3.12396694214876e-07, + "logits/chosen": -0.1787109375, + "logits/rejected": -0.283203125, + "logps/chosen": -364.0, + "logps/rejected": -360.0, + "loss": 0.0782, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.1015625, + "rewards/margins": 6.90625, + "rewards/rejected": -5.78125, + "step": 933 + }, + { + "epoch": 1.1460122699386504, + "grad_norm": 15.497645570036209, + "learning_rate": 3.121900826446281e-07, + "logits/chosen": -0.2099609375, + "logits/rejected": -0.388671875, + "logps/chosen": -376.0, + "logps/rejected": -328.0, + "loss": 0.0882, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.859375, + "rewards/margins": 7.375, + "rewards/rejected": -5.53125, + "step": 934 + }, + { + "epoch": 1.147239263803681, + "grad_norm": 13.481451297674173, + "learning_rate": 3.1198347107438014e-07, + "logits/chosen": -0.2470703125, + "logits/rejected": -0.3984375, + "logps/chosen": -410.0, + "logps/rejected": -366.0, + "loss": 0.0719, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.375, + "rewards/margins": 7.21875, + "rewards/rejected": -5.84375, + "step": 935 + }, + { + "epoch": 1.1484662576687117, + "grad_norm": 11.86109616047399, + "learning_rate": 3.1177685950413224e-07, + "logits/chosen": -0.0927734375, + "logits/rejected": -0.3359375, + "logps/chosen": -358.0, + "logps/rejected": -340.0, + "loss": 0.0671, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.86328125, + "rewards/margins": 7.34375, + "rewards/rejected": -6.46875, + "step": 936 + }, + { + "epoch": 1.1496932515337424, + "grad_norm": 15.045680667663055, + "learning_rate": 3.1157024793388424e-07, + "logits/chosen": -0.1630859375, + "logits/rejected": -0.39453125, + "logps/chosen": -428.0, + "logps/rejected": -362.0, + "loss": 0.0795, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.921875, + "rewards/margins": 7.15625, + "rewards/rejected": -6.21875, + "step": 937 + }, + { + "epoch": 1.150920245398773, + "grad_norm": 19.952822255335196, + "learning_rate": 3.1136363636363634e-07, + "logits/chosen": -0.1669921875, + "logits/rejected": -0.23046875, + "logps/chosen": -368.0, + "logps/rejected": -338.0, + "loss": 0.1106, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.80859375, + "rewards/margins": 7.0625, + "rewards/rejected": -6.25, + "step": 938 + }, + { + "epoch": 1.1521472392638037, + "grad_norm": 9.901813888799785, + "learning_rate": 3.111570247933884e-07, + "logits/chosen": -0.294921875, + "logits/rejected": -0.443359375, + "logps/chosen": -444.0, + "logps/rejected": -378.0, + "loss": 0.047, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.734375, + "rewards/margins": 8.4375, + "rewards/rejected": -6.6875, + "step": 939 + }, + { + "epoch": 1.1533742331288344, + "grad_norm": 11.114952809225473, + "learning_rate": 3.109504132231405e-07, + "logits/chosen": -0.28515625, + "logits/rejected": -0.49609375, + "logps/chosen": -412.0, + "logps/rejected": -344.0, + "loss": 0.0604, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.671875, + "rewards/margins": 8.5, + "rewards/rejected": -6.8125, + "step": 940 + }, + { + "epoch": 1.154601226993865, + "grad_norm": 14.57624716499333, + "learning_rate": 3.1074380165289253e-07, + "logits/chosen": -0.1611328125, + "logits/rejected": -0.376953125, + "logps/chosen": -414.0, + "logps/rejected": -354.0, + "loss": 0.0859, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.6953125, + "rewards/margins": 7.84375, + "rewards/rejected": -6.125, + "step": 941 + }, + { + "epoch": 1.1558282208588957, + "grad_norm": 17.205476592824755, + "learning_rate": 3.1053719008264463e-07, + "logits/chosen": -0.3515625, + "logits/rejected": -0.515625, + "logps/chosen": -416.0, + "logps/rejected": -370.0, + "loss": 0.0918, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.4921875, + "rewards/margins": 8.8125, + "rewards/rejected": -7.3125, + "step": 942 + }, + { + "epoch": 1.1570552147239264, + "grad_norm": 17.60114136823849, + "learning_rate": 3.103305785123967e-07, + "logits/chosen": -0.130859375, + "logits/rejected": -0.302734375, + "logps/chosen": -352.0, + "logps/rejected": -316.0, + "loss": 0.0709, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.5703125, + "rewards/margins": 7.03125, + "rewards/rejected": -6.4375, + "step": 943 + }, + { + "epoch": 1.158282208588957, + "grad_norm": 14.083339954890745, + "learning_rate": 3.101239669421488e-07, + "logits/chosen": -0.2001953125, + "logits/rejected": -0.3828125, + "logps/chosen": -404.0, + "logps/rejected": -378.0, + "loss": 0.0719, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.078125, + "rewards/margins": 8.0625, + "rewards/rejected": -7.0, + "step": 944 + }, + { + "epoch": 1.1595092024539877, + "grad_norm": 12.250051834260303, + "learning_rate": 3.099173553719008e-07, + "logits/chosen": -0.279296875, + "logits/rejected": -0.478515625, + "logps/chosen": -416.0, + "logps/rejected": -352.0, + "loss": 0.0661, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.546875, + "rewards/margins": 8.125, + "rewards/rejected": -6.625, + "step": 945 + }, + { + "epoch": 1.1607361963190184, + "grad_norm": 16.43988418131389, + "learning_rate": 3.0971074380165287e-07, + "logits/chosen": -0.1513671875, + "logits/rejected": -0.2373046875, + "logps/chosen": -380.0, + "logps/rejected": -366.0, + "loss": 0.0957, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.1748046875, + "rewards/margins": 6.3125, + "rewards/rejected": -6.125, + "step": 946 + }, + { + "epoch": 1.161963190184049, + "grad_norm": 14.013450147537364, + "learning_rate": 3.095041322314049e-07, + "logits/chosen": -0.322265625, + "logits/rejected": -0.515625, + "logps/chosen": -344.0, + "logps/rejected": -336.0, + "loss": 0.0936, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 1.0546875, + "rewards/margins": 7.28125, + "rewards/rejected": -6.21875, + "step": 947 + }, + { + "epoch": 1.1631901840490797, + "grad_norm": 17.126789573604487, + "learning_rate": 3.09297520661157e-07, + "logits/chosen": -0.314453125, + "logits/rejected": -0.55078125, + "logps/chosen": -424.0, + "logps/rejected": -348.0, + "loss": 0.0824, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.84375, + "rewards/margins": 7.9375, + "rewards/rejected": -6.09375, + "step": 948 + }, + { + "epoch": 1.1644171779141104, + "grad_norm": 13.907173513833683, + "learning_rate": 3.0909090909090907e-07, + "logits/chosen": -0.1396484375, + "logits/rejected": -0.408203125, + "logps/chosen": -412.0, + "logps/rejected": -370.0, + "loss": 0.0778, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.625, + "rewards/margins": 7.6875, + "rewards/rejected": -6.0625, + "step": 949 + }, + { + "epoch": 1.165644171779141, + "grad_norm": 18.056331811241925, + "learning_rate": 3.0888429752066117e-07, + "logits/chosen": -0.255859375, + "logits/rejected": -0.3671875, + "logps/chosen": -332.0, + "logps/rejected": -296.0, + "loss": 0.095, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.87109375, + "rewards/margins": 7.0, + "rewards/rejected": -6.15625, + "step": 950 + }, + { + "epoch": 1.1668711656441717, + "grad_norm": 16.2085205289594, + "learning_rate": 3.086776859504132e-07, + "logits/chosen": -0.1513671875, + "logits/rejected": -0.28515625, + "logps/chosen": -344.0, + "logps/rejected": -314.0, + "loss": 0.0841, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.81640625, + "rewards/margins": 6.5, + "rewards/rejected": -5.6875, + "step": 951 + }, + { + "epoch": 1.1680981595092024, + "grad_norm": 16.341069022558255, + "learning_rate": 3.0847107438016526e-07, + "logits/chosen": -0.322265625, + "logits/rejected": -0.59765625, + "logps/chosen": -420.0, + "logps/rejected": -344.0, + "loss": 0.0943, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.6484375, + "rewards/margins": 7.46875, + "rewards/rejected": -5.8125, + "step": 952 + }, + { + "epoch": 1.169325153374233, + "grad_norm": 16.968037380438737, + "learning_rate": 3.0826446280991736e-07, + "logits/chosen": -0.208984375, + "logits/rejected": -0.40234375, + "logps/chosen": -386.0, + "logps/rejected": -314.0, + "loss": 0.083, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.1953125, + "rewards/margins": 6.15625, + "rewards/rejected": -4.96875, + "step": 953 + }, + { + "epoch": 1.1705521472392637, + "grad_norm": 19.10483320310206, + "learning_rate": 3.080578512396694e-07, + "logits/chosen": -0.2119140625, + "logits/rejected": -0.40625, + "logps/chosen": -314.0, + "logps/rejected": -274.0, + "loss": 0.1092, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.34765625, + "rewards/margins": 5.96875, + "rewards/rejected": -5.625, + "step": 954 + }, + { + "epoch": 1.1717791411042944, + "grad_norm": 10.69197426239666, + "learning_rate": 3.0785123966942146e-07, + "logits/chosen": -0.1513671875, + "logits/rejected": -0.23046875, + "logps/chosen": -376.0, + "logps/rejected": -334.0, + "loss": 0.0556, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.53125, + "rewards/margins": 6.875, + "rewards/rejected": -5.34375, + "step": 955 + }, + { + "epoch": 1.173006134969325, + "grad_norm": 12.943116163333505, + "learning_rate": 3.076446280991735e-07, + "logits/chosen": -0.2255859375, + "logits/rejected": -0.337890625, + "logps/chosen": -310.0, + "logps/rejected": -302.0, + "loss": 0.0649, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.921875, + "rewards/margins": 6.15625, + "rewards/rejected": -5.21875, + "step": 956 + }, + { + "epoch": 1.1742331288343557, + "grad_norm": 12.21194868544167, + "learning_rate": 3.074380165289256e-07, + "logits/chosen": -0.265625, + "logits/rejected": -0.486328125, + "logps/chosen": -384.0, + "logps/rejected": -358.0, + "loss": 0.0675, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.5625, + "rewards/margins": 6.90625, + "rewards/rejected": -5.34375, + "step": 957 + }, + { + "epoch": 1.1754601226993864, + "grad_norm": 17.259568939422916, + "learning_rate": 3.0723140495867765e-07, + "logits/chosen": -0.185546875, + "logits/rejected": -0.302734375, + "logps/chosen": -356.0, + "logps/rejected": -358.0, + "loss": 0.0691, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.1953125, + "rewards/margins": 7.15625, + "rewards/rejected": -5.96875, + "step": 958 + }, + { + "epoch": 1.1766871165644173, + "grad_norm": 15.64576685723049, + "learning_rate": 3.0702479338842975e-07, + "logits/chosen": -0.220703125, + "logits/rejected": -0.41015625, + "logps/chosen": -390.0, + "logps/rejected": -344.0, + "loss": 0.0859, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.2421875, + "rewards/margins": 7.0, + "rewards/rejected": -5.75, + "step": 959 + }, + { + "epoch": 1.177914110429448, + "grad_norm": 13.606327559065937, + "learning_rate": 3.068181818181818e-07, + "logits/chosen": -0.3046875, + "logits/rejected": -0.455078125, + "logps/chosen": -336.0, + "logps/rejected": -304.0, + "loss": 0.0763, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.43359375, + "rewards/margins": 6.71875, + "rewards/rejected": -6.28125, + "step": 960 + }, + { + "epoch": 1.1791411042944786, + "grad_norm": 11.782861618678115, + "learning_rate": 3.066115702479339e-07, + "logits/chosen": -0.25, + "logits/rejected": -0.380859375, + "logps/chosen": -396.0, + "logps/rejected": -336.0, + "loss": 0.0613, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.7421875, + "rewards/margins": 7.875, + "rewards/rejected": -6.125, + "step": 961 + }, + { + "epoch": 1.1803680981595093, + "grad_norm": 15.408628461589814, + "learning_rate": 3.0640495867768594e-07, + "logits/chosen": -0.150390625, + "logits/rejected": -0.31640625, + "logps/chosen": -432.0, + "logps/rejected": -386.0, + "loss": 0.0822, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.25, + "rewards/margins": 7.34375, + "rewards/rejected": -6.09375, + "step": 962 + }, + { + "epoch": 1.18159509202454, + "grad_norm": 12.216790890333117, + "learning_rate": 3.0619834710743804e-07, + "logits/chosen": -0.25, + "logits/rejected": -0.443359375, + "logps/chosen": -370.0, + "logps/rejected": -312.0, + "loss": 0.0732, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.4140625, + "rewards/margins": 7.625, + "rewards/rejected": -6.1875, + "step": 963 + }, + { + "epoch": 1.1828220858895706, + "grad_norm": 18.006422261990974, + "learning_rate": 3.0599173553719004e-07, + "logits/chosen": -0.1982421875, + "logits/rejected": -0.37890625, + "logps/chosen": -374.0, + "logps/rejected": -326.0, + "loss": 0.0726, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.3359375, + "rewards/margins": 7.90625, + "rewards/rejected": -6.5625, + "step": 964 + }, + { + "epoch": 1.1840490797546013, + "grad_norm": 19.94845083636628, + "learning_rate": 3.0578512396694214e-07, + "logits/chosen": -0.265625, + "logits/rejected": -0.40234375, + "logps/chosen": -356.0, + "logps/rejected": -344.0, + "loss": 0.0739, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.67578125, + "rewards/margins": 7.53125, + "rewards/rejected": -6.84375, + "step": 965 + }, + { + "epoch": 1.185276073619632, + "grad_norm": 13.445845138407845, + "learning_rate": 3.055785123966942e-07, + "logits/chosen": -0.318359375, + "logits/rejected": -0.458984375, + "logps/chosen": -386.0, + "logps/rejected": -320.0, + "loss": 0.0745, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.9140625, + "rewards/margins": 7.5625, + "rewards/rejected": -6.625, + "step": 966 + }, + { + "epoch": 1.1865030674846626, + "grad_norm": 16.300571483075196, + "learning_rate": 3.053719008264463e-07, + "logits/chosen": -0.2412109375, + "logits/rejected": -0.421875, + "logps/chosen": -404.0, + "logps/rejected": -338.0, + "loss": 0.0914, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.6953125, + "rewards/margins": 8.1875, + "rewards/rejected": -6.5, + "step": 967 + }, + { + "epoch": 1.1877300613496933, + "grad_norm": 11.703836604576628, + "learning_rate": 3.0516528925619833e-07, + "logits/chosen": -0.181640625, + "logits/rejected": -0.373046875, + "logps/chosen": -420.0, + "logps/rejected": -354.0, + "loss": 0.0562, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.1953125, + "rewards/margins": 8.3125, + "rewards/rejected": -7.125, + "step": 968 + }, + { + "epoch": 1.188957055214724, + "grad_norm": 16.658410921449764, + "learning_rate": 3.049586776859504e-07, + "logits/chosen": -0.287109375, + "logits/rejected": -0.447265625, + "logps/chosen": -378.0, + "logps/rejected": -380.0, + "loss": 0.0999, + "rewards/accuracies": 0.96875, + "rewards/chosen": -0.5, + "rewards/margins": 6.71875, + "rewards/rejected": -7.21875, + "step": 969 + }, + { + "epoch": 1.1901840490797546, + "grad_norm": 15.75184921128148, + "learning_rate": 3.047520661157025e-07, + "logits/chosen": -0.23046875, + "logits/rejected": -0.365234375, + "logps/chosen": -364.0, + "logps/rejected": -452.0, + "loss": 0.0855, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.7109375, + "rewards/margins": 18.75, + "rewards/rejected": -18.0, + "step": 970 + }, + { + "epoch": 1.1914110429447853, + "grad_norm": 15.12803773136293, + "learning_rate": 3.0454545454545453e-07, + "logits/chosen": -0.1552734375, + "logits/rejected": -0.396484375, + "logps/chosen": -352.0, + "logps/rejected": -318.0, + "loss": 0.0915, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.478515625, + "rewards/margins": 7.4375, + "rewards/rejected": -6.96875, + "step": 971 + }, + { + "epoch": 1.192638036809816, + "grad_norm": 15.945063034571097, + "learning_rate": 3.0433884297520663e-07, + "logits/chosen": -0.2158203125, + "logits/rejected": -0.3515625, + "logps/chosen": -338.0, + "logps/rejected": -280.0, + "loss": 0.1099, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.02880859375, + "rewards/margins": 6.65625, + "rewards/rejected": -6.625, + "step": 972 + }, + { + "epoch": 1.1938650306748466, + "grad_norm": 14.793273037242393, + "learning_rate": 3.041322314049586e-07, + "logits/chosen": -0.287109375, + "logits/rejected": -0.4375, + "logps/chosen": -408.0, + "logps/rejected": -392.0, + "loss": 0.0614, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.09375, + "rewards/margins": 8.0625, + "rewards/rejected": -6.96875, + "step": 973 + }, + { + "epoch": 1.1950920245398773, + "grad_norm": 11.725573965481992, + "learning_rate": 3.039256198347107e-07, + "logits/chosen": -0.357421875, + "logits/rejected": -0.55859375, + "logps/chosen": -394.0, + "logps/rejected": -374.0, + "loss": 0.0561, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.4453125, + "rewards/margins": 8.9375, + "rewards/rejected": -7.5, + "step": 974 + }, + { + "epoch": 1.196319018404908, + "grad_norm": 18.27579215015143, + "learning_rate": 3.0371900826446277e-07, + "logits/chosen": -0.1318359375, + "logits/rejected": -0.2578125, + "logps/chosen": -356.0, + "logps/rejected": -300.0, + "loss": 0.0748, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.578125, + "rewards/margins": 7.21875, + "rewards/rejected": -6.65625, + "step": 975 + }, + { + "epoch": 1.1975460122699386, + "grad_norm": 18.99533942238631, + "learning_rate": 3.0351239669421487e-07, + "logits/chosen": -0.3125, + "logits/rejected": -0.52734375, + "logps/chosen": -420.0, + "logps/rejected": -358.0, + "loss": 0.0909, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.1484375, + "rewards/margins": 7.34375, + "rewards/rejected": -6.21875, + "step": 976 + }, + { + "epoch": 1.1987730061349693, + "grad_norm": 17.188567163830015, + "learning_rate": 3.033057851239669e-07, + "logits/chosen": -0.20703125, + "logits/rejected": -0.412109375, + "logps/chosen": -384.0, + "logps/rejected": -340.0, + "loss": 0.0499, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.40625, + "rewards/margins": 8.6875, + "rewards/rejected": -7.25, + "step": 977 + }, + { + "epoch": 1.2, + "grad_norm": 20.333325189340393, + "learning_rate": 3.03099173553719e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.310546875, + "logps/chosen": -358.0, + "logps/rejected": -310.0, + "loss": 0.1076, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.44921875, + "rewards/margins": 7.125, + "rewards/rejected": -6.6875, + "step": 978 + }, + { + "epoch": 1.2012269938650306, + "grad_norm": 12.588392586420149, + "learning_rate": 3.0289256198347106e-07, + "logits/chosen": -0.1650390625, + "logits/rejected": -0.291015625, + "logps/chosen": -406.0, + "logps/rejected": -350.0, + "loss": 0.0609, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.09375, + "rewards/margins": 8.0, + "rewards/rejected": -6.90625, + "step": 979 + }, + { + "epoch": 1.2024539877300613, + "grad_norm": 11.087054978059909, + "learning_rate": 3.0268595041322316e-07, + "logits/chosen": -0.291015625, + "logits/rejected": -0.48046875, + "logps/chosen": -364.0, + "logps/rejected": -340.0, + "loss": 0.0543, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.421875, + "rewards/margins": 7.90625, + "rewards/rejected": -6.5, + "step": 980 + }, + { + "epoch": 1.203680981595092, + "grad_norm": 15.838665018936267, + "learning_rate": 3.024793388429752e-07, + "logits/chosen": -0.2333984375, + "logits/rejected": -0.3359375, + "logps/chosen": -384.0, + "logps/rejected": -348.0, + "loss": 0.0789, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.125, + "rewards/margins": 7.375, + "rewards/rejected": -6.25, + "step": 981 + }, + { + "epoch": 1.2049079754601226, + "grad_norm": 15.323699779119652, + "learning_rate": 3.0227272727272726e-07, + "logits/chosen": -0.2236328125, + "logits/rejected": -0.40625, + "logps/chosen": -404.0, + "logps/rejected": -372.0, + "loss": 0.0882, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.1875, + "rewards/margins": 7.625, + "rewards/rejected": -6.4375, + "step": 982 + }, + { + "epoch": 1.2061349693251533, + "grad_norm": 18.628005700971052, + "learning_rate": 3.020661157024793e-07, + "logits/chosen": -0.236328125, + "logits/rejected": -0.404296875, + "logps/chosen": -378.0, + "logps/rejected": -314.0, + "loss": 0.1039, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 1.1171875, + "rewards/margins": 6.84375, + "rewards/rejected": -5.71875, + "step": 983 + }, + { + "epoch": 1.207361963190184, + "grad_norm": 16.0212141460115, + "learning_rate": 3.018595041322314e-07, + "logits/chosen": -0.26171875, + "logits/rejected": -0.435546875, + "logps/chosen": -354.0, + "logps/rejected": -310.0, + "loss": 0.0906, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.1328125, + "rewards/margins": 7.4375, + "rewards/rejected": -6.3125, + "step": 984 + }, + { + "epoch": 1.2085889570552146, + "grad_norm": 15.849341321351776, + "learning_rate": 3.0165289256198345e-07, + "logits/chosen": -0.169921875, + "logits/rejected": -0.34765625, + "logps/chosen": -344.0, + "logps/rejected": -314.0, + "loss": 0.0852, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.34375, + "rewards/margins": 7.28125, + "rewards/rejected": -5.9375, + "step": 985 + }, + { + "epoch": 1.2098159509202455, + "grad_norm": 14.41239950819617, + "learning_rate": 3.014462809917355e-07, + "logits/chosen": -0.08154296875, + "logits/rejected": -0.2255859375, + "logps/chosen": -386.0, + "logps/rejected": -322.0, + "loss": 0.0659, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 1.53125, + "rewards/margins": 7.0, + "rewards/rejected": -5.46875, + "step": 986 + }, + { + "epoch": 1.2110429447852762, + "grad_norm": 15.43728903633136, + "learning_rate": 3.012396694214876e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.494140625, + "logps/chosen": -452.0, + "logps/rejected": -368.0, + "loss": 0.0746, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.859375, + "rewards/margins": 7.96875, + "rewards/rejected": -6.125, + "step": 987 + }, + { + "epoch": 1.2122699386503069, + "grad_norm": 11.91513035885166, + "learning_rate": 3.0103305785123965e-07, + "logits/chosen": -0.18359375, + "logits/rejected": -0.38671875, + "logps/chosen": -364.0, + "logps/rejected": -306.0, + "loss": 0.0544, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.03125, + "rewards/margins": 7.1875, + "rewards/rejected": -6.1875, + "step": 988 + }, + { + "epoch": 1.2134969325153375, + "grad_norm": 16.47608455115928, + "learning_rate": 3.0082644628099175e-07, + "logits/chosen": -0.1328125, + "logits/rejected": -0.30078125, + "logps/chosen": -344.0, + "logps/rejected": -300.0, + "loss": 0.0957, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.87890625, + "rewards/margins": 6.40625, + "rewards/rejected": -5.53125, + "step": 989 + }, + { + "epoch": 1.2147239263803682, + "grad_norm": 17.548383088711475, + "learning_rate": 3.006198347107438e-07, + "logits/chosen": -0.2470703125, + "logits/rejected": -0.435546875, + "logps/chosen": -394.0, + "logps/rejected": -352.0, + "loss": 0.0897, + "rewards/accuracies": 0.953125, + "rewards/chosen": 1.3828125, + "rewards/margins": 7.90625, + "rewards/rejected": -6.5, + "step": 990 + }, + { + "epoch": 1.2159509202453989, + "grad_norm": 10.878093708569429, + "learning_rate": 3.0041322314049584e-07, + "logits/chosen": -0.2138671875, + "logits/rejected": -0.337890625, + "logps/chosen": -404.0, + "logps/rejected": -366.0, + "loss": 0.0541, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.86328125, + "rewards/margins": 7.75, + "rewards/rejected": -6.90625, + "step": 991 + }, + { + "epoch": 1.2171779141104295, + "grad_norm": 15.553111442326719, + "learning_rate": 3.002066115702479e-07, + "logits/chosen": -0.2158203125, + "logits/rejected": -0.412109375, + "logps/chosen": -378.0, + "logps/rejected": -350.0, + "loss": 0.0746, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.171875, + "rewards/margins": 7.65625, + "rewards/rejected": -6.5, + "step": 992 + }, + { + "epoch": 1.2184049079754602, + "grad_norm": 16.507163595298366, + "learning_rate": 3e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.4375, + "logps/chosen": -372.0, + "logps/rejected": -336.0, + "loss": 0.0836, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.2734375, + "rewards/margins": 7.25, + "rewards/rejected": -5.96875, + "step": 993 + }, + { + "epoch": 1.2196319018404909, + "grad_norm": 14.14520585310296, + "learning_rate": 2.9979338842975203e-07, + "logits/chosen": -0.283203125, + "logits/rejected": -0.45703125, + "logps/chosen": -418.0, + "logps/rejected": -366.0, + "loss": 0.0733, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.34375, + "rewards/margins": 7.875, + "rewards/rejected": -6.53125, + "step": 994 + }, + { + "epoch": 1.2208588957055215, + "grad_norm": 11.329513670197326, + "learning_rate": 2.9958677685950413e-07, + "logits/chosen": -0.22265625, + "logits/rejected": -0.3671875, + "logps/chosen": -350.0, + "logps/rejected": -358.0, + "loss": 0.057, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.703125, + "rewards/margins": 7.53125, + "rewards/rejected": -6.8125, + "step": 995 + }, + { + "epoch": 1.2220858895705522, + "grad_norm": 24.827809747858634, + "learning_rate": 2.993801652892562e-07, + "logits/chosen": -0.1748046875, + "logits/rejected": -0.41796875, + "logps/chosen": -380.0, + "logps/rejected": -336.0, + "loss": 0.0874, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.59765625, + "rewards/margins": 7.21875, + "rewards/rejected": -6.625, + "step": 996 + }, + { + "epoch": 1.2233128834355829, + "grad_norm": 14.593045071356238, + "learning_rate": 2.991735537190083e-07, + "logits/chosen": -0.296875, + "logits/rejected": -0.486328125, + "logps/chosen": -416.0, + "logps/rejected": -340.0, + "loss": 0.0699, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.5625, + "rewards/margins": 7.78125, + "rewards/rejected": -6.21875, + "step": 997 + }, + { + "epoch": 1.2245398773006135, + "grad_norm": 16.30291368696963, + "learning_rate": 2.9896694214876033e-07, + "logits/chosen": -0.173828125, + "logits/rejected": -0.369140625, + "logps/chosen": -442.0, + "logps/rejected": -376.0, + "loss": 0.0743, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.484375, + "rewards/margins": 7.84375, + "rewards/rejected": -6.34375, + "step": 998 + }, + { + "epoch": 1.2257668711656442, + "grad_norm": 15.361659398242933, + "learning_rate": 2.9876033057851243e-07, + "logits/chosen": -0.21875, + "logits/rejected": -0.39453125, + "logps/chosen": -406.0, + "logps/rejected": -352.0, + "loss": 0.0661, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.65625, + "rewards/margins": 8.1875, + "rewards/rejected": -6.5625, + "step": 999 + }, + { + "epoch": 1.2269938650306749, + "grad_norm": 16.28161869676532, + "learning_rate": 2.985537190082644e-07, + "logits/chosen": -0.1845703125, + "logits/rejected": -0.27734375, + "logps/chosen": -382.0, + "logps/rejected": -350.0, + "loss": 0.0969, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 1.4453125, + "rewards/margins": 7.65625, + "rewards/rejected": -6.21875, + "step": 1000 + }, + { + "epoch": 1.2282208588957055, + "grad_norm": 11.272885655368697, + "learning_rate": 2.983471074380165e-07, + "logits/chosen": -0.3203125, + "logits/rejected": -0.4921875, + "logps/chosen": -408.0, + "logps/rejected": -342.0, + "loss": 0.0532, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.7265625, + "rewards/margins": 8.4375, + "rewards/rejected": -6.71875, + "step": 1001 + }, + { + "epoch": 1.2294478527607362, + "grad_norm": 24.087030362689006, + "learning_rate": 2.9814049586776857e-07, + "logits/chosen": -0.2255859375, + "logits/rejected": -0.30078125, + "logps/chosen": -372.0, + "logps/rejected": -374.0, + "loss": 0.0978, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.359375, + "rewards/margins": 7.71875, + "rewards/rejected": -6.375, + "step": 1002 + }, + { + "epoch": 1.2306748466257669, + "grad_norm": 15.714476341620568, + "learning_rate": 2.9793388429752067e-07, + "logits/chosen": -0.30859375, + "logits/rejected": -0.443359375, + "logps/chosen": -358.0, + "logps/rejected": -344.0, + "loss": 0.0853, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.91796875, + "rewards/margins": 7.8125, + "rewards/rejected": -6.875, + "step": 1003 + }, + { + "epoch": 1.2319018404907975, + "grad_norm": 11.843728821798939, + "learning_rate": 2.977272727272727e-07, + "logits/chosen": -0.2060546875, + "logits/rejected": -0.41796875, + "logps/chosen": -354.0, + "logps/rejected": -296.0, + "loss": 0.0703, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.1171875, + "rewards/margins": 7.28125, + "rewards/rejected": -6.15625, + "step": 1004 + }, + { + "epoch": 1.2331288343558282, + "grad_norm": 16.50686909285978, + "learning_rate": 2.9752066115702476e-07, + "logits/chosen": -0.212890625, + "logits/rejected": -0.3984375, + "logps/chosen": -392.0, + "logps/rejected": -328.0, + "loss": 0.0931, + "rewards/accuracies": 0.953125, + "rewards/chosen": 0.83203125, + "rewards/margins": 7.875, + "rewards/rejected": -7.03125, + "step": 1005 + }, + { + "epoch": 1.2343558282208589, + "grad_norm": 13.635220091003717, + "learning_rate": 2.9731404958677686e-07, + "logits/chosen": -0.25390625, + "logits/rejected": -0.439453125, + "logps/chosen": -364.0, + "logps/rejected": -326.0, + "loss": 0.0783, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 1.0703125, + "rewards/margins": 8.125, + "rewards/rejected": -7.0625, + "step": 1006 + }, + { + "epoch": 1.2355828220858895, + "grad_norm": 15.23141865260738, + "learning_rate": 2.971074380165289e-07, + "logits/chosen": -0.2197265625, + "logits/rejected": -0.392578125, + "logps/chosen": -400.0, + "logps/rejected": -372.0, + "loss": 0.0781, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.2265625, + "rewards/margins": 8.25, + "rewards/rejected": -7.03125, + "step": 1007 + }, + { + "epoch": 1.2368098159509202, + "grad_norm": 16.281149113022543, + "learning_rate": 2.96900826446281e-07, + "logits/chosen": -0.2412109375, + "logits/rejected": -0.36328125, + "logps/chosen": -352.0, + "logps/rejected": -326.0, + "loss": 0.0751, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.66015625, + "rewards/margins": 7.6875, + "rewards/rejected": -7.0, + "step": 1008 + }, + { + "epoch": 1.2380368098159509, + "grad_norm": 15.753570194975307, + "learning_rate": 2.96694214876033e-07, + "logits/chosen": -0.169921875, + "logits/rejected": -0.37109375, + "logps/chosen": -430.0, + "logps/rejected": -348.0, + "loss": 0.0887, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.0546875, + "rewards/margins": 7.59375, + "rewards/rejected": -6.53125, + "step": 1009 + }, + { + "epoch": 1.2392638036809815, + "grad_norm": 15.81206887261548, + "learning_rate": 2.964876033057851e-07, + "logits/chosen": -0.2109375, + "logits/rejected": -0.302734375, + "logps/chosen": -354.0, + "logps/rejected": -340.0, + "loss": 0.0932, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.06201171875, + "rewards/margins": 6.78125, + "rewards/rejected": -6.71875, + "step": 1010 + }, + { + "epoch": 1.2404907975460122, + "grad_norm": 20.589574722596257, + "learning_rate": 2.9628099173553715e-07, + "logits/chosen": -0.2158203125, + "logits/rejected": -0.40234375, + "logps/chosen": -412.0, + "logps/rejected": -358.0, + "loss": 0.0922, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.44140625, + "rewards/margins": 7.40625, + "rewards/rejected": -6.96875, + "step": 1011 + }, + { + "epoch": 1.2417177914110429, + "grad_norm": 20.579275332459357, + "learning_rate": 2.9607438016528925e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.421875, + "logps/chosen": -380.0, + "logps/rejected": -342.0, + "loss": 0.1254, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.78125, + "rewards/margins": 7.5625, + "rewards/rejected": -6.78125, + "step": 1012 + }, + { + "epoch": 1.2429447852760735, + "grad_norm": 11.670737212320592, + "learning_rate": 2.958677685950413e-07, + "logits/chosen": -0.171875, + "logits/rejected": -0.259765625, + "logps/chosen": -392.0, + "logps/rejected": -350.0, + "loss": 0.0766, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.455078125, + "rewards/margins": 6.8125, + "rewards/rejected": -6.375, + "step": 1013 + }, + { + "epoch": 1.2441717791411042, + "grad_norm": 17.81434648694424, + "learning_rate": 2.956611570247934e-07, + "logits/chosen": -0.24609375, + "logits/rejected": -0.392578125, + "logps/chosen": -382.0, + "logps/rejected": -374.0, + "loss": 0.0879, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.404296875, + "rewards/margins": 7.1875, + "rewards/rejected": -6.78125, + "step": 1014 + }, + { + "epoch": 1.2453987730061349, + "grad_norm": 13.56788247411275, + "learning_rate": 2.9545454545454545e-07, + "logits/chosen": -0.2177734375, + "logits/rejected": -0.33984375, + "logps/chosen": -370.0, + "logps/rejected": -352.0, + "loss": 0.0637, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.078125, + "rewards/margins": 7.84375, + "rewards/rejected": -6.75, + "step": 1015 + }, + { + "epoch": 1.2466257668711656, + "grad_norm": 23.609417138690965, + "learning_rate": 2.9524793388429755e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.3515625, + "logps/chosen": -356.0, + "logps/rejected": -314.0, + "loss": 0.1339, + "rewards/accuracies": 0.953125, + "rewards/chosen": 0.54296875, + "rewards/margins": 6.65625, + "rewards/rejected": -6.125, + "step": 1016 + }, + { + "epoch": 1.2478527607361962, + "grad_norm": 11.819528640210681, + "learning_rate": 2.950413223140496e-07, + "logits/chosen": -0.244140625, + "logits/rejected": -0.470703125, + "logps/chosen": -402.0, + "logps/rejected": -322.0, + "loss": 0.0525, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.4453125, + "rewards/margins": 8.0625, + "rewards/rejected": -6.65625, + "step": 1017 + }, + { + "epoch": 1.2490797546012269, + "grad_norm": 21.70323477701805, + "learning_rate": 2.9483471074380164e-07, + "logits/chosen": -0.267578125, + "logits/rejected": -0.36328125, + "logps/chosen": -402.0, + "logps/rejected": -378.0, + "loss": 0.0962, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.490234375, + "rewards/margins": 7.90625, + "rewards/rejected": -7.40625, + "step": 1018 + }, + { + "epoch": 1.2503067484662576, + "grad_norm": 14.000442974449523, + "learning_rate": 2.946280991735537e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.447265625, + "logps/chosen": -370.0, + "logps/rejected": -338.0, + "loss": 0.0847, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.890625, + "rewards/margins": 7.78125, + "rewards/rejected": -6.90625, + "step": 1019 + }, + { + "epoch": 1.2515337423312882, + "grad_norm": 13.06879888610367, + "learning_rate": 2.944214876033058e-07, + "logits/chosen": -0.2373046875, + "logits/rejected": -0.36328125, + "logps/chosen": -410.0, + "logps/rejected": -362.0, + "loss": 0.0748, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.7578125, + "rewards/margins": 8.0625, + "rewards/rejected": -7.3125, + "step": 1020 + }, + { + "epoch": 1.252760736196319, + "grad_norm": 18.899127346492538, + "learning_rate": 2.9421487603305783e-07, + "logits/chosen": -0.216796875, + "logits/rejected": -0.310546875, + "logps/chosen": -368.0, + "logps/rejected": -332.0, + "loss": 0.0868, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.40625, + "rewards/margins": 6.96875, + "rewards/rejected": -6.5625, + "step": 1021 + }, + { + "epoch": 1.2539877300613496, + "grad_norm": 14.162372172323648, + "learning_rate": 2.940082644628099e-07, + "logits/chosen": -0.2890625, + "logits/rejected": -0.4296875, + "logps/chosen": -412.0, + "logps/rejected": -356.0, + "loss": 0.0788, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.046875, + "rewards/margins": 7.875, + "rewards/rejected": -6.84375, + "step": 1022 + }, + { + "epoch": 1.2552147239263804, + "grad_norm": 12.264199783376707, + "learning_rate": 2.93801652892562e-07, + "logits/chosen": -0.251953125, + "logits/rejected": -0.43359375, + "logps/chosen": -396.0, + "logps/rejected": -354.0, + "loss": 0.0625, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.5390625, + "rewards/margins": 8.0, + "rewards/rejected": -6.46875, + "step": 1023 + }, + { + "epoch": 1.2564417177914111, + "grad_norm": 18.04676940622606, + "learning_rate": 2.9359504132231403e-07, + "logits/chosen": -0.1650390625, + "logits/rejected": -0.40625, + "logps/chosen": -406.0, + "logps/rejected": -374.0, + "loss": 0.0856, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.875, + "rewards/margins": 7.875, + "rewards/rejected": -7.0, + "step": 1024 + }, + { + "epoch": 1.2576687116564418, + "grad_norm": 14.70688811959489, + "learning_rate": 2.9338842975206613e-07, + "logits/chosen": -0.150390625, + "logits/rejected": -0.3359375, + "logps/chosen": -408.0, + "logps/rejected": -378.0, + "loss": 0.0832, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.625, + "rewards/margins": 7.9375, + "rewards/rejected": -6.3125, + "step": 1025 + }, + { + "epoch": 1.2588957055214725, + "grad_norm": 14.428819823253946, + "learning_rate": 2.931818181818181e-07, + "logits/chosen": -0.244140625, + "logits/rejected": -0.41796875, + "logps/chosen": -364.0, + "logps/rejected": -336.0, + "loss": 0.086, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.82421875, + "rewards/margins": 7.375, + "rewards/rejected": -6.53125, + "step": 1026 + }, + { + "epoch": 1.2601226993865031, + "grad_norm": 12.462935950586663, + "learning_rate": 2.929752066115702e-07, + "logits/chosen": -0.283203125, + "logits/rejected": -0.51171875, + "logps/chosen": -442.0, + "logps/rejected": -372.0, + "loss": 0.0543, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.1171875, + "rewards/margins": 7.90625, + "rewards/rejected": -6.78125, + "step": 1027 + }, + { + "epoch": 1.2613496932515338, + "grad_norm": 15.687199038767078, + "learning_rate": 2.9276859504132227e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.427734375, + "logps/chosen": -392.0, + "logps/rejected": -356.0, + "loss": 0.0712, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.6328125, + "rewards/margins": 8.6875, + "rewards/rejected": -7.0625, + "step": 1028 + }, + { + "epoch": 1.2625766871165645, + "grad_norm": 18.1445169567953, + "learning_rate": 2.9256198347107437e-07, + "logits/chosen": -0.248046875, + "logits/rejected": -0.431640625, + "logps/chosen": -386.0, + "logps/rejected": -348.0, + "loss": 0.0796, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.8515625, + "rewards/margins": 7.25, + "rewards/rejected": -6.40625, + "step": 1029 + }, + { + "epoch": 1.2638036809815951, + "grad_norm": 16.65068905231203, + "learning_rate": 2.923553719008264e-07, + "logits/chosen": -0.39453125, + "logits/rejected": -0.494140625, + "logps/chosen": -410.0, + "logps/rejected": -370.0, + "loss": 0.0836, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.546875, + "rewards/margins": 8.5, + "rewards/rejected": -6.96875, + "step": 1030 + }, + { + "epoch": 1.2650306748466258, + "grad_norm": 14.392097497709575, + "learning_rate": 2.921487603305785e-07, + "logits/chosen": -0.18359375, + "logits/rejected": -0.41796875, + "logps/chosen": -378.0, + "logps/rejected": -328.0, + "loss": 0.0776, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.9921875, + "rewards/margins": 7.625, + "rewards/rejected": -6.65625, + "step": 1031 + }, + { + "epoch": 1.2662576687116565, + "grad_norm": 11.559260515235467, + "learning_rate": 2.9194214876033056e-07, + "logits/chosen": -0.10009765625, + "logits/rejected": -0.296875, + "logps/chosen": -372.0, + "logps/rejected": -326.0, + "loss": 0.058, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.0625, + "rewards/margins": 7.75, + "rewards/rejected": -6.6875, + "step": 1032 + }, + { + "epoch": 1.2674846625766871, + "grad_norm": 15.990921003538096, + "learning_rate": 2.9173553719008266e-07, + "logits/chosen": -0.2490234375, + "logits/rejected": -0.458984375, + "logps/chosen": -428.0, + "logps/rejected": -356.0, + "loss": 0.0875, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.92578125, + "rewards/margins": 7.3125, + "rewards/rejected": -6.40625, + "step": 1033 + }, + { + "epoch": 1.2687116564417178, + "grad_norm": 8.99616397744727, + "learning_rate": 2.915289256198347e-07, + "logits/chosen": -0.26953125, + "logits/rejected": -0.484375, + "logps/chosen": -460.0, + "logps/rejected": -380.0, + "loss": 0.0426, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.703125, + "rewards/margins": 8.6875, + "rewards/rejected": -6.96875, + "step": 1034 + }, + { + "epoch": 1.2699386503067485, + "grad_norm": 14.825092230707533, + "learning_rate": 2.9132231404958676e-07, + "logits/chosen": -0.193359375, + "logits/rejected": -0.390625, + "logps/chosen": -406.0, + "logps/rejected": -352.0, + "loss": 0.0685, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.9921875, + "rewards/margins": 7.84375, + "rewards/rejected": -6.84375, + "step": 1035 + }, + { + "epoch": 1.2711656441717791, + "grad_norm": 15.303748653633287, + "learning_rate": 2.911157024793388e-07, + "logits/chosen": -0.1806640625, + "logits/rejected": -0.322265625, + "logps/chosen": -374.0, + "logps/rejected": -332.0, + "loss": 0.0729, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.6640625, + "rewards/margins": 7.71875, + "rewards/rejected": -6.0625, + "step": 1036 + }, + { + "epoch": 1.2723926380368098, + "grad_norm": 15.346976284336828, + "learning_rate": 2.909090909090909e-07, + "logits/chosen": -0.36328125, + "logits/rejected": -0.51171875, + "logps/chosen": -412.0, + "logps/rejected": -392.0, + "loss": 0.0698, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.4296875, + "rewards/margins": 7.875, + "rewards/rejected": -6.4375, + "step": 1037 + }, + { + "epoch": 1.2736196319018405, + "grad_norm": 15.840412570196161, + "learning_rate": 2.9070247933884295e-07, + "logits/chosen": -0.2236328125, + "logits/rejected": -0.384765625, + "logps/chosen": -374.0, + "logps/rejected": -350.0, + "loss": 0.067, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.34375, + "rewards/margins": 8.3125, + "rewards/rejected": -6.96875, + "step": 1038 + }, + { + "epoch": 1.2748466257668711, + "grad_norm": 18.036593049006218, + "learning_rate": 2.9049586776859505e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.365234375, + "logps/chosen": -376.0, + "logps/rejected": -370.0, + "loss": 0.0993, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.83203125, + "rewards/margins": 6.8125, + "rewards/rejected": -6.0, + "step": 1039 + }, + { + "epoch": 1.2760736196319018, + "grad_norm": 17.503898447096805, + "learning_rate": 2.902892561983471e-07, + "logits/chosen": -0.27734375, + "logits/rejected": -0.546875, + "logps/chosen": -418.0, + "logps/rejected": -324.0, + "loss": 0.0785, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.4921875, + "rewards/margins": 8.3125, + "rewards/rejected": -6.84375, + "step": 1040 + }, + { + "epoch": 1.2773006134969325, + "grad_norm": 12.167883143637123, + "learning_rate": 2.9008264462809915e-07, + "logits/chosen": -0.2333984375, + "logits/rejected": -0.369140625, + "logps/chosen": -374.0, + "logps/rejected": -330.0, + "loss": 0.0591, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.98828125, + "rewards/margins": 7.375, + "rewards/rejected": -6.375, + "step": 1041 + }, + { + "epoch": 1.2785276073619631, + "grad_norm": 15.75805722285459, + "learning_rate": 2.8987603305785125e-07, + "logits/chosen": -0.37109375, + "logits/rejected": -0.57421875, + "logps/chosen": -444.0, + "logps/rejected": -382.0, + "loss": 0.0708, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.484375, + "rewards/margins": 8.4375, + "rewards/rejected": -6.9375, + "step": 1042 + }, + { + "epoch": 1.2797546012269938, + "grad_norm": 20.340466573407646, + "learning_rate": 2.896694214876033e-07, + "logits/chosen": -0.208984375, + "logits/rejected": -0.380859375, + "logps/chosen": -372.0, + "logps/rejected": -338.0, + "loss": 0.1084, + "rewards/accuracies": 0.953125, + "rewards/chosen": 0.208984375, + "rewards/margins": 6.34375, + "rewards/rejected": -6.125, + "step": 1043 + }, + { + "epoch": 1.2809815950920245, + "grad_norm": 12.178117329974464, + "learning_rate": 2.8946280991735534e-07, + "logits/chosen": -0.287109375, + "logits/rejected": -0.494140625, + "logps/chosen": -424.0, + "logps/rejected": -356.0, + "loss": 0.0493, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 2.0, + "rewards/margins": 8.4375, + "rewards/rejected": -6.4375, + "step": 1044 + }, + { + "epoch": 1.2822085889570551, + "grad_norm": 13.08366669608441, + "learning_rate": 2.892561983471074e-07, + "logits/chosen": -0.32421875, + "logits/rejected": -0.59375, + "logps/chosen": -420.0, + "logps/rejected": -328.0, + "loss": 0.0543, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.6953125, + "rewards/margins": 7.96875, + "rewards/rejected": -6.28125, + "step": 1045 + }, + { + "epoch": 1.2834355828220858, + "grad_norm": 19.29936465122853, + "learning_rate": 2.890495867768595e-07, + "logits/chosen": -0.115234375, + "logits/rejected": -0.27734375, + "logps/chosen": -386.0, + "logps/rejected": -356.0, + "loss": 0.1057, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 1.0, + "rewards/margins": 6.75, + "rewards/rejected": -5.75, + "step": 1046 + }, + { + "epoch": 1.2846625766871167, + "grad_norm": 16.015818931768813, + "learning_rate": 2.8884297520661154e-07, + "logits/chosen": -0.265625, + "logits/rejected": -0.4140625, + "logps/chosen": -394.0, + "logps/rejected": -352.0, + "loss": 0.0711, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.5859375, + "rewards/margins": 7.90625, + "rewards/rejected": -6.34375, + "step": 1047 + }, + { + "epoch": 1.2858895705521474, + "grad_norm": 12.611193036980284, + "learning_rate": 2.8863636363636364e-07, + "logits/chosen": -0.1533203125, + "logits/rejected": -0.330078125, + "logps/chosen": -330.0, + "logps/rejected": -304.0, + "loss": 0.0705, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.2578125, + "rewards/margins": 7.6875, + "rewards/rejected": -6.4375, + "step": 1048 + }, + { + "epoch": 1.287116564417178, + "grad_norm": 14.385515976740427, + "learning_rate": 2.884297520661157e-07, + "logits/chosen": -0.18359375, + "logits/rejected": -0.3984375, + "logps/chosen": -362.0, + "logps/rejected": -328.0, + "loss": 0.0691, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.91015625, + "rewards/margins": 7.21875, + "rewards/rejected": -6.28125, + "step": 1049 + }, + { + "epoch": 1.2883435582822087, + "grad_norm": 16.631519568519366, + "learning_rate": 2.882231404958678e-07, + "logits/chosen": -0.30859375, + "logits/rejected": -0.455078125, + "logps/chosen": -386.0, + "logps/rejected": -356.0, + "loss": 0.0921, + "rewards/accuracies": 0.953125, + "rewards/chosen": 0.96875, + "rewards/margins": 7.15625, + "rewards/rejected": -6.1875, + "step": 1050 + }, + { + "epoch": 1.2895705521472394, + "grad_norm": 15.4144123662566, + "learning_rate": 2.8801652892561983e-07, + "logits/chosen": -0.333984375, + "logits/rejected": -0.51953125, + "logps/chosen": -410.0, + "logps/rejected": -370.0, + "loss": 0.0648, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.75, + "rewards/margins": 8.375, + "rewards/rejected": -6.65625, + "step": 1051 + }, + { + "epoch": 1.29079754601227, + "grad_norm": 21.601063366385812, + "learning_rate": 2.8780991735537193e-07, + "logits/chosen": -0.2119140625, + "logits/rejected": -0.408203125, + "logps/chosen": -418.0, + "logps/rejected": -366.0, + "loss": 0.1128, + "rewards/accuracies": 0.9375, + "rewards/chosen": 1.1875, + "rewards/margins": 7.15625, + "rewards/rejected": -5.96875, + "step": 1052 + }, + { + "epoch": 1.2920245398773007, + "grad_norm": 18.628967903000756, + "learning_rate": 2.876033057851239e-07, + "logits/chosen": -0.158203125, + "logits/rejected": -0.369140625, + "logps/chosen": -354.0, + "logps/rejected": -318.0, + "loss": 0.0996, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 1.40625, + "rewards/margins": 7.625, + "rewards/rejected": -6.21875, + "step": 1053 + }, + { + "epoch": 1.2932515337423314, + "grad_norm": 11.62592979316013, + "learning_rate": 2.87396694214876e-07, + "logits/chosen": -0.197265625, + "logits/rejected": -0.40625, + "logps/chosen": -392.0, + "logps/rejected": -342.0, + "loss": 0.0605, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.3125, + "rewards/margins": 7.6875, + "rewards/rejected": -6.375, + "step": 1054 + }, + { + "epoch": 1.294478527607362, + "grad_norm": 16.65808895304812, + "learning_rate": 2.8719008264462807e-07, + "logits/chosen": -0.185546875, + "logits/rejected": -0.3828125, + "logps/chosen": -376.0, + "logps/rejected": -336.0, + "loss": 0.0868, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.9765625, + "rewards/margins": 7.65625, + "rewards/rejected": -6.6875, + "step": 1055 + }, + { + "epoch": 1.2957055214723927, + "grad_norm": 8.318848313861306, + "learning_rate": 2.8698347107438017e-07, + "logits/chosen": -0.2412109375, + "logits/rejected": -0.412109375, + "logps/chosen": -360.0, + "logps/rejected": -302.0, + "loss": 0.0404, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.91796875, + "rewards/margins": 7.46875, + "rewards/rejected": -6.5625, + "step": 1056 + }, + { + "epoch": 1.2969325153374234, + "grad_norm": 20.372483964393826, + "learning_rate": 2.867768595041322e-07, + "logits/chosen": -0.212890625, + "logits/rejected": -0.37109375, + "logps/chosen": -394.0, + "logps/rejected": -346.0, + "loss": 0.0739, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.2890625, + "rewards/margins": 7.75, + "rewards/rejected": -6.46875, + "step": 1057 + }, + { + "epoch": 1.298159509202454, + "grad_norm": 22.76896229782817, + "learning_rate": 2.8657024793388427e-07, + "logits/chosen": -0.2119140625, + "logits/rejected": -0.44140625, + "logps/chosen": -380.0, + "logps/rejected": -340.0, + "loss": 0.1133, + "rewards/accuracies": 0.953125, + "rewards/chosen": 1.6796875, + "rewards/margins": 8.4375, + "rewards/rejected": -6.75, + "step": 1058 + }, + { + "epoch": 1.2993865030674847, + "grad_norm": 23.092465525495328, + "learning_rate": 2.8636363636363637e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.4609375, + "logps/chosen": -402.0, + "logps/rejected": -336.0, + "loss": 0.0802, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.0, + "rewards/margins": 7.84375, + "rewards/rejected": -6.84375, + "step": 1059 + }, + { + "epoch": 1.3006134969325154, + "grad_norm": 18.50595727262762, + "learning_rate": 2.861570247933884e-07, + "logits/chosen": -0.25390625, + "logits/rejected": -0.341796875, + "logps/chosen": -332.0, + "logps/rejected": -310.0, + "loss": 0.0911, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.0234375, + "rewards/margins": 7.8125, + "rewards/rejected": -6.78125, + "step": 1060 + }, + { + "epoch": 1.301840490797546, + "grad_norm": 15.212444109293378, + "learning_rate": 2.859504132231405e-07, + "logits/chosen": -0.181640625, + "logits/rejected": -0.29296875, + "logps/chosen": -336.0, + "logps/rejected": -328.0, + "loss": 0.0736, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.70703125, + "rewards/margins": 7.0625, + "rewards/rejected": -6.34375, + "step": 1061 + }, + { + "epoch": 1.3030674846625767, + "grad_norm": 19.43583503636694, + "learning_rate": 2.857438016528925e-07, + "logits/chosen": -0.2119140625, + "logits/rejected": -0.36328125, + "logps/chosen": -416.0, + "logps/rejected": -372.0, + "loss": 0.1117, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 1.0625, + "rewards/margins": 7.25, + "rewards/rejected": -6.1875, + "step": 1062 + }, + { + "epoch": 1.3042944785276074, + "grad_norm": 12.816250342771644, + "learning_rate": 2.855371900826446e-07, + "logits/chosen": -0.26171875, + "logits/rejected": -0.404296875, + "logps/chosen": -360.0, + "logps/rejected": -324.0, + "loss": 0.0701, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.69921875, + "rewards/margins": 7.5625, + "rewards/rejected": -6.84375, + "step": 1063 + }, + { + "epoch": 1.305521472392638, + "grad_norm": 14.796412099773818, + "learning_rate": 2.8533057851239665e-07, + "logits/chosen": -0.2412109375, + "logits/rejected": -0.40234375, + "logps/chosen": -378.0, + "logps/rejected": -350.0, + "loss": 0.0798, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.91015625, + "rewards/margins": 8.125, + "rewards/rejected": -7.21875, + "step": 1064 + }, + { + "epoch": 1.3067484662576687, + "grad_norm": 14.143994241356145, + "learning_rate": 2.8512396694214875e-07, + "logits/chosen": -0.2041015625, + "logits/rejected": -0.5078125, + "logps/chosen": -444.0, + "logps/rejected": -360.0, + "loss": 0.0782, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.6796875, + "rewards/margins": 8.875, + "rewards/rejected": -7.21875, + "step": 1065 + }, + { + "epoch": 1.3079754601226994, + "grad_norm": 15.85506994990649, + "learning_rate": 2.849173553719008e-07, + "logits/chosen": -0.2392578125, + "logits/rejected": -0.5234375, + "logps/chosen": -454.0, + "logps/rejected": -386.0, + "loss": 0.0781, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.3125, + "rewards/margins": 8.0625, + "rewards/rejected": -6.75, + "step": 1066 + }, + { + "epoch": 1.30920245398773, + "grad_norm": 13.62123954847692, + "learning_rate": 2.847107438016529e-07, + "logits/chosen": -0.26171875, + "logits/rejected": -0.392578125, + "logps/chosen": -368.0, + "logps/rejected": -350.0, + "loss": 0.086, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.49609375, + "rewards/margins": 7.03125, + "rewards/rejected": -6.53125, + "step": 1067 + }, + { + "epoch": 1.3104294478527607, + "grad_norm": 16.720057778390732, + "learning_rate": 2.8450413223140495e-07, + "logits/chosen": -0.265625, + "logits/rejected": -0.42578125, + "logps/chosen": -380.0, + "logps/rejected": -328.0, + "loss": 0.0893, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.09375, + "rewards/margins": 8.25, + "rewards/rejected": -7.15625, + "step": 1068 + }, + { + "epoch": 1.3116564417177914, + "grad_norm": 17.159411502835123, + "learning_rate": 2.8429752066115705e-07, + "logits/chosen": -0.19140625, + "logits/rejected": -0.421875, + "logps/chosen": -398.0, + "logps/rejected": -362.0, + "loss": 0.1008, + "rewards/accuracies": 0.9453125, + "rewards/chosen": 1.296875, + "rewards/margins": 7.625, + "rewards/rejected": -6.3125, + "step": 1069 + }, + { + "epoch": 1.312883435582822, + "grad_norm": 17.45779899604935, + "learning_rate": 2.840909090909091e-07, + "logits/chosen": -0.283203125, + "logits/rejected": -0.37109375, + "logps/chosen": -382.0, + "logps/rejected": -364.0, + "loss": 0.0766, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.34375, + "rewards/margins": 8.375, + "rewards/rejected": -7.0625, + "step": 1070 + }, + { + "epoch": 1.3141104294478527, + "grad_norm": 15.676397684653205, + "learning_rate": 2.8388429752066114e-07, + "logits/chosen": -0.3046875, + "logits/rejected": -0.498046875, + "logps/chosen": -386.0, + "logps/rejected": -352.0, + "loss": 0.0656, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.0703125, + "rewards/margins": 8.1875, + "rewards/rejected": -7.09375, + "step": 1071 + }, + { + "epoch": 1.3153374233128834, + "grad_norm": 12.108483614150211, + "learning_rate": 2.836776859504132e-07, + "logits/chosen": -0.1396484375, + "logits/rejected": -0.330078125, + "logps/chosen": -404.0, + "logps/rejected": -358.0, + "loss": 0.0589, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.078125, + "rewards/margins": 7.65625, + "rewards/rejected": -6.5625, + "step": 1072 + }, + { + "epoch": 1.316564417177914, + "grad_norm": 17.663822788808194, + "learning_rate": 2.834710743801653e-07, + "logits/chosen": -0.30859375, + "logits/rejected": -0.416015625, + "logps/chosen": -326.0, + "logps/rejected": -338.0, + "loss": 0.0994, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.39453125, + "rewards/margins": 7.1875, + "rewards/rejected": -6.78125, + "step": 1073 + }, + { + "epoch": 1.3177914110429447, + "grad_norm": 12.23423129536633, + "learning_rate": 2.8326446280991734e-07, + "logits/chosen": -0.302734375, + "logits/rejected": -0.427734375, + "logps/chosen": -384.0, + "logps/rejected": -348.0, + "loss": 0.0617, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.9609375, + "rewards/margins": 8.1875, + "rewards/rejected": -7.1875, + "step": 1074 + }, + { + "epoch": 1.3190184049079754, + "grad_norm": 16.0651907118645, + "learning_rate": 2.830578512396694e-07, + "logits/chosen": -0.1806640625, + "logits/rejected": -0.337890625, + "logps/chosen": -390.0, + "logps/rejected": -354.0, + "loss": 0.0828, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.99609375, + "rewards/margins": 7.71875, + "rewards/rejected": -6.71875, + "step": 1075 + }, + { + "epoch": 1.320245398773006, + "grad_norm": 16.986198964127013, + "learning_rate": 2.828512396694215e-07, + "logits/chosen": -0.1552734375, + "logits/rejected": -0.271484375, + "logps/chosen": -394.0, + "logps/rejected": -356.0, + "loss": 0.0931, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.90234375, + "rewards/margins": 7.90625, + "rewards/rejected": -7.0, + "step": 1076 + }, + { + "epoch": 1.3214723926380367, + "grad_norm": 14.837289168347336, + "learning_rate": 2.8264462809917353e-07, + "logits/chosen": -0.318359375, + "logits/rejected": -0.443359375, + "logps/chosen": -294.0, + "logps/rejected": -278.0, + "loss": 0.087, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.404296875, + "rewards/margins": 7.28125, + "rewards/rejected": -6.875, + "step": 1077 + }, + { + "epoch": 1.3226993865030674, + "grad_norm": 15.748715981822883, + "learning_rate": 2.8243801652892563e-07, + "logits/chosen": -0.1845703125, + "logits/rejected": -0.306640625, + "logps/chosen": -378.0, + "logps/rejected": -360.0, + "loss": 0.0928, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.310546875, + "rewards/margins": 6.5, + "rewards/rejected": -6.1875, + "step": 1078 + }, + { + "epoch": 1.323926380368098, + "grad_norm": 26.67132050370277, + "learning_rate": 2.822314049586777e-07, + "logits/chosen": -0.2373046875, + "logits/rejected": -0.37890625, + "logps/chosen": -380.0, + "logps/rejected": -342.0, + "loss": 0.1287, + "rewards/accuracies": 0.9453125, + "rewards/chosen": 0.6484375, + "rewards/margins": 7.65625, + "rewards/rejected": -7.0, + "step": 1079 + }, + { + "epoch": 1.3251533742331287, + "grad_norm": 16.52196279474381, + "learning_rate": 2.820247933884297e-07, + "logits/chosen": -0.19921875, + "logits/rejected": -0.38671875, + "logps/chosen": -358.0, + "logps/rejected": -318.0, + "loss": 0.0898, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.7890625, + "rewards/margins": 6.875, + "rewards/rejected": -6.09375, + "step": 1080 + }, + { + "epoch": 1.3263803680981594, + "grad_norm": 11.9304192784209, + "learning_rate": 2.8181818181818177e-07, + "logits/chosen": -0.212890625, + "logits/rejected": -0.376953125, + "logps/chosen": -384.0, + "logps/rejected": -356.0, + "loss": 0.0661, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.9375, + "rewards/margins": 7.5625, + "rewards/rejected": -6.59375, + "step": 1081 + }, + { + "epoch": 1.32760736196319, + "grad_norm": 15.42217278518539, + "learning_rate": 2.8161157024793387e-07, + "logits/chosen": -0.306640625, + "logits/rejected": -0.5390625, + "logps/chosen": -402.0, + "logps/rejected": -326.0, + "loss": 0.0777, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.28125, + "rewards/margins": 7.40625, + "rewards/rejected": -6.125, + "step": 1082 + }, + { + "epoch": 1.3288343558282207, + "grad_norm": 16.615035353035292, + "learning_rate": 2.814049586776859e-07, + "logits/chosen": -0.2294921875, + "logits/rejected": -0.404296875, + "logps/chosen": -364.0, + "logps/rejected": -290.0, + "loss": 0.0902, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.5859375, + "rewards/margins": 6.8125, + "rewards/rejected": -6.21875, + "step": 1083 + }, + { + "epoch": 1.3300613496932514, + "grad_norm": 18.67529878981988, + "learning_rate": 2.81198347107438e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.298828125, + "logps/chosen": -350.0, + "logps/rejected": -318.0, + "loss": 0.094, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.64453125, + "rewards/margins": 6.75, + "rewards/rejected": -6.125, + "step": 1084 + }, + { + "epoch": 1.331288343558282, + "grad_norm": 19.923297358605808, + "learning_rate": 2.8099173553719007e-07, + "logits/chosen": -0.1494140625, + "logits/rejected": -0.30859375, + "logps/chosen": -380.0, + "logps/rejected": -334.0, + "loss": 0.0916, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.55078125, + "rewards/margins": 6.5625, + "rewards/rejected": -6.03125, + "step": 1085 + }, + { + "epoch": 1.332515337423313, + "grad_norm": 12.719879576598444, + "learning_rate": 2.8078512396694217e-07, + "logits/chosen": -0.197265625, + "logits/rejected": -0.341796875, + "logps/chosen": -310.0, + "logps/rejected": -306.0, + "loss": 0.0792, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.109375, + "rewards/margins": 7.59375, + "rewards/rejected": -6.5, + "step": 1086 + }, + { + "epoch": 1.3337423312883436, + "grad_norm": 16.660755125940913, + "learning_rate": 2.805785123966942e-07, + "logits/chosen": -0.3046875, + "logits/rejected": -0.44140625, + "logps/chosen": -314.0, + "logps/rejected": -332.0, + "loss": 0.081, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.5234375, + "rewards/margins": 6.84375, + "rewards/rejected": -6.3125, + "step": 1087 + }, + { + "epoch": 1.3349693251533743, + "grad_norm": 15.537632785066593, + "learning_rate": 2.803719008264463e-07, + "logits/chosen": -0.2333984375, + "logits/rejected": -0.466796875, + "logps/chosen": -436.0, + "logps/rejected": -336.0, + "loss": 0.0702, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.6875, + "rewards/margins": 7.96875, + "rewards/rejected": -6.28125, + "step": 1088 + }, + { + "epoch": 1.336196319018405, + "grad_norm": 17.61332382580409, + "learning_rate": 2.801652892561983e-07, + "logits/chosen": -0.302734375, + "logits/rejected": -0.451171875, + "logps/chosen": -382.0, + "logps/rejected": -316.0, + "loss": 0.1028, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.318359375, + "rewards/margins": 6.4375, + "rewards/rejected": -6.125, + "step": 1089 + }, + { + "epoch": 1.3374233128834356, + "grad_norm": 15.012547711078769, + "learning_rate": 2.799586776859504e-07, + "logits/chosen": -0.2412109375, + "logits/rejected": -0.431640625, + "logps/chosen": -366.0, + "logps/rejected": -308.0, + "loss": 0.0864, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.57421875, + "rewards/margins": 6.4375, + "rewards/rejected": -5.84375, + "step": 1090 + }, + { + "epoch": 1.3386503067484663, + "grad_norm": 14.453631493657062, + "learning_rate": 2.7975206611570245e-07, + "logits/chosen": -0.109375, + "logits/rejected": -0.279296875, + "logps/chosen": -412.0, + "logps/rejected": -324.0, + "loss": 0.0722, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.3046875, + "rewards/margins": 6.875, + "rewards/rejected": -5.5625, + "step": 1091 + }, + { + "epoch": 1.339877300613497, + "grad_norm": 16.027659103702746, + "learning_rate": 2.7954545454545455e-07, + "logits/chosen": -0.255859375, + "logits/rejected": -0.43359375, + "logps/chosen": -410.0, + "logps/rejected": -352.0, + "loss": 0.0909, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.0390625, + "rewards/margins": 6.6875, + "rewards/rejected": -5.65625, + "step": 1092 + }, + { + "epoch": 1.3411042944785276, + "grad_norm": 13.31742764236003, + "learning_rate": 2.793388429752066e-07, + "logits/chosen": -0.30078125, + "logits/rejected": -0.451171875, + "logps/chosen": -370.0, + "logps/rejected": -332.0, + "loss": 0.0782, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.0390625, + "rewards/margins": 6.96875, + "rewards/rejected": -5.9375, + "step": 1093 + }, + { + "epoch": 1.3423312883435583, + "grad_norm": 18.493341209635503, + "learning_rate": 2.7913223140495865e-07, + "logits/chosen": -0.205078125, + "logits/rejected": -0.431640625, + "logps/chosen": -420.0, + "logps/rejected": -378.0, + "loss": 0.0905, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.3046875, + "rewards/margins": 7.40625, + "rewards/rejected": -6.09375, + "step": 1094 + }, + { + "epoch": 1.343558282208589, + "grad_norm": 14.360235804951863, + "learning_rate": 2.7892561983471075e-07, + "logits/chosen": -0.2421875, + "logits/rejected": -0.4609375, + "logps/chosen": -440.0, + "logps/rejected": -382.0, + "loss": 0.0711, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.59375, + "rewards/margins": 8.375, + "rewards/rejected": -6.78125, + "step": 1095 + }, + { + "epoch": 1.3447852760736196, + "grad_norm": 15.89838040182383, + "learning_rate": 2.787190082644628e-07, + "logits/chosen": -0.265625, + "logits/rejected": -0.392578125, + "logps/chosen": -374.0, + "logps/rejected": -336.0, + "loss": 0.0858, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.8359375, + "rewards/margins": 6.875, + "rewards/rejected": -6.03125, + "step": 1096 + }, + { + "epoch": 1.3460122699386503, + "grad_norm": 12.277559133859164, + "learning_rate": 2.785123966942149e-07, + "logits/chosen": -0.220703125, + "logits/rejected": -0.396484375, + "logps/chosen": -422.0, + "logps/rejected": -342.0, + "loss": 0.0621, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.5234375, + "rewards/margins": 7.71875, + "rewards/rejected": -6.21875, + "step": 1097 + }, + { + "epoch": 1.347239263803681, + "grad_norm": 26.913077449861195, + "learning_rate": 2.783057851239669e-07, + "logits/chosen": -0.1435546875, + "logits/rejected": -0.3046875, + "logps/chosen": -358.0, + "logps/rejected": -346.0, + "loss": 0.081, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.90234375, + "rewards/margins": 7.65625, + "rewards/rejected": -6.75, + "step": 1098 + }, + { + "epoch": 1.3484662576687116, + "grad_norm": 19.093176064131004, + "learning_rate": 2.78099173553719e-07, + "logits/chosen": -0.234375, + "logits/rejected": -0.3515625, + "logps/chosen": -346.0, + "logps/rejected": -308.0, + "loss": 0.1079, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.59375, + "rewards/margins": 6.875, + "rewards/rejected": -6.28125, + "step": 1099 + }, + { + "epoch": 1.3496932515337423, + "grad_norm": 17.3921589049849, + "learning_rate": 2.7789256198347104e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.50390625, + "logps/chosen": -398.0, + "logps/rejected": -338.0, + "loss": 0.0758, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 1.7265625, + "rewards/margins": 8.0625, + "rewards/rejected": -6.34375, + "step": 1100 + }, + { + "epoch": 1.350920245398773, + "grad_norm": 17.70822693943753, + "learning_rate": 2.7768595041322314e-07, + "logits/chosen": -0.103515625, + "logits/rejected": -0.25390625, + "logps/chosen": -364.0, + "logps/rejected": -312.0, + "loss": 0.0898, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 1.15625, + "rewards/margins": 7.875, + "rewards/rejected": -6.71875, + "step": 1101 + }, + { + "epoch": 1.3521472392638036, + "grad_norm": 18.440230518028116, + "learning_rate": 2.774793388429752e-07, + "logits/chosen": -0.34765625, + "logits/rejected": -0.53515625, + "logps/chosen": -364.0, + "logps/rejected": -316.0, + "loss": 0.0935, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.328125, + "rewards/margins": 8.8125, + "rewards/rejected": -7.5, + "step": 1102 + }, + { + "epoch": 1.3533742331288343, + "grad_norm": 15.786633933772746, + "learning_rate": 2.772727272727273e-07, + "logits/chosen": -0.234375, + "logits/rejected": -0.40625, + "logps/chosen": -408.0, + "logps/rejected": -364.0, + "loss": 0.0848, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.1640625, + "rewards/margins": 8.0, + "rewards/rejected": -6.84375, + "step": 1103 + }, + { + "epoch": 1.354601226993865, + "grad_norm": 17.82967274558328, + "learning_rate": 2.7706611570247933e-07, + "logits/chosen": -0.19921875, + "logits/rejected": -0.359375, + "logps/chosen": -360.0, + "logps/rejected": -340.0, + "loss": 0.0933, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.88671875, + "rewards/margins": 7.46875, + "rewards/rejected": -6.59375, + "step": 1104 + }, + { + "epoch": 1.3558282208588956, + "grad_norm": 11.130338946372557, + "learning_rate": 2.7685950413223143e-07, + "logits/chosen": -0.32421875, + "logits/rejected": -0.4765625, + "logps/chosen": -402.0, + "logps/rejected": -382.0, + "loss": 0.0514, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.5859375, + "rewards/margins": 8.5625, + "rewards/rejected": -7.0, + "step": 1105 + }, + { + "epoch": 1.3570552147239263, + "grad_norm": 11.689817724949007, + "learning_rate": 2.766528925619834e-07, + "logits/chosen": -0.26953125, + "logits/rejected": -0.396484375, + "logps/chosen": -354.0, + "logps/rejected": -340.0, + "loss": 0.0631, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.796875, + "rewards/margins": 7.75, + "rewards/rejected": -6.9375, + "step": 1106 + }, + { + "epoch": 1.358282208588957, + "grad_norm": 15.958738681042732, + "learning_rate": 2.764462809917355e-07, + "logits/chosen": -0.12109375, + "logits/rejected": -0.2412109375, + "logps/chosen": -400.0, + "logps/rejected": -338.0, + "loss": 0.0807, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.0234375, + "rewards/margins": 6.9375, + "rewards/rejected": -5.90625, + "step": 1107 + }, + { + "epoch": 1.3595092024539877, + "grad_norm": 12.502398297022388, + "learning_rate": 2.7623966942148757e-07, + "logits/chosen": -0.283203125, + "logits/rejected": -0.474609375, + "logps/chosen": -438.0, + "logps/rejected": -360.0, + "loss": 0.0581, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.5078125, + "rewards/margins": 8.25, + "rewards/rejected": -6.75, + "step": 1108 + }, + { + "epoch": 1.3607361963190185, + "grad_norm": 14.732093704212398, + "learning_rate": 2.7603305785123967e-07, + "logits/chosen": -0.18359375, + "logits/rejected": -0.328125, + "logps/chosen": -396.0, + "logps/rejected": -346.0, + "loss": 0.0874, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.9609375, + "rewards/margins": 7.1875, + "rewards/rejected": -6.21875, + "step": 1109 + }, + { + "epoch": 1.3619631901840492, + "grad_norm": 20.436311156032623, + "learning_rate": 2.758264462809917e-07, + "logits/chosen": -0.2275390625, + "logits/rejected": -0.44921875, + "logps/chosen": -390.0, + "logps/rejected": -354.0, + "loss": 0.1082, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.1875, + "rewards/margins": 8.25, + "rewards/rejected": -7.0625, + "step": 1110 + }, + { + "epoch": 1.3631901840490799, + "grad_norm": 12.01466991945363, + "learning_rate": 2.7561983471074377e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.439453125, + "logps/chosen": -426.0, + "logps/rejected": -342.0, + "loss": 0.0617, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.2265625, + "rewards/margins": 7.875, + "rewards/rejected": -6.65625, + "step": 1111 + }, + { + "epoch": 1.3644171779141105, + "grad_norm": 16.38298802503656, + "learning_rate": 2.7541322314049587e-07, + "logits/chosen": -0.2490234375, + "logits/rejected": -0.365234375, + "logps/chosen": -410.0, + "logps/rejected": -368.0, + "loss": 0.0922, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.1328125, + "rewards/margins": 8.0625, + "rewards/rejected": -6.9375, + "step": 1112 + }, + { + "epoch": 1.3656441717791412, + "grad_norm": 15.977995491223554, + "learning_rate": 2.752066115702479e-07, + "logits/chosen": -0.228515625, + "logits/rejected": -0.3046875, + "logps/chosen": -348.0, + "logps/rejected": -324.0, + "loss": 0.0863, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.0859375, + "rewards/margins": 7.46875, + "rewards/rejected": -6.375, + "step": 1113 + }, + { + "epoch": 1.3668711656441719, + "grad_norm": 16.054507566467127, + "learning_rate": 2.75e-07, + "logits/chosen": -0.353515625, + "logits/rejected": -0.478515625, + "logps/chosen": -332.0, + "logps/rejected": -320.0, + "loss": 0.0797, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.65625, + "rewards/margins": 7.5, + "rewards/rejected": -6.84375, + "step": 1114 + }, + { + "epoch": 1.3680981595092025, + "grad_norm": 14.493487564338034, + "learning_rate": 2.74793388429752e-07, + "logits/chosen": -0.240234375, + "logits/rejected": -0.361328125, + "logps/chosen": -366.0, + "logps/rejected": -328.0, + "loss": 0.0776, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.203125, + "rewards/margins": 8.125, + "rewards/rejected": -6.9375, + "step": 1115 + }, + { + "epoch": 1.3693251533742332, + "grad_norm": 17.69630041701769, + "learning_rate": 2.745867768595041e-07, + "logits/chosen": -0.1875, + "logits/rejected": -0.361328125, + "logps/chosen": -424.0, + "logps/rejected": -356.0, + "loss": 0.1058, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.7890625, + "rewards/margins": 7.875, + "rewards/rejected": -7.09375, + "step": 1116 + }, + { + "epoch": 1.3705521472392639, + "grad_norm": 13.956815596160988, + "learning_rate": 2.7438016528925616e-07, + "logits/chosen": -0.349609375, + "logits/rejected": -0.56640625, + "logps/chosen": -426.0, + "logps/rejected": -356.0, + "loss": 0.0753, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.46875, + "rewards/margins": 8.375, + "rewards/rejected": -6.875, + "step": 1117 + }, + { + "epoch": 1.3717791411042946, + "grad_norm": 15.311936746066133, + "learning_rate": 2.7417355371900826e-07, + "logits/chosen": -0.169921875, + "logits/rejected": -0.34765625, + "logps/chosen": -370.0, + "logps/rejected": -342.0, + "loss": 0.0839, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.671875, + "rewards/margins": 7.5625, + "rewards/rejected": -6.875, + "step": 1118 + }, + { + "epoch": 1.3730061349693252, + "grad_norm": 14.325217913116607, + "learning_rate": 2.739669421487603e-07, + "logits/chosen": -0.25390625, + "logits/rejected": -0.43359375, + "logps/chosen": -416.0, + "logps/rejected": -374.0, + "loss": 0.0861, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.66015625, + "rewards/margins": 7.03125, + "rewards/rejected": -6.375, + "step": 1119 + }, + { + "epoch": 1.3742331288343559, + "grad_norm": 14.194798538739338, + "learning_rate": 2.737603305785124e-07, + "logits/chosen": -0.1962890625, + "logits/rejected": -0.48828125, + "logps/chosen": -420.0, + "logps/rejected": -354.0, + "loss": 0.0632, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.578125, + "rewards/margins": 8.5625, + "rewards/rejected": -7.0, + "step": 1120 + }, + { + "epoch": 1.3754601226993866, + "grad_norm": 18.066145170833295, + "learning_rate": 2.7355371900826445e-07, + "logits/chosen": -0.30078125, + "logits/rejected": -0.4609375, + "logps/chosen": -432.0, + "logps/rejected": -362.0, + "loss": 0.0807, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.265625, + "rewards/margins": 8.0625, + "rewards/rejected": -6.8125, + "step": 1121 + }, + { + "epoch": 1.3766871165644172, + "grad_norm": 17.029232082474003, + "learning_rate": 2.7334710743801655e-07, + "logits/chosen": -0.306640625, + "logits/rejected": -0.44921875, + "logps/chosen": -354.0, + "logps/rejected": -330.0, + "loss": 0.0792, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.625, + "rewards/margins": 7.5625, + "rewards/rejected": -6.9375, + "step": 1122 + }, + { + "epoch": 1.377914110429448, + "grad_norm": 12.415264260772052, + "learning_rate": 2.731404958677686e-07, + "logits/chosen": -0.3125, + "logits/rejected": -0.45703125, + "logps/chosen": -434.0, + "logps/rejected": -338.0, + "loss": 0.0576, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.5859375, + "rewards/margins": 7.46875, + "rewards/rejected": -6.875, + "step": 1123 + }, + { + "epoch": 1.3791411042944786, + "grad_norm": 14.512699990097783, + "learning_rate": 2.7293388429752064e-07, + "logits/chosen": -0.236328125, + "logits/rejected": -0.423828125, + "logps/chosen": -386.0, + "logps/rejected": -324.0, + "loss": 0.0672, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.6953125, + "rewards/margins": 7.90625, + "rewards/rejected": -7.21875, + "step": 1124 + }, + { + "epoch": 1.3803680981595092, + "grad_norm": 15.05560400209906, + "learning_rate": 2.727272727272727e-07, + "logits/chosen": -0.28515625, + "logits/rejected": -0.439453125, + "logps/chosen": -374.0, + "logps/rejected": -338.0, + "loss": 0.0747, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.60546875, + "rewards/margins": 7.59375, + "rewards/rejected": -7.0, + "step": 1125 + }, + { + "epoch": 1.38159509202454, + "grad_norm": 14.244726486989682, + "learning_rate": 2.725206611570248e-07, + "logits/chosen": -0.287109375, + "logits/rejected": -0.4296875, + "logps/chosen": -368.0, + "logps/rejected": -322.0, + "loss": 0.0697, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.625, + "rewards/margins": 7.71875, + "rewards/rejected": -7.09375, + "step": 1126 + }, + { + "epoch": 1.3828220858895706, + "grad_norm": 13.540727443409526, + "learning_rate": 2.7231404958677684e-07, + "logits/chosen": -0.251953125, + "logits/rejected": -0.46875, + "logps/chosen": -440.0, + "logps/rejected": -388.0, + "loss": 0.0749, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.7109375, + "rewards/margins": 8.3125, + "rewards/rejected": -6.625, + "step": 1127 + }, + { + "epoch": 1.3840490797546012, + "grad_norm": 21.310670024436575, + "learning_rate": 2.7210743801652894e-07, + "logits/chosen": -0.2275390625, + "logits/rejected": -0.388671875, + "logps/chosen": -386.0, + "logps/rejected": -370.0, + "loss": 0.1186, + "rewards/accuracies": 0.953125, + "rewards/chosen": 0.458984375, + "rewards/margins": 6.78125, + "rewards/rejected": -6.3125, + "step": 1128 + }, + { + "epoch": 1.385276073619632, + "grad_norm": 17.299094092120104, + "learning_rate": 2.71900826446281e-07, + "logits/chosen": -0.126953125, + "logits/rejected": -0.2734375, + "logps/chosen": -390.0, + "logps/rejected": -326.0, + "loss": 0.0919, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.8828125, + "rewards/margins": 7.28125, + "rewards/rejected": -6.375, + "step": 1129 + }, + { + "epoch": 1.3865030674846626, + "grad_norm": 20.282969965629707, + "learning_rate": 2.7169421487603303e-07, + "logits/chosen": -0.0810546875, + "logits/rejected": -0.298828125, + "logps/chosen": -424.0, + "logps/rejected": -366.0, + "loss": 0.0815, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.0703125, + "rewards/margins": 7.78125, + "rewards/rejected": -6.6875, + "step": 1130 + }, + { + "epoch": 1.3877300613496932, + "grad_norm": 13.65004266527284, + "learning_rate": 2.7148760330578513e-07, + "logits/chosen": -0.30078125, + "logits/rejected": -0.5859375, + "logps/chosen": -420.0, + "logps/rejected": -358.0, + "loss": 0.0672, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.375, + "rewards/margins": 8.1875, + "rewards/rejected": -6.78125, + "step": 1131 + }, + { + "epoch": 1.388957055214724, + "grad_norm": 13.258170271906867, + "learning_rate": 2.712809917355372e-07, + "logits/chosen": -0.2314453125, + "logits/rejected": -0.4609375, + "logps/chosen": -486.0, + "logps/rejected": -370.0, + "loss": 0.0658, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.6328125, + "rewards/margins": 8.125, + "rewards/rejected": -6.46875, + "step": 1132 + }, + { + "epoch": 1.3901840490797546, + "grad_norm": 13.406314215306635, + "learning_rate": 2.710743801652892e-07, + "logits/chosen": -0.291015625, + "logits/rejected": -0.44140625, + "logps/chosen": -400.0, + "logps/rejected": -368.0, + "loss": 0.0674, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.6171875, + "rewards/margins": 8.5, + "rewards/rejected": -6.875, + "step": 1133 + }, + { + "epoch": 1.3914110429447852, + "grad_norm": 13.063750705274053, + "learning_rate": 2.7086776859504127e-07, + "logits/chosen": -0.267578125, + "logits/rejected": -0.470703125, + "logps/chosen": -316.0, + "logps/rejected": -302.0, + "loss": 0.0733, + "rewards/accuracies": 0.9765625, + "rewards/chosen": -0.0189208984375, + "rewards/margins": 7.15625, + "rewards/rejected": -7.1875, + "step": 1134 + }, + { + "epoch": 1.392638036809816, + "grad_norm": 13.108269516670116, + "learning_rate": 2.706611570247934e-07, + "logits/chosen": -0.2275390625, + "logits/rejected": -0.4296875, + "logps/chosen": -400.0, + "logps/rejected": -334.0, + "loss": 0.0781, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.671875, + "rewards/margins": 8.5, + "rewards/rejected": -6.84375, + "step": 1135 + }, + { + "epoch": 1.3938650306748466, + "grad_norm": 18.053221271259833, + "learning_rate": 2.704545454545454e-07, + "logits/chosen": -0.3515625, + "logits/rejected": -0.50390625, + "logps/chosen": -458.0, + "logps/rejected": -370.0, + "loss": 0.0755, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.84375, + "rewards/margins": 9.0, + "rewards/rejected": -7.125, + "step": 1136 + }, + { + "epoch": 1.3950920245398772, + "grad_norm": 15.735878516417994, + "learning_rate": 2.702479338842975e-07, + "logits/chosen": -0.298828125, + "logits/rejected": -0.546875, + "logps/chosen": -458.0, + "logps/rejected": -368.0, + "loss": 0.0725, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.2421875, + "rewards/margins": 7.9375, + "rewards/rejected": -6.6875, + "step": 1137 + }, + { + "epoch": 1.396319018404908, + "grad_norm": 13.44163977525519, + "learning_rate": 2.7004132231404957e-07, + "logits/chosen": -0.1474609375, + "logits/rejected": -0.33984375, + "logps/chosen": -376.0, + "logps/rejected": -318.0, + "loss": 0.0605, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.9609375, + "rewards/margins": 7.0625, + "rewards/rejected": -6.09375, + "step": 1138 + }, + { + "epoch": 1.3975460122699386, + "grad_norm": 13.088415049011786, + "learning_rate": 2.6983471074380167e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.490234375, + "logps/chosen": -354.0, + "logps/rejected": -328.0, + "loss": 0.0687, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.96484375, + "rewards/margins": 7.84375, + "rewards/rejected": -6.875, + "step": 1139 + }, + { + "epoch": 1.3987730061349692, + "grad_norm": 15.624993898414273, + "learning_rate": 2.696280991735537e-07, + "logits/chosen": -0.1953125, + "logits/rejected": -0.328125, + "logps/chosen": -342.0, + "logps/rejected": -318.0, + "loss": 0.0777, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.703125, + "rewards/margins": 7.46875, + "rewards/rejected": -6.78125, + "step": 1140 + }, + { + "epoch": 1.4, + "grad_norm": 14.631221037253876, + "learning_rate": 2.694214876033058e-07, + "logits/chosen": -0.26171875, + "logits/rejected": -0.482421875, + "logps/chosen": -348.0, + "logps/rejected": -320.0, + "loss": 0.0658, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.78125, + "rewards/margins": 7.40625, + "rewards/rejected": -6.625, + "step": 1141 + }, + { + "epoch": 1.4012269938650306, + "grad_norm": 17.16686852504746, + "learning_rate": 2.692148760330578e-07, + "logits/chosen": -0.173828125, + "logits/rejected": -0.314453125, + "logps/chosen": -342.0, + "logps/rejected": -344.0, + "loss": 0.0821, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.875, + "rewards/margins": 7.6875, + "rewards/rejected": -6.8125, + "step": 1142 + }, + { + "epoch": 1.4024539877300612, + "grad_norm": 15.863901461347753, + "learning_rate": 2.690082644628099e-07, + "logits/chosen": -0.236328125, + "logits/rejected": -0.349609375, + "logps/chosen": -386.0, + "logps/rejected": -372.0, + "loss": 0.077, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.484375, + "rewards/margins": 7.46875, + "rewards/rejected": -6.96875, + "step": 1143 + }, + { + "epoch": 1.403680981595092, + "grad_norm": 14.177016192612676, + "learning_rate": 2.6880165289256196e-07, + "logits/chosen": -0.33203125, + "logits/rejected": -0.478515625, + "logps/chosen": -384.0, + "logps/rejected": -348.0, + "loss": 0.0639, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.93359375, + "rewards/margins": 7.96875, + "rewards/rejected": -7.03125, + "step": 1144 + }, + { + "epoch": 1.4049079754601226, + "grad_norm": 17.157921881301142, + "learning_rate": 2.6859504132231406e-07, + "logits/chosen": -0.255859375, + "logits/rejected": -0.4375, + "logps/chosen": -450.0, + "logps/rejected": -388.0, + "loss": 0.0679, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.4609375, + "rewards/margins": 7.90625, + "rewards/rejected": -6.4375, + "step": 1145 + }, + { + "epoch": 1.4061349693251532, + "grad_norm": 18.72400211702753, + "learning_rate": 2.683884297520661e-07, + "logits/chosen": -0.15625, + "logits/rejected": -0.275390625, + "logps/chosen": -372.0, + "logps/rejected": -356.0, + "loss": 0.0928, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.48828125, + "rewards/margins": 7.6875, + "rewards/rejected": -7.1875, + "step": 1146 + }, + { + "epoch": 1.407361963190184, + "grad_norm": 11.861925828487959, + "learning_rate": 2.6818181818181815e-07, + "logits/chosen": -0.2353515625, + "logits/rejected": -0.4453125, + "logps/chosen": -384.0, + "logps/rejected": -342.0, + "loss": 0.0606, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.4140625, + "rewards/margins": 8.6875, + "rewards/rejected": -7.3125, + "step": 1147 + }, + { + "epoch": 1.4085889570552146, + "grad_norm": 12.265993155555183, + "learning_rate": 2.6797520661157025e-07, + "logits/chosen": -0.1884765625, + "logits/rejected": -0.33984375, + "logps/chosen": -364.0, + "logps/rejected": -338.0, + "loss": 0.0533, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.70703125, + "rewards/margins": 7.78125, + "rewards/rejected": -7.09375, + "step": 1148 + }, + { + "epoch": 1.4098159509202455, + "grad_norm": 10.14539124930049, + "learning_rate": 2.677685950413223e-07, + "logits/chosen": -0.24609375, + "logits/rejected": -0.41796875, + "logps/chosen": -376.0, + "logps/rejected": -356.0, + "loss": 0.0424, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.1015625, + "rewards/margins": 8.5, + "rewards/rejected": -7.40625, + "step": 1149 + }, + { + "epoch": 1.4110429447852761, + "grad_norm": 12.992658752871431, + "learning_rate": 2.675619834710744e-07, + "logits/chosen": -0.181640625, + "logits/rejected": -0.36328125, + "logps/chosen": -384.0, + "logps/rejected": -344.0, + "loss": 0.0697, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.52734375, + "rewards/margins": 7.4375, + "rewards/rejected": -6.90625, + "step": 1150 + }, + { + "epoch": 1.4122699386503068, + "grad_norm": 13.901447140858604, + "learning_rate": 2.673553719008264e-07, + "logits/chosen": -0.2236328125, + "logits/rejected": -0.431640625, + "logps/chosen": -380.0, + "logps/rejected": -358.0, + "loss": 0.0673, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.609375, + "rewards/margins": 7.625, + "rewards/rejected": -7.0, + "step": 1151 + }, + { + "epoch": 1.4134969325153375, + "grad_norm": 16.03760627616199, + "learning_rate": 2.671487603305785e-07, + "logits/chosen": -0.2890625, + "logits/rejected": -0.421875, + "logps/chosen": -414.0, + "logps/rejected": -390.0, + "loss": 0.0711, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.2265625, + "rewards/margins": 8.3125, + "rewards/rejected": -7.09375, + "step": 1152 + }, + { + "epoch": 1.4147239263803681, + "grad_norm": 14.903157934315074, + "learning_rate": 2.6694214876033054e-07, + "logits/chosen": -0.228515625, + "logits/rejected": -0.3828125, + "logps/chosen": -396.0, + "logps/rejected": -368.0, + "loss": 0.0772, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.328125, + "rewards/margins": 8.5, + "rewards/rejected": -7.1875, + "step": 1153 + }, + { + "epoch": 1.4159509202453988, + "grad_norm": 17.0296200958866, + "learning_rate": 2.6673553719008264e-07, + "logits/chosen": -0.294921875, + "logits/rejected": -0.470703125, + "logps/chosen": -440.0, + "logps/rejected": -374.0, + "loss": 0.073, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.3359375, + "rewards/margins": 8.5625, + "rewards/rejected": -7.25, + "step": 1154 + }, + { + "epoch": 1.4171779141104295, + "grad_norm": 12.761372619608526, + "learning_rate": 2.665289256198347e-07, + "logits/chosen": -0.28515625, + "logits/rejected": -0.412109375, + "logps/chosen": -374.0, + "logps/rejected": -346.0, + "loss": 0.0755, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.349609375, + "rewards/margins": 7.34375, + "rewards/rejected": -7.0, + "step": 1155 + }, + { + "epoch": 1.4184049079754601, + "grad_norm": 19.770669770107013, + "learning_rate": 2.663223140495868e-07, + "logits/chosen": -0.2001953125, + "logits/rejected": -0.45703125, + "logps/chosen": -434.0, + "logps/rejected": -356.0, + "loss": 0.0801, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.375, + "rewards/margins": 8.9375, + "rewards/rejected": -7.53125, + "step": 1156 + }, + { + "epoch": 1.4196319018404908, + "grad_norm": 13.632878246972178, + "learning_rate": 2.6611570247933883e-07, + "logits/chosen": -0.251953125, + "logits/rejected": -0.390625, + "logps/chosen": -446.0, + "logps/rejected": -386.0, + "loss": 0.0522, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.515625, + "rewards/margins": 8.6875, + "rewards/rejected": -7.1875, + "step": 1157 + }, + { + "epoch": 1.4208588957055215, + "grad_norm": 12.507779155283647, + "learning_rate": 2.6590909090909093e-07, + "logits/chosen": -0.2451171875, + "logits/rejected": -0.40234375, + "logps/chosen": -342.0, + "logps/rejected": -318.0, + "loss": 0.0672, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.9140625, + "rewards/margins": 8.125, + "rewards/rejected": -7.25, + "step": 1158 + }, + { + "epoch": 1.4220858895705522, + "grad_norm": 23.876638078475157, + "learning_rate": 2.65702479338843e-07, + "logits/chosen": -0.21484375, + "logits/rejected": -0.294921875, + "logps/chosen": -348.0, + "logps/rejected": -352.0, + "loss": 0.0993, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.4453125, + "rewards/margins": 7.53125, + "rewards/rejected": -7.0625, + "step": 1159 + }, + { + "epoch": 1.4233128834355828, + "grad_norm": 17.951348529538016, + "learning_rate": 2.6549586776859503e-07, + "logits/chosen": -0.31640625, + "logits/rejected": -0.4921875, + "logps/chosen": -410.0, + "logps/rejected": -362.0, + "loss": 0.0783, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.796875, + "rewards/margins": 7.96875, + "rewards/rejected": -7.1875, + "step": 1160 + }, + { + "epoch": 1.4245398773006135, + "grad_norm": 17.56551756060523, + "learning_rate": 2.652892561983471e-07, + "logits/chosen": -0.18359375, + "logits/rejected": -0.310546875, + "logps/chosen": -372.0, + "logps/rejected": -378.0, + "loss": 0.1015, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.67578125, + "rewards/margins": 7.71875, + "rewards/rejected": -7.03125, + "step": 1161 + }, + { + "epoch": 1.4257668711656442, + "grad_norm": 14.53222312104436, + "learning_rate": 2.650826446280992e-07, + "logits/chosen": -0.283203125, + "logits/rejected": -0.412109375, + "logps/chosen": -388.0, + "logps/rejected": -348.0, + "loss": 0.0746, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.59765625, + "rewards/margins": 7.96875, + "rewards/rejected": -7.375, + "step": 1162 + }, + { + "epoch": 1.4269938650306748, + "grad_norm": 14.235854762550826, + "learning_rate": 2.648760330578512e-07, + "logits/chosen": -0.3515625, + "logits/rejected": -0.59375, + "logps/chosen": -394.0, + "logps/rejected": -342.0, + "loss": 0.062, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.2421875, + "rewards/margins": 8.9375, + "rewards/rejected": -7.71875, + "step": 1163 + }, + { + "epoch": 1.4282208588957055, + "grad_norm": 22.822159818966163, + "learning_rate": 2.6466942148760327e-07, + "logits/chosen": -0.21484375, + "logits/rejected": -0.267578125, + "logps/chosen": -330.0, + "logps/rejected": -332.0, + "loss": 0.0921, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.640625, + "rewards/margins": 7.59375, + "rewards/rejected": -6.9375, + "step": 1164 + }, + { + "epoch": 1.4294478527607362, + "grad_norm": 17.842349921643866, + "learning_rate": 2.6446280991735537e-07, + "logits/chosen": -0.1904296875, + "logits/rejected": -0.337890625, + "logps/chosen": -382.0, + "logps/rejected": -336.0, + "loss": 0.0718, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.54296875, + "rewards/margins": 7.8125, + "rewards/rejected": -7.28125, + "step": 1165 + }, + { + "epoch": 1.4306748466257668, + "grad_norm": 13.25805514835674, + "learning_rate": 2.642561983471074e-07, + "logits/chosen": -0.2265625, + "logits/rejected": -0.470703125, + "logps/chosen": -400.0, + "logps/rejected": -352.0, + "loss": 0.0564, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.71875, + "rewards/margins": 7.5625, + "rewards/rejected": -6.84375, + "step": 1166 + }, + { + "epoch": 1.4319018404907975, + "grad_norm": 16.92585607038591, + "learning_rate": 2.640495867768595e-07, + "logits/chosen": -0.255859375, + "logits/rejected": -0.4609375, + "logps/chosen": -400.0, + "logps/rejected": -372.0, + "loss": 0.0671, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.78515625, + "rewards/margins": 8.4375, + "rewards/rejected": -7.65625, + "step": 1167 + }, + { + "epoch": 1.4331288343558282, + "grad_norm": 13.644619776454029, + "learning_rate": 2.6384297520661156e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.37109375, + "logps/chosen": -364.0, + "logps/rejected": -336.0, + "loss": 0.0649, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.58203125, + "rewards/margins": 8.4375, + "rewards/rejected": -7.84375, + "step": 1168 + }, + { + "epoch": 1.4343558282208588, + "grad_norm": 13.909623867359475, + "learning_rate": 2.636363636363636e-07, + "logits/chosen": -0.1787109375, + "logits/rejected": -0.359375, + "logps/chosen": -370.0, + "logps/rejected": -364.0, + "loss": 0.0675, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.92578125, + "rewards/margins": 7.25, + "rewards/rejected": -6.34375, + "step": 1169 + }, + { + "epoch": 1.4355828220858895, + "grad_norm": 18.219314336763002, + "learning_rate": 2.6342975206611566e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.5078125, + "logps/chosen": -388.0, + "logps/rejected": -330.0, + "loss": 0.0753, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.6953125, + "rewards/margins": 8.0625, + "rewards/rejected": -7.375, + "step": 1170 + }, + { + "epoch": 1.4368098159509202, + "grad_norm": 15.943295109955594, + "learning_rate": 2.6322314049586776e-07, + "logits/chosen": -0.2236328125, + "logits/rejected": -0.40234375, + "logps/chosen": -370.0, + "logps/rejected": -340.0, + "loss": 0.0764, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.296875, + "rewards/margins": 8.5, + "rewards/rejected": -7.1875, + "step": 1171 + }, + { + "epoch": 1.438036809815951, + "grad_norm": 17.81488809336818, + "learning_rate": 2.630165289256198e-07, + "logits/chosen": -0.1826171875, + "logits/rejected": -0.302734375, + "logps/chosen": -428.0, + "logps/rejected": -368.0, + "loss": 0.0819, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.5703125, + "rewards/margins": 6.84375, + "rewards/rejected": -6.25, + "step": 1172 + }, + { + "epoch": 1.4392638036809817, + "grad_norm": 16.521958685170905, + "learning_rate": 2.628099173553719e-07, + "logits/chosen": -0.2197265625, + "logits/rejected": -0.390625, + "logps/chosen": -422.0, + "logps/rejected": -372.0, + "loss": 0.0806, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.859375, + "rewards/margins": 7.6875, + "rewards/rejected": -6.84375, + "step": 1173 + }, + { + "epoch": 1.4404907975460124, + "grad_norm": 18.702376129192125, + "learning_rate": 2.6260330578512395e-07, + "logits/chosen": -0.240234375, + "logits/rejected": -0.291015625, + "logps/chosen": -356.0, + "logps/rejected": -330.0, + "loss": 0.0847, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.60546875, + "rewards/margins": 7.5, + "rewards/rejected": -6.90625, + "step": 1174 + }, + { + "epoch": 1.441717791411043, + "grad_norm": 13.850669096976649, + "learning_rate": 2.6239669421487605e-07, + "logits/chosen": -0.2314453125, + "logits/rejected": -0.3125, + "logps/chosen": -340.0, + "logps/rejected": -330.0, + "loss": 0.0819, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.294921875, + "rewards/margins": 7.21875, + "rewards/rejected": -6.90625, + "step": 1175 + }, + { + "epoch": 1.4429447852760737, + "grad_norm": 18.607155577463676, + "learning_rate": 2.621900826446281e-07, + "logits/chosen": -0.287109375, + "logits/rejected": -0.41015625, + "logps/chosen": -386.0, + "logps/rejected": -366.0, + "loss": 0.0828, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.328125, + "rewards/margins": 7.0625, + "rewards/rejected": -6.75, + "step": 1176 + }, + { + "epoch": 1.4441717791411044, + "grad_norm": 17.638067126521513, + "learning_rate": 2.619834710743802e-07, + "logits/chosen": -0.1611328125, + "logits/rejected": -0.365234375, + "logps/chosen": -376.0, + "logps/rejected": -322.0, + "loss": 0.0822, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.90625, + "rewards/margins": 7.1875, + "rewards/rejected": -6.28125, + "step": 1177 + }, + { + "epoch": 1.445398773006135, + "grad_norm": 10.876079090319244, + "learning_rate": 2.617768595041322e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.4609375, + "logps/chosen": -390.0, + "logps/rejected": -332.0, + "loss": 0.0523, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.7734375, + "rewards/margins": 8.5, + "rewards/rejected": -6.75, + "step": 1178 + }, + { + "epoch": 1.4466257668711657, + "grad_norm": 26.135434766275218, + "learning_rate": 2.615702479338843e-07, + "logits/chosen": -0.314453125, + "logits/rejected": -0.52734375, + "logps/chosen": -430.0, + "logps/rejected": -360.0, + "loss": 0.0639, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.3671875, + "rewards/margins": 8.375, + "rewards/rejected": -7.0, + "step": 1179 + }, + { + "epoch": 1.4478527607361964, + "grad_norm": 19.809776547435497, + "learning_rate": 2.6136363636363634e-07, + "logits/chosen": -0.23828125, + "logits/rejected": -0.302734375, + "logps/chosen": -338.0, + "logps/rejected": -348.0, + "loss": 0.1056, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.64453125, + "rewards/margins": 7.71875, + "rewards/rejected": -7.0625, + "step": 1180 + }, + { + "epoch": 1.449079754601227, + "grad_norm": 11.965538666021382, + "learning_rate": 2.6115702479338844e-07, + "logits/chosen": -0.2451171875, + "logits/rejected": -0.404296875, + "logps/chosen": -426.0, + "logps/rejected": -396.0, + "loss": 0.0527, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.640625, + "rewards/margins": 8.0, + "rewards/rejected": -6.34375, + "step": 1181 + }, + { + "epoch": 1.4503067484662577, + "grad_norm": 12.586713486960434, + "learning_rate": 2.609504132231405e-07, + "logits/chosen": -0.2314453125, + "logits/rejected": -0.390625, + "logps/chosen": -416.0, + "logps/rejected": -366.0, + "loss": 0.0651, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.431640625, + "rewards/margins": 7.34375, + "rewards/rejected": -6.90625, + "step": 1182 + }, + { + "epoch": 1.4515337423312884, + "grad_norm": 18.89011919476893, + "learning_rate": 2.6074380165289253e-07, + "logits/chosen": -0.255859375, + "logits/rejected": -0.33984375, + "logps/chosen": -324.0, + "logps/rejected": -336.0, + "loss": 0.1049, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.328125, + "rewards/margins": 6.71875, + "rewards/rejected": -6.40625, + "step": 1183 + }, + { + "epoch": 1.452760736196319, + "grad_norm": 13.918802583134164, + "learning_rate": 2.6053719008264463e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.470703125, + "logps/chosen": -360.0, + "logps/rejected": -316.0, + "loss": 0.0765, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.9375, + "rewards/margins": 8.125, + "rewards/rejected": -7.1875, + "step": 1184 + }, + { + "epoch": 1.4539877300613497, + "grad_norm": 14.007358226253524, + "learning_rate": 2.603305785123967e-07, + "logits/chosen": -0.1630859375, + "logits/rejected": -0.328125, + "logps/chosen": -412.0, + "logps/rejected": -366.0, + "loss": 0.0606, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.296875, + "rewards/margins": 8.0, + "rewards/rejected": -6.6875, + "step": 1185 + }, + { + "epoch": 1.4552147239263804, + "grad_norm": 16.519948025389986, + "learning_rate": 2.601239669421488e-07, + "logits/chosen": -0.228515625, + "logits/rejected": -0.3984375, + "logps/chosen": -374.0, + "logps/rejected": -350.0, + "loss": 0.1014, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.6015625, + "rewards/margins": 6.8125, + "rewards/rejected": -6.21875, + "step": 1186 + }, + { + "epoch": 1.456441717791411, + "grad_norm": 15.637435718943374, + "learning_rate": 2.599173553719008e-07, + "logits/chosen": -0.25390625, + "logits/rejected": -0.45703125, + "logps/chosen": -448.0, + "logps/rejected": -372.0, + "loss": 0.0751, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.5078125, + "rewards/margins": 7.4375, + "rewards/rejected": -5.90625, + "step": 1187 + }, + { + "epoch": 1.4576687116564417, + "grad_norm": 13.16248567587539, + "learning_rate": 2.597107438016529e-07, + "logits/chosen": -0.1923828125, + "logits/rejected": -0.314453125, + "logps/chosen": -420.0, + "logps/rejected": -394.0, + "loss": 0.0627, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.1953125, + "rewards/margins": 7.4375, + "rewards/rejected": -6.25, + "step": 1188 + }, + { + "epoch": 1.4588957055214724, + "grad_norm": 17.054903091984652, + "learning_rate": 2.595041322314049e-07, + "logits/chosen": -0.275390625, + "logits/rejected": -0.47265625, + "logps/chosen": -420.0, + "logps/rejected": -358.0, + "loss": 0.0849, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.1875, + "rewards/margins": 7.59375, + "rewards/rejected": -6.40625, + "step": 1189 + }, + { + "epoch": 1.460122699386503, + "grad_norm": 10.704468766281648, + "learning_rate": 2.59297520661157e-07, + "logits/chosen": -0.26953125, + "logits/rejected": -0.5, + "logps/chosen": -428.0, + "logps/rejected": -362.0, + "loss": 0.0572, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.5859375, + "rewards/margins": 8.25, + "rewards/rejected": -6.6875, + "step": 1190 + }, + { + "epoch": 1.4613496932515337, + "grad_norm": 17.0111251360486, + "learning_rate": 2.5909090909090907e-07, + "logits/chosen": -0.12890625, + "logits/rejected": -0.26953125, + "logps/chosen": -362.0, + "logps/rejected": -350.0, + "loss": 0.0753, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.0625, + "rewards/margins": 8.1875, + "rewards/rejected": -7.125, + "step": 1191 + }, + { + "epoch": 1.4625766871165644, + "grad_norm": 15.369446069374968, + "learning_rate": 2.5888429752066117e-07, + "logits/chosen": -0.22265625, + "logits/rejected": -0.41015625, + "logps/chosen": -392.0, + "logps/rejected": -358.0, + "loss": 0.0727, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.9296875, + "rewards/margins": 7.625, + "rewards/rejected": -6.6875, + "step": 1192 + }, + { + "epoch": 1.463803680981595, + "grad_norm": 11.287386264873138, + "learning_rate": 2.586776859504132e-07, + "logits/chosen": -0.291015625, + "logits/rejected": -0.48046875, + "logps/chosen": -450.0, + "logps/rejected": -374.0, + "loss": 0.0495, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.1875, + "rewards/margins": 7.59375, + "rewards/rejected": -6.40625, + "step": 1193 + }, + { + "epoch": 1.4650306748466257, + "grad_norm": 13.824964228001653, + "learning_rate": 2.584710743801653e-07, + "logits/chosen": -0.267578125, + "logits/rejected": -0.40625, + "logps/chosen": -410.0, + "logps/rejected": -364.0, + "loss": 0.0477, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.2421875, + "rewards/margins": 7.78125, + "rewards/rejected": -6.53125, + "step": 1194 + }, + { + "epoch": 1.4662576687116564, + "grad_norm": 13.29691128148155, + "learning_rate": 2.582644628099173e-07, + "logits/chosen": -0.2275390625, + "logits/rejected": -0.376953125, + "logps/chosen": -390.0, + "logps/rejected": -368.0, + "loss": 0.0661, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.1015625, + "rewards/margins": 7.71875, + "rewards/rejected": -6.625, + "step": 1195 + }, + { + "epoch": 1.467484662576687, + "grad_norm": 15.177799019212971, + "learning_rate": 2.580578512396694e-07, + "logits/chosen": -0.189453125, + "logits/rejected": -0.333984375, + "logps/chosen": -382.0, + "logps/rejected": -350.0, + "loss": 0.0789, + "rewards/accuracies": 0.953125, + "rewards/chosen": 0.67578125, + "rewards/margins": 6.9375, + "rewards/rejected": -6.25, + "step": 1196 + }, + { + "epoch": 1.4687116564417177, + "grad_norm": 16.309192228173607, + "learning_rate": 2.5785123966942146e-07, + "logits/chosen": -0.197265625, + "logits/rejected": -0.380859375, + "logps/chosen": -414.0, + "logps/rejected": -338.0, + "loss": 0.0852, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.91015625, + "rewards/margins": 7.40625, + "rewards/rejected": -6.5, + "step": 1197 + }, + { + "epoch": 1.4699386503067484, + "grad_norm": 17.042598465129313, + "learning_rate": 2.5764462809917356e-07, + "logits/chosen": -0.1396484375, + "logits/rejected": -0.27734375, + "logps/chosen": -376.0, + "logps/rejected": -312.0, + "loss": 0.0862, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.8984375, + "rewards/margins": 7.125, + "rewards/rejected": -6.25, + "step": 1198 + }, + { + "epoch": 1.471165644171779, + "grad_norm": 14.978817725812366, + "learning_rate": 2.574380165289256e-07, + "logits/chosen": -0.318359375, + "logits/rejected": -0.490234375, + "logps/chosen": -384.0, + "logps/rejected": -334.0, + "loss": 0.0717, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.2890625, + "rewards/margins": 8.25, + "rewards/rejected": -6.96875, + "step": 1199 + }, + { + "epoch": 1.4723926380368098, + "grad_norm": 12.246840389287637, + "learning_rate": 2.5723140495867765e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.423828125, + "logps/chosen": -320.0, + "logps/rejected": -310.0, + "loss": 0.063, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.8828125, + "rewards/margins": 7.15625, + "rewards/rejected": -6.28125, + "step": 1200 + }, + { + "epoch": 1.4736196319018404, + "grad_norm": 12.344748308255857, + "learning_rate": 2.5702479338842975e-07, + "logits/chosen": -0.1708984375, + "logits/rejected": -0.337890625, + "logps/chosen": -372.0, + "logps/rejected": -368.0, + "loss": 0.0557, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.921875, + "rewards/margins": 7.34375, + "rewards/rejected": -6.4375, + "step": 1201 + }, + { + "epoch": 1.474846625766871, + "grad_norm": 13.673164766522879, + "learning_rate": 2.568181818181818e-07, + "logits/chosen": -0.25390625, + "logits/rejected": -0.416015625, + "logps/chosen": -420.0, + "logps/rejected": -380.0, + "loss": 0.0634, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.6875, + "rewards/margins": 8.3125, + "rewards/rejected": -6.625, + "step": 1202 + }, + { + "epoch": 1.4760736196319018, + "grad_norm": 12.02609442001873, + "learning_rate": 2.566115702479339e-07, + "logits/chosen": -0.333984375, + "logits/rejected": -0.5234375, + "logps/chosen": -402.0, + "logps/rejected": -330.0, + "loss": 0.0651, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.015625, + "rewards/margins": 7.78125, + "rewards/rejected": -6.78125, + "step": 1203 + }, + { + "epoch": 1.4773006134969324, + "grad_norm": 20.663473512439204, + "learning_rate": 2.564049586776859e-07, + "logits/chosen": -0.2041015625, + "logits/rejected": -0.439453125, + "logps/chosen": -368.0, + "logps/rejected": -352.0, + "loss": 0.0865, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.1953125, + "rewards/margins": 7.90625, + "rewards/rejected": -6.6875, + "step": 1204 + }, + { + "epoch": 1.478527607361963, + "grad_norm": 17.191642593540273, + "learning_rate": 2.56198347107438e-07, + "logits/chosen": -0.12158203125, + "logits/rejected": -0.345703125, + "logps/chosen": -354.0, + "logps/rejected": -340.0, + "loss": 0.0822, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.2109375, + "rewards/margins": 7.71875, + "rewards/rejected": -6.5, + "step": 1205 + }, + { + "epoch": 1.4797546012269938, + "grad_norm": 12.43541278258852, + "learning_rate": 2.5599173553719004e-07, + "logits/chosen": -0.16796875, + "logits/rejected": -0.43359375, + "logps/chosen": -342.0, + "logps/rejected": -310.0, + "loss": 0.0694, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.86328125, + "rewards/margins": 7.65625, + "rewards/rejected": -6.78125, + "step": 1206 + }, + { + "epoch": 1.4809815950920244, + "grad_norm": 15.001254892318816, + "learning_rate": 2.5578512396694214e-07, + "logits/chosen": -0.22265625, + "logits/rejected": -0.408203125, + "logps/chosen": -400.0, + "logps/rejected": -306.0, + "loss": 0.0771, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.55859375, + "rewards/margins": 7.1875, + "rewards/rejected": -6.625, + "step": 1207 + }, + { + "epoch": 1.482208588957055, + "grad_norm": 18.30618263640872, + "learning_rate": 2.555785123966942e-07, + "logits/chosen": -0.25, + "logits/rejected": -0.41796875, + "logps/chosen": -368.0, + "logps/rejected": -342.0, + "loss": 0.099, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.66796875, + "rewards/margins": 7.03125, + "rewards/rejected": -6.375, + "step": 1208 + }, + { + "epoch": 1.4834355828220858, + "grad_norm": 14.648897782716588, + "learning_rate": 2.553719008264463e-07, + "logits/chosen": -0.21484375, + "logits/rejected": -0.404296875, + "logps/chosen": -354.0, + "logps/rejected": -322.0, + "loss": 0.0892, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.703125, + "rewards/margins": 7.75, + "rewards/rejected": -7.0625, + "step": 1209 + }, + { + "epoch": 1.4846625766871164, + "grad_norm": 12.347110844785343, + "learning_rate": 2.5516528925619833e-07, + "logits/chosen": -0.17578125, + "logits/rejected": -0.34375, + "logps/chosen": -364.0, + "logps/rejected": -326.0, + "loss": 0.0543, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.93359375, + "rewards/margins": 7.875, + "rewards/rejected": -6.9375, + "step": 1210 + }, + { + "epoch": 1.4858895705521473, + "grad_norm": 11.573865654137894, + "learning_rate": 2.5495867768595043e-07, + "logits/chosen": -0.19921875, + "logits/rejected": -0.423828125, + "logps/chosen": -352.0, + "logps/rejected": -342.0, + "loss": 0.0521, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.74609375, + "rewards/margins": 7.625, + "rewards/rejected": -6.875, + "step": 1211 + }, + { + "epoch": 1.487116564417178, + "grad_norm": 15.90149763732436, + "learning_rate": 2.547520661157025e-07, + "logits/chosen": -0.29296875, + "logits/rejected": -0.423828125, + "logps/chosen": -350.0, + "logps/rejected": -346.0, + "loss": 0.078, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.57421875, + "rewards/margins": 7.9375, + "rewards/rejected": -7.34375, + "step": 1212 + }, + { + "epoch": 1.4883435582822087, + "grad_norm": 17.635564837509964, + "learning_rate": 2.5454545454545453e-07, + "logits/chosen": -0.27734375, + "logits/rejected": -0.546875, + "logps/chosen": -426.0, + "logps/rejected": -358.0, + "loss": 0.0748, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.328125, + "rewards/margins": 8.375, + "rewards/rejected": -7.03125, + "step": 1213 + }, + { + "epoch": 1.4895705521472393, + "grad_norm": 16.144394719987027, + "learning_rate": 2.543388429752066e-07, + "logits/chosen": -0.2421875, + "logits/rejected": -0.369140625, + "logps/chosen": -344.0, + "logps/rejected": -338.0, + "loss": 0.0797, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.0634765625, + "rewards/margins": 7.40625, + "rewards/rejected": -7.34375, + "step": 1214 + }, + { + "epoch": 1.49079754601227, + "grad_norm": 14.289031428981978, + "learning_rate": 2.541322314049587e-07, + "logits/chosen": -0.279296875, + "logits/rejected": -0.490234375, + "logps/chosen": -376.0, + "logps/rejected": -350.0, + "loss": 0.0526, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.0, + "rewards/margins": 8.9375, + "rewards/rejected": -7.90625, + "step": 1215 + }, + { + "epoch": 1.4920245398773007, + "grad_norm": 19.81663449599735, + "learning_rate": 2.539256198347107e-07, + "logits/chosen": -0.25390625, + "logits/rejected": -0.3125, + "logps/chosen": -372.0, + "logps/rejected": -330.0, + "loss": 0.1015, + "rewards/accuracies": 0.953125, + "rewards/chosen": 0.19140625, + "rewards/margins": 7.25, + "rewards/rejected": -7.0625, + "step": 1216 + }, + { + "epoch": 1.4932515337423313, + "grad_norm": 11.49360342714182, + "learning_rate": 2.537190082644628e-07, + "logits/chosen": -0.2451171875, + "logits/rejected": -0.3828125, + "logps/chosen": -402.0, + "logps/rejected": -366.0, + "loss": 0.0467, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.3515625, + "rewards/margins": 8.4375, + "rewards/rejected": -7.09375, + "step": 1217 + }, + { + "epoch": 1.494478527607362, + "grad_norm": 16.911688287141253, + "learning_rate": 2.5351239669421487e-07, + "logits/chosen": -0.1767578125, + "logits/rejected": -0.35546875, + "logps/chosen": -364.0, + "logps/rejected": -350.0, + "loss": 0.0771, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.2001953125, + "rewards/margins": 7.4375, + "rewards/rejected": -7.25, + "step": 1218 + }, + { + "epoch": 1.4957055214723927, + "grad_norm": 13.672652402107465, + "learning_rate": 2.533057851239669e-07, + "logits/chosen": -0.25, + "logits/rejected": -0.4140625, + "logps/chosen": -386.0, + "logps/rejected": -372.0, + "loss": 0.0507, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.6328125, + "rewards/margins": 7.875, + "rewards/rejected": -7.25, + "step": 1219 + }, + { + "epoch": 1.4969325153374233, + "grad_norm": 18.661295619736777, + "learning_rate": 2.53099173553719e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.39453125, + "logps/chosen": -392.0, + "logps/rejected": -374.0, + "loss": 0.0917, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.66796875, + "rewards/margins": 7.78125, + "rewards/rejected": -7.09375, + "step": 1220 + }, + { + "epoch": 1.498159509202454, + "grad_norm": 13.403324578383364, + "learning_rate": 2.5289256198347106e-07, + "logits/chosen": -0.294921875, + "logits/rejected": -0.466796875, + "logps/chosen": -402.0, + "logps/rejected": -340.0, + "loss": 0.0586, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.9921875, + "rewards/margins": 8.375, + "rewards/rejected": -7.375, + "step": 1221 + }, + { + "epoch": 1.4993865030674847, + "grad_norm": 16.827163128693247, + "learning_rate": 2.526859504132231e-07, + "logits/chosen": -0.1826171875, + "logits/rejected": -0.369140625, + "logps/chosen": -332.0, + "logps/rejected": -328.0, + "loss": 0.0871, + "rewards/accuracies": 0.9765625, + "rewards/chosen": -0.01953125, + "rewards/margins": 6.6875, + "rewards/rejected": -6.71875, + "step": 1222 + }, + { + "epoch": 1.5006134969325153, + "grad_norm": 12.308730951133256, + "learning_rate": 2.5247933884297516e-07, + "logits/chosen": -0.2158203125, + "logits/rejected": -0.34765625, + "logps/chosen": -420.0, + "logps/rejected": -362.0, + "loss": 0.0629, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.2578125, + "rewards/margins": 8.0625, + "rewards/rejected": -6.8125, + "step": 1223 + }, + { + "epoch": 1.501840490797546, + "grad_norm": 16.055343712171055, + "learning_rate": 2.5227272727272726e-07, + "logits/chosen": -0.212890625, + "logits/rejected": -0.3203125, + "logps/chosen": -352.0, + "logps/rejected": -334.0, + "loss": 0.0962, + "rewards/accuracies": 0.953125, + "rewards/chosen": -0.1962890625, + "rewards/margins": 6.46875, + "rewards/rejected": -6.65625, + "step": 1224 + }, + { + "epoch": 1.5030674846625767, + "grad_norm": 14.466790379446984, + "learning_rate": 2.520661157024793e-07, + "logits/chosen": -0.17578125, + "logits/rejected": -0.3359375, + "logps/chosen": -352.0, + "logps/rejected": -338.0, + "loss": 0.0702, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.64453125, + "rewards/margins": 7.4375, + "rewards/rejected": -6.8125, + "step": 1225 + }, + { + "epoch": 1.5042944785276073, + "grad_norm": 14.886182764586577, + "learning_rate": 2.518595041322314e-07, + "logits/chosen": -0.263671875, + "logits/rejected": -0.453125, + "logps/chosen": -384.0, + "logps/rejected": -340.0, + "loss": 0.0599, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.26171875, + "rewards/margins": 7.15625, + "rewards/rejected": -6.90625, + "step": 1226 + }, + { + "epoch": 1.505521472392638, + "grad_norm": 12.645862539088553, + "learning_rate": 2.5165289256198345e-07, + "logits/chosen": -0.359375, + "logits/rejected": -0.478515625, + "logps/chosen": -386.0, + "logps/rejected": -376.0, + "loss": 0.0551, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.4609375, + "rewards/margins": 8.0625, + "rewards/rejected": -6.625, + "step": 1227 + }, + { + "epoch": 1.5067484662576687, + "grad_norm": 26.979602576272097, + "learning_rate": 2.5144628099173555e-07, + "logits/chosen": -0.2431640625, + "logits/rejected": -0.376953125, + "logps/chosen": -404.0, + "logps/rejected": -380.0, + "loss": 0.1077, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.78515625, + "rewards/margins": 7.125, + "rewards/rejected": -6.3125, + "step": 1228 + }, + { + "epoch": 1.5079754601226993, + "grad_norm": 15.533111070411053, + "learning_rate": 2.512396694214876e-07, + "logits/chosen": -0.310546875, + "logits/rejected": -0.44921875, + "logps/chosen": -372.0, + "logps/rejected": -348.0, + "loss": 0.0663, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.6875, + "rewards/margins": 7.5625, + "rewards/rejected": -6.875, + "step": 1229 + }, + { + "epoch": 1.50920245398773, + "grad_norm": 14.707103339676141, + "learning_rate": 2.510330578512397e-07, + "logits/chosen": -0.2138671875, + "logits/rejected": -0.392578125, + "logps/chosen": -360.0, + "logps/rejected": -326.0, + "loss": 0.0777, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.953125, + "rewards/margins": 7.15625, + "rewards/rejected": -6.1875, + "step": 1230 + }, + { + "epoch": 1.510429447852761, + "grad_norm": 10.167827448968293, + "learning_rate": 2.508264462809917e-07, + "logits/chosen": -0.1748046875, + "logits/rejected": -0.3359375, + "logps/chosen": -346.0, + "logps/rejected": -310.0, + "loss": 0.0559, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.8359375, + "rewards/margins": 6.8125, + "rewards/rejected": -6.0, + "step": 1231 + }, + { + "epoch": 1.5116564417177916, + "grad_norm": 10.45405869315019, + "learning_rate": 2.506198347107438e-07, + "logits/chosen": -0.349609375, + "logits/rejected": -0.5625, + "logps/chosen": -392.0, + "logps/rejected": -348.0, + "loss": 0.0385, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.4296875, + "rewards/margins": 8.4375, + "rewards/rejected": -6.96875, + "step": 1232 + }, + { + "epoch": 1.5128834355828222, + "grad_norm": 13.136128276279047, + "learning_rate": 2.5041322314049584e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.474609375, + "logps/chosen": -372.0, + "logps/rejected": -326.0, + "loss": 0.058, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.95703125, + "rewards/margins": 7.46875, + "rewards/rejected": -6.53125, + "step": 1233 + }, + { + "epoch": 1.514110429447853, + "grad_norm": 24.397776494029806, + "learning_rate": 2.5020661157024794e-07, + "logits/chosen": -0.220703125, + "logits/rejected": -0.431640625, + "logps/chosen": -416.0, + "logps/rejected": -348.0, + "loss": 0.0939, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.6875, + "rewards/margins": 7.78125, + "rewards/rejected": -6.09375, + "step": 1234 + }, + { + "epoch": 1.5153374233128836, + "grad_norm": 13.503553020060968, + "learning_rate": 2.5e-07, + "logits/chosen": -0.1533203125, + "logits/rejected": -0.28515625, + "logps/chosen": -378.0, + "logps/rejected": -332.0, + "loss": 0.0744, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.306640625, + "rewards/margins": 6.5625, + "rewards/rejected": -6.25, + "step": 1235 + }, + { + "epoch": 1.5165644171779142, + "grad_norm": 15.019217461434575, + "learning_rate": 2.4979338842975204e-07, + "logits/chosen": -0.2333984375, + "logits/rejected": -0.41796875, + "logps/chosen": -380.0, + "logps/rejected": -338.0, + "loss": 0.0682, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.2109375, + "rewards/margins": 7.0625, + "rewards/rejected": -5.875, + "step": 1236 + }, + { + "epoch": 1.517791411042945, + "grad_norm": 17.297712239669764, + "learning_rate": 2.4958677685950414e-07, + "logits/chosen": -0.318359375, + "logits/rejected": -0.486328125, + "logps/chosen": -420.0, + "logps/rejected": -348.0, + "loss": 0.0783, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.1640625, + "rewards/margins": 8.125, + "rewards/rejected": -6.96875, + "step": 1237 + }, + { + "epoch": 1.5190184049079756, + "grad_norm": 18.324942299358973, + "learning_rate": 2.493801652892562e-07, + "logits/chosen": -0.1806640625, + "logits/rejected": -0.345703125, + "logps/chosen": -458.0, + "logps/rejected": -350.0, + "loss": 0.0661, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.484375, + "rewards/margins": 7.78125, + "rewards/rejected": -6.3125, + "step": 1238 + }, + { + "epoch": 1.5202453987730062, + "grad_norm": 13.871362280353386, + "learning_rate": 2.4917355371900823e-07, + "logits/chosen": -0.275390625, + "logits/rejected": -0.486328125, + "logps/chosen": -392.0, + "logps/rejected": -338.0, + "loss": 0.0722, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.1328125, + "rewards/margins": 7.90625, + "rewards/rejected": -6.78125, + "step": 1239 + }, + { + "epoch": 1.521472392638037, + "grad_norm": 18.07419128878504, + "learning_rate": 2.4896694214876033e-07, + "logits/chosen": -0.18359375, + "logits/rejected": -0.38671875, + "logps/chosen": -400.0, + "logps/rejected": -354.0, + "loss": 0.0987, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.796875, + "rewards/margins": 7.125, + "rewards/rejected": -6.34375, + "step": 1240 + }, + { + "epoch": 1.5226993865030676, + "grad_norm": 19.28019466173115, + "learning_rate": 2.487603305785124e-07, + "logits/chosen": -0.15234375, + "logits/rejected": -0.298828125, + "logps/chosen": -346.0, + "logps/rejected": -322.0, + "loss": 0.1115, + "rewards/accuracies": 0.953125, + "rewards/chosen": 0.8828125, + "rewards/margins": 6.875, + "rewards/rejected": -5.96875, + "step": 1241 + }, + { + "epoch": 1.5239263803680982, + "grad_norm": 21.39183520579998, + "learning_rate": 2.485537190082644e-07, + "logits/chosen": -0.330078125, + "logits/rejected": -0.50390625, + "logps/chosen": -374.0, + "logps/rejected": -340.0, + "loss": 0.0963, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.6640625, + "rewards/margins": 7.71875, + "rewards/rejected": -7.0625, + "step": 1242 + }, + { + "epoch": 1.525153374233129, + "grad_norm": 14.898065808458167, + "learning_rate": 2.483471074380165e-07, + "logits/chosen": -0.1708984375, + "logits/rejected": -0.322265625, + "logps/chosen": -324.0, + "logps/rejected": -308.0, + "loss": 0.067, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.30859375, + "rewards/margins": 6.4375, + "rewards/rejected": -6.125, + "step": 1243 + }, + { + "epoch": 1.5263803680981596, + "grad_norm": 13.937098717597822, + "learning_rate": 2.4814049586776857e-07, + "logits/chosen": -0.1845703125, + "logits/rejected": -0.296875, + "logps/chosen": -332.0, + "logps/rejected": -328.0, + "loss": 0.0736, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.41015625, + "rewards/margins": 6.25, + "rewards/rejected": -5.84375, + "step": 1244 + }, + { + "epoch": 1.5276073619631902, + "grad_norm": 21.50409852348661, + "learning_rate": 2.4793388429752067e-07, + "logits/chosen": -0.189453125, + "logits/rejected": -0.404296875, + "logps/chosen": -412.0, + "logps/rejected": -370.0, + "loss": 0.1119, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.95703125, + "rewards/margins": 7.53125, + "rewards/rejected": -6.5625, + "step": 1245 + }, + { + "epoch": 1.528834355828221, + "grad_norm": 10.75194113481007, + "learning_rate": 2.477272727272727e-07, + "logits/chosen": -0.298828125, + "logits/rejected": -0.47265625, + "logps/chosen": -344.0, + "logps/rejected": -326.0, + "loss": 0.0596, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.76953125, + "rewards/margins": 7.5, + "rewards/rejected": -6.75, + "step": 1246 + }, + { + "epoch": 1.5300613496932516, + "grad_norm": 11.359814321948857, + "learning_rate": 2.4752066115702477e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.400390625, + "logps/chosen": -426.0, + "logps/rejected": -354.0, + "loss": 0.0564, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.1484375, + "rewards/margins": 8.0, + "rewards/rejected": -6.875, + "step": 1247 + }, + { + "epoch": 1.5312883435582823, + "grad_norm": 12.26114984168159, + "learning_rate": 2.4731404958677687e-07, + "logits/chosen": -0.228515625, + "logits/rejected": -0.419921875, + "logps/chosen": -366.0, + "logps/rejected": -340.0, + "loss": 0.0493, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.28125, + "rewards/margins": 7.75, + "rewards/rejected": -6.46875, + "step": 1248 + }, + { + "epoch": 1.532515337423313, + "grad_norm": 20.714642855164037, + "learning_rate": 2.471074380165289e-07, + "logits/chosen": -0.068359375, + "logits/rejected": -0.181640625, + "logps/chosen": -342.0, + "logps/rejected": -328.0, + "loss": 0.115, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.283203125, + "rewards/margins": 6.75, + "rewards/rejected": -6.46875, + "step": 1249 + }, + { + "epoch": 1.5337423312883436, + "grad_norm": 13.4993389721053, + "learning_rate": 2.46900826446281e-07, + "logits/chosen": -0.298828125, + "logits/rejected": -0.462890625, + "logps/chosen": -438.0, + "logps/rejected": -418.0, + "loss": 0.0563, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.1640625, + "rewards/margins": 8.5, + "rewards/rejected": -7.3125, + "step": 1250 + }, + { + "epoch": 1.5349693251533743, + "grad_norm": 19.475138473265186, + "learning_rate": 2.4669421487603306e-07, + "logits/chosen": -0.35546875, + "logits/rejected": -0.47265625, + "logps/chosen": -368.0, + "logps/rejected": -366.0, + "loss": 0.0834, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.5078125, + "rewards/margins": 8.75, + "rewards/rejected": -7.21875, + "step": 1251 + }, + { + "epoch": 1.536196319018405, + "grad_norm": 16.048605131205, + "learning_rate": 2.464876033057851e-07, + "logits/chosen": -0.26171875, + "logits/rejected": -0.435546875, + "logps/chosen": -384.0, + "logps/rejected": -326.0, + "loss": 0.0744, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.8203125, + "rewards/margins": 8.375, + "rewards/rejected": -7.59375, + "step": 1252 + }, + { + "epoch": 1.5374233128834356, + "grad_norm": 14.18861061782376, + "learning_rate": 2.4628099173553715e-07, + "logits/chosen": -0.25, + "logits/rejected": -0.416015625, + "logps/chosen": -410.0, + "logps/rejected": -366.0, + "loss": 0.0657, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.1796875, + "rewards/margins": 7.9375, + "rewards/rejected": -6.78125, + "step": 1253 + }, + { + "epoch": 1.5386503067484663, + "grad_norm": 18.531277778883343, + "learning_rate": 2.4607438016528925e-07, + "logits/chosen": -0.150390625, + "logits/rejected": -0.296875, + "logps/chosen": -372.0, + "logps/rejected": -320.0, + "loss": 0.0998, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.0546875, + "rewards/margins": 7.75, + "rewards/rejected": -6.6875, + "step": 1254 + }, + { + "epoch": 1.539877300613497, + "grad_norm": 13.091901267394528, + "learning_rate": 2.458677685950413e-07, + "logits/chosen": -0.267578125, + "logits/rejected": -0.5078125, + "logps/chosen": -404.0, + "logps/rejected": -388.0, + "loss": 0.0608, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.15625, + "rewards/margins": 8.8125, + "rewards/rejected": -7.65625, + "step": 1255 + }, + { + "epoch": 1.5411042944785276, + "grad_norm": 17.85641442197123, + "learning_rate": 2.4566115702479335e-07, + "logits/chosen": -0.19140625, + "logits/rejected": -0.396484375, + "logps/chosen": -400.0, + "logps/rejected": -358.0, + "loss": 0.0765, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.0234375, + "rewards/margins": 7.5, + "rewards/rejected": -6.46875, + "step": 1256 + }, + { + "epoch": 1.5423312883435583, + "grad_norm": 18.01604803491479, + "learning_rate": 2.4545454545454545e-07, + "logits/chosen": -0.16796875, + "logits/rejected": -0.341796875, + "logps/chosen": -384.0, + "logps/rejected": -346.0, + "loss": 0.0835, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.63671875, + "rewards/margins": 7.5, + "rewards/rejected": -6.875, + "step": 1257 + }, + { + "epoch": 1.543558282208589, + "grad_norm": 15.439495340668307, + "learning_rate": 2.452479338842975e-07, + "logits/chosen": -0.1953125, + "logits/rejected": -0.40234375, + "logps/chosen": -398.0, + "logps/rejected": -328.0, + "loss": 0.079, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.2578125, + "rewards/margins": 7.875, + "rewards/rejected": -6.625, + "step": 1258 + }, + { + "epoch": 1.5447852760736196, + "grad_norm": 14.44952363527473, + "learning_rate": 2.450413223140496e-07, + "logits/chosen": -0.2138671875, + "logits/rejected": -0.4375, + "logps/chosen": -400.0, + "logps/rejected": -344.0, + "loss": 0.0661, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.109375, + "rewards/margins": 8.0625, + "rewards/rejected": -6.96875, + "step": 1259 + }, + { + "epoch": 1.5460122699386503, + "grad_norm": 16.44982554697176, + "learning_rate": 2.4483471074380164e-07, + "logits/chosen": -0.2451171875, + "logits/rejected": -0.423828125, + "logps/chosen": -446.0, + "logps/rejected": -360.0, + "loss": 0.0607, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.296875, + "rewards/margins": 8.375, + "rewards/rejected": -7.09375, + "step": 1260 + }, + { + "epoch": 1.547239263803681, + "grad_norm": 17.28981564978328, + "learning_rate": 2.446280991735537e-07, + "logits/chosen": -0.30078125, + "logits/rejected": -0.4453125, + "logps/chosen": -404.0, + "logps/rejected": -354.0, + "loss": 0.0732, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.82421875, + "rewards/margins": 7.4375, + "rewards/rejected": -6.625, + "step": 1261 + }, + { + "epoch": 1.5484662576687116, + "grad_norm": 12.32711854386545, + "learning_rate": 2.444214876033058e-07, + "logits/chosen": -0.2138671875, + "logits/rejected": -0.40234375, + "logps/chosen": -378.0, + "logps/rejected": -320.0, + "loss": 0.0784, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.6484375, + "rewards/margins": 7.53125, + "rewards/rejected": -6.90625, + "step": 1262 + }, + { + "epoch": 1.5496932515337423, + "grad_norm": 14.86900377895076, + "learning_rate": 2.4421487603305784e-07, + "logits/chosen": -0.15625, + "logits/rejected": -0.375, + "logps/chosen": -388.0, + "logps/rejected": -340.0, + "loss": 0.0818, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.1328125, + "rewards/margins": 7.9375, + "rewards/rejected": -6.8125, + "step": 1263 + }, + { + "epoch": 1.550920245398773, + "grad_norm": 18.62383388039045, + "learning_rate": 2.440082644628099e-07, + "logits/chosen": -0.115234375, + "logits/rejected": -0.283203125, + "logps/chosen": -382.0, + "logps/rejected": -362.0, + "loss": 0.1031, + "rewards/accuracies": 0.953125, + "rewards/chosen": 0.6328125, + "rewards/margins": 7.40625, + "rewards/rejected": -6.75, + "step": 1264 + }, + { + "epoch": 1.5521472392638036, + "grad_norm": 11.415736814981251, + "learning_rate": 2.43801652892562e-07, + "logits/chosen": -0.251953125, + "logits/rejected": -0.423828125, + "logps/chosen": -378.0, + "logps/rejected": -354.0, + "loss": 0.0605, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.6484375, + "rewards/margins": 7.875, + "rewards/rejected": -7.21875, + "step": 1265 + }, + { + "epoch": 1.5533742331288343, + "grad_norm": 15.61422882415533, + "learning_rate": 2.4359504132231403e-07, + "logits/chosen": -0.28515625, + "logits/rejected": -0.392578125, + "logps/chosen": -350.0, + "logps/rejected": -336.0, + "loss": 0.0752, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.296875, + "rewards/margins": 7.15625, + "rewards/rejected": -6.84375, + "step": 1266 + }, + { + "epoch": 1.554601226993865, + "grad_norm": 19.44717966714071, + "learning_rate": 2.4338842975206613e-07, + "logits/chosen": -0.216796875, + "logits/rejected": -0.37109375, + "logps/chosen": -362.0, + "logps/rejected": -328.0, + "loss": 0.1237, + "rewards/accuracies": 0.953125, + "rewards/chosen": 1.0234375, + "rewards/margins": 7.78125, + "rewards/rejected": -6.75, + "step": 1267 + }, + { + "epoch": 1.5558282208588956, + "grad_norm": 12.036788936135034, + "learning_rate": 2.431818181818182e-07, + "logits/chosen": -0.2314453125, + "logits/rejected": -0.35546875, + "logps/chosen": -494.0, + "logps/rejected": -380.0, + "loss": 0.0598, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.2890625, + "rewards/margins": 8.3125, + "rewards/rejected": -7.03125, + "step": 1268 + }, + { + "epoch": 1.5570552147239263, + "grad_norm": 13.075790358388893, + "learning_rate": 2.429752066115702e-07, + "logits/chosen": -0.265625, + "logits/rejected": -0.400390625, + "logps/chosen": -378.0, + "logps/rejected": -326.0, + "loss": 0.0616, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.8203125, + "rewards/margins": 7.84375, + "rewards/rejected": -7.03125, + "step": 1269 + }, + { + "epoch": 1.558282208588957, + "grad_norm": 17.267795800857765, + "learning_rate": 2.427685950413223e-07, + "logits/chosen": -0.265625, + "logits/rejected": -0.330078125, + "logps/chosen": -404.0, + "logps/rejected": -370.0, + "loss": 0.0568, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.76171875, + "rewards/margins": 7.53125, + "rewards/rejected": -6.75, + "step": 1270 + }, + { + "epoch": 1.5595092024539876, + "grad_norm": 13.404398582551197, + "learning_rate": 2.4256198347107437e-07, + "logits/chosen": -0.1845703125, + "logits/rejected": -0.2734375, + "logps/chosen": -354.0, + "logps/rejected": -332.0, + "loss": 0.0606, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.71484375, + "rewards/margins": 7.46875, + "rewards/rejected": -6.75, + "step": 1271 + }, + { + "epoch": 1.5607361963190183, + "grad_norm": 10.862740987379622, + "learning_rate": 2.423553719008264e-07, + "logits/chosen": -0.32421875, + "logits/rejected": -0.484375, + "logps/chosen": -426.0, + "logps/rejected": -354.0, + "loss": 0.0448, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.484375, + "rewards/margins": 8.375, + "rewards/rejected": -6.90625, + "step": 1272 + }, + { + "epoch": 1.561963190184049, + "grad_norm": 22.851394317942706, + "learning_rate": 2.4214876033057847e-07, + "logits/chosen": -0.294921875, + "logits/rejected": -0.41015625, + "logps/chosen": -422.0, + "logps/rejected": -376.0, + "loss": 0.1152, + "rewards/accuracies": 0.9453125, + "rewards/chosen": 0.76953125, + "rewards/margins": 7.5, + "rewards/rejected": -6.71875, + "step": 1273 + }, + { + "epoch": 1.5631901840490796, + "grad_norm": 10.756674533772827, + "learning_rate": 2.4194214876033057e-07, + "logits/chosen": -0.373046875, + "logits/rejected": -0.5703125, + "logps/chosen": -394.0, + "logps/rejected": -350.0, + "loss": 0.0454, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.88671875, + "rewards/margins": 7.90625, + "rewards/rejected": -7.03125, + "step": 1274 + }, + { + "epoch": 1.5644171779141103, + "grad_norm": 16.684970514342197, + "learning_rate": 2.417355371900826e-07, + "logits/chosen": -0.193359375, + "logits/rejected": -0.34765625, + "logps/chosen": -380.0, + "logps/rejected": -356.0, + "loss": 0.0841, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.671875, + "rewards/margins": 7.78125, + "rewards/rejected": -7.125, + "step": 1275 + }, + { + "epoch": 1.565644171779141, + "grad_norm": 10.635507525158637, + "learning_rate": 2.415289256198347e-07, + "logits/chosen": -0.12451171875, + "logits/rejected": -0.310546875, + "logps/chosen": -412.0, + "logps/rejected": -336.0, + "loss": 0.0494, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.0625, + "rewards/margins": 7.75, + "rewards/rejected": -6.6875, + "step": 1276 + }, + { + "epoch": 1.5668711656441716, + "grad_norm": 16.29793475802765, + "learning_rate": 2.4132231404958676e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.412109375, + "logps/chosen": -352.0, + "logps/rejected": -320.0, + "loss": 0.0802, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.5390625, + "rewards/margins": 7.15625, + "rewards/rejected": -6.625, + "step": 1277 + }, + { + "epoch": 1.5680981595092025, + "grad_norm": 12.613256761700807, + "learning_rate": 2.411157024793388e-07, + "logits/chosen": -0.234375, + "logits/rejected": -0.44921875, + "logps/chosen": -396.0, + "logps/rejected": -356.0, + "loss": 0.0568, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.5078125, + "rewards/margins": 8.75, + "rewards/rejected": -7.21875, + "step": 1278 + }, + { + "epoch": 1.5693251533742332, + "grad_norm": 17.463784303388753, + "learning_rate": 2.409090909090909e-07, + "logits/chosen": -0.26171875, + "logits/rejected": -0.42578125, + "logps/chosen": -350.0, + "logps/rejected": -354.0, + "loss": 0.0887, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.7421875, + "rewards/margins": 7.125, + "rewards/rejected": -6.40625, + "step": 1279 + }, + { + "epoch": 1.5705521472392638, + "grad_norm": 13.965110907461401, + "learning_rate": 2.4070247933884295e-07, + "logits/chosen": -0.296875, + "logits/rejected": -0.431640625, + "logps/chosen": -428.0, + "logps/rejected": -386.0, + "loss": 0.0564, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.234375, + "rewards/margins": 8.3125, + "rewards/rejected": -7.0625, + "step": 1280 + }, + { + "epoch": 1.5717791411042945, + "grad_norm": 19.212054024670067, + "learning_rate": 2.4049586776859505e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.466796875, + "logps/chosen": -432.0, + "logps/rejected": -394.0, + "loss": 0.0885, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.6640625, + "rewards/margins": 8.6875, + "rewards/rejected": -7.0, + "step": 1281 + }, + { + "epoch": 1.5730061349693252, + "grad_norm": 15.669091584469413, + "learning_rate": 2.402892561983471e-07, + "logits/chosen": -0.05810546875, + "logits/rejected": -0.29296875, + "logps/chosen": -384.0, + "logps/rejected": -330.0, + "loss": 0.0679, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.984375, + "rewards/margins": 7.71875, + "rewards/rejected": -6.75, + "step": 1282 + }, + { + "epoch": 1.5742331288343558, + "grad_norm": 18.679730385515196, + "learning_rate": 2.4008264462809915e-07, + "logits/chosen": -0.10498046875, + "logits/rejected": -0.240234375, + "logps/chosen": -342.0, + "logps/rejected": -334.0, + "loss": 0.0951, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.26953125, + "rewards/margins": 7.34375, + "rewards/rejected": -7.0625, + "step": 1283 + }, + { + "epoch": 1.5754601226993865, + "grad_norm": 22.194396862605263, + "learning_rate": 2.3987603305785125e-07, + "logits/chosen": -0.177734375, + "logits/rejected": -0.349609375, + "logps/chosen": -392.0, + "logps/rejected": -368.0, + "loss": 0.1073, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.7890625, + "rewards/margins": 8.125, + "rewards/rejected": -7.34375, + "step": 1284 + }, + { + "epoch": 1.5766871165644172, + "grad_norm": 16.41690266198598, + "learning_rate": 2.396694214876033e-07, + "logits/chosen": -0.2138671875, + "logits/rejected": -0.458984375, + "logps/chosen": -412.0, + "logps/rejected": -370.0, + "loss": 0.0582, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.0078125, + "rewards/margins": 8.25, + "rewards/rejected": -7.25, + "step": 1285 + }, + { + "epoch": 1.5779141104294478, + "grad_norm": 14.215415690036984, + "learning_rate": 2.394628099173554e-07, + "logits/chosen": -0.171875, + "logits/rejected": -0.365234375, + "logps/chosen": -356.0, + "logps/rejected": -312.0, + "loss": 0.0573, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.69921875, + "rewards/margins": 7.96875, + "rewards/rejected": -7.25, + "step": 1286 + }, + { + "epoch": 1.5791411042944785, + "grad_norm": 16.634128782576898, + "learning_rate": 2.3925619834710744e-07, + "logits/chosen": -0.255859375, + "logits/rejected": -0.353515625, + "logps/chosen": -312.0, + "logps/rejected": -332.0, + "loss": 0.0828, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.30078125, + "rewards/margins": 7.75, + "rewards/rejected": -7.4375, + "step": 1287 + }, + { + "epoch": 1.5803680981595092, + "grad_norm": 17.96415518276842, + "learning_rate": 2.390495867768595e-07, + "logits/chosen": -0.2890625, + "logits/rejected": -0.482421875, + "logps/chosen": -382.0, + "logps/rejected": -360.0, + "loss": 0.0876, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.9765625, + "rewards/margins": 8.0625, + "rewards/rejected": -7.09375, + "step": 1288 + }, + { + "epoch": 1.5815950920245399, + "grad_norm": 17.54135326824253, + "learning_rate": 2.3884297520661154e-07, + "logits/chosen": -0.19140625, + "logits/rejected": -0.3359375, + "logps/chosen": -320.0, + "logps/rejected": -298.0, + "loss": 0.0915, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.3203125, + "rewards/margins": 7.5625, + "rewards/rejected": -7.25, + "step": 1289 + }, + { + "epoch": 1.5828220858895705, + "grad_norm": 15.281068791721923, + "learning_rate": 2.3863636363636364e-07, + "logits/chosen": -0.30078125, + "logits/rejected": -0.490234375, + "logps/chosen": -382.0, + "logps/rejected": -364.0, + "loss": 0.0646, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.53125, + "rewards/margins": 8.5625, + "rewards/rejected": -8.0625, + "step": 1290 + }, + { + "epoch": 1.5840490797546012, + "grad_norm": 15.489007232864498, + "learning_rate": 2.384297520661157e-07, + "logits/chosen": -0.18359375, + "logits/rejected": -0.310546875, + "logps/chosen": -356.0, + "logps/rejected": -330.0, + "loss": 0.0587, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.69921875, + "rewards/margins": 8.25, + "rewards/rejected": -7.5625, + "step": 1291 + }, + { + "epoch": 1.5852760736196319, + "grad_norm": 9.924958316993024, + "learning_rate": 2.3822314049586776e-07, + "logits/chosen": -0.306640625, + "logits/rejected": -0.4375, + "logps/chosen": -374.0, + "logps/rejected": -378.0, + "loss": 0.0478, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.828125, + "rewards/margins": 8.75, + "rewards/rejected": -7.9375, + "step": 1292 + }, + { + "epoch": 1.5865030674846625, + "grad_norm": 17.029896879243122, + "learning_rate": 2.3801652892561983e-07, + "logits/chosen": -0.1337890625, + "logits/rejected": -0.390625, + "logps/chosen": -406.0, + "logps/rejected": -340.0, + "loss": 0.0824, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.78125, + "rewards/margins": 8.0, + "rewards/rejected": -7.21875, + "step": 1293 + }, + { + "epoch": 1.5877300613496934, + "grad_norm": 11.25343034375505, + "learning_rate": 2.378099173553719e-07, + "logits/chosen": -0.203125, + "logits/rejected": -0.3984375, + "logps/chosen": -398.0, + "logps/rejected": -380.0, + "loss": 0.0535, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.84375, + "rewards/margins": 8.875, + "rewards/rejected": -8.0, + "step": 1294 + }, + { + "epoch": 1.588957055214724, + "grad_norm": 13.756477043290205, + "learning_rate": 2.3760330578512398e-07, + "logits/chosen": -0.32421875, + "logits/rejected": -0.5234375, + "logps/chosen": -360.0, + "logps/rejected": -336.0, + "loss": 0.0777, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.458984375, + "rewards/margins": 7.90625, + "rewards/rejected": -7.46875, + "step": 1295 + }, + { + "epoch": 1.5901840490797547, + "grad_norm": 24.097317575985585, + "learning_rate": 2.3739669421487603e-07, + "logits/chosen": -0.234375, + "logits/rejected": -0.3359375, + "logps/chosen": -382.0, + "logps/rejected": -356.0, + "loss": 0.1432, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.00860595703125, + "rewards/margins": 7.53125, + "rewards/rejected": -7.53125, + "step": 1296 + }, + { + "epoch": 1.5914110429447854, + "grad_norm": 18.639137723942607, + "learning_rate": 2.371900826446281e-07, + "logits/chosen": -0.169921875, + "logits/rejected": -0.34765625, + "logps/chosen": -404.0, + "logps/rejected": -348.0, + "loss": 0.0932, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.6328125, + "rewards/margins": 7.125, + "rewards/rejected": -6.5, + "step": 1297 + }, + { + "epoch": 1.592638036809816, + "grad_norm": 16.722845871384106, + "learning_rate": 2.3698347107438015e-07, + "logits/chosen": -0.181640625, + "logits/rejected": -0.30859375, + "logps/chosen": -404.0, + "logps/rejected": -374.0, + "loss": 0.0866, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.98828125, + "rewards/margins": 8.4375, + "rewards/rejected": -7.4375, + "step": 1298 + }, + { + "epoch": 1.5938650306748468, + "grad_norm": 12.712483405995942, + "learning_rate": 2.3677685950413222e-07, + "logits/chosen": -0.294921875, + "logits/rejected": -0.400390625, + "logps/chosen": -388.0, + "logps/rejected": -362.0, + "loss": 0.0648, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.369140625, + "rewards/margins": 7.65625, + "rewards/rejected": -7.3125, + "step": 1299 + }, + { + "epoch": 1.5950920245398774, + "grad_norm": 13.148205500869985, + "learning_rate": 2.3657024793388427e-07, + "logits/chosen": -0.1875, + "logits/rejected": -0.3984375, + "logps/chosen": -402.0, + "logps/rejected": -372.0, + "loss": 0.0578, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.7734375, + "rewards/margins": 8.3125, + "rewards/rejected": -7.53125, + "step": 1300 + }, + { + "epoch": 1.596319018404908, + "grad_norm": 16.957859936316087, + "learning_rate": 2.3636363636363634e-07, + "logits/chosen": -0.181640625, + "logits/rejected": -0.3828125, + "logps/chosen": -380.0, + "logps/rejected": -356.0, + "loss": 0.0811, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.314453125, + "rewards/margins": 7.65625, + "rewards/rejected": -7.34375, + "step": 1301 + }, + { + "epoch": 1.5975460122699388, + "grad_norm": 14.567161887436797, + "learning_rate": 2.3615702479338841e-07, + "logits/chosen": -0.3515625, + "logits/rejected": -0.484375, + "logps/chosen": -398.0, + "logps/rejected": -366.0, + "loss": 0.0837, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.125, + "rewards/margins": 8.875, + "rewards/rejected": -7.71875, + "step": 1302 + }, + { + "epoch": 1.5987730061349694, + "grad_norm": 11.923678072340595, + "learning_rate": 2.359504132231405e-07, + "logits/chosen": -0.2421875, + "logits/rejected": -0.451171875, + "logps/chosen": -436.0, + "logps/rejected": -366.0, + "loss": 0.0661, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.078125, + "rewards/margins": 8.8125, + "rewards/rejected": -7.71875, + "step": 1303 + }, + { + "epoch": 1.6, + "grad_norm": 10.437379787713072, + "learning_rate": 2.3574380165289254e-07, + "logits/chosen": -0.32421875, + "logits/rejected": -0.498046875, + "logps/chosen": -378.0, + "logps/rejected": -370.0, + "loss": 0.0521, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.98046875, + "rewards/margins": 8.8125, + "rewards/rejected": -7.8125, + "step": 1304 + }, + { + "epoch": 1.6012269938650308, + "grad_norm": 13.807692539109546, + "learning_rate": 2.355371900826446e-07, + "logits/chosen": -0.2216796875, + "logits/rejected": -0.369140625, + "logps/chosen": -340.0, + "logps/rejected": -332.0, + "loss": 0.0746, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.90625, + "rewards/margins": 7.96875, + "rewards/rejected": -7.0625, + "step": 1305 + }, + { + "epoch": 1.6024539877300614, + "grad_norm": 11.657020755749071, + "learning_rate": 2.3533057851239668e-07, + "logits/chosen": -0.294921875, + "logits/rejected": -0.396484375, + "logps/chosen": -402.0, + "logps/rejected": -350.0, + "loss": 0.05, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.90625, + "rewards/margins": 8.1875, + "rewards/rejected": -7.28125, + "step": 1306 + }, + { + "epoch": 1.603680981595092, + "grad_norm": 13.440305388111407, + "learning_rate": 2.3512396694214876e-07, + "logits/chosen": -0.279296875, + "logits/rejected": -0.48046875, + "logps/chosen": -438.0, + "logps/rejected": -368.0, + "loss": 0.0618, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.34375, + "rewards/margins": 8.25, + "rewards/rejected": -6.90625, + "step": 1307 + }, + { + "epoch": 1.6049079754601228, + "grad_norm": 12.414761446042062, + "learning_rate": 2.3491735537190083e-07, + "logits/chosen": -0.33984375, + "logits/rejected": -0.5, + "logps/chosen": -378.0, + "logps/rejected": -336.0, + "loss": 0.0565, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.015625, + "rewards/margins": 7.96875, + "rewards/rejected": -6.96875, + "step": 1308 + }, + { + "epoch": 1.6061349693251534, + "grad_norm": 13.555100426493926, + "learning_rate": 2.3471074380165288e-07, + "logits/chosen": -0.26953125, + "logits/rejected": -0.404296875, + "logps/chosen": -386.0, + "logps/rejected": -356.0, + "loss": 0.0678, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.68359375, + "rewards/margins": 7.9375, + "rewards/rejected": -7.25, + "step": 1309 + }, + { + "epoch": 1.607361963190184, + "grad_norm": 12.969077369696661, + "learning_rate": 2.3450413223140495e-07, + "logits/chosen": -0.212890625, + "logits/rejected": -0.375, + "logps/chosen": -328.0, + "logps/rejected": -322.0, + "loss": 0.065, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.15625, + "rewards/margins": 8.1875, + "rewards/rejected": -7.03125, + "step": 1310 + }, + { + "epoch": 1.6085889570552148, + "grad_norm": 17.22103366682144, + "learning_rate": 2.3429752066115702e-07, + "logits/chosen": -0.1767578125, + "logits/rejected": -0.361328125, + "logps/chosen": -412.0, + "logps/rejected": -344.0, + "loss": 0.1049, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.70703125, + "rewards/margins": 6.8125, + "rewards/rejected": -6.125, + "step": 1311 + }, + { + "epoch": 1.6098159509202454, + "grad_norm": 12.021177394309591, + "learning_rate": 2.340909090909091e-07, + "logits/chosen": -0.28515625, + "logits/rejected": -0.51171875, + "logps/chosen": -400.0, + "logps/rejected": -350.0, + "loss": 0.0477, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.046875, + "rewards/margins": 8.5, + "rewards/rejected": -7.4375, + "step": 1312 + }, + { + "epoch": 1.611042944785276, + "grad_norm": 13.38847175785287, + "learning_rate": 2.3388429752066114e-07, + "logits/chosen": -0.2265625, + "logits/rejected": -0.375, + "logps/chosen": -364.0, + "logps/rejected": -336.0, + "loss": 0.0643, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.6015625, + "rewards/margins": 7.40625, + "rewards/rejected": -6.78125, + "step": 1313 + }, + { + "epoch": 1.6122699386503068, + "grad_norm": 11.347557248695258, + "learning_rate": 2.3367768595041322e-07, + "logits/chosen": -0.36328125, + "logits/rejected": -0.470703125, + "logps/chosen": -388.0, + "logps/rejected": -368.0, + "loss": 0.0432, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.390625, + "rewards/margins": 8.6875, + "rewards/rejected": -7.28125, + "step": 1314 + }, + { + "epoch": 1.6134969325153374, + "grad_norm": 20.681438762244568, + "learning_rate": 2.334710743801653e-07, + "logits/chosen": -0.240234375, + "logits/rejected": -0.470703125, + "logps/chosen": -442.0, + "logps/rejected": -376.0, + "loss": 0.0992, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 1.34375, + "rewards/margins": 8.0, + "rewards/rejected": -6.65625, + "step": 1315 + }, + { + "epoch": 1.614723926380368, + "grad_norm": 15.536280018990086, + "learning_rate": 2.3326446280991734e-07, + "logits/chosen": -0.11865234375, + "logits/rejected": -0.298828125, + "logps/chosen": -370.0, + "logps/rejected": -328.0, + "loss": 0.0785, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.625, + "rewards/margins": 7.15625, + "rewards/rejected": -6.53125, + "step": 1316 + }, + { + "epoch": 1.6159509202453988, + "grad_norm": 14.275376838860963, + "learning_rate": 2.330578512396694e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.37890625, + "logps/chosen": -382.0, + "logps/rejected": -366.0, + "loss": 0.0682, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.75, + "rewards/margins": 6.96875, + "rewards/rejected": -6.21875, + "step": 1317 + }, + { + "epoch": 1.6171779141104294, + "grad_norm": 10.64444423178702, + "learning_rate": 2.3285123966942146e-07, + "logits/chosen": -0.21484375, + "logits/rejected": -0.41796875, + "logps/chosen": -382.0, + "logps/rejected": -338.0, + "loss": 0.044, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.703125, + "rewards/margins": 7.6875, + "rewards/rejected": -6.96875, + "step": 1318 + }, + { + "epoch": 1.61840490797546, + "grad_norm": 14.588160883500564, + "learning_rate": 2.3264462809917353e-07, + "logits/chosen": -0.2373046875, + "logits/rejected": -0.39453125, + "logps/chosen": -382.0, + "logps/rejected": -376.0, + "loss": 0.0618, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.125, + "rewards/margins": 7.84375, + "rewards/rejected": -6.71875, + "step": 1319 + }, + { + "epoch": 1.6196319018404908, + "grad_norm": 15.839589377719077, + "learning_rate": 2.324380165289256e-07, + "logits/chosen": -0.1943359375, + "logits/rejected": -0.37890625, + "logps/chosen": -430.0, + "logps/rejected": -358.0, + "loss": 0.0758, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.25, + "rewards/margins": 7.59375, + "rewards/rejected": -6.34375, + "step": 1320 + }, + { + "epoch": 1.6208588957055214, + "grad_norm": 27.334880455985346, + "learning_rate": 2.3223140495867768e-07, + "logits/chosen": -0.244140625, + "logits/rejected": -0.380859375, + "logps/chosen": -376.0, + "logps/rejected": -332.0, + "loss": 0.0942, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 1.140625, + "rewards/margins": 8.0, + "rewards/rejected": -6.875, + "step": 1321 + }, + { + "epoch": 1.622085889570552, + "grad_norm": 15.40927134276531, + "learning_rate": 2.3202479338842973e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.423828125, + "logps/chosen": -358.0, + "logps/rejected": -350.0, + "loss": 0.0662, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.7265625, + "rewards/margins": 7.28125, + "rewards/rejected": -6.5625, + "step": 1322 + }, + { + "epoch": 1.6233128834355828, + "grad_norm": 12.702315706196249, + "learning_rate": 2.318181818181818e-07, + "logits/chosen": -0.09814453125, + "logits/rejected": -0.291015625, + "logps/chosen": -326.0, + "logps/rejected": -326.0, + "loss": 0.06, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.89453125, + "rewards/margins": 7.375, + "rewards/rejected": -6.46875, + "step": 1323 + }, + { + "epoch": 1.6245398773006134, + "grad_norm": 17.951923057589752, + "learning_rate": 2.3161157024793387e-07, + "logits/chosen": -0.2431640625, + "logits/rejected": -0.462890625, + "logps/chosen": -408.0, + "logps/rejected": -342.0, + "loss": 0.0956, + "rewards/accuracies": 0.953125, + "rewards/chosen": 1.1484375, + "rewards/margins": 7.625, + "rewards/rejected": -6.5, + "step": 1324 + }, + { + "epoch": 1.6257668711656441, + "grad_norm": 14.74376030616997, + "learning_rate": 2.3140495867768595e-07, + "logits/chosen": -0.1259765625, + "logits/rejected": -0.380859375, + "logps/chosen": -378.0, + "logps/rejected": -340.0, + "loss": 0.08, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.69921875, + "rewards/margins": 7.40625, + "rewards/rejected": -6.6875, + "step": 1325 + }, + { + "epoch": 1.6269938650306748, + "grad_norm": 16.786676256329944, + "learning_rate": 2.3119834710743802e-07, + "logits/chosen": -0.248046875, + "logits/rejected": -0.392578125, + "logps/chosen": -402.0, + "logps/rejected": -364.0, + "loss": 0.0723, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.89453125, + "rewards/margins": 7.84375, + "rewards/rejected": -6.96875, + "step": 1326 + }, + { + "epoch": 1.6282208588957054, + "grad_norm": 20.567770397900244, + "learning_rate": 2.3099173553719007e-07, + "logits/chosen": -0.1767578125, + "logits/rejected": -0.30078125, + "logps/chosen": -358.0, + "logps/rejected": -354.0, + "loss": 0.0912, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.5625, + "rewards/margins": 7.03125, + "rewards/rejected": -6.46875, + "step": 1327 + }, + { + "epoch": 1.6294478527607361, + "grad_norm": 15.051279679825173, + "learning_rate": 2.3078512396694214e-07, + "logits/chosen": -0.25, + "logits/rejected": -0.46484375, + "logps/chosen": -402.0, + "logps/rejected": -348.0, + "loss": 0.0622, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.81640625, + "rewards/margins": 7.96875, + "rewards/rejected": -7.15625, + "step": 1328 + }, + { + "epoch": 1.6306748466257668, + "grad_norm": 15.9994478939779, + "learning_rate": 2.3057851239669422e-07, + "logits/chosen": -0.3046875, + "logits/rejected": -0.4765625, + "logps/chosen": -410.0, + "logps/rejected": -364.0, + "loss": 0.0821, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.640625, + "rewards/margins": 7.15625, + "rewards/rejected": -6.53125, + "step": 1329 + }, + { + "epoch": 1.6319018404907975, + "grad_norm": 26.168100343892643, + "learning_rate": 2.303719008264463e-07, + "logits/chosen": -0.189453125, + "logits/rejected": -0.392578125, + "logps/chosen": -396.0, + "logps/rejected": -354.0, + "loss": 0.0993, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.51171875, + "rewards/margins": 7.34375, + "rewards/rejected": -6.84375, + "step": 1330 + }, + { + "epoch": 1.6331288343558281, + "grad_norm": 10.879007538610207, + "learning_rate": 2.3016528925619834e-07, + "logits/chosen": -0.2216796875, + "logits/rejected": -0.298828125, + "logps/chosen": -354.0, + "logps/rejected": -334.0, + "loss": 0.0467, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.177734375, + "rewards/margins": 7.65625, + "rewards/rejected": -7.5, + "step": 1331 + }, + { + "epoch": 1.6343558282208588, + "grad_norm": 13.446509397161874, + "learning_rate": 2.299586776859504e-07, + "logits/chosen": -0.32421875, + "logits/rejected": -0.478515625, + "logps/chosen": -376.0, + "logps/rejected": -344.0, + "loss": 0.057, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.56640625, + "rewards/margins": 7.75, + "rewards/rejected": -7.1875, + "step": 1332 + }, + { + "epoch": 1.6355828220858895, + "grad_norm": 16.15127863637118, + "learning_rate": 2.2975206611570246e-07, + "logits/chosen": -0.333984375, + "logits/rejected": -0.494140625, + "logps/chosen": -406.0, + "logps/rejected": -392.0, + "loss": 0.0739, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.68359375, + "rewards/margins": 7.84375, + "rewards/rejected": -7.15625, + "step": 1333 + }, + { + "epoch": 1.6368098159509201, + "grad_norm": 17.534743533253806, + "learning_rate": 2.2954545454545453e-07, + "logits/chosen": -0.1787109375, + "logits/rejected": -0.32421875, + "logps/chosen": -376.0, + "logps/rejected": -354.0, + "loss": 0.0743, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.0390625, + "rewards/margins": 8.125, + "rewards/rejected": -7.0625, + "step": 1334 + }, + { + "epoch": 1.6380368098159508, + "grad_norm": 18.52826988873188, + "learning_rate": 2.293388429752066e-07, + "logits/chosen": -0.3046875, + "logits/rejected": -0.5078125, + "logps/chosen": -428.0, + "logps/rejected": -348.0, + "loss": 0.0651, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.6171875, + "rewards/margins": 8.3125, + "rewards/rejected": -6.71875, + "step": 1335 + }, + { + "epoch": 1.6392638036809815, + "grad_norm": 17.965308466389157, + "learning_rate": 2.2913223140495865e-07, + "logits/chosen": -0.40625, + "logits/rejected": -0.57421875, + "logps/chosen": -430.0, + "logps/rejected": -384.0, + "loss": 0.0763, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.2021484375, + "rewards/margins": 7.625, + "rewards/rejected": -7.40625, + "step": 1336 + }, + { + "epoch": 1.6404907975460121, + "grad_norm": 10.012028012421737, + "learning_rate": 2.2892561983471072e-07, + "logits/chosen": -0.255859375, + "logits/rejected": -0.4296875, + "logps/chosen": -404.0, + "logps/rejected": -340.0, + "loss": 0.0415, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.15625, + "rewards/margins": 8.4375, + "rewards/rejected": -7.3125, + "step": 1337 + }, + { + "epoch": 1.6417177914110428, + "grad_norm": 14.173589367800568, + "learning_rate": 2.287190082644628e-07, + "logits/chosen": -0.310546875, + "logits/rejected": -0.462890625, + "logps/chosen": -422.0, + "logps/rejected": -368.0, + "loss": 0.0653, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 1.3125, + "rewards/margins": 8.3125, + "rewards/rejected": -7.03125, + "step": 1338 + }, + { + "epoch": 1.6429447852760735, + "grad_norm": 15.30036128462874, + "learning_rate": 2.2851239669421487e-07, + "logits/chosen": -0.2109375, + "logits/rejected": -0.27734375, + "logps/chosen": -382.0, + "logps/rejected": -306.0, + "loss": 0.0705, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.9140625, + "rewards/margins": 7.25, + "rewards/rejected": -6.34375, + "step": 1339 + }, + { + "epoch": 1.6441717791411041, + "grad_norm": 20.532171898033436, + "learning_rate": 2.2830578512396692e-07, + "logits/chosen": -0.1474609375, + "logits/rejected": -0.3125, + "logps/chosen": -404.0, + "logps/rejected": -358.0, + "loss": 0.1092, + "rewards/accuracies": 0.9453125, + "rewards/chosen": 0.96875, + "rewards/margins": 7.65625, + "rewards/rejected": -6.6875, + "step": 1340 + }, + { + "epoch": 1.645398773006135, + "grad_norm": 12.679548714943563, + "learning_rate": 2.28099173553719e-07, + "logits/chosen": -0.283203125, + "logits/rejected": -0.50390625, + "logps/chosen": -434.0, + "logps/rejected": -356.0, + "loss": 0.0602, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.09375, + "rewards/margins": 8.5, + "rewards/rejected": -7.40625, + "step": 1341 + }, + { + "epoch": 1.6466257668711657, + "grad_norm": 11.115897839454503, + "learning_rate": 2.2789256198347107e-07, + "logits/chosen": -0.306640625, + "logits/rejected": -0.52734375, + "logps/chosen": -406.0, + "logps/rejected": -342.0, + "loss": 0.0627, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.94140625, + "rewards/margins": 7.75, + "rewards/rejected": -6.8125, + "step": 1342 + }, + { + "epoch": 1.6478527607361964, + "grad_norm": 34.12595608491008, + "learning_rate": 2.2768595041322314e-07, + "logits/chosen": -0.251953125, + "logits/rejected": -0.4765625, + "logps/chosen": -400.0, + "logps/rejected": -366.0, + "loss": 0.0922, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.57421875, + "rewards/margins": 7.78125, + "rewards/rejected": -7.1875, + "step": 1343 + }, + { + "epoch": 1.649079754601227, + "grad_norm": 9.48136341146751, + "learning_rate": 2.2747933884297519e-07, + "logits/chosen": -0.2353515625, + "logits/rejected": -0.48046875, + "logps/chosen": -430.0, + "logps/rejected": -352.0, + "loss": 0.0335, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.6171875, + "rewards/margins": 8.875, + "rewards/rejected": -7.28125, + "step": 1344 + }, + { + "epoch": 1.6503067484662577, + "grad_norm": 12.960501739052496, + "learning_rate": 2.2727272727272726e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.427734375, + "logps/chosen": -416.0, + "logps/rejected": -344.0, + "loss": 0.0613, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.81640625, + "rewards/margins": 7.34375, + "rewards/rejected": -6.53125, + "step": 1345 + }, + { + "epoch": 1.6515337423312884, + "grad_norm": 18.807785986855734, + "learning_rate": 2.2706611570247933e-07, + "logits/chosen": -0.2080078125, + "logits/rejected": -0.412109375, + "logps/chosen": -432.0, + "logps/rejected": -358.0, + "loss": 0.0758, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.4765625, + "rewards/margins": 8.125, + "rewards/rejected": -6.65625, + "step": 1346 + }, + { + "epoch": 1.652760736196319, + "grad_norm": 23.673167761409484, + "learning_rate": 2.268595041322314e-07, + "logits/chosen": -0.2255859375, + "logits/rejected": -0.3984375, + "logps/chosen": -414.0, + "logps/rejected": -386.0, + "loss": 0.1326, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.140625, + "rewards/margins": 8.0625, + "rewards/rejected": -6.90625, + "step": 1347 + }, + { + "epoch": 1.6539877300613497, + "grad_norm": 16.122336216772645, + "learning_rate": 2.2665289256198348e-07, + "logits/chosen": -0.2314453125, + "logits/rejected": -0.4140625, + "logps/chosen": -336.0, + "logps/rejected": -346.0, + "loss": 0.0849, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.34375, + "rewards/margins": 7.5, + "rewards/rejected": -7.15625, + "step": 1348 + }, + { + "epoch": 1.6552147239263804, + "grad_norm": 14.86877919579818, + "learning_rate": 2.2644628099173553e-07, + "logits/chosen": -0.2119140625, + "logits/rejected": -0.427734375, + "logps/chosen": -364.0, + "logps/rejected": -346.0, + "loss": 0.07, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.1875, + "rewards/margins": 8.1875, + "rewards/rejected": -7.0, + "step": 1349 + }, + { + "epoch": 1.656441717791411, + "grad_norm": 18.59741646820723, + "learning_rate": 2.262396694214876e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.439453125, + "logps/chosen": -426.0, + "logps/rejected": -392.0, + "loss": 0.0808, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 1.109375, + "rewards/margins": 8.3125, + "rewards/rejected": -7.21875, + "step": 1350 + }, + { + "epoch": 1.6576687116564417, + "grad_norm": 21.166780009343633, + "learning_rate": 2.2603305785123965e-07, + "logits/chosen": -0.2060546875, + "logits/rejected": -0.36328125, + "logps/chosen": -392.0, + "logps/rejected": -362.0, + "loss": 0.1151, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.6171875, + "rewards/margins": 8.1875, + "rewards/rejected": -7.59375, + "step": 1351 + }, + { + "epoch": 1.6588957055214724, + "grad_norm": 15.585122070103669, + "learning_rate": 2.2582644628099172e-07, + "logits/chosen": -0.28515625, + "logits/rejected": -0.462890625, + "logps/chosen": -384.0, + "logps/rejected": -362.0, + "loss": 0.0668, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.61328125, + "rewards/margins": 8.375, + "rewards/rejected": -7.78125, + "step": 1352 + }, + { + "epoch": 1.660122699386503, + "grad_norm": 14.880046371397333, + "learning_rate": 2.2561983471074377e-07, + "logits/chosen": -0.20703125, + "logits/rejected": -0.267578125, + "logps/chosen": -370.0, + "logps/rejected": -376.0, + "loss": 0.0768, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.38671875, + "rewards/margins": 7.46875, + "rewards/rejected": -7.09375, + "step": 1353 + }, + { + "epoch": 1.6613496932515337, + "grad_norm": 12.298220568655871, + "learning_rate": 2.2541322314049584e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.4140625, + "logps/chosen": -368.0, + "logps/rejected": -360.0, + "loss": 0.0605, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.470703125, + "rewards/margins": 8.3125, + "rewards/rejected": -7.84375, + "step": 1354 + }, + { + "epoch": 1.6625766871165644, + "grad_norm": 15.107596299136095, + "learning_rate": 2.2520661157024792e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.431640625, + "logps/chosen": -418.0, + "logps/rejected": -388.0, + "loss": 0.0804, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.3515625, + "rewards/margins": 8.0625, + "rewards/rejected": -7.6875, + "step": 1355 + }, + { + "epoch": 1.6638036809815953, + "grad_norm": 17.54774623851973, + "learning_rate": 2.25e-07, + "logits/chosen": -0.2373046875, + "logits/rejected": -0.390625, + "logps/chosen": -406.0, + "logps/rejected": -370.0, + "loss": 0.0853, + "rewards/accuracies": 0.9765625, + "rewards/chosen": -0.1875, + "rewards/margins": 7.78125, + "rewards/rejected": -7.96875, + "step": 1356 + }, + { + "epoch": 1.665030674846626, + "grad_norm": 15.166063658984665, + "learning_rate": 2.2479338842975206e-07, + "logits/chosen": -0.2119140625, + "logits/rejected": -0.423828125, + "logps/chosen": -434.0, + "logps/rejected": -374.0, + "loss": 0.0497, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.51953125, + "rewards/margins": 8.5625, + "rewards/rejected": -8.0, + "step": 1357 + }, + { + "epoch": 1.6662576687116566, + "grad_norm": 23.759115740771684, + "learning_rate": 2.245867768595041e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.51953125, + "logps/chosen": -394.0, + "logps/rejected": -356.0, + "loss": 0.1185, + "rewards/accuracies": 0.953125, + "rewards/chosen": 0.357421875, + "rewards/margins": 7.9375, + "rewards/rejected": -7.59375, + "step": 1358 + }, + { + "epoch": 1.6674846625766873, + "grad_norm": 14.218582322990752, + "learning_rate": 2.2438016528925618e-07, + "logits/chosen": -0.203125, + "logits/rejected": -0.40625, + "logps/chosen": -408.0, + "logps/rejected": -374.0, + "loss": 0.0612, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.75390625, + "rewards/margins": 8.6875, + "rewards/rejected": -7.90625, + "step": 1359 + }, + { + "epoch": 1.668711656441718, + "grad_norm": 17.592110754219437, + "learning_rate": 2.2417355371900826e-07, + "logits/chosen": -0.44140625, + "logits/rejected": -0.671875, + "logps/chosen": -392.0, + "logps/rejected": -350.0, + "loss": 0.0717, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.7265625, + "rewards/margins": 9.0, + "rewards/rejected": -8.3125, + "step": 1360 + }, + { + "epoch": 1.6699386503067486, + "grad_norm": 16.188924499926596, + "learning_rate": 2.2396694214876033e-07, + "logits/chosen": -0.1669921875, + "logits/rejected": -0.349609375, + "logps/chosen": -412.0, + "logps/rejected": -386.0, + "loss": 0.0774, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.640625, + "rewards/margins": 7.9375, + "rewards/rejected": -7.3125, + "step": 1361 + }, + { + "epoch": 1.6711656441717793, + "grad_norm": 15.361293153530223, + "learning_rate": 2.2376033057851238e-07, + "logits/chosen": -0.185546875, + "logits/rejected": -0.33984375, + "logps/chosen": -400.0, + "logps/rejected": -340.0, + "loss": 0.0737, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.70703125, + "rewards/margins": 8.25, + "rewards/rejected": -7.53125, + "step": 1362 + }, + { + "epoch": 1.67239263803681, + "grad_norm": 8.341032677993777, + "learning_rate": 2.2355371900826445e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.48046875, + "logps/chosen": -400.0, + "logps/rejected": -338.0, + "loss": 0.0301, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.40625, + "rewards/margins": 8.75, + "rewards/rejected": -8.375, + "step": 1363 + }, + { + "epoch": 1.6736196319018406, + "grad_norm": 12.421668434382628, + "learning_rate": 2.2334710743801653e-07, + "logits/chosen": -0.1572265625, + "logits/rejected": -0.337890625, + "logps/chosen": -370.0, + "logps/rejected": -320.0, + "loss": 0.0541, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.828125, + "rewards/margins": 8.3125, + "rewards/rejected": -7.46875, + "step": 1364 + }, + { + "epoch": 1.6748466257668713, + "grad_norm": 19.457292895572753, + "learning_rate": 2.231404958677686e-07, + "logits/chosen": -0.1318359375, + "logits/rejected": -0.314453125, + "logps/chosen": -404.0, + "logps/rejected": -334.0, + "loss": 0.0932, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 1.0078125, + "rewards/margins": 8.4375, + "rewards/rejected": -7.40625, + "step": 1365 + }, + { + "epoch": 1.676073619631902, + "grad_norm": 12.148316797835403, + "learning_rate": 2.2293388429752067e-07, + "logits/chosen": -0.185546875, + "logits/rejected": -0.41015625, + "logps/chosen": -394.0, + "logps/rejected": -340.0, + "loss": 0.0526, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.171875, + "rewards/margins": 8.4375, + "rewards/rejected": -7.25, + "step": 1366 + }, + { + "epoch": 1.6773006134969326, + "grad_norm": 18.305089562800763, + "learning_rate": 2.2272727272727272e-07, + "logits/chosen": -0.1611328125, + "logits/rejected": -0.314453125, + "logps/chosen": -390.0, + "logps/rejected": -362.0, + "loss": 0.0841, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.0859375, + "rewards/margins": 8.5625, + "rewards/rejected": -7.46875, + "step": 1367 + }, + { + "epoch": 1.6785276073619633, + "grad_norm": 18.572318285517575, + "learning_rate": 2.225206611570248e-07, + "logits/chosen": -0.365234375, + "logits/rejected": -0.5234375, + "logps/chosen": -398.0, + "logps/rejected": -356.0, + "loss": 0.074, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.5703125, + "rewards/margins": 8.375, + "rewards/rejected": -7.8125, + "step": 1368 + }, + { + "epoch": 1.679754601226994, + "grad_norm": 19.9117710225746, + "learning_rate": 2.2231404958677684e-07, + "logits/chosen": -0.310546875, + "logits/rejected": -0.5078125, + "logps/chosen": -400.0, + "logps/rejected": -358.0, + "loss": 0.106, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.43359375, + "rewards/margins": 7.5625, + "rewards/rejected": -7.125, + "step": 1369 + }, + { + "epoch": 1.6809815950920246, + "grad_norm": 15.686180424711136, + "learning_rate": 2.2210743801652891e-07, + "logits/chosen": -0.244140625, + "logits/rejected": -0.373046875, + "logps/chosen": -378.0, + "logps/rejected": -370.0, + "loss": 0.0619, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.95703125, + "rewards/margins": 8.5625, + "rewards/rejected": -7.59375, + "step": 1370 + }, + { + "epoch": 1.6822085889570553, + "grad_norm": 18.767760847804734, + "learning_rate": 2.2190082644628096e-07, + "logits/chosen": -0.1806640625, + "logits/rejected": -0.455078125, + "logps/chosen": -462.0, + "logps/rejected": -392.0, + "loss": 0.0866, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 1.3515625, + "rewards/margins": 8.75, + "rewards/rejected": -7.40625, + "step": 1371 + }, + { + "epoch": 1.683435582822086, + "grad_norm": 14.184679430176294, + "learning_rate": 2.2169421487603303e-07, + "logits/chosen": -0.2333984375, + "logits/rejected": -0.458984375, + "logps/chosen": -388.0, + "logps/rejected": -348.0, + "loss": 0.0663, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.15625, + "rewards/margins": 8.4375, + "rewards/rejected": -7.25, + "step": 1372 + }, + { + "epoch": 1.6846625766871166, + "grad_norm": 16.224614188238743, + "learning_rate": 2.214876033057851e-07, + "logits/chosen": -0.2001953125, + "logits/rejected": -0.296875, + "logps/chosen": -372.0, + "logps/rejected": -376.0, + "loss": 0.0656, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.91015625, + "rewards/margins": 8.1875, + "rewards/rejected": -7.25, + "step": 1373 + }, + { + "epoch": 1.6858895705521473, + "grad_norm": 17.941736123412625, + "learning_rate": 2.2128099173553718e-07, + "logits/chosen": -0.138671875, + "logits/rejected": -0.365234375, + "logps/chosen": -392.0, + "logps/rejected": -334.0, + "loss": 0.0966, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.416015625, + "rewards/margins": 7.28125, + "rewards/rejected": -6.84375, + "step": 1374 + }, + { + "epoch": 1.687116564417178, + "grad_norm": 17.848589060773275, + "learning_rate": 2.2107438016528926e-07, + "logits/chosen": -0.1650390625, + "logits/rejected": -0.28125, + "logps/chosen": -324.0, + "logps/rejected": -324.0, + "loss": 0.0882, + "rewards/accuracies": 0.953125, + "rewards/chosen": 0.59765625, + "rewards/margins": 7.40625, + "rewards/rejected": -6.8125, + "step": 1375 + }, + { + "epoch": 1.6883435582822086, + "grad_norm": 11.38717599254382, + "learning_rate": 2.208677685950413e-07, + "logits/chosen": -0.302734375, + "logits/rejected": -0.416015625, + "logps/chosen": -356.0, + "logps/rejected": -362.0, + "loss": 0.0518, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.8359375, + "rewards/margins": 8.125, + "rewards/rejected": -7.3125, + "step": 1376 + }, + { + "epoch": 1.6895705521472393, + "grad_norm": 14.720332823269564, + "learning_rate": 2.2066115702479338e-07, + "logits/chosen": -0.275390625, + "logits/rejected": -0.45703125, + "logps/chosen": -356.0, + "logps/rejected": -342.0, + "loss": 0.0616, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.1328125, + "rewards/margins": 8.875, + "rewards/rejected": -7.71875, + "step": 1377 + }, + { + "epoch": 1.69079754601227, + "grad_norm": 13.510981013957442, + "learning_rate": 2.2045454545454545e-07, + "logits/chosen": -0.2490234375, + "logits/rejected": -0.423828125, + "logps/chosen": -362.0, + "logps/rejected": -324.0, + "loss": 0.0651, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.283203125, + "rewards/margins": 6.96875, + "rewards/rejected": -6.6875, + "step": 1378 + }, + { + "epoch": 1.6920245398773006, + "grad_norm": 18.434706532368633, + "learning_rate": 2.2024793388429752e-07, + "logits/chosen": -0.26171875, + "logits/rejected": -0.4140625, + "logps/chosen": -406.0, + "logps/rejected": -342.0, + "loss": 0.0931, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.0078125, + "rewards/margins": 7.28125, + "rewards/rejected": -6.28125, + "step": 1379 + }, + { + "epoch": 1.6932515337423313, + "grad_norm": 12.034468321990309, + "learning_rate": 2.2004132231404957e-07, + "logits/chosen": -0.2109375, + "logits/rejected": -0.43359375, + "logps/chosen": -418.0, + "logps/rejected": -320.0, + "loss": 0.0512, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.171875, + "rewards/margins": 7.8125, + "rewards/rejected": -6.65625, + "step": 1380 + }, + { + "epoch": 1.694478527607362, + "grad_norm": 15.645405456809128, + "learning_rate": 2.1983471074380164e-07, + "logits/chosen": -0.1533203125, + "logits/rejected": -0.19140625, + "logps/chosen": -360.0, + "logps/rejected": -330.0, + "loss": 0.0782, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.4921875, + "rewards/margins": 6.78125, + "rewards/rejected": -6.3125, + "step": 1381 + }, + { + "epoch": 1.6957055214723926, + "grad_norm": 16.91884584124202, + "learning_rate": 2.1962809917355372e-07, + "logits/chosen": -0.216796875, + "logits/rejected": -0.337890625, + "logps/chosen": -344.0, + "logps/rejected": -342.0, + "loss": 0.0816, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.326171875, + "rewards/margins": 7.21875, + "rewards/rejected": -6.875, + "step": 1382 + }, + { + "epoch": 1.6969325153374233, + "grad_norm": 11.903486632622387, + "learning_rate": 2.194214876033058e-07, + "logits/chosen": -0.228515625, + "logits/rejected": -0.42578125, + "logps/chosen": -384.0, + "logps/rejected": -356.0, + "loss": 0.0562, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.2421875, + "rewards/margins": 7.9375, + "rewards/rejected": -6.6875, + "step": 1383 + }, + { + "epoch": 1.698159509202454, + "grad_norm": 17.069495831518065, + "learning_rate": 2.1921487603305786e-07, + "logits/chosen": -0.109375, + "logits/rejected": -0.2255859375, + "logps/chosen": -364.0, + "logps/rejected": -318.0, + "loss": 0.079, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.58984375, + "rewards/margins": 6.96875, + "rewards/rejected": -6.375, + "step": 1384 + }, + { + "epoch": 1.6993865030674846, + "grad_norm": 19.747804821888522, + "learning_rate": 2.190082644628099e-07, + "logits/chosen": -0.2265625, + "logits/rejected": -0.3515625, + "logps/chosen": -324.0, + "logps/rejected": -308.0, + "loss": 0.1035, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.88671875, + "rewards/margins": 7.375, + "rewards/rejected": -6.46875, + "step": 1385 + }, + { + "epoch": 1.7006134969325153, + "grad_norm": 13.581915417491894, + "learning_rate": 2.1880165289256198e-07, + "logits/chosen": -0.357421875, + "logits/rejected": -0.57421875, + "logps/chosen": -414.0, + "logps/rejected": -370.0, + "loss": 0.0691, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.53125, + "rewards/margins": 8.5625, + "rewards/rejected": -7.0, + "step": 1386 + }, + { + "epoch": 1.701840490797546, + "grad_norm": 14.596333416373868, + "learning_rate": 2.1859504132231403e-07, + "logits/chosen": -0.291015625, + "logits/rejected": -0.48046875, + "logps/chosen": -424.0, + "logps/rejected": -404.0, + "loss": 0.0695, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.21875, + "rewards/margins": 8.3125, + "rewards/rejected": -7.09375, + "step": 1387 + }, + { + "epoch": 1.7030674846625766, + "grad_norm": 13.484939157978427, + "learning_rate": 2.183884297520661e-07, + "logits/chosen": -0.1318359375, + "logits/rejected": -0.265625, + "logps/chosen": -370.0, + "logps/rejected": -318.0, + "loss": 0.0627, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.427734375, + "rewards/margins": 6.90625, + "rewards/rejected": -6.46875, + "step": 1388 + }, + { + "epoch": 1.7042944785276073, + "grad_norm": 17.094111554639458, + "learning_rate": 2.1818181818181815e-07, + "logits/chosen": -0.3515625, + "logits/rejected": -0.47265625, + "logps/chosen": -404.0, + "logps/rejected": -372.0, + "loss": 0.0868, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.140625, + "rewards/margins": 8.125, + "rewards/rejected": -6.96875, + "step": 1389 + }, + { + "epoch": 1.705521472392638, + "grad_norm": 16.274828434391722, + "learning_rate": 2.1797520661157023e-07, + "logits/chosen": -0.255859375, + "logits/rejected": -0.392578125, + "logps/chosen": -368.0, + "logps/rejected": -348.0, + "loss": 0.0716, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.78515625, + "rewards/margins": 7.96875, + "rewards/rejected": -7.1875, + "step": 1390 + }, + { + "epoch": 1.7067484662576686, + "grad_norm": 11.87067599264675, + "learning_rate": 2.177685950413223e-07, + "logits/chosen": -0.2412109375, + "logits/rejected": -0.4921875, + "logps/chosen": -390.0, + "logps/rejected": -352.0, + "loss": 0.0632, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.3359375, + "rewards/margins": 7.84375, + "rewards/rejected": -6.5, + "step": 1391 + }, + { + "epoch": 1.7079754601226993, + "grad_norm": 17.25338097827695, + "learning_rate": 2.1756198347107437e-07, + "logits/chosen": -0.1162109375, + "logits/rejected": -0.28125, + "logps/chosen": -354.0, + "logps/rejected": -310.0, + "loss": 0.0945, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.5234375, + "rewards/margins": 6.6875, + "rewards/rejected": -6.15625, + "step": 1392 + }, + { + "epoch": 1.70920245398773, + "grad_norm": 16.42960478781209, + "learning_rate": 2.1735537190082642e-07, + "logits/chosen": -0.28515625, + "logits/rejected": -0.47265625, + "logps/chosen": -370.0, + "logps/rejected": -310.0, + "loss": 0.0731, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.125, + "rewards/margins": 7.46875, + "rewards/rejected": -6.34375, + "step": 1393 + }, + { + "epoch": 1.7104294478527606, + "grad_norm": 18.523314751619992, + "learning_rate": 2.171487603305785e-07, + "logits/chosen": -0.33203125, + "logits/rejected": -0.494140625, + "logps/chosen": -398.0, + "logps/rejected": -344.0, + "loss": 0.0852, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.0, + "rewards/margins": 7.9375, + "rewards/rejected": -6.9375, + "step": 1394 + }, + { + "epoch": 1.7116564417177913, + "grad_norm": 11.026592204166407, + "learning_rate": 2.1694214876033057e-07, + "logits/chosen": -0.2373046875, + "logits/rejected": -0.43359375, + "logps/chosen": -404.0, + "logps/rejected": -344.0, + "loss": 0.0515, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.0078125, + "rewards/margins": 7.4375, + "rewards/rejected": -6.4375, + "step": 1395 + }, + { + "epoch": 1.712883435582822, + "grad_norm": 16.055124496226444, + "learning_rate": 2.1673553719008264e-07, + "logits/chosen": -0.09619140625, + "logits/rejected": -0.298828125, + "logps/chosen": -374.0, + "logps/rejected": -328.0, + "loss": 0.0724, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.25, + "rewards/margins": 8.3125, + "rewards/rejected": -7.03125, + "step": 1396 + }, + { + "epoch": 1.7141104294478526, + "grad_norm": 12.449061995438948, + "learning_rate": 2.1652892561983471e-07, + "logits/chosen": -0.2294921875, + "logits/rejected": -0.390625, + "logps/chosen": -382.0, + "logps/rejected": -342.0, + "loss": 0.0569, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.7578125, + "rewards/margins": 8.625, + "rewards/rejected": -6.84375, + "step": 1397 + }, + { + "epoch": 1.7153374233128833, + "grad_norm": 15.87205293658849, + "learning_rate": 2.1632231404958676e-07, + "logits/chosen": -0.1943359375, + "logits/rejected": -0.314453125, + "logps/chosen": -424.0, + "logps/rejected": -380.0, + "loss": 0.0678, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.3046875, + "rewards/margins": 7.9375, + "rewards/rejected": -6.65625, + "step": 1398 + }, + { + "epoch": 1.716564417177914, + "grad_norm": 19.398626301714504, + "learning_rate": 2.1611570247933884e-07, + "logits/chosen": -0.1494140625, + "logits/rejected": -0.275390625, + "logps/chosen": -354.0, + "logps/rejected": -362.0, + "loss": 0.0837, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.8125, + "rewards/margins": 7.375, + "rewards/rejected": -6.5625, + "step": 1399 + }, + { + "epoch": 1.7177914110429446, + "grad_norm": 15.517028901266931, + "learning_rate": 2.159090909090909e-07, + "logits/chosen": -0.1669921875, + "logits/rejected": -0.35546875, + "logps/chosen": -336.0, + "logps/rejected": -312.0, + "loss": 0.0559, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.349609375, + "rewards/margins": 7.1875, + "rewards/rejected": -6.84375, + "step": 1400 + }, + { + "epoch": 1.7190184049079753, + "grad_norm": 14.220419180497366, + "learning_rate": 2.1570247933884298e-07, + "logits/chosen": -0.2373046875, + "logits/rejected": -0.458984375, + "logps/chosen": -442.0, + "logps/rejected": -394.0, + "loss": 0.0688, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.1328125, + "rewards/margins": 8.125, + "rewards/rejected": -6.96875, + "step": 1401 + }, + { + "epoch": 1.720245398773006, + "grad_norm": 15.464638402446901, + "learning_rate": 2.1549586776859503e-07, + "logits/chosen": -0.255859375, + "logits/rejected": -0.453125, + "logps/chosen": -400.0, + "logps/rejected": -326.0, + "loss": 0.0758, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.86328125, + "rewards/margins": 7.6875, + "rewards/rejected": -6.84375, + "step": 1402 + }, + { + "epoch": 1.7214723926380369, + "grad_norm": 11.136803364904123, + "learning_rate": 2.152892561983471e-07, + "logits/chosen": -0.1669921875, + "logits/rejected": -0.30859375, + "logps/chosen": -400.0, + "logps/rejected": -346.0, + "loss": 0.0475, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.81640625, + "rewards/margins": 7.625, + "rewards/rejected": -6.8125, + "step": 1403 + }, + { + "epoch": 1.7226993865030675, + "grad_norm": 16.698481888758884, + "learning_rate": 2.1508264462809918e-07, + "logits/chosen": -0.1689453125, + "logits/rejected": -0.318359375, + "logps/chosen": -330.0, + "logps/rejected": -288.0, + "loss": 0.0725, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.1953125, + "rewards/margins": 7.875, + "rewards/rejected": -6.6875, + "step": 1404 + }, + { + "epoch": 1.7239263803680982, + "grad_norm": 16.003372973080417, + "learning_rate": 2.1487603305785122e-07, + "logits/chosen": -0.265625, + "logits/rejected": -0.447265625, + "logps/chosen": -420.0, + "logps/rejected": -372.0, + "loss": 0.0745, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.9453125, + "rewards/margins": 8.375, + "rewards/rejected": -7.46875, + "step": 1405 + }, + { + "epoch": 1.7251533742331289, + "grad_norm": 9.529560720768151, + "learning_rate": 2.146694214876033e-07, + "logits/chosen": -0.375, + "logits/rejected": -0.494140625, + "logps/chosen": -320.0, + "logps/rejected": -330.0, + "loss": 0.0387, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.431640625, + "rewards/margins": 8.1875, + "rewards/rejected": -7.75, + "step": 1406 + }, + { + "epoch": 1.7263803680981595, + "grad_norm": 19.251033754740302, + "learning_rate": 2.1446280991735534e-07, + "logits/chosen": -0.19921875, + "logits/rejected": -0.47265625, + "logps/chosen": -436.0, + "logps/rejected": -382.0, + "loss": 0.0912, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.1328125, + "rewards/margins": 8.0625, + "rewards/rejected": -6.9375, + "step": 1407 + }, + { + "epoch": 1.7276073619631902, + "grad_norm": 13.693844317306695, + "learning_rate": 2.1425619834710742e-07, + "logits/chosen": -0.232421875, + "logits/rejected": -0.38671875, + "logps/chosen": -468.0, + "logps/rejected": -388.0, + "loss": 0.081, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.078125, + "rewards/margins": 8.0625, + "rewards/rejected": -7.0, + "step": 1408 + }, + { + "epoch": 1.7288343558282209, + "grad_norm": 20.257304426634505, + "learning_rate": 2.140495867768595e-07, + "logits/chosen": -0.2021484375, + "logits/rejected": -0.353515625, + "logps/chosen": -374.0, + "logps/rejected": -332.0, + "loss": 0.0852, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.625, + "rewards/margins": 7.90625, + "rewards/rejected": -7.28125, + "step": 1409 + }, + { + "epoch": 1.7300613496932515, + "grad_norm": 13.551924350908378, + "learning_rate": 2.1384297520661157e-07, + "logits/chosen": -0.265625, + "logits/rejected": -0.431640625, + "logps/chosen": -392.0, + "logps/rejected": -344.0, + "loss": 0.0748, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.3203125, + "rewards/margins": 7.34375, + "rewards/rejected": -7.03125, + "step": 1410 + }, + { + "epoch": 1.7312883435582822, + "grad_norm": 15.891870826112665, + "learning_rate": 2.136363636363636e-07, + "logits/chosen": -0.2255859375, + "logits/rejected": -0.380859375, + "logps/chosen": -352.0, + "logps/rejected": -336.0, + "loss": 0.0752, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.2353515625, + "rewards/margins": 7.53125, + "rewards/rejected": -7.28125, + "step": 1411 + }, + { + "epoch": 1.7325153374233129, + "grad_norm": 18.391292263031794, + "learning_rate": 2.1342975206611569e-07, + "logits/chosen": -0.181640625, + "logits/rejected": -0.419921875, + "logps/chosen": -422.0, + "logps/rejected": -352.0, + "loss": 0.0868, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.015625, + "rewards/margins": 8.1875, + "rewards/rejected": -7.15625, + "step": 1412 + }, + { + "epoch": 1.7337423312883435, + "grad_norm": 15.650264623612461, + "learning_rate": 2.1322314049586776e-07, + "logits/chosen": -0.3046875, + "logits/rejected": -0.515625, + "logps/chosen": -390.0, + "logps/rejected": -344.0, + "loss": 0.0827, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.3203125, + "rewards/margins": 8.0625, + "rewards/rejected": -7.78125, + "step": 1413 + }, + { + "epoch": 1.7349693251533742, + "grad_norm": 12.284760841451385, + "learning_rate": 2.1301652892561983e-07, + "logits/chosen": -0.1962890625, + "logits/rejected": -0.380859375, + "logps/chosen": -430.0, + "logps/rejected": -348.0, + "loss": 0.0614, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.8671875, + "rewards/margins": 8.0625, + "rewards/rejected": -7.1875, + "step": 1414 + }, + { + "epoch": 1.7361963190184049, + "grad_norm": 20.17803266616993, + "learning_rate": 2.128099173553719e-07, + "logits/chosen": -0.25, + "logits/rejected": -0.427734375, + "logps/chosen": -342.0, + "logps/rejected": -336.0, + "loss": 0.1033, + "rewards/accuracies": 0.953125, + "rewards/chosen": 0.69140625, + "rewards/margins": 8.0625, + "rewards/rejected": -7.34375, + "step": 1415 + }, + { + "epoch": 1.7374233128834355, + "grad_norm": 14.41675185361736, + "learning_rate": 2.1260330578512395e-07, + "logits/chosen": -0.1875, + "logits/rejected": -0.44921875, + "logps/chosen": -414.0, + "logps/rejected": -358.0, + "loss": 0.0681, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.3203125, + "rewards/margins": 8.625, + "rewards/rejected": -7.3125, + "step": 1416 + }, + { + "epoch": 1.7386503067484662, + "grad_norm": 13.637638277625397, + "learning_rate": 2.1239669421487603e-07, + "logits/chosen": -0.298828125, + "logits/rejected": -0.4453125, + "logps/chosen": -364.0, + "logps/rejected": -342.0, + "loss": 0.0537, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.95703125, + "rewards/margins": 8.625, + "rewards/rejected": -7.65625, + "step": 1417 + }, + { + "epoch": 1.7398773006134969, + "grad_norm": 16.04836111882316, + "learning_rate": 2.121900826446281e-07, + "logits/chosen": -0.2080078125, + "logits/rejected": -0.443359375, + "logps/chosen": -392.0, + "logps/rejected": -360.0, + "loss": 0.0676, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.46875, + "rewards/margins": 8.0625, + "rewards/rejected": -7.625, + "step": 1418 + }, + { + "epoch": 1.7411042944785278, + "grad_norm": 17.60613924094049, + "learning_rate": 2.1198347107438017e-07, + "logits/chosen": -0.1953125, + "logits/rejected": -0.31640625, + "logps/chosen": -336.0, + "logps/rejected": -300.0, + "loss": 0.0918, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.240234375, + "rewards/margins": 7.125, + "rewards/rejected": -6.875, + "step": 1419 + }, + { + "epoch": 1.7423312883435584, + "grad_norm": 16.77386957431945, + "learning_rate": 2.1177685950413222e-07, + "logits/chosen": -0.3828125, + "logits/rejected": -0.53515625, + "logps/chosen": -420.0, + "logps/rejected": -376.0, + "loss": 0.063, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.94921875, + "rewards/margins": 8.8125, + "rewards/rejected": -7.84375, + "step": 1420 + }, + { + "epoch": 1.743558282208589, + "grad_norm": 16.131730598262237, + "learning_rate": 2.115702479338843e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.48828125, + "logps/chosen": -372.0, + "logps/rejected": -346.0, + "loss": 0.0747, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.80859375, + "rewards/margins": 8.625, + "rewards/rejected": -7.84375, + "step": 1421 + }, + { + "epoch": 1.7447852760736198, + "grad_norm": 17.61757832980583, + "learning_rate": 2.1136363636363634e-07, + "logits/chosen": -0.19921875, + "logits/rejected": -0.361328125, + "logps/chosen": -392.0, + "logps/rejected": -352.0, + "loss": 0.1045, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.61328125, + "rewards/margins": 7.75, + "rewards/rejected": -7.15625, + "step": 1422 + }, + { + "epoch": 1.7460122699386504, + "grad_norm": 13.939746523177984, + "learning_rate": 2.1115702479338842e-07, + "logits/chosen": -0.244140625, + "logits/rejected": -0.4296875, + "logps/chosen": -372.0, + "logps/rejected": -376.0, + "loss": 0.0647, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.01300048828125, + "rewards/margins": 8.5, + "rewards/rejected": -8.5, + "step": 1423 + }, + { + "epoch": 1.747239263803681, + "grad_norm": 14.67260116724575, + "learning_rate": 2.109504132231405e-07, + "logits/chosen": -0.32421875, + "logits/rejected": -0.55859375, + "logps/chosen": -420.0, + "logps/rejected": -368.0, + "loss": 0.0749, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.63671875, + "rewards/margins": 8.375, + "rewards/rejected": -7.75, + "step": 1424 + }, + { + "epoch": 1.7484662576687118, + "grad_norm": 16.696897448348274, + "learning_rate": 2.1074380165289254e-07, + "logits/chosen": -0.212890625, + "logits/rejected": -0.333984375, + "logps/chosen": -380.0, + "logps/rejected": -352.0, + "loss": 0.0759, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.8046875, + "rewards/margins": 8.5, + "rewards/rejected": -7.6875, + "step": 1425 + }, + { + "epoch": 1.7496932515337424, + "grad_norm": 19.738799668803697, + "learning_rate": 2.105371900826446e-07, + "logits/chosen": -0.22265625, + "logits/rejected": -0.400390625, + "logps/chosen": -370.0, + "logps/rejected": -350.0, + "loss": 0.1129, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.75390625, + "rewards/margins": 8.25, + "rewards/rejected": -7.53125, + "step": 1426 + }, + { + "epoch": 1.7509202453987731, + "grad_norm": 23.116727331558348, + "learning_rate": 2.1033057851239668e-07, + "logits/chosen": -0.2197265625, + "logits/rejected": -0.369140625, + "logps/chosen": -378.0, + "logps/rejected": -346.0, + "loss": 0.0914, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.66015625, + "rewards/margins": 7.34375, + "rewards/rejected": -6.6875, + "step": 1427 + }, + { + "epoch": 1.7521472392638038, + "grad_norm": 15.978181082257217, + "learning_rate": 2.1012396694214876e-07, + "logits/chosen": -0.279296875, + "logits/rejected": -0.400390625, + "logps/chosen": -420.0, + "logps/rejected": -368.0, + "loss": 0.0733, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.94921875, + "rewards/margins": 8.1875, + "rewards/rejected": -7.25, + "step": 1428 + }, + { + "epoch": 1.7533742331288344, + "grad_norm": 13.101048295432259, + "learning_rate": 2.099173553719008e-07, + "logits/chosen": -0.236328125, + "logits/rejected": -0.40625, + "logps/chosen": -350.0, + "logps/rejected": -322.0, + "loss": 0.0656, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.7578125, + "rewards/margins": 7.9375, + "rewards/rejected": -7.15625, + "step": 1429 + }, + { + "epoch": 1.7546012269938651, + "grad_norm": 14.161965896927917, + "learning_rate": 2.0971074380165288e-07, + "logits/chosen": -0.298828125, + "logits/rejected": -0.400390625, + "logps/chosen": -382.0, + "logps/rejected": -374.0, + "loss": 0.0647, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.87109375, + "rewards/margins": 8.0625, + "rewards/rejected": -7.21875, + "step": 1430 + }, + { + "epoch": 1.7558282208588958, + "grad_norm": 16.980035984498166, + "learning_rate": 2.0950413223140495e-07, + "logits/chosen": -0.1279296875, + "logits/rejected": -0.29296875, + "logps/chosen": -392.0, + "logps/rejected": -340.0, + "loss": 0.0756, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.6015625, + "rewards/margins": 6.90625, + "rewards/rejected": -6.3125, + "step": 1431 + }, + { + "epoch": 1.7570552147239265, + "grad_norm": 8.82012662430086, + "learning_rate": 2.0929752066115702e-07, + "logits/chosen": -0.27734375, + "logits/rejected": -0.33203125, + "logps/chosen": -332.0, + "logps/rejected": -338.0, + "loss": 0.0325, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.859375, + "rewards/margins": 8.125, + "rewards/rejected": -7.25, + "step": 1432 + }, + { + "epoch": 1.7582822085889571, + "grad_norm": 21.489725350493686, + "learning_rate": 2.0909090909090907e-07, + "logits/chosen": -0.11376953125, + "logits/rejected": -0.2236328125, + "logps/chosen": -356.0, + "logps/rejected": -314.0, + "loss": 0.1281, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.314453125, + "rewards/margins": 6.4375, + "rewards/rejected": -6.125, + "step": 1433 + }, + { + "epoch": 1.7595092024539878, + "grad_norm": 16.75596458072332, + "learning_rate": 2.0888429752066115e-07, + "logits/chosen": -0.1357421875, + "logits/rejected": -0.2392578125, + "logps/chosen": -340.0, + "logps/rejected": -372.0, + "loss": 0.0847, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.54296875, + "rewards/margins": 6.90625, + "rewards/rejected": -6.375, + "step": 1434 + }, + { + "epoch": 1.7607361963190185, + "grad_norm": 11.247313981371901, + "learning_rate": 2.0867768595041322e-07, + "logits/chosen": -0.171875, + "logits/rejected": -0.298828125, + "logps/chosen": -346.0, + "logps/rejected": -330.0, + "loss": 0.0495, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.8671875, + "rewards/margins": 7.4375, + "rewards/rejected": -6.5625, + "step": 1435 + }, + { + "epoch": 1.7619631901840491, + "grad_norm": 10.805603892610375, + "learning_rate": 2.084710743801653e-07, + "logits/chosen": -0.205078125, + "logits/rejected": -0.4140625, + "logps/chosen": -386.0, + "logps/rejected": -362.0, + "loss": 0.0436, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.6640625, + "rewards/margins": 8.4375, + "rewards/rejected": -6.78125, + "step": 1436 + }, + { + "epoch": 1.7631901840490798, + "grad_norm": 14.225929279453966, + "learning_rate": 2.0826446280991737e-07, + "logits/chosen": -0.330078125, + "logits/rejected": -0.52734375, + "logps/chosen": -392.0, + "logps/rejected": -374.0, + "loss": 0.0601, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.8515625, + "rewards/margins": 8.125, + "rewards/rejected": -7.28125, + "step": 1437 + }, + { + "epoch": 1.7644171779141105, + "grad_norm": 14.206588051701008, + "learning_rate": 2.080578512396694e-07, + "logits/chosen": -0.232421875, + "logits/rejected": -0.400390625, + "logps/chosen": -376.0, + "logps/rejected": -342.0, + "loss": 0.0661, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.8125, + "rewards/margins": 7.3125, + "rewards/rejected": -6.5, + "step": 1438 + }, + { + "epoch": 1.7656441717791411, + "grad_norm": 14.751935537893047, + "learning_rate": 2.0785123966942149e-07, + "logits/chosen": -0.265625, + "logits/rejected": -0.498046875, + "logps/chosen": -364.0, + "logps/rejected": -332.0, + "loss": 0.0655, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.298828125, + "rewards/margins": 6.875, + "rewards/rejected": -6.59375, + "step": 1439 + }, + { + "epoch": 1.7668711656441718, + "grad_norm": 10.248816305534282, + "learning_rate": 2.0764462809917353e-07, + "logits/chosen": -0.2373046875, + "logits/rejected": -0.44140625, + "logps/chosen": -464.0, + "logps/rejected": -388.0, + "loss": 0.0415, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.4765625, + "rewards/margins": 8.6875, + "rewards/rejected": -7.21875, + "step": 1440 + }, + { + "epoch": 1.7680981595092025, + "grad_norm": 14.481804933484959, + "learning_rate": 2.074380165289256e-07, + "logits/chosen": -0.375, + "logits/rejected": -0.458984375, + "logps/chosen": -356.0, + "logps/rejected": -356.0, + "loss": 0.0639, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.6796875, + "rewards/margins": 8.25, + "rewards/rejected": -7.5625, + "step": 1441 + }, + { + "epoch": 1.7693251533742331, + "grad_norm": 22.015809991017704, + "learning_rate": 2.0723140495867765e-07, + "logits/chosen": -0.326171875, + "logits/rejected": -0.5390625, + "logps/chosen": -428.0, + "logps/rejected": -362.0, + "loss": 0.095, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.67578125, + "rewards/margins": 7.75, + "rewards/rejected": -7.09375, + "step": 1442 + }, + { + "epoch": 1.7705521472392638, + "grad_norm": 18.13219015401745, + "learning_rate": 2.0702479338842973e-07, + "logits/chosen": -0.177734375, + "logits/rejected": -0.32421875, + "logps/chosen": -416.0, + "logps/rejected": -372.0, + "loss": 0.0726, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.0859375, + "rewards/margins": 8.25, + "rewards/rejected": -7.1875, + "step": 1443 + }, + { + "epoch": 1.7717791411042945, + "grad_norm": 13.491518159612902, + "learning_rate": 2.068181818181818e-07, + "logits/chosen": -0.23828125, + "logits/rejected": -0.40625, + "logps/chosen": -392.0, + "logps/rejected": -358.0, + "loss": 0.06, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.3203125, + "rewards/margins": 8.5625, + "rewards/rejected": -7.25, + "step": 1444 + }, + { + "epoch": 1.7730061349693251, + "grad_norm": 15.30212850788442, + "learning_rate": 2.0661157024793388e-07, + "logits/chosen": -0.1845703125, + "logits/rejected": -0.361328125, + "logps/chosen": -324.0, + "logps/rejected": -312.0, + "loss": 0.061, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.4453125, + "rewards/margins": 7.65625, + "rewards/rejected": -7.1875, + "step": 1445 + }, + { + "epoch": 1.7742331288343558, + "grad_norm": 19.853430884853257, + "learning_rate": 2.0640495867768595e-07, + "logits/chosen": -0.185546875, + "logits/rejected": -0.361328125, + "logps/chosen": -410.0, + "logps/rejected": -372.0, + "loss": 0.0697, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.875, + "rewards/margins": 8.6875, + "rewards/rejected": -7.8125, + "step": 1446 + }, + { + "epoch": 1.7754601226993865, + "grad_norm": 19.056315617912155, + "learning_rate": 2.06198347107438e-07, + "logits/chosen": -0.318359375, + "logits/rejected": -0.490234375, + "logps/chosen": -378.0, + "logps/rejected": -344.0, + "loss": 0.0889, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.56640625, + "rewards/margins": 7.71875, + "rewards/rejected": -7.15625, + "step": 1447 + }, + { + "epoch": 1.7766871165644171, + "grad_norm": 16.621289468269772, + "learning_rate": 2.0599173553719007e-07, + "logits/chosen": -0.1982421875, + "logits/rejected": -0.314453125, + "logps/chosen": -336.0, + "logps/rejected": -332.0, + "loss": 0.0775, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.10498046875, + "rewards/margins": 7.25, + "rewards/rejected": -7.15625, + "step": 1448 + }, + { + "epoch": 1.7779141104294478, + "grad_norm": 11.93963310782536, + "learning_rate": 2.0578512396694214e-07, + "logits/chosen": -0.1103515625, + "logits/rejected": -0.310546875, + "logps/chosen": -422.0, + "logps/rejected": -376.0, + "loss": 0.0554, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.6953125, + "rewards/margins": 7.46875, + "rewards/rejected": -6.78125, + "step": 1449 + }, + { + "epoch": 1.7791411042944785, + "grad_norm": 15.776220257842827, + "learning_rate": 2.0557851239669422e-07, + "logits/chosen": -0.26171875, + "logits/rejected": -0.43359375, + "logps/chosen": -420.0, + "logps/rejected": -350.0, + "loss": 0.0741, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.9375, + "rewards/margins": 7.90625, + "rewards/rejected": -6.96875, + "step": 1450 + }, + { + "epoch": 1.7803680981595091, + "grad_norm": 14.007286299216013, + "learning_rate": 2.0537190082644626e-07, + "logits/chosen": -0.16796875, + "logits/rejected": -0.326171875, + "logps/chosen": -416.0, + "logps/rejected": -362.0, + "loss": 0.0655, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.09375, + "rewards/margins": 8.125, + "rewards/rejected": -7.03125, + "step": 1451 + }, + { + "epoch": 1.7815950920245398, + "grad_norm": 8.277122483844174, + "learning_rate": 2.0516528925619834e-07, + "logits/chosen": -0.359375, + "logits/rejected": -0.59765625, + "logps/chosen": -448.0, + "logps/rejected": -370.0, + "loss": 0.0246, + "rewards/accuracies": 1.0, + "rewards/chosen": 2.1875, + "rewards/margins": 9.5, + "rewards/rejected": -7.3125, + "step": 1452 + }, + { + "epoch": 1.7828220858895705, + "grad_norm": 15.233979634836675, + "learning_rate": 2.049586776859504e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.453125, + "logps/chosen": -402.0, + "logps/rejected": -342.0, + "loss": 0.0633, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.203125, + "rewards/margins": 8.625, + "rewards/rejected": -7.40625, + "step": 1453 + }, + { + "epoch": 1.7840490797546011, + "grad_norm": 11.317979404878772, + "learning_rate": 2.0475206611570248e-07, + "logits/chosen": -0.1396484375, + "logits/rejected": -0.34375, + "logps/chosen": -394.0, + "logps/rejected": -350.0, + "loss": 0.0485, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.8125, + "rewards/margins": 8.3125, + "rewards/rejected": -7.53125, + "step": 1454 + }, + { + "epoch": 1.7852760736196318, + "grad_norm": 17.754925262587573, + "learning_rate": 2.0454545454545456e-07, + "logits/chosen": -0.232421875, + "logits/rejected": -0.37890625, + "logps/chosen": -390.0, + "logps/rejected": -370.0, + "loss": 0.077, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.94921875, + "rewards/margins": 7.4375, + "rewards/rejected": -6.5, + "step": 1455 + }, + { + "epoch": 1.7865030674846625, + "grad_norm": 19.854730691864155, + "learning_rate": 2.043388429752066e-07, + "logits/chosen": -0.283203125, + "logits/rejected": -0.40234375, + "logps/chosen": -360.0, + "logps/rejected": -324.0, + "loss": 0.0974, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.8359375, + "rewards/margins": 7.1875, + "rewards/rejected": -6.375, + "step": 1456 + }, + { + "epoch": 1.7877300613496931, + "grad_norm": 10.467307859535879, + "learning_rate": 2.0413223140495868e-07, + "logits/chosen": -0.279296875, + "logits/rejected": -0.5, + "logps/chosen": -416.0, + "logps/rejected": -372.0, + "loss": 0.0448, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.9375, + "rewards/margins": 8.0625, + "rewards/rejected": -7.09375, + "step": 1457 + }, + { + "epoch": 1.7889570552147238, + "grad_norm": 21.949893453118193, + "learning_rate": 2.0392561983471073e-07, + "logits/chosen": -0.15234375, + "logits/rejected": -0.25390625, + "logps/chosen": -354.0, + "logps/rejected": -356.0, + "loss": 0.0971, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.46875, + "rewards/margins": 7.0, + "rewards/rejected": -6.53125, + "step": 1458 + }, + { + "epoch": 1.7901840490797545, + "grad_norm": 12.47585450577588, + "learning_rate": 2.037190082644628e-07, + "logits/chosen": -0.25390625, + "logits/rejected": -0.455078125, + "logps/chosen": -380.0, + "logps/rejected": -342.0, + "loss": 0.0484, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.1875, + "rewards/margins": 8.5625, + "rewards/rejected": -7.375, + "step": 1459 + }, + { + "epoch": 1.7914110429447851, + "grad_norm": 13.870671728030251, + "learning_rate": 2.0351239669421485e-07, + "logits/chosen": -0.208984375, + "logits/rejected": -0.3671875, + "logps/chosen": -414.0, + "logps/rejected": -362.0, + "loss": 0.0699, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.2109375, + "rewards/margins": 7.90625, + "rewards/rejected": -6.6875, + "step": 1460 + }, + { + "epoch": 1.7926380368098158, + "grad_norm": 20.216524552622737, + "learning_rate": 2.0330578512396692e-07, + "logits/chosen": -0.1904296875, + "logits/rejected": -0.40234375, + "logps/chosen": -422.0, + "logps/rejected": -366.0, + "loss": 0.0906, + "rewards/accuracies": 0.953125, + "rewards/chosen": 1.28125, + "rewards/margins": 9.25, + "rewards/rejected": -7.96875, + "step": 1461 + }, + { + "epoch": 1.7938650306748465, + "grad_norm": 17.46297069666732, + "learning_rate": 2.03099173553719e-07, + "logits/chosen": -0.2333984375, + "logits/rejected": -0.310546875, + "logps/chosen": -320.0, + "logps/rejected": -326.0, + "loss": 0.0803, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.76171875, + "rewards/margins": 7.75, + "rewards/rejected": -6.96875, + "step": 1462 + }, + { + "epoch": 1.7950920245398772, + "grad_norm": 11.06100927617084, + "learning_rate": 2.0289256198347107e-07, + "logits/chosen": -0.1728515625, + "logits/rejected": -0.392578125, + "logps/chosen": -398.0, + "logps/rejected": -352.0, + "loss": 0.0464, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.0390625, + "rewards/margins": 7.96875, + "rewards/rejected": -6.9375, + "step": 1463 + }, + { + "epoch": 1.7963190184049078, + "grad_norm": 15.01295815438324, + "learning_rate": 2.0268595041322314e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.40234375, + "logps/chosen": -340.0, + "logps/rejected": -324.0, + "loss": 0.0644, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.6484375, + "rewards/margins": 8.125, + "rewards/rejected": -7.5, + "step": 1464 + }, + { + "epoch": 1.7975460122699385, + "grad_norm": 13.17727420189363, + "learning_rate": 2.024793388429752e-07, + "logits/chosen": -0.298828125, + "logits/rejected": -0.443359375, + "logps/chosen": -392.0, + "logps/rejected": -370.0, + "loss": 0.0506, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.93359375, + "rewards/margins": 8.5, + "rewards/rejected": -7.5625, + "step": 1465 + }, + { + "epoch": 1.7987730061349694, + "grad_norm": 10.463304964717775, + "learning_rate": 2.0227272727272726e-07, + "logits/chosen": -0.224609375, + "logits/rejected": -0.4375, + "logps/chosen": -360.0, + "logps/rejected": -336.0, + "loss": 0.0369, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.390625, + "rewards/margins": 8.25, + "rewards/rejected": -7.84375, + "step": 1466 + }, + { + "epoch": 1.8, + "grad_norm": 16.6389603323545, + "learning_rate": 2.0206611570247933e-07, + "logits/chosen": -0.28515625, + "logits/rejected": -0.404296875, + "logps/chosen": -424.0, + "logps/rejected": -378.0, + "loss": 0.0702, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.109375, + "rewards/margins": 7.78125, + "rewards/rejected": -6.65625, + "step": 1467 + }, + { + "epoch": 1.8012269938650307, + "grad_norm": 17.7073015885254, + "learning_rate": 2.018595041322314e-07, + "logits/chosen": -0.2041015625, + "logits/rejected": -0.400390625, + "logps/chosen": -410.0, + "logps/rejected": -358.0, + "loss": 0.0726, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.1484375, + "rewards/margins": 8.5625, + "rewards/rejected": -7.40625, + "step": 1468 + }, + { + "epoch": 1.8024539877300614, + "grad_norm": 24.152384305185304, + "learning_rate": 2.0165289256198346e-07, + "logits/chosen": -0.1982421875, + "logits/rejected": -0.333984375, + "logps/chosen": -398.0, + "logps/rejected": -348.0, + "loss": 0.1228, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.423828125, + "rewards/margins": 8.0, + "rewards/rejected": -7.5625, + "step": 1469 + }, + { + "epoch": 1.803680981595092, + "grad_norm": 16.505124462328883, + "learning_rate": 2.0144628099173553e-07, + "logits/chosen": -0.1611328125, + "logits/rejected": -0.373046875, + "logps/chosen": -398.0, + "logps/rejected": -342.0, + "loss": 0.1026, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.22265625, + "rewards/margins": 7.375, + "rewards/rejected": -7.125, + "step": 1470 + }, + { + "epoch": 1.8049079754601227, + "grad_norm": 11.613757396562685, + "learning_rate": 2.012396694214876e-07, + "logits/chosen": -0.1767578125, + "logits/rejected": -0.2890625, + "logps/chosen": -364.0, + "logps/rejected": -360.0, + "loss": 0.0527, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.203125, + "rewards/margins": 8.125, + "rewards/rejected": -6.9375, + "step": 1471 + }, + { + "epoch": 1.8061349693251534, + "grad_norm": 20.145572393591006, + "learning_rate": 2.0103305785123968e-07, + "logits/chosen": -0.2001953125, + "logits/rejected": -0.341796875, + "logps/chosen": -386.0, + "logps/rejected": -354.0, + "loss": 0.0853, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.8203125, + "rewards/margins": 8.1875, + "rewards/rejected": -7.375, + "step": 1472 + }, + { + "epoch": 1.807361963190184, + "grad_norm": 15.971278195974767, + "learning_rate": 2.0082644628099172e-07, + "logits/chosen": -0.2314453125, + "logits/rejected": -0.482421875, + "logps/chosen": -378.0, + "logps/rejected": -346.0, + "loss": 0.0682, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.97265625, + "rewards/margins": 8.875, + "rewards/rejected": -7.9375, + "step": 1473 + }, + { + "epoch": 1.8085889570552147, + "grad_norm": 17.182534809447294, + "learning_rate": 2.006198347107438e-07, + "logits/chosen": -0.1162109375, + "logits/rejected": -0.330078125, + "logps/chosen": -420.0, + "logps/rejected": -372.0, + "loss": 0.0679, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.8671875, + "rewards/margins": 8.25, + "rewards/rejected": -7.375, + "step": 1474 + }, + { + "epoch": 1.8098159509202454, + "grad_norm": 16.745501437822007, + "learning_rate": 2.0041322314049587e-07, + "logits/chosen": -0.2392578125, + "logits/rejected": -0.427734375, + "logps/chosen": -396.0, + "logps/rejected": -352.0, + "loss": 0.0655, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.7734375, + "rewards/margins": 8.1875, + "rewards/rejected": -7.4375, + "step": 1475 + }, + { + "epoch": 1.811042944785276, + "grad_norm": 11.884520160046627, + "learning_rate": 2.0020661157024792e-07, + "logits/chosen": -0.255859375, + "logits/rejected": -0.4140625, + "logps/chosen": -360.0, + "logps/rejected": -348.0, + "loss": 0.0482, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.70703125, + "rewards/margins": 8.625, + "rewards/rejected": -7.9375, + "step": 1476 + }, + { + "epoch": 1.8122699386503067, + "grad_norm": 19.099212958377244, + "learning_rate": 2e-07, + "logits/chosen": -0.1484375, + "logits/rejected": -0.2890625, + "logps/chosen": -380.0, + "logps/rejected": -364.0, + "loss": 0.0965, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.515625, + "rewards/margins": 8.0625, + "rewards/rejected": -7.5625, + "step": 1477 + }, + { + "epoch": 1.8134969325153374, + "grad_norm": 15.322861386193901, + "learning_rate": 1.9979338842975204e-07, + "logits/chosen": -0.185546875, + "logits/rejected": -0.365234375, + "logps/chosen": -396.0, + "logps/rejected": -382.0, + "loss": 0.0658, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.546875, + "rewards/margins": 8.875, + "rewards/rejected": -7.3125, + "step": 1478 + }, + { + "epoch": 1.814723926380368, + "grad_norm": 19.94487147046124, + "learning_rate": 1.995867768595041e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.439453125, + "logps/chosen": -376.0, + "logps/rejected": -356.0, + "loss": 0.076, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.90625, + "rewards/margins": 8.875, + "rewards/rejected": -8.0, + "step": 1479 + }, + { + "epoch": 1.8159509202453987, + "grad_norm": 18.370821009225708, + "learning_rate": 1.9938016528925619e-07, + "logits/chosen": -0.337890625, + "logits/rejected": -0.50390625, + "logps/chosen": -392.0, + "logps/rejected": -386.0, + "loss": 0.096, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 1.203125, + "rewards/margins": 8.0, + "rewards/rejected": -6.78125, + "step": 1480 + }, + { + "epoch": 1.8171779141104294, + "grad_norm": 18.894217711244252, + "learning_rate": 1.9917355371900826e-07, + "logits/chosen": -0.29296875, + "logits/rejected": -0.41015625, + "logps/chosen": -426.0, + "logps/rejected": -390.0, + "loss": 0.0634, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.58203125, + "rewards/margins": 8.4375, + "rewards/rejected": -7.8125, + "step": 1481 + }, + { + "epoch": 1.8184049079754603, + "grad_norm": 17.668135072623855, + "learning_rate": 1.989669421487603e-07, + "logits/chosen": -0.1513671875, + "logits/rejected": -0.30859375, + "logps/chosen": -368.0, + "logps/rejected": -334.0, + "loss": 0.1078, + "rewards/accuracies": 0.953125, + "rewards/chosen": 0.66796875, + "rewards/margins": 7.78125, + "rewards/rejected": -7.09375, + "step": 1482 + }, + { + "epoch": 1.819631901840491, + "grad_norm": 17.99377720684637, + "learning_rate": 1.9876033057851238e-07, + "logits/chosen": -0.09130859375, + "logits/rejected": -0.2490234375, + "logps/chosen": -348.0, + "logps/rejected": -300.0, + "loss": 0.0953, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.431640625, + "rewards/margins": 7.53125, + "rewards/rejected": -7.09375, + "step": 1483 + }, + { + "epoch": 1.8208588957055216, + "grad_norm": 17.648167653419545, + "learning_rate": 1.9855371900826445e-07, + "logits/chosen": -0.26171875, + "logits/rejected": -0.43359375, + "logps/chosen": -346.0, + "logps/rejected": -334.0, + "loss": 0.0858, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.373046875, + "rewards/margins": 7.75, + "rewards/rejected": -7.375, + "step": 1484 + }, + { + "epoch": 1.8220858895705523, + "grad_norm": 13.274182550668716, + "learning_rate": 1.9834710743801653e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.326171875, + "logps/chosen": -342.0, + "logps/rejected": -382.0, + "loss": 0.0528, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.216796875, + "rewards/margins": 7.71875, + "rewards/rejected": -7.53125, + "step": 1485 + }, + { + "epoch": 1.823312883435583, + "grad_norm": 20.621329689703675, + "learning_rate": 1.981404958677686e-07, + "logits/chosen": -0.34375, + "logits/rejected": -0.5078125, + "logps/chosen": -372.0, + "logps/rejected": -358.0, + "loss": 0.1021, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.72265625, + "rewards/margins": 8.4375, + "rewards/rejected": -7.6875, + "step": 1486 + }, + { + "epoch": 1.8245398773006136, + "grad_norm": 11.210307074496594, + "learning_rate": 1.9793388429752065e-07, + "logits/chosen": -0.384765625, + "logits/rejected": -0.54296875, + "logps/chosen": -408.0, + "logps/rejected": -344.0, + "loss": 0.0409, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.015625, + "rewards/margins": 8.9375, + "rewards/rejected": -7.90625, + "step": 1487 + }, + { + "epoch": 1.8257668711656443, + "grad_norm": 21.987064923233664, + "learning_rate": 1.9772727272727272e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.5078125, + "logps/chosen": -406.0, + "logps/rejected": -336.0, + "loss": 0.0674, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.984375, + "rewards/margins": 8.75, + "rewards/rejected": -7.75, + "step": 1488 + }, + { + "epoch": 1.826993865030675, + "grad_norm": 18.006481239669995, + "learning_rate": 1.975206611570248e-07, + "logits/chosen": -0.373046875, + "logits/rejected": -0.57421875, + "logps/chosen": -402.0, + "logps/rejected": -360.0, + "loss": 0.0918, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.15625, + "rewards/margins": 8.9375, + "rewards/rejected": -7.78125, + "step": 1489 + }, + { + "epoch": 1.8282208588957056, + "grad_norm": 14.187293099018019, + "learning_rate": 1.9731404958677687e-07, + "logits/chosen": -0.263671875, + "logits/rejected": -0.478515625, + "logps/chosen": -394.0, + "logps/rejected": -358.0, + "loss": 0.0604, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.1015625, + "rewards/margins": 8.5, + "rewards/rejected": -7.40625, + "step": 1490 + }, + { + "epoch": 1.8294478527607363, + "grad_norm": 17.418073179613188, + "learning_rate": 1.9710743801652891e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.5234375, + "logps/chosen": -476.0, + "logps/rejected": -400.0, + "loss": 0.078, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.6875, + "rewards/margins": 9.375, + "rewards/rejected": -7.6875, + "step": 1491 + }, + { + "epoch": 1.830674846625767, + "grad_norm": 23.07517426282743, + "learning_rate": 1.96900826446281e-07, + "logits/chosen": -0.40234375, + "logits/rejected": -0.5546875, + "logps/chosen": -386.0, + "logps/rejected": -350.0, + "loss": 0.0905, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.36328125, + "rewards/margins": 7.625, + "rewards/rejected": -7.25, + "step": 1492 + }, + { + "epoch": 1.8319018404907976, + "grad_norm": 14.205167510588849, + "learning_rate": 1.9669421487603306e-07, + "logits/chosen": -0.35546875, + "logits/rejected": -0.474609375, + "logps/chosen": -320.0, + "logps/rejected": -320.0, + "loss": 0.0652, + "rewards/accuracies": 0.984375, + "rewards/chosen": -0.1103515625, + "rewards/margins": 7.65625, + "rewards/rejected": -7.75, + "step": 1493 + }, + { + "epoch": 1.8331288343558283, + "grad_norm": 15.731370940870633, + "learning_rate": 1.964876033057851e-07, + "logits/chosen": -0.314453125, + "logits/rejected": -0.439453125, + "logps/chosen": -434.0, + "logps/rejected": -390.0, + "loss": 0.068, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.57421875, + "rewards/margins": 8.1875, + "rewards/rejected": -7.59375, + "step": 1494 + }, + { + "epoch": 1.834355828220859, + "grad_norm": 11.665425298441228, + "learning_rate": 1.9628099173553718e-07, + "logits/chosen": -0.279296875, + "logits/rejected": -0.439453125, + "logps/chosen": -360.0, + "logps/rejected": -340.0, + "loss": 0.0587, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.7890625, + "rewards/margins": 8.125, + "rewards/rejected": -7.3125, + "step": 1495 + }, + { + "epoch": 1.8355828220858896, + "grad_norm": 10.39425934542688, + "learning_rate": 1.9607438016528923e-07, + "logits/chosen": -0.2158203125, + "logits/rejected": -0.357421875, + "logps/chosen": -372.0, + "logps/rejected": -354.0, + "loss": 0.0393, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.92578125, + "rewards/margins": 8.125, + "rewards/rejected": -7.1875, + "step": 1496 + }, + { + "epoch": 1.8368098159509203, + "grad_norm": 12.324150494700712, + "learning_rate": 1.958677685950413e-07, + "logits/chosen": -0.208984375, + "logits/rejected": -0.439453125, + "logps/chosen": -406.0, + "logps/rejected": -340.0, + "loss": 0.054, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.3359375, + "rewards/margins": 8.4375, + "rewards/rejected": -7.125, + "step": 1497 + }, + { + "epoch": 1.838036809815951, + "grad_norm": 17.958231249219875, + "learning_rate": 1.9566115702479338e-07, + "logits/chosen": -0.376953125, + "logits/rejected": -0.55859375, + "logps/chosen": -420.0, + "logps/rejected": -396.0, + "loss": 0.0769, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.73828125, + "rewards/margins": 8.1875, + "rewards/rejected": -7.4375, + "step": 1498 + }, + { + "epoch": 1.8392638036809816, + "grad_norm": 13.751331104711817, + "learning_rate": 1.9545454545454545e-07, + "logits/chosen": -0.1923828125, + "logits/rejected": -0.3828125, + "logps/chosen": -384.0, + "logps/rejected": -354.0, + "loss": 0.0604, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.1328125, + "rewards/margins": 8.25, + "rewards/rejected": -7.125, + "step": 1499 + }, + { + "epoch": 1.8404907975460123, + "grad_norm": 17.008256121916453, + "learning_rate": 1.952479338842975e-07, + "logits/chosen": -0.2119140625, + "logits/rejected": -0.43359375, + "logps/chosen": -368.0, + "logps/rejected": -312.0, + "loss": 0.087, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.359375, + "rewards/margins": 8.625, + "rewards/rejected": -7.28125, + "step": 1500 + }, + { + "epoch": 1.841717791411043, + "grad_norm": 13.035711385487769, + "learning_rate": 1.9504132231404957e-07, + "logits/chosen": -0.2041015625, + "logits/rejected": -0.341796875, + "logps/chosen": -368.0, + "logps/rejected": -358.0, + "loss": 0.0636, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.234375, + "rewards/margins": 8.4375, + "rewards/rejected": -7.1875, + "step": 1501 + }, + { + "epoch": 1.8429447852760736, + "grad_norm": 13.41511690736631, + "learning_rate": 1.9483471074380164e-07, + "logits/chosen": -0.1494140625, + "logits/rejected": -0.271484375, + "logps/chosen": -360.0, + "logps/rejected": -354.0, + "loss": 0.0547, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.08935546875, + "rewards/margins": 7.75, + "rewards/rejected": -7.65625, + "step": 1502 + }, + { + "epoch": 1.8441717791411043, + "grad_norm": 15.43502469522035, + "learning_rate": 1.9462809917355372e-07, + "logits/chosen": -0.263671875, + "logits/rejected": -0.474609375, + "logps/chosen": -424.0, + "logps/rejected": -414.0, + "loss": 0.06, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.0078125, + "rewards/margins": 8.5, + "rewards/rejected": -7.46875, + "step": 1503 + }, + { + "epoch": 1.845398773006135, + "grad_norm": 19.482237869100548, + "learning_rate": 1.944214876033058e-07, + "logits/chosen": -0.32421875, + "logits/rejected": -0.48046875, + "logps/chosen": -382.0, + "logps/rejected": -370.0, + "loss": 0.0778, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.125, + "rewards/margins": 8.3125, + "rewards/rejected": -7.1875, + "step": 1504 + }, + { + "epoch": 1.8466257668711656, + "grad_norm": 14.178264878313755, + "learning_rate": 1.9421487603305784e-07, + "logits/chosen": -0.3125, + "logits/rejected": -0.4765625, + "logps/chosen": -412.0, + "logps/rejected": -376.0, + "loss": 0.0684, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.49609375, + "rewards/margins": 7.59375, + "rewards/rejected": -7.09375, + "step": 1505 + }, + { + "epoch": 1.8478527607361963, + "grad_norm": 16.589699048945725, + "learning_rate": 1.940082644628099e-07, + "logits/chosen": -0.25390625, + "logits/rejected": -0.423828125, + "logps/chosen": -350.0, + "logps/rejected": -356.0, + "loss": 0.0709, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.228515625, + "rewards/margins": 7.71875, + "rewards/rejected": -7.5, + "step": 1506 + }, + { + "epoch": 1.849079754601227, + "grad_norm": 16.04070823247722, + "learning_rate": 1.9380165289256199e-07, + "logits/chosen": -0.232421875, + "logits/rejected": -0.44140625, + "logps/chosen": -396.0, + "logps/rejected": -348.0, + "loss": 0.0762, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.015625, + "rewards/margins": 7.375, + "rewards/rejected": -6.375, + "step": 1507 + }, + { + "epoch": 1.8503067484662576, + "grad_norm": 16.39959081069983, + "learning_rate": 1.9359504132231406e-07, + "logits/chosen": -0.1474609375, + "logits/rejected": -0.328125, + "logps/chosen": -384.0, + "logps/rejected": -360.0, + "loss": 0.0792, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.40625, + "rewards/margins": 7.40625, + "rewards/rejected": -7.0, + "step": 1508 + }, + { + "epoch": 1.8515337423312883, + "grad_norm": 13.574268779519473, + "learning_rate": 1.933884297520661e-07, + "logits/chosen": -0.2236328125, + "logits/rejected": -0.4296875, + "logps/chosen": -436.0, + "logps/rejected": -382.0, + "loss": 0.0567, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.28125, + "rewards/margins": 8.0625, + "rewards/rejected": -6.78125, + "step": 1509 + }, + { + "epoch": 1.852760736196319, + "grad_norm": 12.850263749439831, + "learning_rate": 1.9318181818181818e-07, + "logits/chosen": -0.197265625, + "logits/rejected": -0.431640625, + "logps/chosen": -428.0, + "logps/rejected": -354.0, + "loss": 0.0528, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.0234375, + "rewards/margins": 8.3125, + "rewards/rejected": -7.25, + "step": 1510 + }, + { + "epoch": 1.8539877300613496, + "grad_norm": 10.5232427309612, + "learning_rate": 1.9297520661157023e-07, + "logits/chosen": -0.25390625, + "logits/rejected": -0.33984375, + "logps/chosen": -412.0, + "logps/rejected": -412.0, + "loss": 0.0401, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.0078125, + "rewards/margins": 8.6875, + "rewards/rejected": -7.6875, + "step": 1511 + }, + { + "epoch": 1.8552147239263803, + "grad_norm": 15.187449242889205, + "learning_rate": 1.927685950413223e-07, + "logits/chosen": -0.212890625, + "logits/rejected": -0.4296875, + "logps/chosen": -356.0, + "logps/rejected": -318.0, + "loss": 0.0691, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.2734375, + "rewards/margins": 8.75, + "rewards/rejected": -7.5, + "step": 1512 + }, + { + "epoch": 1.856441717791411, + "grad_norm": 13.277786160576623, + "learning_rate": 1.9256198347107437e-07, + "logits/chosen": -0.228515625, + "logits/rejected": -0.439453125, + "logps/chosen": -398.0, + "logps/rejected": -336.0, + "loss": 0.0572, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.71484375, + "rewards/margins": 8.0, + "rewards/rejected": -7.3125, + "step": 1513 + }, + { + "epoch": 1.8576687116564417, + "grad_norm": 14.367371482305296, + "learning_rate": 1.9235537190082642e-07, + "logits/chosen": -0.232421875, + "logits/rejected": -0.421875, + "logps/chosen": -404.0, + "logps/rejected": -380.0, + "loss": 0.0653, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.0546875, + "rewards/margins": 9.125, + "rewards/rejected": -8.0625, + "step": 1514 + }, + { + "epoch": 1.8588957055214723, + "grad_norm": 17.071420621019563, + "learning_rate": 1.921487603305785e-07, + "logits/chosen": -0.265625, + "logits/rejected": -0.48828125, + "logps/chosen": -402.0, + "logps/rejected": -346.0, + "loss": 0.0765, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.53125, + "rewards/margins": 9.1875, + "rewards/rejected": -7.65625, + "step": 1515 + }, + { + "epoch": 1.860122699386503, + "grad_norm": 16.719990803812202, + "learning_rate": 1.9194214876033057e-07, + "logits/chosen": -0.24609375, + "logits/rejected": -0.396484375, + "logps/chosen": -412.0, + "logps/rejected": -370.0, + "loss": 0.085, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.0732421875, + "rewards/margins": 7.40625, + "rewards/rejected": -7.3125, + "step": 1516 + }, + { + "epoch": 1.8613496932515337, + "grad_norm": 12.209079541692272, + "learning_rate": 1.9173553719008264e-07, + "logits/chosen": -0.287109375, + "logits/rejected": -0.48046875, + "logps/chosen": -414.0, + "logps/rejected": -352.0, + "loss": 0.0626, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.046875, + "rewards/margins": 8.6875, + "rewards/rejected": -7.625, + "step": 1517 + }, + { + "epoch": 1.8625766871165643, + "grad_norm": 16.39414971251806, + "learning_rate": 1.915289256198347e-07, + "logits/chosen": -0.294921875, + "logits/rejected": -0.494140625, + "logps/chosen": -376.0, + "logps/rejected": -328.0, + "loss": 0.0807, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.57421875, + "rewards/margins": 8.625, + "rewards/rejected": -8.0625, + "step": 1518 + }, + { + "epoch": 1.863803680981595, + "grad_norm": 15.890943624391708, + "learning_rate": 1.9132231404958676e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.4140625, + "logps/chosen": -366.0, + "logps/rejected": -370.0, + "loss": 0.0651, + "rewards/accuracies": 0.96875, + "rewards/chosen": -0.337890625, + "rewards/margins": 7.5, + "rewards/rejected": -7.84375, + "step": 1519 + }, + { + "epoch": 1.8650306748466257, + "grad_norm": 13.857977675424138, + "learning_rate": 1.9111570247933884e-07, + "logits/chosen": -0.2890625, + "logits/rejected": -0.359375, + "logps/chosen": -388.0, + "logps/rejected": -358.0, + "loss": 0.0497, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.32421875, + "rewards/margins": 8.1875, + "rewards/rejected": -7.84375, + "step": 1520 + }, + { + "epoch": 1.8662576687116563, + "grad_norm": 18.038088141188503, + "learning_rate": 1.909090909090909e-07, + "logits/chosen": -0.1982421875, + "logits/rejected": -0.390625, + "logps/chosen": -368.0, + "logps/rejected": -328.0, + "loss": 0.0741, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.47265625, + "rewards/margins": 7.84375, + "rewards/rejected": -7.34375, + "step": 1521 + }, + { + "epoch": 1.867484662576687, + "grad_norm": 18.967110704939405, + "learning_rate": 1.9070247933884296e-07, + "logits/chosen": -0.2314453125, + "logits/rejected": -0.41796875, + "logps/chosen": -362.0, + "logps/rejected": -334.0, + "loss": 0.1014, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.80859375, + "rewards/margins": 8.3125, + "rewards/rejected": -7.5, + "step": 1522 + }, + { + "epoch": 1.8687116564417177, + "grad_norm": 17.741591856514688, + "learning_rate": 1.9049586776859503e-07, + "logits/chosen": -0.298828125, + "logits/rejected": -0.43359375, + "logps/chosen": -370.0, + "logps/rejected": -334.0, + "loss": 0.0675, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.71484375, + "rewards/margins": 8.5, + "rewards/rejected": -7.8125, + "step": 1523 + }, + { + "epoch": 1.8699386503067483, + "grad_norm": 20.803822165387253, + "learning_rate": 1.902892561983471e-07, + "logits/chosen": -0.1533203125, + "logits/rejected": -0.3125, + "logps/chosen": -344.0, + "logps/rejected": -360.0, + "loss": 0.0995, + "rewards/accuracies": 0.9609375, + "rewards/chosen": -0.244140625, + "rewards/margins": 7.875, + "rewards/rejected": -8.125, + "step": 1524 + }, + { + "epoch": 1.871165644171779, + "grad_norm": 22.570729030773556, + "learning_rate": 1.9008264462809918e-07, + "logits/chosen": -0.275390625, + "logits/rejected": -0.4453125, + "logps/chosen": -346.0, + "logps/rejected": -354.0, + "loss": 0.0879, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.8828125, + "rewards/margins": 9.125, + "rewards/rejected": -8.25, + "step": 1525 + }, + { + "epoch": 1.8723926380368097, + "grad_norm": 19.496680476670846, + "learning_rate": 1.8987603305785125e-07, + "logits/chosen": -0.16015625, + "logits/rejected": -0.359375, + "logps/chosen": -406.0, + "logps/rejected": -352.0, + "loss": 0.0996, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 1.0, + "rewards/margins": 8.1875, + "rewards/rejected": -7.1875, + "step": 1526 + }, + { + "epoch": 1.8736196319018403, + "grad_norm": 19.187276658450095, + "learning_rate": 1.896694214876033e-07, + "logits/chosen": -0.2060546875, + "logits/rejected": -0.404296875, + "logps/chosen": -408.0, + "logps/rejected": -328.0, + "loss": 0.0768, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.9140625, + "rewards/margins": 8.375, + "rewards/rejected": -7.46875, + "step": 1527 + }, + { + "epoch": 1.874846625766871, + "grad_norm": 12.224106373875838, + "learning_rate": 1.8946280991735537e-07, + "logits/chosen": -0.1650390625, + "logits/rejected": -0.37890625, + "logps/chosen": -392.0, + "logps/rejected": -324.0, + "loss": 0.0716, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.0546875, + "rewards/margins": 8.8125, + "rewards/rejected": -7.75, + "step": 1528 + }, + { + "epoch": 1.876073619631902, + "grad_norm": 13.189072919497397, + "learning_rate": 1.8925619834710742e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.51953125, + "logps/chosen": -420.0, + "logps/rejected": -360.0, + "loss": 0.0461, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.640625, + "rewards/margins": 9.9375, + "rewards/rejected": -8.3125, + "step": 1529 + }, + { + "epoch": 1.8773006134969326, + "grad_norm": 15.891716890392578, + "learning_rate": 1.890495867768595e-07, + "logits/chosen": -0.27734375, + "logits/rejected": -0.408203125, + "logps/chosen": -382.0, + "logps/rejected": -322.0, + "loss": 0.0907, + "rewards/accuracies": 0.9765625, + "rewards/chosen": -0.1728515625, + "rewards/margins": 7.84375, + "rewards/rejected": -8.0, + "step": 1530 + }, + { + "epoch": 1.8785276073619632, + "grad_norm": 20.40280513004175, + "learning_rate": 1.8884297520661154e-07, + "logits/chosen": -0.1572265625, + "logits/rejected": -0.3046875, + "logps/chosen": -376.0, + "logps/rejected": -332.0, + "loss": 0.1019, + "rewards/accuracies": 0.953125, + "rewards/chosen": -0.1015625, + "rewards/margins": 7.625, + "rewards/rejected": -7.75, + "step": 1531 + }, + { + "epoch": 1.879754601226994, + "grad_norm": 12.781822182528002, + "learning_rate": 1.8863636363636361e-07, + "logits/chosen": -0.39453125, + "logits/rejected": -0.56640625, + "logps/chosen": -432.0, + "logps/rejected": -402.0, + "loss": 0.0519, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.1875, + "rewards/margins": 9.375, + "rewards/rejected": -8.1875, + "step": 1532 + }, + { + "epoch": 1.8809815950920246, + "grad_norm": 16.121285182923785, + "learning_rate": 1.884297520661157e-07, + "logits/chosen": -0.21875, + "logits/rejected": -0.365234375, + "logps/chosen": -380.0, + "logps/rejected": -362.0, + "loss": 0.0829, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.40625, + "rewards/margins": 7.53125, + "rewards/rejected": -7.125, + "step": 1533 + }, + { + "epoch": 1.8822085889570552, + "grad_norm": 13.827869103464698, + "learning_rate": 1.8822314049586776e-07, + "logits/chosen": -0.296875, + "logits/rejected": -0.443359375, + "logps/chosen": -382.0, + "logps/rejected": -368.0, + "loss": 0.0717, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.27734375, + "rewards/margins": 8.125, + "rewards/rejected": -7.84375, + "step": 1534 + }, + { + "epoch": 1.883435582822086, + "grad_norm": 17.494379446948752, + "learning_rate": 1.8801652892561983e-07, + "logits/chosen": -0.1611328125, + "logits/rejected": -0.408203125, + "logps/chosen": -368.0, + "logps/rejected": -318.0, + "loss": 0.0727, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.98828125, + "rewards/margins": 8.375, + "rewards/rejected": -7.40625, + "step": 1535 + }, + { + "epoch": 1.8846625766871166, + "grad_norm": 18.488925778102313, + "learning_rate": 1.8780991735537188e-07, + "logits/chosen": -0.171875, + "logits/rejected": -0.365234375, + "logps/chosen": -450.0, + "logps/rejected": -398.0, + "loss": 0.0724, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.15625, + "rewards/margins": 8.625, + "rewards/rejected": -7.4375, + "step": 1536 + }, + { + "epoch": 1.8858895705521472, + "grad_norm": 11.009905239673062, + "learning_rate": 1.8760330578512395e-07, + "logits/chosen": -0.22265625, + "logits/rejected": -0.4453125, + "logps/chosen": -374.0, + "logps/rejected": -346.0, + "loss": 0.0436, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.71484375, + "rewards/margins": 8.5, + "rewards/rejected": -7.8125, + "step": 1537 + }, + { + "epoch": 1.887116564417178, + "grad_norm": 11.45993497676878, + "learning_rate": 1.8739669421487603e-07, + "logits/chosen": -0.236328125, + "logits/rejected": -0.369140625, + "logps/chosen": -362.0, + "logps/rejected": -350.0, + "loss": 0.0402, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.85546875, + "rewards/margins": 8.3125, + "rewards/rejected": -7.4375, + "step": 1538 + }, + { + "epoch": 1.8883435582822086, + "grad_norm": 13.349132041853364, + "learning_rate": 1.871900826446281e-07, + "logits/chosen": -0.146484375, + "logits/rejected": -0.37109375, + "logps/chosen": -376.0, + "logps/rejected": -346.0, + "loss": 0.0607, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.5234375, + "rewards/margins": 7.625, + "rewards/rejected": -7.09375, + "step": 1539 + }, + { + "epoch": 1.8895705521472392, + "grad_norm": 18.36311236887226, + "learning_rate": 1.8698347107438015e-07, + "logits/chosen": -0.39453125, + "logits/rejected": -0.5390625, + "logps/chosen": -432.0, + "logps/rejected": -422.0, + "loss": 0.0777, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.0546875, + "rewards/margins": 8.625, + "rewards/rejected": -7.5625, + "step": 1540 + }, + { + "epoch": 1.89079754601227, + "grad_norm": 16.19023546437399, + "learning_rate": 1.8677685950413222e-07, + "logits/chosen": -0.34765625, + "logits/rejected": -0.5, + "logps/chosen": -378.0, + "logps/rejected": -364.0, + "loss": 0.0679, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.765625, + "rewards/margins": 8.3125, + "rewards/rejected": -7.5625, + "step": 1541 + }, + { + "epoch": 1.8920245398773006, + "grad_norm": 14.543972218564775, + "learning_rate": 1.865702479338843e-07, + "logits/chosen": -0.298828125, + "logits/rejected": -0.48046875, + "logps/chosen": -398.0, + "logps/rejected": -360.0, + "loss": 0.0529, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.390625, + "rewards/margins": 9.25, + "rewards/rejected": -7.84375, + "step": 1542 + }, + { + "epoch": 1.8932515337423312, + "grad_norm": 11.95081032652667, + "learning_rate": 1.8636363636363637e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.462890625, + "logps/chosen": -372.0, + "logps/rejected": -350.0, + "loss": 0.0503, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.80078125, + "rewards/margins": 8.625, + "rewards/rejected": -7.8125, + "step": 1543 + }, + { + "epoch": 1.8944785276073621, + "grad_norm": 15.346383720672437, + "learning_rate": 1.8615702479338844e-07, + "logits/chosen": -0.33203125, + "logits/rejected": -0.51171875, + "logps/chosen": -414.0, + "logps/rejected": -404.0, + "loss": 0.0628, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.953125, + "rewards/margins": 8.625, + "rewards/rejected": -7.6875, + "step": 1544 + }, + { + "epoch": 1.8957055214723928, + "grad_norm": 13.729280643295004, + "learning_rate": 1.859504132231405e-07, + "logits/chosen": -0.2421875, + "logits/rejected": -0.431640625, + "logps/chosen": -388.0, + "logps/rejected": -318.0, + "loss": 0.0556, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.296875, + "rewards/margins": 7.46875, + "rewards/rejected": -7.15625, + "step": 1545 + }, + { + "epoch": 1.8969325153374235, + "grad_norm": 19.79972702374522, + "learning_rate": 1.8574380165289256e-07, + "logits/chosen": -0.26953125, + "logits/rejected": -0.443359375, + "logps/chosen": -370.0, + "logps/rejected": -334.0, + "loss": 0.0735, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.59375, + "rewards/margins": 8.0625, + "rewards/rejected": -7.5, + "step": 1546 + }, + { + "epoch": 1.8981595092024541, + "grad_norm": 17.368679503832553, + "learning_rate": 1.855371900826446e-07, + "logits/chosen": -0.2431640625, + "logits/rejected": -0.5546875, + "logps/chosen": -482.0, + "logps/rejected": -372.0, + "loss": 0.0614, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.0625, + "rewards/margins": 9.375, + "rewards/rejected": -8.3125, + "step": 1547 + }, + { + "epoch": 1.8993865030674848, + "grad_norm": 31.906634148177798, + "learning_rate": 1.8533057851239668e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.333984375, + "logps/chosen": -394.0, + "logps/rejected": -386.0, + "loss": 0.0734, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.515625, + "rewards/margins": 8.0, + "rewards/rejected": -7.5, + "step": 1548 + }, + { + "epoch": 1.9006134969325155, + "grad_norm": 14.790340930236075, + "learning_rate": 1.8512396694214873e-07, + "logits/chosen": -0.1767578125, + "logits/rejected": -0.38671875, + "logps/chosen": -384.0, + "logps/rejected": -330.0, + "loss": 0.0803, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.46484375, + "rewards/margins": 7.53125, + "rewards/rejected": -7.09375, + "step": 1549 + }, + { + "epoch": 1.9018404907975461, + "grad_norm": 16.17337431777944, + "learning_rate": 1.849173553719008e-07, + "logits/chosen": -0.279296875, + "logits/rejected": -0.3828125, + "logps/chosen": -388.0, + "logps/rejected": -350.0, + "loss": 0.07, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.56640625, + "rewards/margins": 8.5625, + "rewards/rejected": -8.0, + "step": 1550 + }, + { + "epoch": 1.9030674846625768, + "grad_norm": 13.058682584284002, + "learning_rate": 1.8471074380165288e-07, + "logits/chosen": -0.31640625, + "logits/rejected": -0.5234375, + "logps/chosen": -426.0, + "logps/rejected": -374.0, + "loss": 0.0661, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.435546875, + "rewards/margins": 8.0625, + "rewards/rejected": -7.625, + "step": 1551 + }, + { + "epoch": 1.9042944785276075, + "grad_norm": 18.975415198635574, + "learning_rate": 1.8450413223140495e-07, + "logits/chosen": -0.25, + "logits/rejected": -0.3828125, + "logps/chosen": -354.0, + "logps/rejected": -324.0, + "loss": 0.1003, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.349609375, + "rewards/margins": 7.125, + "rewards/rejected": -6.78125, + "step": 1552 + }, + { + "epoch": 1.9055214723926381, + "grad_norm": 16.503921096809567, + "learning_rate": 1.8429752066115703e-07, + "logits/chosen": -0.201171875, + "logits/rejected": -0.326171875, + "logps/chosen": -386.0, + "logps/rejected": -316.0, + "loss": 0.0626, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.5078125, + "rewards/margins": 8.0, + "rewards/rejected": -7.5, + "step": 1553 + }, + { + "epoch": 1.9067484662576688, + "grad_norm": 16.1200440750319, + "learning_rate": 1.8409090909090907e-07, + "logits/chosen": -0.359375, + "logits/rejected": -0.62109375, + "logps/chosen": -418.0, + "logps/rejected": -362.0, + "loss": 0.0711, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.81640625, + "rewards/margins": 8.5, + "rewards/rejected": -7.6875, + "step": 1554 + }, + { + "epoch": 1.9079754601226995, + "grad_norm": 17.86351324332019, + "learning_rate": 1.8388429752066115e-07, + "logits/chosen": -0.380859375, + "logits/rejected": -0.412109375, + "logps/chosen": -376.0, + "logps/rejected": -368.0, + "loss": 0.0678, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.828125, + "rewards/margins": 8.375, + "rewards/rejected": -7.53125, + "step": 1555 + }, + { + "epoch": 1.9092024539877301, + "grad_norm": 13.370865232547146, + "learning_rate": 1.8367768595041322e-07, + "logits/chosen": -0.2080078125, + "logits/rejected": -0.435546875, + "logps/chosen": -402.0, + "logps/rejected": -350.0, + "loss": 0.0622, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.03125, + "rewards/margins": 8.1875, + "rewards/rejected": -7.125, + "step": 1556 + }, + { + "epoch": 1.9104294478527608, + "grad_norm": 17.840722552958336, + "learning_rate": 1.834710743801653e-07, + "logits/chosen": -0.1474609375, + "logits/rejected": -0.38671875, + "logps/chosen": -398.0, + "logps/rejected": -370.0, + "loss": 0.0788, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.54296875, + "rewards/margins": 7.25, + "rewards/rejected": -6.71875, + "step": 1557 + }, + { + "epoch": 1.9116564417177915, + "grad_norm": 10.994682736952559, + "learning_rate": 1.8326446280991734e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.443359375, + "logps/chosen": -388.0, + "logps/rejected": -386.0, + "loss": 0.0407, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.9921875, + "rewards/margins": 8.5625, + "rewards/rejected": -7.59375, + "step": 1558 + }, + { + "epoch": 1.9128834355828221, + "grad_norm": 19.70741185520124, + "learning_rate": 1.8305785123966941e-07, + "logits/chosen": -0.1708984375, + "logits/rejected": -0.265625, + "logps/chosen": -390.0, + "logps/rejected": -312.0, + "loss": 0.1004, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.50390625, + "rewards/margins": 7.34375, + "rewards/rejected": -6.84375, + "step": 1559 + }, + { + "epoch": 1.9141104294478528, + "grad_norm": 14.735555239774861, + "learning_rate": 1.828512396694215e-07, + "logits/chosen": -0.2080078125, + "logits/rejected": -0.39453125, + "logps/chosen": -368.0, + "logps/rejected": -326.0, + "loss": 0.0704, + "rewards/accuracies": 0.9765625, + "rewards/chosen": -0.1611328125, + "rewards/margins": 7.625, + "rewards/rejected": -7.8125, + "step": 1560 + }, + { + "epoch": 1.9153374233128835, + "grad_norm": 17.97811007791773, + "learning_rate": 1.8264462809917356e-07, + "logits/chosen": -0.2890625, + "logits/rejected": -0.5546875, + "logps/chosen": -448.0, + "logps/rejected": -364.0, + "loss": 0.0705, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.5, + "rewards/margins": 9.125, + "rewards/rejected": -7.625, + "step": 1561 + }, + { + "epoch": 1.9165644171779141, + "grad_norm": 9.68873741335912, + "learning_rate": 1.824380165289256e-07, + "logits/chosen": -0.32421875, + "logits/rejected": -0.53515625, + "logps/chosen": -436.0, + "logps/rejected": -374.0, + "loss": 0.0375, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.703125, + "rewards/margins": 8.9375, + "rewards/rejected": -7.21875, + "step": 1562 + }, + { + "epoch": 1.9177914110429448, + "grad_norm": 14.07231161016849, + "learning_rate": 1.8223140495867768e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.5, + "logps/chosen": -398.0, + "logps/rejected": -358.0, + "loss": 0.0583, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 1.3359375, + "rewards/margins": 8.6875, + "rewards/rejected": -7.3125, + "step": 1563 + }, + { + "epoch": 1.9190184049079755, + "grad_norm": 15.162777851608853, + "learning_rate": 1.8202479338842976e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.462890625, + "logps/chosen": -380.0, + "logps/rejected": -360.0, + "loss": 0.0651, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.69921875, + "rewards/margins": 7.78125, + "rewards/rejected": -7.0625, + "step": 1564 + }, + { + "epoch": 1.9202453987730062, + "grad_norm": 8.989543359392542, + "learning_rate": 1.818181818181818e-07, + "logits/chosen": -0.38671875, + "logits/rejected": -0.578125, + "logps/chosen": -320.0, + "logps/rejected": -302.0, + "loss": 0.0453, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.7578125, + "rewards/margins": 8.3125, + "rewards/rejected": -7.5625, + "step": 1565 + }, + { + "epoch": 1.9214723926380368, + "grad_norm": 15.42845482201227, + "learning_rate": 1.8161157024793388e-07, + "logits/chosen": -0.2392578125, + "logits/rejected": -0.384765625, + "logps/chosen": -400.0, + "logps/rejected": -382.0, + "loss": 0.0643, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.5234375, + "rewards/margins": 9.0, + "rewards/rejected": -7.46875, + "step": 1566 + }, + { + "epoch": 1.9226993865030675, + "grad_norm": 11.957956051809287, + "learning_rate": 1.8140495867768592e-07, + "logits/chosen": -0.255859375, + "logits/rejected": -0.416015625, + "logps/chosen": -372.0, + "logps/rejected": -348.0, + "loss": 0.062, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.67578125, + "rewards/margins": 8.4375, + "rewards/rejected": -7.75, + "step": 1567 + }, + { + "epoch": 1.9239263803680982, + "grad_norm": 15.889854049410278, + "learning_rate": 1.81198347107438e-07, + "logits/chosen": -0.201171875, + "logits/rejected": -0.431640625, + "logps/chosen": -386.0, + "logps/rejected": -362.0, + "loss": 0.0621, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.7421875, + "rewards/margins": 8.9375, + "rewards/rejected": -7.1875, + "step": 1568 + }, + { + "epoch": 1.9251533742331288, + "grad_norm": 21.646714958845084, + "learning_rate": 1.8099173553719007e-07, + "logits/chosen": -0.109375, + "logits/rejected": -0.2578125, + "logps/chosen": -388.0, + "logps/rejected": -324.0, + "loss": 0.0662, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.515625, + "rewards/margins": 7.78125, + "rewards/rejected": -7.28125, + "step": 1569 + }, + { + "epoch": 1.9263803680981595, + "grad_norm": 11.393196483354775, + "learning_rate": 1.8078512396694214e-07, + "logits/chosen": -0.234375, + "logits/rejected": -0.447265625, + "logps/chosen": -378.0, + "logps/rejected": -346.0, + "loss": 0.0587, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.4140625, + "rewards/margins": 7.65625, + "rewards/rejected": -7.25, + "step": 1570 + }, + { + "epoch": 1.9276073619631902, + "grad_norm": 18.937790760222054, + "learning_rate": 1.805785123966942e-07, + "logits/chosen": -0.26171875, + "logits/rejected": -0.419921875, + "logps/chosen": -424.0, + "logps/rejected": -386.0, + "loss": 0.0827, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.95703125, + "rewards/margins": 7.9375, + "rewards/rejected": -6.96875, + "step": 1571 + }, + { + "epoch": 1.9288343558282208, + "grad_norm": 10.488631686538346, + "learning_rate": 1.8037190082644626e-07, + "logits/chosen": -0.296875, + "logits/rejected": -0.494140625, + "logps/chosen": -408.0, + "logps/rejected": -360.0, + "loss": 0.0403, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.828125, + "rewards/margins": 8.875, + "rewards/rejected": -8.0625, + "step": 1572 + }, + { + "epoch": 1.9300613496932515, + "grad_norm": 15.41524900418897, + "learning_rate": 1.8016528925619834e-07, + "logits/chosen": -0.291015625, + "logits/rejected": -0.427734375, + "logps/chosen": -396.0, + "logps/rejected": -354.0, + "loss": 0.0707, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.25390625, + "rewards/margins": 7.6875, + "rewards/rejected": -7.4375, + "step": 1573 + }, + { + "epoch": 1.9312883435582822, + "grad_norm": 17.095977350911046, + "learning_rate": 1.799586776859504e-07, + "logits/chosen": -0.154296875, + "logits/rejected": -0.302734375, + "logps/chosen": -360.0, + "logps/rejected": -364.0, + "loss": 0.0673, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.703125, + "rewards/margins": 7.78125, + "rewards/rejected": -7.09375, + "step": 1574 + }, + { + "epoch": 1.9325153374233128, + "grad_norm": 17.678902691852176, + "learning_rate": 1.7975206611570249e-07, + "logits/chosen": -0.298828125, + "logits/rejected": -0.4296875, + "logps/chosen": -394.0, + "logps/rejected": -340.0, + "loss": 0.0827, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.0078125, + "rewards/margins": 8.5625, + "rewards/rejected": -7.59375, + "step": 1575 + }, + { + "epoch": 1.9337423312883435, + "grad_norm": 15.920908291632927, + "learning_rate": 1.7954545454545453e-07, + "logits/chosen": -0.29296875, + "logits/rejected": -0.49609375, + "logps/chosen": -372.0, + "logps/rejected": -342.0, + "loss": 0.0601, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.126953125, + "rewards/margins": 7.9375, + "rewards/rejected": -8.0625, + "step": 1576 + }, + { + "epoch": 1.9349693251533742, + "grad_norm": 15.906075116479652, + "learning_rate": 1.793388429752066e-07, + "logits/chosen": -0.228515625, + "logits/rejected": -0.40234375, + "logps/chosen": -384.0, + "logps/rejected": -306.0, + "loss": 0.0731, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.1875, + "rewards/margins": 8.6875, + "rewards/rejected": -7.46875, + "step": 1577 + }, + { + "epoch": 1.9361963190184048, + "grad_norm": 20.09538798619118, + "learning_rate": 1.7913223140495868e-07, + "logits/chosen": -0.2412109375, + "logits/rejected": -0.419921875, + "logps/chosen": -378.0, + "logps/rejected": -376.0, + "loss": 0.0811, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.326171875, + "rewards/margins": 8.1875, + "rewards/rejected": -7.84375, + "step": 1578 + }, + { + "epoch": 1.9374233128834355, + "grad_norm": 12.298477999538573, + "learning_rate": 1.7892561983471075e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.3984375, + "logps/chosen": -380.0, + "logps/rejected": -342.0, + "loss": 0.0599, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.59375, + "rewards/margins": 8.0625, + "rewards/rejected": -7.5, + "step": 1579 + }, + { + "epoch": 1.9386503067484662, + "grad_norm": 10.849637266639293, + "learning_rate": 1.787190082644628e-07, + "logits/chosen": -0.265625, + "logits/rejected": -0.4765625, + "logps/chosen": -440.0, + "logps/rejected": -376.0, + "loss": 0.0477, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.1796875, + "rewards/margins": 8.875, + "rewards/rejected": -7.6875, + "step": 1580 + }, + { + "epoch": 1.9398773006134968, + "grad_norm": 13.990885859252648, + "learning_rate": 1.7851239669421487e-07, + "logits/chosen": -0.220703125, + "logits/rejected": -0.380859375, + "logps/chosen": -412.0, + "logps/rejected": -364.0, + "loss": 0.0635, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.015625, + "rewards/margins": 8.375, + "rewards/rejected": -7.34375, + "step": 1581 + }, + { + "epoch": 1.9411042944785275, + "grad_norm": 14.910402890547681, + "learning_rate": 1.7830578512396692e-07, + "logits/chosen": -0.1572265625, + "logits/rejected": -0.28125, + "logps/chosen": -326.0, + "logps/rejected": -310.0, + "loss": 0.0873, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.1611328125, + "rewards/margins": 7.0625, + "rewards/rejected": -6.90625, + "step": 1582 + }, + { + "epoch": 1.9423312883435582, + "grad_norm": 21.965289093237924, + "learning_rate": 1.78099173553719e-07, + "logits/chosen": -0.2265625, + "logits/rejected": -0.408203125, + "logps/chosen": -414.0, + "logps/rejected": -358.0, + "loss": 0.0772, + "rewards/accuracies": 0.96875, + "rewards/chosen": 1.171875, + "rewards/margins": 8.375, + "rewards/rejected": -7.21875, + "step": 1583 + }, + { + "epoch": 1.9435582822085888, + "grad_norm": 16.642939256031468, + "learning_rate": 1.7789256198347107e-07, + "logits/chosen": -0.21875, + "logits/rejected": -0.40625, + "logps/chosen": -432.0, + "logps/rejected": -356.0, + "loss": 0.0887, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.625, + "rewards/margins": 7.59375, + "rewards/rejected": -6.96875, + "step": 1584 + }, + { + "epoch": 1.9447852760736195, + "grad_norm": 16.42513846451918, + "learning_rate": 1.7768595041322312e-07, + "logits/chosen": -0.283203125, + "logits/rejected": -0.431640625, + "logps/chosen": -412.0, + "logps/rejected": -388.0, + "loss": 0.0519, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.3828125, + "rewards/margins": 9.1875, + "rewards/rejected": -7.78125, + "step": 1585 + }, + { + "epoch": 1.9460122699386502, + "grad_norm": 18.29573534106398, + "learning_rate": 1.774793388429752e-07, + "logits/chosen": -0.314453125, + "logits/rejected": -0.49609375, + "logps/chosen": -396.0, + "logps/rejected": -344.0, + "loss": 0.0887, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.90234375, + "rewards/margins": 7.625, + "rewards/rejected": -6.71875, + "step": 1586 + }, + { + "epoch": 1.9472392638036808, + "grad_norm": 12.580384580594664, + "learning_rate": 1.7727272727272726e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.45703125, + "logps/chosen": -354.0, + "logps/rejected": -322.0, + "loss": 0.0669, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.412109375, + "rewards/margins": 7.28125, + "rewards/rejected": -6.84375, + "step": 1587 + }, + { + "epoch": 1.9484662576687115, + "grad_norm": 12.585504293545585, + "learning_rate": 1.7706611570247934e-07, + "logits/chosen": -0.203125, + "logits/rejected": -0.380859375, + "logps/chosen": -370.0, + "logps/rejected": -338.0, + "loss": 0.0678, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.78515625, + "rewards/margins": 7.8125, + "rewards/rejected": -7.0, + "step": 1588 + }, + { + "epoch": 1.9496932515337422, + "grad_norm": 14.387923555339917, + "learning_rate": 1.7685950413223138e-07, + "logits/chosen": -0.283203125, + "logits/rejected": -0.4453125, + "logps/chosen": -356.0, + "logps/rejected": -344.0, + "loss": 0.0651, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.71875, + "rewards/margins": 8.5, + "rewards/rejected": -7.78125, + "step": 1589 + }, + { + "epoch": 1.9509202453987728, + "grad_norm": 18.309926390635418, + "learning_rate": 1.7665289256198346e-07, + "logits/chosen": -0.1962890625, + "logits/rejected": -0.361328125, + "logps/chosen": -390.0, + "logps/rejected": -374.0, + "loss": 0.0592, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.265625, + "rewards/margins": 8.625, + "rewards/rejected": -7.375, + "step": 1590 + }, + { + "epoch": 1.9521472392638037, + "grad_norm": 11.073900129635811, + "learning_rate": 1.7644628099173553e-07, + "logits/chosen": -0.291015625, + "logits/rejected": -0.44140625, + "logps/chosen": -360.0, + "logps/rejected": -326.0, + "loss": 0.0469, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.56640625, + "rewards/margins": 8.25, + "rewards/rejected": -7.71875, + "step": 1591 + }, + { + "epoch": 1.9533742331288344, + "grad_norm": 10.45569293496878, + "learning_rate": 1.762396694214876e-07, + "logits/chosen": -0.19921875, + "logits/rejected": -0.341796875, + "logps/chosen": -370.0, + "logps/rejected": -356.0, + "loss": 0.0525, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.267578125, + "rewards/margins": 7.8125, + "rewards/rejected": -7.5625, + "step": 1592 + }, + { + "epoch": 1.954601226993865, + "grad_norm": 16.81098801924393, + "learning_rate": 1.7603305785123968e-07, + "logits/chosen": -0.2119140625, + "logits/rejected": -0.3671875, + "logps/chosen": -396.0, + "logps/rejected": -352.0, + "loss": 0.0737, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.44140625, + "rewards/margins": 8.375, + "rewards/rejected": -7.90625, + "step": 1593 + }, + { + "epoch": 1.9558282208588957, + "grad_norm": 16.874405948149928, + "learning_rate": 1.7582644628099172e-07, + "logits/chosen": -0.2890625, + "logits/rejected": -0.439453125, + "logps/chosen": -324.0, + "logps/rejected": -304.0, + "loss": 0.0907, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.76953125, + "rewards/margins": 8.3125, + "rewards/rejected": -7.53125, + "step": 1594 + }, + { + "epoch": 1.9570552147239264, + "grad_norm": 13.916000616686723, + "learning_rate": 1.756198347107438e-07, + "logits/chosen": -0.240234375, + "logits/rejected": -0.322265625, + "logps/chosen": -370.0, + "logps/rejected": -360.0, + "loss": 0.0649, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.25, + "rewards/margins": 8.5625, + "rewards/rejected": -8.3125, + "step": 1595 + }, + { + "epoch": 1.958282208588957, + "grad_norm": 13.761689054733528, + "learning_rate": 1.7541322314049587e-07, + "logits/chosen": -0.30078125, + "logits/rejected": -0.34765625, + "logps/chosen": -356.0, + "logps/rejected": -326.0, + "loss": 0.0586, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.2138671875, + "rewards/margins": 8.1875, + "rewards/rejected": -7.96875, + "step": 1596 + }, + { + "epoch": 1.9595092024539877, + "grad_norm": 12.939807513369477, + "learning_rate": 1.7520661157024794e-07, + "logits/chosen": -0.2314453125, + "logits/rejected": -0.43359375, + "logps/chosen": -392.0, + "logps/rejected": -348.0, + "loss": 0.0597, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.62109375, + "rewards/margins": 8.8125, + "rewards/rejected": -8.1875, + "step": 1597 + }, + { + "epoch": 1.9607361963190184, + "grad_norm": 24.210872748895458, + "learning_rate": 1.75e-07, + "logits/chosen": -0.296875, + "logits/rejected": -0.40234375, + "logps/chosen": -384.0, + "logps/rejected": -384.0, + "loss": 0.0871, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.171875, + "rewards/margins": 8.0, + "rewards/rejected": -7.84375, + "step": 1598 + }, + { + "epoch": 1.961963190184049, + "grad_norm": 13.231799352209123, + "learning_rate": 1.7479338842975207e-07, + "logits/chosen": -0.2265625, + "logits/rejected": -0.453125, + "logps/chosen": -396.0, + "logps/rejected": -344.0, + "loss": 0.0632, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.419921875, + "rewards/margins": 8.375, + "rewards/rejected": -7.9375, + "step": 1599 + }, + { + "epoch": 1.9631901840490797, + "grad_norm": 16.86215786601759, + "learning_rate": 1.745867768595041e-07, + "logits/chosen": -0.2001953125, + "logits/rejected": -0.35546875, + "logps/chosen": -408.0, + "logps/rejected": -366.0, + "loss": 0.0691, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.294921875, + "rewards/margins": 7.90625, + "rewards/rejected": -7.625, + "step": 1600 + }, + { + "epoch": 1.9644171779141104, + "grad_norm": 16.903866876358965, + "learning_rate": 1.7438016528925619e-07, + "logits/chosen": -0.150390625, + "logits/rejected": -0.267578125, + "logps/chosen": -340.0, + "logps/rejected": -330.0, + "loss": 0.089, + "rewards/accuracies": 0.9765625, + "rewards/chosen": -0.23046875, + "rewards/margins": 7.375, + "rewards/rejected": -7.625, + "step": 1601 + }, + { + "epoch": 1.965644171779141, + "grad_norm": 19.920257096709662, + "learning_rate": 1.7417355371900826e-07, + "logits/chosen": -0.2177734375, + "logits/rejected": -0.419921875, + "logps/chosen": -438.0, + "logps/rejected": -338.0, + "loss": 0.0853, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.76171875, + "rewards/margins": 8.4375, + "rewards/rejected": -7.6875, + "step": 1602 + }, + { + "epoch": 1.9668711656441717, + "grad_norm": 18.82710805276002, + "learning_rate": 1.739669421487603e-07, + "logits/chosen": -0.244140625, + "logits/rejected": -0.43359375, + "logps/chosen": -466.0, + "logps/rejected": -386.0, + "loss": 0.0765, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.31640625, + "rewards/margins": 8.75, + "rewards/rejected": -8.4375, + "step": 1603 + }, + { + "epoch": 1.9680981595092024, + "grad_norm": 13.660334432483126, + "learning_rate": 1.7376033057851238e-07, + "logits/chosen": -0.185546875, + "logits/rejected": -0.376953125, + "logps/chosen": -386.0, + "logps/rejected": -354.0, + "loss": 0.0614, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.63671875, + "rewards/margins": 8.0625, + "rewards/rejected": -7.40625, + "step": 1604 + }, + { + "epoch": 1.969325153374233, + "grad_norm": 16.355510174655173, + "learning_rate": 1.7355371900826445e-07, + "logits/chosen": -0.2060546875, + "logits/rejected": -0.349609375, + "logps/chosen": -426.0, + "logps/rejected": -392.0, + "loss": 0.0872, + "rewards/accuracies": 0.9765625, + "rewards/chosen": -0.015869140625, + "rewards/margins": 7.9375, + "rewards/rejected": -7.9375, + "step": 1605 + }, + { + "epoch": 1.9705521472392638, + "grad_norm": 16.375311133988927, + "learning_rate": 1.7334710743801653e-07, + "logits/chosen": -0.302734375, + "logits/rejected": -0.51171875, + "logps/chosen": -410.0, + "logps/rejected": -394.0, + "loss": 0.0657, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.984375, + "rewards/margins": 9.25, + "rewards/rejected": -8.25, + "step": 1606 + }, + { + "epoch": 1.9717791411042946, + "grad_norm": 14.554343830774451, + "learning_rate": 1.7314049586776857e-07, + "logits/chosen": -0.24609375, + "logits/rejected": -0.474609375, + "logps/chosen": -378.0, + "logps/rejected": -326.0, + "loss": 0.0628, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.68359375, + "rewards/margins": 8.75, + "rewards/rejected": -8.0625, + "step": 1607 + }, + { + "epoch": 1.9730061349693253, + "grad_norm": 15.719187369250749, + "learning_rate": 1.7293388429752065e-07, + "logits/chosen": -0.267578125, + "logits/rejected": -0.466796875, + "logps/chosen": -390.0, + "logps/rejected": -370.0, + "loss": 0.0642, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.40625, + "rewards/margins": 8.625, + "rewards/rejected": -8.1875, + "step": 1608 + }, + { + "epoch": 1.974233128834356, + "grad_norm": 17.01909774411504, + "learning_rate": 1.7272727272727272e-07, + "logits/chosen": -0.287109375, + "logits/rejected": -0.419921875, + "logps/chosen": -374.0, + "logps/rejected": -358.0, + "loss": 0.0787, + "rewards/accuracies": 0.984375, + "rewards/chosen": -0.2001953125, + "rewards/margins": 8.25, + "rewards/rejected": -8.5, + "step": 1609 + }, + { + "epoch": 1.9754601226993866, + "grad_norm": 15.357536676228408, + "learning_rate": 1.725206611570248e-07, + "logits/chosen": -0.3125, + "logits/rejected": -0.408203125, + "logps/chosen": -364.0, + "logps/rejected": -324.0, + "loss": 0.0592, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.1611328125, + "rewards/margins": 8.3125, + "rewards/rejected": -8.1875, + "step": 1610 + }, + { + "epoch": 1.9766871165644173, + "grad_norm": 18.838550299680794, + "learning_rate": 1.7231404958677684e-07, + "logits/chosen": -0.2138671875, + "logits/rejected": -0.34765625, + "logps/chosen": -326.0, + "logps/rejected": -304.0, + "loss": 0.1053, + "rewards/accuracies": 0.9609375, + "rewards/chosen": -0.4296875, + "rewards/margins": 7.03125, + "rewards/rejected": -7.46875, + "step": 1611 + }, + { + "epoch": 1.977914110429448, + "grad_norm": 20.124369243466692, + "learning_rate": 1.7210743801652892e-07, + "logits/chosen": -0.1865234375, + "logits/rejected": -0.390625, + "logps/chosen": -434.0, + "logps/rejected": -420.0, + "loss": 0.0809, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.6640625, + "rewards/margins": 8.8125, + "rewards/rejected": -8.125, + "step": 1612 + }, + { + "epoch": 1.9791411042944786, + "grad_norm": 12.23192136632499, + "learning_rate": 1.71900826446281e-07, + "logits/chosen": -0.146484375, + "logits/rejected": -0.322265625, + "logps/chosen": -440.0, + "logps/rejected": -376.0, + "loss": 0.0454, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.41796875, + "rewards/margins": 9.1875, + "rewards/rejected": -8.8125, + "step": 1613 + }, + { + "epoch": 1.9803680981595093, + "grad_norm": 17.767099358459415, + "learning_rate": 1.7169421487603306e-07, + "logits/chosen": -0.341796875, + "logits/rejected": -0.55078125, + "logps/chosen": -432.0, + "logps/rejected": -390.0, + "loss": 0.0866, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.447265625, + "rewards/margins": 9.0, + "rewards/rejected": -8.5, + "step": 1614 + }, + { + "epoch": 1.98159509202454, + "grad_norm": 18.375199372248133, + "learning_rate": 1.7148760330578514e-07, + "logits/chosen": -0.376953125, + "logits/rejected": -0.4765625, + "logps/chosen": -372.0, + "logps/rejected": -374.0, + "loss": 0.0878, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.380859375, + "rewards/margins": 9.0, + "rewards/rejected": -8.625, + "step": 1615 + }, + { + "epoch": 1.9828220858895707, + "grad_norm": 16.980201801549224, + "learning_rate": 1.7128099173553718e-07, + "logits/chosen": -0.2236328125, + "logits/rejected": -0.361328125, + "logps/chosen": -354.0, + "logps/rejected": -312.0, + "loss": 0.0833, + "rewards/accuracies": 0.984375, + "rewards/chosen": -0.427734375, + "rewards/margins": 7.75, + "rewards/rejected": -8.1875, + "step": 1616 + }, + { + "epoch": 1.9840490797546013, + "grad_norm": 18.340815809134835, + "learning_rate": 1.7107438016528926e-07, + "logits/chosen": -0.1689453125, + "logits/rejected": -0.359375, + "logps/chosen": -362.0, + "logps/rejected": -338.0, + "loss": 0.0799, + "rewards/accuracies": 0.96875, + "rewards/chosen": -0.1640625, + "rewards/margins": 7.28125, + "rewards/rejected": -7.46875, + "step": 1617 + }, + { + "epoch": 1.985276073619632, + "grad_norm": 17.251543871972963, + "learning_rate": 1.708677685950413e-07, + "logits/chosen": -0.314453125, + "logits/rejected": -0.439453125, + "logps/chosen": -372.0, + "logps/rejected": -338.0, + "loss": 0.072, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.11181640625, + "rewards/margins": 7.9375, + "rewards/rejected": -7.8125, + "step": 1618 + }, + { + "epoch": 1.9865030674846627, + "grad_norm": 16.109177601042767, + "learning_rate": 1.7066115702479338e-07, + "logits/chosen": -0.34375, + "logits/rejected": -0.486328125, + "logps/chosen": -416.0, + "logps/rejected": -350.0, + "loss": 0.083, + "rewards/accuracies": 0.984375, + "rewards/chosen": -0.010498046875, + "rewards/margins": 8.0625, + "rewards/rejected": -8.0625, + "step": 1619 + }, + { + "epoch": 1.9877300613496933, + "grad_norm": 15.4178672934062, + "learning_rate": 1.7045454545454543e-07, + "logits/chosen": -0.251953125, + "logits/rejected": -0.423828125, + "logps/chosen": -374.0, + "logps/rejected": -340.0, + "loss": 0.0612, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.283203125, + "rewards/margins": 8.5625, + "rewards/rejected": -8.25, + "step": 1620 + }, + { + "epoch": 1.988957055214724, + "grad_norm": 14.585763450114149, + "learning_rate": 1.702479338842975e-07, + "logits/chosen": -0.2294921875, + "logits/rejected": -0.365234375, + "logps/chosen": -408.0, + "logps/rejected": -382.0, + "loss": 0.0668, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.42578125, + "rewards/margins": 8.5, + "rewards/rejected": -8.125, + "step": 1621 + }, + { + "epoch": 1.9901840490797547, + "grad_norm": 16.117811689018634, + "learning_rate": 1.7004132231404957e-07, + "logits/chosen": -0.455078125, + "logits/rejected": -0.59765625, + "logps/chosen": -406.0, + "logps/rejected": -404.0, + "loss": 0.0836, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.1513671875, + "rewards/margins": 8.375, + "rewards/rejected": -8.25, + "step": 1622 + }, + { + "epoch": 1.9914110429447853, + "grad_norm": 11.62582380086032, + "learning_rate": 1.6983471074380165e-07, + "logits/chosen": -0.2001953125, + "logits/rejected": -0.3984375, + "logps/chosen": -402.0, + "logps/rejected": -366.0, + "loss": 0.0433, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.50390625, + "rewards/margins": 8.875, + "rewards/rejected": -8.375, + "step": 1623 + }, + { + "epoch": 1.992638036809816, + "grad_norm": 12.363248165694763, + "learning_rate": 1.6962809917355372e-07, + "logits/chosen": -0.32421875, + "logits/rejected": -0.5703125, + "logps/chosen": -376.0, + "logps/rejected": -354.0, + "loss": 0.0564, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.703125, + "rewards/margins": 8.8125, + "rewards/rejected": -8.125, + "step": 1624 + }, + { + "epoch": 1.9938650306748467, + "grad_norm": 16.612845106209782, + "learning_rate": 1.6942148760330577e-07, + "logits/chosen": -0.1630859375, + "logits/rejected": -0.36328125, + "logps/chosen": -440.0, + "logps/rejected": -368.0, + "loss": 0.0635, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.84765625, + "rewards/margins": 8.5625, + "rewards/rejected": -7.75, + "step": 1625 + }, + { + "epoch": 1.9950920245398773, + "grad_norm": 18.500067272564216, + "learning_rate": 1.6921487603305784e-07, + "logits/chosen": -0.287109375, + "logits/rejected": -0.404296875, + "logps/chosen": -430.0, + "logps/rejected": -386.0, + "loss": 0.0799, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.4609375, + "rewards/margins": 8.0625, + "rewards/rejected": -7.625, + "step": 1626 + }, + { + "epoch": 1.996319018404908, + "grad_norm": 17.72671467214421, + "learning_rate": 1.6900826446280991e-07, + "logits/chosen": -0.3359375, + "logits/rejected": -0.451171875, + "logps/chosen": -370.0, + "logps/rejected": -330.0, + "loss": 0.0889, + "rewards/accuracies": 0.9609375, + "rewards/chosen": 0.6328125, + "rewards/margins": 8.5, + "rewards/rejected": -7.84375, + "step": 1627 + }, + { + "epoch": 1.9975460122699387, + "grad_norm": 12.210404250665713, + "learning_rate": 1.68801652892562e-07, + "logits/chosen": -0.263671875, + "logits/rejected": -0.39453125, + "logps/chosen": -364.0, + "logps/rejected": -366.0, + "loss": 0.0598, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.90234375, + "rewards/margins": 8.875, + "rewards/rejected": -7.9375, + "step": 1628 + }, + { + "epoch": 1.9987730061349693, + "grad_norm": 18.064956939135023, + "learning_rate": 1.6859504132231403e-07, + "logits/chosen": -0.1640625, + "logits/rejected": -0.33203125, + "logps/chosen": -392.0, + "logps/rejected": -366.0, + "loss": 0.088, + "rewards/accuracies": 0.96875, + "rewards/chosen": 0.50390625, + "rewards/margins": 8.0625, + "rewards/rejected": -7.5625, + "step": 1629 + }, + { + "epoch": 2.0, + "grad_norm": 14.818785297318101, + "learning_rate": 1.683884297520661e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.435546875, + "logps/chosen": -422.0, + "logps/rejected": -380.0, + "loss": 0.0621, + "rewards/accuracies": 0.9831933379173279, + "rewards/chosen": 0.69921875, + "rewards/margins": 9.0, + "rewards/rejected": -8.3125, + "step": 1630 + }, + { + "epoch": 2.0012269938650307, + "grad_norm": 3.695574135667292, + "learning_rate": 1.6818181818181818e-07, + "logits/chosen": -0.22265625, + "logits/rejected": -0.453125, + "logps/chosen": -428.0, + "logps/rejected": -354.0, + "loss": 0.0156, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.3828125, + "rewards/margins": 9.375, + "rewards/rejected": -8.0, + "step": 1631 + }, + { + "epoch": 2.0024539877300613, + "grad_norm": 4.375413812221265, + "learning_rate": 1.6797520661157025e-07, + "logits/chosen": -0.216796875, + "logits/rejected": -0.337890625, + "logps/chosen": -376.0, + "logps/rejected": -364.0, + "loss": 0.0178, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.171875, + "rewards/margins": 8.875, + "rewards/rejected": -7.71875, + "step": 1632 + }, + { + "epoch": 2.003680981595092, + "grad_norm": 6.919356253149619, + "learning_rate": 1.6776859504132233e-07, + "logits/chosen": -0.13671875, + "logits/rejected": -0.314453125, + "logps/chosen": -460.0, + "logps/rejected": -360.0, + "loss": 0.0398, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.2421875, + "rewards/margins": 8.6875, + "rewards/rejected": -7.4375, + "step": 1633 + }, + { + "epoch": 2.0049079754601227, + "grad_norm": 6.765739775672973, + "learning_rate": 1.6756198347107438e-07, + "logits/chosen": -0.291015625, + "logits/rejected": -0.451171875, + "logps/chosen": -388.0, + "logps/rejected": -360.0, + "loss": 0.0256, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.66796875, + "rewards/margins": 8.1875, + "rewards/rejected": -7.5, + "step": 1634 + }, + { + "epoch": 2.0061349693251533, + "grad_norm": 4.980157877392166, + "learning_rate": 1.6735537190082645e-07, + "logits/chosen": -0.2373046875, + "logits/rejected": -0.390625, + "logps/chosen": -400.0, + "logps/rejected": -352.0, + "loss": 0.0232, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.234375, + "rewards/margins": 9.1875, + "rewards/rejected": -7.96875, + "step": 1635 + }, + { + "epoch": 2.007361963190184, + "grad_norm": 4.864170214455221, + "learning_rate": 1.671487603305785e-07, + "logits/chosen": -0.26953125, + "logits/rejected": -0.453125, + "logps/chosen": -386.0, + "logps/rejected": -350.0, + "loss": 0.0179, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.90234375, + "rewards/margins": 8.9375, + "rewards/rejected": -8.0, + "step": 1636 + }, + { + "epoch": 2.0085889570552147, + "grad_norm": 4.446212441218756, + "learning_rate": 1.6694214876033057e-07, + "logits/chosen": -0.2333984375, + "logits/rejected": -0.3671875, + "logps/chosen": -332.0, + "logps/rejected": -322.0, + "loss": 0.0197, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.27734375, + "rewards/margins": 8.0625, + "rewards/rejected": -7.75, + "step": 1637 + }, + { + "epoch": 2.0098159509202453, + "grad_norm": 4.393259672328072, + "learning_rate": 1.6673553719008262e-07, + "logits/chosen": -0.298828125, + "logits/rejected": -0.396484375, + "logps/chosen": -382.0, + "logps/rejected": -358.0, + "loss": 0.0194, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.125, + "rewards/margins": 9.0625, + "rewards/rejected": -7.96875, + "step": 1638 + }, + { + "epoch": 2.011042944785276, + "grad_norm": 4.720410741472239, + "learning_rate": 1.665289256198347e-07, + "logits/chosen": -0.1962890625, + "logits/rejected": -0.3359375, + "logps/chosen": -344.0, + "logps/rejected": -342.0, + "loss": 0.018, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.1484375, + "rewards/margins": 8.625, + "rewards/rejected": -7.46875, + "step": 1639 + }, + { + "epoch": 2.0122699386503067, + "grad_norm": 5.8163313344423475, + "learning_rate": 1.6632231404958676e-07, + "logits/chosen": -0.2041015625, + "logits/rejected": -0.3828125, + "logps/chosen": -384.0, + "logps/rejected": -370.0, + "loss": 0.0265, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.83984375, + "rewards/margins": 8.0, + "rewards/rejected": -7.15625, + "step": 1640 + }, + { + "epoch": 2.0134969325153373, + "grad_norm": 4.984029397674014, + "learning_rate": 1.6611570247933884e-07, + "logits/chosen": -0.244140625, + "logits/rejected": -0.412109375, + "logps/chosen": -380.0, + "logps/rejected": -364.0, + "loss": 0.0183, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.0234375, + "rewards/margins": 8.4375, + "rewards/rejected": -7.375, + "step": 1641 + }, + { + "epoch": 2.014723926380368, + "grad_norm": 4.71389459550831, + "learning_rate": 1.659090909090909e-07, + "logits/chosen": -0.2421875, + "logits/rejected": -0.41796875, + "logps/chosen": -414.0, + "logps/rejected": -388.0, + "loss": 0.0263, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.828125, + "rewards/margins": 8.375, + "rewards/rejected": -7.53125, + "step": 1642 + }, + { + "epoch": 2.0159509202453987, + "grad_norm": 4.169260753275698, + "learning_rate": 1.6570247933884296e-07, + "logits/chosen": -0.193359375, + "logits/rejected": -0.326171875, + "logps/chosen": -334.0, + "logps/rejected": -312.0, + "loss": 0.0202, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.2138671875, + "rewards/margins": 7.71875, + "rewards/rejected": -7.5, + "step": 1643 + }, + { + "epoch": 2.0171779141104293, + "grad_norm": 5.0687693594000605, + "learning_rate": 1.6549586776859503e-07, + "logits/chosen": -0.2109375, + "logits/rejected": -0.44921875, + "logps/chosen": -428.0, + "logps/rejected": -400.0, + "loss": 0.0225, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.1953125, + "rewards/margins": 8.5, + "rewards/rejected": -7.28125, + "step": 1644 + }, + { + "epoch": 2.01840490797546, + "grad_norm": 4.915518532029101, + "learning_rate": 1.652892561983471e-07, + "logits/chosen": -0.265625, + "logits/rejected": -0.44921875, + "logps/chosen": -390.0, + "logps/rejected": -348.0, + "loss": 0.0258, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.5234375, + "rewards/margins": 9.1875, + "rewards/rejected": -7.65625, + "step": 1645 + }, + { + "epoch": 2.0196319018404907, + "grad_norm": 6.1122336613375285, + "learning_rate": 1.6508264462809918e-07, + "logits/chosen": -0.1923828125, + "logits/rejected": -0.27734375, + "logps/chosen": -348.0, + "logps/rejected": -334.0, + "loss": 0.0231, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5625, + "rewards/margins": 7.78125, + "rewards/rejected": -7.21875, + "step": 1646 + }, + { + "epoch": 2.0208588957055214, + "grad_norm": 4.161960149741094, + "learning_rate": 1.6487603305785123e-07, + "logits/chosen": -0.326171875, + "logits/rejected": -0.58203125, + "logps/chosen": -436.0, + "logps/rejected": -356.0, + "loss": 0.0153, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.76953125, + "rewards/margins": 9.0, + "rewards/rejected": -8.25, + "step": 1647 + }, + { + "epoch": 2.022085889570552, + "grad_norm": 3.967678760354043, + "learning_rate": 1.646694214876033e-07, + "logits/chosen": -0.28515625, + "logits/rejected": -0.466796875, + "logps/chosen": -384.0, + "logps/rejected": -374.0, + "loss": 0.0227, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.7109375, + "rewards/margins": 9.1875, + "rewards/rejected": -8.5, + "step": 1648 + }, + { + "epoch": 2.0233128834355827, + "grad_norm": 4.646636576224791, + "learning_rate": 1.6446280991735537e-07, + "logits/chosen": -0.3125, + "logits/rejected": -0.515625, + "logps/chosen": -382.0, + "logps/rejected": -344.0, + "loss": 0.0199, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.453125, + "rewards/margins": 9.0, + "rewards/rejected": -7.5625, + "step": 1649 + }, + { + "epoch": 2.0245398773006134, + "grad_norm": 4.727655532978415, + "learning_rate": 1.6425619834710745e-07, + "logits/chosen": -0.15625, + "logits/rejected": -0.40625, + "logps/chosen": -388.0, + "logps/rejected": -320.0, + "loss": 0.0258, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.64453125, + "rewards/margins": 8.3125, + "rewards/rejected": -7.6875, + "step": 1650 + }, + { + "epoch": 2.025766871165644, + "grad_norm": 4.414214488436301, + "learning_rate": 1.640495867768595e-07, + "logits/chosen": -0.263671875, + "logits/rejected": -0.44140625, + "logps/chosen": -428.0, + "logps/rejected": -388.0, + "loss": 0.0172, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.0234375, + "rewards/margins": 8.9375, + "rewards/rejected": -7.9375, + "step": 1651 + }, + { + "epoch": 2.0269938650306747, + "grad_norm": 4.992117205515556, + "learning_rate": 1.6384297520661157e-07, + "logits/chosen": -0.2119140625, + "logits/rejected": -0.33984375, + "logps/chosen": -338.0, + "logps/rejected": -334.0, + "loss": 0.0191, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.87109375, + "rewards/margins": 8.6875, + "rewards/rejected": -7.78125, + "step": 1652 + }, + { + "epoch": 2.0282208588957054, + "grad_norm": 4.660626698500399, + "learning_rate": 1.6363636363636364e-07, + "logits/chosen": -0.2255859375, + "logits/rejected": -0.3828125, + "logps/chosen": -376.0, + "logps/rejected": -330.0, + "loss": 0.0274, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.8828125, + "rewards/margins": 8.75, + "rewards/rejected": -7.875, + "step": 1653 + }, + { + "epoch": 2.029447852760736, + "grad_norm": 7.536409964435264, + "learning_rate": 1.634297520661157e-07, + "logits/chosen": -0.07470703125, + "logits/rejected": -0.28515625, + "logps/chosen": -400.0, + "logps/rejected": -356.0, + "loss": 0.0289, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.9453125, + "rewards/margins": 8.5, + "rewards/rejected": -7.59375, + "step": 1654 + }, + { + "epoch": 2.0306748466257667, + "grad_norm": 6.553625799108254, + "learning_rate": 1.6322314049586776e-07, + "logits/chosen": -0.333984375, + "logits/rejected": -0.435546875, + "logps/chosen": -400.0, + "logps/rejected": -382.0, + "loss": 0.0286, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.96875, + "rewards/margins": 9.125, + "rewards/rejected": -8.1875, + "step": 1655 + }, + { + "epoch": 2.0319018404907974, + "grad_norm": 3.826712088624458, + "learning_rate": 1.630165289256198e-07, + "logits/chosen": -0.208984375, + "logits/rejected": -0.341796875, + "logps/chosen": -440.0, + "logps/rejected": -394.0, + "loss": 0.0146, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.0390625, + "rewards/margins": 9.125, + "rewards/rejected": -8.0625, + "step": 1656 + }, + { + "epoch": 2.033128834355828, + "grad_norm": 5.883744864796587, + "learning_rate": 1.6280991735537188e-07, + "logits/chosen": -0.1875, + "logits/rejected": -0.271484375, + "logps/chosen": -378.0, + "logps/rejected": -372.0, + "loss": 0.0273, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.80859375, + "rewards/margins": 8.1875, + "rewards/rejected": -7.375, + "step": 1657 + }, + { + "epoch": 2.0343558282208587, + "grad_norm": 9.437116637981, + "learning_rate": 1.6260330578512396e-07, + "logits/chosen": -0.24609375, + "logits/rejected": -0.369140625, + "logps/chosen": -380.0, + "logps/rejected": -384.0, + "loss": 0.0446, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.58203125, + "rewards/margins": 8.8125, + "rewards/rejected": -8.25, + "step": 1658 + }, + { + "epoch": 2.0355828220858894, + "grad_norm": 4.469594637738195, + "learning_rate": 1.6239669421487603e-07, + "logits/chosen": -0.310546875, + "logits/rejected": -0.494140625, + "logps/chosen": -408.0, + "logps/rejected": -404.0, + "loss": 0.0197, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.345703125, + "rewards/margins": 9.375, + "rewards/rejected": -9.0625, + "step": 1659 + }, + { + "epoch": 2.03680981595092, + "grad_norm": 4.488646996954519, + "learning_rate": 1.6219008264462808e-07, + "logits/chosen": -0.265625, + "logits/rejected": -0.376953125, + "logps/chosen": -370.0, + "logps/rejected": -346.0, + "loss": 0.021, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.419921875, + "rewards/margins": 8.5625, + "rewards/rejected": -8.125, + "step": 1660 + }, + { + "epoch": 2.038036809815951, + "grad_norm": 3.6734767465225473, + "learning_rate": 1.6198347107438015e-07, + "logits/chosen": -0.37890625, + "logits/rejected": -0.4765625, + "logps/chosen": -366.0, + "logps/rejected": -344.0, + "loss": 0.0156, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.1279296875, + "rewards/margins": 8.8125, + "rewards/rejected": -8.9375, + "step": 1661 + }, + { + "epoch": 2.039263803680982, + "grad_norm": 3.3909174591668676, + "learning_rate": 1.6177685950413222e-07, + "logits/chosen": -0.3671875, + "logits/rejected": -0.5703125, + "logps/chosen": -464.0, + "logps/rejected": -400.0, + "loss": 0.0116, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.640625, + "rewards/margins": 10.625, + "rewards/rejected": -9.0, + "step": 1662 + }, + { + "epoch": 2.0404907975460125, + "grad_norm": 4.130113133438218, + "learning_rate": 1.615702479338843e-07, + "logits/chosen": -0.2021484375, + "logits/rejected": -0.466796875, + "logps/chosen": -424.0, + "logps/rejected": -382.0, + "loss": 0.0138, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.66015625, + "rewards/margins": 9.3125, + "rewards/rejected": -8.6875, + "step": 1663 + }, + { + "epoch": 2.041717791411043, + "grad_norm": 4.097047024053047, + "learning_rate": 1.6136363636363637e-07, + "logits/chosen": -0.275390625, + "logits/rejected": -0.3828125, + "logps/chosen": -386.0, + "logps/rejected": -340.0, + "loss": 0.0181, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.52734375, + "rewards/margins": 9.1875, + "rewards/rejected": -8.625, + "step": 1664 + }, + { + "epoch": 2.042944785276074, + "grad_norm": 8.449905168017025, + "learning_rate": 1.6115702479338842e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.39453125, + "logps/chosen": -388.0, + "logps/rejected": -334.0, + "loss": 0.0271, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.21875, + "rewards/margins": 8.375, + "rewards/rejected": -8.1875, + "step": 1665 + }, + { + "epoch": 2.0441717791411045, + "grad_norm": 8.517881191918772, + "learning_rate": 1.609504132231405e-07, + "logits/chosen": -0.2197265625, + "logits/rejected": -0.412109375, + "logps/chosen": -366.0, + "logps/rejected": -344.0, + "loss": 0.0306, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.046875, + "rewards/margins": 9.625, + "rewards/rejected": -8.5625, + "step": 1666 + }, + { + "epoch": 2.045398773006135, + "grad_norm": 3.880741019194578, + "learning_rate": 1.6074380165289256e-07, + "logits/chosen": -0.33984375, + "logits/rejected": -0.5, + "logps/chosen": -410.0, + "logps/rejected": -376.0, + "loss": 0.0202, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.09521484375, + "rewards/margins": 8.875, + "rewards/rejected": -8.9375, + "step": 1667 + }, + { + "epoch": 2.046625766871166, + "grad_norm": 3.453446768856216, + "learning_rate": 1.6053719008264464e-07, + "logits/chosen": -0.345703125, + "logits/rejected": -0.490234375, + "logps/chosen": -366.0, + "logps/rejected": -354.0, + "loss": 0.0119, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.93359375, + "rewards/margins": 9.6875, + "rewards/rejected": -8.75, + "step": 1668 + }, + { + "epoch": 2.0478527607361965, + "grad_norm": 4.72059377474258, + "learning_rate": 1.6033057851239669e-07, + "logits/chosen": -0.21875, + "logits/rejected": -0.373046875, + "logps/chosen": -376.0, + "logps/rejected": -352.0, + "loss": 0.0259, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.44921875, + "rewards/margins": 8.3125, + "rewards/rejected": -7.84375, + "step": 1669 + }, + { + "epoch": 2.049079754601227, + "grad_norm": 3.7909243131175354, + "learning_rate": 1.6012396694214876e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.5078125, + "logps/chosen": -412.0, + "logps/rejected": -374.0, + "loss": 0.0163, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.171875, + "rewards/margins": 9.625, + "rewards/rejected": -8.4375, + "step": 1670 + }, + { + "epoch": 2.050306748466258, + "grad_norm": 5.212695047074954, + "learning_rate": 1.599173553719008e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.453125, + "logps/chosen": -408.0, + "logps/rejected": -370.0, + "loss": 0.0198, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.28125, + "rewards/margins": 9.5625, + "rewards/rejected": -8.3125, + "step": 1671 + }, + { + "epoch": 2.0515337423312885, + "grad_norm": 3.6515480661799153, + "learning_rate": 1.5971074380165288e-07, + "logits/chosen": -0.2265625, + "logits/rejected": -0.453125, + "logps/chosen": -394.0, + "logps/rejected": -368.0, + "loss": 0.0148, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.265625, + "rewards/margins": 9.4375, + "rewards/rejected": -8.125, + "step": 1672 + }, + { + "epoch": 2.052760736196319, + "grad_norm": 4.909313260628001, + "learning_rate": 1.5950413223140495e-07, + "logits/chosen": -0.1923828125, + "logits/rejected": -0.26171875, + "logps/chosen": -384.0, + "logps/rejected": -350.0, + "loss": 0.0233, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.62890625, + "rewards/margins": 8.3125, + "rewards/rejected": -7.71875, + "step": 1673 + }, + { + "epoch": 2.05398773006135, + "grad_norm": 4.298946260124492, + "learning_rate": 1.59297520661157e-07, + "logits/chosen": -0.302734375, + "logits/rejected": -0.498046875, + "logps/chosen": -382.0, + "logps/rejected": -356.0, + "loss": 0.0164, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.94921875, + "rewards/margins": 9.375, + "rewards/rejected": -8.4375, + "step": 1674 + }, + { + "epoch": 2.0552147239263805, + "grad_norm": 5.224905892419499, + "learning_rate": 1.5909090909090907e-07, + "logits/chosen": -0.3046875, + "logits/rejected": -0.4921875, + "logps/chosen": -436.0, + "logps/rejected": -380.0, + "loss": 0.0225, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.2421875, + "rewards/margins": 9.125, + "rewards/rejected": -7.875, + "step": 1675 + }, + { + "epoch": 2.056441717791411, + "grad_norm": 4.617938289440955, + "learning_rate": 1.5888429752066115e-07, + "logits/chosen": -0.2021484375, + "logits/rejected": -0.388671875, + "logps/chosen": -402.0, + "logps/rejected": -358.0, + "loss": 0.0172, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.8515625, + "rewards/margins": 8.75, + "rewards/rejected": -7.9375, + "step": 1676 + }, + { + "epoch": 2.057668711656442, + "grad_norm": 3.6153125899861163, + "learning_rate": 1.5867768595041322e-07, + "logits/chosen": -0.3984375, + "logits/rejected": -0.5703125, + "logps/chosen": -342.0, + "logps/rejected": -328.0, + "loss": 0.0169, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.05322265625, + "rewards/margins": 9.0625, + "rewards/rejected": -9.0, + "step": 1677 + }, + { + "epoch": 2.0588957055214725, + "grad_norm": 4.912768537247566, + "learning_rate": 1.5847107438016527e-07, + "logits/chosen": -0.251953125, + "logits/rejected": -0.33203125, + "logps/chosen": -370.0, + "logps/rejected": -386.0, + "loss": 0.0203, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.1728515625, + "rewards/margins": 8.375, + "rewards/rejected": -8.1875, + "step": 1678 + }, + { + "epoch": 2.060122699386503, + "grad_norm": 4.346772159192706, + "learning_rate": 1.5826446280991734e-07, + "logits/chosen": -0.26171875, + "logits/rejected": -0.349609375, + "logps/chosen": -298.0, + "logps/rejected": -308.0, + "loss": 0.0187, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.032470703125, + "rewards/margins": 7.90625, + "rewards/rejected": -7.875, + "step": 1679 + }, + { + "epoch": 2.061349693251534, + "grad_norm": 5.22069267226155, + "learning_rate": 1.5805785123966942e-07, + "logits/chosen": -0.2451171875, + "logits/rejected": -0.380859375, + "logps/chosen": -382.0, + "logps/rejected": -334.0, + "loss": 0.023, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.84375, + "rewards/margins": 8.625, + "rewards/rejected": -7.78125, + "step": 1680 + }, + { + "epoch": 2.0625766871165645, + "grad_norm": 3.7474192324166085, + "learning_rate": 1.578512396694215e-07, + "logits/chosen": -0.3359375, + "logits/rejected": -0.498046875, + "logps/chosen": -402.0, + "logps/rejected": -384.0, + "loss": 0.0152, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.2421875, + "rewards/margins": 9.375, + "rewards/rejected": -8.125, + "step": 1681 + }, + { + "epoch": 2.063803680981595, + "grad_norm": 4.344834796526355, + "learning_rate": 1.5764462809917356e-07, + "logits/chosen": -0.33984375, + "logits/rejected": -0.478515625, + "logps/chosen": -402.0, + "logps/rejected": -356.0, + "loss": 0.017, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4921875, + "rewards/margins": 8.3125, + "rewards/rejected": -7.8125, + "step": 1682 + }, + { + "epoch": 2.065030674846626, + "grad_norm": 4.7090317346866275, + "learning_rate": 1.574380165289256e-07, + "logits/chosen": -0.1748046875, + "logits/rejected": -0.345703125, + "logps/chosen": -404.0, + "logps/rejected": -336.0, + "loss": 0.0204, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5390625, + "rewards/margins": 8.5, + "rewards/rejected": -7.96875, + "step": 1683 + }, + { + "epoch": 2.0662576687116565, + "grad_norm": 5.4722535576048426, + "learning_rate": 1.5723140495867768e-07, + "logits/chosen": -0.30859375, + "logits/rejected": -0.392578125, + "logps/chosen": -348.0, + "logps/rejected": -326.0, + "loss": 0.0263, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.142578125, + "rewards/margins": 7.59375, + "rewards/rejected": -7.75, + "step": 1684 + }, + { + "epoch": 2.067484662576687, + "grad_norm": 7.209455630777843, + "learning_rate": 1.5702479338842976e-07, + "logits/chosen": -0.1376953125, + "logits/rejected": -0.400390625, + "logps/chosen": -394.0, + "logps/rejected": -354.0, + "loss": 0.0356, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.134765625, + "rewards/margins": 8.0, + "rewards/rejected": -7.875, + "step": 1685 + }, + { + "epoch": 2.068711656441718, + "grad_norm": 4.291018685946437, + "learning_rate": 1.5681818181818183e-07, + "logits/chosen": -0.37109375, + "logits/rejected": -0.55859375, + "logps/chosen": -390.0, + "logps/rejected": -324.0, + "loss": 0.017, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.41796875, + "rewards/margins": 8.9375, + "rewards/rejected": -8.5625, + "step": 1686 + }, + { + "epoch": 2.0699386503067485, + "grad_norm": 5.171032724004726, + "learning_rate": 1.5661157024793388e-07, + "logits/chosen": -0.173828125, + "logits/rejected": -0.470703125, + "logps/chosen": -420.0, + "logps/rejected": -360.0, + "loss": 0.018, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.796875, + "rewards/margins": 9.25, + "rewards/rejected": -8.5, + "step": 1687 + }, + { + "epoch": 2.071165644171779, + "grad_norm": 3.6329862590884265, + "learning_rate": 1.5640495867768595e-07, + "logits/chosen": -0.2236328125, + "logits/rejected": -0.390625, + "logps/chosen": -382.0, + "logps/rejected": -372.0, + "loss": 0.0135, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.52734375, + "rewards/margins": 9.1875, + "rewards/rejected": -8.625, + "step": 1688 + }, + { + "epoch": 2.07239263803681, + "grad_norm": 4.5140707199919, + "learning_rate": 1.56198347107438e-07, + "logits/chosen": -0.2158203125, + "logits/rejected": -0.376953125, + "logps/chosen": -392.0, + "logps/rejected": -350.0, + "loss": 0.0205, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.77734375, + "rewards/margins": 9.1875, + "rewards/rejected": -8.4375, + "step": 1689 + }, + { + "epoch": 2.0736196319018405, + "grad_norm": 4.338353142809476, + "learning_rate": 1.5599173553719007e-07, + "logits/chosen": -0.35546875, + "logits/rejected": -0.4765625, + "logps/chosen": -384.0, + "logps/rejected": -378.0, + "loss": 0.016, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.376953125, + "rewards/margins": 8.875, + "rewards/rejected": -9.25, + "step": 1690 + }, + { + "epoch": 2.074846625766871, + "grad_norm": 3.5919494011886854, + "learning_rate": 1.5578512396694212e-07, + "logits/chosen": -0.255859375, + "logits/rejected": -0.474609375, + "logps/chosen": -364.0, + "logps/rejected": -338.0, + "loss": 0.0132, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.37890625, + "rewards/margins": 9.1875, + "rewards/rejected": -8.8125, + "step": 1691 + }, + { + "epoch": 2.076073619631902, + "grad_norm": 5.623563769975572, + "learning_rate": 1.555785123966942e-07, + "logits/chosen": -0.32421875, + "logits/rejected": -0.46875, + "logps/chosen": -406.0, + "logps/rejected": -406.0, + "loss": 0.0221, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.78125, + "rewards/margins": 9.5625, + "rewards/rejected": -8.75, + "step": 1692 + }, + { + "epoch": 2.0773006134969325, + "grad_norm": 4.675743365516195, + "learning_rate": 1.5537190082644627e-07, + "logits/chosen": -0.333984375, + "logits/rejected": -0.46875, + "logps/chosen": -394.0, + "logps/rejected": -404.0, + "loss": 0.0169, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.2275390625, + "rewards/margins": 9.4375, + "rewards/rejected": -9.1875, + "step": 1693 + }, + { + "epoch": 2.078527607361963, + "grad_norm": 4.00498528588971, + "learning_rate": 1.5516528925619834e-07, + "logits/chosen": -0.388671875, + "logits/rejected": -0.57421875, + "logps/chosen": -400.0, + "logps/rejected": -402.0, + "loss": 0.0206, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.51171875, + "rewards/margins": 9.3125, + "rewards/rejected": -8.8125, + "step": 1694 + }, + { + "epoch": 2.079754601226994, + "grad_norm": 4.7465784074152255, + "learning_rate": 1.549586776859504e-07, + "logits/chosen": -0.2890625, + "logits/rejected": -0.486328125, + "logps/chosen": -364.0, + "logps/rejected": -370.0, + "loss": 0.0226, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.65625, + "rewards/margins": 9.5, + "rewards/rejected": -8.8125, + "step": 1695 + }, + { + "epoch": 2.0809815950920245, + "grad_norm": 4.033097931259831, + "learning_rate": 1.5475206611570246e-07, + "logits/chosen": -0.396484375, + "logits/rejected": -0.62109375, + "logps/chosen": -390.0, + "logps/rejected": -380.0, + "loss": 0.016, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4453125, + "rewards/margins": 9.9375, + "rewards/rejected": -9.5, + "step": 1696 + }, + { + "epoch": 2.082208588957055, + "grad_norm": 3.479012035490453, + "learning_rate": 1.5454545454545453e-07, + "logits/chosen": -0.326171875, + "logits/rejected": -0.51953125, + "logps/chosen": -370.0, + "logps/rejected": -384.0, + "loss": 0.0144, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.06640625, + "rewards/margins": 9.25, + "rewards/rejected": -9.1875, + "step": 1697 + }, + { + "epoch": 2.083435582822086, + "grad_norm": 5.191934590760718, + "learning_rate": 1.543388429752066e-07, + "logits/chosen": -0.330078125, + "logits/rejected": -0.439453125, + "logps/chosen": -388.0, + "logps/rejected": -392.0, + "loss": 0.0201, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.69140625, + "rewards/margins": 9.375, + "rewards/rejected": -8.6875, + "step": 1698 + }, + { + "epoch": 2.0846625766871165, + "grad_norm": 4.743931941567417, + "learning_rate": 1.5413223140495868e-07, + "logits/chosen": -0.27734375, + "logits/rejected": -0.44140625, + "logps/chosen": -460.0, + "logps/rejected": -388.0, + "loss": 0.0159, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.96875, + "rewards/margins": 9.8125, + "rewards/rejected": -8.875, + "step": 1699 + }, + { + "epoch": 2.085889570552147, + "grad_norm": 4.409556301018882, + "learning_rate": 1.5392561983471073e-07, + "logits/chosen": -0.1875, + "logits/rejected": -0.33984375, + "logps/chosen": -412.0, + "logps/rejected": -354.0, + "loss": 0.0193, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4296875, + "rewards/margins": 8.75, + "rewards/rejected": -8.3125, + "step": 1700 + }, + { + "epoch": 2.087116564417178, + "grad_norm": 5.156911950160116, + "learning_rate": 1.537190082644628e-07, + "logits/chosen": -0.2197265625, + "logits/rejected": -0.396484375, + "logps/chosen": -380.0, + "logps/rejected": -378.0, + "loss": 0.02, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.37890625, + "rewards/margins": 8.875, + "rewards/rejected": -9.25, + "step": 1701 + }, + { + "epoch": 2.0883435582822085, + "grad_norm": 3.666116279857421, + "learning_rate": 1.5351239669421487e-07, + "logits/chosen": -0.2890625, + "logits/rejected": -0.4921875, + "logps/chosen": -430.0, + "logps/rejected": -380.0, + "loss": 0.0192, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.71875, + "rewards/margins": 10.4375, + "rewards/rejected": -9.6875, + "step": 1702 + }, + { + "epoch": 2.089570552147239, + "grad_norm": 5.436102407347225, + "learning_rate": 1.5330578512396695e-07, + "logits/chosen": -0.255859375, + "logits/rejected": -0.498046875, + "logps/chosen": -398.0, + "logps/rejected": -376.0, + "loss": 0.0198, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.306640625, + "rewards/margins": 9.4375, + "rewards/rejected": -9.125, + "step": 1703 + }, + { + "epoch": 2.09079754601227, + "grad_norm": 6.985043416195019, + "learning_rate": 1.5309917355371902e-07, + "logits/chosen": -0.27734375, + "logits/rejected": -0.51171875, + "logps/chosen": -458.0, + "logps/rejected": -402.0, + "loss": 0.0164, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.515625, + "rewards/margins": 11.375, + "rewards/rejected": -9.875, + "step": 1704 + }, + { + "epoch": 2.0920245398773005, + "grad_norm": 4.1632937396342555, + "learning_rate": 1.5289256198347107e-07, + "logits/chosen": -0.3203125, + "logits/rejected": -0.46875, + "logps/chosen": -376.0, + "logps/rejected": -344.0, + "loss": 0.0171, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5, + "rewards/margins": 9.8125, + "rewards/rejected": -9.3125, + "step": 1705 + }, + { + "epoch": 2.093251533742331, + "grad_norm": 4.95866731162232, + "learning_rate": 1.5268595041322314e-07, + "logits/chosen": -0.359375, + "logits/rejected": -0.58984375, + "logps/chosen": -428.0, + "logps/rejected": -372.0, + "loss": 0.0173, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.9296875, + "rewards/margins": 9.875, + "rewards/rejected": -8.9375, + "step": 1706 + }, + { + "epoch": 2.094478527607362, + "grad_norm": 3.6155433018141654, + "learning_rate": 1.524793388429752e-07, + "logits/chosen": -0.33984375, + "logits/rejected": -0.49609375, + "logps/chosen": -354.0, + "logps/rejected": -354.0, + "loss": 0.0158, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.036376953125, + "rewards/margins": 9.0625, + "rewards/rejected": -9.0625, + "step": 1707 + }, + { + "epoch": 2.0957055214723925, + "grad_norm": 5.945174346798367, + "learning_rate": 1.5227272727272726e-07, + "logits/chosen": -0.380859375, + "logits/rejected": -0.578125, + "logps/chosen": -400.0, + "logps/rejected": -364.0, + "loss": 0.0156, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.2333984375, + "rewards/margins": 9.9375, + "rewards/rejected": -9.6875, + "step": 1708 + }, + { + "epoch": 2.096932515337423, + "grad_norm": 7.755633285465657, + "learning_rate": 1.520661157024793e-07, + "logits/chosen": -0.314453125, + "logits/rejected": -0.453125, + "logps/chosen": -394.0, + "logps/rejected": -404.0, + "loss": 0.0274, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.2236328125, + "rewards/margins": 9.125, + "rewards/rejected": -8.9375, + "step": 1709 + }, + { + "epoch": 2.098159509202454, + "grad_norm": 4.0861187921623765, + "learning_rate": 1.5185950413223138e-07, + "logits/chosen": -0.40625, + "logits/rejected": -0.60546875, + "logps/chosen": -468.0, + "logps/rejected": -376.0, + "loss": 0.0191, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.7265625, + "rewards/margins": 10.1875, + "rewards/rejected": -9.5, + "step": 1710 + }, + { + "epoch": 2.0993865030674845, + "grad_norm": 11.90387780000704, + "learning_rate": 1.5165289256198346e-07, + "logits/chosen": -0.345703125, + "logits/rejected": -0.44921875, + "logps/chosen": -400.0, + "logps/rejected": -404.0, + "loss": 0.0306, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.421875, + "rewards/margins": 9.125, + "rewards/rejected": -8.75, + "step": 1711 + }, + { + "epoch": 2.100613496932515, + "grad_norm": 5.347027351741012, + "learning_rate": 1.5144628099173553e-07, + "logits/chosen": -0.326171875, + "logits/rejected": -0.515625, + "logps/chosen": -398.0, + "logps/rejected": -366.0, + "loss": 0.0206, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.002960205078125, + "rewards/margins": 9.0625, + "rewards/rejected": -9.0625, + "step": 1712 + }, + { + "epoch": 2.101840490797546, + "grad_norm": 4.966783247585808, + "learning_rate": 1.512396694214876e-07, + "logits/chosen": -0.341796875, + "logits/rejected": -0.5390625, + "logps/chosen": -378.0, + "logps/rejected": -378.0, + "loss": 0.0276, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.546875, + "rewards/margins": 9.625, + "rewards/rejected": -9.0625, + "step": 1713 + }, + { + "epoch": 2.1030674846625765, + "grad_norm": 5.759385859148531, + "learning_rate": 1.5103305785123965e-07, + "logits/chosen": -0.26953125, + "logits/rejected": -0.4765625, + "logps/chosen": -370.0, + "logps/rejected": -324.0, + "loss": 0.0227, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.3671875, + "rewards/margins": 8.875, + "rewards/rejected": -8.5, + "step": 1714 + }, + { + "epoch": 2.104294478527607, + "grad_norm": 5.929490646322824, + "learning_rate": 1.5082644628099173e-07, + "logits/chosen": -0.27734375, + "logits/rejected": -0.490234375, + "logps/chosen": -376.0, + "logps/rejected": -370.0, + "loss": 0.018, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.30859375, + "rewards/margins": 9.4375, + "rewards/rejected": -9.125, + "step": 1715 + }, + { + "epoch": 2.105521472392638, + "grad_norm": 5.476139761166003, + "learning_rate": 1.506198347107438e-07, + "logits/chosen": -0.2294921875, + "logits/rejected": -0.421875, + "logps/chosen": -382.0, + "logps/rejected": -370.0, + "loss": 0.024, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.515625, + "rewards/margins": 8.75, + "rewards/rejected": -8.25, + "step": 1716 + }, + { + "epoch": 2.1067484662576685, + "grad_norm": 3.7201871097099746, + "learning_rate": 1.5041322314049587e-07, + "logits/chosen": -0.3203125, + "logits/rejected": -0.5234375, + "logps/chosen": -388.0, + "logps/rejected": -362.0, + "loss": 0.014, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.640625, + "rewards/margins": 9.6875, + "rewards/rejected": -9.0625, + "step": 1717 + }, + { + "epoch": 2.107975460122699, + "grad_norm": 4.5919152824308975, + "learning_rate": 1.5020661157024792e-07, + "logits/chosen": -0.224609375, + "logits/rejected": -0.39453125, + "logps/chosen": -376.0, + "logps/rejected": -354.0, + "loss": 0.0233, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.125, + "rewards/margins": 8.6875, + "rewards/rejected": -8.5625, + "step": 1718 + }, + { + "epoch": 2.10920245398773, + "grad_norm": 4.170913167553334, + "learning_rate": 1.5e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.4765625, + "logps/chosen": -440.0, + "logps/rejected": -388.0, + "loss": 0.0243, + "rewards/accuracies": 0.984375, + "rewards/chosen": 1.328125, + "rewards/margins": 10.25, + "rewards/rejected": -8.9375, + "step": 1719 + }, + { + "epoch": 2.1104294478527605, + "grad_norm": 4.566327836649422, + "learning_rate": 1.4979338842975207e-07, + "logits/chosen": -0.283203125, + "logits/rejected": -0.416015625, + "logps/chosen": -332.0, + "logps/rejected": -330.0, + "loss": 0.0164, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.3046875, + "rewards/margins": 9.0, + "rewards/rejected": -8.6875, + "step": 1720 + }, + { + "epoch": 2.111656441717791, + "grad_norm": 4.593689335661095, + "learning_rate": 1.4958677685950414e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.53125, + "logps/chosen": -432.0, + "logps/rejected": -400.0, + "loss": 0.0173, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.91796875, + "rewards/margins": 10.25, + "rewards/rejected": -9.375, + "step": 1721 + }, + { + "epoch": 2.112883435582822, + "grad_norm": 8.25741431225049, + "learning_rate": 1.4938016528925621e-07, + "logits/chosen": -0.283203125, + "logits/rejected": -0.3984375, + "logps/chosen": -362.0, + "logps/rejected": -350.0, + "loss": 0.0327, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.291015625, + "rewards/margins": 8.5, + "rewards/rejected": -8.8125, + "step": 1722 + }, + { + "epoch": 2.1141104294478525, + "grad_norm": 3.6303736086187275, + "learning_rate": 1.4917355371900826e-07, + "logits/chosen": -0.318359375, + "logits/rejected": -0.51953125, + "logps/chosen": -404.0, + "logps/rejected": -362.0, + "loss": 0.0138, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.32421875, + "rewards/margins": 8.6875, + "rewards/rejected": -8.375, + "step": 1723 + }, + { + "epoch": 2.1153374233128837, + "grad_norm": 4.96750127801855, + "learning_rate": 1.4896694214876033e-07, + "logits/chosen": -0.3359375, + "logits/rejected": -0.474609375, + "logps/chosen": -342.0, + "logps/rejected": -330.0, + "loss": 0.0175, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.62890625, + "rewards/margins": 9.1875, + "rewards/rejected": -8.5625, + "step": 1724 + }, + { + "epoch": 2.116564417177914, + "grad_norm": 3.1799983632367783, + "learning_rate": 1.4876033057851238e-07, + "logits/chosen": -0.330078125, + "logits/rejected": -0.49609375, + "logps/chosen": -388.0, + "logps/rejected": -390.0, + "loss": 0.0112, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.302734375, + "rewards/margins": 9.5, + "rewards/rejected": -9.1875, + "step": 1725 + }, + { + "epoch": 2.117791411042945, + "grad_norm": 6.14882278384978, + "learning_rate": 1.4855371900826446e-07, + "logits/chosen": -0.419921875, + "logits/rejected": -0.60546875, + "logps/chosen": -428.0, + "logps/rejected": -406.0, + "loss": 0.0296, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.984375, + "rewards/margins": 10.1875, + "rewards/rejected": -9.1875, + "step": 1726 + }, + { + "epoch": 2.1190184049079757, + "grad_norm": 2.814789401489579, + "learning_rate": 1.483471074380165e-07, + "logits/chosen": -0.30078125, + "logits/rejected": -0.396484375, + "logps/chosen": -420.0, + "logps/rejected": -380.0, + "loss": 0.0098, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.2734375, + "rewards/margins": 10.6875, + "rewards/rejected": -9.4375, + "step": 1727 + }, + { + "epoch": 2.1202453987730063, + "grad_norm": 4.451538560418426, + "learning_rate": 1.4814049586776858e-07, + "logits/chosen": -0.26953125, + "logits/rejected": -0.4375, + "logps/chosen": -430.0, + "logps/rejected": -356.0, + "loss": 0.0198, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.60546875, + "rewards/margins": 9.5, + "rewards/rejected": -8.875, + "step": 1728 + }, + { + "epoch": 2.121472392638037, + "grad_norm": 5.33015854973991, + "learning_rate": 1.4793388429752065e-07, + "logits/chosen": -0.1474609375, + "logits/rejected": -0.328125, + "logps/chosen": -374.0, + "logps/rejected": -348.0, + "loss": 0.0205, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.2119140625, + "rewards/margins": 8.75, + "rewards/rejected": -8.5625, + "step": 1729 + }, + { + "epoch": 2.1226993865030677, + "grad_norm": 5.774019944437036, + "learning_rate": 1.4772727272727272e-07, + "logits/chosen": -0.330078125, + "logits/rejected": -0.44140625, + "logps/chosen": -384.0, + "logps/rejected": -376.0, + "loss": 0.0244, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.453125, + "rewards/margins": 8.75, + "rewards/rejected": -9.1875, + "step": 1730 + }, + { + "epoch": 2.1239263803680983, + "grad_norm": 5.278420585079798, + "learning_rate": 1.475206611570248e-07, + "logits/chosen": -0.326171875, + "logits/rejected": -0.5078125, + "logps/chosen": -364.0, + "logps/rejected": -358.0, + "loss": 0.0206, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.2060546875, + "rewards/margins": 9.125, + "rewards/rejected": -8.875, + "step": 1731 + }, + { + "epoch": 2.125153374233129, + "grad_norm": 5.4603594701485205, + "learning_rate": 1.4731404958677684e-07, + "logits/chosen": -0.255859375, + "logits/rejected": -0.421875, + "logps/chosen": -414.0, + "logps/rejected": -398.0, + "loss": 0.0178, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.8203125, + "rewards/margins": 10.1875, + "rewards/rejected": -9.375, + "step": 1732 + }, + { + "epoch": 2.1263803680981597, + "grad_norm": 4.9871374258428425, + "learning_rate": 1.4710743801652892e-07, + "logits/chosen": -0.2333984375, + "logits/rejected": -0.4375, + "logps/chosen": -418.0, + "logps/rejected": -370.0, + "loss": 0.0184, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.98828125, + "rewards/margins": 9.625, + "rewards/rejected": -8.625, + "step": 1733 + }, + { + "epoch": 2.1276073619631903, + "grad_norm": 3.84531825035709, + "learning_rate": 1.46900826446281e-07, + "logits/chosen": -0.326171875, + "logits/rejected": -0.515625, + "logps/chosen": -420.0, + "logps/rejected": -400.0, + "loss": 0.0134, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.83203125, + "rewards/margins": 10.5625, + "rewards/rejected": -9.75, + "step": 1734 + }, + { + "epoch": 2.128834355828221, + "grad_norm": 4.262233246590286, + "learning_rate": 1.4669421487603306e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.3984375, + "logps/chosen": -386.0, + "logps/rejected": -356.0, + "loss": 0.0151, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.07275390625, + "rewards/margins": 9.25, + "rewards/rejected": -9.3125, + "step": 1735 + }, + { + "epoch": 2.1300613496932517, + "grad_norm": 6.031806189890375, + "learning_rate": 1.464876033057851e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.41796875, + "logps/chosen": -420.0, + "logps/rejected": -390.0, + "loss": 0.0309, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.158203125, + "rewards/margins": 8.4375, + "rewards/rejected": -8.625, + "step": 1736 + }, + { + "epoch": 2.1312883435582823, + "grad_norm": 3.811659226600542, + "learning_rate": 1.4628099173553718e-07, + "logits/chosen": -0.26171875, + "logits/rejected": -0.443359375, + "logps/chosen": -390.0, + "logps/rejected": -384.0, + "loss": 0.0148, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5625, + "rewards/margins": 9.625, + "rewards/rejected": -9.0625, + "step": 1737 + }, + { + "epoch": 2.132515337423313, + "grad_norm": 4.243183334857802, + "learning_rate": 1.4607438016528926e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.47265625, + "logps/chosen": -396.0, + "logps/rejected": -406.0, + "loss": 0.0222, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.07080078125, + "rewards/margins": 9.625, + "rewards/rejected": -9.5625, + "step": 1738 + }, + { + "epoch": 2.1337423312883437, + "grad_norm": 3.486674066253199, + "learning_rate": 1.4586776859504133e-07, + "logits/chosen": -0.3046875, + "logits/rejected": -0.427734375, + "logps/chosen": -376.0, + "logps/rejected": -408.0, + "loss": 0.0156, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.181640625, + "rewards/margins": 9.75, + "rewards/rejected": -9.625, + "step": 1739 + }, + { + "epoch": 2.1349693251533743, + "grad_norm": 4.4444756109590635, + "learning_rate": 1.4566115702479338e-07, + "logits/chosen": -0.279296875, + "logits/rejected": -0.396484375, + "logps/chosen": -352.0, + "logps/rejected": -354.0, + "loss": 0.0214, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.287109375, + "rewards/margins": 9.3125, + "rewards/rejected": -9.0625, + "step": 1740 + }, + { + "epoch": 2.136196319018405, + "grad_norm": 5.318316795029678, + "learning_rate": 1.4545454545454545e-07, + "logits/chosen": -0.302734375, + "logits/rejected": -0.390625, + "logps/chosen": -362.0, + "logps/rejected": -376.0, + "loss": 0.0217, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.1796875, + "rewards/margins": 9.4375, + "rewards/rejected": -9.3125, + "step": 1741 + }, + { + "epoch": 2.1374233128834357, + "grad_norm": 5.227425566854369, + "learning_rate": 1.4524793388429753e-07, + "logits/chosen": -0.30078125, + "logits/rejected": -0.447265625, + "logps/chosen": -402.0, + "logps/rejected": -324.0, + "loss": 0.0235, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.306640625, + "rewards/margins": 9.375, + "rewards/rejected": -9.0625, + "step": 1742 + }, + { + "epoch": 2.1386503067484663, + "grad_norm": 4.00741390333395, + "learning_rate": 1.4504132231404957e-07, + "logits/chosen": -0.3125, + "logits/rejected": -0.5, + "logps/chosen": -394.0, + "logps/rejected": -374.0, + "loss": 0.0206, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.765625, + "rewards/margins": 9.8125, + "rewards/rejected": -9.0625, + "step": 1743 + }, + { + "epoch": 2.139877300613497, + "grad_norm": 3.97598664088876, + "learning_rate": 1.4483471074380165e-07, + "logits/chosen": -0.396484375, + "logits/rejected": -0.64453125, + "logps/chosen": -394.0, + "logps/rejected": -392.0, + "loss": 0.0107, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.1982421875, + "rewards/margins": 10.4375, + "rewards/rejected": -10.25, + "step": 1744 + }, + { + "epoch": 2.1411042944785277, + "grad_norm": 4.954318723769565, + "learning_rate": 1.446280991735537e-07, + "logits/chosen": -0.349609375, + "logits/rejected": -0.5390625, + "logps/chosen": -424.0, + "logps/rejected": -394.0, + "loss": 0.0148, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.146484375, + "rewards/margins": 9.6875, + "rewards/rejected": -9.5, + "step": 1745 + }, + { + "epoch": 2.1423312883435583, + "grad_norm": 4.948247455899231, + "learning_rate": 1.4442148760330577e-07, + "logits/chosen": -0.2158203125, + "logits/rejected": -0.3828125, + "logps/chosen": -438.0, + "logps/rejected": -368.0, + "loss": 0.0255, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.5078125, + "rewards/margins": 9.0625, + "rewards/rejected": -8.5625, + "step": 1746 + }, + { + "epoch": 2.143558282208589, + "grad_norm": 2.967598582152442, + "learning_rate": 1.4421487603305784e-07, + "logits/chosen": -0.27734375, + "logits/rejected": -0.416015625, + "logps/chosen": -398.0, + "logps/rejected": -376.0, + "loss": 0.0104, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4296875, + "rewards/margins": 10.0625, + "rewards/rejected": -9.625, + "step": 1747 + }, + { + "epoch": 2.1447852760736197, + "grad_norm": 4.68189820262662, + "learning_rate": 1.4400826446280991e-07, + "logits/chosen": -0.3359375, + "logits/rejected": -0.5703125, + "logps/chosen": -422.0, + "logps/rejected": -372.0, + "loss": 0.0206, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.8984375, + "rewards/margins": 9.5, + "rewards/rejected": -8.5625, + "step": 1748 + }, + { + "epoch": 2.1460122699386504, + "grad_norm": 4.192942188719989, + "learning_rate": 1.4380165289256196e-07, + "logits/chosen": -0.181640625, + "logits/rejected": -0.435546875, + "logps/chosen": -422.0, + "logps/rejected": -392.0, + "loss": 0.015, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.80078125, + "rewards/margins": 9.0625, + "rewards/rejected": -8.25, + "step": 1749 + }, + { + "epoch": 2.147239263803681, + "grad_norm": 4.190267862778011, + "learning_rate": 1.4359504132231404e-07, + "logits/chosen": -0.3359375, + "logits/rejected": -0.55078125, + "logps/chosen": -404.0, + "logps/rejected": -360.0, + "loss": 0.0132, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.166015625, + "rewards/margins": 9.5625, + "rewards/rejected": -9.4375, + "step": 1750 + }, + { + "epoch": 2.1484662576687117, + "grad_norm": 5.317375716052735, + "learning_rate": 1.433884297520661e-07, + "logits/chosen": -0.2138671875, + "logits/rejected": -0.41015625, + "logps/chosen": -316.0, + "logps/rejected": -336.0, + "loss": 0.0172, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.2734375, + "rewards/margins": 9.25, + "rewards/rejected": -9.0, + "step": 1751 + }, + { + "epoch": 2.1496932515337424, + "grad_norm": 4.595272493454587, + "learning_rate": 1.4318181818181818e-07, + "logits/chosen": -0.2373046875, + "logits/rejected": -0.43359375, + "logps/chosen": -450.0, + "logps/rejected": -386.0, + "loss": 0.0163, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.32421875, + "rewards/margins": 9.4375, + "rewards/rejected": -9.125, + "step": 1752 + }, + { + "epoch": 2.150920245398773, + "grad_norm": 4.0831685043326456, + "learning_rate": 1.4297520661157026e-07, + "logits/chosen": -0.26171875, + "logits/rejected": -0.439453125, + "logps/chosen": -398.0, + "logps/rejected": -350.0, + "loss": 0.0157, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.671875, + "rewards/margins": 8.9375, + "rewards/rejected": -8.3125, + "step": 1753 + }, + { + "epoch": 2.1521472392638037, + "grad_norm": 6.9503605453264425, + "learning_rate": 1.427685950413223e-07, + "logits/chosen": -0.236328125, + "logits/rejected": -0.412109375, + "logps/chosen": -386.0, + "logps/rejected": -352.0, + "loss": 0.0268, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.08642578125, + "rewards/margins": 9.125, + "rewards/rejected": -9.0625, + "step": 1754 + }, + { + "epoch": 2.1533742331288344, + "grad_norm": 4.951773727961341, + "learning_rate": 1.4256198347107438e-07, + "logits/chosen": -0.19921875, + "logits/rejected": -0.3984375, + "logps/chosen": -374.0, + "logps/rejected": -356.0, + "loss": 0.0195, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5078125, + "rewards/margins": 9.3125, + "rewards/rejected": -8.75, + "step": 1755 + }, + { + "epoch": 2.154601226993865, + "grad_norm": 6.1962406063870015, + "learning_rate": 1.4235537190082645e-07, + "logits/chosen": -0.228515625, + "logits/rejected": -0.427734375, + "logps/chosen": -424.0, + "logps/rejected": -400.0, + "loss": 0.0203, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.453125, + "rewards/margins": 9.25, + "rewards/rejected": -8.8125, + "step": 1756 + }, + { + "epoch": 2.1558282208588957, + "grad_norm": 8.38257881192885, + "learning_rate": 1.4214876033057852e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.3984375, + "logps/chosen": -374.0, + "logps/rejected": -380.0, + "loss": 0.0258, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.259765625, + "rewards/margins": 8.6875, + "rewards/rejected": -8.4375, + "step": 1757 + }, + { + "epoch": 2.1570552147239264, + "grad_norm": 5.847260510810782, + "learning_rate": 1.4194214876033057e-07, + "logits/chosen": -0.265625, + "logits/rejected": -0.32421875, + "logps/chosen": -328.0, + "logps/rejected": -344.0, + "loss": 0.0253, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.06591796875, + "rewards/margins": 9.1875, + "rewards/rejected": -9.125, + "step": 1758 + }, + { + "epoch": 2.158282208588957, + "grad_norm": 5.288110966819383, + "learning_rate": 1.4173553719008264e-07, + "logits/chosen": -0.416015625, + "logits/rejected": -0.6015625, + "logps/chosen": -380.0, + "logps/rejected": -372.0, + "loss": 0.0213, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.412109375, + "rewards/margins": 9.9375, + "rewards/rejected": -9.5, + "step": 1759 + }, + { + "epoch": 2.1595092024539877, + "grad_norm": 4.624929859696501, + "learning_rate": 1.415289256198347e-07, + "logits/chosen": -0.287109375, + "logits/rejected": -0.52734375, + "logps/chosen": -430.0, + "logps/rejected": -378.0, + "loss": 0.016, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.8984375, + "rewards/margins": 10.0, + "rewards/rejected": -9.125, + "step": 1760 + }, + { + "epoch": 2.1607361963190184, + "grad_norm": 5.130802127059329, + "learning_rate": 1.4132231404958677e-07, + "logits/chosen": -0.3125, + "logits/rejected": -0.5078125, + "logps/chosen": -402.0, + "logps/rejected": -400.0, + "loss": 0.018, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.181640625, + "rewards/margins": 9.6875, + "rewards/rejected": -9.5, + "step": 1761 + }, + { + "epoch": 2.161963190184049, + "grad_norm": 5.854939124446989, + "learning_rate": 1.4111570247933884e-07, + "logits/chosen": -0.38671875, + "logits/rejected": -0.486328125, + "logps/chosen": -362.0, + "logps/rejected": -376.0, + "loss": 0.0243, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.27734375, + "rewards/margins": 9.25, + "rewards/rejected": -9.5, + "step": 1762 + }, + { + "epoch": 2.1631901840490797, + "grad_norm": 6.141122372387298, + "learning_rate": 1.4090909090909089e-07, + "logits/chosen": -0.31640625, + "logits/rejected": -0.5078125, + "logps/chosen": -428.0, + "logps/rejected": -396.0, + "loss": 0.0331, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.69140625, + "rewards/margins": 8.875, + "rewards/rejected": -9.5625, + "step": 1763 + }, + { + "epoch": 2.1644171779141104, + "grad_norm": 5.637809455362602, + "learning_rate": 1.4070247933884296e-07, + "logits/chosen": -0.228515625, + "logits/rejected": -0.375, + "logps/chosen": -402.0, + "logps/rejected": -362.0, + "loss": 0.0408, + "rewards/accuracies": 0.9765625, + "rewards/chosen": 0.031494140625, + "rewards/margins": 8.75, + "rewards/rejected": -8.6875, + "step": 1764 + }, + { + "epoch": 2.165644171779141, + "grad_norm": 3.6926109914479506, + "learning_rate": 1.4049586776859503e-07, + "logits/chosen": -0.42578125, + "logits/rejected": -0.64453125, + "logps/chosen": -458.0, + "logps/rejected": -398.0, + "loss": 0.0173, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.99609375, + "rewards/margins": 10.75, + "rewards/rejected": -9.75, + "step": 1765 + }, + { + "epoch": 2.1668711656441717, + "grad_norm": 5.438552108783997, + "learning_rate": 1.402892561983471e-07, + "logits/chosen": -0.171875, + "logits/rejected": -0.375, + "logps/chosen": -342.0, + "logps/rejected": -346.0, + "loss": 0.0197, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.302734375, + "rewards/margins": 9.125, + "rewards/rejected": -8.8125, + "step": 1766 + }, + { + "epoch": 2.1680981595092024, + "grad_norm": 4.764322011984576, + "learning_rate": 1.4008264462809915e-07, + "logits/chosen": -0.203125, + "logits/rejected": -0.3125, + "logps/chosen": -398.0, + "logps/rejected": -358.0, + "loss": 0.015, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.0888671875, + "rewards/margins": 9.4375, + "rewards/rejected": -9.3125, + "step": 1767 + }, + { + "epoch": 2.169325153374233, + "grad_norm": 4.933245765787079, + "learning_rate": 1.3987603305785123e-07, + "logits/chosen": -0.228515625, + "logits/rejected": -0.3984375, + "logps/chosen": -352.0, + "logps/rejected": -328.0, + "loss": 0.0159, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.111328125, + "rewards/margins": 9.125, + "rewards/rejected": -9.0, + "step": 1768 + }, + { + "epoch": 2.1705521472392637, + "grad_norm": 5.603122792946467, + "learning_rate": 1.396694214876033e-07, + "logits/chosen": -0.283203125, + "logits/rejected": -0.498046875, + "logps/chosen": -392.0, + "logps/rejected": -388.0, + "loss": 0.0189, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.103515625, + "rewards/margins": 9.75, + "rewards/rejected": -9.875, + "step": 1769 + }, + { + "epoch": 2.1717791411042944, + "grad_norm": 7.415429624817888, + "learning_rate": 1.3946280991735537e-07, + "logits/chosen": -0.455078125, + "logits/rejected": -0.6015625, + "logps/chosen": -384.0, + "logps/rejected": -366.0, + "loss": 0.0209, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.038818359375, + "rewards/margins": 9.5625, + "rewards/rejected": -9.625, + "step": 1770 + }, + { + "epoch": 2.173006134969325, + "grad_norm": 4.898924752030283, + "learning_rate": 1.3925619834710745e-07, + "logits/chosen": -0.1875, + "logits/rejected": -0.392578125, + "logps/chosen": -386.0, + "logps/rejected": -374.0, + "loss": 0.0179, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.0191650390625, + "rewards/margins": 9.6875, + "rewards/rejected": -9.75, + "step": 1771 + }, + { + "epoch": 2.1742331288343557, + "grad_norm": 7.484386306004089, + "learning_rate": 1.390495867768595e-07, + "logits/chosen": -0.2001953125, + "logits/rejected": -0.283203125, + "logps/chosen": -362.0, + "logps/rejected": -352.0, + "loss": 0.0231, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.2255859375, + "rewards/margins": 9.5625, + "rewards/rejected": -9.3125, + "step": 1772 + }, + { + "epoch": 2.1754601226993864, + "grad_norm": 8.309071648350947, + "learning_rate": 1.3884297520661157e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.408203125, + "logps/chosen": -384.0, + "logps/rejected": -392.0, + "loss": 0.0208, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.0247802734375, + "rewards/margins": 9.375, + "rewards/rejected": -9.375, + "step": 1773 + }, + { + "epoch": 2.176687116564417, + "grad_norm": 7.205604123265275, + "learning_rate": 1.3863636363636364e-07, + "logits/chosen": -0.21484375, + "logits/rejected": -0.330078125, + "logps/chosen": -388.0, + "logps/rejected": -382.0, + "loss": 0.0287, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.0233154296875, + "rewards/margins": 8.8125, + "rewards/rejected": -8.8125, + "step": 1774 + }, + { + "epoch": 2.1779141104294477, + "grad_norm": 4.917966331915129, + "learning_rate": 1.3842975206611572e-07, + "logits/chosen": -0.322265625, + "logits/rejected": -0.41796875, + "logps/chosen": -406.0, + "logps/rejected": -366.0, + "loss": 0.0178, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.011962890625, + "rewards/margins": 9.3125, + "rewards/rejected": -9.3125, + "step": 1775 + }, + { + "epoch": 2.1791411042944784, + "grad_norm": 4.785592934711352, + "learning_rate": 1.3822314049586776e-07, + "logits/chosen": -0.291015625, + "logits/rejected": -0.494140625, + "logps/chosen": -410.0, + "logps/rejected": -388.0, + "loss": 0.0162, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.3671875, + "rewards/margins": 9.9375, + "rewards/rejected": -9.625, + "step": 1776 + }, + { + "epoch": 2.180368098159509, + "grad_norm": 4.433016457964013, + "learning_rate": 1.3801652892561984e-07, + "logits/chosen": -0.2294921875, + "logits/rejected": -0.345703125, + "logps/chosen": -398.0, + "logps/rejected": -376.0, + "loss": 0.0138, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5703125, + "rewards/margins": 9.9375, + "rewards/rejected": -9.375, + "step": 1777 + }, + { + "epoch": 2.1815950920245397, + "grad_norm": 5.067668639345676, + "learning_rate": 1.3780991735537188e-07, + "logits/chosen": -0.234375, + "logits/rejected": -0.48828125, + "logps/chosen": -408.0, + "logps/rejected": -358.0, + "loss": 0.0251, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.671875, + "rewards/margins": 9.75, + "rewards/rejected": -9.0625, + "step": 1778 + }, + { + "epoch": 2.1828220858895704, + "grad_norm": 4.154439265883584, + "learning_rate": 1.3760330578512396e-07, + "logits/chosen": -0.32421875, + "logits/rejected": -0.54296875, + "logps/chosen": -442.0, + "logps/rejected": -376.0, + "loss": 0.0184, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.046875, + "rewards/margins": 10.4375, + "rewards/rejected": -9.375, + "step": 1779 + }, + { + "epoch": 2.184049079754601, + "grad_norm": 5.172625274062805, + "learning_rate": 1.37396694214876e-07, + "logits/chosen": -0.37890625, + "logits/rejected": -0.56640625, + "logps/chosen": -390.0, + "logps/rejected": -400.0, + "loss": 0.0258, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.2373046875, + "rewards/margins": 9.375, + "rewards/rejected": -9.625, + "step": 1780 + }, + { + "epoch": 2.1852760736196317, + "grad_norm": 4.328432410727534, + "learning_rate": 1.3719008264462808e-07, + "logits/chosen": -0.361328125, + "logits/rejected": -0.60546875, + "logps/chosen": -410.0, + "logps/rejected": -404.0, + "loss": 0.0189, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.73046875, + "rewards/margins": 10.1875, + "rewards/rejected": -9.5, + "step": 1781 + }, + { + "epoch": 2.1865030674846624, + "grad_norm": 6.0323283610718414, + "learning_rate": 1.3698347107438015e-07, + "logits/chosen": -0.349609375, + "logits/rejected": -0.46484375, + "logps/chosen": -364.0, + "logps/rejected": -378.0, + "loss": 0.0224, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.0830078125, + "rewards/margins": 9.3125, + "rewards/rejected": -9.375, + "step": 1782 + }, + { + "epoch": 2.187730061349693, + "grad_norm": 5.057311790433255, + "learning_rate": 1.3677685950413222e-07, + "logits/chosen": -0.263671875, + "logits/rejected": -0.419921875, + "logps/chosen": -358.0, + "logps/rejected": -358.0, + "loss": 0.0157, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.2578125, + "rewards/margins": 9.1875, + "rewards/rejected": -8.9375, + "step": 1783 + }, + { + "epoch": 2.1889570552147237, + "grad_norm": 6.279275860252532, + "learning_rate": 1.365702479338843e-07, + "logits/chosen": -0.4375, + "logits/rejected": -0.65625, + "logps/chosen": -412.0, + "logps/rejected": -362.0, + "loss": 0.0282, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.69921875, + "rewards/margins": 10.25, + "rewards/rejected": -9.5625, + "step": 1784 + }, + { + "epoch": 2.190184049079755, + "grad_norm": 6.2381481095351345, + "learning_rate": 1.3636363636363635e-07, + "logits/chosen": -0.26953125, + "logits/rejected": -0.4453125, + "logps/chosen": -384.0, + "logps/rejected": -392.0, + "loss": 0.0236, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.1396484375, + "rewards/margins": 9.5625, + "rewards/rejected": -9.375, + "step": 1785 + }, + { + "epoch": 2.191411042944785, + "grad_norm": 5.6891112250641225, + "learning_rate": 1.3615702479338842e-07, + "logits/chosen": -0.263671875, + "logits/rejected": -0.392578125, + "logps/chosen": -358.0, + "logps/rejected": -342.0, + "loss": 0.0171, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.17578125, + "rewards/margins": 8.8125, + "rewards/rejected": -8.625, + "step": 1786 + }, + { + "epoch": 2.192638036809816, + "grad_norm": 4.792411416132231, + "learning_rate": 1.359504132231405e-07, + "logits/chosen": -0.328125, + "logits/rejected": -0.421875, + "logps/chosen": -402.0, + "logps/rejected": -418.0, + "loss": 0.0289, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.373046875, + "rewards/margins": 8.875, + "rewards/rejected": -8.5, + "step": 1787 + }, + { + "epoch": 2.1938650306748464, + "grad_norm": 5.153992715777966, + "learning_rate": 1.3574380165289257e-07, + "logits/chosen": -0.103515625, + "logits/rejected": -0.375, + "logps/chosen": -400.0, + "logps/rejected": -360.0, + "loss": 0.0207, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.32421875, + "rewards/margins": 9.125, + "rewards/rejected": -8.75, + "step": 1788 + }, + { + "epoch": 2.1950920245398775, + "grad_norm": 4.7076352814010765, + "learning_rate": 1.355371900826446e-07, + "logits/chosen": -0.3203125, + "logits/rejected": -0.4921875, + "logps/chosen": -400.0, + "logps/rejected": -388.0, + "loss": 0.0191, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.19921875, + "rewards/margins": 9.0625, + "rewards/rejected": -9.25, + "step": 1789 + }, + { + "epoch": 2.196319018404908, + "grad_norm": 6.7931301392273475, + "learning_rate": 1.353305785123967e-07, + "logits/chosen": -0.162109375, + "logits/rejected": -0.4296875, + "logps/chosen": -412.0, + "logps/rejected": -352.0, + "loss": 0.0273, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.8046875, + "rewards/margins": 9.3125, + "rewards/rejected": -8.5, + "step": 1790 + }, + { + "epoch": 2.197546012269939, + "grad_norm": 4.732918561624651, + "learning_rate": 1.3512396694214876e-07, + "logits/chosen": -0.32421875, + "logits/rejected": -0.490234375, + "logps/chosen": -362.0, + "logps/rejected": -378.0, + "loss": 0.0177, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.228515625, + "rewards/margins": 8.9375, + "rewards/rejected": -9.1875, + "step": 1791 + }, + { + "epoch": 2.1987730061349695, + "grad_norm": 5.768930132690701, + "learning_rate": 1.3491735537190083e-07, + "logits/chosen": -0.255859375, + "logits/rejected": -0.40234375, + "logps/chosen": -358.0, + "logps/rejected": -368.0, + "loss": 0.023, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.349609375, + "rewards/margins": 8.75, + "rewards/rejected": -9.0625, + "step": 1792 + }, + { + "epoch": 2.2, + "grad_norm": 3.166564903238143, + "learning_rate": 1.347107438016529e-07, + "logits/chosen": -0.326171875, + "logits/rejected": -0.40625, + "logps/chosen": -350.0, + "logps/rejected": -368.0, + "loss": 0.0116, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.048828125, + "rewards/margins": 8.9375, + "rewards/rejected": -9.0, + "step": 1793 + }, + { + "epoch": 2.201226993865031, + "grad_norm": 4.321450988373375, + "learning_rate": 1.3450413223140495e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.443359375, + "logps/chosen": -414.0, + "logps/rejected": -384.0, + "loss": 0.0164, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.1435546875, + "rewards/margins": 9.5625, + "rewards/rejected": -9.4375, + "step": 1794 + }, + { + "epoch": 2.2024539877300615, + "grad_norm": 4.794056390507042, + "learning_rate": 1.3429752066115703e-07, + "logits/chosen": -0.3203125, + "logits/rejected": -0.451171875, + "logps/chosen": -388.0, + "logps/rejected": -376.0, + "loss": 0.0215, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.3671875, + "rewards/margins": 9.0, + "rewards/rejected": -8.625, + "step": 1795 + }, + { + "epoch": 2.203680981595092, + "grad_norm": 5.981817943585242, + "learning_rate": 1.3409090909090908e-07, + "logits/chosen": -0.318359375, + "logits/rejected": -0.42578125, + "logps/chosen": -392.0, + "logps/rejected": -374.0, + "loss": 0.0237, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.87890625, + "rewards/margins": 9.625, + "rewards/rejected": -8.75, + "step": 1796 + }, + { + "epoch": 2.204907975460123, + "grad_norm": 3.8081382498110528, + "learning_rate": 1.3388429752066115e-07, + "logits/chosen": -0.328125, + "logits/rejected": -0.51171875, + "logps/chosen": -394.0, + "logps/rejected": -376.0, + "loss": 0.012, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6953125, + "rewards/margins": 9.75, + "rewards/rejected": -9.0625, + "step": 1797 + }, + { + "epoch": 2.2061349693251535, + "grad_norm": 4.496888465578048, + "learning_rate": 1.336776859504132e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.46875, + "logps/chosen": -396.0, + "logps/rejected": -398.0, + "loss": 0.0164, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.75390625, + "rewards/margins": 10.375, + "rewards/rejected": -9.625, + "step": 1798 + }, + { + "epoch": 2.207361963190184, + "grad_norm": 5.105417417870863, + "learning_rate": 1.3347107438016527e-07, + "logits/chosen": -0.2353515625, + "logits/rejected": -0.4140625, + "logps/chosen": -386.0, + "logps/rejected": -390.0, + "loss": 0.02, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.3671875, + "rewards/margins": 9.75, + "rewards/rejected": -9.375, + "step": 1799 + }, + { + "epoch": 2.208588957055215, + "grad_norm": 7.206240095924718, + "learning_rate": 1.3326446280991734e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.408203125, + "logps/chosen": -374.0, + "logps/rejected": -370.0, + "loss": 0.021, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.06494140625, + "rewards/margins": 9.8125, + "rewards/rejected": -9.875, + "step": 1800 + }, + { + "epoch": 2.2098159509202455, + "grad_norm": 5.6507039275260125, + "learning_rate": 1.3305785123966942e-07, + "logits/chosen": -0.26171875, + "logits/rejected": -0.431640625, + "logps/chosen": -350.0, + "logps/rejected": -370.0, + "loss": 0.0192, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.10498046875, + "rewards/margins": 9.9375, + "rewards/rejected": -9.8125, + "step": 1801 + }, + { + "epoch": 2.211042944785276, + "grad_norm": 4.790305842773947, + "learning_rate": 1.328512396694215e-07, + "logits/chosen": -0.36328125, + "logits/rejected": -0.48828125, + "logps/chosen": -388.0, + "logps/rejected": -380.0, + "loss": 0.02, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.26953125, + "rewards/margins": 9.1875, + "rewards/rejected": -8.875, + "step": 1802 + }, + { + "epoch": 2.212269938650307, + "grad_norm": 4.2196180179683545, + "learning_rate": 1.3264462809917354e-07, + "logits/chosen": -0.40625, + "logits/rejected": -0.6171875, + "logps/chosen": -394.0, + "logps/rejected": -372.0, + "loss": 0.0159, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.53515625, + "rewards/margins": 10.75, + "rewards/rejected": -10.1875, + "step": 1803 + }, + { + "epoch": 2.2134969325153375, + "grad_norm": 4.6667370416904435, + "learning_rate": 1.324380165289256e-07, + "logits/chosen": -0.267578125, + "logits/rejected": -0.490234375, + "logps/chosen": -400.0, + "logps/rejected": -370.0, + "loss": 0.0177, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.265625, + "rewards/margins": 9.9375, + "rewards/rejected": -9.6875, + "step": 1804 + }, + { + "epoch": 2.214723926380368, + "grad_norm": 6.060868069550036, + "learning_rate": 1.3223140495867768e-07, + "logits/chosen": -0.25, + "logits/rejected": -0.44140625, + "logps/chosen": -444.0, + "logps/rejected": -340.0, + "loss": 0.0207, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.40625, + "rewards/margins": 9.9375, + "rewards/rejected": -9.5625, + "step": 1805 + }, + { + "epoch": 2.215950920245399, + "grad_norm": 5.836193246359891, + "learning_rate": 1.3202479338842976e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.4375, + "logps/chosen": -366.0, + "logps/rejected": -362.0, + "loss": 0.0229, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.447265625, + "rewards/margins": 9.25, + "rewards/rejected": -9.6875, + "step": 1806 + }, + { + "epoch": 2.2171779141104295, + "grad_norm": 5.269783474031115, + "learning_rate": 1.318181818181818e-07, + "logits/chosen": -0.1884765625, + "logits/rejected": -0.3828125, + "logps/chosen": -388.0, + "logps/rejected": -378.0, + "loss": 0.0199, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.51171875, + "rewards/margins": 9.3125, + "rewards/rejected": -8.8125, + "step": 1807 + }, + { + "epoch": 2.21840490797546, + "grad_norm": 3.6049730141569634, + "learning_rate": 1.3161157024793388e-07, + "logits/chosen": -0.373046875, + "logits/rejected": -0.54296875, + "logps/chosen": -356.0, + "logps/rejected": -388.0, + "loss": 0.0124, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.349609375, + "rewards/margins": 10.125, + "rewards/rejected": -9.75, + "step": 1808 + }, + { + "epoch": 2.219631901840491, + "grad_norm": 4.015229686688981, + "learning_rate": 1.3140495867768595e-07, + "logits/chosen": -0.322265625, + "logits/rejected": -0.51953125, + "logps/chosen": -422.0, + "logps/rejected": -356.0, + "loss": 0.0137, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.057373046875, + "rewards/margins": 9.8125, + "rewards/rejected": -9.8125, + "step": 1809 + }, + { + "epoch": 2.2208588957055215, + "grad_norm": 7.870957941326324, + "learning_rate": 1.3119834710743803e-07, + "logits/chosen": -0.2060546875, + "logits/rejected": -0.359375, + "logps/chosen": -412.0, + "logps/rejected": -378.0, + "loss": 0.0222, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.287109375, + "rewards/margins": 9.0, + "rewards/rejected": -8.75, + "step": 1810 + }, + { + "epoch": 2.222085889570552, + "grad_norm": 4.933793758459652, + "learning_rate": 1.309917355371901e-07, + "logits/chosen": -0.294921875, + "logits/rejected": -0.431640625, + "logps/chosen": -360.0, + "logps/rejected": -340.0, + "loss": 0.0196, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.4765625, + "rewards/margins": 9.1875, + "rewards/rejected": -9.625, + "step": 1811 + }, + { + "epoch": 2.223312883435583, + "grad_norm": 5.279159408771306, + "learning_rate": 1.3078512396694215e-07, + "logits/chosen": -0.255859375, + "logits/rejected": -0.404296875, + "logps/chosen": -380.0, + "logps/rejected": -342.0, + "loss": 0.0262, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.2353515625, + "rewards/margins": 9.6875, + "rewards/rejected": -9.4375, + "step": 1812 + }, + { + "epoch": 2.2245398773006135, + "grad_norm": 4.383850139528388, + "learning_rate": 1.3057851239669422e-07, + "logits/chosen": -0.38671875, + "logits/rejected": -0.59375, + "logps/chosen": -404.0, + "logps/rejected": -374.0, + "loss": 0.0146, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.1845703125, + "rewards/margins": 9.375, + "rewards/rejected": -9.1875, + "step": 1813 + }, + { + "epoch": 2.225766871165644, + "grad_norm": 5.221574284880684, + "learning_rate": 1.3037190082644627e-07, + "logits/chosen": -0.33984375, + "logits/rejected": -0.54296875, + "logps/chosen": -390.0, + "logps/rejected": -356.0, + "loss": 0.0258, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.435546875, + "rewards/margins": 9.4375, + "rewards/rejected": -9.0, + "step": 1814 + }, + { + "epoch": 2.226993865030675, + "grad_norm": 4.903806142353254, + "learning_rate": 1.3016528925619834e-07, + "logits/chosen": -0.255859375, + "logits/rejected": -0.4765625, + "logps/chosen": -408.0, + "logps/rejected": -392.0, + "loss": 0.0146, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.341796875, + "rewards/margins": 9.6875, + "rewards/rejected": -9.375, + "step": 1815 + }, + { + "epoch": 2.2282208588957055, + "grad_norm": 4.596704982864842, + "learning_rate": 1.299586776859504e-07, + "logits/chosen": -0.302734375, + "logits/rejected": -0.4921875, + "logps/chosen": -422.0, + "logps/rejected": -390.0, + "loss": 0.0232, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.28515625, + "rewards/margins": 8.9375, + "rewards/rejected": -8.625, + "step": 1816 + }, + { + "epoch": 2.229447852760736, + "grad_norm": 4.261914985992708, + "learning_rate": 1.2975206611570246e-07, + "logits/chosen": -0.263671875, + "logits/rejected": -0.478515625, + "logps/chosen": -436.0, + "logps/rejected": -372.0, + "loss": 0.0193, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.7109375, + "rewards/margins": 10.0, + "rewards/rejected": -9.25, + "step": 1817 + }, + { + "epoch": 2.230674846625767, + "grad_norm": 8.272172103840209, + "learning_rate": 1.2954545454545453e-07, + "logits/chosen": -0.306640625, + "logits/rejected": -0.5390625, + "logps/chosen": -396.0, + "logps/rejected": -372.0, + "loss": 0.0283, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.15234375, + "rewards/margins": 9.375, + "rewards/rejected": -9.1875, + "step": 1818 + }, + { + "epoch": 2.2319018404907975, + "grad_norm": 7.819904445229833, + "learning_rate": 1.293388429752066e-07, + "logits/chosen": -0.263671875, + "logits/rejected": -0.423828125, + "logps/chosen": -368.0, + "logps/rejected": -334.0, + "loss": 0.0216, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.41796875, + "rewards/margins": 8.5625, + "rewards/rejected": -9.0, + "step": 1819 + }, + { + "epoch": 2.233128834355828, + "grad_norm": 5.518071097913923, + "learning_rate": 1.2913223140495866e-07, + "logits/chosen": -0.1923828125, + "logits/rejected": -0.302734375, + "logps/chosen": -338.0, + "logps/rejected": -330.0, + "loss": 0.0199, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.2421875, + "rewards/margins": 8.375, + "rewards/rejected": -8.125, + "step": 1820 + }, + { + "epoch": 2.234355828220859, + "grad_norm": 4.953869439038375, + "learning_rate": 1.2892561983471073e-07, + "logits/chosen": -0.353515625, + "logits/rejected": -0.51953125, + "logps/chosen": -384.0, + "logps/rejected": -360.0, + "loss": 0.0169, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.515625, + "rewards/margins": 9.5625, + "rewards/rejected": -9.0, + "step": 1821 + }, + { + "epoch": 2.2355828220858895, + "grad_norm": 4.5008802810776825, + "learning_rate": 1.287190082644628e-07, + "logits/chosen": -0.314453125, + "logits/rejected": -0.41796875, + "logps/chosen": -386.0, + "logps/rejected": -356.0, + "loss": 0.0174, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5078125, + "rewards/margins": 9.125, + "rewards/rejected": -8.625, + "step": 1822 + }, + { + "epoch": 2.23680981595092, + "grad_norm": 7.3514185553659726, + "learning_rate": 1.2851239669421488e-07, + "logits/chosen": -0.171875, + "logits/rejected": -0.384765625, + "logps/chosen": -448.0, + "logps/rejected": -394.0, + "loss": 0.0297, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.703125, + "rewards/margins": 8.875, + "rewards/rejected": -8.1875, + "step": 1823 + }, + { + "epoch": 2.238036809815951, + "grad_norm": 4.0172905288880605, + "learning_rate": 1.2830578512396695e-07, + "logits/chosen": -0.11572265625, + "logits/rejected": -0.30078125, + "logps/chosen": -360.0, + "logps/rejected": -352.0, + "loss": 0.0156, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.302734375, + "rewards/margins": 8.625, + "rewards/rejected": -8.3125, + "step": 1824 + }, + { + "epoch": 2.2392638036809815, + "grad_norm": 3.909744719775554, + "learning_rate": 1.28099173553719e-07, + "logits/chosen": -0.1806640625, + "logits/rejected": -0.341796875, + "logps/chosen": -404.0, + "logps/rejected": -386.0, + "loss": 0.0154, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.1103515625, + "rewards/margins": 8.8125, + "rewards/rejected": -8.9375, + "step": 1825 + }, + { + "epoch": 2.240490797546012, + "grad_norm": 4.506705672741201, + "learning_rate": 1.2789256198347107e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.3828125, + "logps/chosen": -372.0, + "logps/rejected": -386.0, + "loss": 0.0137, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.1845703125, + "rewards/margins": 8.875, + "rewards/rejected": -9.0625, + "step": 1826 + }, + { + "epoch": 2.241717791411043, + "grad_norm": 4.207294897242547, + "learning_rate": 1.2768595041322314e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.51953125, + "logps/chosen": -386.0, + "logps/rejected": -366.0, + "loss": 0.0173, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6953125, + "rewards/margins": 10.0625, + "rewards/rejected": -9.375, + "step": 1827 + }, + { + "epoch": 2.2429447852760735, + "grad_norm": 6.617077685484015, + "learning_rate": 1.2747933884297522e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.412109375, + "logps/chosen": -364.0, + "logps/rejected": -374.0, + "loss": 0.0178, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.53515625, + "rewards/margins": 10.25, + "rewards/rejected": -9.6875, + "step": 1828 + }, + { + "epoch": 2.244171779141104, + "grad_norm": 5.054930387032939, + "learning_rate": 1.2727272727272726e-07, + "logits/chosen": -0.296875, + "logits/rejected": -0.47265625, + "logps/chosen": -394.0, + "logps/rejected": -378.0, + "loss": 0.018, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.01953125, + "rewards/margins": 8.75, + "rewards/rejected": -8.75, + "step": 1829 + }, + { + "epoch": 2.245398773006135, + "grad_norm": 5.924133953073634, + "learning_rate": 1.2706611570247934e-07, + "logits/chosen": -0.2021484375, + "logits/rejected": -0.380859375, + "logps/chosen": -364.0, + "logps/rejected": -342.0, + "loss": 0.0206, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.177734375, + "rewards/margins": 9.0, + "rewards/rejected": -8.875, + "step": 1830 + }, + { + "epoch": 2.2466257668711656, + "grad_norm": 5.73812637771657, + "learning_rate": 1.268595041322314e-07, + "logits/chosen": -0.3046875, + "logits/rejected": -0.443359375, + "logps/chosen": -350.0, + "logps/rejected": -384.0, + "loss": 0.021, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.53125, + "rewards/margins": 9.25, + "rewards/rejected": -9.75, + "step": 1831 + }, + { + "epoch": 2.247852760736196, + "grad_norm": 5.4627215261926105, + "learning_rate": 1.2665289256198346e-07, + "logits/chosen": -0.2255859375, + "logits/rejected": -0.36328125, + "logps/chosen": -480.0, + "logps/rejected": -416.0, + "loss": 0.0181, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.49609375, + "rewards/margins": 9.875, + "rewards/rejected": -9.375, + "step": 1832 + }, + { + "epoch": 2.249079754601227, + "grad_norm": 4.839645431062902, + "learning_rate": 1.2644628099173553e-07, + "logits/chosen": -0.279296875, + "logits/rejected": -0.484375, + "logps/chosen": -372.0, + "logps/rejected": -388.0, + "loss": 0.0227, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.416015625, + "rewards/margins": 10.125, + "rewards/rejected": -9.6875, + "step": 1833 + }, + { + "epoch": 2.2503067484662576, + "grad_norm": 4.305086956387641, + "learning_rate": 1.2623966942148758e-07, + "logits/chosen": -0.32421875, + "logits/rejected": -0.5234375, + "logps/chosen": -392.0, + "logps/rejected": -358.0, + "loss": 0.016, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.1845703125, + "rewards/margins": 9.375, + "rewards/rejected": -9.1875, + "step": 1834 + }, + { + "epoch": 2.2515337423312882, + "grad_norm": 4.297763467863586, + "learning_rate": 1.2603305785123965e-07, + "logits/chosen": -0.23046875, + "logits/rejected": -0.416015625, + "logps/chosen": -384.0, + "logps/rejected": -364.0, + "loss": 0.0155, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.040771484375, + "rewards/margins": 9.0625, + "rewards/rejected": -9.0, + "step": 1835 + }, + { + "epoch": 2.252760736196319, + "grad_norm": 9.17048388750303, + "learning_rate": 1.2582644628099173e-07, + "logits/chosen": -0.2138671875, + "logits/rejected": -0.396484375, + "logps/chosen": -338.0, + "logps/rejected": -308.0, + "loss": 0.0198, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.31640625, + "rewards/margins": 9.5625, + "rewards/rejected": -9.25, + "step": 1836 + }, + { + "epoch": 2.2539877300613496, + "grad_norm": 3.9722065307840535, + "learning_rate": 1.256198347107438e-07, + "logits/chosen": -0.361328125, + "logits/rejected": -0.447265625, + "logps/chosen": -388.0, + "logps/rejected": -396.0, + "loss": 0.013, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.24609375, + "rewards/margins": 9.25, + "rewards/rejected": -9.5, + "step": 1837 + }, + { + "epoch": 2.2552147239263802, + "grad_norm": 3.405796330817541, + "learning_rate": 1.2541322314049585e-07, + "logits/chosen": -0.330078125, + "logits/rejected": -0.5078125, + "logps/chosen": -422.0, + "logps/rejected": -394.0, + "loss": 0.0119, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.625, + "rewards/margins": 10.0625, + "rewards/rejected": -9.4375, + "step": 1838 + }, + { + "epoch": 2.256441717791411, + "grad_norm": 6.011368771014763, + "learning_rate": 1.2520661157024792e-07, + "logits/chosen": -0.1884765625, + "logits/rejected": -0.349609375, + "logps/chosen": -350.0, + "logps/rejected": -332.0, + "loss": 0.019, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.345703125, + "rewards/margins": 8.625, + "rewards/rejected": -8.9375, + "step": 1839 + }, + { + "epoch": 2.2576687116564416, + "grad_norm": 5.419929178897395, + "learning_rate": 1.25e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.435546875, + "logps/chosen": -430.0, + "logps/rejected": -374.0, + "loss": 0.0211, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.66015625, + "rewards/margins": 9.5, + "rewards/rejected": -8.875, + "step": 1840 + }, + { + "epoch": 2.2588957055214722, + "grad_norm": 7.688671443912321, + "learning_rate": 1.2479338842975207e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.5078125, + "logps/chosen": -434.0, + "logps/rejected": -378.0, + "loss": 0.0194, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.78125, + "rewards/margins": 9.5625, + "rewards/rejected": -8.8125, + "step": 1841 + }, + { + "epoch": 2.260122699386503, + "grad_norm": 3.8524443627573812, + "learning_rate": 1.2458677685950411e-07, + "logits/chosen": -0.310546875, + "logits/rejected": -0.53515625, + "logps/chosen": -362.0, + "logps/rejected": -364.0, + "loss": 0.02, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.041015625, + "rewards/margins": 9.8125, + "rewards/rejected": -9.8125, + "step": 1842 + }, + { + "epoch": 2.2613496932515336, + "grad_norm": 15.48327877065845, + "learning_rate": 1.243801652892562e-07, + "logits/chosen": -0.302734375, + "logits/rejected": -0.4296875, + "logps/chosen": -366.0, + "logps/rejected": -360.0, + "loss": 0.0399, + "rewards/accuracies": 0.984375, + "rewards/chosen": -0.11376953125, + "rewards/margins": 8.9375, + "rewards/rejected": -9.0625, + "step": 1843 + }, + { + "epoch": 2.2625766871165642, + "grad_norm": 4.956289249165779, + "learning_rate": 1.2417355371900826e-07, + "logits/chosen": -0.328125, + "logits/rejected": -0.486328125, + "logps/chosen": -412.0, + "logps/rejected": -410.0, + "loss": 0.0163, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.275390625, + "rewards/margins": 9.8125, + "rewards/rejected": -9.5625, + "step": 1844 + }, + { + "epoch": 2.263803680981595, + "grad_norm": 4.4762356663789955, + "learning_rate": 1.2396694214876034e-07, + "logits/chosen": -0.224609375, + "logits/rejected": -0.3828125, + "logps/chosen": -434.0, + "logps/rejected": -376.0, + "loss": 0.0152, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.7421875, + "rewards/margins": 9.375, + "rewards/rejected": -8.625, + "step": 1845 + }, + { + "epoch": 2.265030674846626, + "grad_norm": 5.967385254386135, + "learning_rate": 1.2376033057851238e-07, + "logits/chosen": -0.3359375, + "logits/rejected": -0.5546875, + "logps/chosen": -440.0, + "logps/rejected": -386.0, + "loss": 0.0219, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.298828125, + "rewards/margins": 9.6875, + "rewards/rejected": -9.375, + "step": 1846 + }, + { + "epoch": 2.2662576687116562, + "grad_norm": 4.604379263817608, + "learning_rate": 1.2355371900826446e-07, + "logits/chosen": -0.46484375, + "logits/rejected": -0.59765625, + "logps/chosen": -398.0, + "logps/rejected": -406.0, + "loss": 0.0216, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.80859375, + "rewards/margins": 10.125, + "rewards/rejected": -9.375, + "step": 1847 + }, + { + "epoch": 2.2674846625766873, + "grad_norm": 4.025842549166051, + "learning_rate": 1.2334710743801653e-07, + "logits/chosen": -0.197265625, + "logits/rejected": -0.396484375, + "logps/chosen": -422.0, + "logps/rejected": -374.0, + "loss": 0.0179, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.28125, + "rewards/margins": 9.6875, + "rewards/rejected": -8.375, + "step": 1848 + }, + { + "epoch": 2.2687116564417176, + "grad_norm": 4.048336426559366, + "learning_rate": 1.2314049586776858e-07, + "logits/chosen": -0.345703125, + "logits/rejected": -0.58203125, + "logps/chosen": -460.0, + "logps/rejected": -394.0, + "loss": 0.0117, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.1171875, + "rewards/margins": 11.0625, + "rewards/rejected": -9.9375, + "step": 1849 + }, + { + "epoch": 2.2699386503067487, + "grad_norm": 6.288058969937334, + "learning_rate": 1.2293388429752065e-07, + "logits/chosen": -0.333984375, + "logits/rejected": -0.56640625, + "logps/chosen": -424.0, + "logps/rejected": -372.0, + "loss": 0.0294, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.75, + "rewards/margins": 9.625, + "rewards/rejected": -8.875, + "step": 1850 + }, + { + "epoch": 2.271165644171779, + "grad_norm": 5.278325398098783, + "learning_rate": 1.2272727272727272e-07, + "logits/chosen": -0.18359375, + "logits/rejected": -0.392578125, + "logps/chosen": -368.0, + "logps/rejected": -382.0, + "loss": 0.017, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.201171875, + "rewards/margins": 9.625, + "rewards/rejected": -9.375, + "step": 1851 + }, + { + "epoch": 2.27239263803681, + "grad_norm": 4.442269405575828, + "learning_rate": 1.225206611570248e-07, + "logits/chosen": -0.18359375, + "logits/rejected": -0.392578125, + "logps/chosen": -450.0, + "logps/rejected": -412.0, + "loss": 0.0127, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.55859375, + "rewards/margins": 9.9375, + "rewards/rejected": -9.375, + "step": 1852 + }, + { + "epoch": 2.2736196319018402, + "grad_norm": 6.094932523074976, + "learning_rate": 1.2231404958677684e-07, + "logits/chosen": -0.0791015625, + "logits/rejected": -0.240234375, + "logps/chosen": -380.0, + "logps/rejected": -334.0, + "loss": 0.0226, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.12158203125, + "rewards/margins": 9.0, + "rewards/rejected": -9.125, + "step": 1853 + }, + { + "epoch": 2.2748466257668714, + "grad_norm": 4.252529523140967, + "learning_rate": 1.2210743801652892e-07, + "logits/chosen": -0.1806640625, + "logits/rejected": -0.32421875, + "logps/chosen": -358.0, + "logps/rejected": -342.0, + "loss": 0.0147, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.53125, + "rewards/margins": 9.4375, + "rewards/rejected": -8.9375, + "step": 1854 + }, + { + "epoch": 2.276073619631902, + "grad_norm": 3.966002587994711, + "learning_rate": 1.21900826446281e-07, + "logits/chosen": -0.291015625, + "logits/rejected": -0.4921875, + "logps/chosen": -442.0, + "logps/rejected": -378.0, + "loss": 0.0147, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6171875, + "rewards/margins": 10.3125, + "rewards/rejected": -9.6875, + "step": 1855 + }, + { + "epoch": 2.2773006134969327, + "grad_norm": 4.1424847709304355, + "learning_rate": 1.2169421487603307e-07, + "logits/chosen": -0.294921875, + "logits/rejected": -0.49609375, + "logps/chosen": -394.0, + "logps/rejected": -344.0, + "loss": 0.0148, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.7265625, + "rewards/margins": 10.125, + "rewards/rejected": -9.375, + "step": 1856 + }, + { + "epoch": 2.2785276073619634, + "grad_norm": 4.469381339585677, + "learning_rate": 1.214876033057851e-07, + "logits/chosen": -0.265625, + "logits/rejected": -0.447265625, + "logps/chosen": -360.0, + "logps/rejected": -324.0, + "loss": 0.0135, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.021728515625, + "rewards/margins": 9.4375, + "rewards/rejected": -9.4375, + "step": 1857 + }, + { + "epoch": 2.279754601226994, + "grad_norm": 4.068226344409849, + "learning_rate": 1.2128099173553719e-07, + "logits/chosen": -0.37890625, + "logits/rejected": -0.515625, + "logps/chosen": -382.0, + "logps/rejected": -394.0, + "loss": 0.0156, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.0654296875, + "rewards/margins": 10.125, + "rewards/rejected": -10.0625, + "step": 1858 + }, + { + "epoch": 2.2809815950920247, + "grad_norm": 6.253718534274674, + "learning_rate": 1.2107438016528923e-07, + "logits/chosen": -0.44140625, + "logits/rejected": -0.5859375, + "logps/chosen": -384.0, + "logps/rejected": -372.0, + "loss": 0.0221, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.54296875, + "rewards/margins": 10.0625, + "rewards/rejected": -9.5, + "step": 1859 + }, + { + "epoch": 2.2822085889570554, + "grad_norm": 7.2725718304640905, + "learning_rate": 1.208677685950413e-07, + "logits/chosen": -0.32421875, + "logits/rejected": -0.53125, + "logps/chosen": -412.0, + "logps/rejected": -390.0, + "loss": 0.0218, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4609375, + "rewards/margins": 9.4375, + "rewards/rejected": -8.9375, + "step": 1860 + }, + { + "epoch": 2.283435582822086, + "grad_norm": 6.470265580449715, + "learning_rate": 1.2066115702479338e-07, + "logits/chosen": -0.380859375, + "logits/rejected": -0.5390625, + "logps/chosen": -408.0, + "logps/rejected": -388.0, + "loss": 0.0227, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.039306640625, + "rewards/margins": 9.3125, + "rewards/rejected": -9.3125, + "step": 1861 + }, + { + "epoch": 2.2846625766871167, + "grad_norm": 8.255200630350702, + "learning_rate": 1.2045454545454545e-07, + "logits/chosen": -0.287109375, + "logits/rejected": -0.451171875, + "logps/chosen": -356.0, + "logps/rejected": -350.0, + "loss": 0.0237, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.28515625, + "rewards/margins": 9.25, + "rewards/rejected": -8.9375, + "step": 1862 + }, + { + "epoch": 2.2858895705521474, + "grad_norm": 4.0228052324371175, + "learning_rate": 1.2024793388429753e-07, + "logits/chosen": -0.294921875, + "logits/rejected": -0.3984375, + "logps/chosen": -430.0, + "logps/rejected": -384.0, + "loss": 0.0146, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5078125, + "rewards/margins": 9.6875, + "rewards/rejected": -9.125, + "step": 1863 + }, + { + "epoch": 2.287116564417178, + "grad_norm": 3.5940273595382157, + "learning_rate": 1.2004132231404957e-07, + "logits/chosen": -0.3359375, + "logits/rejected": -0.53125, + "logps/chosen": -430.0, + "logps/rejected": -406.0, + "loss": 0.0165, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.04638671875, + "rewards/margins": 9.875, + "rewards/rejected": -9.8125, + "step": 1864 + }, + { + "epoch": 2.2883435582822087, + "grad_norm": 4.523001230757999, + "learning_rate": 1.1983471074380165e-07, + "logits/chosen": -0.34375, + "logits/rejected": -0.447265625, + "logps/chosen": -392.0, + "logps/rejected": -378.0, + "loss": 0.0177, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.41015625, + "rewards/margins": 9.375, + "rewards/rejected": -9.0, + "step": 1865 + }, + { + "epoch": 2.2895705521472394, + "grad_norm": 5.4823026760417095, + "learning_rate": 1.1962809917355372e-07, + "logits/chosen": -0.291015625, + "logits/rejected": -0.53515625, + "logps/chosen": -390.0, + "logps/rejected": -372.0, + "loss": 0.0209, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.240234375, + "rewards/margins": 9.625, + "rewards/rejected": -9.875, + "step": 1866 + }, + { + "epoch": 2.29079754601227, + "grad_norm": 4.235306536487644, + "learning_rate": 1.1942148760330577e-07, + "logits/chosen": -0.125, + "logits/rejected": -0.279296875, + "logps/chosen": -346.0, + "logps/rejected": -350.0, + "loss": 0.02, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.470703125, + "rewards/margins": 10.125, + "rewards/rejected": -9.625, + "step": 1867 + }, + { + "epoch": 2.2920245398773007, + "grad_norm": 3.7516321764213365, + "learning_rate": 1.1921487603305784e-07, + "logits/chosen": -0.33203125, + "logits/rejected": -0.443359375, + "logps/chosen": -376.0, + "logps/rejected": -362.0, + "loss": 0.0124, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.109375, + "rewards/margins": 9.3125, + "rewards/rejected": -9.4375, + "step": 1868 + }, + { + "epoch": 2.2932515337423314, + "grad_norm": 5.054659253208865, + "learning_rate": 1.1900826446280992e-07, + "logits/chosen": -0.30859375, + "logits/rejected": -0.484375, + "logps/chosen": -414.0, + "logps/rejected": -374.0, + "loss": 0.0169, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.1025390625, + "rewards/margins": 9.1875, + "rewards/rejected": -9.0625, + "step": 1869 + }, + { + "epoch": 2.294478527607362, + "grad_norm": 3.833868040000152, + "learning_rate": 1.1880165289256199e-07, + "logits/chosen": -0.248046875, + "logits/rejected": -0.384765625, + "logps/chosen": -352.0, + "logps/rejected": -332.0, + "loss": 0.0119, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.047607421875, + "rewards/margins": 9.75, + "rewards/rejected": -9.6875, + "step": 1870 + }, + { + "epoch": 2.2957055214723927, + "grad_norm": 6.31057654248971, + "learning_rate": 1.1859504132231405e-07, + "logits/chosen": -0.27734375, + "logits/rejected": -0.396484375, + "logps/chosen": -394.0, + "logps/rejected": -350.0, + "loss": 0.0182, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.06884765625, + "rewards/margins": 9.25, + "rewards/rejected": -9.3125, + "step": 1871 + }, + { + "epoch": 2.2969325153374234, + "grad_norm": 3.4986960364666646, + "learning_rate": 1.1838842975206611e-07, + "logits/chosen": -0.373046875, + "logits/rejected": -0.462890625, + "logps/chosen": -414.0, + "logps/rejected": -394.0, + "loss": 0.0114, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.7421875, + "rewards/margins": 10.375, + "rewards/rejected": -9.625, + "step": 1872 + }, + { + "epoch": 2.298159509202454, + "grad_norm": 4.159250770394041, + "learning_rate": 1.1818181818181817e-07, + "logits/chosen": -0.2109375, + "logits/rejected": -0.2890625, + "logps/chosen": -372.0, + "logps/rejected": -354.0, + "loss": 0.0152, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.28125, + "rewards/margins": 8.6875, + "rewards/rejected": -9.0, + "step": 1873 + }, + { + "epoch": 2.2993865030674847, + "grad_norm": 5.169157572431984, + "learning_rate": 1.1797520661157024e-07, + "logits/chosen": -0.310546875, + "logits/rejected": -0.5625, + "logps/chosen": -444.0, + "logps/rejected": -396.0, + "loss": 0.0146, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.7734375, + "rewards/margins": 10.6875, + "rewards/rejected": -9.9375, + "step": 1874 + }, + { + "epoch": 2.3006134969325154, + "grad_norm": 4.021053731215981, + "learning_rate": 1.177685950413223e-07, + "logits/chosen": -0.28515625, + "logits/rejected": -0.482421875, + "logps/chosen": -396.0, + "logps/rejected": -374.0, + "loss": 0.0131, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.439453125, + "rewards/margins": 10.25, + "rewards/rejected": -10.6875, + "step": 1875 + }, + { + "epoch": 2.301840490797546, + "grad_norm": 6.582060986858026, + "learning_rate": 1.1756198347107438e-07, + "logits/chosen": -0.263671875, + "logits/rejected": -0.458984375, + "logps/chosen": -460.0, + "logps/rejected": -390.0, + "loss": 0.0207, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.53515625, + "rewards/margins": 10.1875, + "rewards/rejected": -9.625, + "step": 1876 + }, + { + "epoch": 2.3030674846625767, + "grad_norm": 4.966548066872626, + "learning_rate": 1.1735537190082644e-07, + "logits/chosen": -0.1533203125, + "logits/rejected": -0.345703125, + "logps/chosen": -388.0, + "logps/rejected": -356.0, + "loss": 0.0178, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.400390625, + "rewards/margins": 8.8125, + "rewards/rejected": -8.4375, + "step": 1877 + }, + { + "epoch": 2.3042944785276074, + "grad_norm": 7.769689504179184, + "learning_rate": 1.1714876033057851e-07, + "logits/chosen": -0.341796875, + "logits/rejected": -0.5859375, + "logps/chosen": -382.0, + "logps/rejected": -372.0, + "loss": 0.0207, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.3203125, + "rewards/margins": 9.375, + "rewards/rejected": -9.0625, + "step": 1878 + }, + { + "epoch": 2.305521472392638, + "grad_norm": 6.636300479603842, + "learning_rate": 1.1694214876033057e-07, + "logits/chosen": -0.26171875, + "logits/rejected": -0.51171875, + "logps/chosen": -420.0, + "logps/rejected": -368.0, + "loss": 0.0249, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.06787109375, + "rewards/margins": 9.5, + "rewards/rejected": -9.4375, + "step": 1879 + }, + { + "epoch": 2.3067484662576687, + "grad_norm": 5.903557273764698, + "learning_rate": 1.1673553719008265e-07, + "logits/chosen": -0.28515625, + "logits/rejected": -0.5078125, + "logps/chosen": -434.0, + "logps/rejected": -386.0, + "loss": 0.0178, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.80078125, + "rewards/margins": 9.6875, + "rewards/rejected": -8.9375, + "step": 1880 + }, + { + "epoch": 2.3079754601226994, + "grad_norm": 5.693936314370452, + "learning_rate": 1.165289256198347e-07, + "logits/chosen": -0.287109375, + "logits/rejected": -0.44921875, + "logps/chosen": -428.0, + "logps/rejected": -400.0, + "loss": 0.0188, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6796875, + "rewards/margins": 9.3125, + "rewards/rejected": -8.625, + "step": 1881 + }, + { + "epoch": 2.30920245398773, + "grad_norm": 5.74963593239503, + "learning_rate": 1.1632231404958677e-07, + "logits/chosen": -0.3515625, + "logits/rejected": -0.455078125, + "logps/chosen": -416.0, + "logps/rejected": -384.0, + "loss": 0.0222, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.08056640625, + "rewards/margins": 9.625, + "rewards/rejected": -9.5625, + "step": 1882 + }, + { + "epoch": 2.3104294478527607, + "grad_norm": 7.823205340929679, + "learning_rate": 1.1611570247933884e-07, + "logits/chosen": -0.216796875, + "logits/rejected": -0.375, + "logps/chosen": -356.0, + "logps/rejected": -306.0, + "loss": 0.0237, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.1689453125, + "rewards/margins": 8.4375, + "rewards/rejected": -8.625, + "step": 1883 + }, + { + "epoch": 2.3116564417177914, + "grad_norm": 4.898170979659046, + "learning_rate": 1.159090909090909e-07, + "logits/chosen": -0.1953125, + "logits/rejected": -0.34375, + "logps/chosen": -382.0, + "logps/rejected": -364.0, + "loss": 0.0192, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.36328125, + "rewards/margins": 9.5, + "rewards/rejected": -9.125, + "step": 1884 + }, + { + "epoch": 2.312883435582822, + "grad_norm": 13.12174672369411, + "learning_rate": 1.1570247933884297e-07, + "logits/chosen": -0.287109375, + "logits/rejected": -0.4609375, + "logps/chosen": -368.0, + "logps/rejected": -368.0, + "loss": 0.0286, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.140625, + "rewards/margins": 9.75, + "rewards/rejected": -9.9375, + "step": 1885 + }, + { + "epoch": 2.3141104294478527, + "grad_norm": 4.496896900756331, + "learning_rate": 1.1549586776859503e-07, + "logits/chosen": -0.2236328125, + "logits/rejected": -0.38671875, + "logps/chosen": -384.0, + "logps/rejected": -374.0, + "loss": 0.0139, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.0252685546875, + "rewards/margins": 9.75, + "rewards/rejected": -9.75, + "step": 1886 + }, + { + "epoch": 2.3153374233128834, + "grad_norm": 5.478516102618331, + "learning_rate": 1.1528925619834711e-07, + "logits/chosen": -0.265625, + "logits/rejected": -0.4375, + "logps/chosen": -446.0, + "logps/rejected": -436.0, + "loss": 0.0181, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.0047607421875, + "rewards/margins": 9.6875, + "rewards/rejected": -9.6875, + "step": 1887 + }, + { + "epoch": 2.316564417177914, + "grad_norm": 4.664529355297077, + "learning_rate": 1.1508264462809917e-07, + "logits/chosen": -0.275390625, + "logits/rejected": -0.515625, + "logps/chosen": -428.0, + "logps/rejected": -394.0, + "loss": 0.0191, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.10302734375, + "rewards/margins": 10.375, + "rewards/rejected": -10.3125, + "step": 1888 + }, + { + "epoch": 2.3177914110429447, + "grad_norm": 4.217017598926788, + "learning_rate": 1.1487603305785123e-07, + "logits/chosen": -0.326171875, + "logits/rejected": -0.494140625, + "logps/chosen": -390.0, + "logps/rejected": -376.0, + "loss": 0.0154, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.045654296875, + "rewards/margins": 9.75, + "rewards/rejected": -9.6875, + "step": 1889 + }, + { + "epoch": 2.3190184049079754, + "grad_norm": 4.286279130148845, + "learning_rate": 1.146694214876033e-07, + "logits/chosen": -0.265625, + "logits/rejected": -0.5234375, + "logps/chosen": -432.0, + "logps/rejected": -372.0, + "loss": 0.0149, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.296875, + "rewards/margins": 9.625, + "rewards/rejected": -9.3125, + "step": 1890 + }, + { + "epoch": 2.320245398773006, + "grad_norm": 5.286567126241354, + "learning_rate": 1.1446280991735536e-07, + "logits/chosen": -0.375, + "logits/rejected": -0.515625, + "logps/chosen": -358.0, + "logps/rejected": -360.0, + "loss": 0.0204, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.94140625, + "rewards/margins": 9.0, + "rewards/rejected": -9.9375, + "step": 1891 + }, + { + "epoch": 2.3214723926380367, + "grad_norm": 5.365017096665431, + "learning_rate": 1.1425619834710744e-07, + "logits/chosen": -0.326171875, + "logits/rejected": -0.51171875, + "logps/chosen": -426.0, + "logps/rejected": -388.0, + "loss": 0.0174, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.177734375, + "rewards/margins": 10.1875, + "rewards/rejected": -10.0, + "step": 1892 + }, + { + "epoch": 2.3226993865030674, + "grad_norm": 8.751696752064426, + "learning_rate": 1.140495867768595e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.478515625, + "logps/chosen": -392.0, + "logps/rejected": -356.0, + "loss": 0.0214, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.154296875, + "rewards/margins": 9.5, + "rewards/rejected": -9.3125, + "step": 1893 + }, + { + "epoch": 2.323926380368098, + "grad_norm": 4.8514425198609334, + "learning_rate": 1.1384297520661157e-07, + "logits/chosen": -0.298828125, + "logits/rejected": -0.466796875, + "logps/chosen": -416.0, + "logps/rejected": -392.0, + "loss": 0.0158, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.1640625, + "rewards/margins": 9.0, + "rewards/rejected": -9.1875, + "step": 1894 + }, + { + "epoch": 2.3251533742331287, + "grad_norm": 3.4384274214237225, + "learning_rate": 1.1363636363636363e-07, + "logits/chosen": -0.28515625, + "logits/rejected": -0.361328125, + "logps/chosen": -400.0, + "logps/rejected": -366.0, + "loss": 0.0146, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.181640625, + "rewards/margins": 9.8125, + "rewards/rejected": -10.0, + "step": 1895 + }, + { + "epoch": 2.3263803680981594, + "grad_norm": 5.010652343034374, + "learning_rate": 1.134297520661157e-07, + "logits/chosen": -0.248046875, + "logits/rejected": -0.3984375, + "logps/chosen": -370.0, + "logps/rejected": -376.0, + "loss": 0.0244, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.3515625, + "rewards/margins": 9.9375, + "rewards/rejected": -9.625, + "step": 1896 + }, + { + "epoch": 2.32760736196319, + "grad_norm": 5.43718048958515, + "learning_rate": 1.1322314049586776e-07, + "logits/chosen": -0.388671875, + "logits/rejected": -0.54296875, + "logps/chosen": -396.0, + "logps/rejected": -376.0, + "loss": 0.0179, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5234375, + "rewards/margins": 9.9375, + "rewards/rejected": -9.375, + "step": 1897 + }, + { + "epoch": 2.3288343558282207, + "grad_norm": 7.395293738583648, + "learning_rate": 1.1301652892561982e-07, + "logits/chosen": -0.318359375, + "logits/rejected": -0.388671875, + "logps/chosen": -376.0, + "logps/rejected": -370.0, + "loss": 0.0245, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.9453125, + "rewards/margins": 9.0, + "rewards/rejected": -9.9375, + "step": 1898 + }, + { + "epoch": 2.3300613496932514, + "grad_norm": 4.777953761793094, + "learning_rate": 1.1280991735537188e-07, + "logits/chosen": -0.158203125, + "logits/rejected": -0.3125, + "logps/chosen": -400.0, + "logps/rejected": -372.0, + "loss": 0.0206, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -1.0234375, + "rewards/margins": 9.125, + "rewards/rejected": -10.125, + "step": 1899 + }, + { + "epoch": 2.331288343558282, + "grad_norm": 5.990655430536018, + "learning_rate": 1.1260330578512396e-07, + "logits/chosen": -0.240234375, + "logits/rejected": -0.40234375, + "logps/chosen": -408.0, + "logps/rejected": -358.0, + "loss": 0.0224, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.060791015625, + "rewards/margins": 9.0625, + "rewards/rejected": -9.0, + "step": 1900 + }, + { + "epoch": 2.3325153374233127, + "grad_norm": 4.345294104400046, + "learning_rate": 1.1239669421487603e-07, + "logits/chosen": -0.408203125, + "logits/rejected": -0.54296875, + "logps/chosen": -376.0, + "logps/rejected": -384.0, + "loss": 0.014, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.21875, + "rewards/margins": 10.1875, + "rewards/rejected": -9.9375, + "step": 1901 + }, + { + "epoch": 2.3337423312883434, + "grad_norm": 6.771766034538752, + "learning_rate": 1.1219008264462809e-07, + "logits/chosen": -0.1513671875, + "logits/rejected": -0.3671875, + "logps/chosen": -444.0, + "logps/rejected": -414.0, + "loss": 0.0165, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.375, + "rewards/margins": 9.25, + "rewards/rejected": -8.875, + "step": 1902 + }, + { + "epoch": 2.334969325153374, + "grad_norm": 13.579036068622795, + "learning_rate": 1.1198347107438017e-07, + "logits/chosen": -0.310546875, + "logits/rejected": -0.5234375, + "logps/chosen": -402.0, + "logps/rejected": -400.0, + "loss": 0.0238, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.6796875, + "rewards/margins": 10.875, + "rewards/rejected": -10.1875, + "step": 1903 + }, + { + "epoch": 2.3361963190184047, + "grad_norm": 5.463165834232385, + "learning_rate": 1.1177685950413223e-07, + "logits/chosen": -0.2109375, + "logits/rejected": -0.40625, + "logps/chosen": -400.0, + "logps/rejected": -374.0, + "loss": 0.0155, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.51953125, + "rewards/margins": 9.5625, + "rewards/rejected": -9.0625, + "step": 1904 + }, + { + "epoch": 2.3374233128834354, + "grad_norm": 3.841921859696376, + "learning_rate": 1.115702479338843e-07, + "logits/chosen": -0.3125, + "logits/rejected": -0.486328125, + "logps/chosen": -422.0, + "logps/rejected": -424.0, + "loss": 0.0116, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.62109375, + "rewards/margins": 10.625, + "rewards/rejected": -10.0, + "step": 1905 + }, + { + "epoch": 2.338650306748466, + "grad_norm": 5.34146187315824, + "learning_rate": 1.1136363636363636e-07, + "logits/chosen": -0.306640625, + "logits/rejected": -0.455078125, + "logps/chosen": -344.0, + "logps/rejected": -376.0, + "loss": 0.0224, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.4765625, + "rewards/margins": 9.125, + "rewards/rejected": -9.625, + "step": 1906 + }, + { + "epoch": 2.3398773006134967, + "grad_norm": 5.73390901630304, + "learning_rate": 1.1115702479338842e-07, + "logits/chosen": -0.41015625, + "logits/rejected": -0.6328125, + "logps/chosen": -394.0, + "logps/rejected": -378.0, + "loss": 0.019, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.57421875, + "rewards/margins": 10.1875, + "rewards/rejected": -9.625, + "step": 1907 + }, + { + "epoch": 2.3411042944785274, + "grad_norm": 3.228303967821765, + "learning_rate": 1.1095041322314048e-07, + "logits/chosen": -0.3125, + "logits/rejected": -0.484375, + "logps/chosen": -396.0, + "logps/rejected": -372.0, + "loss": 0.0102, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.306640625, + "rewards/margins": 10.25, + "rewards/rejected": -9.9375, + "step": 1908 + }, + { + "epoch": 2.3423312883435585, + "grad_norm": 4.866165071197186, + "learning_rate": 1.1074380165289255e-07, + "logits/chosen": -0.36328125, + "logits/rejected": -0.546875, + "logps/chosen": -430.0, + "logps/rejected": -382.0, + "loss": 0.017, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.625, + "rewards/margins": 10.625, + "rewards/rejected": -9.0, + "step": 1909 + }, + { + "epoch": 2.3435582822085887, + "grad_norm": 3.8143534686857072, + "learning_rate": 1.1053719008264463e-07, + "logits/chosen": -0.287109375, + "logits/rejected": -0.4375, + "logps/chosen": -404.0, + "logps/rejected": -386.0, + "loss": 0.015, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.578125, + "rewards/margins": 9.375, + "rewards/rejected": -8.75, + "step": 1910 + }, + { + "epoch": 2.34478527607362, + "grad_norm": 6.697549502554224, + "learning_rate": 1.1033057851239669e-07, + "logits/chosen": -0.30859375, + "logits/rejected": -0.498046875, + "logps/chosen": -396.0, + "logps/rejected": -364.0, + "loss": 0.0322, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.17578125, + "rewards/margins": 9.4375, + "rewards/rejected": -9.25, + "step": 1911 + }, + { + "epoch": 2.34601226993865, + "grad_norm": 8.531636819528389, + "learning_rate": 1.1012396694214876e-07, + "logits/chosen": -0.361328125, + "logits/rejected": -0.44140625, + "logps/chosen": -404.0, + "logps/rejected": -384.0, + "loss": 0.0295, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.00946044921875, + "rewards/margins": 8.9375, + "rewards/rejected": -8.9375, + "step": 1912 + }, + { + "epoch": 2.347239263803681, + "grad_norm": 5.898173850181046, + "learning_rate": 1.0991735537190082e-07, + "logits/chosen": -0.326171875, + "logits/rejected": -0.5859375, + "logps/chosen": -380.0, + "logps/rejected": -332.0, + "loss": 0.0199, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.09228515625, + "rewards/margins": 9.4375, + "rewards/rejected": -9.3125, + "step": 1913 + }, + { + "epoch": 2.3484662576687114, + "grad_norm": 4.2012176654997075, + "learning_rate": 1.097107438016529e-07, + "logits/chosen": -0.37109375, + "logits/rejected": -0.54296875, + "logps/chosen": -358.0, + "logps/rejected": -340.0, + "loss": 0.0151, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.12060546875, + "rewards/margins": 9.5, + "rewards/rejected": -9.375, + "step": 1914 + }, + { + "epoch": 2.3496932515337425, + "grad_norm": 4.4167733485093335, + "learning_rate": 1.0950413223140496e-07, + "logits/chosen": -0.32421875, + "logits/rejected": -0.50390625, + "logps/chosen": -416.0, + "logps/rejected": -394.0, + "loss": 0.0112, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.9765625, + "rewards/margins": 10.6875, + "rewards/rejected": -9.6875, + "step": 1915 + }, + { + "epoch": 2.3509202453987728, + "grad_norm": 5.307827306333487, + "learning_rate": 1.0929752066115702e-07, + "logits/chosen": -0.234375, + "logits/rejected": -0.384765625, + "logps/chosen": -434.0, + "logps/rejected": -376.0, + "loss": 0.0195, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.26171875, + "rewards/margins": 9.6875, + "rewards/rejected": -9.375, + "step": 1916 + }, + { + "epoch": 2.352147239263804, + "grad_norm": 4.922689147078711, + "learning_rate": 1.0909090909090908e-07, + "logits/chosen": -0.3203125, + "logits/rejected": -0.5703125, + "logps/chosen": -396.0, + "logps/rejected": -372.0, + "loss": 0.0154, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.9453125, + "rewards/margins": 10.375, + "rewards/rejected": -9.375, + "step": 1917 + }, + { + "epoch": 2.3533742331288345, + "grad_norm": 7.760854210017015, + "learning_rate": 1.0888429752066115e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.52734375, + "logps/chosen": -412.0, + "logps/rejected": -392.0, + "loss": 0.0314, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.11962890625, + "rewards/margins": 10.75, + "rewards/rejected": -10.625, + "step": 1918 + }, + { + "epoch": 2.354601226993865, + "grad_norm": 6.6541490716729506, + "learning_rate": 1.0867768595041321e-07, + "logits/chosen": -0.25390625, + "logits/rejected": -0.455078125, + "logps/chosen": -388.0, + "logps/rejected": -380.0, + "loss": 0.0306, + "rewards/accuracies": 0.984375, + "rewards/chosen": -0.140625, + "rewards/margins": 9.375, + "rewards/rejected": -9.5625, + "step": 1919 + }, + { + "epoch": 2.355828220858896, + "grad_norm": 7.411810067387336, + "learning_rate": 1.0847107438016528e-07, + "logits/chosen": -0.376953125, + "logits/rejected": -0.54296875, + "logps/chosen": -392.0, + "logps/rejected": -386.0, + "loss": 0.0256, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.2333984375, + "rewards/margins": 9.8125, + "rewards/rejected": -9.5625, + "step": 1920 + }, + { + "epoch": 2.3570552147239265, + "grad_norm": 5.365707675019068, + "learning_rate": 1.0826446280991736e-07, + "logits/chosen": -0.3046875, + "logits/rejected": -0.484375, + "logps/chosen": -378.0, + "logps/rejected": -376.0, + "loss": 0.0164, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.41796875, + "rewards/margins": 10.3125, + "rewards/rejected": -9.875, + "step": 1921 + }, + { + "epoch": 2.358282208588957, + "grad_norm": 3.866564614703734, + "learning_rate": 1.0805785123966942e-07, + "logits/chosen": -0.2470703125, + "logits/rejected": -0.38671875, + "logps/chosen": -348.0, + "logps/rejected": -342.0, + "loss": 0.0151, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.2412109375, + "rewards/margins": 9.5, + "rewards/rejected": -9.25, + "step": 1922 + }, + { + "epoch": 2.359509202453988, + "grad_norm": 4.446698301438392, + "learning_rate": 1.0785123966942149e-07, + "logits/chosen": -0.3671875, + "logits/rejected": -0.640625, + "logps/chosen": -386.0, + "logps/rejected": -376.0, + "loss": 0.0141, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.357421875, + "rewards/margins": 10.125, + "rewards/rejected": -9.75, + "step": 1923 + }, + { + "epoch": 2.3607361963190185, + "grad_norm": 3.9572872632005396, + "learning_rate": 1.0764462809917355e-07, + "logits/chosen": -0.228515625, + "logits/rejected": -0.44921875, + "logps/chosen": -404.0, + "logps/rejected": -380.0, + "loss": 0.0148, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.171875, + "rewards/margins": 10.125, + "rewards/rejected": -8.9375, + "step": 1924 + }, + { + "epoch": 2.361963190184049, + "grad_norm": 4.845225866152578, + "learning_rate": 1.0743801652892561e-07, + "logits/chosen": -0.169921875, + "logits/rejected": -0.32421875, + "logps/chosen": -386.0, + "logps/rejected": -368.0, + "loss": 0.0172, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.053466796875, + "rewards/margins": 9.0625, + "rewards/rejected": -9.0, + "step": 1925 + }, + { + "epoch": 2.36319018404908, + "grad_norm": 3.6925602562903648, + "learning_rate": 1.0723140495867767e-07, + "logits/chosen": -0.3828125, + "logits/rejected": -0.59765625, + "logps/chosen": -400.0, + "logps/rejected": -408.0, + "loss": 0.0108, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.44921875, + "rewards/margins": 10.4375, + "rewards/rejected": -10.0, + "step": 1926 + }, + { + "epoch": 2.3644171779141105, + "grad_norm": 5.484421296785847, + "learning_rate": 1.0702479338842975e-07, + "logits/chosen": -0.267578125, + "logits/rejected": -0.427734375, + "logps/chosen": -406.0, + "logps/rejected": -370.0, + "loss": 0.0165, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6171875, + "rewards/margins": 10.1875, + "rewards/rejected": -9.5625, + "step": 1927 + }, + { + "epoch": 2.365644171779141, + "grad_norm": 4.710618826658171, + "learning_rate": 1.068181818181818e-07, + "logits/chosen": -0.2431640625, + "logits/rejected": -0.54296875, + "logps/chosen": -398.0, + "logps/rejected": -372.0, + "loss": 0.0178, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6640625, + "rewards/margins": 10.3125, + "rewards/rejected": -9.6875, + "step": 1928 + }, + { + "epoch": 2.366871165644172, + "grad_norm": 5.13477483786115, + "learning_rate": 1.0661157024793388e-07, + "logits/chosen": -0.2470703125, + "logits/rejected": -0.46875, + "logps/chosen": -406.0, + "logps/rejected": -384.0, + "loss": 0.0232, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.1259765625, + "rewards/margins": 9.6875, + "rewards/rejected": -9.8125, + "step": 1929 + }, + { + "epoch": 2.3680981595092025, + "grad_norm": 3.211467170037565, + "learning_rate": 1.0640495867768595e-07, + "logits/chosen": -0.26171875, + "logits/rejected": -0.48046875, + "logps/chosen": -394.0, + "logps/rejected": -372.0, + "loss": 0.0119, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.11572265625, + "rewards/margins": 9.375, + "rewards/rejected": -9.5, + "step": 1930 + }, + { + "epoch": 2.369325153374233, + "grad_norm": 6.322565190897538, + "learning_rate": 1.0619834710743801e-07, + "logits/chosen": -0.30078125, + "logits/rejected": -0.431640625, + "logps/chosen": -380.0, + "logps/rejected": -370.0, + "loss": 0.017, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.251953125, + "rewards/margins": 9.4375, + "rewards/rejected": -9.6875, + "step": 1931 + }, + { + "epoch": 2.370552147239264, + "grad_norm": 4.673588612933272, + "learning_rate": 1.0599173553719009e-07, + "logits/chosen": -0.2294921875, + "logits/rejected": -0.369140625, + "logps/chosen": -380.0, + "logps/rejected": -412.0, + "loss": 0.0166, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.26171875, + "rewards/margins": 9.4375, + "rewards/rejected": -9.1875, + "step": 1932 + }, + { + "epoch": 2.3717791411042946, + "grad_norm": 4.614377010496672, + "learning_rate": 1.0578512396694215e-07, + "logits/chosen": -0.1376953125, + "logits/rejected": -0.35546875, + "logps/chosen": -398.0, + "logps/rejected": -342.0, + "loss": 0.016, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.25390625, + "rewards/margins": 8.5625, + "rewards/rejected": -8.3125, + "step": 1933 + }, + { + "epoch": 2.373006134969325, + "grad_norm": 5.431349762528029, + "learning_rate": 1.0557851239669421e-07, + "logits/chosen": -0.251953125, + "logits/rejected": -0.43359375, + "logps/chosen": -438.0, + "logps/rejected": -416.0, + "loss": 0.0172, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.193359375, + "rewards/margins": 10.0, + "rewards/rejected": -9.8125, + "step": 1934 + }, + { + "epoch": 2.374233128834356, + "grad_norm": 3.838161519427266, + "learning_rate": 1.0537190082644627e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.466796875, + "logps/chosen": -400.0, + "logps/rejected": -372.0, + "loss": 0.0127, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.54296875, + "rewards/margins": 10.6875, + "rewards/rejected": -10.125, + "step": 1935 + }, + { + "epoch": 2.3754601226993866, + "grad_norm": 4.134657349163537, + "learning_rate": 1.0516528925619834e-07, + "logits/chosen": -0.328125, + "logits/rejected": -0.43359375, + "logps/chosen": -342.0, + "logps/rejected": -368.0, + "loss": 0.0189, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.15625, + "rewards/margins": 9.5625, + "rewards/rejected": -9.75, + "step": 1936 + }, + { + "epoch": 2.3766871165644172, + "grad_norm": 4.9760010170902405, + "learning_rate": 1.049586776859504e-07, + "logits/chosen": -0.23046875, + "logits/rejected": -0.400390625, + "logps/chosen": -404.0, + "logps/rejected": -360.0, + "loss": 0.0174, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.3046875, + "rewards/margins": 9.625, + "rewards/rejected": -9.3125, + "step": 1937 + }, + { + "epoch": 2.377914110429448, + "grad_norm": 4.623715406258195, + "learning_rate": 1.0475206611570248e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.3671875, + "logps/chosen": -404.0, + "logps/rejected": -408.0, + "loss": 0.0145, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.2216796875, + "rewards/margins": 10.1875, + "rewards/rejected": -10.0, + "step": 1938 + }, + { + "epoch": 2.3791411042944786, + "grad_norm": 5.867371017101037, + "learning_rate": 1.0454545454545454e-07, + "logits/chosen": -0.41015625, + "logits/rejected": -0.59375, + "logps/chosen": -394.0, + "logps/rejected": -384.0, + "loss": 0.0169, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.341796875, + "rewards/margins": 10.5625, + "rewards/rejected": -10.25, + "step": 1939 + }, + { + "epoch": 2.3803680981595092, + "grad_norm": 4.371367671117423, + "learning_rate": 1.0433884297520661e-07, + "logits/chosen": -0.2431640625, + "logits/rejected": -0.361328125, + "logps/chosen": -384.0, + "logps/rejected": -364.0, + "loss": 0.0178, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.1025390625, + "rewards/margins": 8.875, + "rewards/rejected": -8.8125, + "step": 1940 + }, + { + "epoch": 2.38159509202454, + "grad_norm": 5.687841360188196, + "learning_rate": 1.0413223140495868e-07, + "logits/chosen": -0.30859375, + "logits/rejected": -0.48046875, + "logps/chosen": -416.0, + "logps/rejected": -374.0, + "loss": 0.0178, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.2470703125, + "rewards/margins": 9.9375, + "rewards/rejected": -9.6875, + "step": 1941 + }, + { + "epoch": 2.3828220858895706, + "grad_norm": 10.988123416995014, + "learning_rate": 1.0392561983471074e-07, + "logits/chosen": -0.15234375, + "logits/rejected": -0.349609375, + "logps/chosen": -380.0, + "logps/rejected": -348.0, + "loss": 0.0341, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.306640625, + "rewards/margins": 8.75, + "rewards/rejected": -9.0625, + "step": 1942 + }, + { + "epoch": 2.3840490797546012, + "grad_norm": 5.436888827475886, + "learning_rate": 1.037190082644628e-07, + "logits/chosen": -0.35546875, + "logits/rejected": -0.55078125, + "logps/chosen": -448.0, + "logps/rejected": -398.0, + "loss": 0.0147, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.203125, + "rewards/margins": 10.625, + "rewards/rejected": -9.4375, + "step": 1943 + }, + { + "epoch": 2.385276073619632, + "grad_norm": 6.382938975353642, + "learning_rate": 1.0351239669421486e-07, + "logits/chosen": -0.34375, + "logits/rejected": -0.4609375, + "logps/chosen": -396.0, + "logps/rejected": -388.0, + "loss": 0.0202, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.003570556640625, + "rewards/margins": 9.625, + "rewards/rejected": -9.625, + "step": 1944 + }, + { + "epoch": 2.3865030674846626, + "grad_norm": 4.270560436372214, + "learning_rate": 1.0330578512396694e-07, + "logits/chosen": -0.349609375, + "logits/rejected": -0.6015625, + "logps/chosen": -428.0, + "logps/rejected": -386.0, + "loss": 0.0116, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.4140625, + "rewards/margins": 10.875, + "rewards/rejected": -9.4375, + "step": 1945 + }, + { + "epoch": 2.3877300613496932, + "grad_norm": 3.8280147575003, + "learning_rate": 1.03099173553719e-07, + "logits/chosen": -0.1044921875, + "logits/rejected": -0.310546875, + "logps/chosen": -394.0, + "logps/rejected": -370.0, + "loss": 0.0191, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.1162109375, + "rewards/margins": 8.875, + "rewards/rejected": -9.0, + "step": 1946 + }, + { + "epoch": 2.388957055214724, + "grad_norm": 3.759291376263858, + "learning_rate": 1.0289256198347107e-07, + "logits/chosen": -0.3671875, + "logits/rejected": -0.57421875, + "logps/chosen": -412.0, + "logps/rejected": -362.0, + "loss": 0.0112, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.58984375, + "rewards/margins": 10.25, + "rewards/rejected": -9.6875, + "step": 1947 + }, + { + "epoch": 2.3901840490797546, + "grad_norm": 5.10226310093131, + "learning_rate": 1.0268595041322313e-07, + "logits/chosen": -0.23046875, + "logits/rejected": -0.416015625, + "logps/chosen": -408.0, + "logps/rejected": -354.0, + "loss": 0.0159, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.49609375, + "rewards/margins": 9.3125, + "rewards/rejected": -8.875, + "step": 1948 + }, + { + "epoch": 2.3914110429447852, + "grad_norm": 3.861242196744785, + "learning_rate": 1.024793388429752e-07, + "logits/chosen": -0.236328125, + "logits/rejected": -0.478515625, + "logps/chosen": -418.0, + "logps/rejected": -400.0, + "loss": 0.0143, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.208984375, + "rewards/margins": 10.125, + "rewards/rejected": -9.875, + "step": 1949 + }, + { + "epoch": 2.392638036809816, + "grad_norm": 3.27506219696791, + "learning_rate": 1.0227272727272728e-07, + "logits/chosen": -0.23828125, + "logits/rejected": -0.357421875, + "logps/chosen": -380.0, + "logps/rejected": -488.0, + "loss": 0.0161, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.0009765625, + "rewards/margins": 21.375, + "rewards/rejected": -21.375, + "step": 1950 + }, + { + "epoch": 2.3938650306748466, + "grad_norm": 6.359347573891212, + "learning_rate": 1.0206611570247934e-07, + "logits/chosen": -0.1064453125, + "logits/rejected": -0.29296875, + "logps/chosen": -392.0, + "logps/rejected": -312.0, + "loss": 0.0287, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.5546875, + "rewards/margins": 7.4375, + "rewards/rejected": -8.0, + "step": 1951 + }, + { + "epoch": 2.3950920245398772, + "grad_norm": 6.604429042236883, + "learning_rate": 1.018595041322314e-07, + "logits/chosen": -0.265625, + "logits/rejected": -0.443359375, + "logps/chosen": -436.0, + "logps/rejected": -404.0, + "loss": 0.0235, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.1630859375, + "rewards/margins": 9.5, + "rewards/rejected": -9.625, + "step": 1952 + }, + { + "epoch": 2.396319018404908, + "grad_norm": 3.3336992655497895, + "learning_rate": 1.0165289256198346e-07, + "logits/chosen": -0.19140625, + "logits/rejected": -0.43359375, + "logps/chosen": -390.0, + "logps/rejected": -382.0, + "loss": 0.0113, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.061767578125, + "rewards/margins": 9.875, + "rewards/rejected": -9.9375, + "step": 1953 + }, + { + "epoch": 2.3975460122699386, + "grad_norm": 3.686003545492463, + "learning_rate": 1.0144628099173553e-07, + "logits/chosen": -0.31640625, + "logits/rejected": -0.41796875, + "logps/chosen": -384.0, + "logps/rejected": -390.0, + "loss": 0.0118, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.66015625, + "rewards/margins": 10.4375, + "rewards/rejected": -9.8125, + "step": 1954 + }, + { + "epoch": 2.3987730061349692, + "grad_norm": 3.3059905000108643, + "learning_rate": 1.012396694214876e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.46875, + "logps/chosen": -448.0, + "logps/rejected": -390.0, + "loss": 0.0162, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.46875, + "rewards/margins": 9.8125, + "rewards/rejected": -9.375, + "step": 1955 + }, + { + "epoch": 2.4, + "grad_norm": 4.062671556509122, + "learning_rate": 1.0103305785123967e-07, + "logits/chosen": -0.27734375, + "logits/rejected": -0.376953125, + "logps/chosen": -400.0, + "logps/rejected": -424.0, + "loss": 0.0128, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.2353515625, + "rewards/margins": 10.0625, + "rewards/rejected": -9.8125, + "step": 1956 + }, + { + "epoch": 2.4012269938650306, + "grad_norm": 6.189354618561992, + "learning_rate": 1.0082644628099173e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.44921875, + "logps/chosen": -384.0, + "logps/rejected": -376.0, + "loss": 0.0223, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.244140625, + "rewards/margins": 9.4375, + "rewards/rejected": -9.1875, + "step": 1957 + }, + { + "epoch": 2.4024539877300612, + "grad_norm": 4.927658204547556, + "learning_rate": 1.006198347107438e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.466796875, + "logps/chosen": -408.0, + "logps/rejected": -402.0, + "loss": 0.0187, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.435546875, + "rewards/margins": 9.8125, + "rewards/rejected": -9.375, + "step": 1958 + }, + { + "epoch": 2.403680981595092, + "grad_norm": 3.701988921573886, + "learning_rate": 1.0041322314049586e-07, + "logits/chosen": -0.251953125, + "logits/rejected": -0.390625, + "logps/chosen": -354.0, + "logps/rejected": -352.0, + "loss": 0.0124, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.1181640625, + "rewards/margins": 9.75, + "rewards/rejected": -9.625, + "step": 1959 + }, + { + "epoch": 2.4049079754601226, + "grad_norm": 4.5090174534361305, + "learning_rate": 1.0020661157024794e-07, + "logits/chosen": -0.32421875, + "logits/rejected": -0.5, + "logps/chosen": -388.0, + "logps/rejected": -364.0, + "loss": 0.02, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.0257568359375, + "rewards/margins": 10.25, + "rewards/rejected": -10.25, + "step": 1960 + }, + { + "epoch": 2.4061349693251532, + "grad_norm": 5.779487778941397, + "learning_rate": 1e-07, + "logits/chosen": -0.341796875, + "logits/rejected": -0.404296875, + "logps/chosen": -412.0, + "logps/rejected": -378.0, + "loss": 0.0226, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.29296875, + "rewards/margins": 10.75, + "rewards/rejected": -10.4375, + "step": 1961 + }, + { + "epoch": 2.407361963190184, + "grad_norm": 6.14500490885384, + "learning_rate": 9.979338842975206e-08, + "logits/chosen": -0.228515625, + "logits/rejected": -0.392578125, + "logps/chosen": -376.0, + "logps/rejected": -376.0, + "loss": 0.0153, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.212890625, + "rewards/margins": 9.9375, + "rewards/rejected": -10.1875, + "step": 1962 + }, + { + "epoch": 2.4085889570552146, + "grad_norm": 4.493825340408892, + "learning_rate": 9.958677685950413e-08, + "logits/chosen": -0.1748046875, + "logits/rejected": -0.46875, + "logps/chosen": -432.0, + "logps/rejected": -372.0, + "loss": 0.013, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.9921875, + "rewards/margins": 10.0625, + "rewards/rejected": -9.0625, + "step": 1963 + }, + { + "epoch": 2.4098159509202453, + "grad_norm": 5.5970699371732655, + "learning_rate": 9.938016528925619e-08, + "logits/chosen": -0.357421875, + "logits/rejected": -0.56640625, + "logps/chosen": -430.0, + "logps/rejected": -408.0, + "loss": 0.0142, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.443359375, + "rewards/margins": 10.75, + "rewards/rejected": -10.3125, + "step": 1964 + }, + { + "epoch": 2.411042944785276, + "grad_norm": 4.705959575456872, + "learning_rate": 9.917355371900826e-08, + "logits/chosen": -0.1806640625, + "logits/rejected": -0.265625, + "logps/chosen": -348.0, + "logps/rejected": -364.0, + "loss": 0.0147, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.296875, + "rewards/margins": 9.9375, + "rewards/rejected": -9.625, + "step": 1965 + }, + { + "epoch": 2.4122699386503066, + "grad_norm": 3.844538086368948, + "learning_rate": 9.896694214876032e-08, + "logits/chosen": -0.32421875, + "logits/rejected": -0.53515625, + "logps/chosen": -376.0, + "logps/rejected": -360.0, + "loss": 0.0114, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.69921875, + "rewards/margins": 10.375, + "rewards/rejected": -9.6875, + "step": 1966 + }, + { + "epoch": 2.4134969325153373, + "grad_norm": 4.789062200817242, + "learning_rate": 9.87603305785124e-08, + "logits/chosen": -0.318359375, + "logits/rejected": -0.490234375, + "logps/chosen": -386.0, + "logps/rejected": -352.0, + "loss": 0.0201, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.32421875, + "rewards/margins": 10.0, + "rewards/rejected": -10.3125, + "step": 1967 + }, + { + "epoch": 2.414723926380368, + "grad_norm": 6.01596619459714, + "learning_rate": 9.855371900826446e-08, + "logits/chosen": -0.322265625, + "logits/rejected": -0.5546875, + "logps/chosen": -378.0, + "logps/rejected": -360.0, + "loss": 0.0202, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.1259765625, + "rewards/margins": 9.6875, + "rewards/rejected": -9.5625, + "step": 1968 + }, + { + "epoch": 2.4159509202453986, + "grad_norm": 5.741519657591056, + "learning_rate": 9.834710743801653e-08, + "logits/chosen": -0.291015625, + "logits/rejected": -0.478515625, + "logps/chosen": -412.0, + "logps/rejected": -374.0, + "loss": 0.0151, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.55859375, + "rewards/margins": 9.75, + "rewards/rejected": -9.1875, + "step": 1969 + }, + { + "epoch": 2.4171779141104293, + "grad_norm": 5.396863545476976, + "learning_rate": 9.814049586776859e-08, + "logits/chosen": -0.197265625, + "logits/rejected": -0.318359375, + "logps/chosen": -388.0, + "logps/rejected": -376.0, + "loss": 0.0265, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.267578125, + "rewards/margins": 9.25, + "rewards/rejected": -9.5, + "step": 1970 + }, + { + "epoch": 2.41840490797546, + "grad_norm": 8.589897243411217, + "learning_rate": 9.793388429752065e-08, + "logits/chosen": -0.240234375, + "logits/rejected": -0.40625, + "logps/chosen": -360.0, + "logps/rejected": -356.0, + "loss": 0.0265, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.2294921875, + "rewards/margins": 8.875, + "rewards/rejected": -9.125, + "step": 1971 + }, + { + "epoch": 2.419631901840491, + "grad_norm": 5.017010577837942, + "learning_rate": 9.772727272727273e-08, + "logits/chosen": -0.3203125, + "logits/rejected": -0.45703125, + "logps/chosen": -402.0, + "logps/rejected": -370.0, + "loss": 0.0181, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.63671875, + "rewards/margins": 10.375, + "rewards/rejected": -9.6875, + "step": 1972 + }, + { + "epoch": 2.4208588957055213, + "grad_norm": 2.7645232321950495, + "learning_rate": 9.752066115702479e-08, + "logits/chosen": -0.26171875, + "logits/rejected": -0.341796875, + "logps/chosen": -392.0, + "logps/rejected": -374.0, + "loss": 0.0088, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.1005859375, + "rewards/margins": 10.0625, + "rewards/rejected": -10.1875, + "step": 1973 + }, + { + "epoch": 2.4220858895705524, + "grad_norm": 4.0863506681401995, + "learning_rate": 9.731404958677686e-08, + "logits/chosen": -0.294921875, + "logits/rejected": -0.48828125, + "logps/chosen": -442.0, + "logps/rejected": -398.0, + "loss": 0.0137, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.365234375, + "rewards/margins": 10.5625, + "rewards/rejected": -10.1875, + "step": 1974 + }, + { + "epoch": 2.4233128834355826, + "grad_norm": 5.992139137538322, + "learning_rate": 9.710743801652892e-08, + "logits/chosen": -0.34765625, + "logits/rejected": -0.57421875, + "logps/chosen": -438.0, + "logps/rejected": -406.0, + "loss": 0.0198, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.54296875, + "rewards/margins": 10.0625, + "rewards/rejected": -9.5, + "step": 1975 + }, + { + "epoch": 2.4245398773006137, + "grad_norm": 3.834331038960652, + "learning_rate": 9.690082644628099e-08, + "logits/chosen": -0.30859375, + "logits/rejected": -0.408203125, + "logps/chosen": -364.0, + "logps/rejected": -360.0, + "loss": 0.02, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.10009765625, + "rewards/margins": 9.5, + "rewards/rejected": -9.625, + "step": 1976 + }, + { + "epoch": 2.425766871165644, + "grad_norm": 4.795148694972335, + "learning_rate": 9.669421487603305e-08, + "logits/chosen": -0.150390625, + "logits/rejected": -0.3125, + "logps/chosen": -364.0, + "logps/rejected": -354.0, + "loss": 0.0118, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.150390625, + "rewards/margins": 9.5, + "rewards/rejected": -9.3125, + "step": 1977 + }, + { + "epoch": 2.426993865030675, + "grad_norm": 4.7035588660571275, + "learning_rate": 9.648760330578511e-08, + "logits/chosen": -0.32421875, + "logits/rejected": -0.546875, + "logps/chosen": -464.0, + "logps/rejected": -434.0, + "loss": 0.011, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.17578125, + "rewards/margins": 10.125, + "rewards/rejected": -10.3125, + "step": 1978 + }, + { + "epoch": 2.4282208588957057, + "grad_norm": 4.724626618936102, + "learning_rate": 9.628099173553719e-08, + "logits/chosen": -0.2314453125, + "logits/rejected": -0.49609375, + "logps/chosen": -414.0, + "logps/rejected": -372.0, + "loss": 0.0173, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.09814453125, + "rewards/margins": 9.875, + "rewards/rejected": -10.0, + "step": 1979 + }, + { + "epoch": 2.4294478527607364, + "grad_norm": 5.610920964055625, + "learning_rate": 9.607438016528925e-08, + "logits/chosen": -0.30078125, + "logits/rejected": -0.5078125, + "logps/chosen": -378.0, + "logps/rejected": -370.0, + "loss": 0.0223, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.1357421875, + "rewards/margins": 9.625, + "rewards/rejected": -9.75, + "step": 1980 + }, + { + "epoch": 2.430674846625767, + "grad_norm": 5.162616201924037, + "learning_rate": 9.586776859504132e-08, + "logits/chosen": -0.2255859375, + "logits/rejected": -0.357421875, + "logps/chosen": -422.0, + "logps/rejected": -400.0, + "loss": 0.0216, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.0167236328125, + "rewards/margins": 9.125, + "rewards/rejected": -9.125, + "step": 1981 + }, + { + "epoch": 2.4319018404907977, + "grad_norm": 5.2114013984877685, + "learning_rate": 9.566115702479338e-08, + "logits/chosen": -0.310546875, + "logits/rejected": -0.46875, + "logps/chosen": -392.0, + "logps/rejected": -386.0, + "loss": 0.0143, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.416015625, + "rewards/margins": 9.0625, + "rewards/rejected": -9.5, + "step": 1982 + }, + { + "epoch": 2.4331288343558284, + "grad_norm": 3.451903518007281, + "learning_rate": 9.545454545454546e-08, + "logits/chosen": -0.23046875, + "logits/rejected": -0.458984375, + "logps/chosen": -454.0, + "logps/rejected": -424.0, + "loss": 0.0111, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.61328125, + "rewards/margins": 10.3125, + "rewards/rejected": -9.6875, + "step": 1983 + }, + { + "epoch": 2.434355828220859, + "grad_norm": 5.297087586217428, + "learning_rate": 9.524793388429752e-08, + "logits/chosen": -0.2490234375, + "logits/rejected": -0.41796875, + "logps/chosen": -402.0, + "logps/rejected": -412.0, + "loss": 0.0179, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.328125, + "rewards/margins": 9.9375, + "rewards/rejected": -9.625, + "step": 1984 + }, + { + "epoch": 2.4355828220858897, + "grad_norm": 6.7372329768927885, + "learning_rate": 9.504132231404959e-08, + "logits/chosen": -0.310546875, + "logits/rejected": -0.6015625, + "logps/chosen": -450.0, + "logps/rejected": -370.0, + "loss": 0.0157, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6171875, + "rewards/margins": 10.25, + "rewards/rejected": -9.6875, + "step": 1985 + }, + { + "epoch": 2.4368098159509204, + "grad_norm": 4.922384751769037, + "learning_rate": 9.483471074380165e-08, + "logits/chosen": -0.40625, + "logits/rejected": -0.61328125, + "logps/chosen": -444.0, + "logps/rejected": -394.0, + "loss": 0.0156, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.86328125, + "rewards/margins": 10.4375, + "rewards/rejected": -9.5625, + "step": 1986 + }, + { + "epoch": 2.438036809815951, + "grad_norm": 4.330160793459899, + "learning_rate": 9.462809917355371e-08, + "logits/chosen": -0.23046875, + "logits/rejected": -0.328125, + "logps/chosen": -354.0, + "logps/rejected": -338.0, + "loss": 0.015, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.11767578125, + "rewards/margins": 9.4375, + "rewards/rejected": -9.5, + "step": 1987 + }, + { + "epoch": 2.4392638036809817, + "grad_norm": 4.321182938314299, + "learning_rate": 9.442148760330577e-08, + "logits/chosen": -0.2451171875, + "logits/rejected": -0.36328125, + "logps/chosen": -364.0, + "logps/rejected": -370.0, + "loss": 0.0149, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.2060546875, + "rewards/margins": 9.5625, + "rewards/rejected": -9.375, + "step": 1988 + }, + { + "epoch": 2.4404907975460124, + "grad_norm": 3.403255143274009, + "learning_rate": 9.421487603305784e-08, + "logits/chosen": -0.296875, + "logits/rejected": -0.5625, + "logps/chosen": -410.0, + "logps/rejected": -384.0, + "loss": 0.0091, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.65625, + "rewards/margins": 10.625, + "rewards/rejected": -9.9375, + "step": 1989 + }, + { + "epoch": 2.441717791411043, + "grad_norm": 3.9542140669839103, + "learning_rate": 9.400826446280992e-08, + "logits/chosen": -0.2734375, + "logits/rejected": -0.462890625, + "logps/chosen": -402.0, + "logps/rejected": -362.0, + "loss": 0.0138, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.3671875, + "rewards/margins": 9.5625, + "rewards/rejected": -9.9375, + "step": 1990 + }, + { + "epoch": 2.4429447852760737, + "grad_norm": 4.96979250682656, + "learning_rate": 9.380165289256198e-08, + "logits/chosen": -0.1982421875, + "logits/rejected": -0.392578125, + "logps/chosen": -344.0, + "logps/rejected": -350.0, + "loss": 0.0159, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.04248046875, + "rewards/margins": 9.4375, + "rewards/rejected": -9.375, + "step": 1991 + }, + { + "epoch": 2.4441717791411044, + "grad_norm": 6.204470452385545, + "learning_rate": 9.359504132231405e-08, + "logits/chosen": -0.2333984375, + "logits/rejected": -0.44140625, + "logps/chosen": -414.0, + "logps/rejected": -346.0, + "loss": 0.0152, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.490234375, + "rewards/margins": 9.8125, + "rewards/rejected": -9.3125, + "step": 1992 + }, + { + "epoch": 2.445398773006135, + "grad_norm": 6.359363984427582, + "learning_rate": 9.338842975206611e-08, + "logits/chosen": -0.1591796875, + "logits/rejected": -0.33203125, + "logps/chosen": -360.0, + "logps/rejected": -346.0, + "loss": 0.0201, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.033447265625, + "rewards/margins": 9.0, + "rewards/rejected": -9.0, + "step": 1993 + }, + { + "epoch": 2.4466257668711657, + "grad_norm": 5.1501689143728075, + "learning_rate": 9.318181818181818e-08, + "logits/chosen": -0.2890625, + "logits/rejected": -0.40234375, + "logps/chosen": -374.0, + "logps/rejected": -374.0, + "loss": 0.0174, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.330078125, + "rewards/margins": 9.1875, + "rewards/rejected": -9.5, + "step": 1994 + }, + { + "epoch": 2.4478527607361964, + "grad_norm": 5.775670981572119, + "learning_rate": 9.297520661157025e-08, + "logits/chosen": -0.279296875, + "logits/rejected": -0.53515625, + "logps/chosen": -456.0, + "logps/rejected": -386.0, + "loss": 0.018, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.87890625, + "rewards/margins": 10.125, + "rewards/rejected": -9.1875, + "step": 1995 + }, + { + "epoch": 2.449079754601227, + "grad_norm": 5.044105602487043, + "learning_rate": 9.27685950413223e-08, + "logits/chosen": -0.294921875, + "logits/rejected": -0.451171875, + "logps/chosen": -348.0, + "logps/rejected": -364.0, + "loss": 0.019, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.291015625, + "rewards/margins": 8.9375, + "rewards/rejected": -9.25, + "step": 1996 + }, + { + "epoch": 2.4503067484662577, + "grad_norm": 6.522689590324313, + "learning_rate": 9.256198347107437e-08, + "logits/chosen": -0.287109375, + "logits/rejected": -0.453125, + "logps/chosen": -422.0, + "logps/rejected": -384.0, + "loss": 0.0183, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.33203125, + "rewards/margins": 9.6875, + "rewards/rejected": -9.3125, + "step": 1997 + }, + { + "epoch": 2.4515337423312884, + "grad_norm": 4.913295865508845, + "learning_rate": 9.235537190082644e-08, + "logits/chosen": -0.234375, + "logits/rejected": -0.3828125, + "logps/chosen": -370.0, + "logps/rejected": -366.0, + "loss": 0.0151, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.328125, + "rewards/margins": 9.375, + "rewards/rejected": -9.0625, + "step": 1998 + }, + { + "epoch": 2.452760736196319, + "grad_norm": 6.208817815288645, + "learning_rate": 9.214876033057851e-08, + "logits/chosen": -0.2890625, + "logits/rejected": -0.462890625, + "logps/chosen": -358.0, + "logps/rejected": -342.0, + "loss": 0.0282, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.451171875, + "rewards/margins": 9.25, + "rewards/rejected": -8.8125, + "step": 1999 + }, + { + "epoch": 2.4539877300613497, + "grad_norm": 5.551093645981188, + "learning_rate": 9.194214876033057e-08, + "logits/chosen": -0.318359375, + "logits/rejected": -0.4921875, + "logps/chosen": -372.0, + "logps/rejected": -358.0, + "loss": 0.0206, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.1591796875, + "rewards/margins": 9.5, + "rewards/rejected": -9.6875, + "step": 2000 + }, + { + "epoch": 2.4552147239263804, + "grad_norm": 10.220430803273974, + "learning_rate": 9.173553719008265e-08, + "logits/chosen": -0.2333984375, + "logits/rejected": -0.5078125, + "logps/chosen": -410.0, + "logps/rejected": -334.0, + "loss": 0.019, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.326171875, + "rewards/margins": 9.875, + "rewards/rejected": -9.5625, + "step": 2001 + }, + { + "epoch": 2.456441717791411, + "grad_norm": 5.208194699076826, + "learning_rate": 9.152892561983471e-08, + "logits/chosen": -0.2392578125, + "logits/rejected": -0.408203125, + "logps/chosen": -386.0, + "logps/rejected": -348.0, + "loss": 0.0151, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.33984375, + "rewards/margins": 9.8125, + "rewards/rejected": -9.4375, + "step": 2002 + }, + { + "epoch": 2.4576687116564417, + "grad_norm": 6.027451478965465, + "learning_rate": 9.132231404958678e-08, + "logits/chosen": -0.251953125, + "logits/rejected": -0.443359375, + "logps/chosen": -382.0, + "logps/rejected": -390.0, + "loss": 0.0233, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.310546875, + "rewards/margins": 9.0625, + "rewards/rejected": -9.375, + "step": 2003 + }, + { + "epoch": 2.4588957055214724, + "grad_norm": 5.36078479690874, + "learning_rate": 9.111570247933884e-08, + "logits/chosen": -0.287109375, + "logits/rejected": -0.396484375, + "logps/chosen": -412.0, + "logps/rejected": -414.0, + "loss": 0.0201, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.0361328125, + "rewards/margins": 9.25, + "rewards/rejected": -9.3125, + "step": 2004 + }, + { + "epoch": 2.460122699386503, + "grad_norm": 5.656737071790728, + "learning_rate": 9.09090909090909e-08, + "logits/chosen": -0.380859375, + "logits/rejected": -0.474609375, + "logps/chosen": -370.0, + "logps/rejected": -372.0, + "loss": 0.0174, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.006683349609375, + "rewards/margins": 9.5625, + "rewards/rejected": -9.5625, + "step": 2005 + }, + { + "epoch": 2.4613496932515337, + "grad_norm": 6.727707194752534, + "learning_rate": 9.070247933884296e-08, + "logits/chosen": -0.185546875, + "logits/rejected": -0.314453125, + "logps/chosen": -378.0, + "logps/rejected": -372.0, + "loss": 0.0189, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.55859375, + "rewards/margins": 10.0625, + "rewards/rejected": -9.5, + "step": 2006 + }, + { + "epoch": 2.4625766871165644, + "grad_norm": 7.160837759247697, + "learning_rate": 9.049586776859504e-08, + "logits/chosen": -0.302734375, + "logits/rejected": -0.48046875, + "logps/chosen": -398.0, + "logps/rejected": -394.0, + "loss": 0.0223, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.07666015625, + "rewards/margins": 9.6875, + "rewards/rejected": -9.75, + "step": 2007 + }, + { + "epoch": 2.463803680981595, + "grad_norm": 5.8280120609711386, + "learning_rate": 9.02892561983471e-08, + "logits/chosen": -0.357421875, + "logits/rejected": -0.4765625, + "logps/chosen": -358.0, + "logps/rejected": -330.0, + "loss": 0.0207, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.88671875, + "rewards/margins": 8.875, + "rewards/rejected": -9.75, + "step": 2008 + }, + { + "epoch": 2.4650306748466257, + "grad_norm": 5.651745885701394, + "learning_rate": 9.008264462809917e-08, + "logits/chosen": -0.38671875, + "logits/rejected": -0.60546875, + "logps/chosen": -362.0, + "logps/rejected": -360.0, + "loss": 0.0143, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.054931640625, + "rewards/margins": 10.625, + "rewards/rejected": -10.6875, + "step": 2009 + }, + { + "epoch": 2.4662576687116564, + "grad_norm": 9.6767669253971, + "learning_rate": 8.987603305785124e-08, + "logits/chosen": -0.259765625, + "logits/rejected": -0.439453125, + "logps/chosen": -398.0, + "logps/rejected": -360.0, + "loss": 0.0233, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.018310546875, + "rewards/margins": 9.75, + "rewards/rejected": -9.75, + "step": 2010 + }, + { + "epoch": 2.467484662576687, + "grad_norm": 5.433749693393289, + "learning_rate": 8.96694214876033e-08, + "logits/chosen": -0.25390625, + "logits/rejected": -0.369140625, + "logps/chosen": -366.0, + "logps/rejected": -354.0, + "loss": 0.0166, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.39453125, + "rewards/margins": 8.875, + "rewards/rejected": -9.25, + "step": 2011 + }, + { + "epoch": 2.4687116564417177, + "grad_norm": 6.056511248449985, + "learning_rate": 8.946280991735538e-08, + "logits/chosen": -0.240234375, + "logits/rejected": -0.4375, + "logps/chosen": -388.0, + "logps/rejected": -400.0, + "loss": 0.0166, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.10009765625, + "rewards/margins": 10.25, + "rewards/rejected": -10.375, + "step": 2012 + }, + { + "epoch": 2.4699386503067484, + "grad_norm": 6.244946598223986, + "learning_rate": 8.925619834710744e-08, + "logits/chosen": -0.427734375, + "logits/rejected": -0.57421875, + "logps/chosen": -424.0, + "logps/rejected": -390.0, + "loss": 0.0164, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.484375, + "rewards/margins": 10.1875, + "rewards/rejected": -10.625, + "step": 2013 + }, + { + "epoch": 2.471165644171779, + "grad_norm": 6.073662659141964, + "learning_rate": 8.90495867768595e-08, + "logits/chosen": -0.341796875, + "logits/rejected": -0.51171875, + "logps/chosen": -416.0, + "logps/rejected": -410.0, + "loss": 0.0171, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.53515625, + "rewards/margins": 10.0, + "rewards/rejected": -10.5, + "step": 2014 + }, + { + "epoch": 2.4723926380368098, + "grad_norm": 4.359900393904523, + "learning_rate": 8.884297520661156e-08, + "logits/chosen": -0.37890625, + "logits/rejected": -0.6171875, + "logps/chosen": -386.0, + "logps/rejected": -362.0, + "loss": 0.0145, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.49609375, + "rewards/margins": 9.9375, + "rewards/rejected": -9.4375, + "step": 2015 + }, + { + "epoch": 2.4736196319018404, + "grad_norm": 4.657488230585688, + "learning_rate": 8.863636363636363e-08, + "logits/chosen": -0.361328125, + "logits/rejected": -0.54296875, + "logps/chosen": -446.0, + "logps/rejected": -372.0, + "loss": 0.0199, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.462890625, + "rewards/margins": 10.0625, + "rewards/rejected": -9.625, + "step": 2016 + }, + { + "epoch": 2.474846625766871, + "grad_norm": 6.281557341426558, + "learning_rate": 8.842975206611569e-08, + "logits/chosen": -0.314453125, + "logits/rejected": -0.53125, + "logps/chosen": -398.0, + "logps/rejected": -378.0, + "loss": 0.0193, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.2734375, + "rewards/margins": 10.0625, + "rewards/rejected": -10.375, + "step": 2017 + }, + { + "epoch": 2.4760736196319018, + "grad_norm": 5.8828720487744635, + "learning_rate": 8.822314049586777e-08, + "logits/chosen": -0.26953125, + "logits/rejected": -0.4375, + "logps/chosen": -404.0, + "logps/rejected": -362.0, + "loss": 0.019, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.25, + "rewards/margins": 9.8125, + "rewards/rejected": -10.0625, + "step": 2018 + }, + { + "epoch": 2.4773006134969324, + "grad_norm": 7.233962269465832, + "learning_rate": 8.801652892561984e-08, + "logits/chosen": -0.330078125, + "logits/rejected": -0.44140625, + "logps/chosen": -366.0, + "logps/rejected": -364.0, + "loss": 0.0215, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.125, + "rewards/margins": 10.0, + "rewards/rejected": -10.125, + "step": 2019 + }, + { + "epoch": 2.478527607361963, + "grad_norm": 6.932574258525103, + "learning_rate": 8.78099173553719e-08, + "logits/chosen": -0.40234375, + "logits/rejected": -0.59375, + "logps/chosen": -384.0, + "logps/rejected": -380.0, + "loss": 0.0177, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.318359375, + "rewards/margins": 9.6875, + "rewards/rejected": -10.0625, + "step": 2020 + }, + { + "epoch": 2.4797546012269938, + "grad_norm": 5.1559953822451, + "learning_rate": 8.760330578512397e-08, + "logits/chosen": -0.1845703125, + "logits/rejected": -0.388671875, + "logps/chosen": -414.0, + "logps/rejected": -376.0, + "loss": 0.0183, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.0120849609375, + "rewards/margins": 9.625, + "rewards/rejected": -9.625, + "step": 2021 + }, + { + "epoch": 2.4809815950920244, + "grad_norm": 5.760829581506237, + "learning_rate": 8.739669421487603e-08, + "logits/chosen": -0.2333984375, + "logits/rejected": -0.31640625, + "logps/chosen": -392.0, + "logps/rejected": -370.0, + "loss": 0.0227, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.8046875, + "rewards/margins": 8.4375, + "rewards/rejected": -9.1875, + "step": 2022 + }, + { + "epoch": 2.482208588957055, + "grad_norm": 3.1556929278433827, + "learning_rate": 8.719008264462809e-08, + "logits/chosen": -0.3046875, + "logits/rejected": -0.44140625, + "logps/chosen": -416.0, + "logps/rejected": -396.0, + "loss": 0.0097, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.189453125, + "rewards/margins": 9.5, + "rewards/rejected": -9.3125, + "step": 2023 + }, + { + "epoch": 2.4834355828220858, + "grad_norm": 3.5253268580394046, + "learning_rate": 8.698347107438015e-08, + "logits/chosen": -0.23828125, + "logits/rejected": -0.435546875, + "logps/chosen": -376.0, + "logps/rejected": -416.0, + "loss": 0.012, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.40234375, + "rewards/margins": 10.0, + "rewards/rejected": -9.625, + "step": 2024 + }, + { + "epoch": 2.4846625766871164, + "grad_norm": 5.498481852463346, + "learning_rate": 8.677685950413223e-08, + "logits/chosen": -0.388671875, + "logits/rejected": -0.52734375, + "logps/chosen": -350.0, + "logps/rejected": -354.0, + "loss": 0.0192, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.345703125, + "rewards/margins": 9.1875, + "rewards/rejected": -9.5, + "step": 2025 + }, + { + "epoch": 2.485889570552147, + "grad_norm": 3.706190513865461, + "learning_rate": 8.657024793388429e-08, + "logits/chosen": -0.259765625, + "logits/rejected": -0.48046875, + "logps/chosen": -404.0, + "logps/rejected": -392.0, + "loss": 0.015, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.109375, + "rewards/margins": 10.0, + "rewards/rejected": -10.125, + "step": 2026 + }, + { + "epoch": 2.4871165644171778, + "grad_norm": 5.138923634268763, + "learning_rate": 8.636363636363636e-08, + "logits/chosen": -0.265625, + "logits/rejected": -0.416015625, + "logps/chosen": -382.0, + "logps/rejected": -346.0, + "loss": 0.0187, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.0206298828125, + "rewards/margins": 9.9375, + "rewards/rejected": -9.875, + "step": 2027 + }, + { + "epoch": 2.4883435582822084, + "grad_norm": 7.778091921774226, + "learning_rate": 8.615702479338842e-08, + "logits/chosen": -0.27734375, + "logits/rejected": -0.5, + "logps/chosen": -396.0, + "logps/rejected": -388.0, + "loss": 0.0166, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.2451171875, + "rewards/margins": 10.5, + "rewards/rejected": -10.25, + "step": 2028 + }, + { + "epoch": 2.489570552147239, + "grad_norm": 4.5926112124290865, + "learning_rate": 8.59504132231405e-08, + "logits/chosen": -0.3203125, + "logits/rejected": -0.49609375, + "logps/chosen": -416.0, + "logps/rejected": -376.0, + "loss": 0.0159, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.1298828125, + "rewards/margins": 9.25, + "rewards/rejected": -9.375, + "step": 2029 + }, + { + "epoch": 2.4907975460122698, + "grad_norm": 4.823718085291878, + "learning_rate": 8.574380165289257e-08, + "logits/chosen": -0.35546875, + "logits/rejected": -0.53515625, + "logps/chosen": -398.0, + "logps/rejected": -378.0, + "loss": 0.013, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.408203125, + "rewards/margins": 10.1875, + "rewards/rejected": -9.8125, + "step": 2030 + }, + { + "epoch": 2.4920245398773004, + "grad_norm": 5.01547780684661, + "learning_rate": 8.553719008264463e-08, + "logits/chosen": -0.318359375, + "logits/rejected": -0.447265625, + "logps/chosen": -376.0, + "logps/rejected": -390.0, + "loss": 0.0191, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.1005859375, + "rewards/margins": 9.0, + "rewards/rejected": -9.0625, + "step": 2031 + }, + { + "epoch": 2.493251533742331, + "grad_norm": 4.454326538586077, + "learning_rate": 8.533057851239669e-08, + "logits/chosen": -0.2578125, + "logits/rejected": -0.455078125, + "logps/chosen": -374.0, + "logps/rejected": -372.0, + "loss": 0.0144, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.046875, + "rewards/margins": 9.5, + "rewards/rejected": -9.4375, + "step": 2032 + }, + { + "epoch": 2.4944785276073618, + "grad_norm": 5.3531237594915035, + "learning_rate": 8.512396694214875e-08, + "logits/chosen": -0.1748046875, + "logits/rejected": -0.353515625, + "logps/chosen": -400.0, + "logps/rejected": -352.0, + "loss": 0.0187, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.466796875, + "rewards/margins": 9.375, + "rewards/rejected": -8.9375, + "step": 2033 + }, + { + "epoch": 2.4957055214723924, + "grad_norm": 4.1722037452425775, + "learning_rate": 8.491735537190082e-08, + "logits/chosen": -0.33203125, + "logits/rejected": -0.5078125, + "logps/chosen": -432.0, + "logps/rejected": -420.0, + "loss": 0.0131, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.265625, + "rewards/margins": 10.375, + "rewards/rejected": -10.125, + "step": 2034 + }, + { + "epoch": 2.4969325153374236, + "grad_norm": 5.0982592617946345, + "learning_rate": 8.471074380165288e-08, + "logits/chosen": -0.287109375, + "logits/rejected": -0.44921875, + "logps/chosen": -388.0, + "logps/rejected": -370.0, + "loss": 0.0192, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.341796875, + "rewards/margins": 9.625, + "rewards/rejected": -9.25, + "step": 2035 + }, + { + "epoch": 2.4981595092024538, + "grad_norm": 3.3643838294504653, + "learning_rate": 8.450413223140496e-08, + "logits/chosen": -0.11279296875, + "logits/rejected": -0.34375, + "logps/chosen": -378.0, + "logps/rejected": -356.0, + "loss": 0.012, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.330078125, + "rewards/margins": 9.4375, + "rewards/rejected": -9.75, + "step": 2036 + }, + { + "epoch": 2.499386503067485, + "grad_norm": 6.731996625727098, + "learning_rate": 8.429752066115702e-08, + "logits/chosen": -0.298828125, + "logits/rejected": -0.478515625, + "logps/chosen": -414.0, + "logps/rejected": -382.0, + "loss": 0.0224, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.43359375, + "rewards/margins": 10.0625, + "rewards/rejected": -9.625, + "step": 2037 + }, + { + "epoch": 2.500613496932515, + "grad_norm": 7.676139470943911, + "learning_rate": 8.409090909090909e-08, + "logits/chosen": -0.294921875, + "logits/rejected": -0.43359375, + "logps/chosen": -378.0, + "logps/rejected": -378.0, + "loss": 0.0222, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.5078125, + "rewards/margins": 9.5, + "rewards/rejected": -10.0, + "step": 2038 + }, + { + "epoch": 2.5018404907975462, + "grad_norm": 5.4158172465137495, + "learning_rate": 8.388429752066116e-08, + "logits/chosen": -0.234375, + "logits/rejected": -0.341796875, + "logps/chosen": -404.0, + "logps/rejected": -378.0, + "loss": 0.0141, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.470703125, + "rewards/margins": 9.75, + "rewards/rejected": -10.25, + "step": 2039 + }, + { + "epoch": 2.5030674846625764, + "grad_norm": 5.0810644772520215, + "learning_rate": 8.367768595041322e-08, + "logits/chosen": -0.23046875, + "logits/rejected": -0.46484375, + "logps/chosen": -350.0, + "logps/rejected": -340.0, + "loss": 0.0146, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.1630859375, + "rewards/margins": 9.5625, + "rewards/rejected": -9.75, + "step": 2040 + }, + { + "epoch": 2.5042944785276076, + "grad_norm": 3.4284926768854462, + "learning_rate": 8.347107438016528e-08, + "logits/chosen": -0.396484375, + "logits/rejected": -0.55859375, + "logps/chosen": -394.0, + "logps/rejected": -378.0, + "loss": 0.0117, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.3125, + "rewards/margins": 9.625, + "rewards/rejected": -9.3125, + "step": 2041 + }, + { + "epoch": 2.505521472392638, + "grad_norm": 4.71075583220704, + "learning_rate": 8.326446280991735e-08, + "logits/chosen": -0.296875, + "logits/rejected": -0.46875, + "logps/chosen": -400.0, + "logps/rejected": -356.0, + "loss": 0.0159, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.58984375, + "rewards/margins": 10.5, + "rewards/rejected": -9.9375, + "step": 2042 + }, + { + "epoch": 2.506748466257669, + "grad_norm": 4.728608562778987, + "learning_rate": 8.305785123966942e-08, + "logits/chosen": -0.291015625, + "logits/rejected": -0.4609375, + "logps/chosen": -406.0, + "logps/rejected": -398.0, + "loss": 0.0152, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.1484375, + "rewards/margins": 10.0625, + "rewards/rejected": -9.9375, + "step": 2043 + }, + { + "epoch": 2.507975460122699, + "grad_norm": 7.064663937972893, + "learning_rate": 8.285123966942148e-08, + "logits/chosen": -0.30078125, + "logits/rejected": -0.43359375, + "logps/chosen": -312.0, + "logps/rejected": -318.0, + "loss": 0.0285, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.34765625, + "rewards/margins": 9.375, + "rewards/rejected": -9.6875, + "step": 2044 + }, + { + "epoch": 2.5092024539877302, + "grad_norm": 3.878850722162715, + "learning_rate": 8.264462809917355e-08, + "logits/chosen": -0.263671875, + "logits/rejected": -0.455078125, + "logps/chosen": -412.0, + "logps/rejected": -360.0, + "loss": 0.0143, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.25390625, + "rewards/margins": 9.5625, + "rewards/rejected": -9.3125, + "step": 2045 + }, + { + "epoch": 2.510429447852761, + "grad_norm": 4.55562641030707, + "learning_rate": 8.243801652892561e-08, + "logits/chosen": -0.26953125, + "logits/rejected": -0.41796875, + "logps/chosen": -370.0, + "logps/rejected": -348.0, + "loss": 0.0169, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.232421875, + "rewards/margins": 9.25, + "rewards/rejected": -9.5, + "step": 2046 + }, + { + "epoch": 2.5116564417177916, + "grad_norm": 6.7473308029613195, + "learning_rate": 8.223140495867769e-08, + "logits/chosen": -0.291015625, + "logits/rejected": -0.419921875, + "logps/chosen": -392.0, + "logps/rejected": -350.0, + "loss": 0.0325, + "rewards/accuracies": 0.9765625, + "rewards/chosen": -0.0927734375, + "rewards/margins": 10.0625, + "rewards/rejected": -10.1875, + "step": 2047 + }, + { + "epoch": 2.5128834355828222, + "grad_norm": 6.815699963974387, + "learning_rate": 8.202479338842975e-08, + "logits/chosen": -0.248046875, + "logits/rejected": -0.40625, + "logps/chosen": -410.0, + "logps/rejected": -388.0, + "loss": 0.0256, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.263671875, + "rewards/margins": 9.5625, + "rewards/rejected": -9.8125, + "step": 2048 + }, + { + "epoch": 2.514110429447853, + "grad_norm": 4.624677670182832, + "learning_rate": 8.181818181818182e-08, + "logits/chosen": -0.29296875, + "logits/rejected": -0.455078125, + "logps/chosen": -454.0, + "logps/rejected": -384.0, + "loss": 0.0194, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.625, + "rewards/margins": 10.3125, + "rewards/rejected": -9.6875, + "step": 2049 + }, + { + "epoch": 2.5153374233128836, + "grad_norm": 5.915479745107026, + "learning_rate": 8.161157024793388e-08, + "logits/chosen": -0.291015625, + "logits/rejected": -0.5390625, + "logps/chosen": -456.0, + "logps/rejected": -414.0, + "loss": 0.0145, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5703125, + "rewards/margins": 10.625, + "rewards/rejected": -10.0, + "step": 2050 + }, + { + "epoch": 2.5165644171779142, + "grad_norm": 6.473892493816635, + "learning_rate": 8.140495867768594e-08, + "logits/chosen": -0.3125, + "logits/rejected": -0.4765625, + "logps/chosen": -418.0, + "logps/rejected": -368.0, + "loss": 0.0152, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.38671875, + "rewards/margins": 9.6875, + "rewards/rejected": -9.25, + "step": 2051 + }, + { + "epoch": 2.517791411042945, + "grad_norm": 5.137677673890226, + "learning_rate": 8.119834710743801e-08, + "logits/chosen": -0.255859375, + "logits/rejected": -0.45703125, + "logps/chosen": -370.0, + "logps/rejected": -348.0, + "loss": 0.0213, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.1689453125, + "rewards/margins": 9.625, + "rewards/rejected": -9.75, + "step": 2052 + }, + { + "epoch": 2.5190184049079756, + "grad_norm": 5.2291318758535414, + "learning_rate": 8.099173553719008e-08, + "logits/chosen": -0.373046875, + "logits/rejected": -0.52734375, + "logps/chosen": -398.0, + "logps/rejected": -362.0, + "loss": 0.0168, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.2451171875, + "rewards/margins": 9.375, + "rewards/rejected": -9.625, + "step": 2053 + }, + { + "epoch": 2.5202453987730062, + "grad_norm": 4.685949678455865, + "learning_rate": 8.078512396694215e-08, + "logits/chosen": -0.2578125, + "logits/rejected": -0.474609375, + "logps/chosen": -452.0, + "logps/rejected": -394.0, + "loss": 0.0148, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.412109375, + "rewards/margins": 10.5625, + "rewards/rejected": -10.1875, + "step": 2054 + }, + { + "epoch": 2.521472392638037, + "grad_norm": 7.476469950804685, + "learning_rate": 8.057851239669421e-08, + "logits/chosen": -0.09521484375, + "logits/rejected": -0.259765625, + "logps/chosen": -358.0, + "logps/rejected": -350.0, + "loss": 0.0227, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.40234375, + "rewards/margins": 8.6875, + "rewards/rejected": -9.125, + "step": 2055 + }, + { + "epoch": 2.5226993865030676, + "grad_norm": 5.956656502903732, + "learning_rate": 8.037190082644628e-08, + "logits/chosen": -0.28515625, + "logits/rejected": -0.55078125, + "logps/chosen": -448.0, + "logps/rejected": -410.0, + "loss": 0.017, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.1259765625, + "rewards/margins": 10.1875, + "rewards/rejected": -10.3125, + "step": 2056 + }, + { + "epoch": 2.5239263803680982, + "grad_norm": 4.2633827558113735, + "learning_rate": 8.016528925619834e-08, + "logits/chosen": -0.296875, + "logits/rejected": -0.42578125, + "logps/chosen": -416.0, + "logps/rejected": -414.0, + "loss": 0.0126, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.3828125, + "rewards/margins": 10.4375, + "rewards/rejected": -10.0625, + "step": 2057 + }, + { + "epoch": 2.525153374233129, + "grad_norm": 8.249954084095695, + "learning_rate": 7.99586776859504e-08, + "logits/chosen": -0.330078125, + "logits/rejected": -0.466796875, + "logps/chosen": -434.0, + "logps/rejected": -426.0, + "loss": 0.0249, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.059814453125, + "rewards/margins": 10.0, + "rewards/rejected": -9.9375, + "step": 2058 + }, + { + "epoch": 2.5263803680981596, + "grad_norm": 4.283836055915162, + "learning_rate": 7.975206611570248e-08, + "logits/chosen": -0.296875, + "logits/rejected": -0.5078125, + "logps/chosen": -390.0, + "logps/rejected": -400.0, + "loss": 0.0111, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.375, + "rewards/margins": 10.25, + "rewards/rejected": -9.875, + "step": 2059 + }, + { + "epoch": 2.5276073619631902, + "grad_norm": 4.73071476935483, + "learning_rate": 7.954545454545454e-08, + "logits/chosen": -0.275390625, + "logits/rejected": -0.5, + "logps/chosen": -402.0, + "logps/rejected": -360.0, + "loss": 0.0144, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.0712890625, + "rewards/margins": 9.6875, + "rewards/rejected": -9.625, + "step": 2060 + }, + { + "epoch": 2.528834355828221, + "grad_norm": 4.571516542375547, + "learning_rate": 7.933884297520661e-08, + "logits/chosen": -0.275390625, + "logits/rejected": -0.4140625, + "logps/chosen": -380.0, + "logps/rejected": -404.0, + "loss": 0.0132, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.032958984375, + "rewards/margins": 9.9375, + "rewards/rejected": -9.875, + "step": 2061 + }, + { + "epoch": 2.5300613496932516, + "grad_norm": 4.45423875875844, + "learning_rate": 7.913223140495867e-08, + "logits/chosen": -0.267578125, + "logits/rejected": -0.423828125, + "logps/chosen": -398.0, + "logps/rejected": -394.0, + "loss": 0.0147, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.380859375, + "rewards/margins": 10.3125, + "rewards/rejected": -9.9375, + "step": 2062 + }, + { + "epoch": 2.5312883435582823, + "grad_norm": 4.994756080363643, + "learning_rate": 7.892561983471074e-08, + "logits/chosen": -0.421875, + "logits/rejected": -0.57421875, + "logps/chosen": -392.0, + "logps/rejected": -382.0, + "loss": 0.0138, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.0101318359375, + "rewards/margins": 10.25, + "rewards/rejected": -10.1875, + "step": 2063 + }, + { + "epoch": 2.532515337423313, + "grad_norm": 4.212857673705914, + "learning_rate": 7.87190082644628e-08, + "logits/chosen": -0.310546875, + "logits/rejected": -0.609375, + "logps/chosen": -436.0, + "logps/rejected": -400.0, + "loss": 0.0134, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4140625, + "rewards/margins": 9.9375, + "rewards/rejected": -9.5625, + "step": 2064 + }, + { + "epoch": 2.5337423312883436, + "grad_norm": 8.277063858091442, + "learning_rate": 7.851239669421488e-08, + "logits/chosen": -0.1689453125, + "logits/rejected": -0.337890625, + "logps/chosen": -414.0, + "logps/rejected": -378.0, + "loss": 0.0265, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.359375, + "rewards/margins": 8.875, + "rewards/rejected": -9.25, + "step": 2065 + }, + { + "epoch": 2.5349693251533743, + "grad_norm": 9.59840072120848, + "learning_rate": 7.830578512396694e-08, + "logits/chosen": -0.29296875, + "logits/rejected": -0.4296875, + "logps/chosen": -362.0, + "logps/rejected": -364.0, + "loss": 0.0371, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.310546875, + "rewards/margins": 9.0, + "rewards/rejected": -9.3125, + "step": 2066 + }, + { + "epoch": 2.536196319018405, + "grad_norm": 5.039126853182753, + "learning_rate": 7.8099173553719e-08, + "logits/chosen": -0.34765625, + "logits/rejected": -0.4765625, + "logps/chosen": -374.0, + "logps/rejected": -376.0, + "loss": 0.0155, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.220703125, + "rewards/margins": 9.6875, + "rewards/rejected": -9.9375, + "step": 2067 + }, + { + "epoch": 2.5374233128834356, + "grad_norm": 4.776369533055998, + "learning_rate": 7.789256198347106e-08, + "logits/chosen": -0.271484375, + "logits/rejected": -0.55078125, + "logps/chosen": -458.0, + "logps/rejected": -394.0, + "loss": 0.0122, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.84765625, + "rewards/margins": 11.1875, + "rewards/rejected": -10.3125, + "step": 2068 + }, + { + "epoch": 2.5386503067484663, + "grad_norm": 4.050871657520582, + "learning_rate": 7.768595041322313e-08, + "logits/chosen": -0.189453125, + "logits/rejected": -0.443359375, + "logps/chosen": -378.0, + "logps/rejected": -352.0, + "loss": 0.0118, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6796875, + "rewards/margins": 10.875, + "rewards/rejected": -10.1875, + "step": 2069 + }, + { + "epoch": 2.539877300613497, + "grad_norm": 3.7579389501039056, + "learning_rate": 7.74793388429752e-08, + "logits/chosen": -0.357421875, + "logits/rejected": -0.458984375, + "logps/chosen": -346.0, + "logps/rejected": -340.0, + "loss": 0.0121, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.03759765625, + "rewards/margins": 9.75, + "rewards/rejected": -9.8125, + "step": 2070 + }, + { + "epoch": 2.5411042944785276, + "grad_norm": 3.954520772430744, + "learning_rate": 7.727272727272727e-08, + "logits/chosen": -0.34375, + "logits/rejected": -0.55859375, + "logps/chosen": -430.0, + "logps/rejected": -378.0, + "loss": 0.0138, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.8515625, + "rewards/margins": 10.5, + "rewards/rejected": -9.6875, + "step": 2071 + }, + { + "epoch": 2.5423312883435583, + "grad_norm": 5.511537538679169, + "learning_rate": 7.706611570247934e-08, + "logits/chosen": -0.3359375, + "logits/rejected": -0.55859375, + "logps/chosen": -416.0, + "logps/rejected": -374.0, + "loss": 0.0127, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.185546875, + "rewards/margins": 9.5, + "rewards/rejected": -9.3125, + "step": 2072 + }, + { + "epoch": 2.543558282208589, + "grad_norm": 4.8686039938802255, + "learning_rate": 7.68595041322314e-08, + "logits/chosen": -0.384765625, + "logits/rejected": -0.58203125, + "logps/chosen": -410.0, + "logps/rejected": -390.0, + "loss": 0.0175, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.37109375, + "rewards/margins": 10.1875, + "rewards/rejected": -9.8125, + "step": 2073 + }, + { + "epoch": 2.5447852760736196, + "grad_norm": 5.294719533055856, + "learning_rate": 7.665289256198347e-08, + "logits/chosen": -0.3515625, + "logits/rejected": -0.65234375, + "logps/chosen": -420.0, + "logps/rejected": -384.0, + "loss": 0.0189, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.9765625, + "rewards/margins": 10.75, + "rewards/rejected": -9.8125, + "step": 2074 + }, + { + "epoch": 2.5460122699386503, + "grad_norm": 6.0790276754128145, + "learning_rate": 7.644628099173553e-08, + "logits/chosen": -0.23046875, + "logits/rejected": -0.5078125, + "logps/chosen": -400.0, + "logps/rejected": -368.0, + "loss": 0.0255, + "rewards/accuracies": 0.984375, + "rewards/chosen": 0.7578125, + "rewards/margins": 10.125, + "rewards/rejected": -9.375, + "step": 2075 + }, + { + "epoch": 2.547239263803681, + "grad_norm": 4.531026905251121, + "learning_rate": 7.62396694214876e-08, + "logits/chosen": -0.28125, + "logits/rejected": -0.470703125, + "logps/chosen": -356.0, + "logps/rejected": -364.0, + "loss": 0.0129, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.048828125, + "rewards/margins": 9.75, + "rewards/rejected": -9.75, + "step": 2076 + }, + { + "epoch": 2.5484662576687116, + "grad_norm": 2.8029050009381002, + "learning_rate": 7.603305785123966e-08, + "logits/chosen": -0.400390625, + "logits/rejected": -0.5078125, + "logps/chosen": -454.0, + "logps/rejected": -416.0, + "loss": 0.0091, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.412109375, + "rewards/margins": 10.8125, + "rewards/rejected": -10.4375, + "step": 2077 + }, + { + "epoch": 2.5496932515337423, + "grad_norm": 3.826747025101471, + "learning_rate": 7.582644628099173e-08, + "logits/chosen": -0.2890625, + "logits/rejected": -0.47265625, + "logps/chosen": -358.0, + "logps/rejected": -366.0, + "loss": 0.0188, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.49609375, + "rewards/margins": 9.0, + "rewards/rejected": -9.5, + "step": 2078 + }, + { + "epoch": 2.550920245398773, + "grad_norm": 4.847091466139291, + "learning_rate": 7.56198347107438e-08, + "logits/chosen": -0.2734375, + "logits/rejected": -0.546875, + "logps/chosen": -432.0, + "logps/rejected": -390.0, + "loss": 0.0133, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.84375, + "rewards/margins": 10.4375, + "rewards/rejected": -9.5625, + "step": 2079 + }, + { + "epoch": 2.5521472392638036, + "grad_norm": 7.4794285949939345, + "learning_rate": 7.541322314049586e-08, + "logits/chosen": -0.2412109375, + "logits/rejected": -0.41796875, + "logps/chosen": -424.0, + "logps/rejected": -378.0, + "loss": 0.0213, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.076171875, + "rewards/margins": 9.875, + "rewards/rejected": -9.9375, + "step": 2080 + }, + { + "epoch": 2.5533742331288343, + "grad_norm": 3.9114147745666186, + "learning_rate": 7.520661157024794e-08, + "logits/chosen": -0.30859375, + "logits/rejected": -0.43359375, + "logps/chosen": -366.0, + "logps/rejected": -376.0, + "loss": 0.0127, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.068359375, + "rewards/margins": 10.375, + "rewards/rejected": -10.4375, + "step": 2081 + }, + { + "epoch": 2.554601226993865, + "grad_norm": 4.578640314383085, + "learning_rate": 7.5e-08, + "logits/chosen": -0.263671875, + "logits/rejected": -0.44921875, + "logps/chosen": -390.0, + "logps/rejected": -358.0, + "loss": 0.016, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.8203125, + "rewards/margins": 10.5625, + "rewards/rejected": -9.75, + "step": 2082 + }, + { + "epoch": 2.5558282208588956, + "grad_norm": 5.453588940236682, + "learning_rate": 7.479338842975207e-08, + "logits/chosen": -0.177734375, + "logits/rejected": -0.353515625, + "logps/chosen": -376.0, + "logps/rejected": -362.0, + "loss": 0.0273, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.625, + "rewards/margins": 8.9375, + "rewards/rejected": -9.5625, + "step": 2083 + }, + { + "epoch": 2.5570552147239263, + "grad_norm": 4.962673298621751, + "learning_rate": 7.458677685950413e-08, + "logits/chosen": -0.30078125, + "logits/rejected": -0.458984375, + "logps/chosen": -414.0, + "logps/rejected": -404.0, + "loss": 0.0231, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.2294921875, + "rewards/margins": 10.1875, + "rewards/rejected": -9.9375, + "step": 2084 + }, + { + "epoch": 2.558282208588957, + "grad_norm": 4.1947762988507735, + "learning_rate": 7.438016528925619e-08, + "logits/chosen": -0.1640625, + "logits/rejected": -0.326171875, + "logps/chosen": -402.0, + "logps/rejected": -356.0, + "loss": 0.0127, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.2734375, + "rewards/margins": 9.1875, + "rewards/rejected": -9.5, + "step": 2085 + }, + { + "epoch": 2.5595092024539876, + "grad_norm": 3.8041701992712587, + "learning_rate": 7.417355371900825e-08, + "logits/chosen": -0.31640625, + "logits/rejected": -0.48828125, + "logps/chosen": -378.0, + "logps/rejected": -384.0, + "loss": 0.0139, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.2109375, + "rewards/margins": 10.125, + "rewards/rejected": -9.9375, + "step": 2086 + }, + { + "epoch": 2.5607361963190183, + "grad_norm": 2.795676994666709, + "learning_rate": 7.396694214876032e-08, + "logits/chosen": -0.2294921875, + "logits/rejected": -0.462890625, + "logps/chosen": -400.0, + "logps/rejected": -370.0, + "loss": 0.0087, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.00238037109375, + "rewards/margins": 10.75, + "rewards/rejected": -10.75, + "step": 2087 + }, + { + "epoch": 2.561963190184049, + "grad_norm": 3.1393035938229277, + "learning_rate": 7.37603305785124e-08, + "logits/chosen": -0.388671875, + "logits/rejected": -0.41796875, + "logps/chosen": -358.0, + "logps/rejected": -396.0, + "loss": 0.0094, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.005462646484375, + "rewards/margins": 10.4375, + "rewards/rejected": -10.4375, + "step": 2088 + }, + { + "epoch": 2.5631901840490796, + "grad_norm": 4.410632814302219, + "learning_rate": 7.355371900826446e-08, + "logits/chosen": -0.365234375, + "logits/rejected": -0.5703125, + "logps/chosen": -364.0, + "logps/rejected": -386.0, + "loss": 0.0168, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.240234375, + "rewards/margins": 10.75, + "rewards/rejected": -11.0, + "step": 2089 + }, + { + "epoch": 2.5644171779141103, + "grad_norm": 3.6281739441503795, + "learning_rate": 7.334710743801653e-08, + "logits/chosen": -0.41796875, + "logits/rejected": -0.49609375, + "logps/chosen": -378.0, + "logps/rejected": -392.0, + "loss": 0.015, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.11376953125, + "rewards/margins": 11.25, + "rewards/rejected": -11.375, + "step": 2090 + }, + { + "epoch": 2.565644171779141, + "grad_norm": 5.607221683072971, + "learning_rate": 7.314049586776859e-08, + "logits/chosen": -0.412109375, + "logits/rejected": -0.48828125, + "logps/chosen": -366.0, + "logps/rejected": -368.0, + "loss": 0.0177, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.275390625, + "rewards/margins": 9.875, + "rewards/rejected": -10.125, + "step": 2091 + }, + { + "epoch": 2.5668711656441716, + "grad_norm": 3.9931720836239766, + "learning_rate": 7.293388429752067e-08, + "logits/chosen": -0.29296875, + "logits/rejected": -0.55859375, + "logps/chosen": -454.0, + "logps/rejected": -412.0, + "loss": 0.0115, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.484375, + "rewards/margins": 11.5, + "rewards/rejected": -11.0, + "step": 2092 + }, + { + "epoch": 2.5680981595092023, + "grad_norm": 3.6395997674967178, + "learning_rate": 7.272727272727273e-08, + "logits/chosen": -0.24609375, + "logits/rejected": -0.400390625, + "logps/chosen": -398.0, + "logps/rejected": -386.0, + "loss": 0.0116, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.263671875, + "rewards/margins": 10.5625, + "rewards/rejected": -10.3125, + "step": 2093 + }, + { + "epoch": 2.5693251533742334, + "grad_norm": 4.713076003146637, + "learning_rate": 7.252066115702479e-08, + "logits/chosen": -0.294921875, + "logits/rejected": -0.49609375, + "logps/chosen": -396.0, + "logps/rejected": -376.0, + "loss": 0.0174, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.337890625, + "rewards/margins": 10.0, + "rewards/rejected": -10.375, + "step": 2094 + }, + { + "epoch": 2.5705521472392636, + "grad_norm": 10.016104982780496, + "learning_rate": 7.231404958677685e-08, + "logits/chosen": -0.353515625, + "logits/rejected": -0.45703125, + "logps/chosen": -426.0, + "logps/rejected": -394.0, + "loss": 0.0266, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.326171875, + "rewards/margins": 10.1875, + "rewards/rejected": -9.8125, + "step": 2095 + }, + { + "epoch": 2.5717791411042947, + "grad_norm": 5.532922386804478, + "learning_rate": 7.210743801652892e-08, + "logits/chosen": -0.2470703125, + "logits/rejected": -0.400390625, + "logps/chosen": -396.0, + "logps/rejected": -358.0, + "loss": 0.019, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.458984375, + "rewards/margins": 9.875, + "rewards/rejected": -10.3125, + "step": 2096 + }, + { + "epoch": 2.573006134969325, + "grad_norm": 4.632437730291063, + "learning_rate": 7.190082644628098e-08, + "logits/chosen": -0.20703125, + "logits/rejected": -0.375, + "logps/chosen": -414.0, + "logps/rejected": -408.0, + "loss": 0.0179, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.1806640625, + "rewards/margins": 9.8125, + "rewards/rejected": -10.0, + "step": 2097 + }, + { + "epoch": 2.574233128834356, + "grad_norm": 5.501170130416107, + "learning_rate": 7.169421487603305e-08, + "logits/chosen": -0.23828125, + "logits/rejected": -0.421875, + "logps/chosen": -388.0, + "logps/rejected": -362.0, + "loss": 0.0195, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.365234375, + "rewards/margins": 9.5625, + "rewards/rejected": -9.9375, + "step": 2098 + }, + { + "epoch": 2.5754601226993863, + "grad_norm": 6.678317480289005, + "learning_rate": 7.148760330578513e-08, + "logits/chosen": -0.220703125, + "logits/rejected": -0.408203125, + "logps/chosen": -406.0, + "logps/rejected": -394.0, + "loss": 0.0137, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.0001220703125, + "rewards/margins": 10.1875, + "rewards/rejected": -10.1875, + "step": 2099 + }, + { + "epoch": 2.5766871165644174, + "grad_norm": 4.008497694714325, + "learning_rate": 7.128099173553719e-08, + "logits/chosen": -0.265625, + "logits/rejected": -0.453125, + "logps/chosen": -400.0, + "logps/rejected": -390.0, + "loss": 0.0112, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.1298828125, + "rewards/margins": 10.375, + "rewards/rejected": -10.25, + "step": 2100 + }, + { + "epoch": 2.5779141104294476, + "grad_norm": 3.1670258370467894, + "learning_rate": 7.107438016528926e-08, + "logits/chosen": -0.296875, + "logits/rejected": -0.470703125, + "logps/chosen": -416.0, + "logps/rejected": -366.0, + "loss": 0.0089, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.8984375, + "rewards/margins": 10.9375, + "rewards/rejected": -10.0625, + "step": 2101 + }, + { + "epoch": 2.5791411042944787, + "grad_norm": 5.587462071530686, + "learning_rate": 7.086776859504132e-08, + "logits/chosen": -0.197265625, + "logits/rejected": -0.369140625, + "logps/chosen": -358.0, + "logps/rejected": -358.0, + "loss": 0.0157, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.032470703125, + "rewards/margins": 9.9375, + "rewards/rejected": -9.9375, + "step": 2102 + }, + { + "epoch": 2.580368098159509, + "grad_norm": 3.9820109878983803, + "learning_rate": 7.066115702479338e-08, + "logits/chosen": -0.1953125, + "logits/rejected": -0.330078125, + "logps/chosen": -380.0, + "logps/rejected": -388.0, + "loss": 0.012, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.2001953125, + "rewards/margins": 10.0, + "rewards/rejected": -9.75, + "step": 2103 + }, + { + "epoch": 2.58159509202454, + "grad_norm": 7.389850945444863, + "learning_rate": 7.045454545454544e-08, + "logits/chosen": -0.0673828125, + "logits/rejected": -0.30078125, + "logps/chosen": -350.0, + "logps/rejected": -336.0, + "loss": 0.0213, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.6953125, + "rewards/margins": 8.25, + "rewards/rejected": -8.9375, + "step": 2104 + }, + { + "epoch": 2.5828220858895703, + "grad_norm": 3.6025276366847874, + "learning_rate": 7.024793388429752e-08, + "logits/chosen": -0.2197265625, + "logits/rejected": -0.3984375, + "logps/chosen": -378.0, + "logps/rejected": -374.0, + "loss": 0.0117, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.40234375, + "rewards/margins": 10.125, + "rewards/rejected": -9.6875, + "step": 2105 + }, + { + "epoch": 2.5840490797546014, + "grad_norm": 3.4409437909598832, + "learning_rate": 7.004132231404958e-08, + "logits/chosen": -0.388671875, + "logits/rejected": -0.55859375, + "logps/chosen": -400.0, + "logps/rejected": -364.0, + "loss": 0.0113, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.1708984375, + "rewards/margins": 9.625, + "rewards/rejected": -9.75, + "step": 2106 + }, + { + "epoch": 2.5852760736196316, + "grad_norm": 4.934010517067252, + "learning_rate": 6.983471074380165e-08, + "logits/chosen": -0.392578125, + "logits/rejected": -0.55859375, + "logps/chosen": -384.0, + "logps/rejected": -384.0, + "loss": 0.0176, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.70703125, + "rewards/margins": 9.4375, + "rewards/rejected": -10.125, + "step": 2107 + }, + { + "epoch": 2.5865030674846627, + "grad_norm": 4.860700291008415, + "learning_rate": 6.962809917355372e-08, + "logits/chosen": -0.359375, + "logits/rejected": -0.55078125, + "logps/chosen": -424.0, + "logps/rejected": -382.0, + "loss": 0.0197, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.11181640625, + "rewards/margins": 9.4375, + "rewards/rejected": -9.3125, + "step": 2108 + }, + { + "epoch": 2.5877300613496934, + "grad_norm": 8.4219869837017, + "learning_rate": 6.942148760330578e-08, + "logits/chosen": -0.2119140625, + "logits/rejected": -0.416015625, + "logps/chosen": -404.0, + "logps/rejected": -370.0, + "loss": 0.023, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.75390625, + "rewards/margins": 9.5, + "rewards/rejected": -8.75, + "step": 2109 + }, + { + "epoch": 2.588957055214724, + "grad_norm": 4.017250388597033, + "learning_rate": 6.921487603305786e-08, + "logits/chosen": -0.25390625, + "logits/rejected": -0.3046875, + "logps/chosen": -408.0, + "logps/rejected": -382.0, + "loss": 0.0136, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4140625, + "rewards/margins": 9.8125, + "rewards/rejected": -9.4375, + "step": 2110 + }, + { + "epoch": 2.5901840490797547, + "grad_norm": 5.237759527299838, + "learning_rate": 6.900826446280992e-08, + "logits/chosen": -0.1806640625, + "logits/rejected": -0.28125, + "logps/chosen": -320.0, + "logps/rejected": -322.0, + "loss": 0.0189, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.30859375, + "rewards/margins": 8.625, + "rewards/rejected": -8.9375, + "step": 2111 + }, + { + "epoch": 2.5914110429447854, + "grad_norm": 3.075121421829525, + "learning_rate": 6.880165289256198e-08, + "logits/chosen": -0.11962890625, + "logits/rejected": -0.314453125, + "logps/chosen": -414.0, + "logps/rejected": -360.0, + "loss": 0.0102, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.01953125, + "rewards/margins": 9.625, + "rewards/rejected": -9.625, + "step": 2112 + }, + { + "epoch": 2.592638036809816, + "grad_norm": 5.944653428115269, + "learning_rate": 6.859504132231404e-08, + "logits/chosen": -0.244140625, + "logits/rejected": -0.375, + "logps/chosen": -370.0, + "logps/rejected": -342.0, + "loss": 0.0239, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.53515625, + "rewards/margins": 9.1875, + "rewards/rejected": -9.75, + "step": 2113 + }, + { + "epoch": 2.5938650306748468, + "grad_norm": 5.209671938934779, + "learning_rate": 6.838842975206611e-08, + "logits/chosen": -0.26171875, + "logits/rejected": -0.46875, + "logps/chosen": -380.0, + "logps/rejected": -346.0, + "loss": 0.0182, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.46875, + "rewards/margins": 9.3125, + "rewards/rejected": -8.875, + "step": 2114 + }, + { + "epoch": 2.5950920245398774, + "grad_norm": 4.8461921635224465, + "learning_rate": 6.818181818181817e-08, + "logits/chosen": -0.21484375, + "logits/rejected": -0.40234375, + "logps/chosen": -388.0, + "logps/rejected": -342.0, + "loss": 0.0223, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.8125, + "rewards/margins": 9.9375, + "rewards/rejected": -9.125, + "step": 2115 + }, + { + "epoch": 2.596319018404908, + "grad_norm": 5.431395135824396, + "learning_rate": 6.797520661157025e-08, + "logits/chosen": -0.12890625, + "logits/rejected": -0.267578125, + "logps/chosen": -356.0, + "logps/rejected": -354.0, + "loss": 0.0143, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.671875, + "rewards/margins": 8.9375, + "rewards/rejected": -8.25, + "step": 2116 + }, + { + "epoch": 2.5975460122699388, + "grad_norm": 4.081702266766246, + "learning_rate": 6.77685950413223e-08, + "logits/chosen": -0.328125, + "logits/rejected": -0.546875, + "logps/chosen": -372.0, + "logps/rejected": -356.0, + "loss": 0.0147, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.59375, + "rewards/margins": 9.75, + "rewards/rejected": -9.1875, + "step": 2117 + }, + { + "epoch": 2.5987730061349694, + "grad_norm": 5.5189088500712815, + "learning_rate": 6.756198347107438e-08, + "logits/chosen": -0.2197265625, + "logits/rejected": -0.318359375, + "logps/chosen": -388.0, + "logps/rejected": -342.0, + "loss": 0.0176, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.080078125, + "rewards/margins": 9.75, + "rewards/rejected": -9.875, + "step": 2118 + }, + { + "epoch": 2.6, + "grad_norm": 4.834477008591915, + "learning_rate": 6.735537190082645e-08, + "logits/chosen": -0.263671875, + "logits/rejected": -0.4140625, + "logps/chosen": -382.0, + "logps/rejected": -352.0, + "loss": 0.0199, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.86328125, + "rewards/margins": 10.125, + "rewards/rejected": -9.3125, + "step": 2119 + }, + { + "epoch": 2.6012269938650308, + "grad_norm": 4.737199595590765, + "learning_rate": 6.714876033057851e-08, + "logits/chosen": -0.263671875, + "logits/rejected": -0.5, + "logps/chosen": -420.0, + "logps/rejected": -410.0, + "loss": 0.0154, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.54296875, + "rewards/margins": 9.5625, + "rewards/rejected": -9.0, + "step": 2120 + }, + { + "epoch": 2.6024539877300614, + "grad_norm": 5.564430036876529, + "learning_rate": 6.694214876033057e-08, + "logits/chosen": -0.310546875, + "logits/rejected": -0.48046875, + "logps/chosen": -384.0, + "logps/rejected": -382.0, + "loss": 0.0179, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.3828125, + "rewards/margins": 9.8125, + "rewards/rejected": -9.375, + "step": 2121 + }, + { + "epoch": 2.603680981595092, + "grad_norm": 3.7333025445001575, + "learning_rate": 6.673553719008263e-08, + "logits/chosen": -0.322265625, + "logits/rejected": -0.53515625, + "logps/chosen": -368.0, + "logps/rejected": -366.0, + "loss": 0.0169, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.1357421875, + "rewards/margins": 9.0, + "rewards/rejected": -8.875, + "step": 2122 + }, + { + "epoch": 2.6049079754601228, + "grad_norm": 5.372234874806413, + "learning_rate": 6.652892561983471e-08, + "logits/chosen": -0.189453125, + "logits/rejected": -0.384765625, + "logps/chosen": -380.0, + "logps/rejected": -344.0, + "loss": 0.0227, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.328125, + "rewards/margins": 9.0625, + "rewards/rejected": -8.75, + "step": 2123 + }, + { + "epoch": 2.6061349693251534, + "grad_norm": 4.0051714919934085, + "learning_rate": 6.632231404958677e-08, + "logits/chosen": -0.294921875, + "logits/rejected": -0.5234375, + "logps/chosen": -418.0, + "logps/rejected": -350.0, + "loss": 0.0102, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.0, + "rewards/margins": 10.375, + "rewards/rejected": -9.375, + "step": 2124 + }, + { + "epoch": 2.607361963190184, + "grad_norm": 3.456802314292605, + "learning_rate": 6.611570247933884e-08, + "logits/chosen": -0.271484375, + "logits/rejected": -0.51171875, + "logps/chosen": -398.0, + "logps/rejected": -430.0, + "loss": 0.0151, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.70703125, + "rewards/margins": 10.375, + "rewards/rejected": -9.625, + "step": 2125 + }, + { + "epoch": 2.6085889570552148, + "grad_norm": 4.9428526320285275, + "learning_rate": 6.59090909090909e-08, + "logits/chosen": -0.255859375, + "logits/rejected": -0.447265625, + "logps/chosen": -400.0, + "logps/rejected": -374.0, + "loss": 0.0164, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.60546875, + "rewards/margins": 9.5625, + "rewards/rejected": -8.9375, + "step": 2126 + }, + { + "epoch": 2.6098159509202454, + "grad_norm": 4.472059193007503, + "learning_rate": 6.570247933884298e-08, + "logits/chosen": -0.388671875, + "logits/rejected": -0.56640625, + "logps/chosen": -414.0, + "logps/rejected": -380.0, + "loss": 0.0117, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.09375, + "rewards/margins": 10.125, + "rewards/rejected": -9.0625, + "step": 2127 + }, + { + "epoch": 2.611042944785276, + "grad_norm": 3.573081632883371, + "learning_rate": 6.549586776859505e-08, + "logits/chosen": -0.306640625, + "logits/rejected": -0.515625, + "logps/chosen": -458.0, + "logps/rejected": -388.0, + "loss": 0.0109, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.53125, + "rewards/margins": 10.8125, + "rewards/rejected": -10.25, + "step": 2128 + }, + { + "epoch": 2.6122699386503068, + "grad_norm": 5.167426637395523, + "learning_rate": 6.528925619834711e-08, + "logits/chosen": -0.306640625, + "logits/rejected": -0.53515625, + "logps/chosen": -434.0, + "logps/rejected": -402.0, + "loss": 0.0157, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.56640625, + "rewards/margins": 10.0625, + "rewards/rejected": -9.5, + "step": 2129 + }, + { + "epoch": 2.6134969325153374, + "grad_norm": 7.52350810012445, + "learning_rate": 6.508264462809917e-08, + "logits/chosen": -0.365234375, + "logits/rejected": -0.60546875, + "logps/chosen": -384.0, + "logps/rejected": -374.0, + "loss": 0.0188, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.09521484375, + "rewards/margins": 9.8125, + "rewards/rejected": -9.75, + "step": 2130 + }, + { + "epoch": 2.614723926380368, + "grad_norm": 7.050915338599457, + "learning_rate": 6.487603305785123e-08, + "logits/chosen": -0.29296875, + "logits/rejected": -0.44140625, + "logps/chosen": -376.0, + "logps/rejected": -400.0, + "loss": 0.0222, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.6484375, + "rewards/margins": 9.6875, + "rewards/rejected": -10.375, + "step": 2131 + }, + { + "epoch": 2.6159509202453988, + "grad_norm": 3.5569561585085006, + "learning_rate": 6.46694214876033e-08, + "logits/chosen": -0.2138671875, + "logits/rejected": -0.310546875, + "logps/chosen": -410.0, + "logps/rejected": -412.0, + "loss": 0.011, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5, + "rewards/margins": 9.375, + "rewards/rejected": -8.875, + "step": 2132 + }, + { + "epoch": 2.6171779141104294, + "grad_norm": 6.001152223243349, + "learning_rate": 6.446280991735536e-08, + "logits/chosen": -0.265625, + "logits/rejected": -0.482421875, + "logps/chosen": -414.0, + "logps/rejected": -380.0, + "loss": 0.0147, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.92578125, + "rewards/margins": 10.6875, + "rewards/rejected": -9.75, + "step": 2133 + }, + { + "epoch": 2.61840490797546, + "grad_norm": 4.37426519818206, + "learning_rate": 6.425619834710744e-08, + "logits/chosen": -0.275390625, + "logits/rejected": -0.54296875, + "logps/chosen": -434.0, + "logps/rejected": -418.0, + "loss": 0.0145, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.51171875, + "rewards/margins": 10.375, + "rewards/rejected": -9.8125, + "step": 2134 + }, + { + "epoch": 2.6196319018404908, + "grad_norm": 7.24041739345886, + "learning_rate": 6.40495867768595e-08, + "logits/chosen": -0.251953125, + "logits/rejected": -0.40234375, + "logps/chosen": -402.0, + "logps/rejected": -370.0, + "loss": 0.022, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.357421875, + "rewards/margins": 9.1875, + "rewards/rejected": -9.5625, + "step": 2135 + }, + { + "epoch": 2.6208588957055214, + "grad_norm": 4.533332290503176, + "learning_rate": 6.384297520661157e-08, + "logits/chosen": -0.306640625, + "logits/rejected": -0.62109375, + "logps/chosen": -472.0, + "logps/rejected": -404.0, + "loss": 0.0142, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.93359375, + "rewards/margins": 10.875, + "rewards/rejected": -10.0, + "step": 2136 + }, + { + "epoch": 2.622085889570552, + "grad_norm": 5.345457301909781, + "learning_rate": 6.363636363636363e-08, + "logits/chosen": -0.1416015625, + "logits/rejected": -0.375, + "logps/chosen": -346.0, + "logps/rejected": -340.0, + "loss": 0.0183, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.302734375, + "rewards/margins": 10.1875, + "rewards/rejected": -9.875, + "step": 2137 + }, + { + "epoch": 2.6233128834355828, + "grad_norm": 7.984704707634555, + "learning_rate": 6.34297520661157e-08, + "logits/chosen": -0.404296875, + "logits/rejected": -0.55859375, + "logps/chosen": -382.0, + "logps/rejected": -402.0, + "loss": 0.0229, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.07275390625, + "rewards/margins": 9.625, + "rewards/rejected": -9.6875, + "step": 2138 + }, + { + "epoch": 2.6245398773006134, + "grad_norm": 3.4454568205824705, + "learning_rate": 6.322314049586777e-08, + "logits/chosen": -0.2734375, + "logits/rejected": -0.451171875, + "logps/chosen": -422.0, + "logps/rejected": -404.0, + "loss": 0.0094, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.34375, + "rewards/margins": 10.625, + "rewards/rejected": -10.3125, + "step": 2139 + }, + { + "epoch": 2.625766871165644, + "grad_norm": 5.3431606018894096, + "learning_rate": 6.301652892561983e-08, + "logits/chosen": -0.294921875, + "logits/rejected": -0.4453125, + "logps/chosen": -354.0, + "logps/rejected": -332.0, + "loss": 0.0194, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.451171875, + "rewards/margins": 9.625, + "rewards/rejected": -10.0625, + "step": 2140 + }, + { + "epoch": 2.626993865030675, + "grad_norm": 4.884434258020845, + "learning_rate": 6.28099173553719e-08, + "logits/chosen": -0.224609375, + "logits/rejected": -0.318359375, + "logps/chosen": -404.0, + "logps/rejected": -362.0, + "loss": 0.0132, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.2119140625, + "rewards/margins": 9.5625, + "rewards/rejected": -9.8125, + "step": 2141 + }, + { + "epoch": 2.6282208588957054, + "grad_norm": 9.946639135733136, + "learning_rate": 6.260330578512396e-08, + "logits/chosen": -0.298828125, + "logits/rejected": -0.51953125, + "logps/chosen": -384.0, + "logps/rejected": -380.0, + "loss": 0.0207, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.1962890625, + "rewards/margins": 10.25, + "rewards/rejected": -10.0625, + "step": 2142 + }, + { + "epoch": 2.629447852760736, + "grad_norm": 5.811799470438696, + "learning_rate": 6.239669421487603e-08, + "logits/chosen": -0.15234375, + "logits/rejected": -0.306640625, + "logps/chosen": -416.0, + "logps/rejected": -384.0, + "loss": 0.0145, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.2294921875, + "rewards/margins": 10.0625, + "rewards/rejected": -9.8125, + "step": 2143 + }, + { + "epoch": 2.630674846625767, + "grad_norm": 4.57444453424348, + "learning_rate": 6.21900826446281e-08, + "logits/chosen": -0.349609375, + "logits/rejected": -0.451171875, + "logps/chosen": -378.0, + "logps/rejected": -384.0, + "loss": 0.0151, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.1416015625, + "rewards/margins": 9.625, + "rewards/rejected": -9.75, + "step": 2144 + }, + { + "epoch": 2.6319018404907975, + "grad_norm": 4.14050223958243, + "learning_rate": 6.198347107438017e-08, + "logits/chosen": -0.11279296875, + "logits/rejected": -0.251953125, + "logps/chosen": -374.0, + "logps/rejected": -350.0, + "loss": 0.0134, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.357421875, + "rewards/margins": 9.9375, + "rewards/rejected": -9.625, + "step": 2145 + }, + { + "epoch": 2.633128834355828, + "grad_norm": 7.280110613507197, + "learning_rate": 6.177685950413223e-08, + "logits/chosen": -0.1806640625, + "logits/rejected": -0.33984375, + "logps/chosen": -398.0, + "logps/rejected": -400.0, + "loss": 0.0217, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.28515625, + "rewards/margins": 9.75, + "rewards/rejected": -10.0, + "step": 2146 + }, + { + "epoch": 2.634355828220859, + "grad_norm": 4.463522031708956, + "learning_rate": 6.157024793388429e-08, + "logits/chosen": -0.248046875, + "logits/rejected": -0.396484375, + "logps/chosen": -376.0, + "logps/rejected": -346.0, + "loss": 0.0132, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.41796875, + "rewards/margins": 9.375, + "rewards/rejected": -9.8125, + "step": 2147 + }, + { + "epoch": 2.6355828220858895, + "grad_norm": 8.500240831322394, + "learning_rate": 6.136363636363636e-08, + "logits/chosen": -0.244140625, + "logits/rejected": -0.453125, + "logps/chosen": -368.0, + "logps/rejected": -368.0, + "loss": 0.031, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.373046875, + "rewards/margins": 8.875, + "rewards/rejected": -9.25, + "step": 2148 + }, + { + "epoch": 2.63680981595092, + "grad_norm": 4.155930191016974, + "learning_rate": 6.115702479338842e-08, + "logits/chosen": -0.291015625, + "logits/rejected": -0.48828125, + "logps/chosen": -384.0, + "logps/rejected": -380.0, + "loss": 0.0136, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.1552734375, + "rewards/margins": 9.9375, + "rewards/rejected": -9.75, + "step": 2149 + }, + { + "epoch": 2.638036809815951, + "grad_norm": 5.5280072580527015, + "learning_rate": 6.09504132231405e-08, + "logits/chosen": -0.291015625, + "logits/rejected": -0.439453125, + "logps/chosen": -350.0, + "logps/rejected": -358.0, + "loss": 0.0179, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.17578125, + "rewards/margins": 9.0625, + "rewards/rejected": -8.875, + "step": 2150 + }, + { + "epoch": 2.6392638036809815, + "grad_norm": 4.805592746648088, + "learning_rate": 6.074380165289256e-08, + "logits/chosen": -0.33984375, + "logits/rejected": -0.578125, + "logps/chosen": -434.0, + "logps/rejected": -382.0, + "loss": 0.0146, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.35546875, + "rewards/margins": 10.3125, + "rewards/rejected": -9.9375, + "step": 2151 + }, + { + "epoch": 2.640490797546012, + "grad_norm": 4.493652553519595, + "learning_rate": 6.053719008264462e-08, + "logits/chosen": -0.310546875, + "logits/rejected": -0.57421875, + "logps/chosen": -432.0, + "logps/rejected": -344.0, + "loss": 0.0143, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.2119140625, + "rewards/margins": 9.4375, + "rewards/rejected": -9.25, + "step": 2152 + }, + { + "epoch": 2.641717791411043, + "grad_norm": 5.373636780879808, + "learning_rate": 6.033057851239669e-08, + "logits/chosen": -0.1982421875, + "logits/rejected": -0.361328125, + "logps/chosen": -360.0, + "logps/rejected": -352.0, + "loss": 0.0185, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.2734375, + "rewards/margins": 9.375, + "rewards/rejected": -9.625, + "step": 2153 + }, + { + "epoch": 2.6429447852760735, + "grad_norm": 4.34111901837397, + "learning_rate": 6.012396694214876e-08, + "logits/chosen": -0.25390625, + "logits/rejected": -0.46484375, + "logps/chosen": -432.0, + "logps/rejected": -368.0, + "loss": 0.0142, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.0849609375, + "rewards/margins": 10.1875, + "rewards/rejected": -10.3125, + "step": 2154 + }, + { + "epoch": 2.644171779141104, + "grad_norm": 5.187241385192399, + "learning_rate": 5.991735537190082e-08, + "logits/chosen": -0.166015625, + "logits/rejected": -0.361328125, + "logps/chosen": -360.0, + "logps/rejected": -348.0, + "loss": 0.0178, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.0546875, + "rewards/margins": 9.3125, + "rewards/rejected": -9.25, + "step": 2155 + }, + { + "epoch": 2.645398773006135, + "grad_norm": 3.0478885185002267, + "learning_rate": 5.971074380165288e-08, + "logits/chosen": -0.2275390625, + "logits/rejected": -0.400390625, + "logps/chosen": -410.0, + "logps/rejected": -396.0, + "loss": 0.0087, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.1953125, + "rewards/margins": 10.0625, + "rewards/rejected": -9.875, + "step": 2156 + }, + { + "epoch": 2.646625766871166, + "grad_norm": 2.759397014539251, + "learning_rate": 5.950413223140496e-08, + "logits/chosen": -0.265625, + "logits/rejected": -0.3984375, + "logps/chosen": -416.0, + "logps/rejected": -404.0, + "loss": 0.0084, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.83203125, + "rewards/margins": 10.75, + "rewards/rejected": -9.9375, + "step": 2157 + }, + { + "epoch": 2.647852760736196, + "grad_norm": 6.983059713435933, + "learning_rate": 5.9297520661157025e-08, + "logits/chosen": -0.345703125, + "logits/rejected": -0.51953125, + "logps/chosen": -408.0, + "logps/rejected": -362.0, + "loss": 0.0204, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.294921875, + "rewards/margins": 9.5, + "rewards/rejected": -9.25, + "step": 2158 + }, + { + "epoch": 2.6490797546012272, + "grad_norm": 5.703935938813981, + "learning_rate": 5.9090909090909085e-08, + "logits/chosen": -0.4453125, + "logits/rejected": -0.58984375, + "logps/chosen": -360.0, + "logps/rejected": -360.0, + "loss": 0.0158, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.4453125, + "rewards/margins": 9.8125, + "rewards/rejected": -10.3125, + "step": 2159 + }, + { + "epoch": 2.6503067484662575, + "grad_norm": 6.528171106716255, + "learning_rate": 5.888429752066115e-08, + "logits/chosen": -0.2255859375, + "logits/rejected": -0.421875, + "logps/chosen": -402.0, + "logps/rejected": -350.0, + "loss": 0.0171, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.1640625, + "rewards/margins": 9.5, + "rewards/rejected": -9.3125, + "step": 2160 + }, + { + "epoch": 2.6515337423312886, + "grad_norm": 4.63048741149375, + "learning_rate": 5.867768595041322e-08, + "logits/chosen": -0.2265625, + "logits/rejected": -0.341796875, + "logps/chosen": -358.0, + "logps/rejected": -348.0, + "loss": 0.0173, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.046875, + "rewards/margins": 10.0625, + "rewards/rejected": -10.125, + "step": 2161 + }, + { + "epoch": 2.652760736196319, + "grad_norm": 5.809065717170921, + "learning_rate": 5.8471074380165286e-08, + "logits/chosen": -0.373046875, + "logits/rejected": -0.55078125, + "logps/chosen": -396.0, + "logps/rejected": -384.0, + "loss": 0.0168, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.62109375, + "rewards/margins": 9.5, + "rewards/rejected": -10.125, + "step": 2162 + }, + { + "epoch": 2.65398773006135, + "grad_norm": 5.693613835808198, + "learning_rate": 5.826446280991735e-08, + "logits/chosen": -0.173828125, + "logits/rejected": -0.359375, + "logps/chosen": -414.0, + "logps/rejected": -384.0, + "loss": 0.018, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.8125, + "rewards/margins": 10.375, + "rewards/rejected": -9.5625, + "step": 2163 + }, + { + "epoch": 2.65521472392638, + "grad_norm": 4.035748095755746, + "learning_rate": 5.805785123966942e-08, + "logits/chosen": -0.373046875, + "logits/rejected": -0.55078125, + "logps/chosen": -406.0, + "logps/rejected": -364.0, + "loss": 0.0129, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5234375, + "rewards/margins": 10.0, + "rewards/rejected": -9.5, + "step": 2164 + }, + { + "epoch": 2.6564417177914113, + "grad_norm": 6.001065706997156, + "learning_rate": 5.785123966942149e-08, + "logits/chosen": -0.220703125, + "logits/rejected": -0.36328125, + "logps/chosen": -394.0, + "logps/rejected": -376.0, + "loss": 0.0156, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.330078125, + "rewards/margins": 9.3125, + "rewards/rejected": -9.6875, + "step": 2165 + }, + { + "epoch": 2.6576687116564415, + "grad_norm": 4.116110025560348, + "learning_rate": 5.7644628099173554e-08, + "logits/chosen": -0.34765625, + "logits/rejected": -0.54296875, + "logps/chosen": -428.0, + "logps/rejected": -410.0, + "loss": 0.0213, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.072265625, + "rewards/margins": 10.1875, + "rewards/rejected": -10.125, + "step": 2166 + }, + { + "epoch": 2.6588957055214726, + "grad_norm": 3.780744415505408, + "learning_rate": 5.7438016528925614e-08, + "logits/chosen": -0.166015625, + "logits/rejected": -0.294921875, + "logps/chosen": -402.0, + "logps/rejected": -376.0, + "loss": 0.0136, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.007080078125, + "rewards/margins": 9.1875, + "rewards/rejected": -9.1875, + "step": 2167 + }, + { + "epoch": 2.660122699386503, + "grad_norm": 5.373084792801061, + "learning_rate": 5.723140495867768e-08, + "logits/chosen": -0.22265625, + "logits/rejected": -0.375, + "logps/chosen": -362.0, + "logps/rejected": -336.0, + "loss": 0.0144, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.1591796875, + "rewards/margins": 9.375, + "rewards/rejected": -9.5625, + "step": 2168 + }, + { + "epoch": 2.661349693251534, + "grad_norm": 4.185328692806901, + "learning_rate": 5.702479338842975e-08, + "logits/chosen": -0.357421875, + "logits/rejected": -0.58984375, + "logps/chosen": -410.0, + "logps/rejected": -410.0, + "loss": 0.0159, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.423828125, + "rewards/margins": 10.6875, + "rewards/rejected": -10.25, + "step": 2169 + }, + { + "epoch": 2.662576687116564, + "grad_norm": 6.45344595886177, + "learning_rate": 5.6818181818181815e-08, + "logits/chosen": -0.29296875, + "logits/rejected": -0.376953125, + "logps/chosen": -370.0, + "logps/rejected": -386.0, + "loss": 0.0239, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.138671875, + "rewards/margins": 9.5625, + "rewards/rejected": -9.4375, + "step": 2170 + }, + { + "epoch": 2.6638036809815953, + "grad_norm": 3.799258345741279, + "learning_rate": 5.661157024793388e-08, + "logits/chosen": -0.265625, + "logits/rejected": -0.484375, + "logps/chosen": -400.0, + "logps/rejected": -366.0, + "loss": 0.0129, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6171875, + "rewards/margins": 9.8125, + "rewards/rejected": -9.1875, + "step": 2171 + }, + { + "epoch": 2.665030674846626, + "grad_norm": 4.24314033959681, + "learning_rate": 5.640495867768594e-08, + "logits/chosen": -0.310546875, + "logits/rejected": -0.48828125, + "logps/chosen": -324.0, + "logps/rejected": -352.0, + "loss": 0.0191, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.1015625, + "rewards/margins": 9.8125, + "rewards/rejected": -9.75, + "step": 2172 + }, + { + "epoch": 2.6662576687116566, + "grad_norm": 2.998958981889124, + "learning_rate": 5.6198347107438016e-08, + "logits/chosen": -0.3203125, + "logits/rejected": -0.427734375, + "logps/chosen": -390.0, + "logps/rejected": -396.0, + "loss": 0.0089, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.369140625, + "rewards/margins": 10.375, + "rewards/rejected": -10.0, + "step": 2173 + }, + { + "epoch": 2.6674846625766873, + "grad_norm": 4.209384842258259, + "learning_rate": 5.599173553719008e-08, + "logits/chosen": -0.28515625, + "logits/rejected": -0.439453125, + "logps/chosen": -372.0, + "logps/rejected": -362.0, + "loss": 0.0151, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.37109375, + "rewards/margins": 9.4375, + "rewards/rejected": -9.8125, + "step": 2174 + }, + { + "epoch": 2.668711656441718, + "grad_norm": 5.368670547470727, + "learning_rate": 5.578512396694215e-08, + "logits/chosen": -0.314453125, + "logits/rejected": -0.51171875, + "logps/chosen": -382.0, + "logps/rejected": -360.0, + "loss": 0.0181, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.0025634765625, + "rewards/margins": 9.8125, + "rewards/rejected": -9.8125, + "step": 2175 + }, + { + "epoch": 2.6699386503067486, + "grad_norm": 5.019782477019031, + "learning_rate": 5.557851239669421e-08, + "logits/chosen": -0.373046875, + "logits/rejected": -0.53515625, + "logps/chosen": -404.0, + "logps/rejected": -386.0, + "loss": 0.0218, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.10888671875, + "rewards/margins": 9.75, + "rewards/rejected": -9.875, + "step": 2176 + }, + { + "epoch": 2.6711656441717793, + "grad_norm": 3.1414857412529615, + "learning_rate": 5.537190082644628e-08, + "logits/chosen": -0.369140625, + "logits/rejected": -0.484375, + "logps/chosen": -378.0, + "logps/rejected": -378.0, + "loss": 0.0106, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.10888671875, + "rewards/margins": 10.25, + "rewards/rejected": -10.1875, + "step": 2177 + }, + { + "epoch": 2.67239263803681, + "grad_norm": 5.354151171478511, + "learning_rate": 5.5165289256198344e-08, + "logits/chosen": -0.22265625, + "logits/rejected": -0.34765625, + "logps/chosen": -362.0, + "logps/rejected": -332.0, + "loss": 0.0209, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.2041015625, + "rewards/margins": 8.75, + "rewards/rejected": -8.9375, + "step": 2178 + }, + { + "epoch": 2.6736196319018406, + "grad_norm": 4.560951250529504, + "learning_rate": 5.495867768595041e-08, + "logits/chosen": -0.2265625, + "logits/rejected": -0.375, + "logps/chosen": -364.0, + "logps/rejected": -362.0, + "loss": 0.0134, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.17578125, + "rewards/margins": 9.75, + "rewards/rejected": -9.9375, + "step": 2179 + }, + { + "epoch": 2.6748466257668713, + "grad_norm": 5.9363216876862355, + "learning_rate": 5.475206611570248e-08, + "logits/chosen": -0.28515625, + "logits/rejected": -0.37109375, + "logps/chosen": -354.0, + "logps/rejected": -380.0, + "loss": 0.0188, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.62109375, + "rewards/margins": 8.75, + "rewards/rejected": -9.375, + "step": 2180 + }, + { + "epoch": 2.676073619631902, + "grad_norm": 4.938606048569286, + "learning_rate": 5.454545454545454e-08, + "logits/chosen": -0.2021484375, + "logits/rejected": -0.384765625, + "logps/chosen": -400.0, + "logps/rejected": -350.0, + "loss": 0.0173, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.74609375, + "rewards/margins": 8.5, + "rewards/rejected": -9.25, + "step": 2181 + }, + { + "epoch": 2.6773006134969326, + "grad_norm": 4.701083239234094, + "learning_rate": 5.4338842975206605e-08, + "logits/chosen": -0.314453125, + "logits/rejected": -0.439453125, + "logps/chosen": -350.0, + "logps/rejected": -358.0, + "loss": 0.0136, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.044189453125, + "rewards/margins": 9.8125, + "rewards/rejected": -9.8125, + "step": 2182 + }, + { + "epoch": 2.6785276073619633, + "grad_norm": 9.687465852069591, + "learning_rate": 5.413223140495868e-08, + "logits/chosen": -0.384765625, + "logits/rejected": -0.57421875, + "logps/chosen": -360.0, + "logps/rejected": -344.0, + "loss": 0.0195, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.076171875, + "rewards/margins": 10.625, + "rewards/rejected": -10.5, + "step": 2183 + }, + { + "epoch": 2.679754601226994, + "grad_norm": 4.966675695553107, + "learning_rate": 5.3925619834710746e-08, + "logits/chosen": -0.322265625, + "logits/rejected": -0.412109375, + "logps/chosen": -372.0, + "logps/rejected": -372.0, + "loss": 0.0154, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.5078125, + "rewards/margins": 9.5, + "rewards/rejected": -10.0, + "step": 2184 + }, + { + "epoch": 2.6809815950920246, + "grad_norm": 5.435541248494877, + "learning_rate": 5.3719008264462806e-08, + "logits/chosen": -0.29296875, + "logits/rejected": -0.5234375, + "logps/chosen": -384.0, + "logps/rejected": -374.0, + "loss": 0.0144, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.318359375, + "rewards/margins": 10.0625, + "rewards/rejected": -10.375, + "step": 2185 + }, + { + "epoch": 2.6822085889570553, + "grad_norm": 5.432545185466505, + "learning_rate": 5.351239669421487e-08, + "logits/chosen": -0.1650390625, + "logits/rejected": -0.232421875, + "logps/chosen": -334.0, + "logps/rejected": -370.0, + "loss": 0.02, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.71875, + "rewards/margins": 9.3125, + "rewards/rejected": -10.0, + "step": 2186 + }, + { + "epoch": 2.683435582822086, + "grad_norm": 5.158215627079551, + "learning_rate": 5.330578512396694e-08, + "logits/chosen": -0.375, + "logits/rejected": -0.48046875, + "logps/chosen": -364.0, + "logps/rejected": -374.0, + "loss": 0.0149, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.0693359375, + "rewards/margins": 10.625, + "rewards/rejected": -10.6875, + "step": 2187 + }, + { + "epoch": 2.6846625766871166, + "grad_norm": 4.289184825378351, + "learning_rate": 5.309917355371901e-08, + "logits/chosen": -0.236328125, + "logits/rejected": -0.466796875, + "logps/chosen": -408.0, + "logps/rejected": -364.0, + "loss": 0.0142, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.255859375, + "rewards/margins": 10.0, + "rewards/rejected": -10.25, + "step": 2188 + }, + { + "epoch": 2.6858895705521473, + "grad_norm": 4.579245758740167, + "learning_rate": 5.2892561983471074e-08, + "logits/chosen": -0.37109375, + "logits/rejected": -0.55859375, + "logps/chosen": -400.0, + "logps/rejected": -362.0, + "loss": 0.0152, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.0439453125, + "rewards/margins": 9.9375, + "rewards/rejected": -10.0, + "step": 2189 + }, + { + "epoch": 2.687116564417178, + "grad_norm": 5.893309506038807, + "learning_rate": 5.2685950413223134e-08, + "logits/chosen": -0.380859375, + "logits/rejected": -0.578125, + "logps/chosen": -430.0, + "logps/rejected": -386.0, + "loss": 0.0166, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.396484375, + "rewards/margins": 10.3125, + "rewards/rejected": -9.9375, + "step": 2190 + }, + { + "epoch": 2.6883435582822086, + "grad_norm": 1.9565532384274265, + "learning_rate": 5.24793388429752e-08, + "logits/chosen": -0.28515625, + "logits/rejected": -0.498046875, + "logps/chosen": -408.0, + "logps/rejected": -360.0, + "loss": 0.0114, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.609375, + "rewards/margins": 10.8125, + "rewards/rejected": -10.1875, + "step": 2191 + }, + { + "epoch": 2.6895705521472393, + "grad_norm": 6.575464906490675, + "learning_rate": 5.227272727272727e-08, + "logits/chosen": -0.244140625, + "logits/rejected": -0.3828125, + "logps/chosen": -378.0, + "logps/rejected": -394.0, + "loss": 0.0217, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.1884765625, + "rewards/margins": 9.9375, + "rewards/rejected": -10.125, + "step": 2192 + }, + { + "epoch": 2.69079754601227, + "grad_norm": 3.267124531161651, + "learning_rate": 5.206611570247934e-08, + "logits/chosen": -0.2138671875, + "logits/rejected": -0.283203125, + "logps/chosen": -370.0, + "logps/rejected": -356.0, + "loss": 0.0092, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.439453125, + "rewards/margins": 9.8125, + "rewards/rejected": -10.25, + "step": 2193 + }, + { + "epoch": 2.6920245398773006, + "grad_norm": 5.871041619795656, + "learning_rate": 5.18595041322314e-08, + "logits/chosen": -0.32421875, + "logits/rejected": -0.42578125, + "logps/chosen": -410.0, + "logps/rejected": -406.0, + "loss": 0.0189, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.1552734375, + "rewards/margins": 9.8125, + "rewards/rejected": -10.0, + "step": 2194 + }, + { + "epoch": 2.6932515337423313, + "grad_norm": 7.03632086518888, + "learning_rate": 5.165289256198347e-08, + "logits/chosen": -0.251953125, + "logits/rejected": -0.412109375, + "logps/chosen": -488.0, + "logps/rejected": -432.0, + "loss": 0.0194, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.296875, + "rewards/margins": 10.3125, + "rewards/rejected": -10.0, + "step": 2195 + }, + { + "epoch": 2.694478527607362, + "grad_norm": 4.7942025138250255, + "learning_rate": 5.1446280991735536e-08, + "logits/chosen": -0.4140625, + "logits/rejected": -0.63671875, + "logps/chosen": -400.0, + "logps/rejected": -378.0, + "loss": 0.0132, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.376953125, + "rewards/margins": 10.6875, + "rewards/rejected": -10.25, + "step": 2196 + }, + { + "epoch": 2.6957055214723926, + "grad_norm": 3.9478850014074527, + "learning_rate": 5.12396694214876e-08, + "logits/chosen": -0.31640625, + "logits/rejected": -0.59375, + "logps/chosen": -444.0, + "logps/rejected": -398.0, + "loss": 0.0105, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.76953125, + "rewards/margins": 11.3125, + "rewards/rejected": -10.5, + "step": 2197 + }, + { + "epoch": 2.6969325153374233, + "grad_norm": 5.600477512733808, + "learning_rate": 5.103305785123967e-08, + "logits/chosen": -0.322265625, + "logits/rejected": -0.400390625, + "logps/chosen": -408.0, + "logps/rejected": -378.0, + "loss": 0.0169, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.166015625, + "rewards/margins": 9.9375, + "rewards/rejected": -10.125, + "step": 2198 + }, + { + "epoch": 2.698159509202454, + "grad_norm": 6.634996778151442, + "learning_rate": 5.082644628099173e-08, + "logits/chosen": -0.25, + "logits/rejected": -0.494140625, + "logps/chosen": -448.0, + "logps/rejected": -394.0, + "loss": 0.0187, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.0400390625, + "rewards/margins": 10.1875, + "rewards/rejected": -10.1875, + "step": 2199 + }, + { + "epoch": 2.6993865030674846, + "grad_norm": 3.673223022353457, + "learning_rate": 5.06198347107438e-08, + "logits/chosen": -0.1630859375, + "logits/rejected": -0.328125, + "logps/chosen": -392.0, + "logps/rejected": -380.0, + "loss": 0.0135, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.07275390625, + "rewards/margins": 9.6875, + "rewards/rejected": -9.8125, + "step": 2200 + }, + { + "epoch": 2.7006134969325153, + "grad_norm": 6.441229552909222, + "learning_rate": 5.0413223140495864e-08, + "logits/chosen": -0.3203125, + "logits/rejected": -0.578125, + "logps/chosen": -456.0, + "logps/rejected": -432.0, + "loss": 0.0137, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.3984375, + "rewards/margins": 11.625, + "rewards/rejected": -10.1875, + "step": 2201 + }, + { + "epoch": 2.701840490797546, + "grad_norm": 10.995165819984125, + "learning_rate": 5.020661157024793e-08, + "logits/chosen": -0.255859375, + "logits/rejected": -0.359375, + "logps/chosen": -392.0, + "logps/rejected": -378.0, + "loss": 0.027, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.2177734375, + "rewards/margins": 9.5625, + "rewards/rejected": -9.8125, + "step": 2202 + }, + { + "epoch": 2.7030674846625766, + "grad_norm": 6.546530032834828, + "learning_rate": 5e-08, + "logits/chosen": -0.20703125, + "logits/rejected": -0.451171875, + "logps/chosen": -396.0, + "logps/rejected": -358.0, + "loss": 0.0178, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.5859375, + "rewards/margins": 10.0, + "rewards/rejected": -10.5625, + "step": 2203 + }, + { + "epoch": 2.7042944785276073, + "grad_norm": 4.657288686257257, + "learning_rate": 4.9793388429752065e-08, + "logits/chosen": -0.310546875, + "logits/rejected": -0.486328125, + "logps/chosen": -410.0, + "logps/rejected": -378.0, + "loss": 0.0105, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.099609375, + "rewards/margins": 10.6875, + "rewards/rejected": -10.75, + "step": 2204 + }, + { + "epoch": 2.705521472392638, + "grad_norm": 3.9120817890547794, + "learning_rate": 4.958677685950413e-08, + "logits/chosen": -0.265625, + "logits/rejected": -0.423828125, + "logps/chosen": -380.0, + "logps/rejected": -356.0, + "loss": 0.0138, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.30859375, + "rewards/margins": 9.75, + "rewards/rejected": -10.0625, + "step": 2205 + }, + { + "epoch": 2.7067484662576686, + "grad_norm": 4.074805435756812, + "learning_rate": 4.93801652892562e-08, + "logits/chosen": -0.3203125, + "logits/rejected": -0.373046875, + "logps/chosen": -350.0, + "logps/rejected": -374.0, + "loss": 0.0194, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.236328125, + "rewards/margins": 10.25, + "rewards/rejected": -10.5, + "step": 2206 + }, + { + "epoch": 2.7079754601226993, + "grad_norm": 5.493978432115817, + "learning_rate": 4.9173553719008266e-08, + "logits/chosen": -0.296875, + "logits/rejected": -0.46875, + "logps/chosen": -390.0, + "logps/rejected": -396.0, + "loss": 0.0172, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.408203125, + "rewards/margins": 9.5, + "rewards/rejected": -9.9375, + "step": 2207 + }, + { + "epoch": 2.70920245398773, + "grad_norm": 4.427894875955212, + "learning_rate": 4.8966942148760326e-08, + "logits/chosen": -0.359375, + "logits/rejected": -0.6015625, + "logps/chosen": -418.0, + "logps/rejected": -406.0, + "loss": 0.0116, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.359375, + "rewards/margins": 11.4375, + "rewards/rejected": -11.125, + "step": 2208 + }, + { + "epoch": 2.7104294478527606, + "grad_norm": 5.057257640021764, + "learning_rate": 4.876033057851239e-08, + "logits/chosen": -0.37109375, + "logits/rejected": -0.5625, + "logps/chosen": -412.0, + "logps/rejected": -386.0, + "loss": 0.0234, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.2080078125, + "rewards/margins": 10.5625, + "rewards/rejected": -10.3125, + "step": 2209 + }, + { + "epoch": 2.7116564417177913, + "grad_norm": 7.9736035615488206, + "learning_rate": 4.855371900826446e-08, + "logits/chosen": -0.259765625, + "logits/rejected": -0.466796875, + "logps/chosen": -390.0, + "logps/rejected": -352.0, + "loss": 0.0263, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.2236328125, + "rewards/margins": 10.125, + "rewards/rejected": -10.375, + "step": 2210 + }, + { + "epoch": 2.712883435582822, + "grad_norm": 7.304499135036712, + "learning_rate": 4.8347107438016527e-08, + "logits/chosen": -0.26171875, + "logits/rejected": -0.43359375, + "logps/chosen": -368.0, + "logps/rejected": -376.0, + "loss": 0.0146, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.74609375, + "rewards/margins": 9.625, + "rewards/rejected": -10.375, + "step": 2211 + }, + { + "epoch": 2.7141104294478526, + "grad_norm": 5.727823331324457, + "learning_rate": 4.8140495867768594e-08, + "logits/chosen": -0.341796875, + "logits/rejected": -0.50390625, + "logps/chosen": -428.0, + "logps/rejected": -380.0, + "loss": 0.0254, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.3515625, + "rewards/margins": 10.125, + "rewards/rejected": -10.5, + "step": 2212 + }, + { + "epoch": 2.7153374233128833, + "grad_norm": 5.101582288302789, + "learning_rate": 4.793388429752066e-08, + "logits/chosen": -0.265625, + "logits/rejected": -0.5, + "logps/chosen": -422.0, + "logps/rejected": -402.0, + "loss": 0.015, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5, + "rewards/margins": 10.4375, + "rewards/rejected": -9.9375, + "step": 2213 + }, + { + "epoch": 2.716564417177914, + "grad_norm": 4.733364033305934, + "learning_rate": 4.772727272727273e-08, + "logits/chosen": -0.181640625, + "logits/rejected": -0.404296875, + "logps/chosen": -372.0, + "logps/rejected": -354.0, + "loss": 0.0176, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.2314453125, + "rewards/margins": 9.6875, + "rewards/rejected": -9.875, + "step": 2214 + }, + { + "epoch": 2.7177914110429446, + "grad_norm": 4.8373033851580844, + "learning_rate": 4.7520661157024794e-08, + "logits/chosen": -0.255859375, + "logits/rejected": -0.392578125, + "logps/chosen": -386.0, + "logps/rejected": -400.0, + "loss": 0.0131, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.115234375, + "rewards/margins": 10.875, + "rewards/rejected": -11.0, + "step": 2215 + }, + { + "epoch": 2.7190184049079753, + "grad_norm": 7.2526286154484945, + "learning_rate": 4.7314049586776855e-08, + "logits/chosen": -0.1416015625, + "logits/rejected": -0.37109375, + "logps/chosen": -372.0, + "logps/rejected": -370.0, + "loss": 0.0275, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.376953125, + "rewards/margins": 9.8125, + "rewards/rejected": -10.1875, + "step": 2216 + }, + { + "epoch": 2.720245398773006, + "grad_norm": 3.6005550984184627, + "learning_rate": 4.710743801652892e-08, + "logits/chosen": -0.25, + "logits/rejected": -0.447265625, + "logps/chosen": -424.0, + "logps/rejected": -378.0, + "loss": 0.0171, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.341796875, + "rewards/margins": 10.1875, + "rewards/rejected": -9.875, + "step": 2217 + }, + { + "epoch": 2.721472392638037, + "grad_norm": 4.564286034120757, + "learning_rate": 4.690082644628099e-08, + "logits/chosen": -0.27734375, + "logits/rejected": -0.455078125, + "logps/chosen": -388.0, + "logps/rejected": -370.0, + "loss": 0.0185, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.17578125, + "rewards/margins": 10.375, + "rewards/rejected": -10.5625, + "step": 2218 + }, + { + "epoch": 2.7226993865030673, + "grad_norm": 4.026445377028431, + "learning_rate": 4.6694214876033056e-08, + "logits/chosen": -0.240234375, + "logits/rejected": -0.44140625, + "logps/chosen": -402.0, + "logps/rejected": -402.0, + "loss": 0.015, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.234375, + "rewards/margins": 10.0, + "rewards/rejected": -10.25, + "step": 2219 + }, + { + "epoch": 2.7239263803680984, + "grad_norm": 3.9243489215422076, + "learning_rate": 4.648760330578512e-08, + "logits/chosen": -0.296875, + "logits/rejected": -0.5078125, + "logps/chosen": -438.0, + "logps/rejected": -378.0, + "loss": 0.0149, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.921875, + "rewards/margins": 11.125, + "rewards/rejected": -10.25, + "step": 2220 + }, + { + "epoch": 2.7251533742331286, + "grad_norm": 4.574514245314263, + "learning_rate": 4.628099173553718e-08, + "logits/chosen": -0.19140625, + "logits/rejected": -0.314453125, + "logps/chosen": -382.0, + "logps/rejected": -400.0, + "loss": 0.024, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.310546875, + "rewards/margins": 10.5, + "rewards/rejected": -10.8125, + "step": 2221 + }, + { + "epoch": 2.7263803680981598, + "grad_norm": 4.538521040842785, + "learning_rate": 4.6074380165289256e-08, + "logits/chosen": -0.25390625, + "logits/rejected": -0.4609375, + "logps/chosen": -412.0, + "logps/rejected": -400.0, + "loss": 0.0134, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.447265625, + "rewards/margins": 9.9375, + "rewards/rejected": -10.375, + "step": 2222 + }, + { + "epoch": 2.72760736196319, + "grad_norm": 6.109317790055887, + "learning_rate": 4.5867768595041323e-08, + "logits/chosen": -0.193359375, + "logits/rejected": -0.40625, + "logps/chosen": -418.0, + "logps/rejected": -374.0, + "loss": 0.0157, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.291015625, + "rewards/margins": 10.5625, + "rewards/rejected": -10.3125, + "step": 2223 + }, + { + "epoch": 2.728834355828221, + "grad_norm": 9.16154363037481, + "learning_rate": 4.566115702479339e-08, + "logits/chosen": -0.248046875, + "logits/rejected": -0.40625, + "logps/chosen": -408.0, + "logps/rejected": -364.0, + "loss": 0.0226, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.546875, + "rewards/margins": 9.5625, + "rewards/rejected": -10.125, + "step": 2224 + }, + { + "epoch": 2.7300613496932513, + "grad_norm": 4.102904681515829, + "learning_rate": 4.545454545454545e-08, + "logits/chosen": -0.298828125, + "logits/rejected": -0.4140625, + "logps/chosen": -378.0, + "logps/rejected": -388.0, + "loss": 0.0171, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.1748046875, + "rewards/margins": 10.0, + "rewards/rejected": -10.1875, + "step": 2225 + }, + { + "epoch": 2.7312883435582824, + "grad_norm": 5.601230760620754, + "learning_rate": 4.524793388429752e-08, + "logits/chosen": -0.2216796875, + "logits/rejected": -0.486328125, + "logps/chosen": -444.0, + "logps/rejected": -394.0, + "loss": 0.0138, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.19140625, + "rewards/margins": 10.125, + "rewards/rejected": -10.3125, + "step": 2226 + }, + { + "epoch": 2.7325153374233127, + "grad_norm": 4.736746696833797, + "learning_rate": 4.5041322314049585e-08, + "logits/chosen": -0.255859375, + "logits/rejected": -0.345703125, + "logps/chosen": -346.0, + "logps/rejected": -398.0, + "loss": 0.0176, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.69140625, + "rewards/margins": 9.25, + "rewards/rejected": -10.0, + "step": 2227 + }, + { + "epoch": 2.7337423312883438, + "grad_norm": 13.72339724498813, + "learning_rate": 4.483471074380165e-08, + "logits/chosen": -0.2578125, + "logits/rejected": -0.5078125, + "logps/chosen": -372.0, + "logps/rejected": -344.0, + "loss": 0.0251, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.2353515625, + "rewards/margins": 10.4375, + "rewards/rejected": -10.625, + "step": 2228 + }, + { + "epoch": 2.734969325153374, + "grad_norm": 6.092547219030361, + "learning_rate": 4.462809917355372e-08, + "logits/chosen": -0.126953125, + "logits/rejected": -0.390625, + "logps/chosen": -388.0, + "logps/rejected": -356.0, + "loss": 0.0183, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5, + "rewards/margins": 10.3125, + "rewards/rejected": -9.8125, + "step": 2229 + }, + { + "epoch": 2.736196319018405, + "grad_norm": 6.478414618978289, + "learning_rate": 4.442148760330578e-08, + "logits/chosen": -0.390625, + "logits/rejected": -0.6015625, + "logps/chosen": -414.0, + "logps/rejected": -384.0, + "loss": 0.0128, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.56640625, + "rewards/margins": 11.4375, + "rewards/rejected": -10.875, + "step": 2230 + }, + { + "epoch": 2.7374233128834353, + "grad_norm": 5.084087786660665, + "learning_rate": 4.4214876033057846e-08, + "logits/chosen": -0.32421875, + "logits/rejected": -0.58203125, + "logps/chosen": -384.0, + "logps/rejected": -356.0, + "loss": 0.0175, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4375, + "rewards/margins": 10.9375, + "rewards/rejected": -10.5, + "step": 2231 + }, + { + "epoch": 2.7386503067484664, + "grad_norm": 6.893201781260533, + "learning_rate": 4.400826446280992e-08, + "logits/chosen": -0.294921875, + "logits/rejected": -0.423828125, + "logps/chosen": -346.0, + "logps/rejected": -376.0, + "loss": 0.0226, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.75, + "rewards/margins": 9.8125, + "rewards/rejected": -10.5625, + "step": 2232 + }, + { + "epoch": 2.7398773006134967, + "grad_norm": 6.782606082597347, + "learning_rate": 4.3801652892561986e-08, + "logits/chosen": -0.3671875, + "logits/rejected": -0.5859375, + "logps/chosen": -432.0, + "logps/rejected": -412.0, + "loss": 0.0182, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.0810546875, + "rewards/margins": 10.5, + "rewards/rejected": -10.375, + "step": 2233 + }, + { + "epoch": 2.7411042944785278, + "grad_norm": 3.369672010833607, + "learning_rate": 4.3595041322314047e-08, + "logits/chosen": -0.365234375, + "logits/rejected": -0.58203125, + "logps/chosen": -428.0, + "logps/rejected": -412.0, + "loss": 0.0158, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.12109375, + "rewards/margins": 10.8125, + "rewards/rejected": -10.6875, + "step": 2234 + }, + { + "epoch": 2.7423312883435584, + "grad_norm": 4.347045339078717, + "learning_rate": 4.3388429752066114e-08, + "logits/chosen": -0.201171875, + "logits/rejected": -0.294921875, + "logps/chosen": -328.0, + "logps/rejected": -362.0, + "loss": 0.0168, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.25390625, + "rewards/margins": 9.75, + "rewards/rejected": -10.0625, + "step": 2235 + }, + { + "epoch": 2.743558282208589, + "grad_norm": 4.550816980789058, + "learning_rate": 4.318181818181818e-08, + "logits/chosen": -0.224609375, + "logits/rejected": -0.373046875, + "logps/chosen": -444.0, + "logps/rejected": -442.0, + "loss": 0.012, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.30078125, + "rewards/margins": 10.5, + "rewards/rejected": -10.1875, + "step": 2236 + }, + { + "epoch": 2.7447852760736198, + "grad_norm": 11.105941570810998, + "learning_rate": 4.297520661157025e-08, + "logits/chosen": -0.32421875, + "logits/rejected": -0.5390625, + "logps/chosen": -408.0, + "logps/rejected": -364.0, + "loss": 0.0271, + "rewards/accuracies": 0.984375, + "rewards/chosen": -0.16015625, + "rewards/margins": 9.8125, + "rewards/rejected": -9.9375, + "step": 2237 + }, + { + "epoch": 2.7460122699386504, + "grad_norm": 3.0258229487712263, + "learning_rate": 4.2768595041322314e-08, + "logits/chosen": -0.263671875, + "logits/rejected": -0.40234375, + "logps/chosen": -366.0, + "logps/rejected": -400.0, + "loss": 0.0092, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.30859375, + "rewards/margins": 10.5, + "rewards/rejected": -10.8125, + "step": 2238 + }, + { + "epoch": 2.747239263803681, + "grad_norm": 6.701380515353283, + "learning_rate": 4.2561983471074375e-08, + "logits/chosen": -0.330078125, + "logits/rejected": -0.486328125, + "logps/chosen": -360.0, + "logps/rejected": -358.0, + "loss": 0.0199, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.1279296875, + "rewards/margins": 10.5, + "rewards/rejected": -10.375, + "step": 2239 + }, + { + "epoch": 2.7484662576687118, + "grad_norm": 5.338877661202331, + "learning_rate": 4.235537190082644e-08, + "logits/chosen": -0.29296875, + "logits/rejected": -0.388671875, + "logps/chosen": -420.0, + "logps/rejected": -402.0, + "loss": 0.0273, + "rewards/accuracies": 0.984375, + "rewards/chosen": -0.057373046875, + "rewards/margins": 10.0625, + "rewards/rejected": -10.125, + "step": 2240 + }, + { + "epoch": 2.7496932515337424, + "grad_norm": 8.81228273404, + "learning_rate": 4.214876033057851e-08, + "logits/chosen": -0.298828125, + "logits/rejected": -0.38671875, + "logps/chosen": -368.0, + "logps/rejected": -376.0, + "loss": 0.0222, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.52734375, + "rewards/margins": 9.5, + "rewards/rejected": -10.0625, + "step": 2241 + }, + { + "epoch": 2.750920245398773, + "grad_norm": 6.203115561678589, + "learning_rate": 4.194214876033058e-08, + "logits/chosen": -0.3046875, + "logits/rejected": -0.4765625, + "logps/chosen": -346.0, + "logps/rejected": -346.0, + "loss": 0.0193, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.07421875, + "rewards/margins": 9.875, + "rewards/rejected": -9.8125, + "step": 2242 + }, + { + "epoch": 2.752147239263804, + "grad_norm": 5.140777656995009, + "learning_rate": 4.173553719008264e-08, + "logits/chosen": -0.33203125, + "logits/rejected": -0.427734375, + "logps/chosen": -396.0, + "logps/rejected": -384.0, + "loss": 0.0183, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.232421875, + "rewards/margins": 10.125, + "rewards/rejected": -10.375, + "step": 2243 + }, + { + "epoch": 2.7533742331288344, + "grad_norm": 5.37084879206341, + "learning_rate": 4.152892561983471e-08, + "logits/chosen": -0.34375, + "logits/rejected": -0.50390625, + "logps/chosen": -392.0, + "logps/rejected": -370.0, + "loss": 0.0196, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.5390625, + "rewards/margins": 10.25, + "rewards/rejected": -10.75, + "step": 2244 + }, + { + "epoch": 2.754601226993865, + "grad_norm": 8.041376332284571, + "learning_rate": 4.1322314049586776e-08, + "logits/chosen": -0.201171875, + "logits/rejected": -0.427734375, + "logps/chosen": -396.0, + "logps/rejected": -378.0, + "loss": 0.0226, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5234375, + "rewards/margins": 10.0625, + "rewards/rejected": -9.5625, + "step": 2245 + }, + { + "epoch": 2.755828220858896, + "grad_norm": 7.693334942435798, + "learning_rate": 4.111570247933884e-08, + "logits/chosen": -0.349609375, + "logits/rejected": -0.546875, + "logps/chosen": -352.0, + "logps/rejected": -328.0, + "loss": 0.0254, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.349609375, + "rewards/margins": 9.5625, + "rewards/rejected": -9.9375, + "step": 2246 + }, + { + "epoch": 2.7570552147239265, + "grad_norm": 4.111653193925938, + "learning_rate": 4.090909090909091e-08, + "logits/chosen": -0.275390625, + "logits/rejected": -0.474609375, + "logps/chosen": -444.0, + "logps/rejected": -410.0, + "loss": 0.0128, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.45703125, + "rewards/margins": 11.4375, + "rewards/rejected": -11.0, + "step": 2247 + }, + { + "epoch": 2.758282208588957, + "grad_norm": 7.058417332338, + "learning_rate": 4.070247933884297e-08, + "logits/chosen": -0.27734375, + "logits/rejected": -0.376953125, + "logps/chosen": -412.0, + "logps/rejected": -394.0, + "loss": 0.0243, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.609375, + "rewards/margins": 9.4375, + "rewards/rejected": -10.0, + "step": 2248 + }, + { + "epoch": 2.759509202453988, + "grad_norm": 8.026686572044982, + "learning_rate": 4.049586776859504e-08, + "logits/chosen": -0.283203125, + "logits/rejected": -0.423828125, + "logps/chosen": -432.0, + "logps/rejected": -358.0, + "loss": 0.024, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.349609375, + "rewards/margins": 9.375, + "rewards/rejected": -9.0625, + "step": 2249 + }, + { + "epoch": 2.7607361963190185, + "grad_norm": 5.8653142974546775, + "learning_rate": 4.0289256198347104e-08, + "logits/chosen": -0.216796875, + "logits/rejected": -0.388671875, + "logps/chosen": -364.0, + "logps/rejected": -368.0, + "loss": 0.0209, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.11572265625, + "rewards/margins": 8.75, + "rewards/rejected": -8.875, + "step": 2250 + }, + { + "epoch": 2.761963190184049, + "grad_norm": 5.850853355191937, + "learning_rate": 4.008264462809917e-08, + "logits/chosen": -0.220703125, + "logits/rejected": -0.369140625, + "logps/chosen": -374.0, + "logps/rejected": -360.0, + "loss": 0.0194, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.474609375, + "rewards/margins": 8.9375, + "rewards/rejected": -9.4375, + "step": 2251 + }, + { + "epoch": 2.76319018404908, + "grad_norm": 8.163974033234508, + "learning_rate": 3.987603305785124e-08, + "logits/chosen": -0.2470703125, + "logits/rejected": -0.404296875, + "logps/chosen": -398.0, + "logps/rejected": -432.0, + "loss": 0.0214, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.33984375, + "rewards/margins": 10.0, + "rewards/rejected": -10.375, + "step": 2252 + }, + { + "epoch": 2.7644171779141105, + "grad_norm": 4.104441337054119, + "learning_rate": 3.9669421487603305e-08, + "logits/chosen": -0.38671875, + "logits/rejected": -0.52734375, + "logps/chosen": -404.0, + "logps/rejected": -390.0, + "loss": 0.0126, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.4921875, + "rewards/margins": 9.75, + "rewards/rejected": -10.1875, + "step": 2253 + }, + { + "epoch": 2.765644171779141, + "grad_norm": 6.118783316584425, + "learning_rate": 3.946280991735537e-08, + "logits/chosen": -0.279296875, + "logits/rejected": -0.458984375, + "logps/chosen": -364.0, + "logps/rejected": -354.0, + "loss": 0.0275, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.228515625, + "rewards/margins": 9.9375, + "rewards/rejected": -9.6875, + "step": 2254 + }, + { + "epoch": 2.766871165644172, + "grad_norm": 5.183974056113008, + "learning_rate": 3.925619834710744e-08, + "logits/chosen": -0.2314453125, + "logits/rejected": -0.408203125, + "logps/chosen": -390.0, + "logps/rejected": -386.0, + "loss": 0.0167, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.02685546875, + "rewards/margins": 10.3125, + "rewards/rejected": -10.3125, + "step": 2255 + }, + { + "epoch": 2.7680981595092025, + "grad_norm": 6.769877341641651, + "learning_rate": 3.90495867768595e-08, + "logits/chosen": -0.26171875, + "logits/rejected": -0.44140625, + "logps/chosen": -414.0, + "logps/rejected": -366.0, + "loss": 0.0221, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.65234375, + "rewards/margins": 9.5625, + "rewards/rejected": -10.25, + "step": 2256 + }, + { + "epoch": 2.769325153374233, + "grad_norm": 4.314738448457369, + "learning_rate": 3.8842975206611566e-08, + "logits/chosen": -0.29296875, + "logits/rejected": -0.51171875, + "logps/chosen": -422.0, + "logps/rejected": -412.0, + "loss": 0.0112, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.4609375, + "rewards/margins": 9.9375, + "rewards/rejected": -10.375, + "step": 2257 + }, + { + "epoch": 2.770552147239264, + "grad_norm": 4.260575031021047, + "learning_rate": 3.8636363636363633e-08, + "logits/chosen": -0.265625, + "logits/rejected": -0.44140625, + "logps/chosen": -382.0, + "logps/rejected": -380.0, + "loss": 0.0124, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.4453125, + "rewards/margins": 9.8125, + "rewards/rejected": -10.3125, + "step": 2258 + }, + { + "epoch": 2.7717791411042945, + "grad_norm": 7.340748272518618, + "learning_rate": 3.84297520661157e-08, + "logits/chosen": -0.349609375, + "logits/rejected": -0.47265625, + "logps/chosen": -436.0, + "logps/rejected": -418.0, + "loss": 0.0218, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.3203125, + "rewards/margins": 9.4375, + "rewards/rejected": -9.75, + "step": 2259 + }, + { + "epoch": 2.773006134969325, + "grad_norm": 5.589351592917868, + "learning_rate": 3.822314049586777e-08, + "logits/chosen": -0.384765625, + "logits/rejected": -0.5703125, + "logps/chosen": -378.0, + "logps/rejected": -366.0, + "loss": 0.0179, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.828125, + "rewards/margins": 9.9375, + "rewards/rejected": -10.8125, + "step": 2260 + }, + { + "epoch": 2.774233128834356, + "grad_norm": 5.774569876754217, + "learning_rate": 3.801652892561983e-08, + "logits/chosen": -0.251953125, + "logits/rejected": -0.462890625, + "logps/chosen": -410.0, + "logps/rejected": -418.0, + "loss": 0.0173, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.65234375, + "rewards/margins": 10.1875, + "rewards/rejected": -9.5625, + "step": 2261 + }, + { + "epoch": 2.7754601226993865, + "grad_norm": 4.756864359352574, + "learning_rate": 3.78099173553719e-08, + "logits/chosen": -0.37890625, + "logits/rejected": -0.55859375, + "logps/chosen": -434.0, + "logps/rejected": -382.0, + "loss": 0.0148, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.16796875, + "rewards/margins": 10.5, + "rewards/rejected": -10.6875, + "step": 2262 + }, + { + "epoch": 2.776687116564417, + "grad_norm": 2.890426670901585, + "learning_rate": 3.760330578512397e-08, + "logits/chosen": -0.291015625, + "logits/rejected": -0.439453125, + "logps/chosen": -400.0, + "logps/rejected": -374.0, + "loss": 0.0127, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.2275390625, + "rewards/margins": 10.9375, + "rewards/rejected": -11.1875, + "step": 2263 + }, + { + "epoch": 2.777914110429448, + "grad_norm": 4.28489377814865, + "learning_rate": 3.7396694214876035e-08, + "logits/chosen": -0.236328125, + "logits/rejected": -0.3828125, + "logps/chosen": -380.0, + "logps/rejected": -382.0, + "loss": 0.0142, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.4921875, + "rewards/margins": 9.5625, + "rewards/rejected": -10.0625, + "step": 2264 + }, + { + "epoch": 2.7791411042944785, + "grad_norm": 3.5194578711409976, + "learning_rate": 3.7190082644628095e-08, + "logits/chosen": -0.302734375, + "logits/rejected": -0.43359375, + "logps/chosen": -414.0, + "logps/rejected": -384.0, + "loss": 0.0113, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.095703125, + "rewards/margins": 10.125, + "rewards/rejected": -10.25, + "step": 2265 + }, + { + "epoch": 2.780368098159509, + "grad_norm": 3.6217002036273818, + "learning_rate": 3.698347107438016e-08, + "logits/chosen": -0.294921875, + "logits/rejected": -0.5234375, + "logps/chosen": -448.0, + "logps/rejected": -392.0, + "loss": 0.0103, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.08251953125, + "rewards/margins": 10.375, + "rewards/rejected": -10.25, + "step": 2266 + }, + { + "epoch": 2.78159509202454, + "grad_norm": 4.307712978409588, + "learning_rate": 3.677685950413223e-08, + "logits/chosen": -0.349609375, + "logits/rejected": -0.55078125, + "logps/chosen": -472.0, + "logps/rejected": -412.0, + "loss": 0.0142, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.5234375, + "rewards/margins": 10.6875, + "rewards/rejected": -10.125, + "step": 2267 + }, + { + "epoch": 2.7828220858895705, + "grad_norm": 5.30116871518542, + "learning_rate": 3.6570247933884296e-08, + "logits/chosen": -0.12060546875, + "logits/rejected": -0.2265625, + "logps/chosen": -388.0, + "logps/rejected": -384.0, + "loss": 0.0181, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.30078125, + "rewards/margins": 8.9375, + "rewards/rejected": -9.25, + "step": 2268 + }, + { + "epoch": 2.784049079754601, + "grad_norm": 5.071445902345003, + "learning_rate": 3.636363636363636e-08, + "logits/chosen": -0.33203125, + "logits/rejected": -0.474609375, + "logps/chosen": -388.0, + "logps/rejected": -376.0, + "loss": 0.0164, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.2138671875, + "rewards/margins": 9.9375, + "rewards/rejected": -9.6875, + "step": 2269 + }, + { + "epoch": 2.785276073619632, + "grad_norm": 4.993578375739971, + "learning_rate": 3.6157024793388424e-08, + "logits/chosen": -0.396484375, + "logits/rejected": -0.51171875, + "logps/chosen": -420.0, + "logps/rejected": -400.0, + "loss": 0.0194, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.53125, + "rewards/margins": 9.8125, + "rewards/rejected": -10.3125, + "step": 2270 + }, + { + "epoch": 2.7865030674846625, + "grad_norm": 5.506272778074537, + "learning_rate": 3.595041322314049e-08, + "logits/chosen": -0.177734375, + "logits/rejected": -0.375, + "logps/chosen": -390.0, + "logps/rejected": -380.0, + "loss": 0.0203, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.65625, + "rewards/margins": 9.25, + "rewards/rejected": -9.875, + "step": 2271 + }, + { + "epoch": 2.787730061349693, + "grad_norm": 5.590772625216088, + "learning_rate": 3.5743801652892564e-08, + "logits/chosen": -0.298828125, + "logits/rejected": -0.49609375, + "logps/chosen": -412.0, + "logps/rejected": -388.0, + "loss": 0.0248, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.08447265625, + "rewards/margins": 10.125, + "rewards/rejected": -10.25, + "step": 2272 + }, + { + "epoch": 2.788957055214724, + "grad_norm": 4.740180506502867, + "learning_rate": 3.553719008264463e-08, + "logits/chosen": -0.1728515625, + "logits/rejected": -0.33984375, + "logps/chosen": -452.0, + "logps/rejected": -386.0, + "loss": 0.0131, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.13671875, + "rewards/margins": 10.125, + "rewards/rejected": -10.0, + "step": 2273 + }, + { + "epoch": 2.7901840490797545, + "grad_norm": 3.9264745254765345, + "learning_rate": 3.533057851239669e-08, + "logits/chosen": -0.267578125, + "logits/rejected": -0.482421875, + "logps/chosen": -436.0, + "logps/rejected": -368.0, + "loss": 0.014, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6015625, + "rewards/margins": 10.125, + "rewards/rejected": -9.5625, + "step": 2274 + }, + { + "epoch": 2.791411042944785, + "grad_norm": 4.098081903050605, + "learning_rate": 3.512396694214876e-08, + "logits/chosen": -0.3671875, + "logits/rejected": -0.5546875, + "logps/chosen": -452.0, + "logps/rejected": -398.0, + "loss": 0.0132, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.15625, + "rewards/margins": 10.875, + "rewards/rejected": -9.6875, + "step": 2275 + }, + { + "epoch": 2.792638036809816, + "grad_norm": 7.349462699545828, + "learning_rate": 3.4917355371900825e-08, + "logits/chosen": -0.25390625, + "logits/rejected": -0.404296875, + "logps/chosen": -412.0, + "logps/rejected": -406.0, + "loss": 0.0249, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.4921875, + "rewards/margins": 10.625, + "rewards/rejected": -10.125, + "step": 2276 + }, + { + "epoch": 2.7938650306748465, + "grad_norm": 4.698599899468152, + "learning_rate": 3.471074380165289e-08, + "logits/chosen": -0.291015625, + "logits/rejected": -0.376953125, + "logps/chosen": -358.0, + "logps/rejected": -390.0, + "loss": 0.015, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.1611328125, + "rewards/margins": 10.125, + "rewards/rejected": -10.0, + "step": 2277 + }, + { + "epoch": 2.795092024539877, + "grad_norm": 3.8919307539173533, + "learning_rate": 3.450413223140496e-08, + "logits/chosen": -0.279296875, + "logits/rejected": -0.5, + "logps/chosen": -414.0, + "logps/rejected": -398.0, + "loss": 0.0126, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.44140625, + "rewards/margins": 10.8125, + "rewards/rejected": -10.375, + "step": 2278 + }, + { + "epoch": 2.796319018404908, + "grad_norm": 4.648779783704914, + "learning_rate": 3.429752066115702e-08, + "logits/chosen": -0.3046875, + "logits/rejected": -0.4609375, + "logps/chosen": -422.0, + "logps/rejected": -378.0, + "loss": 0.0153, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.181640625, + "rewards/margins": 10.25, + "rewards/rejected": -10.125, + "step": 2279 + }, + { + "epoch": 2.7975460122699385, + "grad_norm": 5.722867568882704, + "learning_rate": 3.4090909090909086e-08, + "logits/chosen": -0.2578125, + "logits/rejected": -0.455078125, + "logps/chosen": -452.0, + "logps/rejected": -388.0, + "loss": 0.0176, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.002655029296875, + "rewards/margins": 10.0, + "rewards/rejected": -10.0, + "step": 2280 + }, + { + "epoch": 2.7987730061349696, + "grad_norm": 4.145488244186817, + "learning_rate": 3.388429752066115e-08, + "logits/chosen": -0.35546875, + "logits/rejected": -0.54296875, + "logps/chosen": -454.0, + "logps/rejected": -418.0, + "loss": 0.0121, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.248046875, + "rewards/margins": 10.8125, + "rewards/rejected": -10.5625, + "step": 2281 + }, + { + "epoch": 2.8, + "grad_norm": 5.584832969664345, + "learning_rate": 3.367768595041323e-08, + "logits/chosen": -0.326171875, + "logits/rejected": -0.56640625, + "logps/chosen": -488.0, + "logps/rejected": -430.0, + "loss": 0.0139, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.6640625, + "rewards/margins": 10.875, + "rewards/rejected": -10.1875, + "step": 2282 + }, + { + "epoch": 2.801226993865031, + "grad_norm": 6.962141999736088, + "learning_rate": 3.347107438016529e-08, + "logits/chosen": -0.2578125, + "logits/rejected": -0.474609375, + "logps/chosen": -388.0, + "logps/rejected": -390.0, + "loss": 0.0202, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.2158203125, + "rewards/margins": 10.0625, + "rewards/rejected": -10.25, + "step": 2283 + }, + { + "epoch": 2.802453987730061, + "grad_norm": 3.612213472974032, + "learning_rate": 3.3264462809917354e-08, + "logits/chosen": -0.318359375, + "logits/rejected": -0.50390625, + "logps/chosen": -352.0, + "logps/rejected": -354.0, + "loss": 0.0096, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.341796875, + "rewards/margins": 10.5625, + "rewards/rejected": -10.25, + "step": 2284 + }, + { + "epoch": 2.8036809815950923, + "grad_norm": 5.751531136698857, + "learning_rate": 3.305785123966942e-08, + "logits/chosen": -0.29296875, + "logits/rejected": -0.515625, + "logps/chosen": -406.0, + "logps/rejected": -354.0, + "loss": 0.0166, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.05517578125, + "rewards/margins": 9.8125, + "rewards/rejected": -9.875, + "step": 2285 + }, + { + "epoch": 2.8049079754601225, + "grad_norm": 7.474680737867139, + "learning_rate": 3.285123966942149e-08, + "logits/chosen": -0.330078125, + "logits/rejected": -0.4609375, + "logps/chosen": -388.0, + "logps/rejected": -418.0, + "loss": 0.0182, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.345703125, + "rewards/margins": 10.0625, + "rewards/rejected": -9.6875, + "step": 2286 + }, + { + "epoch": 2.8061349693251536, + "grad_norm": 5.236259440842286, + "learning_rate": 3.2644628099173555e-08, + "logits/chosen": -0.275390625, + "logits/rejected": -0.47265625, + "logps/chosen": -384.0, + "logps/rejected": -358.0, + "loss": 0.0153, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.322265625, + "rewards/margins": 9.8125, + "rewards/rejected": -9.5, + "step": 2287 + }, + { + "epoch": 2.807361963190184, + "grad_norm": 4.313073585176207, + "learning_rate": 3.2438016528925615e-08, + "logits/chosen": -0.359375, + "logits/rejected": -0.5, + "logps/chosen": -380.0, + "logps/rejected": -378.0, + "loss": 0.0192, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.416015625, + "rewards/margins": 9.875, + "rewards/rejected": -10.3125, + "step": 2288 + }, + { + "epoch": 2.808588957055215, + "grad_norm": 4.435166988526884, + "learning_rate": 3.223140495867768e-08, + "logits/chosen": -0.248046875, + "logits/rejected": -0.44921875, + "logps/chosen": -424.0, + "logps/rejected": -372.0, + "loss": 0.0192, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.08935546875, + "rewards/margins": 10.1875, + "rewards/rejected": -10.125, + "step": 2289 + }, + { + "epoch": 2.809815950920245, + "grad_norm": 4.783718079676925, + "learning_rate": 3.202479338842975e-08, + "logits/chosen": -0.287109375, + "logits/rejected": -0.484375, + "logps/chosen": -418.0, + "logps/rejected": -410.0, + "loss": 0.0153, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.72265625, + "rewards/margins": 10.0, + "rewards/rejected": -9.3125, + "step": 2290 + }, + { + "epoch": 2.8110429447852763, + "grad_norm": 5.521759167738502, + "learning_rate": 3.1818181818181816e-08, + "logits/chosen": -0.328125, + "logits/rejected": -0.4375, + "logps/chosen": -386.0, + "logps/rejected": -390.0, + "loss": 0.0155, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.134765625, + "rewards/margins": 10.3125, + "rewards/rejected": -10.1875, + "step": 2291 + }, + { + "epoch": 2.8122699386503065, + "grad_norm": 4.250224026319642, + "learning_rate": 3.161157024793388e-08, + "logits/chosen": -0.369140625, + "logits/rejected": -0.439453125, + "logps/chosen": -410.0, + "logps/rejected": -384.0, + "loss": 0.0111, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.37890625, + "rewards/margins": 10.4375, + "rewards/rejected": -10.8125, + "step": 2292 + }, + { + "epoch": 2.8134969325153376, + "grad_norm": 4.3976354376504565, + "learning_rate": 3.140495867768595e-08, + "logits/chosen": -0.21484375, + "logits/rejected": -0.46484375, + "logps/chosen": -512.0, + "logps/rejected": -434.0, + "loss": 0.016, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 1.2109375, + "rewards/margins": 10.4375, + "rewards/rejected": -9.25, + "step": 2293 + }, + { + "epoch": 2.814723926380368, + "grad_norm": 3.429372593117004, + "learning_rate": 3.119834710743802e-08, + "logits/chosen": -0.39453125, + "logits/rejected": -0.52734375, + "logps/chosen": -418.0, + "logps/rejected": -404.0, + "loss": 0.0147, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.0189208984375, + "rewards/margins": 10.375, + "rewards/rejected": -10.375, + "step": 2294 + }, + { + "epoch": 2.815950920245399, + "grad_norm": 6.507683983365873, + "learning_rate": 3.0991735537190084e-08, + "logits/chosen": -0.19140625, + "logits/rejected": -0.439453125, + "logps/chosen": -402.0, + "logps/rejected": -386.0, + "loss": 0.0205, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.263671875, + "rewards/margins": 10.0625, + "rewards/rejected": -10.3125, + "step": 2295 + }, + { + "epoch": 2.817177914110429, + "grad_norm": 5.6897054359669665, + "learning_rate": 3.0785123966942144e-08, + "logits/chosen": -0.353515625, + "logits/rejected": -0.578125, + "logps/chosen": -448.0, + "logps/rejected": -410.0, + "loss": 0.02, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.189453125, + "rewards/margins": 9.8125, + "rewards/rejected": -9.625, + "step": 2296 + }, + { + "epoch": 2.8184049079754603, + "grad_norm": 6.020402972718308, + "learning_rate": 3.057851239669421e-08, + "logits/chosen": -0.349609375, + "logits/rejected": -0.462890625, + "logps/chosen": -388.0, + "logps/rejected": -406.0, + "loss": 0.0153, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.040283203125, + "rewards/margins": 10.5, + "rewards/rejected": -10.5625, + "step": 2297 + }, + { + "epoch": 2.819631901840491, + "grad_norm": 5.046835677629229, + "learning_rate": 3.037190082644628e-08, + "logits/chosen": -0.267578125, + "logits/rejected": -0.412109375, + "logps/chosen": -348.0, + "logps/rejected": -338.0, + "loss": 0.0214, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.08935546875, + "rewards/margins": 9.5, + "rewards/rejected": -9.4375, + "step": 2298 + }, + { + "epoch": 2.8208588957055216, + "grad_norm": 4.809838582819625, + "learning_rate": 3.0165289256198345e-08, + "logits/chosen": -0.2216796875, + "logits/rejected": -0.384765625, + "logps/chosen": -356.0, + "logps/rejected": -362.0, + "loss": 0.0176, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.30078125, + "rewards/margins": 9.25, + "rewards/rejected": -9.5625, + "step": 2299 + }, + { + "epoch": 2.8220858895705523, + "grad_norm": 7.484451583297542, + "learning_rate": 2.995867768595041e-08, + "logits/chosen": -0.2138671875, + "logits/rejected": -0.392578125, + "logps/chosen": -432.0, + "logps/rejected": -372.0, + "loss": 0.0189, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.88671875, + "rewards/margins": 9.625, + "rewards/rejected": -10.5625, + "step": 2300 + }, + { + "epoch": 2.823312883435583, + "grad_norm": 5.530823027349428, + "learning_rate": 2.975206611570248e-08, + "logits/chosen": -0.34765625, + "logits/rejected": -0.51953125, + "logps/chosen": -348.0, + "logps/rejected": -322.0, + "loss": 0.0208, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.1865234375, + "rewards/margins": 9.4375, + "rewards/rejected": -9.625, + "step": 2301 + }, + { + "epoch": 2.8245398773006136, + "grad_norm": 4.140027645676079, + "learning_rate": 2.9545454545454543e-08, + "logits/chosen": -0.455078125, + "logits/rejected": -0.6484375, + "logps/chosen": -404.0, + "logps/rejected": -368.0, + "loss": 0.0114, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.224609375, + "rewards/margins": 10.1875, + "rewards/rejected": -10.0, + "step": 2302 + }, + { + "epoch": 2.8257668711656443, + "grad_norm": 14.652449086328279, + "learning_rate": 2.933884297520661e-08, + "logits/chosen": -0.2119140625, + "logits/rejected": -0.31640625, + "logps/chosen": -368.0, + "logps/rejected": -372.0, + "loss": 0.0136, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.3359375, + "rewards/margins": 9.125, + "rewards/rejected": -9.4375, + "step": 2303 + }, + { + "epoch": 2.826993865030675, + "grad_norm": 8.109683957708965, + "learning_rate": 2.9132231404958677e-08, + "logits/chosen": -0.236328125, + "logits/rejected": -0.482421875, + "logps/chosen": -392.0, + "logps/rejected": -352.0, + "loss": 0.0226, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.0036773681640625, + "rewards/margins": 9.5, + "rewards/rejected": -9.5, + "step": 2304 + }, + { + "epoch": 2.8282208588957056, + "grad_norm": 4.836833490823325, + "learning_rate": 2.8925619834710743e-08, + "logits/chosen": -0.296875, + "logits/rejected": -0.451171875, + "logps/chosen": -312.0, + "logps/rejected": -338.0, + "loss": 0.0194, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.00946044921875, + "rewards/margins": 9.875, + "rewards/rejected": -9.875, + "step": 2305 + }, + { + "epoch": 2.8294478527607363, + "grad_norm": 5.161977959651098, + "learning_rate": 2.8719008264462807e-08, + "logits/chosen": -0.361328125, + "logits/rejected": -0.5078125, + "logps/chosen": -404.0, + "logps/rejected": -382.0, + "loss": 0.0236, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.625, + "rewards/margins": 9.25, + "rewards/rejected": -9.875, + "step": 2306 + }, + { + "epoch": 2.830674846625767, + "grad_norm": 5.3844827958829535, + "learning_rate": 2.8512396694214874e-08, + "logits/chosen": -0.271484375, + "logits/rejected": -0.375, + "logps/chosen": -378.0, + "logps/rejected": -358.0, + "loss": 0.0225, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.21875, + "rewards/margins": 9.5625, + "rewards/rejected": -9.375, + "step": 2307 + }, + { + "epoch": 2.8319018404907976, + "grad_norm": 5.8070042050298945, + "learning_rate": 2.830578512396694e-08, + "logits/chosen": -0.3828125, + "logits/rejected": -0.578125, + "logps/chosen": -404.0, + "logps/rejected": -398.0, + "loss": 0.0187, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.1376953125, + "rewards/margins": 10.5625, + "rewards/rejected": -10.375, + "step": 2308 + }, + { + "epoch": 2.8331288343558283, + "grad_norm": 6.461122597290218, + "learning_rate": 2.8099173553719008e-08, + "logits/chosen": -0.251953125, + "logits/rejected": -0.392578125, + "logps/chosen": -348.0, + "logps/rejected": -360.0, + "loss": 0.0264, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.04345703125, + "rewards/margins": 9.6875, + "rewards/rejected": -9.6875, + "step": 2309 + }, + { + "epoch": 2.834355828220859, + "grad_norm": 4.568617469073562, + "learning_rate": 2.7892561983471075e-08, + "logits/chosen": -0.353515625, + "logits/rejected": -0.5234375, + "logps/chosen": -414.0, + "logps/rejected": -372.0, + "loss": 0.0141, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.09765625, + "rewards/margins": 10.0625, + "rewards/rejected": -9.9375, + "step": 2310 + }, + { + "epoch": 2.8355828220858896, + "grad_norm": 3.256594327702661, + "learning_rate": 2.768595041322314e-08, + "logits/chosen": -0.38671875, + "logits/rejected": -0.55078125, + "logps/chosen": -392.0, + "logps/rejected": -388.0, + "loss": 0.01, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.369140625, + "rewards/margins": 10.75, + "rewards/rejected": -10.375, + "step": 2311 + }, + { + "epoch": 2.8368098159509203, + "grad_norm": 10.20315797322232, + "learning_rate": 2.7479338842975205e-08, + "logits/chosen": -0.28515625, + "logits/rejected": -0.392578125, + "logps/chosen": -376.0, + "logps/rejected": -366.0, + "loss": 0.0221, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.15625, + "rewards/margins": 10.5625, + "rewards/rejected": -10.375, + "step": 2312 + }, + { + "epoch": 2.838036809815951, + "grad_norm": 8.20052407931538, + "learning_rate": 2.727272727272727e-08, + "logits/chosen": -0.361328125, + "logits/rejected": -0.57421875, + "logps/chosen": -420.0, + "logps/rejected": -392.0, + "loss": 0.0229, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.169921875, + "rewards/margins": 10.25, + "rewards/rejected": -10.4375, + "step": 2313 + }, + { + "epoch": 2.8392638036809816, + "grad_norm": 6.178193014315444, + "learning_rate": 2.706611570247934e-08, + "logits/chosen": -0.30859375, + "logits/rejected": -0.482421875, + "logps/chosen": -370.0, + "logps/rejected": -388.0, + "loss": 0.0176, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.55859375, + "rewards/margins": 10.1875, + "rewards/rejected": -9.625, + "step": 2314 + }, + { + "epoch": 2.8404907975460123, + "grad_norm": 5.614373917907217, + "learning_rate": 2.6859504132231403e-08, + "logits/chosen": -0.333984375, + "logits/rejected": -0.455078125, + "logps/chosen": -376.0, + "logps/rejected": -402.0, + "loss": 0.0141, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.25390625, + "rewards/margins": 10.1875, + "rewards/rejected": -9.9375, + "step": 2315 + }, + { + "epoch": 2.841717791411043, + "grad_norm": 4.369294982926816, + "learning_rate": 2.665289256198347e-08, + "logits/chosen": -0.431640625, + "logits/rejected": -0.60546875, + "logps/chosen": -328.0, + "logps/rejected": -342.0, + "loss": 0.0227, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.11279296875, + "rewards/margins": 10.3125, + "rewards/rejected": -10.4375, + "step": 2316 + }, + { + "epoch": 2.8429447852760736, + "grad_norm": 4.410695146906998, + "learning_rate": 2.6446280991735537e-08, + "logits/chosen": -0.296875, + "logits/rejected": -0.44921875, + "logps/chosen": -412.0, + "logps/rejected": -402.0, + "loss": 0.017, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.154296875, + "rewards/margins": 9.8125, + "rewards/rejected": -9.9375, + "step": 2317 + }, + { + "epoch": 2.8441717791411043, + "grad_norm": 5.705073757539916, + "learning_rate": 2.62396694214876e-08, + "logits/chosen": -0.265625, + "logits/rejected": -0.373046875, + "logps/chosen": -398.0, + "logps/rejected": -382.0, + "loss": 0.0144, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.125, + "rewards/margins": 9.5, + "rewards/rejected": -9.625, + "step": 2318 + }, + { + "epoch": 2.845398773006135, + "grad_norm": 5.1690493278227825, + "learning_rate": 2.603305785123967e-08, + "logits/chosen": -0.30859375, + "logits/rejected": -0.34375, + "logps/chosen": -416.0, + "logps/rejected": -388.0, + "loss": 0.022, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.41015625, + "rewards/margins": 9.6875, + "rewards/rejected": -9.3125, + "step": 2319 + }, + { + "epoch": 2.8466257668711656, + "grad_norm": 6.922133323833909, + "learning_rate": 2.5826446280991734e-08, + "logits/chosen": -0.298828125, + "logits/rejected": -0.431640625, + "logps/chosen": -378.0, + "logps/rejected": -362.0, + "loss": 0.0182, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.1494140625, + "rewards/margins": 9.6875, + "rewards/rejected": -9.5, + "step": 2320 + }, + { + "epoch": 2.8478527607361963, + "grad_norm": 5.6895891888214924, + "learning_rate": 2.56198347107438e-08, + "logits/chosen": -0.37109375, + "logits/rejected": -0.515625, + "logps/chosen": -378.0, + "logps/rejected": -366.0, + "loss": 0.0184, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.1416015625, + "rewards/margins": 9.75, + "rewards/rejected": -9.625, + "step": 2321 + }, + { + "epoch": 2.849079754601227, + "grad_norm": 4.3522889608931035, + "learning_rate": 2.5413223140495865e-08, + "logits/chosen": -0.2734375, + "logits/rejected": -0.439453125, + "logps/chosen": -422.0, + "logps/rejected": -398.0, + "loss": 0.0137, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.349609375, + "rewards/margins": 10.125, + "rewards/rejected": -9.75, + "step": 2322 + }, + { + "epoch": 2.8503067484662576, + "grad_norm": 13.282810013704502, + "learning_rate": 2.5206611570247932e-08, + "logits/chosen": -0.263671875, + "logits/rejected": -0.34375, + "logps/chosen": -354.0, + "logps/rejected": -366.0, + "loss": 0.031, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.216796875, + "rewards/margins": 9.1875, + "rewards/rejected": -9.4375, + "step": 2323 + }, + { + "epoch": 2.8515337423312883, + "grad_norm": 9.963775551702653, + "learning_rate": 2.5e-08, + "logits/chosen": -0.32421875, + "logits/rejected": -0.455078125, + "logps/chosen": -396.0, + "logps/rejected": -358.0, + "loss": 0.0217, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.28515625, + "rewards/margins": 9.125, + "rewards/rejected": -9.375, + "step": 2324 + }, + { + "epoch": 2.852760736196319, + "grad_norm": 5.777525541823679, + "learning_rate": 2.4793388429752066e-08, + "logits/chosen": -0.25, + "logits/rejected": -0.412109375, + "logps/chosen": -402.0, + "logps/rejected": -396.0, + "loss": 0.0266, + "rewards/accuracies": 0.984375, + "rewards/chosen": -0.578125, + "rewards/margins": 9.625, + "rewards/rejected": -10.1875, + "step": 2325 + }, + { + "epoch": 2.8539877300613496, + "grad_norm": 3.9379533812459595, + "learning_rate": 2.4586776859504133e-08, + "logits/chosen": -0.26171875, + "logits/rejected": -0.47265625, + "logps/chosen": -386.0, + "logps/rejected": -364.0, + "loss": 0.0127, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.71484375, + "rewards/margins": 9.375, + "rewards/rejected": -10.0625, + "step": 2326 + }, + { + "epoch": 2.8552147239263803, + "grad_norm": 5.994808828387231, + "learning_rate": 2.4380165289256196e-08, + "logits/chosen": -0.310546875, + "logits/rejected": -0.4921875, + "logps/chosen": -376.0, + "logps/rejected": -376.0, + "loss": 0.0181, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.1533203125, + "rewards/margins": 9.4375, + "rewards/rejected": -9.5625, + "step": 2327 + }, + { + "epoch": 2.856441717791411, + "grad_norm": 4.248948843931193, + "learning_rate": 2.4173553719008263e-08, + "logits/chosen": -0.275390625, + "logits/rejected": -0.42578125, + "logps/chosen": -390.0, + "logps/rejected": -348.0, + "loss": 0.0152, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.279296875, + "rewards/margins": 9.625, + "rewards/rejected": -9.375, + "step": 2328 + }, + { + "epoch": 2.8576687116564417, + "grad_norm": 5.8909650812880745, + "learning_rate": 2.396694214876033e-08, + "logits/chosen": -0.376953125, + "logits/rejected": -0.58984375, + "logps/chosen": -390.0, + "logps/rejected": -392.0, + "loss": 0.0234, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.859375, + "rewards/margins": 10.1875, + "rewards/rejected": -11.0, + "step": 2329 + }, + { + "epoch": 2.8588957055214723, + "grad_norm": 7.877823569002685, + "learning_rate": 2.3760330578512397e-08, + "logits/chosen": -0.314453125, + "logits/rejected": -0.431640625, + "logps/chosen": -448.0, + "logps/rejected": -378.0, + "loss": 0.0172, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.12353515625, + "rewards/margins": 10.25, + "rewards/rejected": -10.125, + "step": 2330 + }, + { + "epoch": 2.860122699386503, + "grad_norm": 3.5141856759463024, + "learning_rate": 2.355371900826446e-08, + "logits/chosen": -0.3203125, + "logits/rejected": -0.48828125, + "logps/chosen": -394.0, + "logps/rejected": -388.0, + "loss": 0.0106, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.0252685546875, + "rewards/margins": 10.0625, + "rewards/rejected": -10.0625, + "step": 2331 + }, + { + "epoch": 2.8613496932515337, + "grad_norm": 5.824011722153884, + "learning_rate": 2.3347107438016528e-08, + "logits/chosen": -0.34375, + "logits/rejected": -0.42578125, + "logps/chosen": -372.0, + "logps/rejected": -394.0, + "loss": 0.0203, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.494140625, + "rewards/margins": 10.5, + "rewards/rejected": -10.0, + "step": 2332 + }, + { + "epoch": 2.8625766871165643, + "grad_norm": 4.282352830825776, + "learning_rate": 2.314049586776859e-08, + "logits/chosen": -0.30078125, + "logits/rejected": -0.49609375, + "logps/chosen": -382.0, + "logps/rejected": -386.0, + "loss": 0.0131, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.020751953125, + "rewards/margins": 10.0625, + "rewards/rejected": -10.0625, + "step": 2333 + }, + { + "epoch": 2.863803680981595, + "grad_norm": 7.250586698502055, + "learning_rate": 2.2933884297520662e-08, + "logits/chosen": -0.357421875, + "logits/rejected": -0.4453125, + "logps/chosen": -368.0, + "logps/rejected": -346.0, + "loss": 0.0215, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.54296875, + "rewards/margins": 9.4375, + "rewards/rejected": -10.0, + "step": 2334 + }, + { + "epoch": 2.8650306748466257, + "grad_norm": 3.337317871576431, + "learning_rate": 2.2727272727272725e-08, + "logits/chosen": -0.416015625, + "logits/rejected": -0.54296875, + "logps/chosen": -450.0, + "logps/rejected": -392.0, + "loss": 0.0134, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.10546875, + "rewards/margins": 10.375, + "rewards/rejected": -10.5, + "step": 2335 + }, + { + "epoch": 2.8662576687116563, + "grad_norm": 3.7963626563565156, + "learning_rate": 2.2520661157024792e-08, + "logits/chosen": -0.423828125, + "logits/rejected": -0.6015625, + "logps/chosen": -400.0, + "logps/rejected": -390.0, + "loss": 0.0101, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.0712890625, + "rewards/margins": 9.9375, + "rewards/rejected": -10.0, + "step": 2336 + }, + { + "epoch": 2.867484662576687, + "grad_norm": 4.091751066715973, + "learning_rate": 2.231404958677686e-08, + "logits/chosen": -0.265625, + "logits/rejected": -0.4296875, + "logps/chosen": -348.0, + "logps/rejected": -390.0, + "loss": 0.0149, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.24609375, + "rewards/margins": 9.6875, + "rewards/rejected": -9.9375, + "step": 2337 + }, + { + "epoch": 2.8687116564417177, + "grad_norm": 7.6080806661219995, + "learning_rate": 2.2107438016528923e-08, + "logits/chosen": -0.24609375, + "logits/rejected": -0.34765625, + "logps/chosen": -362.0, + "logps/rejected": -366.0, + "loss": 0.0266, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.65234375, + "rewards/margins": 8.8125, + "rewards/rejected": -9.4375, + "step": 2338 + }, + { + "epoch": 2.8699386503067483, + "grad_norm": 4.0124242413332505, + "learning_rate": 2.1900826446280993e-08, + "logits/chosen": -0.201171875, + "logits/rejected": -0.435546875, + "logps/chosen": -354.0, + "logps/rejected": -340.0, + "loss": 0.0126, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.361328125, + "rewards/margins": 9.75, + "rewards/rejected": -9.375, + "step": 2339 + }, + { + "epoch": 2.871165644171779, + "grad_norm": 4.260473719796248, + "learning_rate": 2.1694214876033057e-08, + "logits/chosen": -0.32421875, + "logits/rejected": -0.46484375, + "logps/chosen": -422.0, + "logps/rejected": -414.0, + "loss": 0.0148, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.447265625, + "rewards/margins": 10.0625, + "rewards/rejected": -10.5, + "step": 2340 + }, + { + "epoch": 2.8723926380368097, + "grad_norm": 5.599198188744597, + "learning_rate": 2.1487603305785124e-08, + "logits/chosen": -0.3515625, + "logits/rejected": -0.48828125, + "logps/chosen": -364.0, + "logps/rejected": -402.0, + "loss": 0.0179, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.384765625, + "rewards/margins": 10.1875, + "rewards/rejected": -9.75, + "step": 2341 + }, + { + "epoch": 2.8736196319018403, + "grad_norm": 8.120624916283182, + "learning_rate": 2.1280991735537187e-08, + "logits/chosen": -0.435546875, + "logits/rejected": -0.671875, + "logps/chosen": -436.0, + "logps/rejected": -398.0, + "loss": 0.0223, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.1455078125, + "rewards/margins": 10.5, + "rewards/rejected": -10.375, + "step": 2342 + }, + { + "epoch": 2.874846625766871, + "grad_norm": 3.8102428781908553, + "learning_rate": 2.1074380165289254e-08, + "logits/chosen": -0.35546875, + "logits/rejected": -0.50390625, + "logps/chosen": -386.0, + "logps/rejected": -384.0, + "loss": 0.0123, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.053955078125, + "rewards/margins": 9.6875, + "rewards/rejected": -9.75, + "step": 2343 + }, + { + "epoch": 2.876073619631902, + "grad_norm": 5.320736560890849, + "learning_rate": 2.086776859504132e-08, + "logits/chosen": -0.2470703125, + "logits/rejected": -0.400390625, + "logps/chosen": -402.0, + "logps/rejected": -394.0, + "loss": 0.014, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.09375, + "rewards/margins": 10.1875, + "rewards/rejected": -10.125, + "step": 2344 + }, + { + "epoch": 2.8773006134969323, + "grad_norm": 4.754951464421055, + "learning_rate": 2.0661157024793388e-08, + "logits/chosen": -0.3984375, + "logits/rejected": -0.50390625, + "logps/chosen": -374.0, + "logps/rejected": -366.0, + "loss": 0.013, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.10107421875, + "rewards/margins": 10.25, + "rewards/rejected": -10.1875, + "step": 2345 + }, + { + "epoch": 2.8785276073619634, + "grad_norm": 4.967759508884862, + "learning_rate": 2.0454545454545455e-08, + "logits/chosen": -0.265625, + "logits/rejected": -0.47265625, + "logps/chosen": -454.0, + "logps/rejected": -400.0, + "loss": 0.0205, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.050537109375, + "rewards/margins": 9.875, + "rewards/rejected": -9.8125, + "step": 2346 + }, + { + "epoch": 2.8797546012269937, + "grad_norm": 9.227873425016995, + "learning_rate": 2.024793388429752e-08, + "logits/chosen": -0.302734375, + "logits/rejected": -0.443359375, + "logps/chosen": -358.0, + "logps/rejected": -348.0, + "loss": 0.0294, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.193359375, + "rewards/margins": 10.125, + "rewards/rejected": -10.3125, + "step": 2347 + }, + { + "epoch": 2.880981595092025, + "grad_norm": 5.110127487141932, + "learning_rate": 2.0041322314049586e-08, + "logits/chosen": -0.232421875, + "logits/rejected": -0.380859375, + "logps/chosen": -406.0, + "logps/rejected": -370.0, + "loss": 0.0148, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.12255859375, + "rewards/margins": 10.0, + "rewards/rejected": -9.875, + "step": 2348 + }, + { + "epoch": 2.882208588957055, + "grad_norm": 3.5459207954437746, + "learning_rate": 1.9834710743801653e-08, + "logits/chosen": -0.3515625, + "logits/rejected": -0.494140625, + "logps/chosen": -408.0, + "logps/rejected": -362.0, + "loss": 0.0118, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.5703125, + "rewards/margins": 9.8125, + "rewards/rejected": -10.375, + "step": 2349 + }, + { + "epoch": 2.883435582822086, + "grad_norm": 9.5476230113337, + "learning_rate": 1.962809917355372e-08, + "logits/chosen": -0.408203125, + "logits/rejected": -0.65625, + "logps/chosen": -448.0, + "logps/rejected": -416.0, + "loss": 0.0092, + "rewards/accuracies": 1.0, + "rewards/chosen": 1.03125, + "rewards/margins": 11.1875, + "rewards/rejected": -10.1875, + "step": 2350 + }, + { + "epoch": 2.8846625766871163, + "grad_norm": 3.582640816988838, + "learning_rate": 1.9421487603305783e-08, + "logits/chosen": -0.375, + "logits/rejected": -0.546875, + "logps/chosen": -398.0, + "logps/rejected": -390.0, + "loss": 0.0287, + "rewards/accuracies": 0.9765625, + "rewards/chosen": -0.4296875, + "rewards/margins": 9.625, + "rewards/rejected": -10.0, + "step": 2351 + }, + { + "epoch": 2.8858895705521475, + "grad_norm": 4.32179034132841, + "learning_rate": 1.921487603305785e-08, + "logits/chosen": -0.26953125, + "logits/rejected": -0.41015625, + "logps/chosen": -356.0, + "logps/rejected": -378.0, + "loss": 0.0124, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.28125, + "rewards/margins": 10.0, + "rewards/rejected": -10.3125, + "step": 2352 + }, + { + "epoch": 2.8871165644171777, + "grad_norm": 4.082401932909914, + "learning_rate": 1.9008264462809914e-08, + "logits/chosen": -0.26953125, + "logits/rejected": -0.431640625, + "logps/chosen": -418.0, + "logps/rejected": -394.0, + "loss": 0.0108, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.1201171875, + "rewards/margins": 10.625, + "rewards/rejected": -10.5, + "step": 2353 + }, + { + "epoch": 2.888343558282209, + "grad_norm": 8.947757768081745, + "learning_rate": 1.8801652892561984e-08, + "logits/chosen": -0.37890625, + "logits/rejected": -0.50390625, + "logps/chosen": -428.0, + "logps/rejected": -382.0, + "loss": 0.0162, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.1337890625, + "rewards/margins": 9.5, + "rewards/rejected": -9.625, + "step": 2354 + }, + { + "epoch": 2.889570552147239, + "grad_norm": 5.9760387571298015, + "learning_rate": 1.8595041322314048e-08, + "logits/chosen": -0.24609375, + "logits/rejected": -0.28515625, + "logps/chosen": -360.0, + "logps/rejected": -386.0, + "loss": 0.018, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.134765625, + "rewards/margins": 9.5, + "rewards/rejected": -9.625, + "step": 2355 + }, + { + "epoch": 2.89079754601227, + "grad_norm": 3.398049358069293, + "learning_rate": 1.8388429752066115e-08, + "logits/chosen": -0.17578125, + "logits/rejected": -0.359375, + "logps/chosen": -388.0, + "logps/rejected": -386.0, + "loss": 0.0112, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.291015625, + "rewards/margins": 10.0625, + "rewards/rejected": -9.8125, + "step": 2356 + }, + { + "epoch": 2.8920245398773003, + "grad_norm": 6.07796579252892, + "learning_rate": 1.818181818181818e-08, + "logits/chosen": -0.4609375, + "logits/rejected": -0.57421875, + "logps/chosen": -388.0, + "logps/rejected": -408.0, + "loss": 0.0185, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.2197265625, + "rewards/margins": 9.9375, + "rewards/rejected": -10.125, + "step": 2357 + }, + { + "epoch": 2.8932515337423315, + "grad_norm": 8.696145245217439, + "learning_rate": 1.7975206611570245e-08, + "logits/chosen": -0.25, + "logits/rejected": -0.44921875, + "logps/chosen": -410.0, + "logps/rejected": -402.0, + "loss": 0.017, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.396484375, + "rewards/margins": 10.0, + "rewards/rejected": -9.5625, + "step": 2358 + }, + { + "epoch": 2.894478527607362, + "grad_norm": 4.920697181641911, + "learning_rate": 1.7768595041322315e-08, + "logits/chosen": -0.318359375, + "logits/rejected": -0.462890625, + "logps/chosen": -478.0, + "logps/rejected": -426.0, + "loss": 0.0153, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.1015625, + "rewards/margins": 10.5, + "rewards/rejected": -10.4375, + "step": 2359 + }, + { + "epoch": 2.895705521472393, + "grad_norm": 12.095056213398975, + "learning_rate": 1.756198347107438e-08, + "logits/chosen": -0.3203125, + "logits/rejected": -0.43359375, + "logps/chosen": -362.0, + "logps/rejected": -362.0, + "loss": 0.0235, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.365234375, + "rewards/margins": 9.4375, + "rewards/rejected": -9.75, + "step": 2360 + }, + { + "epoch": 2.8969325153374235, + "grad_norm": 5.726694652229428, + "learning_rate": 1.7355371900826446e-08, + "logits/chosen": -0.228515625, + "logits/rejected": -0.412109375, + "logps/chosen": -386.0, + "logps/rejected": -392.0, + "loss": 0.0154, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.287109375, + "rewards/margins": 10.375, + "rewards/rejected": -10.125, + "step": 2361 + }, + { + "epoch": 2.898159509202454, + "grad_norm": 2.7652592049483533, + "learning_rate": 1.714876033057851e-08, + "logits/chosen": -0.265625, + "logits/rejected": -0.474609375, + "logps/chosen": -398.0, + "logps/rejected": -380.0, + "loss": 0.0076, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.27734375, + "rewards/margins": 10.625, + "rewards/rejected": -10.3125, + "step": 2362 + }, + { + "epoch": 2.899386503067485, + "grad_norm": 4.702435901134138, + "learning_rate": 1.6942148760330577e-08, + "logits/chosen": -0.39453125, + "logits/rejected": -0.54296875, + "logps/chosen": -390.0, + "logps/rejected": -408.0, + "loss": 0.0146, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.072265625, + "rewards/margins": 10.5625, + "rewards/rejected": -10.625, + "step": 2363 + }, + { + "epoch": 2.9006134969325155, + "grad_norm": 4.019114705854662, + "learning_rate": 1.6735537190082644e-08, + "logits/chosen": -0.294921875, + "logits/rejected": -0.482421875, + "logps/chosen": -434.0, + "logps/rejected": -416.0, + "loss": 0.0096, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.51953125, + "rewards/margins": 10.6875, + "rewards/rejected": -10.1875, + "step": 2364 + }, + { + "epoch": 2.901840490797546, + "grad_norm": 6.231189119226923, + "learning_rate": 1.652892561983471e-08, + "logits/chosen": -0.23046875, + "logits/rejected": -0.328125, + "logps/chosen": -398.0, + "logps/rejected": -374.0, + "loss": 0.0288, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.44140625, + "rewards/margins": 10.0, + "rewards/rejected": -10.4375, + "step": 2365 + }, + { + "epoch": 2.903067484662577, + "grad_norm": 4.786426673184359, + "learning_rate": 1.6322314049586777e-08, + "logits/chosen": -0.3125, + "logits/rejected": -0.46875, + "logps/chosen": -416.0, + "logps/rejected": -404.0, + "loss": 0.0159, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.416015625, + "rewards/margins": 9.75, + "rewards/rejected": -10.1875, + "step": 2366 + }, + { + "epoch": 2.9042944785276075, + "grad_norm": 5.275701160081034, + "learning_rate": 1.611570247933884e-08, + "logits/chosen": -0.310546875, + "logits/rejected": -0.46484375, + "logps/chosen": -338.0, + "logps/rejected": -344.0, + "loss": 0.0186, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.74609375, + "rewards/margins": 9.375, + "rewards/rejected": -10.125, + "step": 2367 + }, + { + "epoch": 2.905521472392638, + "grad_norm": 6.545850598851337, + "learning_rate": 1.5909090909090908e-08, + "logits/chosen": -0.375, + "logits/rejected": -0.5625, + "logps/chosen": -406.0, + "logps/rejected": -414.0, + "loss": 0.0186, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.009033203125, + "rewards/margins": 10.8125, + "rewards/rejected": -10.8125, + "step": 2368 + }, + { + "epoch": 2.906748466257669, + "grad_norm": 4.221135613206881, + "learning_rate": 1.5702479338842975e-08, + "logits/chosen": -0.314453125, + "logits/rejected": -0.5078125, + "logps/chosen": -430.0, + "logps/rejected": -394.0, + "loss": 0.014, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.1923828125, + "rewards/margins": 9.875, + "rewards/rejected": -10.0625, + "step": 2369 + }, + { + "epoch": 2.9079754601226995, + "grad_norm": 4.756253201328986, + "learning_rate": 1.5495867768595042e-08, + "logits/chosen": -0.232421875, + "logits/rejected": -0.365234375, + "logps/chosen": -414.0, + "logps/rejected": -392.0, + "loss": 0.0152, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.255859375, + "rewards/margins": 9.8125, + "rewards/rejected": -10.125, + "step": 2370 + }, + { + "epoch": 2.90920245398773, + "grad_norm": 5.7141193678874815, + "learning_rate": 1.5289256198347106e-08, + "logits/chosen": -0.2890625, + "logits/rejected": -0.4453125, + "logps/chosen": -394.0, + "logps/rejected": -368.0, + "loss": 0.0228, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.85546875, + "rewards/margins": 9.125, + "rewards/rejected": -10.0, + "step": 2371 + }, + { + "epoch": 2.910429447852761, + "grad_norm": 5.714939638560889, + "learning_rate": 1.5082644628099173e-08, + "logits/chosen": -0.298828125, + "logits/rejected": -0.59375, + "logps/chosen": -416.0, + "logps/rejected": -360.0, + "loss": 0.0126, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.263671875, + "rewards/margins": 11.25, + "rewards/rejected": -11.0, + "step": 2372 + }, + { + "epoch": 2.9116564417177915, + "grad_norm": 6.197795422625927, + "learning_rate": 1.487603305785124e-08, + "logits/chosen": -0.10693359375, + "logits/rejected": -0.34375, + "logps/chosen": -436.0, + "logps/rejected": -390.0, + "loss": 0.0177, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.609375, + "rewards/margins": 10.5, + "rewards/rejected": -9.875, + "step": 2373 + }, + { + "epoch": 2.912883435582822, + "grad_norm": 10.275154715490803, + "learning_rate": 1.4669421487603305e-08, + "logits/chosen": -0.306640625, + "logits/rejected": -0.49609375, + "logps/chosen": -422.0, + "logps/rejected": -374.0, + "loss": 0.0253, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.10693359375, + "rewards/margins": 9.875, + "rewards/rejected": -9.75, + "step": 2374 + }, + { + "epoch": 2.914110429447853, + "grad_norm": 7.276929469833461, + "learning_rate": 1.4462809917355372e-08, + "logits/chosen": -0.275390625, + "logits/rejected": -0.41796875, + "logps/chosen": -390.0, + "logps/rejected": -394.0, + "loss": 0.0208, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.111328125, + "rewards/margins": 9.25, + "rewards/rejected": -9.375, + "step": 2375 + }, + { + "epoch": 2.9153374233128835, + "grad_norm": 4.928817861597808, + "learning_rate": 1.4256198347107437e-08, + "logits/chosen": -0.189453125, + "logits/rejected": -0.34765625, + "logps/chosen": -406.0, + "logps/rejected": -380.0, + "loss": 0.0175, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.0947265625, + "rewards/margins": 9.5, + "rewards/rejected": -9.5625, + "step": 2376 + }, + { + "epoch": 2.916564417177914, + "grad_norm": 7.100703753753761, + "learning_rate": 1.4049586776859504e-08, + "logits/chosen": -0.10791015625, + "logits/rejected": -0.26953125, + "logps/chosen": -380.0, + "logps/rejected": -374.0, + "loss": 0.0231, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.65625, + "rewards/margins": 8.875, + "rewards/rejected": -9.5, + "step": 2377 + }, + { + "epoch": 2.917791411042945, + "grad_norm": 3.76449294490794, + "learning_rate": 1.384297520661157e-08, + "logits/chosen": -0.23828125, + "logits/rejected": -0.451171875, + "logps/chosen": -396.0, + "logps/rejected": -398.0, + "loss": 0.017, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.5078125, + "rewards/margins": 9.5, + "rewards/rejected": -10.0, + "step": 2378 + }, + { + "epoch": 2.9190184049079755, + "grad_norm": 5.466922451152148, + "learning_rate": 1.3636363636363635e-08, + "logits/chosen": -0.28125, + "logits/rejected": -0.416015625, + "logps/chosen": -374.0, + "logps/rejected": -380.0, + "loss": 0.0147, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.0255126953125, + "rewards/margins": 9.9375, + "rewards/rejected": -9.9375, + "step": 2379 + }, + { + "epoch": 2.920245398773006, + "grad_norm": 8.634908945779232, + "learning_rate": 1.3429752066115701e-08, + "logits/chosen": -0.287109375, + "logits/rejected": -0.474609375, + "logps/chosen": -410.0, + "logps/rejected": -398.0, + "loss": 0.0209, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.404296875, + "rewards/margins": 9.75, + "rewards/rejected": -10.125, + "step": 2380 + }, + { + "epoch": 2.921472392638037, + "grad_norm": 4.161545832203642, + "learning_rate": 1.3223140495867768e-08, + "logits/chosen": -0.30859375, + "logits/rejected": -0.5078125, + "logps/chosen": -394.0, + "logps/rejected": -380.0, + "loss": 0.0127, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.25390625, + "rewards/margins": 9.875, + "rewards/rejected": -10.1875, + "step": 2381 + }, + { + "epoch": 2.9226993865030675, + "grad_norm": 4.169003562651855, + "learning_rate": 1.3016528925619835e-08, + "logits/chosen": -0.271484375, + "logits/rejected": -0.43359375, + "logps/chosen": -382.0, + "logps/rejected": -368.0, + "loss": 0.02, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.2353515625, + "rewards/margins": 9.75, + "rewards/rejected": -10.0, + "step": 2382 + }, + { + "epoch": 2.923926380368098, + "grad_norm": 4.533088143111806, + "learning_rate": 1.28099173553719e-08, + "logits/chosen": -0.2333984375, + "logits/rejected": -0.408203125, + "logps/chosen": -422.0, + "logps/rejected": -368.0, + "loss": 0.014, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.158203125, + "rewards/margins": 9.75, + "rewards/rejected": -9.9375, + "step": 2383 + }, + { + "epoch": 2.925153374233129, + "grad_norm": 4.768205795730351, + "learning_rate": 1.2603305785123966e-08, + "logits/chosen": -0.27734375, + "logits/rejected": -0.486328125, + "logps/chosen": -408.0, + "logps/rejected": -394.0, + "loss": 0.0221, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.1689453125, + "rewards/margins": 9.8125, + "rewards/rejected": -9.625, + "step": 2384 + }, + { + "epoch": 2.9263803680981595, + "grad_norm": 6.913327301901633, + "learning_rate": 1.2396694214876033e-08, + "logits/chosen": -0.326171875, + "logits/rejected": -0.515625, + "logps/chosen": -400.0, + "logps/rejected": -372.0, + "loss": 0.0215, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.0264892578125, + "rewards/margins": 9.875, + "rewards/rejected": -9.875, + "step": 2385 + }, + { + "epoch": 2.92760736196319, + "grad_norm": 5.7757051057931035, + "learning_rate": 1.2190082644628098e-08, + "logits/chosen": -0.27734375, + "logits/rejected": -0.46484375, + "logps/chosen": -420.0, + "logps/rejected": -412.0, + "loss": 0.0187, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.62890625, + "rewards/margins": 9.6875, + "rewards/rejected": -9.0625, + "step": 2386 + }, + { + "epoch": 2.928834355828221, + "grad_norm": 3.984089690252272, + "learning_rate": 1.1983471074380165e-08, + "logits/chosen": -0.330078125, + "logits/rejected": -0.51171875, + "logps/chosen": -382.0, + "logps/rejected": -396.0, + "loss": 0.0111, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.427734375, + "rewards/margins": 10.1875, + "rewards/rejected": -10.625, + "step": 2387 + }, + { + "epoch": 2.9300613496932515, + "grad_norm": 4.627253874547468, + "learning_rate": 1.177685950413223e-08, + "logits/chosen": -0.298828125, + "logits/rejected": -0.55859375, + "logps/chosen": -418.0, + "logps/rejected": -388.0, + "loss": 0.0123, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.3984375, + "rewards/margins": 11.0625, + "rewards/rejected": -10.625, + "step": 2388 + }, + { + "epoch": 2.931288343558282, + "grad_norm": 5.9568120843539205, + "learning_rate": 1.1570247933884296e-08, + "logits/chosen": -0.2265625, + "logits/rejected": -0.3046875, + "logps/chosen": -370.0, + "logps/rejected": -392.0, + "loss": 0.0194, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.0634765625, + "rewards/margins": 9.4375, + "rewards/rejected": -9.5, + "step": 2389 + }, + { + "epoch": 2.932515337423313, + "grad_norm": 5.463650170191562, + "learning_rate": 1.1363636363636363e-08, + "logits/chosen": -0.236328125, + "logits/rejected": -0.46875, + "logps/chosen": -426.0, + "logps/rejected": -374.0, + "loss": 0.0184, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.388671875, + "rewards/margins": 10.0, + "rewards/rejected": -9.5625, + "step": 2390 + }, + { + "epoch": 2.9337423312883435, + "grad_norm": 3.8962149242168174, + "learning_rate": 1.115702479338843e-08, + "logits/chosen": -0.232421875, + "logits/rejected": -0.5, + "logps/chosen": -376.0, + "logps/rejected": -354.0, + "loss": 0.0175, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.1796875, + "rewards/margins": 9.4375, + "rewards/rejected": -9.625, + "step": 2391 + }, + { + "epoch": 2.934969325153374, + "grad_norm": 4.487111931294344, + "learning_rate": 1.0950413223140497e-08, + "logits/chosen": -0.2734375, + "logits/rejected": -0.486328125, + "logps/chosen": -416.0, + "logps/rejected": -396.0, + "loss": 0.0119, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.1943359375, + "rewards/margins": 10.25, + "rewards/rejected": -10.4375, + "step": 2392 + }, + { + "epoch": 2.936196319018405, + "grad_norm": 4.421303122734101, + "learning_rate": 1.0743801652892562e-08, + "logits/chosen": -0.193359375, + "logits/rejected": -0.33984375, + "logps/chosen": -348.0, + "logps/rejected": -360.0, + "loss": 0.0186, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.482421875, + "rewards/margins": 9.5625, + "rewards/rejected": -10.0625, + "step": 2393 + }, + { + "epoch": 2.9374233128834355, + "grad_norm": 3.791792662728553, + "learning_rate": 1.0537190082644627e-08, + "logits/chosen": -0.3125, + "logits/rejected": -0.482421875, + "logps/chosen": -398.0, + "logps/rejected": -398.0, + "loss": 0.0168, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.025146484375, + "rewards/margins": 10.0625, + "rewards/rejected": -10.0625, + "step": 2394 + }, + { + "epoch": 2.938650306748466, + "grad_norm": 5.579935730873654, + "learning_rate": 1.0330578512396694e-08, + "logits/chosen": -0.33984375, + "logits/rejected": -0.486328125, + "logps/chosen": -368.0, + "logps/rejected": -366.0, + "loss": 0.018, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.2890625, + "rewards/margins": 9.875, + "rewards/rejected": -10.125, + "step": 2395 + }, + { + "epoch": 2.939877300613497, + "grad_norm": 3.7608618770400355, + "learning_rate": 1.012396694214876e-08, + "logits/chosen": -0.349609375, + "logits/rejected": -0.51171875, + "logps/chosen": -418.0, + "logps/rejected": -408.0, + "loss": 0.0114, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.7890625, + "rewards/margins": 10.4375, + "rewards/rejected": -9.6875, + "step": 2396 + }, + { + "epoch": 2.9411042944785275, + "grad_norm": 4.301979467350802, + "learning_rate": 9.917355371900826e-09, + "logits/chosen": -0.283203125, + "logits/rejected": -0.43359375, + "logps/chosen": -360.0, + "logps/rejected": -382.0, + "loss": 0.014, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.310546875, + "rewards/margins": 9.9375, + "rewards/rejected": -10.25, + "step": 2397 + }, + { + "epoch": 2.942331288343558, + "grad_norm": 6.295447467736398, + "learning_rate": 9.710743801652892e-09, + "logits/chosen": -0.1357421875, + "logits/rejected": -0.275390625, + "logps/chosen": -386.0, + "logps/rejected": -380.0, + "loss": 0.0147, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.65234375, + "rewards/margins": 9.6875, + "rewards/rejected": -10.375, + "step": 2398 + }, + { + "epoch": 2.943558282208589, + "grad_norm": 3.466127732342938, + "learning_rate": 9.504132231404957e-09, + "logits/chosen": -0.228515625, + "logits/rejected": -0.39453125, + "logps/chosen": -420.0, + "logps/rejected": -374.0, + "loss": 0.0116, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.4140625, + "rewards/margins": 9.875, + "rewards/rejected": -10.3125, + "step": 2399 + }, + { + "epoch": 2.9447852760736195, + "grad_norm": 5.840517369766517, + "learning_rate": 9.297520661157024e-09, + "logits/chosen": -0.306640625, + "logits/rejected": -0.470703125, + "logps/chosen": -426.0, + "logps/rejected": -404.0, + "loss": 0.0145, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.126953125, + "rewards/margins": 10.5, + "rewards/rejected": -10.625, + "step": 2400 + }, + { + "epoch": 2.94601226993865, + "grad_norm": 5.440619151600873, + "learning_rate": 9.09090909090909e-09, + "logits/chosen": -0.30078125, + "logits/rejected": -0.47265625, + "logps/chosen": -358.0, + "logps/rejected": -362.0, + "loss": 0.0202, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.07470703125, + "rewards/margins": 10.1875, + "rewards/rejected": -10.0625, + "step": 2401 + }, + { + "epoch": 2.947239263803681, + "grad_norm": 4.652173555234269, + "learning_rate": 8.884297520661158e-09, + "logits/chosen": -0.287109375, + "logits/rejected": -0.5, + "logps/chosen": -414.0, + "logps/rejected": -392.0, + "loss": 0.0126, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.259765625, + "rewards/margins": 10.5, + "rewards/rejected": -10.25, + "step": 2402 + }, + { + "epoch": 2.9484662576687115, + "grad_norm": 7.303034460930339, + "learning_rate": 8.677685950413223e-09, + "logits/chosen": -0.3125, + "logits/rejected": -0.4921875, + "logps/chosen": -372.0, + "logps/rejected": -368.0, + "loss": 0.0191, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.337890625, + "rewards/margins": 9.8125, + "rewards/rejected": -10.125, + "step": 2403 + }, + { + "epoch": 2.949693251533742, + "grad_norm": 4.6906212258839, + "learning_rate": 8.471074380165288e-09, + "logits/chosen": -0.33203125, + "logits/rejected": -0.498046875, + "logps/chosen": -440.0, + "logps/rejected": -402.0, + "loss": 0.0152, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.01287841796875, + "rewards/margins": 9.875, + "rewards/rejected": -9.875, + "step": 2404 + }, + { + "epoch": 2.950920245398773, + "grad_norm": 5.401973680764693, + "learning_rate": 8.264462809917355e-09, + "logits/chosen": -0.2197265625, + "logits/rejected": -0.47265625, + "logps/chosen": -436.0, + "logps/rejected": -370.0, + "loss": 0.018, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.244140625, + "rewards/margins": 9.4375, + "rewards/rejected": -9.1875, + "step": 2405 + }, + { + "epoch": 2.9521472392638035, + "grad_norm": 9.438561688552145, + "learning_rate": 8.05785123966942e-09, + "logits/chosen": -0.2353515625, + "logits/rejected": -0.447265625, + "logps/chosen": -384.0, + "logps/rejected": -368.0, + "loss": 0.029, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.78515625, + "rewards/margins": 9.375, + "rewards/rejected": -10.125, + "step": 2406 + }, + { + "epoch": 2.9533742331288346, + "grad_norm": 6.552876979042077, + "learning_rate": 7.851239669421488e-09, + "logits/chosen": -0.173828125, + "logits/rejected": -0.328125, + "logps/chosen": -370.0, + "logps/rejected": -374.0, + "loss": 0.0167, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.08349609375, + "rewards/margins": 9.375, + "rewards/rejected": -9.5, + "step": 2407 + }, + { + "epoch": 2.954601226993865, + "grad_norm": 7.588992629123461, + "learning_rate": 7.644628099173553e-09, + "logits/chosen": -0.16796875, + "logits/rejected": -0.376953125, + "logps/chosen": -406.0, + "logps/rejected": -402.0, + "loss": 0.0266, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.59765625, + "rewards/margins": 10.4375, + "rewards/rejected": -9.8125, + "step": 2408 + }, + { + "epoch": 2.955828220858896, + "grad_norm": 3.6908738076821566, + "learning_rate": 7.43801652892562e-09, + "logits/chosen": -0.470703125, + "logits/rejected": -0.62109375, + "logps/chosen": -400.0, + "logps/rejected": -392.0, + "loss": 0.0125, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.345703125, + "rewards/margins": 10.5, + "rewards/rejected": -10.125, + "step": 2409 + }, + { + "epoch": 2.957055214723926, + "grad_norm": 5.01848342811666, + "learning_rate": 7.231404958677686e-09, + "logits/chosen": -0.259765625, + "logits/rejected": -0.423828125, + "logps/chosen": -396.0, + "logps/rejected": -370.0, + "loss": 0.0179, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.251953125, + "rewards/margins": 9.3125, + "rewards/rejected": -9.5625, + "step": 2410 + }, + { + "epoch": 2.9582822085889573, + "grad_norm": 5.051792933351555, + "learning_rate": 7.024793388429752e-09, + "logits/chosen": -0.2470703125, + "logits/rejected": -0.478515625, + "logps/chosen": -404.0, + "logps/rejected": -382.0, + "loss": 0.0187, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.71875, + "rewards/margins": 10.5, + "rewards/rejected": -9.8125, + "step": 2411 + }, + { + "epoch": 2.9595092024539875, + "grad_norm": 4.307869961804709, + "learning_rate": 6.818181818181817e-09, + "logits/chosen": -0.33203125, + "logits/rejected": -0.466796875, + "logps/chosen": -420.0, + "logps/rejected": -410.0, + "loss": 0.0133, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.330078125, + "rewards/margins": 9.6875, + "rewards/rejected": -10.0, + "step": 2412 + }, + { + "epoch": 2.9607361963190186, + "grad_norm": 4.399535657765695, + "learning_rate": 6.611570247933884e-09, + "logits/chosen": -0.373046875, + "logits/rejected": -0.5625, + "logps/chosen": -460.0, + "logps/rejected": -414.0, + "loss": 0.011, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.443359375, + "rewards/margins": 11.3125, + "rewards/rejected": -10.875, + "step": 2413 + }, + { + "epoch": 2.961963190184049, + "grad_norm": 5.994426196095844, + "learning_rate": 6.40495867768595e-09, + "logits/chosen": -0.1875, + "logits/rejected": -0.26953125, + "logps/chosen": -318.0, + "logps/rejected": -320.0, + "loss": 0.0185, + "rewards/accuracies": 1.0, + "rewards/chosen": -1.2109375, + "rewards/margins": 8.125, + "rewards/rejected": -9.3125, + "step": 2414 + }, + { + "epoch": 2.96319018404908, + "grad_norm": 5.008863584519489, + "learning_rate": 6.1983471074380165e-09, + "logits/chosen": -0.423828125, + "logits/rejected": -0.625, + "logps/chosen": -412.0, + "logps/rejected": -382.0, + "loss": 0.0136, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.0888671875, + "rewards/margins": 10.8125, + "rewards/rejected": -10.6875, + "step": 2415 + }, + { + "epoch": 2.96441717791411, + "grad_norm": 2.9974896558099466, + "learning_rate": 5.9917355371900826e-09, + "logits/chosen": -0.349609375, + "logits/rejected": -0.4453125, + "logps/chosen": -394.0, + "logps/rejected": -424.0, + "loss": 0.009, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.060791015625, + "rewards/margins": 10.6875, + "rewards/rejected": -10.625, + "step": 2416 + }, + { + "epoch": 2.9656441717791413, + "grad_norm": 6.648822028050813, + "learning_rate": 5.785123966942148e-09, + "logits/chosen": -0.3359375, + "logits/rejected": -0.515625, + "logps/chosen": -400.0, + "logps/rejected": -388.0, + "loss": 0.0189, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.1533203125, + "rewards/margins": 10.25, + "rewards/rejected": -10.125, + "step": 2417 + }, + { + "epoch": 2.9668711656441715, + "grad_norm": 4.624022651158804, + "learning_rate": 5.578512396694215e-09, + "logits/chosen": -0.33203125, + "logits/rejected": -0.5, + "logps/chosen": -412.0, + "logps/rejected": -388.0, + "loss": 0.016, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.1591796875, + "rewards/margins": 9.75, + "rewards/rejected": -9.5625, + "step": 2418 + }, + { + "epoch": 2.9680981595092026, + "grad_norm": 4.960828083697773, + "learning_rate": 5.371900826446281e-09, + "logits/chosen": -0.30859375, + "logits/rejected": -0.5390625, + "logps/chosen": -406.0, + "logps/rejected": -382.0, + "loss": 0.0175, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.44140625, + "rewards/margins": 9.6875, + "rewards/rejected": -10.1875, + "step": 2419 + }, + { + "epoch": 2.969325153374233, + "grad_norm": 4.892723135101014, + "learning_rate": 5.165289256198347e-09, + "logits/chosen": -0.1904296875, + "logits/rejected": -0.328125, + "logps/chosen": -384.0, + "logps/rejected": -334.0, + "loss": 0.0157, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.04296875, + "rewards/margins": 10.125, + "rewards/rejected": -10.0625, + "step": 2420 + }, + { + "epoch": 2.970552147239264, + "grad_norm": 4.762058868289895, + "learning_rate": 4.958677685950413e-09, + "logits/chosen": -0.302734375, + "logits/rejected": -0.431640625, + "logps/chosen": -372.0, + "logps/rejected": -378.0, + "loss": 0.0154, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.07470703125, + "rewards/margins": 9.125, + "rewards/rejected": -9.25, + "step": 2421 + }, + { + "epoch": 2.9717791411042946, + "grad_norm": 4.630627516594022, + "learning_rate": 4.7520661157024785e-09, + "logits/chosen": -0.392578125, + "logits/rejected": -0.53515625, + "logps/chosen": -386.0, + "logps/rejected": -398.0, + "loss": 0.0151, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.36328125, + "rewards/margins": 9.9375, + "rewards/rejected": -10.25, + "step": 2422 + }, + { + "epoch": 2.9730061349693253, + "grad_norm": 5.6043578835013035, + "learning_rate": 4.545454545454545e-09, + "logits/chosen": -0.294921875, + "logits/rejected": -0.470703125, + "logps/chosen": -374.0, + "logps/rejected": -350.0, + "loss": 0.0193, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.271484375, + "rewards/margins": 9.75, + "rewards/rejected": -10.0625, + "step": 2423 + }, + { + "epoch": 2.974233128834356, + "grad_norm": 5.271249522475347, + "learning_rate": 4.3388429752066115e-09, + "logits/chosen": -0.2734375, + "logits/rejected": -0.38671875, + "logps/chosen": -380.0, + "logps/rejected": -370.0, + "loss": 0.0163, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.314453125, + "rewards/margins": 10.3125, + "rewards/rejected": -10.0, + "step": 2424 + }, + { + "epoch": 2.9754601226993866, + "grad_norm": 6.100351101903936, + "learning_rate": 4.132231404958678e-09, + "logits/chosen": -0.2578125, + "logits/rejected": -0.453125, + "logps/chosen": -394.0, + "logps/rejected": -410.0, + "loss": 0.0202, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.431640625, + "rewards/margins": 10.6875, + "rewards/rejected": -10.25, + "step": 2425 + }, + { + "epoch": 2.9766871165644173, + "grad_norm": 6.005004353707595, + "learning_rate": 3.925619834710744e-09, + "logits/chosen": -0.419921875, + "logits/rejected": -0.6015625, + "logps/chosen": -410.0, + "logps/rejected": -368.0, + "loss": 0.0171, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.1943359375, + "rewards/margins": 10.75, + "rewards/rejected": -10.9375, + "step": 2426 + }, + { + "epoch": 2.977914110429448, + "grad_norm": 4.138955833410806, + "learning_rate": 3.71900826446281e-09, + "logits/chosen": -0.259765625, + "logits/rejected": -0.435546875, + "logps/chosen": -366.0, + "logps/rejected": -356.0, + "loss": 0.0136, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.44140625, + "rewards/margins": 9.875, + "rewards/rejected": -10.3125, + "step": 2427 + }, + { + "epoch": 2.9791411042944786, + "grad_norm": 4.358291703741995, + "learning_rate": 3.512396694214876e-09, + "logits/chosen": -0.287109375, + "logits/rejected": -0.41796875, + "logps/chosen": -378.0, + "logps/rejected": -358.0, + "loss": 0.0158, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4140625, + "rewards/margins": 9.875, + "rewards/rejected": -9.5, + "step": 2428 + }, + { + "epoch": 2.9803680981595093, + "grad_norm": 10.267601802430875, + "learning_rate": 3.305785123966942e-09, + "logits/chosen": -0.29296875, + "logits/rejected": -0.498046875, + "logps/chosen": -428.0, + "logps/rejected": -384.0, + "loss": 0.0251, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -0.43359375, + "rewards/margins": 10.0625, + "rewards/rejected": -10.5, + "step": 2429 + }, + { + "epoch": 2.98159509202454, + "grad_norm": 4.985124570037801, + "learning_rate": 3.0991735537190082e-09, + "logits/chosen": -0.2275390625, + "logits/rejected": -0.41015625, + "logps/chosen": -376.0, + "logps/rejected": -368.0, + "loss": 0.0131, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.00775146484375, + "rewards/margins": 10.3125, + "rewards/rejected": -10.3125, + "step": 2430 + }, + { + "epoch": 2.9828220858895707, + "grad_norm": 3.4169256403711388, + "learning_rate": 2.892561983471074e-09, + "logits/chosen": -0.29296875, + "logits/rejected": -0.46875, + "logps/chosen": -406.0, + "logps/rejected": -400.0, + "loss": 0.0096, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.17578125, + "rewards/margins": 10.4375, + "rewards/rejected": -10.25, + "step": 2431 + }, + { + "epoch": 2.9840490797546013, + "grad_norm": 4.461142085296544, + "learning_rate": 2.6859504132231405e-09, + "logits/chosen": -0.32421875, + "logits/rejected": -0.474609375, + "logps/chosen": -394.0, + "logps/rejected": -408.0, + "loss": 0.0191, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -1.359375, + "rewards/margins": 9.25, + "rewards/rejected": -10.625, + "step": 2432 + }, + { + "epoch": 2.985276073619632, + "grad_norm": 3.155518914402819, + "learning_rate": 2.4793388429752066e-09, + "logits/chosen": -0.2734375, + "logits/rejected": -0.51953125, + "logps/chosen": -386.0, + "logps/rejected": -368.0, + "loss": 0.0153, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.205078125, + "rewards/margins": 10.1875, + "rewards/rejected": -10.0, + "step": 2433 + }, + { + "epoch": 2.9865030674846627, + "grad_norm": 5.523546116175359, + "learning_rate": 2.2727272727272727e-09, + "logits/chosen": -0.298828125, + "logits/rejected": -0.58984375, + "logps/chosen": -408.0, + "logps/rejected": -366.0, + "loss": 0.0171, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.98828125, + "rewards/margins": 10.25, + "rewards/rejected": -9.25, + "step": 2434 + }, + { + "epoch": 2.9877300613496933, + "grad_norm": 3.345943272292768, + "learning_rate": 2.066115702479339e-09, + "logits/chosen": -0.185546875, + "logits/rejected": -0.337890625, + "logps/chosen": -382.0, + "logps/rejected": -350.0, + "loss": 0.0111, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.51953125, + "rewards/margins": 8.875, + "rewards/rejected": -9.4375, + "step": 2435 + }, + { + "epoch": 2.988957055214724, + "grad_norm": 5.776608705449125, + "learning_rate": 1.859504132231405e-09, + "logits/chosen": -0.2734375, + "logits/rejected": -0.46875, + "logps/chosen": -484.0, + "logps/rejected": -392.0, + "loss": 0.0178, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.765625, + "rewards/margins": 10.5625, + "rewards/rejected": -9.8125, + "step": 2436 + }, + { + "epoch": 2.9901840490797547, + "grad_norm": 5.063964853754313, + "learning_rate": 1.652892561983471e-09, + "logits/chosen": -0.328125, + "logits/rejected": -0.52734375, + "logps/chosen": -430.0, + "logps/rejected": -414.0, + "loss": 0.0168, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.22265625, + "rewards/margins": 10.1875, + "rewards/rejected": -9.9375, + "step": 2437 + }, + { + "epoch": 2.9914110429447853, + "grad_norm": 3.080709877400218, + "learning_rate": 1.446280991735537e-09, + "logits/chosen": -0.2431640625, + "logits/rejected": -0.45703125, + "logps/chosen": -394.0, + "logps/rejected": -354.0, + "loss": 0.009, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.796875, + "rewards/margins": 10.6875, + "rewards/rejected": -9.9375, + "step": 2438 + }, + { + "epoch": 2.992638036809816, + "grad_norm": 3.8880409866287406, + "learning_rate": 1.2396694214876033e-09, + "logits/chosen": -0.30078125, + "logits/rejected": -0.51171875, + "logps/chosen": -398.0, + "logps/rejected": -344.0, + "loss": 0.0149, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.4375, + "rewards/margins": 10.0625, + "rewards/rejected": -9.625, + "step": 2439 + }, + { + "epoch": 2.9938650306748467, + "grad_norm": 4.4419221452752256, + "learning_rate": 1.0330578512396694e-09, + "logits/chosen": -0.458984375, + "logits/rejected": -0.5390625, + "logps/chosen": -408.0, + "logps/rejected": -428.0, + "loss": 0.0168, + "rewards/accuracies": 0.9921875, + "rewards/chosen": 0.447265625, + "rewards/margins": 11.25, + "rewards/rejected": -10.8125, + "step": 2440 + }, + { + "epoch": 2.9950920245398773, + "grad_norm": 5.947346323824424, + "learning_rate": 8.264462809917355e-10, + "logits/chosen": -0.2333984375, + "logits/rejected": -0.33984375, + "logps/chosen": -376.0, + "logps/rejected": -356.0, + "loss": 0.0254, + "rewards/accuracies": 0.9921875, + "rewards/chosen": -1.0859375, + "rewards/margins": 8.5625, + "rewards/rejected": -9.625, + "step": 2441 + }, + { + "epoch": 2.996319018404908, + "grad_norm": 4.056492556974755, + "learning_rate": 6.198347107438016e-10, + "logits/chosen": -0.234375, + "logits/rejected": -0.328125, + "logps/chosen": -378.0, + "logps/rejected": -386.0, + "loss": 0.0127, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.419921875, + "rewards/margins": 10.375, + "rewards/rejected": -9.9375, + "step": 2442 + }, + { + "epoch": 2.9975460122699387, + "grad_norm": 4.584247877450063, + "learning_rate": 4.1322314049586776e-10, + "logits/chosen": -0.291015625, + "logits/rejected": -0.345703125, + "logps/chosen": -374.0, + "logps/rejected": -352.0, + "loss": 0.0131, + "rewards/accuracies": 1.0, + "rewards/chosen": -0.94140625, + "rewards/margins": 9.125, + "rewards/rejected": -10.0625, + "step": 2443 + }, + { + "epoch": 2.9987730061349693, + "grad_norm": 5.0203537223569015, + "learning_rate": 2.0661157024793388e-10, + "logits/chosen": -0.400390625, + "logits/rejected": -0.58203125, + "logps/chosen": -422.0, + "logps/rejected": -398.0, + "loss": 0.0149, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.000751495361328125, + "rewards/margins": 10.25, + "rewards/rejected": -10.25, + "step": 2444 + }, + { + "epoch": 3.0, + "grad_norm": 5.683128500949149, + "learning_rate": 0.0, + "logits/chosen": -0.384765625, + "logits/rejected": -0.515625, + "logps/chosen": -352.0, + "logps/rejected": -394.0, + "loss": 0.0155, + "rewards/accuracies": 1.0, + "rewards/chosen": 0.29296875, + "rewards/margins": 10.0, + "rewards/rejected": -9.6875, + "step": 2445 + } + ], + "logging_steps": 1, + "max_steps": 2445, + "num_input_tokens_seen": 0, + "num_train_epochs": 3, + "save_steps": 500, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": true + }, + "attributes": {} + } + }, + "total_flos": 0.0, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/checkpoint-2445/training_args.bin b/checkpoint-2445/training_args.bin new file mode 100644 index 0000000..e6584e4 --- /dev/null +++ b/checkpoint-2445/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2c8443655ac3e7ec4a935ee92ab8e32d8a6138b7510b01c0cdfb106a1174f6d8 +size 9528 diff --git a/checkpoint-2445/zero_to_fp32.py b/checkpoint-2445/zero_to_fp32.py new file mode 100644 index 0000000..24cc342 --- /dev/null +++ b/checkpoint-2445/zero_to_fp32.py @@ -0,0 +1,604 @@ +#!/usr/bin/env python + +# Copyright (c) Microsoft Corporation. +# SPDX-License-Identifier: Apache-2.0 + +# DeepSpeed Team + +# This script extracts fp32 consolidated weights from a zero 1, 2 and 3 DeepSpeed checkpoints. It gets +# copied into the top level checkpoint dir, so the user can easily do the conversion at any point in +# the future. Once extracted, the weights don't require DeepSpeed and can be used in any +# application. +# +# example: python zero_to_fp32.py . pytorch_model.bin + +import argparse +import torch +import glob +import math +import os +import re +from collections import OrderedDict +from dataclasses import dataclass + +# while this script doesn't use deepspeed to recover data, since the checkpoints are pickled with +# DeepSpeed data structures it has to be available in the current python environment. +from deepspeed.utils import logger +from deepspeed.checkpoint.constants import (DS_VERSION, OPTIMIZER_STATE_DICT, SINGLE_PARTITION_OF_FP32_GROUPS, + FP32_FLAT_GROUPS, ZERO_STAGE, PARTITION_COUNT, PARAM_SHAPES, BUFFER_NAMES, + FROZEN_PARAM_SHAPES, FROZEN_PARAM_FRAGMENTS) + + +@dataclass +class zero_model_state: + buffers: dict() + param_shapes: dict() + shared_params: list + ds_version: int + frozen_param_shapes: dict() + frozen_param_fragments: dict() + + +debug = 0 + +# load to cpu +device = torch.device('cpu') + + +def atoi(text): + return int(text) if text.isdigit() else text + + +def natural_keys(text): + ''' + alist.sort(key=natural_keys) sorts in human order + http://nedbatchelder.com/blog/200712/human_sorting.html + (See Toothy's implementation in the comments) + ''' + return [atoi(c) for c in re.split(r'(\d+)', text)] + + +def get_model_state_file(checkpoint_dir, zero_stage): + if not os.path.isdir(checkpoint_dir): + raise FileNotFoundError(f"Directory '{checkpoint_dir}' doesn't exist") + + # there should be only one file + if zero_stage <= 2: + file = os.path.join(checkpoint_dir, "mp_rank_00_model_states.pt") + elif zero_stage == 3: + file = os.path.join(checkpoint_dir, "zero_pp_rank_0_mp_rank_00_model_states.pt") + + if not os.path.exists(file): + raise FileNotFoundError(f"can't find model states file at '{file}'") + + return file + + +def get_checkpoint_files(checkpoint_dir, glob_pattern): + # XXX: need to test that this simple glob rule works for multi-node setup too + ckpt_files = sorted(glob.glob(os.path.join(checkpoint_dir, glob_pattern)), key=natural_keys) + + if len(ckpt_files) == 0: + raise FileNotFoundError(f"can't find {glob_pattern} files in directory '{checkpoint_dir}'") + + return ckpt_files + + +def get_optim_files(checkpoint_dir): + return get_checkpoint_files(checkpoint_dir, "*_optim_states.pt") + + +def get_model_state_files(checkpoint_dir): + return get_checkpoint_files(checkpoint_dir, "*_model_states.pt") + + +def parse_model_states(files): + zero_model_states = [] + for file in files: + state_dict = torch.load(file, map_location=device) + + if BUFFER_NAMES not in state_dict: + raise ValueError(f"{file} is not a model state checkpoint") + buffer_names = state_dict[BUFFER_NAMES] + if debug: + print("Found buffers:", buffer_names) + + # recover just the buffers while restoring them to fp32 if they were saved in fp16 + buffers = {k: v.float() for k, v in state_dict["module"].items() if k in buffer_names} + param_shapes = state_dict[PARAM_SHAPES] + + # collect parameters that are included in param_shapes + param_names = [] + for s in param_shapes: + for name in s.keys(): + param_names.append(name) + + # update with frozen parameters + frozen_param_shapes = state_dict.get(FROZEN_PARAM_SHAPES, None) + if frozen_param_shapes is not None: + if debug: + print(f"Found frozen_param_shapes: {frozen_param_shapes}") + param_names += list(frozen_param_shapes.keys()) + + # handle shared params + shared_params = [[k, v] for k, v in state_dict["shared_params"].items()] + + ds_version = state_dict.get(DS_VERSION, None) + + frozen_param_fragments = state_dict.get(FROZEN_PARAM_FRAGMENTS, None) + + z_model_state = zero_model_state(buffers=buffers, + param_shapes=param_shapes, + shared_params=shared_params, + ds_version=ds_version, + frozen_param_shapes=frozen_param_shapes, + frozen_param_fragments=frozen_param_fragments) + zero_model_states.append(z_model_state) + + return zero_model_states + + +def parse_optim_states(files, ds_checkpoint_dir): + + total_files = len(files) + state_dicts = [] + for f in files: + state_dict = torch.load(f, map_location=device) + # immediately discard the potentially huge 2 optimizer states as we only care for fp32 master weights + # and also handle the case where it was already removed by another helper script + state_dict["optimizer_state_dict"].pop("optimizer_state_dict", None) + state_dicts.append(state_dict) + + if not ZERO_STAGE in state_dicts[0][OPTIMIZER_STATE_DICT]: + raise ValueError(f"{files[0]} is not a zero checkpoint") + zero_stage = state_dicts[0][OPTIMIZER_STATE_DICT][ZERO_STAGE] + world_size = state_dicts[0][OPTIMIZER_STATE_DICT][PARTITION_COUNT] + + # For ZeRO-2 each param group can have different partition_count as data parallelism for expert + # parameters can be different from data parallelism for non-expert parameters. So we can just + # use the max of the partition_count to get the dp world_size. + + if type(world_size) is list: + world_size = max(world_size) + + if world_size != total_files: + raise ValueError( + f"Expected {world_size} of '*_optim_states.pt' under '{ds_checkpoint_dir}' but found {total_files} files. " + "Possibly due to an overwrite of an old checkpoint, or a checkpoint didn't get saved by one or more processes." + ) + + # the groups are named differently in each stage + if zero_stage <= 2: + fp32_groups_key = SINGLE_PARTITION_OF_FP32_GROUPS + elif zero_stage == 3: + fp32_groups_key = FP32_FLAT_GROUPS + else: + raise ValueError(f"unknown zero stage {zero_stage}") + + if zero_stage <= 2: + fp32_flat_groups = [state_dicts[i][OPTIMIZER_STATE_DICT][fp32_groups_key] for i in range(len(state_dicts))] + elif zero_stage == 3: + # if there is more than one param group, there will be multiple flattened tensors - one + # flattened tensor per group - for simplicity merge them into a single tensor + # + # XXX: could make the script more memory efficient for when there are multiple groups - it + # will require matching the sub-lists of param_shapes for each param group flattened tensor + + fp32_flat_groups = [ + torch.cat(state_dicts[i][OPTIMIZER_STATE_DICT][fp32_groups_key], 0) for i in range(len(state_dicts)) + ] + + return zero_stage, world_size, fp32_flat_groups + + +def _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters): + """ + Returns fp32 state_dict reconstructed from ds checkpoint + + Args: + - ``ds_checkpoint_dir``: path to the deepspeed checkpoint folder (where the optimizer files are) + + """ + print(f"Processing zero checkpoint '{ds_checkpoint_dir}'") + + optim_files = get_optim_files(ds_checkpoint_dir) + zero_stage, world_size, fp32_flat_groups = parse_optim_states(optim_files, ds_checkpoint_dir) + print(f"Detected checkpoint of type zero stage {zero_stage}, world_size: {world_size}") + + model_files = get_model_state_files(ds_checkpoint_dir) + + zero_model_states = parse_model_states(model_files) + print(f'Parsing checkpoint created by deepspeed=={zero_model_states[0].ds_version}') + + if zero_stage <= 2: + return _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters) + elif zero_stage == 3: + return _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters) + + +def _zero2_merge_frozen_params(state_dict, zero_model_states): + if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0: + return + + frozen_param_shapes = zero_model_states[0].frozen_param_shapes + frozen_param_fragments = zero_model_states[0].frozen_param_fragments + + if debug: + num_elem = sum(s.numel() for s in frozen_param_shapes.values()) + print(f'rank 0: {FROZEN_PARAM_SHAPES}.numel = {num_elem}') + + wanted_params = len(frozen_param_shapes) + wanted_numel = sum(s.numel() for s in frozen_param_shapes.values()) + avail_numel = sum([p.numel() for p in frozen_param_fragments.values()]) + print(f'Frozen params: Have {avail_numel} numels to process.') + print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params') + + total_params = 0 + total_numel = 0 + for name, shape in frozen_param_shapes.items(): + total_params += 1 + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + + state_dict[name] = frozen_param_fragments[name] + + if debug: + print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ") + + print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements") + + +def _has_callable(obj, fn): + attr = getattr(obj, fn, None) + return callable(attr) + + +def _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states): + param_shapes = zero_model_states[0].param_shapes + + # Reconstruction protocol: + # + # XXX: document this + + if debug: + for i in range(world_size): + for j in range(len(fp32_flat_groups[0])): + print(f"{FP32_FLAT_GROUPS}[{i}][{j}].shape={fp32_flat_groups[i][j].shape}") + + # XXX: memory usage doubles here (zero2) + num_param_groups = len(fp32_flat_groups[0]) + merged_single_partition_of_fp32_groups = [] + for i in range(num_param_groups): + merged_partitions = [sd[i] for sd in fp32_flat_groups] + full_single_fp32_vector = torch.cat(merged_partitions, 0) + merged_single_partition_of_fp32_groups.append(full_single_fp32_vector) + avail_numel = sum( + [full_single_fp32_vector.numel() for full_single_fp32_vector in merged_single_partition_of_fp32_groups]) + + if debug: + wanted_params = sum([len(shapes) for shapes in param_shapes]) + wanted_numel = sum([sum(shape.numel() for shape in shapes.values()) for shapes in param_shapes]) + # not asserting if there is a mismatch due to possible padding + print(f"Have {avail_numel} numels to process.") + print(f"Need {wanted_numel} numels in {wanted_params} params.") + + # params + # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support + # out-of-core computing solution + total_numel = 0 + total_params = 0 + for shapes, full_single_fp32_vector in zip(param_shapes, merged_single_partition_of_fp32_groups): + offset = 0 + avail_numel = full_single_fp32_vector.numel() + for name, shape in shapes.items(): + + unpartitioned_numel = shape.numel() if _has_callable(shape, 'numel') else math.prod(shape) + total_numel += unpartitioned_numel + total_params += 1 + + if debug: + print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ") + state_dict[name] = full_single_fp32_vector.narrow(0, offset, unpartitioned_numel).view(shape) + offset += unpartitioned_numel + + # Z2 started to align to 2*world_size to improve nccl performance. Therefore both offset and + # avail_numel can differ by anywhere between 0..2*world_size. Due to two unrelated complex + # paddings performed in the code it's almost impossible to predict the exact numbers w/o the + # live optimizer object, so we are checking that the numbers are within the right range + align_to = 2 * world_size + + def zero2_align(x): + return align_to * math.ceil(x / align_to) + + if debug: + print(f"original offset={offset}, avail_numel={avail_numel}") + + offset = zero2_align(offset) + avail_numel = zero2_align(avail_numel) + + if debug: + print(f"aligned offset={offset}, avail_numel={avail_numel}") + + # Sanity check + if offset != avail_numel: + raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong") + + print(f"Reconstructed fp32 state dict with {total_params} params {total_numel} elements") + + +def _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters): + state_dict = OrderedDict() + + # buffers + buffers = zero_model_states[0].buffers + state_dict.update(buffers) + if debug: + print(f"added {len(buffers)} buffers") + + if not exclude_frozen_parameters: + _zero2_merge_frozen_params(state_dict, zero_model_states) + + _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states) + + # recover shared parameters + for pair in zero_model_states[0].shared_params: + if pair[1] in state_dict: + state_dict[pair[0]] = state_dict[pair[1]] + + return state_dict + + +def zero3_partitioned_param_info(unpartitioned_numel, world_size): + remainder = unpartitioned_numel % world_size + padding_numel = (world_size - remainder) if remainder else 0 + partitioned_numel = math.ceil(unpartitioned_numel / world_size) + return partitioned_numel, padding_numel + + +def _zero3_merge_frozen_params(state_dict, world_size, zero_model_states): + if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0: + return + + if debug: + for i in range(world_size): + num_elem = sum(s.numel() for s in zero_model_states[i].frozen_param_fragments.values()) + print(f'rank {i}: {FROZEN_PARAM_SHAPES}.numel = {num_elem}') + + frozen_param_shapes = zero_model_states[0].frozen_param_shapes + wanted_params = len(frozen_param_shapes) + wanted_numel = sum(s.numel() for s in frozen_param_shapes.values()) + avail_numel = sum([p.numel() for p in zero_model_states[0].frozen_param_fragments.values()]) * world_size + print(f'Frozen params: Have {avail_numel} numels to process.') + print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params') + + total_params = 0 + total_numel = 0 + for name, shape in zero_model_states[0].frozen_param_shapes.items(): + total_params += 1 + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + + param_frags = tuple(model_state.frozen_param_fragments[name] for model_state in zero_model_states) + state_dict[name] = torch.cat(param_frags, 0).narrow(0, 0, unpartitioned_numel).view(shape) + + partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size) + + if debug: + print( + f"Frozen params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}" + ) + + print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements") + + +def _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states): + param_shapes = zero_model_states[0].param_shapes + avail_numel = fp32_flat_groups[0].numel() * world_size + # Reconstruction protocol: For zero3 we need to zip the partitions together at boundary of each + # param, re-consolidating each param, while dealing with padding if any + + # merge list of dicts, preserving order + param_shapes = {k: v for d in param_shapes for k, v in d.items()} + + if debug: + for i in range(world_size): + print(f"{FP32_FLAT_GROUPS}[{i}].shape={fp32_flat_groups[i].shape}") + + wanted_params = len(param_shapes) + wanted_numel = sum(shape.numel() for shape in param_shapes.values()) + # not asserting if there is a mismatch due to possible padding + avail_numel = fp32_flat_groups[0].numel() * world_size + print(f"Trainable params: Have {avail_numel} numels to process.") + print(f"Trainable params: Need {wanted_numel} numels in {wanted_params} params.") + + # params + # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support + # out-of-core computing solution + offset = 0 + total_numel = 0 + total_params = 0 + for name, shape in param_shapes.items(): + + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + total_params += 1 + + partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size) + + if debug: + print( + f"Trainable params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}" + ) + + # XXX: memory usage doubles here + state_dict[name] = torch.cat( + tuple(fp32_flat_groups[i].narrow(0, offset, partitioned_numel) for i in range(world_size)), + 0).narrow(0, 0, unpartitioned_numel).view(shape) + offset += partitioned_numel + + offset *= world_size + + # Sanity check + if offset != avail_numel: + raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong") + + print(f"Reconstructed Trainable fp32 state dict with {total_params} params {total_numel} elements") + + +def _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters): + state_dict = OrderedDict() + + # buffers + buffers = zero_model_states[0].buffers + state_dict.update(buffers) + if debug: + print(f"added {len(buffers)} buffers") + + if not exclude_frozen_parameters: + _zero3_merge_frozen_params(state_dict, world_size, zero_model_states) + + _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states) + + # recover shared parameters + for pair in zero_model_states[0].shared_params: + if pair[1] in state_dict: + state_dict[pair[0]] = state_dict[pair[1]] + + return state_dict + + +def get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, tag=None, exclude_frozen_parameters=False): + """ + Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated state_dict that can be loaded with + ``load_state_dict()`` and used for training without DeepSpeed or shared with others, for example + via a model hub. + + Args: + - ``checkpoint_dir``: path to the desired checkpoint folder + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in 'latest' file. e.g., ``global_step14`` + - ``exclude_frozen_parameters``: exclude frozen parameters + + Returns: + - pytorch ``state_dict`` + + Note: this approach may not work if your application doesn't have sufficient free CPU memory and + you may need to use the offline approach using the ``zero_to_fp32.py`` script that is saved with + the checkpoint. + + A typical usage might be :: + + from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint + # do the training and checkpoint saving + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir) # already on cpu + model = model.cpu() # move to cpu + model.load_state_dict(state_dict) + # submit to model hub or save the model to share with others + + In this example the ``model`` will no longer be usable in the deepspeed context of the same + application. i.e. you will need to re-initialize the deepspeed engine, since + ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it. + + If you want it all done for you, use ``load_state_dict_from_zero_checkpoint`` instead. + + """ + if tag is None: + latest_path = os.path.join(checkpoint_dir, 'latest') + if os.path.isfile(latest_path): + with open(latest_path, 'r') as fd: + tag = fd.read().strip() + else: + raise ValueError(f"Unable to find 'latest' file at {latest_path}") + + ds_checkpoint_dir = os.path.join(checkpoint_dir, tag) + + if not os.path.isdir(ds_checkpoint_dir): + raise FileNotFoundError(f"Directory '{ds_checkpoint_dir}' doesn't exist") + + return _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters) + + +def convert_zero_checkpoint_to_fp32_state_dict(checkpoint_dir, output_file, tag=None, exclude_frozen_parameters=False): + """ + Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict`` file that can be + loaded with ``torch.load(file)`` + ``load_state_dict()`` and used for training without DeepSpeed. + + Args: + - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``) + - ``output_file``: path to the pytorch fp32 state_dict output file (e.g. path/pytorch_model.bin) + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14`` + - ``exclude_frozen_parameters``: exclude frozen parameters + """ + + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, tag, exclude_frozen_parameters) + print(f"Saving fp32 state dict to {output_file}") + torch.save(state_dict, output_file) + + +def load_state_dict_from_zero_checkpoint(model, checkpoint_dir, tag=None): + """ + 1. Put the provided model to cpu + 2. Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict`` + 3. Load it into the provided model + + Args: + - ``model``: the model object to update + - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``) + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14`` + + Returns: + - ``model`: modified model + + Make sure you have plenty of CPU memory available before you call this function. If you don't + have enough use the ``zero_to_fp32.py`` utility to do the conversion. You will find it + conveniently placed for you in the checkpoint folder. + + A typical usage might be :: + + from deepspeed.utils.zero_to_fp32 import load_state_dict_from_zero_checkpoint + model = load_state_dict_from_zero_checkpoint(trainer.model, checkpoint_dir) + # submit to model hub or save the model to share with others + + Note, that once this was run, the ``model`` will no longer be usable in the deepspeed context + of the same application. i.e. you will need to re-initialize the deepspeed engine, since + ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it. + + """ + logger.info(f"Extracting fp32 weights") + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, tag) + + logger.info(f"Overwriting model with fp32 weights") + model = model.cpu() + model.load_state_dict(state_dict, strict=False) + + return model + + +if __name__ == "__main__": + + parser = argparse.ArgumentParser() + parser.add_argument("checkpoint_dir", + type=str, + help="path to the desired checkpoint folder, e.g., path/checkpoint-12") + parser.add_argument( + "output_file", + type=str, + help="path to the pytorch fp32 state_dict output file (e.g. path/checkpoint-12/pytorch_model.bin)") + parser.add_argument("-t", + "--tag", + type=str, + default=None, + help="checkpoint tag used as a unique identifier for checkpoint. e.g., global_step1") + parser.add_argument("--exclude_frozen_parameters", action='store_true', help="exclude frozen parameters") + parser.add_argument("-d", "--debug", action='store_true', help="enable debug") + args = parser.parse_args() + + debug = args.debug + + convert_zero_checkpoint_to_fp32_state_dict(args.checkpoint_dir, + args.output_file, + tag=args.tag, + exclude_frozen_parameters=args.exclude_frozen_parameters) diff --git a/checkpoint-815/config.json b/checkpoint-815/config.json new file mode 100644 index 0000000..ded5a8b --- /dev/null +++ b/checkpoint-815/config.json @@ -0,0 +1,35 @@ +{ + "architectures": [ + "LlamaForCausalLM" + ], + "attention_bias": false, + "attention_dropout": 0.0, + "bos_token_id": 128000, + "eos_token_id": 128009, + "head_dim": 128, + "hidden_act": "silu", + "hidden_size": 4096, + "initializer_range": 0.02, + "intermediate_size": 14336, + "max_position_embeddings": 131072, + "mlp_bias": false, + "model_type": "llama", + "num_attention_heads": 32, + "num_hidden_layers": 32, + "num_key_value_heads": 8, + "pretraining_tp": 1, + "rms_norm_eps": 1e-05, + "rope_scaling": { + "factor": 8.0, + "high_freq_factor": 4.0, + "low_freq_factor": 1.0, + "original_max_position_embeddings": 8192, + "rope_type": "llama3" + }, + "rope_theta": 500000.0, + "tie_word_embeddings": false, + "torch_dtype": "bfloat16", + "transformers_version": "4.50.0", + "use_cache": false, + "vocab_size": 128256 +} diff --git a/checkpoint-815/generation_config.json b/checkpoint-815/generation_config.json new file mode 100644 index 0000000..0acdb5a --- /dev/null +++ b/checkpoint-815/generation_config.json @@ -0,0 +1,12 @@ +{ + "bos_token_id": 128000, + "do_sample": true, + "eos_token_id": [ + 128001, + 128008, + 128009 + ], + "temperature": 0.6, + "top_p": 0.9, + "transformers_version": "4.50.0" +} diff --git a/checkpoint-815/global_step815/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt b/checkpoint-815/global_step815/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..250a1be --- /dev/null +++ b/checkpoint-815/global_step815/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c0732d99f7912989f0591a6cf1037f09c9a291abc1530596ee8aa02f1f385cb3 +size 1514015111 diff --git a/checkpoint-815/global_step815/bf16_zero_pp_rank_10_mp_rank_00_optim_states.pt b/checkpoint-815/global_step815/bf16_zero_pp_rank_10_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..9a21a7d --- /dev/null +++ b/checkpoint-815/global_step815/bf16_zero_pp_rank_10_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:01715fc314336546ee15a7263bd71f476ad4af42ac173fd22a3575388027ea72 +size 1514016442 diff --git a/checkpoint-815/global_step815/bf16_zero_pp_rank_11_mp_rank_00_optim_states.pt b/checkpoint-815/global_step815/bf16_zero_pp_rank_11_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..ee114bf --- /dev/null +++ b/checkpoint-815/global_step815/bf16_zero_pp_rank_11_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:cea7e535217be5612aa8c4230ee8cf0e2f5c4cf8241d4bf10da315fbf763b80a +size 1514016442 diff --git a/checkpoint-815/global_step815/bf16_zero_pp_rank_12_mp_rank_00_optim_states.pt b/checkpoint-815/global_step815/bf16_zero_pp_rank_12_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..3bca141 --- /dev/null +++ b/checkpoint-815/global_step815/bf16_zero_pp_rank_12_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c4d24c2c64359955a830401e059b10dd22f313b6ea470840a6dbe9af21cc37bc +size 1514016442 diff --git a/checkpoint-815/global_step815/bf16_zero_pp_rank_13_mp_rank_00_optim_states.pt b/checkpoint-815/global_step815/bf16_zero_pp_rank_13_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..d4f9735 --- /dev/null +++ b/checkpoint-815/global_step815/bf16_zero_pp_rank_13_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7d759f5805e9fcc7a732aeb204aea482c52d0e3f3bd8fac286dc76ed577a689f +size 1514016442 diff --git a/checkpoint-815/global_step815/bf16_zero_pp_rank_14_mp_rank_00_optim_states.pt b/checkpoint-815/global_step815/bf16_zero_pp_rank_14_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..33177c7 --- /dev/null +++ b/checkpoint-815/global_step815/bf16_zero_pp_rank_14_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4f835917ac36975fc6066590205faca79ab85f6804637fb35a12bb276e5077d0 +size 1514016442 diff --git a/checkpoint-815/global_step815/bf16_zero_pp_rank_15_mp_rank_00_optim_states.pt b/checkpoint-815/global_step815/bf16_zero_pp_rank_15_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..2654243 --- /dev/null +++ b/checkpoint-815/global_step815/bf16_zero_pp_rank_15_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:fc0e68caab56d3c5a6cbb83c3e7142b07086452e85feecc23ce91541136de0ce +size 1514016442 diff --git a/checkpoint-815/global_step815/bf16_zero_pp_rank_16_mp_rank_00_optim_states.pt b/checkpoint-815/global_step815/bf16_zero_pp_rank_16_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..06d764a --- /dev/null +++ b/checkpoint-815/global_step815/bf16_zero_pp_rank_16_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:69496a1e9d40e8c39481220d99b762c14f523bb44d52c120fbf09799bb025776 +size 1514016442 diff --git a/checkpoint-815/global_step815/bf16_zero_pp_rank_17_mp_rank_00_optim_states.pt b/checkpoint-815/global_step815/bf16_zero_pp_rank_17_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..ba886a9 --- /dev/null +++ b/checkpoint-815/global_step815/bf16_zero_pp_rank_17_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:532fd03727c1c886f9a7d1fa71098697aeb978f4ca0fe7873d3cd86c310fc24e +size 1514016442 diff --git a/checkpoint-815/global_step815/bf16_zero_pp_rank_18_mp_rank_00_optim_states.pt b/checkpoint-815/global_step815/bf16_zero_pp_rank_18_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..434e877 --- /dev/null +++ b/checkpoint-815/global_step815/bf16_zero_pp_rank_18_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7e15de7eec228fb04ae5b80b1828cdcd91f14f294651cb8e2b9062c0f1f9a217 +size 1514016442 diff --git a/checkpoint-815/global_step815/bf16_zero_pp_rank_19_mp_rank_00_optim_states.pt b/checkpoint-815/global_step815/bf16_zero_pp_rank_19_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..f93f48c --- /dev/null +++ b/checkpoint-815/global_step815/bf16_zero_pp_rank_19_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:cdc0745afa5d7ddf35487018a2af59b5bd80e64fb974b7ef9ea90e271500bd2b +size 1514016442 diff --git a/checkpoint-815/global_step815/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt b/checkpoint-815/global_step815/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..3d6f835 --- /dev/null +++ b/checkpoint-815/global_step815/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6aae8e59ae6250ef8a120c7fec5e1cc1ee0850c9b238d2f8624e0dc483424ee1 +size 1514015111 diff --git a/checkpoint-815/global_step815/bf16_zero_pp_rank_20_mp_rank_00_optim_states.pt b/checkpoint-815/global_step815/bf16_zero_pp_rank_20_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..c902abc --- /dev/null +++ b/checkpoint-815/global_step815/bf16_zero_pp_rank_20_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6c406fa17e362dc75e9e712d73dacf0d49e9a70374a03806ad418e6e45aa2aec +size 1514016442 diff --git a/checkpoint-815/global_step815/bf16_zero_pp_rank_21_mp_rank_00_optim_states.pt b/checkpoint-815/global_step815/bf16_zero_pp_rank_21_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..0035b57 --- /dev/null +++ b/checkpoint-815/global_step815/bf16_zero_pp_rank_21_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:030005ca82709d367e3a783419e67cda9e91e19eef0b2e63da83009e4973b4ce +size 1514016442 diff --git a/checkpoint-815/global_step815/bf16_zero_pp_rank_22_mp_rank_00_optim_states.pt b/checkpoint-815/global_step815/bf16_zero_pp_rank_22_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..0c0e086 --- /dev/null +++ b/checkpoint-815/global_step815/bf16_zero_pp_rank_22_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4d532e3f97c6ce4f0c94ce4cfc99b0a08c681fb492936a9981ed671221b9368e +size 1514016442 diff --git a/checkpoint-815/global_step815/bf16_zero_pp_rank_23_mp_rank_00_optim_states.pt b/checkpoint-815/global_step815/bf16_zero_pp_rank_23_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..ab25a40 --- /dev/null +++ b/checkpoint-815/global_step815/bf16_zero_pp_rank_23_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d346f9a475210158b9f62ecf9afe5f2b91f5801a6155d6a71b54f6dca353c21d +size 1514016442 diff --git a/checkpoint-815/global_step815/bf16_zero_pp_rank_24_mp_rank_00_optim_states.pt b/checkpoint-815/global_step815/bf16_zero_pp_rank_24_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..47a8e36 --- /dev/null +++ b/checkpoint-815/global_step815/bf16_zero_pp_rank_24_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:79ce5746275925505ac93df4d1b0f792e437cadc52f125dad31e6c648b8465ec +size 1514016442 diff --git a/checkpoint-815/global_step815/bf16_zero_pp_rank_25_mp_rank_00_optim_states.pt b/checkpoint-815/global_step815/bf16_zero_pp_rank_25_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..1e8ef95 --- /dev/null +++ b/checkpoint-815/global_step815/bf16_zero_pp_rank_25_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d5e4beac9cd3ad84cd684c7130109eb36cf53f9e8ebf90406631ee4fc27bb3b7 +size 1514016442 diff --git a/checkpoint-815/global_step815/bf16_zero_pp_rank_26_mp_rank_00_optim_states.pt b/checkpoint-815/global_step815/bf16_zero_pp_rank_26_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..36cff41 --- /dev/null +++ b/checkpoint-815/global_step815/bf16_zero_pp_rank_26_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:837ecfaf32aa84bd384ebe7fbdcc85b6d744d6ce7bd57e7f706438b47f5b80df +size 1514016442 diff --git a/checkpoint-815/global_step815/bf16_zero_pp_rank_27_mp_rank_00_optim_states.pt b/checkpoint-815/global_step815/bf16_zero_pp_rank_27_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..2e847a7 --- /dev/null +++ b/checkpoint-815/global_step815/bf16_zero_pp_rank_27_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:a50e4978b6e92b61557b955a1e7e3666d694d9f41e9c3bcd4bdc5a11e29f0f8b +size 1514016442 diff --git a/checkpoint-815/global_step815/bf16_zero_pp_rank_28_mp_rank_00_optim_states.pt b/checkpoint-815/global_step815/bf16_zero_pp_rank_28_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..3c3c149 --- /dev/null +++ b/checkpoint-815/global_step815/bf16_zero_pp_rank_28_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:773851c2b48e18765aebc463b568bab769503b7c18644acd85c4f51b05022d2e +size 1514016442 diff --git a/checkpoint-815/global_step815/bf16_zero_pp_rank_29_mp_rank_00_optim_states.pt b/checkpoint-815/global_step815/bf16_zero_pp_rank_29_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..5ccd911 --- /dev/null +++ b/checkpoint-815/global_step815/bf16_zero_pp_rank_29_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ad420ea67de1a87fba753e779654e7dfcdc9a5b54189b84299a62c08bfbcd28b +size 1514016442 diff --git a/checkpoint-815/global_step815/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt b/checkpoint-815/global_step815/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..09e3ca7 --- /dev/null +++ b/checkpoint-815/global_step815/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e81807ad46ddeeb22a5739c61cf73a2763abb5b615d276b33bcec04ed26468d5 +size 1514015111 diff --git a/checkpoint-815/global_step815/bf16_zero_pp_rank_30_mp_rank_00_optim_states.pt b/checkpoint-815/global_step815/bf16_zero_pp_rank_30_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..2ddb5de --- /dev/null +++ b/checkpoint-815/global_step815/bf16_zero_pp_rank_30_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7522b75df1753af3f341c15056ca9698502b32e694517f8bf6b848b3eaa83169 +size 1514016442 diff --git a/checkpoint-815/global_step815/bf16_zero_pp_rank_31_mp_rank_00_optim_states.pt b/checkpoint-815/global_step815/bf16_zero_pp_rank_31_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..5600e15 --- /dev/null +++ b/checkpoint-815/global_step815/bf16_zero_pp_rank_31_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:bb4e003f95a40d32e2fbb4175fa44b9739212aa54f6d9f024b53cc5d96f498e0 +size 1514016442 diff --git a/checkpoint-815/global_step815/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt b/checkpoint-815/global_step815/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..fcd8b9b --- /dev/null +++ b/checkpoint-815/global_step815/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:f747f22ec95a52b8531d79641554b91aaf6ef1b2879a84a37d7a1cb89503523c +size 1514015111 diff --git a/checkpoint-815/global_step815/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt b/checkpoint-815/global_step815/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..b2a4894 --- /dev/null +++ b/checkpoint-815/global_step815/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c921b3afb651ba7c4d8c447e7bf2f29d539c6f96b2636db6c1be03ac080e0dd1 +size 1514015111 diff --git a/checkpoint-815/global_step815/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt b/checkpoint-815/global_step815/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..4362331 --- /dev/null +++ b/checkpoint-815/global_step815/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:8ba2f1bff9b4fbdd7c07d0e92e6f58b0ad4c8a8b54b8586195ca64729c3b373b +size 1514015111 diff --git a/checkpoint-815/global_step815/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt b/checkpoint-815/global_step815/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..cfbc4dc --- /dev/null +++ b/checkpoint-815/global_step815/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:a4dc15cfbeb8c8faf992c03a12d0a98a6f01354c85a151fd99f7fa6dab02798b +size 1514015111 diff --git a/checkpoint-815/global_step815/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt b/checkpoint-815/global_step815/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..3553a57 --- /dev/null +++ b/checkpoint-815/global_step815/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e9066e8925671e802d036bc6858a35e031987149bb939b9420bf0156b5000691 +size 1514015111 diff --git a/checkpoint-815/global_step815/bf16_zero_pp_rank_8_mp_rank_00_optim_states.pt b/checkpoint-815/global_step815/bf16_zero_pp_rank_8_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..df1419f --- /dev/null +++ b/checkpoint-815/global_step815/bf16_zero_pp_rank_8_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:bb435b3f3e0981b001a5a961dfb68350557a0506dc2b39a9c965043256fe96f6 +size 1514015111 diff --git a/checkpoint-815/global_step815/bf16_zero_pp_rank_9_mp_rank_00_optim_states.pt b/checkpoint-815/global_step815/bf16_zero_pp_rank_9_mp_rank_00_optim_states.pt new file mode 100644 index 0000000..f239bff --- /dev/null +++ b/checkpoint-815/global_step815/bf16_zero_pp_rank_9_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:77c9b9f7705ba6ca362f429227b003bae8e7bff5fcf3de66868fcb5ed96075e3 +size 1514015111 diff --git a/checkpoint-815/global_step815/zero_pp_rank_0_mp_rank_00_model_states.pt b/checkpoint-815/global_step815/zero_pp_rank_0_mp_rank_00_model_states.pt new file mode 100644 index 0000000..8948f42 --- /dev/null +++ b/checkpoint-815/global_step815/zero_pp_rank_0_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:40ba6c0d314a71a8a038eeffa9046553c73f5e76e4b9d8e856629862855dfcfb +size 150245 diff --git a/checkpoint-815/global_step815/zero_pp_rank_10_mp_rank_00_model_states.pt b/checkpoint-815/global_step815/zero_pp_rank_10_mp_rank_00_model_states.pt new file mode 100644 index 0000000..2212482 --- /dev/null +++ b/checkpoint-815/global_step815/zero_pp_rank_10_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:024eef49228ce027257c81680e51700d64008ec55789eb59dcde70a36817558a +size 150540 diff --git a/checkpoint-815/global_step815/zero_pp_rank_11_mp_rank_00_model_states.pt b/checkpoint-815/global_step815/zero_pp_rank_11_mp_rank_00_model_states.pt new file mode 100644 index 0000000..40bd1bd --- /dev/null +++ b/checkpoint-815/global_step815/zero_pp_rank_11_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:5c00f3b3e366b7cfacd447b4434da21ef301448603fb55d4335db39299b66575 +size 150540 diff --git a/checkpoint-815/global_step815/zero_pp_rank_12_mp_rank_00_model_states.pt b/checkpoint-815/global_step815/zero_pp_rank_12_mp_rank_00_model_states.pt new file mode 100644 index 0000000..9915c4d --- /dev/null +++ b/checkpoint-815/global_step815/zero_pp_rank_12_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6cf1da6bf30a5b8f93f325e72d167effb11dfdf29766364fef6b9d4506dfb81e +size 150540 diff --git a/checkpoint-815/global_step815/zero_pp_rank_13_mp_rank_00_model_states.pt b/checkpoint-815/global_step815/zero_pp_rank_13_mp_rank_00_model_states.pt new file mode 100644 index 0000000..f03df1f --- /dev/null +++ b/checkpoint-815/global_step815/zero_pp_rank_13_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:9f94229da5713f438ab5c4189e38eadbc168fc643fd01a5b6eb930bd2f722efd +size 150540 diff --git a/checkpoint-815/global_step815/zero_pp_rank_14_mp_rank_00_model_states.pt b/checkpoint-815/global_step815/zero_pp_rank_14_mp_rank_00_model_states.pt new file mode 100644 index 0000000..058ff88 --- /dev/null +++ b/checkpoint-815/global_step815/zero_pp_rank_14_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b5b97915295b3f6c7eca69f6541ba5833b8919fc0cb698d51f36e8f4b9fdf1d5 +size 150540 diff --git a/checkpoint-815/global_step815/zero_pp_rank_15_mp_rank_00_model_states.pt b/checkpoint-815/global_step815/zero_pp_rank_15_mp_rank_00_model_states.pt new file mode 100644 index 0000000..b950999 --- /dev/null +++ b/checkpoint-815/global_step815/zero_pp_rank_15_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b99f4e99e6ffd910f61d39cd0667ad6f7cf15a6179452f54cd0ab9eb3be0f7c9 +size 150540 diff --git a/checkpoint-815/global_step815/zero_pp_rank_16_mp_rank_00_model_states.pt b/checkpoint-815/global_step815/zero_pp_rank_16_mp_rank_00_model_states.pt new file mode 100644 index 0000000..8974561 --- /dev/null +++ b/checkpoint-815/global_step815/zero_pp_rank_16_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:61fef944ea931de77863bf7ca7b70cda46266397ec948e9282e6930a74bf2ed0 +size 150540 diff --git a/checkpoint-815/global_step815/zero_pp_rank_17_mp_rank_00_model_states.pt b/checkpoint-815/global_step815/zero_pp_rank_17_mp_rank_00_model_states.pt new file mode 100644 index 0000000..05f05a1 --- /dev/null +++ b/checkpoint-815/global_step815/zero_pp_rank_17_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:8c65e902223780bcaa882920de3575f35c5deb86a74decf182ff60de992138c6 +size 150540 diff --git a/checkpoint-815/global_step815/zero_pp_rank_18_mp_rank_00_model_states.pt b/checkpoint-815/global_step815/zero_pp_rank_18_mp_rank_00_model_states.pt new file mode 100644 index 0000000..238e639 --- /dev/null +++ b/checkpoint-815/global_step815/zero_pp_rank_18_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:a133f1cb598eed313d7415e6de2861d456036a9823785dafc9b52a26fa533f4c +size 150540 diff --git a/checkpoint-815/global_step815/zero_pp_rank_19_mp_rank_00_model_states.pt b/checkpoint-815/global_step815/zero_pp_rank_19_mp_rank_00_model_states.pt new file mode 100644 index 0000000..2c4dc0d --- /dev/null +++ b/checkpoint-815/global_step815/zero_pp_rank_19_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:55591d7a7ad8cacac5cf43918a7ad42f693db1b850f57a260cf2778aee083cef +size 150540 diff --git a/checkpoint-815/global_step815/zero_pp_rank_1_mp_rank_00_model_states.pt b/checkpoint-815/global_step815/zero_pp_rank_1_mp_rank_00_model_states.pt new file mode 100644 index 0000000..17bb96a --- /dev/null +++ b/checkpoint-815/global_step815/zero_pp_rank_1_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:a5947cccfabfeb8fc303b07ca84c4d4146bb568b41e8dee350a89b8dbb72981c +size 150245 diff --git a/checkpoint-815/global_step815/zero_pp_rank_20_mp_rank_00_model_states.pt b/checkpoint-815/global_step815/zero_pp_rank_20_mp_rank_00_model_states.pt new file mode 100644 index 0000000..1604c21 --- /dev/null +++ b/checkpoint-815/global_step815/zero_pp_rank_20_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e7c17e090edef85f94359ec12ac733fd9394d7a36675b4cf63dda67fe6da8f24 +size 150540 diff --git a/checkpoint-815/global_step815/zero_pp_rank_21_mp_rank_00_model_states.pt b/checkpoint-815/global_step815/zero_pp_rank_21_mp_rank_00_model_states.pt new file mode 100644 index 0000000..98d5fce --- /dev/null +++ b/checkpoint-815/global_step815/zero_pp_rank_21_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:9d35bbd41a45c012aa1db3445f9b72b3dd567ebc41b00dce74bd1e4d82e2ebfd +size 150540 diff --git a/checkpoint-815/global_step815/zero_pp_rank_22_mp_rank_00_model_states.pt b/checkpoint-815/global_step815/zero_pp_rank_22_mp_rank_00_model_states.pt new file mode 100644 index 0000000..91cd1fe --- /dev/null +++ b/checkpoint-815/global_step815/zero_pp_rank_22_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e38f525185b44ebf31ebd0ac8f0d8a32e0fb510d3f674311c087e3508b40c993 +size 150540 diff --git a/checkpoint-815/global_step815/zero_pp_rank_23_mp_rank_00_model_states.pt b/checkpoint-815/global_step815/zero_pp_rank_23_mp_rank_00_model_states.pt new file mode 100644 index 0000000..168e223 --- /dev/null +++ b/checkpoint-815/global_step815/zero_pp_rank_23_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6f7cce2fd60981a15a0f3f33cc90ce2537fcaab35671f44f3c49fcea6fca1891 +size 150540 diff --git a/checkpoint-815/global_step815/zero_pp_rank_24_mp_rank_00_model_states.pt b/checkpoint-815/global_step815/zero_pp_rank_24_mp_rank_00_model_states.pt new file mode 100644 index 0000000..ab22b84 --- /dev/null +++ b/checkpoint-815/global_step815/zero_pp_rank_24_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4f8d1850a9fd50d9ad858ec306dadb3409f83a743868167753d2ceb1ee0b8782 +size 150540 diff --git a/checkpoint-815/global_step815/zero_pp_rank_25_mp_rank_00_model_states.pt b/checkpoint-815/global_step815/zero_pp_rank_25_mp_rank_00_model_states.pt new file mode 100644 index 0000000..3d155ea --- /dev/null +++ b/checkpoint-815/global_step815/zero_pp_rank_25_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:55bc11c638b6fadef2d46875c4a0e4a788f2b78ae95eacdff3a036f1cbfc8b9e +size 150540 diff --git a/checkpoint-815/global_step815/zero_pp_rank_26_mp_rank_00_model_states.pt b/checkpoint-815/global_step815/zero_pp_rank_26_mp_rank_00_model_states.pt new file mode 100644 index 0000000..32b8482 --- /dev/null +++ b/checkpoint-815/global_step815/zero_pp_rank_26_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ff219377c7fb54bb953c6c570cf957b0e25d7bb9d2326d87143bc2db6e131b02 +size 150540 diff --git a/checkpoint-815/global_step815/zero_pp_rank_27_mp_rank_00_model_states.pt b/checkpoint-815/global_step815/zero_pp_rank_27_mp_rank_00_model_states.pt new file mode 100644 index 0000000..ad8f112 --- /dev/null +++ b/checkpoint-815/global_step815/zero_pp_rank_27_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:18ed23baa1f8cd3b5be593df62b46bd925963eae398fb856c46af8bca0bdc706 +size 150540 diff --git a/checkpoint-815/global_step815/zero_pp_rank_28_mp_rank_00_model_states.pt b/checkpoint-815/global_step815/zero_pp_rank_28_mp_rank_00_model_states.pt new file mode 100644 index 0000000..572add1 --- /dev/null +++ b/checkpoint-815/global_step815/zero_pp_rank_28_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7e4fe2622f3c42b1d9b6319829c12a40ba41eed4b5165643ba1e541bbd9d6773 +size 150540 diff --git a/checkpoint-815/global_step815/zero_pp_rank_29_mp_rank_00_model_states.pt b/checkpoint-815/global_step815/zero_pp_rank_29_mp_rank_00_model_states.pt new file mode 100644 index 0000000..8f66a39 --- /dev/null +++ b/checkpoint-815/global_step815/zero_pp_rank_29_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3aaab1637c614043c25c7321822568b135d719fb8ee06fdcd666152646a036f8 +size 150540 diff --git a/checkpoint-815/global_step815/zero_pp_rank_2_mp_rank_00_model_states.pt b/checkpoint-815/global_step815/zero_pp_rank_2_mp_rank_00_model_states.pt new file mode 100644 index 0000000..bce022e --- /dev/null +++ b/checkpoint-815/global_step815/zero_pp_rank_2_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:955cdff9e07f053cbc74b4a713e4d8def17fa2e19b7e9802bad227f51d4b61af +size 150245 diff --git a/checkpoint-815/global_step815/zero_pp_rank_30_mp_rank_00_model_states.pt b/checkpoint-815/global_step815/zero_pp_rank_30_mp_rank_00_model_states.pt new file mode 100644 index 0000000..d78e9d3 --- /dev/null +++ b/checkpoint-815/global_step815/zero_pp_rank_30_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:cc85012ee362480a408246d70a9f1fce990efdf194b19f0a18f7f3aac1eb1ab3 +size 150540 diff --git a/checkpoint-815/global_step815/zero_pp_rank_31_mp_rank_00_model_states.pt b/checkpoint-815/global_step815/zero_pp_rank_31_mp_rank_00_model_states.pt new file mode 100644 index 0000000..025216a --- /dev/null +++ b/checkpoint-815/global_step815/zero_pp_rank_31_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2fbdfe073710344bded771325bbd465f5b8a32a32bdf561a674751b41cf6e111 +size 150540 diff --git a/checkpoint-815/global_step815/zero_pp_rank_3_mp_rank_00_model_states.pt b/checkpoint-815/global_step815/zero_pp_rank_3_mp_rank_00_model_states.pt new file mode 100644 index 0000000..45a8ff1 --- /dev/null +++ b/checkpoint-815/global_step815/zero_pp_rank_3_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:1bbe876d4201139b9ab1ecc5cc62f74e0eb73ef120e1cff4c5f84dca3059dad7 +size 150245 diff --git a/checkpoint-815/global_step815/zero_pp_rank_4_mp_rank_00_model_states.pt b/checkpoint-815/global_step815/zero_pp_rank_4_mp_rank_00_model_states.pt new file mode 100644 index 0000000..51ec98a --- /dev/null +++ b/checkpoint-815/global_step815/zero_pp_rank_4_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:bfae4502edaad044ae8c1a527900b97fd20fea07eaa512af7273532d23b47618 +size 150245 diff --git a/checkpoint-815/global_step815/zero_pp_rank_5_mp_rank_00_model_states.pt b/checkpoint-815/global_step815/zero_pp_rank_5_mp_rank_00_model_states.pt new file mode 100644 index 0000000..32e7ce4 --- /dev/null +++ b/checkpoint-815/global_step815/zero_pp_rank_5_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:73170415f2c2bef296c8730bf78811e31654ac55c87c2d71d77bd88d30b5a270 +size 150245 diff --git a/checkpoint-815/global_step815/zero_pp_rank_6_mp_rank_00_model_states.pt b/checkpoint-815/global_step815/zero_pp_rank_6_mp_rank_00_model_states.pt new file mode 100644 index 0000000..82d10da --- /dev/null +++ b/checkpoint-815/global_step815/zero_pp_rank_6_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:859c2393bcde923cc30a036b27c836d6eac277f575f022b4cbb0b541237091dd +size 150245 diff --git a/checkpoint-815/global_step815/zero_pp_rank_7_mp_rank_00_model_states.pt b/checkpoint-815/global_step815/zero_pp_rank_7_mp_rank_00_model_states.pt new file mode 100644 index 0000000..00c0875 --- /dev/null +++ b/checkpoint-815/global_step815/zero_pp_rank_7_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4494a1f9263497b860dafc470670372cabcf493bd54adb561d84e9c57be3dac7 +size 150245 diff --git a/checkpoint-815/global_step815/zero_pp_rank_8_mp_rank_00_model_states.pt b/checkpoint-815/global_step815/zero_pp_rank_8_mp_rank_00_model_states.pt new file mode 100644 index 0000000..aee6ef3 --- /dev/null +++ b/checkpoint-815/global_step815/zero_pp_rank_8_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:edb26fdb729d3f1fea2b31878462cdc9057312c888b9c8ef8bae28e1002dfdf4 +size 150245 diff --git a/checkpoint-815/global_step815/zero_pp_rank_9_mp_rank_00_model_states.pt b/checkpoint-815/global_step815/zero_pp_rank_9_mp_rank_00_model_states.pt new file mode 100644 index 0000000..077564d --- /dev/null +++ b/checkpoint-815/global_step815/zero_pp_rank_9_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:22843c3e9c8f1d5116a8f88a79ac3c5368fdf132311c803b3b1b2d75ea9cb1b6 +size 150245 diff --git a/checkpoint-815/latest b/checkpoint-815/latest new file mode 100644 index 0000000..c057bc6 --- /dev/null +++ b/checkpoint-815/latest @@ -0,0 +1 @@ +global_step815 \ No newline at end of file diff --git a/checkpoint-815/model-00001-of-00004.safetensors b/checkpoint-815/model-00001-of-00004.safetensors new file mode 100644 index 0000000..006fe76 --- /dev/null +++ b/checkpoint-815/model-00001-of-00004.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:850add823f4e5b1c18dff7e8978a3e89b279cd849e6942a7a3524345bdaffea7 +size 4976698672 diff --git a/checkpoint-815/model-00002-of-00004.safetensors b/checkpoint-815/model-00002-of-00004.safetensors new file mode 100644 index 0000000..aea7951 --- /dev/null +++ b/checkpoint-815/model-00002-of-00004.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:240b16f52194cdd30843a04f60b26d1daa85c54ecfa9e1fe0cee68e668deb748 +size 4999802720 diff --git a/checkpoint-815/model-00003-of-00004.safetensors b/checkpoint-815/model-00003-of-00004.safetensors new file mode 100644 index 0000000..377486c --- /dev/null +++ b/checkpoint-815/model-00003-of-00004.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:054f3088444939ca9c77c2bc8342d4418ca257af0aaeaa3a30bd28b8c0f99b9c +size 4915916176 diff --git a/checkpoint-815/model-00004-of-00004.safetensors b/checkpoint-815/model-00004-of-00004.safetensors new file mode 100644 index 0000000..359788e --- /dev/null +++ b/checkpoint-815/model-00004-of-00004.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:8c55df0c3dd2062496278c785ad52c110e8084360c5e781eef3473b7c3205632 +size 1168138808 diff --git a/checkpoint-815/model.safetensors.index.json b/checkpoint-815/model.safetensors.index.json new file mode 100644 index 0000000..0fd8120 --- /dev/null +++ b/checkpoint-815/model.safetensors.index.json @@ -0,0 +1,298 @@ +{ + "metadata": { + "total_size": 16060522496 + }, + "weight_map": { + "lm_head.weight": "model-00004-of-00004.safetensors", + "model.embed_tokens.weight": "model-00001-of-00004.safetensors", + "model.layers.0.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.0.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.0.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.0.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.0.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.0.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.0.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.0.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.0.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.1.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.1.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.1.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.1.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.1.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.1.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.1.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.1.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.1.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.10.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.10.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.10.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.10.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.10.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.10.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.10.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.10.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.10.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.11.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.11.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.11.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.11.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.11.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.11.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.11.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.11.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.11.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.12.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.12.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.12.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.12.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.12.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.12.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.12.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.12.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.12.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.13.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.13.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.13.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.13.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.13.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.13.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.13.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.13.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.13.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.14.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.14.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.14.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.14.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.14.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.14.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.14.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.14.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.14.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.15.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.15.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.15.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.15.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.15.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.15.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.15.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.15.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.15.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.16.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.16.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.16.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.16.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.16.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.16.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.16.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.16.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.16.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.17.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.17.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.17.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.17.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.17.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.17.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.17.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.17.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.17.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.18.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.18.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.18.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.18.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.18.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.18.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.18.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.18.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.18.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.19.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.19.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.19.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.19.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.19.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.19.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.19.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.19.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.19.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.2.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.2.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.2.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.2.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.2.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.2.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.2.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.2.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.2.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.20.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.20.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.20.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.20.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.20.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.20.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.20.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.20.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.20.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.21.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.21.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.21.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.21.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.21.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.21.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.21.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.21.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.21.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.22.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.22.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.22.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.22.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.22.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.22.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.22.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.22.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.22.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.23.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.23.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.23.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.23.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.23.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.23.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.23.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.23.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.23.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.24.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.24.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.24.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.24.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.24.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.24.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.24.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.24.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.24.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.25.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.25.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.25.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.25.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.25.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.25.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.25.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.25.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.25.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.26.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.26.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.26.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.26.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.26.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.26.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.26.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.26.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.26.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.27.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.27.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.27.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.27.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.27.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.27.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.27.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.27.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.27.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.28.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.28.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.28.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.28.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.28.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.28.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.28.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.28.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.28.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.29.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.29.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.29.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.29.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.29.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.29.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.29.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.29.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.29.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.3.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.3.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.3.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.3.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.3.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.3.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.3.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.3.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.3.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.30.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.30.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.30.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.30.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.30.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.30.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.30.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.30.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.30.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.31.input_layernorm.weight": "model-00004-of-00004.safetensors", + "model.layers.31.mlp.down_proj.weight": "model-00004-of-00004.safetensors", + "model.layers.31.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.31.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.31.post_attention_layernorm.weight": "model-00004-of-00004.safetensors", + "model.layers.31.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.31.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.31.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.31.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.4.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.4.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.4.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.4.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.4.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.4.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.4.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.4.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.4.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.5.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.5.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.5.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.5.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.5.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.5.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.5.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.5.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.5.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.6.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.6.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.6.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.6.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.6.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.6.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.6.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.6.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.6.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.7.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.7.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.7.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.7.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.7.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.7.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.7.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.7.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.7.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.8.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.8.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.8.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.8.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.8.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.8.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.8.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.8.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.8.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.9.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.9.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.9.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.9.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.9.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.9.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.9.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.9.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.9.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.norm.weight": "model-00004-of-00004.safetensors" + } +} diff --git a/checkpoint-815/rng_state_0.pth b/checkpoint-815/rng_state_0.pth new file mode 100644 index 0000000..b647361 --- /dev/null +++ b/checkpoint-815/rng_state_0.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:575119a228f98110923ffa2dedcb50e3317251b26054355d015e0b2240d566f2 +size 15984 diff --git a/checkpoint-815/rng_state_1.pth b/checkpoint-815/rng_state_1.pth new file mode 100644 index 0000000..8506e00 --- /dev/null +++ b/checkpoint-815/rng_state_1.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0728b56dab7abb5ef8a0d4bae3519c5767c97467bdd886d26bf19cc8599d0312 +size 15984 diff --git a/checkpoint-815/rng_state_10.pth b/checkpoint-815/rng_state_10.pth new file mode 100644 index 0000000..4a20fa5 --- /dev/null +++ b/checkpoint-815/rng_state_10.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:532d1ab071177c2e9d0cc3435d6314c1777a0356f9ce1a5d8f10fbe5f8fd8926 +size 15997 diff --git a/checkpoint-815/rng_state_11.pth b/checkpoint-815/rng_state_11.pth new file mode 100644 index 0000000..a0cf51d --- /dev/null +++ b/checkpoint-815/rng_state_11.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:5a089513416d3ed447265187782ec1194ac2303155b941284463976c62bf3d9b +size 15997 diff --git a/checkpoint-815/rng_state_12.pth b/checkpoint-815/rng_state_12.pth new file mode 100644 index 0000000..97aa200 --- /dev/null +++ b/checkpoint-815/rng_state_12.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2a87db6b16c9956496c45bf5c81750dc2349e157e60e544e5d256bb957be1243 +size 15997 diff --git a/checkpoint-815/rng_state_13.pth b/checkpoint-815/rng_state_13.pth new file mode 100644 index 0000000..c9f4510 --- /dev/null +++ b/checkpoint-815/rng_state_13.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:36d5fe5d1b92643a3c3dd35cf2f0cbfa4a92599fe3ccbd8941395c1550f088aa +size 15997 diff --git a/checkpoint-815/rng_state_14.pth b/checkpoint-815/rng_state_14.pth new file mode 100644 index 0000000..3c9daf6 --- /dev/null +++ b/checkpoint-815/rng_state_14.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d4a08278e808af796415aac256bf0c1e8619db1f0f025ff15775cd3b8d02bd59 +size 15997 diff --git a/checkpoint-815/rng_state_15.pth b/checkpoint-815/rng_state_15.pth new file mode 100644 index 0000000..1697bc6 --- /dev/null +++ b/checkpoint-815/rng_state_15.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:88600b3520001a5a7e82c0e184d278b46492fda5424ea22ea243af15b40b2e82 +size 15997 diff --git a/checkpoint-815/rng_state_16.pth b/checkpoint-815/rng_state_16.pth new file mode 100644 index 0000000..480705c --- /dev/null +++ b/checkpoint-815/rng_state_16.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d9a5825e92eb7518856e88ce648529dc0597c32a5f52764f0361a119217a4dfb +size 15997 diff --git a/checkpoint-815/rng_state_17.pth b/checkpoint-815/rng_state_17.pth new file mode 100644 index 0000000..d425906 --- /dev/null +++ b/checkpoint-815/rng_state_17.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b30bd2cfa327fb55a93d390d852db109e0a2e1f102ecabf520870cbc79ca95ad +size 15997 diff --git a/checkpoint-815/rng_state_18.pth b/checkpoint-815/rng_state_18.pth new file mode 100644 index 0000000..a8bc0d6 --- /dev/null +++ b/checkpoint-815/rng_state_18.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:77c95f2456fa4473e7231ab94b79ecbc3c126d31d3a94c61f86ee6125b547456 +size 15997 diff --git a/checkpoint-815/rng_state_19.pth b/checkpoint-815/rng_state_19.pth new file mode 100644 index 0000000..40fe188 --- /dev/null +++ b/checkpoint-815/rng_state_19.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:301f380300f7ae9a581c304ac407794ecff9d66e6c9c55ff6cffcfc8d94690a4 +size 15997 diff --git a/checkpoint-815/rng_state_2.pth b/checkpoint-815/rng_state_2.pth new file mode 100644 index 0000000..ea499e2 --- /dev/null +++ b/checkpoint-815/rng_state_2.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:f4e481d4ef1546694da7337f6bb6c658b866dcb79b85deeb477da0d27ebe851e +size 15984 diff --git a/checkpoint-815/rng_state_20.pth b/checkpoint-815/rng_state_20.pth new file mode 100644 index 0000000..4b90c8b --- /dev/null +++ b/checkpoint-815/rng_state_20.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:8b2e90afb8f9481396fa1f82913f7fb908e83e63bf2a38a6f6d2b869ca1d06db +size 15997 diff --git a/checkpoint-815/rng_state_21.pth b/checkpoint-815/rng_state_21.pth new file mode 100644 index 0000000..fb87d85 --- /dev/null +++ b/checkpoint-815/rng_state_21.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:35fafcbe672a0f62668f219b7ae7b88ddc86330086a2eca82505408964d61498 +size 15997 diff --git a/checkpoint-815/rng_state_22.pth b/checkpoint-815/rng_state_22.pth new file mode 100644 index 0000000..ac9beaf --- /dev/null +++ b/checkpoint-815/rng_state_22.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:9b8f851ca87ff60251262afa155c3ab50fc55615fb72c857120fd7fa3fe3177c +size 15997 diff --git a/checkpoint-815/rng_state_23.pth b/checkpoint-815/rng_state_23.pth new file mode 100644 index 0000000..59e574d --- /dev/null +++ b/checkpoint-815/rng_state_23.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:27d8cd100c48bfcfbf5c8a5164b02d5879f69b5a6276dae705a9c60de9a079c1 +size 15997 diff --git a/checkpoint-815/rng_state_24.pth b/checkpoint-815/rng_state_24.pth new file mode 100644 index 0000000..5064859 --- /dev/null +++ b/checkpoint-815/rng_state_24.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:78d1a58c82846308cc3df216d63b5388e6910766e8fbc6b4e8b28255bfff9f0b +size 15997 diff --git a/checkpoint-815/rng_state_25.pth b/checkpoint-815/rng_state_25.pth new file mode 100644 index 0000000..c0ea34f --- /dev/null +++ b/checkpoint-815/rng_state_25.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:bdee831f657ca735b9fcf1c4034be6dcc25cc224594a3b2c7488ea6ec175be96 +size 15997 diff --git a/checkpoint-815/rng_state_26.pth b/checkpoint-815/rng_state_26.pth new file mode 100644 index 0000000..f7f04e9 --- /dev/null +++ b/checkpoint-815/rng_state_26.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:1e922469f65021a6179e6ecc7c2713db0a41dead9dc08d91e98ed34e65afd14e +size 15997 diff --git a/checkpoint-815/rng_state_27.pth b/checkpoint-815/rng_state_27.pth new file mode 100644 index 0000000..f354e1d --- /dev/null +++ b/checkpoint-815/rng_state_27.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:11867e8beaaaacbefb60c912ca48d2026f0222b2247dd97d78a6ddd227e75bcf +size 15997 diff --git a/checkpoint-815/rng_state_28.pth b/checkpoint-815/rng_state_28.pth new file mode 100644 index 0000000..12c799a --- /dev/null +++ b/checkpoint-815/rng_state_28.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7664653b5278a30fcc7bd77ee73888988040ecbb6a9cb71fd8a5bb5ccd2c9a31 +size 15997 diff --git a/checkpoint-815/rng_state_29.pth b/checkpoint-815/rng_state_29.pth new file mode 100644 index 0000000..6feba08 --- /dev/null +++ b/checkpoint-815/rng_state_29.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:5007396f0c3c95678e1e62a10e31552d6bfe2303e6e78ab6882752474b2efdc7 +size 15997 diff --git a/checkpoint-815/rng_state_3.pth b/checkpoint-815/rng_state_3.pth new file mode 100644 index 0000000..aeb38f9 --- /dev/null +++ b/checkpoint-815/rng_state_3.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:353c60be37ea56fc992fca446598ceca5d1fd002aa3bd6dbb9ad740e6f47ebb3 +size 15984 diff --git a/checkpoint-815/rng_state_30.pth b/checkpoint-815/rng_state_30.pth new file mode 100644 index 0000000..52254ce --- /dev/null +++ b/checkpoint-815/rng_state_30.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:f01c58f06cc2a38c9093fadd85def1f922a5e8910e17a0d885f0df5570b13a98 +size 15997 diff --git a/checkpoint-815/rng_state_31.pth b/checkpoint-815/rng_state_31.pth new file mode 100644 index 0000000..f6010f3 --- /dev/null +++ b/checkpoint-815/rng_state_31.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:35e075e15ab066bd7c9405a66e387f2ebf6b302fbd19ba7905da3f8cc8f71009 +size 15997 diff --git a/checkpoint-815/rng_state_4.pth b/checkpoint-815/rng_state_4.pth new file mode 100644 index 0000000..9d5856c --- /dev/null +++ b/checkpoint-815/rng_state_4.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e9107fe964ba7205e354084b85210e5a5ea1c98cfd4d38adb9cd3926945dcae4 +size 15984 diff --git a/checkpoint-815/rng_state_5.pth b/checkpoint-815/rng_state_5.pth new file mode 100644 index 0000000..b824ee2 --- /dev/null +++ b/checkpoint-815/rng_state_5.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:69d1bb1abee38b92e53f3f23549b642ce0f1edcdccf7b6129847ac61636e96d5 +size 15984 diff --git a/checkpoint-815/rng_state_6.pth b/checkpoint-815/rng_state_6.pth new file mode 100644 index 0000000..a9fd036 --- /dev/null +++ b/checkpoint-815/rng_state_6.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:afd5516048e20f36959601574e29e40106085a7d3cdc7bf425ce5e84633490e6 +size 15984 diff --git a/checkpoint-815/rng_state_7.pth b/checkpoint-815/rng_state_7.pth new file mode 100644 index 0000000..4e80125 --- /dev/null +++ b/checkpoint-815/rng_state_7.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:8e2c46927fc06939b4c976a01e4b95dec1f8b98ceaea86d31a5d756fc30ff006 +size 15984 diff --git a/checkpoint-815/rng_state_8.pth b/checkpoint-815/rng_state_8.pth new file mode 100644 index 0000000..b95c8ee --- /dev/null +++ b/checkpoint-815/rng_state_8.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:87544a1ecb93bba51fc38c978d8a027be1635c93e80f7f0679c1154bc76e16d3 +size 15984 diff --git a/checkpoint-815/rng_state_9.pth b/checkpoint-815/rng_state_9.pth new file mode 100644 index 0000000..8ff6eb6 --- /dev/null +++ b/checkpoint-815/rng_state_9.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3f51e1e81143bcfd2cfd36874b3b7606bb4a14aac945154b167b31a816d9f450 +size 15984 diff --git a/checkpoint-815/scheduler.pt b/checkpoint-815/scheduler.pt new file mode 100644 index 0000000..90bd0de --- /dev/null +++ b/checkpoint-815/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d0f19bec156340ea553c250b893604b263a6f98041038eae9d9856fe427b7812 +size 1064 diff --git a/checkpoint-815/special_tokens_map.json b/checkpoint-815/special_tokens_map.json new file mode 100644 index 0000000..278b7f0 --- /dev/null +++ b/checkpoint-815/special_tokens_map.json @@ -0,0 +1,23 @@ +{ + "bos_token": { + "content": "<|begin_of_text|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false + }, + "eos_token": { + "content": "<|eot_id|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false + }, + "pad_token": { + "content": "<|end_of_text|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false + } +} diff --git a/checkpoint-815/tokenizer.json b/checkpoint-815/tokenizer.json new file mode 100644 index 0000000..1c1d8d5 --- /dev/null +++ b/checkpoint-815/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6b9e4e7fb171f92fd137b777cc2714bf87d11576700a1dcd7a399e7bbe39537b +size 17209920 diff --git a/checkpoint-815/tokenizer_config.json b/checkpoint-815/tokenizer_config.json new file mode 100644 index 0000000..8098161 --- /dev/null +++ b/checkpoint-815/tokenizer_config.json @@ -0,0 +1,2064 @@ +{ + "added_tokens_decoder": { + "128000": { + "content": "<|begin_of_text|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128001": { + "content": "<|end_of_text|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128002": { + "content": "<|reserved_special_token_0|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128003": { + "content": "<|reserved_special_token_1|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128004": { + "content": "<|finetune_right_pad_id|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128005": { + "content": "<|reserved_special_token_2|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128006": { + "content": "<|start_header_id|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128007": { + "content": "<|end_header_id|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128008": { + "content": "<|eom_id|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128009": { + "content": "<|eot_id|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128010": { + "content": "<|python_tag|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128011": { + "content": "<|reserved_special_token_3|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128012": { + "content": "<|reserved_special_token_4|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128013": { + "content": "<|reserved_special_token_5|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128014": { + "content": "<|reserved_special_token_6|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128015": { + "content": "<|reserved_special_token_7|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128016": { + "content": "<|reserved_special_token_8|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128017": { + "content": "<|reserved_special_token_9|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128018": { + "content": "<|reserved_special_token_10|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128019": { + "content": "<|reserved_special_token_11|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128020": { + "content": "<|reserved_special_token_12|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128021": { + "content": "<|reserved_special_token_13|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128022": { + "content": "<|reserved_special_token_14|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128023": { + "content": "<|reserved_special_token_15|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128024": { + "content": "<|reserved_special_token_16|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128025": { + "content": "<|reserved_special_token_17|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128026": { + "content": "<|reserved_special_token_18|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128027": { + "content": "<|reserved_special_token_19|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128028": { + "content": "<|reserved_special_token_20|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128029": { + "content": "<|reserved_special_token_21|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128030": { + "content": "<|reserved_special_token_22|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128031": { + "content": "<|reserved_special_token_23|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128032": { + "content": "<|reserved_special_token_24|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128033": { + "content": "<|reserved_special_token_25|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128034": { + "content": "<|reserved_special_token_26|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128035": { + "content": "<|reserved_special_token_27|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128036": { + "content": "<|reserved_special_token_28|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128037": { + "content": "<|reserved_special_token_29|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128038": { + "content": "<|reserved_special_token_30|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128039": { + "content": "<|reserved_special_token_31|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128040": { + "content": "<|reserved_special_token_32|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128041": { + "content": "<|reserved_special_token_33|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128042": { + "content": "<|reserved_special_token_34|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128043": { + "content": "<|reserved_special_token_35|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128044": { + "content": "<|reserved_special_token_36|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128045": { + "content": "<|reserved_special_token_37|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128046": { + "content": "<|reserved_special_token_38|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128047": { + "content": "<|reserved_special_token_39|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128048": { + "content": "<|reserved_special_token_40|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128049": { + "content": "<|reserved_special_token_41|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128050": { + "content": "<|reserved_special_token_42|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128051": { + "content": "<|reserved_special_token_43|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128052": { + "content": "<|reserved_special_token_44|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128053": { + "content": "<|reserved_special_token_45|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128054": { + "content": "<|reserved_special_token_46|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128055": { + "content": "<|reserved_special_token_47|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128056": { + "content": "<|reserved_special_token_48|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128057": { + "content": "<|reserved_special_token_49|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128058": { + "content": "<|reserved_special_token_50|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128059": { + "content": "<|reserved_special_token_51|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128060": { + "content": "<|reserved_special_token_52|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128061": { + "content": "<|reserved_special_token_53|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128062": { + "content": "<|reserved_special_token_54|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128063": { + "content": "<|reserved_special_token_55|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128064": { + "content": "<|reserved_special_token_56|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128065": { + "content": "<|reserved_special_token_57|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128066": { + "content": "<|reserved_special_token_58|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128067": { + "content": "<|reserved_special_token_59|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128068": { + "content": "<|reserved_special_token_60|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128069": { + "content": "<|reserved_special_token_61|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128070": { + "content": "<|reserved_special_token_62|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128071": { + "content": "<|reserved_special_token_63|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128072": { + "content": "<|reserved_special_token_64|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128073": { + "content": "<|reserved_special_token_65|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128074": { + "content": "<|reserved_special_token_66|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128075": { + "content": "<|reserved_special_token_67|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128076": { + "content": "<|reserved_special_token_68|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128077": { + "content": "<|reserved_special_token_69|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128078": { + "content": "<|reserved_special_token_70|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128079": { + "content": "<|reserved_special_token_71|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128080": { + "content": "<|reserved_special_token_72|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128081": { + "content": "<|reserved_special_token_73|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128082": { + "content": "<|reserved_special_token_74|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128083": { + "content": "<|reserved_special_token_75|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128084": { + "content": "<|reserved_special_token_76|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128085": { + "content": "<|reserved_special_token_77|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128086": { + "content": "<|reserved_special_token_78|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128087": { + "content": "<|reserved_special_token_79|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128088": { + "content": "<|reserved_special_token_80|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128089": { + "content": "<|reserved_special_token_81|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128090": { + "content": "<|reserved_special_token_82|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128091": { + "content": "<|reserved_special_token_83|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128092": { + "content": "<|reserved_special_token_84|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128093": { + "content": "<|reserved_special_token_85|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128094": { + "content": "<|reserved_special_token_86|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128095": { + "content": "<|reserved_special_token_87|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128096": { + "content": "<|reserved_special_token_88|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128097": { + "content": "<|reserved_special_token_89|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128098": { + "content": "<|reserved_special_token_90|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128099": { + "content": "<|reserved_special_token_91|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128100": { + "content": "<|reserved_special_token_92|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128101": { + "content": "<|reserved_special_token_93|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128102": { + "content": "<|reserved_special_token_94|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128103": { + "content": "<|reserved_special_token_95|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128104": { + "content": "<|reserved_special_token_96|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128105": { + "content": "<|reserved_special_token_97|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128106": { + "content": "<|reserved_special_token_98|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128107": { + "content": "<|reserved_special_token_99|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128108": { + "content": "<|reserved_special_token_100|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128109": { + "content": "<|reserved_special_token_101|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128110": { + "content": "<|reserved_special_token_102|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128111": { + "content": "<|reserved_special_token_103|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128112": { + "content": "<|reserved_special_token_104|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128113": { + "content": "<|reserved_special_token_105|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128114": { + "content": "<|reserved_special_token_106|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128115": { + "content": "<|reserved_special_token_107|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128116": { + "content": "<|reserved_special_token_108|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128117": { + "content": "<|reserved_special_token_109|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128118": { + "content": "<|reserved_special_token_110|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128119": { + "content": "<|reserved_special_token_111|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128120": { + "content": "<|reserved_special_token_112|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128121": { + "content": "<|reserved_special_token_113|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128122": { + "content": "<|reserved_special_token_114|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128123": { + "content": "<|reserved_special_token_115|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128124": { + "content": "<|reserved_special_token_116|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128125": { + "content": "<|reserved_special_token_117|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128126": { + "content": "<|reserved_special_token_118|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128127": { + "content": "<|reserved_special_token_119|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128128": { + "content": "<|reserved_special_token_120|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128129": { + "content": "<|reserved_special_token_121|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128130": { + "content": "<|reserved_special_token_122|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128131": { + "content": "<|reserved_special_token_123|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128132": { + "content": "<|reserved_special_token_124|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128133": { + "content": "<|reserved_special_token_125|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128134": { + "content": "<|reserved_special_token_126|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128135": { + "content": "<|reserved_special_token_127|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128136": { + "content": "<|reserved_special_token_128|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128137": { + "content": "<|reserved_special_token_129|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128138": { + "content": "<|reserved_special_token_130|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128139": { + "content": "<|reserved_special_token_131|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128140": { + "content": "<|reserved_special_token_132|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128141": { + "content": "<|reserved_special_token_133|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128142": { + "content": "<|reserved_special_token_134|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128143": { + "content": "<|reserved_special_token_135|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128144": { + "content": "<|reserved_special_token_136|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128145": { + "content": "<|reserved_special_token_137|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128146": { + "content": "<|reserved_special_token_138|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128147": { + "content": "<|reserved_special_token_139|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128148": { + "content": "<|reserved_special_token_140|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128149": { + "content": "<|reserved_special_token_141|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128150": { + "content": "<|reserved_special_token_142|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128151": { + "content": "<|reserved_special_token_143|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128152": { + "content": "<|reserved_special_token_144|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128153": { + "content": "<|reserved_special_token_145|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128154": { + "content": "<|reserved_special_token_146|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128155": { + "content": "<|reserved_special_token_147|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128156": { + "content": "<|reserved_special_token_148|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128157": { + "content": "<|reserved_special_token_149|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128158": { + "content": "<|reserved_special_token_150|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128159": { + "content": "<|reserved_special_token_151|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128160": { + "content": "<|reserved_special_token_152|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128161": { + "content": "<|reserved_special_token_153|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128162": { + "content": "<|reserved_special_token_154|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128163": { + "content": "<|reserved_special_token_155|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128164": { + "content": "<|reserved_special_token_156|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128165": { + "content": "<|reserved_special_token_157|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128166": { + "content": "<|reserved_special_token_158|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128167": { + "content": "<|reserved_special_token_159|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128168": { + "content": "<|reserved_special_token_160|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128169": { + "content": "<|reserved_special_token_161|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128170": { + "content": "<|reserved_special_token_162|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128171": { + "content": "<|reserved_special_token_163|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128172": { + "content": "<|reserved_special_token_164|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128173": { + "content": "<|reserved_special_token_165|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128174": { + "content": "<|reserved_special_token_166|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128175": { + "content": "<|reserved_special_token_167|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128176": { + "content": "<|reserved_special_token_168|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128177": { + "content": "<|reserved_special_token_169|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128178": { + "content": "<|reserved_special_token_170|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128179": { + "content": "<|reserved_special_token_171|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128180": { + "content": "<|reserved_special_token_172|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128181": { + "content": "<|reserved_special_token_173|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128182": { + "content": "<|reserved_special_token_174|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128183": { + "content": "<|reserved_special_token_175|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128184": { + "content": "<|reserved_special_token_176|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128185": { + "content": "<|reserved_special_token_177|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128186": { + "content": "<|reserved_special_token_178|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128187": { + "content": "<|reserved_special_token_179|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128188": { + "content": "<|reserved_special_token_180|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128189": { + "content": "<|reserved_special_token_181|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128190": { + "content": "<|reserved_special_token_182|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128191": { + "content": "<|reserved_special_token_183|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128192": { + "content": "<|reserved_special_token_184|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128193": { + "content": "<|reserved_special_token_185|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128194": { + "content": "<|reserved_special_token_186|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128195": { + "content": "<|reserved_special_token_187|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128196": { + "content": "<|reserved_special_token_188|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128197": { + "content": "<|reserved_special_token_189|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128198": { + "content": "<|reserved_special_token_190|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128199": { + "content": "<|reserved_special_token_191|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128200": { + "content": "<|reserved_special_token_192|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128201": { + "content": "<|reserved_special_token_193|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128202": { + "content": "<|reserved_special_token_194|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128203": { + "content": "<|reserved_special_token_195|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128204": { + "content": "<|reserved_special_token_196|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128205": { + "content": "<|reserved_special_token_197|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128206": { + "content": "<|reserved_special_token_198|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128207": { + "content": "<|reserved_special_token_199|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128208": { + "content": "<|reserved_special_token_200|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128209": { + "content": "<|reserved_special_token_201|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128210": { + "content": "<|reserved_special_token_202|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128211": { + "content": "<|reserved_special_token_203|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128212": { + "content": "<|reserved_special_token_204|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128213": { + "content": "<|reserved_special_token_205|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128214": { + "content": "<|reserved_special_token_206|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128215": { + "content": "<|reserved_special_token_207|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128216": { + "content": "<|reserved_special_token_208|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128217": { + "content": "<|reserved_special_token_209|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128218": { + "content": "<|reserved_special_token_210|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128219": { + "content": "<|reserved_special_token_211|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128220": { + "content": "<|reserved_special_token_212|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128221": { + "content": "<|reserved_special_token_213|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128222": { + "content": "<|reserved_special_token_214|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128223": { + "content": "<|reserved_special_token_215|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128224": { + "content": "<|reserved_special_token_216|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128225": { + "content": "<|reserved_special_token_217|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128226": { + "content": "<|reserved_special_token_218|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128227": { + "content": "<|reserved_special_token_219|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128228": { + "content": "<|reserved_special_token_220|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128229": { + "content": "<|reserved_special_token_221|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128230": { + "content": "<|reserved_special_token_222|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128231": { + "content": "<|reserved_special_token_223|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128232": { + "content": "<|reserved_special_token_224|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128233": { + "content": "<|reserved_special_token_225|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128234": { + "content": "<|reserved_special_token_226|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128235": { + "content": "<|reserved_special_token_227|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128236": { + "content": "<|reserved_special_token_228|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128237": { + "content": "<|reserved_special_token_229|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128238": { + "content": "<|reserved_special_token_230|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128239": { + "content": "<|reserved_special_token_231|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128240": { + "content": "<|reserved_special_token_232|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128241": { + "content": "<|reserved_special_token_233|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128242": { + "content": "<|reserved_special_token_234|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128243": { + "content": "<|reserved_special_token_235|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128244": { + "content": "<|reserved_special_token_236|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128245": { + "content": "<|reserved_special_token_237|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128246": { + "content": "<|reserved_special_token_238|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128247": { + "content": "<|reserved_special_token_239|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128248": { + "content": "<|reserved_special_token_240|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128249": { + "content": "<|reserved_special_token_241|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128250": { + "content": "<|reserved_special_token_242|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128251": { + "content": "<|reserved_special_token_243|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128252": { + "content": "<|reserved_special_token_244|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128253": { + "content": "<|reserved_special_token_245|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128254": { + "content": "<|reserved_special_token_246|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128255": { + "content": "<|reserved_special_token_247|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + } + }, + "bos_token": "<|begin_of_text|>", + "chat_template": "{% if not add_generation_prompt is defined %}{% set add_generation_prompt = false %}{% endif %}{% set loop_messages = messages %}{% for message in loop_messages %}{% set content = '<|start_header_id|>' + message['role'] + '<|end_header_id|>\n\n'+ message['content'] | trim + '<|eot_id|>' %}{% if loop.index0 == 0 %}{% set content = bos_token + content %}{% endif %}{{ content }}{% endfor %}{% if add_generation_prompt %}{{ '<|start_header_id|>assistant<|end_header_id|>\n\n' }}{% endif %}", + "clean_up_tokenization_spaces": true, + "eos_token": "<|eot_id|>", + "extra_special_tokens": {}, + "model_input_names": [ + "input_ids", + "attention_mask" + ], + "model_max_length": 131072, + "pad_token": "<|end_of_text|>", + "tokenizer_class": "PreTrainedTokenizer" +} diff --git a/checkpoint-815/trainer_state.json b/checkpoint-815/trainer_state.json new file mode 100644 index 0000000..65b0935 --- /dev/null +++ b/checkpoint-815/trainer_state.json @@ -0,0 +1,12259 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.0, + "eval_steps": 500, + "global_step": 815, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.001226993865030675, + "grad_norm": 151.44113305401245, + "learning_rate": 2e-08, + "logits/chosen": -0.32421875, + "logits/rejected": -0.515625, + "logps/chosen": -474.0, + "logps/rejected": -316.0, + "loss": 0.6914, + "rewards/accuracies": 0.0, + "rewards/chosen": 0.0, + "rewards/margins": 0.0, + "rewards/rejected": 0.0, + "step": 1 + }, + { + "epoch": 0.00245398773006135, + "grad_norm": 162.5072043033413, + "learning_rate": 4e-08, + "logits/chosen": -0.22265625, + "logits/rejected": -0.439453125, + "logps/chosen": -436.0, + "logps/rejected": -292.0, + "loss": 0.6914, + "rewards/accuracies": 0.0, + "rewards/chosen": 0.0, + "rewards/margins": 0.0, + "rewards/rejected": 0.0, + "step": 2 + }, + { + "epoch": 0.0036809815950920245, + "grad_norm": 108.37171307643952, + "learning_rate": 6e-08, + "logits/chosen": -0.12890625, + "logits/rejected": -0.255859375, + "logps/chosen": -368.0, + "logps/rejected": -272.0, + "loss": 0.6896, + "rewards/accuracies": 0.328125, + "rewards/chosen": 0.005706787109375, + "rewards/margins": 0.01055908203125, + "rewards/rejected": -0.004852294921875, + "step": 3 + }, + { + "epoch": 0.0049079754601227, + "grad_norm": 152.5657567319493, + "learning_rate": 8e-08, + "logits/chosen": -0.166015625, + "logits/rejected": -0.326171875, + "logps/chosen": -422.0, + "logps/rejected": -242.0, + "loss": 0.7141, + "rewards/accuracies": 0.3359375, + "rewards/chosen": -0.009765625, + "rewards/margins": -0.025634765625, + "rewards/rejected": 0.0159912109375, + "step": 4 + }, + { + "epoch": 0.006134969325153374, + "grad_norm": 288.1306811063231, + "learning_rate": 1e-07, + "logits/chosen": -0.1845703125, + "logits/rejected": -0.326171875, + "logps/chosen": -380.0, + "logps/rejected": -270.0, + "loss": 0.6984, + "rewards/accuracies": 0.421875, + "rewards/chosen": 0.0216064453125, + "rewards/margins": -0.0030670166015625, + "rewards/rejected": 0.0247802734375, + "step": 5 + }, + { + "epoch": 0.007361963190184049, + "grad_norm": 331.41871326801424, + "learning_rate": 1.2e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.345703125, + "logps/chosen": -412.0, + "logps/rejected": -306.0, + "loss": 0.7177, + "rewards/accuracies": 0.2578125, + "rewards/chosen": -0.01434326171875, + "rewards/margins": -0.03466796875, + "rewards/rejected": 0.0203857421875, + "step": 6 + }, + { + "epoch": 0.008588957055214725, + "grad_norm": 249.74586517146642, + "learning_rate": 1.4e-07, + "logits/chosen": -0.2060546875, + "logits/rejected": -0.38671875, + "logps/chosen": -378.0, + "logps/rejected": -266.0, + "loss": 0.7072, + "rewards/accuracies": 0.3359375, + "rewards/chosen": -0.000904083251953125, + "rewards/margins": -0.0172119140625, + "rewards/rejected": 0.016357421875, + "step": 7 + }, + { + "epoch": 0.0098159509202454, + "grad_norm": 128.1050509063449, + "learning_rate": 1.6e-07, + "logits/chosen": -0.115234375, + "logits/rejected": -0.32421875, + "logps/chosen": -432.0, + "logps/rejected": -292.0, + "loss": 0.7045, + "rewards/accuracies": 0.2421875, + "rewards/chosen": 0.01513671875, + "rewards/margins": -0.01055908203125, + "rewards/rejected": 0.0257568359375, + "step": 8 + }, + { + "epoch": 0.011042944785276074, + "grad_norm": 128.31082936106668, + "learning_rate": 1.8e-07, + "logits/chosen": -0.1357421875, + "logits/rejected": -0.361328125, + "logps/chosen": -402.0, + "logps/rejected": -294.0, + "loss": 0.7057, + "rewards/accuracies": 0.2890625, + "rewards/chosen": 0.0185546875, + "rewards/margins": -0.0194091796875, + "rewards/rejected": 0.0380859375, + "step": 9 + }, + { + "epoch": 0.012269938650306749, + "grad_norm": 148.13248133021244, + "learning_rate": 2e-07, + "logits/chosen": -0.201171875, + "logits/rejected": -0.35546875, + "logps/chosen": -402.0, + "logps/rejected": -278.0, + "loss": 0.6879, + "rewards/accuracies": 0.359375, + "rewards/chosen": 0.03466796875, + "rewards/margins": 0.011962890625, + "rewards/rejected": 0.022705078125, + "step": 10 + }, + { + "epoch": 0.013496932515337423, + "grad_norm": 188.4465050278061, + "learning_rate": 2.1999999999999998e-07, + "logits/chosen": -0.38671875, + "logits/rejected": -0.52734375, + "logps/chosen": -422.0, + "logps/rejected": -296.0, + "loss": 0.6847, + "rewards/accuracies": 0.421875, + "rewards/chosen": 0.04296875, + "rewards/margins": 0.025634765625, + "rewards/rejected": 0.017333984375, + "step": 11 + }, + { + "epoch": 0.014723926380368098, + "grad_norm": 283.48200245967496, + "learning_rate": 2.4e-07, + "logits/chosen": -0.1455078125, + "logits/rejected": -0.251953125, + "logps/chosen": -374.0, + "logps/rejected": -262.0, + "loss": 0.6763, + "rewards/accuracies": 0.4140625, + "rewards/chosen": 0.036376953125, + "rewards/margins": 0.042724609375, + "rewards/rejected": -0.00634765625, + "step": 12 + }, + { + "epoch": 0.015950920245398775, + "grad_norm": 157.86633246900865, + "learning_rate": 2.6e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.423828125, + "logps/chosen": -392.0, + "logps/rejected": -249.0, + "loss": 0.6399, + "rewards/accuracies": 0.59375, + "rewards/chosen": 0.068359375, + "rewards/margins": 0.1240234375, + "rewards/rejected": -0.055419921875, + "step": 13 + }, + { + "epoch": 0.01717791411042945, + "grad_norm": 170.28826054471034, + "learning_rate": 2.8e-07, + "logits/chosen": -0.2412109375, + "logits/rejected": -0.419921875, + "logps/chosen": -472.0, + "logps/rejected": -310.0, + "loss": 0.645, + "rewards/accuracies": 0.5390625, + "rewards/chosen": 0.1201171875, + "rewards/margins": 0.12109375, + "rewards/rejected": -0.000881195068359375, + "step": 14 + }, + { + "epoch": 0.018404907975460124, + "grad_norm": 196.84243180155542, + "learning_rate": 3e-07, + "logits/chosen": -0.12451171875, + "logits/rejected": -0.1923828125, + "logps/chosen": -420.0, + "logps/rejected": -288.0, + "loss": 0.6433, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.0849609375, + "rewards/margins": 0.1298828125, + "rewards/rejected": -0.044677734375, + "step": 15 + }, + { + "epoch": 0.0196319018404908, + "grad_norm": 150.44401802967914, + "learning_rate": 3.2e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.439453125, + "logps/chosen": -408.0, + "logps/rejected": -304.0, + "loss": 0.6163, + "rewards/accuracies": 0.609375, + "rewards/chosen": 0.1513671875, + "rewards/margins": 0.189453125, + "rewards/rejected": -0.03759765625, + "step": 16 + }, + { + "epoch": 0.020858895705521473, + "grad_norm": 158.3424645259106, + "learning_rate": 3.4000000000000003e-07, + "logits/chosen": -0.181640625, + "logits/rejected": -0.330078125, + "logps/chosen": -434.0, + "logps/rejected": -254.0, + "loss": 0.5994, + "rewards/accuracies": 0.6171875, + "rewards/chosen": 0.173828125, + "rewards/margins": 0.25390625, + "rewards/rejected": -0.08056640625, + "step": 17 + }, + { + "epoch": 0.022085889570552148, + "grad_norm": 127.76158860883122, + "learning_rate": 3.6e-07, + "logits/chosen": -0.16015625, + "logits/rejected": -0.337890625, + "logps/chosen": -404.0, + "logps/rejected": -276.0, + "loss": 0.5706, + "rewards/accuracies": 0.6953125, + "rewards/chosen": 0.2294921875, + "rewards/margins": 0.3359375, + "rewards/rejected": -0.10595703125, + "step": 18 + }, + { + "epoch": 0.023312883435582823, + "grad_norm": 69.38468528362102, + "learning_rate": 3.7999999999999996e-07, + "logits/chosen": -0.20703125, + "logits/rejected": -0.37890625, + "logps/chosen": -388.0, + "logps/rejected": -288.0, + "loss": 0.567, + "rewards/accuracies": 0.6484375, + "rewards/chosen": 0.2197265625, + "rewards/margins": 0.37890625, + "rewards/rejected": -0.158203125, + "step": 19 + }, + { + "epoch": 0.024539877300613498, + "grad_norm": 82.21345162463909, + "learning_rate": 4e-07, + "logits/chosen": -0.291015625, + "logits/rejected": -0.455078125, + "logps/chosen": -466.0, + "logps/rejected": -310.0, + "loss": 0.5153, + "rewards/accuracies": 0.7421875, + "rewards/chosen": 0.37890625, + "rewards/margins": 0.58984375, + "rewards/rejected": -0.2109375, + "step": 20 + }, + { + "epoch": 0.025766871165644172, + "grad_norm": 105.40201871897163, + "learning_rate": 4.1999999999999995e-07, + "logits/chosen": -0.166015625, + "logits/rejected": -0.337890625, + "logps/chosen": -412.0, + "logps/rejected": -260.0, + "loss": 0.5326, + "rewards/accuracies": 0.703125, + "rewards/chosen": 0.296875, + "rewards/margins": 0.490234375, + "rewards/rejected": -0.1923828125, + "step": 21 + }, + { + "epoch": 0.026993865030674847, + "grad_norm": 70.78030423389544, + "learning_rate": 4.3999999999999997e-07, + "logits/chosen": -0.162109375, + "logits/rejected": -0.29296875, + "logps/chosen": -382.0, + "logps/rejected": -292.0, + "loss": 0.5334, + "rewards/accuracies": 0.75, + "rewards/chosen": 0.291015625, + "rewards/margins": 0.5390625, + "rewards/rejected": -0.2470703125, + "step": 22 + }, + { + "epoch": 0.02822085889570552, + "grad_norm": 60.46408711421665, + "learning_rate": 4.6e-07, + "logits/chosen": -0.283203125, + "logits/rejected": -0.333984375, + "logps/chosen": -380.0, + "logps/rejected": -302.0, + "loss": 0.513, + "rewards/accuracies": 0.6953125, + "rewards/chosen": 0.498046875, + "rewards/margins": 0.75390625, + "rewards/rejected": -0.2578125, + "step": 23 + }, + { + "epoch": 0.029447852760736196, + "grad_norm": 54.54733596050591, + "learning_rate": 4.8e-07, + "logits/chosen": -0.21484375, + "logits/rejected": -0.396484375, + "logps/chosen": -378.0, + "logps/rejected": -274.0, + "loss": 0.5458, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.36328125, + "rewards/margins": 0.6015625, + "rewards/rejected": -0.2392578125, + "step": 24 + }, + { + "epoch": 0.03067484662576687, + "grad_norm": 46.35027564725166, + "learning_rate": 5e-07, + "logits/chosen": -0.29296875, + "logits/rejected": -0.478515625, + "logps/chosen": -436.0, + "logps/rejected": -296.0, + "loss": 0.468, + "rewards/accuracies": 0.75, + "rewards/chosen": 0.65234375, + "rewards/margins": 1.0859375, + "rewards/rejected": -0.43359375, + "step": 25 + }, + { + "epoch": 0.03190184049079755, + "grad_norm": 49.250838916767385, + "learning_rate": 4.99793388429752e-07, + "logits/chosen": -0.193359375, + "logits/rejected": -0.349609375, + "logps/chosen": -390.0, + "logps/rejected": -272.0, + "loss": 0.4753, + "rewards/accuracies": 0.7265625, + "rewards/chosen": 0.75, + "rewards/margins": 1.15625, + "rewards/rejected": -0.404296875, + "step": 26 + }, + { + "epoch": 0.033128834355828224, + "grad_norm": 49.243509562031704, + "learning_rate": 4.995867768595041e-07, + "logits/chosen": -0.142578125, + "logits/rejected": -0.314453125, + "logps/chosen": -362.0, + "logps/rejected": -274.0, + "loss": 0.4481, + "rewards/accuracies": 0.734375, + "rewards/chosen": 0.84765625, + "rewards/margins": 1.3125, + "rewards/rejected": -0.46484375, + "step": 27 + }, + { + "epoch": 0.0343558282208589, + "grad_norm": 43.853948458317184, + "learning_rate": 4.993801652892562e-07, + "logits/chosen": -0.08203125, + "logits/rejected": -0.1884765625, + "logps/chosen": -382.0, + "logps/rejected": -258.0, + "loss": 0.4667, + "rewards/accuracies": 0.78125, + "rewards/chosen": 0.79296875, + "rewards/margins": 1.125, + "rewards/rejected": -0.33203125, + "step": 28 + }, + { + "epoch": 0.03558282208588957, + "grad_norm": 46.27857873377814, + "learning_rate": 4.991735537190083e-07, + "logits/chosen": -0.318359375, + "logits/rejected": -0.46484375, + "logps/chosen": -422.0, + "logps/rejected": -316.0, + "loss": 0.442, + "rewards/accuracies": 0.7578125, + "rewards/chosen": 0.94921875, + "rewards/margins": 1.46875, + "rewards/rejected": -0.5234375, + "step": 29 + }, + { + "epoch": 0.03680981595092025, + "grad_norm": 54.43172367072751, + "learning_rate": 4.989669421487603e-07, + "logits/chosen": -0.18359375, + "logits/rejected": -0.302734375, + "logps/chosen": -338.0, + "logps/rejected": -260.0, + "loss": 0.4973, + "rewards/accuracies": 0.7578125, + "rewards/chosen": 0.671875, + "rewards/margins": 1.1015625, + "rewards/rejected": -0.4296875, + "step": 30 + }, + { + "epoch": 0.03803680981595092, + "grad_norm": 49.563120237934434, + "learning_rate": 4.987603305785124e-07, + "logits/chosen": -0.171875, + "logits/rejected": -0.294921875, + "logps/chosen": -388.0, + "logps/rejected": -270.0, + "loss": 0.4585, + "rewards/accuracies": 0.75, + "rewards/chosen": 0.97265625, + "rewards/margins": 1.5390625, + "rewards/rejected": -0.5703125, + "step": 31 + }, + { + "epoch": 0.0392638036809816, + "grad_norm": 47.082618739282914, + "learning_rate": 4.985537190082644e-07, + "logits/chosen": -0.220703125, + "logits/rejected": -0.41015625, + "logps/chosen": -394.0, + "logps/rejected": -282.0, + "loss": 0.4295, + "rewards/accuracies": 0.7734375, + "rewards/chosen": 0.9609375, + "rewards/margins": 1.578125, + "rewards/rejected": -0.61328125, + "step": 32 + }, + { + "epoch": 0.04049079754601227, + "grad_norm": 43.28996668354881, + "learning_rate": 4.983471074380165e-07, + "logits/chosen": -0.10595703125, + "logits/rejected": -0.244140625, + "logps/chosen": -332.0, + "logps/rejected": -229.0, + "loss": 0.4502, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.73828125, + "rewards/margins": 1.3203125, + "rewards/rejected": -0.58203125, + "step": 33 + }, + { + "epoch": 0.04171779141104295, + "grad_norm": 53.08103037992315, + "learning_rate": 4.981404958677686e-07, + "logits/chosen": -0.26171875, + "logits/rejected": -0.396484375, + "logps/chosen": -390.0, + "logps/rejected": -296.0, + "loss": 0.4275, + "rewards/accuracies": 0.7578125, + "rewards/chosen": 0.9296875, + "rewards/margins": 1.78125, + "rewards/rejected": -0.84765625, + "step": 34 + }, + { + "epoch": 0.04294478527607362, + "grad_norm": 51.02011562118897, + "learning_rate": 4.979338842975207e-07, + "logits/chosen": -0.169921875, + "logits/rejected": -0.3203125, + "logps/chosen": -360.0, + "logps/rejected": -258.0, + "loss": 0.4005, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.75, + "rewards/margins": 1.78125, + "rewards/rejected": -1.0234375, + "step": 35 + }, + { + "epoch": 0.044171779141104296, + "grad_norm": 39.1724548423627, + "learning_rate": 4.977272727272727e-07, + "logits/chosen": -0.224609375, + "logits/rejected": -0.314453125, + "logps/chosen": -404.0, + "logps/rejected": -288.0, + "loss": 0.3849, + "rewards/accuracies": 0.78125, + "rewards/chosen": 1.125, + "rewards/margins": 2.1875, + "rewards/rejected": -1.0546875, + "step": 36 + }, + { + "epoch": 0.04539877300613497, + "grad_norm": 41.851898602487374, + "learning_rate": 4.975206611570248e-07, + "logits/chosen": -0.19140625, + "logits/rejected": -0.30859375, + "logps/chosen": -394.0, + "logps/rejected": -308.0, + "loss": 0.4066, + "rewards/accuracies": 0.7421875, + "rewards/chosen": 1.3203125, + "rewards/margins": 2.296875, + "rewards/rejected": -0.9765625, + "step": 37 + }, + { + "epoch": 0.046625766871165646, + "grad_norm": 38.15131350129523, + "learning_rate": 4.973140495867769e-07, + "logits/chosen": -0.134765625, + "logits/rejected": -0.27734375, + "logps/chosen": -402.0, + "logps/rejected": -298.0, + "loss": 0.3886, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.53125, + "rewards/margins": 2.578125, + "rewards/rejected": -1.046875, + "step": 38 + }, + { + "epoch": 0.04785276073619632, + "grad_norm": 41.71923927967426, + "learning_rate": 4.971074380165288e-07, + "logits/chosen": -0.25390625, + "logits/rejected": -0.4375, + "logps/chosen": -428.0, + "logps/rejected": -302.0, + "loss": 0.3805, + "rewards/accuracies": 0.796875, + "rewards/chosen": 1.328125, + "rewards/margins": 2.640625, + "rewards/rejected": -1.3125, + "step": 39 + }, + { + "epoch": 0.049079754601226995, + "grad_norm": 38.402003702110484, + "learning_rate": 4.96900826446281e-07, + "logits/chosen": -0.1865234375, + "logits/rejected": -0.328125, + "logps/chosen": -376.0, + "logps/rejected": -282.0, + "loss": 0.3421, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.3125, + "rewards/margins": 2.734375, + "rewards/rejected": -1.421875, + "step": 40 + }, + { + "epoch": 0.05030674846625767, + "grad_norm": 34.67962672406851, + "learning_rate": 4.96694214876033e-07, + "logits/chosen": -0.185546875, + "logits/rejected": -0.390625, + "logps/chosen": -380.0, + "logps/rejected": -272.0, + "loss": 0.3787, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.3125, + "rewards/margins": 2.65625, + "rewards/rejected": -1.3515625, + "step": 41 + }, + { + "epoch": 0.051533742331288344, + "grad_norm": 46.35208610876743, + "learning_rate": 4.964876033057851e-07, + "logits/chosen": -0.1455078125, + "logits/rejected": -0.328125, + "logps/chosen": -366.0, + "logps/rejected": -284.0, + "loss": 0.3611, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.2109375, + "rewards/margins": 2.71875, + "rewards/rejected": -1.515625, + "step": 42 + }, + { + "epoch": 0.05276073619631902, + "grad_norm": 48.36417348819516, + "learning_rate": 4.962809917355371e-07, + "logits/chosen": -0.2080078125, + "logits/rejected": -0.404296875, + "logps/chosen": -420.0, + "logps/rejected": -322.0, + "loss": 0.3483, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.3828125, + "rewards/margins": 3.109375, + "rewards/rejected": -1.7265625, + "step": 43 + }, + { + "epoch": 0.053987730061349694, + "grad_norm": 58.150094006043, + "learning_rate": 4.960743801652892e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.4140625, + "logps/chosen": -390.0, + "logps/rejected": -294.0, + "loss": 0.4261, + "rewards/accuracies": 0.78125, + "rewards/chosen": 0.94140625, + "rewards/margins": 2.75, + "rewards/rejected": -1.8046875, + "step": 44 + }, + { + "epoch": 0.05521472392638037, + "grad_norm": 41.77249990347939, + "learning_rate": 4.958677685950413e-07, + "logits/chosen": -0.34765625, + "logits/rejected": -0.455078125, + "logps/chosen": -358.0, + "logps/rejected": -286.0, + "loss": 0.3831, + "rewards/accuracies": 0.78125, + "rewards/chosen": 1.015625, + "rewards/margins": 2.890625, + "rewards/rejected": -1.8671875, + "step": 45 + }, + { + "epoch": 0.05644171779141104, + "grad_norm": 42.522353640053986, + "learning_rate": 4.956611570247934e-07, + "logits/chosen": -0.21875, + "logits/rejected": -0.412109375, + "logps/chosen": -426.0, + "logps/rejected": -292.0, + "loss": 0.3376, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.5546875, + "rewards/margins": 3.5, + "rewards/rejected": -1.953125, + "step": 46 + }, + { + "epoch": 0.05766871165644172, + "grad_norm": 59.82362665796057, + "learning_rate": 4.954545454545454e-07, + "logits/chosen": -0.26953125, + "logits/rejected": -0.373046875, + "logps/chosen": -394.0, + "logps/rejected": -362.0, + "loss": 0.4408, + "rewards/accuracies": 0.734375, + "rewards/chosen": 1.0390625, + "rewards/margins": 2.6875, + "rewards/rejected": -1.6484375, + "step": 47 + }, + { + "epoch": 0.05889570552147239, + "grad_norm": 36.37462895121556, + "learning_rate": 4.952479338842975e-07, + "logits/chosen": -0.25, + "logits/rejected": -0.40234375, + "logps/chosen": -352.0, + "logps/rejected": -276.0, + "loss": 0.3918, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.0, + "rewards/margins": 2.4375, + "rewards/rejected": -1.4296875, + "step": 48 + }, + { + "epoch": 0.06012269938650307, + "grad_norm": 33.380998200862365, + "learning_rate": 4.950413223140495e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.515625, + "logps/chosen": -406.0, + "logps/rejected": -288.0, + "loss": 0.2888, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.5703125, + "rewards/margins": 3.65625, + "rewards/rejected": -2.078125, + "step": 49 + }, + { + "epoch": 0.06134969325153374, + "grad_norm": 49.61344030643431, + "learning_rate": 4.948347107438016e-07, + "logits/chosen": -0.25390625, + "logits/rejected": -0.447265625, + "logps/chosen": -406.0, + "logps/rejected": -310.0, + "loss": 0.4032, + "rewards/accuracies": 0.7734375, + "rewards/chosen": 1.28125, + "rewards/margins": 2.890625, + "rewards/rejected": -1.609375, + "step": 50 + }, + { + "epoch": 0.06257668711656442, + "grad_norm": 44.94363880784817, + "learning_rate": 4.946280991735537e-07, + "logits/chosen": -0.201171875, + "logits/rejected": -0.373046875, + "logps/chosen": -444.0, + "logps/rejected": -352.0, + "loss": 0.3064, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.640625, + "rewards/margins": 3.578125, + "rewards/rejected": -1.9375, + "step": 51 + }, + { + "epoch": 0.0638036809815951, + "grad_norm": 41.35776161230766, + "learning_rate": 4.944214876033058e-07, + "logits/chosen": -0.2333984375, + "logits/rejected": -0.435546875, + "logps/chosen": -402.0, + "logps/rejected": -328.0, + "loss": 0.369, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.1953125, + "rewards/margins": 3.34375, + "rewards/rejected": -2.15625, + "step": 52 + }, + { + "epoch": 0.06503067484662577, + "grad_norm": 44.728082439821826, + "learning_rate": 4.942148760330578e-07, + "logits/chosen": -0.173828125, + "logits/rejected": -0.34375, + "logps/chosen": -404.0, + "logps/rejected": -316.0, + "loss": 0.3683, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.3515625, + "rewards/margins": 3.109375, + "rewards/rejected": -1.7578125, + "step": 53 + }, + { + "epoch": 0.06625766871165645, + "grad_norm": 39.009654963149515, + "learning_rate": 4.940082644628099e-07, + "logits/chosen": -0.072265625, + "logits/rejected": -0.255859375, + "logps/chosen": -338.0, + "logps/rejected": -251.0, + "loss": 0.3097, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.9765625, + "rewards/margins": 2.796875, + "rewards/rejected": -1.8203125, + "step": 54 + }, + { + "epoch": 0.06748466257668712, + "grad_norm": 40.85012819896818, + "learning_rate": 4.93801652892562e-07, + "logits/chosen": -0.2021484375, + "logits/rejected": -0.376953125, + "logps/chosen": -382.0, + "logps/rejected": -288.0, + "loss": 0.3452, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.1875, + "rewards/margins": 3.140625, + "rewards/rejected": -1.9609375, + "step": 55 + }, + { + "epoch": 0.0687116564417178, + "grad_norm": 46.70951578377314, + "learning_rate": 4.935950413223141e-07, + "logits/chosen": -0.169921875, + "logits/rejected": -0.361328125, + "logps/chosen": -392.0, + "logps/rejected": -324.0, + "loss": 0.3916, + "rewards/accuracies": 0.7578125, + "rewards/chosen": 1.3671875, + "rewards/margins": 3.234375, + "rewards/rejected": -1.875, + "step": 56 + }, + { + "epoch": 0.06993865030674846, + "grad_norm": 51.30803055192484, + "learning_rate": 4.933884297520661e-07, + "logits/chosen": -0.1650390625, + "logits/rejected": -0.255859375, + "logps/chosen": -356.0, + "logps/rejected": -316.0, + "loss": 0.3947, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.1875, + "rewards/margins": 3.203125, + "rewards/rejected": -2.015625, + "step": 57 + }, + { + "epoch": 0.07116564417177915, + "grad_norm": 47.592024830773475, + "learning_rate": 4.931818181818182e-07, + "logits/chosen": -0.177734375, + "logits/rejected": -0.2734375, + "logps/chosen": -378.0, + "logps/rejected": -320.0, + "loss": 0.3758, + "rewards/accuracies": 0.78125, + "rewards/chosen": 1.4140625, + "rewards/margins": 3.328125, + "rewards/rejected": -1.9140625, + "step": 58 + }, + { + "epoch": 0.07239263803680981, + "grad_norm": 48.17219624892423, + "learning_rate": 4.929752066115702e-07, + "logits/chosen": -0.0947265625, + "logits/rejected": -0.1923828125, + "logps/chosen": -380.0, + "logps/rejected": -288.0, + "loss": 0.4219, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.0546875, + "rewards/margins": 2.59375, + "rewards/rejected": -1.5390625, + "step": 59 + }, + { + "epoch": 0.0736196319018405, + "grad_norm": 39.36985463274499, + "learning_rate": 4.927685950413223e-07, + "logits/chosen": -0.171875, + "logits/rejected": -0.314453125, + "logps/chosen": -386.0, + "logps/rejected": -280.0, + "loss": 0.3667, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.9765625, + "rewards/margins": 2.796875, + "rewards/rejected": -1.8125, + "step": 60 + }, + { + "epoch": 0.07484662576687116, + "grad_norm": 38.11628572877564, + "learning_rate": 4.925619834710743e-07, + "logits/chosen": -0.169921875, + "logits/rejected": -0.318359375, + "logps/chosen": -420.0, + "logps/rejected": -310.0, + "loss": 0.3265, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.59375, + "rewards/margins": 3.65625, + "rewards/rejected": -2.0625, + "step": 61 + }, + { + "epoch": 0.07607361963190185, + "grad_norm": 40.58395817948392, + "learning_rate": 4.923553719008265e-07, + "logits/chosen": -0.15234375, + "logits/rejected": -0.373046875, + "logps/chosen": -432.0, + "logps/rejected": -302.0, + "loss": 0.3375, + "rewards/accuracies": 0.78125, + "rewards/chosen": 1.8203125, + "rewards/margins": 4.09375, + "rewards/rejected": -2.265625, + "step": 62 + }, + { + "epoch": 0.07730061349693251, + "grad_norm": 43.13092829482704, + "learning_rate": 4.921487603305785e-07, + "logits/chosen": -0.06787109375, + "logits/rejected": -0.244140625, + "logps/chosen": -422.0, + "logps/rejected": -300.0, + "loss": 0.3277, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.2265625, + "rewards/margins": 3.203125, + "rewards/rejected": -1.96875, + "step": 63 + }, + { + "epoch": 0.0785276073619632, + "grad_norm": 57.40916665463975, + "learning_rate": 4.919421487603306e-07, + "logits/chosen": -0.21484375, + "logits/rejected": -0.404296875, + "logps/chosen": -406.0, + "logps/rejected": -324.0, + "loss": 0.3991, + "rewards/accuracies": 0.7734375, + "rewards/chosen": 1.5078125, + "rewards/margins": 3.609375, + "rewards/rejected": -2.09375, + "step": 64 + }, + { + "epoch": 0.07975460122699386, + "grad_norm": 39.641816149243105, + "learning_rate": 4.917355371900826e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.37109375, + "logps/chosen": -396.0, + "logps/rejected": -296.0, + "loss": 0.3463, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.4375, + "rewards/margins": 3.4375, + "rewards/rejected": -2.0, + "step": 65 + }, + { + "epoch": 0.08098159509202454, + "grad_norm": 49.84344547746062, + "learning_rate": 4.915289256198346e-07, + "logits/chosen": -0.2421875, + "logits/rejected": -0.392578125, + "logps/chosen": -322.0, + "logps/rejected": -254.0, + "loss": 0.3217, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.4921875, + "rewards/margins": 3.796875, + "rewards/rejected": -2.3125, + "step": 66 + }, + { + "epoch": 0.08220858895705521, + "grad_norm": 37.32761829857322, + "learning_rate": 4.913223140495867e-07, + "logits/chosen": -0.1337890625, + "logits/rejected": -0.263671875, + "logps/chosen": -334.0, + "logps/rejected": -288.0, + "loss": 0.3388, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.9375, + "rewards/margins": 3.125, + "rewards/rejected": -2.1875, + "step": 67 + }, + { + "epoch": 0.0834355828220859, + "grad_norm": 44.340094240446255, + "learning_rate": 4.911157024793388e-07, + "logits/chosen": -0.2216796875, + "logits/rejected": -0.30078125, + "logps/chosen": -364.0, + "logps/rejected": -326.0, + "loss": 0.3709, + "rewards/accuracies": 0.78125, + "rewards/chosen": 1.15625, + "rewards/margins": 3.234375, + "rewards/rejected": -2.078125, + "step": 68 + }, + { + "epoch": 0.08466257668711656, + "grad_norm": 36.72487633784899, + "learning_rate": 4.909090909090909e-07, + "logits/chosen": -0.279296875, + "logits/rejected": -0.46875, + "logps/chosen": -414.0, + "logps/rejected": -278.0, + "loss": 0.3115, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.8203125, + "rewards/margins": 4.0625, + "rewards/rejected": -2.25, + "step": 69 + }, + { + "epoch": 0.08588957055214724, + "grad_norm": 38.53295537225695, + "learning_rate": 4.907024793388429e-07, + "logits/chosen": -0.1572265625, + "logits/rejected": -0.35546875, + "logps/chosen": -414.0, + "logps/rejected": -336.0, + "loss": 0.2897, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.7578125, + "rewards/margins": 3.875, + "rewards/rejected": -2.109375, + "step": 70 + }, + { + "epoch": 0.08711656441717791, + "grad_norm": 41.12312548370276, + "learning_rate": 4.90495867768595e-07, + "logits/chosen": -0.095703125, + "logits/rejected": -0.1796875, + "logps/chosen": -348.0, + "logps/rejected": -274.0, + "loss": 0.4118, + "rewards/accuracies": 0.75, + "rewards/chosen": 0.9765625, + "rewards/margins": 2.921875, + "rewards/rejected": -1.9453125, + "step": 71 + }, + { + "epoch": 0.08834355828220859, + "grad_norm": 39.321341602611746, + "learning_rate": 4.902892561983471e-07, + "logits/chosen": -0.251953125, + "logits/rejected": -0.419921875, + "logps/chosen": -434.0, + "logps/rejected": -344.0, + "loss": 0.3197, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.5078125, + "rewards/margins": 3.53125, + "rewards/rejected": -2.03125, + "step": 72 + }, + { + "epoch": 0.08957055214723926, + "grad_norm": 44.53160035761988, + "learning_rate": 4.900826446280992e-07, + "logits/chosen": -0.1943359375, + "logits/rejected": -0.29296875, + "logps/chosen": -352.0, + "logps/rejected": -294.0, + "loss": 0.3927, + "rewards/accuracies": 0.765625, + "rewards/chosen": 1.1328125, + "rewards/margins": 3.34375, + "rewards/rejected": -2.21875, + "step": 73 + }, + { + "epoch": 0.09079754601226994, + "grad_norm": 40.466626208621626, + "learning_rate": 4.898760330578512e-07, + "logits/chosen": -0.1953125, + "logits/rejected": -0.29296875, + "logps/chosen": -356.0, + "logps/rejected": -324.0, + "loss": 0.303, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.97265625, + "rewards/margins": 3.25, + "rewards/rejected": -2.28125, + "step": 74 + }, + { + "epoch": 0.09202453987730061, + "grad_norm": 35.5267105162623, + "learning_rate": 4.896694214876033e-07, + "logits/chosen": -0.1669921875, + "logits/rejected": -0.33203125, + "logps/chosen": -384.0, + "logps/rejected": -314.0, + "loss": 0.2978, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.453125, + "rewards/margins": 3.8125, + "rewards/rejected": -2.359375, + "step": 75 + }, + { + "epoch": 0.09325153374233129, + "grad_norm": 47.01910580765987, + "learning_rate": 4.894628099173553e-07, + "logits/chosen": -0.169921875, + "logits/rejected": -0.359375, + "logps/chosen": -402.0, + "logps/rejected": -284.0, + "loss": 0.3205, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.4765625, + "rewards/margins": 3.671875, + "rewards/rejected": -2.203125, + "step": 76 + }, + { + "epoch": 0.09447852760736196, + "grad_norm": 37.028647946403694, + "learning_rate": 4.892561983471074e-07, + "logits/chosen": -0.189453125, + "logits/rejected": -0.34765625, + "logps/chosen": -352.0, + "logps/rejected": -292.0, + "loss": 0.3058, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.1328125, + "rewards/margins": 3.59375, + "rewards/rejected": -2.46875, + "step": 77 + }, + { + "epoch": 0.09570552147239264, + "grad_norm": 41.57134852043157, + "learning_rate": 4.890495867768595e-07, + "logits/chosen": -0.1474609375, + "logits/rejected": -0.330078125, + "logps/chosen": -420.0, + "logps/rejected": -310.0, + "loss": 0.3141, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.3671875, + "rewards/margins": 3.75, + "rewards/rejected": -2.390625, + "step": 78 + }, + { + "epoch": 0.09693251533742331, + "grad_norm": 34.691948521740784, + "learning_rate": 4.888429752066116e-07, + "logits/chosen": -0.12890625, + "logits/rejected": -0.2734375, + "logps/chosen": -356.0, + "logps/rejected": -282.0, + "loss": 0.3063, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.09375, + "rewards/margins": 3.40625, + "rewards/rejected": -2.3125, + "step": 79 + }, + { + "epoch": 0.09815950920245399, + "grad_norm": 49.17092037552417, + "learning_rate": 4.886363636363636e-07, + "logits/chosen": -0.19140625, + "logits/rejected": -0.42578125, + "logps/chosen": -410.0, + "logps/rejected": -318.0, + "loss": 0.2984, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.7890625, + "rewards/margins": 4.34375, + "rewards/rejected": -2.5625, + "step": 80 + }, + { + "epoch": 0.09938650306748466, + "grad_norm": 39.19664643244926, + "learning_rate": 4.884297520661157e-07, + "logits/chosen": -0.255859375, + "logits/rejected": -0.435546875, + "logps/chosen": -440.0, + "logps/rejected": -334.0, + "loss": 0.3241, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.5546875, + "rewards/margins": 4.15625, + "rewards/rejected": -2.578125, + "step": 81 + }, + { + "epoch": 0.10061349693251534, + "grad_norm": 49.311491941358796, + "learning_rate": 4.882231404958677e-07, + "logits/chosen": -0.1650390625, + "logits/rejected": -0.29296875, + "logps/chosen": -430.0, + "logps/rejected": -326.0, + "loss": 0.3395, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.0234375, + "rewards/margins": 3.65625, + "rewards/rejected": -2.640625, + "step": 82 + }, + { + "epoch": 0.10184049079754601, + "grad_norm": 49.376121428612976, + "learning_rate": 4.880165289256198e-07, + "logits/chosen": -0.1513671875, + "logits/rejected": -0.32421875, + "logps/chosen": -352.0, + "logps/rejected": -298.0, + "loss": 0.32, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.140625, + "rewards/margins": 3.734375, + "rewards/rejected": -2.59375, + "step": 83 + }, + { + "epoch": 0.10306748466257669, + "grad_norm": 64.06732250692619, + "learning_rate": 4.878099173553718e-07, + "logits/chosen": -0.1259765625, + "logits/rejected": -0.365234375, + "logps/chosen": -450.0, + "logps/rejected": -338.0, + "loss": 0.3022, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.4609375, + "rewards/margins": 4.3125, + "rewards/rejected": -2.875, + "step": 84 + }, + { + "epoch": 0.10429447852760736, + "grad_norm": 44.025841834176795, + "learning_rate": 4.87603305785124e-07, + "logits/chosen": -0.2177734375, + "logits/rejected": -0.38671875, + "logps/chosen": -378.0, + "logps/rejected": -314.0, + "loss": 0.3406, + "rewards/accuracies": 0.78125, + "rewards/chosen": 0.97265625, + "rewards/margins": 3.71875, + "rewards/rejected": -2.75, + "step": 85 + }, + { + "epoch": 0.10552147239263804, + "grad_norm": 41.64304248400373, + "learning_rate": 4.87396694214876e-07, + "logits/chosen": -0.1484375, + "logits/rejected": -0.271484375, + "logps/chosen": -426.0, + "logps/rejected": -294.0, + "loss": 0.3372, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.4140625, + "rewards/margins": 3.78125, + "rewards/rejected": -2.359375, + "step": 86 + }, + { + "epoch": 0.1067484662576687, + "grad_norm": 33.11395742992561, + "learning_rate": 4.871900826446281e-07, + "logits/chosen": -0.185546875, + "logits/rejected": -0.32421875, + "logps/chosen": -352.0, + "logps/rejected": -252.0, + "loss": 0.2974, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.7421875, + "rewards/margins": 3.484375, + "rewards/rejected": -2.75, + "step": 87 + }, + { + "epoch": 0.10797546012269939, + "grad_norm": 42.17124755394979, + "learning_rate": 4.869834710743801e-07, + "logits/chosen": -0.166015625, + "logits/rejected": -0.33984375, + "logps/chosen": -364.0, + "logps/rejected": -268.0, + "loss": 0.2793, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.125, + "rewards/margins": 3.6875, + "rewards/rejected": -2.5625, + "step": 88 + }, + { + "epoch": 0.10920245398773006, + "grad_norm": 43.24754945978333, + "learning_rate": 4.867768595041323e-07, + "logits/chosen": -0.1787109375, + "logits/rejected": -0.29296875, + "logps/chosen": -394.0, + "logps/rejected": -322.0, + "loss": 0.3704, + "rewards/accuracies": 0.796875, + "rewards/chosen": 1.328125, + "rewards/margins": 3.65625, + "rewards/rejected": -2.328125, + "step": 89 + }, + { + "epoch": 0.11042944785276074, + "grad_norm": 36.97477331926065, + "learning_rate": 4.865702479338843e-07, + "logits/chosen": -0.212890625, + "logits/rejected": -0.400390625, + "logps/chosen": -380.0, + "logps/rejected": -312.0, + "loss": 0.3415, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.97265625, + "rewards/margins": 3.5, + "rewards/rejected": -2.53125, + "step": 90 + }, + { + "epoch": 0.1116564417177914, + "grad_norm": 43.208078047171966, + "learning_rate": 4.863636363636364e-07, + "logits/chosen": -0.04638671875, + "logits/rejected": -0.30859375, + "logps/chosen": -394.0, + "logps/rejected": -290.0, + "loss": 0.2904, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.25, + "rewards/margins": 3.78125, + "rewards/rejected": -2.53125, + "step": 91 + }, + { + "epoch": 0.11288343558282209, + "grad_norm": 45.84043985703993, + "learning_rate": 4.861570247933884e-07, + "logits/chosen": -0.12890625, + "logits/rejected": -0.2490234375, + "logps/chosen": -394.0, + "logps/rejected": -294.0, + "loss": 0.2811, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.2578125, + "rewards/margins": 3.921875, + "rewards/rejected": -2.65625, + "step": 92 + }, + { + "epoch": 0.11411042944785275, + "grad_norm": 36.66550841517969, + "learning_rate": 4.859504132231405e-07, + "logits/chosen": -0.1484375, + "logits/rejected": -0.37109375, + "logps/chosen": -406.0, + "logps/rejected": -292.0, + "loss": 0.3038, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.8125, + "rewards/margins": 4.3125, + "rewards/rejected": -2.515625, + "step": 93 + }, + { + "epoch": 0.11533742331288344, + "grad_norm": 45.36547804836722, + "learning_rate": 4.857438016528925e-07, + "logits/chosen": -0.181640625, + "logits/rejected": -0.40234375, + "logps/chosen": -434.0, + "logps/rejected": -334.0, + "loss": 0.298, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.9140625, + "rewards/margins": 4.34375, + "rewards/rejected": -2.4375, + "step": 94 + }, + { + "epoch": 0.1165644171779141, + "grad_norm": 36.1886645335595, + "learning_rate": 4.855371900826447e-07, + "logits/chosen": -0.25390625, + "logits/rejected": -0.40625, + "logps/chosen": -382.0, + "logps/rejected": -300.0, + "loss": 0.3254, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.5390625, + "rewards/margins": 4.25, + "rewards/rejected": -2.703125, + "step": 95 + }, + { + "epoch": 0.11779141104294479, + "grad_norm": 47.78990929288722, + "learning_rate": 4.853305785123967e-07, + "logits/chosen": -0.2373046875, + "logits/rejected": -0.40625, + "logps/chosen": -374.0, + "logps/rejected": -302.0, + "loss": 0.2721, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.875, + "rewards/margins": 4.59375, + "rewards/rejected": -2.734375, + "step": 96 + }, + { + "epoch": 0.11901840490797547, + "grad_norm": 46.646580854293525, + "learning_rate": 4.851239669421487e-07, + "logits/chosen": -0.2314453125, + "logits/rejected": -0.37890625, + "logps/chosen": -428.0, + "logps/rejected": -346.0, + "loss": 0.3608, + "rewards/accuracies": 0.796875, + "rewards/chosen": 1.6640625, + "rewards/margins": 4.0, + "rewards/rejected": -2.328125, + "step": 97 + }, + { + "epoch": 0.12024539877300613, + "grad_norm": 38.68608855483517, + "learning_rate": 4.849173553719008e-07, + "logits/chosen": -0.0419921875, + "logits/rejected": -0.2431640625, + "logps/chosen": -360.0, + "logps/rejected": -276.0, + "loss": 0.3119, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.5, + "rewards/margins": 3.71875, + "rewards/rejected": -2.21875, + "step": 98 + }, + { + "epoch": 0.12147239263803682, + "grad_norm": 39.562539416001016, + "learning_rate": 4.847107438016528e-07, + "logits/chosen": -0.1953125, + "logits/rejected": -0.294921875, + "logps/chosen": -340.0, + "logps/rejected": -239.0, + "loss": 0.2701, + "rewards/accuracies": 0.921875, + "rewards/chosen": 1.1171875, + "rewards/margins": 3.46875, + "rewards/rejected": -2.34375, + "step": 99 + }, + { + "epoch": 0.12269938650306748, + "grad_norm": 37.50806782806318, + "learning_rate": 4.84504132231405e-07, + "logits/chosen": -0.2236328125, + "logits/rejected": -0.408203125, + "logps/chosen": -396.0, + "logps/rejected": -312.0, + "loss": 0.3124, + "rewards/accuracies": 0.796875, + "rewards/chosen": 1.5546875, + "rewards/margins": 4.125, + "rewards/rejected": -2.578125, + "step": 100 + }, + { + "epoch": 0.12392638036809817, + "grad_norm": 46.32080898977058, + "learning_rate": 4.842975206611569e-07, + "logits/chosen": -0.220703125, + "logits/rejected": -0.41015625, + "logps/chosen": -414.0, + "logps/rejected": -330.0, + "loss": 0.3659, + "rewards/accuracies": 0.78125, + "rewards/chosen": 1.6875, + "rewards/margins": 4.0625, + "rewards/rejected": -2.375, + "step": 101 + }, + { + "epoch": 0.12515337423312883, + "grad_norm": 38.46942420347679, + "learning_rate": 4.840909090909091e-07, + "logits/chosen": -0.19921875, + "logits/rejected": -0.31640625, + "logps/chosen": -396.0, + "logps/rejected": -314.0, + "loss": 0.2962, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.671875, + "rewards/margins": 4.0, + "rewards/rejected": -2.328125, + "step": 102 + }, + { + "epoch": 0.1263803680981595, + "grad_norm": 39.79508252800174, + "learning_rate": 4.838842975206611e-07, + "logits/chosen": -0.1884765625, + "logits/rejected": -0.349609375, + "logps/chosen": -350.0, + "logps/rejected": -290.0, + "loss": 0.3121, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.4609375, + "rewards/margins": 3.734375, + "rewards/rejected": -2.265625, + "step": 103 + }, + { + "epoch": 0.1276073619631902, + "grad_norm": 47.40646017292448, + "learning_rate": 4.836776859504132e-07, + "logits/chosen": -0.1162109375, + "logits/rejected": -0.255859375, + "logps/chosen": -416.0, + "logps/rejected": -330.0, + "loss": 0.3411, + "rewards/accuracies": 0.78125, + "rewards/chosen": 1.46875, + "rewards/margins": 3.734375, + "rewards/rejected": -2.265625, + "step": 104 + }, + { + "epoch": 0.12883435582822086, + "grad_norm": 38.094017856958104, + "learning_rate": 4.834710743801652e-07, + "logits/chosen": -0.2021484375, + "logits/rejected": -0.40234375, + "logps/chosen": -378.0, + "logps/rejected": -298.0, + "loss": 0.2782, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.6640625, + "rewards/margins": 4.1875, + "rewards/rejected": -2.515625, + "step": 105 + }, + { + "epoch": 0.13006134969325153, + "grad_norm": 38.92036345370265, + "learning_rate": 4.832644628099174e-07, + "logits/chosen": -0.177734375, + "logits/rejected": -0.337890625, + "logps/chosen": -394.0, + "logps/rejected": -304.0, + "loss": 0.3126, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.6171875, + "rewards/margins": 3.953125, + "rewards/rejected": -2.34375, + "step": 106 + }, + { + "epoch": 0.1312883435582822, + "grad_norm": 41.08010358460662, + "learning_rate": 4.830578512396694e-07, + "logits/chosen": -0.2109375, + "logits/rejected": -0.3046875, + "logps/chosen": -350.0, + "logps/rejected": -292.0, + "loss": 0.2914, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.4375, + "rewards/margins": 3.8125, + "rewards/rejected": -2.375, + "step": 107 + }, + { + "epoch": 0.1325153374233129, + "grad_norm": 36.5889842300964, + "learning_rate": 4.828512396694215e-07, + "logits/chosen": -0.2236328125, + "logits/rejected": -0.435546875, + "logps/chosen": -382.0, + "logps/rejected": -294.0, + "loss": 0.2899, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.2734375, + "rewards/margins": 3.921875, + "rewards/rejected": -2.65625, + "step": 108 + }, + { + "epoch": 0.13374233128834356, + "grad_norm": 39.09556301559485, + "learning_rate": 4.826446280991735e-07, + "logits/chosen": -0.20703125, + "logits/rejected": -0.39453125, + "logps/chosen": -414.0, + "logps/rejected": -304.0, + "loss": 0.3113, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 2.1875, + "rewards/margins": 4.59375, + "rewards/rejected": -2.390625, + "step": 109 + }, + { + "epoch": 0.13496932515337423, + "grad_norm": 40.98286093074122, + "learning_rate": 4.824380165289256e-07, + "logits/chosen": -0.193359375, + "logits/rejected": -0.349609375, + "logps/chosen": -406.0, + "logps/rejected": -326.0, + "loss": 0.3227, + "rewards/accuracies": 0.7734375, + "rewards/chosen": 1.890625, + "rewards/margins": 4.3125, + "rewards/rejected": -2.421875, + "step": 110 + }, + { + "epoch": 0.1361963190184049, + "grad_norm": 35.811211169912276, + "learning_rate": 4.822314049586776e-07, + "logits/chosen": -0.1318359375, + "logits/rejected": -0.294921875, + "logps/chosen": -332.0, + "logps/rejected": -262.0, + "loss": 0.303, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.3828125, + "rewards/margins": 3.546875, + "rewards/rejected": -2.15625, + "step": 111 + }, + { + "epoch": 0.1374233128834356, + "grad_norm": 34.57286118091264, + "learning_rate": 4.820247933884298e-07, + "logits/chosen": -0.2080078125, + "logits/rejected": -0.328125, + "logps/chosen": -342.0, + "logps/rejected": -272.0, + "loss": 0.259, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.4140625, + "rewards/margins": 3.828125, + "rewards/rejected": -2.40625, + "step": 112 + }, + { + "epoch": 0.13865030674846626, + "grad_norm": 39.00609248421783, + "learning_rate": 4.818181818181818e-07, + "logits/chosen": -0.12353515625, + "logits/rejected": -0.216796875, + "logps/chosen": -378.0, + "logps/rejected": -294.0, + "loss": 0.3242, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.5859375, + "rewards/margins": 3.8125, + "rewards/rejected": -2.234375, + "step": 113 + }, + { + "epoch": 0.13987730061349693, + "grad_norm": 44.795935075325445, + "learning_rate": 4.816115702479339e-07, + "logits/chosen": -0.1591796875, + "logits/rejected": -0.318359375, + "logps/chosen": -376.0, + "logps/rejected": -300.0, + "loss": 0.3214, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.1875, + "rewards/margins": 3.484375, + "rewards/rejected": -2.296875, + "step": 114 + }, + { + "epoch": 0.1411042944785276, + "grad_norm": 43.827084866837005, + "learning_rate": 4.814049586776859e-07, + "logits/chosen": -0.1689453125, + "logits/rejected": -0.291015625, + "logps/chosen": -340.0, + "logps/rejected": -306.0, + "loss": 0.338, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.953125, + "rewards/margins": 3.296875, + "rewards/rejected": -2.34375, + "step": 115 + }, + { + "epoch": 0.1423312883435583, + "grad_norm": 32.836140603929685, + "learning_rate": 4.81198347107438e-07, + "logits/chosen": -0.220703125, + "logits/rejected": -0.45703125, + "logps/chosen": -382.0, + "logps/rejected": -314.0, + "loss": 0.2561, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.84375, + "rewards/margins": 4.375, + "rewards/rejected": -2.546875, + "step": 116 + }, + { + "epoch": 0.14355828220858896, + "grad_norm": 34.86086710464441, + "learning_rate": 4.809917355371901e-07, + "logits/chosen": -0.1689453125, + "logits/rejected": -0.31640625, + "logps/chosen": -326.0, + "logps/rejected": -255.0, + "loss": 0.289, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.140625, + "rewards/margins": 3.828125, + "rewards/rejected": -2.6875, + "step": 117 + }, + { + "epoch": 0.14478527607361963, + "grad_norm": 39.71090585702439, + "learning_rate": 4.807851239669422e-07, + "logits/chosen": -0.1826171875, + "logits/rejected": -0.349609375, + "logps/chosen": -422.0, + "logps/rejected": -344.0, + "loss": 0.3177, + "rewards/accuracies": 0.7734375, + "rewards/chosen": 1.8203125, + "rewards/margins": 4.125, + "rewards/rejected": -2.296875, + "step": 118 + }, + { + "epoch": 0.1460122699386503, + "grad_norm": 39.95542336983019, + "learning_rate": 4.805785123966942e-07, + "logits/chosen": -0.25, + "logits/rejected": -0.353515625, + "logps/chosen": -356.0, + "logps/rejected": -310.0, + "loss": 0.3108, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.25, + "rewards/margins": 3.921875, + "rewards/rejected": -2.65625, + "step": 119 + }, + { + "epoch": 0.147239263803681, + "grad_norm": 43.1225245187085, + "learning_rate": 4.803719008264463e-07, + "logits/chosen": -0.2373046875, + "logits/rejected": -0.42578125, + "logps/chosen": -422.0, + "logps/rejected": -340.0, + "loss": 0.2861, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 2.15625, + "rewards/margins": 4.6875, + "rewards/rejected": -2.53125, + "step": 120 + }, + { + "epoch": 0.14846625766871166, + "grad_norm": 37.11625554264979, + "learning_rate": 4.801652892561983e-07, + "logits/chosen": -0.150390625, + "logits/rejected": -0.3125, + "logps/chosen": -412.0, + "logps/rejected": -318.0, + "loss": 0.2783, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.9296875, + "rewards/margins": 4.34375, + "rewards/rejected": -2.421875, + "step": 121 + }, + { + "epoch": 0.14969325153374233, + "grad_norm": 40.09291676904836, + "learning_rate": 4.799586776859503e-07, + "logits/chosen": -0.1689453125, + "logits/rejected": -0.337890625, + "logps/chosen": -380.0, + "logps/rejected": -282.0, + "loss": 0.2905, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.484375, + "rewards/margins": 3.859375, + "rewards/rejected": -2.390625, + "step": 122 + }, + { + "epoch": 0.150920245398773, + "grad_norm": 40.539065533878755, + "learning_rate": 4.797520661157025e-07, + "logits/chosen": -0.06982421875, + "logits/rejected": -0.2431640625, + "logps/chosen": -382.0, + "logps/rejected": -272.0, + "loss": 0.3077, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.140625, + "rewards/margins": 3.734375, + "rewards/rejected": -2.59375, + "step": 123 + }, + { + "epoch": 0.1521472392638037, + "grad_norm": 36.86795414024157, + "learning_rate": 4.795454545454545e-07, + "logits/chosen": -0.232421875, + "logits/rejected": -0.306640625, + "logps/chosen": -352.0, + "logps/rejected": -274.0, + "loss": 0.2623, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.75, + "rewards/margins": 4.53125, + "rewards/rejected": -2.78125, + "step": 124 + }, + { + "epoch": 0.15337423312883436, + "grad_norm": 41.75540815129781, + "learning_rate": 4.793388429752066e-07, + "logits/chosen": -0.29296875, + "logits/rejected": -0.47265625, + "logps/chosen": -434.0, + "logps/rejected": -320.0, + "loss": 0.2841, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.578125, + "rewards/margins": 4.5625, + "rewards/rejected": -2.984375, + "step": 125 + }, + { + "epoch": 0.15460122699386503, + "grad_norm": 80.39792909106652, + "learning_rate": 4.791322314049586e-07, + "logits/chosen": -0.16015625, + "logits/rejected": -0.353515625, + "logps/chosen": -366.0, + "logps/rejected": -296.0, + "loss": 0.3527, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.83203125, + "rewards/margins": 3.578125, + "rewards/rejected": -2.75, + "step": 126 + }, + { + "epoch": 0.1558282208588957, + "grad_norm": 40.94598816709626, + "learning_rate": 4.789256198347108e-07, + "logits/chosen": -0.1103515625, + "logits/rejected": -0.298828125, + "logps/chosen": -390.0, + "logps/rejected": -318.0, + "loss": 0.3476, + "rewards/accuracies": 0.7734375, + "rewards/chosen": 1.6640625, + "rewards/margins": 4.21875, + "rewards/rejected": -2.5625, + "step": 127 + }, + { + "epoch": 0.1570552147239264, + "grad_norm": 39.47992513478673, + "learning_rate": 4.787190082644627e-07, + "logits/chosen": -0.158203125, + "logits/rejected": -0.34765625, + "logps/chosen": -374.0, + "logps/rejected": -320.0, + "loss": 0.2814, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.5703125, + "rewards/margins": 4.3125, + "rewards/rejected": -2.75, + "step": 128 + }, + { + "epoch": 0.15828220858895706, + "grad_norm": 37.925898083738666, + "learning_rate": 4.785123966942149e-07, + "logits/chosen": -0.06396484375, + "logits/rejected": -0.1953125, + "logps/chosen": -338.0, + "logps/rejected": -278.0, + "loss": 0.3421, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.125, + "rewards/margins": 3.546875, + "rewards/rejected": -2.421875, + "step": 129 + }, + { + "epoch": 0.15950920245398773, + "grad_norm": 38.0262211895724, + "learning_rate": 4.783057851239669e-07, + "logits/chosen": -0.162109375, + "logits/rejected": -0.3046875, + "logps/chosen": -382.0, + "logps/rejected": -300.0, + "loss": 0.3115, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.1640625, + "rewards/margins": 3.96875, + "rewards/rejected": -2.8125, + "step": 130 + }, + { + "epoch": 0.1607361963190184, + "grad_norm": 35.33717303960686, + "learning_rate": 4.78099173553719e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.4140625, + "logps/chosen": -394.0, + "logps/rejected": -330.0, + "loss": 0.2154, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.6875, + "rewards/margins": 4.6875, + "rewards/rejected": -3.0, + "step": 131 + }, + { + "epoch": 0.1619631901840491, + "grad_norm": 40.955300358810696, + "learning_rate": 4.77892561983471e-07, + "logits/chosen": -0.234375, + "logits/rejected": -0.421875, + "logps/chosen": -390.0, + "logps/rejected": -312.0, + "loss": 0.314, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.484375, + "rewards/margins": 4.34375, + "rewards/rejected": -2.84375, + "step": 132 + }, + { + "epoch": 0.16319018404907976, + "grad_norm": 43.6440596613334, + "learning_rate": 4.776859504132231e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.4296875, + "logps/chosen": -384.0, + "logps/rejected": -318.0, + "loss": 0.2844, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.3671875, + "rewards/margins": 4.4375, + "rewards/rejected": -3.078125, + "step": 133 + }, + { + "epoch": 0.16441717791411042, + "grad_norm": 43.873623198146426, + "learning_rate": 4.774793388429752e-07, + "logits/chosen": -0.1953125, + "logits/rejected": -0.404296875, + "logps/chosen": -452.0, + "logps/rejected": -354.0, + "loss": 0.2948, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.3828125, + "rewards/margins": 3.96875, + "rewards/rejected": -2.59375, + "step": 134 + }, + { + "epoch": 0.1656441717791411, + "grad_norm": 44.973502848979926, + "learning_rate": 4.772727272727273e-07, + "logits/chosen": -0.0732421875, + "logits/rejected": -0.1865234375, + "logps/chosen": -372.0, + "logps/rejected": -308.0, + "loss": 0.3459, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.86328125, + "rewards/margins": 3.6875, + "rewards/rejected": -2.828125, + "step": 135 + }, + { + "epoch": 0.1668711656441718, + "grad_norm": 42.51816162906932, + "learning_rate": 4.770661157024793e-07, + "logits/chosen": -0.29296875, + "logits/rejected": -0.376953125, + "logps/chosen": -388.0, + "logps/rejected": -298.0, + "loss": 0.3308, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.2578125, + "rewards/margins": 4.34375, + "rewards/rejected": -3.078125, + "step": 136 + }, + { + "epoch": 0.16809815950920245, + "grad_norm": 48.104926340758944, + "learning_rate": 4.768595041322314e-07, + "logits/chosen": -0.080078125, + "logits/rejected": -0.2236328125, + "logps/chosen": -394.0, + "logps/rejected": -298.0, + "loss": 0.3458, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.125, + "rewards/margins": 3.640625, + "rewards/rejected": -2.515625, + "step": 137 + }, + { + "epoch": 0.16932515337423312, + "grad_norm": 38.354545275687684, + "learning_rate": 4.766528925619834e-07, + "logits/chosen": -0.1572265625, + "logits/rejected": -0.298828125, + "logps/chosen": -402.0, + "logps/rejected": -338.0, + "loss": 0.304, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.0078125, + "rewards/margins": 3.78125, + "rewards/rejected": -2.765625, + "step": 138 + }, + { + "epoch": 0.1705521472392638, + "grad_norm": 43.72111370882085, + "learning_rate": 4.764462809917355e-07, + "logits/chosen": -0.1494140625, + "logits/rejected": -0.32421875, + "logps/chosen": -414.0, + "logps/rejected": -356.0, + "loss": 0.3477, + "rewards/accuracies": 0.765625, + "rewards/chosen": 1.4453125, + "rewards/margins": 4.625, + "rewards/rejected": -3.171875, + "step": 139 + }, + { + "epoch": 0.17177914110429449, + "grad_norm": 49.390666427837495, + "learning_rate": 4.7623966942148756e-07, + "logits/chosen": -0.1201171875, + "logits/rejected": -0.3046875, + "logps/chosen": -422.0, + "logps/rejected": -354.0, + "loss": 0.3233, + "rewards/accuracies": 0.78125, + "rewards/chosen": 1.375, + "rewards/margins": 4.28125, + "rewards/rejected": -2.90625, + "step": 140 + }, + { + "epoch": 0.17300613496932515, + "grad_norm": 37.18049684192118, + "learning_rate": 4.7603305785123966e-07, + "logits/chosen": -0.10205078125, + "logits/rejected": -0.228515625, + "logps/chosen": -356.0, + "logps/rejected": -312.0, + "loss": 0.2587, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.3671875, + "rewards/margins": 4.1875, + "rewards/rejected": -2.8125, + "step": 141 + }, + { + "epoch": 0.17423312883435582, + "grad_norm": 38.15326329982988, + "learning_rate": 4.758264462809917e-07, + "logits/chosen": -0.134765625, + "logits/rejected": -0.32421875, + "logps/chosen": -396.0, + "logps/rejected": -330.0, + "loss": 0.3083, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.3984375, + "rewards/margins": 4.40625, + "rewards/rejected": -3.0, + "step": 142 + }, + { + "epoch": 0.1754601226993865, + "grad_norm": 42.239479521280984, + "learning_rate": 4.756198347107438e-07, + "logits/chosen": -0.1572265625, + "logits/rejected": -0.37890625, + "logps/chosen": -382.0, + "logps/rejected": -302.0, + "loss": 0.3086, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.0, + "rewards/margins": 4.15625, + "rewards/rejected": -3.140625, + "step": 143 + }, + { + "epoch": 0.17668711656441718, + "grad_norm": 36.71090019780343, + "learning_rate": 4.7541322314049586e-07, + "logits/chosen": -0.25, + "logits/rejected": -0.44140625, + "logps/chosen": -418.0, + "logps/rejected": -334.0, + "loss": 0.2799, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.7578125, + "rewards/margins": 4.75, + "rewards/rejected": -2.984375, + "step": 144 + }, + { + "epoch": 0.17791411042944785, + "grad_norm": 39.65398403637813, + "learning_rate": 4.7520661157024796e-07, + "logits/chosen": -0.2421875, + "logits/rejected": -0.390625, + "logps/chosen": -382.0, + "logps/rejected": -326.0, + "loss": 0.2858, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.5078125, + "rewards/margins": 4.46875, + "rewards/rejected": -2.953125, + "step": 145 + }, + { + "epoch": 0.17914110429447852, + "grad_norm": 36.72907127712686, + "learning_rate": 4.7499999999999995e-07, + "logits/chosen": -0.2236328125, + "logits/rejected": -0.33984375, + "logps/chosen": -384.0, + "logps/rejected": -310.0, + "loss": 0.2676, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 0.9375, + "rewards/margins": 4.09375, + "rewards/rejected": -3.15625, + "step": 146 + }, + { + "epoch": 0.18036809815950922, + "grad_norm": 35.42441477087175, + "learning_rate": 4.7479338842975205e-07, + "logits/chosen": -0.2255859375, + "logits/rejected": -0.37890625, + "logps/chosen": -388.0, + "logps/rejected": -310.0, + "loss": 0.275, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.5625, + "rewards/margins": 4.75, + "rewards/rejected": -3.203125, + "step": 147 + }, + { + "epoch": 0.18159509202453988, + "grad_norm": 51.82377713556493, + "learning_rate": 4.745867768595041e-07, + "logits/chosen": -0.25, + "logits/rejected": -0.384765625, + "logps/chosen": -414.0, + "logps/rejected": -344.0, + "loss": 0.3525, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.1171875, + "rewards/margins": 4.15625, + "rewards/rejected": -3.03125, + "step": 148 + }, + { + "epoch": 0.18282208588957055, + "grad_norm": 41.25940325564231, + "learning_rate": 4.743801652892562e-07, + "logits/chosen": -0.1279296875, + "logits/rejected": -0.29296875, + "logps/chosen": -406.0, + "logps/rejected": -362.0, + "loss": 0.253, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.734375, + "rewards/margins": 4.5625, + "rewards/rejected": -2.8125, + "step": 149 + }, + { + "epoch": 0.18404907975460122, + "grad_norm": 43.207544914218985, + "learning_rate": 4.7417355371900825e-07, + "logits/chosen": -0.1611328125, + "logits/rejected": -0.34375, + "logps/chosen": -424.0, + "logps/rejected": -328.0, + "loss": 0.3367, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.3984375, + "rewards/margins": 4.03125, + "rewards/rejected": -2.625, + "step": 150 + }, + { + "epoch": 0.18527607361963191, + "grad_norm": 42.2843854545005, + "learning_rate": 4.739669421487603e-07, + "logits/chosen": -0.1728515625, + "logits/rejected": -0.302734375, + "logps/chosen": -380.0, + "logps/rejected": -306.0, + "loss": 0.319, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.4453125, + "rewards/margins": 4.0625, + "rewards/rejected": -2.609375, + "step": 151 + }, + { + "epoch": 0.18650306748466258, + "grad_norm": 36.146243015735116, + "learning_rate": 4.737603305785124e-07, + "logits/chosen": -0.267578125, + "logits/rejected": -0.5078125, + "logps/chosen": -398.0, + "logps/rejected": -294.0, + "loss": 0.2584, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.203125, + "rewards/margins": 4.75, + "rewards/rejected": -3.546875, + "step": 152 + }, + { + "epoch": 0.18773006134969325, + "grad_norm": 38.30453694202532, + "learning_rate": 4.7355371900826444e-07, + "logits/chosen": -0.23828125, + "logits/rejected": -0.35546875, + "logps/chosen": -350.0, + "logps/rejected": -302.0, + "loss": 0.2846, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.265625, + "rewards/margins": 4.34375, + "rewards/rejected": -3.0625, + "step": 153 + }, + { + "epoch": 0.18895705521472392, + "grad_norm": 48.193035851495836, + "learning_rate": 4.7334710743801654e-07, + "logits/chosen": -0.11767578125, + "logits/rejected": -0.30859375, + "logps/chosen": -424.0, + "logps/rejected": -324.0, + "loss": 0.3123, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.703125, + "rewards/margins": 4.4375, + "rewards/rejected": -2.734375, + "step": 154 + }, + { + "epoch": 0.1901840490797546, + "grad_norm": 27.96292821117509, + "learning_rate": 4.7314049586776853e-07, + "logits/chosen": -0.2216796875, + "logits/rejected": -0.46875, + "logps/chosen": -384.0, + "logps/rejected": -302.0, + "loss": 0.1878, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 2.15625, + "rewards/margins": 5.40625, + "rewards/rejected": -3.25, + "step": 155 + }, + { + "epoch": 0.19141104294478528, + "grad_norm": 42.366226442840826, + "learning_rate": 4.7293388429752063e-07, + "logits/chosen": -0.1357421875, + "logits/rejected": -0.2470703125, + "logps/chosen": -370.0, + "logps/rejected": -332.0, + "loss": 0.2881, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.1796875, + "rewards/margins": 3.953125, + "rewards/rejected": -2.765625, + "step": 156 + }, + { + "epoch": 0.19263803680981595, + "grad_norm": 40.72999796402848, + "learning_rate": 4.727272727272727e-07, + "logits/chosen": -0.1376953125, + "logits/rejected": -0.263671875, + "logps/chosen": -396.0, + "logps/rejected": -292.0, + "loss": 0.2888, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.1953125, + "rewards/margins": 4.09375, + "rewards/rejected": -2.890625, + "step": 157 + }, + { + "epoch": 0.19386503067484662, + "grad_norm": 33.577674005153725, + "learning_rate": 4.725206611570248e-07, + "logits/chosen": -0.32421875, + "logits/rejected": -0.51171875, + "logps/chosen": -388.0, + "logps/rejected": -302.0, + "loss": 0.2863, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.3671875, + "rewards/margins": 4.53125, + "rewards/rejected": -3.15625, + "step": 158 + }, + { + "epoch": 0.1950920245398773, + "grad_norm": 43.09895886139825, + "learning_rate": 4.7231404958677683e-07, + "logits/chosen": -0.228515625, + "logits/rejected": -0.357421875, + "logps/chosen": -360.0, + "logps/rejected": -314.0, + "loss": 0.2941, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.40625, + "rewards/margins": 4.25, + "rewards/rejected": -2.84375, + "step": 159 + }, + { + "epoch": 0.19631901840490798, + "grad_norm": 33.061685198617056, + "learning_rate": 4.7210743801652893e-07, + "logits/chosen": -0.1201171875, + "logits/rejected": -0.345703125, + "logps/chosen": -354.0, + "logps/rejected": -290.0, + "loss": 0.2365, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.03125, + "rewards/margins": 4.125, + "rewards/rejected": -3.09375, + "step": 160 + }, + { + "epoch": 0.19754601226993865, + "grad_norm": 34.262461708297515, + "learning_rate": 4.71900826446281e-07, + "logits/chosen": -0.28515625, + "logits/rejected": -0.4921875, + "logps/chosen": -390.0, + "logps/rejected": -284.0, + "loss": 0.2321, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.6015625, + "rewards/margins": 4.6875, + "rewards/rejected": -3.078125, + "step": 161 + }, + { + "epoch": 0.19877300613496932, + "grad_norm": 46.44613400198569, + "learning_rate": 4.716942148760331e-07, + "logits/chosen": -0.2080078125, + "logits/rejected": -0.2890625, + "logps/chosen": -352.0, + "logps/rejected": -326.0, + "loss": 0.3532, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.234375, + "rewards/margins": 4.09375, + "rewards/rejected": -2.875, + "step": 162 + }, + { + "epoch": 0.2, + "grad_norm": 40.81709447673029, + "learning_rate": 4.7148760330578507e-07, + "logits/chosen": -0.146484375, + "logits/rejected": -0.296875, + "logps/chosen": -394.0, + "logps/rejected": -324.0, + "loss": 0.2919, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.3359375, + "rewards/margins": 4.15625, + "rewards/rejected": -2.8125, + "step": 163 + }, + { + "epoch": 0.20122699386503068, + "grad_norm": 30.76141719102355, + "learning_rate": 4.7128099173553717e-07, + "logits/chosen": -0.2890625, + "logits/rejected": -0.5234375, + "logps/chosen": -396.0, + "logps/rejected": -290.0, + "loss": 0.2276, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.828125, + "rewards/margins": 5.09375, + "rewards/rejected": -3.28125, + "step": 164 + }, + { + "epoch": 0.20245398773006135, + "grad_norm": 39.308244617085876, + "learning_rate": 4.710743801652892e-07, + "logits/chosen": -0.09228515625, + "logits/rejected": -0.298828125, + "logps/chosen": -442.0, + "logps/rejected": -306.0, + "loss": 0.2561, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.6328125, + "rewards/margins": 4.40625, + "rewards/rejected": -2.78125, + "step": 165 + }, + { + "epoch": 0.20368098159509201, + "grad_norm": 40.482102907615214, + "learning_rate": 4.708677685950413e-07, + "logits/chosen": -0.158203125, + "logits/rejected": -0.388671875, + "logps/chosen": -390.0, + "logps/rejected": -316.0, + "loss": 0.335, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.7890625, + "rewards/margins": 4.4375, + "rewards/rejected": -2.640625, + "step": 166 + }, + { + "epoch": 0.2049079754601227, + "grad_norm": 41.24091114160285, + "learning_rate": 4.7066115702479336e-07, + "logits/chosen": -0.13671875, + "logits/rejected": -0.291015625, + "logps/chosen": -402.0, + "logps/rejected": -298.0, + "loss": 0.3427, + "rewards/accuracies": 0.78125, + "rewards/chosen": 1.9609375, + "rewards/margins": 4.65625, + "rewards/rejected": -2.703125, + "step": 167 + }, + { + "epoch": 0.20613496932515338, + "grad_norm": 36.55347289055332, + "learning_rate": 4.704545454545454e-07, + "logits/chosen": -0.12158203125, + "logits/rejected": -0.236328125, + "logps/chosen": -348.0, + "logps/rejected": -270.0, + "loss": 0.2471, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.046875, + "rewards/margins": 4.3125, + "rewards/rejected": -3.265625, + "step": 168 + }, + { + "epoch": 0.20736196319018405, + "grad_norm": 42.227854487848845, + "learning_rate": 4.702479338842975e-07, + "logits/chosen": -0.1982421875, + "logits/rejected": -0.365234375, + "logps/chosen": -370.0, + "logps/rejected": -344.0, + "loss": 0.3043, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.03125, + "rewards/margins": 4.09375, + "rewards/rejected": -3.0625, + "step": 169 + }, + { + "epoch": 0.2085889570552147, + "grad_norm": 41.26301353968675, + "learning_rate": 4.7004132231404956e-07, + "logits/chosen": -0.1865234375, + "logits/rejected": -0.427734375, + "logps/chosen": -450.0, + "logps/rejected": -322.0, + "loss": 0.282, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.8671875, + "rewards/margins": 4.875, + "rewards/rejected": -3.015625, + "step": 170 + }, + { + "epoch": 0.2098159509202454, + "grad_norm": 32.40263540928059, + "learning_rate": 4.6983471074380166e-07, + "logits/chosen": -0.169921875, + "logits/rejected": -0.365234375, + "logps/chosen": -384.0, + "logps/rejected": -296.0, + "loss": 0.267, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.625, + "rewards/margins": 4.9375, + "rewards/rejected": -3.296875, + "step": 171 + }, + { + "epoch": 0.21104294478527608, + "grad_norm": 39.16155801484506, + "learning_rate": 4.6962809917355365e-07, + "logits/chosen": -0.1455078125, + "logits/rejected": -0.30859375, + "logps/chosen": -438.0, + "logps/rejected": -326.0, + "loss": 0.2624, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.828125, + "rewards/margins": 4.96875, + "rewards/rejected": -3.140625, + "step": 172 + }, + { + "epoch": 0.21226993865030674, + "grad_norm": 32.6638006062681, + "learning_rate": 4.6942148760330575e-07, + "logits/chosen": -0.2021484375, + "logits/rejected": -0.439453125, + "logps/chosen": -424.0, + "logps/rejected": -330.0, + "loss": 0.2304, + "rewards/accuracies": 0.859375, + "rewards/chosen": 2.015625, + "rewards/margins": 5.3125, + "rewards/rejected": -3.28125, + "step": 173 + }, + { + "epoch": 0.2134969325153374, + "grad_norm": 41.117611256664055, + "learning_rate": 4.692148760330578e-07, + "logits/chosen": -0.057861328125, + "logits/rejected": -0.265625, + "logps/chosen": -380.0, + "logps/rejected": -318.0, + "loss": 0.3128, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.28125, + "rewards/margins": 4.4375, + "rewards/rejected": -3.15625, + "step": 174 + }, + { + "epoch": 0.2147239263803681, + "grad_norm": 43.97682714628577, + "learning_rate": 4.690082644628099e-07, + "logits/chosen": -0.1943359375, + "logits/rejected": -0.333984375, + "logps/chosen": -396.0, + "logps/rejected": -336.0, + "loss": 0.3103, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.6796875, + "rewards/margins": 4.8125, + "rewards/rejected": -3.140625, + "step": 175 + }, + { + "epoch": 0.21595092024539878, + "grad_norm": 39.95318826911176, + "learning_rate": 4.6880165289256195e-07, + "logits/chosen": -0.23046875, + "logits/rejected": -0.419921875, + "logps/chosen": -432.0, + "logps/rejected": -346.0, + "loss": 0.3105, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.65625, + "rewards/margins": 4.875, + "rewards/rejected": -3.234375, + "step": 176 + }, + { + "epoch": 0.21717791411042944, + "grad_norm": 31.646657225559906, + "learning_rate": 4.6859504132231405e-07, + "logits/chosen": -0.1767578125, + "logits/rejected": -0.408203125, + "logps/chosen": -416.0, + "logps/rejected": -324.0, + "loss": 0.233, + "rewards/accuracies": 0.859375, + "rewards/chosen": 2.109375, + "rewards/margins": 5.5625, + "rewards/rejected": -3.46875, + "step": 177 + }, + { + "epoch": 0.2184049079754601, + "grad_norm": 41.80865379666853, + "learning_rate": 4.683884297520661e-07, + "logits/chosen": -0.173828125, + "logits/rejected": -0.322265625, + "logps/chosen": -326.0, + "logps/rejected": -288.0, + "loss": 0.3445, + "rewards/accuracies": 0.78125, + "rewards/chosen": 0.640625, + "rewards/margins": 4.28125, + "rewards/rejected": -3.640625, + "step": 178 + }, + { + "epoch": 0.2196319018404908, + "grad_norm": 33.273068108107914, + "learning_rate": 4.681818181818182e-07, + "logits/chosen": -0.2099609375, + "logits/rejected": -0.4140625, + "logps/chosen": -368.0, + "logps/rejected": -298.0, + "loss": 0.2545, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 0.8828125, + "rewards/margins": 4.4375, + "rewards/rejected": -3.546875, + "step": 179 + }, + { + "epoch": 0.22085889570552147, + "grad_norm": 41.89399116746023, + "learning_rate": 4.6797520661157024e-07, + "logits/chosen": -0.2099609375, + "logits/rejected": -0.333984375, + "logps/chosen": -356.0, + "logps/rejected": -292.0, + "loss": 0.3137, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.2421875, + "rewards/margins": 4.34375, + "rewards/rejected": -3.09375, + "step": 180 + }, + { + "epoch": 0.22208588957055214, + "grad_norm": 44.979423553734385, + "learning_rate": 4.677685950413223e-07, + "logits/chosen": -0.1962890625, + "logits/rejected": -0.35546875, + "logps/chosen": -412.0, + "logps/rejected": -364.0, + "loss": 0.3496, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.4296875, + "rewards/margins": 4.625, + "rewards/rejected": -3.1875, + "step": 181 + }, + { + "epoch": 0.2233128834355828, + "grad_norm": 41.75351319386413, + "learning_rate": 4.6756198347107434e-07, + "logits/chosen": -0.2275390625, + "logits/rejected": -0.36328125, + "logps/chosen": -372.0, + "logps/rejected": -306.0, + "loss": 0.3303, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.921875, + "rewards/margins": 4.09375, + "rewards/rejected": -3.15625, + "step": 182 + }, + { + "epoch": 0.2245398773006135, + "grad_norm": 46.40866345124908, + "learning_rate": 4.6735537190082644e-07, + "logits/chosen": -0.11376953125, + "logits/rejected": -0.30078125, + "logps/chosen": -412.0, + "logps/rejected": -368.0, + "loss": 0.3255, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.984375, + "rewards/margins": 3.953125, + "rewards/rejected": -2.96875, + "step": 183 + }, + { + "epoch": 0.22576687116564417, + "grad_norm": 46.76226224495867, + "learning_rate": 4.671487603305785e-07, + "logits/chosen": -0.146484375, + "logits/rejected": -0.267578125, + "logps/chosen": -390.0, + "logps/rejected": -328.0, + "loss": 0.3388, + "rewards/accuracies": 0.765625, + "rewards/chosen": 0.78515625, + "rewards/margins": 3.984375, + "rewards/rejected": -3.1875, + "step": 184 + }, + { + "epoch": 0.22699386503067484, + "grad_norm": 48.77760268554608, + "learning_rate": 4.669421487603306e-07, + "logits/chosen": -0.19140625, + "logits/rejected": -0.263671875, + "logps/chosen": -384.0, + "logps/rejected": -340.0, + "loss": 0.3219, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.6328125, + "rewards/margins": 4.5, + "rewards/rejected": -2.859375, + "step": 185 + }, + { + "epoch": 0.2282208588957055, + "grad_norm": 38.08873895580722, + "learning_rate": 4.6673553719008263e-07, + "logits/chosen": -0.203125, + "logits/rejected": -0.33203125, + "logps/chosen": -338.0, + "logps/rejected": -300.0, + "loss": 0.2901, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.3203125, + "rewards/margins": 4.4375, + "rewards/rejected": -3.109375, + "step": 186 + }, + { + "epoch": 0.2294478527607362, + "grad_norm": 40.67564497850856, + "learning_rate": 4.665289256198347e-07, + "logits/chosen": -0.1884765625, + "logits/rejected": -0.357421875, + "logps/chosen": -374.0, + "logps/rejected": -326.0, + "loss": 0.2813, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.265625, + "rewards/margins": 4.625, + "rewards/rejected": -3.359375, + "step": 187 + }, + { + "epoch": 0.23067484662576687, + "grad_norm": 35.35467709831456, + "learning_rate": 4.663223140495868e-07, + "logits/chosen": -0.09716796875, + "logits/rejected": -0.189453125, + "logps/chosen": -332.0, + "logps/rejected": -280.0, + "loss": 0.2813, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.3046875, + "rewards/margins": 4.40625, + "rewards/rejected": -3.109375, + "step": 188 + }, + { + "epoch": 0.23190184049079754, + "grad_norm": 32.02217527416385, + "learning_rate": 4.661157024793388e-07, + "logits/chosen": -0.1787109375, + "logits/rejected": -0.369140625, + "logps/chosen": -400.0, + "logps/rejected": -308.0, + "loss": 0.2159, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.6015625, + "rewards/margins": 4.9375, + "rewards/rejected": -3.34375, + "step": 189 + }, + { + "epoch": 0.2331288343558282, + "grad_norm": 35.517601629388636, + "learning_rate": 4.6590909090909087e-07, + "logits/chosen": -0.08154296875, + "logits/rejected": -0.2490234375, + "logps/chosen": -344.0, + "logps/rejected": -300.0, + "loss": 0.2873, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.1015625, + "rewards/margins": 4.125, + "rewards/rejected": -3.03125, + "step": 190 + }, + { + "epoch": 0.2343558282208589, + "grad_norm": 46.62318205281028, + "learning_rate": 4.657024793388429e-07, + "logits/chosen": -0.1484375, + "logits/rejected": -0.33203125, + "logps/chosen": -402.0, + "logps/rejected": -288.0, + "loss": 0.3248, + "rewards/accuracies": 0.796875, + "rewards/chosen": 1.6953125, + "rewards/margins": 4.90625, + "rewards/rejected": -3.203125, + "step": 191 + }, + { + "epoch": 0.23558282208588957, + "grad_norm": 47.302561931824144, + "learning_rate": 4.65495867768595e-07, + "logits/chosen": -0.16015625, + "logits/rejected": -0.36328125, + "logps/chosen": -386.0, + "logps/rejected": -284.0, + "loss": 0.3212, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.265625, + "rewards/margins": 4.03125, + "rewards/rejected": -2.75, + "step": 192 + }, + { + "epoch": 0.23680981595092024, + "grad_norm": 38.194528570730164, + "learning_rate": 4.6528925619834707e-07, + "logits/chosen": -0.27734375, + "logits/rejected": -0.5234375, + "logps/chosen": -410.0, + "logps/rejected": -322.0, + "loss": 0.2332, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.7109375, + "rewards/margins": 5.03125, + "rewards/rejected": -3.3125, + "step": 193 + }, + { + "epoch": 0.23803680981595093, + "grad_norm": 42.44224201595828, + "learning_rate": 4.6508264462809917e-07, + "logits/chosen": -0.32421875, + "logits/rejected": -0.44921875, + "logps/chosen": -394.0, + "logps/rejected": -312.0, + "loss": 0.3223, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.953125, + "rewards/margins": 4.5625, + "rewards/rejected": -3.59375, + "step": 194 + }, + { + "epoch": 0.2392638036809816, + "grad_norm": 34.0790216803257, + "learning_rate": 4.648760330578512e-07, + "logits/chosen": -0.1396484375, + "logits/rejected": -0.40625, + "logps/chosen": -410.0, + "logps/rejected": -322.0, + "loss": 0.219, + "rewards/accuracies": 0.859375, + "rewards/chosen": 2.0, + "rewards/margins": 5.5, + "rewards/rejected": -3.5, + "step": 195 + }, + { + "epoch": 0.24049079754601227, + "grad_norm": 43.004434879940106, + "learning_rate": 4.646694214876033e-07, + "logits/chosen": -0.11962890625, + "logits/rejected": -0.3203125, + "logps/chosen": -392.0, + "logps/rejected": -282.0, + "loss": 0.3054, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.296875, + "rewards/margins": 4.3125, + "rewards/rejected": -3.0, + "step": 196 + }, + { + "epoch": 0.24171779141104294, + "grad_norm": 34.15269412729779, + "learning_rate": 4.6446280991735536e-07, + "logits/chosen": -0.2265625, + "logits/rejected": -0.47265625, + "logps/chosen": -378.0, + "logps/rejected": -308.0, + "loss": 0.2756, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.671875, + "rewards/margins": 4.75, + "rewards/rejected": -3.09375, + "step": 197 + }, + { + "epoch": 0.24294478527607363, + "grad_norm": 36.78925425492936, + "learning_rate": 4.6425619834710746e-07, + "logits/chosen": -0.1630859375, + "logits/rejected": -0.255859375, + "logps/chosen": -342.0, + "logps/rejected": -250.0, + "loss": 0.2945, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.1640625, + "rewards/margins": 4.09375, + "rewards/rejected": -2.9375, + "step": 198 + }, + { + "epoch": 0.2441717791411043, + "grad_norm": 28.311028034096932, + "learning_rate": 4.6404958677685945e-07, + "logits/chosen": -0.18359375, + "logits/rejected": -0.388671875, + "logps/chosen": -430.0, + "logps/rejected": -300.0, + "loss": 0.2045, + "rewards/accuracies": 0.921875, + "rewards/chosen": 2.171875, + "rewards/margins": 5.28125, + "rewards/rejected": -3.125, + "step": 199 + }, + { + "epoch": 0.24539877300613497, + "grad_norm": 44.46315305804351, + "learning_rate": 4.6384297520661155e-07, + "logits/chosen": -0.1591796875, + "logits/rejected": -0.3828125, + "logps/chosen": -434.0, + "logps/rejected": -358.0, + "loss": 0.303, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.9921875, + "rewards/margins": 4.8125, + "rewards/rejected": -2.8125, + "step": 200 + }, + { + "epoch": 0.24662576687116564, + "grad_norm": 32.929953461927006, + "learning_rate": 4.636363636363636e-07, + "logits/chosen": -0.171875, + "logits/rejected": -0.396484375, + "logps/chosen": -396.0, + "logps/rejected": -300.0, + "loss": 0.2219, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.8203125, + "rewards/margins": 4.78125, + "rewards/rejected": -2.953125, + "step": 201 + }, + { + "epoch": 0.24785276073619633, + "grad_norm": 38.191540513799985, + "learning_rate": 4.634297520661157e-07, + "logits/chosen": -0.1484375, + "logits/rejected": -0.359375, + "logps/chosen": -424.0, + "logps/rejected": -310.0, + "loss": 0.2735, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.9453125, + "rewards/margins": 4.75, + "rewards/rejected": -2.8125, + "step": 202 + }, + { + "epoch": 0.249079754601227, + "grad_norm": 43.899916034277716, + "learning_rate": 4.6322314049586775e-07, + "logits/chosen": -0.12158203125, + "logits/rejected": -0.30078125, + "logps/chosen": -386.0, + "logps/rejected": -328.0, + "loss": 0.3715, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.7265625, + "rewards/margins": 4.1875, + "rewards/rejected": -2.46875, + "step": 203 + }, + { + "epoch": 0.25030674846625767, + "grad_norm": 40.42534652251951, + "learning_rate": 4.630165289256198e-07, + "logits/chosen": -0.10498046875, + "logits/rejected": -0.2490234375, + "logps/chosen": -346.0, + "logps/rejected": -262.0, + "loss": 0.314, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.5234375, + "rewards/margins": 4.4375, + "rewards/rejected": -2.921875, + "step": 204 + }, + { + "epoch": 0.25153374233128833, + "grad_norm": 37.717470986712556, + "learning_rate": 4.628099173553719e-07, + "logits/chosen": -0.059326171875, + "logits/rejected": -0.2001953125, + "logps/chosen": -380.0, + "logps/rejected": -290.0, + "loss": 0.3111, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.7578125, + "rewards/margins": 4.1875, + "rewards/rejected": -2.4375, + "step": 205 + }, + { + "epoch": 0.252760736196319, + "grad_norm": 30.55406782868523, + "learning_rate": 4.6260330578512394e-07, + "logits/chosen": -0.1494140625, + "logits/rejected": -0.431640625, + "logps/chosen": -426.0, + "logps/rejected": -320.0, + "loss": 0.2196, + "rewards/accuracies": 0.90625, + "rewards/chosen": 2.0625, + "rewards/margins": 5.28125, + "rewards/rejected": -3.21875, + "step": 206 + }, + { + "epoch": 0.25398773006134967, + "grad_norm": 44.99416041741556, + "learning_rate": 4.6239669421487604e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.474609375, + "logps/chosen": -424.0, + "logps/rejected": -346.0, + "loss": 0.3683, + "rewards/accuracies": 0.7734375, + "rewards/chosen": 2.09375, + "rewards/margins": 4.65625, + "rewards/rejected": -2.5625, + "step": 207 + }, + { + "epoch": 0.2552147239263804, + "grad_norm": 38.298643600670886, + "learning_rate": 4.6219008264462804e-07, + "logits/chosen": -0.2451171875, + "logits/rejected": -0.376953125, + "logps/chosen": -386.0, + "logps/rejected": -312.0, + "loss": 0.3077, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.78125, + "rewards/margins": 4.78125, + "rewards/rejected": -2.984375, + "step": 208 + }, + { + "epoch": 0.25644171779141106, + "grad_norm": 42.08974951434723, + "learning_rate": 4.6198347107438014e-07, + "logits/chosen": -0.236328125, + "logits/rejected": -0.369140625, + "logps/chosen": -388.0, + "logps/rejected": -326.0, + "loss": 0.3252, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.6328125, + "rewards/margins": 4.46875, + "rewards/rejected": -2.84375, + "step": 209 + }, + { + "epoch": 0.25766871165644173, + "grad_norm": 49.252789458115785, + "learning_rate": 4.617768595041322e-07, + "logits/chosen": -0.19140625, + "logits/rejected": -0.306640625, + "logps/chosen": -390.0, + "logps/rejected": -354.0, + "loss": 0.3478, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.3359375, + "rewards/margins": 4.15625, + "rewards/rejected": -2.8125, + "step": 210 + }, + { + "epoch": 0.2588957055214724, + "grad_norm": 35.19521189692808, + "learning_rate": 4.615702479338843e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.474609375, + "logps/chosen": -430.0, + "logps/rejected": -336.0, + "loss": 0.2943, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.7421875, + "rewards/margins": 5.0, + "rewards/rejected": -3.25, + "step": 211 + }, + { + "epoch": 0.26012269938650306, + "grad_norm": 38.588101334546415, + "learning_rate": 4.6136363636363633e-07, + "logits/chosen": -0.205078125, + "logits/rejected": -0.373046875, + "logps/chosen": -396.0, + "logps/rejected": -304.0, + "loss": 0.2772, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.8671875, + "rewards/margins": 5.09375, + "rewards/rejected": -3.234375, + "step": 212 + }, + { + "epoch": 0.26134969325153373, + "grad_norm": 36.19543986527335, + "learning_rate": 4.6115702479338843e-07, + "logits/chosen": -0.1533203125, + "logits/rejected": -0.228515625, + "logps/chosen": -344.0, + "logps/rejected": -274.0, + "loss": 0.2568, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.25, + "rewards/margins": 4.28125, + "rewards/rejected": -3.015625, + "step": 213 + }, + { + "epoch": 0.2625766871165644, + "grad_norm": 36.76253302400916, + "learning_rate": 4.609504132231405e-07, + "logits/chosen": -0.130859375, + "logits/rejected": -0.3046875, + "logps/chosen": -370.0, + "logps/rejected": -306.0, + "loss": 0.2624, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.6953125, + "rewards/margins": 4.84375, + "rewards/rejected": -3.125, + "step": 214 + }, + { + "epoch": 0.26380368098159507, + "grad_norm": 37.194255093432446, + "learning_rate": 4.607438016528926e-07, + "logits/chosen": -0.111328125, + "logits/rejected": -0.2138671875, + "logps/chosen": -350.0, + "logps/rejected": -296.0, + "loss": 0.2725, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.1484375, + "rewards/margins": 4.25, + "rewards/rejected": -3.09375, + "step": 215 + }, + { + "epoch": 0.2650306748466258, + "grad_norm": 37.819502778321414, + "learning_rate": 4.605371900826446e-07, + "logits/chosen": -0.166015625, + "logits/rejected": -0.291015625, + "logps/chosen": -330.0, + "logps/rejected": -284.0, + "loss": 0.2757, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.921875, + "rewards/margins": 4.03125, + "rewards/rejected": -3.109375, + "step": 216 + }, + { + "epoch": 0.26625766871165646, + "grad_norm": 38.426937338322844, + "learning_rate": 4.6033057851239667e-07, + "logits/chosen": -0.072265625, + "logits/rejected": -0.224609375, + "logps/chosen": -398.0, + "logps/rejected": -298.0, + "loss": 0.3129, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.6875, + "rewards/margins": 4.59375, + "rewards/rejected": -2.890625, + "step": 217 + }, + { + "epoch": 0.2674846625766871, + "grad_norm": 48.711804010557216, + "learning_rate": 4.601239669421487e-07, + "logits/chosen": -0.12255859375, + "logits/rejected": -0.2412109375, + "logps/chosen": -380.0, + "logps/rejected": -326.0, + "loss": 0.3689, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.125, + "rewards/margins": 4.0625, + "rewards/rejected": -2.9375, + "step": 218 + }, + { + "epoch": 0.2687116564417178, + "grad_norm": 34.859463323248626, + "learning_rate": 4.599173553719008e-07, + "logits/chosen": -0.2158203125, + "logits/rejected": -0.328125, + "logps/chosen": -350.0, + "logps/rejected": -292.0, + "loss": 0.2779, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.09375, + "rewards/margins": 4.59375, + "rewards/rejected": -3.5, + "step": 219 + }, + { + "epoch": 0.26993865030674846, + "grad_norm": 46.80026994213379, + "learning_rate": 4.5971074380165287e-07, + "logits/chosen": -0.07568359375, + "logits/rejected": -0.1572265625, + "logps/chosen": -362.0, + "logps/rejected": -354.0, + "loss": 0.3534, + "rewards/accuracies": 0.765625, + "rewards/chosen": 0.79296875, + "rewards/margins": 3.765625, + "rewards/rejected": -2.96875, + "step": 220 + }, + { + "epoch": 0.27116564417177913, + "grad_norm": 44.236722785199355, + "learning_rate": 4.595041322314049e-07, + "logits/chosen": -0.1669921875, + "logits/rejected": -0.375, + "logps/chosen": -362.0, + "logps/rejected": -288.0, + "loss": 0.3432, + "rewards/accuracies": 0.7734375, + "rewards/chosen": 0.8125, + "rewards/margins": 4.28125, + "rewards/rejected": -3.46875, + "step": 221 + }, + { + "epoch": 0.2723926380368098, + "grad_norm": 37.55504945465003, + "learning_rate": 4.59297520661157e-07, + "logits/chosen": -0.33203125, + "logits/rejected": -0.482421875, + "logps/chosen": -386.0, + "logps/rejected": -298.0, + "loss": 0.2529, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.5703125, + "rewards/margins": 5.46875, + "rewards/rejected": -3.890625, + "step": 222 + }, + { + "epoch": 0.27361963190184047, + "grad_norm": 51.564475699604486, + "learning_rate": 4.5909090909090906e-07, + "logits/chosen": -0.154296875, + "logits/rejected": -0.33984375, + "logps/chosen": -386.0, + "logps/rejected": -316.0, + "loss": 0.3058, + "rewards/accuracies": 0.796875, + "rewards/chosen": 0.953125, + "rewards/margins": 4.25, + "rewards/rejected": -3.3125, + "step": 223 + }, + { + "epoch": 0.2748466257668712, + "grad_norm": 43.15791338185834, + "learning_rate": 4.5888429752066116e-07, + "logits/chosen": -0.248046875, + "logits/rejected": -0.435546875, + "logps/chosen": -450.0, + "logps/rejected": -332.0, + "loss": 0.2807, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.4609375, + "rewards/margins": 5.28125, + "rewards/rejected": -3.84375, + "step": 224 + }, + { + "epoch": 0.27607361963190186, + "grad_norm": 35.879838019408076, + "learning_rate": 4.586776859504132e-07, + "logits/chosen": -0.1279296875, + "logits/rejected": -0.328125, + "logps/chosen": -340.0, + "logps/rejected": -300.0, + "loss": 0.2506, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.92578125, + "rewards/margins": 4.84375, + "rewards/rejected": -3.921875, + "step": 225 + }, + { + "epoch": 0.2773006134969325, + "grad_norm": 44.55257679536464, + "learning_rate": 4.5847107438016525e-07, + "logits/chosen": -0.142578125, + "logits/rejected": -0.287109375, + "logps/chosen": -374.0, + "logps/rejected": -308.0, + "loss": 0.3177, + "rewards/accuracies": 0.78125, + "rewards/chosen": 1.203125, + "rewards/margins": 4.78125, + "rewards/rejected": -3.59375, + "step": 226 + }, + { + "epoch": 0.2785276073619632, + "grad_norm": 43.069867055252956, + "learning_rate": 4.582644628099173e-07, + "logits/chosen": -0.17578125, + "logits/rejected": -0.259765625, + "logps/chosen": -360.0, + "logps/rejected": -312.0, + "loss": 0.2933, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.95703125, + "rewards/margins": 4.84375, + "rewards/rejected": -3.875, + "step": 227 + }, + { + "epoch": 0.27975460122699386, + "grad_norm": 59.89729428981541, + "learning_rate": 4.580578512396694e-07, + "logits/chosen": -0.185546875, + "logits/rejected": -0.375, + "logps/chosen": -366.0, + "logps/rejected": -320.0, + "loss": 0.324, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.62109375, + "rewards/margins": 4.34375, + "rewards/rejected": -3.703125, + "step": 228 + }, + { + "epoch": 0.2809815950920245, + "grad_norm": 41.26714714905276, + "learning_rate": 4.5785123966942145e-07, + "logits/chosen": -0.1025390625, + "logits/rejected": -0.310546875, + "logps/chosen": -424.0, + "logps/rejected": -332.0, + "loss": 0.27, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.484375, + "rewards/margins": 4.65625, + "rewards/rejected": -3.171875, + "step": 229 + }, + { + "epoch": 0.2822085889570552, + "grad_norm": 33.72568576392679, + "learning_rate": 4.5764462809917355e-07, + "logits/chosen": -0.08935546875, + "logits/rejected": -0.28125, + "logps/chosen": -376.0, + "logps/rejected": -318.0, + "loss": 0.235, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.9765625, + "rewards/margins": 4.71875, + "rewards/rejected": -3.75, + "step": 230 + }, + { + "epoch": 0.28343558282208586, + "grad_norm": 42.97736121941397, + "learning_rate": 4.574380165289256e-07, + "logits/chosen": -0.1689453125, + "logits/rejected": -0.287109375, + "logps/chosen": -370.0, + "logps/rejected": -306.0, + "loss": 0.3436, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.0234375, + "rewards/margins": 4.3125, + "rewards/rejected": -3.296875, + "step": 231 + }, + { + "epoch": 0.2846625766871166, + "grad_norm": 42.93355591121654, + "learning_rate": 4.572314049586777e-07, + "logits/chosen": -0.2314453125, + "logits/rejected": -0.373046875, + "logps/chosen": -386.0, + "logps/rejected": -330.0, + "loss": 0.3127, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.5546875, + "rewards/margins": 4.3125, + "rewards/rejected": -3.75, + "step": 232 + }, + { + "epoch": 0.28588957055214725, + "grad_norm": 37.7852023248725, + "learning_rate": 4.5702479338842974e-07, + "logits/chosen": -0.1318359375, + "logits/rejected": -0.361328125, + "logps/chosen": -374.0, + "logps/rejected": -286.0, + "loss": 0.2759, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.21875, + "rewards/margins": 5.03125, + "rewards/rejected": -3.8125, + "step": 233 + }, + { + "epoch": 0.2871165644171779, + "grad_norm": 38.62852043438936, + "learning_rate": 4.5681818181818184e-07, + "logits/chosen": -0.267578125, + "logits/rejected": -0.400390625, + "logps/chosen": -374.0, + "logps/rejected": -310.0, + "loss": 0.2764, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.1640625, + "rewards/margins": 4.75, + "rewards/rejected": -3.578125, + "step": 234 + }, + { + "epoch": 0.2883435582822086, + "grad_norm": 37.335415454122945, + "learning_rate": 4.5661157024793384e-07, + "logits/chosen": -0.283203125, + "logits/rejected": -0.439453125, + "logps/chosen": -362.0, + "logps/rejected": -316.0, + "loss": 0.2629, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.1953125, + "rewards/margins": 4.84375, + "rewards/rejected": -3.640625, + "step": 235 + }, + { + "epoch": 0.28957055214723926, + "grad_norm": 55.00073114295456, + "learning_rate": 4.5640495867768594e-07, + "logits/chosen": -0.04736328125, + "logits/rejected": -0.232421875, + "logps/chosen": -398.0, + "logps/rejected": -364.0, + "loss": 0.374, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.6015625, + "rewards/margins": 4.46875, + "rewards/rejected": -2.859375, + "step": 236 + }, + { + "epoch": 0.2907975460122699, + "grad_norm": 34.92202343855084, + "learning_rate": 4.56198347107438e-07, + "logits/chosen": -0.189453125, + "logits/rejected": -0.34375, + "logps/chosen": -370.0, + "logps/rejected": -302.0, + "loss": 0.252, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.3515625, + "rewards/margins": 4.9375, + "rewards/rejected": -3.578125, + "step": 237 + }, + { + "epoch": 0.2920245398773006, + "grad_norm": 42.067317323205096, + "learning_rate": 4.559917355371901e-07, + "logits/chosen": -0.205078125, + "logits/rejected": -0.3671875, + "logps/chosen": -426.0, + "logps/rejected": -346.0, + "loss": 0.3198, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.4453125, + "rewards/margins": 4.78125, + "rewards/rejected": -3.34375, + "step": 238 + }, + { + "epoch": 0.29325153374233126, + "grad_norm": 41.04109475522015, + "learning_rate": 4.5578512396694213e-07, + "logits/chosen": -0.21484375, + "logits/rejected": -0.408203125, + "logps/chosen": -384.0, + "logps/rejected": -304.0, + "loss": 0.3007, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.78125, + "rewards/margins": 5.28125, + "rewards/rejected": -3.515625, + "step": 239 + }, + { + "epoch": 0.294478527607362, + "grad_norm": 42.47439204624692, + "learning_rate": 4.555785123966942e-07, + "logits/chosen": -0.2265625, + "logits/rejected": -0.380859375, + "logps/chosen": -422.0, + "logps/rejected": -352.0, + "loss": 0.2516, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.6171875, + "rewards/margins": 5.46875, + "rewards/rejected": -3.859375, + "step": 240 + }, + { + "epoch": 0.29570552147239265, + "grad_norm": 38.63581064698526, + "learning_rate": 4.553719008264463e-07, + "logits/chosen": -0.169921875, + "logits/rejected": -0.306640625, + "logps/chosen": -366.0, + "logps/rejected": -326.0, + "loss": 0.2718, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.7109375, + "rewards/margins": 5.21875, + "rewards/rejected": -3.5, + "step": 241 + }, + { + "epoch": 0.2969325153374233, + "grad_norm": 31.580876023766372, + "learning_rate": 4.551652892561983e-07, + "logits/chosen": -0.1826171875, + "logits/rejected": -0.349609375, + "logps/chosen": -350.0, + "logps/rejected": -310.0, + "loss": 0.2369, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.171875, + "rewards/margins": 5.21875, + "rewards/rejected": -4.03125, + "step": 242 + }, + { + "epoch": 0.298159509202454, + "grad_norm": 38.48835239358082, + "learning_rate": 4.5495867768595037e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.4140625, + "logps/chosen": -392.0, + "logps/rejected": -358.0, + "loss": 0.2935, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.1171875, + "rewards/margins": 4.78125, + "rewards/rejected": -3.671875, + "step": 243 + }, + { + "epoch": 0.29938650306748466, + "grad_norm": 41.633020456629765, + "learning_rate": 4.547520661157024e-07, + "logits/chosen": -0.25390625, + "logits/rejected": -0.47265625, + "logps/chosen": -386.0, + "logps/rejected": -340.0, + "loss": 0.3582, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.140625, + "rewards/margins": 4.65625, + "rewards/rejected": -3.5, + "step": 244 + }, + { + "epoch": 0.3006134969325153, + "grad_norm": 36.05397433070667, + "learning_rate": 4.545454545454545e-07, + "logits/chosen": -0.220703125, + "logits/rejected": -0.369140625, + "logps/chosen": -404.0, + "logps/rejected": -344.0, + "loss": 0.234, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.4453125, + "rewards/margins": 5.09375, + "rewards/rejected": -3.65625, + "step": 245 + }, + { + "epoch": 0.301840490797546, + "grad_norm": 38.58934325410754, + "learning_rate": 4.5433884297520657e-07, + "logits/chosen": -0.224609375, + "logits/rejected": -0.390625, + "logps/chosen": -378.0, + "logps/rejected": -338.0, + "loss": 0.2805, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.765625, + "rewards/margins": 5.40625, + "rewards/rejected": -3.65625, + "step": 246 + }, + { + "epoch": 0.3030674846625767, + "grad_norm": 46.170807958237866, + "learning_rate": 4.5413223140495867e-07, + "logits/chosen": -0.224609375, + "logits/rejected": -0.408203125, + "logps/chosen": -376.0, + "logps/rejected": -298.0, + "loss": 0.3061, + "rewards/accuracies": 0.796875, + "rewards/chosen": 0.875, + "rewards/margins": 4.71875, + "rewards/rejected": -3.828125, + "step": 247 + }, + { + "epoch": 0.3042944785276074, + "grad_norm": 40.70518240157979, + "learning_rate": 4.539256198347107e-07, + "logits/chosen": -0.1474609375, + "logits/rejected": -0.396484375, + "logps/chosen": -394.0, + "logps/rejected": -324.0, + "loss": 0.2562, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.234375, + "rewards/margins": 4.71875, + "rewards/rejected": -3.46875, + "step": 248 + }, + { + "epoch": 0.30552147239263805, + "grad_norm": 43.152905506219625, + "learning_rate": 4.537190082644628e-07, + "logits/chosen": -0.26953125, + "logits/rejected": -0.466796875, + "logps/chosen": -480.0, + "logps/rejected": -362.0, + "loss": 0.274, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.9375, + "rewards/margins": 5.5625, + "rewards/rejected": -3.625, + "step": 249 + }, + { + "epoch": 0.3067484662576687, + "grad_norm": 39.51182461700564, + "learning_rate": 4.5351239669421486e-07, + "logits/chosen": -0.349609375, + "logits/rejected": -0.423828125, + "logps/chosen": -342.0, + "logps/rejected": -316.0, + "loss": 0.2913, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.97265625, + "rewards/margins": 4.59375, + "rewards/rejected": -3.625, + "step": 250 + }, + { + "epoch": 0.3079754601226994, + "grad_norm": 47.42800586657486, + "learning_rate": 4.5330578512396696e-07, + "logits/chosen": -0.055908203125, + "logits/rejected": -0.228515625, + "logps/chosen": -378.0, + "logps/rejected": -298.0, + "loss": 0.3574, + "rewards/accuracies": 0.765625, + "rewards/chosen": 1.1171875, + "rewards/margins": 4.1875, + "rewards/rejected": -3.046875, + "step": 251 + }, + { + "epoch": 0.30920245398773005, + "grad_norm": 38.9167492571078, + "learning_rate": 4.5309917355371896e-07, + "logits/chosen": -0.2216796875, + "logits/rejected": -0.37109375, + "logps/chosen": -396.0, + "logps/rejected": -304.0, + "loss": 0.2806, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.5078125, + "rewards/margins": 4.75, + "rewards/rejected": -3.234375, + "step": 252 + }, + { + "epoch": 0.3104294478527607, + "grad_norm": 31.88015147725951, + "learning_rate": 4.5289256198347106e-07, + "logits/chosen": -0.22265625, + "logits/rejected": -0.453125, + "logps/chosen": -340.0, + "logps/rejected": -288.0, + "loss": 0.2435, + "rewards/accuracies": 0.90625, + "rewards/chosen": 1.109375, + "rewards/margins": 4.78125, + "rewards/rejected": -3.6875, + "step": 253 + }, + { + "epoch": 0.3116564417177914, + "grad_norm": 41.38320327055996, + "learning_rate": 4.526859504132231e-07, + "logits/chosen": -0.166015625, + "logits/rejected": -0.328125, + "logps/chosen": -356.0, + "logps/rejected": -312.0, + "loss": 0.3288, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.3515625, + "rewards/margins": 4.84375, + "rewards/rejected": -3.46875, + "step": 254 + }, + { + "epoch": 0.3128834355828221, + "grad_norm": 39.369898300453734, + "learning_rate": 4.524793388429752e-07, + "logits/chosen": -0.1572265625, + "logits/rejected": -0.318359375, + "logps/chosen": -386.0, + "logps/rejected": -304.0, + "loss": 0.3362, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.5625, + "rewards/margins": 4.59375, + "rewards/rejected": -3.046875, + "step": 255 + }, + { + "epoch": 0.3141104294478528, + "grad_norm": 32.76851278241994, + "learning_rate": 4.5227272727272725e-07, + "logits/chosen": -0.20703125, + "logits/rejected": -0.376953125, + "logps/chosen": -350.0, + "logps/rejected": -304.0, + "loss": 0.2341, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.9765625, + "rewards/margins": 5.40625, + "rewards/rejected": -3.4375, + "step": 256 + }, + { + "epoch": 0.31533742331288345, + "grad_norm": 45.250746891569236, + "learning_rate": 4.520661157024793e-07, + "logits/chosen": -0.2080078125, + "logits/rejected": -0.359375, + "logps/chosen": -430.0, + "logps/rejected": -344.0, + "loss": 0.3181, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.7734375, + "rewards/margins": 4.875, + "rewards/rejected": -3.109375, + "step": 257 + }, + { + "epoch": 0.3165644171779141, + "grad_norm": 35.04986410208359, + "learning_rate": 4.518595041322314e-07, + "logits/chosen": -0.1552734375, + "logits/rejected": -0.33984375, + "logps/chosen": -400.0, + "logps/rejected": -326.0, + "loss": 0.2317, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.59375, + "rewards/margins": 4.90625, + "rewards/rejected": -3.296875, + "step": 258 + }, + { + "epoch": 0.3177914110429448, + "grad_norm": 34.37988001182442, + "learning_rate": 4.5165289256198344e-07, + "logits/chosen": -0.2099609375, + "logits/rejected": -0.404296875, + "logps/chosen": -346.0, + "logps/rejected": -338.0, + "loss": 0.2627, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.1953125, + "rewards/margins": 4.625, + "rewards/rejected": -3.40625, + "step": 259 + }, + { + "epoch": 0.31901840490797545, + "grad_norm": 39.73259510340199, + "learning_rate": 4.5144628099173554e-07, + "logits/chosen": -0.2353515625, + "logits/rejected": -0.326171875, + "logps/chosen": -388.0, + "logps/rejected": -306.0, + "loss": 0.2938, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.375, + "rewards/margins": 4.53125, + "rewards/rejected": -3.171875, + "step": 260 + }, + { + "epoch": 0.3202453987730061, + "grad_norm": 42.63140351827292, + "learning_rate": 4.5123966942148754e-07, + "logits/chosen": -0.1708984375, + "logits/rejected": -0.322265625, + "logps/chosen": -378.0, + "logps/rejected": -308.0, + "loss": 0.2956, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.4453125, + "rewards/margins": 4.65625, + "rewards/rejected": -3.203125, + "step": 261 + }, + { + "epoch": 0.3214723926380368, + "grad_norm": 48.00556286038852, + "learning_rate": 4.5103305785123964e-07, + "logits/chosen": -0.2109375, + "logits/rejected": -0.40234375, + "logps/chosen": -384.0, + "logps/rejected": -320.0, + "loss": 0.3166, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.9609375, + "rewards/margins": 5.03125, + "rewards/rejected": -3.0625, + "step": 262 + }, + { + "epoch": 0.3226993865030675, + "grad_norm": 41.40798456165999, + "learning_rate": 4.508264462809917e-07, + "logits/chosen": -0.197265625, + "logits/rejected": -0.32421875, + "logps/chosen": -366.0, + "logps/rejected": -302.0, + "loss": 0.2953, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.125, + "rewards/margins": 4.03125, + "rewards/rejected": -2.921875, + "step": 263 + }, + { + "epoch": 0.3239263803680982, + "grad_norm": 39.73351721310888, + "learning_rate": 4.506198347107438e-07, + "logits/chosen": -0.1611328125, + "logits/rejected": -0.275390625, + "logps/chosen": -350.0, + "logps/rejected": -286.0, + "loss": 0.3138, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.3359375, + "rewards/margins": 4.3125, + "rewards/rejected": -2.96875, + "step": 264 + }, + { + "epoch": 0.32515337423312884, + "grad_norm": 39.72934408632108, + "learning_rate": 4.5041322314049583e-07, + "logits/chosen": -0.166015625, + "logits/rejected": -0.326171875, + "logps/chosen": -354.0, + "logps/rejected": -262.0, + "loss": 0.2712, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.3359375, + "rewards/margins": 4.53125, + "rewards/rejected": -3.1875, + "step": 265 + }, + { + "epoch": 0.3263803680981595, + "grad_norm": 47.72732688002189, + "learning_rate": 4.5020661157024793e-07, + "logits/chosen": -0.142578125, + "logits/rejected": -0.291015625, + "logps/chosen": -316.0, + "logps/rejected": -290.0, + "loss": 0.3794, + "rewards/accuracies": 0.7734375, + "rewards/chosen": 0.64453125, + "rewards/margins": 3.625, + "rewards/rejected": -2.984375, + "step": 266 + }, + { + "epoch": 0.3276073619631902, + "grad_norm": 52.825089270201424, + "learning_rate": 4.5e-07, + "logits/chosen": -0.16796875, + "logits/rejected": -0.384765625, + "logps/chosen": -400.0, + "logps/rejected": -294.0, + "loss": 0.3429, + "rewards/accuracies": 0.796875, + "rewards/chosen": 1.6796875, + "rewards/margins": 4.40625, + "rewards/rejected": -2.734375, + "step": 267 + }, + { + "epoch": 0.32883435582822085, + "grad_norm": 35.92749837261359, + "learning_rate": 4.497933884297521e-07, + "logits/chosen": -0.306640625, + "logits/rejected": -0.419921875, + "logps/chosen": -384.0, + "logps/rejected": -308.0, + "loss": 0.2275, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.5078125, + "rewards/margins": 4.625, + "rewards/rejected": -3.109375, + "step": 268 + }, + { + "epoch": 0.3300613496932515, + "grad_norm": 35.81499005195925, + "learning_rate": 4.4958677685950413e-07, + "logits/chosen": -0.203125, + "logits/rejected": -0.50390625, + "logps/chosen": -402.0, + "logps/rejected": -290.0, + "loss": 0.2385, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.6796875, + "rewards/margins": 4.90625, + "rewards/rejected": -3.25, + "step": 269 + }, + { + "epoch": 0.3312883435582822, + "grad_norm": 44.38655671717473, + "learning_rate": 4.493801652892562e-07, + "logits/chosen": -0.2109375, + "logits/rejected": -0.328125, + "logps/chosen": -326.0, + "logps/rejected": -282.0, + "loss": 0.345, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.15625, + "rewards/margins": 3.71875, + "rewards/rejected": -2.5625, + "step": 270 + }, + { + "epoch": 0.3325153374233129, + "grad_norm": 34.101391505637224, + "learning_rate": 4.491735537190082e-07, + "logits/chosen": -0.22265625, + "logits/rejected": -0.341796875, + "logps/chosen": -384.0, + "logps/rejected": -312.0, + "loss": 0.2456, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 2.078125, + "rewards/margins": 4.875, + "rewards/rejected": -2.796875, + "step": 271 + }, + { + "epoch": 0.3337423312883436, + "grad_norm": 36.8738947032395, + "learning_rate": 4.489669421487603e-07, + "logits/chosen": -0.12353515625, + "logits/rejected": -0.291015625, + "logps/chosen": -358.0, + "logps/rejected": -284.0, + "loss": 0.2495, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.25, + "rewards/margins": 4.21875, + "rewards/rejected": -2.984375, + "step": 272 + }, + { + "epoch": 0.33496932515337424, + "grad_norm": 44.70898948794442, + "learning_rate": 4.4876033057851237e-07, + "logits/chosen": -0.07470703125, + "logits/rejected": -0.1611328125, + "logps/chosen": -334.0, + "logps/rejected": -286.0, + "loss": 0.3884, + "rewards/accuracies": 0.78125, + "rewards/chosen": 1.1796875, + "rewards/margins": 3.90625, + "rewards/rejected": -2.734375, + "step": 273 + }, + { + "epoch": 0.3361963190184049, + "grad_norm": 42.40600245146773, + "learning_rate": 4.4855371900826447e-07, + "logits/chosen": -0.0927734375, + "logits/rejected": -0.2421875, + "logps/chosen": -400.0, + "logps/rejected": -316.0, + "loss": 0.3338, + "rewards/accuracies": 0.796875, + "rewards/chosen": 1.8046875, + "rewards/margins": 4.28125, + "rewards/rejected": -2.484375, + "step": 274 + }, + { + "epoch": 0.3374233128834356, + "grad_norm": 40.8103963168886, + "learning_rate": 4.483471074380165e-07, + "logits/chosen": -0.1552734375, + "logits/rejected": -0.263671875, + "logps/chosen": -316.0, + "logps/rejected": -296.0, + "loss": 0.2999, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.4765625, + "rewards/margins": 4.15625, + "rewards/rejected": -2.6875, + "step": 275 + }, + { + "epoch": 0.33865030674846625, + "grad_norm": 31.049107272836952, + "learning_rate": 4.4814049586776856e-07, + "logits/chosen": -0.08154296875, + "logits/rejected": -0.291015625, + "logps/chosen": -376.0, + "logps/rejected": -298.0, + "loss": 0.2799, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.5703125, + "rewards/margins": 4.3125, + "rewards/rejected": -2.75, + "step": 276 + }, + { + "epoch": 0.3398773006134969, + "grad_norm": 32.630832893605, + "learning_rate": 4.4793388429752066e-07, + "logits/chosen": -0.244140625, + "logits/rejected": -0.443359375, + "logps/chosen": -404.0, + "logps/rejected": -312.0, + "loss": 0.2319, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 2.171875, + "rewards/margins": 5.1875, + "rewards/rejected": -3.0, + "step": 277 + }, + { + "epoch": 0.3411042944785276, + "grad_norm": 44.309610437735856, + "learning_rate": 4.477272727272727e-07, + "logits/chosen": -0.1689453125, + "logits/rejected": -0.2373046875, + "logps/chosen": -376.0, + "logps/rejected": -328.0, + "loss": 0.2724, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.640625, + "rewards/margins": 4.46875, + "rewards/rejected": -2.828125, + "step": 278 + }, + { + "epoch": 0.3423312883435583, + "grad_norm": 26.353655721882397, + "learning_rate": 4.4752066115702476e-07, + "logits/chosen": -0.21484375, + "logits/rejected": -0.400390625, + "logps/chosen": -380.0, + "logps/rejected": -290.0, + "loss": 0.1863, + "rewards/accuracies": 0.9453125, + "rewards/chosen": 1.7578125, + "rewards/margins": 4.96875, + "rewards/rejected": -3.21875, + "step": 279 + }, + { + "epoch": 0.34355828220858897, + "grad_norm": 44.718053283042785, + "learning_rate": 4.473140495867768e-07, + "logits/chosen": -0.2001953125, + "logits/rejected": -0.365234375, + "logps/chosen": -396.0, + "logps/rejected": -342.0, + "loss": 0.3351, + "rewards/accuracies": 0.7734375, + "rewards/chosen": 1.953125, + "rewards/margins": 5.125, + "rewards/rejected": -3.171875, + "step": 280 + }, + { + "epoch": 0.34478527607361964, + "grad_norm": 42.34591075354157, + "learning_rate": 4.471074380165289e-07, + "logits/chosen": -0.1484375, + "logits/rejected": -0.34765625, + "logps/chosen": -374.0, + "logps/rejected": -306.0, + "loss": 0.3447, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.4375, + "rewards/margins": 4.125, + "rewards/rejected": -2.6875, + "step": 281 + }, + { + "epoch": 0.3460122699386503, + "grad_norm": 41.75221231669429, + "learning_rate": 4.4690082644628095e-07, + "logits/chosen": -0.30859375, + "logits/rejected": -0.46875, + "logps/chosen": -336.0, + "logps/rejected": -298.0, + "loss": 0.2518, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.71875, + "rewards/margins": 5.25, + "rewards/rejected": -3.515625, + "step": 282 + }, + { + "epoch": 0.347239263803681, + "grad_norm": 33.916128769423274, + "learning_rate": 4.4669421487603305e-07, + "logits/chosen": -0.3359375, + "logits/rejected": -0.44921875, + "logps/chosen": -348.0, + "logps/rejected": -274.0, + "loss": 0.2746, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.3203125, + "rewards/margins": 4.375, + "rewards/rejected": -3.046875, + "step": 283 + }, + { + "epoch": 0.34846625766871164, + "grad_norm": 35.84425714657199, + "learning_rate": 4.464876033057851e-07, + "logits/chosen": -0.1572265625, + "logits/rejected": -0.3046875, + "logps/chosen": -364.0, + "logps/rejected": -294.0, + "loss": 0.2426, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.484375, + "rewards/margins": 4.78125, + "rewards/rejected": -3.296875, + "step": 284 + }, + { + "epoch": 0.3496932515337423, + "grad_norm": 31.897221284753925, + "learning_rate": 4.462809917355372e-07, + "logits/chosen": -0.2373046875, + "logits/rejected": -0.453125, + "logps/chosen": -354.0, + "logps/rejected": -304.0, + "loss": 0.2458, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.5078125, + "rewards/margins": 5.03125, + "rewards/rejected": -3.515625, + "step": 285 + }, + { + "epoch": 0.350920245398773, + "grad_norm": 40.0301906925459, + "learning_rate": 4.4607438016528924e-07, + "logits/chosen": -0.1708984375, + "logits/rejected": -0.3828125, + "logps/chosen": -414.0, + "logps/rejected": -332.0, + "loss": 0.3071, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.5234375, + "rewards/margins": 5.21875, + "rewards/rejected": -3.703125, + "step": 286 + }, + { + "epoch": 0.3521472392638037, + "grad_norm": 50.881866049082234, + "learning_rate": 4.4586776859504135e-07, + "logits/chosen": -0.26171875, + "logits/rejected": -0.419921875, + "logps/chosen": -376.0, + "logps/rejected": -308.0, + "loss": 0.288, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.0703125, + "rewards/margins": 4.625, + "rewards/rejected": -3.546875, + "step": 287 + }, + { + "epoch": 0.35337423312883437, + "grad_norm": 37.27905667507029, + "learning_rate": 4.4566115702479334e-07, + "logits/chosen": -0.08642578125, + "logits/rejected": -0.2392578125, + "logps/chosen": -380.0, + "logps/rejected": -312.0, + "loss": 0.2887, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.99609375, + "rewards/margins": 4.25, + "rewards/rejected": -3.265625, + "step": 288 + }, + { + "epoch": 0.35460122699386504, + "grad_norm": 38.51669077378738, + "learning_rate": 4.4545454545454544e-07, + "logits/chosen": -0.2158203125, + "logits/rejected": -0.357421875, + "logps/chosen": -398.0, + "logps/rejected": -302.0, + "loss": 0.2274, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.484375, + "rewards/margins": 5.4375, + "rewards/rejected": -3.9375, + "step": 289 + }, + { + "epoch": 0.3558282208588957, + "grad_norm": 39.101756003947045, + "learning_rate": 4.452479338842975e-07, + "logits/chosen": -0.3828125, + "logits/rejected": -0.53125, + "logps/chosen": -372.0, + "logps/rejected": -324.0, + "loss": 0.197, + "rewards/accuracies": 0.921875, + "rewards/chosen": 1.375, + "rewards/margins": 5.65625, + "rewards/rejected": -4.28125, + "step": 290 + }, + { + "epoch": 0.3570552147239264, + "grad_norm": 35.84563757340601, + "learning_rate": 4.450413223140496e-07, + "logits/chosen": -0.3125, + "logits/rejected": -0.44921875, + "logps/chosen": -390.0, + "logps/rejected": -320.0, + "loss": 0.264, + "rewards/accuracies": 0.828125, + "rewards/chosen": 2.03125, + "rewards/margins": 5.5625, + "rewards/rejected": -3.515625, + "step": 291 + }, + { + "epoch": 0.35828220858895704, + "grad_norm": 48.83799779484981, + "learning_rate": 4.4483471074380163e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.5078125, + "logps/chosen": -402.0, + "logps/rejected": -324.0, + "loss": 0.2282, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.15625, + "rewards/margins": 5.125, + "rewards/rejected": -3.96875, + "step": 292 + }, + { + "epoch": 0.3595092024539877, + "grad_norm": 33.24417072591366, + "learning_rate": 4.446280991735537e-07, + "logits/chosen": -0.2080078125, + "logits/rejected": -0.400390625, + "logps/chosen": -376.0, + "logps/rejected": -306.0, + "loss": 0.236, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 0.74609375, + "rewards/margins": 4.90625, + "rewards/rejected": -4.15625, + "step": 293 + }, + { + "epoch": 0.36073619631901843, + "grad_norm": 33.17016716719111, + "learning_rate": 4.444214876033058e-07, + "logits/chosen": -0.443359375, + "logits/rejected": -0.59765625, + "logps/chosen": -464.0, + "logps/rejected": -342.0, + "loss": 0.2358, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.3828125, + "rewards/margins": 5.84375, + "rewards/rejected": -4.46875, + "step": 294 + }, + { + "epoch": 0.3619631901840491, + "grad_norm": 41.08997488080215, + "learning_rate": 4.4421487603305783e-07, + "logits/chosen": -0.1689453125, + "logits/rejected": -0.3203125, + "logps/chosen": -350.0, + "logps/rejected": -308.0, + "loss": 0.2229, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.81640625, + "rewards/margins": 5.0, + "rewards/rejected": -4.1875, + "step": 295 + }, + { + "epoch": 0.36319018404907977, + "grad_norm": 36.46585175010118, + "learning_rate": 4.4400826446280993e-07, + "logits/chosen": -0.14453125, + "logits/rejected": -0.30859375, + "logps/chosen": -418.0, + "logps/rejected": -320.0, + "loss": 0.2845, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.421875, + "rewards/margins": 5.03125, + "rewards/rejected": -3.609375, + "step": 296 + }, + { + "epoch": 0.36441717791411044, + "grad_norm": 30.507553736995185, + "learning_rate": 4.438016528925619e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.447265625, + "logps/chosen": -356.0, + "logps/rejected": -300.0, + "loss": 0.2352, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.203125, + "rewards/margins": 5.125, + "rewards/rejected": -3.9375, + "step": 297 + }, + { + "epoch": 0.3656441717791411, + "grad_norm": 42.744426202574054, + "learning_rate": 4.43595041322314e-07, + "logits/chosen": -0.1513671875, + "logits/rejected": -0.2578125, + "logps/chosen": -380.0, + "logps/rejected": -316.0, + "loss": 0.2875, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.9609375, + "rewards/margins": 4.53125, + "rewards/rejected": -3.5625, + "step": 298 + }, + { + "epoch": 0.36687116564417177, + "grad_norm": 57.11420288456295, + "learning_rate": 4.4338842975206607e-07, + "logits/chosen": -0.189453125, + "logits/rejected": -0.3671875, + "logps/chosen": -392.0, + "logps/rejected": -312.0, + "loss": 0.3303, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.53515625, + "rewards/margins": 4.40625, + "rewards/rejected": -3.859375, + "step": 299 + }, + { + "epoch": 0.36809815950920244, + "grad_norm": 44.0642342343628, + "learning_rate": 4.4318181818181817e-07, + "logits/chosen": -0.2890625, + "logits/rejected": -0.451171875, + "logps/chosen": -364.0, + "logps/rejected": -306.0, + "loss": 0.2951, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.1328125, + "rewards/margins": 5.15625, + "rewards/rejected": -4.03125, + "step": 300 + }, + { + "epoch": 0.3693251533742331, + "grad_norm": 36.50971474693751, + "learning_rate": 4.429752066115702e-07, + "logits/chosen": -0.2314453125, + "logits/rejected": -0.4296875, + "logps/chosen": -454.0, + "logps/rejected": -362.0, + "loss": 0.2791, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.546875, + "rewards/margins": 5.53125, + "rewards/rejected": -3.984375, + "step": 301 + }, + { + "epoch": 0.37055214723926383, + "grad_norm": 31.988576378738134, + "learning_rate": 4.427685950413223e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.46875, + "logps/chosen": -374.0, + "logps/rejected": -292.0, + "loss": 0.2208, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.0859375, + "rewards/margins": 5.0625, + "rewards/rejected": -3.984375, + "step": 302 + }, + { + "epoch": 0.3717791411042945, + "grad_norm": 46.63040649021854, + "learning_rate": 4.4256198347107436e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.390625, + "logps/chosen": -378.0, + "logps/rejected": -350.0, + "loss": 0.3215, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.625, + "rewards/margins": 4.75, + "rewards/rejected": -4.125, + "step": 303 + }, + { + "epoch": 0.37300613496932516, + "grad_norm": 38.26286144297621, + "learning_rate": 4.4235537190082646e-07, + "logits/chosen": -0.162109375, + "logits/rejected": -0.412109375, + "logps/chosen": -384.0, + "logps/rejected": -306.0, + "loss": 0.244, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.109375, + "rewards/margins": 5.28125, + "rewards/rejected": -4.15625, + "step": 304 + }, + { + "epoch": 0.37423312883435583, + "grad_norm": 36.3552235356213, + "learning_rate": 4.421487603305785e-07, + "logits/chosen": -0.2392578125, + "logits/rejected": -0.38671875, + "logps/chosen": -404.0, + "logps/rejected": -312.0, + "loss": 0.2568, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.4140625, + "rewards/margins": 5.625, + "rewards/rejected": -4.21875, + "step": 305 + }, + { + "epoch": 0.3754601226993865, + "grad_norm": 40.279423014087726, + "learning_rate": 4.4194214876033056e-07, + "logits/chosen": -0.322265625, + "logits/rejected": -0.484375, + "logps/chosen": -416.0, + "logps/rejected": -334.0, + "loss": 0.2584, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.1171875, + "rewards/margins": 5.0, + "rewards/rejected": -3.890625, + "step": 306 + }, + { + "epoch": 0.37668711656441717, + "grad_norm": 39.63802917296688, + "learning_rate": 4.417355371900826e-07, + "logits/chosen": -0.1884765625, + "logits/rejected": -0.333984375, + "logps/chosen": -368.0, + "logps/rejected": -314.0, + "loss": 0.3214, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.2578125, + "rewards/margins": 5.25, + "rewards/rejected": -4.0, + "step": 307 + }, + { + "epoch": 0.37791411042944784, + "grad_norm": 38.40390766672212, + "learning_rate": 4.415289256198347e-07, + "logits/chosen": -0.1513671875, + "logits/rejected": -0.3125, + "logps/chosen": -384.0, + "logps/rejected": -328.0, + "loss": 0.3262, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.95703125, + "rewards/margins": 4.28125, + "rewards/rejected": -3.3125, + "step": 308 + }, + { + "epoch": 0.3791411042944785, + "grad_norm": 32.4379821627175, + "learning_rate": 4.4132231404958675e-07, + "logits/chosen": -0.3046875, + "logits/rejected": -0.419921875, + "logps/chosen": -378.0, + "logps/rejected": -326.0, + "loss": 0.2098, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.625, + "rewards/margins": 5.6875, + "rewards/rejected": -4.03125, + "step": 309 + }, + { + "epoch": 0.3803680981595092, + "grad_norm": 40.47301853181884, + "learning_rate": 4.411157024793388e-07, + "logits/chosen": -0.107421875, + "logits/rejected": -0.205078125, + "logps/chosen": -310.0, + "logps/rejected": -284.0, + "loss": 0.3181, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.32421875, + "rewards/margins": 4.0, + "rewards/rejected": -3.6875, + "step": 310 + }, + { + "epoch": 0.3815950920245399, + "grad_norm": 33.919361023276416, + "learning_rate": 4.409090909090909e-07, + "logits/chosen": -0.267578125, + "logits/rejected": -0.443359375, + "logps/chosen": -382.0, + "logps/rejected": -316.0, + "loss": 0.2306, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.5625, + "rewards/margins": 5.6875, + "rewards/rejected": -4.125, + "step": 311 + }, + { + "epoch": 0.38282208588957056, + "grad_norm": 48.72311046374392, + "learning_rate": 4.4070247933884295e-07, + "logits/chosen": -0.1376953125, + "logits/rejected": -0.2734375, + "logps/chosen": -382.0, + "logps/rejected": -350.0, + "loss": 0.3689, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.1953125, + "rewards/margins": 4.59375, + "rewards/rejected": -3.40625, + "step": 312 + }, + { + "epoch": 0.38404907975460123, + "grad_norm": 32.93519257063822, + "learning_rate": 4.4049586776859505e-07, + "logits/chosen": -0.134765625, + "logits/rejected": -0.41015625, + "logps/chosen": -400.0, + "logps/rejected": -342.0, + "loss": 0.2417, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 2.171875, + "rewards/margins": 6.09375, + "rewards/rejected": -3.90625, + "step": 313 + }, + { + "epoch": 0.3852760736196319, + "grad_norm": 29.761092790659628, + "learning_rate": 4.402892561983471e-07, + "logits/chosen": -0.1689453125, + "logits/rejected": -0.359375, + "logps/chosen": -454.0, + "logps/rejected": -330.0, + "loss": 0.1846, + "rewards/accuracies": 0.890625, + "rewards/chosen": 2.515625, + "rewards/margins": 6.71875, + "rewards/rejected": -4.1875, + "step": 314 + }, + { + "epoch": 0.38650306748466257, + "grad_norm": 33.15936964822026, + "learning_rate": 4.4008264462809914e-07, + "logits/chosen": -0.06982421875, + "logits/rejected": -0.259765625, + "logps/chosen": -342.0, + "logps/rejected": -274.0, + "loss": 0.2307, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.0078125, + "rewards/margins": 4.875, + "rewards/rejected": -3.859375, + "step": 315 + }, + { + "epoch": 0.38773006134969323, + "grad_norm": 30.385645470245766, + "learning_rate": 4.398760330578512e-07, + "logits/chosen": -0.07666015625, + "logits/rejected": -0.2197265625, + "logps/chosen": -354.0, + "logps/rejected": -280.0, + "loss": 0.2284, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.2890625, + "rewards/margins": 5.375, + "rewards/rejected": -4.09375, + "step": 316 + }, + { + "epoch": 0.3889570552147239, + "grad_norm": 34.30838449187616, + "learning_rate": 4.396694214876033e-07, + "logits/chosen": -0.1982421875, + "logits/rejected": -0.4140625, + "logps/chosen": -394.0, + "logps/rejected": -342.0, + "loss": 0.2337, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.46875, + "rewards/margins": 5.90625, + "rewards/rejected": -4.4375, + "step": 317 + }, + { + "epoch": 0.3901840490797546, + "grad_norm": 43.51216041497958, + "learning_rate": 4.3946280991735533e-07, + "logits/chosen": -0.2431640625, + "logits/rejected": -0.41015625, + "logps/chosen": -398.0, + "logps/rejected": -340.0, + "loss": 0.3148, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.4140625, + "rewards/margins": 5.03125, + "rewards/rejected": -3.625, + "step": 318 + }, + { + "epoch": 0.3914110429447853, + "grad_norm": 23.822105871778678, + "learning_rate": 4.3925619834710743e-07, + "logits/chosen": -0.1689453125, + "logits/rejected": -0.359375, + "logps/chosen": -410.0, + "logps/rejected": -292.0, + "loss": 0.157, + "rewards/accuracies": 0.90625, + "rewards/chosen": 1.59375, + "rewards/margins": 6.34375, + "rewards/rejected": -4.75, + "step": 319 + }, + { + "epoch": 0.39263803680981596, + "grad_norm": 37.656689387782905, + "learning_rate": 4.390495867768595e-07, + "logits/chosen": -0.1806640625, + "logits/rejected": -0.291015625, + "logps/chosen": -316.0, + "logps/rejected": -262.0, + "loss": 0.2576, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.8046875, + "rewards/margins": 5.03125, + "rewards/rejected": -4.21875, + "step": 320 + }, + { + "epoch": 0.39386503067484663, + "grad_norm": 47.198644192326896, + "learning_rate": 4.388429752066116e-07, + "logits/chosen": -0.287109375, + "logits/rejected": -0.4609375, + "logps/chosen": -404.0, + "logps/rejected": -372.0, + "loss": 0.2837, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.03125, + "rewards/margins": 5.8125, + "rewards/rejected": -4.78125, + "step": 321 + }, + { + "epoch": 0.3950920245398773, + "grad_norm": 35.22081458129445, + "learning_rate": 4.3863636363636363e-07, + "logits/chosen": -0.2119140625, + "logits/rejected": -0.369140625, + "logps/chosen": -392.0, + "logps/rejected": -306.0, + "loss": 0.2397, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.5, + "rewards/margins": 5.84375, + "rewards/rejected": -4.34375, + "step": 322 + }, + { + "epoch": 0.39631901840490796, + "grad_norm": 40.535682371905, + "learning_rate": 4.3842975206611573e-07, + "logits/chosen": -0.25, + "logits/rejected": -0.38671875, + "logps/chosen": -350.0, + "logps/rejected": -316.0, + "loss": 0.3459, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.9453125, + "rewards/margins": 4.5625, + "rewards/rejected": -3.609375, + "step": 323 + }, + { + "epoch": 0.39754601226993863, + "grad_norm": 34.724438451994665, + "learning_rate": 4.382231404958677e-07, + "logits/chosen": -0.283203125, + "logits/rejected": -0.453125, + "logps/chosen": -354.0, + "logps/rejected": -306.0, + "loss": 0.2659, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.8671875, + "rewards/margins": 5.46875, + "rewards/rejected": -4.59375, + "step": 324 + }, + { + "epoch": 0.3987730061349693, + "grad_norm": 47.440215471486304, + "learning_rate": 4.380165289256198e-07, + "logits/chosen": -0.14453125, + "logits/rejected": -0.228515625, + "logps/chosen": -328.0, + "logps/rejected": -284.0, + "loss": 0.383, + "rewards/accuracies": 0.796875, + "rewards/chosen": 0.53515625, + "rewards/margins": 4.5, + "rewards/rejected": -3.96875, + "step": 325 + }, + { + "epoch": 0.4, + "grad_norm": 36.66273937163835, + "learning_rate": 4.3780991735537187e-07, + "logits/chosen": -0.31640625, + "logits/rejected": -0.462890625, + "logps/chosen": -398.0, + "logps/rejected": -350.0, + "loss": 0.2043, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.7265625, + "rewards/margins": 6.21875, + "rewards/rejected": -4.46875, + "step": 326 + }, + { + "epoch": 0.4012269938650307, + "grad_norm": 51.442585409024396, + "learning_rate": 4.3760330578512397e-07, + "logits/chosen": -0.2119140625, + "logits/rejected": -0.390625, + "logps/chosen": -428.0, + "logps/rejected": -334.0, + "loss": 0.3681, + "rewards/accuracies": 0.796875, + "rewards/chosen": 1.2265625, + "rewards/margins": 4.65625, + "rewards/rejected": -3.4375, + "step": 327 + }, + { + "epoch": 0.40245398773006136, + "grad_norm": 44.606600240172085, + "learning_rate": 4.37396694214876e-07, + "logits/chosen": -0.2431640625, + "logits/rejected": -0.376953125, + "logps/chosen": -360.0, + "logps/rejected": -268.0, + "loss": 0.3204, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.59375, + "rewards/margins": 4.59375, + "rewards/rejected": -4.0, + "step": 328 + }, + { + "epoch": 0.403680981595092, + "grad_norm": 36.3592106715033, + "learning_rate": 4.3719008264462806e-07, + "logits/chosen": -0.1884765625, + "logits/rejected": -0.396484375, + "logps/chosen": -458.0, + "logps/rejected": -358.0, + "loss": 0.2828, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.765625, + "rewards/margins": 6.28125, + "rewards/rejected": -4.5, + "step": 329 + }, + { + "epoch": 0.4049079754601227, + "grad_norm": 36.0973250750226, + "learning_rate": 4.3698347107438016e-07, + "logits/chosen": -0.318359375, + "logits/rejected": -0.52734375, + "logps/chosen": -412.0, + "logps/rejected": -326.0, + "loss": 0.2257, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.609375, + "rewards/margins": 6.125, + "rewards/rejected": -4.53125, + "step": 330 + }, + { + "epoch": 0.40613496932515336, + "grad_norm": 35.83835721797351, + "learning_rate": 4.367768595041322e-07, + "logits/chosen": -0.2890625, + "logits/rejected": -0.40234375, + "logps/chosen": -404.0, + "logps/rejected": -334.0, + "loss": 0.2402, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.59375, + "rewards/margins": 5.75, + "rewards/rejected": -4.15625, + "step": 331 + }, + { + "epoch": 0.40736196319018403, + "grad_norm": 29.00587176168557, + "learning_rate": 4.3657024793388426e-07, + "logits/chosen": -0.29296875, + "logits/rejected": -0.482421875, + "logps/chosen": -424.0, + "logps/rejected": -308.0, + "loss": 0.2051, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.703125, + "rewards/margins": 6.03125, + "rewards/rejected": -4.3125, + "step": 332 + }, + { + "epoch": 0.4085889570552147, + "grad_norm": 37.2793403072948, + "learning_rate": 4.363636363636363e-07, + "logits/chosen": -0.12158203125, + "logits/rejected": -0.251953125, + "logps/chosen": -364.0, + "logps/rejected": -322.0, + "loss": 0.2787, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.265625, + "rewards/margins": 4.96875, + "rewards/rejected": -3.6875, + "step": 333 + }, + { + "epoch": 0.4098159509202454, + "grad_norm": 37.233291436969324, + "learning_rate": 4.361570247933884e-07, + "logits/chosen": -0.2255859375, + "logits/rejected": -0.4609375, + "logps/chosen": -372.0, + "logps/rejected": -336.0, + "loss": 0.263, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.40625, + "rewards/margins": 5.78125, + "rewards/rejected": -4.375, + "step": 334 + }, + { + "epoch": 0.4110429447852761, + "grad_norm": 40.307147676871146, + "learning_rate": 4.3595041322314045e-07, + "logits/chosen": -0.162109375, + "logits/rejected": -0.408203125, + "logps/chosen": -424.0, + "logps/rejected": -304.0, + "loss": 0.2393, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.109375, + "rewards/margins": 5.03125, + "rewards/rejected": -3.9375, + "step": 335 + }, + { + "epoch": 0.41226993865030676, + "grad_norm": 35.98003323778127, + "learning_rate": 4.3574380165289255e-07, + "logits/chosen": -0.3046875, + "logits/rejected": -0.45703125, + "logps/chosen": -392.0, + "logps/rejected": -324.0, + "loss": 0.2573, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.265625, + "rewards/margins": 5.3125, + "rewards/rejected": -4.03125, + "step": 336 + }, + { + "epoch": 0.4134969325153374, + "grad_norm": 47.71731749469287, + "learning_rate": 4.355371900826446e-07, + "logits/chosen": -0.10595703125, + "logits/rejected": -0.275390625, + "logps/chosen": -348.0, + "logps/rejected": -322.0, + "loss": 0.3291, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.1484375, + "rewards/margins": 4.96875, + "rewards/rejected": -3.828125, + "step": 337 + }, + { + "epoch": 0.4147239263803681, + "grad_norm": 40.237231718518984, + "learning_rate": 4.353305785123967e-07, + "logits/chosen": -0.1484375, + "logits/rejected": -0.302734375, + "logps/chosen": -380.0, + "logps/rejected": -324.0, + "loss": 0.3113, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.2890625, + "rewards/margins": 5.0625, + "rewards/rejected": -3.78125, + "step": 338 + }, + { + "epoch": 0.41595092024539876, + "grad_norm": 43.74604259781836, + "learning_rate": 4.3512396694214875e-07, + "logits/chosen": -0.08935546875, + "logits/rejected": -0.2275390625, + "logps/chosen": -366.0, + "logps/rejected": -318.0, + "loss": 0.3036, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.109375, + "rewards/margins": 4.90625, + "rewards/rejected": -3.796875, + "step": 339 + }, + { + "epoch": 0.4171779141104294, + "grad_norm": 40.57164499134951, + "learning_rate": 4.3491735537190085e-07, + "logits/chosen": -0.1826171875, + "logits/rejected": -0.40625, + "logps/chosen": -354.0, + "logps/rejected": -324.0, + "loss": 0.2623, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.046875, + "rewards/margins": 4.75, + "rewards/rejected": -3.703125, + "step": 340 + }, + { + "epoch": 0.41840490797546015, + "grad_norm": 35.445167805912895, + "learning_rate": 4.3471074380165284e-07, + "logits/chosen": -0.22265625, + "logits/rejected": -0.4453125, + "logps/chosen": -388.0, + "logps/rejected": -308.0, + "loss": 0.2979, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.4296875, + "rewards/margins": 5.65625, + "rewards/rejected": -4.21875, + "step": 341 + }, + { + "epoch": 0.4196319018404908, + "grad_norm": 43.283231525706334, + "learning_rate": 4.3450413223140494e-07, + "logits/chosen": -0.1865234375, + "logits/rejected": -0.2890625, + "logps/chosen": -330.0, + "logps/rejected": -296.0, + "loss": 0.3065, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.015625, + "rewards/margins": 4.71875, + "rewards/rejected": -3.703125, + "step": 342 + }, + { + "epoch": 0.4208588957055215, + "grad_norm": 41.84183041867056, + "learning_rate": 4.34297520661157e-07, + "logits/chosen": -0.2001953125, + "logits/rejected": -0.310546875, + "logps/chosen": -374.0, + "logps/rejected": -330.0, + "loss": 0.3363, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.0859375, + "rewards/margins": 4.40625, + "rewards/rejected": -3.328125, + "step": 343 + }, + { + "epoch": 0.42208588957055215, + "grad_norm": 40.634867535224096, + "learning_rate": 4.340909090909091e-07, + "logits/chosen": -0.2080078125, + "logits/rejected": -0.349609375, + "logps/chosen": -398.0, + "logps/rejected": -318.0, + "loss": 0.3062, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.0859375, + "rewards/margins": 4.625, + "rewards/rejected": -3.515625, + "step": 344 + }, + { + "epoch": 0.4233128834355828, + "grad_norm": 44.35750118248226, + "learning_rate": 4.3388429752066114e-07, + "logits/chosen": -0.1875, + "logits/rejected": -0.380859375, + "logps/chosen": -404.0, + "logps/rejected": -314.0, + "loss": 0.3386, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.3046875, + "rewards/margins": 4.96875, + "rewards/rejected": -3.671875, + "step": 345 + }, + { + "epoch": 0.4245398773006135, + "grad_norm": 39.322612546267074, + "learning_rate": 4.336776859504132e-07, + "logits/chosen": -0.1953125, + "logits/rejected": -0.3828125, + "logps/chosen": -332.0, + "logps/rejected": -280.0, + "loss": 0.3136, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.015625, + "rewards/margins": 4.5625, + "rewards/rejected": -3.546875, + "step": 346 + }, + { + "epoch": 0.42576687116564416, + "grad_norm": 30.94392895882633, + "learning_rate": 4.334710743801653e-07, + "logits/chosen": -0.2099609375, + "logits/rejected": -0.34765625, + "logps/chosen": -358.0, + "logps/rejected": -332.0, + "loss": 0.2331, + "rewards/accuracies": 0.90625, + "rewards/chosen": 1.296875, + "rewards/margins": 4.78125, + "rewards/rejected": -3.484375, + "step": 347 + }, + { + "epoch": 0.4269938650306748, + "grad_norm": 32.258435591671414, + "learning_rate": 4.3326446280991733e-07, + "logits/chosen": -0.244140625, + "logits/rejected": -0.455078125, + "logps/chosen": -410.0, + "logps/rejected": -300.0, + "loss": 0.2507, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.0625, + "rewards/margins": 5.71875, + "rewards/rejected": -4.65625, + "step": 348 + }, + { + "epoch": 0.42822085889570555, + "grad_norm": 35.47879422672426, + "learning_rate": 4.3305785123966943e-07, + "logits/chosen": -0.2412109375, + "logits/rejected": -0.38671875, + "logps/chosen": -394.0, + "logps/rejected": -296.0, + "loss": 0.2708, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.1875, + "rewards/margins": 5.4375, + "rewards/rejected": -4.25, + "step": 349 + }, + { + "epoch": 0.4294478527607362, + "grad_norm": 41.30786537567203, + "learning_rate": 4.328512396694214e-07, + "logits/chosen": -0.1103515625, + "logits/rejected": -0.3046875, + "logps/chosen": -398.0, + "logps/rejected": -292.0, + "loss": 0.2859, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.3828125, + "rewards/margins": 4.6875, + "rewards/rejected": -3.296875, + "step": 350 + }, + { + "epoch": 0.4306748466257669, + "grad_norm": 40.51120105706657, + "learning_rate": 4.326446280991735e-07, + "logits/chosen": -0.265625, + "logits/rejected": -0.412109375, + "logps/chosen": -332.0, + "logps/rejected": -302.0, + "loss": 0.3046, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.875, + "rewards/margins": 4.6875, + "rewards/rejected": -3.796875, + "step": 351 + }, + { + "epoch": 0.43190184049079755, + "grad_norm": 41.727810614577876, + "learning_rate": 4.3243801652892557e-07, + "logits/chosen": -0.1845703125, + "logits/rejected": -0.388671875, + "logps/chosen": -378.0, + "logps/rejected": -312.0, + "loss": 0.3119, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.8203125, + "rewards/margins": 4.875, + "rewards/rejected": -3.0625, + "step": 352 + }, + { + "epoch": 0.4331288343558282, + "grad_norm": 31.222074641479136, + "learning_rate": 4.3223140495867767e-07, + "logits/chosen": -0.23828125, + "logits/rejected": -0.4140625, + "logps/chosen": -354.0, + "logps/rejected": -304.0, + "loss": 0.2275, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.6484375, + "rewards/margins": 5.5625, + "rewards/rejected": -3.90625, + "step": 353 + }, + { + "epoch": 0.4343558282208589, + "grad_norm": 36.249821649908675, + "learning_rate": 4.320247933884297e-07, + "logits/chosen": -0.1630859375, + "logits/rejected": -0.34375, + "logps/chosen": -432.0, + "logps/rejected": -354.0, + "loss": 0.281, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 2.046875, + "rewards/margins": 5.0625, + "rewards/rejected": -3.03125, + "step": 354 + }, + { + "epoch": 0.43558282208588955, + "grad_norm": 40.95221006715783, + "learning_rate": 4.318181818181818e-07, + "logits/chosen": -0.30859375, + "logits/rejected": -0.41015625, + "logps/chosen": -338.0, + "logps/rejected": -332.0, + "loss": 0.3157, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.3203125, + "rewards/margins": 4.90625, + "rewards/rejected": -3.5625, + "step": 355 + }, + { + "epoch": 0.4368098159509202, + "grad_norm": 36.1989317653681, + "learning_rate": 4.3161157024793386e-07, + "logits/chosen": -0.11962890625, + "logits/rejected": -0.259765625, + "logps/chosen": -386.0, + "logps/rejected": -308.0, + "loss": 0.3022, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.5, + "rewards/margins": 4.5625, + "rewards/rejected": -3.046875, + "step": 356 + }, + { + "epoch": 0.43803680981595094, + "grad_norm": 36.959818116679386, + "learning_rate": 4.3140495867768597e-07, + "logits/chosen": -0.365234375, + "logits/rejected": -0.51953125, + "logps/chosen": -394.0, + "logps/rejected": -312.0, + "loss": 0.2585, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.5703125, + "rewards/margins": 5.53125, + "rewards/rejected": -3.953125, + "step": 357 + }, + { + "epoch": 0.4392638036809816, + "grad_norm": 35.616695396791314, + "learning_rate": 4.31198347107438e-07, + "logits/chosen": -0.318359375, + "logits/rejected": -0.4765625, + "logps/chosen": -440.0, + "logps/rejected": -306.0, + "loss": 0.2431, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.9765625, + "rewards/margins": 5.5625, + "rewards/rejected": -3.59375, + "step": 358 + }, + { + "epoch": 0.4404907975460123, + "grad_norm": 39.323762039132475, + "learning_rate": 4.3099173553719006e-07, + "logits/chosen": -0.208984375, + "logits/rejected": -0.326171875, + "logps/chosen": -414.0, + "logps/rejected": -308.0, + "loss": 0.2505, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.9375, + "rewards/margins": 5.21875, + "rewards/rejected": -3.296875, + "step": 359 + }, + { + "epoch": 0.44171779141104295, + "grad_norm": 39.07034175993009, + "learning_rate": 4.307851239669421e-07, + "logits/chosen": -0.1787109375, + "logits/rejected": -0.3125, + "logps/chosen": -386.0, + "logps/rejected": -332.0, + "loss": 0.2575, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.2734375, + "rewards/margins": 5.21875, + "rewards/rejected": -3.953125, + "step": 360 + }, + { + "epoch": 0.4429447852760736, + "grad_norm": 35.06710617877251, + "learning_rate": 4.305785123966942e-07, + "logits/chosen": -0.126953125, + "logits/rejected": -0.33203125, + "logps/chosen": -426.0, + "logps/rejected": -352.0, + "loss": 0.2472, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.7890625, + "rewards/margins": 5.625, + "rewards/rejected": -3.828125, + "step": 361 + }, + { + "epoch": 0.4441717791411043, + "grad_norm": 34.7975606217305, + "learning_rate": 4.3037190082644625e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.412109375, + "logps/chosen": -408.0, + "logps/rejected": -318.0, + "loss": 0.2548, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.578125, + "rewards/margins": 5.46875, + "rewards/rejected": -3.890625, + "step": 362 + }, + { + "epoch": 0.44539877300613495, + "grad_norm": 35.42891956468369, + "learning_rate": 4.3016528925619835e-07, + "logits/chosen": -0.1748046875, + "logits/rejected": -0.33203125, + "logps/chosen": -382.0, + "logps/rejected": -322.0, + "loss": 0.237, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.6328125, + "rewards/margins": 5.375, + "rewards/rejected": -3.734375, + "step": 363 + }, + { + "epoch": 0.4466257668711656, + "grad_norm": 44.20888419689405, + "learning_rate": 4.299586776859504e-07, + "logits/chosen": -0.1083984375, + "logits/rejected": -0.29296875, + "logps/chosen": -386.0, + "logps/rejected": -290.0, + "loss": 0.2487, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.390625, + "rewards/margins": 5.03125, + "rewards/rejected": -3.625, + "step": 364 + }, + { + "epoch": 0.44785276073619634, + "grad_norm": 32.07969290277028, + "learning_rate": 4.2975206611570245e-07, + "logits/chosen": -0.158203125, + "logits/rejected": -0.30859375, + "logps/chosen": -346.0, + "logps/rejected": -292.0, + "loss": 0.2268, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.234375, + "rewards/margins": 5.15625, + "rewards/rejected": -3.921875, + "step": 365 + }, + { + "epoch": 0.449079754601227, + "grad_norm": 35.77821392399441, + "learning_rate": 4.2954545454545455e-07, + "logits/chosen": -0.146484375, + "logits/rejected": -0.25, + "logps/chosen": -360.0, + "logps/rejected": -314.0, + "loss": 0.3, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.3828125, + "rewards/margins": 4.6875, + "rewards/rejected": -3.3125, + "step": 366 + }, + { + "epoch": 0.4503067484662577, + "grad_norm": 33.47062276922143, + "learning_rate": 4.293388429752066e-07, + "logits/chosen": -0.26953125, + "logits/rejected": -0.451171875, + "logps/chosen": -392.0, + "logps/rejected": -316.0, + "loss": 0.2494, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.3046875, + "rewards/margins": 5.03125, + "rewards/rejected": -3.734375, + "step": 367 + }, + { + "epoch": 0.45153374233128835, + "grad_norm": 41.18940309867523, + "learning_rate": 4.2913223140495864e-07, + "logits/chosen": -0.09033203125, + "logits/rejected": -0.1494140625, + "logps/chosen": -366.0, + "logps/rejected": -312.0, + "loss": 0.3001, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.0, + "rewards/margins": 4.625, + "rewards/rejected": -3.625, + "step": 368 + }, + { + "epoch": 0.452760736196319, + "grad_norm": 37.92759892609332, + "learning_rate": 4.289256198347107e-07, + "logits/chosen": -0.115234375, + "logits/rejected": -0.224609375, + "logps/chosen": -340.0, + "logps/rejected": -280.0, + "loss": 0.2816, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.5859375, + "rewards/margins": 4.34375, + "rewards/rejected": -3.75, + "step": 369 + }, + { + "epoch": 0.4539877300613497, + "grad_norm": 32.92636269991582, + "learning_rate": 4.287190082644628e-07, + "logits/chosen": -0.265625, + "logits/rejected": -0.462890625, + "logps/chosen": -402.0, + "logps/rejected": -336.0, + "loss": 0.2538, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.671875, + "rewards/margins": 5.375, + "rewards/rejected": -3.703125, + "step": 370 + }, + { + "epoch": 0.45521472392638035, + "grad_norm": 38.74700708912898, + "learning_rate": 4.2851239669421484e-07, + "logits/chosen": -0.2490234375, + "logits/rejected": -0.4375, + "logps/chosen": -460.0, + "logps/rejected": -352.0, + "loss": 0.2839, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.53125, + "rewards/margins": 4.84375, + "rewards/rejected": -3.3125, + "step": 371 + }, + { + "epoch": 0.456441717791411, + "grad_norm": 35.56525332139474, + "learning_rate": 4.2830578512396694e-07, + "logits/chosen": -0.1650390625, + "logits/rejected": -0.326171875, + "logps/chosen": -410.0, + "logps/rejected": -310.0, + "loss": 0.239, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.46875, + "rewards/margins": 5.0, + "rewards/rejected": -3.53125, + "step": 372 + }, + { + "epoch": 0.45766871165644174, + "grad_norm": 38.919873513342004, + "learning_rate": 4.28099173553719e-07, + "logits/chosen": -0.1943359375, + "logits/rejected": -0.3046875, + "logps/chosen": -360.0, + "logps/rejected": -308.0, + "loss": 0.325, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 0.765625, + "rewards/margins": 4.5625, + "rewards/rejected": -3.8125, + "step": 373 + }, + { + "epoch": 0.4588957055214724, + "grad_norm": 33.72191218536702, + "learning_rate": 4.278925619834711e-07, + "logits/chosen": -0.2099609375, + "logits/rejected": -0.349609375, + "logps/chosen": -384.0, + "logps/rejected": -304.0, + "loss": 0.2315, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.765625, + "rewards/margins": 5.4375, + "rewards/rejected": -3.6875, + "step": 374 + }, + { + "epoch": 0.4601226993865031, + "grad_norm": 39.982978401052485, + "learning_rate": 4.2768595041322313e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.34765625, + "logps/chosen": -392.0, + "logps/rejected": -342.0, + "loss": 0.2831, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.546875, + "rewards/margins": 4.84375, + "rewards/rejected": -3.3125, + "step": 375 + }, + { + "epoch": 0.46134969325153374, + "grad_norm": 33.94023445384835, + "learning_rate": 4.2747933884297523e-07, + "logits/chosen": -0.140625, + "logits/rejected": -0.29296875, + "logps/chosen": -376.0, + "logps/rejected": -336.0, + "loss": 0.2271, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.5859375, + "rewards/margins": 5.0, + "rewards/rejected": -3.421875, + "step": 376 + }, + { + "epoch": 0.4625766871165644, + "grad_norm": 37.21157793471459, + "learning_rate": 4.272727272727272e-07, + "logits/chosen": -0.21484375, + "logits/rejected": -0.287109375, + "logps/chosen": -352.0, + "logps/rejected": -306.0, + "loss": 0.262, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.453125, + "rewards/margins": 5.46875, + "rewards/rejected": -4.03125, + "step": 377 + }, + { + "epoch": 0.4638036809815951, + "grad_norm": 38.20919614495083, + "learning_rate": 4.270661157024793e-07, + "logits/chosen": -0.2421875, + "logits/rejected": -0.4921875, + "logps/chosen": -376.0, + "logps/rejected": -320.0, + "loss": 0.28, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.6484375, + "rewards/margins": 5.375, + "rewards/rejected": -3.734375, + "step": 378 + }, + { + "epoch": 0.46503067484662575, + "grad_norm": 36.24612780889627, + "learning_rate": 4.2685950413223137e-07, + "logits/chosen": -0.287109375, + "logits/rejected": -0.45703125, + "logps/chosen": -406.0, + "logps/rejected": -328.0, + "loss": 0.257, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.796875, + "rewards/margins": 5.75, + "rewards/rejected": -3.96875, + "step": 379 + }, + { + "epoch": 0.4662576687116564, + "grad_norm": 36.557393364699294, + "learning_rate": 4.2665289256198347e-07, + "logits/chosen": -0.203125, + "logits/rejected": -0.353515625, + "logps/chosen": -382.0, + "logps/rejected": -312.0, + "loss": 0.2671, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.578125, + "rewards/margins": 5.4375, + "rewards/rejected": -3.84375, + "step": 380 + }, + { + "epoch": 0.46748466257668714, + "grad_norm": 37.32259328400382, + "learning_rate": 4.264462809917355e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.458984375, + "logps/chosen": -370.0, + "logps/rejected": -310.0, + "loss": 0.3045, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.2578125, + "rewards/margins": 5.46875, + "rewards/rejected": -4.21875, + "step": 381 + }, + { + "epoch": 0.4687116564417178, + "grad_norm": 34.81605521306601, + "learning_rate": 4.2623966942148757e-07, + "logits/chosen": -0.283203125, + "logits/rejected": -0.390625, + "logps/chosen": -378.0, + "logps/rejected": -324.0, + "loss": 0.2736, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.34375, + "rewards/margins": 5.53125, + "rewards/rejected": -4.15625, + "step": 382 + }, + { + "epoch": 0.4699386503067485, + "grad_norm": 38.419341258289826, + "learning_rate": 4.2603305785123967e-07, + "logits/chosen": -0.2001953125, + "logits/rejected": -0.36328125, + "logps/chosen": -400.0, + "logps/rejected": -364.0, + "loss": 0.2858, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.3515625, + "rewards/margins": 5.5625, + "rewards/rejected": -4.21875, + "step": 383 + }, + { + "epoch": 0.47116564417177914, + "grad_norm": 33.49732006194629, + "learning_rate": 4.258264462809917e-07, + "logits/chosen": -0.2890625, + "logits/rejected": -0.52734375, + "logps/chosen": -392.0, + "logps/rejected": -320.0, + "loss": 0.2126, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.234375, + "rewards/margins": 6.15625, + "rewards/rejected": -4.90625, + "step": 384 + }, + { + "epoch": 0.4723926380368098, + "grad_norm": 38.114919863333334, + "learning_rate": 4.256198347107438e-07, + "logits/chosen": -0.19140625, + "logits/rejected": -0.384765625, + "logps/chosen": -388.0, + "logps/rejected": -314.0, + "loss": 0.2925, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.96484375, + "rewards/margins": 5.40625, + "rewards/rejected": -4.4375, + "step": 385 + }, + { + "epoch": 0.4736196319018405, + "grad_norm": 42.83706264363719, + "learning_rate": 4.254132231404958e-07, + "logits/chosen": -0.146484375, + "logits/rejected": -0.314453125, + "logps/chosen": -336.0, + "logps/rejected": -292.0, + "loss": 0.2814, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.439453125, + "rewards/margins": 5.09375, + "rewards/rejected": -4.65625, + "step": 386 + }, + { + "epoch": 0.47484662576687114, + "grad_norm": 43.964728733564016, + "learning_rate": 4.252066115702479e-07, + "logits/chosen": -0.169921875, + "logits/rejected": -0.365234375, + "logps/chosen": -416.0, + "logps/rejected": -328.0, + "loss": 0.2666, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.3046875, + "rewards/margins": 5.8125, + "rewards/rejected": -4.5, + "step": 387 + }, + { + "epoch": 0.47607361963190187, + "grad_norm": 44.03543501865791, + "learning_rate": 4.2499999999999995e-07, + "logits/chosen": -0.193359375, + "logits/rejected": -0.298828125, + "logps/chosen": -400.0, + "logps/rejected": -310.0, + "loss": 0.3549, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.6328125, + "rewards/margins": 4.5, + "rewards/rejected": -3.875, + "step": 388 + }, + { + "epoch": 0.47730061349693254, + "grad_norm": 42.68974337451638, + "learning_rate": 4.2479338842975205e-07, + "logits/chosen": -0.2421875, + "logits/rejected": -0.337890625, + "logps/chosen": -404.0, + "logps/rejected": -322.0, + "loss": 0.3419, + "rewards/accuracies": 0.78125, + "rewards/chosen": 0.9609375, + "rewards/margins": 5.3125, + "rewards/rejected": -4.34375, + "step": 389 + }, + { + "epoch": 0.4785276073619632, + "grad_norm": 42.06628954709381, + "learning_rate": 4.245867768595041e-07, + "logits/chosen": -0.306640625, + "logits/rejected": -0.447265625, + "logps/chosen": -362.0, + "logps/rejected": -326.0, + "loss": 0.3237, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.361328125, + "rewards/margins": 5.15625, + "rewards/rejected": -4.78125, + "step": 390 + }, + { + "epoch": 0.47975460122699387, + "grad_norm": 49.18980712796409, + "learning_rate": 4.243801652892562e-07, + "logits/chosen": -0.22265625, + "logits/rejected": -0.3515625, + "logps/chosen": -380.0, + "logps/rejected": -324.0, + "loss": 0.3698, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 0.92578125, + "rewards/margins": 5.4375, + "rewards/rejected": -4.5, + "step": 391 + }, + { + "epoch": 0.48098159509202454, + "grad_norm": 34.35189463552141, + "learning_rate": 4.2417355371900825e-07, + "logits/chosen": -0.1787109375, + "logits/rejected": -0.330078125, + "logps/chosen": -354.0, + "logps/rejected": -310.0, + "loss": 0.2639, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.9296875, + "rewards/margins": 5.59375, + "rewards/rejected": -4.65625, + "step": 392 + }, + { + "epoch": 0.4822085889570552, + "grad_norm": 38.67130742947215, + "learning_rate": 4.2396694214876035e-07, + "logits/chosen": -0.14453125, + "logits/rejected": -0.2890625, + "logps/chosen": -404.0, + "logps/rejected": -352.0, + "loss": 0.2885, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.921875, + "rewards/margins": 5.375, + "rewards/rejected": -4.46875, + "step": 393 + }, + { + "epoch": 0.4834355828220859, + "grad_norm": 40.57744523526432, + "learning_rate": 4.237603305785124e-07, + "logits/chosen": -0.212890625, + "logits/rejected": -0.42578125, + "logps/chosen": -386.0, + "logps/rejected": -324.0, + "loss": 0.2657, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.84765625, + "rewards/margins": 5.34375, + "rewards/rejected": -4.5, + "step": 394 + }, + { + "epoch": 0.48466257668711654, + "grad_norm": 38.619317047033334, + "learning_rate": 4.2355371900826444e-07, + "logits/chosen": -0.212890625, + "logits/rejected": -0.34375, + "logps/chosen": -438.0, + "logps/rejected": -336.0, + "loss": 0.307, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.94921875, + "rewards/margins": 5.21875, + "rewards/rejected": -4.28125, + "step": 395 + }, + { + "epoch": 0.48588957055214727, + "grad_norm": 30.114712115596447, + "learning_rate": 4.233471074380165e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.4921875, + "logps/chosen": -338.0, + "logps/rejected": -312.0, + "loss": 0.215, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 0.439453125, + "rewards/margins": 5.375, + "rewards/rejected": -4.9375, + "step": 396 + }, + { + "epoch": 0.48711656441717793, + "grad_norm": 34.39736388154625, + "learning_rate": 4.231404958677686e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.43359375, + "logps/chosen": -374.0, + "logps/rejected": -326.0, + "loss": 0.2349, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.84765625, + "rewards/margins": 5.78125, + "rewards/rejected": -4.9375, + "step": 397 + }, + { + "epoch": 0.4883435582822086, + "grad_norm": 40.00891469568207, + "learning_rate": 4.2293388429752064e-07, + "logits/chosen": -0.2490234375, + "logits/rejected": -0.3984375, + "logps/chosen": -416.0, + "logps/rejected": -324.0, + "loss": 0.3096, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 1.0859375, + "rewards/margins": 5.46875, + "rewards/rejected": -4.375, + "step": 398 + }, + { + "epoch": 0.48957055214723927, + "grad_norm": 35.41096130608413, + "learning_rate": 4.227272727272727e-07, + "logits/chosen": -0.26953125, + "logits/rejected": -0.416015625, + "logps/chosen": -384.0, + "logps/rejected": -324.0, + "loss": 0.2995, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.921875, + "rewards/margins": 5.3125, + "rewards/rejected": -4.375, + "step": 399 + }, + { + "epoch": 0.49079754601226994, + "grad_norm": 48.45396143006796, + "learning_rate": 4.225206611570248e-07, + "logits/chosen": -0.2236328125, + "logits/rejected": -0.30859375, + "logps/chosen": -370.0, + "logps/rejected": -346.0, + "loss": 0.3464, + "rewards/accuracies": 0.796875, + "rewards/chosen": 0.8125, + "rewards/margins": 4.78125, + "rewards/rejected": -3.953125, + "step": 400 + }, + { + "epoch": 0.4920245398773006, + "grad_norm": 30.00175559700857, + "learning_rate": 4.2231404958677683e-07, + "logits/chosen": -0.337890625, + "logits/rejected": -0.490234375, + "logps/chosen": -446.0, + "logps/rejected": -366.0, + "loss": 0.2176, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.46875, + "rewards/margins": 6.1875, + "rewards/rejected": -4.71875, + "step": 401 + }, + { + "epoch": 0.49325153374233127, + "grad_norm": 37.529393439709146, + "learning_rate": 4.2210743801652893e-07, + "logits/chosen": -0.208984375, + "logits/rejected": -0.314453125, + "logps/chosen": -384.0, + "logps/rejected": -328.0, + "loss": 0.2923, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.98828125, + "rewards/margins": 5.25, + "rewards/rejected": -4.25, + "step": 402 + }, + { + "epoch": 0.49447852760736194, + "grad_norm": 41.86969893893965, + "learning_rate": 4.21900826446281e-07, + "logits/chosen": -0.203125, + "logits/rejected": -0.3046875, + "logps/chosen": -388.0, + "logps/rejected": -348.0, + "loss": 0.3168, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.828125, + "rewards/margins": 5.125, + "rewards/rejected": -4.28125, + "step": 403 + }, + { + "epoch": 0.49570552147239266, + "grad_norm": 34.20945313316955, + "learning_rate": 4.21694214876033e-07, + "logits/chosen": -0.1513671875, + "logits/rejected": -0.30078125, + "logps/chosen": -364.0, + "logps/rejected": -324.0, + "loss": 0.2255, + "rewards/accuracies": 0.90625, + "rewards/chosen": 1.0703125, + "rewards/margins": 5.65625, + "rewards/rejected": -4.59375, + "step": 404 + }, + { + "epoch": 0.49693251533742333, + "grad_norm": 35.86293374874338, + "learning_rate": 4.2148760330578507e-07, + "logits/chosen": -0.2314453125, + "logits/rejected": -0.462890625, + "logps/chosen": -364.0, + "logps/rejected": -304.0, + "loss": 0.3106, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.21875, + "rewards/margins": 5.53125, + "rewards/rejected": -4.3125, + "step": 405 + }, + { + "epoch": 0.498159509202454, + "grad_norm": 43.071679894395345, + "learning_rate": 4.2128099173553717e-07, + "logits/chosen": -0.1328125, + "logits/rejected": -0.2294921875, + "logps/chosen": -374.0, + "logps/rejected": -322.0, + "loss": 0.3625, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 0.86328125, + "rewards/margins": 4.78125, + "rewards/rejected": -3.921875, + "step": 406 + }, + { + "epoch": 0.49938650306748467, + "grad_norm": 42.39188898560159, + "learning_rate": 4.210743801652892e-07, + "logits/chosen": -0.10986328125, + "logits/rejected": -0.2734375, + "logps/chosen": -402.0, + "logps/rejected": -322.0, + "loss": 0.3105, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.9140625, + "rewards/margins": 5.78125, + "rewards/rejected": -3.84375, + "step": 407 + }, + { + "epoch": 0.5006134969325153, + "grad_norm": 45.27741438195794, + "learning_rate": 4.208677685950413e-07, + "logits/chosen": -0.2109375, + "logits/rejected": -0.310546875, + "logps/chosen": -418.0, + "logps/rejected": -346.0, + "loss": 0.3592, + "rewards/accuracies": 0.78125, + "rewards/chosen": 0.73828125, + "rewards/margins": 4.4375, + "rewards/rejected": -3.71875, + "step": 408 + }, + { + "epoch": 0.501840490797546, + "grad_norm": 39.84136285513692, + "learning_rate": 4.2066115702479337e-07, + "logits/chosen": -0.1484375, + "logits/rejected": -0.345703125, + "logps/chosen": -418.0, + "logps/rejected": -322.0, + "loss": 0.2668, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.3125, + "rewards/margins": 5.5625, + "rewards/rejected": -4.25, + "step": 409 + }, + { + "epoch": 0.5030674846625767, + "grad_norm": 40.12041017968796, + "learning_rate": 4.2045454545454547e-07, + "logits/chosen": -0.1357421875, + "logits/rejected": -0.33984375, + "logps/chosen": -382.0, + "logps/rejected": -340.0, + "loss": 0.2892, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.91796875, + "rewards/margins": 4.78125, + "rewards/rejected": -3.859375, + "step": 410 + }, + { + "epoch": 0.5042944785276073, + "grad_norm": 37.21127075191681, + "learning_rate": 4.202479338842975e-07, + "logits/chosen": -0.1279296875, + "logits/rejected": -0.26953125, + "logps/chosen": -338.0, + "logps/rejected": -302.0, + "loss": 0.2656, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.65625, + "rewards/margins": 5.03125, + "rewards/rejected": -4.375, + "step": 411 + }, + { + "epoch": 0.505521472392638, + "grad_norm": 41.819486450620104, + "learning_rate": 4.200413223140496e-07, + "logits/chosen": -0.1376953125, + "logits/rejected": -0.27734375, + "logps/chosen": -420.0, + "logps/rejected": -348.0, + "loss": 0.3095, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.015625, + "rewards/margins": 4.75, + "rewards/rejected": -3.71875, + "step": 412 + }, + { + "epoch": 0.5067484662576687, + "grad_norm": 38.33771429389002, + "learning_rate": 4.198347107438016e-07, + "logits/chosen": -0.1728515625, + "logits/rejected": -0.404296875, + "logps/chosen": -402.0, + "logps/rejected": -312.0, + "loss": 0.2722, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.3828125, + "rewards/margins": 5.40625, + "rewards/rejected": -4.03125, + "step": 413 + }, + { + "epoch": 0.5079754601226993, + "grad_norm": 37.12482857003386, + "learning_rate": 4.196280991735537e-07, + "logits/chosen": -0.21875, + "logits/rejected": -0.37109375, + "logps/chosen": -402.0, + "logps/rejected": -336.0, + "loss": 0.2323, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.15625, + "rewards/margins": 5.34375, + "rewards/rejected": -4.1875, + "step": 414 + }, + { + "epoch": 0.50920245398773, + "grad_norm": 34.655790564533014, + "learning_rate": 4.1942148760330576e-07, + "logits/chosen": -0.1796875, + "logits/rejected": -0.36328125, + "logps/chosen": -346.0, + "logps/rejected": -310.0, + "loss": 0.2656, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.90625, + "rewards/margins": 5.03125, + "rewards/rejected": -4.125, + "step": 415 + }, + { + "epoch": 0.5104294478527608, + "grad_norm": 32.98043530408525, + "learning_rate": 4.1921487603305786e-07, + "logits/chosen": -0.154296875, + "logits/rejected": -0.375, + "logps/chosen": -360.0, + "logps/rejected": -304.0, + "loss": 0.2198, + "rewards/accuracies": 0.890625, + "rewards/chosen": 0.62109375, + "rewards/margins": 4.75, + "rewards/rejected": -4.125, + "step": 416 + }, + { + "epoch": 0.5116564417177915, + "grad_norm": 36.96587452637558, + "learning_rate": 4.190082644628099e-07, + "logits/chosen": -0.3515625, + "logits/rejected": -0.53125, + "logps/chosen": -436.0, + "logps/rejected": -362.0, + "loss": 0.2649, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.6484375, + "rewards/margins": 6.28125, + "rewards/rejected": -4.65625, + "step": 417 + }, + { + "epoch": 0.5128834355828221, + "grad_norm": 34.4789260314332, + "learning_rate": 4.1880165289256195e-07, + "logits/chosen": -0.267578125, + "logits/rejected": -0.373046875, + "logps/chosen": -364.0, + "logps/rejected": -284.0, + "loss": 0.2518, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.1484375, + "rewards/margins": 5.40625, + "rewards/rejected": -4.25, + "step": 418 + }, + { + "epoch": 0.5141104294478528, + "grad_norm": 34.78381462111674, + "learning_rate": 4.1859504132231405e-07, + "logits/chosen": -0.2109375, + "logits/rejected": -0.3828125, + "logps/chosen": -378.0, + "logps/rejected": -320.0, + "loss": 0.2278, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.1484375, + "rewards/margins": 5.71875, + "rewards/rejected": -4.5625, + "step": 419 + }, + { + "epoch": 0.5153374233128835, + "grad_norm": 39.079403507615055, + "learning_rate": 4.183884297520661e-07, + "logits/chosen": -0.1494140625, + "logits/rejected": -0.326171875, + "logps/chosen": -344.0, + "logps/rejected": -294.0, + "loss": 0.3113, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.03125, + "rewards/margins": 4.84375, + "rewards/rejected": -3.8125, + "step": 420 + }, + { + "epoch": 0.5165644171779141, + "grad_norm": 34.54058833309064, + "learning_rate": 4.1818181818181814e-07, + "logits/chosen": -0.1943359375, + "logits/rejected": -0.3984375, + "logps/chosen": -362.0, + "logps/rejected": -302.0, + "loss": 0.3077, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.34375, + "rewards/margins": 5.21875, + "rewards/rejected": -3.875, + "step": 421 + }, + { + "epoch": 0.5177914110429448, + "grad_norm": 36.04776328314745, + "learning_rate": 4.179752066115702e-07, + "logits/chosen": -0.1171875, + "logits/rejected": -0.287109375, + "logps/chosen": -356.0, + "logps/rejected": -282.0, + "loss": 0.2784, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.9609375, + "rewards/margins": 5.125, + "rewards/rejected": -4.15625, + "step": 422 + }, + { + "epoch": 0.5190184049079755, + "grad_norm": 43.01937925233782, + "learning_rate": 4.177685950413223e-07, + "logits/chosen": -0.232421875, + "logits/rejected": -0.40234375, + "logps/chosen": -396.0, + "logps/rejected": -346.0, + "loss": 0.3382, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.82421875, + "rewards/margins": 4.6875, + "rewards/rejected": -3.859375, + "step": 423 + }, + { + "epoch": 0.5202453987730061, + "grad_norm": 36.48453900377271, + "learning_rate": 4.1756198347107434e-07, + "logits/chosen": -0.1611328125, + "logits/rejected": -0.365234375, + "logps/chosen": -378.0, + "logps/rejected": -328.0, + "loss": 0.3126, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.2421875, + "rewards/margins": 5.625, + "rewards/rejected": -4.375, + "step": 424 + }, + { + "epoch": 0.5214723926380368, + "grad_norm": 41.79473108392073, + "learning_rate": 4.1735537190082644e-07, + "logits/chosen": -0.193359375, + "logits/rejected": -0.318359375, + "logps/chosen": -394.0, + "logps/rejected": -332.0, + "loss": 0.3372, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.5078125, + "rewards/margins": 5.40625, + "rewards/rejected": -3.90625, + "step": 425 + }, + { + "epoch": 0.5226993865030675, + "grad_norm": 48.26366364465108, + "learning_rate": 4.171487603305785e-07, + "logits/chosen": -0.2412109375, + "logits/rejected": -0.376953125, + "logps/chosen": -368.0, + "logps/rejected": -330.0, + "loss": 0.2573, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.3203125, + "rewards/margins": 5.625, + "rewards/rejected": -4.28125, + "step": 426 + }, + { + "epoch": 0.5239263803680981, + "grad_norm": 99.7573372246345, + "learning_rate": 4.169421487603306e-07, + "logits/chosen": -0.1982421875, + "logits/rejected": -0.3125, + "logps/chosen": -376.0, + "logps/rejected": -318.0, + "loss": 0.2668, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.3046875, + "rewards/margins": 5.34375, + "rewards/rejected": -4.03125, + "step": 427 + }, + { + "epoch": 0.5251533742331288, + "grad_norm": 37.06815581413299, + "learning_rate": 4.1673553719008263e-07, + "logits/chosen": -0.224609375, + "logits/rejected": -0.357421875, + "logps/chosen": -360.0, + "logps/rejected": -306.0, + "loss": 0.3028, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.890625, + "rewards/margins": 5.0, + "rewards/rejected": -4.125, + "step": 428 + }, + { + "epoch": 0.5263803680981595, + "grad_norm": 33.97292039326683, + "learning_rate": 4.1652892561983473e-07, + "logits/chosen": -0.224609375, + "logits/rejected": -0.34765625, + "logps/chosen": -356.0, + "logps/rejected": -352.0, + "loss": 0.243, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.82421875, + "rewards/margins": 5.875, + "rewards/rejected": -5.0625, + "step": 429 + }, + { + "epoch": 0.5276073619631901, + "grad_norm": 29.82247469458647, + "learning_rate": 4.163223140495867e-07, + "logits/chosen": -0.287109375, + "logits/rejected": -0.46484375, + "logps/chosen": -392.0, + "logps/rejected": -332.0, + "loss": 0.1971, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.1953125, + "rewards/margins": 5.96875, + "rewards/rejected": -4.78125, + "step": 430 + }, + { + "epoch": 0.5288343558282208, + "grad_norm": 50.10617111263047, + "learning_rate": 4.161157024793388e-07, + "logits/chosen": -0.1787109375, + "logits/rejected": -0.3515625, + "logps/chosen": -380.0, + "logps/rejected": -326.0, + "loss": 0.3808, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.7109375, + "rewards/margins": 4.90625, + "rewards/rejected": -4.21875, + "step": 431 + }, + { + "epoch": 0.5300613496932516, + "grad_norm": 46.34719786232677, + "learning_rate": 4.1590909090909087e-07, + "logits/chosen": -0.1328125, + "logits/rejected": -0.185546875, + "logps/chosen": -376.0, + "logps/rejected": -334.0, + "loss": 0.3379, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.3359375, + "rewards/margins": 5.25, + "rewards/rejected": -3.921875, + "step": 432 + }, + { + "epoch": 0.5312883435582823, + "grad_norm": 42.692948753426734, + "learning_rate": 4.1570247933884297e-07, + "logits/chosen": -0.1181640625, + "logits/rejected": -0.33984375, + "logps/chosen": -382.0, + "logps/rejected": -298.0, + "loss": 0.3119, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.55078125, + "rewards/margins": 4.96875, + "rewards/rejected": -4.40625, + "step": 433 + }, + { + "epoch": 0.5325153374233129, + "grad_norm": 39.50920458351492, + "learning_rate": 4.15495867768595e-07, + "logits/chosen": -0.263671875, + "logits/rejected": -0.36328125, + "logps/chosen": -384.0, + "logps/rejected": -338.0, + "loss": 0.2357, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.61328125, + "rewards/margins": 5.125, + "rewards/rejected": -4.5, + "step": 434 + }, + { + "epoch": 0.5337423312883436, + "grad_norm": 41.38331544820595, + "learning_rate": 4.1528925619834707e-07, + "logits/chosen": -0.201171875, + "logits/rejected": -0.416015625, + "logps/chosen": -386.0, + "logps/rejected": -340.0, + "loss": 0.2711, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.140625, + "rewards/margins": 5.65625, + "rewards/rejected": -4.53125, + "step": 435 + }, + { + "epoch": 0.5349693251533743, + "grad_norm": 39.363819944524835, + "learning_rate": 4.1508264462809917e-07, + "logits/chosen": -0.2099609375, + "logits/rejected": -0.423828125, + "logps/chosen": -416.0, + "logps/rejected": -336.0, + "loss": 0.2469, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.6796875, + "rewards/margins": 6.28125, + "rewards/rejected": -4.59375, + "step": 436 + }, + { + "epoch": 0.5361963190184049, + "grad_norm": 32.4215285898728, + "learning_rate": 4.148760330578512e-07, + "logits/chosen": -0.2431640625, + "logits/rejected": -0.4296875, + "logps/chosen": -382.0, + "logps/rejected": -328.0, + "loss": 0.2367, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.109375, + "rewards/margins": 5.8125, + "rewards/rejected": -4.6875, + "step": 437 + }, + { + "epoch": 0.5374233128834356, + "grad_norm": 41.11999044241744, + "learning_rate": 4.146694214876033e-07, + "logits/chosen": -0.16796875, + "logits/rejected": -0.279296875, + "logps/chosen": -358.0, + "logps/rejected": -314.0, + "loss": 0.3424, + "rewards/accuracies": 0.796875, + "rewards/chosen": 0.859375, + "rewards/margins": 4.59375, + "rewards/rejected": -3.734375, + "step": 438 + }, + { + "epoch": 0.5386503067484663, + "grad_norm": 36.95463031219475, + "learning_rate": 4.144628099173553e-07, + "logits/chosen": -0.1181640625, + "logits/rejected": -0.32421875, + "logps/chosen": -364.0, + "logps/rejected": -326.0, + "loss": 0.2791, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.7734375, + "rewards/margins": 5.21875, + "rewards/rejected": -4.46875, + "step": 439 + }, + { + "epoch": 0.5398773006134969, + "grad_norm": 49.69926246487377, + "learning_rate": 4.142561983471074e-07, + "logits/chosen": -0.166015625, + "logits/rejected": -0.271484375, + "logps/chosen": -384.0, + "logps/rejected": -326.0, + "loss": 0.3218, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.35546875, + "rewards/margins": 4.40625, + "rewards/rejected": -4.03125, + "step": 440 + }, + { + "epoch": 0.5411042944785276, + "grad_norm": 39.707681073149594, + "learning_rate": 4.1404958677685946e-07, + "logits/chosen": -0.107421875, + "logits/rejected": -0.224609375, + "logps/chosen": -332.0, + "logps/rejected": -292.0, + "loss": 0.2837, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.69140625, + "rewards/margins": 4.78125, + "rewards/rejected": -4.09375, + "step": 441 + }, + { + "epoch": 0.5423312883435583, + "grad_norm": 38.960801334852974, + "learning_rate": 4.1384297520661156e-07, + "logits/chosen": -0.24609375, + "logits/rejected": -0.3828125, + "logps/chosen": -384.0, + "logps/rejected": -334.0, + "loss": 0.3027, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.0234375, + "rewards/margins": 5.21875, + "rewards/rejected": -4.1875, + "step": 442 + }, + { + "epoch": 0.5435582822085889, + "grad_norm": 42.815669493727604, + "learning_rate": 4.136363636363636e-07, + "logits/chosen": -0.193359375, + "logits/rejected": -0.33203125, + "logps/chosen": -366.0, + "logps/rejected": -312.0, + "loss": 0.303, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.2734375, + "rewards/margins": 5.25, + "rewards/rejected": -4.0, + "step": 443 + }, + { + "epoch": 0.5447852760736196, + "grad_norm": 35.80955378025667, + "learning_rate": 4.134297520661157e-07, + "logits/chosen": -0.234375, + "logits/rejected": -0.47265625, + "logps/chosen": -448.0, + "logps/rejected": -360.0, + "loss": 0.2204, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.84375, + "rewards/margins": 6.40625, + "rewards/rejected": -4.5625, + "step": 444 + }, + { + "epoch": 0.5460122699386503, + "grad_norm": 38.126966452680875, + "learning_rate": 4.1322314049586775e-07, + "logits/chosen": -0.2060546875, + "logits/rejected": -0.388671875, + "logps/chosen": -352.0, + "logps/rejected": -296.0, + "loss": 0.3507, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.1328125, + "rewards/margins": 4.9375, + "rewards/rejected": -3.8125, + "step": 445 + }, + { + "epoch": 0.5472392638036809, + "grad_norm": 35.409001850251684, + "learning_rate": 4.1301652892561985e-07, + "logits/chosen": -0.21875, + "logits/rejected": -0.3984375, + "logps/chosen": -434.0, + "logps/rejected": -352.0, + "loss": 0.2334, + "rewards/accuracies": 0.90625, + "rewards/chosen": 1.171875, + "rewards/margins": 5.0625, + "rewards/rejected": -3.875, + "step": 446 + }, + { + "epoch": 0.5484662576687117, + "grad_norm": 37.030505301448606, + "learning_rate": 4.128099173553719e-07, + "logits/chosen": -0.20703125, + "logits/rejected": -0.421875, + "logps/chosen": -412.0, + "logps/rejected": -340.0, + "loss": 0.2524, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.5625, + "rewards/margins": 6.3125, + "rewards/rejected": -4.75, + "step": 447 + }, + { + "epoch": 0.5496932515337424, + "grad_norm": 40.14683673248258, + "learning_rate": 4.1260330578512394e-07, + "logits/chosen": -0.1435546875, + "logits/rejected": -0.298828125, + "logps/chosen": -342.0, + "logps/rejected": -296.0, + "loss": 0.3068, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.60546875, + "rewards/margins": 4.59375, + "rewards/rejected": -4.0, + "step": 448 + }, + { + "epoch": 0.550920245398773, + "grad_norm": 36.49625976131608, + "learning_rate": 4.12396694214876e-07, + "logits/chosen": -0.2119140625, + "logits/rejected": -0.365234375, + "logps/chosen": -396.0, + "logps/rejected": -326.0, + "loss": 0.257, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.5234375, + "rewards/margins": 5.78125, + "rewards/rejected": -4.25, + "step": 449 + }, + { + "epoch": 0.5521472392638037, + "grad_norm": 36.243221597677895, + "learning_rate": 4.121900826446281e-07, + "logits/chosen": -0.2890625, + "logits/rejected": -0.34765625, + "logps/chosen": -348.0, + "logps/rejected": -284.0, + "loss": 0.2672, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.94921875, + "rewards/margins": 5.25, + "rewards/rejected": -4.28125, + "step": 450 + }, + { + "epoch": 0.5533742331288344, + "grad_norm": 32.1407046295721, + "learning_rate": 4.1198347107438014e-07, + "logits/chosen": -0.1650390625, + "logits/rejected": -0.353515625, + "logps/chosen": -344.0, + "logps/rejected": -278.0, + "loss": 0.2477, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.9375, + "rewards/margins": 5.15625, + "rewards/rejected": -4.21875, + "step": 451 + }, + { + "epoch": 0.554601226993865, + "grad_norm": 42.28873095520698, + "learning_rate": 4.1177685950413224e-07, + "logits/chosen": -0.2236328125, + "logits/rejected": -0.484375, + "logps/chosen": -460.0, + "logps/rejected": -326.0, + "loss": 0.2747, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.9140625, + "rewards/margins": 5.90625, + "rewards/rejected": -4.0, + "step": 452 + }, + { + "epoch": 0.5558282208588957, + "grad_norm": 32.36959074636312, + "learning_rate": 4.115702479338843e-07, + "logits/chosen": -0.29296875, + "logits/rejected": -0.5234375, + "logps/chosen": -440.0, + "logps/rejected": -362.0, + "loss": 0.1965, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 2.109375, + "rewards/margins": 6.5, + "rewards/rejected": -4.375, + "step": 453 + }, + { + "epoch": 0.5570552147239264, + "grad_norm": 37.72144307940475, + "learning_rate": 4.1136363636363633e-07, + "logits/chosen": -0.1572265625, + "logits/rejected": -0.248046875, + "logps/chosen": -340.0, + "logps/rejected": -302.0, + "loss": 0.2824, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.67578125, + "rewards/margins": 4.84375, + "rewards/rejected": -4.15625, + "step": 454 + }, + { + "epoch": 0.558282208588957, + "grad_norm": 36.8405329111992, + "learning_rate": 4.1115702479338843e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.400390625, + "logps/chosen": -370.0, + "logps/rejected": -344.0, + "loss": 0.2387, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.65625, + "rewards/margins": 5.9375, + "rewards/rejected": -4.28125, + "step": 455 + }, + { + "epoch": 0.5595092024539877, + "grad_norm": 38.28626472369992, + "learning_rate": 4.109504132231405e-07, + "logits/chosen": -0.1533203125, + "logits/rejected": -0.259765625, + "logps/chosen": -314.0, + "logps/rejected": -296.0, + "loss": 0.2614, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.9921875, + "rewards/margins": 5.5, + "rewards/rejected": -4.53125, + "step": 456 + }, + { + "epoch": 0.5607361963190184, + "grad_norm": 37.602299554825706, + "learning_rate": 4.1074380165289253e-07, + "logits/chosen": -0.1865234375, + "logits/rejected": -0.326171875, + "logps/chosen": -354.0, + "logps/rejected": -312.0, + "loss": 0.2718, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.1484375, + "rewards/margins": 5.0, + "rewards/rejected": -3.84375, + "step": 457 + }, + { + "epoch": 0.561963190184049, + "grad_norm": 34.248759383891915, + "learning_rate": 4.105371900826446e-07, + "logits/chosen": -0.203125, + "logits/rejected": -0.375, + "logps/chosen": -372.0, + "logps/rejected": -282.0, + "loss": 0.2095, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.671875, + "rewards/margins": 6.03125, + "rewards/rejected": -4.34375, + "step": 458 + }, + { + "epoch": 0.5631901840490797, + "grad_norm": 36.02884511565117, + "learning_rate": 4.103305785123967e-07, + "logits/chosen": -0.1923828125, + "logits/rejected": -0.37109375, + "logps/chosen": -390.0, + "logps/rejected": -334.0, + "loss": 0.2657, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.6875, + "rewards/margins": 5.875, + "rewards/rejected": -4.1875, + "step": 459 + }, + { + "epoch": 0.5644171779141104, + "grad_norm": 39.138490077598576, + "learning_rate": 4.101239669421487e-07, + "logits/chosen": -0.19140625, + "logits/rejected": -0.3046875, + "logps/chosen": -348.0, + "logps/rejected": -318.0, + "loss": 0.2605, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 0.8125, + "rewards/margins": 5.75, + "rewards/rejected": -4.9375, + "step": 460 + }, + { + "epoch": 0.5656441717791411, + "grad_norm": 42.1658732163214, + "learning_rate": 4.099173553719008e-07, + "logits/chosen": -0.37890625, + "logits/rejected": -0.5078125, + "logps/chosen": -372.0, + "logps/rejected": -332.0, + "loss": 0.2725, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.9765625, + "rewards/margins": 5.3125, + "rewards/rejected": -4.34375, + "step": 461 + }, + { + "epoch": 0.5668711656441717, + "grad_norm": 41.91165523140955, + "learning_rate": 4.0971074380165287e-07, + "logits/chosen": -0.1474609375, + "logits/rejected": -0.34375, + "logps/chosen": -360.0, + "logps/rejected": -288.0, + "loss": 0.3075, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.8203125, + "rewards/margins": 4.625, + "rewards/rejected": -3.8125, + "step": 462 + }, + { + "epoch": 0.5680981595092025, + "grad_norm": 38.69169820185617, + "learning_rate": 4.0950413223140497e-07, + "logits/chosen": -0.248046875, + "logits/rejected": -0.365234375, + "logps/chosen": -362.0, + "logps/rejected": -348.0, + "loss": 0.2766, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.15625, + "rewards/margins": 5.5, + "rewards/rejected": -4.34375, + "step": 463 + }, + { + "epoch": 0.5693251533742332, + "grad_norm": 43.91810675336078, + "learning_rate": 4.09297520661157e-07, + "logits/chosen": -0.12890625, + "logits/rejected": -0.314453125, + "logps/chosen": -390.0, + "logps/rejected": -310.0, + "loss": 0.2966, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.0, + "rewards/margins": 5.28125, + "rewards/rejected": -4.28125, + "step": 464 + }, + { + "epoch": 0.5705521472392638, + "grad_norm": 33.81460512528705, + "learning_rate": 4.090909090909091e-07, + "logits/chosen": -0.2451171875, + "logits/rejected": -0.482421875, + "logps/chosen": -398.0, + "logps/rejected": -332.0, + "loss": 0.1974, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.21875, + "rewards/margins": 5.96875, + "rewards/rejected": -4.75, + "step": 465 + }, + { + "epoch": 0.5717791411042945, + "grad_norm": 43.114669278637464, + "learning_rate": 4.088842975206611e-07, + "logits/chosen": -0.1923828125, + "logits/rejected": -0.33203125, + "logps/chosen": -416.0, + "logps/rejected": -330.0, + "loss": 0.2803, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.921875, + "rewards/margins": 5.6875, + "rewards/rejected": -4.75, + "step": 466 + }, + { + "epoch": 0.5730061349693252, + "grad_norm": 41.26777561271183, + "learning_rate": 4.086776859504132e-07, + "logits/chosen": -0.201171875, + "logits/rejected": -0.4296875, + "logps/chosen": -384.0, + "logps/rejected": -342.0, + "loss": 0.2918, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.2734375, + "rewards/margins": 5.59375, + "rewards/rejected": -4.34375, + "step": 467 + }, + { + "epoch": 0.5742331288343558, + "grad_norm": 46.80452187024971, + "learning_rate": 4.0847107438016526e-07, + "logits/chosen": -0.2041015625, + "logits/rejected": -0.357421875, + "logps/chosen": -366.0, + "logps/rejected": -336.0, + "loss": 0.2962, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.0703125, + "rewards/margins": 5.875, + "rewards/rejected": -4.8125, + "step": 468 + }, + { + "epoch": 0.5754601226993865, + "grad_norm": 35.72783758477153, + "learning_rate": 4.0826446280991736e-07, + "logits/chosen": -0.1611328125, + "logits/rejected": -0.341796875, + "logps/chosen": -386.0, + "logps/rejected": -296.0, + "loss": 0.194, + "rewards/accuracies": 0.9140625, + "rewards/chosen": 1.203125, + "rewards/margins": 5.96875, + "rewards/rejected": -4.78125, + "step": 469 + }, + { + "epoch": 0.5766871165644172, + "grad_norm": 36.63750325467396, + "learning_rate": 4.080578512396694e-07, + "logits/chosen": -0.1904296875, + "logits/rejected": -0.279296875, + "logps/chosen": -352.0, + "logps/rejected": -316.0, + "loss": 0.2875, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.1875, + "rewards/margins": 5.8125, + "rewards/rejected": -4.625, + "step": 470 + }, + { + "epoch": 0.5779141104294478, + "grad_norm": 41.264612609731145, + "learning_rate": 4.0785123966942145e-07, + "logits/chosen": -0.07373046875, + "logits/rejected": -0.2451171875, + "logps/chosen": -402.0, + "logps/rejected": -328.0, + "loss": 0.2914, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.94140625, + "rewards/margins": 5.28125, + "rewards/rejected": -4.34375, + "step": 471 + }, + { + "epoch": 0.5791411042944785, + "grad_norm": 45.183894833304514, + "learning_rate": 4.0764462809917355e-07, + "logits/chosen": -0.126953125, + "logits/rejected": -0.34765625, + "logps/chosen": -408.0, + "logps/rejected": -314.0, + "loss": 0.2808, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.078125, + "rewards/margins": 5.53125, + "rewards/rejected": -4.4375, + "step": 472 + }, + { + "epoch": 0.5803680981595092, + "grad_norm": 43.25551760993764, + "learning_rate": 4.074380165289256e-07, + "logits/chosen": -0.287109375, + "logits/rejected": -0.4140625, + "logps/chosen": -398.0, + "logps/rejected": -370.0, + "loss": 0.2992, + "rewards/accuracies": 0.796875, + "rewards/chosen": 1.078125, + "rewards/margins": 5.3125, + "rewards/rejected": -4.25, + "step": 473 + }, + { + "epoch": 0.5815950920245399, + "grad_norm": 36.874064189408784, + "learning_rate": 4.072314049586777e-07, + "logits/chosen": -0.25, + "logits/rejected": -0.4609375, + "logps/chosen": -430.0, + "logps/rejected": -338.0, + "loss": 0.2515, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.984375, + "rewards/margins": 5.5, + "rewards/rejected": -4.53125, + "step": 474 + }, + { + "epoch": 0.5828220858895705, + "grad_norm": 33.97530110519338, + "learning_rate": 4.070247933884297e-07, + "logits/chosen": -0.232421875, + "logits/rejected": -0.45703125, + "logps/chosen": -426.0, + "logps/rejected": -338.0, + "loss": 0.2189, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.8828125, + "rewards/margins": 6.6875, + "rewards/rejected": -4.8125, + "step": 475 + }, + { + "epoch": 0.5840490797546012, + "grad_norm": 32.31826742696185, + "learning_rate": 4.068181818181818e-07, + "logits/chosen": -0.1806640625, + "logits/rejected": -0.373046875, + "logps/chosen": -406.0, + "logps/rejected": -330.0, + "loss": 0.2688, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 0.462890625, + "rewards/margins": 5.125, + "rewards/rejected": -4.65625, + "step": 476 + }, + { + "epoch": 0.5852760736196319, + "grad_norm": 36.47831028156178, + "learning_rate": 4.0661157024793384e-07, + "logits/chosen": -0.287109375, + "logits/rejected": -0.439453125, + "logps/chosen": -418.0, + "logps/rejected": -342.0, + "loss": 0.2274, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.5625, + "rewards/margins": 6.28125, + "rewards/rejected": -4.71875, + "step": 477 + }, + { + "epoch": 0.5865030674846625, + "grad_norm": 38.16498737596341, + "learning_rate": 4.0640495867768594e-07, + "logits/chosen": -0.205078125, + "logits/rejected": -0.380859375, + "logps/chosen": -418.0, + "logps/rejected": -338.0, + "loss": 0.2857, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.2265625, + "rewards/margins": 5.9375, + "rewards/rejected": -4.71875, + "step": 478 + }, + { + "epoch": 0.5877300613496933, + "grad_norm": 41.81318374412193, + "learning_rate": 4.06198347107438e-07, + "logits/chosen": -0.2060546875, + "logits/rejected": -0.462890625, + "logps/chosen": -352.0, + "logps/rejected": -324.0, + "loss": 0.2644, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.58203125, + "rewards/margins": 5.46875, + "rewards/rejected": -4.90625, + "step": 479 + }, + { + "epoch": 0.588957055214724, + "grad_norm": 34.21678743382818, + "learning_rate": 4.059917355371901e-07, + "logits/chosen": -0.251953125, + "logits/rejected": -0.38671875, + "logps/chosen": -356.0, + "logps/rejected": -318.0, + "loss": 0.2258, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.68359375, + "rewards/margins": 5.6875, + "rewards/rejected": -5.0, + "step": 480 + }, + { + "epoch": 0.5901840490797546, + "grad_norm": 41.214709064982436, + "learning_rate": 4.0578512396694213e-07, + "logits/chosen": -0.25, + "logits/rejected": -0.376953125, + "logps/chosen": -424.0, + "logps/rejected": -370.0, + "loss": 0.3414, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.94921875, + "rewards/margins": 5.5, + "rewards/rejected": -4.5625, + "step": 481 + }, + { + "epoch": 0.5914110429447853, + "grad_norm": 34.07376051032277, + "learning_rate": 4.0557851239669423e-07, + "logits/chosen": -0.2431640625, + "logits/rejected": -0.416015625, + "logps/chosen": -410.0, + "logps/rejected": -326.0, + "loss": 0.269, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.0859375, + "rewards/margins": 5.71875, + "rewards/rejected": -4.65625, + "step": 482 + }, + { + "epoch": 0.592638036809816, + "grad_norm": 37.03436000175101, + "learning_rate": 4.053719008264463e-07, + "logits/chosen": -0.11572265625, + "logits/rejected": -0.263671875, + "logps/chosen": -346.0, + "logps/rejected": -304.0, + "loss": 0.2869, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.71484375, + "rewards/margins": 5.375, + "rewards/rejected": -4.65625, + "step": 483 + }, + { + "epoch": 0.5938650306748466, + "grad_norm": 37.50453607778557, + "learning_rate": 4.0516528925619833e-07, + "logits/chosen": -0.1953125, + "logits/rejected": -0.349609375, + "logps/chosen": -370.0, + "logps/rejected": -318.0, + "loss": 0.3017, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.171875, + "rewards/margins": 5.375, + "rewards/rejected": -4.21875, + "step": 484 + }, + { + "epoch": 0.5950920245398773, + "grad_norm": 35.082772186969954, + "learning_rate": 4.049586776859504e-07, + "logits/chosen": -0.16796875, + "logits/rejected": -0.31640625, + "logps/chosen": -360.0, + "logps/rejected": -298.0, + "loss": 0.2666, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.6796875, + "rewards/margins": 5.53125, + "rewards/rejected": -4.84375, + "step": 485 + }, + { + "epoch": 0.596319018404908, + "grad_norm": 34.67777878301507, + "learning_rate": 4.047520661157025e-07, + "logits/chosen": -0.1923828125, + "logits/rejected": -0.33203125, + "logps/chosen": -404.0, + "logps/rejected": -330.0, + "loss": 0.2405, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.28125, + "rewards/margins": 5.625, + "rewards/rejected": -4.34375, + "step": 486 + }, + { + "epoch": 0.5975460122699386, + "grad_norm": 36.99824119978169, + "learning_rate": 4.045454545454545e-07, + "logits/chosen": -0.24609375, + "logits/rejected": -0.458984375, + "logps/chosen": -404.0, + "logps/rejected": -344.0, + "loss": 0.2534, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.96875, + "rewards/margins": 6.0, + "rewards/rejected": -5.0, + "step": 487 + }, + { + "epoch": 0.5987730061349693, + "grad_norm": 47.34405656815455, + "learning_rate": 4.0433884297520657e-07, + "logits/chosen": -0.25390625, + "logits/rejected": -0.33984375, + "logps/chosen": -420.0, + "logps/rejected": -354.0, + "loss": 0.2559, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.9375, + "rewards/margins": 5.625, + "rewards/rejected": -4.6875, + "step": 488 + }, + { + "epoch": 0.6, + "grad_norm": 32.18985964645197, + "learning_rate": 4.0413223140495867e-07, + "logits/chosen": -0.171875, + "logits/rejected": -0.421875, + "logps/chosen": -380.0, + "logps/rejected": -320.0, + "loss": 0.2603, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.4609375, + "rewards/margins": 6.375, + "rewards/rejected": -4.90625, + "step": 489 + }, + { + "epoch": 0.6012269938650306, + "grad_norm": 41.3641809975054, + "learning_rate": 4.039256198347107e-07, + "logits/chosen": -0.14453125, + "logits/rejected": -0.369140625, + "logps/chosen": -424.0, + "logps/rejected": -346.0, + "loss": 0.2435, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 0.9609375, + "rewards/margins": 5.78125, + "rewards/rejected": -4.8125, + "step": 490 + }, + { + "epoch": 0.6024539877300613, + "grad_norm": 36.929475951535615, + "learning_rate": 4.037190082644628e-07, + "logits/chosen": -0.1279296875, + "logits/rejected": -0.3359375, + "logps/chosen": -368.0, + "logps/rejected": -312.0, + "loss": 0.2468, + "rewards/accuracies": 0.9140625, + "rewards/chosen": 0.76953125, + "rewards/margins": 5.71875, + "rewards/rejected": -4.9375, + "step": 491 + }, + { + "epoch": 0.603680981595092, + "grad_norm": 34.25022073617326, + "learning_rate": 4.0351239669421486e-07, + "logits/chosen": -0.212890625, + "logits/rejected": -0.36328125, + "logps/chosen": -394.0, + "logps/rejected": -374.0, + "loss": 0.2476, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 0.82421875, + "rewards/margins": 5.4375, + "rewards/rejected": -4.625, + "step": 492 + }, + { + "epoch": 0.6049079754601226, + "grad_norm": 44.528399584764976, + "learning_rate": 4.033057851239669e-07, + "logits/chosen": -0.07275390625, + "logits/rejected": -0.18359375, + "logps/chosen": -388.0, + "logps/rejected": -324.0, + "loss": 0.3692, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.67578125, + "rewards/margins": 4.5625, + "rewards/rejected": -3.890625, + "step": 493 + }, + { + "epoch": 0.6061349693251534, + "grad_norm": 33.0051523964255, + "learning_rate": 4.0309917355371896e-07, + "logits/chosen": -0.1591796875, + "logits/rejected": -0.345703125, + "logps/chosen": -426.0, + "logps/rejected": -326.0, + "loss": 0.2292, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.4921875, + "rewards/margins": 6.3125, + "rewards/rejected": -4.8125, + "step": 494 + }, + { + "epoch": 0.6073619631901841, + "grad_norm": 36.62725418587262, + "learning_rate": 4.0289256198347106e-07, + "logits/chosen": -0.16796875, + "logits/rejected": -0.32421875, + "logps/chosen": -400.0, + "logps/rejected": -336.0, + "loss": 0.2572, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.2265625, + "rewards/margins": 5.9375, + "rewards/rejected": -4.71875, + "step": 495 + }, + { + "epoch": 0.6085889570552148, + "grad_norm": 42.16049484237724, + "learning_rate": 4.026859504132231e-07, + "logits/chosen": -0.2138671875, + "logits/rejected": -0.431640625, + "logps/chosen": -378.0, + "logps/rejected": -312.0, + "loss": 0.3108, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.53515625, + "rewards/margins": 5.46875, + "rewards/rejected": -4.90625, + "step": 496 + }, + { + "epoch": 0.6098159509202454, + "grad_norm": 45.47382251482463, + "learning_rate": 4.024793388429752e-07, + "logits/chosen": -0.1669921875, + "logits/rejected": -0.337890625, + "logps/chosen": -400.0, + "logps/rejected": -352.0, + "loss": 0.3664, + "rewards/accuracies": 0.7734375, + "rewards/chosen": 0.51953125, + "rewards/margins": 5.5, + "rewards/rejected": -4.96875, + "step": 497 + }, + { + "epoch": 0.6110429447852761, + "grad_norm": 35.6433892815013, + "learning_rate": 4.0227272727272725e-07, + "logits/chosen": -0.28515625, + "logits/rejected": -0.46484375, + "logps/chosen": -398.0, + "logps/rejected": -354.0, + "loss": 0.2458, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.171875, + "rewards/margins": 6.4375, + "rewards/rejected": -5.25, + "step": 498 + }, + { + "epoch": 0.6122699386503068, + "grad_norm": 37.060767498257135, + "learning_rate": 4.0206611570247935e-07, + "logits/chosen": -0.1630859375, + "logits/rejected": -0.388671875, + "logps/chosen": -424.0, + "logps/rejected": -336.0, + "loss": 0.2685, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.09375, + "rewards/margins": 5.8125, + "rewards/rejected": -4.71875, + "step": 499 + }, + { + "epoch": 0.6134969325153374, + "grad_norm": 35.21143709339605, + "learning_rate": 4.018595041322314e-07, + "logits/chosen": -0.189453125, + "logits/rejected": -0.314453125, + "logps/chosen": -418.0, + "logps/rejected": -322.0, + "loss": 0.2498, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.15625, + "rewards/margins": 5.90625, + "rewards/rejected": -4.75, + "step": 500 + }, + { + "epoch": 0.6147239263803681, + "grad_norm": 39.07038484978643, + "learning_rate": 4.0165289256198345e-07, + "logits/chosen": -0.240234375, + "logits/rejected": -0.373046875, + "logps/chosen": -406.0, + "logps/rejected": -338.0, + "loss": 0.2402, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.515625, + "rewards/margins": 6.5625, + "rewards/rejected": -5.0625, + "step": 501 + }, + { + "epoch": 0.6159509202453988, + "grad_norm": 34.95433271630032, + "learning_rate": 4.014462809917355e-07, + "logits/chosen": -0.20703125, + "logits/rejected": -0.47265625, + "logps/chosen": -382.0, + "logps/rejected": -322.0, + "loss": 0.2631, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.2109375, + "rewards/margins": 6.46875, + "rewards/rejected": -5.28125, + "step": 502 + }, + { + "epoch": 0.6171779141104294, + "grad_norm": 36.27046530070022, + "learning_rate": 4.012396694214876e-07, + "logits/chosen": -0.0498046875, + "logits/rejected": -0.248046875, + "logps/chosen": -328.0, + "logps/rejected": -306.0, + "loss": 0.2571, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.8515625, + "rewards/margins": 5.53125, + "rewards/rejected": -4.65625, + "step": 503 + }, + { + "epoch": 0.6184049079754601, + "grad_norm": 32.074615531320944, + "learning_rate": 4.0103305785123964e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.44140625, + "logps/chosen": -384.0, + "logps/rejected": -326.0, + "loss": 0.253, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.416015625, + "rewards/margins": 5.34375, + "rewards/rejected": -4.9375, + "step": 504 + }, + { + "epoch": 0.6196319018404908, + "grad_norm": 50.2956600108261, + "learning_rate": 4.0082644628099174e-07, + "logits/chosen": -0.263671875, + "logits/rejected": -0.4921875, + "logps/chosen": -424.0, + "logps/rejected": -384.0, + "loss": 0.3428, + "rewards/accuracies": 0.796875, + "rewards/chosen": 0.40234375, + "rewards/margins": 5.6875, + "rewards/rejected": -5.28125, + "step": 505 + }, + { + "epoch": 0.6208588957055214, + "grad_norm": 39.722486070303646, + "learning_rate": 4.006198347107438e-07, + "logits/chosen": -0.1298828125, + "logits/rejected": -0.423828125, + "logps/chosen": -420.0, + "logps/rejected": -320.0, + "loss": 0.2585, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.93359375, + "rewards/margins": 6.0, + "rewards/rejected": -5.0625, + "step": 506 + }, + { + "epoch": 0.6220858895705521, + "grad_norm": 31.372949248189112, + "learning_rate": 4.0041322314049583e-07, + "logits/chosen": -0.22265625, + "logits/rejected": -0.34375, + "logps/chosen": -386.0, + "logps/rejected": -298.0, + "loss": 0.2085, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.92578125, + "rewards/margins": 6.125, + "rewards/rejected": -5.1875, + "step": 507 + }, + { + "epoch": 0.6233128834355828, + "grad_norm": 31.130400720786195, + "learning_rate": 4.0020661157024793e-07, + "logits/chosen": -0.062255859375, + "logits/rejected": -0.2431640625, + "logps/chosen": -386.0, + "logps/rejected": -300.0, + "loss": 0.2241, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 0.91015625, + "rewards/margins": 5.59375, + "rewards/rejected": -4.6875, + "step": 508 + }, + { + "epoch": 0.6245398773006134, + "grad_norm": 53.16460512064989, + "learning_rate": 4e-07, + "logits/chosen": -0.1962890625, + "logits/rejected": -0.4375, + "logps/chosen": -464.0, + "logps/rejected": -374.0, + "loss": 0.3519, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 2.109375, + "rewards/margins": 7.0625, + "rewards/rejected": -4.9375, + "step": 509 + }, + { + "epoch": 0.6257668711656442, + "grad_norm": 33.530586116590285, + "learning_rate": 3.9979338842975203e-07, + "logits/chosen": -0.30859375, + "logits/rejected": -0.474609375, + "logps/chosen": -358.0, + "logps/rejected": -294.0, + "loss": 0.2436, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 0.609375, + "rewards/margins": 5.15625, + "rewards/rejected": -4.5625, + "step": 510 + }, + { + "epoch": 0.6269938650306749, + "grad_norm": 40.068124237732846, + "learning_rate": 3.995867768595041e-07, + "logits/chosen": -0.30078125, + "logits/rejected": -0.439453125, + "logps/chosen": -390.0, + "logps/rejected": -344.0, + "loss": 0.2864, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.2109375, + "rewards/margins": 6.25, + "rewards/rejected": -5.03125, + "step": 511 + }, + { + "epoch": 0.6282208588957056, + "grad_norm": 46.79446957798848, + "learning_rate": 3.993801652892562e-07, + "logits/chosen": -0.1337890625, + "logits/rejected": -0.28515625, + "logps/chosen": -378.0, + "logps/rejected": -376.0, + "loss": 0.3288, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.5625, + "rewards/margins": 4.6875, + "rewards/rejected": -4.125, + "step": 512 + }, + { + "epoch": 0.6294478527607362, + "grad_norm": 39.156027495649305, + "learning_rate": 3.991735537190082e-07, + "logits/chosen": -0.138671875, + "logits/rejected": -0.283203125, + "logps/chosen": -372.0, + "logps/rejected": -302.0, + "loss": 0.335, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.3515625, + "rewards/margins": 5.71875, + "rewards/rejected": -4.375, + "step": 513 + }, + { + "epoch": 0.6306748466257669, + "grad_norm": 32.5774175879679, + "learning_rate": 3.989669421487603e-07, + "logits/chosen": -0.12353515625, + "logits/rejected": -0.279296875, + "logps/chosen": -326.0, + "logps/rejected": -278.0, + "loss": 0.2532, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.220703125, + "rewards/margins": 5.375, + "rewards/rejected": -5.15625, + "step": 514 + }, + { + "epoch": 0.6319018404907976, + "grad_norm": 40.41320321797794, + "learning_rate": 3.9876033057851237e-07, + "logits/chosen": -0.1376953125, + "logits/rejected": -0.291015625, + "logps/chosen": -344.0, + "logps/rejected": -338.0, + "loss": 0.2856, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.2578125, + "rewards/margins": 5.25, + "rewards/rejected": -5.0, + "step": 515 + }, + { + "epoch": 0.6331288343558282, + "grad_norm": 33.09690635668108, + "learning_rate": 3.9855371900826447e-07, + "logits/chosen": -0.1806640625, + "logits/rejected": -0.27734375, + "logps/chosen": -366.0, + "logps/rejected": -320.0, + "loss": 0.2475, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.404296875, + "rewards/margins": 5.34375, + "rewards/rejected": -4.9375, + "step": 516 + }, + { + "epoch": 0.6343558282208589, + "grad_norm": 45.00347742756972, + "learning_rate": 3.983471074380165e-07, + "logits/chosen": -0.166015625, + "logits/rejected": -0.32421875, + "logps/chosen": -388.0, + "logps/rejected": -326.0, + "loss": 0.3686, + "rewards/accuracies": 0.796875, + "rewards/chosen": 0.7265625, + "rewards/margins": 5.0, + "rewards/rejected": -4.28125, + "step": 517 + }, + { + "epoch": 0.6355828220858896, + "grad_norm": 37.888666954836985, + "learning_rate": 3.981404958677686e-07, + "logits/chosen": -0.2421875, + "logits/rejected": -0.369140625, + "logps/chosen": -414.0, + "logps/rejected": -336.0, + "loss": 0.2069, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.328125, + "rewards/margins": 5.96875, + "rewards/rejected": -4.625, + "step": 518 + }, + { + "epoch": 0.6368098159509202, + "grad_norm": 38.80463867569447, + "learning_rate": 3.979338842975206e-07, + "logits/chosen": -0.2294921875, + "logits/rejected": -0.3671875, + "logps/chosen": -380.0, + "logps/rejected": -328.0, + "loss": 0.2446, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.921875, + "rewards/margins": 5.78125, + "rewards/rejected": -4.875, + "step": 519 + }, + { + "epoch": 0.6380368098159509, + "grad_norm": 40.986581892777515, + "learning_rate": 3.977272727272727e-07, + "logits/chosen": -0.259765625, + "logits/rejected": -0.494140625, + "logps/chosen": -366.0, + "logps/rejected": -320.0, + "loss": 0.3191, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.2265625, + "rewards/margins": 6.3125, + "rewards/rejected": -5.09375, + "step": 520 + }, + { + "epoch": 0.6392638036809816, + "grad_norm": 36.04171128345913, + "learning_rate": 3.9752066115702476e-07, + "logits/chosen": -0.07763671875, + "logits/rejected": -0.2138671875, + "logps/chosen": -412.0, + "logps/rejected": -348.0, + "loss": 0.2642, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.546875, + "rewards/margins": 6.34375, + "rewards/rejected": -4.8125, + "step": 521 + }, + { + "epoch": 0.6404907975460122, + "grad_norm": 36.91350515266316, + "learning_rate": 3.9731404958677686e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.421875, + "logps/chosen": -422.0, + "logps/rejected": -340.0, + "loss": 0.3094, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.15625, + "rewards/margins": 6.46875, + "rewards/rejected": -5.3125, + "step": 522 + }, + { + "epoch": 0.6417177914110429, + "grad_norm": 42.88283547574401, + "learning_rate": 3.971074380165289e-07, + "logits/chosen": -0.1923828125, + "logits/rejected": -0.337890625, + "logps/chosen": -362.0, + "logps/rejected": -316.0, + "loss": 0.3333, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.6171875, + "rewards/margins": 5.09375, + "rewards/rejected": -4.46875, + "step": 523 + }, + { + "epoch": 0.6429447852760736, + "grad_norm": 45.322523177242, + "learning_rate": 3.9690082644628095e-07, + "logits/chosen": -0.1611328125, + "logits/rejected": -0.361328125, + "logps/chosen": -422.0, + "logps/rejected": -350.0, + "loss": 0.3031, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.609375, + "rewards/margins": 5.21875, + "rewards/rejected": -4.59375, + "step": 524 + }, + { + "epoch": 0.6441717791411042, + "grad_norm": 49.70289783132654, + "learning_rate": 3.9669421487603305e-07, + "logits/chosen": -0.1650390625, + "logits/rejected": -0.2294921875, + "logps/chosen": -388.0, + "logps/rejected": -356.0, + "loss": 0.3567, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.578125, + "rewards/margins": 4.8125, + "rewards/rejected": -4.25, + "step": 525 + }, + { + "epoch": 0.645398773006135, + "grad_norm": 36.78598991927111, + "learning_rate": 3.964876033057851e-07, + "logits/chosen": -0.1845703125, + "logits/rejected": -0.3359375, + "logps/chosen": -386.0, + "logps/rejected": -328.0, + "loss": 0.2502, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.98828125, + "rewards/margins": 5.9375, + "rewards/rejected": -4.96875, + "step": 526 + }, + { + "epoch": 0.6466257668711657, + "grad_norm": 36.651686257226466, + "learning_rate": 3.962809917355372e-07, + "logits/chosen": -0.125, + "logits/rejected": -0.345703125, + "logps/chosen": -422.0, + "logps/rejected": -318.0, + "loss": 0.2789, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.85546875, + "rewards/margins": 5.625, + "rewards/rejected": -4.78125, + "step": 527 + }, + { + "epoch": 0.6478527607361964, + "grad_norm": 35.31748764596186, + "learning_rate": 3.960743801652892e-07, + "logits/chosen": -0.2333984375, + "logits/rejected": -0.427734375, + "logps/chosen": -356.0, + "logps/rejected": -314.0, + "loss": 0.2999, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.625, + "rewards/margins": 5.78125, + "rewards/rejected": -5.15625, + "step": 528 + }, + { + "epoch": 0.649079754601227, + "grad_norm": 36.86996860776575, + "learning_rate": 3.958677685950413e-07, + "logits/chosen": -0.19140625, + "logits/rejected": -0.373046875, + "logps/chosen": -338.0, + "logps/rejected": -326.0, + "loss": 0.3236, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.94140625, + "rewards/margins": 5.5625, + "rewards/rejected": -4.625, + "step": 529 + }, + { + "epoch": 0.6503067484662577, + "grad_norm": 40.308596718463534, + "learning_rate": 3.9566115702479334e-07, + "logits/chosen": -0.1611328125, + "logits/rejected": -0.302734375, + "logps/chosen": -358.0, + "logps/rejected": -338.0, + "loss": 0.307, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.1015625, + "rewards/margins": 5.9375, + "rewards/rejected": -4.84375, + "step": 530 + }, + { + "epoch": 0.6515337423312884, + "grad_norm": 34.92823583852622, + "learning_rate": 3.9545454545454544e-07, + "logits/chosen": -0.2265625, + "logits/rejected": -0.400390625, + "logps/chosen": -382.0, + "logps/rejected": -310.0, + "loss": 0.2686, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.046875, + "rewards/margins": 5.5625, + "rewards/rejected": -4.5, + "step": 531 + }, + { + "epoch": 0.652760736196319, + "grad_norm": 35.9537343386399, + "learning_rate": 3.952479338842975e-07, + "logits/chosen": -0.12158203125, + "logits/rejected": -0.263671875, + "logps/chosen": -384.0, + "logps/rejected": -318.0, + "loss": 0.2733, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.91015625, + "rewards/margins": 5.25, + "rewards/rejected": -4.3125, + "step": 532 + }, + { + "epoch": 0.6539877300613497, + "grad_norm": 33.35300325251816, + "learning_rate": 3.950413223140496e-07, + "logits/chosen": -0.275390625, + "logits/rejected": -0.482421875, + "logps/chosen": -404.0, + "logps/rejected": -338.0, + "loss": 0.2339, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.6640625, + "rewards/margins": 6.46875, + "rewards/rejected": -4.78125, + "step": 533 + }, + { + "epoch": 0.6552147239263804, + "grad_norm": 33.59071906368527, + "learning_rate": 3.9483471074380164e-07, + "logits/chosen": -0.1416015625, + "logits/rejected": -0.26953125, + "logps/chosen": -364.0, + "logps/rejected": -316.0, + "loss": 0.2687, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.0, + "rewards/margins": 5.1875, + "rewards/rejected": -4.15625, + "step": 534 + }, + { + "epoch": 0.656441717791411, + "grad_norm": 37.966223525168424, + "learning_rate": 3.9462809917355374e-07, + "logits/chosen": -0.2470703125, + "logits/rejected": -0.3671875, + "logps/chosen": -368.0, + "logps/rejected": -324.0, + "loss": 0.2745, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.359375, + "rewards/margins": 5.15625, + "rewards/rejected": -4.78125, + "step": 535 + }, + { + "epoch": 0.6576687116564417, + "grad_norm": 33.781725934858414, + "learning_rate": 3.944214876033058e-07, + "logits/chosen": -0.19140625, + "logits/rejected": -0.30859375, + "logps/chosen": -386.0, + "logps/rejected": -308.0, + "loss": 0.2154, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.4140625, + "rewards/margins": 6.09375, + "rewards/rejected": -4.6875, + "step": 536 + }, + { + "epoch": 0.6588957055214724, + "grad_norm": 47.92234178996883, + "learning_rate": 3.9421487603305783e-07, + "logits/chosen": -0.1904296875, + "logits/rejected": -0.349609375, + "logps/chosen": -380.0, + "logps/rejected": -302.0, + "loss": 0.3881, + "rewards/accuracies": 0.7734375, + "rewards/chosen": 0.1796875, + "rewards/margins": 4.375, + "rewards/rejected": -4.1875, + "step": 537 + }, + { + "epoch": 0.660122699386503, + "grad_norm": 42.47717470031941, + "learning_rate": 3.940082644628099e-07, + "logits/chosen": -0.150390625, + "logits/rejected": -0.33984375, + "logps/chosen": -396.0, + "logps/rejected": -342.0, + "loss": 0.3398, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.40625, + "rewards/margins": 5.6875, + "rewards/rejected": -4.28125, + "step": 538 + }, + { + "epoch": 0.6613496932515337, + "grad_norm": 37.22523933086588, + "learning_rate": 3.93801652892562e-07, + "logits/chosen": -0.154296875, + "logits/rejected": -0.30078125, + "logps/chosen": -394.0, + "logps/rejected": -334.0, + "loss": 0.2742, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.3203125, + "rewards/margins": 5.1875, + "rewards/rejected": -3.859375, + "step": 539 + }, + { + "epoch": 0.6625766871165644, + "grad_norm": 40.71616745650965, + "learning_rate": 3.93595041322314e-07, + "logits/chosen": -0.1328125, + "logits/rejected": -0.30859375, + "logps/chosen": -390.0, + "logps/rejected": -318.0, + "loss": 0.3006, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.34375, + "rewards/margins": 5.84375, + "rewards/rejected": -4.5, + "step": 540 + }, + { + "epoch": 0.6638036809815951, + "grad_norm": 36.00028869643927, + "learning_rate": 3.933884297520661e-07, + "logits/chosen": -0.1552734375, + "logits/rejected": -0.259765625, + "logps/chosen": -386.0, + "logps/rejected": -340.0, + "loss": 0.2699, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.71875, + "rewards/margins": 4.8125, + "rewards/rejected": -4.09375, + "step": 541 + }, + { + "epoch": 0.6650306748466258, + "grad_norm": 36.856579052467744, + "learning_rate": 3.9318181818181817e-07, + "logits/chosen": -0.1845703125, + "logits/rejected": -0.29296875, + "logps/chosen": -352.0, + "logps/rejected": -310.0, + "loss": 0.2808, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.265625, + "rewards/margins": 5.25, + "rewards/rejected": -4.0, + "step": 542 + }, + { + "epoch": 0.6662576687116565, + "grad_norm": 37.076885533693634, + "learning_rate": 3.929752066115702e-07, + "logits/chosen": -0.2255859375, + "logits/rejected": -0.41015625, + "logps/chosen": -446.0, + "logps/rejected": -342.0, + "loss": 0.2335, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.9296875, + "rewards/margins": 6.25, + "rewards/rejected": -4.3125, + "step": 543 + }, + { + "epoch": 0.6674846625766871, + "grad_norm": 48.36100783202625, + "learning_rate": 3.927685950413223e-07, + "logits/chosen": -0.20703125, + "logits/rejected": -0.35546875, + "logps/chosen": -374.0, + "logps/rejected": -306.0, + "loss": 0.3321, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.84375, + "rewards/margins": 5.4375, + "rewards/rejected": -4.59375, + "step": 544 + }, + { + "epoch": 0.6687116564417178, + "grad_norm": 43.36042581975704, + "learning_rate": 3.9256198347107437e-07, + "logits/chosen": -0.25, + "logits/rejected": -0.427734375, + "logps/chosen": -452.0, + "logps/rejected": -354.0, + "loss": 0.3606, + "rewards/accuracies": 0.796875, + "rewards/chosen": 1.6171875, + "rewards/margins": 5.5, + "rewards/rejected": -3.890625, + "step": 545 + }, + { + "epoch": 0.6699386503067485, + "grad_norm": 39.63701590605686, + "learning_rate": 3.923553719008264e-07, + "logits/chosen": -0.1416015625, + "logits/rejected": -0.251953125, + "logps/chosen": -370.0, + "logps/rejected": -326.0, + "loss": 0.3095, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.203125, + "rewards/margins": 5.5625, + "rewards/rejected": -4.34375, + "step": 546 + }, + { + "epoch": 0.6711656441717792, + "grad_norm": 33.08408154520663, + "learning_rate": 3.9214876033057846e-07, + "logits/chosen": -0.205078125, + "logits/rejected": -0.380859375, + "logps/chosen": -380.0, + "logps/rejected": -300.0, + "loss": 0.2677, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.53125, + "rewards/margins": 5.78125, + "rewards/rejected": -4.25, + "step": 547 + }, + { + "epoch": 0.6723926380368098, + "grad_norm": 41.01241845328248, + "learning_rate": 3.9194214876033056e-07, + "logits/chosen": -0.251953125, + "logits/rejected": -0.47265625, + "logps/chosen": -396.0, + "logps/rejected": -346.0, + "loss": 0.2427, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.6640625, + "rewards/margins": 5.5625, + "rewards/rejected": -3.90625, + "step": 548 + }, + { + "epoch": 0.6736196319018405, + "grad_norm": 38.04742407115687, + "learning_rate": 3.917355371900826e-07, + "logits/chosen": -0.158203125, + "logits/rejected": -0.37890625, + "logps/chosen": -408.0, + "logps/rejected": -332.0, + "loss": 0.2684, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.3203125, + "rewards/margins": 5.375, + "rewards/rejected": -4.0625, + "step": 549 + }, + { + "epoch": 0.6748466257668712, + "grad_norm": 38.74485204677174, + "learning_rate": 3.915289256198347e-07, + "logits/chosen": -0.2333984375, + "logits/rejected": -0.314453125, + "logps/chosen": -392.0, + "logps/rejected": -312.0, + "loss": 0.3275, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.1015625, + "rewards/margins": 4.875, + "rewards/rejected": -3.78125, + "step": 550 + }, + { + "epoch": 0.6760736196319018, + "grad_norm": 36.24315774996275, + "learning_rate": 3.9132231404958675e-07, + "logits/chosen": -0.1474609375, + "logits/rejected": -0.279296875, + "logps/chosen": -402.0, + "logps/rejected": -328.0, + "loss": 0.2537, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.9375, + "rewards/margins": 5.65625, + "rewards/rejected": -3.71875, + "step": 551 + }, + { + "epoch": 0.6773006134969325, + "grad_norm": 36.45208223894636, + "learning_rate": 3.9111570247933885e-07, + "logits/chosen": -0.232421875, + "logits/rejected": -0.375, + "logps/chosen": -410.0, + "logps/rejected": -344.0, + "loss": 0.2933, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.359375, + "rewards/margins": 5.28125, + "rewards/rejected": -3.921875, + "step": 552 + }, + { + "epoch": 0.6785276073619632, + "grad_norm": 41.631610478201644, + "learning_rate": 3.909090909090909e-07, + "logits/chosen": -0.18359375, + "logits/rejected": -0.333984375, + "logps/chosen": -356.0, + "logps/rejected": -324.0, + "loss": 0.3207, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.7890625, + "rewards/margins": 4.59375, + "rewards/rejected": -3.796875, + "step": 553 + }, + { + "epoch": 0.6797546012269938, + "grad_norm": 33.49412012982899, + "learning_rate": 3.90702479338843e-07, + "logits/chosen": -0.1328125, + "logits/rejected": -0.34375, + "logps/chosen": -424.0, + "logps/rejected": -316.0, + "loss": 0.2289, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.84375, + "rewards/margins": 5.625, + "rewards/rejected": -3.796875, + "step": 554 + }, + { + "epoch": 0.6809815950920245, + "grad_norm": 37.66391393717185, + "learning_rate": 3.90495867768595e-07, + "logits/chosen": -0.03759765625, + "logits/rejected": -0.1650390625, + "logps/chosen": -352.0, + "logps/rejected": -296.0, + "loss": 0.3404, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.4296875, + "rewards/margins": 5.15625, + "rewards/rejected": -3.71875, + "step": 555 + }, + { + "epoch": 0.6822085889570552, + "grad_norm": 30.301075310625425, + "learning_rate": 3.902892561983471e-07, + "logits/chosen": -0.1552734375, + "logits/rejected": -0.37109375, + "logps/chosen": -414.0, + "logps/rejected": -334.0, + "loss": 0.2278, + "rewards/accuracies": 0.84375, + "rewards/chosen": 2.140625, + "rewards/margins": 6.1875, + "rewards/rejected": -4.0625, + "step": 556 + }, + { + "epoch": 0.6834355828220859, + "grad_norm": 33.83430112648751, + "learning_rate": 3.9008264462809914e-07, + "logits/chosen": -0.16796875, + "logits/rejected": -0.392578125, + "logps/chosen": -386.0, + "logps/rejected": -320.0, + "loss": 0.2682, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.78125, + "rewards/margins": 5.4375, + "rewards/rejected": -3.65625, + "step": 557 + }, + { + "epoch": 0.6846625766871166, + "grad_norm": 30.75402635256423, + "learning_rate": 3.8987603305785124e-07, + "logits/chosen": -0.1298828125, + "logits/rejected": -0.287109375, + "logps/chosen": -364.0, + "logps/rejected": -314.0, + "loss": 0.2312, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.09375, + "rewards/margins": 5.78125, + "rewards/rejected": -4.6875, + "step": 558 + }, + { + "epoch": 0.6858895705521473, + "grad_norm": 40.61066869149253, + "learning_rate": 3.896694214876033e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.388671875, + "logps/chosen": -374.0, + "logps/rejected": -328.0, + "loss": 0.3017, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.2734375, + "rewards/margins": 5.5, + "rewards/rejected": -4.21875, + "step": 559 + }, + { + "epoch": 0.6871165644171779, + "grad_norm": 28.075176930111862, + "learning_rate": 3.8946280991735534e-07, + "logits/chosen": -0.34375, + "logits/rejected": -0.494140625, + "logps/chosen": -382.0, + "logps/rejected": -316.0, + "loss": 0.1832, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.6171875, + "rewards/margins": 6.4375, + "rewards/rejected": -4.8125, + "step": 560 + }, + { + "epoch": 0.6883435582822086, + "grad_norm": 31.670561048270176, + "learning_rate": 3.8925619834710744e-07, + "logits/chosen": -0.208984375, + "logits/rejected": -0.390625, + "logps/chosen": -348.0, + "logps/rejected": -288.0, + "loss": 0.2243, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.390625, + "rewards/margins": 5.84375, + "rewards/rejected": -4.4375, + "step": 561 + }, + { + "epoch": 0.6895705521472393, + "grad_norm": 32.855068201542075, + "learning_rate": 3.890495867768595e-07, + "logits/chosen": -0.087890625, + "logits/rejected": -0.287109375, + "logps/chosen": -368.0, + "logps/rejected": -308.0, + "loss": 0.2422, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.84375, + "rewards/margins": 5.28125, + "rewards/rejected": -4.4375, + "step": 562 + }, + { + "epoch": 0.69079754601227, + "grad_norm": 35.79449426535959, + "learning_rate": 3.888429752066116e-07, + "logits/chosen": -0.244140625, + "logits/rejected": -0.40625, + "logps/chosen": -388.0, + "logps/rejected": -358.0, + "loss": 0.2546, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.7109375, + "rewards/margins": 6.28125, + "rewards/rejected": -4.5625, + "step": 563 + }, + { + "epoch": 0.6920245398773006, + "grad_norm": 29.77603709052077, + "learning_rate": 3.886363636363636e-07, + "logits/chosen": -0.255859375, + "logits/rejected": -0.37890625, + "logps/chosen": -384.0, + "logps/rejected": -324.0, + "loss": 0.2408, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.015625, + "rewards/margins": 5.3125, + "rewards/rejected": -4.3125, + "step": 564 + }, + { + "epoch": 0.6932515337423313, + "grad_norm": 35.70334442848756, + "learning_rate": 3.884297520661157e-07, + "logits/chosen": -0.19921875, + "logits/rejected": -0.400390625, + "logps/chosen": -392.0, + "logps/rejected": -330.0, + "loss": 0.3131, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.859375, + "rewards/margins": 4.84375, + "rewards/rejected": -3.96875, + "step": 565 + }, + { + "epoch": 0.694478527607362, + "grad_norm": 35.48298237028605, + "learning_rate": 3.882231404958677e-07, + "logits/chosen": -0.2109375, + "logits/rejected": -0.322265625, + "logps/chosen": -412.0, + "logps/rejected": -326.0, + "loss": 0.2452, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.5859375, + "rewards/margins": 5.96875, + "rewards/rejected": -4.375, + "step": 566 + }, + { + "epoch": 0.6957055214723926, + "grad_norm": 31.112271919353073, + "learning_rate": 3.880165289256198e-07, + "logits/chosen": -0.11572265625, + "logits/rejected": -0.251953125, + "logps/chosen": -314.0, + "logps/rejected": -266.0, + "loss": 0.2267, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 0.58203125, + "rewards/margins": 4.8125, + "rewards/rejected": -4.21875, + "step": 567 + }, + { + "epoch": 0.6969325153374233, + "grad_norm": 38.89246029311522, + "learning_rate": 3.8780991735537187e-07, + "logits/chosen": -0.2353515625, + "logits/rejected": -0.314453125, + "logps/chosen": -380.0, + "logps/rejected": -316.0, + "loss": 0.2865, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.109375, + "rewards/margins": 5.59375, + "rewards/rejected": -4.46875, + "step": 568 + }, + { + "epoch": 0.698159509202454, + "grad_norm": 34.50521407178372, + "learning_rate": 3.8760330578512397e-07, + "logits/chosen": -0.1552734375, + "logits/rejected": -0.3046875, + "logps/chosen": -380.0, + "logps/rejected": -298.0, + "loss": 0.2647, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.7578125, + "rewards/margins": 5.0625, + "rewards/rejected": -4.3125, + "step": 569 + }, + { + "epoch": 0.6993865030674846, + "grad_norm": 27.986690455754786, + "learning_rate": 3.87396694214876e-07, + "logits/chosen": -0.3125, + "logits/rejected": -0.451171875, + "logps/chosen": -400.0, + "logps/rejected": -330.0, + "loss": 0.18, + "rewards/accuracies": 0.9453125, + "rewards/chosen": 1.5703125, + "rewards/margins": 6.25, + "rewards/rejected": -4.6875, + "step": 570 + }, + { + "epoch": 0.7006134969325153, + "grad_norm": 32.36101057946353, + "learning_rate": 3.871900826446281e-07, + "logits/chosen": -0.193359375, + "logits/rejected": -0.32421875, + "logps/chosen": -326.0, + "logps/rejected": -300.0, + "loss": 0.2221, + "rewards/accuracies": 0.890625, + "rewards/chosen": 0.625, + "rewards/margins": 5.0625, + "rewards/rejected": -4.4375, + "step": 571 + }, + { + "epoch": 0.701840490797546, + "grad_norm": 36.69242569066846, + "learning_rate": 3.8698347107438017e-07, + "logits/chosen": -0.166015625, + "logits/rejected": -0.3203125, + "logps/chosen": -384.0, + "logps/rejected": -358.0, + "loss": 0.2363, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.5859375, + "rewards/margins": 5.96875, + "rewards/rejected": -4.40625, + "step": 572 + }, + { + "epoch": 0.7030674846625767, + "grad_norm": 41.66310475024957, + "learning_rate": 3.867768595041322e-07, + "logits/chosen": -0.1240234375, + "logits/rejected": -0.26953125, + "logps/chosen": -388.0, + "logps/rejected": -326.0, + "loss": 0.3484, + "rewards/accuracies": 0.796875, + "rewards/chosen": 0.51171875, + "rewards/margins": 5.09375, + "rewards/rejected": -4.59375, + "step": 573 + }, + { + "epoch": 0.7042944785276074, + "grad_norm": 39.39212100565405, + "learning_rate": 3.8657024793388426e-07, + "logits/chosen": -0.2470703125, + "logits/rejected": -0.376953125, + "logps/chosen": -322.0, + "logps/rejected": -302.0, + "loss": 0.2719, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.89453125, + "rewards/margins": 5.53125, + "rewards/rejected": -4.625, + "step": 574 + }, + { + "epoch": 0.7055214723926381, + "grad_norm": 35.35137643401559, + "learning_rate": 3.8636363636363636e-07, + "logits/chosen": -0.283203125, + "logits/rejected": -0.458984375, + "logps/chosen": -406.0, + "logps/rejected": -364.0, + "loss": 0.2178, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.6875, + "rewards/margins": 6.65625, + "rewards/rejected": -4.96875, + "step": 575 + }, + { + "epoch": 0.7067484662576687, + "grad_norm": 28.9202010136064, + "learning_rate": 3.861570247933884e-07, + "logits/chosen": -0.1494140625, + "logits/rejected": -0.36328125, + "logps/chosen": -380.0, + "logps/rejected": -320.0, + "loss": 0.1958, + "rewards/accuracies": 0.921875, + "rewards/chosen": 1.59375, + "rewards/margins": 6.75, + "rewards/rejected": -5.15625, + "step": 576 + }, + { + "epoch": 0.7079754601226994, + "grad_norm": 36.46431827427722, + "learning_rate": 3.8595041322314045e-07, + "logits/chosen": -0.09033203125, + "logits/rejected": -0.23046875, + "logps/chosen": -362.0, + "logps/rejected": -312.0, + "loss": 0.2593, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.4296875, + "rewards/margins": 6.59375, + "rewards/rejected": -5.1875, + "step": 577 + }, + { + "epoch": 0.7092024539877301, + "grad_norm": 40.66901563749969, + "learning_rate": 3.8574380165289255e-07, + "logits/chosen": -0.2421875, + "logits/rejected": -0.3984375, + "logps/chosen": -416.0, + "logps/rejected": -326.0, + "loss": 0.3148, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.484375, + "rewards/margins": 6.46875, + "rewards/rejected": -5.0, + "step": 578 + }, + { + "epoch": 0.7104294478527607, + "grad_norm": 43.94460926088441, + "learning_rate": 3.855371900826446e-07, + "logits/chosen": -0.2353515625, + "logits/rejected": -0.330078125, + "logps/chosen": -428.0, + "logps/rejected": -326.0, + "loss": 0.3599, + "rewards/accuracies": 0.78125, + "rewards/chosen": 0.498046875, + "rewards/margins": 4.875, + "rewards/rejected": -4.375, + "step": 579 + }, + { + "epoch": 0.7116564417177914, + "grad_norm": 36.521177273018374, + "learning_rate": 3.853305785123967e-07, + "logits/chosen": -0.125, + "logits/rejected": -0.298828125, + "logps/chosen": -380.0, + "logps/rejected": -344.0, + "loss": 0.2355, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.79296875, + "rewards/margins": 6.1875, + "rewards/rejected": -5.40625, + "step": 580 + }, + { + "epoch": 0.7128834355828221, + "grad_norm": 30.81358847829242, + "learning_rate": 3.8512396694214875e-07, + "logits/chosen": -0.2373046875, + "logits/rejected": -0.427734375, + "logps/chosen": -368.0, + "logps/rejected": -308.0, + "loss": 0.2127, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.3359375, + "rewards/margins": 6.40625, + "rewards/rejected": -5.0625, + "step": 581 + }, + { + "epoch": 0.7141104294478527, + "grad_norm": 46.46655474433081, + "learning_rate": 3.849173553719008e-07, + "logits/chosen": -0.046875, + "logits/rejected": -0.259765625, + "logps/chosen": -392.0, + "logps/rejected": -320.0, + "loss": 0.31, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.9453125, + "rewards/margins": 5.09375, + "rewards/rejected": -4.15625, + "step": 582 + }, + { + "epoch": 0.7153374233128834, + "grad_norm": 38.88117000055558, + "learning_rate": 3.8471074380165284e-07, + "logits/chosen": -0.21875, + "logits/rejected": -0.373046875, + "logps/chosen": -382.0, + "logps/rejected": -334.0, + "loss": 0.3145, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.4296875, + "rewards/margins": 5.5625, + "rewards/rejected": -4.15625, + "step": 583 + }, + { + "epoch": 0.7165644171779141, + "grad_norm": 41.99819867075411, + "learning_rate": 3.8450413223140494e-07, + "logits/chosen": -0.126953125, + "logits/rejected": -0.2099609375, + "logps/chosen": -368.0, + "logps/rejected": -364.0, + "loss": 0.3344, + "rewards/accuracies": 0.796875, + "rewards/chosen": 0.640625, + "rewards/margins": 4.375, + "rewards/rejected": -3.734375, + "step": 584 + }, + { + "epoch": 0.7177914110429447, + "grad_norm": 44.1611316963058, + "learning_rate": 3.84297520661157e-07, + "logits/chosen": -0.038818359375, + "logits/rejected": -0.1630859375, + "logps/chosen": -398.0, + "logps/rejected": -318.0, + "loss": 0.3664, + "rewards/accuracies": 0.78125, + "rewards/chosen": 1.3125, + "rewards/margins": 4.90625, + "rewards/rejected": -3.609375, + "step": 585 + }, + { + "epoch": 0.7190184049079754, + "grad_norm": 39.0964035012581, + "learning_rate": 3.840909090909091e-07, + "logits/chosen": -0.158203125, + "logits/rejected": -0.271484375, + "logps/chosen": -346.0, + "logps/rejected": -296.0, + "loss": 0.2973, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.0, + "rewards/margins": 5.09375, + "rewards/rejected": -4.09375, + "step": 586 + }, + { + "epoch": 0.7202453987730061, + "grad_norm": 36.08960275580907, + "learning_rate": 3.8388429752066114e-07, + "logits/chosen": -0.1953125, + "logits/rejected": -0.306640625, + "logps/chosen": -332.0, + "logps/rejected": -306.0, + "loss": 0.2916, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.0703125, + "rewards/margins": 5.28125, + "rewards/rejected": -4.1875, + "step": 587 + }, + { + "epoch": 0.7214723926380369, + "grad_norm": 26.657846221925215, + "learning_rate": 3.8367768595041324e-07, + "logits/chosen": -0.193359375, + "logits/rejected": -0.361328125, + "logps/chosen": -380.0, + "logps/rejected": -314.0, + "loss": 0.2231, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.8515625, + "rewards/margins": 6.0625, + "rewards/rejected": -4.1875, + "step": 588 + }, + { + "epoch": 0.7226993865030675, + "grad_norm": 41.32671053142075, + "learning_rate": 3.834710743801653e-07, + "logits/chosen": -0.267578125, + "logits/rejected": -0.37109375, + "logps/chosen": -360.0, + "logps/rejected": -326.0, + "loss": 0.3126, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.69140625, + "rewards/margins": 4.5, + "rewards/rejected": -3.828125, + "step": 589 + }, + { + "epoch": 0.7239263803680982, + "grad_norm": 31.50139516862032, + "learning_rate": 3.8326446280991733e-07, + "logits/chosen": -0.171875, + "logits/rejected": -0.29296875, + "logps/chosen": -364.0, + "logps/rejected": -302.0, + "loss": 0.2457, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.125, + "rewards/margins": 5.125, + "rewards/rejected": -3.984375, + "step": 590 + }, + { + "epoch": 0.7251533742331289, + "grad_norm": 41.923208067017086, + "learning_rate": 3.830578512396694e-07, + "logits/chosen": -0.328125, + "logits/rejected": -0.51953125, + "logps/chosen": -404.0, + "logps/rejected": -326.0, + "loss": 0.2429, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.6484375, + "rewards/margins": 6.1875, + "rewards/rejected": -4.53125, + "step": 591 + }, + { + "epoch": 0.7263803680981595, + "grad_norm": 36.03509452521486, + "learning_rate": 3.828512396694215e-07, + "logits/chosen": -0.1904296875, + "logits/rejected": -0.380859375, + "logps/chosen": -370.0, + "logps/rejected": -296.0, + "loss": 0.2519, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.4375, + "rewards/margins": 6.0625, + "rewards/rejected": -4.625, + "step": 592 + }, + { + "epoch": 0.7276073619631902, + "grad_norm": 42.073646570880065, + "learning_rate": 3.826446280991735e-07, + "logits/chosen": -0.12890625, + "logits/rejected": -0.388671875, + "logps/chosen": -444.0, + "logps/rejected": -362.0, + "loss": 0.2844, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.6484375, + "rewards/margins": 5.625, + "rewards/rejected": -3.984375, + "step": 593 + }, + { + "epoch": 0.7288343558282209, + "grad_norm": 32.37131856233386, + "learning_rate": 3.824380165289256e-07, + "logits/chosen": -0.193359375, + "logits/rejected": -0.36328125, + "logps/chosen": -356.0, + "logps/rejected": -306.0, + "loss": 0.2431, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.81640625, + "rewards/margins": 5.65625, + "rewards/rejected": -4.84375, + "step": 594 + }, + { + "epoch": 0.7300613496932515, + "grad_norm": 40.766534902822876, + "learning_rate": 3.8223140495867767e-07, + "logits/chosen": -0.2041015625, + "logits/rejected": -0.3984375, + "logps/chosen": -444.0, + "logps/rejected": -340.0, + "loss": 0.2581, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.578125, + "rewards/margins": 6.15625, + "rewards/rejected": -4.59375, + "step": 595 + }, + { + "epoch": 0.7312883435582822, + "grad_norm": 39.26882224861265, + "learning_rate": 3.820247933884297e-07, + "logits/chosen": -0.1767578125, + "logits/rejected": -0.341796875, + "logps/chosen": -410.0, + "logps/rejected": -338.0, + "loss": 0.2749, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.203125, + "rewards/margins": 5.53125, + "rewards/rejected": -4.3125, + "step": 596 + }, + { + "epoch": 0.7325153374233129, + "grad_norm": 39.569676008461244, + "learning_rate": 3.818181818181818e-07, + "logits/chosen": -0.0849609375, + "logits/rejected": -0.26171875, + "logps/chosen": -378.0, + "logps/rejected": -282.0, + "loss": 0.2937, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.2265625, + "rewards/margins": 5.25, + "rewards/rejected": -4.03125, + "step": 597 + }, + { + "epoch": 0.7337423312883435, + "grad_norm": 32.53349158917794, + "learning_rate": 3.8161157024793387e-07, + "logits/chosen": -0.1806640625, + "logits/rejected": -0.369140625, + "logps/chosen": -438.0, + "logps/rejected": -310.0, + "loss": 0.2181, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 2.046875, + "rewards/margins": 6.3125, + "rewards/rejected": -4.28125, + "step": 598 + }, + { + "epoch": 0.7349693251533742, + "grad_norm": 37.462844674823714, + "learning_rate": 3.814049586776859e-07, + "logits/chosen": -0.30859375, + "logits/rejected": -0.45703125, + "logps/chosen": -448.0, + "logps/rejected": -354.0, + "loss": 0.2935, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.6328125, + "rewards/margins": 6.125, + "rewards/rejected": -4.5, + "step": 599 + }, + { + "epoch": 0.7361963190184049, + "grad_norm": 40.34755354050605, + "learning_rate": 3.8119834710743796e-07, + "logits/chosen": -0.3125, + "logits/rejected": -0.408203125, + "logps/chosen": -356.0, + "logps/rejected": -308.0, + "loss": 0.3262, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.2734375, + "rewards/margins": 5.875, + "rewards/rejected": -4.59375, + "step": 600 + }, + { + "epoch": 0.7374233128834355, + "grad_norm": 31.83131835226018, + "learning_rate": 3.8099173553719006e-07, + "logits/chosen": -0.2001953125, + "logits/rejected": -0.3828125, + "logps/chosen": -338.0, + "logps/rejected": -296.0, + "loss": 0.2587, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.5546875, + "rewards/margins": 5.46875, + "rewards/rejected": -4.90625, + "step": 601 + }, + { + "epoch": 0.7386503067484662, + "grad_norm": 27.556154921143015, + "learning_rate": 3.807851239669421e-07, + "logits/chosen": -0.0517578125, + "logits/rejected": -0.2158203125, + "logps/chosen": -398.0, + "logps/rejected": -322.0, + "loss": 0.1812, + "rewards/accuracies": 0.9296875, + "rewards/chosen": 1.4765625, + "rewards/margins": 6.4375, + "rewards/rejected": -4.96875, + "step": 602 + }, + { + "epoch": 0.7398773006134969, + "grad_norm": 33.37496659841441, + "learning_rate": 3.805785123966942e-07, + "logits/chosen": -0.205078125, + "logits/rejected": -0.34765625, + "logps/chosen": -376.0, + "logps/rejected": -308.0, + "loss": 0.2746, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.609375, + "rewards/margins": 6.34375, + "rewards/rejected": -4.71875, + "step": 603 + }, + { + "epoch": 0.7411042944785277, + "grad_norm": 33.47399818424688, + "learning_rate": 3.8037190082644626e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.4296875, + "logps/chosen": -410.0, + "logps/rejected": -344.0, + "loss": 0.2518, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.234375, + "rewards/margins": 6.1875, + "rewards/rejected": -4.96875, + "step": 604 + }, + { + "epoch": 0.7423312883435583, + "grad_norm": 31.794522300753904, + "learning_rate": 3.8016528925619836e-07, + "logits/chosen": -0.2041015625, + "logits/rejected": -0.396484375, + "logps/chosen": -372.0, + "logps/rejected": -318.0, + "loss": 0.2352, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.1640625, + "rewards/margins": 6.375, + "rewards/rejected": -5.21875, + "step": 605 + }, + { + "epoch": 0.743558282208589, + "grad_norm": 39.11777077485029, + "learning_rate": 3.799586776859504e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.41796875, + "logps/chosen": -382.0, + "logps/rejected": -322.0, + "loss": 0.2993, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.3671875, + "rewards/margins": 5.9375, + "rewards/rejected": -4.5625, + "step": 606 + }, + { + "epoch": 0.7447852760736197, + "grad_norm": 35.13403324428258, + "learning_rate": 3.797520661157025e-07, + "logits/chosen": -0.1591796875, + "logits/rejected": -0.37890625, + "logps/chosen": -394.0, + "logps/rejected": -356.0, + "loss": 0.2528, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 0.75, + "rewards/margins": 6.1875, + "rewards/rejected": -5.4375, + "step": 607 + }, + { + "epoch": 0.7460122699386503, + "grad_norm": 34.622853683902335, + "learning_rate": 3.795454545454545e-07, + "logits/chosen": -0.06396484375, + "logits/rejected": -0.302734375, + "logps/chosen": -394.0, + "logps/rejected": -334.0, + "loss": 0.2671, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 0.43359375, + "rewards/margins": 5.34375, + "rewards/rejected": -4.90625, + "step": 608 + }, + { + "epoch": 0.747239263803681, + "grad_norm": 33.44784961871993, + "learning_rate": 3.793388429752066e-07, + "logits/chosen": -0.1748046875, + "logits/rejected": -0.33984375, + "logps/chosen": -402.0, + "logps/rejected": -314.0, + "loss": 0.2401, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 0.78515625, + "rewards/margins": 6.25, + "rewards/rejected": -5.46875, + "step": 609 + }, + { + "epoch": 0.7484662576687117, + "grad_norm": 30.3709205845726, + "learning_rate": 3.7913223140495864e-07, + "logits/chosen": -0.2294921875, + "logits/rejected": -0.447265625, + "logps/chosen": -442.0, + "logps/rejected": -368.0, + "loss": 0.2211, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.3125, + "rewards/margins": 6.875, + "rewards/rejected": -5.5625, + "step": 610 + }, + { + "epoch": 0.7496932515337423, + "grad_norm": 47.71192907247348, + "learning_rate": 3.7892561983471074e-07, + "logits/chosen": -0.2001953125, + "logits/rejected": -0.3671875, + "logps/chosen": -430.0, + "logps/rejected": -354.0, + "loss": 0.331, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.14453125, + "rewards/margins": 5.34375, + "rewards/rejected": -5.1875, + "step": 611 + }, + { + "epoch": 0.750920245398773, + "grad_norm": 40.03785494441384, + "learning_rate": 3.787190082644628e-07, + "logits/chosen": -0.2041015625, + "logits/rejected": -0.34765625, + "logps/chosen": -390.0, + "logps/rejected": -352.0, + "loss": 0.327, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.6875, + "rewards/margins": 5.4375, + "rewards/rejected": -4.75, + "step": 612 + }, + { + "epoch": 0.7521472392638037, + "grad_norm": 39.68756652628583, + "learning_rate": 3.7851239669421484e-07, + "logits/chosen": -0.19140625, + "logits/rejected": -0.265625, + "logps/chosen": -374.0, + "logps/rejected": -320.0, + "loss": 0.3199, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.369140625, + "rewards/margins": 5.53125, + "rewards/rejected": -5.15625, + "step": 613 + }, + { + "epoch": 0.7533742331288343, + "grad_norm": 41.644849602297185, + "learning_rate": 3.7830578512396694e-07, + "logits/chosen": -0.2451171875, + "logits/rejected": -0.384765625, + "logps/chosen": -418.0, + "logps/rejected": -338.0, + "loss": 0.2887, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.80859375, + "rewards/margins": 5.875, + "rewards/rejected": -5.0625, + "step": 614 + }, + { + "epoch": 0.754601226993865, + "grad_norm": 37.7145942345175, + "learning_rate": 3.78099173553719e-07, + "logits/chosen": -0.228515625, + "logits/rejected": -0.33984375, + "logps/chosen": -366.0, + "logps/rejected": -340.0, + "loss": 0.2656, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.0078125, + "rewards/margins": 6.25, + "rewards/rejected": -5.21875, + "step": 615 + }, + { + "epoch": 0.7558282208588957, + "grad_norm": 33.41765706894794, + "learning_rate": 3.778925619834711e-07, + "logits/chosen": -0.1865234375, + "logits/rejected": -0.333984375, + "logps/chosen": -322.0, + "logps/rejected": -286.0, + "loss": 0.2479, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.26953125, + "rewards/margins": 5.03125, + "rewards/rejected": -4.78125, + "step": 616 + }, + { + "epoch": 0.7570552147239263, + "grad_norm": 40.974699543395324, + "learning_rate": 3.776859504132231e-07, + "logits/chosen": -0.173828125, + "logits/rejected": -0.26171875, + "logps/chosen": -368.0, + "logps/rejected": -310.0, + "loss": 0.3367, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 0.609375, + "rewards/margins": 5.1875, + "rewards/rejected": -4.59375, + "step": 617 + }, + { + "epoch": 0.758282208588957, + "grad_norm": 46.934415155128356, + "learning_rate": 3.774793388429752e-07, + "logits/chosen": -0.099609375, + "logits/rejected": -0.275390625, + "logps/chosen": -414.0, + "logps/rejected": -308.0, + "loss": 0.3508, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.74609375, + "rewards/margins": 4.9375, + "rewards/rejected": -4.1875, + "step": 618 + }, + { + "epoch": 0.7595092024539877, + "grad_norm": 35.432918707651034, + "learning_rate": 3.7727272727272723e-07, + "logits/chosen": -0.12890625, + "logits/rejected": -0.330078125, + "logps/chosen": -426.0, + "logps/rejected": -328.0, + "loss": 0.2261, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.140625, + "rewards/margins": 6.25, + "rewards/rejected": -5.125, + "step": 619 + }, + { + "epoch": 0.7607361963190185, + "grad_norm": 44.522688117502966, + "learning_rate": 3.7706611570247933e-07, + "logits/chosen": -0.1318359375, + "logits/rejected": -0.33984375, + "logps/chosen": -404.0, + "logps/rejected": -324.0, + "loss": 0.2954, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.625, + "rewards/margins": 5.125, + "rewards/rejected": -4.5, + "step": 620 + }, + { + "epoch": 0.7619631901840491, + "grad_norm": 35.21620215877052, + "learning_rate": 3.768595041322314e-07, + "logits/chosen": -0.2412109375, + "logits/rejected": -0.412109375, + "logps/chosen": -478.0, + "logps/rejected": -360.0, + "loss": 0.2617, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.1015625, + "rewards/margins": 6.46875, + "rewards/rejected": -5.375, + "step": 621 + }, + { + "epoch": 0.7631901840490798, + "grad_norm": 32.97202434149592, + "learning_rate": 3.766528925619835e-07, + "logits/chosen": -0.13671875, + "logits/rejected": -0.310546875, + "logps/chosen": -378.0, + "logps/rejected": -334.0, + "loss": 0.2271, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 0.73828125, + "rewards/margins": 5.9375, + "rewards/rejected": -5.1875, + "step": 622 + }, + { + "epoch": 0.7644171779141105, + "grad_norm": 40.73770796587866, + "learning_rate": 3.764462809917355e-07, + "logits/chosen": -0.1669921875, + "logits/rejected": -0.34765625, + "logps/chosen": -452.0, + "logps/rejected": -370.0, + "loss": 0.3008, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.3515625, + "rewards/margins": 6.21875, + "rewards/rejected": -4.875, + "step": 623 + }, + { + "epoch": 0.7656441717791411, + "grad_norm": 33.6312460876679, + "learning_rate": 3.762396694214876e-07, + "logits/chosen": -0.228515625, + "logits/rejected": -0.3984375, + "logps/chosen": -378.0, + "logps/rejected": -316.0, + "loss": 0.218, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.1328125, + "rewards/margins": 6.78125, + "rewards/rejected": -5.65625, + "step": 624 + }, + { + "epoch": 0.7668711656441718, + "grad_norm": 35.01728220554292, + "learning_rate": 3.7603305785123967e-07, + "logits/chosen": -0.2001953125, + "logits/rejected": -0.34765625, + "logps/chosen": -404.0, + "logps/rejected": -316.0, + "loss": 0.2202, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.015625, + "rewards/margins": 5.6875, + "rewards/rejected": -4.65625, + "step": 625 + }, + { + "epoch": 0.7680981595092025, + "grad_norm": 43.4178761562483, + "learning_rate": 3.758264462809917e-07, + "logits/chosen": -0.314453125, + "logits/rejected": -0.46875, + "logps/chosen": -414.0, + "logps/rejected": -344.0, + "loss": 0.3158, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.3515625, + "rewards/margins": 5.78125, + "rewards/rejected": -4.4375, + "step": 626 + }, + { + "epoch": 0.7693251533742331, + "grad_norm": 35.14066305401538, + "learning_rate": 3.7561983471074376e-07, + "logits/chosen": -0.1162109375, + "logits/rejected": -0.21484375, + "logps/chosen": -308.0, + "logps/rejected": -320.0, + "loss": 0.3225, + "rewards/accuracies": 0.8671875, + "rewards/chosen": -0.06884765625, + "rewards/margins": 4.53125, + "rewards/rejected": -4.59375, + "step": 627 + }, + { + "epoch": 0.7705521472392638, + "grad_norm": 43.80833337888977, + "learning_rate": 3.7541322314049586e-07, + "logits/chosen": -0.15234375, + "logits/rejected": -0.294921875, + "logps/chosen": -378.0, + "logps/rejected": -290.0, + "loss": 0.3054, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.90234375, + "rewards/margins": 5.15625, + "rewards/rejected": -4.25, + "step": 628 + }, + { + "epoch": 0.7717791411042945, + "grad_norm": 24.76129586575429, + "learning_rate": 3.752066115702479e-07, + "logits/chosen": -0.171875, + "logits/rejected": -0.296875, + "logps/chosen": -348.0, + "logps/rejected": -276.0, + "loss": 0.1831, + "rewards/accuracies": 0.9375, + "rewards/chosen": 0.74609375, + "rewards/margins": 5.34375, + "rewards/rejected": -4.59375, + "step": 629 + }, + { + "epoch": 0.7730061349693251, + "grad_norm": 34.904501482497786, + "learning_rate": 3.75e-07, + "logits/chosen": -0.11328125, + "logits/rejected": -0.357421875, + "logps/chosen": -370.0, + "logps/rejected": -358.0, + "loss": 0.2492, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.640625, + "rewards/margins": 6.03125, + "rewards/rejected": -4.40625, + "step": 630 + }, + { + "epoch": 0.7742331288343558, + "grad_norm": 37.86286725268997, + "learning_rate": 3.7479338842975206e-07, + "logits/chosen": -0.298828125, + "logits/rejected": -0.404296875, + "logps/chosen": -390.0, + "logps/rejected": -312.0, + "loss": 0.3021, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.390625, + "rewards/margins": 5.5625, + "rewards/rejected": -4.1875, + "step": 631 + }, + { + "epoch": 0.7754601226993865, + "grad_norm": 39.56376346395484, + "learning_rate": 3.745867768595041e-07, + "logits/chosen": -0.22265625, + "logits/rejected": -0.36328125, + "logps/chosen": -402.0, + "logps/rejected": -330.0, + "loss": 0.2667, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.5234375, + "rewards/margins": 5.1875, + "rewards/rejected": -3.671875, + "step": 632 + }, + { + "epoch": 0.7766871165644171, + "grad_norm": 43.15920072260989, + "learning_rate": 3.743801652892562e-07, + "logits/chosen": -0.1484375, + "logits/rejected": -0.27734375, + "logps/chosen": -338.0, + "logps/rejected": -324.0, + "loss": 0.317, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.7734375, + "rewards/margins": 4.71875, + "rewards/rejected": -3.96875, + "step": 633 + }, + { + "epoch": 0.7779141104294478, + "grad_norm": 34.76469344160583, + "learning_rate": 3.7417355371900825e-07, + "logits/chosen": -0.2333984375, + "logits/rejected": -0.443359375, + "logps/chosen": -418.0, + "logps/rejected": -316.0, + "loss": 0.2151, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 2.4375, + "rewards/margins": 6.90625, + "rewards/rejected": -4.46875, + "step": 634 + }, + { + "epoch": 0.7791411042944786, + "grad_norm": 32.416601067780334, + "learning_rate": 3.739669421487603e-07, + "logits/chosen": -0.2421875, + "logits/rejected": -0.3125, + "logps/chosen": -358.0, + "logps/rejected": -288.0, + "loss": 0.217, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 0.9140625, + "rewards/margins": 4.96875, + "rewards/rejected": -4.03125, + "step": 635 + }, + { + "epoch": 0.7803680981595092, + "grad_norm": 38.28241269033868, + "learning_rate": 3.7376033057851234e-07, + "logits/chosen": -0.234375, + "logits/rejected": -0.36328125, + "logps/chosen": -414.0, + "logps/rejected": -358.0, + "loss": 0.2749, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.6328125, + "rewards/margins": 5.8125, + "rewards/rejected": -4.15625, + "step": 636 + }, + { + "epoch": 0.7815950920245399, + "grad_norm": 47.424162576758796, + "learning_rate": 3.7355371900826445e-07, + "logits/chosen": -0.0859375, + "logits/rejected": -0.267578125, + "logps/chosen": -378.0, + "logps/rejected": -292.0, + "loss": 0.2932, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.890625, + "rewards/margins": 5.09375, + "rewards/rejected": -4.1875, + "step": 637 + }, + { + "epoch": 0.7828220858895706, + "grad_norm": 33.14638387389286, + "learning_rate": 3.733471074380165e-07, + "logits/chosen": -0.2177734375, + "logits/rejected": -0.412109375, + "logps/chosen": -402.0, + "logps/rejected": -326.0, + "loss": 0.225, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.5234375, + "rewards/margins": 5.65625, + "rewards/rejected": -4.125, + "step": 638 + }, + { + "epoch": 0.7840490797546013, + "grad_norm": 40.33146789211734, + "learning_rate": 3.731404958677686e-07, + "logits/chosen": -0.1015625, + "logits/rejected": -0.283203125, + "logps/chosen": -404.0, + "logps/rejected": -326.0, + "loss": 0.3027, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.4375, + "rewards/margins": 5.1875, + "rewards/rejected": -3.75, + "step": 639 + }, + { + "epoch": 0.7852760736196319, + "grad_norm": 40.99608723585622, + "learning_rate": 3.7293388429752064e-07, + "logits/chosen": -0.24609375, + "logits/rejected": -0.388671875, + "logps/chosen": -444.0, + "logps/rejected": -376.0, + "loss": 0.2653, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.890625, + "rewards/margins": 6.03125, + "rewards/rejected": -4.125, + "step": 640 + }, + { + "epoch": 0.7865030674846626, + "grad_norm": 46.58650892643996, + "learning_rate": 3.7272727272727274e-07, + "logits/chosen": -0.27734375, + "logits/rejected": -0.419921875, + "logps/chosen": -392.0, + "logps/rejected": -342.0, + "loss": 0.3815, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.5703125, + "rewards/margins": 5.09375, + "rewards/rejected": -3.515625, + "step": 641 + }, + { + "epoch": 0.7877300613496933, + "grad_norm": 28.471925622053803, + "learning_rate": 3.725206611570248e-07, + "logits/chosen": -0.185546875, + "logits/rejected": -0.39453125, + "logps/chosen": -348.0, + "logps/rejected": -284.0, + "loss": 0.2363, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.3515625, + "rewards/margins": 5.25, + "rewards/rejected": -3.890625, + "step": 642 + }, + { + "epoch": 0.7889570552147239, + "grad_norm": 40.149407361877095, + "learning_rate": 3.723140495867769e-07, + "logits/chosen": -0.30859375, + "logits/rejected": -0.484375, + "logps/chosen": -400.0, + "logps/rejected": -364.0, + "loss": 0.2571, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.5234375, + "rewards/margins": 5.4375, + "rewards/rejected": -3.90625, + "step": 643 + }, + { + "epoch": 0.7901840490797546, + "grad_norm": 43.580660836250416, + "learning_rate": 3.721074380165289e-07, + "logits/chosen": -0.2314453125, + "logits/rejected": -0.384765625, + "logps/chosen": -386.0, + "logps/rejected": -316.0, + "loss": 0.2481, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.5390625, + "rewards/margins": 5.90625, + "rewards/rejected": -4.34375, + "step": 644 + }, + { + "epoch": 0.7914110429447853, + "grad_norm": 36.964537896873544, + "learning_rate": 3.71900826446281e-07, + "logits/chosen": -0.1728515625, + "logits/rejected": -0.380859375, + "logps/chosen": -330.0, + "logps/rejected": -322.0, + "loss": 0.2416, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.6484375, + "rewards/margins": 5.78125, + "rewards/rejected": -4.15625, + "step": 645 + }, + { + "epoch": 0.7926380368098159, + "grad_norm": 36.18484120423215, + "learning_rate": 3.7169421487603303e-07, + "logits/chosen": -0.130859375, + "logits/rejected": -0.3046875, + "logps/chosen": -378.0, + "logps/rejected": -314.0, + "loss": 0.285, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.4921875, + "rewards/margins": 5.5, + "rewards/rejected": -4.0, + "step": 646 + }, + { + "epoch": 0.7938650306748466, + "grad_norm": 32.85091829554944, + "learning_rate": 3.7148760330578513e-07, + "logits/chosen": -0.1826171875, + "logits/rejected": -0.333984375, + "logps/chosen": -376.0, + "logps/rejected": -308.0, + "loss": 0.2558, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.9609375, + "rewards/margins": 6.125, + "rewards/rejected": -4.1875, + "step": 647 + }, + { + "epoch": 0.7950920245398773, + "grad_norm": 42.502304621111726, + "learning_rate": 3.712809917355372e-07, + "logits/chosen": -0.236328125, + "logits/rejected": -0.25, + "logps/chosen": -324.0, + "logps/rejected": -312.0, + "loss": 0.3343, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.90625, + "rewards/margins": 4.875, + "rewards/rejected": -3.96875, + "step": 648 + }, + { + "epoch": 0.7963190184049079, + "grad_norm": 41.7626560131211, + "learning_rate": 3.710743801652892e-07, + "logits/chosen": -0.1064453125, + "logits/rejected": -0.2109375, + "logps/chosen": -360.0, + "logps/rejected": -318.0, + "loss": 0.4139, + "rewards/accuracies": 0.796875, + "rewards/chosen": 1.15625, + "rewards/margins": 4.59375, + "rewards/rejected": -3.4375, + "step": 649 + }, + { + "epoch": 0.7975460122699386, + "grad_norm": 40.035923383900304, + "learning_rate": 3.708677685950413e-07, + "logits/chosen": -0.12255859375, + "logits/rejected": -0.296875, + "logps/chosen": -422.0, + "logps/rejected": -340.0, + "loss": 0.328, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.8125, + "rewards/margins": 5.1875, + "rewards/rejected": -3.375, + "step": 650 + }, + { + "epoch": 0.7987730061349694, + "grad_norm": 41.02033222140374, + "learning_rate": 3.7066115702479337e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.337890625, + "logps/chosen": -368.0, + "logps/rejected": -338.0, + "loss": 0.2567, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.78125, + "rewards/margins": 6.3125, + "rewards/rejected": -4.53125, + "step": 651 + }, + { + "epoch": 0.8, + "grad_norm": 43.99996770243787, + "learning_rate": 3.7045454545454547e-07, + "logits/chosen": -0.1943359375, + "logits/rejected": -0.333984375, + "logps/chosen": -364.0, + "logps/rejected": -332.0, + "loss": 0.304, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.796875, + "rewards/margins": 4.96875, + "rewards/rejected": -4.15625, + "step": 652 + }, + { + "epoch": 0.8012269938650307, + "grad_norm": 42.280947809979125, + "learning_rate": 3.7024793388429746e-07, + "logits/chosen": -0.142578125, + "logits/rejected": -0.322265625, + "logps/chosen": -346.0, + "logps/rejected": -316.0, + "loss": 0.2642, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.2890625, + "rewards/margins": 5.875, + "rewards/rejected": -4.59375, + "step": 653 + }, + { + "epoch": 0.8024539877300614, + "grad_norm": 33.69377308507155, + "learning_rate": 3.7004132231404956e-07, + "logits/chosen": -0.12255859375, + "logits/rejected": -0.330078125, + "logps/chosen": -388.0, + "logps/rejected": -302.0, + "loss": 0.2251, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.5546875, + "rewards/margins": 5.75, + "rewards/rejected": -4.1875, + "step": 654 + }, + { + "epoch": 0.803680981595092, + "grad_norm": 37.83873855183703, + "learning_rate": 3.698347107438016e-07, + "logits/chosen": -0.1806640625, + "logits/rejected": -0.35546875, + "logps/chosen": -380.0, + "logps/rejected": -332.0, + "loss": 0.2549, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.375, + "rewards/margins": 5.40625, + "rewards/rejected": -4.03125, + "step": 655 + }, + { + "epoch": 0.8049079754601227, + "grad_norm": 39.726835256559795, + "learning_rate": 3.696280991735537e-07, + "logits/chosen": -0.1171875, + "logits/rejected": -0.27734375, + "logps/chosen": -364.0, + "logps/rejected": -308.0, + "loss": 0.3072, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.15625, + "rewards/margins": 5.1875, + "rewards/rejected": -4.03125, + "step": 656 + }, + { + "epoch": 0.8061349693251534, + "grad_norm": 32.94464991591826, + "learning_rate": 3.6942148760330576e-07, + "logits/chosen": -0.2578125, + "logits/rejected": -0.416015625, + "logps/chosen": -354.0, + "logps/rejected": -318.0, + "loss": 0.2901, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.421875, + "rewards/margins": 5.375, + "rewards/rejected": -3.953125, + "step": 657 + }, + { + "epoch": 0.807361963190184, + "grad_norm": 35.33216238810386, + "learning_rate": 3.6921487603305786e-07, + "logits/chosen": -0.265625, + "logits/rejected": -0.408203125, + "logps/chosen": -386.0, + "logps/rejected": -330.0, + "loss": 0.265, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.34375, + "rewards/margins": 5.4375, + "rewards/rejected": -4.09375, + "step": 658 + }, + { + "epoch": 0.8085889570552147, + "grad_norm": 35.903067216165454, + "learning_rate": 3.690082644628099e-07, + "logits/chosen": -0.2060546875, + "logits/rejected": -0.365234375, + "logps/chosen": -358.0, + "logps/rejected": -316.0, + "loss": 0.2874, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.65625, + "rewards/margins": 5.0, + "rewards/rejected": -4.34375, + "step": 659 + }, + { + "epoch": 0.8098159509202454, + "grad_norm": 33.43274680085514, + "learning_rate": 3.68801652892562e-07, + "logits/chosen": -0.216796875, + "logits/rejected": -0.412109375, + "logps/chosen": -396.0, + "logps/rejected": -338.0, + "loss": 0.2533, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.7890625, + "rewards/margins": 5.9375, + "rewards/rejected": -4.15625, + "step": 660 + }, + { + "epoch": 0.811042944785276, + "grad_norm": 42.73024720052954, + "learning_rate": 3.6859504132231405e-07, + "logits/chosen": -0.158203125, + "logits/rejected": -0.267578125, + "logps/chosen": -356.0, + "logps/rejected": -284.0, + "loss": 0.3128, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.6640625, + "rewards/margins": 4.875, + "rewards/rejected": -4.21875, + "step": 661 + }, + { + "epoch": 0.8122699386503067, + "grad_norm": 29.594222057082835, + "learning_rate": 3.683884297520661e-07, + "logits/chosen": -0.16796875, + "logits/rejected": -0.306640625, + "logps/chosen": -360.0, + "logps/rejected": -308.0, + "loss": 0.211, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.5859375, + "rewards/margins": 6.03125, + "rewards/rejected": -4.4375, + "step": 662 + }, + { + "epoch": 0.8134969325153374, + "grad_norm": 30.816389985498457, + "learning_rate": 3.6818181818181815e-07, + "logits/chosen": -0.11669921875, + "logits/rejected": -0.3125, + "logps/chosen": -352.0, + "logps/rejected": -310.0, + "loss": 0.2494, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.6015625, + "rewards/margins": 5.625, + "rewards/rejected": -4.0, + "step": 663 + }, + { + "epoch": 0.8147239263803681, + "grad_norm": 27.861290032166615, + "learning_rate": 3.6797520661157025e-07, + "logits/chosen": -0.373046875, + "logits/rejected": -0.51953125, + "logps/chosen": -380.0, + "logps/rejected": -346.0, + "loss": 0.1714, + "rewards/accuracies": 0.9140625, + "rewards/chosen": 1.5390625, + "rewards/margins": 6.8125, + "rewards/rejected": -5.28125, + "step": 664 + }, + { + "epoch": 0.8159509202453987, + "grad_norm": 43.48547648980068, + "learning_rate": 3.677685950413223e-07, + "logits/chosen": -0.10009765625, + "logits/rejected": -0.267578125, + "logps/chosen": -332.0, + "logps/rejected": -280.0, + "loss": 0.2535, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.765625, + "rewards/margins": 5.34375, + "rewards/rejected": -4.59375, + "step": 665 + }, + { + "epoch": 0.8171779141104294, + "grad_norm": 41.230514254119846, + "learning_rate": 3.6756198347107434e-07, + "logits/chosen": -0.130859375, + "logits/rejected": -0.3203125, + "logps/chosen": -414.0, + "logps/rejected": -340.0, + "loss": 0.3107, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.4375, + "rewards/margins": 5.75, + "rewards/rejected": -4.3125, + "step": 666 + }, + { + "epoch": 0.8184049079754602, + "grad_norm": 38.330931790926165, + "learning_rate": 3.6735537190082644e-07, + "logits/chosen": -0.19921875, + "logits/rejected": -0.396484375, + "logps/chosen": -372.0, + "logps/rejected": -324.0, + "loss": 0.2562, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.21875, + "rewards/margins": 6.0, + "rewards/rejected": -4.78125, + "step": 667 + }, + { + "epoch": 0.8196319018404908, + "grad_norm": 36.01171777931778, + "learning_rate": 3.671487603305785e-07, + "logits/chosen": -0.19921875, + "logits/rejected": -0.33984375, + "logps/chosen": -386.0, + "logps/rejected": -340.0, + "loss": 0.2577, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.2734375, + "rewards/margins": 5.84375, + "rewards/rejected": -4.5625, + "step": 668 + }, + { + "epoch": 0.8208588957055215, + "grad_norm": 37.805581553660694, + "learning_rate": 3.669421487603306e-07, + "logits/chosen": -0.25390625, + "logits/rejected": -0.41796875, + "logps/chosen": -338.0, + "logps/rejected": -322.0, + "loss": 0.257, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 0.9375, + "rewards/margins": 5.5625, + "rewards/rejected": -4.625, + "step": 669 + }, + { + "epoch": 0.8220858895705522, + "grad_norm": 34.18026783004868, + "learning_rate": 3.6673553719008263e-07, + "logits/chosen": -0.0791015625, + "logits/rejected": -0.22265625, + "logps/chosen": -324.0, + "logps/rejected": -290.0, + "loss": 0.2365, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 0.9296875, + "rewards/margins": 5.46875, + "rewards/rejected": -4.53125, + "step": 670 + }, + { + "epoch": 0.8233128834355828, + "grad_norm": 31.80438827189515, + "learning_rate": 3.665289256198347e-07, + "logits/chosen": -0.1787109375, + "logits/rejected": -0.34375, + "logps/chosen": -374.0, + "logps/rejected": -320.0, + "loss": 0.242, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.609375, + "rewards/margins": 6.09375, + "rewards/rejected": -4.46875, + "step": 671 + }, + { + "epoch": 0.8245398773006135, + "grad_norm": 34.31886268675687, + "learning_rate": 3.6632231404958673e-07, + "logits/chosen": -0.1591796875, + "logits/rejected": -0.419921875, + "logps/chosen": -448.0, + "logps/rejected": -320.0, + "loss": 0.2443, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.875, + "rewards/margins": 6.53125, + "rewards/rejected": -4.65625, + "step": 672 + }, + { + "epoch": 0.8257668711656442, + "grad_norm": 35.357570263918994, + "learning_rate": 3.6611570247933883e-07, + "logits/chosen": -0.11083984375, + "logits/rejected": -0.3359375, + "logps/chosen": -390.0, + "logps/rejected": -318.0, + "loss": 0.2364, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.1484375, + "rewards/margins": 5.25, + "rewards/rejected": -4.09375, + "step": 673 + }, + { + "epoch": 0.8269938650306748, + "grad_norm": 33.53684126770598, + "learning_rate": 3.659090909090909e-07, + "logits/chosen": -0.0654296875, + "logits/rejected": -0.2333984375, + "logps/chosen": -356.0, + "logps/rejected": -320.0, + "loss": 0.2467, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.2734375, + "rewards/margins": 5.84375, + "rewards/rejected": -4.5625, + "step": 674 + }, + { + "epoch": 0.8282208588957055, + "grad_norm": 34.52915039204892, + "learning_rate": 3.65702479338843e-07, + "logits/chosen": -0.1376953125, + "logits/rejected": -0.3515625, + "logps/chosen": -426.0, + "logps/rejected": -356.0, + "loss": 0.2621, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.453125, + "rewards/margins": 6.15625, + "rewards/rejected": -4.71875, + "step": 675 + }, + { + "epoch": 0.8294478527607362, + "grad_norm": 39.20023525071254, + "learning_rate": 3.65495867768595e-07, + "logits/chosen": -0.2216796875, + "logits/rejected": -0.333984375, + "logps/chosen": -392.0, + "logps/rejected": -338.0, + "loss": 0.2552, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.640625, + "rewards/margins": 5.6875, + "rewards/rejected": -5.03125, + "step": 676 + }, + { + "epoch": 0.8306748466257668, + "grad_norm": 40.9061677699551, + "learning_rate": 3.652892561983471e-07, + "logits/chosen": -0.1181640625, + "logits/rejected": -0.291015625, + "logps/chosen": -336.0, + "logps/rejected": -298.0, + "loss": 0.2803, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.4609375, + "rewards/margins": 5.59375, + "rewards/rejected": -5.125, + "step": 677 + }, + { + "epoch": 0.8319018404907975, + "grad_norm": 35.838195895535726, + "learning_rate": 3.6508264462809917e-07, + "logits/chosen": -0.15625, + "logits/rejected": -0.361328125, + "logps/chosen": -418.0, + "logps/rejected": -342.0, + "loss": 0.2691, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.88671875, + "rewards/margins": 5.53125, + "rewards/rejected": -4.65625, + "step": 678 + }, + { + "epoch": 0.8331288343558282, + "grad_norm": 39.33502920792321, + "learning_rate": 3.648760330578512e-07, + "logits/chosen": -0.07080078125, + "logits/rejected": -0.1845703125, + "logps/chosen": -338.0, + "logps/rejected": -310.0, + "loss": 0.284, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.94140625, + "rewards/margins": 5.25, + "rewards/rejected": -4.3125, + "step": 679 + }, + { + "epoch": 0.8343558282208589, + "grad_norm": 35.15449592029737, + "learning_rate": 3.6466942148760326e-07, + "logits/chosen": -0.1923828125, + "logits/rejected": -0.369140625, + "logps/chosen": -454.0, + "logps/rejected": -356.0, + "loss": 0.2298, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.34375, + "rewards/margins": 6.375, + "rewards/rejected": -5.03125, + "step": 680 + }, + { + "epoch": 0.8355828220858895, + "grad_norm": 31.78034807618272, + "learning_rate": 3.6446280991735536e-07, + "logits/chosen": -0.21484375, + "logits/rejected": -0.37890625, + "logps/chosen": -346.0, + "logps/rejected": -316.0, + "loss": 0.1963, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 0.8984375, + "rewards/margins": 6.4375, + "rewards/rejected": -5.5625, + "step": 681 + }, + { + "epoch": 0.8368098159509203, + "grad_norm": 39.09021083370229, + "learning_rate": 3.642561983471074e-07, + "logits/chosen": -0.21875, + "logits/rejected": -0.341796875, + "logps/chosen": -350.0, + "logps/rejected": -316.0, + "loss": 0.301, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.74609375, + "rewards/margins": 5.78125, + "rewards/rejected": -5.03125, + "step": 682 + }, + { + "epoch": 0.838036809815951, + "grad_norm": 36.30997939377773, + "learning_rate": 3.640495867768595e-07, + "logits/chosen": -0.2294921875, + "logits/rejected": -0.349609375, + "logps/chosen": -370.0, + "logps/rejected": -308.0, + "loss": 0.2667, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.15625, + "rewards/margins": 6.28125, + "rewards/rejected": -5.125, + "step": 683 + }, + { + "epoch": 0.8392638036809816, + "grad_norm": 43.34454211125793, + "learning_rate": 3.6384297520661156e-07, + "logits/chosen": -0.06298828125, + "logits/rejected": -0.18359375, + "logps/chosen": -314.0, + "logps/rejected": -330.0, + "loss": 0.3642, + "rewards/accuracies": 0.8359375, + "rewards/chosen": -0.0263671875, + "rewards/margins": 4.6875, + "rewards/rejected": -4.71875, + "step": 684 + }, + { + "epoch": 0.8404907975460123, + "grad_norm": 34.04376739318291, + "learning_rate": 3.636363636363636e-07, + "logits/chosen": -0.1669921875, + "logits/rejected": -0.34375, + "logps/chosen": -396.0, + "logps/rejected": -356.0, + "loss": 0.2432, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.0546875, + "rewards/margins": 6.90625, + "rewards/rejected": -5.84375, + "step": 685 + }, + { + "epoch": 0.841717791411043, + "grad_norm": 32.60171699566285, + "learning_rate": 3.634297520661157e-07, + "logits/chosen": -0.1787109375, + "logits/rejected": -0.31640625, + "logps/chosen": -392.0, + "logps/rejected": -320.0, + "loss": 0.2556, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.0390625, + "rewards/margins": 6.0, + "rewards/rejected": -4.9375, + "step": 686 + }, + { + "epoch": 0.8429447852760736, + "grad_norm": 36.65354869863078, + "learning_rate": 3.6322314049586775e-07, + "logits/chosen": -0.16015625, + "logits/rejected": -0.306640625, + "logps/chosen": -374.0, + "logps/rejected": -338.0, + "loss": 0.2628, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.2109375, + "rewards/margins": 6.0625, + "rewards/rejected": -4.84375, + "step": 687 + }, + { + "epoch": 0.8441717791411043, + "grad_norm": 41.14195765537747, + "learning_rate": 3.630165289256198e-07, + "logits/chosen": -0.20703125, + "logits/rejected": -0.369140625, + "logps/chosen": -376.0, + "logps/rejected": -300.0, + "loss": 0.2638, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.177734375, + "rewards/margins": 5.53125, + "rewards/rejected": -5.34375, + "step": 688 + }, + { + "epoch": 0.845398773006135, + "grad_norm": 38.51353105415181, + "learning_rate": 3.6280991735537185e-07, + "logits/chosen": -0.162109375, + "logits/rejected": -0.265625, + "logps/chosen": -372.0, + "logps/rejected": -320.0, + "loss": 0.2884, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.2890625, + "rewards/margins": 6.0, + "rewards/rejected": -4.71875, + "step": 689 + }, + { + "epoch": 0.8466257668711656, + "grad_norm": 50.698015097303056, + "learning_rate": 3.6260330578512395e-07, + "logits/chosen": -0.044677734375, + "logits/rejected": -0.244140625, + "logps/chosen": -402.0, + "logps/rejected": -344.0, + "loss": 0.3436, + "rewards/accuracies": 0.796875, + "rewards/chosen": 1.5234375, + "rewards/margins": 6.1875, + "rewards/rejected": -4.65625, + "step": 690 + }, + { + "epoch": 0.8478527607361963, + "grad_norm": 30.814234506471102, + "learning_rate": 3.62396694214876e-07, + "logits/chosen": -0.3359375, + "logits/rejected": -0.458984375, + "logps/chosen": -356.0, + "logps/rejected": -340.0, + "loss": 0.2217, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.2421875, + "rewards/margins": 6.375, + "rewards/rejected": -5.125, + "step": 691 + }, + { + "epoch": 0.849079754601227, + "grad_norm": 43.15048361460468, + "learning_rate": 3.621900826446281e-07, + "logits/chosen": -0.1767578125, + "logits/rejected": -0.337890625, + "logps/chosen": -408.0, + "logps/rejected": -330.0, + "loss": 0.2766, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.640625, + "rewards/margins": 6.46875, + "rewards/rejected": -4.84375, + "step": 692 + }, + { + "epoch": 0.8503067484662576, + "grad_norm": 35.3095511118675, + "learning_rate": 3.6198347107438014e-07, + "logits/chosen": -0.189453125, + "logits/rejected": -0.392578125, + "logps/chosen": -442.0, + "logps/rejected": -360.0, + "loss": 0.2852, + "rewards/accuracies": 0.875, + "rewards/chosen": 2.0625, + "rewards/margins": 7.25, + "rewards/rejected": -5.1875, + "step": 693 + }, + { + "epoch": 0.8515337423312883, + "grad_norm": 50.92757487577681, + "learning_rate": 3.6177685950413224e-07, + "logits/chosen": -0.18359375, + "logits/rejected": -0.361328125, + "logps/chosen": -370.0, + "logps/rejected": -326.0, + "loss": 0.3663, + "rewards/accuracies": 0.796875, + "rewards/chosen": 0.73828125, + "rewards/margins": 4.96875, + "rewards/rejected": -4.21875, + "step": 694 + }, + { + "epoch": 0.852760736196319, + "grad_norm": 50.927014909943495, + "learning_rate": 3.615702479338843e-07, + "logits/chosen": -0.1689453125, + "logits/rejected": -0.26953125, + "logps/chosen": -328.0, + "logps/rejected": -302.0, + "loss": 0.4583, + "rewards/accuracies": 0.734375, + "rewards/chosen": 0.5625, + "rewards/margins": 4.34375, + "rewards/rejected": -3.765625, + "step": 695 + }, + { + "epoch": 0.8539877300613496, + "grad_norm": 39.49040375200759, + "learning_rate": 3.613636363636364e-07, + "logits/chosen": -0.130859375, + "logits/rejected": -0.306640625, + "logps/chosen": -382.0, + "logps/rejected": -314.0, + "loss": 0.2881, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.2734375, + "rewards/margins": 5.6875, + "rewards/rejected": -4.40625, + "step": 696 + }, + { + "epoch": 0.8552147239263803, + "grad_norm": 45.57900690356607, + "learning_rate": 3.611570247933884e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.328125, + "logps/chosen": -388.0, + "logps/rejected": -358.0, + "loss": 0.2838, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.8671875, + "rewards/margins": 6.46875, + "rewards/rejected": -4.59375, + "step": 697 + }, + { + "epoch": 0.8564417177914111, + "grad_norm": 38.81941112945181, + "learning_rate": 3.609504132231405e-07, + "logits/chosen": -0.1328125, + "logits/rejected": -0.279296875, + "logps/chosen": -394.0, + "logps/rejected": -344.0, + "loss": 0.2619, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.40625, + "rewards/margins": 6.125, + "rewards/rejected": -4.71875, + "step": 698 + }, + { + "epoch": 0.8576687116564418, + "grad_norm": 42.966064611435726, + "learning_rate": 3.6074380165289253e-07, + "logits/chosen": -0.2021484375, + "logits/rejected": -0.30078125, + "logps/chosen": -338.0, + "logps/rejected": -320.0, + "loss": 0.3034, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.5859375, + "rewards/margins": 5.25, + "rewards/rejected": -4.6875, + "step": 699 + }, + { + "epoch": 0.8588957055214724, + "grad_norm": 42.65113203498414, + "learning_rate": 3.6053719008264463e-07, + "logits/chosen": -0.11767578125, + "logits/rejected": -0.2353515625, + "logps/chosen": -370.0, + "logps/rejected": -320.0, + "loss": 0.3109, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.1015625, + "rewards/margins": 5.21875, + "rewards/rejected": -4.125, + "step": 700 + }, + { + "epoch": 0.8601226993865031, + "grad_norm": 45.17083911298038, + "learning_rate": 3.603305785123967e-07, + "logits/chosen": -0.08056640625, + "logits/rejected": -0.1982421875, + "logps/chosen": -380.0, + "logps/rejected": -320.0, + "loss": 0.3654, + "rewards/accuracies": 0.8046875, + "rewards/chosen": 0.75, + "rewards/margins": 5.34375, + "rewards/rejected": -4.59375, + "step": 701 + }, + { + "epoch": 0.8613496932515338, + "grad_norm": 31.973002163499245, + "learning_rate": 3.601239669421487e-07, + "logits/chosen": -0.2080078125, + "logits/rejected": -0.498046875, + "logps/chosen": -398.0, + "logps/rejected": -328.0, + "loss": 0.1933, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.8125, + "rewards/margins": 6.875, + "rewards/rejected": -5.0625, + "step": 702 + }, + { + "epoch": 0.8625766871165644, + "grad_norm": 36.36498243165029, + "learning_rate": 3.599173553719008e-07, + "logits/chosen": -0.10400390625, + "logits/rejected": -0.25, + "logps/chosen": -414.0, + "logps/rejected": -336.0, + "loss": 0.3136, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.203125, + "rewards/margins": 5.375, + "rewards/rejected": -4.1875, + "step": 703 + }, + { + "epoch": 0.8638036809815951, + "grad_norm": 35.79987216653264, + "learning_rate": 3.5971074380165287e-07, + "logits/chosen": -0.173828125, + "logits/rejected": -0.349609375, + "logps/chosen": -322.0, + "logps/rejected": -294.0, + "loss": 0.2837, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.1171875, + "rewards/margins": 5.8125, + "rewards/rejected": -4.6875, + "step": 704 + }, + { + "epoch": 0.8650306748466258, + "grad_norm": 36.827745109710804, + "learning_rate": 3.5950413223140497e-07, + "logits/chosen": -0.279296875, + "logits/rejected": -0.41015625, + "logps/chosen": -410.0, + "logps/rejected": -350.0, + "loss": 0.2403, + "rewards/accuracies": 0.875, + "rewards/chosen": 2.09375, + "rewards/margins": 6.75, + "rewards/rejected": -4.65625, + "step": 705 + }, + { + "epoch": 0.8662576687116564, + "grad_norm": 36.25592355489759, + "learning_rate": 3.5929752066115697e-07, + "logits/chosen": -0.216796875, + "logits/rejected": -0.41796875, + "logps/chosen": -398.0, + "logps/rejected": -294.0, + "loss": 0.2682, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.3984375, + "rewards/margins": 5.84375, + "rewards/rejected": -4.4375, + "step": 706 + }, + { + "epoch": 0.8674846625766871, + "grad_norm": 33.13517607643058, + "learning_rate": 3.5909090909090907e-07, + "logits/chosen": -0.228515625, + "logits/rejected": -0.388671875, + "logps/chosen": -382.0, + "logps/rejected": -302.0, + "loss": 0.2352, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.078125, + "rewards/margins": 6.0, + "rewards/rejected": -4.9375, + "step": 707 + }, + { + "epoch": 0.8687116564417178, + "grad_norm": 29.108052314139623, + "learning_rate": 3.588842975206611e-07, + "logits/chosen": -0.2119140625, + "logits/rejected": -0.4296875, + "logps/chosen": -370.0, + "logps/rejected": -308.0, + "loss": 0.2018, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.6328125, + "rewards/margins": 6.25, + "rewards/rejected": -4.625, + "step": 708 + }, + { + "epoch": 0.8699386503067484, + "grad_norm": 26.864603379868992, + "learning_rate": 3.586776859504132e-07, + "logits/chosen": -0.1123046875, + "logits/rejected": -0.28125, + "logps/chosen": -436.0, + "logps/rejected": -336.0, + "loss": 0.184, + "rewards/accuracies": 0.953125, + "rewards/chosen": 1.8046875, + "rewards/margins": 7.0, + "rewards/rejected": -5.1875, + "step": 709 + }, + { + "epoch": 0.8711656441717791, + "grad_norm": 39.09283390375149, + "learning_rate": 3.5847107438016526e-07, + "logits/chosen": -0.0732421875, + "logits/rejected": -0.2109375, + "logps/chosen": -362.0, + "logps/rejected": -308.0, + "loss": 0.3161, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 1.0859375, + "rewards/margins": 5.34375, + "rewards/rejected": -4.25, + "step": 710 + }, + { + "epoch": 0.8723926380368098, + "grad_norm": 29.706815103224322, + "learning_rate": 3.5826446280991736e-07, + "logits/chosen": -0.09912109375, + "logits/rejected": -0.29296875, + "logps/chosen": -382.0, + "logps/rejected": -312.0, + "loss": 0.2257, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.484375, + "rewards/margins": 5.84375, + "rewards/rejected": -4.375, + "step": 711 + }, + { + "epoch": 0.8736196319018404, + "grad_norm": 44.764736935363494, + "learning_rate": 3.580578512396694e-07, + "logits/chosen": -0.08984375, + "logits/rejected": -0.244140625, + "logps/chosen": -404.0, + "logps/rejected": -338.0, + "loss": 0.3157, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.984375, + "rewards/margins": 6.0, + "rewards/rejected": -4.03125, + "step": 712 + }, + { + "epoch": 0.8748466257668711, + "grad_norm": 33.83006454123061, + "learning_rate": 3.578512396694215e-07, + "logits/chosen": -0.1748046875, + "logits/rejected": -0.3671875, + "logps/chosen": -380.0, + "logps/rejected": -314.0, + "loss": 0.2531, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.234375, + "rewards/margins": 5.8125, + "rewards/rejected": -4.59375, + "step": 713 + }, + { + "epoch": 0.8760736196319019, + "grad_norm": 37.79578296577771, + "learning_rate": 3.5764462809917355e-07, + "logits/chosen": -0.07177734375, + "logits/rejected": -0.28515625, + "logps/chosen": -366.0, + "logps/rejected": -312.0, + "loss": 0.2529, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.2890625, + "rewards/margins": 5.5, + "rewards/rejected": -4.21875, + "step": 714 + }, + { + "epoch": 0.8773006134969326, + "grad_norm": 33.397821944610435, + "learning_rate": 3.574380165289256e-07, + "logits/chosen": -0.26953125, + "logits/rejected": -0.359375, + "logps/chosen": -382.0, + "logps/rejected": -312.0, + "loss": 0.2448, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.3046875, + "rewards/margins": 6.3125, + "rewards/rejected": -5.03125, + "step": 715 + }, + { + "epoch": 0.8785276073619632, + "grad_norm": 38.599098942966314, + "learning_rate": 3.5723140495867765e-07, + "logits/chosen": -0.236328125, + "logits/rejected": -0.423828125, + "logps/chosen": -382.0, + "logps/rejected": -308.0, + "loss": 0.3027, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.390625, + "rewards/margins": 5.5, + "rewards/rejected": -4.09375, + "step": 716 + }, + { + "epoch": 0.8797546012269939, + "grad_norm": 35.160888357665144, + "learning_rate": 3.5702479338842975e-07, + "logits/chosen": -0.146484375, + "logits/rejected": -0.30859375, + "logps/chosen": -342.0, + "logps/rejected": -268.0, + "loss": 0.2911, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.92578125, + "rewards/margins": 5.40625, + "rewards/rejected": -4.46875, + "step": 717 + }, + { + "epoch": 0.8809815950920246, + "grad_norm": 26.612419306861238, + "learning_rate": 3.568181818181818e-07, + "logits/chosen": -0.2333984375, + "logits/rejected": -0.3828125, + "logps/chosen": -398.0, + "logps/rejected": -336.0, + "loss": 0.1966, + "rewards/accuracies": 0.921875, + "rewards/chosen": 1.859375, + "rewards/margins": 6.15625, + "rewards/rejected": -4.3125, + "step": 718 + }, + { + "epoch": 0.8822085889570552, + "grad_norm": 39.83118714795231, + "learning_rate": 3.5661157024793384e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.3984375, + "logps/chosen": -406.0, + "logps/rejected": -346.0, + "loss": 0.2762, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 2.203125, + "rewards/margins": 6.34375, + "rewards/rejected": -4.15625, + "step": 719 + }, + { + "epoch": 0.8834355828220859, + "grad_norm": 30.80915305318243, + "learning_rate": 3.5640495867768594e-07, + "logits/chosen": -0.267578125, + "logits/rejected": -0.474609375, + "logps/chosen": -410.0, + "logps/rejected": -330.0, + "loss": 0.218, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 2.171875, + "rewards/margins": 6.125, + "rewards/rejected": -3.96875, + "step": 720 + }, + { + "epoch": 0.8846625766871166, + "grad_norm": 27.499435353414444, + "learning_rate": 3.56198347107438e-07, + "logits/chosen": -0.23828125, + "logits/rejected": -0.498046875, + "logps/chosen": -412.0, + "logps/rejected": -342.0, + "loss": 0.1999, + "rewards/accuracies": 0.90625, + "rewards/chosen": 1.7890625, + "rewards/margins": 6.875, + "rewards/rejected": -5.09375, + "step": 721 + }, + { + "epoch": 0.8858895705521472, + "grad_norm": 32.55228038139476, + "learning_rate": 3.559917355371901e-07, + "logits/chosen": -0.2353515625, + "logits/rejected": -0.333984375, + "logps/chosen": -378.0, + "logps/rejected": -336.0, + "loss": 0.222, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.8359375, + "rewards/margins": 6.09375, + "rewards/rejected": -4.25, + "step": 722 + }, + { + "epoch": 0.8871165644171779, + "grad_norm": 38.73866617415686, + "learning_rate": 3.5578512396694214e-07, + "logits/chosen": -0.23046875, + "logits/rejected": -0.3515625, + "logps/chosen": -372.0, + "logps/rejected": -314.0, + "loss": 0.2777, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.3046875, + "rewards/margins": 5.84375, + "rewards/rejected": -4.53125, + "step": 723 + }, + { + "epoch": 0.8883435582822086, + "grad_norm": 36.524786654594486, + "learning_rate": 3.555785123966942e-07, + "logits/chosen": -0.2265625, + "logits/rejected": -0.44921875, + "logps/chosen": -378.0, + "logps/rejected": -298.0, + "loss": 0.2442, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.6328125, + "rewards/margins": 6.0, + "rewards/rejected": -4.375, + "step": 724 + }, + { + "epoch": 0.8895705521472392, + "grad_norm": 38.158440355258406, + "learning_rate": 3.5537190082644623e-07, + "logits/chosen": -0.10986328125, + "logits/rejected": -0.283203125, + "logps/chosen": -400.0, + "logps/rejected": -318.0, + "loss": 0.283, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.390625, + "rewards/margins": 5.6875, + "rewards/rejected": -4.28125, + "step": 725 + }, + { + "epoch": 0.8907975460122699, + "grad_norm": 27.73103579824844, + "learning_rate": 3.5516528925619833e-07, + "logits/chosen": -0.2216796875, + "logits/rejected": -0.359375, + "logps/chosen": -334.0, + "logps/rejected": -280.0, + "loss": 0.1949, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.0703125, + "rewards/margins": 5.8125, + "rewards/rejected": -4.75, + "step": 726 + }, + { + "epoch": 0.8920245398773006, + "grad_norm": 34.09534371161639, + "learning_rate": 3.549586776859504e-07, + "logits/chosen": -0.2001953125, + "logits/rejected": -0.34765625, + "logps/chosen": -368.0, + "logps/rejected": -314.0, + "loss": 0.2172, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.515625, + "rewards/margins": 5.78125, + "rewards/rejected": -4.25, + "step": 727 + }, + { + "epoch": 0.8932515337423312, + "grad_norm": 39.39112103020417, + "learning_rate": 3.547520661157025e-07, + "logits/chosen": -0.208984375, + "logits/rejected": -0.361328125, + "logps/chosen": -398.0, + "logps/rejected": -354.0, + "loss": 0.2626, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.9765625, + "rewards/margins": 6.5625, + "rewards/rejected": -4.59375, + "step": 728 + }, + { + "epoch": 0.894478527607362, + "grad_norm": 37.23604455297992, + "learning_rate": 3.545454545454545e-07, + "logits/chosen": -0.2236328125, + "logits/rejected": -0.37890625, + "logps/chosen": -388.0, + "logps/rejected": -342.0, + "loss": 0.2356, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.640625, + "rewards/margins": 6.59375, + "rewards/rejected": -4.9375, + "step": 729 + }, + { + "epoch": 0.8957055214723927, + "grad_norm": 32.56560137662825, + "learning_rate": 3.543388429752066e-07, + "logits/chosen": -0.294921875, + "logits/rejected": -0.421875, + "logps/chosen": -398.0, + "logps/rejected": -354.0, + "loss": 0.2002, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 2.1875, + "rewards/margins": 6.9375, + "rewards/rejected": -4.75, + "step": 730 + }, + { + "epoch": 0.8969325153374234, + "grad_norm": 37.581323988938905, + "learning_rate": 3.5413223140495867e-07, + "logits/chosen": -0.1044921875, + "logits/rejected": -0.2412109375, + "logps/chosen": -430.0, + "logps/rejected": -338.0, + "loss": 0.2709, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.40625, + "rewards/margins": 6.15625, + "rewards/rejected": -4.75, + "step": 731 + }, + { + "epoch": 0.898159509202454, + "grad_norm": 42.424019347418515, + "learning_rate": 3.5392561983471077e-07, + "logits/chosen": -0.2451171875, + "logits/rejected": -0.419921875, + "logps/chosen": -372.0, + "logps/rejected": -346.0, + "loss": 0.3232, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.484375, + "rewards/margins": 5.9375, + "rewards/rejected": -4.46875, + "step": 732 + }, + { + "epoch": 0.8993865030674847, + "grad_norm": 30.46815348460911, + "learning_rate": 3.5371900826446277e-07, + "logits/chosen": -0.16015625, + "logits/rejected": -0.3203125, + "logps/chosen": -354.0, + "logps/rejected": -334.0, + "loss": 0.205, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.28125, + "rewards/margins": 6.09375, + "rewards/rejected": -4.8125, + "step": 733 + }, + { + "epoch": 0.9006134969325154, + "grad_norm": 40.11598742347428, + "learning_rate": 3.5351239669421487e-07, + "logits/chosen": -0.1337890625, + "logits/rejected": -0.322265625, + "logps/chosen": -374.0, + "logps/rejected": -326.0, + "loss": 0.2734, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.4140625, + "rewards/margins": 6.5625, + "rewards/rejected": -5.125, + "step": 734 + }, + { + "epoch": 0.901840490797546, + "grad_norm": 30.987246843568794, + "learning_rate": 3.533057851239669e-07, + "logits/chosen": -0.2392578125, + "logits/rejected": -0.47265625, + "logps/chosen": -422.0, + "logps/rejected": -358.0, + "loss": 0.1867, + "rewards/accuracies": 0.90625, + "rewards/chosen": 1.4921875, + "rewards/margins": 6.96875, + "rewards/rejected": -5.46875, + "step": 735 + }, + { + "epoch": 0.9030674846625767, + "grad_norm": 39.665000609602814, + "learning_rate": 3.53099173553719e-07, + "logits/chosen": -0.08203125, + "logits/rejected": -0.2138671875, + "logps/chosen": -352.0, + "logps/rejected": -316.0, + "loss": 0.3163, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.3671875, + "rewards/margins": 5.5625, + "rewards/rejected": -5.1875, + "step": 736 + }, + { + "epoch": 0.9042944785276074, + "grad_norm": 45.99636093708745, + "learning_rate": 3.5289256198347106e-07, + "logits/chosen": -0.1767578125, + "logits/rejected": -0.28125, + "logps/chosen": -350.0, + "logps/rejected": -322.0, + "loss": 0.3995, + "rewards/accuracies": 0.78125, + "rewards/chosen": 0.5546875, + "rewards/margins": 5.53125, + "rewards/rejected": -5.0, + "step": 737 + }, + { + "epoch": 0.905521472392638, + "grad_norm": 34.94091041398414, + "learning_rate": 3.526859504132231e-07, + "logits/chosen": -0.2255859375, + "logits/rejected": -0.361328125, + "logps/chosen": -440.0, + "logps/rejected": -336.0, + "loss": 0.2497, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.578125, + "rewards/margins": 6.5625, + "rewards/rejected": -5.0, + "step": 738 + }, + { + "epoch": 0.9067484662576687, + "grad_norm": 37.70067993632191, + "learning_rate": 3.524793388429752e-07, + "logits/chosen": -0.1650390625, + "logits/rejected": -0.30859375, + "logps/chosen": -338.0, + "logps/rejected": -318.0, + "loss": 0.2834, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.671875, + "rewards/margins": 5.65625, + "rewards/rejected": -4.96875, + "step": 739 + }, + { + "epoch": 0.9079754601226994, + "grad_norm": 33.58911831683584, + "learning_rate": 3.5227272727272725e-07, + "logits/chosen": -0.22265625, + "logits/rejected": -0.392578125, + "logps/chosen": -338.0, + "logps/rejected": -306.0, + "loss": 0.2496, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.60546875, + "rewards/margins": 6.09375, + "rewards/rejected": -5.5, + "step": 740 + }, + { + "epoch": 0.90920245398773, + "grad_norm": 35.571601551599564, + "learning_rate": 3.5206611570247935e-07, + "logits/chosen": -0.2119140625, + "logits/rejected": -0.38671875, + "logps/chosen": -352.0, + "logps/rejected": -306.0, + "loss": 0.2619, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.3515625, + "rewards/margins": 6.90625, + "rewards/rejected": -5.53125, + "step": 741 + }, + { + "epoch": 0.9104294478527607, + "grad_norm": 31.812391536470038, + "learning_rate": 3.5185950413223135e-07, + "logits/chosen": -0.2138671875, + "logits/rejected": -0.412109375, + "logps/chosen": -360.0, + "logps/rejected": -348.0, + "loss": 0.2088, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.484375, + "rewards/margins": 7.03125, + "rewards/rejected": -5.53125, + "step": 742 + }, + { + "epoch": 0.9116564417177914, + "grad_norm": 36.766990867423736, + "learning_rate": 3.5165289256198345e-07, + "logits/chosen": -0.19140625, + "logits/rejected": -0.263671875, + "logps/chosen": -416.0, + "logps/rejected": -368.0, + "loss": 0.2538, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.0390625, + "rewards/margins": 5.6875, + "rewards/rejected": -4.65625, + "step": 743 + }, + { + "epoch": 0.912883435582822, + "grad_norm": 30.797563569261442, + "learning_rate": 3.514462809917355e-07, + "logits/chosen": -0.1796875, + "logits/rejected": -0.373046875, + "logps/chosen": -376.0, + "logps/rejected": -318.0, + "loss": 0.2174, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.5546875, + "rewards/margins": 7.03125, + "rewards/rejected": -5.5, + "step": 744 + }, + { + "epoch": 0.9141104294478528, + "grad_norm": 37.182331193903785, + "learning_rate": 3.512396694214876e-07, + "logits/chosen": -0.1376953125, + "logits/rejected": -0.2451171875, + "logps/chosen": -342.0, + "logps/rejected": -300.0, + "loss": 0.2759, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.515625, + "rewards/margins": 5.40625, + "rewards/rejected": -4.875, + "step": 745 + }, + { + "epoch": 0.9153374233128835, + "grad_norm": 42.37840427394414, + "learning_rate": 3.5103305785123964e-07, + "logits/chosen": -0.140625, + "logits/rejected": -0.306640625, + "logps/chosen": -402.0, + "logps/rejected": -336.0, + "loss": 0.2818, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.96484375, + "rewards/margins": 5.9375, + "rewards/rejected": -4.96875, + "step": 746 + }, + { + "epoch": 0.9165644171779141, + "grad_norm": 36.09849932082116, + "learning_rate": 3.5082644628099174e-07, + "logits/chosen": -0.306640625, + "logits/rejected": -0.42578125, + "logps/chosen": -338.0, + "logps/rejected": -326.0, + "loss": 0.2741, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.51171875, + "rewards/margins": 5.3125, + "rewards/rejected": -4.8125, + "step": 747 + }, + { + "epoch": 0.9177914110429448, + "grad_norm": 39.853022506318325, + "learning_rate": 3.506198347107438e-07, + "logits/chosen": -0.11376953125, + "logits/rejected": -0.2314453125, + "logps/chosen": -372.0, + "logps/rejected": -332.0, + "loss": 0.3302, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.205078125, + "rewards/margins": 4.875, + "rewards/rejected": -4.65625, + "step": 748 + }, + { + "epoch": 0.9190184049079755, + "grad_norm": 40.89419641030945, + "learning_rate": 3.504132231404959e-07, + "logits/chosen": -0.2275390625, + "logits/rejected": -0.4375, + "logps/chosen": -416.0, + "logps/rejected": -336.0, + "loss": 0.3306, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 1.046875, + "rewards/margins": 6.1875, + "rewards/rejected": -5.15625, + "step": 749 + }, + { + "epoch": 0.9202453987730062, + "grad_norm": 48.1673918296563, + "learning_rate": 3.5020661157024794e-07, + "logits/chosen": -0.212890625, + "logits/rejected": -0.357421875, + "logps/chosen": -406.0, + "logps/rejected": -326.0, + "loss": 0.3386, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.66796875, + "rewards/margins": 5.75, + "rewards/rejected": -5.09375, + "step": 750 + }, + { + "epoch": 0.9214723926380368, + "grad_norm": 43.63193512219085, + "learning_rate": 3.5e-07, + "logits/chosen": -0.21484375, + "logits/rejected": -0.384765625, + "logps/chosen": -420.0, + "logps/rejected": -340.0, + "loss": 0.2867, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.1796875, + "rewards/margins": 6.4375, + "rewards/rejected": -5.25, + "step": 751 + }, + { + "epoch": 0.9226993865030675, + "grad_norm": 35.77618155880579, + "learning_rate": 3.4979338842975203e-07, + "logits/chosen": -0.216796875, + "logits/rejected": -0.478515625, + "logps/chosen": -418.0, + "logps/rejected": -346.0, + "loss": 0.2401, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.359375, + "rewards/margins": 6.875, + "rewards/rejected": -5.5, + "step": 752 + }, + { + "epoch": 0.9239263803680982, + "grad_norm": 38.24604411902878, + "learning_rate": 3.4958677685950413e-07, + "logits/chosen": -0.1181640625, + "logits/rejected": -0.265625, + "logps/chosen": -402.0, + "logps/rejected": -338.0, + "loss": 0.2709, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.71484375, + "rewards/margins": 5.59375, + "rewards/rejected": -4.875, + "step": 753 + }, + { + "epoch": 0.9251533742331288, + "grad_norm": 43.12286562619324, + "learning_rate": 3.493801652892562e-07, + "logits/chosen": -0.1767578125, + "logits/rejected": -0.345703125, + "logps/chosen": -386.0, + "logps/rejected": -326.0, + "loss": 0.3289, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.66015625, + "rewards/margins": 5.625, + "rewards/rejected": -4.9375, + "step": 754 + }, + { + "epoch": 0.9263803680981595, + "grad_norm": 34.65065790431959, + "learning_rate": 3.491735537190082e-07, + "logits/chosen": -0.2216796875, + "logits/rejected": -0.34765625, + "logps/chosen": -376.0, + "logps/rejected": -340.0, + "loss": 0.2314, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.87109375, + "rewards/margins": 5.90625, + "rewards/rejected": -5.03125, + "step": 755 + }, + { + "epoch": 0.9276073619631902, + "grad_norm": 32.01115835369059, + "learning_rate": 3.489669421487603e-07, + "logits/chosen": -0.1357421875, + "logits/rejected": -0.2294921875, + "logps/chosen": -332.0, + "logps/rejected": -302.0, + "loss": 0.2247, + "rewards/accuracies": 0.890625, + "rewards/chosen": 0.390625, + "rewards/margins": 5.4375, + "rewards/rejected": -5.03125, + "step": 756 + }, + { + "epoch": 0.9288343558282208, + "grad_norm": 29.79853888885103, + "learning_rate": 3.4876033057851237e-07, + "logits/chosen": -0.087890625, + "logits/rejected": -0.314453125, + "logps/chosen": -398.0, + "logps/rejected": -320.0, + "loss": 0.2143, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.4140625, + "rewards/margins": 6.28125, + "rewards/rejected": -4.875, + "step": 757 + }, + { + "epoch": 0.9300613496932515, + "grad_norm": 41.4434512511522, + "learning_rate": 3.4855371900826447e-07, + "logits/chosen": -0.142578125, + "logits/rejected": -0.3125, + "logps/chosen": -366.0, + "logps/rejected": -296.0, + "loss": 0.3204, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.494140625, + "rewards/margins": 5.40625, + "rewards/rejected": -4.90625, + "step": 758 + }, + { + "epoch": 0.9312883435582822, + "grad_norm": 33.101256433680135, + "learning_rate": 3.483471074380165e-07, + "logits/chosen": -0.1123046875, + "logits/rejected": -0.34375, + "logps/chosen": -386.0, + "logps/rejected": -318.0, + "loss": 0.2334, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.28125, + "rewards/margins": 5.8125, + "rewards/rejected": -4.53125, + "step": 759 + }, + { + "epoch": 0.9325153374233128, + "grad_norm": 31.858866512033583, + "learning_rate": 3.4814049586776857e-07, + "logits/chosen": -0.275390625, + "logits/rejected": -0.53515625, + "logps/chosen": -434.0, + "logps/rejected": -342.0, + "loss": 0.2656, + "rewards/accuracies": 0.859375, + "rewards/chosen": 2.046875, + "rewards/margins": 7.03125, + "rewards/rejected": -5.0, + "step": 760 + }, + { + "epoch": 0.9337423312883436, + "grad_norm": 42.354453289827106, + "learning_rate": 3.479338842975206e-07, + "logits/chosen": -0.08251953125, + "logits/rejected": -0.232421875, + "logps/chosen": -374.0, + "logps/rejected": -334.0, + "loss": 0.258, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.3359375, + "rewards/margins": 6.0625, + "rewards/rejected": -4.71875, + "step": 761 + }, + { + "epoch": 0.9349693251533743, + "grad_norm": 38.24811318296336, + "learning_rate": 3.477272727272727e-07, + "logits/chosen": -0.0703125, + "logits/rejected": -0.25390625, + "logps/chosen": -420.0, + "logps/rejected": -340.0, + "loss": 0.2519, + "rewards/accuracies": 0.9140625, + "rewards/chosen": 1.1953125, + "rewards/margins": 6.09375, + "rewards/rejected": -4.90625, + "step": 762 + }, + { + "epoch": 0.9361963190184049, + "grad_norm": 36.20016344003986, + "learning_rate": 3.4752066115702476e-07, + "logits/chosen": -0.1357421875, + "logits/rejected": -0.2333984375, + "logps/chosen": -388.0, + "logps/rejected": -338.0, + "loss": 0.2628, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.578125, + "rewards/margins": 6.25, + "rewards/rejected": -4.65625, + "step": 763 + }, + { + "epoch": 0.9374233128834356, + "grad_norm": 37.48666102403677, + "learning_rate": 3.4731404958677686e-07, + "logits/chosen": -0.330078125, + "logits/rejected": -0.490234375, + "logps/chosen": -320.0, + "logps/rejected": -294.0, + "loss": 0.2761, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 0.447265625, + "rewards/margins": 5.625, + "rewards/rejected": -5.15625, + "step": 764 + }, + { + "epoch": 0.9386503067484663, + "grad_norm": 44.1796891457386, + "learning_rate": 3.471074380165289e-07, + "logits/chosen": -0.126953125, + "logits/rejected": -0.2578125, + "logps/chosen": -392.0, + "logps/rejected": -298.0, + "loss": 0.3388, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.89453125, + "rewards/margins": 5.03125, + "rewards/rejected": -4.15625, + "step": 765 + }, + { + "epoch": 0.939877300613497, + "grad_norm": 36.01121716925078, + "learning_rate": 3.46900826446281e-07, + "logits/chosen": -0.16796875, + "logits/rejected": -0.37109375, + "logps/chosen": -434.0, + "logps/rejected": -316.0, + "loss": 0.268, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.546875, + "rewards/margins": 6.21875, + "rewards/rejected": -4.65625, + "step": 766 + }, + { + "epoch": 0.9411042944785276, + "grad_norm": 36.56160162737348, + "learning_rate": 3.4669421487603306e-07, + "logits/chosen": -0.1884765625, + "logits/rejected": -0.33984375, + "logps/chosen": -374.0, + "logps/rejected": -312.0, + "loss": 0.3045, + "rewards/accuracies": 0.796875, + "rewards/chosen": 1.2890625, + "rewards/margins": 6.03125, + "rewards/rejected": -4.75, + "step": 767 + }, + { + "epoch": 0.9423312883435583, + "grad_norm": 40.47132685816318, + "learning_rate": 3.464876033057851e-07, + "logits/chosen": -0.2021484375, + "logits/rejected": -0.3828125, + "logps/chosen": -398.0, + "logps/rejected": -360.0, + "loss": 0.2909, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.765625, + "rewards/margins": 6.3125, + "rewards/rejected": -4.5625, + "step": 768 + }, + { + "epoch": 0.943558282208589, + "grad_norm": 30.62201594248347, + "learning_rate": 3.4628099173553715e-07, + "logits/chosen": -0.21484375, + "logits/rejected": -0.361328125, + "logps/chosen": -366.0, + "logps/rejected": -318.0, + "loss": 0.2247, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.09375, + "rewards/margins": 6.15625, + "rewards/rejected": -5.0625, + "step": 769 + }, + { + "epoch": 0.9447852760736196, + "grad_norm": 43.60373632493513, + "learning_rate": 3.4607438016528925e-07, + "logits/chosen": -0.2255859375, + "logits/rejected": -0.474609375, + "logps/chosen": -404.0, + "logps/rejected": -348.0, + "loss": 0.2772, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 2.078125, + "rewards/margins": 6.28125, + "rewards/rejected": -4.1875, + "step": 770 + }, + { + "epoch": 0.9460122699386503, + "grad_norm": 45.17582091386918, + "learning_rate": 3.458677685950413e-07, + "logits/chosen": -0.2236328125, + "logits/rejected": -0.26171875, + "logps/chosen": -416.0, + "logps/rejected": -334.0, + "loss": 0.3922, + "rewards/accuracies": 0.78125, + "rewards/chosen": 0.78125, + "rewards/margins": 5.03125, + "rewards/rejected": -4.25, + "step": 771 + }, + { + "epoch": 0.947239263803681, + "grad_norm": 42.297058717421166, + "learning_rate": 3.456611570247934e-07, + "logits/chosen": -0.0947265625, + "logits/rejected": -0.31640625, + "logps/chosen": -410.0, + "logps/rejected": -336.0, + "loss": 0.295, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.734375, + "rewards/margins": 6.0, + "rewards/rejected": -4.28125, + "step": 772 + }, + { + "epoch": 0.9484662576687116, + "grad_norm": 36.5037310282473, + "learning_rate": 3.4545454545454544e-07, + "logits/chosen": -0.10009765625, + "logits/rejected": -0.287109375, + "logps/chosen": -360.0, + "logps/rejected": -298.0, + "loss": 0.2904, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.7890625, + "rewards/margins": 5.21875, + "rewards/rejected": -4.4375, + "step": 773 + }, + { + "epoch": 0.9496932515337423, + "grad_norm": 38.086980897558234, + "learning_rate": 3.452479338842975e-07, + "logits/chosen": -0.1240234375, + "logits/rejected": -0.263671875, + "logps/chosen": -344.0, + "logps/rejected": -296.0, + "loss": 0.3096, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.458984375, + "rewards/margins": 4.09375, + "rewards/rejected": -3.640625, + "step": 774 + }, + { + "epoch": 0.950920245398773, + "grad_norm": 36.85278680079692, + "learning_rate": 3.450413223140496e-07, + "logits/chosen": -0.03271484375, + "logits/rejected": -0.2275390625, + "logps/chosen": -398.0, + "logps/rejected": -332.0, + "loss": 0.2823, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.515625, + "rewards/margins": 5.09375, + "rewards/rejected": -3.578125, + "step": 775 + }, + { + "epoch": 0.9521472392638037, + "grad_norm": 34.94073241862638, + "learning_rate": 3.4483471074380164e-07, + "logits/chosen": -0.2265625, + "logits/rejected": -0.412109375, + "logps/chosen": -398.0, + "logps/rejected": -338.0, + "loss": 0.2924, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.796875, + "rewards/margins": 5.6875, + "rewards/rejected": -3.90625, + "step": 776 + }, + { + "epoch": 0.9533742331288344, + "grad_norm": 36.22271519573166, + "learning_rate": 3.446280991735537e-07, + "logits/chosen": -0.1953125, + "logits/rejected": -0.34375, + "logps/chosen": -390.0, + "logps/rejected": -314.0, + "loss": 0.2907, + "rewards/accuracies": 0.796875, + "rewards/chosen": 1.2109375, + "rewards/margins": 5.46875, + "rewards/rejected": -4.25, + "step": 777 + }, + { + "epoch": 0.9546012269938651, + "grad_norm": 38.284746149580194, + "learning_rate": 3.4442148760330573e-07, + "logits/chosen": -0.16796875, + "logits/rejected": -0.375, + "logps/chosen": -382.0, + "logps/rejected": -300.0, + "loss": 0.2391, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.125, + "rewards/margins": 5.03125, + "rewards/rejected": -3.90625, + "step": 778 + }, + { + "epoch": 0.9558282208588957, + "grad_norm": 42.74163715791748, + "learning_rate": 3.4421487603305783e-07, + "logits/chosen": -0.2236328125, + "logits/rejected": -0.40234375, + "logps/chosen": -428.0, + "logps/rejected": -332.0, + "loss": 0.2504, + "rewards/accuracies": 0.828125, + "rewards/chosen": 1.6015625, + "rewards/margins": 6.15625, + "rewards/rejected": -4.53125, + "step": 779 + }, + { + "epoch": 0.9570552147239264, + "grad_norm": 39.028284362830085, + "learning_rate": 3.440082644628099e-07, + "logits/chosen": -0.1259765625, + "logits/rejected": -0.298828125, + "logps/chosen": -368.0, + "logps/rejected": -334.0, + "loss": 0.327, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.81640625, + "rewards/margins": 5.0, + "rewards/rejected": -4.1875, + "step": 780 + }, + { + "epoch": 0.9582822085889571, + "grad_norm": 29.49560218073861, + "learning_rate": 3.43801652892562e-07, + "logits/chosen": -0.2294921875, + "logits/rejected": -0.458984375, + "logps/chosen": -416.0, + "logps/rejected": -328.0, + "loss": 0.1947, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.921875, + "rewards/margins": 6.9375, + "rewards/rejected": -5.0, + "step": 781 + }, + { + "epoch": 0.9595092024539877, + "grad_norm": 30.862418691296618, + "learning_rate": 3.43595041322314e-07, + "logits/chosen": -0.1962890625, + "logits/rejected": -0.314453125, + "logps/chosen": -358.0, + "logps/rejected": -326.0, + "loss": 0.2276, + "rewards/accuracies": 0.9140625, + "rewards/chosen": 1.1640625, + "rewards/margins": 5.53125, + "rewards/rejected": -4.375, + "step": 782 + }, + { + "epoch": 0.9607361963190184, + "grad_norm": 32.30854631034835, + "learning_rate": 3.433884297520661e-07, + "logits/chosen": -0.2138671875, + "logits/rejected": -0.3671875, + "logps/chosen": -408.0, + "logps/rejected": -344.0, + "loss": 0.2037, + "rewards/accuracies": 0.8984375, + "rewards/chosen": 1.609375, + "rewards/margins": 6.46875, + "rewards/rejected": -4.84375, + "step": 783 + }, + { + "epoch": 0.9619631901840491, + "grad_norm": 44.933495412305525, + "learning_rate": 3.4318181818181817e-07, + "logits/chosen": -0.189453125, + "logits/rejected": -0.2412109375, + "logps/chosen": -376.0, + "logps/rejected": -330.0, + "loss": 0.3216, + "rewards/accuracies": 0.828125, + "rewards/chosen": 0.421875, + "rewards/margins": 5.125, + "rewards/rejected": -4.71875, + "step": 784 + }, + { + "epoch": 0.9631901840490797, + "grad_norm": 35.45021237079088, + "learning_rate": 3.429752066115703e-07, + "logits/chosen": -0.146484375, + "logits/rejected": -0.314453125, + "logps/chosen": -374.0, + "logps/rejected": -300.0, + "loss": 0.2635, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.03125, + "rewards/margins": 5.96875, + "rewards/rejected": -4.9375, + "step": 785 + }, + { + "epoch": 0.9644171779141104, + "grad_norm": 31.822348766627872, + "learning_rate": 3.4276859504132227e-07, + "logits/chosen": -0.1396484375, + "logits/rejected": -0.34765625, + "logps/chosen": -362.0, + "logps/rejected": -308.0, + "loss": 0.2296, + "rewards/accuracies": 0.9140625, + "rewards/chosen": 0.5703125, + "rewards/margins": 5.8125, + "rewards/rejected": -5.21875, + "step": 786 + }, + { + "epoch": 0.9656441717791411, + "grad_norm": 35.86043202347341, + "learning_rate": 3.4256198347107437e-07, + "logits/chosen": -0.21484375, + "logits/rejected": -0.359375, + "logps/chosen": -402.0, + "logps/rejected": -326.0, + "loss": 0.2274, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 0.78125, + "rewards/margins": 6.40625, + "rewards/rejected": -5.625, + "step": 787 + }, + { + "epoch": 0.9668711656441717, + "grad_norm": 26.552313321059188, + "learning_rate": 3.423553719008264e-07, + "logits/chosen": -0.2255859375, + "logits/rejected": -0.408203125, + "logps/chosen": -382.0, + "logps/rejected": -346.0, + "loss": 0.1667, + "rewards/accuracies": 0.9296875, + "rewards/chosen": 1.1875, + "rewards/margins": 6.75, + "rewards/rejected": -5.5625, + "step": 788 + }, + { + "epoch": 0.9680981595092024, + "grad_norm": 33.30240522771134, + "learning_rate": 3.421487603305785e-07, + "logits/chosen": -0.1474609375, + "logits/rejected": -0.330078125, + "logps/chosen": -374.0, + "logps/rejected": -308.0, + "loss": 0.2769, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 0.419921875, + "rewards/margins": 5.4375, + "rewards/rejected": -5.0, + "step": 789 + }, + { + "epoch": 0.9693251533742331, + "grad_norm": 35.332506360333724, + "learning_rate": 3.4194214876033056e-07, + "logits/chosen": -0.263671875, + "logits/rejected": -0.484375, + "logps/chosen": -380.0, + "logps/rejected": -310.0, + "loss": 0.2259, + "rewards/accuracies": 0.890625, + "rewards/chosen": 0.71484375, + "rewards/margins": 6.03125, + "rewards/rejected": -5.3125, + "step": 790 + }, + { + "epoch": 0.9705521472392638, + "grad_norm": 35.242935109364, + "learning_rate": 3.417355371900826e-07, + "logits/chosen": -0.232421875, + "logits/rejected": -0.4453125, + "logps/chosen": -390.0, + "logps/rejected": -324.0, + "loss": 0.2483, + "rewards/accuracies": 0.859375, + "rewards/chosen": 1.1796875, + "rewards/margins": 6.84375, + "rewards/rejected": -5.6875, + "step": 791 + }, + { + "epoch": 0.9717791411042945, + "grad_norm": 38.00481733058289, + "learning_rate": 3.415289256198347e-07, + "logits/chosen": -0.232421875, + "logits/rejected": -0.392578125, + "logps/chosen": -432.0, + "logps/rejected": -354.0, + "loss": 0.3121, + "rewards/accuracies": 0.84375, + "rewards/chosen": 1.109375, + "rewards/margins": 5.5625, + "rewards/rejected": -4.46875, + "step": 792 + }, + { + "epoch": 0.9730061349693252, + "grad_norm": 39.05298404914802, + "learning_rate": 3.4132231404958676e-07, + "logits/chosen": -0.21875, + "logits/rejected": -0.365234375, + "logps/chosen": -384.0, + "logps/rejected": -340.0, + "loss": 0.3098, + "rewards/accuracies": 0.859375, + "rewards/chosen": 0.7109375, + "rewards/margins": 5.5, + "rewards/rejected": -4.78125, + "step": 793 + }, + { + "epoch": 0.9742331288343559, + "grad_norm": 40.1763340425155, + "learning_rate": 3.4111570247933886e-07, + "logits/chosen": -0.169921875, + "logits/rejected": -0.30859375, + "logps/chosen": -348.0, + "logps/rejected": -314.0, + "loss": 0.3445, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 0.3046875, + "rewards/margins": 5.3125, + "rewards/rejected": -5.0, + "step": 794 + }, + { + "epoch": 0.9754601226993865, + "grad_norm": 31.061860595685847, + "learning_rate": 3.4090909090909085e-07, + "logits/chosen": -0.3359375, + "logits/rejected": -0.515625, + "logps/chosen": -384.0, + "logps/rejected": -346.0, + "loss": 0.2126, + "rewards/accuracies": 0.890625, + "rewards/chosen": 1.65625, + "rewards/margins": 7.59375, + "rewards/rejected": -5.9375, + "step": 795 + }, + { + "epoch": 0.9766871165644172, + "grad_norm": 43.66859590907784, + "learning_rate": 3.4070247933884295e-07, + "logits/chosen": -0.244140625, + "logits/rejected": -0.447265625, + "logps/chosen": -400.0, + "logps/rejected": -312.0, + "loss": 0.2891, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.0830078125, + "rewards/margins": 5.5, + "rewards/rejected": -5.4375, + "step": 796 + }, + { + "epoch": 0.9779141104294479, + "grad_norm": 35.97056431665963, + "learning_rate": 3.40495867768595e-07, + "logits/chosen": -0.1767578125, + "logits/rejected": -0.357421875, + "logps/chosen": -394.0, + "logps/rejected": -300.0, + "loss": 0.2689, + "rewards/accuracies": 0.84375, + "rewards/chosen": 0.8359375, + "rewards/margins": 5.6875, + "rewards/rejected": -4.84375, + "step": 797 + }, + { + "epoch": 0.9791411042944785, + "grad_norm": 34.63236728191056, + "learning_rate": 3.402892561983471e-07, + "logits/chosen": -0.2099609375, + "logits/rejected": -0.388671875, + "logps/chosen": -424.0, + "logps/rejected": -354.0, + "loss": 0.2477, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.91015625, + "rewards/margins": 6.15625, + "rewards/rejected": -5.25, + "step": 798 + }, + { + "epoch": 0.9803680981595092, + "grad_norm": 40.12810675669665, + "learning_rate": 3.4008264462809914e-07, + "logits/chosen": -0.2470703125, + "logits/rejected": -0.421875, + "logps/chosen": -392.0, + "logps/rejected": -336.0, + "loss": 0.3047, + "rewards/accuracies": 0.8125, + "rewards/chosen": 1.125, + "rewards/margins": 6.0625, + "rewards/rejected": -4.9375, + "step": 799 + }, + { + "epoch": 0.9815950920245399, + "grad_norm": 36.02461663266261, + "learning_rate": 3.3987603305785124e-07, + "logits/chosen": -0.2255859375, + "logits/rejected": -0.42578125, + "logps/chosen": -378.0, + "logps/rejected": -324.0, + "loss": 0.2414, + "rewards/accuracies": 0.890625, + "rewards/chosen": 0.7265625, + "rewards/margins": 5.96875, + "rewards/rejected": -5.25, + "step": 800 + }, + { + "epoch": 0.9828220858895705, + "grad_norm": 42.912325824023604, + "learning_rate": 3.396694214876033e-07, + "logits/chosen": -0.2333984375, + "logits/rejected": -0.39453125, + "logps/chosen": -428.0, + "logps/rejected": -360.0, + "loss": 0.3447, + "rewards/accuracies": 0.7890625, + "rewards/chosen": 0.82421875, + "rewards/margins": 5.375, + "rewards/rejected": -4.5625, + "step": 801 + }, + { + "epoch": 0.9840490797546012, + "grad_norm": 43.08820301261888, + "learning_rate": 3.394628099173554e-07, + "logits/chosen": -0.28125, + "logits/rejected": -0.42578125, + "logps/chosen": -380.0, + "logps/rejected": -328.0, + "loss": 0.3234, + "rewards/accuracies": 0.8203125, + "rewards/chosen": 0.58203125, + "rewards/margins": 5.6875, + "rewards/rejected": -5.09375, + "step": 802 + }, + { + "epoch": 0.9852760736196319, + "grad_norm": 32.00066785635946, + "learning_rate": 3.3925619834710744e-07, + "logits/chosen": -0.333984375, + "logits/rejected": -0.5078125, + "logps/chosen": -390.0, + "logps/rejected": -324.0, + "loss": 0.2588, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.2578125, + "rewards/margins": 6.15625, + "rewards/rejected": -4.90625, + "step": 803 + }, + { + "epoch": 0.9865030674846625, + "grad_norm": 34.73198448187894, + "learning_rate": 3.390495867768595e-07, + "logits/chosen": -0.1806640625, + "logits/rejected": -0.3046875, + "logps/chosen": -352.0, + "logps/rejected": -320.0, + "loss": 0.3089, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 0.357421875, + "rewards/margins": 5.09375, + "rewards/rejected": -4.71875, + "step": 804 + }, + { + "epoch": 0.9877300613496932, + "grad_norm": 40.00296686612965, + "learning_rate": 3.3884297520661153e-07, + "logits/chosen": -0.2734375, + "logits/rejected": -0.421875, + "logps/chosen": -426.0, + "logps/rejected": -372.0, + "loss": 0.3066, + "rewards/accuracies": 0.8515625, + "rewards/chosen": 1.078125, + "rewards/margins": 6.15625, + "rewards/rejected": -5.09375, + "step": 805 + }, + { + "epoch": 0.9889570552147239, + "grad_norm": 40.373803134623145, + "learning_rate": 3.3863636363636363e-07, + "logits/chosen": -0.07470703125, + "logits/rejected": -0.2119140625, + "logps/chosen": -408.0, + "logps/rejected": -360.0, + "loss": 0.3327, + "rewards/accuracies": 0.796875, + "rewards/chosen": 0.79296875, + "rewards/margins": 5.34375, + "rewards/rejected": -4.53125, + "step": 806 + }, + { + "epoch": 0.9901840490797545, + "grad_norm": 38.793240604287554, + "learning_rate": 3.384297520661157e-07, + "logits/chosen": -0.162109375, + "logits/rejected": -0.32421875, + "logps/chosen": -394.0, + "logps/rejected": -324.0, + "loss": 0.2214, + "rewards/accuracies": 0.8828125, + "rewards/chosen": 1.140625, + "rewards/margins": 6.34375, + "rewards/rejected": -5.1875, + "step": 807 + }, + { + "epoch": 0.9914110429447853, + "grad_norm": 34.36639607943694, + "learning_rate": 3.3822314049586773e-07, + "logits/chosen": -0.291015625, + "logits/rejected": -0.3125, + "logps/chosen": -354.0, + "logps/rejected": -326.0, + "loss": 0.2778, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 0.34375, + "rewards/margins": 5.84375, + "rewards/rejected": -5.5, + "step": 808 + }, + { + "epoch": 0.992638036809816, + "grad_norm": 35.83788708559064, + "learning_rate": 3.3801652892561983e-07, + "logits/chosen": -0.205078125, + "logits/rejected": -0.43359375, + "logps/chosen": -428.0, + "logps/rejected": -334.0, + "loss": 0.2316, + "rewards/accuracies": 0.8671875, + "rewards/chosen": 1.6875, + "rewards/margins": 6.84375, + "rewards/rejected": -5.15625, + "step": 809 + }, + { + "epoch": 0.9938650306748467, + "grad_norm": 33.992147771254764, + "learning_rate": 3.378099173553719e-07, + "logits/chosen": -0.30078125, + "logits/rejected": -0.486328125, + "logps/chosen": -436.0, + "logps/rejected": -358.0, + "loss": 0.232, + "rewards/accuracies": 0.875, + "rewards/chosen": 1.34375, + "rewards/margins": 6.40625, + "rewards/rejected": -5.0625, + "step": 810 + }, + { + "epoch": 0.9950920245398773, + "grad_norm": 33.283496414356925, + "learning_rate": 3.37603305785124e-07, + "logits/chosen": -0.291015625, + "logits/rejected": -0.44921875, + "logps/chosen": -386.0, + "logps/rejected": -356.0, + "loss": 0.2725, + "rewards/accuracies": 0.8359375, + "rewards/chosen": 1.2578125, + "rewards/margins": 5.875, + "rewards/rejected": -4.625, + "step": 811 + }, + { + "epoch": 0.996319018404908, + "grad_norm": 37.39709126950234, + "learning_rate": 3.37396694214876e-07, + "logits/chosen": -0.271484375, + "logits/rejected": -0.359375, + "logps/chosen": -356.0, + "logps/rejected": -316.0, + "loss": 0.2424, + "rewards/accuracies": 0.921875, + "rewards/chosen": 0.65625, + "rewards/margins": 6.09375, + "rewards/rejected": -5.4375, + "step": 812 + }, + { + "epoch": 0.9975460122699387, + "grad_norm": 33.804195099429606, + "learning_rate": 3.3719008264462807e-07, + "logits/chosen": -0.1953125, + "logits/rejected": -0.341796875, + "logps/chosen": -336.0, + "logps/rejected": -314.0, + "loss": 0.1865, + "rewards/accuracies": 0.90625, + "rewards/chosen": 0.9140625, + "rewards/margins": 6.0625, + "rewards/rejected": -5.15625, + "step": 813 + }, + { + "epoch": 0.9987730061349693, + "grad_norm": 38.231813987979244, + "learning_rate": 3.369834710743801e-07, + "logits/chosen": -0.1884765625, + "logits/rejected": -0.2734375, + "logps/chosen": -378.0, + "logps/rejected": -346.0, + "loss": 0.3288, + "rewards/accuracies": 0.8125, + "rewards/chosen": 0.162109375, + "rewards/margins": 4.65625, + "rewards/rejected": -4.5, + "step": 814 + }, + { + "epoch": 1.0, + "grad_norm": 37.3431869316195, + "learning_rate": 3.367768595041322e-07, + "logits/chosen": -0.11572265625, + "logits/rejected": -0.306640625, + "logps/chosen": -378.0, + "logps/rejected": -338.0, + "loss": 0.203, + "rewards/accuracies": 0.8571429252624512, + "rewards/chosen": 0.859375, + "rewards/margins": 5.9375, + "rewards/rejected": -5.0625, + "step": 815 + } + ], + "logging_steps": 1, + "max_steps": 2445, + "num_input_tokens_seen": 0, + "num_train_epochs": 3, + "save_steps": 500, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 0.0, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/checkpoint-815/training_args.bin b/checkpoint-815/training_args.bin new file mode 100644 index 0000000..e6584e4 --- /dev/null +++ b/checkpoint-815/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2c8443655ac3e7ec4a935ee92ab8e32d8a6138b7510b01c0cdfb106a1174f6d8 +size 9528 diff --git a/checkpoint-815/zero_to_fp32.py b/checkpoint-815/zero_to_fp32.py new file mode 100644 index 0000000..24cc342 --- /dev/null +++ b/checkpoint-815/zero_to_fp32.py @@ -0,0 +1,604 @@ +#!/usr/bin/env python + +# Copyright (c) Microsoft Corporation. +# SPDX-License-Identifier: Apache-2.0 + +# DeepSpeed Team + +# This script extracts fp32 consolidated weights from a zero 1, 2 and 3 DeepSpeed checkpoints. It gets +# copied into the top level checkpoint dir, so the user can easily do the conversion at any point in +# the future. Once extracted, the weights don't require DeepSpeed and can be used in any +# application. +# +# example: python zero_to_fp32.py . pytorch_model.bin + +import argparse +import torch +import glob +import math +import os +import re +from collections import OrderedDict +from dataclasses import dataclass + +# while this script doesn't use deepspeed to recover data, since the checkpoints are pickled with +# DeepSpeed data structures it has to be available in the current python environment. +from deepspeed.utils import logger +from deepspeed.checkpoint.constants import (DS_VERSION, OPTIMIZER_STATE_DICT, SINGLE_PARTITION_OF_FP32_GROUPS, + FP32_FLAT_GROUPS, ZERO_STAGE, PARTITION_COUNT, PARAM_SHAPES, BUFFER_NAMES, + FROZEN_PARAM_SHAPES, FROZEN_PARAM_FRAGMENTS) + + +@dataclass +class zero_model_state: + buffers: dict() + param_shapes: dict() + shared_params: list + ds_version: int + frozen_param_shapes: dict() + frozen_param_fragments: dict() + + +debug = 0 + +# load to cpu +device = torch.device('cpu') + + +def atoi(text): + return int(text) if text.isdigit() else text + + +def natural_keys(text): + ''' + alist.sort(key=natural_keys) sorts in human order + http://nedbatchelder.com/blog/200712/human_sorting.html + (See Toothy's implementation in the comments) + ''' + return [atoi(c) for c in re.split(r'(\d+)', text)] + + +def get_model_state_file(checkpoint_dir, zero_stage): + if not os.path.isdir(checkpoint_dir): + raise FileNotFoundError(f"Directory '{checkpoint_dir}' doesn't exist") + + # there should be only one file + if zero_stage <= 2: + file = os.path.join(checkpoint_dir, "mp_rank_00_model_states.pt") + elif zero_stage == 3: + file = os.path.join(checkpoint_dir, "zero_pp_rank_0_mp_rank_00_model_states.pt") + + if not os.path.exists(file): + raise FileNotFoundError(f"can't find model states file at '{file}'") + + return file + + +def get_checkpoint_files(checkpoint_dir, glob_pattern): + # XXX: need to test that this simple glob rule works for multi-node setup too + ckpt_files = sorted(glob.glob(os.path.join(checkpoint_dir, glob_pattern)), key=natural_keys) + + if len(ckpt_files) == 0: + raise FileNotFoundError(f"can't find {glob_pattern} files in directory '{checkpoint_dir}'") + + return ckpt_files + + +def get_optim_files(checkpoint_dir): + return get_checkpoint_files(checkpoint_dir, "*_optim_states.pt") + + +def get_model_state_files(checkpoint_dir): + return get_checkpoint_files(checkpoint_dir, "*_model_states.pt") + + +def parse_model_states(files): + zero_model_states = [] + for file in files: + state_dict = torch.load(file, map_location=device) + + if BUFFER_NAMES not in state_dict: + raise ValueError(f"{file} is not a model state checkpoint") + buffer_names = state_dict[BUFFER_NAMES] + if debug: + print("Found buffers:", buffer_names) + + # recover just the buffers while restoring them to fp32 if they were saved in fp16 + buffers = {k: v.float() for k, v in state_dict["module"].items() if k in buffer_names} + param_shapes = state_dict[PARAM_SHAPES] + + # collect parameters that are included in param_shapes + param_names = [] + for s in param_shapes: + for name in s.keys(): + param_names.append(name) + + # update with frozen parameters + frozen_param_shapes = state_dict.get(FROZEN_PARAM_SHAPES, None) + if frozen_param_shapes is not None: + if debug: + print(f"Found frozen_param_shapes: {frozen_param_shapes}") + param_names += list(frozen_param_shapes.keys()) + + # handle shared params + shared_params = [[k, v] for k, v in state_dict["shared_params"].items()] + + ds_version = state_dict.get(DS_VERSION, None) + + frozen_param_fragments = state_dict.get(FROZEN_PARAM_FRAGMENTS, None) + + z_model_state = zero_model_state(buffers=buffers, + param_shapes=param_shapes, + shared_params=shared_params, + ds_version=ds_version, + frozen_param_shapes=frozen_param_shapes, + frozen_param_fragments=frozen_param_fragments) + zero_model_states.append(z_model_state) + + return zero_model_states + + +def parse_optim_states(files, ds_checkpoint_dir): + + total_files = len(files) + state_dicts = [] + for f in files: + state_dict = torch.load(f, map_location=device) + # immediately discard the potentially huge 2 optimizer states as we only care for fp32 master weights + # and also handle the case where it was already removed by another helper script + state_dict["optimizer_state_dict"].pop("optimizer_state_dict", None) + state_dicts.append(state_dict) + + if not ZERO_STAGE in state_dicts[0][OPTIMIZER_STATE_DICT]: + raise ValueError(f"{files[0]} is not a zero checkpoint") + zero_stage = state_dicts[0][OPTIMIZER_STATE_DICT][ZERO_STAGE] + world_size = state_dicts[0][OPTIMIZER_STATE_DICT][PARTITION_COUNT] + + # For ZeRO-2 each param group can have different partition_count as data parallelism for expert + # parameters can be different from data parallelism for non-expert parameters. So we can just + # use the max of the partition_count to get the dp world_size. + + if type(world_size) is list: + world_size = max(world_size) + + if world_size != total_files: + raise ValueError( + f"Expected {world_size} of '*_optim_states.pt' under '{ds_checkpoint_dir}' but found {total_files} files. " + "Possibly due to an overwrite of an old checkpoint, or a checkpoint didn't get saved by one or more processes." + ) + + # the groups are named differently in each stage + if zero_stage <= 2: + fp32_groups_key = SINGLE_PARTITION_OF_FP32_GROUPS + elif zero_stage == 3: + fp32_groups_key = FP32_FLAT_GROUPS + else: + raise ValueError(f"unknown zero stage {zero_stage}") + + if zero_stage <= 2: + fp32_flat_groups = [state_dicts[i][OPTIMIZER_STATE_DICT][fp32_groups_key] for i in range(len(state_dicts))] + elif zero_stage == 3: + # if there is more than one param group, there will be multiple flattened tensors - one + # flattened tensor per group - for simplicity merge them into a single tensor + # + # XXX: could make the script more memory efficient for when there are multiple groups - it + # will require matching the sub-lists of param_shapes for each param group flattened tensor + + fp32_flat_groups = [ + torch.cat(state_dicts[i][OPTIMIZER_STATE_DICT][fp32_groups_key], 0) for i in range(len(state_dicts)) + ] + + return zero_stage, world_size, fp32_flat_groups + + +def _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters): + """ + Returns fp32 state_dict reconstructed from ds checkpoint + + Args: + - ``ds_checkpoint_dir``: path to the deepspeed checkpoint folder (where the optimizer files are) + + """ + print(f"Processing zero checkpoint '{ds_checkpoint_dir}'") + + optim_files = get_optim_files(ds_checkpoint_dir) + zero_stage, world_size, fp32_flat_groups = parse_optim_states(optim_files, ds_checkpoint_dir) + print(f"Detected checkpoint of type zero stage {zero_stage}, world_size: {world_size}") + + model_files = get_model_state_files(ds_checkpoint_dir) + + zero_model_states = parse_model_states(model_files) + print(f'Parsing checkpoint created by deepspeed=={zero_model_states[0].ds_version}') + + if zero_stage <= 2: + return _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters) + elif zero_stage == 3: + return _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters) + + +def _zero2_merge_frozen_params(state_dict, zero_model_states): + if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0: + return + + frozen_param_shapes = zero_model_states[0].frozen_param_shapes + frozen_param_fragments = zero_model_states[0].frozen_param_fragments + + if debug: + num_elem = sum(s.numel() for s in frozen_param_shapes.values()) + print(f'rank 0: {FROZEN_PARAM_SHAPES}.numel = {num_elem}') + + wanted_params = len(frozen_param_shapes) + wanted_numel = sum(s.numel() for s in frozen_param_shapes.values()) + avail_numel = sum([p.numel() for p in frozen_param_fragments.values()]) + print(f'Frozen params: Have {avail_numel} numels to process.') + print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params') + + total_params = 0 + total_numel = 0 + for name, shape in frozen_param_shapes.items(): + total_params += 1 + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + + state_dict[name] = frozen_param_fragments[name] + + if debug: + print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ") + + print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements") + + +def _has_callable(obj, fn): + attr = getattr(obj, fn, None) + return callable(attr) + + +def _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states): + param_shapes = zero_model_states[0].param_shapes + + # Reconstruction protocol: + # + # XXX: document this + + if debug: + for i in range(world_size): + for j in range(len(fp32_flat_groups[0])): + print(f"{FP32_FLAT_GROUPS}[{i}][{j}].shape={fp32_flat_groups[i][j].shape}") + + # XXX: memory usage doubles here (zero2) + num_param_groups = len(fp32_flat_groups[0]) + merged_single_partition_of_fp32_groups = [] + for i in range(num_param_groups): + merged_partitions = [sd[i] for sd in fp32_flat_groups] + full_single_fp32_vector = torch.cat(merged_partitions, 0) + merged_single_partition_of_fp32_groups.append(full_single_fp32_vector) + avail_numel = sum( + [full_single_fp32_vector.numel() for full_single_fp32_vector in merged_single_partition_of_fp32_groups]) + + if debug: + wanted_params = sum([len(shapes) for shapes in param_shapes]) + wanted_numel = sum([sum(shape.numel() for shape in shapes.values()) for shapes in param_shapes]) + # not asserting if there is a mismatch due to possible padding + print(f"Have {avail_numel} numels to process.") + print(f"Need {wanted_numel} numels in {wanted_params} params.") + + # params + # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support + # out-of-core computing solution + total_numel = 0 + total_params = 0 + for shapes, full_single_fp32_vector in zip(param_shapes, merged_single_partition_of_fp32_groups): + offset = 0 + avail_numel = full_single_fp32_vector.numel() + for name, shape in shapes.items(): + + unpartitioned_numel = shape.numel() if _has_callable(shape, 'numel') else math.prod(shape) + total_numel += unpartitioned_numel + total_params += 1 + + if debug: + print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ") + state_dict[name] = full_single_fp32_vector.narrow(0, offset, unpartitioned_numel).view(shape) + offset += unpartitioned_numel + + # Z2 started to align to 2*world_size to improve nccl performance. Therefore both offset and + # avail_numel can differ by anywhere between 0..2*world_size. Due to two unrelated complex + # paddings performed in the code it's almost impossible to predict the exact numbers w/o the + # live optimizer object, so we are checking that the numbers are within the right range + align_to = 2 * world_size + + def zero2_align(x): + return align_to * math.ceil(x / align_to) + + if debug: + print(f"original offset={offset}, avail_numel={avail_numel}") + + offset = zero2_align(offset) + avail_numel = zero2_align(avail_numel) + + if debug: + print(f"aligned offset={offset}, avail_numel={avail_numel}") + + # Sanity check + if offset != avail_numel: + raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong") + + print(f"Reconstructed fp32 state dict with {total_params} params {total_numel} elements") + + +def _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters): + state_dict = OrderedDict() + + # buffers + buffers = zero_model_states[0].buffers + state_dict.update(buffers) + if debug: + print(f"added {len(buffers)} buffers") + + if not exclude_frozen_parameters: + _zero2_merge_frozen_params(state_dict, zero_model_states) + + _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states) + + # recover shared parameters + for pair in zero_model_states[0].shared_params: + if pair[1] in state_dict: + state_dict[pair[0]] = state_dict[pair[1]] + + return state_dict + + +def zero3_partitioned_param_info(unpartitioned_numel, world_size): + remainder = unpartitioned_numel % world_size + padding_numel = (world_size - remainder) if remainder else 0 + partitioned_numel = math.ceil(unpartitioned_numel / world_size) + return partitioned_numel, padding_numel + + +def _zero3_merge_frozen_params(state_dict, world_size, zero_model_states): + if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0: + return + + if debug: + for i in range(world_size): + num_elem = sum(s.numel() for s in zero_model_states[i].frozen_param_fragments.values()) + print(f'rank {i}: {FROZEN_PARAM_SHAPES}.numel = {num_elem}') + + frozen_param_shapes = zero_model_states[0].frozen_param_shapes + wanted_params = len(frozen_param_shapes) + wanted_numel = sum(s.numel() for s in frozen_param_shapes.values()) + avail_numel = sum([p.numel() for p in zero_model_states[0].frozen_param_fragments.values()]) * world_size + print(f'Frozen params: Have {avail_numel} numels to process.') + print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params') + + total_params = 0 + total_numel = 0 + for name, shape in zero_model_states[0].frozen_param_shapes.items(): + total_params += 1 + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + + param_frags = tuple(model_state.frozen_param_fragments[name] for model_state in zero_model_states) + state_dict[name] = torch.cat(param_frags, 0).narrow(0, 0, unpartitioned_numel).view(shape) + + partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size) + + if debug: + print( + f"Frozen params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}" + ) + + print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements") + + +def _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states): + param_shapes = zero_model_states[0].param_shapes + avail_numel = fp32_flat_groups[0].numel() * world_size + # Reconstruction protocol: For zero3 we need to zip the partitions together at boundary of each + # param, re-consolidating each param, while dealing with padding if any + + # merge list of dicts, preserving order + param_shapes = {k: v for d in param_shapes for k, v in d.items()} + + if debug: + for i in range(world_size): + print(f"{FP32_FLAT_GROUPS}[{i}].shape={fp32_flat_groups[i].shape}") + + wanted_params = len(param_shapes) + wanted_numel = sum(shape.numel() for shape in param_shapes.values()) + # not asserting if there is a mismatch due to possible padding + avail_numel = fp32_flat_groups[0].numel() * world_size + print(f"Trainable params: Have {avail_numel} numels to process.") + print(f"Trainable params: Need {wanted_numel} numels in {wanted_params} params.") + + # params + # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support + # out-of-core computing solution + offset = 0 + total_numel = 0 + total_params = 0 + for name, shape in param_shapes.items(): + + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + total_params += 1 + + partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size) + + if debug: + print( + f"Trainable params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}" + ) + + # XXX: memory usage doubles here + state_dict[name] = torch.cat( + tuple(fp32_flat_groups[i].narrow(0, offset, partitioned_numel) for i in range(world_size)), + 0).narrow(0, 0, unpartitioned_numel).view(shape) + offset += partitioned_numel + + offset *= world_size + + # Sanity check + if offset != avail_numel: + raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong") + + print(f"Reconstructed Trainable fp32 state dict with {total_params} params {total_numel} elements") + + +def _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters): + state_dict = OrderedDict() + + # buffers + buffers = zero_model_states[0].buffers + state_dict.update(buffers) + if debug: + print(f"added {len(buffers)} buffers") + + if not exclude_frozen_parameters: + _zero3_merge_frozen_params(state_dict, world_size, zero_model_states) + + _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states) + + # recover shared parameters + for pair in zero_model_states[0].shared_params: + if pair[1] in state_dict: + state_dict[pair[0]] = state_dict[pair[1]] + + return state_dict + + +def get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, tag=None, exclude_frozen_parameters=False): + """ + Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated state_dict that can be loaded with + ``load_state_dict()`` and used for training without DeepSpeed or shared with others, for example + via a model hub. + + Args: + - ``checkpoint_dir``: path to the desired checkpoint folder + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in 'latest' file. e.g., ``global_step14`` + - ``exclude_frozen_parameters``: exclude frozen parameters + + Returns: + - pytorch ``state_dict`` + + Note: this approach may not work if your application doesn't have sufficient free CPU memory and + you may need to use the offline approach using the ``zero_to_fp32.py`` script that is saved with + the checkpoint. + + A typical usage might be :: + + from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint + # do the training and checkpoint saving + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir) # already on cpu + model = model.cpu() # move to cpu + model.load_state_dict(state_dict) + # submit to model hub or save the model to share with others + + In this example the ``model`` will no longer be usable in the deepspeed context of the same + application. i.e. you will need to re-initialize the deepspeed engine, since + ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it. + + If you want it all done for you, use ``load_state_dict_from_zero_checkpoint`` instead. + + """ + if tag is None: + latest_path = os.path.join(checkpoint_dir, 'latest') + if os.path.isfile(latest_path): + with open(latest_path, 'r') as fd: + tag = fd.read().strip() + else: + raise ValueError(f"Unable to find 'latest' file at {latest_path}") + + ds_checkpoint_dir = os.path.join(checkpoint_dir, tag) + + if not os.path.isdir(ds_checkpoint_dir): + raise FileNotFoundError(f"Directory '{ds_checkpoint_dir}' doesn't exist") + + return _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters) + + +def convert_zero_checkpoint_to_fp32_state_dict(checkpoint_dir, output_file, tag=None, exclude_frozen_parameters=False): + """ + Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict`` file that can be + loaded with ``torch.load(file)`` + ``load_state_dict()`` and used for training without DeepSpeed. + + Args: + - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``) + - ``output_file``: path to the pytorch fp32 state_dict output file (e.g. path/pytorch_model.bin) + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14`` + - ``exclude_frozen_parameters``: exclude frozen parameters + """ + + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, tag, exclude_frozen_parameters) + print(f"Saving fp32 state dict to {output_file}") + torch.save(state_dict, output_file) + + +def load_state_dict_from_zero_checkpoint(model, checkpoint_dir, tag=None): + """ + 1. Put the provided model to cpu + 2. Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict`` + 3. Load it into the provided model + + Args: + - ``model``: the model object to update + - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``) + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14`` + + Returns: + - ``model`: modified model + + Make sure you have plenty of CPU memory available before you call this function. If you don't + have enough use the ``zero_to_fp32.py`` utility to do the conversion. You will find it + conveniently placed for you in the checkpoint folder. + + A typical usage might be :: + + from deepspeed.utils.zero_to_fp32 import load_state_dict_from_zero_checkpoint + model = load_state_dict_from_zero_checkpoint(trainer.model, checkpoint_dir) + # submit to model hub or save the model to share with others + + Note, that once this was run, the ``model`` will no longer be usable in the deepspeed context + of the same application. i.e. you will need to re-initialize the deepspeed engine, since + ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it. + + """ + logger.info(f"Extracting fp32 weights") + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, tag) + + logger.info(f"Overwriting model with fp32 weights") + model = model.cpu() + model.load_state_dict(state_dict, strict=False) + + return model + + +if __name__ == "__main__": + + parser = argparse.ArgumentParser() + parser.add_argument("checkpoint_dir", + type=str, + help="path to the desired checkpoint folder, e.g., path/checkpoint-12") + parser.add_argument( + "output_file", + type=str, + help="path to the pytorch fp32 state_dict output file (e.g. path/checkpoint-12/pytorch_model.bin)") + parser.add_argument("-t", + "--tag", + type=str, + default=None, + help="checkpoint tag used as a unique identifier for checkpoint. e.g., global_step1") + parser.add_argument("--exclude_frozen_parameters", action='store_true', help="exclude frozen parameters") + parser.add_argument("-d", "--debug", action='store_true', help="enable debug") + args = parser.parse_args() + + debug = args.debug + + convert_zero_checkpoint_to_fp32_state_dict(args.checkpoint_dir, + args.output_file, + tag=args.tag, + exclude_frozen_parameters=args.exclude_frozen_parameters) diff --git a/config.json b/config.json new file mode 100644 index 0000000..ded5a8b --- /dev/null +++ b/config.json @@ -0,0 +1,35 @@ +{ + "architectures": [ + "LlamaForCausalLM" + ], + "attention_bias": false, + "attention_dropout": 0.0, + "bos_token_id": 128000, + "eos_token_id": 128009, + "head_dim": 128, + "hidden_act": "silu", + "hidden_size": 4096, + "initializer_range": 0.02, + "intermediate_size": 14336, + "max_position_embeddings": 131072, + "mlp_bias": false, + "model_type": "llama", + "num_attention_heads": 32, + "num_hidden_layers": 32, + "num_key_value_heads": 8, + "pretraining_tp": 1, + "rms_norm_eps": 1e-05, + "rope_scaling": { + "factor": 8.0, + "high_freq_factor": 4.0, + "low_freq_factor": 1.0, + "original_max_position_embeddings": 8192, + "rope_type": "llama3" + }, + "rope_theta": 500000.0, + "tie_word_embeddings": false, + "torch_dtype": "bfloat16", + "transformers_version": "4.50.0", + "use_cache": false, + "vocab_size": 128256 +} diff --git a/configuration.json b/configuration.json new file mode 100644 index 0000000..bbeeda1 --- /dev/null +++ b/configuration.json @@ -0,0 +1 @@ +{"framework": "pytorch", "task": "text-generation", "allow_remote": true} \ No newline at end of file diff --git a/generation_config.json b/generation_config.json new file mode 100644 index 0000000..0acdb5a --- /dev/null +++ b/generation_config.json @@ -0,0 +1,12 @@ +{ + "bos_token_id": 128000, + "do_sample": true, + "eos_token_id": [ + 128001, + 128008, + 128009 + ], + "temperature": 0.6, + "top_p": 0.9, + "transformers_version": "4.50.0" +} diff --git a/model-00001-of-00004.safetensors b/model-00001-of-00004.safetensors new file mode 100644 index 0000000..ed64cd7 --- /dev/null +++ b/model-00001-of-00004.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:cff81d17a3cd81e9d2b0ead991e0e87179e8e68a1affd888ec8bd5436a6abc66 +size 4976698672 diff --git a/model-00002-of-00004.safetensors b/model-00002-of-00004.safetensors new file mode 100644 index 0000000..937035a --- /dev/null +++ b/model-00002-of-00004.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2842ae76f40d60eaaaa64f3fdc59fe484e071540609ea5786362fbe2c50e710e +size 4999802720 diff --git a/model-00003-of-00004.safetensors b/model-00003-of-00004.safetensors new file mode 100644 index 0000000..eecf8e9 --- /dev/null +++ b/model-00003-of-00004.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:67cbf5fb045e08815772745e13a1f87329294c7e9392ec96189dbe1fdd401a70 +size 4915916176 diff --git a/model-00004-of-00004.safetensors b/model-00004-of-00004.safetensors new file mode 100644 index 0000000..382c28f --- /dev/null +++ b/model-00004-of-00004.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b930bd71a39f3f5eeafea36d2cfb07b2271c03f0bfd1ba632abd42d9793c6c4b +size 1168138808 diff --git a/model.safetensors.index.json b/model.safetensors.index.json new file mode 100644 index 0000000..0fd8120 --- /dev/null +++ b/model.safetensors.index.json @@ -0,0 +1,298 @@ +{ + "metadata": { + "total_size": 16060522496 + }, + "weight_map": { + "lm_head.weight": "model-00004-of-00004.safetensors", + "model.embed_tokens.weight": "model-00001-of-00004.safetensors", + "model.layers.0.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.0.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.0.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.0.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.0.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.0.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.0.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.0.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.0.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.1.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.1.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.1.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.1.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.1.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.1.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.1.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.1.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.1.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.10.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.10.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.10.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.10.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.10.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.10.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.10.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.10.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.10.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.11.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.11.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.11.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.11.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.11.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.11.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.11.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.11.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.11.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.12.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.12.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.12.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.12.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.12.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.12.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.12.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.12.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.12.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.13.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.13.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.13.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.13.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.13.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.13.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.13.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.13.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.13.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.14.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.14.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.14.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.14.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.14.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.14.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.14.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.14.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.14.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.15.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.15.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.15.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.15.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.15.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.15.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.15.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.15.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.15.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.16.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.16.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.16.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.16.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.16.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.16.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.16.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.16.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.16.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.17.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.17.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.17.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.17.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.17.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.17.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.17.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.17.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.17.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.18.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.18.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.18.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.18.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.18.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.18.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.18.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.18.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.18.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.19.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.19.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.19.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.19.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.19.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.19.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.19.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.19.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.19.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.2.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.2.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.2.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.2.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.2.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.2.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.2.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.2.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.2.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.20.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.20.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.20.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.20.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.20.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.20.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.20.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.20.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.20.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.21.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.21.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.21.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.21.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.21.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.21.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.21.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.21.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.21.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.22.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.22.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.22.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.22.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.22.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.22.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.22.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.22.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.22.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.23.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.23.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.23.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.23.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.23.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.23.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.23.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.23.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.23.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.24.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.24.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.24.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.24.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.24.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.24.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.24.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.24.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.24.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.25.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.25.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.25.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.25.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.25.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.25.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.25.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.25.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.25.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.26.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.26.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.26.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.26.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.26.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.26.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.26.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.26.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.26.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.27.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.27.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.27.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.27.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.27.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.27.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.27.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.27.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.27.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.28.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.28.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.28.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.28.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.28.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.28.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.28.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.28.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.28.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.29.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.29.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.29.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.29.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.29.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.29.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.29.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.29.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.29.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.3.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.3.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.3.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.3.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.3.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.3.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.3.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.3.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.3.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.30.input_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.30.mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.30.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.30.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.30.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "model.layers.30.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.30.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.30.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.30.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.31.input_layernorm.weight": "model-00004-of-00004.safetensors", + "model.layers.31.mlp.down_proj.weight": "model-00004-of-00004.safetensors", + "model.layers.31.mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.31.mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.31.post_attention_layernorm.weight": "model-00004-of-00004.safetensors", + "model.layers.31.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.31.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.31.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.31.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "model.layers.4.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.4.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.4.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.4.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.4.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.4.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.4.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.4.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.4.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.5.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.5.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.5.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.5.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.5.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.5.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.5.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.5.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.5.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.6.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.6.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.6.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.6.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.6.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.6.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.6.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.6.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.6.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.7.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.7.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.7.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.7.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.7.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.7.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.7.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.7.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.7.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.8.input_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.8.mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.8.mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.8.mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.8.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "model.layers.8.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.8.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.8.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.8.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "model.layers.9.input_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.9.mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.9.mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.9.mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.9.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "model.layers.9.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.9.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.9.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "model.layers.9.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "model.norm.weight": "model-00004-of-00004.safetensors" + } +} diff --git a/runs/Apr03_06-01-58_ip-10-1-1-135/events.out.tfevents.1743660167.ip-10-1-1-135.3479241.0 b/runs/Apr03_06-01-58_ip-10-1-1-135/events.out.tfevents.1743660167.ip-10-1-1-135.3479241.0 new file mode 100644 index 0000000..c30962f --- /dev/null +++ b/runs/Apr03_06-01-58_ip-10-1-1-135/events.out.tfevents.1743660167.ip-10-1-1-135.3479241.0 @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c60ea4cd0e084cff25dec5b4db2a150109e7ebae3ff54661978bb4bad46ef2d0 +size 1688666 diff --git a/special_tokens_map.json b/special_tokens_map.json new file mode 100644 index 0000000..278b7f0 --- /dev/null +++ b/special_tokens_map.json @@ -0,0 +1,23 @@ +{ + "bos_token": { + "content": "<|begin_of_text|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false + }, + "eos_token": { + "content": "<|eot_id|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false + }, + "pad_token": { + "content": "<|end_of_text|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false + } +} diff --git a/tokenizer.json b/tokenizer.json new file mode 100644 index 0000000..1c1d8d5 --- /dev/null +++ b/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6b9e4e7fb171f92fd137b777cc2714bf87d11576700a1dcd7a399e7bbe39537b +size 17209920 diff --git a/tokenizer_config.json b/tokenizer_config.json new file mode 100644 index 0000000..8098161 --- /dev/null +++ b/tokenizer_config.json @@ -0,0 +1,2064 @@ +{ + "added_tokens_decoder": { + "128000": { + "content": "<|begin_of_text|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128001": { + "content": "<|end_of_text|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128002": { + "content": "<|reserved_special_token_0|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128003": { + "content": "<|reserved_special_token_1|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128004": { + "content": "<|finetune_right_pad_id|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128005": { + "content": "<|reserved_special_token_2|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128006": { + "content": "<|start_header_id|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128007": { + "content": "<|end_header_id|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128008": { + "content": "<|eom_id|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128009": { + "content": "<|eot_id|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128010": { + "content": "<|python_tag|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128011": { + "content": "<|reserved_special_token_3|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128012": { + "content": "<|reserved_special_token_4|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128013": { + "content": "<|reserved_special_token_5|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128014": { + "content": "<|reserved_special_token_6|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128015": { + "content": "<|reserved_special_token_7|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128016": { + "content": "<|reserved_special_token_8|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128017": { + "content": "<|reserved_special_token_9|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128018": { + "content": "<|reserved_special_token_10|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128019": { + "content": "<|reserved_special_token_11|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128020": { + "content": "<|reserved_special_token_12|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128021": { + "content": "<|reserved_special_token_13|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128022": { + "content": "<|reserved_special_token_14|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128023": { + "content": "<|reserved_special_token_15|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128024": { + "content": "<|reserved_special_token_16|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128025": { + "content": "<|reserved_special_token_17|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128026": { + "content": "<|reserved_special_token_18|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128027": { + "content": "<|reserved_special_token_19|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128028": { + "content": "<|reserved_special_token_20|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128029": { + "content": "<|reserved_special_token_21|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128030": { + "content": "<|reserved_special_token_22|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128031": { + "content": "<|reserved_special_token_23|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128032": { + "content": "<|reserved_special_token_24|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128033": { + "content": "<|reserved_special_token_25|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128034": { + "content": "<|reserved_special_token_26|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128035": { + "content": "<|reserved_special_token_27|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128036": { + "content": "<|reserved_special_token_28|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128037": { + "content": "<|reserved_special_token_29|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128038": { + "content": "<|reserved_special_token_30|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128039": { + "content": "<|reserved_special_token_31|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128040": { + "content": "<|reserved_special_token_32|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128041": { + "content": "<|reserved_special_token_33|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128042": { + "content": "<|reserved_special_token_34|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128043": { + "content": "<|reserved_special_token_35|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128044": { + "content": "<|reserved_special_token_36|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128045": { + "content": "<|reserved_special_token_37|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128046": { + "content": "<|reserved_special_token_38|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128047": { + "content": "<|reserved_special_token_39|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128048": { + "content": "<|reserved_special_token_40|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128049": { + "content": "<|reserved_special_token_41|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128050": { + "content": "<|reserved_special_token_42|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128051": { + "content": "<|reserved_special_token_43|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128052": { + "content": "<|reserved_special_token_44|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128053": { + "content": "<|reserved_special_token_45|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128054": { + "content": "<|reserved_special_token_46|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128055": { + "content": "<|reserved_special_token_47|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128056": { + "content": "<|reserved_special_token_48|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128057": { + "content": "<|reserved_special_token_49|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128058": { + "content": "<|reserved_special_token_50|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128059": { + "content": "<|reserved_special_token_51|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128060": { + "content": "<|reserved_special_token_52|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128061": { + "content": "<|reserved_special_token_53|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128062": { + "content": "<|reserved_special_token_54|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128063": { + "content": "<|reserved_special_token_55|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128064": { + "content": "<|reserved_special_token_56|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128065": { + "content": "<|reserved_special_token_57|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128066": { + "content": "<|reserved_special_token_58|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128067": { + "content": "<|reserved_special_token_59|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128068": { + "content": "<|reserved_special_token_60|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128069": { + "content": "<|reserved_special_token_61|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128070": { + "content": "<|reserved_special_token_62|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128071": { + "content": "<|reserved_special_token_63|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128072": { + "content": "<|reserved_special_token_64|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128073": { + "content": "<|reserved_special_token_65|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128074": { + "content": "<|reserved_special_token_66|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128075": { + "content": "<|reserved_special_token_67|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128076": { + "content": "<|reserved_special_token_68|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128077": { + "content": "<|reserved_special_token_69|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128078": { + "content": "<|reserved_special_token_70|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128079": { + "content": "<|reserved_special_token_71|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128080": { + "content": "<|reserved_special_token_72|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128081": { + "content": "<|reserved_special_token_73|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128082": { + "content": "<|reserved_special_token_74|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128083": { + "content": "<|reserved_special_token_75|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128084": { + "content": "<|reserved_special_token_76|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128085": { + "content": "<|reserved_special_token_77|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128086": { + "content": "<|reserved_special_token_78|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128087": { + "content": "<|reserved_special_token_79|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128088": { + "content": "<|reserved_special_token_80|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128089": { + "content": "<|reserved_special_token_81|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128090": { + "content": "<|reserved_special_token_82|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128091": { + "content": "<|reserved_special_token_83|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128092": { + "content": "<|reserved_special_token_84|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128093": { + "content": "<|reserved_special_token_85|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128094": { + "content": "<|reserved_special_token_86|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128095": { + "content": "<|reserved_special_token_87|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128096": { + "content": "<|reserved_special_token_88|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128097": { + "content": "<|reserved_special_token_89|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128098": { + "content": "<|reserved_special_token_90|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128099": { + "content": "<|reserved_special_token_91|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128100": { + "content": "<|reserved_special_token_92|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128101": { + "content": "<|reserved_special_token_93|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128102": { + "content": "<|reserved_special_token_94|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128103": { + "content": "<|reserved_special_token_95|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128104": { + "content": "<|reserved_special_token_96|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128105": { + "content": "<|reserved_special_token_97|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128106": { + "content": "<|reserved_special_token_98|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128107": { + "content": "<|reserved_special_token_99|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128108": { + "content": "<|reserved_special_token_100|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128109": { + "content": "<|reserved_special_token_101|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128110": { + "content": "<|reserved_special_token_102|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128111": { + "content": "<|reserved_special_token_103|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128112": { + "content": "<|reserved_special_token_104|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128113": { + "content": "<|reserved_special_token_105|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128114": { + "content": "<|reserved_special_token_106|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128115": { + "content": "<|reserved_special_token_107|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128116": { + "content": "<|reserved_special_token_108|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128117": { + "content": "<|reserved_special_token_109|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128118": { + "content": "<|reserved_special_token_110|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128119": { + "content": "<|reserved_special_token_111|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128120": { + "content": "<|reserved_special_token_112|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128121": { + "content": "<|reserved_special_token_113|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128122": { + "content": "<|reserved_special_token_114|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128123": { + "content": "<|reserved_special_token_115|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128124": { + "content": "<|reserved_special_token_116|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128125": { + "content": "<|reserved_special_token_117|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128126": { + "content": "<|reserved_special_token_118|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128127": { + "content": "<|reserved_special_token_119|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128128": { + "content": "<|reserved_special_token_120|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128129": { + "content": "<|reserved_special_token_121|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128130": { + "content": "<|reserved_special_token_122|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128131": { + "content": "<|reserved_special_token_123|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128132": { + "content": "<|reserved_special_token_124|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128133": { + "content": "<|reserved_special_token_125|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128134": { + "content": "<|reserved_special_token_126|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128135": { + "content": "<|reserved_special_token_127|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128136": { + "content": "<|reserved_special_token_128|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128137": { + "content": "<|reserved_special_token_129|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128138": { + "content": "<|reserved_special_token_130|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128139": { + "content": "<|reserved_special_token_131|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128140": { + "content": "<|reserved_special_token_132|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128141": { + "content": "<|reserved_special_token_133|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128142": { + "content": "<|reserved_special_token_134|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128143": { + "content": "<|reserved_special_token_135|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128144": { + "content": "<|reserved_special_token_136|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128145": { + "content": "<|reserved_special_token_137|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128146": { + "content": "<|reserved_special_token_138|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128147": { + "content": "<|reserved_special_token_139|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128148": { + "content": "<|reserved_special_token_140|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128149": { + "content": "<|reserved_special_token_141|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128150": { + "content": "<|reserved_special_token_142|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128151": { + "content": "<|reserved_special_token_143|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128152": { + "content": "<|reserved_special_token_144|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128153": { + "content": "<|reserved_special_token_145|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128154": { + "content": "<|reserved_special_token_146|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128155": { + "content": "<|reserved_special_token_147|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128156": { + "content": "<|reserved_special_token_148|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128157": { + "content": "<|reserved_special_token_149|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128158": { + "content": "<|reserved_special_token_150|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128159": { + "content": "<|reserved_special_token_151|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128160": { + "content": "<|reserved_special_token_152|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128161": { + "content": "<|reserved_special_token_153|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128162": { + "content": "<|reserved_special_token_154|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128163": { + "content": "<|reserved_special_token_155|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128164": { + "content": "<|reserved_special_token_156|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128165": { + "content": "<|reserved_special_token_157|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128166": { + "content": "<|reserved_special_token_158|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128167": { + "content": "<|reserved_special_token_159|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128168": { + "content": "<|reserved_special_token_160|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128169": { + "content": "<|reserved_special_token_161|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128170": { + "content": "<|reserved_special_token_162|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128171": { + "content": "<|reserved_special_token_163|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128172": { + "content": "<|reserved_special_token_164|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128173": { + "content": "<|reserved_special_token_165|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128174": { + "content": "<|reserved_special_token_166|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128175": { + "content": "<|reserved_special_token_167|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128176": { + "content": "<|reserved_special_token_168|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128177": { + "content": "<|reserved_special_token_169|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128178": { + "content": "<|reserved_special_token_170|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128179": { + "content": "<|reserved_special_token_171|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128180": { + "content": "<|reserved_special_token_172|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128181": { + "content": "<|reserved_special_token_173|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128182": { + "content": "<|reserved_special_token_174|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128183": { + "content": "<|reserved_special_token_175|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128184": { + "content": "<|reserved_special_token_176|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128185": { + "content": "<|reserved_special_token_177|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128186": { + "content": "<|reserved_special_token_178|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128187": { + "content": "<|reserved_special_token_179|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128188": { + "content": "<|reserved_special_token_180|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128189": { + "content": "<|reserved_special_token_181|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128190": { + "content": "<|reserved_special_token_182|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128191": { + "content": "<|reserved_special_token_183|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128192": { + "content": "<|reserved_special_token_184|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128193": { + "content": "<|reserved_special_token_185|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128194": { + "content": "<|reserved_special_token_186|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128195": { + "content": "<|reserved_special_token_187|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128196": { + "content": "<|reserved_special_token_188|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128197": { + "content": "<|reserved_special_token_189|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128198": { + "content": "<|reserved_special_token_190|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128199": { + "content": "<|reserved_special_token_191|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128200": { + "content": "<|reserved_special_token_192|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128201": { + "content": "<|reserved_special_token_193|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128202": { + "content": "<|reserved_special_token_194|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128203": { + "content": "<|reserved_special_token_195|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128204": { + "content": "<|reserved_special_token_196|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128205": { + "content": "<|reserved_special_token_197|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128206": { + "content": "<|reserved_special_token_198|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128207": { + "content": "<|reserved_special_token_199|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128208": { + "content": "<|reserved_special_token_200|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128209": { + "content": "<|reserved_special_token_201|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128210": { + "content": "<|reserved_special_token_202|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128211": { + "content": "<|reserved_special_token_203|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128212": { + "content": "<|reserved_special_token_204|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128213": { + "content": "<|reserved_special_token_205|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128214": { + "content": "<|reserved_special_token_206|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128215": { + "content": "<|reserved_special_token_207|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128216": { + "content": "<|reserved_special_token_208|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128217": { + "content": "<|reserved_special_token_209|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128218": { + "content": "<|reserved_special_token_210|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128219": { + "content": "<|reserved_special_token_211|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128220": { + "content": "<|reserved_special_token_212|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128221": { + "content": "<|reserved_special_token_213|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128222": { + "content": "<|reserved_special_token_214|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128223": { + "content": "<|reserved_special_token_215|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128224": { + "content": "<|reserved_special_token_216|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128225": { + "content": "<|reserved_special_token_217|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128226": { + "content": "<|reserved_special_token_218|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128227": { + "content": "<|reserved_special_token_219|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128228": { + "content": "<|reserved_special_token_220|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128229": { + "content": "<|reserved_special_token_221|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128230": { + "content": "<|reserved_special_token_222|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128231": { + "content": "<|reserved_special_token_223|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128232": { + "content": "<|reserved_special_token_224|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128233": { + "content": "<|reserved_special_token_225|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128234": { + "content": "<|reserved_special_token_226|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128235": { + "content": "<|reserved_special_token_227|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128236": { + "content": "<|reserved_special_token_228|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128237": { + "content": "<|reserved_special_token_229|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128238": { + "content": "<|reserved_special_token_230|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128239": { + "content": "<|reserved_special_token_231|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128240": { + "content": "<|reserved_special_token_232|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128241": { + "content": "<|reserved_special_token_233|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128242": { + "content": "<|reserved_special_token_234|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128243": { + "content": "<|reserved_special_token_235|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128244": { + "content": "<|reserved_special_token_236|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128245": { + "content": "<|reserved_special_token_237|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128246": { + "content": "<|reserved_special_token_238|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128247": { + "content": "<|reserved_special_token_239|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128248": { + "content": "<|reserved_special_token_240|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128249": { + "content": "<|reserved_special_token_241|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128250": { + "content": "<|reserved_special_token_242|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128251": { + "content": "<|reserved_special_token_243|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128252": { + "content": "<|reserved_special_token_244|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128253": { + "content": "<|reserved_special_token_245|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128254": { + "content": "<|reserved_special_token_246|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "128255": { + "content": "<|reserved_special_token_247|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + } + }, + "bos_token": "<|begin_of_text|>", + "chat_template": "{% if not add_generation_prompt is defined %}{% set add_generation_prompt = false %}{% endif %}{% set loop_messages = messages %}{% for message in loop_messages %}{% set content = '<|start_header_id|>' + message['role'] + '<|end_header_id|>\n\n'+ message['content'] | trim + '<|eot_id|>' %}{% if loop.index0 == 0 %}{% set content = bos_token + content %}{% endif %}{{ content }}{% endfor %}{% if add_generation_prompt %}{{ '<|start_header_id|>assistant<|end_header_id|>\n\n' }}{% endif %}", + "clean_up_tokenization_spaces": true, + "eos_token": "<|eot_id|>", + "extra_special_tokens": {}, + "model_input_names": [ + "input_ids", + "attention_mask" + ], + "model_max_length": 131072, + "pad_token": "<|end_of_text|>", + "tokenizer_class": "PreTrainedTokenizer" +} diff --git a/training_args.bin b/training_args.bin new file mode 100644 index 0000000..e6584e4 --- /dev/null +++ b/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2c8443655ac3e7ec4a935ee92ab8e32d8a6138b7510b01c0cdfb106a1174f6d8 +size 9528