初始化项目,由ModelHub XC社区提供模型

Model: MusaKlair/pythia410m-dpo-beta1.0
Source: Original Platform
This commit is contained in:
ModelHub XC
2026-07-24 06:50:10 +08:00
commit a2f3914ab1
42 changed files with 1004926 additions and 0 deletions

35
.gitattributes vendored Normal file
View File

@@ -0,0 +1,35 @@
*.7z filter=lfs diff=lfs merge=lfs -text
*.arrow filter=lfs diff=lfs merge=lfs -text
*.bin filter=lfs diff=lfs merge=lfs -text
*.bz2 filter=lfs diff=lfs merge=lfs -text
*.ckpt filter=lfs diff=lfs merge=lfs -text
*.ftz filter=lfs diff=lfs merge=lfs -text
*.gz filter=lfs diff=lfs merge=lfs -text
*.h5 filter=lfs diff=lfs merge=lfs -text
*.joblib filter=lfs diff=lfs merge=lfs -text
*.lfs.* filter=lfs diff=lfs merge=lfs -text
*.mlmodel filter=lfs diff=lfs merge=lfs -text
*.model filter=lfs diff=lfs merge=lfs -text
*.msgpack filter=lfs diff=lfs merge=lfs -text
*.npy filter=lfs diff=lfs merge=lfs -text
*.npz filter=lfs diff=lfs merge=lfs -text
*.onnx filter=lfs diff=lfs merge=lfs -text
*.ot filter=lfs diff=lfs merge=lfs -text
*.parquet filter=lfs diff=lfs merge=lfs -text
*.pb filter=lfs diff=lfs merge=lfs -text
*.pickle filter=lfs diff=lfs merge=lfs -text
*.pkl filter=lfs diff=lfs merge=lfs -text
*.pt filter=lfs diff=lfs merge=lfs -text
*.pth filter=lfs diff=lfs merge=lfs -text
*.rar filter=lfs diff=lfs merge=lfs -text
*.safetensors filter=lfs diff=lfs merge=lfs -text
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
*.tar.* filter=lfs diff=lfs merge=lfs -text
*.tar filter=lfs diff=lfs merge=lfs -text
*.tflite filter=lfs diff=lfs merge=lfs -text
*.tgz filter=lfs diff=lfs merge=lfs -text
*.wasm filter=lfs diff=lfs merge=lfs -text
*.xz filter=lfs diff=lfs merge=lfs -text
*.zip filter=lfs diff=lfs merge=lfs -text
*.zst filter=lfs diff=lfs merge=lfs -text
*tfevents* filter=lfs diff=lfs merge=lfs -text

69
README.md Normal file
View File

@@ -0,0 +1,69 @@
---
base_model: EleutherAI/pythia-410m
library_name: transformers
model_name: pythia410m-dpo-beta1.0
tags:
- generated_from_trainer
- dpo
- trl
licence: license
---
# Model Card for pythia410m-dpo-beta1.0
This model is a fine-tuned version of [EleutherAI/pythia-410m](https://huggingface.co/EleutherAI/pythia-410m).
It has been trained using [TRL](https://github.com/huggingface/trl).
## Quick start
```python
from transformers import pipeline
question = "If you had a time machine, but could only go to the past or the future once and never return, which would you choose and why?"
generator = pipeline("text-generation", model="None", device="cuda")
output = generator([{"role": "user", "content": question}], max_new_tokens=128, return_full_text=False)[0]
print(output["generated_text"])
```
## Training procedure
This model was trained with DPO, a method introduced in [Direct Preference Optimization: Your Language Model is Secretly a Reward Model](https://huggingface.co/papers/2305.18290).
### Framework versions
- TRL: 1.7.1
- Transformers: 5.13.0
- Pytorch: 2.10.0+cu128
- Datasets: 5.0.0
- Tokenizers: 0.22.2
## Citations
Cite DPO as:
```bibtex
@inproceedings{rafailov2023direct,
title = {{Direct Preference Optimization: Your Language Model is Secretly a Reward Model}},
author = {Rafael Rafailov and Archit Sharma and Eric Mitchell and Christopher D. Manning and Stefano Ermon and Chelsea Finn},
year = 2023,
booktitle = {Advances in Neural Information Processing Systems 36: Annual Conference on Neural Information Processing Systems 2023, NeurIPS 2023, New Orleans, LA, USA, December 10 - 16, 2023},
url = {http://papers.nips.cc/paper_files/paper/2023/hash/a85b405ed65c6477a4fe8302b5e06ce7-Abstract-Conference.html},
editor = {Alice Oh and Tristan Naumann and Amir Globerson and Kate Saenko and Moritz Hardt and Sergey Levine},
}
```
Cite TRL as:
```bibtex
@software{vonwerra2020trl,
title = {{TRL: Transformers Reinforcement Learning}},
author = {von Werra, Leandro and Belkada, Younes and Tunstall, Lewis and Beeching, Edward and Thrush, Tristan and Lambert, Nathan and Huang, Shengyi and Rasul, Kashif and Gallouédec, Quentin},
license = {Apache-2.0},
url = {https://github.com/huggingface/trl},
year = {2020}
}
```

View File

@@ -0,0 +1,33 @@
{
"architectures": [
"GPTNeoXForCausalLM"
],
"attention_bias": true,
"attention_dropout": 0.0,
"bos_token_id": 0,
"classifier_dropout": 0.1,
"dtype": "float32",
"eos_token_id": 0,
"hidden_act": "gelu",
"hidden_dropout": 0.0,
"hidden_size": 1024,
"initializer_range": 0.02,
"intermediate_size": 4096,
"is_decoder": false,
"layer_norm_eps": 1e-05,
"max_position_embeddings": 2048,
"model_type": "gpt_neox",
"num_attention_heads": 16,
"num_hidden_layers": 24,
"pad_token_id": 1,
"rope_parameters": {
"partial_rotary_factor": 0.25,
"rope_theta": 10000,
"rope_type": "default"
},
"tie_word_embeddings": false,
"transformers_version": "5.13.0",
"use_cache": false,
"use_parallel_residual": true,
"vocab_size": 50304
}

View File

@@ -0,0 +1,10 @@
{
"_from_model_config": true,
"bos_token_id": 0,
"eos_token_id": [
0
],
"pad_token_id": 1,
"transformers_version": "5.13.0",
"use_cache": true
}

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:45a469faa469edadeba0293eb9acbfa1691097ef1b57faaf7a29e8f8c6c60813
size 1621370224

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:716fe5f5fd6b5a7b4f4e6e1a5417051f8a6ea63260371e2c37abdc007ee542e6
size 3242916491

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:718a0f3db00824213036a2c0441849791319b7d9cf189065873bb26a7020738e
size 14645

3
checkpoint-100/scaler.pt Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:c4393a84a3109995aa1202073b039b12062e3189ed89aa0b94ef0510ba843009
size 1383

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:da6acab1199ce8b95be17924d67d35a7688c7036095034a44b256466f55879dc
size 1465

250557
checkpoint-100/tokenizer.json Normal file

File diff suppressed because it is too large Load Diff

View File

@@ -0,0 +1,14 @@
{
"add_prefix_space": false,
"backend": "tokenizers",
"bos_token": "<|endoftext|>",
"eos_token": "<|endoftext|>",
"errors": "replace",
"is_local": false,
"local_files_only": false,
"model_max_length": 1000000000000000019884624838656,
"pad_token": "<|padding|>",
"tokenizer_class": "GPTNeoXTokenizer",
"trim_offsets": true,
"unk_token": "<|endoftext|>"
}

View File

@@ -0,0 +1,451 @@
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.592,
"eval_steps": 50,
"global_step": 100,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 2.5553497850894926,
"epoch": 0.08,
"grad_norm": 357.8926696777344,
"learning_rate": 2.8571428571428573e-06,
"logits/chosen": 0.41187580737484436,
"logits/rejected": 0.43087167594886183,
"logps/chosen": -157.8165241241455,
"logps/rejected": -150.432616519928,
"loss": 0.6890408515930175,
"mean_token_accuracy": 0.45499045923352244,
"num_tokens": 63280.0,
"rewards/accuracies": 0.55625,
"rewards/chosen": 0.18442693948745728,
"rewards/margins": 0.05980904102325439,
"rewards/rejected": 0.12461789846420288,
"step": 5
},
{
"entropy": 2.585687577724457,
"epoch": 0.16,
"grad_norm": 550.5374145507812,
"learning_rate": 4.984280524733107e-06,
"logits/chosen": 0.23282768258015127,
"logits/rejected": 0.41657135452577226,
"logps/chosen": -160.46632223129274,
"logps/rejected": -155.05524663925172,
"loss": 1.0951576232910156,
"mean_token_accuracy": 0.4666588671505451,
"num_tokens": 128751.0,
"rewards/accuracies": 0.46875,
"rewards/chosen": 0.04196357727050781,
"rewards/margins": -0.13510316610336304,
"rewards/rejected": 0.17706674337387085,
"step": 10
},
{
"entropy": 2.4887936890125273,
"epoch": 0.24,
"grad_norm": 544.36474609375,
"learning_rate": 4.809698831278217e-06,
"logits/chosen": 0.19960332682723014,
"logits/rejected": 0.25714549020005323,
"logps/chosen": -151.403657245636,
"logps/rejected": -163.51016159057616,
"loss": 1.1309956550598144,
"mean_token_accuracy": 0.4729401096701622,
"num_tokens": 194142.0,
"rewards/accuracies": 0.45625,
"rewards/chosen": -0.6780350089073182,
"rewards/margins": 0.11501268744468689,
"rewards/rejected": -0.793047696352005,
"step": 15
},
{
"entropy": 2.543038326501846,
"epoch": 0.32,
"grad_norm": 545.773193359375,
"learning_rate": 4.454578706170075e-06,
"logits/chosen": 0.10757563983449289,
"logits/rejected": 0.2191312620805499,
"logps/chosen": -134.6160714149475,
"logps/rejected": -134.7640838623047,
"loss": 1.2686697959899902,
"mean_token_accuracy": 0.46390472874045374,
"num_tokens": 254871.0,
"rewards/accuracies": 0.54375,
"rewards/chosen": -1.045345139503479,
"rewards/margins": 0.4233867168426514,
"rewards/rejected": -1.4687318563461305,
"step": 20
},
{
"entropy": 2.4839668542146685,
"epoch": 0.4,
"grad_norm": 609.0315551757812,
"learning_rate": 3.946678240449515e-06,
"logits/chosen": 0.23401674829751978,
"logits/rejected": 0.22746947777638224,
"logps/chosen": -144.78962602615357,
"logps/rejected": -136.76443700790406,
"loss": 1.4144909858703614,
"mean_token_accuracy": 0.45985892340540885,
"num_tokens": 317752.0,
"rewards/accuracies": 0.5625,
"rewards/chosen": -0.8229869723320007,
"rewards/margins": 0.27719623446464536,
"rewards/rejected": -1.1001832067966462,
"step": 25
},
{
"entropy": 2.4549559235572813,
"epoch": 0.48,
"grad_norm": 685.6503295898438,
"learning_rate": 3.3256976548879183e-06,
"logits/chosen": 0.21252182170691483,
"logits/rejected": 0.27063995156819315,
"logps/chosen": -148.57344274520875,
"logps/rejected": -146.81006059646606,
"loss": 1.6434017181396485,
"mean_token_accuracy": 0.454254624247551,
"num_tokens": 387452.0,
"rewards/accuracies": 0.4625,
"rewards/chosen": -0.23523921966552735,
"rewards/margins": 0.0028411030769348146,
"rewards/rejected": -0.23808032274246216,
"step": 30
},
{
"entropy": 2.4848766714334487,
"epoch": 0.56,
"grad_norm": 572.0255737304688,
"learning_rate": 2.6401761180929798e-06,
"logits/chosen": 0.1604402064572174,
"logits/rejected": 0.23192453424270135,
"logps/chosen": -178.91495656967163,
"logps/rejected": -171.79455051422119,
"loss": 1.2930749893188476,
"mean_token_accuracy": 0.4774269789457321,
"num_tokens": 454873.0,
"rewards/accuracies": 0.54375,
"rewards/chosen": 0.2875680088996887,
"rewards/margins": 0.7235915064811707,
"rewards/rejected": -0.43602349758148196,
"step": 35
},
{
"entropy": 2.4956657856702806,
"epoch": 0.64,
"grad_norm": 581.42724609375,
"learning_rate": 1.9436976651092143e-06,
"logits/chosen": 0.26337065405985355,
"logits/rejected": 0.36300255439029444,
"logps/chosen": -157.99055194854736,
"logps/rejected": -159.0982545375824,
"loss": 1.5171399116516113,
"mean_token_accuracy": 0.46507507339119913,
"num_tokens": 518527.0,
"rewards/accuracies": 0.5,
"rewards/chosen": -0.061191481351852414,
"rewards/margins": 0.1269888162612915,
"rewards/rejected": -0.18818029761314392,
"step": 40
},
{
"entropy": 2.434966567158699,
"epoch": 0.72,
"grad_norm": 432.56536865234375,
"learning_rate": 1.2907027822369006e-06,
"logits/chosen": 0.268132887364752,
"logits/rejected": 0.30894473259910554,
"logps/chosen": -154.1576229095459,
"logps/rejected": -159.85538330078126,
"loss": 1.3509400367736817,
"mean_token_accuracy": 0.4740308240056038,
"num_tokens": 586496.0,
"rewards/accuracies": 0.5375,
"rewards/chosen": 0.02395761013031006,
"rewards/margins": 0.8281095027923584,
"rewards/rejected": -0.8041518926620483,
"step": 45
},
{
"entropy": 2.4690693795681,
"epoch": 0.8,
"grad_norm": 504.9461364746094,
"learning_rate": 7.322330470336314e-07,
"logits/chosen": 0.27772643533489566,
"logits/rejected": 0.36052606081661537,
"logps/chosen": -164.17142915725708,
"logps/rejected": -163.73542156219483,
"loss": 1.4861845970153809,
"mean_token_accuracy": 0.4653610520064831,
"num_tokens": 659345.0,
"rewards/accuracies": 0.55625,
"rewards/chosen": -0.0009298324584960938,
"rewards/margins": 0.31063854694366455,
"rewards/rejected": -0.31156837940216064,
"step": 50
},
{
"epoch": 0.8,
"eval_entropy": 2.536505832195282,
"eval_logits/chosen": 0.2893901140152919,
"eval_logits/rejected": 0.34482142702810936,
"eval_logps/chosen": -161.61729994201661,
"eval_logps/rejected": -153.7386490020752,
"eval_loss": 1.3951599597930908,
"eval_mean_token_accuracy": 0.46117462730407716,
"eval_num_tokens": 659345.0,
"eval_rewards/accuracies": 0.539,
"eval_rewards/chosen": -0.16949110031127929,
"eval_rewards/margins": 0.413674391746521,
"eval_rewards/rejected": -0.5831654920578003,
"eval_runtime": 204.2784,
"eval_samples_per_second": 4.895,
"eval_steps_per_second": 1.224,
"step": 50
},
{
"entropy": 2.5048249810934067,
"epoch": 0.88,
"grad_norm": 538.51953125,
"learning_rate": 3.119414452281158e-07,
"logits/chosen": 0.31241473497619054,
"logits/rejected": 0.4336116565754852,
"logps/chosen": -148.8257155418396,
"logps/rejected": -143.5335810661316,
"loss": 1.5545385360717774,
"mean_token_accuracy": 0.47073024958372117,
"num_tokens": 731475.0,
"rewards/accuracies": 0.53125,
"rewards/chosen": -0.08134242296218872,
"rewards/margins": 0.31841338872909547,
"rewards/rejected": -0.39975581169128416,
"step": 55
},
{
"entropy": 2.4619424283504485,
"epoch": 0.96,
"grad_norm": 439.4546813964844,
"learning_rate": 6.268021954544095e-08,
"logits/chosen": 0.26771219837052634,
"logits/rejected": 0.3957730213546686,
"logps/chosen": -157.09008331298827,
"logps/rejected": -164.03927259445192,
"loss": 1.2014739990234375,
"mean_token_accuracy": 0.47436425387859343,
"num_tokens": 797757.0,
"rewards/accuracies": 0.525,
"rewards/chosen": 0.21749011874198915,
"rewards/margins": 0.5742806613445282,
"rewards/rejected": -0.35679054260253906,
"step": 60
},
{
"epoch": 1.0,
"eval_entropy": 2.5392660574913024,
"eval_logits/chosen": 0.2875409764336183,
"eval_logits/rejected": 0.34302489192485985,
"eval_logps/chosen": -161.68841091918947,
"eval_logps/rejected": -153.80732011413573,
"eval_loss": 1.3833612203598022,
"eval_mean_token_accuracy": 0.46109312522411344,
"eval_num_tokens": 829784.0,
"eval_rewards/accuracies": 0.543,
"eval_rewards/chosen": -0.24060248374938964,
"eval_rewards/margins": 0.4112340784072876,
"eval_rewards/rejected": -0.6518365621566773,
"eval_runtime": 204.0071,
"eval_samples_per_second": 4.902,
"eval_steps_per_second": 1.225,
"step": 63
},
{
"entropy": 2.507671430706978,
"epoch": 1.032,
"grad_norm": 189.56698608398438,
"learning_rate": 4.184239109116393e-06,
"logits/chosen": 0.2979938850081893,
"logits/rejected": 0.3261501650298202,
"logps/chosen": -146.56341791152954,
"logps/rejected": -168.53296971321106,
"loss": 0.27623340487480164,
"mean_token_accuracy": 0.47298500686883926,
"num_tokens": 27180.0,
"rewards/accuracies": 0.828125,
"rewards/chosen": 5.079042822122574,
"rewards/margins": 11.58286327123642,
"rewards/rejected": -6.503820419311523,
"step": 65
},
{
"entropy": 2.5133699655532835,
"epoch": 1.112,
"grad_norm": 113.09912872314453,
"learning_rate": 4.006586590948141e-06,
"logits/chosen": 0.25969656721433304,
"logits/rejected": 0.39782895997815093,
"logps/chosen": -152.27070779800414,
"logps/rejected": -152.92093172073365,
"loss": 0.13215208053588867,
"mean_token_accuracy": 0.4806541882455349,
"num_tokens": 86611.0,
"rewards/accuracies": 0.93125,
"rewards/chosen": 5.613885009288788,
"rewards/margins": 12.845363640785218,
"rewards/rejected": -7.231478703022003,
"step": 70
},
{
"entropy": 2.5407466888427734,
"epoch": 1.192,
"grad_norm": 164.6415252685547,
"learning_rate": 3.81608040719339e-06,
"logits/chosen": 0.3012379954587533,
"logits/rejected": 0.35636349940869577,
"logps/chosen": -152.22927570343018,
"logps/rejected": -158.37194900512696,
"loss": 0.13926982879638672,
"mean_token_accuracy": 0.4698187731206417,
"num_tokens": 153056.0,
"rewards/accuracies": 0.925,
"rewards/chosen": 4.025047600269318,
"rewards/margins": 11.277643758058549,
"rewards/rejected": -7.252596193552018,
"step": 75
},
{
"entropy": 2.5421448230743406,
"epoch": 1.272,
"grad_norm": 77.16290283203125,
"learning_rate": 3.6143458894413463e-06,
"logits/chosen": 0.2523993960550924,
"logits/rejected": 0.3098906828719798,
"logps/chosen": -128.28734722137452,
"logps/rejected": -151.55945873260498,
"loss": 0.20328567028045655,
"mean_token_accuracy": 0.4690698154270649,
"num_tokens": 215920.0,
"rewards/accuracies": 0.9,
"rewards/chosen": 5.010193508863449,
"rewards/margins": 10.482384419441223,
"rewards/rejected": -5.472190934419632,
"step": 80
},
{
"entropy": 2.462119910120964,
"epoch": 1.3519999999999999,
"grad_norm": 181.0267791748047,
"learning_rate": 3.403104165467883e-06,
"logits/chosen": 0.2615454777932041,
"logits/rejected": 0.34690817078532066,
"logps/chosen": -136.50883808135987,
"logps/rejected": -156.16784238815308,
"loss": 0.24072544574737548,
"mean_token_accuracy": 0.49424040541052816,
"num_tokens": 287127.0,
"rewards/accuracies": 0.89375,
"rewards/chosen": 6.286368477344513,
"rewards/margins": 13.312550961971283,
"rewards/rejected": -7.02618248462677,
"step": 85
},
{
"entropy": 2.5757258504629137,
"epoch": 1.432,
"grad_norm": 128.99142456054688,
"learning_rate": 3.184157475180208e-06,
"logits/chosen": 0.26197732623753106,
"logits/rejected": 0.3165610941969709,
"logps/chosen": -156.26946783065796,
"logps/rejected": -148.62067685127258,
"loss": 0.2306227684020996,
"mean_token_accuracy": 0.46578485444188117,
"num_tokens": 354068.0,
"rewards/accuracies": 0.89375,
"rewards/chosen": 5.876923865079879,
"rewards/margins": 10.556617093086242,
"rewards/rejected": -4.679693168401718,
"step": 90
},
{
"entropy": 2.4905955940485,
"epoch": 1.512,
"grad_norm": 99.29806518554688,
"learning_rate": 2.9593737945414264e-06,
"logits/chosen": 0.18172540683269275,
"logits/rejected": 0.17394183194436158,
"logps/chosen": -135.62753200531006,
"logps/rejected": -156.26373701095582,
"loss": 0.18702551126480102,
"mean_token_accuracy": 0.4736903429031372,
"num_tokens": 421426.0,
"rewards/accuracies": 0.8875,
"rewards/chosen": 5.762694102525711,
"rewards/margins": 12.075559437274933,
"rewards/rejected": -6.312865370512009,
"step": 95
},
{
"entropy": 2.4252312004566194,
"epoch": 1.592,
"grad_norm": 277.9349670410156,
"learning_rate": 2.730670898658255e-06,
"logits/chosen": -0.04065577566546924,
"logits/rejected": 0.10009592183059253,
"logps/chosen": -154.10384283065795,
"logps/rejected": -152.03404664993286,
"loss": 0.21797585487365723,
"mean_token_accuracy": 0.490592048317194,
"num_tokens": 489806.0,
"rewards/accuracies": 0.89375,
"rewards/chosen": 6.565640062093735,
"rewards/margins": 12.645995873212815,
"rewards/rejected": -6.080355882644653,
"step": 100
},
{
"epoch": 1.592,
"eval_entropy": 2.4817885313034056,
"eval_logits/chosen": -0.02915419819877984,
"eval_logits/rejected": 0.030335744896749582,
"eval_logps/chosen": -161.77295245361327,
"eval_logps/rejected": -154.0547428894043,
"eval_loss": 1.7032477855682373,
"eval_mean_token_accuracy": 0.46294176495075223,
"eval_num_tokens": 489806.0,
"eval_rewards/accuracies": 0.535,
"eval_rewards/chosen": -0.3251441774368286,
"eval_rewards/margins": 0.5741160621643067,
"eval_rewards/rejected": -0.8992602396011352,
"eval_runtime": 206.5591,
"eval_samples_per_second": 4.841,
"eval_steps_per_second": 1.21,
"step": 100
}
],
"logging_steps": 5,
"max_steps": 189,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 5237912290590720.0,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:bd11bc38a7578d81a07965e3bcf4c5c3915b28f975b3660339cfa5e5be2c946a
size 5841

View File

@@ -0,0 +1,33 @@
{
"architectures": [
"GPTNeoXForCausalLM"
],
"attention_bias": true,
"attention_dropout": 0.0,
"bos_token_id": 0,
"classifier_dropout": 0.1,
"dtype": "float32",
"eos_token_id": 0,
"hidden_act": "gelu",
"hidden_dropout": 0.0,
"hidden_size": 1024,
"initializer_range": 0.02,
"intermediate_size": 4096,
"is_decoder": false,
"layer_norm_eps": 1e-05,
"max_position_embeddings": 2048,
"model_type": "gpt_neox",
"num_attention_heads": 16,
"num_hidden_layers": 24,
"pad_token_id": 1,
"rope_parameters": {
"partial_rotary_factor": 0.25,
"rope_theta": 10000,
"rope_type": "default"
},
"tie_word_embeddings": false,
"transformers_version": "5.13.0",
"use_cache": false,
"use_parallel_residual": true,
"vocab_size": 50304
}

View File

@@ -0,0 +1,10 @@
{
"_from_model_config": true,
"bos_token_id": 0,
"eos_token_id": [
0
],
"pad_token_id": 1,
"transformers_version": "5.13.0",
"use_cache": true
}

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:fb241657c5572d29567211002e6de651a121d314ea0871bddcc26852419c9b30
size 1621370224

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:f7903262716a0ff3915ce9372b0b5a7fa90e569e4200d7eb1b3643a94d27335d
size 3242916491

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:fdc37bbd2e979f041dfbbb004a5c74bab6cdda159cb18116df728588515a9ef6
size 14645

3
checkpoint-189/scaler.pt Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:49f6bef68f1a79850e9c094ae1ada2d209bb00bda2944425e211ef8d4b2d7e85
size 1383

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:315777cdc55fe9505686ba500aff0de04b86af28c9ef728058b9b40c43f12bd4
size 1465

250557
checkpoint-189/tokenizer.json Normal file

File diff suppressed because it is too large Load Diff

View File

@@ -0,0 +1,14 @@
{
"add_prefix_space": false,
"backend": "tokenizers",
"bos_token": "<|endoftext|>",
"eos_token": "<|endoftext|>",
"errors": "replace",
"is_local": false,
"local_files_only": false,
"model_max_length": 1000000000000000019884624838656,
"pad_token": "<|padding|>",
"tokenizer_class": "GPTNeoXTokenizer",
"trim_offsets": true,
"unk_token": "<|endoftext|>"
}

View File

@@ -0,0 +1,795 @@
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.0,
"eval_steps": 50,
"global_step": 189,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 2.5553497850894926,
"epoch": 0.08,
"grad_norm": 357.8926696777344,
"learning_rate": 2.8571428571428573e-06,
"logits/chosen": 0.41187580737484436,
"logits/rejected": 0.43087167594886183,
"logps/chosen": -157.8165241241455,
"logps/rejected": -150.432616519928,
"loss": 0.6890408515930175,
"mean_token_accuracy": 0.45499045923352244,
"num_tokens": 63280.0,
"rewards/accuracies": 0.55625,
"rewards/chosen": 0.18442693948745728,
"rewards/margins": 0.05980904102325439,
"rewards/rejected": 0.12461789846420288,
"step": 5
},
{
"entropy": 2.585687577724457,
"epoch": 0.16,
"grad_norm": 550.5374145507812,
"learning_rate": 4.984280524733107e-06,
"logits/chosen": 0.23282768258015127,
"logits/rejected": 0.41657135452577226,
"logps/chosen": -160.46632223129274,
"logps/rejected": -155.05524663925172,
"loss": 1.0951576232910156,
"mean_token_accuracy": 0.4666588671505451,
"num_tokens": 128751.0,
"rewards/accuracies": 0.46875,
"rewards/chosen": 0.04196357727050781,
"rewards/margins": -0.13510316610336304,
"rewards/rejected": 0.17706674337387085,
"step": 10
},
{
"entropy": 2.4887936890125273,
"epoch": 0.24,
"grad_norm": 544.36474609375,
"learning_rate": 4.809698831278217e-06,
"logits/chosen": 0.19960332682723014,
"logits/rejected": 0.25714549020005323,
"logps/chosen": -151.403657245636,
"logps/rejected": -163.51016159057616,
"loss": 1.1309956550598144,
"mean_token_accuracy": 0.4729401096701622,
"num_tokens": 194142.0,
"rewards/accuracies": 0.45625,
"rewards/chosen": -0.6780350089073182,
"rewards/margins": 0.11501268744468689,
"rewards/rejected": -0.793047696352005,
"step": 15
},
{
"entropy": 2.543038326501846,
"epoch": 0.32,
"grad_norm": 545.773193359375,
"learning_rate": 4.454578706170075e-06,
"logits/chosen": 0.10757563983449289,
"logits/rejected": 0.2191312620805499,
"logps/chosen": -134.6160714149475,
"logps/rejected": -134.7640838623047,
"loss": 1.2686697959899902,
"mean_token_accuracy": 0.46390472874045374,
"num_tokens": 254871.0,
"rewards/accuracies": 0.54375,
"rewards/chosen": -1.045345139503479,
"rewards/margins": 0.4233867168426514,
"rewards/rejected": -1.4687318563461305,
"step": 20
},
{
"entropy": 2.4839668542146685,
"epoch": 0.4,
"grad_norm": 609.0315551757812,
"learning_rate": 3.946678240449515e-06,
"logits/chosen": 0.23401674829751978,
"logits/rejected": 0.22746947777638224,
"logps/chosen": -144.78962602615357,
"logps/rejected": -136.76443700790406,
"loss": 1.4144909858703614,
"mean_token_accuracy": 0.45985892340540885,
"num_tokens": 317752.0,
"rewards/accuracies": 0.5625,
"rewards/chosen": -0.8229869723320007,
"rewards/margins": 0.27719623446464536,
"rewards/rejected": -1.1001832067966462,
"step": 25
},
{
"entropy": 2.4549559235572813,
"epoch": 0.48,
"grad_norm": 685.6503295898438,
"learning_rate": 3.3256976548879183e-06,
"logits/chosen": 0.21252182170691483,
"logits/rejected": 0.27063995156819315,
"logps/chosen": -148.57344274520875,
"logps/rejected": -146.81006059646606,
"loss": 1.6434017181396485,
"mean_token_accuracy": 0.454254624247551,
"num_tokens": 387452.0,
"rewards/accuracies": 0.4625,
"rewards/chosen": -0.23523921966552735,
"rewards/margins": 0.0028411030769348146,
"rewards/rejected": -0.23808032274246216,
"step": 30
},
{
"entropy": 2.4848766714334487,
"epoch": 0.56,
"grad_norm": 572.0255737304688,
"learning_rate": 2.6401761180929798e-06,
"logits/chosen": 0.1604402064572174,
"logits/rejected": 0.23192453424270135,
"logps/chosen": -178.91495656967163,
"logps/rejected": -171.79455051422119,
"loss": 1.2930749893188476,
"mean_token_accuracy": 0.4774269789457321,
"num_tokens": 454873.0,
"rewards/accuracies": 0.54375,
"rewards/chosen": 0.2875680088996887,
"rewards/margins": 0.7235915064811707,
"rewards/rejected": -0.43602349758148196,
"step": 35
},
{
"entropy": 2.4956657856702806,
"epoch": 0.64,
"grad_norm": 581.42724609375,
"learning_rate": 1.9436976651092143e-06,
"logits/chosen": 0.26337065405985355,
"logits/rejected": 0.36300255439029444,
"logps/chosen": -157.99055194854736,
"logps/rejected": -159.0982545375824,
"loss": 1.5171399116516113,
"mean_token_accuracy": 0.46507507339119913,
"num_tokens": 518527.0,
"rewards/accuracies": 0.5,
"rewards/chosen": -0.061191481351852414,
"rewards/margins": 0.1269888162612915,
"rewards/rejected": -0.18818029761314392,
"step": 40
},
{
"entropy": 2.434966567158699,
"epoch": 0.72,
"grad_norm": 432.56536865234375,
"learning_rate": 1.2907027822369006e-06,
"logits/chosen": 0.268132887364752,
"logits/rejected": 0.30894473259910554,
"logps/chosen": -154.1576229095459,
"logps/rejected": -159.85538330078126,
"loss": 1.3509400367736817,
"mean_token_accuracy": 0.4740308240056038,
"num_tokens": 586496.0,
"rewards/accuracies": 0.5375,
"rewards/chosen": 0.02395761013031006,
"rewards/margins": 0.8281095027923584,
"rewards/rejected": -0.8041518926620483,
"step": 45
},
{
"entropy": 2.4690693795681,
"epoch": 0.8,
"grad_norm": 504.9461364746094,
"learning_rate": 7.322330470336314e-07,
"logits/chosen": 0.27772643533489566,
"logits/rejected": 0.36052606081661537,
"logps/chosen": -164.17142915725708,
"logps/rejected": -163.73542156219483,
"loss": 1.4861845970153809,
"mean_token_accuracy": 0.4653610520064831,
"num_tokens": 659345.0,
"rewards/accuracies": 0.55625,
"rewards/chosen": -0.0009298324584960938,
"rewards/margins": 0.31063854694366455,
"rewards/rejected": -0.31156837940216064,
"step": 50
},
{
"epoch": 0.8,
"eval_entropy": 2.536505832195282,
"eval_logits/chosen": 0.2893901140152919,
"eval_logits/rejected": 0.34482142702810936,
"eval_logps/chosen": -161.61729994201661,
"eval_logps/rejected": -153.7386490020752,
"eval_loss": 1.3951599597930908,
"eval_mean_token_accuracy": 0.46117462730407716,
"eval_num_tokens": 659345.0,
"eval_rewards/accuracies": 0.539,
"eval_rewards/chosen": -0.16949110031127929,
"eval_rewards/margins": 0.413674391746521,
"eval_rewards/rejected": -0.5831654920578003,
"eval_runtime": 204.2784,
"eval_samples_per_second": 4.895,
"eval_steps_per_second": 1.224,
"step": 50
},
{
"entropy": 2.5048249810934067,
"epoch": 0.88,
"grad_norm": 538.51953125,
"learning_rate": 3.119414452281158e-07,
"logits/chosen": 0.31241473497619054,
"logits/rejected": 0.4336116565754852,
"logps/chosen": -148.8257155418396,
"logps/rejected": -143.5335810661316,
"loss": 1.5545385360717774,
"mean_token_accuracy": 0.47073024958372117,
"num_tokens": 731475.0,
"rewards/accuracies": 0.53125,
"rewards/chosen": -0.08134242296218872,
"rewards/margins": 0.31841338872909547,
"rewards/rejected": -0.39975581169128416,
"step": 55
},
{
"entropy": 2.4619424283504485,
"epoch": 0.96,
"grad_norm": 439.4546813964844,
"learning_rate": 6.268021954544095e-08,
"logits/chosen": 0.26771219837052634,
"logits/rejected": 0.3957730213546686,
"logps/chosen": -157.09008331298827,
"logps/rejected": -164.03927259445192,
"loss": 1.2014739990234375,
"mean_token_accuracy": 0.47436425387859343,
"num_tokens": 797757.0,
"rewards/accuracies": 0.525,
"rewards/chosen": 0.21749011874198915,
"rewards/margins": 0.5742806613445282,
"rewards/rejected": -0.35679054260253906,
"step": 60
},
{
"epoch": 1.0,
"eval_entropy": 2.5392660574913024,
"eval_logits/chosen": 0.2875409764336183,
"eval_logits/rejected": 0.34302489192485985,
"eval_logps/chosen": -161.68841091918947,
"eval_logps/rejected": -153.80732011413573,
"eval_loss": 1.3833612203598022,
"eval_mean_token_accuracy": 0.46109312522411344,
"eval_num_tokens": 829784.0,
"eval_rewards/accuracies": 0.543,
"eval_rewards/chosen": -0.24060248374938964,
"eval_rewards/margins": 0.4112340784072876,
"eval_rewards/rejected": -0.6518365621566773,
"eval_runtime": 204.0071,
"eval_samples_per_second": 4.902,
"eval_steps_per_second": 1.225,
"step": 63
},
{
"entropy": 2.507671430706978,
"epoch": 1.032,
"grad_norm": 189.56698608398438,
"learning_rate": 4.184239109116393e-06,
"logits/chosen": 0.2979938850081893,
"logits/rejected": 0.3261501650298202,
"logps/chosen": -146.56341791152954,
"logps/rejected": -168.53296971321106,
"loss": 0.27623340487480164,
"mean_token_accuracy": 0.47298500686883926,
"num_tokens": 27180.0,
"rewards/accuracies": 0.828125,
"rewards/chosen": 5.079042822122574,
"rewards/margins": 11.58286327123642,
"rewards/rejected": -6.503820419311523,
"step": 65
},
{
"entropy": 2.5133699655532835,
"epoch": 1.112,
"grad_norm": 113.09912872314453,
"learning_rate": 4.006586590948141e-06,
"logits/chosen": 0.25969656721433304,
"logits/rejected": 0.39782895997815093,
"logps/chosen": -152.27070779800414,
"logps/rejected": -152.92093172073365,
"loss": 0.13215208053588867,
"mean_token_accuracy": 0.4806541882455349,
"num_tokens": 86611.0,
"rewards/accuracies": 0.93125,
"rewards/chosen": 5.613885009288788,
"rewards/margins": 12.845363640785218,
"rewards/rejected": -7.231478703022003,
"step": 70
},
{
"entropy": 2.5407466888427734,
"epoch": 1.192,
"grad_norm": 164.6415252685547,
"learning_rate": 3.81608040719339e-06,
"logits/chosen": 0.3012379954587533,
"logits/rejected": 0.35636349940869577,
"logps/chosen": -152.22927570343018,
"logps/rejected": -158.37194900512696,
"loss": 0.13926982879638672,
"mean_token_accuracy": 0.4698187731206417,
"num_tokens": 153056.0,
"rewards/accuracies": 0.925,
"rewards/chosen": 4.025047600269318,
"rewards/margins": 11.277643758058549,
"rewards/rejected": -7.252596193552018,
"step": 75
},
{
"entropy": 2.5421448230743406,
"epoch": 1.272,
"grad_norm": 77.16290283203125,
"learning_rate": 3.6143458894413463e-06,
"logits/chosen": 0.2523993960550924,
"logits/rejected": 0.3098906828719798,
"logps/chosen": -128.28734722137452,
"logps/rejected": -151.55945873260498,
"loss": 0.20328567028045655,
"mean_token_accuracy": 0.4690698154270649,
"num_tokens": 215920.0,
"rewards/accuracies": 0.9,
"rewards/chosen": 5.010193508863449,
"rewards/margins": 10.482384419441223,
"rewards/rejected": -5.472190934419632,
"step": 80
},
{
"entropy": 2.462119910120964,
"epoch": 1.3519999999999999,
"grad_norm": 181.0267791748047,
"learning_rate": 3.403104165467883e-06,
"logits/chosen": 0.2615454777932041,
"logits/rejected": 0.34690817078532066,
"logps/chosen": -136.50883808135987,
"logps/rejected": -156.16784238815308,
"loss": 0.24072544574737548,
"mean_token_accuracy": 0.49424040541052816,
"num_tokens": 287127.0,
"rewards/accuracies": 0.89375,
"rewards/chosen": 6.286368477344513,
"rewards/margins": 13.312550961971283,
"rewards/rejected": -7.02618248462677,
"step": 85
},
{
"entropy": 2.5757258504629137,
"epoch": 1.432,
"grad_norm": 128.99142456054688,
"learning_rate": 3.184157475180208e-06,
"logits/chosen": 0.26197732623753106,
"logits/rejected": 0.3165610941969709,
"logps/chosen": -156.26946783065796,
"logps/rejected": -148.62067685127258,
"loss": 0.2306227684020996,
"mean_token_accuracy": 0.46578485444188117,
"num_tokens": 354068.0,
"rewards/accuracies": 0.89375,
"rewards/chosen": 5.876923865079879,
"rewards/margins": 10.556617093086242,
"rewards/rejected": -4.679693168401718,
"step": 90
},
{
"entropy": 2.4905955940485,
"epoch": 1.512,
"grad_norm": 99.29806518554688,
"learning_rate": 2.9593737945414264e-06,
"logits/chosen": 0.18172540683269275,
"logits/rejected": 0.17394183194436158,
"logps/chosen": -135.62753200531006,
"logps/rejected": -156.26373701095582,
"loss": 0.18702551126480102,
"mean_token_accuracy": 0.4736903429031372,
"num_tokens": 421426.0,
"rewards/accuracies": 0.8875,
"rewards/chosen": 5.762694102525711,
"rewards/margins": 12.075559437274933,
"rewards/rejected": -6.312865370512009,
"step": 95
},
{
"entropy": 2.4252312004566194,
"epoch": 1.592,
"grad_norm": 277.9349670410156,
"learning_rate": 2.730670898658255e-06,
"logits/chosen": -0.04065577566546924,
"logits/rejected": 0.10009592183059253,
"logps/chosen": -154.10384283065795,
"logps/rejected": -152.03404664993286,
"loss": 0.21797585487365723,
"mean_token_accuracy": 0.490592048317194,
"num_tokens": 489806.0,
"rewards/accuracies": 0.89375,
"rewards/chosen": 6.565640062093735,
"rewards/margins": 12.645995873212815,
"rewards/rejected": -6.080355882644653,
"step": 100
},
{
"epoch": 1.592,
"eval_entropy": 2.4817885313034056,
"eval_logits/chosen": -0.02915419819877984,
"eval_logits/rejected": 0.030335744896749582,
"eval_logps/chosen": -161.77295245361327,
"eval_logps/rejected": -154.0547428894043,
"eval_loss": 1.7032477855682373,
"eval_mean_token_accuracy": 0.46294176495075223,
"eval_num_tokens": 489806.0,
"eval_rewards/accuracies": 0.535,
"eval_rewards/chosen": -0.3251441774368286,
"eval_rewards/margins": 0.5741160621643067,
"eval_rewards/rejected": -0.8992602396011352,
"eval_runtime": 206.5591,
"eval_samples_per_second": 4.841,
"eval_steps_per_second": 1.21,
"step": 100
},
{
"entropy": 2.456927877664566,
"epoch": 1.6720000000000002,
"grad_norm": 165.99703979492188,
"learning_rate": 2.5e-06,
"logits/chosen": -0.054035433190315674,
"logits/rejected": 0.023870603039078404,
"logps/chosen": -163.42230014801027,
"logps/rejected": -180.3114507675171,
"loss": 0.201928448677063,
"mean_token_accuracy": 0.4830969862639904,
"num_tokens": 557126.0,
"rewards/accuracies": 0.91875,
"rewards/chosen": 7.902144932746888,
"rewards/margins": 15.32146052122116,
"rewards/rejected": -7.419315588474274,
"step": 105
},
{
"entropy": 2.3846511244773865,
"epoch": 1.752,
"grad_norm": 223.44317626953125,
"learning_rate": 2.269329101341745e-06,
"logits/chosen": -0.08168034990535702,
"logits/rejected": 0.0008842671251679538,
"logps/chosen": -157.9646562576294,
"logps/rejected": -169.75593194961547,
"loss": 0.2925128936767578,
"mean_token_accuracy": 0.4920019693672657,
"num_tokens": 621946.0,
"rewards/accuracies": 0.86875,
"rewards/chosen": 5.381330716609955,
"rewards/margins": 12.80650681257248,
"rewards/rejected": -7.425176107883454,
"step": 110
},
{
"entropy": 2.390929380059242,
"epoch": 1.8319999999999999,
"grad_norm": 161.18760681152344,
"learning_rate": 2.040626205458574e-06,
"logits/chosen": -0.13911858224201848,
"logits/rejected": 0.005971987129984738,
"logps/chosen": -149.66920585632323,
"logps/rejected": -163.18242540359498,
"loss": 0.3038404703140259,
"mean_token_accuracy": 0.4787629432976246,
"num_tokens": 691164.0,
"rewards/accuracies": 0.875,
"rewards/chosen": 4.273123002052307,
"rewards/margins": 11.417729103565216,
"rewards/rejected": -7.144606101512909,
"step": 115
},
{
"entropy": 2.396760308742523,
"epoch": 1.912,
"grad_norm": 89.2537612915039,
"learning_rate": 1.8158425248197931e-06,
"logits/chosen": -0.12405535128295105,
"logits/rejected": -0.04780259835323798,
"logps/chosen": -151.86719579696654,
"logps/rejected": -157.59414463043214,
"loss": 0.30124845504760744,
"mean_token_accuracy": 0.4764955550432205,
"num_tokens": 754527.0,
"rewards/accuracies": 0.86875,
"rewards/chosen": 4.300834584236145,
"rewards/margins": 11.465607309341431,
"rewards/rejected": -7.164772701263428,
"step": 120
},
{
"entropy": 2.4199918031692507,
"epoch": 1.992,
"grad_norm": 133.04541015625,
"learning_rate": 1.5968958345321178e-06,
"logits/chosen": -0.13994722177665678,
"logits/rejected": -0.04187930260754162,
"logps/chosen": -145.3044916152954,
"logps/rejected": -156.23708686828613,
"loss": 0.24916279315948486,
"mean_token_accuracy": 0.4763185203075409,
"num_tokens": 823843.0,
"rewards/accuracies": 0.86875,
"rewards/chosen": 4.19235634803772,
"rewards/margins": 11.286557984352111,
"rewards/rejected": -7.094201683998108,
"step": 125
},
{
"entropy": 2.415849642621146,
"epoch": 2.064,
"grad_norm": 12.131107330322266,
"learning_rate": 1.3856541105586545e-06,
"logits/chosen": -0.05668467466104803,
"logits/rejected": 0.011222639368738605,
"logps/chosen": -140.81739722357855,
"logps/rejected": -159.12346098158093,
"loss": 0.11149348020553589,
"mean_token_accuracy": 0.4910110185543696,
"num_tokens": 880621.0,
"rewards/accuracies": 0.9652777777777778,
"rewards/chosen": 6.9378207259707985,
"rewards/margins": 17.63261538081699,
"rewards/rejected": -10.694794721073574,
"step": 130
},
{
"entropy": 2.393415144085884,
"epoch": 2.144,
"grad_norm": 49.40803146362305,
"learning_rate": 1.1839195928066101e-06,
"logits/chosen": -0.06260905999738418,
"logits/rejected": 0.01862583566735894,
"logps/chosen": -145.67238521575928,
"logps/rejected": -158.00395879745483,
"loss": 0.055275356769561766,
"mean_token_accuracy": 0.488899864256382,
"num_tokens": 947062.0,
"rewards/accuracies": 0.96875,
"rewards/chosen": 6.641458833217621,
"rewards/margins": 15.128113627433777,
"rewards/rejected": -8.486654794216156,
"step": 135
},
{
"entropy": 2.3886053651571273,
"epoch": 2.224,
"grad_norm": 247.27073669433594,
"learning_rate": 9.934134090518593e-07,
"logits/chosen": 0.015752432688678975,
"logits/rejected": 0.14565652903713386,
"logps/chosen": -140.80859432220458,
"logps/rejected": -144.45258922576903,
"loss": 0.08347327113151551,
"mean_token_accuracy": 0.48201576992869377,
"num_tokens": 1009620.0,
"rewards/accuracies": 0.9375,
"rewards/chosen": 6.356861460208893,
"rewards/margins": 15.583760273456573,
"rewards/rejected": -9.22689858675003,
"step": 140
},
{
"entropy": 2.386504426598549,
"epoch": 2.304,
"grad_norm": 53.45302200317383,
"learning_rate": 8.157608908836071e-07,
"logits/chosen": -0.020702211829369148,
"logits/rejected": 0.04769667472695908,
"logps/chosen": -146.7426830291748,
"logps/rejected": -163.1491216659546,
"loss": 0.043124151229858396,
"mean_token_accuracy": 0.4906194917857647,
"num_tokens": 1073365.0,
"rewards/accuracies": 0.96875,
"rewards/chosen": 7.815622496604919,
"rewards/margins": 18.167242777347564,
"rewards/rejected": -10.351620376110077,
"step": 145
},
{
"entropy": 2.4140032857656477,
"epoch": 2.384,
"grad_norm": 58.150901794433594,
"learning_rate": 6.524777069483526e-07,
"logits/chosen": -0.050803879241865094,
"logits/rejected": 0.016077080657433143,
"logps/chosen": -149.95097274780272,
"logps/rejected": -170.474439907074,
"loss": 0.043502068519592284,
"mean_token_accuracy": 0.47633846253156664,
"num_tokens": 1145086.0,
"rewards/accuracies": 0.95625,
"rewards/chosen": 8.080148875713348,
"rewards/margins": 18.47083934545517,
"rewards/rejected": -10.390690636634826,
"step": 150
},
{
"epoch": 2.384,
"eval_entropy": 2.4216558537483217,
"eval_logits/chosen": -0.029028150294289495,
"eval_logits/rejected": 0.0280112105939085,
"eval_logps/chosen": -162.54176181030275,
"eval_logps/rejected": -155.01175158691407,
"eval_loss": 1.7026314735412598,
"eval_mean_token_accuracy": 0.46184870624542235,
"eval_num_tokens": 1145086.0,
"eval_rewards/accuracies": 0.548,
"eval_rewards/chosen": -1.093953761100769,
"eval_rewards/margins": 0.762314435005188,
"eval_rewards/rejected": -1.85626819896698,
"eval_runtime": 206.5417,
"eval_samples_per_second": 4.842,
"eval_steps_per_second": 1.21,
"step": 150
},
{
"entropy": 2.3098636120557785,
"epoch": 2.464,
"grad_norm": 64.46814727783203,
"learning_rate": 5.049569317994013e-07,
"logits/chosen": -0.06188787605804125,
"logits/rejected": 0.027120160451300827,
"logps/chosen": -139.7538740158081,
"logps/rejected": -178.46554546356202,
"loss": 0.04540476202964783,
"mean_token_accuracy": 0.494048598408699,
"num_tokens": 1213916.0,
"rewards/accuracies": 0.95625,
"rewards/chosen": 6.214471685886383,
"rewards/margins": 16.185495030879974,
"rewards/rejected": -9.97102323770523,
"step": 155
},
{
"entropy": 2.409408602118492,
"epoch": 2.544,
"grad_norm": 68.03170013427734,
"learning_rate": 3.7445716067596506e-07,
"logits/chosen": -0.003306678294279577,
"logits/rejected": 0.18536064407876787,
"logps/chosen": -129.7855330467224,
"logps/rejected": -140.2837603569031,
"loss": 0.049390339851379396,
"mean_token_accuracy": 0.4815196588635445,
"num_tokens": 1277766.0,
"rewards/accuracies": 0.9625,
"rewards/chosen": 6.468300366401673,
"rewards/margins": 14.843488407135009,
"rewards/rejected": -8.37518800497055,
"step": 160
},
{
"entropy": 2.373009890317917,
"epoch": 2.624,
"grad_norm": 29.85422134399414,
"learning_rate": 2.620917716123444e-07,
"logits/chosen": -0.034215040255231824,
"logits/rejected": 0.003781206712556699,
"logps/chosen": -144.27701168060304,
"logps/rejected": -160.7808395385742,
"loss": 0.03415984511375427,
"mean_token_accuracy": 0.49681628569960595,
"num_tokens": 1344187.0,
"rewards/accuracies": 0.975,
"rewards/chosen": 6.034191703796386,
"rewards/margins": 14.862355995178223,
"rewards/rejected": -8.828164434432983,
"step": 165
},
{
"entropy": 2.4209450781345367,
"epoch": 2.7039999999999997,
"grad_norm": 31.656320571899414,
"learning_rate": 1.6881942648911077e-07,
"logits/chosen": -0.020082851941010425,
"logits/rejected": 0.05684754955497793,
"logps/chosen": -159.64463758468628,
"logps/rejected": -200.80445861816406,
"loss": 0.039914682507514954,
"mean_token_accuracy": 0.47963607460260393,
"num_tokens": 1412024.0,
"rewards/accuracies": 0.9625,
"rewards/chosen": 7.226568651199341,
"rewards/margins": 19.14883189201355,
"rewards/rejected": -11.922263181209564,
"step": 170
},
{
"entropy": 2.398535707592964,
"epoch": 2.784,
"grad_norm": 7.714607238769531,
"learning_rate": 9.54358920679524e-08,
"logits/chosen": -0.0991577681817519,
"logits/rejected": 0.04568099312173675,
"logps/chosen": -163.36764631271362,
"logps/rejected": -165.54495639801024,
"loss": 0.02738744020462036,
"mean_token_accuracy": 0.4867618277668953,
"num_tokens": 1479107.0,
"rewards/accuracies": 0.98125,
"rewards/chosen": 9.70926661491394,
"rewards/margins": 20.305203425884248,
"rewards/rejected": -10.595936667919158,
"step": 175
},
{
"entropy": 2.4347573101520537,
"epoch": 2.864,
"grad_norm": 24.47334861755371,
"learning_rate": 4.256725079024554e-08,
"logits/chosen": -0.02471525168225915,
"logits/rejected": 0.07145450971571757,
"logps/chosen": -150.1224630355835,
"logps/rejected": -145.60447340011598,
"loss": 0.04212303757667542,
"mean_token_accuracy": 0.4759250283241272,
"num_tokens": 1546945.0,
"rewards/accuracies": 0.96875,
"rewards/chosen": 8.439748311042786,
"rewards/margins": 16.580363899469376,
"rewards/rejected": -8.140615552663803,
"step": 180
},
{
"entropy": 2.3951420307159426,
"epoch": 2.944,
"grad_norm": 11.518243789672852,
"learning_rate": 1.0664559262413831e-08,
"logits/chosen": -0.04937423423232102,
"logits/rejected": 0.10506708711402735,
"logps/chosen": -154.27819213867187,
"logps/rejected": -160.4699233055115,
"loss": 0.0593170702457428,
"mean_token_accuracy": 0.47507822662591936,
"num_tokens": 1610498.0,
"rewards/accuracies": 0.9625,
"rewards/chosen": 7.954719412326813,
"rewards/margins": 16.75150465965271,
"rewards/rejected": -8.796785068511962,
"step": 185
},
{
"epoch": 3.0,
"eval_entropy": 2.4251069741249083,
"eval_logits/chosen": -0.03056270304781408,
"eval_logits/rejected": 0.02707430725326769,
"eval_logps/chosen": -162.3641845550537,
"eval_logps/rejected": -154.82411492919923,
"eval_loss": 1.706053614616394,
"eval_mean_token_accuracy": 0.4618482575416565,
"eval_num_tokens": 1659568.0,
"eval_rewards/accuracies": 0.551,
"eval_rewards/chosen": -0.9163762617111206,
"eval_rewards/margins": 0.7522554168701172,
"eval_rewards/rejected": -1.668631679534912,
"eval_runtime": 206.75,
"eval_samples_per_second": 4.837,
"eval_steps_per_second": 1.209,
"step": 189
}
],
"logging_steps": 5,
"max_steps": 189,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 9840760918671360.0,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:bd11bc38a7578d81a07965e3bcf4c5c3915b28f975b3660339cfa5e5be2c946a
size 5841

33
checkpoint-63/config.json Normal file
View File

@@ -0,0 +1,33 @@
{
"architectures": [
"GPTNeoXForCausalLM"
],
"attention_bias": true,
"attention_dropout": 0.0,
"bos_token_id": 0,
"classifier_dropout": 0.1,
"dtype": "float32",
"eos_token_id": 0,
"hidden_act": "gelu",
"hidden_dropout": 0.0,
"hidden_size": 1024,
"initializer_range": 0.02,
"intermediate_size": 4096,
"is_decoder": false,
"layer_norm_eps": 1e-05,
"max_position_embeddings": 2048,
"model_type": "gpt_neox",
"num_attention_heads": 16,
"num_hidden_layers": 24,
"pad_token_id": 1,
"rope_parameters": {
"partial_rotary_factor": 0.25,
"rope_theta": 10000,
"rope_type": "default"
},
"tie_word_embeddings": false,
"transformers_version": "5.13.0",
"use_cache": false,
"use_parallel_residual": true,
"vocab_size": 50304
}

View File

@@ -0,0 +1,10 @@
{
"_from_model_config": true,
"bos_token_id": 0,
"eos_token_id": [
0
],
"pad_token_id": 1,
"transformers_version": "5.13.0",
"use_cache": true
}

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:b3ba2786f0c2cf41c8c2592eb30864eb9d1f7002c6114e271d17753ab4c6c8fd
size 1621370224

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:99eaa72ddce5c51bc9f0216405e21b19596412ffdef2353200fa3067e5132006
size 3242916491

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:f4a9f217e852f439efa6bd32fde98d6867f11aa6ea13ddc021ba10af6a0b0934
size 14645

3
checkpoint-63/scaler.pt Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:7b09ff53dfdeb98feaa25ccade54f490eaebb7ca5b59d6e930f01eab95790c26
size 1383

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:8f144286c127833c5309618e8e24f8a84d423b58fb8de34fb79a94bb5b178ab9
size 1465

250557
checkpoint-63/tokenizer.json Normal file

File diff suppressed because it is too large Load Diff

View File

@@ -0,0 +1,14 @@
{
"add_prefix_space": false,
"backend": "tokenizers",
"bos_token": "<|endoftext|>",
"eos_token": "<|endoftext|>",
"errors": "replace",
"is_local": false,
"local_files_only": false,
"model_max_length": 1000000000000000019884624838656,
"pad_token": "<|padding|>",
"tokenizer_class": "GPTNeoXTokenizer",
"trim_offsets": true,
"unk_token": "<|endoftext|>"
}

View File

@@ -0,0 +1,288 @@
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 50,
"global_step": 63,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 2.5553497850894926,
"epoch": 0.08,
"grad_norm": 357.8926696777344,
"learning_rate": 2.8571428571428573e-06,
"logits/chosen": 0.41187580737484436,
"logits/rejected": 0.43087167594886183,
"logps/chosen": -157.8165241241455,
"logps/rejected": -150.432616519928,
"loss": 0.6890408515930175,
"mean_token_accuracy": 0.45499045923352244,
"num_tokens": 63280.0,
"rewards/accuracies": 0.55625,
"rewards/chosen": 0.18442693948745728,
"rewards/margins": 0.05980904102325439,
"rewards/rejected": 0.12461789846420288,
"step": 5
},
{
"entropy": 2.585687577724457,
"epoch": 0.16,
"grad_norm": 550.5374145507812,
"learning_rate": 4.984280524733107e-06,
"logits/chosen": 0.23282768258015127,
"logits/rejected": 0.41657135452577226,
"logps/chosen": -160.46632223129274,
"logps/rejected": -155.05524663925172,
"loss": 1.0951576232910156,
"mean_token_accuracy": 0.4666588671505451,
"num_tokens": 128751.0,
"rewards/accuracies": 0.46875,
"rewards/chosen": 0.04196357727050781,
"rewards/margins": -0.13510316610336304,
"rewards/rejected": 0.17706674337387085,
"step": 10
},
{
"entropy": 2.4887936890125273,
"epoch": 0.24,
"grad_norm": 544.36474609375,
"learning_rate": 4.809698831278217e-06,
"logits/chosen": 0.19960332682723014,
"logits/rejected": 0.25714549020005323,
"logps/chosen": -151.403657245636,
"logps/rejected": -163.51016159057616,
"loss": 1.1309956550598144,
"mean_token_accuracy": 0.4729401096701622,
"num_tokens": 194142.0,
"rewards/accuracies": 0.45625,
"rewards/chosen": -0.6780350089073182,
"rewards/margins": 0.11501268744468689,
"rewards/rejected": -0.793047696352005,
"step": 15
},
{
"entropy": 2.543038326501846,
"epoch": 0.32,
"grad_norm": 545.773193359375,
"learning_rate": 4.454578706170075e-06,
"logits/chosen": 0.10757563983449289,
"logits/rejected": 0.2191312620805499,
"logps/chosen": -134.6160714149475,
"logps/rejected": -134.7640838623047,
"loss": 1.2686697959899902,
"mean_token_accuracy": 0.46390472874045374,
"num_tokens": 254871.0,
"rewards/accuracies": 0.54375,
"rewards/chosen": -1.045345139503479,
"rewards/margins": 0.4233867168426514,
"rewards/rejected": -1.4687318563461305,
"step": 20
},
{
"entropy": 2.4839668542146685,
"epoch": 0.4,
"grad_norm": 609.0315551757812,
"learning_rate": 3.946678240449515e-06,
"logits/chosen": 0.23401674829751978,
"logits/rejected": 0.22746947777638224,
"logps/chosen": -144.78962602615357,
"logps/rejected": -136.76443700790406,
"loss": 1.4144909858703614,
"mean_token_accuracy": 0.45985892340540885,
"num_tokens": 317752.0,
"rewards/accuracies": 0.5625,
"rewards/chosen": -0.8229869723320007,
"rewards/margins": 0.27719623446464536,
"rewards/rejected": -1.1001832067966462,
"step": 25
},
{
"entropy": 2.4549559235572813,
"epoch": 0.48,
"grad_norm": 685.6503295898438,
"learning_rate": 3.3256976548879183e-06,
"logits/chosen": 0.21252182170691483,
"logits/rejected": 0.27063995156819315,
"logps/chosen": -148.57344274520875,
"logps/rejected": -146.81006059646606,
"loss": 1.6434017181396485,
"mean_token_accuracy": 0.454254624247551,
"num_tokens": 387452.0,
"rewards/accuracies": 0.4625,
"rewards/chosen": -0.23523921966552735,
"rewards/margins": 0.0028411030769348146,
"rewards/rejected": -0.23808032274246216,
"step": 30
},
{
"entropy": 2.4848766714334487,
"epoch": 0.56,
"grad_norm": 572.0255737304688,
"learning_rate": 2.6401761180929798e-06,
"logits/chosen": 0.1604402064572174,
"logits/rejected": 0.23192453424270135,
"logps/chosen": -178.91495656967163,
"logps/rejected": -171.79455051422119,
"loss": 1.2930749893188476,
"mean_token_accuracy": 0.4774269789457321,
"num_tokens": 454873.0,
"rewards/accuracies": 0.54375,
"rewards/chosen": 0.2875680088996887,
"rewards/margins": 0.7235915064811707,
"rewards/rejected": -0.43602349758148196,
"step": 35
},
{
"entropy": 2.4956657856702806,
"epoch": 0.64,
"grad_norm": 581.42724609375,
"learning_rate": 1.9436976651092143e-06,
"logits/chosen": 0.26337065405985355,
"logits/rejected": 0.36300255439029444,
"logps/chosen": -157.99055194854736,
"logps/rejected": -159.0982545375824,
"loss": 1.5171399116516113,
"mean_token_accuracy": 0.46507507339119913,
"num_tokens": 518527.0,
"rewards/accuracies": 0.5,
"rewards/chosen": -0.061191481351852414,
"rewards/margins": 0.1269888162612915,
"rewards/rejected": -0.18818029761314392,
"step": 40
},
{
"entropy": 2.434966567158699,
"epoch": 0.72,
"grad_norm": 432.56536865234375,
"learning_rate": 1.2907027822369006e-06,
"logits/chosen": 0.268132887364752,
"logits/rejected": 0.30894473259910554,
"logps/chosen": -154.1576229095459,
"logps/rejected": -159.85538330078126,
"loss": 1.3509400367736817,
"mean_token_accuracy": 0.4740308240056038,
"num_tokens": 586496.0,
"rewards/accuracies": 0.5375,
"rewards/chosen": 0.02395761013031006,
"rewards/margins": 0.8281095027923584,
"rewards/rejected": -0.8041518926620483,
"step": 45
},
{
"entropy": 2.4690693795681,
"epoch": 0.8,
"grad_norm": 504.9461364746094,
"learning_rate": 7.322330470336314e-07,
"logits/chosen": 0.27772643533489566,
"logits/rejected": 0.36052606081661537,
"logps/chosen": -164.17142915725708,
"logps/rejected": -163.73542156219483,
"loss": 1.4861845970153809,
"mean_token_accuracy": 0.4653610520064831,
"num_tokens": 659345.0,
"rewards/accuracies": 0.55625,
"rewards/chosen": -0.0009298324584960938,
"rewards/margins": 0.31063854694366455,
"rewards/rejected": -0.31156837940216064,
"step": 50
},
{
"epoch": 0.8,
"eval_entropy": 2.536505832195282,
"eval_logits/chosen": 0.2893901140152919,
"eval_logits/rejected": 0.34482142702810936,
"eval_logps/chosen": -161.61729994201661,
"eval_logps/rejected": -153.7386490020752,
"eval_loss": 1.3951599597930908,
"eval_mean_token_accuracy": 0.46117462730407716,
"eval_num_tokens": 659345.0,
"eval_rewards/accuracies": 0.539,
"eval_rewards/chosen": -0.16949110031127929,
"eval_rewards/margins": 0.413674391746521,
"eval_rewards/rejected": -0.5831654920578003,
"eval_runtime": 204.2784,
"eval_samples_per_second": 4.895,
"eval_steps_per_second": 1.224,
"step": 50
},
{
"entropy": 2.5048249810934067,
"epoch": 0.88,
"grad_norm": 538.51953125,
"learning_rate": 3.119414452281158e-07,
"logits/chosen": 0.31241473497619054,
"logits/rejected": 0.4336116565754852,
"logps/chosen": -148.8257155418396,
"logps/rejected": -143.5335810661316,
"loss": 1.5545385360717774,
"mean_token_accuracy": 0.47073024958372117,
"num_tokens": 731475.0,
"rewards/accuracies": 0.53125,
"rewards/chosen": -0.08134242296218872,
"rewards/margins": 0.31841338872909547,
"rewards/rejected": -0.39975581169128416,
"step": 55
},
{
"entropy": 2.4619424283504485,
"epoch": 0.96,
"grad_norm": 439.4546813964844,
"learning_rate": 6.268021954544095e-08,
"logits/chosen": 0.26771219837052634,
"logits/rejected": 0.3957730213546686,
"logps/chosen": -157.09008331298827,
"logps/rejected": -164.03927259445192,
"loss": 1.2014739990234375,
"mean_token_accuracy": 0.47436425387859343,
"num_tokens": 797757.0,
"rewards/accuracies": 0.525,
"rewards/chosen": 0.21749011874198915,
"rewards/margins": 0.5742806613445282,
"rewards/rejected": -0.35679054260253906,
"step": 60
},
{
"epoch": 1.0,
"eval_entropy": 2.5392660574913024,
"eval_logits/chosen": 0.2875409764336183,
"eval_logits/rejected": 0.34302489192485985,
"eval_logps/chosen": -161.68841091918947,
"eval_logps/rejected": -153.80732011413573,
"eval_loss": 1.3833612203598022,
"eval_mean_token_accuracy": 0.46109312522411344,
"eval_num_tokens": 829784.0,
"eval_rewards/accuracies": 0.543,
"eval_rewards/chosen": -0.24060248374938964,
"eval_rewards/margins": 0.4112340784072876,
"eval_rewards/rejected": -0.6518365621566773,
"eval_runtime": 204.0071,
"eval_samples_per_second": 4.902,
"eval_steps_per_second": 1.225,
"step": 63
}
],
"logging_steps": 5,
"max_steps": 63,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 3267470732328960.0,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:a7b77773b982b950a274c747409fcf823a4c10541af386ddc953bcabecd153d0
size 5841

33
config.json Normal file
View File

@@ -0,0 +1,33 @@
{
"architectures": [
"GPTNeoXForCausalLM"
],
"attention_bias": true,
"attention_dropout": 0.0,
"bos_token_id": 0,
"classifier_dropout": 0.1,
"dtype": "float32",
"eos_token_id": 0,
"hidden_act": "gelu",
"hidden_dropout": 0.0,
"hidden_size": 1024,
"initializer_range": 0.02,
"intermediate_size": 4096,
"is_decoder": false,
"layer_norm_eps": 1e-05,
"max_position_embeddings": 2048,
"model_type": "gpt_neox",
"num_attention_heads": 16,
"num_hidden_layers": 24,
"pad_token_id": 1,
"rope_parameters": {
"partial_rotary_factor": 0.25,
"rope_theta": 10000,
"rope_type": "default"
},
"tie_word_embeddings": false,
"transformers_version": "5.13.0",
"use_cache": false,
"use_parallel_residual": true,
"vocab_size": 50304
}

10
generation_config.json Normal file
View File

@@ -0,0 +1,10 @@
{
"_from_model_config": true,
"bos_token_id": 0,
"eos_token_id": [
0
],
"pad_token_id": 1,
"transformers_version": "5.13.0",
"use_cache": true
}

772
log_history.json Normal file
View File

@@ -0,0 +1,772 @@
[
{
"entropy": 2.5553497850894926,
"epoch": 0.08,
"grad_norm": 357.8926696777344,
"learning_rate": 2.8571428571428573e-06,
"logits/chosen": 0.41187580737484436,
"logits/rejected": 0.43087167594886183,
"logps/chosen": -157.8165241241455,
"logps/rejected": -150.432616519928,
"loss": 0.6890408515930175,
"mean_token_accuracy": 0.45499045923352244,
"num_tokens": 63280.0,
"rewards/accuracies": 0.55625,
"rewards/chosen": 0.18442693948745728,
"rewards/margins": 0.05980904102325439,
"rewards/rejected": 0.12461789846420288,
"step": 5
},
{
"entropy": 2.585687577724457,
"epoch": 0.16,
"grad_norm": 550.5374145507812,
"learning_rate": 4.984280524733107e-06,
"logits/chosen": 0.23282768258015127,
"logits/rejected": 0.41657135452577226,
"logps/chosen": -160.46632223129274,
"logps/rejected": -155.05524663925172,
"loss": 1.0951576232910156,
"mean_token_accuracy": 0.4666588671505451,
"num_tokens": 128751.0,
"rewards/accuracies": 0.46875,
"rewards/chosen": 0.04196357727050781,
"rewards/margins": -0.13510316610336304,
"rewards/rejected": 0.17706674337387085,
"step": 10
},
{
"entropy": 2.4887936890125273,
"epoch": 0.24,
"grad_norm": 544.36474609375,
"learning_rate": 4.809698831278217e-06,
"logits/chosen": 0.19960332682723014,
"logits/rejected": 0.25714549020005323,
"logps/chosen": -151.403657245636,
"logps/rejected": -163.51016159057616,
"loss": 1.1309956550598144,
"mean_token_accuracy": 0.4729401096701622,
"num_tokens": 194142.0,
"rewards/accuracies": 0.45625,
"rewards/chosen": -0.6780350089073182,
"rewards/margins": 0.11501268744468689,
"rewards/rejected": -0.793047696352005,
"step": 15
},
{
"entropy": 2.543038326501846,
"epoch": 0.32,
"grad_norm": 545.773193359375,
"learning_rate": 4.454578706170075e-06,
"logits/chosen": 0.10757563983449289,
"logits/rejected": 0.2191312620805499,
"logps/chosen": -134.6160714149475,
"logps/rejected": -134.7640838623047,
"loss": 1.2686697959899902,
"mean_token_accuracy": 0.46390472874045374,
"num_tokens": 254871.0,
"rewards/accuracies": 0.54375,
"rewards/chosen": -1.045345139503479,
"rewards/margins": 0.4233867168426514,
"rewards/rejected": -1.4687318563461305,
"step": 20
},
{
"entropy": 2.4839668542146685,
"epoch": 0.4,
"grad_norm": 609.0315551757812,
"learning_rate": 3.946678240449515e-06,
"logits/chosen": 0.23401674829751978,
"logits/rejected": 0.22746947777638224,
"logps/chosen": -144.78962602615357,
"logps/rejected": -136.76443700790406,
"loss": 1.4144909858703614,
"mean_token_accuracy": 0.45985892340540885,
"num_tokens": 317752.0,
"rewards/accuracies": 0.5625,
"rewards/chosen": -0.8229869723320007,
"rewards/margins": 0.27719623446464536,
"rewards/rejected": -1.1001832067966462,
"step": 25
},
{
"entropy": 2.4549559235572813,
"epoch": 0.48,
"grad_norm": 685.6503295898438,
"learning_rate": 3.3256976548879183e-06,
"logits/chosen": 0.21252182170691483,
"logits/rejected": 0.27063995156819315,
"logps/chosen": -148.57344274520875,
"logps/rejected": -146.81006059646606,
"loss": 1.6434017181396485,
"mean_token_accuracy": 0.454254624247551,
"num_tokens": 387452.0,
"rewards/accuracies": 0.4625,
"rewards/chosen": -0.23523921966552735,
"rewards/margins": 0.0028411030769348146,
"rewards/rejected": -0.23808032274246216,
"step": 30
},
{
"entropy": 2.4848766714334487,
"epoch": 0.56,
"grad_norm": 572.0255737304688,
"learning_rate": 2.6401761180929798e-06,
"logits/chosen": 0.1604402064572174,
"logits/rejected": 0.23192453424270135,
"logps/chosen": -178.91495656967163,
"logps/rejected": -171.79455051422119,
"loss": 1.2930749893188476,
"mean_token_accuracy": 0.4774269789457321,
"num_tokens": 454873.0,
"rewards/accuracies": 0.54375,
"rewards/chosen": 0.2875680088996887,
"rewards/margins": 0.7235915064811707,
"rewards/rejected": -0.43602349758148196,
"step": 35
},
{
"entropy": 2.4956657856702806,
"epoch": 0.64,
"grad_norm": 581.42724609375,
"learning_rate": 1.9436976651092143e-06,
"logits/chosen": 0.26337065405985355,
"logits/rejected": 0.36300255439029444,
"logps/chosen": -157.99055194854736,
"logps/rejected": -159.0982545375824,
"loss": 1.5171399116516113,
"mean_token_accuracy": 0.46507507339119913,
"num_tokens": 518527.0,
"rewards/accuracies": 0.5,
"rewards/chosen": -0.061191481351852414,
"rewards/margins": 0.1269888162612915,
"rewards/rejected": -0.18818029761314392,
"step": 40
},
{
"entropy": 2.434966567158699,
"epoch": 0.72,
"grad_norm": 432.56536865234375,
"learning_rate": 1.2907027822369006e-06,
"logits/chosen": 0.268132887364752,
"logits/rejected": 0.30894473259910554,
"logps/chosen": -154.1576229095459,
"logps/rejected": -159.85538330078126,
"loss": 1.3509400367736817,
"mean_token_accuracy": 0.4740308240056038,
"num_tokens": 586496.0,
"rewards/accuracies": 0.5375,
"rewards/chosen": 0.02395761013031006,
"rewards/margins": 0.8281095027923584,
"rewards/rejected": -0.8041518926620483,
"step": 45
},
{
"entropy": 2.4690693795681,
"epoch": 0.8,
"grad_norm": 504.9461364746094,
"learning_rate": 7.322330470336314e-07,
"logits/chosen": 0.27772643533489566,
"logits/rejected": 0.36052606081661537,
"logps/chosen": -164.17142915725708,
"logps/rejected": -163.73542156219483,
"loss": 1.4861845970153809,
"mean_token_accuracy": 0.4653610520064831,
"num_tokens": 659345.0,
"rewards/accuracies": 0.55625,
"rewards/chosen": -0.0009298324584960938,
"rewards/margins": 0.31063854694366455,
"rewards/rejected": -0.31156837940216064,
"step": 50
},
{
"epoch": 0.8,
"eval_entropy": 2.536505832195282,
"eval_logits/chosen": 0.2893901140152919,
"eval_logits/rejected": 0.34482142702810936,
"eval_logps/chosen": -161.61729994201661,
"eval_logps/rejected": -153.7386490020752,
"eval_loss": 1.3951599597930908,
"eval_mean_token_accuracy": 0.46117462730407716,
"eval_num_tokens": 659345.0,
"eval_rewards/accuracies": 0.539,
"eval_rewards/chosen": -0.16949110031127929,
"eval_rewards/margins": 0.413674391746521,
"eval_rewards/rejected": -0.5831654920578003,
"eval_runtime": 204.2784,
"eval_samples_per_second": 4.895,
"eval_steps_per_second": 1.224,
"step": 50
},
{
"entropy": 2.5048249810934067,
"epoch": 0.88,
"grad_norm": 538.51953125,
"learning_rate": 3.119414452281158e-07,
"logits/chosen": 0.31241473497619054,
"logits/rejected": 0.4336116565754852,
"logps/chosen": -148.8257155418396,
"logps/rejected": -143.5335810661316,
"loss": 1.5545385360717774,
"mean_token_accuracy": 0.47073024958372117,
"num_tokens": 731475.0,
"rewards/accuracies": 0.53125,
"rewards/chosen": -0.08134242296218872,
"rewards/margins": 0.31841338872909547,
"rewards/rejected": -0.39975581169128416,
"step": 55
},
{
"entropy": 2.4619424283504485,
"epoch": 0.96,
"grad_norm": 439.4546813964844,
"learning_rate": 6.268021954544095e-08,
"logits/chosen": 0.26771219837052634,
"logits/rejected": 0.3957730213546686,
"logps/chosen": -157.09008331298827,
"logps/rejected": -164.03927259445192,
"loss": 1.2014739990234375,
"mean_token_accuracy": 0.47436425387859343,
"num_tokens": 797757.0,
"rewards/accuracies": 0.525,
"rewards/chosen": 0.21749011874198915,
"rewards/margins": 0.5742806613445282,
"rewards/rejected": -0.35679054260253906,
"step": 60
},
{
"epoch": 1.0,
"eval_entropy": 2.5392660574913024,
"eval_logits/chosen": 0.2875409764336183,
"eval_logits/rejected": 0.34302489192485985,
"eval_logps/chosen": -161.68841091918947,
"eval_logps/rejected": -153.80732011413573,
"eval_loss": 1.3833612203598022,
"eval_mean_token_accuracy": 0.46109312522411344,
"eval_num_tokens": 829784.0,
"eval_rewards/accuracies": 0.543,
"eval_rewards/chosen": -0.24060248374938964,
"eval_rewards/margins": 0.4112340784072876,
"eval_rewards/rejected": -0.6518365621566773,
"eval_runtime": 204.0071,
"eval_samples_per_second": 4.902,
"eval_steps_per_second": 1.225,
"step": 63
},
{
"loss": 0.27623340487480164,
"grad_norm": 189.56698608398438,
"learning_rate": 4.184239109116393e-06,
"entropy": 2.507671430706978,
"num_tokens": 27180.0,
"logits/chosen": 0.2979938850081893,
"logits/rejected": 0.3261501650298202,
"mean_token_accuracy": 0.47298500686883926,
"rewards/chosen": 5.079042822122574,
"rewards/rejected": -6.503820419311523,
"rewards/accuracies": 0.828125,
"rewards/margins": 11.58286327123642,
"logps/chosen": -146.56341791152954,
"logps/rejected": -168.53296971321106,
"epoch": 1.032,
"step": 65
},
{
"loss": 0.13215208053588867,
"grad_norm": 113.09912872314453,
"learning_rate": 4.006586590948141e-06,
"entropy": 2.5133699655532835,
"num_tokens": 86611.0,
"logits/chosen": 0.25969656721433304,
"logits/rejected": 0.39782895997815093,
"mean_token_accuracy": 0.4806541882455349,
"rewards/chosen": 5.613885009288788,
"rewards/rejected": -7.231478703022003,
"rewards/accuracies": 0.93125,
"rewards/margins": 12.845363640785218,
"logps/chosen": -152.27070779800414,
"logps/rejected": -152.92093172073365,
"epoch": 1.112,
"step": 70
},
{
"loss": 0.13926982879638672,
"grad_norm": 164.6415252685547,
"learning_rate": 3.81608040719339e-06,
"entropy": 2.5407466888427734,
"num_tokens": 153056.0,
"logits/chosen": 0.3012379954587533,
"logits/rejected": 0.35636349940869577,
"mean_token_accuracy": 0.4698187731206417,
"rewards/chosen": 4.025047600269318,
"rewards/rejected": -7.252596193552018,
"rewards/accuracies": 0.925,
"rewards/margins": 11.277643758058549,
"logps/chosen": -152.22927570343018,
"logps/rejected": -158.37194900512696,
"epoch": 1.192,
"step": 75
},
{
"loss": 0.20328567028045655,
"grad_norm": 77.16290283203125,
"learning_rate": 3.6143458894413463e-06,
"entropy": 2.5421448230743406,
"num_tokens": 215920.0,
"logits/chosen": 0.2523993960550924,
"logits/rejected": 0.3098906828719798,
"mean_token_accuracy": 0.4690698154270649,
"rewards/chosen": 5.010193508863449,
"rewards/rejected": -5.472190934419632,
"rewards/accuracies": 0.9,
"rewards/margins": 10.482384419441223,
"logps/chosen": -128.28734722137452,
"logps/rejected": -151.55945873260498,
"epoch": 1.272,
"step": 80
},
{
"loss": 0.24072544574737548,
"grad_norm": 181.0267791748047,
"learning_rate": 3.403104165467883e-06,
"entropy": 2.462119910120964,
"num_tokens": 287127.0,
"logits/chosen": 0.2615454777932041,
"logits/rejected": 0.34690817078532066,
"mean_token_accuracy": 0.49424040541052816,
"rewards/chosen": 6.286368477344513,
"rewards/rejected": -7.02618248462677,
"rewards/accuracies": 0.89375,
"rewards/margins": 13.312550961971283,
"logps/chosen": -136.50883808135987,
"logps/rejected": -156.16784238815308,
"epoch": 1.3519999999999999,
"step": 85
},
{
"loss": 0.2306227684020996,
"grad_norm": 128.99142456054688,
"learning_rate": 3.184157475180208e-06,
"entropy": 2.5757258504629137,
"num_tokens": 354068.0,
"logits/chosen": 0.26197732623753106,
"logits/rejected": 0.3165610941969709,
"mean_token_accuracy": 0.46578485444188117,
"rewards/chosen": 5.876923865079879,
"rewards/rejected": -4.679693168401718,
"rewards/accuracies": 0.89375,
"rewards/margins": 10.556617093086242,
"logps/chosen": -156.26946783065796,
"logps/rejected": -148.62067685127258,
"epoch": 1.432,
"step": 90
},
{
"loss": 0.18702551126480102,
"grad_norm": 99.29806518554688,
"learning_rate": 2.9593737945414264e-06,
"entropy": 2.4905955940485,
"num_tokens": 421426.0,
"logits/chosen": 0.18172540683269275,
"logits/rejected": 0.17394183194436158,
"mean_token_accuracy": 0.4736903429031372,
"rewards/chosen": 5.762694102525711,
"rewards/rejected": -6.312865370512009,
"rewards/accuracies": 0.8875,
"rewards/margins": 12.075559437274933,
"logps/chosen": -135.62753200531006,
"logps/rejected": -156.26373701095582,
"epoch": 1.512,
"step": 95
},
{
"loss": 0.21797585487365723,
"grad_norm": 277.9349670410156,
"learning_rate": 2.730670898658255e-06,
"entropy": 2.4252312004566194,
"num_tokens": 489806.0,
"logits/chosen": -0.04065577566546924,
"logits/rejected": 0.10009592183059253,
"mean_token_accuracy": 0.490592048317194,
"rewards/chosen": 6.565640062093735,
"rewards/rejected": -6.080355882644653,
"rewards/accuracies": 0.89375,
"rewards/margins": 12.645995873212815,
"logps/chosen": -154.10384283065795,
"logps/rejected": -152.03404664993286,
"epoch": 1.592,
"step": 100
},
{
"eval_loss": 1.7032477855682373,
"eval_runtime": 206.5591,
"eval_samples_per_second": 4.841,
"eval_steps_per_second": 1.21,
"eval_entropy": 2.4817885313034056,
"eval_num_tokens": 489806.0,
"eval_logits/chosen": -0.02915419819877984,
"eval_logits/rejected": 0.030335744896749582,
"eval_mean_token_accuracy": 0.46294176495075223,
"eval_rewards/chosen": -0.3251441774368286,
"eval_rewards/rejected": -0.8992602396011352,
"eval_rewards/accuracies": 0.535,
"eval_rewards/margins": 0.5741160621643067,
"eval_logps/chosen": -161.77295245361327,
"eval_logps/rejected": -154.0547428894043,
"epoch": 1.592,
"step": 100
},
{
"loss": 0.201928448677063,
"grad_norm": 165.99703979492188,
"learning_rate": 2.5e-06,
"entropy": 2.456927877664566,
"num_tokens": 557126.0,
"logits/chosen": -0.054035433190315674,
"logits/rejected": 0.023870603039078404,
"mean_token_accuracy": 0.4830969862639904,
"rewards/chosen": 7.902144932746888,
"rewards/rejected": -7.419315588474274,
"rewards/accuracies": 0.91875,
"rewards/margins": 15.32146052122116,
"logps/chosen": -163.42230014801027,
"logps/rejected": -180.3114507675171,
"epoch": 1.6720000000000002,
"step": 105
},
{
"loss": 0.2925128936767578,
"grad_norm": 223.44317626953125,
"learning_rate": 2.269329101341745e-06,
"entropy": 2.3846511244773865,
"num_tokens": 621946.0,
"logits/chosen": -0.08168034990535702,
"logits/rejected": 0.0008842671251679538,
"mean_token_accuracy": 0.4920019693672657,
"rewards/chosen": 5.381330716609955,
"rewards/rejected": -7.425176107883454,
"rewards/accuracies": 0.86875,
"rewards/margins": 12.80650681257248,
"logps/chosen": -157.9646562576294,
"logps/rejected": -169.75593194961547,
"epoch": 1.752,
"step": 110
},
{
"loss": 0.3038404703140259,
"grad_norm": 161.18760681152344,
"learning_rate": 2.040626205458574e-06,
"entropy": 2.390929380059242,
"num_tokens": 691164.0,
"logits/chosen": -0.13911858224201848,
"logits/rejected": 0.005971987129984738,
"mean_token_accuracy": 0.4787629432976246,
"rewards/chosen": 4.273123002052307,
"rewards/rejected": -7.144606101512909,
"rewards/accuracies": 0.875,
"rewards/margins": 11.417729103565216,
"logps/chosen": -149.66920585632323,
"logps/rejected": -163.18242540359498,
"epoch": 1.8319999999999999,
"step": 115
},
{
"loss": 0.30124845504760744,
"grad_norm": 89.2537612915039,
"learning_rate": 1.8158425248197931e-06,
"entropy": 2.396760308742523,
"num_tokens": 754527.0,
"logits/chosen": -0.12405535128295105,
"logits/rejected": -0.04780259835323798,
"mean_token_accuracy": 0.4764955550432205,
"rewards/chosen": 4.300834584236145,
"rewards/rejected": -7.164772701263428,
"rewards/accuracies": 0.86875,
"rewards/margins": 11.465607309341431,
"logps/chosen": -151.86719579696654,
"logps/rejected": -157.59414463043214,
"epoch": 1.912,
"step": 120
},
{
"loss": 0.24916279315948486,
"grad_norm": 133.04541015625,
"learning_rate": 1.5968958345321178e-06,
"entropy": 2.4199918031692507,
"num_tokens": 823843.0,
"logits/chosen": -0.13994722177665678,
"logits/rejected": -0.04187930260754162,
"mean_token_accuracy": 0.4763185203075409,
"rewards/chosen": 4.19235634803772,
"rewards/rejected": -7.094201683998108,
"rewards/accuracies": 0.86875,
"rewards/margins": 11.286557984352111,
"logps/chosen": -145.3044916152954,
"logps/rejected": -156.23708686828613,
"epoch": 1.992,
"step": 125
},
{
"loss": 0.11149348020553589,
"grad_norm": 12.131107330322266,
"learning_rate": 1.3856541105586545e-06,
"entropy": 2.415849642621146,
"num_tokens": 880621.0,
"logits/chosen": -0.05668467466104803,
"logits/rejected": 0.011222639368738605,
"mean_token_accuracy": 0.4910110185543696,
"rewards/chosen": 6.9378207259707985,
"rewards/rejected": -10.694794721073574,
"rewards/accuracies": 0.9652777777777778,
"rewards/margins": 17.63261538081699,
"logps/chosen": -140.81739722357855,
"logps/rejected": -159.12346098158093,
"epoch": 2.064,
"step": 130
},
{
"loss": 0.055275356769561766,
"grad_norm": 49.40803146362305,
"learning_rate": 1.1839195928066101e-06,
"entropy": 2.393415144085884,
"num_tokens": 947062.0,
"logits/chosen": -0.06260905999738418,
"logits/rejected": 0.01862583566735894,
"mean_token_accuracy": 0.488899864256382,
"rewards/chosen": 6.641458833217621,
"rewards/rejected": -8.486654794216156,
"rewards/accuracies": 0.96875,
"rewards/margins": 15.128113627433777,
"logps/chosen": -145.67238521575928,
"logps/rejected": -158.00395879745483,
"epoch": 2.144,
"step": 135
},
{
"loss": 0.08347327113151551,
"grad_norm": 247.27073669433594,
"learning_rate": 9.934134090518593e-07,
"entropy": 2.3886053651571273,
"num_tokens": 1009620.0,
"logits/chosen": 0.015752432688678975,
"logits/rejected": 0.14565652903713386,
"mean_token_accuracy": 0.48201576992869377,
"rewards/chosen": 6.356861460208893,
"rewards/rejected": -9.22689858675003,
"rewards/accuracies": 0.9375,
"rewards/margins": 15.583760273456573,
"logps/chosen": -140.80859432220458,
"logps/rejected": -144.45258922576903,
"epoch": 2.224,
"step": 140
},
{
"loss": 0.043124151229858396,
"grad_norm": 53.45302200317383,
"learning_rate": 8.157608908836071e-07,
"entropy": 2.386504426598549,
"num_tokens": 1073365.0,
"logits/chosen": -0.020702211829369148,
"logits/rejected": 0.04769667472695908,
"mean_token_accuracy": 0.4906194917857647,
"rewards/chosen": 7.815622496604919,
"rewards/rejected": -10.351620376110077,
"rewards/accuracies": 0.96875,
"rewards/margins": 18.167242777347564,
"logps/chosen": -146.7426830291748,
"logps/rejected": -163.1491216659546,
"epoch": 2.304,
"step": 145
},
{
"loss": 0.043502068519592284,
"grad_norm": 58.150901794433594,
"learning_rate": 6.524777069483526e-07,
"entropy": 2.4140032857656477,
"num_tokens": 1145086.0,
"logits/chosen": -0.050803879241865094,
"logits/rejected": 0.016077080657433143,
"mean_token_accuracy": 0.47633846253156664,
"rewards/chosen": 8.080148875713348,
"rewards/rejected": -10.390690636634826,
"rewards/accuracies": 0.95625,
"rewards/margins": 18.47083934545517,
"logps/chosen": -149.95097274780272,
"logps/rejected": -170.474439907074,
"epoch": 2.384,
"step": 150
},
{
"eval_loss": 1.7026314735412598,
"eval_runtime": 206.5417,
"eval_samples_per_second": 4.842,
"eval_steps_per_second": 1.21,
"eval_entropy": 2.4216558537483217,
"eval_num_tokens": 1145086.0,
"eval_logits/chosen": -0.029028150294289495,
"eval_logits/rejected": 0.0280112105939085,
"eval_mean_token_accuracy": 0.46184870624542235,
"eval_rewards/chosen": -1.093953761100769,
"eval_rewards/rejected": -1.85626819896698,
"eval_rewards/accuracies": 0.548,
"eval_rewards/margins": 0.762314435005188,
"eval_logps/chosen": -162.54176181030275,
"eval_logps/rejected": -155.01175158691407,
"epoch": 2.384,
"step": 150
},
{
"loss": 0.04540476202964783,
"grad_norm": 64.46814727783203,
"learning_rate": 5.049569317994013e-07,
"entropy": 2.3098636120557785,
"num_tokens": 1213916.0,
"logits/chosen": -0.06188787605804125,
"logits/rejected": 0.027120160451300827,
"mean_token_accuracy": 0.494048598408699,
"rewards/chosen": 6.214471685886383,
"rewards/rejected": -9.97102323770523,
"rewards/accuracies": 0.95625,
"rewards/margins": 16.185495030879974,
"logps/chosen": -139.7538740158081,
"logps/rejected": -178.46554546356202,
"epoch": 2.464,
"step": 155
},
{
"loss": 0.049390339851379396,
"grad_norm": 68.03170013427734,
"learning_rate": 3.7445716067596506e-07,
"entropy": 2.409408602118492,
"num_tokens": 1277766.0,
"logits/chosen": -0.003306678294279577,
"logits/rejected": 0.18536064407876787,
"mean_token_accuracy": 0.4815196588635445,
"rewards/chosen": 6.468300366401673,
"rewards/rejected": -8.37518800497055,
"rewards/accuracies": 0.9625,
"rewards/margins": 14.843488407135009,
"logps/chosen": -129.7855330467224,
"logps/rejected": -140.2837603569031,
"epoch": 2.544,
"step": 160
},
{
"loss": 0.03415984511375427,
"grad_norm": 29.85422134399414,
"learning_rate": 2.620917716123444e-07,
"entropy": 2.373009890317917,
"num_tokens": 1344187.0,
"logits/chosen": -0.034215040255231824,
"logits/rejected": 0.003781206712556699,
"mean_token_accuracy": 0.49681628569960595,
"rewards/chosen": 6.034191703796386,
"rewards/rejected": -8.828164434432983,
"rewards/accuracies": 0.975,
"rewards/margins": 14.862355995178223,
"logps/chosen": -144.27701168060304,
"logps/rejected": -160.7808395385742,
"epoch": 2.624,
"step": 165
},
{
"loss": 0.039914682507514954,
"grad_norm": 31.656320571899414,
"learning_rate": 1.6881942648911077e-07,
"entropy": 2.4209450781345367,
"num_tokens": 1412024.0,
"logits/chosen": -0.020082851941010425,
"logits/rejected": 0.05684754955497793,
"mean_token_accuracy": 0.47963607460260393,
"rewards/chosen": 7.226568651199341,
"rewards/rejected": -11.922263181209564,
"rewards/accuracies": 0.9625,
"rewards/margins": 19.14883189201355,
"logps/chosen": -159.64463758468628,
"logps/rejected": -200.80445861816406,
"epoch": 2.7039999999999997,
"step": 170
},
{
"loss": 0.02738744020462036,
"grad_norm": 7.714607238769531,
"learning_rate": 9.54358920679524e-08,
"entropy": 2.398535707592964,
"num_tokens": 1479107.0,
"logits/chosen": -0.0991577681817519,
"logits/rejected": 0.04568099312173675,
"mean_token_accuracy": 0.4867618277668953,
"rewards/chosen": 9.70926661491394,
"rewards/rejected": -10.595936667919158,
"rewards/accuracies": 0.98125,
"rewards/margins": 20.305203425884248,
"logps/chosen": -163.36764631271362,
"logps/rejected": -165.54495639801024,
"epoch": 2.784,
"step": 175
},
{
"loss": 0.04212303757667542,
"grad_norm": 24.47334861755371,
"learning_rate": 4.256725079024554e-08,
"entropy": 2.4347573101520537,
"num_tokens": 1546945.0,
"logits/chosen": -0.02471525168225915,
"logits/rejected": 0.07145450971571757,
"mean_token_accuracy": 0.4759250283241272,
"rewards/chosen": 8.439748311042786,
"rewards/rejected": -8.140615552663803,
"rewards/accuracies": 0.96875,
"rewards/margins": 16.580363899469376,
"logps/chosen": -150.1224630355835,
"logps/rejected": -145.60447340011598,
"epoch": 2.864,
"step": 180
},
{
"loss": 0.0593170702457428,
"grad_norm": 11.518243789672852,
"learning_rate": 1.0664559262413831e-08,
"entropy": 2.3951420307159426,
"num_tokens": 1610498.0,
"logits/chosen": -0.04937423423232102,
"logits/rejected": 0.10506708711402735,
"mean_token_accuracy": 0.47507822662591936,
"rewards/chosen": 7.954719412326813,
"rewards/rejected": -8.796785068511962,
"rewards/accuracies": 0.9625,
"rewards/margins": 16.75150465965271,
"logps/chosen": -154.27819213867187,
"logps/rejected": -160.4699233055115,
"epoch": 2.944,
"step": 185
},
{
"eval_loss": 1.706053614616394,
"eval_runtime": 206.75,
"eval_samples_per_second": 4.837,
"eval_steps_per_second": 1.209,
"eval_entropy": 2.4251069741249083,
"eval_num_tokens": 1659568.0,
"eval_logits/chosen": -0.03056270304781408,
"eval_logits/rejected": 0.02707430725326769,
"eval_mean_token_accuracy": 0.4618482575416565,
"eval_rewards/chosen": -0.9163762617111206,
"eval_rewards/rejected": -1.668631679534912,
"eval_rewards/accuracies": 0.551,
"eval_rewards/margins": 0.7522554168701172,
"eval_logps/chosen": -162.3641845550537,
"eval_logps/rejected": -154.82411492919923,
"epoch": 3.0,
"step": 189
},
{
"train_runtime": 2671.7282,
"train_samples_per_second": 2.246,
"train_steps_per_second": 0.071,
"total_flos": 9840760918671360.0,
"train_loss": 0.09329431752363841,
"epoch": 3.0,
"step": 189
}
]

3
model.safetensors Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:fb241657c5572d29567211002e6de651a121d314ea0871bddcc26852419c9b30
size 1621370224

250557
tokenizer.json Normal file

File diff suppressed because it is too large Load Diff

14
tokenizer_config.json Normal file
View File

@@ -0,0 +1,14 @@
{
"add_prefix_space": false,
"backend": "tokenizers",
"bos_token": "<|endoftext|>",
"eos_token": "<|endoftext|>",
"errors": "replace",
"is_local": false,
"local_files_only": false,
"model_max_length": 1000000000000000019884624838656,
"pad_token": "<|padding|>",
"tokenizer_class": "GPTNeoXTokenizer",
"trim_offsets": true,
"unk_token": "<|endoftext|>"
}

3
training_args.bin Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:bd11bc38a7578d81a07965e3bcf4c5c3915b28f975b3660339cfa5e5be2c946a
size 5841