初始化项目,由ModelHub XC社区提供模型
Model: MusaKlair/pythia410m-dpo-beta0.5 Source: Original Platform
This commit is contained in:
35
.gitattributes
vendored
Normal file
35
.gitattributes
vendored
Normal file
@@ -0,0 +1,35 @@
|
||||
*.7z filter=lfs diff=lfs merge=lfs -text
|
||||
*.arrow filter=lfs diff=lfs merge=lfs -text
|
||||
*.bin filter=lfs diff=lfs merge=lfs -text
|
||||
*.bz2 filter=lfs diff=lfs merge=lfs -text
|
||||
*.ckpt filter=lfs diff=lfs merge=lfs -text
|
||||
*.ftz filter=lfs diff=lfs merge=lfs -text
|
||||
*.gz filter=lfs diff=lfs merge=lfs -text
|
||||
*.h5 filter=lfs diff=lfs merge=lfs -text
|
||||
*.joblib filter=lfs diff=lfs merge=lfs -text
|
||||
*.lfs.* filter=lfs diff=lfs merge=lfs -text
|
||||
*.mlmodel filter=lfs diff=lfs merge=lfs -text
|
||||
*.model filter=lfs diff=lfs merge=lfs -text
|
||||
*.msgpack filter=lfs diff=lfs merge=lfs -text
|
||||
*.npy filter=lfs diff=lfs merge=lfs -text
|
||||
*.npz filter=lfs diff=lfs merge=lfs -text
|
||||
*.onnx filter=lfs diff=lfs merge=lfs -text
|
||||
*.ot filter=lfs diff=lfs merge=lfs -text
|
||||
*.parquet filter=lfs diff=lfs merge=lfs -text
|
||||
*.pb filter=lfs diff=lfs merge=lfs -text
|
||||
*.pickle filter=lfs diff=lfs merge=lfs -text
|
||||
*.pkl filter=lfs diff=lfs merge=lfs -text
|
||||
*.pt filter=lfs diff=lfs merge=lfs -text
|
||||
*.pth filter=lfs diff=lfs merge=lfs -text
|
||||
*.rar filter=lfs diff=lfs merge=lfs -text
|
||||
*.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
|
||||
*.tar.* filter=lfs diff=lfs merge=lfs -text
|
||||
*.tar filter=lfs diff=lfs merge=lfs -text
|
||||
*.tflite filter=lfs diff=lfs merge=lfs -text
|
||||
*.tgz filter=lfs diff=lfs merge=lfs -text
|
||||
*.wasm filter=lfs diff=lfs merge=lfs -text
|
||||
*.xz filter=lfs diff=lfs merge=lfs -text
|
||||
*.zip filter=lfs diff=lfs merge=lfs -text
|
||||
*.zst filter=lfs diff=lfs merge=lfs -text
|
||||
*tfevents* filter=lfs diff=lfs merge=lfs -text
|
||||
69
README.md
Normal file
69
README.md
Normal file
@@ -0,0 +1,69 @@
|
||||
---
|
||||
base_model: EleutherAI/pythia-410m
|
||||
library_name: transformers
|
||||
model_name: pythia410m-dpo-beta0.5
|
||||
tags:
|
||||
- generated_from_trainer
|
||||
- dpo
|
||||
- trl
|
||||
licence: license
|
||||
---
|
||||
|
||||
# Model Card for pythia410m-dpo-beta0.5
|
||||
|
||||
This model is a fine-tuned version of [EleutherAI/pythia-410m](https://huggingface.co/EleutherAI/pythia-410m).
|
||||
It has been trained using [TRL](https://github.com/huggingface/trl).
|
||||
|
||||
## Quick start
|
||||
|
||||
```python
|
||||
from transformers import pipeline
|
||||
|
||||
question = "If you had a time machine, but could only go to the past or the future once and never return, which would you choose and why?"
|
||||
generator = pipeline("text-generation", model="None", device="cuda")
|
||||
output = generator([{"role": "user", "content": question}], max_new_tokens=128, return_full_text=False)[0]
|
||||
print(output["generated_text"])
|
||||
```
|
||||
|
||||
## Training procedure
|
||||
|
||||
|
||||
|
||||
|
||||
|
||||
This model was trained with DPO, a method introduced in [Direct Preference Optimization: Your Language Model is Secretly a Reward Model](https://huggingface.co/papers/2305.18290).
|
||||
|
||||
### Framework versions
|
||||
|
||||
- TRL: 1.7.1
|
||||
- Transformers: 5.13.0
|
||||
- Pytorch: 2.10.0+cu128
|
||||
- Datasets: 5.0.0
|
||||
- Tokenizers: 0.22.2
|
||||
|
||||
## Citations
|
||||
|
||||
Cite DPO as:
|
||||
|
||||
```bibtex
|
||||
@inproceedings{rafailov2023direct,
|
||||
title = {{Direct Preference Optimization: Your Language Model is Secretly a Reward Model}},
|
||||
author = {Rafael Rafailov and Archit Sharma and Eric Mitchell and Christopher D. Manning and Stefano Ermon and Chelsea Finn},
|
||||
year = 2023,
|
||||
booktitle = {Advances in Neural Information Processing Systems 36: Annual Conference on Neural Information Processing Systems 2023, NeurIPS 2023, New Orleans, LA, USA, December 10 - 16, 2023},
|
||||
url = {http://papers.nips.cc/paper_files/paper/2023/hash/a85b405ed65c6477a4fe8302b5e06ce7-Abstract-Conference.html},
|
||||
editor = {Alice Oh and Tristan Naumann and Amir Globerson and Kate Saenko and Moritz Hardt and Sergey Levine},
|
||||
}
|
||||
```
|
||||
|
||||
Cite TRL as:
|
||||
|
||||
```bibtex
|
||||
@software{vonwerra2020trl,
|
||||
title = {{TRL: Transformers Reinforcement Learning}},
|
||||
author = {von Werra, Leandro and Belkada, Younes and Tunstall, Lewis and Beeching, Edward and Thrush, Tristan and Lambert, Nathan and Huang, Shengyi and Rasul, Kashif and Gallouédec, Quentin},
|
||||
license = {Apache-2.0},
|
||||
url = {https://github.com/huggingface/trl},
|
||||
year = {2020}
|
||||
}
|
||||
```
|
||||
33
checkpoint-100/config.json
Normal file
33
checkpoint-100/config.json
Normal file
@@ -0,0 +1,33 @@
|
||||
{
|
||||
"architectures": [
|
||||
"GPTNeoXForCausalLM"
|
||||
],
|
||||
"attention_bias": true,
|
||||
"attention_dropout": 0.0,
|
||||
"bos_token_id": 0,
|
||||
"classifier_dropout": 0.1,
|
||||
"dtype": "float32",
|
||||
"eos_token_id": 0,
|
||||
"hidden_act": "gelu",
|
||||
"hidden_dropout": 0.0,
|
||||
"hidden_size": 1024,
|
||||
"initializer_range": 0.02,
|
||||
"intermediate_size": 4096,
|
||||
"is_decoder": false,
|
||||
"layer_norm_eps": 1e-05,
|
||||
"max_position_embeddings": 2048,
|
||||
"model_type": "gpt_neox",
|
||||
"num_attention_heads": 16,
|
||||
"num_hidden_layers": 24,
|
||||
"pad_token_id": 1,
|
||||
"rope_parameters": {
|
||||
"partial_rotary_factor": 0.25,
|
||||
"rope_theta": 10000,
|
||||
"rope_type": "default"
|
||||
},
|
||||
"tie_word_embeddings": false,
|
||||
"transformers_version": "5.13.0",
|
||||
"use_cache": false,
|
||||
"use_parallel_residual": true,
|
||||
"vocab_size": 50304
|
||||
}
|
||||
10
checkpoint-100/generation_config.json
Normal file
10
checkpoint-100/generation_config.json
Normal file
@@ -0,0 +1,10 @@
|
||||
{
|
||||
"_from_model_config": true,
|
||||
"bos_token_id": 0,
|
||||
"eos_token_id": [
|
||||
0
|
||||
],
|
||||
"pad_token_id": 1,
|
||||
"transformers_version": "5.13.0",
|
||||
"use_cache": true
|
||||
}
|
||||
3
checkpoint-100/model.safetensors
Normal file
3
checkpoint-100/model.safetensors
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:055a3448112764bd6a605ca9e666f1ae71f91da6f07c3694262a99fc98296995
|
||||
size 1621370224
|
||||
3
checkpoint-100/optimizer.pt
Normal file
3
checkpoint-100/optimizer.pt
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:f02c7e27cc59b981d9663c338fe8f468be67b7f4b0b1643a8533181e31276eee
|
||||
size 3242916491
|
||||
3
checkpoint-100/rng_state.pth
Normal file
3
checkpoint-100/rng_state.pth
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:718a0f3db00824213036a2c0441849791319b7d9cf189065873bb26a7020738e
|
||||
size 14645
|
||||
3
checkpoint-100/scaler.pt
Normal file
3
checkpoint-100/scaler.pt
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:c4393a84a3109995aa1202073b039b12062e3189ed89aa0b94ef0510ba843009
|
||||
size 1383
|
||||
3
checkpoint-100/scheduler.pt
Normal file
3
checkpoint-100/scheduler.pt
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:da6acab1199ce8b95be17924d67d35a7688c7036095034a44b256466f55879dc
|
||||
size 1465
|
||||
250557
checkpoint-100/tokenizer.json
Normal file
250557
checkpoint-100/tokenizer.json
Normal file
File diff suppressed because it is too large
Load Diff
14
checkpoint-100/tokenizer_config.json
Normal file
14
checkpoint-100/tokenizer_config.json
Normal file
@@ -0,0 +1,14 @@
|
||||
{
|
||||
"add_prefix_space": false,
|
||||
"backend": "tokenizers",
|
||||
"bos_token": "<|endoftext|>",
|
||||
"eos_token": "<|endoftext|>",
|
||||
"errors": "replace",
|
||||
"is_local": false,
|
||||
"local_files_only": false,
|
||||
"model_max_length": 1000000000000000019884624838656,
|
||||
"pad_token": "<|padding|>",
|
||||
"tokenizer_class": "GPTNeoXTokenizer",
|
||||
"trim_offsets": true,
|
||||
"unk_token": "<|endoftext|>"
|
||||
}
|
||||
451
checkpoint-100/trainer_state.json
Normal file
451
checkpoint-100/trainer_state.json
Normal file
@@ -0,0 +1,451 @@
|
||||
{
|
||||
"best_global_step": null,
|
||||
"best_metric": null,
|
||||
"best_model_checkpoint": null,
|
||||
"epoch": 1.592,
|
||||
"eval_steps": 50,
|
||||
"global_step": 100,
|
||||
"is_hyper_param_search": false,
|
||||
"is_local_process_zero": true,
|
||||
"is_world_process_zero": true,
|
||||
"log_history": [
|
||||
{
|
||||
"entropy": 2.555550271272659,
|
||||
"epoch": 0.08,
|
||||
"grad_norm": 175.83624267578125,
|
||||
"learning_rate": 2.8571428571428573e-06,
|
||||
"logits/chosen": 0.41239441768472307,
|
||||
"logits/rejected": 0.4313717963372231,
|
||||
"logps/chosen": -157.81461162567138,
|
||||
"logps/rejected": -150.4321650505066,
|
||||
"loss": 0.6844395637512207,
|
||||
"mean_token_accuracy": 0.45540447160601616,
|
||||
"num_tokens": 63280.0,
|
||||
"rewards/accuracies": 0.55,
|
||||
"rewards/chosen": 0.09316946864128113,
|
||||
"rewards/margins": 0.030635011196136475,
|
||||
"rewards/rejected": 0.06253445744514466,
|
||||
"step": 5
|
||||
},
|
||||
{
|
||||
"entropy": 2.584770825505257,
|
||||
"epoch": 0.16,
|
||||
"grad_norm": 275.8374938964844,
|
||||
"learning_rate": 4.984280524733107e-06,
|
||||
"logits/chosen": 0.23018057449154425,
|
||||
"logits/rejected": 0.4137123508420314,
|
||||
"logps/chosen": -160.37082138061524,
|
||||
"logps/rejected": -154.9328401565552,
|
||||
"loss": 0.848213005065918,
|
||||
"mean_token_accuracy": 0.4679958797991276,
|
||||
"num_tokens": 128751.0,
|
||||
"rewards/accuracies": 0.4625,
|
||||
"rewards/chosen": 0.06873167753219604,
|
||||
"rewards/margins": -0.08100449442863464,
|
||||
"rewards/rejected": 0.1497361719608307,
|
||||
"step": 10
|
||||
},
|
||||
{
|
||||
"entropy": 2.485997956991196,
|
||||
"epoch": 0.24,
|
||||
"grad_norm": 273.0233154296875,
|
||||
"learning_rate": 4.809698831278217e-06,
|
||||
"logits/chosen": 0.1816923364201413,
|
||||
"logits/rejected": 0.23945612540369207,
|
||||
"logps/chosen": -151.38499155044556,
|
||||
"logps/rejected": -163.4970989227295,
|
||||
"loss": 0.8470439910888672,
|
||||
"mean_token_accuracy": 0.4733552895486355,
|
||||
"num_tokens": 194142.0,
|
||||
"rewards/accuracies": 0.45,
|
||||
"rewards/chosen": -0.32968448400497435,
|
||||
"rewards/margins": 0.06030769646167755,
|
||||
"rewards/rejected": -0.3899921804666519,
|
||||
"step": 15
|
||||
},
|
||||
{
|
||||
"entropy": 2.5318914532661436,
|
||||
"epoch": 0.32,
|
||||
"grad_norm": 234.37681579589844,
|
||||
"learning_rate": 4.454578706170075e-06,
|
||||
"logits/chosen": 0.07677000825058375,
|
||||
"logits/rejected": 0.18887137972641857,
|
||||
"logps/chosen": -135.0070219039917,
|
||||
"logps/rejected": -135.28493957519532,
|
||||
"loss": 0.9311827659606934,
|
||||
"mean_token_accuracy": 0.4595716767013073,
|
||||
"num_tokens": 254871.0,
|
||||
"rewards/accuracies": 0.5375,
|
||||
"rewards/chosen": -0.7181475728750228,
|
||||
"rewards/margins": 0.2766463726758957,
|
||||
"rewards/rejected": -0.9947939455509186,
|
||||
"step": 20
|
||||
},
|
||||
{
|
||||
"entropy": 2.462447080016136,
|
||||
"epoch": 0.4,
|
||||
"grad_norm": 250.9570770263672,
|
||||
"learning_rate": 3.946678240449515e-06,
|
||||
"logits/chosen": 0.20993061968672994,
|
||||
"logits/rejected": 0.20386893310256043,
|
||||
"logps/chosen": -145.39961681365966,
|
||||
"logps/rejected": -137.4315857887268,
|
||||
"loss": 0.9580174446105957,
|
||||
"mean_token_accuracy": 0.45824490338563917,
|
||||
"num_tokens": 317752.0,
|
||||
"rewards/accuracies": 0.58125,
|
||||
"rewards/chosen": -0.7164888560771943,
|
||||
"rewards/margins": 0.16717674732208251,
|
||||
"rewards/rejected": -0.8836656033992767,
|
||||
"step": 25
|
||||
},
|
||||
{
|
||||
"entropy": 2.4387545943260194,
|
||||
"epoch": 0.48,
|
||||
"grad_norm": 316.4103088378906,
|
||||
"learning_rate": 3.3256976548879183e-06,
|
||||
"logits/chosen": 0.21743581064338796,
|
||||
"logits/rejected": 0.2765391890690152,
|
||||
"logps/chosen": -148.74287595748902,
|
||||
"logps/rejected": -147.26203107833862,
|
||||
"loss": 0.9910862922668457,
|
||||
"mean_token_accuracy": 0.4532994642853737,
|
||||
"num_tokens": 387452.0,
|
||||
"rewards/accuracies": 0.5125,
|
||||
"rewards/chosen": -0.2023364007472992,
|
||||
"rewards/margins": 0.1426894724369049,
|
||||
"rewards/rejected": -0.3450258731842041,
|
||||
"step": 30
|
||||
},
|
||||
{
|
||||
"entropy": 2.469076004624367,
|
||||
"epoch": 0.56,
|
||||
"grad_norm": 256.6429748535156,
|
||||
"learning_rate": 2.6401761180929798e-06,
|
||||
"logits/chosen": 0.18299585651420763,
|
||||
"logits/rejected": 0.250682400907656,
|
||||
"logps/chosen": -178.9021216392517,
|
||||
"logps/rejected": -171.8313166618347,
|
||||
"loss": 0.8882085800170898,
|
||||
"mean_token_accuracy": 0.47426797077059746,
|
||||
"num_tokens": 454873.0,
|
||||
"rewards/accuracies": 0.53125,
|
||||
"rewards/chosen": 0.1502027690410614,
|
||||
"rewards/margins": 0.38659809827804564,
|
||||
"rewards/rejected": -0.23639532923698425,
|
||||
"step": 35
|
||||
},
|
||||
{
|
||||
"entropy": 2.4749947816133497,
|
||||
"epoch": 0.64,
|
||||
"grad_norm": 248.1305694580078,
|
||||
"learning_rate": 1.9436976651092143e-06,
|
||||
"logits/chosen": 0.27816104129128527,
|
||||
"logits/rejected": 0.37676442462284854,
|
||||
"logps/chosen": -157.81686353683472,
|
||||
"logps/rejected": -158.98215370178224,
|
||||
"loss": 1.0146113395690919,
|
||||
"mean_token_accuracy": 0.465312571823597,
|
||||
"num_tokens": 518527.0,
|
||||
"rewards/accuracies": 0.55625,
|
||||
"rewards/chosen": 0.05624905824661255,
|
||||
"rewards/margins": 0.09228863418102265,
|
||||
"rewards/rejected": -0.036039575934410095,
|
||||
"step": 40
|
||||
},
|
||||
{
|
||||
"entropy": 2.409931382536888,
|
||||
"epoch": 0.72,
|
||||
"grad_norm": 219.939697265625,
|
||||
"learning_rate": 1.2907027822369006e-06,
|
||||
"logits/chosen": 0.2784307162908892,
|
||||
"logits/rejected": 0.3215469827251049,
|
||||
"logps/chosen": -153.8018159866333,
|
||||
"logps/rejected": -159.60495262145997,
|
||||
"loss": 0.921458625793457,
|
||||
"mean_token_accuracy": 0.4758016161620617,
|
||||
"num_tokens": 586496.0,
|
||||
"rewards/accuracies": 0.525,
|
||||
"rewards/chosen": 0.1898827075958252,
|
||||
"rewards/margins": 0.46674283146858214,
|
||||
"rewards/rejected": -0.27686012387275694,
|
||||
"step": 45
|
||||
},
|
||||
{
|
||||
"entropy": 2.4379068195819853,
|
||||
"epoch": 0.8,
|
||||
"grad_norm": 235.46241760253906,
|
||||
"learning_rate": 7.322330470336314e-07,
|
||||
"logits/chosen": 0.28584471002719647,
|
||||
"logits/rejected": 0.3651064125555795,
|
||||
"logps/chosen": -163.8307611465454,
|
||||
"logps/rejected": -163.46687126159668,
|
||||
"loss": 0.979340648651123,
|
||||
"mean_token_accuracy": 0.4653128065168858,
|
||||
"num_tokens": 659345.0,
|
||||
"rewards/accuracies": 0.5,
|
||||
"rewards/chosen": 0.16986804008483886,
|
||||
"rewards/margins": 0.1913771450519562,
|
||||
"rewards/rejected": -0.02150910496711731,
|
||||
"step": 50
|
||||
},
|
||||
{
|
||||
"epoch": 0.8,
|
||||
"eval_entropy": 2.5069966416358946,
|
||||
"eval_logits/chosen": 0.29315065189355716,
|
||||
"eval_logits/rejected": 0.348470281243937,
|
||||
"eval_logps/chosen": -161.13176106262208,
|
||||
"eval_logps/rejected": -153.30834275054931,
|
||||
"eval_loss": 0.9624814391136169,
|
||||
"eval_mean_token_accuracy": 0.4618878421783447,
|
||||
"eval_num_tokens": 659345.0,
|
||||
"eval_rewards/accuracies": 0.531,
|
||||
"eval_rewards/chosen": 0.1580237216949463,
|
||||
"eval_rewards/margins": 0.2344533715248108,
|
||||
"eval_rewards/rejected": -0.0764296498298645,
|
||||
"eval_runtime": 203.9137,
|
||||
"eval_samples_per_second": 4.904,
|
||||
"eval_steps_per_second": 1.226,
|
||||
"step": 50
|
||||
},
|
||||
{
|
||||
"entropy": 2.47237910926342,
|
||||
"epoch": 0.88,
|
||||
"grad_norm": 254.37533569335938,
|
||||
"learning_rate": 3.119414452281158e-07,
|
||||
"logits/chosen": 0.31621869752899623,
|
||||
"logits/rejected": 0.438719071421892,
|
||||
"logps/chosen": -148.24002447128296,
|
||||
"logps/rejected": -142.998854637146,
|
||||
"loss": 0.9957857131958008,
|
||||
"mean_token_accuracy": 0.47029968202114103,
|
||||
"num_tokens": 731475.0,
|
||||
"rewards/accuracies": 0.59375,
|
||||
"rewards/chosen": 0.2521739423274994,
|
||||
"rewards/margins": 0.1846893012523651,
|
||||
"rewards/rejected": 0.06748464107513427,
|
||||
"step": 55
|
||||
},
|
||||
{
|
||||
"entropy": 2.4306333363056183,
|
||||
"epoch": 0.96,
|
||||
"grad_norm": 226.28863525390625,
|
||||
"learning_rate": 6.268021954544095e-08,
|
||||
"logits/chosen": 0.27655188516120244,
|
||||
"logits/rejected": 0.40121284602477314,
|
||||
"logps/chosen": -156.78616828918456,
|
||||
"logps/rejected": -163.7671283721924,
|
||||
"loss": 0.8905390739440918,
|
||||
"mean_token_accuracy": 0.4723482772707939,
|
||||
"num_tokens": 797757.0,
|
||||
"rewards/accuracies": 0.5125,
|
||||
"rewards/chosen": 0.2607013940811157,
|
||||
"rewards/margins": 0.30302430391311647,
|
||||
"rewards/rejected": -0.04232290983200073,
|
||||
"step": 60
|
||||
},
|
||||
{
|
||||
"epoch": 1.0,
|
||||
"eval_entropy": 2.5108700938224793,
|
||||
"eval_logits/chosen": 0.2960853689074952,
|
||||
"eval_logits/rejected": 0.35102944673757674,
|
||||
"eval_logps/chosen": -161.2097156829834,
|
||||
"eval_logps/rejected": -153.38722127532958,
|
||||
"eval_loss": 0.9581051468849182,
|
||||
"eval_mean_token_accuracy": 0.4621651805639267,
|
||||
"eval_num_tokens": 829784.0,
|
||||
"eval_rewards/accuracies": 0.532,
|
||||
"eval_rewards/chosen": 0.11904637241363525,
|
||||
"eval_rewards/margins": 0.23491560649871826,
|
||||
"eval_rewards/rejected": -0.11586923408508301,
|
||||
"eval_runtime": 204.736,
|
||||
"eval_samples_per_second": 4.884,
|
||||
"eval_steps_per_second": 1.221,
|
||||
"step": 63
|
||||
},
|
||||
{
|
||||
"entropy": 2.4772405922412872,
|
||||
"epoch": 1.032,
|
||||
"grad_norm": 70.3385238647461,
|
||||
"learning_rate": 4.184239109116393e-06,
|
||||
"logits/chosen": 0.29999179148367466,
|
||||
"logits/rejected": 0.3366013686931765,
|
||||
"logps/chosen": -145.2724313735962,
|
||||
"logps/rejected": -168.38544821739197,
|
||||
"loss": 0.20300202071666718,
|
||||
"mean_token_accuracy": 0.4766918160021305,
|
||||
"num_tokens": 27180.0,
|
||||
"rewards/accuracies": 0.84375,
|
||||
"rewards/chosen": 3.185014322400093,
|
||||
"rewards/margins": 6.363163933157921,
|
||||
"rewards/rejected": -3.17814964056015,
|
||||
"step": 65
|
||||
},
|
||||
{
|
||||
"entropy": 2.5059203624725344,
|
||||
"epoch": 1.112,
|
||||
"grad_norm": 46.46247482299805,
|
||||
"learning_rate": 4.006586590948141e-06,
|
||||
"logits/chosen": 0.30248451255827935,
|
||||
"logits/rejected": 0.4369742989935694,
|
||||
"logps/chosen": -151.66757192611695,
|
||||
"logps/rejected": -152.82527809143068,
|
||||
"loss": 0.16016263961791993,
|
||||
"mean_token_accuracy": 0.48107142075896264,
|
||||
"num_tokens": 86611.0,
|
||||
"rewards/accuracies": 0.93125,
|
||||
"rewards/chosen": 3.108510234951973,
|
||||
"rewards/margins": 6.6764221549034115,
|
||||
"rewards/rejected": -3.5679119408130644,
|
||||
"step": 70
|
||||
},
|
||||
{
|
||||
"entropy": 2.5288314819335938,
|
||||
"epoch": 1.192,
|
||||
"grad_norm": 112.07616424560547,
|
||||
"learning_rate": 3.81608040719339e-06,
|
||||
"logits/chosen": 0.3381024272346584,
|
||||
"logits/rejected": 0.3919709001428062,
|
||||
"logps/chosen": -151.99142513275146,
|
||||
"logps/rejected": -158.68587474823,
|
||||
"loss": 0.1984729766845703,
|
||||
"mean_token_accuracy": 0.47099064812064173,
|
||||
"num_tokens": 153056.0,
|
||||
"rewards/accuracies": 0.88125,
|
||||
"rewards/chosen": 2.1314487934112547,
|
||||
"rewards/margins": 5.91470921933651,
|
||||
"rewards/rejected": -3.7832603842020034,
|
||||
"step": 75
|
||||
},
|
||||
{
|
||||
"entropy": 2.5066609025001525,
|
||||
"epoch": 1.272,
|
||||
"grad_norm": 47.97988510131836,
|
||||
"learning_rate": 3.6143458894413463e-06,
|
||||
"logits/chosen": 0.25372562736194504,
|
||||
"logits/rejected": 0.3085220085200435,
|
||||
"logps/chosen": -127.87930164337158,
|
||||
"logps/rejected": -152.39403762817383,
|
||||
"loss": 0.17381094694137572,
|
||||
"mean_token_accuracy": 0.47169380336999894,
|
||||
"num_tokens": 215920.0,
|
||||
"rewards/accuracies": 0.9375,
|
||||
"rewards/chosen": 2.709118887782097,
|
||||
"rewards/margins": 5.862504243850708,
|
||||
"rewards/rejected": -3.153385379910469,
|
||||
"step": 80
|
||||
},
|
||||
{
|
||||
"entropy": 2.42382150888443,
|
||||
"epoch": 1.3519999999999999,
|
||||
"grad_norm": 76.58686065673828,
|
||||
"learning_rate": 3.403104165467883e-06,
|
||||
"logits/chosen": 0.27046587254706894,
|
||||
"logits/rejected": 0.3554108506103396,
|
||||
"logps/chosen": -135.95888204574584,
|
||||
"logps/rejected": -156.9404288291931,
|
||||
"loss": 0.17821238040924073,
|
||||
"mean_token_accuracy": 0.49741546660661695,
|
||||
"num_tokens": 287127.0,
|
||||
"rewards/accuracies": 0.91875,
|
||||
"rewards/chosen": 3.4181615144014357,
|
||||
"rewards/margins": 7.317546558380127,
|
||||
"rewards/rejected": -3.8993850499391556,
|
||||
"step": 85
|
||||
},
|
||||
{
|
||||
"entropy": 2.5261152565479277,
|
||||
"epoch": 1.432,
|
||||
"grad_norm": 80.35875701904297,
|
||||
"learning_rate": 3.184157475180208e-06,
|
||||
"logits/chosen": 0.2524602257174569,
|
||||
"logits/rejected": 0.30296234191214516,
|
||||
"logps/chosen": -156.0525354385376,
|
||||
"logps/rejected": -149.48046531677247,
|
||||
"loss": 0.23036706447601318,
|
||||
"mean_token_accuracy": 0.46826066076755524,
|
||||
"num_tokens": 354068.0,
|
||||
"rewards/accuracies": 0.89375,
|
||||
"rewards/chosen": 3.04692747592926,
|
||||
"rewards/margins": 5.816668316721916,
|
||||
"rewards/rejected": -2.7697408348321915,
|
||||
"step": 90
|
||||
},
|
||||
{
|
||||
"entropy": 2.4211883395910263,
|
||||
"epoch": 1.512,
|
||||
"grad_norm": 53.557090759277344,
|
||||
"learning_rate": 2.9593737945414264e-06,
|
||||
"logits/chosen": 0.17738279076359578,
|
||||
"logits/rejected": 0.17275444698543332,
|
||||
"logps/chosen": -135.7138165473938,
|
||||
"logps/rejected": -157.41348686218262,
|
||||
"loss": 0.16570401191711426,
|
||||
"mean_token_accuracy": 0.4731420993804932,
|
||||
"num_tokens": 421426.0,
|
||||
"rewards/accuracies": 0.89375,
|
||||
"rewards/chosen": 2.8382038921117783,
|
||||
"rewards/margins": 6.569511443376541,
|
||||
"rewards/rejected": -3.731307566165924,
|
||||
"step": 95
|
||||
},
|
||||
{
|
||||
"entropy": 2.341481050848961,
|
||||
"epoch": 1.592,
|
||||
"grad_norm": 127.4275131225586,
|
||||
"learning_rate": 2.730670898658255e-06,
|
||||
"logits/chosen": -0.04766494180334789,
|
||||
"logits/rejected": 0.09169179261277503,
|
||||
"logps/chosen": -153.73596954345703,
|
||||
"logps/rejected": -152.93934383392335,
|
||||
"loss": 0.1649105429649353,
|
||||
"mean_token_accuracy": 0.4882186971604824,
|
||||
"num_tokens": 489806.0,
|
||||
"rewards/accuracies": 0.9125,
|
||||
"rewards/chosen": 3.46675723195076,
|
||||
"rewards/margins": 6.959583753347397,
|
||||
"rewards/rejected": -3.4928264021873474,
|
||||
"step": 100
|
||||
},
|
||||
{
|
||||
"epoch": 1.592,
|
||||
"eval_entropy": 2.3993507494926454,
|
||||
"eval_logits/chosen": -0.03254038471881061,
|
||||
"eval_logits/rejected": 0.02311345798919562,
|
||||
"eval_logps/chosen": -161.87789566040038,
|
||||
"eval_logps/rejected": -154.16960359954834,
|
||||
"eval_loss": 1.181304931640625,
|
||||
"eval_mean_token_accuracy": 0.4609604501724243,
|
||||
"eval_num_tokens": 489806.0,
|
||||
"eval_rewards/accuracies": 0.516,
|
||||
"eval_rewards/chosen": -0.21504417657852173,
|
||||
"eval_rewards/margins": 0.29201573705673217,
|
||||
"eval_rewards/rejected": -0.5070599136352539,
|
||||
"eval_runtime": 206.6722,
|
||||
"eval_samples_per_second": 4.839,
|
||||
"eval_steps_per_second": 1.21,
|
||||
"step": 100
|
||||
}
|
||||
],
|
||||
"logging_steps": 5,
|
||||
"max_steps": 189,
|
||||
"num_input_tokens_seen": 0,
|
||||
"num_train_epochs": 3,
|
||||
"save_steps": 100,
|
||||
"stateful_callbacks": {
|
||||
"TrainerControl": {
|
||||
"args": {
|
||||
"should_epoch_stop": false,
|
||||
"should_evaluate": false,
|
||||
"should_log": false,
|
||||
"should_save": true,
|
||||
"should_training_stop": false
|
||||
},
|
||||
"attributes": {}
|
||||
}
|
||||
},
|
||||
"total_flos": 5237912290590720.0,
|
||||
"train_batch_size": 4,
|
||||
"trial_name": null,
|
||||
"trial_params": null
|
||||
}
|
||||
3
checkpoint-100/training_args.bin
Normal file
3
checkpoint-100/training_args.bin
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:3990be1fe7ba3aac1d4d439514f84255e14a6f8b94b6ea9e4d8615fab866635a
|
||||
size 5841
|
||||
33
checkpoint-189/config.json
Normal file
33
checkpoint-189/config.json
Normal file
@@ -0,0 +1,33 @@
|
||||
{
|
||||
"architectures": [
|
||||
"GPTNeoXForCausalLM"
|
||||
],
|
||||
"attention_bias": true,
|
||||
"attention_dropout": 0.0,
|
||||
"bos_token_id": 0,
|
||||
"classifier_dropout": 0.1,
|
||||
"dtype": "float32",
|
||||
"eos_token_id": 0,
|
||||
"hidden_act": "gelu",
|
||||
"hidden_dropout": 0.0,
|
||||
"hidden_size": 1024,
|
||||
"initializer_range": 0.02,
|
||||
"intermediate_size": 4096,
|
||||
"is_decoder": false,
|
||||
"layer_norm_eps": 1e-05,
|
||||
"max_position_embeddings": 2048,
|
||||
"model_type": "gpt_neox",
|
||||
"num_attention_heads": 16,
|
||||
"num_hidden_layers": 24,
|
||||
"pad_token_id": 1,
|
||||
"rope_parameters": {
|
||||
"partial_rotary_factor": 0.25,
|
||||
"rope_theta": 10000,
|
||||
"rope_type": "default"
|
||||
},
|
||||
"tie_word_embeddings": false,
|
||||
"transformers_version": "5.13.0",
|
||||
"use_cache": false,
|
||||
"use_parallel_residual": true,
|
||||
"vocab_size": 50304
|
||||
}
|
||||
10
checkpoint-189/generation_config.json
Normal file
10
checkpoint-189/generation_config.json
Normal file
@@ -0,0 +1,10 @@
|
||||
{
|
||||
"_from_model_config": true,
|
||||
"bos_token_id": 0,
|
||||
"eos_token_id": [
|
||||
0
|
||||
],
|
||||
"pad_token_id": 1,
|
||||
"transformers_version": "5.13.0",
|
||||
"use_cache": true
|
||||
}
|
||||
3
checkpoint-189/model.safetensors
Normal file
3
checkpoint-189/model.safetensors
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:cb5672dbc1c652d718f4df253689dc43e6069b8d1da2fe0c50ca19a54673c3b1
|
||||
size 1621370224
|
||||
3
checkpoint-189/optimizer.pt
Normal file
3
checkpoint-189/optimizer.pt
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:04f9aea91f4260fc4fc29a1ec0e83de8633c4059d1623861e93ac8ac97b83c83
|
||||
size 3242916491
|
||||
3
checkpoint-189/rng_state.pth
Normal file
3
checkpoint-189/rng_state.pth
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:fdc37bbd2e979f041dfbbb004a5c74bab6cdda159cb18116df728588515a9ef6
|
||||
size 14645
|
||||
3
checkpoint-189/scaler.pt
Normal file
3
checkpoint-189/scaler.pt
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:49f6bef68f1a79850e9c094ae1ada2d209bb00bda2944425e211ef8d4b2d7e85
|
||||
size 1383
|
||||
3
checkpoint-189/scheduler.pt
Normal file
3
checkpoint-189/scheduler.pt
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:315777cdc55fe9505686ba500aff0de04b86af28c9ef728058b9b40c43f12bd4
|
||||
size 1465
|
||||
250557
checkpoint-189/tokenizer.json
Normal file
250557
checkpoint-189/tokenizer.json
Normal file
File diff suppressed because it is too large
Load Diff
14
checkpoint-189/tokenizer_config.json
Normal file
14
checkpoint-189/tokenizer_config.json
Normal file
@@ -0,0 +1,14 @@
|
||||
{
|
||||
"add_prefix_space": false,
|
||||
"backend": "tokenizers",
|
||||
"bos_token": "<|endoftext|>",
|
||||
"eos_token": "<|endoftext|>",
|
||||
"errors": "replace",
|
||||
"is_local": false,
|
||||
"local_files_only": false,
|
||||
"model_max_length": 1000000000000000019884624838656,
|
||||
"pad_token": "<|padding|>",
|
||||
"tokenizer_class": "GPTNeoXTokenizer",
|
||||
"trim_offsets": true,
|
||||
"unk_token": "<|endoftext|>"
|
||||
}
|
||||
795
checkpoint-189/trainer_state.json
Normal file
795
checkpoint-189/trainer_state.json
Normal file
@@ -0,0 +1,795 @@
|
||||
{
|
||||
"best_global_step": null,
|
||||
"best_metric": null,
|
||||
"best_model_checkpoint": null,
|
||||
"epoch": 3.0,
|
||||
"eval_steps": 50,
|
||||
"global_step": 189,
|
||||
"is_hyper_param_search": false,
|
||||
"is_local_process_zero": true,
|
||||
"is_world_process_zero": true,
|
||||
"log_history": [
|
||||
{
|
||||
"entropy": 2.555550271272659,
|
||||
"epoch": 0.08,
|
||||
"grad_norm": 175.83624267578125,
|
||||
"learning_rate": 2.8571428571428573e-06,
|
||||
"logits/chosen": 0.41239441768472307,
|
||||
"logits/rejected": 0.4313717963372231,
|
||||
"logps/chosen": -157.81461162567138,
|
||||
"logps/rejected": -150.4321650505066,
|
||||
"loss": 0.6844395637512207,
|
||||
"mean_token_accuracy": 0.45540447160601616,
|
||||
"num_tokens": 63280.0,
|
||||
"rewards/accuracies": 0.55,
|
||||
"rewards/chosen": 0.09316946864128113,
|
||||
"rewards/margins": 0.030635011196136475,
|
||||
"rewards/rejected": 0.06253445744514466,
|
||||
"step": 5
|
||||
},
|
||||
{
|
||||
"entropy": 2.584770825505257,
|
||||
"epoch": 0.16,
|
||||
"grad_norm": 275.8374938964844,
|
||||
"learning_rate": 4.984280524733107e-06,
|
||||
"logits/chosen": 0.23018057449154425,
|
||||
"logits/rejected": 0.4137123508420314,
|
||||
"logps/chosen": -160.37082138061524,
|
||||
"logps/rejected": -154.9328401565552,
|
||||
"loss": 0.848213005065918,
|
||||
"mean_token_accuracy": 0.4679958797991276,
|
||||
"num_tokens": 128751.0,
|
||||
"rewards/accuracies": 0.4625,
|
||||
"rewards/chosen": 0.06873167753219604,
|
||||
"rewards/margins": -0.08100449442863464,
|
||||
"rewards/rejected": 0.1497361719608307,
|
||||
"step": 10
|
||||
},
|
||||
{
|
||||
"entropy": 2.485997956991196,
|
||||
"epoch": 0.24,
|
||||
"grad_norm": 273.0233154296875,
|
||||
"learning_rate": 4.809698831278217e-06,
|
||||
"logits/chosen": 0.1816923364201413,
|
||||
"logits/rejected": 0.23945612540369207,
|
||||
"logps/chosen": -151.38499155044556,
|
||||
"logps/rejected": -163.4970989227295,
|
||||
"loss": 0.8470439910888672,
|
||||
"mean_token_accuracy": 0.4733552895486355,
|
||||
"num_tokens": 194142.0,
|
||||
"rewards/accuracies": 0.45,
|
||||
"rewards/chosen": -0.32968448400497435,
|
||||
"rewards/margins": 0.06030769646167755,
|
||||
"rewards/rejected": -0.3899921804666519,
|
||||
"step": 15
|
||||
},
|
||||
{
|
||||
"entropy": 2.5318914532661436,
|
||||
"epoch": 0.32,
|
||||
"grad_norm": 234.37681579589844,
|
||||
"learning_rate": 4.454578706170075e-06,
|
||||
"logits/chosen": 0.07677000825058375,
|
||||
"logits/rejected": 0.18887137972641857,
|
||||
"logps/chosen": -135.0070219039917,
|
||||
"logps/rejected": -135.28493957519532,
|
||||
"loss": 0.9311827659606934,
|
||||
"mean_token_accuracy": 0.4595716767013073,
|
||||
"num_tokens": 254871.0,
|
||||
"rewards/accuracies": 0.5375,
|
||||
"rewards/chosen": -0.7181475728750228,
|
||||
"rewards/margins": 0.2766463726758957,
|
||||
"rewards/rejected": -0.9947939455509186,
|
||||
"step": 20
|
||||
},
|
||||
{
|
||||
"entropy": 2.462447080016136,
|
||||
"epoch": 0.4,
|
||||
"grad_norm": 250.9570770263672,
|
||||
"learning_rate": 3.946678240449515e-06,
|
||||
"logits/chosen": 0.20993061968672994,
|
||||
"logits/rejected": 0.20386893310256043,
|
||||
"logps/chosen": -145.39961681365966,
|
||||
"logps/rejected": -137.4315857887268,
|
||||
"loss": 0.9580174446105957,
|
||||
"mean_token_accuracy": 0.45824490338563917,
|
||||
"num_tokens": 317752.0,
|
||||
"rewards/accuracies": 0.58125,
|
||||
"rewards/chosen": -0.7164888560771943,
|
||||
"rewards/margins": 0.16717674732208251,
|
||||
"rewards/rejected": -0.8836656033992767,
|
||||
"step": 25
|
||||
},
|
||||
{
|
||||
"entropy": 2.4387545943260194,
|
||||
"epoch": 0.48,
|
||||
"grad_norm": 316.4103088378906,
|
||||
"learning_rate": 3.3256976548879183e-06,
|
||||
"logits/chosen": 0.21743581064338796,
|
||||
"logits/rejected": 0.2765391890690152,
|
||||
"logps/chosen": -148.74287595748902,
|
||||
"logps/rejected": -147.26203107833862,
|
||||
"loss": 0.9910862922668457,
|
||||
"mean_token_accuracy": 0.4532994642853737,
|
||||
"num_tokens": 387452.0,
|
||||
"rewards/accuracies": 0.5125,
|
||||
"rewards/chosen": -0.2023364007472992,
|
||||
"rewards/margins": 0.1426894724369049,
|
||||
"rewards/rejected": -0.3450258731842041,
|
||||
"step": 30
|
||||
},
|
||||
{
|
||||
"entropy": 2.469076004624367,
|
||||
"epoch": 0.56,
|
||||
"grad_norm": 256.6429748535156,
|
||||
"learning_rate": 2.6401761180929798e-06,
|
||||
"logits/chosen": 0.18299585651420763,
|
||||
"logits/rejected": 0.250682400907656,
|
||||
"logps/chosen": -178.9021216392517,
|
||||
"logps/rejected": -171.8313166618347,
|
||||
"loss": 0.8882085800170898,
|
||||
"mean_token_accuracy": 0.47426797077059746,
|
||||
"num_tokens": 454873.0,
|
||||
"rewards/accuracies": 0.53125,
|
||||
"rewards/chosen": 0.1502027690410614,
|
||||
"rewards/margins": 0.38659809827804564,
|
||||
"rewards/rejected": -0.23639532923698425,
|
||||
"step": 35
|
||||
},
|
||||
{
|
||||
"entropy": 2.4749947816133497,
|
||||
"epoch": 0.64,
|
||||
"grad_norm": 248.1305694580078,
|
||||
"learning_rate": 1.9436976651092143e-06,
|
||||
"logits/chosen": 0.27816104129128527,
|
||||
"logits/rejected": 0.37676442462284854,
|
||||
"logps/chosen": -157.81686353683472,
|
||||
"logps/rejected": -158.98215370178224,
|
||||
"loss": 1.0146113395690919,
|
||||
"mean_token_accuracy": 0.465312571823597,
|
||||
"num_tokens": 518527.0,
|
||||
"rewards/accuracies": 0.55625,
|
||||
"rewards/chosen": 0.05624905824661255,
|
||||
"rewards/margins": 0.09228863418102265,
|
||||
"rewards/rejected": -0.036039575934410095,
|
||||
"step": 40
|
||||
},
|
||||
{
|
||||
"entropy": 2.409931382536888,
|
||||
"epoch": 0.72,
|
||||
"grad_norm": 219.939697265625,
|
||||
"learning_rate": 1.2907027822369006e-06,
|
||||
"logits/chosen": 0.2784307162908892,
|
||||
"logits/rejected": 0.3215469827251049,
|
||||
"logps/chosen": -153.8018159866333,
|
||||
"logps/rejected": -159.60495262145997,
|
||||
"loss": 0.921458625793457,
|
||||
"mean_token_accuracy": 0.4758016161620617,
|
||||
"num_tokens": 586496.0,
|
||||
"rewards/accuracies": 0.525,
|
||||
"rewards/chosen": 0.1898827075958252,
|
||||
"rewards/margins": 0.46674283146858214,
|
||||
"rewards/rejected": -0.27686012387275694,
|
||||
"step": 45
|
||||
},
|
||||
{
|
||||
"entropy": 2.4379068195819853,
|
||||
"epoch": 0.8,
|
||||
"grad_norm": 235.46241760253906,
|
||||
"learning_rate": 7.322330470336314e-07,
|
||||
"logits/chosen": 0.28584471002719647,
|
||||
"logits/rejected": 0.3651064125555795,
|
||||
"logps/chosen": -163.8307611465454,
|
||||
"logps/rejected": -163.46687126159668,
|
||||
"loss": 0.979340648651123,
|
||||
"mean_token_accuracy": 0.4653128065168858,
|
||||
"num_tokens": 659345.0,
|
||||
"rewards/accuracies": 0.5,
|
||||
"rewards/chosen": 0.16986804008483886,
|
||||
"rewards/margins": 0.1913771450519562,
|
||||
"rewards/rejected": -0.02150910496711731,
|
||||
"step": 50
|
||||
},
|
||||
{
|
||||
"epoch": 0.8,
|
||||
"eval_entropy": 2.5069966416358946,
|
||||
"eval_logits/chosen": 0.29315065189355716,
|
||||
"eval_logits/rejected": 0.348470281243937,
|
||||
"eval_logps/chosen": -161.13176106262208,
|
||||
"eval_logps/rejected": -153.30834275054931,
|
||||
"eval_loss": 0.9624814391136169,
|
||||
"eval_mean_token_accuracy": 0.4618878421783447,
|
||||
"eval_num_tokens": 659345.0,
|
||||
"eval_rewards/accuracies": 0.531,
|
||||
"eval_rewards/chosen": 0.1580237216949463,
|
||||
"eval_rewards/margins": 0.2344533715248108,
|
||||
"eval_rewards/rejected": -0.0764296498298645,
|
||||
"eval_runtime": 203.9137,
|
||||
"eval_samples_per_second": 4.904,
|
||||
"eval_steps_per_second": 1.226,
|
||||
"step": 50
|
||||
},
|
||||
{
|
||||
"entropy": 2.47237910926342,
|
||||
"epoch": 0.88,
|
||||
"grad_norm": 254.37533569335938,
|
||||
"learning_rate": 3.119414452281158e-07,
|
||||
"logits/chosen": 0.31621869752899623,
|
||||
"logits/rejected": 0.438719071421892,
|
||||
"logps/chosen": -148.24002447128296,
|
||||
"logps/rejected": -142.998854637146,
|
||||
"loss": 0.9957857131958008,
|
||||
"mean_token_accuracy": 0.47029968202114103,
|
||||
"num_tokens": 731475.0,
|
||||
"rewards/accuracies": 0.59375,
|
||||
"rewards/chosen": 0.2521739423274994,
|
||||
"rewards/margins": 0.1846893012523651,
|
||||
"rewards/rejected": 0.06748464107513427,
|
||||
"step": 55
|
||||
},
|
||||
{
|
||||
"entropy": 2.4306333363056183,
|
||||
"epoch": 0.96,
|
||||
"grad_norm": 226.28863525390625,
|
||||
"learning_rate": 6.268021954544095e-08,
|
||||
"logits/chosen": 0.27655188516120244,
|
||||
"logits/rejected": 0.40121284602477314,
|
||||
"logps/chosen": -156.78616828918456,
|
||||
"logps/rejected": -163.7671283721924,
|
||||
"loss": 0.8905390739440918,
|
||||
"mean_token_accuracy": 0.4723482772707939,
|
||||
"num_tokens": 797757.0,
|
||||
"rewards/accuracies": 0.5125,
|
||||
"rewards/chosen": 0.2607013940811157,
|
||||
"rewards/margins": 0.30302430391311647,
|
||||
"rewards/rejected": -0.04232290983200073,
|
||||
"step": 60
|
||||
},
|
||||
{
|
||||
"epoch": 1.0,
|
||||
"eval_entropy": 2.5108700938224793,
|
||||
"eval_logits/chosen": 0.2960853689074952,
|
||||
"eval_logits/rejected": 0.35102944673757674,
|
||||
"eval_logps/chosen": -161.2097156829834,
|
||||
"eval_logps/rejected": -153.38722127532958,
|
||||
"eval_loss": 0.9581051468849182,
|
||||
"eval_mean_token_accuracy": 0.4621651805639267,
|
||||
"eval_num_tokens": 829784.0,
|
||||
"eval_rewards/accuracies": 0.532,
|
||||
"eval_rewards/chosen": 0.11904637241363525,
|
||||
"eval_rewards/margins": 0.23491560649871826,
|
||||
"eval_rewards/rejected": -0.11586923408508301,
|
||||
"eval_runtime": 204.736,
|
||||
"eval_samples_per_second": 4.884,
|
||||
"eval_steps_per_second": 1.221,
|
||||
"step": 63
|
||||
},
|
||||
{
|
||||
"entropy": 2.4772405922412872,
|
||||
"epoch": 1.032,
|
||||
"grad_norm": 70.3385238647461,
|
||||
"learning_rate": 4.184239109116393e-06,
|
||||
"logits/chosen": 0.29999179148367466,
|
||||
"logits/rejected": 0.3366013686931765,
|
||||
"logps/chosen": -145.2724313735962,
|
||||
"logps/rejected": -168.38544821739197,
|
||||
"loss": 0.20300202071666718,
|
||||
"mean_token_accuracy": 0.4766918160021305,
|
||||
"num_tokens": 27180.0,
|
||||
"rewards/accuracies": 0.84375,
|
||||
"rewards/chosen": 3.185014322400093,
|
||||
"rewards/margins": 6.363163933157921,
|
||||
"rewards/rejected": -3.17814964056015,
|
||||
"step": 65
|
||||
},
|
||||
{
|
||||
"entropy": 2.5059203624725344,
|
||||
"epoch": 1.112,
|
||||
"grad_norm": 46.46247482299805,
|
||||
"learning_rate": 4.006586590948141e-06,
|
||||
"logits/chosen": 0.30248451255827935,
|
||||
"logits/rejected": 0.4369742989935694,
|
||||
"logps/chosen": -151.66757192611695,
|
||||
"logps/rejected": -152.82527809143068,
|
||||
"loss": 0.16016263961791993,
|
||||
"mean_token_accuracy": 0.48107142075896264,
|
||||
"num_tokens": 86611.0,
|
||||
"rewards/accuracies": 0.93125,
|
||||
"rewards/chosen": 3.108510234951973,
|
||||
"rewards/margins": 6.6764221549034115,
|
||||
"rewards/rejected": -3.5679119408130644,
|
||||
"step": 70
|
||||
},
|
||||
{
|
||||
"entropy": 2.5288314819335938,
|
||||
"epoch": 1.192,
|
||||
"grad_norm": 112.07616424560547,
|
||||
"learning_rate": 3.81608040719339e-06,
|
||||
"logits/chosen": 0.3381024272346584,
|
||||
"logits/rejected": 0.3919709001428062,
|
||||
"logps/chosen": -151.99142513275146,
|
||||
"logps/rejected": -158.68587474823,
|
||||
"loss": 0.1984729766845703,
|
||||
"mean_token_accuracy": 0.47099064812064173,
|
||||
"num_tokens": 153056.0,
|
||||
"rewards/accuracies": 0.88125,
|
||||
"rewards/chosen": 2.1314487934112547,
|
||||
"rewards/margins": 5.91470921933651,
|
||||
"rewards/rejected": -3.7832603842020034,
|
||||
"step": 75
|
||||
},
|
||||
{
|
||||
"entropy": 2.5066609025001525,
|
||||
"epoch": 1.272,
|
||||
"grad_norm": 47.97988510131836,
|
||||
"learning_rate": 3.6143458894413463e-06,
|
||||
"logits/chosen": 0.25372562736194504,
|
||||
"logits/rejected": 0.3085220085200435,
|
||||
"logps/chosen": -127.87930164337158,
|
||||
"logps/rejected": -152.39403762817383,
|
||||
"loss": 0.17381094694137572,
|
||||
"mean_token_accuracy": 0.47169380336999894,
|
||||
"num_tokens": 215920.0,
|
||||
"rewards/accuracies": 0.9375,
|
||||
"rewards/chosen": 2.709118887782097,
|
||||
"rewards/margins": 5.862504243850708,
|
||||
"rewards/rejected": -3.153385379910469,
|
||||
"step": 80
|
||||
},
|
||||
{
|
||||
"entropy": 2.42382150888443,
|
||||
"epoch": 1.3519999999999999,
|
||||
"grad_norm": 76.58686065673828,
|
||||
"learning_rate": 3.403104165467883e-06,
|
||||
"logits/chosen": 0.27046587254706894,
|
||||
"logits/rejected": 0.3554108506103396,
|
||||
"logps/chosen": -135.95888204574584,
|
||||
"logps/rejected": -156.9404288291931,
|
||||
"loss": 0.17821238040924073,
|
||||
"mean_token_accuracy": 0.49741546660661695,
|
||||
"num_tokens": 287127.0,
|
||||
"rewards/accuracies": 0.91875,
|
||||
"rewards/chosen": 3.4181615144014357,
|
||||
"rewards/margins": 7.317546558380127,
|
||||
"rewards/rejected": -3.8993850499391556,
|
||||
"step": 85
|
||||
},
|
||||
{
|
||||
"entropy": 2.5261152565479277,
|
||||
"epoch": 1.432,
|
||||
"grad_norm": 80.35875701904297,
|
||||
"learning_rate": 3.184157475180208e-06,
|
||||
"logits/chosen": 0.2524602257174569,
|
||||
"logits/rejected": 0.30296234191214516,
|
||||
"logps/chosen": -156.0525354385376,
|
||||
"logps/rejected": -149.48046531677247,
|
||||
"loss": 0.23036706447601318,
|
||||
"mean_token_accuracy": 0.46826066076755524,
|
||||
"num_tokens": 354068.0,
|
||||
"rewards/accuracies": 0.89375,
|
||||
"rewards/chosen": 3.04692747592926,
|
||||
"rewards/margins": 5.816668316721916,
|
||||
"rewards/rejected": -2.7697408348321915,
|
||||
"step": 90
|
||||
},
|
||||
{
|
||||
"entropy": 2.4211883395910263,
|
||||
"epoch": 1.512,
|
||||
"grad_norm": 53.557090759277344,
|
||||
"learning_rate": 2.9593737945414264e-06,
|
||||
"logits/chosen": 0.17738279076359578,
|
||||
"logits/rejected": 0.17275444698543332,
|
||||
"logps/chosen": -135.7138165473938,
|
||||
"logps/rejected": -157.41348686218262,
|
||||
"loss": 0.16570401191711426,
|
||||
"mean_token_accuracy": 0.4731420993804932,
|
||||
"num_tokens": 421426.0,
|
||||
"rewards/accuracies": 0.89375,
|
||||
"rewards/chosen": 2.8382038921117783,
|
||||
"rewards/margins": 6.569511443376541,
|
||||
"rewards/rejected": -3.731307566165924,
|
||||
"step": 95
|
||||
},
|
||||
{
|
||||
"entropy": 2.341481050848961,
|
||||
"epoch": 1.592,
|
||||
"grad_norm": 127.4275131225586,
|
||||
"learning_rate": 2.730670898658255e-06,
|
||||
"logits/chosen": -0.04766494180334789,
|
||||
"logits/rejected": 0.09169179261277503,
|
||||
"logps/chosen": -153.73596954345703,
|
||||
"logps/rejected": -152.93934383392335,
|
||||
"loss": 0.1649105429649353,
|
||||
"mean_token_accuracy": 0.4882186971604824,
|
||||
"num_tokens": 489806.0,
|
||||
"rewards/accuracies": 0.9125,
|
||||
"rewards/chosen": 3.46675723195076,
|
||||
"rewards/margins": 6.959583753347397,
|
||||
"rewards/rejected": -3.4928264021873474,
|
||||
"step": 100
|
||||
},
|
||||
{
|
||||
"epoch": 1.592,
|
||||
"eval_entropy": 2.3993507494926454,
|
||||
"eval_logits/chosen": -0.03254038471881061,
|
||||
"eval_logits/rejected": 0.02311345798919562,
|
||||
"eval_logps/chosen": -161.87789566040038,
|
||||
"eval_logps/rejected": -154.16960359954834,
|
||||
"eval_loss": 1.181304931640625,
|
||||
"eval_mean_token_accuracy": 0.4609604501724243,
|
||||
"eval_num_tokens": 489806.0,
|
||||
"eval_rewards/accuracies": 0.516,
|
||||
"eval_rewards/chosen": -0.21504417657852173,
|
||||
"eval_rewards/margins": 0.29201573705673217,
|
||||
"eval_rewards/rejected": -0.5070599136352539,
|
||||
"eval_runtime": 206.6722,
|
||||
"eval_samples_per_second": 4.839,
|
||||
"eval_steps_per_second": 1.21,
|
||||
"step": 100
|
||||
},
|
||||
{
|
||||
"entropy": 2.3751278162002563,
|
||||
"epoch": 1.6720000000000002,
|
||||
"grad_norm": 88.25654602050781,
|
||||
"learning_rate": 2.5e-06,
|
||||
"logits/chosen": -0.06720577408088163,
|
||||
"logits/rejected": 0.009747601991268295,
|
||||
"logps/chosen": -163.05800094604493,
|
||||
"logps/rejected": -181.62881116867067,
|
||||
"loss": 0.14087371826171874,
|
||||
"mean_token_accuracy": 0.4826005406677723,
|
||||
"num_tokens": 557126.0,
|
||||
"rewards/accuracies": 0.9375,
|
||||
"rewards/chosen": 4.133222645521164,
|
||||
"rewards/margins": 8.501560699939727,
|
||||
"rewards/rejected": -4.368338066339493,
|
||||
"step": 105
|
||||
},
|
||||
{
|
||||
"entropy": 2.292782101035118,
|
||||
"epoch": 1.752,
|
||||
"grad_norm": 139.0855255126953,
|
||||
"learning_rate": 2.269329101341745e-06,
|
||||
"logits/chosen": -0.1230251408579616,
|
||||
"logits/rejected": -0.04259267106090293,
|
||||
"logps/chosen": -156.97511377334595,
|
||||
"logps/rejected": -170.4386715888977,
|
||||
"loss": 0.23338742256164552,
|
||||
"mean_token_accuracy": 0.48731986358761786,
|
||||
"num_tokens": 621946.0,
|
||||
"rewards/accuracies": 0.8875,
|
||||
"rewards/chosen": 3.1854370057582857,
|
||||
"rewards/margins": 7.239394760131836,
|
||||
"rewards/rejected": -4.053957831859589,
|
||||
"step": 110
|
||||
},
|
||||
{
|
||||
"entropy": 2.2945144355297087,
|
||||
"epoch": 1.8319999999999999,
|
||||
"grad_norm": 52.13258743286133,
|
||||
"learning_rate": 2.040626205458574e-06,
|
||||
"logits/chosen": -0.2037358547111102,
|
||||
"logits/rejected": -0.04959464698416915,
|
||||
"logps/chosen": -148.64922075271608,
|
||||
"logps/rejected": -163.68930807113648,
|
||||
"loss": 0.24213719367980957,
|
||||
"mean_token_accuracy": 0.48034665957093237,
|
||||
"num_tokens": 691164.0,
|
||||
"rewards/accuracies": 0.89375,
|
||||
"rewards/chosen": 2.6465539157390596,
|
||||
"rewards/margins": 6.472298520803451,
|
||||
"rewards/rejected": -3.8257445871829985,
|
||||
"step": 115
|
||||
},
|
||||
{
|
||||
"entropy": 2.318876361846924,
|
||||
"epoch": 1.912,
|
||||
"grad_norm": 51.697227478027344,
|
||||
"learning_rate": 1.8158425248197931e-06,
|
||||
"logits/chosen": -0.16565151490742838,
|
||||
"logits/rejected": -0.09252247863799953,
|
||||
"logps/chosen": -151.05957136154174,
|
||||
"logps/rejected": -158.38998804092407,
|
||||
"loss": 0.16733760833740235,
|
||||
"mean_token_accuracy": 0.4730261914432049,
|
||||
"num_tokens": 754527.0,
|
||||
"rewards/accuracies": 0.90625,
|
||||
"rewards/chosen": 2.554230135679245,
|
||||
"rewards/margins": 6.5345380246639255,
|
||||
"rewards/rejected": -3.980307912826538,
|
||||
"step": 120
|
||||
},
|
||||
{
|
||||
"entropy": 2.373268890380859,
|
||||
"epoch": 1.992,
|
||||
"grad_norm": 67.3870620727539,
|
||||
"learning_rate": 1.5968958345321178e-06,
|
||||
"logits/chosen": -0.19111626640901203,
|
||||
"logits/rejected": -0.09068037643756863,
|
||||
"logps/chosen": -144.4349822998047,
|
||||
"logps/rejected": -157.0623517036438,
|
||||
"loss": 0.17435957193374635,
|
||||
"mean_token_accuracy": 0.473250250518322,
|
||||
"num_tokens": 823843.0,
|
||||
"rewards/accuracies": 0.90625,
|
||||
"rewards/chosen": 2.5309324622154237,
|
||||
"rewards/margins": 6.4906654238700865,
|
||||
"rewards/rejected": -3.9597329974174498,
|
||||
"step": 125
|
||||
},
|
||||
{
|
||||
"entropy": 2.378200375371509,
|
||||
"epoch": 2.064,
|
||||
"grad_norm": 6.317872524261475,
|
||||
"learning_rate": 1.3856541105586545e-06,
|
||||
"logits/chosen": -0.11781226721693444,
|
||||
"logits/rejected": -0.042003764714465604,
|
||||
"logps/chosen": -139.36247073279486,
|
||||
"logps/rejected": -160.00994406806097,
|
||||
"loss": 0.08384315967559815,
|
||||
"mean_token_accuracy": 0.49078691171275246,
|
||||
"num_tokens": 880621.0,
|
||||
"rewards/accuracies": 0.9583333333333334,
|
||||
"rewards/chosen": 4.196374575297038,
|
||||
"rewards/margins": 9.98701392279731,
|
||||
"rewards/rejected": -5.790639360745748,
|
||||
"step": 130
|
||||
},
|
||||
{
|
||||
"entropy": 2.3539724469184877,
|
||||
"epoch": 2.144,
|
||||
"grad_norm": 16.372520446777344,
|
||||
"learning_rate": 1.1839195928066101e-06,
|
||||
"logits/chosen": -0.1456372075386406,
|
||||
"logits/rejected": -0.059097048477018174,
|
||||
"logps/chosen": -144.68906011581421,
|
||||
"logps/rejected": -159.5312638282776,
|
||||
"loss": 0.0357888251543045,
|
||||
"mean_token_accuracy": 0.4876934640109539,
|
||||
"num_tokens": 947062.0,
|
||||
"rewards/accuracies": 0.975,
|
||||
"rewards/chosen": 3.8123921036720274,
|
||||
"rewards/margins": 8.819371503591537,
|
||||
"rewards/rejected": -5.0069794178009035,
|
||||
"step": 135
|
||||
},
|
||||
{
|
||||
"entropy": 2.3356225162744524,
|
||||
"epoch": 2.224,
|
||||
"grad_norm": 29.679048538208008,
|
||||
"learning_rate": 9.934134090518593e-07,
|
||||
"logits/chosen": -0.11882373575890333,
|
||||
"logits/rejected": 0.026453084276548428,
|
||||
"logps/chosen": -139.31078090667725,
|
||||
"logps/rejected": -145.80226907730102,
|
||||
"loss": 0.0521980881690979,
|
||||
"mean_token_accuracy": 0.48251245468854903,
|
||||
"num_tokens": 1009620.0,
|
||||
"rewards/accuracies": 0.95625,
|
||||
"rewards/chosen": 3.927339309453964,
|
||||
"rewards/margins": 9.215629595518113,
|
||||
"rewards/rejected": -5.288290357589721,
|
||||
"step": 140
|
||||
},
|
||||
{
|
||||
"entropy": 2.3158033907413484,
|
||||
"epoch": 2.304,
|
||||
"grad_norm": 7.268758773803711,
|
||||
"learning_rate": 8.157608908836071e-07,
|
||||
"logits/chosen": -0.17821111338030823,
|
||||
"logits/rejected": -0.10465911260719843,
|
||||
"logps/chosen": -145.11655292510986,
|
||||
"logps/rejected": -164.69618825912477,
|
||||
"loss": 0.03299629390239715,
|
||||
"mean_token_accuracy": 0.48976081162691115,
|
||||
"num_tokens": 1073365.0,
|
||||
"rewards/accuracies": 0.98125,
|
||||
"rewards/chosen": 4.720877766609192,
|
||||
"rewards/margins": 10.670221543312072,
|
||||
"rewards/rejected": -5.949343764781952,
|
||||
"step": 145
|
||||
},
|
||||
{
|
||||
"entropy": 2.3338232010602953,
|
||||
"epoch": 2.384,
|
||||
"grad_norm": 12.778029441833496,
|
||||
"learning_rate": 6.524777069483526e-07,
|
||||
"logits/chosen": -0.24220225234879864,
|
||||
"logits/rejected": -0.18092035396691847,
|
||||
"logps/chosen": -149.46499347686768,
|
||||
"logps/rejected": -172.2482801437378,
|
||||
"loss": 0.045380374789237975,
|
||||
"mean_token_accuracy": 0.4738804578781128,
|
||||
"num_tokens": 1145086.0,
|
||||
"rewards/accuracies": 0.95625,
|
||||
"rewards/chosen": 4.283064597845078,
|
||||
"rewards/margins": 10.365329492092133,
|
||||
"rewards/rejected": -6.082264894247055,
|
||||
"step": 150
|
||||
},
|
||||
{
|
||||
"epoch": 2.384,
|
||||
"eval_entropy": 2.3283381662368776,
|
||||
"eval_logits/chosen": -0.24593508894178606,
|
||||
"eval_logits/rejected": -0.18872405137363696,
|
||||
"eval_logps/chosen": -162.80099214172364,
|
||||
"eval_logps/rejected": -155.3276520462036,
|
||||
"eval_loss": 1.1916899681091309,
|
||||
"eval_mean_token_accuracy": 0.4613952031135559,
|
||||
"eval_num_tokens": 1145086.0,
|
||||
"eval_rewards/accuracies": 0.533,
|
||||
"eval_rewards/chosen": -0.6765917901992797,
|
||||
"eval_rewards/margins": 0.4094925169944763,
|
||||
"eval_rewards/rejected": -1.086084306716919,
|
||||
"eval_runtime": 206.7309,
|
||||
"eval_samples_per_second": 4.837,
|
||||
"eval_steps_per_second": 1.209,
|
||||
"step": 150
|
||||
},
|
||||
{
|
||||
"entropy": 2.218647238612175,
|
||||
"epoch": 2.464,
|
||||
"grad_norm": 26.799619674682617,
|
||||
"learning_rate": 5.049569317994013e-07,
|
||||
"logits/chosen": -0.2961522508715828,
|
||||
"logits/rejected": -0.21192918570690328,
|
||||
"logps/chosen": -138.59407653808594,
|
||||
"logps/rejected": -181.92112674713135,
|
||||
"loss": 0.03839964866638183,
|
||||
"mean_token_accuracy": 0.49626709893345833,
|
||||
"num_tokens": 1213916.0,
|
||||
"rewards/accuracies": 0.96875,
|
||||
"rewards/chosen": 3.6871350944042205,
|
||||
"rewards/margins": 10.40043729543686,
|
||||
"rewards/rejected": -6.713302159309388,
|
||||
"step": 155
|
||||
},
|
||||
{
|
||||
"entropy": 2.3031299352645873,
|
||||
"epoch": 2.544,
|
||||
"grad_norm": 6.236860275268555,
|
||||
"learning_rate": 3.7445716067596506e-07,
|
||||
"logits/chosen": -0.2408471276221063,
|
||||
"logits/rejected": -0.05440791536781857,
|
||||
"logps/chosen": -127.97663774490357,
|
||||
"logps/rejected": -142.3651433944702,
|
||||
"loss": 0.03359568119049072,
|
||||
"mean_token_accuracy": 0.48194736018776896,
|
||||
"num_tokens": 1277766.0,
|
||||
"rewards/accuracies": 0.975,
|
||||
"rewards/chosen": 4.138598304986954,
|
||||
"rewards/margins": 9.36688324213028,
|
||||
"rewards/rejected": -5.22828494310379,
|
||||
"step": 160
|
||||
},
|
||||
{
|
||||
"entropy": 2.2714572310447694,
|
||||
"epoch": 2.624,
|
||||
"grad_norm": 8.428302764892578,
|
||||
"learning_rate": 2.620917716123444e-07,
|
||||
"logits/chosen": -0.30565182218347137,
|
||||
"logits/rejected": -0.262391552365428,
|
||||
"logps/chosen": -143.35228729248047,
|
||||
"logps/rejected": -163.5957480430603,
|
||||
"loss": 0.03351616859436035,
|
||||
"mean_token_accuracy": 0.4966980829834938,
|
||||
"num_tokens": 1344187.0,
|
||||
"rewards/accuracies": 0.98125,
|
||||
"rewards/chosen": 3.4794578850269318,
|
||||
"rewards/margins": 9.300994729995727,
|
||||
"rewards/rejected": -5.821536821126938,
|
||||
"step": 165
|
||||
},
|
||||
{
|
||||
"entropy": 2.319387698173523,
|
||||
"epoch": 2.7039999999999997,
|
||||
"grad_norm": 19.33875846862793,
|
||||
"learning_rate": 1.6881942648911077e-07,
|
||||
"logits/chosen": -0.2771282747536266,
|
||||
"logits/rejected": -0.1903030416102311,
|
||||
"logps/chosen": -159.3884250640869,
|
||||
"logps/rejected": -202.81982517242432,
|
||||
"loss": 0.03787025213241577,
|
||||
"mean_token_accuracy": 0.483600977063179,
|
||||
"num_tokens": 1412024.0,
|
||||
"rewards/accuracies": 0.96875,
|
||||
"rewards/chosen": 3.7413900166749956,
|
||||
"rewards/margins": 10.71020541191101,
|
||||
"rewards/rejected": -6.968815433979034,
|
||||
"step": 170
|
||||
},
|
||||
{
|
||||
"entropy": 2.296932601928711,
|
||||
"epoch": 2.784,
|
||||
"grad_norm": 8.236591339111328,
|
||||
"learning_rate": 9.54358920679524e-08,
|
||||
"logits/chosen": -0.35752807567610184,
|
||||
"logits/rejected": -0.2152659888252221,
|
||||
"logps/chosen": -162.68478546142578,
|
||||
"logps/rejected": -166.8199408531189,
|
||||
"loss": 0.030017280578613283,
|
||||
"mean_token_accuracy": 0.48842705860733987,
|
||||
"num_tokens": 1479107.0,
|
||||
"rewards/accuracies": 0.98125,
|
||||
"rewards/chosen": 5.196063238382339,
|
||||
"rewards/margins": 11.131522840261459,
|
||||
"rewards/rejected": -5.935459566116333,
|
||||
"step": 175
|
||||
},
|
||||
{
|
||||
"entropy": 2.326069247722626,
|
||||
"epoch": 2.864,
|
||||
"grad_norm": 4.00937557220459,
|
||||
"learning_rate": 4.256725079024554e-08,
|
||||
"logits/chosen": -0.2914971237007954,
|
||||
"logits/rejected": -0.18431776261809868,
|
||||
"logps/chosen": -148.99251294136047,
|
||||
"logps/rejected": -147.76169719696045,
|
||||
"loss": 0.04067146480083465,
|
||||
"mean_token_accuracy": 0.4746674746274948,
|
||||
"num_tokens": 1546945.0,
|
||||
"rewards/accuracies": 0.975,
|
||||
"rewards/chosen": 4.784848666191101,
|
||||
"rewards/margins": 9.933767330646514,
|
||||
"rewards/rejected": -5.148918730020523,
|
||||
"step": 180
|
||||
},
|
||||
{
|
||||
"entropy": 2.2894690483808517,
|
||||
"epoch": 2.944,
|
||||
"grad_norm": 6.369950771331787,
|
||||
"learning_rate": 1.0664559262413831e-08,
|
||||
"logits/chosen": -0.31424430259859776,
|
||||
"logits/rejected": -0.1595707523796258,
|
||||
"logps/chosen": -153.0141131401062,
|
||||
"logps/rejected": -162.40540452003478,
|
||||
"loss": 0.03373933434486389,
|
||||
"mean_token_accuracy": 0.4808969467878342,
|
||||
"num_tokens": 1610498.0,
|
||||
"rewards/accuracies": 0.96875,
|
||||
"rewards/chosen": 4.609399086236953,
|
||||
"rewards/margins": 9.97553214430809,
|
||||
"rewards/rejected": -5.366133022308349,
|
||||
"step": 185
|
||||
},
|
||||
{
|
||||
"epoch": 3.0,
|
||||
"eval_entropy": 2.320549825191498,
|
||||
"eval_logits/chosen": -0.2871145028256165,
|
||||
"eval_logits/rejected": -0.23016112940510325,
|
||||
"eval_logps/chosen": -163.11243586730956,
|
||||
"eval_logps/rejected": -155.6747285079956,
|
||||
"eval_loss": 1.209433674812317,
|
||||
"eval_mean_token_accuracy": 0.4607901349067688,
|
||||
"eval_num_tokens": 1659568.0,
|
||||
"eval_rewards/accuracies": 0.529,
|
||||
"eval_rewards/chosen": -0.8323136119842529,
|
||||
"eval_rewards/margins": 0.4273088164329529,
|
||||
"eval_rewards/rejected": -1.2596224284172057,
|
||||
"eval_runtime": 207.0068,
|
||||
"eval_samples_per_second": 4.831,
|
||||
"eval_steps_per_second": 1.208,
|
||||
"step": 189
|
||||
}
|
||||
],
|
||||
"logging_steps": 5,
|
||||
"max_steps": 189,
|
||||
"num_input_tokens_seen": 0,
|
||||
"num_train_epochs": 3,
|
||||
"save_steps": 100,
|
||||
"stateful_callbacks": {
|
||||
"TrainerControl": {
|
||||
"args": {
|
||||
"should_epoch_stop": false,
|
||||
"should_evaluate": false,
|
||||
"should_log": false,
|
||||
"should_save": true,
|
||||
"should_training_stop": true
|
||||
},
|
||||
"attributes": {}
|
||||
}
|
||||
},
|
||||
"total_flos": 9840760918671360.0,
|
||||
"train_batch_size": 4,
|
||||
"trial_name": null,
|
||||
"trial_params": null
|
||||
}
|
||||
3
checkpoint-189/training_args.bin
Normal file
3
checkpoint-189/training_args.bin
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:3990be1fe7ba3aac1d4d439514f84255e14a6f8b94b6ea9e4d8615fab866635a
|
||||
size 5841
|
||||
33
checkpoint-63/config.json
Normal file
33
checkpoint-63/config.json
Normal file
@@ -0,0 +1,33 @@
|
||||
{
|
||||
"architectures": [
|
||||
"GPTNeoXForCausalLM"
|
||||
],
|
||||
"attention_bias": true,
|
||||
"attention_dropout": 0.0,
|
||||
"bos_token_id": 0,
|
||||
"classifier_dropout": 0.1,
|
||||
"dtype": "float32",
|
||||
"eos_token_id": 0,
|
||||
"hidden_act": "gelu",
|
||||
"hidden_dropout": 0.0,
|
||||
"hidden_size": 1024,
|
||||
"initializer_range": 0.02,
|
||||
"intermediate_size": 4096,
|
||||
"is_decoder": false,
|
||||
"layer_norm_eps": 1e-05,
|
||||
"max_position_embeddings": 2048,
|
||||
"model_type": "gpt_neox",
|
||||
"num_attention_heads": 16,
|
||||
"num_hidden_layers": 24,
|
||||
"pad_token_id": 1,
|
||||
"rope_parameters": {
|
||||
"partial_rotary_factor": 0.25,
|
||||
"rope_theta": 10000,
|
||||
"rope_type": "default"
|
||||
},
|
||||
"tie_word_embeddings": false,
|
||||
"transformers_version": "5.13.0",
|
||||
"use_cache": false,
|
||||
"use_parallel_residual": true,
|
||||
"vocab_size": 50304
|
||||
}
|
||||
10
checkpoint-63/generation_config.json
Normal file
10
checkpoint-63/generation_config.json
Normal file
@@ -0,0 +1,10 @@
|
||||
{
|
||||
"_from_model_config": true,
|
||||
"bos_token_id": 0,
|
||||
"eos_token_id": [
|
||||
0
|
||||
],
|
||||
"pad_token_id": 1,
|
||||
"transformers_version": "5.13.0",
|
||||
"use_cache": true
|
||||
}
|
||||
3
checkpoint-63/model.safetensors
Normal file
3
checkpoint-63/model.safetensors
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:6980521ff003fe520fc38e8259c042e28491ef78db7d457d3c26ead5b9e7914f
|
||||
size 1621370224
|
||||
3
checkpoint-63/optimizer.pt
Normal file
3
checkpoint-63/optimizer.pt
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:d4bb1301207ba7d99436469844888a2b3ff821c1a959e47b7115b6e54248b9e6
|
||||
size 3242916491
|
||||
3
checkpoint-63/rng_state.pth
Normal file
3
checkpoint-63/rng_state.pth
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:f4a9f217e852f439efa6bd32fde98d6867f11aa6ea13ddc021ba10af6a0b0934
|
||||
size 14645
|
||||
3
checkpoint-63/scaler.pt
Normal file
3
checkpoint-63/scaler.pt
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:7b09ff53dfdeb98feaa25ccade54f490eaebb7ca5b59d6e930f01eab95790c26
|
||||
size 1383
|
||||
3
checkpoint-63/scheduler.pt
Normal file
3
checkpoint-63/scheduler.pt
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:8f144286c127833c5309618e8e24f8a84d423b58fb8de34fb79a94bb5b178ab9
|
||||
size 1465
|
||||
250557
checkpoint-63/tokenizer.json
Normal file
250557
checkpoint-63/tokenizer.json
Normal file
File diff suppressed because it is too large
Load Diff
14
checkpoint-63/tokenizer_config.json
Normal file
14
checkpoint-63/tokenizer_config.json
Normal file
@@ -0,0 +1,14 @@
|
||||
{
|
||||
"add_prefix_space": false,
|
||||
"backend": "tokenizers",
|
||||
"bos_token": "<|endoftext|>",
|
||||
"eos_token": "<|endoftext|>",
|
||||
"errors": "replace",
|
||||
"is_local": false,
|
||||
"local_files_only": false,
|
||||
"model_max_length": 1000000000000000019884624838656,
|
||||
"pad_token": "<|padding|>",
|
||||
"tokenizer_class": "GPTNeoXTokenizer",
|
||||
"trim_offsets": true,
|
||||
"unk_token": "<|endoftext|>"
|
||||
}
|
||||
288
checkpoint-63/trainer_state.json
Normal file
288
checkpoint-63/trainer_state.json
Normal file
@@ -0,0 +1,288 @@
|
||||
{
|
||||
"best_global_step": null,
|
||||
"best_metric": null,
|
||||
"best_model_checkpoint": null,
|
||||
"epoch": 1.0,
|
||||
"eval_steps": 50,
|
||||
"global_step": 63,
|
||||
"is_hyper_param_search": false,
|
||||
"is_local_process_zero": true,
|
||||
"is_world_process_zero": true,
|
||||
"log_history": [
|
||||
{
|
||||
"entropy": 2.555550271272659,
|
||||
"epoch": 0.08,
|
||||
"grad_norm": 175.83624267578125,
|
||||
"learning_rate": 2.8571428571428573e-06,
|
||||
"logits/chosen": 0.41239441768472307,
|
||||
"logits/rejected": 0.4313717963372231,
|
||||
"logps/chosen": -157.81461162567138,
|
||||
"logps/rejected": -150.4321650505066,
|
||||
"loss": 0.6844395637512207,
|
||||
"mean_token_accuracy": 0.45540447160601616,
|
||||
"num_tokens": 63280.0,
|
||||
"rewards/accuracies": 0.55,
|
||||
"rewards/chosen": 0.09316946864128113,
|
||||
"rewards/margins": 0.030635011196136475,
|
||||
"rewards/rejected": 0.06253445744514466,
|
||||
"step": 5
|
||||
},
|
||||
{
|
||||
"entropy": 2.584770825505257,
|
||||
"epoch": 0.16,
|
||||
"grad_norm": 275.8374938964844,
|
||||
"learning_rate": 4.984280524733107e-06,
|
||||
"logits/chosen": 0.23018057449154425,
|
||||
"logits/rejected": 0.4137123508420314,
|
||||
"logps/chosen": -160.37082138061524,
|
||||
"logps/rejected": -154.9328401565552,
|
||||
"loss": 0.848213005065918,
|
||||
"mean_token_accuracy": 0.4679958797991276,
|
||||
"num_tokens": 128751.0,
|
||||
"rewards/accuracies": 0.4625,
|
||||
"rewards/chosen": 0.06873167753219604,
|
||||
"rewards/margins": -0.08100449442863464,
|
||||
"rewards/rejected": 0.1497361719608307,
|
||||
"step": 10
|
||||
},
|
||||
{
|
||||
"entropy": 2.485997956991196,
|
||||
"epoch": 0.24,
|
||||
"grad_norm": 273.0233154296875,
|
||||
"learning_rate": 4.809698831278217e-06,
|
||||
"logits/chosen": 0.1816923364201413,
|
||||
"logits/rejected": 0.23945612540369207,
|
||||
"logps/chosen": -151.38499155044556,
|
||||
"logps/rejected": -163.4970989227295,
|
||||
"loss": 0.8470439910888672,
|
||||
"mean_token_accuracy": 0.4733552895486355,
|
||||
"num_tokens": 194142.0,
|
||||
"rewards/accuracies": 0.45,
|
||||
"rewards/chosen": -0.32968448400497435,
|
||||
"rewards/margins": 0.06030769646167755,
|
||||
"rewards/rejected": -0.3899921804666519,
|
||||
"step": 15
|
||||
},
|
||||
{
|
||||
"entropy": 2.5318914532661436,
|
||||
"epoch": 0.32,
|
||||
"grad_norm": 234.37681579589844,
|
||||
"learning_rate": 4.454578706170075e-06,
|
||||
"logits/chosen": 0.07677000825058375,
|
||||
"logits/rejected": 0.18887137972641857,
|
||||
"logps/chosen": -135.0070219039917,
|
||||
"logps/rejected": -135.28493957519532,
|
||||
"loss": 0.9311827659606934,
|
||||
"mean_token_accuracy": 0.4595716767013073,
|
||||
"num_tokens": 254871.0,
|
||||
"rewards/accuracies": 0.5375,
|
||||
"rewards/chosen": -0.7181475728750228,
|
||||
"rewards/margins": 0.2766463726758957,
|
||||
"rewards/rejected": -0.9947939455509186,
|
||||
"step": 20
|
||||
},
|
||||
{
|
||||
"entropy": 2.462447080016136,
|
||||
"epoch": 0.4,
|
||||
"grad_norm": 250.9570770263672,
|
||||
"learning_rate": 3.946678240449515e-06,
|
||||
"logits/chosen": 0.20993061968672994,
|
||||
"logits/rejected": 0.20386893310256043,
|
||||
"logps/chosen": -145.39961681365966,
|
||||
"logps/rejected": -137.4315857887268,
|
||||
"loss": 0.9580174446105957,
|
||||
"mean_token_accuracy": 0.45824490338563917,
|
||||
"num_tokens": 317752.0,
|
||||
"rewards/accuracies": 0.58125,
|
||||
"rewards/chosen": -0.7164888560771943,
|
||||
"rewards/margins": 0.16717674732208251,
|
||||
"rewards/rejected": -0.8836656033992767,
|
||||
"step": 25
|
||||
},
|
||||
{
|
||||
"entropy": 2.4387545943260194,
|
||||
"epoch": 0.48,
|
||||
"grad_norm": 316.4103088378906,
|
||||
"learning_rate": 3.3256976548879183e-06,
|
||||
"logits/chosen": 0.21743581064338796,
|
||||
"logits/rejected": 0.2765391890690152,
|
||||
"logps/chosen": -148.74287595748902,
|
||||
"logps/rejected": -147.26203107833862,
|
||||
"loss": 0.9910862922668457,
|
||||
"mean_token_accuracy": 0.4532994642853737,
|
||||
"num_tokens": 387452.0,
|
||||
"rewards/accuracies": 0.5125,
|
||||
"rewards/chosen": -0.2023364007472992,
|
||||
"rewards/margins": 0.1426894724369049,
|
||||
"rewards/rejected": -0.3450258731842041,
|
||||
"step": 30
|
||||
},
|
||||
{
|
||||
"entropy": 2.469076004624367,
|
||||
"epoch": 0.56,
|
||||
"grad_norm": 256.6429748535156,
|
||||
"learning_rate": 2.6401761180929798e-06,
|
||||
"logits/chosen": 0.18299585651420763,
|
||||
"logits/rejected": 0.250682400907656,
|
||||
"logps/chosen": -178.9021216392517,
|
||||
"logps/rejected": -171.8313166618347,
|
||||
"loss": 0.8882085800170898,
|
||||
"mean_token_accuracy": 0.47426797077059746,
|
||||
"num_tokens": 454873.0,
|
||||
"rewards/accuracies": 0.53125,
|
||||
"rewards/chosen": 0.1502027690410614,
|
||||
"rewards/margins": 0.38659809827804564,
|
||||
"rewards/rejected": -0.23639532923698425,
|
||||
"step": 35
|
||||
},
|
||||
{
|
||||
"entropy": 2.4749947816133497,
|
||||
"epoch": 0.64,
|
||||
"grad_norm": 248.1305694580078,
|
||||
"learning_rate": 1.9436976651092143e-06,
|
||||
"logits/chosen": 0.27816104129128527,
|
||||
"logits/rejected": 0.37676442462284854,
|
||||
"logps/chosen": -157.81686353683472,
|
||||
"logps/rejected": -158.98215370178224,
|
||||
"loss": 1.0146113395690919,
|
||||
"mean_token_accuracy": 0.465312571823597,
|
||||
"num_tokens": 518527.0,
|
||||
"rewards/accuracies": 0.55625,
|
||||
"rewards/chosen": 0.05624905824661255,
|
||||
"rewards/margins": 0.09228863418102265,
|
||||
"rewards/rejected": -0.036039575934410095,
|
||||
"step": 40
|
||||
},
|
||||
{
|
||||
"entropy": 2.409931382536888,
|
||||
"epoch": 0.72,
|
||||
"grad_norm": 219.939697265625,
|
||||
"learning_rate": 1.2907027822369006e-06,
|
||||
"logits/chosen": 0.2784307162908892,
|
||||
"logits/rejected": 0.3215469827251049,
|
||||
"logps/chosen": -153.8018159866333,
|
||||
"logps/rejected": -159.60495262145997,
|
||||
"loss": 0.921458625793457,
|
||||
"mean_token_accuracy": 0.4758016161620617,
|
||||
"num_tokens": 586496.0,
|
||||
"rewards/accuracies": 0.525,
|
||||
"rewards/chosen": 0.1898827075958252,
|
||||
"rewards/margins": 0.46674283146858214,
|
||||
"rewards/rejected": -0.27686012387275694,
|
||||
"step": 45
|
||||
},
|
||||
{
|
||||
"entropy": 2.4379068195819853,
|
||||
"epoch": 0.8,
|
||||
"grad_norm": 235.46241760253906,
|
||||
"learning_rate": 7.322330470336314e-07,
|
||||
"logits/chosen": 0.28584471002719647,
|
||||
"logits/rejected": 0.3651064125555795,
|
||||
"logps/chosen": -163.8307611465454,
|
||||
"logps/rejected": -163.46687126159668,
|
||||
"loss": 0.979340648651123,
|
||||
"mean_token_accuracy": 0.4653128065168858,
|
||||
"num_tokens": 659345.0,
|
||||
"rewards/accuracies": 0.5,
|
||||
"rewards/chosen": 0.16986804008483886,
|
||||
"rewards/margins": 0.1913771450519562,
|
||||
"rewards/rejected": -0.02150910496711731,
|
||||
"step": 50
|
||||
},
|
||||
{
|
||||
"epoch": 0.8,
|
||||
"eval_entropy": 2.5069966416358946,
|
||||
"eval_logits/chosen": 0.29315065189355716,
|
||||
"eval_logits/rejected": 0.348470281243937,
|
||||
"eval_logps/chosen": -161.13176106262208,
|
||||
"eval_logps/rejected": -153.30834275054931,
|
||||
"eval_loss": 0.9624814391136169,
|
||||
"eval_mean_token_accuracy": 0.4618878421783447,
|
||||
"eval_num_tokens": 659345.0,
|
||||
"eval_rewards/accuracies": 0.531,
|
||||
"eval_rewards/chosen": 0.1580237216949463,
|
||||
"eval_rewards/margins": 0.2344533715248108,
|
||||
"eval_rewards/rejected": -0.0764296498298645,
|
||||
"eval_runtime": 203.9137,
|
||||
"eval_samples_per_second": 4.904,
|
||||
"eval_steps_per_second": 1.226,
|
||||
"step": 50
|
||||
},
|
||||
{
|
||||
"entropy": 2.47237910926342,
|
||||
"epoch": 0.88,
|
||||
"grad_norm": 254.37533569335938,
|
||||
"learning_rate": 3.119414452281158e-07,
|
||||
"logits/chosen": 0.31621869752899623,
|
||||
"logits/rejected": 0.438719071421892,
|
||||
"logps/chosen": -148.24002447128296,
|
||||
"logps/rejected": -142.998854637146,
|
||||
"loss": 0.9957857131958008,
|
||||
"mean_token_accuracy": 0.47029968202114103,
|
||||
"num_tokens": 731475.0,
|
||||
"rewards/accuracies": 0.59375,
|
||||
"rewards/chosen": 0.2521739423274994,
|
||||
"rewards/margins": 0.1846893012523651,
|
||||
"rewards/rejected": 0.06748464107513427,
|
||||
"step": 55
|
||||
},
|
||||
{
|
||||
"entropy": 2.4306333363056183,
|
||||
"epoch": 0.96,
|
||||
"grad_norm": 226.28863525390625,
|
||||
"learning_rate": 6.268021954544095e-08,
|
||||
"logits/chosen": 0.27655188516120244,
|
||||
"logits/rejected": 0.40121284602477314,
|
||||
"logps/chosen": -156.78616828918456,
|
||||
"logps/rejected": -163.7671283721924,
|
||||
"loss": 0.8905390739440918,
|
||||
"mean_token_accuracy": 0.4723482772707939,
|
||||
"num_tokens": 797757.0,
|
||||
"rewards/accuracies": 0.5125,
|
||||
"rewards/chosen": 0.2607013940811157,
|
||||
"rewards/margins": 0.30302430391311647,
|
||||
"rewards/rejected": -0.04232290983200073,
|
||||
"step": 60
|
||||
},
|
||||
{
|
||||
"epoch": 1.0,
|
||||
"eval_entropy": 2.5108700938224793,
|
||||
"eval_logits/chosen": 0.2960853689074952,
|
||||
"eval_logits/rejected": 0.35102944673757674,
|
||||
"eval_logps/chosen": -161.2097156829834,
|
||||
"eval_logps/rejected": -153.38722127532958,
|
||||
"eval_loss": 0.9581051468849182,
|
||||
"eval_mean_token_accuracy": 0.4621651805639267,
|
||||
"eval_num_tokens": 829784.0,
|
||||
"eval_rewards/accuracies": 0.532,
|
||||
"eval_rewards/chosen": 0.11904637241363525,
|
||||
"eval_rewards/margins": 0.23491560649871826,
|
||||
"eval_rewards/rejected": -0.11586923408508301,
|
||||
"eval_runtime": 204.736,
|
||||
"eval_samples_per_second": 4.884,
|
||||
"eval_steps_per_second": 1.221,
|
||||
"step": 63
|
||||
}
|
||||
],
|
||||
"logging_steps": 5,
|
||||
"max_steps": 63,
|
||||
"num_input_tokens_seen": 0,
|
||||
"num_train_epochs": 1,
|
||||
"save_steps": 100,
|
||||
"stateful_callbacks": {
|
||||
"TrainerControl": {
|
||||
"args": {
|
||||
"should_epoch_stop": false,
|
||||
"should_evaluate": false,
|
||||
"should_log": false,
|
||||
"should_save": true,
|
||||
"should_training_stop": true
|
||||
},
|
||||
"attributes": {}
|
||||
}
|
||||
},
|
||||
"total_flos": 3267470732328960.0,
|
||||
"train_batch_size": 4,
|
||||
"trial_name": null,
|
||||
"trial_params": null
|
||||
}
|
||||
3
checkpoint-63/training_args.bin
Normal file
3
checkpoint-63/training_args.bin
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:0dfa3938528a7f4bb114af77947b14e7b7ab81b6ca5f58111a02d2010f632347
|
||||
size 5841
|
||||
33
config.json
Normal file
33
config.json
Normal file
@@ -0,0 +1,33 @@
|
||||
{
|
||||
"architectures": [
|
||||
"GPTNeoXForCausalLM"
|
||||
],
|
||||
"attention_bias": true,
|
||||
"attention_dropout": 0.0,
|
||||
"bos_token_id": 0,
|
||||
"classifier_dropout": 0.1,
|
||||
"dtype": "float32",
|
||||
"eos_token_id": 0,
|
||||
"hidden_act": "gelu",
|
||||
"hidden_dropout": 0.0,
|
||||
"hidden_size": 1024,
|
||||
"initializer_range": 0.02,
|
||||
"intermediate_size": 4096,
|
||||
"is_decoder": false,
|
||||
"layer_norm_eps": 1e-05,
|
||||
"max_position_embeddings": 2048,
|
||||
"model_type": "gpt_neox",
|
||||
"num_attention_heads": 16,
|
||||
"num_hidden_layers": 24,
|
||||
"pad_token_id": 1,
|
||||
"rope_parameters": {
|
||||
"partial_rotary_factor": 0.25,
|
||||
"rope_theta": 10000,
|
||||
"rope_type": "default"
|
||||
},
|
||||
"tie_word_embeddings": false,
|
||||
"transformers_version": "5.13.0",
|
||||
"use_cache": false,
|
||||
"use_parallel_residual": true,
|
||||
"vocab_size": 50304
|
||||
}
|
||||
10
generation_config.json
Normal file
10
generation_config.json
Normal file
@@ -0,0 +1,10 @@
|
||||
{
|
||||
"_from_model_config": true,
|
||||
"bos_token_id": 0,
|
||||
"eos_token_id": [
|
||||
0
|
||||
],
|
||||
"pad_token_id": 1,
|
||||
"transformers_version": "5.13.0",
|
||||
"use_cache": true
|
||||
}
|
||||
772
log_history.json
Normal file
772
log_history.json
Normal file
@@ -0,0 +1,772 @@
|
||||
[
|
||||
{
|
||||
"entropy": 2.555550271272659,
|
||||
"epoch": 0.08,
|
||||
"grad_norm": 175.83624267578125,
|
||||
"learning_rate": 2.8571428571428573e-06,
|
||||
"logits/chosen": 0.41239441768472307,
|
||||
"logits/rejected": 0.4313717963372231,
|
||||
"logps/chosen": -157.81461162567138,
|
||||
"logps/rejected": -150.4321650505066,
|
||||
"loss": 0.6844395637512207,
|
||||
"mean_token_accuracy": 0.45540447160601616,
|
||||
"num_tokens": 63280.0,
|
||||
"rewards/accuracies": 0.55,
|
||||
"rewards/chosen": 0.09316946864128113,
|
||||
"rewards/margins": 0.030635011196136475,
|
||||
"rewards/rejected": 0.06253445744514466,
|
||||
"step": 5
|
||||
},
|
||||
{
|
||||
"entropy": 2.584770825505257,
|
||||
"epoch": 0.16,
|
||||
"grad_norm": 275.8374938964844,
|
||||
"learning_rate": 4.984280524733107e-06,
|
||||
"logits/chosen": 0.23018057449154425,
|
||||
"logits/rejected": 0.4137123508420314,
|
||||
"logps/chosen": -160.37082138061524,
|
||||
"logps/rejected": -154.9328401565552,
|
||||
"loss": 0.848213005065918,
|
||||
"mean_token_accuracy": 0.4679958797991276,
|
||||
"num_tokens": 128751.0,
|
||||
"rewards/accuracies": 0.4625,
|
||||
"rewards/chosen": 0.06873167753219604,
|
||||
"rewards/margins": -0.08100449442863464,
|
||||
"rewards/rejected": 0.1497361719608307,
|
||||
"step": 10
|
||||
},
|
||||
{
|
||||
"entropy": 2.485997956991196,
|
||||
"epoch": 0.24,
|
||||
"grad_norm": 273.0233154296875,
|
||||
"learning_rate": 4.809698831278217e-06,
|
||||
"logits/chosen": 0.1816923364201413,
|
||||
"logits/rejected": 0.23945612540369207,
|
||||
"logps/chosen": -151.38499155044556,
|
||||
"logps/rejected": -163.4970989227295,
|
||||
"loss": 0.8470439910888672,
|
||||
"mean_token_accuracy": 0.4733552895486355,
|
||||
"num_tokens": 194142.0,
|
||||
"rewards/accuracies": 0.45,
|
||||
"rewards/chosen": -0.32968448400497435,
|
||||
"rewards/margins": 0.06030769646167755,
|
||||
"rewards/rejected": -0.3899921804666519,
|
||||
"step": 15
|
||||
},
|
||||
{
|
||||
"entropy": 2.5318914532661436,
|
||||
"epoch": 0.32,
|
||||
"grad_norm": 234.37681579589844,
|
||||
"learning_rate": 4.454578706170075e-06,
|
||||
"logits/chosen": 0.07677000825058375,
|
||||
"logits/rejected": 0.18887137972641857,
|
||||
"logps/chosen": -135.0070219039917,
|
||||
"logps/rejected": -135.28493957519532,
|
||||
"loss": 0.9311827659606934,
|
||||
"mean_token_accuracy": 0.4595716767013073,
|
||||
"num_tokens": 254871.0,
|
||||
"rewards/accuracies": 0.5375,
|
||||
"rewards/chosen": -0.7181475728750228,
|
||||
"rewards/margins": 0.2766463726758957,
|
||||
"rewards/rejected": -0.9947939455509186,
|
||||
"step": 20
|
||||
},
|
||||
{
|
||||
"entropy": 2.462447080016136,
|
||||
"epoch": 0.4,
|
||||
"grad_norm": 250.9570770263672,
|
||||
"learning_rate": 3.946678240449515e-06,
|
||||
"logits/chosen": 0.20993061968672994,
|
||||
"logits/rejected": 0.20386893310256043,
|
||||
"logps/chosen": -145.39961681365966,
|
||||
"logps/rejected": -137.4315857887268,
|
||||
"loss": 0.9580174446105957,
|
||||
"mean_token_accuracy": 0.45824490338563917,
|
||||
"num_tokens": 317752.0,
|
||||
"rewards/accuracies": 0.58125,
|
||||
"rewards/chosen": -0.7164888560771943,
|
||||
"rewards/margins": 0.16717674732208251,
|
||||
"rewards/rejected": -0.8836656033992767,
|
||||
"step": 25
|
||||
},
|
||||
{
|
||||
"entropy": 2.4387545943260194,
|
||||
"epoch": 0.48,
|
||||
"grad_norm": 316.4103088378906,
|
||||
"learning_rate": 3.3256976548879183e-06,
|
||||
"logits/chosen": 0.21743581064338796,
|
||||
"logits/rejected": 0.2765391890690152,
|
||||
"logps/chosen": -148.74287595748902,
|
||||
"logps/rejected": -147.26203107833862,
|
||||
"loss": 0.9910862922668457,
|
||||
"mean_token_accuracy": 0.4532994642853737,
|
||||
"num_tokens": 387452.0,
|
||||
"rewards/accuracies": 0.5125,
|
||||
"rewards/chosen": -0.2023364007472992,
|
||||
"rewards/margins": 0.1426894724369049,
|
||||
"rewards/rejected": -0.3450258731842041,
|
||||
"step": 30
|
||||
},
|
||||
{
|
||||
"entropy": 2.469076004624367,
|
||||
"epoch": 0.56,
|
||||
"grad_norm": 256.6429748535156,
|
||||
"learning_rate": 2.6401761180929798e-06,
|
||||
"logits/chosen": 0.18299585651420763,
|
||||
"logits/rejected": 0.250682400907656,
|
||||
"logps/chosen": -178.9021216392517,
|
||||
"logps/rejected": -171.8313166618347,
|
||||
"loss": 0.8882085800170898,
|
||||
"mean_token_accuracy": 0.47426797077059746,
|
||||
"num_tokens": 454873.0,
|
||||
"rewards/accuracies": 0.53125,
|
||||
"rewards/chosen": 0.1502027690410614,
|
||||
"rewards/margins": 0.38659809827804564,
|
||||
"rewards/rejected": -0.23639532923698425,
|
||||
"step": 35
|
||||
},
|
||||
{
|
||||
"entropy": 2.4749947816133497,
|
||||
"epoch": 0.64,
|
||||
"grad_norm": 248.1305694580078,
|
||||
"learning_rate": 1.9436976651092143e-06,
|
||||
"logits/chosen": 0.27816104129128527,
|
||||
"logits/rejected": 0.37676442462284854,
|
||||
"logps/chosen": -157.81686353683472,
|
||||
"logps/rejected": -158.98215370178224,
|
||||
"loss": 1.0146113395690919,
|
||||
"mean_token_accuracy": 0.465312571823597,
|
||||
"num_tokens": 518527.0,
|
||||
"rewards/accuracies": 0.55625,
|
||||
"rewards/chosen": 0.05624905824661255,
|
||||
"rewards/margins": 0.09228863418102265,
|
||||
"rewards/rejected": -0.036039575934410095,
|
||||
"step": 40
|
||||
},
|
||||
{
|
||||
"entropy": 2.409931382536888,
|
||||
"epoch": 0.72,
|
||||
"grad_norm": 219.939697265625,
|
||||
"learning_rate": 1.2907027822369006e-06,
|
||||
"logits/chosen": 0.2784307162908892,
|
||||
"logits/rejected": 0.3215469827251049,
|
||||
"logps/chosen": -153.8018159866333,
|
||||
"logps/rejected": -159.60495262145997,
|
||||
"loss": 0.921458625793457,
|
||||
"mean_token_accuracy": 0.4758016161620617,
|
||||
"num_tokens": 586496.0,
|
||||
"rewards/accuracies": 0.525,
|
||||
"rewards/chosen": 0.1898827075958252,
|
||||
"rewards/margins": 0.46674283146858214,
|
||||
"rewards/rejected": -0.27686012387275694,
|
||||
"step": 45
|
||||
},
|
||||
{
|
||||
"entropy": 2.4379068195819853,
|
||||
"epoch": 0.8,
|
||||
"grad_norm": 235.46241760253906,
|
||||
"learning_rate": 7.322330470336314e-07,
|
||||
"logits/chosen": 0.28584471002719647,
|
||||
"logits/rejected": 0.3651064125555795,
|
||||
"logps/chosen": -163.8307611465454,
|
||||
"logps/rejected": -163.46687126159668,
|
||||
"loss": 0.979340648651123,
|
||||
"mean_token_accuracy": 0.4653128065168858,
|
||||
"num_tokens": 659345.0,
|
||||
"rewards/accuracies": 0.5,
|
||||
"rewards/chosen": 0.16986804008483886,
|
||||
"rewards/margins": 0.1913771450519562,
|
||||
"rewards/rejected": -0.02150910496711731,
|
||||
"step": 50
|
||||
},
|
||||
{
|
||||
"epoch": 0.8,
|
||||
"eval_entropy": 2.5069966416358946,
|
||||
"eval_logits/chosen": 0.29315065189355716,
|
||||
"eval_logits/rejected": 0.348470281243937,
|
||||
"eval_logps/chosen": -161.13176106262208,
|
||||
"eval_logps/rejected": -153.30834275054931,
|
||||
"eval_loss": 0.9624814391136169,
|
||||
"eval_mean_token_accuracy": 0.4618878421783447,
|
||||
"eval_num_tokens": 659345.0,
|
||||
"eval_rewards/accuracies": 0.531,
|
||||
"eval_rewards/chosen": 0.1580237216949463,
|
||||
"eval_rewards/margins": 0.2344533715248108,
|
||||
"eval_rewards/rejected": -0.0764296498298645,
|
||||
"eval_runtime": 203.9137,
|
||||
"eval_samples_per_second": 4.904,
|
||||
"eval_steps_per_second": 1.226,
|
||||
"step": 50
|
||||
},
|
||||
{
|
||||
"entropy": 2.47237910926342,
|
||||
"epoch": 0.88,
|
||||
"grad_norm": 254.37533569335938,
|
||||
"learning_rate": 3.119414452281158e-07,
|
||||
"logits/chosen": 0.31621869752899623,
|
||||
"logits/rejected": 0.438719071421892,
|
||||
"logps/chosen": -148.24002447128296,
|
||||
"logps/rejected": -142.998854637146,
|
||||
"loss": 0.9957857131958008,
|
||||
"mean_token_accuracy": 0.47029968202114103,
|
||||
"num_tokens": 731475.0,
|
||||
"rewards/accuracies": 0.59375,
|
||||
"rewards/chosen": 0.2521739423274994,
|
||||
"rewards/margins": 0.1846893012523651,
|
||||
"rewards/rejected": 0.06748464107513427,
|
||||
"step": 55
|
||||
},
|
||||
{
|
||||
"entropy": 2.4306333363056183,
|
||||
"epoch": 0.96,
|
||||
"grad_norm": 226.28863525390625,
|
||||
"learning_rate": 6.268021954544095e-08,
|
||||
"logits/chosen": 0.27655188516120244,
|
||||
"logits/rejected": 0.40121284602477314,
|
||||
"logps/chosen": -156.78616828918456,
|
||||
"logps/rejected": -163.7671283721924,
|
||||
"loss": 0.8905390739440918,
|
||||
"mean_token_accuracy": 0.4723482772707939,
|
||||
"num_tokens": 797757.0,
|
||||
"rewards/accuracies": 0.5125,
|
||||
"rewards/chosen": 0.2607013940811157,
|
||||
"rewards/margins": 0.30302430391311647,
|
||||
"rewards/rejected": -0.04232290983200073,
|
||||
"step": 60
|
||||
},
|
||||
{
|
||||
"epoch": 1.0,
|
||||
"eval_entropy": 2.5108700938224793,
|
||||
"eval_logits/chosen": 0.2960853689074952,
|
||||
"eval_logits/rejected": 0.35102944673757674,
|
||||
"eval_logps/chosen": -161.2097156829834,
|
||||
"eval_logps/rejected": -153.38722127532958,
|
||||
"eval_loss": 0.9581051468849182,
|
||||
"eval_mean_token_accuracy": 0.4621651805639267,
|
||||
"eval_num_tokens": 829784.0,
|
||||
"eval_rewards/accuracies": 0.532,
|
||||
"eval_rewards/chosen": 0.11904637241363525,
|
||||
"eval_rewards/margins": 0.23491560649871826,
|
||||
"eval_rewards/rejected": -0.11586923408508301,
|
||||
"eval_runtime": 204.736,
|
||||
"eval_samples_per_second": 4.884,
|
||||
"eval_steps_per_second": 1.221,
|
||||
"step": 63
|
||||
},
|
||||
{
|
||||
"loss": 0.20300202071666718,
|
||||
"grad_norm": 70.3385238647461,
|
||||
"learning_rate": 4.184239109116393e-06,
|
||||
"entropy": 2.4772405922412872,
|
||||
"num_tokens": 27180.0,
|
||||
"logits/chosen": 0.29999179148367466,
|
||||
"logits/rejected": 0.3366013686931765,
|
||||
"mean_token_accuracy": 0.4766918160021305,
|
||||
"rewards/chosen": 3.185014322400093,
|
||||
"rewards/rejected": -3.17814964056015,
|
||||
"rewards/accuracies": 0.84375,
|
||||
"rewards/margins": 6.363163933157921,
|
||||
"logps/chosen": -145.2724313735962,
|
||||
"logps/rejected": -168.38544821739197,
|
||||
"epoch": 1.032,
|
||||
"step": 65
|
||||
},
|
||||
{
|
||||
"loss": 0.16016263961791993,
|
||||
"grad_norm": 46.46247482299805,
|
||||
"learning_rate": 4.006586590948141e-06,
|
||||
"entropy": 2.5059203624725344,
|
||||
"num_tokens": 86611.0,
|
||||
"logits/chosen": 0.30248451255827935,
|
||||
"logits/rejected": 0.4369742989935694,
|
||||
"mean_token_accuracy": 0.48107142075896264,
|
||||
"rewards/chosen": 3.108510234951973,
|
||||
"rewards/rejected": -3.5679119408130644,
|
||||
"rewards/accuracies": 0.93125,
|
||||
"rewards/margins": 6.6764221549034115,
|
||||
"logps/chosen": -151.66757192611695,
|
||||
"logps/rejected": -152.82527809143068,
|
||||
"epoch": 1.112,
|
||||
"step": 70
|
||||
},
|
||||
{
|
||||
"loss": 0.1984729766845703,
|
||||
"grad_norm": 112.07616424560547,
|
||||
"learning_rate": 3.81608040719339e-06,
|
||||
"entropy": 2.5288314819335938,
|
||||
"num_tokens": 153056.0,
|
||||
"logits/chosen": 0.3381024272346584,
|
||||
"logits/rejected": 0.3919709001428062,
|
||||
"mean_token_accuracy": 0.47099064812064173,
|
||||
"rewards/chosen": 2.1314487934112547,
|
||||
"rewards/rejected": -3.7832603842020034,
|
||||
"rewards/accuracies": 0.88125,
|
||||
"rewards/margins": 5.91470921933651,
|
||||
"logps/chosen": -151.99142513275146,
|
||||
"logps/rejected": -158.68587474823,
|
||||
"epoch": 1.192,
|
||||
"step": 75
|
||||
},
|
||||
{
|
||||
"loss": 0.17381094694137572,
|
||||
"grad_norm": 47.97988510131836,
|
||||
"learning_rate": 3.6143458894413463e-06,
|
||||
"entropy": 2.5066609025001525,
|
||||
"num_tokens": 215920.0,
|
||||
"logits/chosen": 0.25372562736194504,
|
||||
"logits/rejected": 0.3085220085200435,
|
||||
"mean_token_accuracy": 0.47169380336999894,
|
||||
"rewards/chosen": 2.709118887782097,
|
||||
"rewards/rejected": -3.153385379910469,
|
||||
"rewards/accuracies": 0.9375,
|
||||
"rewards/margins": 5.862504243850708,
|
||||
"logps/chosen": -127.87930164337158,
|
||||
"logps/rejected": -152.39403762817383,
|
||||
"epoch": 1.272,
|
||||
"step": 80
|
||||
},
|
||||
{
|
||||
"loss": 0.17821238040924073,
|
||||
"grad_norm": 76.58686065673828,
|
||||
"learning_rate": 3.403104165467883e-06,
|
||||
"entropy": 2.42382150888443,
|
||||
"num_tokens": 287127.0,
|
||||
"logits/chosen": 0.27046587254706894,
|
||||
"logits/rejected": 0.3554108506103396,
|
||||
"mean_token_accuracy": 0.49741546660661695,
|
||||
"rewards/chosen": 3.4181615144014357,
|
||||
"rewards/rejected": -3.8993850499391556,
|
||||
"rewards/accuracies": 0.91875,
|
||||
"rewards/margins": 7.317546558380127,
|
||||
"logps/chosen": -135.95888204574584,
|
||||
"logps/rejected": -156.9404288291931,
|
||||
"epoch": 1.3519999999999999,
|
||||
"step": 85
|
||||
},
|
||||
{
|
||||
"loss": 0.23036706447601318,
|
||||
"grad_norm": 80.35875701904297,
|
||||
"learning_rate": 3.184157475180208e-06,
|
||||
"entropy": 2.5261152565479277,
|
||||
"num_tokens": 354068.0,
|
||||
"logits/chosen": 0.2524602257174569,
|
||||
"logits/rejected": 0.30296234191214516,
|
||||
"mean_token_accuracy": 0.46826066076755524,
|
||||
"rewards/chosen": 3.04692747592926,
|
||||
"rewards/rejected": -2.7697408348321915,
|
||||
"rewards/accuracies": 0.89375,
|
||||
"rewards/margins": 5.816668316721916,
|
||||
"logps/chosen": -156.0525354385376,
|
||||
"logps/rejected": -149.48046531677247,
|
||||
"epoch": 1.432,
|
||||
"step": 90
|
||||
},
|
||||
{
|
||||
"loss": 0.16570401191711426,
|
||||
"grad_norm": 53.557090759277344,
|
||||
"learning_rate": 2.9593737945414264e-06,
|
||||
"entropy": 2.4211883395910263,
|
||||
"num_tokens": 421426.0,
|
||||
"logits/chosen": 0.17738279076359578,
|
||||
"logits/rejected": 0.17275444698543332,
|
||||
"mean_token_accuracy": 0.4731420993804932,
|
||||
"rewards/chosen": 2.8382038921117783,
|
||||
"rewards/rejected": -3.731307566165924,
|
||||
"rewards/accuracies": 0.89375,
|
||||
"rewards/margins": 6.569511443376541,
|
||||
"logps/chosen": -135.7138165473938,
|
||||
"logps/rejected": -157.41348686218262,
|
||||
"epoch": 1.512,
|
||||
"step": 95
|
||||
},
|
||||
{
|
||||
"loss": 0.1649105429649353,
|
||||
"grad_norm": 127.4275131225586,
|
||||
"learning_rate": 2.730670898658255e-06,
|
||||
"entropy": 2.341481050848961,
|
||||
"num_tokens": 489806.0,
|
||||
"logits/chosen": -0.04766494180334789,
|
||||
"logits/rejected": 0.09169179261277503,
|
||||
"mean_token_accuracy": 0.4882186971604824,
|
||||
"rewards/chosen": 3.46675723195076,
|
||||
"rewards/rejected": -3.4928264021873474,
|
||||
"rewards/accuracies": 0.9125,
|
||||
"rewards/margins": 6.959583753347397,
|
||||
"logps/chosen": -153.73596954345703,
|
||||
"logps/rejected": -152.93934383392335,
|
||||
"epoch": 1.592,
|
||||
"step": 100
|
||||
},
|
||||
{
|
||||
"eval_loss": 1.181304931640625,
|
||||
"eval_runtime": 206.6722,
|
||||
"eval_samples_per_second": 4.839,
|
||||
"eval_steps_per_second": 1.21,
|
||||
"eval_entropy": 2.3993507494926454,
|
||||
"eval_num_tokens": 489806.0,
|
||||
"eval_logits/chosen": -0.03254038471881061,
|
||||
"eval_logits/rejected": 0.02311345798919562,
|
||||
"eval_mean_token_accuracy": 0.4609604501724243,
|
||||
"eval_rewards/chosen": -0.21504417657852173,
|
||||
"eval_rewards/rejected": -0.5070599136352539,
|
||||
"eval_rewards/accuracies": 0.516,
|
||||
"eval_rewards/margins": 0.29201573705673217,
|
||||
"eval_logps/chosen": -161.87789566040038,
|
||||
"eval_logps/rejected": -154.16960359954834,
|
||||
"epoch": 1.592,
|
||||
"step": 100
|
||||
},
|
||||
{
|
||||
"loss": 0.14087371826171874,
|
||||
"grad_norm": 88.25654602050781,
|
||||
"learning_rate": 2.5e-06,
|
||||
"entropy": 2.3751278162002563,
|
||||
"num_tokens": 557126.0,
|
||||
"logits/chosen": -0.06720577408088163,
|
||||
"logits/rejected": 0.009747601991268295,
|
||||
"mean_token_accuracy": 0.4826005406677723,
|
||||
"rewards/chosen": 4.133222645521164,
|
||||
"rewards/rejected": -4.368338066339493,
|
||||
"rewards/accuracies": 0.9375,
|
||||
"rewards/margins": 8.501560699939727,
|
||||
"logps/chosen": -163.05800094604493,
|
||||
"logps/rejected": -181.62881116867067,
|
||||
"epoch": 1.6720000000000002,
|
||||
"step": 105
|
||||
},
|
||||
{
|
||||
"loss": 0.23338742256164552,
|
||||
"grad_norm": 139.0855255126953,
|
||||
"learning_rate": 2.269329101341745e-06,
|
||||
"entropy": 2.292782101035118,
|
||||
"num_tokens": 621946.0,
|
||||
"logits/chosen": -0.1230251408579616,
|
||||
"logits/rejected": -0.04259267106090293,
|
||||
"mean_token_accuracy": 0.48731986358761786,
|
||||
"rewards/chosen": 3.1854370057582857,
|
||||
"rewards/rejected": -4.053957831859589,
|
||||
"rewards/accuracies": 0.8875,
|
||||
"rewards/margins": 7.239394760131836,
|
||||
"logps/chosen": -156.97511377334595,
|
||||
"logps/rejected": -170.4386715888977,
|
||||
"epoch": 1.752,
|
||||
"step": 110
|
||||
},
|
||||
{
|
||||
"loss": 0.24213719367980957,
|
||||
"grad_norm": 52.13258743286133,
|
||||
"learning_rate": 2.040626205458574e-06,
|
||||
"entropy": 2.2945144355297087,
|
||||
"num_tokens": 691164.0,
|
||||
"logits/chosen": -0.2037358547111102,
|
||||
"logits/rejected": -0.04959464698416915,
|
||||
"mean_token_accuracy": 0.48034665957093237,
|
||||
"rewards/chosen": 2.6465539157390596,
|
||||
"rewards/rejected": -3.8257445871829985,
|
||||
"rewards/accuracies": 0.89375,
|
||||
"rewards/margins": 6.472298520803451,
|
||||
"logps/chosen": -148.64922075271608,
|
||||
"logps/rejected": -163.68930807113648,
|
||||
"epoch": 1.8319999999999999,
|
||||
"step": 115
|
||||
},
|
||||
{
|
||||
"loss": 0.16733760833740235,
|
||||
"grad_norm": 51.697227478027344,
|
||||
"learning_rate": 1.8158425248197931e-06,
|
||||
"entropy": 2.318876361846924,
|
||||
"num_tokens": 754527.0,
|
||||
"logits/chosen": -0.16565151490742838,
|
||||
"logits/rejected": -0.09252247863799953,
|
||||
"mean_token_accuracy": 0.4730261914432049,
|
||||
"rewards/chosen": 2.554230135679245,
|
||||
"rewards/rejected": -3.980307912826538,
|
||||
"rewards/accuracies": 0.90625,
|
||||
"rewards/margins": 6.5345380246639255,
|
||||
"logps/chosen": -151.05957136154174,
|
||||
"logps/rejected": -158.38998804092407,
|
||||
"epoch": 1.912,
|
||||
"step": 120
|
||||
},
|
||||
{
|
||||
"loss": 0.17435957193374635,
|
||||
"grad_norm": 67.3870620727539,
|
||||
"learning_rate": 1.5968958345321178e-06,
|
||||
"entropy": 2.373268890380859,
|
||||
"num_tokens": 823843.0,
|
||||
"logits/chosen": -0.19111626640901203,
|
||||
"logits/rejected": -0.09068037643756863,
|
||||
"mean_token_accuracy": 0.473250250518322,
|
||||
"rewards/chosen": 2.5309324622154237,
|
||||
"rewards/rejected": -3.9597329974174498,
|
||||
"rewards/accuracies": 0.90625,
|
||||
"rewards/margins": 6.4906654238700865,
|
||||
"logps/chosen": -144.4349822998047,
|
||||
"logps/rejected": -157.0623517036438,
|
||||
"epoch": 1.992,
|
||||
"step": 125
|
||||
},
|
||||
{
|
||||
"loss": 0.08384315967559815,
|
||||
"grad_norm": 6.317872524261475,
|
||||
"learning_rate": 1.3856541105586545e-06,
|
||||
"entropy": 2.378200375371509,
|
||||
"num_tokens": 880621.0,
|
||||
"logits/chosen": -0.11781226721693444,
|
||||
"logits/rejected": -0.042003764714465604,
|
||||
"mean_token_accuracy": 0.49078691171275246,
|
||||
"rewards/chosen": 4.196374575297038,
|
||||
"rewards/rejected": -5.790639360745748,
|
||||
"rewards/accuracies": 0.9583333333333334,
|
||||
"rewards/margins": 9.98701392279731,
|
||||
"logps/chosen": -139.36247073279486,
|
||||
"logps/rejected": -160.00994406806097,
|
||||
"epoch": 2.064,
|
||||
"step": 130
|
||||
},
|
||||
{
|
||||
"loss": 0.0357888251543045,
|
||||
"grad_norm": 16.372520446777344,
|
||||
"learning_rate": 1.1839195928066101e-06,
|
||||
"entropy": 2.3539724469184877,
|
||||
"num_tokens": 947062.0,
|
||||
"logits/chosen": -0.1456372075386406,
|
||||
"logits/rejected": -0.059097048477018174,
|
||||
"mean_token_accuracy": 0.4876934640109539,
|
||||
"rewards/chosen": 3.8123921036720274,
|
||||
"rewards/rejected": -5.0069794178009035,
|
||||
"rewards/accuracies": 0.975,
|
||||
"rewards/margins": 8.819371503591537,
|
||||
"logps/chosen": -144.68906011581421,
|
||||
"logps/rejected": -159.5312638282776,
|
||||
"epoch": 2.144,
|
||||
"step": 135
|
||||
},
|
||||
{
|
||||
"loss": 0.0521980881690979,
|
||||
"grad_norm": 29.679048538208008,
|
||||
"learning_rate": 9.934134090518593e-07,
|
||||
"entropy": 2.3356225162744524,
|
||||
"num_tokens": 1009620.0,
|
||||
"logits/chosen": -0.11882373575890333,
|
||||
"logits/rejected": 0.026453084276548428,
|
||||
"mean_token_accuracy": 0.48251245468854903,
|
||||
"rewards/chosen": 3.927339309453964,
|
||||
"rewards/rejected": -5.288290357589721,
|
||||
"rewards/accuracies": 0.95625,
|
||||
"rewards/margins": 9.215629595518113,
|
||||
"logps/chosen": -139.31078090667725,
|
||||
"logps/rejected": -145.80226907730102,
|
||||
"epoch": 2.224,
|
||||
"step": 140
|
||||
},
|
||||
{
|
||||
"loss": 0.03299629390239715,
|
||||
"grad_norm": 7.268758773803711,
|
||||
"learning_rate": 8.157608908836071e-07,
|
||||
"entropy": 2.3158033907413484,
|
||||
"num_tokens": 1073365.0,
|
||||
"logits/chosen": -0.17821111338030823,
|
||||
"logits/rejected": -0.10465911260719843,
|
||||
"mean_token_accuracy": 0.48976081162691115,
|
||||
"rewards/chosen": 4.720877766609192,
|
||||
"rewards/rejected": -5.949343764781952,
|
||||
"rewards/accuracies": 0.98125,
|
||||
"rewards/margins": 10.670221543312072,
|
||||
"logps/chosen": -145.11655292510986,
|
||||
"logps/rejected": -164.69618825912477,
|
||||
"epoch": 2.304,
|
||||
"step": 145
|
||||
},
|
||||
{
|
||||
"loss": 0.045380374789237975,
|
||||
"grad_norm": 12.778029441833496,
|
||||
"learning_rate": 6.524777069483526e-07,
|
||||
"entropy": 2.3338232010602953,
|
||||
"num_tokens": 1145086.0,
|
||||
"logits/chosen": -0.24220225234879864,
|
||||
"logits/rejected": -0.18092035396691847,
|
||||
"mean_token_accuracy": 0.4738804578781128,
|
||||
"rewards/chosen": 4.283064597845078,
|
||||
"rewards/rejected": -6.082264894247055,
|
||||
"rewards/accuracies": 0.95625,
|
||||
"rewards/margins": 10.365329492092133,
|
||||
"logps/chosen": -149.46499347686768,
|
||||
"logps/rejected": -172.2482801437378,
|
||||
"epoch": 2.384,
|
||||
"step": 150
|
||||
},
|
||||
{
|
||||
"eval_loss": 1.1916899681091309,
|
||||
"eval_runtime": 206.7309,
|
||||
"eval_samples_per_second": 4.837,
|
||||
"eval_steps_per_second": 1.209,
|
||||
"eval_entropy": 2.3283381662368776,
|
||||
"eval_num_tokens": 1145086.0,
|
||||
"eval_logits/chosen": -0.24593508894178606,
|
||||
"eval_logits/rejected": -0.18872405137363696,
|
||||
"eval_mean_token_accuracy": 0.4613952031135559,
|
||||
"eval_rewards/chosen": -0.6765917901992797,
|
||||
"eval_rewards/rejected": -1.086084306716919,
|
||||
"eval_rewards/accuracies": 0.533,
|
||||
"eval_rewards/margins": 0.4094925169944763,
|
||||
"eval_logps/chosen": -162.80099214172364,
|
||||
"eval_logps/rejected": -155.3276520462036,
|
||||
"epoch": 2.384,
|
||||
"step": 150
|
||||
},
|
||||
{
|
||||
"loss": 0.03839964866638183,
|
||||
"grad_norm": 26.799619674682617,
|
||||
"learning_rate": 5.049569317994013e-07,
|
||||
"entropy": 2.218647238612175,
|
||||
"num_tokens": 1213916.0,
|
||||
"logits/chosen": -0.2961522508715828,
|
||||
"logits/rejected": -0.21192918570690328,
|
||||
"mean_token_accuracy": 0.49626709893345833,
|
||||
"rewards/chosen": 3.6871350944042205,
|
||||
"rewards/rejected": -6.713302159309388,
|
||||
"rewards/accuracies": 0.96875,
|
||||
"rewards/margins": 10.40043729543686,
|
||||
"logps/chosen": -138.59407653808594,
|
||||
"logps/rejected": -181.92112674713135,
|
||||
"epoch": 2.464,
|
||||
"step": 155
|
||||
},
|
||||
{
|
||||
"loss": 0.03359568119049072,
|
||||
"grad_norm": 6.236860275268555,
|
||||
"learning_rate": 3.7445716067596506e-07,
|
||||
"entropy": 2.3031299352645873,
|
||||
"num_tokens": 1277766.0,
|
||||
"logits/chosen": -0.2408471276221063,
|
||||
"logits/rejected": -0.05440791536781857,
|
||||
"mean_token_accuracy": 0.48194736018776896,
|
||||
"rewards/chosen": 4.138598304986954,
|
||||
"rewards/rejected": -5.22828494310379,
|
||||
"rewards/accuracies": 0.975,
|
||||
"rewards/margins": 9.36688324213028,
|
||||
"logps/chosen": -127.97663774490357,
|
||||
"logps/rejected": -142.3651433944702,
|
||||
"epoch": 2.544,
|
||||
"step": 160
|
||||
},
|
||||
{
|
||||
"loss": 0.03351616859436035,
|
||||
"grad_norm": 8.428302764892578,
|
||||
"learning_rate": 2.620917716123444e-07,
|
||||
"entropy": 2.2714572310447694,
|
||||
"num_tokens": 1344187.0,
|
||||
"logits/chosen": -0.30565182218347137,
|
||||
"logits/rejected": -0.262391552365428,
|
||||
"mean_token_accuracy": 0.4966980829834938,
|
||||
"rewards/chosen": 3.4794578850269318,
|
||||
"rewards/rejected": -5.821536821126938,
|
||||
"rewards/accuracies": 0.98125,
|
||||
"rewards/margins": 9.300994729995727,
|
||||
"logps/chosen": -143.35228729248047,
|
||||
"logps/rejected": -163.5957480430603,
|
||||
"epoch": 2.624,
|
||||
"step": 165
|
||||
},
|
||||
{
|
||||
"loss": 0.03787025213241577,
|
||||
"grad_norm": 19.33875846862793,
|
||||
"learning_rate": 1.6881942648911077e-07,
|
||||
"entropy": 2.319387698173523,
|
||||
"num_tokens": 1412024.0,
|
||||
"logits/chosen": -0.2771282747536266,
|
||||
"logits/rejected": -0.1903030416102311,
|
||||
"mean_token_accuracy": 0.483600977063179,
|
||||
"rewards/chosen": 3.7413900166749956,
|
||||
"rewards/rejected": -6.968815433979034,
|
||||
"rewards/accuracies": 0.96875,
|
||||
"rewards/margins": 10.71020541191101,
|
||||
"logps/chosen": -159.3884250640869,
|
||||
"logps/rejected": -202.81982517242432,
|
||||
"epoch": 2.7039999999999997,
|
||||
"step": 170
|
||||
},
|
||||
{
|
||||
"loss": 0.030017280578613283,
|
||||
"grad_norm": 8.236591339111328,
|
||||
"learning_rate": 9.54358920679524e-08,
|
||||
"entropy": 2.296932601928711,
|
||||
"num_tokens": 1479107.0,
|
||||
"logits/chosen": -0.35752807567610184,
|
||||
"logits/rejected": -0.2152659888252221,
|
||||
"mean_token_accuracy": 0.48842705860733987,
|
||||
"rewards/chosen": 5.196063238382339,
|
||||
"rewards/rejected": -5.935459566116333,
|
||||
"rewards/accuracies": 0.98125,
|
||||
"rewards/margins": 11.131522840261459,
|
||||
"logps/chosen": -162.68478546142578,
|
||||
"logps/rejected": -166.8199408531189,
|
||||
"epoch": 2.784,
|
||||
"step": 175
|
||||
},
|
||||
{
|
||||
"loss": 0.04067146480083465,
|
||||
"grad_norm": 4.00937557220459,
|
||||
"learning_rate": 4.256725079024554e-08,
|
||||
"entropy": 2.326069247722626,
|
||||
"num_tokens": 1546945.0,
|
||||
"logits/chosen": -0.2914971237007954,
|
||||
"logits/rejected": -0.18431776261809868,
|
||||
"mean_token_accuracy": 0.4746674746274948,
|
||||
"rewards/chosen": 4.784848666191101,
|
||||
"rewards/rejected": -5.148918730020523,
|
||||
"rewards/accuracies": 0.975,
|
||||
"rewards/margins": 9.933767330646514,
|
||||
"logps/chosen": -148.99251294136047,
|
||||
"logps/rejected": -147.76169719696045,
|
||||
"epoch": 2.864,
|
||||
"step": 180
|
||||
},
|
||||
{
|
||||
"loss": 0.03373933434486389,
|
||||
"grad_norm": 6.369950771331787,
|
||||
"learning_rate": 1.0664559262413831e-08,
|
||||
"entropy": 2.2894690483808517,
|
||||
"num_tokens": 1610498.0,
|
||||
"logits/chosen": -0.31424430259859776,
|
||||
"logits/rejected": -0.1595707523796258,
|
||||
"mean_token_accuracy": 0.4808969467878342,
|
||||
"rewards/chosen": 4.609399086236953,
|
||||
"rewards/rejected": -5.366133022308349,
|
||||
"rewards/accuracies": 0.96875,
|
||||
"rewards/margins": 9.97553214430809,
|
||||
"logps/chosen": -153.0141131401062,
|
||||
"logps/rejected": -162.40540452003478,
|
||||
"epoch": 2.944,
|
||||
"step": 185
|
||||
},
|
||||
{
|
||||
"eval_loss": 1.209433674812317,
|
||||
"eval_runtime": 207.0068,
|
||||
"eval_samples_per_second": 4.831,
|
||||
"eval_steps_per_second": 1.208,
|
||||
"eval_entropy": 2.320549825191498,
|
||||
"eval_num_tokens": 1659568.0,
|
||||
"eval_logits/chosen": -0.2871145028256165,
|
||||
"eval_logits/rejected": -0.23016112940510325,
|
||||
"eval_mean_token_accuracy": 0.4607901349067688,
|
||||
"eval_rewards/chosen": -0.8323136119842529,
|
||||
"eval_rewards/rejected": -1.2596224284172057,
|
||||
"eval_rewards/accuracies": 0.529,
|
||||
"eval_rewards/margins": 0.4273088164329529,
|
||||
"eval_logps/chosen": -163.11243586730956,
|
||||
"eval_logps/rejected": -155.6747285079956,
|
||||
"epoch": 3.0,
|
||||
"step": 189
|
||||
},
|
||||
{
|
||||
"train_runtime": 2676.0265,
|
||||
"train_samples_per_second": 2.242,
|
||||
"train_steps_per_second": 0.071,
|
||||
"total_flos": 9840760918671360.0,
|
||||
"train_loss": 0.07604808514080351,
|
||||
"epoch": 3.0,
|
||||
"step": 189
|
||||
}
|
||||
]
|
||||
3
model.safetensors
Normal file
3
model.safetensors
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:cb5672dbc1c652d718f4df253689dc43e6069b8d1da2fe0c50ca19a54673c3b1
|
||||
size 1621370224
|
||||
250557
tokenizer.json
Normal file
250557
tokenizer.json
Normal file
File diff suppressed because it is too large
Load Diff
14
tokenizer_config.json
Normal file
14
tokenizer_config.json
Normal file
@@ -0,0 +1,14 @@
|
||||
{
|
||||
"add_prefix_space": false,
|
||||
"backend": "tokenizers",
|
||||
"bos_token": "<|endoftext|>",
|
||||
"eos_token": "<|endoftext|>",
|
||||
"errors": "replace",
|
||||
"is_local": false,
|
||||
"local_files_only": false,
|
||||
"model_max_length": 1000000000000000019884624838656,
|
||||
"pad_token": "<|padding|>",
|
||||
"tokenizer_class": "GPTNeoXTokenizer",
|
||||
"trim_offsets": true,
|
||||
"unk_token": "<|endoftext|>"
|
||||
}
|
||||
3
training_args.bin
Normal file
3
training_args.bin
Normal file
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:3990be1fe7ba3aac1d4d439514f84255e14a6f8b94b6ea9e4d8615fab866635a
|
||||
size 5841
|
||||
Reference in New Issue
Block a user