285 lines
7.6 KiB
JSON
285 lines
7.6 KiB
JSON
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 3.0,
|
|
"eval_steps": 500,
|
|
"global_step": 258,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"entropy": 1.3396112367510795,
|
|
"epoch": 0.1171303074670571,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.00019999210442038162,
|
|
"loss": 1.5911,
|
|
"mean_token_accuracy": 0.6371529325842857,
|
|
"num_tokens": 81104.0,
|
|
"step": 10
|
|
},
|
|
{
|
|
"entropy": 1.1428312733769417,
|
|
"epoch": 0.2342606149341142,
|
|
"grad_norm": 0.578125,
|
|
"learning_rate": 0.00019904614256966512,
|
|
"loss": 1.1178,
|
|
"mean_token_accuracy": 0.7238687098026275,
|
|
"num_tokens": 162974.0,
|
|
"step": 20
|
|
},
|
|
{
|
|
"entropy": 0.8962877839803696,
|
|
"epoch": 0.3513909224011713,
|
|
"grad_norm": 0.478515625,
|
|
"learning_rate": 0.0001965381638833274,
|
|
"loss": 0.9277,
|
|
"mean_token_accuracy": 0.7669008579105139,
|
|
"num_tokens": 244811.0,
|
|
"step": 30
|
|
},
|
|
{
|
|
"entropy": 0.9452402792870999,
|
|
"epoch": 0.4685212298682284,
|
|
"grad_norm": 0.421875,
|
|
"learning_rate": 0.0001925077206834458,
|
|
"loss": 0.9307,
|
|
"mean_token_accuracy": 0.761869502440095,
|
|
"num_tokens": 326663.0,
|
|
"step": 40
|
|
},
|
|
{
|
|
"entropy": 0.885918003693223,
|
|
"epoch": 0.5856515373352855,
|
|
"grad_norm": 0.400390625,
|
|
"learning_rate": 0.0001870183754669526,
|
|
"loss": 0.9136,
|
|
"mean_token_accuracy": 0.7613564830273389,
|
|
"num_tokens": 408546.0,
|
|
"step": 50
|
|
},
|
|
{
|
|
"entropy": 0.7956090953201056,
|
|
"epoch": 0.7027818448023426,
|
|
"grad_norm": 0.35546875,
|
|
"learning_rate": 0.00018015669848708767,
|
|
"loss": 0.7743,
|
|
"mean_token_accuracy": 0.7908696968108415,
|
|
"num_tokens": 490427.0,
|
|
"step": 60
|
|
},
|
|
{
|
|
"entropy": 0.7252638831734657,
|
|
"epoch": 0.8199121522693997,
|
|
"grad_norm": 0.44140625,
|
|
"learning_rate": 0.0001720309024887907,
|
|
"loss": 0.7452,
|
|
"mean_token_accuracy": 0.7986918680369854,
|
|
"num_tokens": 572268.0,
|
|
"step": 70
|
|
},
|
|
{
|
|
"entropy": 0.8875785615295172,
|
|
"epoch": 0.9370424597364568,
|
|
"grad_norm": 0.3359375,
|
|
"learning_rate": 0.00016276913612907007,
|
|
"loss": 0.8771,
|
|
"mean_token_accuracy": 0.7722796119749546,
|
|
"num_tokens": 654069.0,
|
|
"step": 80
|
|
},
|
|
{
|
|
"entropy": 0.7577637726068497,
|
|
"epoch": 1.0468521229868228,
|
|
"grad_norm": 0.318359375,
|
|
"learning_rate": 0.0001525174629961296,
|
|
"loss": 0.735,
|
|
"mean_token_accuracy": 0.7980754868189494,
|
|
"num_tokens": 730754.0,
|
|
"step": 90
|
|
},
|
|
{
|
|
"entropy": 0.8036635374650359,
|
|
"epoch": 1.16398243045388,
|
|
"grad_norm": 0.375,
|
|
"learning_rate": 0.00014143755809932845,
|
|
"loss": 0.8076,
|
|
"mean_token_accuracy": 0.7897886544466018,
|
|
"num_tokens": 812566.0,
|
|
"step": 100
|
|
},
|
|
{
|
|
"entropy": 0.8438609030097723,
|
|
"epoch": 1.281112737920937,
|
|
"grad_norm": 0.33203125,
|
|
"learning_rate": 0.0001297041581577035,
|
|
"loss": 0.8318,
|
|
"mean_token_accuracy": 0.7828883446753025,
|
|
"num_tokens": 893688.0,
|
|
"step": 110
|
|
},
|
|
{
|
|
"entropy": 0.7181106580421328,
|
|
"epoch": 1.3982430453879942,
|
|
"grad_norm": 0.404296875,
|
|
"learning_rate": 0.00011750230589752762,
|
|
"loss": 0.7207,
|
|
"mean_token_accuracy": 0.8055280044674873,
|
|
"num_tokens": 975564.0,
|
|
"step": 120
|
|
},
|
|
{
|
|
"entropy": 0.7229301311075688,
|
|
"epoch": 1.5153733528550513,
|
|
"grad_norm": 0.388671875,
|
|
"learning_rate": 0.00010502443181797697,
|
|
"loss": 0.7249,
|
|
"mean_token_accuracy": 0.8056504145264626,
|
|
"num_tokens": 1057403.0,
|
|
"step": 130
|
|
},
|
|
{
|
|
"entropy": 0.7823872465640307,
|
|
"epoch": 1.6325036603221084,
|
|
"grad_norm": 0.36328125,
|
|
"learning_rate": 9.246731944720675e-05,
|
|
"loss": 0.7791,
|
|
"mean_token_accuracy": 0.7945993095636368,
|
|
"num_tokens": 1139268.0,
|
|
"step": 140
|
|
},
|
|
{
|
|
"entropy": 0.6786214027553796,
|
|
"epoch": 1.7496339677891655,
|
|
"grad_norm": 0.39453125,
|
|
"learning_rate": 8.002900194855932e-05,
|
|
"loss": 0.6803,
|
|
"mean_token_accuracy": 0.8125956118106842,
|
|
"num_tokens": 1221128.0,
|
|
"step": 150
|
|
},
|
|
{
|
|
"entropy": 0.7029102340340614,
|
|
"epoch": 1.8667642752562226,
|
|
"grad_norm": 0.451171875,
|
|
"learning_rate": 6.790563901927907e-05,
|
|
"loss": 0.6941,
|
|
"mean_token_accuracy": 0.8080258596688509,
|
|
"num_tokens": 1302883.0,
|
|
"step": 160
|
|
},
|
|
{
|
|
"entropy": 0.8408648435026407,
|
|
"epoch": 1.9838945827232797,
|
|
"grad_norm": 0.421875,
|
|
"learning_rate": 5.6288423334906735e-05,
|
|
"loss": 0.843,
|
|
"mean_token_accuracy": 0.7804605267941952,
|
|
"num_tokens": 1384758.0,
|
|
"step": 170
|
|
},
|
|
{
|
|
"entropy": 0.7994472912947337,
|
|
"epoch": 2.0937042459736457,
|
|
"grad_norm": 0.3671875,
|
|
"learning_rate": 4.5360565326573104e-05,
|
|
"loss": 0.7804,
|
|
"mean_token_accuracy": 0.7989432060718537,
|
|
"num_tokens": 1461478.0,
|
|
"step": 180
|
|
},
|
|
{
|
|
"entropy": 0.7261181980371475,
|
|
"epoch": 2.210834553440703,
|
|
"grad_norm": 0.380859375,
|
|
"learning_rate": 3.52944038430556e-05,
|
|
"loss": 0.7032,
|
|
"mean_token_accuracy": 0.8093580298125744,
|
|
"num_tokens": 1543336.0,
|
|
"step": 190
|
|
},
|
|
{
|
|
"entropy": 0.6980411611497402,
|
|
"epoch": 2.32796486090776,
|
|
"grad_norm": 0.41015625,
|
|
"learning_rate": 2.624868826418262e-05,
|
|
"loss": 0.7014,
|
|
"mean_token_accuracy": 0.8104535348713398,
|
|
"num_tokens": 1625196.0,
|
|
"step": 200
|
|
},
|
|
{
|
|
"entropy": 0.6276400487869978,
|
|
"epoch": 2.445095168374817,
|
|
"grad_norm": 0.376953125,
|
|
"learning_rate": 1.8366074928281607e-05,
|
|
"loss": 0.63,
|
|
"mean_token_accuracy": 0.8211923144757748,
|
|
"num_tokens": 1707105.0,
|
|
"step": 210
|
|
},
|
|
{
|
|
"entropy": 0.7523287607356905,
|
|
"epoch": 2.562225475841874,
|
|
"grad_norm": 0.392578125,
|
|
"learning_rate": 1.1770877356504683e-05,
|
|
"loss": 0.7501,
|
|
"mean_token_accuracy": 0.7998858217149973,
|
|
"num_tokens": 1788910.0,
|
|
"step": 220
|
|
},
|
|
{
|
|
"entropy": 0.7270868588238955,
|
|
"epoch": 2.679355783308931,
|
|
"grad_norm": 0.3671875,
|
|
"learning_rate": 6.5671057543387985e-06,
|
|
"loss": 0.7306,
|
|
"mean_token_accuracy": 0.8045763105154038,
|
|
"num_tokens": 1869982.0,
|
|
"step": 230
|
|
},
|
|
{
|
|
"entropy": 0.64420210942626,
|
|
"epoch": 2.7964860907759883,
|
|
"grad_norm": 0.416015625,
|
|
"learning_rate": 2.836826708532603e-06,
|
|
"loss": 0.6385,
|
|
"mean_token_accuracy": 0.8231038711965084,
|
|
"num_tokens": 1951891.0,
|
|
"step": 240
|
|
},
|
|
{
|
|
"entropy": 0.7004209227859974,
|
|
"epoch": 2.9136163982430454,
|
|
"grad_norm": 0.41015625,
|
|
"learning_rate": 6.388689479991605e-07,
|
|
"loss": 0.7025,
|
|
"mean_token_accuracy": 0.8102728992700576,
|
|
"num_tokens": 2033696.0,
|
|
"step": 250
|
|
}
|
|
],
|
|
"logging_steps": 10,
|
|
"max_steps": 258,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 3,
|
|
"save_steps": 500,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": true
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 5660925050880000.0,
|
|
"train_batch_size": 1,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|