Files
llama3-3B-sft/checkpoint-92/trainer_state.json

679 lines
16 KiB
JSON
Raw Normal View History

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.3546987951807229,
"eval_steps": 500,
"global_step": 92,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0038554216867469878,
"grad_norm": 1.2289724349975586,
"learning_rate": 0.0,
"loss": 0.0363,
"step": 1
},
{
"epoch": 0.0077108433734939755,
"grad_norm": 1.148133635520935,
"learning_rate": 5.128205128205128e-07,
"loss": 0.042,
"step": 2
},
{
"epoch": 0.011566265060240964,
"grad_norm": 1.251704216003418,
"learning_rate": 1.0256410256410257e-06,
"loss": 0.0442,
"step": 3
},
{
"epoch": 0.015421686746987951,
"grad_norm": 1.1709717512130737,
"learning_rate": 1.5384615384615387e-06,
"loss": 0.0363,
"step": 4
},
{
"epoch": 0.01927710843373494,
"grad_norm": 1.1885852813720703,
"learning_rate": 2.0512820512820513e-06,
"loss": 0.0281,
"step": 5
},
{
"epoch": 0.02313253012048193,
"grad_norm": 0.7513725161552429,
"learning_rate": 2.564102564102564e-06,
"loss": 0.0456,
"step": 6
},
{
"epoch": 0.026987951807228915,
"grad_norm": 0.6604480147361755,
"learning_rate": 3.0769230769230774e-06,
"loss": 0.0336,
"step": 7
},
{
"epoch": 0.030843373493975902,
"grad_norm": 0.5245765447616577,
"learning_rate": 3.58974358974359e-06,
"loss": 0.0351,
"step": 8
},
{
"epoch": 0.03469879518072289,
"grad_norm": 0.35446059703826904,
"learning_rate": 4.102564102564103e-06,
"loss": 0.022,
"step": 9
},
{
"epoch": 0.03855421686746988,
"grad_norm": 0.40557414293289185,
"learning_rate": 4.615384615384616e-06,
"loss": 0.0248,
"step": 10
},
{
"epoch": 0.042409638554216866,
"grad_norm": 0.3844715356826782,
"learning_rate": 5.128205128205128e-06,
"loss": 0.0289,
"step": 11
},
{
"epoch": 0.04626506024096386,
"grad_norm": 0.31521302461624146,
"learning_rate": 5.641025641025641e-06,
"loss": 0.0221,
"step": 12
},
{
"epoch": 0.05012048192771084,
"grad_norm": 0.40441566705703735,
"learning_rate": 6.153846153846155e-06,
"loss": 0.0226,
"step": 13
},
{
"epoch": 0.05397590361445783,
"grad_norm": 0.30345258116722107,
"learning_rate": 6.666666666666667e-06,
"loss": 0.0181,
"step": 14
},
{
"epoch": 0.05783132530120482,
"grad_norm": 0.32419148087501526,
"learning_rate": 7.17948717948718e-06,
"loss": 0.0217,
"step": 15
},
{
"epoch": 0.061686746987951804,
"grad_norm": 0.29662227630615234,
"learning_rate": 7.692307692307694e-06,
"loss": 0.0216,
"step": 16
},
{
"epoch": 0.0655421686746988,
"grad_norm": 0.24562332034111023,
"learning_rate": 8.205128205128205e-06,
"loss": 0.0163,
"step": 17
},
{
"epoch": 0.06939759036144579,
"grad_norm": 0.21251554787158966,
"learning_rate": 8.717948717948719e-06,
"loss": 0.0176,
"step": 18
},
{
"epoch": 0.07325301204819278,
"grad_norm": 0.195358544588089,
"learning_rate": 9.230769230769232e-06,
"loss": 0.0121,
"step": 19
},
{
"epoch": 0.07710843373493977,
"grad_norm": 0.1519210785627365,
"learning_rate": 9.743589743589744e-06,
"loss": 0.0103,
"step": 20
},
{
"epoch": 0.08096385542168674,
"grad_norm": 0.29832565784454346,
"learning_rate": 1.0256410256410256e-05,
"loss": 0.0197,
"step": 21
},
{
"epoch": 0.08481927710843373,
"grad_norm": 0.24802711606025696,
"learning_rate": 1.076923076923077e-05,
"loss": 0.0207,
"step": 22
},
{
"epoch": 0.08867469879518072,
"grad_norm": 0.17878903448581696,
"learning_rate": 1.1282051282051283e-05,
"loss": 0.014,
"step": 23
},
{
"epoch": 0.09253012048192771,
"grad_norm": 0.23687325417995453,
"learning_rate": 1.1794871794871796e-05,
"loss": 0.0153,
"step": 24
},
{
"epoch": 0.0963855421686747,
"grad_norm": 0.29058969020843506,
"learning_rate": 1.230769230769231e-05,
"loss": 0.0149,
"step": 25
},
{
"epoch": 0.10024096385542168,
"grad_norm": 0.1624310314655304,
"learning_rate": 1.2820512820512823e-05,
"loss": 0.0127,
"step": 26
},
{
"epoch": 0.10409638554216867,
"grad_norm": 0.27256354689598083,
"learning_rate": 1.3333333333333333e-05,
"loss": 0.0173,
"step": 27
},
{
"epoch": 0.10795180722891566,
"grad_norm": 0.24831782281398773,
"learning_rate": 1.3846153846153847e-05,
"loss": 0.0161,
"step": 28
},
{
"epoch": 0.11180722891566265,
"grad_norm": 0.20417729020118713,
"learning_rate": 1.435897435897436e-05,
"loss": 0.0127,
"step": 29
},
{
"epoch": 0.11566265060240964,
"grad_norm": 0.22253485023975372,
"learning_rate": 1.4871794871794874e-05,
"loss": 0.018,
"step": 30
},
{
"epoch": 0.11951807228915663,
"grad_norm": 0.1634419709444046,
"learning_rate": 1.5384615384615387e-05,
"loss": 0.0092,
"step": 31
},
{
"epoch": 0.12337349397590361,
"grad_norm": 0.16349917650222778,
"learning_rate": 1.5897435897435897e-05,
"loss": 0.0151,
"step": 32
},
{
"epoch": 0.1272289156626506,
"grad_norm": 0.2271573394536972,
"learning_rate": 1.641025641025641e-05,
"loss": 0.0174,
"step": 33
},
{
"epoch": 0.1310843373493976,
"grad_norm": 0.1916988492012024,
"learning_rate": 1.6923076923076924e-05,
"loss": 0.0126,
"step": 34
},
{
"epoch": 0.13493975903614458,
"grad_norm": 0.23479051887989044,
"learning_rate": 1.7435897435897438e-05,
"loss": 0.0116,
"step": 35
},
{
"epoch": 0.13879518072289157,
"grad_norm": 0.18296493589878082,
"learning_rate": 1.794871794871795e-05,
"loss": 0.0133,
"step": 36
},
{
"epoch": 0.14265060240963856,
"grad_norm": 0.12307147681713104,
"learning_rate": 1.8461538461538465e-05,
"loss": 0.0093,
"step": 37
},
{
"epoch": 0.14650602409638555,
"grad_norm": 0.1736001819372177,
"learning_rate": 1.8974358974358975e-05,
"loss": 0.0097,
"step": 38
},
{
"epoch": 0.15036144578313254,
"grad_norm": 0.21048344671726227,
"learning_rate": 1.9487179487179488e-05,
"loss": 0.0121,
"step": 39
},
{
"epoch": 0.15421686746987953,
"grad_norm": 0.18844228982925415,
"learning_rate": 2e-05,
"loss": 0.0145,
"step": 40
},
{
"epoch": 0.1580722891566265,
"grad_norm": 0.24053065478801727,
"learning_rate": 2.0512820512820512e-05,
"loss": 0.0233,
"step": 41
},
{
"epoch": 0.16192771084337348,
"grad_norm": 0.16952425241470337,
"learning_rate": 2.102564102564103e-05,
"loss": 0.024,
"step": 42
},
{
"epoch": 0.16578313253012048,
"grad_norm": 0.1816851794719696,
"learning_rate": 2.153846153846154e-05,
"loss": 0.0165,
"step": 43
},
{
"epoch": 0.16963855421686747,
"grad_norm": 0.17718464136123657,
"learning_rate": 2.2051282051282056e-05,
"loss": 0.0171,
"step": 44
},
{
"epoch": 0.17349397590361446,
"grad_norm": 0.44719773530960083,
"learning_rate": 2.2564102564102566e-05,
"loss": 0.0357,
"step": 45
},
{
"epoch": 0.17734939759036145,
"grad_norm": 0.1649208813905716,
"learning_rate": 2.3076923076923076e-05,
"loss": 0.016,
"step": 46
},
{
"epoch": 0.18120481927710844,
"grad_norm": 0.17772121727466583,
"learning_rate": 2.3589743589743593e-05,
"loss": 0.0106,
"step": 47
},
{
"epoch": 0.18506024096385543,
"grad_norm": 0.30155256390571594,
"learning_rate": 2.4102564102564103e-05,
"loss": 0.0132,
"step": 48
},
{
"epoch": 0.18891566265060242,
"grad_norm": 0.1777803599834442,
"learning_rate": 2.461538461538462e-05,
"loss": 0.0089,
"step": 49
},
{
"epoch": 0.1927710843373494,
"grad_norm": 0.23959968984127045,
"learning_rate": 2.512820512820513e-05,
"loss": 0.0137,
"step": 50
},
{
"epoch": 0.1966265060240964,
"grad_norm": 0.2473219782114029,
"learning_rate": 2.5641025641025646e-05,
"loss": 0.0241,
"step": 51
},
{
"epoch": 0.20048192771084336,
"grad_norm": 0.14216162264347076,
"learning_rate": 2.6153846153846157e-05,
"loss": 0.0089,
"step": 52
},
{
"epoch": 0.20433734939759035,
"grad_norm": 0.16024824976921082,
"learning_rate": 2.6666666666666667e-05,
"loss": 0.0105,
"step": 53
},
{
"epoch": 0.20819277108433734,
"grad_norm": 0.19614927470684052,
"learning_rate": 2.7179487179487183e-05,
"loss": 0.0102,
"step": 54
},
{
"epoch": 0.21204819277108433,
"grad_norm": 0.18651551008224487,
"learning_rate": 2.7692307692307694e-05,
"loss": 0.0109,
"step": 55
},
{
"epoch": 0.21590361445783132,
"grad_norm": 0.1358720362186432,
"learning_rate": 2.820512820512821e-05,
"loss": 0.0082,
"step": 56
},
{
"epoch": 0.2197590361445783,
"grad_norm": 0.13998733460903168,
"learning_rate": 2.871794871794872e-05,
"loss": 0.0081,
"step": 57
},
{
"epoch": 0.2236144578313253,
"grad_norm": 0.1299574077129364,
"learning_rate": 2.923076923076923e-05,
"loss": 0.0067,
"step": 58
},
{
"epoch": 0.2274698795180723,
"grad_norm": 0.17477169632911682,
"learning_rate": 2.9743589743589747e-05,
"loss": 0.0091,
"step": 59
},
{
"epoch": 0.23132530120481928,
"grad_norm": 0.27078455686569214,
"learning_rate": 3.0256410256410257e-05,
"loss": 0.0128,
"step": 60
},
{
"epoch": 0.23518072289156627,
"grad_norm": 0.2184700220823288,
"learning_rate": 3.0769230769230774e-05,
"loss": 0.0236,
"step": 61
},
{
"epoch": 0.23903614457831326,
"grad_norm": 0.21013228595256805,
"learning_rate": 3.128205128205129e-05,
"loss": 0.0114,
"step": 62
},
{
"epoch": 0.24289156626506025,
"grad_norm": 0.4988560974597931,
"learning_rate": 3.1794871794871795e-05,
"loss": 0.0111,
"step": 63
},
{
"epoch": 0.24674698795180722,
"grad_norm": 0.18484456837177277,
"learning_rate": 3.230769230769231e-05,
"loss": 0.0104,
"step": 64
},
{
"epoch": 0.25060240963855424,
"grad_norm": 0.19871847331523895,
"learning_rate": 3.282051282051282e-05,
"loss": 0.0094,
"step": 65
},
{
"epoch": 0.2544578313253012,
"grad_norm": 0.17952671647071838,
"learning_rate": 3.3333333333333335e-05,
"loss": 0.0127,
"step": 66
},
{
"epoch": 0.2583132530120482,
"grad_norm": 0.29055604338645935,
"learning_rate": 3.384615384615385e-05,
"loss": 0.023,
"step": 67
},
{
"epoch": 0.2621686746987952,
"grad_norm": 0.2033795416355133,
"learning_rate": 3.435897435897436e-05,
"loss": 0.0091,
"step": 68
},
{
"epoch": 0.26602409638554214,
"grad_norm": 0.2499230057001114,
"learning_rate": 3.4871794871794875e-05,
"loss": 0.0221,
"step": 69
},
{
"epoch": 0.26987951807228916,
"grad_norm": 0.22038578987121582,
"learning_rate": 3.538461538461539e-05,
"loss": 0.0139,
"step": 70
},
{
"epoch": 0.2737349397590361,
"grad_norm": 0.14657297730445862,
"learning_rate": 3.58974358974359e-05,
"loss": 0.0104,
"step": 71
},
{
"epoch": 0.27759036144578314,
"grad_norm": 0.23861773312091827,
"learning_rate": 3.6410256410256416e-05,
"loss": 0.0126,
"step": 72
},
{
"epoch": 0.2814457831325301,
"grad_norm": 0.21007320284843445,
"learning_rate": 3.692307692307693e-05,
"loss": 0.0133,
"step": 73
},
{
"epoch": 0.2853012048192771,
"grad_norm": 0.20938654243946075,
"learning_rate": 3.7435897435897436e-05,
"loss": 0.0116,
"step": 74
},
{
"epoch": 0.2891566265060241,
"grad_norm": 0.27394789457321167,
"learning_rate": 3.794871794871795e-05,
"loss": 0.0158,
"step": 75
},
{
"epoch": 0.2930120481927711,
"grad_norm": 0.1749437153339386,
"learning_rate": 3.846153846153846e-05,
"loss": 0.0097,
"step": 76
},
{
"epoch": 0.29686746987951806,
"grad_norm": 0.2208889275789261,
"learning_rate": 3.8974358974358976e-05,
"loss": 0.024,
"step": 77
},
{
"epoch": 0.3007228915662651,
"grad_norm": 0.32802650332450867,
"learning_rate": 3.948717948717949e-05,
"loss": 0.015,
"step": 78
},
{
"epoch": 0.30457831325301205,
"grad_norm": 0.21527938544750214,
"learning_rate": 4e-05,
"loss": 0.0137,
"step": 79
},
{
"epoch": 0.30843373493975906,
"grad_norm": 0.2894026041030884,
"learning_rate": 3.999979972589652e-05,
"loss": 0.0177,
"step": 80
},
{
"epoch": 0.312289156626506,
"grad_norm": 0.21148355305194855,
"learning_rate": 3.9999198907597046e-05,
"loss": 0.0146,
"step": 81
},
{
"epoch": 0.316144578313253,
"grad_norm": 0.1950712502002716,
"learning_rate": 3.999819755713442e-05,
"loss": 0.0174,
"step": 82
},
{
"epoch": 0.32,
"grad_norm": 0.23408709466457367,
"learning_rate": 3.9996795694563096e-05,
"loss": 0.0142,
"step": 83
},
{
"epoch": 0.32385542168674697,
"grad_norm": 0.4009031355381012,
"learning_rate": 3.999499334795875e-05,
"loss": 0.014,
"step": 84
},
{
"epoch": 0.327710843373494,
"grad_norm": 0.2507084012031555,
"learning_rate": 3.999279055341771e-05,
"loss": 0.013,
"step": 85
},
{
"epoch": 0.33156626506024095,
"grad_norm": 0.2922132909297943,
"learning_rate": 3.999018735505626e-05,
"loss": 0.013,
"step": 86
},
{
"epoch": 0.33542168674698797,
"grad_norm": 0.2073613405227661,
"learning_rate": 3.998718380500971e-05,
"loss": 0.0107,
"step": 87
},
{
"epoch": 0.33927710843373493,
"grad_norm": 0.3113904595375061,
"learning_rate": 3.998377996343139e-05,
"loss": 0.0337,
"step": 88
},
{
"epoch": 0.34313253012048195,
"grad_norm": 0.18452070653438568,
"learning_rate": 3.997997589849145e-05,
"loss": 0.0137,
"step": 89
},
{
"epoch": 0.3469879518072289,
"grad_norm": 0.24420331418514252,
"learning_rate": 3.9975771686375434e-05,
"loss": 0.0104,
"step": 90
},
{
"epoch": 0.35084337349397593,
"grad_norm": 0.3163854479789734,
"learning_rate": 3.9971167411282835e-05,
"loss": 0.0133,
"step": 91
},
{
"epoch": 0.3546987951807229,
"grad_norm": 0.11558058857917786,
"learning_rate": 3.996616316542537e-05,
"loss": 0.0069,
"step": 92
}
],
"logging_steps": 1,
"max_steps": 780,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 92,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 7.051174608015196e+17,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}