Files
Malaysian-Llama-3.1-8B-Inst…/lora-embedding-128-llama3.1-8b-malaysian-8k/checkpoint-400/trainer_state.json
ModelHub XC a580c21353 初始化项目,由ModelHub XC社区提供模型
Model: mesolitica/Malaysian-Llama-3.1-8B-Instruct
Source: Original Platform
2026-08-11 15:03:18 +08:00

2835 lines
62 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.1380738695201933,
"eval_steps": 500,
"global_step": 400,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.00034518467380048324,
"grad_norm": 164.25050354003906,
"learning_rate": 0.0,
"loss": 1.9257,
"step": 1
},
{
"epoch": 0.0006903693476009665,
"grad_norm": 116.43001556396484,
"learning_rate": 2e-05,
"loss": 1.8201,
"step": 2
},
{
"epoch": 0.0010355540214014498,
"grad_norm": 111.98278045654297,
"learning_rate": 2e-05,
"loss": 1.9652,
"step": 3
},
{
"epoch": 0.001380738695201933,
"grad_norm": 312.7107238769531,
"learning_rate": 2e-05,
"loss": 1.6971,
"step": 4
},
{
"epoch": 0.0017259233690024164,
"grad_norm": 124.51359558105469,
"learning_rate": 2e-05,
"loss": 1.7228,
"step": 5
},
{
"epoch": 0.0020711080428028996,
"grad_norm": 117.87893676757812,
"learning_rate": 2e-05,
"loss": 1.7254,
"step": 6
},
{
"epoch": 0.002416292716603383,
"grad_norm": 59.12928771972656,
"learning_rate": 2e-05,
"loss": 1.473,
"step": 7
},
{
"epoch": 0.002761477390403866,
"grad_norm": 24.38951873779297,
"learning_rate": 2e-05,
"loss": 1.5216,
"step": 8
},
{
"epoch": 0.0031066620642043494,
"grad_norm": 57.787757873535156,
"learning_rate": 2e-05,
"loss": 1.5563,
"step": 9
},
{
"epoch": 0.0034518467380048328,
"grad_norm": 21.435535430908203,
"learning_rate": 2e-05,
"loss": 1.4052,
"step": 10
},
{
"epoch": 0.0037970314118053157,
"grad_norm": 25.76114273071289,
"learning_rate": 2e-05,
"loss": 1.4289,
"step": 11
},
{
"epoch": 0.004142216085605799,
"grad_norm": 16.697547912597656,
"learning_rate": 2e-05,
"loss": 1.5014,
"step": 12
},
{
"epoch": 0.0044874007594062825,
"grad_norm": 10.946109771728516,
"learning_rate": 2e-05,
"loss": 1.4236,
"step": 13
},
{
"epoch": 0.004832585433206766,
"grad_norm": 9.638275146484375,
"learning_rate": 2e-05,
"loss": 1.4098,
"step": 14
},
{
"epoch": 0.0051777701070072485,
"grad_norm": 17.02400016784668,
"learning_rate": 2e-05,
"loss": 1.4035,
"step": 15
},
{
"epoch": 0.005522954780807732,
"grad_norm": 7.689630508422852,
"learning_rate": 2e-05,
"loss": 1.3273,
"step": 16
},
{
"epoch": 0.005868139454608215,
"grad_norm": 7.028171539306641,
"learning_rate": 2e-05,
"loss": 1.3675,
"step": 17
},
{
"epoch": 0.006213324128408699,
"grad_norm": 8.425003051757812,
"learning_rate": 2e-05,
"loss": 1.3065,
"step": 18
},
{
"epoch": 0.006558508802209182,
"grad_norm": 7.860549449920654,
"learning_rate": 2e-05,
"loss": 1.2914,
"step": 19
},
{
"epoch": 0.0069036934760096655,
"grad_norm": 5.793131351470947,
"learning_rate": 2e-05,
"loss": 1.2639,
"step": 20
},
{
"epoch": 0.007248878149810148,
"grad_norm": 6.066828727722168,
"learning_rate": 2e-05,
"loss": 1.2845,
"step": 21
},
{
"epoch": 0.0075940628236106315,
"grad_norm": 6.9683074951171875,
"learning_rate": 2e-05,
"loss": 1.2839,
"step": 22
},
{
"epoch": 0.007939247497411116,
"grad_norm": 7.026453018188477,
"learning_rate": 2e-05,
"loss": 1.3129,
"step": 23
},
{
"epoch": 0.008284432171211598,
"grad_norm": 6.011166095733643,
"learning_rate": 2e-05,
"loss": 1.2021,
"step": 24
},
{
"epoch": 0.00862961684501208,
"grad_norm": 6.688496112823486,
"learning_rate": 2e-05,
"loss": 1.2988,
"step": 25
},
{
"epoch": 0.008974801518812565,
"grad_norm": 5.536924839019775,
"learning_rate": 2e-05,
"loss": 1.2529,
"step": 26
},
{
"epoch": 0.009319986192613048,
"grad_norm": 6.189913749694824,
"learning_rate": 2e-05,
"loss": 1.2541,
"step": 27
},
{
"epoch": 0.009665170866413532,
"grad_norm": 5.186566352844238,
"learning_rate": 2e-05,
"loss": 1.1685,
"step": 28
},
{
"epoch": 0.010010355540214014,
"grad_norm": 5.111907482147217,
"learning_rate": 2e-05,
"loss": 1.1647,
"step": 29
},
{
"epoch": 0.010355540214014497,
"grad_norm": 7.816215515136719,
"learning_rate": 2e-05,
"loss": 1.1613,
"step": 30
},
{
"epoch": 0.010700724887814981,
"grad_norm": 6.994287014007568,
"learning_rate": 2e-05,
"loss": 1.1798,
"step": 31
},
{
"epoch": 0.011045909561615464,
"grad_norm": 6.679455280303955,
"learning_rate": 2e-05,
"loss": 1.1356,
"step": 32
},
{
"epoch": 0.011391094235415948,
"grad_norm": 5.451405048370361,
"learning_rate": 2e-05,
"loss": 1.1679,
"step": 33
},
{
"epoch": 0.01173627890921643,
"grad_norm": 5.443926811218262,
"learning_rate": 2e-05,
"loss": 1.1729,
"step": 34
},
{
"epoch": 0.012081463583016915,
"grad_norm": 5.605351448059082,
"learning_rate": 2e-05,
"loss": 1.1808,
"step": 35
},
{
"epoch": 0.012426648256817397,
"grad_norm": 5.121994972229004,
"learning_rate": 2e-05,
"loss": 1.1379,
"step": 36
},
{
"epoch": 0.01277183293061788,
"grad_norm": 4.825695037841797,
"learning_rate": 2e-05,
"loss": 1.1291,
"step": 37
},
{
"epoch": 0.013117017604418364,
"grad_norm": 4.905743598937988,
"learning_rate": 2e-05,
"loss": 1.1687,
"step": 38
},
{
"epoch": 0.013462202278218847,
"grad_norm": 5.373997688293457,
"learning_rate": 2e-05,
"loss": 1.2164,
"step": 39
},
{
"epoch": 0.013807386952019331,
"grad_norm": 4.702381134033203,
"learning_rate": 2e-05,
"loss": 1.1769,
"step": 40
},
{
"epoch": 0.014152571625819814,
"grad_norm": 5.017072677612305,
"learning_rate": 2e-05,
"loss": 1.1081,
"step": 41
},
{
"epoch": 0.014497756299620296,
"grad_norm": 4.598694801330566,
"learning_rate": 2e-05,
"loss": 1.0872,
"step": 42
},
{
"epoch": 0.01484294097342078,
"grad_norm": 4.88613224029541,
"learning_rate": 2e-05,
"loss": 1.166,
"step": 43
},
{
"epoch": 0.015188125647221263,
"grad_norm": 4.172844886779785,
"learning_rate": 2e-05,
"loss": 1.1078,
"step": 44
},
{
"epoch": 0.015533310321021747,
"grad_norm": 4.9598612785339355,
"learning_rate": 2e-05,
"loss": 1.1068,
"step": 45
},
{
"epoch": 0.01587849499482223,
"grad_norm": 4.003320693969727,
"learning_rate": 2e-05,
"loss": 1.0951,
"step": 46
},
{
"epoch": 0.016223679668622714,
"grad_norm": 4.30601692199707,
"learning_rate": 2e-05,
"loss": 1.1088,
"step": 47
},
{
"epoch": 0.016568864342423197,
"grad_norm": 4.957517623901367,
"learning_rate": 2e-05,
"loss": 1.1152,
"step": 48
},
{
"epoch": 0.01691404901622368,
"grad_norm": 5.051650047302246,
"learning_rate": 2e-05,
"loss": 1.0514,
"step": 49
},
{
"epoch": 0.01725923369002416,
"grad_norm": 4.508876800537109,
"learning_rate": 2e-05,
"loss": 1.1081,
"step": 50
},
{
"epoch": 0.017604418363824648,
"grad_norm": 4.666370391845703,
"learning_rate": 2e-05,
"loss": 1.0889,
"step": 51
},
{
"epoch": 0.01794960303762513,
"grad_norm": 4.62983512878418,
"learning_rate": 2e-05,
"loss": 1.0561,
"step": 52
},
{
"epoch": 0.018294787711425613,
"grad_norm": 3.8194386959075928,
"learning_rate": 2e-05,
"loss": 1.0314,
"step": 53
},
{
"epoch": 0.018639972385226095,
"grad_norm": 4.9420695304870605,
"learning_rate": 2e-05,
"loss": 1.1218,
"step": 54
},
{
"epoch": 0.018985157059026578,
"grad_norm": 4.9239068031311035,
"learning_rate": 2e-05,
"loss": 1.0647,
"step": 55
},
{
"epoch": 0.019330341732827064,
"grad_norm": 4.308078289031982,
"learning_rate": 2e-05,
"loss": 1.0469,
"step": 56
},
{
"epoch": 0.019675526406627546,
"grad_norm": 4.183582782745361,
"learning_rate": 2e-05,
"loss": 1.101,
"step": 57
},
{
"epoch": 0.02002071108042803,
"grad_norm": 5.259477138519287,
"learning_rate": 2e-05,
"loss": 1.1166,
"step": 58
},
{
"epoch": 0.02036589575422851,
"grad_norm": 4.483434677124023,
"learning_rate": 2e-05,
"loss": 1.0173,
"step": 59
},
{
"epoch": 0.020711080428028994,
"grad_norm": 4.112723350524902,
"learning_rate": 2e-05,
"loss": 1.062,
"step": 60
},
{
"epoch": 0.02105626510182948,
"grad_norm": 4.924528121948242,
"learning_rate": 2e-05,
"loss": 1.0574,
"step": 61
},
{
"epoch": 0.021401449775629963,
"grad_norm": 3.717799663543701,
"learning_rate": 2e-05,
"loss": 1.0268,
"step": 62
},
{
"epoch": 0.021746634449430445,
"grad_norm": 4.5001044273376465,
"learning_rate": 2e-05,
"loss": 1.057,
"step": 63
},
{
"epoch": 0.022091819123230928,
"grad_norm": 4.214874267578125,
"learning_rate": 2e-05,
"loss": 1.1244,
"step": 64
},
{
"epoch": 0.02243700379703141,
"grad_norm": 4.098433494567871,
"learning_rate": 2e-05,
"loss": 1.0685,
"step": 65
},
{
"epoch": 0.022782188470831896,
"grad_norm": 3.9524285793304443,
"learning_rate": 2e-05,
"loss": 1.0642,
"step": 66
},
{
"epoch": 0.02312737314463238,
"grad_norm": 4.906257152557373,
"learning_rate": 2e-05,
"loss": 1.0543,
"step": 67
},
{
"epoch": 0.02347255781843286,
"grad_norm": 5.597499847412109,
"learning_rate": 2e-05,
"loss": 1.0525,
"step": 68
},
{
"epoch": 0.023817742492233344,
"grad_norm": 3.9120569229125977,
"learning_rate": 2e-05,
"loss": 1.0316,
"step": 69
},
{
"epoch": 0.02416292716603383,
"grad_norm": 3.9987313747406006,
"learning_rate": 2e-05,
"loss": 1.0415,
"step": 70
},
{
"epoch": 0.024508111839834312,
"grad_norm": 3.854943037033081,
"learning_rate": 2e-05,
"loss": 1.0162,
"step": 71
},
{
"epoch": 0.024853296513634795,
"grad_norm": 4.38804292678833,
"learning_rate": 2e-05,
"loss": 0.9893,
"step": 72
},
{
"epoch": 0.025198481187435277,
"grad_norm": 3.375614881515503,
"learning_rate": 2e-05,
"loss": 1.0135,
"step": 73
},
{
"epoch": 0.02554366586123576,
"grad_norm": 3.9334664344787598,
"learning_rate": 2e-05,
"loss": 1.0267,
"step": 74
},
{
"epoch": 0.025888850535036246,
"grad_norm": 3.8816137313842773,
"learning_rate": 2e-05,
"loss": 1.0347,
"step": 75
},
{
"epoch": 0.02623403520883673,
"grad_norm": 3.884535551071167,
"learning_rate": 2e-05,
"loss": 0.9914,
"step": 76
},
{
"epoch": 0.02657921988263721,
"grad_norm": 3.833580493927002,
"learning_rate": 2e-05,
"loss": 1.021,
"step": 77
},
{
"epoch": 0.026924404556437694,
"grad_norm": 3.6896729469299316,
"learning_rate": 2e-05,
"loss": 0.9915,
"step": 78
},
{
"epoch": 0.027269589230238176,
"grad_norm": 3.8832285404205322,
"learning_rate": 2e-05,
"loss": 1.0081,
"step": 79
},
{
"epoch": 0.027614773904038662,
"grad_norm": 4.00054931640625,
"learning_rate": 2e-05,
"loss": 0.9723,
"step": 80
},
{
"epoch": 0.027959958577839145,
"grad_norm": 3.9635231494903564,
"learning_rate": 2e-05,
"loss": 1.0677,
"step": 81
},
{
"epoch": 0.028305143251639627,
"grad_norm": 4.25091552734375,
"learning_rate": 2e-05,
"loss": 0.9683,
"step": 82
},
{
"epoch": 0.02865032792544011,
"grad_norm": 4.387684345245361,
"learning_rate": 2e-05,
"loss": 1.0273,
"step": 83
},
{
"epoch": 0.028995512599240592,
"grad_norm": 4.047482013702393,
"learning_rate": 2e-05,
"loss": 1.0372,
"step": 84
},
{
"epoch": 0.029340697273041078,
"grad_norm": 4.226908206939697,
"learning_rate": 2e-05,
"loss": 1.0192,
"step": 85
},
{
"epoch": 0.02968588194684156,
"grad_norm": 4.123228073120117,
"learning_rate": 2e-05,
"loss": 0.9915,
"step": 86
},
{
"epoch": 0.030031066620642043,
"grad_norm": 6.669504165649414,
"learning_rate": 2e-05,
"loss": 0.9531,
"step": 87
},
{
"epoch": 0.030376251294442526,
"grad_norm": 4.364908695220947,
"learning_rate": 2e-05,
"loss": 1.0042,
"step": 88
},
{
"epoch": 0.03072143596824301,
"grad_norm": 3.7988955974578857,
"learning_rate": 2e-05,
"loss": 0.9767,
"step": 89
},
{
"epoch": 0.031066620642043494,
"grad_norm": 3.547370433807373,
"learning_rate": 2e-05,
"loss": 1.0045,
"step": 90
},
{
"epoch": 0.03141180531584398,
"grad_norm": 4.054666042327881,
"learning_rate": 2e-05,
"loss": 0.9679,
"step": 91
},
{
"epoch": 0.03175698998964446,
"grad_norm": 4.089395523071289,
"learning_rate": 2e-05,
"loss": 1.009,
"step": 92
},
{
"epoch": 0.03210217466344494,
"grad_norm": 3.888781785964966,
"learning_rate": 2e-05,
"loss": 0.9993,
"step": 93
},
{
"epoch": 0.03244735933724543,
"grad_norm": 4.337654113769531,
"learning_rate": 2e-05,
"loss": 1.0637,
"step": 94
},
{
"epoch": 0.03279254401104591,
"grad_norm": 3.9866831302642822,
"learning_rate": 2e-05,
"loss": 1.0415,
"step": 95
},
{
"epoch": 0.03313772868484639,
"grad_norm": 3.694230556488037,
"learning_rate": 2e-05,
"loss": 1.0111,
"step": 96
},
{
"epoch": 0.03348291335864688,
"grad_norm": 3.8903889656066895,
"learning_rate": 2e-05,
"loss": 1.0113,
"step": 97
},
{
"epoch": 0.03382809803244736,
"grad_norm": 4.173677444458008,
"learning_rate": 2e-05,
"loss": 0.9969,
"step": 98
},
{
"epoch": 0.034173282706247844,
"grad_norm": 3.679419755935669,
"learning_rate": 2e-05,
"loss": 1.0401,
"step": 99
},
{
"epoch": 0.03451846738004832,
"grad_norm": 4.073668003082275,
"learning_rate": 2e-05,
"loss": 1.0062,
"step": 100
},
{
"epoch": 0.03486365205384881,
"grad_norm": 3.659552574157715,
"learning_rate": 2e-05,
"loss": 0.9113,
"step": 101
},
{
"epoch": 0.035208836727649295,
"grad_norm": 3.581220865249634,
"learning_rate": 2e-05,
"loss": 1.0402,
"step": 102
},
{
"epoch": 0.035554021401449774,
"grad_norm": 3.6875903606414795,
"learning_rate": 2e-05,
"loss": 1.0051,
"step": 103
},
{
"epoch": 0.03589920607525026,
"grad_norm": 3.3204426765441895,
"learning_rate": 2e-05,
"loss": 1.0041,
"step": 104
},
{
"epoch": 0.03624439074905074,
"grad_norm": 3.408184766769409,
"learning_rate": 2e-05,
"loss": 0.9501,
"step": 105
},
{
"epoch": 0.036589575422851225,
"grad_norm": 3.7698254585266113,
"learning_rate": 2e-05,
"loss": 0.9487,
"step": 106
},
{
"epoch": 0.03693476009665171,
"grad_norm": 4.5543694496154785,
"learning_rate": 2e-05,
"loss": 1.0095,
"step": 107
},
{
"epoch": 0.03727994477045219,
"grad_norm": 4.206326961517334,
"learning_rate": 2e-05,
"loss": 0.9307,
"step": 108
},
{
"epoch": 0.037625129444252677,
"grad_norm": 3.7120132446289062,
"learning_rate": 2e-05,
"loss": 0.9017,
"step": 109
},
{
"epoch": 0.037970314118053156,
"grad_norm": 3.6532175540924072,
"learning_rate": 2e-05,
"loss": 0.9544,
"step": 110
},
{
"epoch": 0.03831549879185364,
"grad_norm": 3.4927427768707275,
"learning_rate": 2e-05,
"loss": 0.97,
"step": 111
},
{
"epoch": 0.03866068346565413,
"grad_norm": 4.344557762145996,
"learning_rate": 2e-05,
"loss": 0.9311,
"step": 112
},
{
"epoch": 0.03900586813945461,
"grad_norm": 3.0494396686553955,
"learning_rate": 2e-05,
"loss": 1.0055,
"step": 113
},
{
"epoch": 0.03935105281325509,
"grad_norm": 3.7052459716796875,
"learning_rate": 2e-05,
"loss": 0.9356,
"step": 114
},
{
"epoch": 0.03969623748705557,
"grad_norm": 4.43536376953125,
"learning_rate": 2e-05,
"loss": 0.9695,
"step": 115
},
{
"epoch": 0.04004142216085606,
"grad_norm": 3.6565682888031006,
"learning_rate": 2e-05,
"loss": 1.0503,
"step": 116
},
{
"epoch": 0.040386606834656544,
"grad_norm": 3.5132741928100586,
"learning_rate": 2e-05,
"loss": 0.959,
"step": 117
},
{
"epoch": 0.04073179150845702,
"grad_norm": 4.00861120223999,
"learning_rate": 2e-05,
"loss": 0.8973,
"step": 118
},
{
"epoch": 0.04107697618225751,
"grad_norm": 4.118383407592773,
"learning_rate": 2e-05,
"loss": 0.961,
"step": 119
},
{
"epoch": 0.04142216085605799,
"grad_norm": 3.6368112564086914,
"learning_rate": 2e-05,
"loss": 1.0302,
"step": 120
},
{
"epoch": 0.041767345529858474,
"grad_norm": 3.668741226196289,
"learning_rate": 2e-05,
"loss": 0.9267,
"step": 121
},
{
"epoch": 0.04211253020365896,
"grad_norm": 3.392117500305176,
"learning_rate": 2e-05,
"loss": 1.0133,
"step": 122
},
{
"epoch": 0.04245771487745944,
"grad_norm": 3.939965009689331,
"learning_rate": 2e-05,
"loss": 0.9151,
"step": 123
},
{
"epoch": 0.042802899551259925,
"grad_norm": 3.3222975730895996,
"learning_rate": 2e-05,
"loss": 0.9028,
"step": 124
},
{
"epoch": 0.043148084225060404,
"grad_norm": 3.639970541000366,
"learning_rate": 2e-05,
"loss": 0.9709,
"step": 125
},
{
"epoch": 0.04349326889886089,
"grad_norm": 3.2109615802764893,
"learning_rate": 2e-05,
"loss": 0.9867,
"step": 126
},
{
"epoch": 0.043838453572661376,
"grad_norm": 3.3262574672698975,
"learning_rate": 2e-05,
"loss": 0.964,
"step": 127
},
{
"epoch": 0.044183638246461855,
"grad_norm": 5.754081726074219,
"learning_rate": 2e-05,
"loss": 0.8765,
"step": 128
},
{
"epoch": 0.04452882292026234,
"grad_norm": 3.367676019668579,
"learning_rate": 2e-05,
"loss": 0.9724,
"step": 129
},
{
"epoch": 0.04487400759406282,
"grad_norm": 3.8047783374786377,
"learning_rate": 2e-05,
"loss": 0.9596,
"step": 130
},
{
"epoch": 0.045219192267863306,
"grad_norm": 3.5262019634246826,
"learning_rate": 2e-05,
"loss": 0.8931,
"step": 131
},
{
"epoch": 0.04556437694166379,
"grad_norm": 3.1185085773468018,
"learning_rate": 2e-05,
"loss": 0.891,
"step": 132
},
{
"epoch": 0.04590956161546427,
"grad_norm": 3.795315980911255,
"learning_rate": 2e-05,
"loss": 0.9536,
"step": 133
},
{
"epoch": 0.04625474628926476,
"grad_norm": 3.698105812072754,
"learning_rate": 2e-05,
"loss": 0.918,
"step": 134
},
{
"epoch": 0.04659993096306524,
"grad_norm": 4.450272560119629,
"learning_rate": 2e-05,
"loss": 0.9075,
"step": 135
},
{
"epoch": 0.04694511563686572,
"grad_norm": 3.3076443672180176,
"learning_rate": 2e-05,
"loss": 0.9334,
"step": 136
},
{
"epoch": 0.04729030031066621,
"grad_norm": 3.551239252090454,
"learning_rate": 2e-05,
"loss": 0.9221,
"step": 137
},
{
"epoch": 0.04763548498446669,
"grad_norm": 3.3865537643432617,
"learning_rate": 2e-05,
"loss": 0.96,
"step": 138
},
{
"epoch": 0.047980669658267174,
"grad_norm": 3.477189302444458,
"learning_rate": 2e-05,
"loss": 0.9794,
"step": 139
},
{
"epoch": 0.04832585433206766,
"grad_norm": 3.2932441234588623,
"learning_rate": 2e-05,
"loss": 0.9078,
"step": 140
},
{
"epoch": 0.04867103900586814,
"grad_norm": 3.095069646835327,
"learning_rate": 2e-05,
"loss": 0.9045,
"step": 141
},
{
"epoch": 0.049016223679668625,
"grad_norm": 3.386526107788086,
"learning_rate": 2e-05,
"loss": 0.937,
"step": 142
},
{
"epoch": 0.049361408353469104,
"grad_norm": 3.274214267730713,
"learning_rate": 2e-05,
"loss": 0.9356,
"step": 143
},
{
"epoch": 0.04970659302726959,
"grad_norm": 3.472280263900757,
"learning_rate": 2e-05,
"loss": 0.8798,
"step": 144
},
{
"epoch": 0.050051777701070076,
"grad_norm": 3.4150500297546387,
"learning_rate": 2e-05,
"loss": 1.0118,
"step": 145
},
{
"epoch": 0.050396962374870555,
"grad_norm": 3.7823333740234375,
"learning_rate": 2e-05,
"loss": 0.9675,
"step": 146
},
{
"epoch": 0.05074214704867104,
"grad_norm": 3.460674524307251,
"learning_rate": 2e-05,
"loss": 0.9366,
"step": 147
},
{
"epoch": 0.05108733172247152,
"grad_norm": 4.081386089324951,
"learning_rate": 2e-05,
"loss": 0.9596,
"step": 148
},
{
"epoch": 0.051432516396272006,
"grad_norm": 3.5548624992370605,
"learning_rate": 2e-05,
"loss": 0.9369,
"step": 149
},
{
"epoch": 0.05177770107007249,
"grad_norm": 3.713184118270874,
"learning_rate": 2e-05,
"loss": 0.9645,
"step": 150
},
{
"epoch": 0.05212288574387297,
"grad_norm": 9.342556953430176,
"learning_rate": 2e-05,
"loss": 0.953,
"step": 151
},
{
"epoch": 0.05246807041767346,
"grad_norm": 3.330892562866211,
"learning_rate": 2e-05,
"loss": 0.9851,
"step": 152
},
{
"epoch": 0.052813255091473936,
"grad_norm": 3.2820513248443604,
"learning_rate": 2e-05,
"loss": 0.9881,
"step": 153
},
{
"epoch": 0.05315843976527442,
"grad_norm": 3.08601713180542,
"learning_rate": 2e-05,
"loss": 0.8678,
"step": 154
},
{
"epoch": 0.05350362443907491,
"grad_norm": 3.466398239135742,
"learning_rate": 2e-05,
"loss": 0.9688,
"step": 155
},
{
"epoch": 0.05384880911287539,
"grad_norm": 3.8165998458862305,
"learning_rate": 2e-05,
"loss": 0.9516,
"step": 156
},
{
"epoch": 0.05419399378667587,
"grad_norm": 3.843984365463257,
"learning_rate": 2e-05,
"loss": 0.8846,
"step": 157
},
{
"epoch": 0.05453917846047635,
"grad_norm": 3.6460742950439453,
"learning_rate": 2e-05,
"loss": 0.9738,
"step": 158
},
{
"epoch": 0.05488436313427684,
"grad_norm": 3.6064538955688477,
"learning_rate": 2e-05,
"loss": 0.8974,
"step": 159
},
{
"epoch": 0.055229547808077324,
"grad_norm": 3.8065435886383057,
"learning_rate": 2e-05,
"loss": 0.9804,
"step": 160
},
{
"epoch": 0.0555747324818778,
"grad_norm": 3.020841121673584,
"learning_rate": 2e-05,
"loss": 0.9037,
"step": 161
},
{
"epoch": 0.05591991715567829,
"grad_norm": 3.5063493251800537,
"learning_rate": 2e-05,
"loss": 0.892,
"step": 162
},
{
"epoch": 0.05626510182947877,
"grad_norm": 3.2224860191345215,
"learning_rate": 2e-05,
"loss": 0.8995,
"step": 163
},
{
"epoch": 0.056610286503279254,
"grad_norm": 3.520097494125366,
"learning_rate": 2e-05,
"loss": 0.9791,
"step": 164
},
{
"epoch": 0.05695547117707974,
"grad_norm": 3.435135841369629,
"learning_rate": 2e-05,
"loss": 1.0013,
"step": 165
},
{
"epoch": 0.05730065585088022,
"grad_norm": 3.173973321914673,
"learning_rate": 2e-05,
"loss": 0.9146,
"step": 166
},
{
"epoch": 0.057645840524680705,
"grad_norm": 3.4863386154174805,
"learning_rate": 2e-05,
"loss": 0.9885,
"step": 167
},
{
"epoch": 0.057991025198481184,
"grad_norm": 3.2673957347869873,
"learning_rate": 2e-05,
"loss": 0.9354,
"step": 168
},
{
"epoch": 0.05833620987228167,
"grad_norm": 3.613051652908325,
"learning_rate": 2e-05,
"loss": 0.9169,
"step": 169
},
{
"epoch": 0.058681394546082156,
"grad_norm": 3.6220316886901855,
"learning_rate": 2e-05,
"loss": 0.9123,
"step": 170
},
{
"epoch": 0.059026579219882636,
"grad_norm": 2.9920058250427246,
"learning_rate": 2e-05,
"loss": 0.9228,
"step": 171
},
{
"epoch": 0.05937176389368312,
"grad_norm": 3.1163201332092285,
"learning_rate": 2e-05,
"loss": 0.9196,
"step": 172
},
{
"epoch": 0.0597169485674836,
"grad_norm": 3.5045080184936523,
"learning_rate": 2e-05,
"loss": 0.9711,
"step": 173
},
{
"epoch": 0.06006213324128409,
"grad_norm": 3.3398544788360596,
"learning_rate": 2e-05,
"loss": 0.8714,
"step": 174
},
{
"epoch": 0.06040731791508457,
"grad_norm": 2.9095466136932373,
"learning_rate": 2e-05,
"loss": 0.8746,
"step": 175
},
{
"epoch": 0.06075250258888505,
"grad_norm": 3.1426031589508057,
"learning_rate": 2e-05,
"loss": 0.8826,
"step": 176
},
{
"epoch": 0.06109768726268554,
"grad_norm": 4.104501724243164,
"learning_rate": 2e-05,
"loss": 0.9346,
"step": 177
},
{
"epoch": 0.06144287193648602,
"grad_norm": 2.990579128265381,
"learning_rate": 2e-05,
"loss": 0.9675,
"step": 178
},
{
"epoch": 0.0617880566102865,
"grad_norm": 3.756319284439087,
"learning_rate": 2e-05,
"loss": 0.9229,
"step": 179
},
{
"epoch": 0.06213324128408699,
"grad_norm": 3.5764338970184326,
"learning_rate": 2e-05,
"loss": 0.9925,
"step": 180
},
{
"epoch": 0.06247842595788747,
"grad_norm": 3.068021774291992,
"learning_rate": 2e-05,
"loss": 0.8987,
"step": 181
},
{
"epoch": 0.06282361063168795,
"grad_norm": 3.2142879962921143,
"learning_rate": 2e-05,
"loss": 0.8418,
"step": 182
},
{
"epoch": 0.06316879530548844,
"grad_norm": 3.3960886001586914,
"learning_rate": 2e-05,
"loss": 0.8892,
"step": 183
},
{
"epoch": 0.06351397997928893,
"grad_norm": 4.435737609863281,
"learning_rate": 2e-05,
"loss": 0.9485,
"step": 184
},
{
"epoch": 0.0638591646530894,
"grad_norm": 11.62714958190918,
"learning_rate": 2e-05,
"loss": 0.8685,
"step": 185
},
{
"epoch": 0.06420434932688988,
"grad_norm": 3.0193748474121094,
"learning_rate": 2e-05,
"loss": 0.9131,
"step": 186
},
{
"epoch": 0.06454953400069037,
"grad_norm": 3.1290862560272217,
"learning_rate": 2e-05,
"loss": 0.9776,
"step": 187
},
{
"epoch": 0.06489471867449086,
"grad_norm": 3.153416872024536,
"learning_rate": 2e-05,
"loss": 0.9031,
"step": 188
},
{
"epoch": 0.06523990334829134,
"grad_norm": 3.450758457183838,
"learning_rate": 2e-05,
"loss": 0.8928,
"step": 189
},
{
"epoch": 0.06558508802209181,
"grad_norm": 3.281147003173828,
"learning_rate": 2e-05,
"loss": 1.0054,
"step": 190
},
{
"epoch": 0.0659302726958923,
"grad_norm": 3.1141176223754883,
"learning_rate": 2e-05,
"loss": 0.913,
"step": 191
},
{
"epoch": 0.06627545736969279,
"grad_norm": 2.945939064025879,
"learning_rate": 2e-05,
"loss": 0.895,
"step": 192
},
{
"epoch": 0.06662064204349327,
"grad_norm": 3.141927719116211,
"learning_rate": 2e-05,
"loss": 0.9336,
"step": 193
},
{
"epoch": 0.06696582671729376,
"grad_norm": 3.6074554920196533,
"learning_rate": 2e-05,
"loss": 0.9821,
"step": 194
},
{
"epoch": 0.06731101139109423,
"grad_norm": 2.96323823928833,
"learning_rate": 2e-05,
"loss": 0.9417,
"step": 195
},
{
"epoch": 0.06765619606489472,
"grad_norm": 3.4270036220550537,
"learning_rate": 2e-05,
"loss": 0.9268,
"step": 196
},
{
"epoch": 0.0680013807386952,
"grad_norm": 3.006737232208252,
"learning_rate": 2e-05,
"loss": 0.9125,
"step": 197
},
{
"epoch": 0.06834656541249569,
"grad_norm": 3.3677432537078857,
"learning_rate": 2e-05,
"loss": 0.9403,
"step": 198
},
{
"epoch": 0.06869175008629617,
"grad_norm": 3.6785035133361816,
"learning_rate": 2e-05,
"loss": 0.8477,
"step": 199
},
{
"epoch": 0.06903693476009665,
"grad_norm": 3.1328837871551514,
"learning_rate": 2e-05,
"loss": 0.8866,
"step": 200
},
{
"epoch": 0.06938211943389713,
"grad_norm": 3.178600311279297,
"learning_rate": 2e-05,
"loss": 0.8418,
"step": 201
},
{
"epoch": 0.06972730410769762,
"grad_norm": 3.471315622329712,
"learning_rate": 2e-05,
"loss": 0.8908,
"step": 202
},
{
"epoch": 0.0700724887814981,
"grad_norm": 3.3694980144500732,
"learning_rate": 2e-05,
"loss": 0.8825,
"step": 203
},
{
"epoch": 0.07041767345529859,
"grad_norm": 3.511202812194824,
"learning_rate": 2e-05,
"loss": 0.89,
"step": 204
},
{
"epoch": 0.07076285812909906,
"grad_norm": 3.5508413314819336,
"learning_rate": 2e-05,
"loss": 0.8933,
"step": 205
},
{
"epoch": 0.07110804280289955,
"grad_norm": 2.9084413051605225,
"learning_rate": 2e-05,
"loss": 0.9258,
"step": 206
},
{
"epoch": 0.07145322747670003,
"grad_norm": 3.2880771160125732,
"learning_rate": 2e-05,
"loss": 0.9357,
"step": 207
},
{
"epoch": 0.07179841215050052,
"grad_norm": 3.110895872116089,
"learning_rate": 2e-05,
"loss": 0.8697,
"step": 208
},
{
"epoch": 0.072143596824301,
"grad_norm": 3.059079170227051,
"learning_rate": 2e-05,
"loss": 0.8579,
"step": 209
},
{
"epoch": 0.07248878149810148,
"grad_norm": 2.9385037422180176,
"learning_rate": 2e-05,
"loss": 0.8913,
"step": 210
},
{
"epoch": 0.07283396617190196,
"grad_norm": 2.984720468521118,
"learning_rate": 2e-05,
"loss": 0.9311,
"step": 211
},
{
"epoch": 0.07317915084570245,
"grad_norm": 3.1889357566833496,
"learning_rate": 2e-05,
"loss": 0.931,
"step": 212
},
{
"epoch": 0.07352433551950294,
"grad_norm": 3.020983934402466,
"learning_rate": 2e-05,
"loss": 0.8572,
"step": 213
},
{
"epoch": 0.07386952019330342,
"grad_norm": 3.3382914066314697,
"learning_rate": 2e-05,
"loss": 0.9128,
"step": 214
},
{
"epoch": 0.0742147048671039,
"grad_norm": 3.1657910346984863,
"learning_rate": 2e-05,
"loss": 0.8976,
"step": 215
},
{
"epoch": 0.07455988954090438,
"grad_norm": 3.058868885040283,
"learning_rate": 2e-05,
"loss": 0.8939,
"step": 216
},
{
"epoch": 0.07490507421470487,
"grad_norm": 3.422123908996582,
"learning_rate": 2e-05,
"loss": 0.9378,
"step": 217
},
{
"epoch": 0.07525025888850535,
"grad_norm": 3.1783478260040283,
"learning_rate": 2e-05,
"loss": 0.9485,
"step": 218
},
{
"epoch": 0.07559544356230584,
"grad_norm": 3.0557048320770264,
"learning_rate": 2e-05,
"loss": 0.8256,
"step": 219
},
{
"epoch": 0.07594062823610631,
"grad_norm": 2.9779226779937744,
"learning_rate": 2e-05,
"loss": 0.8713,
"step": 220
},
{
"epoch": 0.0762858129099068,
"grad_norm": 3.3758676052093506,
"learning_rate": 2e-05,
"loss": 0.8843,
"step": 221
},
{
"epoch": 0.07663099758370728,
"grad_norm": 3.1416192054748535,
"learning_rate": 2e-05,
"loss": 0.9064,
"step": 222
},
{
"epoch": 0.07697618225750777,
"grad_norm": 2.9653568267822266,
"learning_rate": 2e-05,
"loss": 0.8296,
"step": 223
},
{
"epoch": 0.07732136693130826,
"grad_norm": 3.2615296840667725,
"learning_rate": 2e-05,
"loss": 0.9057,
"step": 224
},
{
"epoch": 0.07766655160510873,
"grad_norm": 3.3381457328796387,
"learning_rate": 2e-05,
"loss": 0.9088,
"step": 225
},
{
"epoch": 0.07801173627890921,
"grad_norm": 3.4600749015808105,
"learning_rate": 2e-05,
"loss": 0.86,
"step": 226
},
{
"epoch": 0.0783569209527097,
"grad_norm": 3.2292826175689697,
"learning_rate": 2e-05,
"loss": 0.9591,
"step": 227
},
{
"epoch": 0.07870210562651019,
"grad_norm": 3.345545530319214,
"learning_rate": 2e-05,
"loss": 0.8476,
"step": 228
},
{
"epoch": 0.07904729030031067,
"grad_norm": 3.09397292137146,
"learning_rate": 2e-05,
"loss": 0.8652,
"step": 229
},
{
"epoch": 0.07939247497411114,
"grad_norm": 3.004117965698242,
"learning_rate": 2e-05,
"loss": 0.9689,
"step": 230
},
{
"epoch": 0.07973765964791163,
"grad_norm": 3.200100898742676,
"learning_rate": 2e-05,
"loss": 0.8666,
"step": 231
},
{
"epoch": 0.08008284432171212,
"grad_norm": 2.7272403240203857,
"learning_rate": 2e-05,
"loss": 0.8602,
"step": 232
},
{
"epoch": 0.0804280289955126,
"grad_norm": 3.2486329078674316,
"learning_rate": 2e-05,
"loss": 0.8464,
"step": 233
},
{
"epoch": 0.08077321366931309,
"grad_norm": 3.303467035293579,
"learning_rate": 2e-05,
"loss": 0.873,
"step": 234
},
{
"epoch": 0.08111839834311356,
"grad_norm": 3.0120198726654053,
"learning_rate": 2e-05,
"loss": 0.8934,
"step": 235
},
{
"epoch": 0.08146358301691405,
"grad_norm": 2.962071657180786,
"learning_rate": 2e-05,
"loss": 0.8904,
"step": 236
},
{
"epoch": 0.08180876769071453,
"grad_norm": 3.7542247772216797,
"learning_rate": 2e-05,
"loss": 0.9119,
"step": 237
},
{
"epoch": 0.08215395236451502,
"grad_norm": 3.281599521636963,
"learning_rate": 2e-05,
"loss": 0.9107,
"step": 238
},
{
"epoch": 0.0824991370383155,
"grad_norm": 3.1624579429626465,
"learning_rate": 2e-05,
"loss": 0.8766,
"step": 239
},
{
"epoch": 0.08284432171211598,
"grad_norm": 3.3022897243499756,
"learning_rate": 2e-05,
"loss": 0.9303,
"step": 240
},
{
"epoch": 0.08318950638591646,
"grad_norm": 3.1247267723083496,
"learning_rate": 2e-05,
"loss": 0.9125,
"step": 241
},
{
"epoch": 0.08353469105971695,
"grad_norm": 3.2210910320281982,
"learning_rate": 2e-05,
"loss": 0.9221,
"step": 242
},
{
"epoch": 0.08387987573351743,
"grad_norm": 3.1737873554229736,
"learning_rate": 2e-05,
"loss": 0.8178,
"step": 243
},
{
"epoch": 0.08422506040731792,
"grad_norm": 3.2427146434783936,
"learning_rate": 2e-05,
"loss": 0.9566,
"step": 244
},
{
"epoch": 0.08457024508111839,
"grad_norm": 3.4193999767303467,
"learning_rate": 2e-05,
"loss": 0.8557,
"step": 245
},
{
"epoch": 0.08491542975491888,
"grad_norm": 3.4254438877105713,
"learning_rate": 2e-05,
"loss": 0.8968,
"step": 246
},
{
"epoch": 0.08526061442871936,
"grad_norm": 3.159757614135742,
"learning_rate": 2e-05,
"loss": 0.9018,
"step": 247
},
{
"epoch": 0.08560579910251985,
"grad_norm": 3.187760353088379,
"learning_rate": 2e-05,
"loss": 0.9057,
"step": 248
},
{
"epoch": 0.08595098377632034,
"grad_norm": 2.959864616394043,
"learning_rate": 2e-05,
"loss": 0.904,
"step": 249
},
{
"epoch": 0.08629616845012081,
"grad_norm": 3.240973711013794,
"learning_rate": 2e-05,
"loss": 0.9294,
"step": 250
},
{
"epoch": 0.0866413531239213,
"grad_norm": 2.98917555809021,
"learning_rate": 2e-05,
"loss": 0.8764,
"step": 251
},
{
"epoch": 0.08698653779772178,
"grad_norm": 2.8783609867095947,
"learning_rate": 2e-05,
"loss": 0.8941,
"step": 252
},
{
"epoch": 0.08733172247152227,
"grad_norm": 3.0823488235473633,
"learning_rate": 2e-05,
"loss": 0.9319,
"step": 253
},
{
"epoch": 0.08767690714532275,
"grad_norm": 3.0972771644592285,
"learning_rate": 2e-05,
"loss": 0.8236,
"step": 254
},
{
"epoch": 0.08802209181912322,
"grad_norm": 3.005472421646118,
"learning_rate": 2e-05,
"loss": 0.8301,
"step": 255
},
{
"epoch": 0.08836727649292371,
"grad_norm": 3.145705223083496,
"learning_rate": 2e-05,
"loss": 0.866,
"step": 256
},
{
"epoch": 0.0887124611667242,
"grad_norm": 2.7804439067840576,
"learning_rate": 2e-05,
"loss": 0.8594,
"step": 257
},
{
"epoch": 0.08905764584052468,
"grad_norm": 3.092439889907837,
"learning_rate": 2e-05,
"loss": 0.8486,
"step": 258
},
{
"epoch": 0.08940283051432517,
"grad_norm": 3.228419303894043,
"learning_rate": 2e-05,
"loss": 0.8338,
"step": 259
},
{
"epoch": 0.08974801518812564,
"grad_norm": 3.093811273574829,
"learning_rate": 2e-05,
"loss": 0.9424,
"step": 260
},
{
"epoch": 0.09009319986192613,
"grad_norm": 3.0747523307800293,
"learning_rate": 2e-05,
"loss": 0.8944,
"step": 261
},
{
"epoch": 0.09043838453572661,
"grad_norm": 3.186995267868042,
"learning_rate": 2e-05,
"loss": 0.8586,
"step": 262
},
{
"epoch": 0.0907835692095271,
"grad_norm": 3.1833300590515137,
"learning_rate": 2e-05,
"loss": 0.8728,
"step": 263
},
{
"epoch": 0.09112875388332758,
"grad_norm": 3.0900795459747314,
"learning_rate": 2e-05,
"loss": 0.9022,
"step": 264
},
{
"epoch": 0.09147393855712806,
"grad_norm": 3.004206895828247,
"learning_rate": 2e-05,
"loss": 0.9062,
"step": 265
},
{
"epoch": 0.09181912323092854,
"grad_norm": 3.1954448223114014,
"learning_rate": 2e-05,
"loss": 0.8732,
"step": 266
},
{
"epoch": 0.09216430790472903,
"grad_norm": 3.324725866317749,
"learning_rate": 2e-05,
"loss": 0.9214,
"step": 267
},
{
"epoch": 0.09250949257852951,
"grad_norm": 2.8366189002990723,
"learning_rate": 2e-05,
"loss": 0.9153,
"step": 268
},
{
"epoch": 0.09285467725233,
"grad_norm": 3.264113187789917,
"learning_rate": 2e-05,
"loss": 0.8697,
"step": 269
},
{
"epoch": 0.09319986192613049,
"grad_norm": 3.186286211013794,
"learning_rate": 2e-05,
"loss": 0.9348,
"step": 270
},
{
"epoch": 0.09354504659993096,
"grad_norm": 2.8541440963745117,
"learning_rate": 2e-05,
"loss": 0.9067,
"step": 271
},
{
"epoch": 0.09389023127373144,
"grad_norm": 3.074235200881958,
"learning_rate": 2e-05,
"loss": 0.8935,
"step": 272
},
{
"epoch": 0.09423541594753193,
"grad_norm": 3.0192456245422363,
"learning_rate": 2e-05,
"loss": 0.8231,
"step": 273
},
{
"epoch": 0.09458060062133242,
"grad_norm": 2.740384101867676,
"learning_rate": 2e-05,
"loss": 0.8533,
"step": 274
},
{
"epoch": 0.0949257852951329,
"grad_norm": 2.9101722240448,
"learning_rate": 2e-05,
"loss": 0.8529,
"step": 275
},
{
"epoch": 0.09527096996893337,
"grad_norm": 3.137927770614624,
"learning_rate": 2e-05,
"loss": 0.9192,
"step": 276
},
{
"epoch": 0.09561615464273386,
"grad_norm": 3.054185628890991,
"learning_rate": 2e-05,
"loss": 0.8945,
"step": 277
},
{
"epoch": 0.09596133931653435,
"grad_norm": 3.1088597774505615,
"learning_rate": 2e-05,
"loss": 0.9008,
"step": 278
},
{
"epoch": 0.09630652399033483,
"grad_norm": 2.7827138900756836,
"learning_rate": 2e-05,
"loss": 0.8461,
"step": 279
},
{
"epoch": 0.09665170866413532,
"grad_norm": 2.864086389541626,
"learning_rate": 2e-05,
"loss": 0.8751,
"step": 280
},
{
"epoch": 0.09699689333793579,
"grad_norm": 3.1949148178100586,
"learning_rate": 2e-05,
"loss": 0.8377,
"step": 281
},
{
"epoch": 0.09734207801173628,
"grad_norm": 2.7971835136413574,
"learning_rate": 2e-05,
"loss": 0.9062,
"step": 282
},
{
"epoch": 0.09768726268553676,
"grad_norm": 6.014020919799805,
"learning_rate": 2e-05,
"loss": 0.8477,
"step": 283
},
{
"epoch": 0.09803244735933725,
"grad_norm": 3.1988205909729004,
"learning_rate": 2e-05,
"loss": 0.8605,
"step": 284
},
{
"epoch": 0.09837763203313774,
"grad_norm": 3.0080959796905518,
"learning_rate": 2e-05,
"loss": 0.9122,
"step": 285
},
{
"epoch": 0.09872281670693821,
"grad_norm": 2.848585844039917,
"learning_rate": 2e-05,
"loss": 0.861,
"step": 286
},
{
"epoch": 0.0990680013807387,
"grad_norm": 3.069856882095337,
"learning_rate": 2e-05,
"loss": 0.9373,
"step": 287
},
{
"epoch": 0.09941318605453918,
"grad_norm": 3.0742900371551514,
"learning_rate": 2e-05,
"loss": 0.907,
"step": 288
},
{
"epoch": 0.09975837072833967,
"grad_norm": 2.8606960773468018,
"learning_rate": 2e-05,
"loss": 0.8644,
"step": 289
},
{
"epoch": 0.10010355540214015,
"grad_norm": 2.9489126205444336,
"learning_rate": 2e-05,
"loss": 0.8922,
"step": 290
},
{
"epoch": 0.10044874007594062,
"grad_norm": 3.0227949619293213,
"learning_rate": 2e-05,
"loss": 0.9255,
"step": 291
},
{
"epoch": 0.10079392474974111,
"grad_norm": 2.758237361907959,
"learning_rate": 2e-05,
"loss": 0.8339,
"step": 292
},
{
"epoch": 0.1011391094235416,
"grad_norm": 2.8767168521881104,
"learning_rate": 2e-05,
"loss": 0.8697,
"step": 293
},
{
"epoch": 0.10148429409734208,
"grad_norm": 2.8063676357269287,
"learning_rate": 2e-05,
"loss": 0.8628,
"step": 294
},
{
"epoch": 0.10182947877114257,
"grad_norm": 2.9139151573181152,
"learning_rate": 2e-05,
"loss": 0.9157,
"step": 295
},
{
"epoch": 0.10217466344494304,
"grad_norm": 2.857400894165039,
"learning_rate": 2e-05,
"loss": 0.892,
"step": 296
},
{
"epoch": 0.10251984811874353,
"grad_norm": 2.8675410747528076,
"learning_rate": 2e-05,
"loss": 0.8438,
"step": 297
},
{
"epoch": 0.10286503279254401,
"grad_norm": 2.8956315517425537,
"learning_rate": 2e-05,
"loss": 0.847,
"step": 298
},
{
"epoch": 0.1032102174663445,
"grad_norm": 2.743086099624634,
"learning_rate": 2e-05,
"loss": 0.9041,
"step": 299
},
{
"epoch": 0.10355540214014498,
"grad_norm": 3.0366575717926025,
"learning_rate": 2e-05,
"loss": 0.8704,
"step": 300
},
{
"epoch": 0.10390058681394546,
"grad_norm": 3.290945291519165,
"learning_rate": 2e-05,
"loss": 0.7993,
"step": 301
},
{
"epoch": 0.10424577148774594,
"grad_norm": 2.562634229660034,
"learning_rate": 2e-05,
"loss": 0.7964,
"step": 302
},
{
"epoch": 0.10459095616154643,
"grad_norm": 3.005824089050293,
"learning_rate": 2e-05,
"loss": 0.8158,
"step": 303
},
{
"epoch": 0.10493614083534691,
"grad_norm": 2.912410259246826,
"learning_rate": 2e-05,
"loss": 0.8584,
"step": 304
},
{
"epoch": 0.1052813255091474,
"grad_norm": 2.7015678882598877,
"learning_rate": 2e-05,
"loss": 0.8731,
"step": 305
},
{
"epoch": 0.10562651018294787,
"grad_norm": 2.857595682144165,
"learning_rate": 2e-05,
"loss": 0.8809,
"step": 306
},
{
"epoch": 0.10597169485674836,
"grad_norm": 2.7211265563964844,
"learning_rate": 2e-05,
"loss": 0.9234,
"step": 307
},
{
"epoch": 0.10631687953054884,
"grad_norm": 3.018676519393921,
"learning_rate": 2e-05,
"loss": 0.9101,
"step": 308
},
{
"epoch": 0.10666206420434933,
"grad_norm": 2.8703527450561523,
"learning_rate": 2e-05,
"loss": 0.852,
"step": 309
},
{
"epoch": 0.10700724887814982,
"grad_norm": 2.912076473236084,
"learning_rate": 2e-05,
"loss": 0.8749,
"step": 310
},
{
"epoch": 0.10735243355195029,
"grad_norm": 2.652156352996826,
"learning_rate": 2e-05,
"loss": 0.8838,
"step": 311
},
{
"epoch": 0.10769761822575077,
"grad_norm": 2.8902244567871094,
"learning_rate": 2e-05,
"loss": 0.8898,
"step": 312
},
{
"epoch": 0.10804280289955126,
"grad_norm": 2.7108359336853027,
"learning_rate": 2e-05,
"loss": 0.8312,
"step": 313
},
{
"epoch": 0.10838798757335175,
"grad_norm": 2.6468076705932617,
"learning_rate": 2e-05,
"loss": 0.7757,
"step": 314
},
{
"epoch": 0.10873317224715223,
"grad_norm": 2.969503402709961,
"learning_rate": 2e-05,
"loss": 0.8498,
"step": 315
},
{
"epoch": 0.1090783569209527,
"grad_norm": 2.7394843101501465,
"learning_rate": 2e-05,
"loss": 0.9067,
"step": 316
},
{
"epoch": 0.10942354159475319,
"grad_norm": 2.8321640491485596,
"learning_rate": 2e-05,
"loss": 0.8693,
"step": 317
},
{
"epoch": 0.10976872626855368,
"grad_norm": 3.0017828941345215,
"learning_rate": 2e-05,
"loss": 0.8555,
"step": 318
},
{
"epoch": 0.11011391094235416,
"grad_norm": 2.7267954349517822,
"learning_rate": 2e-05,
"loss": 0.8947,
"step": 319
},
{
"epoch": 0.11045909561615465,
"grad_norm": 2.9304072856903076,
"learning_rate": 2e-05,
"loss": 0.9042,
"step": 320
},
{
"epoch": 0.11080428028995512,
"grad_norm": 2.9202630519866943,
"learning_rate": 2e-05,
"loss": 0.8426,
"step": 321
},
{
"epoch": 0.1111494649637556,
"grad_norm": 3.0602047443389893,
"learning_rate": 2e-05,
"loss": 0.8573,
"step": 322
},
{
"epoch": 0.11149464963755609,
"grad_norm": 2.987820863723755,
"learning_rate": 2e-05,
"loss": 0.8695,
"step": 323
},
{
"epoch": 0.11183983431135658,
"grad_norm": 3.158129930496216,
"learning_rate": 2e-05,
"loss": 0.9306,
"step": 324
},
{
"epoch": 0.11218501898515706,
"grad_norm": 2.893429756164551,
"learning_rate": 2e-05,
"loss": 0.9157,
"step": 325
},
{
"epoch": 0.11253020365895754,
"grad_norm": 3.009833335876465,
"learning_rate": 2e-05,
"loss": 0.9162,
"step": 326
},
{
"epoch": 0.11287538833275802,
"grad_norm": 2.768258571624756,
"learning_rate": 2e-05,
"loss": 0.8547,
"step": 327
},
{
"epoch": 0.11322057300655851,
"grad_norm": 3.0964066982269287,
"learning_rate": 2e-05,
"loss": 0.8735,
"step": 328
},
{
"epoch": 0.113565757680359,
"grad_norm": 2.9525063037872314,
"learning_rate": 2e-05,
"loss": 0.8907,
"step": 329
},
{
"epoch": 0.11391094235415948,
"grad_norm": 3.317748785018921,
"learning_rate": 2e-05,
"loss": 0.8673,
"step": 330
},
{
"epoch": 0.11425612702795995,
"grad_norm": 2.934115409851074,
"learning_rate": 2e-05,
"loss": 0.8477,
"step": 331
},
{
"epoch": 0.11460131170176044,
"grad_norm": 2.8080825805664062,
"learning_rate": 2e-05,
"loss": 0.9336,
"step": 332
},
{
"epoch": 0.11494649637556092,
"grad_norm": 2.938957929611206,
"learning_rate": 2e-05,
"loss": 0.8972,
"step": 333
},
{
"epoch": 0.11529168104936141,
"grad_norm": 2.778604745864868,
"learning_rate": 2e-05,
"loss": 0.8013,
"step": 334
},
{
"epoch": 0.1156368657231619,
"grad_norm": 2.779245376586914,
"learning_rate": 2e-05,
"loss": 0.9065,
"step": 335
},
{
"epoch": 0.11598205039696237,
"grad_norm": 2.834568738937378,
"learning_rate": 2e-05,
"loss": 0.8904,
"step": 336
},
{
"epoch": 0.11632723507076285,
"grad_norm": 2.7382054328918457,
"learning_rate": 2e-05,
"loss": 0.8932,
"step": 337
},
{
"epoch": 0.11667241974456334,
"grad_norm": 2.746325731277466,
"learning_rate": 2e-05,
"loss": 0.8365,
"step": 338
},
{
"epoch": 0.11701760441836383,
"grad_norm": 2.750140905380249,
"learning_rate": 2e-05,
"loss": 0.8255,
"step": 339
},
{
"epoch": 0.11736278909216431,
"grad_norm": 3.3976187705993652,
"learning_rate": 2e-05,
"loss": 0.859,
"step": 340
},
{
"epoch": 0.11770797376596479,
"grad_norm": 3.004563093185425,
"learning_rate": 2e-05,
"loss": 0.8895,
"step": 341
},
{
"epoch": 0.11805315843976527,
"grad_norm": 3.343090295791626,
"learning_rate": 2e-05,
"loss": 0.8644,
"step": 342
},
{
"epoch": 0.11839834311356576,
"grad_norm": 2.7037289142608643,
"learning_rate": 2e-05,
"loss": 0.834,
"step": 343
},
{
"epoch": 0.11874352778736624,
"grad_norm": 2.881302833557129,
"learning_rate": 2e-05,
"loss": 0.8343,
"step": 344
},
{
"epoch": 0.11908871246116673,
"grad_norm": 2.9096665382385254,
"learning_rate": 2e-05,
"loss": 0.8559,
"step": 345
},
{
"epoch": 0.1194338971349672,
"grad_norm": 3.109509229660034,
"learning_rate": 2e-05,
"loss": 0.9016,
"step": 346
},
{
"epoch": 0.11977908180876769,
"grad_norm": 2.9444544315338135,
"learning_rate": 2e-05,
"loss": 0.8391,
"step": 347
},
{
"epoch": 0.12012426648256817,
"grad_norm": 3.122678518295288,
"learning_rate": 2e-05,
"loss": 0.8868,
"step": 348
},
{
"epoch": 0.12046945115636866,
"grad_norm": 2.646322250366211,
"learning_rate": 2e-05,
"loss": 0.8174,
"step": 349
},
{
"epoch": 0.12081463583016915,
"grad_norm": 2.9330692291259766,
"learning_rate": 2e-05,
"loss": 0.8805,
"step": 350
},
{
"epoch": 0.12115982050396962,
"grad_norm": 2.9383981227874756,
"learning_rate": 2e-05,
"loss": 0.8618,
"step": 351
},
{
"epoch": 0.1215050051777701,
"grad_norm": 2.9238908290863037,
"learning_rate": 2e-05,
"loss": 0.9407,
"step": 352
},
{
"epoch": 0.12185018985157059,
"grad_norm": 2.8855233192443848,
"learning_rate": 2e-05,
"loss": 0.8713,
"step": 353
},
{
"epoch": 0.12219537452537108,
"grad_norm": 2.822115182876587,
"learning_rate": 2e-05,
"loss": 0.8916,
"step": 354
},
{
"epoch": 0.12254055919917156,
"grad_norm": 2.8500313758850098,
"learning_rate": 2e-05,
"loss": 0.8349,
"step": 355
},
{
"epoch": 0.12288574387297203,
"grad_norm": 3.022473096847534,
"learning_rate": 2e-05,
"loss": 0.8479,
"step": 356
},
{
"epoch": 0.12323092854677252,
"grad_norm": 2.7787365913391113,
"learning_rate": 2e-05,
"loss": 0.8833,
"step": 357
},
{
"epoch": 0.123576113220573,
"grad_norm": 2.9101765155792236,
"learning_rate": 2e-05,
"loss": 0.888,
"step": 358
},
{
"epoch": 0.12392129789437349,
"grad_norm": 2.7252466678619385,
"learning_rate": 2e-05,
"loss": 0.8657,
"step": 359
},
{
"epoch": 0.12426648256817398,
"grad_norm": 2.8830056190490723,
"learning_rate": 2e-05,
"loss": 0.8259,
"step": 360
},
{
"epoch": 0.12461166724197445,
"grad_norm": 2.671375274658203,
"learning_rate": 2e-05,
"loss": 0.8253,
"step": 361
},
{
"epoch": 0.12495685191577494,
"grad_norm": 2.706015110015869,
"learning_rate": 2e-05,
"loss": 0.838,
"step": 362
},
{
"epoch": 0.12530203658957542,
"grad_norm": 2.616062641143799,
"learning_rate": 2e-05,
"loss": 0.8607,
"step": 363
},
{
"epoch": 0.1256472212633759,
"grad_norm": 3.385586738586426,
"learning_rate": 2e-05,
"loss": 0.8603,
"step": 364
},
{
"epoch": 0.1259924059371764,
"grad_norm": 2.9748425483703613,
"learning_rate": 2e-05,
"loss": 0.8802,
"step": 365
},
{
"epoch": 0.12633759061097688,
"grad_norm": 3.009232759475708,
"learning_rate": 2e-05,
"loss": 0.8572,
"step": 366
},
{
"epoch": 0.12668277528477737,
"grad_norm": 2.995032548904419,
"learning_rate": 2e-05,
"loss": 0.8542,
"step": 367
},
{
"epoch": 0.12702795995857785,
"grad_norm": 3.1191444396972656,
"learning_rate": 2e-05,
"loss": 0.9096,
"step": 368
},
{
"epoch": 0.1273731446323783,
"grad_norm": 3.3370883464813232,
"learning_rate": 2e-05,
"loss": 0.8456,
"step": 369
},
{
"epoch": 0.1277183293061788,
"grad_norm": 2.910351276397705,
"learning_rate": 2e-05,
"loss": 0.8415,
"step": 370
},
{
"epoch": 0.12806351397997928,
"grad_norm": 2.381078004837036,
"learning_rate": 2e-05,
"loss": 0.7864,
"step": 371
},
{
"epoch": 0.12840869865377977,
"grad_norm": 2.8764638900756836,
"learning_rate": 2e-05,
"loss": 0.8731,
"step": 372
},
{
"epoch": 0.12875388332758025,
"grad_norm": 2.9746713638305664,
"learning_rate": 2e-05,
"loss": 0.8447,
"step": 373
},
{
"epoch": 0.12909906800138074,
"grad_norm": 2.7619199752807617,
"learning_rate": 2e-05,
"loss": 0.8315,
"step": 374
},
{
"epoch": 0.12944425267518123,
"grad_norm": 2.5940611362457275,
"learning_rate": 2e-05,
"loss": 0.8749,
"step": 375
},
{
"epoch": 0.1297894373489817,
"grad_norm": 2.9887807369232178,
"learning_rate": 2e-05,
"loss": 0.9069,
"step": 376
},
{
"epoch": 0.1301346220227822,
"grad_norm": 3.1408069133758545,
"learning_rate": 2e-05,
"loss": 0.9029,
"step": 377
},
{
"epoch": 0.13047980669658268,
"grad_norm": 2.876115083694458,
"learning_rate": 2e-05,
"loss": 0.9135,
"step": 378
},
{
"epoch": 0.13082499137038314,
"grad_norm": 2.7395379543304443,
"learning_rate": 2e-05,
"loss": 0.8597,
"step": 379
},
{
"epoch": 0.13117017604418363,
"grad_norm": 3.036904811859131,
"learning_rate": 2e-05,
"loss": 0.8886,
"step": 380
},
{
"epoch": 0.13151536071798411,
"grad_norm": 3.047651767730713,
"learning_rate": 2e-05,
"loss": 0.8923,
"step": 381
},
{
"epoch": 0.1318605453917846,
"grad_norm": 2.8202462196350098,
"learning_rate": 2e-05,
"loss": 0.8434,
"step": 382
},
{
"epoch": 0.1322057300655851,
"grad_norm": 2.605100393295288,
"learning_rate": 2e-05,
"loss": 0.8975,
"step": 383
},
{
"epoch": 0.13255091473938557,
"grad_norm": 2.781841516494751,
"learning_rate": 2e-05,
"loss": 0.809,
"step": 384
},
{
"epoch": 0.13289609941318606,
"grad_norm": 2.6456520557403564,
"learning_rate": 2e-05,
"loss": 0.8827,
"step": 385
},
{
"epoch": 0.13324128408698654,
"grad_norm": 10.660346984863281,
"learning_rate": 2e-05,
"loss": 0.8615,
"step": 386
},
{
"epoch": 0.13358646876078703,
"grad_norm": 3.2193210124969482,
"learning_rate": 2e-05,
"loss": 0.8553,
"step": 387
},
{
"epoch": 0.13393165343458752,
"grad_norm": 2.9482877254486084,
"learning_rate": 2e-05,
"loss": 0.7931,
"step": 388
},
{
"epoch": 0.13427683810838797,
"grad_norm": 2.851332664489746,
"learning_rate": 2e-05,
"loss": 0.8291,
"step": 389
},
{
"epoch": 0.13462202278218846,
"grad_norm": 3.519622802734375,
"learning_rate": 2e-05,
"loss": 0.8803,
"step": 390
},
{
"epoch": 0.13496720745598895,
"grad_norm": 2.979022741317749,
"learning_rate": 2e-05,
"loss": 0.9023,
"step": 391
},
{
"epoch": 0.13531239212978943,
"grad_norm": 2.8534867763519287,
"learning_rate": 2e-05,
"loss": 0.8652,
"step": 392
},
{
"epoch": 0.13565757680358992,
"grad_norm": 2.7661948204040527,
"learning_rate": 2e-05,
"loss": 0.8136,
"step": 393
},
{
"epoch": 0.1360027614773904,
"grad_norm": 2.6558003425598145,
"learning_rate": 2e-05,
"loss": 0.8805,
"step": 394
},
{
"epoch": 0.1363479461511909,
"grad_norm": 2.9477477073669434,
"learning_rate": 2e-05,
"loss": 0.8341,
"step": 395
},
{
"epoch": 0.13669313082499138,
"grad_norm": 2.777376174926758,
"learning_rate": 2e-05,
"loss": 0.8435,
"step": 396
},
{
"epoch": 0.13703831549879186,
"grad_norm": 2.947483777999878,
"learning_rate": 2e-05,
"loss": 0.8495,
"step": 397
},
{
"epoch": 0.13738350017259235,
"grad_norm": 2.923473834991455,
"learning_rate": 2e-05,
"loss": 0.8357,
"step": 398
},
{
"epoch": 0.1377286848463928,
"grad_norm": 2.5483436584472656,
"learning_rate": 2e-05,
"loss": 0.7862,
"step": 399
},
{
"epoch": 0.1380738695201933,
"grad_norm": 2.5327706336975098,
"learning_rate": 2e-05,
"loss": 0.8527,
"step": 400
}
],
"logging_steps": 1.0,
"max_steps": 14485,
"num_input_tokens_seen": 0,
"num_train_epochs": 5,
"save_steps": 200,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 251255586816000.0,
"train_batch_size": 12,
"trial_name": null,
"trial_params": null
}