Files
ModelHub XC a580c21353 初始化项目,由ModelHub XC社区提供模型
Model: mesolitica/Malaysian-Llama-3.1-8B-Instruct
Source: Original Platform
2026-08-11 15:03:18 +08:00

1435 lines
32 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.06903693476009665,
"eval_steps": 500,
"global_step": 200,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.00034518467380048324,
"grad_norm": 164.25050354003906,
"learning_rate": 0.0,
"loss": 1.9257,
"step": 1
},
{
"epoch": 0.0006903693476009665,
"grad_norm": 116.43001556396484,
"learning_rate": 2e-05,
"loss": 1.8201,
"step": 2
},
{
"epoch": 0.0010355540214014498,
"grad_norm": 111.98278045654297,
"learning_rate": 2e-05,
"loss": 1.9652,
"step": 3
},
{
"epoch": 0.001380738695201933,
"grad_norm": 312.7107238769531,
"learning_rate": 2e-05,
"loss": 1.6971,
"step": 4
},
{
"epoch": 0.0017259233690024164,
"grad_norm": 124.51359558105469,
"learning_rate": 2e-05,
"loss": 1.7228,
"step": 5
},
{
"epoch": 0.0020711080428028996,
"grad_norm": 117.87893676757812,
"learning_rate": 2e-05,
"loss": 1.7254,
"step": 6
},
{
"epoch": 0.002416292716603383,
"grad_norm": 59.12928771972656,
"learning_rate": 2e-05,
"loss": 1.473,
"step": 7
},
{
"epoch": 0.002761477390403866,
"grad_norm": 24.38951873779297,
"learning_rate": 2e-05,
"loss": 1.5216,
"step": 8
},
{
"epoch": 0.0031066620642043494,
"grad_norm": 57.787757873535156,
"learning_rate": 2e-05,
"loss": 1.5563,
"step": 9
},
{
"epoch": 0.0034518467380048328,
"grad_norm": 21.435535430908203,
"learning_rate": 2e-05,
"loss": 1.4052,
"step": 10
},
{
"epoch": 0.0037970314118053157,
"grad_norm": 25.76114273071289,
"learning_rate": 2e-05,
"loss": 1.4289,
"step": 11
},
{
"epoch": 0.004142216085605799,
"grad_norm": 16.697547912597656,
"learning_rate": 2e-05,
"loss": 1.5014,
"step": 12
},
{
"epoch": 0.0044874007594062825,
"grad_norm": 10.946109771728516,
"learning_rate": 2e-05,
"loss": 1.4236,
"step": 13
},
{
"epoch": 0.004832585433206766,
"grad_norm": 9.638275146484375,
"learning_rate": 2e-05,
"loss": 1.4098,
"step": 14
},
{
"epoch": 0.0051777701070072485,
"grad_norm": 17.02400016784668,
"learning_rate": 2e-05,
"loss": 1.4035,
"step": 15
},
{
"epoch": 0.005522954780807732,
"grad_norm": 7.689630508422852,
"learning_rate": 2e-05,
"loss": 1.3273,
"step": 16
},
{
"epoch": 0.005868139454608215,
"grad_norm": 7.028171539306641,
"learning_rate": 2e-05,
"loss": 1.3675,
"step": 17
},
{
"epoch": 0.006213324128408699,
"grad_norm": 8.425003051757812,
"learning_rate": 2e-05,
"loss": 1.3065,
"step": 18
},
{
"epoch": 0.006558508802209182,
"grad_norm": 7.860549449920654,
"learning_rate": 2e-05,
"loss": 1.2914,
"step": 19
},
{
"epoch": 0.0069036934760096655,
"grad_norm": 5.793131351470947,
"learning_rate": 2e-05,
"loss": 1.2639,
"step": 20
},
{
"epoch": 0.007248878149810148,
"grad_norm": 6.066828727722168,
"learning_rate": 2e-05,
"loss": 1.2845,
"step": 21
},
{
"epoch": 0.0075940628236106315,
"grad_norm": 6.9683074951171875,
"learning_rate": 2e-05,
"loss": 1.2839,
"step": 22
},
{
"epoch": 0.007939247497411116,
"grad_norm": 7.026453018188477,
"learning_rate": 2e-05,
"loss": 1.3129,
"step": 23
},
{
"epoch": 0.008284432171211598,
"grad_norm": 6.011166095733643,
"learning_rate": 2e-05,
"loss": 1.2021,
"step": 24
},
{
"epoch": 0.00862961684501208,
"grad_norm": 6.688496112823486,
"learning_rate": 2e-05,
"loss": 1.2988,
"step": 25
},
{
"epoch": 0.008974801518812565,
"grad_norm": 5.536924839019775,
"learning_rate": 2e-05,
"loss": 1.2529,
"step": 26
},
{
"epoch": 0.009319986192613048,
"grad_norm": 6.189913749694824,
"learning_rate": 2e-05,
"loss": 1.2541,
"step": 27
},
{
"epoch": 0.009665170866413532,
"grad_norm": 5.186566352844238,
"learning_rate": 2e-05,
"loss": 1.1685,
"step": 28
},
{
"epoch": 0.010010355540214014,
"grad_norm": 5.111907482147217,
"learning_rate": 2e-05,
"loss": 1.1647,
"step": 29
},
{
"epoch": 0.010355540214014497,
"grad_norm": 7.816215515136719,
"learning_rate": 2e-05,
"loss": 1.1613,
"step": 30
},
{
"epoch": 0.010700724887814981,
"grad_norm": 6.994287014007568,
"learning_rate": 2e-05,
"loss": 1.1798,
"step": 31
},
{
"epoch": 0.011045909561615464,
"grad_norm": 6.679455280303955,
"learning_rate": 2e-05,
"loss": 1.1356,
"step": 32
},
{
"epoch": 0.011391094235415948,
"grad_norm": 5.451405048370361,
"learning_rate": 2e-05,
"loss": 1.1679,
"step": 33
},
{
"epoch": 0.01173627890921643,
"grad_norm": 5.443926811218262,
"learning_rate": 2e-05,
"loss": 1.1729,
"step": 34
},
{
"epoch": 0.012081463583016915,
"grad_norm": 5.605351448059082,
"learning_rate": 2e-05,
"loss": 1.1808,
"step": 35
},
{
"epoch": 0.012426648256817397,
"grad_norm": 5.121994972229004,
"learning_rate": 2e-05,
"loss": 1.1379,
"step": 36
},
{
"epoch": 0.01277183293061788,
"grad_norm": 4.825695037841797,
"learning_rate": 2e-05,
"loss": 1.1291,
"step": 37
},
{
"epoch": 0.013117017604418364,
"grad_norm": 4.905743598937988,
"learning_rate": 2e-05,
"loss": 1.1687,
"step": 38
},
{
"epoch": 0.013462202278218847,
"grad_norm": 5.373997688293457,
"learning_rate": 2e-05,
"loss": 1.2164,
"step": 39
},
{
"epoch": 0.013807386952019331,
"grad_norm": 4.702381134033203,
"learning_rate": 2e-05,
"loss": 1.1769,
"step": 40
},
{
"epoch": 0.014152571625819814,
"grad_norm": 5.017072677612305,
"learning_rate": 2e-05,
"loss": 1.1081,
"step": 41
},
{
"epoch": 0.014497756299620296,
"grad_norm": 4.598694801330566,
"learning_rate": 2e-05,
"loss": 1.0872,
"step": 42
},
{
"epoch": 0.01484294097342078,
"grad_norm": 4.88613224029541,
"learning_rate": 2e-05,
"loss": 1.166,
"step": 43
},
{
"epoch": 0.015188125647221263,
"grad_norm": 4.172844886779785,
"learning_rate": 2e-05,
"loss": 1.1078,
"step": 44
},
{
"epoch": 0.015533310321021747,
"grad_norm": 4.9598612785339355,
"learning_rate": 2e-05,
"loss": 1.1068,
"step": 45
},
{
"epoch": 0.01587849499482223,
"grad_norm": 4.003320693969727,
"learning_rate": 2e-05,
"loss": 1.0951,
"step": 46
},
{
"epoch": 0.016223679668622714,
"grad_norm": 4.30601692199707,
"learning_rate": 2e-05,
"loss": 1.1088,
"step": 47
},
{
"epoch": 0.016568864342423197,
"grad_norm": 4.957517623901367,
"learning_rate": 2e-05,
"loss": 1.1152,
"step": 48
},
{
"epoch": 0.01691404901622368,
"grad_norm": 5.051650047302246,
"learning_rate": 2e-05,
"loss": 1.0514,
"step": 49
},
{
"epoch": 0.01725923369002416,
"grad_norm": 4.508876800537109,
"learning_rate": 2e-05,
"loss": 1.1081,
"step": 50
},
{
"epoch": 0.017604418363824648,
"grad_norm": 4.666370391845703,
"learning_rate": 2e-05,
"loss": 1.0889,
"step": 51
},
{
"epoch": 0.01794960303762513,
"grad_norm": 4.62983512878418,
"learning_rate": 2e-05,
"loss": 1.0561,
"step": 52
},
{
"epoch": 0.018294787711425613,
"grad_norm": 3.8194386959075928,
"learning_rate": 2e-05,
"loss": 1.0314,
"step": 53
},
{
"epoch": 0.018639972385226095,
"grad_norm": 4.9420695304870605,
"learning_rate": 2e-05,
"loss": 1.1218,
"step": 54
},
{
"epoch": 0.018985157059026578,
"grad_norm": 4.9239068031311035,
"learning_rate": 2e-05,
"loss": 1.0647,
"step": 55
},
{
"epoch": 0.019330341732827064,
"grad_norm": 4.308078289031982,
"learning_rate": 2e-05,
"loss": 1.0469,
"step": 56
},
{
"epoch": 0.019675526406627546,
"grad_norm": 4.183582782745361,
"learning_rate": 2e-05,
"loss": 1.101,
"step": 57
},
{
"epoch": 0.02002071108042803,
"grad_norm": 5.259477138519287,
"learning_rate": 2e-05,
"loss": 1.1166,
"step": 58
},
{
"epoch": 0.02036589575422851,
"grad_norm": 4.483434677124023,
"learning_rate": 2e-05,
"loss": 1.0173,
"step": 59
},
{
"epoch": 0.020711080428028994,
"grad_norm": 4.112723350524902,
"learning_rate": 2e-05,
"loss": 1.062,
"step": 60
},
{
"epoch": 0.02105626510182948,
"grad_norm": 4.924528121948242,
"learning_rate": 2e-05,
"loss": 1.0574,
"step": 61
},
{
"epoch": 0.021401449775629963,
"grad_norm": 3.717799663543701,
"learning_rate": 2e-05,
"loss": 1.0268,
"step": 62
},
{
"epoch": 0.021746634449430445,
"grad_norm": 4.5001044273376465,
"learning_rate": 2e-05,
"loss": 1.057,
"step": 63
},
{
"epoch": 0.022091819123230928,
"grad_norm": 4.214874267578125,
"learning_rate": 2e-05,
"loss": 1.1244,
"step": 64
},
{
"epoch": 0.02243700379703141,
"grad_norm": 4.098433494567871,
"learning_rate": 2e-05,
"loss": 1.0685,
"step": 65
},
{
"epoch": 0.022782188470831896,
"grad_norm": 3.9524285793304443,
"learning_rate": 2e-05,
"loss": 1.0642,
"step": 66
},
{
"epoch": 0.02312737314463238,
"grad_norm": 4.906257152557373,
"learning_rate": 2e-05,
"loss": 1.0543,
"step": 67
},
{
"epoch": 0.02347255781843286,
"grad_norm": 5.597499847412109,
"learning_rate": 2e-05,
"loss": 1.0525,
"step": 68
},
{
"epoch": 0.023817742492233344,
"grad_norm": 3.9120569229125977,
"learning_rate": 2e-05,
"loss": 1.0316,
"step": 69
},
{
"epoch": 0.02416292716603383,
"grad_norm": 3.9987313747406006,
"learning_rate": 2e-05,
"loss": 1.0415,
"step": 70
},
{
"epoch": 0.024508111839834312,
"grad_norm": 3.854943037033081,
"learning_rate": 2e-05,
"loss": 1.0162,
"step": 71
},
{
"epoch": 0.024853296513634795,
"grad_norm": 4.38804292678833,
"learning_rate": 2e-05,
"loss": 0.9893,
"step": 72
},
{
"epoch": 0.025198481187435277,
"grad_norm": 3.375614881515503,
"learning_rate": 2e-05,
"loss": 1.0135,
"step": 73
},
{
"epoch": 0.02554366586123576,
"grad_norm": 3.9334664344787598,
"learning_rate": 2e-05,
"loss": 1.0267,
"step": 74
},
{
"epoch": 0.025888850535036246,
"grad_norm": 3.8816137313842773,
"learning_rate": 2e-05,
"loss": 1.0347,
"step": 75
},
{
"epoch": 0.02623403520883673,
"grad_norm": 3.884535551071167,
"learning_rate": 2e-05,
"loss": 0.9914,
"step": 76
},
{
"epoch": 0.02657921988263721,
"grad_norm": 3.833580493927002,
"learning_rate": 2e-05,
"loss": 1.021,
"step": 77
},
{
"epoch": 0.026924404556437694,
"grad_norm": 3.6896729469299316,
"learning_rate": 2e-05,
"loss": 0.9915,
"step": 78
},
{
"epoch": 0.027269589230238176,
"grad_norm": 3.8832285404205322,
"learning_rate": 2e-05,
"loss": 1.0081,
"step": 79
},
{
"epoch": 0.027614773904038662,
"grad_norm": 4.00054931640625,
"learning_rate": 2e-05,
"loss": 0.9723,
"step": 80
},
{
"epoch": 0.027959958577839145,
"grad_norm": 3.9635231494903564,
"learning_rate": 2e-05,
"loss": 1.0677,
"step": 81
},
{
"epoch": 0.028305143251639627,
"grad_norm": 4.25091552734375,
"learning_rate": 2e-05,
"loss": 0.9683,
"step": 82
},
{
"epoch": 0.02865032792544011,
"grad_norm": 4.387684345245361,
"learning_rate": 2e-05,
"loss": 1.0273,
"step": 83
},
{
"epoch": 0.028995512599240592,
"grad_norm": 4.047482013702393,
"learning_rate": 2e-05,
"loss": 1.0372,
"step": 84
},
{
"epoch": 0.029340697273041078,
"grad_norm": 4.226908206939697,
"learning_rate": 2e-05,
"loss": 1.0192,
"step": 85
},
{
"epoch": 0.02968588194684156,
"grad_norm": 4.123228073120117,
"learning_rate": 2e-05,
"loss": 0.9915,
"step": 86
},
{
"epoch": 0.030031066620642043,
"grad_norm": 6.669504165649414,
"learning_rate": 2e-05,
"loss": 0.9531,
"step": 87
},
{
"epoch": 0.030376251294442526,
"grad_norm": 4.364908695220947,
"learning_rate": 2e-05,
"loss": 1.0042,
"step": 88
},
{
"epoch": 0.03072143596824301,
"grad_norm": 3.7988955974578857,
"learning_rate": 2e-05,
"loss": 0.9767,
"step": 89
},
{
"epoch": 0.031066620642043494,
"grad_norm": 3.547370433807373,
"learning_rate": 2e-05,
"loss": 1.0045,
"step": 90
},
{
"epoch": 0.03141180531584398,
"grad_norm": 4.054666042327881,
"learning_rate": 2e-05,
"loss": 0.9679,
"step": 91
},
{
"epoch": 0.03175698998964446,
"grad_norm": 4.089395523071289,
"learning_rate": 2e-05,
"loss": 1.009,
"step": 92
},
{
"epoch": 0.03210217466344494,
"grad_norm": 3.888781785964966,
"learning_rate": 2e-05,
"loss": 0.9993,
"step": 93
},
{
"epoch": 0.03244735933724543,
"grad_norm": 4.337654113769531,
"learning_rate": 2e-05,
"loss": 1.0637,
"step": 94
},
{
"epoch": 0.03279254401104591,
"grad_norm": 3.9866831302642822,
"learning_rate": 2e-05,
"loss": 1.0415,
"step": 95
},
{
"epoch": 0.03313772868484639,
"grad_norm": 3.694230556488037,
"learning_rate": 2e-05,
"loss": 1.0111,
"step": 96
},
{
"epoch": 0.03348291335864688,
"grad_norm": 3.8903889656066895,
"learning_rate": 2e-05,
"loss": 1.0113,
"step": 97
},
{
"epoch": 0.03382809803244736,
"grad_norm": 4.173677444458008,
"learning_rate": 2e-05,
"loss": 0.9969,
"step": 98
},
{
"epoch": 0.034173282706247844,
"grad_norm": 3.679419755935669,
"learning_rate": 2e-05,
"loss": 1.0401,
"step": 99
},
{
"epoch": 0.03451846738004832,
"grad_norm": 4.073668003082275,
"learning_rate": 2e-05,
"loss": 1.0062,
"step": 100
},
{
"epoch": 0.03486365205384881,
"grad_norm": 3.659552574157715,
"learning_rate": 2e-05,
"loss": 0.9113,
"step": 101
},
{
"epoch": 0.035208836727649295,
"grad_norm": 3.581220865249634,
"learning_rate": 2e-05,
"loss": 1.0402,
"step": 102
},
{
"epoch": 0.035554021401449774,
"grad_norm": 3.6875903606414795,
"learning_rate": 2e-05,
"loss": 1.0051,
"step": 103
},
{
"epoch": 0.03589920607525026,
"grad_norm": 3.3204426765441895,
"learning_rate": 2e-05,
"loss": 1.0041,
"step": 104
},
{
"epoch": 0.03624439074905074,
"grad_norm": 3.408184766769409,
"learning_rate": 2e-05,
"loss": 0.9501,
"step": 105
},
{
"epoch": 0.036589575422851225,
"grad_norm": 3.7698254585266113,
"learning_rate": 2e-05,
"loss": 0.9487,
"step": 106
},
{
"epoch": 0.03693476009665171,
"grad_norm": 4.5543694496154785,
"learning_rate": 2e-05,
"loss": 1.0095,
"step": 107
},
{
"epoch": 0.03727994477045219,
"grad_norm": 4.206326961517334,
"learning_rate": 2e-05,
"loss": 0.9307,
"step": 108
},
{
"epoch": 0.037625129444252677,
"grad_norm": 3.7120132446289062,
"learning_rate": 2e-05,
"loss": 0.9017,
"step": 109
},
{
"epoch": 0.037970314118053156,
"grad_norm": 3.6532175540924072,
"learning_rate": 2e-05,
"loss": 0.9544,
"step": 110
},
{
"epoch": 0.03831549879185364,
"grad_norm": 3.4927427768707275,
"learning_rate": 2e-05,
"loss": 0.97,
"step": 111
},
{
"epoch": 0.03866068346565413,
"grad_norm": 4.344557762145996,
"learning_rate": 2e-05,
"loss": 0.9311,
"step": 112
},
{
"epoch": 0.03900586813945461,
"grad_norm": 3.0494396686553955,
"learning_rate": 2e-05,
"loss": 1.0055,
"step": 113
},
{
"epoch": 0.03935105281325509,
"grad_norm": 3.7052459716796875,
"learning_rate": 2e-05,
"loss": 0.9356,
"step": 114
},
{
"epoch": 0.03969623748705557,
"grad_norm": 4.43536376953125,
"learning_rate": 2e-05,
"loss": 0.9695,
"step": 115
},
{
"epoch": 0.04004142216085606,
"grad_norm": 3.6565682888031006,
"learning_rate": 2e-05,
"loss": 1.0503,
"step": 116
},
{
"epoch": 0.040386606834656544,
"grad_norm": 3.5132741928100586,
"learning_rate": 2e-05,
"loss": 0.959,
"step": 117
},
{
"epoch": 0.04073179150845702,
"grad_norm": 4.00861120223999,
"learning_rate": 2e-05,
"loss": 0.8973,
"step": 118
},
{
"epoch": 0.04107697618225751,
"grad_norm": 4.118383407592773,
"learning_rate": 2e-05,
"loss": 0.961,
"step": 119
},
{
"epoch": 0.04142216085605799,
"grad_norm": 3.6368112564086914,
"learning_rate": 2e-05,
"loss": 1.0302,
"step": 120
},
{
"epoch": 0.041767345529858474,
"grad_norm": 3.668741226196289,
"learning_rate": 2e-05,
"loss": 0.9267,
"step": 121
},
{
"epoch": 0.04211253020365896,
"grad_norm": 3.392117500305176,
"learning_rate": 2e-05,
"loss": 1.0133,
"step": 122
},
{
"epoch": 0.04245771487745944,
"grad_norm": 3.939965009689331,
"learning_rate": 2e-05,
"loss": 0.9151,
"step": 123
},
{
"epoch": 0.042802899551259925,
"grad_norm": 3.3222975730895996,
"learning_rate": 2e-05,
"loss": 0.9028,
"step": 124
},
{
"epoch": 0.043148084225060404,
"grad_norm": 3.639970541000366,
"learning_rate": 2e-05,
"loss": 0.9709,
"step": 125
},
{
"epoch": 0.04349326889886089,
"grad_norm": 3.2109615802764893,
"learning_rate": 2e-05,
"loss": 0.9867,
"step": 126
},
{
"epoch": 0.043838453572661376,
"grad_norm": 3.3262574672698975,
"learning_rate": 2e-05,
"loss": 0.964,
"step": 127
},
{
"epoch": 0.044183638246461855,
"grad_norm": 5.754081726074219,
"learning_rate": 2e-05,
"loss": 0.8765,
"step": 128
},
{
"epoch": 0.04452882292026234,
"grad_norm": 3.367676019668579,
"learning_rate": 2e-05,
"loss": 0.9724,
"step": 129
},
{
"epoch": 0.04487400759406282,
"grad_norm": 3.8047783374786377,
"learning_rate": 2e-05,
"loss": 0.9596,
"step": 130
},
{
"epoch": 0.045219192267863306,
"grad_norm": 3.5262019634246826,
"learning_rate": 2e-05,
"loss": 0.8931,
"step": 131
},
{
"epoch": 0.04556437694166379,
"grad_norm": 3.1185085773468018,
"learning_rate": 2e-05,
"loss": 0.891,
"step": 132
},
{
"epoch": 0.04590956161546427,
"grad_norm": 3.795315980911255,
"learning_rate": 2e-05,
"loss": 0.9536,
"step": 133
},
{
"epoch": 0.04625474628926476,
"grad_norm": 3.698105812072754,
"learning_rate": 2e-05,
"loss": 0.918,
"step": 134
},
{
"epoch": 0.04659993096306524,
"grad_norm": 4.450272560119629,
"learning_rate": 2e-05,
"loss": 0.9075,
"step": 135
},
{
"epoch": 0.04694511563686572,
"grad_norm": 3.3076443672180176,
"learning_rate": 2e-05,
"loss": 0.9334,
"step": 136
},
{
"epoch": 0.04729030031066621,
"grad_norm": 3.551239252090454,
"learning_rate": 2e-05,
"loss": 0.9221,
"step": 137
},
{
"epoch": 0.04763548498446669,
"grad_norm": 3.3865537643432617,
"learning_rate": 2e-05,
"loss": 0.96,
"step": 138
},
{
"epoch": 0.047980669658267174,
"grad_norm": 3.477189302444458,
"learning_rate": 2e-05,
"loss": 0.9794,
"step": 139
},
{
"epoch": 0.04832585433206766,
"grad_norm": 3.2932441234588623,
"learning_rate": 2e-05,
"loss": 0.9078,
"step": 140
},
{
"epoch": 0.04867103900586814,
"grad_norm": 3.095069646835327,
"learning_rate": 2e-05,
"loss": 0.9045,
"step": 141
},
{
"epoch": 0.049016223679668625,
"grad_norm": 3.386526107788086,
"learning_rate": 2e-05,
"loss": 0.937,
"step": 142
},
{
"epoch": 0.049361408353469104,
"grad_norm": 3.274214267730713,
"learning_rate": 2e-05,
"loss": 0.9356,
"step": 143
},
{
"epoch": 0.04970659302726959,
"grad_norm": 3.472280263900757,
"learning_rate": 2e-05,
"loss": 0.8798,
"step": 144
},
{
"epoch": 0.050051777701070076,
"grad_norm": 3.4150500297546387,
"learning_rate": 2e-05,
"loss": 1.0118,
"step": 145
},
{
"epoch": 0.050396962374870555,
"grad_norm": 3.7823333740234375,
"learning_rate": 2e-05,
"loss": 0.9675,
"step": 146
},
{
"epoch": 0.05074214704867104,
"grad_norm": 3.460674524307251,
"learning_rate": 2e-05,
"loss": 0.9366,
"step": 147
},
{
"epoch": 0.05108733172247152,
"grad_norm": 4.081386089324951,
"learning_rate": 2e-05,
"loss": 0.9596,
"step": 148
},
{
"epoch": 0.051432516396272006,
"grad_norm": 3.5548624992370605,
"learning_rate": 2e-05,
"loss": 0.9369,
"step": 149
},
{
"epoch": 0.05177770107007249,
"grad_norm": 3.713184118270874,
"learning_rate": 2e-05,
"loss": 0.9645,
"step": 150
},
{
"epoch": 0.05212288574387297,
"grad_norm": 9.342556953430176,
"learning_rate": 2e-05,
"loss": 0.953,
"step": 151
},
{
"epoch": 0.05246807041767346,
"grad_norm": 3.330892562866211,
"learning_rate": 2e-05,
"loss": 0.9851,
"step": 152
},
{
"epoch": 0.052813255091473936,
"grad_norm": 3.2820513248443604,
"learning_rate": 2e-05,
"loss": 0.9881,
"step": 153
},
{
"epoch": 0.05315843976527442,
"grad_norm": 3.08601713180542,
"learning_rate": 2e-05,
"loss": 0.8678,
"step": 154
},
{
"epoch": 0.05350362443907491,
"grad_norm": 3.466398239135742,
"learning_rate": 2e-05,
"loss": 0.9688,
"step": 155
},
{
"epoch": 0.05384880911287539,
"grad_norm": 3.8165998458862305,
"learning_rate": 2e-05,
"loss": 0.9516,
"step": 156
},
{
"epoch": 0.05419399378667587,
"grad_norm": 3.843984365463257,
"learning_rate": 2e-05,
"loss": 0.8846,
"step": 157
},
{
"epoch": 0.05453917846047635,
"grad_norm": 3.6460742950439453,
"learning_rate": 2e-05,
"loss": 0.9738,
"step": 158
},
{
"epoch": 0.05488436313427684,
"grad_norm": 3.6064538955688477,
"learning_rate": 2e-05,
"loss": 0.8974,
"step": 159
},
{
"epoch": 0.055229547808077324,
"grad_norm": 3.8065435886383057,
"learning_rate": 2e-05,
"loss": 0.9804,
"step": 160
},
{
"epoch": 0.0555747324818778,
"grad_norm": 3.020841121673584,
"learning_rate": 2e-05,
"loss": 0.9037,
"step": 161
},
{
"epoch": 0.05591991715567829,
"grad_norm": 3.5063493251800537,
"learning_rate": 2e-05,
"loss": 0.892,
"step": 162
},
{
"epoch": 0.05626510182947877,
"grad_norm": 3.2224860191345215,
"learning_rate": 2e-05,
"loss": 0.8995,
"step": 163
},
{
"epoch": 0.056610286503279254,
"grad_norm": 3.520097494125366,
"learning_rate": 2e-05,
"loss": 0.9791,
"step": 164
},
{
"epoch": 0.05695547117707974,
"grad_norm": 3.435135841369629,
"learning_rate": 2e-05,
"loss": 1.0013,
"step": 165
},
{
"epoch": 0.05730065585088022,
"grad_norm": 3.173973321914673,
"learning_rate": 2e-05,
"loss": 0.9146,
"step": 166
},
{
"epoch": 0.057645840524680705,
"grad_norm": 3.4863386154174805,
"learning_rate": 2e-05,
"loss": 0.9885,
"step": 167
},
{
"epoch": 0.057991025198481184,
"grad_norm": 3.2673957347869873,
"learning_rate": 2e-05,
"loss": 0.9354,
"step": 168
},
{
"epoch": 0.05833620987228167,
"grad_norm": 3.613051652908325,
"learning_rate": 2e-05,
"loss": 0.9169,
"step": 169
},
{
"epoch": 0.058681394546082156,
"grad_norm": 3.6220316886901855,
"learning_rate": 2e-05,
"loss": 0.9123,
"step": 170
},
{
"epoch": 0.059026579219882636,
"grad_norm": 2.9920058250427246,
"learning_rate": 2e-05,
"loss": 0.9228,
"step": 171
},
{
"epoch": 0.05937176389368312,
"grad_norm": 3.1163201332092285,
"learning_rate": 2e-05,
"loss": 0.9196,
"step": 172
},
{
"epoch": 0.0597169485674836,
"grad_norm": 3.5045080184936523,
"learning_rate": 2e-05,
"loss": 0.9711,
"step": 173
},
{
"epoch": 0.06006213324128409,
"grad_norm": 3.3398544788360596,
"learning_rate": 2e-05,
"loss": 0.8714,
"step": 174
},
{
"epoch": 0.06040731791508457,
"grad_norm": 2.9095466136932373,
"learning_rate": 2e-05,
"loss": 0.8746,
"step": 175
},
{
"epoch": 0.06075250258888505,
"grad_norm": 3.1426031589508057,
"learning_rate": 2e-05,
"loss": 0.8826,
"step": 176
},
{
"epoch": 0.06109768726268554,
"grad_norm": 4.104501724243164,
"learning_rate": 2e-05,
"loss": 0.9346,
"step": 177
},
{
"epoch": 0.06144287193648602,
"grad_norm": 2.990579128265381,
"learning_rate": 2e-05,
"loss": 0.9675,
"step": 178
},
{
"epoch": 0.0617880566102865,
"grad_norm": 3.756319284439087,
"learning_rate": 2e-05,
"loss": 0.9229,
"step": 179
},
{
"epoch": 0.06213324128408699,
"grad_norm": 3.5764338970184326,
"learning_rate": 2e-05,
"loss": 0.9925,
"step": 180
},
{
"epoch": 0.06247842595788747,
"grad_norm": 3.068021774291992,
"learning_rate": 2e-05,
"loss": 0.8987,
"step": 181
},
{
"epoch": 0.06282361063168795,
"grad_norm": 3.2142879962921143,
"learning_rate": 2e-05,
"loss": 0.8418,
"step": 182
},
{
"epoch": 0.06316879530548844,
"grad_norm": 3.3960886001586914,
"learning_rate": 2e-05,
"loss": 0.8892,
"step": 183
},
{
"epoch": 0.06351397997928893,
"grad_norm": 4.435737609863281,
"learning_rate": 2e-05,
"loss": 0.9485,
"step": 184
},
{
"epoch": 0.0638591646530894,
"grad_norm": 11.62714958190918,
"learning_rate": 2e-05,
"loss": 0.8685,
"step": 185
},
{
"epoch": 0.06420434932688988,
"grad_norm": 3.0193748474121094,
"learning_rate": 2e-05,
"loss": 0.9131,
"step": 186
},
{
"epoch": 0.06454953400069037,
"grad_norm": 3.1290862560272217,
"learning_rate": 2e-05,
"loss": 0.9776,
"step": 187
},
{
"epoch": 0.06489471867449086,
"grad_norm": 3.153416872024536,
"learning_rate": 2e-05,
"loss": 0.9031,
"step": 188
},
{
"epoch": 0.06523990334829134,
"grad_norm": 3.450758457183838,
"learning_rate": 2e-05,
"loss": 0.8928,
"step": 189
},
{
"epoch": 0.06558508802209181,
"grad_norm": 3.281147003173828,
"learning_rate": 2e-05,
"loss": 1.0054,
"step": 190
},
{
"epoch": 0.0659302726958923,
"grad_norm": 3.1141176223754883,
"learning_rate": 2e-05,
"loss": 0.913,
"step": 191
},
{
"epoch": 0.06627545736969279,
"grad_norm": 2.945939064025879,
"learning_rate": 2e-05,
"loss": 0.895,
"step": 192
},
{
"epoch": 0.06662064204349327,
"grad_norm": 3.141927719116211,
"learning_rate": 2e-05,
"loss": 0.9336,
"step": 193
},
{
"epoch": 0.06696582671729376,
"grad_norm": 3.6074554920196533,
"learning_rate": 2e-05,
"loss": 0.9821,
"step": 194
},
{
"epoch": 0.06731101139109423,
"grad_norm": 2.96323823928833,
"learning_rate": 2e-05,
"loss": 0.9417,
"step": 195
},
{
"epoch": 0.06765619606489472,
"grad_norm": 3.4270036220550537,
"learning_rate": 2e-05,
"loss": 0.9268,
"step": 196
},
{
"epoch": 0.0680013807386952,
"grad_norm": 3.006737232208252,
"learning_rate": 2e-05,
"loss": 0.9125,
"step": 197
},
{
"epoch": 0.06834656541249569,
"grad_norm": 3.3677432537078857,
"learning_rate": 2e-05,
"loss": 0.9403,
"step": 198
},
{
"epoch": 0.06869175008629617,
"grad_norm": 3.6785035133361816,
"learning_rate": 2e-05,
"loss": 0.8477,
"step": 199
},
{
"epoch": 0.06903693476009665,
"grad_norm": 3.1328837871551514,
"learning_rate": 2e-05,
"loss": 0.8866,
"step": 200
}
],
"logging_steps": 1.0,
"max_steps": 14485,
"num_input_tokens_seen": 0,
"num_train_epochs": 5,
"save_steps": 200,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 125627793408000.0,
"train_batch_size": 12,
"trial_name": null,
"trial_params": null
}