Files
Malaysian-Llama-3.2-3B-Inst…/lora-embedding-128-llama3.2-3b-malaysian-8k/checkpoint-200/trainer_state.json
ModelHub XC a833baf8fa 初始化项目,由ModelHub XC社区提供模型
Model: mesolitica/Malaysian-Llama-3.2-3B-Instruct
Source: Original Platform
2026-08-22 12:53:17 +08:00

1435 lines
32 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.06903693476009665,
"eval_steps": 500,
"global_step": 200,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.00034518467380048324,
"grad_norm": 25.833335876464844,
"learning_rate": 0.0,
"loss": 2.2926,
"step": 1
},
{
"epoch": 0.0006903693476009665,
"grad_norm": 23.58083724975586,
"learning_rate": 2e-05,
"loss": 2.1943,
"step": 2
},
{
"epoch": 0.0010355540214014498,
"grad_norm": 24.2187442779541,
"learning_rate": 2e-05,
"loss": 2.3772,
"step": 3
},
{
"epoch": 0.001380738695201933,
"grad_norm": 14.579557418823242,
"learning_rate": 2e-05,
"loss": 2.0945,
"step": 4
},
{
"epoch": 0.0017259233690024164,
"grad_norm": 15.069305419921875,
"learning_rate": 2e-05,
"loss": 2.1537,
"step": 5
},
{
"epoch": 0.0020711080428028996,
"grad_norm": 14.385339736938477,
"learning_rate": 2e-05,
"loss": 2.1585,
"step": 6
},
{
"epoch": 0.002416292716603383,
"grad_norm": 9.95476245880127,
"learning_rate": 2e-05,
"loss": 1.8333,
"step": 7
},
{
"epoch": 0.002761477390403866,
"grad_norm": 9.15005111694336,
"learning_rate": 2e-05,
"loss": 1.937,
"step": 8
},
{
"epoch": 0.0031066620642043494,
"grad_norm": 7.361661911010742,
"learning_rate": 2e-05,
"loss": 1.9484,
"step": 9
},
{
"epoch": 0.0034518467380048328,
"grad_norm": 5.931179046630859,
"learning_rate": 2e-05,
"loss": 1.7668,
"step": 10
},
{
"epoch": 0.0037970314118053157,
"grad_norm": 8.192151069641113,
"learning_rate": 2e-05,
"loss": 1.8234,
"step": 11
},
{
"epoch": 0.004142216085605799,
"grad_norm": 6.827078342437744,
"learning_rate": 2e-05,
"loss": 1.9133,
"step": 12
},
{
"epoch": 0.0044874007594062825,
"grad_norm": 7.808759689331055,
"learning_rate": 2e-05,
"loss": 1.8314,
"step": 13
},
{
"epoch": 0.004832585433206766,
"grad_norm": 7.531504154205322,
"learning_rate": 2e-05,
"loss": 1.7961,
"step": 14
},
{
"epoch": 0.0051777701070072485,
"grad_norm": 6.617609977722168,
"learning_rate": 2e-05,
"loss": 1.7624,
"step": 15
},
{
"epoch": 0.005522954780807732,
"grad_norm": 4.966954708099365,
"learning_rate": 2e-05,
"loss": 1.7034,
"step": 16
},
{
"epoch": 0.005868139454608215,
"grad_norm": 5.566157817840576,
"learning_rate": 2e-05,
"loss": 1.7722,
"step": 17
},
{
"epoch": 0.006213324128408699,
"grad_norm": 4.915079593658447,
"learning_rate": 2e-05,
"loss": 1.6602,
"step": 18
},
{
"epoch": 0.006558508802209182,
"grad_norm": 4.77263069152832,
"learning_rate": 2e-05,
"loss": 1.6854,
"step": 19
},
{
"epoch": 0.0069036934760096655,
"grad_norm": 4.299682140350342,
"learning_rate": 2e-05,
"loss": 1.6217,
"step": 20
},
{
"epoch": 0.007248878149810148,
"grad_norm": 4.1203694343566895,
"learning_rate": 2e-05,
"loss": 1.6546,
"step": 21
},
{
"epoch": 0.0075940628236106315,
"grad_norm": 4.058311939239502,
"learning_rate": 2e-05,
"loss": 1.6795,
"step": 22
},
{
"epoch": 0.007939247497411116,
"grad_norm": 3.668001651763916,
"learning_rate": 2e-05,
"loss": 1.7228,
"step": 23
},
{
"epoch": 0.008284432171211598,
"grad_norm": 3.397109270095825,
"learning_rate": 2e-05,
"loss": 1.555,
"step": 24
},
{
"epoch": 0.00862961684501208,
"grad_norm": 4.351656436920166,
"learning_rate": 2e-05,
"loss": 1.6977,
"step": 25
},
{
"epoch": 0.008974801518812565,
"grad_norm": 3.7789554595947266,
"learning_rate": 2e-05,
"loss": 1.6534,
"step": 26
},
{
"epoch": 0.009319986192613048,
"grad_norm": 3.4693193435668945,
"learning_rate": 2e-05,
"loss": 1.6248,
"step": 27
},
{
"epoch": 0.009665170866413532,
"grad_norm": 2.6027116775512695,
"learning_rate": 2e-05,
"loss": 1.4901,
"step": 28
},
{
"epoch": 0.010010355540214014,
"grad_norm": 2.6816513538360596,
"learning_rate": 2e-05,
"loss": 1.4964,
"step": 29
},
{
"epoch": 0.010355540214014497,
"grad_norm": 5.244405746459961,
"learning_rate": 2e-05,
"loss": 1.5238,
"step": 30
},
{
"epoch": 0.010700724887814981,
"grad_norm": 4.071628570556641,
"learning_rate": 2e-05,
"loss": 1.5401,
"step": 31
},
{
"epoch": 0.011045909561615464,
"grad_norm": 3.897395372390747,
"learning_rate": 2e-05,
"loss": 1.4759,
"step": 32
},
{
"epoch": 0.011391094235415948,
"grad_norm": 2.9609882831573486,
"learning_rate": 2e-05,
"loss": 1.4919,
"step": 33
},
{
"epoch": 0.01173627890921643,
"grad_norm": 3.1106183528900146,
"learning_rate": 2e-05,
"loss": 1.5436,
"step": 34
},
{
"epoch": 0.012081463583016915,
"grad_norm": 3.7441351413726807,
"learning_rate": 2e-05,
"loss": 1.5496,
"step": 35
},
{
"epoch": 0.012426648256817397,
"grad_norm": 3.6406350135803223,
"learning_rate": 2e-05,
"loss": 1.4531,
"step": 36
},
{
"epoch": 0.01277183293061788,
"grad_norm": 2.915447950363159,
"learning_rate": 2e-05,
"loss": 1.48,
"step": 37
},
{
"epoch": 0.013117017604418364,
"grad_norm": 2.8513331413269043,
"learning_rate": 2e-05,
"loss": 1.5192,
"step": 38
},
{
"epoch": 0.013462202278218847,
"grad_norm": 3.2347466945648193,
"learning_rate": 2e-05,
"loss": 1.5727,
"step": 39
},
{
"epoch": 0.013807386952019331,
"grad_norm": 2.82135272026062,
"learning_rate": 2e-05,
"loss": 1.5098,
"step": 40
},
{
"epoch": 0.014152571625819814,
"grad_norm": 2.694873809814453,
"learning_rate": 2e-05,
"loss": 1.4223,
"step": 41
},
{
"epoch": 0.014497756299620296,
"grad_norm": 2.7129478454589844,
"learning_rate": 2e-05,
"loss": 1.4062,
"step": 42
},
{
"epoch": 0.01484294097342078,
"grad_norm": 2.6555328369140625,
"learning_rate": 2e-05,
"loss": 1.4993,
"step": 43
},
{
"epoch": 0.015188125647221263,
"grad_norm": 2.3439159393310547,
"learning_rate": 2e-05,
"loss": 1.4281,
"step": 44
},
{
"epoch": 0.015533310321021747,
"grad_norm": 2.40368914604187,
"learning_rate": 2e-05,
"loss": 1.4261,
"step": 45
},
{
"epoch": 0.01587849499482223,
"grad_norm": 2.3288614749908447,
"learning_rate": 2e-05,
"loss": 1.3958,
"step": 46
},
{
"epoch": 0.016223679668622714,
"grad_norm": 2.474519968032837,
"learning_rate": 2e-05,
"loss": 1.4246,
"step": 47
},
{
"epoch": 0.016568864342423197,
"grad_norm": 2.680997371673584,
"learning_rate": 2e-05,
"loss": 1.4318,
"step": 48
},
{
"epoch": 0.01691404901622368,
"grad_norm": 2.6899235248565674,
"learning_rate": 2e-05,
"loss": 1.3581,
"step": 49
},
{
"epoch": 0.01725923369002416,
"grad_norm": 2.5045225620269775,
"learning_rate": 2e-05,
"loss": 1.3983,
"step": 50
},
{
"epoch": 0.017604418363824648,
"grad_norm": 2.650184154510498,
"learning_rate": 2e-05,
"loss": 1.4005,
"step": 51
},
{
"epoch": 0.01794960303762513,
"grad_norm": 2.560302495956421,
"learning_rate": 2e-05,
"loss": 1.3706,
"step": 52
},
{
"epoch": 0.018294787711425613,
"grad_norm": 2.116626739501953,
"learning_rate": 2e-05,
"loss": 1.2987,
"step": 53
},
{
"epoch": 0.018639972385226095,
"grad_norm": 3.0732431411743164,
"learning_rate": 2e-05,
"loss": 1.4394,
"step": 54
},
{
"epoch": 0.018985157059026578,
"grad_norm": 2.880014657974243,
"learning_rate": 2e-05,
"loss": 1.3772,
"step": 55
},
{
"epoch": 0.019330341732827064,
"grad_norm": 2.65002179145813,
"learning_rate": 2e-05,
"loss": 1.344,
"step": 56
},
{
"epoch": 0.019675526406627546,
"grad_norm": 2.4109294414520264,
"learning_rate": 2e-05,
"loss": 1.3818,
"step": 57
},
{
"epoch": 0.02002071108042803,
"grad_norm": 3.318305730819702,
"learning_rate": 2e-05,
"loss": 1.4488,
"step": 58
},
{
"epoch": 0.02036589575422851,
"grad_norm": 2.9551541805267334,
"learning_rate": 2e-05,
"loss": 1.3245,
"step": 59
},
{
"epoch": 0.020711080428028994,
"grad_norm": 2.512965679168701,
"learning_rate": 2e-05,
"loss": 1.3476,
"step": 60
},
{
"epoch": 0.02105626510182948,
"grad_norm": 2.608680248260498,
"learning_rate": 2e-05,
"loss": 1.335,
"step": 61
},
{
"epoch": 0.021401449775629963,
"grad_norm": 2.2880616188049316,
"learning_rate": 2e-05,
"loss": 1.2781,
"step": 62
},
{
"epoch": 0.021746634449430445,
"grad_norm": 2.7310123443603516,
"learning_rate": 2e-05,
"loss": 1.3449,
"step": 63
},
{
"epoch": 0.022091819123230928,
"grad_norm": 2.5008130073547363,
"learning_rate": 2e-05,
"loss": 1.4042,
"step": 64
},
{
"epoch": 0.02243700379703141,
"grad_norm": 3.5907320976257324,
"learning_rate": 2e-05,
"loss": 1.344,
"step": 65
},
{
"epoch": 0.022782188470831896,
"grad_norm": 2.4797489643096924,
"learning_rate": 2e-05,
"loss": 1.3342,
"step": 66
},
{
"epoch": 0.02312737314463238,
"grad_norm": 2.556204319000244,
"learning_rate": 2e-05,
"loss": 1.3244,
"step": 67
},
{
"epoch": 0.02347255781843286,
"grad_norm": 5.068964004516602,
"learning_rate": 2e-05,
"loss": 1.3041,
"step": 68
},
{
"epoch": 0.023817742492233344,
"grad_norm": 2.165076494216919,
"learning_rate": 2e-05,
"loss": 1.2727,
"step": 69
},
{
"epoch": 0.02416292716603383,
"grad_norm": 2.202164649963379,
"learning_rate": 2e-05,
"loss": 1.2887,
"step": 70
},
{
"epoch": 0.024508111839834312,
"grad_norm": 2.3834869861602783,
"learning_rate": 2e-05,
"loss": 1.2694,
"step": 71
},
{
"epoch": 0.024853296513634795,
"grad_norm": 2.5316550731658936,
"learning_rate": 2e-05,
"loss": 1.2514,
"step": 72
},
{
"epoch": 0.025198481187435277,
"grad_norm": 1.9449459314346313,
"learning_rate": 2e-05,
"loss": 1.26,
"step": 73
},
{
"epoch": 0.02554366586123576,
"grad_norm": 2.2826900482177734,
"learning_rate": 2e-05,
"loss": 1.2931,
"step": 74
},
{
"epoch": 0.025888850535036246,
"grad_norm": 2.260650396347046,
"learning_rate": 2e-05,
"loss": 1.2732,
"step": 75
},
{
"epoch": 0.02623403520883673,
"grad_norm": 2.356182336807251,
"learning_rate": 2e-05,
"loss": 1.2449,
"step": 76
},
{
"epoch": 0.02657921988263721,
"grad_norm": 2.199906826019287,
"learning_rate": 2e-05,
"loss": 1.2733,
"step": 77
},
{
"epoch": 0.026924404556437694,
"grad_norm": 2.3083510398864746,
"learning_rate": 2e-05,
"loss": 1.2257,
"step": 78
},
{
"epoch": 0.027269589230238176,
"grad_norm": 2.2658169269561768,
"learning_rate": 2e-05,
"loss": 1.2525,
"step": 79
},
{
"epoch": 0.027614773904038662,
"grad_norm": 2.352308988571167,
"learning_rate": 2e-05,
"loss": 1.2202,
"step": 80
},
{
"epoch": 0.027959958577839145,
"grad_norm": 2.523381471633911,
"learning_rate": 2e-05,
"loss": 1.2996,
"step": 81
},
{
"epoch": 0.028305143251639627,
"grad_norm": 2.4327428340911865,
"learning_rate": 2e-05,
"loss": 1.2135,
"step": 82
},
{
"epoch": 0.02865032792544011,
"grad_norm": 2.4549570083618164,
"learning_rate": 2e-05,
"loss": 1.2813,
"step": 83
},
{
"epoch": 0.028995512599240592,
"grad_norm": 2.4394640922546387,
"learning_rate": 2e-05,
"loss": 1.2828,
"step": 84
},
{
"epoch": 0.029340697273041078,
"grad_norm": 2.4780633449554443,
"learning_rate": 2e-05,
"loss": 1.2517,
"step": 85
},
{
"epoch": 0.02968588194684156,
"grad_norm": 2.326880931854248,
"learning_rate": 2e-05,
"loss": 1.2288,
"step": 86
},
{
"epoch": 0.030031066620642043,
"grad_norm": 3.1833627223968506,
"learning_rate": 2e-05,
"loss": 1.1978,
"step": 87
},
{
"epoch": 0.030376251294442526,
"grad_norm": 2.624091625213623,
"learning_rate": 2e-05,
"loss": 1.2534,
"step": 88
},
{
"epoch": 0.03072143596824301,
"grad_norm": 2.531895160675049,
"learning_rate": 2e-05,
"loss": 1.2263,
"step": 89
},
{
"epoch": 0.031066620642043494,
"grad_norm": 2.2346715927124023,
"learning_rate": 2e-05,
"loss": 1.2301,
"step": 90
},
{
"epoch": 0.03141180531584398,
"grad_norm": 2.237839698791504,
"learning_rate": 2e-05,
"loss": 1.1897,
"step": 91
},
{
"epoch": 0.03175698998964446,
"grad_norm": 2.4267807006835938,
"learning_rate": 2e-05,
"loss": 1.2508,
"step": 92
},
{
"epoch": 0.03210217466344494,
"grad_norm": 2.2506682872772217,
"learning_rate": 2e-05,
"loss": 1.2262,
"step": 93
},
{
"epoch": 0.03244735933724543,
"grad_norm": 2.5266077518463135,
"learning_rate": 2e-05,
"loss": 1.3139,
"step": 94
},
{
"epoch": 0.03279254401104591,
"grad_norm": 2.2002406120300293,
"learning_rate": 2e-05,
"loss": 1.2755,
"step": 95
},
{
"epoch": 0.03313772868484639,
"grad_norm": 2.20263409614563,
"learning_rate": 2e-05,
"loss": 1.2388,
"step": 96
},
{
"epoch": 0.03348291335864688,
"grad_norm": 2.297576665878296,
"learning_rate": 2e-05,
"loss": 1.2406,
"step": 97
},
{
"epoch": 0.03382809803244736,
"grad_norm": 2.3951361179351807,
"learning_rate": 2e-05,
"loss": 1.2244,
"step": 98
},
{
"epoch": 0.034173282706247844,
"grad_norm": 2.2707271575927734,
"learning_rate": 2e-05,
"loss": 1.2719,
"step": 99
},
{
"epoch": 0.03451846738004832,
"grad_norm": 2.2766411304473877,
"learning_rate": 2e-05,
"loss": 1.23,
"step": 100
},
{
"epoch": 0.03486365205384881,
"grad_norm": 2.253887414932251,
"learning_rate": 2e-05,
"loss": 1.1369,
"step": 101
},
{
"epoch": 0.035208836727649295,
"grad_norm": 2.0003821849823,
"learning_rate": 2e-05,
"loss": 1.2547,
"step": 102
},
{
"epoch": 0.035554021401449774,
"grad_norm": 2.277153253555298,
"learning_rate": 2e-05,
"loss": 1.2244,
"step": 103
},
{
"epoch": 0.03589920607525026,
"grad_norm": 2.1561081409454346,
"learning_rate": 2e-05,
"loss": 1.2222,
"step": 104
},
{
"epoch": 0.03624439074905074,
"grad_norm": 2.0002012252807617,
"learning_rate": 2e-05,
"loss": 1.1599,
"step": 105
},
{
"epoch": 0.036589575422851225,
"grad_norm": 2.3313021659851074,
"learning_rate": 2e-05,
"loss": 1.1658,
"step": 106
},
{
"epoch": 0.03693476009665171,
"grad_norm": 2.58686900138855,
"learning_rate": 2e-05,
"loss": 1.2282,
"step": 107
},
{
"epoch": 0.03727994477045219,
"grad_norm": 2.485671043395996,
"learning_rate": 2e-05,
"loss": 1.1537,
"step": 108
},
{
"epoch": 0.037625129444252677,
"grad_norm": 2.3962278366088867,
"learning_rate": 2e-05,
"loss": 1.133,
"step": 109
},
{
"epoch": 0.037970314118053156,
"grad_norm": 2.118319034576416,
"learning_rate": 2e-05,
"loss": 1.1769,
"step": 110
},
{
"epoch": 0.03831549879185364,
"grad_norm": 2.095940113067627,
"learning_rate": 2e-05,
"loss": 1.1763,
"step": 111
},
{
"epoch": 0.03866068346565413,
"grad_norm": 2.0862512588500977,
"learning_rate": 2e-05,
"loss": 1.1356,
"step": 112
},
{
"epoch": 0.03900586813945461,
"grad_norm": 1.9276546239852905,
"learning_rate": 2e-05,
"loss": 1.2068,
"step": 113
},
{
"epoch": 0.03935105281325509,
"grad_norm": 2.5604825019836426,
"learning_rate": 2e-05,
"loss": 1.16,
"step": 114
},
{
"epoch": 0.03969623748705557,
"grad_norm": 2.200289726257324,
"learning_rate": 2e-05,
"loss": 1.1811,
"step": 115
},
{
"epoch": 0.04004142216085606,
"grad_norm": 2.2654318809509277,
"learning_rate": 2e-05,
"loss": 1.2745,
"step": 116
},
{
"epoch": 0.040386606834656544,
"grad_norm": 2.194129228591919,
"learning_rate": 2e-05,
"loss": 1.1633,
"step": 117
},
{
"epoch": 0.04073179150845702,
"grad_norm": 2.267609119415283,
"learning_rate": 2e-05,
"loss": 1.1025,
"step": 118
},
{
"epoch": 0.04107697618225751,
"grad_norm": 2.3966379165649414,
"learning_rate": 2e-05,
"loss": 1.1624,
"step": 119
},
{
"epoch": 0.04142216085605799,
"grad_norm": 2.3428127765655518,
"learning_rate": 2e-05,
"loss": 1.2521,
"step": 120
},
{
"epoch": 0.041767345529858474,
"grad_norm": 2.257154941558838,
"learning_rate": 2e-05,
"loss": 1.1427,
"step": 121
},
{
"epoch": 0.04211253020365896,
"grad_norm": 2.4615261554718018,
"learning_rate": 2e-05,
"loss": 1.209,
"step": 122
},
{
"epoch": 0.04245771487745944,
"grad_norm": 2.215366840362549,
"learning_rate": 2e-05,
"loss": 1.1213,
"step": 123
},
{
"epoch": 0.042802899551259925,
"grad_norm": 2.293936014175415,
"learning_rate": 2e-05,
"loss": 1.1118,
"step": 124
},
{
"epoch": 0.043148084225060404,
"grad_norm": 2.351991653442383,
"learning_rate": 2e-05,
"loss": 1.1849,
"step": 125
},
{
"epoch": 0.04349326889886089,
"grad_norm": 2.118906259536743,
"learning_rate": 2e-05,
"loss": 1.1905,
"step": 126
},
{
"epoch": 0.043838453572661376,
"grad_norm": 2.1108460426330566,
"learning_rate": 2e-05,
"loss": 1.1787,
"step": 127
},
{
"epoch": 0.044183638246461855,
"grad_norm": 2.560715436935425,
"learning_rate": 2e-05,
"loss": 1.0727,
"step": 128
},
{
"epoch": 0.04452882292026234,
"grad_norm": 1.9983900785446167,
"learning_rate": 2e-05,
"loss": 1.1665,
"step": 129
},
{
"epoch": 0.04487400759406282,
"grad_norm": 2.3714847564697266,
"learning_rate": 2e-05,
"loss": 1.1488,
"step": 130
},
{
"epoch": 0.045219192267863306,
"grad_norm": 2.243546724319458,
"learning_rate": 2e-05,
"loss": 1.0965,
"step": 131
},
{
"epoch": 0.04556437694166379,
"grad_norm": 1.989858627319336,
"learning_rate": 2e-05,
"loss": 1.0833,
"step": 132
},
{
"epoch": 0.04590956161546427,
"grad_norm": 2.298943519592285,
"learning_rate": 2e-05,
"loss": 1.1548,
"step": 133
},
{
"epoch": 0.04625474628926476,
"grad_norm": 2.256289005279541,
"learning_rate": 2e-05,
"loss": 1.1139,
"step": 134
},
{
"epoch": 0.04659993096306524,
"grad_norm": 2.386530876159668,
"learning_rate": 2e-05,
"loss": 1.1245,
"step": 135
},
{
"epoch": 0.04694511563686572,
"grad_norm": 2.073687791824341,
"learning_rate": 2e-05,
"loss": 1.1337,
"step": 136
},
{
"epoch": 0.04729030031066621,
"grad_norm": 2.307697057723999,
"learning_rate": 2e-05,
"loss": 1.1325,
"step": 137
},
{
"epoch": 0.04763548498446669,
"grad_norm": 2.1158194541931152,
"learning_rate": 2e-05,
"loss": 1.1637,
"step": 138
},
{
"epoch": 0.047980669658267174,
"grad_norm": 2.21449613571167,
"learning_rate": 2e-05,
"loss": 1.1802,
"step": 139
},
{
"epoch": 0.04832585433206766,
"grad_norm": 2.041476249694824,
"learning_rate": 2e-05,
"loss": 1.1007,
"step": 140
},
{
"epoch": 0.04867103900586814,
"grad_norm": 2.262849807739258,
"learning_rate": 2e-05,
"loss": 1.1006,
"step": 141
},
{
"epoch": 0.049016223679668625,
"grad_norm": 2.207761287689209,
"learning_rate": 2e-05,
"loss": 1.133,
"step": 142
},
{
"epoch": 0.049361408353469104,
"grad_norm": 2.083613872528076,
"learning_rate": 2e-05,
"loss": 1.1319,
"step": 143
},
{
"epoch": 0.04970659302726959,
"grad_norm": 2.1225838661193848,
"learning_rate": 2e-05,
"loss": 1.0786,
"step": 144
},
{
"epoch": 0.050051777701070076,
"grad_norm": 2.17154598236084,
"learning_rate": 2e-05,
"loss": 1.2138,
"step": 145
},
{
"epoch": 0.050396962374870555,
"grad_norm": 2.655251979827881,
"learning_rate": 2e-05,
"loss": 1.1639,
"step": 146
},
{
"epoch": 0.05074214704867104,
"grad_norm": 2.241605758666992,
"learning_rate": 2e-05,
"loss": 1.1345,
"step": 147
},
{
"epoch": 0.05108733172247152,
"grad_norm": 2.397520065307617,
"learning_rate": 2e-05,
"loss": 1.1592,
"step": 148
},
{
"epoch": 0.051432516396272006,
"grad_norm": 2.2444629669189453,
"learning_rate": 2e-05,
"loss": 1.134,
"step": 149
},
{
"epoch": 0.05177770107007249,
"grad_norm": 2.179332971572876,
"learning_rate": 2e-05,
"loss": 1.1726,
"step": 150
},
{
"epoch": 0.05212288574387297,
"grad_norm": 2.1803085803985596,
"learning_rate": 2e-05,
"loss": 1.1458,
"step": 151
},
{
"epoch": 0.05246807041767346,
"grad_norm": 2.06752872467041,
"learning_rate": 2e-05,
"loss": 1.1741,
"step": 152
},
{
"epoch": 0.052813255091473936,
"grad_norm": 1.9567921161651611,
"learning_rate": 2e-05,
"loss": 1.1783,
"step": 153
},
{
"epoch": 0.05315843976527442,
"grad_norm": 1.8780710697174072,
"learning_rate": 2e-05,
"loss": 1.0461,
"step": 154
},
{
"epoch": 0.05350362443907491,
"grad_norm": 2.142355442047119,
"learning_rate": 2e-05,
"loss": 1.1683,
"step": 155
},
{
"epoch": 0.05384880911287539,
"grad_norm": 2.404834270477295,
"learning_rate": 2e-05,
"loss": 1.1367,
"step": 156
},
{
"epoch": 0.05419399378667587,
"grad_norm": 2.467586040496826,
"learning_rate": 2e-05,
"loss": 1.0616,
"step": 157
},
{
"epoch": 0.05453917846047635,
"grad_norm": 2.428678035736084,
"learning_rate": 2e-05,
"loss": 1.1587,
"step": 158
},
{
"epoch": 0.05488436313427684,
"grad_norm": 1.9721519947052002,
"learning_rate": 2e-05,
"loss": 1.0864,
"step": 159
},
{
"epoch": 0.055229547808077324,
"grad_norm": 2.282735586166382,
"learning_rate": 2e-05,
"loss": 1.1805,
"step": 160
},
{
"epoch": 0.0555747324818778,
"grad_norm": 2.136899471282959,
"learning_rate": 2e-05,
"loss": 1.0941,
"step": 161
},
{
"epoch": 0.05591991715567829,
"grad_norm": 2.0251846313476562,
"learning_rate": 2e-05,
"loss": 1.0796,
"step": 162
},
{
"epoch": 0.05626510182947877,
"grad_norm": 2.1328299045562744,
"learning_rate": 2e-05,
"loss": 1.0917,
"step": 163
},
{
"epoch": 0.056610286503279254,
"grad_norm": 2.205331802368164,
"learning_rate": 2e-05,
"loss": 1.1792,
"step": 164
},
{
"epoch": 0.05695547117707974,
"grad_norm": 2.0339744091033936,
"learning_rate": 2e-05,
"loss": 1.1874,
"step": 165
},
{
"epoch": 0.05730065585088022,
"grad_norm": 1.8030365705490112,
"learning_rate": 2e-05,
"loss": 1.0929,
"step": 166
},
{
"epoch": 0.057645840524680705,
"grad_norm": 2.1905670166015625,
"learning_rate": 2e-05,
"loss": 1.1831,
"step": 167
},
{
"epoch": 0.057991025198481184,
"grad_norm": 2.142336845397949,
"learning_rate": 2e-05,
"loss": 1.1237,
"step": 168
},
{
"epoch": 0.05833620987228167,
"grad_norm": 2.3521053791046143,
"learning_rate": 2e-05,
"loss": 1.1077,
"step": 169
},
{
"epoch": 0.058681394546082156,
"grad_norm": 2.105743408203125,
"learning_rate": 2e-05,
"loss": 1.1048,
"step": 170
},
{
"epoch": 0.059026579219882636,
"grad_norm": 1.9414738416671753,
"learning_rate": 2e-05,
"loss": 1.112,
"step": 171
},
{
"epoch": 0.05937176389368312,
"grad_norm": 1.9606658220291138,
"learning_rate": 2e-05,
"loss": 1.1109,
"step": 172
},
{
"epoch": 0.0597169485674836,
"grad_norm": 2.3274831771850586,
"learning_rate": 2e-05,
"loss": 1.1803,
"step": 173
},
{
"epoch": 0.06006213324128409,
"grad_norm": 2.1384570598602295,
"learning_rate": 2e-05,
"loss": 1.0515,
"step": 174
},
{
"epoch": 0.06040731791508457,
"grad_norm": 2.0795719623565674,
"learning_rate": 2e-05,
"loss": 1.0581,
"step": 175
},
{
"epoch": 0.06075250258888505,
"grad_norm": 2.0180423259735107,
"learning_rate": 2e-05,
"loss": 1.0686,
"step": 176
},
{
"epoch": 0.06109768726268554,
"grad_norm": 2.0913267135620117,
"learning_rate": 2e-05,
"loss": 1.117,
"step": 177
},
{
"epoch": 0.06144287193648602,
"grad_norm": 2.0325934886932373,
"learning_rate": 2e-05,
"loss": 1.1526,
"step": 178
},
{
"epoch": 0.0617880566102865,
"grad_norm": 2.222254991531372,
"learning_rate": 2e-05,
"loss": 1.113,
"step": 179
},
{
"epoch": 0.06213324128408699,
"grad_norm": 2.2039270401000977,
"learning_rate": 2e-05,
"loss": 1.1886,
"step": 180
},
{
"epoch": 0.06247842595788747,
"grad_norm": 2.0291781425476074,
"learning_rate": 2e-05,
"loss": 1.0884,
"step": 181
},
{
"epoch": 0.06282361063168795,
"grad_norm": 2.2183430194854736,
"learning_rate": 2e-05,
"loss": 1.0223,
"step": 182
},
{
"epoch": 0.06316879530548844,
"grad_norm": 2.37440824508667,
"learning_rate": 2e-05,
"loss": 1.0775,
"step": 183
},
{
"epoch": 0.06351397997928893,
"grad_norm": 1.8214384317398071,
"learning_rate": 2e-05,
"loss": 1.1279,
"step": 184
},
{
"epoch": 0.0638591646530894,
"grad_norm": 2.205291271209717,
"learning_rate": 2e-05,
"loss": 1.0396,
"step": 185
},
{
"epoch": 0.06420434932688988,
"grad_norm": 2.137577533721924,
"learning_rate": 2e-05,
"loss": 1.0861,
"step": 186
},
{
"epoch": 0.06454953400069037,
"grad_norm": 1.982663869857788,
"learning_rate": 2e-05,
"loss": 1.1612,
"step": 187
},
{
"epoch": 0.06489471867449086,
"grad_norm": 21.140506744384766,
"learning_rate": 2e-05,
"loss": 1.0824,
"step": 188
},
{
"epoch": 0.06523990334829134,
"grad_norm": 2.2611193656921387,
"learning_rate": 2e-05,
"loss": 1.0795,
"step": 189
},
{
"epoch": 0.06558508802209181,
"grad_norm": 2.0905325412750244,
"learning_rate": 2e-05,
"loss": 1.1989,
"step": 190
},
{
"epoch": 0.0659302726958923,
"grad_norm": 1.9430997371673584,
"learning_rate": 2e-05,
"loss": 1.0885,
"step": 191
},
{
"epoch": 0.06627545736969279,
"grad_norm": 1.8876497745513916,
"learning_rate": 2e-05,
"loss": 1.0708,
"step": 192
},
{
"epoch": 0.06662064204349327,
"grad_norm": 2.0716099739074707,
"learning_rate": 2e-05,
"loss": 1.124,
"step": 193
},
{
"epoch": 0.06696582671729376,
"grad_norm": 2.413959503173828,
"learning_rate": 2e-05,
"loss": 1.1856,
"step": 194
},
{
"epoch": 0.06731101139109423,
"grad_norm": 1.8021107912063599,
"learning_rate": 2e-05,
"loss": 1.1284,
"step": 195
},
{
"epoch": 0.06765619606489472,
"grad_norm": 2.2795395851135254,
"learning_rate": 2e-05,
"loss": 1.1101,
"step": 196
},
{
"epoch": 0.0680013807386952,
"grad_norm": 1.936448097229004,
"learning_rate": 2e-05,
"loss": 1.0921,
"step": 197
},
{
"epoch": 0.06834656541249569,
"grad_norm": 1.940928339958191,
"learning_rate": 2e-05,
"loss": 1.1236,
"step": 198
},
{
"epoch": 0.06869175008629617,
"grad_norm": 2.1147520542144775,
"learning_rate": 2e-05,
"loss": 1.0332,
"step": 199
},
{
"epoch": 0.06903693476009665,
"grad_norm": 1.9784513711929321,
"learning_rate": 2e-05,
"loss": 1.0644,
"step": 200
}
],
"logging_steps": 1.0,
"max_steps": 14485,
"num_input_tokens_seen": 0,
"num_train_epochs": 5,
"save_steps": 200,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 82624433356800.0,
"train_batch_size": 12,
"trial_name": null,
"trial_params": null
}