Files
ModelHub XC a1080453d5 初始化项目,由ModelHub XC社区提供模型
Model: stratosphere/qwen2.5-1.5b-slips-immune-unified
Source: Original Platform
2026-07-26 13:32:07 +08:00

1109 lines
28 KiB
JSON

{
"best_global_step": 150,
"best_metric": 0.6550542712211609,
"best_model_checkpoint": "./qwen_unified_finetuned_v2/checkpoint-150",
"epoch": 1.5800922874093606,
"eval_steps": 50,
"global_step": 150,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.01054713249835201,
"grad_norm": 11.254260063171387,
"learning_rate": 0.0,
"loss": 1.2856202125549316,
"step": 1
},
{
"epoch": 0.02109426499670402,
"grad_norm": 9.963000297546387,
"learning_rate": 6.666666666666667e-07,
"loss": 1.2529420852661133,
"step": 2
},
{
"epoch": 0.03164139749505603,
"grad_norm": 9.828377723693848,
"learning_rate": 1.3333333333333334e-06,
"loss": 1.1177468299865723,
"step": 3
},
{
"epoch": 0.04218852999340804,
"grad_norm": 8.927521705627441,
"learning_rate": 2.0000000000000003e-06,
"loss": 1.160679578781128,
"step": 4
},
{
"epoch": 0.05273566249176005,
"grad_norm": 9.450704574584961,
"learning_rate": 2.666666666666667e-06,
"loss": 1.1996268033981323,
"step": 5
},
{
"epoch": 0.06328279499011207,
"grad_norm": 7.224189758300781,
"learning_rate": 3.3333333333333333e-06,
"loss": 1.2939574718475342,
"step": 6
},
{
"epoch": 0.07382992748846408,
"grad_norm": 6.68184232711792,
"learning_rate": 4.000000000000001e-06,
"loss": 1.202090859413147,
"step": 7
},
{
"epoch": 0.08437705998681608,
"grad_norm": 5.252114772796631,
"learning_rate": 4.666666666666667e-06,
"loss": 1.0647697448730469,
"step": 8
},
{
"epoch": 0.09492419248516809,
"grad_norm": 4.770995140075684,
"learning_rate": 5.333333333333334e-06,
"loss": 0.811023473739624,
"step": 9
},
{
"epoch": 0.1054713249835201,
"grad_norm": 5.881967067718506,
"learning_rate": 6e-06,
"loss": 1.0770221948623657,
"step": 10
},
{
"epoch": 0.11601845748187212,
"grad_norm": 4.145230293273926,
"learning_rate": 6.666666666666667e-06,
"loss": 0.6524759531021118,
"step": 11
},
{
"epoch": 0.12656558998022413,
"grad_norm": 4.487707138061523,
"learning_rate": 7.333333333333333e-06,
"loss": 0.8969423770904541,
"step": 12
},
{
"epoch": 0.13711272247857614,
"grad_norm": 4.725864410400391,
"learning_rate": 8.000000000000001e-06,
"loss": 0.893510103225708,
"step": 13
},
{
"epoch": 0.14765985497692816,
"grad_norm": 5.280237674713135,
"learning_rate": 8.666666666666668e-06,
"loss": 1.3190690279006958,
"step": 14
},
{
"epoch": 0.15820698747528017,
"grad_norm": 4.238594055175781,
"learning_rate": 9.333333333333334e-06,
"loss": 0.8921085000038147,
"step": 15
},
{
"epoch": 0.16875411997363216,
"grad_norm": 4.737040042877197,
"learning_rate": 1e-05,
"loss": 1.1678017377853394,
"step": 16
},
{
"epoch": 0.17930125247198417,
"grad_norm": 3.861323356628418,
"learning_rate": 1.0666666666666667e-05,
"loss": 0.8146582841873169,
"step": 17
},
{
"epoch": 0.18984838497033618,
"grad_norm": 3.594571113586426,
"learning_rate": 1.1333333333333334e-05,
"loss": 0.6457481384277344,
"step": 18
},
{
"epoch": 0.2003955174686882,
"grad_norm": 5.211328983306885,
"learning_rate": 1.2e-05,
"loss": 1.250954031944275,
"step": 19
},
{
"epoch": 0.2109426499670402,
"grad_norm": 4.465060234069824,
"learning_rate": 1.2666666666666667e-05,
"loss": 1.146741271018982,
"step": 20
},
{
"epoch": 0.22148978246539222,
"grad_norm": 4.283473491668701,
"learning_rate": 1.3333333333333333e-05,
"loss": 1.0449175834655762,
"step": 21
},
{
"epoch": 0.23203691496374423,
"grad_norm": 4.074254512786865,
"learning_rate": 1.4e-05,
"loss": 1.132203459739685,
"step": 22
},
{
"epoch": 0.24258404746209625,
"grad_norm": 3.665837526321411,
"learning_rate": 1.4666666666666666e-05,
"loss": 0.7999849915504456,
"step": 23
},
{
"epoch": 0.25313117996044826,
"grad_norm": 3.750049352645874,
"learning_rate": 1.5333333333333334e-05,
"loss": 0.9189183115959167,
"step": 24
},
{
"epoch": 0.26367831245880025,
"grad_norm": 3.9863851070404053,
"learning_rate": 1.6000000000000003e-05,
"loss": 0.9486135244369507,
"step": 25
},
{
"epoch": 0.2742254449571523,
"grad_norm": 3.5417375564575195,
"learning_rate": 1.6666666666666667e-05,
"loss": 0.7232263088226318,
"step": 26
},
{
"epoch": 0.28477257745550427,
"grad_norm": 2.7772789001464844,
"learning_rate": 1.7333333333333336e-05,
"loss": 0.5559145212173462,
"step": 27
},
{
"epoch": 0.2953197099538563,
"grad_norm": 3.2987618446350098,
"learning_rate": 1.8e-05,
"loss": 0.7673175930976868,
"step": 28
},
{
"epoch": 0.3058668424522083,
"grad_norm": 4.202295303344727,
"learning_rate": 1.866666666666667e-05,
"loss": 0.9726297855377197,
"step": 29
},
{
"epoch": 0.31641397495056034,
"grad_norm": 3.3992533683776855,
"learning_rate": 1.9333333333333333e-05,
"loss": 0.8889808058738708,
"step": 30
},
{
"epoch": 0.3269611074489123,
"grad_norm": 3.55267596244812,
"learning_rate": 2e-05,
"loss": 0.7761465907096863,
"step": 31
},
{
"epoch": 0.3375082399472643,
"grad_norm": 3.9312660694122314,
"learning_rate": 1.9998072404820648e-05,
"loss": 1.0842286348342896,
"step": 32
},
{
"epoch": 0.34805537244561635,
"grad_norm": 3.166452407836914,
"learning_rate": 1.9992290362407232e-05,
"loss": 0.8452663421630859,
"step": 33
},
{
"epoch": 0.35860250494396834,
"grad_norm": 3.7628989219665527,
"learning_rate": 1.998265610184716e-05,
"loss": 0.9143624305725098,
"step": 34
},
{
"epoch": 0.3691496374423204,
"grad_norm": 3.930147409439087,
"learning_rate": 1.9969173337331283e-05,
"loss": 0.937317967414856,
"step": 35
},
{
"epoch": 0.37969676994067236,
"grad_norm": 3.9495177268981934,
"learning_rate": 1.995184726672197e-05,
"loss": 0.9962741732597351,
"step": 36
},
{
"epoch": 0.3902439024390244,
"grad_norm": 3.237985849380493,
"learning_rate": 1.9930684569549265e-05,
"loss": 0.8508425354957581,
"step": 37
},
{
"epoch": 0.4007910349373764,
"grad_norm": 3.5464437007904053,
"learning_rate": 1.990569340443577e-05,
"loss": 1.0232917070388794,
"step": 38
},
{
"epoch": 0.41133816743572843,
"grad_norm": 2.8413944244384766,
"learning_rate": 1.9876883405951378e-05,
"loss": 0.7485581040382385,
"step": 39
},
{
"epoch": 0.4218852999340804,
"grad_norm": 3.03243088722229,
"learning_rate": 1.9844265680898917e-05,
"loss": 0.8981056809425354,
"step": 40
},
{
"epoch": 0.43243243243243246,
"grad_norm": 2.713469982147217,
"learning_rate": 1.9807852804032306e-05,
"loss": 0.7302929162979126,
"step": 41
},
{
"epoch": 0.44297956493078444,
"grad_norm": 2.5833826065063477,
"learning_rate": 1.9767658813208725e-05,
"loss": 0.8823336958885193,
"step": 42
},
{
"epoch": 0.4535266974291364,
"grad_norm": 3.5490224361419678,
"learning_rate": 1.9723699203976768e-05,
"loss": 0.9176093935966492,
"step": 43
},
{
"epoch": 0.46407382992748847,
"grad_norm": 2.9480419158935547,
"learning_rate": 1.96759909236026e-05,
"loss": 0.7887524962425232,
"step": 44
},
{
"epoch": 0.47462096242584045,
"grad_norm": 2.722837448120117,
"learning_rate": 1.9624552364536472e-05,
"loss": 0.7906816601753235,
"step": 45
},
{
"epoch": 0.4851680949241925,
"grad_norm": 2.400080919265747,
"learning_rate": 1.956940335732209e-05,
"loss": 0.5717998147010803,
"step": 46
},
{
"epoch": 0.4957152274225445,
"grad_norm": 3.238320827484131,
"learning_rate": 1.9510565162951538e-05,
"loss": 0.8687648773193359,
"step": 47
},
{
"epoch": 0.5062623599208965,
"grad_norm": 3.124903678894043,
"learning_rate": 1.944806046466878e-05,
"loss": 0.9546631574630737,
"step": 48
},
{
"epoch": 0.5168094924192486,
"grad_norm": 3.41595458984375,
"learning_rate": 1.9381913359224844e-05,
"loss": 0.7677831649780273,
"step": 49
},
{
"epoch": 0.5273566249176005,
"grad_norm": 2.969999313354492,
"learning_rate": 1.9312149347588035e-05,
"loss": 0.8908669352531433,
"step": 50
},
{
"epoch": 0.5273566249176005,
"eval_loss": 0.7529963850975037,
"eval_runtime": 28.3177,
"eval_samples_per_second": 5.05,
"eval_steps_per_second": 1.271,
"step": 50
},
{
"epoch": 0.5379037574159525,
"grad_norm": 2.576383113861084,
"learning_rate": 1.9238795325112867e-05,
"loss": 0.7306627631187439,
"step": 51
},
{
"epoch": 0.5484508899143046,
"grad_norm": 2.5779168605804443,
"learning_rate": 1.916187957117136e-05,
"loss": 0.6502229571342468,
"step": 52
},
{
"epoch": 0.5589980224126566,
"grad_norm": 3.7034096717834473,
"learning_rate": 1.9081431738250815e-05,
"loss": 1.0519064664840698,
"step": 53
},
{
"epoch": 0.5695451549110085,
"grad_norm": 3.7297651767730713,
"learning_rate": 1.8997482840522218e-05,
"loss": 0.9438788890838623,
"step": 54
},
{
"epoch": 0.5800922874093606,
"grad_norm": 2.983699083328247,
"learning_rate": 1.891006524188368e-05,
"loss": 0.810992419719696,
"step": 55
},
{
"epoch": 0.5906394199077126,
"grad_norm": 2.869706869125366,
"learning_rate": 1.881921264348355e-05,
"loss": 0.681011438369751,
"step": 56
},
{
"epoch": 0.6011865524060646,
"grad_norm": 2.8603360652923584,
"learning_rate": 1.8724960070727974e-05,
"loss": 0.8332223892211914,
"step": 57
},
{
"epoch": 0.6117336849044166,
"grad_norm": 2.766416072845459,
"learning_rate": 1.862734385977792e-05,
"loss": 0.8047686815261841,
"step": 58
},
{
"epoch": 0.6222808174027686,
"grad_norm": 2.664792776107788,
"learning_rate": 1.8526401643540924e-05,
"loss": 0.6811239719390869,
"step": 59
},
{
"epoch": 0.6328279499011207,
"grad_norm": 2.787421226501465,
"learning_rate": 1.8422172337162865e-05,
"loss": 0.9071734547615051,
"step": 60
},
{
"epoch": 0.6433750823994726,
"grad_norm": 2.5916903018951416,
"learning_rate": 1.8314696123025456e-05,
"loss": 0.778200089931488,
"step": 61
},
{
"epoch": 0.6539222148978246,
"grad_norm": 2.5858092308044434,
"learning_rate": 1.8204014435255136e-05,
"loss": 0.7620019912719727,
"step": 62
},
{
"epoch": 0.6644693473961767,
"grad_norm": 3.226935386657715,
"learning_rate": 1.8090169943749477e-05,
"loss": 1.0030763149261475,
"step": 63
},
{
"epoch": 0.6750164798945286,
"grad_norm": 2.46641206741333,
"learning_rate": 1.797320653772707e-05,
"loss": 0.6492084860801697,
"step": 64
},
{
"epoch": 0.6855636123928807,
"grad_norm": 2.243069648742676,
"learning_rate": 1.785316930880745e-05,
"loss": 0.6458125114440918,
"step": 65
},
{
"epoch": 0.6961107448912327,
"grad_norm": 2.7569828033447266,
"learning_rate": 1.773010453362737e-05,
"loss": 0.8067665100097656,
"step": 66
},
{
"epoch": 0.7066578773895847,
"grad_norm": 3.01151967048645,
"learning_rate": 1.7604059656000313e-05,
"loss": 0.8096626996994019,
"step": 67
},
{
"epoch": 0.7172050098879367,
"grad_norm": 2.5362462997436523,
"learning_rate": 1.747508326862597e-05,
"loss": 0.5855382084846497,
"step": 68
},
{
"epoch": 0.7277521423862887,
"grad_norm": 3.2442595958709717,
"learning_rate": 1.7343225094356857e-05,
"loss": 1.0010881423950195,
"step": 69
},
{
"epoch": 0.7382992748846408,
"grad_norm": 2.9444711208343506,
"learning_rate": 1.720853596702919e-05,
"loss": 0.9237573146820068,
"step": 70
},
{
"epoch": 0.7488464073829928,
"grad_norm": 2.2847354412078857,
"learning_rate": 1.7071067811865477e-05,
"loss": 0.6892184615135193,
"step": 71
},
{
"epoch": 0.7593935398813447,
"grad_norm": 2.72588849067688,
"learning_rate": 1.6930873625456362e-05,
"loss": 0.7187391519546509,
"step": 72
},
{
"epoch": 0.7699406723796968,
"grad_norm": 2.462245225906372,
"learning_rate": 1.678800745532942e-05,
"loss": 0.6943771839141846,
"step": 73
},
{
"epoch": 0.7804878048780488,
"grad_norm": 2.880293846130371,
"learning_rate": 1.664252437911282e-05,
"loss": 0.7184453010559082,
"step": 74
},
{
"epoch": 0.7910349373764007,
"grad_norm": 3.225119113922119,
"learning_rate": 1.6494480483301836e-05,
"loss": 0.9926764369010925,
"step": 75
},
{
"epoch": 0.8015820698747528,
"grad_norm": 2.788250207901001,
"learning_rate": 1.6343932841636455e-05,
"loss": 0.8473926186561584,
"step": 76
},
{
"epoch": 0.8121292023731048,
"grad_norm": 2.1925415992736816,
"learning_rate": 1.6190939493098344e-05,
"loss": 0.5790418982505798,
"step": 77
},
{
"epoch": 0.8226763348714569,
"grad_norm": 2.4412641525268555,
"learning_rate": 1.6035559419535714e-05,
"loss": 0.677460789680481,
"step": 78
},
{
"epoch": 0.8332234673698088,
"grad_norm": 2.478698968887329,
"learning_rate": 1.5877852522924733e-05,
"loss": 0.8228996992111206,
"step": 79
},
{
"epoch": 0.8437705998681608,
"grad_norm": 2.5369465351104736,
"learning_rate": 1.5717879602276123e-05,
"loss": 0.7633792757987976,
"step": 80
},
{
"epoch": 0.8543177323665129,
"grad_norm": 2.9730212688446045,
"learning_rate": 1.5555702330196024e-05,
"loss": 1.0669782161712646,
"step": 81
},
{
"epoch": 0.8648648648648649,
"grad_norm": 2.1946942806243896,
"learning_rate": 1.5391383229110005e-05,
"loss": 0.6726582646369934,
"step": 82
},
{
"epoch": 0.8754119973632168,
"grad_norm": 2.4897115230560303,
"learning_rate": 1.5224985647159489e-05,
"loss": 0.7702843546867371,
"step": 83
},
{
"epoch": 0.8859591298615689,
"grad_norm": 2.055375337600708,
"learning_rate": 1.5056573733779848e-05,
"loss": 0.49126309156417847,
"step": 84
},
{
"epoch": 0.8965062623599209,
"grad_norm": 2.346480131149292,
"learning_rate": 1.4886212414969551e-05,
"loss": 0.7343087196350098,
"step": 85
},
{
"epoch": 0.9070533948582729,
"grad_norm": 2.2193572521209717,
"learning_rate": 1.4713967368259981e-05,
"loss": 0.5628997683525085,
"step": 86
},
{
"epoch": 0.9176005273566249,
"grad_norm": 2.818474292755127,
"learning_rate": 1.4539904997395468e-05,
"loss": 0.9049317240715027,
"step": 87
},
{
"epoch": 0.9281476598549769,
"grad_norm": 2.0409064292907715,
"learning_rate": 1.436409240673342e-05,
"loss": 0.609929621219635,
"step": 88
},
{
"epoch": 0.938694792353329,
"grad_norm": 2.5648860931396484,
"learning_rate": 1.4186597375374283e-05,
"loss": 0.7217040657997131,
"step": 89
},
{
"epoch": 0.9492419248516809,
"grad_norm": 2.435124158859253,
"learning_rate": 1.4007488331031409e-05,
"loss": 0.6683085560798645,
"step": 90
},
{
"epoch": 0.959789057350033,
"grad_norm": 2.642301082611084,
"learning_rate": 1.3826834323650899e-05,
"loss": 0.7930483222007751,
"step": 91
},
{
"epoch": 0.970336189848385,
"grad_norm": 2.8316915035247803,
"learning_rate": 1.3644704998791501e-05,
"loss": 0.8307502269744873,
"step": 92
},
{
"epoch": 0.980883322346737,
"grad_norm": 2.585615873336792,
"learning_rate": 1.346117057077493e-05,
"loss": 0.809612512588501,
"step": 93
},
{
"epoch": 0.991430454845089,
"grad_norm": 2.4871203899383545,
"learning_rate": 1.3276301795616937e-05,
"loss": 0.7022823095321655,
"step": 94
},
{
"epoch": 1.0,
"grad_norm": 2.2630867958068848,
"learning_rate": 1.3090169943749475e-05,
"loss": 0.540604293346405,
"step": 95
},
{
"epoch": 1.010547132498352,
"grad_norm": 1.8352792263031006,
"learning_rate": 1.2902846772544625e-05,
"loss": 0.47405001521110535,
"step": 96
},
{
"epoch": 1.021094264996704,
"grad_norm": 2.3510472774505615,
"learning_rate": 1.2714404498650743e-05,
"loss": 0.7485337257385254,
"step": 97
},
{
"epoch": 1.031641397495056,
"grad_norm": 2.6154630184173584,
"learning_rate": 1.252491577015158e-05,
"loss": 0.8424244523048401,
"step": 98
},
{
"epoch": 1.042188529993408,
"grad_norm": 2.235624074935913,
"learning_rate": 1.2334453638559057e-05,
"loss": 0.5035255551338196,
"step": 99
},
{
"epoch": 1.05273566249176,
"grad_norm": 2.5067241191864014,
"learning_rate": 1.2143091530650508e-05,
"loss": 0.839946985244751,
"step": 100
},
{
"epoch": 1.05273566249176,
"eval_loss": 0.69390469789505,
"eval_runtime": 28.1554,
"eval_samples_per_second": 5.079,
"eval_steps_per_second": 1.279,
"step": 100
},
{
"epoch": 1.063282794990112,
"grad_norm": 2.4152822494506836,
"learning_rate": 1.1950903220161286e-05,
"loss": 0.6019119024276733,
"step": 101
},
{
"epoch": 1.0738299274884642,
"grad_norm": 3.1178929805755615,
"learning_rate": 1.1757962799343548e-05,
"loss": 0.8134055733680725,
"step": 102
},
{
"epoch": 1.084377059986816,
"grad_norm": 2.630704402923584,
"learning_rate": 1.156434465040231e-05,
"loss": 0.7413411736488342,
"step": 103
},
{
"epoch": 1.094924192485168,
"grad_norm": 2.8832743167877197,
"learning_rate": 1.1370123416819683e-05,
"loss": 0.8591673374176025,
"step": 104
},
{
"epoch": 1.1054713249835202,
"grad_norm": 2.6520588397979736,
"learning_rate": 1.1175373974578378e-05,
"loss": 0.7692611813545227,
"step": 105
},
{
"epoch": 1.1160184574818721,
"grad_norm": 2.3777475357055664,
"learning_rate": 1.098017140329561e-05,
"loss": 0.644071102142334,
"step": 106
},
{
"epoch": 1.126565589980224,
"grad_norm": 2.3438470363616943,
"learning_rate": 1.0784590957278452e-05,
"loss": 0.6566027998924255,
"step": 107
},
{
"epoch": 1.1371127224785762,
"grad_norm": 2.494967222213745,
"learning_rate": 1.058870803651189e-05,
"loss": 0.6349762678146362,
"step": 108
},
{
"epoch": 1.1476598549769281,
"grad_norm": 2.557257652282715,
"learning_rate": 1.0392598157590687e-05,
"loss": 0.7407976388931274,
"step": 109
},
{
"epoch": 1.15820698747528,
"grad_norm": 2.54610013961792,
"learning_rate": 1.0196336924606282e-05,
"loss": 0.6565055251121521,
"step": 110
},
{
"epoch": 1.1687541199736322,
"grad_norm": 2.7403500080108643,
"learning_rate": 1e-05,
"loss": 0.9395892024040222,
"step": 111
},
{
"epoch": 1.1793012524719841,
"grad_norm": 2.6010167598724365,
"learning_rate": 9.80366307539372e-06,
"loss": 0.7564979791641235,
"step": 112
},
{
"epoch": 1.189848384970336,
"grad_norm": 2.5348997116088867,
"learning_rate": 9.607401842409318e-06,
"loss": 0.671207070350647,
"step": 113
},
{
"epoch": 1.2003955174686882,
"grad_norm": 2.2326834201812744,
"learning_rate": 9.41129196348811e-06,
"loss": 0.4958484470844269,
"step": 114
},
{
"epoch": 1.2109426499670402,
"grad_norm": 2.7414183616638184,
"learning_rate": 9.215409042721553e-06,
"loss": 0.7510374784469604,
"step": 115
},
{
"epoch": 1.2214897824653923,
"grad_norm": 2.51889705657959,
"learning_rate": 9.019828596704394e-06,
"loss": 0.6310056447982788,
"step": 116
},
{
"epoch": 1.2320369149637442,
"grad_norm": 2.1737775802612305,
"learning_rate": 8.824626025421625e-06,
"loss": 0.5721197128295898,
"step": 117
},
{
"epoch": 1.2425840474620962,
"grad_norm": 2.6601269245147705,
"learning_rate": 8.629876583180322e-06,
"loss": 0.6723504662513733,
"step": 118
},
{
"epoch": 1.2531311799604483,
"grad_norm": 3.153501033782959,
"learning_rate": 8.43565534959769e-06,
"loss": 0.8398867845535278,
"step": 119
},
{
"epoch": 1.2636783124588002,
"grad_norm": 2.913832664489746,
"learning_rate": 8.242037200656455e-06,
"loss": 0.7067492008209229,
"step": 120
},
{
"epoch": 1.2742254449571524,
"grad_norm": 3.4029502868652344,
"learning_rate": 8.04909677983872e-06,
"loss": 0.9664009809494019,
"step": 121
},
{
"epoch": 1.2847725774555043,
"grad_norm": 2.364175319671631,
"learning_rate": 7.856908469349495e-06,
"loss": 0.5740135312080383,
"step": 122
},
{
"epoch": 1.2953197099538563,
"grad_norm": 2.6324050426483154,
"learning_rate": 7.66554636144095e-06,
"loss": 0.6533321738243103,
"step": 123
},
{
"epoch": 1.3058668424522084,
"grad_norm": 2.7875795364379883,
"learning_rate": 7.4750842298484205e-06,
"loss": 0.7847114205360413,
"step": 124
},
{
"epoch": 1.3164139749505603,
"grad_norm": 2.482607126235962,
"learning_rate": 7.285595501349259e-06,
"loss": 0.6538381576538086,
"step": 125
},
{
"epoch": 1.3269611074489123,
"grad_norm": 2.798854351043701,
"learning_rate": 7.097153227455379e-06,
"loss": 0.7187844514846802,
"step": 126
},
{
"epoch": 1.3375082399472644,
"grad_norm": 3.029470920562744,
"learning_rate": 6.909830056250527e-06,
"loss": 0.859753429889679,
"step": 127
},
{
"epoch": 1.3480553724456164,
"grad_norm": 2.3846898078918457,
"learning_rate": 6.723698204383067e-06,
"loss": 0.6410857439041138,
"step": 128
},
{
"epoch": 1.3586025049439683,
"grad_norm": 2.828608751296997,
"learning_rate": 6.538829429225068e-06,
"loss": 0.7521955966949463,
"step": 129
},
{
"epoch": 1.3691496374423204,
"grad_norm": 2.1056339740753174,
"learning_rate": 6.355295001208504e-06,
"loss": 0.49943816661834717,
"step": 130
},
{
"epoch": 1.3796967699406724,
"grad_norm": 2.9909141063690186,
"learning_rate": 6.173165676349103e-06,
"loss": 0.6608769297599792,
"step": 131
},
{
"epoch": 1.3902439024390243,
"grad_norm": 2.3114278316497803,
"learning_rate": 5.9925116689685925e-06,
"loss": 0.5453819632530212,
"step": 132
},
{
"epoch": 1.4007910349373764,
"grad_norm": 2.200542688369751,
"learning_rate": 5.813402624625722e-06,
"loss": 0.4996246099472046,
"step": 133
},
{
"epoch": 1.4113381674357284,
"grad_norm": 2.2516205310821533,
"learning_rate": 5.635907593266578e-06,
"loss": 0.63039630651474,
"step": 134
},
{
"epoch": 1.4218852999340803,
"grad_norm": 2.5531094074249268,
"learning_rate": 5.460095002604533e-06,
"loss": 0.65385502576828,
"step": 135
},
{
"epoch": 1.4324324324324325,
"grad_norm": 2.369076728820801,
"learning_rate": 5.286032631740023e-06,
"loss": 0.5936092138290405,
"step": 136
},
{
"epoch": 1.4429795649307844,
"grad_norm": 2.984978199005127,
"learning_rate": 5.1137875850304545e-06,
"loss": 0.7236067652702332,
"step": 137
},
{
"epoch": 1.4535266974291363,
"grad_norm": 2.5663387775421143,
"learning_rate": 4.943426266220156e-06,
"loss": 0.6463375091552734,
"step": 138
},
{
"epoch": 1.4640738299274885,
"grad_norm": 2.425461769104004,
"learning_rate": 4.775014352840512e-06,
"loss": 0.6277223825454712,
"step": 139
},
{
"epoch": 1.4746209624258404,
"grad_norm": 2.8183038234710693,
"learning_rate": 4.608616770889998e-06,
"loss": 0.8176087141036987,
"step": 140
},
{
"epoch": 1.4851680949241926,
"grad_norm": 2.203562021255493,
"learning_rate": 4.444297669803981e-06,
"loss": 0.4891142249107361,
"step": 141
},
{
"epoch": 1.4957152274225445,
"grad_norm": 2.412172794342041,
"learning_rate": 4.282120397723879e-06,
"loss": 0.735496997833252,
"step": 142
},
{
"epoch": 1.5062623599208966,
"grad_norm": 2.850745916366577,
"learning_rate": 4.12214747707527e-06,
"loss": 0.736525297164917,
"step": 143
},
{
"epoch": 1.5168094924192486,
"grad_norm": 2.6273257732391357,
"learning_rate": 3.964440580464286e-06,
"loss": 0.629302978515625,
"step": 144
},
{
"epoch": 1.5273566249176005,
"grad_norm": 2.045539379119873,
"learning_rate": 3.8090605069016596e-06,
"loss": 0.5002003312110901,
"step": 145
},
{
"epoch": 1.5379037574159526,
"grad_norm": 2.5290746688842773,
"learning_rate": 3.6560671583635467e-06,
"loss": 0.604846715927124,
"step": 146
},
{
"epoch": 1.5484508899143046,
"grad_norm": 2.6563849449157715,
"learning_rate": 3.505519516698165e-06,
"loss": 0.7351030111312866,
"step": 147
},
{
"epoch": 1.5589980224126565,
"grad_norm": 2.430051326751709,
"learning_rate": 3.3574756208871862e-06,
"loss": 0.49856996536254883,
"step": 148
},
{
"epoch": 1.5695451549110087,
"grad_norm": 2.4349019527435303,
"learning_rate": 3.2119925446705824e-06,
"loss": 0.6530035138130188,
"step": 149
},
{
"epoch": 1.5800922874093606,
"grad_norm": 2.302081823348999,
"learning_rate": 3.069126374543643e-06,
"loss": 0.5958735346794128,
"step": 150
},
{
"epoch": 1.5800922874093606,
"eval_loss": 0.6550542712211609,
"eval_runtime": 27.788,
"eval_samples_per_second": 5.146,
"eval_steps_per_second": 1.296,
"step": 150
}
],
"logging_steps": 1,
"max_steps": 190,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 50,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 4.316898167598182e+16,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}