Files
R3-Phi-4-reasoning-plus-14k/trainer_state.json
ModelHub XC 70a97ddefc 初始化项目,由ModelHub XC社区提供模型
Model: rubricreward/R3-Phi-4-reasoning-plus-14k
Source: Original Platform
2026-10-05 00:41:03 +08:00

1015 lines
24 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 4.988962472406181,
"eval_steps": 500,
"global_step": 140,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.03532008830022075,
"grad_norm": 3.4858555793762207,
"learning_rate": 0.0,
"loss": 1.2361,
"step": 1
},
{
"epoch": 0.0706401766004415,
"grad_norm": 3.464823007583618,
"learning_rate": 7.142857142857143e-07,
"loss": 1.2206,
"step": 2
},
{
"epoch": 0.10596026490066225,
"grad_norm": 3.4208483695983887,
"learning_rate": 1.4285714285714286e-06,
"loss": 1.2132,
"step": 3
},
{
"epoch": 0.141280353200883,
"grad_norm": 3.3376152515411377,
"learning_rate": 2.1428571428571427e-06,
"loss": 1.2121,
"step": 4
},
{
"epoch": 0.17660044150110377,
"grad_norm": 3.1001338958740234,
"learning_rate": 2.8571428571428573e-06,
"loss": 1.1702,
"step": 5
},
{
"epoch": 0.2119205298013245,
"grad_norm": 3.0533435344696045,
"learning_rate": 3.5714285714285718e-06,
"loss": 1.1686,
"step": 6
},
{
"epoch": 0.24724061810154527,
"grad_norm": 2.3576905727386475,
"learning_rate": 4.2857142857142855e-06,
"loss": 1.0736,
"step": 7
},
{
"epoch": 0.282560706401766,
"grad_norm": 2.261962413787842,
"learning_rate": 5e-06,
"loss": 1.0668,
"step": 8
},
{
"epoch": 0.31788079470198677,
"grad_norm": 2.265753746032715,
"learning_rate": 5.7142857142857145e-06,
"loss": 0.9917,
"step": 9
},
{
"epoch": 0.35320088300220753,
"grad_norm": 2.008701801300049,
"learning_rate": 6.4285714285714295e-06,
"loss": 0.9747,
"step": 10
},
{
"epoch": 0.38852097130242824,
"grad_norm": 1.549065351486206,
"learning_rate": 7.1428571428571436e-06,
"loss": 0.921,
"step": 11
},
{
"epoch": 0.423841059602649,
"grad_norm": 1.4250916242599487,
"learning_rate": 7.857142857142858e-06,
"loss": 0.918,
"step": 12
},
{
"epoch": 0.45916114790286977,
"grad_norm": 0.9893090128898621,
"learning_rate": 8.571428571428571e-06,
"loss": 0.8762,
"step": 13
},
{
"epoch": 0.49448123620309054,
"grad_norm": 0.6518274545669556,
"learning_rate": 9.285714285714288e-06,
"loss": 0.8263,
"step": 14
},
{
"epoch": 0.5298013245033113,
"grad_norm": 0.591307520866394,
"learning_rate": 1e-05,
"loss": 0.7922,
"step": 15
},
{
"epoch": 0.565121412803532,
"grad_norm": 0.7602832913398743,
"learning_rate": 9.998445910004082e-06,
"loss": 0.802,
"step": 16
},
{
"epoch": 0.6004415011037527,
"grad_norm": 0.6480713486671448,
"learning_rate": 9.993784606094612e-06,
"loss": 0.7708,
"step": 17
},
{
"epoch": 0.6357615894039735,
"grad_norm": 0.5583199858665466,
"learning_rate": 9.986018985905901e-06,
"loss": 0.7604,
"step": 18
},
{
"epoch": 0.6710816777041942,
"grad_norm": 0.5023630857467651,
"learning_rate": 9.975153876827008e-06,
"loss": 0.7618,
"step": 19
},
{
"epoch": 0.7064017660044151,
"grad_norm": 0.45895782113075256,
"learning_rate": 9.961196033000862e-06,
"loss": 0.7388,
"step": 20
},
{
"epoch": 0.7417218543046358,
"grad_norm": 0.43403342366218567,
"learning_rate": 9.944154131125643e-06,
"loss": 0.7238,
"step": 21
},
{
"epoch": 0.7770419426048565,
"grad_norm": 0.396315336227417,
"learning_rate": 9.924038765061042e-06,
"loss": 0.7187,
"step": 22
},
{
"epoch": 0.8123620309050773,
"grad_norm": 0.36350035667419434,
"learning_rate": 9.900862439242719e-06,
"loss": 0.7146,
"step": 23
},
{
"epoch": 0.847682119205298,
"grad_norm": 0.33320245146751404,
"learning_rate": 9.874639560909118e-06,
"loss": 0.705,
"step": 24
},
{
"epoch": 0.8830022075055187,
"grad_norm": 0.34043627977371216,
"learning_rate": 9.84538643114539e-06,
"loss": 0.7109,
"step": 25
},
{
"epoch": 0.9183222958057395,
"grad_norm": 0.3423653542995453,
"learning_rate": 9.81312123475006e-06,
"loss": 0.7014,
"step": 26
},
{
"epoch": 0.9536423841059603,
"grad_norm": 0.2895442843437195,
"learning_rate": 9.777864028930705e-06,
"loss": 0.683,
"step": 27
},
{
"epoch": 0.9889624724061811,
"grad_norm": 0.28546565771102905,
"learning_rate": 9.73963673083566e-06,
"loss": 0.6918,
"step": 28
},
{
"epoch": 1.0353200883002207,
"grad_norm": 0.6970784664154053,
"learning_rate": 9.698463103929542e-06,
"loss": 1.3478,
"step": 29
},
{
"epoch": 1.0706401766004414,
"grad_norm": 0.2922583520412445,
"learning_rate": 9.654368743221022e-06,
"loss": 0.6623,
"step": 30
},
{
"epoch": 1.1059602649006623,
"grad_norm": 0.267183393239975,
"learning_rate": 9.60738105935204e-06,
"loss": 0.6627,
"step": 31
},
{
"epoch": 1.141280353200883,
"grad_norm": 0.2721976637840271,
"learning_rate": 9.557529261558367e-06,
"loss": 0.6543,
"step": 32
},
{
"epoch": 1.1766004415011038,
"grad_norm": 0.26923075318336487,
"learning_rate": 9.504844339512096e-06,
"loss": 0.6445,
"step": 33
},
{
"epoch": 1.2119205298013245,
"grad_norm": 0.2816242277622223,
"learning_rate": 9.449359044057344e-06,
"loss": 0.6579,
"step": 34
},
{
"epoch": 1.2472406181015452,
"grad_norm": 0.26378050446510315,
"learning_rate": 9.391107866851143e-06,
"loss": 0.6421,
"step": 35
},
{
"epoch": 1.2825607064017661,
"grad_norm": 0.26462990045547485,
"learning_rate": 9.330127018922195e-06,
"loss": 0.6348,
"step": 36
},
{
"epoch": 1.3178807947019868,
"grad_norm": 0.2398785650730133,
"learning_rate": 9.266454408160779e-06,
"loss": 0.6311,
"step": 37
},
{
"epoch": 1.3532008830022075,
"grad_norm": 0.23922935128211975,
"learning_rate": 9.200129615753858e-06,
"loss": 0.6229,
"step": 38
},
{
"epoch": 1.3885209713024282,
"grad_norm": 0.24454143643379211,
"learning_rate": 9.131193871579975e-06,
"loss": 0.6292,
"step": 39
},
{
"epoch": 1.423841059602649,
"grad_norm": 0.2412351816892624,
"learning_rate": 9.059690028579285e-06,
"loss": 0.6298,
"step": 40
},
{
"epoch": 1.4591611479028699,
"grad_norm": 0.23216432332992554,
"learning_rate": 8.985662536114614e-06,
"loss": 0.6223,
"step": 41
},
{
"epoch": 1.4944812362030906,
"grad_norm": 0.22735749185085297,
"learning_rate": 8.90915741234015e-06,
"loss": 0.6196,
"step": 42
},
{
"epoch": 1.5298013245033113,
"grad_norm": 0.21923714876174927,
"learning_rate": 8.83022221559489e-06,
"loss": 0.6158,
"step": 43
},
{
"epoch": 1.565121412803532,
"grad_norm": 0.2194388210773468,
"learning_rate": 8.748906014838672e-06,
"loss": 0.6192,
"step": 44
},
{
"epoch": 1.6004415011037527,
"grad_norm": 0.21789804100990295,
"learning_rate": 8.665259359149132e-06,
"loss": 0.6117,
"step": 45
},
{
"epoch": 1.6357615894039736,
"grad_norm": 0.21348023414611816,
"learning_rate": 8.579334246298593e-06,
"loss": 0.6147,
"step": 46
},
{
"epoch": 1.6710816777041941,
"grad_norm": 0.22152183949947357,
"learning_rate": 8.491184090430365e-06,
"loss": 0.6211,
"step": 47
},
{
"epoch": 1.706401766004415,
"grad_norm": 0.33644410967826843,
"learning_rate": 8.400863688854598e-06,
"loss": 0.6096,
"step": 48
},
{
"epoch": 1.7417218543046358,
"grad_norm": 0.20447926223278046,
"learning_rate": 8.308429187984298e-06,
"loss": 0.6022,
"step": 49
},
{
"epoch": 1.7770419426048565,
"grad_norm": 0.20848725736141205,
"learning_rate": 8.213938048432697e-06,
"loss": 0.6006,
"step": 50
},
{
"epoch": 1.8123620309050774,
"grad_norm": 0.206590473651886,
"learning_rate": 8.117449009293668e-06,
"loss": 0.6067,
"step": 51
},
{
"epoch": 1.847682119205298,
"grad_norm": 0.19945330917835236,
"learning_rate": 8.019022051627387e-06,
"loss": 0.6111,
"step": 52
},
{
"epoch": 1.8830022075055188,
"grad_norm": 0.20706170797348022,
"learning_rate": 7.918718361173951e-06,
"loss": 0.6082,
"step": 53
},
{
"epoch": 1.9183222958057395,
"grad_norm": 0.2041434645652771,
"learning_rate": 7.81660029031811e-06,
"loss": 0.6053,
"step": 54
},
{
"epoch": 1.9536423841059603,
"grad_norm": 0.20378544926643372,
"learning_rate": 7.712731319328798e-06,
"loss": 0.5952,
"step": 55
},
{
"epoch": 1.9889624724061812,
"grad_norm": 0.20271281898021698,
"learning_rate": 7.607176016897491e-06,
"loss": 0.6074,
"step": 56
},
{
"epoch": 2.035320088300221,
"grad_norm": 0.5798813700675964,
"learning_rate": 7.500000000000001e-06,
"loss": 1.1756,
"step": 57
},
{
"epoch": 2.0706401766004414,
"grad_norm": 0.2145741730928421,
"learning_rate": 7.391269893106592e-06,
"loss": 0.5663,
"step": 58
},
{
"epoch": 2.1059602649006623,
"grad_norm": 0.22654342651367188,
"learning_rate": 7.281053286765816e-06,
"loss": 0.5608,
"step": 59
},
{
"epoch": 2.141280353200883,
"grad_norm": 0.214119091629982,
"learning_rate": 7.169418695587791e-06,
"loss": 0.5633,
"step": 60
},
{
"epoch": 2.1766004415011038,
"grad_norm": 0.21689127385616302,
"learning_rate": 7.056435515653059e-06,
"loss": 0.573,
"step": 61
},
{
"epoch": 2.2119205298013247,
"grad_norm": 0.2351013571023941,
"learning_rate": 6.942173981373474e-06,
"loss": 0.5583,
"step": 62
},
{
"epoch": 2.247240618101545,
"grad_norm": 0.2187872976064682,
"learning_rate": 6.8267051218319766e-06,
"loss": 0.5654,
"step": 63
},
{
"epoch": 2.282560706401766,
"grad_norm": 0.22464171051979065,
"learning_rate": 6.710100716628345e-06,
"loss": 0.559,
"step": 64
},
{
"epoch": 2.3178807947019866,
"grad_norm": 0.21201135218143463,
"learning_rate": 6.592433251258423e-06,
"loss": 0.5593,
"step": 65
},
{
"epoch": 2.3532008830022075,
"grad_norm": 0.22330448031425476,
"learning_rate": 6.473775872054522e-06,
"loss": 0.5657,
"step": 66
},
{
"epoch": 2.3885209713024285,
"grad_norm": 0.22798852622509003,
"learning_rate": 6.354202340715027e-06,
"loss": 0.5525,
"step": 67
},
{
"epoch": 2.423841059602649,
"grad_norm": 0.2099257856607437,
"learning_rate": 6.233786988451468e-06,
"loss": 0.5521,
"step": 68
},
{
"epoch": 2.45916114790287,
"grad_norm": 0.22329546511173248,
"learning_rate": 6.112604669781572e-06,
"loss": 0.5477,
"step": 69
},
{
"epoch": 2.4944812362030904,
"grad_norm": 0.21606341004371643,
"learning_rate": 5.990730715996989e-06,
"loss": 0.5617,
"step": 70
},
{
"epoch": 2.5298013245033113,
"grad_norm": 0.22307656705379486,
"learning_rate": 5.8682408883346535e-06,
"loss": 0.5558,
"step": 71
},
{
"epoch": 2.5651214128035322,
"grad_norm": 0.22020138800144196,
"learning_rate": 5.745211330880872e-06,
"loss": 0.5649,
"step": 72
},
{
"epoch": 2.6004415011037527,
"grad_norm": 0.22075800597667694,
"learning_rate": 5.621718523237427e-06,
"loss": 0.5577,
"step": 73
},
{
"epoch": 2.6357615894039736,
"grad_norm": 0.2150786817073822,
"learning_rate": 5.497839232979084e-06,
"loss": 0.5608,
"step": 74
},
{
"epoch": 2.671081677704194,
"grad_norm": 0.20284047722816467,
"learning_rate": 5.373650467932122e-06,
"loss": 0.5475,
"step": 75
},
{
"epoch": 2.706401766004415,
"grad_norm": 0.20899544656276703,
"learning_rate": 5.249229428303486e-06,
"loss": 0.5519,
"step": 76
},
{
"epoch": 2.741721854304636,
"grad_norm": 0.22029131650924683,
"learning_rate": 5.1246534586903655e-06,
"loss": 0.5557,
"step": 77
},
{
"epoch": 2.7770419426048565,
"grad_norm": 0.21529056131839752,
"learning_rate": 5e-06,
"loss": 0.5499,
"step": 78
},
{
"epoch": 2.8123620309050774,
"grad_norm": 0.20519256591796875,
"learning_rate": 4.875346541309637e-06,
"loss": 0.5589,
"step": 79
},
{
"epoch": 2.847682119205298,
"grad_norm": 0.20095472037792206,
"learning_rate": 4.750770571696514e-06,
"loss": 0.5534,
"step": 80
},
{
"epoch": 2.883002207505519,
"grad_norm": 0.2044837325811386,
"learning_rate": 4.626349532067879e-06,
"loss": 0.558,
"step": 81
},
{
"epoch": 2.9183222958057398,
"grad_norm": 0.21322041749954224,
"learning_rate": 4.502160767020918e-06,
"loss": 0.5518,
"step": 82
},
{
"epoch": 2.9536423841059603,
"grad_norm": 0.20826520025730133,
"learning_rate": 4.3782814767625755e-06,
"loss": 0.5594,
"step": 83
},
{
"epoch": 2.988962472406181,
"grad_norm": 0.20033308863639832,
"learning_rate": 4.254788669119127e-06,
"loss": 0.5495,
"step": 84
},
{
"epoch": 3.035320088300221,
"grad_norm": 0.6130826473236084,
"learning_rate": 4.131759111665349e-06,
"loss": 1.0677,
"step": 85
},
{
"epoch": 3.0706401766004414,
"grad_norm": 0.21460668742656708,
"learning_rate": 4.009269284003014e-06,
"loss": 0.524,
"step": 86
},
{
"epoch": 3.1059602649006623,
"grad_norm": 0.22096680104732513,
"learning_rate": 3.887395330218429e-06,
"loss": 0.529,
"step": 87
},
{
"epoch": 3.141280353200883,
"grad_norm": 0.21952886879444122,
"learning_rate": 3.7662130115485317e-06,
"loss": 0.5139,
"step": 88
},
{
"epoch": 3.1766004415011038,
"grad_norm": 0.20717650651931763,
"learning_rate": 3.6457976592849753e-06,
"loss": 0.538,
"step": 89
},
{
"epoch": 3.2119205298013247,
"grad_norm": 0.2178877294063568,
"learning_rate": 3.526224127945479e-06,
"loss": 0.5211,
"step": 90
},
{
"epoch": 3.247240618101545,
"grad_norm": 0.2241029292345047,
"learning_rate": 3.4075667487415785e-06,
"loss": 0.519,
"step": 91
},
{
"epoch": 3.282560706401766,
"grad_norm": 0.21641160547733307,
"learning_rate": 3.289899283371657e-06,
"loss": 0.5243,
"step": 92
},
{
"epoch": 3.3178807947019866,
"grad_norm": 0.21510644257068634,
"learning_rate": 3.173294878168025e-06,
"loss": 0.5221,
"step": 93
},
{
"epoch": 3.3532008830022075,
"grad_norm": 0.19615644216537476,
"learning_rate": 3.057826018626527e-06,
"loss": 0.5125,
"step": 94
},
{
"epoch": 3.3885209713024285,
"grad_norm": 0.2057165652513504,
"learning_rate": 2.9435644843469434e-06,
"loss": 0.5278,
"step": 95
},
{
"epoch": 3.423841059602649,
"grad_norm": 0.20802539587020874,
"learning_rate": 2.83058130441221e-06,
"loss": 0.5283,
"step": 96
},
{
"epoch": 3.45916114790287,
"grad_norm": 0.20562782883644104,
"learning_rate": 2.718946713234185e-06,
"loss": 0.5181,
"step": 97
},
{
"epoch": 3.4944812362030904,
"grad_norm": 0.20871534943580627,
"learning_rate": 2.608730106893411e-06,
"loss": 0.5294,
"step": 98
},
{
"epoch": 3.5298013245033113,
"grad_norm": 0.20962011814117432,
"learning_rate": 2.5000000000000015e-06,
"loss": 0.5254,
"step": 99
},
{
"epoch": 3.5651214128035322,
"grad_norm": 0.21789631247520447,
"learning_rate": 2.39282398310251e-06,
"loss": 0.5205,
"step": 100
},
{
"epoch": 3.6004415011037527,
"grad_norm": 0.20756219327449799,
"learning_rate": 2.2872686806712037e-06,
"loss": 0.5284,
"step": 101
},
{
"epoch": 3.6357615894039736,
"grad_norm": 0.2051207423210144,
"learning_rate": 2.1833997096818897e-06,
"loss": 0.5158,
"step": 102
},
{
"epoch": 3.671081677704194,
"grad_norm": 0.20944955945014954,
"learning_rate": 2.081281638826052e-06,
"loss": 0.5212,
"step": 103
},
{
"epoch": 3.706401766004415,
"grad_norm": 0.2089272290468216,
"learning_rate": 1.980977948372612e-06,
"loss": 0.5196,
"step": 104
},
{
"epoch": 3.741721854304636,
"grad_norm": 0.20365557074546814,
"learning_rate": 1.8825509907063328e-06,
"loss": 0.5206,
"step": 105
},
{
"epoch": 3.7770419426048565,
"grad_norm": 0.21182844042778015,
"learning_rate": 1.7860619515673034e-06,
"loss": 0.5151,
"step": 106
},
{
"epoch": 3.8123620309050774,
"grad_norm": 0.20389576256275177,
"learning_rate": 1.6915708120157042e-06,
"loss": 0.5262,
"step": 107
},
{
"epoch": 3.847682119205298,
"grad_norm": 0.20757290720939636,
"learning_rate": 1.5991363111454023e-06,
"loss": 0.5232,
"step": 108
},
{
"epoch": 3.883002207505519,
"grad_norm": 0.198753222823143,
"learning_rate": 1.5088159095696365e-06,
"loss": 0.5128,
"step": 109
},
{
"epoch": 3.9183222958057398,
"grad_norm": 0.1987779140472412,
"learning_rate": 1.4206657537014078e-06,
"loss": 0.5121,
"step": 110
},
{
"epoch": 3.9536423841059603,
"grad_norm": 0.21601754426956177,
"learning_rate": 1.3347406408508695e-06,
"loss": 0.5182,
"step": 111
},
{
"epoch": 3.988962472406181,
"grad_norm": 0.19785133004188538,
"learning_rate": 1.2510939851613285e-06,
"loss": 0.5122,
"step": 112
},
{
"epoch": 4.035320088300221,
"grad_norm": 0.586131751537323,
"learning_rate": 1.1697777844051105e-06,
"loss": 1.0492,
"step": 113
},
{
"epoch": 4.070640176600442,
"grad_norm": 0.19814273715019226,
"learning_rate": 1.0908425876598512e-06,
"loss": 0.5057,
"step": 114
},
{
"epoch": 4.105960264900662,
"grad_norm": 0.20427848398685455,
"learning_rate": 1.0143374638853892e-06,
"loss": 0.5128,
"step": 115
},
{
"epoch": 4.141280353200883,
"grad_norm": 0.2004529982805252,
"learning_rate": 9.403099714207175e-07,
"loss": 0.5134,
"step": 116
},
{
"epoch": 4.176600441501104,
"grad_norm": 0.20502617955207825,
"learning_rate": 8.688061284200266e-07,
"loss": 0.4987,
"step": 117
},
{
"epoch": 4.211920529801325,
"grad_norm": 0.2038722187280655,
"learning_rate": 7.99870384246143e-07,
"loss": 0.5018,
"step": 118
},
{
"epoch": 4.247240618101546,
"grad_norm": 0.20944777131080627,
"learning_rate": 7.33545591839222e-07,
"loss": 0.5067,
"step": 119
},
{
"epoch": 4.282560706401766,
"grad_norm": 0.19977308809757233,
"learning_rate": 6.698729810778065e-07,
"loss": 0.5042,
"step": 120
},
{
"epoch": 4.317880794701987,
"grad_norm": 0.1941792219877243,
"learning_rate": 6.088921331488568e-07,
"loss": 0.5077,
"step": 121
},
{
"epoch": 4.3532008830022075,
"grad_norm": 0.1949029117822647,
"learning_rate": 5.506409559426573e-07,
"loss": 0.4944,
"step": 122
},
{
"epoch": 4.3885209713024285,
"grad_norm": 0.20529474318027496,
"learning_rate": 4.951556604879049e-07,
"loss": 0.5111,
"step": 123
},
{
"epoch": 4.423841059602649,
"grad_norm": 0.2010287493467331,
"learning_rate": 4.4247073844163434e-07,
"loss": 0.5126,
"step": 124
},
{
"epoch": 4.459161147902869,
"grad_norm": 0.23294468224048615,
"learning_rate": 3.9261894064796136e-07,
"loss": 0.5069,
"step": 125
},
{
"epoch": 4.49448123620309,
"grad_norm": 0.19945360720157623,
"learning_rate": 3.4563125677897936e-07,
"loss": 0.5084,
"step": 126
},
{
"epoch": 4.529801324503311,
"grad_norm": 0.2046247273683548,
"learning_rate": 3.015368960704584e-07,
"loss": 0.4999,
"step": 127
},
{
"epoch": 4.565121412803532,
"grad_norm": 0.1992851048707962,
"learning_rate": 2.6036326916434153e-07,
"loss": 0.499,
"step": 128
},
{
"epoch": 4.600441501103752,
"grad_norm": 0.19971168041229248,
"learning_rate": 2.2213597106929608e-07,
"loss": 0.5064,
"step": 129
},
{
"epoch": 4.635761589403973,
"grad_norm": 0.19480104744434357,
"learning_rate": 1.8687876524993987e-07,
"loss": 0.4898,
"step": 130
},
{
"epoch": 4.671081677704194,
"grad_norm": 0.19488228857517242,
"learning_rate": 1.5461356885461077e-07,
"loss": 0.5177,
"step": 131
},
{
"epoch": 4.706401766004415,
"grad_norm": 0.19764956831932068,
"learning_rate": 1.253604390908819e-07,
"loss": 0.5003,
"step": 132
},
{
"epoch": 4.741721854304636,
"grad_norm": 0.19655047357082367,
"learning_rate": 9.913756075728088e-08,
"loss": 0.5091,
"step": 133
},
{
"epoch": 4.777041942604857,
"grad_norm": 0.19022136926651,
"learning_rate": 7.59612349389599e-08,
"loss": 0.508,
"step": 134
},
{
"epoch": 4.812362030905077,
"grad_norm": 0.19194653630256653,
"learning_rate": 5.584586887435739e-08,
"loss": 0.5047,
"step": 135
},
{
"epoch": 4.847682119205298,
"grad_norm": 0.21053938567638397,
"learning_rate": 3.8803966999139686e-08,
"loss": 0.5102,
"step": 136
},
{
"epoch": 4.883002207505519,
"grad_norm": 0.19490186870098114,
"learning_rate": 2.4846123172992953e-08,
"loss": 0.4918,
"step": 137
},
{
"epoch": 4.91832229580574,
"grad_norm": 0.20711970329284668,
"learning_rate": 1.3981014094099354e-08,
"loss": 0.5133,
"step": 138
},
{
"epoch": 4.95364238410596,
"grad_norm": 0.1879791021347046,
"learning_rate": 6.215393905388278e-09,
"loss": 0.5171,
"step": 139
},
{
"epoch": 4.988962472406181,
"grad_norm": 0.19428808987140656,
"learning_rate": 1.5540899959187727e-09,
"loss": 0.5076,
"step": 140
}
],
"logging_steps": 1,
"max_steps": 140,
"num_input_tokens_seen": 0,
"num_train_epochs": 5,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 320624929013760.0,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}