1240 lines
35 KiB
JSON
1240 lines
35 KiB
JSON
{
|
|
"best_global_step": 320,
|
|
"best_metric": 0.17490149,
|
|
"best_model_checkpoint": "/data/home/scyb089/CODE/scripts/ms-swift/3b/v31-20250504-035000/checkpoint-320",
|
|
"epoch": 2.9977046671767407,
|
|
"eval_steps": 20,
|
|
"global_step": 489,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"epoch": 0.00612088752869166,
|
|
"grad_norm": 2.4262969493865967,
|
|
"learning_rate": 9.999896814055916e-06,
|
|
"loss": 0.29114457964897156,
|
|
"memory(GiB)": 27.73,
|
|
"step": 1,
|
|
"token_acc": 0.8905354511216637,
|
|
"train_speed(iter/s)": 0.075742
|
|
},
|
|
{
|
|
"epoch": 0.030604437643458302,
|
|
"grad_norm": 1.4515410661697388,
|
|
"learning_rate": 9.99742056433851e-06,
|
|
"loss": 0.2713624835014343,
|
|
"memory(GiB)": 27.73,
|
|
"step": 5,
|
|
"token_acc": 0.9116365441541489,
|
|
"train_speed(iter/s)": 0.152509
|
|
},
|
|
{
|
|
"epoch": 0.061208875286916604,
|
|
"grad_norm": 0.9496105909347534,
|
|
"learning_rate": 9.989684918749365e-06,
|
|
"loss": 0.2552653312683105,
|
|
"memory(GiB)": 27.73,
|
|
"step": 10,
|
|
"token_acc": 0.9153024911032028,
|
|
"train_speed(iter/s)": 0.174854
|
|
},
|
|
{
|
|
"epoch": 0.09181331293037491,
|
|
"grad_norm": 0.7063636183738708,
|
|
"learning_rate": 9.976801044672608e-06,
|
|
"loss": 0.2308896780014038,
|
|
"memory(GiB)": 27.73,
|
|
"step": 15,
|
|
"token_acc": 0.9208086725449933,
|
|
"train_speed(iter/s)": 0.184963
|
|
},
|
|
{
|
|
"epoch": 0.12241775057383321,
|
|
"grad_norm": 0.7325994372367859,
|
|
"learning_rate": 9.958782235357938e-06,
|
|
"loss": 0.23883743286132814,
|
|
"memory(GiB)": 27.73,
|
|
"step": 20,
|
|
"token_acc": 0.9143488349915764,
|
|
"train_speed(iter/s)": 0.1933
|
|
},
|
|
{
|
|
"epoch": 0.12241775057383321,
|
|
"eval_loss": 0.2350648194551468,
|
|
"eval_runtime": 3.0009,
|
|
"eval_samples_per_second": 34.99,
|
|
"eval_steps_per_second": 8.997,
|
|
"eval_token_acc": 0.9214235491373249,
|
|
"step": 20
|
|
},
|
|
{
|
|
"epoch": 0.1530221882172915,
|
|
"grad_norm": 0.6182907223701477,
|
|
"learning_rate": 9.935647082149088e-06,
|
|
"loss": 0.22287518978118898,
|
|
"memory(GiB)": 27.73,
|
|
"step": 25,
|
|
"token_acc": 0.9215506715506715,
|
|
"train_speed(iter/s)": 0.176091
|
|
},
|
|
{
|
|
"epoch": 0.18362662586074982,
|
|
"grad_norm": 0.6147263646125793,
|
|
"learning_rate": 9.90741945530174e-06,
|
|
"loss": 0.2169550657272339,
|
|
"memory(GiB)": 27.73,
|
|
"step": 30,
|
|
"token_acc": 0.9242762338076332,
|
|
"train_speed(iter/s)": 0.182484
|
|
},
|
|
{
|
|
"epoch": 0.21423106350420812,
|
|
"grad_norm": 0.5748075246810913,
|
|
"learning_rate": 9.874128479354833e-06,
|
|
"loss": 0.20252976417541504,
|
|
"memory(GiB)": 27.73,
|
|
"step": 35,
|
|
"token_acc": 0.9266982811494906,
|
|
"train_speed(iter/s)": 0.184908
|
|
},
|
|
{
|
|
"epoch": 0.24483550114766642,
|
|
"grad_norm": 0.5819372534751892,
|
|
"learning_rate": 9.835808503080586e-06,
|
|
"loss": 0.2103517770767212,
|
|
"memory(GiB)": 27.73,
|
|
"step": 40,
|
|
"token_acc": 0.9242556390977443,
|
|
"train_speed(iter/s)": 0.187883
|
|
},
|
|
{
|
|
"epoch": 0.24483550114766642,
|
|
"eval_loss": 0.21685469150543213,
|
|
"eval_runtime": 2.9694,
|
|
"eval_samples_per_second": 35.361,
|
|
"eval_steps_per_second": 9.093,
|
|
"eval_token_acc": 0.9267889015090054,
|
|
"step": 40
|
|
},
|
|
{
|
|
"epoch": 0.2754399387911247,
|
|
"grad_norm": 0.5915679931640625,
|
|
"learning_rate": 9.792499064044343e-06,
|
|
"loss": 0.22011182308197022,
|
|
"memory(GiB)": 27.73,
|
|
"step": 45,
|
|
"token_acc": 0.9259782645267656,
|
|
"train_speed(iter/s)": 0.178276
|
|
},
|
|
{
|
|
"epoch": 0.306044376434583,
|
|
"grad_norm": 0.5741272568702698,
|
|
"learning_rate": 9.744244847810716e-06,
|
|
"loss": 0.20354759693145752,
|
|
"memory(GiB)": 27.73,
|
|
"step": 50,
|
|
"token_acc": 0.9264593625325863,
|
|
"train_speed(iter/s)": 0.180934
|
|
},
|
|
{
|
|
"epoch": 0.3366488140780413,
|
|
"grad_norm": 0.6794053316116333,
|
|
"learning_rate": 9.691095641838168e-06,
|
|
"loss": 0.20430679321289064,
|
|
"memory(GiB)": 27.73,
|
|
"step": 55,
|
|
"token_acc": 0.9300412165115843,
|
|
"train_speed(iter/s)": 0.184099
|
|
},
|
|
{
|
|
"epoch": 0.36725325172149964,
|
|
"grad_norm": 0.638066828250885,
|
|
"learning_rate": 9.633106284109612e-06,
|
|
"loss": 0.20622057914733888,
|
|
"memory(GiB)": 27.73,
|
|
"step": 60,
|
|
"token_acc": 0.9269024685344354,
|
|
"train_speed(iter/s)": 0.187435
|
|
},
|
|
{
|
|
"epoch": 0.36725325172149964,
|
|
"eval_loss": 0.20562399923801422,
|
|
"eval_runtime": 2.9656,
|
|
"eval_samples_per_second": 35.406,
|
|
"eval_steps_per_second": 9.104,
|
|
"eval_token_acc": 0.9300124398290875,
|
|
"step": 60
|
|
},
|
|
{
|
|
"epoch": 0.3978576893649579,
|
|
"grad_norm": 0.6637494564056396,
|
|
"learning_rate": 9.570336606551966e-06,
|
|
"loss": 0.19611797332763672,
|
|
"memory(GiB)": 27.73,
|
|
"step": 65,
|
|
"token_acc": 0.9295485869849984,
|
|
"train_speed(iter/s)": 0.180966
|
|
},
|
|
{
|
|
"epoch": 0.42846212700841624,
|
|
"grad_norm": 0.6041725873947144,
|
|
"learning_rate": 9.502851373303137e-06,
|
|
"loss": 0.19453718662261962,
|
|
"memory(GiB)": 27.73,
|
|
"step": 70,
|
|
"token_acc": 0.935506221719457,
|
|
"train_speed(iter/s)": 0.182759
|
|
},
|
|
{
|
|
"epoch": 0.4590665646518745,
|
|
"grad_norm": 0.6496462225914001,
|
|
"learning_rate": 9.43072021389003e-06,
|
|
"loss": 0.19291472434997559,
|
|
"memory(GiB)": 27.73,
|
|
"step": 75,
|
|
"token_acc": 0.9276501621556994,
|
|
"train_speed(iter/s)": 0.184684
|
|
},
|
|
{
|
|
"epoch": 0.48967100229533284,
|
|
"grad_norm": 0.6091645359992981,
|
|
"learning_rate": 9.354017551386599e-06,
|
|
"loss": 0.19289860725402833,
|
|
"memory(GiB)": 29.73,
|
|
"step": 80,
|
|
"token_acc": 0.9271297939943614,
|
|
"train_speed(iter/s)": 0.186191
|
|
},
|
|
{
|
|
"epoch": 0.48967100229533284,
|
|
"eval_loss": 0.20189911127090454,
|
|
"eval_runtime": 2.9558,
|
|
"eval_samples_per_second": 35.523,
|
|
"eval_steps_per_second": 9.134,
|
|
"eval_token_acc": 0.9315160365622803,
|
|
"step": 80
|
|
},
|
|
{
|
|
"epoch": 0.5202754399387911,
|
|
"grad_norm": 0.6070266962051392,
|
|
"learning_rate": 9.272822525626047e-06,
|
|
"loss": 0.18841828107833863,
|
|
"memory(GiB)": 29.73,
|
|
"step": 85,
|
|
"token_acc": 0.9308790049419735,
|
|
"train_speed(iter/s)": 0.181691
|
|
},
|
|
{
|
|
"epoch": 0.5508798775822494,
|
|
"grad_norm": 0.5664994120597839,
|
|
"learning_rate": 9.187218911546363e-06,
|
|
"loss": 0.18708581924438478,
|
|
"memory(GiB)": 29.73,
|
|
"step": 90,
|
|
"token_acc": 0.9307408366791866,
|
|
"train_speed(iter/s)": 0.183539
|
|
},
|
|
{
|
|
"epoch": 0.5814843152257078,
|
|
"grad_norm": 0.6189126372337341,
|
|
"learning_rate": 9.09729503275351e-06,
|
|
"loss": 0.1919234037399292,
|
|
"memory(GiB)": 29.73,
|
|
"step": 95,
|
|
"token_acc": 0.9302339232778609,
|
|
"train_speed(iter/s)": 0.18417
|
|
},
|
|
{
|
|
"epoch": 0.612088752869166,
|
|
"grad_norm": 0.5816466808319092,
|
|
"learning_rate": 9.003143670391403e-06,
|
|
"loss": 0.17953382730484008,
|
|
"memory(GiB)": 29.73,
|
|
"step": 100,
|
|
"token_acc": 0.9341908338745658,
|
|
"train_speed(iter/s)": 0.185218
|
|
},
|
|
{
|
|
"epoch": 0.612088752869166,
|
|
"eval_loss": 0.19569453597068787,
|
|
"eval_runtime": 2.9576,
|
|
"eval_samples_per_second": 35.502,
|
|
"eval_steps_per_second": 9.129,
|
|
"eval_token_acc": 0.9332143436638001,
|
|
"step": 100
|
|
},
|
|
{
|
|
"epoch": 0.6426931905126243,
|
|
"grad_norm": 0.6038978695869446,
|
|
"learning_rate": 8.904861967412702e-06,
|
|
"loss": 0.18669098615646362,
|
|
"memory(GiB)": 29.73,
|
|
"step": 105,
|
|
"token_acc": 0.9360083136077594,
|
|
"train_speed(iter/s)": 0.182365
|
|
},
|
|
{
|
|
"epoch": 0.6732976281560826,
|
|
"grad_norm": 0.6839295029640198,
|
|
"learning_rate": 8.802551328349222e-06,
|
|
"loss": 0.18886933326721192,
|
|
"memory(GiB)": 29.73,
|
|
"step": 110,
|
|
"token_acc": 0.9355897003717136,
|
|
"train_speed(iter/s)": 0.183447
|
|
},
|
|
{
|
|
"epoch": 0.703902065799541,
|
|
"grad_norm": 0.5784356594085693,
|
|
"learning_rate": 8.696317314685342e-06,
|
|
"loss": 0.1860347270965576,
|
|
"memory(GiB)": 29.73,
|
|
"step": 115,
|
|
"token_acc": 0.934266941773856,
|
|
"train_speed(iter/s)": 0.184623
|
|
},
|
|
{
|
|
"epoch": 0.7345065034429993,
|
|
"grad_norm": 0.6492018103599548,
|
|
"learning_rate": 8.586269535942386e-06,
|
|
"loss": 0.191730272769928,
|
|
"memory(GiB)": 29.73,
|
|
"step": 120,
|
|
"token_acc": 0.9330231994302426,
|
|
"train_speed(iter/s)": 0.185813
|
|
},
|
|
{
|
|
"epoch": 0.7345065034429993,
|
|
"eval_loss": 0.19317017495632172,
|
|
"eval_runtime": 2.9604,
|
|
"eval_samples_per_second": 35.468,
|
|
"eval_steps_per_second": 9.12,
|
|
"eval_token_acc": 0.9342636162042296,
|
|
"step": 120
|
|
},
|
|
{
|
|
"epoch": 0.7651109410864575,
|
|
"grad_norm": 0.5753573775291443,
|
|
"learning_rate": 8.472521536586336e-06,
|
|
"loss": 0.18596272468566893,
|
|
"memory(GiB)": 29.73,
|
|
"step": 125,
|
|
"token_acc": 0.9319849005577779,
|
|
"train_speed(iter/s)": 0.182874
|
|
},
|
|
{
|
|
"epoch": 0.7957153787299158,
|
|
"grad_norm": 0.586589515209198,
|
|
"learning_rate": 8.355190678875577e-06,
|
|
"loss": 0.18235174417495728,
|
|
"memory(GiB)": 29.73,
|
|
"step": 130,
|
|
"token_acc": 0.9364593742793451,
|
|
"train_speed(iter/s)": 0.183919
|
|
},
|
|
{
|
|
"epoch": 0.8263198163733741,
|
|
"grad_norm": 0.6312227845191956,
|
|
"learning_rate": 8.234398021769541e-06,
|
|
"loss": 0.18675460815429687,
|
|
"memory(GiB)": 29.73,
|
|
"step": 135,
|
|
"token_acc": 0.9301861157944705,
|
|
"train_speed(iter/s)": 0.184691
|
|
},
|
|
{
|
|
"epoch": 0.8569242540168325,
|
|
"grad_norm": 0.5985466837882996,
|
|
"learning_rate": 8.110268196023179e-06,
|
|
"loss": 0.18646229505538942,
|
|
"memory(GiB)": 29.73,
|
|
"step": 140,
|
|
"token_acc": 0.9337858101175913,
|
|
"train_speed(iter/s)": 0.185698
|
|
},
|
|
{
|
|
"epoch": 0.8569242540168325,
|
|
"eval_loss": 0.18890073895454407,
|
|
"eval_runtime": 2.9675,
|
|
"eval_samples_per_second": 35.383,
|
|
"eval_steps_per_second": 9.098,
|
|
"eval_token_acc": 0.9360809129752826,
|
|
"step": 140
|
|
},
|
|
{
|
|
"epoch": 0.8875286916602907,
|
|
"grad_norm": 0.6701765060424805,
|
|
"learning_rate": 7.982929275596164e-06,
|
|
"loss": 0.18306300640106202,
|
|
"memory(GiB)": 29.73,
|
|
"step": 145,
|
|
"token_acc": 0.9374918368235448,
|
|
"train_speed(iter/s)": 0.183024
|
|
},
|
|
{
|
|
"epoch": 0.918133129303749,
|
|
"grad_norm": 0.6174297332763672,
|
|
"learning_rate": 7.85251264550948e-06,
|
|
"loss": 0.18363630771636963,
|
|
"memory(GiB)": 29.73,
|
|
"step": 150,
|
|
"token_acc": 0.9375606928038264,
|
|
"train_speed(iter/s)": 0.183651
|
|
},
|
|
{
|
|
"epoch": 0.9487375669472073,
|
|
"grad_norm": 0.6339284181594849,
|
|
"learning_rate": 7.719152866285722e-06,
|
|
"loss": 0.17851275205612183,
|
|
"memory(GiB)": 29.73,
|
|
"step": 155,
|
|
"token_acc": 0.9321391193556705,
|
|
"train_speed(iter/s)": 0.184494
|
|
},
|
|
{
|
|
"epoch": 0.9793420045906657,
|
|
"grad_norm": 0.589568555355072,
|
|
"learning_rate": 7.5829875351130224e-06,
|
|
"loss": 0.1714911699295044,
|
|
"memory(GiB)": 29.73,
|
|
"step": 160,
|
|
"token_acc": 0.936993310933695,
|
|
"train_speed(iter/s)": 0.185314
|
|
},
|
|
{
|
|
"epoch": 0.9793420045906657,
|
|
"eval_loss": 0.18555624783039093,
|
|
"eval_runtime": 2.9746,
|
|
"eval_samples_per_second": 35.299,
|
|
"eval_steps_per_second": 9.077,
|
|
"eval_token_acc": 0.9358970198496404,
|
|
"step": 160
|
|
},
|
|
{
|
|
"epoch": 1.0122417750573833,
|
|
"grad_norm": 0.5571500062942505,
|
|
"learning_rate": 7.44415714387582e-06,
|
|
"loss": 0.1988983631134033,
|
|
"memory(GiB)": 29.73,
|
|
"step": 165,
|
|
"token_acc": 0.9428557149282822,
|
|
"train_speed(iter/s)": 0.183086
|
|
},
|
|
{
|
|
"epoch": 1.0428462127008415,
|
|
"grad_norm": 0.668183445930481,
|
|
"learning_rate": 7.302804934198937e-06,
|
|
"loss": 0.14512217044830322,
|
|
"memory(GiB)": 29.73,
|
|
"step": 170,
|
|
"token_acc": 0.9455400702401195,
|
|
"train_speed(iter/s)": 0.183717
|
|
},
|
|
{
|
|
"epoch": 1.0734506503443,
|
|
"grad_norm": 0.6544790267944336,
|
|
"learning_rate": 7.159076749654559e-06,
|
|
"loss": 0.1422812223434448,
|
|
"memory(GiB)": 29.73,
|
|
"step": 175,
|
|
"token_acc": 0.9467687539877859,
|
|
"train_speed(iter/s)": 0.184527
|
|
},
|
|
{
|
|
"epoch": 1.1040550879877582,
|
|
"grad_norm": 0.6180390119552612,
|
|
"learning_rate": 7.013120885284599e-06,
|
|
"loss": 0.14142969846725464,
|
|
"memory(GiB)": 29.73,
|
|
"step": 180,
|
|
"token_acc": 0.9519427697810598,
|
|
"train_speed(iter/s)": 0.185066
|
|
},
|
|
{
|
|
"epoch": 1.1040550879877582,
|
|
"eval_loss": 0.1868736445903778,
|
|
"eval_runtime": 2.9588,
|
|
"eval_samples_per_second": 35.487,
|
|
"eval_steps_per_second": 9.125,
|
|
"eval_token_acc": 0.9361025474606522,
|
|
"step": 180
|
|
},
|
|
{
|
|
"epoch": 1.1346595256312164,
|
|
"grad_norm": 0.5758160352706909,
|
|
"learning_rate": 6.86508793459368e-06,
|
|
"loss": 0.13951488733291625,
|
|
"memory(GiB)": 29.73,
|
|
"step": 185,
|
|
"token_acc": 0.9455232473644789,
|
|
"train_speed(iter/s)": 0.182916
|
|
},
|
|
{
|
|
"epoch": 1.1652639632746749,
|
|
"grad_norm": 0.6193047761917114,
|
|
"learning_rate": 6.715130634170636e-06,
|
|
"loss": 0.146294903755188,
|
|
"memory(GiB)": 29.73,
|
|
"step": 190,
|
|
"token_acc": 0.9483162813805095,
|
|
"train_speed(iter/s)": 0.183613
|
|
},
|
|
{
|
|
"epoch": 1.195868400918133,
|
|
"grad_norm": 0.5518524050712585,
|
|
"learning_rate": 6.563403706098833e-06,
|
|
"loss": 0.14221264123916627,
|
|
"memory(GiB)": 29.73,
|
|
"step": 195,
|
|
"token_acc": 0.948411852483479,
|
|
"train_speed(iter/s)": 0.184409
|
|
},
|
|
{
|
|
"epoch": 1.2264728385615915,
|
|
"grad_norm": 0.5622280836105347,
|
|
"learning_rate": 6.410063698317901e-06,
|
|
"loss": 0.14119510650634765,
|
|
"memory(GiB)": 29.73,
|
|
"step": 200,
|
|
"token_acc": 0.949674972130127,
|
|
"train_speed(iter/s)": 0.184756
|
|
},
|
|
{
|
|
"epoch": 1.2264728385615915,
|
|
"eval_loss": 0.18399108946323395,
|
|
"eval_runtime": 2.9642,
|
|
"eval_samples_per_second": 35.423,
|
|
"eval_steps_per_second": 9.109,
|
|
"eval_token_acc": 0.9372816269132997,
|
|
"step": 200
|
|
},
|
|
{
|
|
"epoch": 1.2570772762050497,
|
|
"grad_norm": 0.5925666689872742,
|
|
"learning_rate": 6.255268823101604e-06,
|
|
"loss": 0.13880105018615724,
|
|
"memory(GiB)": 29.73,
|
|
"step": 205,
|
|
"token_acc": 0.9477773473991206,
|
|
"train_speed(iter/s)": 0.183189
|
|
},
|
|
{
|
|
"epoch": 1.287681713848508,
|
|
"grad_norm": 0.6059976816177368,
|
|
"learning_rate": 6.099178793818479e-06,
|
|
"loss": 0.14395406246185302,
|
|
"memory(GiB)": 29.73,
|
|
"step": 210,
|
|
"token_acc": 0.950825693689833,
|
|
"train_speed(iter/s)": 0.183549
|
|
},
|
|
{
|
|
"epoch": 1.3182861514919664,
|
|
"grad_norm": 0.563386857509613,
|
|
"learning_rate": 5.941954660143703e-06,
|
|
"loss": 0.13854990005493165,
|
|
"memory(GiB)": 29.73,
|
|
"step": 215,
|
|
"token_acc": 0.9485802112183096,
|
|
"train_speed(iter/s)": 0.184231
|
|
},
|
|
{
|
|
"epoch": 1.3488905891354246,
|
|
"grad_norm": 0.6268328428268433,
|
|
"learning_rate": 5.783758641892172e-06,
|
|
"loss": 0.14123060703277587,
|
|
"memory(GiB)": 29.73,
|
|
"step": 220,
|
|
"token_acc": 0.9484895429899303,
|
|
"train_speed(iter/s)": 0.184974
|
|
},
|
|
{
|
|
"epoch": 1.3488905891354246,
|
|
"eval_loss": 0.18251946568489075,
|
|
"eval_runtime": 2.9684,
|
|
"eval_samples_per_second": 35.372,
|
|
"eval_steps_per_second": 9.096,
|
|
"eval_token_acc": 0.9383849856671534,
|
|
"step": 220
|
|
},
|
|
{
|
|
"epoch": 1.379495026778883,
|
|
"grad_norm": 0.5578710436820984,
|
|
"learning_rate": 5.624753961644281e-06,
|
|
"loss": 0.14209306240081787,
|
|
"memory(GiB)": 29.73,
|
|
"step": 225,
|
|
"token_acc": 0.9469471634849386,
|
|
"train_speed(iter/s)": 0.183543
|
|
},
|
|
{
|
|
"epoch": 1.4100994644223412,
|
|
"grad_norm": 0.6176152229309082,
|
|
"learning_rate": 5.4651046763370615e-06,
|
|
"loss": 0.1443139672279358,
|
|
"memory(GiB)": 29.73,
|
|
"step": 230,
|
|
"token_acc": 0.9480665287334199,
|
|
"train_speed(iter/s)": 0.184004
|
|
},
|
|
{
|
|
"epoch": 1.4407039020657995,
|
|
"grad_norm": 0.5799533724784851,
|
|
"learning_rate": 5.304975507994453e-06,
|
|
"loss": 0.13565800189971924,
|
|
"memory(GiB)": 29.73,
|
|
"step": 235,
|
|
"token_acc": 0.9535484258411278,
|
|
"train_speed(iter/s)": 0.184791
|
|
},
|
|
{
|
|
"epoch": 1.471308339709258,
|
|
"grad_norm": 0.6195805072784424,
|
|
"learning_rate": 5.144531673771364e-06,
|
|
"loss": 0.13422565460205077,
|
|
"memory(GiB)": 29.73,
|
|
"step": 240,
|
|
"token_acc": 0.9504853626843996,
|
|
"train_speed(iter/s)": 0.185206
|
|
},
|
|
{
|
|
"epoch": 1.471308339709258,
|
|
"eval_loss": 0.1826462596654892,
|
|
"eval_runtime": 2.974,
|
|
"eval_samples_per_second": 35.306,
|
|
"eval_steps_per_second": 9.079,
|
|
"eval_token_acc": 0.9378441235329115,
|
|
"step": 240
|
|
},
|
|
{
|
|
"epoch": 1.501912777352716,
|
|
"grad_norm": 0.5705444812774658,
|
|
"learning_rate": 4.983938715486858e-06,
|
|
"loss": 0.13150216341018678,
|
|
"memory(GiB)": 29.73,
|
|
"step": 245,
|
|
"token_acc": 0.9486215675776085,
|
|
"train_speed(iter/s)": 0.183983
|
|
},
|
|
{
|
|
"epoch": 1.5325172149961745,
|
|
"grad_norm": 0.6076279282569885,
|
|
"learning_rate": 4.82336232882237e-06,
|
|
"loss": 0.1356377363204956,
|
|
"memory(GiB)": 29.73,
|
|
"step": 250,
|
|
"token_acc": 0.9495890326460746,
|
|
"train_speed(iter/s)": 0.184361
|
|
},
|
|
{
|
|
"epoch": 1.5631216526396328,
|
|
"grad_norm": 0.606853187084198,
|
|
"learning_rate": 4.662968192361161e-06,
|
|
"loss": 0.1377635955810547,
|
|
"memory(GiB)": 29.73,
|
|
"step": 255,
|
|
"token_acc": 0.9498974208675264,
|
|
"train_speed(iter/s)": 0.184863
|
|
},
|
|
{
|
|
"epoch": 1.593726090283091,
|
|
"grad_norm": 0.5685162544250488,
|
|
"learning_rate": 4.502921796645424e-06,
|
|
"loss": 0.13207011222839354,
|
|
"memory(GiB)": 29.73,
|
|
"step": 260,
|
|
"token_acc": 0.9555538648813147,
|
|
"train_speed(iter/s)": 0.185408
|
|
},
|
|
{
|
|
"epoch": 1.593726090283091,
|
|
"eval_loss": 0.18062403798103333,
|
|
"eval_runtime": 2.9631,
|
|
"eval_samples_per_second": 35.435,
|
|
"eval_steps_per_second": 9.112,
|
|
"eval_token_acc": 0.9392503650819406,
|
|
"step": 260
|
|
},
|
|
{
|
|
"epoch": 1.6243305279265492,
|
|
"grad_norm": 0.6115860342979431,
|
|
"learning_rate": 4.3433882734274e-06,
|
|
"loss": 0.13854453563690186,
|
|
"memory(GiB)": 29.73,
|
|
"step": 265,
|
|
"token_acc": 0.950067791336045,
|
|
"train_speed(iter/s)": 0.184317
|
|
},
|
|
{
|
|
"epoch": 1.6549349655700076,
|
|
"grad_norm": 0.594256579875946,
|
|
"learning_rate": 4.184532225290687e-06,
|
|
"loss": 0.14273109436035156,
|
|
"memory(GiB)": 29.73,
|
|
"step": 270,
|
|
"token_acc": 0.949110499003211,
|
|
"train_speed(iter/s)": 0.184908
|
|
},
|
|
{
|
|
"epoch": 1.685539403213466,
|
|
"grad_norm": 0.6124013662338257,
|
|
"learning_rate": 4.026517555817527e-06,
|
|
"loss": 0.14174976348876953,
|
|
"memory(GiB)": 29.73,
|
|
"step": 275,
|
|
"token_acc": 0.9440209335390386,
|
|
"train_speed(iter/s)": 0.185319
|
|
},
|
|
{
|
|
"epoch": 1.7161438408569243,
|
|
"grad_norm": 0.5577505230903625,
|
|
"learning_rate": 3.869507300477311e-06,
|
|
"loss": 0.14029152393341066,
|
|
"memory(GiB)": 29.73,
|
|
"step": 280,
|
|
"token_acc": 0.949042973113875,
|
|
"train_speed(iter/s)": 0.185887
|
|
},
|
|
{
|
|
"epoch": 1.7161438408569243,
|
|
"eval_loss": 0.17867250740528107,
|
|
"eval_runtime": 2.9631,
|
|
"eval_samples_per_second": 35.436,
|
|
"eval_steps_per_second": 9.112,
|
|
"eval_token_acc": 0.9399534858564552,
|
|
"step": 280
|
|
},
|
|
{
|
|
"epoch": 1.7467482785003825,
|
|
"grad_norm": 0.5901487469673157,
|
|
"learning_rate": 3.7136634584107787e-06,
|
|
"loss": 0.13561428785324098,
|
|
"memory(GiB)": 32.03,
|
|
"step": 285,
|
|
"token_acc": 0.9532760191419626,
|
|
"train_speed(iter/s)": 0.184838
|
|
},
|
|
{
|
|
"epoch": 1.7773527161438407,
|
|
"grad_norm": 0.5688520073890686,
|
|
"learning_rate": 3.5591468252834654e-06,
|
|
"loss": 0.13801207542419433,
|
|
"memory(GiB)": 32.03,
|
|
"step": 290,
|
|
"token_acc": 0.9521514789965446,
|
|
"train_speed(iter/s)": 0.185292
|
|
},
|
|
{
|
|
"epoch": 1.8079571537872992,
|
|
"grad_norm": 0.5571552515029907,
|
|
"learning_rate": 3.4061168273808896e-06,
|
|
"loss": 0.13579220771789552,
|
|
"memory(GiB)": 32.03,
|
|
"step": 295,
|
|
"token_acc": 0.9481830960882842,
|
|
"train_speed(iter/s)": 0.18574
|
|
},
|
|
{
|
|
"epoch": 1.8385615914307576,
|
|
"grad_norm": 0.5458003282546997,
|
|
"learning_rate": 3.254731357116597e-06,
|
|
"loss": 0.13743789196014405,
|
|
"memory(GiB)": 32.03,
|
|
"step": 300,
|
|
"token_acc": 0.9545541917236455,
|
|
"train_speed(iter/s)": 0.186123
|
|
},
|
|
{
|
|
"epoch": 1.8385615914307576,
|
|
"eval_loss": 0.17722059786319733,
|
|
"eval_runtime": 2.9691,
|
|
"eval_samples_per_second": 35.364,
|
|
"eval_steps_per_second": 9.094,
|
|
"eval_token_acc": 0.9400183893125642,
|
|
"step": 300
|
|
},
|
|
{
|
|
"epoch": 1.8691660290742158,
|
|
"grad_norm": 0.5650319457054138,
|
|
"learning_rate": 3.105146610122839e-06,
|
|
"loss": 0.13116140365600587,
|
|
"memory(GiB)": 32.03,
|
|
"step": 305,
|
|
"token_acc": 0.9474181254005194,
|
|
"train_speed(iter/s)": 0.185096
|
|
},
|
|
{
|
|
"epoch": 1.899770466717674,
|
|
"grad_norm": 0.5377411842346191,
|
|
"learning_rate": 2.95751692409194e-06,
|
|
"loss": 0.141234827041626,
|
|
"memory(GiB)": 32.03,
|
|
"step": 310,
|
|
"token_acc": 0.9441545925827463,
|
|
"train_speed(iter/s)": 0.185517
|
|
},
|
|
{
|
|
"epoch": 1.9303749043611322,
|
|
"grad_norm": 0.5164922475814819,
|
|
"learning_rate": 2.8119946195346375e-06,
|
|
"loss": 0.13225994110107422,
|
|
"memory(GiB)": 32.03,
|
|
"step": 315,
|
|
"token_acc": 0.9511941848390446,
|
|
"train_speed(iter/s)": 0.185993
|
|
},
|
|
{
|
|
"epoch": 1.9609793420045907,
|
|
"grad_norm": 0.5725815892219543,
|
|
"learning_rate": 2.6687298426196974e-06,
|
|
"loss": 0.1376440167427063,
|
|
"memory(GiB)": 32.03,
|
|
"step": 320,
|
|
"token_acc": 0.9511019926015729,
|
|
"train_speed(iter/s)": 0.186367
|
|
},
|
|
{
|
|
"epoch": 1.9609793420045907,
|
|
"eval_loss": 0.17490148544311523,
|
|
"eval_runtime": 2.9672,
|
|
"eval_samples_per_second": 35.386,
|
|
"eval_steps_per_second": 9.099,
|
|
"eval_token_acc": 0.9408945859700363,
|
|
"step": 320
|
|
},
|
|
{
|
|
"epoch": 1.9915837796480491,
|
|
"grad_norm": 0.5404472947120667,
|
|
"learning_rate": 2.527870410256966e-06,
|
|
"loss": 0.1282888650894165,
|
|
"memory(GiB)": 32.03,
|
|
"step": 325,
|
|
"token_acc": 0.9526283186802439,
|
|
"train_speed(iter/s)": 0.185372
|
|
},
|
|
{
|
|
"epoch": 2.0244835501147667,
|
|
"grad_norm": 0.5364894270896912,
|
|
"learning_rate": 2.389561657583681e-06,
|
|
"loss": 0.14493446350097655,
|
|
"memory(GiB)": 32.03,
|
|
"step": 330,
|
|
"token_acc": 0.9557499000952937,
|
|
"train_speed(iter/s)": 0.185654
|
|
},
|
|
{
|
|
"epoch": 2.055087987758225,
|
|
"grad_norm": 0.5487475395202637,
|
|
"learning_rate": 2.253946288011419e-06,
|
|
"loss": 0.10785077810287476,
|
|
"memory(GiB)": 32.03,
|
|
"step": 335,
|
|
"token_acc": 0.9601302750594264,
|
|
"train_speed(iter/s)": 0.186057
|
|
},
|
|
{
|
|
"epoch": 2.085692425401683,
|
|
"grad_norm": 0.5607486963272095,
|
|
"learning_rate": 2.121164225988387e-06,
|
|
"loss": 0.10882875919342042,
|
|
"memory(GiB)": 32.03,
|
|
"step": 340,
|
|
"token_acc": 0.9595018647214418,
|
|
"train_speed(iter/s)": 0.186452
|
|
},
|
|
{
|
|
"epoch": 2.085692425401683,
|
|
"eval_loss": 0.18441390991210938,
|
|
"eval_runtime": 2.9649,
|
|
"eval_samples_per_second": 35.415,
|
|
"eval_steps_per_second": 9.107,
|
|
"eval_token_acc": 0.9401265617394127,
|
|
"step": 340
|
|
},
|
|
{
|
|
"epoch": 2.1162968630451418,
|
|
"grad_norm": 0.539606511592865,
|
|
"learning_rate": 1.9913524726289784e-06,
|
|
"loss": 0.1085669994354248,
|
|
"memory(GiB)": 32.03,
|
|
"step": 345,
|
|
"token_acc": 0.9560936203659229,
|
|
"train_speed(iter/s)": 0.185455
|
|
},
|
|
{
|
|
"epoch": 2.1469013006886,
|
|
"grad_norm": 0.5162772536277771,
|
|
"learning_rate": 1.8646449643595565e-06,
|
|
"loss": 0.10514116287231445,
|
|
"memory(GiB)": 32.03,
|
|
"step": 350,
|
|
"token_acc": 0.9644231329796537,
|
|
"train_speed(iter/s)": 0.185643
|
|
},
|
|
{
|
|
"epoch": 2.177505738332058,
|
|
"grad_norm": 0.5563685894012451,
|
|
"learning_rate": 1.7411724347262826e-06,
|
|
"loss": 0.11478805541992188,
|
|
"memory(GiB)": 32.03,
|
|
"step": 355,
|
|
"token_acc": 0.9576824543864034,
|
|
"train_speed(iter/s)": 0.186082
|
|
},
|
|
{
|
|
"epoch": 2.2081101759755164,
|
|
"grad_norm": 0.5719069242477417,
|
|
"learning_rate": 1.621062279507617e-06,
|
|
"loss": 0.10535905361175538,
|
|
"memory(GiB)": 32.03,
|
|
"step": 360,
|
|
"token_acc": 0.9599832227797368,
|
|
"train_speed(iter/s)": 0.1864
|
|
},
|
|
{
|
|
"epoch": 2.2081101759755164,
|
|
"eval_loss": 0.1818896383047104,
|
|
"eval_runtime": 2.968,
|
|
"eval_samples_per_second": 35.378,
|
|
"eval_steps_per_second": 9.097,
|
|
"eval_token_acc": 0.9408621342419817,
|
|
"step": 360
|
|
},
|
|
{
|
|
"epoch": 2.2387146136189746,
|
|
"grad_norm": 0.5362414121627808,
|
|
"learning_rate": 1.5044384252706312e-06,
|
|
"loss": 0.1083768367767334,
|
|
"memory(GiB)": 32.03,
|
|
"step": 365,
|
|
"token_acc": 0.9576676318628286,
|
|
"train_speed(iter/s)": 0.185562
|
|
},
|
|
{
|
|
"epoch": 2.269319051262433,
|
|
"grad_norm": 0.5509895086288452,
|
|
"learning_rate": 1.3914212015067653e-06,
|
|
"loss": 0.10523394346237183,
|
|
"memory(GiB)": 32.03,
|
|
"step": 370,
|
|
"token_acc": 0.9611730489578284,
|
|
"train_speed(iter/s)": 0.185837
|
|
},
|
|
{
|
|
"epoch": 2.2999234889058915,
|
|
"grad_norm": 0.5473169684410095,
|
|
"learning_rate": 1.2821272164789544e-06,
|
|
"loss": 0.10544384717941284,
|
|
"memory(GiB)": 32.03,
|
|
"step": 375,
|
|
"token_acc": 0.9595612848087743,
|
|
"train_speed(iter/s)": 0.186197
|
|
},
|
|
{
|
|
"epoch": 2.3305279265493497,
|
|
"grad_norm": 0.5506060719490051,
|
|
"learning_rate": 1.1766692369082255e-06,
|
|
"loss": 0.10901916027069092,
|
|
"memory(GiB)": 32.03,
|
|
"step": 380,
|
|
"token_acc": 0.9595015576323987,
|
|
"train_speed(iter/s)": 0.18649
|
|
},
|
|
{
|
|
"epoch": 2.3305279265493497,
|
|
"eval_loss": 0.18156129121780396,
|
|
"eval_runtime": 2.9586,
|
|
"eval_samples_per_second": 35.49,
|
|
"eval_steps_per_second": 9.126,
|
|
"eval_token_acc": 0.9409054032127211,
|
|
"step": 380
|
|
},
|
|
{
|
|
"epoch": 2.361132364192808,
|
|
"grad_norm": 0.5408657193183899,
|
|
"learning_rate": 1.0751560716238968e-06,
|
|
"loss": 0.10397273302078247,
|
|
"memory(GiB)": 32.03,
|
|
"step": 385,
|
|
"token_acc": 0.9595956316091394,
|
|
"train_speed(iter/s)": 0.185677
|
|
},
|
|
{
|
|
"epoch": 2.391736801836266,
|
|
"grad_norm": 0.565687358379364,
|
|
"learning_rate": 9.776924592974257e-07,
|
|
"loss": 0.10786858797073365,
|
|
"memory(GiB)": 32.03,
|
|
"step": 390,
|
|
"token_acc": 0.9580994261477046,
|
|
"train_speed(iter/s)": 0.185992
|
|
},
|
|
{
|
|
"epoch": 2.4223412394797244,
|
|
"grad_norm": 0.5598291754722595,
|
|
"learning_rate": 8.843789603757446e-07,
|
|
"loss": 0.10539779663085938,
|
|
"memory(GiB)": 32.03,
|
|
"step": 395,
|
|
"token_acc": 0.9650639142961036,
|
|
"train_speed(iter/s)": 0.186263
|
|
},
|
|
{
|
|
"epoch": 2.452945677123183,
|
|
"grad_norm": 0.5249931216239929,
|
|
"learning_rate": 7.953118533255821e-07,
|
|
"loss": 0.10175876617431641,
|
|
"memory(GiB)": 32.03,
|
|
"step": 400,
|
|
"token_acc": 0.9630585035539542,
|
|
"train_speed(iter/s)": 0.186474
|
|
},
|
|
{
|
|
"epoch": 2.452945677123183,
|
|
"eval_loss": 0.18106642365455627,
|
|
"eval_runtime": 2.9642,
|
|
"eval_samples_per_second": 35.423,
|
|
"eval_steps_per_second": 9.109,
|
|
"eval_token_acc": 0.9406998756017091,
|
|
"step": 400
|
|
},
|
|
{
|
|
"epoch": 2.4835501147666412,
|
|
"grad_norm": 0.5907252430915833,
|
|
"learning_rate": 7.105830352958143e-07,
|
|
"loss": 0.10489962100982667,
|
|
"memory(GiB)": 32.03,
|
|
"step": 405,
|
|
"token_acc": 0.9566693129911521,
|
|
"train_speed(iter/s)": 0.185755
|
|
},
|
|
{
|
|
"epoch": 2.5141545524100994,
|
|
"grad_norm": 0.5359929203987122,
|
|
"learning_rate": 6.302799273003546e-07,
|
|
"loss": 0.10674171447753907,
|
|
"memory(GiB)": 32.03,
|
|
"step": 410,
|
|
"token_acc": 0.9589793334758233,
|
|
"train_speed(iter/s)": 0.186023
|
|
},
|
|
{
|
|
"epoch": 2.5447589900535577,
|
|
"grad_norm": 0.5575762987136841,
|
|
"learning_rate": 5.544853840193981e-07,
|
|
"loss": 0.10684401988983154,
|
|
"memory(GiB)": 32.03,
|
|
"step": 415,
|
|
"token_acc": 0.961750384418247,
|
|
"train_speed(iter/s)": 0.186382
|
|
},
|
|
{
|
|
"epoch": 2.575363427697016,
|
|
"grad_norm": 0.5757756233215332,
|
|
"learning_rate": 4.832776083120983e-07,
|
|
"loss": 0.10789649486541748,
|
|
"memory(GiB)": 32.03,
|
|
"step": 420,
|
|
"token_acc": 0.9595656339827531,
|
|
"train_speed(iter/s)": 0.186545
|
|
},
|
|
{
|
|
"epoch": 2.575363427697016,
|
|
"eval_loss": 0.18043935298919678,
|
|
"eval_runtime": 2.9657,
|
|
"eval_samples_per_second": 35.404,
|
|
"eval_steps_per_second": 9.104,
|
|
"eval_token_acc": 0.9409162204554059,
|
|
"step": 420
|
|
},
|
|
{
|
|
"epoch": 2.6059678653404745,
|
|
"grad_norm": 0.5543663501739502,
|
|
"learning_rate": 4.167300705288718e-07,
|
|
"loss": 0.10247746706008912,
|
|
"memory(GiB)": 32.03,
|
|
"step": 425,
|
|
"token_acc": 0.9594139385812865,
|
|
"train_speed(iter/s)": 0.185739
|
|
},
|
|
{
|
|
"epoch": 2.6365723029839327,
|
|
"grad_norm": 0.545873761177063,
|
|
"learning_rate": 3.5491143270657445e-07,
|
|
"loss": 0.1048995852470398,
|
|
"memory(GiB)": 32.03,
|
|
"step": 430,
|
|
"token_acc": 0.9606733925249195,
|
|
"train_speed(iter/s)": 0.185979
|
|
},
|
|
{
|
|
"epoch": 2.667176740627391,
|
|
"grad_norm": 0.5157749056816101,
|
|
"learning_rate": 2.9788547772478416e-07,
|
|
"loss": 0.10134179592132568,
|
|
"memory(GiB)": 32.03,
|
|
"step": 435,
|
|
"token_acc": 0.9625057155921354,
|
|
"train_speed(iter/s)": 0.186374
|
|
},
|
|
{
|
|
"epoch": 2.697781178270849,
|
|
"grad_norm": 0.5268109440803528,
|
|
"learning_rate": 2.457110434962645e-07,
|
|
"loss": 0.10287988185882568,
|
|
"memory(GiB)": 32.03,
|
|
"step": 440,
|
|
"token_acc": 0.9619926437374976,
|
|
"train_speed(iter/s)": 0.186687
|
|
},
|
|
{
|
|
"epoch": 2.697781178270849,
|
|
"eval_loss": 0.18037647008895874,
|
|
"eval_runtime": 2.9654,
|
|
"eval_samples_per_second": 35.409,
|
|
"eval_steps_per_second": 9.105,
|
|
"eval_token_acc": 0.941046027367624,
|
|
"step": 440
|
|
},
|
|
{
|
|
"epoch": 2.7283856159143074,
|
|
"grad_norm": 0.5612174272537231,
|
|
"learning_rate": 1.984419622595224e-07,
|
|
"loss": 0.10738935470581054,
|
|
"memory(GiB)": 32.03,
|
|
"step": 445,
|
|
"token_acc": 0.9575748052706009,
|
|
"train_speed(iter/s)": 0.185904
|
|
},
|
|
{
|
|
"epoch": 2.758990053557766,
|
|
"grad_norm": 0.5592919588088989,
|
|
"learning_rate": 1.561270050360897e-07,
|
|
"loss": 0.1064642071723938,
|
|
"memory(GiB)": 32.03,
|
|
"step": 450,
|
|
"token_acc": 0.9620171040990858,
|
|
"train_speed(iter/s)": 0.186133
|
|
},
|
|
{
|
|
"epoch": 2.7895944912012243,
|
|
"grad_norm": 0.5563650131225586,
|
|
"learning_rate": 1.1880983130983626e-07,
|
|
"loss": 0.11139054298400879,
|
|
"memory(GiB)": 32.03,
|
|
"step": 455,
|
|
"token_acc": 0.9608461825416563,
|
|
"train_speed(iter/s)": 0.186386
|
|
},
|
|
{
|
|
"epoch": 2.8201989288446825,
|
|
"grad_norm": 0.5721088647842407,
|
|
"learning_rate": 8.652894398024137e-08,
|
|
"loss": 0.1031692385673523,
|
|
"memory(GiB)": 32.03,
|
|
"step": 460,
|
|
"token_acc": 0.9663138518177634,
|
|
"train_speed(iter/s)": 0.186591
|
|
},
|
|
{
|
|
"epoch": 2.8201989288446825,
|
|
"eval_loss": 0.1801983118057251,
|
|
"eval_runtime": 2.9604,
|
|
"eval_samples_per_second": 35.468,
|
|
"eval_steps_per_second": 9.12,
|
|
"eval_token_acc": 0.941110930823733,
|
|
"step": 460
|
|
},
|
|
{
|
|
"epoch": 2.8508033664881407,
|
|
"grad_norm": 0.5719510316848755,
|
|
"learning_rate": 5.9317649636088656e-08,
|
|
"loss": 0.10809749364852905,
|
|
"memory(GiB)": 32.03,
|
|
"step": 465,
|
|
"token_acc": 0.9583455558814902,
|
|
"train_speed(iter/s)": 0.185906
|
|
},
|
|
{
|
|
"epoch": 2.881407804131599,
|
|
"grad_norm": 0.5535134673118591,
|
|
"learning_rate": 3.720402419058966e-08,
|
|
"loss": 0.10542930364608764,
|
|
"memory(GiB)": 32.03,
|
|
"step": 470,
|
|
"token_acc": 0.9625262091383702,
|
|
"train_speed(iter/s)": 0.18623
|
|
},
|
|
{
|
|
"epoch": 2.9120122417750576,
|
|
"grad_norm": 0.5565011501312256,
|
|
"learning_rate": 2.0210883913376334e-08,
|
|
"loss": 0.10625803470611572,
|
|
"memory(GiB)": 32.03,
|
|
"step": 475,
|
|
"token_acc": 0.9594989624827711,
|
|
"train_speed(iter/s)": 0.186434
|
|
},
|
|
{
|
|
"epoch": 2.942616679418516,
|
|
"grad_norm": 0.5512571334838867,
|
|
"learning_rate": 8.35576188926046e-09,
|
|
"loss": 0.098574298620224,
|
|
"memory(GiB)": 32.03,
|
|
"step": 480,
|
|
"token_acc": 0.9657953849295488,
|
|
"train_speed(iter/s)": 0.186661
|
|
},
|
|
{
|
|
"epoch": 2.942616679418516,
|
|
"eval_loss": 0.18013475835323334,
|
|
"eval_runtime": 2.956,
|
|
"eval_samples_per_second": 35.52,
|
|
"eval_steps_per_second": 9.134,
|
|
"eval_token_acc": 0.9411433825517875,
|
|
"step": 480
|
|
},
|
|
{
|
|
"epoch": 2.973221117061974,
|
|
"grad_norm": 0.5630972385406494,
|
|
"learning_rate": 1.6508899280515134e-09,
|
|
"loss": 0.10670101642608643,
|
|
"memory(GiB)": 32.03,
|
|
"step": 485,
|
|
"token_acc": 0.9557970508071842,
|
|
"train_speed(iter/s)": 0.186012
|
|
},
|
|
{
|
|
"epoch": 2.9977046671767407,
|
|
"eval_loss": 0.18032938241958618,
|
|
"eval_runtime": 2.9668,
|
|
"eval_samples_per_second": 35.392,
|
|
"eval_steps_per_second": 9.101,
|
|
"eval_token_acc": 0.9413380929201146,
|
|
"step": 489
|
|
}
|
|
],
|
|
"logging_steps": 5,
|
|
"max_steps": 489,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 3,
|
|
"save_steps": 20,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": true
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 7.018693783621468e+17,
|
|
"train_batch_size": 1,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|