Files

1162 lines
26 KiB
JSON
Raw Permalink Normal View History

[
{
"loss": 0.0999,
"grad_norm": 0.6476165056228638,
"learning_rate": 2.3376623376623376e-05,
"epoch": 0.013003901170351105,
"step": 10
},
{
"loss": 0.0313,
"grad_norm": 0.4233693778514862,
"learning_rate": 4.9350649350649355e-05,
"epoch": 0.02600780234070221,
"step": 20
},
{
"loss": 0.0175,
"grad_norm": 0.179221972823143,
"learning_rate": 7.532467532467533e-05,
"epoch": 0.03901170351105332,
"step": 30
},
{
"loss": 0.0143,
"grad_norm": 0.1977965086698532,
"learning_rate": 0.0001012987012987013,
"epoch": 0.05201560468140442,
"step": 40
},
{
"loss": 0.0098,
"grad_norm": 0.1977885216474533,
"learning_rate": 0.00012727272727272728,
"epoch": 0.06501950585175553,
"step": 50
},
{
"loss": 0.0097,
"grad_norm": 0.17543193697929382,
"learning_rate": 0.00015324675324675325,
"epoch": 0.07802340702210664,
"step": 60
},
{
"loss": 0.0084,
"grad_norm": 0.1590070128440857,
"learning_rate": 0.00017922077922077922,
"epoch": 0.09102730819245773,
"step": 70
},
{
"loss": 0.009,
"grad_norm": 0.12166043370962143,
"learning_rate": 0.00020519480519480521,
"epoch": 0.10403120936280884,
"step": 80
},
{
"loss": 0.009,
"grad_norm": 0.2049126923084259,
"learning_rate": 0.00023116883116883118,
"epoch": 0.11703511053315994,
"step": 90
},
{
"loss": 0.0108,
"grad_norm": 0.26844000816345215,
"learning_rate": 0.00025714285714285715,
"epoch": 0.13003901170351106,
"step": 100
},
{
"loss": 0.0091,
"grad_norm": 0.2070150524377823,
"learning_rate": 0.0002831168831168831,
"epoch": 0.14304291287386217,
"step": 110
},
{
"loss": 0.0088,
"grad_norm": 0.17007677257061005,
"learning_rate": 0.0003090909090909091,
"epoch": 0.15604681404421328,
"step": 120
},
{
"loss": 0.0135,
"grad_norm": 0.4476225972175598,
"learning_rate": 0.0003350649350649351,
"epoch": 0.16905071521456436,
"step": 130
},
{
"loss": 0.0082,
"grad_norm": 0.18799515068531036,
"learning_rate": 0.0003610389610389611,
"epoch": 0.18205461638491546,
"step": 140
},
{
"loss": 0.0105,
"grad_norm": 0.6265793442726135,
"learning_rate": 0.0003870129870129871,
"epoch": 0.19505851755526657,
"step": 150
},
{
"eval_loss": 0.008664383552968502,
"eval_runtime": 26.6114,
"eval_samples_per_second": 48.626,
"eval_steps_per_second": 12.175,
"epoch": 0.19895968790637192,
"step": 153
},
{
"loss": 0.0082,
"grad_norm": 0.13256056606769562,
"learning_rate": 0.000399987118604584,
"epoch": 0.20806241872561768,
"step": 160
},
{
"loss": 0.0093,
"grad_norm": 0.2438155710697174,
"learning_rate": 0.0003998840773968632,
"epoch": 0.22106631989596878,
"step": 170
},
{
"loss": 0.008,
"grad_norm": 0.10311782360076904,
"learning_rate": 0.00039967804807229337,
"epoch": 0.2340702210663199,
"step": 180
},
{
"loss": 0.0067,
"grad_norm": 0.08892055600881577,
"learning_rate": 0.00039936913678526384,
"epoch": 0.247074122236671,
"step": 190
},
{
"loss": 0.0051,
"grad_norm": 0.0572589635848999,
"learning_rate": 0.0003989575026989863,
"epoch": 0.26007802340702213,
"step": 200
},
{
"loss": 0.007,
"grad_norm": 0.11798332631587982,
"learning_rate": 0.00039844335790348767,
"epoch": 0.27308192457737324,
"step": 210
},
{
"loss": 0.007,
"grad_norm": 0.09970659017562866,
"learning_rate": 0.00039782696730633334,
"epoch": 0.28608582574772434,
"step": 220
},
{
"loss": 0.0045,
"grad_norm": 0.07247322052717209,
"learning_rate": 0.0003971086484961359,
"epoch": 0.29908972691807545,
"step": 230
},
{
"loss": 0.0051,
"grad_norm": 0.06070903316140175,
"learning_rate": 0.0003962887715789215,
"epoch": 0.31209362808842656,
"step": 240
},
{
"loss": 0.0043,
"grad_norm": 0.07125398516654968,
"learning_rate": 0.0003953677589874364,
"epoch": 0.3250975292587776,
"step": 250
},
{
"loss": 0.0049,
"grad_norm": 0.14290770888328552,
"learning_rate": 0.00039434608526349316,
"epoch": 0.3381014304291287,
"step": 260
},
{
"loss": 0.0046,
"grad_norm": 0.06481975317001343,
"learning_rate": 0.0003932242768134681,
"epoch": 0.3511053315994798,
"step": 270
},
{
"loss": 0.0043,
"grad_norm": 0.08478418737649918,
"learning_rate": 0.00039200291163707596,
"epoch": 0.3641092327698309,
"step": 280
},
{
"loss": 0.0038,
"grad_norm": 0.09579581022262573,
"learning_rate": 0.0003906826190295621,
"epoch": 0.37711313394018203,
"step": 290
},
{
"loss": 0.0047,
"grad_norm": 0.07205233722925186,
"learning_rate": 0.0003892640792574644,
"epoch": 0.39011703511053314,
"step": 300
},
{
"eval_loss": 0.0036644258070737123,
"eval_runtime": 18.3234,
"eval_samples_per_second": 70.62,
"eval_steps_per_second": 17.682,
"epoch": 0.39791937581274384,
"step": 306
},
{
"loss": 0.0041,
"grad_norm": 0.35666874051094055,
"learning_rate": 0.0003877480232081138,
"epoch": 0.40312093628088425,
"step": 310
},
{
"loss": 0.0045,
"grad_norm": 0.09247690439224243,
"learning_rate": 0.0003861352320130521,
"epoch": 0.41612483745123535,
"step": 320
},
{
"loss": 0.0046,
"grad_norm": 0.056292008608579636,
"learning_rate": 0.00038442653664556246,
"epoch": 0.42912873862158646,
"step": 330
},
{
"loss": 0.0038,
"grad_norm": 0.05615556240081787,
"learning_rate": 0.0003826228174925194,
"epoch": 0.44213263979193757,
"step": 340
},
{
"loss": 0.004,
"grad_norm": 0.17996034026145935,
"learning_rate": 0.0003807250039007789,
"epoch": 0.45513654096228867,
"step": 350
},
{
"loss": 0.0053,
"grad_norm": 0.137319877743721,
"learning_rate": 0.00037873407369834255,
"epoch": 0.4681404421326398,
"step": 360
},
{
"loss": 0.0058,
"grad_norm": 0.563551127910614,
"learning_rate": 0.0003766510526905421,
"epoch": 0.4811443433029909,
"step": 370
},
{
"loss": 0.0052,
"grad_norm": 0.10102391242980957,
"learning_rate": 0.00037447701413150436,
"epoch": 0.494148244473342,
"step": 380
},
{
"loss": 0.0064,
"grad_norm": 0.1089361160993576,
"learning_rate": 0.0003722130781711686,
"epoch": 0.5071521456436932,
"step": 390
},
{
"loss": 0.0069,
"grad_norm": 0.12658214569091797,
"learning_rate": 0.0003698604112781413,
"epoch": 0.5201560468140443,
"step": 400
},
{
"loss": 0.0067,
"grad_norm": 0.1498098373413086,
"learning_rate": 0.00036742022563868577,
"epoch": 0.5331599479843954,
"step": 410
},
{
"loss": 0.0067,
"grad_norm": 0.1835741102695465,
"learning_rate": 0.00036489377853215647,
"epoch": 0.5461638491547465,
"step": 420
},
{
"loss": 0.0058,
"grad_norm": 0.1957734078168869,
"learning_rate": 0.0003622823716831989,
"epoch": 0.5591677503250976,
"step": 430
},
{
"loss": 0.0039,
"grad_norm": 0.10933089256286621,
"learning_rate": 0.0003595873505910505,
"epoch": 0.5721716514954487,
"step": 440
},
{
"loss": 0.005,
"grad_norm": 0.08690325915813446,
"learning_rate": 0.0003568101038362864,
"epoch": 0.5851755526657998,
"step": 450
},
{
"eval_loss": 0.0036996062844991684,
"eval_runtime": 18.3619,
"eval_samples_per_second": 70.472,
"eval_steps_per_second": 17.645,
"epoch": 0.5968790637191157,
"step": 459
},
{
"loss": 0.0052,
"grad_norm": 0.11432008445262909,
"learning_rate": 0.0003539520623653683,
"epoch": 0.5981794538361509,
"step": 460
},
{
"loss": 0.0059,
"grad_norm": 0.09832175821065903,
"learning_rate": 0.00035101469875336466,
"epoch": 0.611183355006502,
"step": 470
},
{
"loss": 0.0041,
"grad_norm": 0.08699937909841537,
"learning_rate": 0.00034799952644522236,
"epoch": 0.6241872561768531,
"step": 480
},
{
"loss": 0.0052,
"grad_norm": 0.12459639459848404,
"learning_rate": 0.0003449080989759805,
"epoch": 0.6371911573472041,
"step": 490
},
{
"loss": 0.0052,
"grad_norm": 0.10064008086919785,
"learning_rate": 0.00034174200917032826,
"epoch": 0.6501950585175552,
"step": 500
},
{
"loss": 0.0038,
"grad_norm": 0.07517597824335098,
"learning_rate": 0.0003385028883219188,
"epoch": 0.6631989596879063,
"step": 510
},
{
"loss": 0.0035,
"grad_norm": 0.06853006780147552,
"learning_rate": 0.0003351924053528633,
"epoch": 0.6762028608582574,
"step": 520
},
{
"loss": 0.0029,
"grad_norm": 0.09138665348291397,
"learning_rate": 0.0003318122659538365,
"epoch": 0.6892067620286085,
"step": 530
},
{
"loss": 0.0024,
"grad_norm": 0.05078333243727684,
"learning_rate": 0.00032836421170523807,
"epoch": 0.7022106631989596,
"step": 540
},
{
"loss": 0.0031,
"grad_norm": 0.045032307505607605,
"learning_rate": 0.0003248500191798619,
"epoch": 0.7152145643693107,
"step": 550
},
{
"loss": 0.003,
"grad_norm": 0.10225801914930344,
"learning_rate": 0.0003212714990275365,
"epoch": 0.7282184655396619,
"step": 560
},
{
"loss": 0.0025,
"grad_norm": 0.048902999609708786,
"learning_rate": 0.0003176304950422067,
"epoch": 0.741222366710013,
"step": 570
},
{
"loss": 0.0032,
"grad_norm": 0.05594451352953911,
"learning_rate": 0.00031392888321193907,
"epoch": 0.7542262678803641,
"step": 580
},
{
"loss": 0.0033,
"grad_norm": 0.04082875698804855,
"learning_rate": 0.0003101685707523392,
"epoch": 0.7672301690507152,
"step": 590
},
{
"loss": 0.003,
"grad_norm": 0.04635205864906311,
"learning_rate": 0.00030635149512387913,
"epoch": 0.7802340702210663,
"step": 600
},
{
"loss": 0.0028,
"grad_norm": 0.060200098901987076,
"learning_rate": 0.0003024796230336422,
"epoch": 0.7932379713914174,
"step": 610
},
{
"eval_loss": 0.002621545922011137,
"eval_runtime": 18.3184,
"eval_samples_per_second": 70.639,
"eval_steps_per_second": 17.687,
"epoch": 0.7958387516254877,
"step": 612
},
{
"loss": 0.0034,
"grad_norm": 0.046855997294187546,
"learning_rate": 0.00029855494942199813,
"epoch": 0.8062418725617685,
"step": 620
},
{
"loss": 0.0037,
"grad_norm": 0.05887070298194885,
"learning_rate": 0.00029457949643473143,
"epoch": 0.8192457737321196,
"step": 630
},
{
"loss": 0.0022,
"grad_norm": 0.03723029047250748,
"learning_rate": 0.0002905553123811527,
"epoch": 0.8322496749024707,
"step": 640
},
{
"loss": 0.0029,
"grad_norm": 0.07676632702350616,
"learning_rate": 0.00028648447067872943,
"epoch": 0.8452535760728218,
"step": 650
},
{
"loss": 0.0028,
"grad_norm": 0.034462593495845795,
"learning_rate": 0.00028236906878477977,
"epoch": 0.8582574772431729,
"step": 660
},
{
"loss": 0.0024,
"grad_norm": 0.07990952581167221,
"learning_rate": 0.0002782112271157804,
"epoch": 0.871261378413524,
"step": 670
},
{
"loss": 0.0027,
"grad_norm": 0.09356771409511566,
"learning_rate": 0.0002740130879548446,
"epoch": 0.8842652795838751,
"step": 680
},
{
"loss": 0.0026,
"grad_norm": 0.05710175260901451,
"learning_rate": 0.00026977681434793446,
"epoch": 0.8972691807542262,
"step": 690
},
{
"loss": 0.0028,
"grad_norm": 0.057762809097766876,
"learning_rate": 0.00026550458898937394,
"epoch": 0.9102730819245773,
"step": 700
},
{
"loss": 0.0027,
"grad_norm": 0.03704589977860451,
"learning_rate": 0.00026119861309724005,
"epoch": 0.9232769830949284,
"step": 710
},
{
"loss": 0.0022,
"grad_norm": 0.04962095618247986,
"learning_rate": 0.0002568611052792082,
"epoch": 0.9362808842652796,
"step": 720
},
{
"loss": 0.002,
"grad_norm": 0.05513838678598404,
"learning_rate": 0.000252494300389439,
"epoch": 0.9492847854356307,
"step": 730
},
{
"loss": 0.0025,
"grad_norm": 0.04495919868350029,
"learning_rate": 0.0002481004483770934,
"epoch": 0.9622886866059818,
"step": 740
},
{
"loss": 0.0023,
"grad_norm": 0.03698936477303505,
"learning_rate": 0.00024368181312707098,
"epoch": 0.9752925877763329,
"step": 750
},
{
"loss": 0.0029,
"grad_norm": 0.2230578362941742,
"learning_rate": 0.00023924067129356728,
"epoch": 0.988296488946684,
"step": 760
},
{
"eval_loss": 0.004058652091771364,
"eval_runtime": 18.4716,
"eval_samples_per_second": 70.054,
"eval_steps_per_second": 17.54,
"epoch": 0.9947984395318595,
"step": 765
},
{
"loss": 0.0024,
"grad_norm": 0.04448261857032776,
"learning_rate": 0.00023477931112705252,
"epoch": 1.0013003901170352,
"step": 770
},
{
"loss": 0.0017,
"grad_norm": 0.045737676322460175,
"learning_rate": 0.00023030003129527522,
"epoch": 1.0143042912873863,
"step": 780
},
{
"loss": 0.0014,
"grad_norm": 0.049366582185029984,
"learning_rate": 0.0002258051396988981,
"epoch": 1.0273081924577374,
"step": 790
},
{
"loss": 0.001,
"grad_norm": 0.04127206653356552,
"learning_rate": 0.00022129695228237747,
"epoch": 1.0403120936280885,
"step": 800
},
{
"loss": 0.0012,
"grad_norm": 0.03728267550468445,
"learning_rate": 0.00021677779184069772,
"epoch": 1.0533159947984396,
"step": 810
},
{
"loss": 0.002,
"grad_norm": 0.04708348587155342,
"learning_rate": 0.00021224998682257615,
"epoch": 1.0663198959687907,
"step": 820
},
{
"loss": 0.0016,
"grad_norm": 0.0577986016869545,
"learning_rate": 0.00020771587013075496,
"epoch": 1.0793237971391418,
"step": 830
},
{
"loss": 0.0009,
"grad_norm": 0.034850601106882095,
"learning_rate": 0.0002031777779199982,
"epoch": 1.092327698309493,
"step": 840
},
{
"loss": 0.0011,
"grad_norm": 0.04283386841416359,
"learning_rate": 0.00019863804839341312,
"epoch": 1.105331599479844,
"step": 850
},
{
"loss": 0.0014,
"grad_norm": 0.03216319903731346,
"learning_rate": 0.00019409902059771642,
"epoch": 1.1183355006501952,
"step": 860
},
{
"loss": 0.0014,
"grad_norm": 0.03168678283691406,
"learning_rate": 0.00018956303321806547,
"epoch": 1.1313394018205463,
"step": 870
},
{
"loss": 0.0011,
"grad_norm": 0.12212653458118439,
"learning_rate": 0.000185032423373076,
"epoch": 1.1443433029908974,
"step": 880
},
{
"loss": 0.0013,
"grad_norm": 0.05462120100855827,
"learning_rate": 0.00018050952541064704,
"epoch": 1.1573472041612485,
"step": 890
},
{
"loss": 0.0015,
"grad_norm": 0.04625839367508888,
"learning_rate": 0.0001759966697052132,
"epoch": 1.1703511053315996,
"step": 900
},
{
"loss": 0.0012,
"grad_norm": 0.05508960038423538,
"learning_rate": 0.0001714961814570444,
"epoch": 1.1833550065019507,
"step": 910
},
{
"eval_loss": 0.0016215220093727112,
"eval_runtime": 18.4155,
"eval_samples_per_second": 70.267,
"eval_steps_per_second": 17.594,
"epoch": 1.1937581274382314,
"step": 918
},
{
"loss": 0.0009,
"grad_norm": 0.02297932282090187,
"learning_rate": 0.0001670103794942114,
"epoch": 1.1963589076723018,
"step": 920
},
{
"loss": 0.0011,
"grad_norm": 0.04282490909099579,
"learning_rate": 0.00016254157507783487,
"epoch": 1.209362808842653,
"step": 930
},
{
"loss": 0.0017,
"grad_norm": 0.057187534868717194,
"learning_rate": 0.0001580920707112327,
"epoch": 1.222366710013004,
"step": 940
},
{
"loss": 0.0019,
"grad_norm": 0.032249465584754944,
"learning_rate": 0.00015366415895358014,
"epoch": 1.2353706111833551,
"step": 950
},
{
"loss": 0.0014,
"grad_norm": 0.041704822331666946,
"learning_rate": 0.00014926012123869345,
"epoch": 1.2483745123537062,
"step": 960
},
{
"loss": 0.0012,
"grad_norm": 0.0736030712723732,
"learning_rate": 0.0001448822266995456,
"epoch": 1.2613784135240573,
"step": 970
},
{
"loss": 0.0014,
"grad_norm": 0.06387858837842941,
"learning_rate": 0.00014053273099911984,
"epoch": 1.2743823146944084,
"step": 980
},
{
"loss": 0.0014,
"grad_norm": 0.0314788743853569,
"learning_rate": 0.000136213875168204,
"epoch": 1.2873862158647595,
"step": 990
},
{
"loss": 0.0012,
"grad_norm": 0.03232254460453987,
"learning_rate": 0.00013192788445072327,
"epoch": 1.3003901170351106,
"step": 1000
},
{
"loss": 0.0013,
"grad_norm": 0.02252402901649475,
"learning_rate": 0.00012767696715720734,
"epoch": 1.3133940182054618,
"step": 1010
},
{
"loss": 0.0009,
"grad_norm": 0.022411393001675606,
"learning_rate": 0.00012346331352698205,
"epoch": 1.3263979193758129,
"step": 1020
},
{
"loss": 0.0008,
"grad_norm": 0.05385369434952736,
"learning_rate": 0.00011928909459967246,
"epoch": 1.339401820546164,
"step": 1030
},
{
"loss": 0.0015,
"grad_norm": 0.04184234142303467,
"learning_rate": 0.00011515646109659777,
"epoch": 1.352405721716515,
"step": 1040
},
{
"loss": 0.0007,
"grad_norm": 0.022253768518567085,
"learning_rate": 0.00011106754231263557,
"epoch": 1.3654096228868662,
"step": 1050
},
{
"loss": 0.0014,
"grad_norm": 0.02799154259264469,
"learning_rate": 0.0001070244450191255,
"epoch": 1.3784135240572173,
"step": 1060
},
{
"loss": 0.0013,
"grad_norm": 0.07600559294223785,
"learning_rate": 0.00010302925237837802,
"epoch": 1.3914174252275684,
"step": 1070
},
{
"eval_loss": 0.0017509988974779844,
"eval_runtime": 18.3471,
"eval_samples_per_second": 70.529,
"eval_steps_per_second": 17.659,
"epoch": 1.3927178153446034,
"step": 1071
},
{
"loss": 0.0013,
"grad_norm": 0.03550839424133301,
"learning_rate": 9.908402287034757e-05,
"epoch": 1.4044213263979195,
"step": 1080
},
{
"loss": 0.001,
"grad_norm": 0.04086020588874817,
"learning_rate": 9.519078923202267e-05,
"epoch": 1.4174252275682706,
"step": 1090
},
{
"loss": 0.0008,
"grad_norm": 0.023380495607852936,
"learning_rate": 9.135155741008052e-05,
"epoch": 1.4304291287386217,
"step": 1100
},
{
"loss": 0.001,
"grad_norm": 0.019674424082040787,
"learning_rate": 8.75683055273443e-05,
"epoch": 1.4434330299089728,
"step": 1110
},
{
"loss": 0.0009,
"grad_norm": 0.0658983439207077,
"learning_rate": 8.384298286357677e-05,
"epoch": 1.456436931079324,
"step": 1120
},
{
"loss": 0.0009,
"grad_norm": 0.03550272434949875,
"learning_rate": 8.017750885113488e-05,
"epoch": 1.469440832249675,
"step": 1130
},
{
"loss": 0.0007,
"grad_norm": 0.022506220266222954,
"learning_rate": 7.657377208600296e-05,
"epoch": 1.4824447334200261,
"step": 1140
},
{
"loss": 0.0015,
"grad_norm": 0.01744789071381092,
"learning_rate": 7.303362935471394e-05,
"epoch": 1.4954486345903772,
"step": 1150
},
{
"loss": 0.0009,
"grad_norm": 0.027020927518606186,
"learning_rate": 6.955890467766008e-05,
"epoch": 1.5084525357607284,
"step": 1160
},
{
"loss": 0.0008,
"grad_norm": 0.055683232843875885,
"learning_rate": 6.615138836928635e-05,
"epoch": 1.5214564369310795,
"step": 1170
},
{
"loss": 0.0013,
"grad_norm": 0.039357252418994904,
"learning_rate": 6.281283611564985e-05,
"epoch": 1.5344603381014306,
"step": 1180
},
{
"loss": 0.0008,
"grad_norm": 0.06996215134859085,
"learning_rate": 5.954496806982175e-05,
"epoch": 1.5474642392717817,
"step": 1190
},
{
"loss": 0.0009,
"grad_norm": 0.03188481554389,
"learning_rate": 5.6349467965596726e-05,
"epoch": 1.5604681404421328,
"step": 1200
},
{
"loss": 0.0011,
"grad_norm": 0.04183268919587135,
"learning_rate": 5.3227982249967544e-05,
"epoch": 1.5734720416124839,
"step": 1210
},
{
"loss": 0.0008,
"grad_norm": 0.02618698589503765,
"learning_rate": 5.018211923481084e-05,
"epoch": 1.586475942782835,
"step": 1220
},
{
"eval_loss": 0.0014909803867340088,
"eval_runtime": 18.3298,
"eval_samples_per_second": 70.595,
"eval_steps_per_second": 17.676,
"epoch": 1.5916775032509753,
"step": 1224
},
{
"loss": 0.001,
"grad_norm": 0.0037807803601026535,
"learning_rate": 4.721344826822174e-05,
"epoch": 1.599479843953186,
"step": 1230
},
{
"loss": 0.0016,
"grad_norm": 0.18698498606681824,
"learning_rate": 4.43234989259242e-05,
"epoch": 1.6124837451235372,
"step": 1240
},
{
"loss": 0.0011,
"grad_norm": 0.03939785063266754,
"learning_rate": 4.151376022317364e-05,
"epoch": 1.6254876462938883,
"step": 1250
},
{
"loss": 0.0009,
"grad_norm": 0.03093765489757061,
"learning_rate": 3.878567984755774e-05,
"epoch": 1.6384915474642394,
"step": 1260
},
{
"loss": 0.0012,
"grad_norm": 0.029676560312509537,
"learning_rate": 3.6140663413091216e-05,
"epoch": 1.6514954486345905,
"step": 1270
},
{
"loss": 0.0009,
"grad_norm": 0.029265930876135826,
"learning_rate": 3.358007373598815e-05,
"epoch": 1.6644993498049416,
"step": 1280
},
{
"loss": 0.0008,
"grad_norm": 0.011111883446574211,
"learning_rate": 3.110523013248578e-05,
"epoch": 1.6775032509752927,
"step": 1290
},
{
"loss": 0.0009,
"grad_norm": 0.055704716593027115,
"learning_rate": 2.8717407739080936e-05,
"epoch": 1.6905071521456438,
"step": 1300
},
{
"loss": 0.0007,
"grad_norm": 0.04278053715825081,
"learning_rate": 2.641783685552961e-05,
"epoch": 1.703511053315995,
"step": 1310
},
{
"loss": 0.0011,
"grad_norm": 0.017013443633913994,
"learning_rate": 2.420770231094851e-05,
"epoch": 1.716514954486346,
"step": 1320
},
{
"loss": 0.0007,
"grad_norm": 0.023405104875564575,
"learning_rate": 2.2088142853344486e-05,
"epoch": 1.7295188556566972,
"step": 1330
},
{
"loss": 0.0008,
"grad_norm": 0.0045458367094397545,
"learning_rate": 2.0060250562886805e-05,
"epoch": 1.7425227568270483,
"step": 1340
},
{
"loss": 0.0006,
"grad_norm": 0.008420413359999657,
"learning_rate": 1.812507028922481e-05,
"epoch": 1.7555266579973994,
"step": 1350
},
{
"loss": 0.0007,
"grad_norm": 0.002557553583756089,
"learning_rate": 1.6283599113140212e-05,
"epoch": 1.7685305591677505,
"step": 1360
},
{
"loss": 0.0009,
"grad_norm": 0.05028311908245087,
"learning_rate": 1.453678583281206e-05,
"epoch": 1.7815344603381016,
"step": 1370
},
{
"eval_loss": 0.0014456523349508643,
"eval_runtime": 18.3887,
"eval_samples_per_second": 70.369,
"eval_steps_per_second": 17.619,
"epoch": 1.790637191157347,
"step": 1377
},
{
"loss": 0.0009,
"grad_norm": 0.03440438210964203,
"learning_rate": 1.2885530474958707e-05,
"epoch": 1.7945383615084527,
"step": 1380
},
{
"loss": 0.0009,
"grad_norm": 0.02877131663262844,
"learning_rate": 1.133068383110869e-05,
"epoch": 1.8075422626788038,
"step": 1390
},
{
"loss": 0.0007,
"grad_norm": 0.023834988474845886,
"learning_rate": 9.873047019239634e-06,
"epoch": 1.820546163849155,
"step": 1400
},
{
"loss": 0.0006,
"grad_norm": 0.02217000722885132,
"learning_rate": 8.513371071010778e-06,
"epoch": 1.833550065019506,
"step": 1410
},
{
"loss": 0.0007,
"grad_norm": 0.018024561926722527,
"learning_rate": 7.25235654480203e-06,
"epoch": 1.8465539661898571,
"step": 1420
},
{
"loss": 0.0009,
"grad_norm": 0.029887991026043892,
"learning_rate": 6.0906531647588305e-06,
"epoch": 1.8595578673602082,
"step": 1430
},
{
"loss": 0.0007,
"grad_norm": 0.030590757727622986,
"learning_rate": 5.028859486028803e-06,
"epoch": 1.8725617685305593,
"step": 1440
},
{
"loss": 0.0008,
"grad_norm": 0.024422012269496918,
"learning_rate": 4.06752258636256e-06,
"epoch": 1.8855656697009102,
"step": 1450
},
{
"loss": 0.0009,
"grad_norm": 0.029740504920482635,
"learning_rate": 3.2071377842379345e-06,
"epoch": 1.8985695708712613,
"step": 1460
},
{
"loss": 0.0011,
"grad_norm": 0.017065834254026413,
"learning_rate": 2.448148383652371e-06,
"epoch": 1.9115734720416124,
"step": 1470
},
{
"loss": 0.0009,
"grad_norm": 0.03916705399751663,
"learning_rate": 1.7909454457153418e-06,
"epoch": 1.9245773732119635,
"step": 1480
},
{
"loss": 0.0005,
"grad_norm": 0.01918933540582657,
"learning_rate": 1.2358675871583458e-06,
"epoch": 1.9375812743823146,
"step": 1490
},
{
"loss": 0.0008,
"grad_norm": 0.03058127500116825,
"learning_rate": 7.832008058662688e-07,
"epoch": 1.9505851755526658,
"step": 1500
},
{
"loss": 0.001,
"grad_norm": 0.01543338131159544,
"learning_rate": 4.33178333520079e-07,
"epoch": 1.9635890767230169,
"step": 1510
},
{
"loss": 0.0005,
"grad_norm": 0.028682643547654152,
"learning_rate": 1.859805154266203e-07,
"epoch": 1.976592977893368,
"step": 1520
},
{
"loss": 0.0006,
"grad_norm": 0.02276739478111267,
"learning_rate": 4.1734717597807785e-08,
"epoch": 1.989596879063719,
"step": 1530
},
{
"eval_loss": 0.0014343492221087217,
"eval_runtime": 18.163,
"eval_samples_per_second": 71.244,
"eval_steps_per_second": 17.838,
"epoch": 1.989596879063719,
"step": 1530
},
{
"train_runtime": 1142.9274,
"train_samples_per_second": 43.023,
"train_steps_per_second": 1.346,
"total_flos": 5.034504520128e+16,
"train_loss": 0.004019292104312295,
"epoch": 2.0,
"step": 1538
}
]