Files
OLMo-0H-1D-50F-1000/trainer_state.json

1667 lines
39 KiB
JSON
Raw Normal View History

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 400.0,
"eval_steps": 500,
"global_step": 2000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 2.0,
"grad_norm": 9.0625,
"learning_rate": 1.8e-05,
"loss": 2.418994331359863,
"loss_d0": 2.423280668258667,
"step": 10
},
{
"epoch": 4.0,
"grad_norm": 4.53125,
"learning_rate": 3.8e-05,
"loss": 0.9471499443054199,
"loss_d0": 0.9483950972557068,
"step": 20
},
{
"epoch": 6.0,
"grad_norm": 3.734375,
"learning_rate": 5.8e-05,
"loss": 0.5623598098754883,
"loss_d0": 0.56459439098835,
"step": 30
},
{
"epoch": 8.0,
"grad_norm": 4.0,
"learning_rate": 7.800000000000001e-05,
"loss": 0.40128116607666015,
"loss_d0": 0.4030485600233078,
"step": 40
},
{
"epoch": 10.0,
"grad_norm": 2.65625,
"learning_rate": 9.8e-05,
"loss": 0.28589348793029784,
"loss_d0": 0.28680678009986876,
"step": 50
},
{
"epoch": 12.0,
"grad_norm": 2.578125,
"learning_rate": 0.000118,
"loss": 0.2765557527542114,
"loss_d0": 0.27714781165122987,
"step": 60
},
{
"epoch": 14.0,
"grad_norm": 2.921875,
"learning_rate": 0.000138,
"loss": 0.24961316585540771,
"loss_d0": 0.2508685752749443,
"step": 70
},
{
"epoch": 16.0,
"grad_norm": 2.625,
"learning_rate": 0.00015800000000000002,
"loss": 0.22726972103118898,
"loss_d0": 0.22790100574493408,
"step": 80
},
{
"epoch": 18.0,
"grad_norm": 1.9453125,
"learning_rate": 0.00017800000000000002,
"loss": 0.17535831928253173,
"loss_d0": 0.17523229271173477,
"step": 90
},
{
"epoch": 20.0,
"grad_norm": 1.8125,
"learning_rate": 0.00019800000000000002,
"loss": 0.13673940896987916,
"loss_d0": 0.13673204109072684,
"step": 100
},
{
"epoch": 22.0,
"grad_norm": 1.3828125,
"learning_rate": 0.0002,
"loss": 0.11648437976837159,
"loss_d0": 0.11471812278032303,
"step": 110
},
{
"epoch": 24.0,
"grad_norm": 1.328125,
"learning_rate": 0.0002,
"loss": 0.1015650749206543,
"loss_d0": 0.10103901475667953,
"step": 120
},
{
"epoch": 26.0,
"grad_norm": 1.1875,
"learning_rate": 0.0002,
"loss": 0.08723539113998413,
"loss_d0": 0.08815691880881786,
"step": 130
},
{
"epoch": 28.0,
"grad_norm": 0.8828125,
"learning_rate": 0.0002,
"loss": 0.08241847753524781,
"loss_d0": 0.08273882381618022,
"step": 140
},
{
"epoch": 30.0,
"grad_norm": 1.7421875,
"learning_rate": 0.0002,
"loss": 0.08337835669517517,
"loss_d0": 0.08354556560516357,
"step": 150
},
{
"epoch": 32.0,
"grad_norm": 1.1953125,
"learning_rate": 0.0002,
"loss": 0.06866609454154968,
"loss_d0": 0.06860040538012982,
"step": 160
},
{
"epoch": 34.0,
"grad_norm": 0.74609375,
"learning_rate": 0.0002,
"loss": 0.053651779890060425,
"loss_d0": 0.0539071150124073,
"step": 170
},
{
"epoch": 36.0,
"grad_norm": 0.6328125,
"learning_rate": 0.0002,
"loss": 0.05598109364509583,
"loss_d0": 0.05669083409011364,
"step": 180
},
{
"epoch": 38.0,
"grad_norm": 1.421875,
"learning_rate": 0.0002,
"loss": 0.0645066499710083,
"loss_d0": 0.06387052945792675,
"step": 190
},
{
"epoch": 40.0,
"grad_norm": 0.734375,
"learning_rate": 0.0002,
"loss": 0.05241028070449829,
"loss_d0": 0.05293848738074303,
"step": 200
},
{
"epoch": 42.0,
"grad_norm": 0.5390625,
"learning_rate": 0.0002,
"loss": 0.05211336016654968,
"loss_d0": 0.052401353046298026,
"step": 210
},
{
"epoch": 44.0,
"grad_norm": 0.57421875,
"learning_rate": 0.0002,
"loss": 0.05016546249389649,
"loss_d0": 0.050755372270941734,
"step": 220
},
{
"epoch": 46.0,
"grad_norm": 0.71875,
"learning_rate": 0.0002,
"loss": 0.041543081402778625,
"loss_d0": 0.042144207283854485,
"step": 230
},
{
"epoch": 48.0,
"grad_norm": 0.78515625,
"learning_rate": 0.0002,
"loss": 0.05228267908096314,
"loss_d0": 0.05261162966489792,
"step": 240
},
{
"epoch": 50.0,
"grad_norm": 0.66796875,
"learning_rate": 0.0002,
"loss": 0.05244388580322266,
"loss_d0": 0.05229940041899681,
"step": 250
},
{
"epoch": 52.0,
"grad_norm": 0.88671875,
"learning_rate": 0.0002,
"loss": 0.05073425769805908,
"loss_d0": 0.051067108660936354,
"step": 260
},
{
"epoch": 54.0,
"grad_norm": 0.71875,
"learning_rate": 0.0002,
"loss": 0.06447980999946594,
"loss_d0": 0.06431438736617565,
"step": 270
},
{
"epoch": 56.0,
"grad_norm": 0.47265625,
"learning_rate": 0.0002,
"loss": 0.05653516054153442,
"loss_d0": 0.05646625086665154,
"step": 280
},
{
"epoch": 58.0,
"grad_norm": 0.578125,
"learning_rate": 0.0002,
"loss": 0.04778359830379486,
"loss_d0": 0.04764467999339104,
"step": 290
},
{
"epoch": 60.0,
"grad_norm": 0.73828125,
"learning_rate": 0.0002,
"loss": 0.054469555616378784,
"loss_d0": 0.055085692554712296,
"step": 300
},
{
"epoch": 62.0,
"grad_norm": 0.609375,
"learning_rate": 0.0002,
"loss": 0.041742435097694396,
"loss_d0": 0.04279345571994782,
"step": 310
},
{
"epoch": 64.0,
"grad_norm": 0.55078125,
"learning_rate": 0.0002,
"loss": 0.042937666177749634,
"loss_d0": 0.0437875846400857,
"step": 320
},
{
"epoch": 66.0,
"grad_norm": 0.5078125,
"learning_rate": 0.0002,
"loss": 0.041009509563446046,
"loss_d0": 0.0414072010666132,
"step": 330
},
{
"epoch": 68.0,
"grad_norm": 0.625,
"learning_rate": 0.0002,
"loss": 0.048875680565834044,
"loss_d0": 0.04988762177526951,
"step": 340
},
{
"epoch": 70.0,
"grad_norm": 0.578125,
"learning_rate": 0.0002,
"loss": 0.04380723237991333,
"loss_d0": 0.04455060698091984,
"step": 350
},
{
"epoch": 72.0,
"grad_norm": 0.359375,
"learning_rate": 0.0002,
"loss": 0.040441864728927614,
"loss_d0": 0.04014628697186708,
"step": 360
},
{
"epoch": 74.0,
"grad_norm": 0.265625,
"learning_rate": 0.0002,
"loss": 0.030716186761856078,
"loss_d0": 0.0307559696957469,
"step": 370
},
{
"epoch": 76.0,
"grad_norm": 0.32421875,
"learning_rate": 0.0002,
"loss": 0.028968781232833862,
"loss_d0": 0.029201462492346765,
"step": 380
},
{
"epoch": 78.0,
"grad_norm": 0.244140625,
"learning_rate": 0.0002,
"loss": 0.029742777347564697,
"loss_d0": 0.029923729598522186,
"step": 390
},
{
"epoch": 80.0,
"grad_norm": 0.2421875,
"learning_rate": 0.0002,
"loss": 0.028669720888137816,
"loss_d0": 0.028858649916946887,
"step": 400
},
{
"epoch": 82.0,
"grad_norm": 0.240234375,
"learning_rate": 0.0002,
"loss": 0.028132319450378418,
"loss_d0": 0.02834435775876045,
"step": 410
},
{
"epoch": 84.0,
"grad_norm": 0.380859375,
"learning_rate": 0.0002,
"loss": 0.02881980538368225,
"loss_d0": 0.029026586934924124,
"step": 420
},
{
"epoch": 86.0,
"grad_norm": 0.2080078125,
"learning_rate": 0.0002,
"loss": 0.028524792194366454,
"loss_d0": 0.028784673288464548,
"step": 430
},
{
"epoch": 88.0,
"grad_norm": 0.380859375,
"learning_rate": 0.0002,
"loss": 0.029756176471710204,
"loss_d0": 0.0299751091748476,
"step": 440
},
{
"epoch": 90.0,
"grad_norm": 0.2099609375,
"learning_rate": 0.0002,
"loss": 0.02948334515094757,
"loss_d0": 0.029621412977576256,
"step": 450
},
{
"epoch": 92.0,
"grad_norm": 0.28515625,
"learning_rate": 0.0002,
"loss": 0.030714261531829833,
"loss_d0": 0.030979700013995172,
"step": 460
},
{
"epoch": 94.0,
"grad_norm": 0.294921875,
"learning_rate": 0.0002,
"loss": 0.030224135518074034,
"loss_d0": 0.030322908796370028,
"step": 470
},
{
"epoch": 96.0,
"grad_norm": 0.59375,
"learning_rate": 0.0002,
"loss": 0.04414036273956299,
"loss_d0": 0.04425068683922291,
"step": 480
},
{
"epoch": 98.0,
"grad_norm": 1.078125,
"learning_rate": 0.0002,
"loss": 0.04671807289123535,
"loss_d0": 0.046425480581820014,
"step": 490
},
{
"epoch": 100.0,
"grad_norm": 0.73828125,
"learning_rate": 0.0002,
"loss": 0.07045136690139771,
"loss_d0": 0.07064050324261188,
"step": 500
},
{
"epoch": 100.0,
"eval_loss": 8.959203720092773,
"eval_runtime": 0.3447,
"eval_samples_per_second": 725.191,
"eval_steps_per_second": 72.519,
"step": 500
},
{
"epoch": 102.0,
"grad_norm": 0.6875,
"learning_rate": 0.0002,
"loss": 0.06712871193885803,
"loss_d0": 0.06785535477101803,
"step": 510
},
{
"epoch": 104.0,
"grad_norm": 0.4375,
"learning_rate": 0.0002,
"loss": 0.04896087944507599,
"loss_d0": 0.04912064522504807,
"step": 520
},
{
"epoch": 106.0,
"grad_norm": 0.5390625,
"learning_rate": 0.0002,
"loss": 0.05117716193199158,
"loss_d0": 0.05100610740482807,
"step": 530
},
{
"epoch": 108.0,
"grad_norm": 0.921875,
"learning_rate": 0.0002,
"loss": 0.05128544569015503,
"loss_d0": 0.05223123952746391,
"step": 540
},
{
"epoch": 110.0,
"grad_norm": 0.76953125,
"learning_rate": 0.0002,
"loss": 0.04075254797935486,
"loss_d0": 0.04160372149199247,
"step": 550
},
{
"epoch": 112.0,
"grad_norm": 0.51171875,
"learning_rate": 0.0002,
"loss": 0.03934467732906342,
"loss_d0": 0.039441941492259505,
"step": 560
},
{
"epoch": 114.0,
"grad_norm": 0.431640625,
"learning_rate": 0.0002,
"loss": 0.033867093920707705,
"loss_d0": 0.03388459365814924,
"step": 570
},
{
"epoch": 116.0,
"grad_norm": 0.337890625,
"learning_rate": 0.0002,
"loss": 0.0360151618719101,
"loss_d0": 0.03605454880744219,
"step": 580
},
{
"epoch": 118.0,
"grad_norm": 0.255859375,
"learning_rate": 0.0002,
"loss": 0.030016973614692688,
"loss_d0": 0.030266443826258184,
"step": 590
},
{
"epoch": 120.0,
"grad_norm": 0.86328125,
"learning_rate": 0.0002,
"loss": 0.029359149932861327,
"loss_d0": 0.029560688696801663,
"step": 600
},
{
"epoch": 122.0,
"grad_norm": 0.267578125,
"learning_rate": 0.0002,
"loss": 0.02911534309387207,
"loss_d0": 0.029265684261918067,
"step": 610
},
{
"epoch": 124.0,
"grad_norm": 0.19921875,
"learning_rate": 0.0002,
"loss": 0.02807998061180115,
"loss_d0": 0.028299786895513535,
"step": 620
},
{
"epoch": 126.0,
"grad_norm": 0.384765625,
"learning_rate": 0.0002,
"loss": 0.027643266320228576,
"loss_d0": 0.02785799019038677,
"step": 630
},
{
"epoch": 128.0,
"grad_norm": 0.2470703125,
"learning_rate": 0.0002,
"loss": 0.027844372391700744,
"loss_d0": 0.028002014197409154,
"step": 640
},
{
"epoch": 130.0,
"grad_norm": 0.240234375,
"learning_rate": 0.0002,
"loss": 0.027933624386787415,
"loss_d0": 0.02816301938146353,
"step": 650
},
{
"epoch": 132.0,
"grad_norm": 0.32421875,
"learning_rate": 0.0002,
"loss": 0.028434035181999207,
"loss_d0": 0.028620816953480243,
"step": 660
},
{
"epoch": 134.0,
"grad_norm": 0.2216796875,
"learning_rate": 0.0002,
"loss": 0.028094932436943054,
"loss_d0": 0.028314914368093014,
"step": 670
},
{
"epoch": 136.0,
"grad_norm": 0.2294921875,
"learning_rate": 0.0002,
"loss": 0.028378623723983764,
"loss_d0": 0.028593042865395546,
"step": 680
},
{
"epoch": 138.0,
"grad_norm": 0.2734375,
"learning_rate": 0.0002,
"loss": 0.028746598958969118,
"loss_d0": 0.028957749716937542,
"step": 690
},
{
"epoch": 140.0,
"grad_norm": 0.455078125,
"learning_rate": 0.0002,
"loss": 0.028535950183868408,
"loss_d0": 0.028712566196918487,
"step": 700
},
{
"epoch": 142.0,
"grad_norm": 0.2314453125,
"learning_rate": 0.0002,
"loss": 0.028533819317817687,
"loss_d0": 0.028727527521550656,
"step": 710
},
{
"epoch": 144.0,
"grad_norm": 0.337890625,
"learning_rate": 0.0002,
"loss": 0.028585079312324523,
"loss_d0": 0.02878807336091995,
"step": 720
},
{
"epoch": 146.0,
"grad_norm": 0.26953125,
"learning_rate": 0.0002,
"loss": 0.028488412499427795,
"loss_d0": 0.028675549291074277,
"step": 730
},
{
"epoch": 148.0,
"grad_norm": 0.298828125,
"learning_rate": 0.0002,
"loss": 0.028854280710220337,
"loss_d0": 0.029053621739149094,
"step": 740
},
{
"epoch": 150.0,
"grad_norm": 0.2119140625,
"learning_rate": 0.0002,
"loss": 0.02862183153629303,
"loss_d0": 0.028778632916510106,
"step": 750
},
{
"epoch": 152.0,
"grad_norm": 0.275390625,
"learning_rate": 0.0002,
"loss": 0.028436908125877382,
"loss_d0": 0.028733734413981436,
"step": 760
},
{
"epoch": 154.0,
"grad_norm": 0.21875,
"learning_rate": 0.0002,
"loss": 0.027613097429275514,
"loss_d0": 0.027862665802240373,
"step": 770
},
{
"epoch": 156.0,
"grad_norm": 0.2734375,
"learning_rate": 0.0002,
"loss": 0.027435335516929626,
"loss_d0": 0.027639228850603104,
"step": 780
},
{
"epoch": 158.0,
"grad_norm": 0.220703125,
"learning_rate": 0.0002,
"loss": 0.0274164617061615,
"loss_d0": 0.027649453654885293,
"step": 790
},
{
"epoch": 160.0,
"grad_norm": 0.35546875,
"learning_rate": 0.0002,
"loss": 0.027769792079925536,
"loss_d0": 0.02795196920633316,
"step": 800
},
{
"epoch": 162.0,
"grad_norm": 0.2578125,
"learning_rate": 0.0002,
"loss": 0.028336551785469056,
"loss_d0": 0.028514006175100803,
"step": 810
},
{
"epoch": 164.0,
"grad_norm": 0.296875,
"learning_rate": 0.0002,
"loss": 0.027915754914283754,
"loss_d0": 0.028118485398590565,
"step": 820
},
{
"epoch": 166.0,
"grad_norm": 0.326171875,
"learning_rate": 0.0002,
"loss": 0.02842898666858673,
"loss_d0": 0.028575334511697293,
"step": 830
},
{
"epoch": 168.0,
"grad_norm": 0.40625,
"learning_rate": 0.0002,
"loss": 0.028567203879356386,
"loss_d0": 0.028683514893054964,
"step": 840
},
{
"epoch": 170.0,
"grad_norm": 0.240234375,
"learning_rate": 0.0002,
"loss": 0.02767796516418457,
"loss_d0": 0.02789214290678501,
"step": 850
},
{
"epoch": 172.0,
"grad_norm": 0.3828125,
"learning_rate": 0.0002,
"loss": 0.027684780955314636,
"loss_d0": 0.02787543125450611,
"step": 860
},
{
"epoch": 174.0,
"grad_norm": 0.2890625,
"learning_rate": 0.0002,
"loss": 0.0280588835477829,
"loss_d0": 0.028297702036798,
"step": 870
},
{
"epoch": 176.0,
"grad_norm": 0.28515625,
"learning_rate": 0.0002,
"loss": 0.027783623337745665,
"loss_d0": 0.028036702796816824,
"step": 880
},
{
"epoch": 178.0,
"grad_norm": 0.33984375,
"learning_rate": 0.0002,
"loss": 0.02792365550994873,
"loss_d0": 0.028142866864800452,
"step": 890
},
{
"epoch": 180.0,
"grad_norm": 0.255859375,
"learning_rate": 0.0002,
"loss": 0.027568233013153077,
"loss_d0": 0.027781904488801957,
"step": 900
},
{
"epoch": 182.0,
"grad_norm": 0.337890625,
"learning_rate": 0.0002,
"loss": 0.0276969313621521,
"loss_d0": 0.027824966609477995,
"step": 910
},
{
"epoch": 184.0,
"grad_norm": 0.41015625,
"learning_rate": 0.0002,
"loss": 0.028015774488449097,
"loss_d0": 0.02823227122426033,
"step": 920
},
{
"epoch": 186.0,
"grad_norm": 0.33203125,
"learning_rate": 0.0002,
"loss": 0.02751585841178894,
"loss_d0": 0.027756123058497905,
"step": 930
},
{
"epoch": 188.0,
"grad_norm": 0.29296875,
"learning_rate": 0.0002,
"loss": 0.0278137743473053,
"loss_d0": 0.0280290137976408,
"step": 940
},
{
"epoch": 190.0,
"grad_norm": 0.21484375,
"learning_rate": 0.0002,
"loss": 0.02724808156490326,
"loss_d0": 0.027457468770444395,
"step": 950
},
{
"epoch": 192.0,
"grad_norm": 0.359375,
"learning_rate": 0.0002,
"loss": 0.02748032510280609,
"loss_d0": 0.027659581601619722,
"step": 960
},
{
"epoch": 194.0,
"grad_norm": 0.2138671875,
"learning_rate": 0.0002,
"loss": 0.027248311042785644,
"loss_d0": 0.027455149777233602,
"step": 970
},
{
"epoch": 196.0,
"grad_norm": 0.234375,
"learning_rate": 0.0002,
"loss": 0.027402669191360474,
"loss_d0": 0.02764355856925249,
"step": 980
},
{
"epoch": 198.0,
"grad_norm": 0.251953125,
"learning_rate": 0.0002,
"loss": 0.027301329374313354,
"loss_d0": 0.027496096305549146,
"step": 990
},
{
"epoch": 200.0,
"grad_norm": 0.2890625,
"learning_rate": 0.0002,
"loss": 0.02728489935398102,
"loss_d0": 0.027470245584845544,
"step": 1000
},
{
"epoch": 200.0,
"eval_loss": 11.642775535583496,
"eval_runtime": 0.3432,
"eval_samples_per_second": 728.437,
"eval_steps_per_second": 72.844,
"step": 1000
},
{
"epoch": 202.0,
"grad_norm": 0.29296875,
"learning_rate": 0.0002,
"loss": 0.02735854685306549,
"loss_d0": 0.027549722604453562,
"step": 1010
},
{
"epoch": 204.0,
"grad_norm": 0.2431640625,
"learning_rate": 0.0002,
"loss": 0.027801865339279176,
"loss_d0": 0.028005635365843773,
"step": 1020
},
{
"epoch": 206.0,
"grad_norm": 0.369140625,
"learning_rate": 0.0002,
"loss": 0.027131298184394838,
"loss_d0": 0.027335867658257483,
"step": 1030
},
{
"epoch": 208.0,
"grad_norm": 0.29296875,
"learning_rate": 0.0002,
"loss": 0.027349919080734253,
"loss_d0": 0.02756602894514799,
"step": 1040
},
{
"epoch": 210.0,
"grad_norm": 0.236328125,
"learning_rate": 0.0002,
"loss": 0.027464228868484496,
"loss_d0": 0.027678760513663293,
"step": 1050
},
{
"epoch": 212.0,
"grad_norm": 0.341796875,
"learning_rate": 0.0002,
"loss": 0.027161532640457155,
"loss_d0": 0.02738652192056179,
"step": 1060
},
{
"epoch": 214.0,
"grad_norm": 0.23046875,
"learning_rate": 0.0002,
"loss": 0.027511611580848694,
"loss_d0": 0.02768396809697151,
"step": 1070
},
{
"epoch": 216.0,
"grad_norm": 0.33203125,
"learning_rate": 0.0002,
"loss": 0.027651122212409972,
"loss_d0": 0.027797568403184415,
"step": 1080
},
{
"epoch": 218.0,
"grad_norm": 0.267578125,
"learning_rate": 0.0002,
"loss": 0.02745751440525055,
"loss_d0": 0.027669144794344902,
"step": 1090
},
{
"epoch": 220.0,
"grad_norm": 0.296875,
"learning_rate": 0.0002,
"loss": 0.027723565697669983,
"loss_d0": 0.02790863234549761,
"step": 1100
},
{
"epoch": 222.0,
"grad_norm": 0.255859375,
"learning_rate": 0.0002,
"loss": 0.02735493779182434,
"loss_d0": 0.027564115822315216,
"step": 1110
},
{
"epoch": 224.0,
"grad_norm": 0.2421875,
"learning_rate": 0.0002,
"loss": 0.026864311099052428,
"loss_d0": 0.027068359963595866,
"step": 1120
},
{
"epoch": 226.0,
"grad_norm": 0.34765625,
"learning_rate": 0.0002,
"loss": 0.02702401876449585,
"loss_d0": 0.02721490990370512,
"step": 1130
},
{
"epoch": 228.0,
"grad_norm": 0.38671875,
"learning_rate": 0.0002,
"loss": 0.027210086584091187,
"loss_d0": 0.027409385330975054,
"step": 1140
},
{
"epoch": 230.0,
"grad_norm": 0.3828125,
"learning_rate": 0.0002,
"loss": 0.02788194715976715,
"loss_d0": 0.028096820414066314,
"step": 1150
},
{
"epoch": 232.0,
"grad_norm": 0.25390625,
"learning_rate": 0.0002,
"loss": 0.02745024561882019,
"loss_d0": 0.02763645313680172,
"step": 1160
},
{
"epoch": 234.0,
"grad_norm": 0.29296875,
"learning_rate": 0.0002,
"loss": 0.027583950757980348,
"loss_d0": 0.027757029607892038,
"step": 1170
},
{
"epoch": 236.0,
"grad_norm": 0.35546875,
"learning_rate": 0.0002,
"loss": 0.027706864476203918,
"loss_d0": 0.027875961363315584,
"step": 1180
},
{
"epoch": 238.0,
"grad_norm": 0.412109375,
"learning_rate": 0.0002,
"loss": 0.027233675122261047,
"loss_d0": 0.027483156137168407,
"step": 1190
},
{
"epoch": 240.0,
"grad_norm": 0.484375,
"learning_rate": 0.0002,
"loss": 0.028237748146057128,
"loss_d0": 0.028435330465435983,
"step": 1200
},
{
"epoch": 242.0,
"grad_norm": 0.341796875,
"learning_rate": 0.0002,
"loss": 0.028385213017463683,
"loss_d0": 0.02854954022914171,
"step": 1210
},
{
"epoch": 244.0,
"grad_norm": 1.4765625,
"learning_rate": 0.0002,
"loss": 0.07820796370506286,
"loss_d0": 0.07887713219970464,
"step": 1220
},
{
"epoch": 246.0,
"grad_norm": 0.55078125,
"learning_rate": 0.0002,
"loss": 0.06436525583267212,
"loss_d0": 0.06421407721936703,
"step": 1230
},
{
"epoch": 248.0,
"grad_norm": 0.796875,
"learning_rate": 0.0002,
"loss": 0.04631165564060211,
"loss_d0": 0.04691880084574222,
"step": 1240
},
{
"epoch": 250.0,
"grad_norm": 0.3671875,
"learning_rate": 0.0002,
"loss": 0.04134821593761444,
"loss_d0": 0.04087922126054764,
"step": 1250
},
{
"epoch": 252.0,
"grad_norm": 0.2470703125,
"learning_rate": 0.0002,
"loss": 0.0302289217710495,
"loss_d0": 0.03042766097933054,
"step": 1260
},
{
"epoch": 254.0,
"grad_norm": 0.29296875,
"learning_rate": 0.0002,
"loss": 0.02885407507419586,
"loss_d0": 0.029020925983786583,
"step": 1270
},
{
"epoch": 256.0,
"grad_norm": 0.2890625,
"learning_rate": 0.0002,
"loss": 0.02922482490539551,
"loss_d0": 0.029606640711426734,
"step": 1280
},
{
"epoch": 258.0,
"grad_norm": 0.2333984375,
"learning_rate": 0.0002,
"loss": 0.027226346731185912,
"loss_d0": 0.027418379485607148,
"step": 1290
},
{
"epoch": 260.0,
"grad_norm": 0.31640625,
"learning_rate": 0.0002,
"loss": 0.027053937315940857,
"loss_d0": 0.027259073778986932,
"step": 1300
},
{
"epoch": 262.0,
"grad_norm": 0.29296875,
"learning_rate": 0.0002,
"loss": 0.027176541090011597,
"loss_d0": 0.02738271653652191,
"step": 1310
},
{
"epoch": 264.0,
"grad_norm": 0.28515625,
"learning_rate": 0.0002,
"loss": 0.026905521750450134,
"loss_d0": 0.027155109308660032,
"step": 1320
},
{
"epoch": 266.0,
"grad_norm": 0.26171875,
"learning_rate": 0.0002,
"loss": 0.0273532897233963,
"loss_d0": 0.027509130537509918,
"step": 1330
},
{
"epoch": 268.0,
"grad_norm": 0.294921875,
"learning_rate": 0.0002,
"loss": 0.02710416615009308,
"loss_d0": 0.027293745800852774,
"step": 1340
},
{
"epoch": 270.0,
"grad_norm": 0.2236328125,
"learning_rate": 0.0002,
"loss": 0.02694128155708313,
"loss_d0": 0.027170353196561338,
"step": 1350
},
{
"epoch": 272.0,
"grad_norm": 0.2421875,
"learning_rate": 0.0002,
"loss": 0.02707500457763672,
"loss_d0": 0.027278581261634828,
"step": 1360
},
{
"epoch": 274.0,
"grad_norm": 0.2216796875,
"learning_rate": 0.0002,
"loss": 0.02710617482662201,
"loss_d0": 0.02733020707964897,
"step": 1370
},
{
"epoch": 276.0,
"grad_norm": 0.265625,
"learning_rate": 0.0002,
"loss": 0.026942601799964903,
"loss_d0": 0.027134068310260773,
"step": 1380
},
{
"epoch": 278.0,
"grad_norm": 0.314453125,
"learning_rate": 0.0002,
"loss": 0.026836836338043214,
"loss_d0": 0.02706842515617609,
"step": 1390
},
{
"epoch": 280.0,
"grad_norm": 0.2890625,
"learning_rate": 0.0002,
"loss": 0.027437672019004822,
"loss_d0": 0.027645259350538253,
"step": 1400
},
{
"epoch": 282.0,
"grad_norm": 0.302734375,
"learning_rate": 0.0002,
"loss": 0.0270478755235672,
"loss_d0": 0.02722824104130268,
"step": 1410
},
{
"epoch": 284.0,
"grad_norm": 0.21875,
"learning_rate": 0.0002,
"loss": 0.02693583369255066,
"loss_d0": 0.02716414462774992,
"step": 1420
},
{
"epoch": 286.0,
"grad_norm": 0.28515625,
"learning_rate": 0.0002,
"loss": 0.027086949348449706,
"loss_d0": 0.02727580312639475,
"step": 1430
},
{
"epoch": 288.0,
"grad_norm": 0.22265625,
"learning_rate": 0.0002,
"loss": 0.026997911930084228,
"loss_d0": 0.027215636894106866,
"step": 1440
},
{
"epoch": 290.0,
"grad_norm": 0.2314453125,
"learning_rate": 0.0002,
"loss": 0.027128046751022337,
"loss_d0": 0.027313951589167117,
"step": 1450
},
{
"epoch": 292.0,
"grad_norm": 0.2734375,
"learning_rate": 0.0002,
"loss": 0.02703723907470703,
"loss_d0": 0.02727229129523039,
"step": 1460
},
{
"epoch": 294.0,
"grad_norm": 0.26171875,
"learning_rate": 0.0002,
"loss": 0.02702658772468567,
"loss_d0": 0.027214765176177026,
"step": 1470
},
{
"epoch": 296.0,
"grad_norm": 0.5,
"learning_rate": 0.0002,
"loss": 0.02745291292667389,
"loss_d0": 0.027677034400403498,
"step": 1480
},
{
"epoch": 298.0,
"grad_norm": 0.26953125,
"learning_rate": 0.0002,
"loss": 0.026951307058334352,
"loss_d0": 0.027119937352836132,
"step": 1490
},
{
"epoch": 300.0,
"grad_norm": 0.30859375,
"learning_rate": 0.0002,
"loss": 0.027886945009231567,
"loss_d0": 0.028050208278000355,
"step": 1500
},
{
"epoch": 300.0,
"eval_loss": 11.753874778747559,
"eval_runtime": 0.3443,
"eval_samples_per_second": 726.204,
"eval_steps_per_second": 72.62,
"step": 1500
},
{
"epoch": 302.0,
"grad_norm": 0.326171875,
"learning_rate": 0.0002,
"loss": 0.027407735586166382,
"loss_d0": 0.027636309526860713,
"step": 1510
},
{
"epoch": 304.0,
"grad_norm": 0.3671875,
"learning_rate": 0.0002,
"loss": 0.02735218107700348,
"loss_d0": 0.02756862100213766,
"step": 1520
},
{
"epoch": 306.0,
"grad_norm": 0.32421875,
"learning_rate": 0.0002,
"loss": 0.02719148397445679,
"loss_d0": 0.027414854615926743,
"step": 1530
},
{
"epoch": 308.0,
"grad_norm": 0.2353515625,
"learning_rate": 0.0002,
"loss": 0.027126818895339966,
"loss_d0": 0.027357102558016776,
"step": 1540
},
{
"epoch": 310.0,
"grad_norm": 0.2470703125,
"learning_rate": 0.0002,
"loss": 0.02752436101436615,
"loss_d0": 0.027706788294017314,
"step": 1550
},
{
"epoch": 312.0,
"grad_norm": 1.0859375,
"learning_rate": 0.0002,
"loss": 0.03637430667877197,
"loss_d0": 0.0361976170912385,
"step": 1560
},
{
"epoch": 314.0,
"grad_norm": 0.59765625,
"learning_rate": 0.0002,
"loss": 0.05565944910049438,
"loss_d0": 0.05626031719148159,
"step": 1570
},
{
"epoch": 316.0,
"grad_norm": 0.79296875,
"learning_rate": 0.0002,
"loss": 0.06168928146362305,
"loss_d0": 0.06206231936812401,
"step": 1580
},
{
"epoch": 318.0,
"grad_norm": 0.400390625,
"learning_rate": 0.0002,
"loss": 0.05846645832061768,
"loss_d0": 0.060188758000731465,
"step": 1590
},
{
"epoch": 320.0,
"grad_norm": 0.6875,
"learning_rate": 0.0002,
"loss": 0.05034934282302857,
"loss_d0": 0.05091057028621435,
"step": 1600
},
{
"epoch": 322.0,
"grad_norm": 0.310546875,
"learning_rate": 0.00019995559043291586,
"loss": 0.0373257964849472,
"loss_d0": 0.03773617539554834,
"step": 1610
},
{
"epoch": 324.0,
"grad_norm": 0.3125,
"learning_rate": 0.0001998021321462845,
"loss": 0.029404985904693603,
"loss_d0": 0.02956023495644331,
"step": 1620
},
{
"epoch": 326.0,
"grad_norm": 0.28515625,
"learning_rate": 0.00019953926379459095,
"loss": 0.029057389497756957,
"loss_d0": 0.029157786443829537,
"step": 1630
},
{
"epoch": 328.0,
"grad_norm": 0.328125,
"learning_rate": 0.00019916730564242994,
"loss": 0.03261968493461609,
"loss_d0": 0.032432263158261775,
"step": 1640
},
{
"epoch": 330.0,
"grad_norm": 0.271484375,
"learning_rate": 0.00019868671086351413,
"loss": 0.028703576326370238,
"loss_d0": 0.02889830097556114,
"step": 1650
},
{
"epoch": 332.0,
"grad_norm": 0.31640625,
"learning_rate": 0.00019809806498855166,
"loss": 0.027686920762062073,
"loss_d0": 0.02781019788235426,
"step": 1660
},
{
"epoch": 334.0,
"grad_norm": 0.26171875,
"learning_rate": 0.00019740208519186726,
"loss": 0.027178701758384705,
"loss_d0": 0.027357110008597373,
"step": 1670
},
{
"epoch": 336.0,
"grad_norm": 0.26171875,
"learning_rate": 0.0001965996194176357,
"loss": 0.027020579576492308,
"loss_d0": 0.027211257629096507,
"step": 1680
},
{
"epoch": 338.0,
"grad_norm": 0.2294921875,
"learning_rate": 0.00019569164534679248,
"loss": 0.027001625299453734,
"loss_d0": 0.027210658043622972,
"step": 1690
},
{
"epoch": 340.0,
"grad_norm": 0.2578125,
"learning_rate": 0.0001946792692058803,
"loss": 0.02686695158481598,
"loss_d0": 0.02705973945558071,
"step": 1700
},
{
"epoch": 342.0,
"grad_norm": 0.283203125,
"learning_rate": 0.00019356372441928221,
"loss": 0.02691388428211212,
"loss_d0": 0.027120614424347878,
"step": 1710
},
{
"epoch": 344.0,
"grad_norm": 0.322265625,
"learning_rate": 0.00019234637010648426,
"loss": 0.027087369561195375,
"loss_d0": 0.02729078847914934,
"step": 1720
},
{
"epoch": 346.0,
"grad_norm": 0.294921875,
"learning_rate": 0.00019102868942619743,
"loss": 0.027006912231445312,
"loss_d0": 0.027164803072810172,
"step": 1730
},
{
"epoch": 348.0,
"grad_norm": 0.2001953125,
"learning_rate": 0.00018961228776935755,
"loss": 0.026824173331260682,
"loss_d0": 0.027049205265939236,
"step": 1740
},
{
"epoch": 350.0,
"grad_norm": 0.35546875,
"learning_rate": 0.00018809889080320357,
"loss": 0.027346810698509215,
"loss_d0": 0.02754506915807724,
"step": 1750
},
{
"epoch": 352.0,
"grad_norm": 0.20703125,
"learning_rate": 0.00018649034236881777,
"loss": 0.026931869983673095,
"loss_d0": 0.027164109982550144,
"step": 1760
},
{
"epoch": 354.0,
"grad_norm": 0.248046875,
"learning_rate": 0.00018478860223468955,
"loss": 0.026971223950386047,
"loss_d0": 0.027155683562159538,
"step": 1770
},
{
"epoch": 356.0,
"grad_norm": 0.2451171875,
"learning_rate": 0.0001829957437090394,
"loss": 0.026918986439704896,
"loss_d0": 0.027109501883387566,
"step": 1780
},
{
"epoch": 358.0,
"grad_norm": 0.232421875,
"learning_rate": 0.00018111395111381214,
"loss": 0.026931074261665345,
"loss_d0": 0.027130777202546596,
"step": 1790
},
{
"epoch": 360.0,
"grad_norm": 0.2099609375,
"learning_rate": 0.00017914551712341713,
"loss": 0.026917403936386107,
"loss_d0": 0.027093666046857832,
"step": 1800
},
{
"epoch": 362.0,
"grad_norm": 0.251953125,
"learning_rate": 0.0001770928399714576,
"loss": 0.026946458220481872,
"loss_d0": 0.027147732861340045,
"step": 1810
},
{
"epoch": 364.0,
"grad_norm": 0.263671875,
"learning_rate": 0.0001749584205288526,
"loss": 0.026951560378074647,
"loss_d0": 0.027163142152130604,
"step": 1820
},
{
"epoch": 366.0,
"grad_norm": 0.2373046875,
"learning_rate": 0.00017274485925691083,
"loss": 0.026931411027908324,
"loss_d0": 0.027134256064891817,
"step": 1830
},
{
"epoch": 368.0,
"grad_norm": 0.294921875,
"learning_rate": 0.00017045485303906913,
"loss": 0.02700725793838501,
"loss_d0": 0.02721524015069008,
"step": 1840
},
{
"epoch": 370.0,
"grad_norm": 0.302734375,
"learning_rate": 0.00016809119189515557,
"loss": 0.026832824945449828,
"loss_d0": 0.0270213108509779,
"step": 1850
},
{
"epoch": 372.0,
"grad_norm": 0.251953125,
"learning_rate": 0.00016565675558217989,
"loss": 0.02687087655067444,
"loss_d0": 0.027065552584826947,
"step": 1860
},
{
"epoch": 374.0,
"grad_norm": 0.2001953125,
"learning_rate": 0.00016315451008579328,
"loss": 0.026832956075668334,
"loss_d0": 0.027041353285312653,
"step": 1870
},
{
"epoch": 376.0,
"grad_norm": 0.21875,
"learning_rate": 0.00016058750400669178,
"loss": 0.026945966482162475,
"loss_d0": 0.027109875157475472,
"step": 1880
},
{
"epoch": 378.0,
"grad_norm": 0.1962890625,
"learning_rate": 0.0001579588648463657,
"loss": 0.026940566301345826,
"loss_d0": 0.02715429160743952,
"step": 1890
},
{
"epoch": 380.0,
"grad_norm": 0.248046875,
"learning_rate": 0.00015527179519672117,
"loss": 0.026649385690689087,
"loss_d0": 0.026848485693335533,
"step": 1900
},
{
"epoch": 382.0,
"grad_norm": 0.37109375,
"learning_rate": 0.00015252956883821488,
"loss": 0.026962289214134218,
"loss_d0": 0.02715070601552725,
"step": 1910
},
{
"epoch": 384.0,
"grad_norm": 0.2412109375,
"learning_rate": 0.00014973552675125708,
"loss": 0.02674136757850647,
"loss_d0": 0.026959112286567687,
"step": 1920
},
{
"epoch": 386.0,
"grad_norm": 0.275390625,
"learning_rate": 0.00014689307304574154,
"loss": 0.026704049110412596,
"loss_d0": 0.026865163631737233,
"step": 1930
},
{
"epoch": 388.0,
"grad_norm": 0.2060546875,
"learning_rate": 0.00014400567081366205,
"loss": 0.026654690504074097,
"loss_d0": 0.026883286982774736,
"step": 1940
},
{
"epoch": 390.0,
"grad_norm": 0.291015625,
"learning_rate": 0.00014107683790986813,
"loss": 0.026780441403388977,
"loss_d0": 0.026964642107486725,
"step": 1950
},
{
"epoch": 392.0,
"grad_norm": 0.26171875,
"learning_rate": 0.00013811014266610096,
"loss": 0.026698926091194154,
"loss_d0": 0.0269396111369133,
"step": 1960
},
{
"epoch": 394.0,
"grad_norm": 0.283203125,
"learning_rate": 0.00013510919954353066,
"loss": 0.026647239923477173,
"loss_d0": 0.026839211583137512,
"step": 1970
},
{
"epoch": 396.0,
"grad_norm": 0.2470703125,
"learning_rate": 0.00013207766472909225,
"loss": 0.0267528235912323,
"loss_d0": 0.026924306713044643,
"step": 1980
},
{
"epoch": 398.0,
"grad_norm": 0.2431640625,
"learning_rate": 0.000129019231680985,
"loss": 0.026655691862106323,
"loss_d0": 0.026865272782742977,
"step": 1990
},
{
"epoch": 400.0,
"grad_norm": 0.25,
"learning_rate": 0.0001259376266287625,
"loss": 0.02653391659259796,
"loss_d0": 0.026740485802292824,
"step": 2000
},
{
"epoch": 400.0,
"eval_loss": 12.447556495666504,
"eval_runtime": 0.3446,
"eval_samples_per_second": 725.445,
"eval_steps_per_second": 72.544,
"step": 2000
}
],
"logging_steps": 10,
"max_steps": 2500,
"num_input_tokens_seen": 0,
"num_train_epochs": 500,
"save_steps": 1000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 2.638372371529728e+16,
"train_batch_size": 10,
"trial_name": null,
"trial_params": null
}