Files
vintage-LLM-340m-v1-base/trainer_state2.json
ModelHub XC 1619232d51 初始化项目,由ModelHub XC社区提供模型
Model: croqaz/vintage-LLM-340m-v1-base
Source: Original Platform
2026-07-15 16:59:11 +08:00

7963 lines
199 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.3500724287783679,
"eval_steps": 100,
"global_step": 10150,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0007595898214963919,
"grad_norm": 4.34375,
"learning_rate": 0.0,
"loss": 4.160505771636963,
"step": 1
},
{
"epoch": 0.007595898214963919,
"grad_norm": 1.5078125,
"learning_rate": 2.2499999999999998e-05,
"loss": 4.129366980658637,
"step": 10
},
{
"epoch": 0.015191796429927839,
"grad_norm": 0.65625,
"learning_rate": 4.75e-05,
"loss": 4.0021720886230465,
"step": 20
},
{
"epoch": 0.02278769464489176,
"grad_norm": 0.341796875,
"learning_rate": 7.25e-05,
"loss": 3.8429046630859376,
"step": 30
},
{
"epoch": 0.030383592859855677,
"grad_norm": 0.2490234375,
"learning_rate": 9.750000000000001e-05,
"loss": 3.714479446411133,
"step": 40
},
{
"epoch": 0.0379794910748196,
"grad_norm": 0.279296875,
"learning_rate": 0.0001225,
"loss": 3.6400478363037108,
"step": 50
},
{
"epoch": 0.04557538928978352,
"grad_norm": 0.244140625,
"learning_rate": 0.0001475,
"loss": 3.551565933227539,
"step": 60
},
{
"epoch": 0.053171287504747436,
"grad_norm": 0.3046875,
"learning_rate": 0.0001725,
"loss": 3.4914886474609377,
"step": 70
},
{
"epoch": 0.060767185719711354,
"grad_norm": 0.255859375,
"learning_rate": 0.0001975,
"loss": 3.4572845458984376,
"step": 80
},
{
"epoch": 0.06836308393467527,
"grad_norm": 0.30078125,
"learning_rate": 0.00022250000000000001,
"loss": 3.41595573425293,
"step": 90
},
{
"epoch": 0.0759589821496392,
"grad_norm": 0.55078125,
"learning_rate": 0.0002475,
"loss": 3.356405258178711,
"step": 100
},
{
"epoch": 0.0759589821496392,
"eval_loss": 3.321293830871582,
"eval_runtime": 6.4337,
"eval_samples_per_second": 50.826,
"eval_steps_per_second": 1.71,
"step": 100
},
{
"epoch": 0.08355488036460311,
"grad_norm": 0.326171875,
"learning_rate": 0.0002725,
"loss": 3.3377449035644533,
"step": 110
},
{
"epoch": 0.09115077857956703,
"grad_norm": 0.35546875,
"learning_rate": 0.00029749999999999997,
"loss": 3.2930694580078126,
"step": 120
},
{
"epoch": 0.09874667679453095,
"grad_norm": 0.423828125,
"learning_rate": 0.00032250000000000003,
"loss": 3.28686637878418,
"step": 130
},
{
"epoch": 0.10634257500949487,
"grad_norm": 0.337890625,
"learning_rate": 0.0003475,
"loss": 3.260041046142578,
"step": 140
},
{
"epoch": 0.1139384732244588,
"grad_norm": 0.38671875,
"learning_rate": 0.0003725,
"loss": 3.230126953125,
"step": 150
},
{
"epoch": 0.12153437143942271,
"grad_norm": 0.396484375,
"learning_rate": 0.0003975,
"loss": 3.247303009033203,
"step": 160
},
{
"epoch": 0.12913026965438662,
"grad_norm": 0.69921875,
"learning_rate": 0.00042249999999999997,
"loss": 3.215043640136719,
"step": 170
},
{
"epoch": 0.13672616786935055,
"grad_norm": 0.416015625,
"learning_rate": 0.00044750000000000004,
"loss": 3.1772716522216795,
"step": 180
},
{
"epoch": 0.14432206608431447,
"grad_norm": 0.625,
"learning_rate": 0.0004725,
"loss": 3.1748157501220704,
"step": 190
},
{
"epoch": 0.1519179642992784,
"grad_norm": 0.365234375,
"learning_rate": 0.0004975,
"loss": 3.162751388549805,
"step": 200
},
{
"epoch": 0.1519179642992784,
"eval_loss": 3.1788299083709717,
"eval_runtime": 6.3407,
"eval_samples_per_second": 51.571,
"eval_steps_per_second": 1.735,
"step": 200
},
{
"epoch": 0.15951386251424232,
"grad_norm": 0.390625,
"learning_rate": 0.000499923916786539,
"loss": 3.1491827011108398,
"step": 210
},
{
"epoch": 0.16710976072920622,
"grad_norm": 0.48046875,
"learning_rate": 0.0004996609756683134,
"loss": 3.1373762130737304,
"step": 220
},
{
"epoch": 0.17470565894417014,
"grad_norm": 0.349609375,
"learning_rate": 0.0004992104452776705,
"loss": 3.1026805877685546,
"step": 230
},
{
"epoch": 0.18230155715913407,
"grad_norm": 0.318359375,
"learning_rate": 0.0004985726819745386,
"loss": 3.097637748718262,
"step": 240
},
{
"epoch": 0.189897455374098,
"grad_norm": 0.33984375,
"learning_rate": 0.0004977481902160848,
"loss": 3.074860191345215,
"step": 250
},
{
"epoch": 0.1974933535890619,
"grad_norm": 0.361328125,
"learning_rate": 0.0004967376221577013,
"loss": 3.0807043075561524,
"step": 260
},
{
"epoch": 0.20508925180402582,
"grad_norm": 0.40625,
"learning_rate": 0.0004955417771371639,
"loss": 3.074227142333984,
"step": 270
},
{
"epoch": 0.21268515001898974,
"grad_norm": 0.353515625,
"learning_rate": 0.0004941616010423732,
"loss": 3.05371036529541,
"step": 280
},
{
"epoch": 0.22028104823395367,
"grad_norm": 0.322265625,
"learning_rate": 0.0004925981855631768,
"loss": 3.0531679153442384,
"step": 290
},
{
"epoch": 0.2278769464489176,
"grad_norm": 0.33984375,
"learning_rate": 0.0004908527673278665,
"loss": 3.044694709777832,
"step": 300
},
{
"epoch": 0.2278769464489176,
"eval_loss": 3.135857105255127,
"eval_runtime": 6.4068,
"eval_samples_per_second": 51.04,
"eval_steps_per_second": 1.717,
"step": 300
},
{
"epoch": 0.2354728446638815,
"grad_norm": 0.310546875,
"learning_rate": 0.0004889267269250315,
"loss": 3.0244071960449217,
"step": 310
},
{
"epoch": 0.24306874287884542,
"grad_norm": 0.310546875,
"learning_rate": 0.0004868215878115427,
"loss": 3.0274925231933594,
"step": 320
},
{
"epoch": 0.25066464109380937,
"grad_norm": 0.421875,
"learning_rate": 0.00048453901510752973,
"loss": 3.0219192504882812,
"step": 330
},
{
"epoch": 0.25826053930877324,
"grad_norm": 0.298828125,
"learning_rate": 0.0004820808142793077,
"loss": 3.0148666381835936,
"step": 340
},
{
"epoch": 0.26585643752373717,
"grad_norm": 0.267578125,
"learning_rate": 0.00047944892971129113,
"loss": 2.9982091903686525,
"step": 350
},
{
"epoch": 0.2734523357387011,
"grad_norm": 0.34375,
"learning_rate": 0.0004766454431680274,
"loss": 2.986362266540527,
"step": 360
},
{
"epoch": 0.281048233953665,
"grad_norm": 0.30859375,
"learning_rate": 0.00047367257214756583,
"loss": 2.9878061294555662,
"step": 370
},
{
"epoch": 0.28864413216862894,
"grad_norm": 0.267578125,
"learning_rate": 0.0004705326681274636,
"loss": 2.9845380783081055,
"step": 380
},
{
"epoch": 0.29624003038359287,
"grad_norm": 0.30078125,
"learning_rate": 0.00046722821470481706,
"loss": 2.9719078063964846,
"step": 390
},
{
"epoch": 0.3038359285985568,
"grad_norm": 0.291015625,
"learning_rate": 0.00046376182563179013,
"loss": 2.9487117767333983,
"step": 400
},
{
"epoch": 0.3038359285985568,
"eval_loss": 3.0641255378723145,
"eval_runtime": 6.3681,
"eval_samples_per_second": 51.35,
"eval_steps_per_second": 1.727,
"step": 400
},
{
"epoch": 0.3114318268135207,
"grad_norm": 0.291015625,
"learning_rate": 0.0004601362427481912,
"loss": 2.9743417739868163,
"step": 410
},
{
"epoch": 0.31902772502848464,
"grad_norm": 0.29296875,
"learning_rate": 0.000456354333812737,
"loss": 2.9637521743774413,
"step": 420
},
{
"epoch": 0.3266236232434485,
"grad_norm": 0.298828125,
"learning_rate": 0.00045241909023471626,
"loss": 2.9459299087524413,
"step": 430
},
{
"epoch": 0.33421952145841244,
"grad_norm": 0.294921875,
"learning_rate": 0.000448333624707849,
"loss": 2.9349159240722655,
"step": 440
},
{
"epoch": 0.34181541967337636,
"grad_norm": 0.326171875,
"learning_rate": 0.00044410116874821204,
"loss": 2.939449119567871,
"step": 450
},
{
"epoch": 0.3494113178883403,
"grad_norm": 0.275390625,
"learning_rate": 0.00043972507013817876,
"loss": 2.923619270324707,
"step": 460
},
{
"epoch": 0.3570072161033042,
"grad_norm": 0.31640625,
"learning_rate": 0.0004352087902783947,
"loss": 2.923044967651367,
"step": 470
},
{
"epoch": 0.36460311431826814,
"grad_norm": 0.2578125,
"learning_rate": 0.00043055590144988365,
"loss": 2.921802520751953,
"step": 480
},
{
"epoch": 0.37219901253323207,
"grad_norm": 0.328125,
"learning_rate": 0.0004257700839884492,
"loss": 2.9253984451293946,
"step": 490
},
{
"epoch": 0.379794910748196,
"grad_norm": 0.310546875,
"learning_rate": 0.0004208551233736077,
"loss": 2.910613441467285,
"step": 500
},
{
"epoch": 0.379794910748196,
"eval_loss": 3.0285699367523193,
"eval_runtime": 6.4137,
"eval_samples_per_second": 50.984,
"eval_steps_per_second": 1.715,
"step": 500
},
{
"epoch": 0.3873908089631599,
"grad_norm": 0.29296875,
"learning_rate": 0.00041581490723435527,
"loss": 2.9117815017700197,
"step": 510
},
{
"epoch": 0.3949867071781238,
"grad_norm": 0.2734375,
"learning_rate": 0.00041065342227413534,
"loss": 2.8861461639404298,
"step": 520
},
{
"epoch": 0.4025826053930877,
"grad_norm": 0.244140625,
"learning_rate": 0.00040537475111744196,
"loss": 2.918853759765625,
"step": 530
},
{
"epoch": 0.41017850360805164,
"grad_norm": 0.310546875,
"learning_rate": 0.00039998306908055066,
"loss": 2.8889438629150392,
"step": 540
},
{
"epoch": 0.41777440182301556,
"grad_norm": 0.2578125,
"learning_rate": 0.0003944826408689321,
"loss": 2.8760492324829103,
"step": 550
},
{
"epoch": 0.4253703000379795,
"grad_norm": 0.2470703125,
"learning_rate": 0.00038887781720396166,
"loss": 2.8791513442993164,
"step": 560
},
{
"epoch": 0.4329661982529434,
"grad_norm": 0.2578125,
"learning_rate": 0.000383173031381591,
"loss": 2.8855258941650392,
"step": 570
},
{
"epoch": 0.44056209646790734,
"grad_norm": 0.255859375,
"learning_rate": 0.0003773727957657058,
"loss": 2.868224334716797,
"step": 580
},
{
"epoch": 0.44815799468287126,
"grad_norm": 0.287109375,
"learning_rate": 0.0003714816982189424,
"loss": 2.871646690368652,
"step": 590
},
{
"epoch": 0.4557538928978352,
"grad_norm": 0.228515625,
"learning_rate": 0.00036550439847378576,
"loss": 2.8556640625,
"step": 600
},
{
"epoch": 0.4557538928978352,
"eval_loss": 2.9900174140930176,
"eval_runtime": 6.3879,
"eval_samples_per_second": 51.191,
"eval_steps_per_second": 1.722,
"step": 600
},
{
"epoch": 0.4633497911127991,
"grad_norm": 0.2578125,
"learning_rate": 0.00035944562444682114,
"loss": 2.8718791961669923,
"step": 610
},
{
"epoch": 0.470945689327763,
"grad_norm": 0.27734375,
"learning_rate": 0.0003533101684990526,
"loss": 2.8613565444946287,
"step": 620
},
{
"epoch": 0.4785415875427269,
"grad_norm": 0.265625,
"learning_rate": 0.0003471028836452474,
"loss": 2.8642951965332033,
"step": 630
},
{
"epoch": 0.48613748575769083,
"grad_norm": 0.236328125,
"learning_rate": 0.0003408286797153057,
"loss": 2.861553764343262,
"step": 640
},
{
"epoch": 0.49373338397265476,
"grad_norm": 0.2734375,
"learning_rate": 0.00033449251947068867,
"loss": 2.8493188858032226,
"step": 650
},
{
"epoch": 0.5013292821876187,
"grad_norm": 0.2578125,
"learning_rate": 0.00032809941467898114,
"loss": 2.846090316772461,
"step": 660
},
{
"epoch": 0.5089251804025826,
"grad_norm": 0.31640625,
"learning_rate": 0.0003216544221496897,
"loss": 2.8381746292114256,
"step": 670
},
{
"epoch": 0.5165210786175465,
"grad_norm": 0.2734375,
"learning_rate": 0.00031516263973441466,
"loss": 2.844132995605469,
"step": 680
},
{
"epoch": 0.5241169768325105,
"grad_norm": 0.240234375,
"learning_rate": 0.00030862920229455756,
"loss": 2.8329984664916994,
"step": 690
},
{
"epoch": 0.5317128750474743,
"grad_norm": 0.28125,
"learning_rate": 0.00030205927763975616,
"loss": 2.830152130126953,
"step": 700
},
{
"epoch": 0.5317128750474743,
"eval_loss": 2.963874578475952,
"eval_runtime": 6.3886,
"eval_samples_per_second": 51.185,
"eval_steps_per_second": 1.722,
"step": 700
},
{
"epoch": 0.5393087732624383,
"grad_norm": 0.27734375,
"learning_rate": 0.0002954580624402567,
"loss": 2.8245569229125977,
"step": 710
},
{
"epoch": 0.5469046714774022,
"grad_norm": 0.21875,
"learning_rate": 0.00028883077811645876,
"loss": 2.84329776763916,
"step": 720
},
{
"epoch": 0.5545005696923662,
"grad_norm": 0.2392578125,
"learning_rate": 0.00028218266670888316,
"loss": 2.835365104675293,
"step": 730
},
{
"epoch": 0.56209646790733,
"grad_norm": 0.25,
"learning_rate": 0.0002755189867318296,
"loss": 2.809566116333008,
"step": 740
},
{
"epoch": 0.569692366122294,
"grad_norm": 0.2578125,
"learning_rate": 0.0002688450090140041,
"loss": 2.8277103424072267,
"step": 750
},
{
"epoch": 0.5772882643372579,
"grad_norm": 0.2392578125,
"learning_rate": 0.0002621660125294062,
"loss": 2.8039220809936523,
"step": 760
},
{
"epoch": 0.5848841625522218,
"grad_norm": 0.25390625,
"learning_rate": 0.0002554872802217726,
"loss": 2.8002191543579102,
"step": 770
},
{
"epoch": 0.5924800607671857,
"grad_norm": 0.23828125,
"learning_rate": 0.00024881409482588177,
"loss": 2.813232421875,
"step": 780
},
{
"epoch": 0.6000759589821496,
"grad_norm": 0.248046875,
"learning_rate": 0.00024215173468902332,
"loss": 2.8190376281738283,
"step": 790
},
{
"epoch": 0.6076718571971136,
"grad_norm": 0.216796875,
"learning_rate": 0.00023550546959593793,
"loss": 2.8102094650268556,
"step": 800
},
{
"epoch": 0.6076718571971136,
"eval_loss": 2.933663845062256,
"eval_runtime": 6.4064,
"eval_samples_per_second": 51.042,
"eval_steps_per_second": 1.717,
"step": 800
},
{
"epoch": 0.6152677554120775,
"grad_norm": 0.2197265625,
"learning_rate": 0.00022888055660052993,
"loss": 2.7970836639404295,
"step": 810
},
{
"epoch": 0.6228636536270414,
"grad_norm": 0.21484375,
"learning_rate": 0.0002222822358676499,
"loss": 2.8055255889892576,
"step": 820
},
{
"epoch": 0.6304595518420053,
"grad_norm": 0.2275390625,
"learning_rate": 0.00021571572652823615,
"loss": 2.793012809753418,
"step": 830
},
{
"epoch": 0.6380554500569693,
"grad_norm": 0.212890625,
"learning_rate": 0.00020918622255109334,
"loss": 2.7924644470214846,
"step": 840
},
{
"epoch": 0.6456513482719332,
"grad_norm": 0.21484375,
"learning_rate": 0.000202698888634574,
"loss": 2.7925525665283204,
"step": 850
},
{
"epoch": 0.653247246486897,
"grad_norm": 0.2099609375,
"learning_rate": 0.00019625885612141222,
"loss": 2.7974515914916993,
"step": 860
},
{
"epoch": 0.660843144701861,
"grad_norm": 0.2353515625,
"learning_rate": 0.00018987121893994128,
"loss": 2.794886016845703,
"step": 870
},
{
"epoch": 0.6684390429168249,
"grad_norm": 0.1962890625,
"learning_rate": 0.00018354102957490476,
"loss": 2.77576904296875,
"step": 880
},
{
"epoch": 0.6760349411317889,
"grad_norm": 0.1865234375,
"learning_rate": 0.00017727329507104896,
"loss": 2.781934356689453,
"step": 890
},
{
"epoch": 0.6836308393467527,
"grad_norm": 0.1982421875,
"learning_rate": 0.00017107297307265726,
"loss": 2.775553894042969,
"step": 900
},
{
"epoch": 0.6836308393467527,
"eval_loss": 2.9109058380126953,
"eval_runtime": 6.3905,
"eval_samples_per_second": 51.17,
"eval_steps_per_second": 1.721,
"step": 900
},
{
"epoch": 0.6912267375617167,
"grad_norm": 0.1787109375,
"learning_rate": 0.0001649449679021595,
"loss": 2.780860710144043,
"step": 910
},
{
"epoch": 0.6988226357766806,
"grad_norm": 0.203125,
"learning_rate": 0.00015889412668091725,
"loss": 2.7567111968994142,
"step": 920
},
{
"epoch": 0.7064185339916446,
"grad_norm": 0.2109375,
"learning_rate": 0.00015292523549525436,
"loss": 2.771552085876465,
"step": 930
},
{
"epoch": 0.7140144322066084,
"grad_norm": 0.2236328125,
"learning_rate": 0.00014704301561076487,
"loss": 2.7714685440063476,
"step": 940
},
{
"epoch": 0.7216103304215723,
"grad_norm": 0.208984375,
"learning_rate": 0.00014125211973789242,
"loss": 2.7673364639282227,
"step": 950
},
{
"epoch": 0.7292062286365363,
"grad_norm": 0.197265625,
"learning_rate": 0.00013555712835173575,
"loss": 2.7799705505371093,
"step": 960
},
{
"epoch": 0.7368021268515001,
"grad_norm": 0.1982421875,
"learning_rate": 0.00012996254606899047,
"loss": 2.778921699523926,
"step": 970
},
{
"epoch": 0.7443980250664641,
"grad_norm": 0.2060546875,
"learning_rate": 0.0001244727980848934,
"loss": 2.767135810852051,
"step": 980
},
{
"epoch": 0.751993923281428,
"grad_norm": 0.185546875,
"learning_rate": 0.00011909222667298774,
"loss": 2.776322937011719,
"step": 990
},
{
"epoch": 0.759589821496392,
"grad_norm": 0.1787109375,
"learning_rate": 0.00011382508775047693,
"loss": 2.767734336853027,
"step": 1000
},
{
"epoch": 0.759589821496392,
"eval_loss": 2.8951478004455566,
"eval_runtime": 6.4384,
"eval_samples_per_second": 50.789,
"eval_steps_per_second": 1.709,
"step": 1000
},
{
"epoch": 0.7671857197113559,
"grad_norm": 0.1826171875,
"learning_rate": 0.00010867554751188518,
"loss": 2.762259674072266,
"step": 1010
},
{
"epoch": 0.7747816179263198,
"grad_norm": 0.16796875,
"learning_rate": 0.00010364767913368654,
"loss": 2.768287467956543,
"step": 1020
},
{
"epoch": 0.7823775161412837,
"grad_norm": 0.1748046875,
"learning_rate": 9.874545955250897e-05,
"loss": 2.765730857849121,
"step": 1030
},
{
"epoch": 0.7899734143562476,
"grad_norm": 0.185546875,
"learning_rate": 9.397276631946256e-05,
"loss": 2.7567041397094725,
"step": 1040
},
{
"epoch": 0.7975693125712116,
"grad_norm": 0.1806640625,
"learning_rate": 8.933337453307916e-05,
"loss": 2.746847152709961,
"step": 1050
},
{
"epoch": 0.8051652107861754,
"grad_norm": 0.177734375,
"learning_rate": 8.483095385328999e-05,
"loss": 2.747633361816406,
"step": 1060
},
{
"epoch": 0.8127611090011394,
"grad_norm": 0.189453125,
"learning_rate": 8.046906559880302e-05,
"loss": 2.7606531143188477,
"step": 1070
},
{
"epoch": 0.8203570072161033,
"grad_norm": 0.1865234375,
"learning_rate": 7.625115993017566e-05,
"loss": 2.758637619018555,
"step": 1080
},
{
"epoch": 0.8279529054310673,
"grad_norm": 0.1806640625,
"learning_rate": 7.218057312081155e-05,
"loss": 2.761465644836426,
"step": 1090
},
{
"epoch": 0.8355488036460311,
"grad_norm": 0.1708984375,
"learning_rate": 6.826052491803939e-05,
"loss": 2.7564212799072267,
"step": 1100
},
{
"epoch": 0.8355488036460311,
"eval_loss": 2.88885760307312,
"eval_runtime": 6.3901,
"eval_samples_per_second": 51.173,
"eval_steps_per_second": 1.721,
"step": 1100
},
{
"epoch": 0.8431447018609951,
"grad_norm": 0.166015625,
"learning_rate": 6.449411599636155e-05,
"loss": 2.747487258911133,
"step": 1110
},
{
"epoch": 0.850740600075959,
"grad_norm": 0.1669921875,
"learning_rate": 6.0884325504886556e-05,
"loss": 2.7676666259765623,
"step": 1120
},
{
"epoch": 0.858336498290923,
"grad_norm": 0.1728515625,
"learning_rate": 5.743400871088574e-05,
"loss": 2.7493162155151367,
"step": 1130
},
{
"epoch": 0.8659323965058868,
"grad_norm": 0.1630859375,
"learning_rate": 5.414589474133783e-05,
"loss": 2.7586923599243165,
"step": 1140
},
{
"epoch": 0.8735282947208507,
"grad_norm": 0.169921875,
"learning_rate": 5.1022584424247705e-05,
"loss": 2.7609556198120115,
"step": 1150
},
{
"epoch": 0.8811241929358147,
"grad_norm": 0.1630859375,
"learning_rate": 4.8066548231446775e-05,
"loss": 2.7444868087768555,
"step": 1160
},
{
"epoch": 0.8887200911507785,
"grad_norm": 0.169921875,
"learning_rate": 4.528012432450273e-05,
"loss": 2.750021553039551,
"step": 1170
},
{
"epoch": 0.8963159893657425,
"grad_norm": 0.1640625,
"learning_rate": 4.266551670528335e-05,
"loss": 2.768070411682129,
"step": 1180
},
{
"epoch": 0.9039118875807064,
"grad_norm": 0.162109375,
"learning_rate": 4.0224793472638234e-05,
"loss": 2.7698774337768555,
"step": 1190
},
{
"epoch": 0.9115077857956704,
"grad_norm": 0.16015625,
"learning_rate": 3.7959885186576626e-05,
"loss": 2.7517560958862304,
"step": 1200
},
{
"epoch": 0.9115077857956704,
"eval_loss": 2.8854928016662598,
"eval_runtime": 6.4263,
"eval_samples_per_second": 50.885,
"eval_steps_per_second": 1.712,
"step": 1200
},
{
"epoch": 0.9191036840106342,
"grad_norm": 0.1669921875,
"learning_rate": 3.5872583341235727e-05,
"loss": 2.761515235900879,
"step": 1210
},
{
"epoch": 0.9266995822255982,
"grad_norm": 0.166015625,
"learning_rate": 3.3964538947846945e-05,
"loss": 2.7607538223266603,
"step": 1220
},
{
"epoch": 0.9342954804405621,
"grad_norm": 0.171875,
"learning_rate": 3.223726122882127e-05,
"loss": 2.74609375,
"step": 1230
},
{
"epoch": 0.941891378655526,
"grad_norm": 0.162109375,
"learning_rate": 3.069211642398656e-05,
"loss": 2.7672258377075196,
"step": 1240
},
{
"epoch": 0.94948727687049,
"grad_norm": 0.15625,
"learning_rate": 2.9330326709921017e-05,
"loss": 2.750092697143555,
"step": 1250
},
{
"epoch": 0.9570831750854538,
"grad_norm": 0.1552734375,
"learning_rate": 2.8152969233237523e-05,
"loss": 2.739312934875488,
"step": 1260
},
{
"epoch": 0.9646790733004178,
"grad_norm": 0.1708984375,
"learning_rate": 2.7160975258583626e-05,
"loss": 2.7647802352905275,
"step": 1270
},
{
"epoch": 0.9722749715153817,
"grad_norm": 0.162109375,
"learning_rate": 2.6355129432031147e-05,
"loss": 2.74219970703125,
"step": 1280
},
{
"epoch": 0.9798708697303457,
"grad_norm": 0.15625,
"learning_rate": 2.5736069160437846e-05,
"loss": 2.751408576965332,
"step": 1290
},
{
"epoch": 0.9874667679453095,
"grad_norm": 0.162109375,
"learning_rate": 2.5304284107272224e-05,
"loss": 2.748354911804199,
"step": 1300
},
{
"epoch": 0.9874667679453095,
"eval_loss": 2.884568452835083,
"eval_runtime": 6.3925,
"eval_samples_per_second": 51.154,
"eval_steps_per_second": 1.721,
"step": 1300
},
{
"epoch": 0.9950626661602735,
"grad_norm": 0.1591796875,
"learning_rate": 2.5060115805300056e-05,
"loss": 2.7556131362915037,
"step": 1310
},
{
"epoch": 1.0,
"eval_loss": 2.884584665298462,
"eval_runtime": 6.2983,
"eval_samples_per_second": 51.919,
"eval_steps_per_second": 1.747,
"step": 1317
},
{
"epoch": 0.04552666068841829,
"grad_norm": 8.5625,
"learning_rate": 0.0004995606766654085,
"loss": 3.94569460550944,
"step": 1320
},
{
"epoch": 0.045871559633027525,
"grad_norm": 0.4375,
"learning_rate": 0.0004995527919860256,
"loss": 3.688318634033203,
"step": 1330
},
{
"epoch": 0.04621645857763675,
"grad_norm": 0.267578125,
"learning_rate": 0.0004995448372467478,
"loss": 3.4252037048339843,
"step": 1340
},
{
"epoch": 0.04656135752224598,
"grad_norm": 0.279296875,
"learning_rate": 0.0004995368124499263,
"loss": 3.3581897735595705,
"step": 1350
},
{
"epoch": 0.046906256466855215,
"grad_norm": 0.267578125,
"learning_rate": 0.0004995287175979324,
"loss": 3.306211471557617,
"step": 1360
},
{
"epoch": 0.04725115541146444,
"grad_norm": 0.24609375,
"learning_rate": 0.0004995205526931589,
"loss": 3.3056015014648437,
"step": 1370
},
{
"epoch": 0.04759605435607367,
"grad_norm": 0.2451171875,
"learning_rate": 0.0004995123177380185,
"loss": 3.2437950134277345,
"step": 1380
},
{
"epoch": 0.0479409533006829,
"grad_norm": 0.279296875,
"learning_rate": 0.0004995040127349455,
"loss": 3.2430068969726564,
"step": 1390
},
{
"epoch": 0.04828585224529213,
"grad_norm": 0.283203125,
"learning_rate": 0.0004994956376863939,
"loss": 3.2402618408203123,
"step": 1400
},
{
"epoch": 0.04828585224529213,
"eval_loss": 3.1775357723236084,
"eval_runtime": 6.7497,
"eval_samples_per_second": 48.447,
"eval_steps_per_second": 1.63,
"step": 1400
},
{
"epoch": 0.04863075118990136,
"grad_norm": 0.30859375,
"learning_rate": 0.0004994871925948393,
"loss": 3.22863883972168,
"step": 1410
},
{
"epoch": 0.048975650134510586,
"grad_norm": 0.2451171875,
"learning_rate": 0.0004994786774627774,
"loss": 3.2331768035888673,
"step": 1420
},
{
"epoch": 0.04932054907911982,
"grad_norm": 0.244140625,
"learning_rate": 0.0004994700922927248,
"loss": 3.1989618301391602,
"step": 1430
},
{
"epoch": 0.04966544802372905,
"grad_norm": 0.263671875,
"learning_rate": 0.0004994614370872189,
"loss": 3.168655204772949,
"step": 1440
},
{
"epoch": 0.050010346968338275,
"grad_norm": 0.275390625,
"learning_rate": 0.0004994527118488177,
"loss": 3.2157833099365236,
"step": 1450
},
{
"epoch": 0.05035524591294751,
"grad_norm": 0.255859375,
"learning_rate": 0.0004994439165800999,
"loss": 3.186210060119629,
"step": 1460
},
{
"epoch": 0.050700144857556736,
"grad_norm": 0.28125,
"learning_rate": 0.0004994350512836648,
"loss": 3.1895734786987306,
"step": 1470
},
{
"epoch": 0.051045043802165964,
"grad_norm": 0.2314453125,
"learning_rate": 0.0004994261159621327,
"loss": 3.1697080612182615,
"step": 1480
},
{
"epoch": 0.0513899427467752,
"grad_norm": 0.275390625,
"learning_rate": 0.0004994171106181441,
"loss": 3.1745536804199217,
"step": 1490
},
{
"epoch": 0.051734841691384426,
"grad_norm": 0.255859375,
"learning_rate": 0.0004994080352543608,
"loss": 3.1699466705322266,
"step": 1500
},
{
"epoch": 0.051734841691384426,
"eval_loss": 3.178737163543701,
"eval_runtime": 6.7276,
"eval_samples_per_second": 48.606,
"eval_steps_per_second": 1.635,
"step": 1500
},
{
"epoch": 0.05207974063599365,
"grad_norm": 0.265625,
"learning_rate": 0.0004993988898734648,
"loss": 3.1477949142456056,
"step": 1510
},
{
"epoch": 0.05242463958060288,
"grad_norm": 0.296875,
"learning_rate": 0.000499389674478159,
"loss": 3.176782989501953,
"step": 1520
},
{
"epoch": 0.052769538525212115,
"grad_norm": 0.271484375,
"learning_rate": 0.000499380389071167,
"loss": 3.1550008773803713,
"step": 1530
},
{
"epoch": 0.05311443746982134,
"grad_norm": 0.283203125,
"learning_rate": 0.0004993710336552331,
"loss": 3.16734619140625,
"step": 1540
},
{
"epoch": 0.05345933641443057,
"grad_norm": 0.29296875,
"learning_rate": 0.0004993616082331221,
"loss": 3.117188835144043,
"step": 1550
},
{
"epoch": 0.053804235359039804,
"grad_norm": 0.265625,
"learning_rate": 0.0004993521128076199,
"loss": 3.1880640029907226,
"step": 1560
},
{
"epoch": 0.05414913430364903,
"grad_norm": 0.23046875,
"learning_rate": 0.0004993425473815325,
"loss": 3.1521093368530275,
"step": 1570
},
{
"epoch": 0.05449403324825826,
"grad_norm": 0.263671875,
"learning_rate": 0.0004993329119576872,
"loss": 3.1449941635131835,
"step": 1580
},
{
"epoch": 0.05483893219286749,
"grad_norm": 0.267578125,
"learning_rate": 0.0004993232065389315,
"loss": 3.164867401123047,
"step": 1590
},
{
"epoch": 0.05518383113747672,
"grad_norm": 0.333984375,
"learning_rate": 0.0004993134311281341,
"loss": 3.1254270553588865,
"step": 1600
},
{
"epoch": 0.05518383113747672,
"eval_loss": 3.1886394023895264,
"eval_runtime": 6.7151,
"eval_samples_per_second": 48.696,
"eval_steps_per_second": 1.638,
"step": 1600
},
{
"epoch": 0.05552873008208595,
"grad_norm": 0.28125,
"learning_rate": 0.0004993035857281838,
"loss": 3.158915901184082,
"step": 1610
},
{
"epoch": 0.055873629026695175,
"grad_norm": 0.255859375,
"learning_rate": 0.0004992936703419904,
"loss": 3.1532636642456056,
"step": 1620
},
{
"epoch": 0.05621852797130441,
"grad_norm": 0.2578125,
"learning_rate": 0.0004992836849724843,
"loss": 3.1459360122680664,
"step": 1630
},
{
"epoch": 0.05656342691591364,
"grad_norm": 0.263671875,
"learning_rate": 0.0004992736296226168,
"loss": 3.1383129119873048,
"step": 1640
},
{
"epoch": 0.056908325860522864,
"grad_norm": 0.240234375,
"learning_rate": 0.0004992635042953597,
"loss": 3.1324377059936523,
"step": 1650
},
{
"epoch": 0.0572532248051321,
"grad_norm": 0.2431640625,
"learning_rate": 0.0004992533089937053,
"loss": 3.164575958251953,
"step": 1660
},
{
"epoch": 0.057598123749741326,
"grad_norm": 0.283203125,
"learning_rate": 0.000499243043720667,
"loss": 3.15883846282959,
"step": 1670
},
{
"epoch": 0.05794302269435055,
"grad_norm": 0.28125,
"learning_rate": 0.0004992327084792785,
"loss": 3.123383140563965,
"step": 1680
},
{
"epoch": 0.05828792163895979,
"grad_norm": 0.2431640625,
"learning_rate": 0.0004992223032725944,
"loss": 3.1440086364746094,
"step": 1690
},
{
"epoch": 0.058632820583569015,
"grad_norm": 0.216796875,
"learning_rate": 0.00049921182810369,
"loss": 3.112078857421875,
"step": 1700
},
{
"epoch": 0.058632820583569015,
"eval_loss": 3.211069345474243,
"eval_runtime": 6.7281,
"eval_samples_per_second": 48.602,
"eval_steps_per_second": 1.635,
"step": 1700
},
{
"epoch": 0.05897771952817824,
"grad_norm": 0.2412109375,
"learning_rate": 0.0004992012829756609,
"loss": 3.171876335144043,
"step": 1710
},
{
"epoch": 0.059322618472787476,
"grad_norm": 0.2314453125,
"learning_rate": 0.000499190667891624,
"loss": 3.1190860748291014,
"step": 1720
},
{
"epoch": 0.059667517417396704,
"grad_norm": 0.216796875,
"learning_rate": 0.0004991799828547164,
"loss": 3.1243335723876955,
"step": 1730
},
{
"epoch": 0.06001241636200593,
"grad_norm": 0.2314453125,
"learning_rate": 0.000499169227868096,
"loss": 3.105545234680176,
"step": 1740
},
{
"epoch": 0.06035731530661516,
"grad_norm": 0.2197265625,
"learning_rate": 0.0004991584029349413,
"loss": 3.104082489013672,
"step": 1750
},
{
"epoch": 0.06070221425122439,
"grad_norm": 0.2578125,
"learning_rate": 0.0004991475080584518,
"loss": 3.1014020919799803,
"step": 1760
},
{
"epoch": 0.06104711319583362,
"grad_norm": 0.2353515625,
"learning_rate": 0.0004991365432418472,
"loss": 3.1070577621459963,
"step": 1770
},
{
"epoch": 0.06139201214044285,
"grad_norm": 0.224609375,
"learning_rate": 0.0004991255084883683,
"loss": 3.12465763092041,
"step": 1780
},
{
"epoch": 0.06173691108505208,
"grad_norm": 0.294921875,
"learning_rate": 0.0004991144038012762,
"loss": 3.110963249206543,
"step": 1790
},
{
"epoch": 0.06208181002966131,
"grad_norm": 0.265625,
"learning_rate": 0.000499103229183853,
"loss": 3.1210065841674806,
"step": 1800
},
{
"epoch": 0.06208181002966131,
"eval_loss": 3.2403862476348877,
"eval_runtime": 6.8085,
"eval_samples_per_second": 48.028,
"eval_steps_per_second": 1.616,
"step": 1800
},
{
"epoch": 0.06242670897427054,
"grad_norm": 0.2421875,
"learning_rate": 0.0004990919846394012,
"loss": 3.111033058166504,
"step": 1810
},
{
"epoch": 0.06277160791887977,
"grad_norm": 0.244140625,
"learning_rate": 0.000499080670171244,
"loss": 3.0953065872192385,
"step": 1820
},
{
"epoch": 0.06311650686348899,
"grad_norm": 0.2373046875,
"learning_rate": 0.0004990692857827254,
"loss": 3.094102478027344,
"step": 1830
},
{
"epoch": 0.06346140580809823,
"grad_norm": 0.244140625,
"learning_rate": 0.0004990578314772101,
"loss": 3.1337677001953126,
"step": 1840
},
{
"epoch": 0.06380630475270746,
"grad_norm": 0.2490234375,
"learning_rate": 0.0004990463072580834,
"loss": 3.075612258911133,
"step": 1850
},
{
"epoch": 0.06415120369731668,
"grad_norm": 0.251953125,
"learning_rate": 0.000499034713128751,
"loss": 3.121097755432129,
"step": 1860
},
{
"epoch": 0.06449610264192591,
"grad_norm": 0.28515625,
"learning_rate": 0.0004990230490926398,
"loss": 3.1022356033325194,
"step": 1870
},
{
"epoch": 0.06484100158653515,
"grad_norm": 0.251953125,
"learning_rate": 0.0004990113151531968,
"loss": 3.106301116943359,
"step": 1880
},
{
"epoch": 0.06518590053114437,
"grad_norm": 0.22265625,
"learning_rate": 0.00049899951131389,
"loss": 3.0839033126831055,
"step": 1890
},
{
"epoch": 0.0655307994757536,
"grad_norm": 0.255859375,
"learning_rate": 0.0004989876375782079,
"loss": 3.116221618652344,
"step": 1900
},
{
"epoch": 0.0655307994757536,
"eval_loss": 3.2191734313964844,
"eval_runtime": 6.7393,
"eval_samples_per_second": 48.522,
"eval_steps_per_second": 1.632,
"step": 1900
},
{
"epoch": 0.06587569842036284,
"grad_norm": 0.2197265625,
"learning_rate": 0.00049897569394966,
"loss": 3.105671501159668,
"step": 1910
},
{
"epoch": 0.06622059736497206,
"grad_norm": 0.244140625,
"learning_rate": 0.0004989636804317758,
"loss": 3.0686840057373046,
"step": 1920
},
{
"epoch": 0.06656549630958129,
"grad_norm": 0.251953125,
"learning_rate": 0.0004989515970281061,
"loss": 3.1332202911376954,
"step": 1930
},
{
"epoch": 0.06691039525419053,
"grad_norm": 0.2373046875,
"learning_rate": 0.000498939443742222,
"loss": 3.108740043640137,
"step": 1940
},
{
"epoch": 0.06725529419879975,
"grad_norm": 0.2431640625,
"learning_rate": 0.0004989272205777154,
"loss": 3.076454925537109,
"step": 1950
},
{
"epoch": 0.06760019314340898,
"grad_norm": 0.2431640625,
"learning_rate": 0.0004989149275381987,
"loss": 3.068858337402344,
"step": 1960
},
{
"epoch": 0.06794509208801822,
"grad_norm": 0.30078125,
"learning_rate": 0.0004989025646273054,
"loss": 3.072835922241211,
"step": 1970
},
{
"epoch": 0.06828999103262744,
"grad_norm": 0.224609375,
"learning_rate": 0.0004988901318486889,
"loss": 3.0758934020996094,
"step": 1980
},
{
"epoch": 0.06863488997723667,
"grad_norm": 0.2373046875,
"learning_rate": 0.0004988776292060235,
"loss": 3.069691848754883,
"step": 1990
},
{
"epoch": 0.0689797889218459,
"grad_norm": 0.25,
"learning_rate": 0.000498865056703005,
"loss": 3.071276092529297,
"step": 2000
},
{
"epoch": 0.0689797889218459,
"eval_loss": 3.195521593093872,
"eval_runtime": 6.7353,
"eval_samples_per_second": 48.55,
"eval_steps_per_second": 1.633,
"step": 2000
},
{
"epoch": 0.06932468786645513,
"grad_norm": 0.23828125,
"learning_rate": 0.0004988524143433485,
"loss": 3.095376205444336,
"step": 2010
},
{
"epoch": 0.06966958681106436,
"grad_norm": 0.240234375,
"learning_rate": 0.0004988397021307906,
"loss": 3.0992828369140626,
"step": 2020
},
{
"epoch": 0.0700144857556736,
"grad_norm": 0.2578125,
"learning_rate": 0.0004988269200690886,
"loss": 3.0559410095214843,
"step": 2030
},
{
"epoch": 0.07035938470028281,
"grad_norm": 0.248046875,
"learning_rate": 0.0004988140681620196,
"loss": 3.0838075637817384,
"step": 2040
},
{
"epoch": 0.07070428364489205,
"grad_norm": 0.2421875,
"learning_rate": 0.0004988011464133826,
"loss": 3.0631616592407225,
"step": 2050
},
{
"epoch": 0.07104918258950127,
"grad_norm": 0.220703125,
"learning_rate": 0.0004987881548269961,
"loss": 3.130056953430176,
"step": 2060
},
{
"epoch": 0.0713940815341105,
"grad_norm": 0.23828125,
"learning_rate": 0.0004987750934066998,
"loss": 3.1007272720336916,
"step": 2070
},
{
"epoch": 0.07173898047871974,
"grad_norm": 0.2294921875,
"learning_rate": 0.0004987619621563541,
"loss": 3.115607261657715,
"step": 2080
},
{
"epoch": 0.07208387942332896,
"grad_norm": 0.2177734375,
"learning_rate": 0.0004987487610798396,
"loss": 3.0787405014038085,
"step": 2090
},
{
"epoch": 0.07242877836793819,
"grad_norm": 0.212890625,
"learning_rate": 0.0004987354901810581,
"loss": 3.0954341888427734,
"step": 2100
},
{
"epoch": 0.07242877836793819,
"eval_loss": 3.2088491916656494,
"eval_runtime": 6.7313,
"eval_samples_per_second": 48.579,
"eval_steps_per_second": 1.634,
"step": 2100
},
{
"epoch": 0.07277367731254743,
"grad_norm": 0.2451171875,
"learning_rate": 0.0004987221494639316,
"loss": 3.0991601943969727,
"step": 2110
},
{
"epoch": 0.07311857625715665,
"grad_norm": 0.236328125,
"learning_rate": 0.000498708738932403,
"loss": 3.0792991638183596,
"step": 2120
},
{
"epoch": 0.07346347520176588,
"grad_norm": 0.2392578125,
"learning_rate": 0.0004986952585904356,
"loss": 3.063749885559082,
"step": 2130
},
{
"epoch": 0.07380837414637512,
"grad_norm": 0.2333984375,
"learning_rate": 0.0004986817084420136,
"loss": 3.064266395568848,
"step": 2140
},
{
"epoch": 0.07415327309098434,
"grad_norm": 0.232421875,
"learning_rate": 0.0004986680884911415,
"loss": 3.0542619705200194,
"step": 2150
},
{
"epoch": 0.07449817203559357,
"grad_norm": 0.236328125,
"learning_rate": 0.0004986543987418446,
"loss": 3.0570451736450197,
"step": 2160
},
{
"epoch": 0.0748430709802028,
"grad_norm": 0.2294921875,
"learning_rate": 0.0004986406391981692,
"loss": 3.0890731811523438,
"step": 2170
},
{
"epoch": 0.07518796992481203,
"grad_norm": 0.2470703125,
"learning_rate": 0.0004986268098641814,
"loss": 3.0486711502075194,
"step": 2180
},
{
"epoch": 0.07553286886942126,
"grad_norm": 0.267578125,
"learning_rate": 0.0004986129107439688,
"loss": 3.065072250366211,
"step": 2190
},
{
"epoch": 0.0758777678140305,
"grad_norm": 0.2177734375,
"learning_rate": 0.0004985989418416389,
"loss": 3.0860727310180662,
"step": 2200
},
{
"epoch": 0.0758777678140305,
"eval_loss": 3.2100729942321777,
"eval_runtime": 6.7308,
"eval_samples_per_second": 48.583,
"eval_steps_per_second": 1.634,
"step": 2200
},
{
"epoch": 0.07622266675863971,
"grad_norm": 0.259765625,
"learning_rate": 0.0004985849031613204,
"loss": 3.0380903244018556,
"step": 2210
},
{
"epoch": 0.07656756570324895,
"grad_norm": 0.2392578125,
"learning_rate": 0.0004985707947071623,
"loss": 3.094039535522461,
"step": 2220
},
{
"epoch": 0.07691246464785818,
"grad_norm": 0.23828125,
"learning_rate": 0.0004985566164833342,
"loss": 3.078387451171875,
"step": 2230
},
{
"epoch": 0.0772573635924674,
"grad_norm": 0.232421875,
"learning_rate": 0.0004985423684940263,
"loss": 3.0869937896728517,
"step": 2240
},
{
"epoch": 0.07760226253707664,
"grad_norm": 0.21875,
"learning_rate": 0.00049852805074345,
"loss": 3.0973333358764648,
"step": 2250
},
{
"epoch": 0.07794716148168587,
"grad_norm": 0.291015625,
"learning_rate": 0.0004985136632358363,
"loss": 3.063151168823242,
"step": 2260
},
{
"epoch": 0.0782920604262951,
"grad_norm": 0.2451171875,
"learning_rate": 0.0004984992059754378,
"loss": 3.056650733947754,
"step": 2270
},
{
"epoch": 0.07863695937090433,
"grad_norm": 0.2353515625,
"learning_rate": 0.0004984846789665269,
"loss": 3.066288375854492,
"step": 2280
},
{
"epoch": 0.07898185831551355,
"grad_norm": 0.2333984375,
"learning_rate": 0.0004984700822133972,
"loss": 3.03564510345459,
"step": 2290
},
{
"epoch": 0.07932675726012278,
"grad_norm": 0.224609375,
"learning_rate": 0.0004984554157203628,
"loss": 3.049472618103027,
"step": 2300
},
{
"epoch": 0.07932675726012278,
"eval_loss": 3.1962928771972656,
"eval_runtime": 6.7335,
"eval_samples_per_second": 48.563,
"eval_steps_per_second": 1.634,
"step": 2300
},
{
"epoch": 0.07967165620473202,
"grad_norm": 0.2080078125,
"learning_rate": 0.0004984406794917581,
"loss": 3.0810522079467773,
"step": 2310
},
{
"epoch": 0.08001655514934124,
"grad_norm": 0.23828125,
"learning_rate": 0.0004984258735319384,
"loss": 3.054339790344238,
"step": 2320
},
{
"epoch": 0.08036145409395047,
"grad_norm": 0.2255859375,
"learning_rate": 0.0004984109978452797,
"loss": 3.071099281311035,
"step": 2330
},
{
"epoch": 0.0807063530385597,
"grad_norm": 0.224609375,
"learning_rate": 0.0004983960524361782,
"loss": 3.032479476928711,
"step": 2340
},
{
"epoch": 0.08105125198316893,
"grad_norm": 0.20703125,
"learning_rate": 0.0004983810373090511,
"loss": 3.066059875488281,
"step": 2350
},
{
"epoch": 0.08139615092777816,
"grad_norm": 0.25,
"learning_rate": 0.000498365952468336,
"loss": 3.063777542114258,
"step": 2360
},
{
"epoch": 0.0817410498723874,
"grad_norm": 0.2177734375,
"learning_rate": 0.0004983507979184911,
"loss": 3.063796806335449,
"step": 2370
},
{
"epoch": 0.08208594881699662,
"grad_norm": 0.248046875,
"learning_rate": 0.0004983355736639955,
"loss": 3.021498107910156,
"step": 2380
},
{
"epoch": 0.08243084776160585,
"grad_norm": 0.28125,
"learning_rate": 0.0004983202797093483,
"loss": 3.0589014053344727,
"step": 2390
},
{
"epoch": 0.08277574670621508,
"grad_norm": 0.23828125,
"learning_rate": 0.0004983049160590698,
"loss": 3.033548355102539,
"step": 2400
},
{
"epoch": 0.08277574670621508,
"eval_loss": 3.197201728820801,
"eval_runtime": 6.8331,
"eval_samples_per_second": 47.855,
"eval_steps_per_second": 1.61,
"step": 2400
},
{
"epoch": 0.0831206456508243,
"grad_norm": 0.2412109375,
"learning_rate": 0.0004982894827177006,
"loss": 3.038789749145508,
"step": 2410
},
{
"epoch": 0.08346554459543354,
"grad_norm": 0.2099609375,
"learning_rate": 0.000498273979689802,
"loss": 3.0522674560546874,
"step": 2420
},
{
"epoch": 0.08381044354004277,
"grad_norm": 0.291015625,
"learning_rate": 0.0004982584069799557,
"loss": 3.0577108383178713,
"step": 2430
},
{
"epoch": 0.084155342484652,
"grad_norm": 0.25,
"learning_rate": 0.0004982427645927644,
"loss": 3.0683292388916015,
"step": 2440
},
{
"epoch": 0.08450024142926123,
"grad_norm": 0.248046875,
"learning_rate": 0.0004982270525328509,
"loss": 3.0640302658081056,
"step": 2450
},
{
"epoch": 0.08484514037387046,
"grad_norm": 0.2431640625,
"learning_rate": 0.0004982112708048588,
"loss": 3.061013412475586,
"step": 2460
},
{
"epoch": 0.08519003931847968,
"grad_norm": 0.251953125,
"learning_rate": 0.0004981954194134526,
"loss": 3.0707763671875,
"step": 2470
},
{
"epoch": 0.08553493826308892,
"grad_norm": 0.2578125,
"learning_rate": 0.000498179498363317,
"loss": 3.0547483444213865,
"step": 2480
},
{
"epoch": 0.08587983720769815,
"grad_norm": 0.236328125,
"learning_rate": 0.0004981635076591573,
"loss": 3.0435951232910154,
"step": 2490
},
{
"epoch": 0.08622473615230737,
"grad_norm": 0.263671875,
"learning_rate": 0.0004981474473056994,
"loss": 3.091439628601074,
"step": 2500
},
{
"epoch": 0.08622473615230737,
"eval_loss": 3.1967952251434326,
"eval_runtime": 6.8075,
"eval_samples_per_second": 48.035,
"eval_steps_per_second": 1.616,
"step": 2500
},
{
"epoch": 0.0865696350969166,
"grad_norm": 0.2294921875,
"learning_rate": 0.00049813131730769,
"loss": 3.0426443099975584,
"step": 2510
},
{
"epoch": 0.08691453404152583,
"grad_norm": 0.265625,
"learning_rate": 0.0004981151176698963,
"loss": 3.080913543701172,
"step": 2520
},
{
"epoch": 0.08725943298613506,
"grad_norm": 0.2431640625,
"learning_rate": 0.000498098848397106,
"loss": 3.0481851577758787,
"step": 2530
},
{
"epoch": 0.0876043319307443,
"grad_norm": 0.232421875,
"learning_rate": 0.0004980825094941274,
"loss": 3.01617431640625,
"step": 2540
},
{
"epoch": 0.08794923087535352,
"grad_norm": 0.224609375,
"learning_rate": 0.0004980661009657894,
"loss": 3.0407470703125,
"step": 2550
},
{
"epoch": 0.08829412981996275,
"grad_norm": 0.2490234375,
"learning_rate": 0.0004980496228169413,
"loss": 3.0526084899902344,
"step": 2560
},
{
"epoch": 0.08863902876457198,
"grad_norm": 0.21875,
"learning_rate": 0.0004980330750524533,
"loss": 3.0630365371704102,
"step": 2570
},
{
"epoch": 0.0889839277091812,
"grad_norm": 0.220703125,
"learning_rate": 0.0004980164576772161,
"loss": 3.017895317077637,
"step": 2580
},
{
"epoch": 0.08932882665379044,
"grad_norm": 0.2373046875,
"learning_rate": 0.0004979997706961407,
"loss": 3.0463420867919924,
"step": 2590
},
{
"epoch": 0.08967372559839967,
"grad_norm": 0.251953125,
"learning_rate": 0.0004979830141141591,
"loss": 3.0082685470581056,
"step": 2600
},
{
"epoch": 0.08967372559839967,
"eval_loss": 3.186363935470581,
"eval_runtime": 6.7325,
"eval_samples_per_second": 48.57,
"eval_steps_per_second": 1.634,
"step": 2600
},
{
"epoch": 0.0900186245430089,
"grad_norm": 0.2421875,
"learning_rate": 0.0004979661879362233,
"loss": 3.026647758483887,
"step": 2610
},
{
"epoch": 0.09036352348761813,
"grad_norm": 0.255859375,
"learning_rate": 0.0004979492921673064,
"loss": 3.0578779220581054,
"step": 2620
},
{
"epoch": 0.09070842243222736,
"grad_norm": 0.25,
"learning_rate": 0.000497932326812402,
"loss": 3.0211202621459963,
"step": 2630
},
{
"epoch": 0.09105332137683658,
"grad_norm": 0.259765625,
"learning_rate": 0.0004979152918765239,
"loss": 3.0802417755126954,
"step": 2640
},
{
"epoch": 0.09139822032144582,
"grad_norm": 0.2314453125,
"learning_rate": 0.0004978981873647068,
"loss": 3.041337013244629,
"step": 2650
},
{
"epoch": 0.09174311926605505,
"grad_norm": 0.25390625,
"learning_rate": 0.0004978810132820059,
"loss": 3.0317039489746094,
"step": 2660
},
{
"epoch": 0.09208801821066427,
"grad_norm": 0.2333984375,
"learning_rate": 0.0004978637696334969,
"loss": 3.043722915649414,
"step": 2670
},
{
"epoch": 0.0924329171552735,
"grad_norm": 0.220703125,
"learning_rate": 0.0004978464564242759,
"loss": 3.0568105697631838,
"step": 2680
},
{
"epoch": 0.09277781609988274,
"grad_norm": 0.2236328125,
"learning_rate": 0.0004978290736594599,
"loss": 3.0359878540039062,
"step": 2690
},
{
"epoch": 0.09312271504449196,
"grad_norm": 0.2275390625,
"learning_rate": 0.0004978116213441864,
"loss": 2.9945466995239256,
"step": 2700
},
{
"epoch": 0.09312271504449196,
"eval_loss": 3.198932409286499,
"eval_runtime": 6.7314,
"eval_samples_per_second": 48.579,
"eval_steps_per_second": 1.634,
"step": 2700
},
{
"epoch": 0.0934676139891012,
"grad_norm": 0.2255859375,
"learning_rate": 0.0004977940994836133,
"loss": 3.0619199752807615,
"step": 2710
},
{
"epoch": 0.09381251293371043,
"grad_norm": 0.248046875,
"learning_rate": 0.0004977765080829191,
"loss": 3.055706787109375,
"step": 2720
},
{
"epoch": 0.09415741187831965,
"grad_norm": 0.2373046875,
"learning_rate": 0.0004977588471473026,
"loss": 3.0402034759521483,
"step": 2730
},
{
"epoch": 0.09450231082292888,
"grad_norm": 0.2236328125,
"learning_rate": 0.0004977411166819837,
"loss": 3.0405792236328124,
"step": 2740
},
{
"epoch": 0.09484720976753812,
"grad_norm": 0.212890625,
"learning_rate": 0.0004977233166922026,
"loss": 3.0502443313598633,
"step": 2750
},
{
"epoch": 0.09519210871214734,
"grad_norm": 0.234375,
"learning_rate": 0.0004977054471832199,
"loss": 3.0309206008911134,
"step": 2760
},
{
"epoch": 0.09553700765675657,
"grad_norm": 0.23828125,
"learning_rate": 0.0004976875081603168,
"loss": 3.0458982467651365,
"step": 2770
},
{
"epoch": 0.0958819066013658,
"grad_norm": 0.21875,
"learning_rate": 0.0004976694996287951,
"loss": 3.0382736206054686,
"step": 2780
},
{
"epoch": 0.09622680554597503,
"grad_norm": 0.2138671875,
"learning_rate": 0.0004976514215939773,
"loss": 3.0607757568359375,
"step": 2790
},
{
"epoch": 0.09657170449058426,
"grad_norm": 0.26171875,
"learning_rate": 0.0004976332740612061,
"loss": 3.040727424621582,
"step": 2800
},
{
"epoch": 0.09657170449058426,
"eval_loss": 3.1886744499206543,
"eval_runtime": 6.7372,
"eval_samples_per_second": 48.536,
"eval_steps_per_second": 1.633,
"step": 2800
},
{
"epoch": 0.09691660343519348,
"grad_norm": 0.2216796875,
"learning_rate": 0.0004976150570358451,
"loss": 3.071457862854004,
"step": 2810
},
{
"epoch": 0.09726150237980272,
"grad_norm": 0.2314453125,
"learning_rate": 0.000497596770523278,
"loss": 3.0482696533203124,
"step": 2820
},
{
"epoch": 0.09760640132441195,
"grad_norm": 0.2197265625,
"learning_rate": 0.0004975784145289096,
"loss": 3.0346181869506834,
"step": 2830
},
{
"epoch": 0.09795130026902117,
"grad_norm": 0.2373046875,
"learning_rate": 0.0004975599890581646,
"loss": 3.004329490661621,
"step": 2840
},
{
"epoch": 0.0982961992136304,
"grad_norm": 0.2421875,
"learning_rate": 0.0004975414941164889,
"loss": 3.023432159423828,
"step": 2850
},
{
"epoch": 0.09864109815823964,
"grad_norm": 0.234375,
"learning_rate": 0.0004975229297093485,
"loss": 3.028712844848633,
"step": 2860
},
{
"epoch": 0.09898599710284886,
"grad_norm": 0.228515625,
"learning_rate": 0.0004975042958422298,
"loss": 2.9909120559692384,
"step": 2870
},
{
"epoch": 0.0993308960474581,
"grad_norm": 0.28125,
"learning_rate": 0.0004974855925206403,
"loss": 3.0135841369628906,
"step": 2880
},
{
"epoch": 0.09967579499206733,
"grad_norm": 0.2177734375,
"learning_rate": 0.0004974668197501074,
"loss": 3.0275318145751955,
"step": 2890
},
{
"epoch": 0.10002069393667655,
"grad_norm": 0.2294921875,
"learning_rate": 0.0004974479775361795,
"loss": 3.0700860977172852,
"step": 2900
},
{
"epoch": 0.10002069393667655,
"eval_loss": 3.197871208190918,
"eval_runtime": 6.7314,
"eval_samples_per_second": 48.578,
"eval_steps_per_second": 1.634,
"step": 2900
},
{
"epoch": 0.10036559288128578,
"grad_norm": 0.2353515625,
"learning_rate": 0.0004974290658844253,
"loss": 3.0187602996826173,
"step": 2910
},
{
"epoch": 0.10071049182589502,
"grad_norm": 0.2373046875,
"learning_rate": 0.0004974100848004339,
"loss": 3.013742446899414,
"step": 2920
},
{
"epoch": 0.10105539077050424,
"grad_norm": 0.234375,
"learning_rate": 0.0004973910342898153,
"loss": 3.039021110534668,
"step": 2930
},
{
"epoch": 0.10140028971511347,
"grad_norm": 0.2255859375,
"learning_rate": 0.0004973719143581996,
"loss": 3.036471366882324,
"step": 2940
},
{
"epoch": 0.10174518865972271,
"grad_norm": 0.255859375,
"learning_rate": 0.0004973527250112377,
"loss": 2.9922014236450196,
"step": 2950
},
{
"epoch": 0.10209008760433193,
"grad_norm": 0.2470703125,
"learning_rate": 0.0004973334662546009,
"loss": 2.987853240966797,
"step": 2960
},
{
"epoch": 0.10243498654894116,
"grad_norm": 0.2265625,
"learning_rate": 0.0004973141380939811,
"loss": 3.023481750488281,
"step": 2970
},
{
"epoch": 0.1027798854935504,
"grad_norm": 0.232421875,
"learning_rate": 0.0004972947405350906,
"loss": 3.0309520721435548,
"step": 2980
},
{
"epoch": 0.10312478443815962,
"grad_norm": 0.248046875,
"learning_rate": 0.0004972752735836623,
"loss": 3.034584617614746,
"step": 2990
},
{
"epoch": 0.10346968338276885,
"grad_norm": 0.2353515625,
"learning_rate": 0.0004972557372454495,
"loss": 3.0353445053100585,
"step": 3000
},
{
"epoch": 0.10346968338276885,
"eval_loss": 3.1815316677093506,
"eval_runtime": 6.8396,
"eval_samples_per_second": 47.81,
"eval_steps_per_second": 1.608,
"step": 3000
},
{
"epoch": 0.10381458232737807,
"grad_norm": 0.23828125,
"learning_rate": 0.0004972361315262261,
"loss": 3.035526466369629,
"step": 3010
},
{
"epoch": 0.1041594812719873,
"grad_norm": 0.220703125,
"learning_rate": 0.0004972164564317865,
"loss": 3.0296043395996093,
"step": 3020
},
{
"epoch": 0.10450438021659654,
"grad_norm": 0.2470703125,
"learning_rate": 0.0004971967119679456,
"loss": 3.041478729248047,
"step": 3030
},
{
"epoch": 0.10484927916120576,
"grad_norm": 0.2275390625,
"learning_rate": 0.0004971768981405388,
"loss": 3.001759719848633,
"step": 3040
},
{
"epoch": 0.105194178105815,
"grad_norm": 0.236328125,
"learning_rate": 0.000497157014955422,
"loss": 3.0119159698486326,
"step": 3050
},
{
"epoch": 0.10553907705042423,
"grad_norm": 0.23046875,
"learning_rate": 0.0004971370624184715,
"loss": 3.0216413497924806,
"step": 3060
},
{
"epoch": 0.10588397599503345,
"grad_norm": 0.205078125,
"learning_rate": 0.0004971170405355843,
"loss": 3.0348670959472654,
"step": 3070
},
{
"epoch": 0.10622887493964268,
"grad_norm": 0.2275390625,
"learning_rate": 0.0004970969493126777,
"loss": 3.0531684875488283,
"step": 3080
},
{
"epoch": 0.10657377388425192,
"grad_norm": 0.25390625,
"learning_rate": 0.0004970767887556895,
"loss": 3.0255355834960938,
"step": 3090
},
{
"epoch": 0.10691867282886114,
"grad_norm": 0.23828125,
"learning_rate": 0.0004970565588705781,
"loss": 3.016491508483887,
"step": 3100
},
{
"epoch": 0.10691867282886114,
"eval_loss": 3.174170732498169,
"eval_runtime": 6.7372,
"eval_samples_per_second": 48.537,
"eval_steps_per_second": 1.633,
"step": 3100
},
{
"epoch": 0.10726357177347037,
"grad_norm": 0.2138671875,
"learning_rate": 0.0004970362596633225,
"loss": 2.9967432022094727,
"step": 3110
},
{
"epoch": 0.10760847071807961,
"grad_norm": 0.236328125,
"learning_rate": 0.0004970158911399219,
"loss": 2.985181999206543,
"step": 3120
},
{
"epoch": 0.10795336966268883,
"grad_norm": 0.228515625,
"learning_rate": 0.0004969954533063962,
"loss": 3.00512752532959,
"step": 3130
},
{
"epoch": 0.10829826860729806,
"grad_norm": 0.2216796875,
"learning_rate": 0.0004969749461687856,
"loss": 3.0171781539916993,
"step": 3140
},
{
"epoch": 0.1086431675519073,
"grad_norm": 0.2392578125,
"learning_rate": 0.0004969543697331511,
"loss": 3.0024200439453126,
"step": 3150
},
{
"epoch": 0.10898806649651652,
"grad_norm": 0.2216796875,
"learning_rate": 0.0004969337240055738,
"loss": 3.0367971420288087,
"step": 3160
},
{
"epoch": 0.10933296544112575,
"grad_norm": 0.25,
"learning_rate": 0.0004969130089921554,
"loss": 3.029571533203125,
"step": 3170
},
{
"epoch": 0.10967786438573499,
"grad_norm": 0.2392578125,
"learning_rate": 0.0004968922246990184,
"loss": 3.0332483291625976,
"step": 3180
},
{
"epoch": 0.1100227633303442,
"grad_norm": 0.216796875,
"learning_rate": 0.0004968713711323051,
"loss": 3.008295249938965,
"step": 3190
},
{
"epoch": 0.11036766227495344,
"grad_norm": 0.2353515625,
"learning_rate": 0.0004968504482981791,
"loss": 3.026075553894043,
"step": 3200
},
{
"epoch": 0.11036766227495344,
"eval_loss": 3.172048568725586,
"eval_runtime": 6.7364,
"eval_samples_per_second": 48.542,
"eval_steps_per_second": 1.633,
"step": 3200
},
{
"epoch": 0.11071256121956267,
"grad_norm": 0.2275390625,
"learning_rate": 0.0004968294562028237,
"loss": 3.0314558029174803,
"step": 3210
},
{
"epoch": 0.1110574601641719,
"grad_norm": 0.27734375,
"learning_rate": 0.0004968083948524433,
"loss": 3.0183042526245116,
"step": 3220
},
{
"epoch": 0.11140235910878113,
"grad_norm": 0.2373046875,
"learning_rate": 0.0004967872642532623,
"loss": 3.0487560272216796,
"step": 3230
},
{
"epoch": 0.11174725805339035,
"grad_norm": 0.296875,
"learning_rate": 0.000496766064411526,
"loss": 3.0047475814819338,
"step": 3240
},
{
"epoch": 0.11209215699799958,
"grad_norm": 0.2373046875,
"learning_rate": 0.0004967447953334995,
"loss": 3.037026023864746,
"step": 3250
},
{
"epoch": 0.11243705594260882,
"grad_norm": 0.2392578125,
"learning_rate": 0.0004967234570254691,
"loss": 3.0033973693847655,
"step": 3260
},
{
"epoch": 0.11278195488721804,
"grad_norm": 0.2353515625,
"learning_rate": 0.0004967020494937413,
"loss": 3.0388776779174806,
"step": 3270
},
{
"epoch": 0.11312685383182727,
"grad_norm": 0.248046875,
"learning_rate": 0.0004966805727446426,
"loss": 3.014145088195801,
"step": 3280
},
{
"epoch": 0.11347175277643651,
"grad_norm": 0.2177734375,
"learning_rate": 0.0004966590267845208,
"loss": 3.0064775466918947,
"step": 3290
},
{
"epoch": 0.11381665172104573,
"grad_norm": 0.23046875,
"learning_rate": 0.0004966374116197435,
"loss": 3.054228591918945,
"step": 3300
},
{
"epoch": 0.11381665172104573,
"eval_loss": 3.1683712005615234,
"eval_runtime": 6.7192,
"eval_samples_per_second": 48.666,
"eval_steps_per_second": 1.637,
"step": 3300
},
{
"epoch": 0.11416155066565496,
"grad_norm": 0.2197265625,
"learning_rate": 0.0004966157272566989,
"loss": 2.9828277587890626,
"step": 3310
},
{
"epoch": 0.1145064496102642,
"grad_norm": 0.2470703125,
"learning_rate": 0.000496593973701796,
"loss": 2.992258071899414,
"step": 3320
},
{
"epoch": 0.11485134855487342,
"grad_norm": 0.2177734375,
"learning_rate": 0.0004965721509614636,
"loss": 3.021725654602051,
"step": 3330
},
{
"epoch": 0.11519624749948265,
"grad_norm": 0.220703125,
"learning_rate": 0.0004965502590421517,
"loss": 3.032084083557129,
"step": 3340
},
{
"epoch": 0.11554114644409189,
"grad_norm": 0.2578125,
"learning_rate": 0.00049652829795033,
"loss": 3.017766571044922,
"step": 3350
},
{
"epoch": 0.1158860453887011,
"grad_norm": 0.21484375,
"learning_rate": 0.0004965062676924892,
"loss": 3.025203514099121,
"step": 3360
},
{
"epoch": 0.11623094433331034,
"grad_norm": 0.251953125,
"learning_rate": 0.0004964841682751402,
"loss": 3.0111839294433596,
"step": 3370
},
{
"epoch": 0.11657584327791957,
"grad_norm": 0.2353515625,
"learning_rate": 0.0004964619997048143,
"loss": 3.0000905990600586,
"step": 3380
},
{
"epoch": 0.1169207422225288,
"grad_norm": 0.251953125,
"learning_rate": 0.0004964397619880635,
"loss": 3.0158496856689454,
"step": 3390
},
{
"epoch": 0.11726564116713803,
"grad_norm": 0.267578125,
"learning_rate": 0.00049641745513146,
"loss": 3.0142328262329103,
"step": 3400
},
{
"epoch": 0.11726564116713803,
"eval_loss": 3.1717991828918457,
"eval_runtime": 6.7287,
"eval_samples_per_second": 48.598,
"eval_steps_per_second": 1.635,
"step": 3400
},
{
"epoch": 0.11761054011174726,
"grad_norm": 0.2314453125,
"learning_rate": 0.0004963950791415963,
"loss": 3.0468318939208983,
"step": 3410
},
{
"epoch": 0.11795543905635648,
"grad_norm": 0.2275390625,
"learning_rate": 0.0004963726340250858,
"loss": 3.0026397705078125,
"step": 3420
},
{
"epoch": 0.11830033800096572,
"grad_norm": 0.220703125,
"learning_rate": 0.000496350119788562,
"loss": 3.01328067779541,
"step": 3430
},
{
"epoch": 0.11864523694557495,
"grad_norm": 0.271484375,
"learning_rate": 0.0004963275364386787,
"loss": 3.022497367858887,
"step": 3440
},
{
"epoch": 0.11899013589018417,
"grad_norm": 0.236328125,
"learning_rate": 0.0004963048839821105,
"loss": 3.036116027832031,
"step": 3450
},
{
"epoch": 0.11933503483479341,
"grad_norm": 0.234375,
"learning_rate": 0.0004962821624255521,
"loss": 2.98995361328125,
"step": 3460
},
{
"epoch": 0.11967993377940264,
"grad_norm": 0.2080078125,
"learning_rate": 0.0004962593717757188,
"loss": 3.0167715072631838,
"step": 3470
},
{
"epoch": 0.12002483272401186,
"grad_norm": 0.208984375,
"learning_rate": 0.0004962365120393463,
"loss": 2.9596494674682616,
"step": 3480
},
{
"epoch": 0.1203697316686211,
"grad_norm": 0.240234375,
"learning_rate": 0.0004962135832231908,
"loss": 3.0237884521484375,
"step": 3490
},
{
"epoch": 0.12071463061323032,
"grad_norm": 0.2158203125,
"learning_rate": 0.0004961905853340285,
"loss": 2.9989990234375,
"step": 3500
},
{
"epoch": 0.12071463061323032,
"eval_loss": 3.165252685546875,
"eval_runtime": 6.723,
"eval_samples_per_second": 48.639,
"eval_steps_per_second": 1.636,
"step": 3500
},
{
"epoch": 0.12105952955783955,
"grad_norm": 0.255859375,
"learning_rate": 0.0004961675183786567,
"loss": 2.991859245300293,
"step": 3510
},
{
"epoch": 0.12140442850244879,
"grad_norm": 0.2265625,
"learning_rate": 0.0004961443823638924,
"loss": 3.0180643081665037,
"step": 3520
},
{
"epoch": 0.121749327447058,
"grad_norm": 0.2890625,
"learning_rate": 0.0004961211772965736,
"loss": 3.033351516723633,
"step": 3530
},
{
"epoch": 0.12209422639166724,
"grad_norm": 0.234375,
"learning_rate": 0.0004960979031835582,
"loss": 2.9912784576416014,
"step": 3540
},
{
"epoch": 0.12243912533627647,
"grad_norm": 0.2275390625,
"learning_rate": 0.000496074560031725,
"loss": 3.0393821716308596,
"step": 3550
},
{
"epoch": 0.1227840242808857,
"grad_norm": 0.244140625,
"learning_rate": 0.0004960511478479729,
"loss": 3.0030418395996095,
"step": 3560
},
{
"epoch": 0.12312892322549493,
"grad_norm": 0.248046875,
"learning_rate": 0.0004960276666392213,
"loss": 3.0119344711303713,
"step": 3570
},
{
"epoch": 0.12347382217010416,
"grad_norm": 0.2314453125,
"learning_rate": 0.0004960041164124097,
"loss": 2.9897686004638673,
"step": 3580
},
{
"epoch": 0.12381872111471338,
"grad_norm": 0.267578125,
"learning_rate": 0.0004959804971744987,
"loss": 3.045718193054199,
"step": 3590
},
{
"epoch": 0.12416362005932262,
"grad_norm": 0.21484375,
"learning_rate": 0.0004959568089324684,
"loss": 2.9756067276000975,
"step": 3600
},
{
"epoch": 0.12416362005932262,
"eval_loss": 3.1751327514648438,
"eval_runtime": 6.7661,
"eval_samples_per_second": 48.329,
"eval_steps_per_second": 1.626,
"step": 3600
},
{
"epoch": 0.12450851900393185,
"grad_norm": 0.2177734375,
"learning_rate": 0.0004959330516933201,
"loss": 2.989982032775879,
"step": 3610
},
{
"epoch": 0.12485341794854107,
"grad_norm": 0.2412109375,
"learning_rate": 0.0004959092254640751,
"loss": 2.9974496841430662,
"step": 3620
},
{
"epoch": 0.1251983168931503,
"grad_norm": 0.2177734375,
"learning_rate": 0.000495885330251775,
"loss": 3.0266117095947265,
"step": 3630
},
{
"epoch": 0.12554321583775954,
"grad_norm": 0.2119140625,
"learning_rate": 0.000495861366063482,
"loss": 2.9926311492919924,
"step": 3640
},
{
"epoch": 0.12588811478236878,
"grad_norm": 0.2490234375,
"learning_rate": 0.0004958373329062787,
"loss": 2.9860143661499023,
"step": 3650
},
{
"epoch": 0.12623301372697798,
"grad_norm": 0.232421875,
"learning_rate": 0.0004958132307872677,
"loss": 3.0157192230224608,
"step": 3660
},
{
"epoch": 0.12657791267158722,
"grad_norm": 0.2314453125,
"learning_rate": 0.0004957890597135726,
"loss": 3.013762664794922,
"step": 3670
},
{
"epoch": 0.12692281161619645,
"grad_norm": 0.2099609375,
"learning_rate": 0.0004957648196923368,
"loss": 2.9722711563110353,
"step": 3680
},
{
"epoch": 0.12726771056080569,
"grad_norm": 0.2265625,
"learning_rate": 0.0004957405107307245,
"loss": 3.0043930053710937,
"step": 3690
},
{
"epoch": 0.12761260950541492,
"grad_norm": 0.234375,
"learning_rate": 0.0004957161328359201,
"loss": 2.991504096984863,
"step": 3700
},
{
"epoch": 0.12761260950541492,
"eval_loss": 3.159167766571045,
"eval_runtime": 6.7318,
"eval_samples_per_second": 48.576,
"eval_steps_per_second": 1.634,
"step": 3700
},
{
"epoch": 0.12795750845002415,
"grad_norm": 0.28125,
"learning_rate": 0.0004956916860151283,
"loss": 3.0034387588500975,
"step": 3710
},
{
"epoch": 0.12830240739463336,
"grad_norm": 0.220703125,
"learning_rate": 0.0004956671702755743,
"loss": 2.9816072463989256,
"step": 3720
},
{
"epoch": 0.1286473063392426,
"grad_norm": 0.240234375,
"learning_rate": 0.0004956425856245036,
"loss": 3.000564956665039,
"step": 3730
},
{
"epoch": 0.12899220528385183,
"grad_norm": 0.21875,
"learning_rate": 0.000495617932069182,
"loss": 3.005902862548828,
"step": 3740
},
{
"epoch": 0.12933710422846106,
"grad_norm": 0.224609375,
"learning_rate": 0.000495593209616896,
"loss": 3.0049072265625,
"step": 3750
},
{
"epoch": 0.1296820031730703,
"grad_norm": 0.216796875,
"learning_rate": 0.0004955684182749519,
"loss": 2.9935598373413086,
"step": 3760
},
{
"epoch": 0.13002690211767953,
"grad_norm": 0.244140625,
"learning_rate": 0.0004955435580506768,
"loss": 2.9739862442016602,
"step": 3770
},
{
"epoch": 0.13037180106228874,
"grad_norm": 0.251953125,
"learning_rate": 0.0004955186289514182,
"loss": 2.9983901977539062,
"step": 3780
},
{
"epoch": 0.13071670000689797,
"grad_norm": 0.232421875,
"learning_rate": 0.0004954936309845434,
"loss": 3.004456901550293,
"step": 3790
},
{
"epoch": 0.1310615989515072,
"grad_norm": 0.2294921875,
"learning_rate": 0.0004954685641574408,
"loss": 2.960996627807617,
"step": 3800
},
{
"epoch": 0.1310615989515072,
"eval_loss": 3.164684534072876,
"eval_runtime": 6.7202,
"eval_samples_per_second": 48.659,
"eval_steps_per_second": 1.637,
"step": 3800
},
{
"epoch": 0.13140649789611644,
"grad_norm": 0.25390625,
"learning_rate": 0.0004954434284775187,
"loss": 2.950288772583008,
"step": 3810
},
{
"epoch": 0.13175139684072568,
"grad_norm": 0.2265625,
"learning_rate": 0.0004954182239522056,
"loss": 2.9668479919433595,
"step": 3820
},
{
"epoch": 0.1320962957853349,
"grad_norm": 0.21875,
"learning_rate": 0.000495392950588951,
"loss": 2.977401351928711,
"step": 3830
},
{
"epoch": 0.13244119472994412,
"grad_norm": 0.228515625,
"learning_rate": 0.000495367608395224,
"loss": 3.0218761444091795,
"step": 3840
},
{
"epoch": 0.13278609367455335,
"grad_norm": 0.228515625,
"learning_rate": 0.0004953421973785144,
"loss": 2.9925100326538088,
"step": 3850
},
{
"epoch": 0.13313099261916259,
"grad_norm": 0.244140625,
"learning_rate": 0.0004953167175463324,
"loss": 2.9722568511962892,
"step": 3860
},
{
"epoch": 0.13347589156377182,
"grad_norm": 0.275390625,
"learning_rate": 0.0004952911689062085,
"loss": 3.006439781188965,
"step": 3870
},
{
"epoch": 0.13382079050838105,
"grad_norm": 0.2177734375,
"learning_rate": 0.0004952655514656934,
"loss": 2.983469009399414,
"step": 3880
},
{
"epoch": 0.13416568945299026,
"grad_norm": 0.21875,
"learning_rate": 0.0004952398652323583,
"loss": 3.0055164337158202,
"step": 3890
},
{
"epoch": 0.1345105883975995,
"grad_norm": 0.2451171875,
"learning_rate": 0.0004952141102137946,
"loss": 3.028909683227539,
"step": 3900
},
{
"epoch": 0.1345105883975995,
"eval_loss": 3.1625843048095703,
"eval_runtime": 6.722,
"eval_samples_per_second": 48.646,
"eval_steps_per_second": 1.636,
"step": 3900
},
{
"epoch": 0.13485548734220873,
"grad_norm": 0.24609375,
"learning_rate": 0.0004951882864176139,
"loss": 2.9902904510498045,
"step": 3910
},
{
"epoch": 0.13520038628681796,
"grad_norm": 0.220703125,
"learning_rate": 0.0004951623938514487,
"loss": 3.0018278121948243,
"step": 3920
},
{
"epoch": 0.1355452852314272,
"grad_norm": 0.251953125,
"learning_rate": 0.0004951364325229511,
"loss": 2.9799169540405273,
"step": 3930
},
{
"epoch": 0.13589018417603643,
"grad_norm": 0.22265625,
"learning_rate": 0.000495110402439794,
"loss": 2.9893619537353517,
"step": 3940
},
{
"epoch": 0.13623508312064564,
"grad_norm": 0.2412109375,
"learning_rate": 0.0004950843036096705,
"loss": 2.962021255493164,
"step": 3950
},
{
"epoch": 0.13657998206525487,
"grad_norm": 0.2197265625,
"learning_rate": 0.0004950581360402938,
"loss": 2.977663040161133,
"step": 3960
},
{
"epoch": 0.1369248810098641,
"grad_norm": 0.21484375,
"learning_rate": 0.0004950318997393978,
"loss": 2.9969497680664063,
"step": 3970
},
{
"epoch": 0.13726977995447334,
"grad_norm": 0.2197265625,
"learning_rate": 0.0004950055947147366,
"loss": 3.00067138671875,
"step": 3980
},
{
"epoch": 0.13761467889908258,
"grad_norm": 0.2333984375,
"learning_rate": 0.0004949792209740843,
"loss": 2.9823270797729493,
"step": 3990
},
{
"epoch": 0.1379595778436918,
"grad_norm": 0.205078125,
"learning_rate": 0.0004949527785252357,
"loss": 2.982051658630371,
"step": 4000
},
{
"epoch": 0.1379595778436918,
"eval_loss": 3.1498098373413086,
"eval_runtime": 6.7185,
"eval_samples_per_second": 48.672,
"eval_steps_per_second": 1.637,
"step": 4000
},
{
"epoch": 0.13830447678830102,
"grad_norm": 0.228515625,
"learning_rate": 0.0004949262673760056,
"loss": 3.0193693161010744,
"step": 4010
},
{
"epoch": 0.13864937573291025,
"grad_norm": 0.236328125,
"learning_rate": 0.0004948996875342293,
"loss": 2.989998626708984,
"step": 4020
},
{
"epoch": 0.13899427467751949,
"grad_norm": 0.251953125,
"learning_rate": 0.0004948730390077627,
"loss": 3.002806282043457,
"step": 4030
},
{
"epoch": 0.13933917362212872,
"grad_norm": 0.2138671875,
"learning_rate": 0.0004948463218044811,
"loss": 3.029488182067871,
"step": 4040
},
{
"epoch": 0.13968407256673795,
"grad_norm": 0.26171875,
"learning_rate": 0.0004948195359322809,
"loss": 2.9810775756835937,
"step": 4050
},
{
"epoch": 0.1400289715113472,
"grad_norm": 0.2353515625,
"learning_rate": 0.0004947926813990785,
"loss": 2.9854259490966797,
"step": 4060
},
{
"epoch": 0.1403738704559564,
"grad_norm": 0.2099609375,
"learning_rate": 0.0004947657582128109,
"loss": 2.96386661529541,
"step": 4070
},
{
"epoch": 0.14071876940056563,
"grad_norm": 0.25390625,
"learning_rate": 0.0004947387663814348,
"loss": 2.9897836685180663,
"step": 4080
},
{
"epoch": 0.14106366834517486,
"grad_norm": 0.2294921875,
"learning_rate": 0.0004947117059129276,
"loss": 2.9781829833984377,
"step": 4090
},
{
"epoch": 0.1414085672897841,
"grad_norm": 0.201171875,
"learning_rate": 0.0004946845768152868,
"loss": 3.002536392211914,
"step": 4100
},
{
"epoch": 0.1414085672897841,
"eval_loss": 3.1550486087799072,
"eval_runtime": 6.7271,
"eval_samples_per_second": 48.609,
"eval_steps_per_second": 1.635,
"step": 4100
},
{
"epoch": 0.14175346623439333,
"grad_norm": 0.240234375,
"learning_rate": 0.0004946573790965307,
"loss": 2.987820625305176,
"step": 4110
},
{
"epoch": 0.14209836517900254,
"grad_norm": 0.22265625,
"learning_rate": 0.0004946301127646969,
"loss": 2.972881317138672,
"step": 4120
},
{
"epoch": 0.14244326412361177,
"grad_norm": 0.23828125,
"learning_rate": 0.0004946027778278443,
"loss": 3.0019201278686523,
"step": 4130
},
{
"epoch": 0.142788163068221,
"grad_norm": 0.265625,
"learning_rate": 0.0004945753742940514,
"loss": 2.988333892822266,
"step": 4140
},
{
"epoch": 0.14313306201283024,
"grad_norm": 0.2275390625,
"learning_rate": 0.0004945479021714171,
"loss": 2.9953964233398436,
"step": 4150
},
{
"epoch": 0.14347796095743948,
"grad_norm": 0.2353515625,
"learning_rate": 0.0004945203614680609,
"loss": 2.982470893859863,
"step": 4160
},
{
"epoch": 0.1438228599020487,
"grad_norm": 0.2265625,
"learning_rate": 0.0004944927521921223,
"loss": 3.003155517578125,
"step": 4170
},
{
"epoch": 0.14416775884665792,
"grad_norm": 0.2392578125,
"learning_rate": 0.0004944650743517609,
"loss": 2.9850168228149414,
"step": 4180
},
{
"epoch": 0.14451265779126715,
"grad_norm": 0.203125,
"learning_rate": 0.000494437327955157,
"loss": 2.984214019775391,
"step": 4190
},
{
"epoch": 0.14485755673587639,
"grad_norm": 0.24609375,
"learning_rate": 0.0004944095130105106,
"loss": 2.952581596374512,
"step": 4200
},
{
"epoch": 0.14485755673587639,
"eval_loss": 3.1441195011138916,
"eval_runtime": 6.72,
"eval_samples_per_second": 48.661,
"eval_steps_per_second": 1.637,
"step": 4200
},
{
"epoch": 0.14520245568048562,
"grad_norm": 0.2294921875,
"learning_rate": 0.0004943816295260426,
"loss": 2.9667022705078123,
"step": 4210
},
{
"epoch": 0.14554735462509485,
"grad_norm": 0.2314453125,
"learning_rate": 0.0004943536775099937,
"loss": 2.9970605850219725,
"step": 4220
},
{
"epoch": 0.1458922535697041,
"grad_norm": 0.25390625,
"learning_rate": 0.0004943256569706251,
"loss": 2.9807682037353516,
"step": 4230
},
{
"epoch": 0.1462371525143133,
"grad_norm": 0.2451171875,
"learning_rate": 0.0004942975679162182,
"loss": 3.0138120651245117,
"step": 4240
},
{
"epoch": 0.14658205145892253,
"grad_norm": 0.263671875,
"learning_rate": 0.0004942694103550742,
"loss": 2.976573371887207,
"step": 4250
},
{
"epoch": 0.14692695040353176,
"grad_norm": 0.2578125,
"learning_rate": 0.0004942411842955153,
"loss": 2.9844640731811523,
"step": 4260
},
{
"epoch": 0.147271849348141,
"grad_norm": 0.2197265625,
"learning_rate": 0.0004942128897458835,
"loss": 2.9822599411010744,
"step": 4270
},
{
"epoch": 0.14761674829275023,
"grad_norm": 0.25390625,
"learning_rate": 0.0004941845267145412,
"loss": 2.996249961853027,
"step": 4280
},
{
"epoch": 0.14796164723735947,
"grad_norm": 0.2392578125,
"learning_rate": 0.0004941560952098707,
"loss": 3.0042388916015623,
"step": 4290
},
{
"epoch": 0.14830654618196867,
"grad_norm": 0.2099609375,
"learning_rate": 0.0004941275952402752,
"loss": 2.9566108703613283,
"step": 4300
},
{
"epoch": 0.14830654618196867,
"eval_loss": 3.1496925354003906,
"eval_runtime": 6.7198,
"eval_samples_per_second": 48.662,
"eval_steps_per_second": 1.637,
"step": 4300
},
{
"epoch": 0.1486514451265779,
"grad_norm": 0.25390625,
"learning_rate": 0.0004940990268141773,
"loss": 2.979448127746582,
"step": 4310
},
{
"epoch": 0.14899634407118714,
"grad_norm": 0.31640625,
"learning_rate": 0.0004940703899400207,
"loss": 2.9457590103149416,
"step": 4320
},
{
"epoch": 0.14934124301579638,
"grad_norm": 0.2265625,
"learning_rate": 0.0004940416846262686,
"loss": 2.98935546875,
"step": 4330
},
{
"epoch": 0.1496861419604056,
"grad_norm": 0.203125,
"learning_rate": 0.0004940129108814049,
"loss": 3.0102176666259766,
"step": 4340
},
{
"epoch": 0.15003104090501482,
"grad_norm": 0.2392578125,
"learning_rate": 0.0004939840687139334,
"loss": 2.9817178726196287,
"step": 4350
},
{
"epoch": 0.15037593984962405,
"grad_norm": 0.244140625,
"learning_rate": 0.0004939551581323783,
"loss": 2.972992706298828,
"step": 4360
},
{
"epoch": 0.15072083879423329,
"grad_norm": 0.212890625,
"learning_rate": 0.0004939261791452842,
"loss": 2.992824363708496,
"step": 4370
},
{
"epoch": 0.15106573773884252,
"grad_norm": 0.2578125,
"learning_rate": 0.0004938971317612155,
"loss": 2.992608833312988,
"step": 4380
},
{
"epoch": 0.15141063668345175,
"grad_norm": 0.2470703125,
"learning_rate": 0.000493868015988757,
"loss": 2.982779312133789,
"step": 4390
},
{
"epoch": 0.151755535628061,
"grad_norm": 0.2197265625,
"learning_rate": 0.000493838831836514,
"loss": 2.9856546401977537,
"step": 4400
},
{
"epoch": 0.151755535628061,
"eval_loss": 3.153886318206787,
"eval_runtime": 6.7252,
"eval_samples_per_second": 48.623,
"eval_steps_per_second": 1.636,
"step": 4400
},
{
"epoch": 0.1521004345726702,
"grad_norm": 0.2490234375,
"learning_rate": 0.0004938095793131115,
"loss": 2.9966169357299806,
"step": 4410
},
{
"epoch": 0.15244533351727943,
"grad_norm": 0.2275390625,
"learning_rate": 0.0004937802584271949,
"loss": 2.9869657516479493,
"step": 4420
},
{
"epoch": 0.15279023246188866,
"grad_norm": 0.2138671875,
"learning_rate": 0.0004937508691874301,
"loss": 2.972144889831543,
"step": 4430
},
{
"epoch": 0.1531351314064979,
"grad_norm": 0.244140625,
"learning_rate": 0.0004937214116025028,
"loss": 2.9536251068115233,
"step": 4440
},
{
"epoch": 0.15348003035110713,
"grad_norm": 0.236328125,
"learning_rate": 0.000493691885681119,
"loss": 2.983636665344238,
"step": 4450
},
{
"epoch": 0.15382492929571637,
"grad_norm": 0.232421875,
"learning_rate": 0.0004936622914320052,
"loss": 2.9705886840820312,
"step": 4460
},
{
"epoch": 0.15416982824032557,
"grad_norm": 0.2236328125,
"learning_rate": 0.0004936326288639076,
"loss": 2.9875600814819334,
"step": 4470
},
{
"epoch": 0.1545147271849348,
"grad_norm": 0.234375,
"learning_rate": 0.0004936028979855929,
"loss": 2.972930145263672,
"step": 4480
},
{
"epoch": 0.15485962612954404,
"grad_norm": 0.232421875,
"learning_rate": 0.000493573098805848,
"loss": 2.9791515350341795,
"step": 4490
},
{
"epoch": 0.15520452507415328,
"grad_norm": 0.2265625,
"learning_rate": 0.00049354323133348,
"loss": 3.0023319244384767,
"step": 4500
},
{
"epoch": 0.15520452507415328,
"eval_loss": 3.1520376205444336,
"eval_runtime": 6.73,
"eval_samples_per_second": 48.589,
"eval_steps_per_second": 1.634,
"step": 4500
},
{
"epoch": 0.1555494240187625,
"grad_norm": 0.22265625,
"learning_rate": 0.0004935132955773159,
"loss": 2.9401525497436523,
"step": 4510
},
{
"epoch": 0.15589432296337175,
"grad_norm": 0.2158203125,
"learning_rate": 0.000493483291546203,
"loss": 2.9643228530883787,
"step": 4520
},
{
"epoch": 0.15623922190798095,
"grad_norm": 0.2177734375,
"learning_rate": 0.0004934532192490092,
"loss": 2.958892059326172,
"step": 4530
},
{
"epoch": 0.1565841208525902,
"grad_norm": 0.236328125,
"learning_rate": 0.000493423078694622,
"loss": 2.983892250061035,
"step": 4540
},
{
"epoch": 0.15692901979719942,
"grad_norm": 0.2333984375,
"learning_rate": 0.0004933928698919492,
"loss": 2.9624845504760744,
"step": 4550
},
{
"epoch": 0.15727391874180865,
"grad_norm": 0.2333984375,
"learning_rate": 0.0004933625928499192,
"loss": 2.9689382553100585,
"step": 4560
},
{
"epoch": 0.1576188176864179,
"grad_norm": 0.236328125,
"learning_rate": 0.00049333224757748,
"loss": 2.9538814544677736,
"step": 4570
},
{
"epoch": 0.1579637166310271,
"grad_norm": 0.224609375,
"learning_rate": 0.0004933018340836002,
"loss": 2.969583511352539,
"step": 4580
},
{
"epoch": 0.15830861557563633,
"grad_norm": 0.2265625,
"learning_rate": 0.000493271352377268,
"loss": 2.977361297607422,
"step": 4590
},
{
"epoch": 0.15865351452024556,
"grad_norm": 0.22265625,
"learning_rate": 0.0004932408024674926,
"loss": 2.9521629333496096,
"step": 4600
},
{
"epoch": 0.15865351452024556,
"eval_loss": 3.150723695755005,
"eval_runtime": 6.7238,
"eval_samples_per_second": 48.633,
"eval_steps_per_second": 1.636,
"step": 4600
},
{
"epoch": 0.1589984134648548,
"grad_norm": 0.2431640625,
"learning_rate": 0.0004932101843633026,
"loss": 2.9743833541870117,
"step": 4610
},
{
"epoch": 0.15934331240946403,
"grad_norm": 0.26953125,
"learning_rate": 0.0004931794980737472,
"loss": 2.949156951904297,
"step": 4620
},
{
"epoch": 0.15968821135407327,
"grad_norm": 0.22265625,
"learning_rate": 0.0004931487436078954,
"loss": 2.957554244995117,
"step": 4630
},
{
"epoch": 0.16003311029868247,
"grad_norm": 0.2294921875,
"learning_rate": 0.0004931179209748368,
"loss": 2.9589775085449217,
"step": 4640
},
{
"epoch": 0.1603780092432917,
"grad_norm": 0.25390625,
"learning_rate": 0.0004930870301836807,
"loss": 2.9749269485473633,
"step": 4650
},
{
"epoch": 0.16072290818790094,
"grad_norm": 0.2197265625,
"learning_rate": 0.0004930560712435567,
"loss": 2.9557363510131838,
"step": 4660
},
{
"epoch": 0.16106780713251018,
"grad_norm": 0.2216796875,
"learning_rate": 0.0004930250441636147,
"loss": 2.9683906555175783,
"step": 4670
},
{
"epoch": 0.1614127060771194,
"grad_norm": 0.2451171875,
"learning_rate": 0.0004929939489530246,
"loss": 2.9600408554077147,
"step": 4680
},
{
"epoch": 0.16175760502172865,
"grad_norm": 0.244140625,
"learning_rate": 0.0004929627856209765,
"loss": 2.970965576171875,
"step": 4690
},
{
"epoch": 0.16210250396633785,
"grad_norm": 0.2265625,
"learning_rate": 0.0004929315541766804,
"loss": 2.961244010925293,
"step": 4700
},
{
"epoch": 0.16210250396633785,
"eval_loss": 3.1319401264190674,
"eval_runtime": 6.7399,
"eval_samples_per_second": 48.517,
"eval_steps_per_second": 1.632,
"step": 4700
},
{
"epoch": 0.1624474029109471,
"grad_norm": 0.216796875,
"learning_rate": 0.0004929002546293667,
"loss": 2.9594139099121093,
"step": 4710
},
{
"epoch": 0.16279230185555632,
"grad_norm": 0.228515625,
"learning_rate": 0.000492868886988286,
"loss": 2.9610084533691405,
"step": 4720
},
{
"epoch": 0.16313720080016555,
"grad_norm": 0.22265625,
"learning_rate": 0.0004928374512627087,
"loss": 2.985554313659668,
"step": 4730
},
{
"epoch": 0.1634820997447748,
"grad_norm": 0.248046875,
"learning_rate": 0.0004928059474619255,
"loss": 2.994824981689453,
"step": 4740
},
{
"epoch": 0.16382699868938402,
"grad_norm": 0.275390625,
"learning_rate": 0.0004927743755952473,
"loss": 2.9625144958496095,
"step": 4750
},
{
"epoch": 0.16417189763399323,
"grad_norm": 0.25,
"learning_rate": 0.0004927427356720049,
"loss": 2.984906005859375,
"step": 4760
},
{
"epoch": 0.16451679657860246,
"grad_norm": 0.2216796875,
"learning_rate": 0.0004927110277015493,
"loss": 2.969473457336426,
"step": 4770
},
{
"epoch": 0.1648616955232117,
"grad_norm": 0.208984375,
"learning_rate": 0.0004926792516932518,
"loss": 2.964279365539551,
"step": 4780
},
{
"epoch": 0.16520659446782093,
"grad_norm": 0.236328125,
"learning_rate": 0.0004926474076565037,
"loss": 2.9810308456420898,
"step": 4790
},
{
"epoch": 0.16555149341243017,
"grad_norm": 0.23828125,
"learning_rate": 0.0004926154956007162,
"loss": 2.9619462966918944,
"step": 4800
},
{
"epoch": 0.16555149341243017,
"eval_loss": 3.1518521308898926,
"eval_runtime": 6.7386,
"eval_samples_per_second": 48.527,
"eval_steps_per_second": 1.632,
"step": 4800
},
{
"epoch": 0.16589639235703937,
"grad_norm": 0.25,
"learning_rate": 0.0004925835155353208,
"loss": 2.9949432373046876,
"step": 4810
},
{
"epoch": 0.1662412913016486,
"grad_norm": 0.2109375,
"learning_rate": 0.0004925514674697692,
"loss": 2.9820219039916993,
"step": 4820
},
{
"epoch": 0.16658619024625784,
"grad_norm": 0.236328125,
"learning_rate": 0.0004925193514135329,
"loss": 2.971327209472656,
"step": 4830
},
{
"epoch": 0.16693108919086708,
"grad_norm": 0.2392578125,
"learning_rate": 0.0004924871673761038,
"loss": 2.954444694519043,
"step": 4840
},
{
"epoch": 0.1672759881354763,
"grad_norm": 0.216796875,
"learning_rate": 0.0004924549153669935,
"loss": 2.9767589569091797,
"step": 4850
},
{
"epoch": 0.16762088708008555,
"grad_norm": 0.224609375,
"learning_rate": 0.0004924225953957342,
"loss": 2.9760509490966798,
"step": 4860
},
{
"epoch": 0.16796578602469475,
"grad_norm": 0.255859375,
"learning_rate": 0.0004923902074718778,
"loss": 2.952646255493164,
"step": 4870
},
{
"epoch": 0.168310684969304,
"grad_norm": 0.228515625,
"learning_rate": 0.0004923577516049964,
"loss": 2.9636226654052735,
"step": 4880
},
{
"epoch": 0.16865558391391322,
"grad_norm": 0.2275390625,
"learning_rate": 0.0004923252278046822,
"loss": 2.9538818359375,
"step": 4890
},
{
"epoch": 0.16900048285852245,
"grad_norm": 0.2314453125,
"learning_rate": 0.0004922926360805476,
"loss": 2.9321662902832033,
"step": 4900
},
{
"epoch": 0.16900048285852245,
"eval_loss": 3.1576976776123047,
"eval_runtime": 6.803,
"eval_samples_per_second": 48.067,
"eval_steps_per_second": 1.617,
"step": 4900
},
{
"epoch": 0.1693453818031317,
"grad_norm": 0.2109375,
"learning_rate": 0.0004922599764422247,
"loss": 2.94467830657959,
"step": 4910
},
{
"epoch": 0.16969028074774092,
"grad_norm": 0.236328125,
"learning_rate": 0.000492227248899366,
"loss": 2.9843250274658204,
"step": 4920
},
{
"epoch": 0.17003517969235013,
"grad_norm": 0.263671875,
"learning_rate": 0.0004921944534616443,
"loss": 2.939727020263672,
"step": 4930
},
{
"epoch": 0.17038007863695936,
"grad_norm": 0.21875,
"learning_rate": 0.0004921615901387515,
"loss": 2.953375816345215,
"step": 4940
},
{
"epoch": 0.1707249775815686,
"grad_norm": 0.228515625,
"learning_rate": 0.0004921286589404007,
"loss": 2.9527448654174804,
"step": 4950
},
{
"epoch": 0.17106987652617783,
"grad_norm": 0.2080078125,
"learning_rate": 0.0004920956598763245,
"loss": 2.9727285385131834,
"step": 4960
},
{
"epoch": 0.17141477547078707,
"grad_norm": 0.2421875,
"learning_rate": 0.0004920625929562756,
"loss": 2.972251319885254,
"step": 4970
},
{
"epoch": 0.1717596744153963,
"grad_norm": 0.236328125,
"learning_rate": 0.0004920294581900266,
"loss": 2.9452888488769533,
"step": 4980
},
{
"epoch": 0.1721045733600055,
"grad_norm": 0.2236328125,
"learning_rate": 0.0004919962555873705,
"loss": 2.9507394790649415,
"step": 4990
},
{
"epoch": 0.17244947230461474,
"grad_norm": 0.26953125,
"learning_rate": 0.0004919629851581202,
"loss": 2.9617536544799803,
"step": 5000
},
{
"epoch": 0.17244947230461474,
"eval_loss": 3.145920991897583,
"eval_runtime": 6.8224,
"eval_samples_per_second": 47.93,
"eval_steps_per_second": 1.612,
"step": 5000
},
{
"epoch": 0.17279437124922398,
"grad_norm": 0.2041015625,
"learning_rate": 0.0004919296469121084,
"loss": 2.9821300506591797,
"step": 5010
},
{
"epoch": 0.1731392701938332,
"grad_norm": 0.212890625,
"learning_rate": 0.0004918962408591885,
"loss": 2.9879783630371093,
"step": 5020
},
{
"epoch": 0.17348416913844245,
"grad_norm": 0.2177734375,
"learning_rate": 0.0004918627670092332,
"loss": 2.9563671112060548,
"step": 5030
},
{
"epoch": 0.17382906808305165,
"grad_norm": 0.2578125,
"learning_rate": 0.0004918292253721355,
"loss": 2.949415397644043,
"step": 5040
},
{
"epoch": 0.1741739670276609,
"grad_norm": 0.232421875,
"learning_rate": 0.0004917956159578087,
"loss": 2.982105255126953,
"step": 5050
},
{
"epoch": 0.17451886597227012,
"grad_norm": 0.26953125,
"learning_rate": 0.0004917619387761858,
"loss": 2.95444278717041,
"step": 5060
},
{
"epoch": 0.17486376491687936,
"grad_norm": 0.2197265625,
"learning_rate": 0.0004917281938372198,
"loss": 2.9795372009277346,
"step": 5070
},
{
"epoch": 0.1752086638614886,
"grad_norm": 0.240234375,
"learning_rate": 0.0004916943811508842,
"loss": 2.9851028442382814,
"step": 5080
},
{
"epoch": 0.17555356280609782,
"grad_norm": 0.2578125,
"learning_rate": 0.0004916605007271718,
"loss": 2.970852088928223,
"step": 5090
},
{
"epoch": 0.17589846175070703,
"grad_norm": 0.2255859375,
"learning_rate": 0.0004916265525760961,
"loss": 2.958824348449707,
"step": 5100
},
{
"epoch": 0.17589846175070703,
"eval_loss": 3.1318001747131348,
"eval_runtime": 6.8104,
"eval_samples_per_second": 48.014,
"eval_steps_per_second": 1.615,
"step": 5100
},
{
"epoch": 0.17624336069531626,
"grad_norm": 0.22265625,
"learning_rate": 0.0004915925367076903,
"loss": 2.916763687133789,
"step": 5110
},
{
"epoch": 0.1765882596399255,
"grad_norm": 0.244140625,
"learning_rate": 0.0004915584531320075,
"loss": 2.942286491394043,
"step": 5120
},
{
"epoch": 0.17693315858453473,
"grad_norm": 0.216796875,
"learning_rate": 0.0004915243018591209,
"loss": 2.973043441772461,
"step": 5130
},
{
"epoch": 0.17727805752914397,
"grad_norm": 0.2216796875,
"learning_rate": 0.000491490082899124,
"loss": 2.979201889038086,
"step": 5140
},
{
"epoch": 0.1776229564737532,
"grad_norm": 0.232421875,
"learning_rate": 0.00049145579626213,
"loss": 2.9672853469848635,
"step": 5150
},
{
"epoch": 0.1779678554183624,
"grad_norm": 0.236328125,
"learning_rate": 0.000491421441958272,
"loss": 2.9649829864501953,
"step": 5160
},
{
"epoch": 0.17831275436297164,
"grad_norm": 0.2236328125,
"learning_rate": 0.0004913870199977034,
"loss": 2.9548431396484376,
"step": 5170
},
{
"epoch": 0.17865765330758088,
"grad_norm": 0.255859375,
"learning_rate": 0.0004913525303905973,
"loss": 2.9435720443725586,
"step": 5180
},
{
"epoch": 0.1790025522521901,
"grad_norm": 0.236328125,
"learning_rate": 0.0004913179731471472,
"loss": 2.950910186767578,
"step": 5190
},
{
"epoch": 0.17934745119679935,
"grad_norm": 0.2099609375,
"learning_rate": 0.0004912833482775662,
"loss": 2.9732566833496095,
"step": 5200
},
{
"epoch": 0.17934745119679935,
"eval_loss": 3.1375985145568848,
"eval_runtime": 6.7966,
"eval_samples_per_second": 48.112,
"eval_steps_per_second": 1.618,
"step": 5200
},
{
"epoch": 0.17969235014140858,
"grad_norm": 0.2275390625,
"learning_rate": 0.0004912486557920874,
"loss": 2.9639122009277346,
"step": 5210
},
{
"epoch": 0.1800372490860178,
"grad_norm": 0.2392578125,
"learning_rate": 0.0004912138957009642,
"loss": 2.904903602600098,
"step": 5220
},
{
"epoch": 0.18038214803062702,
"grad_norm": 0.2197265625,
"learning_rate": 0.0004911790680144697,
"loss": 2.937609100341797,
"step": 5230
},
{
"epoch": 0.18072704697523626,
"grad_norm": 0.21484375,
"learning_rate": 0.0004911441727428971,
"loss": 2.9472780227661133,
"step": 5240
},
{
"epoch": 0.1810719459198455,
"grad_norm": 0.216796875,
"learning_rate": 0.0004911092098965596,
"loss": 2.9447872161865236,
"step": 5250
},
{
"epoch": 0.18141684486445472,
"grad_norm": 0.2236328125,
"learning_rate": 0.0004910741794857903,
"loss": 2.9409147262573243,
"step": 5260
},
{
"epoch": 0.18176174380906396,
"grad_norm": 0.244140625,
"learning_rate": 0.0004910390815209421,
"loss": 2.9940746307373045,
"step": 5270
},
{
"epoch": 0.18210664275367316,
"grad_norm": 0.2333984375,
"learning_rate": 0.0004910039160123882,
"loss": 2.9786664962768556,
"step": 5280
},
{
"epoch": 0.1824515416982824,
"grad_norm": 0.2109375,
"learning_rate": 0.0004909686829705217,
"loss": 2.948029708862305,
"step": 5290
},
{
"epoch": 0.18279644064289163,
"grad_norm": 0.2392578125,
"learning_rate": 0.0004909333824057552,
"loss": 2.9685604095458986,
"step": 5300
},
{
"epoch": 0.18279644064289163,
"eval_loss": 3.136223077774048,
"eval_runtime": 6.8053,
"eval_samples_per_second": 48.051,
"eval_steps_per_second": 1.616,
"step": 5300
},
{
"epoch": 0.18314133958750087,
"grad_norm": 0.2353515625,
"learning_rate": 0.0004908980143285221,
"loss": 2.944846343994141,
"step": 5310
},
{
"epoch": 0.1834862385321101,
"grad_norm": 0.240234375,
"learning_rate": 0.0004908625787492751,
"loss": 2.944388008117676,
"step": 5320
},
{
"epoch": 0.1838311374767193,
"grad_norm": 0.228515625,
"learning_rate": 0.0004908270756784868,
"loss": 2.961709213256836,
"step": 5330
},
{
"epoch": 0.18417603642132854,
"grad_norm": 0.2216796875,
"learning_rate": 0.0004907915051266502,
"loss": 2.9545183181762695,
"step": 5340
},
{
"epoch": 0.18452093536593778,
"grad_norm": 0.2216796875,
"learning_rate": 0.0004907558671042781,
"loss": 2.945513153076172,
"step": 5350
},
{
"epoch": 0.184865834310547,
"grad_norm": 0.2119140625,
"learning_rate": 0.0004907201616219029,
"loss": 2.9108417510986326,
"step": 5360
},
{
"epoch": 0.18521073325515625,
"grad_norm": 0.244140625,
"learning_rate": 0.0004906843886900773,
"loss": 2.960129165649414,
"step": 5370
},
{
"epoch": 0.18555563219976548,
"grad_norm": 0.21875,
"learning_rate": 0.000490648548319374,
"loss": 2.9885751724243166,
"step": 5380
},
{
"epoch": 0.1859005311443747,
"grad_norm": 0.236328125,
"learning_rate": 0.0004906126405203853,
"loss": 2.950654220581055,
"step": 5390
},
{
"epoch": 0.18624543008898392,
"grad_norm": 0.244140625,
"learning_rate": 0.0004905766653037235,
"loss": 2.9581636428833007,
"step": 5400
},
{
"epoch": 0.18624543008898392,
"eval_loss": 3.147744655609131,
"eval_runtime": 6.8204,
"eval_samples_per_second": 47.944,
"eval_steps_per_second": 1.613,
"step": 5400
},
{
"epoch": 0.18659032903359316,
"grad_norm": 0.255859375,
"learning_rate": 0.0004905406226800212,
"loss": 2.948745918273926,
"step": 5410
},
{
"epoch": 0.1869352279782024,
"grad_norm": 0.23828125,
"learning_rate": 0.0004905045126599302,
"loss": 2.9636159896850587,
"step": 5420
},
{
"epoch": 0.18728012692281162,
"grad_norm": 0.203125,
"learning_rate": 0.0004904683352541232,
"loss": 2.9364925384521485,
"step": 5430
},
{
"epoch": 0.18762502586742086,
"grad_norm": 0.220703125,
"learning_rate": 0.0004904320904732919,
"loss": 2.946030044555664,
"step": 5440
},
{
"epoch": 0.18796992481203006,
"grad_norm": 0.236328125,
"learning_rate": 0.0004903957783281483,
"loss": 2.955285835266113,
"step": 5450
},
{
"epoch": 0.1883148237566393,
"grad_norm": 0.263671875,
"learning_rate": 0.0004903593988294245,
"loss": 2.968264579772949,
"step": 5460
},
{
"epoch": 0.18865972270124853,
"grad_norm": 0.2265625,
"learning_rate": 0.000490322951987872,
"loss": 2.933293342590332,
"step": 5470
},
{
"epoch": 0.18900462164585777,
"grad_norm": 0.27734375,
"learning_rate": 0.0004902864378142628,
"loss": 2.9185680389404296,
"step": 5480
},
{
"epoch": 0.189349520590467,
"grad_norm": 0.220703125,
"learning_rate": 0.0004902498563193882,
"loss": 2.9825998306274415,
"step": 5490
},
{
"epoch": 0.18969441953507624,
"grad_norm": 0.23828125,
"learning_rate": 0.0004902132075140601,
"loss": 2.9420900344848633,
"step": 5500
},
{
"epoch": 0.18969441953507624,
"eval_loss": 3.130540370941162,
"eval_runtime": 6.813,
"eval_samples_per_second": 47.996,
"eval_steps_per_second": 1.615,
"step": 5500
},
{
"epoch": 0.19003931847968544,
"grad_norm": 0.2119140625,
"learning_rate": 0.0004901764914091095,
"loss": 2.940257263183594,
"step": 5510
},
{
"epoch": 0.19038421742429468,
"grad_norm": 0.2060546875,
"learning_rate": 0.0004901397080153878,
"loss": 2.967739486694336,
"step": 5520
},
{
"epoch": 0.1907291163689039,
"grad_norm": 0.220703125,
"learning_rate": 0.0004901028573437663,
"loss": 2.9387725830078124,
"step": 5530
},
{
"epoch": 0.19107401531351315,
"grad_norm": 0.2236328125,
"learning_rate": 0.0004900659394051359,
"loss": 2.9443140029907227,
"step": 5540
},
{
"epoch": 0.19141891425812238,
"grad_norm": 0.2216796875,
"learning_rate": 0.0004900289542104075,
"loss": 2.941057586669922,
"step": 5550
},
{
"epoch": 0.1917638132027316,
"grad_norm": 0.2421875,
"learning_rate": 0.0004899919017705122,
"loss": 2.9690261840820313,
"step": 5560
},
{
"epoch": 0.19210871214734082,
"grad_norm": 0.23828125,
"learning_rate": 0.0004899547820964004,
"loss": 2.933773994445801,
"step": 5570
},
{
"epoch": 0.19245361109195006,
"grad_norm": 0.2333984375,
"learning_rate": 0.0004899175951990427,
"loss": 2.9384889602661133,
"step": 5580
},
{
"epoch": 0.1927985100365593,
"grad_norm": 0.2412109375,
"learning_rate": 0.0004898803410894295,
"loss": 2.924280548095703,
"step": 5590
},
{
"epoch": 0.19314340898116852,
"grad_norm": 0.2216796875,
"learning_rate": 0.0004898430197785713,
"loss": 2.946701240539551,
"step": 5600
},
{
"epoch": 0.19314340898116852,
"eval_loss": 3.126265048980713,
"eval_runtime": 6.8128,
"eval_samples_per_second": 47.998,
"eval_steps_per_second": 1.615,
"step": 5600
},
{
"epoch": 0.19348830792577776,
"grad_norm": 0.234375,
"learning_rate": 0.0004898056312774979,
"loss": 2.9281982421875,
"step": 5610
},
{
"epoch": 0.19383320687038696,
"grad_norm": 0.216796875,
"learning_rate": 0.0004897681755972596,
"loss": 2.924086570739746,
"step": 5620
},
{
"epoch": 0.1941781058149962,
"grad_norm": 0.220703125,
"learning_rate": 0.0004897306527489262,
"loss": 2.937215042114258,
"step": 5630
},
{
"epoch": 0.19452300475960543,
"grad_norm": 0.2353515625,
"learning_rate": 0.0004896930627435873,
"loss": 2.8927446365356446,
"step": 5640
},
{
"epoch": 0.19486790370421467,
"grad_norm": 0.21875,
"learning_rate": 0.0004896554055923525,
"loss": 2.9507640838623046,
"step": 5650
},
{
"epoch": 0.1952128026488239,
"grad_norm": 0.255859375,
"learning_rate": 0.0004896176813063512,
"loss": 2.9396808624267576,
"step": 5660
},
{
"epoch": 0.19555770159343314,
"grad_norm": 0.2470703125,
"learning_rate": 0.0004895798898967327,
"loss": 2.9674518585205076,
"step": 5670
},
{
"epoch": 0.19590260053804234,
"grad_norm": 0.224609375,
"learning_rate": 0.0004895420313746661,
"loss": 2.9632637023925783,
"step": 5680
},
{
"epoch": 0.19624749948265158,
"grad_norm": 0.2255859375,
"learning_rate": 0.0004895041057513403,
"loss": 2.967760467529297,
"step": 5690
},
{
"epoch": 0.1965923984272608,
"grad_norm": 0.216796875,
"learning_rate": 0.0004894661130379639,
"loss": 2.9013383865356444,
"step": 5700
},
{
"epoch": 0.1965923984272608,
"eval_loss": 3.121634006500244,
"eval_runtime": 6.8291,
"eval_samples_per_second": 47.884,
"eval_steps_per_second": 1.611,
"step": 5700
},
{
"epoch": 0.19693729737187005,
"grad_norm": 0.2109375,
"learning_rate": 0.0004894280532457656,
"loss": 2.918315124511719,
"step": 5710
},
{
"epoch": 0.19728219631647928,
"grad_norm": 0.232421875,
"learning_rate": 0.0004893899263859939,
"loss": 2.9516460418701174,
"step": 5720
},
{
"epoch": 0.19762709526108851,
"grad_norm": 0.267578125,
"learning_rate": 0.0004893517324699168,
"loss": 2.911311912536621,
"step": 5730
},
{
"epoch": 0.19797199420569772,
"grad_norm": 0.21875,
"learning_rate": 0.0004893134715088224,
"loss": 2.972389030456543,
"step": 5740
},
{
"epoch": 0.19831689315030696,
"grad_norm": 0.2451171875,
"learning_rate": 0.0004892751435140189,
"loss": 2.9304439544677736,
"step": 5750
},
{
"epoch": 0.1986617920949162,
"grad_norm": 0.212890625,
"learning_rate": 0.0004892367484968335,
"loss": 2.9385852813720703,
"step": 5760
},
{
"epoch": 0.19900669103952542,
"grad_norm": 0.23046875,
"learning_rate": 0.0004891982864686138,
"loss": 2.9378582000732423,
"step": 5770
},
{
"epoch": 0.19935158998413466,
"grad_norm": 0.234375,
"learning_rate": 0.0004891597574407273,
"loss": 2.9304388046264647,
"step": 5780
},
{
"epoch": 0.19969648892874386,
"grad_norm": 0.224609375,
"learning_rate": 0.0004891211614245608,
"loss": 2.948497009277344,
"step": 5790
},
{
"epoch": 0.2000413878733531,
"grad_norm": 0.23828125,
"learning_rate": 0.0004890824984315214,
"loss": 2.9190345764160157,
"step": 5800
},
{
"epoch": 0.2000413878733531,
"eval_loss": 3.122713804244995,
"eval_runtime": 6.8165,
"eval_samples_per_second": 47.972,
"eval_steps_per_second": 1.614,
"step": 5800
},
{
"epoch": 0.20038628681796233,
"grad_norm": 0.2412109375,
"learning_rate": 0.0004890437684730355,
"loss": 2.957596778869629,
"step": 5810
},
{
"epoch": 0.20073118576257157,
"grad_norm": 0.228515625,
"learning_rate": 0.0004890049715605499,
"loss": 2.9663761138916014,
"step": 5820
},
{
"epoch": 0.2010760847071808,
"grad_norm": 0.25390625,
"learning_rate": 0.0004889661077055307,
"loss": 2.9496397018432616,
"step": 5830
},
{
"epoch": 0.20142098365179004,
"grad_norm": 0.22265625,
"learning_rate": 0.0004889271769194639,
"loss": 2.9407833099365233,
"step": 5840
},
{
"epoch": 0.20176588259639924,
"grad_norm": 0.2333984375,
"learning_rate": 0.0004888881792138554,
"loss": 2.972163963317871,
"step": 5850
},
{
"epoch": 0.20211078154100848,
"grad_norm": 0.23046875,
"learning_rate": 0.0004888491146002306,
"loss": 2.9447059631347656,
"step": 5860
},
{
"epoch": 0.2024556804856177,
"grad_norm": 0.2255859375,
"learning_rate": 0.0004888099830901352,
"loss": 2.9304573059082033,
"step": 5870
},
{
"epoch": 0.20280057943022695,
"grad_norm": 0.216796875,
"learning_rate": 0.0004887707846951341,
"loss": 2.9314733505249024,
"step": 5880
},
{
"epoch": 0.20314547837483618,
"grad_norm": 0.2119140625,
"learning_rate": 0.0004887315194268123,
"loss": 2.9163957595825196,
"step": 5890
},
{
"epoch": 0.20349037731944541,
"grad_norm": 0.248046875,
"learning_rate": 0.0004886921872967745,
"loss": 2.9023399353027344,
"step": 5900
},
{
"epoch": 0.20349037731944541,
"eval_loss": 3.111980438232422,
"eval_runtime": 6.7925,
"eval_samples_per_second": 48.141,
"eval_steps_per_second": 1.619,
"step": 5900
},
{
"epoch": 0.20383527626405462,
"grad_norm": 0.2197265625,
"learning_rate": 0.000488652788316645,
"loss": 2.9696720123291014,
"step": 5910
},
{
"epoch": 0.20418017520866386,
"grad_norm": 0.2373046875,
"learning_rate": 0.0004886133224980681,
"loss": 2.96008243560791,
"step": 5920
},
{
"epoch": 0.2045250741532731,
"grad_norm": 0.2109375,
"learning_rate": 0.0004885737898527078,
"loss": 2.9522701263427735,
"step": 5930
},
{
"epoch": 0.20486997309788232,
"grad_norm": 0.2099609375,
"learning_rate": 0.0004885341903922476,
"loss": 2.9466459274291994,
"step": 5940
},
{
"epoch": 0.20521487204249156,
"grad_norm": 0.240234375,
"learning_rate": 0.0004884945241283913,
"loss": 2.9266565322875975,
"step": 5950
},
{
"epoch": 0.2055597709871008,
"grad_norm": 0.2109375,
"learning_rate": 0.0004884547910728617,
"loss": 2.910065269470215,
"step": 5960
},
{
"epoch": 0.20590466993171,
"grad_norm": 0.22265625,
"learning_rate": 0.0004884149912374019,
"loss": 2.970027542114258,
"step": 5970
},
{
"epoch": 0.20624956887631923,
"grad_norm": 0.21875,
"learning_rate": 0.0004883751246337746,
"loss": 2.926654815673828,
"step": 5980
},
{
"epoch": 0.20659446782092847,
"grad_norm": 0.21875,
"learning_rate": 0.000488335191273762,
"loss": 2.9630802154541014,
"step": 5990
},
{
"epoch": 0.2069393667655377,
"grad_norm": 0.2265625,
"learning_rate": 0.0004882951911691666,
"loss": 2.9407182693481446,
"step": 6000
},
{
"epoch": 0.2069393667655377,
"eval_loss": 3.115058660507202,
"eval_runtime": 6.867,
"eval_samples_per_second": 47.619,
"eval_steps_per_second": 1.602,
"step": 6000
},
{
"epoch": 0.20728426571014694,
"grad_norm": 0.2119140625,
"learning_rate": 0.0004882551243318099,
"loss": 2.9117368698120116,
"step": 6010
},
{
"epoch": 0.20762916465475614,
"grad_norm": 0.236328125,
"learning_rate": 0.0004882149907735336,
"loss": 2.944511604309082,
"step": 6020
},
{
"epoch": 0.20797406359936538,
"grad_norm": 0.2392578125,
"learning_rate": 0.000488174790506199,
"loss": 2.947153663635254,
"step": 6030
},
{
"epoch": 0.2083189625439746,
"grad_norm": 0.25390625,
"learning_rate": 0.0004881345235416871,
"loss": 2.93719596862793,
"step": 6040
},
{
"epoch": 0.20866386148858385,
"grad_norm": 0.26171875,
"learning_rate": 0.00048809418989189865,
"loss": 2.9408388137817383,
"step": 6050
},
{
"epoch": 0.20900876043319308,
"grad_norm": 0.2265625,
"learning_rate": 0.0004880537895687541,
"loss": 2.954499053955078,
"step": 6060
},
{
"epoch": 0.20935365937780231,
"grad_norm": 0.2265625,
"learning_rate": 0.00048801332258419344,
"loss": 2.9254438400268556,
"step": 6070
},
{
"epoch": 0.20969855832241152,
"grad_norm": 0.234375,
"learning_rate": 0.00048797278895017666,
"loss": 2.931148338317871,
"step": 6080
},
{
"epoch": 0.21004345726702076,
"grad_norm": 0.255859375,
"learning_rate": 0.0004879321886786832,
"loss": 2.927779769897461,
"step": 6090
},
{
"epoch": 0.21038835621163,
"grad_norm": 0.240234375,
"learning_rate": 0.00048789152178171235,
"loss": 2.9477685928344726,
"step": 6100
},
{
"epoch": 0.21038835621163,
"eval_loss": 3.1181752681732178,
"eval_runtime": 6.8071,
"eval_samples_per_second": 48.038,
"eval_steps_per_second": 1.616,
"step": 6100
},
{
"epoch": 0.21073325515623922,
"grad_norm": 0.232421875,
"learning_rate": 0.0004878507882712831,
"loss": 2.9507234573364256,
"step": 6110
},
{
"epoch": 0.21107815410084846,
"grad_norm": 0.212890625,
"learning_rate": 0.0004878099881594339,
"loss": 2.9332416534423826,
"step": 6120
},
{
"epoch": 0.2114230530454577,
"grad_norm": 0.234375,
"learning_rate": 0.0004877691214582232,
"loss": 2.9169775009155274,
"step": 6130
},
{
"epoch": 0.2117679519900669,
"grad_norm": 0.2333984375,
"learning_rate": 0.00048772818817972873,
"loss": 2.9464527130126954,
"step": 6140
},
{
"epoch": 0.21211285093467613,
"grad_norm": 0.2265625,
"learning_rate": 0.00048768718833604836,
"loss": 2.94616813659668,
"step": 6150
},
{
"epoch": 0.21245774987928537,
"grad_norm": 0.23828125,
"learning_rate": 0.00048764612193929937,
"loss": 2.948628044128418,
"step": 6160
},
{
"epoch": 0.2128026488238946,
"grad_norm": 0.224609375,
"learning_rate": 0.00048760498900161865,
"loss": 2.9061281204223635,
"step": 6170
},
{
"epoch": 0.21314754776850384,
"grad_norm": 0.2333984375,
"learning_rate": 0.00048756378953516294,
"loss": 2.938188171386719,
"step": 6180
},
{
"epoch": 0.21349244671311307,
"grad_norm": 0.255859375,
"learning_rate": 0.00048752252355210857,
"loss": 2.9095922470092774,
"step": 6190
},
{
"epoch": 0.21383734565772228,
"grad_norm": 0.23046875,
"learning_rate": 0.00048748119106465157,
"loss": 2.9191511154174803,
"step": 6200
},
{
"epoch": 0.21383734565772228,
"eval_loss": 3.1247401237487793,
"eval_runtime": 6.8096,
"eval_samples_per_second": 48.021,
"eval_steps_per_second": 1.615,
"step": 6200
},
{
"epoch": 0.2141822446023315,
"grad_norm": 0.255859375,
"learning_rate": 0.0004874397920850074,
"loss": 2.9448171615600587,
"step": 6210
},
{
"epoch": 0.21452714354694075,
"grad_norm": 0.224609375,
"learning_rate": 0.00048739832662541145,
"loss": 2.9186744689941406,
"step": 6220
},
{
"epoch": 0.21487204249154998,
"grad_norm": 0.25,
"learning_rate": 0.00048735679469811866,
"loss": 2.88161563873291,
"step": 6230
},
{
"epoch": 0.21521694143615921,
"grad_norm": 0.2158203125,
"learning_rate": 0.00048731519631540354,
"loss": 2.919352722167969,
"step": 6240
},
{
"epoch": 0.21556184038076842,
"grad_norm": 0.2119140625,
"learning_rate": 0.00048727353148956046,
"loss": 2.9212326049804687,
"step": 6250
},
{
"epoch": 0.21590673932537766,
"grad_norm": 0.216796875,
"learning_rate": 0.000487231800232903,
"loss": 2.921360397338867,
"step": 6260
},
{
"epoch": 0.2162516382699869,
"grad_norm": 0.2314453125,
"learning_rate": 0.0004871900025577649,
"loss": 2.9270441055297853,
"step": 6270
},
{
"epoch": 0.21659653721459612,
"grad_norm": 0.2451171875,
"learning_rate": 0.00048714813847649917,
"loss": 2.9321136474609375,
"step": 6280
},
{
"epoch": 0.21694143615920536,
"grad_norm": 0.23046875,
"learning_rate": 0.0004871062080014786,
"loss": 2.935541534423828,
"step": 6290
},
{
"epoch": 0.2172863351038146,
"grad_norm": 0.2470703125,
"learning_rate": 0.0004870642111450956,
"loss": 2.914782905578613,
"step": 6300
},
{
"epoch": 0.2172863351038146,
"eval_loss": 3.1243624687194824,
"eval_runtime": 6.8131,
"eval_samples_per_second": 47.996,
"eval_steps_per_second": 1.615,
"step": 6300
},
{
"epoch": 0.2176312340484238,
"grad_norm": 0.2333984375,
"learning_rate": 0.000487022147919762,
"loss": 2.941673469543457,
"step": 6310
},
{
"epoch": 0.21797613299303303,
"grad_norm": 0.2158203125,
"learning_rate": 0.00048698001833790945,
"loss": 2.935510444641113,
"step": 6320
},
{
"epoch": 0.21832103193764227,
"grad_norm": 0.2431640625,
"learning_rate": 0.00048693782241198926,
"loss": 2.9452632904052733,
"step": 6330
},
{
"epoch": 0.2186659308822515,
"grad_norm": 0.2177734375,
"learning_rate": 0.0004868955601544721,
"loss": 2.9349176406860353,
"step": 6340
},
{
"epoch": 0.21901082982686074,
"grad_norm": 0.2412109375,
"learning_rate": 0.0004868532315778485,
"loss": 2.9314014434814455,
"step": 6350
},
{
"epoch": 0.21935572877146997,
"grad_norm": 0.2294921875,
"learning_rate": 0.00048681083669462847,
"loss": 2.923857879638672,
"step": 6360
},
{
"epoch": 0.21970062771607918,
"grad_norm": 0.2197265625,
"learning_rate": 0.00048676837551734156,
"loss": 2.9235401153564453,
"step": 6370
},
{
"epoch": 0.2200455266606884,
"grad_norm": 0.21875,
"learning_rate": 0.00048672584805853705,
"loss": 2.9105674743652346,
"step": 6380
},
{
"epoch": 0.22039042560529765,
"grad_norm": 0.2353515625,
"learning_rate": 0.00048668325433078377,
"loss": 2.9641794204711913,
"step": 6390
},
{
"epoch": 0.22073532454990688,
"grad_norm": 0.25390625,
"learning_rate": 0.00048664059434666996,
"loss": 2.9338321685791016,
"step": 6400
},
{
"epoch": 0.22073532454990688,
"eval_loss": 3.118654489517212,
"eval_runtime": 6.8272,
"eval_samples_per_second": 47.897,
"eval_steps_per_second": 1.611,
"step": 6400
},
{
"epoch": 0.22108022349451611,
"grad_norm": 0.232421875,
"learning_rate": 0.0004865978681188038,
"loss": 2.9640241622924806,
"step": 6410
},
{
"epoch": 0.22142512243912535,
"grad_norm": 0.2177734375,
"learning_rate": 0.0004865550756598126,
"loss": 2.9090980529785155,
"step": 6420
},
{
"epoch": 0.22177002138373456,
"grad_norm": 0.2265625,
"learning_rate": 0.00048651221698234364,
"loss": 2.939912223815918,
"step": 6430
},
{
"epoch": 0.2221149203283438,
"grad_norm": 0.216796875,
"learning_rate": 0.0004864692920990636,
"loss": 2.934763526916504,
"step": 6440
},
{
"epoch": 0.22245981927295302,
"grad_norm": 0.3046875,
"learning_rate": 0.0004864263010226587,
"loss": 2.936397743225098,
"step": 6450
},
{
"epoch": 0.22280471821756226,
"grad_norm": 0.23828125,
"learning_rate": 0.00048638324376583484,
"loss": 2.9405590057373048,
"step": 6460
},
{
"epoch": 0.2231496171621715,
"grad_norm": 0.2275390625,
"learning_rate": 0.00048634012034131724,
"loss": 2.8913330078125,
"step": 6470
},
{
"epoch": 0.2234945161067807,
"grad_norm": 0.240234375,
"learning_rate": 0.00048629693076185094,
"loss": 2.9031755447387697,
"step": 6480
},
{
"epoch": 0.22383941505138993,
"grad_norm": 0.2119140625,
"learning_rate": 0.0004862536750402004,
"loss": 2.9500730514526365,
"step": 6490
},
{
"epoch": 0.22418431399599917,
"grad_norm": 0.2373046875,
"learning_rate": 0.0004862103531891497,
"loss": 2.9305023193359374,
"step": 6500
},
{
"epoch": 0.22418431399599917,
"eval_loss": 3.1145131587982178,
"eval_runtime": 6.8166,
"eval_samples_per_second": 47.971,
"eval_steps_per_second": 1.614,
"step": 6500
},
{
"epoch": 0.2245292129406084,
"grad_norm": 0.2392578125,
"learning_rate": 0.00048616696522150234,
"loss": 2.9475831985473633,
"step": 6510
},
{
"epoch": 0.22487411188521764,
"grad_norm": 0.2099609375,
"learning_rate": 0.00048612351115008155,
"loss": 2.9322816848754885,
"step": 6520
},
{
"epoch": 0.22521901082982687,
"grad_norm": 0.21484375,
"learning_rate": 0.00048607999098772986,
"loss": 2.9325334548950197,
"step": 6530
},
{
"epoch": 0.22556390977443608,
"grad_norm": 0.248046875,
"learning_rate": 0.0004860364047473096,
"loss": 2.9308235168457033,
"step": 6540
},
{
"epoch": 0.2259088087190453,
"grad_norm": 0.216796875,
"learning_rate": 0.00048599275244170235,
"loss": 2.9516983032226562,
"step": 6550
},
{
"epoch": 0.22625370766365455,
"grad_norm": 0.2216796875,
"learning_rate": 0.00048594903408380946,
"loss": 2.9532941818237304,
"step": 6560
},
{
"epoch": 0.22659860660826378,
"grad_norm": 0.26171875,
"learning_rate": 0.0004859052496865516,
"loss": 2.938241386413574,
"step": 6570
},
{
"epoch": 0.22694350555287301,
"grad_norm": 0.232421875,
"learning_rate": 0.00048586139926286916,
"loss": 2.9100818634033203,
"step": 6580
},
{
"epoch": 0.22728840449748225,
"grad_norm": 0.23046875,
"learning_rate": 0.0004858174828257219,
"loss": 2.921408462524414,
"step": 6590
},
{
"epoch": 0.22763330344209146,
"grad_norm": 0.216796875,
"learning_rate": 0.00048577350038808904,
"loss": 2.9440067291259764,
"step": 6600
},
{
"epoch": 0.22763330344209146,
"eval_loss": 3.090876817703247,
"eval_runtime": 6.8316,
"eval_samples_per_second": 47.866,
"eval_steps_per_second": 1.61,
"step": 6600
},
{
"epoch": 0.2279782023867007,
"grad_norm": 0.2353515625,
"learning_rate": 0.00048572945196296945,
"loss": 2.8909435272216797,
"step": 6610
},
{
"epoch": 0.22832310133130992,
"grad_norm": 0.220703125,
"learning_rate": 0.00048568533756338157,
"loss": 2.9205949783325194,
"step": 6620
},
{
"epoch": 0.22866800027591916,
"grad_norm": 0.236328125,
"learning_rate": 0.0004856411572023631,
"loss": 2.9317556381225587,
"step": 6630
},
{
"epoch": 0.2290128992205284,
"grad_norm": 0.228515625,
"learning_rate": 0.00048559691089297127,
"loss": 2.9168882369995117,
"step": 6640
},
{
"epoch": 0.22935779816513763,
"grad_norm": 0.2451171875,
"learning_rate": 0.00048555259864828295,
"loss": 2.946694183349609,
"step": 6650
},
{
"epoch": 0.22970269710974683,
"grad_norm": 0.2431640625,
"learning_rate": 0.0004855082204813945,
"loss": 2.9441465377807616,
"step": 6660
},
{
"epoch": 0.23004759605435607,
"grad_norm": 0.2255859375,
"learning_rate": 0.00048546377640542156,
"loss": 2.956826400756836,
"step": 6670
},
{
"epoch": 0.2303924949989653,
"grad_norm": 0.236328125,
"learning_rate": 0.00048541926643349957,
"loss": 2.9312650680541994,
"step": 6680
},
{
"epoch": 0.23073739394357454,
"grad_norm": 0.2255859375,
"learning_rate": 0.00048537469057878297,
"loss": 2.93796443939209,
"step": 6690
},
{
"epoch": 0.23108229288818377,
"grad_norm": 0.2158203125,
"learning_rate": 0.0004853300488544463,
"loss": 2.9332632064819335,
"step": 6700
},
{
"epoch": 0.23108229288818377,
"eval_loss": 3.1144378185272217,
"eval_runtime": 6.8187,
"eval_samples_per_second": 47.956,
"eval_steps_per_second": 1.613,
"step": 6700
},
{
"epoch": 0.23142719183279298,
"grad_norm": 0.23828125,
"learning_rate": 0.00048528534127368283,
"loss": 2.8993963241577148,
"step": 6710
},
{
"epoch": 0.2317720907774022,
"grad_norm": 0.2314453125,
"learning_rate": 0.00048524056784970596,
"loss": 2.9221208572387694,
"step": 6720
},
{
"epoch": 0.23211698972201145,
"grad_norm": 0.2314453125,
"learning_rate": 0.0004851957285957483,
"loss": 2.917343330383301,
"step": 6730
},
{
"epoch": 0.23246188866662068,
"grad_norm": 0.267578125,
"learning_rate": 0.0004851508235250617,
"loss": 2.9634822845458983,
"step": 6740
},
{
"epoch": 0.23280678761122992,
"grad_norm": 0.259765625,
"learning_rate": 0.0004851058526509178,
"loss": 2.910009002685547,
"step": 6750
},
{
"epoch": 0.23315168655583915,
"grad_norm": 0.2177734375,
"learning_rate": 0.0004850608159866075,
"loss": 2.9299671173095705,
"step": 6760
},
{
"epoch": 0.23349658550044836,
"grad_norm": 0.2216796875,
"learning_rate": 0.0004850157135454411,
"loss": 2.9386728286743162,
"step": 6770
},
{
"epoch": 0.2338414844450576,
"grad_norm": 0.224609375,
"learning_rate": 0.00048497054534074857,
"loss": 2.928000259399414,
"step": 6780
},
{
"epoch": 0.23418638338966682,
"grad_norm": 0.2373046875,
"learning_rate": 0.00048492531138587914,
"loss": 2.9296024322509764,
"step": 6790
},
{
"epoch": 0.23453128233427606,
"grad_norm": 0.228515625,
"learning_rate": 0.0004848800116942014,
"loss": 2.9159997940063476,
"step": 6800
},
{
"epoch": 0.23453128233427606,
"eval_loss": 3.1205053329467773,
"eval_runtime": 6.8376,
"eval_samples_per_second": 47.824,
"eval_steps_per_second": 1.609,
"step": 6800
},
{
"epoch": 0.2348761812788853,
"grad_norm": 0.2158203125,
"learning_rate": 0.00048483464627910354,
"loss": 2.915631103515625,
"step": 6810
},
{
"epoch": 0.23522108022349453,
"grad_norm": 0.2236328125,
"learning_rate": 0.00048478921515399316,
"loss": 2.921986961364746,
"step": 6820
},
{
"epoch": 0.23556597916810373,
"grad_norm": 0.20703125,
"learning_rate": 0.0004847437183322971,
"loss": 2.9156558990478514,
"step": 6830
},
{
"epoch": 0.23591087811271297,
"grad_norm": 0.24609375,
"learning_rate": 0.0004846981558274619,
"loss": 2.9449398040771486,
"step": 6840
},
{
"epoch": 0.2362557770573222,
"grad_norm": 0.23046875,
"learning_rate": 0.00048465252765295325,
"loss": 2.916766548156738,
"step": 6850
},
{
"epoch": 0.23660067600193144,
"grad_norm": 0.236328125,
"learning_rate": 0.0004846068338222564,
"loss": 2.9411689758300783,
"step": 6860
},
{
"epoch": 0.23694557494654067,
"grad_norm": 0.2333984375,
"learning_rate": 0.00048456107434887585,
"loss": 2.9139921188354494,
"step": 6870
},
{
"epoch": 0.2372904738911499,
"grad_norm": 0.240234375,
"learning_rate": 0.00048451524924633573,
"loss": 2.9304178237915037,
"step": 6880
},
{
"epoch": 0.2376353728357591,
"grad_norm": 0.2265625,
"learning_rate": 0.00048446935852817943,
"loss": 2.9133159637451174,
"step": 6890
},
{
"epoch": 0.23798027178036835,
"grad_norm": 0.220703125,
"learning_rate": 0.00048442340220796967,
"loss": 2.8832542419433596,
"step": 6900
},
{
"epoch": 0.23798027178036835,
"eval_loss": 3.121171236038208,
"eval_runtime": 6.8337,
"eval_samples_per_second": 47.851,
"eval_steps_per_second": 1.61,
"step": 6900
},
{
"epoch": 0.23832517072497758,
"grad_norm": 0.228515625,
"learning_rate": 0.0004843773802992887,
"loss": 2.9310277938842773,
"step": 6910
},
{
"epoch": 0.23867006966958682,
"grad_norm": 0.2177734375,
"learning_rate": 0.00048433129281573814,
"loss": 2.9636621475219727,
"step": 6920
},
{
"epoch": 0.23901496861419605,
"grad_norm": 0.24609375,
"learning_rate": 0.0004842851397709388,
"loss": 2.9365089416503904,
"step": 6930
},
{
"epoch": 0.23935986755880528,
"grad_norm": 0.220703125,
"learning_rate": 0.00048423892117853114,
"loss": 2.94277400970459,
"step": 6940
},
{
"epoch": 0.2397047665034145,
"grad_norm": 0.2265625,
"learning_rate": 0.0004841926370521748,
"loss": 2.9524927139282227,
"step": 6950
},
{
"epoch": 0.24004966544802372,
"grad_norm": 0.2158203125,
"learning_rate": 0.0004841462874055487,
"loss": 2.9277170181274412,
"step": 6960
},
{
"epoch": 0.24039456439263296,
"grad_norm": 0.236328125,
"learning_rate": 0.00048409987225235166,
"loss": 2.962260627746582,
"step": 6970
},
{
"epoch": 0.2407394633372422,
"grad_norm": 0.21484375,
"learning_rate": 0.00048405339160630107,
"loss": 2.914175033569336,
"step": 6980
},
{
"epoch": 0.24108436228185143,
"grad_norm": 0.205078125,
"learning_rate": 0.00048400684548113426,
"loss": 2.922310447692871,
"step": 6990
},
{
"epoch": 0.24142926122646063,
"grad_norm": 0.2578125,
"learning_rate": 0.00048396023389060775,
"loss": 2.9141109466552733,
"step": 7000
},
{
"epoch": 0.24142926122646063,
"eval_loss": 3.116530418395996,
"eval_runtime": 6.8526,
"eval_samples_per_second": 47.719,
"eval_steps_per_second": 1.605,
"step": 7000
},
{
"epoch": 0.24177416017106987,
"grad_norm": 0.224609375,
"learning_rate": 0.0004839135568484973,
"loss": 2.9708431243896483,
"step": 7010
},
{
"epoch": 0.2421190591156791,
"grad_norm": 0.2265625,
"learning_rate": 0.0004838668143685981,
"loss": 2.9161773681640626,
"step": 7020
},
{
"epoch": 0.24246395806028834,
"grad_norm": 0.259765625,
"learning_rate": 0.00048382000646472485,
"loss": 2.923369216918945,
"step": 7030
},
{
"epoch": 0.24280885700489757,
"grad_norm": 0.251953125,
"learning_rate": 0.0004837731331507113,
"loss": 2.877602958679199,
"step": 7040
},
{
"epoch": 0.2431537559495068,
"grad_norm": 0.248046875,
"learning_rate": 0.0004837261944404105,
"loss": 2.921415901184082,
"step": 7050
},
{
"epoch": 0.243498654894116,
"grad_norm": 0.2099609375,
"learning_rate": 0.0004836791903476953,
"loss": 2.9126455307006838,
"step": 7060
},
{
"epoch": 0.24384355383872525,
"grad_norm": 0.267578125,
"learning_rate": 0.00048363212088645726,
"loss": 2.9458139419555662,
"step": 7070
},
{
"epoch": 0.24418845278333448,
"grad_norm": 0.26953125,
"learning_rate": 0.0004835849860706076,
"loss": 2.92777042388916,
"step": 7080
},
{
"epoch": 0.24453335172794372,
"grad_norm": 0.208984375,
"learning_rate": 0.000483537785914077,
"loss": 2.939556884765625,
"step": 7090
},
{
"epoch": 0.24487825067255295,
"grad_norm": 0.236328125,
"learning_rate": 0.0004834905204308151,
"loss": 2.9306768417358398,
"step": 7100
},
{
"epoch": 0.24487825067255295,
"eval_loss": 3.126533269882202,
"eval_runtime": 6.8424,
"eval_samples_per_second": 47.79,
"eval_steps_per_second": 1.608,
"step": 7100
},
{
"epoch": 0.24522314961716218,
"grad_norm": 0.224609375,
"learning_rate": 0.000483443189634791,
"loss": 2.911077880859375,
"step": 7110
},
{
"epoch": 0.2455680485617714,
"grad_norm": 0.2265625,
"learning_rate": 0.00048339579353999306,
"loss": 2.9036911010742186,
"step": 7120
},
{
"epoch": 0.24591294750638062,
"grad_norm": 0.20703125,
"learning_rate": 0.00048334833216042913,
"loss": 2.957064628601074,
"step": 7130
},
{
"epoch": 0.24625784645098986,
"grad_norm": 0.2138671875,
"learning_rate": 0.00048330080551012614,
"loss": 2.943134880065918,
"step": 7140
},
{
"epoch": 0.2466027453955991,
"grad_norm": 0.2490234375,
"learning_rate": 0.00048325321360313036,
"loss": 2.9274309158325194,
"step": 7150
},
{
"epoch": 0.24694764434020833,
"grad_norm": 0.216796875,
"learning_rate": 0.00048320555645350736,
"loss": 2.9225950241088867,
"step": 7160
},
{
"epoch": 0.24729254328481756,
"grad_norm": 0.23046875,
"learning_rate": 0.00048315783407534195,
"loss": 2.9422739028930662,
"step": 7170
},
{
"epoch": 0.24763744222942677,
"grad_norm": 0.216796875,
"learning_rate": 0.00048311004648273837,
"loss": 2.9058792114257814,
"step": 7180
},
{
"epoch": 0.247982341174036,
"grad_norm": 0.2392578125,
"learning_rate": 0.0004830621936898201,
"loss": 2.9241222381591796,
"step": 7190
},
{
"epoch": 0.24832724011864524,
"grad_norm": 0.212890625,
"learning_rate": 0.00048301427571072956,
"loss": 2.9027957916259766,
"step": 7200
},
{
"epoch": 0.24832724011864524,
"eval_loss": 3.1183176040649414,
"eval_runtime": 6.8372,
"eval_samples_per_second": 47.827,
"eval_steps_per_second": 1.609,
"step": 7200
},
{
"epoch": 0.24867213906325447,
"grad_norm": 0.2177734375,
"learning_rate": 0.0004829662925596289,
"loss": 2.898910713195801,
"step": 7210
},
{
"epoch": 0.2490170380078637,
"grad_norm": 0.21484375,
"learning_rate": 0.00048291824425069935,
"loss": 2.9299800872802733,
"step": 7220
},
{
"epoch": 0.2493619369524729,
"grad_norm": 0.220703125,
"learning_rate": 0.00048287013079814124,
"loss": 2.9169307708740235,
"step": 7230
},
{
"epoch": 0.24970683589708215,
"grad_norm": 0.2265625,
"learning_rate": 0.0004828219522161743,
"loss": 2.90466251373291,
"step": 7240
},
{
"epoch": 0.2500517348416914,
"grad_norm": 0.232421875,
"learning_rate": 0.0004827737085190376,
"loss": 2.9335451126098633,
"step": 7250
},
{
"epoch": 0.2503966337863006,
"grad_norm": 0.2373046875,
"learning_rate": 0.0004827253997209892,
"loss": 2.9106502532958984,
"step": 7260
},
{
"epoch": 0.2507415327309098,
"grad_norm": 0.2353515625,
"learning_rate": 0.0004826770258363067,
"loss": 2.9364431381225584,
"step": 7270
},
{
"epoch": 0.2510864316755191,
"grad_norm": 0.2421875,
"learning_rate": 0.00048262858687928673,
"loss": 2.9522266387939453,
"step": 7280
},
{
"epoch": 0.2514313306201283,
"grad_norm": 0.2158203125,
"learning_rate": 0.0004825800828642452,
"loss": 2.9148534774780273,
"step": 7290
},
{
"epoch": 0.25177622956473755,
"grad_norm": 0.271484375,
"learning_rate": 0.0004825315138055172,
"loss": 2.9190120697021484,
"step": 7300
},
{
"epoch": 0.25177622956473755,
"eval_loss": 3.09189510345459,
"eval_runtime": 6.8373,
"eval_samples_per_second": 47.826,
"eval_steps_per_second": 1.609,
"step": 7300
},
{
"epoch": 0.25212112850934676,
"grad_norm": 0.2119140625,
"learning_rate": 0.0004824828797174572,
"loss": 2.907255172729492,
"step": 7310
},
{
"epoch": 0.25246602745395597,
"grad_norm": 0.2314453125,
"learning_rate": 0.0004824341806144387,
"loss": 2.9031770706176756,
"step": 7320
},
{
"epoch": 0.2528109263985652,
"grad_norm": 0.2373046875,
"learning_rate": 0.00048238541651085456,
"loss": 2.894978332519531,
"step": 7330
},
{
"epoch": 0.25315582534317443,
"grad_norm": 0.2119140625,
"learning_rate": 0.0004823365874211167,
"loss": 2.895108222961426,
"step": 7340
},
{
"epoch": 0.2535007242877837,
"grad_norm": 0.21484375,
"learning_rate": 0.0004822876933596566,
"loss": 2.904713249206543,
"step": 7350
},
{
"epoch": 0.2538456232323929,
"grad_norm": 0.2177734375,
"learning_rate": 0.00048223873434092435,
"loss": 2.9330770492553713,
"step": 7360
},
{
"epoch": 0.25419052217700217,
"grad_norm": 0.25,
"learning_rate": 0.00048218971037938975,
"loss": 2.909575843811035,
"step": 7370
},
{
"epoch": 0.25453542112161137,
"grad_norm": 0.22265625,
"learning_rate": 0.00048214062148954157,
"loss": 2.9293270111083984,
"step": 7380
},
{
"epoch": 0.2548803200662206,
"grad_norm": 0.2333984375,
"learning_rate": 0.0004820914676858879,
"loss": 2.934307670593262,
"step": 7390
},
{
"epoch": 0.25522521901082984,
"grad_norm": 0.2275390625,
"learning_rate": 0.00048204224898295574,
"loss": 2.9084339141845703,
"step": 7400
},
{
"epoch": 0.25522521901082984,
"eval_loss": 3.1125600337982178,
"eval_runtime": 6.8026,
"eval_samples_per_second": 48.07,
"eval_steps_per_second": 1.617,
"step": 7400
},
{
"epoch": 0.25557011795543905,
"grad_norm": 0.224609375,
"learning_rate": 0.0004819929653952916,
"loss": 2.9171512603759764,
"step": 7410
},
{
"epoch": 0.2559150169000483,
"grad_norm": 0.232421875,
"learning_rate": 0.000481943616937461,
"loss": 2.9008132934570314,
"step": 7420
},
{
"epoch": 0.2562599158446575,
"grad_norm": 0.24609375,
"learning_rate": 0.0004818942036240487,
"loss": 2.924310874938965,
"step": 7430
},
{
"epoch": 0.2566048147892667,
"grad_norm": 0.240234375,
"learning_rate": 0.00048184472546965846,
"loss": 2.8931264877319336,
"step": 7440
},
{
"epoch": 0.256949713733876,
"grad_norm": 0.240234375,
"learning_rate": 0.00048179518248891333,
"loss": 2.9353042602539063,
"step": 7450
},
{
"epoch": 0.2572946126784852,
"grad_norm": 0.228515625,
"learning_rate": 0.0004817455746964557,
"loss": 2.9459924697875977,
"step": 7460
},
{
"epoch": 0.25763951162309445,
"grad_norm": 0.21484375,
"learning_rate": 0.00048169590210694684,
"loss": 2.9280765533447264,
"step": 7470
},
{
"epoch": 0.25798441056770366,
"grad_norm": 0.240234375,
"learning_rate": 0.0004816461647350672,
"loss": 2.931351661682129,
"step": 7480
},
{
"epoch": 0.25832930951231287,
"grad_norm": 0.232421875,
"learning_rate": 0.0004815963625955164,
"loss": 2.8771490097045898,
"step": 7490
},
{
"epoch": 0.25867420845692213,
"grad_norm": 0.2236328125,
"learning_rate": 0.0004815464957030134,
"loss": 2.897832489013672,
"step": 7500
},
{
"epoch": 0.25867420845692213,
"eval_loss": 3.104717969894409,
"eval_runtime": 6.8403,
"eval_samples_per_second": 47.805,
"eval_steps_per_second": 1.608,
"step": 7500
},
{
"epoch": 0.25901910740153133,
"grad_norm": 0.2021484375,
"learning_rate": 0.0004814965640722961,
"loss": 2.9176025390625,
"step": 7510
},
{
"epoch": 0.2593640063461406,
"grad_norm": 0.2236328125,
"learning_rate": 0.00048144656771812144,
"loss": 2.918319892883301,
"step": 7520
},
{
"epoch": 0.2597089052907498,
"grad_norm": 0.2373046875,
"learning_rate": 0.00048139650665526574,
"loss": 2.891171455383301,
"step": 7530
},
{
"epoch": 0.26005380423535907,
"grad_norm": 0.244140625,
"learning_rate": 0.00048134638089852426,
"loss": 2.8993497848510743,
"step": 7540
},
{
"epoch": 0.26039870317996827,
"grad_norm": 0.232421875,
"learning_rate": 0.00048129619046271156,
"loss": 2.8940078735351564,
"step": 7550
},
{
"epoch": 0.2607436021245775,
"grad_norm": 0.236328125,
"learning_rate": 0.000481245935362661,
"loss": 2.9011760711669923,
"step": 7560
},
{
"epoch": 0.26108850106918674,
"grad_norm": 0.2216796875,
"learning_rate": 0.0004811956156132255,
"loss": 2.9280242919921875,
"step": 7570
},
{
"epoch": 0.26143340001379595,
"grad_norm": 0.24609375,
"learning_rate": 0.00048114523122927665,
"loss": 2.9348657608032225,
"step": 7580
},
{
"epoch": 0.2617782989584052,
"grad_norm": 0.2275390625,
"learning_rate": 0.0004810947822257053,
"loss": 2.877024269104004,
"step": 7590
},
{
"epoch": 0.2621231979030144,
"grad_norm": 0.201171875,
"learning_rate": 0.00048104426861742157,
"loss": 2.9315607070922853,
"step": 7600
},
{
"epoch": 0.2621231979030144,
"eval_loss": 3.1030023097991943,
"eval_runtime": 6.8297,
"eval_samples_per_second": 47.879,
"eval_steps_per_second": 1.611,
"step": 7600
},
{
"epoch": 0.2624680968476236,
"grad_norm": 0.224609375,
"learning_rate": 0.0004809936904193545,
"loss": 2.88507194519043,
"step": 7610
},
{
"epoch": 0.2628129957922329,
"grad_norm": 0.2294921875,
"learning_rate": 0.0004809430476464521,
"loss": 2.9259174346923826,
"step": 7620
},
{
"epoch": 0.2631578947368421,
"grad_norm": 0.23828125,
"learning_rate": 0.0004808923403136819,
"loss": 2.8806646347045897,
"step": 7630
},
{
"epoch": 0.26350279368145135,
"grad_norm": 0.2431640625,
"learning_rate": 0.00048084156843602994,
"loss": 2.9029253005981444,
"step": 7640
},
{
"epoch": 0.26384769262606056,
"grad_norm": 0.2734375,
"learning_rate": 0.0004807907320285018,
"loss": 2.8839141845703127,
"step": 7650
},
{
"epoch": 0.2641925915706698,
"grad_norm": 0.216796875,
"learning_rate": 0.0004807398311061219,
"loss": 2.89400634765625,
"step": 7660
},
{
"epoch": 0.26453749051527903,
"grad_norm": 0.2333984375,
"learning_rate": 0.0004806888656839338,
"loss": 2.890558624267578,
"step": 7670
},
{
"epoch": 0.26488238945988823,
"grad_norm": 0.2216796875,
"learning_rate": 0.00048063783577700003,
"loss": 2.9174373626708983,
"step": 7680
},
{
"epoch": 0.2652272884044975,
"grad_norm": 0.2177734375,
"learning_rate": 0.0004805867414004023,
"loss": 2.8800275802612303,
"step": 7690
},
{
"epoch": 0.2655721873491067,
"grad_norm": 0.25,
"learning_rate": 0.0004805355825692414,
"loss": 2.900164031982422,
"step": 7700
},
{
"epoch": 0.2655721873491067,
"eval_loss": 3.0969250202178955,
"eval_runtime": 6.8276,
"eval_samples_per_second": 47.894,
"eval_steps_per_second": 1.611,
"step": 7700
},
{
"epoch": 0.26591708629371597,
"grad_norm": 0.28125,
"learning_rate": 0.00048048435929863695,
"loss": 2.921148109436035,
"step": 7710
},
{
"epoch": 0.26626198523832517,
"grad_norm": 0.2158203125,
"learning_rate": 0.0004804330716037278,
"loss": 2.8917718887329102,
"step": 7720
},
{
"epoch": 0.2666068841829344,
"grad_norm": 0.208984375,
"learning_rate": 0.0004803817194996719,
"loss": 2.890752983093262,
"step": 7730
},
{
"epoch": 0.26695178312754364,
"grad_norm": 0.2236328125,
"learning_rate": 0.000480330303001646,
"loss": 2.9210477828979493,
"step": 7740
},
{
"epoch": 0.26729668207215285,
"grad_norm": 0.2255859375,
"learning_rate": 0.00048027882212484617,
"loss": 2.882546043395996,
"step": 7750
},
{
"epoch": 0.2676415810167621,
"grad_norm": 0.224609375,
"learning_rate": 0.0004802272768844873,
"loss": 2.9026378631591796,
"step": 7760
},
{
"epoch": 0.2679864799613713,
"grad_norm": 0.27734375,
"learning_rate": 0.00048017566729580314,
"loss": 2.891184616088867,
"step": 7770
},
{
"epoch": 0.2683313789059805,
"grad_norm": 0.25390625,
"learning_rate": 0.000480123993374047,
"loss": 2.9190244674682617,
"step": 7780
},
{
"epoch": 0.2686762778505898,
"grad_norm": 0.2099609375,
"learning_rate": 0.0004800722551344907,
"loss": 2.9181575775146484,
"step": 7790
},
{
"epoch": 0.269021176795199,
"grad_norm": 0.2080078125,
"learning_rate": 0.0004800204525924253,
"loss": 2.9071882247924803,
"step": 7800
},
{
"epoch": 0.269021176795199,
"eval_loss": 3.1101934909820557,
"eval_runtime": 6.9299,
"eval_samples_per_second": 47.187,
"eval_steps_per_second": 1.587,
"step": 7800
},
{
"epoch": 0.26936607573980825,
"grad_norm": 0.2470703125,
"learning_rate": 0.0004799685857631608,
"loss": 2.920227813720703,
"step": 7810
},
{
"epoch": 0.26971097468441746,
"grad_norm": 0.2255859375,
"learning_rate": 0.0004799166546620261,
"loss": 2.9081161499023436,
"step": 7820
},
{
"epoch": 0.2700558736290267,
"grad_norm": 0.2490234375,
"learning_rate": 0.0004798646593043694,
"loss": 2.9441673278808596,
"step": 7830
},
{
"epoch": 0.27040077257363593,
"grad_norm": 0.20703125,
"learning_rate": 0.0004798125997055576,
"loss": 2.8898330688476563,
"step": 7840
},
{
"epoch": 0.27074567151824513,
"grad_norm": 0.205078125,
"learning_rate": 0.0004797604758809765,
"loss": 2.919536590576172,
"step": 7850
},
{
"epoch": 0.2710905704628544,
"grad_norm": 0.224609375,
"learning_rate": 0.0004797082878460315,
"loss": 2.9212438583374025,
"step": 7860
},
{
"epoch": 0.2714354694074636,
"grad_norm": 0.236328125,
"learning_rate": 0.0004796560356161461,
"loss": 2.9245223999023438,
"step": 7870
},
{
"epoch": 0.27178036835207287,
"grad_norm": 0.2373046875,
"learning_rate": 0.00047960371920676353,
"loss": 2.868524932861328,
"step": 7880
},
{
"epoch": 0.27212526729668207,
"grad_norm": 0.236328125,
"learning_rate": 0.0004795513386333455,
"loss": 2.9088613510131838,
"step": 7890
},
{
"epoch": 0.2724701662412913,
"grad_norm": 0.216796875,
"learning_rate": 0.00047949889391137284,
"loss": 2.884700965881348,
"step": 7900
},
{
"epoch": 0.2724701662412913,
"eval_loss": 3.1060330867767334,
"eval_runtime": 6.8273,
"eval_samples_per_second": 47.896,
"eval_steps_per_second": 1.611,
"step": 7900
},
{
"epoch": 0.27281506518590054,
"grad_norm": 0.2451171875,
"learning_rate": 0.0004794463850563454,
"loss": 2.9303298950195313,
"step": 7910
},
{
"epoch": 0.27315996413050975,
"grad_norm": 0.23828125,
"learning_rate": 0.00047939381208378205,
"loss": 2.8783666610717775,
"step": 7920
},
{
"epoch": 0.273504863075119,
"grad_norm": 0.2353515625,
"learning_rate": 0.0004793411750092203,
"loss": 2.8956361770629884,
"step": 7930
},
{
"epoch": 0.2738497620197282,
"grad_norm": 0.22265625,
"learning_rate": 0.000479288473848217,
"loss": 2.8841411590576174,
"step": 7940
},
{
"epoch": 0.2741946609643374,
"grad_norm": 0.21484375,
"learning_rate": 0.00047923570861634757,
"loss": 2.925836753845215,
"step": 7950
},
{
"epoch": 0.2745395599089467,
"grad_norm": 0.2177734375,
"learning_rate": 0.00047918287932920654,
"loss": 2.887011909484863,
"step": 7960
},
{
"epoch": 0.2748844588535559,
"grad_norm": 0.2255859375,
"learning_rate": 0.0004791299860024076,
"loss": 2.8862180709838867,
"step": 7970
},
{
"epoch": 0.27522935779816515,
"grad_norm": 0.2138671875,
"learning_rate": 0.00047907702865158285,
"loss": 2.888905715942383,
"step": 7980
},
{
"epoch": 0.27557425674277436,
"grad_norm": 0.2255859375,
"learning_rate": 0.00047902400729238375,
"loss": 2.9060813903808596,
"step": 7990
},
{
"epoch": 0.2759191556873836,
"grad_norm": 0.208984375,
"learning_rate": 0.0004789709219404805,
"loss": 2.8980886459350588,
"step": 8000
},
{
"epoch": 0.2759191556873836,
"eval_loss": 3.1027467250823975,
"eval_runtime": 6.8446,
"eval_samples_per_second": 47.775,
"eval_steps_per_second": 1.607,
"step": 8000
},
{
"epoch": 0.27626405463199283,
"grad_norm": 0.228515625,
"learning_rate": 0.0004789177726115622,
"loss": 2.9022424697875975,
"step": 8010
},
{
"epoch": 0.27660895357660203,
"grad_norm": 0.21875,
"learning_rate": 0.00047886455932133704,
"loss": 2.9184452056884767,
"step": 8020
},
{
"epoch": 0.2769538525212113,
"grad_norm": 0.2080078125,
"learning_rate": 0.0004788112820855318,
"loss": 2.9035671234130858,
"step": 8030
},
{
"epoch": 0.2772987514658205,
"grad_norm": 0.228515625,
"learning_rate": 0.0004787579409198924,
"loss": 2.9065969467163084,
"step": 8040
},
{
"epoch": 0.27764365041042977,
"grad_norm": 0.2158203125,
"learning_rate": 0.0004787045358401836,
"loss": 2.9058074951171875,
"step": 8050
},
{
"epoch": 0.27798854935503897,
"grad_norm": 0.2412109375,
"learning_rate": 0.000478651066862189,
"loss": 2.9324623107910157,
"step": 8060
},
{
"epoch": 0.2783334482996482,
"grad_norm": 0.251953125,
"learning_rate": 0.0004785975340017111,
"loss": 2.915102005004883,
"step": 8070
},
{
"epoch": 0.27867834724425744,
"grad_norm": 0.259765625,
"learning_rate": 0.0004785439372745714,
"loss": 2.8882448196411135,
"step": 8080
},
{
"epoch": 0.27902324618886665,
"grad_norm": 0.2158203125,
"learning_rate": 0.0004784902766966101,
"loss": 2.909399223327637,
"step": 8090
},
{
"epoch": 0.2793681451334759,
"grad_norm": 0.2216796875,
"learning_rate": 0.0004784365522836863,
"loss": 2.9289169311523438,
"step": 8100
},
{
"epoch": 0.2793681451334759,
"eval_loss": 3.0956976413726807,
"eval_runtime": 6.849,
"eval_samples_per_second": 47.744,
"eval_steps_per_second": 1.606,
"step": 8100
},
{
"epoch": 0.2797130440780851,
"grad_norm": 0.248046875,
"learning_rate": 0.00047838276405167806,
"loss": 2.8941259384155273,
"step": 8110
},
{
"epoch": 0.2800579430226944,
"grad_norm": 0.234375,
"learning_rate": 0.0004783289120164822,
"loss": 2.8998798370361327,
"step": 8120
},
{
"epoch": 0.2804028419673036,
"grad_norm": 0.240234375,
"learning_rate": 0.00047827499619401454,
"loss": 2.905199432373047,
"step": 8130
},
{
"epoch": 0.2807477409119128,
"grad_norm": 0.22265625,
"learning_rate": 0.0004782210166002096,
"loss": 2.9012819290161134,
"step": 8140
},
{
"epoch": 0.28109263985652205,
"grad_norm": 0.2412109375,
"learning_rate": 0.0004781669732510209,
"loss": 2.8945152282714846,
"step": 8150
},
{
"epoch": 0.28143753880113126,
"grad_norm": 0.228515625,
"learning_rate": 0.0004781128661624206,
"loss": 2.8935155868530273,
"step": 8160
},
{
"epoch": 0.2817824377457405,
"grad_norm": 0.220703125,
"learning_rate": 0.00047805869535039983,
"loss": 2.911442756652832,
"step": 8170
},
{
"epoch": 0.28212733669034973,
"grad_norm": 0.2109375,
"learning_rate": 0.00047800446083096846,
"loss": 2.887200355529785,
"step": 8180
},
{
"epoch": 0.28247223563495893,
"grad_norm": 0.2373046875,
"learning_rate": 0.00047795016262015545,
"loss": 2.9261764526367187,
"step": 8190
},
{
"epoch": 0.2828171345795682,
"grad_norm": 0.22265625,
"learning_rate": 0.0004778958007340083,
"loss": 2.9135900497436524,
"step": 8200
},
{
"epoch": 0.2828171345795682,
"eval_loss": 3.097870349884033,
"eval_runtime": 6.84,
"eval_samples_per_second": 47.807,
"eval_steps_per_second": 1.608,
"step": 8200
},
{
"epoch": 0.2831620335241774,
"grad_norm": 0.2265625,
"learning_rate": 0.00047784137518859336,
"loss": 2.9153194427490234,
"step": 8210
},
{
"epoch": 0.28350693246878667,
"grad_norm": 0.232421875,
"learning_rate": 0.000477786885999996,
"loss": 2.9038772583007812,
"step": 8220
},
{
"epoch": 0.28385183141339587,
"grad_norm": 0.244140625,
"learning_rate": 0.00047773233318432006,
"loss": 2.8880935668945313,
"step": 8230
},
{
"epoch": 0.2841967303580051,
"grad_norm": 0.224609375,
"learning_rate": 0.00047767771675768855,
"loss": 2.8845342636108398,
"step": 8240
},
{
"epoch": 0.28454162930261434,
"grad_norm": 0.244140625,
"learning_rate": 0.000477623036736243,
"loss": 2.9379093170166017,
"step": 8250
},
{
"epoch": 0.28488652824722355,
"grad_norm": 0.216796875,
"learning_rate": 0.00047756829313614404,
"loss": 2.8892704010009767,
"step": 8260
},
{
"epoch": 0.2852314271918328,
"grad_norm": 0.232421875,
"learning_rate": 0.00047751348597357057,
"loss": 2.898004341125488,
"step": 8270
},
{
"epoch": 0.285576326136442,
"grad_norm": 0.224609375,
"learning_rate": 0.0004774586152647209,
"loss": 2.9427114486694337,
"step": 8280
},
{
"epoch": 0.2859212250810513,
"grad_norm": 0.224609375,
"learning_rate": 0.00047740368102581164,
"loss": 2.923950958251953,
"step": 8290
},
{
"epoch": 0.2862661240256605,
"grad_norm": 0.259765625,
"learning_rate": 0.0004773486832730785,
"loss": 2.898242378234863,
"step": 8300
},
{
"epoch": 0.2862661240256605,
"eval_loss": 3.0847926139831543,
"eval_runtime": 6.9364,
"eval_samples_per_second": 47.143,
"eval_steps_per_second": 1.586,
"step": 8300
},
{
"epoch": 0.2866110229702697,
"grad_norm": 0.228515625,
"learning_rate": 0.00047729362202277573,
"loss": 2.9224609375,
"step": 8310
},
{
"epoch": 0.28695592191487895,
"grad_norm": 0.228515625,
"learning_rate": 0.0004772384972911764,
"loss": 2.9071815490722654,
"step": 8320
},
{
"epoch": 0.28730082085948816,
"grad_norm": 0.2109375,
"learning_rate": 0.0004771833090945725,
"loss": 2.9216276168823243,
"step": 8330
},
{
"epoch": 0.2876457198040974,
"grad_norm": 0.220703125,
"learning_rate": 0.0004771280574492745,
"loss": 2.9011404037475588,
"step": 8340
},
{
"epoch": 0.28799061874870663,
"grad_norm": 0.2197265625,
"learning_rate": 0.0004770727423716119,
"loss": 2.9012659072875975,
"step": 8350
},
{
"epoch": 0.28833551769331583,
"grad_norm": 0.244140625,
"learning_rate": 0.0004770173638779329,
"loss": 2.899481773376465,
"step": 8360
},
{
"epoch": 0.2886804166379251,
"grad_norm": 0.2236328125,
"learning_rate": 0.00047696192198460404,
"loss": 2.8808507919311523,
"step": 8370
},
{
"epoch": 0.2890253155825343,
"grad_norm": 0.2314453125,
"learning_rate": 0.00047690641670801134,
"loss": 2.9292137145996096,
"step": 8380
},
{
"epoch": 0.28937021452714357,
"grad_norm": 0.2236328125,
"learning_rate": 0.00047685084806455886,
"loss": 2.891880989074707,
"step": 8390
},
{
"epoch": 0.28971511347175277,
"grad_norm": 0.2216796875,
"learning_rate": 0.00047679521607066973,
"loss": 2.932229995727539,
"step": 8400
},
{
"epoch": 0.28971511347175277,
"eval_loss": 3.08143949508667,
"eval_runtime": 6.8365,
"eval_samples_per_second": 47.831,
"eval_steps_per_second": 1.609,
"step": 8400
},
{
"epoch": 0.290060012416362,
"grad_norm": 0.22265625,
"learning_rate": 0.00047673952074278576,
"loss": 2.896831512451172,
"step": 8410
},
{
"epoch": 0.29040491136097124,
"grad_norm": 0.224609375,
"learning_rate": 0.0004766837620973674,
"loss": 2.9042150497436525,
"step": 8420
},
{
"epoch": 0.29074981030558045,
"grad_norm": 0.2392578125,
"learning_rate": 0.000476627940150894,
"loss": 2.896987533569336,
"step": 8430
},
{
"epoch": 0.2910947092501897,
"grad_norm": 0.2353515625,
"learning_rate": 0.0004765720549198634,
"loss": 2.901259994506836,
"step": 8440
},
{
"epoch": 0.2914396081947989,
"grad_norm": 0.216796875,
"learning_rate": 0.00047651610642079217,
"loss": 2.9245439529418946,
"step": 8450
},
{
"epoch": 0.2917845071394082,
"grad_norm": 0.2236328125,
"learning_rate": 0.00047646009467021573,
"loss": 2.9156162261962892,
"step": 8460
},
{
"epoch": 0.2921294060840174,
"grad_norm": 0.2099609375,
"learning_rate": 0.0004764040196846881,
"loss": 2.9000455856323244,
"step": 8470
},
{
"epoch": 0.2924743050286266,
"grad_norm": 0.26171875,
"learning_rate": 0.0004763478814807819,
"loss": 2.891794967651367,
"step": 8480
},
{
"epoch": 0.29281920397323585,
"grad_norm": 0.2265625,
"learning_rate": 0.0004762916800750887,
"loss": 2.906112289428711,
"step": 8490
},
{
"epoch": 0.29316410291784506,
"grad_norm": 0.19921875,
"learning_rate": 0.00047623541548421836,
"loss": 2.914089584350586,
"step": 8500
},
{
"epoch": 0.29316410291784506,
"eval_loss": 3.0853705406188965,
"eval_runtime": 6.8412,
"eval_samples_per_second": 47.799,
"eval_steps_per_second": 1.608,
"step": 8500
},
{
"epoch": 0.2935090018624543,
"grad_norm": 0.2099609375,
"learning_rate": 0.0004761790877247997,
"loss": 2.913014602661133,
"step": 8510
},
{
"epoch": 0.29385390080706353,
"grad_norm": 0.236328125,
"learning_rate": 0.00047612269681348034,
"loss": 2.9043367385864256,
"step": 8520
},
{
"epoch": 0.29419879975167273,
"grad_norm": 0.21875,
"learning_rate": 0.00047606624276692606,
"loss": 2.8908466339111327,
"step": 8530
},
{
"epoch": 0.294543698696282,
"grad_norm": 0.2421875,
"learning_rate": 0.0004760097256018218,
"loss": 2.899244689941406,
"step": 8540
},
{
"epoch": 0.2948885976408912,
"grad_norm": 0.2255859375,
"learning_rate": 0.0004759531453348709,
"loss": 2.8998796463012697,
"step": 8550
},
{
"epoch": 0.29523349658550047,
"grad_norm": 0.2265625,
"learning_rate": 0.00047589650198279535,
"loss": 2.9302436828613283,
"step": 8560
},
{
"epoch": 0.29557839553010967,
"grad_norm": 0.2333984375,
"learning_rate": 0.00047583979556233593,
"loss": 2.8846467971801757,
"step": 8570
},
{
"epoch": 0.29592329447471893,
"grad_norm": 0.212890625,
"learning_rate": 0.0004757830260902519,
"loss": 2.9151865005493165,
"step": 8580
},
{
"epoch": 0.29626819341932814,
"grad_norm": 0.2265625,
"learning_rate": 0.0004757261935833212,
"loss": 2.953875923156738,
"step": 8590
},
{
"epoch": 0.29661309236393735,
"grad_norm": 0.2138671875,
"learning_rate": 0.0004756692980583406,
"loss": 2.9121395111083985,
"step": 8600
},
{
"epoch": 0.29661309236393735,
"eval_loss": 3.0825328826904297,
"eval_runtime": 6.8313,
"eval_samples_per_second": 47.868,
"eval_steps_per_second": 1.61,
"step": 8600
},
{
"epoch": 0.2969579913085466,
"grad_norm": 0.2451171875,
"learning_rate": 0.0004756123395321251,
"loss": 2.9110280990600588,
"step": 8610
},
{
"epoch": 0.2973028902531558,
"grad_norm": 0.234375,
"learning_rate": 0.00047555531802150866,
"loss": 2.8566871643066407,
"step": 8620
},
{
"epoch": 0.2976477891977651,
"grad_norm": 0.2236328125,
"learning_rate": 0.0004754982335433437,
"loss": 2.878468132019043,
"step": 8630
},
{
"epoch": 0.2979926881423743,
"grad_norm": 0.2119140625,
"learning_rate": 0.0004754410861145013,
"loss": 2.9155420303344726,
"step": 8640
},
{
"epoch": 0.2983375870869835,
"grad_norm": 0.22265625,
"learning_rate": 0.00047538387575187115,
"loss": 2.9016794204711913,
"step": 8650
},
{
"epoch": 0.29868248603159275,
"grad_norm": 0.248046875,
"learning_rate": 0.0004753266024723614,
"loss": 2.9032976150512697,
"step": 8660
},
{
"epoch": 0.29902738497620196,
"grad_norm": 0.2451171875,
"learning_rate": 0.0004752692662928991,
"loss": 2.8761463165283203,
"step": 8670
},
{
"epoch": 0.2993722839208112,
"grad_norm": 0.21875,
"learning_rate": 0.0004752118672304295,
"loss": 2.8870811462402344,
"step": 8680
},
{
"epoch": 0.29971718286542043,
"grad_norm": 0.2333984375,
"learning_rate": 0.0004751544053019168,
"loss": 2.891538619995117,
"step": 8690
},
{
"epoch": 0.30006208181002963,
"grad_norm": 0.22265625,
"learning_rate": 0.00047509688052434354,
"loss": 2.8946979522705076,
"step": 8700
},
{
"epoch": 0.30006208181002963,
"eval_loss": 3.0811736583709717,
"eval_runtime": 6.8493,
"eval_samples_per_second": 47.742,
"eval_steps_per_second": 1.606,
"step": 8700
},
{
"epoch": 0.3004069807546389,
"grad_norm": 0.228515625,
"learning_rate": 0.0004750392929147109,
"loss": 2.876332473754883,
"step": 8710
},
{
"epoch": 0.3007518796992481,
"grad_norm": 0.22265625,
"learning_rate": 0.00047498164249003863,
"loss": 2.8564647674560546,
"step": 8720
},
{
"epoch": 0.30109677864385737,
"grad_norm": 0.2294921875,
"learning_rate": 0.0004749239292673652,
"loss": 2.893986129760742,
"step": 8730
},
{
"epoch": 0.30144167758846657,
"grad_norm": 0.220703125,
"learning_rate": 0.0004748661532637473,
"loss": 2.878702926635742,
"step": 8740
},
{
"epoch": 0.30178657653307583,
"grad_norm": 0.2236328125,
"learning_rate": 0.00047480831449626037,
"loss": 2.860252571105957,
"step": 8750
},
{
"epoch": 0.30213147547768504,
"grad_norm": 0.26953125,
"learning_rate": 0.0004747504129819986,
"loss": 2.8820051193237304,
"step": 8760
},
{
"epoch": 0.30247637442229425,
"grad_norm": 0.2255859375,
"learning_rate": 0.0004746924487380744,
"loss": 2.881456184387207,
"step": 8770
},
{
"epoch": 0.3028212733669035,
"grad_norm": 0.23828125,
"learning_rate": 0.00047463442178161884,
"loss": 2.893559455871582,
"step": 8780
},
{
"epoch": 0.3031661723115127,
"grad_norm": 0.220703125,
"learning_rate": 0.00047457633212978157,
"loss": 2.918229675292969,
"step": 8790
},
{
"epoch": 0.303511071256122,
"grad_norm": 0.2294921875,
"learning_rate": 0.0004745181797997306,
"loss": 2.884060096740723,
"step": 8800
},
{
"epoch": 0.303511071256122,
"eval_loss": 3.0883822441101074,
"eval_runtime": 6.84,
"eval_samples_per_second": 47.807,
"eval_steps_per_second": 1.608,
"step": 8800
},
{
"epoch": 0.3038559702007312,
"grad_norm": 0.212890625,
"learning_rate": 0.0004744599648086528,
"loss": 2.899524688720703,
"step": 8810
},
{
"epoch": 0.3042008691453404,
"grad_norm": 0.2333984375,
"learning_rate": 0.0004744016871737532,
"loss": 2.9101129531860352,
"step": 8820
},
{
"epoch": 0.30454576808994965,
"grad_norm": 0.22265625,
"learning_rate": 0.0004743433469122555,
"loss": 2.8809268951416014,
"step": 8830
},
{
"epoch": 0.30489066703455886,
"grad_norm": 0.21875,
"learning_rate": 0.00047428494404140196,
"loss": 2.9337669372558595,
"step": 8840
},
{
"epoch": 0.3052355659791681,
"grad_norm": 0.2197265625,
"learning_rate": 0.0004742264785784533,
"loss": 2.88265438079834,
"step": 8850
},
{
"epoch": 0.30558046492377733,
"grad_norm": 0.2451171875,
"learning_rate": 0.00047416795054068875,
"loss": 2.892649459838867,
"step": 8860
},
{
"epoch": 0.30592536386838654,
"grad_norm": 0.2109375,
"learning_rate": 0.0004741093599454058,
"loss": 2.914415168762207,
"step": 8870
},
{
"epoch": 0.3062702628129958,
"grad_norm": 0.23828125,
"learning_rate": 0.00047405070680992087,
"loss": 2.884738540649414,
"step": 8880
},
{
"epoch": 0.306615161757605,
"grad_norm": 0.2109375,
"learning_rate": 0.00047399199115156853,
"loss": 2.8966169357299805,
"step": 8890
},
{
"epoch": 0.30696006070221427,
"grad_norm": 0.2412109375,
"learning_rate": 0.00047393321298770197,
"loss": 2.9124738693237306,
"step": 8900
},
{
"epoch": 0.30696006070221427,
"eval_loss": 3.09952449798584,
"eval_runtime": 6.9427,
"eval_samples_per_second": 47.1,
"eval_steps_per_second": 1.584,
"step": 8900
},
{
"epoch": 0.3073049596468235,
"grad_norm": 0.23828125,
"learning_rate": 0.0004738743723356929,
"loss": 2.883900260925293,
"step": 8910
},
{
"epoch": 0.30764985859143273,
"grad_norm": 0.2392578125,
"learning_rate": 0.00047381546921293114,
"loss": 2.9006317138671873,
"step": 8920
},
{
"epoch": 0.30799475753604194,
"grad_norm": 0.263671875,
"learning_rate": 0.0004737565036368255,
"loss": 2.8863780975341795,
"step": 8930
},
{
"epoch": 0.30833965648065115,
"grad_norm": 0.21875,
"learning_rate": 0.0004736974756248029,
"loss": 2.88758544921875,
"step": 8940
},
{
"epoch": 0.3086845554252604,
"grad_norm": 0.24609375,
"learning_rate": 0.00047363838519430887,
"loss": 2.882228660583496,
"step": 8950
},
{
"epoch": 0.3090294543698696,
"grad_norm": 0.232421875,
"learning_rate": 0.0004735792323628071,
"loss": 2.890774726867676,
"step": 8960
},
{
"epoch": 0.3093743533144789,
"grad_norm": 0.2265625,
"learning_rate": 0.00047352001714778027,
"loss": 2.884100341796875,
"step": 8970
},
{
"epoch": 0.3097192522590881,
"grad_norm": 0.22265625,
"learning_rate": 0.00047346073956672897,
"loss": 2.893174743652344,
"step": 8980
},
{
"epoch": 0.3100641512036973,
"grad_norm": 0.2197265625,
"learning_rate": 0.0004734013996371725,
"loss": 2.9126157760620117,
"step": 8990
},
{
"epoch": 0.31040905014830655,
"grad_norm": 0.205078125,
"learning_rate": 0.00047334199737664845,
"loss": 2.9093223571777345,
"step": 9000
},
{
"epoch": 0.31040905014830655,
"eval_loss": 3.086381435394287,
"eval_runtime": 6.8327,
"eval_samples_per_second": 47.858,
"eval_steps_per_second": 1.61,
"step": 9000
},
{
"epoch": 0.31075394909291576,
"grad_norm": 0.232421875,
"learning_rate": 0.000473282532802713,
"loss": 2.891655921936035,
"step": 9010
},
{
"epoch": 0.311098848037525,
"grad_norm": 0.263671875,
"learning_rate": 0.0004732230059329405,
"loss": 2.8674449920654297,
"step": 9020
},
{
"epoch": 0.31144374698213423,
"grad_norm": 0.2255859375,
"learning_rate": 0.00047316341678492387,
"loss": 2.8836734771728514,
"step": 9030
},
{
"epoch": 0.3117886459267435,
"grad_norm": 0.2177734375,
"learning_rate": 0.0004731037653762745,
"loss": 2.891972541809082,
"step": 9040
},
{
"epoch": 0.3121335448713527,
"grad_norm": 0.228515625,
"learning_rate": 0.00047304405172462214,
"loss": 2.900237464904785,
"step": 9050
},
{
"epoch": 0.3124784438159619,
"grad_norm": 0.2177734375,
"learning_rate": 0.00047298427584761474,
"loss": 2.923178482055664,
"step": 9060
},
{
"epoch": 0.31282334276057117,
"grad_norm": 0.2177734375,
"learning_rate": 0.00047292443776291885,
"loss": 2.8529937744140623,
"step": 9070
},
{
"epoch": 0.3131682417051804,
"grad_norm": 0.220703125,
"learning_rate": 0.0004728645374882194,
"loss": 2.892356109619141,
"step": 9080
},
{
"epoch": 0.31351314064978963,
"grad_norm": 0.232421875,
"learning_rate": 0.00047280457504121957,
"loss": 2.8949756622314453,
"step": 9090
},
{
"epoch": 0.31385803959439884,
"grad_norm": 0.2255859375,
"learning_rate": 0.0004727445504396411,
"loss": 2.9034751892089843,
"step": 9100
},
{
"epoch": 0.31385803959439884,
"eval_loss": 3.0865285396575928,
"eval_runtime": 6.8406,
"eval_samples_per_second": 47.803,
"eval_steps_per_second": 1.608,
"step": 9100
},
{
"epoch": 0.31420293853900805,
"grad_norm": 0.2177734375,
"learning_rate": 0.00047268446370122387,
"loss": 2.8904367446899415,
"step": 9110
},
{
"epoch": 0.3145478374836173,
"grad_norm": 0.25,
"learning_rate": 0.0004726243148437264,
"loss": 2.8654937744140625,
"step": 9120
},
{
"epoch": 0.3148927364282265,
"grad_norm": 0.2470703125,
"learning_rate": 0.0004725641038849252,
"loss": 2.8933300018310546,
"step": 9130
},
{
"epoch": 0.3152376353728358,
"grad_norm": 0.232421875,
"learning_rate": 0.00047250383084261556,
"loss": 2.868818664550781,
"step": 9140
},
{
"epoch": 0.315582534317445,
"grad_norm": 0.23046875,
"learning_rate": 0.0004724434957346108,
"loss": 2.863626480102539,
"step": 9150
},
{
"epoch": 0.3159274332620542,
"grad_norm": 0.21484375,
"learning_rate": 0.0004723830985787427,
"loss": 2.873278999328613,
"step": 9160
},
{
"epoch": 0.31627233220666345,
"grad_norm": 0.2197265625,
"learning_rate": 0.0004723226393928615,
"loss": 2.8583749771118163,
"step": 9170
},
{
"epoch": 0.31661723115127266,
"grad_norm": 0.255859375,
"learning_rate": 0.0004722621181948354,
"loss": 2.8726430892944337,
"step": 9180
},
{
"epoch": 0.3169621300958819,
"grad_norm": 0.232421875,
"learning_rate": 0.0004722015350025513,
"loss": 2.8634578704833986,
"step": 9190
},
{
"epoch": 0.31730702904049113,
"grad_norm": 0.2421875,
"learning_rate": 0.00047214088983391436,
"loss": 2.9009580612182617,
"step": 9200
},
{
"epoch": 0.31730702904049113,
"eval_loss": 3.0831668376922607,
"eval_runtime": 6.842,
"eval_samples_per_second": 47.793,
"eval_steps_per_second": 1.608,
"step": 9200
},
{
"epoch": 0.3176519279851004,
"grad_norm": 0.228515625,
"learning_rate": 0.0004720801827068479,
"loss": 2.8945308685302735,
"step": 9210
},
{
"epoch": 0.3179968269297096,
"grad_norm": 0.212890625,
"learning_rate": 0.0004720194136392936,
"loss": 2.8950809478759765,
"step": 9220
},
{
"epoch": 0.3183417258743188,
"grad_norm": 0.2138671875,
"learning_rate": 0.0004719585826492116,
"loss": 2.8906280517578127,
"step": 9230
},
{
"epoch": 0.31868662481892807,
"grad_norm": 0.216796875,
"learning_rate": 0.0004718976897545802,
"loss": 2.882951545715332,
"step": 9240
},
{
"epoch": 0.3190315237635373,
"grad_norm": 0.2275390625,
"learning_rate": 0.00047183673497339595,
"loss": 2.8714506149291994,
"step": 9250
},
{
"epoch": 0.31937642270814653,
"grad_norm": 0.212890625,
"learning_rate": 0.00047177571832367383,
"loss": 2.9083600997924806,
"step": 9260
},
{
"epoch": 0.31972132165275574,
"grad_norm": 0.2353515625,
"learning_rate": 0.000471714639823447,
"loss": 2.8847978591918944,
"step": 9270
},
{
"epoch": 0.32006622059736495,
"grad_norm": 0.224609375,
"learning_rate": 0.000471653499490767,
"loss": 2.8744651794433596,
"step": 9280
},
{
"epoch": 0.3204111195419742,
"grad_norm": 0.255859375,
"learning_rate": 0.00047159229734370354,
"loss": 2.8778450012207033,
"step": 9290
},
{
"epoch": 0.3207560184865834,
"grad_norm": 0.21875,
"learning_rate": 0.0004715310334003446,
"loss": 2.876936149597168,
"step": 9300
},
{
"epoch": 0.3207560184865834,
"eval_loss": 3.0836637020111084,
"eval_runtime": 6.8451,
"eval_samples_per_second": 47.772,
"eval_steps_per_second": 1.607,
"step": 9300
},
{
"epoch": 0.3211009174311927,
"grad_norm": 0.2265625,
"learning_rate": 0.00047146970767879655,
"loss": 2.889265441894531,
"step": 9310
},
{
"epoch": 0.3214458163758019,
"grad_norm": 0.2294921875,
"learning_rate": 0.0004714083201971839,
"loss": 2.8701702117919923,
"step": 9320
},
{
"epoch": 0.32179071532041115,
"grad_norm": 0.228515625,
"learning_rate": 0.0004713468709736494,
"loss": 2.8872251510620117,
"step": 9330
},
{
"epoch": 0.32213561426502035,
"grad_norm": 0.267578125,
"learning_rate": 0.0004712853600263541,
"loss": 2.915439224243164,
"step": 9340
},
{
"epoch": 0.32248051320962956,
"grad_norm": 0.234375,
"learning_rate": 0.0004712237873734774,
"loss": 2.890000343322754,
"step": 9350
},
{
"epoch": 0.3228254121542388,
"grad_norm": 0.236328125,
"learning_rate": 0.00047116215303321665,
"loss": 2.9059385299682616,
"step": 9360
},
{
"epoch": 0.32317031109884803,
"grad_norm": 0.24609375,
"learning_rate": 0.00047110045702378775,
"loss": 2.8583507537841797,
"step": 9370
},
{
"epoch": 0.3235152100434573,
"grad_norm": 0.24609375,
"learning_rate": 0.0004710386993634246,
"loss": 2.895582389831543,
"step": 9380
},
{
"epoch": 0.3238601089880665,
"grad_norm": 0.2138671875,
"learning_rate": 0.00047097688007037943,
"loss": 2.8871803283691406,
"step": 9390
},
{
"epoch": 0.3242050079326757,
"grad_norm": 0.22265625,
"learning_rate": 0.00047091499916292277,
"loss": 2.873086929321289,
"step": 9400
},
{
"epoch": 0.3242050079326757,
"eval_loss": 3.0859570503234863,
"eval_runtime": 6.8444,
"eval_samples_per_second": 47.776,
"eval_steps_per_second": 1.607,
"step": 9400
},
{
"epoch": 0.32454990687728497,
"grad_norm": 0.2373046875,
"learning_rate": 0.00047085305665934293,
"loss": 2.8721101760864256,
"step": 9410
},
{
"epoch": 0.3248948058218942,
"grad_norm": 0.2255859375,
"learning_rate": 0.000470791052577947,
"loss": 2.8789905548095702,
"step": 9420
},
{
"epoch": 0.32523970476650343,
"grad_norm": 0.2197265625,
"learning_rate": 0.00047072898693706003,
"loss": 2.8888473510742188,
"step": 9430
},
{
"epoch": 0.32558460371111264,
"grad_norm": 0.2333984375,
"learning_rate": 0.0004706668597550251,
"loss": 2.8772443771362304,
"step": 9440
},
{
"epoch": 0.32592950265572185,
"grad_norm": 0.25,
"learning_rate": 0.00047060467105020364,
"loss": 2.874882698059082,
"step": 9450
},
{
"epoch": 0.3262744016003311,
"grad_norm": 0.216796875,
"learning_rate": 0.00047054242084097536,
"loss": 2.907251739501953,
"step": 9460
},
{
"epoch": 0.3266193005449403,
"grad_norm": 0.2373046875,
"learning_rate": 0.000470480109145738,
"loss": 2.8861087799072265,
"step": 9470
},
{
"epoch": 0.3269641994895496,
"grad_norm": 0.2392578125,
"learning_rate": 0.0004704177359829073,
"loss": 2.89605712890625,
"step": 9480
},
{
"epoch": 0.3273090984341588,
"grad_norm": 0.2236328125,
"learning_rate": 0.00047035530137091763,
"loss": 2.8671310424804686,
"step": 9490
},
{
"epoch": 0.32765399737876805,
"grad_norm": 0.228515625,
"learning_rate": 0.00047029280532822124,
"loss": 2.8878786087036135,
"step": 9500
},
{
"epoch": 0.32765399737876805,
"eval_loss": 3.0768001079559326,
"eval_runtime": 6.8365,
"eval_samples_per_second": 47.832,
"eval_steps_per_second": 1.609,
"step": 9500
},
{
"epoch": 0.32799889632337725,
"grad_norm": 0.2177734375,
"learning_rate": 0.00047023024787328833,
"loss": 2.897165870666504,
"step": 9510
},
{
"epoch": 0.32834379526798646,
"grad_norm": 0.2392578125,
"learning_rate": 0.0004701676290246077,
"loss": 2.896839714050293,
"step": 9520
},
{
"epoch": 0.3286886942125957,
"grad_norm": 0.2236328125,
"learning_rate": 0.000470104948800686,
"loss": 2.8711565017700194,
"step": 9530
},
{
"epoch": 0.32903359315720493,
"grad_norm": 0.25390625,
"learning_rate": 0.0004700422072200481,
"loss": 2.887459564208984,
"step": 9540
},
{
"epoch": 0.3293784921018142,
"grad_norm": 0.2236328125,
"learning_rate": 0.0004699794043012369,
"loss": 2.8840200424194338,
"step": 9550
},
{
"epoch": 0.3297233910464234,
"grad_norm": 0.25,
"learning_rate": 0.0004699165400628137,
"loss": 2.8814922332763673,
"step": 9560
},
{
"epoch": 0.3300682899910326,
"grad_norm": 0.2275390625,
"learning_rate": 0.00046985361452335755,
"loss": 2.9127830505371093,
"step": 9570
},
{
"epoch": 0.33041318893564187,
"grad_norm": 0.251953125,
"learning_rate": 0.00046979062770146604,
"loss": 2.8633771896362306,
"step": 9580
},
{
"epoch": 0.3307580878802511,
"grad_norm": 0.2265625,
"learning_rate": 0.00046972757961575445,
"loss": 2.899677848815918,
"step": 9590
},
{
"epoch": 0.33110298682486033,
"grad_norm": 0.25390625,
"learning_rate": 0.00046966447028485637,
"loss": 2.8629825592041014,
"step": 9600
},
{
"epoch": 0.33110298682486033,
"eval_loss": 3.079789400100708,
"eval_runtime": 6.8222,
"eval_samples_per_second": 47.932,
"eval_steps_per_second": 1.612,
"step": 9600
},
{
"epoch": 0.33144788576946954,
"grad_norm": 0.224609375,
"learning_rate": 0.0004696012997274236,
"loss": 2.8848873138427735,
"step": 9610
},
{
"epoch": 0.33179278471407875,
"grad_norm": 0.216796875,
"learning_rate": 0.0004695380679621258,
"loss": 2.8816598892211913,
"step": 9620
},
{
"epoch": 0.332137683658688,
"grad_norm": 0.2255859375,
"learning_rate": 0.000469474775007651,
"loss": 2.8526987075805663,
"step": 9630
},
{
"epoch": 0.3324825826032972,
"grad_norm": 0.25,
"learning_rate": 0.00046941142088270497,
"loss": 2.9084049224853517,
"step": 9640
},
{
"epoch": 0.3328274815479065,
"grad_norm": 0.224609375,
"learning_rate": 0.00046934800560601177,
"loss": 2.8614824295043944,
"step": 9650
},
{
"epoch": 0.3331723804925157,
"grad_norm": 0.275390625,
"learning_rate": 0.0004692845291963136,
"loss": 2.921006774902344,
"step": 9660
},
{
"epoch": 0.33351727943712495,
"grad_norm": 0.21484375,
"learning_rate": 0.00046922099167237053,
"loss": 2.856806755065918,
"step": 9670
},
{
"epoch": 0.33386217838173415,
"grad_norm": 0.2216796875,
"learning_rate": 0.0004691573930529609,
"loss": 2.8948123931884764,
"step": 9680
},
{
"epoch": 0.33420707732634336,
"grad_norm": 0.2236328125,
"learning_rate": 0.0004690937333568809,
"loss": 2.8706531524658203,
"step": 9690
},
{
"epoch": 0.3345519762709526,
"grad_norm": 0.2392578125,
"learning_rate": 0.0004690300126029449,
"loss": 2.88925838470459,
"step": 9700
},
{
"epoch": 0.3345519762709526,
"eval_loss": 3.0771496295928955,
"eval_runtime": 6.8444,
"eval_samples_per_second": 47.776,
"eval_steps_per_second": 1.607,
"step": 9700
},
{
"epoch": 0.33489687521556183,
"grad_norm": 0.2490234375,
"learning_rate": 0.00046896623080998524,
"loss": 2.8900306701660154,
"step": 9710
},
{
"epoch": 0.3352417741601711,
"grad_norm": 0.265625,
"learning_rate": 0.0004689023879968524,
"loss": 2.872745323181152,
"step": 9720
},
{
"epoch": 0.3355866731047803,
"grad_norm": 0.2265625,
"learning_rate": 0.0004688384841824148,
"loss": 2.909883499145508,
"step": 9730
},
{
"epoch": 0.3359315720493895,
"grad_norm": 0.2138671875,
"learning_rate": 0.00046877451938555906,
"loss": 2.8921176910400392,
"step": 9740
},
{
"epoch": 0.33627647099399877,
"grad_norm": 0.2060546875,
"learning_rate": 0.0004687104936251895,
"loss": 2.901247024536133,
"step": 9750
},
{
"epoch": 0.336621369938608,
"grad_norm": 0.2490234375,
"learning_rate": 0.0004686464069202287,
"loss": 2.8688276290893553,
"step": 9760
},
{
"epoch": 0.33696626888321723,
"grad_norm": 0.23828125,
"learning_rate": 0.00046858225928961733,
"loss": 2.874532699584961,
"step": 9770
},
{
"epoch": 0.33731116782782644,
"grad_norm": 0.2265625,
"learning_rate": 0.00046851805075231377,
"loss": 2.871516799926758,
"step": 9780
},
{
"epoch": 0.3376560667724357,
"grad_norm": 0.2265625,
"learning_rate": 0.00046845378132729466,
"loss": 2.8817909240722654,
"step": 9790
},
{
"epoch": 0.3380009657170449,
"grad_norm": 0.212890625,
"learning_rate": 0.0004683894510335545,
"loss": 2.911819267272949,
"step": 9800
},
{
"epoch": 0.3380009657170449,
"eval_loss": 3.0750601291656494,
"eval_runtime": 6.8376,
"eval_samples_per_second": 47.824,
"eval_steps_per_second": 1.609,
"step": 9800
},
{
"epoch": 0.3383458646616541,
"grad_norm": 0.2255859375,
"learning_rate": 0.00046832505989010585,
"loss": 2.889698600769043,
"step": 9810
},
{
"epoch": 0.3386907636062634,
"grad_norm": 0.2275390625,
"learning_rate": 0.00046826060791597924,
"loss": 2.872812843322754,
"step": 9820
},
{
"epoch": 0.3390356625508726,
"grad_norm": 0.21875,
"learning_rate": 0.0004681960951302231,
"loss": 2.880837821960449,
"step": 9830
},
{
"epoch": 0.33938056149548185,
"grad_norm": 0.2412109375,
"learning_rate": 0.0004681315215519039,
"loss": 2.8398786544799806,
"step": 9840
},
{
"epoch": 0.33972546044009105,
"grad_norm": 0.205078125,
"learning_rate": 0.00046806688720010613,
"loss": 2.899904251098633,
"step": 9850
},
{
"epoch": 0.34007035938470026,
"grad_norm": 0.220703125,
"learning_rate": 0.0004680021920939322,
"loss": 2.90311222076416,
"step": 9860
},
{
"epoch": 0.3404152583293095,
"grad_norm": 0.2353515625,
"learning_rate": 0.0004679374362525024,
"loss": 2.8610860824584963,
"step": 9870
},
{
"epoch": 0.34076015727391873,
"grad_norm": 0.216796875,
"learning_rate": 0.00046787261969495505,
"loss": 2.8810659408569337,
"step": 9880
},
{
"epoch": 0.341105056218528,
"grad_norm": 0.2197265625,
"learning_rate": 0.0004678077424404464,
"loss": 2.8866769790649416,
"step": 9890
},
{
"epoch": 0.3414499551631372,
"grad_norm": 0.2255859375,
"learning_rate": 0.0004677428045081506,
"loss": 2.8884346008300783,
"step": 9900
},
{
"epoch": 0.3414499551631372,
"eval_loss": 3.075286865234375,
"eval_runtime": 6.8522,
"eval_samples_per_second": 47.722,
"eval_steps_per_second": 1.605,
"step": 9900
},
{
"epoch": 0.3417948541077464,
"grad_norm": 0.2353515625,
"learning_rate": 0.0004676778059172598,
"loss": 2.873636245727539,
"step": 9910
},
{
"epoch": 0.34213975305235567,
"grad_norm": 0.208984375,
"learning_rate": 0.000467612746686984,
"loss": 2.892445755004883,
"step": 9920
},
{
"epoch": 0.3424846519969649,
"grad_norm": 0.228515625,
"learning_rate": 0.00046754762683655127,
"loss": 2.8829296112060545,
"step": 9930
},
{
"epoch": 0.34282955094157413,
"grad_norm": 0.216796875,
"learning_rate": 0.0004674824463852074,
"loss": 2.8889898300170898,
"step": 9940
},
{
"epoch": 0.34317444988618334,
"grad_norm": 0.2041015625,
"learning_rate": 0.00046741720535221616,
"loss": 2.8747501373291016,
"step": 9950
},
{
"epoch": 0.3435193488307926,
"grad_norm": 0.26171875,
"learning_rate": 0.00046735190375685935,
"loss": 2.8482076644897463,
"step": 9960
},
{
"epoch": 0.3438642477754018,
"grad_norm": 0.234375,
"learning_rate": 0.00046728654161843643,
"loss": 2.8706937789916993,
"step": 9970
},
{
"epoch": 0.344209146720011,
"grad_norm": 0.26171875,
"learning_rate": 0.00046722111895626506,
"loss": 2.8873790740966796,
"step": 9980
},
{
"epoch": 0.3445540456646203,
"grad_norm": 0.26171875,
"learning_rate": 0.00046715563578968053,
"loss": 2.866537666320801,
"step": 9990
},
{
"epoch": 0.3448989446092295,
"grad_norm": 0.234375,
"learning_rate": 0.000467090092138036,
"loss": 2.8902517318725587,
"step": 10000
},
{
"epoch": 0.3448989446092295,
"eval_loss": 3.0738189220428467,
"eval_runtime": 6.8486,
"eval_samples_per_second": 47.747,
"eval_steps_per_second": 1.606,
"step": 10000
},
{
"epoch": 0.34524384355383875,
"grad_norm": 0.228515625,
"learning_rate": 0.0004670244880207027,
"loss": 2.9031728744506835,
"step": 10010
},
{
"epoch": 0.34558874249844795,
"grad_norm": 0.22265625,
"learning_rate": 0.00046695882345706963,
"loss": 2.8672115325927736,
"step": 10020
},
{
"epoch": 0.34593364144305716,
"grad_norm": 0.232421875,
"learning_rate": 0.00046689309846654364,
"loss": 2.8815147399902346,
"step": 10030
},
{
"epoch": 0.3462785403876664,
"grad_norm": 0.2265625,
"learning_rate": 0.0004668273130685495,
"loss": 2.8637039184570314,
"step": 10040
},
{
"epoch": 0.34662343933227563,
"grad_norm": 0.28125,
"learning_rate": 0.0004667614672825298,
"loss": 2.8640941619873046,
"step": 10050
},
{
"epoch": 0.3469683382768849,
"grad_norm": 0.2353515625,
"learning_rate": 0.0004666955611279449,
"loss": 2.855289077758789,
"step": 10060
},
{
"epoch": 0.3473132372214941,
"grad_norm": 0.21484375,
"learning_rate": 0.0004666295946242731,
"loss": 2.8919794082641603,
"step": 10070
},
{
"epoch": 0.3476581361661033,
"grad_norm": 0.201171875,
"learning_rate": 0.00046656356779101047,
"loss": 2.8786876678466795,
"step": 10080
},
{
"epoch": 0.34800303511071257,
"grad_norm": 0.25390625,
"learning_rate": 0.000466497480647671,
"loss": 2.878182601928711,
"step": 10090
},
{
"epoch": 0.3483479340553218,
"grad_norm": 0.2333984375,
"learning_rate": 0.00046643133321378643,
"loss": 2.876922035217285,
"step": 10100
},
{
"epoch": 0.3483479340553218,
"eval_loss": 3.0728087425231934,
"eval_runtime": 6.8468,
"eval_samples_per_second": 47.76,
"eval_steps_per_second": 1.607,
"step": 10100
},
{
"epoch": 0.34869283299993103,
"grad_norm": 0.2353515625,
"learning_rate": 0.0004663651255089064,
"loss": 2.8738582611083983,
"step": 10110
},
{
"epoch": 0.34903773194454024,
"grad_norm": 0.2236328125,
"learning_rate": 0.00046629885755259813,
"loss": 2.8597055435180665,
"step": 10120
},
{
"epoch": 0.3493826308891495,
"grad_norm": 0.2373046875,
"learning_rate": 0.000466232529364447,
"loss": 2.86612548828125,
"step": 10130
},
{
"epoch": 0.3497275298337587,
"grad_norm": 0.2353515625,
"learning_rate": 0.0004661661409640559,
"loss": 2.857718086242676,
"step": 10140
},
{
"epoch": 0.3500724287783679,
"grad_norm": 0.2275390625,
"learning_rate": 0.00046609969237104573,
"loss": 2.860115623474121,
"step": 10150
}
],
"logging_steps": 10,
"max_steps": 57988,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 50,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 9.810306083258892e+18,
"train_batch_size": 32,
"trial_name": null,
"trial_params": null
}