Files
general_knowledge_model/checkpoint-7136/trainer_state.json
ModelHub XC e7f998cf6d 初始化项目,由ModelHub XC社区提供模型
Model: cs-552-2026-the-transformers/general_knowledge_model
Source: Original Platform
2026-07-20 05:53:10 +08:00

7165 lines
204 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 500,
"global_step": 7136,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 1.1749843299388885,
"epoch": 0.0014013943874154784,
"grad_norm": 77.5,
"learning_rate": 1.264044943820225e-07,
"loss": 3.7286407470703127,
"mean_token_accuracy": 0.4398000232875347,
"num_tokens": 58634.0,
"step": 10
},
{
"entropy": 1.138375636935234,
"epoch": 0.002802788774830957,
"grad_norm": 89.0,
"learning_rate": 2.668539325842697e-07,
"loss": 3.726331329345703,
"mean_token_accuracy": 0.44621490836143496,
"num_tokens": 117434.0,
"step": 20
},
{
"entropy": 1.1546230360865593,
"epoch": 0.004204183162246435,
"grad_norm": 77.0,
"learning_rate": 4.073033707865169e-07,
"loss": 3.6857357025146484,
"mean_token_accuracy": 0.44239638149738314,
"num_tokens": 177224.0,
"step": 30
},
{
"entropy": 1.165491023659706,
"epoch": 0.005605577549661914,
"grad_norm": 81.0,
"learning_rate": 5.477528089887641e-07,
"loss": 3.7168804168701173,
"mean_token_accuracy": 0.441532301902771,
"num_tokens": 238330.0,
"step": 40
},
{
"entropy": 1.2151292562484741,
"epoch": 0.007006971937077392,
"grad_norm": 65.0,
"learning_rate": 6.882022471910113e-07,
"loss": 3.7297904968261717,
"mean_token_accuracy": 0.4368342585861683,
"num_tokens": 296693.0,
"step": 50
},
{
"entropy": 1.2036117509007453,
"epoch": 0.00840836632449287,
"grad_norm": 63.0,
"learning_rate": 8.286516853932584e-07,
"loss": 3.6518295288085936,
"mean_token_accuracy": 0.44340850710868834,
"num_tokens": 355315.0,
"step": 60
},
{
"entropy": 1.217386195063591,
"epoch": 0.009809760711908349,
"grad_norm": 59.0,
"learning_rate": 9.691011235955058e-07,
"loss": 3.5424434661865236,
"mean_token_accuracy": 0.44781318232417106,
"num_tokens": 414287.0,
"step": 70
},
{
"entropy": 1.2282691702246666,
"epoch": 0.011211155099323827,
"grad_norm": 57.0,
"learning_rate": 1.1095505617977528e-06,
"loss": 3.553877258300781,
"mean_token_accuracy": 0.4493464961647987,
"num_tokens": 470247.0,
"step": 80
},
{
"entropy": 1.2959989964962007,
"epoch": 0.012612549486739306,
"grad_norm": 47.25,
"learning_rate": 1.25e-06,
"loss": 3.4337196350097656,
"mean_token_accuracy": 0.4504865989089012,
"num_tokens": 530809.0,
"step": 90
},
{
"entropy": 1.3231378316879272,
"epoch": 0.014013943874154784,
"grad_norm": 42.5,
"learning_rate": 1.3904494382022474e-06,
"loss": 3.357102966308594,
"mean_token_accuracy": 0.46152718737721443,
"num_tokens": 589432.0,
"step": 100
},
{
"entropy": 1.376977691054344,
"epoch": 0.015415338261570263,
"grad_norm": 30.75,
"learning_rate": 1.5308988764044946e-06,
"loss": 3.2706432342529297,
"mean_token_accuracy": 0.4622736141085625,
"num_tokens": 647158.0,
"step": 110
},
{
"entropy": 1.4021880328655243,
"epoch": 0.01681673264898574,
"grad_norm": 25.0,
"learning_rate": 1.6713483146067417e-06,
"loss": 3.1713953018188477,
"mean_token_accuracy": 0.4704868413507938,
"num_tokens": 707400.0,
"step": 120
},
{
"entropy": 1.436927217245102,
"epoch": 0.01821812703640122,
"grad_norm": 27.375,
"learning_rate": 1.811797752808989e-06,
"loss": 3.0929262161254885,
"mean_token_accuracy": 0.47034821286797523,
"num_tokens": 764052.0,
"step": 130
},
{
"entropy": 1.5048964083194734,
"epoch": 0.019619521423816698,
"grad_norm": 18.875,
"learning_rate": 1.9522471910112362e-06,
"loss": 3.021409606933594,
"mean_token_accuracy": 0.4734907761216164,
"num_tokens": 819260.0,
"step": 140
},
{
"entropy": 1.6020113319158553,
"epoch": 0.021020915811232176,
"grad_norm": 18.25,
"learning_rate": 2.0926966292134835e-06,
"loss": 2.9581523895263673,
"mean_token_accuracy": 0.46810011118650435,
"num_tokens": 878716.0,
"step": 150
},
{
"entropy": 1.6423213809728623,
"epoch": 0.022422310198647655,
"grad_norm": 16.0,
"learning_rate": 2.2331460674157303e-06,
"loss": 2.784856414794922,
"mean_token_accuracy": 0.4787336468696594,
"num_tokens": 938918.0,
"step": 160
},
{
"entropy": 1.6930634200572967,
"epoch": 0.023823704586063133,
"grad_norm": 13.4375,
"learning_rate": 2.3735955056179776e-06,
"loss": 2.6741771697998047,
"mean_token_accuracy": 0.48545088768005373,
"num_tokens": 996413.0,
"step": 170
},
{
"entropy": 1.764124980568886,
"epoch": 0.02522509897347861,
"grad_norm": 12.75,
"learning_rate": 2.514044943820225e-06,
"loss": 2.544516754150391,
"mean_token_accuracy": 0.4911739453673363,
"num_tokens": 1055251.0,
"step": 180
},
{
"entropy": 1.7424744457006454,
"epoch": 0.02662649336089409,
"grad_norm": 9.75,
"learning_rate": 2.654494382022472e-06,
"loss": 2.343752861022949,
"mean_token_accuracy": 0.5158485703170299,
"num_tokens": 1111837.0,
"step": 190
},
{
"entropy": 1.787026074528694,
"epoch": 0.02802788774830957,
"grad_norm": 8.5625,
"learning_rate": 2.7949438202247194e-06,
"loss": 2.3229976654052735,
"mean_token_accuracy": 0.5173665106296539,
"num_tokens": 1172000.0,
"step": 200
},
{
"entropy": 1.845227986574173,
"epoch": 0.029429282135725047,
"grad_norm": 7.28125,
"learning_rate": 2.9353932584269666e-06,
"loss": 2.2990942001342773,
"mean_token_accuracy": 0.5192534171044827,
"num_tokens": 1231079.0,
"step": 210
},
{
"entropy": 1.8506489276885987,
"epoch": 0.030830676523140525,
"grad_norm": 6.625,
"learning_rate": 3.075842696629214e-06,
"loss": 2.2143314361572264,
"mean_token_accuracy": 0.527560542523861,
"num_tokens": 1291223.0,
"step": 220
},
{
"entropy": 1.976783648133278,
"epoch": 0.032232070910556,
"grad_norm": 6.75,
"learning_rate": 3.2162921348314607e-06,
"loss": 2.259410285949707,
"mean_token_accuracy": 0.520425470918417,
"num_tokens": 1349689.0,
"step": 230
},
{
"entropy": 1.9874911963939668,
"epoch": 0.03363346529797148,
"grad_norm": 5.96875,
"learning_rate": 3.3567415730337084e-06,
"loss": 2.2152097702026365,
"mean_token_accuracy": 0.5251795709133148,
"num_tokens": 1413724.0,
"step": 240
},
{
"entropy": 2.0247445702552795,
"epoch": 0.03503485968538696,
"grad_norm": 7.34375,
"learning_rate": 3.4971910112359553e-06,
"loss": 2.192658042907715,
"mean_token_accuracy": 0.5360996119678021,
"num_tokens": 1470666.0,
"step": 250
},
{
"entropy": 2.0707518488168715,
"epoch": 0.03643625407280244,
"grad_norm": 5.375,
"learning_rate": 3.637640449438202e-06,
"loss": 2.203626823425293,
"mean_token_accuracy": 0.5276296675205231,
"num_tokens": 1531575.0,
"step": 260
},
{
"entropy": 2.0428607910871506,
"epoch": 0.037837648460217914,
"grad_norm": 4.875,
"learning_rate": 3.77808988764045e-06,
"loss": 2.181136894226074,
"mean_token_accuracy": 0.5354902669787407,
"num_tokens": 1589503.0,
"step": 270
},
{
"entropy": 2.094152969121933,
"epoch": 0.039239042847633396,
"grad_norm": 4.25,
"learning_rate": 3.918539325842697e-06,
"loss": 2.2115604400634767,
"mean_token_accuracy": 0.5282930836081505,
"num_tokens": 1650565.0,
"step": 280
},
{
"entropy": 2.070644298195839,
"epoch": 0.04064043723504887,
"grad_norm": 4.6875,
"learning_rate": 4.058988764044944e-06,
"loss": 2.190484809875488,
"mean_token_accuracy": 0.5283051446080208,
"num_tokens": 1712022.0,
"step": 290
},
{
"entropy": 2.076260048151016,
"epoch": 0.04204183162246435,
"grad_norm": 3.9375,
"learning_rate": 4.199438202247192e-06,
"loss": 2.1462358474731444,
"mean_token_accuracy": 0.533646783977747,
"num_tokens": 1777142.0,
"step": 300
},
{
"entropy": 2.0128800898790358,
"epoch": 0.04344322600987983,
"grad_norm": 3.578125,
"learning_rate": 4.339887640449438e-06,
"loss": 2.0999853134155275,
"mean_token_accuracy": 0.5459584936499595,
"num_tokens": 1833136.0,
"step": 310
},
{
"entropy": 1.9699875265359879,
"epoch": 0.04484462039729531,
"grad_norm": 3.609375,
"learning_rate": 4.480337078651686e-06,
"loss": 2.054058837890625,
"mean_token_accuracy": 0.548506161570549,
"num_tokens": 1890622.0,
"step": 320
},
{
"entropy": 2.0611583977937697,
"epoch": 0.046246014784710784,
"grad_norm": 3.640625,
"learning_rate": 4.6207865168539325e-06,
"loss": 2.1545442581176757,
"mean_token_accuracy": 0.5369547970592976,
"num_tokens": 1950235.0,
"step": 330
},
{
"entropy": 2.0399067103862762,
"epoch": 0.047647409172126266,
"grad_norm": 4.03125,
"learning_rate": 4.761235955056181e-06,
"loss": 2.139397621154785,
"mean_token_accuracy": 0.5447163872420788,
"num_tokens": 2008662.0,
"step": 340
},
{
"entropy": 1.9834542274475098,
"epoch": 0.04904880355954174,
"grad_norm": 3.5,
"learning_rate": 4.901685393258427e-06,
"loss": 2.0456113815307617,
"mean_token_accuracy": 0.5515513971447945,
"num_tokens": 2065547.0,
"step": 350
},
{
"entropy": 1.9932841449975967,
"epoch": 0.05045019794695722,
"grad_norm": 3.71875,
"learning_rate": 4.9977876106194695e-06,
"loss": 2.0840469360351563,
"mean_token_accuracy": 0.5537005968391895,
"num_tokens": 2122846.0,
"step": 360
},
{
"entropy": 1.9792243987321854,
"epoch": 0.0518515923343727,
"grad_norm": 3.765625,
"learning_rate": 4.990412979351033e-06,
"loss": 2.048763084411621,
"mean_token_accuracy": 0.5508734963834285,
"num_tokens": 2176941.0,
"step": 370
},
{
"entropy": 1.9960775971412659,
"epoch": 0.05325298672178818,
"grad_norm": 3.890625,
"learning_rate": 4.983038348082596e-06,
"loss": 2.0834062576293944,
"mean_token_accuracy": 0.5490451008081436,
"num_tokens": 2234758.0,
"step": 380
},
{
"entropy": 2.0350757420063017,
"epoch": 0.054654381109203655,
"grad_norm": 3.640625,
"learning_rate": 4.975663716814159e-06,
"loss": 2.102910041809082,
"mean_token_accuracy": 0.5434986114501953,
"num_tokens": 2291715.0,
"step": 390
},
{
"entropy": 2.029018145799637,
"epoch": 0.05605577549661914,
"grad_norm": 3.53125,
"learning_rate": 4.9682890855457235e-06,
"loss": 2.0678232192993162,
"mean_token_accuracy": 0.5505224116146564,
"num_tokens": 2350005.0,
"step": 400
},
{
"entropy": 2.0029339730739593,
"epoch": 0.05745716988403461,
"grad_norm": 4.46875,
"learning_rate": 4.960914454277287e-06,
"loss": 2.094471740722656,
"mean_token_accuracy": 0.5440472796559334,
"num_tokens": 2407677.0,
"step": 410
},
{
"entropy": 2.0633452206850054,
"epoch": 0.058858564271450094,
"grad_norm": 3.484375,
"learning_rate": 4.95353982300885e-06,
"loss": 2.13787899017334,
"mean_token_accuracy": 0.5416313037276268,
"num_tokens": 2467567.0,
"step": 420
},
{
"entropy": 1.9949743568897247,
"epoch": 0.06025995865886557,
"grad_norm": 4.28125,
"learning_rate": 4.946165191740413e-06,
"loss": 2.062998962402344,
"mean_token_accuracy": 0.547588687390089,
"num_tokens": 2525614.0,
"step": 430
},
{
"entropy": 2.019722428917885,
"epoch": 0.06166135304628105,
"grad_norm": 3.46875,
"learning_rate": 4.938790560471977e-06,
"loss": 2.0874080657958984,
"mean_token_accuracy": 0.5463835179805756,
"num_tokens": 2582910.0,
"step": 440
},
{
"entropy": 1.9916650235652924,
"epoch": 0.06306274743369653,
"grad_norm": 3.8125,
"learning_rate": 4.93141592920354e-06,
"loss": 2.0598018646240233,
"mean_token_accuracy": 0.5500055000185966,
"num_tokens": 2640183.0,
"step": 450
},
{
"entropy": 2.0060368895530702,
"epoch": 0.064464141821112,
"grad_norm": 3.59375,
"learning_rate": 4.924041297935104e-06,
"loss": 2.0795265197753907,
"mean_token_accuracy": 0.5481240846216678,
"num_tokens": 2698117.0,
"step": 460
},
{
"entropy": 2.033749130368233,
"epoch": 0.06586553620852749,
"grad_norm": 3.75,
"learning_rate": 4.9166666666666665e-06,
"loss": 2.095734405517578,
"mean_token_accuracy": 0.5404889442026615,
"num_tokens": 2756561.0,
"step": 470
},
{
"entropy": 2.0706971049308778,
"epoch": 0.06726693059594296,
"grad_norm": 3.390625,
"learning_rate": 4.909292035398231e-06,
"loss": 2.1171714782714846,
"mean_token_accuracy": 0.5364310555160046,
"num_tokens": 2818553.0,
"step": 480
},
{
"entropy": 2.058588495850563,
"epoch": 0.06866832498335844,
"grad_norm": 4.1875,
"learning_rate": 4.901917404129794e-06,
"loss": 2.1368818283081055,
"mean_token_accuracy": 0.5373388394713402,
"num_tokens": 2879555.0,
"step": 490
},
{
"entropy": 2.064988616108894,
"epoch": 0.07006971937077391,
"grad_norm": 3.78125,
"learning_rate": 4.894542772861358e-06,
"loss": 2.1231252670288088,
"mean_token_accuracy": 0.5416132740676403,
"num_tokens": 2936270.0,
"step": 500
},
{
"entropy": 2.0648070216178893,
"epoch": 0.0714711137581894,
"grad_norm": 3.703125,
"learning_rate": 4.8871681415929204e-06,
"loss": 2.1406299591064455,
"mean_token_accuracy": 0.5388594828546047,
"num_tokens": 2993931.0,
"step": 510
},
{
"entropy": 2.065402030944824,
"epoch": 0.07287250814560488,
"grad_norm": 3.609375,
"learning_rate": 4.879793510324485e-06,
"loss": 2.1110891342163085,
"mean_token_accuracy": 0.5408674567937851,
"num_tokens": 3052231.0,
"step": 520
},
{
"entropy": 2.008076322078705,
"epoch": 0.07427390253302035,
"grad_norm": 3.71875,
"learning_rate": 4.872418879056048e-06,
"loss": 2.0839359283447267,
"mean_token_accuracy": 0.5448177300393582,
"num_tokens": 3113651.0,
"step": 530
},
{
"entropy": 2.0742378741502763,
"epoch": 0.07567529692043583,
"grad_norm": 3.453125,
"learning_rate": 4.865044247787611e-06,
"loss": 2.1109527587890624,
"mean_token_accuracy": 0.5407277189195157,
"num_tokens": 3175338.0,
"step": 540
},
{
"entropy": 2.048898476362228,
"epoch": 0.07707669130785132,
"grad_norm": 4.1875,
"learning_rate": 4.8576696165191744e-06,
"loss": 2.106137275695801,
"mean_token_accuracy": 0.546953809261322,
"num_tokens": 3233510.0,
"step": 550
},
{
"entropy": 2.084382873773575,
"epoch": 0.07847808569526679,
"grad_norm": 3.4375,
"learning_rate": 4.850294985250738e-06,
"loss": 2.1437379837036135,
"mean_token_accuracy": 0.5365074597299099,
"num_tokens": 3294641.0,
"step": 560
},
{
"entropy": 2.0615872770547865,
"epoch": 0.07987948008268227,
"grad_norm": 4.21875,
"learning_rate": 4.842920353982301e-06,
"loss": 2.1082529067993163,
"mean_token_accuracy": 0.5400469101965427,
"num_tokens": 3354895.0,
"step": 570
},
{
"entropy": 2.0372446924448013,
"epoch": 0.08128087447009774,
"grad_norm": 3.875,
"learning_rate": 4.835545722713864e-06,
"loss": 2.0846746444702147,
"mean_token_accuracy": 0.542639608681202,
"num_tokens": 3415190.0,
"step": 580
},
{
"entropy": 2.0401179790496826,
"epoch": 0.08268226885751323,
"grad_norm": 3.65625,
"learning_rate": 4.8281710914454284e-06,
"loss": 2.0969858169555664,
"mean_token_accuracy": 0.5441658839583396,
"num_tokens": 3474415.0,
"step": 590
},
{
"entropy": 2.009382280707359,
"epoch": 0.0840836632449287,
"grad_norm": 3.75,
"learning_rate": 4.820796460176992e-06,
"loss": 2.0534940719604493,
"mean_token_accuracy": 0.5497397676110267,
"num_tokens": 3531386.0,
"step": 600
},
{
"entropy": 1.959547182917595,
"epoch": 0.08548505763234418,
"grad_norm": 4.0625,
"learning_rate": 4.813421828908555e-06,
"loss": 2.0382083892822265,
"mean_token_accuracy": 0.5582435041666031,
"num_tokens": 3587230.0,
"step": 610
},
{
"entropy": 2.0483379155397414,
"epoch": 0.08688645201975966,
"grad_norm": 3.359375,
"learning_rate": 4.806047197640118e-06,
"loss": 2.0792516708374023,
"mean_token_accuracy": 0.5420335404574871,
"num_tokens": 3649935.0,
"step": 620
},
{
"entropy": 2.048970940709114,
"epoch": 0.08828784640717514,
"grad_norm": 4.375,
"learning_rate": 4.7986725663716816e-06,
"loss": 2.0989675521850586,
"mean_token_accuracy": 0.5420025557279586,
"num_tokens": 3708420.0,
"step": 630
},
{
"entropy": 1.942202365398407,
"epoch": 0.08968924079459062,
"grad_norm": 3.390625,
"learning_rate": 4.791297935103245e-06,
"loss": 2.0210729598999024,
"mean_token_accuracy": 0.560210132598877,
"num_tokens": 3761875.0,
"step": 640
},
{
"entropy": 2.0344078302383424,
"epoch": 0.0910906351820061,
"grad_norm": 3.53125,
"learning_rate": 4.783923303834809e-06,
"loss": 2.0858205795288085,
"mean_token_accuracy": 0.5398732639849186,
"num_tokens": 3820824.0,
"step": 650
},
{
"entropy": 2.085204502940178,
"epoch": 0.09249202956942157,
"grad_norm": 4.15625,
"learning_rate": 4.776548672566372e-06,
"loss": 2.1287776947021486,
"mean_token_accuracy": 0.5379412017762661,
"num_tokens": 3881060.0,
"step": 660
},
{
"entropy": 2.029499676823616,
"epoch": 0.09389342395683706,
"grad_norm": 3.8125,
"learning_rate": 4.7691740412979356e-06,
"loss": 2.0897621154785155,
"mean_token_accuracy": 0.5459394969046116,
"num_tokens": 3937415.0,
"step": 670
},
{
"entropy": 2.04031979739666,
"epoch": 0.09529481834425253,
"grad_norm": 3.296875,
"learning_rate": 4.761799410029499e-06,
"loss": 2.08218936920166,
"mean_token_accuracy": 0.5483398318290711,
"num_tokens": 3996057.0,
"step": 680
},
{
"entropy": 2.031023436784744,
"epoch": 0.09669621273166801,
"grad_norm": 3.96875,
"learning_rate": 4.754424778761063e-06,
"loss": 2.074525260925293,
"mean_token_accuracy": 0.5459690198302269,
"num_tokens": 4055201.0,
"step": 690
},
{
"entropy": 2.017417848110199,
"epoch": 0.09809760711908348,
"grad_norm": 3.625,
"learning_rate": 4.747050147492625e-06,
"loss": 2.0694021224975585,
"mean_token_accuracy": 0.5547117449343204,
"num_tokens": 4111854.0,
"step": 700
},
{
"entropy": 2.0284538745880125,
"epoch": 0.09949900150649897,
"grad_norm": 3.578125,
"learning_rate": 4.7396755162241895e-06,
"loss": 2.127583694458008,
"mean_token_accuracy": 0.5464184492826462,
"num_tokens": 4171738.0,
"step": 710
},
{
"entropy": 1.997345969080925,
"epoch": 0.10090039589391445,
"grad_norm": 3.4375,
"learning_rate": 4.732300884955753e-06,
"loss": 2.038435363769531,
"mean_token_accuracy": 0.5501852035522461,
"num_tokens": 4229220.0,
"step": 720
},
{
"entropy": 2.0234489142894745,
"epoch": 0.10230179028132992,
"grad_norm": 3.71875,
"learning_rate": 4.724926253687316e-06,
"loss": 2.063991928100586,
"mean_token_accuracy": 0.5484826415777206,
"num_tokens": 4287264.0,
"step": 730
},
{
"entropy": 2.0313188999891283,
"epoch": 0.1037031846687454,
"grad_norm": 3.375,
"learning_rate": 4.717551622418879e-06,
"loss": 2.1104171752929686,
"mean_token_accuracy": 0.5436050571501255,
"num_tokens": 4347435.0,
"step": 740
},
{
"entropy": 2.058633345365524,
"epoch": 0.10510457905616089,
"grad_norm": 3.75,
"learning_rate": 4.710176991150443e-06,
"loss": 2.112974739074707,
"mean_token_accuracy": 0.5412231512367726,
"num_tokens": 4408019.0,
"step": 750
},
{
"entropy": 2.0089460521936418,
"epoch": 0.10650597344357636,
"grad_norm": 3.625,
"learning_rate": 4.702802359882006e-06,
"loss": 2.0665733337402346,
"mean_token_accuracy": 0.5501148752868176,
"num_tokens": 4465697.0,
"step": 760
},
{
"entropy": 1.9932250171899795,
"epoch": 0.10790736783099183,
"grad_norm": 3.515625,
"learning_rate": 4.695427728613569e-06,
"loss": 2.0313592910766602,
"mean_token_accuracy": 0.5506305918097496,
"num_tokens": 4523186.0,
"step": 770
},
{
"entropy": 2.016455405950546,
"epoch": 0.10930876221840731,
"grad_norm": 3.1875,
"learning_rate": 4.688053097345133e-06,
"loss": 2.0808271408081054,
"mean_token_accuracy": 0.5452144391834736,
"num_tokens": 4581461.0,
"step": 780
},
{
"entropy": 2.0657077699899675,
"epoch": 0.1107101566058228,
"grad_norm": 3.703125,
"learning_rate": 4.680678466076697e-06,
"loss": 2.089410591125488,
"mean_token_accuracy": 0.5414080828428268,
"num_tokens": 4643576.0,
"step": 790
},
{
"entropy": 1.9475072085857392,
"epoch": 0.11211155099323827,
"grad_norm": 3.796875,
"learning_rate": 4.67330383480826e-06,
"loss": 2.022770309448242,
"mean_token_accuracy": 0.5502500668168068,
"num_tokens": 4701452.0,
"step": 800
},
{
"entropy": 2.0099977761507035,
"epoch": 0.11351294538065375,
"grad_norm": 3.953125,
"learning_rate": 4.665929203539823e-06,
"loss": 2.044535255432129,
"mean_token_accuracy": 0.5522691115736962,
"num_tokens": 4755652.0,
"step": 810
},
{
"entropy": 2.032015699148178,
"epoch": 0.11491433976806922,
"grad_norm": 3.890625,
"learning_rate": 4.658554572271387e-06,
"loss": 2.090387153625488,
"mean_token_accuracy": 0.5472030349075794,
"num_tokens": 4815215.0,
"step": 820
},
{
"entropy": 2.002387708425522,
"epoch": 0.11631573415548471,
"grad_norm": 3.171875,
"learning_rate": 4.65117994100295e-06,
"loss": 2.041549301147461,
"mean_token_accuracy": 0.5508693747222424,
"num_tokens": 4872654.0,
"step": 830
},
{
"entropy": 2.057389384508133,
"epoch": 0.11771712854290019,
"grad_norm": 3.578125,
"learning_rate": 4.643805309734514e-06,
"loss": 2.098028564453125,
"mean_token_accuracy": 0.5409851305186748,
"num_tokens": 4932258.0,
"step": 840
},
{
"entropy": 2.0524306416511537,
"epoch": 0.11911852293031566,
"grad_norm": 3.40625,
"learning_rate": 4.636430678466077e-06,
"loss": 2.0935876846313475,
"mean_token_accuracy": 0.5410212010145188,
"num_tokens": 4992277.0,
"step": 850
},
{
"entropy": 2.0131456166505814,
"epoch": 0.12051991731773114,
"grad_norm": 3.84375,
"learning_rate": 4.6290560471976405e-06,
"loss": 2.0590002059936525,
"mean_token_accuracy": 0.5476037085056304,
"num_tokens": 5049601.0,
"step": 860
},
{
"entropy": 2.0318191319704058,
"epoch": 0.12192131170514663,
"grad_norm": 3.359375,
"learning_rate": 4.621681415929204e-06,
"loss": 2.0884126663208007,
"mean_token_accuracy": 0.5430484347045421,
"num_tokens": 5108748.0,
"step": 870
},
{
"entropy": 2.083487269282341,
"epoch": 0.1233227060925621,
"grad_norm": 3.171875,
"learning_rate": 4.614306784660768e-06,
"loss": 2.1179590225219727,
"mean_token_accuracy": 0.5432230710983277,
"num_tokens": 5168839.0,
"step": 880
},
{
"entropy": 2.0145327717065813,
"epoch": 0.12472410047997758,
"grad_norm": 3.75,
"learning_rate": 4.60693215339233e-06,
"loss": 2.07696475982666,
"mean_token_accuracy": 0.5457107946276665,
"num_tokens": 5227340.0,
"step": 890
},
{
"entropy": 2.035206711292267,
"epoch": 0.12612549486739305,
"grad_norm": 3.78125,
"learning_rate": 4.5995575221238945e-06,
"loss": 2.0905691146850587,
"mean_token_accuracy": 0.5446631409227848,
"num_tokens": 5285854.0,
"step": 900
},
{
"entropy": 2.0117908298969267,
"epoch": 0.12752688925480854,
"grad_norm": 3.703125,
"learning_rate": 4.592182890855458e-06,
"loss": 2.0560426712036133,
"mean_token_accuracy": 0.5508834436535835,
"num_tokens": 5341221.0,
"step": 910
},
{
"entropy": 2.0344759225845337,
"epoch": 0.128928283642224,
"grad_norm": 3.71875,
"learning_rate": 4.584808259587021e-06,
"loss": 2.079263687133789,
"mean_token_accuracy": 0.5434476636350155,
"num_tokens": 5401626.0,
"step": 920
},
{
"entropy": 1.9311437100172042,
"epoch": 0.1303296780296395,
"grad_norm": 4.0625,
"learning_rate": 4.577433628318584e-06,
"loss": 2.022018814086914,
"mean_token_accuracy": 0.5603329479694367,
"num_tokens": 5457954.0,
"step": 930
},
{
"entropy": 2.0410451918840407,
"epoch": 0.13173107241705498,
"grad_norm": 3.6875,
"learning_rate": 4.570058997050148e-06,
"loss": 2.0759771347045897,
"mean_token_accuracy": 0.5456251330673695,
"num_tokens": 5514411.0,
"step": 940
},
{
"entropy": 2.0314603090286254,
"epoch": 0.13313246680447044,
"grad_norm": 3.625,
"learning_rate": 4.562684365781711e-06,
"loss": 2.087483787536621,
"mean_token_accuracy": 0.5457659848034382,
"num_tokens": 5573836.0,
"step": 950
},
{
"entropy": 2.048544630408287,
"epoch": 0.13453386119188593,
"grad_norm": 3.265625,
"learning_rate": 4.555309734513274e-06,
"loss": 2.0968584060668944,
"mean_token_accuracy": 0.5420685298740864,
"num_tokens": 5631848.0,
"step": 960
},
{
"entropy": 2.0000774681568148,
"epoch": 0.13593525557930142,
"grad_norm": 3.453125,
"learning_rate": 4.547935103244838e-06,
"loss": 2.0616247177124025,
"mean_token_accuracy": 0.5471087761223317,
"num_tokens": 5690136.0,
"step": 970
},
{
"entropy": 2.049460005760193,
"epoch": 0.13733664996671688,
"grad_norm": 3.71875,
"learning_rate": 4.540560471976402e-06,
"loss": 2.0837566375732424,
"mean_token_accuracy": 0.5436567731201649,
"num_tokens": 5749865.0,
"step": 980
},
{
"entropy": 1.996617168188095,
"epoch": 0.13873804435413237,
"grad_norm": 4.03125,
"learning_rate": 4.533185840707965e-06,
"loss": 2.039174270629883,
"mean_token_accuracy": 0.5500171341001987,
"num_tokens": 5809556.0,
"step": 990
},
{
"entropy": 2.08602631688118,
"epoch": 0.14013943874154783,
"grad_norm": 3.59375,
"learning_rate": 4.525811209439528e-06,
"loss": 2.1357633590698244,
"mean_token_accuracy": 0.5347492642700672,
"num_tokens": 5871230.0,
"step": 1000
},
{
"entropy": 2.050332334637642,
"epoch": 0.14154083312896332,
"grad_norm": 3.5625,
"learning_rate": 4.518436578171092e-06,
"loss": 2.0810262680053713,
"mean_token_accuracy": 0.5481423802673817,
"num_tokens": 5927611.0,
"step": 1010
},
{
"entropy": 2.017560285329819,
"epoch": 0.1429422275163788,
"grad_norm": 3.484375,
"learning_rate": 4.511061946902655e-06,
"loss": 2.044953727722168,
"mean_token_accuracy": 0.5441621497273446,
"num_tokens": 5988181.0,
"step": 1020
},
{
"entropy": 1.978191888332367,
"epoch": 0.14434362190379427,
"grad_norm": 3.25,
"learning_rate": 4.503687315634219e-06,
"loss": 2.0562999725341795,
"mean_token_accuracy": 0.553606178611517,
"num_tokens": 6044917.0,
"step": 1030
},
{
"entropy": 2.0290765553712844,
"epoch": 0.14574501629120976,
"grad_norm": 3.59375,
"learning_rate": 4.496312684365782e-06,
"loss": 2.0762353897094727,
"mean_token_accuracy": 0.5505865596234798,
"num_tokens": 6103386.0,
"step": 1040
},
{
"entropy": 1.9776984721422195,
"epoch": 0.14714641067862524,
"grad_norm": 3.8125,
"learning_rate": 4.4889380530973455e-06,
"loss": 2.0386898040771486,
"mean_token_accuracy": 0.554041002690792,
"num_tokens": 6160068.0,
"step": 1050
},
{
"entropy": 2.023387759923935,
"epoch": 0.1485478050660407,
"grad_norm": 4.4375,
"learning_rate": 4.481563421828909e-06,
"loss": 2.0716257095336914,
"mean_token_accuracy": 0.5479126609861851,
"num_tokens": 6220498.0,
"step": 1060
},
{
"entropy": 2.0474730670452117,
"epoch": 0.1499491994534562,
"grad_norm": 3.203125,
"learning_rate": 4.474188790560473e-06,
"loss": 2.077955436706543,
"mean_token_accuracy": 0.5469909913837909,
"num_tokens": 6278819.0,
"step": 1070
},
{
"entropy": 2.0014224141836165,
"epoch": 0.15135059384087166,
"grad_norm": 3.59375,
"learning_rate": 4.466814159292035e-06,
"loss": 2.049655723571777,
"mean_token_accuracy": 0.5477922618389129,
"num_tokens": 6338511.0,
"step": 1080
},
{
"entropy": 1.9802268594503403,
"epoch": 0.15275198822828714,
"grad_norm": 3.734375,
"learning_rate": 4.4594395280235995e-06,
"loss": 2.0510026931762697,
"mean_token_accuracy": 0.549194262176752,
"num_tokens": 6398236.0,
"step": 1090
},
{
"entropy": 2.0562620222568513,
"epoch": 0.15415338261570263,
"grad_norm": 3.515625,
"learning_rate": 4.452064896755163e-06,
"loss": 2.075428771972656,
"mean_token_accuracy": 0.5397219233214855,
"num_tokens": 6458469.0,
"step": 1100
},
{
"entropy": 1.9961812257766725,
"epoch": 0.1555547770031181,
"grad_norm": 3.90625,
"learning_rate": 4.444690265486726e-06,
"loss": 2.042446327209473,
"mean_token_accuracy": 0.546827956289053,
"num_tokens": 6520285.0,
"step": 1110
},
{
"entropy": 1.9569410175085067,
"epoch": 0.15695617139053358,
"grad_norm": 3.640625,
"learning_rate": 4.437315634218289e-06,
"loss": 2.0179250717163084,
"mean_token_accuracy": 0.5565195336937905,
"num_tokens": 6575492.0,
"step": 1120
},
{
"entropy": 2.020855191349983,
"epoch": 0.15835756577794907,
"grad_norm": 3.84375,
"learning_rate": 4.429941002949853e-06,
"loss": 2.0828372955322267,
"mean_token_accuracy": 0.5492666378617287,
"num_tokens": 6632686.0,
"step": 1130
},
{
"entropy": 2.033621999621391,
"epoch": 0.15975896016536453,
"grad_norm": 3.265625,
"learning_rate": 4.422566371681417e-06,
"loss": 2.08284969329834,
"mean_token_accuracy": 0.5422478929162026,
"num_tokens": 6693725.0,
"step": 1140
},
{
"entropy": 2.0249646574258806,
"epoch": 0.16116035455278002,
"grad_norm": 3.3125,
"learning_rate": 4.41519174041298e-06,
"loss": 2.0838279724121094,
"mean_token_accuracy": 0.5503048494458198,
"num_tokens": 6748881.0,
"step": 1150
},
{
"entropy": 2.014036813378334,
"epoch": 0.16256174894019548,
"grad_norm": 4.09375,
"learning_rate": 4.407817109144543e-06,
"loss": 2.0788618087768556,
"mean_token_accuracy": 0.5560389801859855,
"num_tokens": 6803170.0,
"step": 1160
},
{
"entropy": 2.036391496658325,
"epoch": 0.16396314332761097,
"grad_norm": 3.296875,
"learning_rate": 4.400442477876107e-06,
"loss": 2.08026008605957,
"mean_token_accuracy": 0.5430544361472129,
"num_tokens": 6862145.0,
"step": 1170
},
{
"entropy": 2.048283538222313,
"epoch": 0.16536453771502646,
"grad_norm": 3.671875,
"learning_rate": 4.39306784660767e-06,
"loss": 2.0746267318725584,
"mean_token_accuracy": 0.5450486116111278,
"num_tokens": 6922081.0,
"step": 1180
},
{
"entropy": 2.039934918284416,
"epoch": 0.16676593210244192,
"grad_norm": 3.6875,
"learning_rate": 4.385693215339233e-06,
"loss": 2.0975273132324217,
"mean_token_accuracy": 0.5371013961732387,
"num_tokens": 6987071.0,
"step": 1190
},
{
"entropy": 2.0690238893032076,
"epoch": 0.1681673264898574,
"grad_norm": 3.65625,
"learning_rate": 4.378318584070797e-06,
"loss": 2.093341064453125,
"mean_token_accuracy": 0.5354558274149894,
"num_tokens": 7050863.0,
"step": 1200
},
{
"entropy": 2.0879353821277618,
"epoch": 0.1695687208772729,
"grad_norm": 3.265625,
"learning_rate": 4.37094395280236e-06,
"loss": 2.138813018798828,
"mean_token_accuracy": 0.5322487376630306,
"num_tokens": 7114408.0,
"step": 1210
},
{
"entropy": 2.0216532915830614,
"epoch": 0.17097011526468836,
"grad_norm": 3.921875,
"learning_rate": 4.363569321533924e-06,
"loss": 2.0587230682373048,
"mean_token_accuracy": 0.5481282226741314,
"num_tokens": 7171138.0,
"step": 1220
},
{
"entropy": 2.0256995797157287,
"epoch": 0.17237150965210385,
"grad_norm": 4.0,
"learning_rate": 4.356194690265487e-06,
"loss": 2.0920654296875,
"mean_token_accuracy": 0.5509567841887474,
"num_tokens": 7227571.0,
"step": 1230
},
{
"entropy": 1.96624498963356,
"epoch": 0.1737729040395193,
"grad_norm": 4.6875,
"learning_rate": 4.34882005899705e-06,
"loss": 2.0297975540161133,
"mean_token_accuracy": 0.5592314623296261,
"num_tokens": 7283174.0,
"step": 1240
},
{
"entropy": 1.9834202975034714,
"epoch": 0.1751742984269348,
"grad_norm": 3.171875,
"learning_rate": 4.341445427728614e-06,
"loss": 2.032474899291992,
"mean_token_accuracy": 0.5518560096621513,
"num_tokens": 7341620.0,
"step": 1250
},
{
"entropy": 2.0227621525526045,
"epoch": 0.1765756928143503,
"grad_norm": 3.59375,
"learning_rate": 4.334070796460178e-06,
"loss": 2.0725967407226564,
"mean_token_accuracy": 0.550294154882431,
"num_tokens": 7401468.0,
"step": 1260
},
{
"entropy": 2.0101997554302216,
"epoch": 0.17797708720176575,
"grad_norm": 3.53125,
"learning_rate": 4.32669616519174e-06,
"loss": 2.0583026885986326,
"mean_token_accuracy": 0.5472072966396808,
"num_tokens": 7458282.0,
"step": 1270
},
{
"entropy": 1.99407716691494,
"epoch": 0.17937848158918124,
"grad_norm": 3.84375,
"learning_rate": 4.319321533923304e-06,
"loss": 2.032002639770508,
"mean_token_accuracy": 0.5496652647852898,
"num_tokens": 7517901.0,
"step": 1280
},
{
"entropy": 2.0280429512262343,
"epoch": 0.18077987597659673,
"grad_norm": 3.953125,
"learning_rate": 4.311946902654868e-06,
"loss": 2.0772026062011717,
"mean_token_accuracy": 0.5498968653380871,
"num_tokens": 7576444.0,
"step": 1290
},
{
"entropy": 2.017439436912537,
"epoch": 0.1821812703640122,
"grad_norm": 3.4375,
"learning_rate": 4.304572271386431e-06,
"loss": 2.03843994140625,
"mean_token_accuracy": 0.5490963935852051,
"num_tokens": 7631549.0,
"step": 1300
},
{
"entropy": 2.017805191874504,
"epoch": 0.18358266475142768,
"grad_norm": 3.390625,
"learning_rate": 4.297197640117994e-06,
"loss": 2.061754035949707,
"mean_token_accuracy": 0.5464312724769116,
"num_tokens": 7690773.0,
"step": 1310
},
{
"entropy": 2.03846270442009,
"epoch": 0.18498405913884314,
"grad_norm": 3.765625,
"learning_rate": 4.2898230088495575e-06,
"loss": 2.0858694076538087,
"mean_token_accuracy": 0.5471534766256809,
"num_tokens": 7746556.0,
"step": 1320
},
{
"entropy": 1.9878355622291566,
"epoch": 0.18638545352625863,
"grad_norm": 4.09375,
"learning_rate": 4.282448377581122e-06,
"loss": 2.0129779815673827,
"mean_token_accuracy": 0.555971772223711,
"num_tokens": 7802469.0,
"step": 1330
},
{
"entropy": 2.050147184729576,
"epoch": 0.18778684791367412,
"grad_norm": 3.234375,
"learning_rate": 4.275073746312685e-06,
"loss": 2.0990713119506834,
"mean_token_accuracy": 0.5421249151229859,
"num_tokens": 7862639.0,
"step": 1340
},
{
"entropy": 2.042793941497803,
"epoch": 0.18918824230108958,
"grad_norm": 3.8125,
"learning_rate": 4.267699115044248e-06,
"loss": 2.09356632232666,
"mean_token_accuracy": 0.5455923363566398,
"num_tokens": 7924419.0,
"step": 1350
},
{
"entropy": 1.9938032358884812,
"epoch": 0.19058963668850507,
"grad_norm": 3.578125,
"learning_rate": 4.2603244837758115e-06,
"loss": 2.031763458251953,
"mean_token_accuracy": 0.5496641293168067,
"num_tokens": 7983402.0,
"step": 1360
},
{
"entropy": 2.0284968227148057,
"epoch": 0.19199103107592055,
"grad_norm": 3.46875,
"learning_rate": 4.252949852507375e-06,
"loss": 2.0689836502075196,
"mean_token_accuracy": 0.543882504850626,
"num_tokens": 8043153.0,
"step": 1370
},
{
"entropy": 2.094452905654907,
"epoch": 0.19339242546333602,
"grad_norm": 3.484375,
"learning_rate": 4.245575221238938e-06,
"loss": 2.1328027725219725,
"mean_token_accuracy": 0.5360393956303596,
"num_tokens": 8105121.0,
"step": 1380
},
{
"entropy": 1.9476406127214432,
"epoch": 0.1947938198507515,
"grad_norm": 4.28125,
"learning_rate": 4.238200589970502e-06,
"loss": 1.9976503372192382,
"mean_token_accuracy": 0.5624695174396038,
"num_tokens": 8158071.0,
"step": 1390
},
{
"entropy": 2.04414941072464,
"epoch": 0.19619521423816697,
"grad_norm": 3.546875,
"learning_rate": 4.230825958702065e-06,
"loss": 2.095863914489746,
"mean_token_accuracy": 0.5353860557079315,
"num_tokens": 8218916.0,
"step": 1400
},
{
"entropy": 2.0396353930234907,
"epoch": 0.19759660862558245,
"grad_norm": 3.46875,
"learning_rate": 4.223451327433629e-06,
"loss": 2.056717872619629,
"mean_token_accuracy": 0.5479662336409092,
"num_tokens": 8278908.0,
"step": 1410
},
{
"entropy": 2.02007874250412,
"epoch": 0.19899800301299794,
"grad_norm": 3.546875,
"learning_rate": 4.216076696165192e-06,
"loss": 2.093400001525879,
"mean_token_accuracy": 0.5425383374094963,
"num_tokens": 8340788.0,
"step": 1420
},
{
"entropy": 2.080344945192337,
"epoch": 0.2003993974004134,
"grad_norm": 3.4375,
"learning_rate": 4.208702064896755e-06,
"loss": 2.1184001922607423,
"mean_token_accuracy": 0.5389995083212853,
"num_tokens": 8401654.0,
"step": 1430
},
{
"entropy": 2.0462054193019865,
"epoch": 0.2018007917878289,
"grad_norm": 4.3125,
"learning_rate": 4.201327433628319e-06,
"loss": 2.095401382446289,
"mean_token_accuracy": 0.5458614088594913,
"num_tokens": 8461086.0,
"step": 1440
},
{
"entropy": 2.0348505645990373,
"epoch": 0.20320218617524438,
"grad_norm": 3.703125,
"learning_rate": 4.193952802359883e-06,
"loss": 2.0764629364013674,
"mean_token_accuracy": 0.5477914564311505,
"num_tokens": 8519544.0,
"step": 1450
},
{
"entropy": 2.0418587952852247,
"epoch": 0.20460358056265984,
"grad_norm": 3.78125,
"learning_rate": 4.186578171091446e-06,
"loss": 2.0719451904296875,
"mean_token_accuracy": 0.5453279495239258,
"num_tokens": 8575632.0,
"step": 1460
},
{
"entropy": 1.9750055521726608,
"epoch": 0.20600497495007533,
"grad_norm": 3.859375,
"learning_rate": 4.179203539823009e-06,
"loss": 2.044822883605957,
"mean_token_accuracy": 0.5503912933170796,
"num_tokens": 8632807.0,
"step": 1470
},
{
"entropy": 2.067868760228157,
"epoch": 0.2074063693374908,
"grad_norm": 3.484375,
"learning_rate": 4.171828908554573e-06,
"loss": 2.1004459381103517,
"mean_token_accuracy": 0.5417281433939933,
"num_tokens": 8693834.0,
"step": 1480
},
{
"entropy": 2.0344304889440536,
"epoch": 0.20880776372490628,
"grad_norm": 3.890625,
"learning_rate": 4.164454277286136e-06,
"loss": 2.0767101287841796,
"mean_token_accuracy": 0.5481426410377026,
"num_tokens": 8753734.0,
"step": 1490
},
{
"entropy": 2.0047311425209045,
"epoch": 0.21020915811232177,
"grad_norm": 4.0,
"learning_rate": 4.157079646017699e-06,
"loss": 2.075409698486328,
"mean_token_accuracy": 0.5513108044862747,
"num_tokens": 8809137.0,
"step": 1500
},
{
"entropy": 2.0314046144485474,
"epoch": 0.21161055249973723,
"grad_norm": 3.5625,
"learning_rate": 4.1497050147492625e-06,
"loss": 2.0660478591918947,
"mean_token_accuracy": 0.5465934894979,
"num_tokens": 8867546.0,
"step": 1510
},
{
"entropy": 1.9994929015636445,
"epoch": 0.21301194688715272,
"grad_norm": 4.0,
"learning_rate": 4.142330383480827e-06,
"loss": 2.0473262786865236,
"mean_token_accuracy": 0.5522368937730789,
"num_tokens": 8924366.0,
"step": 1520
},
{
"entropy": 2.095882478356361,
"epoch": 0.2144133412745682,
"grad_norm": 3.453125,
"learning_rate": 4.13495575221239e-06,
"loss": 2.1347635269165037,
"mean_token_accuracy": 0.5365191757678985,
"num_tokens": 8986796.0,
"step": 1530
},
{
"entropy": 2.0848882615566255,
"epoch": 0.21581473566198367,
"grad_norm": 3.765625,
"learning_rate": 4.127581120943953e-06,
"loss": 2.142112159729004,
"mean_token_accuracy": 0.5401039518415928,
"num_tokens": 9047723.0,
"step": 1540
},
{
"entropy": 2.0115451723337174,
"epoch": 0.21721613004939916,
"grad_norm": 3.8125,
"learning_rate": 4.1202064896755165e-06,
"loss": 2.0483930587768553,
"mean_token_accuracy": 0.5501567840576171,
"num_tokens": 9105059.0,
"step": 1550
},
{
"entropy": 2.043051043152809,
"epoch": 0.21861752443681462,
"grad_norm": 3.609375,
"learning_rate": 4.11283185840708e-06,
"loss": 2.1072006225585938,
"mean_token_accuracy": 0.5446874745190143,
"num_tokens": 9165074.0,
"step": 1560
},
{
"entropy": 1.990285524725914,
"epoch": 0.2200189188242301,
"grad_norm": 3.765625,
"learning_rate": 4.105457227138643e-06,
"loss": 2.042169189453125,
"mean_token_accuracy": 0.5572816863656044,
"num_tokens": 9221198.0,
"step": 1570
},
{
"entropy": 1.9795201420783997,
"epoch": 0.2214203132116456,
"grad_norm": 4.1875,
"learning_rate": 4.098082595870207e-06,
"loss": 2.045511245727539,
"mean_token_accuracy": 0.5509970605373382,
"num_tokens": 9279938.0,
"step": 1580
},
{
"entropy": 2.0109116673469543,
"epoch": 0.22282170759906106,
"grad_norm": 3.8125,
"learning_rate": 4.09070796460177e-06,
"loss": 2.0378480911254884,
"mean_token_accuracy": 0.5496018096804619,
"num_tokens": 9335237.0,
"step": 1590
},
{
"entropy": 1.9677739530801772,
"epoch": 0.22422310198647655,
"grad_norm": 4.0,
"learning_rate": 4.083333333333334e-06,
"loss": 2.008736419677734,
"mean_token_accuracy": 0.5573440827429295,
"num_tokens": 9389997.0,
"step": 1600
},
{
"entropy": 2.0067166537046432,
"epoch": 0.22562449637389204,
"grad_norm": 3.875,
"learning_rate": 4.075958702064897e-06,
"loss": 2.0409936904907227,
"mean_token_accuracy": 0.5538617163896561,
"num_tokens": 9447727.0,
"step": 1610
},
{
"entropy": 2.0425065875053408,
"epoch": 0.2270258907613075,
"grad_norm": 3.4375,
"learning_rate": 4.068584070796461e-06,
"loss": 2.0920581817626953,
"mean_token_accuracy": 0.5449938684701919,
"num_tokens": 9508085.0,
"step": 1620
},
{
"entropy": 2.008884146809578,
"epoch": 0.22842728514872299,
"grad_norm": 3.546875,
"learning_rate": 4.061209439528024e-06,
"loss": 2.077191925048828,
"mean_token_accuracy": 0.5473880305886268,
"num_tokens": 9564075.0,
"step": 1630
},
{
"entropy": 2.0422200560569763,
"epoch": 0.22982867953613845,
"grad_norm": 3.859375,
"learning_rate": 4.053834808259588e-06,
"loss": 2.056693458557129,
"mean_token_accuracy": 0.5427386954426765,
"num_tokens": 9625251.0,
"step": 1640
},
{
"entropy": 1.9331750929355622,
"epoch": 0.23123007392355394,
"grad_norm": 3.609375,
"learning_rate": 4.046460176991151e-06,
"loss": 1.997640037536621,
"mean_token_accuracy": 0.559542316198349,
"num_tokens": 9679299.0,
"step": 1650
},
{
"entropy": 2.0358143985271453,
"epoch": 0.23263146831096942,
"grad_norm": 3.921875,
"learning_rate": 4.039085545722714e-06,
"loss": 2.0736413955688477,
"mean_token_accuracy": 0.5433515466749668,
"num_tokens": 9738907.0,
"step": 1660
},
{
"entropy": 2.0287980914115904,
"epoch": 0.23403286269838489,
"grad_norm": 3.421875,
"learning_rate": 4.031710914454278e-06,
"loss": 2.050998878479004,
"mean_token_accuracy": 0.5446001760661602,
"num_tokens": 9800456.0,
"step": 1670
},
{
"entropy": 2.030411049723625,
"epoch": 0.23543425708580037,
"grad_norm": 3.28125,
"learning_rate": 4.024336283185841e-06,
"loss": 2.0855588912963867,
"mean_token_accuracy": 0.542332086712122,
"num_tokens": 9860929.0,
"step": 1680
},
{
"entropy": 1.9989683747291564,
"epoch": 0.23683565147321586,
"grad_norm": 3.640625,
"learning_rate": 4.016961651917404e-06,
"loss": 2.044294738769531,
"mean_token_accuracy": 0.5456494316458702,
"num_tokens": 9921403.0,
"step": 1690
},
{
"entropy": 2.0276321530342103,
"epoch": 0.23823704586063132,
"grad_norm": 4.25,
"learning_rate": 4.0095870206489675e-06,
"loss": 2.058464241027832,
"mean_token_accuracy": 0.5500309750437736,
"num_tokens": 9978695.0,
"step": 1700
},
{
"entropy": 1.9861027270555496,
"epoch": 0.2396384402480468,
"grad_norm": 3.5625,
"learning_rate": 4.002212389380532e-06,
"loss": 2.0480157852172853,
"mean_token_accuracy": 0.5492375880479813,
"num_tokens": 10035266.0,
"step": 1710
},
{
"entropy": 2.0590964436531065,
"epoch": 0.24103983463546227,
"grad_norm": 3.46875,
"learning_rate": 3.994837758112095e-06,
"loss": 2.0842300415039063,
"mean_token_accuracy": 0.5476659752428532,
"num_tokens": 10095628.0,
"step": 1720
},
{
"entropy": 2.0491928100585937,
"epoch": 0.24244122902287776,
"grad_norm": 3.4375,
"learning_rate": 3.987463126843658e-06,
"loss": 2.097138786315918,
"mean_token_accuracy": 0.5445733956992627,
"num_tokens": 10152840.0,
"step": 1730
},
{
"entropy": 2.0307011008262634,
"epoch": 0.24384262341029325,
"grad_norm": 3.46875,
"learning_rate": 3.9800884955752215e-06,
"loss": 2.065476417541504,
"mean_token_accuracy": 0.5439828269183635,
"num_tokens": 10212647.0,
"step": 1740
},
{
"entropy": 2.031652170419693,
"epoch": 0.2452440177977087,
"grad_norm": 3.8125,
"learning_rate": 3.972713864306785e-06,
"loss": 2.0586521148681642,
"mean_token_accuracy": 0.5489093273878097,
"num_tokens": 10270971.0,
"step": 1750
},
{
"entropy": 2.0088635206222536,
"epoch": 0.2466454121851242,
"grad_norm": 4.0,
"learning_rate": 3.965339233038348e-06,
"loss": 2.0783411026000977,
"mean_token_accuracy": 0.54852824062109,
"num_tokens": 10330561.0,
"step": 1760
},
{
"entropy": 2.0077249109745026,
"epoch": 0.24804680657253966,
"grad_norm": 3.4375,
"learning_rate": 3.957964601769912e-06,
"loss": 2.0558242797851562,
"mean_token_accuracy": 0.5530465073883534,
"num_tokens": 10387513.0,
"step": 1770
},
{
"entropy": 1.9883006066083908,
"epoch": 0.24944820095995515,
"grad_norm": 3.515625,
"learning_rate": 3.9505899705014754e-06,
"loss": 2.0360387802124023,
"mean_token_accuracy": 0.5527264244854451,
"num_tokens": 10445558.0,
"step": 1780
},
{
"entropy": 2.048704609274864,
"epoch": 0.2508495953473706,
"grad_norm": 3.28125,
"learning_rate": 3.943215339233039e-06,
"loss": 2.097726249694824,
"mean_token_accuracy": 0.5423043698072434,
"num_tokens": 10507169.0,
"step": 1790
},
{
"entropy": 2.040918904542923,
"epoch": 0.2522509897347861,
"grad_norm": 3.625,
"learning_rate": 3.935840707964602e-06,
"loss": 2.080495262145996,
"mean_token_accuracy": 0.5438195087015629,
"num_tokens": 10566307.0,
"step": 1800
},
{
"entropy": 2.0052473068237306,
"epoch": 0.2536523841222016,
"grad_norm": 2.9375,
"learning_rate": 3.928466076696166e-06,
"loss": 2.0398183822631837,
"mean_token_accuracy": 0.546070022881031,
"num_tokens": 10624818.0,
"step": 1810
},
{
"entropy": 2.083695039153099,
"epoch": 0.2550537785096171,
"grad_norm": 4.3125,
"learning_rate": 3.921091445427729e-06,
"loss": 2.117705726623535,
"mean_token_accuracy": 0.5372008338570595,
"num_tokens": 10687638.0,
"step": 1820
},
{
"entropy": 2.0451648265123366,
"epoch": 0.25645517289703257,
"grad_norm": 3.328125,
"learning_rate": 3.913716814159293e-06,
"loss": 2.101591873168945,
"mean_token_accuracy": 0.5431081369519234,
"num_tokens": 10748647.0,
"step": 1830
},
{
"entropy": 2.028788596391678,
"epoch": 0.257856567284448,
"grad_norm": 3.890625,
"learning_rate": 3.906342182890856e-06,
"loss": 2.0835641860961913,
"mean_token_accuracy": 0.5432848446071148,
"num_tokens": 10810906.0,
"step": 1840
},
{
"entropy": 1.9781817615032196,
"epoch": 0.2592579616718635,
"grad_norm": 3.640625,
"learning_rate": 3.898967551622419e-06,
"loss": 2.0251651763916017,
"mean_token_accuracy": 0.5534879423677921,
"num_tokens": 10867014.0,
"step": 1850
},
{
"entropy": 1.9987586200237275,
"epoch": 0.260659356059279,
"grad_norm": 3.65625,
"learning_rate": 3.8915929203539826e-06,
"loss": 2.0439634323120117,
"mean_token_accuracy": 0.5515172652900219,
"num_tokens": 10923966.0,
"step": 1860
},
{
"entropy": 1.9946261763572692,
"epoch": 0.26206075044669447,
"grad_norm": 4.34375,
"learning_rate": 3.884218289085546e-06,
"loss": 2.0570749282836913,
"mean_token_accuracy": 0.5502081900835037,
"num_tokens": 10982331.0,
"step": 1870
},
{
"entropy": 2.082772919535637,
"epoch": 0.26346214483410996,
"grad_norm": 3.1875,
"learning_rate": 3.876843657817109e-06,
"loss": 2.124038505554199,
"mean_token_accuracy": 0.5378222659230232,
"num_tokens": 11042321.0,
"step": 1880
},
{
"entropy": 2.0446047335863113,
"epoch": 0.2648635392215254,
"grad_norm": 3.25,
"learning_rate": 3.869469026548673e-06,
"loss": 2.081063461303711,
"mean_token_accuracy": 0.5414594948291779,
"num_tokens": 11103961.0,
"step": 1890
},
{
"entropy": 2.003836825489998,
"epoch": 0.2662649336089409,
"grad_norm": 3.6875,
"learning_rate": 3.8620943952802366e-06,
"loss": 2.0427907943725585,
"mean_token_accuracy": 0.5516212925314903,
"num_tokens": 11161256.0,
"step": 1900
},
{
"entropy": 2.066277724504471,
"epoch": 0.26766632799635637,
"grad_norm": 3.484375,
"learning_rate": 3.8547197640118e-06,
"loss": 2.1015077590942384,
"mean_token_accuracy": 0.5404363766312599,
"num_tokens": 11220888.0,
"step": 1910
},
{
"entropy": 2.0015517294406893,
"epoch": 0.26906772238377186,
"grad_norm": 3.765625,
"learning_rate": 3.847345132743363e-06,
"loss": 2.0402530670166015,
"mean_token_accuracy": 0.5519128695130349,
"num_tokens": 11278153.0,
"step": 1920
},
{
"entropy": 1.9748200744390487,
"epoch": 0.27046911677118735,
"grad_norm": 3.359375,
"learning_rate": 3.839970501474926e-06,
"loss": 1.996561050415039,
"mean_token_accuracy": 0.5551008068025112,
"num_tokens": 11333108.0,
"step": 1930
},
{
"entropy": 2.024563890695572,
"epoch": 0.27187051115860283,
"grad_norm": 4.125,
"learning_rate": 3.8325958702064905e-06,
"loss": 2.0915248870849608,
"mean_token_accuracy": 0.5441000409424305,
"num_tokens": 11392826.0,
"step": 1940
},
{
"entropy": 2.048647916316986,
"epoch": 0.27327190554601827,
"grad_norm": 3.703125,
"learning_rate": 3.825221238938053e-06,
"loss": 2.1001590728759765,
"mean_token_accuracy": 0.5445165455341339,
"num_tokens": 11451500.0,
"step": 1950
},
{
"entropy": 2.009050303697586,
"epoch": 0.27467329993343376,
"grad_norm": 3.71875,
"learning_rate": 3.817846607669617e-06,
"loss": 2.037006950378418,
"mean_token_accuracy": 0.5515233352780342,
"num_tokens": 11508406.0,
"step": 1960
},
{
"entropy": 1.983980432152748,
"epoch": 0.27607469432084925,
"grad_norm": 3.578125,
"learning_rate": 3.8104719764011804e-06,
"loss": 2.030117416381836,
"mean_token_accuracy": 0.5510232672095299,
"num_tokens": 11565640.0,
"step": 1970
},
{
"entropy": 2.0504226833581924,
"epoch": 0.27747608870826473,
"grad_norm": 3.734375,
"learning_rate": 3.8030973451327437e-06,
"loss": 2.074881744384766,
"mean_token_accuracy": 0.5433954305946826,
"num_tokens": 11626552.0,
"step": 1980
},
{
"entropy": 2.04710875749588,
"epoch": 0.2788774830956802,
"grad_norm": 3.484375,
"learning_rate": 3.795722713864307e-06,
"loss": 2.0955013275146483,
"mean_token_accuracy": 0.5433564156293869,
"num_tokens": 11686265.0,
"step": 1990
},
{
"entropy": 2.0252153426408768,
"epoch": 0.28027887748309566,
"grad_norm": 3.515625,
"learning_rate": 3.7883480825958707e-06,
"loss": 2.0773523330688475,
"mean_token_accuracy": 0.5479929871857167,
"num_tokens": 11744420.0,
"step": 2000
},
{
"entropy": 2.0120167046785356,
"epoch": 0.28168027187051115,
"grad_norm": 3.453125,
"learning_rate": 3.780973451327434e-06,
"loss": 2.06146240234375,
"mean_token_accuracy": 0.5448708184063434,
"num_tokens": 11805879.0,
"step": 2010
},
{
"entropy": 2.0325658559799193,
"epoch": 0.28308166625792663,
"grad_norm": 3.390625,
"learning_rate": 3.7735988200589972e-06,
"loss": 2.07748966217041,
"mean_token_accuracy": 0.5456863172352314,
"num_tokens": 11865695.0,
"step": 2020
},
{
"entropy": 1.9818778395652772,
"epoch": 0.2844830606453421,
"grad_norm": 3.390625,
"learning_rate": 3.766224188790561e-06,
"loss": 2.02254638671875,
"mean_token_accuracy": 0.5516637116670609,
"num_tokens": 11924218.0,
"step": 2030
},
{
"entropy": 2.0609579384326935,
"epoch": 0.2858844550327576,
"grad_norm": 3.375,
"learning_rate": 3.758849557522124e-06,
"loss": 2.1082080841064452,
"mean_token_accuracy": 0.5414181008934975,
"num_tokens": 11985925.0,
"step": 2040
},
{
"entropy": 2.056264355778694,
"epoch": 0.28728584942017305,
"grad_norm": 3.578125,
"learning_rate": 3.7514749262536875e-06,
"loss": 2.0749874114990234,
"mean_token_accuracy": 0.542043574154377,
"num_tokens": 12043546.0,
"step": 2050
},
{
"entropy": 2.0399533569812776,
"epoch": 0.28868724380758853,
"grad_norm": 3.625,
"learning_rate": 3.7441002949852512e-06,
"loss": 2.115126037597656,
"mean_token_accuracy": 0.542166319489479,
"num_tokens": 12101450.0,
"step": 2060
},
{
"entropy": 2.005798429250717,
"epoch": 0.290088638195004,
"grad_norm": 3.59375,
"learning_rate": 3.736725663716814e-06,
"loss": 2.0584402084350586,
"mean_token_accuracy": 0.5555612161755562,
"num_tokens": 12158295.0,
"step": 2070
},
{
"entropy": 2.027473473548889,
"epoch": 0.2914900325824195,
"grad_norm": 4.1875,
"learning_rate": 3.729351032448378e-06,
"loss": 2.0642648696899415,
"mean_token_accuracy": 0.5496302887797355,
"num_tokens": 12217180.0,
"step": 2080
},
{
"entropy": 2.068603280186653,
"epoch": 0.292891426969835,
"grad_norm": 3.875,
"learning_rate": 3.7219764011799415e-06,
"loss": 2.1073820114135744,
"mean_token_accuracy": 0.5398187652230263,
"num_tokens": 12279165.0,
"step": 2090
},
{
"entropy": 1.9664050936698914,
"epoch": 0.2942928213572505,
"grad_norm": 3.40625,
"learning_rate": 3.7146017699115044e-06,
"loss": 2.031716537475586,
"mean_token_accuracy": 0.5617817871272563,
"num_tokens": 12332864.0,
"step": 2100
},
{
"entropy": 2.031452310085297,
"epoch": 0.2956942157446659,
"grad_norm": 3.78125,
"learning_rate": 3.707227138643068e-06,
"loss": 2.058265495300293,
"mean_token_accuracy": 0.550971408188343,
"num_tokens": 12391694.0,
"step": 2110
},
{
"entropy": 1.9575803756713868,
"epoch": 0.2970956101320814,
"grad_norm": 3.484375,
"learning_rate": 3.699852507374632e-06,
"loss": 2.0243839263916015,
"mean_token_accuracy": 0.5532980509102344,
"num_tokens": 12452312.0,
"step": 2120
},
{
"entropy": 2.0010867685079576,
"epoch": 0.2984970045194969,
"grad_norm": 3.640625,
"learning_rate": 3.692477876106195e-06,
"loss": 2.0592809677124024,
"mean_token_accuracy": 0.5490673378109932,
"num_tokens": 12507943.0,
"step": 2130
},
{
"entropy": 2.029738873243332,
"epoch": 0.2998983989069124,
"grad_norm": 3.9375,
"learning_rate": 3.6851032448377584e-06,
"loss": 2.07022705078125,
"mean_token_accuracy": 0.5449296228587628,
"num_tokens": 12567374.0,
"step": 2140
},
{
"entropy": 2.0201781749725343,
"epoch": 0.3012997932943279,
"grad_norm": 3.96875,
"learning_rate": 3.677728613569322e-06,
"loss": 2.0301849365234377,
"mean_token_accuracy": 0.5546999678015709,
"num_tokens": 12622888.0,
"step": 2150
},
{
"entropy": 1.9730218589305877,
"epoch": 0.3027011876817433,
"grad_norm": 3.796875,
"learning_rate": 3.6703539823008854e-06,
"loss": 2.0661874771118165,
"mean_token_accuracy": 0.5545330084860325,
"num_tokens": 12678493.0,
"step": 2160
},
{
"entropy": 2.0124511659145354,
"epoch": 0.3041025820691588,
"grad_norm": 4.25,
"learning_rate": 3.6629793510324486e-06,
"loss": 2.0427947998046876,
"mean_token_accuracy": 0.554379727691412,
"num_tokens": 12735832.0,
"step": 2170
},
{
"entropy": 2.0333964198827745,
"epoch": 0.3055039764565743,
"grad_norm": 3.625,
"learning_rate": 3.655604719764012e-06,
"loss": 2.0744590759277344,
"mean_token_accuracy": 0.5443440832197666,
"num_tokens": 12795414.0,
"step": 2180
},
{
"entropy": 1.9904500722885132,
"epoch": 0.3069053708439898,
"grad_norm": 3.546875,
"learning_rate": 3.6482300884955756e-06,
"loss": 2.0214725494384767,
"mean_token_accuracy": 0.553394029289484,
"num_tokens": 12850628.0,
"step": 2190
},
{
"entropy": 2.012459713220596,
"epoch": 0.30830676523140527,
"grad_norm": 4.0,
"learning_rate": 3.640855457227139e-06,
"loss": 2.05026798248291,
"mean_token_accuracy": 0.5478941559791565,
"num_tokens": 12910543.0,
"step": 2200
},
{
"entropy": 2.041311630606651,
"epoch": 0.3097081596188207,
"grad_norm": 3.65625,
"learning_rate": 3.633480825958702e-06,
"loss": 2.080320930480957,
"mean_token_accuracy": 0.5436180986464023,
"num_tokens": 12969175.0,
"step": 2210
},
{
"entropy": 2.0246637046337126,
"epoch": 0.3111095540062362,
"grad_norm": 3.40625,
"learning_rate": 3.626106194690266e-06,
"loss": 2.075758934020996,
"mean_token_accuracy": 0.5477502450346947,
"num_tokens": 13029048.0,
"step": 2220
},
{
"entropy": 2.016602024435997,
"epoch": 0.3125109483936517,
"grad_norm": 3.296875,
"learning_rate": 3.6187315634218288e-06,
"loss": 2.0503862380981444,
"mean_token_accuracy": 0.5497252814471721,
"num_tokens": 13086708.0,
"step": 2230
},
{
"entropy": 1.9739759057760238,
"epoch": 0.31391234278106717,
"grad_norm": 3.625,
"learning_rate": 3.6113569321533925e-06,
"loss": 2.0244831085205077,
"mean_token_accuracy": 0.5533089518547059,
"num_tokens": 13145789.0,
"step": 2240
},
{
"entropy": 2.066014051437378,
"epoch": 0.31531373716848266,
"grad_norm": 3.453125,
"learning_rate": 3.603982300884956e-06,
"loss": 2.1090654373168944,
"mean_token_accuracy": 0.5381431728601456,
"num_tokens": 13204643.0,
"step": 2250
},
{
"entropy": 2.032071939110756,
"epoch": 0.31671513155589814,
"grad_norm": 3.859375,
"learning_rate": 3.596607669616519e-06,
"loss": 2.0973888397216798,
"mean_token_accuracy": 0.5404280602931977,
"num_tokens": 13264537.0,
"step": 2260
},
{
"entropy": 2.030746152997017,
"epoch": 0.3181165259433136,
"grad_norm": 3.546875,
"learning_rate": 3.5892330383480828e-06,
"loss": 2.066508483886719,
"mean_token_accuracy": 0.5464574486017227,
"num_tokens": 13326486.0,
"step": 2270
},
{
"entropy": 2.0341346323490144,
"epoch": 0.31951792033072907,
"grad_norm": 3.421875,
"learning_rate": 3.5818584070796465e-06,
"loss": 2.0528663635253905,
"mean_token_accuracy": 0.5416016794741154,
"num_tokens": 13386625.0,
"step": 2280
},
{
"entropy": 2.033405900001526,
"epoch": 0.32091931471814455,
"grad_norm": 3.734375,
"learning_rate": 3.57448377581121e-06,
"loss": 2.077082061767578,
"mean_token_accuracy": 0.5406279399991035,
"num_tokens": 13446811.0,
"step": 2290
},
{
"entropy": 2.043126568198204,
"epoch": 0.32232070910556004,
"grad_norm": 3.640625,
"learning_rate": 3.567109144542773e-06,
"loss": 2.0811180114746093,
"mean_token_accuracy": 0.542109789699316,
"num_tokens": 13505758.0,
"step": 2300
},
{
"entropy": 2.0713710308074953,
"epoch": 0.32372210349297553,
"grad_norm": 3.625,
"learning_rate": 3.5597345132743367e-06,
"loss": 2.0945466995239257,
"mean_token_accuracy": 0.539750412106514,
"num_tokens": 13564426.0,
"step": 2310
},
{
"entropy": 2.009327819943428,
"epoch": 0.32512349788039097,
"grad_norm": 3.828125,
"learning_rate": 3.5523598820059e-06,
"loss": 2.0479202270507812,
"mean_token_accuracy": 0.5478827625513076,
"num_tokens": 13624506.0,
"step": 2320
},
{
"entropy": 2.0233408570289613,
"epoch": 0.32652489226780645,
"grad_norm": 3.625,
"learning_rate": 3.5449852507374633e-06,
"loss": 2.072812080383301,
"mean_token_accuracy": 0.5496255904436111,
"num_tokens": 13681895.0,
"step": 2330
},
{
"entropy": 2.0150050669908524,
"epoch": 0.32792628665522194,
"grad_norm": 3.640625,
"learning_rate": 3.537610619469027e-06,
"loss": 2.0481910705566406,
"mean_token_accuracy": 0.5474696174263954,
"num_tokens": 13742408.0,
"step": 2340
},
{
"entropy": 1.996006327867508,
"epoch": 0.32932768104263743,
"grad_norm": 4.21875,
"learning_rate": 3.5302359882005903e-06,
"loss": 2.039927673339844,
"mean_token_accuracy": 0.5505919076502324,
"num_tokens": 13801936.0,
"step": 2350
},
{
"entropy": 2.0160360783338547,
"epoch": 0.3307290754300529,
"grad_norm": 4.25,
"learning_rate": 3.5228613569321536e-06,
"loss": 2.0754911422729494,
"mean_token_accuracy": 0.5470316275954247,
"num_tokens": 13860452.0,
"step": 2360
},
{
"entropy": 2.033596268296242,
"epoch": 0.33213046981746835,
"grad_norm": 3.640625,
"learning_rate": 3.515486725663717e-06,
"loss": 2.0809364318847656,
"mean_token_accuracy": 0.5446468167006969,
"num_tokens": 13917770.0,
"step": 2370
},
{
"entropy": 1.9926137715578078,
"epoch": 0.33353186420488384,
"grad_norm": 3.40625,
"learning_rate": 3.5081120943952806e-06,
"loss": 2.028292655944824,
"mean_token_accuracy": 0.5545202195644379,
"num_tokens": 13973511.0,
"step": 2380
},
{
"entropy": 1.956346869468689,
"epoch": 0.33493325859229933,
"grad_norm": 4.46875,
"learning_rate": 3.500737463126844e-06,
"loss": 2.014778709411621,
"mean_token_accuracy": 0.5580305725336074,
"num_tokens": 14029619.0,
"step": 2390
},
{
"entropy": 2.021263125538826,
"epoch": 0.3363346529797148,
"grad_norm": 4.1875,
"learning_rate": 3.493362831858407e-06,
"loss": 2.0767066955566404,
"mean_token_accuracy": 0.5438144609332085,
"num_tokens": 14090701.0,
"step": 2400
},
{
"entropy": 2.0122366905212403,
"epoch": 0.3377360473671303,
"grad_norm": 3.484375,
"learning_rate": 3.485988200589971e-06,
"loss": 2.0509740829467775,
"mean_token_accuracy": 0.5462699607014656,
"num_tokens": 14152154.0,
"step": 2410
},
{
"entropy": 1.9940638601779939,
"epoch": 0.3391374417545458,
"grad_norm": 4.09375,
"learning_rate": 3.4786135693215337e-06,
"loss": 2.0240846633911134,
"mean_token_accuracy": 0.5554023273289204,
"num_tokens": 14206928.0,
"step": 2420
},
{
"entropy": 2.0023196965456007,
"epoch": 0.34053883614196123,
"grad_norm": 3.75,
"learning_rate": 3.4712389380530974e-06,
"loss": 2.038427543640137,
"mean_token_accuracy": 0.5528297238051891,
"num_tokens": 14265500.0,
"step": 2430
},
{
"entropy": 2.02716104388237,
"epoch": 0.3419402305293767,
"grad_norm": 3.9375,
"learning_rate": 3.463864306784661e-06,
"loss": 2.0936708450317383,
"mean_token_accuracy": 0.5434965647757053,
"num_tokens": 14323980.0,
"step": 2440
},
{
"entropy": 2.006233334541321,
"epoch": 0.3433416249167922,
"grad_norm": 3.625,
"learning_rate": 3.456489675516225e-06,
"loss": 2.010869789123535,
"mean_token_accuracy": 0.5536993630230427,
"num_tokens": 14381484.0,
"step": 2450
},
{
"entropy": 1.956309551000595,
"epoch": 0.3447430193042077,
"grad_norm": 4.125,
"learning_rate": 3.4491150442477877e-06,
"loss": 2.0028940200805665,
"mean_token_accuracy": 0.5577565245330334,
"num_tokens": 14437013.0,
"step": 2460
},
{
"entropy": 1.986230832338333,
"epoch": 0.3461444136916232,
"grad_norm": 4.03125,
"learning_rate": 3.4417404129793514e-06,
"loss": 2.0378223419189454,
"mean_token_accuracy": 0.5529210731387139,
"num_tokens": 14494172.0,
"step": 2470
},
{
"entropy": 2.020972040295601,
"epoch": 0.3475458080790386,
"grad_norm": 3.34375,
"learning_rate": 3.434365781710915e-06,
"loss": 2.057634162902832,
"mean_token_accuracy": 0.5544227443635463,
"num_tokens": 14549695.0,
"step": 2480
},
{
"entropy": 2.0772712618112563,
"epoch": 0.3489472024664541,
"grad_norm": 3.84375,
"learning_rate": 3.426991150442478e-06,
"loss": 2.1363456726074217,
"mean_token_accuracy": 0.5460018336772918,
"num_tokens": 14608869.0,
"step": 2490
},
{
"entropy": 1.991566962003708,
"epoch": 0.3503485968538696,
"grad_norm": 3.4375,
"learning_rate": 3.4196165191740417e-06,
"loss": 2.0198110580444335,
"mean_token_accuracy": 0.5531622432172298,
"num_tokens": 14665103.0,
"step": 2500
},
{
"entropy": 2.051846295595169,
"epoch": 0.3517499912412851,
"grad_norm": 3.53125,
"learning_rate": 3.412241887905605e-06,
"loss": 2.115659713745117,
"mean_token_accuracy": 0.5371693730354309,
"num_tokens": 14725608.0,
"step": 2510
},
{
"entropy": 2.0814440310001374,
"epoch": 0.3531513856287006,
"grad_norm": 3.828125,
"learning_rate": 3.4048672566371683e-06,
"loss": 2.1354246139526367,
"mean_token_accuracy": 0.534952775388956,
"num_tokens": 14785719.0,
"step": 2520
},
{
"entropy": 1.9824702113866806,
"epoch": 0.354552780016116,
"grad_norm": 3.625,
"learning_rate": 3.397492625368732e-06,
"loss": 2.029611015319824,
"mean_token_accuracy": 0.5569346085190773,
"num_tokens": 14843220.0,
"step": 2530
},
{
"entropy": 1.9848757982254028,
"epoch": 0.3559541744035315,
"grad_norm": 3.90625,
"learning_rate": 3.3901179941002953e-06,
"loss": 2.036295700073242,
"mean_token_accuracy": 0.5557854510843754,
"num_tokens": 14901805.0,
"step": 2540
},
{
"entropy": 2.012274181842804,
"epoch": 0.357355568790947,
"grad_norm": 3.71875,
"learning_rate": 3.3827433628318586e-06,
"loss": 2.0520450592041017,
"mean_token_accuracy": 0.5437561951577663,
"num_tokens": 14961782.0,
"step": 2550
},
{
"entropy": 2.0370524376630783,
"epoch": 0.3587569631783625,
"grad_norm": 3.8125,
"learning_rate": 3.375368731563422e-06,
"loss": 2.1124666213989256,
"mean_token_accuracy": 0.5437058597803116,
"num_tokens": 15022925.0,
"step": 2560
},
{
"entropy": 2.0400708824396134,
"epoch": 0.36015835756577796,
"grad_norm": 4.09375,
"learning_rate": 3.3679941002949855e-06,
"loss": 2.046133613586426,
"mean_token_accuracy": 0.553859393298626,
"num_tokens": 15082687.0,
"step": 2570
},
{
"entropy": 2.0404021978378295,
"epoch": 0.36155975195319345,
"grad_norm": 3.6875,
"learning_rate": 3.360619469026549e-06,
"loss": 2.08302001953125,
"mean_token_accuracy": 0.5444831892848014,
"num_tokens": 15143071.0,
"step": 2580
},
{
"entropy": 1.9733462482690811,
"epoch": 0.3629611463406089,
"grad_norm": 3.5,
"learning_rate": 3.353244837758112e-06,
"loss": 2.0270782470703126,
"mean_token_accuracy": 0.5567068234086037,
"num_tokens": 15201082.0,
"step": 2590
},
{
"entropy": 2.010732626914978,
"epoch": 0.3643625407280244,
"grad_norm": 3.328125,
"learning_rate": 3.345870206489676e-06,
"loss": 2.0494049072265623,
"mean_token_accuracy": 0.5488976605236531,
"num_tokens": 15260037.0,
"step": 2600
},
{
"entropy": 2.0001643508672715,
"epoch": 0.36576393511543986,
"grad_norm": 4.03125,
"learning_rate": 3.3384955752212395e-06,
"loss": 2.0865619659423826,
"mean_token_accuracy": 0.5552799321711064,
"num_tokens": 15317347.0,
"step": 2610
},
{
"entropy": 2.0003055959939955,
"epoch": 0.36716532950285535,
"grad_norm": 3.421875,
"learning_rate": 3.3311209439528024e-06,
"loss": 2.032404327392578,
"mean_token_accuracy": 0.5533877588808537,
"num_tokens": 15376104.0,
"step": 2620
},
{
"entropy": 2.0134785562753676,
"epoch": 0.36856672389027084,
"grad_norm": 3.796875,
"learning_rate": 3.323746312684366e-06,
"loss": 2.075766181945801,
"mean_token_accuracy": 0.5478799432516098,
"num_tokens": 15433006.0,
"step": 2630
},
{
"entropy": 2.0133273512125016,
"epoch": 0.3699681182776863,
"grad_norm": 3.671875,
"learning_rate": 3.31637168141593e-06,
"loss": 2.0486371994018553,
"mean_token_accuracy": 0.5523924797773361,
"num_tokens": 15488723.0,
"step": 2640
},
{
"entropy": 2.02708223760128,
"epoch": 0.37136951266510176,
"grad_norm": 3.09375,
"learning_rate": 3.3089970501474927e-06,
"loss": 2.1050783157348634,
"mean_token_accuracy": 0.543995326012373,
"num_tokens": 15549170.0,
"step": 2650
},
{
"entropy": 2.059222882986069,
"epoch": 0.37277090705251725,
"grad_norm": 3.625,
"learning_rate": 3.3016224188790564e-06,
"loss": 2.0997392654418947,
"mean_token_accuracy": 0.5429941609501838,
"num_tokens": 15612383.0,
"step": 2660
},
{
"entropy": 1.996263289451599,
"epoch": 0.37417230143993274,
"grad_norm": 3.421875,
"learning_rate": 3.29424778761062e-06,
"loss": 2.0333202362060545,
"mean_token_accuracy": 0.5534181974828243,
"num_tokens": 15668533.0,
"step": 2670
},
{
"entropy": 2.0458276212215423,
"epoch": 0.37557369582734823,
"grad_norm": 3.6875,
"learning_rate": 3.286873156342183e-06,
"loss": 2.11057186126709,
"mean_token_accuracy": 0.5400335542857647,
"num_tokens": 15728891.0,
"step": 2680
},
{
"entropy": 2.012293756008148,
"epoch": 0.37697509021476366,
"grad_norm": 3.390625,
"learning_rate": 3.2794985250737467e-06,
"loss": 2.0523448944091798,
"mean_token_accuracy": 0.5516530051827431,
"num_tokens": 15786671.0,
"step": 2690
},
{
"entropy": 2.03779356777668,
"epoch": 0.37837648460217915,
"grad_norm": 3.953125,
"learning_rate": 3.27212389380531e-06,
"loss": 2.0828990936279297,
"mean_token_accuracy": 0.5453480415046215,
"num_tokens": 15847796.0,
"step": 2700
},
{
"entropy": 2.0558393210172654,
"epoch": 0.37977787898959464,
"grad_norm": 3.8125,
"learning_rate": 3.2647492625368732e-06,
"loss": 2.076746368408203,
"mean_token_accuracy": 0.5400703974068165,
"num_tokens": 15907761.0,
"step": 2710
},
{
"entropy": 1.979285529255867,
"epoch": 0.38117927337701013,
"grad_norm": 3.390625,
"learning_rate": 3.257374631268437e-06,
"loss": 2.04888916015625,
"mean_token_accuracy": 0.557814684510231,
"num_tokens": 15963089.0,
"step": 2720
},
{
"entropy": 2.062352991104126,
"epoch": 0.3825806677644256,
"grad_norm": 3.859375,
"learning_rate": 3.2500000000000002e-06,
"loss": 2.0771505355834963,
"mean_token_accuracy": 0.5436685405671596,
"num_tokens": 16021866.0,
"step": 2730
},
{
"entropy": 2.033045384287834,
"epoch": 0.3839820621518411,
"grad_norm": 3.5625,
"learning_rate": 3.2426253687315635e-06,
"loss": 2.094202995300293,
"mean_token_accuracy": 0.5457345262169838,
"num_tokens": 16081435.0,
"step": 2740
},
{
"entropy": 2.038944327831268,
"epoch": 0.38538345653925654,
"grad_norm": 3.578125,
"learning_rate": 3.2352507374631272e-06,
"loss": 2.0836963653564453,
"mean_token_accuracy": 0.5412560358643532,
"num_tokens": 16140741.0,
"step": 2750
},
{
"entropy": 1.9726036459207534,
"epoch": 0.38678485092667203,
"grad_norm": 3.625,
"learning_rate": 3.2278761061946905e-06,
"loss": 2.0361520767211916,
"mean_token_accuracy": 0.5550483211874961,
"num_tokens": 16198658.0,
"step": 2760
},
{
"entropy": 2.0610845535993576,
"epoch": 0.3881862453140875,
"grad_norm": 3.5,
"learning_rate": 3.220501474926254e-06,
"loss": 2.091715431213379,
"mean_token_accuracy": 0.5454363986849785,
"num_tokens": 16262732.0,
"step": 2770
},
{
"entropy": 2.027015134692192,
"epoch": 0.389587639701503,
"grad_norm": 3.96875,
"learning_rate": 3.213126843657817e-06,
"loss": 2.0607582092285157,
"mean_token_accuracy": 0.5436989083886147,
"num_tokens": 16323072.0,
"step": 2780
},
{
"entropy": 2.0341162979602814,
"epoch": 0.3909890340889185,
"grad_norm": 4.03125,
"learning_rate": 3.2057522123893808e-06,
"loss": 2.080152893066406,
"mean_token_accuracy": 0.5442491464316845,
"num_tokens": 16383825.0,
"step": 2790
},
{
"entropy": 1.9967200189828873,
"epoch": 0.39239042847633393,
"grad_norm": 3.21875,
"learning_rate": 3.1983775811209445e-06,
"loss": 2.0428693771362303,
"mean_token_accuracy": 0.5509172320365906,
"num_tokens": 16442919.0,
"step": 2800
},
{
"entropy": 2.0158123135566712,
"epoch": 0.3937918228637494,
"grad_norm": 4.03125,
"learning_rate": 3.1910029498525074e-06,
"loss": 2.0505596160888673,
"mean_token_accuracy": 0.5477202244102954,
"num_tokens": 16503445.0,
"step": 2810
},
{
"entropy": 2.0057578057050707,
"epoch": 0.3951932172511649,
"grad_norm": 3.71875,
"learning_rate": 3.183628318584071e-06,
"loss": 2.052252197265625,
"mean_token_accuracy": 0.5474997572600842,
"num_tokens": 16564816.0,
"step": 2820
},
{
"entropy": 1.9953262776136398,
"epoch": 0.3965946116385804,
"grad_norm": 3.359375,
"learning_rate": 3.1762536873156348e-06,
"loss": 2.0280698776245116,
"mean_token_accuracy": 0.5522720851004124,
"num_tokens": 16620817.0,
"step": 2830
},
{
"entropy": 1.9913746654987334,
"epoch": 0.3979960060259959,
"grad_norm": 3.703125,
"learning_rate": 3.1688790560471976e-06,
"loss": 2.044495391845703,
"mean_token_accuracy": 0.5515089079737663,
"num_tokens": 16680154.0,
"step": 2840
},
{
"entropy": 2.0292646408081056,
"epoch": 0.3993974004134113,
"grad_norm": 3.15625,
"learning_rate": 3.1615044247787613e-06,
"loss": 2.0748342514038085,
"mean_token_accuracy": 0.5438324570655823,
"num_tokens": 16741428.0,
"step": 2850
},
{
"entropy": 2.059218314290047,
"epoch": 0.4007987948008268,
"grad_norm": 3.171875,
"learning_rate": 3.154129793510325e-06,
"loss": 2.087131309509277,
"mean_token_accuracy": 0.5398609600961208,
"num_tokens": 16803820.0,
"step": 2860
},
{
"entropy": 1.988922455906868,
"epoch": 0.4022001891882423,
"grad_norm": 3.40625,
"learning_rate": 3.146755162241888e-06,
"loss": 2.014337348937988,
"mean_token_accuracy": 0.5536053828895092,
"num_tokens": 16862017.0,
"step": 2870
},
{
"entropy": 2.009887772798538,
"epoch": 0.4036015835756578,
"grad_norm": 3.484375,
"learning_rate": 3.1393805309734516e-06,
"loss": 2.0723125457763674,
"mean_token_accuracy": 0.5473446324467659,
"num_tokens": 16920887.0,
"step": 2880
},
{
"entropy": 2.06411289870739,
"epoch": 0.4050029779630733,
"grad_norm": 3.34375,
"learning_rate": 3.1320058997050153e-06,
"loss": 2.109910774230957,
"mean_token_accuracy": 0.5424987003207207,
"num_tokens": 16981303.0,
"step": 2890
},
{
"entropy": 1.9845988363027574,
"epoch": 0.40640437235048876,
"grad_norm": 3.53125,
"learning_rate": 3.124631268436578e-06,
"loss": 2.025481605529785,
"mean_token_accuracy": 0.5532370284199715,
"num_tokens": 17040169.0,
"step": 2900
},
{
"entropy": 2.049331721663475,
"epoch": 0.4078057667379042,
"grad_norm": 3.6875,
"learning_rate": 3.117256637168142e-06,
"loss": 2.112797164916992,
"mean_token_accuracy": 0.537342993915081,
"num_tokens": 17102359.0,
"step": 2910
},
{
"entropy": 1.972009301185608,
"epoch": 0.4092071611253197,
"grad_norm": 3.53125,
"learning_rate": 3.109882005899705e-06,
"loss": 2.0128068923950195,
"mean_token_accuracy": 0.5560865074396133,
"num_tokens": 17158577.0,
"step": 2920
},
{
"entropy": 2.049245524406433,
"epoch": 0.4106085555127352,
"grad_norm": 3.03125,
"learning_rate": 3.102507374631269e-06,
"loss": 2.0594350814819338,
"mean_token_accuracy": 0.5510149970650673,
"num_tokens": 17219246.0,
"step": 2930
},
{
"entropy": 1.9770815700292588,
"epoch": 0.41200994990015066,
"grad_norm": 3.390625,
"learning_rate": 3.095132743362832e-06,
"loss": 2.0263744354248048,
"mean_token_accuracy": 0.550960586220026,
"num_tokens": 17276673.0,
"step": 2940
},
{
"entropy": 2.054537570476532,
"epoch": 0.41341134428756615,
"grad_norm": 3.265625,
"learning_rate": 3.0877581120943955e-06,
"loss": 2.0924644470214844,
"mean_token_accuracy": 0.5403410479426384,
"num_tokens": 17337580.0,
"step": 2950
},
{
"entropy": 1.9809619694948197,
"epoch": 0.4148127386749816,
"grad_norm": 3.609375,
"learning_rate": 3.080383480825959e-06,
"loss": 2.0583356857299804,
"mean_token_accuracy": 0.555622187256813,
"num_tokens": 17395739.0,
"step": 2960
},
{
"entropy": 1.970469206571579,
"epoch": 0.4162141330623971,
"grad_norm": 4.21875,
"learning_rate": 3.073008849557522e-06,
"loss": 2.010905647277832,
"mean_token_accuracy": 0.5615350589156151,
"num_tokens": 17452172.0,
"step": 2970
},
{
"entropy": 1.9751002043485641,
"epoch": 0.41761552744981256,
"grad_norm": 3.4375,
"learning_rate": 3.0656342182890857e-06,
"loss": 2.0333751678466796,
"mean_token_accuracy": 0.5564141780138016,
"num_tokens": 17507476.0,
"step": 2980
},
{
"entropy": 2.0776767164468763,
"epoch": 0.41901692183722805,
"grad_norm": 3.546875,
"learning_rate": 3.0582595870206494e-06,
"loss": 2.1196556091308594,
"mean_token_accuracy": 0.5379776880145073,
"num_tokens": 17569888.0,
"step": 2990
},
{
"entropy": 2.0239798009395598,
"epoch": 0.42041831622464354,
"grad_norm": 3.25,
"learning_rate": 3.0508849557522123e-06,
"loss": 2.067799758911133,
"mean_token_accuracy": 0.5501157879829407,
"num_tokens": 17629147.0,
"step": 3000
},
{
"entropy": 2.0476420164108275,
"epoch": 0.421819710612059,
"grad_norm": 3.453125,
"learning_rate": 3.043510324483776e-06,
"loss": 2.100557327270508,
"mean_token_accuracy": 0.5459968023002147,
"num_tokens": 17683878.0,
"step": 3010
},
{
"entropy": 1.994628182053566,
"epoch": 0.42322110499947446,
"grad_norm": 3.578125,
"learning_rate": 3.0361356932153397e-06,
"loss": 2.0465036392211915,
"mean_token_accuracy": 0.5495273642241955,
"num_tokens": 17743179.0,
"step": 3020
},
{
"entropy": 2.00454503595829,
"epoch": 0.42462249938688995,
"grad_norm": 3.75,
"learning_rate": 3.0287610619469026e-06,
"loss": 2.0378849029541017,
"mean_token_accuracy": 0.5559940241277218,
"num_tokens": 17799589.0,
"step": 3030
},
{
"entropy": 2.0207887947559358,
"epoch": 0.42602389377430544,
"grad_norm": 3.203125,
"learning_rate": 3.0213864306784663e-06,
"loss": 2.0674230575561525,
"mean_token_accuracy": 0.5485209092497826,
"num_tokens": 17857747.0,
"step": 3040
},
{
"entropy": 1.9799177139997481,
"epoch": 0.42742528816172093,
"grad_norm": 4.21875,
"learning_rate": 3.01401179941003e-06,
"loss": 2.004818344116211,
"mean_token_accuracy": 0.5566212393343448,
"num_tokens": 17912862.0,
"step": 3050
},
{
"entropy": 1.9984881341457368,
"epoch": 0.4288266825491364,
"grad_norm": 3.34375,
"learning_rate": 3.006637168141593e-06,
"loss": 2.059418869018555,
"mean_token_accuracy": 0.550378105789423,
"num_tokens": 17972825.0,
"step": 3060
},
{
"entropy": 2.02097764313221,
"epoch": 0.43022807693655185,
"grad_norm": 3.046875,
"learning_rate": 2.9992625368731566e-06,
"loss": 2.080335807800293,
"mean_token_accuracy": 0.5408771336078644,
"num_tokens": 18031427.0,
"step": 3070
},
{
"entropy": 2.032861089706421,
"epoch": 0.43162947132396734,
"grad_norm": 3.765625,
"learning_rate": 2.9918879056047203e-06,
"loss": 2.0570114135742186,
"mean_token_accuracy": 0.5447784259915351,
"num_tokens": 18089201.0,
"step": 3080
},
{
"entropy": 2.0530674159526825,
"epoch": 0.43303086571138283,
"grad_norm": 3.4375,
"learning_rate": 2.9845132743362836e-06,
"loss": 2.1033819198608397,
"mean_token_accuracy": 0.5419682547450065,
"num_tokens": 18151114.0,
"step": 3090
},
{
"entropy": 1.988242071866989,
"epoch": 0.4344322600987983,
"grad_norm": 4.25,
"learning_rate": 2.977138643067847e-06,
"loss": 2.0315269470214843,
"mean_token_accuracy": 0.552942118793726,
"num_tokens": 18209516.0,
"step": 3100
},
{
"entropy": 2.0201914995908736,
"epoch": 0.4358336544862138,
"grad_norm": 4.25,
"learning_rate": 2.96976401179941e-06,
"loss": 2.067410469055176,
"mean_token_accuracy": 0.5459202371537686,
"num_tokens": 18268921.0,
"step": 3110
},
{
"entropy": 1.954800271987915,
"epoch": 0.43723504887362924,
"grad_norm": 3.515625,
"learning_rate": 2.962389380530974e-06,
"loss": 1.9979192733764648,
"mean_token_accuracy": 0.5595223732292652,
"num_tokens": 18325142.0,
"step": 3120
},
{
"entropy": 2.017845964431763,
"epoch": 0.43863644326104473,
"grad_norm": 3.5625,
"learning_rate": 2.955014749262537e-06,
"loss": 2.077107810974121,
"mean_token_accuracy": 0.5507882386445999,
"num_tokens": 18384427.0,
"step": 3130
},
{
"entropy": 2.0217061281204223,
"epoch": 0.4400378376484602,
"grad_norm": 3.890625,
"learning_rate": 2.9476401179941004e-06,
"loss": 2.064482307434082,
"mean_token_accuracy": 0.5540095090866088,
"num_tokens": 18442826.0,
"step": 3140
},
{
"entropy": 2.007353922724724,
"epoch": 0.4414392320358757,
"grad_norm": 3.96875,
"learning_rate": 2.940265486725664e-06,
"loss": 2.0431005477905275,
"mean_token_accuracy": 0.5479564107954502,
"num_tokens": 18502794.0,
"step": 3150
},
{
"entropy": 1.9794378250837326,
"epoch": 0.4428406264232912,
"grad_norm": 3.8125,
"learning_rate": 2.932890855457227e-06,
"loss": 2.052911376953125,
"mean_token_accuracy": 0.5498085469007492,
"num_tokens": 18560966.0,
"step": 3160
},
{
"entropy": 1.9761908054351807,
"epoch": 0.44424202081070663,
"grad_norm": 3.90625,
"learning_rate": 2.9255162241887907e-06,
"loss": 2.0283836364746093,
"mean_token_accuracy": 0.554186000674963,
"num_tokens": 18616685.0,
"step": 3170
},
{
"entropy": 2.015652891993523,
"epoch": 0.4456434151981221,
"grad_norm": 3.609375,
"learning_rate": 2.9181415929203544e-06,
"loss": 2.037789535522461,
"mean_token_accuracy": 0.5506032936275005,
"num_tokens": 18672575.0,
"step": 3180
},
{
"entropy": 2.0318040758371354,
"epoch": 0.4470448095855376,
"grad_norm": 3.765625,
"learning_rate": 2.9107669616519173e-06,
"loss": 2.0607019424438477,
"mean_token_accuracy": 0.5467961005866527,
"num_tokens": 18731995.0,
"step": 3190
},
{
"entropy": 2.0122063130140306,
"epoch": 0.4484462039729531,
"grad_norm": 3.5,
"learning_rate": 2.903392330383481e-06,
"loss": 2.051531219482422,
"mean_token_accuracy": 0.551438144594431,
"num_tokens": 18789636.0,
"step": 3200
},
{
"entropy": 1.9415486752986908,
"epoch": 0.4498475983603686,
"grad_norm": 3.265625,
"learning_rate": 2.8960176991150447e-06,
"loss": 1.9925420761108399,
"mean_token_accuracy": 0.5665767565369606,
"num_tokens": 18845733.0,
"step": 3210
},
{
"entropy": 2.091024360060692,
"epoch": 0.4512489927477841,
"grad_norm": 3.75,
"learning_rate": 2.8886430678466075e-06,
"loss": 2.150341796875,
"mean_token_accuracy": 0.5364172495901585,
"num_tokens": 18906167.0,
"step": 3220
},
{
"entropy": 2.0123080760240555,
"epoch": 0.4526503871351995,
"grad_norm": 3.671875,
"learning_rate": 2.8812684365781713e-06,
"loss": 2.054686737060547,
"mean_token_accuracy": 0.5530279859900474,
"num_tokens": 18965813.0,
"step": 3230
},
{
"entropy": 2.0785245269536974,
"epoch": 0.454051781522615,
"grad_norm": 3.53125,
"learning_rate": 2.873893805309735e-06,
"loss": 2.1151668548583986,
"mean_token_accuracy": 0.5389002986252308,
"num_tokens": 19026553.0,
"step": 3240
},
{
"entropy": 2.09374221265316,
"epoch": 0.4554531759100305,
"grad_norm": 3.703125,
"learning_rate": 2.8665191740412982e-06,
"loss": 2.1182989120483398,
"mean_token_accuracy": 0.5350490301847458,
"num_tokens": 19090598.0,
"step": 3250
},
{
"entropy": 2.040800130367279,
"epoch": 0.45685457029744597,
"grad_norm": 3.296875,
"learning_rate": 2.8591445427728615e-06,
"loss": 2.0858171463012694,
"mean_token_accuracy": 0.5454586446285248,
"num_tokens": 19149415.0,
"step": 3260
},
{
"entropy": 2.0399263858795167,
"epoch": 0.45825596468486146,
"grad_norm": 4.125,
"learning_rate": 2.8517699115044252e-06,
"loss": 2.071771812438965,
"mean_token_accuracy": 0.5436090737581253,
"num_tokens": 19209559.0,
"step": 3270
},
{
"entropy": 2.0385482013225555,
"epoch": 0.4596573590722769,
"grad_norm": 3.53125,
"learning_rate": 2.8443952802359885e-06,
"loss": 2.076809310913086,
"mean_token_accuracy": 0.5420018076896668,
"num_tokens": 19270353.0,
"step": 3280
},
{
"entropy": 2.0251143515110015,
"epoch": 0.4610587534596924,
"grad_norm": 3.5625,
"learning_rate": 2.837020648967552e-06,
"loss": 2.059922218322754,
"mean_token_accuracy": 0.551348476856947,
"num_tokens": 19328176.0,
"step": 3290
},
{
"entropy": 2.0049924582242964,
"epoch": 0.46246014784710787,
"grad_norm": 3.59375,
"learning_rate": 2.829646017699115e-06,
"loss": 2.062200927734375,
"mean_token_accuracy": 0.5466015346348285,
"num_tokens": 19386709.0,
"step": 3300
},
{
"entropy": 1.991297048330307,
"epoch": 0.46386154223452336,
"grad_norm": 3.890625,
"learning_rate": 2.822271386430679e-06,
"loss": 2.0469194412231446,
"mean_token_accuracy": 0.5508559308946133,
"num_tokens": 19444741.0,
"step": 3310
},
{
"entropy": 2.0167817562818526,
"epoch": 0.46526293662193885,
"grad_norm": 3.625,
"learning_rate": 2.814896755162242e-06,
"loss": 2.0712039947509764,
"mean_token_accuracy": 0.5523478977382184,
"num_tokens": 19503028.0,
"step": 3320
},
{
"entropy": 2.0049867272377013,
"epoch": 0.4666643310093543,
"grad_norm": 4.09375,
"learning_rate": 2.8075221238938054e-06,
"loss": 2.043589401245117,
"mean_token_accuracy": 0.5559856280684471,
"num_tokens": 19558987.0,
"step": 3330
},
{
"entropy": 2.005906584858894,
"epoch": 0.46806572539676977,
"grad_norm": 3.84375,
"learning_rate": 2.800147492625369e-06,
"loss": 2.0505804061889648,
"mean_token_accuracy": 0.5503264181315899,
"num_tokens": 19618160.0,
"step": 3340
},
{
"entropy": 2.000386303663254,
"epoch": 0.46946711978418526,
"grad_norm": 3.296875,
"learning_rate": 2.792772861356932e-06,
"loss": 2.054909324645996,
"mean_token_accuracy": 0.5460795871913433,
"num_tokens": 19677802.0,
"step": 3350
},
{
"entropy": 2.0026027977466585,
"epoch": 0.47086851417160075,
"grad_norm": 3.453125,
"learning_rate": 2.7853982300884957e-06,
"loss": 2.049390411376953,
"mean_token_accuracy": 0.551422468572855,
"num_tokens": 19735520.0,
"step": 3360
},
{
"entropy": 2.053162467479706,
"epoch": 0.47226990855901624,
"grad_norm": 3.140625,
"learning_rate": 2.7780235988200594e-06,
"loss": 2.097758102416992,
"mean_token_accuracy": 0.5442638322710991,
"num_tokens": 19795972.0,
"step": 3370
},
{
"entropy": 2.0171428352594374,
"epoch": 0.4736713029464317,
"grad_norm": 3.5625,
"learning_rate": 2.7706489675516222e-06,
"loss": 2.060979652404785,
"mean_token_accuracy": 0.5500943906605243,
"num_tokens": 19852770.0,
"step": 3380
},
{
"entropy": 2.065670907497406,
"epoch": 0.47507269733384716,
"grad_norm": 3.59375,
"learning_rate": 2.763274336283186e-06,
"loss": 2.0913238525390625,
"mean_token_accuracy": 0.5402901194989681,
"num_tokens": 19913506.0,
"step": 3390
},
{
"entropy": 1.9373196512460709,
"epoch": 0.47647409172126265,
"grad_norm": 3.78125,
"learning_rate": 2.7558997050147496e-06,
"loss": 2.016362762451172,
"mean_token_accuracy": 0.5609184913337231,
"num_tokens": 19969123.0,
"step": 3400
},
{
"entropy": 2.0038623034954073,
"epoch": 0.47787548610867814,
"grad_norm": 3.875,
"learning_rate": 2.7485250737463133e-06,
"loss": 2.0328384399414063,
"mean_token_accuracy": 0.5531811892986298,
"num_tokens": 20026637.0,
"step": 3410
},
{
"entropy": 2.025873976945877,
"epoch": 0.4792768804960936,
"grad_norm": 3.78125,
"learning_rate": 2.741150442477876e-06,
"loss": 2.074894142150879,
"mean_token_accuracy": 0.5467535518109798,
"num_tokens": 20084776.0,
"step": 3420
},
{
"entropy": 2.0325380116701126,
"epoch": 0.4806782748835091,
"grad_norm": 3.796875,
"learning_rate": 2.73377581120944e-06,
"loss": 2.0545236587524416,
"mean_token_accuracy": 0.5489490836858749,
"num_tokens": 20143024.0,
"step": 3430
},
{
"entropy": 2.0260173439979554,
"epoch": 0.48207966927092455,
"grad_norm": 3.5625,
"learning_rate": 2.726401179941003e-06,
"loss": 2.067676544189453,
"mean_token_accuracy": 0.5490511626005172,
"num_tokens": 20199880.0,
"step": 3440
},
{
"entropy": 2.042122220993042,
"epoch": 0.48348106365834004,
"grad_norm": 3.65625,
"learning_rate": 2.7190265486725665e-06,
"loss": 2.0859392166137694,
"mean_token_accuracy": 0.5460739366710186,
"num_tokens": 20257116.0,
"step": 3450
},
{
"entropy": 2.0438840121030806,
"epoch": 0.4848824580457555,
"grad_norm": 4.59375,
"learning_rate": 2.71165191740413e-06,
"loss": 2.067841339111328,
"mean_token_accuracy": 0.5486466385424137,
"num_tokens": 20315069.0,
"step": 3460
},
{
"entropy": 2.0156511545181273,
"epoch": 0.486283852433171,
"grad_norm": 3.84375,
"learning_rate": 2.7042772861356935e-06,
"loss": 2.0815851211547853,
"mean_token_accuracy": 0.5475437700748443,
"num_tokens": 20375449.0,
"step": 3470
},
{
"entropy": 2.069836437702179,
"epoch": 0.4876852468205865,
"grad_norm": 3.375,
"learning_rate": 2.6969026548672568e-06,
"loss": 2.150330352783203,
"mean_token_accuracy": 0.5382217861711979,
"num_tokens": 20438695.0,
"step": 3480
},
{
"entropy": 2.0334780693054197,
"epoch": 0.48908664120800194,
"grad_norm": 3.625,
"learning_rate": 2.68952802359882e-06,
"loss": 2.0477685928344727,
"mean_token_accuracy": 0.5468250714242459,
"num_tokens": 20498908.0,
"step": 3490
},
{
"entropy": 2.0661162793636323,
"epoch": 0.4904880355954174,
"grad_norm": 3.8125,
"learning_rate": 2.6821533923303838e-06,
"loss": 2.118264007568359,
"mean_token_accuracy": 0.5386695951223374,
"num_tokens": 20558837.0,
"step": 3500
},
{
"entropy": 2.0294057965278625,
"epoch": 0.4918894299828329,
"grad_norm": 3.40625,
"learning_rate": 2.674778761061947e-06,
"loss": 2.0714643478393553,
"mean_token_accuracy": 0.544650749117136,
"num_tokens": 20621754.0,
"step": 3510
},
{
"entropy": 1.9884522348642348,
"epoch": 0.4932908243702484,
"grad_norm": 3.21875,
"learning_rate": 2.6674041297935103e-06,
"loss": 2.037005805969238,
"mean_token_accuracy": 0.5551797017455101,
"num_tokens": 20678506.0,
"step": 3520
},
{
"entropy": 2.057207414507866,
"epoch": 0.4946922187576639,
"grad_norm": 4.28125,
"learning_rate": 2.660029498525074e-06,
"loss": 2.0946880340576173,
"mean_token_accuracy": 0.5411521509289742,
"num_tokens": 20738044.0,
"step": 3530
},
{
"entropy": 2.037112107872963,
"epoch": 0.4960936131450793,
"grad_norm": 3.75,
"learning_rate": 2.6526548672566373e-06,
"loss": 2.0831565856933594,
"mean_token_accuracy": 0.5441927686333656,
"num_tokens": 20795455.0,
"step": 3540
},
{
"entropy": 2.0589177668094636,
"epoch": 0.4974950075324948,
"grad_norm": 3.390625,
"learning_rate": 2.6452802359882006e-06,
"loss": 2.078609085083008,
"mean_token_accuracy": 0.5393376901745797,
"num_tokens": 20857923.0,
"step": 3550
},
{
"entropy": 1.9840614557266236,
"epoch": 0.4988964019199103,
"grad_norm": 3.8125,
"learning_rate": 2.6379056047197643e-06,
"loss": 2.0415136337280275,
"mean_token_accuracy": 0.5558890357613564,
"num_tokens": 20914435.0,
"step": 3560
},
{
"entropy": 2.0576535284519197,
"epoch": 0.5002977963073257,
"grad_norm": 3.5625,
"learning_rate": 2.630530973451328e-06,
"loss": 2.100432205200195,
"mean_token_accuracy": 0.5417121030390263,
"num_tokens": 20975121.0,
"step": 3570
},
{
"entropy": 1.977579164505005,
"epoch": 0.5016991906947412,
"grad_norm": 3.28125,
"learning_rate": 2.623156342182891e-06,
"loss": 1.9968931198120117,
"mean_token_accuracy": 0.5547671675682068,
"num_tokens": 21033320.0,
"step": 3580
},
{
"entropy": 1.994506189227104,
"epoch": 0.5031005850821567,
"grad_norm": 3.640625,
"learning_rate": 2.6157817109144546e-06,
"loss": 2.055440139770508,
"mean_token_accuracy": 0.5502506762742996,
"num_tokens": 21090281.0,
"step": 3590
},
{
"entropy": 2.013153353333473,
"epoch": 0.5045019794695722,
"grad_norm": 3.578125,
"learning_rate": 2.6084070796460183e-06,
"loss": 2.0509225845336916,
"mean_token_accuracy": 0.5509684525430203,
"num_tokens": 21147874.0,
"step": 3600
},
{
"entropy": 2.0328510105609894,
"epoch": 0.5059033738569877,
"grad_norm": 3.640625,
"learning_rate": 2.601032448377581e-06,
"loss": 2.063313293457031,
"mean_token_accuracy": 0.5480868622660637,
"num_tokens": 21208265.0,
"step": 3610
},
{
"entropy": 2.0235374003648756,
"epoch": 0.5073047682444032,
"grad_norm": 4.1875,
"learning_rate": 2.593657817109145e-06,
"loss": 2.049294090270996,
"mean_token_accuracy": 0.5469991482794285,
"num_tokens": 21267181.0,
"step": 3620
},
{
"entropy": 2.0558235228061674,
"epoch": 0.5087061626318187,
"grad_norm": 3.9375,
"learning_rate": 2.586283185840708e-06,
"loss": 2.0990793228149416,
"mean_token_accuracy": 0.5421556040644646,
"num_tokens": 21330102.0,
"step": 3630
},
{
"entropy": 2.007439586520195,
"epoch": 0.5101075570192342,
"grad_norm": 3.859375,
"learning_rate": 2.5789085545722714e-06,
"loss": 2.031885528564453,
"mean_token_accuracy": 0.5457480415701866,
"num_tokens": 21391219.0,
"step": 3640
},
{
"entropy": 2.0088407576084135,
"epoch": 0.5115089514066496,
"grad_norm": 3.4375,
"learning_rate": 2.571533923303835e-06,
"loss": 2.059234046936035,
"mean_token_accuracy": 0.5426969014108181,
"num_tokens": 21450040.0,
"step": 3650
},
{
"entropy": 2.077793797850609,
"epoch": 0.5129103457940651,
"grad_norm": 3.96875,
"learning_rate": 2.5641592920353984e-06,
"loss": 2.12182731628418,
"mean_token_accuracy": 0.536633738130331,
"num_tokens": 21513501.0,
"step": 3660
},
{
"entropy": 2.0497137665748597,
"epoch": 0.5143117401814806,
"grad_norm": 3.734375,
"learning_rate": 2.5567846607669617e-06,
"loss": 2.0897573471069335,
"mean_token_accuracy": 0.5466533005237579,
"num_tokens": 21571729.0,
"step": 3670
},
{
"entropy": 2.069832128286362,
"epoch": 0.515713134568896,
"grad_norm": 3.359375,
"learning_rate": 2.5494100294985254e-06,
"loss": 2.104374122619629,
"mean_token_accuracy": 0.5386730141937732,
"num_tokens": 21634312.0,
"step": 3680
},
{
"entropy": 1.9782506972551346,
"epoch": 0.5171145289563115,
"grad_norm": 3.8125,
"learning_rate": 2.5420353982300887e-06,
"loss": 2.0286142349243166,
"mean_token_accuracy": 0.5537291884422302,
"num_tokens": 21692193.0,
"step": 3690
},
{
"entropy": 2.032965365052223,
"epoch": 0.518515923343727,
"grad_norm": 3.1875,
"learning_rate": 2.534660766961652e-06,
"loss": 2.0770105361938476,
"mean_token_accuracy": 0.5466852344572544,
"num_tokens": 21754024.0,
"step": 3700
},
{
"entropy": 2.0536326289176943,
"epoch": 0.5199173177311425,
"grad_norm": 4.28125,
"learning_rate": 2.5272861356932153e-06,
"loss": 2.093625068664551,
"mean_token_accuracy": 0.5425667576491833,
"num_tokens": 21814964.0,
"step": 3710
},
{
"entropy": 2.0720867395401,
"epoch": 0.521318712118558,
"grad_norm": 3.859375,
"learning_rate": 2.519911504424779e-06,
"loss": 2.115810012817383,
"mean_token_accuracy": 0.5382542759180069,
"num_tokens": 21876670.0,
"step": 3720
},
{
"entropy": 2.0418166905641555,
"epoch": 0.5227201065059734,
"grad_norm": 3.234375,
"learning_rate": 2.5125368731563427e-06,
"loss": 2.0819705963134765,
"mean_token_accuracy": 0.5415958672761917,
"num_tokens": 21936186.0,
"step": 3730
},
{
"entropy": 1.9627337753772736,
"epoch": 0.5241215008933889,
"grad_norm": 3.71875,
"learning_rate": 2.5051622418879056e-06,
"loss": 2.0003637313842773,
"mean_token_accuracy": 0.5582445688545704,
"num_tokens": 21990937.0,
"step": 3740
},
{
"entropy": 2.041642299294472,
"epoch": 0.5255228952808044,
"grad_norm": 3.421875,
"learning_rate": 2.4977876106194693e-06,
"loss": 2.0848148345947264,
"mean_token_accuracy": 0.5404154628515243,
"num_tokens": 22049685.0,
"step": 3750
},
{
"entropy": 2.0510466665029528,
"epoch": 0.5269242896682199,
"grad_norm": 3.625,
"learning_rate": 2.4904129793510326e-06,
"loss": 2.072761344909668,
"mean_token_accuracy": 0.5417856775224209,
"num_tokens": 22111400.0,
"step": 3760
},
{
"entropy": 2.0478140890598295,
"epoch": 0.5283256840556354,
"grad_norm": 3.484375,
"learning_rate": 2.4830383480825963e-06,
"loss": 2.074302101135254,
"mean_token_accuracy": 0.5471907205879688,
"num_tokens": 22169953.0,
"step": 3770
},
{
"entropy": 1.9797133803367615,
"epoch": 0.5297270784430508,
"grad_norm": 3.5625,
"learning_rate": 2.4756637168141596e-06,
"loss": 2.05294246673584,
"mean_token_accuracy": 0.5519698172807693,
"num_tokens": 22225622.0,
"step": 3780
},
{
"entropy": 2.0385789662599563,
"epoch": 0.5311284728304663,
"grad_norm": 3.71875,
"learning_rate": 2.468289085545723e-06,
"loss": 2.064686965942383,
"mean_token_accuracy": 0.5464815199375153,
"num_tokens": 22286974.0,
"step": 3790
},
{
"entropy": 2.001328268647194,
"epoch": 0.5325298672178818,
"grad_norm": 3.5,
"learning_rate": 2.4609144542772865e-06,
"loss": 2.0372297286987306,
"mean_token_accuracy": 0.5501808658242225,
"num_tokens": 22344418.0,
"step": 3800
},
{
"entropy": 2.0195149928331375,
"epoch": 0.5339312616052972,
"grad_norm": 3.4375,
"learning_rate": 2.45353982300885e-06,
"loss": 2.0701387405395506,
"mean_token_accuracy": 0.5477361977100372,
"num_tokens": 22408335.0,
"step": 3810
},
{
"entropy": 2.0369257777929306,
"epoch": 0.5353326559927127,
"grad_norm": 4.03125,
"learning_rate": 2.446165191740413e-06,
"loss": 2.0915966033935547,
"mean_token_accuracy": 0.5456332109868527,
"num_tokens": 22466521.0,
"step": 3820
},
{
"entropy": 1.9785560071468353,
"epoch": 0.5367340503801282,
"grad_norm": 3.546875,
"learning_rate": 2.438790560471977e-06,
"loss": 2.0245759963989256,
"mean_token_accuracy": 0.5537137188017368,
"num_tokens": 22522827.0,
"step": 3830
},
{
"entropy": 2.009777495265007,
"epoch": 0.5381354447675437,
"grad_norm": 3.609375,
"learning_rate": 2.43141592920354e-06,
"loss": 2.04541130065918,
"mean_token_accuracy": 0.5507000245153904,
"num_tokens": 22579352.0,
"step": 3840
},
{
"entropy": 2.0158716648817063,
"epoch": 0.5395368391549592,
"grad_norm": 3.953125,
"learning_rate": 2.4240412979351034e-06,
"loss": 2.0709373474121096,
"mean_token_accuracy": 0.5494461841881275,
"num_tokens": 22633813.0,
"step": 3850
},
{
"entropy": 1.9816727459430694,
"epoch": 0.5409382335423747,
"grad_norm": 3.703125,
"learning_rate": 2.4166666666666667e-06,
"loss": 2.028717803955078,
"mean_token_accuracy": 0.5602708630263805,
"num_tokens": 22690510.0,
"step": 3860
},
{
"entropy": 2.0063779681921003,
"epoch": 0.5423396279297902,
"grad_norm": 3.984375,
"learning_rate": 2.4092920353982304e-06,
"loss": 2.027983856201172,
"mean_token_accuracy": 0.5518012642860413,
"num_tokens": 22751639.0,
"step": 3870
},
{
"entropy": 1.9799637734889983,
"epoch": 0.5437410223172057,
"grad_norm": 4.0,
"learning_rate": 2.4019174041297937e-06,
"loss": 2.0037744522094725,
"mean_token_accuracy": 0.5529186941683293,
"num_tokens": 22809956.0,
"step": 3880
},
{
"entropy": 1.9927177160978318,
"epoch": 0.545142416704621,
"grad_norm": 3.515625,
"learning_rate": 2.394542772861357e-06,
"loss": 2.0321245193481445,
"mean_token_accuracy": 0.5531116656959056,
"num_tokens": 22868091.0,
"step": 3890
},
{
"entropy": 2.026549074053764,
"epoch": 0.5465438110920365,
"grad_norm": 7.3125,
"learning_rate": 2.3871681415929202e-06,
"loss": 2.0672191619873046,
"mean_token_accuracy": 0.5436496593058109,
"num_tokens": 22929148.0,
"step": 3900
},
{
"entropy": 1.9840692311525345,
"epoch": 0.547945205479452,
"grad_norm": 3.375,
"learning_rate": 2.379793510324484e-06,
"loss": 2.0380395889282226,
"mean_token_accuracy": 0.5514030374586583,
"num_tokens": 22988015.0,
"step": 3910
},
{
"entropy": 2.035917988419533,
"epoch": 0.5493465998668675,
"grad_norm": 3.578125,
"learning_rate": 2.3724188790560472e-06,
"loss": 2.0763721466064453,
"mean_token_accuracy": 0.5406392715871334,
"num_tokens": 23049171.0,
"step": 3920
},
{
"entropy": 1.99947247505188,
"epoch": 0.550747994254283,
"grad_norm": 3.828125,
"learning_rate": 2.365044247787611e-06,
"loss": 2.052603530883789,
"mean_token_accuracy": 0.5530374385416508,
"num_tokens": 23105763.0,
"step": 3930
},
{
"entropy": 2.0505595415830613,
"epoch": 0.5521493886416985,
"grad_norm": 3.59375,
"learning_rate": 2.3576696165191742e-06,
"loss": 2.094431495666504,
"mean_token_accuracy": 0.5417370781302452,
"num_tokens": 23166182.0,
"step": 3940
},
{
"entropy": 2.050633665919304,
"epoch": 0.553550783029114,
"grad_norm": 4.3125,
"learning_rate": 2.3502949852507375e-06,
"loss": 2.0828453063964845,
"mean_token_accuracy": 0.5454864524304867,
"num_tokens": 23227099.0,
"step": 3950
},
{
"entropy": 2.0483777284622193,
"epoch": 0.5549521774165295,
"grad_norm": 3.625,
"learning_rate": 2.3429203539823012e-06,
"loss": 2.0835256576538086,
"mean_token_accuracy": 0.5411513276398182,
"num_tokens": 23288781.0,
"step": 3960
},
{
"entropy": 2.064347520470619,
"epoch": 0.556353571803945,
"grad_norm": 3.265625,
"learning_rate": 2.3355457227138645e-06,
"loss": 2.107004165649414,
"mean_token_accuracy": 0.5416832119226456,
"num_tokens": 23350486.0,
"step": 3970
},
{
"entropy": 2.0445487290620803,
"epoch": 0.5577549661913604,
"grad_norm": 3.53125,
"learning_rate": 2.328171091445428e-06,
"loss": 2.08209342956543,
"mean_token_accuracy": 0.5434218257665634,
"num_tokens": 23411926.0,
"step": 3980
},
{
"entropy": 2.0346221029758453,
"epoch": 0.5591563605787759,
"grad_norm": 3.234375,
"learning_rate": 2.3207964601769915e-06,
"loss": 2.0527862548828124,
"mean_token_accuracy": 0.5450842939317226,
"num_tokens": 23472131.0,
"step": 3990
},
{
"entropy": 2.0058074325323103,
"epoch": 0.5605577549661913,
"grad_norm": 3.78125,
"learning_rate": 2.313421828908555e-06,
"loss": 2.0455265045166016,
"mean_token_accuracy": 0.5474824257194996,
"num_tokens": 23531627.0,
"step": 4000
},
{
"entropy": 2.0183048009872437,
"epoch": 0.5619591493536068,
"grad_norm": 3.8125,
"learning_rate": 2.3060471976401185e-06,
"loss": 2.0639692306518556,
"mean_token_accuracy": 0.5463249370455742,
"num_tokens": 23588833.0,
"step": 4010
},
{
"entropy": 1.9974335372447967,
"epoch": 0.5633605437410223,
"grad_norm": 3.703125,
"learning_rate": 2.2986725663716818e-06,
"loss": 2.0383316040039063,
"mean_token_accuracy": 0.5446601718664169,
"num_tokens": 23648905.0,
"step": 4020
},
{
"entropy": 2.0130158990621565,
"epoch": 0.5647619381284378,
"grad_norm": 3.828125,
"learning_rate": 2.291297935103245e-06,
"loss": 2.0863428115844727,
"mean_token_accuracy": 0.5524916179478169,
"num_tokens": 23708346.0,
"step": 4030
},
{
"entropy": 2.0139412343502046,
"epoch": 0.5661633325158533,
"grad_norm": 3.40625,
"learning_rate": 2.2839233038348084e-06,
"loss": 2.0729434967041014,
"mean_token_accuracy": 0.5456508606672287,
"num_tokens": 23769092.0,
"step": 4040
},
{
"entropy": 2.006833681464195,
"epoch": 0.5675647269032688,
"grad_norm": 3.59375,
"learning_rate": 2.276548672566372e-06,
"loss": 2.030129814147949,
"mean_token_accuracy": 0.5505193144083023,
"num_tokens": 23826674.0,
"step": 4050
},
{
"entropy": 1.9849727123975753,
"epoch": 0.5689661212906842,
"grad_norm": 5.96875,
"learning_rate": 2.2691740412979353e-06,
"loss": 2.0195226669311523,
"mean_token_accuracy": 0.5553907476365566,
"num_tokens": 23883950.0,
"step": 4060
},
{
"entropy": 2.0020676136016844,
"epoch": 0.5703675156780997,
"grad_norm": 3.421875,
"learning_rate": 2.2617994100294986e-06,
"loss": 2.029514503479004,
"mean_token_accuracy": 0.546630323678255,
"num_tokens": 23943657.0,
"step": 4070
},
{
"entropy": 2.0378906697034838,
"epoch": 0.5717689100655152,
"grad_norm": 3.40625,
"learning_rate": 2.254424778761062e-06,
"loss": 2.090596008300781,
"mean_token_accuracy": 0.5463094800710678,
"num_tokens": 24003246.0,
"step": 4080
},
{
"entropy": 2.0127851188182833,
"epoch": 0.5731703044529307,
"grad_norm": 4.09375,
"learning_rate": 2.2470501474926256e-06,
"loss": 2.06030330657959,
"mean_token_accuracy": 0.5467360019683838,
"num_tokens": 24063024.0,
"step": 4090
},
{
"entropy": 1.999370601773262,
"epoch": 0.5745716988403461,
"grad_norm": 3.5,
"learning_rate": 2.239675516224189e-06,
"loss": 2.0564907073974608,
"mean_token_accuracy": 0.5505198113620281,
"num_tokens": 24125799.0,
"step": 4100
},
{
"entropy": 2.0180424094200133,
"epoch": 0.5759730932277616,
"grad_norm": 3.78125,
"learning_rate": 2.232300884955752e-06,
"loss": 2.0601451873779295,
"mean_token_accuracy": 0.5503242604434491,
"num_tokens": 24181795.0,
"step": 4110
},
{
"entropy": 2.0518387466669084,
"epoch": 0.5773744876151771,
"grad_norm": 3.828125,
"learning_rate": 2.224926253687316e-06,
"loss": 2.1045751571655273,
"mean_token_accuracy": 0.5413469187915325,
"num_tokens": 24241030.0,
"step": 4120
},
{
"entropy": 2.071943160891533,
"epoch": 0.5787758820025926,
"grad_norm": 3.390625,
"learning_rate": 2.217551622418879e-06,
"loss": 2.114454650878906,
"mean_token_accuracy": 0.5378143228590488,
"num_tokens": 24302855.0,
"step": 4130
},
{
"entropy": 1.9547184824943542,
"epoch": 0.580177276390008,
"grad_norm": 4.1875,
"learning_rate": 2.2101769911504425e-06,
"loss": 2.0317546844482424,
"mean_token_accuracy": 0.5589460290968418,
"num_tokens": 24357551.0,
"step": 4140
},
{
"entropy": 2.057077610492706,
"epoch": 0.5815786707774235,
"grad_norm": 3.75,
"learning_rate": 2.202802359882006e-06,
"loss": 2.083742141723633,
"mean_token_accuracy": 0.5418501496315002,
"num_tokens": 24419099.0,
"step": 4150
},
{
"entropy": 1.984746727347374,
"epoch": 0.582980065164839,
"grad_norm": 3.65625,
"learning_rate": 2.1954277286135695e-06,
"loss": 2.0364831924438476,
"mean_token_accuracy": 0.5524508558213711,
"num_tokens": 24477573.0,
"step": 4160
},
{
"entropy": 1.9938465535640717,
"epoch": 0.5843814595522545,
"grad_norm": 3.9375,
"learning_rate": 2.188053097345133e-06,
"loss": 2.0479278564453125,
"mean_token_accuracy": 0.5529054492712021,
"num_tokens": 24534505.0,
"step": 4170
},
{
"entropy": 2.044906014204025,
"epoch": 0.58578285393967,
"grad_norm": 3.6875,
"learning_rate": 2.1806784660766965e-06,
"loss": 2.0834814071655274,
"mean_token_accuracy": 0.545136384665966,
"num_tokens": 24595351.0,
"step": 4180
},
{
"entropy": 2.0310352951288224,
"epoch": 0.5871842483270855,
"grad_norm": 3.25,
"learning_rate": 2.1733038348082597e-06,
"loss": 2.081809425354004,
"mean_token_accuracy": 0.5477789878845215,
"num_tokens": 24653298.0,
"step": 4190
},
{
"entropy": 1.9692771136760712,
"epoch": 0.588585642714501,
"grad_norm": 3.828125,
"learning_rate": 2.1659292035398235e-06,
"loss": 1.99939022064209,
"mean_token_accuracy": 0.5581804670393467,
"num_tokens": 24709554.0,
"step": 4200
},
{
"entropy": 2.012720575928688,
"epoch": 0.5899870371019164,
"grad_norm": 3.953125,
"learning_rate": 2.1585545722713867e-06,
"loss": 2.050390625,
"mean_token_accuracy": 0.5485328942537308,
"num_tokens": 24768020.0,
"step": 4210
},
{
"entropy": 2.0160817176103594,
"epoch": 0.5913884314893318,
"grad_norm": 4.09375,
"learning_rate": 2.15117994100295e-06,
"loss": 2.0523845672607424,
"mean_token_accuracy": 0.5486735932528972,
"num_tokens": 24827064.0,
"step": 4220
},
{
"entropy": 2.046040180325508,
"epoch": 0.5927898258767473,
"grad_norm": 3.65625,
"learning_rate": 2.1438053097345133e-06,
"loss": 2.100558280944824,
"mean_token_accuracy": 0.538923604041338,
"num_tokens": 24888245.0,
"step": 4230
},
{
"entropy": 1.95506771504879,
"epoch": 0.5941912202641628,
"grad_norm": 4.09375,
"learning_rate": 2.136430678466077e-06,
"loss": 2.005992126464844,
"mean_token_accuracy": 0.5591956958174705,
"num_tokens": 24944271.0,
"step": 4240
},
{
"entropy": 2.0218535140156746,
"epoch": 0.5955926146515783,
"grad_norm": 4.09375,
"learning_rate": 2.1290560471976403e-06,
"loss": 2.1161304473876954,
"mean_token_accuracy": 0.5459480352699757,
"num_tokens": 25007787.0,
"step": 4250
},
{
"entropy": 1.9901989072561264,
"epoch": 0.5969940090389938,
"grad_norm": 4.03125,
"learning_rate": 2.1216814159292036e-06,
"loss": 2.0250368118286133,
"mean_token_accuracy": 0.555504946410656,
"num_tokens": 25064609.0,
"step": 4260
},
{
"entropy": 2.04794394671917,
"epoch": 0.5983954034264093,
"grad_norm": 3.640625,
"learning_rate": 2.114306784660767e-06,
"loss": 2.110860252380371,
"mean_token_accuracy": 0.5407655954360961,
"num_tokens": 25125069.0,
"step": 4270
},
{
"entropy": 1.9708813965320586,
"epoch": 0.5997967978138248,
"grad_norm": 3.765625,
"learning_rate": 2.1069321533923306e-06,
"loss": 2.01574649810791,
"mean_token_accuracy": 0.5548791468143464,
"num_tokens": 25179831.0,
"step": 4280
},
{
"entropy": 1.9761624753475189,
"epoch": 0.6011981922012403,
"grad_norm": 3.421875,
"learning_rate": 2.099557522123894e-06,
"loss": 2.03051700592041,
"mean_token_accuracy": 0.5576313950121403,
"num_tokens": 25237191.0,
"step": 4290
},
{
"entropy": 2.0774387955665587,
"epoch": 0.6025995865886558,
"grad_norm": 3.78125,
"learning_rate": 2.092182890855457e-06,
"loss": 2.092380142211914,
"mean_token_accuracy": 0.5382080920040607,
"num_tokens": 25297215.0,
"step": 4300
},
{
"entropy": 2.0198237359523774,
"epoch": 0.6040009809760712,
"grad_norm": 3.828125,
"learning_rate": 2.084808259587021e-06,
"loss": 2.0585187911987304,
"mean_token_accuracy": 0.5482968099415302,
"num_tokens": 25354816.0,
"step": 4310
},
{
"entropy": 2.045816385746002,
"epoch": 0.6054023753634866,
"grad_norm": 3.703125,
"learning_rate": 2.077433628318584e-06,
"loss": 2.0543848037719727,
"mean_token_accuracy": 0.5452761068940163,
"num_tokens": 25413901.0,
"step": 4320
},
{
"entropy": 1.9651571273803712,
"epoch": 0.6068037697509021,
"grad_norm": 3.5625,
"learning_rate": 2.070058997050148e-06,
"loss": 2.0480159759521483,
"mean_token_accuracy": 0.555195688456297,
"num_tokens": 25468413.0,
"step": 4330
},
{
"entropy": 2.0128135979175568,
"epoch": 0.6082051641383176,
"grad_norm": 4.1875,
"learning_rate": 2.062684365781711e-06,
"loss": 2.05289306640625,
"mean_token_accuracy": 0.5511495009064674,
"num_tokens": 25526075.0,
"step": 4340
},
{
"entropy": 1.9372184723615646,
"epoch": 0.6096065585257331,
"grad_norm": 3.71875,
"learning_rate": 2.0553097345132744e-06,
"loss": 1.9700294494628907,
"mean_token_accuracy": 0.5638393282890319,
"num_tokens": 25582379.0,
"step": 4350
},
{
"entropy": 2.0384511291980743,
"epoch": 0.6110079529131486,
"grad_norm": 3.4375,
"learning_rate": 2.047935103244838e-06,
"loss": 2.091180992126465,
"mean_token_accuracy": 0.5433830074965954,
"num_tokens": 25639216.0,
"step": 4360
},
{
"entropy": 1.9909147679805757,
"epoch": 0.6124093473005641,
"grad_norm": 3.546875,
"learning_rate": 2.0405604719764014e-06,
"loss": 2.054271697998047,
"mean_token_accuracy": 0.5466593787074089,
"num_tokens": 25700427.0,
"step": 4370
},
{
"entropy": 2.04966981112957,
"epoch": 0.6138107416879796,
"grad_norm": 3.15625,
"learning_rate": 2.0331858407079647e-06,
"loss": 2.1054479598999025,
"mean_token_accuracy": 0.5437165200710297,
"num_tokens": 25762410.0,
"step": 4380
},
{
"entropy": 2.080600243806839,
"epoch": 0.615212136075395,
"grad_norm": 3.578125,
"learning_rate": 2.0258112094395284e-06,
"loss": 2.1234355926513673,
"mean_token_accuracy": 0.5354627579450607,
"num_tokens": 25823106.0,
"step": 4390
},
{
"entropy": 2.010471725463867,
"epoch": 0.6166135304628105,
"grad_norm": 3.5,
"learning_rate": 2.0184365781710917e-06,
"loss": 2.0771133422851564,
"mean_token_accuracy": 0.550500302016735,
"num_tokens": 25882208.0,
"step": 4400
},
{
"entropy": 2.046468684077263,
"epoch": 0.618014924850226,
"grad_norm": 3.328125,
"learning_rate": 2.011061946902655e-06,
"loss": 2.0935302734375,
"mean_token_accuracy": 0.5437944456934929,
"num_tokens": 25942159.0,
"step": 4410
},
{
"entropy": 1.9386399030685424,
"epoch": 0.6194163192376414,
"grad_norm": 3.59375,
"learning_rate": 2.0036873156342183e-06,
"loss": 2.0005924224853517,
"mean_token_accuracy": 0.5630344584584236,
"num_tokens": 25999031.0,
"step": 4420
},
{
"entropy": 1.9665241211652755,
"epoch": 0.6208177136250569,
"grad_norm": 4.15625,
"learning_rate": 1.996312684365782e-06,
"loss": 2.0306076049804687,
"mean_token_accuracy": 0.5548419393599033,
"num_tokens": 26057864.0,
"step": 4430
},
{
"entropy": 2.073987701535225,
"epoch": 0.6222191080124724,
"grad_norm": 3.34375,
"learning_rate": 1.9889380530973453e-06,
"loss": 2.129755210876465,
"mean_token_accuracy": 0.5381237179040909,
"num_tokens": 26116078.0,
"step": 4440
},
{
"entropy": 2.070046308636665,
"epoch": 0.6236205023998879,
"grad_norm": 3.796875,
"learning_rate": 1.9815634218289085e-06,
"loss": 2.126053237915039,
"mean_token_accuracy": 0.5377902492880822,
"num_tokens": 26175970.0,
"step": 4450
},
{
"entropy": 2.0707394987344743,
"epoch": 0.6250218967873034,
"grad_norm": 3.203125,
"learning_rate": 1.974188790560472e-06,
"loss": 2.0814849853515627,
"mean_token_accuracy": 0.5414546556770802,
"num_tokens": 26239820.0,
"step": 4460
},
{
"entropy": 1.9759136408567428,
"epoch": 0.6264232911747188,
"grad_norm": 3.265625,
"learning_rate": 1.9668141592920355e-06,
"loss": 2.024312973022461,
"mean_token_accuracy": 0.5533434115350246,
"num_tokens": 26297034.0,
"step": 4470
},
{
"entropy": 1.9657244265079499,
"epoch": 0.6278246855621343,
"grad_norm": 4.09375,
"learning_rate": 1.959439528023599e-06,
"loss": 2.0544254302978517,
"mean_token_accuracy": 0.5568137258291245,
"num_tokens": 26353027.0,
"step": 4480
},
{
"entropy": 1.9609319418668747,
"epoch": 0.6292260799495498,
"grad_norm": 3.546875,
"learning_rate": 1.9520648967551625e-06,
"loss": 2.0087684631347655,
"mean_token_accuracy": 0.5550144128501415,
"num_tokens": 26408537.0,
"step": 4490
},
{
"entropy": 2.010950264334679,
"epoch": 0.6306274743369653,
"grad_norm": 3.46875,
"learning_rate": 1.944690265486726e-06,
"loss": 2.0559103012084963,
"mean_token_accuracy": 0.5485326498746872,
"num_tokens": 26468140.0,
"step": 4500
},
{
"entropy": 2.04426332116127,
"epoch": 0.6320288687243808,
"grad_norm": 3.546875,
"learning_rate": 1.937315634218289e-06,
"loss": 2.0743776321411134,
"mean_token_accuracy": 0.5475040890276432,
"num_tokens": 26527853.0,
"step": 4510
},
{
"entropy": 2.017905443906784,
"epoch": 0.6334302631117963,
"grad_norm": 3.84375,
"learning_rate": 1.929941002949853e-06,
"loss": 2.0734704971313476,
"mean_token_accuracy": 0.5491776756942273,
"num_tokens": 26587202.0,
"step": 4520
},
{
"entropy": 2.043527716398239,
"epoch": 0.6348316574992117,
"grad_norm": 3.921875,
"learning_rate": 1.922566371681416e-06,
"loss": 2.088183784484863,
"mean_token_accuracy": 0.5455729715526104,
"num_tokens": 26646466.0,
"step": 4530
},
{
"entropy": 1.961167186498642,
"epoch": 0.6362330518866272,
"grad_norm": 4.1875,
"learning_rate": 1.9151917404129794e-06,
"loss": 1.994313621520996,
"mean_token_accuracy": 0.5559468373656273,
"num_tokens": 26704075.0,
"step": 4540
},
{
"entropy": 2.0513493835926058,
"epoch": 0.6376344462740426,
"grad_norm": 3.828125,
"learning_rate": 1.907817109144543e-06,
"loss": 2.097141075134277,
"mean_token_accuracy": 0.5411770515143871,
"num_tokens": 26762440.0,
"step": 4550
},
{
"entropy": 2.047315889596939,
"epoch": 0.6390358406614581,
"grad_norm": 4.125,
"learning_rate": 1.9004424778761064e-06,
"loss": 2.0906604766845702,
"mean_token_accuracy": 0.5442274920642376,
"num_tokens": 26823392.0,
"step": 4560
},
{
"entropy": 2.043235424160957,
"epoch": 0.6404372350488736,
"grad_norm": 3.46875,
"learning_rate": 1.8930678466076699e-06,
"loss": 2.1020296096801756,
"mean_token_accuracy": 0.5450766839087009,
"num_tokens": 26882187.0,
"step": 4570
},
{
"entropy": 2.037255918979645,
"epoch": 0.6418386294362891,
"grad_norm": 3.359375,
"learning_rate": 1.8856932153392332e-06,
"loss": 2.0846155166625975,
"mean_token_accuracy": 0.5447261914610863,
"num_tokens": 26943183.0,
"step": 4580
},
{
"entropy": 1.9987845778465272,
"epoch": 0.6432400238237046,
"grad_norm": 4.5625,
"learning_rate": 1.8783185840707964e-06,
"loss": 2.027919387817383,
"mean_token_accuracy": 0.5525832653045655,
"num_tokens": 27000841.0,
"step": 4590
},
{
"entropy": 1.9617159694433213,
"epoch": 0.6446414182111201,
"grad_norm": 4.125,
"learning_rate": 1.8709439528023602e-06,
"loss": 2.006016731262207,
"mean_token_accuracy": 0.5595106884837151,
"num_tokens": 27057746.0,
"step": 4600
},
{
"entropy": 2.0060916900634767,
"epoch": 0.6460428125985356,
"grad_norm": 3.65625,
"learning_rate": 1.8635693215339234e-06,
"loss": 2.0546661376953126,
"mean_token_accuracy": 0.551572060585022,
"num_tokens": 27116382.0,
"step": 4610
},
{
"entropy": 2.0146182805299757,
"epoch": 0.6474442069859511,
"grad_norm": 3.515625,
"learning_rate": 1.8561946902654867e-06,
"loss": 2.068709945678711,
"mean_token_accuracy": 0.5452509075403214,
"num_tokens": 27175277.0,
"step": 4620
},
{
"entropy": 1.999513065814972,
"epoch": 0.6488456013733666,
"grad_norm": 4.15625,
"learning_rate": 1.8488200589970504e-06,
"loss": 2.0343143463134767,
"mean_token_accuracy": 0.5572051353752613,
"num_tokens": 27230042.0,
"step": 4630
},
{
"entropy": 2.0813112437725065,
"epoch": 0.6502469957607819,
"grad_norm": 3.84375,
"learning_rate": 1.8414454277286137e-06,
"loss": 2.1107179641723635,
"mean_token_accuracy": 0.5401345692574978,
"num_tokens": 27289023.0,
"step": 4640
},
{
"entropy": 1.990957334637642,
"epoch": 0.6516483901481974,
"grad_norm": 3.5,
"learning_rate": 1.8340707964601772e-06,
"loss": 2.055299186706543,
"mean_token_accuracy": 0.5579043760895729,
"num_tokens": 27347136.0,
"step": 4650
},
{
"entropy": 2.0554713308811188,
"epoch": 0.6530497845356129,
"grad_norm": 3.828125,
"learning_rate": 1.8266961651917405e-06,
"loss": 2.0880794525146484,
"mean_token_accuracy": 0.539712043851614,
"num_tokens": 27406387.0,
"step": 4660
},
{
"entropy": 2.026723089814186,
"epoch": 0.6544511789230284,
"grad_norm": 3.53125,
"learning_rate": 1.819321533923304e-06,
"loss": 2.0620615005493166,
"mean_token_accuracy": 0.5442560493946076,
"num_tokens": 27468338.0,
"step": 4670
},
{
"entropy": 2.0433737605810167,
"epoch": 0.6558525733104439,
"grad_norm": 3.546875,
"learning_rate": 1.8119469026548675e-06,
"loss": 2.089468002319336,
"mean_token_accuracy": 0.5462387673556804,
"num_tokens": 27526762.0,
"step": 4680
},
{
"entropy": 2.0639784425497054,
"epoch": 0.6572539676978594,
"grad_norm": 3.484375,
"learning_rate": 1.8045722713864308e-06,
"loss": 2.09127140045166,
"mean_token_accuracy": 0.5396267674863339,
"num_tokens": 27586667.0,
"step": 4690
},
{
"entropy": 2.0777137130498886,
"epoch": 0.6586553620852749,
"grad_norm": 3.484375,
"learning_rate": 1.797197640117994e-06,
"loss": 2.12203311920166,
"mean_token_accuracy": 0.5387140743434429,
"num_tokens": 27647812.0,
"step": 4700
},
{
"entropy": 2.0052779465913773,
"epoch": 0.6600567564726904,
"grad_norm": 3.75,
"learning_rate": 1.7898230088495578e-06,
"loss": 2.0488203048706053,
"mean_token_accuracy": 0.5510134190320969,
"num_tokens": 27704905.0,
"step": 4710
},
{
"entropy": 2.037332388758659,
"epoch": 0.6614581508601058,
"grad_norm": 3.46875,
"learning_rate": 1.782448377581121e-06,
"loss": 2.0693235397338867,
"mean_token_accuracy": 0.550404942035675,
"num_tokens": 27765888.0,
"step": 4720
},
{
"entropy": 1.9879785537719727,
"epoch": 0.6628595452475213,
"grad_norm": 3.46875,
"learning_rate": 1.7750737463126846e-06,
"loss": 2.019399642944336,
"mean_token_accuracy": 0.5548613980412483,
"num_tokens": 27825414.0,
"step": 4730
},
{
"entropy": 2.074928048253059,
"epoch": 0.6642609396349367,
"grad_norm": 3.578125,
"learning_rate": 1.767699115044248e-06,
"loss": 2.095464897155762,
"mean_token_accuracy": 0.5411224909126758,
"num_tokens": 27887165.0,
"step": 4740
},
{
"entropy": 1.9969034761190414,
"epoch": 0.6656623340223522,
"grad_norm": 3.796875,
"learning_rate": 1.7603244837758113e-06,
"loss": 2.0468374252319337,
"mean_token_accuracy": 0.5477425627410412,
"num_tokens": 27946311.0,
"step": 4750
},
{
"entropy": 2.0368546158075334,
"epoch": 0.6670637284097677,
"grad_norm": 4.09375,
"learning_rate": 1.7529498525073748e-06,
"loss": 2.0636785507202147,
"mean_token_accuracy": 0.5443605974316597,
"num_tokens": 28004202.0,
"step": 4760
},
{
"entropy": 2.0267171233892443,
"epoch": 0.6684651227971832,
"grad_norm": 3.609375,
"learning_rate": 1.7455752212389381e-06,
"loss": 2.05112361907959,
"mean_token_accuracy": 0.5438154451549053,
"num_tokens": 28066214.0,
"step": 4770
},
{
"entropy": 1.9797705829143524,
"epoch": 0.6698665171845987,
"grad_norm": 3.6875,
"learning_rate": 1.7382005899705016e-06,
"loss": 2.0299072265625,
"mean_token_accuracy": 0.5556055679917336,
"num_tokens": 28121726.0,
"step": 4780
},
{
"entropy": 2.011865311861038,
"epoch": 0.6712679115720142,
"grad_norm": 3.765625,
"learning_rate": 1.7308259587020651e-06,
"loss": 2.04732723236084,
"mean_token_accuracy": 0.5537573218345642,
"num_tokens": 28182568.0,
"step": 4790
},
{
"entropy": 2.0864431977272035,
"epoch": 0.6726693059594296,
"grad_norm": 4.03125,
"learning_rate": 1.7234513274336284e-06,
"loss": 2.127519416809082,
"mean_token_accuracy": 0.534342635422945,
"num_tokens": 28245237.0,
"step": 4800
},
{
"entropy": 1.998366579413414,
"epoch": 0.6740707003468451,
"grad_norm": 3.75,
"learning_rate": 1.716076696165192e-06,
"loss": 2.062630462646484,
"mean_token_accuracy": 0.5544887915253639,
"num_tokens": 28302356.0,
"step": 4810
},
{
"entropy": 2.0306527107954024,
"epoch": 0.6754720947342606,
"grad_norm": 3.828125,
"learning_rate": 1.7087020648967554e-06,
"loss": 2.0890117645263673,
"mean_token_accuracy": 0.5466470494866371,
"num_tokens": 28361601.0,
"step": 4820
},
{
"entropy": 2.0527277678251266,
"epoch": 0.6768734891216761,
"grad_norm": 3.4375,
"learning_rate": 1.7013274336283187e-06,
"loss": 2.0924203872680662,
"mean_token_accuracy": 0.5420490309596062,
"num_tokens": 28423623.0,
"step": 4830
},
{
"entropy": 2.056154838204384,
"epoch": 0.6782748835090916,
"grad_norm": 3.953125,
"learning_rate": 1.6939528023598822e-06,
"loss": 2.0951744079589845,
"mean_token_accuracy": 0.5420894406735897,
"num_tokens": 28485339.0,
"step": 4840
},
{
"entropy": 2.043560880422592,
"epoch": 0.679676277896507,
"grad_norm": 3.71875,
"learning_rate": 1.6865781710914457e-06,
"loss": 2.0973472595214844,
"mean_token_accuracy": 0.5462093599140644,
"num_tokens": 28544597.0,
"step": 4850
},
{
"entropy": 1.9837368726730347,
"epoch": 0.6810776722839225,
"grad_norm": 3.796875,
"learning_rate": 1.679203539823009e-06,
"loss": 2.024229049682617,
"mean_token_accuracy": 0.5542949989438057,
"num_tokens": 28600577.0,
"step": 4860
},
{
"entropy": 2.0445822417736053,
"epoch": 0.682479066671338,
"grad_norm": 3.28125,
"learning_rate": 1.6718289085545724e-06,
"loss": 2.080499267578125,
"mean_token_accuracy": 0.5457544267177582,
"num_tokens": 28658978.0,
"step": 4870
},
{
"entropy": 2.02373021543026,
"epoch": 0.6838804610587534,
"grad_norm": 3.765625,
"learning_rate": 1.6644542772861357e-06,
"loss": 2.0790000915527345,
"mean_token_accuracy": 0.549615528434515,
"num_tokens": 28718368.0,
"step": 4880
},
{
"entropy": 2.012890937924385,
"epoch": 0.6852818554461689,
"grad_norm": 3.9375,
"learning_rate": 1.6570796460176994e-06,
"loss": 2.0690385818481447,
"mean_token_accuracy": 0.5495897889137268,
"num_tokens": 28775826.0,
"step": 4890
},
{
"entropy": 1.9953327834606172,
"epoch": 0.6866832498335844,
"grad_norm": 4.0,
"learning_rate": 1.6497050147492627e-06,
"loss": 2.0699180603027343,
"mean_token_accuracy": 0.5566862612962723,
"num_tokens": 28832227.0,
"step": 4900
},
{
"entropy": 2.017250362038612,
"epoch": 0.6880846442209999,
"grad_norm": 3.421875,
"learning_rate": 1.642330383480826e-06,
"loss": 2.0600749969482424,
"mean_token_accuracy": 0.5505439385771751,
"num_tokens": 28893658.0,
"step": 4910
},
{
"entropy": 2.0216071248054504,
"epoch": 0.6894860386084154,
"grad_norm": 3.859375,
"learning_rate": 1.6349557522123895e-06,
"loss": 2.0286935806274413,
"mean_token_accuracy": 0.5535654246807098,
"num_tokens": 28951703.0,
"step": 4920
},
{
"entropy": 2.0413787811994553,
"epoch": 0.6908874329958309,
"grad_norm": 3.734375,
"learning_rate": 1.627581120943953e-06,
"loss": 2.0949050903320314,
"mean_token_accuracy": 0.5380190096795558,
"num_tokens": 29011546.0,
"step": 4930
},
{
"entropy": 2.0354854226112367,
"epoch": 0.6922888273832464,
"grad_norm": 4.1875,
"learning_rate": 1.6202064896755163e-06,
"loss": 2.0558343887329102,
"mean_token_accuracy": 0.5461363635957242,
"num_tokens": 29072027.0,
"step": 4940
},
{
"entropy": 1.9892939269542693,
"epoch": 0.6936902217706619,
"grad_norm": 3.671875,
"learning_rate": 1.6128318584070798e-06,
"loss": 2.0504005432128904,
"mean_token_accuracy": 0.552552143484354,
"num_tokens": 29127681.0,
"step": 4950
},
{
"entropy": 1.9891421705484391,
"epoch": 0.6950916161580772,
"grad_norm": 3.3125,
"learning_rate": 1.605457227138643e-06,
"loss": 2.0430601119995115,
"mean_token_accuracy": 0.5505351021885871,
"num_tokens": 29187210.0,
"step": 4960
},
{
"entropy": 2.0355088084936144,
"epoch": 0.6964930105454927,
"grad_norm": 3.421875,
"learning_rate": 1.5980825958702068e-06,
"loss": 2.065724563598633,
"mean_token_accuracy": 0.5397682934999466,
"num_tokens": 29248403.0,
"step": 4970
},
{
"entropy": 2.039190375804901,
"epoch": 0.6978944049329082,
"grad_norm": 3.671875,
"learning_rate": 1.59070796460177e-06,
"loss": 2.0834108352661134,
"mean_token_accuracy": 0.5436397984623909,
"num_tokens": 29308108.0,
"step": 4980
},
{
"entropy": 1.95891977250576,
"epoch": 0.6992957993203237,
"grad_norm": 3.515625,
"learning_rate": 1.5833333333333333e-06,
"loss": 2.0039615631103516,
"mean_token_accuracy": 0.5627473741769791,
"num_tokens": 29363890.0,
"step": 4990
},
{
"entropy": 2.00730918943882,
"epoch": 0.7006971937077392,
"grad_norm": 3.453125,
"learning_rate": 1.575958702064897e-06,
"loss": 2.0677875518798827,
"mean_token_accuracy": 0.550707983225584,
"num_tokens": 29421859.0,
"step": 5000
},
{
"entropy": 2.0345747053623198,
"epoch": 0.7020985880951547,
"grad_norm": 3.734375,
"learning_rate": 1.5685840707964603e-06,
"loss": 2.070606231689453,
"mean_token_accuracy": 0.5438873060047626,
"num_tokens": 29485269.0,
"step": 5010
},
{
"entropy": 1.9661437571048737,
"epoch": 0.7034999824825702,
"grad_norm": 3.890625,
"learning_rate": 1.5612094395280236e-06,
"loss": 2.0235414505004883,
"mean_token_accuracy": 0.5593526065349579,
"num_tokens": 29540316.0,
"step": 5020
},
{
"entropy": 1.9796199768781662,
"epoch": 0.7049013768699857,
"grad_norm": 3.359375,
"learning_rate": 1.5538348082595871e-06,
"loss": 2.022873115539551,
"mean_token_accuracy": 0.5520857453346253,
"num_tokens": 29598590.0,
"step": 5030
},
{
"entropy": 1.9959565669298172,
"epoch": 0.7063027712574012,
"grad_norm": 3.34375,
"learning_rate": 1.5464601769911506e-06,
"loss": 2.041946220397949,
"mean_token_accuracy": 0.5531593382358551,
"num_tokens": 29657145.0,
"step": 5040
},
{
"entropy": 1.9920789122581481,
"epoch": 0.7077041656448166,
"grad_norm": 4.09375,
"learning_rate": 1.5390855457227141e-06,
"loss": 2.0239227294921873,
"mean_token_accuracy": 0.5522009208798409,
"num_tokens": 29715642.0,
"step": 5050
},
{
"entropy": 2.01208633184433,
"epoch": 0.709105560032232,
"grad_norm": 3.34375,
"learning_rate": 1.5317109144542774e-06,
"loss": 2.041418266296387,
"mean_token_accuracy": 0.5467449180781842,
"num_tokens": 29778010.0,
"step": 5060
},
{
"entropy": 2.0474745452404024,
"epoch": 0.7105069544196475,
"grad_norm": 4.15625,
"learning_rate": 1.5243362831858407e-06,
"loss": 2.08483829498291,
"mean_token_accuracy": 0.5433097027242184,
"num_tokens": 29840933.0,
"step": 5070
},
{
"entropy": 1.9889600902795792,
"epoch": 0.711908348807063,
"grad_norm": 3.6875,
"learning_rate": 1.5169616519174044e-06,
"loss": 2.027958869934082,
"mean_token_accuracy": 0.5541149020195008,
"num_tokens": 29897460.0,
"step": 5080
},
{
"entropy": 1.9934295445680619,
"epoch": 0.7133097431944785,
"grad_norm": 3.515625,
"learning_rate": 1.5095870206489677e-06,
"loss": 2.053207588195801,
"mean_token_accuracy": 0.5522679515182972,
"num_tokens": 29955103.0,
"step": 5090
},
{
"entropy": 2.008519572019577,
"epoch": 0.714711137581894,
"grad_norm": 3.515625,
"learning_rate": 1.502212389380531e-06,
"loss": 2.075584602355957,
"mean_token_accuracy": 0.548991971462965,
"num_tokens": 30016790.0,
"step": 5100
},
{
"entropy": 2.039276033639908,
"epoch": 0.7161125319693095,
"grad_norm": 3.5625,
"learning_rate": 1.4948377581120947e-06,
"loss": 2.0914531707763673,
"mean_token_accuracy": 0.5397449642419815,
"num_tokens": 30077591.0,
"step": 5110
},
{
"entropy": 2.025232970714569,
"epoch": 0.717513926356725,
"grad_norm": 3.734375,
"learning_rate": 1.487463126843658e-06,
"loss": 2.062969970703125,
"mean_token_accuracy": 0.5480619043111801,
"num_tokens": 30137969.0,
"step": 5120
},
{
"entropy": 2.009069937467575,
"epoch": 0.7189153207441404,
"grad_norm": 3.796875,
"learning_rate": 1.4800884955752215e-06,
"loss": 2.0655084609985352,
"mean_token_accuracy": 0.5510629720985889,
"num_tokens": 30196112.0,
"step": 5130
},
{
"entropy": 2.0180150896310804,
"epoch": 0.7203167151315559,
"grad_norm": 3.953125,
"learning_rate": 1.4727138643067847e-06,
"loss": 2.0467395782470703,
"mean_token_accuracy": 0.5497609481215477,
"num_tokens": 30258499.0,
"step": 5140
},
{
"entropy": 2.03435495197773,
"epoch": 0.7217181095189714,
"grad_norm": 3.28125,
"learning_rate": 1.465339233038348e-06,
"loss": 2.0752939224243163,
"mean_token_accuracy": 0.5446124017238617,
"num_tokens": 30319512.0,
"step": 5150
},
{
"entropy": 1.966948103904724,
"epoch": 0.7231195039063869,
"grad_norm": 3.96875,
"learning_rate": 1.4579646017699117e-06,
"loss": 2.028528594970703,
"mean_token_accuracy": 0.5552498593926429,
"num_tokens": 30377947.0,
"step": 5160
},
{
"entropy": 2.0390039294958116,
"epoch": 0.7245208982938023,
"grad_norm": 4.125,
"learning_rate": 1.450589970501475e-06,
"loss": 2.072515678405762,
"mean_token_accuracy": 0.5410834163427353,
"num_tokens": 30438293.0,
"step": 5170
},
{
"entropy": 2.02644604742527,
"epoch": 0.7259222926812178,
"grad_norm": 5.375,
"learning_rate": 1.4432153392330383e-06,
"loss": 2.0944353103637696,
"mean_token_accuracy": 0.5451689854264259,
"num_tokens": 30498524.0,
"step": 5180
},
{
"entropy": 2.062913554906845,
"epoch": 0.7273236870686333,
"grad_norm": 3.46875,
"learning_rate": 1.435840707964602e-06,
"loss": 2.120368003845215,
"mean_token_accuracy": 0.5419623903930187,
"num_tokens": 30559568.0,
"step": 5190
},
{
"entropy": 1.9839348793029785,
"epoch": 0.7287250814560488,
"grad_norm": 4.8125,
"learning_rate": 1.4284660766961653e-06,
"loss": 2.010845756530762,
"mean_token_accuracy": 0.5561483658850193,
"num_tokens": 30616257.0,
"step": 5200
},
{
"entropy": 1.9909240514039994,
"epoch": 0.7301264758434642,
"grad_norm": 3.609375,
"learning_rate": 1.4210914454277288e-06,
"loss": 2.038786506652832,
"mean_token_accuracy": 0.5507546961307526,
"num_tokens": 30676130.0,
"step": 5210
},
{
"entropy": 2.0434360295534133,
"epoch": 0.7315278702308797,
"grad_norm": 3.5,
"learning_rate": 1.413716814159292e-06,
"loss": 2.087807464599609,
"mean_token_accuracy": 0.543889294564724,
"num_tokens": 30733476.0,
"step": 5220
},
{
"entropy": 2.0257026076316835,
"epoch": 0.7329292646182952,
"grad_norm": 3.875,
"learning_rate": 1.4063421828908556e-06,
"loss": 2.0706718444824217,
"mean_token_accuracy": 0.5436087146401405,
"num_tokens": 30794786.0,
"step": 5230
},
{
"entropy": 1.9865258991718293,
"epoch": 0.7343306590057107,
"grad_norm": 3.453125,
"learning_rate": 1.398967551622419e-06,
"loss": 2.031447982788086,
"mean_token_accuracy": 0.5527370892465114,
"num_tokens": 30851784.0,
"step": 5240
},
{
"entropy": 2.0543854385614395,
"epoch": 0.7357320533931262,
"grad_norm": 3.484375,
"learning_rate": 1.3915929203539824e-06,
"loss": 2.098319244384766,
"mean_token_accuracy": 0.5480484694242478,
"num_tokens": 30907244.0,
"step": 5250
},
{
"entropy": 2.046630707383156,
"epoch": 0.7371334477805417,
"grad_norm": 3.6875,
"learning_rate": 1.3842182890855456e-06,
"loss": 2.0829851150512697,
"mean_token_accuracy": 0.5406535662710666,
"num_tokens": 30968532.0,
"step": 5260
},
{
"entropy": 2.090639790892601,
"epoch": 0.7385348421679571,
"grad_norm": 3.765625,
"learning_rate": 1.3768436578171094e-06,
"loss": 2.108531951904297,
"mean_token_accuracy": 0.5410657115280628,
"num_tokens": 31032380.0,
"step": 5270
},
{
"entropy": 2.0192977368831633,
"epoch": 0.7399362365553726,
"grad_norm": 3.984375,
"learning_rate": 1.3694690265486726e-06,
"loss": 2.06378288269043,
"mean_token_accuracy": 0.5463333018124104,
"num_tokens": 31089758.0,
"step": 5280
},
{
"entropy": 2.0674374043941497,
"epoch": 0.741337630942788,
"grad_norm": 3.53125,
"learning_rate": 1.3620943952802361e-06,
"loss": 2.1007968902587892,
"mean_token_accuracy": 0.5407262332737446,
"num_tokens": 31151558.0,
"step": 5290
},
{
"entropy": 2.038059750199318,
"epoch": 0.7427390253302035,
"grad_norm": 4.15625,
"learning_rate": 1.3547197640117996e-06,
"loss": 2.0754085540771485,
"mean_token_accuracy": 0.5470300734043121,
"num_tokens": 31210314.0,
"step": 5300
},
{
"entropy": 2.046363744139671,
"epoch": 0.744140419717619,
"grad_norm": 4.125,
"learning_rate": 1.347345132743363e-06,
"loss": 2.0913890838623046,
"mean_token_accuracy": 0.5413794197142124,
"num_tokens": 31268829.0,
"step": 5310
},
{
"entropy": 1.9908478796482085,
"epoch": 0.7455418141050345,
"grad_norm": 4.1875,
"learning_rate": 1.3399705014749264e-06,
"loss": 2.0599996566772463,
"mean_token_accuracy": 0.5544260628521442,
"num_tokens": 31327236.0,
"step": 5320
},
{
"entropy": 2.0618211805820463,
"epoch": 0.74694320849245,
"grad_norm": 4.125,
"learning_rate": 1.3325958702064897e-06,
"loss": 2.089054489135742,
"mean_token_accuracy": 0.5435502268373966,
"num_tokens": 31386149.0,
"step": 5330
},
{
"entropy": 2.03034026324749,
"epoch": 0.7483446028798655,
"grad_norm": 3.1875,
"learning_rate": 1.3252212389380532e-06,
"loss": 2.061849594116211,
"mean_token_accuracy": 0.5444556280970574,
"num_tokens": 31445055.0,
"step": 5340
},
{
"entropy": 1.954394268989563,
"epoch": 0.749745997267281,
"grad_norm": 3.8125,
"learning_rate": 1.3178466076696167e-06,
"loss": 2.0087169647216796,
"mean_token_accuracy": 0.5599333278834819,
"num_tokens": 31501584.0,
"step": 5350
},
{
"entropy": 2.0153422504663467,
"epoch": 0.7511473916546965,
"grad_norm": 3.921875,
"learning_rate": 1.31047197640118e-06,
"loss": 2.0687637329101562,
"mean_token_accuracy": 0.5506028674542904,
"num_tokens": 31558998.0,
"step": 5360
},
{
"entropy": 2.0368154883384704,
"epoch": 0.752548786042112,
"grad_norm": 3.640625,
"learning_rate": 1.3030973451327437e-06,
"loss": 2.0791160583496096,
"mean_token_accuracy": 0.5412822388112545,
"num_tokens": 31620793.0,
"step": 5370
},
{
"entropy": 2.0666065216064453,
"epoch": 0.7539501804295273,
"grad_norm": 3.71875,
"learning_rate": 1.295722713864307e-06,
"loss": 2.1090770721435548,
"mean_token_accuracy": 0.5386351138353348,
"num_tokens": 31680897.0,
"step": 5380
},
{
"entropy": 1.9791485756635665,
"epoch": 0.7553515748169428,
"grad_norm": 3.5625,
"learning_rate": 1.2883480825958703e-06,
"loss": 2.023344612121582,
"mean_token_accuracy": 0.5536239571869374,
"num_tokens": 31738850.0,
"step": 5390
},
{
"entropy": 1.9926690608263016,
"epoch": 0.7567529692043583,
"grad_norm": 4.125,
"learning_rate": 1.2809734513274338e-06,
"loss": 2.0447708129882813,
"mean_token_accuracy": 0.5517847746610641,
"num_tokens": 31797186.0,
"step": 5400
},
{
"entropy": 1.9964224964380264,
"epoch": 0.7581543635917738,
"grad_norm": 4.84375,
"learning_rate": 1.2735988200589973e-06,
"loss": 2.045303726196289,
"mean_token_accuracy": 0.5528283767402172,
"num_tokens": 31855775.0,
"step": 5410
},
{
"entropy": 2.0050380915403365,
"epoch": 0.7595557579791893,
"grad_norm": 3.0625,
"learning_rate": 1.2662241887905605e-06,
"loss": 2.0495418548583983,
"mean_token_accuracy": 0.5511241793632508,
"num_tokens": 31917779.0,
"step": 5420
},
{
"entropy": 2.032631465792656,
"epoch": 0.7609571523666048,
"grad_norm": 3.6875,
"learning_rate": 1.258849557522124e-06,
"loss": 2.086847496032715,
"mean_token_accuracy": 0.5456423066556454,
"num_tokens": 31975252.0,
"step": 5430
},
{
"entropy": 2.039604443311691,
"epoch": 0.7623585467540203,
"grad_norm": 3.34375,
"learning_rate": 1.2514749262536873e-06,
"loss": 2.066813278198242,
"mean_token_accuracy": 0.541644936800003,
"num_tokens": 32039447.0,
"step": 5440
},
{
"entropy": 1.9697502493858337,
"epoch": 0.7637599411414357,
"grad_norm": 3.75,
"learning_rate": 1.2441002949852508e-06,
"loss": 2.009023094177246,
"mean_token_accuracy": 0.5575101591646672,
"num_tokens": 32094443.0,
"step": 5450
},
{
"entropy": 2.061708700656891,
"epoch": 0.7651613355288512,
"grad_norm": 3.3125,
"learning_rate": 1.2367256637168143e-06,
"loss": 2.124795341491699,
"mean_token_accuracy": 0.5439794048666954,
"num_tokens": 32153470.0,
"step": 5460
},
{
"entropy": 1.9518501698970794,
"epoch": 0.7665627299162667,
"grad_norm": 3.375,
"learning_rate": 1.2293510324483776e-06,
"loss": 2.02158145904541,
"mean_token_accuracy": 0.5608993351459504,
"num_tokens": 32207417.0,
"step": 5470
},
{
"entropy": 1.9832956045866013,
"epoch": 0.7679641243036822,
"grad_norm": 3.875,
"learning_rate": 1.221976401179941e-06,
"loss": 2.0236433029174803,
"mean_token_accuracy": 0.5541934780776501,
"num_tokens": 32265269.0,
"step": 5480
},
{
"entropy": 2.064125454425812,
"epoch": 0.7693655186910976,
"grad_norm": 3.53125,
"learning_rate": 1.2146017699115046e-06,
"loss": 2.1089569091796876,
"mean_token_accuracy": 0.5377648368477821,
"num_tokens": 32324979.0,
"step": 5490
},
{
"entropy": 1.9474216997623444,
"epoch": 0.7707669130785131,
"grad_norm": 3.171875,
"learning_rate": 1.2072271386430679e-06,
"loss": 2.0038455963134765,
"mean_token_accuracy": 0.5647109769284725,
"num_tokens": 32380726.0,
"step": 5500
},
{
"entropy": 2.0227566003799438,
"epoch": 0.7721683074659286,
"grad_norm": 4.625,
"learning_rate": 1.1998525073746314e-06,
"loss": 2.062344551086426,
"mean_token_accuracy": 0.5454733707010746,
"num_tokens": 32438897.0,
"step": 5510
},
{
"entropy": 2.060624200105667,
"epoch": 0.7735697018533441,
"grad_norm": 3.640625,
"learning_rate": 1.1924778761061947e-06,
"loss": 2.114695930480957,
"mean_token_accuracy": 0.5415135055780411,
"num_tokens": 32501137.0,
"step": 5520
},
{
"entropy": 1.963140258193016,
"epoch": 0.7749710962407595,
"grad_norm": 3.8125,
"learning_rate": 1.1851032448377582e-06,
"loss": 2.0178470611572266,
"mean_token_accuracy": 0.5575778961181641,
"num_tokens": 32557905.0,
"step": 5530
},
{
"entropy": 1.9923629015684128,
"epoch": 0.776372490628175,
"grad_norm": 3.546875,
"learning_rate": 1.1777286135693217e-06,
"loss": 2.038427734375,
"mean_token_accuracy": 0.5486880376935005,
"num_tokens": 32617221.0,
"step": 5540
},
{
"entropy": 2.0610381811857224,
"epoch": 0.7777738850155905,
"grad_norm": 3.78125,
"learning_rate": 1.170353982300885e-06,
"loss": 2.089842987060547,
"mean_token_accuracy": 0.5413602493703366,
"num_tokens": 32677171.0,
"step": 5550
},
{
"entropy": 2.0449792385101317,
"epoch": 0.779175279403006,
"grad_norm": 3.84375,
"learning_rate": 1.1629793510324484e-06,
"loss": 2.083336067199707,
"mean_token_accuracy": 0.544983584433794,
"num_tokens": 32734176.0,
"step": 5560
},
{
"entropy": 2.0048939406871797,
"epoch": 0.7805766737904215,
"grad_norm": 3.828125,
"learning_rate": 1.155604719764012e-06,
"loss": 2.0253765106201174,
"mean_token_accuracy": 0.5513779424130917,
"num_tokens": 32792833.0,
"step": 5570
},
{
"entropy": 1.9710610508918762,
"epoch": 0.781978068177837,
"grad_norm": 4.125,
"learning_rate": 1.1482300884955754e-06,
"loss": 2.0077726364135744,
"mean_token_accuracy": 0.555688152462244,
"num_tokens": 32848426.0,
"step": 5580
},
{
"entropy": 2.030847093462944,
"epoch": 0.7833794625652524,
"grad_norm": 4.0625,
"learning_rate": 1.1408554572271387e-06,
"loss": 2.0594655990600588,
"mean_token_accuracy": 0.55287881270051,
"num_tokens": 32908103.0,
"step": 5590
},
{
"entropy": 1.9961274981498718,
"epoch": 0.7847808569526679,
"grad_norm": 3.84375,
"learning_rate": 1.1334808259587022e-06,
"loss": 2.0341890335083006,
"mean_token_accuracy": 0.5506459511816502,
"num_tokens": 32969324.0,
"step": 5600
},
{
"entropy": 2.034320372343063,
"epoch": 0.7861822513400833,
"grad_norm": 3.1875,
"learning_rate": 1.1261061946902655e-06,
"loss": 2.0603561401367188,
"mean_token_accuracy": 0.5476031564176083,
"num_tokens": 33028844.0,
"step": 5610
},
{
"entropy": 2.0152987748384477,
"epoch": 0.7875836457274988,
"grad_norm": 3.421875,
"learning_rate": 1.118731563421829e-06,
"loss": 2.0534236907958983,
"mean_token_accuracy": 0.5472868226468564,
"num_tokens": 33088470.0,
"step": 5620
},
{
"entropy": 2.0418001085519792,
"epoch": 0.7889850401149143,
"grad_norm": 3.1875,
"learning_rate": 1.1113569321533923e-06,
"loss": 2.077309417724609,
"mean_token_accuracy": 0.5479334965348244,
"num_tokens": 33147480.0,
"step": 5630
},
{
"entropy": 2.0254188984632493,
"epoch": 0.7903864345023298,
"grad_norm": 3.9375,
"learning_rate": 1.1039823008849558e-06,
"loss": 2.0901409149169923,
"mean_token_accuracy": 0.5460968457162381,
"num_tokens": 33207254.0,
"step": 5640
},
{
"entropy": 2.078515759110451,
"epoch": 0.7917878288897453,
"grad_norm": 3.859375,
"learning_rate": 1.0966076696165193e-06,
"loss": 2.1065073013305664,
"mean_token_accuracy": 0.538357075303793,
"num_tokens": 33269654.0,
"step": 5650
},
{
"entropy": 2.030597913265228,
"epoch": 0.7931892232771608,
"grad_norm": 3.5625,
"learning_rate": 1.0892330383480828e-06,
"loss": 2.069440460205078,
"mean_token_accuracy": 0.5432138055562973,
"num_tokens": 33330503.0,
"step": 5660
},
{
"entropy": 2.0529883772134783,
"epoch": 0.7945906176645763,
"grad_norm": 3.671875,
"learning_rate": 1.081858407079646e-06,
"loss": 2.0848726272583007,
"mean_token_accuracy": 0.53982138261199,
"num_tokens": 33390091.0,
"step": 5670
},
{
"entropy": 1.9861307680606841,
"epoch": 0.7959920120519918,
"grad_norm": 3.609375,
"learning_rate": 1.0744837758112095e-06,
"loss": 2.0331771850585936,
"mean_token_accuracy": 0.5522069059312343,
"num_tokens": 33446385.0,
"step": 5680
},
{
"entropy": 2.0443527430295942,
"epoch": 0.7973934064394073,
"grad_norm": 3.375,
"learning_rate": 1.067109144542773e-06,
"loss": 2.085647773742676,
"mean_token_accuracy": 0.5428236566483975,
"num_tokens": 33509176.0,
"step": 5690
},
{
"entropy": 1.9681357473134995,
"epoch": 0.7987948008268226,
"grad_norm": 3.78125,
"learning_rate": 1.0597345132743363e-06,
"loss": 2.0029911041259765,
"mean_token_accuracy": 0.5614252880215644,
"num_tokens": 33564141.0,
"step": 5700
},
{
"entropy": 2.0032998740673067,
"epoch": 0.8001961952142381,
"grad_norm": 3.984375,
"learning_rate": 1.0523598820058998e-06,
"loss": 2.0492082595825196,
"mean_token_accuracy": 0.5448523163795471,
"num_tokens": 33622834.0,
"step": 5710
},
{
"entropy": 2.037500596046448,
"epoch": 0.8015975896016536,
"grad_norm": 4.15625,
"learning_rate": 1.0449852507374631e-06,
"loss": 2.0980915069580077,
"mean_token_accuracy": 0.5466709710657597,
"num_tokens": 33682071.0,
"step": 5720
},
{
"entropy": 2.0753049701452255,
"epoch": 0.8029989839890691,
"grad_norm": 3.328125,
"learning_rate": 1.0376106194690266e-06,
"loss": 2.0992870330810547,
"mean_token_accuracy": 0.5368607066571712,
"num_tokens": 33745428.0,
"step": 5730
},
{
"entropy": 2.0023007065057756,
"epoch": 0.8044003783764846,
"grad_norm": 3.84375,
"learning_rate": 1.03023598820059e-06,
"loss": 2.057754707336426,
"mean_token_accuracy": 0.5510963708162308,
"num_tokens": 33802458.0,
"step": 5740
},
{
"entropy": 1.9657213807106018,
"epoch": 0.8058017727639001,
"grad_norm": 4.0,
"learning_rate": 1.0228613569321534e-06,
"loss": 2.002410125732422,
"mean_token_accuracy": 0.5550228297710419,
"num_tokens": 33858048.0,
"step": 5750
},
{
"entropy": 2.0697003692388534,
"epoch": 0.8072031671513156,
"grad_norm": 3.6875,
"learning_rate": 1.0154867256637169e-06,
"loss": 2.1153873443603515,
"mean_token_accuracy": 0.539206364005804,
"num_tokens": 33919315.0,
"step": 5760
},
{
"entropy": 1.966435581445694,
"epoch": 0.8086045615387311,
"grad_norm": 3.28125,
"learning_rate": 1.0081120943952804e-06,
"loss": 1.9911382675170899,
"mean_token_accuracy": 0.5573266044259071,
"num_tokens": 33977087.0,
"step": 5770
},
{
"entropy": 2.0584985971450807,
"epoch": 0.8100059559261465,
"grad_norm": 3.546875,
"learning_rate": 1.0007374631268439e-06,
"loss": 2.1007591247558595,
"mean_token_accuracy": 0.5422012776136398,
"num_tokens": 34037587.0,
"step": 5780
},
{
"entropy": 1.9936932235956193,
"epoch": 0.811407350313562,
"grad_norm": 3.796875,
"learning_rate": 9.933628318584072e-07,
"loss": 2.022954750061035,
"mean_token_accuracy": 0.5503713063895702,
"num_tokens": 34094984.0,
"step": 5790
},
{
"entropy": 2.005845013260841,
"epoch": 0.8128087447009775,
"grad_norm": 3.1875,
"learning_rate": 9.859882005899705e-07,
"loss": 2.0530033111572266,
"mean_token_accuracy": 0.5474283389747143,
"num_tokens": 34153566.0,
"step": 5800
},
{
"entropy": 2.0169087648391724,
"epoch": 0.8142101390883929,
"grad_norm": 3.375,
"learning_rate": 9.78613569321534e-07,
"loss": 2.05322380065918,
"mean_token_accuracy": 0.5500776514410972,
"num_tokens": 34211590.0,
"step": 5810
},
{
"entropy": 1.9852912485599519,
"epoch": 0.8156115334758084,
"grad_norm": 3.59375,
"learning_rate": 9.712389380530974e-07,
"loss": 2.043269729614258,
"mean_token_accuracy": 0.5516661286354065,
"num_tokens": 34267748.0,
"step": 5820
},
{
"entropy": 2.050777268409729,
"epoch": 0.8170129278632239,
"grad_norm": 3.4375,
"learning_rate": 9.638643067846607e-07,
"loss": 2.0954652786254884,
"mean_token_accuracy": 0.5400247015058994,
"num_tokens": 34328233.0,
"step": 5830
},
{
"entropy": 2.018732896447182,
"epoch": 0.8184143222506394,
"grad_norm": 3.671875,
"learning_rate": 9.564896755162242e-07,
"loss": 2.044917678833008,
"mean_token_accuracy": 0.546955619752407,
"num_tokens": 34388325.0,
"step": 5840
},
{
"entropy": 2.0328523486852648,
"epoch": 0.8198157166380549,
"grad_norm": 3.734375,
"learning_rate": 9.491150442477877e-07,
"loss": 2.0901863098144533,
"mean_token_accuracy": 0.5440246790647507,
"num_tokens": 34449564.0,
"step": 5850
},
{
"entropy": 1.998683288693428,
"epoch": 0.8212171110254703,
"grad_norm": 3.65625,
"learning_rate": 9.417404129793511e-07,
"loss": 2.029113006591797,
"mean_token_accuracy": 0.5511540561914444,
"num_tokens": 34507918.0,
"step": 5860
},
{
"entropy": 1.9962221890687943,
"epoch": 0.8226185054128858,
"grad_norm": 3.703125,
"learning_rate": 9.343657817109145e-07,
"loss": 2.0319952011108398,
"mean_token_accuracy": 0.5507189773023129,
"num_tokens": 34564368.0,
"step": 5870
},
{
"entropy": 2.0780009627342224,
"epoch": 0.8240198998003013,
"grad_norm": 3.296875,
"learning_rate": 9.269911504424779e-07,
"loss": 2.1300451278686525,
"mean_token_accuracy": 0.5382222034037113,
"num_tokens": 34626239.0,
"step": 5880
},
{
"entropy": 2.0017063498497008,
"epoch": 0.8254212941877168,
"grad_norm": 3.5625,
"learning_rate": 9.196165191740414e-07,
"loss": 2.05452823638916,
"mean_token_accuracy": 0.5506385952234268,
"num_tokens": 34682351.0,
"step": 5890
},
{
"entropy": 2.0254274785518644,
"epoch": 0.8268226885751323,
"grad_norm": 3.46875,
"learning_rate": 9.122418879056048e-07,
"loss": 2.0523189544677733,
"mean_token_accuracy": 0.55109326466918,
"num_tokens": 34740163.0,
"step": 5900
},
{
"entropy": 1.9847439497709274,
"epoch": 0.8282240829625477,
"grad_norm": 3.46875,
"learning_rate": 9.048672566371682e-07,
"loss": 2.033793830871582,
"mean_token_accuracy": 0.5541432574391365,
"num_tokens": 34797066.0,
"step": 5910
},
{
"entropy": 1.9410735696554184,
"epoch": 0.8296254773499632,
"grad_norm": 3.53125,
"learning_rate": 8.974926253687316e-07,
"loss": 2.0152511596679688,
"mean_token_accuracy": 0.5639293536543846,
"num_tokens": 34851537.0,
"step": 5920
},
{
"entropy": 1.9899339884519578,
"epoch": 0.8310268717373787,
"grad_norm": 3.46875,
"learning_rate": 8.901179941002951e-07,
"loss": 2.0402029037475584,
"mean_token_accuracy": 0.5545332990586758,
"num_tokens": 34906669.0,
"step": 5930
},
{
"entropy": 2.0425183057785032,
"epoch": 0.8324282661247941,
"grad_norm": 3.515625,
"learning_rate": 8.827433628318586e-07,
"loss": 2.0895105361938477,
"mean_token_accuracy": 0.5444886229932309,
"num_tokens": 34968897.0,
"step": 5940
},
{
"entropy": 2.063935214281082,
"epoch": 0.8338296605122096,
"grad_norm": 3.65625,
"learning_rate": 8.753687315634218e-07,
"loss": 2.101520538330078,
"mean_token_accuracy": 0.5415826089680195,
"num_tokens": 35028785.0,
"step": 5950
},
{
"entropy": 2.054108539223671,
"epoch": 0.8352310548996251,
"grad_norm": 3.484375,
"learning_rate": 8.679941002949853e-07,
"loss": 2.1111446380615235,
"mean_token_accuracy": 0.5441468000411988,
"num_tokens": 35087811.0,
"step": 5960
},
{
"entropy": 2.0053718417882918,
"epoch": 0.8366324492870406,
"grad_norm": 4.75,
"learning_rate": 8.606194690265487e-07,
"loss": 2.033930778503418,
"mean_token_accuracy": 0.5514634430408478,
"num_tokens": 35146653.0,
"step": 5970
},
{
"entropy": 2.0017360031604765,
"epoch": 0.8380338436744561,
"grad_norm": 4.03125,
"learning_rate": 8.532448377581122e-07,
"loss": 2.0413970947265625,
"mean_token_accuracy": 0.54992650821805,
"num_tokens": 35204683.0,
"step": 5980
},
{
"entropy": 2.040289434790611,
"epoch": 0.8394352380618716,
"grad_norm": 4.0,
"learning_rate": 8.458702064896755e-07,
"loss": 2.082858085632324,
"mean_token_accuracy": 0.5428684964776039,
"num_tokens": 35264118.0,
"step": 5990
},
{
"entropy": 2.057906711101532,
"epoch": 0.8408366324492871,
"grad_norm": 3.578125,
"learning_rate": 8.38495575221239e-07,
"loss": 2.1240556716918944,
"mean_token_accuracy": 0.5388853140175343,
"num_tokens": 35325192.0,
"step": 6000
},
{
"entropy": 1.9824541568756104,
"epoch": 0.8422380268367026,
"grad_norm": 4.3125,
"learning_rate": 8.311209439528024e-07,
"loss": 2.0088882446289062,
"mean_token_accuracy": 0.5598554380238057,
"num_tokens": 35381469.0,
"step": 6010
},
{
"entropy": 2.0172985911369326,
"epoch": 0.843639421224118,
"grad_norm": 3.5,
"learning_rate": 8.237463126843659e-07,
"loss": 2.047108459472656,
"mean_token_accuracy": 0.5510746836662292,
"num_tokens": 35441252.0,
"step": 6020
},
{
"entropy": 2.056035044789314,
"epoch": 0.8450408156115334,
"grad_norm": 3.859375,
"learning_rate": 8.163716814159292e-07,
"loss": 2.094436836242676,
"mean_token_accuracy": 0.5377640590071678,
"num_tokens": 35504029.0,
"step": 6030
},
{
"entropy": 2.0101221829652784,
"epoch": 0.8464422099989489,
"grad_norm": 3.546875,
"learning_rate": 8.089970501474927e-07,
"loss": 2.035587501525879,
"mean_token_accuracy": 0.5499837107956409,
"num_tokens": 35562638.0,
"step": 6040
},
{
"entropy": 2.047288802266121,
"epoch": 0.8478436043863644,
"grad_norm": 3.609375,
"learning_rate": 8.016224188790561e-07,
"loss": 2.0719959259033205,
"mean_token_accuracy": 0.5444797173142433,
"num_tokens": 35623543.0,
"step": 6050
},
{
"entropy": 2.019099435210228,
"epoch": 0.8492449987737799,
"grad_norm": 4.03125,
"learning_rate": 7.942477876106196e-07,
"loss": 2.0497373580932616,
"mean_token_accuracy": 0.5494643032550812,
"num_tokens": 35679985.0,
"step": 6060
},
{
"entropy": 2.0061439841985704,
"epoch": 0.8506463931611954,
"grad_norm": 3.5,
"learning_rate": 7.868731563421829e-07,
"loss": 2.0653059005737306,
"mean_token_accuracy": 0.5476897947490216,
"num_tokens": 35739820.0,
"step": 6070
},
{
"entropy": 2.0328592479228975,
"epoch": 0.8520477875486109,
"grad_norm": 3.46875,
"learning_rate": 7.794985250737463e-07,
"loss": 2.086130905151367,
"mean_token_accuracy": 0.5431623153388501,
"num_tokens": 35796661.0,
"step": 6080
},
{
"entropy": 1.8993887215852738,
"epoch": 0.8534491819360264,
"grad_norm": 4.375,
"learning_rate": 7.721238938053098e-07,
"loss": 1.962714385986328,
"mean_token_accuracy": 0.5716985687613487,
"num_tokens": 35847825.0,
"step": 6090
},
{
"entropy": 2.075725582242012,
"epoch": 0.8548505763234419,
"grad_norm": 3.671875,
"learning_rate": 7.647492625368732e-07,
"loss": 2.107008171081543,
"mean_token_accuracy": 0.5390588149428368,
"num_tokens": 35907717.0,
"step": 6100
},
{
"entropy": 1.8984440177679063,
"epoch": 0.8562519707108573,
"grad_norm": 3.921875,
"learning_rate": 7.573746312684366e-07,
"loss": 1.9352567672729493,
"mean_token_accuracy": 0.5684593334794045,
"num_tokens": 35962545.0,
"step": 6110
},
{
"entropy": 2.058637836575508,
"epoch": 0.8576533650982728,
"grad_norm": 3.484375,
"learning_rate": 7.5e-07,
"loss": 2.0837944030761717,
"mean_token_accuracy": 0.5434879846870899,
"num_tokens": 36022968.0,
"step": 6120
},
{
"entropy": 1.9400978535413742,
"epoch": 0.8590547594856882,
"grad_norm": 4.25,
"learning_rate": 7.426253687315635e-07,
"loss": 1.9954360961914062,
"mean_token_accuracy": 0.5575679615139961,
"num_tokens": 36076221.0,
"step": 6130
},
{
"entropy": 1.9835266083478929,
"epoch": 0.8604561538731037,
"grad_norm": 3.96875,
"learning_rate": 7.352507374631269e-07,
"loss": 2.0139698028564452,
"mean_token_accuracy": 0.5524957269430161,
"num_tokens": 36132536.0,
"step": 6140
},
{
"entropy": 2.0456617742776873,
"epoch": 0.8618575482605192,
"grad_norm": 4.28125,
"learning_rate": 7.278761061946903e-07,
"loss": 2.112765884399414,
"mean_token_accuracy": 0.5496705166995526,
"num_tokens": 36190324.0,
"step": 6150
},
{
"entropy": 2.035894200205803,
"epoch": 0.8632589426479347,
"grad_norm": 3.609375,
"learning_rate": 7.205014749262537e-07,
"loss": 2.0914268493652344,
"mean_token_accuracy": 0.5396786376833915,
"num_tokens": 36248280.0,
"step": 6160
},
{
"entropy": 1.9879158645868302,
"epoch": 0.8646603370353502,
"grad_norm": 4.46875,
"learning_rate": 7.131268436578172e-07,
"loss": 2.035540008544922,
"mean_token_accuracy": 0.5554796390235424,
"num_tokens": 36306248.0,
"step": 6170
},
{
"entropy": 2.0229848116636275,
"epoch": 0.8660617314227657,
"grad_norm": 3.9375,
"learning_rate": 7.057522123893807e-07,
"loss": 2.0664846420288088,
"mean_token_accuracy": 0.5501019656658173,
"num_tokens": 36366071.0,
"step": 6180
},
{
"entropy": 2.0001530408859254,
"epoch": 0.8674631258101811,
"grad_norm": 3.765625,
"learning_rate": 6.98377581120944e-07,
"loss": 2.0575767517089845,
"mean_token_accuracy": 0.548371671885252,
"num_tokens": 36423193.0,
"step": 6190
},
{
"entropy": 2.0265861362218858,
"epoch": 0.8688645201975966,
"grad_norm": 3.578125,
"learning_rate": 6.910029498525074e-07,
"loss": 2.0700199127197267,
"mean_token_accuracy": 0.5455373786389828,
"num_tokens": 36483882.0,
"step": 6200
},
{
"entropy": 2.028146120905876,
"epoch": 0.8702659145850121,
"grad_norm": 3.125,
"learning_rate": 6.836283185840709e-07,
"loss": 2.070331573486328,
"mean_token_accuracy": 0.5485374145209789,
"num_tokens": 36545648.0,
"step": 6210
},
{
"entropy": 1.987005740404129,
"epoch": 0.8716673089724276,
"grad_norm": 3.859375,
"learning_rate": 6.762536873156344e-07,
"loss": 2.0263193130493162,
"mean_token_accuracy": 0.5584463804960251,
"num_tokens": 36599833.0,
"step": 6220
},
{
"entropy": 1.9288410902023316,
"epoch": 0.873068703359843,
"grad_norm": 3.8125,
"learning_rate": 6.688790560471976e-07,
"loss": 1.9976137161254883,
"mean_token_accuracy": 0.5675419226288796,
"num_tokens": 36652349.0,
"step": 6230
},
{
"entropy": 2.0247942060232162,
"epoch": 0.8744700977472585,
"grad_norm": 3.46875,
"learning_rate": 6.615044247787611e-07,
"loss": 2.077358627319336,
"mean_token_accuracy": 0.5490225307643414,
"num_tokens": 36709926.0,
"step": 6240
},
{
"entropy": 2.037145656347275,
"epoch": 0.875871492134674,
"grad_norm": 3.640625,
"learning_rate": 6.541297935103245e-07,
"loss": 2.0747695922851563,
"mean_token_accuracy": 0.5489478342235088,
"num_tokens": 36766997.0,
"step": 6250
},
{
"entropy": 2.08789139688015,
"epoch": 0.8772728865220895,
"grad_norm": 3.453125,
"learning_rate": 6.46755162241888e-07,
"loss": 2.159014892578125,
"mean_token_accuracy": 0.5406771205365658,
"num_tokens": 36825729.0,
"step": 6260
},
{
"entropy": 2.02270690202713,
"epoch": 0.878674280909505,
"grad_norm": 3.40625,
"learning_rate": 6.393805309734513e-07,
"loss": 2.078984260559082,
"mean_token_accuracy": 0.5482322216033936,
"num_tokens": 36882508.0,
"step": 6270
},
{
"entropy": 2.062803938984871,
"epoch": 0.8800756752969204,
"grad_norm": 3.6875,
"learning_rate": 6.320058997050148e-07,
"loss": 2.1231290817260744,
"mean_token_accuracy": 0.5389542184770107,
"num_tokens": 36943197.0,
"step": 6280
},
{
"entropy": 2.0048464626073836,
"epoch": 0.8814770696843359,
"grad_norm": 3.546875,
"learning_rate": 6.246312684365782e-07,
"loss": 2.059210014343262,
"mean_token_accuracy": 0.5485001653432846,
"num_tokens": 37005085.0,
"step": 6290
},
{
"entropy": 2.025335270166397,
"epoch": 0.8828784640717514,
"grad_norm": 3.640625,
"learning_rate": 6.172566371681416e-07,
"loss": 2.060206413269043,
"mean_token_accuracy": 0.5467525869607925,
"num_tokens": 37063136.0,
"step": 6300
},
{
"entropy": 2.020196759700775,
"epoch": 0.8842798584591669,
"grad_norm": 3.296875,
"learning_rate": 6.098820058997051e-07,
"loss": 2.0538991928100585,
"mean_token_accuracy": 0.550513831526041,
"num_tokens": 37119334.0,
"step": 6310
},
{
"entropy": 2.0399301528930662,
"epoch": 0.8856812528465824,
"grad_norm": 4.03125,
"learning_rate": 6.025073746312685e-07,
"loss": 2.0788429260253904,
"mean_token_accuracy": 0.5436412036418915,
"num_tokens": 37178429.0,
"step": 6320
},
{
"entropy": 2.000591477751732,
"epoch": 0.8870826472339979,
"grad_norm": 3.546875,
"learning_rate": 5.951327433628319e-07,
"loss": 2.0320425033569336,
"mean_token_accuracy": 0.5498329490423203,
"num_tokens": 37236981.0,
"step": 6330
},
{
"entropy": 1.9805440604686737,
"epoch": 0.8884840416214133,
"grad_norm": 4.09375,
"learning_rate": 5.877581120943953e-07,
"loss": 2.0307077407836913,
"mean_token_accuracy": 0.5537135571241378,
"num_tokens": 37294776.0,
"step": 6340
},
{
"entropy": 1.936901894211769,
"epoch": 0.8898854360088287,
"grad_norm": 3.75,
"learning_rate": 5.803834808259588e-07,
"loss": 1.9797849655151367,
"mean_token_accuracy": 0.5618837036192417,
"num_tokens": 37352430.0,
"step": 6350
},
{
"entropy": 2.053365245461464,
"epoch": 0.8912868303962442,
"grad_norm": 3.546875,
"learning_rate": 5.730088495575221e-07,
"loss": 2.0904542922973635,
"mean_token_accuracy": 0.542573357373476,
"num_tokens": 37416418.0,
"step": 6360
},
{
"entropy": 2.000337392091751,
"epoch": 0.8926882247836597,
"grad_norm": 3.625,
"learning_rate": 5.656342182890856e-07,
"loss": 2.0344776153564452,
"mean_token_accuracy": 0.5477051064372063,
"num_tokens": 37475972.0,
"step": 6370
},
{
"entropy": 2.0170745253562927,
"epoch": 0.8940896191710752,
"grad_norm": 3.34375,
"learning_rate": 5.58259587020649e-07,
"loss": 2.0558750152587892,
"mean_token_accuracy": 0.5457292802631855,
"num_tokens": 37537323.0,
"step": 6380
},
{
"entropy": 1.9845432758331298,
"epoch": 0.8954910135584907,
"grad_norm": 3.546875,
"learning_rate": 5.508849557522124e-07,
"loss": 2.023291015625,
"mean_token_accuracy": 0.5518418118357659,
"num_tokens": 37595925.0,
"step": 6390
},
{
"entropy": 2.011869651079178,
"epoch": 0.8968924079459062,
"grad_norm": 3.625,
"learning_rate": 5.435103244837758e-07,
"loss": 2.056960868835449,
"mean_token_accuracy": 0.5488930225372315,
"num_tokens": 37654306.0,
"step": 6400
},
{
"entropy": 2.038878303766251,
"epoch": 0.8982938023333217,
"grad_norm": 3.71875,
"learning_rate": 5.361356932153393e-07,
"loss": 2.076828956604004,
"mean_token_accuracy": 0.5448395848274231,
"num_tokens": 37711374.0,
"step": 6410
},
{
"entropy": 2.039568394422531,
"epoch": 0.8996951967207372,
"grad_norm": 4.15625,
"learning_rate": 5.287610619469027e-07,
"loss": 2.073482704162598,
"mean_token_accuracy": 0.5399616301059723,
"num_tokens": 37770694.0,
"step": 6420
},
{
"entropy": 2.0115788161754606,
"epoch": 0.9010965911081527,
"grad_norm": 3.46875,
"learning_rate": 5.213864306784661e-07,
"loss": 2.050179290771484,
"mean_token_accuracy": 0.5504628643393517,
"num_tokens": 37826837.0,
"step": 6430
},
{
"entropy": 2.015952408313751,
"epoch": 0.9024979854955681,
"grad_norm": 3.40625,
"learning_rate": 5.140117994100295e-07,
"loss": 2.071290969848633,
"mean_token_accuracy": 0.5500116847455502,
"num_tokens": 37884941.0,
"step": 6440
},
{
"entropy": 2.0158112794160843,
"epoch": 0.9038993798829835,
"grad_norm": 3.84375,
"learning_rate": 5.06637168141593e-07,
"loss": 2.086159324645996,
"mean_token_accuracy": 0.5468775622546673,
"num_tokens": 37944909.0,
"step": 6450
},
{
"entropy": 2.0077433407306673,
"epoch": 0.905300774270399,
"grad_norm": 3.65625,
"learning_rate": 4.992625368731564e-07,
"loss": 2.0421270370483398,
"mean_token_accuracy": 0.5518474072217942,
"num_tokens": 38004058.0,
"step": 6460
},
{
"entropy": 1.9993306159973145,
"epoch": 0.9067021686578145,
"grad_norm": 3.515625,
"learning_rate": 4.918879056047199e-07,
"loss": 2.06262149810791,
"mean_token_accuracy": 0.5521749749779701,
"num_tokens": 38063422.0,
"step": 6470
},
{
"entropy": 1.9897942543029785,
"epoch": 0.90810356304523,
"grad_norm": 4.0,
"learning_rate": 4.845132743362832e-07,
"loss": 2.022821807861328,
"mean_token_accuracy": 0.5545240730047226,
"num_tokens": 38122592.0,
"step": 6480
},
{
"entropy": 2.0235477566719053,
"epoch": 0.9095049574326455,
"grad_norm": 3.390625,
"learning_rate": 4.771386430678466e-07,
"loss": 2.066654014587402,
"mean_token_accuracy": 0.5462680235505104,
"num_tokens": 38180327.0,
"step": 6490
},
{
"entropy": 2.0121923983097076,
"epoch": 0.910906351820061,
"grad_norm": 3.328125,
"learning_rate": 4.6976401179941004e-07,
"loss": 2.052077293395996,
"mean_token_accuracy": 0.5453770585358143,
"num_tokens": 38244544.0,
"step": 6500
},
{
"entropy": 1.990377414226532,
"epoch": 0.9123077462074765,
"grad_norm": 3.421875,
"learning_rate": 4.623893805309735e-07,
"loss": 2.0432369232177736,
"mean_token_accuracy": 0.552157311886549,
"num_tokens": 38301630.0,
"step": 6510
},
{
"entropy": 2.0386833012104035,
"epoch": 0.9137091405948919,
"grad_norm": 4.15625,
"learning_rate": 4.550147492625369e-07,
"loss": 2.0687461853027345,
"mean_token_accuracy": 0.5471295416355133,
"num_tokens": 38362047.0,
"step": 6520
},
{
"entropy": 2.016241931915283,
"epoch": 0.9151105349823074,
"grad_norm": 3.5625,
"learning_rate": 4.476401179941003e-07,
"loss": 2.0638471603393556,
"mean_token_accuracy": 0.5452109411358833,
"num_tokens": 38420546.0,
"step": 6530
},
{
"entropy": 2.0142155259847643,
"epoch": 0.9165119293697229,
"grad_norm": 3.8125,
"learning_rate": 4.402654867256637e-07,
"loss": 2.0311935424804686,
"mean_token_accuracy": 0.5492551133036614,
"num_tokens": 38477064.0,
"step": 6540
},
{
"entropy": 2.041605365276337,
"epoch": 0.9179133237571383,
"grad_norm": 3.921875,
"learning_rate": 4.328908554572272e-07,
"loss": 2.0858449935913086,
"mean_token_accuracy": 0.5439679443836212,
"num_tokens": 38537050.0,
"step": 6550
},
{
"entropy": 1.9411323845386506,
"epoch": 0.9193147181445538,
"grad_norm": 4.03125,
"learning_rate": 4.255162241887906e-07,
"loss": 1.9711341857910156,
"mean_token_accuracy": 0.5628354027867317,
"num_tokens": 38589735.0,
"step": 6560
},
{
"entropy": 2.021375334262848,
"epoch": 0.9207161125319693,
"grad_norm": 4.1875,
"learning_rate": 4.1814159292035404e-07,
"loss": 2.0553340911865234,
"mean_token_accuracy": 0.548372670263052,
"num_tokens": 38647281.0,
"step": 6570
},
{
"entropy": 1.9824792742729187,
"epoch": 0.9221175069193848,
"grad_norm": 4.21875,
"learning_rate": 4.1076696165191743e-07,
"loss": 2.0263160705566405,
"mean_token_accuracy": 0.561814583837986,
"num_tokens": 38704914.0,
"step": 6580
},
{
"entropy": 1.9721422612667083,
"epoch": 0.9235189013068003,
"grad_norm": 3.90625,
"learning_rate": 4.033923303834809e-07,
"loss": 1.9989608764648437,
"mean_token_accuracy": 0.5563309617340565,
"num_tokens": 38762710.0,
"step": 6590
},
{
"entropy": 1.9227455765008927,
"epoch": 0.9249202956942157,
"grad_norm": 4.15625,
"learning_rate": 3.9601769911504427e-07,
"loss": 1.9534294128417968,
"mean_token_accuracy": 0.5688752263784409,
"num_tokens": 38813817.0,
"step": 6600
},
{
"entropy": 2.0381629914045334,
"epoch": 0.9263216900816312,
"grad_norm": 3.515625,
"learning_rate": 3.886430678466077e-07,
"loss": 2.085663414001465,
"mean_token_accuracy": 0.5444460518658161,
"num_tokens": 38873859.0,
"step": 6610
},
{
"entropy": 1.9983567535877227,
"epoch": 0.9277230844690467,
"grad_norm": 4.125,
"learning_rate": 3.812684365781711e-07,
"loss": 2.040988540649414,
"mean_token_accuracy": 0.5537363089621067,
"num_tokens": 38930081.0,
"step": 6620
},
{
"entropy": 2.054008278250694,
"epoch": 0.9291244788564622,
"grad_norm": 3.75,
"learning_rate": 3.7389380530973454e-07,
"loss": 2.078899955749512,
"mean_token_accuracy": 0.5432993650436402,
"num_tokens": 38992167.0,
"step": 6630
},
{
"entropy": 1.9960554003715516,
"epoch": 0.9305258732438777,
"grad_norm": 3.796875,
"learning_rate": 3.6651917404129794e-07,
"loss": 2.0496959686279297,
"mean_token_accuracy": 0.5463558658957481,
"num_tokens": 39050033.0,
"step": 6640
},
{
"entropy": 2.0130848824977874,
"epoch": 0.9319272676312932,
"grad_norm": 3.8125,
"learning_rate": 3.591445427728614e-07,
"loss": 2.0514385223388674,
"mean_token_accuracy": 0.5462015986442565,
"num_tokens": 39109813.0,
"step": 6650
},
{
"entropy": 2.0008685261011125,
"epoch": 0.9333286620187086,
"grad_norm": 3.984375,
"learning_rate": 3.5176991150442477e-07,
"loss": 2.0396297454833983,
"mean_token_accuracy": 0.5541946470737458,
"num_tokens": 39169418.0,
"step": 6660
},
{
"entropy": 2.007505992054939,
"epoch": 0.934730056406124,
"grad_norm": 4.0625,
"learning_rate": 3.4439528023598827e-07,
"loss": 2.028615188598633,
"mean_token_accuracy": 0.5482863061130047,
"num_tokens": 39231387.0,
"step": 6670
},
{
"entropy": 1.9650995761156083,
"epoch": 0.9361314507935395,
"grad_norm": 3.734375,
"learning_rate": 3.370206489675516e-07,
"loss": 2.010177803039551,
"mean_token_accuracy": 0.553785203397274,
"num_tokens": 39289423.0,
"step": 6680
},
{
"entropy": 2.006561702489853,
"epoch": 0.937532845180955,
"grad_norm": 3.5,
"learning_rate": 3.296460176991151e-07,
"loss": 2.041889762878418,
"mean_token_accuracy": 0.5466282285749913,
"num_tokens": 39348639.0,
"step": 6690
},
{
"entropy": 2.0054247260093687,
"epoch": 0.9389342395683705,
"grad_norm": 3.8125,
"learning_rate": 3.222713864306785e-07,
"loss": 2.0583980560302733,
"mean_token_accuracy": 0.549737986177206,
"num_tokens": 39406443.0,
"step": 6700
},
{
"entropy": 2.0257751524448393,
"epoch": 0.940335633955786,
"grad_norm": 3.265625,
"learning_rate": 3.1489675516224194e-07,
"loss": 2.0774940490722655,
"mean_token_accuracy": 0.5478138782083988,
"num_tokens": 39465975.0,
"step": 6710
},
{
"entropy": 2.0418166309595107,
"epoch": 0.9417370283432015,
"grad_norm": 3.46875,
"learning_rate": 3.0752212389380533e-07,
"loss": 2.0822931289672852,
"mean_token_accuracy": 0.5457756318151951,
"num_tokens": 39525372.0,
"step": 6720
},
{
"entropy": 2.040261897444725,
"epoch": 0.943138422730617,
"grad_norm": 3.71875,
"learning_rate": 3.0014749262536877e-07,
"loss": 2.0909551620483398,
"mean_token_accuracy": 0.5410762540996075,
"num_tokens": 39586099.0,
"step": 6730
},
{
"entropy": 1.9952420234680175,
"epoch": 0.9445398171180325,
"grad_norm": 3.703125,
"learning_rate": 2.927728613569322e-07,
"loss": 2.024325942993164,
"mean_token_accuracy": 0.5516095891594887,
"num_tokens": 39647194.0,
"step": 6740
},
{
"entropy": 2.010332950949669,
"epoch": 0.945941211505448,
"grad_norm": 3.34375,
"learning_rate": 2.853982300884956e-07,
"loss": 2.0505157470703126,
"mean_token_accuracy": 0.5492790564894676,
"num_tokens": 39706766.0,
"step": 6750
},
{
"entropy": 1.996803131699562,
"epoch": 0.9473426058928635,
"grad_norm": 3.34375,
"learning_rate": 2.7802359882005905e-07,
"loss": 2.043563461303711,
"mean_token_accuracy": 0.5545439317822456,
"num_tokens": 39765877.0,
"step": 6760
},
{
"entropy": 2.0132049292325975,
"epoch": 0.9487440002802788,
"grad_norm": 3.671875,
"learning_rate": 2.7064896755162244e-07,
"loss": 2.056793975830078,
"mean_token_accuracy": 0.545245599001646,
"num_tokens": 39826022.0,
"step": 6770
},
{
"entropy": 2.005643293261528,
"epoch": 0.9501453946676943,
"grad_norm": 3.484375,
"learning_rate": 2.632743362831859e-07,
"loss": 2.038430595397949,
"mean_token_accuracy": 0.5540463931858539,
"num_tokens": 39884745.0,
"step": 6780
},
{
"entropy": 2.059726729989052,
"epoch": 0.9515467890551098,
"grad_norm": 3.890625,
"learning_rate": 2.558997050147493e-07,
"loss": 2.0972423553466797,
"mean_token_accuracy": 0.5440350763499737,
"num_tokens": 39942285.0,
"step": 6790
},
{
"entropy": 2.0223002463579176,
"epoch": 0.9529481834425253,
"grad_norm": 3.65625,
"learning_rate": 2.485250737463127e-07,
"loss": 2.0618755340576174,
"mean_token_accuracy": 0.5452701196074485,
"num_tokens": 40000931.0,
"step": 6800
},
{
"entropy": 2.0402153849601747,
"epoch": 0.9543495778299408,
"grad_norm": 3.8125,
"learning_rate": 2.4115044247787616e-07,
"loss": 2.067853546142578,
"mean_token_accuracy": 0.546335106343031,
"num_tokens": 40058952.0,
"step": 6810
},
{
"entropy": 1.9442283779382705,
"epoch": 0.9557509722173563,
"grad_norm": 3.734375,
"learning_rate": 2.3377581120943955e-07,
"loss": 1.9712425231933595,
"mean_token_accuracy": 0.5628250107169152,
"num_tokens": 40114799.0,
"step": 6820
},
{
"entropy": 2.054434522986412,
"epoch": 0.9571523666047718,
"grad_norm": 3.390625,
"learning_rate": 2.2640117994100297e-07,
"loss": 2.1256746292114257,
"mean_token_accuracy": 0.5392848886549473,
"num_tokens": 40178091.0,
"step": 6830
},
{
"entropy": 1.985149982571602,
"epoch": 0.9585537609921873,
"grad_norm": 3.59375,
"learning_rate": 2.1902654867256642e-07,
"loss": 2.0216928482055665,
"mean_token_accuracy": 0.5527814209461213,
"num_tokens": 40234308.0,
"step": 6840
},
{
"entropy": 2.005727228522301,
"epoch": 0.9599551553796027,
"grad_norm": 3.84375,
"learning_rate": 2.1165191740412983e-07,
"loss": 2.044818878173828,
"mean_token_accuracy": 0.5569542542099952,
"num_tokens": 40290671.0,
"step": 6850
},
{
"entropy": 1.9439302861690522,
"epoch": 0.9613565497670182,
"grad_norm": 3.34375,
"learning_rate": 2.0427728613569325e-07,
"loss": 2.042837905883789,
"mean_token_accuracy": 0.5579884998500347,
"num_tokens": 40348303.0,
"step": 6860
},
{
"entropy": 1.985863122344017,
"epoch": 0.9627579441544336,
"grad_norm": 3.953125,
"learning_rate": 1.9690265486725667e-07,
"loss": 2.0241420745849608,
"mean_token_accuracy": 0.5558819644153118,
"num_tokens": 40404033.0,
"step": 6870
},
{
"entropy": 2.0353716880083086,
"epoch": 0.9641593385418491,
"grad_norm": 3.5,
"learning_rate": 1.8952802359882009e-07,
"loss": 2.0784717559814454,
"mean_token_accuracy": 0.5437360376119613,
"num_tokens": 40462297.0,
"step": 6880
},
{
"entropy": 1.9631452977657318,
"epoch": 0.9655607329292646,
"grad_norm": 3.578125,
"learning_rate": 1.821533923303835e-07,
"loss": 1.9946128845214843,
"mean_token_accuracy": 0.5578184209764003,
"num_tokens": 40518672.0,
"step": 6890
},
{
"entropy": 1.974769440293312,
"epoch": 0.9669621273166801,
"grad_norm": 3.578125,
"learning_rate": 1.7477876106194692e-07,
"loss": 2.008790969848633,
"mean_token_accuracy": 0.5549022503197193,
"num_tokens": 40577347.0,
"step": 6900
},
{
"entropy": 2.0247413128614427,
"epoch": 0.9683635217040956,
"grad_norm": 3.84375,
"learning_rate": 1.6740412979351036e-07,
"loss": 2.0420900344848634,
"mean_token_accuracy": 0.550466337800026,
"num_tokens": 40634927.0,
"step": 6910
},
{
"entropy": 2.04134958088398,
"epoch": 0.969764916091511,
"grad_norm": 3.734375,
"learning_rate": 1.6002949852507378e-07,
"loss": 2.07739372253418,
"mean_token_accuracy": 0.5457551784813404,
"num_tokens": 40691846.0,
"step": 6920
},
{
"entropy": 1.9664236783981324,
"epoch": 0.9711663104789265,
"grad_norm": 3.96875,
"learning_rate": 1.5265486725663717e-07,
"loss": 2.0042022705078124,
"mean_token_accuracy": 0.5581375107169151,
"num_tokens": 40750168.0,
"step": 6930
},
{
"entropy": 2.0273396879434586,
"epoch": 0.972567704866342,
"grad_norm": 2.921875,
"learning_rate": 1.452802359882006e-07,
"loss": 2.0899295806884766,
"mean_token_accuracy": 0.5483457125723362,
"num_tokens": 40808730.0,
"step": 6940
},
{
"entropy": 2.02415617108345,
"epoch": 0.9739690992537575,
"grad_norm": 3.671875,
"learning_rate": 1.3790560471976403e-07,
"loss": 2.074420356750488,
"mean_token_accuracy": 0.5455530092120171,
"num_tokens": 40868156.0,
"step": 6950
},
{
"entropy": 2.0240610927343368,
"epoch": 0.975370493641173,
"grad_norm": 3.4375,
"learning_rate": 1.3053097345132745e-07,
"loss": 2.0607715606689454,
"mean_token_accuracy": 0.5471958234906197,
"num_tokens": 40923682.0,
"step": 6960
},
{
"entropy": 2.0293728321790696,
"epoch": 0.9767718880285885,
"grad_norm": 3.34375,
"learning_rate": 1.2315634218289087e-07,
"loss": 2.0637628555297853,
"mean_token_accuracy": 0.544766490906477,
"num_tokens": 40983981.0,
"step": 6970
},
{
"entropy": 2.071514305472374,
"epoch": 0.9781732824160039,
"grad_norm": 3.40625,
"learning_rate": 1.1578171091445429e-07,
"loss": 2.109389877319336,
"mean_token_accuracy": 0.5343147926032543,
"num_tokens": 41047569.0,
"step": 6980
},
{
"entropy": 2.0054246932268143,
"epoch": 0.9795746768034194,
"grad_norm": 3.390625,
"learning_rate": 1.084070796460177e-07,
"loss": 2.064986801147461,
"mean_token_accuracy": 0.5516049854457379,
"num_tokens": 41108322.0,
"step": 6990
},
{
"entropy": 2.007992023229599,
"epoch": 0.9809760711908349,
"grad_norm": 3.234375,
"learning_rate": 1.0103244837758113e-07,
"loss": 2.0503591537475585,
"mean_token_accuracy": 0.5488371036946773,
"num_tokens": 41166844.0,
"step": 7000
},
{
"entropy": 2.0042567580938337,
"epoch": 0.9823774655782503,
"grad_norm": 3.734375,
"learning_rate": 9.365781710914455e-08,
"loss": 2.061623382568359,
"mean_token_accuracy": 0.548622415214777,
"num_tokens": 41225177.0,
"step": 7010
},
{
"entropy": 1.92800931930542,
"epoch": 0.9837788599656658,
"grad_norm": 3.625,
"learning_rate": 8.628318584070797e-08,
"loss": 1.9699708938598632,
"mean_token_accuracy": 0.5659283697605133,
"num_tokens": 41279035.0,
"step": 7020
},
{
"entropy": 2.0187560588121416,
"epoch": 0.9851802543530813,
"grad_norm": 4.3125,
"learning_rate": 7.890855457227139e-08,
"loss": 2.0564207077026366,
"mean_token_accuracy": 0.5510451331734657,
"num_tokens": 41336172.0,
"step": 7030
},
{
"entropy": 2.0258085399866106,
"epoch": 0.9865816487404968,
"grad_norm": 4.34375,
"learning_rate": 7.153392330383482e-08,
"loss": 2.0803592681884764,
"mean_token_accuracy": 0.5455730646848679,
"num_tokens": 41393023.0,
"step": 7040
},
{
"entropy": 1.9908759355545045,
"epoch": 0.9879830431279123,
"grad_norm": 3.90625,
"learning_rate": 6.415929203539823e-08,
"loss": 2.038408088684082,
"mean_token_accuracy": 0.5520909205079079,
"num_tokens": 41450492.0,
"step": 7050
},
{
"entropy": 2.0316341012716292,
"epoch": 0.9893844375153278,
"grad_norm": 3.71875,
"learning_rate": 5.678466076696166e-08,
"loss": 2.0807302474975584,
"mean_token_accuracy": 0.5429827772080899,
"num_tokens": 41513079.0,
"step": 7060
},
{
"entropy": 1.9735469341278076,
"epoch": 0.9907858319027433,
"grad_norm": 3.5,
"learning_rate": 4.9410029498525076e-08,
"loss": 2.0276817321777343,
"mean_token_accuracy": 0.556085791438818,
"num_tokens": 41573403.0,
"step": 7070
},
{
"entropy": 2.0149279564619063,
"epoch": 0.9921872262901587,
"grad_norm": 3.578125,
"learning_rate": 4.20353982300885e-08,
"loss": 2.053173828125,
"mean_token_accuracy": 0.5515789903700352,
"num_tokens": 41632678.0,
"step": 7080
},
{
"entropy": 1.994994157552719,
"epoch": 0.9935886206775741,
"grad_norm": 3.78125,
"learning_rate": 3.466076696165192e-08,
"loss": 2.040749931335449,
"mean_token_accuracy": 0.5496800921857357,
"num_tokens": 41690157.0,
"step": 7090
},
{
"entropy": 1.9715099543333054,
"epoch": 0.9949900150649896,
"grad_norm": 4.0625,
"learning_rate": 2.728613569321534e-08,
"loss": 2.0029624938964843,
"mean_token_accuracy": 0.5555107049643994,
"num_tokens": 41746029.0,
"step": 7100
},
{
"entropy": 2.0422003865242004,
"epoch": 0.9963914094524051,
"grad_norm": 3.9375,
"learning_rate": 1.9911504424778762e-08,
"loss": 2.0568687438964846,
"mean_token_accuracy": 0.5468258865177631,
"num_tokens": 41803572.0,
"step": 7110
},
{
"entropy": 1.9422328054904938,
"epoch": 0.9977928038398206,
"grad_norm": 3.71875,
"learning_rate": 1.2536873156342184e-08,
"loss": 1.9889080047607421,
"mean_token_accuracy": 0.5637653365731239,
"num_tokens": 41856226.0,
"step": 7120
},
{
"entropy": 2.0215059161186217,
"epoch": 0.9991941982272361,
"grad_norm": 3.421875,
"learning_rate": 5.162241887905605e-09,
"loss": 2.051664924621582,
"mean_token_accuracy": 0.5480418384075165,
"num_tokens": 41915331.0,
"step": 7130
}
],
"logging_steps": 10,
"max_steps": 7136,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 5.15865159523498e+17,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}