Files
Qwen2.5-1.5B-SFT-Tulu3-deco…/trainer_state.json
ModelHub XC 1a4abee3c3 初始化项目,由ModelHub XC社区提供模型
Model: ali-elganzory/Qwen2.5-1.5B-SFT-Tulu3-decontaminated-masked
Source: Original Platform
2026-07-19 00:10:56 +08:00

14677 lines
410 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 2.0,
"eval_steps": 500,
"global_step": 14634,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 1.133203125,
"epoch": 0.0013667737306088978,
"grad_norm": 1.47973484738084,
"learning_rate": 1.0227272727272728e-07,
"loss": 0.9116,
"mean_token_accuracy": 0.7684988468885422,
"num_tokens": 894751.0,
"step": 10
},
{
"entropy": 1.1056640625,
"epoch": 0.0027335474612177955,
"grad_norm": 1.384856744390175,
"learning_rate": 2.1590909090909094e-07,
"loss": 0.8478,
"mean_token_accuracy": 0.7864527463912964,
"num_tokens": 1750308.0,
"step": 20
},
{
"entropy": 1.1029296875,
"epoch": 0.004100321191826693,
"grad_norm": 1.2918070552619323,
"learning_rate": 3.2954545454545455e-07,
"loss": 0.8772,
"mean_token_accuracy": 0.7778588503599166,
"num_tokens": 2644413.0,
"step": 30
},
{
"entropy": 1.1462890625,
"epoch": 0.005467094922435591,
"grad_norm": 1.3855098091309865,
"learning_rate": 4.431818181818182e-07,
"loss": 0.8964,
"mean_token_accuracy": 0.7757254868745804,
"num_tokens": 3517264.0,
"step": 40
},
{
"entropy": 1.0861328125,
"epoch": 0.006833868653044488,
"grad_norm": 0.9943341325775763,
"learning_rate": 5.568181818181818e-07,
"loss": 0.8391,
"mean_token_accuracy": 0.7831233769655228,
"num_tokens": 4410342.0,
"step": 50
},
{
"entropy": 1.1466796875,
"epoch": 0.008200642383653386,
"grad_norm": 0.9138535836869487,
"learning_rate": 6.704545454545456e-07,
"loss": 0.8548,
"mean_token_accuracy": 0.7803959935903549,
"num_tokens": 5335473.0,
"step": 60
},
{
"entropy": 1.198046875,
"epoch": 0.009567416114262284,
"grad_norm": 0.9462222109240385,
"learning_rate": 7.840909090909092e-07,
"loss": 0.879,
"mean_token_accuracy": 0.7767121315002441,
"num_tokens": 6259118.0,
"step": 70
},
{
"entropy": 1.21953125,
"epoch": 0.010934189844871182,
"grad_norm": 0.8946763546028623,
"learning_rate": 8.977272727272728e-07,
"loss": 0.918,
"mean_token_accuracy": 0.7694416373968125,
"num_tokens": 7173208.0,
"step": 80
},
{
"entropy": 1.147265625,
"epoch": 0.01230096357548008,
"grad_norm": 0.7272533467741081,
"learning_rate": 1.0113636363636365e-06,
"loss": 0.8217,
"mean_token_accuracy": 0.7842182248830796,
"num_tokens": 8004347.0,
"step": 90
},
{
"entropy": 1.11953125,
"epoch": 0.013667737306088976,
"grad_norm": 0.7393863504460576,
"learning_rate": 1.125e-06,
"loss": 0.8397,
"mean_token_accuracy": 0.7859926730394363,
"num_tokens": 8901160.0,
"step": 100
},
{
"entropy": 1.1099609375,
"epoch": 0.015034511036697874,
"grad_norm": 0.7430908639655994,
"learning_rate": 1.2386363636363638e-06,
"loss": 0.8015,
"mean_token_accuracy": 0.790648204088211,
"num_tokens": 9797773.0,
"step": 110
},
{
"entropy": 1.1158203125,
"epoch": 0.016401284767306772,
"grad_norm": 0.7846360223375193,
"learning_rate": 1.3522727272727273e-06,
"loss": 0.824,
"mean_token_accuracy": 0.7866247147321701,
"num_tokens": 10670680.0,
"step": 120
},
{
"entropy": 1.1041015625,
"epoch": 0.01776805849791567,
"grad_norm": 0.7329528277488314,
"learning_rate": 1.465909090909091e-06,
"loss": 0.8092,
"mean_token_accuracy": 0.7890402346849441,
"num_tokens": 11561633.0,
"step": 130
},
{
"entropy": 1.1150390625,
"epoch": 0.019134832228524568,
"grad_norm": 0.706993092066847,
"learning_rate": 1.5795454545454547e-06,
"loss": 0.7887,
"mean_token_accuracy": 0.7937764972448349,
"num_tokens": 12473967.0,
"step": 140
},
{
"entropy": 1.119921875,
"epoch": 0.020501605959133466,
"grad_norm": 0.7395193782300857,
"learning_rate": 1.6931818181818182e-06,
"loss": 0.8189,
"mean_token_accuracy": 0.7912224739789963,
"num_tokens": 13386639.0,
"step": 150
},
{
"entropy": 1.10546875,
"epoch": 0.021868379689742364,
"grad_norm": 0.7583417691328382,
"learning_rate": 1.8068181818181822e-06,
"loss": 0.8434,
"mean_token_accuracy": 0.7822531402111054,
"num_tokens": 14284815.0,
"step": 160
},
{
"entropy": 1.1140625,
"epoch": 0.023235153420351262,
"grad_norm": 0.7548825097145285,
"learning_rate": 1.9204545454545457e-06,
"loss": 0.8198,
"mean_token_accuracy": 0.7881694793701172,
"num_tokens": 15109817.0,
"step": 170
},
{
"entropy": 1.0630859375,
"epoch": 0.02460192715096016,
"grad_norm": 0.7146710295095036,
"learning_rate": 2.034090909090909e-06,
"loss": 0.7985,
"mean_token_accuracy": 0.7921379566192627,
"num_tokens": 15983614.0,
"step": 180
},
{
"entropy": 1.094140625,
"epoch": 0.025968700881569055,
"grad_norm": 0.6891660032195893,
"learning_rate": 2.147727272727273e-06,
"loss": 0.8406,
"mean_token_accuracy": 0.7826101392507553,
"num_tokens": 16896096.0,
"step": 190
},
{
"entropy": 1.119921875,
"epoch": 0.027335474612177953,
"grad_norm": 0.7079249140305466,
"learning_rate": 2.2613636363636366e-06,
"loss": 0.8386,
"mean_token_accuracy": 0.7861522406339645,
"num_tokens": 17736266.0,
"step": 200
},
{
"entropy": 1.1025390625,
"epoch": 0.02870224834278685,
"grad_norm": 0.7421999850405911,
"learning_rate": 2.375e-06,
"loss": 0.8201,
"mean_token_accuracy": 0.7850783497095108,
"num_tokens": 18638867.0,
"step": 210
},
{
"entropy": 1.1244140625,
"epoch": 0.03006902207339575,
"grad_norm": 0.7813917158837166,
"learning_rate": 2.488636363636364e-06,
"loss": 0.8156,
"mean_token_accuracy": 0.7882750242948532,
"num_tokens": 19534482.0,
"step": 220
},
{
"entropy": 1.0501953125,
"epoch": 0.03143579580400465,
"grad_norm": 0.7145059386941122,
"learning_rate": 2.6022727272727276e-06,
"loss": 0.7587,
"mean_token_accuracy": 0.7987982839345932,
"num_tokens": 20445734.0,
"step": 230
},
{
"entropy": 1.0849609375,
"epoch": 0.032802569534613545,
"grad_norm": 0.7365589728206592,
"learning_rate": 2.715909090909091e-06,
"loss": 0.7983,
"mean_token_accuracy": 0.7906692862510681,
"num_tokens": 21340398.0,
"step": 240
},
{
"entropy": 1.0732421875,
"epoch": 0.03416934326522244,
"grad_norm": 0.7196746763132376,
"learning_rate": 2.829545454545455e-06,
"loss": 0.7871,
"mean_token_accuracy": 0.7958200126886368,
"num_tokens": 22231277.0,
"step": 250
},
{
"entropy": 1.0375,
"epoch": 0.03553611699583134,
"grad_norm": 0.6292946786065218,
"learning_rate": 2.9431818181818185e-06,
"loss": 0.7576,
"mean_token_accuracy": 0.8025897562503814,
"num_tokens": 23128440.0,
"step": 260
},
{
"entropy": 1.0494140625,
"epoch": 0.036902890726440235,
"grad_norm": 0.5976709531713745,
"learning_rate": 3.056818181818182e-06,
"loss": 0.7523,
"mean_token_accuracy": 0.8013501852750778,
"num_tokens": 24023611.0,
"step": 270
},
{
"entropy": 1.041015625,
"epoch": 0.038269664457049136,
"grad_norm": 0.6544548026636576,
"learning_rate": 3.1704545454545456e-06,
"loss": 0.7838,
"mean_token_accuracy": 0.7961118400096894,
"num_tokens": 24931447.0,
"step": 280
},
{
"entropy": 1.076953125,
"epoch": 0.03963643818765803,
"grad_norm": 0.7214111369421188,
"learning_rate": 3.2840909090909095e-06,
"loss": 0.8037,
"mean_token_accuracy": 0.790821048617363,
"num_tokens": 25822637.0,
"step": 290
},
{
"entropy": 1.05546875,
"epoch": 0.04100321191826693,
"grad_norm": 0.7034705581227888,
"learning_rate": 3.397727272727273e-06,
"loss": 0.7889,
"mean_token_accuracy": 0.791827729344368,
"num_tokens": 26705243.0,
"step": 300
},
{
"entropy": 1.0822265625,
"epoch": 0.04236998564887583,
"grad_norm": 0.7505998438309659,
"learning_rate": 3.5113636363636365e-06,
"loss": 0.8121,
"mean_token_accuracy": 0.791116139292717,
"num_tokens": 27620336.0,
"step": 310
},
{
"entropy": 1.0779296875,
"epoch": 0.04373675937948473,
"grad_norm": 0.6818744821830525,
"learning_rate": 3.625e-06,
"loss": 0.7887,
"mean_token_accuracy": 0.7914052873849868,
"num_tokens": 28487030.0,
"step": 320
},
{
"entropy": 1.131640625,
"epoch": 0.04510353311009362,
"grad_norm": 0.7149746749931768,
"learning_rate": 3.7386363636363635e-06,
"loss": 0.857,
"mean_token_accuracy": 0.7833189278841018,
"num_tokens": 29362700.0,
"step": 330
},
{
"entropy": 1.036328125,
"epoch": 0.046470306840702524,
"grad_norm": 0.7416737913642195,
"learning_rate": 3.852272727272728e-06,
"loss": 0.7582,
"mean_token_accuracy": 0.8007463544607163,
"num_tokens": 30216448.0,
"step": 340
},
{
"entropy": 1.02890625,
"epoch": 0.04783708057131142,
"grad_norm": 0.7020157476237329,
"learning_rate": 3.965909090909091e-06,
"loss": 0.742,
"mean_token_accuracy": 0.8046863466501236,
"num_tokens": 31124761.0,
"step": 350
},
{
"entropy": 1.093359375,
"epoch": 0.04920385430192032,
"grad_norm": 0.6280383149394886,
"learning_rate": 4.079545454545455e-06,
"loss": 0.8222,
"mean_token_accuracy": 0.7872264623641968,
"num_tokens": 32021822.0,
"step": 360
},
{
"entropy": 1.0974609375,
"epoch": 0.050570628032529215,
"grad_norm": 0.7380877978268416,
"learning_rate": 4.193181818181819e-06,
"loss": 0.7975,
"mean_token_accuracy": 0.7915991097688675,
"num_tokens": 32911869.0,
"step": 370
},
{
"entropy": 1.0947265625,
"epoch": 0.05193740176313811,
"grad_norm": 0.7414654865931276,
"learning_rate": 4.306818181818182e-06,
"loss": 0.8243,
"mean_token_accuracy": 0.7880736440420151,
"num_tokens": 33780250.0,
"step": 380
},
{
"entropy": 1.0501953125,
"epoch": 0.05330417549374701,
"grad_norm": 0.6414608090841433,
"learning_rate": 4.420454545454546e-06,
"loss": 0.7743,
"mean_token_accuracy": 0.7961185693740844,
"num_tokens": 34694542.0,
"step": 390
},
{
"entropy": 1.0455078125,
"epoch": 0.054670949224355905,
"grad_norm": 0.6342322950297787,
"learning_rate": 4.53409090909091e-06,
"loss": 0.7577,
"mean_token_accuracy": 0.8010485202074051,
"num_tokens": 35546961.0,
"step": 400
},
{
"entropy": 1.1216796875,
"epoch": 0.05603772295496481,
"grad_norm": 0.766358664424253,
"learning_rate": 4.647727272727273e-06,
"loss": 0.8103,
"mean_token_accuracy": 0.7868758946657181,
"num_tokens": 36410375.0,
"step": 410
},
{
"entropy": 1.0482421875,
"epoch": 0.0574044966855737,
"grad_norm": 0.7322470913003186,
"learning_rate": 4.761363636363637e-06,
"loss": 0.7757,
"mean_token_accuracy": 0.7972762882709503,
"num_tokens": 37311509.0,
"step": 420
},
{
"entropy": 1.0392578125,
"epoch": 0.0587712704161826,
"grad_norm": 0.7000698722357811,
"learning_rate": 4.875e-06,
"loss": 0.7411,
"mean_token_accuracy": 0.8046496480703353,
"num_tokens": 38219048.0,
"step": 430
},
{
"entropy": 1.08046875,
"epoch": 0.0601380441467915,
"grad_norm": 0.6373664103609694,
"learning_rate": 4.988636363636364e-06,
"loss": 0.8412,
"mean_token_accuracy": 0.7826752036809921,
"num_tokens": 39127651.0,
"step": 440
},
{
"entropy": 1.0880859375,
"epoch": 0.0615048178774004,
"grad_norm": 0.6895753121612086,
"learning_rate": 4.996829646329435e-06,
"loss": 0.8168,
"mean_token_accuracy": 0.7855626612901687,
"num_tokens": 40015164.0,
"step": 450
},
{
"entropy": 1.1203125,
"epoch": 0.0628715916080093,
"grad_norm": 0.6892380300036761,
"learning_rate": 4.993307031139919e-06,
"loss": 0.8492,
"mean_token_accuracy": 0.7822004556655884,
"num_tokens": 40925068.0,
"step": 460
},
{
"entropy": 1.0947265625,
"epoch": 0.0642383653386182,
"grad_norm": 0.6596672876616283,
"learning_rate": 4.989784415950402e-06,
"loss": 0.8475,
"mean_token_accuracy": 0.7822087347507477,
"num_tokens": 41825875.0,
"step": 470
},
{
"entropy": 1.129296875,
"epoch": 0.06560513906922709,
"grad_norm": 0.7481960981808156,
"learning_rate": 4.986261800760885e-06,
"loss": 0.8445,
"mean_token_accuracy": 0.780723512172699,
"num_tokens": 42703080.0,
"step": 480
},
{
"entropy": 1.07265625,
"epoch": 0.06697191279983598,
"grad_norm": 0.6982029734905336,
"learning_rate": 4.9827391855713685e-06,
"loss": 0.8058,
"mean_token_accuracy": 0.7927624523639679,
"num_tokens": 43616920.0,
"step": 490
},
{
"entropy": 1.0748046875,
"epoch": 0.06833868653044488,
"grad_norm": 0.765655438941745,
"learning_rate": 4.979216570381852e-06,
"loss": 0.7615,
"mean_token_accuracy": 0.7971159189939498,
"num_tokens": 44506039.0,
"step": 500
},
{
"entropy": 1.080859375,
"epoch": 0.06970546026105379,
"grad_norm": 0.6938540877354535,
"learning_rate": 4.975693955192335e-06,
"loss": 0.8085,
"mean_token_accuracy": 0.7873266220092774,
"num_tokens": 45382350.0,
"step": 510
},
{
"entropy": 1.1015625,
"epoch": 0.07107223399166268,
"grad_norm": 0.7749255180737751,
"learning_rate": 4.972171340002819e-06,
"loss": 0.8129,
"mean_token_accuracy": 0.7902452021837234,
"num_tokens": 46304368.0,
"step": 520
},
{
"entropy": 1.1015625,
"epoch": 0.07243900772227158,
"grad_norm": 0.6987790117642767,
"learning_rate": 4.968648724813302e-06,
"loss": 0.8002,
"mean_token_accuracy": 0.790622878074646,
"num_tokens": 47189558.0,
"step": 530
},
{
"entropy": 1.0736328125,
"epoch": 0.07380578145288047,
"grad_norm": 0.7249936955895514,
"learning_rate": 4.965126109623785e-06,
"loss": 0.8075,
"mean_token_accuracy": 0.7903886288404465,
"num_tokens": 48062199.0,
"step": 540
},
{
"entropy": 1.1001953125,
"epoch": 0.07517255518348938,
"grad_norm": 0.7077474930628763,
"learning_rate": 4.961603494434268e-06,
"loss": 0.8453,
"mean_token_accuracy": 0.7838813126087188,
"num_tokens": 48939443.0,
"step": 550
},
{
"entropy": 1.0498046875,
"epoch": 0.07653932891409827,
"grad_norm": 0.7234177900454702,
"learning_rate": 4.958080879244752e-06,
"loss": 0.7527,
"mean_token_accuracy": 0.8002402514219285,
"num_tokens": 49849066.0,
"step": 560
},
{
"entropy": 1.0650390625,
"epoch": 0.07790610264470717,
"grad_norm": 0.7409309720869139,
"learning_rate": 4.954558264055234e-06,
"loss": 0.792,
"mean_token_accuracy": 0.7912765085697174,
"num_tokens": 50698168.0,
"step": 570
},
{
"entropy": 1.03828125,
"epoch": 0.07927287637531606,
"grad_norm": 0.8177829263664329,
"learning_rate": 4.951035648865719e-06,
"loss": 0.7792,
"mean_token_accuracy": 0.7948757350444794,
"num_tokens": 51559112.0,
"step": 580
},
{
"entropy": 1.0583984375,
"epoch": 0.08063965010592497,
"grad_norm": 0.7167262720393076,
"learning_rate": 4.9475130336762015e-06,
"loss": 0.7724,
"mean_token_accuracy": 0.7948375970125199,
"num_tokens": 52433072.0,
"step": 590
},
{
"entropy": 1.100390625,
"epoch": 0.08200642383653386,
"grad_norm": 0.7510644855662679,
"learning_rate": 4.943990418486685e-06,
"loss": 0.8146,
"mean_token_accuracy": 0.7879427194595336,
"num_tokens": 53357598.0,
"step": 600
},
{
"entropy": 1.0828125,
"epoch": 0.08337319756714276,
"grad_norm": 0.7266319195598163,
"learning_rate": 4.9404678032971685e-06,
"loss": 0.8125,
"mean_token_accuracy": 0.7918030083179474,
"num_tokens": 54234701.0,
"step": 610
},
{
"entropy": 1.06328125,
"epoch": 0.08473997129775165,
"grad_norm": 0.6778718137962241,
"learning_rate": 4.936945188107651e-06,
"loss": 0.8034,
"mean_token_accuracy": 0.7915593594312668,
"num_tokens": 55143442.0,
"step": 620
},
{
"entropy": 1.0177734375,
"epoch": 0.08610674502836055,
"grad_norm": 0.741973654946305,
"learning_rate": 4.933422572918135e-06,
"loss": 0.7498,
"mean_token_accuracy": 0.8041094154119491,
"num_tokens": 56014638.0,
"step": 630
},
{
"entropy": 1.060546875,
"epoch": 0.08747351875896946,
"grad_norm": 0.6582575156145145,
"learning_rate": 4.929899957728618e-06,
"loss": 0.7786,
"mean_token_accuracy": 0.79781294465065,
"num_tokens": 56919559.0,
"step": 640
},
{
"entropy": 1.0798828125,
"epoch": 0.08884029248957835,
"grad_norm": 0.7958120801183867,
"learning_rate": 4.926377342539102e-06,
"loss": 0.773,
"mean_token_accuracy": 0.7964990586042404,
"num_tokens": 57796634.0,
"step": 650
},
{
"entropy": 1.061328125,
"epoch": 0.09020706622018725,
"grad_norm": 0.7505997355364749,
"learning_rate": 4.922854727349585e-06,
"loss": 0.7724,
"mean_token_accuracy": 0.7953317701816559,
"num_tokens": 58681705.0,
"step": 660
},
{
"entropy": 1.0689453125,
"epoch": 0.09157383995079614,
"grad_norm": 0.6259812656383161,
"learning_rate": 4.919332112160068e-06,
"loss": 0.7898,
"mean_token_accuracy": 0.7914301097393036,
"num_tokens": 59598109.0,
"step": 670
},
{
"entropy": 1.079296875,
"epoch": 0.09294061368140505,
"grad_norm": 0.6361875861190548,
"learning_rate": 4.915809496970551e-06,
"loss": 0.7856,
"mean_token_accuracy": 0.7936086148023606,
"num_tokens": 60505590.0,
"step": 680
},
{
"entropy": 1.1392578125,
"epoch": 0.09430738741201394,
"grad_norm": 0.695139133243635,
"learning_rate": 4.912286881781035e-06,
"loss": 0.8942,
"mean_token_accuracy": 0.7715353786945343,
"num_tokens": 61382600.0,
"step": 690
},
{
"entropy": 1.060546875,
"epoch": 0.09567416114262284,
"grad_norm": 0.7300157219628535,
"learning_rate": 4.908764266591518e-06,
"loss": 0.7548,
"mean_token_accuracy": 0.800546082854271,
"num_tokens": 62258121.0,
"step": 700
},
{
"entropy": 1.0701171875,
"epoch": 0.09704093487323173,
"grad_norm": 0.7193069546598314,
"learning_rate": 4.9052416514020015e-06,
"loss": 0.7625,
"mean_token_accuracy": 0.799806535243988,
"num_tokens": 63128686.0,
"step": 710
},
{
"entropy": 1.033203125,
"epoch": 0.09840770860384064,
"grad_norm": 0.7050272607436721,
"learning_rate": 4.901719036212484e-06,
"loss": 0.7631,
"mean_token_accuracy": 0.7967694252729416,
"num_tokens": 64056881.0,
"step": 720
},
{
"entropy": 1.044921875,
"epoch": 0.09977448233444954,
"grad_norm": 0.7023295914401517,
"learning_rate": 4.898196421022968e-06,
"loss": 0.7599,
"mean_token_accuracy": 0.7989740341901779,
"num_tokens": 64941116.0,
"step": 730
},
{
"entropy": 1.05546875,
"epoch": 0.10114125606505843,
"grad_norm": 0.7874022152337663,
"learning_rate": 4.894673805833451e-06,
"loss": 0.7242,
"mean_token_accuracy": 0.8062683254480362,
"num_tokens": 65760286.0,
"step": 740
},
{
"entropy": 1.078515625,
"epoch": 0.10250802979566732,
"grad_norm": 0.7348272168668813,
"learning_rate": 4.891151190643935e-06,
"loss": 0.7983,
"mean_token_accuracy": 0.7927596867084503,
"num_tokens": 66641601.0,
"step": 750
},
{
"entropy": 1.0716796875,
"epoch": 0.10387480352627622,
"grad_norm": 0.6813749448606529,
"learning_rate": 4.8876285754544175e-06,
"loss": 0.7845,
"mean_token_accuracy": 0.7935169667005539,
"num_tokens": 67556757.0,
"step": 760
},
{
"entropy": 1.1080078125,
"epoch": 0.10524157725688513,
"grad_norm": 0.7945027355166359,
"learning_rate": 4.884105960264901e-06,
"loss": 0.8303,
"mean_token_accuracy": 0.787259241938591,
"num_tokens": 68415204.0,
"step": 770
},
{
"entropy": 1.052734375,
"epoch": 0.10660835098749402,
"grad_norm": 0.6478926949670087,
"learning_rate": 4.880583345075385e-06,
"loss": 0.7755,
"mean_token_accuracy": 0.7963724493980407,
"num_tokens": 69305673.0,
"step": 780
},
{
"entropy": 1.0576171875,
"epoch": 0.10797512471810292,
"grad_norm": 0.6209353927462372,
"learning_rate": 4.877060729885867e-06,
"loss": 0.736,
"mean_token_accuracy": 0.8046882033348084,
"num_tokens": 70187437.0,
"step": 790
},
{
"entropy": 1.0568359375,
"epoch": 0.10934189844871181,
"grad_norm": 0.737864929890338,
"learning_rate": 4.873538114696351e-06,
"loss": 0.7633,
"mean_token_accuracy": 0.7971789062023162,
"num_tokens": 71066843.0,
"step": 800
},
{
"entropy": 1.0701171875,
"epoch": 0.11070867217932072,
"grad_norm": 0.7153751409877042,
"learning_rate": 4.870015499506834e-06,
"loss": 0.748,
"mean_token_accuracy": 0.8034778296947479,
"num_tokens": 71952220.0,
"step": 810
},
{
"entropy": 1.0439453125,
"epoch": 0.11207544590992961,
"grad_norm": 0.6440033094017737,
"learning_rate": 4.866492884317318e-06,
"loss": 0.7673,
"mean_token_accuracy": 0.7952882468700408,
"num_tokens": 72848678.0,
"step": 820
},
{
"entropy": 1.041015625,
"epoch": 0.11344221964053851,
"grad_norm": 0.7196922644224383,
"learning_rate": 4.862970269127801e-06,
"loss": 0.7572,
"mean_token_accuracy": 0.8026833266019822,
"num_tokens": 73722522.0,
"step": 830
},
{
"entropy": 1.1015625,
"epoch": 0.1148089933711474,
"grad_norm": 0.699945750524333,
"learning_rate": 4.859447653938284e-06,
"loss": 0.7997,
"mean_token_accuracy": 0.7907466411590576,
"num_tokens": 74585045.0,
"step": 840
},
{
"entropy": 1.0693359375,
"epoch": 0.11617576710175631,
"grad_norm": 0.6137476023495325,
"learning_rate": 4.855925038748768e-06,
"loss": 0.8452,
"mean_token_accuracy": 0.7836443752050399,
"num_tokens": 75542861.0,
"step": 850
},
{
"entropy": 1.0662109375,
"epoch": 0.1175425408323652,
"grad_norm": 0.7202056700056474,
"learning_rate": 4.852402423559251e-06,
"loss": 0.7802,
"mean_token_accuracy": 0.7957876712083817,
"num_tokens": 76472020.0,
"step": 860
},
{
"entropy": 1.1005859375,
"epoch": 0.1189093145629741,
"grad_norm": 0.6704940070299359,
"learning_rate": 4.848879808369734e-06,
"loss": 0.838,
"mean_token_accuracy": 0.7834624230861664,
"num_tokens": 77350339.0,
"step": 870
},
{
"entropy": 1.054296875,
"epoch": 0.120276088293583,
"grad_norm": 0.6584064104553583,
"learning_rate": 4.8453571931802175e-06,
"loss": 0.7317,
"mean_token_accuracy": 0.8052870601415634,
"num_tokens": 78257082.0,
"step": 880
},
{
"entropy": 1.0173828125,
"epoch": 0.12164286202419189,
"grad_norm": 0.6452979599358951,
"learning_rate": 4.8418345779907e-06,
"loss": 0.7958,
"mean_token_accuracy": 0.7915296941995621,
"num_tokens": 79122216.0,
"step": 890
},
{
"entropy": 1.0953125,
"epoch": 0.1230096357548008,
"grad_norm": 0.7011172624006757,
"learning_rate": 4.838311962801184e-06,
"loss": 0.8038,
"mean_token_accuracy": 0.7899881958961487,
"num_tokens": 80032714.0,
"step": 900
},
{
"entropy": 1.075390625,
"epoch": 0.12437640948540969,
"grad_norm": 0.7647967875142279,
"learning_rate": 4.834789347611667e-06,
"loss": 0.7972,
"mean_token_accuracy": 0.7917695701122284,
"num_tokens": 80873820.0,
"step": 910
},
{
"entropy": 1.0970703125,
"epoch": 0.1257431832160186,
"grad_norm": 0.7466339732803586,
"learning_rate": 4.831266732422151e-06,
"loss": 0.7985,
"mean_token_accuracy": 0.7923195451498032,
"num_tokens": 81719615.0,
"step": 920
},
{
"entropy": 1.0296875,
"epoch": 0.1271099569466275,
"grad_norm": 0.7342698567718549,
"learning_rate": 4.827744117232634e-06,
"loss": 0.7145,
"mean_token_accuracy": 0.8082198828458786,
"num_tokens": 82585299.0,
"step": 930
},
{
"entropy": 1.053515625,
"epoch": 0.1284767306772364,
"grad_norm": 0.7343553115378018,
"learning_rate": 4.824221502043117e-06,
"loss": 0.7267,
"mean_token_accuracy": 0.8057208031415939,
"num_tokens": 83450499.0,
"step": 940
},
{
"entropy": 1.0884765625,
"epoch": 0.12984350440784528,
"grad_norm": 0.6533864100983254,
"learning_rate": 4.820698886853601e-06,
"loss": 0.8107,
"mean_token_accuracy": 0.7871950447559357,
"num_tokens": 84384201.0,
"step": 950
},
{
"entropy": 1.0986328125,
"epoch": 0.13121027813845418,
"grad_norm": 0.677923971916316,
"learning_rate": 4.817176271664084e-06,
"loss": 0.7945,
"mean_token_accuracy": 0.7921182036399841,
"num_tokens": 85282609.0,
"step": 960
},
{
"entropy": 1.0345703125,
"epoch": 0.13257705186906307,
"grad_norm": 0.6898455584685086,
"learning_rate": 4.813653656474567e-06,
"loss": 0.7434,
"mean_token_accuracy": 0.8028993427753448,
"num_tokens": 86130389.0,
"step": 970
},
{
"entropy": 1.091015625,
"epoch": 0.13394382559967197,
"grad_norm": 0.7702318237112387,
"learning_rate": 4.8101310412850505e-06,
"loss": 0.7829,
"mean_token_accuracy": 0.7937292158603668,
"num_tokens": 87013196.0,
"step": 980
},
{
"entropy": 1.0681640625,
"epoch": 0.13531059933028086,
"grad_norm": 0.664294501813368,
"learning_rate": 4.806608426095534e-06,
"loss": 0.7673,
"mean_token_accuracy": 0.7985179603099823,
"num_tokens": 87940418.0,
"step": 990
},
{
"entropy": 1.04140625,
"epoch": 0.13667737306088976,
"grad_norm": 0.632741399012812,
"learning_rate": 4.803085810906017e-06,
"loss": 0.7559,
"mean_token_accuracy": 0.7985207498073578,
"num_tokens": 88835060.0,
"step": 1000
},
{
"entropy": 1.0931640625,
"epoch": 0.13804414679149868,
"grad_norm": 0.6583646468195264,
"learning_rate": 4.7995631957165e-06,
"loss": 0.805,
"mean_token_accuracy": 0.7882505506277084,
"num_tokens": 89750236.0,
"step": 1010
},
{
"entropy": 1.01484375,
"epoch": 0.13941092052210757,
"grad_norm": 0.7135802101628062,
"learning_rate": 4.796040580526984e-06,
"loss": 0.7251,
"mean_token_accuracy": 0.8069510519504547,
"num_tokens": 90644061.0,
"step": 1020
},
{
"entropy": 1.04140625,
"epoch": 0.14077769425271647,
"grad_norm": 0.7725682680385748,
"learning_rate": 4.792517965337467e-06,
"loss": 0.7622,
"mean_token_accuracy": 0.7994030177593231,
"num_tokens": 91490004.0,
"step": 1030
},
{
"entropy": 1.0294921875,
"epoch": 0.14214446798332536,
"grad_norm": 0.721858015206174,
"learning_rate": 4.78899535014795e-06,
"loss": 0.7236,
"mean_token_accuracy": 0.8076615869998932,
"num_tokens": 92377049.0,
"step": 1040
},
{
"entropy": 1.0462890625,
"epoch": 0.14351124171393426,
"grad_norm": 0.6564766043009002,
"learning_rate": 4.785472734958434e-06,
"loss": 0.7459,
"mean_token_accuracy": 0.8028117269277573,
"num_tokens": 93288203.0,
"step": 1050
},
{
"entropy": 1.0599609375,
"epoch": 0.14487801544454315,
"grad_norm": 0.6584624367846469,
"learning_rate": 4.781950119768916e-06,
"loss": 0.7504,
"mean_token_accuracy": 0.801429596543312,
"num_tokens": 94185325.0,
"step": 1060
},
{
"entropy": 1.0162109375,
"epoch": 0.14624478917515205,
"grad_norm": 0.6144698055220686,
"learning_rate": 4.778427504579401e-06,
"loss": 0.7213,
"mean_token_accuracy": 0.8058042377233505,
"num_tokens": 95085041.0,
"step": 1070
},
{
"entropy": 1.046875,
"epoch": 0.14761156290576094,
"grad_norm": 0.5911671313436281,
"learning_rate": 4.774904889389883e-06,
"loss": 0.7546,
"mean_token_accuracy": 0.8005396604537964,
"num_tokens": 96001882.0,
"step": 1080
},
{
"entropy": 1.0619140625,
"epoch": 0.14897833663636986,
"grad_norm": 0.7565225171433632,
"learning_rate": 4.771382274200367e-06,
"loss": 0.7777,
"mean_token_accuracy": 0.7950086772441864,
"num_tokens": 96888127.0,
"step": 1090
},
{
"entropy": 1.092578125,
"epoch": 0.15034511036697876,
"grad_norm": 0.6603069667616472,
"learning_rate": 4.76785965901085e-06,
"loss": 0.8278,
"mean_token_accuracy": 0.7858486205339432,
"num_tokens": 97815019.0,
"step": 1100
},
{
"entropy": 1.1109375,
"epoch": 0.15171188409758765,
"grad_norm": 0.700529125019329,
"learning_rate": 4.764337043821333e-06,
"loss": 0.8461,
"mean_token_accuracy": 0.7812117666006089,
"num_tokens": 98683384.0,
"step": 1110
},
{
"entropy": 1.0798828125,
"epoch": 0.15307865782819655,
"grad_norm": 0.6951347002126556,
"learning_rate": 4.760814428631817e-06,
"loss": 0.7856,
"mean_token_accuracy": 0.793980848789215,
"num_tokens": 99564393.0,
"step": 1120
},
{
"entropy": 1.056640625,
"epoch": 0.15444543155880544,
"grad_norm": 0.695728807439555,
"learning_rate": 4.7572918134423e-06,
"loss": 0.782,
"mean_token_accuracy": 0.7932403028011322,
"num_tokens": 100408247.0,
"step": 1130
},
{
"entropy": 1.041796875,
"epoch": 0.15581220528941434,
"grad_norm": 0.6755100221270268,
"learning_rate": 4.753769198252783e-06,
"loss": 0.7408,
"mean_token_accuracy": 0.8028921276330948,
"num_tokens": 101297373.0,
"step": 1140
},
{
"entropy": 1.1048828125,
"epoch": 0.15717897902002323,
"grad_norm": 0.7261127831115767,
"learning_rate": 4.7502465830632665e-06,
"loss": 0.7904,
"mean_token_accuracy": 0.7924922615289688,
"num_tokens": 102230124.0,
"step": 1150
},
{
"entropy": 1.01328125,
"epoch": 0.15854575275063212,
"grad_norm": 0.6485131557546501,
"learning_rate": 4.74672396787375e-06,
"loss": 0.742,
"mean_token_accuracy": 0.8031442880630493,
"num_tokens": 103126908.0,
"step": 1160
},
{
"entropy": 1.039453125,
"epoch": 0.15991252648124102,
"grad_norm": 0.5796653078174231,
"learning_rate": 4.743201352684233e-06,
"loss": 0.751,
"mean_token_accuracy": 0.8013398766517639,
"num_tokens": 104024292.0,
"step": 1170
},
{
"entropy": 1.064453125,
"epoch": 0.16127930021184994,
"grad_norm": 0.7479705359372628,
"learning_rate": 4.739678737494716e-06,
"loss": 0.7681,
"mean_token_accuracy": 0.7991553485393524,
"num_tokens": 104898403.0,
"step": 1180
},
{
"entropy": 1.0611328125,
"epoch": 0.16264607394245884,
"grad_norm": 0.6745624836527098,
"learning_rate": 4.7361561223052e-06,
"loss": 0.7756,
"mean_token_accuracy": 0.7950525432825089,
"num_tokens": 105782333.0,
"step": 1190
},
{
"entropy": 1.051171875,
"epoch": 0.16401284767306773,
"grad_norm": 0.7369056847067365,
"learning_rate": 4.7326335071156834e-06,
"loss": 0.763,
"mean_token_accuracy": 0.7998309344053268,
"num_tokens": 106647573.0,
"step": 1200
},
{
"entropy": 1.0615234375,
"epoch": 0.16537962140367662,
"grad_norm": 0.6808556690336846,
"learning_rate": 4.729110891926166e-06,
"loss": 0.7889,
"mean_token_accuracy": 0.7915427654981613,
"num_tokens": 107566523.0,
"step": 1210
},
{
"entropy": 1.02890625,
"epoch": 0.16674639513428552,
"grad_norm": 0.7827948179676623,
"learning_rate": 4.72558827673665e-06,
"loss": 0.7612,
"mean_token_accuracy": 0.7991937607526779,
"num_tokens": 108414707.0,
"step": 1220
},
{
"entropy": 1.057421875,
"epoch": 0.1681131688648944,
"grad_norm": 0.6615964907611764,
"learning_rate": 4.722065661547132e-06,
"loss": 0.7888,
"mean_token_accuracy": 0.7935863256454467,
"num_tokens": 109308818.0,
"step": 1230
},
{
"entropy": 1.063671875,
"epoch": 0.1694799425955033,
"grad_norm": 0.7688502810783613,
"learning_rate": 4.718543046357617e-06,
"loss": 0.8042,
"mean_token_accuracy": 0.791393518447876,
"num_tokens": 110236510.0,
"step": 1240
},
{
"entropy": 1.0283203125,
"epoch": 0.1708467163261122,
"grad_norm": 0.7561291773952402,
"learning_rate": 4.7150204311680995e-06,
"loss": 0.7507,
"mean_token_accuracy": 0.8016122728586197,
"num_tokens": 111071984.0,
"step": 1250
},
{
"entropy": 1.0904296875,
"epoch": 0.1722134900567211,
"grad_norm": 0.7694492859719241,
"learning_rate": 4.711497815978583e-06,
"loss": 0.7782,
"mean_token_accuracy": 0.7938218623399734,
"num_tokens": 111952526.0,
"step": 1260
},
{
"entropy": 1.074609375,
"epoch": 0.17358026378733002,
"grad_norm": 0.6354068020404235,
"learning_rate": 4.707975200789066e-06,
"loss": 0.7971,
"mean_token_accuracy": 0.7897824734449387,
"num_tokens": 112881665.0,
"step": 1270
},
{
"entropy": 1.0755859375,
"epoch": 0.1749470375179389,
"grad_norm": 0.7548545184801578,
"learning_rate": 4.704452585599549e-06,
"loss": 0.7991,
"mean_token_accuracy": 0.7910603046417236,
"num_tokens": 113764242.0,
"step": 1280
},
{
"entropy": 1.05234375,
"epoch": 0.1763138112485478,
"grad_norm": 0.6469891034446872,
"learning_rate": 4.700929970410033e-06,
"loss": 0.7559,
"mean_token_accuracy": 0.7989594906568527,
"num_tokens": 114647527.0,
"step": 1290
},
{
"entropy": 1.065234375,
"epoch": 0.1776805849791567,
"grad_norm": 0.66796746961558,
"learning_rate": 4.697407355220516e-06,
"loss": 0.7746,
"mean_token_accuracy": 0.7962296068668365,
"num_tokens": 115562594.0,
"step": 1300
},
{
"entropy": 1.066796875,
"epoch": 0.1790473587097656,
"grad_norm": 0.7062807769160125,
"learning_rate": 4.693884740030999e-06,
"loss": 0.7531,
"mean_token_accuracy": 0.796441051363945,
"num_tokens": 116394915.0,
"step": 1310
},
{
"entropy": 1.0845703125,
"epoch": 0.1804141324403745,
"grad_norm": 0.6613822646649558,
"learning_rate": 4.690362124841483e-06,
"loss": 0.8112,
"mean_token_accuracy": 0.7872121959924698,
"num_tokens": 117275706.0,
"step": 1320
},
{
"entropy": 1.082421875,
"epoch": 0.1817809061709834,
"grad_norm": 0.6498119047130987,
"learning_rate": 4.686839509651966e-06,
"loss": 0.7569,
"mean_token_accuracy": 0.8003128319978714,
"num_tokens": 118163200.0,
"step": 1330
},
{
"entropy": 1.0576171875,
"epoch": 0.18314767990159228,
"grad_norm": 0.6868418750537435,
"learning_rate": 4.683316894462449e-06,
"loss": 0.772,
"mean_token_accuracy": 0.795640516281128,
"num_tokens": 119069034.0,
"step": 1340
},
{
"entropy": 1.037890625,
"epoch": 0.18451445363220118,
"grad_norm": 0.7258054820530007,
"learning_rate": 4.679794279272933e-06,
"loss": 0.7913,
"mean_token_accuracy": 0.7920089691877366,
"num_tokens": 119965397.0,
"step": 1350
},
{
"entropy": 1.042578125,
"epoch": 0.1858812273628101,
"grad_norm": 0.7185498781424556,
"learning_rate": 4.676271664083416e-06,
"loss": 0.7458,
"mean_token_accuracy": 0.8035849124193192,
"num_tokens": 120876126.0,
"step": 1360
},
{
"entropy": 1.115625,
"epoch": 0.187248001093419,
"grad_norm": 0.7676769836078166,
"learning_rate": 4.6727490488938995e-06,
"loss": 0.8025,
"mean_token_accuracy": 0.7909227550029755,
"num_tokens": 121712882.0,
"step": 1370
},
{
"entropy": 1.0634765625,
"epoch": 0.1886147748240279,
"grad_norm": 0.6414897365979269,
"learning_rate": 4.669226433704382e-06,
"loss": 0.7754,
"mean_token_accuracy": 0.7954991817474365,
"num_tokens": 122597154.0,
"step": 1380
},
{
"entropy": 1.0666015625,
"epoch": 0.18998154855463678,
"grad_norm": 0.750622318520331,
"learning_rate": 4.665703818514866e-06,
"loss": 0.78,
"mean_token_accuracy": 0.7974061220884323,
"num_tokens": 123457814.0,
"step": 1390
},
{
"entropy": 1.0751953125,
"epoch": 0.19134832228524568,
"grad_norm": 0.6169790007514308,
"learning_rate": 4.6621812033253484e-06,
"loss": 0.7491,
"mean_token_accuracy": 0.8014269709587097,
"num_tokens": 124340451.0,
"step": 1400
},
{
"entropy": 0.9876953125,
"epoch": 0.19271509601585457,
"grad_norm": 0.6334406576640842,
"learning_rate": 4.658658588135833e-06,
"loss": 0.6929,
"mean_token_accuracy": 0.8143978953361511,
"num_tokens": 125222917.0,
"step": 1410
},
{
"entropy": 1.0298828125,
"epoch": 0.19408186974646346,
"grad_norm": 0.7498235515495523,
"learning_rate": 4.6551359729463155e-06,
"loss": 0.7431,
"mean_token_accuracy": 0.8021504133939743,
"num_tokens": 126167349.0,
"step": 1420
},
{
"entropy": 1.078515625,
"epoch": 0.19544864347707236,
"grad_norm": 0.6642804250247699,
"learning_rate": 4.651613357756799e-06,
"loss": 0.8228,
"mean_token_accuracy": 0.7830305993556976,
"num_tokens": 127053792.0,
"step": 1430
},
{
"entropy": 1.0806640625,
"epoch": 0.19681541720768128,
"grad_norm": 0.679034355295869,
"learning_rate": 4.648090742567283e-06,
"loss": 0.7728,
"mean_token_accuracy": 0.7974883794784546,
"num_tokens": 127948703.0,
"step": 1440
},
{
"entropy": 1.0525390625,
"epoch": 0.19818219093829018,
"grad_norm": 0.7118474415905821,
"learning_rate": 4.644568127377765e-06,
"loss": 0.7637,
"mean_token_accuracy": 0.79769446849823,
"num_tokens": 128861108.0,
"step": 1450
},
{
"entropy": 1.0646484375,
"epoch": 0.19954896466889907,
"grad_norm": 0.7162372124810817,
"learning_rate": 4.641045512188249e-06,
"loss": 0.8001,
"mean_token_accuracy": 0.791256308555603,
"num_tokens": 129749270.0,
"step": 1460
},
{
"entropy": 1.0357421875,
"epoch": 0.20091573839950796,
"grad_norm": 0.6775002257127138,
"learning_rate": 4.6375228969987324e-06,
"loss": 0.7544,
"mean_token_accuracy": 0.8007209330797196,
"num_tokens": 130655000.0,
"step": 1470
},
{
"entropy": 1.0435546875,
"epoch": 0.20228251213011686,
"grad_norm": 0.6731133157398727,
"learning_rate": 4.634000281809216e-06,
"loss": 0.7539,
"mean_token_accuracy": 0.8004763782024383,
"num_tokens": 131564630.0,
"step": 1480
},
{
"entropy": 1.05,
"epoch": 0.20364928586072575,
"grad_norm": 0.6167302795124332,
"learning_rate": 4.630477666619699e-06,
"loss": 0.7761,
"mean_token_accuracy": 0.7962046295404435,
"num_tokens": 132430033.0,
"step": 1490
},
{
"entropy": 1.015625,
"epoch": 0.20501605959133465,
"grad_norm": 0.6359085185979183,
"learning_rate": 4.626955051430182e-06,
"loss": 0.7313,
"mean_token_accuracy": 0.8064335793256759,
"num_tokens": 133344093.0,
"step": 1500
},
{
"entropy": 1.08203125,
"epoch": 0.20638283332194354,
"grad_norm": 0.7433559742666581,
"learning_rate": 4.623432436240665e-06,
"loss": 0.8034,
"mean_token_accuracy": 0.7893345713615417,
"num_tokens": 134170710.0,
"step": 1510
},
{
"entropy": 1.04453125,
"epoch": 0.20774960705255244,
"grad_norm": 0.7016113594550795,
"learning_rate": 4.619909821051149e-06,
"loss": 0.7479,
"mean_token_accuracy": 0.7996001571416855,
"num_tokens": 135002300.0,
"step": 1520
},
{
"entropy": 1.0587890625,
"epoch": 0.20911638078316136,
"grad_norm": 0.7218086797343933,
"learning_rate": 4.616387205861632e-06,
"loss": 0.7724,
"mean_token_accuracy": 0.7968056559562683,
"num_tokens": 135877256.0,
"step": 1530
},
{
"entropy": 1.05546875,
"epoch": 0.21048315451377025,
"grad_norm": 0.6881300630045603,
"learning_rate": 4.6128645906721156e-06,
"loss": 0.776,
"mean_token_accuracy": 0.7975842118263244,
"num_tokens": 136719178.0,
"step": 1540
},
{
"entropy": 1.1068359375,
"epoch": 0.21184992824437915,
"grad_norm": 0.7034332839486802,
"learning_rate": 4.609341975482598e-06,
"loss": 0.7916,
"mean_token_accuracy": 0.7945227414369583,
"num_tokens": 137587067.0,
"step": 1550
},
{
"entropy": 1.052734375,
"epoch": 0.21321670197498804,
"grad_norm": 0.689060884744164,
"learning_rate": 4.605819360293082e-06,
"loss": 0.7297,
"mean_token_accuracy": 0.8043758630752563,
"num_tokens": 138510147.0,
"step": 1560
},
{
"entropy": 1.005078125,
"epoch": 0.21458347570559694,
"grad_norm": 0.6317539406202717,
"learning_rate": 4.602296745103565e-06,
"loss": 0.6995,
"mean_token_accuracy": 0.8105645328760147,
"num_tokens": 139391196.0,
"step": 1570
},
{
"entropy": 1.063671875,
"epoch": 0.21595024943620583,
"grad_norm": 0.7205520205009656,
"learning_rate": 4.598774129914049e-06,
"loss": 0.8228,
"mean_token_accuracy": 0.788042688369751,
"num_tokens": 140283552.0,
"step": 1580
},
{
"entropy": 1.0748046875,
"epoch": 0.21731702316681473,
"grad_norm": 0.7653208554390829,
"learning_rate": 4.595251514724532e-06,
"loss": 0.7923,
"mean_token_accuracy": 0.7899823248386383,
"num_tokens": 141150053.0,
"step": 1590
},
{
"entropy": 1.0255859375,
"epoch": 0.21868379689742362,
"grad_norm": 0.6422636369208433,
"learning_rate": 4.591728899535015e-06,
"loss": 0.7463,
"mean_token_accuracy": 0.7993673771619797,
"num_tokens": 142039072.0,
"step": 1600
},
{
"entropy": 1.030859375,
"epoch": 0.22005057062803252,
"grad_norm": 0.7227284191265548,
"learning_rate": 4.588206284345499e-06,
"loss": 0.7102,
"mean_token_accuracy": 0.8098841220140457,
"num_tokens": 142931990.0,
"step": 1610
},
{
"entropy": 1.104296875,
"epoch": 0.22141734435864144,
"grad_norm": 0.7932463932958538,
"learning_rate": 4.584683669155981e-06,
"loss": 0.83,
"mean_token_accuracy": 0.7854558914899826,
"num_tokens": 143831487.0,
"step": 1620
},
{
"entropy": 1.0666015625,
"epoch": 0.22278411808925033,
"grad_norm": 0.6838495863058551,
"learning_rate": 4.581161053966465e-06,
"loss": 0.7726,
"mean_token_accuracy": 0.7985242068767547,
"num_tokens": 144782154.0,
"step": 1630
},
{
"entropy": 1.0955078125,
"epoch": 0.22415089181985923,
"grad_norm": 0.7850241299789648,
"learning_rate": 4.5776384387769485e-06,
"loss": 0.7803,
"mean_token_accuracy": 0.7944418638944626,
"num_tokens": 145684601.0,
"step": 1640
},
{
"entropy": 1.046875,
"epoch": 0.22551766555046812,
"grad_norm": 0.7454946578356711,
"learning_rate": 4.574115823587432e-06,
"loss": 0.7475,
"mean_token_accuracy": 0.802868515253067,
"num_tokens": 146574905.0,
"step": 1650
},
{
"entropy": 1.0349609375,
"epoch": 0.22688443928107702,
"grad_norm": 0.6471121378872763,
"learning_rate": 4.570593208397915e-06,
"loss": 0.7477,
"mean_token_accuracy": 0.8036424338817596,
"num_tokens": 147465145.0,
"step": 1660
},
{
"entropy": 1.0546875,
"epoch": 0.2282512130116859,
"grad_norm": 0.5789809828170942,
"learning_rate": 4.567070593208398e-06,
"loss": 0.7848,
"mean_token_accuracy": 0.7951803565025329,
"num_tokens": 148329950.0,
"step": 1670
},
{
"entropy": 1.056640625,
"epoch": 0.2296179867422948,
"grad_norm": 0.7302467500959406,
"learning_rate": 4.563547978018882e-06,
"loss": 0.773,
"mean_token_accuracy": 0.7942819625139237,
"num_tokens": 149228860.0,
"step": 1680
},
{
"entropy": 1.031640625,
"epoch": 0.2309847604729037,
"grad_norm": 0.7076840801414684,
"learning_rate": 4.560025362829365e-06,
"loss": 0.7675,
"mean_token_accuracy": 0.7968021005392074,
"num_tokens": 150100793.0,
"step": 1690
},
{
"entropy": 1.07421875,
"epoch": 0.23235153420351262,
"grad_norm": 0.6552837619787594,
"learning_rate": 4.556502747639848e-06,
"loss": 0.7828,
"mean_token_accuracy": 0.7926223188638687,
"num_tokens": 150995094.0,
"step": 1700
},
{
"entropy": 1.073046875,
"epoch": 0.23371830793412152,
"grad_norm": 0.6241626954853522,
"learning_rate": 4.552980132450332e-06,
"loss": 0.7972,
"mean_token_accuracy": 0.7900221943855286,
"num_tokens": 151921452.0,
"step": 1710
},
{
"entropy": 1.0404296875,
"epoch": 0.2350850816647304,
"grad_norm": 0.6391169194715876,
"learning_rate": 4.549457517260814e-06,
"loss": 0.7748,
"mean_token_accuracy": 0.798612180352211,
"num_tokens": 152829538.0,
"step": 1720
},
{
"entropy": 1.0146484375,
"epoch": 0.2364518553953393,
"grad_norm": 0.6972159283136489,
"learning_rate": 4.545934902071298e-06,
"loss": 0.7347,
"mean_token_accuracy": 0.8020409017801284,
"num_tokens": 153770075.0,
"step": 1730
},
{
"entropy": 1.0806640625,
"epoch": 0.2378186291259482,
"grad_norm": 0.7454152374252329,
"learning_rate": 4.5424122868817814e-06,
"loss": 0.7685,
"mean_token_accuracy": 0.7938544601202011,
"num_tokens": 154631539.0,
"step": 1740
},
{
"entropy": 1.0384765625,
"epoch": 0.2391854028565571,
"grad_norm": 0.6659275399175422,
"learning_rate": 4.538889671692265e-06,
"loss": 0.7377,
"mean_token_accuracy": 0.8047246366739274,
"num_tokens": 155495251.0,
"step": 1750
},
{
"entropy": 1.07265625,
"epoch": 0.240552176587166,
"grad_norm": 0.7043449412465246,
"learning_rate": 4.535367056502748e-06,
"loss": 0.7595,
"mean_token_accuracy": 0.7977527648210525,
"num_tokens": 156404778.0,
"step": 1760
},
{
"entropy": 1.069921875,
"epoch": 0.24191895031777488,
"grad_norm": 0.6142711163356898,
"learning_rate": 4.531844441313231e-06,
"loss": 0.7777,
"mean_token_accuracy": 0.7939672768115997,
"num_tokens": 157289886.0,
"step": 1770
},
{
"entropy": 1.01640625,
"epoch": 0.24328572404838378,
"grad_norm": 0.6311754920203944,
"learning_rate": 4.528321826123715e-06,
"loss": 0.7286,
"mean_token_accuracy": 0.8054740607738495,
"num_tokens": 158159238.0,
"step": 1780
},
{
"entropy": 1.0603515625,
"epoch": 0.2446524977789927,
"grad_norm": 0.6125526891668216,
"learning_rate": 4.524799210934198e-06,
"loss": 0.7476,
"mean_token_accuracy": 0.8028622239828109,
"num_tokens": 159054886.0,
"step": 1790
},
{
"entropy": 1.06015625,
"epoch": 0.2460192715096016,
"grad_norm": 0.6192665848266459,
"learning_rate": 4.521276595744681e-06,
"loss": 0.7101,
"mean_token_accuracy": 0.8116476029157639,
"num_tokens": 159916702.0,
"step": 1800
},
{
"entropy": 1.04921875,
"epoch": 0.2473860452402105,
"grad_norm": 0.7355141946267879,
"learning_rate": 4.5177539805551646e-06,
"loss": 0.7885,
"mean_token_accuracy": 0.7927444100379943,
"num_tokens": 160800051.0,
"step": 1810
},
{
"entropy": 1.0375,
"epoch": 0.24875281897081938,
"grad_norm": 0.7265414868024029,
"learning_rate": 4.514231365365648e-06,
"loss": 0.7137,
"mean_token_accuracy": 0.8095521658658982,
"num_tokens": 161649504.0,
"step": 1820
},
{
"entropy": 1.04140625,
"epoch": 0.2501195927014283,
"grad_norm": 0.6669407143165951,
"learning_rate": 4.510708750176131e-06,
"loss": 0.7504,
"mean_token_accuracy": 0.7980089575052262,
"num_tokens": 162521710.0,
"step": 1830
},
{
"entropy": 1.0384765625,
"epoch": 0.2514863664320372,
"grad_norm": 0.6648994051003188,
"learning_rate": 4.507186134986614e-06,
"loss": 0.7511,
"mean_token_accuracy": 0.8019384413957595,
"num_tokens": 163456795.0,
"step": 1840
},
{
"entropy": 1.035546875,
"epoch": 0.2528531401626461,
"grad_norm": 0.6446539419699149,
"learning_rate": 4.503663519797098e-06,
"loss": 0.7603,
"mean_token_accuracy": 0.798452478647232,
"num_tokens": 164354274.0,
"step": 1850
},
{
"entropy": 1.044140625,
"epoch": 0.254219913893255,
"grad_norm": 0.7041973910189602,
"learning_rate": 4.5001409046075814e-06,
"loss": 0.7473,
"mean_token_accuracy": 0.8014080345630645,
"num_tokens": 165231568.0,
"step": 1860
},
{
"entropy": 1.0390625,
"epoch": 0.2555866876238639,
"grad_norm": 0.6283313379322466,
"learning_rate": 4.496618289418064e-06,
"loss": 0.7419,
"mean_token_accuracy": 0.802531722187996,
"num_tokens": 166149414.0,
"step": 1870
},
{
"entropy": 1.0486328125,
"epoch": 0.2569534613544728,
"grad_norm": 0.7296306550258447,
"learning_rate": 4.493095674228548e-06,
"loss": 0.7416,
"mean_token_accuracy": 0.8041615515947342,
"num_tokens": 167006969.0,
"step": 1880
},
{
"entropy": 1.059765625,
"epoch": 0.2583202350850817,
"grad_norm": 0.6838954156834921,
"learning_rate": 4.48957305903903e-06,
"loss": 0.7818,
"mean_token_accuracy": 0.7932397276163101,
"num_tokens": 167901440.0,
"step": 1890
},
{
"entropy": 1.037109375,
"epoch": 0.25968700881569057,
"grad_norm": 0.7400543110080356,
"learning_rate": 4.486050443849515e-06,
"loss": 0.7207,
"mean_token_accuracy": 0.8084338694810868,
"num_tokens": 168783114.0,
"step": 1900
},
{
"entropy": 1.0533203125,
"epoch": 0.26105378254629946,
"grad_norm": 0.6108995574468833,
"learning_rate": 4.4825278286599975e-06,
"loss": 0.7439,
"mean_token_accuracy": 0.8014115452766418,
"num_tokens": 169685621.0,
"step": 1910
},
{
"entropy": 1.0111328125,
"epoch": 0.26242055627690836,
"grad_norm": 0.7667951381746856,
"learning_rate": 4.479005213470481e-06,
"loss": 0.7392,
"mean_token_accuracy": 0.8022979021072387,
"num_tokens": 170573171.0,
"step": 1920
},
{
"entropy": 1.0587890625,
"epoch": 0.26378733000751725,
"grad_norm": 0.7609464905046412,
"learning_rate": 4.475482598280964e-06,
"loss": 0.8102,
"mean_token_accuracy": 0.7844867408275604,
"num_tokens": 171454806.0,
"step": 1930
},
{
"entropy": 1.0275390625,
"epoch": 0.26515410373812615,
"grad_norm": 0.7001805007873791,
"learning_rate": 4.471959983091447e-06,
"loss": 0.7522,
"mean_token_accuracy": 0.7987564384937287,
"num_tokens": 172346713.0,
"step": 1940
},
{
"entropy": 1.072265625,
"epoch": 0.26652087746873504,
"grad_norm": 0.6774944421651948,
"learning_rate": 4.468437367901931e-06,
"loss": 0.7314,
"mean_token_accuracy": 0.8039441794157028,
"num_tokens": 173233962.0,
"step": 1950
},
{
"entropy": 1.06953125,
"epoch": 0.26788765119934393,
"grad_norm": 0.6724124802930471,
"learning_rate": 4.464914752712414e-06,
"loss": 0.7935,
"mean_token_accuracy": 0.7918294608592987,
"num_tokens": 174110792.0,
"step": 1960
},
{
"entropy": 1.0259765625,
"epoch": 0.26925442492995283,
"grad_norm": 0.6765520542681359,
"learning_rate": 4.461392137522897e-06,
"loss": 0.7466,
"mean_token_accuracy": 0.8001616388559342,
"num_tokens": 175005864.0,
"step": 1970
},
{
"entropy": 1.022265625,
"epoch": 0.2706211986605617,
"grad_norm": 0.6678971505128823,
"learning_rate": 4.457869522333381e-06,
"loss": 0.7401,
"mean_token_accuracy": 0.8030347615480423,
"num_tokens": 175870222.0,
"step": 1980
},
{
"entropy": 1.0384765625,
"epoch": 0.2719879723911706,
"grad_norm": 0.6672592815894385,
"learning_rate": 4.454346907143864e-06,
"loss": 0.7315,
"mean_token_accuracy": 0.8051863938570023,
"num_tokens": 176750406.0,
"step": 1990
},
{
"entropy": 1.0845703125,
"epoch": 0.2733547461217795,
"grad_norm": 0.7218792772721631,
"learning_rate": 4.450824291954347e-06,
"loss": 0.7536,
"mean_token_accuracy": 0.7993634879589081,
"num_tokens": 177646304.0,
"step": 2000
},
{
"entropy": 1.0072265625,
"epoch": 0.27472151985238846,
"grad_norm": 0.598792253427465,
"learning_rate": 4.44730167676483e-06,
"loss": 0.7164,
"mean_token_accuracy": 0.808587247133255,
"num_tokens": 178544048.0,
"step": 2010
},
{
"entropy": 1.083203125,
"epoch": 0.27608829358299736,
"grad_norm": 0.6896717351843893,
"learning_rate": 4.443779061575314e-06,
"loss": 0.7976,
"mean_token_accuracy": 0.7926790773868561,
"num_tokens": 179424878.0,
"step": 2020
},
{
"entropy": 1.001953125,
"epoch": 0.27745506731360625,
"grad_norm": 0.7478620953683554,
"learning_rate": 4.4402564463857975e-06,
"loss": 0.719,
"mean_token_accuracy": 0.8068624913692475,
"num_tokens": 180290131.0,
"step": 2030
},
{
"entropy": 1.071484375,
"epoch": 0.27882184104421515,
"grad_norm": 0.6339726159167871,
"learning_rate": 4.43673383119628e-06,
"loss": 0.7546,
"mean_token_accuracy": 0.7998242259025574,
"num_tokens": 181151230.0,
"step": 2040
},
{
"entropy": 1.0490234375,
"epoch": 0.28018861477482404,
"grad_norm": 0.6555543145965628,
"learning_rate": 4.433211216006764e-06,
"loss": 0.742,
"mean_token_accuracy": 0.8013415783643723,
"num_tokens": 181997158.0,
"step": 2050
},
{
"entropy": 1.019921875,
"epoch": 0.28155538850543294,
"grad_norm": 0.6167972535893136,
"learning_rate": 4.4296886008172465e-06,
"loss": 0.7493,
"mean_token_accuracy": 0.7999988347291946,
"num_tokens": 182869862.0,
"step": 2060
},
{
"entropy": 1.016015625,
"epoch": 0.28292216223604183,
"grad_norm": 0.6658590806341207,
"learning_rate": 4.426165985627731e-06,
"loss": 0.7254,
"mean_token_accuracy": 0.8057982236146927,
"num_tokens": 183793317.0,
"step": 2070
},
{
"entropy": 1.0181640625,
"epoch": 0.2842889359666507,
"grad_norm": 0.6752570359576422,
"learning_rate": 4.4226433704382136e-06,
"loss": 0.7422,
"mean_token_accuracy": 0.8050920873880386,
"num_tokens": 184654232.0,
"step": 2080
},
{
"entropy": 1.0185546875,
"epoch": 0.2856557096972596,
"grad_norm": 0.6416128901547289,
"learning_rate": 4.419120755248697e-06,
"loss": 0.724,
"mean_token_accuracy": 0.8075159639120102,
"num_tokens": 185544158.0,
"step": 2090
},
{
"entropy": 1.0998046875,
"epoch": 0.2870224834278685,
"grad_norm": 0.64048883023158,
"learning_rate": 4.41559814005918e-06,
"loss": 0.8109,
"mean_token_accuracy": 0.7888032853603363,
"num_tokens": 186444139.0,
"step": 2100
},
{
"entropy": 1.0171875,
"epoch": 0.2883892571584774,
"grad_norm": 0.6841286846635242,
"learning_rate": 4.412075524869663e-06,
"loss": 0.7419,
"mean_token_accuracy": 0.8045876801013947,
"num_tokens": 187281267.0,
"step": 2110
},
{
"entropy": 1.0625,
"epoch": 0.2897560308890863,
"grad_norm": 0.6845477569641711,
"learning_rate": 4.408552909680147e-06,
"loss": 0.775,
"mean_token_accuracy": 0.7947614192962646,
"num_tokens": 188147941.0,
"step": 2120
},
{
"entropy": 1.0306640625,
"epoch": 0.2911228046196952,
"grad_norm": 0.6340252802566206,
"learning_rate": 4.4050302944906304e-06,
"loss": 0.7653,
"mean_token_accuracy": 0.7970018774271012,
"num_tokens": 189047615.0,
"step": 2130
},
{
"entropy": 1.0396484375,
"epoch": 0.2924895783503041,
"grad_norm": 0.6997327093042934,
"learning_rate": 4.401507679301113e-06,
"loss": 0.7284,
"mean_token_accuracy": 0.8062391757965088,
"num_tokens": 189900274.0,
"step": 2140
},
{
"entropy": 1.104296875,
"epoch": 0.293856352080913,
"grad_norm": 0.7936132641508024,
"learning_rate": 4.397985064111597e-06,
"loss": 0.8282,
"mean_token_accuracy": 0.7848259031772613,
"num_tokens": 190817864.0,
"step": 2150
},
{
"entropy": 1.042578125,
"epoch": 0.2952231258115219,
"grad_norm": 0.6447633348108741,
"learning_rate": 4.39446244892208e-06,
"loss": 0.7417,
"mean_token_accuracy": 0.8032991290092468,
"num_tokens": 191696200.0,
"step": 2160
},
{
"entropy": 1.077734375,
"epoch": 0.2965898995421308,
"grad_norm": 0.7874890304630795,
"learning_rate": 4.390939833732563e-06,
"loss": 0.7619,
"mean_token_accuracy": 0.7985487699508667,
"num_tokens": 192504212.0,
"step": 2170
},
{
"entropy": 1.0376953125,
"epoch": 0.2979566732727397,
"grad_norm": 0.724089417378558,
"learning_rate": 4.387417218543047e-06,
"loss": 0.7497,
"mean_token_accuracy": 0.8016789644956589,
"num_tokens": 193391915.0,
"step": 2180
},
{
"entropy": 1.01015625,
"epoch": 0.2993234470033486,
"grad_norm": 0.725326250929472,
"learning_rate": 4.38389460335353e-06,
"loss": 0.6971,
"mean_token_accuracy": 0.8130765438079834,
"num_tokens": 194274927.0,
"step": 2190
},
{
"entropy": 1.037109375,
"epoch": 0.3006902207339575,
"grad_norm": 0.6077862559803905,
"learning_rate": 4.380371988164014e-06,
"loss": 0.8048,
"mean_token_accuracy": 0.7888978034257889,
"num_tokens": 195216521.0,
"step": 2200
},
{
"entropy": 1.019140625,
"epoch": 0.3020569944645664,
"grad_norm": 0.6270325107171512,
"learning_rate": 4.376849372974496e-06,
"loss": 0.7412,
"mean_token_accuracy": 0.8060383260250091,
"num_tokens": 196130208.0,
"step": 2210
},
{
"entropy": 1.0244140625,
"epoch": 0.3034237681951753,
"grad_norm": 0.647127468945935,
"learning_rate": 4.37332675778498e-06,
"loss": 0.7466,
"mean_token_accuracy": 0.7998924225568771,
"num_tokens": 197028743.0,
"step": 2220
},
{
"entropy": 1.0283203125,
"epoch": 0.3047905419257842,
"grad_norm": 0.6714931642518801,
"learning_rate": 4.369804142595463e-06,
"loss": 0.7728,
"mean_token_accuracy": 0.7981234103441238,
"num_tokens": 197898713.0,
"step": 2230
},
{
"entropy": 1.0162109375,
"epoch": 0.3061573156563931,
"grad_norm": 0.681806882922511,
"learning_rate": 4.366281527405947e-06,
"loss": 0.7558,
"mean_token_accuracy": 0.797198337316513,
"num_tokens": 198815509.0,
"step": 2240
},
{
"entropy": 1.005078125,
"epoch": 0.307524089387002,
"grad_norm": 0.668688067634026,
"learning_rate": 4.36275891221643e-06,
"loss": 0.7244,
"mean_token_accuracy": 0.8034601986408234,
"num_tokens": 199704367.0,
"step": 2250
},
{
"entropy": 0.99140625,
"epoch": 0.3088908631176109,
"grad_norm": 0.701375520990333,
"learning_rate": 4.359236297026913e-06,
"loss": 0.7348,
"mean_token_accuracy": 0.8039469867944717,
"num_tokens": 200578924.0,
"step": 2260
},
{
"entropy": 0.998828125,
"epoch": 0.3102576368482198,
"grad_norm": 0.7343101257753415,
"learning_rate": 4.355713681837396e-06,
"loss": 0.7038,
"mean_token_accuracy": 0.8100977689027786,
"num_tokens": 201456944.0,
"step": 2270
},
{
"entropy": 1.00859375,
"epoch": 0.31162441057882867,
"grad_norm": 0.683519149685984,
"learning_rate": 4.352191066647879e-06,
"loss": 0.7365,
"mean_token_accuracy": 0.8024961769580841,
"num_tokens": 202323380.0,
"step": 2280
},
{
"entropy": 1.041015625,
"epoch": 0.31299118430943756,
"grad_norm": 0.68858775291526,
"learning_rate": 4.348668451458363e-06,
"loss": 0.7614,
"mean_token_accuracy": 0.7979620963335037,
"num_tokens": 203221545.0,
"step": 2290
},
{
"entropy": 1.0576171875,
"epoch": 0.31435795804004646,
"grad_norm": 0.6475325587164301,
"learning_rate": 4.3451458362688465e-06,
"loss": 0.7599,
"mean_token_accuracy": 0.7986271291971206,
"num_tokens": 204099161.0,
"step": 2300
},
{
"entropy": 1.050390625,
"epoch": 0.31572473177065535,
"grad_norm": 0.6305735760634883,
"learning_rate": 4.34162322107933e-06,
"loss": 0.7409,
"mean_token_accuracy": 0.8032160550355911,
"num_tokens": 204961852.0,
"step": 2310
},
{
"entropy": 1.0724609375,
"epoch": 0.31709150550126425,
"grad_norm": 0.683373649991868,
"learning_rate": 4.338100605889813e-06,
"loss": 0.7345,
"mean_token_accuracy": 0.8030784040689468,
"num_tokens": 205811402.0,
"step": 2320
},
{
"entropy": 1.00078125,
"epoch": 0.31845827923187314,
"grad_norm": 0.6671940928440009,
"learning_rate": 4.334577990700296e-06,
"loss": 0.6688,
"mean_token_accuracy": 0.8208626359701157,
"num_tokens": 206683323.0,
"step": 2330
},
{
"entropy": 1.0625,
"epoch": 0.31982505296248204,
"grad_norm": 0.6834012086274072,
"learning_rate": 4.33105537551078e-06,
"loss": 0.7916,
"mean_token_accuracy": 0.7903273820877075,
"num_tokens": 207548993.0,
"step": 2340
},
{
"entropy": 1.0078125,
"epoch": 0.32119182669309093,
"grad_norm": 0.6429380930834178,
"learning_rate": 4.327532760321263e-06,
"loss": 0.6958,
"mean_token_accuracy": 0.8136319369077682,
"num_tokens": 208393459.0,
"step": 2350
},
{
"entropy": 1.0318359375,
"epoch": 0.3225586004236999,
"grad_norm": 0.6869293258367866,
"learning_rate": 4.324010145131746e-06,
"loss": 0.7695,
"mean_token_accuracy": 0.7966207057237625,
"num_tokens": 209266863.0,
"step": 2360
},
{
"entropy": 1.0333984375,
"epoch": 0.3239253741543088,
"grad_norm": 0.6267447935729002,
"learning_rate": 4.32048752994223e-06,
"loss": 0.7632,
"mean_token_accuracy": 0.7970691561698914,
"num_tokens": 210197901.0,
"step": 2370
},
{
"entropy": 1.047265625,
"epoch": 0.32529214788491767,
"grad_norm": 0.6369593250686769,
"learning_rate": 4.316964914752712e-06,
"loss": 0.7567,
"mean_token_accuracy": 0.7984864503145218,
"num_tokens": 211082714.0,
"step": 2380
},
{
"entropy": 1.0580078125,
"epoch": 0.32665892161552657,
"grad_norm": 0.8147875336996417,
"learning_rate": 4.313442299563196e-06,
"loss": 0.8233,
"mean_token_accuracy": 0.7882304012775421,
"num_tokens": 211920987.0,
"step": 2390
},
{
"entropy": 1.0265625,
"epoch": 0.32802569534613546,
"grad_norm": 0.7382375026592431,
"learning_rate": 4.3099196843736794e-06,
"loss": 0.7425,
"mean_token_accuracy": 0.8023101031780243,
"num_tokens": 212778254.0,
"step": 2400
},
{
"entropy": 1.04375,
"epoch": 0.32939246907674435,
"grad_norm": 0.6453384089607732,
"learning_rate": 4.306397069184163e-06,
"loss": 0.7477,
"mean_token_accuracy": 0.800194826722145,
"num_tokens": 213665677.0,
"step": 2410
},
{
"entropy": 1.0623046875,
"epoch": 0.33075924280735325,
"grad_norm": 0.7415930480624624,
"learning_rate": 4.302874453994646e-06,
"loss": 0.7639,
"mean_token_accuracy": 0.7967595010995865,
"num_tokens": 214532016.0,
"step": 2420
},
{
"entropy": 1.012109375,
"epoch": 0.33212601653796214,
"grad_norm": 0.6299215391954756,
"learning_rate": 4.299351838805129e-06,
"loss": 0.7071,
"mean_token_accuracy": 0.8087413340806962,
"num_tokens": 215416984.0,
"step": 2430
},
{
"entropy": 1.071484375,
"epoch": 0.33349279026857104,
"grad_norm": 0.5860783010809965,
"learning_rate": 4.295829223615613e-06,
"loss": 0.7532,
"mean_token_accuracy": 0.800373911857605,
"num_tokens": 216317310.0,
"step": 2440
},
{
"entropy": 1.0560546875,
"epoch": 0.33485956399917993,
"grad_norm": 0.6788936207495109,
"learning_rate": 4.292306608426096e-06,
"loss": 0.7519,
"mean_token_accuracy": 0.8014751702547074,
"num_tokens": 217188245.0,
"step": 2450
},
{
"entropy": 0.9908203125,
"epoch": 0.3362263377297888,
"grad_norm": 0.610245700833583,
"learning_rate": 4.288783993236579e-06,
"loss": 0.7266,
"mean_token_accuracy": 0.807662433385849,
"num_tokens": 218084772.0,
"step": 2460
},
{
"entropy": 1.041015625,
"epoch": 0.3375931114603977,
"grad_norm": 0.686927577694576,
"learning_rate": 4.285261378047063e-06,
"loss": 0.7311,
"mean_token_accuracy": 0.8033632308244705,
"num_tokens": 218985412.0,
"step": 2470
},
{
"entropy": 1.0609375,
"epoch": 0.3389598851910066,
"grad_norm": 0.8505298029432377,
"learning_rate": 4.281738762857546e-06,
"loss": 0.7622,
"mean_token_accuracy": 0.7978941231966019,
"num_tokens": 219878663.0,
"step": 2480
},
{
"entropy": 1.0859375,
"epoch": 0.3403266589216155,
"grad_norm": 0.7166249891871526,
"learning_rate": 4.278216147668029e-06,
"loss": 0.7462,
"mean_token_accuracy": 0.8011073052883149,
"num_tokens": 220775855.0,
"step": 2490
},
{
"entropy": 1.053515625,
"epoch": 0.3416934326522244,
"grad_norm": 0.685451510641097,
"learning_rate": 4.274693532478512e-06,
"loss": 0.7949,
"mean_token_accuracy": 0.7896168291568756,
"num_tokens": 221663073.0,
"step": 2500
},
{
"entropy": 1.00546875,
"epoch": 0.3430602063828333,
"grad_norm": 0.5944338222803105,
"learning_rate": 4.271170917288996e-06,
"loss": 0.7291,
"mean_token_accuracy": 0.8064245790243149,
"num_tokens": 222544981.0,
"step": 2510
},
{
"entropy": 1.023828125,
"epoch": 0.3444269801134422,
"grad_norm": 0.666490479629092,
"learning_rate": 4.2676483020994795e-06,
"loss": 0.7145,
"mean_token_accuracy": 0.8091930717229843,
"num_tokens": 223440024.0,
"step": 2520
},
{
"entropy": 1.0513671875,
"epoch": 0.34579375384405114,
"grad_norm": 0.677509841190724,
"learning_rate": 4.264125686909962e-06,
"loss": 0.7834,
"mean_token_accuracy": 0.7946488112211227,
"num_tokens": 224363546.0,
"step": 2530
},
{
"entropy": 1.0578125,
"epoch": 0.34716052757466004,
"grad_norm": 0.6665034389394008,
"learning_rate": 4.260603071720446e-06,
"loss": 0.7778,
"mean_token_accuracy": 0.7976168930530548,
"num_tokens": 225225542.0,
"step": 2540
},
{
"entropy": 1.0685546875,
"epoch": 0.34852730130526893,
"grad_norm": 0.7091404102611992,
"learning_rate": 4.257080456530928e-06,
"loss": 0.7934,
"mean_token_accuracy": 0.7890412211418152,
"num_tokens": 226103209.0,
"step": 2550
},
{
"entropy": 1.0166015625,
"epoch": 0.3498940750358778,
"grad_norm": 0.6482140706563859,
"learning_rate": 4.253557841341413e-06,
"loss": 0.7067,
"mean_token_accuracy": 0.8101300328969956,
"num_tokens": 226998581.0,
"step": 2560
},
{
"entropy": 1.0296875,
"epoch": 0.3512608487664867,
"grad_norm": 0.6989385759644268,
"learning_rate": 4.2500352261518955e-06,
"loss": 0.753,
"mean_token_accuracy": 0.8004690676927566,
"num_tokens": 227888802.0,
"step": 2570
},
{
"entropy": 0.9890625,
"epoch": 0.3526276224970956,
"grad_norm": 0.6653135855102462,
"learning_rate": 4.246512610962379e-06,
"loss": 0.7326,
"mean_token_accuracy": 0.8056268870830536,
"num_tokens": 228776580.0,
"step": 2580
},
{
"entropy": 1.0498046875,
"epoch": 0.3539943962277045,
"grad_norm": 0.7236763297449379,
"learning_rate": 4.242989995772862e-06,
"loss": 0.7591,
"mean_token_accuracy": 0.7993986785411835,
"num_tokens": 229624559.0,
"step": 2590
},
{
"entropy": 1.0546875,
"epoch": 0.3553611699583134,
"grad_norm": 0.5891118043722869,
"learning_rate": 4.239467380583345e-06,
"loss": 0.7569,
"mean_token_accuracy": 0.7990292966365814,
"num_tokens": 230559792.0,
"step": 2600
},
{
"entropy": 1.02578125,
"epoch": 0.3567279436889223,
"grad_norm": 0.6316047872746198,
"learning_rate": 4.235944765393829e-06,
"loss": 0.7099,
"mean_token_accuracy": 0.8105848550796508,
"num_tokens": 231437280.0,
"step": 2610
},
{
"entropy": 1.05078125,
"epoch": 0.3580947174195312,
"grad_norm": 0.7474536432051692,
"learning_rate": 4.232422150204312e-06,
"loss": 0.778,
"mean_token_accuracy": 0.7952050060033798,
"num_tokens": 232292698.0,
"step": 2620
},
{
"entropy": 1.0775390625,
"epoch": 0.3594614911501401,
"grad_norm": 0.6644010905583767,
"learning_rate": 4.228899535014795e-06,
"loss": 0.8014,
"mean_token_accuracy": 0.7889286547899246,
"num_tokens": 233148286.0,
"step": 2630
},
{
"entropy": 1.0556640625,
"epoch": 0.360828264880749,
"grad_norm": 0.7887480352386127,
"learning_rate": 4.225376919825279e-06,
"loss": 0.772,
"mean_token_accuracy": 0.7952852338552475,
"num_tokens": 234027940.0,
"step": 2640
},
{
"entropy": 1.0140625,
"epoch": 0.3621950386113579,
"grad_norm": 0.6471081885858277,
"learning_rate": 4.221854304635762e-06,
"loss": 0.7507,
"mean_token_accuracy": 0.799159613251686,
"num_tokens": 234909727.0,
"step": 2650
},
{
"entropy": 1.1013671875,
"epoch": 0.3635618123419668,
"grad_norm": 0.6567816632166441,
"learning_rate": 4.218331689446245e-06,
"loss": 0.8137,
"mean_token_accuracy": 0.7872438907623291,
"num_tokens": 235799025.0,
"step": 2660
},
{
"entropy": 1.024609375,
"epoch": 0.36492858607257567,
"grad_norm": 0.7190626664469335,
"learning_rate": 4.2148090742567284e-06,
"loss": 0.7035,
"mean_token_accuracy": 0.8121999651193619,
"num_tokens": 236681681.0,
"step": 2670
},
{
"entropy": 1.0224609375,
"epoch": 0.36629535980318456,
"grad_norm": 0.6463479774039452,
"learning_rate": 4.211286459067212e-06,
"loss": 0.7804,
"mean_token_accuracy": 0.7934603750705719,
"num_tokens": 237614496.0,
"step": 2680
},
{
"entropy": 1.0068359375,
"epoch": 0.36766213353379346,
"grad_norm": 0.5902314851980951,
"learning_rate": 4.2077638438776955e-06,
"loss": 0.6938,
"mean_token_accuracy": 0.8133742719888687,
"num_tokens": 238469453.0,
"step": 2690
},
{
"entropy": 1.037109375,
"epoch": 0.36902890726440235,
"grad_norm": 0.630023773083592,
"learning_rate": 4.204241228688178e-06,
"loss": 0.7265,
"mean_token_accuracy": 0.80506831407547,
"num_tokens": 239444806.0,
"step": 2700
},
{
"entropy": 1.0244140625,
"epoch": 0.3703956809950113,
"grad_norm": 0.6517768076409277,
"learning_rate": 4.200718613498662e-06,
"loss": 0.7043,
"mean_token_accuracy": 0.811779898405075,
"num_tokens": 240347408.0,
"step": 2710
},
{
"entropy": 1.03203125,
"epoch": 0.3717624547256202,
"grad_norm": 0.7199822490218735,
"learning_rate": 4.1971959983091445e-06,
"loss": 0.7194,
"mean_token_accuracy": 0.8070890665054321,
"num_tokens": 241208094.0,
"step": 2720
},
{
"entropy": 1.0025390625,
"epoch": 0.3731292284562291,
"grad_norm": 0.6283870809324613,
"learning_rate": 4.193673383119629e-06,
"loss": 0.7014,
"mean_token_accuracy": 0.8113769918680191,
"num_tokens": 242123416.0,
"step": 2730
},
{
"entropy": 1.0634765625,
"epoch": 0.374496002186838,
"grad_norm": 0.6530464318782628,
"learning_rate": 4.190150767930112e-06,
"loss": 0.8242,
"mean_token_accuracy": 0.786988627910614,
"num_tokens": 243074693.0,
"step": 2740
},
{
"entropy": 1.0837890625,
"epoch": 0.3758627759174469,
"grad_norm": 0.6680047648174176,
"learning_rate": 4.186628152740595e-06,
"loss": 0.769,
"mean_token_accuracy": 0.796336778998375,
"num_tokens": 243981066.0,
"step": 2750
},
{
"entropy": 1.03515625,
"epoch": 0.3772295496480558,
"grad_norm": 0.6481562516915532,
"learning_rate": 4.183105537551078e-06,
"loss": 0.7448,
"mean_token_accuracy": 0.8005216747522355,
"num_tokens": 244865595.0,
"step": 2760
},
{
"entropy": 1.0689453125,
"epoch": 0.37859632337866467,
"grad_norm": 0.7052315376002801,
"learning_rate": 4.179582922361561e-06,
"loss": 0.7745,
"mean_token_accuracy": 0.7960536509752274,
"num_tokens": 245726577.0,
"step": 2770
},
{
"entropy": 1.046875,
"epoch": 0.37996309710927356,
"grad_norm": 0.7021028366873274,
"learning_rate": 4.176060307172045e-06,
"loss": 0.7529,
"mean_token_accuracy": 0.7972106099128723,
"num_tokens": 246639968.0,
"step": 2780
},
{
"entropy": 1.0443359375,
"epoch": 0.38132987083988246,
"grad_norm": 0.6533098019669229,
"learning_rate": 4.1725376919825285e-06,
"loss": 0.716,
"mean_token_accuracy": 0.8076875060796738,
"num_tokens": 247494604.0,
"step": 2790
},
{
"entropy": 1.041015625,
"epoch": 0.38269664457049135,
"grad_norm": 0.6896705584307958,
"learning_rate": 4.169015076793011e-06,
"loss": 0.7547,
"mean_token_accuracy": 0.8001517623662948,
"num_tokens": 248346580.0,
"step": 2800
},
{
"entropy": 0.99765625,
"epoch": 0.38406341830110025,
"grad_norm": 0.7635732130856733,
"learning_rate": 4.165492461603495e-06,
"loss": 0.7295,
"mean_token_accuracy": 0.8038206458091736,
"num_tokens": 249243321.0,
"step": 2810
},
{
"entropy": 1.0181640625,
"epoch": 0.38543019203170914,
"grad_norm": 0.6971998439111813,
"learning_rate": 4.161969846413978e-06,
"loss": 0.7204,
"mean_token_accuracy": 0.8063790231943131,
"num_tokens": 250100768.0,
"step": 2820
},
{
"entropy": 0.9779296875,
"epoch": 0.38679696576231803,
"grad_norm": 0.6447574356153839,
"learning_rate": 4.158447231224461e-06,
"loss": 0.7172,
"mean_token_accuracy": 0.8070257067680359,
"num_tokens": 251046334.0,
"step": 2830
},
{
"entropy": 1.0365234375,
"epoch": 0.38816373949292693,
"grad_norm": 0.6191110318027163,
"learning_rate": 4.1549246160349445e-06,
"loss": 0.7526,
"mean_token_accuracy": 0.8005504906177521,
"num_tokens": 251967634.0,
"step": 2840
},
{
"entropy": 1.0216796875,
"epoch": 0.3895305132235358,
"grad_norm": 0.6523538775440434,
"learning_rate": 4.151402000845428e-06,
"loss": 0.7294,
"mean_token_accuracy": 0.8032447904348373,
"num_tokens": 252873963.0,
"step": 2850
},
{
"entropy": 0.999609375,
"epoch": 0.3908972869541447,
"grad_norm": 0.6021666718295879,
"learning_rate": 4.147879385655912e-06,
"loss": 0.6823,
"mean_token_accuracy": 0.816501235961914,
"num_tokens": 253752744.0,
"step": 2860
},
{
"entropy": 1.023828125,
"epoch": 0.3922640606847536,
"grad_norm": 0.7417624065856786,
"learning_rate": 4.144356770466394e-06,
"loss": 0.7351,
"mean_token_accuracy": 0.8035088807344437,
"num_tokens": 254605874.0,
"step": 2870
},
{
"entropy": 1.10234375,
"epoch": 0.39363083441536256,
"grad_norm": 0.6619210502704945,
"learning_rate": 4.140834155276878e-06,
"loss": 0.8055,
"mean_token_accuracy": 0.7876572340726853,
"num_tokens": 255509596.0,
"step": 2880
},
{
"entropy": 1.0478515625,
"epoch": 0.39499760814597146,
"grad_norm": 0.6613731137566995,
"learning_rate": 4.137311540087361e-06,
"loss": 0.7357,
"mean_token_accuracy": 0.8059726566076278,
"num_tokens": 256444844.0,
"step": 2890
},
{
"entropy": 1.0609375,
"epoch": 0.39636438187658035,
"grad_norm": 0.7445111407055267,
"learning_rate": 4.133788924897845e-06,
"loss": 0.7672,
"mean_token_accuracy": 0.7973901689052582,
"num_tokens": 257337194.0,
"step": 2900
},
{
"entropy": 0.9970703125,
"epoch": 0.39773115560718925,
"grad_norm": 0.5786786138367053,
"learning_rate": 4.130266309708328e-06,
"loss": 0.6811,
"mean_token_accuracy": 0.8164718747138977,
"num_tokens": 258224564.0,
"step": 2910
},
{
"entropy": 1.0611328125,
"epoch": 0.39909792933779814,
"grad_norm": 0.7164667691930775,
"learning_rate": 4.126743694518811e-06,
"loss": 0.7836,
"mean_token_accuracy": 0.7944917291402817,
"num_tokens": 259129739.0,
"step": 2920
},
{
"entropy": 1.05546875,
"epoch": 0.40046470306840704,
"grad_norm": 0.6932851311289787,
"learning_rate": 4.123221079329294e-06,
"loss": 0.7172,
"mean_token_accuracy": 0.8080837219953537,
"num_tokens": 259960983.0,
"step": 2930
},
{
"entropy": 1.066796875,
"epoch": 0.40183147679901593,
"grad_norm": 0.7241307842368703,
"learning_rate": 4.1196984641397774e-06,
"loss": 0.7635,
"mean_token_accuracy": 0.797183844447136,
"num_tokens": 260822212.0,
"step": 2940
},
{
"entropy": 1.01640625,
"epoch": 0.4031982505296248,
"grad_norm": 0.6406425982100064,
"learning_rate": 4.116175848950261e-06,
"loss": 0.6765,
"mean_token_accuracy": 0.8169032335281372,
"num_tokens": 261702691.0,
"step": 2950
},
{
"entropy": 1.001953125,
"epoch": 0.4045650242602337,
"grad_norm": 0.6991115053198638,
"learning_rate": 4.1126532337607445e-06,
"loss": 0.6893,
"mean_token_accuracy": 0.8129810094833374,
"num_tokens": 262516705.0,
"step": 2960
},
{
"entropy": 1.073828125,
"epoch": 0.4059317979908426,
"grad_norm": 0.741179797869065,
"learning_rate": 4.109130618571227e-06,
"loss": 0.7645,
"mean_token_accuracy": 0.7974372178316116,
"num_tokens": 263406987.0,
"step": 2970
},
{
"entropy": 1.067578125,
"epoch": 0.4072985717214515,
"grad_norm": 0.6987081716724939,
"learning_rate": 4.105608003381711e-06,
"loss": 0.7492,
"mean_token_accuracy": 0.7993736654520035,
"num_tokens": 264280538.0,
"step": 2980
},
{
"entropy": 1.009375,
"epoch": 0.4086653454520604,
"grad_norm": 0.7120352632703779,
"learning_rate": 4.102085388192194e-06,
"loss": 0.7163,
"mean_token_accuracy": 0.8080975443124772,
"num_tokens": 265155880.0,
"step": 2990
},
{
"entropy": 1.0607421875,
"epoch": 0.4100321191826693,
"grad_norm": 0.7266740996623666,
"learning_rate": 4.098562773002678e-06,
"loss": 0.7737,
"mean_token_accuracy": 0.7947566717863083,
"num_tokens": 266013552.0,
"step": 3000
},
{
"entropy": 0.997265625,
"epoch": 0.4113988929132782,
"grad_norm": 0.6614392028848814,
"learning_rate": 4.095040157813161e-06,
"loss": 0.7166,
"mean_token_accuracy": 0.8075192272663116,
"num_tokens": 266944824.0,
"step": 3010
},
{
"entropy": 1.0447265625,
"epoch": 0.4127656666438871,
"grad_norm": 0.7381747209760061,
"learning_rate": 4.091517542623644e-06,
"loss": 0.7447,
"mean_token_accuracy": 0.8022206068038941,
"num_tokens": 267814564.0,
"step": 3020
},
{
"entropy": 1.09140625,
"epoch": 0.414132440374496,
"grad_norm": 0.7303879770271154,
"learning_rate": 4.087994927434128e-06,
"loss": 0.7793,
"mean_token_accuracy": 0.7943702906370163,
"num_tokens": 268692641.0,
"step": 3030
},
{
"entropy": 1.058984375,
"epoch": 0.4154992141051049,
"grad_norm": 0.6413253619143907,
"learning_rate": 4.08447231224461e-06,
"loss": 0.7616,
"mean_token_accuracy": 0.797767037153244,
"num_tokens": 269542807.0,
"step": 3040
},
{
"entropy": 1.0083984375,
"epoch": 0.4168659878357138,
"grad_norm": 0.6685422828840476,
"learning_rate": 4.080949697055094e-06,
"loss": 0.6819,
"mean_token_accuracy": 0.815268212556839,
"num_tokens": 270383078.0,
"step": 3050
},
{
"entropy": 1.0185546875,
"epoch": 0.4182327615663227,
"grad_norm": 0.7374323085389747,
"learning_rate": 4.0774270818655775e-06,
"loss": 0.7293,
"mean_token_accuracy": 0.8045484244823455,
"num_tokens": 271284999.0,
"step": 3060
},
{
"entropy": 1.0638671875,
"epoch": 0.4195995352969316,
"grad_norm": 0.7150332888643343,
"learning_rate": 4.073904466676061e-06,
"loss": 0.7836,
"mean_token_accuracy": 0.7939735502004623,
"num_tokens": 272148180.0,
"step": 3070
},
{
"entropy": 1.0275390625,
"epoch": 0.4209663090275405,
"grad_norm": 0.807326414081717,
"learning_rate": 4.070381851486544e-06,
"loss": 0.7395,
"mean_token_accuracy": 0.8050776362419129,
"num_tokens": 273083027.0,
"step": 3080
},
{
"entropy": 1.0171875,
"epoch": 0.4223330827581494,
"grad_norm": 0.6577626958658912,
"learning_rate": 4.066859236297027e-06,
"loss": 0.7056,
"mean_token_accuracy": 0.8108771324157715,
"num_tokens": 273982751.0,
"step": 3090
},
{
"entropy": 1.03203125,
"epoch": 0.4236998564887583,
"grad_norm": 0.7284210651863176,
"learning_rate": 4.06333662110751e-06,
"loss": 0.7291,
"mean_token_accuracy": 0.8065966814756393,
"num_tokens": 274840518.0,
"step": 3100
},
{
"entropy": 1.0841796875,
"epoch": 0.4250666302193672,
"grad_norm": 0.6903040465220275,
"learning_rate": 4.059814005917994e-06,
"loss": 0.787,
"mean_token_accuracy": 0.7922222316265106,
"num_tokens": 275767278.0,
"step": 3110
},
{
"entropy": 1.0470703125,
"epoch": 0.4264334039499761,
"grad_norm": 0.7271112547670124,
"learning_rate": 4.056291390728477e-06,
"loss": 0.7496,
"mean_token_accuracy": 0.8013617485761643,
"num_tokens": 276644137.0,
"step": 3120
},
{
"entropy": 1.09375,
"epoch": 0.427800177680585,
"grad_norm": 0.8617337509718178,
"learning_rate": 4.052768775538961e-06,
"loss": 0.7711,
"mean_token_accuracy": 0.7965782463550568,
"num_tokens": 277549426.0,
"step": 3130
},
{
"entropy": 1.0390625,
"epoch": 0.4291669514111939,
"grad_norm": 0.7630396710155102,
"learning_rate": 4.049246160349444e-06,
"loss": 0.7803,
"mean_token_accuracy": 0.7970825910568238,
"num_tokens": 278466337.0,
"step": 3140
},
{
"entropy": 1.0126953125,
"epoch": 0.43053372514180277,
"grad_norm": 0.6844431536893472,
"learning_rate": 4.045723545159927e-06,
"loss": 0.7036,
"mean_token_accuracy": 0.8120175927877427,
"num_tokens": 279324947.0,
"step": 3150
},
{
"entropy": 0.98984375,
"epoch": 0.43190049887241166,
"grad_norm": 0.645504197604222,
"learning_rate": 4.04220092997041e-06,
"loss": 0.6772,
"mean_token_accuracy": 0.8153459429740906,
"num_tokens": 280225654.0,
"step": 3160
},
{
"entropy": 1.0125,
"epoch": 0.43326727260302056,
"grad_norm": 0.6394291718176678,
"learning_rate": 4.038678314780894e-06,
"loss": 0.7317,
"mean_token_accuracy": 0.805874040722847,
"num_tokens": 281153133.0,
"step": 3170
},
{
"entropy": 1.046875,
"epoch": 0.43463404633362945,
"grad_norm": 0.6170273118118016,
"learning_rate": 4.0351556995913775e-06,
"loss": 0.7773,
"mean_token_accuracy": 0.7932921439409256,
"num_tokens": 282083125.0,
"step": 3180
},
{
"entropy": 1.0169921875,
"epoch": 0.43600082006423835,
"grad_norm": 0.5929284103949873,
"learning_rate": 4.03163308440186e-06,
"loss": 0.7516,
"mean_token_accuracy": 0.8015512228012085,
"num_tokens": 282960536.0,
"step": 3190
},
{
"entropy": 1.0546875,
"epoch": 0.43736759379484724,
"grad_norm": 0.6672778375480539,
"learning_rate": 4.028110469212344e-06,
"loss": 0.7676,
"mean_token_accuracy": 0.8005985647439957,
"num_tokens": 283800850.0,
"step": 3200
},
{
"entropy": 1.035546875,
"epoch": 0.43873436752545614,
"grad_norm": 0.659037318244315,
"learning_rate": 4.0245878540228264e-06,
"loss": 0.7422,
"mean_token_accuracy": 0.7998364448547364,
"num_tokens": 284680091.0,
"step": 3210
},
{
"entropy": 1.0650390625,
"epoch": 0.44010114125606503,
"grad_norm": 0.7187303233986764,
"learning_rate": 4.02106523883331e-06,
"loss": 0.757,
"mean_token_accuracy": 0.8002694636583328,
"num_tokens": 285538822.0,
"step": 3220
},
{
"entropy": 1.008203125,
"epoch": 0.441467914986674,
"grad_norm": 0.6814530612322963,
"learning_rate": 4.0175426236437935e-06,
"loss": 0.7388,
"mean_token_accuracy": 0.8060995817184449,
"num_tokens": 286390073.0,
"step": 3230
},
{
"entropy": 1.034765625,
"epoch": 0.4428346887172829,
"grad_norm": 0.6900069720059793,
"learning_rate": 4.014020008454277e-06,
"loss": 0.7352,
"mean_token_accuracy": 0.8046939611434937,
"num_tokens": 287286685.0,
"step": 3240
},
{
"entropy": 1.0197265625,
"epoch": 0.44420146244789177,
"grad_norm": 0.6050313967565822,
"learning_rate": 4.01049739326476e-06,
"loss": 0.7393,
"mean_token_accuracy": 0.799989578127861,
"num_tokens": 288121053.0,
"step": 3250
},
{
"entropy": 1.028125,
"epoch": 0.44556823617850067,
"grad_norm": 0.6204309709382977,
"learning_rate": 4.006974778075243e-06,
"loss": 0.7387,
"mean_token_accuracy": 0.8044203013181687,
"num_tokens": 289016233.0,
"step": 3260
},
{
"entropy": 1.026171875,
"epoch": 0.44693500990910956,
"grad_norm": 0.5615120945124656,
"learning_rate": 4.003452162885727e-06,
"loss": 0.7681,
"mean_token_accuracy": 0.7960608392953873,
"num_tokens": 289937154.0,
"step": 3270
},
{
"entropy": 0.9791015625,
"epoch": 0.44830178363971845,
"grad_norm": 0.8130113370959436,
"learning_rate": 3.99992954769621e-06,
"loss": 0.7127,
"mean_token_accuracy": 0.808709317445755,
"num_tokens": 290823440.0,
"step": 3280
},
{
"entropy": 1.006640625,
"epoch": 0.44966855737032735,
"grad_norm": 0.6806214685972077,
"learning_rate": 3.996406932506693e-06,
"loss": 0.7484,
"mean_token_accuracy": 0.8008476197719574,
"num_tokens": 291744078.0,
"step": 3290
},
{
"entropy": 1.004296875,
"epoch": 0.45103533110093624,
"grad_norm": 0.7088752657814423,
"learning_rate": 3.992884317317177e-06,
"loss": 0.7436,
"mean_token_accuracy": 0.8023568838834763,
"num_tokens": 292683000.0,
"step": 3300
},
{
"entropy": 1.0853515625,
"epoch": 0.45240210483154514,
"grad_norm": 0.7188070435298565,
"learning_rate": 3.98936170212766e-06,
"loss": 0.7632,
"mean_token_accuracy": 0.7993375152349472,
"num_tokens": 293591908.0,
"step": 3310
},
{
"entropy": 0.997265625,
"epoch": 0.45376887856215403,
"grad_norm": 0.6299393470247882,
"learning_rate": 3.985839086938143e-06,
"loss": 0.7074,
"mean_token_accuracy": 0.8102503985166549,
"num_tokens": 294468616.0,
"step": 3320
},
{
"entropy": 1.0423828125,
"epoch": 0.4551356522927629,
"grad_norm": 0.7005267713233797,
"learning_rate": 3.9823164717486265e-06,
"loss": 0.7909,
"mean_token_accuracy": 0.7921394914388656,
"num_tokens": 295394199.0,
"step": 3330
},
{
"entropy": 1.0369140625,
"epoch": 0.4565024260233718,
"grad_norm": 0.6567216722279956,
"learning_rate": 3.97879385655911e-06,
"loss": 0.7426,
"mean_token_accuracy": 0.8032429575920105,
"num_tokens": 296273215.0,
"step": 3340
},
{
"entropy": 1.0470703125,
"epoch": 0.4578691997539807,
"grad_norm": 0.6726660807818218,
"learning_rate": 3.9752712413695936e-06,
"loss": 0.7598,
"mean_token_accuracy": 0.7974883317947388,
"num_tokens": 297148572.0,
"step": 3350
},
{
"entropy": 1.1201171875,
"epoch": 0.4592359734845896,
"grad_norm": 0.6238898379593816,
"learning_rate": 3.971748626180076e-06,
"loss": 0.7948,
"mean_token_accuracy": 0.7926835298538208,
"num_tokens": 298039662.0,
"step": 3360
},
{
"entropy": 1.037890625,
"epoch": 0.4606027472151985,
"grad_norm": 0.666961386563524,
"learning_rate": 3.96822601099056e-06,
"loss": 0.7558,
"mean_token_accuracy": 0.799272945523262,
"num_tokens": 298956252.0,
"step": 3370
},
{
"entropy": 1.028515625,
"epoch": 0.4619695209458074,
"grad_norm": 0.6949887311189878,
"learning_rate": 3.9647033958010425e-06,
"loss": 0.7912,
"mean_token_accuracy": 0.7920649409294128,
"num_tokens": 299823280.0,
"step": 3380
},
{
"entropy": 1.040625,
"epoch": 0.4633362946764163,
"grad_norm": 0.7070915545689106,
"learning_rate": 3.961180780611527e-06,
"loss": 0.7348,
"mean_token_accuracy": 0.8035056173801423,
"num_tokens": 300704268.0,
"step": 3390
},
{
"entropy": 1.0666015625,
"epoch": 0.46470306840702524,
"grad_norm": 0.6112458989542301,
"learning_rate": 3.95765816542201e-06,
"loss": 0.7879,
"mean_token_accuracy": 0.7948038816452027,
"num_tokens": 301638457.0,
"step": 3400
},
{
"entropy": 1.044921875,
"epoch": 0.46606984213763414,
"grad_norm": 0.6257628916205906,
"learning_rate": 3.954135550232493e-06,
"loss": 0.7182,
"mean_token_accuracy": 0.8063306748867035,
"num_tokens": 302495464.0,
"step": 3410
},
{
"entropy": 1.059375,
"epoch": 0.46743661586824303,
"grad_norm": 0.6719771367540622,
"learning_rate": 3.950612935042976e-06,
"loss": 0.7712,
"mean_token_accuracy": 0.7956838965415954,
"num_tokens": 303376908.0,
"step": 3420
},
{
"entropy": 1.010546875,
"epoch": 0.4688033895988519,
"grad_norm": 0.6604495366755494,
"learning_rate": 3.947090319853459e-06,
"loss": 0.7363,
"mean_token_accuracy": 0.8036669582128525,
"num_tokens": 304255583.0,
"step": 3430
},
{
"entropy": 1.08359375,
"epoch": 0.4701701633294608,
"grad_norm": 0.6947909455210323,
"learning_rate": 3.943567704663943e-06,
"loss": 0.7765,
"mean_token_accuracy": 0.7967017829418183,
"num_tokens": 305117375.0,
"step": 3440
},
{
"entropy": 1.02734375,
"epoch": 0.4715369370600697,
"grad_norm": 0.7335263372044268,
"learning_rate": 3.9400450894744265e-06,
"loss": 0.7695,
"mean_token_accuracy": 0.7957329303026199,
"num_tokens": 305964787.0,
"step": 3450
},
{
"entropy": 1.0640625,
"epoch": 0.4729037107906786,
"grad_norm": 0.7913384455029474,
"learning_rate": 3.936522474284909e-06,
"loss": 0.7669,
"mean_token_accuracy": 0.7967384845018387,
"num_tokens": 306874371.0,
"step": 3460
},
{
"entropy": 1.0318359375,
"epoch": 0.4742704845212875,
"grad_norm": 0.7620766345895493,
"learning_rate": 3.932999859095393e-06,
"loss": 0.7424,
"mean_token_accuracy": 0.8033639818429947,
"num_tokens": 307828178.0,
"step": 3470
},
{
"entropy": 1.0185546875,
"epoch": 0.4756372582518964,
"grad_norm": 0.6757621835865483,
"learning_rate": 3.929477243905876e-06,
"loss": 0.7209,
"mean_token_accuracy": 0.8073303073644638,
"num_tokens": 308715305.0,
"step": 3480
},
{
"entropy": 1.068359375,
"epoch": 0.4770040319825053,
"grad_norm": 0.8389183840113517,
"learning_rate": 3.925954628716359e-06,
"loss": 0.7419,
"mean_token_accuracy": 0.8056415826082229,
"num_tokens": 309596173.0,
"step": 3490
},
{
"entropy": 1.0677734375,
"epoch": 0.4783708057131142,
"grad_norm": 0.7346911827931291,
"learning_rate": 3.9224320135268425e-06,
"loss": 0.7482,
"mean_token_accuracy": 0.7990102618932724,
"num_tokens": 310464726.0,
"step": 3500
},
{
"entropy": 1.0431640625,
"epoch": 0.4797375794437231,
"grad_norm": 0.7260274245699219,
"learning_rate": 3.918909398337326e-06,
"loss": 0.7384,
"mean_token_accuracy": 0.8045160651206971,
"num_tokens": 311349143.0,
"step": 3510
},
{
"entropy": 1.0474609375,
"epoch": 0.481104353174332,
"grad_norm": 0.6646660280608785,
"learning_rate": 3.91538678314781e-06,
"loss": 0.7538,
"mean_token_accuracy": 0.8004951298236846,
"num_tokens": 312240199.0,
"step": 3520
},
{
"entropy": 1.04296875,
"epoch": 0.4824711269049409,
"grad_norm": 0.6311967510427017,
"learning_rate": 3.911864167958292e-06,
"loss": 0.739,
"mean_token_accuracy": 0.8032552510499954,
"num_tokens": 313135937.0,
"step": 3530
},
{
"entropy": 1.0251953125,
"epoch": 0.48383790063554977,
"grad_norm": 0.6811705233425357,
"learning_rate": 3.908341552768776e-06,
"loss": 0.7579,
"mean_token_accuracy": 0.7989296853542328,
"num_tokens": 314018252.0,
"step": 3540
},
{
"entropy": 1.048828125,
"epoch": 0.48520467436615866,
"grad_norm": 0.7784024540614994,
"learning_rate": 3.9048189375792586e-06,
"loss": 0.7481,
"mean_token_accuracy": 0.7982779204845428,
"num_tokens": 314871616.0,
"step": 3550
},
{
"entropy": 1.054296875,
"epoch": 0.48657144809676756,
"grad_norm": 0.644821764160877,
"learning_rate": 3.901296322389743e-06,
"loss": 0.7832,
"mean_token_accuracy": 0.7946348160505294,
"num_tokens": 315729836.0,
"step": 3560
},
{
"entropy": 1.05625,
"epoch": 0.48793822182737645,
"grad_norm": 0.7002733847166804,
"learning_rate": 3.897773707200226e-06,
"loss": 0.7527,
"mean_token_accuracy": 0.7987490206956863,
"num_tokens": 316602383.0,
"step": 3570
},
{
"entropy": 1.04453125,
"epoch": 0.4893049955579854,
"grad_norm": 0.7189719643630321,
"learning_rate": 3.894251092010709e-06,
"loss": 0.7366,
"mean_token_accuracy": 0.8003195315599442,
"num_tokens": 317513326.0,
"step": 3580
},
{
"entropy": 1.0080078125,
"epoch": 0.4906717692885943,
"grad_norm": 0.6365594444098862,
"learning_rate": 3.890728476821192e-06,
"loss": 0.714,
"mean_token_accuracy": 0.8079932987689972,
"num_tokens": 318374110.0,
"step": 3590
},
{
"entropy": 0.9962890625,
"epoch": 0.4920385430192032,
"grad_norm": 0.6502404520147075,
"learning_rate": 3.8872058616316755e-06,
"loss": 0.6967,
"mean_token_accuracy": 0.8139762669801712,
"num_tokens": 319229245.0,
"step": 3600
},
{
"entropy": 1.01015625,
"epoch": 0.4934053167498121,
"grad_norm": 0.6901291210406147,
"learning_rate": 3.883683246442159e-06,
"loss": 0.7566,
"mean_token_accuracy": 0.7992701768875122,
"num_tokens": 320108614.0,
"step": 3610
},
{
"entropy": 1.0318359375,
"epoch": 0.494772090480421,
"grad_norm": 0.6896076081290561,
"learning_rate": 3.8801606312526426e-06,
"loss": 0.7087,
"mean_token_accuracy": 0.8087357491254806,
"num_tokens": 321041845.0,
"step": 3620
},
{
"entropy": 0.9791015625,
"epoch": 0.4961388642110299,
"grad_norm": 0.6717107246757519,
"learning_rate": 3.876638016063125e-06,
"loss": 0.6653,
"mean_token_accuracy": 0.8199510991573333,
"num_tokens": 321942482.0,
"step": 3630
},
{
"entropy": 1.02265625,
"epoch": 0.49750563794163877,
"grad_norm": 0.6992765107778841,
"learning_rate": 3.873115400873609e-06,
"loss": 0.7098,
"mean_token_accuracy": 0.8088101625442505,
"num_tokens": 322786504.0,
"step": 3640
},
{
"entropy": 1.033984375,
"epoch": 0.49887241167224766,
"grad_norm": 0.6778189568297441,
"learning_rate": 3.869592785684092e-06,
"loss": 0.7621,
"mean_token_accuracy": 0.79754938185215,
"num_tokens": 323673486.0,
"step": 3650
},
{
"entropy": 1.0544921875,
"epoch": 0.5002391854028566,
"grad_norm": 0.5743171832922257,
"learning_rate": 3.866070170494575e-06,
"loss": 0.741,
"mean_token_accuracy": 0.8048469752073288,
"num_tokens": 324539268.0,
"step": 3660
},
{
"entropy": 1.055078125,
"epoch": 0.5016059591334655,
"grad_norm": 0.7741082277844497,
"learning_rate": 3.862547555305059e-06,
"loss": 0.7655,
"mean_token_accuracy": 0.7971713244915009,
"num_tokens": 325467313.0,
"step": 3670
},
{
"entropy": 1.049609375,
"epoch": 0.5029727328640744,
"grad_norm": 0.7415343789404953,
"learning_rate": 3.859024940115542e-06,
"loss": 0.7365,
"mean_token_accuracy": 0.8039636313915253,
"num_tokens": 326360349.0,
"step": 3680
},
{
"entropy": 1.0013671875,
"epoch": 0.5043395065946833,
"grad_norm": 0.6082752121051939,
"learning_rate": 3.855502324926026e-06,
"loss": 0.6945,
"mean_token_accuracy": 0.8138342827558518,
"num_tokens": 327295014.0,
"step": 3690
},
{
"entropy": 1.0173828125,
"epoch": 0.5057062803252922,
"grad_norm": 0.6826968983112569,
"learning_rate": 3.851979709736508e-06,
"loss": 0.7336,
"mean_token_accuracy": 0.8042835116386413,
"num_tokens": 328166096.0,
"step": 3700
},
{
"entropy": 1.0560546875,
"epoch": 0.5070730540559011,
"grad_norm": 0.6585148956883877,
"learning_rate": 3.848457094546992e-06,
"loss": 0.7527,
"mean_token_accuracy": 0.8013715863227844,
"num_tokens": 329044476.0,
"step": 3710
},
{
"entropy": 1.009765625,
"epoch": 0.50843982778651,
"grad_norm": 0.6102709130448235,
"learning_rate": 3.8449344793574755e-06,
"loss": 0.7448,
"mean_token_accuracy": 0.8030769199132919,
"num_tokens": 329954219.0,
"step": 3720
},
{
"entropy": 1.0318359375,
"epoch": 0.5098066015171189,
"grad_norm": 0.5968327451978446,
"learning_rate": 3.841411864167959e-06,
"loss": 0.7758,
"mean_token_accuracy": 0.7954621225595474,
"num_tokens": 330824306.0,
"step": 3730
},
{
"entropy": 1.0501953125,
"epoch": 0.5111733752477278,
"grad_norm": 0.7455079600958936,
"learning_rate": 3.837889248978442e-06,
"loss": 0.7809,
"mean_token_accuracy": 0.7927061140537262,
"num_tokens": 331697014.0,
"step": 3740
},
{
"entropy": 1.02265625,
"epoch": 0.5125401489783367,
"grad_norm": 0.7049386822135458,
"learning_rate": 3.834366633788925e-06,
"loss": 0.7089,
"mean_token_accuracy": 0.8113010883331299,
"num_tokens": 332591752.0,
"step": 3750
},
{
"entropy": 1.0376953125,
"epoch": 0.5139069227089456,
"grad_norm": 0.729553837810803,
"learning_rate": 3.830844018599408e-06,
"loss": 0.7165,
"mean_token_accuracy": 0.8074272692203521,
"num_tokens": 333428436.0,
"step": 3760
},
{
"entropy": 1.0529296875,
"epoch": 0.5152736964395545,
"grad_norm": 0.6708065328745597,
"learning_rate": 3.8273214034098915e-06,
"loss": 0.7547,
"mean_token_accuracy": 0.8014336943626403,
"num_tokens": 334312680.0,
"step": 3770
},
{
"entropy": 1.0611328125,
"epoch": 0.5166404701701633,
"grad_norm": 0.6809045045249535,
"learning_rate": 3.823798788220375e-06,
"loss": 0.7487,
"mean_token_accuracy": 0.8005068302154541,
"num_tokens": 335170349.0,
"step": 3780
},
{
"entropy": 0.996875,
"epoch": 0.5180072439007722,
"grad_norm": 0.7139028599299945,
"learning_rate": 3.820276173030859e-06,
"loss": 0.7289,
"mean_token_accuracy": 0.8054252594709397,
"num_tokens": 336022826.0,
"step": 3790
},
{
"entropy": 1.01171875,
"epoch": 0.5193740176313811,
"grad_norm": 0.6960714288901958,
"learning_rate": 3.816753557841341e-06,
"loss": 0.7147,
"mean_token_accuracy": 0.8075532734394073,
"num_tokens": 336888400.0,
"step": 3800
},
{
"entropy": 1.031640625,
"epoch": 0.52074079136199,
"grad_norm": 0.6837000020440406,
"learning_rate": 3.813230942651825e-06,
"loss": 0.7626,
"mean_token_accuracy": 0.7986936271190643,
"num_tokens": 337726810.0,
"step": 3810
},
{
"entropy": 1.0412109375,
"epoch": 0.5221075650925989,
"grad_norm": 0.6651542383297837,
"learning_rate": 3.809708327462308e-06,
"loss": 0.7202,
"mean_token_accuracy": 0.8066377907991409,
"num_tokens": 338587129.0,
"step": 3820
},
{
"entropy": 1.0470703125,
"epoch": 0.5234743388232078,
"grad_norm": 0.6495316119049112,
"learning_rate": 3.806185712272792e-06,
"loss": 0.7665,
"mean_token_accuracy": 0.7982558697462082,
"num_tokens": 339495137.0,
"step": 3830
},
{
"entropy": 1.099609375,
"epoch": 0.5248411125538167,
"grad_norm": 0.6754323428565718,
"learning_rate": 3.802663097083275e-06,
"loss": 0.8128,
"mean_token_accuracy": 0.7884750038385391,
"num_tokens": 340326128.0,
"step": 3840
},
{
"entropy": 1.0388671875,
"epoch": 0.5262078862844256,
"grad_norm": 0.6703885242782893,
"learning_rate": 3.799140481893758e-06,
"loss": 0.7378,
"mean_token_accuracy": 0.801518714427948,
"num_tokens": 341183998.0,
"step": 3850
},
{
"entropy": 1.0056640625,
"epoch": 0.5275746600150345,
"grad_norm": 0.6432310588228002,
"learning_rate": 3.7956178667042413e-06,
"loss": 0.7199,
"mean_token_accuracy": 0.808662086725235,
"num_tokens": 342030730.0,
"step": 3860
},
{
"entropy": 0.9822265625,
"epoch": 0.5289414337456434,
"grad_norm": 0.6605560941812774,
"learning_rate": 3.792095251514725e-06,
"loss": 0.7221,
"mean_token_accuracy": 0.8060262531042099,
"num_tokens": 342928649.0,
"step": 3870
},
{
"entropy": 1.0126953125,
"epoch": 0.5303082074762523,
"grad_norm": 0.6594434559353495,
"learning_rate": 3.788572636325208e-06,
"loss": 0.7341,
"mean_token_accuracy": 0.8060806483030319,
"num_tokens": 343852240.0,
"step": 3880
},
{
"entropy": 1.003515625,
"epoch": 0.5316749812068612,
"grad_norm": 0.6187351825227708,
"learning_rate": 3.7850500211356916e-06,
"loss": 0.704,
"mean_token_accuracy": 0.8088907390832901,
"num_tokens": 344750196.0,
"step": 3890
},
{
"entropy": 1.037109375,
"epoch": 0.5330417549374701,
"grad_norm": 0.6661037082946246,
"learning_rate": 3.7815274059461747e-06,
"loss": 0.7367,
"mean_token_accuracy": 0.8027608901262283,
"num_tokens": 345621623.0,
"step": 3900
},
{
"entropy": 1.0169921875,
"epoch": 0.534408528668079,
"grad_norm": 0.59443028424321,
"learning_rate": 3.7780047907566582e-06,
"loss": 0.6906,
"mean_token_accuracy": 0.8136760413646698,
"num_tokens": 346526744.0,
"step": 3910
},
{
"entropy": 1.0265625,
"epoch": 0.5357753023986879,
"grad_norm": 0.613378693442402,
"learning_rate": 3.7744821755671413e-06,
"loss": 0.7155,
"mean_token_accuracy": 0.8097250252962113,
"num_tokens": 347436449.0,
"step": 3920
},
{
"entropy": 1.034375,
"epoch": 0.5371420761292968,
"grad_norm": 0.649899799559019,
"learning_rate": 3.7709595603776245e-06,
"loss": 0.7363,
"mean_token_accuracy": 0.8056155890226364,
"num_tokens": 348331917.0,
"step": 3930
},
{
"entropy": 1.05703125,
"epoch": 0.5385088498599057,
"grad_norm": 0.7611101035673546,
"learning_rate": 3.767436945188108e-06,
"loss": 0.7549,
"mean_token_accuracy": 0.7993716090917588,
"num_tokens": 349199022.0,
"step": 3940
},
{
"entropy": 0.9962890625,
"epoch": 0.5398756235905146,
"grad_norm": 0.6695373984943555,
"learning_rate": 3.7639143299985916e-06,
"loss": 0.7285,
"mean_token_accuracy": 0.8050308763980866,
"num_tokens": 350085246.0,
"step": 3950
},
{
"entropy": 1.05390625,
"epoch": 0.5412423973211234,
"grad_norm": 0.6324055041375802,
"learning_rate": 3.7603917148090747e-06,
"loss": 0.7307,
"mean_token_accuracy": 0.8055595993995667,
"num_tokens": 350974056.0,
"step": 3960
},
{
"entropy": 1.01484375,
"epoch": 0.5426091710517323,
"grad_norm": 0.6797701477365667,
"learning_rate": 3.756869099619558e-06,
"loss": 0.7038,
"mean_token_accuracy": 0.8100059986114502,
"num_tokens": 351864137.0,
"step": 3970
},
{
"entropy": 1.00390625,
"epoch": 0.5439759447823412,
"grad_norm": 0.6651366480057693,
"learning_rate": 3.753346484430041e-06,
"loss": 0.7234,
"mean_token_accuracy": 0.8057575911283493,
"num_tokens": 352741822.0,
"step": 3980
},
{
"entropy": 1.005078125,
"epoch": 0.5453427185129501,
"grad_norm": 0.6603207363381411,
"learning_rate": 3.749823869240524e-06,
"loss": 0.702,
"mean_token_accuracy": 0.8124361783266068,
"num_tokens": 353612932.0,
"step": 3990
},
{
"entropy": 0.98515625,
"epoch": 0.546709492243559,
"grad_norm": 0.7668869545272685,
"learning_rate": 3.746301254051008e-06,
"loss": 0.6868,
"mean_token_accuracy": 0.8145255506038666,
"num_tokens": 354489469.0,
"step": 4000
},
{
"entropy": 1.0076171875,
"epoch": 0.548076265974168,
"grad_norm": 0.6533378661874915,
"learning_rate": 3.742778638861491e-06,
"loss": 0.7278,
"mean_token_accuracy": 0.8039277702569961,
"num_tokens": 355362081.0,
"step": 4010
},
{
"entropy": 1.032421875,
"epoch": 0.5494430397047769,
"grad_norm": 0.6395723650886571,
"learning_rate": 3.7392560236719743e-06,
"loss": 0.7439,
"mean_token_accuracy": 0.8001495033502579,
"num_tokens": 356206559.0,
"step": 4020
},
{
"entropy": 0.9796875,
"epoch": 0.5508098134353858,
"grad_norm": 0.6537086104667109,
"learning_rate": 3.7357334084824574e-06,
"loss": 0.6828,
"mean_token_accuracy": 0.8154332518577576,
"num_tokens": 357084489.0,
"step": 4030
},
{
"entropy": 1.002734375,
"epoch": 0.5521765871659947,
"grad_norm": 0.7161548220908126,
"learning_rate": 3.732210793292941e-06,
"loss": 0.7096,
"mean_token_accuracy": 0.8087851762771606,
"num_tokens": 357975361.0,
"step": 4040
},
{
"entropy": 1.047265625,
"epoch": 0.5535433608966036,
"grad_norm": 0.6795884222536405,
"learning_rate": 3.7286881781034245e-06,
"loss": 0.7389,
"mean_token_accuracy": 0.8024173021316529,
"num_tokens": 358878614.0,
"step": 4050
},
{
"entropy": 1.005859375,
"epoch": 0.5549101346272125,
"grad_norm": 0.5852569242105304,
"learning_rate": 3.7251655629139076e-06,
"loss": 0.6979,
"mean_token_accuracy": 0.8114600956439972,
"num_tokens": 359801961.0,
"step": 4060
},
{
"entropy": 1.053125,
"epoch": 0.5562769083578214,
"grad_norm": 0.6578550318986612,
"learning_rate": 3.7216429477243907e-06,
"loss": 0.7461,
"mean_token_accuracy": 0.7992701888084411,
"num_tokens": 360684656.0,
"step": 4070
},
{
"entropy": 1.0240234375,
"epoch": 0.5576436820884303,
"grad_norm": 0.6508385762596343,
"learning_rate": 3.7181203325348743e-06,
"loss": 0.7353,
"mean_token_accuracy": 0.804370504617691,
"num_tokens": 361604630.0,
"step": 4080
},
{
"entropy": 1.06875,
"epoch": 0.5590104558190392,
"grad_norm": 0.7226491947139827,
"learning_rate": 3.7145977173453574e-06,
"loss": 0.7766,
"mean_token_accuracy": 0.7951119482517243,
"num_tokens": 362453556.0,
"step": 4090
},
{
"entropy": 1.0208984375,
"epoch": 0.5603772295496481,
"grad_norm": 0.6439737035898431,
"learning_rate": 3.7110751021558405e-06,
"loss": 0.7218,
"mean_token_accuracy": 0.8054970890283585,
"num_tokens": 363318401.0,
"step": 4100
},
{
"entropy": 1.0107421875,
"epoch": 0.561744003280257,
"grad_norm": 0.6656562343916809,
"learning_rate": 3.7075524869663245e-06,
"loss": 0.7056,
"mean_token_accuracy": 0.8100204110145569,
"num_tokens": 364242506.0,
"step": 4110
},
{
"entropy": 1.021484375,
"epoch": 0.5631107770108659,
"grad_norm": 0.6410158163653114,
"learning_rate": 3.7040298717768076e-06,
"loss": 0.7517,
"mean_token_accuracy": 0.8025381326675415,
"num_tokens": 365155052.0,
"step": 4120
},
{
"entropy": 1.057421875,
"epoch": 0.5644775507414748,
"grad_norm": 0.6796787005045218,
"learning_rate": 3.7005072565872908e-06,
"loss": 0.7615,
"mean_token_accuracy": 0.7991450190544128,
"num_tokens": 366080792.0,
"step": 4130
},
{
"entropy": 1.039453125,
"epoch": 0.5658443244720837,
"grad_norm": 0.68869130610371,
"learning_rate": 3.696984641397774e-06,
"loss": 0.766,
"mean_token_accuracy": 0.7957821071147919,
"num_tokens": 366962396.0,
"step": 4140
},
{
"entropy": 0.9787109375,
"epoch": 0.5672110982026926,
"grad_norm": 0.7167130641436852,
"learning_rate": 3.693462026208257e-06,
"loss": 0.6913,
"mean_token_accuracy": 0.8134026736021042,
"num_tokens": 367850915.0,
"step": 4150
},
{
"entropy": 1.0298828125,
"epoch": 0.5685778719333014,
"grad_norm": 0.6331385541933299,
"learning_rate": 3.689939411018741e-06,
"loss": 0.735,
"mean_token_accuracy": 0.8063072681427002,
"num_tokens": 368779867.0,
"step": 4160
},
{
"entropy": 0.9828125,
"epoch": 0.5699446456639103,
"grad_norm": 0.651834405699773,
"learning_rate": 3.686416795829224e-06,
"loss": 0.6667,
"mean_token_accuracy": 0.8194939970970154,
"num_tokens": 369657800.0,
"step": 4170
},
{
"entropy": 1.02734375,
"epoch": 0.5713114193945192,
"grad_norm": 0.6701554925904178,
"learning_rate": 3.6828941806397072e-06,
"loss": 0.7375,
"mean_token_accuracy": 0.8040597140789032,
"num_tokens": 370511372.0,
"step": 4180
},
{
"entropy": 1.0306640625,
"epoch": 0.5726781931251281,
"grad_norm": 0.6662378162647455,
"learning_rate": 3.6793715654501903e-06,
"loss": 0.7549,
"mean_token_accuracy": 0.7989726930856704,
"num_tokens": 371416237.0,
"step": 4190
},
{
"entropy": 1.037890625,
"epoch": 0.574044966855737,
"grad_norm": 0.7881137667283706,
"learning_rate": 3.6758489502606735e-06,
"loss": 0.7493,
"mean_token_accuracy": 0.8018577963113784,
"num_tokens": 372347297.0,
"step": 4200
},
{
"entropy": 1.04296875,
"epoch": 0.5754117405863459,
"grad_norm": 0.6975722006023481,
"learning_rate": 3.672326335071157e-06,
"loss": 0.7307,
"mean_token_accuracy": 0.8043183356523513,
"num_tokens": 373210792.0,
"step": 4210
},
{
"entropy": 1.00390625,
"epoch": 0.5767785143169548,
"grad_norm": 0.6778856006898871,
"learning_rate": 3.6688037198816406e-06,
"loss": 0.7141,
"mean_token_accuracy": 0.8090073347091675,
"num_tokens": 374082669.0,
"step": 4220
},
{
"entropy": 1.0189453125,
"epoch": 0.5781452880475637,
"grad_norm": 0.7549511700465201,
"learning_rate": 3.6652811046921237e-06,
"loss": 0.724,
"mean_token_accuracy": 0.8069464415311813,
"num_tokens": 374934918.0,
"step": 4230
},
{
"entropy": 1.019921875,
"epoch": 0.5795120617781726,
"grad_norm": 0.6368180814378112,
"learning_rate": 3.6617584895026072e-06,
"loss": 0.7002,
"mean_token_accuracy": 0.8108852326869964,
"num_tokens": 375792139.0,
"step": 4240
},
{
"entropy": 1.0765625,
"epoch": 0.5808788355087815,
"grad_norm": 0.7139178400383172,
"learning_rate": 3.6582358743130904e-06,
"loss": 0.7866,
"mean_token_accuracy": 0.7892195463180542,
"num_tokens": 376683914.0,
"step": 4250
},
{
"entropy": 1.021484375,
"epoch": 0.5822456092393904,
"grad_norm": 0.6654701515373627,
"learning_rate": 3.6547132591235735e-06,
"loss": 0.7436,
"mean_token_accuracy": 0.80068139731884,
"num_tokens": 377543065.0,
"step": 4260
},
{
"entropy": 1.055078125,
"epoch": 0.5836123829699993,
"grad_norm": 0.7559917981515762,
"learning_rate": 3.651190643934057e-06,
"loss": 0.7654,
"mean_token_accuracy": 0.7982774943113327,
"num_tokens": 378369281.0,
"step": 4270
},
{
"entropy": 1.0271484375,
"epoch": 0.5849791567006082,
"grad_norm": 0.6638469455503714,
"learning_rate": 3.6476680287445406e-06,
"loss": 0.7372,
"mean_token_accuracy": 0.8044341504573822,
"num_tokens": 379279878.0,
"step": 4280
},
{
"entropy": 0.991796875,
"epoch": 0.5863459304312171,
"grad_norm": 0.6341265044410563,
"learning_rate": 3.6441454135550237e-06,
"loss": 0.7052,
"mean_token_accuracy": 0.810255479812622,
"num_tokens": 380191500.0,
"step": 4290
},
{
"entropy": 1.042578125,
"epoch": 0.587712704161826,
"grad_norm": 0.6806819093591229,
"learning_rate": 3.640622798365507e-06,
"loss": 0.7378,
"mean_token_accuracy": 0.8045147031545639,
"num_tokens": 381087074.0,
"step": 4300
},
{
"entropy": 1.0720703125,
"epoch": 0.5890794778924349,
"grad_norm": 0.645260939956569,
"learning_rate": 3.63710018317599e-06,
"loss": 0.7749,
"mean_token_accuracy": 0.795120307803154,
"num_tokens": 381979733.0,
"step": 4310
},
{
"entropy": 1.0837890625,
"epoch": 0.5904462516230438,
"grad_norm": 0.7315285254656948,
"learning_rate": 3.633577567986473e-06,
"loss": 0.7584,
"mean_token_accuracy": 0.7987747997045517,
"num_tokens": 382847154.0,
"step": 4320
},
{
"entropy": 1.0337890625,
"epoch": 0.5918130253536527,
"grad_norm": 0.6607664692142365,
"learning_rate": 3.630054952796957e-06,
"loss": 0.7076,
"mean_token_accuracy": 0.8082605481147767,
"num_tokens": 383707807.0,
"step": 4330
},
{
"entropy": 1.06796875,
"epoch": 0.5931797990842615,
"grad_norm": 0.6414722321180464,
"learning_rate": 3.62653233760744e-06,
"loss": 0.8065,
"mean_token_accuracy": 0.7881005287170411,
"num_tokens": 384590386.0,
"step": 4340
},
{
"entropy": 1.03984375,
"epoch": 0.5945465728148704,
"grad_norm": 0.720259597305389,
"learning_rate": 3.6230097224179233e-06,
"loss": 0.7031,
"mean_token_accuracy": 0.8124631881713867,
"num_tokens": 385369969.0,
"step": 4350
},
{
"entropy": 1.0189453125,
"epoch": 0.5959133465454794,
"grad_norm": 0.7075668783012797,
"learning_rate": 3.6194871072284064e-06,
"loss": 0.7387,
"mean_token_accuracy": 0.8040793180465698,
"num_tokens": 386273775.0,
"step": 4360
},
{
"entropy": 1.055859375,
"epoch": 0.5972801202760883,
"grad_norm": 0.7509322733169231,
"learning_rate": 3.61596449203889e-06,
"loss": 0.724,
"mean_token_accuracy": 0.8055807948112488,
"num_tokens": 387155485.0,
"step": 4370
},
{
"entropy": 0.9732421875,
"epoch": 0.5986468940066972,
"grad_norm": 0.5897178352068814,
"learning_rate": 3.6124418768493735e-06,
"loss": 0.6982,
"mean_token_accuracy": 0.8130936056375504,
"num_tokens": 388029225.0,
"step": 4380
},
{
"entropy": 1.032421875,
"epoch": 0.6000136677373061,
"grad_norm": 0.6316021885833543,
"learning_rate": 3.6089192616598566e-06,
"loss": 0.7507,
"mean_token_accuracy": 0.801616781949997,
"num_tokens": 388973428.0,
"step": 4390
},
{
"entropy": 1.04375,
"epoch": 0.601380441467915,
"grad_norm": 0.7279721453687853,
"learning_rate": 3.6053966464703398e-06,
"loss": 0.7881,
"mean_token_accuracy": 0.7949098169803619,
"num_tokens": 389826917.0,
"step": 4400
},
{
"entropy": 1.057421875,
"epoch": 0.6027472151985239,
"grad_norm": 0.6429364519108608,
"learning_rate": 3.6018740312808233e-06,
"loss": 0.7647,
"mean_token_accuracy": 0.7962178438901901,
"num_tokens": 390768332.0,
"step": 4410
},
{
"entropy": 1.0134765625,
"epoch": 0.6041139889291328,
"grad_norm": 0.7140906478054386,
"learning_rate": 3.5983514160913064e-06,
"loss": 0.7262,
"mean_token_accuracy": 0.803639394044876,
"num_tokens": 391673598.0,
"step": 4420
},
{
"entropy": 1.036328125,
"epoch": 0.6054807626597417,
"grad_norm": 0.6312482265838942,
"learning_rate": 3.5948288009017895e-06,
"loss": 0.7427,
"mean_token_accuracy": 0.8041273295879364,
"num_tokens": 392570813.0,
"step": 4430
},
{
"entropy": 1.0470703125,
"epoch": 0.6068475363903506,
"grad_norm": 0.6745517170724407,
"learning_rate": 3.591306185712273e-06,
"loss": 0.7807,
"mean_token_accuracy": 0.7956268191337585,
"num_tokens": 393449571.0,
"step": 4440
},
{
"entropy": 1.074609375,
"epoch": 0.6082143101209595,
"grad_norm": 0.6377997626115638,
"learning_rate": 3.5877835705227566e-06,
"loss": 0.7691,
"mean_token_accuracy": 0.7971708178520203,
"num_tokens": 394310855.0,
"step": 4450
},
{
"entropy": 1.0130859375,
"epoch": 0.6095810838515684,
"grad_norm": 1.0799333041422565,
"learning_rate": 3.5842609553332398e-06,
"loss": 0.7354,
"mean_token_accuracy": 0.8063646018505096,
"num_tokens": 395201869.0,
"step": 4460
},
{
"entropy": 1.0248046875,
"epoch": 0.6109478575821773,
"grad_norm": 0.7164016231970096,
"learning_rate": 3.580738340143723e-06,
"loss": 0.7365,
"mean_token_accuracy": 0.8040270239114762,
"num_tokens": 396084305.0,
"step": 4470
},
{
"entropy": 1.026953125,
"epoch": 0.6123146313127862,
"grad_norm": 0.6704263929287188,
"learning_rate": 3.577215724954206e-06,
"loss": 0.7471,
"mean_token_accuracy": 0.8011558085680008,
"num_tokens": 396999249.0,
"step": 4480
},
{
"entropy": 1.06171875,
"epoch": 0.6136814050433951,
"grad_norm": 0.606655407069529,
"learning_rate": 3.57369310976469e-06,
"loss": 0.7767,
"mean_token_accuracy": 0.7932609111070633,
"num_tokens": 397841168.0,
"step": 4490
},
{
"entropy": 1.0568359375,
"epoch": 0.615048178774004,
"grad_norm": 0.6435276497355985,
"learning_rate": 3.570170494575173e-06,
"loss": 0.758,
"mean_token_accuracy": 0.7997577220201493,
"num_tokens": 398754063.0,
"step": 4500
},
{
"entropy": 1.0869140625,
"epoch": 0.6164149525046129,
"grad_norm": 0.6948866788462399,
"learning_rate": 3.5666478793856562e-06,
"loss": 0.825,
"mean_token_accuracy": 0.7845769345760345,
"num_tokens": 399621156.0,
"step": 4510
},
{
"entropy": 1.0162109375,
"epoch": 0.6177817262352218,
"grad_norm": 0.7349743966118655,
"learning_rate": 3.5631252641961394e-06,
"loss": 0.7234,
"mean_token_accuracy": 0.8058375209569931,
"num_tokens": 400472687.0,
"step": 4520
},
{
"entropy": 0.9767578125,
"epoch": 0.6191484999658307,
"grad_norm": 0.6731602969123874,
"learning_rate": 3.5596026490066225e-06,
"loss": 0.696,
"mean_token_accuracy": 0.8121082812547684,
"num_tokens": 401390570.0,
"step": 4530
},
{
"entropy": 1.021875,
"epoch": 0.6205152736964396,
"grad_norm": 0.6739368040639884,
"learning_rate": 3.556080033817106e-06,
"loss": 0.7215,
"mean_token_accuracy": 0.8075768560171127,
"num_tokens": 402248186.0,
"step": 4540
},
{
"entropy": 1.0806640625,
"epoch": 0.6218820474270484,
"grad_norm": 0.6977038067046744,
"learning_rate": 3.5525574186275896e-06,
"loss": 0.7937,
"mean_token_accuracy": 0.7915772438049317,
"num_tokens": 403093559.0,
"step": 4550
},
{
"entropy": 1.070703125,
"epoch": 0.6232488211576573,
"grad_norm": 0.7057379096344006,
"learning_rate": 3.5490348034380727e-06,
"loss": 0.7723,
"mean_token_accuracy": 0.7965468317270279,
"num_tokens": 403992480.0,
"step": 4560
},
{
"entropy": 1.0310546875,
"epoch": 0.6246155948882662,
"grad_norm": 0.6236572115666703,
"learning_rate": 3.545512188248556e-06,
"loss": 0.7344,
"mean_token_accuracy": 0.8053835541009903,
"num_tokens": 404853974.0,
"step": 4570
},
{
"entropy": 1.0103515625,
"epoch": 0.6259823686188751,
"grad_norm": 0.636916754734715,
"learning_rate": 3.5419895730590394e-06,
"loss": 0.7256,
"mean_token_accuracy": 0.8039745301008224,
"num_tokens": 405698785.0,
"step": 4580
},
{
"entropy": 1.0650390625,
"epoch": 0.627349142349484,
"grad_norm": 0.6894684352993625,
"learning_rate": 3.5384669578695225e-06,
"loss": 0.7411,
"mean_token_accuracy": 0.801270592212677,
"num_tokens": 406574395.0,
"step": 4590
},
{
"entropy": 1.059375,
"epoch": 0.6287159160800929,
"grad_norm": 0.6933092292991593,
"learning_rate": 3.534944342680006e-06,
"loss": 0.8006,
"mean_token_accuracy": 0.7909941375255585,
"num_tokens": 407487257.0,
"step": 4600
},
{
"entropy": 1.008203125,
"epoch": 0.6300826898107018,
"grad_norm": 0.663392998729766,
"learning_rate": 3.5314217274904896e-06,
"loss": 0.7465,
"mean_token_accuracy": 0.8008531928062439,
"num_tokens": 408376884.0,
"step": 4610
},
{
"entropy": 1.045703125,
"epoch": 0.6314494635413107,
"grad_norm": 0.6202674351958084,
"learning_rate": 3.5278991123009727e-06,
"loss": 0.7497,
"mean_token_accuracy": 0.8012403666973114,
"num_tokens": 409246879.0,
"step": 4620
},
{
"entropy": 1.06875,
"epoch": 0.6328162372719196,
"grad_norm": 0.6991932657340849,
"learning_rate": 3.524376497111456e-06,
"loss": 0.7511,
"mean_token_accuracy": 0.7990607798099518,
"num_tokens": 410153996.0,
"step": 4630
},
{
"entropy": 1.00859375,
"epoch": 0.6341830110025285,
"grad_norm": 0.7172458478766172,
"learning_rate": 3.520853881921939e-06,
"loss": 0.7174,
"mean_token_accuracy": 0.8099153965711594,
"num_tokens": 411026191.0,
"step": 4640
},
{
"entropy": 1.0115234375,
"epoch": 0.6355497847331374,
"grad_norm": 0.6582356717267802,
"learning_rate": 3.517331266732422e-06,
"loss": 0.7556,
"mean_token_accuracy": 0.8011870205402374,
"num_tokens": 411945110.0,
"step": 4650
},
{
"entropy": 1.0947265625,
"epoch": 0.6369165584637463,
"grad_norm": 0.7000067366447207,
"learning_rate": 3.513808651542906e-06,
"loss": 0.8361,
"mean_token_accuracy": 0.7860566258430481,
"num_tokens": 412810803.0,
"step": 4660
},
{
"entropy": 1.037890625,
"epoch": 0.6382833321943552,
"grad_norm": 0.6930318445289756,
"learning_rate": 3.510286036353389e-06,
"loss": 0.7023,
"mean_token_accuracy": 0.8114810407161712,
"num_tokens": 413638372.0,
"step": 4670
},
{
"entropy": 1.0240234375,
"epoch": 0.6396501059249641,
"grad_norm": 0.5876095884195551,
"learning_rate": 3.5067634211638723e-06,
"loss": 0.7098,
"mean_token_accuracy": 0.8075989305973053,
"num_tokens": 414557899.0,
"step": 4680
},
{
"entropy": 1.026953125,
"epoch": 0.641016879655573,
"grad_norm": 0.6201352729965535,
"learning_rate": 3.5032408059743554e-06,
"loss": 0.7259,
"mean_token_accuracy": 0.8050165295600891,
"num_tokens": 415455781.0,
"step": 4690
},
{
"entropy": 1.03125,
"epoch": 0.6423836533861819,
"grad_norm": 0.6691279095977396,
"learning_rate": 3.499718190784839e-06,
"loss": 0.7346,
"mean_token_accuracy": 0.8045117527246475,
"num_tokens": 416295102.0,
"step": 4700
},
{
"entropy": 1.0388671875,
"epoch": 0.6437504271167909,
"grad_norm": 0.6907327752828729,
"learning_rate": 3.4961955755953225e-06,
"loss": 0.7711,
"mean_token_accuracy": 0.7973043292760849,
"num_tokens": 417180585.0,
"step": 4710
},
{
"entropy": 1.066796875,
"epoch": 0.6451172008473998,
"grad_norm": 0.6356185481702634,
"learning_rate": 3.4926729604058056e-06,
"loss": 0.7459,
"mean_token_accuracy": 0.8012819200754165,
"num_tokens": 418052757.0,
"step": 4720
},
{
"entropy": 1.0236328125,
"epoch": 0.6464839745780087,
"grad_norm": 0.748128884776109,
"learning_rate": 3.4891503452162888e-06,
"loss": 0.7313,
"mean_token_accuracy": 0.8048703253269196,
"num_tokens": 418895912.0,
"step": 4730
},
{
"entropy": 1.0083984375,
"epoch": 0.6478507483086176,
"grad_norm": 0.5964900850955507,
"learning_rate": 3.4856277300267723e-06,
"loss": 0.6943,
"mean_token_accuracy": 0.8120358169078827,
"num_tokens": 419758665.0,
"step": 4740
},
{
"entropy": 1.0296875,
"epoch": 0.6492175220392264,
"grad_norm": 0.6720758097164908,
"learning_rate": 3.4821051148372554e-06,
"loss": 0.7482,
"mean_token_accuracy": 0.8000786125659942,
"num_tokens": 420619426.0,
"step": 4750
},
{
"entropy": 0.983203125,
"epoch": 0.6505842957698353,
"grad_norm": 0.7506992810887412,
"learning_rate": 3.4785824996477386e-06,
"loss": 0.669,
"mean_token_accuracy": 0.8172756105661392,
"num_tokens": 421466711.0,
"step": 4760
},
{
"entropy": 0.9732421875,
"epoch": 0.6519510695004442,
"grad_norm": 0.6933518225438784,
"learning_rate": 3.475059884458222e-06,
"loss": 0.7066,
"mean_token_accuracy": 0.8100079447031021,
"num_tokens": 422336352.0,
"step": 4770
},
{
"entropy": 1.0283203125,
"epoch": 0.6533178432310531,
"grad_norm": 0.6654999033024527,
"learning_rate": 3.4715372692687057e-06,
"loss": 0.7131,
"mean_token_accuracy": 0.8079463392496109,
"num_tokens": 423184508.0,
"step": 4780
},
{
"entropy": 1.0818359375,
"epoch": 0.654684616961662,
"grad_norm": 0.667721555881795,
"learning_rate": 3.4680146540791888e-06,
"loss": 0.7711,
"mean_token_accuracy": 0.7985377043485642,
"num_tokens": 424081913.0,
"step": 4790
},
{
"entropy": 1.03828125,
"epoch": 0.6560513906922709,
"grad_norm": 0.633427337494374,
"learning_rate": 3.464492038889672e-06,
"loss": 0.7509,
"mean_token_accuracy": 0.8022255897521973,
"num_tokens": 424917247.0,
"step": 4800
},
{
"entropy": 1.0263671875,
"epoch": 0.6574181644228798,
"grad_norm": 0.7102520561690018,
"learning_rate": 3.460969423700155e-06,
"loss": 0.7818,
"mean_token_accuracy": 0.7930744856595993,
"num_tokens": 425842562.0,
"step": 4810
},
{
"entropy": 1.0337890625,
"epoch": 0.6587849381534887,
"grad_norm": 0.6289064964079135,
"learning_rate": 3.457446808510639e-06,
"loss": 0.7451,
"mean_token_accuracy": 0.8029783427715301,
"num_tokens": 426738885.0,
"step": 4820
},
{
"entropy": 1.006640625,
"epoch": 0.6601517118840976,
"grad_norm": 0.6693363301411029,
"learning_rate": 3.453924193321122e-06,
"loss": 0.7341,
"mean_token_accuracy": 0.8050162017345428,
"num_tokens": 427666165.0,
"step": 4830
},
{
"entropy": 1.011328125,
"epoch": 0.6615184856147065,
"grad_norm": 0.6757115158255806,
"learning_rate": 3.4504015781316052e-06,
"loss": 0.6991,
"mean_token_accuracy": 0.8140609115362167,
"num_tokens": 428584533.0,
"step": 4840
},
{
"entropy": 1.0466796875,
"epoch": 0.6628852593453154,
"grad_norm": 0.6683504278642064,
"learning_rate": 3.4468789629420884e-06,
"loss": 0.7469,
"mean_token_accuracy": 0.8005775839090348,
"num_tokens": 429522884.0,
"step": 4850
},
{
"entropy": 0.99609375,
"epoch": 0.6642520330759243,
"grad_norm": 0.6587950565976542,
"learning_rate": 3.4433563477525715e-06,
"loss": 0.7254,
"mean_token_accuracy": 0.806473332643509,
"num_tokens": 430404622.0,
"step": 4860
},
{
"entropy": 1.01640625,
"epoch": 0.6656188068065332,
"grad_norm": 0.6557381134423553,
"learning_rate": 3.439833732563055e-06,
"loss": 0.7085,
"mean_token_accuracy": 0.8094220012426376,
"num_tokens": 431275413.0,
"step": 4870
},
{
"entropy": 1.0205078125,
"epoch": 0.6669855805371421,
"grad_norm": 0.7393317061064248,
"learning_rate": 3.4363111173735386e-06,
"loss": 0.7304,
"mean_token_accuracy": 0.8043926775455474,
"num_tokens": 432204493.0,
"step": 4880
},
{
"entropy": 1.033203125,
"epoch": 0.668352354267751,
"grad_norm": 0.6680436590256006,
"learning_rate": 3.4327885021840217e-06,
"loss": 0.7422,
"mean_token_accuracy": 0.8039387375116348,
"num_tokens": 433107951.0,
"step": 4890
},
{
"entropy": 1.01953125,
"epoch": 0.6697191279983599,
"grad_norm": 0.6284514802889608,
"learning_rate": 3.429265886994505e-06,
"loss": 0.7708,
"mean_token_accuracy": 0.7973555505275727,
"num_tokens": 434029585.0,
"step": 4900
},
{
"entropy": 1.0091796875,
"epoch": 0.6710859017289688,
"grad_norm": 0.6927907137072618,
"learning_rate": 3.4257432718049884e-06,
"loss": 0.7096,
"mean_token_accuracy": 0.8099610656499863,
"num_tokens": 434937916.0,
"step": 4910
},
{
"entropy": 0.991015625,
"epoch": 0.6724526754595777,
"grad_norm": 0.6694866624125219,
"learning_rate": 3.4222206566154715e-06,
"loss": 0.763,
"mean_token_accuracy": 0.8005238234996795,
"num_tokens": 435852833.0,
"step": 4920
},
{
"entropy": 1.0548828125,
"epoch": 0.6738194491901865,
"grad_norm": 0.6620985686680761,
"learning_rate": 3.418698041425955e-06,
"loss": 0.78,
"mean_token_accuracy": 0.7935137301683426,
"num_tokens": 436724128.0,
"step": 4930
},
{
"entropy": 0.9951171875,
"epoch": 0.6751862229207954,
"grad_norm": 0.6614766952245354,
"learning_rate": 3.415175426236438e-06,
"loss": 0.7051,
"mean_token_accuracy": 0.8111301153898239,
"num_tokens": 437633875.0,
"step": 4940
},
{
"entropy": 0.962109375,
"epoch": 0.6765529966514043,
"grad_norm": 0.6130820496471363,
"learning_rate": 3.4116528110469217e-06,
"loss": 0.6662,
"mean_token_accuracy": 0.8204651117324829,
"num_tokens": 438515714.0,
"step": 4950
},
{
"entropy": 1.020703125,
"epoch": 0.6779197703820132,
"grad_norm": 0.6843284985907506,
"learning_rate": 3.408130195857405e-06,
"loss": 0.6908,
"mean_token_accuracy": 0.8139220923185349,
"num_tokens": 439364688.0,
"step": 4960
},
{
"entropy": 1.030859375,
"epoch": 0.6792865441126221,
"grad_norm": 0.7378407178962452,
"learning_rate": 3.404607580667888e-06,
"loss": 0.7353,
"mean_token_accuracy": 0.8034502059221268,
"num_tokens": 440259473.0,
"step": 4970
},
{
"entropy": 1.0046875,
"epoch": 0.680653317843231,
"grad_norm": 0.6511001292082009,
"learning_rate": 3.401084965478371e-06,
"loss": 0.6842,
"mean_token_accuracy": 0.8161933422088623,
"num_tokens": 441127912.0,
"step": 4980
},
{
"entropy": 1.0328125,
"epoch": 0.6820200915738399,
"grad_norm": 0.613762983259778,
"learning_rate": 3.397562350288855e-06,
"loss": 0.7428,
"mean_token_accuracy": 0.8027386516332626,
"num_tokens": 442024079.0,
"step": 4990
},
{
"entropy": 1.0173828125,
"epoch": 0.6833868653044488,
"grad_norm": 0.6520194319637496,
"learning_rate": 3.394039735099338e-06,
"loss": 0.6907,
"mean_token_accuracy": 0.8122383207082748,
"num_tokens": 442910647.0,
"step": 5000
},
{
"entropy": 0.994921875,
"epoch": 0.6847536390350577,
"grad_norm": 0.7504060706089178,
"learning_rate": 3.3905171199098213e-06,
"loss": 0.6806,
"mean_token_accuracy": 0.8141519367694855,
"num_tokens": 443789732.0,
"step": 5010
},
{
"entropy": 1.009765625,
"epoch": 0.6861204127656666,
"grad_norm": 0.6056923416460039,
"learning_rate": 3.3869945047203044e-06,
"loss": 0.7461,
"mean_token_accuracy": 0.8029884725809098,
"num_tokens": 444692779.0,
"step": 5020
},
{
"entropy": 1.0126953125,
"epoch": 0.6874871864962755,
"grad_norm": 0.678194557959519,
"learning_rate": 3.3834718895307876e-06,
"loss": 0.6981,
"mean_token_accuracy": 0.8116013616323471,
"num_tokens": 445556425.0,
"step": 5030
},
{
"entropy": 0.9986328125,
"epoch": 0.6888539602268844,
"grad_norm": 0.6156995731496101,
"learning_rate": 3.3799492743412715e-06,
"loss": 0.7042,
"mean_token_accuracy": 0.8117827773094177,
"num_tokens": 446440835.0,
"step": 5040
},
{
"entropy": 1.0083984375,
"epoch": 0.6902207339574933,
"grad_norm": 0.6413692570245209,
"learning_rate": 3.3764266591517547e-06,
"loss": 0.7096,
"mean_token_accuracy": 0.8087794154882431,
"num_tokens": 447344281.0,
"step": 5050
},
{
"entropy": 1.0314453125,
"epoch": 0.6915875076881023,
"grad_norm": 0.6812303400206479,
"learning_rate": 3.3729040439622378e-06,
"loss": 0.727,
"mean_token_accuracy": 0.8065667420625686,
"num_tokens": 448244245.0,
"step": 5060
},
{
"entropy": 1.0509765625,
"epoch": 0.6929542814187112,
"grad_norm": 0.7596251155051275,
"learning_rate": 3.3693814287727213e-06,
"loss": 0.7646,
"mean_token_accuracy": 0.7981210500001907,
"num_tokens": 449100309.0,
"step": 5070
},
{
"entropy": 1.0541015625,
"epoch": 0.6943210551493201,
"grad_norm": 0.7582842430643311,
"learning_rate": 3.3658588135832044e-06,
"loss": 0.7621,
"mean_token_accuracy": 0.7980292767286301,
"num_tokens": 450042185.0,
"step": 5080
},
{
"entropy": 0.9978515625,
"epoch": 0.695687828879929,
"grad_norm": 0.5919220790074069,
"learning_rate": 3.3623361983936876e-06,
"loss": 0.7312,
"mean_token_accuracy": 0.8057405114173889,
"num_tokens": 450988603.0,
"step": 5090
},
{
"entropy": 1.023828125,
"epoch": 0.6970546026105379,
"grad_norm": 0.6392293226587777,
"learning_rate": 3.358813583204171e-06,
"loss": 0.7158,
"mean_token_accuracy": 0.8092545241117477,
"num_tokens": 451928945.0,
"step": 5100
},
{
"entropy": 1.0806640625,
"epoch": 0.6984213763411468,
"grad_norm": 0.7227770804031286,
"learning_rate": 3.3552909680146547e-06,
"loss": 0.7718,
"mean_token_accuracy": 0.7951121777296066,
"num_tokens": 452812071.0,
"step": 5110
},
{
"entropy": 0.9916015625,
"epoch": 0.6997881500717557,
"grad_norm": 0.6201386470184078,
"learning_rate": 3.3517683528251378e-06,
"loss": 0.7038,
"mean_token_accuracy": 0.8106577396392822,
"num_tokens": 453702565.0,
"step": 5120
},
{
"entropy": 1.0091796875,
"epoch": 0.7011549238023645,
"grad_norm": 0.6955906231399824,
"learning_rate": 3.348245737635621e-06,
"loss": 0.7027,
"mean_token_accuracy": 0.8107948660850525,
"num_tokens": 454608169.0,
"step": 5130
},
{
"entropy": 1.0255859375,
"epoch": 0.7025216975329734,
"grad_norm": 0.6438494878340484,
"learning_rate": 3.344723122446104e-06,
"loss": 0.7177,
"mean_token_accuracy": 0.8073448032140732,
"num_tokens": 455455664.0,
"step": 5140
},
{
"entropy": 1.03359375,
"epoch": 0.7038884712635823,
"grad_norm": 0.6911709741008571,
"learning_rate": 3.341200507256587e-06,
"loss": 0.7398,
"mean_token_accuracy": 0.8049698263406754,
"num_tokens": 456331907.0,
"step": 5150
},
{
"entropy": 1.0623046875,
"epoch": 0.7052552449941912,
"grad_norm": 0.7025006742573029,
"learning_rate": 3.337677892067071e-06,
"loss": 0.7272,
"mean_token_accuracy": 0.8057276099920273,
"num_tokens": 457208256.0,
"step": 5160
},
{
"entropy": 1.0470703125,
"epoch": 0.7066220187248001,
"grad_norm": 0.8142485558381346,
"learning_rate": 3.3341552768775543e-06,
"loss": 0.7787,
"mean_token_accuracy": 0.7939549803733825,
"num_tokens": 458092829.0,
"step": 5170
},
{
"entropy": 1.0400390625,
"epoch": 0.707988792455409,
"grad_norm": 0.7080976460552749,
"learning_rate": 3.3306326616880374e-06,
"loss": 0.7058,
"mean_token_accuracy": 0.8118306815624237,
"num_tokens": 458977684.0,
"step": 5180
},
{
"entropy": 1.04375,
"epoch": 0.7093555661860179,
"grad_norm": 0.6390141845043376,
"learning_rate": 3.3271100464985205e-06,
"loss": 0.7491,
"mean_token_accuracy": 0.7997821539640426,
"num_tokens": 459877261.0,
"step": 5190
},
{
"entropy": 1.0107421875,
"epoch": 0.7107223399166268,
"grad_norm": 0.6338267746794506,
"learning_rate": 3.323587431309004e-06,
"loss": 0.712,
"mean_token_accuracy": 0.8107642441987991,
"num_tokens": 460803559.0,
"step": 5200
},
{
"entropy": 1.0388671875,
"epoch": 0.7120891136472357,
"grad_norm": 0.7167408835708867,
"learning_rate": 3.3200648161194876e-06,
"loss": 0.7313,
"mean_token_accuracy": 0.8055164635181427,
"num_tokens": 461698177.0,
"step": 5210
},
{
"entropy": 1.0060546875,
"epoch": 0.7134558873778446,
"grad_norm": 0.6862875037818211,
"learning_rate": 3.3165422009299707e-06,
"loss": 0.7311,
"mean_token_accuracy": 0.8046658962965012,
"num_tokens": 462589164.0,
"step": 5220
},
{
"entropy": 1.042578125,
"epoch": 0.7148226611084535,
"grad_norm": 0.6597085861137288,
"learning_rate": 3.313019585740454e-06,
"loss": 0.7275,
"mean_token_accuracy": 0.8043858110904694,
"num_tokens": 463468365.0,
"step": 5230
},
{
"entropy": 1.0474609375,
"epoch": 0.7161894348390624,
"grad_norm": 0.7191521727050386,
"learning_rate": 3.3094969705509374e-06,
"loss": 0.7843,
"mean_token_accuracy": 0.7930650562047958,
"num_tokens": 464350433.0,
"step": 5240
},
{
"entropy": 1.010546875,
"epoch": 0.7175562085696713,
"grad_norm": 0.6911926404311853,
"learning_rate": 3.3059743553614205e-06,
"loss": 0.7374,
"mean_token_accuracy": 0.804737439751625,
"num_tokens": 465221702.0,
"step": 5250
},
{
"entropy": 1.0158203125,
"epoch": 0.7189229823002802,
"grad_norm": 0.6707434424536307,
"learning_rate": 3.3024517401719036e-06,
"loss": 0.724,
"mean_token_accuracy": 0.8047131687402725,
"num_tokens": 466090098.0,
"step": 5260
},
{
"entropy": 1.031640625,
"epoch": 0.7202897560308891,
"grad_norm": 0.8202340669283046,
"learning_rate": 3.298929124982387e-06,
"loss": 0.7947,
"mean_token_accuracy": 0.8008837461471557,
"num_tokens": 466990039.0,
"step": 5270
},
{
"entropy": 1.0451171875,
"epoch": 0.721656529761498,
"grad_norm": 0.6561514140379701,
"learning_rate": 3.2954065097928707e-06,
"loss": 0.7549,
"mean_token_accuracy": 0.8011873692274094,
"num_tokens": 467896781.0,
"step": 5280
},
{
"entropy": 1.0384765625,
"epoch": 0.7230233034921069,
"grad_norm": 0.6795887689690403,
"learning_rate": 3.291883894603354e-06,
"loss": 0.7465,
"mean_token_accuracy": 0.8025134414434433,
"num_tokens": 468784684.0,
"step": 5290
},
{
"entropy": 1.00234375,
"epoch": 0.7243900772227158,
"grad_norm": 0.7222682796819593,
"learning_rate": 3.288361279413837e-06,
"loss": 0.7302,
"mean_token_accuracy": 0.8029415160417557,
"num_tokens": 469661887.0,
"step": 5300
},
{
"entropy": 0.9998046875,
"epoch": 0.7257568509533247,
"grad_norm": 0.6280617516980819,
"learning_rate": 3.28483866422432e-06,
"loss": 0.699,
"mean_token_accuracy": 0.8127899140119552,
"num_tokens": 470540659.0,
"step": 5310
},
{
"entropy": 1.0544921875,
"epoch": 0.7271236246839335,
"grad_norm": 0.6935764709495426,
"learning_rate": 3.281316049034804e-06,
"loss": 0.7785,
"mean_token_accuracy": 0.7920250684022904,
"num_tokens": 471483298.0,
"step": 5320
},
{
"entropy": 1.0068359375,
"epoch": 0.7284903984145424,
"grad_norm": 0.665020125110597,
"learning_rate": 3.277793433845287e-06,
"loss": 0.6995,
"mean_token_accuracy": 0.8084356307983398,
"num_tokens": 472374357.0,
"step": 5330
},
{
"entropy": 1.0185546875,
"epoch": 0.7298571721451513,
"grad_norm": 0.6720259374364177,
"learning_rate": 3.2742708186557703e-06,
"loss": 0.7039,
"mean_token_accuracy": 0.8127414137125015,
"num_tokens": 473290428.0,
"step": 5340
},
{
"entropy": 1.0638671875,
"epoch": 0.7312239458757602,
"grad_norm": 0.7054064844348509,
"learning_rate": 3.2707482034662534e-06,
"loss": 0.7468,
"mean_token_accuracy": 0.8008114963769912,
"num_tokens": 474178439.0,
"step": 5350
},
{
"entropy": 1.025,
"epoch": 0.7325907196063691,
"grad_norm": 0.7031056680016522,
"learning_rate": 3.2672255882767366e-06,
"loss": 0.7353,
"mean_token_accuracy": 0.803893432021141,
"num_tokens": 475073389.0,
"step": 5360
},
{
"entropy": 0.9833984375,
"epoch": 0.733957493336978,
"grad_norm": 0.5912017776705244,
"learning_rate": 3.26370297308722e-06,
"loss": 0.6926,
"mean_token_accuracy": 0.813986885547638,
"num_tokens": 475982346.0,
"step": 5370
},
{
"entropy": 1.01796875,
"epoch": 0.7353242670675869,
"grad_norm": 0.6443002326167591,
"learning_rate": 3.2601803578977037e-06,
"loss": 0.7426,
"mean_token_accuracy": 0.801983967423439,
"num_tokens": 476863931.0,
"step": 5380
},
{
"entropy": 0.98125,
"epoch": 0.7366910407981958,
"grad_norm": 0.5989584038118148,
"learning_rate": 3.2566577427081868e-06,
"loss": 0.7024,
"mean_token_accuracy": 0.8106659978628159,
"num_tokens": 477781550.0,
"step": 5390
},
{
"entropy": 1.0185546875,
"epoch": 0.7380578145288047,
"grad_norm": 0.6730780384314887,
"learning_rate": 3.25313512751867e-06,
"loss": 0.7223,
"mean_token_accuracy": 0.8079999595880508,
"num_tokens": 478654068.0,
"step": 5400
},
{
"entropy": 1.04609375,
"epoch": 0.7394245882594137,
"grad_norm": 0.6036392151988006,
"learning_rate": 3.2496125123291535e-06,
"loss": 0.7643,
"mean_token_accuracy": 0.7988834857940674,
"num_tokens": 479541351.0,
"step": 5410
},
{
"entropy": 1.0228515625,
"epoch": 0.7407913619900226,
"grad_norm": 0.6671526847468292,
"learning_rate": 3.2460898971396366e-06,
"loss": 0.7047,
"mean_token_accuracy": 0.811830273270607,
"num_tokens": 480430820.0,
"step": 5420
},
{
"entropy": 1.0287109375,
"epoch": 0.7421581357206315,
"grad_norm": 0.6883320046026487,
"learning_rate": 3.24256728195012e-06,
"loss": 0.7396,
"mean_token_accuracy": 0.8058585911989212,
"num_tokens": 481306833.0,
"step": 5430
},
{
"entropy": 1.003125,
"epoch": 0.7435249094512404,
"grad_norm": 0.6215353386479779,
"learning_rate": 3.2390446667606037e-06,
"loss": 0.7198,
"mean_token_accuracy": 0.8095199197530747,
"num_tokens": 482218500.0,
"step": 5440
},
{
"entropy": 1.0353515625,
"epoch": 0.7448916831818493,
"grad_norm": 0.682343157185371,
"learning_rate": 3.235522051571087e-06,
"loss": 0.7164,
"mean_token_accuracy": 0.8082947939634323,
"num_tokens": 483099935.0,
"step": 5450
},
{
"entropy": 1.0390625,
"epoch": 0.7462584569124582,
"grad_norm": 0.5821207656439858,
"learning_rate": 3.23199943638157e-06,
"loss": 0.723,
"mean_token_accuracy": 0.8073663532733917,
"num_tokens": 483948988.0,
"step": 5460
},
{
"entropy": 1.044921875,
"epoch": 0.7476252306430671,
"grad_norm": 0.7506833389451576,
"learning_rate": 3.228476821192053e-06,
"loss": 0.7375,
"mean_token_accuracy": 0.8018234461545944,
"num_tokens": 484844939.0,
"step": 5470
},
{
"entropy": 1.0357421875,
"epoch": 0.748992004373676,
"grad_norm": 0.7227798805084888,
"learning_rate": 3.224954206002536e-06,
"loss": 0.7705,
"mean_token_accuracy": 0.7941313654184341,
"num_tokens": 485763455.0,
"step": 5480
},
{
"entropy": 1.0021484375,
"epoch": 0.7503587781042849,
"grad_norm": 0.631121676096458,
"learning_rate": 3.22143159081302e-06,
"loss": 0.665,
"mean_token_accuracy": 0.8196620345115662,
"num_tokens": 486656249.0,
"step": 5490
},
{
"entropy": 1.0638671875,
"epoch": 0.7517255518348938,
"grad_norm": 0.7407761696701312,
"learning_rate": 3.2179089756235033e-06,
"loss": 0.7499,
"mean_token_accuracy": 0.7982611685991288,
"num_tokens": 487540315.0,
"step": 5500
},
{
"entropy": 1.0546875,
"epoch": 0.7530923255655027,
"grad_norm": 0.6610719073480644,
"learning_rate": 3.2143863604339864e-06,
"loss": 0.7529,
"mean_token_accuracy": 0.8003468364477158,
"num_tokens": 488445699.0,
"step": 5510
},
{
"entropy": 1.0201171875,
"epoch": 0.7544590992961115,
"grad_norm": 0.657015686259481,
"learning_rate": 3.2108637452444695e-06,
"loss": 0.7354,
"mean_token_accuracy": 0.8050768882036209,
"num_tokens": 489326155.0,
"step": 5520
},
{
"entropy": 1.066015625,
"epoch": 0.7558258730267204,
"grad_norm": 0.6256474820835042,
"learning_rate": 3.2073411300549526e-06,
"loss": 0.7739,
"mean_token_accuracy": 0.7969092130661011,
"num_tokens": 490191644.0,
"step": 5530
},
{
"entropy": 0.98671875,
"epoch": 0.7571926467573293,
"grad_norm": 0.5827852945438056,
"learning_rate": 3.2038185148654366e-06,
"loss": 0.673,
"mean_token_accuracy": 0.8180216699838638,
"num_tokens": 491068717.0,
"step": 5540
},
{
"entropy": 1.070703125,
"epoch": 0.7585594204879382,
"grad_norm": 0.677964809070066,
"learning_rate": 3.2002958996759197e-06,
"loss": 0.8008,
"mean_token_accuracy": 0.7935272455215454,
"num_tokens": 491916966.0,
"step": 5550
},
{
"entropy": 1.068359375,
"epoch": 0.7599261942185471,
"grad_norm": 0.7248045039497506,
"learning_rate": 3.196773284486403e-06,
"loss": 0.7643,
"mean_token_accuracy": 0.7950438290834427,
"num_tokens": 492799007.0,
"step": 5560
},
{
"entropy": 1.068359375,
"epoch": 0.761292967949156,
"grad_norm": 0.6972790867496663,
"learning_rate": 3.1932506692968864e-06,
"loss": 0.7767,
"mean_token_accuracy": 0.7965763688087464,
"num_tokens": 493694735.0,
"step": 5570
},
{
"entropy": 1.024609375,
"epoch": 0.7626597416797649,
"grad_norm": 0.648718878213279,
"learning_rate": 3.1897280541073695e-06,
"loss": 0.7096,
"mean_token_accuracy": 0.8086673468351364,
"num_tokens": 494599096.0,
"step": 5580
},
{
"entropy": 1.028515625,
"epoch": 0.7640265154103738,
"grad_norm": 0.6152346011200341,
"learning_rate": 3.1862054389178526e-06,
"loss": 0.723,
"mean_token_accuracy": 0.8053847432136536,
"num_tokens": 495533785.0,
"step": 5590
},
{
"entropy": 1.016015625,
"epoch": 0.7653932891409827,
"grad_norm": 0.6742280411644237,
"learning_rate": 3.182682823728336e-06,
"loss": 0.7282,
"mean_token_accuracy": 0.8058796256780625,
"num_tokens": 496427337.0,
"step": 5600
},
{
"entropy": 1.0,
"epoch": 0.7667600628715916,
"grad_norm": 0.6910042191411813,
"learning_rate": 3.1791602085388197e-06,
"loss": 0.7168,
"mean_token_accuracy": 0.80713010430336,
"num_tokens": 497328578.0,
"step": 5610
},
{
"entropy": 1.0666015625,
"epoch": 0.7681268366022005,
"grad_norm": 0.6770948210389743,
"learning_rate": 3.175637593349303e-06,
"loss": 0.7835,
"mean_token_accuracy": 0.79508056640625,
"num_tokens": 498197795.0,
"step": 5620
},
{
"entropy": 1.0619140625,
"epoch": 0.7694936103328094,
"grad_norm": 0.655621787461811,
"learning_rate": 3.172114978159786e-06,
"loss": 0.7561,
"mean_token_accuracy": 0.8001237660646439,
"num_tokens": 499104957.0,
"step": 5630
},
{
"entropy": 1.037109375,
"epoch": 0.7708603840634183,
"grad_norm": 0.6537916404128072,
"learning_rate": 3.168592362970269e-06,
"loss": 0.7276,
"mean_token_accuracy": 0.8061377435922623,
"num_tokens": 499955528.0,
"step": 5640
},
{
"entropy": 0.9990234375,
"epoch": 0.7722271577940272,
"grad_norm": 0.6778283507344393,
"learning_rate": 3.165069747780753e-06,
"loss": 0.6972,
"mean_token_accuracy": 0.8122765779495239,
"num_tokens": 500817635.0,
"step": 5650
},
{
"entropy": 1.0568359375,
"epoch": 0.7735939315246361,
"grad_norm": 0.6815642109987725,
"learning_rate": 3.161547132591236e-06,
"loss": 0.753,
"mean_token_accuracy": 0.7998788446187973,
"num_tokens": 501718725.0,
"step": 5660
},
{
"entropy": 1.0509765625,
"epoch": 0.774960705255245,
"grad_norm": 0.5749076636445767,
"learning_rate": 3.1580245174017193e-06,
"loss": 0.7489,
"mean_token_accuracy": 0.7997293323278427,
"num_tokens": 502611865.0,
"step": 5670
},
{
"entropy": 1.0453125,
"epoch": 0.7763274789858539,
"grad_norm": 0.6774552301330988,
"learning_rate": 3.1545019022122025e-06,
"loss": 0.7114,
"mean_token_accuracy": 0.809497457742691,
"num_tokens": 503500310.0,
"step": 5680
},
{
"entropy": 1.08671875,
"epoch": 0.7776942527164628,
"grad_norm": 0.6352206241206175,
"learning_rate": 3.1509792870226856e-06,
"loss": 0.7698,
"mean_token_accuracy": 0.7946420699357987,
"num_tokens": 504395432.0,
"step": 5690
},
{
"entropy": 1.0138671875,
"epoch": 0.7790610264470716,
"grad_norm": 0.7776672914893535,
"learning_rate": 3.147456671833169e-06,
"loss": 0.7188,
"mean_token_accuracy": 0.8075503021478653,
"num_tokens": 505275664.0,
"step": 5700
},
{
"entropy": 1.01015625,
"epoch": 0.7804278001776805,
"grad_norm": 0.6526812978463439,
"learning_rate": 3.1439340566436527e-06,
"loss": 0.7275,
"mean_token_accuracy": 0.807003054022789,
"num_tokens": 506168945.0,
"step": 5710
},
{
"entropy": 1.0513671875,
"epoch": 0.7817945739082894,
"grad_norm": 0.6449932181084913,
"learning_rate": 3.140411441454136e-06,
"loss": 0.744,
"mean_token_accuracy": 0.8020804494619369,
"num_tokens": 507052908.0,
"step": 5720
},
{
"entropy": 1.0203125,
"epoch": 0.7831613476388983,
"grad_norm": 0.6779936070438857,
"learning_rate": 3.136888826264619e-06,
"loss": 0.7455,
"mean_token_accuracy": 0.8010386437177658,
"num_tokens": 507938577.0,
"step": 5730
},
{
"entropy": 1.000390625,
"epoch": 0.7845281213695072,
"grad_norm": 0.7214006295272753,
"learning_rate": 3.1333662110751025e-06,
"loss": 0.7408,
"mean_token_accuracy": 0.8011776387691498,
"num_tokens": 508807062.0,
"step": 5740
},
{
"entropy": 1.0068359375,
"epoch": 0.7858948951001162,
"grad_norm": 0.6517523760648465,
"learning_rate": 3.1298435958855856e-06,
"loss": 0.7007,
"mean_token_accuracy": 0.8112227976322174,
"num_tokens": 509646843.0,
"step": 5750
},
{
"entropy": 1.0373046875,
"epoch": 0.7872616688307251,
"grad_norm": 0.6457741997377388,
"learning_rate": 3.126320980696069e-06,
"loss": 0.7621,
"mean_token_accuracy": 0.7970447599887848,
"num_tokens": 510507535.0,
"step": 5760
},
{
"entropy": 1.0365234375,
"epoch": 0.788628442561334,
"grad_norm": 0.6724590571197195,
"learning_rate": 3.1227983655065523e-06,
"loss": 0.7262,
"mean_token_accuracy": 0.8034923583269119,
"num_tokens": 511376176.0,
"step": 5770
},
{
"entropy": 0.9826171875,
"epoch": 0.7899952162919429,
"grad_norm": 0.5957456843979005,
"learning_rate": 3.119275750317036e-06,
"loss": 0.701,
"mean_token_accuracy": 0.811369264125824,
"num_tokens": 512257868.0,
"step": 5780
},
{
"entropy": 1.065625,
"epoch": 0.7913619900225518,
"grad_norm": 0.6522810395377578,
"learning_rate": 3.115753135127519e-06,
"loss": 0.7615,
"mean_token_accuracy": 0.7968117266893386,
"num_tokens": 513149614.0,
"step": 5790
},
{
"entropy": 1.016796875,
"epoch": 0.7927287637531607,
"grad_norm": 0.6748266987046495,
"learning_rate": 3.112230519938002e-06,
"loss": 0.728,
"mean_token_accuracy": 0.8059957444667816,
"num_tokens": 514060257.0,
"step": 5800
},
{
"entropy": 1.027734375,
"epoch": 0.7940955374837696,
"grad_norm": 0.7467714337755291,
"learning_rate": 3.108707904748485e-06,
"loss": 0.7083,
"mean_token_accuracy": 0.8093713402748108,
"num_tokens": 514887972.0,
"step": 5810
},
{
"entropy": 1.0412109375,
"epoch": 0.7954623112143785,
"grad_norm": 0.6153371802315305,
"learning_rate": 3.105185289558969e-06,
"loss": 0.7388,
"mean_token_accuracy": 0.8050329059362411,
"num_tokens": 515812256.0,
"step": 5820
},
{
"entropy": 1.0294921875,
"epoch": 0.7968290849449874,
"grad_norm": 0.658413562478503,
"learning_rate": 3.1016626743694523e-06,
"loss": 0.7345,
"mean_token_accuracy": 0.8029650807380676,
"num_tokens": 516697618.0,
"step": 5830
},
{
"entropy": 0.979296875,
"epoch": 0.7981958586755963,
"grad_norm": 0.6169911829006152,
"learning_rate": 3.0981400591799354e-06,
"loss": 0.7011,
"mean_token_accuracy": 0.8099886327981949,
"num_tokens": 517646655.0,
"step": 5840
},
{
"entropy": 1.0302734375,
"epoch": 0.7995626324062052,
"grad_norm": 0.6028865871224212,
"learning_rate": 3.0946174439904185e-06,
"loss": 0.7011,
"mean_token_accuracy": 0.8114229172468186,
"num_tokens": 518550530.0,
"step": 5850
},
{
"entropy": 1.0138671875,
"epoch": 0.8009294061368141,
"grad_norm": 0.6366273048039655,
"learning_rate": 3.0910948288009016e-06,
"loss": 0.696,
"mean_token_accuracy": 0.811361825466156,
"num_tokens": 519408238.0,
"step": 5860
},
{
"entropy": 1.01640625,
"epoch": 0.802296179867423,
"grad_norm": 0.6820881293227248,
"learning_rate": 3.0875722136113856e-06,
"loss": 0.7445,
"mean_token_accuracy": 0.8027656257152558,
"num_tokens": 520283433.0,
"step": 5870
},
{
"entropy": 1.045703125,
"epoch": 0.8036629535980319,
"grad_norm": 0.6545095197326062,
"learning_rate": 3.0840495984218687e-06,
"loss": 0.744,
"mean_token_accuracy": 0.803550860285759,
"num_tokens": 521184354.0,
"step": 5880
},
{
"entropy": 1.050390625,
"epoch": 0.8050297273286408,
"grad_norm": 0.6108779990054315,
"learning_rate": 3.080526983232352e-06,
"loss": 0.7375,
"mean_token_accuracy": 0.8023994356393814,
"num_tokens": 522052078.0,
"step": 5890
},
{
"entropy": 1.025,
"epoch": 0.8063965010592496,
"grad_norm": 0.6670055075850254,
"learning_rate": 3.0770043680428354e-06,
"loss": 0.7479,
"mean_token_accuracy": 0.8007210344076157,
"num_tokens": 522948969.0,
"step": 5900
},
{
"entropy": 1.008984375,
"epoch": 0.8077632747898585,
"grad_norm": 0.620972268858033,
"learning_rate": 3.0734817528533185e-06,
"loss": 0.6927,
"mean_token_accuracy": 0.8151346057653427,
"num_tokens": 523817470.0,
"step": 5910
},
{
"entropy": 1.0640625,
"epoch": 0.8091300485204674,
"grad_norm": 0.6932621730607906,
"learning_rate": 3.0699591376638017e-06,
"loss": 0.7607,
"mean_token_accuracy": 0.7988832116127014,
"num_tokens": 524695050.0,
"step": 5920
},
{
"entropy": 1.00859375,
"epoch": 0.8104968222510763,
"grad_norm": 0.6585411830951857,
"learning_rate": 3.066436522474285e-06,
"loss": 0.7308,
"mean_token_accuracy": 0.8063204050064087,
"num_tokens": 525574755.0,
"step": 5930
},
{
"entropy": 0.987109375,
"epoch": 0.8118635959816852,
"grad_norm": 0.6159964514957132,
"learning_rate": 3.0629139072847688e-06,
"loss": 0.6897,
"mean_token_accuracy": 0.8119957417249679,
"num_tokens": 526509631.0,
"step": 5940
},
{
"entropy": 1.045703125,
"epoch": 0.8132303697122941,
"grad_norm": 0.7223670616776002,
"learning_rate": 3.059391292095252e-06,
"loss": 0.7626,
"mean_token_accuracy": 0.7961015671491622,
"num_tokens": 527382381.0,
"step": 5950
},
{
"entropy": 1.024609375,
"epoch": 0.814597143442903,
"grad_norm": 0.6575549435637892,
"learning_rate": 3.055868676905735e-06,
"loss": 0.7447,
"mean_token_accuracy": 0.8020492106676101,
"num_tokens": 528322905.0,
"step": 5960
},
{
"entropy": 1.037890625,
"epoch": 0.8159639171735119,
"grad_norm": 0.7116369590682416,
"learning_rate": 3.052346061716218e-06,
"loss": 0.7557,
"mean_token_accuracy": 0.8000122904777527,
"num_tokens": 529151743.0,
"step": 5970
},
{
"entropy": 1.018359375,
"epoch": 0.8173306909041208,
"grad_norm": 0.663181538545264,
"learning_rate": 3.048823446526702e-06,
"loss": 0.7278,
"mean_token_accuracy": 0.8044933110475541,
"num_tokens": 530042986.0,
"step": 5980
},
{
"entropy": 1.05546875,
"epoch": 0.8186974646347297,
"grad_norm": 0.729537359601686,
"learning_rate": 3.0453008313371852e-06,
"loss": 0.752,
"mean_token_accuracy": 0.8013705551624298,
"num_tokens": 530980320.0,
"step": 5990
},
{
"entropy": 1.023046875,
"epoch": 0.8200642383653386,
"grad_norm": 0.7003182201847964,
"learning_rate": 3.0417782161476683e-06,
"loss": 0.734,
"mean_token_accuracy": 0.8031865239143372,
"num_tokens": 531854285.0,
"step": 6000
},
{
"entropy": 1.0873046875,
"epoch": 0.8214310120959475,
"grad_norm": 0.7394529199366783,
"learning_rate": 3.0382556009581515e-06,
"loss": 0.7549,
"mean_token_accuracy": 0.7992944806814194,
"num_tokens": 532722975.0,
"step": 6010
},
{
"entropy": 1.0025390625,
"epoch": 0.8227977858265564,
"grad_norm": 0.6834076023329294,
"learning_rate": 3.0347329857686346e-06,
"loss": 0.6869,
"mean_token_accuracy": 0.8127338945865631,
"num_tokens": 533582773.0,
"step": 6020
},
{
"entropy": 1.0087890625,
"epoch": 0.8241645595571653,
"grad_norm": 0.686870988791143,
"learning_rate": 3.031210370579118e-06,
"loss": 0.6835,
"mean_token_accuracy": 0.8165382236242295,
"num_tokens": 534476179.0,
"step": 6030
},
{
"entropy": 1.034765625,
"epoch": 0.8255313332877742,
"grad_norm": 0.6245657971917825,
"learning_rate": 3.0276877553896017e-06,
"loss": 0.7329,
"mean_token_accuracy": 0.8005217492580414,
"num_tokens": 535353086.0,
"step": 6040
},
{
"entropy": 1.0365234375,
"epoch": 0.8268981070183831,
"grad_norm": 0.756352551754645,
"learning_rate": 3.024165140200085e-06,
"loss": 0.71,
"mean_token_accuracy": 0.808431276679039,
"num_tokens": 536231879.0,
"step": 6050
},
{
"entropy": 1.03828125,
"epoch": 0.828264880748992,
"grad_norm": 0.6511368159314913,
"learning_rate": 3.020642525010568e-06,
"loss": 0.7355,
"mean_token_accuracy": 0.8051246345043183,
"num_tokens": 537112252.0,
"step": 6060
},
{
"entropy": 1.01953125,
"epoch": 0.8296316544796009,
"grad_norm": 0.6868131815177022,
"learning_rate": 3.0171199098210515e-06,
"loss": 0.7057,
"mean_token_accuracy": 0.8101237773895263,
"num_tokens": 537972593.0,
"step": 6070
},
{
"entropy": 1.0427734375,
"epoch": 0.8309984282102097,
"grad_norm": 0.6655536124312927,
"learning_rate": 3.0135972946315346e-06,
"loss": 0.7356,
"mean_token_accuracy": 0.8056278675794601,
"num_tokens": 538871586.0,
"step": 6080
},
{
"entropy": 1.0419921875,
"epoch": 0.8323652019408186,
"grad_norm": 0.6613158025666517,
"learning_rate": 3.010074679442018e-06,
"loss": 0.7562,
"mean_token_accuracy": 0.7998174011707306,
"num_tokens": 539732436.0,
"step": 6090
},
{
"entropy": 1.03828125,
"epoch": 0.8337319756714276,
"grad_norm": 0.7327140588353807,
"learning_rate": 3.0065520642525013e-06,
"loss": 0.7582,
"mean_token_accuracy": 0.8008839964866639,
"num_tokens": 540600028.0,
"step": 6100
},
{
"entropy": 1.078125,
"epoch": 0.8350987494020365,
"grad_norm": 0.6859744826639846,
"learning_rate": 3.003029449062985e-06,
"loss": 0.7491,
"mean_token_accuracy": 0.8014679461717605,
"num_tokens": 541502670.0,
"step": 6110
},
{
"entropy": 1.0490234375,
"epoch": 0.8364655231326454,
"grad_norm": 0.7242577659176789,
"learning_rate": 2.999506833873468e-06,
"loss": 0.7636,
"mean_token_accuracy": 0.798132735490799,
"num_tokens": 542340098.0,
"step": 6120
},
{
"entropy": 1.062890625,
"epoch": 0.8378322968632543,
"grad_norm": 0.6542499674570259,
"learning_rate": 2.995984218683951e-06,
"loss": 0.7833,
"mean_token_accuracy": 0.791947191953659,
"num_tokens": 543218409.0,
"step": 6130
},
{
"entropy": 1.012890625,
"epoch": 0.8391990705938632,
"grad_norm": 0.6016050422289568,
"learning_rate": 2.992461603494434e-06,
"loss": 0.7013,
"mean_token_accuracy": 0.8088379561901092,
"num_tokens": 544126052.0,
"step": 6140
},
{
"entropy": 1.023828125,
"epoch": 0.8405658443244721,
"grad_norm": 0.7038029492943951,
"learning_rate": 2.988938988304918e-06,
"loss": 0.7426,
"mean_token_accuracy": 0.8020239174365997,
"num_tokens": 545029025.0,
"step": 6150
},
{
"entropy": 1.009765625,
"epoch": 0.841932618055081,
"grad_norm": 0.6433009936684895,
"learning_rate": 2.9854163731154013e-06,
"loss": 0.7081,
"mean_token_accuracy": 0.8109225749969482,
"num_tokens": 545905476.0,
"step": 6160
},
{
"entropy": 1.0279296875,
"epoch": 0.8432993917856899,
"grad_norm": 0.6025945539042664,
"learning_rate": 2.9818937579258844e-06,
"loss": 0.7188,
"mean_token_accuracy": 0.8071947008371353,
"num_tokens": 546749480.0,
"step": 6170
},
{
"entropy": 1.01484375,
"epoch": 0.8446661655162988,
"grad_norm": 0.6823238954325398,
"learning_rate": 2.9783711427363675e-06,
"loss": 0.6982,
"mean_token_accuracy": 0.8118513196706771,
"num_tokens": 547635672.0,
"step": 6180
},
{
"entropy": 1.0501953125,
"epoch": 0.8460329392469077,
"grad_norm": 0.7467622242124604,
"learning_rate": 2.9748485275468507e-06,
"loss": 0.7337,
"mean_token_accuracy": 0.8042368173599244,
"num_tokens": 548511563.0,
"step": 6190
},
{
"entropy": 1.0185546875,
"epoch": 0.8473997129775166,
"grad_norm": 0.6309106410661556,
"learning_rate": 2.9713259123573346e-06,
"loss": 0.7357,
"mean_token_accuracy": 0.8021078914403915,
"num_tokens": 549358293.0,
"step": 6200
},
{
"entropy": 1.0134765625,
"epoch": 0.8487664867081255,
"grad_norm": 0.6199836622958971,
"learning_rate": 2.9678032971678177e-06,
"loss": 0.7465,
"mean_token_accuracy": 0.8009097337722778,
"num_tokens": 550199472.0,
"step": 6210
},
{
"entropy": 1.0359375,
"epoch": 0.8501332604387344,
"grad_norm": 0.659451630620744,
"learning_rate": 2.964280681978301e-06,
"loss": 0.7874,
"mean_token_accuracy": 0.7931300550699234,
"num_tokens": 551109412.0,
"step": 6220
},
{
"entropy": 0.9978515625,
"epoch": 0.8515000341693433,
"grad_norm": 0.7690460122778942,
"learning_rate": 2.960758066788784e-06,
"loss": 0.7156,
"mean_token_accuracy": 0.8071405053138733,
"num_tokens": 551947950.0,
"step": 6230
},
{
"entropy": 1.0392578125,
"epoch": 0.8528668078999522,
"grad_norm": 0.6656892799085763,
"learning_rate": 2.9572354515992675e-06,
"loss": 0.7528,
"mean_token_accuracy": 0.7969357162714005,
"num_tokens": 552800468.0,
"step": 6240
},
{
"entropy": 0.972265625,
"epoch": 0.8542335816305611,
"grad_norm": 0.6526200848098279,
"learning_rate": 2.9537128364097507e-06,
"loss": 0.6793,
"mean_token_accuracy": 0.8168550312519074,
"num_tokens": 553683283.0,
"step": 6250
},
{
"entropy": 1.0193359375,
"epoch": 0.85560035536117,
"grad_norm": 0.5986318452375786,
"learning_rate": 2.9501902212202342e-06,
"loss": 0.732,
"mean_token_accuracy": 0.8053601443767547,
"num_tokens": 554603674.0,
"step": 6260
},
{
"entropy": 1.0435546875,
"epoch": 0.8569671290917789,
"grad_norm": 0.6156806211960425,
"learning_rate": 2.9466676060307178e-06,
"loss": 0.7548,
"mean_token_accuracy": 0.7986608207225799,
"num_tokens": 555498911.0,
"step": 6270
},
{
"entropy": 1.0533203125,
"epoch": 0.8583339028223878,
"grad_norm": 0.6567629242558556,
"learning_rate": 2.943144990841201e-06,
"loss": 0.7446,
"mean_token_accuracy": 0.8029854267835617,
"num_tokens": 556398231.0,
"step": 6280
},
{
"entropy": 1.0212890625,
"epoch": 0.8597006765529966,
"grad_norm": 0.6957245286892078,
"learning_rate": 2.939622375651684e-06,
"loss": 0.7086,
"mean_token_accuracy": 0.8106298923492432,
"num_tokens": 557289325.0,
"step": 6290
},
{
"entropy": 1.0455078125,
"epoch": 0.8610674502836055,
"grad_norm": 0.7237829897910655,
"learning_rate": 2.936099760462167e-06,
"loss": 0.7767,
"mean_token_accuracy": 0.7954044491052628,
"num_tokens": 558215409.0,
"step": 6300
},
{
"entropy": 1.0162109375,
"epoch": 0.8624342240142144,
"grad_norm": 0.6448016454935606,
"learning_rate": 2.932577145272651e-06,
"loss": 0.6653,
"mean_token_accuracy": 0.8193833529949188,
"num_tokens": 559078072.0,
"step": 6310
},
{
"entropy": 1.0521484375,
"epoch": 0.8638009977448233,
"grad_norm": 0.6194823081479063,
"learning_rate": 2.9290545300831342e-06,
"loss": 0.7427,
"mean_token_accuracy": 0.8033340096473693,
"num_tokens": 559985199.0,
"step": 6320
},
{
"entropy": 1.0572265625,
"epoch": 0.8651677714754322,
"grad_norm": 0.6790673205751923,
"learning_rate": 2.9255319148936174e-06,
"loss": 0.7561,
"mean_token_accuracy": 0.8005869537591934,
"num_tokens": 560873774.0,
"step": 6330
},
{
"entropy": 1.0029296875,
"epoch": 0.8665345452060411,
"grad_norm": 0.657983699165942,
"learning_rate": 2.9220092997041005e-06,
"loss": 0.6744,
"mean_token_accuracy": 0.8176503092050552,
"num_tokens": 561773112.0,
"step": 6340
},
{
"entropy": 1.04453125,
"epoch": 0.86790131893665,
"grad_norm": 0.6659014386025032,
"learning_rate": 2.9184866845145836e-06,
"loss": 0.7412,
"mean_token_accuracy": 0.8051764130592346,
"num_tokens": 562659591.0,
"step": 6350
},
{
"entropy": 1.044140625,
"epoch": 0.8692680926672589,
"grad_norm": 0.6889456075205868,
"learning_rate": 2.9149640693250667e-06,
"loss": 0.7475,
"mean_token_accuracy": 0.7987612932920456,
"num_tokens": 563573747.0,
"step": 6360
},
{
"entropy": 1.024609375,
"epoch": 0.8706348663978678,
"grad_norm": 0.6842636347824659,
"learning_rate": 2.9114414541355507e-06,
"loss": 0.7465,
"mean_token_accuracy": 0.8013798415660858,
"num_tokens": 564444810.0,
"step": 6370
},
{
"entropy": 1.03828125,
"epoch": 0.8720016401284767,
"grad_norm": 0.6161957274814754,
"learning_rate": 2.907918838946034e-06,
"loss": 0.7221,
"mean_token_accuracy": 0.8081075340509415,
"num_tokens": 565334063.0,
"step": 6380
},
{
"entropy": 1.01796875,
"epoch": 0.8733684138590856,
"grad_norm": 0.7034304690600339,
"learning_rate": 2.904396223756517e-06,
"loss": 0.7342,
"mean_token_accuracy": 0.8031708717346191,
"num_tokens": 566217603.0,
"step": 6390
},
{
"entropy": 1.044140625,
"epoch": 0.8747351875896945,
"grad_norm": 0.6926913864516543,
"learning_rate": 2.9008736085670005e-06,
"loss": 0.7414,
"mean_token_accuracy": 0.8032770097255707,
"num_tokens": 567103733.0,
"step": 6400
},
{
"entropy": 1.00546875,
"epoch": 0.8761019613203034,
"grad_norm": 0.7317247467332018,
"learning_rate": 2.8973509933774836e-06,
"loss": 0.7059,
"mean_token_accuracy": 0.8094389736652374,
"num_tokens": 567958707.0,
"step": 6410
},
{
"entropy": 1.0318359375,
"epoch": 0.8774687350509123,
"grad_norm": 0.6375575504679791,
"learning_rate": 2.893828378187967e-06,
"loss": 0.7632,
"mean_token_accuracy": 0.7988681823015213,
"num_tokens": 568857102.0,
"step": 6420
},
{
"entropy": 0.98671875,
"epoch": 0.8788355087815212,
"grad_norm": 0.6498550557161864,
"learning_rate": 2.8903057629984503e-06,
"loss": 0.6993,
"mean_token_accuracy": 0.8111351490020752,
"num_tokens": 569724676.0,
"step": 6430
},
{
"entropy": 1.0087890625,
"epoch": 0.8802022825121301,
"grad_norm": 0.6849815967577918,
"learning_rate": 2.886783147808934e-06,
"loss": 0.6969,
"mean_token_accuracy": 0.8109969347715378,
"num_tokens": 570626696.0,
"step": 6440
},
{
"entropy": 1.0724609375,
"epoch": 0.8815690562427391,
"grad_norm": 0.6474740516023542,
"learning_rate": 2.883260532619417e-06,
"loss": 0.7708,
"mean_token_accuracy": 0.7947840005159378,
"num_tokens": 571490412.0,
"step": 6450
},
{
"entropy": 1.0240234375,
"epoch": 0.882935829973348,
"grad_norm": 0.7645288556228143,
"learning_rate": 2.8797379174299e-06,
"loss": 0.7184,
"mean_token_accuracy": 0.8054411143064499,
"num_tokens": 572332785.0,
"step": 6460
},
{
"entropy": 0.9876953125,
"epoch": 0.8843026037039569,
"grad_norm": 0.6199149148446579,
"learning_rate": 2.876215302240383e-06,
"loss": 0.6788,
"mean_token_accuracy": 0.8179264694452286,
"num_tokens": 573204987.0,
"step": 6470
},
{
"entropy": 1.0541015625,
"epoch": 0.8856693774345658,
"grad_norm": 0.7303331027626061,
"learning_rate": 2.872692687050867e-06,
"loss": 0.7649,
"mean_token_accuracy": 0.7989874750375747,
"num_tokens": 574117752.0,
"step": 6480
},
{
"entropy": 1.0390625,
"epoch": 0.8870361511651746,
"grad_norm": 0.639860671251743,
"learning_rate": 2.8691700718613503e-06,
"loss": 0.7271,
"mean_token_accuracy": 0.8029191762208938,
"num_tokens": 575003850.0,
"step": 6490
},
{
"entropy": 1.00625,
"epoch": 0.8884029248957835,
"grad_norm": 0.7026735735469369,
"learning_rate": 2.8656474566718334e-06,
"loss": 0.7124,
"mean_token_accuracy": 0.8065544188022613,
"num_tokens": 575921233.0,
"step": 6500
},
{
"entropy": 0.9912109375,
"epoch": 0.8897696986263924,
"grad_norm": 0.6072689085738608,
"learning_rate": 2.8621248414823165e-06,
"loss": 0.6811,
"mean_token_accuracy": 0.8146295964717865,
"num_tokens": 576814818.0,
"step": 6510
},
{
"entropy": 1.0498046875,
"epoch": 0.8911364723570013,
"grad_norm": 0.7783823927819524,
"learning_rate": 2.8586022262927997e-06,
"loss": 0.7294,
"mean_token_accuracy": 0.8041055619716644,
"num_tokens": 577627640.0,
"step": 6520
},
{
"entropy": 1.0748046875,
"epoch": 0.8925032460876102,
"grad_norm": 0.6194892527801009,
"learning_rate": 2.8550796111032836e-06,
"loss": 0.7797,
"mean_token_accuracy": 0.7932856291532516,
"num_tokens": 578521956.0,
"step": 6530
},
{
"entropy": 1.021484375,
"epoch": 0.8938700198182191,
"grad_norm": 0.6757584718660479,
"learning_rate": 2.8515569959137668e-06,
"loss": 0.7344,
"mean_token_accuracy": 0.8043972373008728,
"num_tokens": 579395782.0,
"step": 6540
},
{
"entropy": 1.0255859375,
"epoch": 0.895236793548828,
"grad_norm": 0.6271633733725858,
"learning_rate": 2.84803438072425e-06,
"loss": 0.7135,
"mean_token_accuracy": 0.8092946767807007,
"num_tokens": 580272157.0,
"step": 6550
},
{
"entropy": 1.0333984375,
"epoch": 0.8966035672794369,
"grad_norm": 0.6883547857406265,
"learning_rate": 2.844511765534733e-06,
"loss": 0.7229,
"mean_token_accuracy": 0.8075386971235275,
"num_tokens": 581146537.0,
"step": 6560
},
{
"entropy": 0.986328125,
"epoch": 0.8979703410100458,
"grad_norm": 0.6149206600969737,
"learning_rate": 2.8409891503452166e-06,
"loss": 0.7207,
"mean_token_accuracy": 0.8074608564376831,
"num_tokens": 582048135.0,
"step": 6570
},
{
"entropy": 1.0298828125,
"epoch": 0.8993371147406547,
"grad_norm": 0.6839011596012747,
"learning_rate": 2.8374665351556997e-06,
"loss": 0.7395,
"mean_token_accuracy": 0.8032248020172119,
"num_tokens": 582904287.0,
"step": 6580
},
{
"entropy": 1.03359375,
"epoch": 0.9007038884712636,
"grad_norm": 0.651790219079347,
"learning_rate": 2.8339439199661832e-06,
"loss": 0.742,
"mean_token_accuracy": 0.8035044193267822,
"num_tokens": 583826125.0,
"step": 6590
},
{
"entropy": 1.0494140625,
"epoch": 0.9020706622018725,
"grad_norm": 0.6654634046641361,
"learning_rate": 2.8304213047766663e-06,
"loss": 0.7616,
"mean_token_accuracy": 0.7968823820352554,
"num_tokens": 584674987.0,
"step": 6600
},
{
"entropy": 1.00546875,
"epoch": 0.9034374359324814,
"grad_norm": 0.6640662908364235,
"learning_rate": 2.82689868958715e-06,
"loss": 0.7104,
"mean_token_accuracy": 0.8087728917598724,
"num_tokens": 585567786.0,
"step": 6610
},
{
"entropy": 1.0232421875,
"epoch": 0.9048042096630903,
"grad_norm": 0.7000903012354781,
"learning_rate": 2.823376074397633e-06,
"loss": 0.763,
"mean_token_accuracy": 0.7996203184127808,
"num_tokens": 586446088.0,
"step": 6620
},
{
"entropy": 1.0255859375,
"epoch": 0.9061709833936992,
"grad_norm": 0.7452071444945799,
"learning_rate": 2.819853459208116e-06,
"loss": 0.7354,
"mean_token_accuracy": 0.8046149373054504,
"num_tokens": 587291210.0,
"step": 6630
},
{
"entropy": 1.059765625,
"epoch": 0.9075377571243081,
"grad_norm": 0.6805557486497118,
"learning_rate": 2.8163308440186e-06,
"loss": 0.772,
"mean_token_accuracy": 0.796043199300766,
"num_tokens": 588175587.0,
"step": 6640
},
{
"entropy": 1.0326171875,
"epoch": 0.908904530854917,
"grad_norm": 0.7240695129840293,
"learning_rate": 2.8128082288290832e-06,
"loss": 0.7029,
"mean_token_accuracy": 0.8112336784601212,
"num_tokens": 589051406.0,
"step": 6650
},
{
"entropy": 1.0462890625,
"epoch": 0.9102713045855259,
"grad_norm": 0.7227777577962519,
"learning_rate": 2.8092856136395664e-06,
"loss": 0.7334,
"mean_token_accuracy": 0.8020247668027878,
"num_tokens": 589942110.0,
"step": 6660
},
{
"entropy": 1.040234375,
"epoch": 0.9116380783161347,
"grad_norm": 0.7142495022919767,
"learning_rate": 2.8057629984500495e-06,
"loss": 0.7466,
"mean_token_accuracy": 0.8004952311515808,
"num_tokens": 590877907.0,
"step": 6670
},
{
"entropy": 1.018359375,
"epoch": 0.9130048520467436,
"grad_norm": 0.6229780485464748,
"learning_rate": 2.8022403832605326e-06,
"loss": 0.7363,
"mean_token_accuracy": 0.8042032152414322,
"num_tokens": 591773456.0,
"step": 6680
},
{
"entropy": 1.0130859375,
"epoch": 0.9143716257773525,
"grad_norm": 0.6466737492159823,
"learning_rate": 2.7987177680710157e-06,
"loss": 0.6981,
"mean_token_accuracy": 0.8119980305433273,
"num_tokens": 592686986.0,
"step": 6690
},
{
"entropy": 1.0404296875,
"epoch": 0.9157383995079614,
"grad_norm": 0.7523728521339864,
"learning_rate": 2.7951951528814997e-06,
"loss": 0.7413,
"mean_token_accuracy": 0.8014860779047013,
"num_tokens": 593589156.0,
"step": 6700
},
{
"entropy": 1.0240234375,
"epoch": 0.9171051732385703,
"grad_norm": 0.6500458690835362,
"learning_rate": 2.791672537691983e-06,
"loss": 0.7467,
"mean_token_accuracy": 0.800911408662796,
"num_tokens": 594522006.0,
"step": 6710
},
{
"entropy": 0.9962890625,
"epoch": 0.9184719469691792,
"grad_norm": 0.6793130054601448,
"learning_rate": 2.788149922502466e-06,
"loss": 0.7285,
"mean_token_accuracy": 0.8059966385364532,
"num_tokens": 595400912.0,
"step": 6720
},
{
"entropy": 1.012109375,
"epoch": 0.9198387206997881,
"grad_norm": 0.8744839282404142,
"learning_rate": 2.784627307312949e-06,
"loss": 0.723,
"mean_token_accuracy": 0.8073657065629959,
"num_tokens": 596309300.0,
"step": 6730
},
{
"entropy": 1.0046875,
"epoch": 0.921205494430397,
"grad_norm": 0.644118752014997,
"learning_rate": 2.7811046921234326e-06,
"loss": 0.6838,
"mean_token_accuracy": 0.8146449357271195,
"num_tokens": 597210330.0,
"step": 6740
},
{
"entropy": 1.0486328125,
"epoch": 0.9225722681610059,
"grad_norm": 0.688490488270096,
"learning_rate": 2.777582076933916e-06,
"loss": 0.7464,
"mean_token_accuracy": 0.8026282370090485,
"num_tokens": 598081617.0,
"step": 6750
},
{
"entropy": 1.020703125,
"epoch": 0.9239390418916148,
"grad_norm": 0.6197950159397121,
"learning_rate": 2.7740594617443993e-06,
"loss": 0.7282,
"mean_token_accuracy": 0.8043126493692399,
"num_tokens": 598983716.0,
"step": 6760
},
{
"entropy": 1.0021484375,
"epoch": 0.9253058156222237,
"grad_norm": 0.7083194508129859,
"learning_rate": 2.770536846554883e-06,
"loss": 0.704,
"mean_token_accuracy": 0.8102409362792968,
"num_tokens": 599918368.0,
"step": 6770
},
{
"entropy": 1.0251953125,
"epoch": 0.9266725893528326,
"grad_norm": 0.6567851737919456,
"learning_rate": 2.767014231365366e-06,
"loss": 0.7438,
"mean_token_accuracy": 0.8036640852689743,
"num_tokens": 600794870.0,
"step": 6780
},
{
"entropy": 1.0376953125,
"epoch": 0.9280393630834415,
"grad_norm": 0.6682654190678856,
"learning_rate": 2.763491616175849e-06,
"loss": 0.7763,
"mean_token_accuracy": 0.7984342277050018,
"num_tokens": 601726884.0,
"step": 6790
},
{
"entropy": 1.003125,
"epoch": 0.9294061368140505,
"grad_norm": 0.7177646382415886,
"learning_rate": 2.759969000986332e-06,
"loss": 0.7368,
"mean_token_accuracy": 0.802795696258545,
"num_tokens": 602627133.0,
"step": 6800
},
{
"entropy": 0.98828125,
"epoch": 0.9307729105446594,
"grad_norm": 0.6668665989992697,
"learning_rate": 2.756446385796816e-06,
"loss": 0.7023,
"mean_token_accuracy": 0.8096280723810196,
"num_tokens": 603501852.0,
"step": 6810
},
{
"entropy": 1.0078125,
"epoch": 0.9321396842752683,
"grad_norm": 0.6477821654483423,
"learning_rate": 2.7529237706072993e-06,
"loss": 0.6926,
"mean_token_accuracy": 0.8128400057554245,
"num_tokens": 604404913.0,
"step": 6820
},
{
"entropy": 1.01953125,
"epoch": 0.9335064580058772,
"grad_norm": 0.6125051129694505,
"learning_rate": 2.7494011554177824e-06,
"loss": 0.7396,
"mean_token_accuracy": 0.8025951862335206,
"num_tokens": 605285242.0,
"step": 6830
},
{
"entropy": 1.051953125,
"epoch": 0.9348732317364861,
"grad_norm": 0.701252765291259,
"learning_rate": 2.7458785402282656e-06,
"loss": 0.7602,
"mean_token_accuracy": 0.7965040624141693,
"num_tokens": 606154610.0,
"step": 6840
},
{
"entropy": 1.0546875,
"epoch": 0.936240005467095,
"grad_norm": 0.6708988025365819,
"learning_rate": 2.7423559250387487e-06,
"loss": 0.7653,
"mean_token_accuracy": 0.7981054604053497,
"num_tokens": 607046840.0,
"step": 6850
},
{
"entropy": 1.0173828125,
"epoch": 0.9376067791977039,
"grad_norm": 0.6403545174023948,
"learning_rate": 2.7388333098492326e-06,
"loss": 0.7268,
"mean_token_accuracy": 0.806942954659462,
"num_tokens": 607882778.0,
"step": 6860
},
{
"entropy": 1.0021484375,
"epoch": 0.9389735529283127,
"grad_norm": 0.6566433761185085,
"learning_rate": 2.7353106946597158e-06,
"loss": 0.7438,
"mean_token_accuracy": 0.8023928791284561,
"num_tokens": 608824241.0,
"step": 6870
},
{
"entropy": 1.0474609375,
"epoch": 0.9403403266589216,
"grad_norm": 0.772852683850758,
"learning_rate": 2.731788079470199e-06,
"loss": 0.746,
"mean_token_accuracy": 0.7995448529720306,
"num_tokens": 609676651.0,
"step": 6880
},
{
"entropy": 1.0310546875,
"epoch": 0.9417071003895305,
"grad_norm": 0.6679191653307655,
"learning_rate": 2.728265464280682e-06,
"loss": 0.7614,
"mean_token_accuracy": 0.7991016447544098,
"num_tokens": 610543423.0,
"step": 6890
},
{
"entropy": 1.0259765625,
"epoch": 0.9430738741201394,
"grad_norm": 0.6195037104663528,
"learning_rate": 2.7247428490911656e-06,
"loss": 0.7161,
"mean_token_accuracy": 0.807607215642929,
"num_tokens": 611399783.0,
"step": 6900
},
{
"entropy": 1.0388671875,
"epoch": 0.9444406478507483,
"grad_norm": 0.7150124145607535,
"learning_rate": 2.7212202339016487e-06,
"loss": 0.7448,
"mean_token_accuracy": 0.8015163332223892,
"num_tokens": 612298608.0,
"step": 6910
},
{
"entropy": 1.0041015625,
"epoch": 0.9458074215813572,
"grad_norm": 0.6157256424655645,
"learning_rate": 2.7176976187121322e-06,
"loss": 0.7584,
"mean_token_accuracy": 0.7986271679401398,
"num_tokens": 613248091.0,
"step": 6920
},
{
"entropy": 1.03515625,
"epoch": 0.9471741953119661,
"grad_norm": 0.6660304390175997,
"learning_rate": 2.7141750035226154e-06,
"loss": 0.7342,
"mean_token_accuracy": 0.80340396463871,
"num_tokens": 614177532.0,
"step": 6930
},
{
"entropy": 1.0396484375,
"epoch": 0.948540969042575,
"grad_norm": 0.6997204775234258,
"learning_rate": 2.710652388333099e-06,
"loss": 0.7437,
"mean_token_accuracy": 0.8031268626451492,
"num_tokens": 615083286.0,
"step": 6940
},
{
"entropy": 1.0537109375,
"epoch": 0.9499077427731839,
"grad_norm": 0.6414090596518616,
"learning_rate": 2.707129773143582e-06,
"loss": 0.7949,
"mean_token_accuracy": 0.7895577758550644,
"num_tokens": 616002316.0,
"step": 6950
},
{
"entropy": 1.0009765625,
"epoch": 0.9512745165037928,
"grad_norm": 0.6908133276961677,
"learning_rate": 2.703607157954065e-06,
"loss": 0.7213,
"mean_token_accuracy": 0.8047549605369568,
"num_tokens": 616898102.0,
"step": 6960
},
{
"entropy": 1.0619140625,
"epoch": 0.9526412902344017,
"grad_norm": 0.7078548132334659,
"learning_rate": 2.7000845427645483e-06,
"loss": 0.7739,
"mean_token_accuracy": 0.7956016302108765,
"num_tokens": 617749598.0,
"step": 6970
},
{
"entropy": 0.990234375,
"epoch": 0.9540080639650106,
"grad_norm": 0.6837928411297678,
"learning_rate": 2.6965619275750322e-06,
"loss": 0.6994,
"mean_token_accuracy": 0.8107070326805115,
"num_tokens": 618614766.0,
"step": 6980
},
{
"entropy": 1.048046875,
"epoch": 0.9553748376956195,
"grad_norm": 0.7573365826054568,
"learning_rate": 2.6930393123855154e-06,
"loss": 0.7779,
"mean_token_accuracy": 0.7973843842744828,
"num_tokens": 619527250.0,
"step": 6990
},
{
"entropy": 1.06484375,
"epoch": 0.9567416114262284,
"grad_norm": 0.6968924019601463,
"learning_rate": 2.6895166971959985e-06,
"loss": 0.779,
"mean_token_accuracy": 0.7942759484052658,
"num_tokens": 620389290.0,
"step": 7000
},
{
"entropy": 0.9984375,
"epoch": 0.9581083851568373,
"grad_norm": 0.64334455810851,
"learning_rate": 2.6859940820064816e-06,
"loss": 0.7039,
"mean_token_accuracy": 0.8131767541170121,
"num_tokens": 621260557.0,
"step": 7010
},
{
"entropy": 1.0611328125,
"epoch": 0.9594751588874462,
"grad_norm": 0.7880803428726261,
"learning_rate": 2.6824714668169647e-06,
"loss": 0.7372,
"mean_token_accuracy": 0.8031187295913697,
"num_tokens": 622132062.0,
"step": 7020
},
{
"entropy": 1.0248046875,
"epoch": 0.9608419326180551,
"grad_norm": 0.6894258345122939,
"learning_rate": 2.6789488516274487e-06,
"loss": 0.7739,
"mean_token_accuracy": 0.797334510087967,
"num_tokens": 623083505.0,
"step": 7030
},
{
"entropy": 1.0314453125,
"epoch": 0.962208706348664,
"grad_norm": 0.7601175935372178,
"learning_rate": 2.675426236437932e-06,
"loss": 0.7033,
"mean_token_accuracy": 0.8112381219863891,
"num_tokens": 624013009.0,
"step": 7040
},
{
"entropy": 1.0017578125,
"epoch": 0.9635754800792729,
"grad_norm": 0.6379878191807042,
"learning_rate": 2.671903621248415e-06,
"loss": 0.7333,
"mean_token_accuracy": 0.8019950360059738,
"num_tokens": 624866319.0,
"step": 7050
},
{
"entropy": 1.0123046875,
"epoch": 0.9649422538098817,
"grad_norm": 0.6895450165153825,
"learning_rate": 2.668381006058898e-06,
"loss": 0.7488,
"mean_token_accuracy": 0.7994422554969788,
"num_tokens": 625727325.0,
"step": 7060
},
{
"entropy": 1.0517578125,
"epoch": 0.9663090275404906,
"grad_norm": 0.6543662789031309,
"learning_rate": 2.6648583908693816e-06,
"loss": 0.7234,
"mean_token_accuracy": 0.8052160292863846,
"num_tokens": 626605530.0,
"step": 7070
},
{
"entropy": 1.0666015625,
"epoch": 0.9676758012710995,
"grad_norm": 0.7420660999634132,
"learning_rate": 2.6613357756798648e-06,
"loss": 0.8015,
"mean_token_accuracy": 0.7924046903848648,
"num_tokens": 627487707.0,
"step": 7080
},
{
"entropy": 1.04375,
"epoch": 0.9690425750017084,
"grad_norm": 0.6751466069685652,
"learning_rate": 2.6578131604903483e-06,
"loss": 0.7456,
"mean_token_accuracy": 0.8016633421182633,
"num_tokens": 628336825.0,
"step": 7090
},
{
"entropy": 1.006640625,
"epoch": 0.9704093487323173,
"grad_norm": 0.6704961940035628,
"learning_rate": 2.6542905453008314e-06,
"loss": 0.7126,
"mean_token_accuracy": 0.8098105162382125,
"num_tokens": 629226993.0,
"step": 7100
},
{
"entropy": 1.0373046875,
"epoch": 0.9717761224629262,
"grad_norm": 0.6571120640420073,
"learning_rate": 2.650767930111315e-06,
"loss": 0.7479,
"mean_token_accuracy": 0.8022092849016189,
"num_tokens": 630127171.0,
"step": 7110
},
{
"entropy": 1.02890625,
"epoch": 0.9731428961935351,
"grad_norm": 0.644673069602459,
"learning_rate": 2.647245314921798e-06,
"loss": 0.7207,
"mean_token_accuracy": 0.8062548607587814,
"num_tokens": 631049821.0,
"step": 7120
},
{
"entropy": 1.017578125,
"epoch": 0.974509669924144,
"grad_norm": 0.5993625021355329,
"learning_rate": 2.6437226997322812e-06,
"loss": 0.7244,
"mean_token_accuracy": 0.8088390469551087,
"num_tokens": 631978925.0,
"step": 7130
},
{
"entropy": 1.03828125,
"epoch": 0.9758764436547529,
"grad_norm": 0.6384141615896881,
"learning_rate": 2.640200084542765e-06,
"loss": 0.7098,
"mean_token_accuracy": 0.8073332756757736,
"num_tokens": 632874005.0,
"step": 7140
},
{
"entropy": 1.033203125,
"epoch": 0.9772432173853619,
"grad_norm": 0.7574977547751265,
"learning_rate": 2.6366774693532483e-06,
"loss": 0.7447,
"mean_token_accuracy": 0.8014765679836273,
"num_tokens": 633703539.0,
"step": 7150
},
{
"entropy": 1.0634765625,
"epoch": 0.9786099911159708,
"grad_norm": 0.7305484393025342,
"learning_rate": 2.6331548541637314e-06,
"loss": 0.762,
"mean_token_accuracy": 0.7971678763628006,
"num_tokens": 634587023.0,
"step": 7160
},
{
"entropy": 1.0064453125,
"epoch": 0.9799767648465797,
"grad_norm": 0.5878780322944448,
"learning_rate": 2.6296322389742146e-06,
"loss": 0.7074,
"mean_token_accuracy": 0.8103152453899384,
"num_tokens": 635488376.0,
"step": 7170
},
{
"entropy": 0.99296875,
"epoch": 0.9813435385771886,
"grad_norm": 0.661908110748234,
"learning_rate": 2.6261096237846977e-06,
"loss": 0.714,
"mean_token_accuracy": 0.8070233643054963,
"num_tokens": 636356843.0,
"step": 7180
},
{
"entropy": 1.018359375,
"epoch": 0.9827103123077975,
"grad_norm": 0.7183256435813489,
"learning_rate": 2.622587008595181e-06,
"loss": 0.7418,
"mean_token_accuracy": 0.8026507526636124,
"num_tokens": 637214936.0,
"step": 7190
},
{
"entropy": 1.0431640625,
"epoch": 0.9840770860384064,
"grad_norm": 0.7164962536021089,
"learning_rate": 2.6190643934056648e-06,
"loss": 0.7536,
"mean_token_accuracy": 0.7979041546583175,
"num_tokens": 638111430.0,
"step": 7200
},
{
"entropy": 1.058203125,
"epoch": 0.9854438597690153,
"grad_norm": 0.6264383714856159,
"learning_rate": 2.615541778216148e-06,
"loss": 0.7706,
"mean_token_accuracy": 0.7982787132263184,
"num_tokens": 638975613.0,
"step": 7210
},
{
"entropy": 1.0236328125,
"epoch": 0.9868106334996242,
"grad_norm": 0.6825308764683631,
"learning_rate": 2.612019163026631e-06,
"loss": 0.7146,
"mean_token_accuracy": 0.8070366233587265,
"num_tokens": 639844309.0,
"step": 7220
},
{
"entropy": 1.0623046875,
"epoch": 0.9881774072302331,
"grad_norm": 0.7215659086687091,
"learning_rate": 2.6084965478371146e-06,
"loss": 0.7834,
"mean_token_accuracy": 0.7937191188335418,
"num_tokens": 640732612.0,
"step": 7230
},
{
"entropy": 0.9802734375,
"epoch": 0.989544180960842,
"grad_norm": 0.6156130078540817,
"learning_rate": 2.6049739326475977e-06,
"loss": 0.7148,
"mean_token_accuracy": 0.8098976105451584,
"num_tokens": 641622965.0,
"step": 7240
},
{
"entropy": 1.057421875,
"epoch": 0.9909109546914509,
"grad_norm": 0.7381159864929149,
"learning_rate": 2.6014513174580812e-06,
"loss": 0.7197,
"mean_token_accuracy": 0.807045865058899,
"num_tokens": 642493831.0,
"step": 7250
},
{
"entropy": 1.013671875,
"epoch": 0.9922777284220597,
"grad_norm": 0.6683436656175098,
"learning_rate": 2.5979287022685644e-06,
"loss": 0.7176,
"mean_token_accuracy": 0.8095707416534423,
"num_tokens": 643358509.0,
"step": 7260
},
{
"entropy": 0.988671875,
"epoch": 0.9936445021526686,
"grad_norm": 0.6607848624235159,
"learning_rate": 2.594406087079048e-06,
"loss": 0.6879,
"mean_token_accuracy": 0.8139492630958557,
"num_tokens": 644234904.0,
"step": 7270
},
{
"entropy": 1.0609375,
"epoch": 0.9950112758832775,
"grad_norm": 0.6576456156447203,
"learning_rate": 2.590883471889531e-06,
"loss": 0.7826,
"mean_token_accuracy": 0.7935572326183319,
"num_tokens": 645107938.0,
"step": 7280
},
{
"entropy": 1.01796875,
"epoch": 0.9963780496138864,
"grad_norm": 0.650232648961243,
"learning_rate": 2.587360856700014e-06,
"loss": 0.7251,
"mean_token_accuracy": 0.8062494158744812,
"num_tokens": 645973503.0,
"step": 7290
},
{
"entropy": 1.0244140625,
"epoch": 0.9977448233444953,
"grad_norm": 0.666765506802057,
"learning_rate": 2.5838382415104973e-06,
"loss": 0.7314,
"mean_token_accuracy": 0.8052476018667221,
"num_tokens": 646849773.0,
"step": 7300
},
{
"entropy": 1.0431640625,
"epoch": 0.9991115970751042,
"grad_norm": 0.6477963814242129,
"learning_rate": 2.5803156263209813e-06,
"loss": 0.7514,
"mean_token_accuracy": 0.801161241531372,
"num_tokens": 647714153.0,
"step": 7310
},
{
"entropy": 1.0657894736842106,
"epoch": 1.0004100321191827,
"grad_norm": 0.7042763028086272,
"learning_rate": 2.5767930111314644e-06,
"loss": 0.8074,
"mean_token_accuracy": 0.7918616125458166,
"num_tokens": 648591763.0,
"step": 7320
},
{
"entropy": 1.033203125,
"epoch": 1.0017768058497916,
"grad_norm": 0.6356554096254161,
"learning_rate": 2.5732703959419475e-06,
"loss": 0.7186,
"mean_token_accuracy": 0.8073570400476455,
"num_tokens": 649446852.0,
"step": 7330
},
{
"entropy": 0.990625,
"epoch": 1.0031435795804005,
"grad_norm": 0.5873690574446951,
"learning_rate": 2.5697477807524306e-06,
"loss": 0.7153,
"mean_token_accuracy": 0.8073994874954223,
"num_tokens": 650395487.0,
"step": 7340
},
{
"entropy": 0.9654296875,
"epoch": 1.0045103533110094,
"grad_norm": 0.7021521443495583,
"learning_rate": 2.5662251655629138e-06,
"loss": 0.6954,
"mean_token_accuracy": 0.8118454605340958,
"num_tokens": 651283020.0,
"step": 7350
},
{
"entropy": 1.0140625,
"epoch": 1.0058771270416182,
"grad_norm": 0.7323613471254071,
"learning_rate": 2.5627025503733977e-06,
"loss": 0.7237,
"mean_token_accuracy": 0.8039433300495148,
"num_tokens": 652168918.0,
"step": 7360
},
{
"entropy": 1.0255859375,
"epoch": 1.0072439007722271,
"grad_norm": 0.6676944856315249,
"learning_rate": 2.559179935183881e-06,
"loss": 0.7509,
"mean_token_accuracy": 0.8017844527959823,
"num_tokens": 653038499.0,
"step": 7370
},
{
"entropy": 1.0130859375,
"epoch": 1.008610674502836,
"grad_norm": 0.7475316156966741,
"learning_rate": 2.555657319994364e-06,
"loss": 0.7187,
"mean_token_accuracy": 0.8069318473339081,
"num_tokens": 653925430.0,
"step": 7380
},
{
"entropy": 0.999609375,
"epoch": 1.009977448233445,
"grad_norm": 0.6340337568917523,
"learning_rate": 2.552134704804847e-06,
"loss": 0.712,
"mean_token_accuracy": 0.8088026344776154,
"num_tokens": 654833925.0,
"step": 7390
},
{
"entropy": 1.04453125,
"epoch": 1.0113442219640538,
"grad_norm": 0.691706697540941,
"learning_rate": 2.5486120896153306e-06,
"loss": 0.754,
"mean_token_accuracy": 0.7994970858097077,
"num_tokens": 655696986.0,
"step": 7400
},
{
"entropy": 1.0017578125,
"epoch": 1.0127109956946627,
"grad_norm": 0.7479998434941596,
"learning_rate": 2.5450894744258138e-06,
"loss": 0.6932,
"mean_token_accuracy": 0.8134619891643524,
"num_tokens": 656585655.0,
"step": 7410
},
{
"entropy": 0.967578125,
"epoch": 1.0140777694252716,
"grad_norm": 0.7242760970784189,
"learning_rate": 2.5415668592362973e-06,
"loss": 0.6693,
"mean_token_accuracy": 0.8190474063158035,
"num_tokens": 657442572.0,
"step": 7420
},
{
"entropy": 0.978125,
"epoch": 1.0154445431558805,
"grad_norm": 0.6853081489079434,
"learning_rate": 2.5380442440467804e-06,
"loss": 0.6825,
"mean_token_accuracy": 0.815705531835556,
"num_tokens": 658344385.0,
"step": 7430
},
{
"entropy": 1.04609375,
"epoch": 1.0168113168864894,
"grad_norm": 0.8197857020022398,
"learning_rate": 2.534521628857264e-06,
"loss": 0.7656,
"mean_token_accuracy": 0.7963131248950959,
"num_tokens": 659214294.0,
"step": 7440
},
{
"entropy": 0.9896484375,
"epoch": 1.0181780906170983,
"grad_norm": 0.5883233437553218,
"learning_rate": 2.530999013667747e-06,
"loss": 0.7113,
"mean_token_accuracy": 0.8087290436029434,
"num_tokens": 660072515.0,
"step": 7450
},
{
"entropy": 1.07734375,
"epoch": 1.0195448643477072,
"grad_norm": 0.8182009582049645,
"learning_rate": 2.5274763984782302e-06,
"loss": 0.7787,
"mean_token_accuracy": 0.7965607196092606,
"num_tokens": 660959998.0,
"step": 7460
},
{
"entropy": 0.9658203125,
"epoch": 1.020911638078316,
"grad_norm": 0.6858616325403759,
"learning_rate": 2.5239537832887138e-06,
"loss": 0.6872,
"mean_token_accuracy": 0.815222904086113,
"num_tokens": 661875700.0,
"step": 7470
},
{
"entropy": 1.0109375,
"epoch": 1.022278411808925,
"grad_norm": 0.7085492921190026,
"learning_rate": 2.5204311680991973e-06,
"loss": 0.6992,
"mean_token_accuracy": 0.8110994219779968,
"num_tokens": 662774852.0,
"step": 7480
},
{
"entropy": 0.9990234375,
"epoch": 1.0236451855395339,
"grad_norm": 0.6084345769964534,
"learning_rate": 2.5169085529096804e-06,
"loss": 0.667,
"mean_token_accuracy": 0.8187077909708023,
"num_tokens": 663594608.0,
"step": 7490
},
{
"entropy": 1.0125,
"epoch": 1.0250119592701428,
"grad_norm": 0.7550787660207128,
"learning_rate": 2.5133859377201636e-06,
"loss": 0.7354,
"mean_token_accuracy": 0.8029546618461609,
"num_tokens": 664461143.0,
"step": 7500
},
{
"entropy": 1.0318359375,
"epoch": 1.0263787330007517,
"grad_norm": 0.68316883275626,
"learning_rate": 2.5098633225306467e-06,
"loss": 0.7375,
"mean_token_accuracy": 0.8023369699716568,
"num_tokens": 665355418.0,
"step": 7510
},
{
"entropy": 0.9810546875,
"epoch": 1.0277455067313606,
"grad_norm": 0.6691546327873653,
"learning_rate": 2.50634070734113e-06,
"loss": 0.7048,
"mean_token_accuracy": 0.8075759261846542,
"num_tokens": 666259994.0,
"step": 7520
},
{
"entropy": 0.9921875,
"epoch": 1.0291122804619695,
"grad_norm": 0.6290737645387929,
"learning_rate": 2.502818092151614e-06,
"loss": 0.7188,
"mean_token_accuracy": 0.8092032611370087,
"num_tokens": 667126480.0,
"step": 7530
},
{
"entropy": 0.9904296875,
"epoch": 1.0304790541925783,
"grad_norm": 0.7312795598729401,
"learning_rate": 2.499295476962097e-06,
"loss": 0.7165,
"mean_token_accuracy": 0.8066180497407913,
"num_tokens": 668015004.0,
"step": 7540
},
{
"entropy": 1.00390625,
"epoch": 1.0318458279231872,
"grad_norm": 0.6460624459481372,
"learning_rate": 2.49577286177258e-06,
"loss": 0.721,
"mean_token_accuracy": 0.8077930688858033,
"num_tokens": 668927065.0,
"step": 7550
},
{
"entropy": 0.988671875,
"epoch": 1.0332126016537961,
"grad_norm": 0.6513103235825893,
"learning_rate": 2.492250246583063e-06,
"loss": 0.7464,
"mean_token_accuracy": 0.8030341982841491,
"num_tokens": 669799875.0,
"step": 7560
},
{
"entropy": 1.0083984375,
"epoch": 1.034579375384405,
"grad_norm": 0.7052100138190095,
"learning_rate": 2.4887276313935467e-06,
"loss": 0.6734,
"mean_token_accuracy": 0.817026087641716,
"num_tokens": 670673474.0,
"step": 7570
},
{
"entropy": 0.9939453125,
"epoch": 1.035946149115014,
"grad_norm": 0.6220191930316891,
"learning_rate": 2.48520501620403e-06,
"loss": 0.6911,
"mean_token_accuracy": 0.8139413118362426,
"num_tokens": 671584047.0,
"step": 7580
},
{
"entropy": 0.973046875,
"epoch": 1.0373129228456228,
"grad_norm": 0.6742268735484271,
"learning_rate": 2.4816824010145134e-06,
"loss": 0.6662,
"mean_token_accuracy": 0.8160956174135208,
"num_tokens": 672451040.0,
"step": 7590
},
{
"entropy": 0.9994140625,
"epoch": 1.0386796965762317,
"grad_norm": 0.7758158663107451,
"learning_rate": 2.478159785824997e-06,
"loss": 0.7259,
"mean_token_accuracy": 0.8068961590528488,
"num_tokens": 673394919.0,
"step": 7600
},
{
"entropy": 0.98359375,
"epoch": 1.0400464703068406,
"grad_norm": 0.705234755975034,
"learning_rate": 2.47463717063548e-06,
"loss": 0.6879,
"mean_token_accuracy": 0.8142964363098144,
"num_tokens": 674297118.0,
"step": 7610
},
{
"entropy": 1.0365234375,
"epoch": 1.0414132440374495,
"grad_norm": 0.6256548114506058,
"learning_rate": 2.4711145554459636e-06,
"loss": 0.7462,
"mean_token_accuracy": 0.8019334495067596,
"num_tokens": 675208936.0,
"step": 7620
},
{
"entropy": 1.0162109375,
"epoch": 1.0427800177680584,
"grad_norm": 0.6861689847519904,
"learning_rate": 2.4675919402564467e-06,
"loss": 0.7216,
"mean_token_accuracy": 0.8064171105623246,
"num_tokens": 676084432.0,
"step": 7630
},
{
"entropy": 1.0134765625,
"epoch": 1.0441467914986673,
"grad_norm": 0.6430682813615555,
"learning_rate": 2.46406932506693e-06,
"loss": 0.7133,
"mean_token_accuracy": 0.8078578144311905,
"num_tokens": 677002994.0,
"step": 7640
},
{
"entropy": 0.9984375,
"epoch": 1.0455135652292762,
"grad_norm": 0.7395753512753102,
"learning_rate": 2.4605467098774134e-06,
"loss": 0.7309,
"mean_token_accuracy": 0.8057282894849778,
"num_tokens": 677933461.0,
"step": 7650
},
{
"entropy": 0.9685546875,
"epoch": 1.0468803389598853,
"grad_norm": 0.6159826170969495,
"learning_rate": 2.4570240946878965e-06,
"loss": 0.7234,
"mean_token_accuracy": 0.8064192742109298,
"num_tokens": 678803569.0,
"step": 7660
},
{
"entropy": 0.9951171875,
"epoch": 1.0482471126904942,
"grad_norm": 0.6722082301501315,
"learning_rate": 2.4535014794983796e-06,
"loss": 0.7319,
"mean_token_accuracy": 0.8058870553970336,
"num_tokens": 679680533.0,
"step": 7670
},
{
"entropy": 0.9693359375,
"epoch": 1.049613886421103,
"grad_norm": 0.6980901948021629,
"learning_rate": 2.449978864308863e-06,
"loss": 0.6774,
"mean_token_accuracy": 0.8166791647672653,
"num_tokens": 680523782.0,
"step": 7680
},
{
"entropy": 1.002734375,
"epoch": 1.050980660151712,
"grad_norm": 0.6580543640339002,
"learning_rate": 2.4464562491193463e-06,
"loss": 0.7126,
"mean_token_accuracy": 0.8087829142808914,
"num_tokens": 681377055.0,
"step": 7690
},
{
"entropy": 1.006640625,
"epoch": 1.0523474338823209,
"grad_norm": 0.7837149898266933,
"learning_rate": 2.4429336339298294e-06,
"loss": 0.7292,
"mean_token_accuracy": 0.8066399991512299,
"num_tokens": 682286031.0,
"step": 7700
},
{
"entropy": 0.9453125,
"epoch": 1.0537142076129298,
"grad_norm": 0.6813196128289352,
"learning_rate": 2.439411018740313e-06,
"loss": 0.6648,
"mean_token_accuracy": 0.8154626756906509,
"num_tokens": 683137335.0,
"step": 7710
},
{
"entropy": 0.983984375,
"epoch": 1.0550809813435387,
"grad_norm": 0.6015312056953328,
"learning_rate": 2.435888403550796e-06,
"loss": 0.6548,
"mean_token_accuracy": 0.8204831004142761,
"num_tokens": 683993688.0,
"step": 7720
},
{
"entropy": 1.007421875,
"epoch": 1.0564477550741476,
"grad_norm": 0.691594639414402,
"learning_rate": 2.4323657883612797e-06,
"loss": 0.7516,
"mean_token_accuracy": 0.8010935962200165,
"num_tokens": 684887017.0,
"step": 7730
},
{
"entropy": 1.0189453125,
"epoch": 1.0578145288047565,
"grad_norm": 0.6702185091988787,
"learning_rate": 2.4288431731717628e-06,
"loss": 0.7149,
"mean_token_accuracy": 0.8058607935905456,
"num_tokens": 685740410.0,
"step": 7740
},
{
"entropy": 1.0017578125,
"epoch": 1.0591813025353654,
"grad_norm": 0.772648347317478,
"learning_rate": 2.4253205579822463e-06,
"loss": 0.7149,
"mean_token_accuracy": 0.8068384468555451,
"num_tokens": 686594655.0,
"step": 7750
},
{
"entropy": 0.9587890625,
"epoch": 1.0605480762659742,
"grad_norm": 0.6275801369255711,
"learning_rate": 2.4217979427927294e-06,
"loss": 0.6827,
"mean_token_accuracy": 0.8147635638713837,
"num_tokens": 687452138.0,
"step": 7760
},
{
"entropy": 0.9498046875,
"epoch": 1.0619148499965831,
"grad_norm": 0.6342660439350649,
"learning_rate": 2.418275327603213e-06,
"loss": 0.7135,
"mean_token_accuracy": 0.8100977748632431,
"num_tokens": 688323704.0,
"step": 7770
},
{
"entropy": 0.9884765625,
"epoch": 1.063281623727192,
"grad_norm": 0.7496743295966769,
"learning_rate": 2.414752712413696e-06,
"loss": 0.6977,
"mean_token_accuracy": 0.8104572802782058,
"num_tokens": 689208797.0,
"step": 7780
},
{
"entropy": 0.9734375,
"epoch": 1.064648397457801,
"grad_norm": 0.6765945219312358,
"learning_rate": 2.4112300972241797e-06,
"loss": 0.6684,
"mean_token_accuracy": 0.8177749693393708,
"num_tokens": 690082488.0,
"step": 7790
},
{
"entropy": 0.985546875,
"epoch": 1.0660151711884098,
"grad_norm": 0.6410203121070265,
"learning_rate": 2.4077074820346628e-06,
"loss": 0.7425,
"mean_token_accuracy": 0.8031936883926392,
"num_tokens": 690974253.0,
"step": 7800
},
{
"entropy": 1.0177734375,
"epoch": 1.0673819449190187,
"grad_norm": 0.6938986126204604,
"learning_rate": 2.404184866845146e-06,
"loss": 0.7235,
"mean_token_accuracy": 0.8043199151754379,
"num_tokens": 691884193.0,
"step": 7810
},
{
"entropy": 1.0029296875,
"epoch": 1.0687487186496276,
"grad_norm": 0.684193197073462,
"learning_rate": 2.4006622516556295e-06,
"loss": 0.7273,
"mean_token_accuracy": 0.8055897384881974,
"num_tokens": 692774904.0,
"step": 7820
},
{
"entropy": 1.0158203125,
"epoch": 1.0701154923802365,
"grad_norm": 0.6682587743454518,
"learning_rate": 2.3971396364661126e-06,
"loss": 0.7339,
"mean_token_accuracy": 0.8049996584653855,
"num_tokens": 693642265.0,
"step": 7830
},
{
"entropy": 1.004296875,
"epoch": 1.0714822661108454,
"grad_norm": 0.6920348337469813,
"learning_rate": 2.393617021276596e-06,
"loss": 0.7048,
"mean_token_accuracy": 0.8105228692293167,
"num_tokens": 694520615.0,
"step": 7840
},
{
"entropy": 1.0,
"epoch": 1.0728490398414543,
"grad_norm": 0.6171663661225222,
"learning_rate": 2.3900944060870793e-06,
"loss": 0.7012,
"mean_token_accuracy": 0.8118210822343827,
"num_tokens": 695379137.0,
"step": 7850
},
{
"entropy": 1.0169921875,
"epoch": 1.0742158135720632,
"grad_norm": 0.6351229680859666,
"learning_rate": 2.3865717908975624e-06,
"loss": 0.7094,
"mean_token_accuracy": 0.8074415504932404,
"num_tokens": 696271994.0,
"step": 7860
},
{
"entropy": 1.0130859375,
"epoch": 1.075582587302672,
"grad_norm": 0.7281512070793137,
"learning_rate": 2.383049175708046e-06,
"loss": 0.7024,
"mean_token_accuracy": 0.8113619744777679,
"num_tokens": 697156934.0,
"step": 7870
},
{
"entropy": 0.97109375,
"epoch": 1.076949361033281,
"grad_norm": 0.7768213699857249,
"learning_rate": 2.379526560518529e-06,
"loss": 0.7208,
"mean_token_accuracy": 0.8062454134225845,
"num_tokens": 698027349.0,
"step": 7880
},
{
"entropy": 1.03203125,
"epoch": 1.0783161347638899,
"grad_norm": 0.688385723204841,
"learning_rate": 2.376003945329012e-06,
"loss": 0.7581,
"mean_token_accuracy": 0.798772183060646,
"num_tokens": 698930447.0,
"step": 7890
},
{
"entropy": 0.9419921875,
"epoch": 1.0796829084944988,
"grad_norm": 0.686194668031148,
"learning_rate": 2.3724813301394957e-06,
"loss": 0.6285,
"mean_token_accuracy": 0.8267990529537201,
"num_tokens": 699791840.0,
"step": 7900
},
{
"entropy": 0.9625,
"epoch": 1.0810496822251077,
"grad_norm": 0.6069107557586068,
"learning_rate": 2.368958714949979e-06,
"loss": 0.6561,
"mean_token_accuracy": 0.8203893452882767,
"num_tokens": 700643155.0,
"step": 7910
},
{
"entropy": 0.99375,
"epoch": 1.0824164559557166,
"grad_norm": 0.6601542185402244,
"learning_rate": 2.3654360997604624e-06,
"loss": 0.6781,
"mean_token_accuracy": 0.8144112437963485,
"num_tokens": 701513474.0,
"step": 7920
},
{
"entropy": 0.9955078125,
"epoch": 1.0837832296863255,
"grad_norm": 0.6692724481581773,
"learning_rate": 2.3619134845709455e-06,
"loss": 0.6968,
"mean_token_accuracy": 0.8134819358587265,
"num_tokens": 702423369.0,
"step": 7930
},
{
"entropy": 1.025,
"epoch": 1.0851500034169344,
"grad_norm": 0.604833037552161,
"learning_rate": 2.358390869381429e-06,
"loss": 0.6996,
"mean_token_accuracy": 0.8113126665353775,
"num_tokens": 703297260.0,
"step": 7940
},
{
"entropy": 1.005078125,
"epoch": 1.0865167771475432,
"grad_norm": 0.6456606433454788,
"learning_rate": 2.354868254191912e-06,
"loss": 0.7247,
"mean_token_accuracy": 0.8051157116889953,
"num_tokens": 704211864.0,
"step": 7950
},
{
"entropy": 1.01484375,
"epoch": 1.0878835508781521,
"grad_norm": 0.7226377962969541,
"learning_rate": 2.3513456390023957e-06,
"loss": 0.699,
"mean_token_accuracy": 0.8120273888111115,
"num_tokens": 705113336.0,
"step": 7960
},
{
"entropy": 1.01953125,
"epoch": 1.089250324608761,
"grad_norm": 0.6724075567288547,
"learning_rate": 2.347823023812879e-06,
"loss": 0.7069,
"mean_token_accuracy": 0.8086336225271225,
"num_tokens": 705967220.0,
"step": 7970
},
{
"entropy": 1.03828125,
"epoch": 1.09061709833937,
"grad_norm": 0.6590703077856747,
"learning_rate": 2.3443004086233624e-06,
"loss": 0.686,
"mean_token_accuracy": 0.8137315183877945,
"num_tokens": 706841729.0,
"step": 7980
},
{
"entropy": 0.974609375,
"epoch": 1.0919838720699788,
"grad_norm": 0.7354162677966868,
"learning_rate": 2.3407777934338455e-06,
"loss": 0.664,
"mean_token_accuracy": 0.8188916146755219,
"num_tokens": 707742723.0,
"step": 7990
},
{
"entropy": 1.003515625,
"epoch": 1.0933506458005877,
"grad_norm": 0.6703936707465422,
"learning_rate": 2.3372551782443286e-06,
"loss": 0.6938,
"mean_token_accuracy": 0.8138497948646546,
"num_tokens": 708621892.0,
"step": 8000
},
{
"entropy": 1.0041015625,
"epoch": 1.0947174195311966,
"grad_norm": 0.6476507217781851,
"learning_rate": 2.333732563054812e-06,
"loss": 0.713,
"mean_token_accuracy": 0.8076718658208847,
"num_tokens": 709529009.0,
"step": 8010
},
{
"entropy": 1.0046875,
"epoch": 1.0960841932618055,
"grad_norm": 0.7255944446288496,
"learning_rate": 2.3302099478652953e-06,
"loss": 0.7028,
"mean_token_accuracy": 0.8123784542083741,
"num_tokens": 710431822.0,
"step": 8020
},
{
"entropy": 1.015234375,
"epoch": 1.0974509669924144,
"grad_norm": 0.7355028098054017,
"learning_rate": 2.3266873326757784e-06,
"loss": 0.7134,
"mean_token_accuracy": 0.8104434192180634,
"num_tokens": 711282131.0,
"step": 8030
},
{
"entropy": 1.0697265625,
"epoch": 1.0988177407230233,
"grad_norm": 0.7055926787455147,
"learning_rate": 2.323164717486262e-06,
"loss": 0.7738,
"mean_token_accuracy": 0.7941668868064881,
"num_tokens": 712177392.0,
"step": 8040
},
{
"entropy": 0.9505859375,
"epoch": 1.1001845144536322,
"grad_norm": 0.6257232587518962,
"learning_rate": 2.319642102296745e-06,
"loss": 0.6892,
"mean_token_accuracy": 0.8155448943376541,
"num_tokens": 713063521.0,
"step": 8050
},
{
"entropy": 0.98203125,
"epoch": 1.101551288184241,
"grad_norm": 0.6819927576126057,
"learning_rate": 2.3161194871072287e-06,
"loss": 0.6973,
"mean_token_accuracy": 0.8107710540294647,
"num_tokens": 713932139.0,
"step": 8060
},
{
"entropy": 0.9572265625,
"epoch": 1.10291806191485,
"grad_norm": 0.6802757744572574,
"learning_rate": 2.3125968719177118e-06,
"loss": 0.6813,
"mean_token_accuracy": 0.8139048665761948,
"num_tokens": 714800743.0,
"step": 8070
},
{
"entropy": 1.015234375,
"epoch": 1.1042848356454589,
"grad_norm": 0.7171903551119797,
"learning_rate": 2.3090742567281953e-06,
"loss": 0.7273,
"mean_token_accuracy": 0.8047040581703186,
"num_tokens": 715716767.0,
"step": 8080
},
{
"entropy": 1.0138671875,
"epoch": 1.1056516093760678,
"grad_norm": 0.625708794545922,
"learning_rate": 2.3055516415386785e-06,
"loss": 0.7385,
"mean_token_accuracy": 0.8034493327140808,
"num_tokens": 716586164.0,
"step": 8090
},
{
"entropy": 0.9955078125,
"epoch": 1.1070183831066767,
"grad_norm": 0.7707824677711159,
"learning_rate": 2.302029026349162e-06,
"loss": 0.7087,
"mean_token_accuracy": 0.8106034874916077,
"num_tokens": 717454801.0,
"step": 8100
},
{
"entropy": 1.0033203125,
"epoch": 1.1083851568372856,
"grad_norm": 0.8115396200824381,
"learning_rate": 2.298506411159645e-06,
"loss": 0.7086,
"mean_token_accuracy": 0.8106143742799758,
"num_tokens": 718358774.0,
"step": 8110
},
{
"entropy": 1.000390625,
"epoch": 1.1097519305678945,
"grad_norm": 0.7172960271585622,
"learning_rate": 2.2949837959701287e-06,
"loss": 0.7143,
"mean_token_accuracy": 0.8057805925607682,
"num_tokens": 719306865.0,
"step": 8120
},
{
"entropy": 0.9998046875,
"epoch": 1.1111187042985033,
"grad_norm": 0.6800885356630095,
"learning_rate": 2.291461180780612e-06,
"loss": 0.71,
"mean_token_accuracy": 0.808951523900032,
"num_tokens": 720218145.0,
"step": 8130
},
{
"entropy": 0.98828125,
"epoch": 1.1124854780291122,
"grad_norm": 0.7194975410594376,
"learning_rate": 2.287938565591095e-06,
"loss": 0.6599,
"mean_token_accuracy": 0.8183215349912644,
"num_tokens": 721112536.0,
"step": 8140
},
{
"entropy": 0.96328125,
"epoch": 1.1138522517597211,
"grad_norm": 0.5930775543222069,
"learning_rate": 2.2844159504015785e-06,
"loss": 0.6904,
"mean_token_accuracy": 0.8132164448499679,
"num_tokens": 722020751.0,
"step": 8150
},
{
"entropy": 1.00390625,
"epoch": 1.11521902549033,
"grad_norm": 0.693719055527234,
"learning_rate": 2.2808933352120616e-06,
"loss": 0.7062,
"mean_token_accuracy": 0.8119580984115601,
"num_tokens": 722858329.0,
"step": 8160
},
{
"entropy": 0.99453125,
"epoch": 1.116585799220939,
"grad_norm": 0.6528876515817587,
"learning_rate": 2.277370720022545e-06,
"loss": 0.702,
"mean_token_accuracy": 0.8081823259592056,
"num_tokens": 723733723.0,
"step": 8170
},
{
"entropy": 1.0048828125,
"epoch": 1.1179525729515478,
"grad_norm": 0.6908996838711663,
"learning_rate": 2.2738481048330283e-06,
"loss": 0.7311,
"mean_token_accuracy": 0.803116860985756,
"num_tokens": 724643810.0,
"step": 8180
},
{
"entropy": 0.9771484375,
"epoch": 1.1193193466821567,
"grad_norm": 0.7014427953629199,
"learning_rate": 2.2703254896435114e-06,
"loss": 0.719,
"mean_token_accuracy": 0.8065745949745178,
"num_tokens": 725562682.0,
"step": 8190
},
{
"entropy": 0.9998046875,
"epoch": 1.1206861204127656,
"grad_norm": 0.6491409366963765,
"learning_rate": 2.266802874453995e-06,
"loss": 0.7348,
"mean_token_accuracy": 0.804522430896759,
"num_tokens": 726462837.0,
"step": 8200
},
{
"entropy": 1.0025390625,
"epoch": 1.1220528941433745,
"grad_norm": 0.764901199408337,
"learning_rate": 2.263280259264478e-06,
"loss": 0.7127,
"mean_token_accuracy": 0.80663483440876,
"num_tokens": 727331679.0,
"step": 8210
},
{
"entropy": 0.95546875,
"epoch": 1.1234196678739834,
"grad_norm": 0.6516646475940557,
"learning_rate": 2.259757644074961e-06,
"loss": 0.6252,
"mean_token_accuracy": 0.8267205238342286,
"num_tokens": 728213250.0,
"step": 8220
},
{
"entropy": 1.0119140625,
"epoch": 1.1247864416045923,
"grad_norm": 0.6485004783187548,
"learning_rate": 2.2562350288854447e-06,
"loss": 0.7245,
"mean_token_accuracy": 0.8078707754611969,
"num_tokens": 729111281.0,
"step": 8230
},
{
"entropy": 0.9802734375,
"epoch": 1.1261532153352012,
"grad_norm": 0.7194619733105524,
"learning_rate": 2.252712413695928e-06,
"loss": 0.6885,
"mean_token_accuracy": 0.81288683116436,
"num_tokens": 729959862.0,
"step": 8240
},
{
"entropy": 1.00546875,
"epoch": 1.12751998906581,
"grad_norm": 0.7059251276075109,
"learning_rate": 2.2491897985064114e-06,
"loss": 0.7365,
"mean_token_accuracy": 0.801463508605957,
"num_tokens": 730854597.0,
"step": 8250
},
{
"entropy": 0.9958984375,
"epoch": 1.128886762796419,
"grad_norm": 0.7254416944408016,
"learning_rate": 2.2456671833168945e-06,
"loss": 0.6853,
"mean_token_accuracy": 0.814212492108345,
"num_tokens": 731702559.0,
"step": 8260
},
{
"entropy": 0.984765625,
"epoch": 1.1302535365270279,
"grad_norm": 0.7586434140756896,
"learning_rate": 2.242144568127378e-06,
"loss": 0.7372,
"mean_token_accuracy": 0.8039417535066604,
"num_tokens": 732555774.0,
"step": 8270
},
{
"entropy": 1.0240234375,
"epoch": 1.1316203102576368,
"grad_norm": 0.5992553007038247,
"learning_rate": 2.238621952937861e-06,
"loss": 0.742,
"mean_token_accuracy": 0.8032137811183929,
"num_tokens": 733472536.0,
"step": 8280
},
{
"entropy": 1.0294921875,
"epoch": 1.1329870839882457,
"grad_norm": 0.7378302464555057,
"learning_rate": 2.2350993377483447e-06,
"loss": 0.7393,
"mean_token_accuracy": 0.8021186590194702,
"num_tokens": 734343325.0,
"step": 8290
},
{
"entropy": 0.9994140625,
"epoch": 1.1343538577188546,
"grad_norm": 0.6988141169826818,
"learning_rate": 2.231576722558828e-06,
"loss": 0.7199,
"mean_token_accuracy": 0.8061704188585281,
"num_tokens": 735209167.0,
"step": 8300
},
{
"entropy": 0.982421875,
"epoch": 1.1357206314494634,
"grad_norm": 0.7039106421076626,
"learning_rate": 2.2280541073693114e-06,
"loss": 0.6669,
"mean_token_accuracy": 0.8172649383544922,
"num_tokens": 736102499.0,
"step": 8310
},
{
"entropy": 1.037890625,
"epoch": 1.1370874051800723,
"grad_norm": 0.7256224286130204,
"learning_rate": 2.2245314921797945e-06,
"loss": 0.7538,
"mean_token_accuracy": 0.7982185065746308,
"num_tokens": 736993752.0,
"step": 8320
},
{
"entropy": 1.0029296875,
"epoch": 1.1384541789106812,
"grad_norm": 0.6568104501256895,
"learning_rate": 2.2210088769902777e-06,
"loss": 0.7107,
"mean_token_accuracy": 0.808477258682251,
"num_tokens": 737905549.0,
"step": 8330
},
{
"entropy": 0.926171875,
"epoch": 1.1398209526412901,
"grad_norm": 0.6934625685104987,
"learning_rate": 2.217486261800761e-06,
"loss": 0.617,
"mean_token_accuracy": 0.8287739217281341,
"num_tokens": 738743099.0,
"step": 8340
},
{
"entropy": 1.0119140625,
"epoch": 1.141187726371899,
"grad_norm": 0.6778386585950011,
"learning_rate": 2.2139636466112443e-06,
"loss": 0.7169,
"mean_token_accuracy": 0.8084857523441314,
"num_tokens": 739666732.0,
"step": 8350
},
{
"entropy": 0.9556640625,
"epoch": 1.142554500102508,
"grad_norm": 0.6943189845950576,
"learning_rate": 2.2104410314217275e-06,
"loss": 0.6677,
"mean_token_accuracy": 0.8190559178590775,
"num_tokens": 740545036.0,
"step": 8360
},
{
"entropy": 1.009375,
"epoch": 1.1439212738331168,
"grad_norm": 0.7417352354725748,
"learning_rate": 2.206918416232211e-06,
"loss": 0.7204,
"mean_token_accuracy": 0.8069242119789124,
"num_tokens": 741452530.0,
"step": 8370
},
{
"entropy": 1.0037109375,
"epoch": 1.1452880475637257,
"grad_norm": 0.6538810379331951,
"learning_rate": 2.203395801042694e-06,
"loss": 0.7467,
"mean_token_accuracy": 0.7992920488119125,
"num_tokens": 742353736.0,
"step": 8380
},
{
"entropy": 0.9923828125,
"epoch": 1.1466548212943346,
"grad_norm": 0.7251015284939197,
"learning_rate": 2.1998731858531777e-06,
"loss": 0.6947,
"mean_token_accuracy": 0.8123692363500595,
"num_tokens": 743291796.0,
"step": 8390
},
{
"entropy": 1.0046875,
"epoch": 1.1480215950249435,
"grad_norm": 0.7407204620850868,
"learning_rate": 2.196350570663661e-06,
"loss": 0.6686,
"mean_token_accuracy": 0.8183214426040649,
"num_tokens": 744191576.0,
"step": 8400
},
{
"entropy": 1.00625,
"epoch": 1.1493883687555526,
"grad_norm": 0.6638839674431364,
"learning_rate": 2.192827955474144e-06,
"loss": 0.688,
"mean_token_accuracy": 0.8149029016494751,
"num_tokens": 745053472.0,
"step": 8410
},
{
"entropy": 0.9623046875,
"epoch": 1.1507551424861615,
"grad_norm": 0.6125991929518065,
"learning_rate": 2.1893053402846275e-06,
"loss": 0.6798,
"mean_token_accuracy": 0.8161431431770325,
"num_tokens": 745945754.0,
"step": 8420
},
{
"entropy": 1.0326171875,
"epoch": 1.1521219162167704,
"grad_norm": 0.6994951664965418,
"learning_rate": 2.1857827250951106e-06,
"loss": 0.746,
"mean_token_accuracy": 0.8041573941707612,
"num_tokens": 746861785.0,
"step": 8430
},
{
"entropy": 1.03359375,
"epoch": 1.1534886899473793,
"grad_norm": 0.6916201231116991,
"learning_rate": 2.182260109905594e-06,
"loss": 0.7309,
"mean_token_accuracy": 0.8029678553342819,
"num_tokens": 747742441.0,
"step": 8440
},
{
"entropy": 0.9802734375,
"epoch": 1.1548554636779882,
"grad_norm": 0.6745434614107698,
"learning_rate": 2.1787374947160777e-06,
"loss": 0.6968,
"mean_token_accuracy": 0.8136020243167877,
"num_tokens": 748609606.0,
"step": 8450
},
{
"entropy": 0.9552734375,
"epoch": 1.156222237408597,
"grad_norm": 0.5914350397498208,
"learning_rate": 2.175214879526561e-06,
"loss": 0.7253,
"mean_token_accuracy": 0.8061337530612945,
"num_tokens": 749527900.0,
"step": 8460
},
{
"entropy": 1.0103515625,
"epoch": 1.157589011139206,
"grad_norm": 0.6815002856787347,
"learning_rate": 2.171692264337044e-06,
"loss": 0.7078,
"mean_token_accuracy": 0.8082710921764373,
"num_tokens": 750396477.0,
"step": 8470
},
{
"entropy": 0.987890625,
"epoch": 1.1589557848698149,
"grad_norm": 0.6719623857698652,
"learning_rate": 2.1681696491475275e-06,
"loss": 0.6993,
"mean_token_accuracy": 0.8110468506813049,
"num_tokens": 751256327.0,
"step": 8480
},
{
"entropy": 1.0044921875,
"epoch": 1.1603225586004238,
"grad_norm": 0.6421760645350653,
"learning_rate": 2.1646470339580106e-06,
"loss": 0.6879,
"mean_token_accuracy": 0.8141223669052124,
"num_tokens": 752202319.0,
"step": 8490
},
{
"entropy": 0.9796875,
"epoch": 1.1616893323310327,
"grad_norm": 0.6955537165444219,
"learning_rate": 2.1611244187684937e-06,
"loss": 0.676,
"mean_token_accuracy": 0.8178388357162476,
"num_tokens": 753076870.0,
"step": 8500
},
{
"entropy": 0.9869140625,
"epoch": 1.1630561060616416,
"grad_norm": 0.6319953800182476,
"learning_rate": 2.1576018035789773e-06,
"loss": 0.7125,
"mean_token_accuracy": 0.8088477909564972,
"num_tokens": 753992426.0,
"step": 8510
},
{
"entropy": 0.9681640625,
"epoch": 1.1644228797922505,
"grad_norm": 0.7109080304505716,
"learning_rate": 2.1540791883894604e-06,
"loss": 0.6926,
"mean_token_accuracy": 0.8118502974510193,
"num_tokens": 754824603.0,
"step": 8520
},
{
"entropy": 1.011328125,
"epoch": 1.1657896535228593,
"grad_norm": 0.6630950545124246,
"learning_rate": 2.150556573199944e-06,
"loss": 0.7086,
"mean_token_accuracy": 0.8112895041704178,
"num_tokens": 755695653.0,
"step": 8530
},
{
"entropy": 0.9689453125,
"epoch": 1.1671564272534682,
"grad_norm": 0.6198760836315323,
"learning_rate": 2.147033958010427e-06,
"loss": 0.672,
"mean_token_accuracy": 0.8181088984012603,
"num_tokens": 756583392.0,
"step": 8540
},
{
"entropy": 1.0064453125,
"epoch": 1.1685232009840771,
"grad_norm": 0.740489431714006,
"learning_rate": 2.14351134282091e-06,
"loss": 0.6969,
"mean_token_accuracy": 0.8110064148902894,
"num_tokens": 757484772.0,
"step": 8550
},
{
"entropy": 0.9587890625,
"epoch": 1.169889974714686,
"grad_norm": 0.7086124905668687,
"learning_rate": 2.1399887276313937e-06,
"loss": 0.6409,
"mean_token_accuracy": 0.8243378132581711,
"num_tokens": 758398852.0,
"step": 8560
},
{
"entropy": 1.005078125,
"epoch": 1.171256748445295,
"grad_norm": 0.6524138934526202,
"learning_rate": 2.136466112441877e-06,
"loss": 0.7385,
"mean_token_accuracy": 0.8041610717773438,
"num_tokens": 759304325.0,
"step": 8570
},
{
"entropy": 0.98359375,
"epoch": 1.1726235221759038,
"grad_norm": 0.7011420074077952,
"learning_rate": 2.1329434972523604e-06,
"loss": 0.6767,
"mean_token_accuracy": 0.8150423675775528,
"num_tokens": 760182897.0,
"step": 8580
},
{
"entropy": 1.0091796875,
"epoch": 1.1739902959065127,
"grad_norm": 0.6776833881755528,
"learning_rate": 2.1294208820628435e-06,
"loss": 0.7021,
"mean_token_accuracy": 0.8097686290740966,
"num_tokens": 761046394.0,
"step": 8590
},
{
"entropy": 1.02109375,
"epoch": 1.1753570696371216,
"grad_norm": 0.726295391250599,
"learning_rate": 2.125898266873327e-06,
"loss": 0.7199,
"mean_token_accuracy": 0.8055275917053223,
"num_tokens": 761983231.0,
"step": 8600
},
{
"entropy": 1.016796875,
"epoch": 1.1767238433677305,
"grad_norm": 0.6181879885362659,
"learning_rate": 2.12237565168381e-06,
"loss": 0.691,
"mean_token_accuracy": 0.813907366991043,
"num_tokens": 762882518.0,
"step": 8610
},
{
"entropy": 0.994921875,
"epoch": 1.1780906170983394,
"grad_norm": 0.698009189511748,
"learning_rate": 2.1188530364942938e-06,
"loss": 0.7448,
"mean_token_accuracy": 0.8034333825111389,
"num_tokens": 763770291.0,
"step": 8620
},
{
"entropy": 0.9421875,
"epoch": 1.1794573908289483,
"grad_norm": 0.5969854879099485,
"learning_rate": 2.115330421304777e-06,
"loss": 0.6865,
"mean_token_accuracy": 0.8126303791999817,
"num_tokens": 764654419.0,
"step": 8630
},
{
"entropy": 0.9681640625,
"epoch": 1.1808241645595572,
"grad_norm": 0.6269316517535588,
"learning_rate": 2.1118078061152604e-06,
"loss": 0.6936,
"mean_token_accuracy": 0.8155817270278931,
"num_tokens": 765587578.0,
"step": 8640
},
{
"entropy": 0.9625,
"epoch": 1.182190938290166,
"grad_norm": 0.6428325485281918,
"learning_rate": 2.1082851909257435e-06,
"loss": 0.6926,
"mean_token_accuracy": 0.8117691248655319,
"num_tokens": 766486320.0,
"step": 8650
},
{
"entropy": 0.9927734375,
"epoch": 1.183557712020775,
"grad_norm": 0.5979077673220664,
"learning_rate": 2.1047625757362267e-06,
"loss": 0.7064,
"mean_token_accuracy": 0.8104310095310211,
"num_tokens": 767398093.0,
"step": 8660
},
{
"entropy": 0.9931640625,
"epoch": 1.1849244857513839,
"grad_norm": 0.689784038936836,
"learning_rate": 2.1012399605467102e-06,
"loss": 0.6989,
"mean_token_accuracy": 0.8096615195274353,
"num_tokens": 768249145.0,
"step": 8670
},
{
"entropy": 1.0076171875,
"epoch": 1.1862912594819928,
"grad_norm": 0.6462672864188248,
"learning_rate": 2.0977173453571933e-06,
"loss": 0.7129,
"mean_token_accuracy": 0.8098836779594422,
"num_tokens": 769095450.0,
"step": 8680
},
{
"entropy": 1.00390625,
"epoch": 1.1876580332126017,
"grad_norm": 0.760545690814659,
"learning_rate": 2.0941947301676765e-06,
"loss": 0.7617,
"mean_token_accuracy": 0.7970137685537338,
"num_tokens": 769933084.0,
"step": 8690
},
{
"entropy": 0.9837890625,
"epoch": 1.1890248069432106,
"grad_norm": 0.6672294842756432,
"learning_rate": 2.09067211497816e-06,
"loss": 0.714,
"mean_token_accuracy": 0.8083206474781036,
"num_tokens": 770828053.0,
"step": 8700
},
{
"entropy": 1.0103515625,
"epoch": 1.1903915806738194,
"grad_norm": 0.7035754137021792,
"learning_rate": 2.087149499788643e-06,
"loss": 0.6995,
"mean_token_accuracy": 0.8080589652061463,
"num_tokens": 771702147.0,
"step": 8710
},
{
"entropy": 1.0048828125,
"epoch": 1.1917583544044283,
"grad_norm": 0.7976031907387695,
"learning_rate": 2.0836268845991263e-06,
"loss": 0.6939,
"mean_token_accuracy": 0.8130421459674835,
"num_tokens": 772586595.0,
"step": 8720
},
{
"entropy": 0.9974609375,
"epoch": 1.1931251281350372,
"grad_norm": 0.7268516011235843,
"learning_rate": 2.08010426940961e-06,
"loss": 0.7156,
"mean_token_accuracy": 0.8087893992662429,
"num_tokens": 773492144.0,
"step": 8730
},
{
"entropy": 1.0048828125,
"epoch": 1.1944919018656461,
"grad_norm": 0.7057362353730703,
"learning_rate": 2.076581654220093e-06,
"loss": 0.7179,
"mean_token_accuracy": 0.8085781306028366,
"num_tokens": 774384486.0,
"step": 8740
},
{
"entropy": 0.954296875,
"epoch": 1.195858675596255,
"grad_norm": 0.7884169969414491,
"learning_rate": 2.0730590390305765e-06,
"loss": 0.6747,
"mean_token_accuracy": 0.8180738836526871,
"num_tokens": 775257458.0,
"step": 8750
},
{
"entropy": 0.9849609375,
"epoch": 1.197225449326864,
"grad_norm": 0.7565319500094089,
"learning_rate": 2.0695364238410596e-06,
"loss": 0.7156,
"mean_token_accuracy": 0.8068888425827027,
"num_tokens": 776188791.0,
"step": 8760
},
{
"entropy": 1.0107421875,
"epoch": 1.1985922230574728,
"grad_norm": 0.6324448220192138,
"learning_rate": 2.066013808651543e-06,
"loss": 0.7122,
"mean_token_accuracy": 0.8081376940011978,
"num_tokens": 777067934.0,
"step": 8770
},
{
"entropy": 1.0041015625,
"epoch": 1.1999589967880817,
"grad_norm": 0.7717750669860713,
"learning_rate": 2.0624911934620263e-06,
"loss": 0.7355,
"mean_token_accuracy": 0.8060664713382721,
"num_tokens": 777918469.0,
"step": 8780
},
{
"entropy": 1.0255859375,
"epoch": 1.2013257705186906,
"grad_norm": 0.654387475999256,
"learning_rate": 2.05896857827251e-06,
"loss": 0.7596,
"mean_token_accuracy": 0.7990208148956299,
"num_tokens": 778840876.0,
"step": 8790
},
{
"entropy": 0.98828125,
"epoch": 1.2026925442492995,
"grad_norm": 0.6862605542690982,
"learning_rate": 2.055445963082993e-06,
"loss": 0.6828,
"mean_token_accuracy": 0.8156201779842377,
"num_tokens": 779722325.0,
"step": 8800
},
{
"entropy": 0.95546875,
"epoch": 1.2040593179799084,
"grad_norm": 0.7239426341288425,
"learning_rate": 2.0519233478934765e-06,
"loss": 0.686,
"mean_token_accuracy": 0.8138014167547226,
"num_tokens": 780628547.0,
"step": 8810
},
{
"entropy": 1.0193359375,
"epoch": 1.2054260917105173,
"grad_norm": 0.6962068088937692,
"learning_rate": 2.0484007327039596e-06,
"loss": 0.7201,
"mean_token_accuracy": 0.8072294175624848,
"num_tokens": 781503881.0,
"step": 8820
},
{
"entropy": 1.0109375,
"epoch": 1.2067928654411262,
"grad_norm": 0.7267006869313553,
"learning_rate": 2.0448781175144427e-06,
"loss": 0.7453,
"mean_token_accuracy": 0.8030728667974472,
"num_tokens": 782375550.0,
"step": 8830
},
{
"entropy": 0.9798828125,
"epoch": 1.208159639171735,
"grad_norm": 0.6839122957440309,
"learning_rate": 2.0413555023249263e-06,
"loss": 0.7106,
"mean_token_accuracy": 0.8099633991718292,
"num_tokens": 783264796.0,
"step": 8840
},
{
"entropy": 0.990234375,
"epoch": 1.209526412902344,
"grad_norm": 0.709255761515176,
"learning_rate": 2.0378328871354094e-06,
"loss": 0.7129,
"mean_token_accuracy": 0.808837565779686,
"num_tokens": 784182648.0,
"step": 8850
},
{
"entropy": 0.995703125,
"epoch": 1.2108931866329529,
"grad_norm": 0.6596772208926891,
"learning_rate": 2.034310271945893e-06,
"loss": 0.7046,
"mean_token_accuracy": 0.8114217668771744,
"num_tokens": 785110665.0,
"step": 8860
},
{
"entropy": 0.9814453125,
"epoch": 1.2122599603635618,
"grad_norm": 0.6879859441247905,
"learning_rate": 2.030787656756376e-06,
"loss": 0.719,
"mean_token_accuracy": 0.8054919064044952,
"num_tokens": 785985140.0,
"step": 8870
},
{
"entropy": 0.966796875,
"epoch": 1.2136267340941707,
"grad_norm": 0.6220431049182898,
"learning_rate": 2.027265041566859e-06,
"loss": 0.6963,
"mean_token_accuracy": 0.8124190658330918,
"num_tokens": 786868691.0,
"step": 8880
},
{
"entropy": 0.98125,
"epoch": 1.2149935078247796,
"grad_norm": 0.6574053527594649,
"learning_rate": 2.0237424263773427e-06,
"loss": 0.6964,
"mean_token_accuracy": 0.8126682728528977,
"num_tokens": 787720812.0,
"step": 8890
},
{
"entropy": 0.9640625,
"epoch": 1.2163602815553884,
"grad_norm": 0.6092362889416918,
"learning_rate": 2.020219811187826e-06,
"loss": 0.6907,
"mean_token_accuracy": 0.8116444021463394,
"num_tokens": 788632265.0,
"step": 8900
},
{
"entropy": 1.006640625,
"epoch": 1.2177270552859973,
"grad_norm": 0.6568953754127747,
"learning_rate": 2.0166971959983094e-06,
"loss": 0.731,
"mean_token_accuracy": 0.8043823271989823,
"num_tokens": 789527672.0,
"step": 8910
},
{
"entropy": 0.9771484375,
"epoch": 1.2190938290166062,
"grad_norm": 0.6655548423519092,
"learning_rate": 2.0131745808087925e-06,
"loss": 0.6922,
"mean_token_accuracy": 0.8135436773300171,
"num_tokens": 790430285.0,
"step": 8920
},
{
"entropy": 0.9833984375,
"epoch": 1.2204606027472151,
"grad_norm": 0.7389866858730252,
"learning_rate": 2.009651965619276e-06,
"loss": 0.6775,
"mean_token_accuracy": 0.8152046412229538,
"num_tokens": 791320202.0,
"step": 8930
},
{
"entropy": 1.014453125,
"epoch": 1.221827376477824,
"grad_norm": 0.6991355919157957,
"learning_rate": 2.0061293504297592e-06,
"loss": 0.7151,
"mean_token_accuracy": 0.8080723792314529,
"num_tokens": 792228711.0,
"step": 8940
},
{
"entropy": 0.9693359375,
"epoch": 1.223194150208433,
"grad_norm": 0.6782771929506645,
"learning_rate": 2.0026067352402428e-06,
"loss": 0.6705,
"mean_token_accuracy": 0.8194298446178436,
"num_tokens": 793111439.0,
"step": 8950
},
{
"entropy": 0.987890625,
"epoch": 1.2245609239390418,
"grad_norm": 0.6247276021646078,
"learning_rate": 1.999084120050726e-06,
"loss": 0.7355,
"mean_token_accuracy": 0.8044193118810654,
"num_tokens": 794001756.0,
"step": 8960
},
{
"entropy": 0.9748046875,
"epoch": 1.2259276976696507,
"grad_norm": 0.6453629647010559,
"learning_rate": 1.9955615048612094e-06,
"loss": 0.6912,
"mean_token_accuracy": 0.8130948901176452,
"num_tokens": 794884233.0,
"step": 8970
},
{
"entropy": 0.9845703125,
"epoch": 1.2272944714002596,
"grad_norm": 0.6802495885154279,
"learning_rate": 1.9920388896716926e-06,
"loss": 0.6693,
"mean_token_accuracy": 0.8189950793981552,
"num_tokens": 795772500.0,
"step": 8980
},
{
"entropy": 1.0080078125,
"epoch": 1.2286612451308685,
"grad_norm": 0.6139379552989442,
"learning_rate": 1.9885162744821757e-06,
"loss": 0.6764,
"mean_token_accuracy": 0.8187463909387589,
"num_tokens": 796668379.0,
"step": 8990
},
{
"entropy": 1.007421875,
"epoch": 1.2300280188614774,
"grad_norm": 0.7005779731532183,
"learning_rate": 1.9849936592926592e-06,
"loss": 0.6878,
"mean_token_accuracy": 0.8137018412351609,
"num_tokens": 797490645.0,
"step": 9000
},
{
"entropy": 1.0125,
"epoch": 1.2313947925920863,
"grad_norm": 0.6612392485628602,
"learning_rate": 1.9814710441031424e-06,
"loss": 0.6803,
"mean_token_accuracy": 0.8132561892271042,
"num_tokens": 798370052.0,
"step": 9010
},
{
"entropy": 0.9634765625,
"epoch": 1.2327615663226954,
"grad_norm": 0.7259521299045745,
"learning_rate": 1.9779484289136255e-06,
"loss": 0.6786,
"mean_token_accuracy": 0.8160416662693024,
"num_tokens": 799229778.0,
"step": 9020
},
{
"entropy": 1.0048828125,
"epoch": 1.2341283400533043,
"grad_norm": 0.6647993332320858,
"learning_rate": 1.974425813724109e-06,
"loss": 0.6898,
"mean_token_accuracy": 0.814662617444992,
"num_tokens": 800125708.0,
"step": 9030
},
{
"entropy": 0.9892578125,
"epoch": 1.2354951137839132,
"grad_norm": 0.6760227849653597,
"learning_rate": 1.970903198534592e-06,
"loss": 0.6876,
"mean_token_accuracy": 0.8146593600511551,
"num_tokens": 801028037.0,
"step": 9040
},
{
"entropy": 0.9818359375,
"epoch": 1.236861887514522,
"grad_norm": 0.7340791251065227,
"learning_rate": 1.9673805833450753e-06,
"loss": 0.7217,
"mean_token_accuracy": 0.8060630410909653,
"num_tokens": 801926801.0,
"step": 9050
},
{
"entropy": 1.0185546875,
"epoch": 1.238228661245131,
"grad_norm": 0.5619866124244035,
"learning_rate": 1.963857968155559e-06,
"loss": 0.6972,
"mean_token_accuracy": 0.811183512210846,
"num_tokens": 802832899.0,
"step": 9060
},
{
"entropy": 0.9900390625,
"epoch": 1.2395954349757399,
"grad_norm": 0.7989974932426704,
"learning_rate": 1.960335352966042e-06,
"loss": 0.6983,
"mean_token_accuracy": 0.8131559222936631,
"num_tokens": 803717792.0,
"step": 9070
},
{
"entropy": 1.0015625,
"epoch": 1.2409622087063488,
"grad_norm": 0.6775422086036829,
"learning_rate": 1.9568127377765255e-06,
"loss": 0.7365,
"mean_token_accuracy": 0.8013312429189682,
"num_tokens": 804630519.0,
"step": 9080
},
{
"entropy": 0.966015625,
"epoch": 1.2423289824369577,
"grad_norm": 0.6289041931373008,
"learning_rate": 1.9532901225870086e-06,
"loss": 0.6818,
"mean_token_accuracy": 0.8158924013376236,
"num_tokens": 805565081.0,
"step": 9090
},
{
"entropy": 0.988671875,
"epoch": 1.2436957561675666,
"grad_norm": 0.7007421910607128,
"learning_rate": 1.949767507397492e-06,
"loss": 0.7013,
"mean_token_accuracy": 0.8110907912254334,
"num_tokens": 806425066.0,
"step": 9100
},
{
"entropy": 1.0107421875,
"epoch": 1.2450625298981755,
"grad_norm": 0.6665911471333781,
"learning_rate": 1.9462448922079753e-06,
"loss": 0.7214,
"mean_token_accuracy": 0.80598384141922,
"num_tokens": 807299718.0,
"step": 9110
},
{
"entropy": 0.9974609375,
"epoch": 1.2464293036287843,
"grad_norm": 0.6598146330804653,
"learning_rate": 1.942722277018459e-06,
"loss": 0.7102,
"mean_token_accuracy": 0.8091190159320831,
"num_tokens": 808167887.0,
"step": 9120
},
{
"entropy": 1.0185546875,
"epoch": 1.2477960773593932,
"grad_norm": 0.783293826079625,
"learning_rate": 1.939199661828942e-06,
"loss": 0.7311,
"mean_token_accuracy": 0.8033353477716446,
"num_tokens": 809042851.0,
"step": 9130
},
{
"entropy": 0.9615234375,
"epoch": 1.2491628510900021,
"grad_norm": 0.7135585064903122,
"learning_rate": 1.9356770466394255e-06,
"loss": 0.669,
"mean_token_accuracy": 0.8186709940433502,
"num_tokens": 809871246.0,
"step": 9140
},
{
"entropy": 0.953125,
"epoch": 1.250529624820611,
"grad_norm": 0.6681131107636652,
"learning_rate": 1.9321544314499086e-06,
"loss": 0.7174,
"mean_token_accuracy": 0.8084134459495544,
"num_tokens": 810754067.0,
"step": 9150
},
{
"entropy": 0.9837890625,
"epoch": 1.25189639855122,
"grad_norm": 0.775153291344169,
"learning_rate": 1.9286318162603917e-06,
"loss": 0.6973,
"mean_token_accuracy": 0.8103437006473542,
"num_tokens": 811652395.0,
"step": 9160
},
{
"entropy": 0.955078125,
"epoch": 1.2532631722818288,
"grad_norm": 0.6198735650822376,
"learning_rate": 1.9251092010708753e-06,
"loss": 0.6654,
"mean_token_accuracy": 0.8212126284837723,
"num_tokens": 812537595.0,
"step": 9170
},
{
"entropy": 1.0037109375,
"epoch": 1.2546299460124377,
"grad_norm": 0.6058559961024623,
"learning_rate": 1.9215865858813584e-06,
"loss": 0.7064,
"mean_token_accuracy": 0.8094309031963348,
"num_tokens": 813418052.0,
"step": 9180
},
{
"entropy": 1.014453125,
"epoch": 1.2559967197430466,
"grad_norm": 0.6252437159981322,
"learning_rate": 1.918063970691842e-06,
"loss": 0.7291,
"mean_token_accuracy": 0.8039848506450653,
"num_tokens": 814316613.0,
"step": 9190
},
{
"entropy": 1.01015625,
"epoch": 1.2573634934736555,
"grad_norm": 0.6717887391344822,
"learning_rate": 1.914541355502325e-06,
"loss": 0.6842,
"mean_token_accuracy": 0.8134139686822891,
"num_tokens": 815160785.0,
"step": 9200
},
{
"entropy": 0.981640625,
"epoch": 1.2587302672042644,
"grad_norm": 0.6173219036974553,
"learning_rate": 1.9110187403128082e-06,
"loss": 0.6789,
"mean_token_accuracy": 0.8144147872924805,
"num_tokens": 816036366.0,
"step": 9210
},
{
"entropy": 0.9724609375,
"epoch": 1.2600970409348733,
"grad_norm": 0.6563890634873399,
"learning_rate": 1.9074961251232918e-06,
"loss": 0.7,
"mean_token_accuracy": 0.8125383794307709,
"num_tokens": 816965958.0,
"step": 9220
},
{
"entropy": 0.966796875,
"epoch": 1.2614638146654822,
"grad_norm": 0.6812531139978687,
"learning_rate": 1.903973509933775e-06,
"loss": 0.6823,
"mean_token_accuracy": 0.811844003200531,
"num_tokens": 817830932.0,
"step": 9230
},
{
"entropy": 1.025390625,
"epoch": 1.262830588396091,
"grad_norm": 0.7087900616404278,
"learning_rate": 1.9004508947442582e-06,
"loss": 0.7198,
"mean_token_accuracy": 0.8077659666538238,
"num_tokens": 818690604.0,
"step": 9240
},
{
"entropy": 0.978125,
"epoch": 1.2641973621267,
"grad_norm": 0.7289383500812884,
"learning_rate": 1.8969282795547418e-06,
"loss": 0.6783,
"mean_token_accuracy": 0.8169104903936386,
"num_tokens": 819552184.0,
"step": 9250
},
{
"entropy": 1.011328125,
"epoch": 1.2655641358573089,
"grad_norm": 0.6315122893373759,
"learning_rate": 1.8934056643652249e-06,
"loss": 0.695,
"mean_token_accuracy": 0.8126209944486618,
"num_tokens": 820423497.0,
"step": 9260
},
{
"entropy": 0.976171875,
"epoch": 1.2669309095879178,
"grad_norm": 0.620036539703978,
"learning_rate": 1.889883049175708e-06,
"loss": 0.6821,
"mean_token_accuracy": 0.8162996143102645,
"num_tokens": 821295538.0,
"step": 9270
},
{
"entropy": 0.940234375,
"epoch": 1.2682976833185267,
"grad_norm": 0.674736656261246,
"learning_rate": 1.8863604339861916e-06,
"loss": 0.6855,
"mean_token_accuracy": 0.813086873292923,
"num_tokens": 822180580.0,
"step": 9280
},
{
"entropy": 1.0099609375,
"epoch": 1.2696644570491356,
"grad_norm": 0.7353765930147522,
"learning_rate": 1.8828378187966747e-06,
"loss": 0.7236,
"mean_token_accuracy": 0.8068170875310898,
"num_tokens": 823090612.0,
"step": 9290
},
{
"entropy": 0.953125,
"epoch": 1.2710312307797444,
"grad_norm": 0.6681125271207273,
"learning_rate": 1.8793152036071582e-06,
"loss": 0.6945,
"mean_token_accuracy": 0.8135695695877075,
"num_tokens": 823965696.0,
"step": 9300
},
{
"entropy": 0.9955078125,
"epoch": 1.2723980045103533,
"grad_norm": 0.6365172637762955,
"learning_rate": 1.8757925884176414e-06,
"loss": 0.7159,
"mean_token_accuracy": 0.8077572226524353,
"num_tokens": 824871297.0,
"step": 9310
},
{
"entropy": 1.0060546875,
"epoch": 1.2737647782409622,
"grad_norm": 0.7604849152000694,
"learning_rate": 1.8722699732281247e-06,
"loss": 0.7413,
"mean_token_accuracy": 0.800376632809639,
"num_tokens": 825811434.0,
"step": 9320
},
{
"entropy": 1.012890625,
"epoch": 1.2751315519715711,
"grad_norm": 0.6720585361272494,
"learning_rate": 1.868747358038608e-06,
"loss": 0.7306,
"mean_token_accuracy": 0.8055466562509537,
"num_tokens": 826682534.0,
"step": 9330
},
{
"entropy": 0.9533203125,
"epoch": 1.27649832570218,
"grad_norm": 0.6923942852671346,
"learning_rate": 1.8652247428490914e-06,
"loss": 0.7053,
"mean_token_accuracy": 0.8108595162630081,
"num_tokens": 827565061.0,
"step": 9340
},
{
"entropy": 1.0138671875,
"epoch": 1.277865099432789,
"grad_norm": 0.6885821352134159,
"learning_rate": 1.8617021276595745e-06,
"loss": 0.7265,
"mean_token_accuracy": 0.8057165145874023,
"num_tokens": 828433291.0,
"step": 9350
},
{
"entropy": 0.9798828125,
"epoch": 1.2792318731633978,
"grad_norm": 0.7199216265670711,
"learning_rate": 1.858179512470058e-06,
"loss": 0.6941,
"mean_token_accuracy": 0.8164292752742768,
"num_tokens": 829312319.0,
"step": 9360
},
{
"entropy": 0.968359375,
"epoch": 1.2805986468940067,
"grad_norm": 0.6713341615066167,
"learning_rate": 1.8546568972805412e-06,
"loss": 0.7047,
"mean_token_accuracy": 0.811161407828331,
"num_tokens": 830252194.0,
"step": 9370
},
{
"entropy": 0.977734375,
"epoch": 1.2819654206246156,
"grad_norm": 0.7376389092923828,
"learning_rate": 1.8511342820910245e-06,
"loss": 0.6727,
"mean_token_accuracy": 0.8153550803661347,
"num_tokens": 831128961.0,
"step": 9380
},
{
"entropy": 0.9591796875,
"epoch": 1.2833321943552245,
"grad_norm": 0.6491043515784644,
"learning_rate": 1.8476116669015078e-06,
"loss": 0.6573,
"mean_token_accuracy": 0.8198282867670059,
"num_tokens": 832029477.0,
"step": 9390
},
{
"entropy": 0.969921875,
"epoch": 1.2846989680858334,
"grad_norm": 0.6568949617407948,
"learning_rate": 1.8440890517119912e-06,
"loss": 0.662,
"mean_token_accuracy": 0.819307878613472,
"num_tokens": 832931731.0,
"step": 9400
},
{
"entropy": 0.981640625,
"epoch": 1.2860657418164423,
"grad_norm": 0.7089383628729421,
"learning_rate": 1.8405664365224743e-06,
"loss": 0.6976,
"mean_token_accuracy": 0.8119160145521164,
"num_tokens": 833785182.0,
"step": 9410
},
{
"entropy": 1.0181640625,
"epoch": 1.2874325155470512,
"grad_norm": 0.7342057158502735,
"learning_rate": 1.8370438213329578e-06,
"loss": 0.7169,
"mean_token_accuracy": 0.8088097035884857,
"num_tokens": 834717467.0,
"step": 9420
},
{
"entropy": 0.9869140625,
"epoch": 1.28879928927766,
"grad_norm": 0.6826446494956112,
"learning_rate": 1.833521206143441e-06,
"loss": 0.7128,
"mean_token_accuracy": 0.8097311437129975,
"num_tokens": 835602297.0,
"step": 9430
},
{
"entropy": 1.0373046875,
"epoch": 1.290166063008269,
"grad_norm": 0.6509826275178839,
"learning_rate": 1.8299985909539245e-06,
"loss": 0.7208,
"mean_token_accuracy": 0.8045699119567871,
"num_tokens": 836448213.0,
"step": 9440
},
{
"entropy": 1.0001953125,
"epoch": 1.2915328367388779,
"grad_norm": 0.6986044493644451,
"learning_rate": 1.8264759757644076e-06,
"loss": 0.6948,
"mean_token_accuracy": 0.8118053585290909,
"num_tokens": 837327129.0,
"step": 9450
},
{
"entropy": 0.976171875,
"epoch": 1.2928996104694868,
"grad_norm": 0.7023667653103605,
"learning_rate": 1.822953360574891e-06,
"loss": 0.6961,
"mean_token_accuracy": 0.8111655205488205,
"num_tokens": 838172987.0,
"step": 9460
},
{
"entropy": 0.9484375,
"epoch": 1.2942663842000957,
"grad_norm": 0.5937629601383043,
"learning_rate": 1.8194307453853743e-06,
"loss": 0.6636,
"mean_token_accuracy": 0.8182564824819565,
"num_tokens": 839057791.0,
"step": 9470
},
{
"entropy": 1.0310546875,
"epoch": 1.2956331579307045,
"grad_norm": 0.6944682233002658,
"learning_rate": 1.8159081301958576e-06,
"loss": 0.7052,
"mean_token_accuracy": 0.8100999116897583,
"num_tokens": 839956502.0,
"step": 9480
},
{
"entropy": 0.9765625,
"epoch": 1.2969999316613134,
"grad_norm": 0.5805052759667914,
"learning_rate": 1.8123855150063408e-06,
"loss": 0.69,
"mean_token_accuracy": 0.8150934934616089,
"num_tokens": 840854870.0,
"step": 9490
},
{
"entropy": 0.9990234375,
"epoch": 1.2983667053919223,
"grad_norm": 0.5995453956087453,
"learning_rate": 1.8088628998168243e-06,
"loss": 0.6775,
"mean_token_accuracy": 0.8153409838676453,
"num_tokens": 841722038.0,
"step": 9500
},
{
"entropy": 0.9560546875,
"epoch": 1.2997334791225312,
"grad_norm": 0.7478717131165598,
"learning_rate": 1.8053402846273074e-06,
"loss": 0.6705,
"mean_token_accuracy": 0.8162317931652069,
"num_tokens": 842603404.0,
"step": 9510
},
{
"entropy": 0.9345703125,
"epoch": 1.3011002528531401,
"grad_norm": 0.6464456450584957,
"learning_rate": 1.8018176694377906e-06,
"loss": 0.6535,
"mean_token_accuracy": 0.8205371707677841,
"num_tokens": 843468734.0,
"step": 9520
},
{
"entropy": 0.98671875,
"epoch": 1.302467026583749,
"grad_norm": 0.6668490788507031,
"learning_rate": 1.798295054248274e-06,
"loss": 0.6953,
"mean_token_accuracy": 0.8122496396303177,
"num_tokens": 844321422.0,
"step": 9530
},
{
"entropy": 0.9865234375,
"epoch": 1.303833800314358,
"grad_norm": 0.7380720753747091,
"learning_rate": 1.7947724390587572e-06,
"loss": 0.6813,
"mean_token_accuracy": 0.8134033739566803,
"num_tokens": 845185266.0,
"step": 9540
},
{
"entropy": 1.0087890625,
"epoch": 1.3052005740449668,
"grad_norm": 0.73073879412417,
"learning_rate": 1.7912498238692408e-06,
"loss": 0.7325,
"mean_token_accuracy": 0.8035968869924546,
"num_tokens": 846083764.0,
"step": 9550
},
{
"entropy": 0.98125,
"epoch": 1.3065673477755757,
"grad_norm": 0.6294650521572311,
"learning_rate": 1.7877272086797239e-06,
"loss": 0.7009,
"mean_token_accuracy": 0.8114663898944855,
"num_tokens": 846968868.0,
"step": 9560
},
{
"entropy": 1.0083984375,
"epoch": 1.3079341215061846,
"grad_norm": 0.6467436814653291,
"learning_rate": 1.7842045934902072e-06,
"loss": 0.6945,
"mean_token_accuracy": 0.8122023791074753,
"num_tokens": 847867293.0,
"step": 9570
},
{
"entropy": 0.9810546875,
"epoch": 1.3093008952367935,
"grad_norm": 0.6709526261554,
"learning_rate": 1.7806819783006908e-06,
"loss": 0.7346,
"mean_token_accuracy": 0.8029474198818207,
"num_tokens": 848738392.0,
"step": 9580
},
{
"entropy": 0.9796875,
"epoch": 1.3106676689674024,
"grad_norm": 0.6294391019665453,
"learning_rate": 1.777159363111174e-06,
"loss": 0.7108,
"mean_token_accuracy": 0.8103302866220474,
"num_tokens": 849620845.0,
"step": 9590
},
{
"entropy": 0.9787109375,
"epoch": 1.3120344426980113,
"grad_norm": 0.6038208346339093,
"learning_rate": 1.773636747921657e-06,
"loss": 0.6888,
"mean_token_accuracy": 0.8115377008914948,
"num_tokens": 850463193.0,
"step": 9600
},
{
"entropy": 1.0166015625,
"epoch": 1.3134012164286202,
"grad_norm": 0.6992888300511428,
"learning_rate": 1.7701141327321406e-06,
"loss": 0.7047,
"mean_token_accuracy": 0.8098155736923218,
"num_tokens": 851372856.0,
"step": 9610
},
{
"entropy": 0.981640625,
"epoch": 1.314767990159229,
"grad_norm": 0.5773485345842869,
"learning_rate": 1.7665915175426237e-06,
"loss": 0.6977,
"mean_token_accuracy": 0.8130273997783661,
"num_tokens": 852308597.0,
"step": 9620
},
{
"entropy": 0.9603515625,
"epoch": 1.316134763889838,
"grad_norm": 0.7116772669134631,
"learning_rate": 1.763068902353107e-06,
"loss": 0.6809,
"mean_token_accuracy": 0.8148243814706803,
"num_tokens": 853172611.0,
"step": 9630
},
{
"entropy": 1.0208984375,
"epoch": 1.3175015376204469,
"grad_norm": 0.7205570228920782,
"learning_rate": 1.7595462871635904e-06,
"loss": 0.7447,
"mean_token_accuracy": 0.8011247098445893,
"num_tokens": 854025251.0,
"step": 9640
},
{
"entropy": 0.9650390625,
"epoch": 1.3188683113510558,
"grad_norm": 0.6631759999289105,
"learning_rate": 1.7560236719740737e-06,
"loss": 0.6562,
"mean_token_accuracy": 0.8203522324562073,
"num_tokens": 854918609.0,
"step": 9650
},
{
"entropy": 0.9806640625,
"epoch": 1.3202350850816646,
"grad_norm": 0.5997198540714552,
"learning_rate": 1.752501056784557e-06,
"loss": 0.6735,
"mean_token_accuracy": 0.8185502260923385,
"num_tokens": 855840317.0,
"step": 9660
},
{
"entropy": 0.9791015625,
"epoch": 1.3216018588122735,
"grad_norm": 0.6811781186058041,
"learning_rate": 1.7489784415950404e-06,
"loss": 0.6474,
"mean_token_accuracy": 0.8205710530281067,
"num_tokens": 856694202.0,
"step": 9670
},
{
"entropy": 0.971875,
"epoch": 1.3229686325428824,
"grad_norm": 0.6093682959682053,
"learning_rate": 1.7454558264055235e-06,
"loss": 0.7057,
"mean_token_accuracy": 0.8085221260786056,
"num_tokens": 857560944.0,
"step": 9680
},
{
"entropy": 0.98359375,
"epoch": 1.3243354062734913,
"grad_norm": 0.6811331554119074,
"learning_rate": 1.741933211216007e-06,
"loss": 0.6792,
"mean_token_accuracy": 0.8171349585056304,
"num_tokens": 858425303.0,
"step": 9690
},
{
"entropy": 0.991796875,
"epoch": 1.3257021800041002,
"grad_norm": 0.7028510329637612,
"learning_rate": 1.7384105960264902e-06,
"loss": 0.7132,
"mean_token_accuracy": 0.80848408639431,
"num_tokens": 859322782.0,
"step": 9700
},
{
"entropy": 1.0357421875,
"epoch": 1.3270689537347091,
"grad_norm": 0.7580018905315946,
"learning_rate": 1.7348879808369735e-06,
"loss": 0.7595,
"mean_token_accuracy": 0.7962493896484375,
"num_tokens": 860228542.0,
"step": 9710
},
{
"entropy": 0.971484375,
"epoch": 1.328435727465318,
"grad_norm": 0.6922890774457099,
"learning_rate": 1.7313653656474568e-06,
"loss": 0.7395,
"mean_token_accuracy": 0.8043748378753662,
"num_tokens": 861128996.0,
"step": 9720
},
{
"entropy": 1.009375,
"epoch": 1.329802501195927,
"grad_norm": 0.6832881761845064,
"learning_rate": 1.7278427504579402e-06,
"loss": 0.736,
"mean_token_accuracy": 0.8072660684585571,
"num_tokens": 862045862.0,
"step": 9730
},
{
"entropy": 1.0119140625,
"epoch": 1.3311692749265358,
"grad_norm": 0.6701787869878262,
"learning_rate": 1.7243201352684233e-06,
"loss": 0.7121,
"mean_token_accuracy": 0.8089094817638397,
"num_tokens": 862980918.0,
"step": 9740
},
{
"entropy": 1.0044921875,
"epoch": 1.3325360486571447,
"grad_norm": 0.7285753239511736,
"learning_rate": 1.7207975200789068e-06,
"loss": 0.7458,
"mean_token_accuracy": 0.8028531163930893,
"num_tokens": 863864536.0,
"step": 9750
},
{
"entropy": 0.98515625,
"epoch": 1.3339028223877536,
"grad_norm": 0.7005379204095227,
"learning_rate": 1.71727490488939e-06,
"loss": 0.7086,
"mean_token_accuracy": 0.8091609865427017,
"num_tokens": 864692208.0,
"step": 9760
},
{
"entropy": 0.991796875,
"epoch": 1.3352695961183625,
"grad_norm": 0.734115734225704,
"learning_rate": 1.7137522896998735e-06,
"loss": 0.6982,
"mean_token_accuracy": 0.8107037961483001,
"num_tokens": 865583812.0,
"step": 9770
},
{
"entropy": 0.9556640625,
"epoch": 1.3366363698489714,
"grad_norm": 0.6495842493362711,
"learning_rate": 1.7102296745103566e-06,
"loss": 0.6744,
"mean_token_accuracy": 0.8187049567699433,
"num_tokens": 866442714.0,
"step": 9780
},
{
"entropy": 0.9912109375,
"epoch": 1.3380031435795803,
"grad_norm": 0.7121684639572413,
"learning_rate": 1.7067070593208398e-06,
"loss": 0.7042,
"mean_token_accuracy": 0.810910838842392,
"num_tokens": 867348693.0,
"step": 9790
},
{
"entropy": 0.971875,
"epoch": 1.3393699173101892,
"grad_norm": 0.6670697211645724,
"learning_rate": 1.7031844441313233e-06,
"loss": 0.6838,
"mean_token_accuracy": 0.8164479702711105,
"num_tokens": 868245125.0,
"step": 9800
},
{
"entropy": 0.980859375,
"epoch": 1.340736691040798,
"grad_norm": 0.663391188710879,
"learning_rate": 1.6996618289418064e-06,
"loss": 0.7035,
"mean_token_accuracy": 0.8113082021474838,
"num_tokens": 869147634.0,
"step": 9810
},
{
"entropy": 0.9888671875,
"epoch": 1.342103464771407,
"grad_norm": 0.6794762289716056,
"learning_rate": 1.6961392137522898e-06,
"loss": 0.6967,
"mean_token_accuracy": 0.8097662419080734,
"num_tokens": 869984569.0,
"step": 9820
},
{
"entropy": 0.9607421875,
"epoch": 1.3434702385020159,
"grad_norm": 0.6427694338218222,
"learning_rate": 1.6926165985627733e-06,
"loss": 0.7045,
"mean_token_accuracy": 0.8116038978099823,
"num_tokens": 870822937.0,
"step": 9830
},
{
"entropy": 0.99375,
"epoch": 1.3448370122326248,
"grad_norm": 0.6719436740576461,
"learning_rate": 1.6890939833732564e-06,
"loss": 0.7574,
"mean_token_accuracy": 0.7976416736841202,
"num_tokens": 871733262.0,
"step": 9840
},
{
"entropy": 1.0134765625,
"epoch": 1.3462037859632339,
"grad_norm": 0.690657490622878,
"learning_rate": 1.6855713681837396e-06,
"loss": 0.724,
"mean_token_accuracy": 0.8061705589294433,
"num_tokens": 872630340.0,
"step": 9850
},
{
"entropy": 0.980078125,
"epoch": 1.3475705596938428,
"grad_norm": 0.6900653678699217,
"learning_rate": 1.6820487529942231e-06,
"loss": 0.692,
"mean_token_accuracy": 0.8124482244253158,
"num_tokens": 873508298.0,
"step": 9860
},
{
"entropy": 0.971875,
"epoch": 1.3489373334244517,
"grad_norm": 0.7871844250104628,
"learning_rate": 1.6785261378047062e-06,
"loss": 0.6779,
"mean_token_accuracy": 0.8165353178977967,
"num_tokens": 874391916.0,
"step": 9870
},
{
"entropy": 0.9873046875,
"epoch": 1.3503041071550606,
"grad_norm": 0.650761412960548,
"learning_rate": 1.6750035226151898e-06,
"loss": 0.6852,
"mean_token_accuracy": 0.814915344119072,
"num_tokens": 875231876.0,
"step": 9880
},
{
"entropy": 1.0009765625,
"epoch": 1.3516708808856694,
"grad_norm": 0.7351497721121276,
"learning_rate": 1.671480907425673e-06,
"loss": 0.7148,
"mean_token_accuracy": 0.8077278226613999,
"num_tokens": 876127902.0,
"step": 9890
},
{
"entropy": 0.9806640625,
"epoch": 1.3530376546162783,
"grad_norm": 0.7041878847851268,
"learning_rate": 1.6679582922361562e-06,
"loss": 0.7144,
"mean_token_accuracy": 0.8092505186796188,
"num_tokens": 876985950.0,
"step": 9900
},
{
"entropy": 0.993359375,
"epoch": 1.3544044283468872,
"grad_norm": 0.699874998012671,
"learning_rate": 1.6644356770466396e-06,
"loss": 0.6926,
"mean_token_accuracy": 0.8119371592998504,
"num_tokens": 877880193.0,
"step": 9910
},
{
"entropy": 0.994921875,
"epoch": 1.3557712020774961,
"grad_norm": 0.7489445027874324,
"learning_rate": 1.660913061857123e-06,
"loss": 0.7097,
"mean_token_accuracy": 0.8066737532615662,
"num_tokens": 878770858.0,
"step": 9920
},
{
"entropy": 0.94765625,
"epoch": 1.357137975808105,
"grad_norm": 0.7411598398371426,
"learning_rate": 1.657390446667606e-06,
"loss": 0.6457,
"mean_token_accuracy": 0.8226635307073593,
"num_tokens": 879667998.0,
"step": 9930
},
{
"entropy": 0.97421875,
"epoch": 1.358504749538714,
"grad_norm": 0.6532241327586721,
"learning_rate": 1.6538678314780896e-06,
"loss": 0.6975,
"mean_token_accuracy": 0.812068834900856,
"num_tokens": 880544633.0,
"step": 9940
},
{
"entropy": 1.05703125,
"epoch": 1.3598715232693228,
"grad_norm": 0.72497587638635,
"learning_rate": 1.6503452162885727e-06,
"loss": 0.7764,
"mean_token_accuracy": 0.793474867939949,
"num_tokens": 881402825.0,
"step": 9950
},
{
"entropy": 0.9900390625,
"epoch": 1.3612382969999317,
"grad_norm": 0.6825527091917699,
"learning_rate": 1.646822601099056e-06,
"loss": 0.666,
"mean_token_accuracy": 0.8174174726009369,
"num_tokens": 882291149.0,
"step": 9960
},
{
"entropy": 0.958984375,
"epoch": 1.3626050707305406,
"grad_norm": 0.6997745852265767,
"learning_rate": 1.6432999859095394e-06,
"loss": 0.6837,
"mean_token_accuracy": 0.8156074911355973,
"num_tokens": 883176457.0,
"step": 9970
},
{
"entropy": 1.022265625,
"epoch": 1.3639718444611495,
"grad_norm": 0.7353432119670127,
"learning_rate": 1.6397773707200227e-06,
"loss": 0.7493,
"mean_token_accuracy": 0.7995586335659027,
"num_tokens": 884063256.0,
"step": 9980
},
{
"entropy": 0.98984375,
"epoch": 1.3653386181917584,
"grad_norm": 0.6564567797748022,
"learning_rate": 1.636254755530506e-06,
"loss": 0.6916,
"mean_token_accuracy": 0.8132372409105301,
"num_tokens": 884906668.0,
"step": 9990
},
{
"entropy": 0.928515625,
"epoch": 1.3667053919223673,
"grad_norm": 0.6254715850247333,
"learning_rate": 1.6327321403409894e-06,
"loss": 0.6211,
"mean_token_accuracy": 0.8271727561950684,
"num_tokens": 885782940.0,
"step": 10000
},
{
"entropy": 1.0064453125,
"epoch": 1.3680721656529762,
"grad_norm": 0.8146226148305848,
"learning_rate": 1.6292095251514725e-06,
"loss": 0.6896,
"mean_token_accuracy": 0.8132813245058059,
"num_tokens": 886655374.0,
"step": 10010
},
{
"entropy": 1.0224609375,
"epoch": 1.369438939383585,
"grad_norm": 0.6993519719553181,
"learning_rate": 1.625686909961956e-06,
"loss": 0.7491,
"mean_token_accuracy": 0.7997702211141586,
"num_tokens": 887551775.0,
"step": 10020
},
{
"entropy": 1.002734375,
"epoch": 1.370805713114194,
"grad_norm": 0.7204284629412298,
"learning_rate": 1.6221642947724392e-06,
"loss": 0.7303,
"mean_token_accuracy": 0.8039103895425797,
"num_tokens": 888388302.0,
"step": 10030
},
{
"entropy": 1.0119140625,
"epoch": 1.3721724868448029,
"grad_norm": 0.749369214174273,
"learning_rate": 1.6186416795829223e-06,
"loss": 0.7153,
"mean_token_accuracy": 0.8068275094032288,
"num_tokens": 889290281.0,
"step": 10040
},
{
"entropy": 1.00625,
"epoch": 1.3735392605754118,
"grad_norm": 0.7197203954770678,
"learning_rate": 1.6151190643934058e-06,
"loss": 0.7017,
"mean_token_accuracy": 0.811317253112793,
"num_tokens": 890192489.0,
"step": 10050
},
{
"entropy": 0.9650390625,
"epoch": 1.3749060343060207,
"grad_norm": 0.6714818027385355,
"learning_rate": 1.6115964492038892e-06,
"loss": 0.6848,
"mean_token_accuracy": 0.8136399507522583,
"num_tokens": 891071923.0,
"step": 10060
},
{
"entropy": 0.9814453125,
"epoch": 1.3762728080366295,
"grad_norm": 0.660365840284015,
"learning_rate": 1.6080738340143723e-06,
"loss": 0.6867,
"mean_token_accuracy": 0.8180144608020783,
"num_tokens": 891978878.0,
"step": 10070
},
{
"entropy": 0.972265625,
"epoch": 1.3776395817672384,
"grad_norm": 0.687377058793283,
"learning_rate": 1.6045512188248559e-06,
"loss": 0.6913,
"mean_token_accuracy": 0.8146795690059662,
"num_tokens": 892814800.0,
"step": 10080
},
{
"entropy": 0.9892578125,
"epoch": 1.3790063554978473,
"grad_norm": 0.6374373146373902,
"learning_rate": 1.601028603635339e-06,
"loss": 0.6871,
"mean_token_accuracy": 0.8125185579061508,
"num_tokens": 893678292.0,
"step": 10090
},
{
"entropy": 0.9873046875,
"epoch": 1.3803731292284562,
"grad_norm": 0.7304611028769911,
"learning_rate": 1.5975059884458225e-06,
"loss": 0.7189,
"mean_token_accuracy": 0.8075425058603287,
"num_tokens": 894600271.0,
"step": 10100
},
{
"entropy": 0.977734375,
"epoch": 1.3817399029590651,
"grad_norm": 0.6659508019233165,
"learning_rate": 1.5939833732563056e-06,
"loss": 0.6773,
"mean_token_accuracy": 0.8159775674343109,
"num_tokens": 895489860.0,
"step": 10110
},
{
"entropy": 0.98125,
"epoch": 1.383106676689674,
"grad_norm": 0.6227957623049313,
"learning_rate": 1.5904607580667888e-06,
"loss": 0.7209,
"mean_token_accuracy": 0.8076525211334229,
"num_tokens": 896400113.0,
"step": 10120
},
{
"entropy": 0.9876953125,
"epoch": 1.384473450420283,
"grad_norm": 0.7578348934432747,
"learning_rate": 1.5869381428772723e-06,
"loss": 0.7263,
"mean_token_accuracy": 0.8059030801057816,
"num_tokens": 897273945.0,
"step": 10130
},
{
"entropy": 1.0091796875,
"epoch": 1.3858402241508918,
"grad_norm": 0.6794103908818555,
"learning_rate": 1.5834155276877554e-06,
"loss": 0.7164,
"mean_token_accuracy": 0.8081393897533417,
"num_tokens": 898141031.0,
"step": 10140
},
{
"entropy": 1.0173828125,
"epoch": 1.3872069978815007,
"grad_norm": 0.6397070682253793,
"learning_rate": 1.5798929124982388e-06,
"loss": 0.7228,
"mean_token_accuracy": 0.8068986803293228,
"num_tokens": 898982893.0,
"step": 10150
},
{
"entropy": 0.9541015625,
"epoch": 1.3885737716121096,
"grad_norm": 0.7357664027970388,
"learning_rate": 1.5763702973087221e-06,
"loss": 0.6954,
"mean_token_accuracy": 0.8127284675836564,
"num_tokens": 899851800.0,
"step": 10160
},
{
"entropy": 0.9564453125,
"epoch": 1.3899405453427185,
"grad_norm": 0.677719351209298,
"learning_rate": 1.5728476821192054e-06,
"loss": 0.6741,
"mean_token_accuracy": 0.8186201214790344,
"num_tokens": 900727352.0,
"step": 10170
},
{
"entropy": 1.013671875,
"epoch": 1.3913073190733274,
"grad_norm": 0.6849243023131356,
"learning_rate": 1.5693250669296886e-06,
"loss": 0.7173,
"mean_token_accuracy": 0.8075919955968857,
"num_tokens": 901637094.0,
"step": 10180
},
{
"entropy": 0.9498046875,
"epoch": 1.3926740928039363,
"grad_norm": 0.6344433664499071,
"learning_rate": 1.5658024517401721e-06,
"loss": 0.6885,
"mean_token_accuracy": 0.8134977400302887,
"num_tokens": 902522639.0,
"step": 10190
},
{
"entropy": 0.9708984375,
"epoch": 1.3940408665345452,
"grad_norm": 0.6135959677853036,
"learning_rate": 1.5622798365506552e-06,
"loss": 0.6925,
"mean_token_accuracy": 0.8160082101821899,
"num_tokens": 903429509.0,
"step": 10200
},
{
"entropy": 0.9953125,
"epoch": 1.395407640265154,
"grad_norm": 0.6534197784160288,
"learning_rate": 1.5587572213611388e-06,
"loss": 0.6937,
"mean_token_accuracy": 0.8138634771108627,
"num_tokens": 904317564.0,
"step": 10210
},
{
"entropy": 1.0251953125,
"epoch": 1.396774413995763,
"grad_norm": 0.7445745040387791,
"learning_rate": 1.555234606171622e-06,
"loss": 0.7019,
"mean_token_accuracy": 0.8107265621423722,
"num_tokens": 905224463.0,
"step": 10220
},
{
"entropy": 0.98515625,
"epoch": 1.3981411877263719,
"grad_norm": 0.6282637735542458,
"learning_rate": 1.5517119909821052e-06,
"loss": 0.669,
"mean_token_accuracy": 0.8175749123096466,
"num_tokens": 906142295.0,
"step": 10230
},
{
"entropy": 1.006640625,
"epoch": 1.3995079614569808,
"grad_norm": 0.6156190649881913,
"learning_rate": 1.5481893757925886e-06,
"loss": 0.7145,
"mean_token_accuracy": 0.8083264857530594,
"num_tokens": 907054448.0,
"step": 10240
},
{
"entropy": 1.023046875,
"epoch": 1.4008747351875896,
"grad_norm": 0.7705598419904071,
"learning_rate": 1.544666760603072e-06,
"loss": 0.7061,
"mean_token_accuracy": 0.8094436258077622,
"num_tokens": 907895116.0,
"step": 10250
},
{
"entropy": 1.0193359375,
"epoch": 1.4022415089181985,
"grad_norm": 0.753777852067377,
"learning_rate": 1.541144145413555e-06,
"loss": 0.7281,
"mean_token_accuracy": 0.8039324969053269,
"num_tokens": 908802189.0,
"step": 10260
},
{
"entropy": 0.9939453125,
"epoch": 1.4036082826488074,
"grad_norm": 0.7282393810470155,
"learning_rate": 1.5376215302240386e-06,
"loss": 0.6925,
"mean_token_accuracy": 0.8119154274463654,
"num_tokens": 909755000.0,
"step": 10270
},
{
"entropy": 0.9841796875,
"epoch": 1.4049750563794163,
"grad_norm": 0.6492439468467261,
"learning_rate": 1.5340989150345217e-06,
"loss": 0.6905,
"mean_token_accuracy": 0.8126476764678955,
"num_tokens": 910650883.0,
"step": 10280
},
{
"entropy": 0.944140625,
"epoch": 1.4063418301100252,
"grad_norm": 0.6329333844530025,
"learning_rate": 1.5305762998450048e-06,
"loss": 0.6437,
"mean_token_accuracy": 0.8256389409303665,
"num_tokens": 911523735.0,
"step": 10290
},
{
"entropy": 1.0501953125,
"epoch": 1.4077086038406341,
"grad_norm": 0.808148629671583,
"learning_rate": 1.5270536846554884e-06,
"loss": 0.7483,
"mean_token_accuracy": 0.8025032758712769,
"num_tokens": 912401560.0,
"step": 10300
},
{
"entropy": 1.0013671875,
"epoch": 1.409075377571243,
"grad_norm": 0.7769523552132117,
"learning_rate": 1.5235310694659717e-06,
"loss": 0.7633,
"mean_token_accuracy": 0.7964840859174729,
"num_tokens": 913302312.0,
"step": 10310
},
{
"entropy": 0.9517578125,
"epoch": 1.410442151301852,
"grad_norm": 0.7219928434008406,
"learning_rate": 1.5200084542764548e-06,
"loss": 0.6557,
"mean_token_accuracy": 0.819435316324234,
"num_tokens": 914208968.0,
"step": 10320
},
{
"entropy": 0.99453125,
"epoch": 1.4118089250324608,
"grad_norm": 0.7262537198118668,
"learning_rate": 1.5164858390869384e-06,
"loss": 0.6811,
"mean_token_accuracy": 0.8136721968650817,
"num_tokens": 915092764.0,
"step": 10330
},
{
"entropy": 1.042578125,
"epoch": 1.4131756987630697,
"grad_norm": 0.7089754652656638,
"learning_rate": 1.5129632238974215e-06,
"loss": 0.7809,
"mean_token_accuracy": 0.7955824226140976,
"num_tokens": 915947203.0,
"step": 10340
},
{
"entropy": 0.98671875,
"epoch": 1.4145424724936786,
"grad_norm": 0.6234603339547354,
"learning_rate": 1.509440608707905e-06,
"loss": 0.6772,
"mean_token_accuracy": 0.816546642780304,
"num_tokens": 916862972.0,
"step": 10350
},
{
"entropy": 1.025390625,
"epoch": 1.4159092462242875,
"grad_norm": 0.6815867801501408,
"learning_rate": 1.5059179935183882e-06,
"loss": 0.7147,
"mean_token_accuracy": 0.8058921426534653,
"num_tokens": 917739748.0,
"step": 10360
},
{
"entropy": 0.9916015625,
"epoch": 1.4172760199548966,
"grad_norm": 0.6884790237527896,
"learning_rate": 1.5023953783288713e-06,
"loss": 0.6971,
"mean_token_accuracy": 0.8114825129508972,
"num_tokens": 918638904.0,
"step": 10370
},
{
"entropy": 0.976953125,
"epoch": 1.4186427936855055,
"grad_norm": 0.6700804265036239,
"learning_rate": 1.4988727631393549e-06,
"loss": 0.7165,
"mean_token_accuracy": 0.8062746703624726,
"num_tokens": 919508022.0,
"step": 10380
},
{
"entropy": 1.018359375,
"epoch": 1.4200095674161144,
"grad_norm": 0.7479315131588018,
"learning_rate": 1.495350147949838e-06,
"loss": 0.738,
"mean_token_accuracy": 0.8031942427158356,
"num_tokens": 920421270.0,
"step": 10390
},
{
"entropy": 0.9771484375,
"epoch": 1.4213763411467233,
"grad_norm": 0.6651519601539919,
"learning_rate": 1.4918275327603213e-06,
"loss": 0.6654,
"mean_token_accuracy": 0.819014722108841,
"num_tokens": 921268963.0,
"step": 10400
},
{
"entropy": 0.9619140625,
"epoch": 1.4227431148773322,
"grad_norm": 0.6154371198199188,
"learning_rate": 1.4883049175708047e-06,
"loss": 0.6893,
"mean_token_accuracy": 0.8139051795005798,
"num_tokens": 922110156.0,
"step": 10410
},
{
"entropy": 1.003125,
"epoch": 1.424109888607941,
"grad_norm": 0.6744356897227092,
"learning_rate": 1.484782302381288e-06,
"loss": 0.7307,
"mean_token_accuracy": 0.8041684359312058,
"num_tokens": 923000326.0,
"step": 10420
},
{
"entropy": 0.98984375,
"epoch": 1.42547666233855,
"grad_norm": 0.7592904016460145,
"learning_rate": 1.4812596871917711e-06,
"loss": 0.6789,
"mean_token_accuracy": 0.8160955846309662,
"num_tokens": 923866880.0,
"step": 10430
},
{
"entropy": 0.97421875,
"epoch": 1.4268434360691589,
"grad_norm": 0.6519956307263932,
"learning_rate": 1.4777370720022547e-06,
"loss": 0.6958,
"mean_token_accuracy": 0.8120754450559616,
"num_tokens": 924736744.0,
"step": 10440
},
{
"entropy": 0.9689453125,
"epoch": 1.4282102097997678,
"grad_norm": 0.7064229695434354,
"learning_rate": 1.4742144568127378e-06,
"loss": 0.7039,
"mean_token_accuracy": 0.8087856024503708,
"num_tokens": 925648312.0,
"step": 10450
},
{
"entropy": 0.966015625,
"epoch": 1.4295769835303767,
"grad_norm": 0.6554824981084117,
"learning_rate": 1.4706918416232213e-06,
"loss": 0.6997,
"mean_token_accuracy": 0.8112310290336608,
"num_tokens": 926529038.0,
"step": 10460
},
{
"entropy": 1.0048828125,
"epoch": 1.4309437572609855,
"grad_norm": 0.610315197477311,
"learning_rate": 1.4671692264337045e-06,
"loss": 0.7068,
"mean_token_accuracy": 0.8098428606986999,
"num_tokens": 927441768.0,
"step": 10470
},
{
"entropy": 0.9853515625,
"epoch": 1.4323105309915944,
"grad_norm": 0.579076277978099,
"learning_rate": 1.4636466112441878e-06,
"loss": 0.7227,
"mean_token_accuracy": 0.8066409677267075,
"num_tokens": 928358695.0,
"step": 10480
},
{
"entropy": 0.9744140625,
"epoch": 1.4336773047222033,
"grad_norm": 0.641209087391633,
"learning_rate": 1.4601239960546711e-06,
"loss": 0.6847,
"mean_token_accuracy": 0.8146178722381592,
"num_tokens": 929240770.0,
"step": 10490
},
{
"entropy": 1.012109375,
"epoch": 1.4350440784528122,
"grad_norm": 0.6415958001773946,
"learning_rate": 1.4566013808651545e-06,
"loss": 0.6958,
"mean_token_accuracy": 0.8103588581085205,
"num_tokens": 930170684.0,
"step": 10500
},
{
"entropy": 0.9466796875,
"epoch": 1.4364108521834211,
"grad_norm": 0.7103034928042085,
"learning_rate": 1.4530787656756376e-06,
"loss": 0.6548,
"mean_token_accuracy": 0.8203786134719848,
"num_tokens": 931088028.0,
"step": 10510
},
{
"entropy": 0.9892578125,
"epoch": 1.43777762591403,
"grad_norm": 0.6970044052783667,
"learning_rate": 1.4495561504861211e-06,
"loss": 0.7015,
"mean_token_accuracy": 0.8095071345567704,
"num_tokens": 932014724.0,
"step": 10520
},
{
"entropy": 1.0021484375,
"epoch": 1.439144399644639,
"grad_norm": 0.6450519848901535,
"learning_rate": 1.4460335352966043e-06,
"loss": 0.6973,
"mean_token_accuracy": 0.8127225935459137,
"num_tokens": 932888906.0,
"step": 10530
},
{
"entropy": 1.0419921875,
"epoch": 1.4405111733752478,
"grad_norm": 0.7012507621575691,
"learning_rate": 1.4425109201070876e-06,
"loss": 0.8013,
"mean_token_accuracy": 0.7891533970832825,
"num_tokens": 933851911.0,
"step": 10540
},
{
"entropy": 0.9947265625,
"epoch": 1.4418779471058567,
"grad_norm": 0.7058700947323486,
"learning_rate": 1.438988304917571e-06,
"loss": 0.6806,
"mean_token_accuracy": 0.8152488619089127,
"num_tokens": 934766976.0,
"step": 10550
},
{
"entropy": 1.0001953125,
"epoch": 1.4432447208364656,
"grad_norm": 0.6420971394840091,
"learning_rate": 1.4354656897280543e-06,
"loss": 0.7324,
"mean_token_accuracy": 0.8052628427743912,
"num_tokens": 935658392.0,
"step": 10560
},
{
"entropy": 0.9875,
"epoch": 1.4446114945670745,
"grad_norm": 0.6821118082996536,
"learning_rate": 1.4319430745385376e-06,
"loss": 0.6946,
"mean_token_accuracy": 0.8107493430376053,
"num_tokens": 936532519.0,
"step": 10570
},
{
"entropy": 0.9970703125,
"epoch": 1.4459782682976834,
"grad_norm": 0.6165338548829177,
"learning_rate": 1.428420459349021e-06,
"loss": 0.6929,
"mean_token_accuracy": 0.8146391242742539,
"num_tokens": 937413962.0,
"step": 10580
},
{
"entropy": 0.947265625,
"epoch": 1.4473450420282923,
"grad_norm": 0.7380012032499691,
"learning_rate": 1.424897844159504e-06,
"loss": 0.6457,
"mean_token_accuracy": 0.8234804600477219,
"num_tokens": 938298992.0,
"step": 10590
},
{
"entropy": 0.98046875,
"epoch": 1.4487118157589012,
"grad_norm": 0.7611238975418928,
"learning_rate": 1.4213752289699876e-06,
"loss": 0.6772,
"mean_token_accuracy": 0.8166425585746765,
"num_tokens": 939178986.0,
"step": 10600
},
{
"entropy": 0.9470703125,
"epoch": 1.45007858948951,
"grad_norm": 0.5755191328563666,
"learning_rate": 1.4178526137804707e-06,
"loss": 0.6753,
"mean_token_accuracy": 0.8175826162099838,
"num_tokens": 940050901.0,
"step": 10610
},
{
"entropy": 0.9845703125,
"epoch": 1.451445363220119,
"grad_norm": 0.6738231304012829,
"learning_rate": 1.4143299985909538e-06,
"loss": 0.6577,
"mean_token_accuracy": 0.8215571105480194,
"num_tokens": 940916956.0,
"step": 10620
},
{
"entropy": 0.9708984375,
"epoch": 1.4528121369507279,
"grad_norm": 0.6994602251658235,
"learning_rate": 1.4108073834014374e-06,
"loss": 0.6764,
"mean_token_accuracy": 0.8158725798130035,
"num_tokens": 941829889.0,
"step": 10630
},
{
"entropy": 0.954296875,
"epoch": 1.4541789106813368,
"grad_norm": 0.7126337840707433,
"learning_rate": 1.4072847682119205e-06,
"loss": 0.6822,
"mean_token_accuracy": 0.8144129991531373,
"num_tokens": 942736711.0,
"step": 10640
},
{
"entropy": 0.968359375,
"epoch": 1.4555456844119457,
"grad_norm": 0.6633234837048532,
"learning_rate": 1.4037621530224039e-06,
"loss": 0.6994,
"mean_token_accuracy": 0.8119019210338593,
"num_tokens": 943671086.0,
"step": 10650
},
{
"entropy": 0.9841796875,
"epoch": 1.4569124581425545,
"grad_norm": 0.6336115626196425,
"learning_rate": 1.4002395378328872e-06,
"loss": 0.6429,
"mean_token_accuracy": 0.821674132347107,
"num_tokens": 944598233.0,
"step": 10660
},
{
"entropy": 0.9689453125,
"epoch": 1.4582792318731634,
"grad_norm": 0.7011533126006438,
"learning_rate": 1.3967169226433705e-06,
"loss": 0.6609,
"mean_token_accuracy": 0.8204199254512787,
"num_tokens": 945480002.0,
"step": 10670
},
{
"entropy": 0.985546875,
"epoch": 1.4596460056037723,
"grad_norm": 0.6611665185636323,
"learning_rate": 1.393194307453854e-06,
"loss": 0.7168,
"mean_token_accuracy": 0.807428652048111,
"num_tokens": 946388987.0,
"step": 10680
},
{
"entropy": 1.011328125,
"epoch": 1.4610127793343812,
"grad_norm": 0.7269366095727161,
"learning_rate": 1.3896716922643372e-06,
"loss": 0.7288,
"mean_token_accuracy": 0.8029693543910981,
"num_tokens": 947253180.0,
"step": 10690
},
{
"entropy": 0.9685546875,
"epoch": 1.4623795530649901,
"grad_norm": 0.6386861775571776,
"learning_rate": 1.3861490770748203e-06,
"loss": 0.6649,
"mean_token_accuracy": 0.8186743825674057,
"num_tokens": 948160131.0,
"step": 10700
},
{
"entropy": 1.0009765625,
"epoch": 1.463746326795599,
"grad_norm": 0.7824373647810203,
"learning_rate": 1.3826264618853039e-06,
"loss": 0.7068,
"mean_token_accuracy": 0.8068437904119492,
"num_tokens": 949000608.0,
"step": 10710
},
{
"entropy": 1.0166015625,
"epoch": 1.465113100526208,
"grad_norm": 0.6942852517619638,
"learning_rate": 1.379103846695787e-06,
"loss": 0.7211,
"mean_token_accuracy": 0.8062816321849823,
"num_tokens": 949951490.0,
"step": 10720
},
{
"entropy": 1.0046875,
"epoch": 1.4664798742568168,
"grad_norm": 0.7096141130768865,
"learning_rate": 1.3755812315062703e-06,
"loss": 0.7111,
"mean_token_accuracy": 0.8079971700906754,
"num_tokens": 950835351.0,
"step": 10730
},
{
"entropy": 0.96875,
"epoch": 1.4678466479874257,
"grad_norm": 0.680826457413882,
"learning_rate": 1.3720586163167537e-06,
"loss": 0.6994,
"mean_token_accuracy": 0.8108312577009201,
"num_tokens": 951720959.0,
"step": 10740
},
{
"entropy": 1.0111328125,
"epoch": 1.4692134217180346,
"grad_norm": 0.785930638542288,
"learning_rate": 1.368536001127237e-06,
"loss": 0.7361,
"mean_token_accuracy": 0.8074838370084763,
"num_tokens": 952584602.0,
"step": 10750
},
{
"entropy": 0.96640625,
"epoch": 1.4705801954486435,
"grad_norm": 0.6269685368409825,
"learning_rate": 1.3650133859377201e-06,
"loss": 0.6992,
"mean_token_accuracy": 0.8109261006116867,
"num_tokens": 953459805.0,
"step": 10760
},
{
"entropy": 0.987109375,
"epoch": 1.4719469691792524,
"grad_norm": 0.698789783526669,
"learning_rate": 1.3614907707482037e-06,
"loss": 0.6995,
"mean_token_accuracy": 0.8098016887903213,
"num_tokens": 954324502.0,
"step": 10770
},
{
"entropy": 1.065625,
"epoch": 1.4733137429098613,
"grad_norm": 0.710168654995621,
"learning_rate": 1.3579681555586868e-06,
"loss": 0.7478,
"mean_token_accuracy": 0.8022451668977737,
"num_tokens": 955233860.0,
"step": 10780
},
{
"entropy": 1.01171875,
"epoch": 1.4746805166404702,
"grad_norm": 0.5960140782505826,
"learning_rate": 1.3544455403691703e-06,
"loss": 0.704,
"mean_token_accuracy": 0.8111803889274597,
"num_tokens": 956148137.0,
"step": 10790
},
{
"entropy": 0.97109375,
"epoch": 1.476047290371079,
"grad_norm": 0.6806347933745996,
"learning_rate": 1.3509229251796535e-06,
"loss": 0.6678,
"mean_token_accuracy": 0.8172883242368698,
"num_tokens": 956998510.0,
"step": 10800
},
{
"entropy": 0.9970703125,
"epoch": 1.477414064101688,
"grad_norm": 0.6416813152423236,
"learning_rate": 1.3474003099901368e-06,
"loss": 0.7041,
"mean_token_accuracy": 0.8100553959608078,
"num_tokens": 957859645.0,
"step": 10810
},
{
"entropy": 0.9716796875,
"epoch": 1.4787808378322969,
"grad_norm": 0.6151273811221424,
"learning_rate": 1.3438776948006201e-06,
"loss": 0.675,
"mean_token_accuracy": 0.8164024919271469,
"num_tokens": 958729483.0,
"step": 10820
},
{
"entropy": 0.9517578125,
"epoch": 1.4801476115629058,
"grad_norm": 0.6503460070200329,
"learning_rate": 1.3403550796111035e-06,
"loss": 0.6235,
"mean_token_accuracy": 0.8270869314670563,
"num_tokens": 959617772.0,
"step": 10830
},
{
"entropy": 0.9849609375,
"epoch": 1.4815143852935146,
"grad_norm": 0.6836617728397043,
"learning_rate": 1.3368324644215866e-06,
"loss": 0.694,
"mean_token_accuracy": 0.8139364451169968,
"num_tokens": 960496565.0,
"step": 10840
},
{
"entropy": 0.9560546875,
"epoch": 1.4828811590241235,
"grad_norm": 0.6144137272402147,
"learning_rate": 1.3333098492320701e-06,
"loss": 0.6821,
"mean_token_accuracy": 0.814840242266655,
"num_tokens": 961390449.0,
"step": 10850
},
{
"entropy": 1.0119140625,
"epoch": 1.4842479327547324,
"grad_norm": 0.7414359584259543,
"learning_rate": 1.3297872340425533e-06,
"loss": 0.7487,
"mean_token_accuracy": 0.7999522805213928,
"num_tokens": 962243695.0,
"step": 10860
},
{
"entropy": 1.01015625,
"epoch": 1.4856147064853413,
"grad_norm": 0.7279048933560356,
"learning_rate": 1.3262646188530364e-06,
"loss": 0.7416,
"mean_token_accuracy": 0.8040607661008835,
"num_tokens": 963171977.0,
"step": 10870
},
{
"entropy": 0.9828125,
"epoch": 1.4869814802159502,
"grad_norm": 0.5914851111619546,
"learning_rate": 1.32274200366352e-06,
"loss": 0.7025,
"mean_token_accuracy": 0.8124668002128601,
"num_tokens": 964055991.0,
"step": 10880
},
{
"entropy": 0.9703125,
"epoch": 1.4883482539465591,
"grad_norm": 0.6435268016247823,
"learning_rate": 1.319219388474003e-06,
"loss": 0.686,
"mean_token_accuracy": 0.8147623866796494,
"num_tokens": 964895585.0,
"step": 10890
},
{
"entropy": 1.0130859375,
"epoch": 1.489715027677168,
"grad_norm": 0.6540019077571623,
"learning_rate": 1.3156967732844866e-06,
"loss": 0.7333,
"mean_token_accuracy": 0.8022537887096405,
"num_tokens": 965796547.0,
"step": 10900
},
{
"entropy": 0.962890625,
"epoch": 1.491081801407777,
"grad_norm": 0.7013972115153629,
"learning_rate": 1.31217415809497e-06,
"loss": 0.647,
"mean_token_accuracy": 0.8221337378025055,
"num_tokens": 966706376.0,
"step": 10910
},
{
"entropy": 1.0283203125,
"epoch": 1.4924485751383858,
"grad_norm": 0.6978673740064701,
"learning_rate": 1.308651542905453e-06,
"loss": 0.7538,
"mean_token_accuracy": 0.7985073387622833,
"num_tokens": 967641987.0,
"step": 10920
},
{
"entropy": 0.9599609375,
"epoch": 1.4938153488689947,
"grad_norm": 0.7080618641659836,
"learning_rate": 1.3051289277159366e-06,
"loss": 0.6791,
"mean_token_accuracy": 0.8140545517206192,
"num_tokens": 968513222.0,
"step": 10930
},
{
"entropy": 0.98046875,
"epoch": 1.4951821225996036,
"grad_norm": 0.7245925487581225,
"learning_rate": 1.3016063125264197e-06,
"loss": 0.7148,
"mean_token_accuracy": 0.8114113688468934,
"num_tokens": 969379276.0,
"step": 10940
},
{
"entropy": 1.0060546875,
"epoch": 1.4965488963302125,
"grad_norm": 0.7549667801332515,
"learning_rate": 1.2980836973369029e-06,
"loss": 0.7398,
"mean_token_accuracy": 0.8009892582893372,
"num_tokens": 970233883.0,
"step": 10950
},
{
"entropy": 0.959375,
"epoch": 1.4979156700608214,
"grad_norm": 0.7520374087549953,
"learning_rate": 1.2945610821473864e-06,
"loss": 0.7049,
"mean_token_accuracy": 0.810691824555397,
"num_tokens": 971089571.0,
"step": 10960
},
{
"entropy": 0.991015625,
"epoch": 1.4992824437914303,
"grad_norm": 0.6836861107679095,
"learning_rate": 1.2910384669578695e-06,
"loss": 0.6528,
"mean_token_accuracy": 0.8223179608583451,
"num_tokens": 971969845.0,
"step": 10970
},
{
"entropy": 0.9634765625,
"epoch": 1.5006492175220392,
"grad_norm": 0.7323401004386465,
"learning_rate": 1.2875158517683529e-06,
"loss": 0.6932,
"mean_token_accuracy": 0.8138633728027344,
"num_tokens": 972830400.0,
"step": 10980
},
{
"entropy": 1.0015625,
"epoch": 1.502015991252648,
"grad_norm": 0.7374590954844173,
"learning_rate": 1.2839932365788362e-06,
"loss": 0.7421,
"mean_token_accuracy": 0.800410482287407,
"num_tokens": 973711071.0,
"step": 10990
},
{
"entropy": 0.9701171875,
"epoch": 1.503382764983257,
"grad_norm": 0.5878552856993373,
"learning_rate": 1.2804706213893195e-06,
"loss": 0.692,
"mean_token_accuracy": 0.8118181556463242,
"num_tokens": 974615703.0,
"step": 11000
},
{
"entropy": 1.024609375,
"epoch": 1.5047495387138659,
"grad_norm": 0.6563834723936498,
"learning_rate": 1.2769480061998029e-06,
"loss": 0.7207,
"mean_token_accuracy": 0.8085536152124405,
"num_tokens": 975506409.0,
"step": 11010
},
{
"entropy": 0.9703125,
"epoch": 1.5061163124444747,
"grad_norm": 0.6548300719930725,
"learning_rate": 1.2734253910102862e-06,
"loss": 0.6733,
"mean_token_accuracy": 0.8173408329486846,
"num_tokens": 976439918.0,
"step": 11020
},
{
"entropy": 0.9875,
"epoch": 1.5074830861750836,
"grad_norm": 0.6924211747768397,
"learning_rate": 1.2699027758207693e-06,
"loss": 0.6824,
"mean_token_accuracy": 0.8156700253486633,
"num_tokens": 977319557.0,
"step": 11030
},
{
"entropy": 1.0349609375,
"epoch": 1.5088498599056925,
"grad_norm": 0.697607110369416,
"learning_rate": 1.2663801606312529e-06,
"loss": 0.7654,
"mean_token_accuracy": 0.7944225817918777,
"num_tokens": 978259078.0,
"step": 11040
},
{
"entropy": 0.993359375,
"epoch": 1.5102166336363014,
"grad_norm": 0.7370564627831331,
"learning_rate": 1.262857545441736e-06,
"loss": 0.6655,
"mean_token_accuracy": 0.8188665628433227,
"num_tokens": 979110803.0,
"step": 11050
},
{
"entropy": 0.9916015625,
"epoch": 1.5115834073669103,
"grad_norm": 0.6616911209084811,
"learning_rate": 1.2593349302522193e-06,
"loss": 0.6933,
"mean_token_accuracy": 0.8120348274707794,
"num_tokens": 979995472.0,
"step": 11060
},
{
"entropy": 0.99453125,
"epoch": 1.5129501810975192,
"grad_norm": 0.7425996621954023,
"learning_rate": 1.2558123150627027e-06,
"loss": 0.6818,
"mean_token_accuracy": 0.815175524353981,
"num_tokens": 980896411.0,
"step": 11070
},
{
"entropy": 1.0025390625,
"epoch": 1.5143169548281281,
"grad_norm": 0.787717831083482,
"learning_rate": 1.252289699873186e-06,
"loss": 0.7424,
"mean_token_accuracy": 0.8028171688318253,
"num_tokens": 981782545.0,
"step": 11080
},
{
"entropy": 0.997265625,
"epoch": 1.515683728558737,
"grad_norm": 0.7647818083815565,
"learning_rate": 1.2487670846836693e-06,
"loss": 0.7197,
"mean_token_accuracy": 0.8035195410251618,
"num_tokens": 982689516.0,
"step": 11090
},
{
"entropy": 1.0365234375,
"epoch": 1.517050502289346,
"grad_norm": 0.7787327443045708,
"learning_rate": 1.2452444694941527e-06,
"loss": 0.8019,
"mean_token_accuracy": 0.7894831627607346,
"num_tokens": 983535293.0,
"step": 11100
},
{
"entropy": 1.001953125,
"epoch": 1.5184172760199548,
"grad_norm": 0.5761818195379693,
"learning_rate": 1.2417218543046358e-06,
"loss": 0.7115,
"mean_token_accuracy": 0.8087473779916763,
"num_tokens": 984435788.0,
"step": 11110
},
{
"entropy": 0.980859375,
"epoch": 1.5197840497505637,
"grad_norm": 0.6978369464089588,
"learning_rate": 1.2381992391151191e-06,
"loss": 0.7124,
"mean_token_accuracy": 0.8096403777599335,
"num_tokens": 985303807.0,
"step": 11120
},
{
"entropy": 0.9916015625,
"epoch": 1.5211508234811726,
"grad_norm": 0.6968357982898108,
"learning_rate": 1.2346766239256025e-06,
"loss": 0.7173,
"mean_token_accuracy": 0.8055552542209625,
"num_tokens": 986218767.0,
"step": 11130
},
{
"entropy": 0.9826171875,
"epoch": 1.5225175972117815,
"grad_norm": 0.6524541844295285,
"learning_rate": 1.2311540087360858e-06,
"loss": 0.6771,
"mean_token_accuracy": 0.8148417741060257,
"num_tokens": 987143778.0,
"step": 11140
},
{
"entropy": 0.97578125,
"epoch": 1.5238843709423904,
"grad_norm": 0.6656467837045843,
"learning_rate": 1.2276313935465691e-06,
"loss": 0.6698,
"mean_token_accuracy": 0.8177864760160446,
"num_tokens": 988031175.0,
"step": 11150
},
{
"entropy": 0.9806640625,
"epoch": 1.5252511446729993,
"grad_norm": 0.6187402808438844,
"learning_rate": 1.2241087783570525e-06,
"loss": 0.7077,
"mean_token_accuracy": 0.8133202582597733,
"num_tokens": 988923325.0,
"step": 11160
},
{
"entropy": 0.9998046875,
"epoch": 1.5266179184036082,
"grad_norm": 0.6214627480909326,
"learning_rate": 1.2205861631675358e-06,
"loss": 0.6979,
"mean_token_accuracy": 0.8096625149250031,
"num_tokens": 989811919.0,
"step": 11170
},
{
"entropy": 1.0318359375,
"epoch": 1.527984692134217,
"grad_norm": 0.8049513151819327,
"learning_rate": 1.217063547978019e-06,
"loss": 0.7382,
"mean_token_accuracy": 0.8013631731271744,
"num_tokens": 990679973.0,
"step": 11180
},
{
"entropy": 0.984765625,
"epoch": 1.529351465864826,
"grad_norm": 0.6383032292628179,
"learning_rate": 1.2135409327885023e-06,
"loss": 0.6998,
"mean_token_accuracy": 0.8121328204870224,
"num_tokens": 991562442.0,
"step": 11190
},
{
"entropy": 0.9576171875,
"epoch": 1.5307182395954348,
"grad_norm": 0.6486195272569951,
"learning_rate": 1.2100183175989856e-06,
"loss": 0.6647,
"mean_token_accuracy": 0.8169293254613876,
"num_tokens": 992429060.0,
"step": 11200
},
{
"entropy": 0.948046875,
"epoch": 1.5320850133260437,
"grad_norm": 0.6653603924975492,
"learning_rate": 1.206495702409469e-06,
"loss": 0.6682,
"mean_token_accuracy": 0.8176566272974014,
"num_tokens": 993299078.0,
"step": 11210
},
{
"entropy": 0.9505859375,
"epoch": 1.5334517870566526,
"grad_norm": 0.764565470015223,
"learning_rate": 1.202973087219952e-06,
"loss": 0.6686,
"mean_token_accuracy": 0.8170719742774963,
"num_tokens": 994183754.0,
"step": 11220
},
{
"entropy": 0.9642578125,
"epoch": 1.5348185607872615,
"grad_norm": 0.6819718688620995,
"learning_rate": 1.1994504720304354e-06,
"loss": 0.7141,
"mean_token_accuracy": 0.8080669283866883,
"num_tokens": 995090732.0,
"step": 11230
},
{
"entropy": 0.9705078125,
"epoch": 1.5361853345178704,
"grad_norm": 0.7125494995966138,
"learning_rate": 1.1959278568409187e-06,
"loss": 0.6819,
"mean_token_accuracy": 0.8130895823240281,
"num_tokens": 996004572.0,
"step": 11240
},
{
"entropy": 0.97109375,
"epoch": 1.5375521082484793,
"grad_norm": 0.6626830178816916,
"learning_rate": 1.192405241651402e-06,
"loss": 0.6743,
"mean_token_accuracy": 0.8147948384284973,
"num_tokens": 996890955.0,
"step": 11250
},
{
"entropy": 0.9771484375,
"epoch": 1.5389188819790882,
"grad_norm": 0.6660392800822658,
"learning_rate": 1.1888826264618854e-06,
"loss": 0.6964,
"mean_token_accuracy": 0.8101605772972107,
"num_tokens": 997769284.0,
"step": 11260
},
{
"entropy": 0.979296875,
"epoch": 1.540285655709697,
"grad_norm": 0.7020351253027435,
"learning_rate": 1.1853600112723687e-06,
"loss": 0.6937,
"mean_token_accuracy": 0.813403308391571,
"num_tokens": 998677050.0,
"step": 11270
},
{
"entropy": 0.9662109375,
"epoch": 1.541652429440306,
"grad_norm": 0.7109471118384882,
"learning_rate": 1.181837396082852e-06,
"loss": 0.6673,
"mean_token_accuracy": 0.8185861259698868,
"num_tokens": 999575420.0,
"step": 11280
},
{
"entropy": 0.9556640625,
"epoch": 1.543019203170915,
"grad_norm": 0.6641146096670482,
"learning_rate": 1.1783147808933352e-06,
"loss": 0.702,
"mean_token_accuracy": 0.8107817530632019,
"num_tokens": 1000467865.0,
"step": 11290
},
{
"entropy": 1.0517578125,
"epoch": 1.5443859769015238,
"grad_norm": 0.7079236003994918,
"learning_rate": 1.1747921657038185e-06,
"loss": 0.754,
"mean_token_accuracy": 0.7990370631217957,
"num_tokens": 1001343857.0,
"step": 11300
},
{
"entropy": 0.9576171875,
"epoch": 1.5457527506321327,
"grad_norm": 0.6225635154660988,
"learning_rate": 1.1712695505143019e-06,
"loss": 0.6435,
"mean_token_accuracy": 0.8225361436605454,
"num_tokens": 1002206031.0,
"step": 11310
},
{
"entropy": 0.9923828125,
"epoch": 1.5471195243627416,
"grad_norm": 0.6414584770496017,
"learning_rate": 1.1677469353247852e-06,
"loss": 0.6788,
"mean_token_accuracy": 0.8164716541767121,
"num_tokens": 1003046032.0,
"step": 11320
},
{
"entropy": 1.002734375,
"epoch": 1.5484862980933507,
"grad_norm": 0.664603772921697,
"learning_rate": 1.1642243201352685e-06,
"loss": 0.7334,
"mean_token_accuracy": 0.8015383213758469,
"num_tokens": 1003968005.0,
"step": 11330
},
{
"entropy": 0.9767578125,
"epoch": 1.5498530718239596,
"grad_norm": 0.6943245652938212,
"learning_rate": 1.1607017049457519e-06,
"loss": 0.6931,
"mean_token_accuracy": 0.8128362655639648,
"num_tokens": 1004874914.0,
"step": 11340
},
{
"entropy": 1.003125,
"epoch": 1.5512198455545685,
"grad_norm": 0.6639587810484019,
"learning_rate": 1.1571790897562352e-06,
"loss": 0.7361,
"mean_token_accuracy": 0.8039683997631073,
"num_tokens": 1005735910.0,
"step": 11350
},
{
"entropy": 0.9556640625,
"epoch": 1.5525866192851774,
"grad_norm": 0.668506664487321,
"learning_rate": 1.1536564745667183e-06,
"loss": 0.6905,
"mean_token_accuracy": 0.8129796326160431,
"num_tokens": 1006600794.0,
"step": 11360
},
{
"entropy": 1.00078125,
"epoch": 1.5539533930157863,
"grad_norm": 0.7103636513022377,
"learning_rate": 1.1501338593772017e-06,
"loss": 0.7079,
"mean_token_accuracy": 0.809389916062355,
"num_tokens": 1007467493.0,
"step": 11370
},
{
"entropy": 1.005078125,
"epoch": 1.5553201667463952,
"grad_norm": 0.7254116700111988,
"learning_rate": 1.146611244187685e-06,
"loss": 0.7121,
"mean_token_accuracy": 0.8106485962867737,
"num_tokens": 1008379489.0,
"step": 11380
},
{
"entropy": 0.987109375,
"epoch": 1.556686940477004,
"grad_norm": 0.6838689256705915,
"learning_rate": 1.1430886289981683e-06,
"loss": 0.7251,
"mean_token_accuracy": 0.8056413471698761,
"num_tokens": 1009259295.0,
"step": 11390
},
{
"entropy": 0.966796875,
"epoch": 1.558053714207613,
"grad_norm": 0.6994675404876408,
"learning_rate": 1.1395660138086517e-06,
"loss": 0.6586,
"mean_token_accuracy": 0.8202063769102097,
"num_tokens": 1010088513.0,
"step": 11400
},
{
"entropy": 0.951171875,
"epoch": 1.5594204879382219,
"grad_norm": 0.6838236293159698,
"learning_rate": 1.136043398619135e-06,
"loss": 0.6617,
"mean_token_accuracy": 0.8199468821287155,
"num_tokens": 1010964392.0,
"step": 11410
},
{
"entropy": 1.035546875,
"epoch": 1.5607872616688307,
"grad_norm": 0.7510707923077315,
"learning_rate": 1.1325207834296184e-06,
"loss": 0.7481,
"mean_token_accuracy": 0.8006908297538757,
"num_tokens": 1011863256.0,
"step": 11420
},
{
"entropy": 0.965234375,
"epoch": 1.5621540353994396,
"grad_norm": 0.7000532423587039,
"learning_rate": 1.1289981682401017e-06,
"loss": 0.6704,
"mean_token_accuracy": 0.8163295984268188,
"num_tokens": 1012715405.0,
"step": 11430
},
{
"entropy": 0.995703125,
"epoch": 1.5635208091300485,
"grad_norm": 0.626942935287915,
"learning_rate": 1.1254755530505848e-06,
"loss": 0.6874,
"mean_token_accuracy": 0.8158217817544937,
"num_tokens": 1013602800.0,
"step": 11440
},
{
"entropy": 1.005078125,
"epoch": 1.5648875828606574,
"grad_norm": 0.6413177000241937,
"learning_rate": 1.1219529378610681e-06,
"loss": 0.734,
"mean_token_accuracy": 0.8036356657743454,
"num_tokens": 1014477602.0,
"step": 11450
},
{
"entropy": 1.0017578125,
"epoch": 1.5662543565912663,
"grad_norm": 0.7300603188799423,
"learning_rate": 1.1184303226715515e-06,
"loss": 0.7089,
"mean_token_accuracy": 0.809542852640152,
"num_tokens": 1015376894.0,
"step": 11460
},
{
"entropy": 1.0111328125,
"epoch": 1.5676211303218752,
"grad_norm": 0.6876405915452415,
"learning_rate": 1.1149077074820346e-06,
"loss": 0.7186,
"mean_token_accuracy": 0.8058148711919785,
"num_tokens": 1016269694.0,
"step": 11470
},
{
"entropy": 1.0333984375,
"epoch": 1.5689879040524841,
"grad_norm": 0.7671493767807989,
"learning_rate": 1.111385092292518e-06,
"loss": 0.7524,
"mean_token_accuracy": 0.8008171290159225,
"num_tokens": 1017136473.0,
"step": 11480
},
{
"entropy": 0.9736328125,
"epoch": 1.570354677783093,
"grad_norm": 0.623916736274538,
"learning_rate": 1.1078624771030013e-06,
"loss": 0.7014,
"mean_token_accuracy": 0.8114359736442566,
"num_tokens": 1018025066.0,
"step": 11490
},
{
"entropy": 1.00546875,
"epoch": 1.571721451513702,
"grad_norm": 0.6383184737761515,
"learning_rate": 1.1043398619134846e-06,
"loss": 0.72,
"mean_token_accuracy": 0.8066169649362565,
"num_tokens": 1018946433.0,
"step": 11500
},
{
"entropy": 1.0046875,
"epoch": 1.5730882252443108,
"grad_norm": 0.6020999535953647,
"learning_rate": 1.100817246723968e-06,
"loss": 0.7065,
"mean_token_accuracy": 0.8094817966222763,
"num_tokens": 1019818403.0,
"step": 11510
},
{
"entropy": 0.9765625,
"epoch": 1.5744549989749197,
"grad_norm": 0.659241553484498,
"learning_rate": 1.0972946315344513e-06,
"loss": 0.6998,
"mean_token_accuracy": 0.810862198472023,
"num_tokens": 1020734420.0,
"step": 11520
},
{
"entropy": 0.9703125,
"epoch": 1.5758217727055286,
"grad_norm": 0.653792800954176,
"learning_rate": 1.0937720163449346e-06,
"loss": 0.6909,
"mean_token_accuracy": 0.8157576322555542,
"num_tokens": 1021610608.0,
"step": 11530
},
{
"entropy": 0.9943359375,
"epoch": 1.5771885464361375,
"grad_norm": 0.6419689360826935,
"learning_rate": 1.0902494011554177e-06,
"loss": 0.7181,
"mean_token_accuracy": 0.8049979716539383,
"num_tokens": 1022507878.0,
"step": 11540
},
{
"entropy": 0.9671875,
"epoch": 1.5785553201667464,
"grad_norm": 0.6718838998272217,
"learning_rate": 1.086726785965901e-06,
"loss": 0.6748,
"mean_token_accuracy": 0.8166219502687454,
"num_tokens": 1023437587.0,
"step": 11550
},
{
"entropy": 1.0201171875,
"epoch": 1.5799220938973553,
"grad_norm": 0.7376546067948928,
"learning_rate": 1.0832041707763844e-06,
"loss": 0.7422,
"mean_token_accuracy": 0.8012820363044739,
"num_tokens": 1024328404.0,
"step": 11560
},
{
"entropy": 1.001171875,
"epoch": 1.5812888676279642,
"grad_norm": 0.6311387510738095,
"learning_rate": 1.0796815555868678e-06,
"loss": 0.7182,
"mean_token_accuracy": 0.8089624643325806,
"num_tokens": 1025278391.0,
"step": 11570
},
{
"entropy": 1.0125,
"epoch": 1.582655641358573,
"grad_norm": 0.6340182655879473,
"learning_rate": 1.076158940397351e-06,
"loss": 0.7284,
"mean_token_accuracy": 0.8032426297664642,
"num_tokens": 1026166802.0,
"step": 11580
},
{
"entropy": 0.9833984375,
"epoch": 1.584022415089182,
"grad_norm": 0.6430532720540428,
"learning_rate": 1.0726363252078344e-06,
"loss": 0.72,
"mean_token_accuracy": 0.8079435378313065,
"num_tokens": 1027024240.0,
"step": 11590
},
{
"entropy": 0.95546875,
"epoch": 1.5853891888197909,
"grad_norm": 0.6164246317274499,
"learning_rate": 1.0691137100183178e-06,
"loss": 0.6385,
"mean_token_accuracy": 0.8263185858726502,
"num_tokens": 1027904455.0,
"step": 11600
},
{
"entropy": 0.9578125,
"epoch": 1.5867559625503997,
"grad_norm": 0.6918993377278125,
"learning_rate": 1.065591094828801e-06,
"loss": 0.7418,
"mean_token_accuracy": 0.8047758847475052,
"num_tokens": 1028833540.0,
"step": 11610
},
{
"entropy": 0.97578125,
"epoch": 1.5881227362810086,
"grad_norm": 0.6807920668034,
"learning_rate": 1.0620684796392842e-06,
"loss": 0.6697,
"mean_token_accuracy": 0.8169349312782288,
"num_tokens": 1029655720.0,
"step": 11620
},
{
"entropy": 0.9373046875,
"epoch": 1.5894895100116175,
"grad_norm": 0.6757439643185558,
"learning_rate": 1.0585458644497676e-06,
"loss": 0.6431,
"mean_token_accuracy": 0.8242484927177429,
"num_tokens": 1030505941.0,
"step": 11630
},
{
"entropy": 1.025,
"epoch": 1.5908562837422264,
"grad_norm": 0.5886188102356741,
"learning_rate": 1.0550232492602509e-06,
"loss": 0.7059,
"mean_token_accuracy": 0.8095192193984986,
"num_tokens": 1031370313.0,
"step": 11640
},
{
"entropy": 1.01171875,
"epoch": 1.5922230574728353,
"grad_norm": 0.6208834583309742,
"learning_rate": 1.0515006340707342e-06,
"loss": 0.706,
"mean_token_accuracy": 0.8093329399824143,
"num_tokens": 1032243138.0,
"step": 11650
},
{
"entropy": 0.9580078125,
"epoch": 1.5935898312034442,
"grad_norm": 0.7174167126423104,
"learning_rate": 1.0479780188812176e-06,
"loss": 0.6642,
"mean_token_accuracy": 0.8174850344657898,
"num_tokens": 1033081238.0,
"step": 11660
},
{
"entropy": 0.9759765625,
"epoch": 1.5949566049340531,
"grad_norm": 0.669522934506058,
"learning_rate": 1.0444554036917009e-06,
"loss": 0.698,
"mean_token_accuracy": 0.8126110672950745,
"num_tokens": 1033975506.0,
"step": 11670
},
{
"entropy": 1.00859375,
"epoch": 1.5963233786646622,
"grad_norm": 0.6262879547503442,
"learning_rate": 1.0409327885021842e-06,
"loss": 0.7131,
"mean_token_accuracy": 0.8062665164470673,
"num_tokens": 1034879253.0,
"step": 11680
},
{
"entropy": 0.95546875,
"epoch": 1.5976901523952711,
"grad_norm": 0.6870725127419695,
"learning_rate": 1.0374101733126674e-06,
"loss": 0.6761,
"mean_token_accuracy": 0.817094698548317,
"num_tokens": 1035764543.0,
"step": 11690
},
{
"entropy": 0.963671875,
"epoch": 1.59905692612588,
"grad_norm": 0.7349549179387233,
"learning_rate": 1.0338875581231507e-06,
"loss": 0.6599,
"mean_token_accuracy": 0.8210789769887924,
"num_tokens": 1036597658.0,
"step": 11700
},
{
"entropy": 1.025,
"epoch": 1.600423699856489,
"grad_norm": 0.6835881047024192,
"learning_rate": 1.030364942933634e-06,
"loss": 0.738,
"mean_token_accuracy": 0.801714152097702,
"num_tokens": 1037461178.0,
"step": 11710
},
{
"entropy": 0.972265625,
"epoch": 1.6017904735870978,
"grad_norm": 0.5669690481906986,
"learning_rate": 1.0268423277441174e-06,
"loss": 0.7002,
"mean_token_accuracy": 0.8141640454530716,
"num_tokens": 1038320543.0,
"step": 11720
},
{
"entropy": 0.9826171875,
"epoch": 1.6031572473177067,
"grad_norm": 0.6955164921289156,
"learning_rate": 1.0233197125546005e-06,
"loss": 0.6916,
"mean_token_accuracy": 0.8128978669643402,
"num_tokens": 1039158322.0,
"step": 11730
},
{
"entropy": 0.9880859375,
"epoch": 1.6045240210483156,
"grad_norm": 0.6891708839349003,
"learning_rate": 1.0197970973650838e-06,
"loss": 0.6876,
"mean_token_accuracy": 0.8135571569204331,
"num_tokens": 1040044664.0,
"step": 11740
},
{
"entropy": 0.9783203125,
"epoch": 1.6058907947789245,
"grad_norm": 0.7563534966939146,
"learning_rate": 1.0162744821755674e-06,
"loss": 0.7195,
"mean_token_accuracy": 0.8083203881978989,
"num_tokens": 1040933733.0,
"step": 11750
},
{
"entropy": 0.9591796875,
"epoch": 1.6072575685095334,
"grad_norm": 0.6630073353207158,
"learning_rate": 1.0127518669860505e-06,
"loss": 0.6682,
"mean_token_accuracy": 0.8191382318735123,
"num_tokens": 1041821739.0,
"step": 11760
},
{
"entropy": 1.0029296875,
"epoch": 1.6086243422401423,
"grad_norm": 0.7595441321144538,
"learning_rate": 1.0092292517965338e-06,
"loss": 0.7361,
"mean_token_accuracy": 0.8054822951555252,
"num_tokens": 1042734726.0,
"step": 11770
},
{
"entropy": 0.9984375,
"epoch": 1.6099911159707512,
"grad_norm": 0.6708877744663413,
"learning_rate": 1.0057066366070172e-06,
"loss": 0.6931,
"mean_token_accuracy": 0.813278928399086,
"num_tokens": 1043605674.0,
"step": 11780
},
{
"entropy": 0.953125,
"epoch": 1.61135788970136,
"grad_norm": 0.6882324930644342,
"learning_rate": 1.0021840214175005e-06,
"loss": 0.6795,
"mean_token_accuracy": 0.8163608998060227,
"num_tokens": 1044489733.0,
"step": 11790
},
{
"entropy": 0.99296875,
"epoch": 1.612724663431969,
"grad_norm": 0.760994840287915,
"learning_rate": 9.986614062279836e-07,
"loss": 0.7044,
"mean_token_accuracy": 0.8112031817436218,
"num_tokens": 1045386114.0,
"step": 11800
},
{
"entropy": 0.955078125,
"epoch": 1.6140914371625779,
"grad_norm": 0.6465008002005401,
"learning_rate": 9.95138791038467e-07,
"loss": 0.6647,
"mean_token_accuracy": 0.8172231405973435,
"num_tokens": 1046281529.0,
"step": 11810
},
{
"entropy": 0.9544921875,
"epoch": 1.6154582108931868,
"grad_norm": 0.6767061909051924,
"learning_rate": 9.916161758489503e-07,
"loss": 0.657,
"mean_token_accuracy": 0.8212955474853516,
"num_tokens": 1047172601.0,
"step": 11820
},
{
"entropy": 1.013671875,
"epoch": 1.6168249846237956,
"grad_norm": 0.6524067986056481,
"learning_rate": 9.880935606594336e-07,
"loss": 0.6923,
"mean_token_accuracy": 0.8128130286931992,
"num_tokens": 1048111551.0,
"step": 11830
},
{
"entropy": 0.976953125,
"epoch": 1.6181917583544045,
"grad_norm": 0.606912271687429,
"learning_rate": 9.84570945469917e-07,
"loss": 0.6843,
"mean_token_accuracy": 0.8164664953947067,
"num_tokens": 1048993658.0,
"step": 11840
},
{
"entropy": 1.00078125,
"epoch": 1.6195585320850134,
"grad_norm": 0.6684149744404473,
"learning_rate": 9.810483302804003e-07,
"loss": 0.6853,
"mean_token_accuracy": 0.8117449820041657,
"num_tokens": 1049881721.0,
"step": 11850
},
{
"entropy": 0.99453125,
"epoch": 1.6209253058156223,
"grad_norm": 0.6693526884593113,
"learning_rate": 9.775257150908836e-07,
"loss": 0.6816,
"mean_token_accuracy": 0.813981693983078,
"num_tokens": 1050738642.0,
"step": 11860
},
{
"entropy": 0.9677734375,
"epoch": 1.6222920795462312,
"grad_norm": 0.7060975459554698,
"learning_rate": 9.740030999013668e-07,
"loss": 0.6984,
"mean_token_accuracy": 0.8130655616521836,
"num_tokens": 1051607144.0,
"step": 11870
},
{
"entropy": 0.9580078125,
"epoch": 1.6236588532768401,
"grad_norm": 0.6551485296865487,
"learning_rate": 9.7048048471185e-07,
"loss": 0.6783,
"mean_token_accuracy": 0.8138233035802841,
"num_tokens": 1052460566.0,
"step": 11880
},
{
"entropy": 0.9884765625,
"epoch": 1.625025627007449,
"grad_norm": 0.5898067218694412,
"learning_rate": 9.669578695223334e-07,
"loss": 0.7313,
"mean_token_accuracy": 0.8031694978475571,
"num_tokens": 1053364568.0,
"step": 11890
},
{
"entropy": 0.9771484375,
"epoch": 1.626392400738058,
"grad_norm": 0.7150249515749006,
"learning_rate": 9.634352543328168e-07,
"loss": 0.6973,
"mean_token_accuracy": 0.8105839699506759,
"num_tokens": 1054222654.0,
"step": 11900
},
{
"entropy": 0.98671875,
"epoch": 1.6277591744686668,
"grad_norm": 0.7376345617915099,
"learning_rate": 9.599126391433e-07,
"loss": 0.6687,
"mean_token_accuracy": 0.8191323727369308,
"num_tokens": 1055112095.0,
"step": 11910
},
{
"entropy": 1.003125,
"epoch": 1.6291259481992757,
"grad_norm": 0.6878820705394388,
"learning_rate": 9.563900239537834e-07,
"loss": 0.7138,
"mean_token_accuracy": 0.8093390941619873,
"num_tokens": 1055990084.0,
"step": 11920
},
{
"entropy": 0.960546875,
"epoch": 1.6304927219298846,
"grad_norm": 0.7279827963622572,
"learning_rate": 9.528674087642667e-07,
"loss": 0.6841,
"mean_token_accuracy": 0.8136768907308578,
"num_tokens": 1056906052.0,
"step": 11930
},
{
"entropy": 0.9423828125,
"epoch": 1.6318594956604935,
"grad_norm": 0.675711550815025,
"learning_rate": 9.4934479357475e-07,
"loss": 0.6542,
"mean_token_accuracy": 0.8230536550283432,
"num_tokens": 1057804689.0,
"step": 11940
},
{
"entropy": 1.032421875,
"epoch": 1.6332262693911024,
"grad_norm": 0.6346668735356537,
"learning_rate": 9.458221783852332e-07,
"loss": 0.7315,
"mean_token_accuracy": 0.8033591151237488,
"num_tokens": 1058720254.0,
"step": 11950
},
{
"entropy": 0.985546875,
"epoch": 1.6345930431217113,
"grad_norm": 0.6716774545244008,
"learning_rate": 9.422995631957166e-07,
"loss": 0.7011,
"mean_token_accuracy": 0.811592698097229,
"num_tokens": 1059561064.0,
"step": 11960
},
{
"entropy": 0.9935546875,
"epoch": 1.6359598168523202,
"grad_norm": 0.7261786454078664,
"learning_rate": 9.387769480061999e-07,
"loss": 0.7344,
"mean_token_accuracy": 0.8038930118083953,
"num_tokens": 1060429575.0,
"step": 11970
},
{
"entropy": 1.0056640625,
"epoch": 1.637326590582929,
"grad_norm": 0.6389066841711278,
"learning_rate": 9.352543328166831e-07,
"loss": 0.6966,
"mean_token_accuracy": 0.8106735855340957,
"num_tokens": 1061352006.0,
"step": 11980
},
{
"entropy": 0.97890625,
"epoch": 1.638693364313538,
"grad_norm": 0.6022107226924981,
"learning_rate": 9.317317176271665e-07,
"loss": 0.6833,
"mean_token_accuracy": 0.8154165387153626,
"num_tokens": 1062196979.0,
"step": 11990
},
{
"entropy": 1.0087890625,
"epoch": 1.6400601380441469,
"grad_norm": 0.6373769294023369,
"learning_rate": 9.282091024376498e-07,
"loss": 0.7545,
"mean_token_accuracy": 0.800234255194664,
"num_tokens": 1063136300.0,
"step": 12000
},
{
"entropy": 1.0361328125,
"epoch": 1.6414269117747557,
"grad_norm": 0.7440150959319336,
"learning_rate": 9.246864872481331e-07,
"loss": 0.7705,
"mean_token_accuracy": 0.7940131783485412,
"num_tokens": 1063984611.0,
"step": 12010
},
{
"entropy": 0.990234375,
"epoch": 1.6427936855053646,
"grad_norm": 0.6622284878642833,
"learning_rate": 9.211638720586164e-07,
"loss": 0.6944,
"mean_token_accuracy": 0.8106675982475281,
"num_tokens": 1064831535.0,
"step": 12020
},
{
"entropy": 0.98828125,
"epoch": 1.6441604592359735,
"grad_norm": 0.7640867815537881,
"learning_rate": 9.176412568690997e-07,
"loss": 0.6978,
"mean_token_accuracy": 0.8123889297246933,
"num_tokens": 1065725334.0,
"step": 12030
},
{
"entropy": 0.97890625,
"epoch": 1.6455272329665824,
"grad_norm": 0.7351839478894647,
"learning_rate": 9.14118641679583e-07,
"loss": 0.7388,
"mean_token_accuracy": 0.8027020663022995,
"num_tokens": 1066626508.0,
"step": 12040
},
{
"entropy": 0.96875,
"epoch": 1.6468940066971913,
"grad_norm": 0.6846819086132424,
"learning_rate": 9.105960264900663e-07,
"loss": 0.7185,
"mean_token_accuracy": 0.8073684483766556,
"num_tokens": 1067460843.0,
"step": 12050
},
{
"entropy": 0.968359375,
"epoch": 1.6482607804278002,
"grad_norm": 0.6536179481790718,
"learning_rate": 9.070734113005496e-07,
"loss": 0.6985,
"mean_token_accuracy": 0.8130323141813278,
"num_tokens": 1068399394.0,
"step": 12060
},
{
"entropy": 1.0205078125,
"epoch": 1.6496275541584091,
"grad_norm": 0.691719879392971,
"learning_rate": 9.035507961110329e-07,
"loss": 0.7377,
"mean_token_accuracy": 0.8014243602752685,
"num_tokens": 1069269064.0,
"step": 12070
},
{
"entropy": 0.973046875,
"epoch": 1.650994327889018,
"grad_norm": 0.6906818159747639,
"learning_rate": 9.000281809215163e-07,
"loss": 0.6775,
"mean_token_accuracy": 0.8161803901195526,
"num_tokens": 1070151947.0,
"step": 12080
},
{
"entropy": 0.980078125,
"epoch": 1.652361101619627,
"grad_norm": 0.7216585529166231,
"learning_rate": 8.965055657319995e-07,
"loss": 0.683,
"mean_token_accuracy": 0.816037604212761,
"num_tokens": 1071027874.0,
"step": 12090
},
{
"entropy": 0.9734375,
"epoch": 1.6537278753502358,
"grad_norm": 0.6152499730976357,
"learning_rate": 8.929829505424828e-07,
"loss": 0.7012,
"mean_token_accuracy": 0.8111869037151337,
"num_tokens": 1071914954.0,
"step": 12100
},
{
"entropy": 0.968359375,
"epoch": 1.6550946490808447,
"grad_norm": 0.6501059956502043,
"learning_rate": 8.894603353529662e-07,
"loss": 0.6653,
"mean_token_accuracy": 0.8195156037807465,
"num_tokens": 1072794976.0,
"step": 12110
},
{
"entropy": 0.9673828125,
"epoch": 1.6564614228114536,
"grad_norm": 0.6300615719115146,
"learning_rate": 8.859377201634495e-07,
"loss": 0.6714,
"mean_token_accuracy": 0.8164879888296127,
"num_tokens": 1073716171.0,
"step": 12120
},
{
"entropy": 1.03828125,
"epoch": 1.6578281965420625,
"grad_norm": 0.6611924681129763,
"learning_rate": 8.824151049739326e-07,
"loss": 0.746,
"mean_token_accuracy": 0.7996961534023285,
"num_tokens": 1074611877.0,
"step": 12130
},
{
"entropy": 0.9505859375,
"epoch": 1.6591949702726714,
"grad_norm": 0.6824334757582261,
"learning_rate": 8.788924897844161e-07,
"loss": 0.6669,
"mean_token_accuracy": 0.8187736958265305,
"num_tokens": 1075528862.0,
"step": 12140
},
{
"entropy": 0.9609375,
"epoch": 1.6605617440032803,
"grad_norm": 0.6942233571981051,
"learning_rate": 8.753698745948994e-07,
"loss": 0.6766,
"mean_token_accuracy": 0.8162683337926865,
"num_tokens": 1076437769.0,
"step": 12150
},
{
"entropy": 0.9607421875,
"epoch": 1.6619285177338892,
"grad_norm": 0.6843219246672874,
"learning_rate": 8.718472594053825e-07,
"loss": 0.6647,
"mean_token_accuracy": 0.8175890415906906,
"num_tokens": 1077282147.0,
"step": 12160
},
{
"entropy": 1.0009765625,
"epoch": 1.663295291464498,
"grad_norm": 0.7084256205673699,
"learning_rate": 8.683246442158659e-07,
"loss": 0.7111,
"mean_token_accuracy": 0.8108899891376495,
"num_tokens": 1078141716.0,
"step": 12170
},
{
"entropy": 0.979296875,
"epoch": 1.664662065195107,
"grad_norm": 0.6253211700612913,
"learning_rate": 8.648020290263492e-07,
"loss": 0.6661,
"mean_token_accuracy": 0.8185211956501007,
"num_tokens": 1078987019.0,
"step": 12180
},
{
"entropy": 0.9966796875,
"epoch": 1.6660288389257158,
"grad_norm": 0.7362925935787727,
"learning_rate": 8.612794138368325e-07,
"loss": 0.6987,
"mean_token_accuracy": 0.8124189108610154,
"num_tokens": 1079883292.0,
"step": 12190
},
{
"entropy": 0.9966796875,
"epoch": 1.6673956126563247,
"grad_norm": 0.7188716564788808,
"learning_rate": 8.577567986473158e-07,
"loss": 0.6949,
"mean_token_accuracy": 0.8137042582035064,
"num_tokens": 1080734797.0,
"step": 12200
},
{
"entropy": 0.9697265625,
"epoch": 1.6687623863869336,
"grad_norm": 0.715077508453888,
"learning_rate": 8.542341834577991e-07,
"loss": 0.676,
"mean_token_accuracy": 0.8171851009130477,
"num_tokens": 1081602784.0,
"step": 12210
},
{
"entropy": 0.973828125,
"epoch": 1.6701291601175425,
"grad_norm": 0.6940166260596656,
"learning_rate": 8.507115682682824e-07,
"loss": 0.6922,
"mean_token_accuracy": 0.8134889125823974,
"num_tokens": 1082468814.0,
"step": 12220
},
{
"entropy": 1.007421875,
"epoch": 1.6714959338481514,
"grad_norm": 0.7624470125188934,
"learning_rate": 8.471889530787658e-07,
"loss": 0.7485,
"mean_token_accuracy": 0.8021373957395553,
"num_tokens": 1083378491.0,
"step": 12230
},
{
"entropy": 0.9791015625,
"epoch": 1.6728627075787603,
"grad_norm": 0.6746945572549455,
"learning_rate": 8.43666337889249e-07,
"loss": 0.6866,
"mean_token_accuracy": 0.816061070561409,
"num_tokens": 1084256436.0,
"step": 12240
},
{
"entropy": 0.965625,
"epoch": 1.6742294813093692,
"grad_norm": 0.6236400469250156,
"learning_rate": 8.401437226997323e-07,
"loss": 0.7032,
"mean_token_accuracy": 0.812015226483345,
"num_tokens": 1085167492.0,
"step": 12250
},
{
"entropy": 0.987109375,
"epoch": 1.675596255039978,
"grad_norm": 0.7026873948830076,
"learning_rate": 8.366211075102157e-07,
"loss": 0.6859,
"mean_token_accuracy": 0.8141325563192368,
"num_tokens": 1085994348.0,
"step": 12260
},
{
"entropy": 0.9728515625,
"epoch": 1.676963028770587,
"grad_norm": 0.6933117697359946,
"learning_rate": 8.330984923206989e-07,
"loss": 0.6824,
"mean_token_accuracy": 0.815504041314125,
"num_tokens": 1086909354.0,
"step": 12270
},
{
"entropy": 0.99453125,
"epoch": 1.678329802501196,
"grad_norm": 0.6766955084744052,
"learning_rate": 8.295758771311822e-07,
"loss": 0.6983,
"mean_token_accuracy": 0.8113291233777999,
"num_tokens": 1087731177.0,
"step": 12280
},
{
"entropy": 0.9818359375,
"epoch": 1.6796965762318048,
"grad_norm": 0.5949041140030672,
"learning_rate": 8.260532619416656e-07,
"loss": 0.705,
"mean_token_accuracy": 0.8115957736968994,
"num_tokens": 1088587754.0,
"step": 12290
},
{
"entropy": 0.97265625,
"epoch": 1.6810633499624137,
"grad_norm": 0.6356839661506778,
"learning_rate": 8.225306467521489e-07,
"loss": 0.6596,
"mean_token_accuracy": 0.8214329928159714,
"num_tokens": 1089479095.0,
"step": 12300
},
{
"entropy": 0.9923828125,
"epoch": 1.6824301236930226,
"grad_norm": 0.6974674039369607,
"learning_rate": 8.190080315626321e-07,
"loss": 0.713,
"mean_token_accuracy": 0.8087830692529678,
"num_tokens": 1090337044.0,
"step": 12310
},
{
"entropy": 0.9861328125,
"epoch": 1.6837968974236315,
"grad_norm": 0.6474590811529385,
"learning_rate": 8.154854163731155e-07,
"loss": 0.6942,
"mean_token_accuracy": 0.8134057998657227,
"num_tokens": 1091244361.0,
"step": 12320
},
{
"entropy": 0.9994140625,
"epoch": 1.6851636711542404,
"grad_norm": 0.7455540589148902,
"learning_rate": 8.119628011835988e-07,
"loss": 0.7228,
"mean_token_accuracy": 0.8050553858280182,
"num_tokens": 1092118184.0,
"step": 12330
},
{
"entropy": 0.9701171875,
"epoch": 1.6865304448848493,
"grad_norm": 0.6319388338710064,
"learning_rate": 8.084401859940821e-07,
"loss": 0.6752,
"mean_token_accuracy": 0.8139030992984772,
"num_tokens": 1092980010.0,
"step": 12340
},
{
"entropy": 0.998046875,
"epoch": 1.6878972186154582,
"grad_norm": 0.6761679055559789,
"learning_rate": 8.049175708045654e-07,
"loss": 0.7178,
"mean_token_accuracy": 0.8082813113927841,
"num_tokens": 1093871943.0,
"step": 12350
},
{
"entropy": 0.9708984375,
"epoch": 1.689263992346067,
"grad_norm": 0.5996753134726202,
"learning_rate": 8.013949556150487e-07,
"loss": 0.6815,
"mean_token_accuracy": 0.8141068190336227,
"num_tokens": 1094708515.0,
"step": 12360
},
{
"entropy": 0.971875,
"epoch": 1.690630766076676,
"grad_norm": 0.7115726236695408,
"learning_rate": 7.97872340425532e-07,
"loss": 0.6912,
"mean_token_accuracy": 0.8127671331167221,
"num_tokens": 1095605283.0,
"step": 12370
},
{
"entropy": 0.99375,
"epoch": 1.6919975398072848,
"grad_norm": 0.8072489695823932,
"learning_rate": 7.943497252360153e-07,
"loss": 0.7341,
"mean_token_accuracy": 0.8045919865369797,
"num_tokens": 1096471521.0,
"step": 12380
},
{
"entropy": 1.008203125,
"epoch": 1.6933643135378937,
"grad_norm": 0.6993920895421085,
"learning_rate": 7.908271100464986e-07,
"loss": 0.7674,
"mean_token_accuracy": 0.7942608684301377,
"num_tokens": 1097380895.0,
"step": 12390
},
{
"entropy": 0.9978515625,
"epoch": 1.6947310872685026,
"grad_norm": 0.698363255562028,
"learning_rate": 7.873044948569819e-07,
"loss": 0.6998,
"mean_token_accuracy": 0.8119717031717301,
"num_tokens": 1098264769.0,
"step": 12400
},
{
"entropy": 1.0076171875,
"epoch": 1.6960978609991115,
"grad_norm": 0.6750435175154219,
"learning_rate": 7.837818796674653e-07,
"loss": 0.7005,
"mean_token_accuracy": 0.8113796025514602,
"num_tokens": 1099166534.0,
"step": 12410
},
{
"entropy": 0.9794921875,
"epoch": 1.6974646347297204,
"grad_norm": 0.7754708081448448,
"learning_rate": 7.802592644779484e-07,
"loss": 0.6675,
"mean_token_accuracy": 0.8169810116291046,
"num_tokens": 1100092895.0,
"step": 12420
},
{
"entropy": 0.99296875,
"epoch": 1.6988314084603293,
"grad_norm": 0.7100294210336219,
"learning_rate": 7.767366492884317e-07,
"loss": 0.706,
"mean_token_accuracy": 0.8068255871534348,
"num_tokens": 1100961965.0,
"step": 12430
},
{
"entropy": 0.9673828125,
"epoch": 1.7001981821909382,
"grad_norm": 0.7097951991276095,
"learning_rate": 7.732140340989152e-07,
"loss": 0.7122,
"mean_token_accuracy": 0.8073020845651626,
"num_tokens": 1101887589.0,
"step": 12440
},
{
"entropy": 0.9916015625,
"epoch": 1.701564955921547,
"grad_norm": 0.691023964631853,
"learning_rate": 7.696914189093985e-07,
"loss": 0.6842,
"mean_token_accuracy": 0.8160337448120117,
"num_tokens": 1102768436.0,
"step": 12450
},
{
"entropy": 0.976953125,
"epoch": 1.702931729652156,
"grad_norm": 0.5753849240324386,
"learning_rate": 7.661688037198816e-07,
"loss": 0.7049,
"mean_token_accuracy": 0.8103340804576874,
"num_tokens": 1103662460.0,
"step": 12460
},
{
"entropy": 0.9583984375,
"epoch": 1.704298503382765,
"grad_norm": 0.6180059992121845,
"learning_rate": 7.62646188530365e-07,
"loss": 0.6552,
"mean_token_accuracy": 0.8207314282655715,
"num_tokens": 1104539373.0,
"step": 12470
},
{
"entropy": 0.93203125,
"epoch": 1.7056652771133738,
"grad_norm": 0.6301199290623966,
"learning_rate": 7.591235733408483e-07,
"loss": 0.6548,
"mean_token_accuracy": 0.8206787496805191,
"num_tokens": 1105434657.0,
"step": 12480
},
{
"entropy": 0.946484375,
"epoch": 1.7070320508439827,
"grad_norm": 0.7045709012156572,
"learning_rate": 7.556009581513315e-07,
"loss": 0.6741,
"mean_token_accuracy": 0.8164747148752213,
"num_tokens": 1106311018.0,
"step": 12490
},
{
"entropy": 0.9486328125,
"epoch": 1.7083988245745916,
"grad_norm": 0.658417576416753,
"learning_rate": 7.520783429618149e-07,
"loss": 0.645,
"mean_token_accuracy": 0.8235941052436828,
"num_tokens": 1107229488.0,
"step": 12500
},
{
"entropy": 0.94453125,
"epoch": 1.7097655983052005,
"grad_norm": 0.6486892385955564,
"learning_rate": 7.485557277722982e-07,
"loss": 0.6907,
"mean_token_accuracy": 0.8148349404335022,
"num_tokens": 1108129586.0,
"step": 12510
},
{
"entropy": 0.984375,
"epoch": 1.7111323720358094,
"grad_norm": 0.6595271877303205,
"learning_rate": 7.450331125827815e-07,
"loss": 0.7065,
"mean_token_accuracy": 0.808405289053917,
"num_tokens": 1109025467.0,
"step": 12520
},
{
"entropy": 1.001953125,
"epoch": 1.7124991457664183,
"grad_norm": 0.7021383574187899,
"learning_rate": 7.415104973932648e-07,
"loss": 0.7145,
"mean_token_accuracy": 0.8074663549661636,
"num_tokens": 1109928602.0,
"step": 12530
},
{
"entropy": 0.9515625,
"epoch": 1.7138659194970272,
"grad_norm": 0.6938695818310416,
"learning_rate": 7.379878822037481e-07,
"loss": 0.6407,
"mean_token_accuracy": 0.8222871124744415,
"num_tokens": 1110759388.0,
"step": 12540
},
{
"entropy": 1.0107421875,
"epoch": 1.715232693227636,
"grad_norm": 0.6898831596754071,
"learning_rate": 7.344652670142314e-07,
"loss": 0.7257,
"mean_token_accuracy": 0.8067269414663315,
"num_tokens": 1111652033.0,
"step": 12550
},
{
"entropy": 0.993359375,
"epoch": 1.716599466958245,
"grad_norm": 0.6237678011464771,
"learning_rate": 7.309426518247147e-07,
"loss": 0.7141,
"mean_token_accuracy": 0.8073635965585708,
"num_tokens": 1112559338.0,
"step": 12560
},
{
"entropy": 1.0015625,
"epoch": 1.7179662406888538,
"grad_norm": 0.6368627246476465,
"learning_rate": 7.27420036635198e-07,
"loss": 0.7045,
"mean_token_accuracy": 0.8102504342794419,
"num_tokens": 1113422543.0,
"step": 12570
},
{
"entropy": 1.008203125,
"epoch": 1.7193330144194627,
"grad_norm": 0.6938724449644283,
"learning_rate": 7.238974214456813e-07,
"loss": 0.7274,
"mean_token_accuracy": 0.8036054342985153,
"num_tokens": 1114320790.0,
"step": 12580
},
{
"entropy": 0.9896484375,
"epoch": 1.7206997881500716,
"grad_norm": 0.7004870213162495,
"learning_rate": 7.203748062561647e-07,
"loss": 0.6645,
"mean_token_accuracy": 0.8199347764253616,
"num_tokens": 1115279578.0,
"step": 12590
},
{
"entropy": 0.985546875,
"epoch": 1.7220665618806805,
"grad_norm": 0.6698688590968722,
"learning_rate": 7.168521910666479e-07,
"loss": 0.7174,
"mean_token_accuracy": 0.8103180438280105,
"num_tokens": 1116158991.0,
"step": 12600
},
{
"entropy": 0.9818359375,
"epoch": 1.7234333356112894,
"grad_norm": 0.67480945961024,
"learning_rate": 7.133295758771312e-07,
"loss": 0.7211,
"mean_token_accuracy": 0.8065048217773437,
"num_tokens": 1117041491.0,
"step": 12610
},
{
"entropy": 0.9671875,
"epoch": 1.7248001093418983,
"grad_norm": 0.6977039253064753,
"learning_rate": 7.098069606876146e-07,
"loss": 0.6982,
"mean_token_accuracy": 0.8113816767930985,
"num_tokens": 1117918004.0,
"step": 12620
},
{
"entropy": 0.944921875,
"epoch": 1.7261668830725072,
"grad_norm": 0.7533110998132613,
"learning_rate": 7.062843454980979e-07,
"loss": 0.6565,
"mean_token_accuracy": 0.8223623603582382,
"num_tokens": 1118785040.0,
"step": 12630
},
{
"entropy": 0.967578125,
"epoch": 1.727533656803116,
"grad_norm": 0.5959420070131333,
"learning_rate": 7.027617303085811e-07,
"loss": 0.6834,
"mean_token_accuracy": 0.8152470350265503,
"num_tokens": 1119691878.0,
"step": 12640
},
{
"entropy": 0.9673828125,
"epoch": 1.728900430533725,
"grad_norm": 0.7128070915072579,
"learning_rate": 6.992391151190645e-07,
"loss": 0.6701,
"mean_token_accuracy": 0.8186782628297806,
"num_tokens": 1120588565.0,
"step": 12650
},
{
"entropy": 1.0017578125,
"epoch": 1.730267204264334,
"grad_norm": 0.767092881780616,
"learning_rate": 6.957164999295478e-07,
"loss": 0.7139,
"mean_token_accuracy": 0.8088365882635117,
"num_tokens": 1121432713.0,
"step": 12660
},
{
"entropy": 0.9884765625,
"epoch": 1.7316339779949428,
"grad_norm": 0.6936601392418862,
"learning_rate": 6.921938847400309e-07,
"loss": 0.7077,
"mean_token_accuracy": 0.8068469017744064,
"num_tokens": 1122273894.0,
"step": 12670
},
{
"entropy": 0.9765625,
"epoch": 1.7330007517255517,
"grad_norm": 0.6908748062866857,
"learning_rate": 6.886712695505144e-07,
"loss": 0.6993,
"mean_token_accuracy": 0.8124866396188736,
"num_tokens": 1123187375.0,
"step": 12680
},
{
"entropy": 1.01015625,
"epoch": 1.7343675254561606,
"grad_norm": 0.6894148092015951,
"learning_rate": 6.851486543609977e-07,
"loss": 0.7418,
"mean_token_accuracy": 0.8036303758621216,
"num_tokens": 1124085975.0,
"step": 12690
},
{
"entropy": 1.0259765625,
"epoch": 1.7357342991867695,
"grad_norm": 0.653106514168987,
"learning_rate": 6.816260391714811e-07,
"loss": 0.7107,
"mean_token_accuracy": 0.8080219537019729,
"num_tokens": 1124957939.0,
"step": 12700
},
{
"entropy": 0.9818359375,
"epoch": 1.7371010729173784,
"grad_norm": 0.7071191037850414,
"learning_rate": 6.781034239819642e-07,
"loss": 0.7193,
"mean_token_accuracy": 0.8064363747835159,
"num_tokens": 1125845835.0,
"step": 12710
},
{
"entropy": 0.9716796875,
"epoch": 1.7384678466479875,
"grad_norm": 0.7125008582700688,
"learning_rate": 6.745808087924475e-07,
"loss": 0.6823,
"mean_token_accuracy": 0.8134805738925934,
"num_tokens": 1126726139.0,
"step": 12720
},
{
"entropy": 1.0134765625,
"epoch": 1.7398346203785964,
"grad_norm": 0.6804968512333612,
"learning_rate": 6.710581936029308e-07,
"loss": 0.691,
"mean_token_accuracy": 0.8127485632896423,
"num_tokens": 1127591299.0,
"step": 12730
},
{
"entropy": 0.9640625,
"epoch": 1.7412013941092053,
"grad_norm": 0.6775557957209662,
"learning_rate": 6.675355784134143e-07,
"loss": 0.6939,
"mean_token_accuracy": 0.8124170362949371,
"num_tokens": 1128505092.0,
"step": 12740
},
{
"entropy": 0.983984375,
"epoch": 1.7425681678398142,
"grad_norm": 0.678708224301204,
"learning_rate": 6.640129632238974e-07,
"loss": 0.6766,
"mean_token_accuracy": 0.8157808423042298,
"num_tokens": 1129395781.0,
"step": 12750
},
{
"entropy": 0.9943359375,
"epoch": 1.743934941570423,
"grad_norm": 0.6454816147925972,
"learning_rate": 6.604903480343807e-07,
"loss": 0.6875,
"mean_token_accuracy": 0.8119397521018982,
"num_tokens": 1130301530.0,
"step": 12760
},
{
"entropy": 0.963671875,
"epoch": 1.745301715301032,
"grad_norm": 0.7690748135766076,
"learning_rate": 6.569677328448641e-07,
"loss": 0.6901,
"mean_token_accuracy": 0.8141798675060272,
"num_tokens": 1131161646.0,
"step": 12770
},
{
"entropy": 0.9462890625,
"epoch": 1.7466684890316408,
"grad_norm": 0.6507149139186422,
"learning_rate": 6.534451176553473e-07,
"loss": 0.6646,
"mean_token_accuracy": 0.8199919193983078,
"num_tokens": 1132051345.0,
"step": 12780
},
{
"entropy": 0.9658203125,
"epoch": 1.7480352627622497,
"grad_norm": 0.6836402698542248,
"learning_rate": 6.499225024658306e-07,
"loss": 0.6996,
"mean_token_accuracy": 0.8107101887464523,
"num_tokens": 1132962042.0,
"step": 12790
},
{
"entropy": 0.9830078125,
"epoch": 1.7494020364928586,
"grad_norm": 0.6497681786177332,
"learning_rate": 6.46399887276314e-07,
"loss": 0.6669,
"mean_token_accuracy": 0.8183911681175232,
"num_tokens": 1133802402.0,
"step": 12800
},
{
"entropy": 1.02265625,
"epoch": 1.7507688102234675,
"grad_norm": 0.8238582348199669,
"learning_rate": 6.428772720867973e-07,
"loss": 0.7215,
"mean_token_accuracy": 0.805960550904274,
"num_tokens": 1134670099.0,
"step": 12810
},
{
"entropy": 0.96953125,
"epoch": 1.7521355839540764,
"grad_norm": 0.7069475792373839,
"learning_rate": 6.393546568972805e-07,
"loss": 0.6657,
"mean_token_accuracy": 0.8178022414445877,
"num_tokens": 1135525749.0,
"step": 12820
},
{
"entropy": 0.9998046875,
"epoch": 1.7535023576846853,
"grad_norm": 0.6535568515458505,
"learning_rate": 6.358320417077639e-07,
"loss": 0.7031,
"mean_token_accuracy": 0.8089333504438401,
"num_tokens": 1136407810.0,
"step": 12830
},
{
"entropy": 0.9669921875,
"epoch": 1.7548691314152942,
"grad_norm": 0.6678699870649419,
"learning_rate": 6.323094265182472e-07,
"loss": 0.6574,
"mean_token_accuracy": 0.818003261089325,
"num_tokens": 1137249574.0,
"step": 12840
},
{
"entropy": 0.9533203125,
"epoch": 1.756235905145903,
"grad_norm": 0.6211740366269195,
"learning_rate": 6.287868113287306e-07,
"loss": 0.6704,
"mean_token_accuracy": 0.8175321102142334,
"num_tokens": 1138164235.0,
"step": 12850
},
{
"entropy": 0.9619140625,
"epoch": 1.757602678876512,
"grad_norm": 0.6763504601105339,
"learning_rate": 6.252641961392138e-07,
"loss": 0.7001,
"mean_token_accuracy": 0.8120060175657272,
"num_tokens": 1139067214.0,
"step": 12860
},
{
"entropy": 0.9265625,
"epoch": 1.758969452607121,
"grad_norm": 0.662542574961193,
"learning_rate": 6.217415809496971e-07,
"loss": 0.659,
"mean_token_accuracy": 0.8207195669412612,
"num_tokens": 1139953795.0,
"step": 12870
},
{
"entropy": 0.9890625,
"epoch": 1.7603362263377298,
"grad_norm": 0.6769675725190332,
"learning_rate": 6.182189657601804e-07,
"loss": 0.7263,
"mean_token_accuracy": 0.8066204816102982,
"num_tokens": 1140862640.0,
"step": 12880
},
{
"entropy": 0.97578125,
"epoch": 1.7617030000683387,
"grad_norm": 0.7201297890704201,
"learning_rate": 6.146963505706637e-07,
"loss": 0.6811,
"mean_token_accuracy": 0.8160328775644302,
"num_tokens": 1141743254.0,
"step": 12890
},
{
"entropy": 0.9765625,
"epoch": 1.7630697737989476,
"grad_norm": 0.6208269972768949,
"learning_rate": 6.11173735381147e-07,
"loss": 0.733,
"mean_token_accuracy": 0.804643589258194,
"num_tokens": 1142600515.0,
"step": 12900
},
{
"entropy": 1.0052734375,
"epoch": 1.7644365475295565,
"grad_norm": 0.6296056996066749,
"learning_rate": 6.076511201916304e-07,
"loss": 0.7169,
"mean_token_accuracy": 0.8098845213651658,
"num_tokens": 1143475412.0,
"step": 12910
},
{
"entropy": 0.98203125,
"epoch": 1.7658033212601654,
"grad_norm": 0.7925704052325199,
"learning_rate": 6.041285050021136e-07,
"loss": 0.7126,
"mean_token_accuracy": 0.8040048986673355,
"num_tokens": 1144302196.0,
"step": 12920
},
{
"entropy": 1.0013671875,
"epoch": 1.7671700949907743,
"grad_norm": 0.6372537173695464,
"learning_rate": 6.006058898125969e-07,
"loss": 0.6974,
"mean_token_accuracy": 0.8118223279714585,
"num_tokens": 1145232557.0,
"step": 12930
},
{
"entropy": 1.008203125,
"epoch": 1.7685368687213832,
"grad_norm": 0.6930931172742063,
"learning_rate": 5.970832746230803e-07,
"loss": 0.7312,
"mean_token_accuracy": 0.8056265652179718,
"num_tokens": 1146194324.0,
"step": 12940
},
{
"entropy": 0.991796875,
"epoch": 1.769903642451992,
"grad_norm": 0.7056419604585832,
"learning_rate": 5.935606594335636e-07,
"loss": 0.6815,
"mean_token_accuracy": 0.8160041928291321,
"num_tokens": 1147126259.0,
"step": 12950
},
{
"entropy": 0.9830078125,
"epoch": 1.771270416182601,
"grad_norm": 0.6644132919864333,
"learning_rate": 5.900380442440468e-07,
"loss": 0.7009,
"mean_token_accuracy": 0.8142157644033432,
"num_tokens": 1147998971.0,
"step": 12960
},
{
"entropy": 1.0162109375,
"epoch": 1.7726371899132098,
"grad_norm": 0.6852071361717903,
"learning_rate": 5.8651542905453e-07,
"loss": 0.7612,
"mean_token_accuracy": 0.7997553199529648,
"num_tokens": 1148904341.0,
"step": 12970
},
{
"entropy": 0.965625,
"epoch": 1.7740039636438187,
"grad_norm": 0.697689303968472,
"learning_rate": 5.829928138650135e-07,
"loss": 0.6826,
"mean_token_accuracy": 0.8164666175842286,
"num_tokens": 1149783289.0,
"step": 12980
},
{
"entropy": 0.97578125,
"epoch": 1.7753707373744276,
"grad_norm": 0.6404568056890466,
"learning_rate": 5.794701986754967e-07,
"loss": 0.6687,
"mean_token_accuracy": 0.8186692327260972,
"num_tokens": 1150669938.0,
"step": 12990
},
{
"entropy": 0.9951171875,
"epoch": 1.7767375111050365,
"grad_norm": 0.6825043613185973,
"learning_rate": 5.759475834859801e-07,
"loss": 0.6993,
"mean_token_accuracy": 0.8122649759054184,
"num_tokens": 1151559575.0,
"step": 13000
},
{
"entropy": 1.0197265625,
"epoch": 1.7781042848356454,
"grad_norm": 0.6941779844913275,
"learning_rate": 5.724249682964633e-07,
"loss": 0.735,
"mean_token_accuracy": 0.8028265446424484,
"num_tokens": 1152414438.0,
"step": 13010
},
{
"entropy": 0.9916015625,
"epoch": 1.7794710585662543,
"grad_norm": 0.6818765983567425,
"learning_rate": 5.689023531069466e-07,
"loss": 0.6788,
"mean_token_accuracy": 0.8143812417984009,
"num_tokens": 1153345079.0,
"step": 13020
},
{
"entropy": 0.98671875,
"epoch": 1.7808378322968632,
"grad_norm": 0.6763363866761671,
"learning_rate": 5.6537973791743e-07,
"loss": 0.7011,
"mean_token_accuracy": 0.8104726672172546,
"num_tokens": 1154226611.0,
"step": 13030
},
{
"entropy": 0.9484375,
"epoch": 1.782204606027472,
"grad_norm": 0.6208922591714701,
"learning_rate": 5.618571227279133e-07,
"loss": 0.6926,
"mean_token_accuracy": 0.8143470853567123,
"num_tokens": 1155145591.0,
"step": 13040
},
{
"entropy": 0.92890625,
"epoch": 1.783571379758081,
"grad_norm": 0.7138387726490485,
"learning_rate": 5.583345075383965e-07,
"loss": 0.6716,
"mean_token_accuracy": 0.8163003325462341,
"num_tokens": 1156065067.0,
"step": 13050
},
{
"entropy": 0.9744140625,
"epoch": 1.78493815348869,
"grad_norm": 0.7215139867743996,
"learning_rate": 5.548118923488799e-07,
"loss": 0.6432,
"mean_token_accuracy": 0.8238449990749359,
"num_tokens": 1156911394.0,
"step": 13060
},
{
"entropy": 0.9689453125,
"epoch": 1.786304927219299,
"grad_norm": 0.6491705785654512,
"learning_rate": 5.512892771593632e-07,
"loss": 0.6624,
"mean_token_accuracy": 0.8196566134691239,
"num_tokens": 1157807466.0,
"step": 13070
},
{
"entropy": 1.0197265625,
"epoch": 1.787671700949908,
"grad_norm": 0.5668858224741024,
"learning_rate": 5.477666619698464e-07,
"loss": 0.7484,
"mean_token_accuracy": 0.8017058432102203,
"num_tokens": 1158708008.0,
"step": 13080
},
{
"entropy": 0.9998046875,
"epoch": 1.7890384746805168,
"grad_norm": 0.6313743484278773,
"learning_rate": 5.442440467803298e-07,
"loss": 0.7013,
"mean_token_accuracy": 0.8090007692575455,
"num_tokens": 1159583725.0,
"step": 13090
},
{
"entropy": 0.9994140625,
"epoch": 1.7904052484111257,
"grad_norm": 0.7274888024384116,
"learning_rate": 5.407214315908131e-07,
"loss": 0.6681,
"mean_token_accuracy": 0.8170915126800538,
"num_tokens": 1160491493.0,
"step": 13100
},
{
"entropy": 0.9830078125,
"epoch": 1.7917720221417346,
"grad_norm": 0.6768450901668307,
"learning_rate": 5.371988164012964e-07,
"loss": 0.7213,
"mean_token_accuracy": 0.8047533601522445,
"num_tokens": 1161409970.0,
"step": 13110
},
{
"entropy": 0.9439453125,
"epoch": 1.7931387958723435,
"grad_norm": 0.6010455651129447,
"learning_rate": 5.336762012117797e-07,
"loss": 0.6643,
"mean_token_accuracy": 0.8185744911432267,
"num_tokens": 1162313347.0,
"step": 13120
},
{
"entropy": 0.9951171875,
"epoch": 1.7945055696029524,
"grad_norm": 0.7216280542549083,
"learning_rate": 5.30153586022263e-07,
"loss": 0.6921,
"mean_token_accuracy": 0.8130727887153626,
"num_tokens": 1163220881.0,
"step": 13130
},
{
"entropy": 0.98515625,
"epoch": 1.7958723433335613,
"grad_norm": 0.6072842850598447,
"learning_rate": 5.266309708327462e-07,
"loss": 0.6933,
"mean_token_accuracy": 0.8122229725122452,
"num_tokens": 1164094809.0,
"step": 13140
},
{
"entropy": 0.95546875,
"epoch": 1.7972391170641702,
"grad_norm": 0.6437737867519574,
"learning_rate": 5.231083556432296e-07,
"loss": 0.6589,
"mean_token_accuracy": 0.8227998316287994,
"num_tokens": 1164971338.0,
"step": 13150
},
{
"entropy": 0.995703125,
"epoch": 1.798605890794779,
"grad_norm": 0.6740301540502165,
"learning_rate": 5.195857404537129e-07,
"loss": 0.767,
"mean_token_accuracy": 0.8057633012533187,
"num_tokens": 1165850482.0,
"step": 13160
},
{
"entropy": 1.00234375,
"epoch": 1.799972664525388,
"grad_norm": 0.7254129080186428,
"learning_rate": 5.160631252641961e-07,
"loss": 0.6817,
"mean_token_accuracy": 0.8168113619089127,
"num_tokens": 1166706374.0,
"step": 13170
},
{
"entropy": 0.96640625,
"epoch": 1.8013394382559968,
"grad_norm": 0.7820821576512458,
"learning_rate": 5.125405100746795e-07,
"loss": 0.6946,
"mean_token_accuracy": 0.8138265401124954,
"num_tokens": 1167624146.0,
"step": 13180
},
{
"entropy": 0.9853515625,
"epoch": 1.8027062119866057,
"grad_norm": 0.6934007958334878,
"learning_rate": 5.090178948851628e-07,
"loss": 0.7316,
"mean_token_accuracy": 0.8035278916358948,
"num_tokens": 1168541396.0,
"step": 13190
},
{
"entropy": 1.019140625,
"epoch": 1.8040729857172146,
"grad_norm": 0.7437430824419655,
"learning_rate": 5.054952796956461e-07,
"loss": 0.7252,
"mean_token_accuracy": 0.804707270860672,
"num_tokens": 1169402817.0,
"step": 13200
},
{
"entropy": 0.9513671875,
"epoch": 1.8054397594478235,
"grad_norm": 0.6750184119185996,
"learning_rate": 5.019726645061294e-07,
"loss": 0.631,
"mean_token_accuracy": 0.8273216128349304,
"num_tokens": 1170317297.0,
"step": 13210
},
{
"entropy": 1.009375,
"epoch": 1.8068065331784324,
"grad_norm": 0.7781721812995487,
"learning_rate": 4.984500493166127e-07,
"loss": 0.698,
"mean_token_accuracy": 0.8121198117733002,
"num_tokens": 1171217665.0,
"step": 13220
},
{
"entropy": 0.9375,
"epoch": 1.8081733069090413,
"grad_norm": 0.6771593095203694,
"learning_rate": 4.94927434127096e-07,
"loss": 0.6339,
"mean_token_accuracy": 0.826965457201004,
"num_tokens": 1172087543.0,
"step": 13230
},
{
"entropy": 0.9607421875,
"epoch": 1.8095400806396502,
"grad_norm": 0.7485463798623734,
"learning_rate": 4.914048189375794e-07,
"loss": 0.7058,
"mean_token_accuracy": 0.809960201382637,
"num_tokens": 1172967896.0,
"step": 13240
},
{
"entropy": 0.99765625,
"epoch": 1.8109068543702591,
"grad_norm": 0.6903301699704419,
"learning_rate": 4.878822037480626e-07,
"loss": 0.7088,
"mean_token_accuracy": 0.8097019761800766,
"num_tokens": 1173765974.0,
"step": 13250
},
{
"entropy": 0.9705078125,
"epoch": 1.812273628100868,
"grad_norm": 0.6571373766683024,
"learning_rate": 4.843595885585459e-07,
"loss": 0.6971,
"mean_token_accuracy": 0.8123333483934403,
"num_tokens": 1174621145.0,
"step": 13260
},
{
"entropy": 0.9873046875,
"epoch": 1.813640401831477,
"grad_norm": 0.7778476863433117,
"learning_rate": 4.808369733690292e-07,
"loss": 0.7167,
"mean_token_accuracy": 0.8076666802167892,
"num_tokens": 1175529749.0,
"step": 13270
},
{
"entropy": 1.0177734375,
"epoch": 1.8150071755620858,
"grad_norm": 0.7074646410384727,
"learning_rate": 4.773143581795125e-07,
"loss": 0.7713,
"mean_token_accuracy": 0.7985436320304871,
"num_tokens": 1176461343.0,
"step": 13280
},
{
"entropy": 0.941015625,
"epoch": 1.8163739492926947,
"grad_norm": 0.6652483954621968,
"learning_rate": 4.7379174298999583e-07,
"loss": 0.6546,
"mean_token_accuracy": 0.8212218075990677,
"num_tokens": 1177334280.0,
"step": 13290
},
{
"entropy": 0.9818359375,
"epoch": 1.8177407230233036,
"grad_norm": 0.7092144046391745,
"learning_rate": 4.702691278004791e-07,
"loss": 0.7052,
"mean_token_accuracy": 0.8115645825862885,
"num_tokens": 1178258174.0,
"step": 13300
},
{
"entropy": 0.95859375,
"epoch": 1.8191074967539125,
"grad_norm": 0.7755540210848789,
"learning_rate": 4.6674651261096245e-07,
"loss": 0.6731,
"mean_token_accuracy": 0.8175948739051819,
"num_tokens": 1179152856.0,
"step": 13310
},
{
"entropy": 0.946875,
"epoch": 1.8204742704845214,
"grad_norm": 0.69755298817589,
"learning_rate": 4.632238974214457e-07,
"loss": 0.6727,
"mean_token_accuracy": 0.81864815056324,
"num_tokens": 1180048625.0,
"step": 13320
},
{
"entropy": 0.9482421875,
"epoch": 1.8218410442151303,
"grad_norm": 0.6326335838529965,
"learning_rate": 4.5970128223192907e-07,
"loss": 0.6758,
"mean_token_accuracy": 0.8170569270849228,
"num_tokens": 1180938231.0,
"step": 13330
},
{
"entropy": 0.945703125,
"epoch": 1.8232078179457392,
"grad_norm": 0.6423835867322417,
"learning_rate": 4.561786670424123e-07,
"loss": 0.6586,
"mean_token_accuracy": 0.8183814853429794,
"num_tokens": 1181813930.0,
"step": 13340
},
{
"entropy": 0.9833984375,
"epoch": 1.824574591676348,
"grad_norm": 0.6918157267074185,
"learning_rate": 4.5265605185289563e-07,
"loss": 0.6782,
"mean_token_accuracy": 0.8155237317085267,
"num_tokens": 1182727375.0,
"step": 13350
},
{
"entropy": 0.96640625,
"epoch": 1.825941365406957,
"grad_norm": 0.6501200507981219,
"learning_rate": 4.491334366633789e-07,
"loss": 0.6772,
"mean_token_accuracy": 0.8151814192533493,
"num_tokens": 1183623201.0,
"step": 13360
},
{
"entropy": 0.98515625,
"epoch": 1.8273081391375658,
"grad_norm": 0.7011268736284346,
"learning_rate": 4.456108214738622e-07,
"loss": 0.7013,
"mean_token_accuracy": 0.812212559580803,
"num_tokens": 1184513685.0,
"step": 13370
},
{
"entropy": 0.9697265625,
"epoch": 1.8286749128681747,
"grad_norm": 0.740707171459844,
"learning_rate": 4.4208820628434553e-07,
"loss": 0.69,
"mean_token_accuracy": 0.8125347405672073,
"num_tokens": 1185400077.0,
"step": 13380
},
{
"entropy": 1.0025390625,
"epoch": 1.8300416865987836,
"grad_norm": 0.6982389582396319,
"learning_rate": 4.385655910948288e-07,
"loss": 0.7386,
"mean_token_accuracy": 0.8010128647089004,
"num_tokens": 1186291424.0,
"step": 13390
},
{
"entropy": 0.991796875,
"epoch": 1.8314084603293925,
"grad_norm": 0.6947517872942133,
"learning_rate": 4.3504297590531215e-07,
"loss": 0.7481,
"mean_token_accuracy": 0.8026941329240799,
"num_tokens": 1187194562.0,
"step": 13400
},
{
"entropy": 0.943359375,
"epoch": 1.8327752340600014,
"grad_norm": 0.7007161423238415,
"learning_rate": 4.3152036071579543e-07,
"loss": 0.6846,
"mean_token_accuracy": 0.8177343755960464,
"num_tokens": 1188098751.0,
"step": 13410
},
{
"entropy": 0.9423828125,
"epoch": 1.8341420077906103,
"grad_norm": 0.6719115413527987,
"learning_rate": 4.2799774552627877e-07,
"loss": 0.6726,
"mean_token_accuracy": 0.8173468470573425,
"num_tokens": 1189005385.0,
"step": 13420
},
{
"entropy": 0.9517578125,
"epoch": 1.8355087815212192,
"grad_norm": 0.7820632153091691,
"learning_rate": 4.2447513033676205e-07,
"loss": 0.6818,
"mean_token_accuracy": 0.8145106852054596,
"num_tokens": 1189882489.0,
"step": 13430
},
{
"entropy": 0.9796875,
"epoch": 1.836875555251828,
"grad_norm": 0.7167805013651437,
"learning_rate": 4.209525151472454e-07,
"loss": 0.6916,
"mean_token_accuracy": 0.8134369194507599,
"num_tokens": 1190750704.0,
"step": 13440
},
{
"entropy": 0.997265625,
"epoch": 1.838242328982437,
"grad_norm": 0.7323037228819883,
"learning_rate": 4.1742989995772867e-07,
"loss": 0.7273,
"mean_token_accuracy": 0.8042553007602692,
"num_tokens": 1191660625.0,
"step": 13450
},
{
"entropy": 1.0150390625,
"epoch": 1.839609102713046,
"grad_norm": 0.6974643249478235,
"learning_rate": 4.13907284768212e-07,
"loss": 0.7275,
"mean_token_accuracy": 0.80511654317379,
"num_tokens": 1192508000.0,
"step": 13460
},
{
"entropy": 1.0173828125,
"epoch": 1.8409758764436548,
"grad_norm": 0.7234446762433636,
"learning_rate": 4.1038466957869523e-07,
"loss": 0.6943,
"mean_token_accuracy": 0.8128799229860306,
"num_tokens": 1193362849.0,
"step": 13470
},
{
"entropy": 0.977734375,
"epoch": 1.8423426501742637,
"grad_norm": 0.6728212792176204,
"learning_rate": 4.068620543891785e-07,
"loss": 0.6959,
"mean_token_accuracy": 0.8120154052972793,
"num_tokens": 1194316124.0,
"step": 13480
},
{
"entropy": 0.9791015625,
"epoch": 1.8437094239048726,
"grad_norm": 0.6843881957203398,
"learning_rate": 4.0333943919966185e-07,
"loss": 0.7182,
"mean_token_accuracy": 0.8067003071308136,
"num_tokens": 1195255727.0,
"step": 13490
},
{
"entropy": 0.9541015625,
"epoch": 1.8450761976354815,
"grad_norm": 0.69249910724842,
"learning_rate": 3.9981682401014513e-07,
"loss": 0.6745,
"mean_token_accuracy": 0.8154380172491074,
"num_tokens": 1196182466.0,
"step": 13500
},
{
"entropy": 0.941015625,
"epoch": 1.8464429713660904,
"grad_norm": 0.6330324312173866,
"learning_rate": 3.9629420882062847e-07,
"loss": 0.6571,
"mean_token_accuracy": 0.8196510314941406,
"num_tokens": 1197059992.0,
"step": 13510
},
{
"entropy": 0.992578125,
"epoch": 1.8478097450966993,
"grad_norm": 0.6537266755237695,
"learning_rate": 3.9277159363111175e-07,
"loss": 0.6919,
"mean_token_accuracy": 0.8128938347101211,
"num_tokens": 1197948995.0,
"step": 13520
},
{
"entropy": 0.9734375,
"epoch": 1.8491765188273082,
"grad_norm": 0.7014821992146262,
"learning_rate": 3.892489784415951e-07,
"loss": 0.6947,
"mean_token_accuracy": 0.8116584062576294,
"num_tokens": 1198824386.0,
"step": 13530
},
{
"entropy": 1.001171875,
"epoch": 1.850543292557917,
"grad_norm": 0.7508111426265951,
"learning_rate": 3.8572636325207837e-07,
"loss": 0.7149,
"mean_token_accuracy": 0.8079665869474411,
"num_tokens": 1199644308.0,
"step": 13540
},
{
"entropy": 1.0234375,
"epoch": 1.851910066288526,
"grad_norm": 0.6935088786998491,
"learning_rate": 3.822037480625617e-07,
"loss": 0.6951,
"mean_token_accuracy": 0.8127709865570069,
"num_tokens": 1200529892.0,
"step": 13550
},
{
"entropy": 0.94375,
"epoch": 1.8532768400191348,
"grad_norm": 0.6497597806243263,
"learning_rate": 3.78681132873045e-07,
"loss": 0.6547,
"mean_token_accuracy": 0.8219240546226502,
"num_tokens": 1201485843.0,
"step": 13560
},
{
"entropy": 0.9953125,
"epoch": 1.8546436137497437,
"grad_norm": 0.6109111249768251,
"learning_rate": 3.7515851768352827e-07,
"loss": 0.7021,
"mean_token_accuracy": 0.8111816883087158,
"num_tokens": 1202365458.0,
"step": 13570
},
{
"entropy": 1.021484375,
"epoch": 1.8560103874803526,
"grad_norm": 0.7652247869477131,
"learning_rate": 3.716359024940116e-07,
"loss": 0.7094,
"mean_token_accuracy": 0.8080085068941116,
"num_tokens": 1203210624.0,
"step": 13580
},
{
"entropy": 1.0013671875,
"epoch": 1.8573771612109615,
"grad_norm": 0.7287844588005301,
"learning_rate": 3.6811328730449484e-07,
"loss": 0.701,
"mean_token_accuracy": 0.8100574910640717,
"num_tokens": 1204109870.0,
"step": 13590
},
{
"entropy": 0.9908203125,
"epoch": 1.8587439349415704,
"grad_norm": 0.6625101144068285,
"learning_rate": 3.645906721149782e-07,
"loss": 0.6642,
"mean_token_accuracy": 0.8194047600030899,
"num_tokens": 1204941911.0,
"step": 13600
},
{
"entropy": 1.0046875,
"epoch": 1.8601107086721793,
"grad_norm": 0.6721139445232838,
"learning_rate": 3.6106805692546145e-07,
"loss": 0.6958,
"mean_token_accuracy": 0.8131987631320954,
"num_tokens": 1205867891.0,
"step": 13610
},
{
"entropy": 1.002734375,
"epoch": 1.8614774824027882,
"grad_norm": 0.6826319345105415,
"learning_rate": 3.575454417359448e-07,
"loss": 0.6979,
"mean_token_accuracy": 0.8129887193441391,
"num_tokens": 1206743074.0,
"step": 13620
},
{
"entropy": 0.98359375,
"epoch": 1.862844256133397,
"grad_norm": 0.6688055558771366,
"learning_rate": 3.5402282654642807e-07,
"loss": 0.6519,
"mean_token_accuracy": 0.8220505267381668,
"num_tokens": 1207606486.0,
"step": 13630
},
{
"entropy": 0.9744140625,
"epoch": 1.864211029864006,
"grad_norm": 0.6602852008145589,
"learning_rate": 3.505002113569114e-07,
"loss": 0.7196,
"mean_token_accuracy": 0.8067003875970841,
"num_tokens": 1208513818.0,
"step": 13640
},
{
"entropy": 1.0021484375,
"epoch": 1.865577803594615,
"grad_norm": 0.7586002603466514,
"learning_rate": 3.469775961673947e-07,
"loss": 0.7034,
"mean_token_accuracy": 0.8116218835115433,
"num_tokens": 1209364561.0,
"step": 13650
},
{
"entropy": 0.9576171875,
"epoch": 1.8669445773252238,
"grad_norm": 0.624662907311726,
"learning_rate": 3.43454980977878e-07,
"loss": 0.6799,
"mean_token_accuracy": 0.8175628453493118,
"num_tokens": 1210238798.0,
"step": 13660
},
{
"entropy": 1.005859375,
"epoch": 1.8683113510558327,
"grad_norm": 0.6958514420607649,
"learning_rate": 3.399323657883613e-07,
"loss": 0.7015,
"mean_token_accuracy": 0.8095487475395202,
"num_tokens": 1211114581.0,
"step": 13670
},
{
"entropy": 1.001171875,
"epoch": 1.8696781247864416,
"grad_norm": 0.6631287000452734,
"learning_rate": 3.364097505988446e-07,
"loss": 0.7243,
"mean_token_accuracy": 0.8057919085025788,
"num_tokens": 1212024219.0,
"step": 13680
},
{
"entropy": 0.9861328125,
"epoch": 1.8710448985170505,
"grad_norm": 0.6500493674320779,
"learning_rate": 3.328871354093279e-07,
"loss": 0.6989,
"mean_token_accuracy": 0.8097725629806518,
"num_tokens": 1212946824.0,
"step": 13690
},
{
"entropy": 0.996875,
"epoch": 1.8724116722476594,
"grad_norm": 0.682911268606318,
"learning_rate": 3.293645202198112e-07,
"loss": 0.7208,
"mean_token_accuracy": 0.8059265494346619,
"num_tokens": 1213839645.0,
"step": 13700
},
{
"entropy": 0.9908203125,
"epoch": 1.8737784459782683,
"grad_norm": 0.6302638979797057,
"learning_rate": 3.2584190503029454e-07,
"loss": 0.6955,
"mean_token_accuracy": 0.8127769470214844,
"num_tokens": 1214692776.0,
"step": 13710
},
{
"entropy": 0.97109375,
"epoch": 1.8751452197088772,
"grad_norm": 0.6761111433772677,
"learning_rate": 3.223192898407778e-07,
"loss": 0.7003,
"mean_token_accuracy": 0.8134942650794983,
"num_tokens": 1215588902.0,
"step": 13720
},
{
"entropy": 0.9681640625,
"epoch": 1.876511993439486,
"grad_norm": 0.6330137230311607,
"learning_rate": 3.1879667465126116e-07,
"loss": 0.661,
"mean_token_accuracy": 0.8217318475246429,
"num_tokens": 1216493221.0,
"step": 13730
},
{
"entropy": 0.966015625,
"epoch": 1.877878767170095,
"grad_norm": 0.5999310223898803,
"learning_rate": 3.152740594617444e-07,
"loss": 0.6902,
"mean_token_accuracy": 0.815803924202919,
"num_tokens": 1217440087.0,
"step": 13740
},
{
"entropy": 0.9748046875,
"epoch": 1.8792455409007038,
"grad_norm": 0.6735613136326348,
"learning_rate": 3.117514442722277e-07,
"loss": 0.6868,
"mean_token_accuracy": 0.8149718403816223,
"num_tokens": 1218357098.0,
"step": 13750
},
{
"entropy": 0.94375,
"epoch": 1.8806123146313127,
"grad_norm": 0.6147625349548352,
"learning_rate": 3.08228829082711e-07,
"loss": 0.6174,
"mean_token_accuracy": 0.8308764725923539,
"num_tokens": 1219287510.0,
"step": 13760
},
{
"entropy": 0.97890625,
"epoch": 1.8819790883619216,
"grad_norm": 0.7301672939889929,
"learning_rate": 3.0470621389319434e-07,
"loss": 0.6827,
"mean_token_accuracy": 0.8137594819068908,
"num_tokens": 1220145054.0,
"step": 13770
},
{
"entropy": 0.9966796875,
"epoch": 1.8833458620925305,
"grad_norm": 0.6105804954966255,
"learning_rate": 3.0118359870367763e-07,
"loss": 0.683,
"mean_token_accuracy": 0.8163618534803391,
"num_tokens": 1220986637.0,
"step": 13780
},
{
"entropy": 0.9587890625,
"epoch": 1.8847126358231394,
"grad_norm": 0.6767693946856456,
"learning_rate": 2.9766098351416096e-07,
"loss": 0.6423,
"mean_token_accuracy": 0.8240266352891922,
"num_tokens": 1221882549.0,
"step": 13790
},
{
"entropy": 0.9970703125,
"epoch": 1.8860794095537483,
"grad_norm": 0.6387256611724176,
"learning_rate": 2.9413836832464424e-07,
"loss": 0.7079,
"mean_token_accuracy": 0.8092765480279922,
"num_tokens": 1222799616.0,
"step": 13800
},
{
"entropy": 1.01796875,
"epoch": 1.8874461832843572,
"grad_norm": 0.691199245845211,
"learning_rate": 2.906157531351276e-07,
"loss": 0.7358,
"mean_token_accuracy": 0.804799371957779,
"num_tokens": 1223692723.0,
"step": 13810
},
{
"entropy": 0.9720703125,
"epoch": 1.888812957014966,
"grad_norm": 0.7275240168380452,
"learning_rate": 2.8709313794561086e-07,
"loss": 0.6705,
"mean_token_accuracy": 0.8166239589452744,
"num_tokens": 1224602296.0,
"step": 13820
},
{
"entropy": 0.9935546875,
"epoch": 1.890179730745575,
"grad_norm": 0.6707659433086326,
"learning_rate": 2.8357052275609415e-07,
"loss": 0.7217,
"mean_token_accuracy": 0.8059206813573837,
"num_tokens": 1225444602.0,
"step": 13830
},
{
"entropy": 1.0228515625,
"epoch": 1.8915465044761839,
"grad_norm": 0.6408565845416174,
"learning_rate": 2.8004790756657743e-07,
"loss": 0.7401,
"mean_token_accuracy": 0.8047633796930314,
"num_tokens": 1226326865.0,
"step": 13840
},
{
"entropy": 0.96875,
"epoch": 1.8929132782067928,
"grad_norm": 0.6259087066796951,
"learning_rate": 2.7652529237706076e-07,
"loss": 0.6897,
"mean_token_accuracy": 0.8127716243267059,
"num_tokens": 1227216431.0,
"step": 13850
},
{
"entropy": 0.9591796875,
"epoch": 1.8942800519374017,
"grad_norm": 0.6631888168556842,
"learning_rate": 2.7300267718754405e-07,
"loss": 0.701,
"mean_token_accuracy": 0.8130402475595474,
"num_tokens": 1228073184.0,
"step": 13860
},
{
"entropy": 0.920703125,
"epoch": 1.8956468256680106,
"grad_norm": 0.6542385940516983,
"learning_rate": 2.694800619980274e-07,
"loss": 0.6669,
"mean_token_accuracy": 0.8203750163316726,
"num_tokens": 1228961273.0,
"step": 13870
},
{
"entropy": 0.96484375,
"epoch": 1.8970135993986195,
"grad_norm": 0.7368113736752565,
"learning_rate": 2.6595744680851066e-07,
"loss": 0.6895,
"mean_token_accuracy": 0.8143171548843384,
"num_tokens": 1229885119.0,
"step": 13880
},
{
"entropy": 1.0138671875,
"epoch": 1.8983803731292284,
"grad_norm": 0.6324942730218499,
"learning_rate": 2.6243483161899395e-07,
"loss": 0.6998,
"mean_token_accuracy": 0.8110860347747803,
"num_tokens": 1230756421.0,
"step": 13890
},
{
"entropy": 0.980078125,
"epoch": 1.8997471468598373,
"grad_norm": 0.6790069955593633,
"learning_rate": 2.589122164294773e-07,
"loss": 0.7131,
"mean_token_accuracy": 0.8095121890306473,
"num_tokens": 1231686900.0,
"step": 13900
},
{
"entropy": 0.9810546875,
"epoch": 1.9011139205904461,
"grad_norm": 0.7227753749059531,
"learning_rate": 2.5538960123996056e-07,
"loss": 0.6819,
"mean_token_accuracy": 0.8159448564052582,
"num_tokens": 1232568957.0,
"step": 13910
},
{
"entropy": 1.0087890625,
"epoch": 1.902480694321055,
"grad_norm": 0.7011770315706303,
"learning_rate": 2.518669860504439e-07,
"loss": 0.6999,
"mean_token_accuracy": 0.8098111867904663,
"num_tokens": 1233407782.0,
"step": 13920
},
{
"entropy": 0.9939453125,
"epoch": 1.903847468051664,
"grad_norm": 0.6964367340720762,
"learning_rate": 2.483443708609272e-07,
"loss": 0.7077,
"mean_token_accuracy": 0.8106684058904647,
"num_tokens": 1234277152.0,
"step": 13930
},
{
"entropy": 0.95,
"epoch": 1.9052142417822728,
"grad_norm": 0.8111065107315187,
"learning_rate": 2.4482175567141046e-07,
"loss": 0.6503,
"mean_token_accuracy": 0.8241176337003708,
"num_tokens": 1235185409.0,
"step": 13940
},
{
"entropy": 0.99921875,
"epoch": 1.9065810155128817,
"grad_norm": 0.6483392967964458,
"learning_rate": 2.4129914048189375e-07,
"loss": 0.7209,
"mean_token_accuracy": 0.8059184402227402,
"num_tokens": 1236117547.0,
"step": 13950
},
{
"entropy": 0.9931640625,
"epoch": 1.9079477892434906,
"grad_norm": 0.6222980822874069,
"learning_rate": 2.3777652529237708e-07,
"loss": 0.7092,
"mean_token_accuracy": 0.8095988929271698,
"num_tokens": 1237019384.0,
"step": 13960
},
{
"entropy": 1.01015625,
"epoch": 1.9093145629740995,
"grad_norm": 0.7172848064657734,
"learning_rate": 2.342539101028604e-07,
"loss": 0.7489,
"mean_token_accuracy": 0.8011025041341782,
"num_tokens": 1237946995.0,
"step": 13970
},
{
"entropy": 1.015625,
"epoch": 1.9106813367047084,
"grad_norm": 0.7535539736179948,
"learning_rate": 2.307312949133437e-07,
"loss": 0.7305,
"mean_token_accuracy": 0.805143216252327,
"num_tokens": 1238820204.0,
"step": 13980
},
{
"entropy": 0.973046875,
"epoch": 1.9120481104353173,
"grad_norm": 0.6491802126403636,
"learning_rate": 2.2720867972382698e-07,
"loss": 0.6924,
"mean_token_accuracy": 0.8136708736419678,
"num_tokens": 1239710908.0,
"step": 13990
},
{
"entropy": 0.9884765625,
"epoch": 1.9134148841659262,
"grad_norm": 0.6595713913288008,
"learning_rate": 2.236860645343103e-07,
"loss": 0.6935,
"mean_token_accuracy": 0.8115501195192337,
"num_tokens": 1240579007.0,
"step": 14000
},
{
"entropy": 0.95703125,
"epoch": 1.914781657896535,
"grad_norm": 0.7310498649537078,
"learning_rate": 2.201634493447936e-07,
"loss": 0.6722,
"mean_token_accuracy": 0.8153464555740356,
"num_tokens": 1241438818.0,
"step": 14010
},
{
"entropy": 0.9658203125,
"epoch": 1.916148431627144,
"grad_norm": 0.6980308619710465,
"learning_rate": 2.166408341552769e-07,
"loss": 0.7217,
"mean_token_accuracy": 0.8069528102874756,
"num_tokens": 1242302339.0,
"step": 14020
},
{
"entropy": 0.9779296875,
"epoch": 1.9175152053577529,
"grad_norm": 0.6943898829402722,
"learning_rate": 2.131182189657602e-07,
"loss": 0.659,
"mean_token_accuracy": 0.8204431354999542,
"num_tokens": 1243178877.0,
"step": 14030
},
{
"entropy": 0.974609375,
"epoch": 1.9188819790883618,
"grad_norm": 0.7076115435746579,
"learning_rate": 2.095956037762435e-07,
"loss": 0.7075,
"mean_token_accuracy": 0.8072081208229065,
"num_tokens": 1244068968.0,
"step": 14040
},
{
"entropy": 0.9955078125,
"epoch": 1.9202487528189707,
"grad_norm": 0.6069286527393407,
"learning_rate": 2.0607298858672678e-07,
"loss": 0.6686,
"mean_token_accuracy": 0.8181742846965789,
"num_tokens": 1244958623.0,
"step": 14050
},
{
"entropy": 0.957421875,
"epoch": 1.9216155265495796,
"grad_norm": 0.7176419942988439,
"learning_rate": 2.025503733972101e-07,
"loss": 0.6851,
"mean_token_accuracy": 0.8154288411140442,
"num_tokens": 1245856273.0,
"step": 14060
},
{
"entropy": 1.016796875,
"epoch": 1.9229823002801885,
"grad_norm": 0.6599051040886966,
"learning_rate": 1.990277582076934e-07,
"loss": 0.7386,
"mean_token_accuracy": 0.8046932131052017,
"num_tokens": 1246770150.0,
"step": 14070
},
{
"entropy": 0.9853515625,
"epoch": 1.9243490740107974,
"grad_norm": 0.6976034713087025,
"learning_rate": 1.955051430181767e-07,
"loss": 0.6769,
"mean_token_accuracy": 0.8148183524608612,
"num_tokens": 1247607077.0,
"step": 14080
},
{
"entropy": 0.975390625,
"epoch": 1.9257158477414063,
"grad_norm": 0.7009348271783387,
"learning_rate": 1.9198252782866002e-07,
"loss": 0.6648,
"mean_token_accuracy": 0.8203177630901337,
"num_tokens": 1248487610.0,
"step": 14090
},
{
"entropy": 0.973828125,
"epoch": 1.9270826214720151,
"grad_norm": 0.6204482124553257,
"learning_rate": 1.8845991263914333e-07,
"loss": 0.6574,
"mean_token_accuracy": 0.8195050746202469,
"num_tokens": 1249385378.0,
"step": 14100
},
{
"entropy": 1.0060546875,
"epoch": 1.928449395202624,
"grad_norm": 0.7212037834268952,
"learning_rate": 1.8493729744962664e-07,
"loss": 0.683,
"mean_token_accuracy": 0.8163373798131943,
"num_tokens": 1250196035.0,
"step": 14110
},
{
"entropy": 0.99921875,
"epoch": 1.9298161689332332,
"grad_norm": 0.7073380256756372,
"learning_rate": 1.8141468226010995e-07,
"loss": 0.7243,
"mean_token_accuracy": 0.8070136427879333,
"num_tokens": 1251106482.0,
"step": 14120
},
{
"entropy": 0.9625,
"epoch": 1.931182942663842,
"grad_norm": 0.7100477036309176,
"learning_rate": 1.778920670705932e-07,
"loss": 0.6574,
"mean_token_accuracy": 0.8203923165798187,
"num_tokens": 1251995675.0,
"step": 14130
},
{
"entropy": 0.978515625,
"epoch": 1.932549716394451,
"grad_norm": 0.6190125497687894,
"learning_rate": 1.743694518810765e-07,
"loss": 0.6721,
"mean_token_accuracy": 0.8155079334974289,
"num_tokens": 1252902201.0,
"step": 14140
},
{
"entropy": 0.9814453125,
"epoch": 1.9339164901250598,
"grad_norm": 0.6800502114714737,
"learning_rate": 1.7084683669155982e-07,
"loss": 0.639,
"mean_token_accuracy": 0.8229890376329422,
"num_tokens": 1253798317.0,
"step": 14150
},
{
"entropy": 1.0083984375,
"epoch": 1.9352832638556687,
"grad_norm": 0.6622448516677614,
"learning_rate": 1.6732422150204313e-07,
"loss": 0.6982,
"mean_token_accuracy": 0.8131533741950989,
"num_tokens": 1254659906.0,
"step": 14160
},
{
"entropy": 0.9607421875,
"epoch": 1.9366500375862776,
"grad_norm": 0.6181691674110205,
"learning_rate": 1.6380160631252644e-07,
"loss": 0.6709,
"mean_token_accuracy": 0.8167496174573898,
"num_tokens": 1255597488.0,
"step": 14170
},
{
"entropy": 0.9689453125,
"epoch": 1.9380168113168865,
"grad_norm": 0.6206517058420508,
"learning_rate": 1.6027899112300975e-07,
"loss": 0.6718,
"mean_token_accuracy": 0.8171421945095062,
"num_tokens": 1256472898.0,
"step": 14180
},
{
"entropy": 0.9701171875,
"epoch": 1.9393835850474954,
"grad_norm": 0.5963814541928857,
"learning_rate": 1.5675637593349303e-07,
"loss": 0.6407,
"mean_token_accuracy": 0.8255658149719238,
"num_tokens": 1257391119.0,
"step": 14190
},
{
"entropy": 0.96953125,
"epoch": 1.9407503587781043,
"grad_norm": 0.664445226638092,
"learning_rate": 1.5323376074397634e-07,
"loss": 0.7026,
"mean_token_accuracy": 0.8097137719392776,
"num_tokens": 1258295967.0,
"step": 14200
},
{
"entropy": 1.05546875,
"epoch": 1.9421171325087132,
"grad_norm": 0.771376035763272,
"learning_rate": 1.4971114555445965e-07,
"loss": 0.776,
"mean_token_accuracy": 0.7938510775566101,
"num_tokens": 1259195309.0,
"step": 14210
},
{
"entropy": 0.9853515625,
"epoch": 1.943483906239322,
"grad_norm": 0.708140416721954,
"learning_rate": 1.4618853036494293e-07,
"loss": 0.7162,
"mean_token_accuracy": 0.8088630110025405,
"num_tokens": 1260067768.0,
"step": 14220
},
{
"entropy": 0.983984375,
"epoch": 1.944850679969931,
"grad_norm": 0.6690908390276159,
"learning_rate": 1.4266591517542624e-07,
"loss": 0.729,
"mean_token_accuracy": 0.8060040086507797,
"num_tokens": 1260932295.0,
"step": 14230
},
{
"entropy": 0.9958984375,
"epoch": 1.94621745370054,
"grad_norm": 0.6188987822940066,
"learning_rate": 1.3914329998590955e-07,
"loss": 0.6569,
"mean_token_accuracy": 0.8201938241720199,
"num_tokens": 1261753749.0,
"step": 14240
},
{
"entropy": 0.987890625,
"epoch": 1.9475842274311488,
"grad_norm": 0.6582027083032023,
"learning_rate": 1.3562068479639286e-07,
"loss": 0.6902,
"mean_token_accuracy": 0.8125846266746521,
"num_tokens": 1262672908.0,
"step": 14250
},
{
"entropy": 0.9556640625,
"epoch": 1.9489510011617577,
"grad_norm": 0.6868307267760104,
"learning_rate": 1.3209806960687614e-07,
"loss": 0.6616,
"mean_token_accuracy": 0.8195683777332305,
"num_tokens": 1263528802.0,
"step": 14260
},
{
"entropy": 0.990625,
"epoch": 1.9503177748923666,
"grad_norm": 0.7050114355403988,
"learning_rate": 1.2857545441735945e-07,
"loss": 0.6802,
"mean_token_accuracy": 0.8147171080112457,
"num_tokens": 1264405077.0,
"step": 14270
},
{
"entropy": 0.9984375,
"epoch": 1.9516845486229755,
"grad_norm": 0.7260155295932988,
"learning_rate": 1.2505283922784276e-07,
"loss": 0.6977,
"mean_token_accuracy": 0.8143691688776016,
"num_tokens": 1265320781.0,
"step": 14280
},
{
"entropy": 0.9626953125,
"epoch": 1.9530513223535844,
"grad_norm": 0.6505479802202863,
"learning_rate": 1.2153022403832607e-07,
"loss": 0.6854,
"mean_token_accuracy": 0.8134407073259353,
"num_tokens": 1266222145.0,
"step": 14290
},
{
"entropy": 0.973828125,
"epoch": 1.9544180960841933,
"grad_norm": 0.6582420194164381,
"learning_rate": 1.1800760884880937e-07,
"loss": 0.7072,
"mean_token_accuracy": 0.8088899821043014,
"num_tokens": 1267147735.0,
"step": 14300
},
{
"entropy": 0.986328125,
"epoch": 1.9557848698148022,
"grad_norm": 0.6575533389054674,
"learning_rate": 1.1448499365929266e-07,
"loss": 0.7075,
"mean_token_accuracy": 0.8116710901260376,
"num_tokens": 1268033827.0,
"step": 14310
},
{
"entropy": 0.9912109375,
"epoch": 1.957151643545411,
"grad_norm": 0.6623944685744114,
"learning_rate": 1.1096237846977597e-07,
"loss": 0.6896,
"mean_token_accuracy": 0.8149222284555435,
"num_tokens": 1268910863.0,
"step": 14320
},
{
"entropy": 1.003125,
"epoch": 1.95851841727602,
"grad_norm": 0.7343245442427366,
"learning_rate": 1.0743976328025928e-07,
"loss": 0.7087,
"mean_token_accuracy": 0.809961798787117,
"num_tokens": 1269814412.0,
"step": 14330
},
{
"entropy": 0.9419921875,
"epoch": 1.9598851910066288,
"grad_norm": 0.6791445049471224,
"learning_rate": 1.0391714809074258e-07,
"loss": 0.6831,
"mean_token_accuracy": 0.8150588631629944,
"num_tokens": 1270716800.0,
"step": 14340
},
{
"entropy": 0.97265625,
"epoch": 1.9612519647372377,
"grad_norm": 0.707699289698995,
"learning_rate": 1.0039453290122588e-07,
"loss": 0.7079,
"mean_token_accuracy": 0.8081780046224594,
"num_tokens": 1271593925.0,
"step": 14350
},
{
"entropy": 0.9515625,
"epoch": 1.9626187384678466,
"grad_norm": 0.6948719468053972,
"learning_rate": 9.687191771170918e-08,
"loss": 0.6524,
"mean_token_accuracy": 0.822149521112442,
"num_tokens": 1272462660.0,
"step": 14360
},
{
"entropy": 1.006640625,
"epoch": 1.9639855121984555,
"grad_norm": 0.7961635219120691,
"learning_rate": 9.334930252219248e-08,
"loss": 0.7633,
"mean_token_accuracy": 0.7995172202587127,
"num_tokens": 1273382850.0,
"step": 14370
},
{
"entropy": 0.981640625,
"epoch": 1.9653522859290644,
"grad_norm": 0.6651337940283104,
"learning_rate": 8.982668733267578e-08,
"loss": 0.6777,
"mean_token_accuracy": 0.8162557691335678,
"num_tokens": 1274290572.0,
"step": 14380
},
{
"entropy": 0.9498046875,
"epoch": 1.9667190596596733,
"grad_norm": 0.6321070711745754,
"learning_rate": 8.630407214315909e-08,
"loss": 0.6642,
"mean_token_accuracy": 0.8204354792833328,
"num_tokens": 1275174274.0,
"step": 14390
},
{
"entropy": 1.0234375,
"epoch": 1.9680858333902822,
"grad_norm": 0.7330653566473884,
"learning_rate": 8.27814569536424e-08,
"loss": 0.6837,
"mean_token_accuracy": 0.8158282816410065,
"num_tokens": 1276074274.0,
"step": 14400
},
{
"entropy": 1.0109375,
"epoch": 1.969452607120891,
"grad_norm": 0.748582894644298,
"learning_rate": 7.925884176412568e-08,
"loss": 0.7458,
"mean_token_accuracy": 0.8034061372280121,
"num_tokens": 1276932931.0,
"step": 14410
},
{
"entropy": 1.021484375,
"epoch": 1.9708193808515,
"grad_norm": 0.6709308572104824,
"learning_rate": 7.573622657460899e-08,
"loss": 0.7217,
"mean_token_accuracy": 0.8074682414531708,
"num_tokens": 1277813012.0,
"step": 14420
},
{
"entropy": 0.965234375,
"epoch": 1.9721861545821089,
"grad_norm": 0.7116458253774633,
"learning_rate": 7.22136113850923e-08,
"loss": 0.6746,
"mean_token_accuracy": 0.816869992017746,
"num_tokens": 1278702374.0,
"step": 14430
},
{
"entropy": 0.965234375,
"epoch": 1.9735529283127178,
"grad_norm": 0.6706626337034902,
"learning_rate": 6.869099619557561e-08,
"loss": 0.6553,
"mean_token_accuracy": 0.8212596595287323,
"num_tokens": 1279586770.0,
"step": 14440
},
{
"entropy": 0.9623046875,
"epoch": 1.9749197020433267,
"grad_norm": 0.7987336733344893,
"learning_rate": 6.51683810060589e-08,
"loss": 0.6951,
"mean_token_accuracy": 0.8135534763336182,
"num_tokens": 1280510572.0,
"step": 14450
},
{
"entropy": 1.003125,
"epoch": 1.9762864757739358,
"grad_norm": 0.732683438377241,
"learning_rate": 6.164576581654221e-08,
"loss": 0.7117,
"mean_token_accuracy": 0.8088078618049621,
"num_tokens": 1281364572.0,
"step": 14460
},
{
"entropy": 0.98359375,
"epoch": 1.9776532495045447,
"grad_norm": 0.7104921091928702,
"learning_rate": 5.8123150627025515e-08,
"loss": 0.6757,
"mean_token_accuracy": 0.815332081913948,
"num_tokens": 1282224524.0,
"step": 14470
},
{
"entropy": 0.976953125,
"epoch": 1.9790200232351536,
"grad_norm": 0.6525201618704177,
"learning_rate": 5.460053543750881e-08,
"loss": 0.6805,
"mean_token_accuracy": 0.8166893810033798,
"num_tokens": 1283046842.0,
"step": 14480
},
{
"entropy": 0.9943359375,
"epoch": 1.9803867969657625,
"grad_norm": 0.7037882698569417,
"learning_rate": 5.107792024799211e-08,
"loss": 0.7156,
"mean_token_accuracy": 0.8095852464437485,
"num_tokens": 1283926789.0,
"step": 14490
},
{
"entropy": 1.0443359375,
"epoch": 1.9817535706963714,
"grad_norm": 0.7162732031881823,
"learning_rate": 4.7555305058475415e-08,
"loss": 0.7579,
"mean_token_accuracy": 0.7985734671354294,
"num_tokens": 1284778482.0,
"step": 14500
},
{
"entropy": 0.9830078125,
"epoch": 1.9831203444269803,
"grad_norm": 0.670906341750453,
"learning_rate": 4.403268986895872e-08,
"loss": 0.7158,
"mean_token_accuracy": 0.8102829128503799,
"num_tokens": 1285717361.0,
"step": 14510
},
{
"entropy": 0.987890625,
"epoch": 1.9844871181575892,
"grad_norm": 0.7062076153754167,
"learning_rate": 4.0510074679442026e-08,
"loss": 0.7111,
"mean_token_accuracy": 0.8087432950735092,
"num_tokens": 1286605150.0,
"step": 14520
},
{
"entropy": 1.020703125,
"epoch": 1.985853891888198,
"grad_norm": 0.7395574137157285,
"learning_rate": 3.698745948992532e-08,
"loss": 0.7324,
"mean_token_accuracy": 0.8045488238334656,
"num_tokens": 1287429714.0,
"step": 14530
},
{
"entropy": 0.97578125,
"epoch": 1.987220665618807,
"grad_norm": 0.6739099109267165,
"learning_rate": 3.3464844300408624e-08,
"loss": 0.6796,
"mean_token_accuracy": 0.8157085716724396,
"num_tokens": 1288274856.0,
"step": 14540
},
{
"entropy": 0.957421875,
"epoch": 1.9885874393494158,
"grad_norm": 0.6500857243201204,
"learning_rate": 2.994222911089193e-08,
"loss": 0.6719,
"mean_token_accuracy": 0.8183841794729233,
"num_tokens": 1289184678.0,
"step": 14550
},
{
"entropy": 1.0015625,
"epoch": 1.9899542130800247,
"grad_norm": 0.6701633892305796,
"learning_rate": 2.6419613921375232e-08,
"loss": 0.6916,
"mean_token_accuracy": 0.8125406235456467,
"num_tokens": 1290104163.0,
"step": 14560
},
{
"entropy": 0.94453125,
"epoch": 1.9913209868106336,
"grad_norm": 0.7260038302313221,
"learning_rate": 2.289699873185853e-08,
"loss": 0.685,
"mean_token_accuracy": 0.8132305800914764,
"num_tokens": 1290984420.0,
"step": 14570
},
{
"entropy": 1.0466796875,
"epoch": 1.9926877605412425,
"grad_norm": 0.6673415672548907,
"learning_rate": 1.9374383542341837e-08,
"loss": 0.7526,
"mean_token_accuracy": 0.7993565887212754,
"num_tokens": 1291827527.0,
"step": 14580
},
{
"entropy": 0.9412109375,
"epoch": 1.9940545342718514,
"grad_norm": 0.6496251192373225,
"learning_rate": 1.585176835282514e-08,
"loss": 0.6525,
"mean_token_accuracy": 0.8212591797113419,
"num_tokens": 1292724554.0,
"step": 14590
},
{
"entropy": 1.0306640625,
"epoch": 1.9954213080024603,
"grad_norm": 0.6966168107024366,
"learning_rate": 1.2329153163308442e-08,
"loss": 0.7637,
"mean_token_accuracy": 0.7983671814203263,
"num_tokens": 1293618300.0,
"step": 14600
},
{
"entropy": 0.9806640625,
"epoch": 1.9967880817330692,
"grad_norm": 0.7023527062208818,
"learning_rate": 8.806537973791744e-09,
"loss": 0.7072,
"mean_token_accuracy": 0.8104992806911469,
"num_tokens": 1294534796.0,
"step": 14610
},
{
"entropy": 0.965234375,
"epoch": 1.998154855463678,
"grad_norm": 0.6920981542124051,
"learning_rate": 5.2839227842750465e-09,
"loss": 0.696,
"mean_token_accuracy": 0.8116828024387359,
"num_tokens": 1295448543.0,
"step": 14620
},
{
"entropy": 0.9857421875,
"epoch": 1.999521629194287,
"grad_norm": 0.7040479582625242,
"learning_rate": 1.7613075947583486e-09,
"loss": 0.7056,
"mean_token_accuracy": 0.8089365065097809,
"num_tokens": 1296340286.0,
"step": 14630
},
{
"entropy": 0.9994419642857143,
"epoch": 2.0,
"mean_token_accuracy": 0.8027979220662799,
"num_tokens": 1296663702.0,
"step": 14634,
"total_flos": 2402699861753856.0,
"train_loss": 0.7249908164597705,
"train_runtime": 27625.1008,
"train_samples_per_second": 67.801,
"train_steps_per_second": 0.53
}
],
"logging_steps": 10,
"max_steps": 14634,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 200,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 2402699861753856.0,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}