Files
SmolLM2-1.7B-SFT-Tulu3-deco…/trainer_state.json
ModelHub XC 17fbb6a21c 初始化项目,由ModelHub XC社区提供模型
Model: ali-elganzory/SmolLM2-1.7B-SFT-Tulu3-decontaminated-masked
Source: Original Platform
2026-07-18 21:52:18 +08:00

14677 lines
410 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 2.0,
"eval_steps": 500,
"global_step": 14634,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 1.96015625,
"epoch": 0.0013666803334700013,
"grad_norm": 263.2508682354472,
"learning_rate": 1.0227272727272728e-07,
"loss": 1.7953,
"mean_token_accuracy": 0.6400650084018707,
"num_tokens": 1016869.0,
"step": 10
},
{
"entropy": 1.9234375,
"epoch": 0.0027333606669400026,
"grad_norm": 227.104034617358,
"learning_rate": 2.1590909090909094e-07,
"loss": 1.6999,
"mean_token_accuracy": 0.659596073627472,
"num_tokens": 1980699.0,
"step": 20
},
{
"entropy": 1.9375,
"epoch": 0.004100041000410004,
"grad_norm": 325.89579440741545,
"learning_rate": 3.2954545454545455e-07,
"loss": 1.7579,
"mean_token_accuracy": 0.6468950569629669,
"num_tokens": 2988245.0,
"step": 30
},
{
"entropy": 1.91796875,
"epoch": 0.005466721333880005,
"grad_norm": 261.4599220389202,
"learning_rate": 4.431818181818182e-07,
"loss": 1.6959,
"mean_token_accuracy": 0.6586498498916626,
"num_tokens": 3975995.0,
"step": 40
},
{
"entropy": 1.85859375,
"epoch": 0.006833401667350007,
"grad_norm": 169.67498898366387,
"learning_rate": 5.568181818181818e-07,
"loss": 1.5918,
"mean_token_accuracy": 0.6706202924251556,
"num_tokens": 4978502.0,
"step": 50
},
{
"entropy": 1.8765625,
"epoch": 0.008200082000820008,
"grad_norm": 203.16442207376542,
"learning_rate": 6.704545454545456e-07,
"loss": 1.6141,
"mean_token_accuracy": 0.6673206567764283,
"num_tokens": 6027883.0,
"step": 60
},
{
"entropy": 1.89609375,
"epoch": 0.00956676233429001,
"grad_norm": 131.4095743174813,
"learning_rate": 7.840909090909092e-07,
"loss": 1.6243,
"mean_token_accuracy": 0.6650258779525757,
"num_tokens": 7061996.0,
"step": 70
},
{
"entropy": 1.83046875,
"epoch": 0.01093344266776001,
"grad_norm": 76.33101138594256,
"learning_rate": 8.977272727272728e-07,
"loss": 1.5403,
"mean_token_accuracy": 0.6762084424495697,
"num_tokens": 8084402.0,
"step": 80
},
{
"entropy": 1.66171875,
"epoch": 0.012300123001230012,
"grad_norm": 80.12881960223145,
"learning_rate": 1.0113636363636365e-06,
"loss": 1.3369,
"mean_token_accuracy": 0.7047765016555786,
"num_tokens": 9025654.0,
"step": 90
},
{
"entropy": 1.56484375,
"epoch": 0.013666803334700014,
"grad_norm": 101.38680651247363,
"learning_rate": 1.125e-06,
"loss": 1.2441,
"mean_token_accuracy": 0.7194692432880402,
"num_tokens": 10036395.0,
"step": 100
},
{
"entropy": 1.49453125,
"epoch": 0.015033483668170014,
"grad_norm": 9.68964664988684,
"learning_rate": 1.2386363636363638e-06,
"loss": 1.1684,
"mean_token_accuracy": 0.7330705165863037,
"num_tokens": 11045728.0,
"step": 110
},
{
"entropy": 1.4640625,
"epoch": 0.016400164001640016,
"grad_norm": 9.576349054914576,
"learning_rate": 1.3522727272727273e-06,
"loss": 1.1337,
"mean_token_accuracy": 0.7390927016735077,
"num_tokens": 12023582.0,
"step": 120
},
{
"entropy": 1.396875,
"epoch": 0.017766844335110017,
"grad_norm": 8.29434689366752,
"learning_rate": 1.465909090909091e-06,
"loss": 1.1075,
"mean_token_accuracy": 0.7398776888847352,
"num_tokens": 13030217.0,
"step": 130
},
{
"entropy": 1.31875,
"epoch": 0.01913352466858002,
"grad_norm": 4.223906273877089,
"learning_rate": 1.5795454545454547e-06,
"loss": 1.018,
"mean_token_accuracy": 0.7567616820335388,
"num_tokens": 14048615.0,
"step": 140
},
{
"entropy": 1.303125,
"epoch": 0.02050020500205002,
"grad_norm": 7.526414829438919,
"learning_rate": 1.6931818181818182e-06,
"loss": 1.0353,
"mean_token_accuracy": 0.7529841959476471,
"num_tokens": 15078495.0,
"step": 150
},
{
"entropy": 1.28671875,
"epoch": 0.02186688533552002,
"grad_norm": 6.529453187821603,
"learning_rate": 1.8068181818181822e-06,
"loss": 1.0496,
"mean_token_accuracy": 0.7480699002742768,
"num_tokens": 16103047.0,
"step": 160
},
{
"entropy": 1.2484375,
"epoch": 0.023233565668990024,
"grad_norm": 1.7761359391252698,
"learning_rate": 1.9204545454545457e-06,
"loss": 0.9784,
"mean_token_accuracy": 0.761588042974472,
"num_tokens": 17028892.0,
"step": 170
},
{
"entropy": 1.17265625,
"epoch": 0.024600246002460024,
"grad_norm": 3.0445338263485073,
"learning_rate": 2.034090909090909e-06,
"loss": 0.9504,
"mean_token_accuracy": 0.7622654676437378,
"num_tokens": 18024902.0,
"step": 180
},
{
"entropy": 1.184375,
"epoch": 0.025966926335930025,
"grad_norm": 5.004781920563031,
"learning_rate": 2.147727272727273e-06,
"loss": 0.954,
"mean_token_accuracy": 0.760678231716156,
"num_tokens": 19080401.0,
"step": 190
},
{
"entropy": 1.21953125,
"epoch": 0.02733360666940003,
"grad_norm": 1.2823507690544536,
"learning_rate": 2.2613636363636366e-06,
"loss": 0.9686,
"mean_token_accuracy": 0.7598397135734558,
"num_tokens": 20026588.0,
"step": 200
},
{
"entropy": 1.16640625,
"epoch": 0.02870028700287003,
"grad_norm": 3.883094542361609,
"learning_rate": 2.375e-06,
"loss": 0.907,
"mean_token_accuracy": 0.7671771466732025,
"num_tokens": 21044783.0,
"step": 210
},
{
"entropy": 1.16015625,
"epoch": 0.03006696733634003,
"grad_norm": 2.732127300781266,
"learning_rate": 2.488636363636364e-06,
"loss": 0.8733,
"mean_token_accuracy": 0.7757133305072784,
"num_tokens": 22052506.0,
"step": 220
},
{
"entropy": 1.112109375,
"epoch": 0.03143364766981003,
"grad_norm": 3.693439258457981,
"learning_rate": 2.6022727272727276e-06,
"loss": 0.8485,
"mean_token_accuracy": 0.7797536194324494,
"num_tokens": 23069235.0,
"step": 230
},
{
"entropy": 1.13984375,
"epoch": 0.03280032800328003,
"grad_norm": 0.6637253011820663,
"learning_rate": 2.715909090909091e-06,
"loss": 0.8602,
"mean_token_accuracy": 0.7771018207073211,
"num_tokens": 24079191.0,
"step": 240
},
{
"entropy": 1.140625,
"epoch": 0.034167008336750036,
"grad_norm": 9.562279590356125,
"learning_rate": 2.829545454545455e-06,
"loss": 0.8642,
"mean_token_accuracy": 0.7762101531028748,
"num_tokens": 25079457.0,
"step": 250
},
{
"entropy": 1.08671875,
"epoch": 0.03553368867022003,
"grad_norm": 0.8321851399969586,
"learning_rate": 2.9431818181818185e-06,
"loss": 0.8182,
"mean_token_accuracy": 0.7851621389389039,
"num_tokens": 26091186.0,
"step": 260
},
{
"entropy": 1.09375,
"epoch": 0.03690036900369004,
"grad_norm": 2.2846725484838406,
"learning_rate": 3.056818181818182e-06,
"loss": 0.8145,
"mean_token_accuracy": 0.7869764864444733,
"num_tokens": 27112339.0,
"step": 270
},
{
"entropy": 1.09921875,
"epoch": 0.03826704933716004,
"grad_norm": 2.294936013946591,
"learning_rate": 3.1704545454545456e-06,
"loss": 0.8309,
"mean_token_accuracy": 0.7814720571041107,
"num_tokens": 28134048.0,
"step": 280
},
{
"entropy": 1.11015625,
"epoch": 0.03963372967063004,
"grad_norm": 1.252185445535455,
"learning_rate": 3.2840909090909095e-06,
"loss": 0.8363,
"mean_token_accuracy": 0.7811675846576691,
"num_tokens": 29136473.0,
"step": 290
},
{
"entropy": 1.081640625,
"epoch": 0.04100041000410004,
"grad_norm": 2.3267466942472628,
"learning_rate": 3.397727272727273e-06,
"loss": 0.8146,
"mean_token_accuracy": 0.7839843451976776,
"num_tokens": 30137323.0,
"step": 300
},
{
"entropy": 1.101953125,
"epoch": 0.042367090337570044,
"grad_norm": 1.2890846642679898,
"learning_rate": 3.5113636363636365e-06,
"loss": 0.8304,
"mean_token_accuracy": 0.7848218083381653,
"num_tokens": 31163454.0,
"step": 310
},
{
"entropy": 1.093359375,
"epoch": 0.04373377067104004,
"grad_norm": 0.4494241669767106,
"learning_rate": 3.625e-06,
"loss": 0.8145,
"mean_token_accuracy": 0.783513605594635,
"num_tokens": 32141812.0,
"step": 320
},
{
"entropy": 1.15625,
"epoch": 0.045100451004510045,
"grad_norm": 1.8962806311442288,
"learning_rate": 3.7386363636363635e-06,
"loss": 0.8796,
"mean_token_accuracy": 0.7751683354377746,
"num_tokens": 33126442.0,
"step": 330
},
{
"entropy": 1.049609375,
"epoch": 0.04646713133798005,
"grad_norm": 1.1753707393307151,
"learning_rate": 3.852272727272728e-06,
"loss": 0.7817,
"mean_token_accuracy": 0.7918863534927368,
"num_tokens": 34104354.0,
"step": 340
},
{
"entropy": 1.03203125,
"epoch": 0.047833811671450045,
"grad_norm": 1.4048014912426348,
"learning_rate": 3.965909090909091e-06,
"loss": 0.7682,
"mean_token_accuracy": 0.7950132608413696,
"num_tokens": 35132692.0,
"step": 350
},
{
"entropy": 1.084765625,
"epoch": 0.04920049200492005,
"grad_norm": 0.6654725577424911,
"learning_rate": 4.079545454545455e-06,
"loss": 0.8396,
"mean_token_accuracy": 0.7795374035835266,
"num_tokens": 36158630.0,
"step": 360
},
{
"entropy": 1.09765625,
"epoch": 0.05056717233839005,
"grad_norm": 0.8750929455547982,
"learning_rate": 4.193181818181819e-06,
"loss": 0.8149,
"mean_token_accuracy": 0.7850733518600463,
"num_tokens": 37163234.0,
"step": 370
},
{
"entropy": 1.115625,
"epoch": 0.05193385267186005,
"grad_norm": 0.7130197940640309,
"learning_rate": 4.306818181818182e-06,
"loss": 0.8394,
"mean_token_accuracy": 0.7815756559371948,
"num_tokens": 38146361.0,
"step": 380
},
{
"entropy": 1.04140625,
"epoch": 0.05330053300533005,
"grad_norm": 1.335802664190266,
"learning_rate": 4.420454545454546e-06,
"loss": 0.7861,
"mean_token_accuracy": 0.7898756861686707,
"num_tokens": 39174804.0,
"step": 390
},
{
"entropy": 1.043359375,
"epoch": 0.05466721333880006,
"grad_norm": 0.43736538852603796,
"learning_rate": 4.53409090909091e-06,
"loss": 0.7625,
"mean_token_accuracy": 0.7971896767616272,
"num_tokens": 40139777.0,
"step": 400
},
{
"entropy": 1.10546875,
"epoch": 0.05603389367227005,
"grad_norm": 0.6206692416797165,
"learning_rate": 4.647727272727273e-06,
"loss": 0.8178,
"mean_token_accuracy": 0.7830190241336823,
"num_tokens": 41114574.0,
"step": 410
},
{
"entropy": 1.066015625,
"epoch": 0.05740057400574006,
"grad_norm": 0.8634310384848157,
"learning_rate": 4.761363636363637e-06,
"loss": 0.7872,
"mean_token_accuracy": 0.7925447583198547,
"num_tokens": 42124866.0,
"step": 420
},
{
"entropy": 1.024609375,
"epoch": 0.05876725433921006,
"grad_norm": 0.8973625693128161,
"learning_rate": 4.875e-06,
"loss": 0.7368,
"mean_token_accuracy": 0.8024304926395416,
"num_tokens": 43150980.0,
"step": 430
},
{
"entropy": 1.05234375,
"epoch": 0.06013393467268006,
"grad_norm": 0.557098794538891,
"learning_rate": 4.988636363636364e-06,
"loss": 0.8203,
"mean_token_accuracy": 0.7845601737499237,
"num_tokens": 44191349.0,
"step": 440
},
{
"entropy": 1.0890625,
"epoch": 0.06150061500615006,
"grad_norm": 0.7152233713997278,
"learning_rate": 4.996829646329435e-06,
"loss": 0.8035,
"mean_token_accuracy": 0.7862460732460022,
"num_tokens": 45193679.0,
"step": 450
},
{
"entropy": 1.109765625,
"epoch": 0.06286729533962006,
"grad_norm": 0.4275710055394895,
"learning_rate": 4.993307031139919e-06,
"loss": 0.8342,
"mean_token_accuracy": 0.7821127533912658,
"num_tokens": 46212953.0,
"step": 460
},
{
"entropy": 1.06953125,
"epoch": 0.06423397567309007,
"grad_norm": 1.582434597563457,
"learning_rate": 4.989784415950402e-06,
"loss": 0.8332,
"mean_token_accuracy": 0.7814404666423798,
"num_tokens": 47223409.0,
"step": 470
},
{
"entropy": 1.11875,
"epoch": 0.06560065600656007,
"grad_norm": 1.3961753814947488,
"learning_rate": 4.986261800760885e-06,
"loss": 0.8412,
"mean_token_accuracy": 0.7799747109413147,
"num_tokens": 48219206.0,
"step": 480
},
{
"entropy": 1.0546875,
"epoch": 0.06696733634003006,
"grad_norm": 1.2706689341027735,
"learning_rate": 4.9827391855713685e-06,
"loss": 0.793,
"mean_token_accuracy": 0.7912791073322296,
"num_tokens": 49254735.0,
"step": 490
},
{
"entropy": 1.07265625,
"epoch": 0.06833401667350007,
"grad_norm": 0.37774345034343876,
"learning_rate": 4.979216570381852e-06,
"loss": 0.761,
"mean_token_accuracy": 0.7951551675796509,
"num_tokens": 50255750.0,
"step": 500
},
{
"entropy": 1.070703125,
"epoch": 0.06970069700697007,
"grad_norm": 0.5412217751550229,
"learning_rate": 4.975693955192335e-06,
"loss": 0.7956,
"mean_token_accuracy": 0.7878499209880829,
"num_tokens": 51239612.0,
"step": 510
},
{
"entropy": 1.086328125,
"epoch": 0.07106737734044007,
"grad_norm": 0.3764293852812404,
"learning_rate": 4.972171340002819e-06,
"loss": 0.8042,
"mean_token_accuracy": 0.7895831227302551,
"num_tokens": 52276744.0,
"step": 520
},
{
"entropy": 1.08515625,
"epoch": 0.07243405767391008,
"grad_norm": 0.5293279178955888,
"learning_rate": 4.968648724813302e-06,
"loss": 0.8086,
"mean_token_accuracy": 0.785852438211441,
"num_tokens": 53273673.0,
"step": 530
},
{
"entropy": 1.066015625,
"epoch": 0.07380073800738007,
"grad_norm": 0.5896256493908911,
"learning_rate": 4.965126109623785e-06,
"loss": 0.799,
"mean_token_accuracy": 0.7898524284362793,
"num_tokens": 54252824.0,
"step": 540
},
{
"entropy": 1.0765625,
"epoch": 0.07516741834085007,
"grad_norm": 0.7978993958408007,
"learning_rate": 4.961603494434268e-06,
"loss": 0.8245,
"mean_token_accuracy": 0.7845027923583985,
"num_tokens": 55242317.0,
"step": 550
},
{
"entropy": 1.040625,
"epoch": 0.07653409867432008,
"grad_norm": 0.5602309686952924,
"learning_rate": 4.958080879244752e-06,
"loss": 0.7544,
"mean_token_accuracy": 0.7974738836288452,
"num_tokens": 56262198.0,
"step": 560
},
{
"entropy": 1.03125,
"epoch": 0.07790077900779008,
"grad_norm": 0.4004900157541459,
"learning_rate": 4.954558264055234e-06,
"loss": 0.7763,
"mean_token_accuracy": 0.7909406900405884,
"num_tokens": 57224893.0,
"step": 570
},
{
"entropy": 1.03828125,
"epoch": 0.07926745934126007,
"grad_norm": 0.9846268309841285,
"learning_rate": 4.951035648865719e-06,
"loss": 0.7745,
"mean_token_accuracy": 0.7935196220874786,
"num_tokens": 58192939.0,
"step": 580
},
{
"entropy": 1.040234375,
"epoch": 0.08063413967473008,
"grad_norm": 0.38684859775812663,
"learning_rate": 4.9475130336762015e-06,
"loss": 0.7642,
"mean_token_accuracy": 0.7959153950214386,
"num_tokens": 59173681.0,
"step": 590
},
{
"entropy": 1.0734375,
"epoch": 0.08200082000820008,
"grad_norm": 0.5183294276730381,
"learning_rate": 4.943990418486685e-06,
"loss": 0.7892,
"mean_token_accuracy": 0.7878992855548859,
"num_tokens": 60217834.0,
"step": 600
},
{
"entropy": 1.044921875,
"epoch": 0.08336750034167008,
"grad_norm": 0.6496892545099879,
"learning_rate": 4.9404678032971685e-06,
"loss": 0.7931,
"mean_token_accuracy": 0.7918606281280518,
"num_tokens": 61203226.0,
"step": 610
},
{
"entropy": 1.034375,
"epoch": 0.08473418067514009,
"grad_norm": 0.48946656525096416,
"learning_rate": 4.936945188107651e-06,
"loss": 0.7923,
"mean_token_accuracy": 0.7916375160217285,
"num_tokens": 62218471.0,
"step": 620
},
{
"entropy": 1.006640625,
"epoch": 0.08610086100861009,
"grad_norm": 0.4814206481542219,
"learning_rate": 4.933422572918135e-06,
"loss": 0.755,
"mean_token_accuracy": 0.7996753811836242,
"num_tokens": 63196352.0,
"step": 630
},
{
"entropy": 1.025,
"epoch": 0.08746754134208008,
"grad_norm": 0.9732807763866093,
"learning_rate": 4.929899957728618e-06,
"loss": 0.7603,
"mean_token_accuracy": 0.7966128170490265,
"num_tokens": 64213947.0,
"step": 640
},
{
"entropy": 1.03125,
"epoch": 0.08883422167555009,
"grad_norm": 0.39563207842614995,
"learning_rate": 4.926377342539102e-06,
"loss": 0.7591,
"mean_token_accuracy": 0.7968947231769562,
"num_tokens": 65212813.0,
"step": 650
},
{
"entropy": 1.023046875,
"epoch": 0.09020090200902009,
"grad_norm": 0.3385177724776059,
"learning_rate": 4.922854727349585e-06,
"loss": 0.7422,
"mean_token_accuracy": 0.8016735732555389,
"num_tokens": 66207188.0,
"step": 660
},
{
"entropy": 1.058203125,
"epoch": 0.09156758234249009,
"grad_norm": 0.3754944900723861,
"learning_rate": 4.919332112160068e-06,
"loss": 0.7741,
"mean_token_accuracy": 0.7950766503810882,
"num_tokens": 67233532.0,
"step": 670
},
{
"entropy": 1.032421875,
"epoch": 0.0929342626759601,
"grad_norm": 0.3081271382872076,
"learning_rate": 4.915809496970551e-06,
"loss": 0.7577,
"mean_token_accuracy": 0.7970731377601623,
"num_tokens": 68263201.0,
"step": 680
},
{
"entropy": 1.09140625,
"epoch": 0.0943009430094301,
"grad_norm": 0.3984090800504185,
"learning_rate": 4.912286881781035e-06,
"loss": 0.8471,
"mean_token_accuracy": 0.7772568702697754,
"num_tokens": 69260237.0,
"step": 690
},
{
"entropy": 1.03203125,
"epoch": 0.09566762334290009,
"grad_norm": 0.4846824266906132,
"learning_rate": 4.908764266591518e-06,
"loss": 0.7512,
"mean_token_accuracy": 0.7989737808704376,
"num_tokens": 70257011.0,
"step": 700
},
{
"entropy": 1.059765625,
"epoch": 0.0970343036763701,
"grad_norm": 0.43993853515889314,
"learning_rate": 4.9052416514020015e-06,
"loss": 0.7557,
"mean_token_accuracy": 0.7978556156158447,
"num_tokens": 71242071.0,
"step": 710
},
{
"entropy": 1.000390625,
"epoch": 0.0984009840098401,
"grad_norm": 0.5797347191053835,
"learning_rate": 4.901719036212484e-06,
"loss": 0.7515,
"mean_token_accuracy": 0.7974603176116943,
"num_tokens": 72300678.0,
"step": 720
},
{
"entropy": 1.0296875,
"epoch": 0.0997676643433101,
"grad_norm": 0.3367615044799,
"learning_rate": 4.898196421022968e-06,
"loss": 0.755,
"mean_token_accuracy": 0.7987989723682404,
"num_tokens": 73295969.0,
"step": 730
},
{
"entropy": 1.02265625,
"epoch": 0.1011343446767801,
"grad_norm": 0.3692198504590743,
"learning_rate": 4.894673805833451e-06,
"loss": 0.7219,
"mean_token_accuracy": 0.8042224228382111,
"num_tokens": 74224367.0,
"step": 740
},
{
"entropy": 1.033203125,
"epoch": 0.1025010250102501,
"grad_norm": 0.36052066253053106,
"learning_rate": 4.891151190643935e-06,
"loss": 0.782,
"mean_token_accuracy": 0.7912867367267609,
"num_tokens": 75220927.0,
"step": 750
},
{
"entropy": 1.030078125,
"epoch": 0.1038677053437201,
"grad_norm": 0.6794795246669783,
"learning_rate": 4.8876285754544175e-06,
"loss": 0.7655,
"mean_token_accuracy": 0.7949857771396637,
"num_tokens": 76264459.0,
"step": 760
},
{
"entropy": 1.0828125,
"epoch": 0.10523438567719011,
"grad_norm": 0.43004807665439043,
"learning_rate": 4.884105960264901e-06,
"loss": 0.8097,
"mean_token_accuracy": 0.7865951538085938,
"num_tokens": 77237576.0,
"step": 770
},
{
"entropy": 1.03828125,
"epoch": 0.1066010660106601,
"grad_norm": 0.31804185196907214,
"learning_rate": 4.880583345075385e-06,
"loss": 0.7649,
"mean_token_accuracy": 0.7966164171695709,
"num_tokens": 78233874.0,
"step": 780
},
{
"entropy": 1.008984375,
"epoch": 0.1079677463441301,
"grad_norm": 0.3260626827750938,
"learning_rate": 4.877060729885867e-06,
"loss": 0.7263,
"mean_token_accuracy": 0.8034639894962311,
"num_tokens": 79226628.0,
"step": 790
},
{
"entropy": 1.030078125,
"epoch": 0.10933442667760011,
"grad_norm": 0.3198673051724005,
"learning_rate": 4.873538114696351e-06,
"loss": 0.7496,
"mean_token_accuracy": 0.7981851160526275,
"num_tokens": 80216871.0,
"step": 800
},
{
"entropy": 1.037890625,
"epoch": 0.11070110701107011,
"grad_norm": 0.3451514200843694,
"learning_rate": 4.870015499506834e-06,
"loss": 0.7473,
"mean_token_accuracy": 0.8012232780456543,
"num_tokens": 81209897.0,
"step": 810
},
{
"entropy": 1.02421875,
"epoch": 0.1120677873445401,
"grad_norm": 0.3130728315106123,
"learning_rate": 4.866492884317318e-06,
"loss": 0.7466,
"mean_token_accuracy": 0.7983315706253051,
"num_tokens": 82222143.0,
"step": 820
},
{
"entropy": 1.016015625,
"epoch": 0.11343446767801012,
"grad_norm": 0.3351869596817912,
"learning_rate": 4.862970269127801e-06,
"loss": 0.7493,
"mean_token_accuracy": 0.801656711101532,
"num_tokens": 83210601.0,
"step": 830
},
{
"entropy": 1.048828125,
"epoch": 0.11480114801148011,
"grad_norm": 0.43247066685797764,
"learning_rate": 4.859447653938284e-06,
"loss": 0.7805,
"mean_token_accuracy": 0.7915208518505097,
"num_tokens": 84189098.0,
"step": 840
},
{
"entropy": 1.037109375,
"epoch": 0.11616782834495011,
"grad_norm": 0.4873139703313428,
"learning_rate": 4.855925038748768e-06,
"loss": 0.8031,
"mean_token_accuracy": 0.7897474706172943,
"num_tokens": 85278005.0,
"step": 850
},
{
"entropy": 1.035546875,
"epoch": 0.11753450867842012,
"grad_norm": 0.3449451596670836,
"learning_rate": 4.852402423559251e-06,
"loss": 0.7598,
"mean_token_accuracy": 0.7976079642772674,
"num_tokens": 86314347.0,
"step": 860
},
{
"entropy": 1.074609375,
"epoch": 0.11890118901189012,
"grad_norm": 0.3253912815851118,
"learning_rate": 4.848879808369734e-06,
"loss": 0.8157,
"mean_token_accuracy": 0.7866216480731965,
"num_tokens": 87295027.0,
"step": 870
},
{
"entropy": 1.025,
"epoch": 0.12026786934536011,
"grad_norm": 0.30417592763660156,
"learning_rate": 4.8453571931802175e-06,
"loss": 0.7256,
"mean_token_accuracy": 0.8040058016777039,
"num_tokens": 88315349.0,
"step": 880
},
{
"entropy": 0.992578125,
"epoch": 0.12163454967883013,
"grad_norm": 0.31770779807174737,
"learning_rate": 4.8418345779907e-06,
"loss": 0.7786,
"mean_token_accuracy": 0.7937738597393036,
"num_tokens": 89285381.0,
"step": 890
},
{
"entropy": 1.070703125,
"epoch": 0.12300123001230012,
"grad_norm": 0.6705946513126628,
"learning_rate": 4.838311962801184e-06,
"loss": 0.7892,
"mean_token_accuracy": 0.7905043542385102,
"num_tokens": 90306461.0,
"step": 900
},
{
"entropy": 1.0421875,
"epoch": 0.12436791034577012,
"grad_norm": 0.33337858999411,
"learning_rate": 4.834789347611667e-06,
"loss": 0.7736,
"mean_token_accuracy": 0.7933135211467743,
"num_tokens": 91255724.0,
"step": 910
},
{
"entropy": 1.049609375,
"epoch": 0.12573459067924012,
"grad_norm": 0.3338537006896635,
"learning_rate": 4.831266732422151e-06,
"loss": 0.763,
"mean_token_accuracy": 0.7986566305160523,
"num_tokens": 92220294.0,
"step": 920
},
{
"entropy": 0.98203125,
"epoch": 0.12710127101271013,
"grad_norm": 0.33446274329736775,
"learning_rate": 4.827744117232634e-06,
"loss": 0.7056,
"mean_token_accuracy": 0.8090991497039794,
"num_tokens": 93189250.0,
"step": 930
},
{
"entropy": 1.02578125,
"epoch": 0.12846795134618014,
"grad_norm": 0.38265128533507614,
"learning_rate": 4.824221502043117e-06,
"loss": 0.717,
"mean_token_accuracy": 0.8059083521366119,
"num_tokens": 94155449.0,
"step": 940
},
{
"entropy": 1.038671875,
"epoch": 0.12983463167965012,
"grad_norm": 0.3145561546948279,
"learning_rate": 4.820698886853601e-06,
"loss": 0.7762,
"mean_token_accuracy": 0.791105842590332,
"num_tokens": 95222208.0,
"step": 950
},
{
"entropy": 1.051953125,
"epoch": 0.13120131201312013,
"grad_norm": 0.31456486581313914,
"learning_rate": 4.817176271664084e-06,
"loss": 0.7635,
"mean_token_accuracy": 0.7961102902889252,
"num_tokens": 96240732.0,
"step": 960
},
{
"entropy": 1.00703125,
"epoch": 0.13256799234659014,
"grad_norm": 0.3004060519521831,
"learning_rate": 4.813653656474567e-06,
"loss": 0.7318,
"mean_token_accuracy": 0.8034555792808533,
"num_tokens": 97189622.0,
"step": 970
},
{
"entropy": 1.03125,
"epoch": 0.13393467268006012,
"grad_norm": 0.4130142267177563,
"learning_rate": 4.8101310412850505e-06,
"loss": 0.7568,
"mean_token_accuracy": 0.7959510207176208,
"num_tokens": 98193657.0,
"step": 980
},
{
"entropy": 1.006640625,
"epoch": 0.13530135301353013,
"grad_norm": 0.32077649833850197,
"learning_rate": 4.806608426095534e-06,
"loss": 0.7443,
"mean_token_accuracy": 0.8014862656593322,
"num_tokens": 99244929.0,
"step": 990
},
{
"entropy": 1.007421875,
"epoch": 0.13666803334700015,
"grad_norm": 0.41623518200237114,
"learning_rate": 4.803085810906017e-06,
"loss": 0.7302,
"mean_token_accuracy": 0.8027207136154175,
"num_tokens": 100253866.0,
"step": 1000
},
{
"entropy": 1.067578125,
"epoch": 0.13803471368047013,
"grad_norm": 0.36469462791521123,
"learning_rate": 4.7995631957165e-06,
"loss": 0.7799,
"mean_token_accuracy": 0.7918023645877839,
"num_tokens": 101284311.0,
"step": 1010
},
{
"entropy": 0.994921875,
"epoch": 0.13940139401394014,
"grad_norm": 0.3792315077231681,
"learning_rate": 4.796040580526984e-06,
"loss": 0.7106,
"mean_token_accuracy": 0.8076497673988342,
"num_tokens": 102289462.0,
"step": 1020
},
{
"entropy": 1.015234375,
"epoch": 0.14076807434741015,
"grad_norm": 0.3584945309457241,
"learning_rate": 4.792517965337467e-06,
"loss": 0.7469,
"mean_token_accuracy": 0.8000266253948212,
"num_tokens": 103255021.0,
"step": 1030
},
{
"entropy": 1.002734375,
"epoch": 0.14213475468088013,
"grad_norm": 0.3678835884459433,
"learning_rate": 4.78899535014795e-06,
"loss": 0.7003,
"mean_token_accuracy": 0.8103915452957153,
"num_tokens": 104261992.0,
"step": 1040
},
{
"entropy": 1.005078125,
"epoch": 0.14350143501435014,
"grad_norm": 0.3049010551947891,
"learning_rate": 4.785472734958434e-06,
"loss": 0.7295,
"mean_token_accuracy": 0.8022205173969269,
"num_tokens": 105292243.0,
"step": 1050
},
{
"entropy": 1.02109375,
"epoch": 0.14486811534782015,
"grad_norm": 0.2917531275988386,
"learning_rate": 4.781950119768916e-06,
"loss": 0.7314,
"mean_token_accuracy": 0.8011777639389038,
"num_tokens": 106305001.0,
"step": 1060
},
{
"entropy": 1.003125,
"epoch": 0.14623479568129014,
"grad_norm": 0.2883739426954743,
"learning_rate": 4.778427504579401e-06,
"loss": 0.7096,
"mean_token_accuracy": 0.8076059401035309,
"num_tokens": 107316342.0,
"step": 1070
},
{
"entropy": 0.972265625,
"epoch": 0.14760147601476015,
"grad_norm": 0.25440782257455624,
"learning_rate": 4.774904889389883e-06,
"loss": 0.7258,
"mean_token_accuracy": 0.8044800698757172,
"num_tokens": 108361044.0,
"step": 1080
},
{
"entropy": 1.014453125,
"epoch": 0.14896815634823016,
"grad_norm": 0.37385040756167454,
"learning_rate": 4.771382274200367e-06,
"loss": 0.7578,
"mean_token_accuracy": 0.7971827805042266,
"num_tokens": 109356718.0,
"step": 1090
},
{
"entropy": 1.04609375,
"epoch": 0.15033483668170014,
"grad_norm": 0.28640515088940943,
"learning_rate": 4.76785965901085e-06,
"loss": 0.79,
"mean_token_accuracy": 0.789400190114975,
"num_tokens": 110398127.0,
"step": 1100
},
{
"entropy": 1.065625,
"epoch": 0.15170151701517015,
"grad_norm": 0.32120051594489574,
"learning_rate": 4.764337043821333e-06,
"loss": 0.8043,
"mean_token_accuracy": 0.7864837765693664,
"num_tokens": 111382725.0,
"step": 1110
},
{
"entropy": 1.055078125,
"epoch": 0.15306819734864016,
"grad_norm": 0.33544300865025695,
"learning_rate": 4.760814428631817e-06,
"loss": 0.7551,
"mean_token_accuracy": 0.7974585473537446,
"num_tokens": 112369399.0,
"step": 1120
},
{
"entropy": 1.03359375,
"epoch": 0.15443487768211014,
"grad_norm": 0.34113581112628805,
"learning_rate": 4.7572918134423e-06,
"loss": 0.7585,
"mean_token_accuracy": 0.7974998593330384,
"num_tokens": 113312860.0,
"step": 1130
},
{
"entropy": 0.973046875,
"epoch": 0.15580155801558015,
"grad_norm": 0.30444841670529976,
"learning_rate": 4.753769198252783e-06,
"loss": 0.7163,
"mean_token_accuracy": 0.8056225657463074,
"num_tokens": 114320706.0,
"step": 1140
},
{
"entropy": 1.066015625,
"epoch": 0.15716823834905017,
"grad_norm": 0.34725926919383143,
"learning_rate": 4.7502465830632665e-06,
"loss": 0.769,
"mean_token_accuracy": 0.7946241915225982,
"num_tokens": 115361624.0,
"step": 1150
},
{
"entropy": 0.990625,
"epoch": 0.15853491868252015,
"grad_norm": 0.32114457392126167,
"learning_rate": 4.74672396787375e-06,
"loss": 0.7243,
"mean_token_accuracy": 0.8057344257831573,
"num_tokens": 116373525.0,
"step": 1160
},
{
"entropy": 1.003125,
"epoch": 0.15990159901599016,
"grad_norm": 0.2888803320453446,
"learning_rate": 4.743201352684233e-06,
"loss": 0.724,
"mean_token_accuracy": 0.8046858787536622,
"num_tokens": 117386597.0,
"step": 1170
},
{
"entropy": 1.025390625,
"epoch": 0.16126827934946017,
"grad_norm": 0.33891229702475467,
"learning_rate": 4.739678737494716e-06,
"loss": 0.754,
"mean_token_accuracy": 0.7992406547069549,
"num_tokens": 118360572.0,
"step": 1180
},
{
"entropy": 1.031640625,
"epoch": 0.16263495968293015,
"grad_norm": 0.35467423859306146,
"learning_rate": 4.7361561223052e-06,
"loss": 0.7374,
"mean_token_accuracy": 0.8009801566600799,
"num_tokens": 119348661.0,
"step": 1190
},
{
"entropy": 0.998828125,
"epoch": 0.16400164001640016,
"grad_norm": 0.449962736392674,
"learning_rate": 4.7326335071156834e-06,
"loss": 0.7337,
"mean_token_accuracy": 0.8041791319847107,
"num_tokens": 120333852.0,
"step": 1200
},
{
"entropy": 1.012890625,
"epoch": 0.16536832034987017,
"grad_norm": 0.28493624486321567,
"learning_rate": 4.729110891926166e-06,
"loss": 0.7512,
"mean_token_accuracy": 0.7989745676517487,
"num_tokens": 121367501.0,
"step": 1210
},
{
"entropy": 1.01171875,
"epoch": 0.16673500068334016,
"grad_norm": 0.5807344000804171,
"learning_rate": 4.72558827673665e-06,
"loss": 0.7525,
"mean_token_accuracy": 0.7980444371700287,
"num_tokens": 122322265.0,
"step": 1220
},
{
"entropy": 1.025,
"epoch": 0.16810168101681017,
"grad_norm": 0.3233251175200412,
"learning_rate": 4.722065661547132e-06,
"loss": 0.7674,
"mean_token_accuracy": 0.7980561077594757,
"num_tokens": 123326121.0,
"step": 1230
},
{
"entropy": 1.024609375,
"epoch": 0.16946836135028018,
"grad_norm": 0.3307472482316988,
"learning_rate": 4.718543046357617e-06,
"loss": 0.7595,
"mean_token_accuracy": 0.7974269986152649,
"num_tokens": 124379656.0,
"step": 1240
},
{
"entropy": 0.984765625,
"epoch": 0.17083504168375016,
"grad_norm": 0.3382305745930074,
"learning_rate": 4.7150204311680995e-06,
"loss": 0.7221,
"mean_token_accuracy": 0.8035790205001831,
"num_tokens": 125327601.0,
"step": 1250
},
{
"entropy": 1.028515625,
"epoch": 0.17220172201722017,
"grad_norm": 0.3198613415700917,
"learning_rate": 4.711497815978583e-06,
"loss": 0.748,
"mean_token_accuracy": 0.799483060836792,
"num_tokens": 126310987.0,
"step": 1260
},
{
"entropy": 1.0328125,
"epoch": 0.17356840235069018,
"grad_norm": 0.3371358843074316,
"learning_rate": 4.707975200789066e-06,
"loss": 0.7624,
"mean_token_accuracy": 0.7954389989376068,
"num_tokens": 127351646.0,
"step": 1270
},
{
"entropy": 1.031640625,
"epoch": 0.17493508268416016,
"grad_norm": 0.35372055612094044,
"learning_rate": 4.704452585599549e-06,
"loss": 0.7604,
"mean_token_accuracy": 0.796168452501297,
"num_tokens": 128345444.0,
"step": 1280
},
{
"entropy": 1.020703125,
"epoch": 0.17630176301763018,
"grad_norm": 0.32523019129549074,
"learning_rate": 4.700929970410033e-06,
"loss": 0.7377,
"mean_token_accuracy": 0.8018362700939179,
"num_tokens": 129339497.0,
"step": 1290
},
{
"entropy": 0.994921875,
"epoch": 0.17766844335110019,
"grad_norm": 0.3765922696814152,
"learning_rate": 4.697407355220516e-06,
"loss": 0.7421,
"mean_token_accuracy": 0.7996269583702087,
"num_tokens": 130382964.0,
"step": 1300
},
{
"entropy": 1.012890625,
"epoch": 0.17903512368457017,
"grad_norm": 0.3037440094721285,
"learning_rate": 4.693884740030999e-06,
"loss": 0.7342,
"mean_token_accuracy": 0.7997219443321228,
"num_tokens": 131333722.0,
"step": 1310
},
{
"entropy": 1.040234375,
"epoch": 0.18040180401804018,
"grad_norm": 0.29289846979514483,
"learning_rate": 4.690362124841483e-06,
"loss": 0.7703,
"mean_token_accuracy": 0.7950002729892731,
"num_tokens": 132332448.0,
"step": 1320
},
{
"entropy": 1.02265625,
"epoch": 0.1817684843515102,
"grad_norm": 0.32091375630399144,
"learning_rate": 4.686839509651966e-06,
"loss": 0.7276,
"mean_token_accuracy": 0.802885216474533,
"num_tokens": 133339343.0,
"step": 1330
},
{
"entropy": 1.019140625,
"epoch": 0.18313516468498017,
"grad_norm": 0.31805212026535024,
"learning_rate": 4.683316894462449e-06,
"loss": 0.7427,
"mean_token_accuracy": 0.799881100654602,
"num_tokens": 134361824.0,
"step": 1340
},
{
"entropy": 1.006640625,
"epoch": 0.18450184501845018,
"grad_norm": 0.30445442846422516,
"learning_rate": 4.679794279272933e-06,
"loss": 0.7544,
"mean_token_accuracy": 0.797343623638153,
"num_tokens": 135366570.0,
"step": 1350
},
{
"entropy": 1.025390625,
"epoch": 0.1858685253519202,
"grad_norm": 0.31271685634207136,
"learning_rate": 4.676271664083416e-06,
"loss": 0.7297,
"mean_token_accuracy": 0.8027778267860413,
"num_tokens": 136388166.0,
"step": 1360
},
{
"entropy": 1.06484375,
"epoch": 0.18723520568539018,
"grad_norm": 0.3928417797536979,
"learning_rate": 4.6727490488938995e-06,
"loss": 0.7748,
"mean_token_accuracy": 0.7941003382205963,
"num_tokens": 137334309.0,
"step": 1370
},
{
"entropy": 1.013671875,
"epoch": 0.1886018860188602,
"grad_norm": 0.2738522980687194,
"learning_rate": 4.669226433704382e-06,
"loss": 0.7446,
"mean_token_accuracy": 0.8006794691085816,
"num_tokens": 138333216.0,
"step": 1380
},
{
"entropy": 0.996875,
"epoch": 0.1899685663523302,
"grad_norm": 0.3072495016158934,
"learning_rate": 4.665703818514866e-06,
"loss": 0.7322,
"mean_token_accuracy": 0.802930474281311,
"num_tokens": 139302001.0,
"step": 1390
},
{
"entropy": 1.002734375,
"epoch": 0.19133524668580018,
"grad_norm": 0.30901351600751414,
"learning_rate": 4.6621812033253484e-06,
"loss": 0.7303,
"mean_token_accuracy": 0.803645521402359,
"num_tokens": 140300151.0,
"step": 1400
},
{
"entropy": 0.937890625,
"epoch": 0.1927019270192702,
"grad_norm": 0.2917862431762014,
"learning_rate": 4.658658588135833e-06,
"loss": 0.6852,
"mean_token_accuracy": 0.8131398797035218,
"num_tokens": 141291771.0,
"step": 1410
},
{
"entropy": 0.991015625,
"epoch": 0.1940686073527402,
"grad_norm": 0.3319293076574617,
"learning_rate": 4.6551359729463155e-06,
"loss": 0.7221,
"mean_token_accuracy": 0.8058219254016876,
"num_tokens": 142345426.0,
"step": 1420
},
{
"entropy": 1.043359375,
"epoch": 0.19543528768621019,
"grad_norm": 0.29744836831699356,
"learning_rate": 4.651613357756799e-06,
"loss": 0.7906,
"mean_token_accuracy": 0.7886937439441681,
"num_tokens": 143350038.0,
"step": 1430
},
{
"entropy": 1.035546875,
"epoch": 0.1968019680196802,
"grad_norm": 0.33687742428934475,
"learning_rate": 4.648090742567283e-06,
"loss": 0.7545,
"mean_token_accuracy": 0.7979585289955139,
"num_tokens": 144364790.0,
"step": 1440
},
{
"entropy": 1.020703125,
"epoch": 0.1981686483531502,
"grad_norm": 0.34748381780244875,
"learning_rate": 4.644568127377765e-06,
"loss": 0.7365,
"mean_token_accuracy": 0.8009274721145629,
"num_tokens": 145393023.0,
"step": 1450
},
{
"entropy": 1.008984375,
"epoch": 0.1995353286866202,
"grad_norm": 0.3848777431153921,
"learning_rate": 4.641045512188249e-06,
"loss": 0.7682,
"mean_token_accuracy": 0.796446430683136,
"num_tokens": 146402141.0,
"step": 1460
},
{
"entropy": 0.978515625,
"epoch": 0.2009020090200902,
"grad_norm": 0.30589133283780984,
"learning_rate": 4.6375228969987324e-06,
"loss": 0.7151,
"mean_token_accuracy": 0.804399311542511,
"num_tokens": 147429117.0,
"step": 1470
},
{
"entropy": 1.02265625,
"epoch": 0.2022686893535602,
"grad_norm": 0.3082746447659605,
"learning_rate": 4.634000281809216e-06,
"loss": 0.7317,
"mean_token_accuracy": 0.802127343416214,
"num_tokens": 148449641.0,
"step": 1480
},
{
"entropy": 0.98984375,
"epoch": 0.2036353696870302,
"grad_norm": 0.2807955356106806,
"learning_rate": 4.630477666619699e-06,
"loss": 0.7341,
"mean_token_accuracy": 0.802459043264389,
"num_tokens": 149435614.0,
"step": 1490
},
{
"entropy": 0.98203125,
"epoch": 0.2050020500205002,
"grad_norm": 0.30396755467781705,
"learning_rate": 4.626955051430182e-06,
"loss": 0.7204,
"mean_token_accuracy": 0.8068271100521087,
"num_tokens": 150463227.0,
"step": 1500
},
{
"entropy": 1.048828125,
"epoch": 0.20636873035397021,
"grad_norm": 0.3229086444162669,
"learning_rate": 4.623432436240665e-06,
"loss": 0.7848,
"mean_token_accuracy": 0.7920935332775116,
"num_tokens": 151395436.0,
"step": 1510
},
{
"entropy": 1.0015625,
"epoch": 0.2077354106874402,
"grad_norm": 0.33652398372098824,
"learning_rate": 4.619909821051149e-06,
"loss": 0.7261,
"mean_token_accuracy": 0.8031912267208099,
"num_tokens": 152324730.0,
"step": 1520
},
{
"entropy": 0.9953125,
"epoch": 0.2091020910209102,
"grad_norm": 0.3138937066978083,
"learning_rate": 4.616387205861632e-06,
"loss": 0.7424,
"mean_token_accuracy": 0.80039764046669,
"num_tokens": 153320864.0,
"step": 1530
},
{
"entropy": 0.983984375,
"epoch": 0.21046877135438022,
"grad_norm": 0.31173319415614076,
"learning_rate": 4.6128645906721156e-06,
"loss": 0.7351,
"mean_token_accuracy": 0.8019467830657959,
"num_tokens": 154278191.0,
"step": 1540
},
{
"entropy": 1.037890625,
"epoch": 0.2118354516878502,
"grad_norm": 0.3092397806606379,
"learning_rate": 4.609341975482598e-06,
"loss": 0.7467,
"mean_token_accuracy": 0.8006970524787903,
"num_tokens": 155275095.0,
"step": 1550
},
{
"entropy": 1.011328125,
"epoch": 0.2132021320213202,
"grad_norm": 0.313156554450749,
"learning_rate": 4.605819360293082e-06,
"loss": 0.7074,
"mean_token_accuracy": 0.806756442785263,
"num_tokens": 156313420.0,
"step": 1560
},
{
"entropy": 0.970703125,
"epoch": 0.21456881235479022,
"grad_norm": 0.4491981732090018,
"learning_rate": 4.602296745103565e-06,
"loss": 0.6788,
"mean_token_accuracy": 0.8135239839553833,
"num_tokens": 157298105.0,
"step": 1570
},
{
"entropy": 1.01796875,
"epoch": 0.2159354926882602,
"grad_norm": 0.3185572831730204,
"learning_rate": 4.598774129914049e-06,
"loss": 0.7782,
"mean_token_accuracy": 0.794141161441803,
"num_tokens": 158304186.0,
"step": 1580
},
{
"entropy": 1.023828125,
"epoch": 0.21730217302173022,
"grad_norm": 0.36646526112537486,
"learning_rate": 4.595251514724532e-06,
"loss": 0.7604,
"mean_token_accuracy": 0.7955964624881744,
"num_tokens": 159286903.0,
"step": 1590
},
{
"entropy": 0.998046875,
"epoch": 0.21866885335520023,
"grad_norm": 0.2809119295092121,
"learning_rate": 4.591728899535015e-06,
"loss": 0.7232,
"mean_token_accuracy": 0.8030906558036804,
"num_tokens": 160287992.0,
"step": 1600
},
{
"entropy": 0.971484375,
"epoch": 0.2200355336886702,
"grad_norm": 0.36671393885523035,
"learning_rate": 4.588206284345499e-06,
"loss": 0.6867,
"mean_token_accuracy": 0.8133134365081787,
"num_tokens": 161293325.0,
"step": 1610
},
{
"entropy": 1.059375,
"epoch": 0.22140221402214022,
"grad_norm": 0.3484133460890968,
"learning_rate": 4.584683669155981e-06,
"loss": 0.7895,
"mean_token_accuracy": 0.7900999844074249,
"num_tokens": 162313205.0,
"step": 1620
},
{
"entropy": 1.02890625,
"epoch": 0.22276889435561023,
"grad_norm": 0.31767159068755363,
"learning_rate": 4.581161053966465e-06,
"loss": 0.7415,
"mean_token_accuracy": 0.8020521640777588,
"num_tokens": 163369684.0,
"step": 1630
},
{
"entropy": 1.068359375,
"epoch": 0.2241355746890802,
"grad_norm": 0.35549882132105537,
"learning_rate": 4.5776384387769485e-06,
"loss": 0.7642,
"mean_token_accuracy": 0.7961217820644378,
"num_tokens": 164375021.0,
"step": 1640
},
{
"entropy": 0.994921875,
"epoch": 0.22550225502255022,
"grad_norm": 0.32078737370460475,
"learning_rate": 4.574115823587432e-06,
"loss": 0.7181,
"mean_token_accuracy": 0.8057355225086212,
"num_tokens": 165385723.0,
"step": 1650
},
{
"entropy": 0.994140625,
"epoch": 0.22686893535602023,
"grad_norm": 0.3047827515273823,
"learning_rate": 4.570593208397915e-06,
"loss": 0.7218,
"mean_token_accuracy": 0.8053807377815246,
"num_tokens": 166386777.0,
"step": 1660
},
{
"entropy": 1.016015625,
"epoch": 0.22823561568949022,
"grad_norm": 0.286850449823658,
"learning_rate": 4.567070593208398e-06,
"loss": 0.76,
"mean_token_accuracy": 0.7973976850509643,
"num_tokens": 167364188.0,
"step": 1670
},
{
"entropy": 1.00390625,
"epoch": 0.22960229602296023,
"grad_norm": 0.31832145024888037,
"learning_rate": 4.563547978018882e-06,
"loss": 0.7432,
"mean_token_accuracy": 0.7990332424640656,
"num_tokens": 168389909.0,
"step": 1680
},
{
"entropy": 0.991015625,
"epoch": 0.23096897635643024,
"grad_norm": 0.31040316748887975,
"learning_rate": 4.560025362829365e-06,
"loss": 0.7319,
"mean_token_accuracy": 0.8016668319702148,
"num_tokens": 169381885.0,
"step": 1690
},
{
"entropy": 0.996875,
"epoch": 0.23233565668990022,
"grad_norm": 0.30536177875552134,
"learning_rate": 4.556502747639848e-06,
"loss": 0.7448,
"mean_token_accuracy": 0.7996761858463287,
"num_tokens": 170399072.0,
"step": 1700
},
{
"entropy": 1.010546875,
"epoch": 0.23370233702337023,
"grad_norm": 0.2821313700771086,
"learning_rate": 4.552980132450332e-06,
"loss": 0.7473,
"mean_token_accuracy": 0.7966431856155396,
"num_tokens": 171449606.0,
"step": 1710
},
{
"entropy": 0.995703125,
"epoch": 0.23506901735684024,
"grad_norm": 0.2603753125707634,
"learning_rate": 4.549457517260814e-06,
"loss": 0.742,
"mean_token_accuracy": 0.8025155305862427,
"num_tokens": 172478002.0,
"step": 1720
},
{
"entropy": 0.985546875,
"epoch": 0.23643569769031023,
"grad_norm": 0.32681695898443575,
"learning_rate": 4.545934902071298e-06,
"loss": 0.712,
"mean_token_accuracy": 0.8068573415279389,
"num_tokens": 173536624.0,
"step": 1730
},
{
"entropy": 1.03984375,
"epoch": 0.23780237802378024,
"grad_norm": 0.3683467079103993,
"learning_rate": 4.5424122868817814e-06,
"loss": 0.7425,
"mean_token_accuracy": 0.7991344928741455,
"num_tokens": 174499171.0,
"step": 1740
},
{
"entropy": 0.980078125,
"epoch": 0.23916905835725025,
"grad_norm": 0.29682894636402973,
"learning_rate": 4.538889671692265e-06,
"loss": 0.7183,
"mean_token_accuracy": 0.8076237916946412,
"num_tokens": 175471599.0,
"step": 1750
},
{
"entropy": 0.991796875,
"epoch": 0.24053573869072023,
"grad_norm": 0.4594613587340168,
"learning_rate": 4.535367056502748e-06,
"loss": 0.7258,
"mean_token_accuracy": 0.8033030688762665,
"num_tokens": 176498065.0,
"step": 1760
},
{
"entropy": 1.019140625,
"epoch": 0.24190241902419024,
"grad_norm": 0.2902134142417007,
"learning_rate": 4.531844441313231e-06,
"loss": 0.753,
"mean_token_accuracy": 0.7975330412387848,
"num_tokens": 177499643.0,
"step": 1770
},
{
"entropy": 0.97421875,
"epoch": 0.24326909935766025,
"grad_norm": 0.2867661537793279,
"learning_rate": 4.528321826123715e-06,
"loss": 0.6924,
"mean_token_accuracy": 0.8110369920730591,
"num_tokens": 178477704.0,
"step": 1780
},
{
"entropy": 1.0171875,
"epoch": 0.24463577969113023,
"grad_norm": 0.2761384122706247,
"learning_rate": 4.524799210934198e-06,
"loss": 0.7223,
"mean_token_accuracy": 0.8053676724433899,
"num_tokens": 179484701.0,
"step": 1790
},
{
"entropy": 1.0109375,
"epoch": 0.24600246002460024,
"grad_norm": 0.32902299590311135,
"learning_rate": 4.521276595744681e-06,
"loss": 0.6884,
"mean_token_accuracy": 0.8140665411949157,
"num_tokens": 180460840.0,
"step": 1800
},
{
"entropy": 1.01640625,
"epoch": 0.24736914035807026,
"grad_norm": 0.3125134516743244,
"learning_rate": 4.5177539805551646e-06,
"loss": 0.7475,
"mean_token_accuracy": 0.8006490051746369,
"num_tokens": 181453261.0,
"step": 1810
},
{
"entropy": 0.99453125,
"epoch": 0.24873582069154024,
"grad_norm": 0.3229954184075109,
"learning_rate": 4.514231365365648e-06,
"loss": 0.7025,
"mean_token_accuracy": 0.8093625009059906,
"num_tokens": 182417078.0,
"step": 1820
},
{
"entropy": 1.005859375,
"epoch": 0.25010250102501025,
"grad_norm": 0.3054903512254197,
"learning_rate": 4.510708750176131e-06,
"loss": 0.7279,
"mean_token_accuracy": 0.8028040051460266,
"num_tokens": 183391495.0,
"step": 1830
},
{
"entropy": 0.988671875,
"epoch": 0.25146918135848023,
"grad_norm": 0.30707190069033785,
"learning_rate": 4.507186134986614e-06,
"loss": 0.7166,
"mean_token_accuracy": 0.8074613451957703,
"num_tokens": 184444423.0,
"step": 1840
},
{
"entropy": 0.979296875,
"epoch": 0.25283586169195027,
"grad_norm": 0.2697765305229652,
"learning_rate": 4.503663519797098e-06,
"loss": 0.7041,
"mean_token_accuracy": 0.8077803969383239,
"num_tokens": 185464205.0,
"step": 1850
},
{
"entropy": 0.995703125,
"epoch": 0.25420254202542025,
"grad_norm": 0.30700615739565673,
"learning_rate": 4.5001409046075814e-06,
"loss": 0.719,
"mean_token_accuracy": 0.8051420748233795,
"num_tokens": 186450985.0,
"step": 1860
},
{
"entropy": 0.978125,
"epoch": 0.25556922235889024,
"grad_norm": 0.2738211240716216,
"learning_rate": 4.496618289418064e-06,
"loss": 0.7068,
"mean_token_accuracy": 0.8089100062847138,
"num_tokens": 187494172.0,
"step": 1870
},
{
"entropy": 0.990625,
"epoch": 0.2569359026923603,
"grad_norm": 0.3274395183809003,
"learning_rate": 4.493095674228548e-06,
"loss": 0.7205,
"mean_token_accuracy": 0.8053383111953736,
"num_tokens": 188466326.0,
"step": 1880
},
{
"entropy": 1.0203125,
"epoch": 0.25830258302583026,
"grad_norm": 0.3728365665110441,
"learning_rate": 4.48957305903903e-06,
"loss": 0.752,
"mean_token_accuracy": 0.7982624292373657,
"num_tokens": 189486495.0,
"step": 1890
},
{
"entropy": 1.0203125,
"epoch": 0.25966926335930024,
"grad_norm": 0.3158300224509941,
"learning_rate": 4.486050443849515e-06,
"loss": 0.7083,
"mean_token_accuracy": 0.808662497997284,
"num_tokens": 190471394.0,
"step": 1900
},
{
"entropy": 0.998046875,
"epoch": 0.2610359436927703,
"grad_norm": 0.28673116203913873,
"learning_rate": 4.4825278286599975e-06,
"loss": 0.7181,
"mean_token_accuracy": 0.8058651447296142,
"num_tokens": 191482976.0,
"step": 1910
},
{
"entropy": 0.97265625,
"epoch": 0.26240262402624026,
"grad_norm": 0.32895548198254515,
"learning_rate": 4.479005213470481e-06,
"loss": 0.7227,
"mean_token_accuracy": 0.8052649319171905,
"num_tokens": 192487003.0,
"step": 1920
},
{
"entropy": 1.0078125,
"epoch": 0.26376930435971024,
"grad_norm": 0.3606790112305354,
"learning_rate": 4.475482598280964e-06,
"loss": 0.7738,
"mean_token_accuracy": 0.7894928276538848,
"num_tokens": 193484373.0,
"step": 1930
},
{
"entropy": 0.988671875,
"epoch": 0.2651359846931803,
"grad_norm": 0.2963044728930391,
"learning_rate": 4.471959983091447e-06,
"loss": 0.7252,
"mean_token_accuracy": 0.8047872841358185,
"num_tokens": 194489877.0,
"step": 1940
},
{
"entropy": 1.012890625,
"epoch": 0.26650266502665027,
"grad_norm": 0.2990119727506965,
"learning_rate": 4.468437367901931e-06,
"loss": 0.7115,
"mean_token_accuracy": 0.8071269631385803,
"num_tokens": 195497240.0,
"step": 1950
},
{
"entropy": 1.032421875,
"epoch": 0.26786934536012025,
"grad_norm": 0.3036341157325471,
"learning_rate": 4.464914752712414e-06,
"loss": 0.7628,
"mean_token_accuracy": 0.7963419258594513,
"num_tokens": 196488733.0,
"step": 1960
},
{
"entropy": 0.966796875,
"epoch": 0.2692360256935903,
"grad_norm": 0.3291925369680096,
"learning_rate": 4.461392137522897e-06,
"loss": 0.7137,
"mean_token_accuracy": 0.805299985408783,
"num_tokens": 197524439.0,
"step": 1970
},
{
"entropy": 0.973828125,
"epoch": 0.27060270602706027,
"grad_norm": 0.29630688198433686,
"learning_rate": 4.457869522333381e-06,
"loss": 0.7068,
"mean_token_accuracy": 0.8082444071769714,
"num_tokens": 198500937.0,
"step": 1980
},
{
"entropy": 0.994140625,
"epoch": 0.27196938636053025,
"grad_norm": 0.3350360896163294,
"learning_rate": 4.454346907143864e-06,
"loss": 0.7134,
"mean_token_accuracy": 0.8086515486240387,
"num_tokens": 199495588.0,
"step": 1990
},
{
"entropy": 1.03515625,
"epoch": 0.2733360666940003,
"grad_norm": 0.309238988084189,
"learning_rate": 4.450824291954347e-06,
"loss": 0.7297,
"mean_token_accuracy": 0.8035208106040954,
"num_tokens": 200506609.0,
"step": 2000
},
{
"entropy": 0.973828125,
"epoch": 0.2747027470274703,
"grad_norm": 0.2644546901447682,
"learning_rate": 4.44730167676483e-06,
"loss": 0.6911,
"mean_token_accuracy": 0.8123423516750335,
"num_tokens": 201514736.0,
"step": 2010
},
{
"entropy": 1.004296875,
"epoch": 0.27606942736094026,
"grad_norm": 0.30209130451424676,
"learning_rate": 4.443779061575314e-06,
"loss": 0.7453,
"mean_token_accuracy": 0.7998587489128113,
"num_tokens": 202528916.0,
"step": 2020
},
{
"entropy": 0.964453125,
"epoch": 0.2774361076944103,
"grad_norm": 0.3440613638492657,
"learning_rate": 4.4402564463857975e-06,
"loss": 0.6971,
"mean_token_accuracy": 0.8096495568752289,
"num_tokens": 203493505.0,
"step": 2030
},
{
"entropy": 1.003515625,
"epoch": 0.2788027880278803,
"grad_norm": 0.2847550286572455,
"learning_rate": 4.43673383119628e-06,
"loss": 0.7197,
"mean_token_accuracy": 0.8040563523769378,
"num_tokens": 204472127.0,
"step": 2040
},
{
"entropy": 0.99609375,
"epoch": 0.28016946836135026,
"grad_norm": 0.2871381812445324,
"learning_rate": 4.433211216006764e-06,
"loss": 0.7212,
"mean_token_accuracy": 0.8038869798183441,
"num_tokens": 205444690.0,
"step": 2050
},
{
"entropy": 0.978125,
"epoch": 0.2815361486948203,
"grad_norm": 0.2844134665854646,
"learning_rate": 4.4296886008172465e-06,
"loss": 0.726,
"mean_token_accuracy": 0.8021420240402222,
"num_tokens": 206433420.0,
"step": 2060
},
{
"entropy": 0.992578125,
"epoch": 0.2829028290282903,
"grad_norm": 0.29928231561442875,
"learning_rate": 4.426165985627731e-06,
"loss": 0.7041,
"mean_token_accuracy": 0.8089551270008087,
"num_tokens": 207474650.0,
"step": 2070
},
{
"entropy": 0.964453125,
"epoch": 0.28426950936176026,
"grad_norm": 0.3183233138705546,
"learning_rate": 4.4226433704382136e-06,
"loss": 0.7259,
"mean_token_accuracy": 0.8057370483875275,
"num_tokens": 208449182.0,
"step": 2080
},
{
"entropy": 0.981640625,
"epoch": 0.2856361896952303,
"grad_norm": 0.28741029987227484,
"learning_rate": 4.419120755248697e-06,
"loss": 0.7074,
"mean_token_accuracy": 0.8083296716213226,
"num_tokens": 209450690.0,
"step": 2090
},
{
"entropy": 1.053125,
"epoch": 0.2870028700287003,
"grad_norm": 0.28082467271802913,
"learning_rate": 4.41559814005918e-06,
"loss": 0.7733,
"mean_token_accuracy": 0.7932539403438568,
"num_tokens": 210469459.0,
"step": 2100
},
{
"entropy": 0.987890625,
"epoch": 0.28836955036217027,
"grad_norm": 0.31915472525408783,
"learning_rate": 4.412075524869663e-06,
"loss": 0.7184,
"mean_token_accuracy": 0.8063822209835052,
"num_tokens": 211422588.0,
"step": 2110
},
{
"entropy": 1.02265625,
"epoch": 0.2897362306956403,
"grad_norm": 0.3300242417733388,
"learning_rate": 4.408552909680147e-06,
"loss": 0.7513,
"mean_token_accuracy": 0.7987053334712982,
"num_tokens": 212401656.0,
"step": 2120
},
{
"entropy": 1.0,
"epoch": 0.2911029110291103,
"grad_norm": 0.30189567473088186,
"learning_rate": 4.4050302944906304e-06,
"loss": 0.7213,
"mean_token_accuracy": 0.8037928819656373,
"num_tokens": 213418240.0,
"step": 2130
},
{
"entropy": 0.98984375,
"epoch": 0.2924695913625803,
"grad_norm": 0.34256173301290266,
"learning_rate": 4.401507679301113e-06,
"loss": 0.7095,
"mean_token_accuracy": 0.8062712132930756,
"num_tokens": 214387238.0,
"step": 2140
},
{
"entropy": 1.061328125,
"epoch": 0.2938362716960503,
"grad_norm": 0.3310198678716763,
"learning_rate": 4.397985064111597e-06,
"loss": 0.7784,
"mean_token_accuracy": 0.7927683234214783,
"num_tokens": 215412774.0,
"step": 2150
},
{
"entropy": 1.0140625,
"epoch": 0.2952029520295203,
"grad_norm": 0.2805965011914587,
"learning_rate": 4.39446244892208e-06,
"loss": 0.7254,
"mean_token_accuracy": 0.8044215738773346,
"num_tokens": 216404116.0,
"step": 2160
},
{
"entropy": 1.001953125,
"epoch": 0.2965696323629903,
"grad_norm": 0.33463756798877375,
"learning_rate": 4.390939833732563e-06,
"loss": 0.7349,
"mean_token_accuracy": 0.8010693073272706,
"num_tokens": 217329569.0,
"step": 2170
},
{
"entropy": 0.99921875,
"epoch": 0.2979363126964603,
"grad_norm": 0.3025939439788873,
"learning_rate": 4.387417218543047e-06,
"loss": 0.7248,
"mean_token_accuracy": 0.8033001124858856,
"num_tokens": 218348233.0,
"step": 2180
},
{
"entropy": 0.971875,
"epoch": 0.2993029930299303,
"grad_norm": 0.29851381115220954,
"learning_rate": 4.38389460335353e-06,
"loss": 0.6799,
"mean_token_accuracy": 0.8139814853668212,
"num_tokens": 219347779.0,
"step": 2190
},
{
"entropy": 0.9953125,
"epoch": 0.3006696733634003,
"grad_norm": 0.270297334705833,
"learning_rate": 4.380371988164014e-06,
"loss": 0.7568,
"mean_token_accuracy": 0.7969937562942505,
"num_tokens": 220403938.0,
"step": 2200
},
{
"entropy": 0.9890625,
"epoch": 0.3020363536968703,
"grad_norm": 0.28155461263658116,
"learning_rate": 4.376849372974496e-06,
"loss": 0.7107,
"mean_token_accuracy": 0.8082155644893646,
"num_tokens": 221435776.0,
"step": 2210
},
{
"entropy": 0.97421875,
"epoch": 0.3034030340303403,
"grad_norm": 0.2754559406747442,
"learning_rate": 4.37332675778498e-06,
"loss": 0.7182,
"mean_token_accuracy": 0.8052756547927856,
"num_tokens": 222450369.0,
"step": 2220
},
{
"entropy": 0.99296875,
"epoch": 0.3047697143638103,
"grad_norm": 0.35318233926299136,
"learning_rate": 4.369804142595463e-06,
"loss": 0.7421,
"mean_token_accuracy": 0.8014789998531342,
"num_tokens": 223430185.0,
"step": 2230
},
{
"entropy": 0.9984375,
"epoch": 0.3061363946972803,
"grad_norm": 0.31075135134463766,
"learning_rate": 4.366281527405947e-06,
"loss": 0.7317,
"mean_token_accuracy": 0.8035633325576782,
"num_tokens": 224476704.0,
"step": 2240
},
{
"entropy": 0.962890625,
"epoch": 0.3075030750307503,
"grad_norm": 0.29154177173686485,
"learning_rate": 4.36275891221643e-06,
"loss": 0.6935,
"mean_token_accuracy": 0.8079265892505646,
"num_tokens": 225491846.0,
"step": 2250
},
{
"entropy": 0.962890625,
"epoch": 0.3088697553642203,
"grad_norm": 0.30985399741114916,
"learning_rate": 4.359236297026913e-06,
"loss": 0.7112,
"mean_token_accuracy": 0.8071798026561737,
"num_tokens": 226484127.0,
"step": 2260
},
{
"entropy": 0.94921875,
"epoch": 0.3102364356976903,
"grad_norm": 0.3397455115356908,
"learning_rate": 4.355713681837396e-06,
"loss": 0.6866,
"mean_token_accuracy": 0.8126883983612061,
"num_tokens": 227474908.0,
"step": 2270
},
{
"entropy": 0.975,
"epoch": 0.3116031160311603,
"grad_norm": 0.2961340613155821,
"learning_rate": 4.352191066647879e-06,
"loss": 0.7119,
"mean_token_accuracy": 0.8053794384002686,
"num_tokens": 228463177.0,
"step": 2280
},
{
"entropy": 0.993359375,
"epoch": 0.3129697963646303,
"grad_norm": 0.34291353474094166,
"learning_rate": 4.348668451458363e-06,
"loss": 0.7362,
"mean_token_accuracy": 0.802696031332016,
"num_tokens": 229469712.0,
"step": 2290
},
{
"entropy": 1.0015625,
"epoch": 0.31433647669810033,
"grad_norm": 0.2903709008265706,
"learning_rate": 4.3451458362688465e-06,
"loss": 0.7251,
"mean_token_accuracy": 0.8039977967739105,
"num_tokens": 230474108.0,
"step": 2300
},
{
"entropy": 1.022265625,
"epoch": 0.3157031570315703,
"grad_norm": 0.2947489494023131,
"learning_rate": 4.34162322107933e-06,
"loss": 0.7161,
"mean_token_accuracy": 0.8073600947856903,
"num_tokens": 231443208.0,
"step": 2310
},
{
"entropy": 1.003515625,
"epoch": 0.3170698373650403,
"grad_norm": 0.2853555412683983,
"learning_rate": 4.338100605889813e-06,
"loss": 0.7118,
"mean_token_accuracy": 0.8079809010028839,
"num_tokens": 232407706.0,
"step": 2320
},
{
"entropy": 0.96484375,
"epoch": 0.31843651769851034,
"grad_norm": 0.2977074981375323,
"learning_rate": 4.334577990700296e-06,
"loss": 0.6514,
"mean_token_accuracy": 0.8223943591117859,
"num_tokens": 233367033.0,
"step": 2330
},
{
"entropy": 1.028515625,
"epoch": 0.3198031980319803,
"grad_norm": 0.3045677263605549,
"learning_rate": 4.33105537551078e-06,
"loss": 0.758,
"mean_token_accuracy": 0.7974882364273072,
"num_tokens": 234337713.0,
"step": 2340
},
{
"entropy": 0.9796875,
"epoch": 0.3211698783654503,
"grad_norm": 0.3897191949153473,
"learning_rate": 4.327532760321263e-06,
"loss": 0.6924,
"mean_token_accuracy": 0.8123081505298615,
"num_tokens": 235293773.0,
"step": 2350
},
{
"entropy": 0.985546875,
"epoch": 0.32253655869892034,
"grad_norm": 0.3332463010345645,
"learning_rate": 4.324010145131746e-06,
"loss": 0.7389,
"mean_token_accuracy": 0.8011645615100861,
"num_tokens": 236278533.0,
"step": 2360
},
{
"entropy": 0.99609375,
"epoch": 0.3239032390323903,
"grad_norm": 0.26274479658987826,
"learning_rate": 4.32048752994223e-06,
"loss": 0.7241,
"mean_token_accuracy": 0.8044654667377472,
"num_tokens": 237320727.0,
"step": 2370
},
{
"entropy": 1.0109375,
"epoch": 0.3252699193658603,
"grad_norm": 0.2931559479090642,
"learning_rate": 4.316964914752712e-06,
"loss": 0.7321,
"mean_token_accuracy": 0.8024771034717559,
"num_tokens": 238313682.0,
"step": 2380
},
{
"entropy": 1.010546875,
"epoch": 0.32663659969933034,
"grad_norm": 0.32849280247775364,
"learning_rate": 4.313442299563196e-06,
"loss": 0.7794,
"mean_token_accuracy": 0.7940086960792542,
"num_tokens": 239272562.0,
"step": 2390
},
{
"entropy": 0.987109375,
"epoch": 0.3280032800328003,
"grad_norm": 0.31840628050955705,
"learning_rate": 4.3099196843736794e-06,
"loss": 0.7254,
"mean_token_accuracy": 0.8047082781791687,
"num_tokens": 240247837.0,
"step": 2400
},
{
"entropy": 0.996484375,
"epoch": 0.3293699603662703,
"grad_norm": 0.2917171959028551,
"learning_rate": 4.306397069184163e-06,
"loss": 0.7139,
"mean_token_accuracy": 0.8048073530197144,
"num_tokens": 241244375.0,
"step": 2410
},
{
"entropy": 1.003515625,
"epoch": 0.33073664069974035,
"grad_norm": 0.34343100617896405,
"learning_rate": 4.302874453994646e-06,
"loss": 0.7427,
"mean_token_accuracy": 0.7991726696491241,
"num_tokens": 242235921.0,
"step": 2420
},
{
"entropy": 0.998046875,
"epoch": 0.33210332103321033,
"grad_norm": 0.3223997287275069,
"learning_rate": 4.299351838805129e-06,
"loss": 0.6983,
"mean_token_accuracy": 0.8104216694831848,
"num_tokens": 243226532.0,
"step": 2430
},
{
"entropy": 1.00625,
"epoch": 0.3334700013666803,
"grad_norm": 0.26708737367555885,
"learning_rate": 4.295829223615613e-06,
"loss": 0.7299,
"mean_token_accuracy": 0.8035477221012115,
"num_tokens": 244230951.0,
"step": 2440
},
{
"entropy": 1.0140625,
"epoch": 0.33483668170015035,
"grad_norm": 0.32423114509225615,
"learning_rate": 4.292306608426096e-06,
"loss": 0.7257,
"mean_token_accuracy": 0.8037355363368988,
"num_tokens": 245216118.0,
"step": 2450
},
{
"entropy": 0.9625,
"epoch": 0.33620336203362033,
"grad_norm": 0.2835329668007959,
"learning_rate": 4.288783993236579e-06,
"loss": 0.7069,
"mean_token_accuracy": 0.8083659172058105,
"num_tokens": 246233429.0,
"step": 2460
},
{
"entropy": 1.008984375,
"epoch": 0.3375700423670903,
"grad_norm": 0.3068171426072291,
"learning_rate": 4.285261378047063e-06,
"loss": 0.7086,
"mean_token_accuracy": 0.8074593424797059,
"num_tokens": 247241545.0,
"step": 2470
},
{
"entropy": 0.994921875,
"epoch": 0.33893672270056036,
"grad_norm": 0.27442135971417403,
"learning_rate": 4.281738762857546e-06,
"loss": 0.7253,
"mean_token_accuracy": 0.8024203658103943,
"num_tokens": 248252703.0,
"step": 2480
},
{
"entropy": 1.040234375,
"epoch": 0.34030340303403034,
"grad_norm": 0.34532435035469755,
"learning_rate": 4.278216147668029e-06,
"loss": 0.7291,
"mean_token_accuracy": 0.8039904534816742,
"num_tokens": 249259960.0,
"step": 2490
},
{
"entropy": 0.996875,
"epoch": 0.3416700833675003,
"grad_norm": 0.2936767636414406,
"learning_rate": 4.274693532478512e-06,
"loss": 0.761,
"mean_token_accuracy": 0.7948627769947052,
"num_tokens": 250256940.0,
"step": 2500
},
{
"entropy": 0.95546875,
"epoch": 0.34303676370097036,
"grad_norm": 0.2804530580212985,
"learning_rate": 4.271170917288996e-06,
"loss": 0.7024,
"mean_token_accuracy": 0.8090153813362122,
"num_tokens": 251256658.0,
"step": 2510
},
{
"entropy": 0.983984375,
"epoch": 0.34440344403444034,
"grad_norm": 0.32866424165092467,
"learning_rate": 4.2676483020994795e-06,
"loss": 0.7001,
"mean_token_accuracy": 0.8092387020587921,
"num_tokens": 252264359.0,
"step": 2520
},
{
"entropy": 1.00078125,
"epoch": 0.3457701243679103,
"grad_norm": 0.30849535466177785,
"learning_rate": 4.264125686909962e-06,
"loss": 0.7439,
"mean_token_accuracy": 0.8000994443893432,
"num_tokens": 253309857.0,
"step": 2530
},
{
"entropy": 1.004296875,
"epoch": 0.34713680470138036,
"grad_norm": 0.28310118442445364,
"learning_rate": 4.260603071720446e-06,
"loss": 0.7478,
"mean_token_accuracy": 0.8003206253051758,
"num_tokens": 254290565.0,
"step": 2540
},
{
"entropy": 1.03515625,
"epoch": 0.34850348503485035,
"grad_norm": 0.326153136232305,
"learning_rate": 4.257080456530928e-06,
"loss": 0.7516,
"mean_token_accuracy": 0.7971282720565795,
"num_tokens": 255281492.0,
"step": 2550
},
{
"entropy": 0.973046875,
"epoch": 0.34987016536832033,
"grad_norm": 0.2803980454933073,
"learning_rate": 4.253557841341413e-06,
"loss": 0.6873,
"mean_token_accuracy": 0.8116559624671936,
"num_tokens": 256296392.0,
"step": 2560
},
{
"entropy": 0.98828125,
"epoch": 0.35123684570179037,
"grad_norm": 0.338513531294206,
"learning_rate": 4.2500352261518955e-06,
"loss": 0.7134,
"mean_token_accuracy": 0.805745393037796,
"num_tokens": 257302063.0,
"step": 2570
},
{
"entropy": 0.94609375,
"epoch": 0.35260352603526035,
"grad_norm": 0.2854030004092913,
"learning_rate": 4.246512610962379e-06,
"loss": 0.6997,
"mean_token_accuracy": 0.8101855337619781,
"num_tokens": 258304554.0,
"step": 2580
},
{
"entropy": 1.010546875,
"epoch": 0.35397020636873033,
"grad_norm": 0.31632626530365127,
"learning_rate": 4.242989995772862e-06,
"loss": 0.729,
"mean_token_accuracy": 0.8030967593193055,
"num_tokens": 259259663.0,
"step": 2590
},
{
"entropy": 0.996484375,
"epoch": 0.35533688670220037,
"grad_norm": 0.2693481519887577,
"learning_rate": 4.239467380583345e-06,
"loss": 0.7311,
"mean_token_accuracy": 0.8030301451683044,
"num_tokens": 260318431.0,
"step": 2600
},
{
"entropy": 0.967578125,
"epoch": 0.35670356703567035,
"grad_norm": 0.28197440683478636,
"learning_rate": 4.235944765393829e-06,
"loss": 0.6865,
"mean_token_accuracy": 0.8131609320640564,
"num_tokens": 261314415.0,
"step": 2610
},
{
"entropy": 0.994140625,
"epoch": 0.35807024736914034,
"grad_norm": 0.3315861683726455,
"learning_rate": 4.232422150204312e-06,
"loss": 0.7365,
"mean_token_accuracy": 0.7998292744159698,
"num_tokens": 262280825.0,
"step": 2620
},
{
"entropy": 1.039453125,
"epoch": 0.3594369277026104,
"grad_norm": 0.29178403324551777,
"learning_rate": 4.228899535014795e-06,
"loss": 0.7548,
"mean_token_accuracy": 0.7961309790611267,
"num_tokens": 263248393.0,
"step": 2630
},
{
"entropy": 0.99375,
"epoch": 0.36080360803608036,
"grad_norm": 0.3311113043457061,
"learning_rate": 4.225376919825279e-06,
"loss": 0.7293,
"mean_token_accuracy": 0.8021280944347382,
"num_tokens": 264237945.0,
"step": 2640
},
{
"entropy": 0.973046875,
"epoch": 0.36217028836955034,
"grad_norm": 0.2811706644171118,
"learning_rate": 4.221854304635762e-06,
"loss": 0.7144,
"mean_token_accuracy": 0.80492182970047,
"num_tokens": 265242177.0,
"step": 2650
},
{
"entropy": 1.03046875,
"epoch": 0.3635369687030204,
"grad_norm": 0.29819240706211,
"learning_rate": 4.218331689446245e-06,
"loss": 0.7726,
"mean_token_accuracy": 0.7936560869216919,
"num_tokens": 266261360.0,
"step": 2660
},
{
"entropy": 0.975390625,
"epoch": 0.36490364903649036,
"grad_norm": 0.35282374790328536,
"learning_rate": 4.2148090742567284e-06,
"loss": 0.6837,
"mean_token_accuracy": 0.8142777204513549,
"num_tokens": 267257220.0,
"step": 2670
},
{
"entropy": 0.980859375,
"epoch": 0.36627032936996035,
"grad_norm": 0.29164617521050434,
"learning_rate": 4.211286459067212e-06,
"loss": 0.7397,
"mean_token_accuracy": 0.7998878240585328,
"num_tokens": 268317830.0,
"step": 2680
},
{
"entropy": 0.9578125,
"epoch": 0.3676370097034304,
"grad_norm": 0.2608071197678855,
"learning_rate": 4.2077638438776955e-06,
"loss": 0.6756,
"mean_token_accuracy": 0.8154746532440186,
"num_tokens": 269283864.0,
"step": 2690
},
{
"entropy": 0.961328125,
"epoch": 0.36900369003690037,
"grad_norm": 0.30538540139836806,
"learning_rate": 4.204241228688178e-06,
"loss": 0.6979,
"mean_token_accuracy": 0.8102354228496551,
"num_tokens": 270373918.0,
"step": 2700
},
{
"entropy": 0.97421875,
"epoch": 0.37037037037037035,
"grad_norm": 0.3043043196690158,
"learning_rate": 4.200718613498662e-06,
"loss": 0.6859,
"mean_token_accuracy": 0.813792759180069,
"num_tokens": 271394623.0,
"step": 2710
},
{
"entropy": 0.9890625,
"epoch": 0.3717370507038404,
"grad_norm": 0.3251374779136682,
"learning_rate": 4.1971959983091445e-06,
"loss": 0.7036,
"mean_token_accuracy": 0.8079059481620788,
"num_tokens": 272366138.0,
"step": 2720
},
{
"entropy": 0.958984375,
"epoch": 0.37310373103731037,
"grad_norm": 0.2876230063540194,
"learning_rate": 4.193673383119629e-06,
"loss": 0.681,
"mean_token_accuracy": 0.8150547683238983,
"num_tokens": 273393329.0,
"step": 2730
},
{
"entropy": 1.03828125,
"epoch": 0.37447041137078035,
"grad_norm": 0.29270239311702817,
"learning_rate": 4.190150767930112e-06,
"loss": 0.7709,
"mean_token_accuracy": 0.7949062883853912,
"num_tokens": 274456082.0,
"step": 2740
},
{
"entropy": 1.03046875,
"epoch": 0.3758370917042504,
"grad_norm": 0.284867085943205,
"learning_rate": 4.186628152740595e-06,
"loss": 0.7388,
"mean_token_accuracy": 0.8010484516620636,
"num_tokens": 275482962.0,
"step": 2750
},
{
"entropy": 0.983203125,
"epoch": 0.3772037720377204,
"grad_norm": 0.347291895762802,
"learning_rate": 4.183105537551078e-06,
"loss": 0.709,
"mean_token_accuracy": 0.8063643634319305,
"num_tokens": 276499414.0,
"step": 2760
},
{
"entropy": 1.01171875,
"epoch": 0.37857045237119036,
"grad_norm": 0.3078971102364497,
"learning_rate": 4.179582922361561e-06,
"loss": 0.7378,
"mean_token_accuracy": 0.8009284317493439,
"num_tokens": 277471208.0,
"step": 2770
},
{
"entropy": 1.01171875,
"epoch": 0.3799371327046604,
"grad_norm": 0.3401100861459825,
"learning_rate": 4.176060307172045e-06,
"loss": 0.7307,
"mean_token_accuracy": 0.8022192418575287,
"num_tokens": 278492364.0,
"step": 2780
},
{
"entropy": 0.983203125,
"epoch": 0.3813038130381304,
"grad_norm": 0.2999810711787555,
"learning_rate": 4.1725376919825285e-06,
"loss": 0.6978,
"mean_token_accuracy": 0.8101940989494324,
"num_tokens": 279461129.0,
"step": 2790
},
{
"entropy": 1.00234375,
"epoch": 0.38267049337160036,
"grad_norm": 0.3013494509006066,
"learning_rate": 4.169015076793011e-06,
"loss": 0.7396,
"mean_token_accuracy": 0.8018145680427551,
"num_tokens": 280432345.0,
"step": 2800
},
{
"entropy": 0.973046875,
"epoch": 0.3840371737050704,
"grad_norm": 0.32781499701079747,
"learning_rate": 4.165492461603495e-06,
"loss": 0.7003,
"mean_token_accuracy": 0.8077415406703949,
"num_tokens": 281431868.0,
"step": 2810
},
{
"entropy": 0.983203125,
"epoch": 0.3854038540385404,
"grad_norm": 0.3297640758920506,
"learning_rate": 4.161969846413978e-06,
"loss": 0.6991,
"mean_token_accuracy": 0.8094355940818787,
"num_tokens": 282396063.0,
"step": 2820
},
{
"entropy": 0.931640625,
"epoch": 0.38677053437201037,
"grad_norm": 0.2779940179480932,
"learning_rate": 4.158447231224461e-06,
"loss": 0.6839,
"mean_token_accuracy": 0.8129307746887207,
"num_tokens": 283462179.0,
"step": 2830
},
{
"entropy": 0.99453125,
"epoch": 0.3881372147054804,
"grad_norm": 0.29875111704146906,
"learning_rate": 4.1549246160349445e-06,
"loss": 0.7229,
"mean_token_accuracy": 0.8042099952697754,
"num_tokens": 284512317.0,
"step": 2840
},
{
"entropy": 0.976171875,
"epoch": 0.3895038950389504,
"grad_norm": 0.2736891122587711,
"learning_rate": 4.151402000845428e-06,
"loss": 0.6979,
"mean_token_accuracy": 0.8093653380870819,
"num_tokens": 285546366.0,
"step": 2850
},
{
"entropy": 0.966015625,
"epoch": 0.39087057537242037,
"grad_norm": 0.27615274475560664,
"learning_rate": 4.147879385655912e-06,
"loss": 0.6668,
"mean_token_accuracy": 0.8181733667850495,
"num_tokens": 286536086.0,
"step": 2860
},
{
"entropy": 0.971875,
"epoch": 0.3922372557058904,
"grad_norm": 0.3246221997057017,
"learning_rate": 4.144356770466394e-06,
"loss": 0.6987,
"mean_token_accuracy": 0.8095854878425598,
"num_tokens": 287506225.0,
"step": 2870
},
{
"entropy": 1.056640625,
"epoch": 0.3936039360393604,
"grad_norm": 0.284752472356369,
"learning_rate": 4.140834155276878e-06,
"loss": 0.7783,
"mean_token_accuracy": 0.7930019438266754,
"num_tokens": 288517766.0,
"step": 2880
},
{
"entropy": 1.00859375,
"epoch": 0.3949706163728304,
"grad_norm": 0.2833659062608655,
"learning_rate": 4.137311540087361e-06,
"loss": 0.7168,
"mean_token_accuracy": 0.8067003786563873,
"num_tokens": 289575438.0,
"step": 2890
},
{
"entropy": 1.028515625,
"epoch": 0.3963372967063004,
"grad_norm": 0.3112640026286998,
"learning_rate": 4.133788924897845e-06,
"loss": 0.7335,
"mean_token_accuracy": 0.8022378206253051,
"num_tokens": 290579778.0,
"step": 2900
},
{
"entropy": 0.957421875,
"epoch": 0.3977039770397704,
"grad_norm": 0.264710871939785,
"learning_rate": 4.130266309708328e-06,
"loss": 0.6641,
"mean_token_accuracy": 0.8198276102542877,
"num_tokens": 291573891.0,
"step": 2910
},
{
"entropy": 1.017578125,
"epoch": 0.3990706573732404,
"grad_norm": 0.2958329986528685,
"learning_rate": 4.126743694518811e-06,
"loss": 0.7452,
"mean_token_accuracy": 0.7994361639022827,
"num_tokens": 292603953.0,
"step": 2920
},
{
"entropy": 0.99921875,
"epoch": 0.4004373377067104,
"grad_norm": 0.3766127209463997,
"learning_rate": 4.123221079329294e-06,
"loss": 0.691,
"mean_token_accuracy": 0.8109338581562042,
"num_tokens": 293541021.0,
"step": 2930
},
{
"entropy": 0.99375,
"epoch": 0.4018040180401804,
"grad_norm": 0.3340890861861796,
"learning_rate": 4.1196984641397774e-06,
"loss": 0.7303,
"mean_token_accuracy": 0.8016102313995361,
"num_tokens": 294528087.0,
"step": 2940
},
{
"entropy": 0.962109375,
"epoch": 0.4031706983736504,
"grad_norm": 0.28909977633081874,
"learning_rate": 4.116175848950261e-06,
"loss": 0.6644,
"mean_token_accuracy": 0.8190057873725891,
"num_tokens": 295510553.0,
"step": 2950
},
{
"entropy": 0.98203125,
"epoch": 0.4045373787071204,
"grad_norm": 0.29813517006231577,
"learning_rate": 4.1126532337607445e-06,
"loss": 0.6734,
"mean_token_accuracy": 0.8144641041755676,
"num_tokens": 296428358.0,
"step": 2960
},
{
"entropy": 1.01484375,
"epoch": 0.4059040590405904,
"grad_norm": 0.33173904422408385,
"learning_rate": 4.109130618571227e-06,
"loss": 0.7297,
"mean_token_accuracy": 0.8033695995807648,
"num_tokens": 297444594.0,
"step": 2970
},
{
"entropy": 1.004296875,
"epoch": 0.4072707393740604,
"grad_norm": 0.3230832806167339,
"learning_rate": 4.105608003381711e-06,
"loss": 0.7034,
"mean_token_accuracy": 0.8062468349933625,
"num_tokens": 298427763.0,
"step": 2980
},
{
"entropy": 0.959375,
"epoch": 0.4086374197075304,
"grad_norm": 0.29121377922102565,
"learning_rate": 4.102085388192194e-06,
"loss": 0.6999,
"mean_token_accuracy": 0.8097927868366241,
"num_tokens": 299412943.0,
"step": 2990
},
{
"entropy": 0.987890625,
"epoch": 0.4100041000410004,
"grad_norm": 0.3105720358697927,
"learning_rate": 4.098562773002678e-06,
"loss": 0.7299,
"mean_token_accuracy": 0.801446121931076,
"num_tokens": 300389659.0,
"step": 3000
},
{
"entropy": 0.958984375,
"epoch": 0.4113707803744704,
"grad_norm": 0.3043034170586837,
"learning_rate": 4.095040157813161e-06,
"loss": 0.6896,
"mean_token_accuracy": 0.8114208281040192,
"num_tokens": 301433498.0,
"step": 3010
},
{
"entropy": 1.00546875,
"epoch": 0.41273746070794043,
"grad_norm": 0.3397763171616319,
"learning_rate": 4.091517542623644e-06,
"loss": 0.7325,
"mean_token_accuracy": 0.8017019748687744,
"num_tokens": 302413081.0,
"step": 3020
},
{
"entropy": 1.037890625,
"epoch": 0.4141041410414104,
"grad_norm": 0.33389366135963927,
"learning_rate": 4.087994927434128e-06,
"loss": 0.7482,
"mean_token_accuracy": 0.7987248003482819,
"num_tokens": 303402573.0,
"step": 3030
},
{
"entropy": 0.9984375,
"epoch": 0.4154708213748804,
"grad_norm": 0.2795776510212591,
"learning_rate": 4.08447231224461e-06,
"loss": 0.726,
"mean_token_accuracy": 0.8024433195590973,
"num_tokens": 304370910.0,
"step": 3040
},
{
"entropy": 0.943359375,
"epoch": 0.41683750170835043,
"grad_norm": 0.29146912063705344,
"learning_rate": 4.080949697055094e-06,
"loss": 0.6568,
"mean_token_accuracy": 0.8182348489761353,
"num_tokens": 305334775.0,
"step": 3050
},
{
"entropy": 0.970703125,
"epoch": 0.4182041820418204,
"grad_norm": 0.2969213802266572,
"learning_rate": 4.0774270818655775e-06,
"loss": 0.7029,
"mean_token_accuracy": 0.8094096779823303,
"num_tokens": 306353872.0,
"step": 3060
},
{
"entropy": 1.019140625,
"epoch": 0.4195708623752904,
"grad_norm": 0.3258532232593765,
"learning_rate": 4.073904466676061e-06,
"loss": 0.7483,
"mean_token_accuracy": 0.7982745587825775,
"num_tokens": 307331806.0,
"step": 3070
},
{
"entropy": 1.001953125,
"epoch": 0.42093754270876044,
"grad_norm": 0.35618066449788743,
"learning_rate": 4.070381851486544e-06,
"loss": 0.7171,
"mean_token_accuracy": 0.8080976486206055,
"num_tokens": 308368576.0,
"step": 3080
},
{
"entropy": 0.979296875,
"epoch": 0.4223042230422304,
"grad_norm": 0.3084739176800711,
"learning_rate": 4.066859236297027e-06,
"loss": 0.6917,
"mean_token_accuracy": 0.8114745438098907,
"num_tokens": 309387885.0,
"step": 3090
},
{
"entropy": 0.990625,
"epoch": 0.4236709033757004,
"grad_norm": 0.3283953712500041,
"learning_rate": 4.06333662110751e-06,
"loss": 0.7065,
"mean_token_accuracy": 0.8087661981582641,
"num_tokens": 310360880.0,
"step": 3100
},
{
"entropy": 1.02421875,
"epoch": 0.42503758370917044,
"grad_norm": 0.302683059338189,
"learning_rate": 4.059814005917994e-06,
"loss": 0.7458,
"mean_token_accuracy": 0.8004996716976166,
"num_tokens": 311413015.0,
"step": 3110
},
{
"entropy": 0.982421875,
"epoch": 0.4264042640426404,
"grad_norm": 0.29916614204328257,
"learning_rate": 4.056291390728477e-06,
"loss": 0.7084,
"mean_token_accuracy": 0.8084153294563293,
"num_tokens": 312411848.0,
"step": 3120
},
{
"entropy": 1.037109375,
"epoch": 0.4277709443761104,
"grad_norm": 0.34737843471959895,
"learning_rate": 4.052768775538961e-06,
"loss": 0.7353,
"mean_token_accuracy": 0.8031761825084687,
"num_tokens": 313432995.0,
"step": 3130
},
{
"entropy": 1.001171875,
"epoch": 0.42913762470958045,
"grad_norm": 0.3660262585573623,
"learning_rate": 4.049246160349444e-06,
"loss": 0.7533,
"mean_token_accuracy": 0.7997193276882172,
"num_tokens": 314460323.0,
"step": 3140
},
{
"entropy": 0.972265625,
"epoch": 0.43050430504305043,
"grad_norm": 0.29744303745944684,
"learning_rate": 4.045723545159927e-06,
"loss": 0.6886,
"mean_token_accuracy": 0.812594473361969,
"num_tokens": 315425698.0,
"step": 3150
},
{
"entropy": 0.94296875,
"epoch": 0.4318709853765204,
"grad_norm": 0.2795858468183903,
"learning_rate": 4.04220092997041e-06,
"loss": 0.6649,
"mean_token_accuracy": 0.8174507856369019,
"num_tokens": 316440825.0,
"step": 3160
},
{
"entropy": 0.97265625,
"epoch": 0.43323766570999045,
"grad_norm": 0.26815744440600503,
"learning_rate": 4.038678314780894e-06,
"loss": 0.6912,
"mean_token_accuracy": 0.8119501948356629,
"num_tokens": 317499361.0,
"step": 3170
},
{
"entropy": 0.98359375,
"epoch": 0.43460434604346043,
"grad_norm": 0.2664173321524729,
"learning_rate": 4.0351556995913775e-06,
"loss": 0.7452,
"mean_token_accuracy": 0.7997786283493042,
"num_tokens": 318535159.0,
"step": 3180
},
{
"entropy": 0.973046875,
"epoch": 0.4359710263769304,
"grad_norm": 0.2595922971563641,
"learning_rate": 4.03163308440186e-06,
"loss": 0.7184,
"mean_token_accuracy": 0.805692332983017,
"num_tokens": 319525232.0,
"step": 3190
},
{
"entropy": 1.00390625,
"epoch": 0.43733770671040045,
"grad_norm": 0.3039818921396253,
"learning_rate": 4.028110469212344e-06,
"loss": 0.7394,
"mean_token_accuracy": 0.80342538356781,
"num_tokens": 320474887.0,
"step": 3200
},
{
"entropy": 0.980859375,
"epoch": 0.43870438704387044,
"grad_norm": 0.2899720182700618,
"learning_rate": 4.0245878540228264e-06,
"loss": 0.7019,
"mean_token_accuracy": 0.8080191254615784,
"num_tokens": 321463665.0,
"step": 3210
},
{
"entropy": 1.021875,
"epoch": 0.4400710673773404,
"grad_norm": 0.3072011905933486,
"learning_rate": 4.02106523883331e-06,
"loss": 0.7263,
"mean_token_accuracy": 0.8046967327594757,
"num_tokens": 322430041.0,
"step": 3220
},
{
"entropy": 0.95390625,
"epoch": 0.44143774771081046,
"grad_norm": 0.30810367588660087,
"learning_rate": 4.0175426236437935e-06,
"loss": 0.711,
"mean_token_accuracy": 0.8078085720539093,
"num_tokens": 323393790.0,
"step": 3230
},
{
"entropy": 0.97421875,
"epoch": 0.44280442804428044,
"grad_norm": 0.33726258410719967,
"learning_rate": 4.014020008454277e-06,
"loss": 0.7069,
"mean_token_accuracy": 0.8087441504001618,
"num_tokens": 324396436.0,
"step": 3240
},
{
"entropy": 0.971875,
"epoch": 0.4441711083777504,
"grad_norm": 0.26756400737528885,
"learning_rate": 4.01049739326476e-06,
"loss": 0.7072,
"mean_token_accuracy": 0.8049550592899323,
"num_tokens": 325343170.0,
"step": 3250
},
{
"entropy": 0.987109375,
"epoch": 0.44553778871122046,
"grad_norm": 0.27991440842043125,
"learning_rate": 4.006974778075243e-06,
"loss": 0.7144,
"mean_token_accuracy": 0.8072557210922241,
"num_tokens": 326355307.0,
"step": 3260
},
{
"entropy": 1.00625,
"epoch": 0.44690446904469044,
"grad_norm": 0.26194978724755913,
"learning_rate": 4.003452162885727e-06,
"loss": 0.7295,
"mean_token_accuracy": 0.800638222694397,
"num_tokens": 327388298.0,
"step": 3270
},
{
"entropy": 0.94296875,
"epoch": 0.4482711493781604,
"grad_norm": 0.399921236949711,
"learning_rate": 3.99992954769621e-06,
"loss": 0.692,
"mean_token_accuracy": 0.81090949177742,
"num_tokens": 328389066.0,
"step": 3280
},
{
"entropy": 0.962890625,
"epoch": 0.44963782971163047,
"grad_norm": 0.29385622274999396,
"learning_rate": 3.996406932506693e-06,
"loss": 0.7096,
"mean_token_accuracy": 0.8067252278327942,
"num_tokens": 329429521.0,
"step": 3290
},
{
"entropy": 0.947265625,
"epoch": 0.45100451004510045,
"grad_norm": 0.29919682402901154,
"learning_rate": 3.992884317317177e-06,
"loss": 0.702,
"mean_token_accuracy": 0.8090509355068207,
"num_tokens": 330482625.0,
"step": 3300
},
{
"entropy": 1.01640625,
"epoch": 0.45237119037857043,
"grad_norm": 0.30390146173413496,
"learning_rate": 3.98936170212766e-06,
"loss": 0.7275,
"mean_token_accuracy": 0.8039159536361694,
"num_tokens": 331506313.0,
"step": 3310
},
{
"entropy": 0.946875,
"epoch": 0.45373787071204047,
"grad_norm": 0.27947906077698964,
"learning_rate": 3.985839086938143e-06,
"loss": 0.6756,
"mean_token_accuracy": 0.814260071516037,
"num_tokens": 332494855.0,
"step": 3320
},
{
"entropy": 0.984765625,
"epoch": 0.45510455104551045,
"grad_norm": 0.33095332797190913,
"learning_rate": 3.9823164717486265e-06,
"loss": 0.7443,
"mean_token_accuracy": 0.7998993754386902,
"num_tokens": 333547164.0,
"step": 3330
},
{
"entropy": 0.98203125,
"epoch": 0.45647123137898044,
"grad_norm": 0.28622600476831256,
"learning_rate": 3.97879385655911e-06,
"loss": 0.7213,
"mean_token_accuracy": 0.8054976522922516,
"num_tokens": 334529077.0,
"step": 3340
},
{
"entropy": 1.008203125,
"epoch": 0.4578379117124505,
"grad_norm": 0.33843649266620995,
"learning_rate": 3.9752712413695936e-06,
"loss": 0.7199,
"mean_token_accuracy": 0.8046471476554871,
"num_tokens": 335516657.0,
"step": 3350
},
{
"entropy": 1.039453125,
"epoch": 0.45920459204592046,
"grad_norm": 0.3080974408034177,
"learning_rate": 3.971748626180076e-06,
"loss": 0.7407,
"mean_token_accuracy": 0.7998206079006195,
"num_tokens": 336529399.0,
"step": 3360
},
{
"entropy": 0.987109375,
"epoch": 0.46057127237939044,
"grad_norm": 0.2724982014290648,
"learning_rate": 3.96822601099056e-06,
"loss": 0.7202,
"mean_token_accuracy": 0.8037076532840729,
"num_tokens": 337575192.0,
"step": 3370
},
{
"entropy": 0.98984375,
"epoch": 0.4619379527128605,
"grad_norm": 0.609068220348201,
"learning_rate": 3.9647033958010425e-06,
"loss": 0.7608,
"mean_token_accuracy": 0.7968976318836212,
"num_tokens": 338561351.0,
"step": 3380
},
{
"entropy": 0.996875,
"epoch": 0.46330463304633046,
"grad_norm": 0.3171310644876287,
"learning_rate": 3.961180780611527e-06,
"loss": 0.7101,
"mean_token_accuracy": 0.8070452332496643,
"num_tokens": 339557736.0,
"step": 3390
},
{
"entropy": 1.014453125,
"epoch": 0.46467131337980044,
"grad_norm": 0.2656135860814018,
"learning_rate": 3.95765816542201e-06,
"loss": 0.7502,
"mean_token_accuracy": 0.8004091322422028,
"num_tokens": 340603014.0,
"step": 3400
},
{
"entropy": 0.95625,
"epoch": 0.4660379937132705,
"grad_norm": 0.28795114014391865,
"learning_rate": 3.954135550232493e-06,
"loss": 0.6866,
"mean_token_accuracy": 0.8104876518249512,
"num_tokens": 341584764.0,
"step": 3410
},
{
"entropy": 0.9953125,
"epoch": 0.46740467404674046,
"grad_norm": 0.3002786332369552,
"learning_rate": 3.950612935042976e-06,
"loss": 0.7198,
"mean_token_accuracy": 0.804291307926178,
"num_tokens": 342590031.0,
"step": 3420
},
{
"entropy": 0.9671875,
"epoch": 0.46877135438021045,
"grad_norm": 0.305457970729464,
"learning_rate": 3.947090319853459e-06,
"loss": 0.711,
"mean_token_accuracy": 0.8069401144981384,
"num_tokens": 343580633.0,
"step": 3430
},
{
"entropy": 1.0375,
"epoch": 0.4701380347136805,
"grad_norm": 0.31231839817219176,
"learning_rate": 3.943567704663943e-06,
"loss": 0.7502,
"mean_token_accuracy": 0.7991959154605865,
"num_tokens": 344555481.0,
"step": 3440
},
{
"entropy": 0.976171875,
"epoch": 0.47150471504715047,
"grad_norm": 0.3538060890243067,
"learning_rate": 3.9400450894744265e-06,
"loss": 0.7332,
"mean_token_accuracy": 0.8023735225200653,
"num_tokens": 345513015.0,
"step": 3450
},
{
"entropy": 1.040625,
"epoch": 0.47287139538062045,
"grad_norm": 0.3506647272818189,
"learning_rate": 3.936522474284909e-06,
"loss": 0.7415,
"mean_token_accuracy": 0.8020818173885346,
"num_tokens": 346519872.0,
"step": 3460
},
{
"entropy": 0.978515625,
"epoch": 0.4742380757140905,
"grad_norm": 0.35982474179574275,
"learning_rate": 3.932999859095393e-06,
"loss": 0.6999,
"mean_token_accuracy": 0.8106732428073883,
"num_tokens": 347593024.0,
"step": 3470
},
{
"entropy": 0.96640625,
"epoch": 0.4756047560475605,
"grad_norm": 0.29540099431902334,
"learning_rate": 3.929477243905876e-06,
"loss": 0.6957,
"mean_token_accuracy": 0.8110571146011353,
"num_tokens": 348594832.0,
"step": 3480
},
{
"entropy": 1.0046875,
"epoch": 0.47697143638103046,
"grad_norm": 0.36475805442672915,
"learning_rate": 3.925954628716359e-06,
"loss": 0.7044,
"mean_token_accuracy": 0.8109088659286499,
"num_tokens": 349593190.0,
"step": 3490
},
{
"entropy": 1.006640625,
"epoch": 0.4783381167145005,
"grad_norm": 0.3348759630749331,
"learning_rate": 3.9224320135268425e-06,
"loss": 0.7234,
"mean_token_accuracy": 0.8026596307754517,
"num_tokens": 350561915.0,
"step": 3500
},
{
"entropy": 0.988671875,
"epoch": 0.4797047970479705,
"grad_norm": 0.3347507106975185,
"learning_rate": 3.918909398337326e-06,
"loss": 0.7065,
"mean_token_accuracy": 0.808227676153183,
"num_tokens": 351565428.0,
"step": 3510
},
{
"entropy": 0.9734375,
"epoch": 0.48107147738144046,
"grad_norm": 0.2905969395155153,
"learning_rate": 3.91538678314781e-06,
"loss": 0.7088,
"mean_token_accuracy": 0.8084500908851624,
"num_tokens": 352587603.0,
"step": 3520
},
{
"entropy": 1.0015625,
"epoch": 0.4824381577149105,
"grad_norm": 0.2879060792272357,
"learning_rate": 3.911864167958292e-06,
"loss": 0.7111,
"mean_token_accuracy": 0.8080259323120117,
"num_tokens": 353602912.0,
"step": 3530
},
{
"entropy": 0.972265625,
"epoch": 0.4838048380483805,
"grad_norm": 0.3056790875367926,
"learning_rate": 3.908341552768776e-06,
"loss": 0.7284,
"mean_token_accuracy": 0.8030906975269317,
"num_tokens": 354606364.0,
"step": 3540
},
{
"entropy": 0.967578125,
"epoch": 0.48517151838185046,
"grad_norm": 0.2975989260629889,
"learning_rate": 3.9048189375792586e-06,
"loss": 0.7086,
"mean_token_accuracy": 0.8042810201644898,
"num_tokens": 355587589.0,
"step": 3550
},
{
"entropy": 1.0171875,
"epoch": 0.4865381987153205,
"grad_norm": 0.30777567236630216,
"learning_rate": 3.901296322389743e-06,
"loss": 0.7535,
"mean_token_accuracy": 0.797535651922226,
"num_tokens": 356558152.0,
"step": 3560
},
{
"entropy": 0.999609375,
"epoch": 0.4879048790487905,
"grad_norm": 0.2956757515819835,
"learning_rate": 3.897773707200226e-06,
"loss": 0.7204,
"mean_token_accuracy": 0.8045667827129364,
"num_tokens": 357540541.0,
"step": 3570
},
{
"entropy": 0.9859375,
"epoch": 0.48927155938226047,
"grad_norm": 0.3382596022145017,
"learning_rate": 3.894251092010709e-06,
"loss": 0.6966,
"mean_token_accuracy": 0.8085460782051086,
"num_tokens": 358570092.0,
"step": 3580
},
{
"entropy": 0.9609375,
"epoch": 0.4906382397157305,
"grad_norm": 0.29661205897709936,
"learning_rate": 3.890728476821192e-06,
"loss": 0.6885,
"mean_token_accuracy": 0.8127694129943848,
"num_tokens": 359534391.0,
"step": 3590
},
{
"entropy": 0.935546875,
"epoch": 0.4920049200492005,
"grad_norm": 0.2764838263902263,
"learning_rate": 3.8872058616316755e-06,
"loss": 0.6682,
"mean_token_accuracy": 0.81747687458992,
"num_tokens": 360497311.0,
"step": 3600
},
{
"entropy": 0.967578125,
"epoch": 0.49337160038267047,
"grad_norm": 0.2987956341394018,
"learning_rate": 3.883683246442159e-06,
"loss": 0.7265,
"mean_token_accuracy": 0.8036037981510162,
"num_tokens": 361488754.0,
"step": 3610
},
{
"entropy": 0.994921875,
"epoch": 0.4947382807161405,
"grad_norm": 0.28774981445354764,
"learning_rate": 3.8801606312526426e-06,
"loss": 0.6879,
"mean_token_accuracy": 0.8119864463806152,
"num_tokens": 362539500.0,
"step": 3620
},
{
"entropy": 0.9171875,
"epoch": 0.4961049610496105,
"grad_norm": 0.30182151604977825,
"learning_rate": 3.876638016063125e-06,
"loss": 0.6486,
"mean_token_accuracy": 0.8223255813121796,
"num_tokens": 363566701.0,
"step": 3630
},
{
"entropy": 0.965625,
"epoch": 0.4974716413830805,
"grad_norm": 0.30656005961637084,
"learning_rate": 3.873115400873609e-06,
"loss": 0.6815,
"mean_token_accuracy": 0.8147214591503144,
"num_tokens": 364529201.0,
"step": 3640
},
{
"entropy": 0.99609375,
"epoch": 0.4988383217165505,
"grad_norm": 0.30245940358768264,
"learning_rate": 3.869592785684092e-06,
"loss": 0.732,
"mean_token_accuracy": 0.8026926159858704,
"num_tokens": 365535910.0,
"step": 3650
},
{
"entropy": 0.991015625,
"epoch": 0.5002050020500205,
"grad_norm": 0.25514088418253195,
"learning_rate": 3.866070170494575e-06,
"loss": 0.7104,
"mean_token_accuracy": 0.8086096704006195,
"num_tokens": 366511634.0,
"step": 3660
},
{
"entropy": 0.981640625,
"epoch": 0.5015716823834905,
"grad_norm": 0.3399911518593315,
"learning_rate": 3.862547555305059e-06,
"loss": 0.7219,
"mean_token_accuracy": 0.8037139892578125,
"num_tokens": 367546812.0,
"step": 3670
},
{
"entropy": 0.98515625,
"epoch": 0.5029383627169605,
"grad_norm": 0.32399202540921723,
"learning_rate": 3.859024940115542e-06,
"loss": 0.7116,
"mean_token_accuracy": 0.8076136589050293,
"num_tokens": 368552370.0,
"step": 3680
},
{
"entropy": 0.95,
"epoch": 0.5043050430504306,
"grad_norm": 0.2647818257491714,
"learning_rate": 3.855502324926026e-06,
"loss": 0.6737,
"mean_token_accuracy": 0.8166876673698426,
"num_tokens": 369603613.0,
"step": 3690
},
{
"entropy": 0.985546875,
"epoch": 0.5056717233839005,
"grad_norm": 0.2854885167001008,
"learning_rate": 3.851979709736508e-06,
"loss": 0.7048,
"mean_token_accuracy": 0.8092823326587677,
"num_tokens": 370579772.0,
"step": 3700
},
{
"entropy": 0.996875,
"epoch": 0.5070384037173705,
"grad_norm": 0.31463956320300923,
"learning_rate": 3.848457094546992e-06,
"loss": 0.7134,
"mean_token_accuracy": 0.8060537278652191,
"num_tokens": 371569052.0,
"step": 3710
},
{
"entropy": 0.955859375,
"epoch": 0.5084050840508405,
"grad_norm": 0.26604883988725936,
"learning_rate": 3.8449344793574755e-06,
"loss": 0.7204,
"mean_token_accuracy": 0.8056537210941315,
"num_tokens": 372600551.0,
"step": 3720
},
{
"entropy": 0.996484375,
"epoch": 0.5097717643843105,
"grad_norm": 0.2713952195512647,
"learning_rate": 3.841411864167959e-06,
"loss": 0.7475,
"mean_token_accuracy": 0.7985845029354095,
"num_tokens": 373584656.0,
"step": 3730
},
{
"entropy": 0.98984375,
"epoch": 0.5111384447177805,
"grad_norm": 0.33407190390441033,
"learning_rate": 3.837889248978442e-06,
"loss": 0.734,
"mean_token_accuracy": 0.8013193726539611,
"num_tokens": 374563340.0,
"step": 3740
},
{
"entropy": 0.985546875,
"epoch": 0.5125051250512506,
"grad_norm": 0.32127884589993244,
"learning_rate": 3.834366633788925e-06,
"loss": 0.692,
"mean_token_accuracy": 0.8126987159252167,
"num_tokens": 375567281.0,
"step": 3750
},
{
"entropy": 0.99375,
"epoch": 0.5138718053847205,
"grad_norm": 0.3317654459624734,
"learning_rate": 3.830844018599408e-06,
"loss": 0.7041,
"mean_token_accuracy": 0.8088657140731812,
"num_tokens": 376511811.0,
"step": 3760
},
{
"entropy": 1.00234375,
"epoch": 0.5152384857181905,
"grad_norm": 0.295177976945786,
"learning_rate": 3.8273214034098915e-06,
"loss": 0.724,
"mean_token_accuracy": 0.8046367168426514,
"num_tokens": 377512831.0,
"step": 3770
},
{
"entropy": 1.0,
"epoch": 0.5166051660516605,
"grad_norm": 0.2985005626533141,
"learning_rate": 3.823798788220375e-06,
"loss": 0.7085,
"mean_token_accuracy": 0.8062677562236786,
"num_tokens": 378478492.0,
"step": 3780
},
{
"entropy": 0.965234375,
"epoch": 0.5179718463851305,
"grad_norm": 0.3359452296845225,
"learning_rate": 3.820276173030859e-06,
"loss": 0.7003,
"mean_token_accuracy": 0.8095349311828614,
"num_tokens": 379444691.0,
"step": 3790
},
{
"entropy": 0.987890625,
"epoch": 0.5193385267186005,
"grad_norm": 0.3023851199024195,
"learning_rate": 3.816753557841341e-06,
"loss": 0.6923,
"mean_token_accuracy": 0.8114668190479278,
"num_tokens": 380423660.0,
"step": 3800
},
{
"entropy": 0.99140625,
"epoch": 0.5207052070520706,
"grad_norm": 0.29509496877815605,
"learning_rate": 3.813230942651825e-06,
"loss": 0.7335,
"mean_token_accuracy": 0.8025622367858887,
"num_tokens": 381365233.0,
"step": 3810
},
{
"entropy": 1.001171875,
"epoch": 0.5220718873855406,
"grad_norm": 0.30266367130404537,
"learning_rate": 3.809708327462308e-06,
"loss": 0.6953,
"mean_token_accuracy": 0.8104704439640045,
"num_tokens": 382338629.0,
"step": 3820
},
{
"entropy": 1.000390625,
"epoch": 0.5234385677190105,
"grad_norm": 0.29284266167422873,
"learning_rate": 3.806185712272792e-06,
"loss": 0.7319,
"mean_token_accuracy": 0.8035790741443634,
"num_tokens": 383353565.0,
"step": 3830
},
{
"entropy": 1.065234375,
"epoch": 0.5248052480524805,
"grad_norm": 0.3476425764110912,
"learning_rate": 3.802663097083275e-06,
"loss": 0.7804,
"mean_token_accuracy": 0.7928232789039612,
"num_tokens": 384284378.0,
"step": 3840
},
{
"entropy": 0.995703125,
"epoch": 0.5261719283859505,
"grad_norm": 0.30477502387389827,
"learning_rate": 3.799140481893758e-06,
"loss": 0.7135,
"mean_token_accuracy": 0.80620836019516,
"num_tokens": 385243988.0,
"step": 3850
},
{
"entropy": 0.9796875,
"epoch": 0.5275386087194205,
"grad_norm": 0.2872694992142711,
"learning_rate": 3.7956178667042413e-06,
"loss": 0.701,
"mean_token_accuracy": 0.8109813749790191,
"num_tokens": 386204705.0,
"step": 3860
},
{
"entropy": 0.946875,
"epoch": 0.5289052890528906,
"grad_norm": 0.30039143245842054,
"learning_rate": 3.792095251514725e-06,
"loss": 0.699,
"mean_token_accuracy": 0.8092650592327117,
"num_tokens": 387221442.0,
"step": 3870
},
{
"entropy": 0.952734375,
"epoch": 0.5302719693863606,
"grad_norm": 0.2964063110330884,
"learning_rate": 3.788572636325208e-06,
"loss": 0.7018,
"mean_token_accuracy": 0.8085566282272338,
"num_tokens": 388252567.0,
"step": 3880
},
{
"entropy": 0.954296875,
"epoch": 0.5316386497198305,
"grad_norm": 0.28027860132362886,
"learning_rate": 3.7850500211356916e-06,
"loss": 0.683,
"mean_token_accuracy": 0.812285190820694,
"num_tokens": 389259487.0,
"step": 3890
},
{
"entropy": 0.981640625,
"epoch": 0.5330053300533005,
"grad_norm": 0.2989032031412311,
"learning_rate": 3.7815274059461747e-06,
"loss": 0.7042,
"mean_token_accuracy": 0.8083933830261231,
"num_tokens": 390253163.0,
"step": 3900
},
{
"entropy": 0.96875,
"epoch": 0.5343720103867705,
"grad_norm": 0.2754059015591345,
"learning_rate": 3.7780047907566582e-06,
"loss": 0.6758,
"mean_token_accuracy": 0.8146444618701935,
"num_tokens": 391269104.0,
"step": 3910
},
{
"entropy": 0.9765625,
"epoch": 0.5357386907202405,
"grad_norm": 0.2667110601342031,
"learning_rate": 3.7744821755671413e-06,
"loss": 0.6936,
"mean_token_accuracy": 0.8135500907897949,
"num_tokens": 392288204.0,
"step": 3920
},
{
"entropy": 0.979296875,
"epoch": 0.5371053710537106,
"grad_norm": 0.265338369669252,
"learning_rate": 3.7709595603776245e-06,
"loss": 0.6979,
"mean_token_accuracy": 0.8117689847946167,
"num_tokens": 393303667.0,
"step": 3930
},
{
"entropy": 1.00625,
"epoch": 0.5384720513871806,
"grad_norm": 0.38177160274435673,
"learning_rate": 3.767436945188108e-06,
"loss": 0.7259,
"mean_token_accuracy": 0.803828752040863,
"num_tokens": 394294972.0,
"step": 3940
},
{
"entropy": 0.977734375,
"epoch": 0.5398387317206506,
"grad_norm": 0.307224681309463,
"learning_rate": 3.7639143299985916e-06,
"loss": 0.7061,
"mean_token_accuracy": 0.8083050549030304,
"num_tokens": 395281144.0,
"step": 3950
},
{
"entropy": 1.0203125,
"epoch": 0.5412054120541205,
"grad_norm": 0.278201670403485,
"learning_rate": 3.7603917148090747e-06,
"loss": 0.7147,
"mean_token_accuracy": 0.807541412115097,
"num_tokens": 396282458.0,
"step": 3960
},
{
"entropy": 0.953125,
"epoch": 0.5425720923875905,
"grad_norm": 0.2873403593237629,
"learning_rate": 3.756869099619558e-06,
"loss": 0.6825,
"mean_token_accuracy": 0.8127366006374359,
"num_tokens": 397299233.0,
"step": 3970
},
{
"entropy": 0.958984375,
"epoch": 0.5439387727210605,
"grad_norm": 0.2781941642519497,
"learning_rate": 3.753346484430041e-06,
"loss": 0.689,
"mean_token_accuracy": 0.812881475687027,
"num_tokens": 398281717.0,
"step": 3980
},
{
"entropy": 0.958203125,
"epoch": 0.5453054530545306,
"grad_norm": 0.2979908593282107,
"learning_rate": 3.749823869240524e-06,
"loss": 0.6823,
"mean_token_accuracy": 0.8150989472866058,
"num_tokens": 399265146.0,
"step": 3990
},
{
"entropy": 0.93828125,
"epoch": 0.5466721333880006,
"grad_norm": 0.30375043638026045,
"learning_rate": 3.746301254051008e-06,
"loss": 0.6621,
"mean_token_accuracy": 0.8176088392734527,
"num_tokens": 400256118.0,
"step": 4000
},
{
"entropy": 0.954296875,
"epoch": 0.5480388137214706,
"grad_norm": 0.29433574780041283,
"learning_rate": 3.742778638861491e-06,
"loss": 0.6979,
"mean_token_accuracy": 0.8097483336925506,
"num_tokens": 401251718.0,
"step": 4010
},
{
"entropy": 0.977734375,
"epoch": 0.5494054940549405,
"grad_norm": 0.2924700722432905,
"learning_rate": 3.7392560236719743e-06,
"loss": 0.714,
"mean_token_accuracy": 0.8053194642066955,
"num_tokens": 402208932.0,
"step": 4020
},
{
"entropy": 0.934765625,
"epoch": 0.5507721743884105,
"grad_norm": 0.2856422806983055,
"learning_rate": 3.7357334084824574e-06,
"loss": 0.6651,
"mean_token_accuracy": 0.8178131639957428,
"num_tokens": 403201031.0,
"step": 4030
},
{
"entropy": 0.952734375,
"epoch": 0.5521388547218805,
"grad_norm": 0.30325435770462694,
"learning_rate": 3.732210793292941e-06,
"loss": 0.6814,
"mean_token_accuracy": 0.8139383256435394,
"num_tokens": 404208352.0,
"step": 4040
},
{
"entropy": 0.9953125,
"epoch": 0.5535055350553506,
"grad_norm": 0.32837370425054957,
"learning_rate": 3.7286881781034245e-06,
"loss": 0.703,
"mean_token_accuracy": 0.8081967294216156,
"num_tokens": 405228257.0,
"step": 4050
},
{
"entropy": 0.974609375,
"epoch": 0.5548722153888206,
"grad_norm": 0.26303442149872575,
"learning_rate": 3.7251655629139076e-06,
"loss": 0.6682,
"mean_token_accuracy": 0.8161556124687195,
"num_tokens": 406262561.0,
"step": 4060
},
{
"entropy": 1.01640625,
"epoch": 0.5562388957222906,
"grad_norm": 0.27865501229874995,
"learning_rate": 3.7216429477243907e-06,
"loss": 0.7193,
"mean_token_accuracy": 0.8047674179077149,
"num_tokens": 407259161.0,
"step": 4070
},
{
"entropy": 0.983203125,
"epoch": 0.5576055760557606,
"grad_norm": 0.2883859043663495,
"learning_rate": 3.7181203325348743e-06,
"loss": 0.7052,
"mean_token_accuracy": 0.8086324870586395,
"num_tokens": 408297673.0,
"step": 4080
},
{
"entropy": 1.013671875,
"epoch": 0.5589722563892305,
"grad_norm": 0.30597230942474685,
"learning_rate": 3.7145977173453574e-06,
"loss": 0.7432,
"mean_token_accuracy": 0.8002488732337951,
"num_tokens": 409266496.0,
"step": 4090
},
{
"entropy": 0.961328125,
"epoch": 0.5603389367227005,
"grad_norm": 0.28805160394744733,
"learning_rate": 3.7110751021558405e-06,
"loss": 0.685,
"mean_token_accuracy": 0.8125308632850647,
"num_tokens": 410238401.0,
"step": 4100
},
{
"entropy": 0.958984375,
"epoch": 0.5617056170561706,
"grad_norm": 0.3064073679684334,
"learning_rate": 3.7075524869663245e-06,
"loss": 0.6855,
"mean_token_accuracy": 0.8140522003173828,
"num_tokens": 411280517.0,
"step": 4110
},
{
"entropy": 0.9734375,
"epoch": 0.5630722973896406,
"grad_norm": 0.2790530859749805,
"learning_rate": 3.7040298717768076e-06,
"loss": 0.7125,
"mean_token_accuracy": 0.8081464350223542,
"num_tokens": 412309765.0,
"step": 4120
},
{
"entropy": 1.0046875,
"epoch": 0.5644389777231106,
"grad_norm": 0.31073553995301495,
"learning_rate": 3.7005072565872908e-06,
"loss": 0.7312,
"mean_token_accuracy": 0.8029002964496612,
"num_tokens": 413340967.0,
"step": 4130
},
{
"entropy": 0.987109375,
"epoch": 0.5658056580565806,
"grad_norm": 0.30546391239301734,
"learning_rate": 3.696984641397774e-06,
"loss": 0.7299,
"mean_token_accuracy": 0.8028201162815094,
"num_tokens": 414340603.0,
"step": 4140
},
{
"entropy": 0.949609375,
"epoch": 0.5671723383900505,
"grad_norm": 0.33812442137792326,
"learning_rate": 3.693462026208257e-06,
"loss": 0.6698,
"mean_token_accuracy": 0.8157974004745483,
"num_tokens": 415339057.0,
"step": 4150
},
{
"entropy": 0.983203125,
"epoch": 0.5685390187235205,
"grad_norm": 0.25955440662935947,
"learning_rate": 3.689939411018741e-06,
"loss": 0.7058,
"mean_token_accuracy": 0.8110428750514984,
"num_tokens": 416381610.0,
"step": 4160
},
{
"entropy": 0.925390625,
"epoch": 0.5699056990569906,
"grad_norm": 0.2965204805481819,
"learning_rate": 3.686416795829224e-06,
"loss": 0.641,
"mean_token_accuracy": 0.8220044076442719,
"num_tokens": 417378752.0,
"step": 4170
},
{
"entropy": 0.9578125,
"epoch": 0.5712723793904606,
"grad_norm": 0.30073642131765765,
"learning_rate": 3.6828941806397072e-06,
"loss": 0.6948,
"mean_token_accuracy": 0.8104956746101379,
"num_tokens": 418347850.0,
"step": 4180
},
{
"entropy": 0.969921875,
"epoch": 0.5726390597239306,
"grad_norm": 0.2875336033668538,
"learning_rate": 3.6793715654501903e-06,
"loss": 0.7194,
"mean_token_accuracy": 0.805890154838562,
"num_tokens": 419363657.0,
"step": 4190
},
{
"entropy": 0.97890625,
"epoch": 0.5740057400574006,
"grad_norm": 0.338298912993475,
"learning_rate": 3.6758489502606735e-06,
"loss": 0.7141,
"mean_token_accuracy": 0.8075056374073029,
"num_tokens": 420407370.0,
"step": 4200
},
{
"entropy": 1.000390625,
"epoch": 0.5753724203908706,
"grad_norm": 0.2935092232282841,
"learning_rate": 3.672326335071157e-06,
"loss": 0.7097,
"mean_token_accuracy": 0.8073876678943634,
"num_tokens": 421382440.0,
"step": 4210
},
{
"entropy": 0.98671875,
"epoch": 0.5767391007243405,
"grad_norm": 0.2833334742377442,
"learning_rate": 3.6688037198816406e-06,
"loss": 0.6923,
"mean_token_accuracy": 0.8110143542289734,
"num_tokens": 422362775.0,
"step": 4220
},
{
"entropy": 0.959375,
"epoch": 0.5781057810578106,
"grad_norm": 0.31502139379608557,
"learning_rate": 3.6652811046921237e-06,
"loss": 0.682,
"mean_token_accuracy": 0.8143631160259247,
"num_tokens": 423331211.0,
"step": 4230
},
{
"entropy": 0.976953125,
"epoch": 0.5794724613912806,
"grad_norm": 0.2821563236509616,
"learning_rate": 3.6617584895026072e-06,
"loss": 0.6876,
"mean_token_accuracy": 0.8125888764858246,
"num_tokens": 424291289.0,
"step": 4240
},
{
"entropy": 1.00234375,
"epoch": 0.5808391417247506,
"grad_norm": 0.3264475243014178,
"learning_rate": 3.6582358743130904e-06,
"loss": 0.7424,
"mean_token_accuracy": 0.7968122065067291,
"num_tokens": 425304325.0,
"step": 4250
},
{
"entropy": 0.983984375,
"epoch": 0.5822058220582206,
"grad_norm": 0.29660586125461497,
"learning_rate": 3.6547132591235735e-06,
"loss": 0.7131,
"mean_token_accuracy": 0.8065547943115234,
"num_tokens": 426270499.0,
"step": 4260
},
{
"entropy": 1.01796875,
"epoch": 0.5835725023916906,
"grad_norm": 0.3445216838957911,
"learning_rate": 3.651190643934057e-06,
"loss": 0.7373,
"mean_token_accuracy": 0.8024384021759033,
"num_tokens": 427187011.0,
"step": 4270
},
{
"entropy": 0.97734375,
"epoch": 0.5849391827251605,
"grad_norm": 0.28586507398428546,
"learning_rate": 3.6476680287445406e-06,
"loss": 0.7119,
"mean_token_accuracy": 0.8084649324417115,
"num_tokens": 428218892.0,
"step": 4280
},
{
"entropy": 0.953515625,
"epoch": 0.5863058630586306,
"grad_norm": 0.2787763393888628,
"learning_rate": 3.6441454135550237e-06,
"loss": 0.6857,
"mean_token_accuracy": 0.813847017288208,
"num_tokens": 429237497.0,
"step": 4290
},
{
"entropy": 0.979296875,
"epoch": 0.5876725433921006,
"grad_norm": 0.282262298089497,
"learning_rate": 3.640622798365507e-06,
"loss": 0.7144,
"mean_token_accuracy": 0.8060578942298889,
"num_tokens": 430237115.0,
"step": 4300
},
{
"entropy": 1.021484375,
"epoch": 0.5890392237255706,
"grad_norm": 0.2715186945747299,
"learning_rate": 3.63710018317599e-06,
"loss": 0.731,
"mean_token_accuracy": 0.8015734434127808,
"num_tokens": 431241122.0,
"step": 4310
},
{
"entropy": 1.03046875,
"epoch": 0.5904059040590406,
"grad_norm": 0.33212655000176056,
"learning_rate": 3.633577567986473e-06,
"loss": 0.7328,
"mean_token_accuracy": 0.8033051431179047,
"num_tokens": 432221995.0,
"step": 4320
},
{
"entropy": 0.977734375,
"epoch": 0.5917725843925106,
"grad_norm": 0.3013825921794014,
"learning_rate": 3.630054952796957e-06,
"loss": 0.6856,
"mean_token_accuracy": 0.8135309100151062,
"num_tokens": 433198674.0,
"step": 4330
},
{
"entropy": 1.017578125,
"epoch": 0.5931392647259806,
"grad_norm": 0.28396962089672956,
"learning_rate": 3.62653233760744e-06,
"loss": 0.7659,
"mean_token_accuracy": 0.7949835419654846,
"num_tokens": 434197222.0,
"step": 4340
},
{
"entropy": 0.969921875,
"epoch": 0.5945059450594506,
"grad_norm": 0.32794838267409593,
"learning_rate": 3.6230097224179233e-06,
"loss": 0.6893,
"mean_token_accuracy": 0.8126155436038971,
"num_tokens": 435080429.0,
"step": 4350
},
{
"entropy": 0.984765625,
"epoch": 0.5958726253929206,
"grad_norm": 0.30199311441672666,
"learning_rate": 3.6194871072284064e-06,
"loss": 0.7089,
"mean_token_accuracy": 0.8079646289348602,
"num_tokens": 436104149.0,
"step": 4360
},
{
"entropy": 1.008203125,
"epoch": 0.5972393057263906,
"grad_norm": 0.3126775597412534,
"learning_rate": 3.61596449203889e-06,
"loss": 0.7056,
"mean_token_accuracy": 0.8096815586090088,
"num_tokens": 437087451.0,
"step": 4370
},
{
"entropy": 0.944921875,
"epoch": 0.5986059860598606,
"grad_norm": 0.27265801710984905,
"learning_rate": 3.6124418768493735e-06,
"loss": 0.6799,
"mean_token_accuracy": 0.8154258549213409,
"num_tokens": 438073519.0,
"step": 4380
},
{
"entropy": 0.975390625,
"epoch": 0.5999726663933306,
"grad_norm": 0.26519871599779404,
"learning_rate": 3.6089192616598566e-06,
"loss": 0.7116,
"mean_token_accuracy": 0.8079006731510162,
"num_tokens": 439150829.0,
"step": 4390
},
{
"entropy": 0.9890625,
"epoch": 0.6013393467268006,
"grad_norm": 0.30757539024534636,
"learning_rate": 3.6053966464703398e-06,
"loss": 0.7495,
"mean_token_accuracy": 0.799792492389679,
"num_tokens": 440124792.0,
"step": 4400
},
{
"entropy": 1.0109375,
"epoch": 0.6027060270602707,
"grad_norm": 0.29253537943391333,
"learning_rate": 3.6018740312808233e-06,
"loss": 0.73,
"mean_token_accuracy": 0.8019254148006439,
"num_tokens": 441178545.0,
"step": 4410
},
{
"entropy": 0.977734375,
"epoch": 0.6040727073937406,
"grad_norm": 0.32017307539476764,
"learning_rate": 3.5983514160913064e-06,
"loss": 0.6953,
"mean_token_accuracy": 0.8076420545578002,
"num_tokens": 442210281.0,
"step": 4420
},
{
"entropy": 0.976171875,
"epoch": 0.6054393877272106,
"grad_norm": 0.26692346667575306,
"learning_rate": 3.5948288009017895e-06,
"loss": 0.7066,
"mean_token_accuracy": 0.8085271298885346,
"num_tokens": 443225259.0,
"step": 4430
},
{
"entropy": 0.991796875,
"epoch": 0.6068060680606806,
"grad_norm": 0.2974127742478895,
"learning_rate": 3.591306185712273e-06,
"loss": 0.742,
"mean_token_accuracy": 0.8002722501754761,
"num_tokens": 444220229.0,
"step": 4440
},
{
"entropy": 1.015234375,
"epoch": 0.6081727483941506,
"grad_norm": 0.2836327434695776,
"learning_rate": 3.5877835705227566e-06,
"loss": 0.7223,
"mean_token_accuracy": 0.8042012989521027,
"num_tokens": 445201473.0,
"step": 4450
},
{
"entropy": 0.955859375,
"epoch": 0.6095394287276206,
"grad_norm": 0.3490268220301665,
"learning_rate": 3.5842609553332398e-06,
"loss": 0.7076,
"mean_token_accuracy": 0.808827006816864,
"num_tokens": 446200834.0,
"step": 4460
},
{
"entropy": 0.978125,
"epoch": 0.6109061090610907,
"grad_norm": 0.307832840746083,
"learning_rate": 3.580738340143723e-06,
"loss": 0.7093,
"mean_token_accuracy": 0.8066488265991211,
"num_tokens": 447203460.0,
"step": 4470
},
{
"entropy": 0.97265625,
"epoch": 0.6122727893945606,
"grad_norm": 0.30744538186229203,
"learning_rate": 3.577215724954206e-06,
"loss": 0.7092,
"mean_token_accuracy": 0.8070337653160096,
"num_tokens": 448231820.0,
"step": 4480
},
{
"entropy": 1.014453125,
"epoch": 0.6136394697280306,
"grad_norm": 0.2748815954542915,
"learning_rate": 3.57369310976469e-06,
"loss": 0.7453,
"mean_token_accuracy": 0.7973771512508392,
"num_tokens": 449181166.0,
"step": 4490
},
{
"entropy": 1.021875,
"epoch": 0.6150061500615006,
"grad_norm": 0.28359327696295844,
"learning_rate": 3.570170494575173e-06,
"loss": 0.7264,
"mean_token_accuracy": 0.8066367626190185,
"num_tokens": 450200977.0,
"step": 4500
},
{
"entropy": 1.041796875,
"epoch": 0.6163728303949706,
"grad_norm": 0.30869381563182696,
"learning_rate": 3.5666478793856562e-06,
"loss": 0.7875,
"mean_token_accuracy": 0.7899083495140076,
"num_tokens": 451176344.0,
"step": 4510
},
{
"entropy": 0.956640625,
"epoch": 0.6177395107284406,
"grad_norm": 0.3191450043139849,
"learning_rate": 3.5631252641961394e-06,
"loss": 0.6892,
"mean_token_accuracy": 0.8113786041736603,
"num_tokens": 452144687.0,
"step": 4520
},
{
"entropy": 0.92578125,
"epoch": 0.6191061910619107,
"grad_norm": 0.30324315708733446,
"learning_rate": 3.5596026490066225e-06,
"loss": 0.6649,
"mean_token_accuracy": 0.8176155924797058,
"num_tokens": 453172733.0,
"step": 4530
},
{
"entropy": 0.974609375,
"epoch": 0.6204728713953807,
"grad_norm": 0.362235600158894,
"learning_rate": 3.556080033817106e-06,
"loss": 0.7033,
"mean_token_accuracy": 0.8097185969352723,
"num_tokens": 454139460.0,
"step": 4540
},
{
"entropy": 1.019921875,
"epoch": 0.6218395517288506,
"grad_norm": 0.3201176084597588,
"learning_rate": 3.5525574186275896e-06,
"loss": 0.765,
"mean_token_accuracy": 0.7966970980167389,
"num_tokens": 455099585.0,
"step": 4550
},
{
"entropy": 1.016015625,
"epoch": 0.6232062320623206,
"grad_norm": 0.3078104245187898,
"learning_rate": 3.5490348034380727e-06,
"loss": 0.7379,
"mean_token_accuracy": 0.8020847976207733,
"num_tokens": 456115164.0,
"step": 4560
},
{
"entropy": 0.988671875,
"epoch": 0.6245729123957906,
"grad_norm": 0.266647423446064,
"learning_rate": 3.545512188248556e-06,
"loss": 0.7109,
"mean_token_accuracy": 0.8070226550102234,
"num_tokens": 457102641.0,
"step": 4570
},
{
"entropy": 0.96015625,
"epoch": 0.6259395927292606,
"grad_norm": 0.2920144023929461,
"learning_rate": 3.5419895730590394e-06,
"loss": 0.7044,
"mean_token_accuracy": 0.8074274301528931,
"num_tokens": 458063569.0,
"step": 4580
},
{
"entropy": 1.012890625,
"epoch": 0.6273062730627307,
"grad_norm": 0.31561561357628326,
"learning_rate": 3.5384669578695225e-06,
"loss": 0.7168,
"mean_token_accuracy": 0.8051236748695374,
"num_tokens": 459050393.0,
"step": 4590
},
{
"entropy": 1.00234375,
"epoch": 0.6286729533962007,
"grad_norm": 0.30613137905590165,
"learning_rate": 3.534944342680006e-06,
"loss": 0.7495,
"mean_token_accuracy": 0.7998060584068298,
"num_tokens": 460080370.0,
"step": 4600
},
{
"entropy": 0.969140625,
"epoch": 0.6300396337296706,
"grad_norm": 0.27612771946184755,
"learning_rate": 3.5314217274904896e-06,
"loss": 0.7104,
"mean_token_accuracy": 0.8079898655414581,
"num_tokens": 461083660.0,
"step": 4610
},
{
"entropy": 0.99375,
"epoch": 0.6314063140631406,
"grad_norm": 0.28243701447235936,
"learning_rate": 3.5278991123009727e-06,
"loss": 0.7154,
"mean_token_accuracy": 0.8058443129062652,
"num_tokens": 462065871.0,
"step": 4620
},
{
"entropy": 1.006640625,
"epoch": 0.6327729943966106,
"grad_norm": 0.31577565158578386,
"learning_rate": 3.524376497111456e-06,
"loss": 0.7115,
"mean_token_accuracy": 0.8061090707778931,
"num_tokens": 463080086.0,
"step": 4630
},
{
"entropy": 0.9734375,
"epoch": 0.6341396747300806,
"grad_norm": 0.31010774925325135,
"learning_rate": 3.520853881921939e-06,
"loss": 0.6997,
"mean_token_accuracy": 0.8101920664310456,
"num_tokens": 464075969.0,
"step": 4640
},
{
"entropy": 0.96640625,
"epoch": 0.6355063550635507,
"grad_norm": 0.28901090837748056,
"learning_rate": 3.517331266732422e-06,
"loss": 0.7182,
"mean_token_accuracy": 0.807942247390747,
"num_tokens": 465113877.0,
"step": 4650
},
{
"entropy": 1.04375,
"epoch": 0.6368730353970207,
"grad_norm": 0.33749154164393064,
"learning_rate": 3.513808651542906e-06,
"loss": 0.7975,
"mean_token_accuracy": 0.79115788936615,
"num_tokens": 466103248.0,
"step": 4660
},
{
"entropy": 0.987109375,
"epoch": 0.6382397157304907,
"grad_norm": 0.2961788528857371,
"learning_rate": 3.510286036353389e-06,
"loss": 0.6831,
"mean_token_accuracy": 0.8133169889450074,
"num_tokens": 467036111.0,
"step": 4670
},
{
"entropy": 0.970703125,
"epoch": 0.6396063960639606,
"grad_norm": 0.26099599043639055,
"learning_rate": 3.5067634211638723e-06,
"loss": 0.6882,
"mean_token_accuracy": 0.8128870189189911,
"num_tokens": 468077688.0,
"step": 4680
},
{
"entropy": 0.9828125,
"epoch": 0.6409730763974306,
"grad_norm": 0.2974622664058962,
"learning_rate": 3.5032408059743554e-06,
"loss": 0.6955,
"mean_token_accuracy": 0.8110446691513061,
"num_tokens": 469081863.0,
"step": 4690
},
{
"entropy": 0.97578125,
"epoch": 0.6423397567309006,
"grad_norm": 0.2924855093758188,
"learning_rate": 3.499718190784839e-06,
"loss": 0.7022,
"mean_token_accuracy": 0.8079616129398346,
"num_tokens": 470036745.0,
"step": 4700
},
{
"entropy": 0.978515625,
"epoch": 0.6437064370643707,
"grad_norm": 0.3270663104819701,
"learning_rate": 3.4961955755953225e-06,
"loss": 0.7307,
"mean_token_accuracy": 0.8022151589393616,
"num_tokens": 471040901.0,
"step": 4710
},
{
"entropy": 0.999609375,
"epoch": 0.6450731173978407,
"grad_norm": 0.26878475477805497,
"learning_rate": 3.4926729604058056e-06,
"loss": 0.7052,
"mean_token_accuracy": 0.8079174041748047,
"num_tokens": 472034268.0,
"step": 4720
},
{
"entropy": 0.974609375,
"epoch": 0.6464397977313107,
"grad_norm": 0.34385011250857417,
"learning_rate": 3.4891503452162888e-06,
"loss": 0.7041,
"mean_token_accuracy": 0.809968364238739,
"num_tokens": 472986643.0,
"step": 4730
},
{
"entropy": 0.9609375,
"epoch": 0.6478064780647806,
"grad_norm": 0.30001389638559656,
"learning_rate": 3.4856277300267723e-06,
"loss": 0.673,
"mean_token_accuracy": 0.8159185230731965,
"num_tokens": 473958882.0,
"step": 4740
},
{
"entropy": 0.983984375,
"epoch": 0.6491731583982506,
"grad_norm": 0.29295886151919,
"learning_rate": 3.4821051148372554e-06,
"loss": 0.7157,
"mean_token_accuracy": 0.8060556411743164,
"num_tokens": 474928079.0,
"step": 4750
},
{
"entropy": 0.945703125,
"epoch": 0.6505398387317206,
"grad_norm": 0.36162731361607053,
"learning_rate": 3.4785824996477386e-06,
"loss": 0.6524,
"mean_token_accuracy": 0.8202277779579162,
"num_tokens": 475886095.0,
"step": 4760
},
{
"entropy": 0.93046875,
"epoch": 0.6519065190651907,
"grad_norm": 0.3122865831195644,
"learning_rate": 3.475059884458222e-06,
"loss": 0.6713,
"mean_token_accuracy": 0.815724390745163,
"num_tokens": 476869328.0,
"step": 4770
},
{
"entropy": 0.96015625,
"epoch": 0.6532731993986607,
"grad_norm": 0.30038689180425476,
"learning_rate": 3.4715372692687057e-06,
"loss": 0.6871,
"mean_token_accuracy": 0.8118316769599915,
"num_tokens": 477821773.0,
"step": 4780
},
{
"entropy": 0.997265625,
"epoch": 0.6546398797321307,
"grad_norm": 0.2899109780521957,
"learning_rate": 3.4680146540791888e-06,
"loss": 0.7262,
"mean_token_accuracy": 0.8047029376029968,
"num_tokens": 478842083.0,
"step": 4790
},
{
"entropy": 0.992578125,
"epoch": 0.6560065600656007,
"grad_norm": 0.2677638645008663,
"learning_rate": 3.464492038889672e-06,
"loss": 0.7214,
"mean_token_accuracy": 0.8057635664939881,
"num_tokens": 479784211.0,
"step": 4800
},
{
"entropy": 0.97578125,
"epoch": 0.6573732403990706,
"grad_norm": 0.31247311475658857,
"learning_rate": 3.460969423700155e-06,
"loss": 0.7359,
"mean_token_accuracy": 0.8007987380027771,
"num_tokens": 480833427.0,
"step": 4810
},
{
"entropy": 0.984375,
"epoch": 0.6587399207325406,
"grad_norm": 0.31781007957023827,
"learning_rate": 3.457446808510639e-06,
"loss": 0.7044,
"mean_token_accuracy": 0.8087445020675659,
"num_tokens": 481851310.0,
"step": 4820
},
{
"entropy": 0.96015625,
"epoch": 0.6601066010660107,
"grad_norm": 0.3015556208252083,
"learning_rate": 3.453924193321122e-06,
"loss": 0.6982,
"mean_token_accuracy": 0.8103048205375671,
"num_tokens": 482891637.0,
"step": 4830
},
{
"entropy": 0.95234375,
"epoch": 0.6614732813994807,
"grad_norm": 0.3264020829920914,
"learning_rate": 3.4504015781316052e-06,
"loss": 0.6789,
"mean_token_accuracy": 0.8154696345329284,
"num_tokens": 483921621.0,
"step": 4840
},
{
"entropy": 0.98359375,
"epoch": 0.6628399617329507,
"grad_norm": 0.34790435269797915,
"learning_rate": 3.4468789629420884e-06,
"loss": 0.7094,
"mean_token_accuracy": 0.8074753224849701,
"num_tokens": 484982954.0,
"step": 4850
},
{
"entropy": 0.94453125,
"epoch": 0.6642066420664207,
"grad_norm": 0.2962159877354206,
"learning_rate": 3.4433563477525715e-06,
"loss": 0.6954,
"mean_token_accuracy": 0.8110183954238892,
"num_tokens": 485972247.0,
"step": 4860
},
{
"entropy": 0.978515625,
"epoch": 0.6655733223998906,
"grad_norm": 0.2936716175352517,
"learning_rate": 3.439833732563055e-06,
"loss": 0.6908,
"mean_token_accuracy": 0.8115616738796234,
"num_tokens": 486961829.0,
"step": 4870
},
{
"entropy": 0.984375,
"epoch": 0.6669400027333606,
"grad_norm": 0.35476200814049197,
"learning_rate": 3.4363111173735386e-06,
"loss": 0.704,
"mean_token_accuracy": 0.8089752078056336,
"num_tokens": 487999991.0,
"step": 4880
},
{
"entropy": 0.978515625,
"epoch": 0.6683066830668307,
"grad_norm": 0.28957970486673573,
"learning_rate": 3.4327885021840217e-06,
"loss": 0.7111,
"mean_token_accuracy": 0.8074664235115051,
"num_tokens": 489015250.0,
"step": 4890
},
{
"entropy": 0.970703125,
"epoch": 0.6696733634003007,
"grad_norm": 0.2870286850314692,
"learning_rate": 3.429265886994505e-06,
"loss": 0.7311,
"mean_token_accuracy": 0.8033273935317993,
"num_tokens": 490060131.0,
"step": 4900
},
{
"entropy": 0.969921875,
"epoch": 0.6710400437337707,
"grad_norm": 0.30549930544264536,
"learning_rate": 3.4257432718049884e-06,
"loss": 0.6805,
"mean_token_accuracy": 0.813351708650589,
"num_tokens": 491082366.0,
"step": 4910
},
{
"entropy": 0.9515625,
"epoch": 0.6724067240672407,
"grad_norm": 0.3563147005292911,
"learning_rate": 3.4222206566154715e-06,
"loss": 0.7217,
"mean_token_accuracy": 0.806405109167099,
"num_tokens": 492125674.0,
"step": 4920
},
{
"entropy": 1.00234375,
"epoch": 0.6737734044007107,
"grad_norm": 0.2965836928328214,
"learning_rate": 3.418698041425955e-06,
"loss": 0.7394,
"mean_token_accuracy": 0.7999022483825684,
"num_tokens": 493112088.0,
"step": 4930
},
{
"entropy": 0.943359375,
"epoch": 0.6751400847341806,
"grad_norm": 0.28914986461294584,
"learning_rate": 3.415175426236438e-06,
"loss": 0.6808,
"mean_token_accuracy": 0.8147705316543579,
"num_tokens": 494137107.0,
"step": 4940
},
{
"entropy": 0.935546875,
"epoch": 0.6765067650676507,
"grad_norm": 0.2730595076828646,
"learning_rate": 3.4116528110469217e-06,
"loss": 0.6617,
"mean_token_accuracy": 0.8192505002021789,
"num_tokens": 495128504.0,
"step": 4950
},
{
"entropy": 0.96796875,
"epoch": 0.6778734454011207,
"grad_norm": 0.3074054455742474,
"learning_rate": 3.408130195857405e-06,
"loss": 0.6807,
"mean_token_accuracy": 0.8149556577205658,
"num_tokens": 496080043.0,
"step": 4960
},
{
"entropy": 0.998828125,
"epoch": 0.6792401257345907,
"grad_norm": 0.3343484552137871,
"learning_rate": 3.404607580667888e-06,
"loss": 0.713,
"mean_token_accuracy": 0.8065791726112366,
"num_tokens": 497081232.0,
"step": 4970
},
{
"entropy": 0.950390625,
"epoch": 0.6806068060680607,
"grad_norm": 0.29553884009119014,
"learning_rate": 3.401084965478371e-06,
"loss": 0.6655,
"mean_token_accuracy": 0.8179472982883453,
"num_tokens": 498057583.0,
"step": 4980
},
{
"entropy": 0.98984375,
"epoch": 0.6819734864015307,
"grad_norm": 0.2751504375691735,
"learning_rate": 3.397562350288855e-06,
"loss": 0.7063,
"mean_token_accuracy": 0.8090551018714904,
"num_tokens": 499058823.0,
"step": 4990
},
{
"entropy": 0.957421875,
"epoch": 0.6833401667350006,
"grad_norm": 0.3473921464637044,
"learning_rate": 3.394039735099338e-06,
"loss": 0.6671,
"mean_token_accuracy": 0.8167648673057556,
"num_tokens": 500054628.0,
"step": 5000
},
{
"entropy": 0.943359375,
"epoch": 0.6847068470684707,
"grad_norm": 0.3155463663561798,
"learning_rate": 3.3905171199098213e-06,
"loss": 0.6627,
"mean_token_accuracy": 0.8159048974514007,
"num_tokens": 501048187.0,
"step": 5010
},
{
"entropy": 0.960546875,
"epoch": 0.6860735274019407,
"grad_norm": 0.2762171449115399,
"learning_rate": 3.3869945047203044e-06,
"loss": 0.7088,
"mean_token_accuracy": 0.8077372729778289,
"num_tokens": 502062268.0,
"step": 5020
},
{
"entropy": 0.957421875,
"epoch": 0.6874402077354107,
"grad_norm": 0.30280806092586376,
"learning_rate": 3.3834718895307876e-06,
"loss": 0.669,
"mean_token_accuracy": 0.8165210902690887,
"num_tokens": 503054152.0,
"step": 5030
},
{
"entropy": 0.953125,
"epoch": 0.6888068880688807,
"grad_norm": 0.26295282995019265,
"learning_rate": 3.3799492743412715e-06,
"loss": 0.6754,
"mean_token_accuracy": 0.8160199522972107,
"num_tokens": 504061542.0,
"step": 5040
},
{
"entropy": 0.96875,
"epoch": 0.6901735684023507,
"grad_norm": 0.27259853571252946,
"learning_rate": 3.3764266591517547e-06,
"loss": 0.6926,
"mean_token_accuracy": 0.8106239318847657,
"num_tokens": 505071467.0,
"step": 5050
},
{
"entropy": 0.962109375,
"epoch": 0.6915402487358207,
"grad_norm": 0.35487846549000124,
"learning_rate": 3.3729040439622378e-06,
"loss": 0.7041,
"mean_token_accuracy": 0.8089596033096313,
"num_tokens": 506090809.0,
"step": 5060
},
{
"entropy": 0.98359375,
"epoch": 0.6929069290692907,
"grad_norm": 0.3306994537275974,
"learning_rate": 3.3693814287727213e-06,
"loss": 0.7178,
"mean_token_accuracy": 0.8044755220413208,
"num_tokens": 507069713.0,
"step": 5070
},
{
"entropy": 1.0046875,
"epoch": 0.6942736094027607,
"grad_norm": 0.31527689432850686,
"learning_rate": 3.3658588135832044e-06,
"loss": 0.7303,
"mean_token_accuracy": 0.8033686459064484,
"num_tokens": 508131315.0,
"step": 5080
},
{
"entropy": 0.951171875,
"epoch": 0.6956402897362307,
"grad_norm": 0.28927017026057583,
"learning_rate": 3.3623361983936876e-06,
"loss": 0.6945,
"mean_token_accuracy": 0.8117424368858337,
"num_tokens": 509194218.0,
"step": 5090
},
{
"entropy": 0.973046875,
"epoch": 0.6970069700697007,
"grad_norm": 0.2753785790537042,
"learning_rate": 3.358813583204171e-06,
"loss": 0.6885,
"mean_token_accuracy": 0.8126153647899628,
"num_tokens": 510256059.0,
"step": 5100
},
{
"entropy": 1.015234375,
"epoch": 0.6983736504031707,
"grad_norm": 0.3246832856340843,
"learning_rate": 3.3552909680146547e-06,
"loss": 0.7195,
"mean_token_accuracy": 0.8042892873287201,
"num_tokens": 511260466.0,
"step": 5110
},
{
"entropy": 0.9484375,
"epoch": 0.6997403307366407,
"grad_norm": 0.28900288397226026,
"learning_rate": 3.3517683528251378e-06,
"loss": 0.6812,
"mean_token_accuracy": 0.813086211681366,
"num_tokens": 512259871.0,
"step": 5120
},
{
"entropy": 0.949609375,
"epoch": 0.7011070110701108,
"grad_norm": 0.3190528511823365,
"learning_rate": 3.348245737635621e-06,
"loss": 0.6759,
"mean_token_accuracy": 0.8159184932708741,
"num_tokens": 513284332.0,
"step": 5130
},
{
"entropy": 0.97578125,
"epoch": 0.7024736914035807,
"grad_norm": 0.2772206205923986,
"learning_rate": 3.344723122446104e-06,
"loss": 0.6935,
"mean_token_accuracy": 0.8100574851036072,
"num_tokens": 514253926.0,
"step": 5140
},
{
"entropy": 0.991015625,
"epoch": 0.7038403717370507,
"grad_norm": 0.29190408049648264,
"learning_rate": 3.341200507256587e-06,
"loss": 0.7101,
"mean_token_accuracy": 0.8081827044487,
"num_tokens": 515239960.0,
"step": 5150
},
{
"entropy": 1.022265625,
"epoch": 0.7052070520705207,
"grad_norm": 0.31798450457967037,
"learning_rate": 3.337677892067071e-06,
"loss": 0.6995,
"mean_token_accuracy": 0.8106700599193573,
"num_tokens": 516225008.0,
"step": 5160
},
{
"entropy": 0.9828125,
"epoch": 0.7065737324039907,
"grad_norm": 0.349951877626245,
"learning_rate": 3.3341552768775543e-06,
"loss": 0.731,
"mean_token_accuracy": 0.8015569388866425,
"num_tokens": 517241190.0,
"step": 5170
},
{
"entropy": 0.976171875,
"epoch": 0.7079404127374607,
"grad_norm": 0.32149745852242245,
"learning_rate": 3.3306326616880374e-06,
"loss": 0.6797,
"mean_token_accuracy": 0.8144209563732148,
"num_tokens": 518251490.0,
"step": 5180
},
{
"entropy": 1.011328125,
"epoch": 0.7093070930709308,
"grad_norm": 0.2809907740944684,
"learning_rate": 3.3271100464985205e-06,
"loss": 0.719,
"mean_token_accuracy": 0.8052473664283752,
"num_tokens": 519272357.0,
"step": 5190
},
{
"entropy": 0.96875,
"epoch": 0.7106737734044007,
"grad_norm": 0.29422199515864333,
"learning_rate": 3.323587431309004e-06,
"loss": 0.6975,
"mean_token_accuracy": 0.8127782821655274,
"num_tokens": 520319517.0,
"step": 5200
},
{
"entropy": 0.987109375,
"epoch": 0.7120404537378707,
"grad_norm": 0.3152128251199193,
"learning_rate": 3.3200648161194876e-06,
"loss": 0.7053,
"mean_token_accuracy": 0.8082129955291748,
"num_tokens": 521333969.0,
"step": 5210
},
{
"entropy": 0.965234375,
"epoch": 0.7134071340713407,
"grad_norm": 0.2893747373304026,
"learning_rate": 3.3165422009299707e-06,
"loss": 0.7009,
"mean_token_accuracy": 0.8110097229480744,
"num_tokens": 522342219.0,
"step": 5220
},
{
"entropy": 0.98515625,
"epoch": 0.7147738144048107,
"grad_norm": 0.3013603898751465,
"learning_rate": 3.313019585740454e-06,
"loss": 0.6953,
"mean_token_accuracy": 0.8111037492752076,
"num_tokens": 523334861.0,
"step": 5230
},
{
"entropy": 0.986328125,
"epoch": 0.7161404947382807,
"grad_norm": 0.28670850886804095,
"learning_rate": 3.3094969705509374e-06,
"loss": 0.7397,
"mean_token_accuracy": 0.8003981471061706,
"num_tokens": 524347920.0,
"step": 5240
},
{
"entropy": 0.978515625,
"epoch": 0.7175071750717508,
"grad_norm": 0.30442557169971723,
"learning_rate": 3.3059743553614205e-06,
"loss": 0.7054,
"mean_token_accuracy": 0.8080243408679962,
"num_tokens": 525329939.0,
"step": 5250
},
{
"entropy": 0.959375,
"epoch": 0.7188738554052208,
"grad_norm": 0.29248248914816916,
"learning_rate": 3.3024517401719036e-06,
"loss": 0.6926,
"mean_token_accuracy": 0.8101104617118835,
"num_tokens": 526310927.0,
"step": 5260
},
{
"entropy": 0.981640625,
"epoch": 0.7202405357386907,
"grad_norm": 0.3507319926577045,
"learning_rate": 3.298929124982387e-06,
"loss": 0.7416,
"mean_token_accuracy": 0.808040314912796,
"num_tokens": 527328309.0,
"step": 5270
},
{
"entropy": 0.998046875,
"epoch": 0.7216072160721607,
"grad_norm": 0.27529215540118096,
"learning_rate": 3.2954065097928707e-06,
"loss": 0.7181,
"mean_token_accuracy": 0.8069609820842742,
"num_tokens": 528355417.0,
"step": 5280
},
{
"entropy": 0.974609375,
"epoch": 0.7229738964056307,
"grad_norm": 0.29046593191015435,
"learning_rate": 3.291883894603354e-06,
"loss": 0.7209,
"mean_token_accuracy": 0.8070241808891296,
"num_tokens": 529367701.0,
"step": 5290
},
{
"entropy": 0.93828125,
"epoch": 0.7243405767391007,
"grad_norm": 0.3135984114364179,
"learning_rate": 3.288361279413837e-06,
"loss": 0.7044,
"mean_token_accuracy": 0.8085176646709442,
"num_tokens": 530358442.0,
"step": 5300
},
{
"entropy": 0.94609375,
"epoch": 0.7257072570725708,
"grad_norm": 0.2800172188078454,
"learning_rate": 3.28483866422432e-06,
"loss": 0.6695,
"mean_token_accuracy": 0.8171441853046417,
"num_tokens": 531346660.0,
"step": 5310
},
{
"entropy": 0.98671875,
"epoch": 0.7270739374060408,
"grad_norm": 0.28046425927780366,
"learning_rate": 3.281316049034804e-06,
"loss": 0.7234,
"mean_token_accuracy": 0.8021590769290924,
"num_tokens": 532403220.0,
"step": 5320
},
{
"entropy": 0.9546875,
"epoch": 0.7284406177395107,
"grad_norm": 0.2874068782846205,
"learning_rate": 3.277793433845287e-06,
"loss": 0.6589,
"mean_token_accuracy": 0.8160367131233215,
"num_tokens": 533433256.0,
"step": 5330
},
{
"entropy": 0.978515625,
"epoch": 0.7298072980729807,
"grad_norm": 0.32596073065580283,
"learning_rate": 3.2742708186557703e-06,
"loss": 0.6844,
"mean_token_accuracy": 0.814948457479477,
"num_tokens": 534455546.0,
"step": 5340
},
{
"entropy": 0.98671875,
"epoch": 0.7311739784064507,
"grad_norm": 0.3136122451284216,
"learning_rate": 3.2707482034662534e-06,
"loss": 0.7039,
"mean_token_accuracy": 0.8067696154117584,
"num_tokens": 535465383.0,
"step": 5350
},
{
"entropy": 0.984375,
"epoch": 0.7325406587399207,
"grad_norm": 0.2927237192393553,
"learning_rate": 3.2672255882767366e-06,
"loss": 0.7005,
"mean_token_accuracy": 0.8112684071063996,
"num_tokens": 536463324.0,
"step": 5360
},
{
"entropy": 0.9453125,
"epoch": 0.7339073390733908,
"grad_norm": 0.2661696916436393,
"learning_rate": 3.26370297308722e-06,
"loss": 0.659,
"mean_token_accuracy": 0.8187053143978119,
"num_tokens": 537502644.0,
"step": 5370
},
{
"entropy": 0.961328125,
"epoch": 0.7352740194068608,
"grad_norm": 0.2849672634869449,
"learning_rate": 3.2601803578977037e-06,
"loss": 0.7035,
"mean_token_accuracy": 0.8081985950469971,
"num_tokens": 538501841.0,
"step": 5380
},
{
"entropy": 0.947265625,
"epoch": 0.7366406997403308,
"grad_norm": 0.26880170126346875,
"learning_rate": 3.2566577427081868e-06,
"loss": 0.6725,
"mean_token_accuracy": 0.8146951556205749,
"num_tokens": 539529171.0,
"step": 5390
},
{
"entropy": 0.98046875,
"epoch": 0.7380073800738007,
"grad_norm": 0.31700973685380196,
"learning_rate": 3.25313512751867e-06,
"loss": 0.6953,
"mean_token_accuracy": 0.810868889093399,
"num_tokens": 540506909.0,
"step": 5400
},
{
"entropy": 1.005859375,
"epoch": 0.7393740604072707,
"grad_norm": 0.2903197445239248,
"learning_rate": 3.2496125123291535e-06,
"loss": 0.7255,
"mean_token_accuracy": 0.8048626959323884,
"num_tokens": 541508626.0,
"step": 5410
},
{
"entropy": 0.971484375,
"epoch": 0.7407407407407407,
"grad_norm": 0.29748112918982295,
"learning_rate": 3.2460898971396366e-06,
"loss": 0.6841,
"mean_token_accuracy": 0.815371435880661,
"num_tokens": 542509987.0,
"step": 5420
},
{
"entropy": 0.979296875,
"epoch": 0.7421074210742108,
"grad_norm": 0.29820564044953923,
"learning_rate": 3.24256728195012e-06,
"loss": 0.7071,
"mean_token_accuracy": 0.8096927523612976,
"num_tokens": 543492581.0,
"step": 5430
},
{
"entropy": 0.96015625,
"epoch": 0.7434741014076808,
"grad_norm": 0.2786757671072904,
"learning_rate": 3.2390446667606037e-06,
"loss": 0.6825,
"mean_token_accuracy": 0.8128310799598694,
"num_tokens": 544522249.0,
"step": 5440
},
{
"entropy": 0.97578125,
"epoch": 0.7448407817411508,
"grad_norm": 0.29905373901801074,
"learning_rate": 3.235522051571087e-06,
"loss": 0.6825,
"mean_token_accuracy": 0.8136143028736115,
"num_tokens": 545521894.0,
"step": 5450
},
{
"entropy": 0.991796875,
"epoch": 0.7462074620746207,
"grad_norm": 0.28199769463283425,
"learning_rate": 3.23199943638157e-06,
"loss": 0.6983,
"mean_token_accuracy": 0.8097034454345703,
"num_tokens": 546492940.0,
"step": 5460
},
{
"entropy": 0.990234375,
"epoch": 0.7475741424080907,
"grad_norm": 0.3431171395796735,
"learning_rate": 3.228476821192053e-06,
"loss": 0.7115,
"mean_token_accuracy": 0.8080429434776306,
"num_tokens": 547508015.0,
"step": 5470
},
{
"entropy": 1.000390625,
"epoch": 0.7489408227415607,
"grad_norm": 0.31637269564039183,
"learning_rate": 3.224954206002536e-06,
"loss": 0.738,
"mean_token_accuracy": 0.7998568475246429,
"num_tokens": 548533834.0,
"step": 5480
},
{
"entropy": 0.95703125,
"epoch": 0.7503075030750308,
"grad_norm": 0.2764804751701535,
"learning_rate": 3.22143159081302e-06,
"loss": 0.6487,
"mean_token_accuracy": 0.8215092480182647,
"num_tokens": 549548230.0,
"step": 5490
},
{
"entropy": 1.009375,
"epoch": 0.7516741834085008,
"grad_norm": 0.35088344828421303,
"learning_rate": 3.2179089756235033e-06,
"loss": 0.7131,
"mean_token_accuracy": 0.8051902234554291,
"num_tokens": 550550533.0,
"step": 5500
},
{
"entropy": 0.992578125,
"epoch": 0.7530408637419708,
"grad_norm": 0.2954154108799479,
"learning_rate": 3.2143863604339864e-06,
"loss": 0.7107,
"mean_token_accuracy": 0.8066734671592712,
"num_tokens": 551582423.0,
"step": 5510
},
{
"entropy": 0.99375,
"epoch": 0.7544075440754408,
"grad_norm": 0.2836030670437231,
"learning_rate": 3.2108637452444695e-06,
"loss": 0.7047,
"mean_token_accuracy": 0.8096573054790497,
"num_tokens": 552575638.0,
"step": 5520
},
{
"entropy": 1.01328125,
"epoch": 0.7557742244089107,
"grad_norm": 0.2843087985447617,
"learning_rate": 3.2073411300549526e-06,
"loss": 0.7485,
"mean_token_accuracy": 0.8012133717536927,
"num_tokens": 553546977.0,
"step": 5530
},
{
"entropy": 0.941015625,
"epoch": 0.7571409047423807,
"grad_norm": 0.27778197774705066,
"learning_rate": 3.2038185148654366e-06,
"loss": 0.6489,
"mean_token_accuracy": 0.8208906054496765,
"num_tokens": 554537362.0,
"step": 5540
},
{
"entropy": 1.00078125,
"epoch": 0.7585075850758508,
"grad_norm": 0.31614310674667595,
"learning_rate": 3.2002958996759197e-06,
"loss": 0.7503,
"mean_token_accuracy": 0.798703384399414,
"num_tokens": 555506336.0,
"step": 5550
},
{
"entropy": 1.0203125,
"epoch": 0.7598742654093208,
"grad_norm": 0.33161467522546495,
"learning_rate": 3.196773284486403e-06,
"loss": 0.7405,
"mean_token_accuracy": 0.8006944775581359,
"num_tokens": 556496732.0,
"step": 5560
},
{
"entropy": 0.98984375,
"epoch": 0.7612409457427908,
"grad_norm": 0.32003385066760043,
"learning_rate": 3.1932506692968864e-06,
"loss": 0.7398,
"mean_token_accuracy": 0.8002616941928864,
"num_tokens": 557522731.0,
"step": 5570
},
{
"entropy": 0.953125,
"epoch": 0.7626076260762608,
"grad_norm": 0.28544393540427937,
"learning_rate": 3.1897280541073695e-06,
"loss": 0.6846,
"mean_token_accuracy": 0.8113572001457214,
"num_tokens": 558552808.0,
"step": 5580
},
{
"entropy": 0.97109375,
"epoch": 0.7639743064097307,
"grad_norm": 0.26955093393508267,
"learning_rate": 3.1862054389178526e-06,
"loss": 0.6821,
"mean_token_accuracy": 0.8144138336181641,
"num_tokens": 559613029.0,
"step": 5590
},
{
"entropy": 0.9546875,
"epoch": 0.7653409867432007,
"grad_norm": 0.28943525398589653,
"learning_rate": 3.182682823728336e-06,
"loss": 0.6928,
"mean_token_accuracy": 0.8111844539642334,
"num_tokens": 560628142.0,
"step": 5600
},
{
"entropy": 0.95,
"epoch": 0.7667076670766708,
"grad_norm": 0.2801764665441077,
"learning_rate": 3.1791602085388197e-06,
"loss": 0.6861,
"mean_token_accuracy": 0.8118519425392151,
"num_tokens": 561653303.0,
"step": 5610
},
{
"entropy": 1.019140625,
"epoch": 0.7680743474101408,
"grad_norm": 0.2740565761350092,
"learning_rate": 3.175637593349303e-06,
"loss": 0.7415,
"mean_token_accuracy": 0.8026874184608459,
"num_tokens": 562622003.0,
"step": 5620
},
{
"entropy": 1.00703125,
"epoch": 0.7694410277436108,
"grad_norm": 0.2897225795898579,
"learning_rate": 3.172114978159786e-06,
"loss": 0.7229,
"mean_token_accuracy": 0.8059043526649475,
"num_tokens": 563647661.0,
"step": 5630
},
{
"entropy": 0.988671875,
"epoch": 0.7708077080770808,
"grad_norm": 0.3403633912720803,
"learning_rate": 3.168592362970269e-06,
"loss": 0.695,
"mean_token_accuracy": 0.8112172067165375,
"num_tokens": 564603750.0,
"step": 5640
},
{
"entropy": 0.9546875,
"epoch": 0.7721743884105507,
"grad_norm": 0.3078225798612668,
"learning_rate": 3.165069747780753e-06,
"loss": 0.6615,
"mean_token_accuracy": 0.8162312686443329,
"num_tokens": 565577122.0,
"step": 5650
},
{
"entropy": 1.0046875,
"epoch": 0.7735410687440207,
"grad_norm": 0.2974511492849301,
"learning_rate": 3.161547132591236e-06,
"loss": 0.7125,
"mean_token_accuracy": 0.8061446130275727,
"num_tokens": 566604600.0,
"step": 5660
},
{
"entropy": 0.99296875,
"epoch": 0.7749077490774908,
"grad_norm": 0.26825651246274257,
"learning_rate": 3.1580245174017193e-06,
"loss": 0.7073,
"mean_token_accuracy": 0.807921701669693,
"num_tokens": 567617845.0,
"step": 5670
},
{
"entropy": 0.98515625,
"epoch": 0.7762744294109608,
"grad_norm": 0.30470013034501936,
"learning_rate": 3.1545019022122025e-06,
"loss": 0.6813,
"mean_token_accuracy": 0.8148034155368805,
"num_tokens": 568612057.0,
"step": 5680
},
{
"entropy": 1.012890625,
"epoch": 0.7776411097444308,
"grad_norm": 0.288759496126156,
"learning_rate": 3.1509792870226856e-06,
"loss": 0.7296,
"mean_token_accuracy": 0.8028347671031952,
"num_tokens": 569613099.0,
"step": 5690
},
{
"entropy": 0.962109375,
"epoch": 0.7790077900779008,
"grad_norm": 0.322475832565793,
"learning_rate": 3.147456671833169e-06,
"loss": 0.6938,
"mean_token_accuracy": 0.8105435132980346,
"num_tokens": 570607026.0,
"step": 5700
},
{
"entropy": 0.967578125,
"epoch": 0.7803744704113708,
"grad_norm": 0.2999863361699114,
"learning_rate": 3.1439340566436527e-06,
"loss": 0.7001,
"mean_token_accuracy": 0.8101175844669342,
"num_tokens": 571616119.0,
"step": 5710
},
{
"entropy": 0.996484375,
"epoch": 0.7817411507448407,
"grad_norm": 0.29875499206877326,
"learning_rate": 3.140411441454136e-06,
"loss": 0.721,
"mean_token_accuracy": 0.8058936357498169,
"num_tokens": 572598084.0,
"step": 5720
},
{
"entropy": 0.980078125,
"epoch": 0.7831078310783108,
"grad_norm": 0.315543187848242,
"learning_rate": 3.136888826264619e-06,
"loss": 0.7219,
"mean_token_accuracy": 0.8046855449676513,
"num_tokens": 573590736.0,
"step": 5730
},
{
"entropy": 0.959375,
"epoch": 0.7844745114117808,
"grad_norm": 0.3109266580697497,
"learning_rate": 3.1333662110751025e-06,
"loss": 0.6935,
"mean_token_accuracy": 0.810023158788681,
"num_tokens": 574574376.0,
"step": 5740
},
{
"entropy": 0.94453125,
"epoch": 0.7858411917452508,
"grad_norm": 0.313353629925361,
"learning_rate": 3.1298435958855856e-06,
"loss": 0.6803,
"mean_token_accuracy": 0.8135264635086059,
"num_tokens": 575523219.0,
"step": 5750
},
{
"entropy": 0.978125,
"epoch": 0.7872078720787208,
"grad_norm": 0.2879983702994732,
"learning_rate": 3.126320980696069e-06,
"loss": 0.7223,
"mean_token_accuracy": 0.8042430639266968,
"num_tokens": 576500257.0,
"step": 5760
},
{
"entropy": 0.995703125,
"epoch": 0.7885745524121908,
"grad_norm": 0.2881312333858873,
"learning_rate": 3.1227983655065523e-06,
"loss": 0.7003,
"mean_token_accuracy": 0.8074903726577759,
"num_tokens": 577473156.0,
"step": 5770
},
{
"entropy": 0.951953125,
"epoch": 0.7899412327456607,
"grad_norm": 0.28151590473083016,
"learning_rate": 3.119275750317036e-06,
"loss": 0.6821,
"mean_token_accuracy": 0.8143817842006683,
"num_tokens": 578458348.0,
"step": 5780
},
{
"entropy": 1.0125,
"epoch": 0.7913079130791308,
"grad_norm": 0.31415199118069964,
"learning_rate": 3.115753135127519e-06,
"loss": 0.7306,
"mean_token_accuracy": 0.8010571837425232,
"num_tokens": 579469890.0,
"step": 5790
},
{
"entropy": 0.963671875,
"epoch": 0.7926745934126008,
"grad_norm": 0.28946001280849404,
"learning_rate": 3.112230519938002e-06,
"loss": 0.6949,
"mean_token_accuracy": 0.8108739733695984,
"num_tokens": 580508736.0,
"step": 5800
},
{
"entropy": 0.947265625,
"epoch": 0.7940412737460708,
"grad_norm": 0.3382796734029658,
"learning_rate": 3.108707904748485e-06,
"loss": 0.6725,
"mean_token_accuracy": 0.8164338529109955,
"num_tokens": 581445920.0,
"step": 5810
},
{
"entropy": 0.989453125,
"epoch": 0.7954079540795408,
"grad_norm": 0.2657347488693671,
"learning_rate": 3.105185289558969e-06,
"loss": 0.711,
"mean_token_accuracy": 0.8079670071601868,
"num_tokens": 582487593.0,
"step": 5820
},
{
"entropy": 0.959375,
"epoch": 0.7967746344130108,
"grad_norm": 0.2706701689975465,
"learning_rate": 3.1016626743694523e-06,
"loss": 0.6944,
"mean_token_accuracy": 0.811071652173996,
"num_tokens": 583488287.0,
"step": 5830
},
{
"entropy": 0.928125,
"epoch": 0.7981413147464808,
"grad_norm": 0.2730950863556596,
"learning_rate": 3.0981400591799354e-06,
"loss": 0.66,
"mean_token_accuracy": 0.8178508639335632,
"num_tokens": 584551415.0,
"step": 5840
},
{
"entropy": 0.959765625,
"epoch": 0.7995079950799509,
"grad_norm": 0.2730081293874954,
"learning_rate": 3.0946174439904185e-06,
"loss": 0.6668,
"mean_token_accuracy": 0.8178348362445831,
"num_tokens": 585569034.0,
"step": 5850
},
{
"entropy": 0.975,
"epoch": 0.8008746754134208,
"grad_norm": 0.284327780591371,
"learning_rate": 3.0910948288009016e-06,
"loss": 0.6833,
"mean_token_accuracy": 0.8142350673675537,
"num_tokens": 586536939.0,
"step": 5860
},
{
"entropy": 0.9625,
"epoch": 0.8022413557468908,
"grad_norm": 0.3227102271543518,
"learning_rate": 3.0875722136113856e-06,
"loss": 0.7064,
"mean_token_accuracy": 0.8073862552642822,
"num_tokens": 587530274.0,
"step": 5870
},
{
"entropy": 0.98125,
"epoch": 0.8036080360803608,
"grad_norm": 0.3173944694750512,
"learning_rate": 3.0840495984218687e-06,
"loss": 0.7077,
"mean_token_accuracy": 0.8075648844242096,
"num_tokens": 588558033.0,
"step": 5880
},
{
"entropy": 0.994921875,
"epoch": 0.8049747164138308,
"grad_norm": 0.30259204081976143,
"learning_rate": 3.080526983232352e-06,
"loss": 0.7033,
"mean_token_accuracy": 0.8086961448192597,
"num_tokens": 589542926.0,
"step": 5890
},
{
"entropy": 0.98046875,
"epoch": 0.8063413967473008,
"grad_norm": 0.2939051715382706,
"learning_rate": 3.0770043680428354e-06,
"loss": 0.7139,
"mean_token_accuracy": 0.8056675791740417,
"num_tokens": 590551239.0,
"step": 5900
},
{
"entropy": 0.951953125,
"epoch": 0.8077080770807709,
"grad_norm": 0.28781044078495466,
"learning_rate": 3.0734817528533185e-06,
"loss": 0.6648,
"mean_token_accuracy": 0.8188680231571197,
"num_tokens": 591541550.0,
"step": 5910
},
{
"entropy": 1.008203125,
"epoch": 0.8090747574142408,
"grad_norm": 0.3173491761250131,
"learning_rate": 3.0699591376638017e-06,
"loss": 0.7371,
"mean_token_accuracy": 0.80208700299263,
"num_tokens": 592526054.0,
"step": 5920
},
{
"entropy": 0.9625,
"epoch": 0.8104414377477108,
"grad_norm": 0.2868558927016247,
"learning_rate": 3.066436522474285e-06,
"loss": 0.7012,
"mean_token_accuracy": 0.8113022923469544,
"num_tokens": 593517164.0,
"step": 5930
},
{
"entropy": 0.927734375,
"epoch": 0.8118081180811808,
"grad_norm": 0.26194503172310446,
"learning_rate": 3.0629139072847688e-06,
"loss": 0.6618,
"mean_token_accuracy": 0.8183797836303711,
"num_tokens": 594586885.0,
"step": 5940
},
{
"entropy": 1.0015625,
"epoch": 0.8131747984146508,
"grad_norm": 0.37454160872589926,
"learning_rate": 3.059391292095252e-06,
"loss": 0.7277,
"mean_token_accuracy": 0.8022289156913758,
"num_tokens": 595562782.0,
"step": 5950
},
{
"entropy": 0.97578125,
"epoch": 0.8145414787481208,
"grad_norm": 0.28834202981819235,
"learning_rate": 3.055868676905735e-06,
"loss": 0.7088,
"mean_token_accuracy": 0.8083132088184357,
"num_tokens": 596620797.0,
"step": 5960
},
{
"entropy": 1.0109375,
"epoch": 0.8159081590815909,
"grad_norm": 0.32296378796562086,
"learning_rate": 3.052346061716218e-06,
"loss": 0.7281,
"mean_token_accuracy": 0.8045010507106781,
"num_tokens": 597544265.0,
"step": 5970
},
{
"entropy": 0.974609375,
"epoch": 0.8172748394150608,
"grad_norm": 0.30573035579967933,
"learning_rate": 3.048823446526702e-06,
"loss": 0.6905,
"mean_token_accuracy": 0.8118664741516113,
"num_tokens": 598556947.0,
"step": 5980
},
{
"entropy": 0.99453125,
"epoch": 0.8186415197485308,
"grad_norm": 0.3307531241897129,
"learning_rate": 3.0453008313371852e-06,
"loss": 0.7246,
"mean_token_accuracy": 0.8058015286922455,
"num_tokens": 599603049.0,
"step": 5990
},
{
"entropy": 0.965625,
"epoch": 0.8200082000820008,
"grad_norm": 0.32272649471453174,
"learning_rate": 3.0417782161476683e-06,
"loss": 0.712,
"mean_token_accuracy": 0.8070037424564361,
"num_tokens": 600590091.0,
"step": 6000
},
{
"entropy": 1.026953125,
"epoch": 0.8213748804154708,
"grad_norm": 0.3627353370878192,
"learning_rate": 3.0382556009581515e-06,
"loss": 0.7191,
"mean_token_accuracy": 0.803814172744751,
"num_tokens": 601575708.0,
"step": 6010
},
{
"entropy": 0.962890625,
"epoch": 0.8227415607489408,
"grad_norm": 0.2873182570542968,
"learning_rate": 3.0347329857686346e-06,
"loss": 0.6679,
"mean_token_accuracy": 0.8166160941123962,
"num_tokens": 602543161.0,
"step": 6020
},
{
"entropy": 0.953515625,
"epoch": 0.8241082410824109,
"grad_norm": 0.3231254967984526,
"learning_rate": 3.031210370579118e-06,
"loss": 0.6587,
"mean_token_accuracy": 0.8200423181056976,
"num_tokens": 603550842.0,
"step": 6030
},
{
"entropy": 0.96953125,
"epoch": 0.8254749214158809,
"grad_norm": 0.3075113353813072,
"learning_rate": 3.0276877553896017e-06,
"loss": 0.6995,
"mean_token_accuracy": 0.8067638576030731,
"num_tokens": 604559325.0,
"step": 6040
},
{
"entropy": 0.990625,
"epoch": 0.8268416017493508,
"grad_norm": 0.3659472026234965,
"learning_rate": 3.024165140200085e-06,
"loss": 0.6802,
"mean_token_accuracy": 0.8136870443820954,
"num_tokens": 605552607.0,
"step": 6050
},
{
"entropy": 0.984375,
"epoch": 0.8282082820828208,
"grad_norm": 0.29823220842017995,
"learning_rate": 3.020642525010568e-06,
"loss": 0.7018,
"mean_token_accuracy": 0.8099577605724335,
"num_tokens": 606538979.0,
"step": 6060
},
{
"entropy": 0.9796875,
"epoch": 0.8295749624162908,
"grad_norm": 0.3164551332612286,
"learning_rate": 3.0171199098210515e-06,
"loss": 0.6823,
"mean_token_accuracy": 0.812882125377655,
"num_tokens": 607508204.0,
"step": 6070
},
{
"entropy": 0.96484375,
"epoch": 0.8309416427497608,
"grad_norm": 0.29197430514074707,
"learning_rate": 3.0135972946315346e-06,
"loss": 0.7031,
"mean_token_accuracy": 0.8107471406459809,
"num_tokens": 608524577.0,
"step": 6080
},
{
"entropy": 0.996875,
"epoch": 0.8323083230832309,
"grad_norm": 0.2943627113489732,
"learning_rate": 3.010074679442018e-06,
"loss": 0.7231,
"mean_token_accuracy": 0.8043189764022827,
"num_tokens": 609491404.0,
"step": 6090
},
{
"entropy": 0.996484375,
"epoch": 0.8336750034167009,
"grad_norm": 0.33723141751271785,
"learning_rate": 3.0065520642525013e-06,
"loss": 0.7352,
"mean_token_accuracy": 0.8029096305370331,
"num_tokens": 610456894.0,
"step": 6100
},
{
"entropy": 1.0015625,
"epoch": 0.8350416837501708,
"grad_norm": 0.2995235686133804,
"learning_rate": 3.003029449062985e-06,
"loss": 0.7023,
"mean_token_accuracy": 0.8091130018234253,
"num_tokens": 611476065.0,
"step": 6110
},
{
"entropy": 0.978515625,
"epoch": 0.8364083640836408,
"grad_norm": 0.34785435794077924,
"learning_rate": 2.999506833873468e-06,
"loss": 0.7178,
"mean_token_accuracy": 0.8065024852752686,
"num_tokens": 612425310.0,
"step": 6120
},
{
"entropy": 1.01171875,
"epoch": 0.8377750444171108,
"grad_norm": 0.2800779601424674,
"learning_rate": 2.995984218683951e-06,
"loss": 0.7434,
"mean_token_accuracy": 0.7990614473819733,
"num_tokens": 613425793.0,
"step": 6130
},
{
"entropy": 0.971875,
"epoch": 0.8391417247505808,
"grad_norm": 0.2741202082023995,
"learning_rate": 2.992461603494434e-06,
"loss": 0.6801,
"mean_token_accuracy": 0.8141279101371766,
"num_tokens": 614450318.0,
"step": 6140
},
{
"entropy": 0.97421875,
"epoch": 0.8405084050840509,
"grad_norm": 0.3000152894005287,
"learning_rate": 2.988938988304918e-06,
"loss": 0.7119,
"mean_token_accuracy": 0.8068076252937317,
"num_tokens": 615468699.0,
"step": 6150
},
{
"entropy": 0.95625,
"epoch": 0.8418750854175209,
"grad_norm": 0.2912450485419346,
"learning_rate": 2.9854163731154013e-06,
"loss": 0.686,
"mean_token_accuracy": 0.8145248055458069,
"num_tokens": 616457438.0,
"step": 6160
},
{
"entropy": 0.98203125,
"epoch": 0.8432417657509909,
"grad_norm": 0.2598026809456778,
"learning_rate": 2.9818937579258844e-06,
"loss": 0.6928,
"mean_token_accuracy": 0.8100854814052582,
"num_tokens": 617408605.0,
"step": 6170
},
{
"entropy": 0.971875,
"epoch": 0.8446084460844608,
"grad_norm": 0.2931850759319398,
"learning_rate": 2.9783711427363675e-06,
"loss": 0.6696,
"mean_token_accuracy": 0.8167233049869538,
"num_tokens": 618412780.0,
"step": 6180
},
{
"entropy": 0.9875,
"epoch": 0.8459751264179308,
"grad_norm": 0.3447061887276082,
"learning_rate": 2.9748485275468507e-06,
"loss": 0.7081,
"mean_token_accuracy": 0.8088925898075103,
"num_tokens": 619400950.0,
"step": 6190
},
{
"entropy": 0.966796875,
"epoch": 0.8473418067514008,
"grad_norm": 0.28290956937265804,
"learning_rate": 2.9713259123573346e-06,
"loss": 0.7001,
"mean_token_accuracy": 0.8089822769165039,
"num_tokens": 620361772.0,
"step": 6200
},
{
"entropy": 0.966015625,
"epoch": 0.8487084870848709,
"grad_norm": 0.27239960556717474,
"learning_rate": 2.9678032971678177e-06,
"loss": 0.7088,
"mean_token_accuracy": 0.8069662153720856,
"num_tokens": 621309759.0,
"step": 6210
},
{
"entropy": 0.956640625,
"epoch": 0.8500751674183409,
"grad_norm": 0.28597923113937274,
"learning_rate": 2.964280681978301e-06,
"loss": 0.7394,
"mean_token_accuracy": 0.8004271745681762,
"num_tokens": 622344321.0,
"step": 6220
},
{
"entropy": 0.95625,
"epoch": 0.8514418477518109,
"grad_norm": 0.34479353589185674,
"learning_rate": 2.960758066788784e-06,
"loss": 0.6898,
"mean_token_accuracy": 0.8127300024032593,
"num_tokens": 623307147.0,
"step": 6230
},
{
"entropy": 0.998046875,
"epoch": 0.8528085280852808,
"grad_norm": 0.33263137645285146,
"learning_rate": 2.9572354515992675e-06,
"loss": 0.7048,
"mean_token_accuracy": 0.8067147672176361,
"num_tokens": 624284064.0,
"step": 6240
},
{
"entropy": 0.921484375,
"epoch": 0.8541752084187508,
"grad_norm": 0.2891303282433591,
"learning_rate": 2.9537128364097507e-06,
"loss": 0.6532,
"mean_token_accuracy": 0.8223119914531708,
"num_tokens": 625283185.0,
"step": 6250
},
{
"entropy": 0.9640625,
"epoch": 0.8555418887522208,
"grad_norm": 0.26671341738473653,
"learning_rate": 2.9501902212202342e-06,
"loss": 0.696,
"mean_token_accuracy": 0.811868405342102,
"num_tokens": 626319054.0,
"step": 6260
},
{
"entropy": 0.977734375,
"epoch": 0.8569085690856909,
"grad_norm": 0.2685318932329358,
"learning_rate": 2.9466676060307178e-06,
"loss": 0.7173,
"mean_token_accuracy": 0.8060109794139863,
"num_tokens": 627327798.0,
"step": 6270
},
{
"entropy": 1.003125,
"epoch": 0.8582752494191609,
"grad_norm": 0.26773634875647745,
"learning_rate": 2.943144990841201e-06,
"loss": 0.7118,
"mean_token_accuracy": 0.8072892248630523,
"num_tokens": 628345763.0,
"step": 6280
},
{
"entropy": 0.9734375,
"epoch": 0.8596419297526309,
"grad_norm": 0.2914634754364856,
"learning_rate": 2.939622375651684e-06,
"loss": 0.6845,
"mean_token_accuracy": 0.8137413799762726,
"num_tokens": 629349687.0,
"step": 6290
},
{
"entropy": 0.989453125,
"epoch": 0.8610086100861009,
"grad_norm": 0.32437817808523195,
"learning_rate": 2.936099760462167e-06,
"loss": 0.7418,
"mean_token_accuracy": 0.8009844183921814,
"num_tokens": 630396591.0,
"step": 6300
},
{
"entropy": 0.96953125,
"epoch": 0.8623752904195708,
"grad_norm": 0.28647188046511735,
"learning_rate": 2.932577145272651e-06,
"loss": 0.6477,
"mean_token_accuracy": 0.8211350500583648,
"num_tokens": 631372808.0,
"step": 6310
},
{
"entropy": 0.991015625,
"epoch": 0.8637419707530408,
"grad_norm": 0.2710141510943479,
"learning_rate": 2.9290545300831342e-06,
"loss": 0.7137,
"mean_token_accuracy": 0.8068701148033142,
"num_tokens": 632389956.0,
"step": 6320
},
{
"entropy": 1.01328125,
"epoch": 0.8651086510865109,
"grad_norm": 0.2883615818158553,
"learning_rate": 2.9255319148936174e-06,
"loss": 0.7347,
"mean_token_accuracy": 0.8036620318889618,
"num_tokens": 633382741.0,
"step": 6330
},
{
"entropy": 0.947265625,
"epoch": 0.8664753314199809,
"grad_norm": 0.28939529732357094,
"learning_rate": 2.9220092997041005e-06,
"loss": 0.6598,
"mean_token_accuracy": 0.8201105475425721,
"num_tokens": 634392872.0,
"step": 6340
},
{
"entropy": 0.990625,
"epoch": 0.8678420117534509,
"grad_norm": 0.3019600130184595,
"learning_rate": 2.9184866845145836e-06,
"loss": 0.7009,
"mean_token_accuracy": 0.8097968578338623,
"num_tokens": 635397192.0,
"step": 6350
},
{
"entropy": 0.97109375,
"epoch": 0.8692086920869209,
"grad_norm": 0.321256466799334,
"learning_rate": 2.9149640693250667e-06,
"loss": 0.7053,
"mean_token_accuracy": 0.8084814429283143,
"num_tokens": 636429865.0,
"step": 6360
},
{
"entropy": 0.984765625,
"epoch": 0.8705753724203908,
"grad_norm": 0.2939166930748819,
"learning_rate": 2.9114414541355507e-06,
"loss": 0.7132,
"mean_token_accuracy": 0.8067617356777191,
"num_tokens": 637412707.0,
"step": 6370
},
{
"entropy": 0.991015625,
"epoch": 0.8719420527538608,
"grad_norm": 0.2727156526101337,
"learning_rate": 2.907918838946034e-06,
"loss": 0.6947,
"mean_token_accuracy": 0.8129273116588592,
"num_tokens": 638419040.0,
"step": 6380
},
{
"entropy": 0.993359375,
"epoch": 0.8733087330873309,
"grad_norm": 0.29780771752483387,
"learning_rate": 2.904396223756517e-06,
"loss": 0.7071,
"mean_token_accuracy": 0.8079606354236603,
"num_tokens": 639409575.0,
"step": 6390
},
{
"entropy": 0.991015625,
"epoch": 0.8746754134208009,
"grad_norm": 0.3071465350740234,
"learning_rate": 2.9008736085670005e-06,
"loss": 0.7059,
"mean_token_accuracy": 0.8088766515254975,
"num_tokens": 640403980.0,
"step": 6400
},
{
"entropy": 0.9421875,
"epoch": 0.8760420937542709,
"grad_norm": 0.37598337204040894,
"learning_rate": 2.8973509933774836e-06,
"loss": 0.6691,
"mean_token_accuracy": 0.8167026400566101,
"num_tokens": 641380100.0,
"step": 6410
},
{
"entropy": 0.982421875,
"epoch": 0.8774087740877409,
"grad_norm": 0.28171518163332343,
"learning_rate": 2.893828378187967e-06,
"loss": 0.7328,
"mean_token_accuracy": 0.8029355049133301,
"num_tokens": 642396526.0,
"step": 6420
},
{
"entropy": 0.972265625,
"epoch": 0.8787754544212109,
"grad_norm": 0.2996351456592474,
"learning_rate": 2.8903057629984503e-06,
"loss": 0.6771,
"mean_token_accuracy": 0.8140079498291015,
"num_tokens": 643365779.0,
"step": 6430
},
{
"entropy": 0.974609375,
"epoch": 0.8801421347546808,
"grad_norm": 0.30224027037904716,
"learning_rate": 2.886783147808934e-06,
"loss": 0.6795,
"mean_token_accuracy": 0.8135444939136505,
"num_tokens": 644374233.0,
"step": 6440
},
{
"entropy": 1.0140625,
"epoch": 0.8815088150881509,
"grad_norm": 0.2933117548009696,
"learning_rate": 2.883260532619417e-06,
"loss": 0.7363,
"mean_token_accuracy": 0.8023761332035064,
"num_tokens": 645333738.0,
"step": 6450
},
{
"entropy": 0.973046875,
"epoch": 0.8828754954216209,
"grad_norm": 0.3224996011436954,
"learning_rate": 2.8797379174299e-06,
"loss": 0.6744,
"mean_token_accuracy": 0.8152699112892151,
"num_tokens": 646280138.0,
"step": 6460
},
{
"entropy": 0.934765625,
"epoch": 0.8842421757550909,
"grad_norm": 0.2764714045330159,
"learning_rate": 2.876215302240383e-06,
"loss": 0.655,
"mean_token_accuracy": 0.8202306270599365,
"num_tokens": 647278647.0,
"step": 6470
},
{
"entropy": 0.996484375,
"epoch": 0.8856088560885609,
"grad_norm": 0.32134476791819294,
"learning_rate": 2.872692687050867e-06,
"loss": 0.7253,
"mean_token_accuracy": 0.8054294109344482,
"num_tokens": 648304920.0,
"step": 6480
},
{
"entropy": 0.967578125,
"epoch": 0.8869755364220309,
"grad_norm": 0.2951336412693532,
"learning_rate": 2.8691700718613503e-06,
"loss": 0.679,
"mean_token_accuracy": 0.8131251156330108,
"num_tokens": 649296959.0,
"step": 6490
},
{
"entropy": 0.9578125,
"epoch": 0.8883422167555008,
"grad_norm": 0.30571060823278595,
"learning_rate": 2.8656474566718334e-06,
"loss": 0.6824,
"mean_token_accuracy": 0.8113418400287629,
"num_tokens": 650329433.0,
"step": 6500
},
{
"entropy": 0.94296875,
"epoch": 0.8897088970889709,
"grad_norm": 0.2890300953507468,
"learning_rate": 2.8621248414823165e-06,
"loss": 0.6643,
"mean_token_accuracy": 0.8174517214298248,
"num_tokens": 651325368.0,
"step": 6510
},
{
"entropy": 0.98671875,
"epoch": 0.8910755774224409,
"grad_norm": 0.32235376671060595,
"learning_rate": 2.8586022262927997e-06,
"loss": 0.697,
"mean_token_accuracy": 0.8094936490058899,
"num_tokens": 652253282.0,
"step": 6520
},
{
"entropy": 1.016015625,
"epoch": 0.8924422577559109,
"grad_norm": 0.2809122310767153,
"learning_rate": 2.8550796111032836e-06,
"loss": 0.7321,
"mean_token_accuracy": 0.8011887848377228,
"num_tokens": 653261800.0,
"step": 6530
},
{
"entropy": 0.96484375,
"epoch": 0.8938089380893809,
"grad_norm": 0.2912028211329781,
"learning_rate": 2.8515569959137668e-06,
"loss": 0.7007,
"mean_token_accuracy": 0.8102782368659973,
"num_tokens": 654258824.0,
"step": 6540
},
{
"entropy": 0.9609375,
"epoch": 0.8951756184228509,
"grad_norm": 0.28359077083470086,
"learning_rate": 2.84803438072425e-06,
"loss": 0.6827,
"mean_token_accuracy": 0.8136013269424438,
"num_tokens": 655251617.0,
"step": 6550
},
{
"entropy": 0.965625,
"epoch": 0.8965422987563209,
"grad_norm": 0.28969451518411854,
"learning_rate": 2.844511765534733e-06,
"loss": 0.6862,
"mean_token_accuracy": 0.8127907276153564,
"num_tokens": 656244842.0,
"step": 6560
},
{
"entropy": 0.926953125,
"epoch": 0.897908979089791,
"grad_norm": 0.26738835780271747,
"learning_rate": 2.8409891503452166e-06,
"loss": 0.6768,
"mean_token_accuracy": 0.8150522708892822,
"num_tokens": 657263161.0,
"step": 6570
},
{
"entropy": 0.96484375,
"epoch": 0.8992756594232609,
"grad_norm": 0.2942543231051045,
"learning_rate": 2.8374665351556997e-06,
"loss": 0.7033,
"mean_token_accuracy": 0.8092438220977783,
"num_tokens": 658229030.0,
"step": 6580
},
{
"entropy": 0.985546875,
"epoch": 0.9006423397567309,
"grad_norm": 0.30186517892704773,
"learning_rate": 2.8339439199661832e-06,
"loss": 0.7112,
"mean_token_accuracy": 0.8089340627193451,
"num_tokens": 659270232.0,
"step": 6590
},
{
"entropy": 0.98671875,
"epoch": 0.9020090200902009,
"grad_norm": 0.5575953951918762,
"learning_rate": 2.8304213047766663e-06,
"loss": 0.7223,
"mean_token_accuracy": 0.8039589762687683,
"num_tokens": 660230684.0,
"step": 6600
},
{
"entropy": 0.953515625,
"epoch": 0.9033757004236709,
"grad_norm": 0.2985206531836995,
"learning_rate": 2.82689868958715e-06,
"loss": 0.6889,
"mean_token_accuracy": 0.813433825969696,
"num_tokens": 661227468.0,
"step": 6610
},
{
"entropy": 0.953125,
"epoch": 0.9047423807571409,
"grad_norm": 0.29620898349370245,
"learning_rate": 2.823376074397633e-06,
"loss": 0.7186,
"mean_token_accuracy": 0.8055509746074676,
"num_tokens": 662247616.0,
"step": 6620
},
{
"entropy": 0.971484375,
"epoch": 0.906109061090611,
"grad_norm": 0.320136668558068,
"learning_rate": 2.819853459208116e-06,
"loss": 0.697,
"mean_token_accuracy": 0.8103512525558472,
"num_tokens": 663208530.0,
"step": 6630
},
{
"entropy": 1.01015625,
"epoch": 0.9074757414240809,
"grad_norm": 0.2901761863313161,
"learning_rate": 2.8163308440186e-06,
"loss": 0.7336,
"mean_token_accuracy": 0.8035214185714722,
"num_tokens": 664207117.0,
"step": 6640
},
{
"entropy": 0.980078125,
"epoch": 0.9088424217575509,
"grad_norm": 0.2997742058065613,
"learning_rate": 2.8128082288290832e-06,
"loss": 0.6763,
"mean_token_accuracy": 0.8152937948703766,
"num_tokens": 665189465.0,
"step": 6650
},
{
"entropy": 0.993359375,
"epoch": 0.9102091020910209,
"grad_norm": 0.3174814636883046,
"learning_rate": 2.8092856136395664e-06,
"loss": 0.7036,
"mean_token_accuracy": 0.8077565610408783,
"num_tokens": 666199452.0,
"step": 6660
},
{
"entropy": 0.984375,
"epoch": 0.9115757824244909,
"grad_norm": 0.30928644770207736,
"learning_rate": 2.8057629984500495e-06,
"loss": 0.7111,
"mean_token_accuracy": 0.806993305683136,
"num_tokens": 667240091.0,
"step": 6670
},
{
"entropy": 0.97109375,
"epoch": 0.9129424627579609,
"grad_norm": 0.2863263401247541,
"learning_rate": 2.8022403832605326e-06,
"loss": 0.6955,
"mean_token_accuracy": 0.8108078062534332,
"num_tokens": 668253541.0,
"step": 6680
},
{
"entropy": 0.980078125,
"epoch": 0.914309143091431,
"grad_norm": 0.2821940085630892,
"learning_rate": 2.7987177680710157e-06,
"loss": 0.6751,
"mean_token_accuracy": 0.8156323850154876,
"num_tokens": 669273366.0,
"step": 6690
},
{
"entropy": 0.976953125,
"epoch": 0.915675823424901,
"grad_norm": 0.3628262779736926,
"learning_rate": 2.7951951528814997e-06,
"loss": 0.7073,
"mean_token_accuracy": 0.8063819587230683,
"num_tokens": 670296894.0,
"step": 6700
},
{
"entropy": 0.983203125,
"epoch": 0.9170425037583709,
"grad_norm": 0.28250366118911596,
"learning_rate": 2.791672537691983e-06,
"loss": 0.7122,
"mean_token_accuracy": 0.8051703691482544,
"num_tokens": 671344584.0,
"step": 6710
},
{
"entropy": 0.971484375,
"epoch": 0.9184091840918409,
"grad_norm": 0.3098999678923463,
"learning_rate": 2.788149922502466e-06,
"loss": 0.7074,
"mean_token_accuracy": 0.8085685610771179,
"num_tokens": 672327599.0,
"step": 6720
},
{
"entropy": 0.9671875,
"epoch": 0.9197758644253109,
"grad_norm": 0.3542166400990644,
"learning_rate": 2.784627307312949e-06,
"loss": 0.6943,
"mean_token_accuracy": 0.8125419378280639,
"num_tokens": 673345908.0,
"step": 6730
},
{
"entropy": 0.94609375,
"epoch": 0.9211425447587809,
"grad_norm": 0.2845398352335146,
"learning_rate": 2.7811046921234326e-06,
"loss": 0.6565,
"mean_token_accuracy": 0.8185151219367981,
"num_tokens": 674352632.0,
"step": 6740
},
{
"entropy": 1.004296875,
"epoch": 0.922509225092251,
"grad_norm": 0.3141905578676694,
"learning_rate": 2.777582076933916e-06,
"loss": 0.7185,
"mean_token_accuracy": 0.8075560629367828,
"num_tokens": 675334845.0,
"step": 6750
},
{
"entropy": 0.96796875,
"epoch": 0.923875905425721,
"grad_norm": 0.25825030656786896,
"learning_rate": 2.7740594617443993e-06,
"loss": 0.6809,
"mean_token_accuracy": 0.8128223121166229,
"num_tokens": 676355454.0,
"step": 6760
},
{
"entropy": 0.981640625,
"epoch": 0.9252425857591909,
"grad_norm": 0.3002993478602983,
"learning_rate": 2.770536846554883e-06,
"loss": 0.6756,
"mean_token_accuracy": 0.815925931930542,
"num_tokens": 677398895.0,
"step": 6770
},
{
"entropy": 1.00546875,
"epoch": 0.9266092660926609,
"grad_norm": 0.2771116195432563,
"learning_rate": 2.767014231365366e-06,
"loss": 0.7205,
"mean_token_accuracy": 0.8070821583271026,
"num_tokens": 678386628.0,
"step": 6780
},
{
"entropy": 0.98984375,
"epoch": 0.9279759464261309,
"grad_norm": 0.3001899866104695,
"learning_rate": 2.763491616175849e-06,
"loss": 0.7371,
"mean_token_accuracy": 0.8023590683937073,
"num_tokens": 679438210.0,
"step": 6790
},
{
"entropy": 0.967578125,
"epoch": 0.9293426267596009,
"grad_norm": 0.30409281495240736,
"learning_rate": 2.759969000986332e-06,
"loss": 0.7098,
"mean_token_accuracy": 0.8061274826526642,
"num_tokens": 680454998.0,
"step": 6800
},
{
"entropy": 0.93203125,
"epoch": 0.930709307093071,
"grad_norm": 0.2880335018126237,
"learning_rate": 2.756446385796816e-06,
"loss": 0.6736,
"mean_token_accuracy": 0.8141964972019196,
"num_tokens": 681444975.0,
"step": 6810
},
{
"entropy": 0.96796875,
"epoch": 0.932075987426541,
"grad_norm": 0.31404767481865337,
"learning_rate": 2.7529237706072993e-06,
"loss": 0.6619,
"mean_token_accuracy": 0.8168764710426331,
"num_tokens": 682457981.0,
"step": 6820
},
{
"entropy": 0.962890625,
"epoch": 0.933442667760011,
"grad_norm": 0.26343633170054737,
"learning_rate": 2.7494011554177824e-06,
"loss": 0.7088,
"mean_token_accuracy": 0.8080482721328736,
"num_tokens": 683453311.0,
"step": 6830
},
{
"entropy": 1.020703125,
"epoch": 0.9348093480934809,
"grad_norm": 0.2957451106867703,
"learning_rate": 2.7458785402282656e-06,
"loss": 0.7189,
"mean_token_accuracy": 0.8045967400074006,
"num_tokens": 684437155.0,
"step": 6840
},
{
"entropy": 1.012109375,
"epoch": 0.9361760284269509,
"grad_norm": 0.30045265901766527,
"learning_rate": 2.7423559250387487e-06,
"loss": 0.722,
"mean_token_accuracy": 0.8060895681381226,
"num_tokens": 685428193.0,
"step": 6850
},
{
"entropy": 0.981640625,
"epoch": 0.9375427087604209,
"grad_norm": 0.29087762942076223,
"learning_rate": 2.7388333098492326e-06,
"loss": 0.6979,
"mean_token_accuracy": 0.8109878540039063,
"num_tokens": 686363719.0,
"step": 6860
},
{
"entropy": 0.978125,
"epoch": 0.938909389093891,
"grad_norm": 0.29793602208242737,
"learning_rate": 2.7353106946597158e-06,
"loss": 0.7139,
"mean_token_accuracy": 0.8067825913429261,
"num_tokens": 687423240.0,
"step": 6870
},
{
"entropy": 0.996484375,
"epoch": 0.940276069427361,
"grad_norm": 0.3258776415068602,
"learning_rate": 2.731788079470199e-06,
"loss": 0.7084,
"mean_token_accuracy": 0.8074081599712372,
"num_tokens": 688380864.0,
"step": 6880
},
{
"entropy": 0.993359375,
"epoch": 0.941642749760831,
"grad_norm": 0.29108518119658794,
"learning_rate": 2.728265464280682e-06,
"loss": 0.7234,
"mean_token_accuracy": 0.8057688534259796,
"num_tokens": 689366091.0,
"step": 6890
},
{
"entropy": 0.986328125,
"epoch": 0.9430094300943009,
"grad_norm": 0.27286856406381516,
"learning_rate": 2.7247428490911656e-06,
"loss": 0.6866,
"mean_token_accuracy": 0.8139042317867279,
"num_tokens": 690330964.0,
"step": 6900
},
{
"entropy": 0.988671875,
"epoch": 0.9443761104277709,
"grad_norm": 0.31418265124619993,
"learning_rate": 2.7212202339016487e-06,
"loss": 0.7167,
"mean_token_accuracy": 0.806832629442215,
"num_tokens": 691337981.0,
"step": 6910
},
{
"entropy": 0.95546875,
"epoch": 0.9457427907612409,
"grad_norm": 0.2690775988102323,
"learning_rate": 2.7176976187121322e-06,
"loss": 0.7103,
"mean_token_accuracy": 0.80700803399086,
"num_tokens": 692402156.0,
"step": 6920
},
{
"entropy": 0.98828125,
"epoch": 0.947109471094711,
"grad_norm": 0.30463718696202,
"learning_rate": 2.7141750035226154e-06,
"loss": 0.7054,
"mean_token_accuracy": 0.8082657098770142,
"num_tokens": 693447012.0,
"step": 6930
},
{
"entropy": 0.99375,
"epoch": 0.948476151428181,
"grad_norm": 0.299742237846808,
"learning_rate": 2.710652388333099e-06,
"loss": 0.7073,
"mean_token_accuracy": 0.8090898215770721,
"num_tokens": 694464422.0,
"step": 6940
},
{
"entropy": 0.982421875,
"epoch": 0.949842831761651,
"grad_norm": 0.3052487876217635,
"learning_rate": 2.707129773143582e-06,
"loss": 0.7523,
"mean_token_accuracy": 0.7968005299568176,
"num_tokens": 695496716.0,
"step": 6950
},
{
"entropy": 0.95078125,
"epoch": 0.951209512095121,
"grad_norm": 0.3051865759543082,
"learning_rate": 2.703607157954065e-06,
"loss": 0.6933,
"mean_token_accuracy": 0.8099996089935303,
"num_tokens": 696522504.0,
"step": 6960
},
{
"entropy": 1.019921875,
"epoch": 0.9525761924285909,
"grad_norm": 0.29963972844559805,
"learning_rate": 2.7000845427645483e-06,
"loss": 0.7411,
"mean_token_accuracy": 0.8003481090068817,
"num_tokens": 697477258.0,
"step": 6970
},
{
"entropy": 0.952734375,
"epoch": 0.9539428727620609,
"grad_norm": 0.3035680297050787,
"learning_rate": 2.6965619275750322e-06,
"loss": 0.6813,
"mean_token_accuracy": 0.8133565843105316,
"num_tokens": 698459724.0,
"step": 6980
},
{
"entropy": 1.000390625,
"epoch": 0.955309553095531,
"grad_norm": 0.3768617185287225,
"learning_rate": 2.6930393123855154e-06,
"loss": 0.7331,
"mean_token_accuracy": 0.8040344774723053,
"num_tokens": 699484062.0,
"step": 6990
},
{
"entropy": 1.019921875,
"epoch": 0.956676233429001,
"grad_norm": 0.2960217555234369,
"learning_rate": 2.6895166971959985e-06,
"loss": 0.736,
"mean_token_accuracy": 0.8021701812744141,
"num_tokens": 700454967.0,
"step": 7000
},
{
"entropy": 0.948828125,
"epoch": 0.958042913762471,
"grad_norm": 0.2800709162991129,
"learning_rate": 2.6859940820064816e-06,
"loss": 0.6808,
"mean_token_accuracy": 0.8145263314247131,
"num_tokens": 701442196.0,
"step": 7010
},
{
"entropy": 1.011328125,
"epoch": 0.959409594095941,
"grad_norm": 0.33517671946302807,
"learning_rate": 2.6824714668169647e-06,
"loss": 0.7142,
"mean_token_accuracy": 0.8070112586021423,
"num_tokens": 702419631.0,
"step": 7020
},
{
"entropy": 0.978125,
"epoch": 0.9607762744294109,
"grad_norm": 0.31967838782177016,
"learning_rate": 2.6789488516274487e-06,
"loss": 0.7316,
"mean_token_accuracy": 0.8033612191677093,
"num_tokens": 703488927.0,
"step": 7030
},
{
"entropy": 0.9890625,
"epoch": 0.9621429547628809,
"grad_norm": 0.3396497855282067,
"learning_rate": 2.675426236437932e-06,
"loss": 0.6712,
"mean_token_accuracy": 0.8162276685237885,
"num_tokens": 704531284.0,
"step": 7040
},
{
"entropy": 0.953515625,
"epoch": 0.963509635096351,
"grad_norm": 0.2854526629267012,
"learning_rate": 2.671903621248415e-06,
"loss": 0.7026,
"mean_token_accuracy": 0.8073373556137085,
"num_tokens": 705501913.0,
"step": 7050
},
{
"entropy": 0.966796875,
"epoch": 0.964876315429821,
"grad_norm": 0.311719672028121,
"learning_rate": 2.668381006058898e-06,
"loss": 0.7112,
"mean_token_accuracy": 0.8061241924762725,
"num_tokens": 706485055.0,
"step": 7060
},
{
"entropy": 0.994921875,
"epoch": 0.966242995763291,
"grad_norm": 0.273906663896208,
"learning_rate": 2.6648583908693816e-06,
"loss": 0.6879,
"mean_token_accuracy": 0.8124912023544312,
"num_tokens": 707478154.0,
"step": 7070
},
{
"entropy": 1.013671875,
"epoch": 0.967609676096761,
"grad_norm": 0.3242577737578032,
"learning_rate": 2.6613357756798648e-06,
"loss": 0.7611,
"mean_token_accuracy": 0.7970275700092315,
"num_tokens": 708467999.0,
"step": 7080
},
{
"entropy": 0.97734375,
"epoch": 0.968976356430231,
"grad_norm": 0.2975362867659516,
"learning_rate": 2.6578131604903483e-06,
"loss": 0.7071,
"mean_token_accuracy": 0.8069530844688415,
"num_tokens": 709429624.0,
"step": 7090
},
{
"entropy": 0.969921875,
"epoch": 0.9703430367637009,
"grad_norm": 0.30448348604315967,
"learning_rate": 2.6542905453008314e-06,
"loss": 0.671,
"mean_token_accuracy": 0.8167487919330597,
"num_tokens": 710434764.0,
"step": 7100
},
{
"entropy": 0.984375,
"epoch": 0.971709717097171,
"grad_norm": 0.29441888387152176,
"learning_rate": 2.650767930111315e-06,
"loss": 0.7177,
"mean_token_accuracy": 0.8071138203144074,
"num_tokens": 711448154.0,
"step": 7110
},
{
"entropy": 0.987109375,
"epoch": 0.973076397430641,
"grad_norm": 0.2732912369891931,
"learning_rate": 2.647245314921798e-06,
"loss": 0.6898,
"mean_token_accuracy": 0.8114186584949493,
"num_tokens": 712485461.0,
"step": 7120
},
{
"entropy": 0.96796875,
"epoch": 0.974443077764111,
"grad_norm": 0.26748981722213633,
"learning_rate": 2.6437226997322812e-06,
"loss": 0.6901,
"mean_token_accuracy": 0.8128128826618195,
"num_tokens": 713537375.0,
"step": 7130
},
{
"entropy": 0.955859375,
"epoch": 0.975809758097581,
"grad_norm": 0.3011358021287143,
"learning_rate": 2.640200084542765e-06,
"loss": 0.6725,
"mean_token_accuracy": 0.813646650314331,
"num_tokens": 714549530.0,
"step": 7140
},
{
"entropy": 0.978125,
"epoch": 0.977176438431051,
"grad_norm": 0.32199727552233653,
"learning_rate": 2.6366774693532483e-06,
"loss": 0.7108,
"mean_token_accuracy": 0.8073301672935486,
"num_tokens": 715478350.0,
"step": 7150
},
{
"entropy": 1.0046875,
"epoch": 0.9785431187645209,
"grad_norm": 0.31603927303321694,
"learning_rate": 2.6331548541637314e-06,
"loss": 0.7193,
"mean_token_accuracy": 0.8054945170879364,
"num_tokens": 716476986.0,
"step": 7160
},
{
"entropy": 0.95546875,
"epoch": 0.979909799097991,
"grad_norm": 0.2585542676016109,
"learning_rate": 2.6296322389742146e-06,
"loss": 0.6771,
"mean_token_accuracy": 0.8150510311126709,
"num_tokens": 717495137.0,
"step": 7170
},
{
"entropy": 0.935546875,
"epoch": 0.981276479431461,
"grad_norm": 0.29612951166844065,
"learning_rate": 2.6261096237846977e-06,
"loss": 0.6793,
"mean_token_accuracy": 0.8139464974403381,
"num_tokens": 718485758.0,
"step": 7180
},
{
"entropy": 0.975,
"epoch": 0.982643159764931,
"grad_norm": 0.29998062208892484,
"learning_rate": 2.622587008595181e-06,
"loss": 0.7074,
"mean_token_accuracy": 0.8085883796215058,
"num_tokens": 719460644.0,
"step": 7190
},
{
"entropy": 0.993359375,
"epoch": 0.984009840098401,
"grad_norm": 0.3164078861544669,
"learning_rate": 2.6190643934056648e-06,
"loss": 0.7133,
"mean_token_accuracy": 0.8054777383804321,
"num_tokens": 720475792.0,
"step": 7200
},
{
"entropy": 1.0234375,
"epoch": 0.985376520431871,
"grad_norm": 0.31044965544106035,
"learning_rate": 2.615541778216148e-06,
"loss": 0.7432,
"mean_token_accuracy": 0.8021265208721161,
"num_tokens": 721453125.0,
"step": 7210
},
{
"entropy": 0.9671875,
"epoch": 0.9867432007653409,
"grad_norm": 0.3124957901483379,
"learning_rate": 2.612019163026631e-06,
"loss": 0.6858,
"mean_token_accuracy": 0.8113693714141845,
"num_tokens": 722432480.0,
"step": 7220
},
{
"entropy": 1.028515625,
"epoch": 0.988109881098811,
"grad_norm": 0.3219634732886099,
"learning_rate": 2.6084965478371146e-06,
"loss": 0.7383,
"mean_token_accuracy": 0.8009580194950103,
"num_tokens": 723432525.0,
"step": 7230
},
{
"entropy": 0.955078125,
"epoch": 0.989476561432281,
"grad_norm": 0.2765168413897391,
"learning_rate": 2.6049739326475977e-06,
"loss": 0.6793,
"mean_token_accuracy": 0.8156472980976105,
"num_tokens": 724435158.0,
"step": 7240
},
{
"entropy": 1.013671875,
"epoch": 0.990843241765751,
"grad_norm": 0.3365827944324138,
"learning_rate": 2.6014513174580812e-06,
"loss": 0.6927,
"mean_token_accuracy": 0.811360239982605,
"num_tokens": 725410072.0,
"step": 7250
},
{
"entropy": 0.969921875,
"epoch": 0.992209922099221,
"grad_norm": 0.2958217857779564,
"learning_rate": 2.5979287022685644e-06,
"loss": 0.6949,
"mean_token_accuracy": 0.8110227346420288,
"num_tokens": 726377155.0,
"step": 7260
},
{
"entropy": 0.95390625,
"epoch": 0.993576602432691,
"grad_norm": 0.2931193057598029,
"learning_rate": 2.594406087079048e-06,
"loss": 0.6676,
"mean_token_accuracy": 0.8165666341781617,
"num_tokens": 727361527.0,
"step": 7270
},
{
"entropy": 1.0,
"epoch": 0.994943282766161,
"grad_norm": 0.28857038503593196,
"learning_rate": 2.590883471889531e-06,
"loss": 0.7513,
"mean_token_accuracy": 0.7985379576683045,
"num_tokens": 728344461.0,
"step": 7280
},
{
"entropy": 0.9640625,
"epoch": 0.996309963099631,
"grad_norm": 0.2840615076342613,
"learning_rate": 2.587360856700014e-06,
"loss": 0.6897,
"mean_token_accuracy": 0.8128137648105621,
"num_tokens": 729330460.0,
"step": 7290
},
{
"entropy": 0.955078125,
"epoch": 0.997676643433101,
"grad_norm": 0.28779855149117234,
"learning_rate": 2.5838382415104973e-06,
"loss": 0.6984,
"mean_token_accuracy": 0.8106254518032074,
"num_tokens": 730339383.0,
"step": 7300
},
{
"entropy": 1.000390625,
"epoch": 0.999043323766571,
"grad_norm": 0.28287016190189723,
"learning_rate": 2.5803156263209813e-06,
"loss": 0.7135,
"mean_token_accuracy": 0.8067171037197113,
"num_tokens": 731309956.0,
"step": 7310
},
{
"entropy": 1.005859375,
"epoch": 1.000410004100041,
"grad_norm": 0.30318466602108357,
"learning_rate": 2.5767930111314644e-06,
"loss": 0.7502,
"mean_token_accuracy": 0.7991820931434631,
"num_tokens": 732351410.0,
"step": 7320
},
{
"entropy": 0.978515625,
"epoch": 1.001776684433511,
"grad_norm": 0.27044508364559133,
"learning_rate": 2.5732703959419475e-06,
"loss": 0.7053,
"mean_token_accuracy": 0.8083781242370606,
"num_tokens": 733308446.0,
"step": 7330
},
{
"entropy": 0.941796875,
"epoch": 1.003143364766981,
"grad_norm": 0.24845199427724002,
"learning_rate": 2.5697477807524306e-06,
"loss": 0.6865,
"mean_token_accuracy": 0.8114877879619599,
"num_tokens": 734386467.0,
"step": 7340
},
{
"entropy": 0.930078125,
"epoch": 1.004510045100451,
"grad_norm": 0.2999987869178577,
"learning_rate": 2.5662251655629138e-06,
"loss": 0.68,
"mean_token_accuracy": 0.8133256375789643,
"num_tokens": 735387465.0,
"step": 7350
},
{
"entropy": 0.979296875,
"epoch": 1.005876725433921,
"grad_norm": 0.32583818809421417,
"learning_rate": 2.5627025503733977e-06,
"loss": 0.7088,
"mean_token_accuracy": 0.8067002952098846,
"num_tokens": 736402880.0,
"step": 7360
},
{
"entropy": 0.99375,
"epoch": 1.007243405767391,
"grad_norm": 0.28365534937914444,
"learning_rate": 2.559179935183881e-06,
"loss": 0.7393,
"mean_token_accuracy": 0.8026269614696503,
"num_tokens": 737386726.0,
"step": 7370
},
{
"entropy": 0.98515625,
"epoch": 1.0086100861008611,
"grad_norm": 0.3107821441691281,
"learning_rate": 2.555657319994364e-06,
"loss": 0.7013,
"mean_token_accuracy": 0.8105101644992828,
"num_tokens": 738377522.0,
"step": 7380
},
{
"entropy": 0.958203125,
"epoch": 1.009976766434331,
"grad_norm": 0.2754395949285862,
"learning_rate": 2.552134704804847e-06,
"loss": 0.6966,
"mean_token_accuracy": 0.8093727111816407,
"num_tokens": 739422958.0,
"step": 7390
},
{
"entropy": 1.00703125,
"epoch": 1.011343446767801,
"grad_norm": 0.30634286160864255,
"learning_rate": 2.5486120896153306e-06,
"loss": 0.7271,
"mean_token_accuracy": 0.8030811607837677,
"num_tokens": 740403213.0,
"step": 7400
},
{
"entropy": 0.97421875,
"epoch": 1.012710127101271,
"grad_norm": 0.6080174163540721,
"learning_rate": 2.5450894744258138e-06,
"loss": 0.6808,
"mean_token_accuracy": 0.8153546631336213,
"num_tokens": 741400708.0,
"step": 7410
},
{
"entropy": 0.9421875,
"epoch": 1.014076807434741,
"grad_norm": 0.28725683411276687,
"learning_rate": 2.5415668592362973e-06,
"loss": 0.6655,
"mean_token_accuracy": 0.8184587955474854,
"num_tokens": 742355306.0,
"step": 7420
},
{
"entropy": 0.9515625,
"epoch": 1.015443487768211,
"grad_norm": 0.2865267046650383,
"learning_rate": 2.5380442440467804e-06,
"loss": 0.6775,
"mean_token_accuracy": 0.8163182973861695,
"num_tokens": 743374434.0,
"step": 7430
},
{
"entropy": 1.014453125,
"epoch": 1.016810168101681,
"grad_norm": 0.3725080015393178,
"learning_rate": 2.534521628857264e-06,
"loss": 0.7375,
"mean_token_accuracy": 0.8008062303066253,
"num_tokens": 744361052.0,
"step": 7440
},
{
"entropy": 0.9703125,
"epoch": 1.018176848435151,
"grad_norm": 0.257106352219646,
"learning_rate": 2.530999013667747e-06,
"loss": 0.704,
"mean_token_accuracy": 0.8088642001152039,
"num_tokens": 745341094.0,
"step": 7450
},
{
"entropy": 1.0484375,
"epoch": 1.019543528768621,
"grad_norm": 0.3442697965894193,
"learning_rate": 2.5274763984782302e-06,
"loss": 0.7571,
"mean_token_accuracy": 0.7989168167114258,
"num_tokens": 746336609.0,
"step": 7460
},
{
"entropy": 0.9296875,
"epoch": 1.020910209102091,
"grad_norm": 0.28840310536921765,
"learning_rate": 2.5239537832887138e-06,
"loss": 0.6722,
"mean_token_accuracy": 0.8170128107070923,
"num_tokens": 747379304.0,
"step": 7470
},
{
"entropy": 0.975390625,
"epoch": 1.022276889435561,
"grad_norm": 0.30104161186010897,
"learning_rate": 2.5204311680991973e-06,
"loss": 0.6834,
"mean_token_accuracy": 0.8112218379974365,
"num_tokens": 748386663.0,
"step": 7480
},
{
"entropy": 0.9359375,
"epoch": 1.023643569769031,
"grad_norm": 0.26576377477801133,
"learning_rate": 2.5169085529096804e-06,
"loss": 0.6632,
"mean_token_accuracy": 0.8188562393188477,
"num_tokens": 749319875.0,
"step": 7490
},
{
"entropy": 0.980859375,
"epoch": 1.0250102501025011,
"grad_norm": 0.3411274155917438,
"learning_rate": 2.5133859377201636e-06,
"loss": 0.7104,
"mean_token_accuracy": 0.806287306547165,
"num_tokens": 750306281.0,
"step": 7500
},
{
"entropy": 1.00625,
"epoch": 1.0263769304359711,
"grad_norm": 0.2844851005172512,
"learning_rate": 2.5098633225306467e-06,
"loss": 0.72,
"mean_token_accuracy": 0.8047569394111633,
"num_tokens": 751317486.0,
"step": 7510
},
{
"entropy": 0.972265625,
"epoch": 1.027743610769441,
"grad_norm": 0.29450425484534937,
"learning_rate": 2.50634070734113e-06,
"loss": 0.6872,
"mean_token_accuracy": 0.8118747591972351,
"num_tokens": 752323434.0,
"step": 7520
},
{
"entropy": 0.962109375,
"epoch": 1.029110291102911,
"grad_norm": 0.2891866467907365,
"learning_rate": 2.502818092151614e-06,
"loss": 0.7045,
"mean_token_accuracy": 0.8096649050712585,
"num_tokens": 753298426.0,
"step": 7530
},
{
"entropy": 0.962890625,
"epoch": 1.030476971436381,
"grad_norm": 0.31642482441876507,
"learning_rate": 2.499295476962097e-06,
"loss": 0.6977,
"mean_token_accuracy": 0.8104706645011902,
"num_tokens": 754304365.0,
"step": 7540
},
{
"entropy": 0.974609375,
"epoch": 1.031843651769851,
"grad_norm": 0.3558771634363033,
"learning_rate": 2.49577286177258e-06,
"loss": 0.7136,
"mean_token_accuracy": 0.8076259315013885,
"num_tokens": 755337024.0,
"step": 7550
},
{
"entropy": 0.973828125,
"epoch": 1.033210332103321,
"grad_norm": 0.28955986258698535,
"learning_rate": 2.492250246583063e-06,
"loss": 0.7259,
"mean_token_accuracy": 0.8050550222396851,
"num_tokens": 756321824.0,
"step": 7560
},
{
"entropy": 0.96484375,
"epoch": 1.034577012436791,
"grad_norm": 0.3025709530188484,
"learning_rate": 2.4887276313935467e-06,
"loss": 0.6725,
"mean_token_accuracy": 0.8146191298961639,
"num_tokens": 757309000.0,
"step": 7570
},
{
"entropy": 0.947265625,
"epoch": 1.035943692770261,
"grad_norm": 0.2764970517403616,
"learning_rate": 2.48520501620403e-06,
"loss": 0.6729,
"mean_token_accuracy": 0.8147356748580933,
"num_tokens": 758343356.0,
"step": 7580
},
{
"entropy": 0.93203125,
"epoch": 1.037310373103731,
"grad_norm": 0.30865981531093917,
"learning_rate": 2.4816824010145134e-06,
"loss": 0.6552,
"mean_token_accuracy": 0.8176005780696869,
"num_tokens": 759319244.0,
"step": 7590
},
{
"entropy": 0.969140625,
"epoch": 1.038677053437201,
"grad_norm": 0.35039827269355606,
"learning_rate": 2.478159785824997e-06,
"loss": 0.7115,
"mean_token_accuracy": 0.808125114440918,
"num_tokens": 760380763.0,
"step": 7600
},
{
"entropy": 0.97109375,
"epoch": 1.040043733770671,
"grad_norm": 0.3438723773747269,
"learning_rate": 2.47463717063548e-06,
"loss": 0.6768,
"mean_token_accuracy": 0.8149885833263397,
"num_tokens": 761390881.0,
"step": 7610
},
{
"entropy": 0.9984375,
"epoch": 1.0414104141041411,
"grad_norm": 0.2862009234793106,
"learning_rate": 2.4711145554459636e-06,
"loss": 0.7251,
"mean_token_accuracy": 0.8040187656879425,
"num_tokens": 762417830.0,
"step": 7620
},
{
"entropy": 0.9859375,
"epoch": 1.0427770944376111,
"grad_norm": 0.290526518959042,
"learning_rate": 2.4675919402564467e-06,
"loss": 0.7042,
"mean_token_accuracy": 0.8079499900341034,
"num_tokens": 763421144.0,
"step": 7630
},
{
"entropy": 0.978515625,
"epoch": 1.0441437747710811,
"grad_norm": 0.27507579879858246,
"learning_rate": 2.46406932506693e-06,
"loss": 0.6963,
"mean_token_accuracy": 0.8109123826026916,
"num_tokens": 764456854.0,
"step": 7640
},
{
"entropy": 0.974609375,
"epoch": 1.045510455104551,
"grad_norm": 0.3207480383248995,
"learning_rate": 2.4605467098774134e-06,
"loss": 0.694,
"mean_token_accuracy": 0.8113563776016235,
"num_tokens": 765502181.0,
"step": 7650
},
{
"entropy": 0.951171875,
"epoch": 1.046877135438021,
"grad_norm": 0.25906868929820837,
"learning_rate": 2.4570240946878965e-06,
"loss": 0.7071,
"mean_token_accuracy": 0.8072395026683807,
"num_tokens": 766492469.0,
"step": 7660
},
{
"entropy": 0.976171875,
"epoch": 1.048243815771491,
"grad_norm": 0.27943533966013,
"learning_rate": 2.4535014794983796e-06,
"loss": 0.7247,
"mean_token_accuracy": 0.8055664896965027,
"num_tokens": 767484098.0,
"step": 7670
},
{
"entropy": 0.95390625,
"epoch": 1.049610496104961,
"grad_norm": 0.3005942980400799,
"learning_rate": 2.449978864308863e-06,
"loss": 0.6672,
"mean_token_accuracy": 0.8175396978855133,
"num_tokens": 768449811.0,
"step": 7680
},
{
"entropy": 0.964453125,
"epoch": 1.050977176438431,
"grad_norm": 0.28964597460200414,
"learning_rate": 2.4464562491193463e-06,
"loss": 0.7007,
"mean_token_accuracy": 0.8086491048336029,
"num_tokens": 769423148.0,
"step": 7690
},
{
"entropy": 0.98984375,
"epoch": 1.052343856771901,
"grad_norm": 0.33335531685756037,
"learning_rate": 2.4429336339298294e-06,
"loss": 0.7173,
"mean_token_accuracy": 0.8070970118045807,
"num_tokens": 770446252.0,
"step": 7700
},
{
"entropy": 0.9171875,
"epoch": 1.053710537105371,
"grad_norm": 0.29492973582449444,
"learning_rate": 2.439411018740313e-06,
"loss": 0.6486,
"mean_token_accuracy": 0.8184673845767975,
"num_tokens": 771407315.0,
"step": 7710
},
{
"entropy": 0.943359375,
"epoch": 1.055077217438841,
"grad_norm": 0.239913141010438,
"learning_rate": 2.435888403550796e-06,
"loss": 0.6442,
"mean_token_accuracy": 0.8199794232845307,
"num_tokens": 772382184.0,
"step": 7720
},
{
"entropy": 0.979296875,
"epoch": 1.056443897772311,
"grad_norm": 0.31792803491656235,
"learning_rate": 2.4323657883612797e-06,
"loss": 0.7358,
"mean_token_accuracy": 0.8034324944019318,
"num_tokens": 773395262.0,
"step": 7730
},
{
"entropy": 0.98515625,
"epoch": 1.0578105781057812,
"grad_norm": 0.29633492720976085,
"learning_rate": 2.4288431731717628e-06,
"loss": 0.7038,
"mean_token_accuracy": 0.8081696331501007,
"num_tokens": 774360843.0,
"step": 7740
},
{
"entropy": 0.96484375,
"epoch": 1.0591772584392511,
"grad_norm": 0.31945723421479005,
"learning_rate": 2.4253205579822463e-06,
"loss": 0.6974,
"mean_token_accuracy": 0.808952248096466,
"num_tokens": 775331478.0,
"step": 7750
},
{
"entropy": 0.959765625,
"epoch": 1.0605439387727211,
"grad_norm": 0.29409924812766175,
"learning_rate": 2.4217979427927294e-06,
"loss": 0.6762,
"mean_token_accuracy": 0.81543048620224,
"num_tokens": 776295077.0,
"step": 7760
},
{
"entropy": 0.93046875,
"epoch": 1.0619106191061911,
"grad_norm": 0.2661349875588255,
"learning_rate": 2.418275327603213e-06,
"loss": 0.6959,
"mean_token_accuracy": 0.8115426957607269,
"num_tokens": 777280868.0,
"step": 7770
},
{
"entropy": 0.950390625,
"epoch": 1.063277299439661,
"grad_norm": 0.32348728089704754,
"learning_rate": 2.414752712413696e-06,
"loss": 0.6809,
"mean_token_accuracy": 0.8133167445659637,
"num_tokens": 778276696.0,
"step": 7780
},
{
"entropy": 0.942578125,
"epoch": 1.064643979773131,
"grad_norm": 0.28648032574219195,
"learning_rate": 2.4112300972241797e-06,
"loss": 0.656,
"mean_token_accuracy": 0.8198854327201843,
"num_tokens": 779266431.0,
"step": 7790
},
{
"entropy": 0.971875,
"epoch": 1.066010660106601,
"grad_norm": 0.2749805592631983,
"learning_rate": 2.4077074820346628e-06,
"loss": 0.7129,
"mean_token_accuracy": 0.8056347489356994,
"num_tokens": 780277233.0,
"step": 7800
},
{
"entropy": 0.9859375,
"epoch": 1.067377340440071,
"grad_norm": 0.29931146489981925,
"learning_rate": 2.404184866845146e-06,
"loss": 0.7086,
"mean_token_accuracy": 0.8064719676971436,
"num_tokens": 781305479.0,
"step": 7810
},
{
"entropy": 0.982421875,
"epoch": 1.068744020773541,
"grad_norm": 0.303861179593527,
"learning_rate": 2.4006622516556295e-06,
"loss": 0.7121,
"mean_token_accuracy": 0.8069659113883972,
"num_tokens": 782310821.0,
"step": 7820
},
{
"entropy": 0.98515625,
"epoch": 1.070110701107011,
"grad_norm": 0.29623136094547653,
"learning_rate": 2.3971396364661126e-06,
"loss": 0.7109,
"mean_token_accuracy": 0.8070824027061463,
"num_tokens": 783300711.0,
"step": 7830
},
{
"entropy": 0.988671875,
"epoch": 1.071477381440481,
"grad_norm": 0.2867098087099921,
"learning_rate": 2.393617021276596e-06,
"loss": 0.6989,
"mean_token_accuracy": 0.810782516002655,
"num_tokens": 784293361.0,
"step": 7840
},
{
"entropy": 0.98125,
"epoch": 1.072844061773951,
"grad_norm": 0.2664046558677891,
"learning_rate": 2.3900944060870793e-06,
"loss": 0.6948,
"mean_token_accuracy": 0.8114540576934814,
"num_tokens": 785257780.0,
"step": 7850
},
{
"entropy": 0.978125,
"epoch": 1.0742107421074212,
"grad_norm": 0.27679429821438634,
"learning_rate": 2.3865717908975624e-06,
"loss": 0.6851,
"mean_token_accuracy": 0.8120885491371155,
"num_tokens": 786269697.0,
"step": 7860
},
{
"entropy": 0.987109375,
"epoch": 1.0755774224408912,
"grad_norm": 0.31924622687138243,
"learning_rate": 2.383049175708046e-06,
"loss": 0.6951,
"mean_token_accuracy": 0.8097779095172882,
"num_tokens": 787269436.0,
"step": 7870
},
{
"entropy": 0.9484375,
"epoch": 1.0769441027743611,
"grad_norm": 0.33324902172600646,
"learning_rate": 2.379526560518529e-06,
"loss": 0.7013,
"mean_token_accuracy": 0.8100776195526123,
"num_tokens": 788255012.0,
"step": 7880
},
{
"entropy": 1.005859375,
"epoch": 1.0783107831078311,
"grad_norm": 0.31183960533087546,
"learning_rate": 2.376003945329012e-06,
"loss": 0.7347,
"mean_token_accuracy": 0.7997345983982086,
"num_tokens": 789269288.0,
"step": 7890
},
{
"entropy": 0.928125,
"epoch": 1.079677463441301,
"grad_norm": 0.31273638737936976,
"learning_rate": 2.3724813301394957e-06,
"loss": 0.6344,
"mean_token_accuracy": 0.824145394563675,
"num_tokens": 790240965.0,
"step": 7900
},
{
"entropy": 0.94453125,
"epoch": 1.081044143774771,
"grad_norm": 0.2699764178324854,
"learning_rate": 2.368958714949979e-06,
"loss": 0.6506,
"mean_token_accuracy": 0.8213645339012146,
"num_tokens": 791198003.0,
"step": 7910
},
{
"entropy": 0.973828125,
"epoch": 1.082410824108241,
"grad_norm": 0.32767359163897314,
"learning_rate": 2.3654360997604624e-06,
"loss": 0.6668,
"mean_token_accuracy": 0.8173234403133393,
"num_tokens": 792174104.0,
"step": 7920
},
{
"entropy": 0.983984375,
"epoch": 1.083777504441711,
"grad_norm": 0.29229068234761196,
"learning_rate": 2.3619134845709455e-06,
"loss": 0.6871,
"mean_token_accuracy": 0.8138575792312622,
"num_tokens": 793200436.0,
"step": 7930
},
{
"entropy": 0.98671875,
"epoch": 1.085144184775181,
"grad_norm": 0.27011386791284525,
"learning_rate": 2.358390869381429e-06,
"loss": 0.6885,
"mean_token_accuracy": 0.811584061384201,
"num_tokens": 794189380.0,
"step": 7940
},
{
"entropy": 0.98671875,
"epoch": 1.086510865108651,
"grad_norm": 0.2880989985207136,
"learning_rate": 2.354868254191912e-06,
"loss": 0.7084,
"mean_token_accuracy": 0.8088852941989899,
"num_tokens": 795204803.0,
"step": 7950
},
{
"entropy": 0.975,
"epoch": 1.087877545442121,
"grad_norm": 0.3335926993567032,
"learning_rate": 2.3513456390023957e-06,
"loss": 0.6892,
"mean_token_accuracy": 0.8127641379833221,
"num_tokens": 796219873.0,
"step": 7960
},
{
"entropy": 0.990625,
"epoch": 1.089244225775591,
"grad_norm": 0.2942591995259697,
"learning_rate": 2.347823023812879e-06,
"loss": 0.6995,
"mean_token_accuracy": 0.8098643660545349,
"num_tokens": 797177168.0,
"step": 7970
},
{
"entropy": 1.00390625,
"epoch": 1.090610906109061,
"grad_norm": 0.2806033464476802,
"learning_rate": 2.3443004086233624e-06,
"loss": 0.6771,
"mean_token_accuracy": 0.8153556048870086,
"num_tokens": 798158967.0,
"step": 7980
},
{
"entropy": 0.950390625,
"epoch": 1.0919775864425312,
"grad_norm": 0.35413938641728837,
"learning_rate": 2.3407777934338455e-06,
"loss": 0.6601,
"mean_token_accuracy": 0.8182018041610718,
"num_tokens": 799174977.0,
"step": 7990
},
{
"entropy": 0.96484375,
"epoch": 1.0933442667760012,
"grad_norm": 0.28642693354088505,
"learning_rate": 2.3372551782443286e-06,
"loss": 0.6904,
"mean_token_accuracy": 0.8126033186912537,
"num_tokens": 800166131.0,
"step": 8000
},
{
"entropy": 0.97109375,
"epoch": 1.0947109471094711,
"grad_norm": 0.2685757781720407,
"learning_rate": 2.333732563054812e-06,
"loss": 0.6975,
"mean_token_accuracy": 0.8081961333751678,
"num_tokens": 801197432.0,
"step": 8010
},
{
"entropy": 0.990625,
"epoch": 1.0960776274429411,
"grad_norm": 0.31898017708556237,
"learning_rate": 2.3302099478652953e-06,
"loss": 0.6981,
"mean_token_accuracy": 0.8114677786827087,
"num_tokens": 802211389.0,
"step": 8020
},
{
"entropy": 0.9765625,
"epoch": 1.097444307776411,
"grad_norm": 0.33486380764015655,
"learning_rate": 2.3266873326757784e-06,
"loss": 0.6951,
"mean_token_accuracy": 0.8124140322208404,
"num_tokens": 803171428.0,
"step": 8030
},
{
"entropy": 1.02265625,
"epoch": 1.098810988109881,
"grad_norm": 0.3317886065294369,
"learning_rate": 2.323164717486262e-06,
"loss": 0.7425,
"mean_token_accuracy": 0.7977739810943604,
"num_tokens": 804203089.0,
"step": 8040
},
{
"entropy": 0.9265625,
"epoch": 1.100177668443351,
"grad_norm": 0.29595273113227427,
"learning_rate": 2.319642102296745e-06,
"loss": 0.6763,
"mean_token_accuracy": 0.81627077460289,
"num_tokens": 805209580.0,
"step": 8050
},
{
"entropy": 0.9671875,
"epoch": 1.101544348776821,
"grad_norm": 0.29477860664740774,
"learning_rate": 2.3161194871072287e-06,
"loss": 0.6838,
"mean_token_accuracy": 0.8127489030361176,
"num_tokens": 806191794.0,
"step": 8060
},
{
"entropy": 0.9453125,
"epoch": 1.102911029110291,
"grad_norm": 0.30015948072529985,
"learning_rate": 2.3125968719177118e-06,
"loss": 0.6698,
"mean_token_accuracy": 0.8165566980838775,
"num_tokens": 807170541.0,
"step": 8070
},
{
"entropy": 1.0046875,
"epoch": 1.104277709443761,
"grad_norm": 0.316010481222701,
"learning_rate": 2.3090742567281953e-06,
"loss": 0.7019,
"mean_token_accuracy": 0.8093967318534852,
"num_tokens": 808211241.0,
"step": 8080
},
{
"entropy": 0.95859375,
"epoch": 1.105644389777231,
"grad_norm": 0.2710942314260515,
"learning_rate": 2.3055516415386785e-06,
"loss": 0.7229,
"mean_token_accuracy": 0.8067293167114258,
"num_tokens": 809195307.0,
"step": 8090
},
{
"entropy": 0.9703125,
"epoch": 1.1070110701107012,
"grad_norm": 0.345707506067606,
"learning_rate": 2.302029026349162e-06,
"loss": 0.6904,
"mean_token_accuracy": 0.8134345471858978,
"num_tokens": 810175750.0,
"step": 8100
},
{
"entropy": 0.97578125,
"epoch": 1.1083777504441712,
"grad_norm": 0.3499862362028418,
"learning_rate": 2.298506411159645e-06,
"loss": 0.6885,
"mean_token_accuracy": 0.8116478979587555,
"num_tokens": 811202472.0,
"step": 8110
},
{
"entropy": 0.9578125,
"epoch": 1.1097444307776412,
"grad_norm": 0.3071336479069896,
"learning_rate": 2.2949837959701287e-06,
"loss": 0.6879,
"mean_token_accuracy": 0.8111238598823547,
"num_tokens": 812275788.0,
"step": 8120
},
{
"entropy": 0.991015625,
"epoch": 1.1111111111111112,
"grad_norm": 0.3050994329279656,
"learning_rate": 2.291461180780612e-06,
"loss": 0.6992,
"mean_token_accuracy": 0.8097286403179169,
"num_tokens": 813309547.0,
"step": 8130
},
{
"entropy": 0.973046875,
"epoch": 1.1124777914445811,
"grad_norm": 0.311070244534316,
"learning_rate": 2.287938565591095e-06,
"loss": 0.651,
"mean_token_accuracy": 0.8190759241580963,
"num_tokens": 814311981.0,
"step": 8140
},
{
"entropy": 0.9375,
"epoch": 1.1138444717780511,
"grad_norm": 0.2535989091761017,
"learning_rate": 2.2844159504015785e-06,
"loss": 0.6817,
"mean_token_accuracy": 0.8132715046405792,
"num_tokens": 815337391.0,
"step": 8150
},
{
"entropy": 0.978515625,
"epoch": 1.115211152111521,
"grad_norm": 0.3013921414684986,
"learning_rate": 2.2808933352120616e-06,
"loss": 0.6937,
"mean_token_accuracy": 0.8126370787620545,
"num_tokens": 816285117.0,
"step": 8160
},
{
"entropy": 0.96796875,
"epoch": 1.116577832444991,
"grad_norm": 0.2835944911971011,
"learning_rate": 2.277370720022545e-06,
"loss": 0.6887,
"mean_token_accuracy": 0.8104055643081665,
"num_tokens": 817279034.0,
"step": 8170
},
{
"entropy": 0.96875,
"epoch": 1.117944512778461,
"grad_norm": 0.3085057979048535,
"learning_rate": 2.2738481048330283e-06,
"loss": 0.7172,
"mean_token_accuracy": 0.8051302850246429,
"num_tokens": 818293161.0,
"step": 8180
},
{
"entropy": 0.94921875,
"epoch": 1.119311193111931,
"grad_norm": 0.29905639091168407,
"learning_rate": 2.2703254896435114e-06,
"loss": 0.6967,
"mean_token_accuracy": 0.8093189656734466,
"num_tokens": 819333445.0,
"step": 8190
},
{
"entropy": 0.994140625,
"epoch": 1.120677873445401,
"grad_norm": 0.2750874889517986,
"learning_rate": 2.266802874453995e-06,
"loss": 0.7198,
"mean_token_accuracy": 0.8053097605705262,
"num_tokens": 820345529.0,
"step": 8200
},
{
"entropy": 0.984765625,
"epoch": 1.122044553778871,
"grad_norm": 0.35817768519781357,
"learning_rate": 2.263280259264478e-06,
"loss": 0.6975,
"mean_token_accuracy": 0.8100892424583435,
"num_tokens": 821321575.0,
"step": 8210
},
{
"entropy": 0.937890625,
"epoch": 1.123411234112341,
"grad_norm": 0.27101526222005917,
"learning_rate": 2.259757644074961e-06,
"loss": 0.627,
"mean_token_accuracy": 0.8257337212562561,
"num_tokens": 822305031.0,
"step": 8220
},
{
"entropy": 0.973046875,
"epoch": 1.1247779144458112,
"grad_norm": 0.27318545054620313,
"learning_rate": 2.2562350288854447e-06,
"loss": 0.7053,
"mean_token_accuracy": 0.8080988645553588,
"num_tokens": 823307632.0,
"step": 8230
},
{
"entropy": 0.942578125,
"epoch": 1.1261445947792812,
"grad_norm": 0.29586024031243,
"learning_rate": 2.252712413695928e-06,
"loss": 0.6686,
"mean_token_accuracy": 0.8150597631931304,
"num_tokens": 824271389.0,
"step": 8240
},
{
"entropy": 0.977734375,
"epoch": 1.1275112751127512,
"grad_norm": 0.29892409780276935,
"learning_rate": 2.2491897985064114e-06,
"loss": 0.7161,
"mean_token_accuracy": 0.8060373961925507,
"num_tokens": 825278540.0,
"step": 8250
},
{
"entropy": 0.946875,
"epoch": 1.1288779554462212,
"grad_norm": 0.29484559191543497,
"learning_rate": 2.2456671833168945e-06,
"loss": 0.6766,
"mean_token_accuracy": 0.8148953199386597,
"num_tokens": 826243008.0,
"step": 8260
},
{
"entropy": 0.962109375,
"epoch": 1.1302446357796911,
"grad_norm": 0.3222071094137033,
"learning_rate": 2.242144568127378e-06,
"loss": 0.718,
"mean_token_accuracy": 0.8060916304588318,
"num_tokens": 827215814.0,
"step": 8270
},
{
"entropy": 1.00625,
"epoch": 1.1316113161131611,
"grad_norm": 0.2593875141796088,
"learning_rate": 2.238621952937861e-06,
"loss": 0.7241,
"mean_token_accuracy": 0.8055178880691528,
"num_tokens": 828242802.0,
"step": 8280
},
{
"entropy": 1.0046875,
"epoch": 1.132977996446631,
"grad_norm": 0.3132984168126262,
"learning_rate": 2.2350993377483447e-06,
"loss": 0.7193,
"mean_token_accuracy": 0.8043026626110077,
"num_tokens": 829230247.0,
"step": 8290
},
{
"entropy": 0.966796875,
"epoch": 1.134344676780101,
"grad_norm": 0.3040954279043013,
"learning_rate": 2.231576722558828e-06,
"loss": 0.7053,
"mean_token_accuracy": 0.8090643763542176,
"num_tokens": 830212886.0,
"step": 8300
},
{
"entropy": 0.960546875,
"epoch": 1.135711357113571,
"grad_norm": 0.32542534536937817,
"learning_rate": 2.2280541073693114e-06,
"loss": 0.6577,
"mean_token_accuracy": 0.8175609409809113,
"num_tokens": 831226328.0,
"step": 8310
},
{
"entropy": 1.0109375,
"epoch": 1.137078037447041,
"grad_norm": 0.34248689587621656,
"learning_rate": 2.2245314921797945e-06,
"loss": 0.7343,
"mean_token_accuracy": 0.8028489351272583,
"num_tokens": 832234093.0,
"step": 8320
},
{
"entropy": 0.981640625,
"epoch": 1.1384447177805113,
"grad_norm": 0.2955595884276326,
"learning_rate": 2.2210088769902777e-06,
"loss": 0.7074,
"mean_token_accuracy": 0.8076356232166291,
"num_tokens": 833253215.0,
"step": 8330
},
{
"entropy": 0.893359375,
"epoch": 1.1398113981139812,
"grad_norm": 0.2809535446059227,
"learning_rate": 2.217486261800761e-06,
"loss": 0.613,
"mean_token_accuracy": 0.8276645123958588,
"num_tokens": 834191417.0,
"step": 8340
},
{
"entropy": 0.984765625,
"epoch": 1.1411780784474512,
"grad_norm": 0.28966572620244585,
"learning_rate": 2.2139636466112443e-06,
"loss": 0.6935,
"mean_token_accuracy": 0.8114056050777435,
"num_tokens": 835221928.0,
"step": 8350
},
{
"entropy": 0.94296875,
"epoch": 1.1425447587809212,
"grad_norm": 0.29729392590238946,
"learning_rate": 2.2104410314217275e-06,
"loss": 0.6619,
"mean_token_accuracy": 0.8190743267536164,
"num_tokens": 836213826.0,
"step": 8360
},
{
"entropy": 0.990234375,
"epoch": 1.1439114391143912,
"grad_norm": 0.31059645009562076,
"learning_rate": 2.206918416232211e-06,
"loss": 0.7035,
"mean_token_accuracy": 0.8099836051464081,
"num_tokens": 837243775.0,
"step": 8370
},
{
"entropy": 0.98515625,
"epoch": 1.1452781194478612,
"grad_norm": 0.35970729529845114,
"learning_rate": 2.203395801042694e-06,
"loss": 0.7255,
"mean_token_accuracy": 0.800898152589798,
"num_tokens": 838260824.0,
"step": 8380
},
{
"entropy": 0.974609375,
"epoch": 1.1466447997813312,
"grad_norm": 0.3493702351467938,
"learning_rate": 2.1998731858531777e-06,
"loss": 0.6785,
"mean_token_accuracy": 0.8149469256401062,
"num_tokens": 839308991.0,
"step": 8390
},
{
"entropy": 0.98828125,
"epoch": 1.1480114801148011,
"grad_norm": 0.3311773471715923,
"learning_rate": 2.196350570663661e-06,
"loss": 0.6615,
"mean_token_accuracy": 0.8172824263572693,
"num_tokens": 840316186.0,
"step": 8400
},
{
"entropy": 0.965625,
"epoch": 1.1493781604482711,
"grad_norm": 0.2887805023259485,
"learning_rate": 2.192827955474144e-06,
"loss": 0.6803,
"mean_token_accuracy": 0.8152313888072967,
"num_tokens": 841297160.0,
"step": 8410
},
{
"entropy": 0.924609375,
"epoch": 1.150744840781741,
"grad_norm": 0.26827300538173043,
"learning_rate": 2.1893053402846275e-06,
"loss": 0.6761,
"mean_token_accuracy": 0.8151662886142731,
"num_tokens": 842305251.0,
"step": 8420
},
{
"entropy": 1.011328125,
"epoch": 1.152111521115211,
"grad_norm": 0.29964264361522663,
"learning_rate": 2.1857827250951106e-06,
"loss": 0.7241,
"mean_token_accuracy": 0.8072146117687226,
"num_tokens": 843329273.0,
"step": 8430
},
{
"entropy": 0.975390625,
"epoch": 1.153478201448681,
"grad_norm": 0.29475824674698187,
"learning_rate": 2.182260109905594e-06,
"loss": 0.6995,
"mean_token_accuracy": 0.8095489859580993,
"num_tokens": 844332178.0,
"step": 8440
},
{
"entropy": 0.94453125,
"epoch": 1.154844881782151,
"grad_norm": 0.30309907643149836,
"learning_rate": 2.1787374947160777e-06,
"loss": 0.6709,
"mean_token_accuracy": 0.8163098096847534,
"num_tokens": 845304453.0,
"step": 8450
},
{
"entropy": 0.9328125,
"epoch": 1.156211562115621,
"grad_norm": 0.2563709012152628,
"learning_rate": 2.175214879526561e-06,
"loss": 0.698,
"mean_token_accuracy": 0.8095203042030334,
"num_tokens": 846348270.0,
"step": 8460
},
{
"entropy": 0.981640625,
"epoch": 1.1575782424490912,
"grad_norm": 0.2938513754904866,
"learning_rate": 2.171692264337044e-06,
"loss": 0.6914,
"mean_token_accuracy": 0.8116420447826386,
"num_tokens": 847329653.0,
"step": 8470
},
{
"entropy": 0.969140625,
"epoch": 1.1589449227825612,
"grad_norm": 0.29356633140438465,
"learning_rate": 2.1681696491475275e-06,
"loss": 0.6841,
"mean_token_accuracy": 0.8139118134975434,
"num_tokens": 848298122.0,
"step": 8480
},
{
"entropy": 0.959765625,
"epoch": 1.1603116031160312,
"grad_norm": 0.2857159265596118,
"learning_rate": 2.1646470339580106e-06,
"loss": 0.673,
"mean_token_accuracy": 0.8161653339862823,
"num_tokens": 849361995.0,
"step": 8490
},
{
"entropy": 0.956640625,
"epoch": 1.1616782834495012,
"grad_norm": 0.3031962499623633,
"learning_rate": 2.1611244187684937e-06,
"loss": 0.6634,
"mean_token_accuracy": 0.8182784497737885,
"num_tokens": 850348679.0,
"step": 8500
},
{
"entropy": 0.944921875,
"epoch": 1.1630449637829712,
"grad_norm": 0.26692219710420906,
"learning_rate": 2.1576018035789773e-06,
"loss": 0.68,
"mean_token_accuracy": 0.8150061249732972,
"num_tokens": 851390979.0,
"step": 8510
},
{
"entropy": 0.925390625,
"epoch": 1.1644116441164412,
"grad_norm": 0.32237755550350883,
"learning_rate": 2.1540791883894604e-06,
"loss": 0.684,
"mean_token_accuracy": 0.8123792946338654,
"num_tokens": 852334784.0,
"step": 8520
},
{
"entropy": 0.975390625,
"epoch": 1.1657783244499111,
"grad_norm": 0.28719657137709376,
"learning_rate": 2.150556573199944e-06,
"loss": 0.6947,
"mean_token_accuracy": 0.8122089743614197,
"num_tokens": 853316164.0,
"step": 8530
},
{
"entropy": 0.954296875,
"epoch": 1.1671450047833811,
"grad_norm": 0.2602319079869363,
"learning_rate": 2.147033958010427e-06,
"loss": 0.671,
"mean_token_accuracy": 0.8178537309169769,
"num_tokens": 854310705.0,
"step": 8540
},
{
"entropy": 0.983203125,
"epoch": 1.168511685116851,
"grad_norm": 0.32023411368644505,
"learning_rate": 2.14351134282091e-06,
"loss": 0.6824,
"mean_token_accuracy": 0.8147923350334167,
"num_tokens": 855323999.0,
"step": 8550
},
{
"entropy": 0.9484375,
"epoch": 1.169878365450321,
"grad_norm": 0.32524237624582664,
"learning_rate": 2.1399887276313937e-06,
"loss": 0.637,
"mean_token_accuracy": 0.8240571796894074,
"num_tokens": 856354716.0,
"step": 8560
},
{
"entropy": 0.9921875,
"epoch": 1.1712450457837913,
"grad_norm": 0.295467051545487,
"learning_rate": 2.136466112441877e-06,
"loss": 0.7254,
"mean_token_accuracy": 0.8061933159828186,
"num_tokens": 857367255.0,
"step": 8570
},
{
"entropy": 0.95703125,
"epoch": 1.1726117261172613,
"grad_norm": 0.2937071220341181,
"learning_rate": 2.1329434972523604e-06,
"loss": 0.6647,
"mean_token_accuracy": 0.8166682302951813,
"num_tokens": 858351443.0,
"step": 8580
},
{
"entropy": 0.96875,
"epoch": 1.1739784064507313,
"grad_norm": 0.3055014416905767,
"learning_rate": 2.1294208820628435e-06,
"loss": 0.6928,
"mean_token_accuracy": 0.8114965975284576,
"num_tokens": 859323958.0,
"step": 8590
},
{
"entropy": 1.0,
"epoch": 1.1753450867842012,
"grad_norm": 0.31755721481034216,
"learning_rate": 2.125898266873327e-06,
"loss": 0.7061,
"mean_token_accuracy": 0.8059556365013123,
"num_tokens": 860387216.0,
"step": 8600
},
{
"entropy": 1.001953125,
"epoch": 1.1767117671176712,
"grad_norm": 0.2724375967673964,
"learning_rate": 2.12237565168381e-06,
"loss": 0.6837,
"mean_token_accuracy": 0.8132215917110444,
"num_tokens": 861392464.0,
"step": 8610
},
{
"entropy": 0.980078125,
"epoch": 1.1780784474511412,
"grad_norm": 0.28387794558826507,
"learning_rate": 2.1188530364942938e-06,
"loss": 0.719,
"mean_token_accuracy": 0.8061092793941498,
"num_tokens": 862397043.0,
"step": 8620
},
{
"entropy": 0.92109375,
"epoch": 1.1794451277846112,
"grad_norm": 0.26730178614846184,
"learning_rate": 2.115330421304777e-06,
"loss": 0.6742,
"mean_token_accuracy": 0.814801824092865,
"num_tokens": 863390205.0,
"step": 8630
},
{
"entropy": 0.937109375,
"epoch": 1.1808118081180812,
"grad_norm": 0.26811534844905227,
"learning_rate": 2.1118078061152604e-06,
"loss": 0.6793,
"mean_token_accuracy": 0.8147133171558381,
"num_tokens": 864448969.0,
"step": 8640
},
{
"entropy": 0.934375,
"epoch": 1.1821784884515512,
"grad_norm": 0.27903088160979606,
"learning_rate": 2.1082851909257435e-06,
"loss": 0.679,
"mean_token_accuracy": 0.8145881772041321,
"num_tokens": 865457188.0,
"step": 8650
},
{
"entropy": 0.957421875,
"epoch": 1.1835451687850211,
"grad_norm": 0.24777084740528194,
"learning_rate": 2.1047625757362267e-06,
"loss": 0.6929,
"mean_token_accuracy": 0.81131432056427,
"num_tokens": 866493920.0,
"step": 8660
},
{
"entropy": 0.96328125,
"epoch": 1.1849118491184911,
"grad_norm": 0.30992108866939533,
"learning_rate": 2.1012399605467102e-06,
"loss": 0.687,
"mean_token_accuracy": 0.8120905935764313,
"num_tokens": 867456088.0,
"step": 8670
},
{
"entropy": 1.001953125,
"epoch": 1.186278529451961,
"grad_norm": 0.2765444099583376,
"learning_rate": 2.0977173453571933e-06,
"loss": 0.7032,
"mean_token_accuracy": 0.8103268504142761,
"num_tokens": 868415965.0,
"step": 8680
},
{
"entropy": 1.0046875,
"epoch": 1.187645209785431,
"grad_norm": 0.335311163583646,
"learning_rate": 2.0941947301676765e-06,
"loss": 0.7395,
"mean_token_accuracy": 0.801025664806366,
"num_tokens": 869360829.0,
"step": 8690
},
{
"entropy": 0.932421875,
"epoch": 1.189011890118901,
"grad_norm": 0.29210526197526426,
"learning_rate": 2.09067211497816e-06,
"loss": 0.6872,
"mean_token_accuracy": 0.8124085128307342,
"num_tokens": 870385804.0,
"step": 8700
},
{
"entropy": 0.973046875,
"epoch": 1.1903785704523713,
"grad_norm": 0.3545333226480236,
"learning_rate": 2.087149499788643e-06,
"loss": 0.6803,
"mean_token_accuracy": 0.811125922203064,
"num_tokens": 871374976.0,
"step": 8710
},
{
"entropy": 0.974609375,
"epoch": 1.1917452507858413,
"grad_norm": 0.3664977563026635,
"learning_rate": 2.0836268845991263e-06,
"loss": 0.6869,
"mean_token_accuracy": 0.8131799697875977,
"num_tokens": 872381296.0,
"step": 8720
},
{
"entropy": 0.96171875,
"epoch": 1.1931119311193112,
"grad_norm": 0.31143351095121874,
"learning_rate": 2.08010426940961e-06,
"loss": 0.6948,
"mean_token_accuracy": 0.8115826427936554,
"num_tokens": 873413346.0,
"step": 8730
},
{
"entropy": 0.980859375,
"epoch": 1.1944786114527812,
"grad_norm": 0.314422139875508,
"learning_rate": 2.076581654220093e-06,
"loss": 0.7134,
"mean_token_accuracy": 0.8071408867835999,
"num_tokens": 874412929.0,
"step": 8740
},
{
"entropy": 0.94453125,
"epoch": 1.1958452917862512,
"grad_norm": 0.3504659588833058,
"learning_rate": 2.0730590390305765e-06,
"loss": 0.6659,
"mean_token_accuracy": 0.8172428727149963,
"num_tokens": 875402223.0,
"step": 8750
},
{
"entropy": 0.967578125,
"epoch": 1.1972119721197212,
"grad_norm": 0.3116915168330326,
"learning_rate": 2.0695364238410596e-06,
"loss": 0.687,
"mean_token_accuracy": 0.811380273103714,
"num_tokens": 876463167.0,
"step": 8760
},
{
"entropy": 0.96953125,
"epoch": 1.1985786524531912,
"grad_norm": 0.2681144363395165,
"learning_rate": 2.066013808651543e-06,
"loss": 0.6856,
"mean_token_accuracy": 0.8122985422611236,
"num_tokens": 877461994.0,
"step": 8770
},
{
"entropy": 1.005859375,
"epoch": 1.1999453327866612,
"grad_norm": 0.33773957495418655,
"learning_rate": 2.0624911934620263e-06,
"loss": 0.7222,
"mean_token_accuracy": 0.8068845927715301,
"num_tokens": 878411994.0,
"step": 8780
},
{
"entropy": 0.99609375,
"epoch": 1.2013120131201311,
"grad_norm": 0.30290005380043156,
"learning_rate": 2.05896857827251e-06,
"loss": 0.7351,
"mean_token_accuracy": 0.8022940337657929,
"num_tokens": 879467450.0,
"step": 8790
},
{
"entropy": 0.944140625,
"epoch": 1.2026786934536011,
"grad_norm": 0.31008148549934866,
"learning_rate": 2.055445963082993e-06,
"loss": 0.6638,
"mean_token_accuracy": 0.8189157843589783,
"num_tokens": 880463239.0,
"step": 8800
},
{
"entropy": 0.933984375,
"epoch": 1.2040453737870713,
"grad_norm": 0.298641035846685,
"learning_rate": 2.0519233478934765e-06,
"loss": 0.6706,
"mean_token_accuracy": 0.815063202381134,
"num_tokens": 881497928.0,
"step": 8810
},
{
"entropy": 0.987890625,
"epoch": 1.2054120541205413,
"grad_norm": 0.3072424762914397,
"learning_rate": 2.0484007327039596e-06,
"loss": 0.7058,
"mean_token_accuracy": 0.8081299781799316,
"num_tokens": 882484287.0,
"step": 8820
},
{
"entropy": 0.973046875,
"epoch": 1.2067787344540113,
"grad_norm": 0.32340383849442744,
"learning_rate": 2.0448781175144427e-06,
"loss": 0.7198,
"mean_token_accuracy": 0.807269948720932,
"num_tokens": 883474734.0,
"step": 8830
},
{
"entropy": 0.966015625,
"epoch": 1.2081454147874813,
"grad_norm": 0.3136467914593551,
"learning_rate": 2.0413555023249263e-06,
"loss": 0.7023,
"mean_token_accuracy": 0.809906256198883,
"num_tokens": 884485200.0,
"step": 8840
},
{
"entropy": 0.959375,
"epoch": 1.2095120951209513,
"grad_norm": 0.3111973769567023,
"learning_rate": 2.0378328871354094e-06,
"loss": 0.6997,
"mean_token_accuracy": 0.8104493319988251,
"num_tokens": 885527588.0,
"step": 8850
},
{
"entropy": 0.966015625,
"epoch": 1.2108787754544212,
"grad_norm": 0.2772959610892207,
"learning_rate": 2.034310271945893e-06,
"loss": 0.6804,
"mean_token_accuracy": 0.8153850674629212,
"num_tokens": 886576177.0,
"step": 8860
},
{
"entropy": 0.959375,
"epoch": 1.2122454557878912,
"grad_norm": 0.3017985583473803,
"learning_rate": 2.030787656756376e-06,
"loss": 0.6994,
"mean_token_accuracy": 0.8085248231887817,
"num_tokens": 887557289.0,
"step": 8870
},
{
"entropy": 0.943359375,
"epoch": 1.2136121361213612,
"grad_norm": 0.2901953958372831,
"learning_rate": 2.027265041566859e-06,
"loss": 0.6768,
"mean_token_accuracy": 0.8144365072250366,
"num_tokens": 888551450.0,
"step": 8880
},
{
"entropy": 0.958984375,
"epoch": 1.2149788164548312,
"grad_norm": 0.2983139713464173,
"learning_rate": 2.0237424263773427e-06,
"loss": 0.6867,
"mean_token_accuracy": 0.8121626555919648,
"num_tokens": 889517616.0,
"step": 8890
},
{
"entropy": 0.92890625,
"epoch": 1.2163454967883012,
"grad_norm": 0.2509972737144255,
"learning_rate": 2.020219811187826e-06,
"loss": 0.666,
"mean_token_accuracy": 0.817164945602417,
"num_tokens": 890537135.0,
"step": 8900
},
{
"entropy": 0.981640625,
"epoch": 1.2177121771217712,
"grad_norm": 0.291163754572076,
"learning_rate": 2.0166971959983094e-06,
"loss": 0.7111,
"mean_token_accuracy": 0.8060116410255432,
"num_tokens": 891549004.0,
"step": 8910
},
{
"entropy": 0.9390625,
"epoch": 1.2190788574552411,
"grad_norm": 0.29326347002708975,
"learning_rate": 2.0131745808087925e-06,
"loss": 0.6758,
"mean_token_accuracy": 0.8148689210414887,
"num_tokens": 892557106.0,
"step": 8920
},
{
"entropy": 0.952734375,
"epoch": 1.2204455377887111,
"grad_norm": 0.3073516611380112,
"learning_rate": 2.009651965619276e-06,
"loss": 0.6656,
"mean_token_accuracy": 0.8161073982715606,
"num_tokens": 893557870.0,
"step": 8930
},
{
"entropy": 0.981640625,
"epoch": 1.221812218122181,
"grad_norm": 0.30203851204854165,
"learning_rate": 2.0061293504297592e-06,
"loss": 0.6945,
"mean_token_accuracy": 0.8110489428043366,
"num_tokens": 894586657.0,
"step": 8940
},
{
"entropy": 0.928515625,
"epoch": 1.2231788984556513,
"grad_norm": 0.29573178460305116,
"learning_rate": 2.0026067352402428e-06,
"loss": 0.6464,
"mean_token_accuracy": 0.8214879512786866,
"num_tokens": 895604874.0,
"step": 8950
},
{
"entropy": 0.984765625,
"epoch": 1.2245455787891213,
"grad_norm": 0.2885097451659557,
"learning_rate": 1.999084120050726e-06,
"loss": 0.7226,
"mean_token_accuracy": 0.8049274444580078,
"num_tokens": 896608041.0,
"step": 8960
},
{
"entropy": 0.943359375,
"epoch": 1.2259122591225913,
"grad_norm": 0.2909025588135091,
"learning_rate": 1.9955615048612094e-06,
"loss": 0.6767,
"mean_token_accuracy": 0.8147510409355163,
"num_tokens": 897597600.0,
"step": 8970
},
{
"entropy": 0.964453125,
"epoch": 1.2272789394560613,
"grad_norm": 0.3083916486876478,
"learning_rate": 1.9920388896716926e-06,
"loss": 0.6623,
"mean_token_accuracy": 0.8191410183906556,
"num_tokens": 898615203.0,
"step": 8980
},
{
"entropy": 0.9859375,
"epoch": 1.2286456197895312,
"grad_norm": 0.2778862180699675,
"learning_rate": 1.9885162744821757e-06,
"loss": 0.6712,
"mean_token_accuracy": 0.8187621057033538,
"num_tokens": 899617423.0,
"step": 8990
},
{
"entropy": 0.95703125,
"epoch": 1.2300123001230012,
"grad_norm": 0.30970142254345506,
"learning_rate": 1.9849936592926592e-06,
"loss": 0.6834,
"mean_token_accuracy": 0.8123359858989716,
"num_tokens": 900558849.0,
"step": 9000
},
{
"entropy": 0.9515625,
"epoch": 1.2313789804564712,
"grad_norm": 0.2819944216656307,
"learning_rate": 1.9814710441031424e-06,
"loss": 0.6628,
"mean_token_accuracy": 0.8179741024971008,
"num_tokens": 901548912.0,
"step": 9010
},
{
"entropy": 0.9359375,
"epoch": 1.2327456607899412,
"grad_norm": 0.29823201492033374,
"learning_rate": 1.9779484289136255e-06,
"loss": 0.661,
"mean_token_accuracy": 0.8186764121055603,
"num_tokens": 902535364.0,
"step": 9020
},
{
"entropy": 0.9796875,
"epoch": 1.2341123411234112,
"grad_norm": 0.2796863427731567,
"learning_rate": 1.974425813724109e-06,
"loss": 0.6825,
"mean_token_accuracy": 0.8144703924655914,
"num_tokens": 903543096.0,
"step": 9030
},
{
"entropy": 0.956640625,
"epoch": 1.2354790214568812,
"grad_norm": 0.2922457291937192,
"learning_rate": 1.970903198534592e-06,
"loss": 0.6771,
"mean_token_accuracy": 0.8145179808139801,
"num_tokens": 904565326.0,
"step": 9040
},
{
"entropy": 0.964453125,
"epoch": 1.2368457017903514,
"grad_norm": 0.3197471907914289,
"learning_rate": 1.9673805833450753e-06,
"loss": 0.6939,
"mean_token_accuracy": 0.809819096326828,
"num_tokens": 905584767.0,
"step": 9050
},
{
"entropy": 0.97265625,
"epoch": 1.2382123821238213,
"grad_norm": 0.2501815419953816,
"learning_rate": 1.963857968155559e-06,
"loss": 0.6795,
"mean_token_accuracy": 0.8146153450012207,
"num_tokens": 906607326.0,
"step": 9060
},
{
"entropy": 0.949609375,
"epoch": 1.2395790624572913,
"grad_norm": 0.32571286202557925,
"learning_rate": 1.960335352966042e-06,
"loss": 0.6862,
"mean_token_accuracy": 0.8137654721736908,
"num_tokens": 907609267.0,
"step": 9070
},
{
"entropy": 0.968359375,
"epoch": 1.2409457427907613,
"grad_norm": 0.291919215356053,
"learning_rate": 1.9568127377765255e-06,
"loss": 0.7093,
"mean_token_accuracy": 0.8073428571224213,
"num_tokens": 908637270.0,
"step": 9080
},
{
"entropy": 0.924609375,
"epoch": 1.2423124231242313,
"grad_norm": 0.25815657237558337,
"learning_rate": 1.9532901225870086e-06,
"loss": 0.6584,
"mean_token_accuracy": 0.8189687311649323,
"num_tokens": 909704935.0,
"step": 9090
},
{
"entropy": 0.958203125,
"epoch": 1.2436791034577013,
"grad_norm": 0.3036111989362327,
"learning_rate": 1.949767507397492e-06,
"loss": 0.6846,
"mean_token_accuracy": 0.813328641653061,
"num_tokens": 910672097.0,
"step": 9100
},
{
"entropy": 0.99453125,
"epoch": 1.2450457837911713,
"grad_norm": 0.3023543711723882,
"learning_rate": 1.9462448922079753e-06,
"loss": 0.7082,
"mean_token_accuracy": 0.8073122560977936,
"num_tokens": 911652942.0,
"step": 9110
},
{
"entropy": 0.9671875,
"epoch": 1.2464124641246412,
"grad_norm": 0.29577714887885037,
"learning_rate": 1.942722277018459e-06,
"loss": 0.696,
"mean_token_accuracy": 0.8107965469360352,
"num_tokens": 912632049.0,
"step": 9120
},
{
"entropy": 0.99921875,
"epoch": 1.2477791444581112,
"grad_norm": 0.33970145448511696,
"learning_rate": 1.939199661828942e-06,
"loss": 0.715,
"mean_token_accuracy": 0.8047411918640137,
"num_tokens": 913616040.0,
"step": 9130
},
{
"entropy": 0.944921875,
"epoch": 1.2491458247915812,
"grad_norm": 0.3134256469417161,
"learning_rate": 1.9356770466394255e-06,
"loss": 0.6604,
"mean_token_accuracy": 0.8204322278499603,
"num_tokens": 914540891.0,
"step": 9140
},
{
"entropy": 0.928515625,
"epoch": 1.2505125051250512,
"grad_norm": 0.2883726490785507,
"learning_rate": 1.9321544314499086e-06,
"loss": 0.6913,
"mean_token_accuracy": 0.8118860840797424,
"num_tokens": 915532706.0,
"step": 9150
},
{
"entropy": 0.96015625,
"epoch": 1.2518791854585212,
"grad_norm": 0.35220512431391715,
"learning_rate": 1.9286318162603917e-06,
"loss": 0.6864,
"mean_token_accuracy": 0.8105059146881104,
"num_tokens": 916543389.0,
"step": 9160
},
{
"entropy": 0.932421875,
"epoch": 1.2532458657919912,
"grad_norm": 0.26726005662657465,
"learning_rate": 1.9251092010708753e-06,
"loss": 0.6576,
"mean_token_accuracy": 0.8214966177940368,
"num_tokens": 917543100.0,
"step": 9170
},
{
"entropy": 0.98359375,
"epoch": 1.2546125461254611,
"grad_norm": 0.24699288459083216,
"learning_rate": 1.9215865858813584e-06,
"loss": 0.6912,
"mean_token_accuracy": 0.8118676900863647,
"num_tokens": 918538535.0,
"step": 9180
},
{
"entropy": 0.9953125,
"epoch": 1.2559792264589311,
"grad_norm": 0.2842826816043992,
"learning_rate": 1.918063970691842e-06,
"loss": 0.7137,
"mean_token_accuracy": 0.805817049741745,
"num_tokens": 919540564.0,
"step": 9190
},
{
"entropy": 0.964453125,
"epoch": 1.2573459067924013,
"grad_norm": 0.3142127746316438,
"learning_rate": 1.914541355502325e-06,
"loss": 0.6768,
"mean_token_accuracy": 0.8128908932209015,
"num_tokens": 920498208.0,
"step": 9200
},
{
"entropy": 0.955078125,
"epoch": 1.2587125871258713,
"grad_norm": 0.27522606209162914,
"learning_rate": 1.9110187403128082e-06,
"loss": 0.6761,
"mean_token_accuracy": 0.813014131784439,
"num_tokens": 921485540.0,
"step": 9210
},
{
"entropy": 0.958984375,
"epoch": 1.2600792674593413,
"grad_norm": 0.30765891547961005,
"learning_rate": 1.9074961251232918e-06,
"loss": 0.6956,
"mean_token_accuracy": 0.8122315466403961,
"num_tokens": 922529790.0,
"step": 9220
},
{
"entropy": 0.9515625,
"epoch": 1.2614459477928113,
"grad_norm": 0.3073662510256798,
"learning_rate": 1.903973509933775e-06,
"loss": 0.6739,
"mean_token_accuracy": 0.8136800825595856,
"num_tokens": 923511480.0,
"step": 9230
},
{
"entropy": 0.998046875,
"epoch": 1.2628126281262813,
"grad_norm": 0.29447081779946127,
"learning_rate": 1.9004508947442582e-06,
"loss": 0.7118,
"mean_token_accuracy": 0.8077692568302155,
"num_tokens": 924472391.0,
"step": 9240
},
{
"entropy": 0.933203125,
"epoch": 1.2641793084597512,
"grad_norm": 0.31149138786378755,
"learning_rate": 1.8969282795547418e-06,
"loss": 0.66,
"mean_token_accuracy": 0.8182271003723145,
"num_tokens": 925446242.0,
"step": 9250
},
{
"entropy": 0.96875,
"epoch": 1.2655459887932212,
"grad_norm": 0.2737470589484016,
"learning_rate": 1.8934056643652249e-06,
"loss": 0.6725,
"mean_token_accuracy": 0.8146336674690247,
"num_tokens": 926428154.0,
"step": 9260
},
{
"entropy": 0.9453125,
"epoch": 1.2669126691266912,
"grad_norm": 0.26571211677859374,
"learning_rate": 1.889883049175708e-06,
"loss": 0.6688,
"mean_token_accuracy": 0.8166499555110931,
"num_tokens": 927412643.0,
"step": 9270
},
{
"entropy": 0.92109375,
"epoch": 1.2682793494601612,
"grad_norm": 0.29532442372929657,
"learning_rate": 1.8863604339861916e-06,
"loss": 0.671,
"mean_token_accuracy": 0.8150282680988312,
"num_tokens": 928410601.0,
"step": 9280
},
{
"entropy": 0.980859375,
"epoch": 1.2696460297936314,
"grad_norm": 0.3138282041244302,
"learning_rate": 1.8828378187966747e-06,
"loss": 0.7246,
"mean_token_accuracy": 0.8051821470260621,
"num_tokens": 929431939.0,
"step": 9290
},
{
"entropy": 0.951171875,
"epoch": 1.2710127101271014,
"grad_norm": 0.2891815864607552,
"learning_rate": 1.8793152036071582e-06,
"loss": 0.6802,
"mean_token_accuracy": 0.814068204164505,
"num_tokens": 930423657.0,
"step": 9300
},
{
"entropy": 0.926953125,
"epoch": 1.2723793904605714,
"grad_norm": 0.26719617440314636,
"learning_rate": 1.8757925884176414e-06,
"loss": 0.6869,
"mean_token_accuracy": 0.8127192676067352,
"num_tokens": 931442449.0,
"step": 9310
},
{
"entropy": 0.97421875,
"epoch": 1.2737460707940413,
"grad_norm": 0.31624971472742314,
"learning_rate": 1.8722699732281247e-06,
"loss": 0.705,
"mean_token_accuracy": 0.8069142878055573,
"num_tokens": 932521052.0,
"step": 9320
},
{
"entropy": 0.991796875,
"epoch": 1.2751127511275113,
"grad_norm": 0.2868179212481973,
"learning_rate": 1.868747358038608e-06,
"loss": 0.7054,
"mean_token_accuracy": 0.8083778977394104,
"num_tokens": 933507370.0,
"step": 9330
},
{
"entropy": 0.937890625,
"epoch": 1.2764794314609813,
"grad_norm": 0.2877295336919635,
"learning_rate": 1.8652247428490914e-06,
"loss": 0.6931,
"mean_token_accuracy": 0.8113889753818512,
"num_tokens": 934502095.0,
"step": 9340
},
{
"entropy": 0.98671875,
"epoch": 1.2778461117944513,
"grad_norm": 0.30825642917245333,
"learning_rate": 1.8617021276595745e-06,
"loss": 0.7093,
"mean_token_accuracy": 0.8078824639320373,
"num_tokens": 935487419.0,
"step": 9350
},
{
"entropy": 0.977734375,
"epoch": 1.2792127921279213,
"grad_norm": 0.31258083358453004,
"learning_rate": 1.858179512470058e-06,
"loss": 0.6784,
"mean_token_accuracy": 0.8164110243320465,
"num_tokens": 936471802.0,
"step": 9360
},
{
"entropy": 0.944140625,
"epoch": 1.2805794724613913,
"grad_norm": 0.27586785095274,
"learning_rate": 1.8546568972805412e-06,
"loss": 0.6926,
"mean_token_accuracy": 0.8127791225910187,
"num_tokens": 937539862.0,
"step": 9370
},
{
"entropy": 0.94921875,
"epoch": 1.2819461527948612,
"grad_norm": 0.3068595392710246,
"learning_rate": 1.8511342820910245e-06,
"loss": 0.6628,
"mean_token_accuracy": 0.8175226986408234,
"num_tokens": 938529370.0,
"step": 9380
},
{
"entropy": 0.937109375,
"epoch": 1.2833128331283312,
"grad_norm": 0.2838695076937846,
"learning_rate": 1.8476116669015078e-06,
"loss": 0.6514,
"mean_token_accuracy": 0.8204932034015655,
"num_tokens": 939551040.0,
"step": 9390
},
{
"entropy": 0.94140625,
"epoch": 1.2846795134618012,
"grad_norm": 0.28870198416139115,
"learning_rate": 1.8440890517119912e-06,
"loss": 0.6459,
"mean_token_accuracy": 0.8209522306919098,
"num_tokens": 940566873.0,
"step": 9400
},
{
"entropy": 0.9671875,
"epoch": 1.2860461937952712,
"grad_norm": 0.3263582657559976,
"learning_rate": 1.8405664365224743e-06,
"loss": 0.6897,
"mean_token_accuracy": 0.812094259262085,
"num_tokens": 941533238.0,
"step": 9410
},
{
"entropy": 1.000390625,
"epoch": 1.2874128741287412,
"grad_norm": 0.3073828495011457,
"learning_rate": 1.8370438213329578e-06,
"loss": 0.6984,
"mean_token_accuracy": 0.809829568862915,
"num_tokens": 942585724.0,
"step": 9420
},
{
"entropy": 0.976171875,
"epoch": 1.2887795544622112,
"grad_norm": 0.29050609769863567,
"learning_rate": 1.833521206143441e-06,
"loss": 0.6874,
"mean_token_accuracy": 0.8131811499595643,
"num_tokens": 943591743.0,
"step": 9430
},
{
"entropy": 1.006640625,
"epoch": 1.2901462347956814,
"grad_norm": 0.28220651456036655,
"learning_rate": 1.8299985909539245e-06,
"loss": 0.7001,
"mean_token_accuracy": 0.8090426921844482,
"num_tokens": 944552381.0,
"step": 9440
},
{
"entropy": 1.002734375,
"epoch": 1.2915129151291513,
"grad_norm": 0.3124513378166016,
"learning_rate": 1.8264759757644076e-06,
"loss": 0.6844,
"mean_token_accuracy": 0.8134803771972656,
"num_tokens": 945540560.0,
"step": 9450
},
{
"entropy": 0.94375,
"epoch": 1.2928795954626213,
"grad_norm": 0.32604701684577664,
"learning_rate": 1.822953360574891e-06,
"loss": 0.688,
"mean_token_accuracy": 0.8134030938148499,
"num_tokens": 946489712.0,
"step": 9460
},
{
"entropy": 0.9375,
"epoch": 1.2942462757960913,
"grad_norm": 0.26440093347693266,
"learning_rate": 1.8194307453853743e-06,
"loss": 0.6652,
"mean_token_accuracy": 0.8173010945320129,
"num_tokens": 947476787.0,
"step": 9470
},
{
"entropy": 0.9859375,
"epoch": 1.2956129561295613,
"grad_norm": 0.301970906370685,
"learning_rate": 1.8159081301958576e-06,
"loss": 0.6705,
"mean_token_accuracy": 0.8170112609863281,
"num_tokens": 948501617.0,
"step": 9480
},
{
"entropy": 0.951171875,
"epoch": 1.2969796364630313,
"grad_norm": 0.24439696614365464,
"learning_rate": 1.8123855150063408e-06,
"loss": 0.6775,
"mean_token_accuracy": 0.8177900195121766,
"num_tokens": 949519303.0,
"step": 9490
},
{
"entropy": 0.97734375,
"epoch": 1.2983463167965013,
"grad_norm": 0.27064460752159347,
"learning_rate": 1.8088628998168243e-06,
"loss": 0.6777,
"mean_token_accuracy": 0.8147445499897004,
"num_tokens": 950486819.0,
"step": 9500
},
{
"entropy": 0.930859375,
"epoch": 1.2997129971299712,
"grad_norm": 0.31597135266472526,
"learning_rate": 1.8053402846273074e-06,
"loss": 0.6601,
"mean_token_accuracy": 0.8182908058166504,
"num_tokens": 951473991.0,
"step": 9510
},
{
"entropy": 0.9078125,
"epoch": 1.3010796774634412,
"grad_norm": 0.27669487979978424,
"learning_rate": 1.8018176694377906e-06,
"loss": 0.6424,
"mean_token_accuracy": 0.8220534741878509,
"num_tokens": 952456845.0,
"step": 9520
},
{
"entropy": 0.944921875,
"epoch": 1.3024463577969114,
"grad_norm": 0.27251358677241777,
"learning_rate": 1.798295054248274e-06,
"loss": 0.6796,
"mean_token_accuracy": 0.814178729057312,
"num_tokens": 953432509.0,
"step": 9530
},
{
"entropy": 0.951171875,
"epoch": 1.3038130381303814,
"grad_norm": 0.32086158033864615,
"learning_rate": 1.7947724390587572e-06,
"loss": 0.6735,
"mean_token_accuracy": 0.8153429687023163,
"num_tokens": 954412401.0,
"step": 9540
},
{
"entropy": 0.97265625,
"epoch": 1.3051797184638514,
"grad_norm": 0.3459676336516918,
"learning_rate": 1.7912498238692408e-06,
"loss": 0.7137,
"mean_token_accuracy": 0.8064033806324005,
"num_tokens": 955434387.0,
"step": 9550
},
{
"entropy": 0.939453125,
"epoch": 1.3065463987973214,
"grad_norm": 0.2820329463130263,
"learning_rate": 1.7877272086797239e-06,
"loss": 0.6857,
"mean_token_accuracy": 0.8138504028320312,
"num_tokens": 956436781.0,
"step": 9560
},
{
"entropy": 0.9671875,
"epoch": 1.3079130791307914,
"grad_norm": 0.2714191277460514,
"learning_rate": 1.7842045934902072e-06,
"loss": 0.6813,
"mean_token_accuracy": 0.8134593486785888,
"num_tokens": 957455135.0,
"step": 9570
},
{
"entropy": 0.963671875,
"epoch": 1.3092797594642613,
"grad_norm": 0.2925078053497086,
"learning_rate": 1.7806819783006908e-06,
"loss": 0.7175,
"mean_token_accuracy": 0.8055298328399658,
"num_tokens": 958444739.0,
"step": 9580
},
{
"entropy": 0.953125,
"epoch": 1.3106464397977313,
"grad_norm": 0.27733337156841964,
"learning_rate": 1.777159363111174e-06,
"loss": 0.6938,
"mean_token_accuracy": 0.8118989050388337,
"num_tokens": 959438087.0,
"step": 9590
},
{
"entropy": 0.950390625,
"epoch": 1.3120131201312013,
"grad_norm": 0.26622531060175636,
"learning_rate": 1.773636747921657e-06,
"loss": 0.6725,
"mean_token_accuracy": 0.8150154054164886,
"num_tokens": 960385839.0,
"step": 9600
},
{
"entropy": 0.956640625,
"epoch": 1.3133798004646713,
"grad_norm": 0.31541844845158784,
"learning_rate": 1.7701141327321406e-06,
"loss": 0.6841,
"mean_token_accuracy": 0.8127715408802032,
"num_tokens": 961419505.0,
"step": 9610
},
{
"entropy": 0.966796875,
"epoch": 1.3147464807981413,
"grad_norm": 0.26694650054463137,
"learning_rate": 1.7665915175426237e-06,
"loss": 0.6742,
"mean_token_accuracy": 0.8165572285652161,
"num_tokens": 962470145.0,
"step": 9620
},
{
"entropy": 0.946875,
"epoch": 1.3161131611316113,
"grad_norm": 0.29556266679477233,
"learning_rate": 1.763068902353107e-06,
"loss": 0.6737,
"mean_token_accuracy": 0.8138741850852966,
"num_tokens": 963447229.0,
"step": 9630
},
{
"entropy": 0.984375,
"epoch": 1.3174798414650812,
"grad_norm": 0.3111642380188694,
"learning_rate": 1.7595462871635904e-06,
"loss": 0.7265,
"mean_token_accuracy": 0.8043180763721466,
"num_tokens": 964422167.0,
"step": 9640
},
{
"entropy": 0.934375,
"epoch": 1.3188465217985512,
"grad_norm": 0.30518401717470706,
"learning_rate": 1.7560236719740737e-06,
"loss": 0.6518,
"mean_token_accuracy": 0.8192057251930237,
"num_tokens": 965440668.0,
"step": 9650
},
{
"entropy": 0.97265625,
"epoch": 1.3202132021320212,
"grad_norm": 0.26621998859268486,
"learning_rate": 1.752501056784557e-06,
"loss": 0.6753,
"mean_token_accuracy": 0.8174243032932281,
"num_tokens": 966467260.0,
"step": 9660
},
{
"entropy": 0.952734375,
"epoch": 1.3215798824654912,
"grad_norm": 0.3193135414804038,
"learning_rate": 1.7489784415950404e-06,
"loss": 0.6499,
"mean_token_accuracy": 0.820396888256073,
"num_tokens": 967428711.0,
"step": 9670
},
{
"entropy": 0.9375,
"epoch": 1.3229465627989614,
"grad_norm": 0.26585771281339887,
"learning_rate": 1.7454558264055235e-06,
"loss": 0.6892,
"mean_token_accuracy": 0.8105414569377899,
"num_tokens": 968403916.0,
"step": 9680
},
{
"entropy": 0.9546875,
"epoch": 1.3243132431324314,
"grad_norm": 0.28230662036947407,
"learning_rate": 1.741933211216007e-06,
"loss": 0.6698,
"mean_token_accuracy": 0.8177600741386414,
"num_tokens": 969366462.0,
"step": 9690
},
{
"entropy": 0.97890625,
"epoch": 1.3256799234659014,
"grad_norm": 0.2999515060494108,
"learning_rate": 1.7384105960264902e-06,
"loss": 0.7037,
"mean_token_accuracy": 0.8103676021099091,
"num_tokens": 970373679.0,
"step": 9700
},
{
"entropy": 0.995703125,
"epoch": 1.3270466037993713,
"grad_norm": 0.335826751252478,
"learning_rate": 1.7348879808369735e-06,
"loss": 0.7363,
"mean_token_accuracy": 0.8007459759712219,
"num_tokens": 971400650.0,
"step": 9710
},
{
"entropy": 0.945703125,
"epoch": 1.3284132841328413,
"grad_norm": 0.2969212964649775,
"learning_rate": 1.7313653656474568e-06,
"loss": 0.705,
"mean_token_accuracy": 0.8088354587554931,
"num_tokens": 972421944.0,
"step": 9720
},
{
"entropy": 0.974609375,
"epoch": 1.3297799644663113,
"grad_norm": 0.3013854880907888,
"learning_rate": 1.7278427504579402e-06,
"loss": 0.7196,
"mean_token_accuracy": 0.8078246295452118,
"num_tokens": 973453605.0,
"step": 9730
},
{
"entropy": 0.970703125,
"epoch": 1.3311466447997813,
"grad_norm": 0.28825239734633457,
"learning_rate": 1.7243201352684233e-06,
"loss": 0.689,
"mean_token_accuracy": 0.8123893916606904,
"num_tokens": 974495387.0,
"step": 9740
},
{
"entropy": 0.976953125,
"epoch": 1.3325133251332513,
"grad_norm": 0.31828123507210615,
"learning_rate": 1.7207975200789068e-06,
"loss": 0.717,
"mean_token_accuracy": 0.8067243099212646,
"num_tokens": 975496025.0,
"step": 9750
},
{
"entropy": 0.948046875,
"epoch": 1.3338800054667213,
"grad_norm": 0.31134265512126746,
"learning_rate": 1.71727490488939e-06,
"loss": 0.6872,
"mean_token_accuracy": 0.8128408551216125,
"num_tokens": 976445931.0,
"step": 9760
},
{
"entropy": 0.957421875,
"epoch": 1.3352466858001915,
"grad_norm": 0.3243231440564403,
"learning_rate": 1.7137522896998735e-06,
"loss": 0.6785,
"mean_token_accuracy": 0.813087522983551,
"num_tokens": 977455378.0,
"step": 9770
},
{
"entropy": 0.934765625,
"epoch": 1.3366133661336614,
"grad_norm": 0.28795744739585644,
"learning_rate": 1.7102296745103566e-06,
"loss": 0.6717,
"mean_token_accuracy": 0.8168282926082611,
"num_tokens": 978419993.0,
"step": 9780
},
{
"entropy": 0.958984375,
"epoch": 1.3379800464671314,
"grad_norm": 0.2982324641413778,
"learning_rate": 1.7067070593208398e-06,
"loss": 0.6878,
"mean_token_accuracy": 0.8123453795909882,
"num_tokens": 979452387.0,
"step": 9790
},
{
"entropy": 0.965234375,
"epoch": 1.3393467268006014,
"grad_norm": 0.29255711206943136,
"learning_rate": 1.7031844441313233e-06,
"loss": 0.6741,
"mean_token_accuracy": 0.8164163529872894,
"num_tokens": 980455389.0,
"step": 9800
},
{
"entropy": 0.950390625,
"epoch": 1.3407134071340714,
"grad_norm": 0.2918576642732828,
"learning_rate": 1.6996618289418064e-06,
"loss": 0.6933,
"mean_token_accuracy": 0.8118243455886841,
"num_tokens": 981471110.0,
"step": 9810
},
{
"entropy": 0.965234375,
"epoch": 1.3420800874675414,
"grad_norm": 0.2918665362866795,
"learning_rate": 1.6961392137522898e-06,
"loss": 0.6834,
"mean_token_accuracy": 0.8129226088523864,
"num_tokens": 982422886.0,
"step": 9820
},
{
"entropy": 0.943359375,
"epoch": 1.3434467678010114,
"grad_norm": 0.29144119844852023,
"learning_rate": 1.6926165985627733e-06,
"loss": 0.6874,
"mean_token_accuracy": 0.8131270051002503,
"num_tokens": 983371506.0,
"step": 9830
},
{
"entropy": 0.965625,
"epoch": 1.3448134481344813,
"grad_norm": 0.2963861367785856,
"learning_rate": 1.6890939833732564e-06,
"loss": 0.7226,
"mean_token_accuracy": 0.8048581480979919,
"num_tokens": 984412138.0,
"step": 9840
},
{
"entropy": 0.976953125,
"epoch": 1.3461801284679513,
"grad_norm": 0.3045065968365471,
"learning_rate": 1.6855713681837396e-06,
"loss": 0.7029,
"mean_token_accuracy": 0.8093400776386261,
"num_tokens": 985425229.0,
"step": 9850
},
{
"entropy": 0.95546875,
"epoch": 1.3475468088014213,
"grad_norm": 0.2888702112950064,
"learning_rate": 1.6820487529942231e-06,
"loss": 0.6668,
"mean_token_accuracy": 0.8150201499462127,
"num_tokens": 986419865.0,
"step": 9860
},
{
"entropy": 0.9375,
"epoch": 1.3489134891348913,
"grad_norm": 0.33878707653433415,
"learning_rate": 1.6785261378047062e-06,
"loss": 0.6601,
"mean_token_accuracy": 0.8167461931705475,
"num_tokens": 987419067.0,
"step": 9870
},
{
"entropy": 0.941796875,
"epoch": 1.3502801694683613,
"grad_norm": 0.29242176107167334,
"learning_rate": 1.6750035226151898e-06,
"loss": 0.6743,
"mean_token_accuracy": 0.8153134226799011,
"num_tokens": 988373727.0,
"step": 9880
},
{
"entropy": 0.944921875,
"epoch": 1.3516468498018313,
"grad_norm": 0.32267921127685195,
"learning_rate": 1.671480907425673e-06,
"loss": 0.6847,
"mean_token_accuracy": 0.8124825775623321,
"num_tokens": 989387984.0,
"step": 9890
},
{
"entropy": 0.9703125,
"epoch": 1.3530135301353012,
"grad_norm": 0.3041977965117845,
"learning_rate": 1.6679582922361562e-06,
"loss": 0.689,
"mean_token_accuracy": 0.8128453671932221,
"num_tokens": 990355546.0,
"step": 9900
},
{
"entropy": 0.973828125,
"epoch": 1.3543802104687712,
"grad_norm": 0.29283925218569734,
"learning_rate": 1.6644356770466396e-06,
"loss": 0.6764,
"mean_token_accuracy": 0.8133953750133515,
"num_tokens": 991370672.0,
"step": 9910
},
{
"entropy": 0.972265625,
"epoch": 1.3557468908022414,
"grad_norm": 0.30684237203836434,
"learning_rate": 1.660913061857123e-06,
"loss": 0.6855,
"mean_token_accuracy": 0.8108513414859772,
"num_tokens": 992381520.0,
"step": 9920
},
{
"entropy": 0.9140625,
"epoch": 1.3571135711357114,
"grad_norm": 0.3171362415471536,
"learning_rate": 1.657390446667606e-06,
"loss": 0.643,
"mean_token_accuracy": 0.8240404665470124,
"num_tokens": 993382761.0,
"step": 9930
},
{
"entropy": 0.944140625,
"epoch": 1.3584802514691814,
"grad_norm": 0.2862360564380031,
"learning_rate": 1.6538678314780896e-06,
"loss": 0.6831,
"mean_token_accuracy": 0.8147768080234528,
"num_tokens": 994369777.0,
"step": 9940
},
{
"entropy": 1.012890625,
"epoch": 1.3598469318026514,
"grad_norm": 0.3060983667039936,
"learning_rate": 1.6503452162885727e-06,
"loss": 0.7553,
"mean_token_accuracy": 0.7965042293071747,
"num_tokens": 995342083.0,
"step": 9950
},
{
"entropy": 0.969921875,
"epoch": 1.3612136121361214,
"grad_norm": 0.2894780442776652,
"learning_rate": 1.646822601099056e-06,
"loss": 0.6559,
"mean_token_accuracy": 0.8194744050502777,
"num_tokens": 996342172.0,
"step": 9960
},
{
"entropy": 0.937890625,
"epoch": 1.3625802924695913,
"grad_norm": 0.3050051346506191,
"learning_rate": 1.6432999859095394e-06,
"loss": 0.667,
"mean_token_accuracy": 0.8174522221088409,
"num_tokens": 997342669.0,
"step": 9970
},
{
"entropy": 0.990625,
"epoch": 1.3639469728030613,
"grad_norm": 0.33008431689959844,
"learning_rate": 1.6397773707200227e-06,
"loss": 0.7271,
"mean_token_accuracy": 0.8031072556972504,
"num_tokens": 998358263.0,
"step": 9980
},
{
"entropy": 0.95234375,
"epoch": 1.3653136531365313,
"grad_norm": 0.2824739827820528,
"learning_rate": 1.636254755530506e-06,
"loss": 0.679,
"mean_token_accuracy": 0.8131628274917603,
"num_tokens": 999320568.0,
"step": 9990
},
{
"entropy": 0.893359375,
"epoch": 1.3666803334700013,
"grad_norm": 0.28402532234618677,
"learning_rate": 1.6327321403409894e-06,
"loss": 0.6155,
"mean_token_accuracy": 0.8277749061584473,
"num_tokens": 1000320181.0,
"step": 10000
},
{
"entropy": 0.962890625,
"epoch": 1.3680470138034715,
"grad_norm": 0.3323603647456639,
"learning_rate": 1.6292095251514725e-06,
"loss": 0.6788,
"mean_token_accuracy": 0.8153265953063965,
"num_tokens": 1001302690.0,
"step": 10010
},
{
"entropy": 0.98515625,
"epoch": 1.3694136941369415,
"grad_norm": 0.2856192471618508,
"learning_rate": 1.625686909961956e-06,
"loss": 0.7232,
"mean_token_accuracy": 0.8050671815872192,
"num_tokens": 1002324480.0,
"step": 10020
},
{
"entropy": 0.970703125,
"epoch": 1.3707803744704115,
"grad_norm": 0.31539921345263566,
"learning_rate": 1.6221642947724392e-06,
"loss": 0.7108,
"mean_token_accuracy": 0.8061969995498657,
"num_tokens": 1003274627.0,
"step": 10030
},
{
"entropy": 0.9890625,
"epoch": 1.3721470548038814,
"grad_norm": 0.3319014194142799,
"learning_rate": 1.6186416795829223e-06,
"loss": 0.6955,
"mean_token_accuracy": 0.8107332468032837,
"num_tokens": 1004298174.0,
"step": 10040
},
{
"entropy": 0.9578125,
"epoch": 1.3735137351373514,
"grad_norm": 0.310728793947531,
"learning_rate": 1.6151190643934058e-06,
"loss": 0.6703,
"mean_token_accuracy": 0.8144782423973084,
"num_tokens": 1005322220.0,
"step": 10050
},
{
"entropy": 0.935546875,
"epoch": 1.3748804154708214,
"grad_norm": 0.29690250562955794,
"learning_rate": 1.6115964492038892e-06,
"loss": 0.6738,
"mean_token_accuracy": 0.8154176294803619,
"num_tokens": 1006316700.0,
"step": 10060
},
{
"entropy": 0.96796875,
"epoch": 1.3762470958042914,
"grad_norm": 0.2974706809309828,
"learning_rate": 1.6080738340143723e-06,
"loss": 0.6691,
"mean_token_accuracy": 0.8194418132305146,
"num_tokens": 1007336671.0,
"step": 10070
},
{
"entropy": 0.938671875,
"epoch": 1.3776137761377614,
"grad_norm": 0.2876374535304607,
"learning_rate": 1.6045512188248559e-06,
"loss": 0.6823,
"mean_token_accuracy": 0.8145674228668213,
"num_tokens": 1008278921.0,
"step": 10080
},
{
"entropy": 0.973046875,
"epoch": 1.3789804564712314,
"grad_norm": 0.28224195419862225,
"learning_rate": 1.601028603635339e-06,
"loss": 0.6714,
"mean_token_accuracy": 0.8160668313503265,
"num_tokens": 1009246342.0,
"step": 10090
},
{
"entropy": 0.969921875,
"epoch": 1.3803471368047013,
"grad_norm": 0.3310711400922336,
"learning_rate": 1.5975059884458225e-06,
"loss": 0.694,
"mean_token_accuracy": 0.8110854923725128,
"num_tokens": 1010299250.0,
"step": 10100
},
{
"entropy": 0.953125,
"epoch": 1.3817138171381713,
"grad_norm": 0.2866890323482724,
"learning_rate": 1.5939833732563056e-06,
"loss": 0.667,
"mean_token_accuracy": 0.8164711356163025,
"num_tokens": 1011305561.0,
"step": 10110
},
{
"entropy": 0.956640625,
"epoch": 1.3830804974716413,
"grad_norm": 0.2640596864374788,
"learning_rate": 1.5904607580667888e-06,
"loss": 0.6975,
"mean_token_accuracy": 0.8096311688423157,
"num_tokens": 1012341918.0,
"step": 10120
},
{
"entropy": 0.969921875,
"epoch": 1.3844471778051113,
"grad_norm": 0.31232911099264365,
"learning_rate": 1.5869381428772723e-06,
"loss": 0.7076,
"mean_token_accuracy": 0.8083328306674957,
"num_tokens": 1013327756.0,
"step": 10130
},
{
"entropy": 0.990234375,
"epoch": 1.3858138581385813,
"grad_norm": 0.2987498055022798,
"learning_rate": 1.5834155276877554e-06,
"loss": 0.7011,
"mean_token_accuracy": 0.8093648970127105,
"num_tokens": 1014308706.0,
"step": 10140
},
{
"entropy": 0.971875,
"epoch": 1.3871805384720512,
"grad_norm": 0.27629772616640613,
"learning_rate": 1.5798929124982388e-06,
"loss": 0.7042,
"mean_token_accuracy": 0.808362352848053,
"num_tokens": 1015268139.0,
"step": 10150
},
{
"entropy": 0.946875,
"epoch": 1.3885472188055215,
"grad_norm": 0.31210133765879594,
"learning_rate": 1.5763702973087221e-06,
"loss": 0.6633,
"mean_token_accuracy": 0.8171403229236602,
"num_tokens": 1016240467.0,
"step": 10160
},
{
"entropy": 0.92265625,
"epoch": 1.3899138991389914,
"grad_norm": 0.35235214658466796,
"learning_rate": 1.5728476821192054e-06,
"loss": 0.6628,
"mean_token_accuracy": 0.8190337181091308,
"num_tokens": 1017227965.0,
"step": 10170
},
{
"entropy": 0.980078125,
"epoch": 1.3912805794724614,
"grad_norm": 0.27967930359563353,
"learning_rate": 1.5693250669296886e-06,
"loss": 0.7,
"mean_token_accuracy": 0.8100073933601379,
"num_tokens": 1018268281.0,
"step": 10180
},
{
"entropy": 0.935546875,
"epoch": 1.3926472598059314,
"grad_norm": 0.271488599742749,
"learning_rate": 1.5658024517401721e-06,
"loss": 0.6824,
"mean_token_accuracy": 0.8143287777900696,
"num_tokens": 1019262621.0,
"step": 10190
},
{
"entropy": 0.92265625,
"epoch": 1.3940139401394014,
"grad_norm": 0.2684137375204588,
"learning_rate": 1.5622798365506552e-06,
"loss": 0.6696,
"mean_token_accuracy": 0.8181226491928101,
"num_tokens": 1020287525.0,
"step": 10200
},
{
"entropy": 0.95703125,
"epoch": 1.3953806204728714,
"grad_norm": 0.2871814107102794,
"learning_rate": 1.5587572213611388e-06,
"loss": 0.6809,
"mean_token_accuracy": 0.8145976543426514,
"num_tokens": 1021281798.0,
"step": 10210
},
{
"entropy": 0.98515625,
"epoch": 1.3967473008063414,
"grad_norm": 0.31863236458816996,
"learning_rate": 1.555234606171622e-06,
"loss": 0.6817,
"mean_token_accuracy": 0.8141428709030152,
"num_tokens": 1022297013.0,
"step": 10220
},
{
"entropy": 0.9625,
"epoch": 1.3981139811398113,
"grad_norm": 0.2823095557545305,
"learning_rate": 1.5517119909821052e-06,
"loss": 0.662,
"mean_token_accuracy": 0.8173053920269012,
"num_tokens": 1023336531.0,
"step": 10230
},
{
"entropy": 0.975,
"epoch": 1.3994806614732813,
"grad_norm": 0.2764480045623546,
"learning_rate": 1.5481893757925886e-06,
"loss": 0.6989,
"mean_token_accuracy": 0.811123150587082,
"num_tokens": 1024359820.0,
"step": 10240
},
{
"entropy": 0.974609375,
"epoch": 1.4008473418067515,
"grad_norm": 0.34410819821381144,
"learning_rate": 1.544666760603072e-06,
"loss": 0.6868,
"mean_token_accuracy": 0.8122689843177795,
"num_tokens": 1025313651.0,
"step": 10250
},
{
"entropy": 0.9921875,
"epoch": 1.4022140221402215,
"grad_norm": 0.32199851682543784,
"learning_rate": 1.541144145413555e-06,
"loss": 0.7102,
"mean_token_accuracy": 0.8058831930160523,
"num_tokens": 1026338791.0,
"step": 10260
},
{
"entropy": 0.98515625,
"epoch": 1.4035807024736915,
"grad_norm": 0.32306501273591576,
"learning_rate": 1.5376215302240386e-06,
"loss": 0.6632,
"mean_token_accuracy": 0.8178538620471955,
"num_tokens": 1027409356.0,
"step": 10270
},
{
"entropy": 0.955859375,
"epoch": 1.4049473828071615,
"grad_norm": 0.28894053102308326,
"learning_rate": 1.5340989150345217e-06,
"loss": 0.6632,
"mean_token_accuracy": 0.8180184185504913,
"num_tokens": 1028421417.0,
"step": 10280
},
{
"entropy": 0.934375,
"epoch": 1.4063140631406315,
"grad_norm": 0.265394061801031,
"learning_rate": 1.5305762998450048e-06,
"loss": 0.6488,
"mean_token_accuracy": 0.823157548904419,
"num_tokens": 1029407757.0,
"step": 10290
},
{
"entropy": 1.01484375,
"epoch": 1.4076807434741014,
"grad_norm": 0.3428969493294603,
"learning_rate": 1.5270536846554884e-06,
"loss": 0.7233,
"mean_token_accuracy": 0.805422431230545,
"num_tokens": 1030402768.0,
"step": 10300
},
{
"entropy": 0.984765625,
"epoch": 1.4090474238075714,
"grad_norm": 0.3264951687863622,
"learning_rate": 1.5235310694659717e-06,
"loss": 0.7367,
"mean_token_accuracy": 0.8008031487464905,
"num_tokens": 1031421346.0,
"step": 10310
},
{
"entropy": 0.9296875,
"epoch": 1.4104141041410414,
"grad_norm": 0.3037360642144804,
"learning_rate": 1.5200084542764548e-06,
"loss": 0.6491,
"mean_token_accuracy": 0.8202433168888092,
"num_tokens": 1032449936.0,
"step": 10320
},
{
"entropy": 0.94921875,
"epoch": 1.4117807844745114,
"grad_norm": 0.34057523152661007,
"learning_rate": 1.5164858390869384e-06,
"loss": 0.6597,
"mean_token_accuracy": 0.8172300338745118,
"num_tokens": 1033451424.0,
"step": 10330
},
{
"entropy": 1.041015625,
"epoch": 1.4131474648079814,
"grad_norm": 0.31759890831463816,
"learning_rate": 1.5129632238974215e-06,
"loss": 0.754,
"mean_token_accuracy": 0.8002470552921295,
"num_tokens": 1034410200.0,
"step": 10340
},
{
"entropy": 0.961328125,
"epoch": 1.4145141451414514,
"grad_norm": 0.27466932332070654,
"learning_rate": 1.509440608707905e-06,
"loss": 0.6669,
"mean_token_accuracy": 0.8165810585021973,
"num_tokens": 1035442507.0,
"step": 10350
},
{
"entropy": 1.004296875,
"epoch": 1.4158808254749213,
"grad_norm": 0.29854330923196776,
"learning_rate": 1.5059179935183882e-06,
"loss": 0.6921,
"mean_token_accuracy": 0.8101158320903779,
"num_tokens": 1036434906.0,
"step": 10360
},
{
"entropy": 0.975,
"epoch": 1.4172475058083913,
"grad_norm": 0.28717951555138777,
"learning_rate": 1.5023953783288713e-06,
"loss": 0.6825,
"mean_token_accuracy": 0.8143952846527099,
"num_tokens": 1037442931.0,
"step": 10370
},
{
"entropy": 0.954296875,
"epoch": 1.4186141861418613,
"grad_norm": 0.285625743910605,
"learning_rate": 1.4988727631393549e-06,
"loss": 0.6883,
"mean_token_accuracy": 0.8111042022705078,
"num_tokens": 1038428896.0,
"step": 10380
},
{
"entropy": 0.9640625,
"epoch": 1.4199808664753313,
"grad_norm": 0.3121390129092322,
"learning_rate": 1.495350147949838e-06,
"loss": 0.7087,
"mean_token_accuracy": 0.8086667716503143,
"num_tokens": 1039468446.0,
"step": 10390
},
{
"entropy": 0.94140625,
"epoch": 1.4213475468088015,
"grad_norm": 0.3054618370510695,
"learning_rate": 1.4918275327603213e-06,
"loss": 0.6636,
"mean_token_accuracy": 0.8190270841121674,
"num_tokens": 1040415907.0,
"step": 10400
},
{
"entropy": 0.93671875,
"epoch": 1.4227142271422715,
"grad_norm": 0.26056535317002244,
"learning_rate": 1.4883049175708047e-06,
"loss": 0.675,
"mean_token_accuracy": 0.8149511814117432,
"num_tokens": 1041365926.0,
"step": 10410
},
{
"entropy": 0.968359375,
"epoch": 1.4240809074757415,
"grad_norm": 0.29962910450297636,
"learning_rate": 1.484782302381288e-06,
"loss": 0.7092,
"mean_token_accuracy": 0.8071873188018799,
"num_tokens": 1042376843.0,
"step": 10420
},
{
"entropy": 0.975390625,
"epoch": 1.4254475878092114,
"grad_norm": 0.33846742366123705,
"learning_rate": 1.4812596871917711e-06,
"loss": 0.6762,
"mean_token_accuracy": 0.8156099438667297,
"num_tokens": 1043360046.0,
"step": 10430
},
{
"entropy": 0.9546875,
"epoch": 1.4268142681426814,
"grad_norm": 0.2768053137857527,
"learning_rate": 1.4777370720022547e-06,
"loss": 0.689,
"mean_token_accuracy": 0.8114222288131714,
"num_tokens": 1044350861.0,
"step": 10440
},
{
"entropy": 0.951953125,
"epoch": 1.4281809484761514,
"grad_norm": 0.2947993988963974,
"learning_rate": 1.4742144568127378e-06,
"loss": 0.6832,
"mean_token_accuracy": 0.8124483168125153,
"num_tokens": 1045385211.0,
"step": 10450
},
{
"entropy": 0.93515625,
"epoch": 1.4295476288096214,
"grad_norm": 0.307878698777441,
"learning_rate": 1.4706918416232213e-06,
"loss": 0.6875,
"mean_token_accuracy": 0.8132932960987092,
"num_tokens": 1046364295.0,
"step": 10460
},
{
"entropy": 0.953515625,
"epoch": 1.4309143091430914,
"grad_norm": 0.2542680818394733,
"learning_rate": 1.4671692264337045e-06,
"loss": 0.6861,
"mean_token_accuracy": 0.8129550218582153,
"num_tokens": 1047401532.0,
"step": 10470
},
{
"entropy": 0.94140625,
"epoch": 1.4322809894765614,
"grad_norm": 0.25527446325064745,
"learning_rate": 1.4636466112441878e-06,
"loss": 0.693,
"mean_token_accuracy": 0.8094128668308258,
"num_tokens": 1048443079.0,
"step": 10480
},
{
"entropy": 0.944921875,
"epoch": 1.4336476698100316,
"grad_norm": 0.2716403701475452,
"learning_rate": 1.4601239960546711e-06,
"loss": 0.6728,
"mean_token_accuracy": 0.8158367812633515,
"num_tokens": 1049441194.0,
"step": 10490
},
{
"entropy": 0.97890625,
"epoch": 1.4350143501435015,
"grad_norm": 0.2896008571392052,
"learning_rate": 1.4566013808651545e-06,
"loss": 0.6737,
"mean_token_accuracy": 0.8133850872516633,
"num_tokens": 1050494420.0,
"step": 10500
},
{
"entropy": 0.931640625,
"epoch": 1.4363810304769715,
"grad_norm": 0.34006407977585323,
"learning_rate": 1.4530787656756376e-06,
"loss": 0.6471,
"mean_token_accuracy": 0.8220993220806122,
"num_tokens": 1051525559.0,
"step": 10510
},
{
"entropy": 0.967578125,
"epoch": 1.4377477108104415,
"grad_norm": 0.3131788825464646,
"learning_rate": 1.4495561504861211e-06,
"loss": 0.678,
"mean_token_accuracy": 0.8129294335842132,
"num_tokens": 1052570593.0,
"step": 10520
},
{
"entropy": 0.97109375,
"epoch": 1.4391143911439115,
"grad_norm": 0.2886352704673807,
"learning_rate": 1.4460335352966043e-06,
"loss": 0.6839,
"mean_token_accuracy": 0.8145684719085693,
"num_tokens": 1053556483.0,
"step": 10530
},
{
"entropy": 1.00234375,
"epoch": 1.4404810714773815,
"grad_norm": 0.30307392572420155,
"learning_rate": 1.4425109201070876e-06,
"loss": 0.7578,
"mean_token_accuracy": 0.7959698915481568,
"num_tokens": 1054642123.0,
"step": 10540
},
{
"entropy": 0.96796875,
"epoch": 1.4418477518108515,
"grad_norm": 0.3137108799243871,
"learning_rate": 1.438988304917571e-06,
"loss": 0.6748,
"mean_token_accuracy": 0.8152523934841156,
"num_tokens": 1055670389.0,
"step": 10550
},
{
"entropy": 0.950390625,
"epoch": 1.4432144321443214,
"grad_norm": 0.2760239297388136,
"learning_rate": 1.4354656897280543e-06,
"loss": 0.7008,
"mean_token_accuracy": 0.8090612351894378,
"num_tokens": 1056685940.0,
"step": 10560
},
{
"entropy": 0.954296875,
"epoch": 1.4445811124777914,
"grad_norm": 0.2948528776024812,
"learning_rate": 1.4319430745385376e-06,
"loss": 0.6733,
"mean_token_accuracy": 0.8142601132392884,
"num_tokens": 1057681428.0,
"step": 10570
},
{
"entropy": 0.970703125,
"epoch": 1.4459477928112614,
"grad_norm": 0.2908130992558613,
"learning_rate": 1.428420459349021e-06,
"loss": 0.6861,
"mean_token_accuracy": 0.8138785541057587,
"num_tokens": 1058675715.0,
"step": 10580
},
{
"entropy": 0.926953125,
"epoch": 1.4473144731447314,
"grad_norm": 0.32041204653614896,
"learning_rate": 1.424897844159504e-06,
"loss": 0.6371,
"mean_token_accuracy": 0.8240197181701661,
"num_tokens": 1059671350.0,
"step": 10590
},
{
"entropy": 0.941796875,
"epoch": 1.4486811534782014,
"grad_norm": 0.33659844526085175,
"learning_rate": 1.4213752289699876e-06,
"loss": 0.6637,
"mean_token_accuracy": 0.8176371693611145,
"num_tokens": 1060663937.0,
"step": 10600
},
{
"entropy": 0.938671875,
"epoch": 1.4500478338116713,
"grad_norm": 0.25431667956582343,
"learning_rate": 1.4178526137804707e-06,
"loss": 0.6706,
"mean_token_accuracy": 0.8170354306697846,
"num_tokens": 1061638094.0,
"step": 10610
},
{
"entropy": 0.95,
"epoch": 1.4514145141451413,
"grad_norm": 0.29464622927175543,
"learning_rate": 1.4143299985909538e-06,
"loss": 0.6551,
"mean_token_accuracy": 0.8205661296844482,
"num_tokens": 1062601786.0,
"step": 10620
},
{
"entropy": 0.941015625,
"epoch": 1.4527811944786113,
"grad_norm": 0.3045324215948976,
"learning_rate": 1.4108073834014374e-06,
"loss": 0.6599,
"mean_token_accuracy": 0.8176623046398163,
"num_tokens": 1063627100.0,
"step": 10630
},
{
"entropy": 0.941796875,
"epoch": 1.4541478748120815,
"grad_norm": 0.31791099460355254,
"learning_rate": 1.4072847682119205e-06,
"loss": 0.683,
"mean_token_accuracy": 0.814414668083191,
"num_tokens": 1064647511.0,
"step": 10640
},
{
"entropy": 0.947265625,
"epoch": 1.4555145551455515,
"grad_norm": 0.29130554168807404,
"learning_rate": 1.4037621530224039e-06,
"loss": 0.6734,
"mean_token_accuracy": 0.8163170576095581,
"num_tokens": 1065704175.0,
"step": 10650
},
{
"entropy": 0.934765625,
"epoch": 1.4568812354790215,
"grad_norm": 0.2760971598125085,
"learning_rate": 1.4002395378328872e-06,
"loss": 0.6231,
"mean_token_accuracy": 0.824841034412384,
"num_tokens": 1066748260.0,
"step": 10660
},
{
"entropy": 0.926171875,
"epoch": 1.4582479158124915,
"grad_norm": 0.318265251126873,
"learning_rate": 1.3967169226433705e-06,
"loss": 0.649,
"mean_token_accuracy": 0.8208978414535523,
"num_tokens": 1067750021.0,
"step": 10670
},
{
"entropy": 0.9703125,
"epoch": 1.4596145961459615,
"grad_norm": 0.27986986264678465,
"learning_rate": 1.393194307453854e-06,
"loss": 0.6956,
"mean_token_accuracy": 0.8110399961471557,
"num_tokens": 1068768921.0,
"step": 10680
},
{
"entropy": 0.9796875,
"epoch": 1.4609812764794314,
"grad_norm": 0.3029900388172291,
"learning_rate": 1.3896716922643372e-06,
"loss": 0.7139,
"mean_token_accuracy": 0.8054700076580048,
"num_tokens": 1069750490.0,
"step": 10690
},
{
"entropy": 0.946875,
"epoch": 1.4623479568129014,
"grad_norm": 0.28015024190057913,
"learning_rate": 1.3861490770748203e-06,
"loss": 0.6611,
"mean_token_accuracy": 0.8193182110786438,
"num_tokens": 1070764757.0,
"step": 10700
},
{
"entropy": 0.968359375,
"epoch": 1.4637146371463714,
"grad_norm": 0.3375161717950594,
"learning_rate": 1.3826264618853039e-06,
"loss": 0.6926,
"mean_token_accuracy": 0.8105603694915772,
"num_tokens": 1071707028.0,
"step": 10710
},
{
"entropy": 0.97734375,
"epoch": 1.4650813174798414,
"grad_norm": 0.29431478372721037,
"learning_rate": 1.379103846695787e-06,
"loss": 0.702,
"mean_token_accuracy": 0.8094258964061737,
"num_tokens": 1072782291.0,
"step": 10720
},
{
"entropy": 0.96484375,
"epoch": 1.4664479978133116,
"grad_norm": 0.3134659299391769,
"learning_rate": 1.3755812315062703e-06,
"loss": 0.6937,
"mean_token_accuracy": 0.8105855464935303,
"num_tokens": 1073775705.0,
"step": 10730
},
{
"entropy": 0.942578125,
"epoch": 1.4678146781467816,
"grad_norm": 0.2930575712046795,
"learning_rate": 1.3720586163167537e-06,
"loss": 0.6829,
"mean_token_accuracy": 0.812822824716568,
"num_tokens": 1074768516.0,
"step": 10740
},
{
"entropy": 0.98671875,
"epoch": 1.4691813584802516,
"grad_norm": 0.32537216648300604,
"learning_rate": 1.368536001127237e-06,
"loss": 0.724,
"mean_token_accuracy": 0.8068375647068023,
"num_tokens": 1075736584.0,
"step": 10750
},
{
"entropy": 0.94609375,
"epoch": 1.4705480388137215,
"grad_norm": 0.26830199394469895,
"learning_rate": 1.3650133859377201e-06,
"loss": 0.6718,
"mean_token_accuracy": 0.8136247396469116,
"num_tokens": 1076732968.0,
"step": 10760
},
{
"entropy": 0.959765625,
"epoch": 1.4719147191471915,
"grad_norm": 0.3058532676221724,
"learning_rate": 1.3614907707482037e-06,
"loss": 0.6863,
"mean_token_accuracy": 0.8124472737312317,
"num_tokens": 1077705908.0,
"step": 10770
},
{
"entropy": 1.0296875,
"epoch": 1.4732813994806615,
"grad_norm": 0.3103418457093494,
"learning_rate": 1.3579681555586868e-06,
"loss": 0.7266,
"mean_token_accuracy": 0.8052566885948181,
"num_tokens": 1078728964.0,
"step": 10780
},
{
"entropy": 0.96953125,
"epoch": 1.4746480798141315,
"grad_norm": 0.33523226789256755,
"learning_rate": 1.3544455403691703e-06,
"loss": 0.6815,
"mean_token_accuracy": 0.8152646958827973,
"num_tokens": 1079762618.0,
"step": 10790
},
{
"entropy": 0.9515625,
"epoch": 1.4760147601476015,
"grad_norm": 0.3043125212116414,
"learning_rate": 1.3509229251796535e-06,
"loss": 0.6669,
"mean_token_accuracy": 0.8174083888530731,
"num_tokens": 1080719511.0,
"step": 10800
},
{
"entropy": 0.972265625,
"epoch": 1.4773814404810715,
"grad_norm": 0.279317159958965,
"learning_rate": 1.3474003099901368e-06,
"loss": 0.6914,
"mean_token_accuracy": 0.8114617705345154,
"num_tokens": 1081698936.0,
"step": 10810
},
{
"entropy": 0.94921875,
"epoch": 1.4787481208145414,
"grad_norm": 0.26922700669857746,
"learning_rate": 1.3438776948006201e-06,
"loss": 0.6665,
"mean_token_accuracy": 0.8172313332557678,
"num_tokens": 1082686698.0,
"step": 10820
},
{
"entropy": 0.9234375,
"epoch": 1.4801148011480114,
"grad_norm": 0.2850309372922779,
"learning_rate": 1.3403550796111035e-06,
"loss": 0.6146,
"mean_token_accuracy": 0.8285885572433471,
"num_tokens": 1083694783.0,
"step": 10830
},
{
"entropy": 0.969921875,
"epoch": 1.4814814814814814,
"grad_norm": 0.30117150227524564,
"learning_rate": 1.3368324644215866e-06,
"loss": 0.6767,
"mean_token_accuracy": 0.8140041172504425,
"num_tokens": 1084697142.0,
"step": 10840
},
{
"entropy": 0.917578125,
"epoch": 1.4828481618149514,
"grad_norm": 0.2845107352159931,
"learning_rate": 1.3333098492320701e-06,
"loss": 0.6657,
"mean_token_accuracy": 0.8167808294296265,
"num_tokens": 1085719990.0,
"step": 10850
},
{
"entropy": 0.98046875,
"epoch": 1.4842148421484214,
"grad_norm": 0.32815892465718033,
"learning_rate": 1.3297872340425533e-06,
"loss": 0.723,
"mean_token_accuracy": 0.8039101898670197,
"num_tokens": 1086693132.0,
"step": 10860
},
{
"entropy": 0.97578125,
"epoch": 1.4855815224818913,
"grad_norm": 0.2947182556383851,
"learning_rate": 1.3262646188530364e-06,
"loss": 0.7099,
"mean_token_accuracy": 0.8081912934780121,
"num_tokens": 1087739681.0,
"step": 10870
},
{
"entropy": 0.95,
"epoch": 1.4869482028153616,
"grad_norm": 0.27476128085562157,
"learning_rate": 1.32274200366352e-06,
"loss": 0.6899,
"mean_token_accuracy": 0.8135964810848236,
"num_tokens": 1088737790.0,
"step": 10880
},
{
"entropy": 0.940234375,
"epoch": 1.4883148831488315,
"grad_norm": 0.28557828458476875,
"learning_rate": 1.319219388474003e-06,
"loss": 0.6726,
"mean_token_accuracy": 0.815677696466446,
"num_tokens": 1089700014.0,
"step": 10890
},
{
"entropy": 1.003125,
"epoch": 1.4896815634823015,
"grad_norm": 0.2941512152965066,
"learning_rate": 1.3156967732844866e-06,
"loss": 0.7183,
"mean_token_accuracy": 0.8058285534381866,
"num_tokens": 1090707376.0,
"step": 10900
},
{
"entropy": 0.927734375,
"epoch": 1.4910482438157715,
"grad_norm": 0.2965788709535501,
"learning_rate": 1.31217415809497e-06,
"loss": 0.6364,
"mean_token_accuracy": 0.8242306411266327,
"num_tokens": 1091734576.0,
"step": 10910
},
{
"entropy": 0.986328125,
"epoch": 1.4924149241492415,
"grad_norm": 0.2932432761043296,
"learning_rate": 1.308651542905453e-06,
"loss": 0.7195,
"mean_token_accuracy": 0.8039514243602752,
"num_tokens": 1092800189.0,
"step": 10920
},
{
"entropy": 0.946875,
"epoch": 1.4937816044827115,
"grad_norm": 0.30918736998418117,
"learning_rate": 1.3051289277159366e-06,
"loss": 0.6699,
"mean_token_accuracy": 0.8154495298862457,
"num_tokens": 1093775552.0,
"step": 10930
},
{
"entropy": 0.951171875,
"epoch": 1.4951482848161814,
"grad_norm": 0.31352727381520845,
"learning_rate": 1.3016063125264197e-06,
"loss": 0.7002,
"mean_token_accuracy": 0.8119960963726044,
"num_tokens": 1094746366.0,
"step": 10940
},
{
"entropy": 0.977734375,
"epoch": 1.4965149651496514,
"grad_norm": 0.31240199061740587,
"learning_rate": 1.2980836973369029e-06,
"loss": 0.7136,
"mean_token_accuracy": 0.8037510633468627,
"num_tokens": 1095721115.0,
"step": 10950
},
{
"entropy": 0.943359375,
"epoch": 1.4978816454831214,
"grad_norm": 0.326096664851689,
"learning_rate": 1.2945610821473864e-06,
"loss": 0.6818,
"mean_token_accuracy": 0.8139350593090058,
"num_tokens": 1096675122.0,
"step": 10960
},
{
"entropy": 0.9390625,
"epoch": 1.4992483258165916,
"grad_norm": 0.2893290617339842,
"learning_rate": 1.2910384669578695e-06,
"loss": 0.6354,
"mean_token_accuracy": 0.8255988180637359,
"num_tokens": 1097680195.0,
"step": 10970
},
{
"entropy": 0.935546875,
"epoch": 1.5006150061500616,
"grad_norm": 0.3769631061799086,
"learning_rate": 1.2875158517683529e-06,
"loss": 0.6855,
"mean_token_accuracy": 0.8127979755401611,
"num_tokens": 1098654530.0,
"step": 10980
},
{
"entropy": 0.97890625,
"epoch": 1.5019816864835316,
"grad_norm": 0.31383039609448404,
"learning_rate": 1.2839932365788362e-06,
"loss": 0.7106,
"mean_token_accuracy": 0.8065861165523529,
"num_tokens": 1099644954.0,
"step": 10990
},
{
"entropy": 0.9546875,
"epoch": 1.5033483668170016,
"grad_norm": 0.24580784347829454,
"learning_rate": 1.2804706213893195e-06,
"loss": 0.677,
"mean_token_accuracy": 0.8155534982681274,
"num_tokens": 1100670867.0,
"step": 11000
},
{
"entropy": 0.990234375,
"epoch": 1.5047150471504716,
"grad_norm": 0.2860723026165276,
"learning_rate": 1.2769480061998029e-06,
"loss": 0.703,
"mean_token_accuracy": 0.8106382846832275,
"num_tokens": 1101669252.0,
"step": 11010
},
{
"entropy": 0.9390625,
"epoch": 1.5060817274839415,
"grad_norm": 0.2783472806260976,
"learning_rate": 1.2734253910102862e-06,
"loss": 0.661,
"mean_token_accuracy": 0.8191558420658112,
"num_tokens": 1102724602.0,
"step": 11020
},
{
"entropy": 0.9640625,
"epoch": 1.5074484078174115,
"grad_norm": 0.27723800062860104,
"learning_rate": 1.2699027758207693e-06,
"loss": 0.6675,
"mean_token_accuracy": 0.8174986004829407,
"num_tokens": 1103718122.0,
"step": 11030
},
{
"entropy": 0.991015625,
"epoch": 1.5088150881508815,
"grad_norm": 0.2900620988180233,
"learning_rate": 1.2663801606312529e-06,
"loss": 0.7243,
"mean_token_accuracy": 0.8019857823848724,
"num_tokens": 1104799231.0,
"step": 11040
},
{
"entropy": 0.93203125,
"epoch": 1.5101817684843515,
"grad_norm": 0.31006732712304835,
"learning_rate": 1.262857545441736e-06,
"loss": 0.6656,
"mean_token_accuracy": 0.8177498996257782,
"num_tokens": 1105748944.0,
"step": 11050
},
{
"entropy": 0.9671875,
"epoch": 1.5115484488178215,
"grad_norm": 0.2714706577794685,
"learning_rate": 1.2593349302522193e-06,
"loss": 0.6795,
"mean_token_accuracy": 0.8129544913768768,
"num_tokens": 1106750859.0,
"step": 11060
},
{
"entropy": 0.965234375,
"epoch": 1.5129151291512914,
"grad_norm": 0.31940332933493504,
"learning_rate": 1.2558123150627027e-06,
"loss": 0.6679,
"mean_token_accuracy": 0.8162144899368287,
"num_tokens": 1107766800.0,
"step": 11070
},
{
"entropy": 0.984765625,
"epoch": 1.5142818094847614,
"grad_norm": 0.3401908841013726,
"learning_rate": 1.252289699873186e-06,
"loss": 0.717,
"mean_token_accuracy": 0.8061027765274048,
"num_tokens": 1108772544.0,
"step": 11080
},
{
"entropy": 0.98671875,
"epoch": 1.5156484898182314,
"grad_norm": 0.3239719271747623,
"learning_rate": 1.2487670846836693e-06,
"loss": 0.6997,
"mean_token_accuracy": 0.8080051660537719,
"num_tokens": 1109784879.0,
"step": 11090
},
{
"entropy": 1.01484375,
"epoch": 1.5170151701517014,
"grad_norm": 0.3639805169541365,
"learning_rate": 1.2452444694941527e-06,
"loss": 0.7755,
"mean_token_accuracy": 0.7933434545993805,
"num_tokens": 1110755323.0,
"step": 11100
},
{
"entropy": 0.98046875,
"epoch": 1.5183818504851714,
"grad_norm": 0.2526202751510765,
"learning_rate": 1.2417218543046358e-06,
"loss": 0.703,
"mean_token_accuracy": 0.8112935185432434,
"num_tokens": 1111752070.0,
"step": 11110
},
{
"entropy": 0.9421875,
"epoch": 1.5197485308186414,
"grad_norm": 0.3486790193337725,
"learning_rate": 1.2381992391151191e-06,
"loss": 0.6968,
"mean_token_accuracy": 0.811996191740036,
"num_tokens": 1112742919.0,
"step": 11120
},
{
"entropy": 0.9484375,
"epoch": 1.5211152111521116,
"grad_norm": 0.2994717169132275,
"learning_rate": 1.2346766239256025e-06,
"loss": 0.6972,
"mean_token_accuracy": 0.8100342988967896,
"num_tokens": 1113773062.0,
"step": 11130
},
{
"entropy": 0.944140625,
"epoch": 1.5224818914855816,
"grad_norm": 0.27582988321879687,
"learning_rate": 1.2311540087360858e-06,
"loss": 0.6581,
"mean_token_accuracy": 0.8179563760757447,
"num_tokens": 1114820138.0,
"step": 11140
},
{
"entropy": 0.94921875,
"epoch": 1.5238485718190515,
"grad_norm": 0.30425501235923375,
"learning_rate": 1.2276313935465691e-06,
"loss": 0.6611,
"mean_token_accuracy": 0.8189345717430114,
"num_tokens": 1115814461.0,
"step": 11150
},
{
"entropy": 0.926171875,
"epoch": 1.5252152521525215,
"grad_norm": 0.2782101574922008,
"learning_rate": 1.2241087783570525e-06,
"loss": 0.6667,
"mean_token_accuracy": 0.816403079032898,
"num_tokens": 1116817324.0,
"step": 11160
},
{
"entropy": 0.962890625,
"epoch": 1.5265819324859915,
"grad_norm": 0.2609205578246998,
"learning_rate": 1.2205861631675358e-06,
"loss": 0.6797,
"mean_token_accuracy": 0.8138895809650422,
"num_tokens": 1117823984.0,
"step": 11170
},
{
"entropy": 1.025,
"epoch": 1.5279486128194615,
"grad_norm": 0.33096072217540917,
"learning_rate": 1.217063547978019e-06,
"loss": 0.7181,
"mean_token_accuracy": 0.8054170250892639,
"num_tokens": 1118804345.0,
"step": 11180
},
{
"entropy": 0.951171875,
"epoch": 1.5293152931529317,
"grad_norm": 0.2892467732943418,
"learning_rate": 1.2135409327885023e-06,
"loss": 0.6893,
"mean_token_accuracy": 0.8114832520484925,
"num_tokens": 1119802939.0,
"step": 11190
},
{
"entropy": 0.93203125,
"epoch": 1.5306819734864017,
"grad_norm": 0.29165928213458897,
"learning_rate": 1.2100183175989856e-06,
"loss": 0.6583,
"mean_token_accuracy": 0.8191441833972931,
"num_tokens": 1120777771.0,
"step": 11200
},
{
"entropy": 0.922265625,
"epoch": 1.5320486538198717,
"grad_norm": 0.3123751706841346,
"learning_rate": 1.206495702409469e-06,
"loss": 0.6521,
"mean_token_accuracy": 0.8206975221633911,
"num_tokens": 1121758238.0,
"step": 11210
},
{
"entropy": 0.908203125,
"epoch": 1.5334153341533416,
"grad_norm": 0.3211074232145451,
"learning_rate": 1.202973087219952e-06,
"loss": 0.6428,
"mean_token_accuracy": 0.8210139989852905,
"num_tokens": 1122757820.0,
"step": 11220
},
{
"entropy": 0.931640625,
"epoch": 1.5347820144868116,
"grad_norm": 0.3020197145300656,
"learning_rate": 1.1994504720304354e-06,
"loss": 0.6919,
"mean_token_accuracy": 0.8111848652362823,
"num_tokens": 1123784136.0,
"step": 11230
},
{
"entropy": 0.91953125,
"epoch": 1.5361486948202816,
"grad_norm": 0.32382516056840777,
"learning_rate": 1.1959278568409187e-06,
"loss": 0.6675,
"mean_token_accuracy": 0.8152971208095551,
"num_tokens": 1124819123.0,
"step": 11240
},
{
"entropy": 0.9265625,
"epoch": 1.5375153751537516,
"grad_norm": 0.300454035811441,
"learning_rate": 1.192405241651402e-06,
"loss": 0.6547,
"mean_token_accuracy": 0.818216073513031,
"num_tokens": 1125826807.0,
"step": 11250
},
{
"entropy": 0.96015625,
"epoch": 1.5388820554872216,
"grad_norm": 0.3030183174584563,
"learning_rate": 1.1888826264618854e-06,
"loss": 0.6874,
"mean_token_accuracy": 0.8112725853919983,
"num_tokens": 1126817641.0,
"step": 11260
},
{
"entropy": 0.948828125,
"epoch": 1.5402487358206916,
"grad_norm": 0.30237917278861365,
"learning_rate": 1.1853600112723687e-06,
"loss": 0.6806,
"mean_token_accuracy": 0.8141808688640595,
"num_tokens": 1127842712.0,
"step": 11270
},
{
"entropy": 0.931640625,
"epoch": 1.5416154161541615,
"grad_norm": 0.3217243802733009,
"learning_rate": 1.181837396082852e-06,
"loss": 0.6528,
"mean_token_accuracy": 0.8194682359695434,
"num_tokens": 1128863816.0,
"step": 11280
},
{
"entropy": 0.931640625,
"epoch": 1.5429820964876315,
"grad_norm": 0.2799483027592197,
"learning_rate": 1.1783147808933352e-06,
"loss": 0.6793,
"mean_token_accuracy": 0.8141201078891754,
"num_tokens": 1129869633.0,
"step": 11290
},
{
"entropy": 1.012109375,
"epoch": 1.5443487768211015,
"grad_norm": 0.2993470774507057,
"learning_rate": 1.1747921657038185e-06,
"loss": 0.7267,
"mean_token_accuracy": 0.8033312678337097,
"num_tokens": 1130865671.0,
"step": 11300
},
{
"entropy": 0.9265625,
"epoch": 1.5457154571545715,
"grad_norm": 0.2752034924758512,
"learning_rate": 1.1712695505143019e-06,
"loss": 0.6388,
"mean_token_accuracy": 0.8232295036315918,
"num_tokens": 1131846947.0,
"step": 11310
},
{
"entropy": 0.98046875,
"epoch": 1.5470821374880415,
"grad_norm": 0.29058828283017335,
"learning_rate": 1.1677469353247852e-06,
"loss": 0.6771,
"mean_token_accuracy": 0.8160733222961426,
"num_tokens": 1132793844.0,
"step": 11320
},
{
"entropy": 0.9734375,
"epoch": 1.5484488178215114,
"grad_norm": 0.2810500679432432,
"learning_rate": 1.1642243201352685e-06,
"loss": 0.7098,
"mean_token_accuracy": 0.8054274916648865,
"num_tokens": 1133827525.0,
"step": 11330
},
{
"entropy": 0.93828125,
"epoch": 1.5498154981549814,
"grad_norm": 0.2904665657976265,
"learning_rate": 1.1607017049457519e-06,
"loss": 0.6832,
"mean_token_accuracy": 0.8123827755451203,
"num_tokens": 1134851611.0,
"step": 11340
},
{
"entropy": 0.976171875,
"epoch": 1.5511821784884514,
"grad_norm": 0.3316479595691473,
"learning_rate": 1.1571790897562352e-06,
"loss": 0.7189,
"mean_token_accuracy": 0.8061707317829132,
"num_tokens": 1135812714.0,
"step": 11350
},
{
"entropy": 0.951171875,
"epoch": 1.5525488588219214,
"grad_norm": 0.310916883953568,
"learning_rate": 1.1536564745667183e-06,
"loss": 0.681,
"mean_token_accuracy": 0.8138940215110779,
"num_tokens": 1136794405.0,
"step": 11360
},
{
"entropy": 0.97109375,
"epoch": 1.5539155391553916,
"grad_norm": 0.32023880926428316,
"learning_rate": 1.1501338593772017e-06,
"loss": 0.6999,
"mean_token_accuracy": 0.8105652570724488,
"num_tokens": 1137769619.0,
"step": 11370
},
{
"entropy": 0.988671875,
"epoch": 1.5552822194888616,
"grad_norm": 0.31231420588928327,
"learning_rate": 1.146611244187685e-06,
"loss": 0.6936,
"mean_token_accuracy": 0.8122254073619842,
"num_tokens": 1138799883.0,
"step": 11380
},
{
"entropy": 0.959375,
"epoch": 1.5566488998223316,
"grad_norm": 0.29408152363313017,
"learning_rate": 1.1430886289981683e-06,
"loss": 0.7026,
"mean_token_accuracy": 0.806819885969162,
"num_tokens": 1139800900.0,
"step": 11390
},
{
"entropy": 0.933203125,
"epoch": 1.5580155801558015,
"grad_norm": 0.30549705663117216,
"learning_rate": 1.1395660138086517e-06,
"loss": 0.6506,
"mean_token_accuracy": 0.8195720672607422,
"num_tokens": 1140741463.0,
"step": 11400
},
{
"entropy": 0.954296875,
"epoch": 1.5593822604892715,
"grad_norm": 0.28830558911572357,
"learning_rate": 1.136043398619135e-06,
"loss": 0.6603,
"mean_token_accuracy": 0.819867593050003,
"num_tokens": 1141722088.0,
"step": 11410
},
{
"entropy": 0.9984375,
"epoch": 1.5607489408227415,
"grad_norm": 0.33118045099629156,
"learning_rate": 1.1325207834296184e-06,
"loss": 0.7121,
"mean_token_accuracy": 0.806777024269104,
"num_tokens": 1142741382.0,
"step": 11420
},
{
"entropy": 0.935546875,
"epoch": 1.5621156211562117,
"grad_norm": 0.2952939823252725,
"learning_rate": 1.1289981682401017e-06,
"loss": 0.6609,
"mean_token_accuracy": 0.8173575282096863,
"num_tokens": 1143707105.0,
"step": 11430
},
{
"entropy": 0.96015625,
"epoch": 1.5634823014896817,
"grad_norm": 0.266727307038431,
"learning_rate": 1.1254755530505848e-06,
"loss": 0.6834,
"mean_token_accuracy": 0.8147940814495087,
"num_tokens": 1144704253.0,
"step": 11440
},
{
"entropy": 0.96796875,
"epoch": 1.5648489818231517,
"grad_norm": 0.269592050751884,
"learning_rate": 1.1219529378610681e-06,
"loss": 0.7101,
"mean_token_accuracy": 0.8063516259193421,
"num_tokens": 1145699269.0,
"step": 11450
},
{
"entropy": 0.980859375,
"epoch": 1.5662156621566217,
"grad_norm": 0.3148769231558417,
"learning_rate": 1.1184303226715515e-06,
"loss": 0.6939,
"mean_token_accuracy": 0.8099006354808808,
"num_tokens": 1146720558.0,
"step": 11460
},
{
"entropy": 0.971875,
"epoch": 1.5675823424900917,
"grad_norm": 0.31017567786827954,
"learning_rate": 1.1149077074820346e-06,
"loss": 0.6956,
"mean_token_accuracy": 0.810180026292801,
"num_tokens": 1147722919.0,
"step": 11470
},
{
"entropy": 1.015625,
"epoch": 1.5689490228235616,
"grad_norm": 0.33857666369106243,
"learning_rate": 1.111385092292518e-06,
"loss": 0.7305,
"mean_token_accuracy": 0.8043645143508911,
"num_tokens": 1148706767.0,
"step": 11480
},
{
"entropy": 0.95,
"epoch": 1.5703157031570316,
"grad_norm": 0.2641810403402725,
"learning_rate": 1.1078624771030013e-06,
"loss": 0.6906,
"mean_token_accuracy": 0.8126172304153443,
"num_tokens": 1149707433.0,
"step": 11490
},
{
"entropy": 0.9671875,
"epoch": 1.5716823834905016,
"grad_norm": 0.30419444187331457,
"learning_rate": 1.1043398619134846e-06,
"loss": 0.6939,
"mean_token_accuracy": 0.8088920056819916,
"num_tokens": 1150747647.0,
"step": 11500
},
{
"entropy": 0.9765625,
"epoch": 1.5730490638239716,
"grad_norm": 0.2754387924904551,
"learning_rate": 1.100817246723968e-06,
"loss": 0.6956,
"mean_token_accuracy": 0.8106356978416442,
"num_tokens": 1151734770.0,
"step": 11510
},
{
"entropy": 0.965234375,
"epoch": 1.5744157441574416,
"grad_norm": 0.3058011840281585,
"learning_rate": 1.0972946315344513e-06,
"loss": 0.688,
"mean_token_accuracy": 0.8132197439670563,
"num_tokens": 1152776679.0,
"step": 11520
},
{
"entropy": 0.93671875,
"epoch": 1.5757824244909115,
"grad_norm": 0.32670514429519737,
"learning_rate": 1.0937720163449346e-06,
"loss": 0.6763,
"mean_token_accuracy": 0.8165204882621765,
"num_tokens": 1153760751.0,
"step": 11530
},
{
"entropy": 0.979296875,
"epoch": 1.5771491048243815,
"grad_norm": 0.29303908138350593,
"learning_rate": 1.0902494011554177e-06,
"loss": 0.6957,
"mean_token_accuracy": 0.8084002554416656,
"num_tokens": 1154773032.0,
"step": 11540
},
{
"entropy": 0.946484375,
"epoch": 1.5785157851578515,
"grad_norm": 0.31132025612034225,
"learning_rate": 1.086726785965901e-06,
"loss": 0.6645,
"mean_token_accuracy": 0.8182926535606384,
"num_tokens": 1155822119.0,
"step": 11550
},
{
"entropy": 0.994140625,
"epoch": 1.5798824654913215,
"grad_norm": 0.31407603804538137,
"learning_rate": 1.0832041707763844e-06,
"loss": 0.7271,
"mean_token_accuracy": 0.8044611155986786,
"num_tokens": 1156821322.0,
"step": 11560
},
{
"entropy": 0.994140625,
"epoch": 1.5812491458247915,
"grad_norm": 0.28139846303031246,
"learning_rate": 1.0796815555868678e-06,
"loss": 0.7067,
"mean_token_accuracy": 0.8100542783737182,
"num_tokens": 1157885137.0,
"step": 11570
},
{
"entropy": 0.99296875,
"epoch": 1.5826158261582615,
"grad_norm": 0.2644686425106775,
"learning_rate": 1.076158940397351e-06,
"loss": 0.7078,
"mean_token_accuracy": 0.807152795791626,
"num_tokens": 1158890096.0,
"step": 11580
},
{
"entropy": 0.969921875,
"epoch": 1.5839825064917314,
"grad_norm": 0.2635076146261175,
"learning_rate": 1.0726363252078344e-06,
"loss": 0.7094,
"mean_token_accuracy": 0.8092429935932159,
"num_tokens": 1159846658.0,
"step": 11590
},
{
"entropy": 0.91484375,
"epoch": 1.5853491868252014,
"grad_norm": 0.28462137881717,
"learning_rate": 1.0691137100183178e-06,
"loss": 0.6279,
"mean_token_accuracy": 0.8270858347415924,
"num_tokens": 1160838561.0,
"step": 11600
},
{
"entropy": 0.928125,
"epoch": 1.5867158671586716,
"grad_norm": 0.29202819092665944,
"learning_rate": 1.065591094828801e-06,
"loss": 0.6998,
"mean_token_accuracy": 0.8101280152797699,
"num_tokens": 1161897074.0,
"step": 11610
},
{
"entropy": 0.952734375,
"epoch": 1.5880825474921416,
"grad_norm": 0.29365425040555937,
"learning_rate": 1.0620684796392842e-06,
"loss": 0.6564,
"mean_token_accuracy": 0.8173795819282532,
"num_tokens": 1162836144.0,
"step": 11620
},
{
"entropy": 0.9140625,
"epoch": 1.5894492278256116,
"grad_norm": 0.2945493440241493,
"learning_rate": 1.0585458644497676e-06,
"loss": 0.6394,
"mean_token_accuracy": 0.8229735136032105,
"num_tokens": 1163803783.0,
"step": 11630
},
{
"entropy": 0.98125,
"epoch": 1.5908159081590816,
"grad_norm": 0.26602262837380025,
"learning_rate": 1.0550232492602509e-06,
"loss": 0.6931,
"mean_token_accuracy": 0.810479998588562,
"num_tokens": 1164789119.0,
"step": 11640
},
{
"entropy": 0.9859375,
"epoch": 1.5921825884925516,
"grad_norm": 0.27234131146584944,
"learning_rate": 1.0515006340707342e-06,
"loss": 0.6895,
"mean_token_accuracy": 0.8116123497486114,
"num_tokens": 1165766661.0,
"step": 11650
},
{
"entropy": 0.928515625,
"epoch": 1.5935492688260215,
"grad_norm": 0.3101607531564019,
"learning_rate": 1.0479780188812176e-06,
"loss": 0.6612,
"mean_token_accuracy": 0.8184740781784058,
"num_tokens": 1166714400.0,
"step": 11660
},
{
"entropy": 0.953515625,
"epoch": 1.5949159491594918,
"grad_norm": 0.27976768377792566,
"learning_rate": 1.0444554036917009e-06,
"loss": 0.6824,
"mean_token_accuracy": 0.8126484036445618,
"num_tokens": 1167724315.0,
"step": 11670
},
{
"entropy": 0.96640625,
"epoch": 1.5962826294929617,
"grad_norm": 0.27442204372842616,
"learning_rate": 1.0409327885021842e-06,
"loss": 0.6895,
"mean_token_accuracy": 0.8100772738456726,
"num_tokens": 1168744110.0,
"step": 11680
},
{
"entropy": 0.93203125,
"epoch": 1.5976493098264317,
"grad_norm": 0.30474765790990366,
"learning_rate": 1.0374101733126674e-06,
"loss": 0.6636,
"mean_token_accuracy": 0.818517130613327,
"num_tokens": 1169739567.0,
"step": 11690
},
{
"entropy": 0.922265625,
"epoch": 1.5990159901599017,
"grad_norm": 0.3320126335347854,
"learning_rate": 1.0338875581231507e-06,
"loss": 0.6558,
"mean_token_accuracy": 0.8188082218170166,
"num_tokens": 1170678500.0,
"step": 11700
},
{
"entropy": 0.984765625,
"epoch": 1.6003826704933717,
"grad_norm": 0.2964972235482017,
"learning_rate": 1.030364942933634e-06,
"loss": 0.714,
"mean_token_accuracy": 0.806060379743576,
"num_tokens": 1171654365.0,
"step": 11710
},
{
"entropy": 0.97265625,
"epoch": 1.6017493508268417,
"grad_norm": 0.2567809407253125,
"learning_rate": 1.0268423277441174e-06,
"loss": 0.6803,
"mean_token_accuracy": 0.8141233325004578,
"num_tokens": 1172617824.0,
"step": 11720
},
{
"entropy": 0.96171875,
"epoch": 1.6031160311603116,
"grad_norm": 0.3110484796964306,
"learning_rate": 1.0233197125546005e-06,
"loss": 0.689,
"mean_token_accuracy": 0.8123758792877197,
"num_tokens": 1173559869.0,
"step": 11730
},
{
"entropy": 0.965234375,
"epoch": 1.6044827114937816,
"grad_norm": 0.29442437895068024,
"learning_rate": 1.0197970973650838e-06,
"loss": 0.6695,
"mean_token_accuracy": 0.8156198382377624,
"num_tokens": 1174562880.0,
"step": 11740
},
{
"entropy": 0.95703125,
"epoch": 1.6058493918272516,
"grad_norm": 0.315213676679525,
"learning_rate": 1.0162744821755674e-06,
"loss": 0.7027,
"mean_token_accuracy": 0.8097061574459076,
"num_tokens": 1175582329.0,
"step": 11750
},
{
"entropy": 0.94765625,
"epoch": 1.6072160721607216,
"grad_norm": 0.285197211399237,
"learning_rate": 1.0127518669860505e-06,
"loss": 0.655,
"mean_token_accuracy": 0.819940572977066,
"num_tokens": 1176571463.0,
"step": 11760
},
{
"entropy": 0.986328125,
"epoch": 1.6085827524941916,
"grad_norm": 0.3137799458645512,
"learning_rate": 1.0092292517965338e-06,
"loss": 0.7082,
"mean_token_accuracy": 0.8085499465465545,
"num_tokens": 1177603350.0,
"step": 11770
},
{
"entropy": 0.9671875,
"epoch": 1.6099494328276616,
"grad_norm": 0.28482385636229635,
"learning_rate": 1.0057066366070172e-06,
"loss": 0.6815,
"mean_token_accuracy": 0.8149292826652527,
"num_tokens": 1178602301.0,
"step": 11780
},
{
"entropy": 0.930078125,
"epoch": 1.6113161131611315,
"grad_norm": 0.2951053233392241,
"learning_rate": 1.0021840214175005e-06,
"loss": 0.6664,
"mean_token_accuracy": 0.818078076839447,
"num_tokens": 1179589154.0,
"step": 11790
},
{
"entropy": 0.96796875,
"epoch": 1.6126827934946015,
"grad_norm": 0.31121963395183605,
"learning_rate": 9.986614062279836e-07,
"loss": 0.6928,
"mean_token_accuracy": 0.8129242658615112,
"num_tokens": 1180600360.0,
"step": 11800
},
{
"entropy": 0.918359375,
"epoch": 1.6140494738280715,
"grad_norm": 0.27874544995790024,
"learning_rate": 9.95138791038467e-07,
"loss": 0.6536,
"mean_token_accuracy": 0.8193086326122284,
"num_tokens": 1181606919.0,
"step": 11810
},
{
"entropy": 0.93515625,
"epoch": 1.6154161541615415,
"grad_norm": 0.2931347175932959,
"learning_rate": 9.916161758489503e-07,
"loss": 0.6461,
"mean_token_accuracy": 0.8230086684226989,
"num_tokens": 1182605366.0,
"step": 11820
},
{
"entropy": 0.953125,
"epoch": 1.6167828344950115,
"grad_norm": 0.29364158533239604,
"learning_rate": 9.880935606594336e-07,
"loss": 0.6707,
"mean_token_accuracy": 0.8171718001365662,
"num_tokens": 1183673571.0,
"step": 11830
},
{
"entropy": 0.9515625,
"epoch": 1.6181495148284815,
"grad_norm": 0.2661531109510684,
"learning_rate": 9.84570945469917e-07,
"loss": 0.6656,
"mean_token_accuracy": 0.8189640760421752,
"num_tokens": 1184672054.0,
"step": 11840
},
{
"entropy": 0.95859375,
"epoch": 1.6195161951619517,
"grad_norm": 0.2827824617368549,
"learning_rate": 9.810483302804003e-07,
"loss": 0.6573,
"mean_token_accuracy": 0.8185723781585693,
"num_tokens": 1185671748.0,
"step": 11850
},
{
"entropy": 0.948046875,
"epoch": 1.6208828754954216,
"grad_norm": 0.288339859893156,
"learning_rate": 9.775257150908836e-07,
"loss": 0.6699,
"mean_token_accuracy": 0.8159129083156585,
"num_tokens": 1186650051.0,
"step": 11860
},
{
"entropy": 0.95625,
"epoch": 1.6222495558288916,
"grad_norm": 0.28772441762515094,
"learning_rate": 9.740030999013668e-07,
"loss": 0.6847,
"mean_token_accuracy": 0.8138026773929596,
"num_tokens": 1187625175.0,
"step": 11870
},
{
"entropy": 0.931640625,
"epoch": 1.6236162361623616,
"grad_norm": 0.27599759356776526,
"learning_rate": 9.7048048471185e-07,
"loss": 0.6638,
"mean_token_accuracy": 0.8168847560882568,
"num_tokens": 1188594146.0,
"step": 11880
},
{
"entropy": 0.96875,
"epoch": 1.6249829164958316,
"grad_norm": 0.26727579639874394,
"learning_rate": 9.669578695223334e-07,
"loss": 0.7105,
"mean_token_accuracy": 0.8071983754634857,
"num_tokens": 1189612533.0,
"step": 11890
},
{
"entropy": 0.960546875,
"epoch": 1.6263495968293016,
"grad_norm": 0.3225277444180693,
"learning_rate": 9.634352543328168e-07,
"loss": 0.6936,
"mean_token_accuracy": 0.8102520287036896,
"num_tokens": 1190580400.0,
"step": 11900
},
{
"entropy": 0.953125,
"epoch": 1.6277162771627718,
"grad_norm": 0.31287971136677006,
"learning_rate": 9.599126391433e-07,
"loss": 0.6631,
"mean_token_accuracy": 0.818117868900299,
"num_tokens": 1191586787.0,
"step": 11910
},
{
"entropy": 0.96875,
"epoch": 1.6290829574962418,
"grad_norm": 0.29527790899253137,
"learning_rate": 9.563900239537834e-07,
"loss": 0.6886,
"mean_token_accuracy": 0.8111729979515075,
"num_tokens": 1192578364.0,
"step": 11920
},
{
"entropy": 0.934375,
"epoch": 1.6304496378297118,
"grad_norm": 0.3113797151982854,
"learning_rate": 9.528674087642667e-07,
"loss": 0.6689,
"mean_token_accuracy": 0.8154932379722595,
"num_tokens": 1193601099.0,
"step": 11930
},
{
"entropy": 0.91796875,
"epoch": 1.6318163181631817,
"grad_norm": 0.2932700705733631,
"learning_rate": 9.4934479357475e-07,
"loss": 0.6471,
"mean_token_accuracy": 0.822374951839447,
"num_tokens": 1194615552.0,
"step": 11940
},
{
"entropy": 0.976171875,
"epoch": 1.6331829984966517,
"grad_norm": 0.2760717915901419,
"learning_rate": 9.458221783852332e-07,
"loss": 0.7105,
"mean_token_accuracy": 0.806237804889679,
"num_tokens": 1195661648.0,
"step": 11950
},
{
"entropy": 0.952734375,
"epoch": 1.6345496788301217,
"grad_norm": 0.29630058058137504,
"learning_rate": 9.422995631957166e-07,
"loss": 0.694,
"mean_token_accuracy": 0.8113204002380371,
"num_tokens": 1196611904.0,
"step": 11960
},
{
"entropy": 0.985546875,
"epoch": 1.6359163591635917,
"grad_norm": 0.31837862330232636,
"learning_rate": 9.387769480061999e-07,
"loss": 0.7159,
"mean_token_accuracy": 0.808042848110199,
"num_tokens": 1197598162.0,
"step": 11970
},
{
"entropy": 0.96640625,
"epoch": 1.6372830394970617,
"grad_norm": 0.2821485329025271,
"learning_rate": 9.352543328166831e-07,
"loss": 0.678,
"mean_token_accuracy": 0.813898766040802,
"num_tokens": 1198636269.0,
"step": 11980
},
{
"entropy": 0.95234375,
"epoch": 1.6386497198305316,
"grad_norm": 0.263128404796652,
"learning_rate": 9.317317176271665e-07,
"loss": 0.6792,
"mean_token_accuracy": 0.8156857550144195,
"num_tokens": 1199590978.0,
"step": 11990
},
{
"entropy": 0.977734375,
"epoch": 1.6400164001640016,
"grad_norm": 0.2872225603685282,
"learning_rate": 9.282091024376498e-07,
"loss": 0.7192,
"mean_token_accuracy": 0.8052062094211578,
"num_tokens": 1200657756.0,
"step": 12000
},
{
"entropy": 0.995703125,
"epoch": 1.6413830804974716,
"grad_norm": 0.3262803329625042,
"learning_rate": 9.246864872481331e-07,
"loss": 0.7291,
"mean_token_accuracy": 0.8008998274803162,
"num_tokens": 1201625479.0,
"step": 12010
},
{
"entropy": 0.959765625,
"epoch": 1.6427497608309416,
"grad_norm": 0.2947145531658441,
"learning_rate": 9.211638720586164e-07,
"loss": 0.6813,
"mean_token_accuracy": 0.8128631472587585,
"num_tokens": 1202578801.0,
"step": 12020
},
{
"entropy": 0.946484375,
"epoch": 1.6441164411644116,
"grad_norm": 0.31729537963304766,
"learning_rate": 9.176412568690997e-07,
"loss": 0.6736,
"mean_token_accuracy": 0.8145003080368042,
"num_tokens": 1203570618.0,
"step": 12030
},
{
"entropy": 0.969921875,
"epoch": 1.6454831214978816,
"grad_norm": 0.3129185823629265,
"learning_rate": 9.14118641679583e-07,
"loss": 0.7132,
"mean_token_accuracy": 0.8067926824092865,
"num_tokens": 1204596821.0,
"step": 12040
},
{
"entropy": 0.928125,
"epoch": 1.6468498018313515,
"grad_norm": 0.30491304672870306,
"learning_rate": 9.105960264900663e-07,
"loss": 0.7039,
"mean_token_accuracy": 0.8078561544418335,
"num_tokens": 1205542592.0,
"step": 12050
},
{
"entropy": 0.956640625,
"epoch": 1.6482164821648215,
"grad_norm": 0.2996312321611244,
"learning_rate": 9.070734113005496e-07,
"loss": 0.6837,
"mean_token_accuracy": 0.8155470192432404,
"num_tokens": 1206585474.0,
"step": 12060
},
{
"entropy": 1.022265625,
"epoch": 1.6495831624982915,
"grad_norm": 0.2964795199708766,
"learning_rate": 9.035507961110329e-07,
"loss": 0.7247,
"mean_token_accuracy": 0.8048866569995881,
"num_tokens": 1207563707.0,
"step": 12070
},
{
"entropy": 0.940234375,
"epoch": 1.6509498428317615,
"grad_norm": 0.29709122174456987,
"learning_rate": 9.000281809215163e-07,
"loss": 0.6651,
"mean_token_accuracy": 0.8173363387584687,
"num_tokens": 1208556252.0,
"step": 12080
},
{
"entropy": 0.935546875,
"epoch": 1.6523165231652317,
"grad_norm": 0.306657090555171,
"learning_rate": 8.965055657319995e-07,
"loss": 0.6709,
"mean_token_accuracy": 0.816289222240448,
"num_tokens": 1209554358.0,
"step": 12090
},
{
"entropy": 0.940625,
"epoch": 1.6536832034987017,
"grad_norm": 0.2558305869812971,
"learning_rate": 8.929829505424828e-07,
"loss": 0.6784,
"mean_token_accuracy": 0.8163156926631927,
"num_tokens": 1210557665.0,
"step": 12100
},
{
"entropy": 0.9328125,
"epoch": 1.6550498838321717,
"grad_norm": 0.31222682939537694,
"learning_rate": 8.894603353529662e-07,
"loss": 0.6546,
"mean_token_accuracy": 0.8194411396980286,
"num_tokens": 1211549288.0,
"step": 12110
},
{
"entropy": 0.921875,
"epoch": 1.6564165641656416,
"grad_norm": 0.2741605333549923,
"learning_rate": 8.859377201634495e-07,
"loss": 0.6525,
"mean_token_accuracy": 0.8197455883026123,
"num_tokens": 1212591886.0,
"step": 12120
},
{
"entropy": 1.0109375,
"epoch": 1.6577832444991116,
"grad_norm": 0.28122039792976766,
"learning_rate": 8.824151049739326e-07,
"loss": 0.7267,
"mean_token_accuracy": 0.8027827858924865,
"num_tokens": 1213604606.0,
"step": 12130
},
{
"entropy": 0.923046875,
"epoch": 1.6591499248325816,
"grad_norm": 0.28699142843147113,
"learning_rate": 8.788924897844161e-07,
"loss": 0.6586,
"mean_token_accuracy": 0.819378662109375,
"num_tokens": 1214642551.0,
"step": 12140
},
{
"entropy": 0.9328125,
"epoch": 1.6605166051660518,
"grad_norm": 0.29843723397704236,
"learning_rate": 8.753698745948994e-07,
"loss": 0.6544,
"mean_token_accuracy": 0.8184885025024414,
"num_tokens": 1215673969.0,
"step": 12150
},
{
"entropy": 0.947265625,
"epoch": 1.6618832854995218,
"grad_norm": 0.29661589761556895,
"learning_rate": 8.718472594053825e-07,
"loss": 0.6562,
"mean_token_accuracy": 0.8188338875770569,
"num_tokens": 1216619775.0,
"step": 12160
},
{
"entropy": 0.940625,
"epoch": 1.6632499658329918,
"grad_norm": 0.30289626638904305,
"learning_rate": 8.683246442158659e-07,
"loss": 0.6979,
"mean_token_accuracy": 0.8112825691699982,
"num_tokens": 1217597835.0,
"step": 12170
},
{
"entropy": 0.91953125,
"epoch": 1.6646166461664618,
"grad_norm": 0.27920147710373105,
"learning_rate": 8.648020290263492e-07,
"loss": 0.6548,
"mean_token_accuracy": 0.8196993350982666,
"num_tokens": 1218556074.0,
"step": 12180
},
{
"entropy": 0.980078125,
"epoch": 1.6659833264999317,
"grad_norm": 0.34930601522016586,
"learning_rate": 8.612794138368325e-07,
"loss": 0.6786,
"mean_token_accuracy": 0.8149687886238098,
"num_tokens": 1219563177.0,
"step": 12190
},
{
"entropy": 0.975390625,
"epoch": 1.6673500068334017,
"grad_norm": 0.3130164318027331,
"learning_rate": 8.577567986473158e-07,
"loss": 0.6746,
"mean_token_accuracy": 0.8161727547645569,
"num_tokens": 1220525706.0,
"step": 12200
},
{
"entropy": 0.938671875,
"epoch": 1.6687166871668717,
"grad_norm": 0.3190207237237475,
"learning_rate": 8.542341834577991e-07,
"loss": 0.6676,
"mean_token_accuracy": 0.8177051067352294,
"num_tokens": 1221509657.0,
"step": 12210
},
{
"entropy": 0.94609375,
"epoch": 1.6700833675003417,
"grad_norm": 0.3031932098608727,
"learning_rate": 8.507115682682824e-07,
"loss": 0.6882,
"mean_token_accuracy": 0.8133323729038239,
"num_tokens": 1222483747.0,
"step": 12220
},
{
"entropy": 0.9890625,
"epoch": 1.6714500478338117,
"grad_norm": 0.3050579523821471,
"learning_rate": 8.471889530787658e-07,
"loss": 0.7219,
"mean_token_accuracy": 0.8060116112232208,
"num_tokens": 1223511420.0,
"step": 12230
},
{
"entropy": 0.942578125,
"epoch": 1.6728167281672817,
"grad_norm": 0.29464977286282173,
"learning_rate": 8.43666337889249e-07,
"loss": 0.6658,
"mean_token_accuracy": 0.8169981420040131,
"num_tokens": 1224496559.0,
"step": 12240
},
{
"entropy": 0.965234375,
"epoch": 1.6741834085007516,
"grad_norm": 0.26839674233224076,
"learning_rate": 8.401437226997323e-07,
"loss": 0.6871,
"mean_token_accuracy": 0.8124606788158417,
"num_tokens": 1225517907.0,
"step": 12250
},
{
"entropy": 0.9625,
"epoch": 1.6755500888342216,
"grad_norm": 0.3029102327956047,
"learning_rate": 8.366211075102157e-07,
"loss": 0.6748,
"mean_token_accuracy": 0.8154053449630737,
"num_tokens": 1226443690.0,
"step": 12260
},
{
"entropy": 0.957421875,
"epoch": 1.6769167691676916,
"grad_norm": 0.3095425382447997,
"learning_rate": 8.330984923206989e-07,
"loss": 0.6701,
"mean_token_accuracy": 0.8168522834777832,
"num_tokens": 1227466312.0,
"step": 12270
},
{
"entropy": 0.983984375,
"epoch": 1.6782834495011616,
"grad_norm": 0.2982430991209532,
"learning_rate": 8.295758771311822e-07,
"loss": 0.6917,
"mean_token_accuracy": 0.8109732449054718,
"num_tokens": 1228400415.0,
"step": 12280
},
{
"entropy": 0.973046875,
"epoch": 1.6796501298346316,
"grad_norm": 0.2560640124618978,
"learning_rate": 8.260532619416656e-07,
"loss": 0.7005,
"mean_token_accuracy": 0.8093669772148132,
"num_tokens": 1229369061.0,
"step": 12290
},
{
"entropy": 0.943359375,
"epoch": 1.6810168101681016,
"grad_norm": 0.2812871290489496,
"learning_rate": 8.225306467521489e-07,
"loss": 0.6561,
"mean_token_accuracy": 0.82002472281456,
"num_tokens": 1230368442.0,
"step": 12300
},
{
"entropy": 0.9796875,
"epoch": 1.6823834905015715,
"grad_norm": 0.2830151010110312,
"learning_rate": 8.190080315626321e-07,
"loss": 0.69,
"mean_token_accuracy": 0.8120650947093964,
"num_tokens": 1231332600.0,
"step": 12310
},
{
"entropy": 0.95390625,
"epoch": 1.6837501708350415,
"grad_norm": 0.2852933588077402,
"learning_rate": 8.154854163731155e-07,
"loss": 0.6787,
"mean_token_accuracy": 0.8150675177574158,
"num_tokens": 1232365140.0,
"step": 12320
},
{
"entropy": 0.95859375,
"epoch": 1.6851168511685117,
"grad_norm": 0.3208345874096138,
"learning_rate": 8.119628011835988e-07,
"loss": 0.6938,
"mean_token_accuracy": 0.8101266622543335,
"num_tokens": 1233345099.0,
"step": 12330
},
{
"entropy": 0.949609375,
"epoch": 1.6864835315019817,
"grad_norm": 0.29253818163229484,
"learning_rate": 8.084401859940821e-07,
"loss": 0.66,
"mean_token_accuracy": 0.8169808983802795,
"num_tokens": 1234317291.0,
"step": 12340
},
{
"entropy": 0.97890625,
"epoch": 1.6878502118354517,
"grad_norm": 0.3004118753103023,
"learning_rate": 8.049175708045654e-07,
"loss": 0.7057,
"mean_token_accuracy": 0.8085742771625519,
"num_tokens": 1235330069.0,
"step": 12350
},
{
"entropy": 0.910546875,
"epoch": 1.6892168921689217,
"grad_norm": 0.26441356273935523,
"learning_rate": 8.013949556150487e-07,
"loss": 0.6736,
"mean_token_accuracy": 0.8149102985858917,
"num_tokens": 1236278954.0,
"step": 12360
},
{
"entropy": 0.940234375,
"epoch": 1.6905835725023917,
"grad_norm": 0.2967019390729575,
"learning_rate": 7.97872340425532e-07,
"loss": 0.68,
"mean_token_accuracy": 0.8144925534725189,
"num_tokens": 1237283806.0,
"step": 12370
},
{
"entropy": 0.962109375,
"epoch": 1.6919502528358616,
"grad_norm": 0.35088585194646527,
"learning_rate": 7.943497252360153e-07,
"loss": 0.7118,
"mean_token_accuracy": 0.8067254483699798,
"num_tokens": 1238255669.0,
"step": 12380
},
{
"entropy": 0.965625,
"epoch": 1.6933169331693319,
"grad_norm": 0.297236568484737,
"learning_rate": 7.908271100464986e-07,
"loss": 0.7391,
"mean_token_accuracy": 0.7997359216213227,
"num_tokens": 1239290900.0,
"step": 12390
},
{
"entropy": 0.953125,
"epoch": 1.6946836135028018,
"grad_norm": 0.34716995187787314,
"learning_rate": 7.873044948569819e-07,
"loss": 0.6809,
"mean_token_accuracy": 0.8143337726593017,
"num_tokens": 1240288490.0,
"step": 12400
},
{
"entropy": 0.989453125,
"epoch": 1.6960502938362718,
"grad_norm": 0.26820799887749447,
"learning_rate": 7.837818796674653e-07,
"loss": 0.6886,
"mean_token_accuracy": 0.8128128707408905,
"num_tokens": 1241290636.0,
"step": 12410
},
{
"entropy": 0.947265625,
"epoch": 1.6974169741697418,
"grad_norm": 0.32705093504244903,
"learning_rate": 7.802592644779484e-07,
"loss": 0.6553,
"mean_token_accuracy": 0.8179016888141633,
"num_tokens": 1242335573.0,
"step": 12420
},
{
"entropy": 0.962109375,
"epoch": 1.6987836545032118,
"grad_norm": 0.298591030451164,
"learning_rate": 7.767366492884317e-07,
"loss": 0.6864,
"mean_token_accuracy": 0.8118829190731048,
"num_tokens": 1243320695.0,
"step": 12430
},
{
"entropy": 0.9625,
"epoch": 1.7001503348366818,
"grad_norm": 0.3324556513377019,
"learning_rate": 7.732140340989152e-07,
"loss": 0.6937,
"mean_token_accuracy": 0.8106046140193939,
"num_tokens": 1244361117.0,
"step": 12440
},
{
"entropy": 0.953125,
"epoch": 1.7015170151701517,
"grad_norm": 0.3217260850763227,
"learning_rate": 7.696914189093985e-07,
"loss": 0.6672,
"mean_token_accuracy": 0.8176872313022614,
"num_tokens": 1245361248.0,
"step": 12450
},
{
"entropy": 0.94609375,
"epoch": 1.7028836955036217,
"grad_norm": 0.2541907309705735,
"learning_rate": 7.661688037198816e-07,
"loss": 0.6819,
"mean_token_accuracy": 0.8133838295936584,
"num_tokens": 1246373180.0,
"step": 12460
},
{
"entropy": 0.927734375,
"epoch": 1.7042503758370917,
"grad_norm": 0.2772390867190836,
"learning_rate": 7.62646188530365e-07,
"loss": 0.6384,
"mean_token_accuracy": 0.8229822933673858,
"num_tokens": 1247358000.0,
"step": 12470
},
{
"entropy": 0.919140625,
"epoch": 1.7056170561705617,
"grad_norm": 0.27021129099309005,
"learning_rate": 7.591235733408483e-07,
"loss": 0.6539,
"mean_token_accuracy": 0.8197616815567017,
"num_tokens": 1248369118.0,
"step": 12480
},
{
"entropy": 0.9140625,
"epoch": 1.7069837365040317,
"grad_norm": 0.3078074626265057,
"learning_rate": 7.556009581513315e-07,
"loss": 0.6552,
"mean_token_accuracy": 0.8187657952308655,
"num_tokens": 1249365813.0,
"step": 12490
},
{
"entropy": 0.9140625,
"epoch": 1.7083504168375017,
"grad_norm": 0.3175123417852976,
"learning_rate": 7.520783429618149e-07,
"loss": 0.6359,
"mean_token_accuracy": 0.8241020441055298,
"num_tokens": 1250403248.0,
"step": 12500
},
{
"entropy": 0.93671875,
"epoch": 1.7097170971709716,
"grad_norm": 0.29609347250928414,
"learning_rate": 7.485557277722982e-07,
"loss": 0.6788,
"mean_token_accuracy": 0.8159572005271911,
"num_tokens": 1251407666.0,
"step": 12510
},
{
"entropy": 0.962890625,
"epoch": 1.7110837775044416,
"grad_norm": 0.27237706271506895,
"learning_rate": 7.450331125827815e-07,
"loss": 0.6899,
"mean_token_accuracy": 0.8115748167037964,
"num_tokens": 1252413446.0,
"step": 12520
},
{
"entropy": 0.984765625,
"epoch": 1.7124504578379116,
"grad_norm": 0.30592134684873473,
"learning_rate": 7.415104973932648e-07,
"loss": 0.6935,
"mean_token_accuracy": 0.809867125749588,
"num_tokens": 1253419895.0,
"step": 12530
},
{
"entropy": 0.928515625,
"epoch": 1.7138171381713816,
"grad_norm": 0.3019976208571218,
"learning_rate": 7.379878822037481e-07,
"loss": 0.637,
"mean_token_accuracy": 0.8223022997379303,
"num_tokens": 1254356254.0,
"step": 12540
},
{
"entropy": 1.0078125,
"epoch": 1.7151838185048516,
"grad_norm": 0.3093481038692815,
"learning_rate": 7.344652670142314e-07,
"loss": 0.7185,
"mean_token_accuracy": 0.80509432554245,
"num_tokens": 1255353127.0,
"step": 12550
},
{
"entropy": 0.958984375,
"epoch": 1.7165504988383216,
"grad_norm": 0.32523210339441655,
"learning_rate": 7.309426518247147e-07,
"loss": 0.6933,
"mean_token_accuracy": 0.8113586902618408,
"num_tokens": 1256385439.0,
"step": 12560
},
{
"entropy": 0.954296875,
"epoch": 1.7179171791717918,
"grad_norm": 0.2874953348205346,
"learning_rate": 7.27420036635198e-07,
"loss": 0.6863,
"mean_token_accuracy": 0.8127159833908081,
"num_tokens": 1257359806.0,
"step": 12570
},
{
"entropy": 0.9609375,
"epoch": 1.7192838595052617,
"grad_norm": 0.29077021885437476,
"learning_rate": 7.238974214456813e-07,
"loss": 0.69,
"mean_token_accuracy": 0.8104073584079743,
"num_tokens": 1258395792.0,
"step": 12580
},
{
"entropy": 0.960546875,
"epoch": 1.7206505398387317,
"grad_norm": 0.30896935778146073,
"learning_rate": 7.203748062561647e-07,
"loss": 0.6564,
"mean_token_accuracy": 0.82052041888237,
"num_tokens": 1259465597.0,
"step": 12590
},
{
"entropy": 0.958984375,
"epoch": 1.7220172201722017,
"grad_norm": 0.28627014421359076,
"learning_rate": 7.168521910666479e-07,
"loss": 0.7054,
"mean_token_accuracy": 0.8104158580303192,
"num_tokens": 1260458869.0,
"step": 12600
},
{
"entropy": 0.94140625,
"epoch": 1.7233839005056717,
"grad_norm": 0.3186268428176663,
"learning_rate": 7.133295758771312e-07,
"loss": 0.6991,
"mean_token_accuracy": 0.8096955835819244,
"num_tokens": 1261455673.0,
"step": 12610
},
{
"entropy": 0.926171875,
"epoch": 1.7247505808391417,
"grad_norm": 0.3033416120514264,
"learning_rate": 7.098069606876146e-07,
"loss": 0.6792,
"mean_token_accuracy": 0.8144218921661377,
"num_tokens": 1262452225.0,
"step": 12620
},
{
"entropy": 0.930078125,
"epoch": 1.7261172611726119,
"grad_norm": 0.3627801527011082,
"learning_rate": 7.062843454980979e-07,
"loss": 0.6566,
"mean_token_accuracy": 0.8210394442081451,
"num_tokens": 1263423599.0,
"step": 12630
},
{
"entropy": 0.94765625,
"epoch": 1.7274839415060819,
"grad_norm": 0.26062285721716266,
"learning_rate": 7.027617303085811e-07,
"loss": 0.6716,
"mean_token_accuracy": 0.8171436488628387,
"num_tokens": 1264437915.0,
"step": 12640
},
{
"entropy": 0.958203125,
"epoch": 1.7288506218395518,
"grad_norm": 0.29087326944813735,
"learning_rate": 6.992391151190645e-07,
"loss": 0.6608,
"mean_token_accuracy": 0.8190978586673736,
"num_tokens": 1265448913.0,
"step": 12650
},
{
"entropy": 0.973046875,
"epoch": 1.7302173021730218,
"grad_norm": 0.3385065825737022,
"learning_rate": 6.957164999295478e-07,
"loss": 0.6935,
"mean_token_accuracy": 0.8097854077816009,
"num_tokens": 1266405679.0,
"step": 12660
},
{
"entropy": 0.943359375,
"epoch": 1.7315839825064918,
"grad_norm": 0.3152442551861355,
"learning_rate": 6.921938847400309e-07,
"loss": 0.6972,
"mean_token_accuracy": 0.8082027554512023,
"num_tokens": 1267365497.0,
"step": 12670
},
{
"entropy": 0.9609375,
"epoch": 1.7329506628399618,
"grad_norm": 0.3016513627011444,
"learning_rate": 6.886712695505144e-07,
"loss": 0.6894,
"mean_token_accuracy": 0.8135842204093933,
"num_tokens": 1268399851.0,
"step": 12680
},
{
"entropy": 0.994921875,
"epoch": 1.7343173431734318,
"grad_norm": 0.2876351875894763,
"learning_rate": 6.851486543609977e-07,
"loss": 0.7151,
"mean_token_accuracy": 0.8063938856124878,
"num_tokens": 1269408675.0,
"step": 12690
},
{
"entropy": 0.9703125,
"epoch": 1.7356840235069018,
"grad_norm": 0.2787565895740805,
"learning_rate": 6.816260391714811e-07,
"loss": 0.6865,
"mean_token_accuracy": 0.811514800786972,
"num_tokens": 1270396370.0,
"step": 12700
},
{
"entropy": 0.97109375,
"epoch": 1.7370507038403717,
"grad_norm": 0.30635691615121136,
"learning_rate": 6.781034239819642e-07,
"loss": 0.7002,
"mean_token_accuracy": 0.809379768371582,
"num_tokens": 1271394992.0,
"step": 12710
},
{
"entropy": 0.95234375,
"epoch": 1.7384173841738417,
"grad_norm": 0.33210693964533794,
"learning_rate": 6.745808087924475e-07,
"loss": 0.6668,
"mean_token_accuracy": 0.8156892538070679,
"num_tokens": 1272386483.0,
"step": 12720
},
{
"entropy": 0.980859375,
"epoch": 1.7397840645073117,
"grad_norm": 0.31230468635622144,
"learning_rate": 6.710581936029308e-07,
"loss": 0.6814,
"mean_token_accuracy": 0.8124064445495606,
"num_tokens": 1273372646.0,
"step": 12730
},
{
"entropy": 0.94296875,
"epoch": 1.7411507448407817,
"grad_norm": 0.30138446996249363,
"learning_rate": 6.675355784134143e-07,
"loss": 0.6704,
"mean_token_accuracy": 0.8157059490680695,
"num_tokens": 1274412839.0,
"step": 12740
},
{
"entropy": 0.963671875,
"epoch": 1.7425174251742517,
"grad_norm": 0.3060203500948367,
"learning_rate": 6.640129632238974e-07,
"loss": 0.6696,
"mean_token_accuracy": 0.817859661579132,
"num_tokens": 1275411093.0,
"step": 12750
},
{
"entropy": 0.976953125,
"epoch": 1.7438841055077217,
"grad_norm": 0.2798678400875142,
"learning_rate": 6.604903480343807e-07,
"loss": 0.6735,
"mean_token_accuracy": 0.8137092113494873,
"num_tokens": 1276433218.0,
"step": 12760
},
{
"entropy": 0.937109375,
"epoch": 1.7452507858411916,
"grad_norm": 0.3410294368989147,
"learning_rate": 6.569677328448641e-07,
"loss": 0.6717,
"mean_token_accuracy": 0.8172415614128112,
"num_tokens": 1277399684.0,
"step": 12770
},
{
"entropy": 0.921875,
"epoch": 1.7466174661746616,
"grad_norm": 0.2814250002089954,
"learning_rate": 6.534451176553473e-07,
"loss": 0.6624,
"mean_token_accuracy": 0.8200752973556519,
"num_tokens": 1278391488.0,
"step": 12780
},
{
"entropy": 0.941015625,
"epoch": 1.7479841465081316,
"grad_norm": 0.3006767483456671,
"learning_rate": 6.499225024658306e-07,
"loss": 0.6871,
"mean_token_accuracy": 0.8132468819618225,
"num_tokens": 1279414925.0,
"step": 12790
},
{
"entropy": 0.939453125,
"epoch": 1.7493508268416016,
"grad_norm": 0.2694479609387882,
"learning_rate": 6.46399887276314e-07,
"loss": 0.656,
"mean_token_accuracy": 0.8192197322845459,
"num_tokens": 1280366866.0,
"step": 12800
},
{
"entropy": 1.00546875,
"epoch": 1.7507175071750718,
"grad_norm": 0.3446443491363421,
"learning_rate": 6.428772720867973e-07,
"loss": 0.712,
"mean_token_accuracy": 0.8066006302833557,
"num_tokens": 1281340884.0,
"step": 12810
},
{
"entropy": 0.958203125,
"epoch": 1.7520841875085418,
"grad_norm": 0.2919748736402774,
"learning_rate": 6.393546568972805e-07,
"loss": 0.6584,
"mean_token_accuracy": 0.8181030213832855,
"num_tokens": 1282309544.0,
"step": 12820
},
{
"entropy": 0.975,
"epoch": 1.7534508678420118,
"grad_norm": 0.2845252473843512,
"learning_rate": 6.358320417077639e-07,
"loss": 0.69,
"mean_token_accuracy": 0.8129602193832397,
"num_tokens": 1283296117.0,
"step": 12830
},
{
"entropy": 0.934375,
"epoch": 1.7548175481754817,
"grad_norm": 0.2844292995315694,
"learning_rate": 6.323094265182472e-07,
"loss": 0.647,
"mean_token_accuracy": 0.8192410409450531,
"num_tokens": 1284253172.0,
"step": 12840
},
{
"entropy": 0.921484375,
"epoch": 1.7561842285089517,
"grad_norm": 0.27514127257903376,
"learning_rate": 6.287868113287306e-07,
"loss": 0.6505,
"mean_token_accuracy": 0.819699090719223,
"num_tokens": 1285293723.0,
"step": 12850
},
{
"entropy": 0.934765625,
"epoch": 1.7575509088424217,
"grad_norm": 0.3015891787513295,
"learning_rate": 6.252641961392138e-07,
"loss": 0.6746,
"mean_token_accuracy": 0.8141245126724244,
"num_tokens": 1286315895.0,
"step": 12860
},
{
"entropy": 0.897265625,
"epoch": 1.758917589175892,
"grad_norm": 0.266046428026834,
"learning_rate": 6.217415809496971e-07,
"loss": 0.6456,
"mean_token_accuracy": 0.8212654829025269,
"num_tokens": 1287326679.0,
"step": 12870
},
{
"entropy": 0.971875,
"epoch": 1.760284269509362,
"grad_norm": 0.3031426686405537,
"learning_rate": 6.182189657601804e-07,
"loss": 0.7122,
"mean_token_accuracy": 0.8080865621566773,
"num_tokens": 1288355321.0,
"step": 12880
},
{
"entropy": 0.95078125,
"epoch": 1.7616509498428319,
"grad_norm": 0.31787825080360094,
"learning_rate": 6.146963505706637e-07,
"loss": 0.6753,
"mean_token_accuracy": 0.8150774657726287,
"num_tokens": 1289342451.0,
"step": 12890
},
{
"entropy": 0.9578125,
"epoch": 1.7630176301763019,
"grad_norm": 0.28135143267174745,
"learning_rate": 6.11173735381147e-07,
"loss": 0.7041,
"mean_token_accuracy": 0.8101069331169128,
"num_tokens": 1290306232.0,
"step": 12900
},
{
"entropy": 0.96171875,
"epoch": 1.7643843105097718,
"grad_norm": 0.2784737508253953,
"learning_rate": 6.076511201916304e-07,
"loss": 0.7054,
"mean_token_accuracy": 0.8085472047328949,
"num_tokens": 1291292043.0,
"step": 12910
},
{
"entropy": 0.9609375,
"epoch": 1.7657509908432418,
"grad_norm": 0.34377919237919846,
"learning_rate": 6.041285050021136e-07,
"loss": 0.699,
"mean_token_accuracy": 0.808113294839859,
"num_tokens": 1292227234.0,
"step": 12920
},
{
"entropy": 0.964453125,
"epoch": 1.7671176711767118,
"grad_norm": 0.2794410710847633,
"learning_rate": 6.006058898125969e-07,
"loss": 0.6693,
"mean_token_accuracy": 0.816795003414154,
"num_tokens": 1293271324.0,
"step": 12930
},
{
"entropy": 0.982421875,
"epoch": 1.7684843515101818,
"grad_norm": 0.29555115890654365,
"learning_rate": 5.970832746230803e-07,
"loss": 0.715,
"mean_token_accuracy": 0.8070627510547638,
"num_tokens": 1294344608.0,
"step": 12940
},
{
"entropy": 0.97109375,
"epoch": 1.7698510318436518,
"grad_norm": 0.3000827909668308,
"learning_rate": 5.935606594335636e-07,
"loss": 0.6718,
"mean_token_accuracy": 0.8158552825450898,
"num_tokens": 1295392624.0,
"step": 12950
},
{
"entropy": 0.9578125,
"epoch": 1.7712177121771218,
"grad_norm": 0.28976697146247216,
"learning_rate": 5.900380442440468e-07,
"loss": 0.6824,
"mean_token_accuracy": 0.8138112485408783,
"num_tokens": 1296388849.0,
"step": 12960
},
{
"entropy": 1.010546875,
"epoch": 1.7725843925105917,
"grad_norm": 0.30147171200141853,
"learning_rate": 5.8651542905453e-07,
"loss": 0.7484,
"mean_token_accuracy": 0.8009718239307404,
"num_tokens": 1297403747.0,
"step": 12970
},
{
"entropy": 0.935546875,
"epoch": 1.7739510728440617,
"grad_norm": 0.35654743869615657,
"learning_rate": 5.829928138650135e-07,
"loss": 0.6746,
"mean_token_accuracy": 0.8161435663700104,
"num_tokens": 1298390531.0,
"step": 12980
},
{
"entropy": 0.95078125,
"epoch": 1.7753177531775317,
"grad_norm": 0.3061316239439336,
"learning_rate": 5.794701986754967e-07,
"loss": 0.6642,
"mean_token_accuracy": 0.8184280276298523,
"num_tokens": 1299380008.0,
"step": 12990
},
{
"entropy": 0.95,
"epoch": 1.7766844335110017,
"grad_norm": 0.3072306406693706,
"learning_rate": 5.759475834859801e-07,
"loss": 0.6868,
"mean_token_accuracy": 0.8131351292133331,
"num_tokens": 1300380140.0,
"step": 13000
},
{
"entropy": 0.986328125,
"epoch": 1.7780511138444717,
"grad_norm": 0.3139061940217988,
"learning_rate": 5.724249682964633e-07,
"loss": 0.7187,
"mean_token_accuracy": 0.805996835231781,
"num_tokens": 1301342727.0,
"step": 13010
},
{
"entropy": 0.972265625,
"epoch": 1.7794177941779417,
"grad_norm": 0.2880622488612643,
"learning_rate": 5.689023531069466e-07,
"loss": 0.6704,
"mean_token_accuracy": 0.814822119474411,
"num_tokens": 1302387080.0,
"step": 13020
},
{
"entropy": 0.96875,
"epoch": 1.7807844745114116,
"grad_norm": 0.293715338487651,
"learning_rate": 5.6537973791743e-07,
"loss": 0.6895,
"mean_token_accuracy": 0.8112622499465942,
"num_tokens": 1303366775.0,
"step": 13030
},
{
"entropy": 0.9125,
"epoch": 1.7821511548448816,
"grad_norm": 0.2728745558497267,
"learning_rate": 5.618571227279133e-07,
"loss": 0.6793,
"mean_token_accuracy": 0.8170794785022736,
"num_tokens": 1304402696.0,
"step": 13040
},
{
"entropy": 0.927734375,
"epoch": 1.7835178351783518,
"grad_norm": 0.3117166841846333,
"learning_rate": 5.583345075383965e-07,
"loss": 0.6611,
"mean_token_accuracy": 0.8171492040157318,
"num_tokens": 1305437835.0,
"step": 13050
},
{
"entropy": 0.92265625,
"epoch": 1.7848845155118218,
"grad_norm": 0.3242453317034453,
"learning_rate": 5.548118923488799e-07,
"loss": 0.6444,
"mean_token_accuracy": 0.821748161315918,
"num_tokens": 1306396989.0,
"step": 13060
},
{
"entropy": 0.92578125,
"epoch": 1.7862511958452918,
"grad_norm": 0.27935559082397654,
"learning_rate": 5.512892771593632e-07,
"loss": 0.6442,
"mean_token_accuracy": 0.8222859859466553,
"num_tokens": 1307411160.0,
"step": 13070
},
{
"entropy": 0.97265625,
"epoch": 1.7876178761787618,
"grad_norm": 0.259322461042615,
"learning_rate": 5.477666619698464e-07,
"loss": 0.7257,
"mean_token_accuracy": 0.8048623263835907,
"num_tokens": 1308422364.0,
"step": 13080
},
{
"entropy": 0.949609375,
"epoch": 1.7889845565122318,
"grad_norm": 0.2706923857708913,
"learning_rate": 5.442440467803298e-07,
"loss": 0.6735,
"mean_token_accuracy": 0.8143205583095551,
"num_tokens": 1309416956.0,
"step": 13090
},
{
"entropy": 0.9703125,
"epoch": 1.7903512368457017,
"grad_norm": 0.32409243074670685,
"learning_rate": 5.407214315908131e-07,
"loss": 0.6562,
"mean_token_accuracy": 0.8191709280014038,
"num_tokens": 1310437474.0,
"step": 13100
},
{
"entropy": 0.968359375,
"epoch": 1.791717917179172,
"grad_norm": 0.2968441288333416,
"learning_rate": 5.371988164012964e-07,
"loss": 0.6912,
"mean_token_accuracy": 0.8095330357551574,
"num_tokens": 1311483257.0,
"step": 13110
},
{
"entropy": 0.91875,
"epoch": 1.793084597512642,
"grad_norm": 0.26649082156220044,
"learning_rate": 5.336762012117797e-07,
"loss": 0.6616,
"mean_token_accuracy": 0.8178961992263794,
"num_tokens": 1312504017.0,
"step": 13120
},
{
"entropy": 0.956640625,
"epoch": 1.794451277846112,
"grad_norm": 0.3188660257478101,
"learning_rate": 5.30153586022263e-07,
"loss": 0.6724,
"mean_token_accuracy": 0.8147534906864167,
"num_tokens": 1313519252.0,
"step": 13130
},
{
"entropy": 0.960546875,
"epoch": 1.795817958179582,
"grad_norm": 0.2874625661415248,
"learning_rate": 5.266309708327462e-07,
"loss": 0.68,
"mean_token_accuracy": 0.8145626366138459,
"num_tokens": 1314515155.0,
"step": 13140
},
{
"entropy": 0.923046875,
"epoch": 1.7971846385130519,
"grad_norm": 0.2905078792107188,
"learning_rate": 5.231083556432296e-07,
"loss": 0.6561,
"mean_token_accuracy": 0.8219948530197143,
"num_tokens": 1315494592.0,
"step": 13150
},
{
"entropy": 0.984765625,
"epoch": 1.7985513188465219,
"grad_norm": 0.29601051876474427,
"learning_rate": 5.195857404537129e-07,
"loss": 0.7435,
"mean_token_accuracy": 0.8054800927639008,
"num_tokens": 1316485334.0,
"step": 13160
},
{
"entropy": 0.966796875,
"epoch": 1.7999179991799918,
"grad_norm": 0.31237623581070606,
"learning_rate": 5.160631252641961e-07,
"loss": 0.6714,
"mean_token_accuracy": 0.8170806169509888,
"num_tokens": 1317455713.0,
"step": 13170
},
{
"entropy": 0.9375,
"epoch": 1.8012846795134618,
"grad_norm": 0.3327757610822277,
"learning_rate": 5.125405100746795e-07,
"loss": 0.6867,
"mean_token_accuracy": 0.812652850151062,
"num_tokens": 1318491881.0,
"step": 13180
},
{
"entropy": 0.96015625,
"epoch": 1.8026513598469318,
"grad_norm": 0.30381098203167406,
"learning_rate": 5.090178948851628e-07,
"loss": 0.7012,
"mean_token_accuracy": 0.8085464894771576,
"num_tokens": 1319522529.0,
"step": 13190
},
{
"entropy": 0.994921875,
"epoch": 1.8040180401804018,
"grad_norm": 0.36223054924665904,
"learning_rate": 5.054952796956461e-07,
"loss": 0.7049,
"mean_token_accuracy": 0.8082178294658661,
"num_tokens": 1320498119.0,
"step": 13200
},
{
"entropy": 0.916796875,
"epoch": 1.8053847205138718,
"grad_norm": 0.3285921054337743,
"learning_rate": 5.019726645061294e-07,
"loss": 0.6226,
"mean_token_accuracy": 0.8270777642726899,
"num_tokens": 1321520797.0,
"step": 13210
},
{
"entropy": 1.009375,
"epoch": 1.8067514008473418,
"grad_norm": 0.3469718256972691,
"learning_rate": 4.984500493166127e-07,
"loss": 0.6876,
"mean_token_accuracy": 0.8130711019039154,
"num_tokens": 1322533199.0,
"step": 13220
},
{
"entropy": 0.89765625,
"epoch": 1.8081180811808117,
"grad_norm": 0.2970448013922898,
"learning_rate": 4.94927434127096e-07,
"loss": 0.6208,
"mean_token_accuracy": 0.8280977785587311,
"num_tokens": 1323516433.0,
"step": 13230
},
{
"entropy": 0.969921875,
"epoch": 1.8094847615142817,
"grad_norm": 0.3179654760684603,
"learning_rate": 4.914048189375794e-07,
"loss": 0.6973,
"mean_token_accuracy": 0.8113041162490845,
"num_tokens": 1324489442.0,
"step": 13240
},
{
"entropy": 0.960546875,
"epoch": 1.8108514418477517,
"grad_norm": 0.2916560342750972,
"learning_rate": 4.878822037480626e-07,
"loss": 0.6954,
"mean_token_accuracy": 0.8112530469894409,
"num_tokens": 1325407187.0,
"step": 13250
},
{
"entropy": 0.950390625,
"epoch": 1.8122181221812217,
"grad_norm": 0.2869580488103768,
"learning_rate": 4.843595885585459e-07,
"loss": 0.6868,
"mean_token_accuracy": 0.8133535385131836,
"num_tokens": 1326374552.0,
"step": 13260
},
{
"entropy": 0.9515625,
"epoch": 1.8135848025146917,
"grad_norm": 0.32900494407286374,
"learning_rate": 4.808369733690292e-07,
"loss": 0.6835,
"mean_token_accuracy": 0.8123052895069123,
"num_tokens": 1327402092.0,
"step": 13270
},
{
"entropy": 1.001953125,
"epoch": 1.8149514828481617,
"grad_norm": 0.29820511299202607,
"learning_rate": 4.773143581795125e-07,
"loss": 0.7412,
"mean_token_accuracy": 0.8029185056686401,
"num_tokens": 1328445454.0,
"step": 13280
},
{
"entropy": 0.92890625,
"epoch": 1.8163181631816319,
"grad_norm": 0.29024332702657957,
"learning_rate": 4.7379174298999583e-07,
"loss": 0.6484,
"mean_token_accuracy": 0.8219327628612518,
"num_tokens": 1329428756.0,
"step": 13290
},
{
"entropy": 0.964453125,
"epoch": 1.8176848435151018,
"grad_norm": 0.33945316633328637,
"learning_rate": 4.702691278004791e-07,
"loss": 0.6809,
"mean_token_accuracy": 0.814829021692276,
"num_tokens": 1330472541.0,
"step": 13300
},
{
"entropy": 0.937890625,
"epoch": 1.8190515238485718,
"grad_norm": 0.3252732065149365,
"learning_rate": 4.6674651261096245e-07,
"loss": 0.6565,
"mean_token_accuracy": 0.8202269911766052,
"num_tokens": 1331479843.0,
"step": 13310
},
{
"entropy": 0.917578125,
"epoch": 1.8204182041820418,
"grad_norm": 0.3251887873058146,
"learning_rate": 4.632238974214457e-07,
"loss": 0.6489,
"mean_token_accuracy": 0.8215922892093659,
"num_tokens": 1332493314.0,
"step": 13320
},
{
"entropy": 0.9328125,
"epoch": 1.8217848845155118,
"grad_norm": 0.26782636483312056,
"learning_rate": 4.5970128223192907e-07,
"loss": 0.671,
"mean_token_accuracy": 0.8165081918239594,
"num_tokens": 1333490980.0,
"step": 13330
},
{
"entropy": 0.930859375,
"epoch": 1.8231515648489818,
"grad_norm": 0.2841427164618243,
"learning_rate": 4.561786670424123e-07,
"loss": 0.6508,
"mean_token_accuracy": 0.8207270860671997,
"num_tokens": 1334466846.0,
"step": 13340
},
{
"entropy": 0.9515625,
"epoch": 1.824518245182452,
"grad_norm": 0.30971610494786156,
"learning_rate": 4.5265605185289563e-07,
"loss": 0.6629,
"mean_token_accuracy": 0.817879033088684,
"num_tokens": 1335493116.0,
"step": 13350
},
{
"entropy": 0.925,
"epoch": 1.825884925515922,
"grad_norm": 0.27018654827300603,
"learning_rate": 4.491334366633789e-07,
"loss": 0.6603,
"mean_token_accuracy": 0.8181707859039307,
"num_tokens": 1336516552.0,
"step": 13360
},
{
"entropy": 0.96484375,
"epoch": 1.827251605849392,
"grad_norm": 0.29985467131211985,
"learning_rate": 4.456108214738622e-07,
"loss": 0.694,
"mean_token_accuracy": 0.8120291590690613,
"num_tokens": 1337514975.0,
"step": 13370
},
{
"entropy": 0.9546875,
"epoch": 1.828618286182862,
"grad_norm": 0.32731690909069705,
"learning_rate": 4.4208820628434553e-07,
"loss": 0.6737,
"mean_token_accuracy": 0.8164534568786621,
"num_tokens": 1338513483.0,
"step": 13380
},
{
"entropy": 0.966796875,
"epoch": 1.829984966516332,
"grad_norm": 0.31068916422074455,
"learning_rate": 4.385655910948288e-07,
"loss": 0.7091,
"mean_token_accuracy": 0.8066407561302185,
"num_tokens": 1339518810.0,
"step": 13390
},
{
"entropy": 0.9671875,
"epoch": 1.831351646849802,
"grad_norm": 0.2926034397695611,
"learning_rate": 4.3504297590531215e-07,
"loss": 0.7267,
"mean_token_accuracy": 0.8036812484264374,
"num_tokens": 1340527451.0,
"step": 13400
},
{
"entropy": 0.92109375,
"epoch": 1.8327183271832719,
"grad_norm": 0.3005999806037628,
"learning_rate": 4.3152036071579543e-07,
"loss": 0.66,
"mean_token_accuracy": 0.819196343421936,
"num_tokens": 1341550702.0,
"step": 13410
},
{
"entropy": 0.923046875,
"epoch": 1.8340850075167419,
"grad_norm": 0.2807180952696634,
"learning_rate": 4.2799774552627877e-07,
"loss": 0.6626,
"mean_token_accuracy": 0.8185633659362793,
"num_tokens": 1342575219.0,
"step": 13420
},
{
"entropy": 0.940234375,
"epoch": 1.8354516878502118,
"grad_norm": 0.3242161161923492,
"learning_rate": 4.2447513033676205e-07,
"loss": 0.6665,
"mean_token_accuracy": 0.817318719625473,
"num_tokens": 1343565670.0,
"step": 13430
},
{
"entropy": 0.940625,
"epoch": 1.8368183681836818,
"grad_norm": 0.3062945860982231,
"learning_rate": 4.209525151472454e-07,
"loss": 0.6787,
"mean_token_accuracy": 0.8146273970603943,
"num_tokens": 1344543137.0,
"step": 13440
},
{
"entropy": 0.977734375,
"epoch": 1.8381850485171518,
"grad_norm": 0.2986348970082363,
"learning_rate": 4.1742989995772867e-07,
"loss": 0.7057,
"mean_token_accuracy": 0.8073008060455322,
"num_tokens": 1345577171.0,
"step": 13450
},
{
"entropy": 0.9875,
"epoch": 1.8395517288506218,
"grad_norm": 0.30407949397618256,
"learning_rate": 4.13907284768212e-07,
"loss": 0.7097,
"mean_token_accuracy": 0.8080058872699738,
"num_tokens": 1346542242.0,
"step": 13460
},
{
"entropy": 0.98125,
"epoch": 1.8409184091840918,
"grad_norm": 0.293739566001541,
"learning_rate": 4.1038466957869523e-07,
"loss": 0.6793,
"mean_token_accuracy": 0.8140108704566955,
"num_tokens": 1347510243.0,
"step": 13470
},
{
"entropy": 0.958203125,
"epoch": 1.8422850895175618,
"grad_norm": 0.3113289211253568,
"learning_rate": 4.068620543891785e-07,
"loss": 0.6845,
"mean_token_accuracy": 0.8127768933773041,
"num_tokens": 1348582573.0,
"step": 13480
},
{
"entropy": 0.942578125,
"epoch": 1.8436517698510317,
"grad_norm": 0.2847870148323656,
"learning_rate": 4.0333943919966185e-07,
"loss": 0.6991,
"mean_token_accuracy": 0.809330266714096,
"num_tokens": 1349636357.0,
"step": 13490
},
{
"entropy": 0.9203125,
"epoch": 1.8450184501845017,
"grad_norm": 0.2882996106689209,
"learning_rate": 3.9981682401014513e-07,
"loss": 0.655,
"mean_token_accuracy": 0.8194228172302246,
"num_tokens": 1350688209.0,
"step": 13500
},
{
"entropy": 0.919140625,
"epoch": 1.8463851305179717,
"grad_norm": 0.279469738208453,
"learning_rate": 3.9629420882062847e-07,
"loss": 0.6554,
"mean_token_accuracy": 0.8197312355041504,
"num_tokens": 1351686326.0,
"step": 13510
},
{
"entropy": 0.984765625,
"epoch": 1.8477518108514417,
"grad_norm": 0.2847371640952963,
"learning_rate": 3.9277159363111175e-07,
"loss": 0.6792,
"mean_token_accuracy": 0.8134668946266175,
"num_tokens": 1352685550.0,
"step": 13520
},
{
"entropy": 0.962890625,
"epoch": 1.849118491184912,
"grad_norm": 0.3015115923401449,
"learning_rate": 3.892489784415951e-07,
"loss": 0.6819,
"mean_token_accuracy": 0.8136623501777649,
"num_tokens": 1353677598.0,
"step": 13530
},
{
"entropy": 0.996875,
"epoch": 1.8504851715183819,
"grad_norm": 0.3286984218641264,
"learning_rate": 3.8572636325207837e-07,
"loss": 0.7073,
"mean_token_accuracy": 0.8067946791648865,
"num_tokens": 1354595839.0,
"step": 13540
},
{
"entropy": 0.99296875,
"epoch": 1.8518518518518519,
"grad_norm": 0.2960274001932569,
"learning_rate": 3.822037480625617e-07,
"loss": 0.6811,
"mean_token_accuracy": 0.8145335257053375,
"num_tokens": 1355600144.0,
"step": 13550
},
{
"entropy": 0.926953125,
"epoch": 1.8532185321853218,
"grad_norm": 0.29108356711426425,
"learning_rate": 3.78681132873045e-07,
"loss": 0.6416,
"mean_token_accuracy": 0.8241022527217865,
"num_tokens": 1356670331.0,
"step": 13560
},
{
"entropy": 0.97421875,
"epoch": 1.8545852125187918,
"grad_norm": 0.25778034565203556,
"learning_rate": 3.7515851768352827e-07,
"loss": 0.6878,
"mean_token_accuracy": 0.811670446395874,
"num_tokens": 1357661057.0,
"step": 13570
},
{
"entropy": 0.986328125,
"epoch": 1.8559518928522618,
"grad_norm": 0.3209521845430768,
"learning_rate": 3.716359024940116e-07,
"loss": 0.69,
"mean_token_accuracy": 0.81049485206604,
"num_tokens": 1358616915.0,
"step": 13580
},
{
"entropy": 0.961328125,
"epoch": 1.857318573185732,
"grad_norm": 0.31647851872449484,
"learning_rate": 3.6811328730449484e-07,
"loss": 0.6862,
"mean_token_accuracy": 0.810965758562088,
"num_tokens": 1359643045.0,
"step": 13590
},
{
"entropy": 0.965234375,
"epoch": 1.858685253519202,
"grad_norm": 0.2900881900145146,
"learning_rate": 3.645906721149782e-07,
"loss": 0.6669,
"mean_token_accuracy": 0.8171241521835327,
"num_tokens": 1360589535.0,
"step": 13600
},
{
"entropy": 0.967578125,
"epoch": 1.860051933852672,
"grad_norm": 0.30487805402963525,
"learning_rate": 3.6106805692546145e-07,
"loss": 0.6736,
"mean_token_accuracy": 0.8174097418785096,
"num_tokens": 1361633326.0,
"step": 13610
},
{
"entropy": 0.98046875,
"epoch": 1.861418614186142,
"grad_norm": 0.2907822389397233,
"learning_rate": 3.575454417359448e-07,
"loss": 0.6797,
"mean_token_accuracy": 0.8144235134124755,
"num_tokens": 1362627505.0,
"step": 13620
},
{
"entropy": 0.97265625,
"epoch": 1.862785294519612,
"grad_norm": 0.30172112773807847,
"learning_rate": 3.5402282654642807e-07,
"loss": 0.6477,
"mean_token_accuracy": 0.8214137077331543,
"num_tokens": 1363598703.0,
"step": 13630
},
{
"entropy": 0.97265625,
"epoch": 1.864151974853082,
"grad_norm": 0.28569131872452214,
"learning_rate": 3.505002113569114e-07,
"loss": 0.7067,
"mean_token_accuracy": 0.8081061005592346,
"num_tokens": 1364623838.0,
"step": 13640
},
{
"entropy": 0.962109375,
"epoch": 1.865518655186552,
"grad_norm": 0.3316636499247359,
"learning_rate": 3.469775961673947e-07,
"loss": 0.6787,
"mean_token_accuracy": 0.8136240363121032,
"num_tokens": 1365591620.0,
"step": 13650
},
{
"entropy": 0.94609375,
"epoch": 1.866885335520022,
"grad_norm": 0.27596222976269674,
"learning_rate": 3.43454980977878e-07,
"loss": 0.674,
"mean_token_accuracy": 0.8181846559047699,
"num_tokens": 1366562325.0,
"step": 13660
},
{
"entropy": 0.981640625,
"epoch": 1.8682520158534919,
"grad_norm": 0.3051504426768079,
"learning_rate": 3.399323657883613e-07,
"loss": 0.6844,
"mean_token_accuracy": 0.8126085758209228,
"num_tokens": 1367547706.0,
"step": 13670
},
{
"entropy": 0.973828125,
"epoch": 1.8696186961869619,
"grad_norm": 0.27757446017199955,
"learning_rate": 3.364097505988446e-07,
"loss": 0.7022,
"mean_token_accuracy": 0.8091614186763764,
"num_tokens": 1368583588.0,
"step": 13680
},
{
"entropy": 0.96875,
"epoch": 1.8709853765204318,
"grad_norm": 0.28059010166706433,
"learning_rate": 3.328871354093279e-07,
"loss": 0.6829,
"mean_token_accuracy": 0.8131014704704285,
"num_tokens": 1369619311.0,
"step": 13690
},
{
"entropy": 0.986328125,
"epoch": 1.8723520568539018,
"grad_norm": 0.2885357145744922,
"learning_rate": 3.293645202198112e-07,
"loss": 0.7052,
"mean_token_accuracy": 0.8085791051387787,
"num_tokens": 1370620293.0,
"step": 13700
},
{
"entropy": 0.976953125,
"epoch": 1.8737187371873718,
"grad_norm": 0.26275775441227944,
"learning_rate": 3.2584190503029454e-07,
"loss": 0.6877,
"mean_token_accuracy": 0.8107349276542664,
"num_tokens": 1371582481.0,
"step": 13710
},
{
"entropy": 0.946875,
"epoch": 1.8750854175208418,
"grad_norm": 0.2895937804302374,
"learning_rate": 3.223192898407778e-07,
"loss": 0.6889,
"mean_token_accuracy": 0.8139593303203583,
"num_tokens": 1372591370.0,
"step": 13720
},
{
"entropy": 0.9625,
"epoch": 1.8764520978543118,
"grad_norm": 0.28103468852357405,
"learning_rate": 3.1879667465126116e-07,
"loss": 0.6595,
"mean_token_accuracy": 0.8201185941696167,
"num_tokens": 1373606101.0,
"step": 13730
},
{
"entropy": 0.940625,
"epoch": 1.8778187781877818,
"grad_norm": 0.2584560047613991,
"learning_rate": 3.152740594617444e-07,
"loss": 0.6677,
"mean_token_accuracy": 0.818338418006897,
"num_tokens": 1374669486.0,
"step": 13740
},
{
"entropy": 0.959765625,
"epoch": 1.8791854585212517,
"grad_norm": 0.319828826689011,
"learning_rate": 3.117514442722277e-07,
"loss": 0.6706,
"mean_token_accuracy": 0.816732543706894,
"num_tokens": 1375701416.0,
"step": 13750
},
{
"entropy": 0.9015625,
"epoch": 1.8805521388547217,
"grad_norm": 0.28545427297139103,
"learning_rate": 3.08228829082711e-07,
"loss": 0.6051,
"mean_token_accuracy": 0.831224673986435,
"num_tokens": 1376758478.0,
"step": 13760
},
{
"entropy": 0.958984375,
"epoch": 1.881918819188192,
"grad_norm": 0.33648916240559495,
"learning_rate": 3.0470621389319434e-07,
"loss": 0.6826,
"mean_token_accuracy": 0.8135513842105866,
"num_tokens": 1377731744.0,
"step": 13770
},
{
"entropy": 0.948046875,
"epoch": 1.883285499521662,
"grad_norm": 0.26786571697307576,
"learning_rate": 3.0118359870367763e-07,
"loss": 0.6779,
"mean_token_accuracy": 0.8157100915908814,
"num_tokens": 1378676516.0,
"step": 13780
},
{
"entropy": 0.926953125,
"epoch": 1.884652179855132,
"grad_norm": 0.2936276344588599,
"learning_rate": 2.9766098351416096e-07,
"loss": 0.6371,
"mean_token_accuracy": 0.8231689274311066,
"num_tokens": 1379694371.0,
"step": 13790
},
{
"entropy": 0.958984375,
"epoch": 1.8860188601886019,
"grad_norm": 0.2854165205908851,
"learning_rate": 2.9413836832464424e-07,
"loss": 0.6884,
"mean_token_accuracy": 0.812450897693634,
"num_tokens": 1380725075.0,
"step": 13800
},
{
"entropy": 0.998828125,
"epoch": 1.8873855405220719,
"grad_norm": 0.3021639957706675,
"learning_rate": 2.906157531351276e-07,
"loss": 0.7162,
"mean_token_accuracy": 0.8074933171272278,
"num_tokens": 1381734170.0,
"step": 13810
},
{
"entropy": 0.9453125,
"epoch": 1.8887522208555418,
"grad_norm": 0.3118479440575567,
"learning_rate": 2.8709313794561086e-07,
"loss": 0.6548,
"mean_token_accuracy": 0.8203225076198578,
"num_tokens": 1382760495.0,
"step": 13820
},
{
"entropy": 0.9625,
"epoch": 1.890118901189012,
"grad_norm": 0.28726538156212683,
"learning_rate": 2.8357052275609415e-07,
"loss": 0.7053,
"mean_token_accuracy": 0.80808886885643,
"num_tokens": 1383715689.0,
"step": 13830
},
{
"entropy": 1.0,
"epoch": 1.891485581522482,
"grad_norm": 0.2794497811296424,
"learning_rate": 2.8004790756657743e-07,
"loss": 0.7245,
"mean_token_accuracy": 0.8061550915241241,
"num_tokens": 1384708046.0,
"step": 13840
},
{
"entropy": 0.96171875,
"epoch": 1.892852261855952,
"grad_norm": 0.26572888104896136,
"learning_rate": 2.7652529237706076e-07,
"loss": 0.6727,
"mean_token_accuracy": 0.8157574713230134,
"num_tokens": 1385697303.0,
"step": 13850
},
{
"entropy": 0.94296875,
"epoch": 1.894218942189422,
"grad_norm": 0.27857123622793084,
"learning_rate": 2.7300267718754405e-07,
"loss": 0.692,
"mean_token_accuracy": 0.8118922889232636,
"num_tokens": 1386666553.0,
"step": 13860
},
{
"entropy": 0.894140625,
"epoch": 1.895585622522892,
"grad_norm": 0.29151259125691986,
"learning_rate": 2.694800619980274e-07,
"loss": 0.653,
"mean_token_accuracy": 0.8219560980796814,
"num_tokens": 1387666933.0,
"step": 13870
},
{
"entropy": 0.933984375,
"epoch": 1.896952302856362,
"grad_norm": 0.31184081859796475,
"learning_rate": 2.6595744680851066e-07,
"loss": 0.66,
"mean_token_accuracy": 0.8187870144844055,
"num_tokens": 1388708335.0,
"step": 13880
},
{
"entropy": 0.969140625,
"epoch": 1.898318983189832,
"grad_norm": 0.2762813764198348,
"learning_rate": 2.6243483161899395e-07,
"loss": 0.6821,
"mean_token_accuracy": 0.8137852549552917,
"num_tokens": 1389687489.0,
"step": 13890
},
{
"entropy": 0.951171875,
"epoch": 1.899685663523302,
"grad_norm": 0.2943318289373388,
"learning_rate": 2.589122164294773e-07,
"loss": 0.6897,
"mean_token_accuracy": 0.812785804271698,
"num_tokens": 1390740352.0,
"step": 13900
},
{
"entropy": 0.948046875,
"epoch": 1.901052343856772,
"grad_norm": 0.3092774255910391,
"learning_rate": 2.5538960123996056e-07,
"loss": 0.6638,
"mean_token_accuracy": 0.8182471096515656,
"num_tokens": 1391739989.0,
"step": 13910
},
{
"entropy": 0.954296875,
"epoch": 1.902419024190242,
"grad_norm": 0.29704850351927875,
"learning_rate": 2.518669860504439e-07,
"loss": 0.6771,
"mean_token_accuracy": 0.8142772614955902,
"num_tokens": 1392697957.0,
"step": 13920
},
{
"entropy": 0.966796875,
"epoch": 1.9037857045237119,
"grad_norm": 0.29281209683860543,
"learning_rate": 2.483443708609272e-07,
"loss": 0.6888,
"mean_token_accuracy": 0.8112469553947449,
"num_tokens": 1393680975.0,
"step": 13930
},
{
"entropy": 0.926953125,
"epoch": 1.9051523848571819,
"grad_norm": 0.3557756750028441,
"learning_rate": 2.4482175567141046e-07,
"loss": 0.638,
"mean_token_accuracy": 0.8237872540950775,
"num_tokens": 1394700240.0,
"step": 13940
},
{
"entropy": 0.996875,
"epoch": 1.9065190651906518,
"grad_norm": 0.26738264626029956,
"learning_rate": 2.4129914048189375e-07,
"loss": 0.6993,
"mean_token_accuracy": 0.8087121844291687,
"num_tokens": 1395752339.0,
"step": 13950
},
{
"entropy": 0.96484375,
"epoch": 1.9078857455241218,
"grad_norm": 0.27351397195593885,
"learning_rate": 2.3777652529237708e-07,
"loss": 0.6941,
"mean_token_accuracy": 0.8121686995029449,
"num_tokens": 1396771928.0,
"step": 13960
},
{
"entropy": 0.9703125,
"epoch": 1.9092524258575918,
"grad_norm": 0.2871050514047969,
"learning_rate": 2.342539101028604e-07,
"loss": 0.7104,
"mean_token_accuracy": 0.8063973426818848,
"num_tokens": 1397822025.0,
"step": 13970
},
{
"entropy": 0.9765625,
"epoch": 1.9106191061910618,
"grad_norm": 0.3143463832807581,
"learning_rate": 2.307312949133437e-07,
"loss": 0.7221,
"mean_token_accuracy": 0.8052859842777252,
"num_tokens": 1398809018.0,
"step": 13980
},
{
"entropy": 0.93203125,
"epoch": 1.9119857865245318,
"grad_norm": 0.2793853060863036,
"learning_rate": 2.2720867972382698e-07,
"loss": 0.6781,
"mean_token_accuracy": 0.8137363135814667,
"num_tokens": 1399817169.0,
"step": 13990
},
{
"entropy": 0.985546875,
"epoch": 1.9133524668580018,
"grad_norm": 0.28444940880937575,
"learning_rate": 2.236860645343103e-07,
"loss": 0.686,
"mean_token_accuracy": 0.811758178472519,
"num_tokens": 1400792761.0,
"step": 14000
},
{
"entropy": 0.91875,
"epoch": 1.914719147191472,
"grad_norm": 0.3227216496286505,
"learning_rate": 2.201634493447936e-07,
"loss": 0.6447,
"mean_token_accuracy": 0.8202575266361236,
"num_tokens": 1401775004.0,
"step": 14010
},
{
"entropy": 0.937109375,
"epoch": 1.916085827524942,
"grad_norm": 0.30479927255695577,
"learning_rate": 2.166408341552769e-07,
"loss": 0.7024,
"mean_token_accuracy": 0.8090051174163818,
"num_tokens": 1402756501.0,
"step": 14020
},
{
"entropy": 0.968359375,
"epoch": 1.917452507858412,
"grad_norm": 0.29684301522671636,
"learning_rate": 2.131182189657602e-07,
"loss": 0.6515,
"mean_token_accuracy": 0.8207015812397003,
"num_tokens": 1403739936.0,
"step": 14030
},
{
"entropy": 0.9578125,
"epoch": 1.918819188191882,
"grad_norm": 0.2916930092057669,
"learning_rate": 2.095956037762435e-07,
"loss": 0.6847,
"mean_token_accuracy": 0.8114553093910217,
"num_tokens": 1404737117.0,
"step": 14040
},
{
"entropy": 0.973046875,
"epoch": 1.920185868525352,
"grad_norm": 0.27010343894936056,
"learning_rate": 2.0607298858672678e-07,
"loss": 0.6546,
"mean_token_accuracy": 0.8205138683319092,
"num_tokens": 1405734788.0,
"step": 14050
},
{
"entropy": 0.93515625,
"epoch": 1.9215525488588219,
"grad_norm": 0.2981022515364946,
"learning_rate": 2.025503733972101e-07,
"loss": 0.6657,
"mean_token_accuracy": 0.8179100632667542,
"num_tokens": 1406751331.0,
"step": 14060
},
{
"entropy": 0.987109375,
"epoch": 1.922919229192292,
"grad_norm": 0.2835578281124474,
"learning_rate": 1.990277582076934e-07,
"loss": 0.7176,
"mean_token_accuracy": 0.8059958994388581,
"num_tokens": 1407785215.0,
"step": 14070
},
{
"entropy": 0.963671875,
"epoch": 1.924285909525762,
"grad_norm": 0.30473154326216834,
"learning_rate": 1.955051430181767e-07,
"loss": 0.6657,
"mean_token_accuracy": 0.8164306163787842,
"num_tokens": 1408718823.0,
"step": 14080
},
{
"entropy": 0.945703125,
"epoch": 1.925652589859232,
"grad_norm": 0.2976613692258312,
"learning_rate": 1.9198252782866002e-07,
"loss": 0.6607,
"mean_token_accuracy": 0.8197282314300537,
"num_tokens": 1409707417.0,
"step": 14090
},
{
"entropy": 0.96328125,
"epoch": 1.927019270192702,
"grad_norm": 0.27423318748763037,
"learning_rate": 1.8845991263914333e-07,
"loss": 0.652,
"mean_token_accuracy": 0.8207785606384277,
"num_tokens": 1410702222.0,
"step": 14100
},
{
"entropy": 0.982421875,
"epoch": 1.928385950526172,
"grad_norm": 0.3330918111683176,
"learning_rate": 1.8493729744962664e-07,
"loss": 0.6705,
"mean_token_accuracy": 0.8163950026035309,
"num_tokens": 1411621562.0,
"step": 14110
},
{
"entropy": 0.999609375,
"epoch": 1.929752630859642,
"grad_norm": 0.296027729235386,
"learning_rate": 1.8141468226010995e-07,
"loss": 0.7096,
"mean_token_accuracy": 0.809599906206131,
"num_tokens": 1412638000.0,
"step": 14120
},
{
"entropy": 0.937890625,
"epoch": 1.931119311193112,
"grad_norm": 0.30610918566726397,
"learning_rate": 1.778920670705932e-07,
"loss": 0.6514,
"mean_token_accuracy": 0.8209907114505768,
"num_tokens": 1413639889.0,
"step": 14130
},
{
"entropy": 0.96171875,
"epoch": 1.932485991526582,
"grad_norm": 0.2777723684014462,
"learning_rate": 1.743694518810765e-07,
"loss": 0.6621,
"mean_token_accuracy": 0.8158150613307953,
"num_tokens": 1414666234.0,
"step": 14140
},
{
"entropy": 0.955078125,
"epoch": 1.933852671860052,
"grad_norm": 0.29865119815261837,
"learning_rate": 1.7084683669155982e-07,
"loss": 0.6349,
"mean_token_accuracy": 0.824281370639801,
"num_tokens": 1415670134.0,
"step": 14150
},
{
"entropy": 0.96953125,
"epoch": 1.935219352193522,
"grad_norm": 0.2882906796830294,
"learning_rate": 1.6732422150204313e-07,
"loss": 0.685,
"mean_token_accuracy": 0.8133962035179139,
"num_tokens": 1416642461.0,
"step": 14160
},
{
"entropy": 0.933203125,
"epoch": 1.936586032526992,
"grad_norm": 0.26846572569287935,
"learning_rate": 1.6380160631252644e-07,
"loss": 0.6531,
"mean_token_accuracy": 0.8210091352462768,
"num_tokens": 1417700877.0,
"step": 14170
},
{
"entropy": 0.95703125,
"epoch": 1.937952712860462,
"grad_norm": 0.2909197394053423,
"learning_rate": 1.6027899112300975e-07,
"loss": 0.6615,
"mean_token_accuracy": 0.8184664309024811,
"num_tokens": 1418691154.0,
"step": 14180
},
{
"entropy": 0.94453125,
"epoch": 1.9393193931939319,
"grad_norm": 0.27641674513796244,
"learning_rate": 1.5675637593349303e-07,
"loss": 0.6377,
"mean_token_accuracy": 0.8243444681167602,
"num_tokens": 1419717600.0,
"step": 14190
},
{
"entropy": 0.954296875,
"epoch": 1.9406860735274019,
"grad_norm": 0.29637106556645054,
"learning_rate": 1.5323376074397634e-07,
"loss": 0.6871,
"mean_token_accuracy": 0.8114877820014954,
"num_tokens": 1420737827.0,
"step": 14200
},
{
"entropy": 1.028125,
"epoch": 1.9420527538608718,
"grad_norm": 0.32201738916609884,
"learning_rate": 1.4971114555445965e-07,
"loss": 0.7528,
"mean_token_accuracy": 0.7972649693489074,
"num_tokens": 1421751522.0,
"step": 14210
},
{
"entropy": 0.977734375,
"epoch": 1.9434194341943418,
"grad_norm": 0.2990468729470133,
"learning_rate": 1.4618853036494293e-07,
"loss": 0.7001,
"mean_token_accuracy": 0.8101386427879333,
"num_tokens": 1422734672.0,
"step": 14220
},
{
"entropy": 0.954296875,
"epoch": 1.9447861145278118,
"grad_norm": 0.2984725579002147,
"learning_rate": 1.4266591517542624e-07,
"loss": 0.7093,
"mean_token_accuracy": 0.8076680898666382,
"num_tokens": 1423713545.0,
"step": 14230
},
{
"entropy": 0.95234375,
"epoch": 1.9461527948612818,
"grad_norm": 0.26711002134144307,
"learning_rate": 1.3914329998590955e-07,
"loss": 0.6541,
"mean_token_accuracy": 0.8208437442779541,
"num_tokens": 1424645986.0,
"step": 14240
},
{
"entropy": 0.95859375,
"epoch": 1.947519475194752,
"grad_norm": 0.28054183779140357,
"learning_rate": 1.3562068479639286e-07,
"loss": 0.6814,
"mean_token_accuracy": 0.8145107567310333,
"num_tokens": 1425688603.0,
"step": 14250
},
{
"entropy": 0.918359375,
"epoch": 1.948886155528222,
"grad_norm": 0.3096830545511366,
"learning_rate": 1.3209806960687614e-07,
"loss": 0.6476,
"mean_token_accuracy": 0.8223003208637237,
"num_tokens": 1426653167.0,
"step": 14260
},
{
"entropy": 0.968359375,
"epoch": 1.950252835861692,
"grad_norm": 0.31116597796647943,
"learning_rate": 1.2857545441735945e-07,
"loss": 0.6655,
"mean_token_accuracy": 0.8174809575080871,
"num_tokens": 1427641418.0,
"step": 14270
},
{
"entropy": 0.965625,
"epoch": 1.951619516195162,
"grad_norm": 0.3176003707558442,
"learning_rate": 1.2505283922784276e-07,
"loss": 0.6851,
"mean_token_accuracy": 0.8145308911800384,
"num_tokens": 1428672424.0,
"step": 14280
},
{
"entropy": 0.9328125,
"epoch": 1.952986196528632,
"grad_norm": 0.27421189524883544,
"learning_rate": 1.2153022403832607e-07,
"loss": 0.6758,
"mean_token_accuracy": 0.814437747001648,
"num_tokens": 1429685204.0,
"step": 14290
},
{
"entropy": 0.95703125,
"epoch": 1.954352876862102,
"grad_norm": 0.29043870455425624,
"learning_rate": 1.1800760884880937e-07,
"loss": 0.6942,
"mean_token_accuracy": 0.8109240591526031,
"num_tokens": 1430729799.0,
"step": 14300
},
{
"entropy": 0.9578125,
"epoch": 1.9557195571955721,
"grad_norm": 0.2858344575001848,
"learning_rate": 1.1448499365929266e-07,
"loss": 0.6831,
"mean_token_accuracy": 0.8135787546634674,
"num_tokens": 1431740518.0,
"step": 14310
},
{
"entropy": 0.950390625,
"epoch": 1.957086237529042,
"grad_norm": 0.2905145410894599,
"learning_rate": 1.1096237846977597e-07,
"loss": 0.6743,
"mean_token_accuracy": 0.8157994091510773,
"num_tokens": 1432734226.0,
"step": 14320
},
{
"entropy": 0.95390625,
"epoch": 1.958452917862512,
"grad_norm": 0.3037675776179237,
"learning_rate": 1.0743976328025928e-07,
"loss": 0.6853,
"mean_token_accuracy": 0.8113859593868256,
"num_tokens": 1433760564.0,
"step": 14330
},
{
"entropy": 0.907421875,
"epoch": 1.959819598195982,
"grad_norm": 0.292807763736744,
"learning_rate": 1.0391714809074258e-07,
"loss": 0.6492,
"mean_token_accuracy": 0.8209530115127563,
"num_tokens": 1434780839.0,
"step": 14340
},
{
"entropy": 0.948828125,
"epoch": 1.961186278529452,
"grad_norm": 0.30261626462467645,
"learning_rate": 1.0039453290122588e-07,
"loss": 0.6919,
"mean_token_accuracy": 0.810335636138916,
"num_tokens": 1435777762.0,
"step": 14350
},
{
"entropy": 0.909375,
"epoch": 1.962552958862922,
"grad_norm": 0.31206868538405313,
"learning_rate": 9.687191771170918e-08,
"loss": 0.645,
"mean_token_accuracy": 0.8214968562126159,
"num_tokens": 1436761658.0,
"step": 14360
},
{
"entropy": 0.99140625,
"epoch": 1.963919639196392,
"grad_norm": 0.34475752774931806,
"learning_rate": 9.334930252219248e-08,
"loss": 0.7442,
"mean_token_accuracy": 0.8010929942131042,
"num_tokens": 1437801007.0,
"step": 14370
},
{
"entropy": 0.94921875,
"epoch": 1.965286319529862,
"grad_norm": 0.301201114028156,
"learning_rate": 8.982668733267578e-08,
"loss": 0.6654,
"mean_token_accuracy": 0.8177802205085755,
"num_tokens": 1438814755.0,
"step": 14380
},
{
"entropy": 0.912890625,
"epoch": 1.966652999863332,
"grad_norm": 0.2761350492792675,
"learning_rate": 8.630407214315909e-08,
"loss": 0.6546,
"mean_token_accuracy": 0.8201165080070496,
"num_tokens": 1439819938.0,
"step": 14390
},
{
"entropy": 0.983203125,
"epoch": 1.968019680196802,
"grad_norm": 0.34035843437327556,
"learning_rate": 8.27814569536424e-08,
"loss": 0.6714,
"mean_token_accuracy": 0.8169462144374847,
"num_tokens": 1440835381.0,
"step": 14400
},
{
"entropy": 0.983203125,
"epoch": 1.969386360530272,
"grad_norm": 0.3279584195287832,
"learning_rate": 7.925884176412568e-08,
"loss": 0.7298,
"mean_token_accuracy": 0.8033305585384369,
"num_tokens": 1441812568.0,
"step": 14410
},
{
"entropy": 0.98125,
"epoch": 1.970753040863742,
"grad_norm": 0.3039843480349863,
"learning_rate": 7.573622657460899e-08,
"loss": 0.7068,
"mean_token_accuracy": 0.8086526036262512,
"num_tokens": 1442798498.0,
"step": 14420
},
{
"entropy": 0.946875,
"epoch": 1.972119721197212,
"grad_norm": 0.3150794464052905,
"learning_rate": 7.22136113850923e-08,
"loss": 0.6688,
"mean_token_accuracy": 0.8161429643630982,
"num_tokens": 1443804598.0,
"step": 14430
},
{
"entropy": 0.9359375,
"epoch": 1.9734864015306819,
"grad_norm": 0.2983323183235282,
"learning_rate": 6.869099619557561e-08,
"loss": 0.6513,
"mean_token_accuracy": 0.8197840631008149,
"num_tokens": 1444812504.0,
"step": 14440
},
{
"entropy": 0.932421875,
"epoch": 1.9748530818641519,
"grad_norm": 0.3491252687156156,
"learning_rate": 6.51683810060589e-08,
"loss": 0.6676,
"mean_token_accuracy": 0.8173172354698182,
"num_tokens": 1445856326.0,
"step": 14450
},
{
"entropy": 0.976171875,
"epoch": 1.9762197621976219,
"grad_norm": 0.36137035222444536,
"learning_rate": 6.164576581654221e-08,
"loss": 0.7019,
"mean_token_accuracy": 0.8100679278373718,
"num_tokens": 1446814419.0,
"step": 14460
},
{
"entropy": 0.953515625,
"epoch": 1.9775864425310918,
"grad_norm": 0.30254479875477325,
"learning_rate": 5.8123150627025515e-08,
"loss": 0.6674,
"mean_token_accuracy": 0.8160466134548188,
"num_tokens": 1447785682.0,
"step": 14470
},
{
"entropy": 0.955859375,
"epoch": 1.9789531228645618,
"grad_norm": 0.2910496376307672,
"learning_rate": 5.460053543750881e-08,
"loss": 0.6773,
"mean_token_accuracy": 0.8150650918483734,
"num_tokens": 1448707537.0,
"step": 14480
},
{
"entropy": 0.98359375,
"epoch": 1.980319803198032,
"grad_norm": 0.28500653042958135,
"learning_rate": 5.107792024799211e-08,
"loss": 0.6874,
"mean_token_accuracy": 0.8117002367973327,
"num_tokens": 1449707689.0,
"step": 14490
},
{
"entropy": 1.009765625,
"epoch": 1.981686483531502,
"grad_norm": 0.3045141976305674,
"learning_rate": 4.7555305058475415e-08,
"loss": 0.7362,
"mean_token_accuracy": 0.8010472059249878,
"num_tokens": 1450667160.0,
"step": 14500
},
{
"entropy": 0.95625,
"epoch": 1.983053163864972,
"grad_norm": 0.32260542456578967,
"learning_rate": 4.403268986895872e-08,
"loss": 0.6976,
"mean_token_accuracy": 0.8104273974895477,
"num_tokens": 1451717212.0,
"step": 14510
},
{
"entropy": 0.961328125,
"epoch": 1.984419844198442,
"grad_norm": 0.29546136797235667,
"learning_rate": 4.0510074679442026e-08,
"loss": 0.6816,
"mean_token_accuracy": 0.8132944285869599,
"num_tokens": 1452714510.0,
"step": 14520
},
{
"entropy": 0.971875,
"epoch": 1.985786524531912,
"grad_norm": 0.32891555448239645,
"learning_rate": 3.698745948992532e-08,
"loss": 0.7198,
"mean_token_accuracy": 0.8056225478649139,
"num_tokens": 1453655116.0,
"step": 14530
},
{
"entropy": 0.946875,
"epoch": 1.987153204865382,
"grad_norm": 0.30097824906225523,
"learning_rate": 3.3464844300408624e-08,
"loss": 0.6711,
"mean_token_accuracy": 0.815236759185791,
"num_tokens": 1454601117.0,
"step": 14540
},
{
"entropy": 0.938671875,
"epoch": 1.9885198851988521,
"grad_norm": 0.28487541091982777,
"learning_rate": 2.994222911089193e-08,
"loss": 0.6575,
"mean_token_accuracy": 0.819963026046753,
"num_tokens": 1455611512.0,
"step": 14550
},
{
"entropy": 0.991796875,
"epoch": 1.9898865655323221,
"grad_norm": 0.2837691822905564,
"learning_rate": 2.6419613921375232e-08,
"loss": 0.6842,
"mean_token_accuracy": 0.8147280931472778,
"num_tokens": 1456632158.0,
"step": 14560
},
{
"entropy": 0.91796875,
"epoch": 1.991253245865792,
"grad_norm": 0.30634119163821566,
"learning_rate": 2.289699873185853e-08,
"loss": 0.6686,
"mean_token_accuracy": 0.8147126793861389,
"num_tokens": 1457642976.0,
"step": 14570
},
{
"entropy": 1.02109375,
"epoch": 1.992619926199262,
"grad_norm": 0.3106446608537736,
"learning_rate": 1.9374383542341837e-08,
"loss": 0.7331,
"mean_token_accuracy": 0.8022411465644836,
"num_tokens": 1458592777.0,
"step": 14580
},
{
"entropy": 0.912890625,
"epoch": 1.993986606532732,
"grad_norm": 0.3249292826535809,
"learning_rate": 1.585176835282514e-08,
"loss": 0.6426,
"mean_token_accuracy": 0.8233030617237092,
"num_tokens": 1459598963.0,
"step": 14590
},
{
"entropy": 0.98515625,
"epoch": 1.995353286866202,
"grad_norm": 0.30572353489261234,
"learning_rate": 1.2329153163308442e-08,
"loss": 0.7322,
"mean_token_accuracy": 0.803408396244049,
"num_tokens": 1460621010.0,
"step": 14600
},
{
"entropy": 0.95703125,
"epoch": 1.996719967199672,
"grad_norm": 0.3009050841792072,
"learning_rate": 8.806537973791744e-09,
"loss": 0.6925,
"mean_token_accuracy": 0.8115882754325867,
"num_tokens": 1461657932.0,
"step": 14610
},
{
"entropy": 0.934375,
"epoch": 1.998086647533142,
"grad_norm": 0.30438893200022404,
"learning_rate": 5.2839227842750465e-09,
"loss": 0.6784,
"mean_token_accuracy": 0.8144053220748901,
"num_tokens": 1462690155.0,
"step": 14620
},
{
"entropy": 0.9703125,
"epoch": 1.999453327866612,
"grad_norm": 0.28898428064832193,
"learning_rate": 1.7613075947583486e-09,
"loss": 0.6989,
"mean_token_accuracy": 0.8101770341396332,
"num_tokens": 1463697643.0,
"step": 14630
},
{
"entropy": 0.984375,
"epoch": 2.0,
"mean_token_accuracy": 0.8038735538721085,
"num_tokens": 1464106948.0,
"step": 14634,
"total_flos": 3199489317601280.0,
"train_loss": 0.7106047359356158,
"train_runtime": 48891.9802,
"train_samples_per_second": 38.309,
"train_steps_per_second": 0.299
}
],
"logging_steps": 10,
"max_steps": 14634,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 200,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 3199489317601280.0,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}