Files
qwen3-8b-instruct-sdf/trainer_state.json

7035 lines
203 KiB
JSON
Raw Normal View History

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.6600582265649863,
"eval_steps": 500,
"global_step": 7000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 0.9377105624414981,
"epoch": 0.0009429403236642661,
"grad_norm": 1.2421875,
"learning_rate": 1.5000000000000002e-07,
"loss": 0.84810791015625,
"mean_token_accuracy": 0.6954030711203814,
"num_tokens": 41672.0,
"step": 10
},
{
"entropy": 0.9366529762744904,
"epoch": 0.0018858806473285323,
"grad_norm": 0.98046875,
"learning_rate": 3.166666666666667e-07,
"loss": 0.7408034801483154,
"mean_token_accuracy": 0.6973626937717199,
"num_tokens": 86016.0,
"step": 20
},
{
"entropy": 0.9000760725699365,
"epoch": 0.0028288209709927984,
"grad_norm": 0.66015625,
"learning_rate": 4.833333333333334e-07,
"loss": 0.677955436706543,
"mean_token_accuracy": 0.7110291102901101,
"num_tokens": 123791.0,
"step": 30
},
{
"entropy": 1.0092571526765823,
"epoch": 0.0037717612946570646,
"grad_norm": 1.015625,
"learning_rate": 6.5e-07,
"loss": 0.7101857662200928,
"mean_token_accuracy": 0.699547297693789,
"num_tokens": 166292.0,
"step": 40
},
{
"entropy": 0.8959570353850722,
"epoch": 0.004714701618321331,
"grad_norm": 0.6953125,
"learning_rate": 8.166666666666668e-07,
"loss": 0.6740357875823975,
"mean_token_accuracy": 0.7126540616154671,
"num_tokens": 207843.0,
"step": 50
},
{
"entropy": 0.8416860729455948,
"epoch": 0.005657641941985597,
"grad_norm": 0.48828125,
"learning_rate": 9.833333333333334e-07,
"loss": 0.7373227596282959,
"mean_token_accuracy": 0.7413243912160397,
"num_tokens": 250846.0,
"step": 60
},
{
"entropy": 0.7951943324878812,
"epoch": 0.006600582265649863,
"grad_norm": 1.1328125,
"learning_rate": 1.1500000000000002e-06,
"loss": 0.6532743453979493,
"mean_token_accuracy": 0.7555031452327967,
"num_tokens": 296289.0,
"step": 70
},
{
"entropy": 0.9203432088717818,
"epoch": 0.007543522589314129,
"grad_norm": 0.78125,
"learning_rate": 1.3166666666666666e-06,
"loss": 0.7728577136993409,
"mean_token_accuracy": 0.717721626535058,
"num_tokens": 342924.0,
"step": 80
},
{
"entropy": 0.9101250190287828,
"epoch": 0.008486462912978394,
"grad_norm": 0.48046875,
"learning_rate": 1.4833333333333337e-06,
"loss": 0.736940574645996,
"mean_token_accuracy": 0.7175416748970747,
"num_tokens": 389818.0,
"step": 90
},
{
"entropy": 0.9771212268620729,
"epoch": 0.009429403236642661,
"grad_norm": 0.6875,
"learning_rate": 1.6500000000000003e-06,
"loss": 0.8331009864807128,
"mean_token_accuracy": 0.7274765845388174,
"num_tokens": 431465.0,
"step": 100
},
{
"entropy": 0.9352089989930391,
"epoch": 0.010372343560306927,
"grad_norm": 0.478515625,
"learning_rate": 1.816666666666667e-06,
"loss": 0.8612667083740234,
"mean_token_accuracy": 0.7201700910925866,
"num_tokens": 467267.0,
"step": 110
},
{
"entropy": 0.7851263372227549,
"epoch": 0.011315283883971194,
"grad_norm": 0.400390625,
"learning_rate": 1.9833333333333335e-06,
"loss": 0.6035785675048828,
"mean_token_accuracy": 0.7742446877062321,
"num_tokens": 510439.0,
"step": 120
},
{
"entropy": 0.8613772111944854,
"epoch": 0.012258224207635459,
"grad_norm": 0.59375,
"learning_rate": 2.15e-06,
"loss": 0.6771652221679687,
"mean_token_accuracy": 0.7419699221849442,
"num_tokens": 560257.0,
"step": 130
},
{
"entropy": 0.6902340137399733,
"epoch": 0.013201164531299726,
"grad_norm": 0.423828125,
"learning_rate": 2.316666666666667e-06,
"loss": 0.5627652168273926,
"mean_token_accuracy": 0.7800763368606567,
"num_tokens": 611089.0,
"step": 140
},
{
"entropy": 0.8741010932251811,
"epoch": 0.014144104854963991,
"grad_norm": 0.734375,
"learning_rate": 2.4833333333333334e-06,
"loss": 0.7286121368408203,
"mean_token_accuracy": 0.7611308570951223,
"num_tokens": 653242.0,
"step": 150
},
{
"entropy": 0.9950330995023251,
"epoch": 0.015087045178628258,
"grad_norm": 0.42578125,
"learning_rate": 2.6500000000000005e-06,
"loss": 0.6086991310119629,
"mean_token_accuracy": 0.7128357637673617,
"num_tokens": 699335.0,
"step": 160
},
{
"entropy": 1.0139703455381095,
"epoch": 0.016029985502292524,
"grad_norm": 0.71875,
"learning_rate": 2.816666666666667e-06,
"loss": 0.716233777999878,
"mean_token_accuracy": 0.7203566078096628,
"num_tokens": 745545.0,
"step": 170
},
{
"entropy": 0.8151160830631852,
"epoch": 0.01697292582595679,
"grad_norm": 0.7421875,
"learning_rate": 2.9833333333333337e-06,
"loss": 0.7127080917358398,
"mean_token_accuracy": 0.7654837179929018,
"num_tokens": 788484.0,
"step": 180
},
{
"entropy": 0.9775107364170253,
"epoch": 0.017915866149621054,
"grad_norm": 0.3515625,
"learning_rate": 3.1500000000000003e-06,
"loss": 0.6497589588165283,
"mean_token_accuracy": 0.723390669375658,
"num_tokens": 829584.0,
"step": 190
},
{
"entropy": 0.939525655657053,
"epoch": 0.018858806473285323,
"grad_norm": 0.5390625,
"learning_rate": 3.316666666666667e-06,
"loss": 0.8930251121520996,
"mean_token_accuracy": 0.7298649605363607,
"num_tokens": 880250.0,
"step": 200
},
{
"entropy": 0.8969364328309893,
"epoch": 0.019801746796949588,
"grad_norm": 0.4453125,
"learning_rate": 3.4833333333333336e-06,
"loss": 0.5880197048187256,
"mean_token_accuracy": 0.7570957642048597,
"num_tokens": 923548.0,
"step": 210
},
{
"entropy": 0.8533092273399234,
"epoch": 0.020744687120613853,
"grad_norm": 0.546875,
"learning_rate": 3.65e-06,
"loss": 0.588037633895874,
"mean_token_accuracy": 0.7782193420454859,
"num_tokens": 971736.0,
"step": 220
},
{
"entropy": 0.9134741343557835,
"epoch": 0.02168762744427812,
"grad_norm": 0.6640625,
"learning_rate": 3.816666666666667e-06,
"loss": 0.7983614444732666,
"mean_token_accuracy": 0.7581239463761449,
"num_tokens": 1017995.0,
"step": 230
},
{
"entropy": 0.9609160049818456,
"epoch": 0.022630567767942388,
"grad_norm": 0.4140625,
"learning_rate": 3.983333333333334e-06,
"loss": 0.8104394912719727,
"mean_token_accuracy": 0.7391819234937429,
"num_tokens": 1067131.0,
"step": 240
},
{
"entropy": 0.7141571814659983,
"epoch": 0.023573508091606653,
"grad_norm": 0.47265625,
"learning_rate": 4.15e-06,
"loss": 0.5877416133880615,
"mean_token_accuracy": 0.794341066479683,
"num_tokens": 1115898.0,
"step": 250
},
{
"entropy": 0.8112523064017296,
"epoch": 0.024516448415270918,
"grad_norm": 0.328125,
"learning_rate": 4.316666666666667e-06,
"loss": 0.6444027900695801,
"mean_token_accuracy": 0.7691240157932043,
"num_tokens": 1167517.0,
"step": 260
},
{
"entropy": 0.7751363357529044,
"epoch": 0.025459388738935183,
"grad_norm": 0.55859375,
"learning_rate": 4.483333333333333e-06,
"loss": 0.757953405380249,
"mean_token_accuracy": 0.7687718976289034,
"num_tokens": 1210826.0,
"step": 270
},
{
"entropy": 0.82865877635777,
"epoch": 0.026402329062599452,
"grad_norm": 1.0,
"learning_rate": 4.65e-06,
"loss": 0.5851547241210937,
"mean_token_accuracy": 0.7553599935024977,
"num_tokens": 1262440.0,
"step": 280
},
{
"entropy": 0.8141519343480468,
"epoch": 0.027345269386263717,
"grad_norm": 0.3671875,
"learning_rate": 4.816666666666667e-06,
"loss": 0.5882571697235107,
"mean_token_accuracy": 0.7627896059304475,
"num_tokens": 1303017.0,
"step": 290
},
{
"entropy": 0.8711584686301649,
"epoch": 0.028288209709927983,
"grad_norm": 0.34375,
"learning_rate": 4.983333333333334e-06,
"loss": 0.764805269241333,
"mean_token_accuracy": 0.7534263415262104,
"num_tokens": 1350030.0,
"step": 300
},
{
"entropy": 0.837328751757741,
"epoch": 0.029231150033592248,
"grad_norm": 0.330078125,
"learning_rate": 4.999989379352344e-06,
"loss": 0.5841926574707031,
"mean_token_accuracy": 0.77335274964571,
"num_tokens": 1397632.0,
"step": 310
},
{
"entropy": 0.9319362798705697,
"epoch": 0.030174090357256517,
"grad_norm": 1.1171875,
"learning_rate": 4.99995266611827e-06,
"loss": 0.835329818725586,
"mean_token_accuracy": 0.747077708505094,
"num_tokens": 1437635.0,
"step": 320
},
{
"entropy": 0.8836544909514487,
"epoch": 0.031117030680920782,
"grad_norm": 0.396484375,
"learning_rate": 4.9998897295636865e-06,
"loss": 0.6881571292877198,
"mean_token_accuracy": 0.7660582908429205,
"num_tokens": 1490028.0,
"step": 330
},
{
"entropy": 0.9423393627628684,
"epoch": 0.03205997100458505,
"grad_norm": 0.470703125,
"learning_rate": 4.999800570348766e-06,
"loss": 0.8963788986206055,
"mean_token_accuracy": 0.7583182919770479,
"num_tokens": 1536533.0,
"step": 340
},
{
"entropy": 0.7955392638221384,
"epoch": 0.03300291132824931,
"grad_norm": 0.48046875,
"learning_rate": 4.9996851894087494e-06,
"loss": 0.6439263820648193,
"mean_token_accuracy": 0.7917482912540436,
"num_tokens": 1588387.0,
"step": 350
},
{
"entropy": 0.9244774136692285,
"epoch": 0.03394585165191358,
"grad_norm": 0.55859375,
"learning_rate": 4.999543587953926e-06,
"loss": 0.745479154586792,
"mean_token_accuracy": 0.7643994279205799,
"num_tokens": 1628362.0,
"step": 360
},
{
"entropy": 0.7448134837672115,
"epoch": 0.03488879197557784,
"grad_norm": 0.302734375,
"learning_rate": 4.999375767469629e-06,
"loss": 0.5240091800689697,
"mean_token_accuracy": 0.8123030034825206,
"num_tokens": 1674278.0,
"step": 370
},
{
"entropy": 0.8121415632776916,
"epoch": 0.03583173229924211,
"grad_norm": 0.34375,
"learning_rate": 4.999181729716214e-06,
"loss": 0.5245255470275879,
"mean_token_accuracy": 0.7992570735514164,
"num_tokens": 1718938.0,
"step": 380
},
{
"entropy": 0.7439056454226375,
"epoch": 0.03677467262290638,
"grad_norm": 0.498046875,
"learning_rate": 4.9989614767290475e-06,
"loss": 0.5786451816558837,
"mean_token_accuracy": 0.7991266250610352,
"num_tokens": 1761197.0,
"step": 390
},
{
"entropy": 0.8094423169270157,
"epoch": 0.037717612946570646,
"grad_norm": 0.5234375,
"learning_rate": 4.998715010818479e-06,
"loss": 0.7232402324676513,
"mean_token_accuracy": 0.7819511042907834,
"num_tokens": 1802910.0,
"step": 400
},
{
"entropy": 0.8084097126498818,
"epoch": 0.03866055327023491,
"grad_norm": 0.392578125,
"learning_rate": 4.998442334569818e-06,
"loss": 0.6168120384216309,
"mean_token_accuracy": 0.7858469415456056,
"num_tokens": 1847975.0,
"step": 410
},
{
"entropy": 0.8122809613589197,
"epoch": 0.039603493593899176,
"grad_norm": 0.423828125,
"learning_rate": 4.9981434508433106e-06,
"loss": 0.5653482913970947,
"mean_token_accuracy": 0.7861449956893921,
"num_tokens": 1898331.0,
"step": 420
},
{
"entropy": 0.8453013042919337,
"epoch": 0.04054643391756344,
"grad_norm": 0.53515625,
"learning_rate": 4.9978183627741036e-06,
"loss": 0.6866735458374024,
"mean_token_accuracy": 0.769303709641099,
"num_tokens": 1943346.0,
"step": 430
},
{
"entropy": 0.7795825297012925,
"epoch": 0.04148937424122771,
"grad_norm": 0.396484375,
"learning_rate": 4.997467073772219e-06,
"loss": 0.5773806095123291,
"mean_token_accuracy": 0.790226286277175,
"num_tokens": 1986104.0,
"step": 440
},
{
"entropy": 0.7945893675088882,
"epoch": 0.04243231456489197,
"grad_norm": 0.5546875,
"learning_rate": 4.997089587522511e-06,
"loss": 0.6738276958465577,
"mean_token_accuracy": 0.7983880737796426,
"num_tokens": 2034829.0,
"step": 450
},
{
"entropy": 0.7780243606306613,
"epoch": 0.04337525488855624,
"grad_norm": 0.546875,
"learning_rate": 4.996685907984634e-06,
"loss": 0.6213938236236572,
"mean_token_accuracy": 0.778583624586463,
"num_tokens": 2080729.0,
"step": 460
},
{
"entropy": 0.8474339607171715,
"epoch": 0.04431819521222051,
"grad_norm": 0.45703125,
"learning_rate": 4.996256039392993e-06,
"loss": 0.7563930511474609,
"mean_token_accuracy": 0.7770253024995327,
"num_tokens": 2127423.0,
"step": 470
},
{
"entropy": 0.7664846159517765,
"epoch": 0.045261135535884775,
"grad_norm": 0.8515625,
"learning_rate": 4.9957999862567054e-06,
"loss": 0.6358477592468261,
"mean_token_accuracy": 0.7809185341000557,
"num_tokens": 2176434.0,
"step": 480
},
{
"entropy": 0.8652129575610161,
"epoch": 0.04620407585954904,
"grad_norm": 0.47265625,
"learning_rate": 4.995317753359555e-06,
"loss": 0.7163708209991455,
"mean_token_accuracy": 0.7767861977219581,
"num_tokens": 2227826.0,
"step": 490
},
{
"entropy": 0.749835775885731,
"epoch": 0.047147016183213306,
"grad_norm": 0.57421875,
"learning_rate": 4.994809345759936e-06,
"loss": 0.6652904033660889,
"mean_token_accuracy": 0.799538579583168,
"num_tokens": 2268858.0,
"step": 500
},
{
"entropy": 0.7915277570486069,
"epoch": 0.04808995650687757,
"grad_norm": 0.65625,
"learning_rate": 4.994274768790804e-06,
"loss": 0.7498304843902588,
"mean_token_accuracy": 0.7831572480499744,
"num_tokens": 2310420.0,
"step": 510
},
{
"entropy": 0.8275801884941757,
"epoch": 0.049032896830541836,
"grad_norm": 0.5390625,
"learning_rate": 4.993714028059617e-06,
"loss": 0.6858491420745849,
"mean_token_accuracy": 0.7689583929255605,
"num_tokens": 2351284.0,
"step": 520
},
{
"entropy": 0.8296442488208413,
"epoch": 0.0499758371542061,
"grad_norm": 0.7265625,
"learning_rate": 4.993127129448281e-06,
"loss": 0.783640718460083,
"mean_token_accuracy": 0.7797811217606068,
"num_tokens": 2399931.0,
"step": 530
},
{
"entropy": 0.7026577349752188,
"epoch": 0.05091877747787037,
"grad_norm": 0.341796875,
"learning_rate": 4.992514079113085e-06,
"loss": 0.5345718383789062,
"mean_token_accuracy": 0.8149769268929958,
"num_tokens": 2443358.0,
"step": 540
},
{
"entropy": 0.8745481946505607,
"epoch": 0.05186171780153463,
"grad_norm": 1.1171875,
"learning_rate": 4.991874883484636e-06,
"loss": 0.7263978004455567,
"mean_token_accuracy": 0.7751286920160055,
"num_tokens": 2485947.0,
"step": 550
},
{
"entropy": 0.7575348360463977,
"epoch": 0.052804658125198904,
"grad_norm": 0.380859375,
"learning_rate": 4.991209549267793e-06,
"loss": 0.6377761363983154,
"mean_token_accuracy": 0.8040944354608655,
"num_tokens": 2530402.0,
"step": 560
},
{
"entropy": 0.9096321894787252,
"epoch": 0.05374759844886317,
"grad_norm": 0.7109375,
"learning_rate": 4.9905180834416e-06,
"loss": 1.0087954521179199,
"mean_token_accuracy": 0.7766659688204527,
"num_tokens": 2571237.0,
"step": 570
},
{
"entropy": 0.8211571240797639,
"epoch": 0.054690538772527435,
"grad_norm": 0.34765625,
"learning_rate": 4.989800493259204e-06,
"loss": 0.6053966522216797,
"mean_token_accuracy": 0.783365786075592,
"num_tokens": 2619202.0,
"step": 580
},
{
"entropy": 0.8075054436922073,
"epoch": 0.0556334790961917,
"grad_norm": 0.439453125,
"learning_rate": 4.989056786247788e-06,
"loss": 0.7344274520874023,
"mean_token_accuracy": 0.7819651760160923,
"num_tokens": 2668876.0,
"step": 590
},
{
"entropy": 0.8033788122236729,
"epoch": 0.056576419419855965,
"grad_norm": 0.2314453125,
"learning_rate": 4.988286970208484e-06,
"loss": 0.5867619991302491,
"mean_token_accuracy": 0.7901865538209677,
"num_tokens": 2720273.0,
"step": 600
},
{
"entropy": 0.8459454836323858,
"epoch": 0.05751935974352023,
"grad_norm": 0.462890625,
"learning_rate": 4.9874910532163e-06,
"loss": 0.6807960987091064,
"mean_token_accuracy": 0.7898602165281773,
"num_tokens": 2767675.0,
"step": 610
},
{
"entropy": 0.7156997710466385,
"epoch": 0.058462300067184496,
"grad_norm": 0.76171875,
"learning_rate": 4.986669043620029e-06,
"loss": 0.6528503894805908,
"mean_token_accuracy": 0.8035624513402582,
"num_tokens": 2809140.0,
"step": 620
},
{
"entropy": 0.7602013352327048,
"epoch": 0.05940524039084876,
"grad_norm": 0.6328125,
"learning_rate": 4.985820950042161e-06,
"loss": 0.613498592376709,
"mean_token_accuracy": 0.797001127153635,
"num_tokens": 2849972.0,
"step": 630
},
{
"entropy": 0.819284772220999,
"epoch": 0.06034818071451303,
"grad_norm": 0.361328125,
"learning_rate": 4.984946781378797e-06,
"loss": 0.7385236740112304,
"mean_token_accuracy": 0.7713361542671919,
"num_tokens": 2892749.0,
"step": 640
},
{
"entropy": 0.694091964699328,
"epoch": 0.0612911210381773,
"grad_norm": 0.408203125,
"learning_rate": 4.9840465467995535e-06,
"loss": 0.6021022796630859,
"mean_token_accuracy": 0.8121187005192041,
"num_tokens": 2940704.0,
"step": 650
},
{
"entropy": 0.6857697816565633,
"epoch": 0.062234061361841564,
"grad_norm": 0.7109375,
"learning_rate": 4.983120255747464e-06,
"loss": 0.5373991966247559,
"mean_token_accuracy": 0.81699233725667,
"num_tokens": 2986358.0,
"step": 660
},
{
"entropy": 0.8100536063313484,
"epoch": 0.06317700168550583,
"grad_norm": 0.69140625,
"learning_rate": 4.982167917938885e-06,
"loss": 0.6947032451629639,
"mean_token_accuracy": 0.7735116362571717,
"num_tokens": 3019506.0,
"step": 670
},
{
"entropy": 0.8745680207386612,
"epoch": 0.0641199420091701,
"grad_norm": 0.392578125,
"learning_rate": 4.981189543363389e-06,
"loss": 0.6408730030059815,
"mean_token_accuracy": 0.7711815811693669,
"num_tokens": 3062042.0,
"step": 680
},
{
"entropy": 0.8105671038851142,
"epoch": 0.06506288233283436,
"grad_norm": 0.5546875,
"learning_rate": 4.98018514228366e-06,
"loss": 0.6767678260803223,
"mean_token_accuracy": 0.774928280338645,
"num_tokens": 3113758.0,
"step": 690
},
{
"entropy": 0.7323714484460652,
"epoch": 0.06600582265649863,
"grad_norm": 0.287109375,
"learning_rate": 4.979154725235392e-06,
"loss": 0.5733721733093262,
"mean_token_accuracy": 0.808050155825913,
"num_tokens": 3163234.0,
"step": 700
},
{
"entropy": 0.8353265615180134,
"epoch": 0.06694876298016289,
"grad_norm": 0.392578125,
"learning_rate": 4.978098303027173e-06,
"loss": 0.6160747528076171,
"mean_token_accuracy": 0.7780146349221468,
"num_tokens": 3207175.0,
"step": 710
},
{
"entropy": 0.7545118189416826,
"epoch": 0.06789170330382716,
"grad_norm": 0.275390625,
"learning_rate": 4.9770158867403705e-06,
"loss": 0.5270243644714355,
"mean_token_accuracy": 0.7902896221727133,
"num_tokens": 3253721.0,
"step": 720
},
{
"entropy": 0.7230144888162613,
"epoch": 0.06883464362749142,
"grad_norm": 0.6640625,
"learning_rate": 4.975907487729021e-06,
"loss": 0.6117719173431396,
"mean_token_accuracy": 0.8142276495695114,
"num_tokens": 3298677.0,
"step": 730
},
{
"entropy": 0.6818190900608897,
"epoch": 0.06977758395115569,
"grad_norm": 0.64453125,
"learning_rate": 4.974773117619703e-06,
"loss": 0.6048723220825195,
"mean_token_accuracy": 0.8080967217683792,
"num_tokens": 3341867.0,
"step": 740
},
{
"entropy": 0.7368672281503678,
"epoch": 0.07072052427481995,
"grad_norm": 0.54296875,
"learning_rate": 4.973612788311424e-06,
"loss": 0.6020387649536133,
"mean_token_accuracy": 0.7991985162720084,
"num_tokens": 3382805.0,
"step": 750
},
{
"entropy": 0.8011913444846869,
"epoch": 0.07166346459848422,
"grad_norm": 0.71875,
"learning_rate": 4.972426511975489e-06,
"loss": 0.741117525100708,
"mean_token_accuracy": 0.7860968332737684,
"num_tokens": 3425539.0,
"step": 760
},
{
"entropy": 0.7815477557480335,
"epoch": 0.0726064049221485,
"grad_norm": 0.6953125,
"learning_rate": 4.971214301055376e-06,
"loss": 0.6468725204467773,
"mean_token_accuracy": 0.7957555901259183,
"num_tokens": 3468481.0,
"step": 770
},
{
"entropy": 0.7002213094383478,
"epoch": 0.07354934524581276,
"grad_norm": 0.318359375,
"learning_rate": 4.9699761682666026e-06,
"loss": 0.4705470085144043,
"mean_token_accuracy": 0.7878050077706575,
"num_tokens": 3513800.0,
"step": 780
},
{
"entropy": 0.7421004495583474,
"epoch": 0.07449228556947703,
"grad_norm": 0.33203125,
"learning_rate": 4.968712126596598e-06,
"loss": 0.6162665843963623,
"mean_token_accuracy": 0.8012846134603023,
"num_tokens": 3554346.0,
"step": 790
},
{
"entropy": 0.7171782004646957,
"epoch": 0.07543522589314129,
"grad_norm": 0.330078125,
"learning_rate": 4.967422189304558e-06,
"loss": 0.5965607643127442,
"mean_token_accuracy": 0.7875219449400902,
"num_tokens": 3606796.0,
"step": 800
},
{
"entropy": 0.7832795661874116,
"epoch": 0.07637816621680556,
"grad_norm": 0.369140625,
"learning_rate": 4.966106369921317e-06,
"loss": 0.602449369430542,
"mean_token_accuracy": 0.7922013100236655,
"num_tokens": 3647649.0,
"step": 810
},
{
"entropy": 0.8182275678031147,
"epoch": 0.07732110654046982,
"grad_norm": 1.046875,
"learning_rate": 4.964764682249197e-06,
"loss": 0.7580663681030273,
"mean_token_accuracy": 0.7738244906067848,
"num_tokens": 3695788.0,
"step": 820
},
{
"entropy": 0.8186208296567201,
"epoch": 0.07826404686413409,
"grad_norm": 0.77734375,
"learning_rate": 4.963397140361868e-06,
"loss": 0.6980972766876221,
"mean_token_accuracy": 0.792484282515943,
"num_tokens": 3736836.0,
"step": 830
},
{
"entropy": 0.766120829153806,
"epoch": 0.07920698718779835,
"grad_norm": 0.44140625,
"learning_rate": 4.962003758604194e-06,
"loss": 0.7221168994903564,
"mean_token_accuracy": 0.796668940410018,
"num_tokens": 3778465.0,
"step": 840
},
{
"entropy": 0.8256865127943456,
"epoch": 0.08014992751146262,
"grad_norm": 0.47265625,
"learning_rate": 4.960584551592094e-06,
"loss": 0.6105232238769531,
"mean_token_accuracy": 0.7867782566696405,
"num_tokens": 3828031.0,
"step": 850
},
{
"entropy": 0.6507625746540725,
"epoch": 0.08109286783512688,
"grad_norm": 0.466796875,
"learning_rate": 4.959139534212375e-06,
"loss": 0.5035228252410888,
"mean_token_accuracy": 0.8218056863173843,
"num_tokens": 3880085.0,
"step": 860
},
{
"entropy": 0.7207641104236245,
"epoch": 0.08203580815879115,
"grad_norm": 0.5703125,
"learning_rate": 4.957668721622587e-06,
"loss": 0.5374783515930176,
"mean_token_accuracy": 0.8109163239598274,
"num_tokens": 3918528.0,
"step": 870
},
{
"entropy": 0.8274590659886598,
"epoch": 0.08297874848245541,
"grad_norm": 0.482421875,
"learning_rate": 4.956172129250858e-06,
"loss": 0.711448335647583,
"mean_token_accuracy": 0.785671678930521,
"num_tokens": 3961043.0,
"step": 880
},
{
"entropy": 0.7421449825167656,
"epoch": 0.08392168880611968,
"grad_norm": 0.47265625,
"learning_rate": 4.954649772795735e-06,
"loss": 0.6577060699462891,
"mean_token_accuracy": 0.7982315208762885,
"num_tokens": 4007062.0,
"step": 890
},
{
"entropy": 0.6785881833173335,
"epoch": 0.08486462912978394,
"grad_norm": 0.64453125,
"learning_rate": 4.953101668226014e-06,
"loss": 0.5841499328613281,
"mean_token_accuracy": 0.8102574732154608,
"num_tokens": 4062219.0,
"step": 900
},
{
"entropy": 0.732798031810671,
"epoch": 0.08580756945344821,
"grad_norm": 1.046875,
"learning_rate": 4.951527831780583e-06,
"loss": 0.6197251319885254,
"mean_token_accuracy": 0.796886844933033,
"num_tokens": 4111022.0,
"step": 910
},
{
"entropy": 0.80500507671386,
"epoch": 0.08675050977711248,
"grad_norm": 0.51953125,
"learning_rate": 4.949928279968238e-06,
"loss": 0.6231956005096435,
"mean_token_accuracy": 0.7846117116510868,
"num_tokens": 4151597.0,
"step": 920
},
{
"entropy": 0.7407358650118112,
"epoch": 0.08769345010077674,
"grad_norm": 0.357421875,
"learning_rate": 4.948303029567523e-06,
"loss": 0.5905776023864746,
"mean_token_accuracy": 0.7902860388159751,
"num_tokens": 4205660.0,
"step": 930
},
{
"entropy": 0.8730802398175002,
"epoch": 0.08863639042444102,
"grad_norm": 0.40234375,
"learning_rate": 4.946652097626544e-06,
"loss": 0.6360596656799317,
"mean_token_accuracy": 0.7667682899162174,
"num_tokens": 4252923.0,
"step": 940
},
{
"entropy": 0.7542075706645847,
"epoch": 0.08957933074810528,
"grad_norm": 0.28125,
"learning_rate": 4.944975501462797e-06,
"loss": 0.6091949462890625,
"mean_token_accuracy": 0.8042812138795853,
"num_tokens": 4305703.0,
"step": 950
},
{
"entropy": 0.6663548903539777,
"epoch": 0.09052227107176955,
"grad_norm": 0.5625,
"learning_rate": 4.943273258662982e-06,
"loss": 0.5946632385253906,
"mean_token_accuracy": 0.8140654802322388,
"num_tokens": 4351819.0,
"step": 960
},
{
"entropy": 0.8968982026912272,
"epoch": 0.09146521139543382,
"grad_norm": 0.7421875,
"learning_rate": 4.941545387082821e-06,
"loss": 0.7777196884155273,
"mean_token_accuracy": 0.7636161763221025,
"num_tokens": 4402994.0,
"step": 970
},
{
"entropy": 0.7275657393038273,
"epoch": 0.09240815171909808,
"grad_norm": 0.7734375,
"learning_rate": 4.939791904846869e-06,
"loss": 0.692138671875,
"mean_token_accuracy": 0.796290036663413,
"num_tokens": 4443896.0,
"step": 980
},
{
"entropy": 0.8022994266822934,
"epoch": 0.09335109204276235,
"grad_norm": 1.15625,
"learning_rate": 4.938012830348325e-06,
"loss": 0.7263329029083252,
"mean_token_accuracy": 0.7886364821344614,
"num_tokens": 4489361.0,
"step": 990
},
{
"entropy": 0.7677907293662429,
"epoch": 0.09429403236642661,
"grad_norm": 0.30078125,
"learning_rate": 4.936208182248838e-06,
"loss": 0.7098466396331787,
"mean_token_accuracy": 0.7836588025093079,
"num_tokens": 4538560.0,
"step": 1000
},
{
"entropy": 0.7540503291413188,
"epoch": 0.09523697269009088,
"grad_norm": 0.306640625,
"learning_rate": 4.934377979478312e-06,
"loss": 0.6721164226531983,
"mean_token_accuracy": 0.774369165673852,
"num_tokens": 4582185.0,
"step": 1010
},
{
"entropy": 0.7057674110867083,
"epoch": 0.09617991301375514,
"grad_norm": 0.5625,
"learning_rate": 4.932522241234711e-06,
"loss": 0.5665208339691162,
"mean_token_accuracy": 0.8124939866364003,
"num_tokens": 4624388.0,
"step": 1020
},
{
"entropy": 0.7860274084843695,
"epoch": 0.09712285333741941,
"grad_norm": 0.87109375,
"learning_rate": 4.9306409869838475e-06,
"loss": 0.627524471282959,
"mean_token_accuracy": 0.7900194443762303,
"num_tokens": 4664734.0,
"step": 1030
},
{
"entropy": 0.6265595956705511,
"epoch": 0.09806579366108367,
"grad_norm": 0.255859375,
"learning_rate": 4.928734236459191e-06,
"loss": 0.47365193367004393,
"mean_token_accuracy": 0.8303351975977421,
"num_tokens": 4718449.0,
"step": 1040
},
{
"entropy": 0.8842747121118009,
"epoch": 0.09900873398474794,
"grad_norm": 0.478515625,
"learning_rate": 4.926802009661651e-06,
"loss": 0.9802035331726074,
"mean_token_accuracy": 0.7524257987737656,
"num_tokens": 4763508.0,
"step": 1050
},
{
"entropy": 0.8015215817838908,
"epoch": 0.0999516743084122,
"grad_norm": 0.47265625,
"learning_rate": 4.9248443268593724e-06,
"loss": 0.683444595336914,
"mean_token_accuracy": 0.7799651555716991,
"num_tokens": 4808857.0,
"step": 1060
},
{
"entropy": 0.7447168783284723,
"epoch": 0.10089461463207647,
"grad_norm": 0.83984375,
"learning_rate": 4.922861208587522e-06,
"loss": 0.6439436435699463,
"mean_token_accuracy": 0.8069465953856707,
"num_tokens": 4849125.0,
"step": 1070
},
{
"entropy": 0.7262563842348755,
"epoch": 0.10183755495574073,
"grad_norm": 0.3359375,
"learning_rate": 4.920852675648071e-06,
"loss": 0.5818546772003174,
"mean_token_accuracy": 0.8100180253386497,
"num_tokens": 4895597.0,
"step": 1080
},
{
"entropy": 0.7206171770580113,
"epoch": 0.102780495279405,
"grad_norm": 0.5546875,
"learning_rate": 4.918818749109581e-06,
"loss": 0.6229705333709716,
"mean_token_accuracy": 0.8035074207931757,
"num_tokens": 4938109.0,
"step": 1090
},
{
"entropy": 0.8021614892408252,
"epoch": 0.10372343560306926,
"grad_norm": 0.5703125,
"learning_rate": 4.9167594503069785e-06,
"loss": 0.6964336395263672,
"mean_token_accuracy": 0.7762649796903134,
"num_tokens": 4981562.0,
"step": 1100
},
{
"entropy": 0.7161757604219019,
"epoch": 0.10466637592673354,
"grad_norm": 0.263671875,
"learning_rate": 4.914674800841332e-06,
"loss": 0.747713851928711,
"mean_token_accuracy": 0.8009138405323029,
"num_tokens": 5028887.0,
"step": 1110
},
{
"entropy": 0.7790245489217341,
"epoch": 0.10560931625039781,
"grad_norm": 0.5234375,
"learning_rate": 4.91256482257963e-06,
"loss": 0.6210433006286621,
"mean_token_accuracy": 0.7918234229087829,
"num_tokens": 5068901.0,
"step": 1120
},
{
"entropy": 0.7243750081397593,
"epoch": 0.10655225657406207,
"grad_norm": 0.455078125,
"learning_rate": 4.910429537654544e-06,
"loss": 0.6189009666442871,
"mean_token_accuracy": 0.7888242486864329,
"num_tokens": 5122274.0,
"step": 1130
},
{
"entropy": 0.7725613342598081,
"epoch": 0.10749519689772634,
"grad_norm": 0.57421875,
"learning_rate": 4.908268968464205e-06,
"loss": 0.6020617485046387,
"mean_token_accuracy": 0.7757980896160006,
"num_tokens": 5171661.0,
"step": 1140
},
{
"entropy": 0.7940086780115962,
"epoch": 0.1084381372213906,
"grad_norm": 0.73046875,
"learning_rate": 4.9060831376719585e-06,
"loss": 0.6493505001068115,
"mean_token_accuracy": 0.7813464991748333,
"num_tokens": 5218273.0,
"step": 1150
},
{
"entropy": 0.6979408304207027,
"epoch": 0.10938107754505487,
"grad_norm": 0.8671875,
"learning_rate": 4.903872068206138e-06,
"loss": 0.6040244102478027,
"mean_token_accuracy": 0.8104764647781849,
"num_tokens": 5259478.0,
"step": 1160
},
{
"entropy": 0.7056857038289308,
"epoch": 0.11032401786871913,
"grad_norm": 0.353515625,
"learning_rate": 4.9016357832598135e-06,
"loss": 0.5862742900848389,
"mean_token_accuracy": 0.8063552943989635,
"num_tokens": 5302993.0,
"step": 1170
},
{
"entropy": 0.7344408438540995,
"epoch": 0.1112669581923834,
"grad_norm": 0.279296875,
"learning_rate": 4.899374306290558e-06,
"loss": 0.7177176952362061,
"mean_token_accuracy": 0.805981208384037,
"num_tokens": 5351565.0,
"step": 1180
},
{
"entropy": 0.6840172544121742,
"epoch": 0.11220989851604767,
"grad_norm": 0.416015625,
"learning_rate": 4.897087661020194e-06,
"loss": 0.5912201881408692,
"mean_token_accuracy": 0.8121493086218834,
"num_tokens": 5391537.0,
"step": 1190
},
{
"entropy": 0.7785421489737928,
"epoch": 0.11315283883971193,
"grad_norm": 0.359375,
"learning_rate": 4.894775871434548e-06,
"loss": 0.6811850547790528,
"mean_token_accuracy": 0.7836464313790202,
"num_tokens": 5428823.0,
"step": 1200
},
{
"entropy": 0.6350860029459,
"epoch": 0.1140957791633762,
"grad_norm": 0.275390625,
"learning_rate": 4.892438961783199e-06,
"loss": 0.49747395515441895,
"mean_token_accuracy": 0.8172833763062954,
"num_tokens": 5474692.0,
"step": 1210
},
{
"entropy": 0.7340997345745564,
"epoch": 0.11503871948704046,
"grad_norm": 0.330078125,
"learning_rate": 4.890076956579223e-06,
"loss": 0.5803222179412841,
"mean_token_accuracy": 0.811799717694521,
"num_tokens": 5522965.0,
"step": 1220
},
{
"entropy": 0.6614907255396247,
"epoch": 0.11598165981070473,
"grad_norm": 0.51953125,
"learning_rate": 4.887689880598938e-06,
"loss": 0.5860563755035401,
"mean_token_accuracy": 0.8119680780917407,
"num_tokens": 5572615.0,
"step": 1230
},
{
"entropy": 0.8880835673771799,
"epoch": 0.11692460013436899,
"grad_norm": 0.54296875,
"learning_rate": 4.885277758881641e-06,
"loss": 0.7023919105529786,
"mean_token_accuracy": 0.7654352005571127,
"num_tokens": 5615891.0,
"step": 1240
},
{
"entropy": 0.7018857408314944,
"epoch": 0.11786754045803326,
"grad_norm": 0.6640625,
"learning_rate": 4.882840616729347e-06,
"loss": 0.615167760848999,
"mean_token_accuracy": 0.7958494182676077,
"num_tokens": 5666242.0,
"step": 1250
},
{
"entropy": 0.8410587665624917,
"epoch": 0.11881048078169752,
"grad_norm": 0.330078125,
"learning_rate": 4.880378479706525e-06,
"loss": 0.6831368446350098,
"mean_token_accuracy": 0.7757596135139465,
"num_tokens": 5714622.0,
"step": 1260
},
{
"entropy": 0.7477244296111166,
"epoch": 0.11975342110536179,
"grad_norm": 0.515625,
"learning_rate": 4.877891373639824e-06,
"loss": 0.5684638977050781,
"mean_token_accuracy": 0.8081520074978471,
"num_tokens": 5762489.0,
"step": 1270
},
{
"entropy": 0.8104454580694437,
"epoch": 0.12069636142902607,
"grad_norm": 0.51953125,
"learning_rate": 4.875379324617815e-06,
"loss": 0.5815711975097656,
"mean_token_accuracy": 0.781415050663054,
"num_tokens": 5799123.0,
"step": 1280
},
{
"entropy": 0.6935905188322067,
"epoch": 0.12163930175269033,
"grad_norm": 0.435546875,
"learning_rate": 4.872842358990701e-06,
"loss": 0.6138697147369385,
"mean_token_accuracy": 0.797416203096509,
"num_tokens": 5849061.0,
"step": 1290
},
{
"entropy": 0.7854719746857881,
"epoch": 0.1225822420763546,
"grad_norm": 0.349609375,
"learning_rate": 4.87028050337005e-06,
"loss": 0.5638726711273193,
"mean_token_accuracy": 0.7877143463119864,
"num_tokens": 5890604.0,
"step": 1300
},
{
"entropy": 0.8234432382509113,
"epoch": 0.12352518240001886,
"grad_norm": 0.3984375,
"learning_rate": 4.867693784628516e-06,
"loss": 0.6471819877624512,
"mean_token_accuracy": 0.7767364744096994,
"num_tokens": 5932967.0,
"step": 1310
},
{
"entropy": 0.7679943142458796,
"epoch": 0.12446812272368313,
"grad_norm": 0.50390625,
"learning_rate": 4.865082229899554e-06,
"loss": 0.6443884372711182,
"mean_token_accuracy": 0.7849613726139069,
"num_tokens": 5973382.0,
"step": 1320
},
{
"entropy": 0.6430552182719111,
"epoch": 0.1254110630473474,
"grad_norm": 0.63671875,
"learning_rate": 4.862445866577138e-06,
"loss": 0.58107008934021,
"mean_token_accuracy": 0.8114496625959873,
"num_tokens": 6021337.0,
"step": 1330
},
{
"entropy": 0.7372513002716005,
"epoch": 0.12635400337101166,
"grad_norm": 0.447265625,
"learning_rate": 4.859784722315472e-06,
"loss": 0.6992315769195556,
"mean_token_accuracy": 0.7826294297352433,
"num_tokens": 6077344.0,
"step": 1340
},
{
"entropy": 0.8189116214867681,
"epoch": 0.12729694369467592,
"grad_norm": 0.53515625,
"learning_rate": 4.857098825028701e-06,
"loss": 0.7671550750732422,
"mean_token_accuracy": 0.7946853101253509,
"num_tokens": 6119359.0,
"step": 1350
},
{
"entropy": 0.7827853210270405,
"epoch": 0.1282398840183402,
"grad_norm": 0.376953125,
"learning_rate": 4.854388202890614e-06,
"loss": 0.7045656681060791,
"mean_token_accuracy": 0.7913773000240326,
"num_tokens": 6160311.0,
"step": 1360
},
{
"entropy": 0.7482062807306648,
"epoch": 0.12918282434200445,
"grad_norm": 0.3984375,
"learning_rate": 4.851652884334356e-06,
"loss": 0.7099195957183838,
"mean_token_accuracy": 0.7907620433717966,
"num_tokens": 6201115.0,
"step": 1370
},
{
"entropy": 0.73036635722965,
"epoch": 0.13012576466566872,
"grad_norm": 0.265625,
"learning_rate": 4.848892898052125e-06,
"loss": 0.5717474937438964,
"mean_token_accuracy": 0.8052898969501256,
"num_tokens": 6248167.0,
"step": 1380
},
{
"entropy": 0.6847926998510957,
"epoch": 0.13106870498933298,
"grad_norm": 0.5859375,
"learning_rate": 4.84610827299487e-06,
"loss": 0.6278266906738281,
"mean_token_accuracy": 0.8036519877612591,
"num_tokens": 6290393.0,
"step": 1390
},
{
"entropy": 0.6735235895961523,
"epoch": 0.13201164531299725,
"grad_norm": 0.33203125,
"learning_rate": 4.843299038371991e-06,
"loss": 0.6215836048126221,
"mean_token_accuracy": 0.8117277476936579,
"num_tokens": 6342860.0,
"step": 1400
},
{
"entropy": 0.7760428190231323,
"epoch": 0.13295458563666152,
"grad_norm": 0.60546875,
"learning_rate": 4.840465223651029e-06,
"loss": 0.5304702281951904,
"mean_token_accuracy": 0.7894374314695597,
"num_tokens": 6389987.0,
"step": 1410
},
{
"entropy": 0.751918163895607,
"epoch": 0.13389752596032578,
"grad_norm": 0.52734375,
"learning_rate": 4.83760685855736e-06,
"loss": 0.6945547580718994,
"mean_token_accuracy": 0.8058279521763325,
"num_tokens": 6435158.0,
"step": 1420
},
{
"entropy": 0.6316566719673574,
"epoch": 0.13484046628399005,
"grad_norm": 0.8515625,
"learning_rate": 4.834723973073882e-06,
"loss": 0.5147292613983154,
"mean_token_accuracy": 0.8109463810920715,
"num_tokens": 6483159.0,
"step": 1430
},
{
"entropy": 0.8705680920742452,
"epoch": 0.1357834066076543,
"grad_norm": 0.68359375,
"learning_rate": 4.831816597440697e-06,
"loss": 0.7946212291717529,
"mean_token_accuracy": 0.7745383739471435,
"num_tokens": 6531589.0,
"step": 1440
},
{
"entropy": 0.6937490504235029,
"epoch": 0.13672634693131858,
"grad_norm": 0.41796875,
"learning_rate": 4.828884762154803e-06,
"loss": 0.5019688606262207,
"mean_token_accuracy": 0.8086294280365109,
"num_tokens": 6582550.0,
"step": 1450
},
{
"entropy": 0.6883674585260451,
"epoch": 0.13766928725498284,
"grad_norm": 0.318359375,
"learning_rate": 4.825928497969763e-06,
"loss": 0.5822939395904541,
"mean_token_accuracy": 0.8153205912560224,
"num_tokens": 6623531.0,
"step": 1460
},
{
"entropy": 0.7426637164317071,
"epoch": 0.1386122275786471,
"grad_norm": 0.48046875,
"learning_rate": 4.822947835895389e-06,
"loss": 0.6456994533538818,
"mean_token_accuracy": 0.7916014738380909,
"num_tokens": 6670087.0,
"step": 1470
},
{
"entropy": 0.7368132835254073,
"epoch": 0.13955516790231137,
"grad_norm": 0.34375,
"learning_rate": 4.819942807197417e-06,
"loss": 0.6506009578704834,
"mean_token_accuracy": 0.8058517042547464,
"num_tokens": 6719389.0,
"step": 1480
},
{
"entropy": 0.8392926104366779,
"epoch": 0.14049810822597564,
"grad_norm": 0.5234375,
"learning_rate": 4.816913443397176e-06,
"loss": 0.6899060726165771,
"mean_token_accuracy": 0.7871105581521988,
"num_tokens": 6761161.0,
"step": 1490
},
{
"entropy": 0.7088076891377568,
"epoch": 0.1414410485496399,
"grad_norm": 0.330078125,
"learning_rate": 4.813859776271258e-06,
"loss": 0.510068130493164,
"mean_token_accuracy": 0.8044612921774388,
"num_tokens": 6805745.0,
"step": 1500
},
{
"entropy": 0.6664590669795871,
"epoch": 0.14238398887330417,
"grad_norm": 0.3515625,
"learning_rate": 4.810781837851186e-06,
"loss": 0.5675896644592285,
"mean_token_accuracy": 0.80593893378973,
"num_tokens": 6850831.0,
"step": 1510
},
{
"entropy": 0.7449090665206313,
"epoch": 0.14332692919696843,
"grad_norm": 0.6796875,
"learning_rate": 4.807679660423078e-06,
"loss": 0.7466594696044921,
"mean_token_accuracy": 0.7963773109018802,
"num_tokens": 6893372.0,
"step": 1520
},
{
"entropy": 0.6773676542565227,
"epoch": 0.14426986952063273,
"grad_norm": 0.267578125,
"learning_rate": 4.8045532765273085e-06,
"loss": 0.5410051822662354,
"mean_token_accuracy": 0.8197047363966703,
"num_tokens": 6942690.0,
"step": 1530
},
{
"entropy": 0.8294754406437278,
"epoch": 0.145212809844297,
"grad_norm": 0.474609375,
"learning_rate": 4.801402718958162e-06,
"loss": 0.5964238166809082,
"mean_token_accuracy": 0.7812088407576084,
"num_tokens": 6995335.0,
"step": 1540
},
{
"entropy": 0.8663926181383431,
"epoch": 0.14615575016796126,
"grad_norm": 0.369140625,
"learning_rate": 4.798228020763501e-06,
"loss": 0.5792275905609131,
"mean_token_accuracy": 0.7707085549831391,
"num_tokens": 7048539.0,
"step": 1550
},
{
"entropy": 0.7147080856608227,
"epoch": 0.14709869049162552,
"grad_norm": 0.36328125,
"learning_rate": 4.795029215244403e-06,
"loss": 0.5165563583374023,
"mean_token_accuracy": 0.7946837220340968,
"num_tokens": 7094588.0,
"step": 1560
},
{
"entropy": 0.8003142789937556,
"epoch": 0.1480416308152898,
"grad_norm": 0.3203125,
"learning_rate": 4.7918063359548274e-06,
"loss": 0.5031931877136231,
"mean_token_accuracy": 0.7990253180265426,
"num_tokens": 7138857.0,
"step": 1570
},
{
"entropy": 0.7444701816886663,
"epoch": 0.14898457113895405,
"grad_norm": 0.490234375,
"learning_rate": 4.788559416701251e-06,
"loss": 0.62364182472229,
"mean_token_accuracy": 0.800935186818242,
"num_tokens": 7181093.0,
"step": 1580
},
{
"entropy": 0.768458298034966,
"epoch": 0.14992751146261832,
"grad_norm": 0.5234375,
"learning_rate": 4.785288491542322e-06,
"loss": 0.6315382480621338,
"mean_token_accuracy": 0.7936431773006916,
"num_tokens": 7225622.0,
"step": 1590
},
{
"entropy": 0.6673228033818305,
"epoch": 0.15087045178628258,
"grad_norm": 0.421875,
"learning_rate": 4.781993594788496e-06,
"loss": 0.5698256015777587,
"mean_token_accuracy": 0.8094664443284273,
"num_tokens": 7272191.0,
"step": 1600
},
{
"entropy": 0.6132199401967228,
"epoch": 0.15181339210994685,
"grad_norm": 0.451171875,
"learning_rate": 4.778674761001681e-06,
"loss": 0.637981653213501,
"mean_token_accuracy": 0.8249839577823878,
"num_tokens": 7320397.0,
"step": 1610
},
{
"entropy": 0.6754366432316601,
"epoch": 0.15275633243361111,
"grad_norm": 0.203125,
"learning_rate": 4.775332024994874e-06,
"loss": 0.4907213687896729,
"mean_token_accuracy": 0.8176268842071295,
"num_tokens": 7369385.0,
"step": 1620
},
{
"entropy": 0.6628142113331705,
"epoch": 0.15369927275727538,
"grad_norm": 0.4375,
"learning_rate": 4.771965421831792e-06,
"loss": 0.5297084331512452,
"mean_token_accuracy": 0.8210704285651446,
"num_tokens": 7418922.0,
"step": 1630
},
{
"entropy": 0.743092224188149,
"epoch": 0.15464221308093964,
"grad_norm": 0.294921875,
"learning_rate": 4.768574986826513e-06,
"loss": 0.7004957675933838,
"mean_token_accuracy": 0.8017095427960157,
"num_tokens": 7470971.0,
"step": 1640
},
{
"entropy": 0.839415866136551,
"epoch": 0.1555851534046039,
"grad_norm": 0.470703125,
"learning_rate": 4.765160755543091e-06,
"loss": 0.8255781173706055,
"mean_token_accuracy": 0.7637870293110609,
"num_tokens": 7515243.0,
"step": 1650
},
{
"entropy": 0.6935912227258086,
"epoch": 0.15652809372826818,
"grad_norm": 0.2578125,
"learning_rate": 4.7617227637952e-06,
"loss": 0.5783330917358398,
"mean_token_accuracy": 0.8085279129445553,
"num_tokens": 7564417.0,
"step": 1660
},
{
"entropy": 0.7936397315002978,
"epoch": 0.15747103405193244,
"grad_norm": 0.75,
"learning_rate": 4.758261047645745e-06,
"loss": 0.6287306785583496,
"mean_token_accuracy": 0.7835016187280417,
"num_tokens": 7612569.0,
"step": 1670
},
{
"entropy": 0.6750403906218707,
"epoch": 0.1584139743755967,
"grad_norm": 0.271484375,
"learning_rate": 4.7547756434064916e-06,
"loss": 0.5946949005126954,
"mean_token_accuracy": 0.8034364454448223,
"num_tokens": 7657765.0,
"step": 1680
},
{
"entropy": 0.7698115283623338,
"epoch": 0.15935691469926097,
"grad_norm": 0.875,
"learning_rate": 4.751266587637681e-06,
"loss": 0.679727029800415,
"mean_token_accuracy": 0.7859929338097572,
"num_tokens": 7692933.0,
"step": 1690
},
{
"entropy": 0.731985289696604,
"epoch": 0.16029985502292524,
"grad_norm": 0.51171875,
"learning_rate": 4.747733917147646e-06,
"loss": 0.6183731079101562,
"mean_token_accuracy": 0.8142067354172469,
"num_tokens": 7737759.0,
"step": 1700
},
{
"entropy": 0.7078736932948232,
"epoch": 0.1612427953465895,
"grad_norm": 0.28125,
"learning_rate": 4.744177668992429e-06,
"loss": 0.49601898193359373,
"mean_token_accuracy": 0.8192032791674138,
"num_tokens": 7782624.0,
"step": 1710
},
{
"entropy": 0.7805814618710428,
"epoch": 0.16218573567025377,
"grad_norm": 0.357421875,
"learning_rate": 4.740597880475391e-06,
"loss": 0.6345070838928223,
"mean_token_accuracy": 0.818518004193902,
"num_tokens": 7830123.0,
"step": 1720
},
{
"entropy": 0.7078598484396934,
"epoch": 0.16312867599391803,
"grad_norm": 0.259765625,
"learning_rate": 4.736994589146821e-06,
"loss": 0.6488445281982422,
"mean_token_accuracy": 0.8083903908729553,
"num_tokens": 7878591.0,
"step": 1730
},
{
"entropy": 0.6218862963840366,
"epoch": 0.1640716163175823,
"grad_norm": 0.55859375,
"learning_rate": 4.7333678328035374e-06,
"loss": 0.5586625576019287,
"mean_token_accuracy": 0.8203994080424308,
"num_tokens": 7928797.0,
"step": 1740
},
{
"entropy": 0.6412875755690038,
"epoch": 0.16501455664124656,
"grad_norm": 0.357421875,
"learning_rate": 4.729717649488499e-06,
"loss": 0.6166950225830078,
"mean_token_accuracy": 0.8231342125684022,
"num_tokens": 7972979.0,
"step": 1750
},
{
"entropy": 0.7250258160755039,
"epoch": 0.16595749696491083,
"grad_norm": 0.423828125,
"learning_rate": 4.7260440774904014e-06,
"loss": 0.5841271877288818,
"mean_token_accuracy": 0.8074738964438438,
"num_tokens": 8015392.0,
"step": 1760
},
{
"entropy": 0.6732541414909065,
"epoch": 0.1669004372885751,
"grad_norm": 0.58203125,
"learning_rate": 4.722347155343277e-06,
"loss": 0.6065329551696778,
"mean_token_accuracy": 0.8136304952204227,
"num_tokens": 8061805.0,
"step": 1770
},
{
"entropy": 0.8656071895733476,
"epoch": 0.16784337761223936,
"grad_norm": 0.337890625,
"learning_rate": 4.71862692182609e-06,
"loss": 0.8307145118713379,
"mean_token_accuracy": 0.7705816131085157,
"num_tokens": 8104858.0,
"step": 1780
},
{
"entropy": 0.7067621927708387,
"epoch": 0.16878631793590362,
"grad_norm": 0.419921875,
"learning_rate": 4.714883415962329e-06,
"loss": 0.6449962615966797,
"mean_token_accuracy": 0.8116483464837074,
"num_tokens": 8153858.0,
"step": 1790
},
{
"entropy": 0.628216756042093,
"epoch": 0.1697292582595679,
"grad_norm": 0.34375,
"learning_rate": 4.711116677019599e-06,
"loss": 0.4528506755828857,
"mean_token_accuracy": 0.8308906458318234,
"num_tokens": 8202695.0,
"step": 1800
},
{
"entropy": 0.5620249833911657,
"epoch": 0.17067219858323215,
"grad_norm": 0.27734375,
"learning_rate": 4.707326744509209e-06,
"loss": 0.6362682342529297,
"mean_token_accuracy": 0.8432179998606444,
"num_tokens": 8250847.0,
"step": 1810
},
{
"entropy": 0.711518302373588,
"epoch": 0.17161513890689642,
"grad_norm": 0.3203125,
"learning_rate": 4.7035136581857596e-06,
"loss": 0.6081731796264649,
"mean_token_accuracy": 0.8159873858094215,
"num_tokens": 8299509.0,
"step": 1820
},
{
"entropy": 0.833217189554125,
"epoch": 0.17255807923056068,
"grad_norm": 0.84375,
"learning_rate": 4.69967745804672e-06,
"loss": 0.928659725189209,
"mean_token_accuracy": 0.7771374503150582,
"num_tokens": 8335978.0,
"step": 1830
},
{
"entropy": 0.8410642127972097,
"epoch": 0.17350101955422495,
"grad_norm": 0.6171875,
"learning_rate": 4.695818184332015e-06,
"loss": 0.727938175201416,
"mean_token_accuracy": 0.7709955636411905,
"num_tokens": 8383600.0,
"step": 1840
},
{
"entropy": 0.6231134903617204,
"epoch": 0.17444395987788922,
"grad_norm": 0.5,
"learning_rate": 4.691935877523599e-06,
"loss": 0.5813844203948975,
"mean_token_accuracy": 0.8313001070171595,
"num_tokens": 8432448.0,
"step": 1850
},
{
"entropy": 0.765664404258132,
"epoch": 0.17538690020155348,
"grad_norm": 0.431640625,
"learning_rate": 4.688030578345034e-06,
"loss": 0.6016036033630371,
"mean_token_accuracy": 0.7821066498756408,
"num_tokens": 8471681.0,
"step": 1860
},
{
"entropy": 0.6680231470614671,
"epoch": 0.17632984052521777,
"grad_norm": 0.310546875,
"learning_rate": 4.684102327761061e-06,
"loss": 0.5228953838348389,
"mean_token_accuracy": 0.8138258129358291,
"num_tokens": 8520363.0,
"step": 1870
},
{
"entropy": 0.6410453176125884,
"epoch": 0.17727278084888204,
"grad_norm": 0.275390625,
"learning_rate": 4.680151166977168e-06,
"loss": 0.48765125274658205,
"mean_token_accuracy": 0.8131914135068655,
"num_tokens": 8576421.0,
"step": 1880
},
{
"entropy": 0.7159248681738972,
"epoch": 0.1782157211725463,
"grad_norm": 0.75390625,
"learning_rate": 4.676177137439164e-06,
"loss": 0.6111386299133301,
"mean_token_accuracy": 0.8026338141411543,
"num_tokens": 8617811.0,
"step": 1890
},
{
"entropy": 0.6831275760196149,
"epoch": 0.17915866149621057,
"grad_norm": 0.431640625,
"learning_rate": 4.672180280832738e-06,
"loss": 0.6701952457427979,
"mean_token_accuracy": 0.8077144119888544,
"num_tokens": 8660752.0,
"step": 1900
},
{
"entropy": 0.7076569891534745,
"epoch": 0.18010160181987483,
"grad_norm": 0.46484375,
"learning_rate": 4.668160639083023e-06,
"loss": 0.558572244644165,
"mean_token_accuracy": 0.7995935019105673,
"num_tokens": 8704690.0,
"step": 1910
},
{
"entropy": 0.7884954256005585,
"epoch": 0.1810445421435391,
"grad_norm": 0.5625,
"learning_rate": 4.664118254354161e-06,
"loss": 0.8152592658996582,
"mean_token_accuracy": 0.7849799519404769,
"num_tokens": 8745623.0,
"step": 1920
},
{
"entropy": 0.6273317654151469,
"epoch": 0.18198748246720337,
"grad_norm": 0.439453125,
"learning_rate": 4.660053169048854e-06,
"loss": 0.6315245628356934,
"mean_token_accuracy": 0.8183496780693531,
"num_tokens": 8785116.0,
"step": 1930
},
{
"entropy": 0.7881477686576546,
"epoch": 0.18293042279086763,
"grad_norm": 0.8515625,
"learning_rate": 4.655965425807922e-06,
"loss": 0.5719914436340332,
"mean_token_accuracy": 0.8004025777801871,
"num_tokens": 8829949.0,
"step": 1940
},
{
"entropy": 0.6546398317441344,
"epoch": 0.1838733631145319,
"grad_norm": 0.71875,
"learning_rate": 4.65185506750986e-06,
"loss": 0.6368934154510498,
"mean_token_accuracy": 0.8093210918828845,
"num_tokens": 8886640.0,
"step": 1950
},
{
"entropy": 0.7569531903602182,
"epoch": 0.18481630343819616,
"grad_norm": 0.333984375,
"learning_rate": 4.6477221372703786e-06,
"loss": 0.6742706298828125,
"mean_token_accuracy": 0.779875087365508,
"num_tokens": 8940559.0,
"step": 1960
},
{
"entropy": 0.7066563277505338,
"epoch": 0.18575924376186043,
"grad_norm": 0.87109375,
"learning_rate": 4.643566678441963e-06,
"loss": 0.4545194149017334,
"mean_token_accuracy": 0.816070344671607,
"num_tokens": 8982660.0,
"step": 1970
},
{
"entropy": 0.7758723221253604,
"epoch": 0.1867021840855247,
"grad_norm": 0.77734375,
"learning_rate": 4.639388734613408e-06,
"loss": 0.6822866439819336,
"mean_token_accuracy": 0.7878825765103101,
"num_tokens": 9022533.0,
"step": 1980
},
{
"entropy": 0.6788542723283172,
"epoch": 0.18764512440918896,
"grad_norm": 0.62890625,
"learning_rate": 4.635188349609368e-06,
"loss": 0.6392297744750977,
"mean_token_accuracy": 0.7984015457332134,
"num_tokens": 9076424.0,
"step": 1990
},
{
"entropy": 0.7143436720129103,
"epoch": 0.18858806473285322,
"grad_norm": 0.376953125,
"learning_rate": 4.630965567489895e-06,
"loss": 0.6579510688781738,
"mean_token_accuracy": 0.8013661563396454,
"num_tokens": 9121745.0,
"step": 2000
},
{
"entropy": 0.6926486367359758,
"epoch": 0.1895310050565175,
"grad_norm": 0.8984375,
"learning_rate": 4.626720432549975e-06,
"loss": 0.8323287010192871,
"mean_token_accuracy": 0.8196912448853254,
"num_tokens": 9161355.0,
"step": 2010
},
{
"entropy": 0.7443779086694121,
"epoch": 0.19047394538018175,
"grad_norm": 0.60546875,
"learning_rate": 4.622452989319064e-06,
"loss": 0.6473805427551269,
"mean_token_accuracy": 0.7991336258128285,
"num_tokens": 9198309.0,
"step": 2020
},
{
"entropy": 0.666377074457705,
"epoch": 0.19141688570384602,
"grad_norm": 0.71875,
"learning_rate": 4.618163282560621e-06,
"loss": 0.5878519535064697,
"mean_token_accuracy": 0.8124156523495912,
"num_tokens": 9242770.0,
"step": 2030
},
{
"entropy": 0.726883088517934,
"epoch": 0.19235982602751028,
"grad_norm": 0.376953125,
"learning_rate": 4.613851357271644e-06,
"loss": 0.6642287731170654,
"mean_token_accuracy": 0.8055625781416893,
"num_tokens": 9289160.0,
"step": 2040
},
{
"entropy": 0.6223044098354876,
"epoch": 0.19330276635117455,
"grad_norm": 0.28515625,
"learning_rate": 4.6095172586821845e-06,
"loss": 0.5843603134155273,
"mean_token_accuracy": 0.8251405648887158,
"num_tokens": 9336075.0,
"step": 2050
},
{
"entropy": 0.5912350189872086,
"epoch": 0.19424570667483881,
"grad_norm": 0.427734375,
"learning_rate": 4.605161032254889e-06,
"loss": 0.49378104209899903,
"mean_token_accuracy": 0.8227537497878075,
"num_tokens": 9380863.0,
"step": 2060
},
{
"entropy": 0.8942209580913186,
"epoch": 0.19518864699850308,
"grad_norm": 0.72265625,
"learning_rate": 4.6007827236845095e-06,
"loss": 0.7838969230651855,
"mean_token_accuracy": 0.7667118087410927,
"num_tokens": 9426134.0,
"step": 2070
},
{
"entropy": 0.7779933417215943,
"epoch": 0.19613158732216734,
"grad_norm": 0.380859375,
"learning_rate": 4.596382378897431e-06,
"loss": 0.6452385902404785,
"mean_token_accuracy": 0.8011699549853801,
"num_tokens": 9468075.0,
"step": 2080
},
{
"entropy": 0.6786517933011055,
"epoch": 0.1970745276458316,
"grad_norm": 0.7578125,
"learning_rate": 4.59196004405119e-06,
"loss": 0.46638927459716795,
"mean_token_accuracy": 0.7987587995827198,
"num_tokens": 9510000.0,
"step": 2090
},
{
"entropy": 0.6716505272313953,
"epoch": 0.19801746796949588,
"grad_norm": 0.57421875,
"learning_rate": 4.587515765533985e-06,
"loss": 0.5990314960479737,
"mean_token_accuracy": 0.8237005785107613,
"num_tokens": 9553054.0,
"step": 2100
},
{
"entropy": 0.6282524673268199,
"epoch": 0.19896040829316014,
"grad_norm": 0.3828125,
"learning_rate": 4.583049589964196e-06,
"loss": 0.6849035263061524,
"mean_token_accuracy": 0.8318673394620418,
"num_tokens": 9599290.0,
"step": 2110
},
{
"entropy": 0.7072675415314734,
"epoch": 0.1999033486168244,
"grad_norm": 0.298828125,
"learning_rate": 4.578561564189889e-06,
"loss": 0.5846244335174561,
"mean_token_accuracy": 0.8056545812636614,
"num_tokens": 9644669.0,
"step": 2120
},
{
"entropy": 0.6512570422142744,
"epoch": 0.20084628894048867,
"grad_norm": 0.369140625,
"learning_rate": 4.574051735288333e-06,
"loss": 0.624661922454834,
"mean_token_accuracy": 0.8112033154815436,
"num_tokens": 9685527.0,
"step": 2130
},
{
"entropy": 0.7499742574989796,
"epoch": 0.20178922926415294,
"grad_norm": 0.61328125,
"learning_rate": 4.5695201505654975e-06,
"loss": 0.7735828876495361,
"mean_token_accuracy": 0.7932566996663809,
"num_tokens": 9736026.0,
"step": 2140
},
{
"entropy": 0.7998500057496131,
"epoch": 0.2027321695878172,
"grad_norm": 0.375,
"learning_rate": 4.564966857555563e-06,
"loss": 0.6731950759887695,
"mean_token_accuracy": 0.781569967418909,
"num_tokens": 9780068.0,
"step": 2150
},
{
"entropy": 0.7340394101105631,
"epoch": 0.20367510991148147,
"grad_norm": 0.37109375,
"learning_rate": 4.5603919040204184e-06,
"loss": 0.5938757419586181,
"mean_token_accuracy": 0.8104211119934916,
"num_tokens": 9833844.0,
"step": 2160
},
{
"entropy": 0.6916491713374853,
"epoch": 0.20461805023514573,
"grad_norm": 0.70703125,
"learning_rate": 4.5557953379491605e-06,
"loss": 0.6073223114013672,
"mean_token_accuracy": 0.8175125665962696,
"num_tokens": 9876964.0,
"step": 2170
},
{
"entropy": 0.7052072752267122,
"epoch": 0.20556099055881,
"grad_norm": 0.609375,
"learning_rate": 4.551177207557593e-06,
"loss": 0.5360385417938233,
"mean_token_accuracy": 0.8053067337721587,
"num_tokens": 9917699.0,
"step": 2180
},
{
"entropy": 0.7037679905071854,
"epoch": 0.20650393088247426,
"grad_norm": 0.423828125,
"learning_rate": 4.546537561287719e-06,
"loss": 0.629872179031372,
"mean_token_accuracy": 0.8012799389660359,
"num_tokens": 9964393.0,
"step": 2190
},
{
"entropy": 0.6786779332906008,
"epoch": 0.20744687120613853,
"grad_norm": 0.94921875,
"learning_rate": 4.541876447807233e-06,
"loss": 0.5202005863189697,
"mean_token_accuracy": 0.827208873257041,
"num_tokens": 10009889.0,
"step": 2200
},
{
"entropy": 0.7257618294097483,
"epoch": 0.20838981152980282,
"grad_norm": 0.57421875,
"learning_rate": 4.537193916009007e-06,
"loss": 0.6309995174407959,
"mean_token_accuracy": 0.7956688452512026,
"num_tokens": 10062058.0,
"step": 2210
},
{
"entropy": 0.6472949480637908,
"epoch": 0.2093327518534671,
"grad_norm": 0.50390625,
"learning_rate": 4.532490015010586e-06,
"loss": 0.5185285568237304,
"mean_token_accuracy": 0.8208729565143585,
"num_tokens": 10114150.0,
"step": 2220
},
{
"entropy": 0.7547943496145308,
"epoch": 0.21027569217713135,
"grad_norm": 0.291015625,
"learning_rate": 4.527764794153666e-06,
"loss": 0.6795809745788575,
"mean_token_accuracy": 0.7977238070219755,
"num_tokens": 10171445.0,
"step": 2230
},
{
"entropy": 0.6034223964437843,
"epoch": 0.21121863250079562,
"grad_norm": 0.31640625,
"learning_rate": 4.523018303003577e-06,
"loss": 0.5290133953094482,
"mean_token_accuracy": 0.8266872577369213,
"num_tokens": 10228018.0,
"step": 2240
},
{
"entropy": 0.7052829279564321,
"epoch": 0.21216157282445988,
"grad_norm": 0.392578125,
"learning_rate": 4.518250591348765e-06,
"loss": 0.5237616539001465,
"mean_token_accuracy": 0.819525421410799,
"num_tokens": 10271175.0,
"step": 2250
},
{
"entropy": 0.7076565511059016,
"epoch": 0.21310451314812415,
"grad_norm": 0.52734375,
"learning_rate": 4.513461709200269e-06,
"loss": 0.6286019802093505,
"mean_token_accuracy": 0.8029639679938555,
"num_tokens": 10323637.0,
"step": 2260
},
{
"entropy": 0.612759631825611,
"epoch": 0.2140474534717884,
"grad_norm": 0.322265625,
"learning_rate": 4.508651706791199e-06,
"loss": 0.6475212097167968,
"mean_token_accuracy": 0.8325118262320756,
"num_tokens": 10371700.0,
"step": 2270
},
{
"entropy": 0.7420009043999016,
"epoch": 0.21499039379545268,
"grad_norm": 0.640625,
"learning_rate": 4.5038206345762e-06,
"loss": 0.7298381328582764,
"mean_token_accuracy": 0.7833721118047834,
"num_tokens": 10417361.0,
"step": 2280
},
{
"entropy": 0.6522927849553526,
"epoch": 0.21593333411911694,
"grad_norm": 0.2578125,
"learning_rate": 4.498968543230937e-06,
"loss": 0.5515638828277588,
"mean_token_accuracy": 0.8166045229882002,
"num_tokens": 10467913.0,
"step": 2290
},
{
"entropy": 0.6916065049357712,
"epoch": 0.2168762744427812,
"grad_norm": 0.333984375,
"learning_rate": 4.49409548365155e-06,
"loss": 0.6021734714508057,
"mean_token_accuracy": 0.8119091907516122,
"num_tokens": 10518853.0,
"step": 2300
},
{
"entropy": 0.6611153034493327,
"epoch": 0.21781921476644547,
"grad_norm": 0.546875,
"learning_rate": 4.48920150695413e-06,
"loss": 0.5773680210113525,
"mean_token_accuracy": 0.8194341376423836,
"num_tokens": 10564495.0,
"step": 2310
},
{
"entropy": 0.8297945160302334,
"epoch": 0.21876215509010974,
"grad_norm": 0.462890625,
"learning_rate": 4.484286664474177e-06,
"loss": 0.6902072906494141,
"mean_token_accuracy": 0.7996103055775166,
"num_tokens": 10610647.0,
"step": 2320
},
{
"entropy": 0.6553996685659513,
"epoch": 0.219705095413774,
"grad_norm": 0.3359375,
"learning_rate": 4.479351007766061e-06,
"loss": 0.5572136402130127,
"mean_token_accuracy": 0.7971479788422584,
"num_tokens": 10663483.0,
"step": 2330
},
{
"entropy": 0.6963181391358375,
"epoch": 0.22064803573743827,
"grad_norm": 0.59765625,
"learning_rate": 4.474394588602486e-06,
"loss": 0.5790410995483398,
"mean_token_accuracy": 0.8045560229569674,
"num_tokens": 10710250.0,
"step": 2340
},
{
"entropy": 0.8422877897508443,
"epoch": 0.22159097606110253,
"grad_norm": 0.419921875,
"learning_rate": 4.469417458973945e-06,
"loss": 0.627861499786377,
"mean_token_accuracy": 0.7863189570605755,
"num_tokens": 10753271.0,
"step": 2350
},
{
"entropy": 0.6823558527044952,
"epoch": 0.2225339163847668,
"grad_norm": 0.41796875,
"learning_rate": 4.464419671088171e-06,
"loss": 0.6231525421142579,
"mean_token_accuracy": 0.8063728950917721,
"num_tokens": 10803990.0,
"step": 2360
},
{
"entropy": 0.7730052729602903,
"epoch": 0.22347685670843107,
"grad_norm": 0.515625,
"learning_rate": 4.459401277369595e-06,
"loss": 0.622228479385376,
"mean_token_accuracy": 0.7853727921843529,
"num_tokens": 10854008.0,
"step": 2370
},
{
"entropy": 0.7397545983083547,
"epoch": 0.22441979703209533,
"grad_norm": 0.5546875,
"learning_rate": 4.454362330458792e-06,
"loss": 0.7059813022613526,
"mean_token_accuracy": 0.8041706055402755,
"num_tokens": 10899375.0,
"step": 2380
},
{
"entropy": 0.8144816821441054,
"epoch": 0.2253627373557596,
"grad_norm": 0.427734375,
"learning_rate": 4.44930288321193e-06,
"loss": 0.5797255992889404,
"mean_token_accuracy": 0.7836383230984211,
"num_tokens": 10950366.0,
"step": 2390
},
{
"entropy": 0.6395042231306434,
"epoch": 0.22630567767942386,
"grad_norm": 0.66015625,
"learning_rate": 4.444222988700217e-06,
"loss": 0.526540470123291,
"mean_token_accuracy": 0.8213209711015225,
"num_tokens": 10997043.0,
"step": 2400
},
{
"entropy": 0.7632207646034658,
"epoch": 0.22724861800308813,
"grad_norm": 0.408203125,
"learning_rate": 4.439122700209344e-06,
"loss": 0.4208627223968506,
"mean_token_accuracy": 0.8001706589013338,
"num_tokens": 11040050.0,
"step": 2410
},
{
"entropy": 0.7518241555429995,
"epoch": 0.2281915583267524,
"grad_norm": 0.59765625,
"learning_rate": 4.434002071238923e-06,
"loss": 0.6388368129730224,
"mean_token_accuracy": 0.7935513414442539,
"num_tokens": 11085047.0,
"step": 2420
},
{
"entropy": 0.6688132929615677,
"epoch": 0.22913449865041666,
"grad_norm": 0.32421875,
"learning_rate": 4.428861155501929e-06,
"loss": 0.546387767791748,
"mean_token_accuracy": 0.820703661069274,
"num_tokens": 11129247.0,
"step": 2430
},
{
"entropy": 0.7079487937502563,
"epoch": 0.23007743897408092,
"grad_norm": 0.4921875,
"learning_rate": 4.423700006924134e-06,
"loss": 0.6248188495635987,
"mean_token_accuracy": 0.8046429224312306,
"num_tokens": 11184873.0,
"step": 2440
},
{
"entropy": 0.6818896850571037,
"epoch": 0.2310203792977452,
"grad_norm": 0.57421875,
"learning_rate": 4.418518679643547e-06,
"loss": 0.5705044746398926,
"mean_token_accuracy": 0.8065329402685165,
"num_tokens": 11224860.0,
"step": 2450
},
{
"entropy": 0.7125477872788906,
"epoch": 0.23196331962140945,
"grad_norm": 0.4375,
"learning_rate": 4.4133172280098366e-06,
"loss": 0.6023592472076416,
"mean_token_accuracy": 0.7931496508419513,
"num_tokens": 11273062.0,
"step": 2460
},
{
"entropy": 0.8268242001533508,
"epoch": 0.23290625994507372,
"grad_norm": 0.65625,
"learning_rate": 4.4080957065837705e-06,
"loss": 0.5537054061889648,
"mean_token_accuracy": 0.7920439690351486,
"num_tokens": 11315820.0,
"step": 2470
},
{
"entropy": 0.6495694993063807,
"epoch": 0.23384920026873798,
"grad_norm": 0.4375,
"learning_rate": 4.402854170136638e-06,
"loss": 0.5979690074920654,
"mean_token_accuracy": 0.8214081518352032,
"num_tokens": 11365181.0,
"step": 2480
},
{
"entropy": 0.6780490770936012,
"epoch": 0.23479214059240225,
"grad_norm": 0.42578125,
"learning_rate": 4.397592673649675e-06,
"loss": 0.5484375476837158,
"mean_token_accuracy": 0.8182380983605981,
"num_tokens": 11411595.0,
"step": 2490
},
{
"entropy": 0.6635444098617882,
"epoch": 0.23573508091606651,
"grad_norm": 0.37890625,
"learning_rate": 4.3923112723134925e-06,
"loss": 0.5475056171417236,
"mean_token_accuracy": 0.8106115475296974,
"num_tokens": 11457001.0,
"step": 2500
},
{
"entropy": 0.5945799764245748,
"epoch": 0.23667802123973078,
"grad_norm": 0.2255859375,
"learning_rate": 4.387010021527489e-06,
"loss": 0.5004089832305908,
"mean_token_accuracy": 0.8270149566233158,
"num_tokens": 11507578.0,
"step": 2510
},
{
"entropy": 0.7172031537629664,
"epoch": 0.23762096156339504,
"grad_norm": 0.416015625,
"learning_rate": 4.381688976899278e-06,
"loss": 0.570509958267212,
"mean_token_accuracy": 0.7985255815088749,
"num_tokens": 11559582.0,
"step": 2520
},
{
"entropy": 0.6814393433742225,
"epoch": 0.2385639018870593,
"grad_norm": 0.67578125,
"learning_rate": 4.376348194244098e-06,
"loss": 0.5488054275512695,
"mean_token_accuracy": 0.8171292833983899,
"num_tokens": 11601800.0,
"step": 2530
},
{
"entropy": 0.6187633796595037,
"epoch": 0.23950684221072358,
"grad_norm": 0.37109375,
"learning_rate": 4.370987729584233e-06,
"loss": 0.528061056137085,
"mean_token_accuracy": 0.8176171716302634,
"num_tokens": 11645914.0,
"step": 2540
},
{
"entropy": 0.7502338518388569,
"epoch": 0.24044978253438787,
"grad_norm": 0.75,
"learning_rate": 4.365607639148422e-06,
"loss": 0.6851604461669922,
"mean_token_accuracy": 0.8080096576362849,
"num_tokens": 11685949.0,
"step": 2550
},
{
"entropy": 0.7071651536040008,
"epoch": 0.24139272285805213,
"grad_norm": 0.5546875,
"learning_rate": 4.360207979371266e-06,
"loss": 0.6052841663360595,
"mean_token_accuracy": 0.8076611422002316,
"num_tokens": 11733467.0,
"step": 2560
},
{
"entropy": 0.8098411624319851,
"epoch": 0.2423356631817164,
"grad_norm": 0.494140625,
"learning_rate": 4.354788806892641e-06,
"loss": 0.5459568500518799,
"mean_token_accuracy": 0.7838873576372862,
"num_tokens": 11778901.0,
"step": 2570
},
{
"entropy": 0.6692146965302527,
"epoch": 0.24327860350538066,
"grad_norm": 0.35546875,
"learning_rate": 4.3493501785571034e-06,
"loss": 0.7700508117675782,
"mean_token_accuracy": 0.82504887804389,
"num_tokens": 11818887.0,
"step": 2580
},
{
"entropy": 0.6426164032891393,
"epoch": 0.24422154382904493,
"grad_norm": 0.33984375,
"learning_rate": 4.34389215141329e-06,
"loss": 0.4979496955871582,
"mean_token_accuracy": 0.8184706576168537,
"num_tokens": 11864058.0,
"step": 2590
},
{
"entropy": 0.7097076333360747,
"epoch": 0.2451644841527092,
"grad_norm": 0.45703125,
"learning_rate": 4.338414782713322e-06,
"loss": 0.5226698875427246,
"mean_token_accuracy": 0.8021728150546551,
"num_tokens": 11911890.0,
"step": 2600
},
{
"entropy": 0.7304733860772104,
"epoch": 0.24610742447637346,
"grad_norm": 0.416015625,
"learning_rate": 4.332918129912208e-06,
"loss": 0.7039321422576904,
"mean_token_accuracy": 0.7967918623238802,
"num_tokens": 11955745.0,
"step": 2610
},
{
"entropy": 0.6977716976776719,
"epoch": 0.24705036480003773,
"grad_norm": 0.7578125,
"learning_rate": 4.327402250667233e-06,
"loss": 0.5292267322540283,
"mean_token_accuracy": 0.8004238706082105,
"num_tokens": 11994942.0,
"step": 2620
},
{
"entropy": 0.7422330360859632,
"epoch": 0.247993305123702,
"grad_norm": 0.5390625,
"learning_rate": 4.321867202837359e-06,
"loss": 0.6598591327667236,
"mean_token_accuracy": 0.793621858395636,
"num_tokens": 12040970.0,
"step": 2630
},
{
"entropy": 0.6614692817442119,
"epoch": 0.24893624544736626,
"grad_norm": 0.349609375,
"learning_rate": 4.316313044482621e-06,
"loss": 0.4676491737365723,
"mean_token_accuracy": 0.8118173565715552,
"num_tokens": 12095644.0,
"step": 2640
},
{
"entropy": 0.7872744291671552,
"epoch": 0.24987918577103052,
"grad_norm": 0.41015625,
"learning_rate": 4.31073983386351e-06,
"loss": 0.7802893161773682,
"mean_token_accuracy": 0.7734283555299044,
"num_tokens": 12147287.0,
"step": 2650
},
{
"entropy": 0.6264273500069976,
"epoch": 0.2508221260946948,
"grad_norm": 0.4375,
"learning_rate": 4.30514762944037e-06,
"loss": 0.5711867809295654,
"mean_token_accuracy": 0.8230541836470365,
"num_tokens": 12191134.0,
"step": 2660
},
{
"entropy": 0.642601250205189,
"epoch": 0.25176506641835905,
"grad_norm": 0.203125,
"learning_rate": 4.299536489872778e-06,
"loss": 0.41927399635314944,
"mean_token_accuracy": 0.8300650017336011,
"num_tokens": 12244587.0,
"step": 2670
},
{
"entropy": 0.7999465940054507,
"epoch": 0.2527080067420233,
"grad_norm": 0.53125,
"learning_rate": 4.293906474018933e-06,
"loss": 0.6219149589538574,
"mean_token_accuracy": 0.7740768680348993,
"num_tokens": 12292442.0,
"step": 2680
},
{
"entropy": 0.6853533301036805,
"epoch": 0.2536509470656876,
"grad_norm": 0.400390625,
"learning_rate": 4.288257640935038e-06,
"loss": 0.5230690479278565,
"mean_token_accuracy": 0.8064401123672724,
"num_tokens": 12332055.0,
"step": 2690
},
{
"entropy": 0.6050175254698843,
"epoch": 0.25459388738935185,
"grad_norm": 0.302734375,
"learning_rate": 4.282590049874678e-06,
"loss": 0.5386334419250488,
"mean_token_accuracy": 0.8066453229635954,
"num_tokens": 12377897.0,
"step": 2700
},
{
"entropy": 0.6740714994259178,
"epoch": 0.2555368277130161,
"grad_norm": 0.1845703125,
"learning_rate": 4.276903760288202e-06,
"loss": 0.4890268325805664,
"mean_token_accuracy": 0.8237885976210236,
"num_tokens": 12422796.0,
"step": 2710
},
{
"entropy": 0.6965341650880873,
"epoch": 0.2564797680366804,
"grad_norm": 0.62109375,
"learning_rate": 4.271198831822097e-06,
"loss": 0.7352762699127198,
"mean_token_accuracy": 0.7847994826734066,
"num_tokens": 12467865.0,
"step": 2720
},
{
"entropy": 0.6212398945353925,
"epoch": 0.25742270836034464,
"grad_norm": 0.45703125,
"learning_rate": 4.265475324318362e-06,
"loss": 0.5328194618225097,
"mean_token_accuracy": 0.8315907616168261,
"num_tokens": 12512975.0,
"step": 2730
},
{
"entropy": 0.693923706561327,
"epoch": 0.2583656486840089,
"grad_norm": 0.59765625,
"learning_rate": 4.259733297813885e-06,
"loss": 0.5941354274749756,
"mean_token_accuracy": 0.8204266559332609,
"num_tokens": 12555479.0,
"step": 2740
},
{
"entropy": 0.8046634275466203,
"epoch": 0.2593085890076732,
"grad_norm": 0.5625,
"learning_rate": 4.253972812539805e-06,
"loss": 0.7706850528717041,
"mean_token_accuracy": 0.7917935982346535,
"num_tokens": 12601319.0,
"step": 2750
},
{
"entropy": 0.7471866227686406,
"epoch": 0.26025152933133744,
"grad_norm": 0.40625,
"learning_rate": 4.248193928920886e-06,
"loss": 0.710187292098999,
"mean_token_accuracy": 0.7990452691912651,
"num_tokens": 12658000.0,
"step": 2760
},
{
"entropy": 0.6626139220781624,
"epoch": 0.2611944696550017,
"grad_norm": 0.25,
"learning_rate": 4.242396707574885e-06,
"loss": 0.48251981735229493,
"mean_token_accuracy": 0.8196328468620777,
"num_tokens": 12707975.0,
"step": 2770
},
{
"entropy": 0.6553014845587313,
"epoch": 0.26213740997866597,
"grad_norm": 0.5625,
"learning_rate": 4.236581209311909e-06,
"loss": 0.5507401466369629,
"mean_token_accuracy": 0.8160292755812406,
"num_tokens": 12753527.0,
"step": 2780
},
{
"entropy": 0.622153397090733,
"epoch": 0.26308035030233023,
"grad_norm": 0.412109375,
"learning_rate": 4.230747495133784e-06,
"loss": 0.5054684162139893,
"mean_token_accuracy": 0.8228756669908762,
"num_tokens": 12809632.0,
"step": 2790
},
{
"entropy": 0.6780139476060867,
"epoch": 0.2640232906259945,
"grad_norm": 0.52734375,
"learning_rate": 4.224895626233409e-06,
"loss": 0.8137707710266113,
"mean_token_accuracy": 0.8064680024981499,
"num_tokens": 12852804.0,
"step": 2800
},
{
"entropy": 0.7678300259634853,
"epoch": 0.26496623094965877,
"grad_norm": 0.408203125,
"learning_rate": 4.219025663994123e-06,
"loss": 0.7762890815734863,
"mean_token_accuracy": 0.7923290681093931,
"num_tokens": 12902399.0,
"step": 2810
},
{
"entropy": 0.5841752365231514,
"epoch": 0.26590917127332303,
"grad_norm": 0.404296875,
"learning_rate": 4.21313766998905e-06,
"loss": 0.4339454174041748,
"mean_token_accuracy": 0.8222315371036529,
"num_tokens": 12945895.0,
"step": 2820
},
{
"entropy": 0.6883633114397526,
"epoch": 0.2668521115969873,
"grad_norm": 0.51953125,
"learning_rate": 4.207231705980461e-06,
"loss": 0.7140939235687256,
"mean_token_accuracy": 0.8142529975622892,
"num_tokens": 12992305.0,
"step": 2830
},
{
"entropy": 0.7407352829352021,
"epoch": 0.26779505192065156,
"grad_norm": 0.25,
"learning_rate": 4.201307833919126e-06,
"loss": 0.6346509456634521,
"mean_token_accuracy": 0.7989520721137524,
"num_tokens": 13041575.0,
"step": 2840
},
{
"entropy": 0.714037418179214,
"epoch": 0.2687379922443158,
"grad_norm": 0.7890625,
"learning_rate": 4.195366115943657e-06,
"loss": 0.6052238464355468,
"mean_token_accuracy": 0.799788748472929,
"num_tokens": 13083778.0,
"step": 2850
},
{
"entropy": 0.8210464440286159,
"epoch": 0.2696809325679801,
"grad_norm": 0.384765625,
"learning_rate": 4.189406614379865e-06,
"loss": 0.6140337944030761,
"mean_token_accuracy": 0.7797987915575504,
"num_tokens": 13136468.0,
"step": 2860
},
{
"entropy": 0.715034647192806,
"epoch": 0.27062387289164436,
"grad_norm": 0.24609375,
"learning_rate": 4.183429391740103e-06,
"loss": 0.6325907707214355,
"mean_token_accuracy": 0.7957759384065867,
"num_tokens": 13190907.0,
"step": 2870
},
{
"entropy": 0.6897853550501167,
"epoch": 0.2715668132153086,
"grad_norm": 1.0390625,
"learning_rate": 4.177434510722605e-06,
"loss": 0.6110557556152344,
"mean_token_accuracy": 0.81325623691082,
"num_tokens": 13231284.0,
"step": 2880
},
{
"entropy": 0.6753826588392258,
"epoch": 0.2725097535389729,
"grad_norm": 0.38671875,
"learning_rate": 4.171422034210839e-06,
"loss": 0.4948280334472656,
"mean_token_accuracy": 0.8051031611859798,
"num_tokens": 13277819.0,
"step": 2890
},
{
"entropy": 0.739368848875165,
"epoch": 0.27345269386263715,
"grad_norm": 0.48828125,
"learning_rate": 4.165392025272836e-06,
"loss": 0.641120195388794,
"mean_token_accuracy": 0.7944438774138689,
"num_tokens": 13319933.0,
"step": 2900
},
{
"entropy": 0.7141495368443429,
"epoch": 0.2743956341863014,
"grad_norm": 0.671875,
"learning_rate": 4.159344547160539e-06,
"loss": 0.6336250305175781,
"mean_token_accuracy": 0.8012420143932104,
"num_tokens": 13357614.0,
"step": 2910
},
{
"entropy": 0.5666716417297721,
"epoch": 0.2753385745099657,
"grad_norm": 0.458984375,
"learning_rate": 4.15327966330913e-06,
"loss": 0.4592881679534912,
"mean_token_accuracy": 0.833888939768076,
"num_tokens": 13412982.0,
"step": 2920
},
{
"entropy": 0.7603326801676303,
"epoch": 0.27628151483362995,
"grad_norm": 0.48046875,
"learning_rate": 4.147197437336372e-06,
"loss": 0.6861026763916016,
"mean_token_accuracy": 0.7918042603880167,
"num_tokens": 13455286.0,
"step": 2930
},
{
"entropy": 0.8255054540932178,
"epoch": 0.2772244551572942,
"grad_norm": 0.55078125,
"learning_rate": 4.141097933041936e-06,
"loss": 0.6968491077423096,
"mean_token_accuracy": 0.7748916573822499,
"num_tokens": 13496973.0,
"step": 2940
},
{
"entropy": 0.7764521720819175,
"epoch": 0.2781673954809585,
"grad_norm": 0.3828125,
"learning_rate": 4.134981214406737e-06,
"loss": 0.4818326473236084,
"mean_token_accuracy": 0.7867025479674339,
"num_tokens": 13547249.0,
"step": 2950
},
{
"entropy": 0.7108894733712077,
"epoch": 0.27911033580462274,
"grad_norm": 0.35546875,
"learning_rate": 4.1288473455922584e-06,
"loss": 0.5785073280334473,
"mean_token_accuracy": 0.8074256978929043,
"num_tokens": 13592148.0,
"step": 2960
},
{
"entropy": 0.7593025027774274,
"epoch": 0.280053276128287,
"grad_norm": 0.408203125,
"learning_rate": 4.122696390939882e-06,
"loss": 0.7499773025512695,
"mean_token_accuracy": 0.7877199437469244,
"num_tokens": 13643977.0,
"step": 2970
},
{
"entropy": 0.763703981693834,
"epoch": 0.2809962164519513,
"grad_norm": 0.267578125,
"learning_rate": 4.116528414970211e-06,
"loss": 0.6026920318603516,
"mean_token_accuracy": 0.7880954163148999,
"num_tokens": 13686759.0,
"step": 2980
},
{
"entropy": 0.6860854076221585,
"epoch": 0.28193915677561554,
"grad_norm": 0.412109375,
"learning_rate": 4.110343482382396e-06,
"loss": 0.5413653373718261,
"mean_token_accuracy": 0.8145212274044752,
"num_tokens": 13731883.0,
"step": 2990
},
{
"entropy": 0.7460825649090111,
"epoch": 0.2828820970992798,
"grad_norm": 0.84765625,
"learning_rate": 4.104141658053451e-06,
"loss": 0.7144715785980225,
"mean_token_accuracy": 0.7957971028983593,
"num_tokens": 13780640.0,
"step": 3000
},
{
"entropy": 0.8326621399261057,
"epoch": 0.28382503742294407,
"grad_norm": 0.486328125,
"learning_rate": 4.097923007037581e-06,
"loss": 0.9063180923461914,
"mean_token_accuracy": 0.7649697538465261,
"num_tokens": 13815992.0,
"step": 3010
},
{
"entropy": 0.9316485294606537,
"epoch": 0.28476797774660834,
"grad_norm": 0.60546875,
"learning_rate": 4.09168759456549e-06,
"loss": 0.8332127571105957,
"mean_token_accuracy": 0.757191539555788,
"num_tokens": 13862295.0,
"step": 3020
},
{
"entropy": 0.7256421025842428,
"epoch": 0.2857109180702726,
"grad_norm": 0.78125,
"learning_rate": 4.085435486043706e-06,
"loss": 0.7105655193328857,
"mean_token_accuracy": 0.80562147423625,
"num_tokens": 13911028.0,
"step": 3030
},
{
"entropy": 0.7599948160350323,
"epoch": 0.28665385839393687,
"grad_norm": 0.828125,
"learning_rate": 4.0791667470538895e-06,
"loss": 0.6686043739318848,
"mean_token_accuracy": 0.7909170279279352,
"num_tokens": 13964127.0,
"step": 3040
},
{
"entropy": 0.8010038698092103,
"epoch": 0.2875967987176012,
"grad_norm": 0.421875,
"learning_rate": 4.072881443352144e-06,
"loss": 0.6279882907867431,
"mean_token_accuracy": 0.78184520509094,
"num_tokens": 14009502.0,
"step": 3050
},
{
"entropy": 0.6282306860201061,
"epoch": 0.28853973904126545,
"grad_norm": 0.50390625,
"learning_rate": 4.0665796408683324e-06,
"loss": 0.6266475677490234,
"mean_token_accuracy": 0.8261493802070617,
"num_tokens": 14054200.0,
"step": 3060
},
{
"entropy": 0.6563035418046639,
"epoch": 0.2894826793649297,
"grad_norm": 0.671875,
"learning_rate": 4.0602614057053815e-06,
"loss": 0.5960610866546631,
"mean_token_accuracy": 0.8131377577781678,
"num_tokens": 14104808.0,
"step": 3070
},
{
"entropy": 0.7352710378356277,
"epoch": 0.290425619688594,
"grad_norm": 0.42578125,
"learning_rate": 4.053926804138588e-06,
"loss": 0.6611281394958496,
"mean_token_accuracy": 0.8034013140946626,
"num_tokens": 14148483.0,
"step": 3080
},
{
"entropy": 0.6457099332474172,
"epoch": 0.29136856001225825,
"grad_norm": 0.2578125,
"learning_rate": 4.047575902614924e-06,
"loss": 0.6730895042419434,
"mean_token_accuracy": 0.8202265679836274,
"num_tokens": 14211134.0,
"step": 3090
},
{
"entropy": 0.6713374426588417,
"epoch": 0.2923115003359225,
"grad_norm": 0.291015625,
"learning_rate": 4.041208767752341e-06,
"loss": 0.5431832790374755,
"mean_token_accuracy": 0.815386663377285,
"num_tokens": 14255091.0,
"step": 3100
},
{
"entropy": 0.734676618874073,
"epoch": 0.2932544406595868,
"grad_norm": 0.2353515625,
"learning_rate": 4.034825466339073e-06,
"loss": 0.5647121906280518,
"mean_token_accuracy": 0.8160567294806242,
"num_tokens": 14301274.0,
"step": 3110
},
{
"entropy": 0.6874036092311144,
"epoch": 0.29419738098325104,
"grad_norm": 0.5546875,
"learning_rate": 4.02842606533293e-06,
"loss": 0.5496022701263428,
"mean_token_accuracy": 0.8137231681495904,
"num_tokens": 14342896.0,
"step": 3120
},
{
"entropy": 0.6659715895075351,
"epoch": 0.2951403213069153,
"grad_norm": 0.291015625,
"learning_rate": 4.0220106318606e-06,
"loss": 0.5480599880218506,
"mean_token_accuracy": 0.8109877597540617,
"num_tokens": 14386650.0,
"step": 3130
},
{
"entropy": 0.9152347665280104,
"epoch": 0.2960832616305796,
"grad_norm": 0.421875,
"learning_rate": 4.015579233216944e-06,
"loss": 0.6289479732513428,
"mean_token_accuracy": 0.7669604491442442,
"num_tokens": 14432746.0,
"step": 3140
},
{
"entropy": 0.7302544771693646,
"epoch": 0.29702620195424384,
"grad_norm": 0.5,
"learning_rate": 4.009131936864293e-06,
"loss": 0.7106366157531738,
"mean_token_accuracy": 0.809479969739914,
"num_tokens": 14473027.0,
"step": 3150
},
{
"entropy": 0.7078684787265956,
"epoch": 0.2979691422779081,
"grad_norm": 0.318359375,
"learning_rate": 4.002668810431733e-06,
"loss": 0.4805280685424805,
"mean_token_accuracy": 0.8173054194077849,
"num_tokens": 14512645.0,
"step": 3160
},
{
"entropy": 0.6727185323834419,
"epoch": 0.29891208260157237,
"grad_norm": 0.34375,
"learning_rate": 3.9961899217144004e-06,
"loss": 0.5752994060516358,
"mean_token_accuracy": 0.8104622792452574,
"num_tokens": 14556834.0,
"step": 3170
},
{
"entropy": 0.6954042711295187,
"epoch": 0.29985502292523664,
"grad_norm": 0.412109375,
"learning_rate": 3.989695338672775e-06,
"loss": 0.5789048671722412,
"mean_token_accuracy": 0.8124545980244875,
"num_tokens": 14596491.0,
"step": 3180
},
{
"entropy": 0.7359610196202994,
"epoch": 0.3007979632489009,
"grad_norm": 0.5078125,
"learning_rate": 3.983185129431959e-06,
"loss": 0.5956539630889892,
"mean_token_accuracy": 0.7969963911920785,
"num_tokens": 14647326.0,
"step": 3190
},
{
"entropy": 0.6450121255591512,
"epoch": 0.30174090357256517,
"grad_norm": 0.390625,
"learning_rate": 3.976659362280966e-06,
"loss": 0.5854204177856446,
"mean_token_accuracy": 0.8218308422714472,
"num_tokens": 14692466.0,
"step": 3200
},
{
"entropy": 0.6701277974992991,
"epoch": 0.30268384389622943,
"grad_norm": 0.318359375,
"learning_rate": 3.970118105672006e-06,
"loss": 0.6377078533172608,
"mean_token_accuracy": 0.8047068595886231,
"num_tokens": 14742900.0,
"step": 3210
},
{
"entropy": 0.7718553693033755,
"epoch": 0.3036267842198937,
"grad_norm": 1.3125,
"learning_rate": 3.963561428219765e-06,
"loss": 0.6326769828796387,
"mean_token_accuracy": 0.7890255197882652,
"num_tokens": 14787852.0,
"step": 3220
},
{
"entropy": 0.7489314749836922,
"epoch": 0.30456972454355796,
"grad_norm": 0.51953125,
"learning_rate": 3.956989398700687e-06,
"loss": 0.7279271602630615,
"mean_token_accuracy": 0.7867590818554163,
"num_tokens": 14827219.0,
"step": 3230
},
{
"entropy": 0.7688439194113016,
"epoch": 0.30551266486722223,
"grad_norm": 0.7734375,
"learning_rate": 3.950402086052253e-06,
"loss": 0.7808563709259033,
"mean_token_accuracy": 0.7964679040014744,
"num_tokens": 14869813.0,
"step": 3240
},
{
"entropy": 0.5645394513383508,
"epoch": 0.3064556051908865,
"grad_norm": 0.4375,
"learning_rate": 3.943799559372254e-06,
"loss": 0.5005753993988037,
"mean_token_accuracy": 0.8374217573553324,
"num_tokens": 14918596.0,
"step": 3250
},
{
"entropy": 0.7563243569806218,
"epoch": 0.30739854551455076,
"grad_norm": 0.51171875,
"learning_rate": 3.937181887918072e-06,
"loss": 0.5691118240356445,
"mean_token_accuracy": 0.8011289283633232,
"num_tokens": 14954915.0,
"step": 3260
},
{
"entropy": 0.6726897666230798,
"epoch": 0.308341485838215,
"grad_norm": 0.62109375,
"learning_rate": 3.930549141105948e-06,
"loss": 0.5586506366729737,
"mean_token_accuracy": 0.8176765486598014,
"num_tokens": 15009865.0,
"step": 3270
},
{
"entropy": 0.7068807984702289,
"epoch": 0.3092844261618793,
"grad_norm": 0.640625,
"learning_rate": 3.923901388510259e-06,
"loss": 0.5407650947570801,
"mean_token_accuracy": 0.8079414956271649,
"num_tokens": 15056586.0,
"step": 3280
},
{
"entropy": 0.6136560516897589,
"epoch": 0.31022736648554355,
"grad_norm": 0.376953125,
"learning_rate": 3.917238699862782e-06,
"loss": 0.522227668762207,
"mean_token_accuracy": 0.8270126104354858,
"num_tokens": 15098316.0,
"step": 3290
},
{
"entropy": 0.693851160723716,
"epoch": 0.3111703068092078,
"grad_norm": 0.58203125,
"learning_rate": 3.910561145051969e-06,
"loss": 0.5569193840026856,
"mean_token_accuracy": 0.816235949471593,
"num_tokens": 15140027.0,
"step": 3300
},
{
"entropy": 0.6663465833291411,
"epoch": 0.3121132471328721,
"grad_norm": 0.63671875,
"learning_rate": 3.903868794122211e-06,
"loss": 0.6506803035736084,
"mean_token_accuracy": 0.8125866772606969,
"num_tokens": 15179813.0,
"step": 3310
},
{
"entropy": 0.7533382272347808,
"epoch": 0.31305618745653635,
"grad_norm": 0.51953125,
"learning_rate": 3.8971617172731026e-06,
"loss": 0.6869213104248046,
"mean_token_accuracy": 0.7885122291743756,
"num_tokens": 15221550.0,
"step": 3320
},
{
"entropy": 0.7408904255833477,
"epoch": 0.3139991277802006,
"grad_norm": 0.267578125,
"learning_rate": 3.8904399848587045e-06,
"loss": 0.6417848587036132,
"mean_token_accuracy": 0.7870474755764008,
"num_tokens": 15271012.0,
"step": 3330
},
{
"entropy": 0.7080091743730008,
"epoch": 0.3149420681038649,
"grad_norm": 0.423828125,
"learning_rate": 3.88370366738681e-06,
"loss": 0.5353238582611084,
"mean_token_accuracy": 0.7993681333959103,
"num_tokens": 15317762.0,
"step": 3340
},
{
"entropy": 0.7359500544145703,
"epoch": 0.31588500842752915,
"grad_norm": 0.625,
"learning_rate": 3.876952835518202e-06,
"loss": 0.7712695121765136,
"mean_token_accuracy": 0.7999884054064751,
"num_tokens": 15356394.0,
"step": 3350
},
{
"entropy": 0.636717552319169,
"epoch": 0.3168279487511934,
"grad_norm": 0.369140625,
"learning_rate": 3.870187560065913e-06,
"loss": 0.5929419994354248,
"mean_token_accuracy": 0.8112790875136853,
"num_tokens": 15401554.0,
"step": 3360
},
{
"entropy": 0.7583870824426413,
"epoch": 0.3177708890748577,
"grad_norm": 0.3125,
"learning_rate": 3.86340791199448e-06,
"loss": 0.6758883953094482,
"mean_token_accuracy": 0.7855101089924574,
"num_tokens": 15449214.0,
"step": 3370
},
{
"entropy": 0.78564184429124,
"epoch": 0.31871382939852194,
"grad_norm": 0.55859375,
"learning_rate": 3.8566139624192035e-06,
"loss": 0.5231400012969971,
"mean_token_accuracy": 0.7916332878172397,
"num_tokens": 15491898.0,
"step": 3380
},
{
"entropy": 0.6915111863054335,
"epoch": 0.3196567697221862,
"grad_norm": 1.8125,
"learning_rate": 3.849805782605401e-06,
"loss": 0.506642484664917,
"mean_token_accuracy": 0.81902342364192,
"num_tokens": 15536558.0,
"step": 3390
},
{
"entropy": 0.7364246053621173,
"epoch": 0.3205997100458505,
"grad_norm": 0.408203125,
"learning_rate": 3.842983443967654e-06,
"loss": 0.6232193946838379,
"mean_token_accuracy": 0.793385767377913,
"num_tokens": 15584969.0,
"step": 3400
},
{
"entropy": 0.6796113492920994,
"epoch": 0.32154265036951474,
"grad_norm": 0.4296875,
"learning_rate": 3.83614701806907e-06,
"loss": 0.5323117733001709,
"mean_token_accuracy": 0.7944784520193935,
"num_tokens": 15628552.0,
"step": 3410
},
{
"entropy": 0.5872353835962713,
"epoch": 0.322485590693179,
"grad_norm": 0.287109375,
"learning_rate": 3.8292965766205204e-06,
"loss": 0.5037885189056397,
"mean_token_accuracy": 0.8266831699758768,
"num_tokens": 15684463.0,
"step": 3420
},
{
"entropy": 0.6443200805224478,
"epoch": 0.32342853101684327,
"grad_norm": 0.478515625,
"learning_rate": 3.822432191479894e-06,
"loss": 0.6218739509582519,
"mean_token_accuracy": 0.8293004889041186,
"num_tokens": 15731478.0,
"step": 3430
},
{
"entropy": 0.6724415736272931,
"epoch": 0.32437147134050753,
"grad_norm": 0.482421875,
"learning_rate": 3.815553934651342e-06,
"loss": 0.49276022911071776,
"mean_token_accuracy": 0.8229852892458439,
"num_tokens": 15783638.0,
"step": 3440
},
{
"entropy": 0.8211766470223665,
"epoch": 0.3253144116641718,
"grad_norm": 0.40234375,
"learning_rate": 3.8086618782845265e-06,
"loss": 0.7018588542938232,
"mean_token_accuracy": 0.7826432820409537,
"num_tokens": 15823126.0,
"step": 3450
},
{
"entropy": 0.6938874244689941,
"epoch": 0.32625735198783606,
"grad_norm": 0.357421875,
"learning_rate": 3.8017560946738557e-06,
"loss": 0.6181281089782715,
"mean_token_accuracy": 0.8122403334826231,
"num_tokens": 15871899.0,
"step": 3460
},
{
"entropy": 0.7408801101148128,
"epoch": 0.32720029231150033,
"grad_norm": 0.421875,
"learning_rate": 3.7948366562577323e-06,
"loss": 0.7769334316253662,
"mean_token_accuracy": 0.7820941220968962,
"num_tokens": 15917934.0,
"step": 3470
},
{
"entropy": 0.7755114403553307,
"epoch": 0.3281432326351646,
"grad_norm": 0.4375,
"learning_rate": 3.78790363561779e-06,
"loss": 0.8794495582580566,
"mean_token_accuracy": 0.794552437029779,
"num_tokens": 15966575.0,
"step": 3480
},
{
"entropy": 0.6764940508641303,
"epoch": 0.32908617295882886,
"grad_norm": 0.5078125,
"learning_rate": 3.780957105478136e-06,
"loss": 0.5081439971923828,
"mean_token_accuracy": 0.8095720581710338,
"num_tokens": 16005157.0,
"step": 3490
},
{
"entropy": 0.6400508332066238,
"epoch": 0.3300291132824931,
"grad_norm": 0.451171875,
"learning_rate": 3.773997138704584e-06,
"loss": 0.6697597503662109,
"mean_token_accuracy": 0.8156585179269313,
"num_tokens": 16058706.0,
"step": 3500
},
{
"entropy": 0.7768798024393618,
"epoch": 0.3309720536061574,
"grad_norm": 0.47265625,
"learning_rate": 3.767023808303892e-06,
"loss": 0.6917949199676514,
"mean_token_accuracy": 0.7819763291627169,
"num_tokens": 16104548.0,
"step": 3510
},
{
"entropy": 0.6866999283432961,
"epoch": 0.33191499392982166,
"grad_norm": 0.375,
"learning_rate": 3.760037187422996e-06,
"loss": 0.5713237285614013,
"mean_token_accuracy": 0.808608740568161,
"num_tokens": 16151094.0,
"step": 3520
},
{
"entropy": 0.6466354493051767,
"epoch": 0.3328579342534859,
"grad_norm": 0.5234375,
"learning_rate": 3.7530373493482442e-06,
"loss": 0.5052223682403565,
"mean_token_accuracy": 0.8262160135433078,
"num_tokens": 16187244.0,
"step": 3530
},
{
"entropy": 0.7813827708363533,
"epoch": 0.3338008745771502,
"grad_norm": 0.50390625,
"learning_rate": 3.746024367504624e-06,
"loss": 0.741961669921875,
"mean_token_accuracy": 0.7885062169283629,
"num_tokens": 16230839.0,
"step": 3540
},
{
"entropy": 0.6852214397862554,
"epoch": 0.33474381490081445,
"grad_norm": 0.296875,
"learning_rate": 3.738998315454997e-06,
"loss": 0.7102997303009033,
"mean_token_accuracy": 0.8053493849933148,
"num_tokens": 16272786.0,
"step": 3550
},
{
"entropy": 0.7877503798343242,
"epoch": 0.3356867552244787,
"grad_norm": 0.5390625,
"learning_rate": 3.7319592668993252e-06,
"loss": 0.6556308746337891,
"mean_token_accuracy": 0.7900882601737976,
"num_tokens": 16315697.0,
"step": 3560
},
{
"entropy": 0.7013790069147945,
"epoch": 0.336629695548143,
"grad_norm": 1.2890625,
"learning_rate": 3.724907295673897e-06,
"loss": 0.6879619598388672,
"mean_token_accuracy": 0.7857543051242828,
"num_tokens": 16355680.0,
"step": 3570
},
{
"entropy": 0.741982850804925,
"epoch": 0.33757263587180725,
"grad_norm": 0.283203125,
"learning_rate": 3.7178424757505527e-06,
"loss": 0.4787749767303467,
"mean_token_accuracy": 0.7993146969936789,
"num_tokens": 16403649.0,
"step": 3580
},
{
"entropy": 0.7543878412805498,
"epoch": 0.3385155761954715,
"grad_norm": 0.265625,
"learning_rate": 3.710764881235911e-06,
"loss": 0.6166384220123291,
"mean_token_accuracy": 0.7903889134526253,
"num_tokens": 16450951.0,
"step": 3590
},
{
"entropy": 0.7278856437653303,
"epoch": 0.3394585165191358,
"grad_norm": 0.58984375,
"learning_rate": 3.7036745863705898e-06,
"loss": 0.5853046894073486,
"mean_token_accuracy": 0.8067043915390968,
"num_tokens": 16492847.0,
"step": 3600
},
{
"entropy": 0.623352998867631,
"epoch": 0.34040145684280004,
"grad_norm": 0.859375,
"learning_rate": 3.696571665528426e-06,
"loss": 0.6010436058044434,
"mean_token_accuracy": 0.8135320819914341,
"num_tokens": 16539335.0,
"step": 3610
},
{
"entropy": 0.5651233859360218,
"epoch": 0.3413443971664643,
"grad_norm": 0.34765625,
"learning_rate": 3.6894561932156993e-06,
"loss": 0.480146598815918,
"mean_token_accuracy": 0.8269745983183384,
"num_tokens": 16581557.0,
"step": 3620
},
{
"entropy": 0.5513820692896843,
"epoch": 0.3422873374901286,
"grad_norm": 0.29296875,
"learning_rate": 3.6823282440703464e-06,
"loss": 0.44032793045043944,
"mean_token_accuracy": 0.8351238772273064,
"num_tokens": 16630457.0,
"step": 3630
},
{
"entropy": 0.6860549350269138,
"epoch": 0.34323027781379284,
"grad_norm": 0.42578125,
"learning_rate": 3.675187892861181e-06,
"loss": 0.8258073806762696,
"mean_token_accuracy": 0.8066768426448107,
"num_tokens": 16672161.0,
"step": 3640
},
{
"entropy": 0.7870678843930363,
"epoch": 0.3441732181374571,
"grad_norm": 0.384765625,
"learning_rate": 3.668035214487109e-06,
"loss": 0.596193790435791,
"mean_token_accuracy": 0.7948238357901574,
"num_tokens": 16718702.0,
"step": 3650
},
{
"entropy": 0.643625473883003,
"epoch": 0.34511615846112137,
"grad_norm": 0.6875,
"learning_rate": 3.6608702839763417e-06,
"loss": 0.5603129863739014,
"mean_token_accuracy": 0.8320864170789719,
"num_tokens": 16762137.0,
"step": 3660
},
{
"entropy": 0.6784814346581698,
"epoch": 0.34605909878478563,
"grad_norm": 0.294921875,
"learning_rate": 3.653693176485609e-06,
"loss": 0.5835480213165283,
"mean_token_accuracy": 0.7936832685023546,
"num_tokens": 16811007.0,
"step": 3670
},
{
"entropy": 0.6954671564511955,
"epoch": 0.3470020391084499,
"grad_norm": 0.3359375,
"learning_rate": 3.6465039672993747e-06,
"loss": 0.5739445209503173,
"mean_token_accuracy": 0.8101118110120297,
"num_tokens": 16859417.0,
"step": 3680
},
{
"entropy": 0.5880941131850704,
"epoch": 0.34794497943211417,
"grad_norm": 0.41015625,
"learning_rate": 3.6393027318290393e-06,
"loss": 0.5243205070495606,
"mean_token_accuracy": 0.8368364397436381,
"num_tokens": 16905942.0,
"step": 3690
},
{
"entropy": 0.7491540067829192,
"epoch": 0.34888791975577843,
"grad_norm": 0.6015625,
"learning_rate": 3.6320895456121554e-06,
"loss": 0.6963620185852051,
"mean_token_accuracy": 0.7984883543103933,
"num_tokens": 16952505.0,
"step": 3700
},
{
"entropy": 0.6897736290469766,
"epoch": 0.3498308600794427,
"grad_norm": 0.7421875,
"learning_rate": 3.624864484311634e-06,
"loss": 0.7436827182769775,
"mean_token_accuracy": 0.8021753750741482,
"num_tokens": 16988497.0,
"step": 3710
},
{
"entropy": 0.7926816479302943,
"epoch": 0.35077380040310696,
"grad_norm": 0.50390625,
"learning_rate": 3.617627623714949e-06,
"loss": 0.5878771781921387,
"mean_token_accuracy": 0.8056975590065122,
"num_tokens": 17034282.0,
"step": 3720
},
{
"entropy": 0.7796463750302791,
"epoch": 0.3517167407267713,
"grad_norm": 0.333984375,
"learning_rate": 3.6103790397333434e-06,
"loss": 0.6098315238952636,
"mean_token_accuracy": 0.7889279814437031,
"num_tokens": 17079686.0,
"step": 3730
},
{
"entropy": 0.6948955420404672,
"epoch": 0.35265968105043555,
"grad_norm": 0.443359375,
"learning_rate": 3.6031188084010323e-06,
"loss": 0.5765831947326661,
"mean_token_accuracy": 0.809371105581522,
"num_tokens": 17130498.0,
"step": 3740
},
{
"entropy": 0.7758785348385573,
"epoch": 0.3536026213740998,
"grad_norm": 0.83203125,
"learning_rate": 3.5958470058744087e-06,
"loss": 0.7576163291931153,
"mean_token_accuracy": 0.783694538474083,
"num_tokens": 17172063.0,
"step": 3750
},
{
"entropy": 0.6243882402777672,
"epoch": 0.3545455616977641,
"grad_norm": 0.58984375,
"learning_rate": 3.5885637084312396e-06,
"loss": 0.5422124862670898,
"mean_token_accuracy": 0.8128781575709582,
"num_tokens": 17216580.0,
"step": 3760
},
{
"entropy": 0.8334074198268354,
"epoch": 0.35548850202142834,
"grad_norm": 0.74609375,
"learning_rate": 3.5812689924698683e-06,
"loss": 0.7805116653442383,
"mean_token_accuracy": 0.7612057582475245,
"num_tokens": 17259710.0,
"step": 3770
},
{
"entropy": 0.7605297128204256,
"epoch": 0.3564314423450926,
"grad_norm": 0.408203125,
"learning_rate": 3.5739629345084138e-06,
"loss": 0.6510057926177979,
"mean_token_accuracy": 0.7927152115851641,
"num_tokens": 17300431.0,
"step": 3780
},
{
"entropy": 0.652113667037338,
"epoch": 0.3573743826687569,
"grad_norm": 0.33984375,
"learning_rate": 3.5666456111839665e-06,
"loss": 0.5418231964111329,
"mean_token_accuracy": 0.8129661198705435,
"num_tokens": 17351269.0,
"step": 3790
},
{
"entropy": 0.6586431222967803,
"epoch": 0.35831732299242114,
"grad_norm": 0.57421875,
"learning_rate": 3.5593170992517863e-06,
"loss": 0.6081669807434082,
"mean_token_accuracy": 0.8147268489003181,
"num_tokens": 17391637.0,
"step": 3800
},
{
"entropy": 0.6838495754636824,
"epoch": 0.3592602633160854,
"grad_norm": 0.55859375,
"learning_rate": 3.5519774755844944e-06,
"loss": 0.6559165000915528,
"mean_token_accuracy": 0.8095557514578104,
"num_tokens": 17434461.0,
"step": 3810
},
{
"entropy": 0.6051603745669126,
"epoch": 0.36020320363974967,
"grad_norm": 0.50390625,
"learning_rate": 3.5446268171712706e-06,
"loss": 0.5790258884429932,
"mean_token_accuracy": 0.8305861912667751,
"num_tokens": 17478194.0,
"step": 3820
},
{
"entropy": 0.6348789224401117,
"epoch": 0.36114614396341393,
"grad_norm": 0.39453125,
"learning_rate": 3.5372652011170446e-06,
"loss": 0.5092689514160156,
"mean_token_accuracy": 0.8051383793354034,
"num_tokens": 17534987.0,
"step": 3830
},
{
"entropy": 0.6503554282244295,
"epoch": 0.3620890842870782,
"grad_norm": 0.76171875,
"learning_rate": 3.529892704641684e-06,
"loss": 0.5429260730743408,
"mean_token_accuracy": 0.8092528533190488,
"num_tokens": 17579200.0,
"step": 3840
},
{
"entropy": 0.7444478679448366,
"epoch": 0.36303202461074247,
"grad_norm": 0.72265625,
"learning_rate": 3.522509405079188e-06,
"loss": 0.7835160732269287,
"mean_token_accuracy": 0.7970532771199942,
"num_tokens": 17620157.0,
"step": 3850
},
{
"entropy": 0.6852880992926658,
"epoch": 0.36397496493440673,
"grad_norm": 0.474609375,
"learning_rate": 3.5151153798768765e-06,
"loss": 0.5196993827819825,
"mean_token_accuracy": 0.818078025430441,
"num_tokens": 17672607.0,
"step": 3860
},
{
"entropy": 0.6903492113575339,
"epoch": 0.364917905258071,
"grad_norm": 0.28515625,
"learning_rate": 3.5077107065945743e-06,
"loss": 0.5674126625061036,
"mean_token_accuracy": 0.8169661879539489,
"num_tokens": 17718690.0,
"step": 3870
},
{
"entropy": 0.7269641313701868,
"epoch": 0.36586084558173526,
"grad_norm": 0.40234375,
"learning_rate": 3.5002954629038007e-06,
"loss": 0.5830210208892822,
"mean_token_accuracy": 0.8018156543374062,
"num_tokens": 17760388.0,
"step": 3880
},
{
"entropy": 0.7480830346234143,
"epoch": 0.3668037859053995,
"grad_norm": 0.392578125,
"learning_rate": 3.4928697265869516e-06,
"loss": 0.5468933582305908,
"mean_token_accuracy": 0.800993998721242,
"num_tokens": 17810259.0,
"step": 3890
},
{
"entropy": 0.6070564269088209,
"epoch": 0.3677467262290638,
"grad_norm": 0.38671875,
"learning_rate": 3.48543357553649e-06,
"loss": 0.5181046009063721,
"mean_token_accuracy": 0.8317337445914745,
"num_tokens": 17858820.0,
"step": 3900
},
{
"entropy": 0.8158755677752196,
"epoch": 0.36868966655272806,
"grad_norm": 0.3828125,
"learning_rate": 3.4779870877541188e-06,
"loss": 0.6114593029022217,
"mean_token_accuracy": 0.7713057190179825,
"num_tokens": 17902522.0,
"step": 3910
},
{
"entropy": 0.6110333253629505,
"epoch": 0.3696326068763923,
"grad_norm": 0.322265625,
"learning_rate": 3.4705303413499736e-06,
"loss": 0.5357798099517822,
"mean_token_accuracy": 0.8168054174631834,
"num_tokens": 17949303.0,
"step": 3920
},
{
"entropy": 0.6398234066087752,
"epoch": 0.3705755472000566,
"grad_norm": 0.76171875,
"learning_rate": 3.4630634145417944e-06,
"loss": 0.6564537048339844,
"mean_token_accuracy": 0.8288793444633484,
"num_tokens": 17993395.0,
"step": 3930
},
{
"entropy": 0.6848932018503546,
"epoch": 0.37151848752372085,
"grad_norm": 0.5390625,
"learning_rate": 3.4555863856541107e-06,
"loss": 0.740598487854004,
"mean_token_accuracy": 0.7940419346094132,
"num_tokens": 18041610.0,
"step": 3940
},
{
"entropy": 0.647498956695199,
"epoch": 0.3724614278473851,
"grad_norm": 0.484375,
"learning_rate": 3.4480993331174166e-06,
"loss": 0.6062899112701416,
"mean_token_accuracy": 0.8174811258912087,
"num_tokens": 18092998.0,
"step": 3950
},
{
"entropy": 0.694026449136436,
"epoch": 0.3734043681710494,
"grad_norm": 0.26171875,
"learning_rate": 3.440602335467351e-06,
"loss": 0.5536818504333496,
"mean_token_accuracy": 0.7983353350311517,
"num_tokens": 18134601.0,
"step": 3960
},
{
"entropy": 0.6323764859698713,
"epoch": 0.37434730849471365,
"grad_norm": 0.419921875,
"learning_rate": 3.433095471343872e-06,
"loss": 0.658245325088501,
"mean_token_accuracy": 0.8151856455951929,
"num_tokens": 18178003.0,
"step": 3970
},
{
"entropy": 0.8302557891234755,
"epoch": 0.3752902488183779,
"grad_norm": 0.419921875,
"learning_rate": 3.425578819490431e-06,
"loss": 0.7398871898651123,
"mean_token_accuracy": 0.7722434610128402,
"num_tokens": 18221880.0,
"step": 3980
},
{
"entropy": 0.661791059281677,
"epoch": 0.3762331891420422,
"grad_norm": 0.443359375,
"learning_rate": 3.4180524587531504e-06,
"loss": 0.48392953872680666,
"mean_token_accuracy": 0.8174215763807297,
"num_tokens": 18265321.0,
"step": 3990
},
{
"entropy": 0.675689808651805,
"epoch": 0.37717612946570644,
"grad_norm": 0.48828125,
"learning_rate": 3.4105164680799928e-06,
"loss": 0.5103531837463379,
"mean_token_accuracy": 0.8037473402917386,
"num_tokens": 18306707.0,
"step": 4000
},
{
"entropy": 0.8221991116646677,
"epoch": 0.3781190697893707,
"grad_norm": 0.271484375,
"learning_rate": 3.402970926519934e-06,
"loss": 0.618397331237793,
"mean_token_accuracy": 0.7826770418323576,
"num_tokens": 18346281.0,
"step": 4010
},
{
"entropy": 0.7318005957640707,
"epoch": 0.379062010113035,
"grad_norm": 0.271484375,
"learning_rate": 3.395415913222134e-06,
"loss": 0.7626585960388184,
"mean_token_accuracy": 0.7984059415757656,
"num_tokens": 18389995.0,
"step": 4020
},
{
"entropy": 0.8118009151890874,
"epoch": 0.38000495043669924,
"grad_norm": 0.62109375,
"learning_rate": 3.3878515074351087e-06,
"loss": 0.7354348182678223,
"mean_token_accuracy": 0.7721582528203725,
"num_tokens": 18434935.0,
"step": 4030
},
{
"entropy": 0.8204971087165177,
"epoch": 0.3809478907603635,
"grad_norm": 0.57421875,
"learning_rate": 3.3802777885058933e-06,
"loss": 0.5647460460662842,
"mean_token_accuracy": 0.7732091106474399,
"num_tokens": 18482777.0,
"step": 4040
},
{
"entropy": 0.6955384029075503,
"epoch": 0.38189083108402777,
"grad_norm": 0.4921875,
"learning_rate": 3.3726948358792176e-06,
"loss": 0.6320321083068847,
"mean_token_accuracy": 0.8126376781612634,
"num_tokens": 18530249.0,
"step": 4050
},
{
"entropy": 0.7113258785568177,
"epoch": 0.38283377140769204,
"grad_norm": 0.46484375,
"learning_rate": 3.3651027290966653e-06,
"loss": 0.5650223731994629,
"mean_token_accuracy": 0.8019524831324816,
"num_tokens": 18577504.0,
"step": 4060
},
{
"entropy": 0.6824137067887932,
"epoch": 0.3837767117313563,
"grad_norm": 1.2734375,
"learning_rate": 3.3575015477958445e-06,
"loss": 0.6059187412261963,
"mean_token_accuracy": 0.7883812438696622,
"num_tokens": 18619468.0,
"step": 4070
},
{
"entropy": 0.7901984248310328,
"epoch": 0.38471965205502057,
"grad_norm": 0.408203125,
"learning_rate": 3.34989137170955e-06,
"loss": 0.5455976486206054,
"mean_token_accuracy": 0.784822690486908,
"num_tokens": 18667000.0,
"step": 4080
},
{
"entropy": 0.718475041934289,
"epoch": 0.38566259237868483,
"grad_norm": 0.31640625,
"learning_rate": 3.3422722806649276e-06,
"loss": 0.5682651042938233,
"mean_token_accuracy": 0.8000302887521684,
"num_tokens": 18710396.0,
"step": 4090
},
{
"entropy": 0.6617384196259082,
"epoch": 0.3866055327023491,
"grad_norm": 0.35546875,
"learning_rate": 3.334644354582638e-06,
"loss": 0.5210241794586181,
"mean_token_accuracy": 0.8172427896410227,
"num_tokens": 18758405.0,
"step": 4100
},
{
"entropy": 0.7391965406015515,
"epoch": 0.38754847302601336,
"grad_norm": 0.64453125,
"learning_rate": 3.327007673476015e-06,
"loss": 0.6083121299743652,
"mean_token_accuracy": 0.7892594009637832,
"num_tokens": 18803120.0,
"step": 4110
},
{
"entropy": 0.6573400060646236,
"epoch": 0.38849141334967763,
"grad_norm": 0.72265625,
"learning_rate": 3.319362317450231e-06,
"loss": 0.5357893466949463,
"mean_token_accuracy": 0.8097851235419512,
"num_tokens": 18846147.0,
"step": 4120
},
{
"entropy": 0.7643828511238098,
"epoch": 0.3894343536733419,
"grad_norm": 0.75390625,
"learning_rate": 3.3117083667014518e-06,
"loss": 0.6513972759246827,
"mean_token_accuracy": 0.8002022080123424,
"num_tokens": 18888996.0,
"step": 4130
},
{
"entropy": 0.6743721715174615,
"epoch": 0.39037729399700616,
"grad_norm": 0.61328125,
"learning_rate": 3.304045901516e-06,
"loss": 0.5173910617828369,
"mean_token_accuracy": 0.8222727868705988,
"num_tokens": 18933492.0,
"step": 4140
},
{
"entropy": 0.6496790492208675,
"epoch": 0.3913202343206704,
"grad_norm": 0.474609375,
"learning_rate": 3.2963750022695094e-06,
"loss": 0.5311402320861817,
"mean_token_accuracy": 0.8124469438567757,
"num_tokens": 18980265.0,
"step": 4150
},
{
"entropy": 0.7410643206909299,
"epoch": 0.3922631746443347,
"grad_norm": 0.3671875,
"learning_rate": 3.288695749426084e-06,
"loss": 0.5552346229553222,
"mean_token_accuracy": 0.8150686305016279,
"num_tokens": 19034421.0,
"step": 4160
},
{
"entropy": 0.7548421092098578,
"epoch": 0.39320611496799895,
"grad_norm": 0.490234375,
"learning_rate": 3.2810082235374508e-06,
"loss": 0.7359838485717773,
"mean_token_accuracy": 0.8010040692985058,
"num_tokens": 19084813.0,
"step": 4170
},
{
"entropy": 0.5428073874674737,
"epoch": 0.3941490552916632,
"grad_norm": 0.318359375,
"learning_rate": 3.2733125052421193e-06,
"loss": 0.46096482276916506,
"mean_token_accuracy": 0.8404661461710929,
"num_tokens": 19131677.0,
"step": 4180
},
{
"entropy": 0.6938783401623368,
"epoch": 0.3950919956153275,
"grad_norm": 0.54296875,
"learning_rate": 3.2656086752645334e-06,
"loss": 0.6413106441497802,
"mean_token_accuracy": 0.804457500204444,
"num_tokens": 19175289.0,
"step": 4190
},
{
"entropy": 0.7383185734972357,
"epoch": 0.39603493593899175,
"grad_norm": 0.625,
"learning_rate": 3.257896814414223e-06,
"loss": 0.599180793762207,
"mean_token_accuracy": 0.7934302197769284,
"num_tokens": 19226110.0,
"step": 4200
},
{
"entropy": 0.6432693097740412,
"epoch": 0.396977876262656,
"grad_norm": 0.63671875,
"learning_rate": 3.2501770035849605e-06,
"loss": 0.5177838802337646,
"mean_token_accuracy": 0.8194103617221117,
"num_tokens": 19273450.0,
"step": 4210
},
{
"entropy": 0.6650319148786366,
"epoch": 0.3979208165863203,
"grad_norm": 0.43359375,
"learning_rate": 3.242449323753908e-06,
"loss": 0.5644178867340088,
"mean_token_accuracy": 0.8194221030920744,
"num_tokens": 19313801.0,
"step": 4220
},
{
"entropy": 0.7258335336111486,
"epoch": 0.39886375690998455,
"grad_norm": 0.392578125,
"learning_rate": 3.2347138559807702e-06,
"loss": 0.7438495635986329,
"mean_token_accuracy": 0.8006484184414149,
"num_tokens": 19364314.0,
"step": 4230
},
{
"entropy": 0.6766277103684842,
"epoch": 0.3998066972336488,
"grad_norm": 0.50390625,
"learning_rate": 3.226970681406944e-06,
"loss": 0.6204345703125,
"mean_token_accuracy": 0.7923669695854187,
"num_tokens": 19408153.0,
"step": 4240
},
{
"entropy": 0.7198492975905537,
"epoch": 0.4007496375573131,
"grad_norm": 0.439453125,
"learning_rate": 3.219219881254666e-06,
"loss": 0.6644938945770263,
"mean_token_accuracy": 0.7969273280352354,
"num_tokens": 19451626.0,
"step": 4250
},
{
"entropy": 0.843270109500736,
"epoch": 0.40169257788097734,
"grad_norm": 0.474609375,
"learning_rate": 3.2114615368261624e-06,
"loss": 0.7886375427246094,
"mean_token_accuracy": 0.7667363656684756,
"num_tokens": 19500931.0,
"step": 4260
},
{
"entropy": 0.7085121444426477,
"epoch": 0.4026355182046416,
"grad_norm": 0.90234375,
"learning_rate": 3.2036957295027958e-06,
"loss": 0.6949386119842529,
"mean_token_accuracy": 0.7916569627821446,
"num_tokens": 19549938.0,
"step": 4270
},
{
"entropy": 0.6853237067349255,
"epoch": 0.4035784585283059,
"grad_norm": 0.75390625,
"learning_rate": 3.1959225407442097e-06,
"loss": 0.6178842544555664,
"mean_token_accuracy": 0.8125127829611302,
"num_tokens": 19599634.0,
"step": 4280
},
{
"entropy": 0.6578317375853657,
"epoch": 0.40452139885197014,
"grad_norm": 0.58984375,
"learning_rate": 3.188142052087476e-06,
"loss": 0.6399495601654053,
"mean_token_accuracy": 0.8123631715774536,
"num_tokens": 19645911.0,
"step": 4290
},
{
"entropy": 0.678624777495861,
"epoch": 0.4054643391756344,
"grad_norm": 0.353515625,
"learning_rate": 3.1803543451462393e-06,
"loss": 0.6367847919464111,
"mean_token_accuracy": 0.8035919483751058,
"num_tokens": 19688704.0,
"step": 4300
},
{
"entropy": 0.5864495939575136,
"epoch": 0.40640727949929867,
"grad_norm": 0.28125,
"learning_rate": 3.17255950160986e-06,
"loss": 0.506658411026001,
"mean_token_accuracy": 0.825262775272131,
"num_tokens": 19730777.0,
"step": 4310
},
{
"entropy": 0.7443196853622794,
"epoch": 0.40735021982296293,
"grad_norm": 0.48828125,
"learning_rate": 3.164757603242559e-06,
"loss": 0.54283447265625,
"mean_token_accuracy": 0.7956912875175476,
"num_tokens": 19776535.0,
"step": 4320
},
{
"entropy": 0.7234893916174769,
"epoch": 0.4082931601466272,
"grad_norm": 0.458984375,
"learning_rate": 3.1569487318825576e-06,
"loss": 0.6039177894592285,
"mean_token_accuracy": 0.8105068215169012,
"num_tokens": 19819712.0,
"step": 4330
},
{
"entropy": 0.7695184142328799,
"epoch": 0.40923610047029146,
"grad_norm": 0.6484375,
"learning_rate": 3.1491329694412217e-06,
"loss": 0.6124618530273438,
"mean_token_accuracy": 0.7952944649383425,
"num_tokens": 19870603.0,
"step": 4340
},
{
"entropy": 0.80782908834517,
"epoch": 0.41017904079395573,
"grad_norm": 0.427734375,
"learning_rate": 3.1413103979021996e-06,
"loss": 0.7708604812622071,
"mean_token_accuracy": 0.7625693265348673,
"num_tokens": 19912895.0,
"step": 4350
},
{
"entropy": 0.8120630858466029,
"epoch": 0.41112198111762,
"grad_norm": 0.671875,
"learning_rate": 3.133481099320567e-06,
"loss": 0.8301298141479492,
"mean_token_accuracy": 0.7721738774329424,
"num_tokens": 19955841.0,
"step": 4360
},
{
"entropy": 0.6812439509667456,
"epoch": 0.41206492144128426,
"grad_norm": 0.79296875,
"learning_rate": 3.1256451558219614e-06,
"loss": 0.6116904258728028,
"mean_token_accuracy": 0.8017740860581398,
"num_tokens": 20005277.0,
"step": 4370
},
{
"entropy": 0.650224775960669,
"epoch": 0.4130078617649485,
"grad_norm": 0.349609375,
"learning_rate": 3.1178026496017206e-06,
"loss": 0.591245460510254,
"mean_token_accuracy": 0.8192921217530966,
"num_tokens": 20052094.0,
"step": 4380
},
{
"entropy": 0.6650533619336784,
"epoch": 0.4139508020886128,
"grad_norm": 0.310546875,
"learning_rate": 3.109953662924025e-06,
"loss": 0.6183666229248047,
"mean_token_accuracy": 0.8229886900633574,
"num_tokens": 20096509.0,
"step": 4390
},
{
"entropy": 0.7457806673366576,
"epoch": 0.41489374241227706,
"grad_norm": 0.453125,
"learning_rate": 3.1020982781210306e-06,
"loss": 0.5394028663635254,
"mean_token_accuracy": 0.797967865690589,
"num_tokens": 20146777.0,
"step": 4400
},
{
"entropy": 0.6870288801379502,
"epoch": 0.4158366827359414,
"grad_norm": 0.54296875,
"learning_rate": 3.0942365775920057e-06,
"loss": 0.5307192802429199,
"mean_token_accuracy": 0.8131231028586626,
"num_tokens": 20187659.0,
"step": 4410
},
{
"entropy": 0.7553388600237667,
"epoch": 0.41677962305960564,
"grad_norm": 0.65234375,
"learning_rate": 3.086368643802471e-06,
"loss": 0.655640697479248,
"mean_token_accuracy": 0.789563775807619,
"num_tokens": 20231537.0,
"step": 4420
},
{
"entropy": 0.7162960932124406,
"epoch": 0.4177225633832699,
"grad_norm": 0.390625,
"learning_rate": 3.078494559283327e-06,
"loss": 0.5714639186859131,
"mean_token_accuracy": 0.8139267075806856,
"num_tokens": 20275124.0,
"step": 4430
},
{
"entropy": 0.638027570489794,
"epoch": 0.4186655037069342,
"grad_norm": 0.6796875,
"learning_rate": 3.070614406629995e-06,
"loss": 0.5676782608032227,
"mean_token_accuracy": 0.8156324338167906,
"num_tokens": 20321807.0,
"step": 4440
},
{
"entropy": 0.7704670215025544,
"epoch": 0.41960844403059844,
"grad_norm": 0.796875,
"learning_rate": 3.0627282685015477e-06,
"loss": 0.5788619518280029,
"mean_token_accuracy": 0.8035795167088509,
"num_tokens": 20364595.0,
"step": 4450
},
{
"entropy": 0.8218068578746169,
"epoch": 0.4205513843542627,
"grad_norm": 0.796875,
"learning_rate": 3.054836227619842e-06,
"loss": 0.5779088020324707,
"mean_token_accuracy": 0.7815472435206174,
"num_tokens": 20410612.0,
"step": 4460
},
{
"entropy": 0.5942241735756397,
"epoch": 0.42149432467792697,
"grad_norm": 0.59765625,
"learning_rate": 3.0469383667686532e-06,
"loss": 0.47473464012145994,
"mean_token_accuracy": 0.8354270774871111,
"num_tokens": 20454032.0,
"step": 4470
},
{
"entropy": 0.5301405775360764,
"epoch": 0.42243726500159123,
"grad_norm": 0.44140625,
"learning_rate": 3.039034768792803e-06,
"loss": 0.44197745323181153,
"mean_token_accuracy": 0.8487105399370194,
"num_tokens": 20496123.0,
"step": 4480
},
{
"entropy": 0.7075543572660535,
"epoch": 0.4233802053252555,
"grad_norm": 0.294921875,
"learning_rate": 3.0311255165972953e-06,
"loss": 0.5451488494873047,
"mean_token_accuracy": 0.8073224203661085,
"num_tokens": 20539415.0,
"step": 4490
},
{
"entropy": 0.6837927075102925,
"epoch": 0.42432314564891976,
"grad_norm": 0.4375,
"learning_rate": 3.0232106931464434e-06,
"loss": 0.6114567279815674,
"mean_token_accuracy": 0.8121942866593599,
"num_tokens": 20584443.0,
"step": 4500
},
{
"entropy": 0.6196409862488508,
"epoch": 0.42526608597258403,
"grad_norm": 0.6015625,
"learning_rate": 3.015290381462998e-06,
"loss": 0.6821407794952392,
"mean_token_accuracy": 0.8301993541419506,
"num_tokens": 20630900.0,
"step": 4510
},
{
"entropy": 0.7151961518451572,
"epoch": 0.4262090262962483,
"grad_norm": 0.4921875,
"learning_rate": 3.0073646646272837e-06,
"loss": 0.614381217956543,
"mean_token_accuracy": 0.8130818229168654,
"num_tokens": 20673932.0,
"step": 4520
},
{
"entropy": 0.6770127274096012,
"epoch": 0.42715196661991256,
"grad_norm": 0.4375,
"learning_rate": 2.9994336257763175e-06,
"loss": 0.54631028175354,
"mean_token_accuracy": 0.8104281619191169,
"num_tokens": 20720772.0,
"step": 4530
},
{
"entropy": 0.6979648591019213,
"epoch": 0.4280949069435768,
"grad_norm": 0.74609375,
"learning_rate": 2.991497348102945e-06,
"loss": 0.6474967956542969,
"mean_token_accuracy": 0.7961675971746445,
"num_tokens": 20766481.0,
"step": 4540
},
{
"entropy": 0.623636071383953,
"epoch": 0.4290378472672411,
"grad_norm": 0.296875,
"learning_rate": 2.9835559148549638e-06,
"loss": 0.6137451648712158,
"mean_token_accuracy": 0.8198790092021226,
"num_tokens": 20805502.0,
"step": 4550
},
{
"entropy": 0.5448908562771976,
"epoch": 0.42998078759090536,
"grad_norm": 0.83203125,
"learning_rate": 2.97560940933425e-06,
"loss": 0.49565706253051756,
"mean_token_accuracy": 0.848630927503109,
"num_tokens": 20847160.0,
"step": 4560
},
{
"entropy": 0.7783894378691911,
"epoch": 0.4309237279145696,
"grad_norm": 0.35546875,
"learning_rate": 2.967657914895887e-06,
"loss": 0.77616868019104,
"mean_token_accuracy": 0.7921557927504181,
"num_tokens": 20894790.0,
"step": 4570
},
{
"entropy": 0.7091885100118815,
"epoch": 0.4318666682382339,
"grad_norm": 0.3828125,
"learning_rate": 2.9597015149472878e-06,
"loss": 0.633561372756958,
"mean_token_accuracy": 0.8060255534946918,
"num_tokens": 20941007.0,
"step": 4580
},
{
"entropy": 0.6587966305203736,
"epoch": 0.43280960856189815,
"grad_norm": 0.2470703125,
"learning_rate": 2.9517402929473243e-06,
"loss": 0.6381916522979736,
"mean_token_accuracy": 0.830630149319768,
"num_tokens": 20992763.0,
"step": 4590
},
{
"entropy": 0.7116721348837018,
"epoch": 0.4337525488855624,
"grad_norm": 0.46875,
"learning_rate": 2.943774332405448e-06,
"loss": 0.6077177047729492,
"mean_token_accuracy": 0.7988573126494884,
"num_tokens": 21038753.0,
"step": 4600
},
{
"entropy": 0.7426122948527336,
"epoch": 0.4346954892092267,
"grad_norm": 0.376953125,
"learning_rate": 2.935803716880815e-06,
"loss": 0.6154319763183593,
"mean_token_accuracy": 0.8028998583555221,
"num_tokens": 21082452.0,
"step": 4610
},
{
"entropy": 0.7233793533407151,
"epoch": 0.43563842953289095,
"grad_norm": 0.5546875,
"learning_rate": 2.927828529981411e-06,
"loss": 0.584602165222168,
"mean_token_accuracy": 0.7928648635745048,
"num_tokens": 21128139.0,
"step": 4620
},
{
"entropy": 0.7569336066953838,
"epoch": 0.4365813698565552,
"grad_norm": 0.1953125,
"learning_rate": 2.919848855363172e-06,
"loss": 0.4981938362121582,
"mean_token_accuracy": 0.8080588222481311,
"num_tokens": 21175953.0,
"step": 4630
},
{
"entropy": 0.6948595408350229,
"epoch": 0.4375243101802195,
"grad_norm": 1.3359375,
"learning_rate": 2.9118647767291096e-06,
"loss": 0.7068987846374511,
"mean_token_accuracy": 0.8049037493765354,
"num_tokens": 21228357.0,
"step": 4640
},
{
"entropy": 0.749409731477499,
"epoch": 0.43846725050388374,
"grad_norm": 0.5078125,
"learning_rate": 2.903876377828431e-06,
"loss": 0.5781918525695801,
"mean_token_accuracy": 0.7907330963760615,
"num_tokens": 21282711.0,
"step": 4650
},
{
"entropy": 0.7640089130960405,
"epoch": 0.439410190827548,
"grad_norm": 0.55859375,
"learning_rate": 2.8958837424556586e-06,
"loss": 0.6110117435455322,
"mean_token_accuracy": 0.8006194703280926,
"num_tokens": 21322979.0,
"step": 4660
},
{
"entropy": 0.6390418185852468,
"epoch": 0.4403531311512123,
"grad_norm": 0.458984375,
"learning_rate": 2.8878869544497574e-06,
"loss": 0.594711446762085,
"mean_token_accuracy": 0.8070811614394188,
"num_tokens": 21367310.0,
"step": 4670
},
{
"entropy": 0.80012998431921,
"epoch": 0.44129607147487654,
"grad_norm": 0.62109375,
"learning_rate": 2.879886097693249e-06,
"loss": 0.7834507465362549,
"mean_token_accuracy": 0.77053287550807,
"num_tokens": 21409253.0,
"step": 4680
},
{
"entropy": 0.7294010010547936,
"epoch": 0.4422390117985408,
"grad_norm": 0.69921875,
"learning_rate": 2.871881256111335e-06,
"loss": 0.701657485961914,
"mean_token_accuracy": 0.7879527509212494,
"num_tokens": 21453671.0,
"step": 4690
},
{
"entropy": 0.6360360025428236,
"epoch": 0.44318195212220507,
"grad_norm": 0.39453125,
"learning_rate": 2.8638725136710156e-06,
"loss": 0.5755587100982666,
"mean_token_accuracy": 0.8209034506231546,
"num_tokens": 21507926.0,
"step": 4700
},
{
"entropy": 0.7269893609918654,
"epoch": 0.44412489244586933,
"grad_norm": 0.376953125,
"learning_rate": 2.855859954380209e-06,
"loss": 0.7129250049591065,
"mean_token_accuracy": 0.8010267514735461,
"num_tokens": 21551045.0,
"step": 4710
},
{
"entropy": 0.6108814541250467,
"epoch": 0.4450678327695336,
"grad_norm": 0.455078125,
"learning_rate": 2.8478436622868704e-06,
"loss": 0.5731475353240967,
"mean_token_accuracy": 0.8247819773852825,
"num_tokens": 21598339.0,
"step": 4720
},
{
"entropy": 0.7286485302262008,
"epoch": 0.44601077309319787,
"grad_norm": 0.578125,
"learning_rate": 2.8398237214781123e-06,
"loss": 0.5923725128173828,
"mean_token_accuracy": 0.7957899816334247,
"num_tokens": 21644913.0,
"step": 4730
},
{
"entropy": 0.8006156609393656,
"epoch": 0.44695371341686213,
"grad_norm": 0.5,
"learning_rate": 2.8318002160793175e-06,
"loss": 0.5867124557495117,
"mean_token_accuracy": 0.7782018858939409,
"num_tokens": 21691472.0,
"step": 4740
},
{
"entropy": 0.731638565286994,
"epoch": 0.4478966537405264,
"grad_norm": 0.30859375,
"learning_rate": 2.82377323025326e-06,
"loss": 0.7104349613189698,
"mean_token_accuracy": 0.800374174490571,
"num_tokens": 21738146.0,
"step": 4750
},
{
"entropy": 0.6022297551855444,
"epoch": 0.44883959406419066,
"grad_norm": 0.6015625,
"learning_rate": 2.815742848199225e-06,
"loss": 0.6393797397613525,
"mean_token_accuracy": 0.8331300269812345,
"num_tokens": 21781574.0,
"step": 4760
},
{
"entropy": 0.6964669045060873,
"epoch": 0.4497825343878549,
"grad_norm": 0.640625,
"learning_rate": 2.8077091541521197e-06,
"loss": 0.8155632019042969,
"mean_token_accuracy": 0.799362026527524,
"num_tokens": 21821499.0,
"step": 4770
},
{
"entropy": 0.8252560695633292,
"epoch": 0.4507254747115192,
"grad_norm": 0.53515625,
"learning_rate": 2.7996722323815923e-06,
"loss": 0.6062126636505127,
"mean_token_accuracy": 0.7833932403475046,
"num_tokens": 21867325.0,
"step": 4780
},
{
"entropy": 0.7341827435418964,
"epoch": 0.45166841503518346,
"grad_norm": 0.5390625,
"learning_rate": 2.79163216719115e-06,
"loss": 0.6348656177520752,
"mean_token_accuracy": 0.7946558525785804,
"num_tokens": 21909555.0,
"step": 4790
},
{
"entropy": 0.7667273837141693,
"epoch": 0.4526113553588477,
"grad_norm": 0.267578125,
"learning_rate": 2.7835890429172712e-06,
"loss": 0.6177640914916992,
"mean_token_accuracy": 0.8011632848531007,
"num_tokens": 21958171.0,
"step": 4800
},
{
"entropy": 0.6290356336161494,
"epoch": 0.453554295682512,
"grad_norm": 0.318359375,
"learning_rate": 2.7755429439285243e-06,
"loss": 0.6255978584289551,
"mean_token_accuracy": 0.8260467633605003,
"num_tokens": 22008006.0,
"step": 4810
},
{
"entropy": 0.7753217613324523,
"epoch": 0.45449723600617625,
"grad_norm": 0.310546875,
"learning_rate": 2.767493954624681e-06,
"loss": 0.6561094760894776,
"mean_token_accuracy": 0.785815117880702,
"num_tokens": 22049411.0,
"step": 4820
},
{
"entropy": 0.6085925869643688,
"epoch": 0.4554401763298405,
"grad_norm": 0.34375,
"learning_rate": 2.759442159435829e-06,
"loss": 0.555381441116333,
"mean_token_accuracy": 0.8140901662409306,
"num_tokens": 22095072.0,
"step": 4830
},
{
"entropy": 0.7590108618140221,
"epoch": 0.4563831166535048,
"grad_norm": 0.25,
"learning_rate": 2.751387642821491e-06,
"loss": 0.6291932582855224,
"mean_token_accuracy": 0.7985693622380495,
"num_tokens": 22139728.0,
"step": 4840
},
{
"entropy": 0.6212056964635849,
"epoch": 0.45732605697716905,
"grad_norm": 0.33984375,
"learning_rate": 2.743330489269734e-06,
"loss": 0.5828049182891846,
"mean_token_accuracy": 0.817613198235631,
"num_tokens": 22185360.0,
"step": 4850
},
{
"entropy": 0.6736974530853331,
"epoch": 0.4582689973008333,
"grad_norm": 0.66015625,
"learning_rate": 2.7352707832962865e-06,
"loss": 0.5845682144165039,
"mean_token_accuracy": 0.8124393951147795,
"num_tokens": 22229210.0,
"step": 4860
},
{
"entropy": 0.712392061483115,
"epoch": 0.4592119376244976,
"grad_norm": 0.703125,
"learning_rate": 2.72720860944365e-06,
"loss": 0.6037466526031494,
"mean_token_accuracy": 0.797969845123589,
"num_tokens": 22273412.0,
"step": 4870
},
{
"entropy": 0.6442144404165446,
"epoch": 0.46015487794816184,
"grad_norm": 0.279296875,
"learning_rate": 2.7191440522802142e-06,
"loss": 0.5164260864257812,
"mean_token_accuracy": 0.819934631511569,
"num_tokens": 22324588.0,
"step": 4880
},
{
"entropy": 0.5705735078081489,
"epoch": 0.4610978182718261,
"grad_norm": 0.361328125,
"learning_rate": 2.7110771963993676e-06,
"loss": 0.5488987922668457,
"mean_token_accuracy": 0.8361519493162632,
"num_tokens": 22372642.0,
"step": 4890
},
{
"entropy": 0.642943031527102,
"epoch": 0.4620407585954904,
"grad_norm": 0.52734375,
"learning_rate": 2.70300812641861e-06,
"loss": 0.6016288280487061,
"mean_token_accuracy": 0.8095859756693244,
"num_tokens": 22423297.0,
"step": 4900
},
{
"entropy": 0.7380821701139212,
"epoch": 0.46298369891915464,
"grad_norm": 1.3515625,
"learning_rate": 2.694936926978668e-06,
"loss": 0.6568095207214355,
"mean_token_accuracy": 0.7910981852561235,
"num_tokens": 22460407.0,
"step": 4910
},
{
"entropy": 0.6616219971328974,
"epoch": 0.4639266392428189,
"grad_norm": 1.25,
"learning_rate": 2.6868636827426055e-06,
"loss": 0.6499626159667968,
"mean_token_accuracy": 0.8095650464296341,
"num_tokens": 22507306.0,
"step": 4920
},
{
"entropy": 0.6243038043379784,
"epoch": 0.46486957956648317,
"grad_norm": 0.419921875,
"learning_rate": 2.6787884783949325e-06,
"loss": 0.4949214458465576,
"mean_token_accuracy": 0.812331048771739,
"num_tokens": 22550929.0,
"step": 4930
},
{
"entropy": 0.7329422317445278,
"epoch": 0.46581251989014744,
"grad_norm": 0.45703125,
"learning_rate": 2.670711398640723e-06,
"loss": 0.731619119644165,
"mean_token_accuracy": 0.7989665359258652,
"num_tokens": 22595301.0,
"step": 4940
},
{
"entropy": 0.5789965157397091,
"epoch": 0.4667554602138117,
"grad_norm": 0.265625,
"learning_rate": 2.662632528204721e-06,
"loss": 0.5827124118804932,
"mean_token_accuracy": 0.8362434811890125,
"num_tokens": 22650881.0,
"step": 4950
},
{
"entropy": 0.6578682715538889,
"epoch": 0.46769840053747597,
"grad_norm": 0.3984375,
"learning_rate": 2.6545519518304542e-06,
"loss": 0.49361634254455566,
"mean_token_accuracy": 0.8121582861989737,
"num_tokens": 22702979.0,
"step": 4960
},
{
"entropy": 0.825195993669331,
"epoch": 0.46864134086114023,
"grad_norm": 0.396484375,
"learning_rate": 2.646469754279345e-06,
"loss": 0.6855580806732178,
"mean_token_accuracy": 0.7875312244519591,
"num_tokens": 22739946.0,
"step": 4970
},
{
"entropy": 0.7191408189013601,
"epoch": 0.4695842811848045,
"grad_norm": 0.71875,
"learning_rate": 2.6383860203298225e-06,
"loss": 0.5945919990539551,
"mean_token_accuracy": 0.7952681098133325,
"num_tokens": 22786614.0,
"step": 4980
},
{
"entropy": 0.7237249138765037,
"epoch": 0.47052722150846876,
"grad_norm": 0.404296875,
"learning_rate": 2.6303008347764297e-06,
"loss": 0.5328628063201905,
"mean_token_accuracy": 0.8129015320912003,
"num_tokens": 22836470.0,
"step": 4990
},
{
"entropy": 0.636794293904677,
"epoch": 0.47147016183213303,
"grad_norm": 0.328125,
"learning_rate": 2.622214282428937e-06,
"loss": 0.594303560256958,
"mean_token_accuracy": 0.8139680068939924,
"num_tokens": 22877578.0,
"step": 5000
},
{
"entropy": 0.6889806432649493,
"epoch": 0.4724131021557973,
"grad_norm": 0.86328125,
"learning_rate": 2.614126448111453e-06,
"loss": 0.4839592456817627,
"mean_token_accuracy": 0.8087041890248656,
"num_tokens": 22920003.0,
"step": 5010
},
{
"entropy": 0.8315211714245379,
"epoch": 0.47335604247946156,
"grad_norm": 0.60546875,
"learning_rate": 2.606037416661531e-06,
"loss": 0.6565670490264892,
"mean_token_accuracy": 0.7755562437698245,
"num_tokens": 22968717.0,
"step": 5020
},
{
"entropy": 0.6515540423803031,
"epoch": 0.4742989828031258,
"grad_norm": 0.734375,
"learning_rate": 2.5979472729292855e-06,
"loss": 0.544868278503418,
"mean_token_accuracy": 0.819118132814765,
"num_tokens": 23010837.0,
"step": 5030
},
{
"entropy": 0.6562650393694639,
"epoch": 0.4752419231267901,
"grad_norm": 0.412109375,
"learning_rate": 2.589856101776494e-06,
"loss": 0.6573739051818848,
"mean_token_accuracy": 0.8055673878639936,
"num_tokens": 23056198.0,
"step": 5040
},
{
"entropy": 0.6976808074861764,
"epoch": 0.47618486345045435,
"grad_norm": 0.6328125,
"learning_rate": 2.581763988075714e-06,
"loss": 0.5908962249755859,
"mean_token_accuracy": 0.8016349047422409,
"num_tokens": 23105822.0,
"step": 5050
},
{
"entropy": 0.6807854567654431,
"epoch": 0.4771278037741186,
"grad_norm": 0.40625,
"learning_rate": 2.573671016709389e-06,
"loss": 0.6641458034515381,
"mean_token_accuracy": 0.8188594870269299,
"num_tokens": 23153269.0,
"step": 5060
},
{
"entropy": 0.7438366217538714,
"epoch": 0.4780707440977829,
"grad_norm": 0.546875,
"learning_rate": 2.5655772725689603e-06,
"loss": 0.5763253688812255,
"mean_token_accuracy": 0.8034364895895123,
"num_tokens": 23192625.0,
"step": 5070
},
{
"entropy": 0.670103266928345,
"epoch": 0.47901368442144715,
"grad_norm": 0.373046875,
"learning_rate": 2.5574828405539728e-06,
"loss": 0.6656664848327637,
"mean_token_accuracy": 0.7948807664215565,
"num_tokens": 23232898.0,
"step": 5080
},
{
"entropy": 0.6341434024274349,
"epoch": 0.47995662474511147,
"grad_norm": 0.4375,
"learning_rate": 2.549387805571187e-06,
"loss": 0.6048046588897705,
"mean_token_accuracy": 0.8179752115160227,
"num_tokens": 23280386.0,
"step": 5090
},
{
"entropy": 0.5786968288943172,
"epoch": 0.48089956506877574,
"grad_norm": 0.427734375,
"learning_rate": 2.541292252533692e-06,
"loss": 0.4855860710144043,
"mean_token_accuracy": 0.8366754438728095,
"num_tokens": 23337825.0,
"step": 5100
},
{
"entropy": 0.6527865190058947,
"epoch": 0.48184250539244,
"grad_norm": 0.77734375,
"learning_rate": 2.5331962663600067e-06,
"loss": 0.5803621768951416,
"mean_token_accuracy": 0.8150936767458916,
"num_tokens": 23384315.0,
"step": 5110
},
{
"entropy": 0.5440753613132984,
"epoch": 0.48278544571610427,
"grad_norm": 0.48046875,
"learning_rate": 2.525099931973195e-06,
"loss": 0.4513993263244629,
"mean_token_accuracy": 0.8605207178741694,
"num_tokens": 23426647.0,
"step": 5120
},
{
"entropy": 0.7320382345467806,
"epoch": 0.48372838603976853,
"grad_norm": 0.455078125,
"learning_rate": 2.5170033342999744e-06,
"loss": 0.5450259208679199,
"mean_token_accuracy": 0.806569528952241,
"num_tokens": 23479860.0,
"step": 5130
},
{
"entropy": 0.932574069686234,
"epoch": 0.4846713263634328,
"grad_norm": 0.43359375,
"learning_rate": 2.508906558269823e-06,
"loss": 0.6856896877288818,
"mean_token_accuracy": 0.7718136046081782,
"num_tokens": 23524560.0,
"step": 5140
},
{
"entropy": 0.7975945806130766,
"epoch": 0.48561426668709706,
"grad_norm": 0.62109375,
"learning_rate": 2.50080968881409e-06,
"loss": 0.6863570213317871,
"mean_token_accuracy": 0.7639251388609409,
"num_tokens": 23569479.0,
"step": 5150
},
{
"entropy": 0.6952396250329912,
"epoch": 0.48655720701076133,
"grad_norm": 0.44921875,
"learning_rate": 2.492712810865104e-06,
"loss": 0.650794506072998,
"mean_token_accuracy": 0.7981450140476227,
"num_tokens": 23613236.0,
"step": 5160
},
{
"entropy": 0.692944074422121,
"epoch": 0.4875001473344256,
"grad_norm": 0.390625,
"learning_rate": 2.4846160093552844e-06,
"loss": 0.5776357173919677,
"mean_token_accuracy": 0.8085918761789799,
"num_tokens": 23664342.0,
"step": 5170
},
{
"entropy": 0.6718699016142636,
"epoch": 0.48844308765808986,
"grad_norm": 0.373046875,
"learning_rate": 2.4765193692162464e-06,
"loss": 0.5085245132446289,
"mean_token_accuracy": 0.8008262846618891,
"num_tokens": 23707193.0,
"step": 5180
},
{
"entropy": 0.706077482830733,
"epoch": 0.4893860279817541,
"grad_norm": 0.404296875,
"learning_rate": 2.4684229753779143e-06,
"loss": 0.6562648296356202,
"mean_token_accuracy": 0.8039237121120095,
"num_tokens": 23752334.0,
"step": 5190
},
{
"entropy": 0.7011547919362784,
"epoch": 0.4903289683054184,
"grad_norm": 0.515625,
"learning_rate": 2.460326912767629e-06,
"loss": 0.531063461303711,
"mean_token_accuracy": 0.7961400125175715,
"num_tokens": 23798649.0,
"step": 5200
},
{
"entropy": 0.6769697558134794,
"epoch": 0.49127190862908265,
"grad_norm": 0.390625,
"learning_rate": 2.4522312663092557e-06,
"loss": 0.6853522777557373,
"mean_token_accuracy": 0.8073696456849575,
"num_tokens": 23848741.0,
"step": 5210
},
{
"entropy": 0.7591002416796983,
"epoch": 0.4922148489527469,
"grad_norm": 0.67578125,
"learning_rate": 2.4441361209222954e-06,
"loss": 0.7305190563201904,
"mean_token_accuracy": 0.797344889678061,
"num_tokens": 23893101.0,
"step": 5220
},
{
"entropy": 0.6849329901859165,
"epoch": 0.4931577892764112,
"grad_norm": 0.2314453125,
"learning_rate": 2.4360415615209917e-06,
"loss": 0.5951381206512452,
"mean_token_accuracy": 0.803836777061224,
"num_tokens": 23939882.0,
"step": 5230
},
{
"entropy": 0.7282287730835378,
"epoch": 0.49410072960007545,
"grad_norm": 0.8203125,
"learning_rate": 2.4279476730134434e-06,
"loss": 0.7151484966278077,
"mean_token_accuracy": 0.7978202365338802,
"num_tokens": 23984588.0,
"step": 5240
},
{
"entropy": 0.5871094174683094,
"epoch": 0.4950436699237397,
"grad_norm": 0.275390625,
"learning_rate": 2.4198545403007096e-06,
"loss": 0.43007869720458985,
"mean_token_accuracy": 0.8355049606412649,
"num_tokens": 24029008.0,
"step": 5250
},
{
"entropy": 0.7616613085381687,
"epoch": 0.495986610247404,
"grad_norm": 0.7421875,
"learning_rate": 2.411762248275925e-06,
"loss": 0.6963319301605224,
"mean_token_accuracy": 0.7859408996999264,
"num_tokens": 24075516.0,
"step": 5260
},
{
"entropy": 0.6838515439070761,
"epoch": 0.49692955057106825,
"grad_norm": 0.462890625,
"learning_rate": 2.403670881823402e-06,
"loss": 0.4955598831176758,
"mean_token_accuracy": 0.8118189193308354,
"num_tokens": 24117898.0,
"step": 5270
},
{
"entropy": 0.7197461973875761,
"epoch": 0.4978724908947325,
"grad_norm": 0.5625,
"learning_rate": 2.395580525817747e-06,
"loss": 0.7124035835266114,
"mean_token_accuracy": 0.8052475444972516,
"num_tokens": 24158791.0,
"step": 5280
},
{
"entropy": 0.6253745971247554,
"epoch": 0.4988154312183968,
"grad_norm": 0.375,
"learning_rate": 2.3874912651229654e-06,
"loss": 0.6346887588500977,
"mean_token_accuracy": 0.8198149241507053,
"num_tokens": 24200515.0,
"step": 5290
},
{
"entropy": 0.7803498791530729,
"epoch": 0.49975837154206104,
"grad_norm": 0.7890625,
"learning_rate": 2.3794031845915747e-06,
"loss": 0.652740478515625,
"mean_token_accuracy": 0.7830078467726708,
"num_tokens": 24241164.0,
"step": 5300
},
{
"entropy": 0.6996277961879969,
"epoch": 0.5007013118657253,
"grad_norm": 0.53515625,
"learning_rate": 2.371316369063712e-06,
"loss": 0.48831911087036134,
"mean_token_accuracy": 0.8117915650829672,
"num_tokens": 24294051.0,
"step": 5310
},
{
"entropy": 0.7372800389304757,
"epoch": 0.5016442521893896,
"grad_norm": 0.326171875,
"learning_rate": 2.363230903366246e-06,
"loss": 0.669452428817749,
"mean_token_accuracy": 0.7989845238626003,
"num_tokens": 24336401.0,
"step": 5320
},
{
"entropy": 0.7606853501871228,
"epoch": 0.5025871925130538,
"grad_norm": 0.66015625,
"learning_rate": 2.355146872311886e-06,
"loss": 0.5572319984436035,
"mean_token_accuracy": 0.7974383737891912,
"num_tokens": 24386340.0,
"step": 5330
},
{
"entropy": 0.621194904576987,
"epoch": 0.5035301328367181,
"grad_norm": 0.69140625,
"learning_rate": 2.3470643606982917e-06,
"loss": 0.5595749378204345,
"mean_token_accuracy": 0.8278559125959873,
"num_tokens": 24438645.0,
"step": 5340
},
{
"entropy": 0.8461435342207551,
"epoch": 0.5044730731603824,
"grad_norm": 0.52734375,
"learning_rate": 2.338983453307186e-06,
"loss": 0.749328899383545,
"mean_token_accuracy": 0.768775100260973,
"num_tokens": 24483263.0,
"step": 5350
},
{
"entropy": 0.7757677493616939,
"epoch": 0.5054160134840466,
"grad_norm": 0.353515625,
"learning_rate": 2.3309042349034626e-06,
"loss": 0.7084070682525635,
"mean_token_accuracy": 0.7868932072073221,
"num_tokens": 24529164.0,
"step": 5360
},
{
"entropy": 0.753884001635015,
"epoch": 0.5063589538077109,
"grad_norm": 0.55859375,
"learning_rate": 2.322826790234301e-06,
"loss": 0.584246015548706,
"mean_token_accuracy": 0.7949038635939359,
"num_tokens": 24570830.0,
"step": 5370
},
{
"entropy": 0.7765898966928944,
"epoch": 0.5073018941313752,
"grad_norm": 0.3671875,
"learning_rate": 2.314751204028273e-06,
"loss": 0.7225810050964355,
"mean_token_accuracy": 0.7808141350746155,
"num_tokens": 24610942.0,
"step": 5380
},
{
"entropy": 0.6957989188842475,
"epoch": 0.5082448344550394,
"grad_norm": 0.349609375,
"learning_rate": 2.3066775609944563e-06,
"loss": 0.5243014812469482,
"mean_token_accuracy": 0.8077589053660631,
"num_tokens": 24652698.0,
"step": 5390
},
{
"entropy": 0.6827801558189094,
"epoch": 0.5091877747787037,
"grad_norm": 0.470703125,
"learning_rate": 2.2986059458215463e-06,
"loss": 0.5520379066467285,
"mean_token_accuracy": 0.8119027376174927,
"num_tokens": 24702847.0,
"step": 5400
},
{
"entropy": 0.7064282950363122,
"epoch": 0.510130715102368,
"grad_norm": 0.78515625,
"learning_rate": 2.290536443176967e-06,
"loss": 0.5469173431396485,
"mean_token_accuracy": 0.7847862780094147,
"num_tokens": 24750274.0,
"step": 5410
},
{
"entropy": 0.7025827980600298,
"epoch": 0.5110736554260322,
"grad_norm": 0.8046875,
"learning_rate": 2.2824691377059815e-06,
"loss": 0.6773509979248047,
"mean_token_accuracy": 0.811617712303996,
"num_tokens": 24793348.0,
"step": 5420
},
{
"entropy": 0.6194292335771024,
"epoch": 0.5120165957496965,
"grad_norm": 0.64453125,
"learning_rate": 2.2744041140308075e-06,
"loss": 0.43538432121276854,
"mean_token_accuracy": 0.83103067278862,
"num_tokens": 24851606.0,
"step": 5430
},
{
"entropy": 0.6980881096795202,
"epoch": 0.5129595360733608,
"grad_norm": 0.326171875,
"learning_rate": 2.266341456749728e-06,
"loss": 0.5463144302368164,
"mean_token_accuracy": 0.814735346660018,
"num_tokens": 24893529.0,
"step": 5440
},
{
"entropy": 0.6669334940612316,
"epoch": 0.513902476397025,
"grad_norm": 0.66796875,
"learning_rate": 2.2582812504362016e-06,
"loss": 0.6203276634216308,
"mean_token_accuracy": 0.817523836158216,
"num_tokens": 24938994.0,
"step": 5450
},
{
"entropy": 0.6864639653824269,
"epoch": 0.5148454167206893,
"grad_norm": 0.400390625,
"learning_rate": 2.2502235796379786e-06,
"loss": 0.6700600147247314,
"mean_token_accuracy": 0.7997597053647041,
"num_tokens": 24989371.0,
"step": 5460
},
{
"entropy": 0.7375475165434182,
"epoch": 0.5157883570443536,
"grad_norm": 0.3828125,
"learning_rate": 2.2421685288762133e-06,
"loss": 0.739337682723999,
"mean_token_accuracy": 0.8012431789189577,
"num_tokens": 25026248.0,
"step": 5470
},
{
"entropy": 0.7337912478949875,
"epoch": 0.5167312973680178,
"grad_norm": 0.37890625,
"learning_rate": 2.2341161826445764e-06,
"loss": 0.6376617431640625,
"mean_token_accuracy": 0.7975466061383486,
"num_tokens": 25070722.0,
"step": 5480
},
{
"entropy": 0.6371306877117604,
"epoch": 0.5176742376916821,
"grad_norm": 0.498046875,
"learning_rate": 2.2260666254083695e-06,
"loss": 0.46918063163757323,
"mean_token_accuracy": 0.8177219878882169,
"num_tokens": 25115523.0,
"step": 5490
},
{
"entropy": 0.5692290297709406,
"epoch": 0.5186171780153463,
"grad_norm": 0.9921875,
"learning_rate": 2.2180199416036385e-06,
"loss": 0.5440778255462646,
"mean_token_accuracy": 0.8257677935063839,
"num_tokens": 25172217.0,
"step": 5500
},
{
"entropy": 0.6837885739281774,
"epoch": 0.5195601183390106,
"grad_norm": 0.5546875,
"learning_rate": 2.2099762156362897e-06,
"loss": 0.7906906604766846,
"mean_token_accuracy": 0.814153590425849,
"num_tokens": 25209734.0,
"step": 5510
},
{
"entropy": 0.8297489018645138,
"epoch": 0.5205030586626749,
"grad_norm": 0.55078125,
"learning_rate": 2.201935531881202e-06,
"loss": 0.715370512008667,
"mean_token_accuracy": 0.7802321035414934,
"num_tokens": 25263278.0,
"step": 5520
},
{
"entropy": 0.6839754433371127,
"epoch": 0.5214459989863391,
"grad_norm": 0.62890625,
"learning_rate": 2.1938979746813435e-06,
"loss": 0.5679389953613281,
"mean_token_accuracy": 0.8094680864363909,
"num_tokens": 25312769.0,
"step": 5530
},
{
"entropy": 0.7027344678528606,
"epoch": 0.5223889393100034,
"grad_norm": 0.302734375,
"learning_rate": 2.1858636283468853e-06,
"loss": 0.6222816467285156,
"mean_token_accuracy": 0.8174486592411995,
"num_tokens": 25363056.0,
"step": 5540
},
{
"entropy": 0.7847942772321403,
"epoch": 0.5233318796336677,
"grad_norm": 1.0078125,
"learning_rate": 2.1778325771543184e-06,
"loss": 0.5383003234863282,
"mean_token_accuracy": 0.7966303894296288,
"num_tokens": 25403541.0,
"step": 5550
},
{
"entropy": 0.7017437141388655,
"epoch": 0.5242748199573319,
"grad_norm": 0.42578125,
"learning_rate": 2.1698049053455707e-06,
"loss": 0.5788224220275879,
"mean_token_accuracy": 0.8125591490417718,
"num_tokens": 25455315.0,
"step": 5560
},
{
"entropy": 0.7177816702984273,
"epoch": 0.5252177602809962,
"grad_norm": 0.44140625,
"learning_rate": 2.1617806971271205e-06,
"loss": 0.5685774326324463,
"mean_token_accuracy": 0.785433416813612,
"num_tokens": 25508053.0,
"step": 5570
},
{
"entropy": 0.6137881996575743,
"epoch": 0.5261607006046605,
"grad_norm": 0.4296875,
"learning_rate": 2.153760036669115e-06,
"loss": 0.54885892868042,
"mean_token_accuracy": 0.8225920587778092,
"num_tokens": 25558186.0,
"step": 5580
},
{
"entropy": 0.646233162516728,
"epoch": 0.5271036409283247,
"grad_norm": 0.419921875,
"learning_rate": 2.1457430081044864e-06,
"loss": 0.5985296726226806,
"mean_token_accuracy": 0.8277124404907227,
"num_tokens": 25608608.0,
"step": 5590
},
{
"entropy": 0.7152201779186725,
"epoch": 0.528046581251989,
"grad_norm": 0.69921875,
"learning_rate": 2.137729695528071e-06,
"loss": 0.5779585361480712,
"mean_token_accuracy": 0.8061476524919271,
"num_tokens": 25657647.0,
"step": 5600
},
{
"entropy": 0.6737063567154109,
"epoch": 0.5289895215756533,
"grad_norm": 0.57421875,
"learning_rate": 2.129720182995727e-06,
"loss": 0.6868101596832276,
"mean_token_accuracy": 0.8116919990628958,
"num_tokens": 25700172.0,
"step": 5610
},
{
"entropy": 0.6977092338725924,
"epoch": 0.5299324618993175,
"grad_norm": 0.32421875,
"learning_rate": 2.1217145545234494e-06,
"loss": 0.6692411422729492,
"mean_token_accuracy": 0.8033047847449779,
"num_tokens": 25752498.0,
"step": 5620
},
{
"entropy": 0.7011082604527473,
"epoch": 0.5308754022229818,
"grad_norm": 0.51171875,
"learning_rate": 2.1137128940864937e-06,
"loss": 0.6209464550018311,
"mean_token_accuracy": 0.7912783624604345,
"num_tokens": 25798610.0,
"step": 5630
},
{
"entropy": 0.7150249132886529,
"epoch": 0.5318183425466461,
"grad_norm": 0.435546875,
"learning_rate": 2.105715285618491e-06,
"loss": 0.6976465702056884,
"mean_token_accuracy": 0.797979774326086,
"num_tokens": 25848826.0,
"step": 5640
},
{
"entropy": 0.6213484527543187,
"epoch": 0.5327612828703103,
"grad_norm": 0.263671875,
"learning_rate": 2.0977218130105698e-06,
"loss": 0.5264866828918457,
"mean_token_accuracy": 0.8229496419429779,
"num_tokens": 25895349.0,
"step": 5650
},
{
"entropy": 0.6708037904463708,
"epoch": 0.5337042231939746,
"grad_norm": 0.447265625,
"learning_rate": 2.0897325601104756e-06,
"loss": 0.588989543914795,
"mean_token_accuracy": 0.7981192912906409,
"num_tokens": 25940046.0,
"step": 5660
},
{
"entropy": 0.6789191416930407,
"epoch": 0.5346471635176389,
"grad_norm": 0.265625,
"learning_rate": 2.08174761072169e-06,
"loss": 0.5451597213745117,
"mean_token_accuracy": 0.8029395695775747,
"num_tokens": 25983827.0,
"step": 5670
},
{
"entropy": 0.5920437740162015,
"epoch": 0.5355901038413031,
"grad_norm": 0.78125,
"learning_rate": 2.0737670486025545e-06,
"loss": 0.4877305507659912,
"mean_token_accuracy": 0.8246560201048851,
"num_tokens": 26026651.0,
"step": 5680
},
{
"entropy": 0.7011357684619725,
"epoch": 0.5365330441649674,
"grad_norm": 0.458984375,
"learning_rate": 2.0657909574653894e-06,
"loss": 0.6222146987915039,
"mean_token_accuracy": 0.7912551097571849,
"num_tokens": 26070473.0,
"step": 5690
},
{
"entropy": 0.6917565542273223,
"epoch": 0.5374759844886317,
"grad_norm": 0.546875,
"learning_rate": 2.0578194209756165e-06,
"loss": 0.4957622528076172,
"mean_token_accuracy": 0.8071240916848182,
"num_tokens": 26114544.0,
"step": 5700
},
{
"entropy": 0.6250287326984107,
"epoch": 0.5384189248122959,
"grad_norm": 0.46875,
"learning_rate": 2.0498525227508807e-06,
"loss": 0.5066961765289306,
"mean_token_accuracy": 0.8199310664087534,
"num_tokens": 26162592.0,
"step": 5710
},
{
"entropy": 0.7448068944737315,
"epoch": 0.5393618651359602,
"grad_norm": 0.265625,
"learning_rate": 2.041890346360176e-06,
"loss": 0.5603039741516114,
"mean_token_accuracy": 0.8090826883912087,
"num_tokens": 26218601.0,
"step": 5720
},
{
"entropy": 0.8320084512233734,
"epoch": 0.5403048054596244,
"grad_norm": 0.640625,
"learning_rate": 2.0339329753229635e-06,
"loss": 0.6805224895477295,
"mean_token_accuracy": 0.7954841999337077,
"num_tokens": 26263287.0,
"step": 5730
},
{
"entropy": 0.6348516764119267,
"epoch": 0.5412477457832887,
"grad_norm": 0.71875,
"learning_rate": 2.0259804931083012e-06,
"loss": 0.5312628269195556,
"mean_token_accuracy": 0.8127726577222347,
"num_tokens": 26310034.0,
"step": 5740
},
{
"entropy": 0.6182076470926404,
"epoch": 0.542190686106953,
"grad_norm": 0.490234375,
"learning_rate": 2.0180329831339637e-06,
"loss": 0.529332160949707,
"mean_token_accuracy": 0.824046990275383,
"num_tokens": 26346391.0,
"step": 5750
},
{
"entropy": 0.6656064330600202,
"epoch": 0.5431336264306172,
"grad_norm": 0.70703125,
"learning_rate": 2.0100905287655704e-06,
"loss": 0.7039621353149415,
"mean_token_accuracy": 0.8080949112772942,
"num_tokens": 26388266.0,
"step": 5760
},
{
"entropy": 0.7996745721437037,
"epoch": 0.5440765667542815,
"grad_norm": 0.52734375,
"learning_rate": 2.002153213315709e-06,
"loss": 0.6947851657867432,
"mean_token_accuracy": 0.7908861048519611,
"num_tokens": 26439880.0,
"step": 5770
},
{
"entropy": 0.678467130381614,
"epoch": 0.5450195070779458,
"grad_norm": 0.384765625,
"learning_rate": 1.9942211200430634e-06,
"loss": 0.5658381938934326,
"mean_token_accuracy": 0.818194093927741,
"num_tokens": 26483322.0,
"step": 5780
},
{
"entropy": 0.6941055947914719,
"epoch": 0.54596244740161,
"grad_norm": 0.248046875,
"learning_rate": 1.986294332151538e-06,
"loss": 0.705126428604126,
"mean_token_accuracy": 0.8105139836668969,
"num_tokens": 26533766.0,
"step": 5790
},
{
"entropy": 0.6308328908868134,
"epoch": 0.5469053877252743,
"grad_norm": 0.5078125,
"learning_rate": 1.9783729327893865e-06,
"loss": 0.5511210918426513,
"mean_token_accuracy": 0.8163013540208339,
"num_tokens": 26581428.0,
"step": 5800
},
{
"entropy": 0.7102134318090976,
"epoch": 0.5478483280489386,
"grad_norm": 0.28125,
"learning_rate": 1.9704570050483404e-06,
"loss": 0.5507728576660156,
"mean_token_accuracy": 0.8015400886535644,
"num_tokens": 26620358.0,
"step": 5810
},
{
"entropy": 0.7275429900735617,
"epoch": 0.5487912683726028,
"grad_norm": 0.9609375,
"learning_rate": 1.962546631962736e-06,
"loss": 0.6528871536254883,
"mean_token_accuracy": 0.8041394516825676,
"num_tokens": 26661174.0,
"step": 5820
},
{
"entropy": 0.6613958537112922,
"epoch": 0.5497342086962671,
"grad_norm": 0.65625,
"learning_rate": 1.9546418965086444e-06,
"loss": 0.6786399841308594,
"mean_token_accuracy": 0.8156840946525336,
"num_tokens": 26710819.0,
"step": 5830
},
{
"entropy": 0.7236452325247228,
"epoch": 0.5506771490199314,
"grad_norm": 0.76171875,
"learning_rate": 1.946742881602999e-06,
"loss": 0.6853342533111573,
"mean_token_accuracy": 0.8027016900479793,
"num_tokens": 26758188.0,
"step": 5840
},
{
"entropy": 0.6812964378856122,
"epoch": 0.5516200893435956,
"grad_norm": 0.58203125,
"learning_rate": 1.9388496701027277e-06,
"loss": 0.6243832588195801,
"mean_token_accuracy": 0.8085433639585972,
"num_tokens": 26804314.0,
"step": 5850
},
{
"entropy": 0.7152590912766754,
"epoch": 0.5525630296672599,
"grad_norm": 0.458984375,
"learning_rate": 1.9309623448038864e-06,
"loss": 0.7200493335723877,
"mean_token_accuracy": 0.7995035350322723,
"num_tokens": 26859814.0,
"step": 5860
},
{
"entropy": 0.87381039140746,
"epoch": 0.5535059699909242,
"grad_norm": 0.7421875,
"learning_rate": 1.923080988440784e-06,
"loss": 0.6745802402496338,
"mean_token_accuracy": 0.769163049198687,
"num_tokens": 26898475.0,
"step": 5870
},
{
"entropy": 0.8256870447658002,
"epoch": 0.5544489103145884,
"grad_norm": 0.56640625,
"learning_rate": 1.9152056836851195e-06,
"loss": 0.650912094116211,
"mean_token_accuracy": 0.7772346431389451,
"num_tokens": 26943779.0,
"step": 5880
},
{
"entropy": 0.7375765237025916,
"epoch": 0.5553918506382527,
"grad_norm": 0.361328125,
"learning_rate": 1.9073365131451138e-06,
"loss": 0.5638370990753174,
"mean_token_accuracy": 0.7974175462499261,
"num_tokens": 26990072.0,
"step": 5890
},
{
"entropy": 0.6312047270126641,
"epoch": 0.556334790961917,
"grad_norm": 0.53125,
"learning_rate": 1.899473559364641e-06,
"loss": 0.5202350616455078,
"mean_token_accuracy": 0.8370380699634552,
"num_tokens": 27033233.0,
"step": 5900
},
{
"entropy": 0.660971057927236,
"epoch": 0.5572777312855812,
"grad_norm": 0.474609375,
"learning_rate": 1.891616904822366e-06,
"loss": 0.5475841522216797,
"mean_token_accuracy": 0.8027979079633951,
"num_tokens": 27081850.0,
"step": 5910
},
{
"entropy": 0.6727430471219122,
"epoch": 0.5582206716092455,
"grad_norm": 0.490234375,
"learning_rate": 1.883766631930878e-06,
"loss": 0.5413420677185059,
"mean_token_accuracy": 0.8251585308462381,
"num_tokens": 27130545.0,
"step": 5920
},
{
"entropy": 0.6418562413193285,
"epoch": 0.5591636119329098,
"grad_norm": 0.365234375,
"learning_rate": 1.8759228230358244e-06,
"loss": 0.5960840702056884,
"mean_token_accuracy": 0.832189904898405,
"num_tokens": 27176239.0,
"step": 5930
},
{
"entropy": 0.6648577735759318,
"epoch": 0.560106552256574,
"grad_norm": 0.404296875,
"learning_rate": 1.8680855604150492e-06,
"loss": 0.6448702812194824,
"mean_token_accuracy": 0.8221142962574959,
"num_tokens": 27224848.0,
"step": 5940
},
{
"entropy": 0.6807060082443058,
"epoch": 0.5610494925802383,
"grad_norm": 0.60546875,
"learning_rate": 1.860254926277728e-06,
"loss": 0.5650904655456543,
"mean_token_accuracy": 0.8069817528128624,
"num_tokens": 27271544.0,
"step": 5950
},
{
"entropy": 0.8060918380506337,
"epoch": 0.5619924329039026,
"grad_norm": 0.453125,
"learning_rate": 1.8524310027635084e-06,
"loss": 0.7444260597229004,
"mean_token_accuracy": 0.7830769976601004,
"num_tokens": 27320762.0,
"step": 5960
},
{
"entropy": 0.6863439489156008,
"epoch": 0.5629353732275668,
"grad_norm": 0.48046875,
"learning_rate": 1.8446138719416452e-06,
"loss": 0.5965976715087891,
"mean_token_accuracy": 0.8035622656345367,
"num_tokens": 27368194.0,
"step": 5970
},
{
"entropy": 0.6725466954987496,
"epoch": 0.5638783135512311,
"grad_norm": 0.41015625,
"learning_rate": 1.8368036158101415e-06,
"loss": 0.6167645454406738,
"mean_token_accuracy": 0.8260718215256929,
"num_tokens": 27407957.0,
"step": 5980
},
{
"entropy": 0.7055775175336748,
"epoch": 0.5648212538748953,
"grad_norm": 0.60546875,
"learning_rate": 1.8290003162948893e-06,
"loss": 0.7305053234100342,
"mean_token_accuracy": 0.805973731353879,
"num_tokens": 27448255.0,
"step": 5990
},
{
"entropy": 0.6864317794330418,
"epoch": 0.5657641941985596,
"grad_norm": 0.47265625,
"learning_rate": 1.8212040552488081e-06,
"loss": 0.5233036518096924,
"mean_token_accuracy": 0.8087876638397574,
"num_tokens": 27492568.0,
"step": 6000
},
{
"entropy": 0.8008205661550164,
"epoch": 0.5667071345222239,
"grad_norm": 0.267578125,
"learning_rate": 1.8134149144509861e-06,
"loss": 0.6945072650909424,
"mean_token_accuracy": 0.7832493115216493,
"num_tokens": 27535293.0,
"step": 6010
},
{
"entropy": 0.7050473445095122,
"epoch": 0.5676500748458881,
"grad_norm": 0.39453125,
"learning_rate": 1.8056329756058249e-06,
"loss": 0.6400737762451172,
"mean_token_accuracy": 0.8038847412914037,
"num_tokens": 27581501.0,
"step": 6020
},
{
"entropy": 0.7546293061226607,
"epoch": 0.5685930151695524,
"grad_norm": 0.40625,
"learning_rate": 1.7978583203421812e-06,
"loss": 0.6627458572387696,
"mean_token_accuracy": 0.7845555316656828,
"num_tokens": 27629782.0,
"step": 6030
},
{
"entropy": 0.7452189083211124,
"epoch": 0.5695359554932167,
"grad_norm": 0.5078125,
"learning_rate": 1.7900910302125086e-06,
"loss": 0.5804001331329346,
"mean_token_accuracy": 0.7970978146418929,
"num_tokens": 27678902.0,
"step": 6040
},
{
"entropy": 0.7050665612798184,
"epoch": 0.5704788958168809,
"grad_norm": 0.4140625,
"learning_rate": 1.7823311866920068e-06,
"loss": 0.5286674499511719,
"mean_token_accuracy": 0.7994862403720617,
"num_tokens": 27717460.0,
"step": 6050
},
{
"entropy": 0.6447273494210094,
"epoch": 0.5714218361405452,
"grad_norm": 1.140625,
"learning_rate": 1.7745788711777611e-06,
"loss": 0.5664659976959229,
"mean_token_accuracy": 0.8183193821460009,
"num_tokens": 27763408.0,
"step": 6060
},
{
"entropy": 0.7607476971112191,
"epoch": 0.5723647764642095,
"grad_norm": 0.357421875,
"learning_rate": 1.766834164987894e-06,
"loss": 0.6255624294281006,
"mean_token_accuracy": 0.7873752404004335,
"num_tokens": 27808897.0,
"step": 6070
},
{
"entropy": 0.6860075819306075,
"epoch": 0.5733077167878737,
"grad_norm": 0.283203125,
"learning_rate": 1.7590971493607072e-06,
"loss": 0.6039350509643555,
"mean_token_accuracy": 0.8028590308502317,
"num_tokens": 27854713.0,
"step": 6080
},
{
"entropy": 0.8293744221329689,
"epoch": 0.574250657111538,
"grad_norm": 0.67578125,
"learning_rate": 1.7513679054538352e-06,
"loss": 0.7157419681549072,
"mean_token_accuracy": 0.7663772650063038,
"num_tokens": 27900429.0,
"step": 6090
},
{
"entropy": 0.8774604101665318,
"epoch": 0.5751935974352024,
"grad_norm": 0.412109375,
"learning_rate": 1.743646514343388e-06,
"loss": 0.5146266937255859,
"mean_token_accuracy": 0.7756213560700417,
"num_tokens": 27943940.0,
"step": 6100
},
{
"entropy": 0.5941920497454702,
"epoch": 0.5761365377588666,
"grad_norm": 0.57421875,
"learning_rate": 1.7359330570231049e-06,
"loss": 0.6486340999603272,
"mean_token_accuracy": 0.8262489166110754,
"num_tokens": 27989276.0,
"step": 6110
},
{
"entropy": 0.6428902736864984,
"epoch": 0.5770794780825309,
"grad_norm": 0.390625,
"learning_rate": 1.7282276144035037e-06,
"loss": 0.6077763080596924,
"mean_token_accuracy": 0.8120482333004475,
"num_tokens": 28026618.0,
"step": 6120
},
{
"entropy": 0.7213725323788822,
"epoch": 0.5780224184061952,
"grad_norm": 2.078125,
"learning_rate": 1.7205302673110308e-06,
"loss": 0.7364995002746582,
"mean_token_accuracy": 0.7888428892940282,
"num_tokens": 28081339.0,
"step": 6130
},
{
"entropy": 0.7310086984187365,
"epoch": 0.5789653587298594,
"grad_norm": 0.9609375,
"learning_rate": 1.7128410964872152e-06,
"loss": 0.5657924175262451,
"mean_token_accuracy": 0.7936812553554773,
"num_tokens": 28117903.0,
"step": 6140
},
{
"entropy": 0.7583439980633557,
"epoch": 0.5799082990535237,
"grad_norm": 0.5078125,
"learning_rate": 1.7051601825878203e-06,
"loss": 0.5908254146575928,
"mean_token_accuracy": 0.7944333799183368,
"num_tokens": 28162769.0,
"step": 6150
},
{
"entropy": 0.6405745659023523,
"epoch": 0.580851239377188,
"grad_norm": 0.58203125,
"learning_rate": 1.6974876061819973e-06,
"loss": 0.5538061618804931,
"mean_token_accuracy": 0.8247173227369785,
"num_tokens": 28203429.0,
"step": 6160
},
{
"entropy": 0.766948539763689,
"epoch": 0.5817941797008522,
"grad_norm": 0.2275390625,
"learning_rate": 1.6898234477514442e-06,
"loss": 0.6483793735504151,
"mean_token_accuracy": 0.7911493647843599,
"num_tokens": 28252124.0,
"step": 6170
},
{
"entropy": 0.6414849878288805,
"epoch": 0.5827371200245165,
"grad_norm": 0.447265625,
"learning_rate": 1.6821677876895554e-06,
"loss": 0.5362122535705567,
"mean_token_accuracy": 0.8220501244068146,
"num_tokens": 28304670.0,
"step": 6180
},
{
"entropy": 0.6628352930769325,
"epoch": 0.5836800603481808,
"grad_norm": 0.248046875,
"learning_rate": 1.6745207063005819e-06,
"loss": 0.5948177814483643,
"mean_token_accuracy": 0.8272610239684581,
"num_tokens": 28342263.0,
"step": 6190
},
{
"entropy": 0.7425322285853326,
"epoch": 0.584623000671845,
"grad_norm": 0.2431640625,
"learning_rate": 1.6668822837987894e-06,
"loss": 0.646372127532959,
"mean_token_accuracy": 0.7970950407907367,
"num_tokens": 28394678.0,
"step": 6200
},
{
"entropy": 0.6451410392299295,
"epoch": 0.5855659409955093,
"grad_norm": 0.326171875,
"learning_rate": 1.6592526003076148e-06,
"loss": 0.6016067028045654,
"mean_token_accuracy": 0.8238395698368549,
"num_tokens": 28449882.0,
"step": 6210
},
{
"entropy": 0.6584913536906243,
"epoch": 0.5865088813191736,
"grad_norm": 0.369140625,
"learning_rate": 1.6516317358588285e-06,
"loss": 0.5983861923217774,
"mean_token_accuracy": 0.8156170316040516,
"num_tokens": 28488572.0,
"step": 6220
},
{
"entropy": 0.5571296599693596,
"epoch": 0.5874518216428378,
"grad_norm": 0.322265625,
"learning_rate": 1.6440197703916928e-06,
"loss": 0.4304994583129883,
"mean_token_accuracy": 0.8418979216367006,
"num_tokens": 28534773.0,
"step": 6230
},
{
"entropy": 0.6841351325623691,
"epoch": 0.5883947619665021,
"grad_norm": 0.376953125,
"learning_rate": 1.6364167837521222e-06,
"loss": 0.6759282112121582,
"mean_token_accuracy": 0.7826384872198104,
"num_tokens": 28576209.0,
"step": 6240
},
{
"entropy": 0.7507536704652011,
"epoch": 0.5893377022901664,
"grad_norm": 0.482421875,
"learning_rate": 1.6288228556918495e-06,
"loss": 0.605400562286377,
"mean_token_accuracy": 0.7974974766373635,
"num_tokens": 28615687.0,
"step": 6250
},
{
"entropy": 0.7499837163835764,
"epoch": 0.5902806426138306,
"grad_norm": 0.400390625,
"learning_rate": 1.621238065867587e-06,
"loss": 0.6003370761871338,
"mean_token_accuracy": 0.7996041260659694,
"num_tokens": 28660419.0,
"step": 6260
},
{
"entropy": 0.7148910771124065,
"epoch": 0.5912235829374949,
"grad_norm": 0.240234375,
"learning_rate": 1.61366249384019e-06,
"loss": 0.5587523937225342,
"mean_token_accuracy": 0.8005239397287369,
"num_tokens": 28700915.0,
"step": 6270
},
{
"entropy": 0.7900654837023466,
"epoch": 0.5921665232611592,
"grad_norm": 0.4296875,
"learning_rate": 1.606096219073825e-06,
"loss": 0.7255774974822998,
"mean_token_accuracy": 0.7740635454654694,
"num_tokens": 28742016.0,
"step": 6280
},
{
"entropy": 0.6664929877966642,
"epoch": 0.5931094635848234,
"grad_norm": 0.32421875,
"learning_rate": 1.598539320935134e-06,
"loss": 0.5831618785858155,
"mean_token_accuracy": 0.8241768430918455,
"num_tokens": 28787025.0,
"step": 6290
},
{
"entropy": 0.841880920343101,
"epoch": 0.5940524039084877,
"grad_norm": 0.46875,
"learning_rate": 1.5909918786924027e-06,
"loss": 0.8506629943847657,
"mean_token_accuracy": 0.7675380181521178,
"num_tokens": 28835489.0,
"step": 6300
},
{
"entropy": 0.7314032892696559,
"epoch": 0.594995344232152,
"grad_norm": 0.703125,
"learning_rate": 1.583453971514729e-06,
"loss": 0.5955713272094727,
"mean_token_accuracy": 0.8092577937990427,
"num_tokens": 28878914.0,
"step": 6310
},
{
"entropy": 0.6585373728536069,
"epoch": 0.5959382845558162,
"grad_norm": 0.5546875,
"learning_rate": 1.5759256784711917e-06,
"loss": 0.6605970382690429,
"mean_token_accuracy": 0.8271971605718136,
"num_tokens": 28926182.0,
"step": 6320
},
{
"entropy": 0.8336781755089759,
"epoch": 0.5968812248794805,
"grad_norm": 0.53125,
"learning_rate": 1.568407078530023e-06,
"loss": 0.7155747890472413,
"mean_token_accuracy": 0.7782786898314953,
"num_tokens": 28972429.0,
"step": 6330
},
{
"entropy": 0.6537047138437628,
"epoch": 0.5978241652031447,
"grad_norm": 0.34765625,
"learning_rate": 1.560898250557778e-06,
"loss": 0.5683440685272216,
"mean_token_accuracy": 0.8080581244081259,
"num_tokens": 29020109.0,
"step": 6340
},
{
"entropy": 0.6812858050689101,
"epoch": 0.598767105526809,
"grad_norm": 0.6640625,
"learning_rate": 1.5533992733185094e-06,
"loss": 0.6385911464691162,
"mean_token_accuracy": 0.8044985607266426,
"num_tokens": 29063213.0,
"step": 6350
},
{
"entropy": 0.68090706942603,
"epoch": 0.5997100458504733,
"grad_norm": 0.79296875,
"learning_rate": 1.54591022547294e-06,
"loss": 0.5990062713623047,
"mean_token_accuracy": 0.818465144187212,
"num_tokens": 29101529.0,
"step": 6360
},
{
"entropy": 0.6892360879923217,
"epoch": 0.6006529861741375,
"grad_norm": 0.35546875,
"learning_rate": 1.5384311855776378e-06,
"loss": 0.6381627082824707,
"mean_token_accuracy": 0.8170299537479877,
"num_tokens": 29151636.0,
"step": 6370
},
{
"entropy": 0.7919900326058269,
"epoch": 0.6015959264978018,
"grad_norm": 0.392578125,
"learning_rate": 1.5309622320841928e-06,
"loss": 0.6791030406951905,
"mean_token_accuracy": 0.7774041363038122,
"num_tokens": 29195688.0,
"step": 6380
},
{
"entropy": 0.7630477277562022,
"epoch": 0.6025388668214661,
"grad_norm": 0.22265625,
"learning_rate": 1.5235034433383922e-06,
"loss": 0.6549117565155029,
"mean_token_accuracy": 0.7939501941204071,
"num_tokens": 29241182.0,
"step": 6390
},
{
"entropy": 0.6038443365134298,
"epoch": 0.6034818071451303,
"grad_norm": 0.79296875,
"learning_rate": 1.516054897579401e-06,
"loss": 0.538882064819336,
"mean_token_accuracy": 0.827283251285553,
"num_tokens": 29288939.0,
"step": 6400
},
{
"entropy": 0.6935314170084894,
"epoch": 0.6044247474687946,
"grad_norm": 0.4921875,
"learning_rate": 1.5086166729389392e-06,
"loss": 0.7098958969116211,
"mean_token_accuracy": 0.8060619793832302,
"num_tokens": 29330647.0,
"step": 6410
},
{
"entropy": 0.6182787658646702,
"epoch": 0.6053676877924589,
"grad_norm": 0.7109375,
"learning_rate": 1.5011888474404635e-06,
"loss": 0.5699858665466309,
"mean_token_accuracy": 0.8177945427596569,
"num_tokens": 29375563.0,
"step": 6420
},
{
"entropy": 0.6610123321413994,
"epoch": 0.6063106281161231,
"grad_norm": 0.546875,
"learning_rate": 1.493771498998349e-06,
"loss": 0.5734387397766113,
"mean_token_accuracy": 0.8026046641170979,
"num_tokens": 29412770.0,
"step": 6430
},
{
"entropy": 0.6550191486254334,
"epoch": 0.6072535684397874,
"grad_norm": 0.48828125,
"learning_rate": 1.486364705417071e-06,
"loss": 0.575551700592041,
"mean_token_accuracy": 0.8128551565110683,
"num_tokens": 29457089.0,
"step": 6440
},
{
"entropy": 0.6363603160483763,
"epoch": 0.6081965087634517,
"grad_norm": 0.37890625,
"learning_rate": 1.4789685443903894e-06,
"loss": 0.585049819946289,
"mean_token_accuracy": 0.820637421682477,
"num_tokens": 29511977.0,
"step": 6450
},
{
"entropy": 0.5975639001466334,
"epoch": 0.6091394490871159,
"grad_norm": 0.39453125,
"learning_rate": 1.471583093500532e-06,
"loss": 0.4691169738769531,
"mean_token_accuracy": 0.8282858118414879,
"num_tokens": 29560593.0,
"step": 6460
},
{
"entropy": 0.6914234139025212,
"epoch": 0.6100823894107802,
"grad_norm": 0.30859375,
"learning_rate": 1.4642084302173867e-06,
"loss": 0.5843109607696533,
"mean_token_accuracy": 0.8037613401189446,
"num_tokens": 29612477.0,
"step": 6470
},
{
"entropy": 0.720405780756846,
"epoch": 0.6110253297344445,
"grad_norm": 1.3671875,
"learning_rate": 1.4568446318976804e-06,
"loss": 0.612605094909668,
"mean_token_accuracy": 0.7900254150852561,
"num_tokens": 29653283.0,
"step": 6480
},
{
"entropy": 0.6390435563400387,
"epoch": 0.6119682700581087,
"grad_norm": 0.47265625,
"learning_rate": 1.449491775784172e-06,
"loss": 0.5124198436737061,
"mean_token_accuracy": 0.8260769449174404,
"num_tokens": 29700246.0,
"step": 6490
},
{
"entropy": 0.6470420122146606,
"epoch": 0.612911210381773,
"grad_norm": 0.90625,
"learning_rate": 1.442149939004845e-06,
"loss": 0.6141894340515137,
"mean_token_accuracy": 0.8217171192169189,
"num_tokens": 29752904.0,
"step": 6500
},
{
"entropy": 0.5653758386150003,
"epoch": 0.6138541507054373,
"grad_norm": 0.43359375,
"learning_rate": 1.4348191985720905e-06,
"loss": 0.5112238883972168,
"mean_token_accuracy": 0.8314279425889254,
"num_tokens": 29791019.0,
"step": 6510
},
{
"entropy": 0.6899514342658222,
"epoch": 0.6147970910291015,
"grad_norm": 0.44140625,
"learning_rate": 1.4274996313819093e-06,
"loss": 0.5467896461486816,
"mean_token_accuracy": 0.8154542069882155,
"num_tokens": 29837978.0,
"step": 6520
},
{
"entropy": 0.7366321623325348,
"epoch": 0.6157400313527658,
"grad_norm": 0.439453125,
"learning_rate": 1.4201913142130953e-06,
"loss": 0.5235143661499023,
"mean_token_accuracy": 0.797525929659605,
"num_tokens": 29885619.0,
"step": 6530
},
{
"entropy": 0.7723901643417775,
"epoch": 0.61668297167643,
"grad_norm": 0.5625,
"learning_rate": 1.4128943237264397e-06,
"loss": 0.6222280502319336,
"mean_token_accuracy": 0.7883600037544966,
"num_tokens": 29929441.0,
"step": 6540
},
{
"entropy": 0.7317868547514081,
"epoch": 0.6176259120000943,
"grad_norm": 0.28515625,
"learning_rate": 1.4056087364639177e-06,
"loss": 0.6348618984222412,
"mean_token_accuracy": 0.7977587293833495,
"num_tokens": 29980994.0,
"step": 6550
},
{
"entropy": 0.6215764599852264,
"epoch": 0.6185688523237586,
"grad_norm": 0.30859375,
"learning_rate": 1.3983346288478934e-06,
"loss": 0.46146564483642577,
"mean_token_accuracy": 0.8226776365190744,
"num_tokens": 30036423.0,
"step": 6560
},
{
"entropy": 0.7115271213464439,
"epoch": 0.6195117926474228,
"grad_norm": 0.6171875,
"learning_rate": 1.3910720771803138e-06,
"loss": 0.5262360572814941,
"mean_token_accuracy": 0.815481587126851,
"num_tokens": 30083567.0,
"step": 6570
},
{
"entropy": 0.6607028277590871,
"epoch": 0.6204547329710871,
"grad_norm": 0.546875,
"learning_rate": 1.3838211576419084e-06,
"loss": 0.6297407627105713,
"mean_token_accuracy": 0.8033003844320774,
"num_tokens": 30123282.0,
"step": 6580
},
{
"entropy": 0.8542975519783795,
"epoch": 0.6213976732947514,
"grad_norm": 0.380859375,
"learning_rate": 1.3765819462913935e-06,
"loss": 0.6734577655792237,
"mean_token_accuracy": 0.7789794001728296,
"num_tokens": 30175834.0,
"step": 6590
},
{
"entropy": 0.6683274048380554,
"epoch": 0.6223406136184156,
"grad_norm": 0.2578125,
"learning_rate": 1.3693545190646687e-06,
"loss": 0.5290188312530517,
"mean_token_accuracy": 0.8123727187514305,
"num_tokens": 30230839.0,
"step": 6600
},
{
"entropy": 0.8296206023544073,
"epoch": 0.6232835539420799,
"grad_norm": 0.376953125,
"learning_rate": 1.3621389517740278e-06,
"loss": 0.6783339023590088,
"mean_token_accuracy": 0.772437755856663,
"num_tokens": 30276477.0,
"step": 6610
},
{
"entropy": 0.7358615064062178,
"epoch": 0.6242264942657442,
"grad_norm": 0.55078125,
"learning_rate": 1.354935320107355e-06,
"loss": 0.7653596878051758,
"mean_token_accuracy": 0.7917595565319061,
"num_tokens": 30322719.0,
"step": 6620
},
{
"entropy": 0.6063522500917315,
"epoch": 0.6251694345894084,
"grad_norm": 0.421875,
"learning_rate": 1.3477436996273391e-06,
"loss": 0.493528938293457,
"mean_token_accuracy": 0.8317346017807722,
"num_tokens": 30366460.0,
"step": 6630
},
{
"entropy": 0.6097435717936606,
"epoch": 0.6261123749130727,
"grad_norm": 0.265625,
"learning_rate": 1.340564165770677e-06,
"loss": 0.5172214508056641,
"mean_token_accuracy": 0.8287797518074512,
"num_tokens": 30413005.0,
"step": 6640
},
{
"entropy": 0.7791145509108901,
"epoch": 0.627055315236737,
"grad_norm": 0.330078125,
"learning_rate": 1.3333967938472791e-06,
"loss": 0.6306872844696045,
"mean_token_accuracy": 0.7808555860072375,
"num_tokens": 30452797.0,
"step": 6650
},
{
"entropy": 0.7186586172319949,
"epoch": 0.6279982555604012,
"grad_norm": 0.2060546875,
"learning_rate": 1.326241659039488e-06,
"loss": 0.7230193614959717,
"mean_token_accuracy": 0.8053840888664127,
"num_tokens": 30501667.0,
"step": 6660
},
{
"entropy": 0.713790905289352,
"epoch": 0.6289411958840655,
"grad_norm": 0.36328125,
"learning_rate": 1.3190988364012798e-06,
"loss": 0.664982271194458,
"mean_token_accuracy": 0.8036589544266463,
"num_tokens": 30546332.0,
"step": 6670
},
{
"entropy": 0.7191013899631798,
"epoch": 0.6298841362077298,
"grad_norm": 1.1640625,
"learning_rate": 1.3119684008574854e-06,
"loss": 0.6084727287292481,
"mean_token_accuracy": 0.7926711194217205,
"num_tokens": 30592915.0,
"step": 6680
},
{
"entropy": 0.7162378825247288,
"epoch": 0.630827076531394,
"grad_norm": 0.51171875,
"learning_rate": 1.3048504272029983e-06,
"loss": 0.6665098190307617,
"mean_token_accuracy": 0.7999292813241482,
"num_tokens": 30630783.0,
"step": 6690
},
{
"entropy": 0.6918003332801164,
"epoch": 0.6317700168550583,
"grad_norm": 0.44140625,
"learning_rate": 1.297744990101995e-06,
"loss": 0.7901312828063964,
"mean_token_accuracy": 0.8032176718115807,
"num_tokens": 30684178.0,
"step": 6700
},
{
"entropy": 0.6030714954715222,
"epoch": 0.6327129571787226,
"grad_norm": 0.470703125,
"learning_rate": 1.2906521640871492e-06,
"loss": 0.5561746597290039,
"mean_token_accuracy": 0.8341683767735958,
"num_tokens": 30729882.0,
"step": 6710
},
{
"entropy": 0.616637565754354,
"epoch": 0.6336558975023868,
"grad_norm": 0.310546875,
"learning_rate": 1.2835720235588475e-06,
"loss": 0.572420072555542,
"mean_token_accuracy": 0.8205343771725893,
"num_tokens": 30779139.0,
"step": 6720
},
{
"entropy": 0.6006744123529643,
"epoch": 0.6345988378260511,
"grad_norm": 0.3984375,
"learning_rate": 1.2765046427844157e-06,
"loss": 0.521686601638794,
"mean_token_accuracy": 0.8351531434804201,
"num_tokens": 30826518.0,
"step": 6730
},
{
"entropy": 0.7569279128685593,
"epoch": 0.6355417781497154,
"grad_norm": 0.4609375,
"learning_rate": 1.2694500958973327e-06,
"loss": 0.6009937286376953,
"mean_token_accuracy": 0.789092281088233,
"num_tokens": 30881879.0,
"step": 6740
},
{
"entropy": 0.5884561772458256,
"epoch": 0.6364847184733796,
"grad_norm": 0.412109375,
"learning_rate": 1.262408456896458e-06,
"loss": 0.520009183883667,
"mean_token_accuracy": 0.8386049326509237,
"num_tokens": 30927036.0,
"step": 6750
},
{
"entropy": 0.5804953049868345,
"epoch": 0.6374276587970439,
"grad_norm": 0.65234375,
"learning_rate": 1.2553797996452504e-06,
"loss": 0.42743620872497556,
"mean_token_accuracy": 0.8361934781074524,
"num_tokens": 30973950.0,
"step": 6760
},
{
"entropy": 0.651206433866173,
"epoch": 0.6383705991207081,
"grad_norm": 0.28125,
"learning_rate": 1.2483641978710023e-06,
"loss": 0.5765644550323487,
"mean_token_accuracy": 0.8276426322758198,
"num_tokens": 31027156.0,
"step": 6770
},
{
"entropy": 0.7943007486872375,
"epoch": 0.6393135394443724,
"grad_norm": 0.2109375,
"learning_rate": 1.2413617251640538e-06,
"loss": 0.6862638473510743,
"mean_token_accuracy": 0.7906891793012619,
"num_tokens": 31081926.0,
"step": 6780
},
{
"entropy": 0.7911325155757367,
"epoch": 0.6402564797680367,
"grad_norm": 0.53125,
"learning_rate": 1.2343724549770311e-06,
"loss": 0.7334757328033448,
"mean_token_accuracy": 0.7799281593412161,
"num_tokens": 31123520.0,
"step": 6790
},
{
"entropy": 0.6264763680286706,
"epoch": 0.641199420091701,
"grad_norm": 0.404296875,
"learning_rate": 1.2273964606240718e-06,
"loss": 0.5062834739685058,
"mean_token_accuracy": 0.813581820204854,
"num_tokens": 31169681.0,
"step": 6800
},
{
"entropy": 0.6135468325577677,
"epoch": 0.6421423604153652,
"grad_norm": 0.388671875,
"learning_rate": 1.220433815280054e-06,
"loss": 0.4851649284362793,
"mean_token_accuracy": 0.8191511053591967,
"num_tokens": 31215610.0,
"step": 6810
},
{
"entropy": 0.8527200820855796,
"epoch": 0.6430853007390295,
"grad_norm": 0.404296875,
"learning_rate": 1.2134845919798346e-06,
"loss": 0.9052200317382812,
"mean_token_accuracy": 0.7757729774340987,
"num_tokens": 31256328.0,
"step": 6820
},
{
"entropy": 0.6696253786794841,
"epoch": 0.6440282410626937,
"grad_norm": 0.330078125,
"learning_rate": 1.2065488636174761e-06,
"loss": 0.4900521755218506,
"mean_token_accuracy": 0.81925327219069,
"num_tokens": 31303360.0,
"step": 6830
},
{
"entropy": 0.7389580006711185,
"epoch": 0.644971181386358,
"grad_norm": 0.6171875,
"learning_rate": 1.1996267029454882e-06,
"loss": 0.6637410640716552,
"mean_token_accuracy": 0.7897630255669356,
"num_tokens": 31356452.0,
"step": 6840
},
{
"entropy": 0.7582534276880324,
"epoch": 0.6459141217100223,
"grad_norm": 0.314453125,
"learning_rate": 1.1927181825740598e-06,
"loss": 0.6377841472625733,
"mean_token_accuracy": 0.78179000467062,
"num_tokens": 31402638.0,
"step": 6850
},
{
"entropy": 0.7765328639186919,
"epoch": 0.6468570620336865,
"grad_norm": 1.4765625,
"learning_rate": 1.1858233749703008e-06,
"loss": 0.7192119121551513,
"mean_token_accuracy": 0.7862007327377796,
"num_tokens": 31441999.0,
"step": 6860
},
{
"entropy": 0.6889529786072671,
"epoch": 0.6478000023573508,
"grad_norm": 0.455078125,
"learning_rate": 1.1789423524574816e-06,
"loss": 0.5516982555389405,
"mean_token_accuracy": 0.8100367560982704,
"num_tokens": 31496439.0,
"step": 6870
},
{
"entropy": 0.5635810997337103,
"epoch": 0.6487429426810151,
"grad_norm": 0.333984375,
"learning_rate": 1.1720751872142708e-06,
"loss": 0.512902307510376,
"mean_token_accuracy": 0.8280544430017471,
"num_tokens": 31543724.0,
"step": 6880
},
{
"entropy": 0.6845852768979966,
"epoch": 0.6496858830046793,
"grad_norm": 0.361328125,
"learning_rate": 1.1652219512739838e-06,
"loss": 0.5510530471801758,
"mean_token_accuracy": 0.8120139855891466,
"num_tokens": 31594284.0,
"step": 6890
},
{
"entropy": 0.6481620660051703,
"epoch": 0.6506288233283436,
"grad_norm": 0.5390625,
"learning_rate": 1.1583827165238206e-06,
"loss": 0.5910237789154053,
"mean_token_accuracy": 0.8181051228195428,
"num_tokens": 31635062.0,
"step": 6900
},
{
"entropy": 0.6908615042455495,
"epoch": 0.6515717636520079,
"grad_norm": 0.84375,
"learning_rate": 1.15155755470412e-06,
"loss": 0.6882299423217774,
"mean_token_accuracy": 0.8048533439636231,
"num_tokens": 31678473.0,
"step": 6910
},
{
"entropy": 0.7044286559335887,
"epoch": 0.6525147039756721,
"grad_norm": 0.609375,
"learning_rate": 1.1447465374075975e-06,
"loss": 0.7313314437866211,
"mean_token_accuracy": 0.8019507348537445,
"num_tokens": 31729255.0,
"step": 6920
},
{
"entropy": 0.6504749067127704,
"epoch": 0.6534576442993364,
"grad_norm": 0.490234375,
"learning_rate": 1.137949736078603e-06,
"loss": 0.5372074604034424,
"mean_token_accuracy": 0.8073802709579467,
"num_tokens": 31768907.0,
"step": 6930
},
{
"entropy": 0.7473512006923556,
"epoch": 0.6544005846230007,
"grad_norm": 0.423828125,
"learning_rate": 1.1311672220123664e-06,
"loss": 0.6788872241973877,
"mean_token_accuracy": 0.7935893721878529,
"num_tokens": 31812183.0,
"step": 6940
},
{
"entropy": 0.7024919440969825,
"epoch": 0.6553435249466649,
"grad_norm": 0.40625,
"learning_rate": 1.1243990663542497e-06,
"loss": 0.6041145324707031,
"mean_token_accuracy": 0.8105067923665047,
"num_tokens": 31862178.0,
"step": 6950
},
{
"entropy": 0.6629848030395806,
"epoch": 0.6562864652703292,
"grad_norm": 0.828125,
"learning_rate": 1.1176453400990049e-06,
"loss": 0.676570463180542,
"mean_token_accuracy": 0.8191709652543068,
"num_tokens": 31907853.0,
"step": 6960
},
{
"entropy": 0.6834048548713326,
"epoch": 0.6572294055939935,
"grad_norm": 0.921875,
"learning_rate": 1.1109061140900224e-06,
"loss": 0.5216798305511474,
"mean_token_accuracy": 0.8132496692240239,
"num_tokens": 31952569.0,
"step": 6970
},
{
"entropy": 0.6860712924972177,
"epoch": 0.6581723459176577,
"grad_norm": 0.421875,
"learning_rate": 1.104181459018596e-06,
"loss": 0.5502390384674072,
"mean_token_accuracy": 0.8120945893228054,
"num_tokens": 32000914.0,
"step": 6980
},
{
"entropy": 0.6751578035764396,
"epoch": 0.659115286241322,
"grad_norm": 0.6640625,
"learning_rate": 1.0974714454231738e-06,
"loss": 0.5092285633087158,
"mean_token_accuracy": 0.8091344766318798,
"num_tokens": 32047882.0,
"step": 6990
},
{
"entropy": 0.6862224272452295,
"epoch": 0.6600582265649863,
"grad_norm": 0.265625,
"learning_rate": 1.0907761436886238e-06,
"loss": 0.4828913688659668,
"mean_token_accuracy": 0.8198781322687865,
"num_tokens": 32093189.0,
"step": 7000
}
],
"logging_steps": 10,
"max_steps": 10000,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1.4573656096110735e+18,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}