{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.6600582265649863, "eval_steps": 500, "global_step": 7000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 0.9377105624414981, "epoch": 0.0009429403236642661, "grad_norm": 1.2421875, "learning_rate": 1.5000000000000002e-07, "loss": 0.84810791015625, "mean_token_accuracy": 0.6954030711203814, "num_tokens": 41672.0, "step": 10 }, { "entropy": 0.9366529762744904, "epoch": 0.0018858806473285323, "grad_norm": 0.98046875, "learning_rate": 3.166666666666667e-07, "loss": 0.7408034801483154, "mean_token_accuracy": 0.6973626937717199, "num_tokens": 86016.0, "step": 20 }, { "entropy": 0.9000760725699365, "epoch": 0.0028288209709927984, "grad_norm": 0.66015625, "learning_rate": 4.833333333333334e-07, "loss": 0.677955436706543, "mean_token_accuracy": 0.7110291102901101, "num_tokens": 123791.0, "step": 30 }, { "entropy": 1.0092571526765823, "epoch": 0.0037717612946570646, "grad_norm": 1.015625, "learning_rate": 6.5e-07, "loss": 0.7101857662200928, "mean_token_accuracy": 0.699547297693789, "num_tokens": 166292.0, "step": 40 }, { "entropy": 0.8959570353850722, "epoch": 0.004714701618321331, "grad_norm": 0.6953125, "learning_rate": 8.166666666666668e-07, "loss": 0.6740357875823975, "mean_token_accuracy": 0.7126540616154671, "num_tokens": 207843.0, "step": 50 }, { "entropy": 0.8416860729455948, "epoch": 0.005657641941985597, "grad_norm": 0.48828125, "learning_rate": 9.833333333333334e-07, "loss": 0.7373227596282959, "mean_token_accuracy": 0.7413243912160397, "num_tokens": 250846.0, "step": 60 }, { "entropy": 0.7951943324878812, "epoch": 0.006600582265649863, "grad_norm": 1.1328125, "learning_rate": 1.1500000000000002e-06, "loss": 0.6532743453979493, "mean_token_accuracy": 0.7555031452327967, "num_tokens": 296289.0, "step": 70 }, { "entropy": 0.9203432088717818, "epoch": 0.007543522589314129, "grad_norm": 0.78125, "learning_rate": 1.3166666666666666e-06, "loss": 0.7728577136993409, "mean_token_accuracy": 0.717721626535058, "num_tokens": 342924.0, "step": 80 }, { "entropy": 0.9101250190287828, "epoch": 0.008486462912978394, "grad_norm": 0.48046875, "learning_rate": 1.4833333333333337e-06, "loss": 0.736940574645996, "mean_token_accuracy": 0.7175416748970747, "num_tokens": 389818.0, "step": 90 }, { "entropy": 0.9771212268620729, "epoch": 0.009429403236642661, "grad_norm": 0.6875, "learning_rate": 1.6500000000000003e-06, "loss": 0.8331009864807128, "mean_token_accuracy": 0.7274765845388174, "num_tokens": 431465.0, "step": 100 }, { "entropy": 0.9352089989930391, "epoch": 0.010372343560306927, "grad_norm": 0.478515625, "learning_rate": 1.816666666666667e-06, "loss": 0.8612667083740234, "mean_token_accuracy": 0.7201700910925866, "num_tokens": 467267.0, "step": 110 }, { "entropy": 0.7851263372227549, "epoch": 0.011315283883971194, "grad_norm": 0.400390625, "learning_rate": 1.9833333333333335e-06, "loss": 0.6035785675048828, "mean_token_accuracy": 0.7742446877062321, "num_tokens": 510439.0, "step": 120 }, { "entropy": 0.8613772111944854, "epoch": 0.012258224207635459, "grad_norm": 0.59375, "learning_rate": 2.15e-06, "loss": 0.6771652221679687, "mean_token_accuracy": 0.7419699221849442, "num_tokens": 560257.0, "step": 130 }, { "entropy": 0.6902340137399733, "epoch": 0.013201164531299726, "grad_norm": 0.423828125, "learning_rate": 2.316666666666667e-06, "loss": 0.5627652168273926, "mean_token_accuracy": 0.7800763368606567, "num_tokens": 611089.0, "step": 140 }, { "entropy": 0.8741010932251811, "epoch": 0.014144104854963991, "grad_norm": 0.734375, "learning_rate": 2.4833333333333334e-06, "loss": 0.7286121368408203, "mean_token_accuracy": 0.7611308570951223, "num_tokens": 653242.0, "step": 150 }, { "entropy": 0.9950330995023251, "epoch": 0.015087045178628258, "grad_norm": 0.42578125, "learning_rate": 2.6500000000000005e-06, "loss": 0.6086991310119629, "mean_token_accuracy": 0.7128357637673617, "num_tokens": 699335.0, "step": 160 }, { "entropy": 1.0139703455381095, "epoch": 0.016029985502292524, "grad_norm": 0.71875, "learning_rate": 2.816666666666667e-06, "loss": 0.716233777999878, "mean_token_accuracy": 0.7203566078096628, "num_tokens": 745545.0, "step": 170 }, { "entropy": 0.8151160830631852, "epoch": 0.01697292582595679, "grad_norm": 0.7421875, "learning_rate": 2.9833333333333337e-06, "loss": 0.7127080917358398, "mean_token_accuracy": 0.7654837179929018, "num_tokens": 788484.0, "step": 180 }, { "entropy": 0.9775107364170253, "epoch": 0.017915866149621054, "grad_norm": 0.3515625, "learning_rate": 3.1500000000000003e-06, "loss": 0.6497589588165283, "mean_token_accuracy": 0.723390669375658, "num_tokens": 829584.0, "step": 190 }, { "entropy": 0.939525655657053, "epoch": 0.018858806473285323, "grad_norm": 0.5390625, "learning_rate": 3.316666666666667e-06, "loss": 0.8930251121520996, "mean_token_accuracy": 0.7298649605363607, "num_tokens": 880250.0, "step": 200 }, { "entropy": 0.8969364328309893, "epoch": 0.019801746796949588, "grad_norm": 0.4453125, "learning_rate": 3.4833333333333336e-06, "loss": 0.5880197048187256, "mean_token_accuracy": 0.7570957642048597, "num_tokens": 923548.0, "step": 210 }, { "entropy": 0.8533092273399234, "epoch": 0.020744687120613853, "grad_norm": 0.546875, "learning_rate": 3.65e-06, "loss": 0.588037633895874, "mean_token_accuracy": 0.7782193420454859, "num_tokens": 971736.0, "step": 220 }, { "entropy": 0.9134741343557835, "epoch": 0.02168762744427812, "grad_norm": 0.6640625, "learning_rate": 3.816666666666667e-06, "loss": 0.7983614444732666, "mean_token_accuracy": 0.7581239463761449, "num_tokens": 1017995.0, "step": 230 }, { "entropy": 0.9609160049818456, "epoch": 0.022630567767942388, "grad_norm": 0.4140625, "learning_rate": 3.983333333333334e-06, "loss": 0.8104394912719727, "mean_token_accuracy": 0.7391819234937429, "num_tokens": 1067131.0, "step": 240 }, { "entropy": 0.7141571814659983, "epoch": 0.023573508091606653, "grad_norm": 0.47265625, "learning_rate": 4.15e-06, "loss": 0.5877416133880615, "mean_token_accuracy": 0.794341066479683, "num_tokens": 1115898.0, "step": 250 }, { "entropy": 0.8112523064017296, "epoch": 0.024516448415270918, "grad_norm": 0.328125, "learning_rate": 4.316666666666667e-06, "loss": 0.6444027900695801, "mean_token_accuracy": 0.7691240157932043, "num_tokens": 1167517.0, "step": 260 }, { "entropy": 0.7751363357529044, "epoch": 0.025459388738935183, "grad_norm": 0.55859375, "learning_rate": 4.483333333333333e-06, "loss": 0.757953405380249, "mean_token_accuracy": 0.7687718976289034, "num_tokens": 1210826.0, "step": 270 }, { "entropy": 0.82865877635777, "epoch": 0.026402329062599452, "grad_norm": 1.0, "learning_rate": 4.65e-06, "loss": 0.5851547241210937, "mean_token_accuracy": 0.7553599935024977, "num_tokens": 1262440.0, "step": 280 }, { "entropy": 0.8141519343480468, "epoch": 0.027345269386263717, "grad_norm": 0.3671875, "learning_rate": 4.816666666666667e-06, "loss": 0.5882571697235107, "mean_token_accuracy": 0.7627896059304475, "num_tokens": 1303017.0, "step": 290 }, { "entropy": 0.8711584686301649, "epoch": 0.028288209709927983, "grad_norm": 0.34375, "learning_rate": 4.983333333333334e-06, "loss": 0.764805269241333, "mean_token_accuracy": 0.7534263415262104, "num_tokens": 1350030.0, "step": 300 }, { "entropy": 0.837328751757741, "epoch": 0.029231150033592248, "grad_norm": 0.330078125, "learning_rate": 4.999989379352344e-06, "loss": 0.5841926574707031, "mean_token_accuracy": 0.77335274964571, "num_tokens": 1397632.0, "step": 310 }, { "entropy": 0.9319362798705697, "epoch": 0.030174090357256517, "grad_norm": 1.1171875, "learning_rate": 4.99995266611827e-06, "loss": 0.835329818725586, "mean_token_accuracy": 0.747077708505094, "num_tokens": 1437635.0, "step": 320 }, { "entropy": 0.8836544909514487, "epoch": 0.031117030680920782, "grad_norm": 0.396484375, "learning_rate": 4.9998897295636865e-06, "loss": 0.6881571292877198, "mean_token_accuracy": 0.7660582908429205, "num_tokens": 1490028.0, "step": 330 }, { "entropy": 0.9423393627628684, "epoch": 0.03205997100458505, "grad_norm": 0.470703125, "learning_rate": 4.999800570348766e-06, "loss": 0.8963788986206055, "mean_token_accuracy": 0.7583182919770479, "num_tokens": 1536533.0, "step": 340 }, { "entropy": 0.7955392638221384, "epoch": 0.03300291132824931, "grad_norm": 0.48046875, "learning_rate": 4.9996851894087494e-06, "loss": 0.6439263820648193, "mean_token_accuracy": 0.7917482912540436, "num_tokens": 1588387.0, "step": 350 }, { "entropy": 0.9244774136692285, "epoch": 0.03394585165191358, "grad_norm": 0.55859375, "learning_rate": 4.999543587953926e-06, "loss": 0.745479154586792, "mean_token_accuracy": 0.7643994279205799, "num_tokens": 1628362.0, "step": 360 }, { "entropy": 0.7448134837672115, "epoch": 0.03488879197557784, "grad_norm": 0.302734375, "learning_rate": 4.999375767469629e-06, "loss": 0.5240091800689697, "mean_token_accuracy": 0.8123030034825206, "num_tokens": 1674278.0, "step": 370 }, { "entropy": 0.8121415632776916, "epoch": 0.03583173229924211, "grad_norm": 0.34375, "learning_rate": 4.999181729716214e-06, "loss": 0.5245255470275879, "mean_token_accuracy": 0.7992570735514164, "num_tokens": 1718938.0, "step": 380 }, { "entropy": 0.7439056454226375, "epoch": 0.03677467262290638, "grad_norm": 0.498046875, "learning_rate": 4.9989614767290475e-06, "loss": 0.5786451816558837, "mean_token_accuracy": 0.7991266250610352, "num_tokens": 1761197.0, "step": 390 }, { "entropy": 0.8094423169270157, "epoch": 0.037717612946570646, "grad_norm": 0.5234375, "learning_rate": 4.998715010818479e-06, "loss": 0.7232402324676513, "mean_token_accuracy": 0.7819511042907834, "num_tokens": 1802910.0, "step": 400 }, { "entropy": 0.8084097126498818, "epoch": 0.03866055327023491, "grad_norm": 0.392578125, "learning_rate": 4.998442334569818e-06, "loss": 0.6168120384216309, "mean_token_accuracy": 0.7858469415456056, "num_tokens": 1847975.0, "step": 410 }, { "entropy": 0.8122809613589197, "epoch": 0.039603493593899176, "grad_norm": 0.423828125, "learning_rate": 4.9981434508433106e-06, "loss": 0.5653482913970947, "mean_token_accuracy": 0.7861449956893921, "num_tokens": 1898331.0, "step": 420 }, { "entropy": 0.8453013042919337, "epoch": 0.04054643391756344, "grad_norm": 0.53515625, "learning_rate": 4.9978183627741036e-06, "loss": 0.6866735458374024, "mean_token_accuracy": 0.769303709641099, "num_tokens": 1943346.0, "step": 430 }, { "entropy": 0.7795825297012925, "epoch": 0.04148937424122771, "grad_norm": 0.396484375, "learning_rate": 4.997467073772219e-06, "loss": 0.5773806095123291, "mean_token_accuracy": 0.790226286277175, "num_tokens": 1986104.0, "step": 440 }, { "entropy": 0.7945893675088882, "epoch": 0.04243231456489197, "grad_norm": 0.5546875, "learning_rate": 4.997089587522511e-06, "loss": 0.6738276958465577, "mean_token_accuracy": 0.7983880737796426, "num_tokens": 2034829.0, "step": 450 }, { "entropy": 0.7780243606306613, "epoch": 0.04337525488855624, "grad_norm": 0.546875, "learning_rate": 4.996685907984634e-06, "loss": 0.6213938236236572, "mean_token_accuracy": 0.778583624586463, "num_tokens": 2080729.0, "step": 460 }, { "entropy": 0.8474339607171715, "epoch": 0.04431819521222051, "grad_norm": 0.45703125, "learning_rate": 4.996256039392993e-06, "loss": 0.7563930511474609, "mean_token_accuracy": 0.7770253024995327, "num_tokens": 2127423.0, "step": 470 }, { "entropy": 0.7664846159517765, "epoch": 0.045261135535884775, "grad_norm": 0.8515625, "learning_rate": 4.9957999862567054e-06, "loss": 0.6358477592468261, "mean_token_accuracy": 0.7809185341000557, "num_tokens": 2176434.0, "step": 480 }, { "entropy": 0.8652129575610161, "epoch": 0.04620407585954904, "grad_norm": 0.47265625, "learning_rate": 4.995317753359555e-06, "loss": 0.7163708209991455, "mean_token_accuracy": 0.7767861977219581, "num_tokens": 2227826.0, "step": 490 }, { "entropy": 0.749835775885731, "epoch": 0.047147016183213306, "grad_norm": 0.57421875, "learning_rate": 4.994809345759936e-06, "loss": 0.6652904033660889, "mean_token_accuracy": 0.799538579583168, "num_tokens": 2268858.0, "step": 500 }, { "entropy": 0.7915277570486069, "epoch": 0.04808995650687757, "grad_norm": 0.65625, "learning_rate": 4.994274768790804e-06, "loss": 0.7498304843902588, "mean_token_accuracy": 0.7831572480499744, "num_tokens": 2310420.0, "step": 510 }, { "entropy": 0.8275801884941757, "epoch": 0.049032896830541836, "grad_norm": 0.5390625, "learning_rate": 4.993714028059617e-06, "loss": 0.6858491420745849, "mean_token_accuracy": 0.7689583929255605, "num_tokens": 2351284.0, "step": 520 }, { "entropy": 0.8296442488208413, "epoch": 0.0499758371542061, "grad_norm": 0.7265625, "learning_rate": 4.993127129448281e-06, "loss": 0.783640718460083, "mean_token_accuracy": 0.7797811217606068, "num_tokens": 2399931.0, "step": 530 }, { "entropy": 0.7026577349752188, "epoch": 0.05091877747787037, "grad_norm": 0.341796875, "learning_rate": 4.992514079113085e-06, "loss": 0.5345718383789062, "mean_token_accuracy": 0.8149769268929958, "num_tokens": 2443358.0, "step": 540 }, { "entropy": 0.8745481946505607, "epoch": 0.05186171780153463, "grad_norm": 1.1171875, "learning_rate": 4.991874883484636e-06, "loss": 0.7263978004455567, "mean_token_accuracy": 0.7751286920160055, "num_tokens": 2485947.0, "step": 550 }, { "entropy": 0.7575348360463977, "epoch": 0.052804658125198904, "grad_norm": 0.380859375, "learning_rate": 4.991209549267793e-06, "loss": 0.6377761363983154, "mean_token_accuracy": 0.8040944354608655, "num_tokens": 2530402.0, "step": 560 }, { "entropy": 0.9096321894787252, "epoch": 0.05374759844886317, "grad_norm": 0.7109375, "learning_rate": 4.9905180834416e-06, "loss": 1.0087954521179199, "mean_token_accuracy": 0.7766659688204527, "num_tokens": 2571237.0, "step": 570 }, { "entropy": 0.8211571240797639, "epoch": 0.054690538772527435, "grad_norm": 0.34765625, "learning_rate": 4.989800493259204e-06, "loss": 0.6053966522216797, "mean_token_accuracy": 0.783365786075592, "num_tokens": 2619202.0, "step": 580 }, { "entropy": 0.8075054436922073, "epoch": 0.0556334790961917, "grad_norm": 0.439453125, "learning_rate": 4.989056786247788e-06, "loss": 0.7344274520874023, "mean_token_accuracy": 0.7819651760160923, "num_tokens": 2668876.0, "step": 590 }, { "entropy": 0.8033788122236729, "epoch": 0.056576419419855965, "grad_norm": 0.2314453125, "learning_rate": 4.988286970208484e-06, "loss": 0.5867619991302491, "mean_token_accuracy": 0.7901865538209677, "num_tokens": 2720273.0, "step": 600 }, { "entropy": 0.8459454836323858, "epoch": 0.05751935974352023, "grad_norm": 0.462890625, "learning_rate": 4.9874910532163e-06, "loss": 0.6807960987091064, "mean_token_accuracy": 0.7898602165281773, "num_tokens": 2767675.0, "step": 610 }, { "entropy": 0.7156997710466385, "epoch": 0.058462300067184496, "grad_norm": 0.76171875, "learning_rate": 4.986669043620029e-06, "loss": 0.6528503894805908, "mean_token_accuracy": 0.8035624513402582, "num_tokens": 2809140.0, "step": 620 }, { "entropy": 0.7602013352327048, "epoch": 0.05940524039084876, "grad_norm": 0.6328125, "learning_rate": 4.985820950042161e-06, "loss": 0.613498592376709, "mean_token_accuracy": 0.797001127153635, "num_tokens": 2849972.0, "step": 630 }, { "entropy": 0.819284772220999, "epoch": 0.06034818071451303, "grad_norm": 0.361328125, "learning_rate": 4.984946781378797e-06, "loss": 0.7385236740112304, "mean_token_accuracy": 0.7713361542671919, "num_tokens": 2892749.0, "step": 640 }, { "entropy": 0.694091964699328, "epoch": 0.0612911210381773, "grad_norm": 0.408203125, "learning_rate": 4.9840465467995535e-06, "loss": 0.6021022796630859, "mean_token_accuracy": 0.8121187005192041, "num_tokens": 2940704.0, "step": 650 }, { "entropy": 0.6857697816565633, "epoch": 0.062234061361841564, "grad_norm": 0.7109375, "learning_rate": 4.983120255747464e-06, "loss": 0.5373991966247559, "mean_token_accuracy": 0.81699233725667, "num_tokens": 2986358.0, "step": 660 }, { "entropy": 0.8100536063313484, "epoch": 0.06317700168550583, "grad_norm": 0.69140625, "learning_rate": 4.982167917938885e-06, "loss": 0.6947032451629639, "mean_token_accuracy": 0.7735116362571717, "num_tokens": 3019506.0, "step": 670 }, { "entropy": 0.8745680207386612, "epoch": 0.0641199420091701, "grad_norm": 0.392578125, "learning_rate": 4.981189543363389e-06, "loss": 0.6408730030059815, "mean_token_accuracy": 0.7711815811693669, "num_tokens": 3062042.0, "step": 680 }, { "entropy": 0.8105671038851142, "epoch": 0.06506288233283436, "grad_norm": 0.5546875, "learning_rate": 4.98018514228366e-06, "loss": 0.6767678260803223, "mean_token_accuracy": 0.774928280338645, "num_tokens": 3113758.0, "step": 690 }, { "entropy": 0.7323714484460652, "epoch": 0.06600582265649863, "grad_norm": 0.287109375, "learning_rate": 4.979154725235392e-06, "loss": 0.5733721733093262, "mean_token_accuracy": 0.808050155825913, "num_tokens": 3163234.0, "step": 700 }, { "entropy": 0.8353265615180134, "epoch": 0.06694876298016289, "grad_norm": 0.392578125, "learning_rate": 4.978098303027173e-06, "loss": 0.6160747528076171, "mean_token_accuracy": 0.7780146349221468, "num_tokens": 3207175.0, "step": 710 }, { "entropy": 0.7545118189416826, "epoch": 0.06789170330382716, "grad_norm": 0.275390625, "learning_rate": 4.9770158867403705e-06, "loss": 0.5270243644714355, "mean_token_accuracy": 0.7902896221727133, "num_tokens": 3253721.0, "step": 720 }, { "entropy": 0.7230144888162613, "epoch": 0.06883464362749142, "grad_norm": 0.6640625, "learning_rate": 4.975907487729021e-06, "loss": 0.6117719173431396, "mean_token_accuracy": 0.8142276495695114, "num_tokens": 3298677.0, "step": 730 }, { "entropy": 0.6818190900608897, "epoch": 0.06977758395115569, "grad_norm": 0.64453125, "learning_rate": 4.974773117619703e-06, "loss": 0.6048723220825195, "mean_token_accuracy": 0.8080967217683792, "num_tokens": 3341867.0, "step": 740 }, { "entropy": 0.7368672281503678, "epoch": 0.07072052427481995, "grad_norm": 0.54296875, "learning_rate": 4.973612788311424e-06, "loss": 0.6020387649536133, "mean_token_accuracy": 0.7991985162720084, "num_tokens": 3382805.0, "step": 750 }, { "entropy": 0.8011913444846869, "epoch": 0.07166346459848422, "grad_norm": 0.71875, "learning_rate": 4.972426511975489e-06, "loss": 0.741117525100708, "mean_token_accuracy": 0.7860968332737684, "num_tokens": 3425539.0, "step": 760 }, { "entropy": 0.7815477557480335, "epoch": 0.0726064049221485, "grad_norm": 0.6953125, "learning_rate": 4.971214301055376e-06, "loss": 0.6468725204467773, "mean_token_accuracy": 0.7957555901259183, "num_tokens": 3468481.0, "step": 770 }, { "entropy": 0.7002213094383478, "epoch": 0.07354934524581276, "grad_norm": 0.318359375, "learning_rate": 4.9699761682666026e-06, "loss": 0.4705470085144043, "mean_token_accuracy": 0.7878050077706575, "num_tokens": 3513800.0, "step": 780 }, { "entropy": 0.7421004495583474, "epoch": 0.07449228556947703, "grad_norm": 0.33203125, "learning_rate": 4.968712126596598e-06, "loss": 0.6162665843963623, "mean_token_accuracy": 0.8012846134603023, "num_tokens": 3554346.0, "step": 790 }, { "entropy": 0.7171782004646957, "epoch": 0.07543522589314129, "grad_norm": 0.330078125, "learning_rate": 4.967422189304558e-06, "loss": 0.5965607643127442, "mean_token_accuracy": 0.7875219449400902, "num_tokens": 3606796.0, "step": 800 }, { "entropy": 0.7832795661874116, "epoch": 0.07637816621680556, "grad_norm": 0.369140625, "learning_rate": 4.966106369921317e-06, "loss": 0.602449369430542, "mean_token_accuracy": 0.7922013100236655, "num_tokens": 3647649.0, "step": 810 }, { "entropy": 0.8182275678031147, "epoch": 0.07732110654046982, "grad_norm": 1.046875, "learning_rate": 4.964764682249197e-06, "loss": 0.7580663681030273, "mean_token_accuracy": 0.7738244906067848, "num_tokens": 3695788.0, "step": 820 }, { "entropy": 0.8186208296567201, "epoch": 0.07826404686413409, "grad_norm": 0.77734375, "learning_rate": 4.963397140361868e-06, "loss": 0.6980972766876221, "mean_token_accuracy": 0.792484282515943, "num_tokens": 3736836.0, "step": 830 }, { "entropy": 0.766120829153806, "epoch": 0.07920698718779835, "grad_norm": 0.44140625, "learning_rate": 4.962003758604194e-06, "loss": 0.7221168994903564, "mean_token_accuracy": 0.796668940410018, "num_tokens": 3778465.0, "step": 840 }, { "entropy": 0.8256865127943456, "epoch": 0.08014992751146262, "grad_norm": 0.47265625, "learning_rate": 4.960584551592094e-06, "loss": 0.6105232238769531, "mean_token_accuracy": 0.7867782566696405, "num_tokens": 3828031.0, "step": 850 }, { "entropy": 0.6507625746540725, "epoch": 0.08109286783512688, "grad_norm": 0.466796875, "learning_rate": 4.959139534212375e-06, "loss": 0.5035228252410888, "mean_token_accuracy": 0.8218056863173843, "num_tokens": 3880085.0, "step": 860 }, { "entropy": 0.7207641104236245, "epoch": 0.08203580815879115, "grad_norm": 0.5703125, "learning_rate": 4.957668721622587e-06, "loss": 0.5374783515930176, "mean_token_accuracy": 0.8109163239598274, "num_tokens": 3918528.0, "step": 870 }, { "entropy": 0.8274590659886598, "epoch": 0.08297874848245541, "grad_norm": 0.482421875, "learning_rate": 4.956172129250858e-06, "loss": 0.711448335647583, "mean_token_accuracy": 0.785671678930521, "num_tokens": 3961043.0, "step": 880 }, { "entropy": 0.7421449825167656, "epoch": 0.08392168880611968, "grad_norm": 0.47265625, "learning_rate": 4.954649772795735e-06, "loss": 0.6577060699462891, "mean_token_accuracy": 0.7982315208762885, "num_tokens": 4007062.0, "step": 890 }, { "entropy": 0.6785881833173335, "epoch": 0.08486462912978394, "grad_norm": 0.64453125, "learning_rate": 4.953101668226014e-06, "loss": 0.5841499328613281, "mean_token_accuracy": 0.8102574732154608, "num_tokens": 4062219.0, "step": 900 }, { "entropy": 0.732798031810671, "epoch": 0.08580756945344821, "grad_norm": 1.046875, "learning_rate": 4.951527831780583e-06, "loss": 0.6197251319885254, "mean_token_accuracy": 0.796886844933033, "num_tokens": 4111022.0, "step": 910 }, { "entropy": 0.80500507671386, "epoch": 0.08675050977711248, "grad_norm": 0.51953125, "learning_rate": 4.949928279968238e-06, "loss": 0.6231956005096435, "mean_token_accuracy": 0.7846117116510868, "num_tokens": 4151597.0, "step": 920 }, { "entropy": 0.7407358650118112, "epoch": 0.08769345010077674, "grad_norm": 0.357421875, "learning_rate": 4.948303029567523e-06, "loss": 0.5905776023864746, "mean_token_accuracy": 0.7902860388159751, "num_tokens": 4205660.0, "step": 930 }, { "entropy": 0.8730802398175002, "epoch": 0.08863639042444102, "grad_norm": 0.40234375, "learning_rate": 4.946652097626544e-06, "loss": 0.6360596656799317, "mean_token_accuracy": 0.7667682899162174, "num_tokens": 4252923.0, "step": 940 }, { "entropy": 0.7542075706645847, "epoch": 0.08957933074810528, "grad_norm": 0.28125, "learning_rate": 4.944975501462797e-06, "loss": 0.6091949462890625, "mean_token_accuracy": 0.8042812138795853, "num_tokens": 4305703.0, "step": 950 }, { "entropy": 0.6663548903539777, "epoch": 0.09052227107176955, "grad_norm": 0.5625, "learning_rate": 4.943273258662982e-06, "loss": 0.5946632385253906, "mean_token_accuracy": 0.8140654802322388, "num_tokens": 4351819.0, "step": 960 }, { "entropy": 0.8968982026912272, "epoch": 0.09146521139543382, "grad_norm": 0.7421875, "learning_rate": 4.941545387082821e-06, "loss": 0.7777196884155273, "mean_token_accuracy": 0.7636161763221025, "num_tokens": 4402994.0, "step": 970 }, { "entropy": 0.7275657393038273, "epoch": 0.09240815171909808, "grad_norm": 0.7734375, "learning_rate": 4.939791904846869e-06, "loss": 0.692138671875, "mean_token_accuracy": 0.796290036663413, "num_tokens": 4443896.0, "step": 980 }, { "entropy": 0.8022994266822934, "epoch": 0.09335109204276235, "grad_norm": 1.15625, "learning_rate": 4.938012830348325e-06, "loss": 0.7263329029083252, "mean_token_accuracy": 0.7886364821344614, "num_tokens": 4489361.0, "step": 990 }, { "entropy": 0.7677907293662429, "epoch": 0.09429403236642661, "grad_norm": 0.30078125, "learning_rate": 4.936208182248838e-06, "loss": 0.7098466396331787, "mean_token_accuracy": 0.7836588025093079, "num_tokens": 4538560.0, "step": 1000 }, { "entropy": 0.7540503291413188, "epoch": 0.09523697269009088, "grad_norm": 0.306640625, "learning_rate": 4.934377979478312e-06, "loss": 0.6721164226531983, "mean_token_accuracy": 0.774369165673852, "num_tokens": 4582185.0, "step": 1010 }, { "entropy": 0.7057674110867083, "epoch": 0.09617991301375514, "grad_norm": 0.5625, "learning_rate": 4.932522241234711e-06, "loss": 0.5665208339691162, "mean_token_accuracy": 0.8124939866364003, "num_tokens": 4624388.0, "step": 1020 }, { "entropy": 0.7860274084843695, "epoch": 0.09712285333741941, "grad_norm": 0.87109375, "learning_rate": 4.9306409869838475e-06, "loss": 0.627524471282959, "mean_token_accuracy": 0.7900194443762303, "num_tokens": 4664734.0, "step": 1030 }, { "entropy": 0.6265595956705511, "epoch": 0.09806579366108367, "grad_norm": 0.255859375, "learning_rate": 4.928734236459191e-06, "loss": 0.47365193367004393, "mean_token_accuracy": 0.8303351975977421, "num_tokens": 4718449.0, "step": 1040 }, { "entropy": 0.8842747121118009, "epoch": 0.09900873398474794, "grad_norm": 0.478515625, "learning_rate": 4.926802009661651e-06, "loss": 0.9802035331726074, "mean_token_accuracy": 0.7524257987737656, "num_tokens": 4763508.0, "step": 1050 }, { "entropy": 0.8015215817838908, "epoch": 0.0999516743084122, "grad_norm": 0.47265625, "learning_rate": 4.9248443268593724e-06, "loss": 0.683444595336914, "mean_token_accuracy": 0.7799651555716991, "num_tokens": 4808857.0, "step": 1060 }, { "entropy": 0.7447168783284723, "epoch": 0.10089461463207647, "grad_norm": 0.83984375, "learning_rate": 4.922861208587522e-06, "loss": 0.6439436435699463, "mean_token_accuracy": 0.8069465953856707, "num_tokens": 4849125.0, "step": 1070 }, { "entropy": 0.7262563842348755, "epoch": 0.10183755495574073, "grad_norm": 0.3359375, "learning_rate": 4.920852675648071e-06, "loss": 0.5818546772003174, "mean_token_accuracy": 0.8100180253386497, "num_tokens": 4895597.0, "step": 1080 }, { "entropy": 0.7206171770580113, "epoch": 0.102780495279405, "grad_norm": 0.5546875, "learning_rate": 4.918818749109581e-06, "loss": 0.6229705333709716, "mean_token_accuracy": 0.8035074207931757, "num_tokens": 4938109.0, "step": 1090 }, { "entropy": 0.8021614892408252, "epoch": 0.10372343560306926, "grad_norm": 0.5703125, "learning_rate": 4.9167594503069785e-06, "loss": 0.6964336395263672, "mean_token_accuracy": 0.7762649796903134, "num_tokens": 4981562.0, "step": 1100 }, { "entropy": 0.7161757604219019, "epoch": 0.10466637592673354, "grad_norm": 0.263671875, "learning_rate": 4.914674800841332e-06, "loss": 0.747713851928711, "mean_token_accuracy": 0.8009138405323029, "num_tokens": 5028887.0, "step": 1110 }, { "entropy": 0.7790245489217341, "epoch": 0.10560931625039781, "grad_norm": 0.5234375, "learning_rate": 4.91256482257963e-06, "loss": 0.6210433006286621, "mean_token_accuracy": 0.7918234229087829, "num_tokens": 5068901.0, "step": 1120 }, { "entropy": 0.7243750081397593, "epoch": 0.10655225657406207, "grad_norm": 0.455078125, "learning_rate": 4.910429537654544e-06, "loss": 0.6189009666442871, "mean_token_accuracy": 0.7888242486864329, "num_tokens": 5122274.0, "step": 1130 }, { "entropy": 0.7725613342598081, "epoch": 0.10749519689772634, "grad_norm": 0.57421875, "learning_rate": 4.908268968464205e-06, "loss": 0.6020617485046387, "mean_token_accuracy": 0.7757980896160006, "num_tokens": 5171661.0, "step": 1140 }, { "entropy": 0.7940086780115962, "epoch": 0.1084381372213906, "grad_norm": 0.73046875, "learning_rate": 4.9060831376719585e-06, "loss": 0.6493505001068115, "mean_token_accuracy": 0.7813464991748333, "num_tokens": 5218273.0, "step": 1150 }, { "entropy": 0.6979408304207027, "epoch": 0.10938107754505487, "grad_norm": 0.8671875, "learning_rate": 4.903872068206138e-06, "loss": 0.6040244102478027, "mean_token_accuracy": 0.8104764647781849, "num_tokens": 5259478.0, "step": 1160 }, { "entropy": 0.7056857038289308, "epoch": 0.11032401786871913, "grad_norm": 0.353515625, "learning_rate": 4.9016357832598135e-06, "loss": 0.5862742900848389, "mean_token_accuracy": 0.8063552943989635, "num_tokens": 5302993.0, "step": 1170 }, { "entropy": 0.7344408438540995, "epoch": 0.1112669581923834, "grad_norm": 0.279296875, "learning_rate": 4.899374306290558e-06, "loss": 0.7177176952362061, "mean_token_accuracy": 0.805981208384037, "num_tokens": 5351565.0, "step": 1180 }, { "entropy": 0.6840172544121742, "epoch": 0.11220989851604767, "grad_norm": 0.416015625, "learning_rate": 4.897087661020194e-06, "loss": 0.5912201881408692, "mean_token_accuracy": 0.8121493086218834, "num_tokens": 5391537.0, "step": 1190 }, { "entropy": 0.7785421489737928, "epoch": 0.11315283883971193, "grad_norm": 0.359375, "learning_rate": 4.894775871434548e-06, "loss": 0.6811850547790528, "mean_token_accuracy": 0.7836464313790202, "num_tokens": 5428823.0, "step": 1200 }, { "entropy": 0.6350860029459, "epoch": 0.1140957791633762, "grad_norm": 0.275390625, "learning_rate": 4.892438961783199e-06, "loss": 0.49747395515441895, "mean_token_accuracy": 0.8172833763062954, "num_tokens": 5474692.0, "step": 1210 }, { "entropy": 0.7340997345745564, "epoch": 0.11503871948704046, "grad_norm": 0.330078125, "learning_rate": 4.890076956579223e-06, "loss": 0.5803222179412841, "mean_token_accuracy": 0.811799717694521, "num_tokens": 5522965.0, "step": 1220 }, { "entropy": 0.6614907255396247, "epoch": 0.11598165981070473, "grad_norm": 0.51953125, "learning_rate": 4.887689880598938e-06, "loss": 0.5860563755035401, "mean_token_accuracy": 0.8119680780917407, "num_tokens": 5572615.0, "step": 1230 }, { "entropy": 0.8880835673771799, "epoch": 0.11692460013436899, "grad_norm": 0.54296875, "learning_rate": 4.885277758881641e-06, "loss": 0.7023919105529786, "mean_token_accuracy": 0.7654352005571127, "num_tokens": 5615891.0, "step": 1240 }, { "entropy": 0.7018857408314944, "epoch": 0.11786754045803326, "grad_norm": 0.6640625, "learning_rate": 4.882840616729347e-06, "loss": 0.615167760848999, "mean_token_accuracy": 0.7958494182676077, "num_tokens": 5666242.0, "step": 1250 }, { "entropy": 0.8410587665624917, "epoch": 0.11881048078169752, "grad_norm": 0.330078125, "learning_rate": 4.880378479706525e-06, "loss": 0.6831368446350098, "mean_token_accuracy": 0.7757596135139465, "num_tokens": 5714622.0, "step": 1260 }, { "entropy": 0.7477244296111166, "epoch": 0.11975342110536179, "grad_norm": 0.515625, "learning_rate": 4.877891373639824e-06, "loss": 0.5684638977050781, "mean_token_accuracy": 0.8081520074978471, "num_tokens": 5762489.0, "step": 1270 }, { "entropy": 0.8104454580694437, "epoch": 0.12069636142902607, "grad_norm": 0.51953125, "learning_rate": 4.875379324617815e-06, "loss": 0.5815711975097656, "mean_token_accuracy": 0.781415050663054, "num_tokens": 5799123.0, "step": 1280 }, { "entropy": 0.6935905188322067, "epoch": 0.12163930175269033, "grad_norm": 0.435546875, "learning_rate": 4.872842358990701e-06, "loss": 0.6138697147369385, "mean_token_accuracy": 0.797416203096509, "num_tokens": 5849061.0, "step": 1290 }, { "entropy": 0.7854719746857881, "epoch": 0.1225822420763546, "grad_norm": 0.349609375, "learning_rate": 4.87028050337005e-06, "loss": 0.5638726711273193, "mean_token_accuracy": 0.7877143463119864, "num_tokens": 5890604.0, "step": 1300 }, { "entropy": 0.8234432382509113, "epoch": 0.12352518240001886, "grad_norm": 0.3984375, "learning_rate": 4.867693784628516e-06, "loss": 0.6471819877624512, "mean_token_accuracy": 0.7767364744096994, "num_tokens": 5932967.0, "step": 1310 }, { "entropy": 0.7679943142458796, "epoch": 0.12446812272368313, "grad_norm": 0.50390625, "learning_rate": 4.865082229899554e-06, "loss": 0.6443884372711182, "mean_token_accuracy": 0.7849613726139069, "num_tokens": 5973382.0, "step": 1320 }, { "entropy": 0.6430552182719111, "epoch": 0.1254110630473474, "grad_norm": 0.63671875, "learning_rate": 4.862445866577138e-06, "loss": 0.58107008934021, "mean_token_accuracy": 0.8114496625959873, "num_tokens": 6021337.0, "step": 1330 }, { "entropy": 0.7372513002716005, "epoch": 0.12635400337101166, "grad_norm": 0.447265625, "learning_rate": 4.859784722315472e-06, "loss": 0.6992315769195556, "mean_token_accuracy": 0.7826294297352433, "num_tokens": 6077344.0, "step": 1340 }, { "entropy": 0.8189116214867681, "epoch": 0.12729694369467592, "grad_norm": 0.53515625, "learning_rate": 4.857098825028701e-06, "loss": 0.7671550750732422, "mean_token_accuracy": 0.7946853101253509, "num_tokens": 6119359.0, "step": 1350 }, { "entropy": 0.7827853210270405, "epoch": 0.1282398840183402, "grad_norm": 0.376953125, "learning_rate": 4.854388202890614e-06, "loss": 0.7045656681060791, "mean_token_accuracy": 0.7913773000240326, "num_tokens": 6160311.0, "step": 1360 }, { "entropy": 0.7482062807306648, "epoch": 0.12918282434200445, "grad_norm": 0.3984375, "learning_rate": 4.851652884334356e-06, "loss": 0.7099195957183838, "mean_token_accuracy": 0.7907620433717966, "num_tokens": 6201115.0, "step": 1370 }, { "entropy": 0.73036635722965, "epoch": 0.13012576466566872, "grad_norm": 0.265625, "learning_rate": 4.848892898052125e-06, "loss": 0.5717474937438964, "mean_token_accuracy": 0.8052898969501256, "num_tokens": 6248167.0, "step": 1380 }, { "entropy": 0.6847926998510957, "epoch": 0.13106870498933298, "grad_norm": 0.5859375, "learning_rate": 4.84610827299487e-06, "loss": 0.6278266906738281, "mean_token_accuracy": 0.8036519877612591, "num_tokens": 6290393.0, "step": 1390 }, { "entropy": 0.6735235895961523, "epoch": 0.13201164531299725, "grad_norm": 0.33203125, "learning_rate": 4.843299038371991e-06, "loss": 0.6215836048126221, "mean_token_accuracy": 0.8117277476936579, "num_tokens": 6342860.0, "step": 1400 }, { "entropy": 0.7760428190231323, "epoch": 0.13295458563666152, "grad_norm": 0.60546875, "learning_rate": 4.840465223651029e-06, "loss": 0.5304702281951904, "mean_token_accuracy": 0.7894374314695597, "num_tokens": 6389987.0, "step": 1410 }, { "entropy": 0.751918163895607, "epoch": 0.13389752596032578, "grad_norm": 0.52734375, "learning_rate": 4.83760685855736e-06, "loss": 0.6945547580718994, "mean_token_accuracy": 0.8058279521763325, "num_tokens": 6435158.0, "step": 1420 }, { "entropy": 0.6316566719673574, "epoch": 0.13484046628399005, "grad_norm": 0.8515625, "learning_rate": 4.834723973073882e-06, "loss": 0.5147292613983154, "mean_token_accuracy": 0.8109463810920715, "num_tokens": 6483159.0, "step": 1430 }, { "entropy": 0.8705680920742452, "epoch": 0.1357834066076543, "grad_norm": 0.68359375, "learning_rate": 4.831816597440697e-06, "loss": 0.7946212291717529, "mean_token_accuracy": 0.7745383739471435, "num_tokens": 6531589.0, "step": 1440 }, { "entropy": 0.6937490504235029, "epoch": 0.13672634693131858, "grad_norm": 0.41796875, "learning_rate": 4.828884762154803e-06, "loss": 0.5019688606262207, "mean_token_accuracy": 0.8086294280365109, "num_tokens": 6582550.0, "step": 1450 }, { "entropy": 0.6883674585260451, "epoch": 0.13766928725498284, "grad_norm": 0.318359375, "learning_rate": 4.825928497969763e-06, "loss": 0.5822939395904541, "mean_token_accuracy": 0.8153205912560224, "num_tokens": 6623531.0, "step": 1460 }, { "entropy": 0.7426637164317071, "epoch": 0.1386122275786471, "grad_norm": 0.48046875, "learning_rate": 4.822947835895389e-06, "loss": 0.6456994533538818, "mean_token_accuracy": 0.7916014738380909, "num_tokens": 6670087.0, "step": 1470 }, { "entropy": 0.7368132835254073, "epoch": 0.13955516790231137, "grad_norm": 0.34375, "learning_rate": 4.819942807197417e-06, "loss": 0.6506009578704834, "mean_token_accuracy": 0.8058517042547464, "num_tokens": 6719389.0, "step": 1480 }, { "entropy": 0.8392926104366779, "epoch": 0.14049810822597564, "grad_norm": 0.5234375, "learning_rate": 4.816913443397176e-06, "loss": 0.6899060726165771, "mean_token_accuracy": 0.7871105581521988, "num_tokens": 6761161.0, "step": 1490 }, { "entropy": 0.7088076891377568, "epoch": 0.1414410485496399, "grad_norm": 0.330078125, "learning_rate": 4.813859776271258e-06, "loss": 0.510068130493164, "mean_token_accuracy": 0.8044612921774388, "num_tokens": 6805745.0, "step": 1500 }, { "entropy": 0.6664590669795871, "epoch": 0.14238398887330417, "grad_norm": 0.3515625, "learning_rate": 4.810781837851186e-06, "loss": 0.5675896644592285, "mean_token_accuracy": 0.80593893378973, "num_tokens": 6850831.0, "step": 1510 }, { "entropy": 0.7449090665206313, "epoch": 0.14332692919696843, "grad_norm": 0.6796875, "learning_rate": 4.807679660423078e-06, "loss": 0.7466594696044921, "mean_token_accuracy": 0.7963773109018802, "num_tokens": 6893372.0, "step": 1520 }, { "entropy": 0.6773676542565227, "epoch": 0.14426986952063273, "grad_norm": 0.267578125, "learning_rate": 4.8045532765273085e-06, "loss": 0.5410051822662354, "mean_token_accuracy": 0.8197047363966703, "num_tokens": 6942690.0, "step": 1530 }, { "entropy": 0.8294754406437278, "epoch": 0.145212809844297, "grad_norm": 0.474609375, "learning_rate": 4.801402718958162e-06, "loss": 0.5964238166809082, "mean_token_accuracy": 0.7812088407576084, "num_tokens": 6995335.0, "step": 1540 }, { "entropy": 0.8663926181383431, "epoch": 0.14615575016796126, "grad_norm": 0.369140625, "learning_rate": 4.798228020763501e-06, "loss": 0.5792275905609131, "mean_token_accuracy": 0.7707085549831391, "num_tokens": 7048539.0, "step": 1550 }, { "entropy": 0.7147080856608227, "epoch": 0.14709869049162552, "grad_norm": 0.36328125, "learning_rate": 4.795029215244403e-06, "loss": 0.5165563583374023, "mean_token_accuracy": 0.7946837220340968, "num_tokens": 7094588.0, "step": 1560 }, { "entropy": 0.8003142789937556, "epoch": 0.1480416308152898, "grad_norm": 0.3203125, "learning_rate": 4.7918063359548274e-06, "loss": 0.5031931877136231, "mean_token_accuracy": 0.7990253180265426, "num_tokens": 7138857.0, "step": 1570 }, { "entropy": 0.7444701816886663, "epoch": 0.14898457113895405, "grad_norm": 0.490234375, "learning_rate": 4.788559416701251e-06, "loss": 0.62364182472229, "mean_token_accuracy": 0.800935186818242, "num_tokens": 7181093.0, "step": 1580 }, { "entropy": 0.768458298034966, "epoch": 0.14992751146261832, "grad_norm": 0.5234375, "learning_rate": 4.785288491542322e-06, "loss": 0.6315382480621338, "mean_token_accuracy": 0.7936431773006916, "num_tokens": 7225622.0, "step": 1590 }, { "entropy": 0.6673228033818305, "epoch": 0.15087045178628258, "grad_norm": 0.421875, "learning_rate": 4.781993594788496e-06, "loss": 0.5698256015777587, "mean_token_accuracy": 0.8094664443284273, "num_tokens": 7272191.0, "step": 1600 }, { "entropy": 0.6132199401967228, "epoch": 0.15181339210994685, "grad_norm": 0.451171875, "learning_rate": 4.778674761001681e-06, "loss": 0.637981653213501, "mean_token_accuracy": 0.8249839577823878, "num_tokens": 7320397.0, "step": 1610 }, { "entropy": 0.6754366432316601, "epoch": 0.15275633243361111, "grad_norm": 0.203125, "learning_rate": 4.775332024994874e-06, "loss": 0.4907213687896729, "mean_token_accuracy": 0.8176268842071295, "num_tokens": 7369385.0, "step": 1620 }, { "entropy": 0.6628142113331705, "epoch": 0.15369927275727538, "grad_norm": 0.4375, "learning_rate": 4.771965421831792e-06, "loss": 0.5297084331512452, "mean_token_accuracy": 0.8210704285651446, "num_tokens": 7418922.0, "step": 1630 }, { "entropy": 0.743092224188149, "epoch": 0.15464221308093964, "grad_norm": 0.294921875, "learning_rate": 4.768574986826513e-06, "loss": 0.7004957675933838, "mean_token_accuracy": 0.8017095427960157, "num_tokens": 7470971.0, "step": 1640 }, { "entropy": 0.839415866136551, "epoch": 0.1555851534046039, "grad_norm": 0.470703125, "learning_rate": 4.765160755543091e-06, "loss": 0.8255781173706055, "mean_token_accuracy": 0.7637870293110609, "num_tokens": 7515243.0, "step": 1650 }, { "entropy": 0.6935912227258086, "epoch": 0.15652809372826818, "grad_norm": 0.2578125, "learning_rate": 4.7617227637952e-06, "loss": 0.5783330917358398, "mean_token_accuracy": 0.8085279129445553, "num_tokens": 7564417.0, "step": 1660 }, { "entropy": 0.7936397315002978, "epoch": 0.15747103405193244, "grad_norm": 0.75, "learning_rate": 4.758261047645745e-06, "loss": 0.6287306785583496, "mean_token_accuracy": 0.7835016187280417, "num_tokens": 7612569.0, "step": 1670 }, { "entropy": 0.6750403906218707, "epoch": 0.1584139743755967, "grad_norm": 0.271484375, "learning_rate": 4.7547756434064916e-06, "loss": 0.5946949005126954, "mean_token_accuracy": 0.8034364454448223, "num_tokens": 7657765.0, "step": 1680 }, { "entropy": 0.7698115283623338, "epoch": 0.15935691469926097, "grad_norm": 0.875, "learning_rate": 4.751266587637681e-06, "loss": 0.679727029800415, "mean_token_accuracy": 0.7859929338097572, "num_tokens": 7692933.0, "step": 1690 }, { "entropy": 0.731985289696604, "epoch": 0.16029985502292524, "grad_norm": 0.51171875, "learning_rate": 4.747733917147646e-06, "loss": 0.6183731079101562, "mean_token_accuracy": 0.8142067354172469, "num_tokens": 7737759.0, "step": 1700 }, { "entropy": 0.7078736932948232, "epoch": 0.1612427953465895, "grad_norm": 0.28125, "learning_rate": 4.744177668992429e-06, "loss": 0.49601898193359373, "mean_token_accuracy": 0.8192032791674138, "num_tokens": 7782624.0, "step": 1710 }, { "entropy": 0.7805814618710428, "epoch": 0.16218573567025377, "grad_norm": 0.357421875, "learning_rate": 4.740597880475391e-06, "loss": 0.6345070838928223, "mean_token_accuracy": 0.818518004193902, "num_tokens": 7830123.0, "step": 1720 }, { "entropy": 0.7078598484396934, "epoch": 0.16312867599391803, "grad_norm": 0.259765625, "learning_rate": 4.736994589146821e-06, "loss": 0.6488445281982422, "mean_token_accuracy": 0.8083903908729553, "num_tokens": 7878591.0, "step": 1730 }, { "entropy": 0.6218862963840366, "epoch": 0.1640716163175823, "grad_norm": 0.55859375, "learning_rate": 4.7333678328035374e-06, "loss": 0.5586625576019287, "mean_token_accuracy": 0.8203994080424308, "num_tokens": 7928797.0, "step": 1740 }, { "entropy": 0.6412875755690038, "epoch": 0.16501455664124656, "grad_norm": 0.357421875, "learning_rate": 4.729717649488499e-06, "loss": 0.6166950225830078, "mean_token_accuracy": 0.8231342125684022, "num_tokens": 7972979.0, "step": 1750 }, { "entropy": 0.7250258160755039, "epoch": 0.16595749696491083, "grad_norm": 0.423828125, "learning_rate": 4.7260440774904014e-06, "loss": 0.5841271877288818, "mean_token_accuracy": 0.8074738964438438, "num_tokens": 8015392.0, "step": 1760 }, { "entropy": 0.6732541414909065, "epoch": 0.1669004372885751, "grad_norm": 0.58203125, "learning_rate": 4.722347155343277e-06, "loss": 0.6065329551696778, "mean_token_accuracy": 0.8136304952204227, "num_tokens": 8061805.0, "step": 1770 }, { "entropy": 0.8656071895733476, "epoch": 0.16784337761223936, "grad_norm": 0.337890625, "learning_rate": 4.71862692182609e-06, "loss": 0.8307145118713379, "mean_token_accuracy": 0.7705816131085157, "num_tokens": 8104858.0, "step": 1780 }, { "entropy": 0.7067621927708387, "epoch": 0.16878631793590362, "grad_norm": 0.419921875, "learning_rate": 4.714883415962329e-06, "loss": 0.6449962615966797, "mean_token_accuracy": 0.8116483464837074, "num_tokens": 8153858.0, "step": 1790 }, { "entropy": 0.628216756042093, "epoch": 0.1697292582595679, "grad_norm": 0.34375, "learning_rate": 4.711116677019599e-06, "loss": 0.4528506755828857, "mean_token_accuracy": 0.8308906458318234, "num_tokens": 8202695.0, "step": 1800 }, { "entropy": 0.5620249833911657, "epoch": 0.17067219858323215, "grad_norm": 0.27734375, "learning_rate": 4.707326744509209e-06, "loss": 0.6362682342529297, "mean_token_accuracy": 0.8432179998606444, "num_tokens": 8250847.0, "step": 1810 }, { "entropy": 0.711518302373588, "epoch": 0.17161513890689642, "grad_norm": 0.3203125, "learning_rate": 4.7035136581857596e-06, "loss": 0.6081731796264649, "mean_token_accuracy": 0.8159873858094215, "num_tokens": 8299509.0, "step": 1820 }, { "entropy": 0.833217189554125, "epoch": 0.17255807923056068, "grad_norm": 0.84375, "learning_rate": 4.69967745804672e-06, "loss": 0.928659725189209, "mean_token_accuracy": 0.7771374503150582, "num_tokens": 8335978.0, "step": 1830 }, { "entropy": 0.8410642127972097, "epoch": 0.17350101955422495, "grad_norm": 0.6171875, "learning_rate": 4.695818184332015e-06, "loss": 0.727938175201416, "mean_token_accuracy": 0.7709955636411905, "num_tokens": 8383600.0, "step": 1840 }, { "entropy": 0.6231134903617204, "epoch": 0.17444395987788922, "grad_norm": 0.5, "learning_rate": 4.691935877523599e-06, "loss": 0.5813844203948975, "mean_token_accuracy": 0.8313001070171595, "num_tokens": 8432448.0, "step": 1850 }, { "entropy": 0.765664404258132, "epoch": 0.17538690020155348, "grad_norm": 0.431640625, "learning_rate": 4.688030578345034e-06, "loss": 0.6016036033630371, "mean_token_accuracy": 0.7821066498756408, "num_tokens": 8471681.0, "step": 1860 }, { "entropy": 0.6680231470614671, "epoch": 0.17632984052521777, "grad_norm": 0.310546875, "learning_rate": 4.684102327761061e-06, "loss": 0.5228953838348389, "mean_token_accuracy": 0.8138258129358291, "num_tokens": 8520363.0, "step": 1870 }, { "entropy": 0.6410453176125884, "epoch": 0.17727278084888204, "grad_norm": 0.275390625, "learning_rate": 4.680151166977168e-06, "loss": 0.48765125274658205, "mean_token_accuracy": 0.8131914135068655, "num_tokens": 8576421.0, "step": 1880 }, { "entropy": 0.7159248681738972, "epoch": 0.1782157211725463, "grad_norm": 0.75390625, "learning_rate": 4.676177137439164e-06, "loss": 0.6111386299133301, "mean_token_accuracy": 0.8026338141411543, "num_tokens": 8617811.0, "step": 1890 }, { "entropy": 0.6831275760196149, "epoch": 0.17915866149621057, "grad_norm": 0.431640625, "learning_rate": 4.672180280832738e-06, "loss": 0.6701952457427979, "mean_token_accuracy": 0.8077144119888544, "num_tokens": 8660752.0, "step": 1900 }, { "entropy": 0.7076569891534745, "epoch": 0.18010160181987483, "grad_norm": 0.46484375, "learning_rate": 4.668160639083023e-06, "loss": 0.558572244644165, "mean_token_accuracy": 0.7995935019105673, "num_tokens": 8704690.0, "step": 1910 }, { "entropy": 0.7884954256005585, "epoch": 0.1810445421435391, "grad_norm": 0.5625, "learning_rate": 4.664118254354161e-06, "loss": 0.8152592658996582, "mean_token_accuracy": 0.7849799519404769, "num_tokens": 8745623.0, "step": 1920 }, { "entropy": 0.6273317654151469, "epoch": 0.18198748246720337, "grad_norm": 0.439453125, "learning_rate": 4.660053169048854e-06, "loss": 0.6315245628356934, "mean_token_accuracy": 0.8183496780693531, "num_tokens": 8785116.0, "step": 1930 }, { "entropy": 0.7881477686576546, "epoch": 0.18293042279086763, "grad_norm": 0.8515625, "learning_rate": 4.655965425807922e-06, "loss": 0.5719914436340332, "mean_token_accuracy": 0.8004025777801871, "num_tokens": 8829949.0, "step": 1940 }, { "entropy": 0.6546398317441344, "epoch": 0.1838733631145319, "grad_norm": 0.71875, "learning_rate": 4.65185506750986e-06, "loss": 0.6368934154510498, "mean_token_accuracy": 0.8093210918828845, "num_tokens": 8886640.0, "step": 1950 }, { "entropy": 0.7569531903602182, "epoch": 0.18481630343819616, "grad_norm": 0.333984375, "learning_rate": 4.6477221372703786e-06, "loss": 0.6742706298828125, "mean_token_accuracy": 0.779875087365508, "num_tokens": 8940559.0, "step": 1960 }, { "entropy": 0.7066563277505338, "epoch": 0.18575924376186043, "grad_norm": 0.87109375, "learning_rate": 4.643566678441963e-06, "loss": 0.4545194149017334, "mean_token_accuracy": 0.816070344671607, "num_tokens": 8982660.0, "step": 1970 }, { "entropy": 0.7758723221253604, "epoch": 0.1867021840855247, "grad_norm": 0.77734375, "learning_rate": 4.639388734613408e-06, "loss": 0.6822866439819336, "mean_token_accuracy": 0.7878825765103101, "num_tokens": 9022533.0, "step": 1980 }, { "entropy": 0.6788542723283172, "epoch": 0.18764512440918896, "grad_norm": 0.62890625, "learning_rate": 4.635188349609368e-06, "loss": 0.6392297744750977, "mean_token_accuracy": 0.7984015457332134, "num_tokens": 9076424.0, "step": 1990 }, { "entropy": 0.7143436720129103, "epoch": 0.18858806473285322, "grad_norm": 0.376953125, "learning_rate": 4.630965567489895e-06, "loss": 0.6579510688781738, "mean_token_accuracy": 0.8013661563396454, "num_tokens": 9121745.0, "step": 2000 }, { "entropy": 0.6926486367359758, "epoch": 0.1895310050565175, "grad_norm": 0.8984375, "learning_rate": 4.626720432549975e-06, "loss": 0.8323287010192871, "mean_token_accuracy": 0.8196912448853254, "num_tokens": 9161355.0, "step": 2010 }, { "entropy": 0.7443779086694121, "epoch": 0.19047394538018175, "grad_norm": 0.60546875, "learning_rate": 4.622452989319064e-06, "loss": 0.6473805427551269, "mean_token_accuracy": 0.7991336258128285, "num_tokens": 9198309.0, "step": 2020 }, { "entropy": 0.666377074457705, "epoch": 0.19141688570384602, "grad_norm": 0.71875, "learning_rate": 4.618163282560621e-06, "loss": 0.5878519535064697, "mean_token_accuracy": 0.8124156523495912, "num_tokens": 9242770.0, "step": 2030 }, { "entropy": 0.726883088517934, "epoch": 0.19235982602751028, "grad_norm": 0.376953125, "learning_rate": 4.613851357271644e-06, "loss": 0.6642287731170654, "mean_token_accuracy": 0.8055625781416893, "num_tokens": 9289160.0, "step": 2040 }, { "entropy": 0.6223044098354876, "epoch": 0.19330276635117455, "grad_norm": 0.28515625, "learning_rate": 4.6095172586821845e-06, "loss": 0.5843603134155273, "mean_token_accuracy": 0.8251405648887158, "num_tokens": 9336075.0, "step": 2050 }, { "entropy": 0.5912350189872086, "epoch": 0.19424570667483881, "grad_norm": 0.427734375, "learning_rate": 4.605161032254889e-06, "loss": 0.49378104209899903, "mean_token_accuracy": 0.8227537497878075, "num_tokens": 9380863.0, "step": 2060 }, { "entropy": 0.8942209580913186, "epoch": 0.19518864699850308, "grad_norm": 0.72265625, "learning_rate": 4.6007827236845095e-06, "loss": 0.7838969230651855, "mean_token_accuracy": 0.7667118087410927, "num_tokens": 9426134.0, "step": 2070 }, { "entropy": 0.7779933417215943, "epoch": 0.19613158732216734, "grad_norm": 0.380859375, "learning_rate": 4.596382378897431e-06, "loss": 0.6452385902404785, "mean_token_accuracy": 0.8011699549853801, "num_tokens": 9468075.0, "step": 2080 }, { "entropy": 0.6786517933011055, "epoch": 0.1970745276458316, "grad_norm": 0.7578125, "learning_rate": 4.59196004405119e-06, "loss": 0.46638927459716795, "mean_token_accuracy": 0.7987587995827198, "num_tokens": 9510000.0, "step": 2090 }, { "entropy": 0.6716505272313953, "epoch": 0.19801746796949588, "grad_norm": 0.57421875, "learning_rate": 4.587515765533985e-06, "loss": 0.5990314960479737, "mean_token_accuracy": 0.8237005785107613, "num_tokens": 9553054.0, "step": 2100 }, { "entropy": 0.6282524673268199, "epoch": 0.19896040829316014, "grad_norm": 0.3828125, "learning_rate": 4.583049589964196e-06, "loss": 0.6849035263061524, "mean_token_accuracy": 0.8318673394620418, "num_tokens": 9599290.0, "step": 2110 }, { "entropy": 0.7072675415314734, "epoch": 0.1999033486168244, "grad_norm": 0.298828125, "learning_rate": 4.578561564189889e-06, "loss": 0.5846244335174561, "mean_token_accuracy": 0.8056545812636614, "num_tokens": 9644669.0, "step": 2120 }, { "entropy": 0.6512570422142744, "epoch": 0.20084628894048867, "grad_norm": 0.369140625, "learning_rate": 4.574051735288333e-06, "loss": 0.624661922454834, "mean_token_accuracy": 0.8112033154815436, "num_tokens": 9685527.0, "step": 2130 }, { "entropy": 0.7499742574989796, "epoch": 0.20178922926415294, "grad_norm": 0.61328125, "learning_rate": 4.5695201505654975e-06, "loss": 0.7735828876495361, "mean_token_accuracy": 0.7932566996663809, "num_tokens": 9736026.0, "step": 2140 }, { "entropy": 0.7998500057496131, "epoch": 0.2027321695878172, "grad_norm": 0.375, "learning_rate": 4.564966857555563e-06, "loss": 0.6731950759887695, "mean_token_accuracy": 0.781569967418909, "num_tokens": 9780068.0, "step": 2150 }, { "entropy": 0.7340394101105631, "epoch": 0.20367510991148147, "grad_norm": 0.37109375, "learning_rate": 4.5603919040204184e-06, "loss": 0.5938757419586181, "mean_token_accuracy": 0.8104211119934916, "num_tokens": 9833844.0, "step": 2160 }, { "entropy": 0.6916491713374853, "epoch": 0.20461805023514573, "grad_norm": 0.70703125, "learning_rate": 4.5557953379491605e-06, "loss": 0.6073223114013672, "mean_token_accuracy": 0.8175125665962696, "num_tokens": 9876964.0, "step": 2170 }, { "entropy": 0.7052072752267122, "epoch": 0.20556099055881, "grad_norm": 0.609375, "learning_rate": 4.551177207557593e-06, "loss": 0.5360385417938233, "mean_token_accuracy": 0.8053067337721587, "num_tokens": 9917699.0, "step": 2180 }, { "entropy": 0.7037679905071854, "epoch": 0.20650393088247426, "grad_norm": 0.423828125, "learning_rate": 4.546537561287719e-06, "loss": 0.629872179031372, "mean_token_accuracy": 0.8012799389660359, "num_tokens": 9964393.0, "step": 2190 }, { "entropy": 0.6786779332906008, "epoch": 0.20744687120613853, "grad_norm": 0.94921875, "learning_rate": 4.541876447807233e-06, "loss": 0.5202005863189697, "mean_token_accuracy": 0.827208873257041, "num_tokens": 10009889.0, "step": 2200 }, { "entropy": 0.7257618294097483, "epoch": 0.20838981152980282, "grad_norm": 0.57421875, "learning_rate": 4.537193916009007e-06, "loss": 0.6309995174407959, "mean_token_accuracy": 0.7956688452512026, "num_tokens": 10062058.0, "step": 2210 }, { "entropy": 0.6472949480637908, "epoch": 0.2093327518534671, "grad_norm": 0.50390625, "learning_rate": 4.532490015010586e-06, "loss": 0.5185285568237304, "mean_token_accuracy": 0.8208729565143585, "num_tokens": 10114150.0, "step": 2220 }, { "entropy": 0.7547943496145308, "epoch": 0.21027569217713135, "grad_norm": 0.291015625, "learning_rate": 4.527764794153666e-06, "loss": 0.6795809745788575, "mean_token_accuracy": 0.7977238070219755, "num_tokens": 10171445.0, "step": 2230 }, { "entropy": 0.6034223964437843, "epoch": 0.21121863250079562, "grad_norm": 0.31640625, "learning_rate": 4.523018303003577e-06, "loss": 0.5290133953094482, "mean_token_accuracy": 0.8266872577369213, "num_tokens": 10228018.0, "step": 2240 }, { "entropy": 0.7052829279564321, "epoch": 0.21216157282445988, "grad_norm": 0.392578125, "learning_rate": 4.518250591348765e-06, "loss": 0.5237616539001465, "mean_token_accuracy": 0.819525421410799, "num_tokens": 10271175.0, "step": 2250 }, { "entropy": 0.7076565511059016, "epoch": 0.21310451314812415, "grad_norm": 0.52734375, "learning_rate": 4.513461709200269e-06, "loss": 0.6286019802093505, "mean_token_accuracy": 0.8029639679938555, "num_tokens": 10323637.0, "step": 2260 }, { "entropy": 0.612759631825611, "epoch": 0.2140474534717884, "grad_norm": 0.322265625, "learning_rate": 4.508651706791199e-06, "loss": 0.6475212097167968, "mean_token_accuracy": 0.8325118262320756, "num_tokens": 10371700.0, "step": 2270 }, { "entropy": 0.7420009043999016, "epoch": 0.21499039379545268, "grad_norm": 0.640625, "learning_rate": 4.5038206345762e-06, "loss": 0.7298381328582764, "mean_token_accuracy": 0.7833721118047834, "num_tokens": 10417361.0, "step": 2280 }, { "entropy": 0.6522927849553526, "epoch": 0.21593333411911694, "grad_norm": 0.2578125, "learning_rate": 4.498968543230937e-06, "loss": 0.5515638828277588, "mean_token_accuracy": 0.8166045229882002, "num_tokens": 10467913.0, "step": 2290 }, { "entropy": 0.6916065049357712, "epoch": 0.2168762744427812, "grad_norm": 0.333984375, "learning_rate": 4.49409548365155e-06, "loss": 0.6021734714508057, "mean_token_accuracy": 0.8119091907516122, "num_tokens": 10518853.0, "step": 2300 }, { "entropy": 0.6611153034493327, "epoch": 0.21781921476644547, "grad_norm": 0.546875, "learning_rate": 4.48920150695413e-06, "loss": 0.5773680210113525, "mean_token_accuracy": 0.8194341376423836, "num_tokens": 10564495.0, "step": 2310 }, { "entropy": 0.8297945160302334, "epoch": 0.21876215509010974, "grad_norm": 0.462890625, "learning_rate": 4.484286664474177e-06, "loss": 0.6902072906494141, "mean_token_accuracy": 0.7996103055775166, "num_tokens": 10610647.0, "step": 2320 }, { "entropy": 0.6553996685659513, "epoch": 0.219705095413774, "grad_norm": 0.3359375, "learning_rate": 4.479351007766061e-06, "loss": 0.5572136402130127, "mean_token_accuracy": 0.7971479788422584, "num_tokens": 10663483.0, "step": 2330 }, { "entropy": 0.6963181391358375, "epoch": 0.22064803573743827, "grad_norm": 0.59765625, "learning_rate": 4.474394588602486e-06, "loss": 0.5790410995483398, "mean_token_accuracy": 0.8045560229569674, "num_tokens": 10710250.0, "step": 2340 }, { "entropy": 0.8422877897508443, "epoch": 0.22159097606110253, "grad_norm": 0.419921875, "learning_rate": 4.469417458973945e-06, "loss": 0.627861499786377, "mean_token_accuracy": 0.7863189570605755, "num_tokens": 10753271.0, "step": 2350 }, { "entropy": 0.6823558527044952, "epoch": 0.2225339163847668, "grad_norm": 0.41796875, "learning_rate": 4.464419671088171e-06, "loss": 0.6231525421142579, "mean_token_accuracy": 0.8063728950917721, "num_tokens": 10803990.0, "step": 2360 }, { "entropy": 0.7730052729602903, "epoch": 0.22347685670843107, "grad_norm": 0.515625, "learning_rate": 4.459401277369595e-06, "loss": 0.622228479385376, "mean_token_accuracy": 0.7853727921843529, "num_tokens": 10854008.0, "step": 2370 }, { "entropy": 0.7397545983083547, "epoch": 0.22441979703209533, "grad_norm": 0.5546875, "learning_rate": 4.454362330458792e-06, "loss": 0.7059813022613526, "mean_token_accuracy": 0.8041706055402755, "num_tokens": 10899375.0, "step": 2380 }, { "entropy": 0.8144816821441054, "epoch": 0.2253627373557596, "grad_norm": 0.427734375, "learning_rate": 4.44930288321193e-06, "loss": 0.5797255992889404, "mean_token_accuracy": 0.7836383230984211, "num_tokens": 10950366.0, "step": 2390 }, { "entropy": 0.6395042231306434, "epoch": 0.22630567767942386, "grad_norm": 0.66015625, "learning_rate": 4.444222988700217e-06, "loss": 0.526540470123291, "mean_token_accuracy": 0.8213209711015225, "num_tokens": 10997043.0, "step": 2400 }, { "entropy": 0.7632207646034658, "epoch": 0.22724861800308813, "grad_norm": 0.408203125, "learning_rate": 4.439122700209344e-06, "loss": 0.4208627223968506, "mean_token_accuracy": 0.8001706589013338, "num_tokens": 11040050.0, "step": 2410 }, { "entropy": 0.7518241555429995, "epoch": 0.2281915583267524, "grad_norm": 0.59765625, "learning_rate": 4.434002071238923e-06, "loss": 0.6388368129730224, "mean_token_accuracy": 0.7935513414442539, "num_tokens": 11085047.0, "step": 2420 }, { "entropy": 0.6688132929615677, "epoch": 0.22913449865041666, "grad_norm": 0.32421875, "learning_rate": 4.428861155501929e-06, "loss": 0.546387767791748, "mean_token_accuracy": 0.820703661069274, "num_tokens": 11129247.0, "step": 2430 }, { "entropy": 0.7079487937502563, "epoch": 0.23007743897408092, "grad_norm": 0.4921875, "learning_rate": 4.423700006924134e-06, "loss": 0.6248188495635987, "mean_token_accuracy": 0.8046429224312306, "num_tokens": 11184873.0, "step": 2440 }, { "entropy": 0.6818896850571037, "epoch": 0.2310203792977452, "grad_norm": 0.57421875, "learning_rate": 4.418518679643547e-06, "loss": 0.5705044746398926, "mean_token_accuracy": 0.8065329402685165, "num_tokens": 11224860.0, "step": 2450 }, { "entropy": 0.7125477872788906, "epoch": 0.23196331962140945, "grad_norm": 0.4375, "learning_rate": 4.4133172280098366e-06, "loss": 0.6023592472076416, "mean_token_accuracy": 0.7931496508419513, "num_tokens": 11273062.0, "step": 2460 }, { "entropy": 0.8268242001533508, "epoch": 0.23290625994507372, "grad_norm": 0.65625, "learning_rate": 4.4080957065837705e-06, "loss": 0.5537054061889648, "mean_token_accuracy": 0.7920439690351486, "num_tokens": 11315820.0, "step": 2470 }, { "entropy": 0.6495694993063807, "epoch": 0.23384920026873798, "grad_norm": 0.4375, "learning_rate": 4.402854170136638e-06, "loss": 0.5979690074920654, "mean_token_accuracy": 0.8214081518352032, "num_tokens": 11365181.0, "step": 2480 }, { "entropy": 0.6780490770936012, "epoch": 0.23479214059240225, "grad_norm": 0.42578125, "learning_rate": 4.397592673649675e-06, "loss": 0.5484375476837158, "mean_token_accuracy": 0.8182380983605981, "num_tokens": 11411595.0, "step": 2490 }, { "entropy": 0.6635444098617882, "epoch": 0.23573508091606651, "grad_norm": 0.37890625, "learning_rate": 4.3923112723134925e-06, "loss": 0.5475056171417236, "mean_token_accuracy": 0.8106115475296974, "num_tokens": 11457001.0, "step": 2500 }, { "entropy": 0.5945799764245748, "epoch": 0.23667802123973078, "grad_norm": 0.2255859375, "learning_rate": 4.387010021527489e-06, "loss": 0.5004089832305908, "mean_token_accuracy": 0.8270149566233158, "num_tokens": 11507578.0, "step": 2510 }, { "entropy": 0.7172031537629664, "epoch": 0.23762096156339504, "grad_norm": 0.416015625, "learning_rate": 4.381688976899278e-06, "loss": 0.570509958267212, "mean_token_accuracy": 0.7985255815088749, "num_tokens": 11559582.0, "step": 2520 }, { "entropy": 0.6814393433742225, "epoch": 0.2385639018870593, "grad_norm": 0.67578125, "learning_rate": 4.376348194244098e-06, "loss": 0.5488054275512695, "mean_token_accuracy": 0.8171292833983899, "num_tokens": 11601800.0, "step": 2530 }, { "entropy": 0.6187633796595037, "epoch": 0.23950684221072358, "grad_norm": 0.37109375, "learning_rate": 4.370987729584233e-06, "loss": 0.528061056137085, "mean_token_accuracy": 0.8176171716302634, "num_tokens": 11645914.0, "step": 2540 }, { "entropy": 0.7502338518388569, "epoch": 0.24044978253438787, "grad_norm": 0.75, "learning_rate": 4.365607639148422e-06, "loss": 0.6851604461669922, "mean_token_accuracy": 0.8080096576362849, "num_tokens": 11685949.0, "step": 2550 }, { "entropy": 0.7071651536040008, "epoch": 0.24139272285805213, "grad_norm": 0.5546875, "learning_rate": 4.360207979371266e-06, "loss": 0.6052841663360595, "mean_token_accuracy": 0.8076611422002316, "num_tokens": 11733467.0, "step": 2560 }, { "entropy": 0.8098411624319851, "epoch": 0.2423356631817164, "grad_norm": 0.494140625, "learning_rate": 4.354788806892641e-06, "loss": 0.5459568500518799, "mean_token_accuracy": 0.7838873576372862, "num_tokens": 11778901.0, "step": 2570 }, { "entropy": 0.6692146965302527, "epoch": 0.24327860350538066, "grad_norm": 0.35546875, "learning_rate": 4.3493501785571034e-06, "loss": 0.7700508117675782, "mean_token_accuracy": 0.82504887804389, "num_tokens": 11818887.0, "step": 2580 }, { "entropy": 0.6426164032891393, "epoch": 0.24422154382904493, "grad_norm": 0.33984375, "learning_rate": 4.34389215141329e-06, "loss": 0.4979496955871582, "mean_token_accuracy": 0.8184706576168537, "num_tokens": 11864058.0, "step": 2590 }, { "entropy": 0.7097076333360747, "epoch": 0.2451644841527092, "grad_norm": 0.45703125, "learning_rate": 4.338414782713322e-06, "loss": 0.5226698875427246, "mean_token_accuracy": 0.8021728150546551, "num_tokens": 11911890.0, "step": 2600 }, { "entropy": 0.7304733860772104, "epoch": 0.24610742447637346, "grad_norm": 0.416015625, "learning_rate": 4.332918129912208e-06, "loss": 0.7039321422576904, "mean_token_accuracy": 0.7967918623238802, "num_tokens": 11955745.0, "step": 2610 }, { "entropy": 0.6977716976776719, "epoch": 0.24705036480003773, "grad_norm": 0.7578125, "learning_rate": 4.327402250667233e-06, "loss": 0.5292267322540283, "mean_token_accuracy": 0.8004238706082105, "num_tokens": 11994942.0, "step": 2620 }, { "entropy": 0.7422330360859632, "epoch": 0.247993305123702, "grad_norm": 0.5390625, "learning_rate": 4.321867202837359e-06, "loss": 0.6598591327667236, "mean_token_accuracy": 0.793621858395636, "num_tokens": 12040970.0, "step": 2630 }, { "entropy": 0.6614692817442119, "epoch": 0.24893624544736626, "grad_norm": 0.349609375, "learning_rate": 4.316313044482621e-06, "loss": 0.4676491737365723, "mean_token_accuracy": 0.8118173565715552, "num_tokens": 12095644.0, "step": 2640 }, { "entropy": 0.7872744291671552, "epoch": 0.24987918577103052, "grad_norm": 0.41015625, "learning_rate": 4.31073983386351e-06, "loss": 0.7802893161773682, "mean_token_accuracy": 0.7734283555299044, "num_tokens": 12147287.0, "step": 2650 }, { "entropy": 0.6264273500069976, "epoch": 0.2508221260946948, "grad_norm": 0.4375, "learning_rate": 4.30514762944037e-06, "loss": 0.5711867809295654, "mean_token_accuracy": 0.8230541836470365, "num_tokens": 12191134.0, "step": 2660 }, { "entropy": 0.642601250205189, "epoch": 0.25176506641835905, "grad_norm": 0.203125, "learning_rate": 4.299536489872778e-06, "loss": 0.41927399635314944, "mean_token_accuracy": 0.8300650017336011, "num_tokens": 12244587.0, "step": 2670 }, { "entropy": 0.7999465940054507, "epoch": 0.2527080067420233, "grad_norm": 0.53125, "learning_rate": 4.293906474018933e-06, "loss": 0.6219149589538574, "mean_token_accuracy": 0.7740768680348993, "num_tokens": 12292442.0, "step": 2680 }, { "entropy": 0.6853533301036805, "epoch": 0.2536509470656876, "grad_norm": 0.400390625, "learning_rate": 4.288257640935038e-06, "loss": 0.5230690479278565, "mean_token_accuracy": 0.8064401123672724, "num_tokens": 12332055.0, "step": 2690 }, { "entropy": 0.6050175254698843, "epoch": 0.25459388738935185, "grad_norm": 0.302734375, "learning_rate": 4.282590049874678e-06, "loss": 0.5386334419250488, "mean_token_accuracy": 0.8066453229635954, "num_tokens": 12377897.0, "step": 2700 }, { "entropy": 0.6740714994259178, "epoch": 0.2555368277130161, "grad_norm": 0.1845703125, "learning_rate": 4.276903760288202e-06, "loss": 0.4890268325805664, "mean_token_accuracy": 0.8237885976210236, "num_tokens": 12422796.0, "step": 2710 }, { "entropy": 0.6965341650880873, "epoch": 0.2564797680366804, "grad_norm": 0.62109375, "learning_rate": 4.271198831822097e-06, "loss": 0.7352762699127198, "mean_token_accuracy": 0.7847994826734066, "num_tokens": 12467865.0, "step": 2720 }, { "entropy": 0.6212398945353925, "epoch": 0.25742270836034464, "grad_norm": 0.45703125, "learning_rate": 4.265475324318362e-06, "loss": 0.5328194618225097, "mean_token_accuracy": 0.8315907616168261, "num_tokens": 12512975.0, "step": 2730 }, { "entropy": 0.693923706561327, "epoch": 0.2583656486840089, "grad_norm": 0.59765625, "learning_rate": 4.259733297813885e-06, "loss": 0.5941354274749756, "mean_token_accuracy": 0.8204266559332609, "num_tokens": 12555479.0, "step": 2740 }, { "entropy": 0.8046634275466203, "epoch": 0.2593085890076732, "grad_norm": 0.5625, "learning_rate": 4.253972812539805e-06, "loss": 0.7706850528717041, "mean_token_accuracy": 0.7917935982346535, "num_tokens": 12601319.0, "step": 2750 }, { "entropy": 0.7471866227686406, "epoch": 0.26025152933133744, "grad_norm": 0.40625, "learning_rate": 4.248193928920886e-06, "loss": 0.710187292098999, "mean_token_accuracy": 0.7990452691912651, "num_tokens": 12658000.0, "step": 2760 }, { "entropy": 0.6626139220781624, "epoch": 0.2611944696550017, "grad_norm": 0.25, "learning_rate": 4.242396707574885e-06, "loss": 0.48251981735229493, "mean_token_accuracy": 0.8196328468620777, "num_tokens": 12707975.0, "step": 2770 }, { "entropy": 0.6553014845587313, "epoch": 0.26213740997866597, "grad_norm": 0.5625, "learning_rate": 4.236581209311909e-06, "loss": 0.5507401466369629, "mean_token_accuracy": 0.8160292755812406, "num_tokens": 12753527.0, "step": 2780 }, { "entropy": 0.622153397090733, "epoch": 0.26308035030233023, "grad_norm": 0.412109375, "learning_rate": 4.230747495133784e-06, "loss": 0.5054684162139893, "mean_token_accuracy": 0.8228756669908762, "num_tokens": 12809632.0, "step": 2790 }, { "entropy": 0.6780139476060867, "epoch": 0.2640232906259945, "grad_norm": 0.52734375, "learning_rate": 4.224895626233409e-06, "loss": 0.8137707710266113, "mean_token_accuracy": 0.8064680024981499, "num_tokens": 12852804.0, "step": 2800 }, { "entropy": 0.7678300259634853, "epoch": 0.26496623094965877, "grad_norm": 0.408203125, "learning_rate": 4.219025663994123e-06, "loss": 0.7762890815734863, "mean_token_accuracy": 0.7923290681093931, "num_tokens": 12902399.0, "step": 2810 }, { "entropy": 0.5841752365231514, "epoch": 0.26590917127332303, "grad_norm": 0.404296875, "learning_rate": 4.21313766998905e-06, "loss": 0.4339454174041748, "mean_token_accuracy": 0.8222315371036529, "num_tokens": 12945895.0, "step": 2820 }, { "entropy": 0.6883633114397526, "epoch": 0.2668521115969873, "grad_norm": 0.51953125, "learning_rate": 4.207231705980461e-06, "loss": 0.7140939235687256, "mean_token_accuracy": 0.8142529975622892, "num_tokens": 12992305.0, "step": 2830 }, { "entropy": 0.7407352829352021, "epoch": 0.26779505192065156, "grad_norm": 0.25, "learning_rate": 4.201307833919126e-06, "loss": 0.6346509456634521, "mean_token_accuracy": 0.7989520721137524, "num_tokens": 13041575.0, "step": 2840 }, { "entropy": 0.714037418179214, "epoch": 0.2687379922443158, "grad_norm": 0.7890625, "learning_rate": 4.195366115943657e-06, "loss": 0.6052238464355468, "mean_token_accuracy": 0.799788748472929, "num_tokens": 13083778.0, "step": 2850 }, { "entropy": 0.8210464440286159, "epoch": 0.2696809325679801, "grad_norm": 0.384765625, "learning_rate": 4.189406614379865e-06, "loss": 0.6140337944030761, "mean_token_accuracy": 0.7797987915575504, "num_tokens": 13136468.0, "step": 2860 }, { "entropy": 0.715034647192806, "epoch": 0.27062387289164436, "grad_norm": 0.24609375, "learning_rate": 4.183429391740103e-06, "loss": 0.6325907707214355, "mean_token_accuracy": 0.7957759384065867, "num_tokens": 13190907.0, "step": 2870 }, { "entropy": 0.6897853550501167, "epoch": 0.2715668132153086, "grad_norm": 1.0390625, "learning_rate": 4.177434510722605e-06, "loss": 0.6110557556152344, "mean_token_accuracy": 0.81325623691082, "num_tokens": 13231284.0, "step": 2880 }, { "entropy": 0.6753826588392258, "epoch": 0.2725097535389729, "grad_norm": 0.38671875, "learning_rate": 4.171422034210839e-06, "loss": 0.4948280334472656, "mean_token_accuracy": 0.8051031611859798, "num_tokens": 13277819.0, "step": 2890 }, { "entropy": 0.739368848875165, "epoch": 0.27345269386263715, "grad_norm": 0.48828125, "learning_rate": 4.165392025272836e-06, "loss": 0.641120195388794, "mean_token_accuracy": 0.7944438774138689, "num_tokens": 13319933.0, "step": 2900 }, { "entropy": 0.7141495368443429, "epoch": 0.2743956341863014, "grad_norm": 0.671875, "learning_rate": 4.159344547160539e-06, "loss": 0.6336250305175781, "mean_token_accuracy": 0.8012420143932104, "num_tokens": 13357614.0, "step": 2910 }, { "entropy": 0.5666716417297721, "epoch": 0.2753385745099657, "grad_norm": 0.458984375, "learning_rate": 4.15327966330913e-06, "loss": 0.4592881679534912, "mean_token_accuracy": 0.833888939768076, "num_tokens": 13412982.0, "step": 2920 }, { "entropy": 0.7603326801676303, "epoch": 0.27628151483362995, "grad_norm": 0.48046875, "learning_rate": 4.147197437336372e-06, "loss": 0.6861026763916016, "mean_token_accuracy": 0.7918042603880167, "num_tokens": 13455286.0, "step": 2930 }, { "entropy": 0.8255054540932178, "epoch": 0.2772244551572942, "grad_norm": 0.55078125, "learning_rate": 4.141097933041936e-06, "loss": 0.6968491077423096, "mean_token_accuracy": 0.7748916573822499, "num_tokens": 13496973.0, "step": 2940 }, { "entropy": 0.7764521720819175, "epoch": 0.2781673954809585, "grad_norm": 0.3828125, "learning_rate": 4.134981214406737e-06, "loss": 0.4818326473236084, "mean_token_accuracy": 0.7867025479674339, "num_tokens": 13547249.0, "step": 2950 }, { "entropy": 0.7108894733712077, "epoch": 0.27911033580462274, "grad_norm": 0.35546875, "learning_rate": 4.1288473455922584e-06, "loss": 0.5785073280334473, "mean_token_accuracy": 0.8074256978929043, "num_tokens": 13592148.0, "step": 2960 }, { "entropy": 0.7593025027774274, "epoch": 0.280053276128287, "grad_norm": 0.408203125, "learning_rate": 4.122696390939882e-06, "loss": 0.7499773025512695, "mean_token_accuracy": 0.7877199437469244, "num_tokens": 13643977.0, "step": 2970 }, { "entropy": 0.763703981693834, "epoch": 0.2809962164519513, "grad_norm": 0.267578125, "learning_rate": 4.116528414970211e-06, "loss": 0.6026920318603516, "mean_token_accuracy": 0.7880954163148999, "num_tokens": 13686759.0, "step": 2980 }, { "entropy": 0.6860854076221585, "epoch": 0.28193915677561554, "grad_norm": 0.412109375, "learning_rate": 4.110343482382396e-06, "loss": 0.5413653373718261, "mean_token_accuracy": 0.8145212274044752, "num_tokens": 13731883.0, "step": 2990 }, { "entropy": 0.7460825649090111, "epoch": 0.2828820970992798, "grad_norm": 0.84765625, "learning_rate": 4.104141658053451e-06, "loss": 0.7144715785980225, "mean_token_accuracy": 0.7957971028983593, "num_tokens": 13780640.0, "step": 3000 }, { "entropy": 0.8326621399261057, "epoch": 0.28382503742294407, "grad_norm": 0.486328125, "learning_rate": 4.097923007037581e-06, "loss": 0.9063180923461914, "mean_token_accuracy": 0.7649697538465261, "num_tokens": 13815992.0, "step": 3010 }, { "entropy": 0.9316485294606537, "epoch": 0.28476797774660834, "grad_norm": 0.60546875, "learning_rate": 4.09168759456549e-06, "loss": 0.8332127571105957, "mean_token_accuracy": 0.757191539555788, "num_tokens": 13862295.0, "step": 3020 }, { "entropy": 0.7256421025842428, "epoch": 0.2857109180702726, "grad_norm": 0.78125, "learning_rate": 4.085435486043706e-06, "loss": 0.7105655193328857, "mean_token_accuracy": 0.80562147423625, "num_tokens": 13911028.0, "step": 3030 }, { "entropy": 0.7599948160350323, "epoch": 0.28665385839393687, "grad_norm": 0.828125, "learning_rate": 4.0791667470538895e-06, "loss": 0.6686043739318848, "mean_token_accuracy": 0.7909170279279352, "num_tokens": 13964127.0, "step": 3040 }, { "entropy": 0.8010038698092103, "epoch": 0.2875967987176012, "grad_norm": 0.421875, "learning_rate": 4.072881443352144e-06, "loss": 0.6279882907867431, "mean_token_accuracy": 0.78184520509094, "num_tokens": 14009502.0, "step": 3050 }, { "entropy": 0.6282306860201061, "epoch": 0.28853973904126545, "grad_norm": 0.50390625, "learning_rate": 4.0665796408683324e-06, "loss": 0.6266475677490234, "mean_token_accuracy": 0.8261493802070617, "num_tokens": 14054200.0, "step": 3060 }, { "entropy": 0.6563035418046639, "epoch": 0.2894826793649297, "grad_norm": 0.671875, "learning_rate": 4.0602614057053815e-06, "loss": 0.5960610866546631, "mean_token_accuracy": 0.8131377577781678, "num_tokens": 14104808.0, "step": 3070 }, { "entropy": 0.7352710378356277, "epoch": 0.290425619688594, "grad_norm": 0.42578125, "learning_rate": 4.053926804138588e-06, "loss": 0.6611281394958496, "mean_token_accuracy": 0.8034013140946626, "num_tokens": 14148483.0, "step": 3080 }, { "entropy": 0.6457099332474172, "epoch": 0.29136856001225825, "grad_norm": 0.2578125, "learning_rate": 4.047575902614924e-06, "loss": 0.6730895042419434, "mean_token_accuracy": 0.8202265679836274, "num_tokens": 14211134.0, "step": 3090 }, { "entropy": 0.6713374426588417, "epoch": 0.2923115003359225, "grad_norm": 0.291015625, "learning_rate": 4.041208767752341e-06, "loss": 0.5431832790374755, "mean_token_accuracy": 0.815386663377285, "num_tokens": 14255091.0, "step": 3100 }, { "entropy": 0.734676618874073, "epoch": 0.2932544406595868, "grad_norm": 0.2353515625, "learning_rate": 4.034825466339073e-06, "loss": 0.5647121906280518, "mean_token_accuracy": 0.8160567294806242, "num_tokens": 14301274.0, "step": 3110 }, { "entropy": 0.6874036092311144, "epoch": 0.29419738098325104, "grad_norm": 0.5546875, "learning_rate": 4.02842606533293e-06, "loss": 0.5496022701263428, "mean_token_accuracy": 0.8137231681495904, "num_tokens": 14342896.0, "step": 3120 }, { "entropy": 0.6659715895075351, "epoch": 0.2951403213069153, "grad_norm": 0.291015625, "learning_rate": 4.0220106318606e-06, "loss": 0.5480599880218506, "mean_token_accuracy": 0.8109877597540617, "num_tokens": 14386650.0, "step": 3130 }, { "entropy": 0.9152347665280104, "epoch": 0.2960832616305796, "grad_norm": 0.421875, "learning_rate": 4.015579233216944e-06, "loss": 0.6289479732513428, "mean_token_accuracy": 0.7669604491442442, "num_tokens": 14432746.0, "step": 3140 }, { "entropy": 0.7302544771693646, "epoch": 0.29702620195424384, "grad_norm": 0.5, "learning_rate": 4.009131936864293e-06, "loss": 0.7106366157531738, "mean_token_accuracy": 0.809479969739914, "num_tokens": 14473027.0, "step": 3150 }, { "entropy": 0.7078684787265956, "epoch": 0.2979691422779081, "grad_norm": 0.318359375, "learning_rate": 4.002668810431733e-06, "loss": 0.4805280685424805, "mean_token_accuracy": 0.8173054194077849, "num_tokens": 14512645.0, "step": 3160 }, { "entropy": 0.6727185323834419, "epoch": 0.29891208260157237, "grad_norm": 0.34375, "learning_rate": 3.9961899217144004e-06, "loss": 0.5752994060516358, "mean_token_accuracy": 0.8104622792452574, "num_tokens": 14556834.0, "step": 3170 }, { "entropy": 0.6954042711295187, "epoch": 0.29985502292523664, "grad_norm": 0.412109375, "learning_rate": 3.989695338672775e-06, "loss": 0.5789048671722412, "mean_token_accuracy": 0.8124545980244875, "num_tokens": 14596491.0, "step": 3180 }, { "entropy": 0.7359610196202994, "epoch": 0.3007979632489009, "grad_norm": 0.5078125, "learning_rate": 3.983185129431959e-06, "loss": 0.5956539630889892, "mean_token_accuracy": 0.7969963911920785, "num_tokens": 14647326.0, "step": 3190 }, { "entropy": 0.6450121255591512, "epoch": 0.30174090357256517, "grad_norm": 0.390625, "learning_rate": 3.976659362280966e-06, "loss": 0.5854204177856446, "mean_token_accuracy": 0.8218308422714472, "num_tokens": 14692466.0, "step": 3200 }, { "entropy": 0.6701277974992991, "epoch": 0.30268384389622943, "grad_norm": 0.318359375, "learning_rate": 3.970118105672006e-06, "loss": 0.6377078533172608, "mean_token_accuracy": 0.8047068595886231, "num_tokens": 14742900.0, "step": 3210 }, { "entropy": 0.7718553693033755, "epoch": 0.3036267842198937, "grad_norm": 1.3125, "learning_rate": 3.963561428219765e-06, "loss": 0.6326769828796387, "mean_token_accuracy": 0.7890255197882652, "num_tokens": 14787852.0, "step": 3220 }, { "entropy": 0.7489314749836922, "epoch": 0.30456972454355796, "grad_norm": 0.51953125, "learning_rate": 3.956989398700687e-06, "loss": 0.7279271602630615, "mean_token_accuracy": 0.7867590818554163, "num_tokens": 14827219.0, "step": 3230 }, { "entropy": 0.7688439194113016, "epoch": 0.30551266486722223, "grad_norm": 0.7734375, "learning_rate": 3.950402086052253e-06, "loss": 0.7808563709259033, "mean_token_accuracy": 0.7964679040014744, "num_tokens": 14869813.0, "step": 3240 }, { "entropy": 0.5645394513383508, "epoch": 0.3064556051908865, "grad_norm": 0.4375, "learning_rate": 3.943799559372254e-06, "loss": 0.5005753993988037, "mean_token_accuracy": 0.8374217573553324, "num_tokens": 14918596.0, "step": 3250 }, { "entropy": 0.7563243569806218, "epoch": 0.30739854551455076, "grad_norm": 0.51171875, "learning_rate": 3.937181887918072e-06, "loss": 0.5691118240356445, "mean_token_accuracy": 0.8011289283633232, "num_tokens": 14954915.0, "step": 3260 }, { "entropy": 0.6726897666230798, "epoch": 0.308341485838215, "grad_norm": 0.62109375, "learning_rate": 3.930549141105948e-06, "loss": 0.5586506366729737, "mean_token_accuracy": 0.8176765486598014, "num_tokens": 15009865.0, "step": 3270 }, { "entropy": 0.7068807984702289, "epoch": 0.3092844261618793, "grad_norm": 0.640625, "learning_rate": 3.923901388510259e-06, "loss": 0.5407650947570801, "mean_token_accuracy": 0.8079414956271649, "num_tokens": 15056586.0, "step": 3280 }, { "entropy": 0.6136560516897589, "epoch": 0.31022736648554355, "grad_norm": 0.376953125, "learning_rate": 3.917238699862782e-06, "loss": 0.522227668762207, "mean_token_accuracy": 0.8270126104354858, "num_tokens": 15098316.0, "step": 3290 }, { "entropy": 0.693851160723716, "epoch": 0.3111703068092078, "grad_norm": 0.58203125, "learning_rate": 3.910561145051969e-06, "loss": 0.5569193840026856, "mean_token_accuracy": 0.816235949471593, "num_tokens": 15140027.0, "step": 3300 }, { "entropy": 0.6663465833291411, "epoch": 0.3121132471328721, "grad_norm": 0.63671875, "learning_rate": 3.903868794122211e-06, "loss": 0.6506803035736084, "mean_token_accuracy": 0.8125866772606969, "num_tokens": 15179813.0, "step": 3310 }, { "entropy": 0.7533382272347808, "epoch": 0.31305618745653635, "grad_norm": 0.51953125, "learning_rate": 3.8971617172731026e-06, "loss": 0.6869213104248046, "mean_token_accuracy": 0.7885122291743756, "num_tokens": 15221550.0, "step": 3320 }, { "entropy": 0.7408904255833477, "epoch": 0.3139991277802006, "grad_norm": 0.267578125, "learning_rate": 3.8904399848587045e-06, "loss": 0.6417848587036132, "mean_token_accuracy": 0.7870474755764008, "num_tokens": 15271012.0, "step": 3330 }, { "entropy": 0.7080091743730008, "epoch": 0.3149420681038649, "grad_norm": 0.423828125, "learning_rate": 3.88370366738681e-06, "loss": 0.5353238582611084, "mean_token_accuracy": 0.7993681333959103, "num_tokens": 15317762.0, "step": 3340 }, { "entropy": 0.7359500544145703, "epoch": 0.31588500842752915, "grad_norm": 0.625, "learning_rate": 3.876952835518202e-06, "loss": 0.7712695121765136, "mean_token_accuracy": 0.7999884054064751, "num_tokens": 15356394.0, "step": 3350 }, { "entropy": 0.636717552319169, "epoch": 0.3168279487511934, "grad_norm": 0.369140625, "learning_rate": 3.870187560065913e-06, "loss": 0.5929419994354248, "mean_token_accuracy": 0.8112790875136853, "num_tokens": 15401554.0, "step": 3360 }, { "entropy": 0.7583870824426413, "epoch": 0.3177708890748577, "grad_norm": 0.3125, "learning_rate": 3.86340791199448e-06, "loss": 0.6758883953094482, "mean_token_accuracy": 0.7855101089924574, "num_tokens": 15449214.0, "step": 3370 }, { "entropy": 0.78564184429124, "epoch": 0.31871382939852194, "grad_norm": 0.55859375, "learning_rate": 3.8566139624192035e-06, "loss": 0.5231400012969971, "mean_token_accuracy": 0.7916332878172397, "num_tokens": 15491898.0, "step": 3380 }, { "entropy": 0.6915111863054335, "epoch": 0.3196567697221862, "grad_norm": 1.8125, "learning_rate": 3.849805782605401e-06, "loss": 0.506642484664917, "mean_token_accuracy": 0.81902342364192, "num_tokens": 15536558.0, "step": 3390 }, { "entropy": 0.7364246053621173, "epoch": 0.3205997100458505, "grad_norm": 0.408203125, "learning_rate": 3.842983443967654e-06, "loss": 0.6232193946838379, "mean_token_accuracy": 0.793385767377913, "num_tokens": 15584969.0, "step": 3400 }, { "entropy": 0.6796113492920994, "epoch": 0.32154265036951474, "grad_norm": 0.4296875, "learning_rate": 3.83614701806907e-06, "loss": 0.5323117733001709, "mean_token_accuracy": 0.7944784520193935, "num_tokens": 15628552.0, "step": 3410 }, { "entropy": 0.5872353835962713, "epoch": 0.322485590693179, "grad_norm": 0.287109375, "learning_rate": 3.8292965766205204e-06, "loss": 0.5037885189056397, "mean_token_accuracy": 0.8266831699758768, "num_tokens": 15684463.0, "step": 3420 }, { "entropy": 0.6443200805224478, "epoch": 0.32342853101684327, "grad_norm": 0.478515625, "learning_rate": 3.822432191479894e-06, "loss": 0.6218739509582519, "mean_token_accuracy": 0.8293004889041186, "num_tokens": 15731478.0, "step": 3430 }, { "entropy": 0.6724415736272931, "epoch": 0.32437147134050753, "grad_norm": 0.482421875, "learning_rate": 3.815553934651342e-06, "loss": 0.49276022911071776, "mean_token_accuracy": 0.8229852892458439, "num_tokens": 15783638.0, "step": 3440 }, { "entropy": 0.8211766470223665, "epoch": 0.3253144116641718, "grad_norm": 0.40234375, "learning_rate": 3.8086618782845265e-06, "loss": 0.7018588542938232, "mean_token_accuracy": 0.7826432820409537, "num_tokens": 15823126.0, "step": 3450 }, { "entropy": 0.6938874244689941, "epoch": 0.32625735198783606, "grad_norm": 0.357421875, "learning_rate": 3.8017560946738557e-06, "loss": 0.6181281089782715, "mean_token_accuracy": 0.8122403334826231, "num_tokens": 15871899.0, "step": 3460 }, { "entropy": 0.7408801101148128, "epoch": 0.32720029231150033, "grad_norm": 0.421875, "learning_rate": 3.7948366562577323e-06, "loss": 0.7769334316253662, "mean_token_accuracy": 0.7820941220968962, "num_tokens": 15917934.0, "step": 3470 }, { "entropy": 0.7755114403553307, "epoch": 0.3281432326351646, "grad_norm": 0.4375, "learning_rate": 3.78790363561779e-06, "loss": 0.8794495582580566, "mean_token_accuracy": 0.794552437029779, "num_tokens": 15966575.0, "step": 3480 }, { "entropy": 0.6764940508641303, "epoch": 0.32908617295882886, "grad_norm": 0.5078125, "learning_rate": 3.780957105478136e-06, "loss": 0.5081439971923828, "mean_token_accuracy": 0.8095720581710338, "num_tokens": 16005157.0, "step": 3490 }, { "entropy": 0.6400508332066238, "epoch": 0.3300291132824931, "grad_norm": 0.451171875, "learning_rate": 3.773997138704584e-06, "loss": 0.6697597503662109, "mean_token_accuracy": 0.8156585179269313, "num_tokens": 16058706.0, "step": 3500 }, { "entropy": 0.7768798024393618, "epoch": 0.3309720536061574, "grad_norm": 0.47265625, "learning_rate": 3.767023808303892e-06, "loss": 0.6917949199676514, "mean_token_accuracy": 0.7819763291627169, "num_tokens": 16104548.0, "step": 3510 }, { "entropy": 0.6866999283432961, "epoch": 0.33191499392982166, "grad_norm": 0.375, "learning_rate": 3.760037187422996e-06, "loss": 0.5713237285614013, "mean_token_accuracy": 0.808608740568161, "num_tokens": 16151094.0, "step": 3520 }, { "entropy": 0.6466354493051767, "epoch": 0.3328579342534859, "grad_norm": 0.5234375, "learning_rate": 3.7530373493482442e-06, "loss": 0.5052223682403565, "mean_token_accuracy": 0.8262160135433078, "num_tokens": 16187244.0, "step": 3530 }, { "entropy": 0.7813827708363533, "epoch": 0.3338008745771502, "grad_norm": 0.50390625, "learning_rate": 3.746024367504624e-06, "loss": 0.741961669921875, "mean_token_accuracy": 0.7885062169283629, "num_tokens": 16230839.0, "step": 3540 }, { "entropy": 0.6852214397862554, "epoch": 0.33474381490081445, "grad_norm": 0.296875, "learning_rate": 3.738998315454997e-06, "loss": 0.7102997303009033, "mean_token_accuracy": 0.8053493849933148, "num_tokens": 16272786.0, "step": 3550 }, { "entropy": 0.7877503798343242, "epoch": 0.3356867552244787, "grad_norm": 0.5390625, "learning_rate": 3.7319592668993252e-06, "loss": 0.6556308746337891, "mean_token_accuracy": 0.7900882601737976, "num_tokens": 16315697.0, "step": 3560 }, { "entropy": 0.7013790069147945, "epoch": 0.336629695548143, "grad_norm": 1.2890625, "learning_rate": 3.724907295673897e-06, "loss": 0.6879619598388672, "mean_token_accuracy": 0.7857543051242828, "num_tokens": 16355680.0, "step": 3570 }, { "entropy": 0.741982850804925, "epoch": 0.33757263587180725, "grad_norm": 0.283203125, "learning_rate": 3.7178424757505527e-06, "loss": 0.4787749767303467, "mean_token_accuracy": 0.7993146969936789, "num_tokens": 16403649.0, "step": 3580 }, { "entropy": 0.7543878412805498, "epoch": 0.3385155761954715, "grad_norm": 0.265625, "learning_rate": 3.710764881235911e-06, "loss": 0.6166384220123291, "mean_token_accuracy": 0.7903889134526253, "num_tokens": 16450951.0, "step": 3590 }, { "entropy": 0.7278856437653303, "epoch": 0.3394585165191358, "grad_norm": 0.58984375, "learning_rate": 3.7036745863705898e-06, "loss": 0.5853046894073486, "mean_token_accuracy": 0.8067043915390968, "num_tokens": 16492847.0, "step": 3600 }, { "entropy": 0.623352998867631, "epoch": 0.34040145684280004, "grad_norm": 0.859375, "learning_rate": 3.696571665528426e-06, "loss": 0.6010436058044434, "mean_token_accuracy": 0.8135320819914341, "num_tokens": 16539335.0, "step": 3610 }, { "entropy": 0.5651233859360218, "epoch": 0.3413443971664643, "grad_norm": 0.34765625, "learning_rate": 3.6894561932156993e-06, "loss": 0.480146598815918, "mean_token_accuracy": 0.8269745983183384, "num_tokens": 16581557.0, "step": 3620 }, { "entropy": 0.5513820692896843, "epoch": 0.3422873374901286, "grad_norm": 0.29296875, "learning_rate": 3.6823282440703464e-06, "loss": 0.44032793045043944, "mean_token_accuracy": 0.8351238772273064, "num_tokens": 16630457.0, "step": 3630 }, { "entropy": 0.6860549350269138, "epoch": 0.34323027781379284, "grad_norm": 0.42578125, "learning_rate": 3.675187892861181e-06, "loss": 0.8258073806762696, "mean_token_accuracy": 0.8066768426448107, "num_tokens": 16672161.0, "step": 3640 }, { "entropy": 0.7870678843930363, "epoch": 0.3441732181374571, "grad_norm": 0.384765625, "learning_rate": 3.668035214487109e-06, "loss": 0.596193790435791, "mean_token_accuracy": 0.7948238357901574, "num_tokens": 16718702.0, "step": 3650 }, { "entropy": 0.643625473883003, "epoch": 0.34511615846112137, "grad_norm": 0.6875, "learning_rate": 3.6608702839763417e-06, "loss": 0.5603129863739014, "mean_token_accuracy": 0.8320864170789719, "num_tokens": 16762137.0, "step": 3660 }, { "entropy": 0.6784814346581698, "epoch": 0.34605909878478563, "grad_norm": 0.294921875, "learning_rate": 3.653693176485609e-06, "loss": 0.5835480213165283, "mean_token_accuracy": 0.7936832685023546, "num_tokens": 16811007.0, "step": 3670 }, { "entropy": 0.6954671564511955, "epoch": 0.3470020391084499, "grad_norm": 0.3359375, "learning_rate": 3.6465039672993747e-06, "loss": 0.5739445209503173, "mean_token_accuracy": 0.8101118110120297, "num_tokens": 16859417.0, "step": 3680 }, { "entropy": 0.5880941131850704, "epoch": 0.34794497943211417, "grad_norm": 0.41015625, "learning_rate": 3.6393027318290393e-06, "loss": 0.5243205070495606, "mean_token_accuracy": 0.8368364397436381, "num_tokens": 16905942.0, "step": 3690 }, { "entropy": 0.7491540067829192, "epoch": 0.34888791975577843, "grad_norm": 0.6015625, "learning_rate": 3.6320895456121554e-06, "loss": 0.6963620185852051, "mean_token_accuracy": 0.7984883543103933, "num_tokens": 16952505.0, "step": 3700 }, { "entropy": 0.6897736290469766, "epoch": 0.3498308600794427, "grad_norm": 0.7421875, "learning_rate": 3.624864484311634e-06, "loss": 0.7436827182769775, "mean_token_accuracy": 0.8021753750741482, "num_tokens": 16988497.0, "step": 3710 }, { "entropy": 0.7926816479302943, "epoch": 0.35077380040310696, "grad_norm": 0.50390625, "learning_rate": 3.617627623714949e-06, "loss": 0.5878771781921387, "mean_token_accuracy": 0.8056975590065122, "num_tokens": 17034282.0, "step": 3720 }, { "entropy": 0.7796463750302791, "epoch": 0.3517167407267713, "grad_norm": 0.333984375, "learning_rate": 3.6103790397333434e-06, "loss": 0.6098315238952636, "mean_token_accuracy": 0.7889279814437031, "num_tokens": 17079686.0, "step": 3730 }, { "entropy": 0.6948955420404672, "epoch": 0.35265968105043555, "grad_norm": 0.443359375, "learning_rate": 3.6031188084010323e-06, "loss": 0.5765831947326661, "mean_token_accuracy": 0.809371105581522, "num_tokens": 17130498.0, "step": 3740 }, { "entropy": 0.7758785348385573, "epoch": 0.3536026213740998, "grad_norm": 0.83203125, "learning_rate": 3.5958470058744087e-06, "loss": 0.7576163291931153, "mean_token_accuracy": 0.783694538474083, "num_tokens": 17172063.0, "step": 3750 }, { "entropy": 0.6243882402777672, "epoch": 0.3545455616977641, "grad_norm": 0.58984375, "learning_rate": 3.5885637084312396e-06, "loss": 0.5422124862670898, "mean_token_accuracy": 0.8128781575709582, "num_tokens": 17216580.0, "step": 3760 }, { "entropy": 0.8334074198268354, "epoch": 0.35548850202142834, "grad_norm": 0.74609375, "learning_rate": 3.5812689924698683e-06, "loss": 0.7805116653442383, "mean_token_accuracy": 0.7612057582475245, "num_tokens": 17259710.0, "step": 3770 }, { "entropy": 0.7605297128204256, "epoch": 0.3564314423450926, "grad_norm": 0.408203125, "learning_rate": 3.5739629345084138e-06, "loss": 0.6510057926177979, "mean_token_accuracy": 0.7927152115851641, "num_tokens": 17300431.0, "step": 3780 }, { "entropy": 0.652113667037338, "epoch": 0.3573743826687569, "grad_norm": 0.33984375, "learning_rate": 3.5666456111839665e-06, "loss": 0.5418231964111329, "mean_token_accuracy": 0.8129661198705435, "num_tokens": 17351269.0, "step": 3790 }, { "entropy": 0.6586431222967803, "epoch": 0.35831732299242114, "grad_norm": 0.57421875, "learning_rate": 3.5593170992517863e-06, "loss": 0.6081669807434082, "mean_token_accuracy": 0.8147268489003181, "num_tokens": 17391637.0, "step": 3800 }, { "entropy": 0.6838495754636824, "epoch": 0.3592602633160854, "grad_norm": 0.55859375, "learning_rate": 3.5519774755844944e-06, "loss": 0.6559165000915528, "mean_token_accuracy": 0.8095557514578104, "num_tokens": 17434461.0, "step": 3810 }, { "entropy": 0.6051603745669126, "epoch": 0.36020320363974967, "grad_norm": 0.50390625, "learning_rate": 3.5446268171712706e-06, "loss": 0.5790258884429932, "mean_token_accuracy": 0.8305861912667751, "num_tokens": 17478194.0, "step": 3820 }, { "entropy": 0.6348789224401117, "epoch": 0.36114614396341393, "grad_norm": 0.39453125, "learning_rate": 3.5372652011170446e-06, "loss": 0.5092689514160156, "mean_token_accuracy": 0.8051383793354034, "num_tokens": 17534987.0, "step": 3830 }, { "entropy": 0.6503554282244295, "epoch": 0.3620890842870782, "grad_norm": 0.76171875, "learning_rate": 3.529892704641684e-06, "loss": 0.5429260730743408, "mean_token_accuracy": 0.8092528533190488, "num_tokens": 17579200.0, "step": 3840 }, { "entropy": 0.7444478679448366, "epoch": 0.36303202461074247, "grad_norm": 0.72265625, "learning_rate": 3.522509405079188e-06, "loss": 0.7835160732269287, "mean_token_accuracy": 0.7970532771199942, "num_tokens": 17620157.0, "step": 3850 }, { "entropy": 0.6852880992926658, "epoch": 0.36397496493440673, "grad_norm": 0.474609375, "learning_rate": 3.5151153798768765e-06, "loss": 0.5196993827819825, "mean_token_accuracy": 0.818078025430441, "num_tokens": 17672607.0, "step": 3860 }, { "entropy": 0.6903492113575339, "epoch": 0.364917905258071, "grad_norm": 0.28515625, "learning_rate": 3.5077107065945743e-06, "loss": 0.5674126625061036, "mean_token_accuracy": 0.8169661879539489, "num_tokens": 17718690.0, "step": 3870 }, { "entropy": 0.7269641313701868, "epoch": 0.36586084558173526, "grad_norm": 0.40234375, "learning_rate": 3.5002954629038007e-06, "loss": 0.5830210208892822, "mean_token_accuracy": 0.8018156543374062, "num_tokens": 17760388.0, "step": 3880 }, { "entropy": 0.7480830346234143, "epoch": 0.3668037859053995, "grad_norm": 0.392578125, "learning_rate": 3.4928697265869516e-06, "loss": 0.5468933582305908, "mean_token_accuracy": 0.800993998721242, "num_tokens": 17810259.0, "step": 3890 }, { "entropy": 0.6070564269088209, "epoch": 0.3677467262290638, "grad_norm": 0.38671875, "learning_rate": 3.48543357553649e-06, "loss": 0.5181046009063721, "mean_token_accuracy": 0.8317337445914745, "num_tokens": 17858820.0, "step": 3900 }, { "entropy": 0.8158755677752196, "epoch": 0.36868966655272806, "grad_norm": 0.3828125, "learning_rate": 3.4779870877541188e-06, "loss": 0.6114593029022217, "mean_token_accuracy": 0.7713057190179825, "num_tokens": 17902522.0, "step": 3910 }, { "entropy": 0.6110333253629505, "epoch": 0.3696326068763923, "grad_norm": 0.322265625, "learning_rate": 3.4705303413499736e-06, "loss": 0.5357798099517822, "mean_token_accuracy": 0.8168054174631834, "num_tokens": 17949303.0, "step": 3920 }, { "entropy": 0.6398234066087752, "epoch": 0.3705755472000566, "grad_norm": 0.76171875, "learning_rate": 3.4630634145417944e-06, "loss": 0.6564537048339844, "mean_token_accuracy": 0.8288793444633484, "num_tokens": 17993395.0, "step": 3930 }, { "entropy": 0.6848932018503546, "epoch": 0.37151848752372085, "grad_norm": 0.5390625, "learning_rate": 3.4555863856541107e-06, "loss": 0.740598487854004, "mean_token_accuracy": 0.7940419346094132, "num_tokens": 18041610.0, "step": 3940 }, { "entropy": 0.647498956695199, "epoch": 0.3724614278473851, "grad_norm": 0.484375, "learning_rate": 3.4480993331174166e-06, "loss": 0.6062899112701416, "mean_token_accuracy": 0.8174811258912087, "num_tokens": 18092998.0, "step": 3950 }, { "entropy": 0.694026449136436, "epoch": 0.3734043681710494, "grad_norm": 0.26171875, "learning_rate": 3.440602335467351e-06, "loss": 0.5536818504333496, "mean_token_accuracy": 0.7983353350311517, "num_tokens": 18134601.0, "step": 3960 }, { "entropy": 0.6323764859698713, "epoch": 0.37434730849471365, "grad_norm": 0.419921875, "learning_rate": 3.433095471343872e-06, "loss": 0.658245325088501, "mean_token_accuracy": 0.8151856455951929, "num_tokens": 18178003.0, "step": 3970 }, { "entropy": 0.8302557891234755, "epoch": 0.3752902488183779, "grad_norm": 0.419921875, "learning_rate": 3.425578819490431e-06, "loss": 0.7398871898651123, "mean_token_accuracy": 0.7722434610128402, "num_tokens": 18221880.0, "step": 3980 }, { "entropy": 0.661791059281677, "epoch": 0.3762331891420422, "grad_norm": 0.443359375, "learning_rate": 3.4180524587531504e-06, "loss": 0.48392953872680666, "mean_token_accuracy": 0.8174215763807297, "num_tokens": 18265321.0, "step": 3990 }, { "entropy": 0.675689808651805, "epoch": 0.37717612946570644, "grad_norm": 0.48828125, "learning_rate": 3.4105164680799928e-06, "loss": 0.5103531837463379, "mean_token_accuracy": 0.8037473402917386, "num_tokens": 18306707.0, "step": 4000 }, { "entropy": 0.8221991116646677, "epoch": 0.3781190697893707, "grad_norm": 0.271484375, "learning_rate": 3.402970926519934e-06, "loss": 0.618397331237793, "mean_token_accuracy": 0.7826770418323576, "num_tokens": 18346281.0, "step": 4010 }, { "entropy": 0.7318005957640707, "epoch": 0.379062010113035, "grad_norm": 0.271484375, "learning_rate": 3.395415913222134e-06, "loss": 0.7626585960388184, "mean_token_accuracy": 0.7984059415757656, "num_tokens": 18389995.0, "step": 4020 }, { "entropy": 0.8118009151890874, "epoch": 0.38000495043669924, "grad_norm": 0.62109375, "learning_rate": 3.3878515074351087e-06, "loss": 0.7354348182678223, "mean_token_accuracy": 0.7721582528203725, "num_tokens": 18434935.0, "step": 4030 }, { "entropy": 0.8204971087165177, "epoch": 0.3809478907603635, "grad_norm": 0.57421875, "learning_rate": 3.3802777885058933e-06, "loss": 0.5647460460662842, "mean_token_accuracy": 0.7732091106474399, "num_tokens": 18482777.0, "step": 4040 }, { "entropy": 0.6955384029075503, "epoch": 0.38189083108402777, "grad_norm": 0.4921875, "learning_rate": 3.3726948358792176e-06, "loss": 0.6320321083068847, "mean_token_accuracy": 0.8126376781612634, "num_tokens": 18530249.0, "step": 4050 }, { "entropy": 0.7113258785568177, "epoch": 0.38283377140769204, "grad_norm": 0.46484375, "learning_rate": 3.3651027290966653e-06, "loss": 0.5650223731994629, "mean_token_accuracy": 0.8019524831324816, "num_tokens": 18577504.0, "step": 4060 }, { "entropy": 0.6824137067887932, "epoch": 0.3837767117313563, "grad_norm": 1.2734375, "learning_rate": 3.3575015477958445e-06, "loss": 0.6059187412261963, "mean_token_accuracy": 0.7883812438696622, "num_tokens": 18619468.0, "step": 4070 }, { "entropy": 0.7901984248310328, "epoch": 0.38471965205502057, "grad_norm": 0.408203125, "learning_rate": 3.34989137170955e-06, "loss": 0.5455976486206054, "mean_token_accuracy": 0.784822690486908, "num_tokens": 18667000.0, "step": 4080 }, { "entropy": 0.718475041934289, "epoch": 0.38566259237868483, "grad_norm": 0.31640625, "learning_rate": 3.3422722806649276e-06, "loss": 0.5682651042938233, "mean_token_accuracy": 0.8000302887521684, "num_tokens": 18710396.0, "step": 4090 }, { "entropy": 0.6617384196259082, "epoch": 0.3866055327023491, "grad_norm": 0.35546875, "learning_rate": 3.334644354582638e-06, "loss": 0.5210241794586181, "mean_token_accuracy": 0.8172427896410227, "num_tokens": 18758405.0, "step": 4100 }, { "entropy": 0.7391965406015515, "epoch": 0.38754847302601336, "grad_norm": 0.64453125, "learning_rate": 3.327007673476015e-06, "loss": 0.6083121299743652, "mean_token_accuracy": 0.7892594009637832, "num_tokens": 18803120.0, "step": 4110 }, { "entropy": 0.6573400060646236, "epoch": 0.38849141334967763, "grad_norm": 0.72265625, "learning_rate": 3.319362317450231e-06, "loss": 0.5357893466949463, "mean_token_accuracy": 0.8097851235419512, "num_tokens": 18846147.0, "step": 4120 }, { "entropy": 0.7643828511238098, "epoch": 0.3894343536733419, "grad_norm": 0.75390625, "learning_rate": 3.3117083667014518e-06, "loss": 0.6513972759246827, "mean_token_accuracy": 0.8002022080123424, "num_tokens": 18888996.0, "step": 4130 }, { "entropy": 0.6743721715174615, "epoch": 0.39037729399700616, "grad_norm": 0.61328125, "learning_rate": 3.304045901516e-06, "loss": 0.5173910617828369, "mean_token_accuracy": 0.8222727868705988, "num_tokens": 18933492.0, "step": 4140 }, { "entropy": 0.6496790492208675, "epoch": 0.3913202343206704, "grad_norm": 0.474609375, "learning_rate": 3.2963750022695094e-06, "loss": 0.5311402320861817, "mean_token_accuracy": 0.8124469438567757, "num_tokens": 18980265.0, "step": 4150 }, { "entropy": 0.7410643206909299, "epoch": 0.3922631746443347, "grad_norm": 0.3671875, "learning_rate": 3.288695749426084e-06, "loss": 0.5552346229553222, "mean_token_accuracy": 0.8150686305016279, "num_tokens": 19034421.0, "step": 4160 }, { "entropy": 0.7548421092098578, "epoch": 0.39320611496799895, "grad_norm": 0.490234375, "learning_rate": 3.2810082235374508e-06, "loss": 0.7359838485717773, "mean_token_accuracy": 0.8010040692985058, "num_tokens": 19084813.0, "step": 4170 }, { "entropy": 0.5428073874674737, "epoch": 0.3941490552916632, "grad_norm": 0.318359375, "learning_rate": 3.2733125052421193e-06, "loss": 0.46096482276916506, "mean_token_accuracy": 0.8404661461710929, "num_tokens": 19131677.0, "step": 4180 }, { "entropy": 0.6938783401623368, "epoch": 0.3950919956153275, "grad_norm": 0.54296875, "learning_rate": 3.2656086752645334e-06, "loss": 0.6413106441497802, "mean_token_accuracy": 0.804457500204444, "num_tokens": 19175289.0, "step": 4190 }, { "entropy": 0.7383185734972357, "epoch": 0.39603493593899175, "grad_norm": 0.625, "learning_rate": 3.257896814414223e-06, "loss": 0.599180793762207, "mean_token_accuracy": 0.7934302197769284, "num_tokens": 19226110.0, "step": 4200 }, { "entropy": 0.6432693097740412, "epoch": 0.396977876262656, "grad_norm": 0.63671875, "learning_rate": 3.2501770035849605e-06, "loss": 0.5177838802337646, "mean_token_accuracy": 0.8194103617221117, "num_tokens": 19273450.0, "step": 4210 }, { "entropy": 0.6650319148786366, "epoch": 0.3979208165863203, "grad_norm": 0.43359375, "learning_rate": 3.242449323753908e-06, "loss": 0.5644178867340088, "mean_token_accuracy": 0.8194221030920744, "num_tokens": 19313801.0, "step": 4220 }, { "entropy": 0.7258335336111486, "epoch": 0.39886375690998455, "grad_norm": 0.392578125, "learning_rate": 3.2347138559807702e-06, "loss": 0.7438495635986329, "mean_token_accuracy": 0.8006484184414149, "num_tokens": 19364314.0, "step": 4230 }, { "entropy": 0.6766277103684842, "epoch": 0.3998066972336488, "grad_norm": 0.50390625, "learning_rate": 3.226970681406944e-06, "loss": 0.6204345703125, "mean_token_accuracy": 0.7923669695854187, "num_tokens": 19408153.0, "step": 4240 }, { "entropy": 0.7198492975905537, "epoch": 0.4007496375573131, "grad_norm": 0.439453125, "learning_rate": 3.219219881254666e-06, "loss": 0.6644938945770263, "mean_token_accuracy": 0.7969273280352354, "num_tokens": 19451626.0, "step": 4250 }, { "entropy": 0.843270109500736, "epoch": 0.40169257788097734, "grad_norm": 0.474609375, "learning_rate": 3.2114615368261624e-06, "loss": 0.7886375427246094, "mean_token_accuracy": 0.7667363656684756, "num_tokens": 19500931.0, "step": 4260 }, { "entropy": 0.7085121444426477, "epoch": 0.4026355182046416, "grad_norm": 0.90234375, "learning_rate": 3.2036957295027958e-06, "loss": 0.6949386119842529, "mean_token_accuracy": 0.7916569627821446, "num_tokens": 19549938.0, "step": 4270 }, { "entropy": 0.6853237067349255, "epoch": 0.4035784585283059, "grad_norm": 0.75390625, "learning_rate": 3.1959225407442097e-06, "loss": 0.6178842544555664, "mean_token_accuracy": 0.8125127829611302, "num_tokens": 19599634.0, "step": 4280 }, { "entropy": 0.6578317375853657, "epoch": 0.40452139885197014, "grad_norm": 0.58984375, "learning_rate": 3.188142052087476e-06, "loss": 0.6399495601654053, "mean_token_accuracy": 0.8123631715774536, "num_tokens": 19645911.0, "step": 4290 }, { "entropy": 0.678624777495861, "epoch": 0.4054643391756344, "grad_norm": 0.353515625, "learning_rate": 3.1803543451462393e-06, "loss": 0.6367847919464111, "mean_token_accuracy": 0.8035919483751058, "num_tokens": 19688704.0, "step": 4300 }, { "entropy": 0.5864495939575136, "epoch": 0.40640727949929867, "grad_norm": 0.28125, "learning_rate": 3.17255950160986e-06, "loss": 0.506658411026001, "mean_token_accuracy": 0.825262775272131, "num_tokens": 19730777.0, "step": 4310 }, { "entropy": 0.7443196853622794, "epoch": 0.40735021982296293, "grad_norm": 0.48828125, "learning_rate": 3.164757603242559e-06, "loss": 0.54283447265625, "mean_token_accuracy": 0.7956912875175476, "num_tokens": 19776535.0, "step": 4320 }, { "entropy": 0.7234893916174769, "epoch": 0.4082931601466272, "grad_norm": 0.458984375, "learning_rate": 3.1569487318825576e-06, "loss": 0.6039177894592285, "mean_token_accuracy": 0.8105068215169012, "num_tokens": 19819712.0, "step": 4330 }, { "entropy": 0.7695184142328799, "epoch": 0.40923610047029146, "grad_norm": 0.6484375, "learning_rate": 3.1491329694412217e-06, "loss": 0.6124618530273438, "mean_token_accuracy": 0.7952944649383425, "num_tokens": 19870603.0, "step": 4340 }, { "entropy": 0.80782908834517, "epoch": 0.41017904079395573, "grad_norm": 0.427734375, "learning_rate": 3.1413103979021996e-06, "loss": 0.7708604812622071, "mean_token_accuracy": 0.7625693265348673, "num_tokens": 19912895.0, "step": 4350 }, { "entropy": 0.8120630858466029, "epoch": 0.41112198111762, "grad_norm": 0.671875, "learning_rate": 3.133481099320567e-06, "loss": 0.8301298141479492, "mean_token_accuracy": 0.7721738774329424, "num_tokens": 19955841.0, "step": 4360 }, { "entropy": 0.6812439509667456, "epoch": 0.41206492144128426, "grad_norm": 0.79296875, "learning_rate": 3.1256451558219614e-06, "loss": 0.6116904258728028, "mean_token_accuracy": 0.8017740860581398, "num_tokens": 20005277.0, "step": 4370 }, { "entropy": 0.650224775960669, "epoch": 0.4130078617649485, "grad_norm": 0.349609375, "learning_rate": 3.1178026496017206e-06, "loss": 0.591245460510254, "mean_token_accuracy": 0.8192921217530966, "num_tokens": 20052094.0, "step": 4380 }, { "entropy": 0.6650533619336784, "epoch": 0.4139508020886128, "grad_norm": 0.310546875, "learning_rate": 3.109953662924025e-06, "loss": 0.6183666229248047, "mean_token_accuracy": 0.8229886900633574, "num_tokens": 20096509.0, "step": 4390 }, { "entropy": 0.7457806673366576, "epoch": 0.41489374241227706, "grad_norm": 0.453125, "learning_rate": 3.1020982781210306e-06, "loss": 0.5394028663635254, "mean_token_accuracy": 0.797967865690589, "num_tokens": 20146777.0, "step": 4400 }, { "entropy": 0.6870288801379502, "epoch": 0.4158366827359414, "grad_norm": 0.54296875, "learning_rate": 3.0942365775920057e-06, "loss": 0.5307192802429199, "mean_token_accuracy": 0.8131231028586626, "num_tokens": 20187659.0, "step": 4410 }, { "entropy": 0.7553388600237667, "epoch": 0.41677962305960564, "grad_norm": 0.65234375, "learning_rate": 3.086368643802471e-06, "loss": 0.655640697479248, "mean_token_accuracy": 0.789563775807619, "num_tokens": 20231537.0, "step": 4420 }, { "entropy": 0.7162960932124406, "epoch": 0.4177225633832699, "grad_norm": 0.390625, "learning_rate": 3.078494559283327e-06, "loss": 0.5714639186859131, "mean_token_accuracy": 0.8139267075806856, "num_tokens": 20275124.0, "step": 4430 }, { "entropy": 0.638027570489794, "epoch": 0.4186655037069342, "grad_norm": 0.6796875, "learning_rate": 3.070614406629995e-06, "loss": 0.5676782608032227, "mean_token_accuracy": 0.8156324338167906, "num_tokens": 20321807.0, "step": 4440 }, { "entropy": 0.7704670215025544, "epoch": 0.41960844403059844, "grad_norm": 0.796875, "learning_rate": 3.0627282685015477e-06, "loss": 0.5788619518280029, "mean_token_accuracy": 0.8035795167088509, "num_tokens": 20364595.0, "step": 4450 }, { "entropy": 0.8218068578746169, "epoch": 0.4205513843542627, "grad_norm": 0.796875, "learning_rate": 3.054836227619842e-06, "loss": 0.5779088020324707, "mean_token_accuracy": 0.7815472435206174, "num_tokens": 20410612.0, "step": 4460 }, { "entropy": 0.5942241735756397, "epoch": 0.42149432467792697, "grad_norm": 0.59765625, "learning_rate": 3.0469383667686532e-06, "loss": 0.47473464012145994, "mean_token_accuracy": 0.8354270774871111, "num_tokens": 20454032.0, "step": 4470 }, { "entropy": 0.5301405775360764, "epoch": 0.42243726500159123, "grad_norm": 0.44140625, "learning_rate": 3.039034768792803e-06, "loss": 0.44197745323181153, "mean_token_accuracy": 0.8487105399370194, "num_tokens": 20496123.0, "step": 4480 }, { "entropy": 0.7075543572660535, "epoch": 0.4233802053252555, "grad_norm": 0.294921875, "learning_rate": 3.0311255165972953e-06, "loss": 0.5451488494873047, "mean_token_accuracy": 0.8073224203661085, "num_tokens": 20539415.0, "step": 4490 }, { "entropy": 0.6837927075102925, "epoch": 0.42432314564891976, "grad_norm": 0.4375, "learning_rate": 3.0232106931464434e-06, "loss": 0.6114567279815674, "mean_token_accuracy": 0.8121942866593599, "num_tokens": 20584443.0, "step": 4500 }, { "entropy": 0.6196409862488508, "epoch": 0.42526608597258403, "grad_norm": 0.6015625, "learning_rate": 3.015290381462998e-06, "loss": 0.6821407794952392, "mean_token_accuracy": 0.8301993541419506, "num_tokens": 20630900.0, "step": 4510 }, { "entropy": 0.7151961518451572, "epoch": 0.4262090262962483, "grad_norm": 0.4921875, "learning_rate": 3.0073646646272837e-06, "loss": 0.614381217956543, "mean_token_accuracy": 0.8130818229168654, "num_tokens": 20673932.0, "step": 4520 }, { "entropy": 0.6770127274096012, "epoch": 0.42715196661991256, "grad_norm": 0.4375, "learning_rate": 2.9994336257763175e-06, "loss": 0.54631028175354, "mean_token_accuracy": 0.8104281619191169, "num_tokens": 20720772.0, "step": 4530 }, { "entropy": 0.6979648591019213, "epoch": 0.4280949069435768, "grad_norm": 0.74609375, "learning_rate": 2.991497348102945e-06, "loss": 0.6474967956542969, "mean_token_accuracy": 0.7961675971746445, "num_tokens": 20766481.0, "step": 4540 }, { "entropy": 0.623636071383953, "epoch": 0.4290378472672411, "grad_norm": 0.296875, "learning_rate": 2.9835559148549638e-06, "loss": 0.6137451648712158, "mean_token_accuracy": 0.8198790092021226, "num_tokens": 20805502.0, "step": 4550 }, { "entropy": 0.5448908562771976, "epoch": 0.42998078759090536, "grad_norm": 0.83203125, "learning_rate": 2.97560940933425e-06, "loss": 0.49565706253051756, "mean_token_accuracy": 0.848630927503109, "num_tokens": 20847160.0, "step": 4560 }, { "entropy": 0.7783894378691911, "epoch": 0.4309237279145696, "grad_norm": 0.35546875, "learning_rate": 2.967657914895887e-06, "loss": 0.77616868019104, "mean_token_accuracy": 0.7921557927504181, "num_tokens": 20894790.0, "step": 4570 }, { "entropy": 0.7091885100118815, "epoch": 0.4318666682382339, "grad_norm": 0.3828125, "learning_rate": 2.9597015149472878e-06, "loss": 0.633561372756958, "mean_token_accuracy": 0.8060255534946918, "num_tokens": 20941007.0, "step": 4580 }, { "entropy": 0.6587966305203736, "epoch": 0.43280960856189815, "grad_norm": 0.2470703125, "learning_rate": 2.9517402929473243e-06, "loss": 0.6381916522979736, "mean_token_accuracy": 0.830630149319768, "num_tokens": 20992763.0, "step": 4590 }, { "entropy": 0.7116721348837018, "epoch": 0.4337525488855624, "grad_norm": 0.46875, "learning_rate": 2.943774332405448e-06, "loss": 0.6077177047729492, "mean_token_accuracy": 0.7988573126494884, "num_tokens": 21038753.0, "step": 4600 }, { "entropy": 0.7426122948527336, "epoch": 0.4346954892092267, "grad_norm": 0.376953125, "learning_rate": 2.935803716880815e-06, "loss": 0.6154319763183593, "mean_token_accuracy": 0.8028998583555221, "num_tokens": 21082452.0, "step": 4610 }, { "entropy": 0.7233793533407151, "epoch": 0.43563842953289095, "grad_norm": 0.5546875, "learning_rate": 2.927828529981411e-06, "loss": 0.584602165222168, "mean_token_accuracy": 0.7928648635745048, "num_tokens": 21128139.0, "step": 4620 }, { "entropy": 0.7569336066953838, "epoch": 0.4365813698565552, "grad_norm": 0.1953125, "learning_rate": 2.919848855363172e-06, "loss": 0.4981938362121582, "mean_token_accuracy": 0.8080588222481311, "num_tokens": 21175953.0, "step": 4630 }, { "entropy": 0.6948595408350229, "epoch": 0.4375243101802195, "grad_norm": 1.3359375, "learning_rate": 2.9118647767291096e-06, "loss": 0.7068987846374511, "mean_token_accuracy": 0.8049037493765354, "num_tokens": 21228357.0, "step": 4640 }, { "entropy": 0.749409731477499, "epoch": 0.43846725050388374, "grad_norm": 0.5078125, "learning_rate": 2.903876377828431e-06, "loss": 0.5781918525695801, "mean_token_accuracy": 0.7907330963760615, "num_tokens": 21282711.0, "step": 4650 }, { "entropy": 0.7640089130960405, "epoch": 0.439410190827548, "grad_norm": 0.55859375, "learning_rate": 2.8958837424556586e-06, "loss": 0.6110117435455322, "mean_token_accuracy": 0.8006194703280926, "num_tokens": 21322979.0, "step": 4660 }, { "entropy": 0.6390418185852468, "epoch": 0.4403531311512123, "grad_norm": 0.458984375, "learning_rate": 2.8878869544497574e-06, "loss": 0.594711446762085, "mean_token_accuracy": 0.8070811614394188, "num_tokens": 21367310.0, "step": 4670 }, { "entropy": 0.80012998431921, "epoch": 0.44129607147487654, "grad_norm": 0.62109375, "learning_rate": 2.879886097693249e-06, "loss": 0.7834507465362549, "mean_token_accuracy": 0.77053287550807, "num_tokens": 21409253.0, "step": 4680 }, { "entropy": 0.7294010010547936, "epoch": 0.4422390117985408, "grad_norm": 0.69921875, "learning_rate": 2.871881256111335e-06, "loss": 0.701657485961914, "mean_token_accuracy": 0.7879527509212494, "num_tokens": 21453671.0, "step": 4690 }, { "entropy": 0.6360360025428236, "epoch": 0.44318195212220507, "grad_norm": 0.39453125, "learning_rate": 2.8638725136710156e-06, "loss": 0.5755587100982666, "mean_token_accuracy": 0.8209034506231546, "num_tokens": 21507926.0, "step": 4700 }, { "entropy": 0.7269893609918654, "epoch": 0.44412489244586933, "grad_norm": 0.376953125, "learning_rate": 2.855859954380209e-06, "loss": 0.7129250049591065, "mean_token_accuracy": 0.8010267514735461, "num_tokens": 21551045.0, "step": 4710 }, { "entropy": 0.6108814541250467, "epoch": 0.4450678327695336, "grad_norm": 0.455078125, "learning_rate": 2.8478436622868704e-06, "loss": 0.5731475353240967, "mean_token_accuracy": 0.8247819773852825, "num_tokens": 21598339.0, "step": 4720 }, { "entropy": 0.7286485302262008, "epoch": 0.44601077309319787, "grad_norm": 0.578125, "learning_rate": 2.8398237214781123e-06, "loss": 0.5923725128173828, "mean_token_accuracy": 0.7957899816334247, "num_tokens": 21644913.0, "step": 4730 }, { "entropy": 0.8006156609393656, "epoch": 0.44695371341686213, "grad_norm": 0.5, "learning_rate": 2.8318002160793175e-06, "loss": 0.5867124557495117, "mean_token_accuracy": 0.7782018858939409, "num_tokens": 21691472.0, "step": 4740 }, { "entropy": 0.731638565286994, "epoch": 0.4478966537405264, "grad_norm": 0.30859375, "learning_rate": 2.82377323025326e-06, "loss": 0.7104349613189698, "mean_token_accuracy": 0.800374174490571, "num_tokens": 21738146.0, "step": 4750 }, { "entropy": 0.6022297551855444, "epoch": 0.44883959406419066, "grad_norm": 0.6015625, "learning_rate": 2.815742848199225e-06, "loss": 0.6393797397613525, "mean_token_accuracy": 0.8331300269812345, "num_tokens": 21781574.0, "step": 4760 }, { "entropy": 0.6964669045060873, "epoch": 0.4497825343878549, "grad_norm": 0.640625, "learning_rate": 2.8077091541521197e-06, "loss": 0.8155632019042969, "mean_token_accuracy": 0.799362026527524, "num_tokens": 21821499.0, "step": 4770 }, { "entropy": 0.8252560695633292, "epoch": 0.4507254747115192, "grad_norm": 0.53515625, "learning_rate": 2.7996722323815923e-06, "loss": 0.6062126636505127, "mean_token_accuracy": 0.7833932403475046, "num_tokens": 21867325.0, "step": 4780 }, { "entropy": 0.7341827435418964, "epoch": 0.45166841503518346, "grad_norm": 0.5390625, "learning_rate": 2.79163216719115e-06, "loss": 0.6348656177520752, "mean_token_accuracy": 0.7946558525785804, "num_tokens": 21909555.0, "step": 4790 }, { "entropy": 0.7667273837141693, "epoch": 0.4526113553588477, "grad_norm": 0.267578125, "learning_rate": 2.7835890429172712e-06, "loss": 0.6177640914916992, "mean_token_accuracy": 0.8011632848531007, "num_tokens": 21958171.0, "step": 4800 }, { "entropy": 0.6290356336161494, "epoch": 0.453554295682512, "grad_norm": 0.318359375, "learning_rate": 2.7755429439285243e-06, "loss": 0.6255978584289551, "mean_token_accuracy": 0.8260467633605003, "num_tokens": 22008006.0, "step": 4810 }, { "entropy": 0.7753217613324523, "epoch": 0.45449723600617625, "grad_norm": 0.310546875, "learning_rate": 2.767493954624681e-06, "loss": 0.6561094760894776, "mean_token_accuracy": 0.785815117880702, "num_tokens": 22049411.0, "step": 4820 }, { "entropy": 0.6085925869643688, "epoch": 0.4554401763298405, "grad_norm": 0.34375, "learning_rate": 2.759442159435829e-06, "loss": 0.555381441116333, "mean_token_accuracy": 0.8140901662409306, "num_tokens": 22095072.0, "step": 4830 }, { "entropy": 0.7590108618140221, "epoch": 0.4563831166535048, "grad_norm": 0.25, "learning_rate": 2.751387642821491e-06, "loss": 0.6291932582855224, "mean_token_accuracy": 0.7985693622380495, "num_tokens": 22139728.0, "step": 4840 }, { "entropy": 0.6212056964635849, "epoch": 0.45732605697716905, "grad_norm": 0.33984375, "learning_rate": 2.743330489269734e-06, "loss": 0.5828049182891846, "mean_token_accuracy": 0.817613198235631, "num_tokens": 22185360.0, "step": 4850 }, { "entropy": 0.6736974530853331, "epoch": 0.4582689973008333, "grad_norm": 0.66015625, "learning_rate": 2.7352707832962865e-06, "loss": 0.5845682144165039, "mean_token_accuracy": 0.8124393951147795, "num_tokens": 22229210.0, "step": 4860 }, { "entropy": 0.712392061483115, "epoch": 0.4592119376244976, "grad_norm": 0.703125, "learning_rate": 2.72720860944365e-06, "loss": 0.6037466526031494, "mean_token_accuracy": 0.797969845123589, "num_tokens": 22273412.0, "step": 4870 }, { "entropy": 0.6442144404165446, "epoch": 0.46015487794816184, "grad_norm": 0.279296875, "learning_rate": 2.7191440522802142e-06, "loss": 0.5164260864257812, "mean_token_accuracy": 0.819934631511569, "num_tokens": 22324588.0, "step": 4880 }, { "entropy": 0.5705735078081489, "epoch": 0.4610978182718261, "grad_norm": 0.361328125, "learning_rate": 2.7110771963993676e-06, "loss": 0.5488987922668457, "mean_token_accuracy": 0.8361519493162632, "num_tokens": 22372642.0, "step": 4890 }, { "entropy": 0.642943031527102, "epoch": 0.4620407585954904, "grad_norm": 0.52734375, "learning_rate": 2.70300812641861e-06, "loss": 0.6016288280487061, "mean_token_accuracy": 0.8095859756693244, "num_tokens": 22423297.0, "step": 4900 }, { "entropy": 0.7380821701139212, "epoch": 0.46298369891915464, "grad_norm": 1.3515625, "learning_rate": 2.694936926978668e-06, "loss": 0.6568095207214355, "mean_token_accuracy": 0.7910981852561235, "num_tokens": 22460407.0, "step": 4910 }, { "entropy": 0.6616219971328974, "epoch": 0.4639266392428189, "grad_norm": 1.25, "learning_rate": 2.6868636827426055e-06, "loss": 0.6499626159667968, "mean_token_accuracy": 0.8095650464296341, "num_tokens": 22507306.0, "step": 4920 }, { "entropy": 0.6243038043379784, "epoch": 0.46486957956648317, "grad_norm": 0.419921875, "learning_rate": 2.6787884783949325e-06, "loss": 0.4949214458465576, "mean_token_accuracy": 0.812331048771739, "num_tokens": 22550929.0, "step": 4930 }, { "entropy": 0.7329422317445278, "epoch": 0.46581251989014744, "grad_norm": 0.45703125, "learning_rate": 2.670711398640723e-06, "loss": 0.731619119644165, "mean_token_accuracy": 0.7989665359258652, "num_tokens": 22595301.0, "step": 4940 }, { "entropy": 0.5789965157397091, "epoch": 0.4667554602138117, "grad_norm": 0.265625, "learning_rate": 2.662632528204721e-06, "loss": 0.5827124118804932, "mean_token_accuracy": 0.8362434811890125, "num_tokens": 22650881.0, "step": 4950 }, { "entropy": 0.6578682715538889, "epoch": 0.46769840053747597, "grad_norm": 0.3984375, "learning_rate": 2.6545519518304542e-06, "loss": 0.49361634254455566, "mean_token_accuracy": 0.8121582861989737, "num_tokens": 22702979.0, "step": 4960 }, { "entropy": 0.825195993669331, "epoch": 0.46864134086114023, "grad_norm": 0.396484375, "learning_rate": 2.646469754279345e-06, "loss": 0.6855580806732178, "mean_token_accuracy": 0.7875312244519591, "num_tokens": 22739946.0, "step": 4970 }, { "entropy": 0.7191408189013601, "epoch": 0.4695842811848045, "grad_norm": 0.71875, "learning_rate": 2.6383860203298225e-06, "loss": 0.5945919990539551, "mean_token_accuracy": 0.7952681098133325, "num_tokens": 22786614.0, "step": 4980 }, { "entropy": 0.7237249138765037, "epoch": 0.47052722150846876, "grad_norm": 0.404296875, "learning_rate": 2.6303008347764297e-06, "loss": 0.5328628063201905, "mean_token_accuracy": 0.8129015320912003, "num_tokens": 22836470.0, "step": 4990 }, { "entropy": 0.636794293904677, "epoch": 0.47147016183213303, "grad_norm": 0.328125, "learning_rate": 2.622214282428937e-06, "loss": 0.594303560256958, "mean_token_accuracy": 0.8139680068939924, "num_tokens": 22877578.0, "step": 5000 }, { "entropy": 0.6889806432649493, "epoch": 0.4724131021557973, "grad_norm": 0.86328125, "learning_rate": 2.614126448111453e-06, "loss": 0.4839592456817627, "mean_token_accuracy": 0.8087041890248656, "num_tokens": 22920003.0, "step": 5010 }, { "entropy": 0.8315211714245379, "epoch": 0.47335604247946156, "grad_norm": 0.60546875, "learning_rate": 2.606037416661531e-06, "loss": 0.6565670490264892, "mean_token_accuracy": 0.7755562437698245, "num_tokens": 22968717.0, "step": 5020 }, { "entropy": 0.6515540423803031, "epoch": 0.4742989828031258, "grad_norm": 0.734375, "learning_rate": 2.5979472729292855e-06, "loss": 0.544868278503418, "mean_token_accuracy": 0.819118132814765, "num_tokens": 23010837.0, "step": 5030 }, { "entropy": 0.6562650393694639, "epoch": 0.4752419231267901, "grad_norm": 0.412109375, "learning_rate": 2.589856101776494e-06, "loss": 0.6573739051818848, "mean_token_accuracy": 0.8055673878639936, "num_tokens": 23056198.0, "step": 5040 }, { "entropy": 0.6976808074861764, "epoch": 0.47618486345045435, "grad_norm": 0.6328125, "learning_rate": 2.581763988075714e-06, "loss": 0.5908962249755859, "mean_token_accuracy": 0.8016349047422409, "num_tokens": 23105822.0, "step": 5050 }, { "entropy": 0.6807854567654431, "epoch": 0.4771278037741186, "grad_norm": 0.40625, "learning_rate": 2.573671016709389e-06, "loss": 0.6641458034515381, "mean_token_accuracy": 0.8188594870269299, "num_tokens": 23153269.0, "step": 5060 }, { "entropy": 0.7438366217538714, "epoch": 0.4780707440977829, "grad_norm": 0.546875, "learning_rate": 2.5655772725689603e-06, "loss": 0.5763253688812255, "mean_token_accuracy": 0.8034364895895123, "num_tokens": 23192625.0, "step": 5070 }, { "entropy": 0.670103266928345, "epoch": 0.47901368442144715, "grad_norm": 0.373046875, "learning_rate": 2.5574828405539728e-06, "loss": 0.6656664848327637, "mean_token_accuracy": 0.7948807664215565, "num_tokens": 23232898.0, "step": 5080 }, { "entropy": 0.6341434024274349, "epoch": 0.47995662474511147, "grad_norm": 0.4375, "learning_rate": 2.549387805571187e-06, "loss": 0.6048046588897705, "mean_token_accuracy": 0.8179752115160227, "num_tokens": 23280386.0, "step": 5090 }, { "entropy": 0.5786968288943172, "epoch": 0.48089956506877574, "grad_norm": 0.427734375, "learning_rate": 2.541292252533692e-06, "loss": 0.4855860710144043, "mean_token_accuracy": 0.8366754438728095, "num_tokens": 23337825.0, "step": 5100 }, { "entropy": 0.6527865190058947, "epoch": 0.48184250539244, "grad_norm": 0.77734375, "learning_rate": 2.5331962663600067e-06, "loss": 0.5803621768951416, "mean_token_accuracy": 0.8150936767458916, "num_tokens": 23384315.0, "step": 5110 }, { "entropy": 0.5440753613132984, "epoch": 0.48278544571610427, "grad_norm": 0.48046875, "learning_rate": 2.525099931973195e-06, "loss": 0.4513993263244629, "mean_token_accuracy": 0.8605207178741694, "num_tokens": 23426647.0, "step": 5120 }, { "entropy": 0.7320382345467806, "epoch": 0.48372838603976853, "grad_norm": 0.455078125, "learning_rate": 2.5170033342999744e-06, "loss": 0.5450259208679199, "mean_token_accuracy": 0.806569528952241, "num_tokens": 23479860.0, "step": 5130 }, { "entropy": 0.932574069686234, "epoch": 0.4846713263634328, "grad_norm": 0.43359375, "learning_rate": 2.508906558269823e-06, "loss": 0.6856896877288818, "mean_token_accuracy": 0.7718136046081782, "num_tokens": 23524560.0, "step": 5140 }, { "entropy": 0.7975945806130766, "epoch": 0.48561426668709706, "grad_norm": 0.62109375, "learning_rate": 2.50080968881409e-06, "loss": 0.6863570213317871, "mean_token_accuracy": 0.7639251388609409, "num_tokens": 23569479.0, "step": 5150 }, { "entropy": 0.6952396250329912, "epoch": 0.48655720701076133, "grad_norm": 0.44921875, "learning_rate": 2.492712810865104e-06, "loss": 0.650794506072998, "mean_token_accuracy": 0.7981450140476227, "num_tokens": 23613236.0, "step": 5160 }, { "entropy": 0.692944074422121, "epoch": 0.4875001473344256, "grad_norm": 0.390625, "learning_rate": 2.4846160093552844e-06, "loss": 0.5776357173919677, "mean_token_accuracy": 0.8085918761789799, "num_tokens": 23664342.0, "step": 5170 }, { "entropy": 0.6718699016142636, "epoch": 0.48844308765808986, "grad_norm": 0.373046875, "learning_rate": 2.4765193692162464e-06, "loss": 0.5085245132446289, "mean_token_accuracy": 0.8008262846618891, "num_tokens": 23707193.0, "step": 5180 }, { "entropy": 0.706077482830733, "epoch": 0.4893860279817541, "grad_norm": 0.404296875, "learning_rate": 2.4684229753779143e-06, "loss": 0.6562648296356202, "mean_token_accuracy": 0.8039237121120095, "num_tokens": 23752334.0, "step": 5190 }, { "entropy": 0.7011547919362784, "epoch": 0.4903289683054184, "grad_norm": 0.515625, "learning_rate": 2.460326912767629e-06, "loss": 0.531063461303711, "mean_token_accuracy": 0.7961400125175715, "num_tokens": 23798649.0, "step": 5200 }, { "entropy": 0.6769697558134794, "epoch": 0.49127190862908265, "grad_norm": 0.390625, "learning_rate": 2.4522312663092557e-06, "loss": 0.6853522777557373, "mean_token_accuracy": 0.8073696456849575, "num_tokens": 23848741.0, "step": 5210 }, { "entropy": 0.7591002416796983, "epoch": 0.4922148489527469, "grad_norm": 0.67578125, "learning_rate": 2.4441361209222954e-06, "loss": 0.7305190563201904, "mean_token_accuracy": 0.797344889678061, "num_tokens": 23893101.0, "step": 5220 }, { "entropy": 0.6849329901859165, "epoch": 0.4931577892764112, "grad_norm": 0.2314453125, "learning_rate": 2.4360415615209917e-06, "loss": 0.5951381206512452, "mean_token_accuracy": 0.803836777061224, "num_tokens": 23939882.0, "step": 5230 }, { "entropy": 0.7282287730835378, "epoch": 0.49410072960007545, "grad_norm": 0.8203125, "learning_rate": 2.4279476730134434e-06, "loss": 0.7151484966278077, "mean_token_accuracy": 0.7978202365338802, "num_tokens": 23984588.0, "step": 5240 }, { "entropy": 0.5871094174683094, "epoch": 0.4950436699237397, "grad_norm": 0.275390625, "learning_rate": 2.4198545403007096e-06, "loss": 0.43007869720458985, "mean_token_accuracy": 0.8355049606412649, "num_tokens": 24029008.0, "step": 5250 }, { "entropy": 0.7616613085381687, "epoch": 0.495986610247404, "grad_norm": 0.7421875, "learning_rate": 2.411762248275925e-06, "loss": 0.6963319301605224, "mean_token_accuracy": 0.7859408996999264, "num_tokens": 24075516.0, "step": 5260 }, { "entropy": 0.6838515439070761, "epoch": 0.49692955057106825, "grad_norm": 0.462890625, "learning_rate": 2.403670881823402e-06, "loss": 0.4955598831176758, "mean_token_accuracy": 0.8118189193308354, "num_tokens": 24117898.0, "step": 5270 }, { "entropy": 0.7197461973875761, "epoch": 0.4978724908947325, "grad_norm": 0.5625, "learning_rate": 2.395580525817747e-06, "loss": 0.7124035835266114, "mean_token_accuracy": 0.8052475444972516, "num_tokens": 24158791.0, "step": 5280 }, { "entropy": 0.6253745971247554, "epoch": 0.4988154312183968, "grad_norm": 0.375, "learning_rate": 2.3874912651229654e-06, "loss": 0.6346887588500977, "mean_token_accuracy": 0.8198149241507053, "num_tokens": 24200515.0, "step": 5290 }, { "entropy": 0.7803498791530729, "epoch": 0.49975837154206104, "grad_norm": 0.7890625, "learning_rate": 2.3794031845915747e-06, "loss": 0.652740478515625, "mean_token_accuracy": 0.7830078467726708, "num_tokens": 24241164.0, "step": 5300 }, { "entropy": 0.6996277961879969, "epoch": 0.5007013118657253, "grad_norm": 0.53515625, "learning_rate": 2.371316369063712e-06, "loss": 0.48831911087036134, "mean_token_accuracy": 0.8117915650829672, "num_tokens": 24294051.0, "step": 5310 }, { "entropy": 0.7372800389304757, "epoch": 0.5016442521893896, "grad_norm": 0.326171875, "learning_rate": 2.363230903366246e-06, "loss": 0.669452428817749, "mean_token_accuracy": 0.7989845238626003, "num_tokens": 24336401.0, "step": 5320 }, { "entropy": 0.7606853501871228, "epoch": 0.5025871925130538, "grad_norm": 0.66015625, "learning_rate": 2.355146872311886e-06, "loss": 0.5572319984436035, "mean_token_accuracy": 0.7974383737891912, "num_tokens": 24386340.0, "step": 5330 }, { "entropy": 0.621194904576987, "epoch": 0.5035301328367181, "grad_norm": 0.69140625, "learning_rate": 2.3470643606982917e-06, "loss": 0.5595749378204345, "mean_token_accuracy": 0.8278559125959873, "num_tokens": 24438645.0, "step": 5340 }, { "entropy": 0.8461435342207551, "epoch": 0.5044730731603824, "grad_norm": 0.52734375, "learning_rate": 2.338983453307186e-06, "loss": 0.749328899383545, "mean_token_accuracy": 0.768775100260973, "num_tokens": 24483263.0, "step": 5350 }, { "entropy": 0.7757677493616939, "epoch": 0.5054160134840466, "grad_norm": 0.353515625, "learning_rate": 2.3309042349034626e-06, "loss": 0.7084070682525635, "mean_token_accuracy": 0.7868932072073221, "num_tokens": 24529164.0, "step": 5360 }, { "entropy": 0.753884001635015, "epoch": 0.5063589538077109, "grad_norm": 0.55859375, "learning_rate": 2.322826790234301e-06, "loss": 0.584246015548706, "mean_token_accuracy": 0.7949038635939359, "num_tokens": 24570830.0, "step": 5370 }, { "entropy": 0.7765898966928944, "epoch": 0.5073018941313752, "grad_norm": 0.3671875, "learning_rate": 2.314751204028273e-06, "loss": 0.7225810050964355, "mean_token_accuracy": 0.7808141350746155, "num_tokens": 24610942.0, "step": 5380 }, { "entropy": 0.6957989188842475, "epoch": 0.5082448344550394, "grad_norm": 0.349609375, "learning_rate": 2.3066775609944563e-06, "loss": 0.5243014812469482, "mean_token_accuracy": 0.8077589053660631, "num_tokens": 24652698.0, "step": 5390 }, { "entropy": 0.6827801558189094, "epoch": 0.5091877747787037, "grad_norm": 0.470703125, "learning_rate": 2.2986059458215463e-06, "loss": 0.5520379066467285, "mean_token_accuracy": 0.8119027376174927, "num_tokens": 24702847.0, "step": 5400 }, { "entropy": 0.7064282950363122, "epoch": 0.510130715102368, "grad_norm": 0.78515625, "learning_rate": 2.290536443176967e-06, "loss": 0.5469173431396485, "mean_token_accuracy": 0.7847862780094147, "num_tokens": 24750274.0, "step": 5410 }, { "entropy": 0.7025827980600298, "epoch": 0.5110736554260322, "grad_norm": 0.8046875, "learning_rate": 2.2824691377059815e-06, "loss": 0.6773509979248047, "mean_token_accuracy": 0.811617712303996, "num_tokens": 24793348.0, "step": 5420 }, { "entropy": 0.6194292335771024, "epoch": 0.5120165957496965, "grad_norm": 0.64453125, "learning_rate": 2.2744041140308075e-06, "loss": 0.43538432121276854, "mean_token_accuracy": 0.83103067278862, "num_tokens": 24851606.0, "step": 5430 }, { "entropy": 0.6980881096795202, "epoch": 0.5129595360733608, "grad_norm": 0.326171875, "learning_rate": 2.266341456749728e-06, "loss": 0.5463144302368164, "mean_token_accuracy": 0.814735346660018, "num_tokens": 24893529.0, "step": 5440 }, { "entropy": 0.6669334940612316, "epoch": 0.513902476397025, "grad_norm": 0.66796875, "learning_rate": 2.2582812504362016e-06, "loss": 0.6203276634216308, "mean_token_accuracy": 0.817523836158216, "num_tokens": 24938994.0, "step": 5450 }, { "entropy": 0.6864639653824269, "epoch": 0.5148454167206893, "grad_norm": 0.400390625, "learning_rate": 2.2502235796379786e-06, "loss": 0.6700600147247314, "mean_token_accuracy": 0.7997597053647041, "num_tokens": 24989371.0, "step": 5460 }, { "entropy": 0.7375475165434182, "epoch": 0.5157883570443536, "grad_norm": 0.3828125, "learning_rate": 2.2421685288762133e-06, "loss": 0.739337682723999, "mean_token_accuracy": 0.8012431789189577, "num_tokens": 25026248.0, "step": 5470 }, { "entropy": 0.7337912478949875, "epoch": 0.5167312973680178, "grad_norm": 0.37890625, "learning_rate": 2.2341161826445764e-06, "loss": 0.6376617431640625, "mean_token_accuracy": 0.7975466061383486, "num_tokens": 25070722.0, "step": 5480 }, { "entropy": 0.6371306877117604, "epoch": 0.5176742376916821, "grad_norm": 0.498046875, "learning_rate": 2.2260666254083695e-06, "loss": 0.46918063163757323, "mean_token_accuracy": 0.8177219878882169, "num_tokens": 25115523.0, "step": 5490 }, { "entropy": 0.5692290297709406, "epoch": 0.5186171780153463, "grad_norm": 0.9921875, "learning_rate": 2.2180199416036385e-06, "loss": 0.5440778255462646, "mean_token_accuracy": 0.8257677935063839, "num_tokens": 25172217.0, "step": 5500 }, { "entropy": 0.6837885739281774, "epoch": 0.5195601183390106, "grad_norm": 0.5546875, "learning_rate": 2.2099762156362897e-06, "loss": 0.7906906604766846, "mean_token_accuracy": 0.814153590425849, "num_tokens": 25209734.0, "step": 5510 }, { "entropy": 0.8297489018645138, "epoch": 0.5205030586626749, "grad_norm": 0.55078125, "learning_rate": 2.201935531881202e-06, "loss": 0.715370512008667, "mean_token_accuracy": 0.7802321035414934, "num_tokens": 25263278.0, "step": 5520 }, { "entropy": 0.6839754433371127, "epoch": 0.5214459989863391, "grad_norm": 0.62890625, "learning_rate": 2.1938979746813435e-06, "loss": 0.5679389953613281, "mean_token_accuracy": 0.8094680864363909, "num_tokens": 25312769.0, "step": 5530 }, { "entropy": 0.7027344678528606, "epoch": 0.5223889393100034, "grad_norm": 0.302734375, "learning_rate": 2.1858636283468853e-06, "loss": 0.6222816467285156, "mean_token_accuracy": 0.8174486592411995, "num_tokens": 25363056.0, "step": 5540 }, { "entropy": 0.7847942772321403, "epoch": 0.5233318796336677, "grad_norm": 1.0078125, "learning_rate": 2.1778325771543184e-06, "loss": 0.5383003234863282, "mean_token_accuracy": 0.7966303894296288, "num_tokens": 25403541.0, "step": 5550 }, { "entropy": 0.7017437141388655, "epoch": 0.5242748199573319, "grad_norm": 0.42578125, "learning_rate": 2.1698049053455707e-06, "loss": 0.5788224220275879, "mean_token_accuracy": 0.8125591490417718, "num_tokens": 25455315.0, "step": 5560 }, { "entropy": 0.7177816702984273, "epoch": 0.5252177602809962, "grad_norm": 0.44140625, "learning_rate": 2.1617806971271205e-06, "loss": 0.5685774326324463, "mean_token_accuracy": 0.785433416813612, "num_tokens": 25508053.0, "step": 5570 }, { "entropy": 0.6137881996575743, "epoch": 0.5261607006046605, "grad_norm": 0.4296875, "learning_rate": 2.153760036669115e-06, "loss": 0.54885892868042, "mean_token_accuracy": 0.8225920587778092, "num_tokens": 25558186.0, "step": 5580 }, { "entropy": 0.646233162516728, "epoch": 0.5271036409283247, "grad_norm": 0.419921875, "learning_rate": 2.1457430081044864e-06, "loss": 0.5985296726226806, "mean_token_accuracy": 0.8277124404907227, "num_tokens": 25608608.0, "step": 5590 }, { "entropy": 0.7152201779186725, "epoch": 0.528046581251989, "grad_norm": 0.69921875, "learning_rate": 2.137729695528071e-06, "loss": 0.5779585361480712, "mean_token_accuracy": 0.8061476524919271, "num_tokens": 25657647.0, "step": 5600 }, { "entropy": 0.6737063567154109, "epoch": 0.5289895215756533, "grad_norm": 0.57421875, "learning_rate": 2.129720182995727e-06, "loss": 0.6868101596832276, "mean_token_accuracy": 0.8116919990628958, "num_tokens": 25700172.0, "step": 5610 }, { "entropy": 0.6977092338725924, "epoch": 0.5299324618993175, "grad_norm": 0.32421875, "learning_rate": 2.1217145545234494e-06, "loss": 0.6692411422729492, "mean_token_accuracy": 0.8033047847449779, "num_tokens": 25752498.0, "step": 5620 }, { "entropy": 0.7011082604527473, "epoch": 0.5308754022229818, "grad_norm": 0.51171875, "learning_rate": 2.1137128940864937e-06, "loss": 0.6209464550018311, "mean_token_accuracy": 0.7912783624604345, "num_tokens": 25798610.0, "step": 5630 }, { "entropy": 0.7150249132886529, "epoch": 0.5318183425466461, "grad_norm": 0.435546875, "learning_rate": 2.105715285618491e-06, "loss": 0.6976465702056884, "mean_token_accuracy": 0.797979774326086, "num_tokens": 25848826.0, "step": 5640 }, { "entropy": 0.6213484527543187, "epoch": 0.5327612828703103, "grad_norm": 0.263671875, "learning_rate": 2.0977218130105698e-06, "loss": 0.5264866828918457, "mean_token_accuracy": 0.8229496419429779, "num_tokens": 25895349.0, "step": 5650 }, { "entropy": 0.6708037904463708, "epoch": 0.5337042231939746, "grad_norm": 0.447265625, "learning_rate": 2.0897325601104756e-06, "loss": 0.588989543914795, "mean_token_accuracy": 0.7981192912906409, "num_tokens": 25940046.0, "step": 5660 }, { "entropy": 0.6789191416930407, "epoch": 0.5346471635176389, "grad_norm": 0.265625, "learning_rate": 2.08174761072169e-06, "loss": 0.5451597213745117, "mean_token_accuracy": 0.8029395695775747, "num_tokens": 25983827.0, "step": 5670 }, { "entropy": 0.5920437740162015, "epoch": 0.5355901038413031, "grad_norm": 0.78125, "learning_rate": 2.0737670486025545e-06, "loss": 0.4877305507659912, "mean_token_accuracy": 0.8246560201048851, "num_tokens": 26026651.0, "step": 5680 }, { "entropy": 0.7011357684619725, "epoch": 0.5365330441649674, "grad_norm": 0.458984375, "learning_rate": 2.0657909574653894e-06, "loss": 0.6222146987915039, "mean_token_accuracy": 0.7912551097571849, "num_tokens": 26070473.0, "step": 5690 }, { "entropy": 0.6917565542273223, "epoch": 0.5374759844886317, "grad_norm": 0.546875, "learning_rate": 2.0578194209756165e-06, "loss": 0.4957622528076172, "mean_token_accuracy": 0.8071240916848182, "num_tokens": 26114544.0, "step": 5700 }, { "entropy": 0.6250287326984107, "epoch": 0.5384189248122959, "grad_norm": 0.46875, "learning_rate": 2.0498525227508807e-06, "loss": 0.5066961765289306, "mean_token_accuracy": 0.8199310664087534, "num_tokens": 26162592.0, "step": 5710 }, { "entropy": 0.7448068944737315, "epoch": 0.5393618651359602, "grad_norm": 0.265625, "learning_rate": 2.041890346360176e-06, "loss": 0.5603039741516114, "mean_token_accuracy": 0.8090826883912087, "num_tokens": 26218601.0, "step": 5720 }, { "entropy": 0.8320084512233734, "epoch": 0.5403048054596244, "grad_norm": 0.640625, "learning_rate": 2.0339329753229635e-06, "loss": 0.6805224895477295, "mean_token_accuracy": 0.7954841999337077, "num_tokens": 26263287.0, "step": 5730 }, { "entropy": 0.6348516764119267, "epoch": 0.5412477457832887, "grad_norm": 0.71875, "learning_rate": 2.0259804931083012e-06, "loss": 0.5312628269195556, "mean_token_accuracy": 0.8127726577222347, "num_tokens": 26310034.0, "step": 5740 }, { "entropy": 0.6182076470926404, "epoch": 0.542190686106953, "grad_norm": 0.490234375, "learning_rate": 2.0180329831339637e-06, "loss": 0.529332160949707, "mean_token_accuracy": 0.824046990275383, "num_tokens": 26346391.0, "step": 5750 }, { "entropy": 0.6656064330600202, "epoch": 0.5431336264306172, "grad_norm": 0.70703125, "learning_rate": 2.0100905287655704e-06, "loss": 0.7039621353149415, "mean_token_accuracy": 0.8080949112772942, "num_tokens": 26388266.0, "step": 5760 }, { "entropy": 0.7996745721437037, "epoch": 0.5440765667542815, "grad_norm": 0.52734375, "learning_rate": 2.002153213315709e-06, "loss": 0.6947851657867432, "mean_token_accuracy": 0.7908861048519611, "num_tokens": 26439880.0, "step": 5770 }, { "entropy": 0.678467130381614, "epoch": 0.5450195070779458, "grad_norm": 0.384765625, "learning_rate": 1.9942211200430634e-06, "loss": 0.5658381938934326, "mean_token_accuracy": 0.818194093927741, "num_tokens": 26483322.0, "step": 5780 }, { "entropy": 0.6941055947914719, "epoch": 0.54596244740161, "grad_norm": 0.248046875, "learning_rate": 1.986294332151538e-06, "loss": 0.705126428604126, "mean_token_accuracy": 0.8105139836668969, "num_tokens": 26533766.0, "step": 5790 }, { "entropy": 0.6308328908868134, "epoch": 0.5469053877252743, "grad_norm": 0.5078125, "learning_rate": 1.9783729327893865e-06, "loss": 0.5511210918426513, "mean_token_accuracy": 0.8163013540208339, "num_tokens": 26581428.0, "step": 5800 }, { "entropy": 0.7102134318090976, "epoch": 0.5478483280489386, "grad_norm": 0.28125, "learning_rate": 1.9704570050483404e-06, "loss": 0.5507728576660156, "mean_token_accuracy": 0.8015400886535644, "num_tokens": 26620358.0, "step": 5810 }, { "entropy": 0.7275429900735617, "epoch": 0.5487912683726028, "grad_norm": 0.9609375, "learning_rate": 1.962546631962736e-06, "loss": 0.6528871536254883, "mean_token_accuracy": 0.8041394516825676, "num_tokens": 26661174.0, "step": 5820 }, { "entropy": 0.6613958537112922, "epoch": 0.5497342086962671, "grad_norm": 0.65625, "learning_rate": 1.9546418965086444e-06, "loss": 0.6786399841308594, "mean_token_accuracy": 0.8156840946525336, "num_tokens": 26710819.0, "step": 5830 }, { "entropy": 0.7236452325247228, "epoch": 0.5506771490199314, "grad_norm": 0.76171875, "learning_rate": 1.946742881602999e-06, "loss": 0.6853342533111573, "mean_token_accuracy": 0.8027016900479793, "num_tokens": 26758188.0, "step": 5840 }, { "entropy": 0.6812964378856122, "epoch": 0.5516200893435956, "grad_norm": 0.58203125, "learning_rate": 1.9388496701027277e-06, "loss": 0.6243832588195801, "mean_token_accuracy": 0.8085433639585972, "num_tokens": 26804314.0, "step": 5850 }, { "entropy": 0.7152590912766754, "epoch": 0.5525630296672599, "grad_norm": 0.458984375, "learning_rate": 1.9309623448038864e-06, "loss": 0.7200493335723877, "mean_token_accuracy": 0.7995035350322723, "num_tokens": 26859814.0, "step": 5860 }, { "entropy": 0.87381039140746, "epoch": 0.5535059699909242, "grad_norm": 0.7421875, "learning_rate": 1.923080988440784e-06, "loss": 0.6745802402496338, "mean_token_accuracy": 0.769163049198687, "num_tokens": 26898475.0, "step": 5870 }, { "entropy": 0.8256870447658002, "epoch": 0.5544489103145884, "grad_norm": 0.56640625, "learning_rate": 1.9152056836851195e-06, "loss": 0.650912094116211, "mean_token_accuracy": 0.7772346431389451, "num_tokens": 26943779.0, "step": 5880 }, { "entropy": 0.7375765237025916, "epoch": 0.5553918506382527, "grad_norm": 0.361328125, "learning_rate": 1.9073365131451138e-06, "loss": 0.5638370990753174, "mean_token_accuracy": 0.7974175462499261, "num_tokens": 26990072.0, "step": 5890 }, { "entropy": 0.6312047270126641, "epoch": 0.556334790961917, "grad_norm": 0.53125, "learning_rate": 1.899473559364641e-06, "loss": 0.5202350616455078, "mean_token_accuracy": 0.8370380699634552, "num_tokens": 27033233.0, "step": 5900 }, { "entropy": 0.660971057927236, "epoch": 0.5572777312855812, "grad_norm": 0.474609375, "learning_rate": 1.891616904822366e-06, "loss": 0.5475841522216797, "mean_token_accuracy": 0.8027979079633951, "num_tokens": 27081850.0, "step": 5910 }, { "entropy": 0.6727430471219122, "epoch": 0.5582206716092455, "grad_norm": 0.490234375, "learning_rate": 1.883766631930878e-06, "loss": 0.5413420677185059, "mean_token_accuracy": 0.8251585308462381, "num_tokens": 27130545.0, "step": 5920 }, { "entropy": 0.6418562413193285, "epoch": 0.5591636119329098, "grad_norm": 0.365234375, "learning_rate": 1.8759228230358244e-06, "loss": 0.5960840702056884, "mean_token_accuracy": 0.832189904898405, "num_tokens": 27176239.0, "step": 5930 }, { "entropy": 0.6648577735759318, "epoch": 0.560106552256574, "grad_norm": 0.404296875, "learning_rate": 1.8680855604150492e-06, "loss": 0.6448702812194824, "mean_token_accuracy": 0.8221142962574959, "num_tokens": 27224848.0, "step": 5940 }, { "entropy": 0.6807060082443058, "epoch": 0.5610494925802383, "grad_norm": 0.60546875, "learning_rate": 1.860254926277728e-06, "loss": 0.5650904655456543, "mean_token_accuracy": 0.8069817528128624, "num_tokens": 27271544.0, "step": 5950 }, { "entropy": 0.8060918380506337, "epoch": 0.5619924329039026, "grad_norm": 0.453125, "learning_rate": 1.8524310027635084e-06, "loss": 0.7444260597229004, "mean_token_accuracy": 0.7830769976601004, "num_tokens": 27320762.0, "step": 5960 }, { "entropy": 0.6863439489156008, "epoch": 0.5629353732275668, "grad_norm": 0.48046875, "learning_rate": 1.8446138719416452e-06, "loss": 0.5965976715087891, "mean_token_accuracy": 0.8035622656345367, "num_tokens": 27368194.0, "step": 5970 }, { "entropy": 0.6725466954987496, "epoch": 0.5638783135512311, "grad_norm": 0.41015625, "learning_rate": 1.8368036158101415e-06, "loss": 0.6167645454406738, "mean_token_accuracy": 0.8260718215256929, "num_tokens": 27407957.0, "step": 5980 }, { "entropy": 0.7055775175336748, "epoch": 0.5648212538748953, "grad_norm": 0.60546875, "learning_rate": 1.8290003162948893e-06, "loss": 0.7305053234100342, "mean_token_accuracy": 0.805973731353879, "num_tokens": 27448255.0, "step": 5990 }, { "entropy": 0.6864317794330418, "epoch": 0.5657641941985596, "grad_norm": 0.47265625, "learning_rate": 1.8212040552488081e-06, "loss": 0.5233036518096924, "mean_token_accuracy": 0.8087876638397574, "num_tokens": 27492568.0, "step": 6000 }, { "entropy": 0.8008205661550164, "epoch": 0.5667071345222239, "grad_norm": 0.267578125, "learning_rate": 1.8134149144509861e-06, "loss": 0.6945072650909424, "mean_token_accuracy": 0.7832493115216493, "num_tokens": 27535293.0, "step": 6010 }, { "entropy": 0.7050473445095122, "epoch": 0.5676500748458881, "grad_norm": 0.39453125, "learning_rate": 1.8056329756058249e-06, "loss": 0.6400737762451172, "mean_token_accuracy": 0.8038847412914037, "num_tokens": 27581501.0, "step": 6020 }, { "entropy": 0.7546293061226607, "epoch": 0.5685930151695524, "grad_norm": 0.40625, "learning_rate": 1.7978583203421812e-06, "loss": 0.6627458572387696, "mean_token_accuracy": 0.7845555316656828, "num_tokens": 27629782.0, "step": 6030 }, { "entropy": 0.7452189083211124, "epoch": 0.5695359554932167, "grad_norm": 0.5078125, "learning_rate": 1.7900910302125086e-06, "loss": 0.5804001331329346, "mean_token_accuracy": 0.7970978146418929, "num_tokens": 27678902.0, "step": 6040 }, { "entropy": 0.7050665612798184, "epoch": 0.5704788958168809, "grad_norm": 0.4140625, "learning_rate": 1.7823311866920068e-06, "loss": 0.5286674499511719, "mean_token_accuracy": 0.7994862403720617, "num_tokens": 27717460.0, "step": 6050 }, { "entropy": 0.6447273494210094, "epoch": 0.5714218361405452, "grad_norm": 1.140625, "learning_rate": 1.7745788711777611e-06, "loss": 0.5664659976959229, "mean_token_accuracy": 0.8183193821460009, "num_tokens": 27763408.0, "step": 6060 }, { "entropy": 0.7607476971112191, "epoch": 0.5723647764642095, "grad_norm": 0.357421875, "learning_rate": 1.766834164987894e-06, "loss": 0.6255624294281006, "mean_token_accuracy": 0.7873752404004335, "num_tokens": 27808897.0, "step": 6070 }, { "entropy": 0.6860075819306075, "epoch": 0.5733077167878737, "grad_norm": 0.283203125, "learning_rate": 1.7590971493607072e-06, "loss": 0.6039350509643555, "mean_token_accuracy": 0.8028590308502317, "num_tokens": 27854713.0, "step": 6080 }, { "entropy": 0.8293744221329689, "epoch": 0.574250657111538, "grad_norm": 0.67578125, "learning_rate": 1.7513679054538352e-06, "loss": 0.7157419681549072, "mean_token_accuracy": 0.7663772650063038, "num_tokens": 27900429.0, "step": 6090 }, { "entropy": 0.8774604101665318, "epoch": 0.5751935974352024, "grad_norm": 0.412109375, "learning_rate": 1.743646514343388e-06, "loss": 0.5146266937255859, "mean_token_accuracy": 0.7756213560700417, "num_tokens": 27943940.0, "step": 6100 }, { "entropy": 0.5941920497454702, "epoch": 0.5761365377588666, "grad_norm": 0.57421875, "learning_rate": 1.7359330570231049e-06, "loss": 0.6486340999603272, "mean_token_accuracy": 0.8262489166110754, "num_tokens": 27989276.0, "step": 6110 }, { "entropy": 0.6428902736864984, "epoch": 0.5770794780825309, "grad_norm": 0.390625, "learning_rate": 1.7282276144035037e-06, "loss": 0.6077763080596924, "mean_token_accuracy": 0.8120482333004475, "num_tokens": 28026618.0, "step": 6120 }, { "entropy": 0.7213725323788822, "epoch": 0.5780224184061952, "grad_norm": 2.078125, "learning_rate": 1.7205302673110308e-06, "loss": 0.7364995002746582, "mean_token_accuracy": 0.7888428892940282, "num_tokens": 28081339.0, "step": 6130 }, { "entropy": 0.7310086984187365, "epoch": 0.5789653587298594, "grad_norm": 0.9609375, "learning_rate": 1.7128410964872152e-06, "loss": 0.5657924175262451, "mean_token_accuracy": 0.7936812553554773, "num_tokens": 28117903.0, "step": 6140 }, { "entropy": 0.7583439980633557, "epoch": 0.5799082990535237, "grad_norm": 0.5078125, "learning_rate": 1.7051601825878203e-06, "loss": 0.5908254146575928, "mean_token_accuracy": 0.7944333799183368, "num_tokens": 28162769.0, "step": 6150 }, { "entropy": 0.6405745659023523, "epoch": 0.580851239377188, "grad_norm": 0.58203125, "learning_rate": 1.6974876061819973e-06, "loss": 0.5538061618804931, "mean_token_accuracy": 0.8247173227369785, "num_tokens": 28203429.0, "step": 6160 }, { "entropy": 0.766948539763689, "epoch": 0.5817941797008522, "grad_norm": 0.2275390625, "learning_rate": 1.6898234477514442e-06, "loss": 0.6483793735504151, "mean_token_accuracy": 0.7911493647843599, "num_tokens": 28252124.0, "step": 6170 }, { "entropy": 0.6414849878288805, "epoch": 0.5827371200245165, "grad_norm": 0.447265625, "learning_rate": 1.6821677876895554e-06, "loss": 0.5362122535705567, "mean_token_accuracy": 0.8220501244068146, "num_tokens": 28304670.0, "step": 6180 }, { "entropy": 0.6628352930769325, "epoch": 0.5836800603481808, "grad_norm": 0.248046875, "learning_rate": 1.6745207063005819e-06, "loss": 0.5948177814483643, "mean_token_accuracy": 0.8272610239684581, "num_tokens": 28342263.0, "step": 6190 }, { "entropy": 0.7425322285853326, "epoch": 0.584623000671845, "grad_norm": 0.2431640625, "learning_rate": 1.6668822837987894e-06, "loss": 0.646372127532959, "mean_token_accuracy": 0.7970950407907367, "num_tokens": 28394678.0, "step": 6200 }, { "entropy": 0.6451410392299295, "epoch": 0.5855659409955093, "grad_norm": 0.326171875, "learning_rate": 1.6592526003076148e-06, "loss": 0.6016067028045654, "mean_token_accuracy": 0.8238395698368549, "num_tokens": 28449882.0, "step": 6210 }, { "entropy": 0.6584913536906243, "epoch": 0.5865088813191736, "grad_norm": 0.369140625, "learning_rate": 1.6516317358588285e-06, "loss": 0.5983861923217774, "mean_token_accuracy": 0.8156170316040516, "num_tokens": 28488572.0, "step": 6220 }, { "entropy": 0.5571296599693596, "epoch": 0.5874518216428378, "grad_norm": 0.322265625, "learning_rate": 1.6440197703916928e-06, "loss": 0.4304994583129883, "mean_token_accuracy": 0.8418979216367006, "num_tokens": 28534773.0, "step": 6230 }, { "entropy": 0.6841351325623691, "epoch": 0.5883947619665021, "grad_norm": 0.376953125, "learning_rate": 1.6364167837521222e-06, "loss": 0.6759282112121582, "mean_token_accuracy": 0.7826384872198104, "num_tokens": 28576209.0, "step": 6240 }, { "entropy": 0.7507536704652011, "epoch": 0.5893377022901664, "grad_norm": 0.482421875, "learning_rate": 1.6288228556918495e-06, "loss": 0.605400562286377, "mean_token_accuracy": 0.7974974766373635, "num_tokens": 28615687.0, "step": 6250 }, { "entropy": 0.7499837163835764, "epoch": 0.5902806426138306, "grad_norm": 0.400390625, "learning_rate": 1.621238065867587e-06, "loss": 0.6003370761871338, "mean_token_accuracy": 0.7996041260659694, "num_tokens": 28660419.0, "step": 6260 }, { "entropy": 0.7148910771124065, "epoch": 0.5912235829374949, "grad_norm": 0.240234375, "learning_rate": 1.61366249384019e-06, "loss": 0.5587523937225342, "mean_token_accuracy": 0.8005239397287369, "num_tokens": 28700915.0, "step": 6270 }, { "entropy": 0.7900654837023466, "epoch": 0.5921665232611592, "grad_norm": 0.4296875, "learning_rate": 1.606096219073825e-06, "loss": 0.7255774974822998, "mean_token_accuracy": 0.7740635454654694, "num_tokens": 28742016.0, "step": 6280 }, { "entropy": 0.6664929877966642, "epoch": 0.5931094635848234, "grad_norm": 0.32421875, "learning_rate": 1.598539320935134e-06, "loss": 0.5831618785858155, "mean_token_accuracy": 0.8241768430918455, "num_tokens": 28787025.0, "step": 6290 }, { "entropy": 0.841880920343101, "epoch": 0.5940524039084877, "grad_norm": 0.46875, "learning_rate": 1.5909918786924027e-06, "loss": 0.8506629943847657, "mean_token_accuracy": 0.7675380181521178, "num_tokens": 28835489.0, "step": 6300 }, { "entropy": 0.7314032892696559, "epoch": 0.594995344232152, "grad_norm": 0.703125, "learning_rate": 1.583453971514729e-06, "loss": 0.5955713272094727, "mean_token_accuracy": 0.8092577937990427, "num_tokens": 28878914.0, "step": 6310 }, { "entropy": 0.6585373728536069, "epoch": 0.5959382845558162, "grad_norm": 0.5546875, "learning_rate": 1.5759256784711917e-06, "loss": 0.6605970382690429, "mean_token_accuracy": 0.8271971605718136, "num_tokens": 28926182.0, "step": 6320 }, { "entropy": 0.8336781755089759, "epoch": 0.5968812248794805, "grad_norm": 0.53125, "learning_rate": 1.568407078530023e-06, "loss": 0.7155747890472413, "mean_token_accuracy": 0.7782786898314953, "num_tokens": 28972429.0, "step": 6330 }, { "entropy": 0.6537047138437628, "epoch": 0.5978241652031447, "grad_norm": 0.34765625, "learning_rate": 1.560898250557778e-06, "loss": 0.5683440685272216, "mean_token_accuracy": 0.8080581244081259, "num_tokens": 29020109.0, "step": 6340 }, { "entropy": 0.6812858050689101, "epoch": 0.598767105526809, "grad_norm": 0.6640625, "learning_rate": 1.5533992733185094e-06, "loss": 0.6385911464691162, "mean_token_accuracy": 0.8044985607266426, "num_tokens": 29063213.0, "step": 6350 }, { "entropy": 0.68090706942603, "epoch": 0.5997100458504733, "grad_norm": 0.79296875, "learning_rate": 1.54591022547294e-06, "loss": 0.5990062713623047, "mean_token_accuracy": 0.818465144187212, "num_tokens": 29101529.0, "step": 6360 }, { "entropy": 0.6892360879923217, "epoch": 0.6006529861741375, "grad_norm": 0.35546875, "learning_rate": 1.5384311855776378e-06, "loss": 0.6381627082824707, "mean_token_accuracy": 0.8170299537479877, "num_tokens": 29151636.0, "step": 6370 }, { "entropy": 0.7919900326058269, "epoch": 0.6015959264978018, "grad_norm": 0.392578125, "learning_rate": 1.5309622320841928e-06, "loss": 0.6791030406951905, "mean_token_accuracy": 0.7774041363038122, "num_tokens": 29195688.0, "step": 6380 }, { "entropy": 0.7630477277562022, "epoch": 0.6025388668214661, "grad_norm": 0.22265625, "learning_rate": 1.5235034433383922e-06, "loss": 0.6549117565155029, "mean_token_accuracy": 0.7939501941204071, "num_tokens": 29241182.0, "step": 6390 }, { "entropy": 0.6038443365134298, "epoch": 0.6034818071451303, "grad_norm": 0.79296875, "learning_rate": 1.516054897579401e-06, "loss": 0.538882064819336, "mean_token_accuracy": 0.827283251285553, "num_tokens": 29288939.0, "step": 6400 }, { "entropy": 0.6935314170084894, "epoch": 0.6044247474687946, "grad_norm": 0.4921875, "learning_rate": 1.5086166729389392e-06, "loss": 0.7098958969116211, "mean_token_accuracy": 0.8060619793832302, "num_tokens": 29330647.0, "step": 6410 }, { "entropy": 0.6182787658646702, "epoch": 0.6053676877924589, "grad_norm": 0.7109375, "learning_rate": 1.5011888474404635e-06, "loss": 0.5699858665466309, "mean_token_accuracy": 0.8177945427596569, "num_tokens": 29375563.0, "step": 6420 }, { "entropy": 0.6610123321413994, "epoch": 0.6063106281161231, "grad_norm": 0.546875, "learning_rate": 1.493771498998349e-06, "loss": 0.5734387397766113, "mean_token_accuracy": 0.8026046641170979, "num_tokens": 29412770.0, "step": 6430 }, { "entropy": 0.6550191486254334, "epoch": 0.6072535684397874, "grad_norm": 0.48828125, "learning_rate": 1.486364705417071e-06, "loss": 0.575551700592041, "mean_token_accuracy": 0.8128551565110683, "num_tokens": 29457089.0, "step": 6440 }, { "entropy": 0.6363603160483763, "epoch": 0.6081965087634517, "grad_norm": 0.37890625, "learning_rate": 1.4789685443903894e-06, "loss": 0.585049819946289, "mean_token_accuracy": 0.820637421682477, "num_tokens": 29511977.0, "step": 6450 }, { "entropy": 0.5975639001466334, "epoch": 0.6091394490871159, "grad_norm": 0.39453125, "learning_rate": 1.471583093500532e-06, "loss": 0.4691169738769531, "mean_token_accuracy": 0.8282858118414879, "num_tokens": 29560593.0, "step": 6460 }, { "entropy": 0.6914234139025212, "epoch": 0.6100823894107802, "grad_norm": 0.30859375, "learning_rate": 1.4642084302173867e-06, "loss": 0.5843109607696533, "mean_token_accuracy": 0.8037613401189446, "num_tokens": 29612477.0, "step": 6470 }, { "entropy": 0.720405780756846, "epoch": 0.6110253297344445, "grad_norm": 1.3671875, "learning_rate": 1.4568446318976804e-06, "loss": 0.612605094909668, "mean_token_accuracy": 0.7900254150852561, "num_tokens": 29653283.0, "step": 6480 }, { "entropy": 0.6390435563400387, "epoch": 0.6119682700581087, "grad_norm": 0.47265625, "learning_rate": 1.449491775784172e-06, "loss": 0.5124198436737061, "mean_token_accuracy": 0.8260769449174404, "num_tokens": 29700246.0, "step": 6490 }, { "entropy": 0.6470420122146606, "epoch": 0.612911210381773, "grad_norm": 0.90625, "learning_rate": 1.442149939004845e-06, "loss": 0.6141894340515137, "mean_token_accuracy": 0.8217171192169189, "num_tokens": 29752904.0, "step": 6500 }, { "entropy": 0.5653758386150003, "epoch": 0.6138541507054373, "grad_norm": 0.43359375, "learning_rate": 1.4348191985720905e-06, "loss": 0.5112238883972168, "mean_token_accuracy": 0.8314279425889254, "num_tokens": 29791019.0, "step": 6510 }, { "entropy": 0.6899514342658222, "epoch": 0.6147970910291015, "grad_norm": 0.44140625, "learning_rate": 1.4274996313819093e-06, "loss": 0.5467896461486816, "mean_token_accuracy": 0.8154542069882155, "num_tokens": 29837978.0, "step": 6520 }, { "entropy": 0.7366321623325348, "epoch": 0.6157400313527658, "grad_norm": 0.439453125, "learning_rate": 1.4201913142130953e-06, "loss": 0.5235143661499023, "mean_token_accuracy": 0.797525929659605, "num_tokens": 29885619.0, "step": 6530 }, { "entropy": 0.7723901643417775, "epoch": 0.61668297167643, "grad_norm": 0.5625, "learning_rate": 1.4128943237264397e-06, "loss": 0.6222280502319336, "mean_token_accuracy": 0.7883600037544966, "num_tokens": 29929441.0, "step": 6540 }, { "entropy": 0.7317868547514081, "epoch": 0.6176259120000943, "grad_norm": 0.28515625, "learning_rate": 1.4056087364639177e-06, "loss": 0.6348618984222412, "mean_token_accuracy": 0.7977587293833495, "num_tokens": 29980994.0, "step": 6550 }, { "entropy": 0.6215764599852264, "epoch": 0.6185688523237586, "grad_norm": 0.30859375, "learning_rate": 1.3983346288478934e-06, "loss": 0.46146564483642577, "mean_token_accuracy": 0.8226776365190744, "num_tokens": 30036423.0, "step": 6560 }, { "entropy": 0.7115271213464439, "epoch": 0.6195117926474228, "grad_norm": 0.6171875, "learning_rate": 1.3910720771803138e-06, "loss": 0.5262360572814941, "mean_token_accuracy": 0.815481587126851, "num_tokens": 30083567.0, "step": 6570 }, { "entropy": 0.6607028277590871, "epoch": 0.6204547329710871, "grad_norm": 0.546875, "learning_rate": 1.3838211576419084e-06, "loss": 0.6297407627105713, "mean_token_accuracy": 0.8033003844320774, "num_tokens": 30123282.0, "step": 6580 }, { "entropy": 0.8542975519783795, "epoch": 0.6213976732947514, "grad_norm": 0.380859375, "learning_rate": 1.3765819462913935e-06, "loss": 0.6734577655792237, "mean_token_accuracy": 0.7789794001728296, "num_tokens": 30175834.0, "step": 6590 }, { "entropy": 0.6683274048380554, "epoch": 0.6223406136184156, "grad_norm": 0.2578125, "learning_rate": 1.3693545190646687e-06, "loss": 0.5290188312530517, "mean_token_accuracy": 0.8123727187514305, "num_tokens": 30230839.0, "step": 6600 }, { "entropy": 0.8296206023544073, "epoch": 0.6232835539420799, "grad_norm": 0.376953125, "learning_rate": 1.3621389517740278e-06, "loss": 0.6783339023590088, "mean_token_accuracy": 0.772437755856663, "num_tokens": 30276477.0, "step": 6610 }, { "entropy": 0.7358615064062178, "epoch": 0.6242264942657442, "grad_norm": 0.55078125, "learning_rate": 1.354935320107355e-06, "loss": 0.7653596878051758, "mean_token_accuracy": 0.7917595565319061, "num_tokens": 30322719.0, "step": 6620 }, { "entropy": 0.6063522500917315, "epoch": 0.6251694345894084, "grad_norm": 0.421875, "learning_rate": 1.3477436996273391e-06, "loss": 0.493528938293457, "mean_token_accuracy": 0.8317346017807722, "num_tokens": 30366460.0, "step": 6630 }, { "entropy": 0.6097435717936606, "epoch": 0.6261123749130727, "grad_norm": 0.265625, "learning_rate": 1.340564165770677e-06, "loss": 0.5172214508056641, "mean_token_accuracy": 0.8287797518074512, "num_tokens": 30413005.0, "step": 6640 }, { "entropy": 0.7791145509108901, "epoch": 0.627055315236737, "grad_norm": 0.330078125, "learning_rate": 1.3333967938472791e-06, "loss": 0.6306872844696045, "mean_token_accuracy": 0.7808555860072375, "num_tokens": 30452797.0, "step": 6650 }, { "entropy": 0.7186586172319949, "epoch": 0.6279982555604012, "grad_norm": 0.2060546875, "learning_rate": 1.326241659039488e-06, "loss": 0.7230193614959717, "mean_token_accuracy": 0.8053840888664127, "num_tokens": 30501667.0, "step": 6660 }, { "entropy": 0.713790905289352, "epoch": 0.6289411958840655, "grad_norm": 0.36328125, "learning_rate": 1.3190988364012798e-06, "loss": 0.664982271194458, "mean_token_accuracy": 0.8036589544266463, "num_tokens": 30546332.0, "step": 6670 }, { "entropy": 0.7191013899631798, "epoch": 0.6298841362077298, "grad_norm": 1.1640625, "learning_rate": 1.3119684008574854e-06, "loss": 0.6084727287292481, "mean_token_accuracy": 0.7926711194217205, "num_tokens": 30592915.0, "step": 6680 }, { "entropy": 0.7162378825247288, "epoch": 0.630827076531394, "grad_norm": 0.51171875, "learning_rate": 1.3048504272029983e-06, "loss": 0.6665098190307617, "mean_token_accuracy": 0.7999292813241482, "num_tokens": 30630783.0, "step": 6690 }, { "entropy": 0.6918003332801164, "epoch": 0.6317700168550583, "grad_norm": 0.44140625, "learning_rate": 1.297744990101995e-06, "loss": 0.7901312828063964, "mean_token_accuracy": 0.8032176718115807, "num_tokens": 30684178.0, "step": 6700 }, { "entropy": 0.6030714954715222, "epoch": 0.6327129571787226, "grad_norm": 0.470703125, "learning_rate": 1.2906521640871492e-06, "loss": 0.5561746597290039, "mean_token_accuracy": 0.8341683767735958, "num_tokens": 30729882.0, "step": 6710 }, { "entropy": 0.616637565754354, "epoch": 0.6336558975023868, "grad_norm": 0.310546875, "learning_rate": 1.2835720235588475e-06, "loss": 0.572420072555542, "mean_token_accuracy": 0.8205343771725893, "num_tokens": 30779139.0, "step": 6720 }, { "entropy": 0.6006744123529643, "epoch": 0.6345988378260511, "grad_norm": 0.3984375, "learning_rate": 1.2765046427844157e-06, "loss": 0.521686601638794, "mean_token_accuracy": 0.8351531434804201, "num_tokens": 30826518.0, "step": 6730 }, { "entropy": 0.7569279128685593, "epoch": 0.6355417781497154, "grad_norm": 0.4609375, "learning_rate": 1.2694500958973327e-06, "loss": 0.6009937286376953, "mean_token_accuracy": 0.789092281088233, "num_tokens": 30881879.0, "step": 6740 }, { "entropy": 0.5884561772458256, "epoch": 0.6364847184733796, "grad_norm": 0.412109375, "learning_rate": 1.262408456896458e-06, "loss": 0.520009183883667, "mean_token_accuracy": 0.8386049326509237, "num_tokens": 30927036.0, "step": 6750 }, { "entropy": 0.5804953049868345, "epoch": 0.6374276587970439, "grad_norm": 0.65234375, "learning_rate": 1.2553797996452504e-06, "loss": 0.42743620872497556, "mean_token_accuracy": 0.8361934781074524, "num_tokens": 30973950.0, "step": 6760 }, { "entropy": 0.651206433866173, "epoch": 0.6383705991207081, "grad_norm": 0.28125, "learning_rate": 1.2483641978710023e-06, "loss": 0.5765644550323487, "mean_token_accuracy": 0.8276426322758198, "num_tokens": 31027156.0, "step": 6770 }, { "entropy": 0.7943007486872375, "epoch": 0.6393135394443724, "grad_norm": 0.2109375, "learning_rate": 1.2413617251640538e-06, "loss": 0.6862638473510743, "mean_token_accuracy": 0.7906891793012619, "num_tokens": 31081926.0, "step": 6780 }, { "entropy": 0.7911325155757367, "epoch": 0.6402564797680367, "grad_norm": 0.53125, "learning_rate": 1.2343724549770311e-06, "loss": 0.7334757328033448, "mean_token_accuracy": 0.7799281593412161, "num_tokens": 31123520.0, "step": 6790 }, { "entropy": 0.6264763680286706, "epoch": 0.641199420091701, "grad_norm": 0.404296875, "learning_rate": 1.2273964606240718e-06, "loss": 0.5062834739685058, "mean_token_accuracy": 0.813581820204854, "num_tokens": 31169681.0, "step": 6800 }, { "entropy": 0.6135468325577677, "epoch": 0.6421423604153652, "grad_norm": 0.388671875, "learning_rate": 1.220433815280054e-06, "loss": 0.4851649284362793, "mean_token_accuracy": 0.8191511053591967, "num_tokens": 31215610.0, "step": 6810 }, { "entropy": 0.8527200820855796, "epoch": 0.6430853007390295, "grad_norm": 0.404296875, "learning_rate": 1.2134845919798346e-06, "loss": 0.9052200317382812, "mean_token_accuracy": 0.7757729774340987, "num_tokens": 31256328.0, "step": 6820 }, { "entropy": 0.6696253786794841, "epoch": 0.6440282410626937, "grad_norm": 0.330078125, "learning_rate": 1.2065488636174761e-06, "loss": 0.4900521755218506, "mean_token_accuracy": 0.81925327219069, "num_tokens": 31303360.0, "step": 6830 }, { "entropy": 0.7389580006711185, "epoch": 0.644971181386358, "grad_norm": 0.6171875, "learning_rate": 1.1996267029454882e-06, "loss": 0.6637410640716552, "mean_token_accuracy": 0.7897630255669356, "num_tokens": 31356452.0, "step": 6840 }, { "entropy": 0.7582534276880324, "epoch": 0.6459141217100223, "grad_norm": 0.314453125, "learning_rate": 1.1927181825740598e-06, "loss": 0.6377841472625733, "mean_token_accuracy": 0.78179000467062, "num_tokens": 31402638.0, "step": 6850 }, { "entropy": 0.7765328639186919, "epoch": 0.6468570620336865, "grad_norm": 1.4765625, "learning_rate": 1.1858233749703008e-06, "loss": 0.7192119121551513, "mean_token_accuracy": 0.7862007327377796, "num_tokens": 31441999.0, "step": 6860 }, { "entropy": 0.6889529786072671, "epoch": 0.6478000023573508, "grad_norm": 0.455078125, "learning_rate": 1.1789423524574816e-06, "loss": 0.5516982555389405, "mean_token_accuracy": 0.8100367560982704, "num_tokens": 31496439.0, "step": 6870 }, { "entropy": 0.5635810997337103, "epoch": 0.6487429426810151, "grad_norm": 0.333984375, "learning_rate": 1.1720751872142708e-06, "loss": 0.512902307510376, "mean_token_accuracy": 0.8280544430017471, "num_tokens": 31543724.0, "step": 6880 }, { "entropy": 0.6845852768979966, "epoch": 0.6496858830046793, "grad_norm": 0.361328125, "learning_rate": 1.1652219512739838e-06, "loss": 0.5510530471801758, "mean_token_accuracy": 0.8120139855891466, "num_tokens": 31594284.0, "step": 6890 }, { "entropy": 0.6481620660051703, "epoch": 0.6506288233283436, "grad_norm": 0.5390625, "learning_rate": 1.1583827165238206e-06, "loss": 0.5910237789154053, "mean_token_accuracy": 0.8181051228195428, "num_tokens": 31635062.0, "step": 6900 }, { "entropy": 0.6908615042455495, "epoch": 0.6515717636520079, "grad_norm": 0.84375, "learning_rate": 1.15155755470412e-06, "loss": 0.6882299423217774, "mean_token_accuracy": 0.8048533439636231, "num_tokens": 31678473.0, "step": 6910 }, { "entropy": 0.7044286559335887, "epoch": 0.6525147039756721, "grad_norm": 0.609375, "learning_rate": 1.1447465374075975e-06, "loss": 0.7313314437866211, "mean_token_accuracy": 0.8019507348537445, "num_tokens": 31729255.0, "step": 6920 }, { "entropy": 0.6504749067127704, "epoch": 0.6534576442993364, "grad_norm": 0.490234375, "learning_rate": 1.137949736078603e-06, "loss": 0.5372074604034424, "mean_token_accuracy": 0.8073802709579467, "num_tokens": 31768907.0, "step": 6930 }, { "entropy": 0.7473512006923556, "epoch": 0.6544005846230007, "grad_norm": 0.423828125, "learning_rate": 1.1311672220123664e-06, "loss": 0.6788872241973877, "mean_token_accuracy": 0.7935893721878529, "num_tokens": 31812183.0, "step": 6940 }, { "entropy": 0.7024919440969825, "epoch": 0.6553435249466649, "grad_norm": 0.40625, "learning_rate": 1.1243990663542497e-06, "loss": 0.6041145324707031, "mean_token_accuracy": 0.8105067923665047, "num_tokens": 31862178.0, "step": 6950 }, { "entropy": 0.6629848030395806, "epoch": 0.6562864652703292, "grad_norm": 0.828125, "learning_rate": 1.1176453400990049e-06, "loss": 0.676570463180542, "mean_token_accuracy": 0.8191709652543068, "num_tokens": 31907853.0, "step": 6960 }, { "entropy": 0.6834048548713326, "epoch": 0.6572294055939935, "grad_norm": 0.921875, "learning_rate": 1.1109061140900224e-06, "loss": 0.5216798305511474, "mean_token_accuracy": 0.8132496692240239, "num_tokens": 31952569.0, "step": 6970 }, { "entropy": 0.6860712924972177, "epoch": 0.6581723459176577, "grad_norm": 0.421875, "learning_rate": 1.104181459018596e-06, "loss": 0.5502390384674072, "mean_token_accuracy": 0.8120945893228054, "num_tokens": 32000914.0, "step": 6980 }, { "entropy": 0.6751578035764396, "epoch": 0.659115286241322, "grad_norm": 0.6640625, "learning_rate": 1.0974714454231738e-06, "loss": 0.5092285633087158, "mean_token_accuracy": 0.8091344766318798, "num_tokens": 32047882.0, "step": 6990 }, { "entropy": 0.6862224272452295, "epoch": 0.6600582265649863, "grad_norm": 0.265625, "learning_rate": 1.0907761436886238e-06, "loss": 0.4828913688659668, "mean_token_accuracy": 0.8198781322687865, "num_tokens": 32093189.0, "step": 7000 } ], "logging_steps": 10, "max_steps": 10000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.4573656096110735e+18, "train_batch_size": 1, "trial_name": null, "trial_params": null }