{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 2375, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 0.4990599287673831, "epoch": 0.004210526315789474, "grad_norm": 69.0, "learning_rate": 6.338028169014085e-07, "loss": 1.671738624572754, "mean_token_accuracy": 0.7763976119458675, "num_tokens": 31553.0, "step": 10 }, { "entropy": 0.4624864859506488, "epoch": 0.008421052631578947, "grad_norm": 65.0, "learning_rate": 1.3380281690140844e-06, "loss": 1.5600993156433105, "mean_token_accuracy": 0.7901717454195023, "num_tokens": 63579.0, "step": 20 }, { "entropy": 0.5733067244291306, "epoch": 0.01263157894736842, "grad_norm": 54.5, "learning_rate": 2.0422535211267608e-06, "loss": 1.6138050079345703, "mean_token_accuracy": 0.7659219928085804, "num_tokens": 92495.0, "step": 30 }, { "entropy": 0.576881331205368, "epoch": 0.016842105263157894, "grad_norm": 30.75, "learning_rate": 2.746478873239437e-06, "loss": 1.3854169845581055, "mean_token_accuracy": 0.7819479435682297, "num_tokens": 122375.0, "step": 40 }, { "entropy": 0.6074449960142374, "epoch": 0.021052631578947368, "grad_norm": 21.375, "learning_rate": 3.4507042253521127e-06, "loss": 1.1678359985351563, "mean_token_accuracy": 0.788398090749979, "num_tokens": 152668.0, "step": 50 }, { "entropy": 0.7060422364622354, "epoch": 0.02526315789473684, "grad_norm": 12.1875, "learning_rate": 4.154929577464789e-06, "loss": 0.9693965911865234, "mean_token_accuracy": 0.798081835359335, "num_tokens": 183863.0, "step": 60 }, { "entropy": 0.741611959785223, "epoch": 0.029473684210526315, "grad_norm": 12.0, "learning_rate": 4.859154929577465e-06, "loss": 0.7716450214385986, "mean_token_accuracy": 0.8399579018354416, "num_tokens": 212992.0, "step": 70 }, { "entropy": 0.6091062590479851, "epoch": 0.03368421052631579, "grad_norm": 15.0, "learning_rate": 4.982638888888889e-06, "loss": 0.5984757900238037, "mean_token_accuracy": 0.8683908067643642, "num_tokens": 242894.0, "step": 80 }, { "entropy": 0.4648941744118929, "epoch": 0.037894736842105266, "grad_norm": 9.25, "learning_rate": 4.9609375e-06, "loss": 0.45642986297607424, "mean_token_accuracy": 0.8944785602390766, "num_tokens": 273459.0, "step": 90 }, { "entropy": 0.3587808248586953, "epoch": 0.042105263157894736, "grad_norm": 8.375, "learning_rate": 4.9392361111111115e-06, "loss": 0.38718841075897215, "mean_token_accuracy": 0.9098845317959785, "num_tokens": 305452.0, "step": 100 }, { "entropy": 0.31363106137141583, "epoch": 0.04631578947368421, "grad_norm": 7.71875, "learning_rate": 4.917534722222223e-06, "loss": 0.35190615653991697, "mean_token_accuracy": 0.9152749516069889, "num_tokens": 336691.0, "step": 110 }, { "entropy": 0.30077689900062976, "epoch": 0.05052631578947368, "grad_norm": 7.5625, "learning_rate": 4.895833333333333e-06, "loss": 0.3593594551086426, "mean_token_accuracy": 0.9169687710702419, "num_tokens": 368879.0, "step": 120 }, { "entropy": 0.2662435117177665, "epoch": 0.05473684210526316, "grad_norm": 8.1875, "learning_rate": 4.8741319444444444e-06, "loss": 0.316438627243042, "mean_token_accuracy": 0.9221884422004223, "num_tokens": 399165.0, "step": 130 }, { "entropy": 0.26467454619705677, "epoch": 0.05894736842105263, "grad_norm": 8.8125, "learning_rate": 4.8524305555555565e-06, "loss": 0.27219557762145996, "mean_token_accuracy": 0.9298946231603622, "num_tokens": 428931.0, "step": 140 }, { "entropy": 0.2657210439443588, "epoch": 0.06315789473684211, "grad_norm": 16.875, "learning_rate": 4.830729166666667e-06, "loss": 0.3098090171813965, "mean_token_accuracy": 0.9222414299845696, "num_tokens": 458794.0, "step": 150 }, { "entropy": 0.23787126671522857, "epoch": 0.06736842105263158, "grad_norm": 10.0, "learning_rate": 4.809027777777778e-06, "loss": 0.2524611711502075, "mean_token_accuracy": 0.9230330072343349, "num_tokens": 489763.0, "step": 160 }, { "entropy": 0.2247232544235885, "epoch": 0.07157894736842105, "grad_norm": 10.75, "learning_rate": 4.787326388888889e-06, "loss": 0.2346771240234375, "mean_token_accuracy": 0.93573377430439, "num_tokens": 520029.0, "step": 170 }, { "entropy": 0.22070267596282064, "epoch": 0.07578947368421053, "grad_norm": 7.75, "learning_rate": 4.765625000000001e-06, "loss": 0.21888349056243897, "mean_token_accuracy": 0.9352433510124684, "num_tokens": 550742.0, "step": 180 }, { "entropy": 0.21396164572797716, "epoch": 0.08, "grad_norm": 7.65625, "learning_rate": 4.743923611111111e-06, "loss": 0.21159236431121825, "mean_token_accuracy": 0.9358419619500637, "num_tokens": 580071.0, "step": 190 }, { "entropy": 0.20088617503643036, "epoch": 0.08421052631578947, "grad_norm": 9.0625, "learning_rate": 4.722222222222222e-06, "loss": 0.210105037689209, "mean_token_accuracy": 0.9405015103518963, "num_tokens": 610346.0, "step": 200 }, { "entropy": 0.2197779224254191, "epoch": 0.08842105263157894, "grad_norm": 6.25, "learning_rate": 4.7005208333333335e-06, "loss": 0.24622466564178466, "mean_token_accuracy": 0.9350829392671585, "num_tokens": 640068.0, "step": 210 }, { "entropy": 0.22689010314643382, "epoch": 0.09263157894736843, "grad_norm": 12.25, "learning_rate": 4.678819444444445e-06, "loss": 0.25157005786895753, "mean_token_accuracy": 0.9245235815644264, "num_tokens": 668586.0, "step": 220 }, { "entropy": 0.2026051654946059, "epoch": 0.0968421052631579, "grad_norm": 11.625, "learning_rate": 4.657118055555556e-06, "loss": 0.22865614891052247, "mean_token_accuracy": 0.9291222095489502, "num_tokens": 700113.0, "step": 230 }, { "entropy": 0.20945081664249302, "epoch": 0.10105263157894737, "grad_norm": 8.4375, "learning_rate": 4.635416666666667e-06, "loss": 0.20557198524475098, "mean_token_accuracy": 0.9318756103515625, "num_tokens": 730359.0, "step": 240 }, { "entropy": 0.1935979576781392, "epoch": 0.10526315789473684, "grad_norm": 9.75, "learning_rate": 4.6137152777777785e-06, "loss": 0.20995285511016845, "mean_token_accuracy": 0.9389079615473748, "num_tokens": 761042.0, "step": 250 }, { "entropy": 0.21530479132197797, "epoch": 0.10947368421052632, "grad_norm": 10.25, "learning_rate": 4.59201388888889e-06, "loss": 0.21937789916992187, "mean_token_accuracy": 0.9335255794227123, "num_tokens": 792117.0, "step": 260 }, { "entropy": 0.24162108548916877, "epoch": 0.11368421052631579, "grad_norm": 10.5, "learning_rate": 4.5703125e-06, "loss": 0.2889341115951538, "mean_token_accuracy": 0.9264158695936203, "num_tokens": 822509.0, "step": 270 }, { "entropy": 0.22190025104209782, "epoch": 0.11789473684210526, "grad_norm": 9.4375, "learning_rate": 4.548611111111111e-06, "loss": 0.22677860260009766, "mean_token_accuracy": 0.9339636966586113, "num_tokens": 852474.0, "step": 280 }, { "entropy": 0.21453084875829517, "epoch": 0.12210526315789473, "grad_norm": 7.65625, "learning_rate": 4.526909722222223e-06, "loss": 0.20040695667266845, "mean_token_accuracy": 0.9411987900733948, "num_tokens": 882821.0, "step": 290 }, { "entropy": 0.2034795220475644, "epoch": 0.12631578947368421, "grad_norm": 12.6875, "learning_rate": 4.505208333333334e-06, "loss": 0.24240901470184326, "mean_token_accuracy": 0.9343540959060193, "num_tokens": 913298.0, "step": 300 }, { "entropy": 0.20725304959341884, "epoch": 0.13052631578947368, "grad_norm": 10.25, "learning_rate": 4.483506944444444e-06, "loss": 0.22464065551757811, "mean_token_accuracy": 0.9300798162817955, "num_tokens": 944669.0, "step": 310 }, { "entropy": 0.18791212746873498, "epoch": 0.13473684210526315, "grad_norm": 8.0, "learning_rate": 4.461805555555556e-06, "loss": 0.17531607151031495, "mean_token_accuracy": 0.9410846054553985, "num_tokens": 973038.0, "step": 320 }, { "entropy": 0.1887997885234654, "epoch": 0.13894736842105262, "grad_norm": 8.25, "learning_rate": 4.440104166666668e-06, "loss": 0.20259859561920165, "mean_token_accuracy": 0.9379140719771385, "num_tokens": 1003504.0, "step": 330 }, { "entropy": 0.21206430648453534, "epoch": 0.1431578947368421, "grad_norm": 8.625, "learning_rate": 4.418402777777778e-06, "loss": 0.24106347560882568, "mean_token_accuracy": 0.9289649538695812, "num_tokens": 1032582.0, "step": 340 }, { "entropy": 0.1938377027399838, "epoch": 0.14736842105263157, "grad_norm": 9.5, "learning_rate": 4.396701388888889e-06, "loss": 0.19278082847595215, "mean_token_accuracy": 0.9380026146769523, "num_tokens": 1064109.0, "step": 350 }, { "entropy": 0.1793072429485619, "epoch": 0.15157894736842106, "grad_norm": 7.65625, "learning_rate": 4.3750000000000005e-06, "loss": 0.18131839036941527, "mean_token_accuracy": 0.9433922998607158, "num_tokens": 1094818.0, "step": 360 }, { "entropy": 0.19749868060462178, "epoch": 0.15578947368421053, "grad_norm": 4.75, "learning_rate": 4.353298611111112e-06, "loss": 0.18917640447616577, "mean_token_accuracy": 0.9424469873309136, "num_tokens": 1123344.0, "step": 370 }, { "entropy": 0.1859517907258123, "epoch": 0.16, "grad_norm": 10.375, "learning_rate": 4.331597222222222e-06, "loss": 0.19585838317871093, "mean_token_accuracy": 0.9397093847393989, "num_tokens": 1154149.0, "step": 380 }, { "entropy": 0.17284040013328195, "epoch": 0.16421052631578947, "grad_norm": 14.3125, "learning_rate": 4.309895833333333e-06, "loss": 0.16065752506256104, "mean_token_accuracy": 0.9468757703900337, "num_tokens": 1185496.0, "step": 390 }, { "entropy": 0.2033068159595132, "epoch": 0.16842105263157894, "grad_norm": 9.0, "learning_rate": 4.288194444444445e-06, "loss": 0.22716670036315917, "mean_token_accuracy": 0.9365929305553437, "num_tokens": 1215776.0, "step": 400 }, { "entropy": 0.20319096064195036, "epoch": 0.1726315789473684, "grad_norm": 9.3125, "learning_rate": 4.266493055555556e-06, "loss": 0.2225698471069336, "mean_token_accuracy": 0.9277164503931999, "num_tokens": 1245574.0, "step": 410 }, { "entropy": 0.1901295615825802, "epoch": 0.17684210526315788, "grad_norm": 10.375, "learning_rate": 4.244791666666667e-06, "loss": 0.22110774517059326, "mean_token_accuracy": 0.9325532615184784, "num_tokens": 1274979.0, "step": 420 }, { "entropy": 0.19151646881364287, "epoch": 0.18105263157894738, "grad_norm": 6.9375, "learning_rate": 4.223090277777778e-06, "loss": 0.1919734835624695, "mean_token_accuracy": 0.9378305852413178, "num_tokens": 1306036.0, "step": 430 }, { "entropy": 0.2085381604731083, "epoch": 0.18526315789473685, "grad_norm": 7.53125, "learning_rate": 4.2013888888888896e-06, "loss": 0.21823127269744874, "mean_token_accuracy": 0.9345854863524437, "num_tokens": 1335047.0, "step": 440 }, { "entropy": 0.2007679786067456, "epoch": 0.18947368421052632, "grad_norm": 8.75, "learning_rate": 4.1796875e-06, "loss": 0.21735711097717286, "mean_token_accuracy": 0.9340473741292954, "num_tokens": 1366790.0, "step": 450 }, { "entropy": 0.17802681485190988, "epoch": 0.1936842105263158, "grad_norm": 5.34375, "learning_rate": 4.157986111111111e-06, "loss": 0.19400970935821532, "mean_token_accuracy": 0.9380262985825538, "num_tokens": 1394887.0, "step": 460 }, { "entropy": 0.21595997624099256, "epoch": 0.19789473684210526, "grad_norm": 7.1875, "learning_rate": 4.1362847222222224e-06, "loss": 0.22792208194732666, "mean_token_accuracy": 0.9314667269587517, "num_tokens": 1425391.0, "step": 470 }, { "entropy": 0.18051641024649143, "epoch": 0.20210526315789473, "grad_norm": 4.9375, "learning_rate": 4.114583333333334e-06, "loss": 0.19123028516769408, "mean_token_accuracy": 0.9385565176606179, "num_tokens": 1453952.0, "step": 480 }, { "entropy": 0.2041733751539141, "epoch": 0.2063157894736842, "grad_norm": 11.1875, "learning_rate": 4.092881944444445e-06, "loss": 0.21048731803894044, "mean_token_accuracy": 0.9365776918828488, "num_tokens": 1487071.0, "step": 490 }, { "entropy": 0.17413038527593017, "epoch": 0.21052631578947367, "grad_norm": 8.4375, "learning_rate": 4.071180555555556e-06, "loss": 0.1920235872268677, "mean_token_accuracy": 0.9346710205078125, "num_tokens": 1518557.0, "step": 500 }, { "entropy": 0.1804610774386674, "epoch": 0.21473684210526317, "grad_norm": 6.71875, "learning_rate": 4.049479166666667e-06, "loss": 0.18783496618270873, "mean_token_accuracy": 0.9396589122712612, "num_tokens": 1548878.0, "step": 510 }, { "entropy": 0.19870298462919891, "epoch": 0.21894736842105264, "grad_norm": 10.5, "learning_rate": 4.027777777777779e-06, "loss": 0.20456252098083497, "mean_token_accuracy": 0.93275361135602, "num_tokens": 1581157.0, "step": 520 }, { "entropy": 0.18834507754072546, "epoch": 0.2231578947368421, "grad_norm": 9.5, "learning_rate": 4.006076388888889e-06, "loss": 0.1853790521621704, "mean_token_accuracy": 0.9434393145143986, "num_tokens": 1612111.0, "step": 530 }, { "entropy": 0.18060610676184297, "epoch": 0.22736842105263158, "grad_norm": 10.875, "learning_rate": 3.984375e-06, "loss": 0.18703898191452026, "mean_token_accuracy": 0.940553817898035, "num_tokens": 1643714.0, "step": 540 }, { "entropy": 0.2124157869257033, "epoch": 0.23157894736842105, "grad_norm": 16.375, "learning_rate": 3.9626736111111115e-06, "loss": 0.23256590366363525, "mean_token_accuracy": 0.931666910648346, "num_tokens": 1674981.0, "step": 550 }, { "entropy": 0.18916954104788603, "epoch": 0.23578947368421052, "grad_norm": 8.625, "learning_rate": 3.940972222222223e-06, "loss": 0.20892608165740967, "mean_token_accuracy": 0.9369244277477264, "num_tokens": 1704650.0, "step": 560 }, { "entropy": 0.18540409342385827, "epoch": 0.24, "grad_norm": 10.75, "learning_rate": 3.919270833333333e-06, "loss": 0.1709328293800354, "mean_token_accuracy": 0.9410766020417214, "num_tokens": 1736731.0, "step": 570 }, { "entropy": 0.1986150752287358, "epoch": 0.24421052631578946, "grad_norm": 12.3125, "learning_rate": 3.897569444444444e-06, "loss": 0.22206108570098876, "mean_token_accuracy": 0.9357864424586296, "num_tokens": 1768488.0, "step": 580 }, { "entropy": 0.1802667098119855, "epoch": 0.24842105263157896, "grad_norm": 6.375, "learning_rate": 3.8758680555555565e-06, "loss": 0.18710933923721312, "mean_token_accuracy": 0.9412250213325024, "num_tokens": 1799166.0, "step": 590 }, { "entropy": 0.17089016041718424, "epoch": 0.25263157894736843, "grad_norm": 12.0, "learning_rate": 3.854166666666667e-06, "loss": 0.18744715452194213, "mean_token_accuracy": 0.9394571520388126, "num_tokens": 1830122.0, "step": 600 }, { "entropy": 0.20793215851299465, "epoch": 0.25684210526315787, "grad_norm": 7.78125, "learning_rate": 3.832465277777778e-06, "loss": 0.234443998336792, "mean_token_accuracy": 0.9333168506622315, "num_tokens": 1862016.0, "step": 610 }, { "entropy": 0.20435764044523239, "epoch": 0.26105263157894737, "grad_norm": 5.78125, "learning_rate": 3.8107638888888894e-06, "loss": 0.23094916343688965, "mean_token_accuracy": 0.9356762997806072, "num_tokens": 1893262.0, "step": 620 }, { "entropy": 0.16803635912947357, "epoch": 0.26526315789473687, "grad_norm": 7.53125, "learning_rate": 3.7890625e-06, "loss": 0.17021799087524414, "mean_token_accuracy": 0.9433802559971809, "num_tokens": 1926661.0, "step": 630 }, { "entropy": 0.1832001986913383, "epoch": 0.2694736842105263, "grad_norm": 8.5625, "learning_rate": 3.7673611111111114e-06, "loss": 0.19909589290618895, "mean_token_accuracy": 0.9378570787608623, "num_tokens": 1957342.0, "step": 640 }, { "entropy": 0.1613461917731911, "epoch": 0.2736842105263158, "grad_norm": 6.0, "learning_rate": 3.7456597222222223e-06, "loss": 0.16491103172302246, "mean_token_accuracy": 0.9445122793316841, "num_tokens": 1988112.0, "step": 650 }, { "entropy": 0.19069023090414702, "epoch": 0.27789473684210525, "grad_norm": 10.8125, "learning_rate": 3.7239583333333335e-06, "loss": 0.19739652872085572, "mean_token_accuracy": 0.9412198103964329, "num_tokens": 2018814.0, "step": 660 }, { "entropy": 0.19063587812706828, "epoch": 0.28210526315789475, "grad_norm": 6.0, "learning_rate": 3.7022569444444443e-06, "loss": 0.19181153774261475, "mean_token_accuracy": 0.9380034580826759, "num_tokens": 2049341.0, "step": 670 }, { "entropy": 0.19904036330990493, "epoch": 0.2863157894736842, "grad_norm": 12.5625, "learning_rate": 3.680555555555556e-06, "loss": 0.20599710941314697, "mean_token_accuracy": 0.9368999592959881, "num_tokens": 2079296.0, "step": 680 }, { "entropy": 0.19427463631145656, "epoch": 0.2905263157894737, "grad_norm": 5.71875, "learning_rate": 3.6588541666666672e-06, "loss": 0.18761125802993775, "mean_token_accuracy": 0.9367304682731629, "num_tokens": 2109208.0, "step": 690 }, { "entropy": 0.16103245173580943, "epoch": 0.29473684210526313, "grad_norm": 4.03125, "learning_rate": 3.637152777777778e-06, "loss": 0.14467405080795287, "mean_token_accuracy": 0.9430748097598552, "num_tokens": 2140169.0, "step": 700 }, { "entropy": 0.18653456503525376, "epoch": 0.29894736842105263, "grad_norm": 8.5625, "learning_rate": 3.6154513888888893e-06, "loss": 0.19110026359558105, "mean_token_accuracy": 0.9356968715786934, "num_tokens": 2169188.0, "step": 710 }, { "entropy": 0.1778560657054186, "epoch": 0.3031578947368421, "grad_norm": 5.84375, "learning_rate": 3.59375e-06, "loss": 0.19346174001693725, "mean_token_accuracy": 0.9388452127575875, "num_tokens": 2201132.0, "step": 720 }, { "entropy": 0.1761186286341399, "epoch": 0.30736842105263157, "grad_norm": 6.1875, "learning_rate": 3.5720486111111114e-06, "loss": 0.17763736248016357, "mean_token_accuracy": 0.9394733160734177, "num_tokens": 2231368.0, "step": 730 }, { "entropy": 0.2061962445732206, "epoch": 0.31157894736842107, "grad_norm": 7.28125, "learning_rate": 3.5503472222222226e-06, "loss": 0.21218445301055908, "mean_token_accuracy": 0.9361796006560326, "num_tokens": 2260621.0, "step": 740 }, { "entropy": 0.18782778745517134, "epoch": 0.3157894736842105, "grad_norm": 8.375, "learning_rate": 3.5286458333333334e-06, "loss": 0.21144359111785888, "mean_token_accuracy": 0.9322924494743348, "num_tokens": 2292074.0, "step": 750 }, { "entropy": 0.16837490680627526, "epoch": 0.32, "grad_norm": 8.9375, "learning_rate": 3.5069444444444447e-06, "loss": 0.17376952171325682, "mean_token_accuracy": 0.9448926664888859, "num_tokens": 2321255.0, "step": 760 }, { "entropy": 0.1900732083246112, "epoch": 0.32421052631578945, "grad_norm": 9.75, "learning_rate": 3.485243055555556e-06, "loss": 0.21094374656677245, "mean_token_accuracy": 0.9347058288753033, "num_tokens": 2352817.0, "step": 770 }, { "entropy": 0.19717438989318908, "epoch": 0.32842105263157895, "grad_norm": 9.125, "learning_rate": 3.463541666666667e-06, "loss": 0.19277981519699097, "mean_token_accuracy": 0.9365353070199489, "num_tokens": 2382010.0, "step": 780 }, { "entropy": 0.18062740950845182, "epoch": 0.33263157894736844, "grad_norm": 7.21875, "learning_rate": 3.4418402777777784e-06, "loss": 0.1980929493904114, "mean_token_accuracy": 0.9367008984088898, "num_tokens": 2413871.0, "step": 790 }, { "entropy": 0.18262718091718852, "epoch": 0.3368421052631579, "grad_norm": 11.375, "learning_rate": 3.420138888888889e-06, "loss": 0.21326255798339844, "mean_token_accuracy": 0.939043466001749, "num_tokens": 2443556.0, "step": 800 }, { "entropy": 0.1931037397123873, "epoch": 0.3410526315789474, "grad_norm": 8.25, "learning_rate": 3.3984375000000004e-06, "loss": 0.2050724744796753, "mean_token_accuracy": 0.9386087417602539, "num_tokens": 2472709.0, "step": 810 }, { "entropy": 0.17652380443178117, "epoch": 0.3452631578947368, "grad_norm": 9.8125, "learning_rate": 3.3767361111111113e-06, "loss": 0.18632233142852783, "mean_token_accuracy": 0.9410148099064827, "num_tokens": 2502787.0, "step": 820 }, { "entropy": 0.18900102768093346, "epoch": 0.3494736842105263, "grad_norm": 20.75, "learning_rate": 3.3550347222222225e-06, "loss": 0.20314161777496337, "mean_token_accuracy": 0.9356084302067756, "num_tokens": 2534024.0, "step": 830 }, { "entropy": 0.1738276852760464, "epoch": 0.35368421052631577, "grad_norm": 10.1875, "learning_rate": 3.3333333333333333e-06, "loss": 0.19026525020599366, "mean_token_accuracy": 0.9386918649077416, "num_tokens": 2565340.0, "step": 840 }, { "entropy": 0.17577651813626288, "epoch": 0.35789473684210527, "grad_norm": 18.375, "learning_rate": 3.3116319444444446e-06, "loss": 0.1828848600387573, "mean_token_accuracy": 0.9417739301919937, "num_tokens": 2594835.0, "step": 850 }, { "entropy": 0.19011623142287135, "epoch": 0.36210526315789476, "grad_norm": 10.25, "learning_rate": 3.2899305555555562e-06, "loss": 0.20780632495880128, "mean_token_accuracy": 0.9356612503528595, "num_tokens": 2625348.0, "step": 860 }, { "entropy": 0.17401062482967972, "epoch": 0.3663157894736842, "grad_norm": 9.5, "learning_rate": 3.268229166666667e-06, "loss": 0.19232455492019654, "mean_token_accuracy": 0.9413411311805249, "num_tokens": 2656663.0, "step": 870 }, { "entropy": 0.2042026157025248, "epoch": 0.3705263157894737, "grad_norm": 5.625, "learning_rate": 3.2465277777777783e-06, "loss": 0.21286656856536865, "mean_token_accuracy": 0.9318742267787457, "num_tokens": 2686890.0, "step": 880 }, { "entropy": 0.18489634501747787, "epoch": 0.37473684210526315, "grad_norm": 5.875, "learning_rate": 3.224826388888889e-06, "loss": 0.1951343297958374, "mean_token_accuracy": 0.9396946728229523, "num_tokens": 2716021.0, "step": 890 }, { "entropy": 0.1702876826748252, "epoch": 0.37894736842105264, "grad_norm": 4.5, "learning_rate": 3.2031250000000004e-06, "loss": 0.20316264629364014, "mean_token_accuracy": 0.9405752472579479, "num_tokens": 2746087.0, "step": 900 }, { "entropy": 0.17025947191286833, "epoch": 0.3831578947368421, "grad_norm": 5.40625, "learning_rate": 3.181423611111111e-06, "loss": 0.1797630548477173, "mean_token_accuracy": 0.9427746705710888, "num_tokens": 2775880.0, "step": 910 }, { "entropy": 0.2002503348980099, "epoch": 0.3873684210526316, "grad_norm": 8.6875, "learning_rate": 3.1597222222222224e-06, "loss": 0.19509780406951904, "mean_token_accuracy": 0.9372896805405617, "num_tokens": 2806354.0, "step": 920 }, { "entropy": 0.18012529672123492, "epoch": 0.391578947368421, "grad_norm": 4.40625, "learning_rate": 3.1380208333333332e-06, "loss": 0.1744396448135376, "mean_token_accuracy": 0.9429976627230644, "num_tokens": 2838779.0, "step": 930 }, { "entropy": 0.1940267413854599, "epoch": 0.3957894736842105, "grad_norm": 7.25, "learning_rate": 3.1163194444444445e-06, "loss": 0.19945181608200074, "mean_token_accuracy": 0.9355903774499893, "num_tokens": 2870567.0, "step": 940 }, { "entropy": 0.1718983714701608, "epoch": 0.4, "grad_norm": 11.0, "learning_rate": 3.094618055555556e-06, "loss": 0.16918015480041504, "mean_token_accuracy": 0.9435592129826545, "num_tokens": 2900643.0, "step": 950 }, { "entropy": 0.17784137637354433, "epoch": 0.40421052631578946, "grad_norm": 7.75, "learning_rate": 3.072916666666667e-06, "loss": 0.18423346281051636, "mean_token_accuracy": 0.9385634325444698, "num_tokens": 2931200.0, "step": 960 }, { "entropy": 0.21101772908587008, "epoch": 0.40842105263157896, "grad_norm": 11.6875, "learning_rate": 3.051215277777778e-06, "loss": 0.2702996253967285, "mean_token_accuracy": 0.9345157586038113, "num_tokens": 2962480.0, "step": 970 }, { "entropy": 0.17290567103773355, "epoch": 0.4126315789473684, "grad_norm": 10.8125, "learning_rate": 3.029513888888889e-06, "loss": 0.17511870861053466, "mean_token_accuracy": 0.942404218018055, "num_tokens": 2993860.0, "step": 980 }, { "entropy": 0.16266593500040472, "epoch": 0.4168421052631579, "grad_norm": 8.3125, "learning_rate": 3.0078125000000003e-06, "loss": 0.1581684708595276, "mean_token_accuracy": 0.9443985551595688, "num_tokens": 3025733.0, "step": 990 }, { "entropy": 0.1775346302194521, "epoch": 0.42105263157894735, "grad_norm": 4.4375, "learning_rate": 2.986111111111111e-06, "loss": 0.18650579452514648, "mean_token_accuracy": 0.938476724177599, "num_tokens": 3055975.0, "step": 1000 }, { "entropy": 0.1736095615196973, "epoch": 0.42526315789473684, "grad_norm": 9.125, "learning_rate": 2.9644097222222223e-06, "loss": 0.18074491024017333, "mean_token_accuracy": 0.9398947678506374, "num_tokens": 3086913.0, "step": 1010 }, { "entropy": 0.1699895558413118, "epoch": 0.42947368421052634, "grad_norm": 8.6875, "learning_rate": 2.9427083333333336e-06, "loss": 0.19113610982894896, "mean_token_accuracy": 0.9418164797127246, "num_tokens": 3121488.0, "step": 1020 }, { "entropy": 0.16524689896032213, "epoch": 0.4336842105263158, "grad_norm": 8.75, "learning_rate": 2.9210069444444444e-06, "loss": 0.185565721988678, "mean_token_accuracy": 0.9433472394943238, "num_tokens": 3151445.0, "step": 1030 }, { "entropy": 0.14927028636448086, "epoch": 0.4378947368421053, "grad_norm": 8.1875, "learning_rate": 2.899305555555556e-06, "loss": 0.15171147584915162, "mean_token_accuracy": 0.9442741066217423, "num_tokens": 3181370.0, "step": 1040 }, { "entropy": 0.18830096670426427, "epoch": 0.4421052631578947, "grad_norm": 8.4375, "learning_rate": 2.8776041666666673e-06, "loss": 0.19921324253082276, "mean_token_accuracy": 0.9361335694789886, "num_tokens": 3212914.0, "step": 1050 }, { "entropy": 0.19236768442206084, "epoch": 0.4463157894736842, "grad_norm": 6.3125, "learning_rate": 2.855902777777778e-06, "loss": 0.20824000835418702, "mean_token_accuracy": 0.9332416817545891, "num_tokens": 3243370.0, "step": 1060 }, { "entropy": 0.19136800640262663, "epoch": 0.45052631578947366, "grad_norm": 6.5625, "learning_rate": 2.8342013888888894e-06, "loss": 0.1997889280319214, "mean_token_accuracy": 0.9408642463386059, "num_tokens": 3273424.0, "step": 1070 }, { "entropy": 0.17793954727239908, "epoch": 0.45473684210526316, "grad_norm": 10.625, "learning_rate": 2.8125e-06, "loss": 0.20664634704589843, "mean_token_accuracy": 0.9388046510517597, "num_tokens": 3303150.0, "step": 1080 }, { "entropy": 0.18900100397877395, "epoch": 0.4589473684210526, "grad_norm": 8.875, "learning_rate": 2.7907986111111114e-06, "loss": 0.2337502956390381, "mean_token_accuracy": 0.9378764137625695, "num_tokens": 3332125.0, "step": 1090 }, { "entropy": 0.2013873849529773, "epoch": 0.4631578947368421, "grad_norm": 4.90625, "learning_rate": 2.7690972222222222e-06, "loss": 0.2129305362701416, "mean_token_accuracy": 0.9356573522090912, "num_tokens": 3360726.0, "step": 1100 }, { "entropy": 0.16724729198031127, "epoch": 0.4673684210526316, "grad_norm": 6.78125, "learning_rate": 2.7473958333333335e-06, "loss": 0.17267029285430907, "mean_token_accuracy": 0.9430627137422561, "num_tokens": 3392537.0, "step": 1110 }, { "entropy": 0.1968531704682391, "epoch": 0.47157894736842104, "grad_norm": 6.40625, "learning_rate": 2.7256944444444443e-06, "loss": 0.2131186008453369, "mean_token_accuracy": 0.9392065338790416, "num_tokens": 3421034.0, "step": 1120 }, { "entropy": 0.18952712146565318, "epoch": 0.47578947368421054, "grad_norm": 8.1875, "learning_rate": 2.703993055555556e-06, "loss": 0.1882106900215149, "mean_token_accuracy": 0.9399594850838184, "num_tokens": 3451236.0, "step": 1130 }, { "entropy": 0.16791359800845385, "epoch": 0.48, "grad_norm": 6.90625, "learning_rate": 2.682291666666667e-06, "loss": 0.19798815250396729, "mean_token_accuracy": 0.9428666599094868, "num_tokens": 3483037.0, "step": 1140 }, { "entropy": 0.18943570028059184, "epoch": 0.4842105263157895, "grad_norm": 7.0625, "learning_rate": 2.660590277777778e-06, "loss": 0.18464272022247313, "mean_token_accuracy": 0.938535039126873, "num_tokens": 3512682.0, "step": 1150 }, { "entropy": 0.18527938476763667, "epoch": 0.4884210526315789, "grad_norm": 7.1875, "learning_rate": 2.6388888888888893e-06, "loss": 0.21876392364501954, "mean_token_accuracy": 0.9350791074335575, "num_tokens": 3542555.0, "step": 1160 }, { "entropy": 0.17846323440317063, "epoch": 0.4926315789473684, "grad_norm": 7.125, "learning_rate": 2.6171875e-06, "loss": 0.18390936851501466, "mean_token_accuracy": 0.9420042358338833, "num_tokens": 3574058.0, "step": 1170 }, { "entropy": 0.19397271373309194, "epoch": 0.4968421052631579, "grad_norm": 6.0625, "learning_rate": 2.5954861111111113e-06, "loss": 0.1811495304107666, "mean_token_accuracy": 0.9370748721063137, "num_tokens": 3606475.0, "step": 1180 }, { "entropy": 0.15141290938481688, "epoch": 0.5010526315789474, "grad_norm": 6.5, "learning_rate": 2.573784722222222e-06, "loss": 0.15798022747039794, "mean_token_accuracy": 0.9513927109539508, "num_tokens": 3638662.0, "step": 1190 }, { "entropy": 0.18826927775517105, "epoch": 0.5052631578947369, "grad_norm": 9.0625, "learning_rate": 2.5520833333333334e-06, "loss": 0.18200069665908813, "mean_token_accuracy": 0.9414383672177792, "num_tokens": 3669896.0, "step": 1200 }, { "entropy": 0.20096497626509519, "epoch": 0.5094736842105263, "grad_norm": 13.4375, "learning_rate": 2.530381944444444e-06, "loss": 0.22587316036224364, "mean_token_accuracy": 0.9326581291854381, "num_tokens": 3698316.0, "step": 1210 }, { "entropy": 0.19803793909959494, "epoch": 0.5136842105263157, "grad_norm": 8.625, "learning_rate": 2.508680555555556e-06, "loss": 0.21513104438781738, "mean_token_accuracy": 0.9399372972548008, "num_tokens": 3728552.0, "step": 1220 }, { "entropy": 0.16103445165790617, "epoch": 0.5178947368421053, "grad_norm": 9.6875, "learning_rate": 2.4869791666666667e-06, "loss": 0.17716561555862426, "mean_token_accuracy": 0.9383736155927181, "num_tokens": 3761109.0, "step": 1230 }, { "entropy": 0.17295233584009112, "epoch": 0.5221052631578947, "grad_norm": 7.3125, "learning_rate": 2.465277777777778e-06, "loss": 0.1894593596458435, "mean_token_accuracy": 0.9400911360979081, "num_tokens": 3790881.0, "step": 1240 }, { "entropy": 0.1784422152210027, "epoch": 0.5263157894736842, "grad_norm": 7.15625, "learning_rate": 2.443576388888889e-06, "loss": 0.1849764585494995, "mean_token_accuracy": 0.94148775562644, "num_tokens": 3820940.0, "step": 1250 }, { "entropy": 0.2000632504466921, "epoch": 0.5305263157894737, "grad_norm": 9.375, "learning_rate": 2.421875e-06, "loss": 0.20038533210754395, "mean_token_accuracy": 0.9400728508830071, "num_tokens": 3849110.0, "step": 1260 }, { "entropy": 0.1836847463157028, "epoch": 0.5347368421052632, "grad_norm": 13.8125, "learning_rate": 2.4001736111111112e-06, "loss": 0.1924800157546997, "mean_token_accuracy": 0.941128908097744, "num_tokens": 3879147.0, "step": 1270 }, { "entropy": 0.16738553042523563, "epoch": 0.5389473684210526, "grad_norm": 8.9375, "learning_rate": 2.3784722222222225e-06, "loss": 0.16631866693496705, "mean_token_accuracy": 0.9407841734588146, "num_tokens": 3912281.0, "step": 1280 }, { "entropy": 0.18249022141098975, "epoch": 0.5431578947368421, "grad_norm": 7.5625, "learning_rate": 2.3567708333333337e-06, "loss": 0.20991320610046388, "mean_token_accuracy": 0.9392150454223156, "num_tokens": 3942679.0, "step": 1290 }, { "entropy": 0.19449416091665625, "epoch": 0.5473684210526316, "grad_norm": 5.96875, "learning_rate": 2.3350694444444445e-06, "loss": 0.20127761363983154, "mean_token_accuracy": 0.9419910401105881, "num_tokens": 3973714.0, "step": 1300 }, { "entropy": 0.18408903060480952, "epoch": 0.5515789473684211, "grad_norm": 6.5, "learning_rate": 2.3133680555555558e-06, "loss": 0.18167479038238527, "mean_token_accuracy": 0.940599375218153, "num_tokens": 4003672.0, "step": 1310 }, { "entropy": 0.17429547207430005, "epoch": 0.5557894736842105, "grad_norm": 6.0, "learning_rate": 2.2916666666666666e-06, "loss": 0.17235063314437865, "mean_token_accuracy": 0.9425551310181618, "num_tokens": 4033615.0, "step": 1320 }, { "entropy": 0.19979104902595282, "epoch": 0.56, "grad_norm": 7.28125, "learning_rate": 2.2699652777777783e-06, "loss": 0.19923921823501586, "mean_token_accuracy": 0.9354177258908749, "num_tokens": 4063157.0, "step": 1330 }, { "entropy": 0.172834698157385, "epoch": 0.5642105263157895, "grad_norm": 9.0625, "learning_rate": 2.248263888888889e-06, "loss": 0.16350815296173096, "mean_token_accuracy": 0.9458058536052704, "num_tokens": 4096030.0, "step": 1340 }, { "entropy": 0.16383765279315413, "epoch": 0.5684210526315789, "grad_norm": 8.5625, "learning_rate": 2.2265625000000003e-06, "loss": 0.16651760339736937, "mean_token_accuracy": 0.9458472564816475, "num_tokens": 4128179.0, "step": 1350 }, { "entropy": 0.17017353922128678, "epoch": 0.5726315789473684, "grad_norm": 7.40625, "learning_rate": 2.204861111111111e-06, "loss": 0.19026347398757934, "mean_token_accuracy": 0.9381780102849007, "num_tokens": 4155994.0, "step": 1360 }, { "entropy": 0.1771279716398567, "epoch": 0.5768421052631579, "grad_norm": 5.71875, "learning_rate": 2.1831597222222224e-06, "loss": 0.19147398471832275, "mean_token_accuracy": 0.9430553078651428, "num_tokens": 4186351.0, "step": 1370 }, { "entropy": 0.19348430414684117, "epoch": 0.5810526315789474, "grad_norm": 7.125, "learning_rate": 2.1614583333333336e-06, "loss": 0.1967188000679016, "mean_token_accuracy": 0.9417100548744202, "num_tokens": 4217267.0, "step": 1380 }, { "entropy": 0.1781235427595675, "epoch": 0.5852631578947368, "grad_norm": 9.6875, "learning_rate": 2.1397569444444445e-06, "loss": 0.1788840651512146, "mean_token_accuracy": 0.9439761303365231, "num_tokens": 4245898.0, "step": 1390 }, { "entropy": 0.18975053504109382, "epoch": 0.5894736842105263, "grad_norm": 6.90625, "learning_rate": 2.1180555555555557e-06, "loss": 0.20416486263275146, "mean_token_accuracy": 0.9330022357404232, "num_tokens": 4276408.0, "step": 1400 }, { "entropy": 0.15169767290353775, "epoch": 0.5936842105263158, "grad_norm": 8.125, "learning_rate": 2.096354166666667e-06, "loss": 0.1466461420059204, "mean_token_accuracy": 0.9468090102076531, "num_tokens": 4306229.0, "step": 1410 }, { "entropy": 0.17125667606014758, "epoch": 0.5978947368421053, "grad_norm": 11.5625, "learning_rate": 2.074652777777778e-06, "loss": 0.17265563011169432, "mean_token_accuracy": 0.9404310546815395, "num_tokens": 4336858.0, "step": 1420 }, { "entropy": 0.18555003069341183, "epoch": 0.6021052631578947, "grad_norm": 10.4375, "learning_rate": 2.052951388888889e-06, "loss": 0.21136150360107422, "mean_token_accuracy": 0.9409567311406135, "num_tokens": 4369258.0, "step": 1430 }, { "entropy": 0.1963237697724253, "epoch": 0.6063157894736843, "grad_norm": 7.78125, "learning_rate": 2.0312500000000002e-06, "loss": 0.20975203514099122, "mean_token_accuracy": 0.9345369815826416, "num_tokens": 4397776.0, "step": 1440 }, { "entropy": 0.17916312967427075, "epoch": 0.6105263157894737, "grad_norm": 9.375, "learning_rate": 2.009548611111111e-06, "loss": 0.18616671562194825, "mean_token_accuracy": 0.9408248156309128, "num_tokens": 4427110.0, "step": 1450 }, { "entropy": 0.16703516799025236, "epoch": 0.6147368421052631, "grad_norm": 8.125, "learning_rate": 1.9878472222222223e-06, "loss": 0.16765722036361694, "mean_token_accuracy": 0.9442552007734776, "num_tokens": 4457255.0, "step": 1460 }, { "entropy": 0.15452561462298037, "epoch": 0.6189473684210526, "grad_norm": 11.875, "learning_rate": 1.9661458333333335e-06, "loss": 0.17154412269592284, "mean_token_accuracy": 0.9427635096013546, "num_tokens": 4489436.0, "step": 1470 }, { "entropy": 0.15665105115622283, "epoch": 0.6231578947368421, "grad_norm": 11.0625, "learning_rate": 1.944444444444445e-06, "loss": 0.14704623222351074, "mean_token_accuracy": 0.9460532791912556, "num_tokens": 4519132.0, "step": 1480 }, { "entropy": 0.16253583596553653, "epoch": 0.6273684210526316, "grad_norm": 6.21875, "learning_rate": 1.9227430555555556e-06, "loss": 0.1866912603378296, "mean_token_accuracy": 0.9407590955495835, "num_tokens": 4550041.0, "step": 1490 }, { "entropy": 0.16826875344850123, "epoch": 0.631578947368421, "grad_norm": 7.40625, "learning_rate": 1.9010416666666666e-06, "loss": 0.1752256989479065, "mean_token_accuracy": 0.9387107148766518, "num_tokens": 4578389.0, "step": 1500 }, { "entropy": 0.19358136910013854, "epoch": 0.6357894736842106, "grad_norm": 5.625, "learning_rate": 1.879340277777778e-06, "loss": 0.21114234924316405, "mean_token_accuracy": 0.9343519538640976, "num_tokens": 4607459.0, "step": 1510 }, { "entropy": 0.17116468152962624, "epoch": 0.64, "grad_norm": 7.75, "learning_rate": 1.8576388888888891e-06, "loss": 0.17217620611190795, "mean_token_accuracy": 0.9416831895709038, "num_tokens": 4638613.0, "step": 1520 }, { "entropy": 0.2053681869059801, "epoch": 0.6442105263157895, "grad_norm": 6.9375, "learning_rate": 1.8359375000000002e-06, "loss": 0.22673625946044923, "mean_token_accuracy": 0.9339988075196743, "num_tokens": 4666917.0, "step": 1530 }, { "entropy": 0.1771626771427691, "epoch": 0.6484210526315789, "grad_norm": 6.875, "learning_rate": 1.8142361111111112e-06, "loss": 0.17564224004745482, "mean_token_accuracy": 0.9413302429020405, "num_tokens": 4696949.0, "step": 1540 }, { "entropy": 0.16223793958779426, "epoch": 0.6526315789473685, "grad_norm": 7.4375, "learning_rate": 1.7925347222222222e-06, "loss": 0.1730146288871765, "mean_token_accuracy": 0.9461438663303852, "num_tokens": 4726446.0, "step": 1550 }, { "entropy": 0.1785475114127621, "epoch": 0.6568421052631579, "grad_norm": 9.4375, "learning_rate": 1.7708333333333337e-06, "loss": 0.17630915641784667, "mean_token_accuracy": 0.941747710108757, "num_tokens": 4757299.0, "step": 1560 }, { "entropy": 0.1837959503289312, "epoch": 0.6610526315789473, "grad_norm": 6.9375, "learning_rate": 1.7491319444444447e-06, "loss": 0.21238627433776855, "mean_token_accuracy": 0.9363793157041073, "num_tokens": 4786004.0, "step": 1570 }, { "entropy": 0.17369262645952405, "epoch": 0.6652631578947369, "grad_norm": 8.3125, "learning_rate": 1.7274305555555557e-06, "loss": 0.17695680856704712, "mean_token_accuracy": 0.9470903754234314, "num_tokens": 4817544.0, "step": 1580 }, { "entropy": 0.20245264389086515, "epoch": 0.6694736842105263, "grad_norm": 7.125, "learning_rate": 1.7057291666666668e-06, "loss": 0.2123798370361328, "mean_token_accuracy": 0.9319963820278645, "num_tokens": 4847565.0, "step": 1590 }, { "entropy": 0.16917385840788485, "epoch": 0.6736842105263158, "grad_norm": 7.15625, "learning_rate": 1.684027777777778e-06, "loss": 0.15817831754684447, "mean_token_accuracy": 0.9451489493250846, "num_tokens": 4879212.0, "step": 1600 }, { "entropy": 0.18626669934019446, "epoch": 0.6778947368421052, "grad_norm": 9.25, "learning_rate": 1.662326388888889e-06, "loss": 0.1963236451148987, "mean_token_accuracy": 0.9376043990254402, "num_tokens": 4911216.0, "step": 1610 }, { "entropy": 0.1777785701211542, "epoch": 0.6821052631578948, "grad_norm": 6.375, "learning_rate": 1.640625e-06, "loss": 0.186847722530365, "mean_token_accuracy": 0.9369994647800922, "num_tokens": 4943694.0, "step": 1620 }, { "entropy": 0.19736593994311988, "epoch": 0.6863157894736842, "grad_norm": 12.5625, "learning_rate": 1.618923611111111e-06, "loss": 0.22199268341064454, "mean_token_accuracy": 0.9357027292251587, "num_tokens": 4972032.0, "step": 1630 }, { "entropy": 0.1932901387102902, "epoch": 0.6905263157894737, "grad_norm": 9.9375, "learning_rate": 1.5972222222222221e-06, "loss": 0.19801300764083862, "mean_token_accuracy": 0.9328659147024154, "num_tokens": 5001985.0, "step": 1640 }, { "entropy": 0.18727553612552583, "epoch": 0.6947368421052632, "grad_norm": 7.25, "learning_rate": 1.5755208333333336e-06, "loss": 0.200944185256958, "mean_token_accuracy": 0.9315911903977394, "num_tokens": 5031619.0, "step": 1650 }, { "entropy": 0.18988265902735293, "epoch": 0.6989473684210527, "grad_norm": 7.375, "learning_rate": 1.5538194444444446e-06, "loss": 0.18995364904403686, "mean_token_accuracy": 0.9380945399403572, "num_tokens": 5061525.0, "step": 1660 }, { "entropy": 0.1723124712705612, "epoch": 0.7031578947368421, "grad_norm": 10.0625, "learning_rate": 1.5321180555555556e-06, "loss": 0.18223432302474976, "mean_token_accuracy": 0.936246433109045, "num_tokens": 5092491.0, "step": 1670 }, { "entropy": 0.1763459252426401, "epoch": 0.7073684210526315, "grad_norm": 12.625, "learning_rate": 1.5104166666666667e-06, "loss": 0.19533677101135255, "mean_token_accuracy": 0.9401971742510795, "num_tokens": 5123692.0, "step": 1680 }, { "entropy": 0.17391538694500924, "epoch": 0.7115789473684211, "grad_norm": 5.34375, "learning_rate": 1.488715277777778e-06, "loss": 0.1833168625831604, "mean_token_accuracy": 0.9375192701816559, "num_tokens": 5154327.0, "step": 1690 }, { "entropy": 0.19447861842345446, "epoch": 0.7157894736842105, "grad_norm": 6.34375, "learning_rate": 1.4670138888888892e-06, "loss": 0.2035297393798828, "mean_token_accuracy": 0.9407950587570667, "num_tokens": 5185441.0, "step": 1700 }, { "entropy": 0.17104214280843735, "epoch": 0.72, "grad_norm": 10.125, "learning_rate": 1.4453125000000002e-06, "loss": 0.19187886714935304, "mean_token_accuracy": 0.9413264997303485, "num_tokens": 5214618.0, "step": 1710 }, { "entropy": 0.164881079364568, "epoch": 0.7242105263157895, "grad_norm": 10.625, "learning_rate": 1.4236111111111112e-06, "loss": 0.17205849885940552, "mean_token_accuracy": 0.9436387285590172, "num_tokens": 5244872.0, "step": 1720 }, { "entropy": 0.18138507837429643, "epoch": 0.728421052631579, "grad_norm": 8.4375, "learning_rate": 1.4019097222222223e-06, "loss": 0.18944886922836304, "mean_token_accuracy": 0.9419176429510117, "num_tokens": 5274811.0, "step": 1730 }, { "entropy": 0.15619251895695924, "epoch": 0.7326315789473684, "grad_norm": 6.25, "learning_rate": 1.3802083333333335e-06, "loss": 0.15303416252136232, "mean_token_accuracy": 0.9456774339079856, "num_tokens": 5305936.0, "step": 1740 }, { "entropy": 0.17621302837505937, "epoch": 0.7368421052631579, "grad_norm": 8.125, "learning_rate": 1.3585069444444445e-06, "loss": 0.16394418478012085, "mean_token_accuracy": 0.9439542882144452, "num_tokens": 5336619.0, "step": 1750 }, { "entropy": 0.1895997554762289, "epoch": 0.7410526315789474, "grad_norm": 9.0, "learning_rate": 1.3368055555555556e-06, "loss": 0.20419509410858155, "mean_token_accuracy": 0.9383566424250602, "num_tokens": 5366166.0, "step": 1760 }, { "entropy": 0.15430729234358295, "epoch": 0.7452631578947368, "grad_norm": 7.96875, "learning_rate": 1.3151041666666666e-06, "loss": 0.14866267442703246, "mean_token_accuracy": 0.9463915720582008, "num_tokens": 5395903.0, "step": 1770 }, { "entropy": 0.1961900666821748, "epoch": 0.7494736842105263, "grad_norm": 7.53125, "learning_rate": 1.293402777777778e-06, "loss": 0.20117769241333008, "mean_token_accuracy": 0.9342163056135178, "num_tokens": 5427462.0, "step": 1780 }, { "entropy": 0.180325382668525, "epoch": 0.7536842105263157, "grad_norm": 10.875, "learning_rate": 1.271701388888889e-06, "loss": 0.19998364448547362, "mean_token_accuracy": 0.9385084345936775, "num_tokens": 5456165.0, "step": 1790 }, { "entropy": 0.18382872603833675, "epoch": 0.7578947368421053, "grad_norm": 6.96875, "learning_rate": 1.25e-06, "loss": 0.18795562982559205, "mean_token_accuracy": 0.9401052162051201, "num_tokens": 5484297.0, "step": 1800 }, { "entropy": 0.1735987264662981, "epoch": 0.7621052631578947, "grad_norm": 6.75, "learning_rate": 1.2282986111111111e-06, "loss": 0.18496283292770385, "mean_token_accuracy": 0.9364599175751209, "num_tokens": 5512121.0, "step": 1810 }, { "entropy": 0.15811273446306587, "epoch": 0.7663157894736842, "grad_norm": 8.375, "learning_rate": 1.2065972222222224e-06, "loss": 0.17440826892852784, "mean_token_accuracy": 0.9474552102386952, "num_tokens": 5540912.0, "step": 1820 }, { "entropy": 0.19428172940388322, "epoch": 0.7705263157894737, "grad_norm": 7.09375, "learning_rate": 1.1848958333333334e-06, "loss": 0.2328346014022827, "mean_token_accuracy": 0.9367604151368141, "num_tokens": 5570904.0, "step": 1830 }, { "entropy": 0.19383207242935896, "epoch": 0.7747368421052632, "grad_norm": 10.125, "learning_rate": 1.1631944444444446e-06, "loss": 0.20834689140319823, "mean_token_accuracy": 0.9364984571933747, "num_tokens": 5601902.0, "step": 1840 }, { "entropy": 0.1639871869701892, "epoch": 0.7789473684210526, "grad_norm": 7.21875, "learning_rate": 1.1414930555555557e-06, "loss": 0.15975459814071655, "mean_token_accuracy": 0.9448182679712772, "num_tokens": 5633013.0, "step": 1850 }, { "entropy": 0.17671056441031396, "epoch": 0.783157894736842, "grad_norm": 6.90625, "learning_rate": 1.1197916666666667e-06, "loss": 0.19243409633636474, "mean_token_accuracy": 0.9421222470700741, "num_tokens": 5665644.0, "step": 1860 }, { "entropy": 0.20545928478240966, "epoch": 0.7873684210526316, "grad_norm": 10.875, "learning_rate": 1.098090277777778e-06, "loss": 0.22782745361328124, "mean_token_accuracy": 0.9283310487866402, "num_tokens": 5696733.0, "step": 1870 }, { "entropy": 0.1771316953469068, "epoch": 0.791578947368421, "grad_norm": 12.0, "learning_rate": 1.076388888888889e-06, "loss": 0.20005078315734864, "mean_token_accuracy": 0.9354067780077457, "num_tokens": 5726809.0, "step": 1880 }, { "entropy": 0.1829876006115228, "epoch": 0.7957894736842105, "grad_norm": 4.375, "learning_rate": 1.0546875e-06, "loss": 0.17984312772750854, "mean_token_accuracy": 0.9406855225563049, "num_tokens": 5757443.0, "step": 1890 }, { "entropy": 0.17131042117252945, "epoch": 0.8, "grad_norm": 5.5625, "learning_rate": 1.032986111111111e-06, "loss": 0.187677800655365, "mean_token_accuracy": 0.9410165570676327, "num_tokens": 5787336.0, "step": 1900 }, { "entropy": 0.15520585421472788, "epoch": 0.8042105263157895, "grad_norm": 8.0625, "learning_rate": 1.0112847222222223e-06, "loss": 0.15040594339370728, "mean_token_accuracy": 0.949649342149496, "num_tokens": 5818737.0, "step": 1910 }, { "entropy": 0.19390389914624392, "epoch": 0.8084210526315789, "grad_norm": 7.875, "learning_rate": 9.895833333333333e-07, "loss": 0.19968183040618898, "mean_token_accuracy": 0.9386158093810082, "num_tokens": 5848788.0, "step": 1920 }, { "entropy": 0.16451029586605728, "epoch": 0.8126315789473684, "grad_norm": 8.4375, "learning_rate": 9.678819444444446e-07, "loss": 0.17298288345336915, "mean_token_accuracy": 0.9406896255910396, "num_tokens": 5878423.0, "step": 1930 }, { "entropy": 0.17370661203749477, "epoch": 0.8168421052631579, "grad_norm": 5.59375, "learning_rate": 9.461805555555556e-07, "loss": 0.17794467210769654, "mean_token_accuracy": 0.9431041710078716, "num_tokens": 5908453.0, "step": 1940 }, { "entropy": 0.1777374588418752, "epoch": 0.8210526315789474, "grad_norm": 11.875, "learning_rate": 9.244791666666668e-07, "loss": 0.20215635299682616, "mean_token_accuracy": 0.9381940357387066, "num_tokens": 5940889.0, "step": 1950 }, { "entropy": 0.18253268958069385, "epoch": 0.8252631578947368, "grad_norm": 5.5, "learning_rate": 9.027777777777779e-07, "loss": 0.17334474325180055, "mean_token_accuracy": 0.9461725540459156, "num_tokens": 5971947.0, "step": 1960 }, { "entropy": 0.1783546233084053, "epoch": 0.8294736842105264, "grad_norm": 6.65625, "learning_rate": 8.81076388888889e-07, "loss": 0.2018296718597412, "mean_token_accuracy": 0.9374721601605416, "num_tokens": 6004716.0, "step": 1970 }, { "entropy": 0.17445771326310933, "epoch": 0.8336842105263158, "grad_norm": 7.0, "learning_rate": 8.59375e-07, "loss": 0.16818779706954956, "mean_token_accuracy": 0.9427588351070881, "num_tokens": 6036766.0, "step": 1980 }, { "entropy": 0.18418881273828447, "epoch": 0.8378947368421052, "grad_norm": 8.375, "learning_rate": 8.376736111111112e-07, "loss": 0.21462113857269288, "mean_token_accuracy": 0.937469869852066, "num_tokens": 6065012.0, "step": 1990 }, { "entropy": 0.16037586382590235, "epoch": 0.8421052631578947, "grad_norm": 5.3125, "learning_rate": 8.159722222222223e-07, "loss": 0.17553248405456542, "mean_token_accuracy": 0.9418002314865589, "num_tokens": 6095994.0, "step": 2000 }, { "entropy": 0.18084662132896484, "epoch": 0.8463157894736842, "grad_norm": 5.34375, "learning_rate": 7.942708333333333e-07, "loss": 0.17438472509384156, "mean_token_accuracy": 0.9446314513683319, "num_tokens": 6126311.0, "step": 2010 }, { "entropy": 0.17917919345200062, "epoch": 0.8505263157894737, "grad_norm": 8.1875, "learning_rate": 7.725694444444446e-07, "loss": 0.18416545391082764, "mean_token_accuracy": 0.9393374055624009, "num_tokens": 6155779.0, "step": 2020 }, { "entropy": 0.17618270772509276, "epoch": 0.8547368421052631, "grad_norm": 11.6875, "learning_rate": 7.508680555555556e-07, "loss": 0.18657455444335938, "mean_token_accuracy": 0.9405391819775104, "num_tokens": 6185940.0, "step": 2030 }, { "entropy": 0.1900980792939663, "epoch": 0.8589473684210527, "grad_norm": 6.34375, "learning_rate": 7.291666666666667e-07, "loss": 0.22004635334014894, "mean_token_accuracy": 0.9368100091814995, "num_tokens": 6216119.0, "step": 2040 }, { "entropy": 0.1798396656755358, "epoch": 0.8631578947368421, "grad_norm": 7.75, "learning_rate": 7.074652777777778e-07, "loss": 0.17679187059402465, "mean_token_accuracy": 0.9427471734583378, "num_tokens": 6248190.0, "step": 2050 }, { "entropy": 0.1862468993291259, "epoch": 0.8673684210526316, "grad_norm": 8.25, "learning_rate": 6.85763888888889e-07, "loss": 0.19130966663360596, "mean_token_accuracy": 0.9378809235990048, "num_tokens": 6282715.0, "step": 2060 }, { "entropy": 0.18561029192060233, "epoch": 0.871578947368421, "grad_norm": 11.25, "learning_rate": 6.640625e-07, "loss": 0.18389569520950316, "mean_token_accuracy": 0.9425614275038242, "num_tokens": 6312639.0, "step": 2070 }, { "entropy": 0.17955731307156383, "epoch": 0.8757894736842106, "grad_norm": 5.75, "learning_rate": 6.423611111111111e-07, "loss": 0.18569419384002686, "mean_token_accuracy": 0.9404567658901215, "num_tokens": 6342390.0, "step": 2080 }, { "entropy": 0.16996940840035676, "epoch": 0.88, "grad_norm": 7.53125, "learning_rate": 6.206597222222223e-07, "loss": 0.18246359825134278, "mean_token_accuracy": 0.9428071282804013, "num_tokens": 6374191.0, "step": 2090 }, { "entropy": 0.19498055870644748, "epoch": 0.8842105263157894, "grad_norm": 7.0625, "learning_rate": 5.989583333333335e-07, "loss": 0.20460844039916992, "mean_token_accuracy": 0.9390896797180176, "num_tokens": 6403082.0, "step": 2100 }, { "entropy": 0.15782833809498698, "epoch": 0.888421052631579, "grad_norm": 8.8125, "learning_rate": 5.772569444444445e-07, "loss": 0.17403767108917237, "mean_token_accuracy": 0.9430192783474922, "num_tokens": 6434824.0, "step": 2110 }, { "entropy": 0.16636770479381086, "epoch": 0.8926315789473684, "grad_norm": 4.90625, "learning_rate": 5.555555555555555e-07, "loss": 0.16270433664321898, "mean_token_accuracy": 0.9464202426373959, "num_tokens": 6464051.0, "step": 2120 }, { "entropy": 0.18715114260558038, "epoch": 0.8968421052631579, "grad_norm": 8.5625, "learning_rate": 5.338541666666667e-07, "loss": 0.22732558250427246, "mean_token_accuracy": 0.9373150266706943, "num_tokens": 6493853.0, "step": 2130 }, { "entropy": 0.17378719956614078, "epoch": 0.9010526315789473, "grad_norm": 7.28125, "learning_rate": 5.121527777777778e-07, "loss": 0.1807337999343872, "mean_token_accuracy": 0.9400206096470356, "num_tokens": 6527705.0, "step": 2140 }, { "entropy": 0.18033494814299048, "epoch": 0.9052631578947369, "grad_norm": 5.875, "learning_rate": 4.904513888888889e-07, "loss": 0.19068191051483155, "mean_token_accuracy": 0.937873587757349, "num_tokens": 6555761.0, "step": 2150 }, { "entropy": 0.175303529528901, "epoch": 0.9094736842105263, "grad_norm": 8.125, "learning_rate": 4.6875000000000006e-07, "loss": 0.183641254901886, "mean_token_accuracy": 0.9391517236828804, "num_tokens": 6585723.0, "step": 2160 }, { "entropy": 0.17232977109961212, "epoch": 0.9136842105263158, "grad_norm": 3.890625, "learning_rate": 4.4704861111111115e-07, "loss": 0.18852951526641845, "mean_token_accuracy": 0.940208625793457, "num_tokens": 6615288.0, "step": 2170 }, { "entropy": 0.16042230552993714, "epoch": 0.9178947368421052, "grad_norm": 8.625, "learning_rate": 4.253472222222223e-07, "loss": 0.16894659996032715, "mean_token_accuracy": 0.9419491074979305, "num_tokens": 6644603.0, "step": 2180 }, { "entropy": 0.18052552677690983, "epoch": 0.9221052631578948, "grad_norm": 9.1875, "learning_rate": 4.0364583333333337e-07, "loss": 0.18952767848968505, "mean_token_accuracy": 0.9380584709346295, "num_tokens": 6673545.0, "step": 2190 }, { "entropy": 0.19028411931358277, "epoch": 0.9263157894736842, "grad_norm": 10.5625, "learning_rate": 3.819444444444445e-07, "loss": 0.18890902996063233, "mean_token_accuracy": 0.9400756865739822, "num_tokens": 6703299.0, "step": 2200 }, { "entropy": 0.16922345554921775, "epoch": 0.9305263157894736, "grad_norm": 6.84375, "learning_rate": 3.6024305555555554e-07, "loss": 0.17599536180496217, "mean_token_accuracy": 0.9455938622355461, "num_tokens": 6732719.0, "step": 2210 }, { "entropy": 0.15744123989716172, "epoch": 0.9347368421052632, "grad_norm": 6.5, "learning_rate": 3.3854166666666667e-07, "loss": 0.17910586595535277, "mean_token_accuracy": 0.9452849693596364, "num_tokens": 6765329.0, "step": 2220 }, { "entropy": 0.15953006697818636, "epoch": 0.9389473684210526, "grad_norm": 10.5, "learning_rate": 3.168402777777778e-07, "loss": 0.16083180904388428, "mean_token_accuracy": 0.9451860629022122, "num_tokens": 6796269.0, "step": 2230 }, { "entropy": 0.19982436632271855, "epoch": 0.9431578947368421, "grad_norm": 4.03125, "learning_rate": 2.951388888888889e-07, "loss": 0.1909162998199463, "mean_token_accuracy": 0.9365056939423084, "num_tokens": 6826464.0, "step": 2240 }, { "entropy": 0.1634247657377273, "epoch": 0.9473684210526315, "grad_norm": 7.75, "learning_rate": 2.7343750000000003e-07, "loss": 0.1653286933898926, "mean_token_accuracy": 0.9445300824940205, "num_tokens": 6857440.0, "step": 2250 }, { "entropy": 0.19435078646056353, "epoch": 0.9515789473684211, "grad_norm": 6.90625, "learning_rate": 2.5173611111111117e-07, "loss": 0.20611786842346191, "mean_token_accuracy": 0.9351051561534405, "num_tokens": 6887333.0, "step": 2260 }, { "entropy": 0.19693100345321, "epoch": 0.9557894736842105, "grad_norm": 8.6875, "learning_rate": 2.3003472222222225e-07, "loss": 0.1984722852706909, "mean_token_accuracy": 0.937918345630169, "num_tokens": 6917794.0, "step": 2270 }, { "entropy": 0.1728912627324462, "epoch": 0.96, "grad_norm": 4.875, "learning_rate": 2.0833333333333333e-07, "loss": 0.16558315753936767, "mean_token_accuracy": 0.9425304509699345, "num_tokens": 6947614.0, "step": 2280 }, { "entropy": 0.17391241467557847, "epoch": 0.9642105263157895, "grad_norm": 8.0625, "learning_rate": 1.8663194444444444e-07, "loss": 0.1844017267227173, "mean_token_accuracy": 0.9372891336679459, "num_tokens": 6978068.0, "step": 2290 }, { "entropy": 0.17354375659488142, "epoch": 0.968421052631579, "grad_norm": 7.5, "learning_rate": 1.6493055555555558e-07, "loss": 0.17987858057022094, "mean_token_accuracy": 0.938211838901043, "num_tokens": 7010536.0, "step": 2300 }, { "entropy": 0.2068662981968373, "epoch": 0.9726315789473684, "grad_norm": 10.0, "learning_rate": 1.4322916666666666e-07, "loss": 0.23096110820770263, "mean_token_accuracy": 0.9326581478118896, "num_tokens": 7042095.0, "step": 2310 }, { "entropy": 0.16978850068990142, "epoch": 0.9768421052631578, "grad_norm": 8.4375, "learning_rate": 1.215277777777778e-07, "loss": 0.17138477563858032, "mean_token_accuracy": 0.9445147432386876, "num_tokens": 7072071.0, "step": 2320 }, { "entropy": 0.17203839742578567, "epoch": 0.9810526315789474, "grad_norm": 8.5625, "learning_rate": 9.982638888888888e-08, "loss": 0.17553606033325195, "mean_token_accuracy": 0.9403647750616073, "num_tokens": 7102822.0, "step": 2330 }, { "entropy": 0.2015716886613518, "epoch": 0.9852631578947368, "grad_norm": 6.46875, "learning_rate": 7.8125e-08, "loss": 0.2199774980545044, "mean_token_accuracy": 0.9335592687129974, "num_tokens": 7132670.0, "step": 2340 }, { "entropy": 0.17184048132039606, "epoch": 0.9894736842105263, "grad_norm": 10.25, "learning_rate": 5.6423611111111116e-08, "loss": 0.19170069694519043, "mean_token_accuracy": 0.9456814132630825, "num_tokens": 7163095.0, "step": 2350 }, { "entropy": 0.18851842815056444, "epoch": 0.9936842105263158, "grad_norm": 7.40625, "learning_rate": 3.472222222222222e-08, "loss": 0.18714648485183716, "mean_token_accuracy": 0.9426751539111138, "num_tokens": 7191956.0, "step": 2360 }, { "entropy": 0.17078252806095406, "epoch": 0.9978947368421053, "grad_norm": 9.5, "learning_rate": 1.3020833333333333e-08, "loss": 0.16565700769424438, "mean_token_accuracy": 0.9381283052265644, "num_tokens": 7221933.0, "step": 2370 } ], "logging_steps": 10, "max_steps": 2375, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 7.608549619134874e+16, "train_batch_size": 2, "trial_name": null, "trial_params": null }