{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 793, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 2.7950327396392822, "epoch": 0.0012610340479192938, "grad_norm": 86.0, "learning_rate": 0.0, "loss": 3.5353, "mean_token_accuracy": 0.4060741662979126, "num_tokens": 980.0, "step": 1 }, { "entropy": 2.8440327644348145, "epoch": 0.0025220680958385876, "grad_norm": 97.5, "learning_rate": 1.0000000000000002e-06, "loss": 3.8445, "mean_token_accuracy": 0.38956092298030853, "num_tokens": 1845.0, "step": 2 }, { "entropy": 2.69694983959198, "epoch": 0.0037831021437578815, "grad_norm": 79.5, "learning_rate": 2.0000000000000003e-06, "loss": 3.5857, "mean_token_accuracy": 0.3938943147659302, "num_tokens": 2881.0, "step": 3 }, { "entropy": 2.7534079551696777, "epoch": 0.005044136191677175, "grad_norm": 82.0, "learning_rate": 3e-06, "loss": 3.5584, "mean_token_accuracy": 0.39021462202072144, "num_tokens": 3852.0, "step": 4 }, { "entropy": 2.6539840698242188, "epoch": 0.006305170239596469, "grad_norm": 76.0, "learning_rate": 4.000000000000001e-06, "loss": 3.3509, "mean_token_accuracy": 0.4235767424106598, "num_tokens": 4863.0, "step": 5 }, { "entropy": 2.6439151763916016, "epoch": 0.007566204287515763, "grad_norm": 64.0, "learning_rate": 5e-06, "loss": 3.1652, "mean_token_accuracy": 0.4303048998117447, "num_tokens": 5954.0, "step": 6 }, { "entropy": 2.785458564758301, "epoch": 0.008827238335435058, "grad_norm": 65.0, "learning_rate": 6e-06, "loss": 3.2856, "mean_token_accuracy": 0.4154505133628845, "num_tokens": 6992.0, "step": 7 }, { "entropy": 2.7383415699005127, "epoch": 0.01008827238335435, "grad_norm": 62.75, "learning_rate": 7e-06, "loss": 3.1293, "mean_token_accuracy": 0.44174981117248535, "num_tokens": 8050.0, "step": 8 }, { "entropy": 2.817816376686096, "epoch": 0.011349306431273645, "grad_norm": 57.5, "learning_rate": 8.000000000000001e-06, "loss": 3.1222, "mean_token_accuracy": 0.41762831807136536, "num_tokens": 9098.0, "step": 9 }, { "entropy": 2.6982277631759644, "epoch": 0.012610340479192938, "grad_norm": 41.25, "learning_rate": 9e-06, "loss": 3.0842, "mean_token_accuracy": 0.45535027980804443, "num_tokens": 10107.0, "step": 10 }, { "entropy": 2.509028911590576, "epoch": 0.013871374527112233, "grad_norm": 25.25, "learning_rate": 1e-05, "loss": 2.7484, "mean_token_accuracy": 0.47226977348327637, "num_tokens": 11197.0, "step": 11 }, { "entropy": 2.4640557765960693, "epoch": 0.015132408575031526, "grad_norm": 23.0, "learning_rate": 1.1000000000000001e-05, "loss": 2.6703, "mean_token_accuracy": 0.49717526137828827, "num_tokens": 12259.0, "step": 12 }, { "entropy": 2.5797423124313354, "epoch": 0.01639344262295082, "grad_norm": 23.5, "learning_rate": 1.2e-05, "loss": 2.7376, "mean_token_accuracy": 0.47545965015888214, "num_tokens": 13300.0, "step": 13 }, { "entropy": 2.3857948780059814, "epoch": 0.017654476670870115, "grad_norm": 25.125, "learning_rate": 1.3000000000000001e-05, "loss": 2.3733, "mean_token_accuracy": 0.528388500213623, "num_tokens": 14346.0, "step": 14 }, { "entropy": 2.419264554977417, "epoch": 0.018915510718789406, "grad_norm": 21.125, "learning_rate": 1.4e-05, "loss": 2.4288, "mean_token_accuracy": 0.510771781206131, "num_tokens": 15334.0, "step": 15 }, { "entropy": 2.421216368675232, "epoch": 0.0201765447667087, "grad_norm": 18.75, "learning_rate": 1.5000000000000002e-05, "loss": 2.3786, "mean_token_accuracy": 0.5227930545806885, "num_tokens": 16359.0, "step": 16 }, { "entropy": 2.4401241540908813, "epoch": 0.021437578814627996, "grad_norm": 16.75, "learning_rate": 1.6000000000000003e-05, "loss": 2.4499, "mean_token_accuracy": 0.5229149460792542, "num_tokens": 17338.0, "step": 17 }, { "entropy": 2.210012912750244, "epoch": 0.02269861286254729, "grad_norm": 17.0, "learning_rate": 1.7e-05, "loss": 2.1433, "mean_token_accuracy": 0.5634103715419769, "num_tokens": 18440.0, "step": 18 }, { "entropy": 2.281220316886902, "epoch": 0.02395964691046658, "grad_norm": 15.375, "learning_rate": 1.8e-05, "loss": 2.2554, "mean_token_accuracy": 0.5328912436962128, "num_tokens": 19447.0, "step": 19 }, { "entropy": 2.2521049976348877, "epoch": 0.025220680958385876, "grad_norm": 16.25, "learning_rate": 1.9e-05, "loss": 2.1713, "mean_token_accuracy": 0.5324675440788269, "num_tokens": 20383.0, "step": 20 }, { "entropy": 2.100218653678894, "epoch": 0.02648171500630517, "grad_norm": 15.0, "learning_rate": 2e-05, "loss": 2.1158, "mean_token_accuracy": 0.5483567118644714, "num_tokens": 21428.0, "step": 21 }, { "entropy": 2.2065863609313965, "epoch": 0.027742749054224466, "grad_norm": 15.6875, "learning_rate": 1.999991741329027e-05, "loss": 2.2424, "mean_token_accuracy": 0.5484118163585663, "num_tokens": 22449.0, "step": 22 }, { "entropy": 2.20810329914093, "epoch": 0.029003783102143757, "grad_norm": 13.625, "learning_rate": 1.9999669654525177e-05, "loss": 2.2329, "mean_token_accuracy": 0.5287463665008545, "num_tokens": 23542.0, "step": 23 }, { "entropy": 2.1414037942886353, "epoch": 0.03026481715006305, "grad_norm": 14.5625, "learning_rate": 1.999925672779705e-05, "loss": 2.1067, "mean_token_accuracy": 0.5522293150424957, "num_tokens": 24653.0, "step": 24 }, { "entropy": 2.1838191747665405, "epoch": 0.031525851197982346, "grad_norm": 19.75, "learning_rate": 1.999867863992634e-05, "loss": 2.3647, "mean_token_accuracy": 0.5000769197940826, "num_tokens": 25561.0, "step": 25 }, { "entropy": 2.0990543365478516, "epoch": 0.03278688524590164, "grad_norm": 13.4375, "learning_rate": 1.9997935400461514e-05, "loss": 1.9901, "mean_token_accuracy": 0.5530209839344025, "num_tokens": 26646.0, "step": 26 }, { "entropy": 2.1618154048919678, "epoch": 0.034047919293820936, "grad_norm": 14.125, "learning_rate": 1.9997027021678916e-05, "loss": 2.2127, "mean_token_accuracy": 0.5342467427253723, "num_tokens": 27644.0, "step": 27 }, { "entropy": 2.23007869720459, "epoch": 0.03530895334174023, "grad_norm": 13.6875, "learning_rate": 1.9995953518582553e-05, "loss": 2.1241, "mean_token_accuracy": 0.535846620798111, "num_tokens": 28721.0, "step": 28 }, { "entropy": 2.2455257177352905, "epoch": 0.03656998738965952, "grad_norm": 14.0, "learning_rate": 1.9994714908903837e-05, "loss": 2.1248, "mean_token_accuracy": 0.5323922038078308, "num_tokens": 29794.0, "step": 29 }, { "entropy": 2.1954925060272217, "epoch": 0.03783102143757881, "grad_norm": 14.125, "learning_rate": 1.9993311213101313e-05, "loss": 2.1482, "mean_token_accuracy": 0.5415486097335815, "num_tokens": 30780.0, "step": 30 }, { "entropy": 2.19482421875, "epoch": 0.03909205548549811, "grad_norm": 14.1875, "learning_rate": 1.99917424543603e-05, "loss": 2.2413, "mean_token_accuracy": 0.5033124387264252, "num_tokens": 31825.0, "step": 31 }, { "entropy": 2.19892680644989, "epoch": 0.0403530895334174, "grad_norm": 13.875, "learning_rate": 1.9990008658592527e-05, "loss": 2.1698, "mean_token_accuracy": 0.5146903991699219, "num_tokens": 32894.0, "step": 32 }, { "entropy": 2.153947114944458, "epoch": 0.0416141235813367, "grad_norm": 12.9375, "learning_rate": 1.9988109854435684e-05, "loss": 2.0789, "mean_token_accuracy": 0.5479936003684998, "num_tokens": 33974.0, "step": 33 }, { "entropy": 2.0923315286636353, "epoch": 0.04287515762925599, "grad_norm": 13.875, "learning_rate": 1.9986046073252975e-05, "loss": 2.0017, "mean_token_accuracy": 0.5312956869602203, "num_tokens": 34996.0, "step": 34 }, { "entropy": 2.1483466625213623, "epoch": 0.044136191677175286, "grad_norm": 13.6875, "learning_rate": 1.998381734913258e-05, "loss": 2.1397, "mean_token_accuracy": 0.5254786312580109, "num_tokens": 36001.0, "step": 35 }, { "entropy": 2.114960551261902, "epoch": 0.04539722572509458, "grad_norm": 14.0625, "learning_rate": 1.9981423718887096e-05, "loss": 1.9213, "mean_token_accuracy": 0.5552413165569305, "num_tokens": 36938.0, "step": 36 }, { "entropy": 2.2198466062545776, "epoch": 0.04665825977301387, "grad_norm": 13.5625, "learning_rate": 1.9978865222052927e-05, "loss": 2.0422, "mean_token_accuracy": 0.53462815284729, "num_tokens": 37973.0, "step": 37 }, { "entropy": 2.1119529008865356, "epoch": 0.04791929382093316, "grad_norm": 13.5625, "learning_rate": 1.997614190088965e-05, "loss": 1.9186, "mean_token_accuracy": 0.5696228444576263, "num_tokens": 39015.0, "step": 38 }, { "entropy": 2.1889278888702393, "epoch": 0.04918032786885246, "grad_norm": 15.0, "learning_rate": 1.9973253800379283e-05, "loss": 2.1161, "mean_token_accuracy": 0.5319362878799438, "num_tokens": 39938.0, "step": 39 }, { "entropy": 2.123116612434387, "epoch": 0.05044136191677175, "grad_norm": 13.5625, "learning_rate": 1.997020096822557e-05, "loss": 1.934, "mean_token_accuracy": 0.5706115663051605, "num_tokens": 40973.0, "step": 40 }, { "entropy": 2.141296863555908, "epoch": 0.05170239596469105, "grad_norm": 13.875, "learning_rate": 1.9966983454853193e-05, "loss": 1.968, "mean_token_accuracy": 0.5507127642631531, "num_tokens": 42064.0, "step": 41 }, { "entropy": 2.083743929862976, "epoch": 0.05296343001261034, "grad_norm": 12.8125, "learning_rate": 1.9963601313406916e-05, "loss": 1.8898, "mean_token_accuracy": 0.5689177513122559, "num_tokens": 43103.0, "step": 42 }, { "entropy": 2.071545362472534, "epoch": 0.05422446406052964, "grad_norm": 13.25, "learning_rate": 1.9960054599750718e-05, "loss": 1.7968, "mean_token_accuracy": 0.5993517637252808, "num_tokens": 44136.0, "step": 43 }, { "entropy": 2.134101986885071, "epoch": 0.05548549810844893, "grad_norm": 14.5, "learning_rate": 1.995634337246689e-05, "loss": 1.9464, "mean_token_accuracy": 0.5441032648086548, "num_tokens": 45168.0, "step": 44 }, { "entropy": 2.1150457859039307, "epoch": 0.05674653215636822, "grad_norm": 14.75, "learning_rate": 1.9952467692855043e-05, "loss": 1.97, "mean_token_accuracy": 0.5512273013591766, "num_tokens": 46141.0, "step": 45 }, { "entropy": 2.144010305404663, "epoch": 0.058007566204287514, "grad_norm": 12.8125, "learning_rate": 1.9948427624931094e-05, "loss": 1.9934, "mean_token_accuracy": 0.5609777271747589, "num_tokens": 47185.0, "step": 46 }, { "entropy": 2.075677990913391, "epoch": 0.05926860025220681, "grad_norm": 14.5625, "learning_rate": 1.9944223235426232e-05, "loss": 1.9446, "mean_token_accuracy": 0.547377347946167, "num_tokens": 48112.0, "step": 47 }, { "entropy": 2.274110198020935, "epoch": 0.0605296343001261, "grad_norm": 13.5625, "learning_rate": 1.9939854593785796e-05, "loss": 1.9643, "mean_token_accuracy": 0.5619737207889557, "num_tokens": 49067.0, "step": 48 }, { "entropy": 2.1645387411117554, "epoch": 0.0617906683480454, "grad_norm": 14.5625, "learning_rate": 1.9935321772168136e-05, "loss": 1.9528, "mean_token_accuracy": 0.5660497844219208, "num_tokens": 50073.0, "step": 49 }, { "entropy": 2.223591923713684, "epoch": 0.06305170239596469, "grad_norm": 13.375, "learning_rate": 1.993062484544341e-05, "loss": 1.9164, "mean_token_accuracy": 0.576151043176651, "num_tokens": 51202.0, "step": 50 }, { "entropy": 2.0002373456954956, "epoch": 0.06431273644388398, "grad_norm": 13.25, "learning_rate": 1.992576389119237e-05, "loss": 1.6916, "mean_token_accuracy": 0.615705132484436, "num_tokens": 52210.0, "step": 51 }, { "entropy": 2.098063111305237, "epoch": 0.06557377049180328, "grad_norm": 14.0, "learning_rate": 1.9920738989705054e-05, "loss": 1.9394, "mean_token_accuracy": 0.5619092583656311, "num_tokens": 53140.0, "step": 52 }, { "entropy": 2.1132895946502686, "epoch": 0.06683480453972257, "grad_norm": 12.6875, "learning_rate": 1.9915550223979482e-05, "loss": 1.8591, "mean_token_accuracy": 0.5690476298332214, "num_tokens": 54243.0, "step": 53 }, { "entropy": 2.0955541133880615, "epoch": 0.06809583858764187, "grad_norm": 12.875, "learning_rate": 1.991019767972027e-05, "loss": 1.8968, "mean_token_accuracy": 0.554290235042572, "num_tokens": 55339.0, "step": 54 }, { "entropy": 2.1030133962631226, "epoch": 0.06935687263556116, "grad_norm": 14.0, "learning_rate": 1.990468144533722e-05, "loss": 1.9777, "mean_token_accuracy": 0.5638581812381744, "num_tokens": 56334.0, "step": 55 }, { "entropy": 2.0524032711982727, "epoch": 0.07061790668348046, "grad_norm": 13.125, "learning_rate": 1.9899001611943865e-05, "loss": 1.8719, "mean_token_accuracy": 0.5665269494056702, "num_tokens": 57380.0, "step": 56 }, { "entropy": 2.143702507019043, "epoch": 0.07187894073139975, "grad_norm": 13.6875, "learning_rate": 1.9893158273355956e-05, "loss": 1.86, "mean_token_accuracy": 0.5789254605770111, "num_tokens": 58371.0, "step": 57 }, { "entropy": 2.0837615728378296, "epoch": 0.07313997477931904, "grad_norm": 12.8125, "learning_rate": 1.9887151526089908e-05, "loss": 1.886, "mean_token_accuracy": 0.5713573396205902, "num_tokens": 59377.0, "step": 58 }, { "entropy": 2.095009446144104, "epoch": 0.07440100882723834, "grad_norm": 11.6875, "learning_rate": 1.988098146936123e-05, "loss": 1.8017, "mean_token_accuracy": 0.5734412372112274, "num_tokens": 60547.0, "step": 59 }, { "entropy": 2.013132631778717, "epoch": 0.07566204287515763, "grad_norm": 13.0625, "learning_rate": 1.9874648205082847e-05, "loss": 1.7583, "mean_token_accuracy": 0.5976959466934204, "num_tokens": 61544.0, "step": 60 }, { "entropy": 2.2874679565429688, "epoch": 0.07692307692307693, "grad_norm": 12.9375, "learning_rate": 1.986815183786346e-05, "loss": 2.0184, "mean_token_accuracy": 0.5443170070648193, "num_tokens": 62561.0, "step": 61 }, { "entropy": 2.035236895084381, "epoch": 0.07818411097099622, "grad_norm": 12.375, "learning_rate": 1.9861492475005785e-05, "loss": 1.7743, "mean_token_accuracy": 0.5798207521438599, "num_tokens": 63578.0, "step": 62 }, { "entropy": 2.1492056846618652, "epoch": 0.07944514501891552, "grad_norm": 14.5, "learning_rate": 1.9854670226504792e-05, "loss": 1.8485, "mean_token_accuracy": 0.593048483133316, "num_tokens": 64496.0, "step": 63 }, { "entropy": 2.2305855751037598, "epoch": 0.0807061790668348, "grad_norm": 11.75, "learning_rate": 1.9847685205045896e-05, "loss": 1.9991, "mean_token_accuracy": 0.54645636677742, "num_tokens": 65588.0, "step": 64 }, { "entropy": 2.2173393964767456, "epoch": 0.08196721311475409, "grad_norm": 12.5625, "learning_rate": 1.9840537526003085e-05, "loss": 2.0169, "mean_token_accuracy": 0.5495975017547607, "num_tokens": 66592.0, "step": 65 }, { "entropy": 2.1479790210723877, "epoch": 0.0832282471626734, "grad_norm": 11.5, "learning_rate": 1.9833227307437018e-05, "loss": 1.7981, "mean_token_accuracy": 0.5722366571426392, "num_tokens": 67636.0, "step": 66 }, { "entropy": 2.0105774998664856, "epoch": 0.08448928121059268, "grad_norm": 12.375, "learning_rate": 1.982575467009307e-05, "loss": 1.6853, "mean_token_accuracy": 0.5884263515472412, "num_tokens": 68598.0, "step": 67 }, { "entropy": 1.9725781679153442, "epoch": 0.08575031525851198, "grad_norm": 11.1875, "learning_rate": 1.9818119737399357e-05, "loss": 1.6855, "mean_token_accuracy": 0.604888379573822, "num_tokens": 69604.0, "step": 68 }, { "entropy": 2.0375980138778687, "epoch": 0.08701134930643127, "grad_norm": 11.5, "learning_rate": 1.9810322635464662e-05, "loss": 1.8189, "mean_token_accuracy": 0.5355795323848724, "num_tokens": 70614.0, "step": 69 }, { "entropy": 1.9053971767425537, "epoch": 0.08827238335435057, "grad_norm": 10.75, "learning_rate": 1.9802363493076392e-05, "loss": 1.669, "mean_token_accuracy": 0.5835593342781067, "num_tokens": 71637.0, "step": 70 }, { "entropy": 1.9287728071212769, "epoch": 0.08953341740226986, "grad_norm": 11.375, "learning_rate": 1.9794242441698418e-05, "loss": 1.7419, "mean_token_accuracy": 0.5846641659736633, "num_tokens": 72762.0, "step": 71 }, { "entropy": 1.9991928935050964, "epoch": 0.09079445145018916, "grad_norm": 10.6875, "learning_rate": 1.9785959615468926e-05, "loss": 1.7409, "mean_token_accuracy": 0.5706911385059357, "num_tokens": 73762.0, "step": 72 }, { "entropy": 1.923768401145935, "epoch": 0.09205548549810845, "grad_norm": 11.3125, "learning_rate": 1.977751515119819e-05, "loss": 1.779, "mean_token_accuracy": 0.5645671784877777, "num_tokens": 74700.0, "step": 73 }, { "entropy": 1.8341243863105774, "epoch": 0.09331651954602774, "grad_norm": 11.0625, "learning_rate": 1.976890918836631e-05, "loss": 1.7521, "mean_token_accuracy": 0.5705311894416809, "num_tokens": 75699.0, "step": 74 }, { "entropy": 1.9348458647727966, "epoch": 0.09457755359394704, "grad_norm": 11.25, "learning_rate": 1.9760141869120917e-05, "loss": 1.767, "mean_token_accuracy": 0.5670446455478668, "num_tokens": 76756.0, "step": 75 }, { "entropy": 1.8842027187347412, "epoch": 0.09583858764186633, "grad_norm": 11.0, "learning_rate": 1.9751213338274826e-05, "loss": 1.739, "mean_token_accuracy": 0.5805586576461792, "num_tokens": 77801.0, "step": 76 }, { "entropy": 1.8319332599639893, "epoch": 0.09709962168978563, "grad_norm": 10.25, "learning_rate": 1.974212374330363e-05, "loss": 1.6026, "mean_token_accuracy": 0.6011435985565186, "num_tokens": 78819.0, "step": 77 }, { "entropy": 1.854103684425354, "epoch": 0.09836065573770492, "grad_norm": 10.6875, "learning_rate": 1.9732873234343274e-05, "loss": 1.7739, "mean_token_accuracy": 0.5729092359542847, "num_tokens": 79820.0, "step": 78 }, { "entropy": 1.7364491820335388, "epoch": 0.09962168978562422, "grad_norm": 11.1875, "learning_rate": 1.9723461964187587e-05, "loss": 1.6451, "mean_token_accuracy": 0.5989556312561035, "num_tokens": 80797.0, "step": 79 }, { "entropy": 1.8707470893859863, "epoch": 0.1008827238335435, "grad_norm": 12.25, "learning_rate": 1.971389008828573e-05, "loss": 1.7916, "mean_token_accuracy": 0.5801495909690857, "num_tokens": 81701.0, "step": 80 }, { "entropy": 1.8177608251571655, "epoch": 0.1021437578814628, "grad_norm": 10.125, "learning_rate": 1.9704157764739654e-05, "loss": 1.6348, "mean_token_accuracy": 0.6249110102653503, "num_tokens": 82727.0, "step": 81 }, { "entropy": 1.7748131155967712, "epoch": 0.1034047919293821, "grad_norm": 10.5, "learning_rate": 1.9694265154301468e-05, "loss": 1.6217, "mean_token_accuracy": 0.5925298631191254, "num_tokens": 83814.0, "step": 82 }, { "entropy": 1.794422686100006, "epoch": 0.10466582597730138, "grad_norm": 10.625, "learning_rate": 1.9684212420370807e-05, "loss": 1.6624, "mean_token_accuracy": 0.5926792025566101, "num_tokens": 84875.0, "step": 83 }, { "entropy": 1.8910409808158875, "epoch": 0.10592686002522068, "grad_norm": 11.375, "learning_rate": 1.9673999728992115e-05, "loss": 1.791, "mean_token_accuracy": 0.5685008466243744, "num_tokens": 85880.0, "step": 84 }, { "entropy": 1.8583315014839172, "epoch": 0.10718789407313997, "grad_norm": 10.8125, "learning_rate": 1.9663627248851903e-05, "loss": 1.771, "mean_token_accuracy": 0.5630261301994324, "num_tokens": 86886.0, "step": 85 }, { "entropy": 1.7223349809646606, "epoch": 0.10844892812105927, "grad_norm": 10.4375, "learning_rate": 1.965309515127598e-05, "loss": 1.5496, "mean_token_accuracy": 0.633098304271698, "num_tokens": 87871.0, "step": 86 }, { "entropy": 1.7501602172851562, "epoch": 0.10970996216897856, "grad_norm": 10.75, "learning_rate": 1.9642403610226596e-05, "loss": 1.7226, "mean_token_accuracy": 0.5990203320980072, "num_tokens": 88919.0, "step": 87 }, { "entropy": 1.647248089313507, "epoch": 0.11097099621689786, "grad_norm": 10.5625, "learning_rate": 1.9631552802299595e-05, "loss": 1.6105, "mean_token_accuracy": 0.6275560259819031, "num_tokens": 89826.0, "step": 88 }, { "entropy": 1.7597458958625793, "epoch": 0.11223203026481715, "grad_norm": 10.4375, "learning_rate": 1.9620542906721476e-05, "loss": 1.7153, "mean_token_accuracy": 0.5785434246063232, "num_tokens": 90801.0, "step": 89 }, { "entropy": 1.849835991859436, "epoch": 0.11349306431273644, "grad_norm": 10.3125, "learning_rate": 1.9609374105346458e-05, "loss": 1.8176, "mean_token_accuracy": 0.5699333846569061, "num_tokens": 91874.0, "step": 90 }, { "entropy": 1.737510323524475, "epoch": 0.11475409836065574, "grad_norm": 10.625, "learning_rate": 1.9598046582653446e-05, "loss": 1.6748, "mean_token_accuracy": 0.5997789800167084, "num_tokens": 92956.0, "step": 91 }, { "entropy": 1.7283032536506653, "epoch": 0.11601513240857503, "grad_norm": 10.9375, "learning_rate": 1.9586560525743007e-05, "loss": 1.6929, "mean_token_accuracy": 0.6055110394954681, "num_tokens": 93956.0, "step": 92 }, { "entropy": 1.707078456878662, "epoch": 0.11727616645649433, "grad_norm": 9.75, "learning_rate": 1.957491612433427e-05, "loss": 1.5962, "mean_token_accuracy": 0.5926138162612915, "num_tokens": 95057.0, "step": 93 }, { "entropy": 1.7746798396110535, "epoch": 0.11853720050441362, "grad_norm": 10.375, "learning_rate": 1.95631135707618e-05, "loss": 1.5627, "mean_token_accuracy": 0.6124057471752167, "num_tokens": 96076.0, "step": 94 }, { "entropy": 1.9260947704315186, "epoch": 0.11979823455233292, "grad_norm": 12.4375, "learning_rate": 1.9551153059972397e-05, "loss": 1.8671, "mean_token_accuracy": 0.573739230632782, "num_tokens": 97094.0, "step": 95 }, { "entropy": 1.8145451545715332, "epoch": 0.1210592686002522, "grad_norm": 11.1875, "learning_rate": 1.9539034789521924e-05, "loss": 1.6648, "mean_token_accuracy": 0.5760055780410767, "num_tokens": 98062.0, "step": 96 }, { "entropy": 1.7630221247673035, "epoch": 0.1223203026481715, "grad_norm": 10.3125, "learning_rate": 1.952675895957199e-05, "loss": 1.6276, "mean_token_accuracy": 0.597524493932724, "num_tokens": 99146.0, "step": 97 }, { "entropy": 1.8840625882148743, "epoch": 0.1235813366960908, "grad_norm": 10.5, "learning_rate": 1.9514325772886674e-05, "loss": 1.7563, "mean_token_accuracy": 0.5629289746284485, "num_tokens": 100176.0, "step": 98 }, { "entropy": 1.8077781200408936, "epoch": 0.12484237074401008, "grad_norm": 10.625, "learning_rate": 1.9501735434829174e-05, "loss": 1.8202, "mean_token_accuracy": 0.5708647072315216, "num_tokens": 101205.0, "step": 99 }, { "entropy": 1.7992448210716248, "epoch": 0.12610340479192939, "grad_norm": 10.5625, "learning_rate": 1.948898815335841e-05, "loss": 1.7348, "mean_token_accuracy": 0.5803385972976685, "num_tokens": 102198.0, "step": 100 }, { "entropy": 1.7925843596458435, "epoch": 0.1273644388398487, "grad_norm": 10.6875, "learning_rate": 1.9476084139025592e-05, "loss": 1.7535, "mean_token_accuracy": 0.5725571513175964, "num_tokens": 103202.0, "step": 101 }, { "entropy": 1.738698124885559, "epoch": 0.12862547288776796, "grad_norm": 10.5625, "learning_rate": 1.946302360497073e-05, "loss": 1.6793, "mean_token_accuracy": 0.5997990965843201, "num_tokens": 104248.0, "step": 102 }, { "entropy": 1.8028201460838318, "epoch": 0.12988650693568726, "grad_norm": 10.3125, "learning_rate": 1.9449806766919132e-05, "loss": 1.713, "mean_token_accuracy": 0.5938751995563507, "num_tokens": 105357.0, "step": 103 }, { "entropy": 1.8229917883872986, "epoch": 0.13114754098360656, "grad_norm": 10.9375, "learning_rate": 1.943643384317784e-05, "loss": 1.6545, "mean_token_accuracy": 0.5763586759567261, "num_tokens": 106403.0, "step": 104 }, { "entropy": 1.71979421377182, "epoch": 0.13240857503152584, "grad_norm": 10.125, "learning_rate": 1.9422905054631996e-05, "loss": 1.6326, "mean_token_accuracy": 0.5953395664691925, "num_tokens": 107440.0, "step": 105 }, { "entropy": 1.66442209482193, "epoch": 0.13366960907944514, "grad_norm": 10.25, "learning_rate": 1.9409220624741234e-05, "loss": 1.6023, "mean_token_accuracy": 0.6147553622722626, "num_tokens": 108468.0, "step": 106 }, { "entropy": 1.7110742330551147, "epoch": 0.13493064312736444, "grad_norm": 10.125, "learning_rate": 1.9395380779535964e-05, "loss": 1.6813, "mean_token_accuracy": 0.6113943159580231, "num_tokens": 109515.0, "step": 107 }, { "entropy": 1.8080978989601135, "epoch": 0.13619167717528374, "grad_norm": 11.4375, "learning_rate": 1.9381385747613634e-05, "loss": 1.9568, "mean_token_accuracy": 0.562128484249115, "num_tokens": 110543.0, "step": 108 }, { "entropy": 1.8338959217071533, "epoch": 0.13745271122320302, "grad_norm": 12.0, "learning_rate": 1.936723576013498e-05, "loss": 1.7324, "mean_token_accuracy": 0.5907362401485443, "num_tokens": 111514.0, "step": 109 }, { "entropy": 1.724937081336975, "epoch": 0.13871374527112232, "grad_norm": 10.25, "learning_rate": 1.9352931050820175e-05, "loss": 1.6873, "mean_token_accuracy": 0.6051501631736755, "num_tokens": 112612.0, "step": 110 }, { "entropy": 1.651603639125824, "epoch": 0.13997477931904162, "grad_norm": 9.6875, "learning_rate": 1.9338471855945003e-05, "loss": 1.5413, "mean_token_accuracy": 0.6353788375854492, "num_tokens": 113755.0, "step": 111 }, { "entropy": 1.8258926272392273, "epoch": 0.14123581336696092, "grad_norm": 10.8125, "learning_rate": 1.932385841433693e-05, "loss": 1.8245, "mean_token_accuracy": 0.5714909732341766, "num_tokens": 114778.0, "step": 112 }, { "entropy": 1.7415724992752075, "epoch": 0.1424968474148802, "grad_norm": 10.25, "learning_rate": 1.9309090967371156e-05, "loss": 1.7037, "mean_token_accuracy": 0.5925652980804443, "num_tokens": 115784.0, "step": 113 }, { "entropy": 1.7369269132614136, "epoch": 0.1437578814627995, "grad_norm": 10.9375, "learning_rate": 1.9294169758966665e-05, "loss": 1.7713, "mean_token_accuracy": 0.5780980885028839, "num_tokens": 116816.0, "step": 114 }, { "entropy": 1.604160726070404, "epoch": 0.1450189155107188, "grad_norm": 9.625, "learning_rate": 1.9279095035582153e-05, "loss": 1.5272, "mean_token_accuracy": 0.6051919460296631, "num_tokens": 117823.0, "step": 115 }, { "entropy": 1.789419949054718, "epoch": 0.14627994955863807, "grad_norm": 10.1875, "learning_rate": 1.9263867046211983e-05, "loss": 1.6845, "mean_token_accuracy": 0.5877159833908081, "num_tokens": 118874.0, "step": 116 }, { "entropy": 1.695505440235138, "epoch": 0.14754098360655737, "grad_norm": 9.875, "learning_rate": 1.9248486042382058e-05, "loss": 1.5964, "mean_token_accuracy": 0.6158693730831146, "num_tokens": 119920.0, "step": 117 }, { "entropy": 1.736804723739624, "epoch": 0.14880201765447668, "grad_norm": 10.9375, "learning_rate": 1.9232952278145683e-05, "loss": 1.6562, "mean_token_accuracy": 0.6033729314804077, "num_tokens": 120897.0, "step": 118 }, { "entropy": 1.762531578540802, "epoch": 0.15006305170239598, "grad_norm": 10.4375, "learning_rate": 1.9217266010079353e-05, "loss": 1.7068, "mean_token_accuracy": 0.5944864749908447, "num_tokens": 121986.0, "step": 119 }, { "entropy": 1.7343703508377075, "epoch": 0.15132408575031525, "grad_norm": 9.875, "learning_rate": 1.9201427497278518e-05, "loss": 1.6192, "mean_token_accuracy": 0.6109800636768341, "num_tokens": 123038.0, "step": 120 }, { "entropy": 1.7780964970588684, "epoch": 0.15258511979823455, "grad_norm": 10.1875, "learning_rate": 1.9185437001353314e-05, "loss": 1.6289, "mean_token_accuracy": 0.5890261828899384, "num_tokens": 124085.0, "step": 121 }, { "entropy": 1.7673614621162415, "epoch": 0.15384615384615385, "grad_norm": 10.0, "learning_rate": 1.9169294786424226e-05, "loss": 1.6759, "mean_token_accuracy": 0.5714527368545532, "num_tokens": 125143.0, "step": 122 }, { "entropy": 1.7509287595748901, "epoch": 0.15510718789407313, "grad_norm": 10.625, "learning_rate": 1.915300111911774e-05, "loss": 1.6029, "mean_token_accuracy": 0.5813908874988556, "num_tokens": 126181.0, "step": 123 }, { "entropy": 1.688304603099823, "epoch": 0.15636822194199243, "grad_norm": 11.25, "learning_rate": 1.9136556268561932e-05, "loss": 1.5938, "mean_token_accuracy": 0.6254107058048248, "num_tokens": 127143.0, "step": 124 }, { "entropy": 1.7035104036331177, "epoch": 0.15762925598991173, "grad_norm": 10.375, "learning_rate": 1.911996050638202e-05, "loss": 1.5971, "mean_token_accuracy": 0.6116199493408203, "num_tokens": 128081.0, "step": 125 }, { "entropy": 1.7566595077514648, "epoch": 0.15889029003783103, "grad_norm": 11.0, "learning_rate": 1.9103214106695884e-05, "loss": 1.7476, "mean_token_accuracy": 0.5734935104846954, "num_tokens": 129096.0, "step": 126 }, { "entropy": 1.7352384328842163, "epoch": 0.1601513240857503, "grad_norm": 10.25, "learning_rate": 1.9086317346109535e-05, "loss": 1.5611, "mean_token_accuracy": 0.6031631529331207, "num_tokens": 130178.0, "step": 127 }, { "entropy": 1.8352270722389221, "epoch": 0.1614123581336696, "grad_norm": 10.75, "learning_rate": 1.9069270503712535e-05, "loss": 1.8456, "mean_token_accuracy": 0.5572615265846252, "num_tokens": 131146.0, "step": 128 }, { "entropy": 1.6694875955581665, "epoch": 0.1626733921815889, "grad_norm": 10.3125, "learning_rate": 1.9052073861073426e-05, "loss": 1.6303, "mean_token_accuracy": 0.6286256313323975, "num_tokens": 132121.0, "step": 129 }, { "entropy": 1.6542978882789612, "epoch": 0.16393442622950818, "grad_norm": 10.3125, "learning_rate": 1.9034727702235023e-05, "loss": 1.6593, "mean_token_accuracy": 0.6110431551933289, "num_tokens": 133086.0, "step": 130 }, { "entropy": 1.7093634009361267, "epoch": 0.16519546027742749, "grad_norm": 10.3125, "learning_rate": 1.9017232313709767e-05, "loss": 1.6621, "mean_token_accuracy": 0.6013783514499664, "num_tokens": 134077.0, "step": 131 }, { "entropy": 1.8136807680130005, "epoch": 0.1664564943253468, "grad_norm": 10.5, "learning_rate": 1.899958798447497e-05, "loss": 1.8217, "mean_token_accuracy": 0.577373206615448, "num_tokens": 135034.0, "step": 132 }, { "entropy": 1.7821927666664124, "epoch": 0.1677175283732661, "grad_norm": 10.125, "learning_rate": 1.8981795005968057e-05, "loss": 1.695, "mean_token_accuracy": 0.5844568014144897, "num_tokens": 136103.0, "step": 133 }, { "entropy": 1.7654359340667725, "epoch": 0.16897856242118536, "grad_norm": 10.8125, "learning_rate": 1.8963853672081732e-05, "loss": 1.5731, "mean_token_accuracy": 0.5868731141090393, "num_tokens": 137100.0, "step": 134 }, { "entropy": 1.7660198211669922, "epoch": 0.17023959646910466, "grad_norm": 10.375, "learning_rate": 1.8945764279159144e-05, "loss": 1.7521, "mean_token_accuracy": 0.5795554518699646, "num_tokens": 138108.0, "step": 135 }, { "entropy": 1.7412180304527283, "epoch": 0.17150063051702397, "grad_norm": 10.3125, "learning_rate": 1.8927527125988983e-05, "loss": 1.592, "mean_token_accuracy": 0.609203428030014, "num_tokens": 139178.0, "step": 136 }, { "entropy": 1.7500796914100647, "epoch": 0.17276166456494324, "grad_norm": 10.25, "learning_rate": 1.8909142513800543e-05, "loss": 1.6479, "mean_token_accuracy": 0.603846937417984, "num_tokens": 140229.0, "step": 137 }, { "entropy": 1.7037127614021301, "epoch": 0.17402269861286254, "grad_norm": 9.875, "learning_rate": 1.889061074625875e-05, "loss": 1.6429, "mean_token_accuracy": 0.5965243577957153, "num_tokens": 141264.0, "step": 138 }, { "entropy": 1.718508780002594, "epoch": 0.17528373266078184, "grad_norm": 10.375, "learning_rate": 1.8871932129459146e-05, "loss": 1.6399, "mean_token_accuracy": 0.5820088386535645, "num_tokens": 142284.0, "step": 139 }, { "entropy": 1.5986170172691345, "epoch": 0.17654476670870115, "grad_norm": 10.6875, "learning_rate": 1.8853106971922833e-05, "loss": 1.4876, "mean_token_accuracy": 0.6402464509010315, "num_tokens": 143235.0, "step": 140 }, { "entropy": 1.6880682110786438, "epoch": 0.17780580075662042, "grad_norm": 10.8125, "learning_rate": 1.8834135584591368e-05, "loss": 1.6687, "mean_token_accuracy": 0.5934623181819916, "num_tokens": 144184.0, "step": 141 }, { "entropy": 1.6574044227600098, "epoch": 0.17906683480453972, "grad_norm": 10.0625, "learning_rate": 1.8815018280821652e-05, "loss": 1.6142, "mean_token_accuracy": 0.6084502339363098, "num_tokens": 145263.0, "step": 142 }, { "entropy": 1.6841396689414978, "epoch": 0.18032786885245902, "grad_norm": 10.3125, "learning_rate": 1.8795755376380724e-05, "loss": 1.6155, "mean_token_accuracy": 0.6059699058532715, "num_tokens": 146303.0, "step": 143 }, { "entropy": 1.705761432647705, "epoch": 0.18158890290037832, "grad_norm": 10.0625, "learning_rate": 1.8776347189440566e-05, "loss": 1.6228, "mean_token_accuracy": 0.5980998873710632, "num_tokens": 147334.0, "step": 144 }, { "entropy": 1.6457685232162476, "epoch": 0.1828499369482976, "grad_norm": 10.4375, "learning_rate": 1.8756794040572834e-05, "loss": 1.658, "mean_token_accuracy": 0.6050177216529846, "num_tokens": 148366.0, "step": 145 }, { "entropy": 1.7485453486442566, "epoch": 0.1841109709962169, "grad_norm": 10.125, "learning_rate": 1.8737096252743576e-05, "loss": 1.705, "mean_token_accuracy": 0.5982577800750732, "num_tokens": 149412.0, "step": 146 }, { "entropy": 1.7776476740837097, "epoch": 0.1853720050441362, "grad_norm": 11.4375, "learning_rate": 1.871725415130789e-05, "loss": 1.8489, "mean_token_accuracy": 0.5569970011711121, "num_tokens": 150395.0, "step": 147 }, { "entropy": 1.5921865701675415, "epoch": 0.18663303909205547, "grad_norm": 9.625, "learning_rate": 1.8697268064004554e-05, "loss": 1.4648, "mean_token_accuracy": 0.6381784975528717, "num_tokens": 151474.0, "step": 148 }, { "entropy": 1.727588713169098, "epoch": 0.18789407313997478, "grad_norm": 9.9375, "learning_rate": 1.8677138320950598e-05, "loss": 1.6152, "mean_token_accuracy": 0.5875283479690552, "num_tokens": 152539.0, "step": 149 }, { "entropy": 1.8232128024101257, "epoch": 0.18915510718789408, "grad_norm": 11.5, "learning_rate": 1.8656865254635877e-05, "loss": 1.8738, "mean_token_accuracy": 0.57618048787117, "num_tokens": 153513.0, "step": 150 }, { "entropy": 1.6553057432174683, "epoch": 0.19041614123581338, "grad_norm": 9.8125, "learning_rate": 1.8636449199917557e-05, "loss": 1.5482, "mean_token_accuracy": 0.6177035272121429, "num_tokens": 154543.0, "step": 151 }, { "entropy": 1.679106891155243, "epoch": 0.19167717528373265, "grad_norm": 10.25, "learning_rate": 1.86158904940146e-05, "loss": 1.5175, "mean_token_accuracy": 0.6258773803710938, "num_tokens": 155554.0, "step": 152 }, { "entropy": 1.6641005277633667, "epoch": 0.19293820933165196, "grad_norm": 11.0, "learning_rate": 1.859518947650217e-05, "loss": 1.6082, "mean_token_accuracy": 0.6205520927906036, "num_tokens": 156536.0, "step": 153 }, { "entropy": 1.73294335603714, "epoch": 0.19419924337957126, "grad_norm": 9.75, "learning_rate": 1.8574346489306067e-05, "loss": 1.5866, "mean_token_accuracy": 0.5927672982215881, "num_tokens": 157626.0, "step": 154 }, { "entropy": 1.6571336388587952, "epoch": 0.19546027742749053, "grad_norm": 10.5, "learning_rate": 1.8553361876697025e-05, "loss": 1.5071, "mean_token_accuracy": 0.6134444177150726, "num_tokens": 158596.0, "step": 155 }, { "entropy": 1.6746886372566223, "epoch": 0.19672131147540983, "grad_norm": 10.0625, "learning_rate": 1.8532235985285073e-05, "loss": 1.6144, "mean_token_accuracy": 0.6072324812412262, "num_tokens": 159605.0, "step": 156 }, { "entropy": 1.6456283926963806, "epoch": 0.19798234552332913, "grad_norm": 10.75, "learning_rate": 1.8510969164013783e-05, "loss": 1.5449, "mean_token_accuracy": 0.6262318193912506, "num_tokens": 160539.0, "step": 157 }, { "entropy": 1.6222925186157227, "epoch": 0.19924337957124844, "grad_norm": 10.125, "learning_rate": 1.848956176415451e-05, "loss": 1.4886, "mean_token_accuracy": 0.617477685213089, "num_tokens": 161559.0, "step": 158 }, { "entropy": 1.6953288912773132, "epoch": 0.2005044136191677, "grad_norm": 10.6875, "learning_rate": 1.84680141393006e-05, "loss": 1.7406, "mean_token_accuracy": 0.5972300469875336, "num_tokens": 162719.0, "step": 159 }, { "entropy": 1.740957796573639, "epoch": 0.201765447667087, "grad_norm": 10.375, "learning_rate": 1.8446326645361542e-05, "loss": 1.7201, "mean_token_accuracy": 0.5818152725696564, "num_tokens": 163758.0, "step": 160 }, { "entropy": 1.7102788090705872, "epoch": 0.2030264817150063, "grad_norm": 9.875, "learning_rate": 1.842449964055709e-05, "loss": 1.5999, "mean_token_accuracy": 0.587261438369751, "num_tokens": 164844.0, "step": 161 }, { "entropy": 1.6290961503982544, "epoch": 0.2042875157629256, "grad_norm": 11.0, "learning_rate": 1.8402533485411345e-05, "loss": 1.6263, "mean_token_accuracy": 0.6018026471138, "num_tokens": 165819.0, "step": 162 }, { "entropy": 1.688206136226654, "epoch": 0.2055485498108449, "grad_norm": 9.875, "learning_rate": 1.8380428542746797e-05, "loss": 1.6451, "mean_token_accuracy": 0.5944227278232574, "num_tokens": 166877.0, "step": 163 }, { "entropy": 1.7512656450271606, "epoch": 0.2068095838587642, "grad_norm": 10.6875, "learning_rate": 1.8358185177678356e-05, "loss": 1.7172, "mean_token_accuracy": 0.593990832567215, "num_tokens": 167899.0, "step": 164 }, { "entropy": 1.7278422713279724, "epoch": 0.2080706179066835, "grad_norm": 12.1875, "learning_rate": 1.8335803757607274e-05, "loss": 1.8035, "mean_token_accuracy": 0.5646536350250244, "num_tokens": 168835.0, "step": 165 }, { "entropy": 1.6790607571601868, "epoch": 0.20933165195460277, "grad_norm": 10.1875, "learning_rate": 1.831328465221513e-05, "loss": 1.5762, "mean_token_accuracy": 0.6165642142295837, "num_tokens": 169861.0, "step": 166 }, { "entropy": 1.571244478225708, "epoch": 0.21059268600252207, "grad_norm": 10.3125, "learning_rate": 1.8290628233457683e-05, "loss": 1.5813, "mean_token_accuracy": 0.6124542355537415, "num_tokens": 170870.0, "step": 167 }, { "entropy": 1.5933078527450562, "epoch": 0.21185372005044137, "grad_norm": 10.625, "learning_rate": 1.826783487555875e-05, "loss": 1.6473, "mean_token_accuracy": 0.5962705314159393, "num_tokens": 171826.0, "step": 168 }, { "entropy": 1.5253100395202637, "epoch": 0.21311475409836064, "grad_norm": 9.6875, "learning_rate": 1.824490495500402e-05, "loss": 1.4781, "mean_token_accuracy": 0.6420259475708008, "num_tokens": 172865.0, "step": 169 }, { "entropy": 1.6337009072303772, "epoch": 0.21437578814627994, "grad_norm": 11.0625, "learning_rate": 1.822183885053483e-05, "loss": 1.5454, "mean_token_accuracy": 0.6230681240558624, "num_tokens": 173897.0, "step": 170 }, { "entropy": 1.6038676500320435, "epoch": 0.21563682219419925, "grad_norm": 9.8125, "learning_rate": 1.8198636943141914e-05, "loss": 1.5517, "mean_token_accuracy": 0.6282725930213928, "num_tokens": 174852.0, "step": 171 }, { "entropy": 1.6523604989051819, "epoch": 0.21689785624211855, "grad_norm": 10.3125, "learning_rate": 1.817529961605911e-05, "loss": 1.6576, "mean_token_accuracy": 0.5921481251716614, "num_tokens": 175885.0, "step": 172 }, { "entropy": 1.6789647340774536, "epoch": 0.21815889029003782, "grad_norm": 9.6875, "learning_rate": 1.815182725475703e-05, "loss": 1.6435, "mean_token_accuracy": 0.6094416081905365, "num_tokens": 176930.0, "step": 173 }, { "entropy": 1.7434654235839844, "epoch": 0.21941992433795712, "grad_norm": 10.6875, "learning_rate": 1.8128220246936693e-05, "loss": 1.7223, "mean_token_accuracy": 0.6018305718898773, "num_tokens": 177925.0, "step": 174 }, { "entropy": 1.5791435241699219, "epoch": 0.22068095838587642, "grad_norm": 10.0625, "learning_rate": 1.8104478982523117e-05, "loss": 1.4421, "mean_token_accuracy": 0.6328472793102264, "num_tokens": 178966.0, "step": 175 }, { "entropy": 1.7045543789863586, "epoch": 0.22194199243379573, "grad_norm": 10.5625, "learning_rate": 1.808060385365889e-05, "loss": 1.7502, "mean_token_accuracy": 0.5983400344848633, "num_tokens": 180003.0, "step": 176 }, { "entropy": 1.7539182901382446, "epoch": 0.223203026481715, "grad_norm": 10.5625, "learning_rate": 1.805659525469767e-05, "loss": 1.6929, "mean_token_accuracy": 0.6106327474117279, "num_tokens": 180975.0, "step": 177 }, { "entropy": 1.6250983476638794, "epoch": 0.2244640605296343, "grad_norm": 10.3125, "learning_rate": 1.8032453582197704e-05, "loss": 1.5665, "mean_token_accuracy": 0.6009056568145752, "num_tokens": 182034.0, "step": 178 }, { "entropy": 1.7369933128356934, "epoch": 0.2257250945775536, "grad_norm": 9.625, "learning_rate": 1.800817923491525e-05, "loss": 1.6817, "mean_token_accuracy": 0.5977542400360107, "num_tokens": 183111.0, "step": 179 }, { "entropy": 1.5737929940223694, "epoch": 0.22698612862547288, "grad_norm": 10.375, "learning_rate": 1.7983772613798006e-05, "loss": 1.5671, "mean_token_accuracy": 0.6290055215358734, "num_tokens": 184084.0, "step": 180 }, { "entropy": 1.7205604314804077, "epoch": 0.22824716267339218, "grad_norm": 11.375, "learning_rate": 1.795923412197847e-05, "loss": 1.7753, "mean_token_accuracy": 0.573646605014801, "num_tokens": 185036.0, "step": 181 }, { "entropy": 1.6126840114593506, "epoch": 0.22950819672131148, "grad_norm": 9.875, "learning_rate": 1.7934564164767306e-05, "loss": 1.5594, "mean_token_accuracy": 0.5945352911949158, "num_tokens": 186070.0, "step": 182 }, { "entropy": 1.6718299984931946, "epoch": 0.23076923076923078, "grad_norm": 10.0625, "learning_rate": 1.7909763149646634e-05, "loss": 1.6871, "mean_token_accuracy": 0.5858203172683716, "num_tokens": 187167.0, "step": 183 }, { "entropy": 1.7010251879692078, "epoch": 0.23203026481715006, "grad_norm": 10.375, "learning_rate": 1.7884831486263302e-05, "loss": 1.7584, "mean_token_accuracy": 0.5768249332904816, "num_tokens": 188200.0, "step": 184 }, { "entropy": 1.661143183708191, "epoch": 0.23329129886506936, "grad_norm": 13.5, "learning_rate": 1.7859769586422122e-05, "loss": 1.6788, "mean_token_accuracy": 0.600527435541153, "num_tokens": 189107.0, "step": 185 }, { "entropy": 1.7367339134216309, "epoch": 0.23455233291298866, "grad_norm": 10.0, "learning_rate": 1.783457786407906e-05, "loss": 1.7237, "mean_token_accuracy": 0.6037432253360748, "num_tokens": 190291.0, "step": 186 }, { "entropy": 1.6531615257263184, "epoch": 0.23581336696090793, "grad_norm": 9.5625, "learning_rate": 1.7809256735334406e-05, "loss": 1.5585, "mean_token_accuracy": 0.6052311062812805, "num_tokens": 191294.0, "step": 187 }, { "entropy": 1.6551061272621155, "epoch": 0.23707440100882723, "grad_norm": 9.9375, "learning_rate": 1.7783806618425904e-05, "loss": 1.5179, "mean_token_accuracy": 0.6289675831794739, "num_tokens": 192264.0, "step": 188 }, { "entropy": 1.7442683577537537, "epoch": 0.23833543505674654, "grad_norm": 10.1875, "learning_rate": 1.775822793372184e-05, "loss": 1.6921, "mean_token_accuracy": 0.5764530301094055, "num_tokens": 193277.0, "step": 189 }, { "entropy": 1.673442304134369, "epoch": 0.23959646910466584, "grad_norm": 10.3125, "learning_rate": 1.773252110371409e-05, "loss": 1.559, "mean_token_accuracy": 0.6022548377513885, "num_tokens": 194237.0, "step": 190 }, { "entropy": 1.7216299176216125, "epoch": 0.2408575031525851, "grad_norm": 10.5625, "learning_rate": 1.7706686553011165e-05, "loss": 1.685, "mean_token_accuracy": 0.5962297022342682, "num_tokens": 195215.0, "step": 191 }, { "entropy": 1.888852596282959, "epoch": 0.2421185372005044, "grad_norm": 10.5, "learning_rate": 1.7680724708331164e-05, "loss": 1.8301, "mean_token_accuracy": 0.5730539560317993, "num_tokens": 196223.0, "step": 192 }, { "entropy": 1.8013971447944641, "epoch": 0.24337957124842372, "grad_norm": 10.75, "learning_rate": 1.7654635998494755e-05, "loss": 1.7305, "mean_token_accuracy": 0.5656139552593231, "num_tokens": 197264.0, "step": 193 }, { "entropy": 1.653419554233551, "epoch": 0.244640605296343, "grad_norm": 10.3125, "learning_rate": 1.7628420854418082e-05, "loss": 1.5073, "mean_token_accuracy": 0.6104737818241119, "num_tokens": 198209.0, "step": 194 }, { "entropy": 1.690063714981079, "epoch": 0.2459016393442623, "grad_norm": 10.3125, "learning_rate": 1.7602079709105644e-05, "loss": 1.6197, "mean_token_accuracy": 0.601123034954071, "num_tokens": 199190.0, "step": 195 }, { "entropy": 1.735607922077179, "epoch": 0.2471626733921816, "grad_norm": 10.6875, "learning_rate": 1.7575612997643145e-05, "loss": 1.6828, "mean_token_accuracy": 0.6010057330131531, "num_tokens": 200142.0, "step": 196 }, { "entropy": 1.7570839524269104, "epoch": 0.2484237074401009, "grad_norm": 10.0, "learning_rate": 1.7549021157190306e-05, "loss": 1.6746, "mean_token_accuracy": 0.5818617343902588, "num_tokens": 201178.0, "step": 197 }, { "entropy": 1.5852105021476746, "epoch": 0.24968474148802017, "grad_norm": 10.3125, "learning_rate": 1.752230462697365e-05, "loss": 1.541, "mean_token_accuracy": 0.6247271299362183, "num_tokens": 202116.0, "step": 198 }, { "entropy": 1.7055960893630981, "epoch": 0.2509457755359395, "grad_norm": 10.0, "learning_rate": 1.7495463848279245e-05, "loss": 1.7141, "mean_token_accuracy": 0.5982573330402374, "num_tokens": 203204.0, "step": 199 }, { "entropy": 1.6302465796470642, "epoch": 0.25220680958385877, "grad_norm": 9.375, "learning_rate": 1.7468499264445405e-05, "loss": 1.4954, "mean_token_accuracy": 0.6210698783397675, "num_tokens": 204281.0, "step": 200 }, { "entropy": 1.616503119468689, "epoch": 0.25346784363177804, "grad_norm": 10.4375, "learning_rate": 1.7441411320855385e-05, "loss": 1.5764, "mean_token_accuracy": 0.6116508543491364, "num_tokens": 205271.0, "step": 201 }, { "entropy": 1.656931459903717, "epoch": 0.2547288776796974, "grad_norm": 10.125, "learning_rate": 1.7414200464930012e-05, "loss": 1.6428, "mean_token_accuracy": 0.6247988939285278, "num_tokens": 206257.0, "step": 202 }, { "entropy": 1.6198022961616516, "epoch": 0.25598991172761665, "grad_norm": 9.875, "learning_rate": 1.73868671461203e-05, "loss": 1.6166, "mean_token_accuracy": 0.5975701808929443, "num_tokens": 207435.0, "step": 203 }, { "entropy": 1.7515166997909546, "epoch": 0.2572509457755359, "grad_norm": 10.0625, "learning_rate": 1.735941181590002e-05, "loss": 1.8691, "mean_token_accuracy": 0.5813634097576141, "num_tokens": 208535.0, "step": 204 }, { "entropy": 1.7693564891815186, "epoch": 0.25851197982345525, "grad_norm": 11.375, "learning_rate": 1.733183492775825e-05, "loss": 1.6963, "mean_token_accuracy": 0.5941225290298462, "num_tokens": 209500.0, "step": 205 }, { "entropy": 1.692057192325592, "epoch": 0.2597730138713745, "grad_norm": 10.375, "learning_rate": 1.730413693719188e-05, "loss": 1.6301, "mean_token_accuracy": 0.5792853236198425, "num_tokens": 210627.0, "step": 206 }, { "entropy": 1.526620626449585, "epoch": 0.2610340479192938, "grad_norm": 9.0, "learning_rate": 1.727631830169809e-05, "loss": 1.3614, "mean_token_accuracy": 0.6597495079040527, "num_tokens": 211754.0, "step": 207 }, { "entropy": 1.6747918725013733, "epoch": 0.26229508196721313, "grad_norm": 9.5625, "learning_rate": 1.72483794807668e-05, "loss": 1.6232, "mean_token_accuracy": 0.6059800088405609, "num_tokens": 212819.0, "step": 208 }, { "entropy": 1.7895873188972473, "epoch": 0.2635561160151324, "grad_norm": 10.6875, "learning_rate": 1.7220320935873066e-05, "loss": 1.7504, "mean_token_accuracy": 0.5805416405200958, "num_tokens": 213802.0, "step": 209 }, { "entropy": 1.634453296661377, "epoch": 0.2648171500630517, "grad_norm": 10.5, "learning_rate": 1.7192143130469466e-05, "loss": 1.5557, "mean_token_accuracy": 0.6099343001842499, "num_tokens": 214834.0, "step": 210 }, { "entropy": 1.5252330303192139, "epoch": 0.266078184110971, "grad_norm": 10.0, "learning_rate": 1.7163846529978455e-05, "loss": 1.5364, "mean_token_accuracy": 0.6193564534187317, "num_tokens": 215985.0, "step": 211 }, { "entropy": 1.6005837321281433, "epoch": 0.2673392181588903, "grad_norm": 10.3125, "learning_rate": 1.7135431601784654e-05, "loss": 1.552, "mean_token_accuracy": 0.611538827419281, "num_tokens": 216962.0, "step": 212 }, { "entropy": 1.689214050769806, "epoch": 0.2686002522068096, "grad_norm": 10.625, "learning_rate": 1.7106898815227143e-05, "loss": 1.6912, "mean_token_accuracy": 0.5871491432189941, "num_tokens": 217992.0, "step": 213 }, { "entropy": 1.6288052797317505, "epoch": 0.2698612862547289, "grad_norm": 11.3125, "learning_rate": 1.7078248641591726e-05, "loss": 1.7354, "mean_token_accuracy": 0.6010589003562927, "num_tokens": 218990.0, "step": 214 }, { "entropy": 1.680719792842865, "epoch": 0.27112232030264816, "grad_norm": 10.5, "learning_rate": 1.7049481554103107e-05, "loss": 1.6217, "mean_token_accuracy": 0.5792437791824341, "num_tokens": 220008.0, "step": 215 }, { "entropy": 1.5593616962432861, "epoch": 0.2723833543505675, "grad_norm": 10.25, "learning_rate": 1.7020598027917117e-05, "loss": 1.5212, "mean_token_accuracy": 0.6116653084754944, "num_tokens": 221037.0, "step": 216 }, { "entropy": 1.7140450477600098, "epoch": 0.27364438839848676, "grad_norm": 10.8125, "learning_rate": 1.6991598540112825e-05, "loss": 1.7497, "mean_token_accuracy": 0.5818181931972504, "num_tokens": 222035.0, "step": 217 }, { "entropy": 1.6045958399772644, "epoch": 0.27490542244640603, "grad_norm": 10.75, "learning_rate": 1.696248356968469e-05, "loss": 1.6136, "mean_token_accuracy": 0.598257303237915, "num_tokens": 223019.0, "step": 218 }, { "entropy": 1.70366370677948, "epoch": 0.27616645649432536, "grad_norm": 9.875, "learning_rate": 1.6933253597534636e-05, "loss": 1.6697, "mean_token_accuracy": 0.5833706855773926, "num_tokens": 224162.0, "step": 219 }, { "entropy": 1.668145775794983, "epoch": 0.27742749054224464, "grad_norm": 10.25, "learning_rate": 1.690390910646411e-05, "loss": 1.6129, "mean_token_accuracy": 0.6058389544487, "num_tokens": 225170.0, "step": 220 }, { "entropy": 1.7130072116851807, "epoch": 0.2786885245901639, "grad_norm": 10.3125, "learning_rate": 1.6874450581166102e-05, "loss": 1.6922, "mean_token_accuracy": 0.6061215698719025, "num_tokens": 226156.0, "step": 221 }, { "entropy": 1.6039882898330688, "epoch": 0.27994955863808324, "grad_norm": 9.8125, "learning_rate": 1.6844878508217155e-05, "loss": 1.5697, "mean_token_accuracy": 0.6189434826374054, "num_tokens": 227269.0, "step": 222 }, { "entropy": 1.7330880761146545, "epoch": 0.2812105926860025, "grad_norm": 9.9375, "learning_rate": 1.6815193376069295e-05, "loss": 1.7152, "mean_token_accuracy": 0.5706145167350769, "num_tokens": 228371.0, "step": 223 }, { "entropy": 1.6350038051605225, "epoch": 0.28247162673392184, "grad_norm": 10.8125, "learning_rate": 1.6785395675042013e-05, "loss": 1.6059, "mean_token_accuracy": 0.59665846824646, "num_tokens": 229314.0, "step": 224 }, { "entropy": 1.6268184185028076, "epoch": 0.2837326607818411, "grad_norm": 10.9375, "learning_rate": 1.6755485897314122e-05, "loss": 1.6301, "mean_token_accuracy": 0.6120674014091492, "num_tokens": 230247.0, "step": 225 }, { "entropy": 1.6736965775489807, "epoch": 0.2849936948297604, "grad_norm": 10.125, "learning_rate": 1.6725464536915648e-05, "loss": 1.5946, "mean_token_accuracy": 0.5917158722877502, "num_tokens": 231316.0, "step": 226 }, { "entropy": 1.658580720424652, "epoch": 0.2862547288776797, "grad_norm": 9.875, "learning_rate": 1.6695332089719668e-05, "loss": 1.6074, "mean_token_accuracy": 0.5995627045631409, "num_tokens": 232373.0, "step": 227 }, { "entropy": 1.5986194610595703, "epoch": 0.287515762925599, "grad_norm": 11.0625, "learning_rate": 1.6665089053434115e-05, "loss": 1.5793, "mean_token_accuracy": 0.6121103763580322, "num_tokens": 233342.0, "step": 228 }, { "entropy": 1.6267426013946533, "epoch": 0.28877679697351827, "grad_norm": 10.0, "learning_rate": 1.6634735927593557e-05, "loss": 1.5595, "mean_token_accuracy": 0.6111132800579071, "num_tokens": 234363.0, "step": 229 }, { "entropy": 1.6530006527900696, "epoch": 0.2900378310214376, "grad_norm": 11.0, "learning_rate": 1.6604273213550957e-05, "loss": 1.5634, "mean_token_accuracy": 0.6302264630794525, "num_tokens": 235358.0, "step": 230 }, { "entropy": 1.6411193013191223, "epoch": 0.29129886506935687, "grad_norm": 9.6875, "learning_rate": 1.6573701414469382e-05, "loss": 1.5509, "mean_token_accuracy": 0.5998447239398956, "num_tokens": 236407.0, "step": 231 }, { "entropy": 1.535860538482666, "epoch": 0.29255989911727615, "grad_norm": 9.4375, "learning_rate": 1.654302103531369e-05, "loss": 1.5039, "mean_token_accuracy": 0.6361163556575775, "num_tokens": 237418.0, "step": 232 }, { "entropy": 1.6116254329681396, "epoch": 0.2938209331651955, "grad_norm": 9.625, "learning_rate": 1.651223258284219e-05, "loss": 1.4401, "mean_token_accuracy": 0.6204985082149506, "num_tokens": 238423.0, "step": 233 }, { "entropy": 1.6180970668792725, "epoch": 0.29508196721311475, "grad_norm": 9.8125, "learning_rate": 1.648133656559828e-05, "loss": 1.6389, "mean_token_accuracy": 0.6117756366729736, "num_tokens": 239529.0, "step": 234 }, { "entropy": 1.7418981194496155, "epoch": 0.296343001261034, "grad_norm": 10.5625, "learning_rate": 1.6450333493902046e-05, "loss": 1.7946, "mean_token_accuracy": 0.5889446437358856, "num_tokens": 240518.0, "step": 235 }, { "entropy": 1.6346675753593445, "epoch": 0.29760403530895335, "grad_norm": 9.9375, "learning_rate": 1.6419223879841823e-05, "loss": 1.568, "mean_token_accuracy": 0.6020772457122803, "num_tokens": 241527.0, "step": 236 }, { "entropy": 1.7152321338653564, "epoch": 0.2988650693568726, "grad_norm": 11.125, "learning_rate": 1.6388008237265744e-05, "loss": 1.7114, "mean_token_accuracy": 0.5903542339801788, "num_tokens": 242555.0, "step": 237 }, { "entropy": 1.5987541675567627, "epoch": 0.30012610340479196, "grad_norm": 10.0625, "learning_rate": 1.6356687081773252e-05, "loss": 1.5698, "mean_token_accuracy": 0.6032786965370178, "num_tokens": 243527.0, "step": 238 }, { "entropy": 1.5720175504684448, "epoch": 0.30138713745271123, "grad_norm": 10.125, "learning_rate": 1.6325260930706584e-05, "loss": 1.5089, "mean_token_accuracy": 0.6329275369644165, "num_tokens": 244554.0, "step": 239 }, { "entropy": 1.6274954676628113, "epoch": 0.3026481715006305, "grad_norm": 10.75, "learning_rate": 1.6293730303142218e-05, "loss": 1.5996, "mean_token_accuracy": 0.6140457987785339, "num_tokens": 245570.0, "step": 240 }, { "entropy": 1.5573576092720032, "epoch": 0.30390920554854983, "grad_norm": 9.375, "learning_rate": 1.6262095719882312e-05, "loss": 1.4947, "mean_token_accuracy": 0.6311947107315063, "num_tokens": 246628.0, "step": 241 }, { "entropy": 1.65983647108078, "epoch": 0.3051702395964691, "grad_norm": 10.6875, "learning_rate": 1.62303577034461e-05, "loss": 1.65, "mean_token_accuracy": 0.5926876962184906, "num_tokens": 247611.0, "step": 242 }, { "entropy": 1.6971190571784973, "epoch": 0.3064312736443884, "grad_norm": 10.125, "learning_rate": 1.6198516778061248e-05, "loss": 1.713, "mean_token_accuracy": 0.5977874100208282, "num_tokens": 248631.0, "step": 243 }, { "entropy": 1.636055052280426, "epoch": 0.3076923076923077, "grad_norm": 10.0625, "learning_rate": 1.616657346965521e-05, "loss": 1.5865, "mean_token_accuracy": 0.6173640191555023, "num_tokens": 249616.0, "step": 244 }, { "entropy": 1.6533807516098022, "epoch": 0.308953341740227, "grad_norm": 10.1875, "learning_rate": 1.6134528305846537e-05, "loss": 1.7129, "mean_token_accuracy": 0.589533805847168, "num_tokens": 250603.0, "step": 245 }, { "entropy": 1.6233521699905396, "epoch": 0.31021437578814626, "grad_norm": 9.8125, "learning_rate": 1.6102381815936153e-05, "loss": 1.5361, "mean_token_accuracy": 0.5984684228897095, "num_tokens": 251620.0, "step": 246 }, { "entropy": 1.6206133365631104, "epoch": 0.3114754098360656, "grad_norm": 10.0625, "learning_rate": 1.6070134530898625e-05, "loss": 1.4942, "mean_token_accuracy": 0.6123421490192413, "num_tokens": 252610.0, "step": 247 }, { "entropy": 1.595905363559723, "epoch": 0.31273644388398486, "grad_norm": 10.0625, "learning_rate": 1.6037786983373386e-05, "loss": 1.5616, "mean_token_accuracy": 0.6123408079147339, "num_tokens": 253614.0, "step": 248 }, { "entropy": 1.6981398463249207, "epoch": 0.31399747793190413, "grad_norm": 10.25, "learning_rate": 1.6005339707655943e-05, "loss": 1.7101, "mean_token_accuracy": 0.5854428708553314, "num_tokens": 254724.0, "step": 249 }, { "entropy": 1.6348340511322021, "epoch": 0.31525851197982346, "grad_norm": 9.6875, "learning_rate": 1.5972793239689038e-05, "loss": 1.5371, "mean_token_accuracy": 0.6322112381458282, "num_tokens": 255791.0, "step": 250 }, { "entropy": 1.5895010232925415, "epoch": 0.31651954602774274, "grad_norm": 10.8125, "learning_rate": 1.594014811705382e-05, "loss": 1.5898, "mean_token_accuracy": 0.6156652271747589, "num_tokens": 256797.0, "step": 251 }, { "entropy": 1.7035390734672546, "epoch": 0.31778058007566207, "grad_norm": 10.0625, "learning_rate": 1.5907404878960936e-05, "loss": 1.7044, "mean_token_accuracy": 0.5872528553009033, "num_tokens": 257887.0, "step": 252 }, { "entropy": 1.6048563718795776, "epoch": 0.31904161412358134, "grad_norm": 9.875, "learning_rate": 1.587456406624165e-05, "loss": 1.5357, "mean_token_accuracy": 0.6179091036319733, "num_tokens": 258945.0, "step": 253 }, { "entropy": 1.6857137084007263, "epoch": 0.3203026481715006, "grad_norm": 10.3125, "learning_rate": 1.584162622133889e-05, "loss": 1.7245, "mean_token_accuracy": 0.5977672934532166, "num_tokens": 259937.0, "step": 254 }, { "entropy": 1.5376020073890686, "epoch": 0.32156368221941994, "grad_norm": 10.125, "learning_rate": 1.5808591888298314e-05, "loss": 1.4081, "mean_token_accuracy": 0.6399954557418823, "num_tokens": 260955.0, "step": 255 }, { "entropy": 1.5937974452972412, "epoch": 0.3228247162673392, "grad_norm": 9.8125, "learning_rate": 1.5775461612759282e-05, "loss": 1.6056, "mean_token_accuracy": 0.6026803851127625, "num_tokens": 262053.0, "step": 256 }, { "entropy": 1.5871049761772156, "epoch": 0.3240857503152585, "grad_norm": 9.625, "learning_rate": 1.5742235941945895e-05, "loss": 1.5565, "mean_token_accuracy": 0.6094169020652771, "num_tokens": 263115.0, "step": 257 }, { "entropy": 1.5924156308174133, "epoch": 0.3253467843631778, "grad_norm": 10.0, "learning_rate": 1.5708915424657917e-05, "loss": 1.6369, "mean_token_accuracy": 0.6104046404361725, "num_tokens": 264166.0, "step": 258 }, { "entropy": 1.6788977980613708, "epoch": 0.3266078184110971, "grad_norm": 10.4375, "learning_rate": 1.5675500611261725e-05, "loss": 1.6851, "mean_token_accuracy": 0.5767435431480408, "num_tokens": 265241.0, "step": 259 }, { "entropy": 1.6361313462257385, "epoch": 0.32786885245901637, "grad_norm": 10.125, "learning_rate": 1.5641992053681213e-05, "loss": 1.5909, "mean_token_accuracy": 0.6082985401153564, "num_tokens": 266258.0, "step": 260 }, { "entropy": 1.6331862807273865, "epoch": 0.3291298865069357, "grad_norm": 9.625, "learning_rate": 1.5608390305388693e-05, "loss": 1.5652, "mean_token_accuracy": 0.6261056959629059, "num_tokens": 267354.0, "step": 261 }, { "entropy": 1.5927565693855286, "epoch": 0.33039092055485497, "grad_norm": 10.5, "learning_rate": 1.557469592139573e-05, "loss": 1.5356, "mean_token_accuracy": 0.6147298514842987, "num_tokens": 268404.0, "step": 262 }, { "entropy": 1.7495569586753845, "epoch": 0.3316519546027743, "grad_norm": 10.625, "learning_rate": 1.554090945824398e-05, "loss": 1.7714, "mean_token_accuracy": 0.575711727142334, "num_tokens": 269378.0, "step": 263 }, { "entropy": 1.774012267589569, "epoch": 0.3329129886506936, "grad_norm": 10.0, "learning_rate": 1.5507031473996016e-05, "loss": 1.7444, "mean_token_accuracy": 0.5899884104728699, "num_tokens": 270455.0, "step": 264 }, { "entropy": 1.6154621839523315, "epoch": 0.33417402269861285, "grad_norm": 9.6875, "learning_rate": 1.5473062528226082e-05, "loss": 1.5548, "mean_token_accuracy": 0.6173100769519806, "num_tokens": 271469.0, "step": 265 }, { "entropy": 1.604124128818512, "epoch": 0.3354350567465322, "grad_norm": 10.3125, "learning_rate": 1.543900318201087e-05, "loss": 1.554, "mean_token_accuracy": 0.6076988577842712, "num_tokens": 272485.0, "step": 266 }, { "entropy": 1.7067211866378784, "epoch": 0.33669609079445145, "grad_norm": 11.5, "learning_rate": 1.5404853997920256e-05, "loss": 1.615, "mean_token_accuracy": 0.5953792333602905, "num_tokens": 273436.0, "step": 267 }, { "entropy": 1.6479616165161133, "epoch": 0.3379571248423707, "grad_norm": 9.5625, "learning_rate": 1.5370615540007986e-05, "loss": 1.6176, "mean_token_accuracy": 0.5981805324554443, "num_tokens": 274539.0, "step": 268 }, { "entropy": 1.6458925604820251, "epoch": 0.33921815889029006, "grad_norm": 9.75, "learning_rate": 1.5336288373802377e-05, "loss": 1.606, "mean_token_accuracy": 0.6037389934062958, "num_tokens": 275564.0, "step": 269 }, { "entropy": 1.5988786220550537, "epoch": 0.34047919293820933, "grad_norm": 10.0, "learning_rate": 1.530187306629697e-05, "loss": 1.5883, "mean_token_accuracy": 0.6218869984149933, "num_tokens": 276588.0, "step": 270 }, { "entropy": 1.7115415930747986, "epoch": 0.3417402269861286, "grad_norm": 10.5, "learning_rate": 1.5267370185941167e-05, "loss": 1.7034, "mean_token_accuracy": 0.5866121649742126, "num_tokens": 277566.0, "step": 271 }, { "entropy": 1.6453835368156433, "epoch": 0.34300126103404793, "grad_norm": 9.9375, "learning_rate": 1.5232780302630845e-05, "loss": 1.5937, "mean_token_accuracy": 0.6008328199386597, "num_tokens": 278651.0, "step": 272 }, { "entropy": 1.6336002945899963, "epoch": 0.3442622950819672, "grad_norm": 9.75, "learning_rate": 1.5198103987698934e-05, "loss": 1.5292, "mean_token_accuracy": 0.6085817515850067, "num_tokens": 279801.0, "step": 273 }, { "entropy": 1.6854661107063293, "epoch": 0.3455233291298865, "grad_norm": 10.1875, "learning_rate": 1.5163341813905983e-05, "loss": 1.7202, "mean_token_accuracy": 0.5947639346122742, "num_tokens": 280820.0, "step": 274 }, { "entropy": 1.6281224489212036, "epoch": 0.3467843631778058, "grad_norm": 11.0625, "learning_rate": 1.5128494355430698e-05, "loss": 1.6097, "mean_token_accuracy": 0.6258082985877991, "num_tokens": 281750.0, "step": 275 }, { "entropy": 1.6371582746505737, "epoch": 0.3480453972257251, "grad_norm": 9.4375, "learning_rate": 1.5093562187860476e-05, "loss": 1.5366, "mean_token_accuracy": 0.6078951954841614, "num_tokens": 282806.0, "step": 276 }, { "entropy": 1.6713650226593018, "epoch": 0.3493064312736444, "grad_norm": 10.375, "learning_rate": 1.505854588818187e-05, "loss": 1.7111, "mean_token_accuracy": 0.5980280041694641, "num_tokens": 283936.0, "step": 277 }, { "entropy": 1.7434438467025757, "epoch": 0.3505674653215637, "grad_norm": 10.75, "learning_rate": 1.5023446034771077e-05, "loss": 1.6995, "mean_token_accuracy": 0.5988207757472992, "num_tokens": 284894.0, "step": 278 }, { "entropy": 1.6402634382247925, "epoch": 0.35182849936948296, "grad_norm": 10.5625, "learning_rate": 1.4988263207384373e-05, "loss": 1.6622, "mean_token_accuracy": 0.590718001127243, "num_tokens": 285922.0, "step": 279 }, { "entropy": 1.664858877658844, "epoch": 0.3530895334174023, "grad_norm": 10.125, "learning_rate": 1.4952997987148554e-05, "loss": 1.7105, "mean_token_accuracy": 0.5985745191574097, "num_tokens": 286934.0, "step": 280 }, { "entropy": 1.5987516045570374, "epoch": 0.35435056746532156, "grad_norm": 11.0, "learning_rate": 1.4917650956551322e-05, "loss": 1.5766, "mean_token_accuracy": 0.6058200299739838, "num_tokens": 287870.0, "step": 281 }, { "entropy": 1.7357138991355896, "epoch": 0.35561160151324084, "grad_norm": 10.875, "learning_rate": 1.4882222699431664e-05, "loss": 1.5859, "mean_token_accuracy": 0.5942579209804535, "num_tokens": 288867.0, "step": 282 }, { "entropy": 1.6793668866157532, "epoch": 0.35687263556116017, "grad_norm": 9.875, "learning_rate": 1.4846713800970217e-05, "loss": 1.6434, "mean_token_accuracy": 0.5955098867416382, "num_tokens": 289975.0, "step": 283 }, { "entropy": 1.608109951019287, "epoch": 0.35813366960907944, "grad_norm": 10.0, "learning_rate": 1.4811124847679603e-05, "loss": 1.4639, "mean_token_accuracy": 0.6151954233646393, "num_tokens": 290984.0, "step": 284 }, { "entropy": 1.671760380268097, "epoch": 0.3593947036569987, "grad_norm": 9.5625, "learning_rate": 1.4775456427394732e-05, "loss": 1.6765, "mean_token_accuracy": 0.6170277297496796, "num_tokens": 292072.0, "step": 285 }, { "entropy": 1.7108528017997742, "epoch": 0.36065573770491804, "grad_norm": 10.4375, "learning_rate": 1.4739709129263098e-05, "loss": 1.644, "mean_token_accuracy": 0.5863812863826752, "num_tokens": 293028.0, "step": 286 }, { "entropy": 1.6518496870994568, "epoch": 0.3619167717528373, "grad_norm": 9.625, "learning_rate": 1.4703883543735047e-05, "loss": 1.5281, "mean_token_accuracy": 0.622421383857727, "num_tokens": 294115.0, "step": 287 }, { "entropy": 1.722779393196106, "epoch": 0.36317780580075665, "grad_norm": 10.75, "learning_rate": 1.4667980262554026e-05, "loss": 1.663, "mean_token_accuracy": 0.5935376286506653, "num_tokens": 295136.0, "step": 288 }, { "entropy": 1.670470952987671, "epoch": 0.3644388398486759, "grad_norm": 9.6875, "learning_rate": 1.4631999878746808e-05, "loss": 1.5116, "mean_token_accuracy": 0.6112522780895233, "num_tokens": 296290.0, "step": 289 }, { "entropy": 1.7348973751068115, "epoch": 0.3656998738965952, "grad_norm": 10.3125, "learning_rate": 1.4595942986613696e-05, "loss": 1.7292, "mean_token_accuracy": 0.5710300803184509, "num_tokens": 297324.0, "step": 290 }, { "entropy": 1.6113238334655762, "epoch": 0.3669609079445145, "grad_norm": 9.9375, "learning_rate": 1.4559810181718706e-05, "loss": 1.6248, "mean_token_accuracy": 0.5936411619186401, "num_tokens": 298359.0, "step": 291 }, { "entropy": 1.6766598224639893, "epoch": 0.3682219419924338, "grad_norm": 10.6875, "learning_rate": 1.4523602060879729e-05, "loss": 1.6773, "mean_token_accuracy": 0.5820978581905365, "num_tokens": 299301.0, "step": 292 }, { "entropy": 1.568081796169281, "epoch": 0.3694829760403531, "grad_norm": 12.1875, "learning_rate": 1.4487319222158686e-05, "loss": 1.6511, "mean_token_accuracy": 0.5992470383644104, "num_tokens": 300288.0, "step": 293 }, { "entropy": 1.6543119549751282, "epoch": 0.3707440100882724, "grad_norm": 10.125, "learning_rate": 1.4450962264851624e-05, "loss": 1.6154, "mean_token_accuracy": 0.6061901152133942, "num_tokens": 301233.0, "step": 294 }, { "entropy": 1.6144514679908752, "epoch": 0.3720050441361917, "grad_norm": 10.625, "learning_rate": 1.4414531789478841e-05, "loss": 1.4881, "mean_token_accuracy": 0.6079922318458557, "num_tokens": 302187.0, "step": 295 }, { "entropy": 1.7027471661567688, "epoch": 0.37326607818411095, "grad_norm": 11.0, "learning_rate": 1.4378028397774956e-05, "loss": 1.7576, "mean_token_accuracy": 0.5662052035331726, "num_tokens": 303178.0, "step": 296 }, { "entropy": 1.7361412644386292, "epoch": 0.3745271122320303, "grad_norm": 10.875, "learning_rate": 1.4341452692678977e-05, "loss": 1.7464, "mean_token_accuracy": 0.5893420279026031, "num_tokens": 304216.0, "step": 297 }, { "entropy": 1.572529911994934, "epoch": 0.37578814627994955, "grad_norm": 10.125, "learning_rate": 1.4304805278324321e-05, "loss": 1.6473, "mean_token_accuracy": 0.5932281911373138, "num_tokens": 305253.0, "step": 298 }, { "entropy": 1.6188668608665466, "epoch": 0.3770491803278688, "grad_norm": 10.5, "learning_rate": 1.4268086760028872e-05, "loss": 1.6927, "mean_token_accuracy": 0.5837763547897339, "num_tokens": 306328.0, "step": 299 }, { "entropy": 1.598306119441986, "epoch": 0.37831021437578816, "grad_norm": 9.8125, "learning_rate": 1.423129774428495e-05, "loss": 1.5212, "mean_token_accuracy": 0.6186553537845612, "num_tokens": 307333.0, "step": 300 }, { "entropy": 1.6257503628730774, "epoch": 0.37957124842370743, "grad_norm": 9.5625, "learning_rate": 1.4194438838749305e-05, "loss": 1.5741, "mean_token_accuracy": 0.5986464321613312, "num_tokens": 308430.0, "step": 301 }, { "entropy": 1.5349686741828918, "epoch": 0.38083228247162676, "grad_norm": 9.9375, "learning_rate": 1.4157510652233084e-05, "loss": 1.4696, "mean_token_accuracy": 0.6411460041999817, "num_tokens": 309366.0, "step": 302 }, { "entropy": 1.5708142518997192, "epoch": 0.38209331651954603, "grad_norm": 10.25, "learning_rate": 1.4120513794691776e-05, "loss": 1.4997, "mean_token_accuracy": 0.6383326947689056, "num_tokens": 310319.0, "step": 303 }, { "entropy": 1.7651317715644836, "epoch": 0.3833543505674653, "grad_norm": 9.875, "learning_rate": 1.4083448877215124e-05, "loss": 1.8198, "mean_token_accuracy": 0.5711182057857513, "num_tokens": 311421.0, "step": 304 }, { "entropy": 1.6001337766647339, "epoch": 0.38461538461538464, "grad_norm": 10.25, "learning_rate": 1.4046316512017044e-05, "loss": 1.544, "mean_token_accuracy": 0.6265537142753601, "num_tokens": 312503.0, "step": 305 }, { "entropy": 1.5876373052597046, "epoch": 0.3858764186633039, "grad_norm": 9.5, "learning_rate": 1.4009117312425508e-05, "loss": 1.5484, "mean_token_accuracy": 0.6097703576087952, "num_tokens": 313569.0, "step": 306 }, { "entropy": 1.5826433300971985, "epoch": 0.3871374527112232, "grad_norm": 10.875, "learning_rate": 1.3971851892872426e-05, "loss": 1.6186, "mean_token_accuracy": 0.616737425327301, "num_tokens": 314606.0, "step": 307 }, { "entropy": 1.7062678337097168, "epoch": 0.3883984867591425, "grad_norm": 9.9375, "learning_rate": 1.3934520868883458e-05, "loss": 1.6629, "mean_token_accuracy": 0.6007142961025238, "num_tokens": 315649.0, "step": 308 }, { "entropy": 1.737806260585785, "epoch": 0.3896595208070618, "grad_norm": 10.125, "learning_rate": 1.389712485706791e-05, "loss": 1.6147, "mean_token_accuracy": 0.601561039686203, "num_tokens": 316674.0, "step": 309 }, { "entropy": 1.7057384848594666, "epoch": 0.39092055485498106, "grad_norm": 9.875, "learning_rate": 1.3859664475108483e-05, "loss": 1.7392, "mean_token_accuracy": 0.5974953472614288, "num_tokens": 317830.0, "step": 310 }, { "entropy": 1.6910250782966614, "epoch": 0.3921815889029004, "grad_norm": 9.625, "learning_rate": 1.3822140341751122e-05, "loss": 1.6296, "mean_token_accuracy": 0.604820191860199, "num_tokens": 318911.0, "step": 311 }, { "entropy": 1.6173145771026611, "epoch": 0.39344262295081966, "grad_norm": 9.875, "learning_rate": 1.3784553076794768e-05, "loss": 1.552, "mean_token_accuracy": 0.6047369539737701, "num_tokens": 319921.0, "step": 312 }, { "entropy": 1.5731265544891357, "epoch": 0.39470365699873894, "grad_norm": 9.8125, "learning_rate": 1.3746903301081131e-05, "loss": 1.5985, "mean_token_accuracy": 0.5914210677146912, "num_tokens": 320934.0, "step": 313 }, { "entropy": 1.7886484265327454, "epoch": 0.39596469104665827, "grad_norm": 10.375, "learning_rate": 1.3709191636484427e-05, "loss": 1.8448, "mean_token_accuracy": 0.5820522606372833, "num_tokens": 321982.0, "step": 314 }, { "entropy": 1.6690111756324768, "epoch": 0.39722572509457754, "grad_norm": 10.25, "learning_rate": 1.3671418705901116e-05, "loss": 1.5918, "mean_token_accuracy": 0.5964595973491669, "num_tokens": 323078.0, "step": 315 }, { "entropy": 1.5699005126953125, "epoch": 0.39848675914249687, "grad_norm": 9.3125, "learning_rate": 1.363358513323961e-05, "loss": 1.5419, "mean_token_accuracy": 0.6049994826316833, "num_tokens": 324137.0, "step": 316 }, { "entropy": 1.6646732687950134, "epoch": 0.39974779319041615, "grad_norm": 9.625, "learning_rate": 1.3595691543409965e-05, "loss": 1.5807, "mean_token_accuracy": 0.6185460090637207, "num_tokens": 325172.0, "step": 317 }, { "entropy": 1.570213496685028, "epoch": 0.4010088272383354, "grad_norm": 9.3125, "learning_rate": 1.3557738562313567e-05, "loss": 1.5077, "mean_token_accuracy": 0.6095544099807739, "num_tokens": 326289.0, "step": 318 }, { "entropy": 1.6996743083000183, "epoch": 0.40226986128625475, "grad_norm": 10.1875, "learning_rate": 1.3519726816832775e-05, "loss": 1.6818, "mean_token_accuracy": 0.6007489562034607, "num_tokens": 327275.0, "step": 319 }, { "entropy": 1.6339809894561768, "epoch": 0.403530895334174, "grad_norm": 9.5, "learning_rate": 1.3481656934820588e-05, "loss": 1.5448, "mean_token_accuracy": 0.6216733753681183, "num_tokens": 328328.0, "step": 320 }, { "entropy": 1.7442388534545898, "epoch": 0.4047919293820933, "grad_norm": 10.5625, "learning_rate": 1.3443529545090271e-05, "loss": 1.6775, "mean_token_accuracy": 0.5959572196006775, "num_tokens": 329277.0, "step": 321 }, { "entropy": 1.748035728931427, "epoch": 0.4060529634300126, "grad_norm": 9.5625, "learning_rate": 1.340534527740495e-05, "loss": 1.6494, "mean_token_accuracy": 0.5945543348789215, "num_tokens": 330321.0, "step": 322 }, { "entropy": 1.7139116525650024, "epoch": 0.4073139974779319, "grad_norm": 10.8125, "learning_rate": 1.336710476246724e-05, "loss": 1.6617, "mean_token_accuracy": 0.6113535761833191, "num_tokens": 331273.0, "step": 323 }, { "entropy": 1.64111989736557, "epoch": 0.4085750315258512, "grad_norm": 10.0, "learning_rate": 1.3328808631908793e-05, "loss": 1.5508, "mean_token_accuracy": 0.6171705424785614, "num_tokens": 332336.0, "step": 324 }, { "entropy": 1.654185175895691, "epoch": 0.4098360655737705, "grad_norm": 10.5625, "learning_rate": 1.32904575182799e-05, "loss": 1.6993, "mean_token_accuracy": 0.5866393744945526, "num_tokens": 333364.0, "step": 325 }, { "entropy": 1.6556926369667053, "epoch": 0.4110970996216898, "grad_norm": 10.6875, "learning_rate": 1.325205205503902e-05, "loss": 1.6917, "mean_token_accuracy": 0.6197098195552826, "num_tokens": 334299.0, "step": 326 }, { "entropy": 1.5928033590316772, "epoch": 0.4123581336696091, "grad_norm": 10.625, "learning_rate": 1.3213592876542311e-05, "loss": 1.5404, "mean_token_accuracy": 0.6149138510227203, "num_tokens": 335227.0, "step": 327 }, { "entropy": 1.6902371644973755, "epoch": 0.4136191677175284, "grad_norm": 10.25, "learning_rate": 1.3175080618033184e-05, "loss": 1.601, "mean_token_accuracy": 0.6110547780990601, "num_tokens": 336256.0, "step": 328 }, { "entropy": 1.5617586970329285, "epoch": 0.41488020176544765, "grad_norm": 9.25, "learning_rate": 1.3136515915631787e-05, "loss": 1.5141, "mean_token_accuracy": 0.6153754889965057, "num_tokens": 337345.0, "step": 329 }, { "entropy": 1.750313639640808, "epoch": 0.416141235813367, "grad_norm": 10.0625, "learning_rate": 1.309789940632448e-05, "loss": 1.6528, "mean_token_accuracy": 0.5952678918838501, "num_tokens": 338393.0, "step": 330 }, { "entropy": 1.6990376114845276, "epoch": 0.41740226986128626, "grad_norm": 9.875, "learning_rate": 1.305923172795337e-05, "loss": 1.6271, "mean_token_accuracy": 0.5852847993373871, "num_tokens": 339528.0, "step": 331 }, { "entropy": 1.5784698724746704, "epoch": 0.41866330390920553, "grad_norm": 10.1875, "learning_rate": 1.3020513519205714e-05, "loss": 1.4595, "mean_token_accuracy": 0.6244376301765442, "num_tokens": 340505.0, "step": 332 }, { "entropy": 1.646328330039978, "epoch": 0.41992433795712486, "grad_norm": 9.625, "learning_rate": 1.2981745419603403e-05, "loss": 1.5663, "mean_token_accuracy": 0.6136239767074585, "num_tokens": 341606.0, "step": 333 }, { "entropy": 1.5949352979660034, "epoch": 0.42118537200504413, "grad_norm": 11.375, "learning_rate": 1.29429280694924e-05, "loss": 1.6404, "mean_token_accuracy": 0.5875102579593658, "num_tokens": 342542.0, "step": 334 }, { "entropy": 1.6558752059936523, "epoch": 0.4224464060529634, "grad_norm": 10.75, "learning_rate": 1.2904062110032145e-05, "loss": 1.6276, "mean_token_accuracy": 0.6022941172122955, "num_tokens": 343518.0, "step": 335 }, { "entropy": 1.5980592370033264, "epoch": 0.42370744010088274, "grad_norm": 10.0625, "learning_rate": 1.286514818318499e-05, "loss": 1.5295, "mean_token_accuracy": 0.6176810562610626, "num_tokens": 344569.0, "step": 336 }, { "entropy": 1.7125784754753113, "epoch": 0.424968474148802, "grad_norm": 10.375, "learning_rate": 1.2826186931705562e-05, "loss": 1.7364, "mean_token_accuracy": 0.5906746685504913, "num_tokens": 345615.0, "step": 337 }, { "entropy": 1.6670573949813843, "epoch": 0.4262295081967213, "grad_norm": 9.8125, "learning_rate": 1.2787178999130176e-05, "loss": 1.6963, "mean_token_accuracy": 0.5844032764434814, "num_tokens": 346655.0, "step": 338 }, { "entropy": 1.59793359041214, "epoch": 0.4274905422446406, "grad_norm": 11.0625, "learning_rate": 1.2748125029766199e-05, "loss": 1.7215, "mean_token_accuracy": 0.5798592269420624, "num_tokens": 347758.0, "step": 339 }, { "entropy": 1.5533649325370789, "epoch": 0.4287515762925599, "grad_norm": 9.75, "learning_rate": 1.270902566868139e-05, "loss": 1.4829, "mean_token_accuracy": 0.6233780384063721, "num_tokens": 348812.0, "step": 340 }, { "entropy": 1.5563918352127075, "epoch": 0.4300126103404792, "grad_norm": 10.0, "learning_rate": 1.2669881561693268e-05, "loss": 1.5464, "mean_token_accuracy": 0.6154004633426666, "num_tokens": 349899.0, "step": 341 }, { "entropy": 1.6067227125167847, "epoch": 0.4312736443883985, "grad_norm": 9.75, "learning_rate": 1.2630693355358436e-05, "loss": 1.6096, "mean_token_accuracy": 0.6106597483158112, "num_tokens": 350892.0, "step": 342 }, { "entropy": 1.6174876689910889, "epoch": 0.43253467843631777, "grad_norm": 9.6875, "learning_rate": 1.2591461696961895e-05, "loss": 1.5553, "mean_token_accuracy": 0.6354844272136688, "num_tokens": 351985.0, "step": 343 }, { "entropy": 1.5226198434829712, "epoch": 0.4337957124842371, "grad_norm": 11.5625, "learning_rate": 1.2552187234506363e-05, "loss": 1.4493, "mean_token_accuracy": 0.6296395361423492, "num_tokens": 352930.0, "step": 344 }, { "entropy": 1.6481866836547852, "epoch": 0.43505674653215637, "grad_norm": 10.4375, "learning_rate": 1.2512870616701571e-05, "loss": 1.7494, "mean_token_accuracy": 0.5906344056129456, "num_tokens": 353936.0, "step": 345 }, { "entropy": 1.6437349319458008, "epoch": 0.43631778058007564, "grad_norm": 10.0625, "learning_rate": 1.247351249295353e-05, "loss": 1.622, "mean_token_accuracy": 0.6081748604774475, "num_tokens": 354963.0, "step": 346 }, { "entropy": 1.6472490429878235, "epoch": 0.43757881462799497, "grad_norm": 9.75, "learning_rate": 1.2434113513353834e-05, "loss": 1.5786, "mean_token_accuracy": 0.6120360493659973, "num_tokens": 356033.0, "step": 347 }, { "entropy": 1.5894339680671692, "epoch": 0.43883984867591425, "grad_norm": 10.25, "learning_rate": 1.2394674328668905e-05, "loss": 1.586, "mean_token_accuracy": 0.5935371220111847, "num_tokens": 357017.0, "step": 348 }, { "entropy": 1.6726936101913452, "epoch": 0.4401008827238335, "grad_norm": 10.25, "learning_rate": 1.2355195590329233e-05, "loss": 1.6063, "mean_token_accuracy": 0.5973404049873352, "num_tokens": 358044.0, "step": 349 }, { "entropy": 1.5750855803489685, "epoch": 0.44136191677175285, "grad_norm": 9.6875, "learning_rate": 1.2315677950418645e-05, "loss": 1.4712, "mean_token_accuracy": 0.6315289437770844, "num_tokens": 359086.0, "step": 350 }, { "entropy": 1.6587135195732117, "epoch": 0.4426229508196721, "grad_norm": 10.75, "learning_rate": 1.2276122061663512e-05, "loss": 1.7816, "mean_token_accuracy": 0.5714567303657532, "num_tokens": 360075.0, "step": 351 }, { "entropy": 1.6971294283866882, "epoch": 0.44388398486759145, "grad_norm": 10.125, "learning_rate": 1.2236528577421976e-05, "loss": 1.645, "mean_token_accuracy": 0.603605717420578, "num_tokens": 361105.0, "step": 352 }, { "entropy": 1.5821102857589722, "epoch": 0.4451450189155107, "grad_norm": 10.125, "learning_rate": 1.2196898151673151e-05, "loss": 1.5037, "mean_token_accuracy": 0.6134222447872162, "num_tokens": 362102.0, "step": 353 }, { "entropy": 1.658466398715973, "epoch": 0.44640605296343, "grad_norm": 10.0625, "learning_rate": 1.2157231439006332e-05, "loss": 1.6378, "mean_token_accuracy": 0.5979603230953217, "num_tokens": 363142.0, "step": 354 }, { "entropy": 1.5029519200325012, "epoch": 0.44766708701134933, "grad_norm": 9.875, "learning_rate": 1.2117529094610177e-05, "loss": 1.5073, "mean_token_accuracy": 0.6103595197200775, "num_tokens": 364152.0, "step": 355 }, { "entropy": 1.594939947128296, "epoch": 0.4489281210592686, "grad_norm": 10.0, "learning_rate": 1.2077791774261884e-05, "loss": 1.5719, "mean_token_accuracy": 0.6029103994369507, "num_tokens": 365285.0, "step": 356 }, { "entropy": 1.6445053815841675, "epoch": 0.4501891551071879, "grad_norm": 9.9375, "learning_rate": 1.2038020134316361e-05, "loss": 1.5611, "mean_token_accuracy": 0.5866135954856873, "num_tokens": 366248.0, "step": 357 }, { "entropy": 1.5946715474128723, "epoch": 0.4514501891551072, "grad_norm": 10.125, "learning_rate": 1.1998214831695388e-05, "loss": 1.5427, "mean_token_accuracy": 0.6005336046218872, "num_tokens": 367310.0, "step": 358 }, { "entropy": 1.8378031253814697, "epoch": 0.4527112232030265, "grad_norm": 10.4375, "learning_rate": 1.1958376523876754e-05, "loss": 1.9031, "mean_token_accuracy": 0.5457925498485565, "num_tokens": 368362.0, "step": 359 }, { "entropy": 1.6695040464401245, "epoch": 0.45397225725094575, "grad_norm": 9.6875, "learning_rate": 1.1918505868883414e-05, "loss": 1.5786, "mean_token_accuracy": 0.5993266105651855, "num_tokens": 369444.0, "step": 360 }, { "entropy": 1.7709419131278992, "epoch": 0.4552332912988651, "grad_norm": 10.375, "learning_rate": 1.1878603525272613e-05, "loss": 1.7425, "mean_token_accuracy": 0.5715267360210419, "num_tokens": 370476.0, "step": 361 }, { "entropy": 1.6697160005569458, "epoch": 0.45649432534678436, "grad_norm": 9.9375, "learning_rate": 1.1838670152125002e-05, "loss": 1.6235, "mean_token_accuracy": 0.5874466001987457, "num_tokens": 371493.0, "step": 362 }, { "entropy": 1.6504763960838318, "epoch": 0.45775535939470363, "grad_norm": 9.8125, "learning_rate": 1.179870640903376e-05, "loss": 1.6297, "mean_token_accuracy": 0.611328125, "num_tokens": 372589.0, "step": 363 }, { "entropy": 1.703143298625946, "epoch": 0.45901639344262296, "grad_norm": 10.625, "learning_rate": 1.1758712956093699e-05, "loss": 1.5668, "mean_token_accuracy": 0.619348019361496, "num_tokens": 373566.0, "step": 364 }, { "entropy": 1.6715249419212341, "epoch": 0.46027742749054223, "grad_norm": 9.625, "learning_rate": 1.1718690453890356e-05, "loss": 1.6445, "mean_token_accuracy": 0.5938351452350616, "num_tokens": 374681.0, "step": 365 }, { "entropy": 1.6687431335449219, "epoch": 0.46153846153846156, "grad_norm": 9.5, "learning_rate": 1.1678639563489085e-05, "loss": 1.6033, "mean_token_accuracy": 0.6006240844726562, "num_tokens": 375780.0, "step": 366 }, { "entropy": 1.698667287826538, "epoch": 0.46279949558638084, "grad_norm": 10.375, "learning_rate": 1.163856094642414e-05, "loss": 1.7423, "mean_token_accuracy": 0.5795640051364899, "num_tokens": 376792.0, "step": 367 }, { "entropy": 1.5898205637931824, "epoch": 0.4640605296343001, "grad_norm": 10.6875, "learning_rate": 1.159845526468774e-05, "loss": 1.5514, "mean_token_accuracy": 0.6268898248672485, "num_tokens": 377749.0, "step": 368 }, { "entropy": 1.5236408710479736, "epoch": 0.46532156368221944, "grad_norm": 10.4375, "learning_rate": 1.1558323180719147e-05, "loss": 1.5018, "mean_token_accuracy": 0.6263366341590881, "num_tokens": 378731.0, "step": 369 }, { "entropy": 1.5538042783737183, "epoch": 0.4665825977301387, "grad_norm": 9.625, "learning_rate": 1.1518165357393716e-05, "loss": 1.4621, "mean_token_accuracy": 0.6311676800251007, "num_tokens": 379782.0, "step": 370 }, { "entropy": 1.693616509437561, "epoch": 0.467843631778058, "grad_norm": 9.375, "learning_rate": 1.1477982458011945e-05, "loss": 1.5905, "mean_token_accuracy": 0.5960313081741333, "num_tokens": 380929.0, "step": 371 }, { "entropy": 1.606422245502472, "epoch": 0.4691046658259773, "grad_norm": 9.75, "learning_rate": 1.1437775146288522e-05, "loss": 1.6387, "mean_token_accuracy": 0.6152320206165314, "num_tokens": 381995.0, "step": 372 }, { "entropy": 1.6852609515190125, "epoch": 0.4703656998738966, "grad_norm": 10.4375, "learning_rate": 1.1397544086341366e-05, "loss": 1.6951, "mean_token_accuracy": 0.5859934687614441, "num_tokens": 382974.0, "step": 373 }, { "entropy": 1.5799720287322998, "epoch": 0.47162673392181587, "grad_norm": 9.9375, "learning_rate": 1.1357289942680652e-05, "loss": 1.5323, "mean_token_accuracy": 0.6245266199111938, "num_tokens": 383989.0, "step": 374 }, { "entropy": 1.7972606420516968, "epoch": 0.4728877679697352, "grad_norm": 10.875, "learning_rate": 1.1317013380197832e-05, "loss": 1.7597, "mean_token_accuracy": 0.5681908130645752, "num_tokens": 385042.0, "step": 375 }, { "entropy": 1.5598702430725098, "epoch": 0.47414880201765447, "grad_norm": 9.6875, "learning_rate": 1.1276715064154663e-05, "loss": 1.4771, "mean_token_accuracy": 0.6240810751914978, "num_tokens": 386083.0, "step": 376 }, { "entropy": 1.590512454509735, "epoch": 0.47540983606557374, "grad_norm": 10.25, "learning_rate": 1.123639566017221e-05, "loss": 1.5557, "mean_token_accuracy": 0.6280277073383331, "num_tokens": 387030.0, "step": 377 }, { "entropy": 1.6556403636932373, "epoch": 0.4766708701134931, "grad_norm": 10.625, "learning_rate": 1.119605583421986e-05, "loss": 1.5002, "mean_token_accuracy": 0.6344245374202728, "num_tokens": 387986.0, "step": 378 }, { "entropy": 1.6127241253852844, "epoch": 0.47793190416141235, "grad_norm": 9.5625, "learning_rate": 1.1155696252604305e-05, "loss": 1.5813, "mean_token_accuracy": 0.6234078109264374, "num_tokens": 389019.0, "step": 379 }, { "entropy": 1.567520260810852, "epoch": 0.4791929382093317, "grad_norm": 9.4375, "learning_rate": 1.111531758195856e-05, "loss": 1.4871, "mean_token_accuracy": 0.623456597328186, "num_tokens": 390134.0, "step": 380 }, { "entropy": 1.6580626368522644, "epoch": 0.48045397225725095, "grad_norm": 10.3125, "learning_rate": 1.1074920489230934e-05, "loss": 1.6402, "mean_token_accuracy": 0.6016538441181183, "num_tokens": 391072.0, "step": 381 }, { "entropy": 1.7108508348464966, "epoch": 0.4817150063051702, "grad_norm": 10.75, "learning_rate": 1.1034505641674022e-05, "loss": 1.7194, "mean_token_accuracy": 0.5933779776096344, "num_tokens": 392032.0, "step": 382 }, { "entropy": 1.777218222618103, "epoch": 0.48297604035308955, "grad_norm": 10.0625, "learning_rate": 1.0994073706833682e-05, "loss": 1.6974, "mean_token_accuracy": 0.6018114984035492, "num_tokens": 393070.0, "step": 383 }, { "entropy": 1.6174723505973816, "epoch": 0.4842370744010088, "grad_norm": 10.0625, "learning_rate": 1.0953625352538006e-05, "loss": 1.7052, "mean_token_accuracy": 0.6018138229846954, "num_tokens": 394136.0, "step": 384 }, { "entropy": 1.4872437715530396, "epoch": 0.4854981084489281, "grad_norm": 11.4375, "learning_rate": 1.091316124688629e-05, "loss": 1.4657, "mean_token_accuracy": 0.6230264902114868, "num_tokens": 395019.0, "step": 385 }, { "entropy": 1.5409154295921326, "epoch": 0.48675914249684743, "grad_norm": 9.5, "learning_rate": 1.0872682058238009e-05, "loss": 1.501, "mean_token_accuracy": 0.6168979108333588, "num_tokens": 395986.0, "step": 386 }, { "entropy": 1.5526871085166931, "epoch": 0.4880201765447667, "grad_norm": 9.5, "learning_rate": 1.0832188455201762e-05, "loss": 1.4908, "mean_token_accuracy": 0.6186527013778687, "num_tokens": 397140.0, "step": 387 }, { "entropy": 1.7182149291038513, "epoch": 0.489281210592686, "grad_norm": 11.3125, "learning_rate": 1.0791681106624235e-05, "loss": 1.7584, "mean_token_accuracy": 0.5741702020168304, "num_tokens": 398163.0, "step": 388 }, { "entropy": 1.6726354360580444, "epoch": 0.4905422446406053, "grad_norm": 9.9375, "learning_rate": 1.0751160681579158e-05, "loss": 1.6979, "mean_token_accuracy": 0.5841811895370483, "num_tokens": 399188.0, "step": 389 }, { "entropy": 1.6654912233352661, "epoch": 0.4918032786885246, "grad_norm": 9.8125, "learning_rate": 1.0710627849356246e-05, "loss": 1.677, "mean_token_accuracy": 0.5893719792366028, "num_tokens": 400265.0, "step": 390 }, { "entropy": 1.6826136112213135, "epoch": 0.4930643127364439, "grad_norm": 9.625, "learning_rate": 1.0670083279450147e-05, "loss": 1.7139, "mean_token_accuracy": 0.5932460427284241, "num_tokens": 401384.0, "step": 391 }, { "entropy": 1.7140849232673645, "epoch": 0.4943253467843632, "grad_norm": 9.8125, "learning_rate": 1.0629527641549391e-05, "loss": 1.6901, "mean_token_accuracy": 0.5878322720527649, "num_tokens": 402473.0, "step": 392 }, { "entropy": 1.6500442624092102, "epoch": 0.49558638083228246, "grad_norm": 9.5625, "learning_rate": 1.0588961605525314e-05, "loss": 1.5253, "mean_token_accuracy": 0.6133356094360352, "num_tokens": 403534.0, "step": 393 }, { "entropy": 1.6340318322181702, "epoch": 0.4968474148802018, "grad_norm": 9.875, "learning_rate": 1.0548385841421008e-05, "loss": 1.6853, "mean_token_accuracy": 0.5924564301967621, "num_tokens": 404590.0, "step": 394 }, { "entropy": 1.5939557552337646, "epoch": 0.49810844892812106, "grad_norm": 10.25, "learning_rate": 1.0507801019440235e-05, "loss": 1.5353, "mean_token_accuracy": 0.6335581541061401, "num_tokens": 405597.0, "step": 395 }, { "entropy": 1.6368260979652405, "epoch": 0.49936948297604034, "grad_norm": 10.3125, "learning_rate": 1.0467207809936387e-05, "loss": 1.574, "mean_token_accuracy": 0.6152799725532532, "num_tokens": 406566.0, "step": 396 }, { "entropy": 1.6411439180374146, "epoch": 0.5006305170239597, "grad_norm": 10.0, "learning_rate": 1.0426606883401382e-05, "loss": 1.6547, "mean_token_accuracy": 0.597534567117691, "num_tokens": 407648.0, "step": 397 }, { "entropy": 1.5688404440879822, "epoch": 0.501891551071879, "grad_norm": 11.0, "learning_rate": 1.0385998910454605e-05, "loss": 1.6324, "mean_token_accuracy": 0.6084195673465729, "num_tokens": 408625.0, "step": 398 }, { "entropy": 1.582146406173706, "epoch": 0.5031525851197982, "grad_norm": 9.8125, "learning_rate": 1.034538456183183e-05, "loss": 1.5041, "mean_token_accuracy": 0.6192508339881897, "num_tokens": 409663.0, "step": 399 }, { "entropy": 1.7961878180503845, "epoch": 0.5044136191677175, "grad_norm": 10.0, "learning_rate": 1.0304764508374152e-05, "loss": 1.7948, "mean_token_accuracy": 0.5808870196342468, "num_tokens": 410771.0, "step": 400 }, { "entropy": 1.5845588445663452, "epoch": 0.5056746532156369, "grad_norm": 9.75, "learning_rate": 1.026413942101687e-05, "loss": 1.485, "mean_token_accuracy": 0.6123223900794983, "num_tokens": 411873.0, "step": 401 }, { "entropy": 1.6289093494415283, "epoch": 0.5069356872635561, "grad_norm": 10.75, "learning_rate": 1.0223509970778451e-05, "loss": 1.5713, "mean_token_accuracy": 0.5967106819152832, "num_tokens": 412844.0, "step": 402 }, { "entropy": 1.591609001159668, "epoch": 0.5081967213114754, "grad_norm": 10.1875, "learning_rate": 1.0182876828749419e-05, "loss": 1.6322, "mean_token_accuracy": 0.6031698882579803, "num_tokens": 413923.0, "step": 403 }, { "entropy": 1.7119539380073547, "epoch": 0.5094577553593947, "grad_norm": 10.8125, "learning_rate": 1.0142240666081267e-05, "loss": 1.6689, "mean_token_accuracy": 0.5945393443107605, "num_tokens": 414843.0, "step": 404 }, { "entropy": 1.7793172597885132, "epoch": 0.510718789407314, "grad_norm": 10.4375, "learning_rate": 1.0101602153975398e-05, "loss": 1.752, "mean_token_accuracy": 0.5787781774997711, "num_tokens": 415846.0, "step": 405 }, { "entropy": 1.6222423911094666, "epoch": 0.5119798234552333, "grad_norm": 9.9375, "learning_rate": 1.0060961963672009e-05, "loss": 1.5658, "mean_token_accuracy": 0.6171309351921082, "num_tokens": 416858.0, "step": 406 }, { "entropy": 1.6142125725746155, "epoch": 0.5132408575031526, "grad_norm": 9.9375, "learning_rate": 1.002032076643902e-05, "loss": 1.5111, "mean_token_accuracy": 0.6223633885383606, "num_tokens": 417867.0, "step": 407 }, { "entropy": 1.6783021688461304, "epoch": 0.5145018915510718, "grad_norm": 10.0, "learning_rate": 9.979679233560983e-06, "loss": 1.6308, "mean_token_accuracy": 0.6037567555904388, "num_tokens": 418919.0, "step": 408 }, { "entropy": 1.6696065664291382, "epoch": 0.5157629255989912, "grad_norm": 10.125, "learning_rate": 9.939038036327993e-06, "loss": 1.637, "mean_token_accuracy": 0.597319483757019, "num_tokens": 419921.0, "step": 409 }, { "entropy": 1.6745046973228455, "epoch": 0.5170239596469105, "grad_norm": 11.875, "learning_rate": 9.898397846024604e-06, "loss": 1.6559, "mean_token_accuracy": 0.5922911167144775, "num_tokens": 420764.0, "step": 410 }, { "entropy": 1.6524096727371216, "epoch": 0.5182849936948297, "grad_norm": 10.25, "learning_rate": 9.857759333918736e-06, "loss": 1.6221, "mean_token_accuracy": 0.5971469581127167, "num_tokens": 421788.0, "step": 411 }, { "entropy": 1.7309560775756836, "epoch": 0.519546027742749, "grad_norm": 10.1875, "learning_rate": 9.817123171250586e-06, "loss": 1.7548, "mean_token_accuracy": 0.5891126096248627, "num_tokens": 422819.0, "step": 412 }, { "entropy": 1.6804513335227966, "epoch": 0.5208070617906684, "grad_norm": 10.625, "learning_rate": 9.77649002922155e-06, "loss": 1.6216, "mean_token_accuracy": 0.5936564207077026, "num_tokens": 423775.0, "step": 413 }, { "entropy": 1.6066806316375732, "epoch": 0.5220680958385876, "grad_norm": 9.875, "learning_rate": 9.735860578983134e-06, "loss": 1.5184, "mean_token_accuracy": 0.6163980662822723, "num_tokens": 424847.0, "step": 414 }, { "entropy": 1.7321721911430359, "epoch": 0.5233291298865069, "grad_norm": 10.875, "learning_rate": 9.69523549162585e-06, "loss": 1.7004, "mean_token_accuracy": 0.591398149728775, "num_tokens": 425822.0, "step": 415 }, { "entropy": 1.5671403408050537, "epoch": 0.5245901639344263, "grad_norm": 9.5625, "learning_rate": 9.654615438168168e-06, "loss": 1.4598, "mean_token_accuracy": 0.6316723823547363, "num_tokens": 426834.0, "step": 416 }, { "entropy": 1.5517327785491943, "epoch": 0.5258511979823455, "grad_norm": 9.6875, "learning_rate": 9.614001089545397e-06, "loss": 1.37, "mean_token_accuracy": 0.6457661688327789, "num_tokens": 427799.0, "step": 417 }, { "entropy": 1.6002381443977356, "epoch": 0.5271122320302648, "grad_norm": 9.3125, "learning_rate": 9.573393116598623e-06, "loss": 1.5309, "mean_token_accuracy": 0.6354118883609772, "num_tokens": 428914.0, "step": 418 }, { "entropy": 1.6189780235290527, "epoch": 0.5283732660781841, "grad_norm": 10.0, "learning_rate": 9.532792190063618e-06, "loss": 1.6119, "mean_token_accuracy": 0.6044613420963287, "num_tokens": 429978.0, "step": 419 }, { "entropy": 1.7663971781730652, "epoch": 0.5296343001261034, "grad_norm": 9.9375, "learning_rate": 9.492198980559766e-06, "loss": 1.7127, "mean_token_accuracy": 0.5848791599273682, "num_tokens": 431089.0, "step": 420 }, { "entropy": 1.6590540409088135, "epoch": 0.5308953341740227, "grad_norm": 9.8125, "learning_rate": 9.451614158578995e-06, "loss": 1.5649, "mean_token_accuracy": 0.6263427138328552, "num_tokens": 432112.0, "step": 421 }, { "entropy": 1.6148885488510132, "epoch": 0.532156368221942, "grad_norm": 9.625, "learning_rate": 9.411038394474688e-06, "loss": 1.5817, "mean_token_accuracy": 0.6041344702243805, "num_tokens": 433130.0, "step": 422 }, { "entropy": 1.7220088243484497, "epoch": 0.5334174022698613, "grad_norm": 10.1875, "learning_rate": 9.370472358450609e-06, "loss": 1.782, "mean_token_accuracy": 0.5883914828300476, "num_tokens": 434173.0, "step": 423 }, { "entropy": 1.6253851652145386, "epoch": 0.5346784363177806, "grad_norm": 9.5625, "learning_rate": 9.329916720549855e-06, "loss": 1.6806, "mean_token_accuracy": 0.5752127766609192, "num_tokens": 435273.0, "step": 424 }, { "entropy": 1.565285325050354, "epoch": 0.5359394703656999, "grad_norm": 9.4375, "learning_rate": 9.289372150643759e-06, "loss": 1.5455, "mean_token_accuracy": 0.6019730269908905, "num_tokens": 436387.0, "step": 425 }, { "entropy": 1.6875513195991516, "epoch": 0.5372005044136192, "grad_norm": 10.125, "learning_rate": 9.248839318420846e-06, "loss": 1.6154, "mean_token_accuracy": 0.583704262971878, "num_tokens": 437423.0, "step": 426 }, { "entropy": 1.5952463746070862, "epoch": 0.5384615384615384, "grad_norm": 11.125, "learning_rate": 9.208318893375769e-06, "loss": 1.5467, "mean_token_accuracy": 0.6100804209709167, "num_tokens": 438401.0, "step": 427 }, { "entropy": 1.6592921614646912, "epoch": 0.5397225725094578, "grad_norm": 10.4375, "learning_rate": 9.167811544798241e-06, "loss": 1.7064, "mean_token_accuracy": 0.5798455774784088, "num_tokens": 439411.0, "step": 428 }, { "entropy": 1.638920783996582, "epoch": 0.5409836065573771, "grad_norm": 10.0625, "learning_rate": 9.127317941761993e-06, "loss": 1.7301, "mean_token_accuracy": 0.5835573971271515, "num_tokens": 440443.0, "step": 429 }, { "entropy": 1.6542947888374329, "epoch": 0.5422446406052963, "grad_norm": 9.8125, "learning_rate": 9.08683875311371e-06, "loss": 1.5304, "mean_token_accuracy": 0.6138914525508881, "num_tokens": 441410.0, "step": 430 }, { "entropy": 1.6559125185012817, "epoch": 0.5435056746532156, "grad_norm": 10.25, "learning_rate": 9.046374647462e-06, "loss": 1.519, "mean_token_accuracy": 0.6206876933574677, "num_tokens": 442410.0, "step": 431 }, { "entropy": 1.6727120280265808, "epoch": 0.544766708701135, "grad_norm": 9.875, "learning_rate": 9.005926293166322e-06, "loss": 1.6683, "mean_token_accuracy": 0.6026677787303925, "num_tokens": 443494.0, "step": 432 }, { "entropy": 1.7115206122398376, "epoch": 0.5460277427490542, "grad_norm": 10.3125, "learning_rate": 8.965494358325982e-06, "loss": 1.7807, "mean_token_accuracy": 0.5852868556976318, "num_tokens": 444505.0, "step": 433 }, { "entropy": 1.5636682510375977, "epoch": 0.5472887767969735, "grad_norm": 9.75, "learning_rate": 8.925079510769068e-06, "loss": 1.4986, "mean_token_accuracy": 0.613828033208847, "num_tokens": 445575.0, "step": 434 }, { "entropy": 1.5912127494812012, "epoch": 0.5485498108448928, "grad_norm": 9.6875, "learning_rate": 8.884682418041443e-06, "loss": 1.54, "mean_token_accuracy": 0.5976535975933075, "num_tokens": 446540.0, "step": 435 }, { "entropy": 1.582628309726715, "epoch": 0.5498108448928121, "grad_norm": 9.625, "learning_rate": 8.844303747395697e-06, "loss": 1.6275, "mean_token_accuracy": 0.6039268970489502, "num_tokens": 447601.0, "step": 436 }, { "entropy": 1.64738130569458, "epoch": 0.5510718789407314, "grad_norm": 10.0, "learning_rate": 8.803944165780146e-06, "loss": 1.6521, "mean_token_accuracy": 0.5900446474552155, "num_tokens": 448687.0, "step": 437 }, { "entropy": 1.7025128602981567, "epoch": 0.5523329129886507, "grad_norm": 10.0, "learning_rate": 8.763604339827793e-06, "loss": 1.6996, "mean_token_accuracy": 0.5777526497840881, "num_tokens": 449742.0, "step": 438 }, { "entropy": 1.6411746144294739, "epoch": 0.5535939470365699, "grad_norm": 9.75, "learning_rate": 8.72328493584534e-06, "loss": 1.6065, "mean_token_accuracy": 0.6120361089706421, "num_tokens": 450816.0, "step": 439 }, { "entropy": 1.5925988554954529, "epoch": 0.5548549810844893, "grad_norm": 10.1875, "learning_rate": 8.682986619802171e-06, "loss": 1.553, "mean_token_accuracy": 0.6123770475387573, "num_tokens": 451812.0, "step": 440 }, { "entropy": 1.6425592303276062, "epoch": 0.5561160151324086, "grad_norm": 9.5625, "learning_rate": 8.642710057319352e-06, "loss": 1.5604, "mean_token_accuracy": 0.5966274738311768, "num_tokens": 452908.0, "step": 441 }, { "entropy": 1.6996275782585144, "epoch": 0.5573770491803278, "grad_norm": 10.625, "learning_rate": 8.602455913658634e-06, "loss": 1.7012, "mean_token_accuracy": 0.5858384966850281, "num_tokens": 453906.0, "step": 442 }, { "entropy": 1.7025622725486755, "epoch": 0.5586380832282472, "grad_norm": 10.4375, "learning_rate": 8.562224853711482e-06, "loss": 1.727, "mean_token_accuracy": 0.5890208780765533, "num_tokens": 454936.0, "step": 443 }, { "entropy": 1.6388814449310303, "epoch": 0.5598991172761665, "grad_norm": 9.6875, "learning_rate": 8.52201754198806e-06, "loss": 1.5797, "mean_token_accuracy": 0.6117729544639587, "num_tokens": 455936.0, "step": 444 }, { "entropy": 1.5603402853012085, "epoch": 0.5611601513240857, "grad_norm": 9.8125, "learning_rate": 8.481834642606287e-06, "loss": 1.4888, "mean_token_accuracy": 0.6284714043140411, "num_tokens": 456990.0, "step": 445 }, { "entropy": 1.586718738079071, "epoch": 0.562421185372005, "grad_norm": 9.875, "learning_rate": 8.441676819280857e-06, "loss": 1.5006, "mean_token_accuracy": 0.6253456175327301, "num_tokens": 458063.0, "step": 446 }, { "entropy": 1.7255162596702576, "epoch": 0.5636822194199244, "grad_norm": 10.375, "learning_rate": 8.401544735312262e-06, "loss": 1.725, "mean_token_accuracy": 0.5891078412532806, "num_tokens": 459120.0, "step": 447 }, { "entropy": 1.624710500240326, "epoch": 0.5649432534678437, "grad_norm": 10.0625, "learning_rate": 8.361439053575861e-06, "loss": 1.5174, "mean_token_accuracy": 0.6173111796379089, "num_tokens": 460155.0, "step": 448 }, { "entropy": 1.6829810738563538, "epoch": 0.5662042875157629, "grad_norm": 9.25, "learning_rate": 8.321360436510916e-06, "loss": 1.5149, "mean_token_accuracy": 0.6153362393379211, "num_tokens": 461286.0, "step": 449 }, { "entropy": 1.550669550895691, "epoch": 0.5674653215636822, "grad_norm": 9.1875, "learning_rate": 8.281309546109649e-06, "loss": 1.4603, "mean_token_accuracy": 0.624053031206131, "num_tokens": 462416.0, "step": 450 }, { "entropy": 1.6433277130126953, "epoch": 0.5687263556116016, "grad_norm": 10.25, "learning_rate": 8.241287043906305e-06, "loss": 1.6117, "mean_token_accuracy": 0.5916386544704437, "num_tokens": 463465.0, "step": 451 }, { "entropy": 1.5914654731750488, "epoch": 0.5699873896595208, "grad_norm": 10.25, "learning_rate": 8.201293590966244e-06, "loss": 1.6014, "mean_token_accuracy": 0.5853811204433441, "num_tokens": 464524.0, "step": 452 }, { "entropy": 1.6217976212501526, "epoch": 0.5712484237074401, "grad_norm": 10.375, "learning_rate": 8.161329847875002e-06, "loss": 1.6488, "mean_token_accuracy": 0.603933721780777, "num_tokens": 465536.0, "step": 453 }, { "entropy": 1.668769657611847, "epoch": 0.5725094577553594, "grad_norm": 9.9375, "learning_rate": 8.12139647472739e-06, "loss": 1.5431, "mean_token_accuracy": 0.6194711029529572, "num_tokens": 466533.0, "step": 454 }, { "entropy": 1.6079354882240295, "epoch": 0.5737704918032787, "grad_norm": 10.1875, "learning_rate": 8.081494131116588e-06, "loss": 1.4601, "mean_token_accuracy": 0.6386167109012604, "num_tokens": 467529.0, "step": 455 }, { "entropy": 1.5854069590568542, "epoch": 0.575031525851198, "grad_norm": 9.125, "learning_rate": 8.041623476123251e-06, "loss": 1.47, "mean_token_accuracy": 0.6398445665836334, "num_tokens": 468630.0, "step": 456 }, { "entropy": 1.5260156989097595, "epoch": 0.5762925598991173, "grad_norm": 9.9375, "learning_rate": 8.001785168304617e-06, "loss": 1.5005, "mean_token_accuracy": 0.6011378169059753, "num_tokens": 469622.0, "step": 457 }, { "entropy": 1.7076481580734253, "epoch": 0.5775535939470365, "grad_norm": 9.6875, "learning_rate": 7.961979865683642e-06, "loss": 1.6202, "mean_token_accuracy": 0.5933865904808044, "num_tokens": 470758.0, "step": 458 }, { "entropy": 1.6706077456474304, "epoch": 0.5788146279949559, "grad_norm": 10.9375, "learning_rate": 7.922208225738118e-06, "loss": 1.8221, "mean_token_accuracy": 0.5651306211948395, "num_tokens": 471795.0, "step": 459 }, { "entropy": 1.5406734943389893, "epoch": 0.5800756620428752, "grad_norm": 9.4375, "learning_rate": 7.882470905389827e-06, "loss": 1.505, "mean_token_accuracy": 0.6003578007221222, "num_tokens": 472887.0, "step": 460 }, { "entropy": 1.6826407313346863, "epoch": 0.5813366960907944, "grad_norm": 10.3125, "learning_rate": 7.84276856099367e-06, "loss": 1.6866, "mean_token_accuracy": 0.6079537272453308, "num_tokens": 473895.0, "step": 461 }, { "entropy": 1.5261881947517395, "epoch": 0.5825977301387137, "grad_norm": 9.625, "learning_rate": 7.803101848326852e-06, "loss": 1.4308, "mean_token_accuracy": 0.6252034902572632, "num_tokens": 474989.0, "step": 462 }, { "entropy": 1.706149160861969, "epoch": 0.5838587641866331, "grad_norm": 9.875, "learning_rate": 7.76347142257803e-06, "loss": 1.6635, "mean_token_accuracy": 0.5897457003593445, "num_tokens": 476079.0, "step": 463 }, { "entropy": 1.6335155367851257, "epoch": 0.5851197982345523, "grad_norm": 9.9375, "learning_rate": 7.72387793833649e-06, "loss": 1.6028, "mean_token_accuracy": 0.6074336171150208, "num_tokens": 477152.0, "step": 464 }, { "entropy": 1.6319258213043213, "epoch": 0.5863808322824716, "grad_norm": 10.0, "learning_rate": 7.684322049581359e-06, "loss": 1.6743, "mean_token_accuracy": 0.6126231551170349, "num_tokens": 478154.0, "step": 465 }, { "entropy": 1.5984978675842285, "epoch": 0.587641866330391, "grad_norm": 10.0, "learning_rate": 7.644804409670769e-06, "loss": 1.5447, "mean_token_accuracy": 0.6286633610725403, "num_tokens": 479188.0, "step": 466 }, { "entropy": 1.6517188549041748, "epoch": 0.5889029003783102, "grad_norm": 9.375, "learning_rate": 7.605325671331099e-06, "loss": 1.6067, "mean_token_accuracy": 0.6035177111625671, "num_tokens": 480331.0, "step": 467 }, { "entropy": 1.5201899409294128, "epoch": 0.5901639344262295, "grad_norm": 9.6875, "learning_rate": 7.565886486646167e-06, "loss": 1.5219, "mean_token_accuracy": 0.6197526156902313, "num_tokens": 481408.0, "step": 468 }, { "entropy": 1.5284817814826965, "epoch": 0.5914249684741488, "grad_norm": 10.3125, "learning_rate": 7.526487507046474e-06, "loss": 1.5018, "mean_token_accuracy": 0.6163230836391449, "num_tokens": 482388.0, "step": 469 }, { "entropy": 1.5280031561851501, "epoch": 0.592686002522068, "grad_norm": 9.625, "learning_rate": 7.487129383298433e-06, "loss": 1.5325, "mean_token_accuracy": 0.6047700941562653, "num_tokens": 483495.0, "step": 470 }, { "entropy": 1.612665593624115, "epoch": 0.5939470365699874, "grad_norm": 9.8125, "learning_rate": 7.447812765493639e-06, "loss": 1.4828, "mean_token_accuracy": 0.6308728158473969, "num_tokens": 484477.0, "step": 471 }, { "entropy": 1.5260791182518005, "epoch": 0.5952080706179067, "grad_norm": 9.125, "learning_rate": 7.408538303038106e-06, "loss": 1.4307, "mean_token_accuracy": 0.6266357898712158, "num_tokens": 485548.0, "step": 472 }, { "entropy": 1.6320922374725342, "epoch": 0.5964691046658259, "grad_norm": 10.125, "learning_rate": 7.369306644641567e-06, "loss": 1.5977, "mean_token_accuracy": 0.6072716414928436, "num_tokens": 486555.0, "step": 473 }, { "entropy": 1.6279585361480713, "epoch": 0.5977301387137453, "grad_norm": 9.75, "learning_rate": 7.330118438306732e-06, "loss": 1.6607, "mean_token_accuracy": 0.6020709276199341, "num_tokens": 487590.0, "step": 474 }, { "entropy": 1.5980820655822754, "epoch": 0.5989911727616646, "grad_norm": 9.6875, "learning_rate": 7.29097433131861e-06, "loss": 1.4855, "mean_token_accuracy": 0.6302129924297333, "num_tokens": 488595.0, "step": 475 }, { "entropy": 1.6216946840286255, "epoch": 0.6002522068095839, "grad_norm": 9.5, "learning_rate": 7.251874970233805e-06, "loss": 1.5476, "mean_token_accuracy": 0.6265118420124054, "num_tokens": 489646.0, "step": 476 }, { "entropy": 1.5502440333366394, "epoch": 0.6015132408575031, "grad_norm": 9.875, "learning_rate": 7.2128210008698255e-06, "loss": 1.493, "mean_token_accuracy": 0.6286751627922058, "num_tokens": 490682.0, "step": 477 }, { "entropy": 1.6056925058364868, "epoch": 0.6027742749054225, "grad_norm": 10.25, "learning_rate": 7.173813068294441e-06, "loss": 1.5198, "mean_token_accuracy": 0.6203805506229401, "num_tokens": 491625.0, "step": 478 }, { "entropy": 1.6156052947044373, "epoch": 0.6040353089533418, "grad_norm": 10.3125, "learning_rate": 7.134851816815014e-06, "loss": 1.5717, "mean_token_accuracy": 0.6026512980461121, "num_tokens": 492642.0, "step": 479 }, { "entropy": 1.5961333513259888, "epoch": 0.605296343001261, "grad_norm": 9.625, "learning_rate": 7.095937889967854e-06, "loss": 1.4724, "mean_token_accuracy": 0.6338109076023102, "num_tokens": 493663.0, "step": 480 }, { "entropy": 1.5767071843147278, "epoch": 0.6065573770491803, "grad_norm": 10.625, "learning_rate": 7.057071930507604e-06, "loss": 1.5848, "mean_token_accuracy": 0.600738912820816, "num_tokens": 494628.0, "step": 481 }, { "entropy": 1.6354678869247437, "epoch": 0.6078184110970997, "grad_norm": 10.4375, "learning_rate": 7.018254580396603e-06, "loss": 1.5456, "mean_token_accuracy": 0.6068757176399231, "num_tokens": 495615.0, "step": 482 }, { "entropy": 1.6405519247055054, "epoch": 0.6090794451450189, "grad_norm": 10.5625, "learning_rate": 6.9794864807942915e-06, "loss": 1.6047, "mean_token_accuracy": 0.6079174876213074, "num_tokens": 496638.0, "step": 483 }, { "entropy": 1.551555097103119, "epoch": 0.6103404791929382, "grad_norm": 9.75, "learning_rate": 6.940768272046633e-06, "loss": 1.5588, "mean_token_accuracy": 0.6117194890975952, "num_tokens": 497707.0, "step": 484 }, { "entropy": 1.4852462410926819, "epoch": 0.6116015132408575, "grad_norm": 9.75, "learning_rate": 6.90210059367552e-06, "loss": 1.432, "mean_token_accuracy": 0.609993040561676, "num_tokens": 498830.0, "step": 485 }, { "entropy": 1.6268917322158813, "epoch": 0.6128625472887768, "grad_norm": 10.25, "learning_rate": 6.863484084368217e-06, "loss": 1.641, "mean_token_accuracy": 0.6106929779052734, "num_tokens": 499805.0, "step": 486 }, { "entropy": 1.5206935405731201, "epoch": 0.6141235813366961, "grad_norm": 9.6875, "learning_rate": 6.8249193819668165e-06, "loss": 1.499, "mean_token_accuracy": 0.631983757019043, "num_tokens": 500760.0, "step": 487 }, { "entropy": 1.6439514756202698, "epoch": 0.6153846153846154, "grad_norm": 10.375, "learning_rate": 6.78640712345769e-06, "loss": 1.6252, "mean_token_accuracy": 0.5874379575252533, "num_tokens": 501784.0, "step": 488 }, { "entropy": 1.6015563607215881, "epoch": 0.6166456494325346, "grad_norm": 10.0625, "learning_rate": 6.7479479449609865e-06, "loss": 1.5631, "mean_token_accuracy": 0.6084559857845306, "num_tokens": 502827.0, "step": 489 }, { "entropy": 1.755643367767334, "epoch": 0.617906683480454, "grad_norm": 10.1875, "learning_rate": 6.7095424817201035e-06, "loss": 1.7159, "mean_token_accuracy": 0.5740377902984619, "num_tokens": 504001.0, "step": 490 }, { "entropy": 1.5435524582862854, "epoch": 0.6191677175283733, "grad_norm": 10.3125, "learning_rate": 6.6711913680912074e-06, "loss": 1.4508, "mean_token_accuracy": 0.6418914198875427, "num_tokens": 504977.0, "step": 491 }, { "entropy": 1.5436031222343445, "epoch": 0.6204287515762925, "grad_norm": 9.25, "learning_rate": 6.632895237532762e-06, "loss": 1.4886, "mean_token_accuracy": 0.6226003170013428, "num_tokens": 506013.0, "step": 492 }, { "entropy": 1.552047848701477, "epoch": 0.6216897856242118, "grad_norm": 9.875, "learning_rate": 6.59465472259505e-06, "loss": 1.5416, "mean_token_accuracy": 0.6107116043567657, "num_tokens": 507052.0, "step": 493 }, { "entropy": 1.6853481531143188, "epoch": 0.6229508196721312, "grad_norm": 10.375, "learning_rate": 6.55647045490973e-06, "loss": 1.7292, "mean_token_accuracy": 0.5904629826545715, "num_tokens": 508055.0, "step": 494 }, { "entropy": 1.569117784500122, "epoch": 0.6242118537200504, "grad_norm": 10.0, "learning_rate": 6.518343065179414e-06, "loss": 1.5271, "mean_token_accuracy": 0.5990890860557556, "num_tokens": 509077.0, "step": 495 }, { "entropy": 1.667130947113037, "epoch": 0.6254728877679697, "grad_norm": 10.1875, "learning_rate": 6.480273183167229e-06, "loss": 1.7343, "mean_token_accuracy": 0.5864747166633606, "num_tokens": 510099.0, "step": 496 }, { "entropy": 1.622936487197876, "epoch": 0.626733921815889, "grad_norm": 10.5, "learning_rate": 6.442261437686437e-06, "loss": 1.592, "mean_token_accuracy": 0.5998493134975433, "num_tokens": 511064.0, "step": 497 }, { "entropy": 1.6585890650749207, "epoch": 0.6279949558638083, "grad_norm": 9.5, "learning_rate": 6.404308456590036e-06, "loss": 1.5832, "mean_token_accuracy": 0.5902130901813507, "num_tokens": 512167.0, "step": 498 }, { "entropy": 1.5793468356132507, "epoch": 0.6292559899117276, "grad_norm": 10.8125, "learning_rate": 6.366414866760391e-06, "loss": 1.5788, "mean_token_accuracy": 0.613257646560669, "num_tokens": 513101.0, "step": 499 }, { "entropy": 1.6209663152694702, "epoch": 0.6305170239596469, "grad_norm": 10.125, "learning_rate": 6.328581294098887e-06, "loss": 1.7012, "mean_token_accuracy": 0.5858111381530762, "num_tokens": 514227.0, "step": 500 }, { "epoch": 0.6305170239596469, "eval_entropy": 1.6149417110111401, "eval_loss": 1.577573299407959, "eval_mean_token_accuracy": 0.6092382099317468, "eval_num_tokens": 514227.0, "eval_runtime": 1.376, "eval_samples_per_second": 512.338, "eval_steps_per_second": 16.715, "step": 500 }, { "entropy": 1.6170178651809692, "epoch": 0.6317780580075663, "grad_norm": 9.3125, "learning_rate": 6.2908083635155796e-06, "loss": 1.5835, "mean_token_accuracy": 0.6066112816333771, "num_tokens": 515290.0, "step": 501 }, { "entropy": 1.6176294684410095, "epoch": 0.6330390920554855, "grad_norm": 9.75, "learning_rate": 6.253096698918873e-06, "loss": 1.5715, "mean_token_accuracy": 0.6069029867649078, "num_tokens": 516354.0, "step": 502 }, { "entropy": 1.543895184993744, "epoch": 0.6343001261034048, "grad_norm": 10.3125, "learning_rate": 6.215446923205233e-06, "loss": 1.5092, "mean_token_accuracy": 0.6218460500240326, "num_tokens": 517310.0, "step": 503 }, { "entropy": 1.602727234363556, "epoch": 0.6355611601513241, "grad_norm": 9.6875, "learning_rate": 6.17785965824888e-06, "loss": 1.483, "mean_token_accuracy": 0.6216234862804413, "num_tokens": 518349.0, "step": 504 }, { "entropy": 1.6165817379951477, "epoch": 0.6368221941992434, "grad_norm": 9.75, "learning_rate": 6.140335524891518e-06, "loss": 1.5962, "mean_token_accuracy": 0.6051628887653351, "num_tokens": 519393.0, "step": 505 }, { "entropy": 1.6006481647491455, "epoch": 0.6380832282471627, "grad_norm": 10.125, "learning_rate": 6.102875142932094e-06, "loss": 1.5795, "mean_token_accuracy": 0.6124628782272339, "num_tokens": 520421.0, "step": 506 }, { "entropy": 1.6821855306625366, "epoch": 0.639344262295082, "grad_norm": 10.5625, "learning_rate": 6.06547913111654e-06, "loss": 1.6944, "mean_token_accuracy": 0.5923645794391632, "num_tokens": 521439.0, "step": 507 }, { "entropy": 1.6875842213630676, "epoch": 0.6406052963430012, "grad_norm": 10.6875, "learning_rate": 6.02814810712758e-06, "loss": 1.7024, "mean_token_accuracy": 0.5728240013122559, "num_tokens": 522360.0, "step": 508 }, { "entropy": 1.6741116046905518, "epoch": 0.6418663303909206, "grad_norm": 10.3125, "learning_rate": 5.9908826875744926e-06, "loss": 1.6793, "mean_token_accuracy": 0.5976190567016602, "num_tokens": 523383.0, "step": 509 }, { "entropy": 1.5459855198860168, "epoch": 0.6431273644388399, "grad_norm": 9.875, "learning_rate": 5.953683487982958e-06, "loss": 1.4656, "mean_token_accuracy": 0.630466103553772, "num_tokens": 524375.0, "step": 510 }, { "entropy": 1.6653950810432434, "epoch": 0.6443883984867591, "grad_norm": 9.8125, "learning_rate": 5.916551122784877e-06, "loss": 1.6078, "mean_token_accuracy": 0.6030786037445068, "num_tokens": 525476.0, "step": 511 }, { "entropy": 1.621675431728363, "epoch": 0.6456494325346784, "grad_norm": 10.25, "learning_rate": 5.879486205308226e-06, "loss": 1.5923, "mean_token_accuracy": 0.6058108806610107, "num_tokens": 526492.0, "step": 512 }, { "entropy": 1.626869261264801, "epoch": 0.6469104665825978, "grad_norm": 10.5, "learning_rate": 5.8424893477669155e-06, "loss": 1.6056, "mean_token_accuracy": 0.6166197955608368, "num_tokens": 527487.0, "step": 513 }, { "entropy": 1.5789138078689575, "epoch": 0.648171500630517, "grad_norm": 9.9375, "learning_rate": 5.805561161250701e-06, "loss": 1.5781, "mean_token_accuracy": 0.6022210121154785, "num_tokens": 528537.0, "step": 514 }, { "entropy": 1.575596272945404, "epoch": 0.6494325346784363, "grad_norm": 10.0, "learning_rate": 5.768702255715053e-06, "loss": 1.5509, "mean_token_accuracy": 0.6026001572608948, "num_tokens": 529593.0, "step": 515 }, { "entropy": 1.5443761348724365, "epoch": 0.6506935687263556, "grad_norm": 9.8125, "learning_rate": 5.7319132399711305e-06, "loss": 1.4789, "mean_token_accuracy": 0.6289182305335999, "num_tokens": 530571.0, "step": 516 }, { "entropy": 1.7085075974464417, "epoch": 0.6519546027742749, "grad_norm": 10.125, "learning_rate": 5.695194721675681e-06, "loss": 1.802, "mean_token_accuracy": 0.5795166194438934, "num_tokens": 531599.0, "step": 517 }, { "entropy": 1.6720210313796997, "epoch": 0.6532156368221942, "grad_norm": 9.6875, "learning_rate": 5.65854730732103e-06, "loss": 1.605, "mean_token_accuracy": 0.6185270547866821, "num_tokens": 532638.0, "step": 518 }, { "entropy": 1.71172297000885, "epoch": 0.6544766708701135, "grad_norm": 10.125, "learning_rate": 5.621971602225043e-06, "loss": 1.6316, "mean_token_accuracy": 0.5973513722419739, "num_tokens": 533704.0, "step": 519 }, { "entropy": 1.6067556738853455, "epoch": 0.6557377049180327, "grad_norm": 9.9375, "learning_rate": 5.58546821052116e-06, "loss": 1.5113, "mean_token_accuracy": 0.6178349554538727, "num_tokens": 534825.0, "step": 520 }, { "entropy": 1.632061243057251, "epoch": 0.6569987389659521, "grad_norm": 9.0625, "learning_rate": 5.549037735148378e-06, "loss": 1.549, "mean_token_accuracy": 0.6097483932971954, "num_tokens": 535971.0, "step": 521 }, { "entropy": 1.5403864979743958, "epoch": 0.6582597730138714, "grad_norm": 9.5625, "learning_rate": 5.512680777841317e-06, "loss": 1.4596, "mean_token_accuracy": 0.6230754852294922, "num_tokens": 537024.0, "step": 522 }, { "entropy": 1.7151065468788147, "epoch": 0.6595208070617906, "grad_norm": 10.75, "learning_rate": 5.476397939120273e-06, "loss": 1.7112, "mean_token_accuracy": 0.5967777669429779, "num_tokens": 537982.0, "step": 523 }, { "entropy": 1.5553420186042786, "epoch": 0.6607818411097099, "grad_norm": 9.625, "learning_rate": 5.4401898182813e-06, "loss": 1.5453, "mean_token_accuracy": 0.6104519665241241, "num_tokens": 539031.0, "step": 524 }, { "entropy": 1.5802620649337769, "epoch": 0.6620428751576293, "grad_norm": 9.8125, "learning_rate": 5.404057013386306e-06, "loss": 1.5294, "mean_token_accuracy": 0.6248644292354584, "num_tokens": 540036.0, "step": 525 }, { "entropy": 1.720866084098816, "epoch": 0.6633039092055486, "grad_norm": 10.1875, "learning_rate": 5.368000121253194e-06, "loss": 1.6522, "mean_token_accuracy": 0.5892738103866577, "num_tokens": 541031.0, "step": 526 }, { "entropy": 1.6795371174812317, "epoch": 0.6645649432534678, "grad_norm": 10.375, "learning_rate": 5.3320197374459805e-06, "loss": 1.5991, "mean_token_accuracy": 0.6063407361507416, "num_tokens": 541991.0, "step": 527 }, { "entropy": 1.6276273131370544, "epoch": 0.6658259773013872, "grad_norm": 9.5, "learning_rate": 5.2961164562649565e-06, "loss": 1.5845, "mean_token_accuracy": 0.596104234457016, "num_tokens": 543076.0, "step": 528 }, { "entropy": 1.5935015678405762, "epoch": 0.6670870113493065, "grad_norm": 10.375, "learning_rate": 5.260290870736906e-06, "loss": 1.5814, "mean_token_accuracy": 0.597423642873764, "num_tokens": 544122.0, "step": 529 }, { "entropy": 1.5235545635223389, "epoch": 0.6683480453972257, "grad_norm": 9.625, "learning_rate": 5.224543572605272e-06, "loss": 1.3863, "mean_token_accuracy": 0.6439205408096313, "num_tokens": 545240.0, "step": 530 }, { "entropy": 1.544245183467865, "epoch": 0.669609079445145, "grad_norm": 10.0625, "learning_rate": 5.188875152320397e-06, "loss": 1.5034, "mean_token_accuracy": 0.6148544549942017, "num_tokens": 546198.0, "step": 531 }, { "entropy": 1.6482225060462952, "epoch": 0.6708701134930644, "grad_norm": 10.1875, "learning_rate": 5.153286199029783e-06, "loss": 1.6033, "mean_token_accuracy": 0.5933025479316711, "num_tokens": 547174.0, "step": 532 }, { "entropy": 1.5747894048690796, "epoch": 0.6721311475409836, "grad_norm": 9.4375, "learning_rate": 5.1177773005683385e-06, "loss": 1.5494, "mean_token_accuracy": 0.6112948060035706, "num_tokens": 548172.0, "step": 533 }, { "entropy": 1.5982520580291748, "epoch": 0.6733921815889029, "grad_norm": 9.625, "learning_rate": 5.082349043448682e-06, "loss": 1.5766, "mean_token_accuracy": 0.6066358089447021, "num_tokens": 549212.0, "step": 534 }, { "entropy": 1.6177298426628113, "epoch": 0.6746532156368222, "grad_norm": 9.6875, "learning_rate": 5.047002012851447e-06, "loss": 1.5554, "mean_token_accuracy": 0.6127637922763824, "num_tokens": 550274.0, "step": 535 }, { "entropy": 1.702902376651764, "epoch": 0.6759142496847415, "grad_norm": 10.6875, "learning_rate": 5.011736792615629e-06, "loss": 1.7977, "mean_token_accuracy": 0.5673922896385193, "num_tokens": 551248.0, "step": 536 }, { "entropy": 1.5914519429206848, "epoch": 0.6771752837326608, "grad_norm": 9.5625, "learning_rate": 4.976553965228924e-06, "loss": 1.4721, "mean_token_accuracy": 0.6292415857315063, "num_tokens": 552278.0, "step": 537 }, { "entropy": 1.5168818235397339, "epoch": 0.6784363177805801, "grad_norm": 10.0625, "learning_rate": 4.941454111818131e-06, "loss": 1.508, "mean_token_accuracy": 0.6399495005607605, "num_tokens": 553237.0, "step": 538 }, { "entropy": 1.6197444200515747, "epoch": 0.6796973518284993, "grad_norm": 10.375, "learning_rate": 4.9064378121395255e-06, "loss": 1.5109, "mean_token_accuracy": 0.605815589427948, "num_tokens": 554185.0, "step": 539 }, { "entropy": 1.6010251641273499, "epoch": 0.6809583858764187, "grad_norm": 10.5, "learning_rate": 4.871505644569303e-06, "loss": 1.6077, "mean_token_accuracy": 0.5981161296367645, "num_tokens": 555143.0, "step": 540 }, { "entropy": 1.637997329235077, "epoch": 0.682219419924338, "grad_norm": 10.0, "learning_rate": 4.8366581860940236e-06, "loss": 1.6099, "mean_token_accuracy": 0.5952269434928894, "num_tokens": 556171.0, "step": 541 }, { "entropy": 1.5722075700759888, "epoch": 0.6834804539722572, "grad_norm": 10.375, "learning_rate": 4.80189601230107e-06, "loss": 1.6759, "mean_token_accuracy": 0.5987652540206909, "num_tokens": 557125.0, "step": 542 }, { "entropy": 1.5625829100608826, "epoch": 0.6847414880201765, "grad_norm": 9.375, "learning_rate": 4.767219697369158e-06, "loss": 1.4107, "mean_token_accuracy": 0.6275063455104828, "num_tokens": 558212.0, "step": 543 }, { "entropy": 1.6600249409675598, "epoch": 0.6860025220680959, "grad_norm": 9.4375, "learning_rate": 4.7326298140588325e-06, "loss": 1.5607, "mean_token_accuracy": 0.6005679666996002, "num_tokens": 559319.0, "step": 544 }, { "entropy": 1.6357145309448242, "epoch": 0.6872635561160151, "grad_norm": 9.25, "learning_rate": 4.698126933703031e-06, "loss": 1.5735, "mean_token_accuracy": 0.6180987358093262, "num_tokens": 560384.0, "step": 545 }, { "entropy": 1.6350824236869812, "epoch": 0.6885245901639344, "grad_norm": 10.9375, "learning_rate": 4.663711626197626e-06, "loss": 1.675, "mean_token_accuracy": 0.5842885673046112, "num_tokens": 561443.0, "step": 546 }, { "entropy": 1.600015938282013, "epoch": 0.6897856242118537, "grad_norm": 10.25, "learning_rate": 4.629384459992016e-06, "loss": 1.6724, "mean_token_accuracy": 0.5942023992538452, "num_tokens": 562452.0, "step": 547 }, { "entropy": 1.6264303922653198, "epoch": 0.691046658259773, "grad_norm": 10.5625, "learning_rate": 4.595146002079746e-06, "loss": 1.6089, "mean_token_accuracy": 0.6137306094169617, "num_tokens": 563401.0, "step": 548 }, { "entropy": 1.7280575037002563, "epoch": 0.6923076923076923, "grad_norm": 10.75, "learning_rate": 4.560996817989131e-06, "loss": 1.7236, "mean_token_accuracy": 0.5739762783050537, "num_tokens": 564402.0, "step": 549 }, { "entropy": 1.723551869392395, "epoch": 0.6935687263556116, "grad_norm": 10.125, "learning_rate": 4.526937471773919e-06, "loss": 1.6549, "mean_token_accuracy": 0.5932482182979584, "num_tokens": 565428.0, "step": 550 }, { "entropy": 1.556459128856659, "epoch": 0.694829760403531, "grad_norm": 9.9375, "learning_rate": 4.4929685260039865e-06, "loss": 1.5655, "mean_token_accuracy": 0.6099835932254791, "num_tokens": 566536.0, "step": 551 }, { "entropy": 1.641317903995514, "epoch": 0.6960907944514502, "grad_norm": 10.625, "learning_rate": 4.459090541756021e-06, "loss": 1.6463, "mean_token_accuracy": 0.594705730676651, "num_tokens": 567640.0, "step": 552 }, { "entropy": 1.597370684146881, "epoch": 0.6973518284993695, "grad_norm": 11.25, "learning_rate": 4.425304078604274e-06, "loss": 1.6491, "mean_token_accuracy": 0.5952914357185364, "num_tokens": 568574.0, "step": 553 }, { "entropy": 1.667187511920929, "epoch": 0.6986128625472888, "grad_norm": 10.0625, "learning_rate": 4.391609694611308e-06, "loss": 1.7062, "mean_token_accuracy": 0.595498651266098, "num_tokens": 569576.0, "step": 554 }, { "entropy": 1.6634328365325928, "epoch": 0.699873896595208, "grad_norm": 11.875, "learning_rate": 4.35800794631879e-06, "loss": 1.7539, "mean_token_accuracy": 0.5765984356403351, "num_tokens": 570584.0, "step": 555 }, { "entropy": 1.5773706436157227, "epoch": 0.7011349306431274, "grad_norm": 10.0625, "learning_rate": 4.324499388738278e-06, "loss": 1.5466, "mean_token_accuracy": 0.6053547561168671, "num_tokens": 571585.0, "step": 556 }, { "entropy": 1.538045346736908, "epoch": 0.7023959646910467, "grad_norm": 10.3125, "learning_rate": 4.291084575342085e-06, "loss": 1.5576, "mean_token_accuracy": 0.6018131077289581, "num_tokens": 572577.0, "step": 557 }, { "entropy": 1.6479364037513733, "epoch": 0.7036569987389659, "grad_norm": 10.625, "learning_rate": 4.257764058054107e-06, "loss": 1.6424, "mean_token_accuracy": 0.5747182071208954, "num_tokens": 573524.0, "step": 558 }, { "entropy": 1.6129924654960632, "epoch": 0.7049180327868853, "grad_norm": 10.125, "learning_rate": 4.2245383872407195e-06, "loss": 1.5762, "mean_token_accuracy": 0.600447416305542, "num_tokens": 574546.0, "step": 559 }, { "entropy": 1.523453950881958, "epoch": 0.7061790668348046, "grad_norm": 9.5625, "learning_rate": 4.191408111701693e-06, "loss": 1.5456, "mean_token_accuracy": 0.6228825449943542, "num_tokens": 575568.0, "step": 560 }, { "entropy": 1.6055732369422913, "epoch": 0.7074401008827238, "grad_norm": 11.3125, "learning_rate": 4.158373778661112e-06, "loss": 1.6417, "mean_token_accuracy": 0.6085829436779022, "num_tokens": 576426.0, "step": 561 }, { "entropy": 1.667851984500885, "epoch": 0.7087011349306431, "grad_norm": 10.0625, "learning_rate": 4.125435933758356e-06, "loss": 1.6283, "mean_token_accuracy": 0.5937761068344116, "num_tokens": 577479.0, "step": 562 }, { "entropy": 1.6255273222923279, "epoch": 0.7099621689785625, "grad_norm": 9.8125, "learning_rate": 4.092595121039066e-06, "loss": 1.594, "mean_token_accuracy": 0.6089232861995697, "num_tokens": 578535.0, "step": 563 }, { "entropy": 1.4689056873321533, "epoch": 0.7112232030264817, "grad_norm": 9.25, "learning_rate": 4.059851882946183e-06, "loss": 1.3934, "mean_token_accuracy": 0.6476598381996155, "num_tokens": 579635.0, "step": 564 }, { "entropy": 1.6343716979026794, "epoch": 0.712484237074401, "grad_norm": 10.125, "learning_rate": 4.0272067603109646e-06, "loss": 1.6306, "mean_token_accuracy": 0.5995541512966156, "num_tokens": 580634.0, "step": 565 }, { "entropy": 1.717770755290985, "epoch": 0.7137452711223203, "grad_norm": 10.3125, "learning_rate": 3.994660292344063e-06, "loss": 1.7253, "mean_token_accuracy": 0.5993589758872986, "num_tokens": 581602.0, "step": 566 }, { "entropy": 1.602467954158783, "epoch": 0.7150063051702396, "grad_norm": 10.0, "learning_rate": 3.9622130166266195e-06, "loss": 1.5721, "mean_token_accuracy": 0.6099851429462433, "num_tokens": 582627.0, "step": 567 }, { "entropy": 1.4821465015411377, "epoch": 0.7162673392181589, "grad_norm": 10.3125, "learning_rate": 3.929865469101382e-06, "loss": 1.4655, "mean_token_accuracy": 0.6258285343647003, "num_tokens": 583627.0, "step": 568 }, { "entropy": 1.6704352498054504, "epoch": 0.7175283732660782, "grad_norm": 9.8125, "learning_rate": 3.897618184063849e-06, "loss": 1.6314, "mean_token_accuracy": 0.6009359657764435, "num_tokens": 584698.0, "step": 569 }, { "entropy": 1.6103723645210266, "epoch": 0.7187894073139974, "grad_norm": 9.5625, "learning_rate": 3.865471694153465e-06, "loss": 1.5382, "mean_token_accuracy": 0.6234713792800903, "num_tokens": 585851.0, "step": 570 }, { "entropy": 1.5848249197006226, "epoch": 0.7200504413619168, "grad_norm": 9.6875, "learning_rate": 3.833426530344791e-06, "loss": 1.4874, "mean_token_accuracy": 0.6228490173816681, "num_tokens": 586896.0, "step": 571 }, { "entropy": 1.6644932627677917, "epoch": 0.7213114754098361, "grad_norm": 9.75, "learning_rate": 3.8014832219387543e-06, "loss": 1.6651, "mean_token_accuracy": 0.5959296822547913, "num_tokens": 587996.0, "step": 572 }, { "entropy": 1.6258652210235596, "epoch": 0.7225725094577553, "grad_norm": 10.5625, "learning_rate": 3.7696422965539036e-06, "loss": 1.5553, "mean_token_accuracy": 0.6083872020244598, "num_tokens": 589005.0, "step": 573 }, { "entropy": 1.6314430236816406, "epoch": 0.7238335435056746, "grad_norm": 9.5, "learning_rate": 3.7379042801176924e-06, "loss": 1.5588, "mean_token_accuracy": 0.6224546134471893, "num_tokens": 590044.0, "step": 574 }, { "entropy": 1.6420432925224304, "epoch": 0.725094577553594, "grad_norm": 10.0625, "learning_rate": 3.706269696857785e-06, "loss": 1.505, "mean_token_accuracy": 0.6281996965408325, "num_tokens": 590975.0, "step": 575 }, { "entropy": 1.6172633171081543, "epoch": 0.7263556116015133, "grad_norm": 10.5, "learning_rate": 3.6747390692934206e-06, "loss": 1.7499, "mean_token_accuracy": 0.5967600345611572, "num_tokens": 591984.0, "step": 576 }, { "entropy": 1.586757779121399, "epoch": 0.7276166456494325, "grad_norm": 9.6875, "learning_rate": 3.643312918226749e-06, "loss": 1.5316, "mean_token_accuracy": 0.6224758625030518, "num_tokens": 593046.0, "step": 577 }, { "entropy": 1.7036398649215698, "epoch": 0.7288776796973518, "grad_norm": 9.75, "learning_rate": 3.611991762734257e-06, "loss": 1.7105, "mean_token_accuracy": 0.5792748928070068, "num_tokens": 594171.0, "step": 578 }, { "entropy": 1.5310705304145813, "epoch": 0.7301387137452712, "grad_norm": 10.0, "learning_rate": 3.580776120158178e-06, "loss": 1.4541, "mean_token_accuracy": 0.6382882595062256, "num_tokens": 595235.0, "step": 579 }, { "entropy": 1.6077587008476257, "epoch": 0.7313997477931904, "grad_norm": 9.9375, "learning_rate": 3.5496665060979563e-06, "loss": 1.5431, "mean_token_accuracy": 0.622633695602417, "num_tokens": 596309.0, "step": 580 }, { "entropy": 1.5529122948646545, "epoch": 0.7326607818411097, "grad_norm": 10.5625, "learning_rate": 3.51866343440172e-06, "loss": 1.4659, "mean_token_accuracy": 0.6347672045230865, "num_tokens": 597289.0, "step": 581 }, { "entropy": 1.6188974380493164, "epoch": 0.733921815889029, "grad_norm": 10.5625, "learning_rate": 3.4877674171578126e-06, "loss": 1.7179, "mean_token_accuracy": 0.5924161672592163, "num_tokens": 598266.0, "step": 582 }, { "entropy": 1.7165232300758362, "epoch": 0.7351828499369483, "grad_norm": 10.6875, "learning_rate": 3.456978964686314e-06, "loss": 1.6381, "mean_token_accuracy": 0.6067573130130768, "num_tokens": 599249.0, "step": 583 }, { "entropy": 1.5602036714553833, "epoch": 0.7364438839848676, "grad_norm": 9.9375, "learning_rate": 3.4262985855306195e-06, "loss": 1.5073, "mean_token_accuracy": 0.6204895377159119, "num_tokens": 600288.0, "step": 584 }, { "entropy": 1.601797878742218, "epoch": 0.7377049180327869, "grad_norm": 9.8125, "learning_rate": 3.395726786449044e-06, "loss": 1.5546, "mean_token_accuracy": 0.6125863194465637, "num_tokens": 601315.0, "step": 585 }, { "entropy": 1.6076158285140991, "epoch": 0.7389659520807061, "grad_norm": 9.9375, "learning_rate": 3.3652640724064465e-06, "loss": 1.5737, "mean_token_accuracy": 0.6054862439632416, "num_tokens": 602341.0, "step": 586 }, { "entropy": 1.5928532481193542, "epoch": 0.7402269861286255, "grad_norm": 10.875, "learning_rate": 3.3349109465658914e-06, "loss": 1.6053, "mean_token_accuracy": 0.6129770278930664, "num_tokens": 603318.0, "step": 587 }, { "entropy": 1.6385427713394165, "epoch": 0.7414880201765448, "grad_norm": 10.25, "learning_rate": 3.3046679102803346e-06, "loss": 1.6013, "mean_token_accuracy": 0.5976338088512421, "num_tokens": 604302.0, "step": 588 }, { "entropy": 1.5366343259811401, "epoch": 0.742749054224464, "grad_norm": 9.875, "learning_rate": 3.274535463084354e-06, "loss": 1.4691, "mean_token_accuracy": 0.6205730736255646, "num_tokens": 605327.0, "step": 589 }, { "entropy": 1.787080466747284, "epoch": 0.7440100882723834, "grad_norm": 10.0, "learning_rate": 3.244514102685881e-06, "loss": 1.7795, "mean_token_accuracy": 0.5752379298210144, "num_tokens": 606439.0, "step": 590 }, { "entropy": 1.6053171157836914, "epoch": 0.7452711223203027, "grad_norm": 10.5, "learning_rate": 3.214604324957987e-06, "loss": 1.5571, "mean_token_accuracy": 0.6215971112251282, "num_tokens": 607334.0, "step": 591 }, { "entropy": 1.5891655683517456, "epoch": 0.7465321563682219, "grad_norm": 9.8125, "learning_rate": 3.1848066239307083e-06, "loss": 1.5656, "mean_token_accuracy": 0.6122055351734161, "num_tokens": 608408.0, "step": 592 }, { "entropy": 1.6325897574424744, "epoch": 0.7477931904161412, "grad_norm": 9.375, "learning_rate": 3.155121491782852e-06, "loss": 1.5902, "mean_token_accuracy": 0.598566085100174, "num_tokens": 609555.0, "step": 593 }, { "entropy": 1.5693252086639404, "epoch": 0.7490542244640606, "grad_norm": 9.5625, "learning_rate": 3.125549418833896e-06, "loss": 1.6252, "mean_token_accuracy": 0.5972473621368408, "num_tokens": 610616.0, "step": 594 }, { "entropy": 1.6936177015304565, "epoch": 0.7503152585119798, "grad_norm": 10.0, "learning_rate": 3.0960908935358904e-06, "loss": 1.7018, "mean_token_accuracy": 0.5809133648872375, "num_tokens": 611647.0, "step": 595 }, { "entropy": 1.7418553233146667, "epoch": 0.7515762925598991, "grad_norm": 10.0625, "learning_rate": 3.066746402465364e-06, "loss": 1.7436, "mean_token_accuracy": 0.577365517616272, "num_tokens": 612739.0, "step": 596 }, { "entropy": 1.65116286277771, "epoch": 0.7528373266078184, "grad_norm": 10.75, "learning_rate": 3.0375164303153125e-06, "loss": 1.5821, "mean_token_accuracy": 0.6119444966316223, "num_tokens": 613679.0, "step": 597 }, { "entropy": 1.6618422865867615, "epoch": 0.7540983606557377, "grad_norm": 10.4375, "learning_rate": 3.008401459887179e-06, "loss": 1.6579, "mean_token_accuracy": 0.5936234891414642, "num_tokens": 614649.0, "step": 598 }, { "entropy": 1.6057924628257751, "epoch": 0.755359394703657, "grad_norm": 10.0625, "learning_rate": 2.9794019720828883e-06, "loss": 1.5492, "mean_token_accuracy": 0.5903959274291992, "num_tokens": 615619.0, "step": 599 }, { "entropy": 1.6187320947647095, "epoch": 0.7566204287515763, "grad_norm": 9.6875, "learning_rate": 2.9505184458968925e-06, "loss": 1.5641, "mean_token_accuracy": 0.6148360073566437, "num_tokens": 616718.0, "step": 600 }, { "entropy": 1.6082826852798462, "epoch": 0.7578814627994955, "grad_norm": 10.625, "learning_rate": 2.921751358408276e-06, "loss": 1.4999, "mean_token_accuracy": 0.6301135122776031, "num_tokens": 617718.0, "step": 601 }, { "entropy": 1.5655282139778137, "epoch": 0.7591424968474149, "grad_norm": 9.9375, "learning_rate": 2.893101184772856e-06, "loss": 1.4883, "mean_token_accuracy": 0.6395408809185028, "num_tokens": 618669.0, "step": 602 }, { "entropy": 1.5624969005584717, "epoch": 0.7604035308953342, "grad_norm": 9.6875, "learning_rate": 2.8645683982153492e-06, "loss": 1.4476, "mean_token_accuracy": 0.6267207562923431, "num_tokens": 619694.0, "step": 603 }, { "entropy": 1.6462831497192383, "epoch": 0.7616645649432535, "grad_norm": 9.8125, "learning_rate": 2.8361534700215464e-06, "loss": 1.5804, "mean_token_accuracy": 0.6060568690299988, "num_tokens": 620699.0, "step": 604 }, { "entropy": 1.5634891390800476, "epoch": 0.7629255989911727, "grad_norm": 10.375, "learning_rate": 2.807856869530534e-06, "loss": 1.5232, "mean_token_accuracy": 0.6247049272060394, "num_tokens": 621665.0, "step": 605 }, { "entropy": 1.6597495675086975, "epoch": 0.7641866330390921, "grad_norm": 10.625, "learning_rate": 2.7796790641269377e-06, "loss": 1.6944, "mean_token_accuracy": 0.5736551582813263, "num_tokens": 622654.0, "step": 606 }, { "entropy": 1.602832555770874, "epoch": 0.7654476670870114, "grad_norm": 9.875, "learning_rate": 2.7516205192332013e-06, "loss": 1.5792, "mean_token_accuracy": 0.5968891382217407, "num_tokens": 623707.0, "step": 607 }, { "entropy": 1.5103943347930908, "epoch": 0.7667087011349306, "grad_norm": 9.625, "learning_rate": 2.723681698301911e-06, "loss": 1.4145, "mean_token_accuracy": 0.630720853805542, "num_tokens": 624728.0, "step": 608 }, { "entropy": 1.5753813982009888, "epoch": 0.7679697351828499, "grad_norm": 10.1875, "learning_rate": 2.695863062808124e-06, "loss": 1.5373, "mean_token_accuracy": 0.6009436249732971, "num_tokens": 625750.0, "step": 609 }, { "entropy": 1.5960492491722107, "epoch": 0.7692307692307693, "grad_norm": 10.0625, "learning_rate": 2.6681650722417517e-06, "loss": 1.5936, "mean_token_accuracy": 0.6083240509033203, "num_tokens": 626747.0, "step": 610 }, { "entropy": 1.5975691676139832, "epoch": 0.7704918032786885, "grad_norm": 9.6875, "learning_rate": 2.6405881840999834e-06, "loss": 1.4518, "mean_token_accuracy": 0.633378803730011, "num_tokens": 627761.0, "step": 611 }, { "entropy": 1.719033122062683, "epoch": 0.7717528373266078, "grad_norm": 10.0625, "learning_rate": 2.613132853879704e-06, "loss": 1.6493, "mean_token_accuracy": 0.5885544419288635, "num_tokens": 628875.0, "step": 612 }, { "entropy": 1.6344210505485535, "epoch": 0.7730138713745272, "grad_norm": 10.75, "learning_rate": 2.585799535069988e-06, "loss": 1.6801, "mean_token_accuracy": 0.5876505076885223, "num_tokens": 629822.0, "step": 613 }, { "entropy": 1.5422580242156982, "epoch": 0.7742749054224464, "grad_norm": 9.5, "learning_rate": 2.558588679144617e-06, "loss": 1.4898, "mean_token_accuracy": 0.6156132817268372, "num_tokens": 630850.0, "step": 614 }, { "entropy": 1.6368955969810486, "epoch": 0.7755359394703657, "grad_norm": 10.3125, "learning_rate": 2.5315007355545983e-06, "loss": 1.6551, "mean_token_accuracy": 0.5985925495624542, "num_tokens": 631878.0, "step": 615 }, { "entropy": 1.5841090679168701, "epoch": 0.776796973518285, "grad_norm": 9.5625, "learning_rate": 2.504536151720758e-06, "loss": 1.4795, "mean_token_accuracy": 0.622355729341507, "num_tokens": 632928.0, "step": 616 }, { "entropy": 1.6905888319015503, "epoch": 0.7780580075662042, "grad_norm": 10.0625, "learning_rate": 2.4776953730263542e-06, "loss": 1.6694, "mean_token_accuracy": 0.608178049325943, "num_tokens": 633971.0, "step": 617 }, { "entropy": 1.6145029664039612, "epoch": 0.7793190416141236, "grad_norm": 9.875, "learning_rate": 2.450978842809699e-06, "loss": 1.5608, "mean_token_accuracy": 0.5896761119365692, "num_tokens": 635069.0, "step": 618 }, { "entropy": 1.556121051311493, "epoch": 0.7805800756620429, "grad_norm": 9.8125, "learning_rate": 2.424387002356857e-06, "loss": 1.5435, "mean_token_accuracy": 0.6025985479354858, "num_tokens": 636177.0, "step": 619 }, { "entropy": 1.5894029140472412, "epoch": 0.7818411097099621, "grad_norm": 10.5625, "learning_rate": 2.3979202908943576e-06, "loss": 1.6423, "mean_token_accuracy": 0.5967113673686981, "num_tokens": 637161.0, "step": 620 }, { "entropy": 1.586296796798706, "epoch": 0.7831021437578815, "grad_norm": 9.8125, "learning_rate": 2.371579145581919e-06, "loss": 1.5078, "mean_token_accuracy": 0.6111081540584564, "num_tokens": 638194.0, "step": 621 }, { "entropy": 1.4746480584144592, "epoch": 0.7843631778058008, "grad_norm": 9.5625, "learning_rate": 2.345364001505248e-06, "loss": 1.4639, "mean_token_accuracy": 0.6132495105266571, "num_tokens": 639244.0, "step": 622 }, { "entropy": 1.6640491485595703, "epoch": 0.78562421185372, "grad_norm": 9.5, "learning_rate": 2.3192752916688378e-06, "loss": 1.6222, "mean_token_accuracy": 0.5872381925582886, "num_tokens": 640291.0, "step": 623 }, { "entropy": 1.5269657969474792, "epoch": 0.7868852459016393, "grad_norm": 10.4375, "learning_rate": 2.2933134469888407e-06, "loss": 1.4887, "mean_token_accuracy": 0.644686758518219, "num_tokens": 641223.0, "step": 624 }, { "entropy": 1.6151806712150574, "epoch": 0.7881462799495587, "grad_norm": 9.75, "learning_rate": 2.267478896285913e-06, "loss": 1.5686, "mean_token_accuracy": 0.6034210622310638, "num_tokens": 642263.0, "step": 625 }, { "entropy": 1.5540375709533691, "epoch": 0.7894073139974779, "grad_norm": 11.1875, "learning_rate": 2.241772066278164e-06, "loss": 1.6005, "mean_token_accuracy": 0.5964966714382172, "num_tokens": 643272.0, "step": 626 }, { "entropy": 1.6209745407104492, "epoch": 0.7906683480453972, "grad_norm": 10.0, "learning_rate": 2.2161933815740987e-06, "loss": 1.593, "mean_token_accuracy": 0.5961326956748962, "num_tokens": 644286.0, "step": 627 }, { "entropy": 1.5604700446128845, "epoch": 0.7919293820933165, "grad_norm": 9.8125, "learning_rate": 2.190743264665598e-06, "loss": 1.5801, "mean_token_accuracy": 0.6023949980735779, "num_tokens": 645310.0, "step": 628 }, { "entropy": 1.7493359446525574, "epoch": 0.7931904161412359, "grad_norm": 9.75, "learning_rate": 2.1654221359209425e-06, "loss": 1.7136, "mean_token_accuracy": 0.5818420052528381, "num_tokens": 646442.0, "step": 629 }, { "entropy": 1.6500951647758484, "epoch": 0.7944514501891551, "grad_norm": 10.25, "learning_rate": 2.140230413577882e-06, "loss": 1.587, "mean_token_accuracy": 0.5937412083148956, "num_tokens": 647543.0, "step": 630 }, { "entropy": 1.6595157980918884, "epoch": 0.7957124842370744, "grad_norm": 10.375, "learning_rate": 2.1151685137366994e-06, "loss": 1.6438, "mean_token_accuracy": 0.5985355973243713, "num_tokens": 648520.0, "step": 631 }, { "entropy": 1.6060655117034912, "epoch": 0.7969735182849937, "grad_norm": 10.125, "learning_rate": 2.0902368503533664e-06, "loss": 1.5514, "mean_token_accuracy": 0.5987799763679504, "num_tokens": 649511.0, "step": 632 }, { "entropy": 1.7033616304397583, "epoch": 0.798234552332913, "grad_norm": 9.6875, "learning_rate": 2.0654358352326963e-06, "loss": 1.7166, "mean_token_accuracy": 0.6091784834861755, "num_tokens": 650579.0, "step": 633 }, { "entropy": 1.5791884660720825, "epoch": 0.7994955863808323, "grad_norm": 9.5625, "learning_rate": 2.0407658780215347e-06, "loss": 1.5058, "mean_token_accuracy": 0.6368519365787506, "num_tokens": 651636.0, "step": 634 }, { "entropy": 1.593576431274414, "epoch": 0.8007566204287516, "grad_norm": 9.75, "learning_rate": 2.0162273862019965e-06, "loss": 1.5622, "mean_token_accuracy": 0.6077103018760681, "num_tokens": 652636.0, "step": 635 }, { "entropy": 1.6148492097854614, "epoch": 0.8020176544766708, "grad_norm": 9.9375, "learning_rate": 1.9918207650847486e-06, "loss": 1.6085, "mean_token_accuracy": 0.5990950167179108, "num_tokens": 653653.0, "step": 636 }, { "entropy": 1.620208740234375, "epoch": 0.8032786885245902, "grad_norm": 9.1875, "learning_rate": 1.9675464178022985e-06, "loss": 1.4553, "mean_token_accuracy": 0.617027074098587, "num_tokens": 654744.0, "step": 637 }, { "entropy": 1.672316312789917, "epoch": 0.8045397225725095, "grad_norm": 9.5625, "learning_rate": 1.9434047453023307e-06, "loss": 1.6387, "mean_token_accuracy": 0.6043696105480194, "num_tokens": 655741.0, "step": 638 }, { "entropy": 1.6659508347511292, "epoch": 0.8058007566204287, "grad_norm": 10.25, "learning_rate": 1.919396146341115e-06, "loss": 1.6174, "mean_token_accuracy": 0.5979881286621094, "num_tokens": 656728.0, "step": 639 }, { "entropy": 1.6201184391975403, "epoch": 0.807061790668348, "grad_norm": 10.0625, "learning_rate": 1.8955210174768857e-06, "loss": 1.5999, "mean_token_accuracy": 0.598040908575058, "num_tokens": 657702.0, "step": 640 }, { "entropy": 1.657130479812622, "epoch": 0.8083228247162674, "grad_norm": 9.625, "learning_rate": 1.8717797530633108e-06, "loss": 1.6281, "mean_token_accuracy": 0.6085665225982666, "num_tokens": 658738.0, "step": 641 }, { "entropy": 1.6190232634544373, "epoch": 0.8095838587641866, "grad_norm": 10.125, "learning_rate": 1.848172745242972e-06, "loss": 1.594, "mean_token_accuracy": 0.6045461893081665, "num_tokens": 659803.0, "step": 642 }, { "entropy": 1.5300160646438599, "epoch": 0.8108448928121059, "grad_norm": 9.8125, "learning_rate": 1.824700383940895e-06, "loss": 1.5786, "mean_token_accuracy": 0.6075372099876404, "num_tokens": 660758.0, "step": 643 }, { "entropy": 1.5939279794692993, "epoch": 0.8121059268600253, "grad_norm": 9.75, "learning_rate": 1.8013630568580887e-06, "loss": 1.5022, "mean_token_accuracy": 0.6274777054786682, "num_tokens": 661868.0, "step": 644 }, { "entropy": 1.6016013622283936, "epoch": 0.8133669609079445, "grad_norm": 9.4375, "learning_rate": 1.7781611494651729e-06, "loss": 1.5496, "mean_token_accuracy": 0.6174932420253754, "num_tokens": 662910.0, "step": 645 }, { "entropy": 1.6788129210472107, "epoch": 0.8146279949558638, "grad_norm": 10.25, "learning_rate": 1.7550950449959813e-06, "loss": 1.6982, "mean_token_accuracy": 0.5900902450084686, "num_tokens": 663881.0, "step": 646 }, { "entropy": 1.5919433236122131, "epoch": 0.8158890290037831, "grad_norm": 10.0, "learning_rate": 1.7321651244412508e-06, "loss": 1.6296, "mean_token_accuracy": 0.5992754995822906, "num_tokens": 664895.0, "step": 647 }, { "entropy": 1.6670875549316406, "epoch": 0.8171500630517023, "grad_norm": 10.125, "learning_rate": 1.709371766542317e-06, "loss": 1.6395, "mean_token_accuracy": 0.6070599853992462, "num_tokens": 665887.0, "step": 648 }, { "entropy": 1.6015033721923828, "epoch": 0.8184110970996217, "grad_norm": 10.0625, "learning_rate": 1.6867153477848709e-06, "loss": 1.5273, "mean_token_accuracy": 0.6009906530380249, "num_tokens": 666858.0, "step": 649 }, { "entropy": 1.597748577594757, "epoch": 0.819672131147541, "grad_norm": 10.125, "learning_rate": 1.6641962423927294e-06, "loss": 1.619, "mean_token_accuracy": 0.6162165701389313, "num_tokens": 667940.0, "step": 650 }, { "entropy": 1.5628655552864075, "epoch": 0.8209331651954602, "grad_norm": 10.3125, "learning_rate": 1.641814822321648e-06, "loss": 1.5317, "mean_token_accuracy": 0.6260219216346741, "num_tokens": 668830.0, "step": 651 }, { "entropy": 1.5993925333023071, "epoch": 0.8221941992433796, "grad_norm": 10.5625, "learning_rate": 1.619571457253203e-06, "loss": 1.5661, "mean_token_accuracy": 0.6064877212047577, "num_tokens": 669770.0, "step": 652 }, { "entropy": 1.6037020087242126, "epoch": 0.8234552332912989, "grad_norm": 9.5625, "learning_rate": 1.5974665145886591e-06, "loss": 1.5811, "mean_token_accuracy": 0.6146577894687653, "num_tokens": 670788.0, "step": 653 }, { "entropy": 1.6218588948249817, "epoch": 0.8247162673392182, "grad_norm": 10.5, "learning_rate": 1.5755003594429107e-06, "loss": 1.6137, "mean_token_accuracy": 0.591108113527298, "num_tokens": 671862.0, "step": 654 }, { "entropy": 1.5854175686836243, "epoch": 0.8259773013871374, "grad_norm": 9.4375, "learning_rate": 1.5536733546384574e-06, "loss": 1.5135, "mean_token_accuracy": 0.6228609085083008, "num_tokens": 672976.0, "step": 655 }, { "entropy": 1.6092653274536133, "epoch": 0.8272383354350568, "grad_norm": 10.0625, "learning_rate": 1.5319858606994032e-06, "loss": 1.5519, "mean_token_accuracy": 0.616204172372818, "num_tokens": 674015.0, "step": 656 }, { "entropy": 1.657637894153595, "epoch": 0.8284993694829761, "grad_norm": 10.1875, "learning_rate": 1.5104382358454927e-06, "loss": 1.6663, "mean_token_accuracy": 0.5839800238609314, "num_tokens": 674966.0, "step": 657 }, { "entropy": 1.6724979281425476, "epoch": 0.8297604035308953, "grad_norm": 10.375, "learning_rate": 1.4890308359862204e-06, "loss": 1.6844, "mean_token_accuracy": 0.5795196890830994, "num_tokens": 675964.0, "step": 658 }, { "entropy": 1.6867769360542297, "epoch": 0.8310214375788146, "grad_norm": 10.0, "learning_rate": 1.4677640147149298e-06, "loss": 1.7271, "mean_token_accuracy": 0.5976731777191162, "num_tokens": 677050.0, "step": 659 }, { "entropy": 1.5519938468933105, "epoch": 0.832282471626734, "grad_norm": 10.125, "learning_rate": 1.4466381233029781e-06, "loss": 1.5131, "mean_token_accuracy": 0.6237548589706421, "num_tokens": 678111.0, "step": 660 }, { "entropy": 1.62520033121109, "epoch": 0.8335435056746532, "grad_norm": 10.5625, "learning_rate": 1.425653510693935e-06, "loss": 1.7469, "mean_token_accuracy": 0.5777223408222198, "num_tokens": 679063.0, "step": 661 }, { "entropy": 1.7489730715751648, "epoch": 0.8348045397225725, "grad_norm": 10.0625, "learning_rate": 1.4048105234978316e-06, "loss": 1.7518, "mean_token_accuracy": 0.5856288075447083, "num_tokens": 680136.0, "step": 662 }, { "entropy": 1.608448565006256, "epoch": 0.8360655737704918, "grad_norm": 10.0, "learning_rate": 1.3841095059854037e-06, "loss": 1.6429, "mean_token_accuracy": 0.6058609485626221, "num_tokens": 681199.0, "step": 663 }, { "entropy": 1.5358132719993591, "epoch": 0.8373266078184111, "grad_norm": 9.9375, "learning_rate": 1.3635508000824438e-06, "loss": 1.483, "mean_token_accuracy": 0.6294578015804291, "num_tokens": 682232.0, "step": 664 }, { "entropy": 1.4801697134971619, "epoch": 0.8385876418663304, "grad_norm": 11.6875, "learning_rate": 1.3431347453641253e-06, "loss": 1.5377, "mean_token_accuracy": 0.62205970287323, "num_tokens": 683134.0, "step": 665 }, { "entropy": 1.5673559308052063, "epoch": 0.8398486759142497, "grad_norm": 10.375, "learning_rate": 1.3228616790494041e-06, "loss": 1.555, "mean_token_accuracy": 0.6151553690433502, "num_tokens": 684190.0, "step": 666 }, { "entropy": 1.5774081945419312, "epoch": 0.8411097099621689, "grad_norm": 9.625, "learning_rate": 1.302731935995447e-06, "loss": 1.5455, "mean_token_accuracy": 0.61209437251091, "num_tokens": 685309.0, "step": 667 }, { "entropy": 1.714252233505249, "epoch": 0.8423707440100883, "grad_norm": 9.6875, "learning_rate": 1.2827458486921084e-06, "loss": 1.7232, "mean_token_accuracy": 0.5814785361289978, "num_tokens": 686464.0, "step": 668 }, { "entropy": 1.6024048328399658, "epoch": 0.8436317780580076, "grad_norm": 9.4375, "learning_rate": 1.2629037472564265e-06, "loss": 1.5261, "mean_token_accuracy": 0.6055002510547638, "num_tokens": 687562.0, "step": 669 }, { "entropy": 1.622502863407135, "epoch": 0.8448928121059268, "grad_norm": 9.4375, "learning_rate": 1.2432059594271684e-06, "loss": 1.5345, "mean_token_accuracy": 0.6223553121089935, "num_tokens": 688631.0, "step": 670 }, { "entropy": 1.6606404185295105, "epoch": 0.8461538461538461, "grad_norm": 9.625, "learning_rate": 1.223652810559437e-06, "loss": 1.6076, "mean_token_accuracy": 0.5935347676277161, "num_tokens": 689693.0, "step": 671 }, { "entropy": 1.5708253383636475, "epoch": 0.8474148802017655, "grad_norm": 10.25, "learning_rate": 1.2042446236192773e-06, "loss": 1.5318, "mean_token_accuracy": 0.6181544959545135, "num_tokens": 690752.0, "step": 672 }, { "entropy": 1.630136489868164, "epoch": 0.8486759142496847, "grad_norm": 10.5625, "learning_rate": 1.1849817191783487e-06, "loss": 1.7418, "mean_token_accuracy": 0.5877110660076141, "num_tokens": 691761.0, "step": 673 }, { "entropy": 1.688385009765625, "epoch": 0.849936948297604, "grad_norm": 10.5, "learning_rate": 1.165864415408632e-06, "loss": 1.5957, "mean_token_accuracy": 0.5905094742774963, "num_tokens": 692772.0, "step": 674 }, { "entropy": 1.5632014274597168, "epoch": 0.8511979823455234, "grad_norm": 10.1875, "learning_rate": 1.1468930280771728e-06, "loss": 1.5715, "mean_token_accuracy": 0.6058877408504486, "num_tokens": 693739.0, "step": 675 }, { "entropy": 1.6090402007102966, "epoch": 0.8524590163934426, "grad_norm": 10.5625, "learning_rate": 1.1280678705408555e-06, "loss": 1.6009, "mean_token_accuracy": 0.5987589657306671, "num_tokens": 694808.0, "step": 676 }, { "entropy": 1.6218902468681335, "epoch": 0.8537200504413619, "grad_norm": 11.25, "learning_rate": 1.109389253741252e-06, "loss": 1.5666, "mean_token_accuracy": 0.6107601821422577, "num_tokens": 695765.0, "step": 677 }, { "entropy": 1.616283357143402, "epoch": 0.8549810844892812, "grad_norm": 10.125, "learning_rate": 1.0908574861994593e-06, "loss": 1.4888, "mean_token_accuracy": 0.6360717117786407, "num_tokens": 696838.0, "step": 678 }, { "entropy": 1.6077577471733093, "epoch": 0.8562421185372006, "grad_norm": 10.1875, "learning_rate": 1.072472874011018e-06, "loss": 1.5456, "mean_token_accuracy": 0.600656270980835, "num_tokens": 697843.0, "step": 679 }, { "entropy": 1.6344243884086609, "epoch": 0.8575031525851198, "grad_norm": 10.75, "learning_rate": 1.0542357208408572e-06, "loss": 1.6269, "mean_token_accuracy": 0.6122370064258575, "num_tokens": 698850.0, "step": 680 }, { "entropy": 1.5988330841064453, "epoch": 0.8587641866330391, "grad_norm": 10.5, "learning_rate": 1.0361463279182705e-06, "loss": 1.4991, "mean_token_accuracy": 0.6044856309890747, "num_tokens": 699813.0, "step": 681 }, { "entropy": 1.646595060825348, "epoch": 0.8600252206809584, "grad_norm": 10.4375, "learning_rate": 1.018204994031946e-06, "loss": 1.6663, "mean_token_accuracy": 0.5816754698753357, "num_tokens": 700860.0, "step": 682 }, { "entropy": 1.6502401232719421, "epoch": 0.8612862547288777, "grad_norm": 9.875, "learning_rate": 1.000412015525032e-06, "loss": 1.5711, "mean_token_accuracy": 0.6014617681503296, "num_tokens": 701882.0, "step": 683 }, { "entropy": 1.5778306722640991, "epoch": 0.862547288776797, "grad_norm": 10.125, "learning_rate": 9.82767686290237e-07, "loss": 1.5073, "mean_token_accuracy": 0.6309453547000885, "num_tokens": 702970.0, "step": 684 }, { "entropy": 1.5491229891777039, "epoch": 0.8638083228247163, "grad_norm": 10.5, "learning_rate": 9.652722977649797e-07, "loss": 1.479, "mean_token_accuracy": 0.6380586922168732, "num_tokens": 703997.0, "step": 685 }, { "entropy": 1.6863412261009216, "epoch": 0.8650693568726355, "grad_norm": 10.3125, "learning_rate": 9.479261389265759e-07, "loss": 1.6822, "mean_token_accuracy": 0.5966202020645142, "num_tokens": 704998.0, "step": 686 }, { "entropy": 1.5364180207252502, "epoch": 0.8663303909205549, "grad_norm": 10.3125, "learning_rate": 9.307294962874647e-07, "loss": 1.3953, "mean_token_accuracy": 0.627411425113678, "num_tokens": 705912.0, "step": 687 }, { "entropy": 1.6023075580596924, "epoch": 0.8675914249684742, "grad_norm": 10.0625, "learning_rate": 9.136826538904698e-07, "loss": 1.5884, "mean_token_accuracy": 0.6016032099723816, "num_tokens": 706959.0, "step": 688 }, { "entropy": 1.6296188831329346, "epoch": 0.8688524590163934, "grad_norm": 10.0, "learning_rate": 8.967858933041185e-07, "loss": 1.5787, "mean_token_accuracy": 0.6014998257160187, "num_tokens": 708045.0, "step": 689 }, { "entropy": 1.6676581501960754, "epoch": 0.8701134930643127, "grad_norm": 10.25, "learning_rate": 8.800394936179812e-07, "loss": 1.7404, "mean_token_accuracy": 0.5869565010070801, "num_tokens": 709109.0, "step": 690 }, { "entropy": 1.6113680005073547, "epoch": 0.8713745271122321, "grad_norm": 9.5, "learning_rate": 8.634437314380694e-07, "loss": 1.5512, "mean_token_accuracy": 0.6073167324066162, "num_tokens": 710171.0, "step": 691 }, { "entropy": 1.5472896099090576, "epoch": 0.8726355611601513, "grad_norm": 10.0625, "learning_rate": 8.469988808822593e-07, "loss": 1.461, "mean_token_accuracy": 0.6256625950336456, "num_tokens": 711165.0, "step": 692 }, { "entropy": 1.6653525829315186, "epoch": 0.8738965952080706, "grad_norm": 10.0625, "learning_rate": 8.307052135757754e-07, "loss": 1.6289, "mean_token_accuracy": 0.6001039147377014, "num_tokens": 712235.0, "step": 693 }, { "entropy": 1.6848056316375732, "epoch": 0.8751576292559899, "grad_norm": 10.9375, "learning_rate": 8.145629986466885e-07, "loss": 1.796, "mean_token_accuracy": 0.5717266201972961, "num_tokens": 713224.0, "step": 694 }, { "entropy": 1.5576205849647522, "epoch": 0.8764186633039092, "grad_norm": 10.125, "learning_rate": 7.985725027214841e-07, "loss": 1.5828, "mean_token_accuracy": 0.6143843829631805, "num_tokens": 714212.0, "step": 695 }, { "entropy": 1.5735121965408325, "epoch": 0.8776796973518285, "grad_norm": 9.5, "learning_rate": 7.827339899206498e-07, "loss": 1.5306, "mean_token_accuracy": 0.6237430572509766, "num_tokens": 715266.0, "step": 696 }, { "entropy": 1.5997198820114136, "epoch": 0.8789407313997478, "grad_norm": 9.375, "learning_rate": 7.670477218543194e-07, "loss": 1.4566, "mean_token_accuracy": 0.6122881770133972, "num_tokens": 716285.0, "step": 697 }, { "entropy": 1.5749364495277405, "epoch": 0.880201765447667, "grad_norm": 10.0625, "learning_rate": 7.515139576179431e-07, "loss": 1.5525, "mean_token_accuracy": 0.6019967794418335, "num_tokens": 717288.0, "step": 698 }, { "entropy": 1.6196271181106567, "epoch": 0.8814627994955864, "grad_norm": 10.0625, "learning_rate": 7.361329537880202e-07, "loss": 1.6218, "mean_token_accuracy": 0.6131271123886108, "num_tokens": 718315.0, "step": 699 }, { "entropy": 1.7117086052894592, "epoch": 0.8827238335435057, "grad_norm": 9.625, "learning_rate": 7.209049644178489e-07, "loss": 1.6847, "mean_token_accuracy": 0.5908259451389313, "num_tokens": 719390.0, "step": 700 }, { "entropy": 1.6483564972877502, "epoch": 0.8839848675914249, "grad_norm": 9.8125, "learning_rate": 7.058302410333373e-07, "loss": 1.6003, "mean_token_accuracy": 0.6116471886634827, "num_tokens": 720424.0, "step": 701 }, { "entropy": 1.7130059599876404, "epoch": 0.8852459016393442, "grad_norm": 10.25, "learning_rate": 6.909090326288447e-07, "loss": 1.6265, "mean_token_accuracy": 0.5986179709434509, "num_tokens": 721445.0, "step": 702 }, { "entropy": 1.6091358065605164, "epoch": 0.8865069356872636, "grad_norm": 9.75, "learning_rate": 6.761415856630749e-07, "loss": 1.5622, "mean_token_accuracy": 0.6100156903266907, "num_tokens": 722510.0, "step": 703 }, { "entropy": 1.5620290637016296, "epoch": 0.8877679697351829, "grad_norm": 9.1875, "learning_rate": 6.615281440549981e-07, "loss": 1.5993, "mean_token_accuracy": 0.592156857252121, "num_tokens": 723628.0, "step": 704 }, { "entropy": 1.5988438129425049, "epoch": 0.8890290037831021, "grad_norm": 9.4375, "learning_rate": 6.470689491798232e-07, "loss": 1.539, "mean_token_accuracy": 0.608138918876648, "num_tokens": 724760.0, "step": 705 }, { "entropy": 1.641887366771698, "epoch": 0.8902900378310215, "grad_norm": 9.9375, "learning_rate": 6.327642398650224e-07, "loss": 1.607, "mean_token_accuracy": 0.6223348081111908, "num_tokens": 725872.0, "step": 706 }, { "entropy": 1.7240522503852844, "epoch": 0.8915510718789408, "grad_norm": 10.125, "learning_rate": 6.18614252386367e-07, "loss": 1.7405, "mean_token_accuracy": 0.5823781192302704, "num_tokens": 726878.0, "step": 707 }, { "entropy": 1.667864739894867, "epoch": 0.89281210592686, "grad_norm": 9.9375, "learning_rate": 6.046192204640389e-07, "loss": 1.6646, "mean_token_accuracy": 0.6081388592720032, "num_tokens": 727992.0, "step": 708 }, { "entropy": 1.6527946591377258, "epoch": 0.8940731399747793, "grad_norm": 10.4375, "learning_rate": 5.907793752587676e-07, "loss": 1.7327, "mean_token_accuracy": 0.580237478017807, "num_tokens": 729029.0, "step": 709 }, { "entropy": 1.5796163082122803, "epoch": 0.8953341740226987, "grad_norm": 9.625, "learning_rate": 5.770949453680064e-07, "loss": 1.5413, "mean_token_accuracy": 0.6177756786346436, "num_tokens": 730086.0, "step": 710 }, { "entropy": 1.6978189945220947, "epoch": 0.8965952080706179, "grad_norm": 10.5, "learning_rate": 5.63566156822164e-07, "loss": 1.6844, "mean_token_accuracy": 0.5957068800926208, "num_tokens": 731078.0, "step": 711 }, { "entropy": 1.6364977955818176, "epoch": 0.8978562421185372, "grad_norm": 9.6875, "learning_rate": 5.50193233080869e-07, "loss": 1.627, "mean_token_accuracy": 0.6093653738498688, "num_tokens": 732087.0, "step": 712 }, { "entropy": 1.6980788111686707, "epoch": 0.8991172761664565, "grad_norm": 9.75, "learning_rate": 5.369763950292739e-07, "loss": 1.6836, "mean_token_accuracy": 0.5986462235450745, "num_tokens": 733214.0, "step": 713 }, { "entropy": 1.6126567125320435, "epoch": 0.9003783102143758, "grad_norm": 9.5625, "learning_rate": 5.239158609744122e-07, "loss": 1.4976, "mean_token_accuracy": 0.6257197856903076, "num_tokens": 734264.0, "step": 714 }, { "entropy": 1.5426988005638123, "epoch": 0.9016393442622951, "grad_norm": 9.9375, "learning_rate": 5.110118466415903e-07, "loss": 1.4991, "mean_token_accuracy": 0.6206920444965363, "num_tokens": 735262.0, "step": 715 }, { "entropy": 1.6925783157348633, "epoch": 0.9029003783102144, "grad_norm": 9.8125, "learning_rate": 4.982645651708273e-07, "loss": 1.6439, "mean_token_accuracy": 0.5905139148235321, "num_tokens": 736286.0, "step": 716 }, { "entropy": 1.6072167754173279, "epoch": 0.9041614123581336, "grad_norm": 9.5, "learning_rate": 4.856742271133275e-07, "loss": 1.4884, "mean_token_accuracy": 0.617807924747467, "num_tokens": 737315.0, "step": 717 }, { "entropy": 1.6528156399726868, "epoch": 0.905422446406053, "grad_norm": 10.3125, "learning_rate": 4.73241040428013e-07, "loss": 1.7388, "mean_token_accuracy": 0.5700719952583313, "num_tokens": 738450.0, "step": 718 }, { "entropy": 1.621579110622406, "epoch": 0.9066834804539723, "grad_norm": 9.8125, "learning_rate": 4.6096521047807706e-07, "loss": 1.5525, "mean_token_accuracy": 0.615268737077713, "num_tokens": 739456.0, "step": 719 }, { "entropy": 1.5768209099769592, "epoch": 0.9079445145018915, "grad_norm": 9.8125, "learning_rate": 4.4884694002760297e-07, "loss": 1.4851, "mean_token_accuracy": 0.6131468713283539, "num_tokens": 740588.0, "step": 720 }, { "entropy": 1.74585622549057, "epoch": 0.9092055485498108, "grad_norm": 10.0, "learning_rate": 4.368864292382058e-07, "loss": 1.7276, "mean_token_accuracy": 0.5804306268692017, "num_tokens": 741706.0, "step": 721 }, { "entropy": 1.6634482741355896, "epoch": 0.9104665825977302, "grad_norm": 10.5, "learning_rate": 4.250838756657327e-07, "loss": 1.6079, "mean_token_accuracy": 0.5807794630527496, "num_tokens": 742647.0, "step": 722 }, { "entropy": 1.719810128211975, "epoch": 0.9117276166456494, "grad_norm": 10.5625, "learning_rate": 4.134394742569958e-07, "loss": 1.7388, "mean_token_accuracy": 0.5862915515899658, "num_tokens": 743740.0, "step": 723 }, { "entropy": 1.6695452332496643, "epoch": 0.9129886506935687, "grad_norm": 9.875, "learning_rate": 4.019534173465567e-07, "loss": 1.5222, "mean_token_accuracy": 0.6237170398235321, "num_tokens": 744805.0, "step": 724 }, { "entropy": 1.6637256741523743, "epoch": 0.914249684741488, "grad_norm": 10.8125, "learning_rate": 3.906258946535446e-07, "loss": 1.5299, "mean_token_accuracy": 0.5966459810733795, "num_tokens": 745889.0, "step": 725 }, { "entropy": 1.6322776079177856, "epoch": 0.9155107187894073, "grad_norm": 9.8125, "learning_rate": 3.7945709327852463e-07, "loss": 1.5525, "mean_token_accuracy": 0.6051934063434601, "num_tokens": 746938.0, "step": 726 }, { "entropy": 1.530247688293457, "epoch": 0.9167717528373266, "grad_norm": 9.6875, "learning_rate": 3.6844719770040894e-07, "loss": 1.4392, "mean_token_accuracy": 0.6275743544101715, "num_tokens": 747965.0, "step": 727 }, { "entropy": 1.705262839794159, "epoch": 0.9180327868852459, "grad_norm": 9.6875, "learning_rate": 3.5759638977340694e-07, "loss": 1.7014, "mean_token_accuracy": 0.5917846262454987, "num_tokens": 749012.0, "step": 728 }, { "entropy": 1.6762296557426453, "epoch": 0.9192938209331651, "grad_norm": 10.0, "learning_rate": 3.469048487240234e-07, "loss": 1.6646, "mean_token_accuracy": 0.5977064967155457, "num_tokens": 750096.0, "step": 729 }, { "entropy": 1.6182932257652283, "epoch": 0.9205548549810845, "grad_norm": 9.25, "learning_rate": 3.363727511480974e-07, "loss": 1.5485, "mean_token_accuracy": 0.6200019121170044, "num_tokens": 751128.0, "step": 730 }, { "entropy": 1.6149555444717407, "epoch": 0.9218158890290038, "grad_norm": 9.625, "learning_rate": 3.26000271007888e-07, "loss": 1.5883, "mean_token_accuracy": 0.6041360795497894, "num_tokens": 752167.0, "step": 731 }, { "entropy": 1.5307012796401978, "epoch": 0.9230769230769231, "grad_norm": 9.5, "learning_rate": 3.157875796291954e-07, "loss": 1.5411, "mean_token_accuracy": 0.617628425359726, "num_tokens": 753250.0, "step": 732 }, { "entropy": 1.5426356196403503, "epoch": 0.9243379571248423, "grad_norm": 9.4375, "learning_rate": 3.057348456985354e-07, "loss": 1.4675, "mean_token_accuracy": 0.6181185245513916, "num_tokens": 754306.0, "step": 733 }, { "entropy": 1.45901757478714, "epoch": 0.9255989911727617, "grad_norm": 10.125, "learning_rate": 2.958422352603507e-07, "loss": 1.4394, "mean_token_accuracy": 0.6353554129600525, "num_tokens": 755274.0, "step": 734 }, { "entropy": 1.5300554633140564, "epoch": 0.926860025220681, "grad_norm": 10.1875, "learning_rate": 2.861099117142718e-07, "loss": 1.5487, "mean_token_accuracy": 0.6036134958267212, "num_tokens": 756306.0, "step": 735 }, { "entropy": 1.5845162868499756, "epoch": 0.9281210592686002, "grad_norm": 9.5625, "learning_rate": 2.765380358124137e-07, "loss": 1.5127, "mean_token_accuracy": 0.6234964728355408, "num_tokens": 757309.0, "step": 736 }, { "entropy": 1.6095054745674133, "epoch": 0.9293820933165196, "grad_norm": 9.625, "learning_rate": 2.6712676565672556e-07, "loss": 1.5488, "mean_token_accuracy": 0.6357644498348236, "num_tokens": 758362.0, "step": 737 }, { "entropy": 1.6068363785743713, "epoch": 0.9306431273644389, "grad_norm": 9.6875, "learning_rate": 2.5787625669637326e-07, "loss": 1.523, "mean_token_accuracy": 0.6318581700325012, "num_tokens": 759368.0, "step": 738 }, { "entropy": 1.5889991521835327, "epoch": 0.9319041614123581, "grad_norm": 9.5, "learning_rate": 2.487866617251766e-07, "loss": 1.5508, "mean_token_accuracy": 0.6171300709247589, "num_tokens": 760356.0, "step": 739 }, { "entropy": 1.7172034978866577, "epoch": 0.9331651954602774, "grad_norm": 10.0625, "learning_rate": 2.398581308790848e-07, "loss": 1.6503, "mean_token_accuracy": 0.5916622281074524, "num_tokens": 761475.0, "step": 740 }, { "entropy": 1.6113387942314148, "epoch": 0.9344262295081968, "grad_norm": 10.5, "learning_rate": 2.3109081163369406e-07, "loss": 1.7583, "mean_token_accuracy": 0.576923668384552, "num_tokens": 762521.0, "step": 741 }, { "entropy": 1.584511160850525, "epoch": 0.935687263556116, "grad_norm": 10.0, "learning_rate": 2.2248484880181386e-07, "loss": 1.4955, "mean_token_accuracy": 0.6316056847572327, "num_tokens": 763461.0, "step": 742 }, { "entropy": 1.6016417741775513, "epoch": 0.9369482976040353, "grad_norm": 10.125, "learning_rate": 2.1404038453107567e-07, "loss": 1.7041, "mean_token_accuracy": 0.5871516168117523, "num_tokens": 764483.0, "step": 743 }, { "entropy": 1.6880784034729004, "epoch": 0.9382093316519546, "grad_norm": 9.625, "learning_rate": 2.057575583015836e-07, "loss": 1.6235, "mean_token_accuracy": 0.5990844666957855, "num_tokens": 765581.0, "step": 744 }, { "entropy": 1.591380536556244, "epoch": 0.9394703656998739, "grad_norm": 10.125, "learning_rate": 1.976365069236108e-07, "loss": 1.5336, "mean_token_accuracy": 0.6195339858531952, "num_tokens": 766548.0, "step": 745 }, { "entropy": 1.5457363724708557, "epoch": 0.9407313997477932, "grad_norm": 10.125, "learning_rate": 1.8967736453534002e-07, "loss": 1.5151, "mean_token_accuracy": 0.6056419909000397, "num_tokens": 767545.0, "step": 746 }, { "entropy": 1.612839162349701, "epoch": 0.9419924337957125, "grad_norm": 10.5, "learning_rate": 1.818802626006466e-07, "loss": 1.5853, "mean_token_accuracy": 0.603949248790741, "num_tokens": 768586.0, "step": 747 }, { "entropy": 1.6123217940330505, "epoch": 0.9432534678436317, "grad_norm": 10.375, "learning_rate": 1.742453299069302e-07, "loss": 1.6436, "mean_token_accuracy": 0.594914048910141, "num_tokens": 769643.0, "step": 748 }, { "entropy": 1.7243667244911194, "epoch": 0.9445145018915511, "grad_norm": 9.875, "learning_rate": 1.6677269256298424e-07, "loss": 1.7381, "mean_token_accuracy": 0.5749774873256683, "num_tokens": 770737.0, "step": 749 }, { "entropy": 1.5863444209098816, "epoch": 0.9457755359394704, "grad_norm": 10.125, "learning_rate": 1.5946247399691638e-07, "loss": 1.506, "mean_token_accuracy": 0.6276157796382904, "num_tokens": 771682.0, "step": 750 }, { "entropy": 1.7262822389602661, "epoch": 0.9470365699873896, "grad_norm": 9.875, "learning_rate": 1.5231479495410595e-07, "loss": 1.647, "mean_token_accuracy": 0.5955233871936798, "num_tokens": 772753.0, "step": 751 }, { "entropy": 1.6021072268486023, "epoch": 0.9482976040353089, "grad_norm": 10.375, "learning_rate": 1.453297734952097e-07, "loss": 1.5959, "mean_token_accuracy": 0.6032880544662476, "num_tokens": 773759.0, "step": 752 }, { "entropy": 1.6947007775306702, "epoch": 0.9495586380832283, "grad_norm": 10.25, "learning_rate": 1.3850752499421917e-07, "loss": 1.7504, "mean_token_accuracy": 0.5882307887077332, "num_tokens": 774762.0, "step": 753 }, { "entropy": 1.670261800289154, "epoch": 0.9508196721311475, "grad_norm": 9.875, "learning_rate": 1.3184816213654304e-07, "loss": 1.6844, "mean_token_accuracy": 0.5984185636043549, "num_tokens": 775875.0, "step": 754 }, { "entropy": 1.5203794240951538, "epoch": 0.9520807061790668, "grad_norm": 9.5, "learning_rate": 1.2535179491715453e-07, "loss": 1.3776, "mean_token_accuracy": 0.6262811720371246, "num_tokens": 776881.0, "step": 755 }, { "entropy": 1.4925638437271118, "epoch": 0.9533417402269861, "grad_norm": 9.5625, "learning_rate": 1.1901853063877366e-07, "loss": 1.4646, "mean_token_accuracy": 0.6303501725196838, "num_tokens": 777917.0, "step": 756 }, { "entropy": 1.6009969115257263, "epoch": 0.9546027742749055, "grad_norm": 9.625, "learning_rate": 1.1284847391009213e-07, "loss": 1.5383, "mean_token_accuracy": 0.6231265664100647, "num_tokens": 778899.0, "step": 757 }, { "entropy": 1.6862744092941284, "epoch": 0.9558638083228247, "grad_norm": 10.3125, "learning_rate": 1.0684172664404691e-07, "loss": 1.7485, "mean_token_accuracy": 0.5865633487701416, "num_tokens": 779887.0, "step": 758 }, { "entropy": 1.58489990234375, "epoch": 0.957124842370744, "grad_norm": 10.5, "learning_rate": 1.0099838805613604e-07, "loss": 1.5386, "mean_token_accuracy": 0.6137128174304962, "num_tokens": 780852.0, "step": 759 }, { "entropy": 1.7339020371437073, "epoch": 0.9583858764186634, "grad_norm": 9.5, "learning_rate": 9.531855466278218e-08, "loss": 1.6334, "mean_token_accuracy": 0.58381187915802, "num_tokens": 782059.0, "step": 760 }, { "entropy": 1.5726083517074585, "epoch": 0.9596469104665826, "grad_norm": 9.375, "learning_rate": 8.980232027973268e-08, "loss": 1.5395, "mean_token_accuracy": 0.6192859411239624, "num_tokens": 783180.0, "step": 761 }, { "entropy": 1.622683346271515, "epoch": 0.9609079445145019, "grad_norm": 10.25, "learning_rate": 8.444977602051985e-08, "loss": 1.6612, "mean_token_accuracy": 0.5969159603118896, "num_tokens": 784134.0, "step": 762 }, { "entropy": 1.6213579177856445, "epoch": 0.9621689785624212, "grad_norm": 10.375, "learning_rate": 7.92610102949476e-08, "loss": 1.6319, "mean_token_accuracy": 0.6108648478984833, "num_tokens": 785135.0, "step": 763 }, { "entropy": 1.5581125020980835, "epoch": 0.9634300126103404, "grad_norm": 10.375, "learning_rate": 7.423610880763265e-08, "loss": 1.4858, "mean_token_accuracy": 0.6188727617263794, "num_tokens": 786079.0, "step": 764 }, { "entropy": 1.6480055451393127, "epoch": 0.9646910466582598, "grad_norm": 9.75, "learning_rate": 6.937515455659128e-08, "loss": 1.6334, "mean_token_accuracy": 0.5843265652656555, "num_tokens": 787144.0, "step": 765 }, { "entropy": 1.6536738276481628, "epoch": 0.9659520807061791, "grad_norm": 12.1875, "learning_rate": 6.467822783186695e-08, "loss": 1.7709, "mean_token_accuracy": 0.5781002342700958, "num_tokens": 788136.0, "step": 766 }, { "entropy": 1.6026808619499207, "epoch": 0.9672131147540983, "grad_norm": 9.25, "learning_rate": 6.014540621420484e-08, "loss": 1.5298, "mean_token_accuracy": 0.6216602921485901, "num_tokens": 789164.0, "step": 767 }, { "entropy": 1.5903871059417725, "epoch": 0.9684741488020177, "grad_norm": 10.6875, "learning_rate": 5.577676457376946e-08, "loss": 1.6205, "mean_token_accuracy": 0.6070701479911804, "num_tokens": 790220.0, "step": 768 }, { "entropy": 1.6330612301826477, "epoch": 0.969735182849937, "grad_norm": 10.3125, "learning_rate": 5.157237506890789e-08, "loss": 1.5942, "mean_token_accuracy": 0.6184689104557037, "num_tokens": 791182.0, "step": 769 }, { "entropy": 1.6491780877113342, "epoch": 0.9709962168978562, "grad_norm": 9.75, "learning_rate": 4.753230714496071e-08, "loss": 1.6282, "mean_token_accuracy": 0.5884484350681305, "num_tokens": 792197.0, "step": 770 }, { "entropy": 1.6831308007240295, "epoch": 0.9722572509457755, "grad_norm": 9.5, "learning_rate": 4.365662753311073e-08, "loss": 1.6791, "mean_token_accuracy": 0.5648599565029144, "num_tokens": 793328.0, "step": 771 }, { "entropy": 1.7370674014091492, "epoch": 0.9735182849936949, "grad_norm": 10.125, "learning_rate": 3.994540024928273e-08, "loss": 1.6976, "mean_token_accuracy": 0.5698262751102448, "num_tokens": 794509.0, "step": 772 }, { "entropy": 1.6178937554359436, "epoch": 0.9747793190416141, "grad_norm": 10.1875, "learning_rate": 3.639868659308765e-08, "loss": 1.5431, "mean_token_accuracy": 0.6045328080654144, "num_tokens": 795558.0, "step": 773 }, { "entropy": 1.5817870497703552, "epoch": 0.9760403530895334, "grad_norm": 9.75, "learning_rate": 3.3016545146806746e-08, "loss": 1.4573, "mean_token_accuracy": 0.6176387667655945, "num_tokens": 796677.0, "step": 774 }, { "entropy": 1.6503630876541138, "epoch": 0.9773013871374527, "grad_norm": 9.5625, "learning_rate": 2.9799031774427888e-08, "loss": 1.5546, "mean_token_accuracy": 0.5988362729549408, "num_tokens": 797760.0, "step": 775 }, { "entropy": 1.5911741256713867, "epoch": 0.978562421185372, "grad_norm": 10.6875, "learning_rate": 2.674619962071967e-08, "loss": 1.6086, "mean_token_accuracy": 0.5956297814846039, "num_tokens": 798827.0, "step": 776 }, { "entropy": 1.6258515119552612, "epoch": 0.9798234552332913, "grad_norm": 9.75, "learning_rate": 2.3858099110353195e-08, "loss": 1.5973, "mean_token_accuracy": 0.6139645576477051, "num_tokens": 799926.0, "step": 777 }, { "entropy": 1.466359257698059, "epoch": 0.9810844892812106, "grad_norm": 9.0625, "learning_rate": 2.113477794707386e-08, "loss": 1.3776, "mean_token_accuracy": 0.6282052099704742, "num_tokens": 800967.0, "step": 778 }, { "entropy": 1.7200924158096313, "epoch": 0.9823455233291298, "grad_norm": 10.0625, "learning_rate": 1.8576281112907547e-08, "loss": 1.6861, "mean_token_accuracy": 0.5817872583866119, "num_tokens": 802064.0, "step": 779 }, { "entropy": 1.6186611652374268, "epoch": 0.9836065573770492, "grad_norm": 9.3125, "learning_rate": 1.6182650867421213e-08, "loss": 1.4432, "mean_token_accuracy": 0.6357538104057312, "num_tokens": 803127.0, "step": 780 }, { "entropy": 1.6093505024909973, "epoch": 0.9848675914249685, "grad_norm": 10.0625, "learning_rate": 1.395392674702567e-08, "loss": 1.558, "mean_token_accuracy": 0.5987730026245117, "num_tokens": 804164.0, "step": 781 }, { "entropy": 1.683523178100586, "epoch": 0.9861286254728878, "grad_norm": 10.6875, "learning_rate": 1.1890145564317224e-08, "loss": 1.6718, "mean_token_accuracy": 0.6047545671463013, "num_tokens": 805104.0, "step": 782 }, { "entropy": 1.5347360968589783, "epoch": 0.987389659520807, "grad_norm": 9.6875, "learning_rate": 9.99134140747704e-09, "loss": 1.4964, "mean_token_accuracy": 0.6017536818981171, "num_tokens": 806192.0, "step": 783 }, { "entropy": 1.6573684811592102, "epoch": 0.9886506935687264, "grad_norm": 10.875, "learning_rate": 8.257545639701603e-09, "loss": 1.6547, "mean_token_accuracy": 0.607554018497467, "num_tokens": 807134.0, "step": 784 }, { "entropy": 1.7061243057250977, "epoch": 0.9899117276166457, "grad_norm": 10.4375, "learning_rate": 6.688786898688682e-09, "loss": 1.7362, "mean_token_accuracy": 0.5759716629981995, "num_tokens": 808137.0, "step": 785 }, { "entropy": 1.6357958316802979, "epoch": 0.9911727616645649, "grad_norm": 10.5625, "learning_rate": 5.285091096163264e-09, "loss": 1.6065, "mean_token_accuracy": 0.6168047785758972, "num_tokens": 809228.0, "step": 786 }, { "entropy": 1.6620115637779236, "epoch": 0.9924337957124842, "grad_norm": 10.9375, "learning_rate": 4.046481417449011e-09, "loss": 1.6609, "mean_token_accuracy": 0.6115907728672028, "num_tokens": 810156.0, "step": 787 }, { "entropy": 1.54367995262146, "epoch": 0.9936948297604036, "grad_norm": 10.0625, "learning_rate": 2.972978321084119e-09, "loss": 1.4789, "mean_token_accuracy": 0.6269399225711823, "num_tokens": 811113.0, "step": 788 }, { "entropy": 1.678809642791748, "epoch": 0.9949558638083228, "grad_norm": 10.375, "learning_rate": 2.0645995384882543e-09, "loss": 1.6143, "mean_token_accuracy": 0.6150172054767609, "num_tokens": 812087.0, "step": 789 }, { "entropy": 1.5846712589263916, "epoch": 0.9962168978562421, "grad_norm": 9.75, "learning_rate": 1.321360073662792e-09, "loss": 1.5745, "mean_token_accuracy": 0.6093320846557617, "num_tokens": 813055.0, "step": 790 }, { "entropy": 1.7048763632774353, "epoch": 0.9974779319041615, "grad_norm": 9.9375, "learning_rate": 7.432722029498962e-10, "loss": 1.6682, "mean_token_accuracy": 0.57883021235466, "num_tokens": 814098.0, "step": 791 }, { "entropy": 1.5479758381843567, "epoch": 0.9987389659520807, "grad_norm": 9.5625, "learning_rate": 3.3034547482269084e-10, "loss": 1.4608, "mean_token_accuracy": 0.6154327094554901, "num_tokens": 815167.0, "step": 792 }, { "entropy": 1.5840736031532288, "epoch": 1.0, "grad_norm": 9.6875, "learning_rate": 8.258670973426697e-11, "loss": 1.6048, "mean_token_accuracy": 0.6037003099918365, "num_tokens": 816243.0, "step": 793 } ], "logging_steps": 1, "max_steps": 793, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 10000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1752790975119360.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }