{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 4.0, "eval_steps": 500, "global_step": 244, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.566802203655243, "epoch": 0.016597510373443983, "grad_norm": 1.3679256439208984, "learning_rate": 0.0, "loss": 2.4676, "mean_token_accuracy": 0.5079668760299683, "num_tokens": 1961.0, "step": 1 }, { "entropy": 1.2824033498764038, "epoch": 0.03319502074688797, "grad_norm": 1.463968276977539, "learning_rate": 1e-05, "loss": 2.1502, "mean_token_accuracy": 0.5586550310254097, "num_tokens": 3454.0, "step": 2 }, { "entropy": 1.3592263162136078, "epoch": 0.04979253112033195, "grad_norm": 2.2606022357940674, "learning_rate": 2e-05, "loss": 2.4176, "mean_token_accuracy": 0.5216769725084305, "num_tokens": 4824.0, "step": 3 }, { "entropy": 1.7233753502368927, "epoch": 0.06639004149377593, "grad_norm": 1.7701078653335571, "learning_rate": 3e-05, "loss": 2.8426, "mean_token_accuracy": 0.48796989023685455, "num_tokens": 6081.0, "step": 4 }, { "entropy": 1.4910274147987366, "epoch": 0.08298755186721991, "grad_norm": 1.786622166633606, "learning_rate": 4e-05, "loss": 2.2084, "mean_token_accuracy": 0.5306425094604492, "num_tokens": 7103.0, "step": 5 }, { "entropy": 1.800081729888916, "epoch": 0.0995850622406639, "grad_norm": 1.775471568107605, "learning_rate": 5e-05, "loss": 2.5362, "mean_token_accuracy": 0.5084067285060883, "num_tokens": 8031.0, "step": 6 }, { "entropy": 2.3219287991523743, "epoch": 0.11618257261410789, "grad_norm": 2.0937862396240234, "learning_rate": 6e-05, "loss": 2.8304, "mean_token_accuracy": 0.448772631585598, "num_tokens": 8843.0, "step": 7 }, { "entropy": 2.229207932949066, "epoch": 0.13278008298755187, "grad_norm": 1.9861464500427246, "learning_rate": 7e-05, "loss": 2.6814, "mean_token_accuracy": 0.47942136973142624, "num_tokens": 9594.0, "step": 8 }, { "entropy": 2.354415476322174, "epoch": 0.14937759336099585, "grad_norm": 1.8094334602355957, "learning_rate": 8e-05, "loss": 2.8711, "mean_token_accuracy": 0.45240335911512375, "num_tokens": 10288.0, "step": 9 }, { "entropy": 2.459421217441559, "epoch": 0.16597510373443983, "grad_norm": 1.8258342742919922, "learning_rate": 9e-05, "loss": 2.9021, "mean_token_accuracy": 0.449099138379097, "num_tokens": 10929.0, "step": 10 }, { "entropy": 2.621789336204529, "epoch": 0.1825726141078838, "grad_norm": 2.7300946712493896, "learning_rate": 0.0001, "loss": 2.547, "mean_token_accuracy": 0.4819970279932022, "num_tokens": 11539.0, "step": 11 }, { "entropy": 2.7384027242660522, "epoch": 0.1991701244813278, "grad_norm": 2.9457969665527344, "learning_rate": 9.999716474831242e-05, "loss": 2.8466, "mean_token_accuracy": 0.4608563259243965, "num_tokens": 12091.0, "step": 12 }, { "entropy": 2.989166796207428, "epoch": 0.2157676348547718, "grad_norm": 2.0658581256866455, "learning_rate": 9.99886593147957e-05, "loss": 2.5596, "mean_token_accuracy": 0.514740876853466, "num_tokens": 12587.0, "step": 13 }, { "entropy": 2.997403562068939, "epoch": 0.23236514522821577, "grad_norm": 3.369170665740967, "learning_rate": 9.997448466405169e-05, "loss": 2.4039, "mean_token_accuracy": 0.5438374727964401, "num_tokens": 13042.0, "step": 14 }, { "entropy": 2.7351107001304626, "epoch": 0.24896265560165975, "grad_norm": 1.9540605545043945, "learning_rate": 9.995464240362846e-05, "loss": 2.0586, "mean_token_accuracy": 0.5540800094604492, "num_tokens": 13445.0, "step": 15 }, { "entropy": 1.8458695709705353, "epoch": 0.26556016597510373, "grad_norm": 0.9754659533500671, "learning_rate": 9.99291347838381e-05, "loss": 1.7562, "mean_token_accuracy": 0.5864828526973724, "num_tokens": 15087.0, "step": 16 }, { "entropy": 2.200885534286499, "epoch": 0.2821576763485477, "grad_norm": 1.13197922706604, "learning_rate": 9.98979646975015e-05, "loss": 2.238, "mean_token_accuracy": 0.5022777020931244, "num_tokens": 16333.0, "step": 17 }, { "entropy": 2.252615600824356, "epoch": 0.2987551867219917, "grad_norm": 1.2078205347061157, "learning_rate": 9.986113567962026e-05, "loss": 2.1967, "mean_token_accuracy": 0.5359554067254066, "num_tokens": 17389.0, "step": 18 }, { "entropy": 2.179795980453491, "epoch": 0.3153526970954357, "grad_norm": 1.3316738605499268, "learning_rate": 9.981865190697577e-05, "loss": 1.8956, "mean_token_accuracy": 0.5649193078279495, "num_tokens": 18350.0, "step": 19 }, { "entropy": 2.2198538780212402, "epoch": 0.33195020746887965, "grad_norm": 1.3263436555862427, "learning_rate": 9.977051819765558e-05, "loss": 2.0364, "mean_token_accuracy": 0.5675807893276215, "num_tokens": 19156.0, "step": 20 }, { "entropy": 2.2128241062164307, "epoch": 0.34854771784232363, "grad_norm": 1.708030343055725, "learning_rate": 9.971674001050686e-05, "loss": 2.1029, "mean_token_accuracy": 0.5378818288445473, "num_tokens": 19911.0, "step": 21 }, { "entropy": 2.033743917942047, "epoch": 0.3651452282157676, "grad_norm": 2.0581839084625244, "learning_rate": 9.96573234445175e-05, "loss": 1.9337, "mean_token_accuracy": 0.5821050256490707, "num_tokens": 20519.0, "step": 22 }, { "entropy": 2.1534159779548645, "epoch": 0.3817427385892116, "grad_norm": 2.190251350402832, "learning_rate": 9.959227523812423e-05, "loss": 2.0707, "mean_token_accuracy": 0.5588077083230019, "num_tokens": 21097.0, "step": 23 }, { "entropy": 2.0276338160037994, "epoch": 0.3983402489626556, "grad_norm": 2.0907859802246094, "learning_rate": 9.952160276844856e-05, "loss": 2.0956, "mean_token_accuracy": 0.5710751935839653, "num_tokens": 21647.0, "step": 24 }, { "entropy": 1.8905757069587708, "epoch": 0.4149377593360996, "grad_norm": 2.121419668197632, "learning_rate": 9.944531405046e-05, "loss": 1.759, "mean_token_accuracy": 0.617972806096077, "num_tokens": 22177.0, "step": 25 }, { "entropy": 2.027945041656494, "epoch": 0.4315352697095436, "grad_norm": 2.8114781379699707, "learning_rate": 9.936341773606723e-05, "loss": 2.0327, "mean_token_accuracy": 0.5869216322898865, "num_tokens": 22687.0, "step": 26 }, { "entropy": 1.8629156649112701, "epoch": 0.44813278008298757, "grad_norm": 2.1601951122283936, "learning_rate": 9.927592311313681e-05, "loss": 1.7504, "mean_token_accuracy": 0.6231366544961929, "num_tokens": 23156.0, "step": 27 }, { "entropy": 1.8361365795135498, "epoch": 0.46473029045643155, "grad_norm": 2.6555299758911133, "learning_rate": 9.918284010443982e-05, "loss": 1.6233, "mean_token_accuracy": 0.6478128284215927, "num_tokens": 23600.0, "step": 28 }, { "entropy": 1.6647760570049286, "epoch": 0.48132780082987553, "grad_norm": 2.550370216369629, "learning_rate": 9.908417926652654e-05, "loss": 1.4416, "mean_token_accuracy": 0.6589087396860123, "num_tokens": 24029.0, "step": 29 }, { "entropy": 1.5259109735488892, "epoch": 0.4979253112033195, "grad_norm": 2.0502336025238037, "learning_rate": 9.897995178852927e-05, "loss": 1.3379, "mean_token_accuracy": 0.6946790963411331, "num_tokens": 24437.0, "step": 30 }, { "entropy": 1.5604857802391052, "epoch": 0.5145228215767634, "grad_norm": 1.2742985486984253, "learning_rate": 9.887016949089333e-05, "loss": 1.7725, "mean_token_accuracy": 0.593292236328125, "num_tokens": 26460.0, "step": 31 }, { "entropy": 1.5407554507255554, "epoch": 0.5311203319502075, "grad_norm": 1.4528374671936035, "learning_rate": 9.875484482403652e-05, "loss": 1.8915, "mean_token_accuracy": 0.5747921615839005, "num_tokens": 27910.0, "step": 32 }, { "entropy": 1.843079686164856, "epoch": 0.5477178423236515, "grad_norm": 1.6220325231552124, "learning_rate": 9.863399086693707e-05, "loss": 2.2955, "mean_token_accuracy": 0.4998007267713547, "num_tokens": 29164.0, "step": 33 }, { "entropy": 1.484895646572113, "epoch": 0.5643153526970954, "grad_norm": 1.3753522634506226, "learning_rate": 9.850762132565043e-05, "loss": 1.6426, "mean_token_accuracy": 0.5886935442686081, "num_tokens": 30278.0, "step": 34 }, { "entropy": 1.604092001914978, "epoch": 0.5809128630705395, "grad_norm": 1.3964170217514038, "learning_rate": 9.837575053175478e-05, "loss": 1.5824, "mean_token_accuracy": 0.6277549713850021, "num_tokens": 31290.0, "step": 35 }, { "entropy": 2.1299741566181183, "epoch": 0.5975103734439834, "grad_norm": 1.5933111906051636, "learning_rate": 9.82383934407258e-05, "loss": 1.8627, "mean_token_accuracy": 0.596154659986496, "num_tokens": 32215.0, "step": 36 }, { "entropy": 2.1440194249153137, "epoch": 0.6141078838174274, "grad_norm": 1.6666224002838135, "learning_rate": 9.809556563024043e-05, "loss": 2.0242, "mean_token_accuracy": 0.5532266497612, "num_tokens": 33041.0, "step": 37 }, { "entropy": 2.121056705713272, "epoch": 0.6307053941908713, "grad_norm": 1.6291508674621582, "learning_rate": 9.794728329841029e-05, "loss": 1.9948, "mean_token_accuracy": 0.5666538178920746, "num_tokens": 33809.0, "step": 38 }, { "entropy": 2.1626654863357544, "epoch": 0.6473029045643154, "grad_norm": 2.0946688652038574, "learning_rate": 9.779356326194466e-05, "loss": 1.9707, "mean_token_accuracy": 0.5822897553443909, "num_tokens": 34512.0, "step": 39 }, { "entropy": 2.2058463096618652, "epoch": 0.6639004149377593, "grad_norm": 1.9641155004501343, "learning_rate": 9.763442295424324e-05, "loss": 2.1697, "mean_token_accuracy": 0.543702982366085, "num_tokens": 35159.0, "step": 40 }, { "entropy": 2.021761655807495, "epoch": 0.6804979253112033, "grad_norm": 1.7235463857650757, "learning_rate": 9.746988042341906e-05, "loss": 1.8144, "mean_token_accuracy": 0.593925267457962, "num_tokens": 35759.0, "step": 41 }, { "entropy": 2.2844014763832092, "epoch": 0.6970954356846473, "grad_norm": 3.0794079303741455, "learning_rate": 9.729995433025168e-05, "loss": 2.2448, "mean_token_accuracy": 0.5087096095085144, "num_tokens": 36332.0, "step": 42 }, { "entropy": 1.8179744482040405, "epoch": 0.7136929460580913, "grad_norm": 1.9659714698791504, "learning_rate": 9.712466394607078e-05, "loss": 1.6948, "mean_token_accuracy": 0.6249574422836304, "num_tokens": 36861.0, "step": 43 }, { "entropy": 2.061110645532608, "epoch": 0.7302904564315352, "grad_norm": 2.4043686389923096, "learning_rate": 9.694402915057066e-05, "loss": 1.8942, "mean_token_accuracy": 0.5952516570687294, "num_tokens": 37339.0, "step": 44 }, { "entropy": 1.827080100774765, "epoch": 0.7468879668049793, "grad_norm": 2.456507682800293, "learning_rate": 9.675807042955569e-05, "loss": 1.6236, "mean_token_accuracy": 0.6085141599178314, "num_tokens": 37756.0, "step": 45 }, { "entropy": 1.4766492545604706, "epoch": 0.7634854771784232, "grad_norm": 1.0035699605941772, "learning_rate": 9.656680887261693e-05, "loss": 1.557, "mean_token_accuracy": 0.617707371711731, "num_tokens": 39461.0, "step": 46 }, { "entropy": 1.7303943932056427, "epoch": 0.7800829875518672, "grad_norm": 1.0027786493301392, "learning_rate": 9.637026617074049e-05, "loss": 1.8817, "mean_token_accuracy": 0.5656901001930237, "num_tokens": 40932.0, "step": 47 }, { "entropy": 1.9746614396572113, "epoch": 0.7966804979253111, "grad_norm": 1.2286392450332642, "learning_rate": 9.616846461384748e-05, "loss": 2.1291, "mean_token_accuracy": 0.5213609486818314, "num_tokens": 42218.0, "step": 48 }, { "entropy": 1.9062314629554749, "epoch": 0.8132780082987552, "grad_norm": 1.0907331705093384, "learning_rate": 9.596142708826604e-05, "loss": 1.9615, "mean_token_accuracy": 0.5589454174041748, "num_tokens": 43380.0, "step": 49 }, { "entropy": 1.9102767407894135, "epoch": 0.8298755186721992, "grad_norm": 1.5399329662322998, "learning_rate": 9.574917707413596e-05, "loss": 1.793, "mean_token_accuracy": 0.598997175693512, "num_tokens": 44400.0, "step": 50 }, { "entropy": 1.7084259390830994, "epoch": 0.8464730290456431, "grad_norm": 1.331813097000122, "learning_rate": 9.553173864274567e-05, "loss": 1.712, "mean_token_accuracy": 0.6038506329059601, "num_tokens": 45335.0, "step": 51 }, { "entropy": 1.8911837935447693, "epoch": 0.8630705394190872, "grad_norm": 2.002470016479492, "learning_rate": 9.530913645380232e-05, "loss": 1.9683, "mean_token_accuracy": 0.5909984111785889, "num_tokens": 46180.0, "step": 52 }, { "entropy": 1.63745978474617, "epoch": 0.8796680497925311, "grad_norm": 1.4724863767623901, "learning_rate": 9.508139575263522e-05, "loss": 1.4999, "mean_token_accuracy": 0.6617157012224197, "num_tokens": 46970.0, "step": 53 }, { "entropy": 1.898155838251114, "epoch": 0.8962655601659751, "grad_norm": 1.8770923614501953, "learning_rate": 9.484854236733264e-05, "loss": 1.6905, "mean_token_accuracy": 0.6523770242929459, "num_tokens": 47725.0, "step": 54 }, { "entropy": 1.92723348736763, "epoch": 0.9128630705394191, "grad_norm": 2.107532262802124, "learning_rate": 9.461060270581275e-05, "loss": 1.9513, "mean_token_accuracy": 0.579139918088913, "num_tokens": 48437.0, "step": 55 }, { "entropy": 1.9208797216415405, "epoch": 0.9294605809128631, "grad_norm": 2.1801645755767822, "learning_rate": 9.436760375282859e-05, "loss": 1.9292, "mean_token_accuracy": 0.5749614462256432, "num_tokens": 49077.0, "step": 56 }, { "entropy": 1.9385250508785248, "epoch": 0.946058091286307, "grad_norm": 1.8006877899169922, "learning_rate": 9.411957306690784e-05, "loss": 1.8412, "mean_token_accuracy": 0.595048114657402, "num_tokens": 49654.0, "step": 57 }, { "entropy": 2.0152436792850494, "epoch": 0.9626556016597511, "grad_norm": 2.4321160316467285, "learning_rate": 9.386653877722733e-05, "loss": 2.2427, "mean_token_accuracy": 0.5564496889710426, "num_tokens": 50150.0, "step": 58 }, { "entropy": 1.6884909868240356, "epoch": 0.979253112033195, "grad_norm": 2.018585443496704, "learning_rate": 9.360852958042295e-05, "loss": 1.6405, "mean_token_accuracy": 0.6549917608499527, "num_tokens": 50606.0, "step": 59 }, { "entropy": 1.976477712392807, "epoch": 0.995850622406639, "grad_norm": 2.2471210956573486, "learning_rate": 9.334557473733511e-05, "loss": 2.0322, "mean_token_accuracy": 0.5780311971902847, "num_tokens": 50948.0, "step": 60 }, { "entropy": 1.2080161571502686, "epoch": 1.0, "grad_norm": 2.225203037261963, "learning_rate": 9.30777040696903e-05, "loss": 1.1001, "mean_token_accuracy": 0.6170212626457214, "num_tokens": 51137.0, "step": 61 }, { "entropy": 1.451114296913147, "epoch": 1.016597510373444, "grad_norm": 0.8033313155174255, "learning_rate": 9.280494795671906e-05, "loss": 1.4178, "mean_token_accuracy": 0.6653263568878174, "num_tokens": 53010.0, "step": 62 }, { "entropy": 1.8700011372566223, "epoch": 1.033195020746888, "grad_norm": 0.8774217963218689, "learning_rate": 9.252733733171056e-05, "loss": 1.7435, "mean_token_accuracy": 0.5836772620677948, "num_tokens": 54426.0, "step": 63 }, { "entropy": 2.0100578665733337, "epoch": 1.049792531120332, "grad_norm": 0.9584742188453674, "learning_rate": 9.22449036785045e-05, "loss": 1.955, "mean_token_accuracy": 0.5431181490421295, "num_tokens": 55685.0, "step": 64 }, { "entropy": 1.649256706237793, "epoch": 1.066390041493776, "grad_norm": 1.0113857984542847, "learning_rate": 9.195767902792053e-05, "loss": 1.4397, "mean_token_accuracy": 0.6426748633384705, "num_tokens": 56742.0, "step": 65 }, { "entropy": 1.596836507320404, "epoch": 1.0829875518672198, "grad_norm": 1.5263484716415405, "learning_rate": 9.166569595412575e-05, "loss": 1.4071, "mean_token_accuracy": 0.6563769578933716, "num_tokens": 57705.0, "step": 66 }, { "entropy": 1.4731523096561432, "epoch": 1.099585062240664, "grad_norm": 1.6699166297912598, "learning_rate": 9.136898757094021e-05, "loss": 1.2226, "mean_token_accuracy": 0.6934443712234497, "num_tokens": 58594.0, "step": 67 }, { "entropy": 1.564688891172409, "epoch": 1.116182572614108, "grad_norm": 1.757997989654541, "learning_rate": 9.106758752808169e-05, "loss": 1.1737, "mean_token_accuracy": 0.7244593054056168, "num_tokens": 59373.0, "step": 68 }, { "entropy": 1.6936156153678894, "epoch": 1.1327800829875518, "grad_norm": 2.0028507709503174, "learning_rate": 9.076153000734938e-05, "loss": 1.5669, "mean_token_accuracy": 0.6568387001752853, "num_tokens": 60094.0, "step": 69 }, { "entropy": 1.8307518661022186, "epoch": 1.1493775933609958, "grad_norm": 1.9967020750045776, "learning_rate": 9.045084971874738e-05, "loss": 1.7996, "mean_token_accuracy": 0.5718972831964493, "num_tokens": 60757.0, "step": 70 }, { "entropy": 1.4585759937763214, "epoch": 1.16597510373444, "grad_norm": 2.1708550453186035, "learning_rate": 9.013558189654819e-05, "loss": 1.3026, "mean_token_accuracy": 0.6736540347337723, "num_tokens": 61352.0, "step": 71 }, { "entropy": 1.6142982840538025, "epoch": 1.1825726141078838, "grad_norm": 2.4141905307769775, "learning_rate": 8.98157622952968e-05, "loss": 1.7232, "mean_token_accuracy": 0.6093451529741287, "num_tokens": 61928.0, "step": 72 }, { "entropy": 1.4834707379341125, "epoch": 1.1991701244813278, "grad_norm": 3.3370718955993652, "learning_rate": 8.94914271857558e-05, "loss": 1.4542, "mean_token_accuracy": 0.6456684172153473, "num_tokens": 62487.0, "step": 73 }, { "entropy": 1.2296392917633057, "epoch": 1.215767634854772, "grad_norm": 3.297661304473877, "learning_rate": 8.916261335079184e-05, "loss": 1.2224, "mean_token_accuracy": 0.7180867195129395, "num_tokens": 62989.0, "step": 74 }, { "entropy": 1.3978646099567413, "epoch": 1.2323651452282158, "grad_norm": 3.230928421020508, "learning_rate": 8.882935808120413e-05, "loss": 1.2525, "mean_token_accuracy": 0.6955430954694748, "num_tokens": 63431.0, "step": 75 }, { "entropy": 1.4348433017730713, "epoch": 1.2489626556016598, "grad_norm": 2.9823155403137207, "learning_rate": 8.849169917149531e-05, "loss": 1.3674, "mean_token_accuracy": 0.6774774789810181, "num_tokens": 63769.0, "step": 76 }, { "entropy": 1.1157634109258652, "epoch": 1.2655601659751037, "grad_norm": 1.2160100936889648, "learning_rate": 8.814967491558513e-05, "loss": 1.2474, "mean_token_accuracy": 0.6769505888223648, "num_tokens": 65514.0, "step": 77 }, { "entropy": 1.1023453027009964, "epoch": 1.2821576763485476, "grad_norm": 1.1360654830932617, "learning_rate": 8.780332410246749e-05, "loss": 1.2555, "mean_token_accuracy": 0.6901346296072006, "num_tokens": 67028.0, "step": 78 }, { "entropy": 1.4519792795181274, "epoch": 1.2987551867219918, "grad_norm": 1.2020699977874756, "learning_rate": 8.745268601181155e-05, "loss": 1.5405, "mean_token_accuracy": 0.6213398575782776, "num_tokens": 68315.0, "step": 79 }, { "entropy": 1.3406359404325485, "epoch": 1.3153526970954357, "grad_norm": 1.3065791130065918, "learning_rate": 8.70978004095068e-05, "loss": 1.2679, "mean_token_accuracy": 0.6887986212968826, "num_tokens": 69366.0, "step": 80 }, { "entropy": 1.3306908905506134, "epoch": 1.3319502074688796, "grad_norm": 1.4615983963012695, "learning_rate": 8.673870754315336e-05, "loss": 1.1372, "mean_token_accuracy": 0.6971320360898972, "num_tokens": 70328.0, "step": 81 }, { "entropy": 1.523217260837555, "epoch": 1.3485477178423237, "grad_norm": 1.8181804418563843, "learning_rate": 8.637544813749746e-05, "loss": 1.3124, "mean_token_accuracy": 0.6847366690635681, "num_tokens": 71161.0, "step": 82 }, { "entropy": 1.5914150774478912, "epoch": 1.3651452282157677, "grad_norm": 1.9594281911849976, "learning_rate": 8.60080633898128e-05, "loss": 1.4735, "mean_token_accuracy": 0.6489894986152649, "num_tokens": 71934.0, "step": 83 }, { "entropy": 1.7109156250953674, "epoch": 1.3817427385892116, "grad_norm": 2.0826797485351562, "learning_rate": 8.563659496522843e-05, "loss": 1.5629, "mean_token_accuracy": 0.61826092004776, "num_tokens": 72659.0, "step": 84 }, { "entropy": 1.6033823788166046, "epoch": 1.3983402489626555, "grad_norm": 2.037574052810669, "learning_rate": 8.526108499200343e-05, "loss": 1.3959, "mean_token_accuracy": 0.6633946299552917, "num_tokens": 73315.0, "step": 85 }, { "entropy": 1.5953782498836517, "epoch": 1.4149377593360997, "grad_norm": 2.0150649547576904, "learning_rate": 8.488157605674925e-05, "loss": 1.3532, "mean_token_accuracy": 0.70735864341259, "num_tokens": 73902.0, "step": 86 }, { "entropy": 1.4288784563541412, "epoch": 1.4315352697095436, "grad_norm": 2.033691883087158, "learning_rate": 8.449811119959981e-05, "loss": 1.1189, "mean_token_accuracy": 0.7260903120040894, "num_tokens": 74448.0, "step": 87 }, { "entropy": 1.7279040217399597, "epoch": 1.4481327800829875, "grad_norm": 2.332186460494995, "learning_rate": 8.411073390933049e-05, "loss": 1.7084, "mean_token_accuracy": 0.5948462039232254, "num_tokens": 74949.0, "step": 88 }, { "entropy": 1.3200257420539856, "epoch": 1.4647302904564317, "grad_norm": 2.3824870586395264, "learning_rate": 8.371948811842589e-05, "loss": 1.019, "mean_token_accuracy": 0.7397761791944504, "num_tokens": 75414.0, "step": 89 }, { "entropy": 1.2348097264766693, "epoch": 1.4813278008298756, "grad_norm": 2.4164183139801025, "learning_rate": 8.33244181980976e-05, "loss": 0.9918, "mean_token_accuracy": 0.7332025468349457, "num_tokens": 75849.0, "step": 90 }, { "entropy": 0.9813397824764252, "epoch": 1.4979253112033195, "grad_norm": 2.268641233444214, "learning_rate": 8.292556895325194e-05, "loss": 0.8268, "mean_token_accuracy": 0.7725253701210022, "num_tokens": 76271.0, "step": 91 }, { "entropy": 1.1244373619556427, "epoch": 1.5145228215767634, "grad_norm": 0.8862183690071106, "learning_rate": 8.252298561740867e-05, "loss": 1.2055, "mean_token_accuracy": 0.6999105960130692, "num_tokens": 78108.0, "step": 92 }, { "entropy": 1.3843848705291748, "epoch": 1.5311203319502074, "grad_norm": 1.3396450281143188, "learning_rate": 8.211671384757114e-05, "loss": 1.4806, "mean_token_accuracy": 0.6275065988302231, "num_tokens": 79501.0, "step": 93 }, { "entropy": 1.534432590007782, "epoch": 1.5477178423236515, "grad_norm": 1.5818778276443481, "learning_rate": 8.170679971904814e-05, "loss": 1.6552, "mean_token_accuracy": 0.6043647080659866, "num_tokens": 80782.0, "step": 94 }, { "entropy": 1.419167011976242, "epoch": 1.5643153526970954, "grad_norm": 1.509782314300537, "learning_rate": 8.129328972022867e-05, "loss": 1.4366, "mean_token_accuracy": 0.6377193629741669, "num_tokens": 81875.0, "step": 95 }, { "entropy": 1.2230817377567291, "epoch": 1.5809128630705396, "grad_norm": 1.9019289016723633, "learning_rate": 8.08762307473096e-05, "loss": 1.1952, "mean_token_accuracy": 0.6841559708118439, "num_tokens": 82833.0, "step": 96 }, { "entropy": 1.5106331408023834, "epoch": 1.5975103734439835, "grad_norm": 2.4379634857177734, "learning_rate": 8.045567009897723e-05, "loss": 1.5762, "mean_token_accuracy": 0.6347994953393936, "num_tokens": 83665.0, "step": 97 }, { "entropy": 1.5159637928009033, "epoch": 1.6141078838174274, "grad_norm": 2.315671920776367, "learning_rate": 8.003165547104305e-05, "loss": 1.4586, "mean_token_accuracy": 0.6473860591650009, "num_tokens": 84400.0, "step": 98 }, { "entropy": 1.4539947211742401, "epoch": 1.6307053941908713, "grad_norm": 3.0009548664093018, "learning_rate": 7.960423495103467e-05, "loss": 1.5424, "mean_token_accuracy": 0.6423875689506531, "num_tokens": 85068.0, "step": 99 }, { "entropy": 1.6873330473899841, "epoch": 1.6473029045643153, "grad_norm": 2.6655983924865723, "learning_rate": 7.917345701274207e-05, "loss": 1.574, "mean_token_accuracy": 0.6550299525260925, "num_tokens": 85695.0, "step": 100 }, { "entropy": 1.4055011570453644, "epoch": 1.6639004149377592, "grad_norm": 3.3150808811187744, "learning_rate": 7.873937051072035e-05, "loss": 1.2071, "mean_token_accuracy": 0.6913554072380066, "num_tokens": 86300.0, "step": 101 }, { "entropy": 1.6945359408855438, "epoch": 1.6804979253112033, "grad_norm": 2.25583553314209, "learning_rate": 7.830202467474899e-05, "loss": 1.493, "mean_token_accuracy": 0.6553004831075668, "num_tokens": 86861.0, "step": 102 }, { "entropy": 1.393843948841095, "epoch": 1.6970954356846473, "grad_norm": 2.9434304237365723, "learning_rate": 7.786146910424876e-05, "loss": 1.2789, "mean_token_accuracy": 0.7113071084022522, "num_tokens": 87388.0, "step": 103 }, { "entropy": 1.3938986957073212, "epoch": 1.7136929460580914, "grad_norm": 2.8079259395599365, "learning_rate": 7.741775376265667e-05, "loss": 1.1396, "mean_token_accuracy": 0.725695475935936, "num_tokens": 87870.0, "step": 104 }, { "entropy": 1.3154444992542267, "epoch": 1.7302904564315353, "grad_norm": 2.5979607105255127, "learning_rate": 7.697092897175957e-05, "loss": 1.1318, "mean_token_accuracy": 0.7149190455675125, "num_tokens": 88313.0, "step": 105 }, { "entropy": 1.2525047361850739, "epoch": 1.7468879668049793, "grad_norm": 2.3928842544555664, "learning_rate": 7.652104540598712e-05, "loss": 0.9614, "mean_token_accuracy": 0.7349429130554199, "num_tokens": 88712.0, "step": 106 }, { "entropy": 1.5751274824142456, "epoch": 1.7634854771784232, "grad_norm": 1.3356112241744995, "learning_rate": 7.606815408666493e-05, "loss": 1.6637, "mean_token_accuracy": 0.6113278269767761, "num_tokens": 90652.0, "step": 107 }, { "entropy": 1.7263123393058777, "epoch": 1.7800829875518671, "grad_norm": 1.220577359199524, "learning_rate": 7.561230637622805e-05, "loss": 1.5781, "mean_token_accuracy": 0.6253386288881302, "num_tokens": 92043.0, "step": 108 }, { "entropy": 1.8092939853668213, "epoch": 1.796680497925311, "grad_norm": 1.2987717390060425, "learning_rate": 7.515355397239613e-05, "loss": 1.6102, "mean_token_accuracy": 0.60220967233181, "num_tokens": 93290.0, "step": 109 }, { "entropy": 1.5732390582561493, "epoch": 1.8132780082987552, "grad_norm": 1.2782738208770752, "learning_rate": 7.469194890231021e-05, "loss": 1.6026, "mean_token_accuracy": 0.6219276785850525, "num_tokens": 94437.0, "step": 110 }, { "entropy": 1.3208205997943878, "epoch": 1.8298755186721993, "grad_norm": 1.508908987045288, "learning_rate": 7.422754351663252e-05, "loss": 1.2197, "mean_token_accuracy": 0.6798736304044724, "num_tokens": 95454.0, "step": 111 }, { "entropy": 1.4695551693439484, "epoch": 1.8464730290456433, "grad_norm": 1.7255935668945312, "learning_rate": 7.376039048360914e-05, "loss": 1.3915, "mean_token_accuracy": 0.6647312641143799, "num_tokens": 96422.0, "step": 112 }, { "entropy": 1.5077824890613556, "epoch": 1.8630705394190872, "grad_norm": 2.4858553409576416, "learning_rate": 7.329054278309708e-05, "loss": 1.5295, "mean_token_accuracy": 0.645410567522049, "num_tokens": 97258.0, "step": 113 }, { "entropy": 1.3513629138469696, "epoch": 1.879668049792531, "grad_norm": 2.4195804595947266, "learning_rate": 7.281805370055581e-05, "loss": 1.3322, "mean_token_accuracy": 0.6713262051343918, "num_tokens": 98053.0, "step": 114 }, { "entropy": 1.1256203055381775, "epoch": 1.896265560165975, "grad_norm": 2.4134695529937744, "learning_rate": 7.234297682100404e-05, "loss": 1.2417, "mean_token_accuracy": 0.7208292186260223, "num_tokens": 98838.0, "step": 115 }, { "entropy": 1.2319197356700897, "epoch": 1.912863070539419, "grad_norm": 2.0551836490631104, "learning_rate": 7.186536602294278e-05, "loss": 1.0502, "mean_token_accuracy": 0.7311187982559204, "num_tokens": 99579.0, "step": 116 }, { "entropy": 1.3636659979820251, "epoch": 1.929460580912863, "grad_norm": 3.1892852783203125, "learning_rate": 7.138527547224485e-05, "loss": 1.3794, "mean_token_accuracy": 0.6597895175218582, "num_tokens": 100219.0, "step": 117 }, { "entropy": 1.3741393387317657, "epoch": 1.946058091286307, "grad_norm": 2.720012664794922, "learning_rate": 7.090275961601203e-05, "loss": 1.4525, "mean_token_accuracy": 0.6761961877346039, "num_tokens": 100773.0, "step": 118 }, { "entropy": 1.2926801443099976, "epoch": 1.9626556016597512, "grad_norm": 2.668562173843384, "learning_rate": 7.041787317640014e-05, "loss": 1.2582, "mean_token_accuracy": 0.7060045301914215, "num_tokens": 101274.0, "step": 119 }, { "entropy": 1.4207338094711304, "epoch": 1.979253112033195, "grad_norm": 2.8614320755004883, "learning_rate": 6.993067114441302e-05, "loss": 1.232, "mean_token_accuracy": 0.6748317778110504, "num_tokens": 101740.0, "step": 120 }, { "entropy": 1.2662785649299622, "epoch": 1.995850622406639, "grad_norm": 2.7323219776153564, "learning_rate": 6.944120877366604e-05, "loss": 0.9631, "mean_token_accuracy": 0.7634817808866501, "num_tokens": 102150.0, "step": 121 }, { "entropy": 1.9474085569381714, "epoch": 2.0, "grad_norm": 6.136712551116943, "learning_rate": 6.894954157411966e-05, "loss": 1.9084, "mean_token_accuracy": 0.5528455376625061, "num_tokens": 102274.0, "step": 122 }, { "entropy": 1.1377949267625809, "epoch": 2.016597510373444, "grad_norm": 0.9612461924552917, "learning_rate": 6.845572530578422e-05, "loss": 1.1333, "mean_token_accuracy": 0.7239202558994293, "num_tokens": 104207.0, "step": 123 }, { "entropy": 1.2367377132177353, "epoch": 2.033195020746888, "grad_norm": 1.1431013345718384, "learning_rate": 6.795981597239599e-05, "loss": 1.0014, "mean_token_accuracy": 0.7419553995132446, "num_tokens": 105672.0, "step": 124 }, { "entropy": 1.449882984161377, "epoch": 2.0497925311203318, "grad_norm": 1.6375846862792969, "learning_rate": 6.7461869815066e-05, "loss": 1.1995, "mean_token_accuracy": 0.6811743974685669, "num_tokens": 107021.0, "step": 125 }, { "entropy": 1.4986421167850494, "epoch": 2.066390041493776, "grad_norm": 1.421595811843872, "learning_rate": 6.696194330590151e-05, "loss": 1.331, "mean_token_accuracy": 0.6666897237300873, "num_tokens": 108279.0, "step": 126 }, { "entropy": 1.2103563100099564, "epoch": 2.08298755186722, "grad_norm": 1.61978018283844, "learning_rate": 6.646009314160173e-05, "loss": 0.9075, "mean_token_accuracy": 0.7723639756441116, "num_tokens": 109356.0, "step": 127 }, { "entropy": 1.217780441045761, "epoch": 2.099585062240664, "grad_norm": 1.7584712505340576, "learning_rate": 6.595637623702763e-05, "loss": 0.8784, "mean_token_accuracy": 0.7690880298614502, "num_tokens": 110347.0, "step": 128 }, { "entropy": 0.8932879865169525, "epoch": 2.116182572614108, "grad_norm": 1.7026498317718506, "learning_rate": 6.545084971874738e-05, "loss": 0.6253, "mean_token_accuracy": 0.8417714536190033, "num_tokens": 111266.0, "step": 129 }, { "entropy": 1.1204040348529816, "epoch": 2.132780082987552, "grad_norm": 2.270695447921753, "learning_rate": 6.494357091855751e-05, "loss": 0.889, "mean_token_accuracy": 0.7744732350111008, "num_tokens": 112096.0, "step": 130 }, { "entropy": 0.9187988489866257, "epoch": 2.1493775933609958, "grad_norm": 2.6016838550567627, "learning_rate": 6.443459736698105e-05, "loss": 0.759, "mean_token_accuracy": 0.8029564172029495, "num_tokens": 112866.0, "step": 131 }, { "entropy": 1.060081034898758, "epoch": 2.1659751037344397, "grad_norm": 3.0870463848114014, "learning_rate": 6.39239867867428e-05, "loss": 0.973, "mean_token_accuracy": 0.7499169707298279, "num_tokens": 113555.0, "step": 132 }, { "entropy": 0.8084948360919952, "epoch": 2.1825726141078836, "grad_norm": 3.516533136367798, "learning_rate": 6.341179708622315e-05, "loss": 0.7765, "mean_token_accuracy": 0.7850001603364944, "num_tokens": 114162.0, "step": 133 }, { "entropy": 0.9602021425962448, "epoch": 2.199170124481328, "grad_norm": 3.2551493644714355, "learning_rate": 6.28980863528906e-05, "loss": 0.7846, "mean_token_accuracy": 0.8070370852947235, "num_tokens": 114731.0, "step": 134 }, { "entropy": 0.8361001461744308, "epoch": 2.215767634854772, "grad_norm": 4.158690929412842, "learning_rate": 6.23829128467141e-05, "loss": 0.783, "mean_token_accuracy": 0.7848098278045654, "num_tokens": 115260.0, "step": 135 }, { "entropy": 0.586012601852417, "epoch": 2.232365145228216, "grad_norm": 3.1432180404663086, "learning_rate": 6.186633499355576e-05, "loss": 0.401, "mean_token_accuracy": 0.8802812397480011, "num_tokens": 115717.0, "step": 136 }, { "entropy": 0.7248338460922241, "epoch": 2.2489626556016598, "grad_norm": 3.5007729530334473, "learning_rate": 6.134841137854475e-05, "loss": 0.5282, "mean_token_accuracy": 0.8414591550827026, "num_tokens": 116118.0, "step": 137 }, { "entropy": 0.7773696631193161, "epoch": 2.2655601659751037, "grad_norm": 1.5687109231948853, "learning_rate": 6.082920073943328e-05, "loss": 0.8679, "mean_token_accuracy": 0.7672423124313354, "num_tokens": 118032.0, "step": 138 }, { "entropy": 0.7244298756122589, "epoch": 2.2821576763485476, "grad_norm": 1.6099064350128174, "learning_rate": 6.030876195993491e-05, "loss": 0.8375, "mean_token_accuracy": 0.7733269482851028, "num_tokens": 119597.0, "step": 139 }, { "entropy": 0.737570583820343, "epoch": 2.2987551867219915, "grad_norm": 2.3326027393341064, "learning_rate": 5.97871540630468e-05, "loss": 0.7659, "mean_token_accuracy": 0.7851079106330872, "num_tokens": 120691.0, "step": 140 }, { "entropy": 0.7653595954179764, "epoch": 2.3153526970954355, "grad_norm": 2.660642623901367, "learning_rate": 5.9264436204355724e-05, "loss": 0.7601, "mean_token_accuracy": 0.7836814522743225, "num_tokens": 121663.0, "step": 141 }, { "entropy": 0.8718907386064529, "epoch": 2.33195020746888, "grad_norm": 2.816377878189087, "learning_rate": 5.874066766532932e-05, "loss": 0.6845, "mean_token_accuracy": 0.8144886344671249, "num_tokens": 122494.0, "step": 142 }, { "entropy": 0.8468358963727951, "epoch": 2.3485477178423237, "grad_norm": 2.4367387294769287, "learning_rate": 5.8215907846592977e-05, "loss": 0.6305, "mean_token_accuracy": 0.8274233788251877, "num_tokens": 123285.0, "step": 143 }, { "entropy": 0.8580201715230942, "epoch": 2.3651452282157677, "grad_norm": 2.3725626468658447, "learning_rate": 5.769021626119314e-05, "loss": 0.6027, "mean_token_accuracy": 0.82393579185009, "num_tokens": 124055.0, "step": 144 }, { "entropy": 1.040640190243721, "epoch": 2.3817427385892116, "grad_norm": 2.584585189819336, "learning_rate": 5.7163652527847987e-05, "loss": 0.8636, "mean_token_accuracy": 0.7851257175207138, "num_tokens": 124789.0, "step": 145 }, { "entropy": 0.8957875370979309, "epoch": 2.3983402489626555, "grad_norm": 2.5588252544403076, "learning_rate": 5.6636276364186105e-05, "loss": 0.6825, "mean_token_accuracy": 0.802570715546608, "num_tokens": 125440.0, "step": 146 }, { "entropy": 0.8292366862297058, "epoch": 2.4149377593360994, "grad_norm": 2.70613169670105, "learning_rate": 5.610814757997377e-05, "loss": 0.6489, "mean_token_accuracy": 0.8280458450317383, "num_tokens": 126019.0, "step": 147 }, { "entropy": 0.8870530277490616, "epoch": 2.431535269709544, "grad_norm": 2.6557841300964355, "learning_rate": 5.557932607033207e-05, "loss": 0.5701, "mean_token_accuracy": 0.8425956070423126, "num_tokens": 126535.0, "step": 148 }, { "entropy": 0.9041202813386917, "epoch": 2.4481327800829877, "grad_norm": 2.9167532920837402, "learning_rate": 5.504987180894411e-05, "loss": 0.6641, "mean_token_accuracy": 0.8117185682058334, "num_tokens": 127017.0, "step": 149 }, { "entropy": 0.6521150767803192, "epoch": 2.4647302904564317, "grad_norm": 2.460925579071045, "learning_rate": 5.451984484125341e-05, "loss": 0.4366, "mean_token_accuracy": 0.8905431628227234, "num_tokens": 127467.0, "step": 150 }, { "entropy": 0.43711117655038834, "epoch": 2.4813278008298756, "grad_norm": 2.205427646636963, "learning_rate": 5.3989305277654156e-05, "loss": 0.264, "mean_token_accuracy": 0.9267032593488693, "num_tokens": 127893.0, "step": 151 }, { "entropy": 0.6371852308511734, "epoch": 2.4979253112033195, "grad_norm": 2.989675283432007, "learning_rate": 5.345831328667408e-05, "loss": 0.4021, "mean_token_accuracy": 0.8775946348905563, "num_tokens": 128245.0, "step": 152 }, { "entropy": 0.9646222442388535, "epoch": 2.5145228215767634, "grad_norm": 2.5618557929992676, "learning_rate": 5.292692908815069e-05, "loss": 1.0454, "mean_token_accuracy": 0.7269141972064972, "num_tokens": 129738.0, "step": 153 }, { "entropy": 1.018859714269638, "epoch": 2.5311203319502074, "grad_norm": 2.760653018951416, "learning_rate": 5.239521294640185e-05, "loss": 1.1112, "mean_token_accuracy": 0.719361737370491, "num_tokens": 131011.0, "step": 154 }, { "entropy": 1.0589520335197449, "epoch": 2.5477178423236513, "grad_norm": 2.75836181640625, "learning_rate": 5.1863225163391073e-05, "loss": 1.1539, "mean_token_accuracy": 0.716277152299881, "num_tokens": 132229.0, "step": 155 }, { "entropy": 0.8339425623416901, "epoch": 2.564315352697095, "grad_norm": 2.1010499000549316, "learning_rate": 5.133102607188874e-05, "loss": 0.6909, "mean_token_accuracy": 0.8211058974266052, "num_tokens": 133343.0, "step": 156 }, { "entropy": 0.7217313796281815, "epoch": 2.5809128630705396, "grad_norm": 2.1709694862365723, "learning_rate": 5.079867602862974e-05, "loss": 0.7069, "mean_token_accuracy": 0.8010880500078201, "num_tokens": 134333.0, "step": 157 }, { "entropy": 0.7894525229930878, "epoch": 2.5975103734439835, "grad_norm": 3.0637104511260986, "learning_rate": 5.0266235407468424e-05, "loss": 0.7065, "mean_token_accuracy": 0.8259354382753372, "num_tokens": 135242.0, "step": 158 }, { "entropy": 0.8071346133947372, "epoch": 2.6141078838174274, "grad_norm": 2.9362282752990723, "learning_rate": 4.973376459253159e-05, "loss": 0.7296, "mean_token_accuracy": 0.7955306619405746, "num_tokens": 136053.0, "step": 159 }, { "entropy": 0.9336775541305542, "epoch": 2.6307053941908713, "grad_norm": 3.6798059940338135, "learning_rate": 4.9201323971370264e-05, "loss": 0.9182, "mean_token_accuracy": 0.7530855238437653, "num_tokens": 136813.0, "step": 160 }, { "entropy": 0.8967225700616837, "epoch": 2.6473029045643153, "grad_norm": 2.9090402126312256, "learning_rate": 4.866897392811126e-05, "loss": 0.7878, "mean_token_accuracy": 0.7828802466392517, "num_tokens": 137520.0, "step": 161 }, { "entropy": 0.8007341772317886, "epoch": 2.663900414937759, "grad_norm": 3.263995885848999, "learning_rate": 4.8136774836608925e-05, "loss": 0.6358, "mean_token_accuracy": 0.8244260102510452, "num_tokens": 138143.0, "step": 162 }, { "entropy": 1.0581243187189102, "epoch": 2.6804979253112036, "grad_norm": 2.9952902793884277, "learning_rate": 4.760478705359816e-05, "loss": 0.7703, "mean_token_accuracy": 0.8044403791427612, "num_tokens": 138716.0, "step": 163 }, { "entropy": 0.7207875102758408, "epoch": 2.6970954356846475, "grad_norm": 3.037635087966919, "learning_rate": 4.707307091184931e-05, "loss": 0.5967, "mean_token_accuracy": 0.8498925566673279, "num_tokens": 139255.0, "step": 164 }, { "entropy": 0.7493630349636078, "epoch": 2.7136929460580914, "grad_norm": 3.4928629398345947, "learning_rate": 4.654168671332594e-05, "loss": 0.5708, "mean_token_accuracy": 0.8602199703454971, "num_tokens": 139746.0, "step": 165 }, { "entropy": 0.6802153587341309, "epoch": 2.7302904564315353, "grad_norm": 3.389561176300049, "learning_rate": 4.601069472234584e-05, "loss": 0.5583, "mean_token_accuracy": 0.8634126931428909, "num_tokens": 140211.0, "step": 166 }, { "entropy": 0.5491561889648438, "epoch": 2.7468879668049793, "grad_norm": 2.452354907989502, "learning_rate": 4.54801551587466e-05, "loss": 0.3749, "mean_token_accuracy": 0.8924126625061035, "num_tokens": 140627.0, "step": 167 }, { "entropy": 1.082240641117096, "epoch": 2.763485477178423, "grad_norm": 1.8373757600784302, "learning_rate": 4.4950128191055896e-05, "loss": 1.0634, "mean_token_accuracy": 0.7363788485527039, "num_tokens": 142517.0, "step": 168 }, { "entropy": 0.9259464293718338, "epoch": 2.780082987551867, "grad_norm": 1.4106931686401367, "learning_rate": 4.4420673929667936e-05, "loss": 0.8906, "mean_token_accuracy": 0.7626354992389679, "num_tokens": 144001.0, "step": 169 }, { "entropy": 1.1125036478042603, "epoch": 2.796680497925311, "grad_norm": 1.8246486186981201, "learning_rate": 4.3891852420026225e-05, "loss": 0.9538, "mean_token_accuracy": 0.7357250899076462, "num_tokens": 145324.0, "step": 170 }, { "entropy": 1.03811414539814, "epoch": 2.813278008298755, "grad_norm": 1.7586928606033325, "learning_rate": 4.336372363581391e-05, "loss": 0.9935, "mean_token_accuracy": 0.7378970831632614, "num_tokens": 146407.0, "step": 171 }, { "entropy": 0.8408836126327515, "epoch": 2.8298755186721993, "grad_norm": 2.626432180404663, "learning_rate": 4.283634747215202e-05, "loss": 0.7084, "mean_token_accuracy": 0.7977723926305771, "num_tokens": 147386.0, "step": 172 }, { "entropy": 0.8435258269309998, "epoch": 2.8464730290456433, "grad_norm": 2.422319173812866, "learning_rate": 4.230978373880687e-05, "loss": 0.6315, "mean_token_accuracy": 0.8369058072566986, "num_tokens": 148176.0, "step": 173 }, { "entropy": 0.8827187120914459, "epoch": 2.863070539419087, "grad_norm": 3.2514476776123047, "learning_rate": 4.178409215340704e-05, "loss": 0.751, "mean_token_accuracy": 0.7934647500514984, "num_tokens": 148877.0, "step": 174 }, { "entropy": 1.1808519065380096, "epoch": 2.879668049792531, "grad_norm": 2.987744092941284, "learning_rate": 4.125933233467069e-05, "loss": 0.9171, "mean_token_accuracy": 0.7549975365400314, "num_tokens": 149538.0, "step": 175 }, { "entropy": 0.8594090789556503, "epoch": 2.896265560165975, "grad_norm": 2.7726871967315674, "learning_rate": 4.0735563795644294e-05, "loss": 0.6315, "mean_token_accuracy": 0.8250421732664108, "num_tokens": 150159.0, "step": 176 }, { "entropy": 0.8105258494615555, "epoch": 2.912863070539419, "grad_norm": 3.127241611480713, "learning_rate": 4.021284593695321e-05, "loss": 0.6019, "mean_token_accuracy": 0.8341681659221649, "num_tokens": 150754.0, "step": 177 }, { "entropy": 0.8403373807668686, "epoch": 2.9294605809128633, "grad_norm": 2.7863616943359375, "learning_rate": 3.969123804006511e-05, "loss": 0.6372, "mean_token_accuracy": 0.8413342088460922, "num_tokens": 151325.0, "step": 178 }, { "entropy": 0.7010289281606674, "epoch": 2.9460580912863072, "grad_norm": 3.0871100425720215, "learning_rate": 3.917079926056674e-05, "loss": 0.5957, "mean_token_accuracy": 0.8436416238546371, "num_tokens": 151854.0, "step": 179 }, { "entropy": 0.7843320816755295, "epoch": 2.962655601659751, "grad_norm": 3.303302764892578, "learning_rate": 3.8651588621455254e-05, "loss": 0.6363, "mean_token_accuracy": 0.8261257261037827, "num_tokens": 152353.0, "step": 180 }, { "entropy": 0.6532695293426514, "epoch": 2.979253112033195, "grad_norm": 3.2265734672546387, "learning_rate": 3.8133665006444255e-05, "loss": 0.4373, "mean_token_accuracy": 0.8786792159080505, "num_tokens": 152799.0, "step": 181 }, { "entropy": 0.5146052092313766, "epoch": 2.995850622406639, "grad_norm": 2.864121198654175, "learning_rate": 3.761708715328593e-05, "loss": 0.3235, "mean_token_accuracy": 0.919788122177124, "num_tokens": 153204.0, "step": 182 }, { "entropy": 1.0765279531478882, "epoch": 3.0, "grad_norm": 4.817622184753418, "learning_rate": 3.7101913647109414e-05, "loss": 0.7345, "mean_token_accuracy": 0.8300970792770386, "num_tokens": 153411.0, "step": 183 }, { "entropy": 0.9053896814584732, "epoch": 3.016597510373444, "grad_norm": 1.3523423671722412, "learning_rate": 3.658820291377686e-05, "loss": 0.7027, "mean_token_accuracy": 0.8281210213899612, "num_tokens": 155308.0, "step": 184 }, { "entropy": 0.9245802909135818, "epoch": 3.033195020746888, "grad_norm": 1.3620742559432983, "learning_rate": 3.60760132132572e-05, "loss": 0.6806, "mean_token_accuracy": 0.8312702178955078, "num_tokens": 156736.0, "step": 185 }, { "entropy": 1.0520436316728592, "epoch": 3.0497925311203318, "grad_norm": 1.862312912940979, "learning_rate": 3.556540263301896e-05, "loss": 0.762, "mean_token_accuracy": 0.8084734082221985, "num_tokens": 158004.0, "step": 186 }, { "entropy": 0.6379094421863556, "epoch": 3.066390041493776, "grad_norm": 1.6042191982269287, "learning_rate": 3.505642908144248e-05, "loss": 0.3796, "mean_token_accuracy": 0.9122848212718964, "num_tokens": 159070.0, "step": 187 }, { "entropy": 0.59751757979393, "epoch": 3.08298755186722, "grad_norm": 2.215848684310913, "learning_rate": 3.4549150281252636e-05, "loss": 0.3516, "mean_token_accuracy": 0.9034991562366486, "num_tokens": 159966.0, "step": 188 }, { "entropy": 0.6749102771282196, "epoch": 3.099585062240664, "grad_norm": 2.7357337474823, "learning_rate": 3.404362376297237e-05, "loss": 0.4656, "mean_token_accuracy": 0.8664576560258865, "num_tokens": 160775.0, "step": 189 }, { "entropy": 0.41622431576251984, "epoch": 3.116182572614108, "grad_norm": 2.113668203353882, "learning_rate": 3.353990685839828e-05, "loss": 0.2241, "mean_token_accuracy": 0.9403961449861526, "num_tokens": 161548.0, "step": 190 }, { "entropy": 0.5323886349797249, "epoch": 3.132780082987552, "grad_norm": 2.39516019821167, "learning_rate": 3.303805669409848e-05, "loss": 0.3055, "mean_token_accuracy": 0.9162275344133377, "num_tokens": 162252.0, "step": 191 }, { "entropy": 0.5232428386807442, "epoch": 3.1493775933609958, "grad_norm": 2.6726315021514893, "learning_rate": 3.253813018493402e-05, "loss": 0.3453, "mean_token_accuracy": 0.9130482524633408, "num_tokens": 162875.0, "step": 192 }, { "entropy": 0.35711124539375305, "epoch": 3.1659751037344397, "grad_norm": 2.5041966438293457, "learning_rate": 3.2040184027604006e-05, "loss": 0.2254, "mean_token_accuracy": 0.9327007085084915, "num_tokens": 163473.0, "step": 193 }, { "entropy": 0.2961500436067581, "epoch": 3.1825726141078836, "grad_norm": 2.367612600326538, "learning_rate": 3.15442746942158e-05, "loss": 0.1943, "mean_token_accuracy": 0.9548846483230591, "num_tokens": 164033.0, "step": 194 }, { "entropy": 0.3251847103238106, "epoch": 3.199170124481328, "grad_norm": 4.243903160095215, "learning_rate": 3.1050458425880335e-05, "loss": 0.2207, "mean_token_accuracy": 0.9388151168823242, "num_tokens": 164545.0, "step": 195 }, { "entropy": 0.2914026416838169, "epoch": 3.215767634854772, "grad_norm": 3.594550609588623, "learning_rate": 3.055879122633397e-05, "loss": 0.1859, "mean_token_accuracy": 0.9419218003749847, "num_tokens": 165031.0, "step": 196 }, { "entropy": 0.29661769419908524, "epoch": 3.232365145228216, "grad_norm": 2.6744418144226074, "learning_rate": 3.006932885558697e-05, "loss": 0.1631, "mean_token_accuracy": 0.962583601474762, "num_tokens": 165486.0, "step": 197 }, { "entropy": 0.26884079724550247, "epoch": 3.2489626556016598, "grad_norm": 3.2280545234680176, "learning_rate": 2.9582126823599876e-05, "loss": 0.1741, "mean_token_accuracy": 0.9312031865119934, "num_tokens": 165852.0, "step": 198 }, { "entropy": 0.5130668357014656, "epoch": 3.2655601659751037, "grad_norm": 1.2567466497421265, "learning_rate": 2.9097240383988e-05, "loss": 0.5013, "mean_token_accuracy": 0.8647334575653076, "num_tokens": 167543.0, "step": 199 }, { "entropy": 0.594046100974083, "epoch": 3.2821576763485476, "grad_norm": 1.816318154335022, "learning_rate": 2.8614724527755165e-05, "loss": 0.5655, "mean_token_accuracy": 0.8496900200843811, "num_tokens": 169003.0, "step": 200 }, { "entropy": 0.6586759090423584, "epoch": 3.2987551867219915, "grad_norm": 3.464672088623047, "learning_rate": 2.8134633977057235e-05, "loss": 0.7252, "mean_token_accuracy": 0.8186280876398087, "num_tokens": 170336.0, "step": 201 }, { "entropy": 0.665482722222805, "epoch": 3.3153526970954355, "grad_norm": 2.9167168140411377, "learning_rate": 2.7657023178995957e-05, "loss": 0.6155, "mean_token_accuracy": 0.8501123189926147, "num_tokens": 171476.0, "step": 202 }, { "entropy": 0.37374667823314667, "epoch": 3.33195020746888, "grad_norm": 2.652055501937866, "learning_rate": 2.7181946299444206e-05, "loss": 0.2669, "mean_token_accuracy": 0.9233611226081848, "num_tokens": 172413.0, "step": 203 }, { "entropy": 0.4015509784221649, "epoch": 3.3485477178423237, "grad_norm": 4.198200702667236, "learning_rate": 2.6709457216902923e-05, "loss": 0.3356, "mean_token_accuracy": 0.8950087577104568, "num_tokens": 173207.0, "step": 204 }, { "entropy": 0.4464033991098404, "epoch": 3.3651452282157677, "grad_norm": 3.859204053878784, "learning_rate": 2.6239609516390885e-05, "loss": 0.359, "mean_token_accuracy": 0.9043852537870407, "num_tokens": 173938.0, "step": 205 }, { "entropy": 0.5395098552107811, "epoch": 3.3817427385892116, "grad_norm": 3.422429084777832, "learning_rate": 2.5772456483367497e-05, "loss": 0.4296, "mean_token_accuracy": 0.8937343955039978, "num_tokens": 174608.0, "step": 206 }, { "entropy": 0.37649453803896904, "epoch": 3.3983402489626555, "grad_norm": 2.677446126937866, "learning_rate": 2.53080510976898e-05, "loss": 0.2481, "mean_token_accuracy": 0.9350832402706146, "num_tokens": 175197.0, "step": 207 }, { "entropy": 0.4082087576389313, "epoch": 3.4149377593360994, "grad_norm": 2.799633026123047, "learning_rate": 2.484644602760389e-05, "loss": 0.2419, "mean_token_accuracy": 0.9391117542982101, "num_tokens": 175740.0, "step": 208 }, { "entropy": 0.37681715935468674, "epoch": 3.431535269709544, "grad_norm": 2.437453508377075, "learning_rate": 2.4387693623771957e-05, "loss": 0.2124, "mean_token_accuracy": 0.9485742002725601, "num_tokens": 176250.0, "step": 209 }, { "entropy": 0.32512830942869186, "epoch": 3.4481327800829877, "grad_norm": 3.021730899810791, "learning_rate": 2.393184591333507e-05, "loss": 0.264, "mean_token_accuracy": 0.940506711602211, "num_tokens": 176726.0, "step": 210 }, { "entropy": 0.2483925148844719, "epoch": 3.4647302904564317, "grad_norm": 2.603163957595825, "learning_rate": 2.347895459401288e-05, "loss": 0.1347, "mean_token_accuracy": 0.9562080502510071, "num_tokens": 177163.0, "step": 211 }, { "entropy": 0.23566309362649918, "epoch": 3.4813278008298756, "grad_norm": 2.984252452850342, "learning_rate": 2.3029071028240434e-05, "loss": 0.1301, "mean_token_accuracy": 0.9639357030391693, "num_tokens": 177585.0, "step": 212 }, { "entropy": 0.30283595249056816, "epoch": 3.4979253112033195, "grad_norm": 2.2506368160247803, "learning_rate": 2.258224623734333e-05, "loss": 0.1524, "mean_token_accuracy": 0.9610457569360733, "num_tokens": 177961.0, "step": 213 }, { "entropy": 0.6629791855812073, "epoch": 3.5145228215767634, "grad_norm": 2.0996663570404053, "learning_rate": 2.2138530895751237e-05, "loss": 0.6517, "mean_token_accuracy": 0.8251046538352966, "num_tokens": 179985.0, "step": 214 }, { "entropy": 0.6168433576822281, "epoch": 3.5311203319502074, "grad_norm": 2.385413408279419, "learning_rate": 2.169797532525103e-05, "loss": 0.5419, "mean_token_accuracy": 0.8522433340549469, "num_tokens": 181356.0, "step": 215 }, { "entropy": 0.5381506308913231, "epoch": 3.5477178423236513, "grad_norm": 1.9651310443878174, "learning_rate": 2.126062948927966e-05, "loss": 0.366, "mean_token_accuracy": 0.9021719694137573, "num_tokens": 182489.0, "step": 216 }, { "entropy": 0.5477860048413277, "epoch": 3.564315352697095, "grad_norm": 2.2163186073303223, "learning_rate": 2.082654298725793e-05, "loss": 0.4651, "mean_token_accuracy": 0.8771954923868179, "num_tokens": 183524.0, "step": 217 }, { "entropy": 0.4866204559803009, "epoch": 3.5809128630705396, "grad_norm": 2.5803163051605225, "learning_rate": 2.0395765048965338e-05, "loss": 0.3798, "mean_token_accuracy": 0.895937517285347, "num_tokens": 184507.0, "step": 218 }, { "entropy": 0.507550872862339, "epoch": 3.5975103734439835, "grad_norm": 2.8360655307769775, "learning_rate": 1.996834452895695e-05, "loss": 0.3611, "mean_token_accuracy": 0.9070864617824554, "num_tokens": 185458.0, "step": 219 }, { "entropy": 0.4657301604747772, "epoch": 3.6141078838174274, "grad_norm": 2.194333553314209, "learning_rate": 1.9544329901022774e-05, "loss": 0.3005, "mean_token_accuracy": 0.9226408004760742, "num_tokens": 186344.0, "step": 220 }, { "entropy": 0.3825162798166275, "epoch": 3.6307053941908713, "grad_norm": 2.246577739715576, "learning_rate": 1.912376925269041e-05, "loss": 0.2462, "mean_token_accuracy": 0.9420317560434341, "num_tokens": 187132.0, "step": 221 }, { "entropy": 0.5880134254693985, "epoch": 3.6473029045643153, "grad_norm": 3.324869394302368, "learning_rate": 1.8706710279771346e-05, "loss": 0.4481, "mean_token_accuracy": 0.8814945220947266, "num_tokens": 187878.0, "step": 222 }, { "entropy": 0.46588296443223953, "epoch": 3.663900414937759, "grad_norm": 2.560573101043701, "learning_rate": 1.8293200280951884e-05, "loss": 0.2962, "mean_token_accuracy": 0.9168391972780228, "num_tokens": 188568.0, "step": 223 }, { "entropy": 0.4065393805503845, "epoch": 3.6804979253112036, "grad_norm": 2.7935709953308105, "learning_rate": 1.7883286152428875e-05, "loss": 0.2726, "mean_token_accuracy": 0.9170111566781998, "num_tokens": 189187.0, "step": 224 }, { "entropy": 0.4957837387919426, "epoch": 3.6970954356846475, "grad_norm": 2.5674972534179688, "learning_rate": 1.747701438259132e-05, "loss": 0.2918, "mean_token_accuracy": 0.9252507090568542, "num_tokens": 189768.0, "step": 225 }, { "entropy": 0.35758352652192116, "epoch": 3.7136929460580914, "grad_norm": 2.453906297683716, "learning_rate": 1.7074431046748075e-05, "loss": 0.2568, "mean_token_accuracy": 0.9271868020296097, "num_tokens": 190321.0, "step": 226 }, { "entropy": 0.2736184000968933, "epoch": 3.7302904564315353, "grad_norm": 2.352849006652832, "learning_rate": 1.6675581801902406e-05, "loss": 0.1523, "mean_token_accuracy": 0.9644663035869598, "num_tokens": 190802.0, "step": 227 }, { "entropy": 0.2299768067896366, "epoch": 3.7468879668049793, "grad_norm": 1.9265366792678833, "learning_rate": 1.6280511881574122e-05, "loss": 0.1308, "mean_token_accuracy": 0.9701746851205826, "num_tokens": 191209.0, "step": 228 }, { "entropy": 0.7222119271755219, "epoch": 3.763485477178423, "grad_norm": 2.0140905380249023, "learning_rate": 1.5889266090669525e-05, "loss": 0.7162, "mean_token_accuracy": 0.8162243366241455, "num_tokens": 192992.0, "step": 229 }, { "entropy": 0.7263834774494171, "epoch": 3.780082987551867, "grad_norm": 2.6647584438323975, "learning_rate": 1.5501888800400204e-05, "loss": 0.6636, "mean_token_accuracy": 0.8170496225357056, "num_tokens": 194413.0, "step": 230 }, { "entropy": 0.8200473785400391, "epoch": 3.796680497925311, "grad_norm": 2.6536271572113037, "learning_rate": 1.5118423943250771e-05, "loss": 0.7257, "mean_token_accuracy": 0.802078515291214, "num_tokens": 195678.0, "step": 231 }, { "entropy": 0.7650105357170105, "epoch": 3.813278008298755, "grad_norm": 2.270249366760254, "learning_rate": 1.4738915007996574e-05, "loss": 0.592, "mean_token_accuracy": 0.8492171764373779, "num_tokens": 196880.0, "step": 232 }, { "entropy": 0.540265865623951, "epoch": 3.8298755186721993, "grad_norm": 1.7297815084457397, "learning_rate": 1.4363405034771576e-05, "loss": 0.3759, "mean_token_accuracy": 0.8878219872713089, "num_tokens": 197920.0, "step": 233 }, { "entropy": 0.3863483667373657, "epoch": 3.8464730290456433, "grad_norm": 1.8610775470733643, "learning_rate": 1.3991936610187206e-05, "loss": 0.2328, "mean_token_accuracy": 0.9479210078716278, "num_tokens": 198865.0, "step": 234 }, { "entropy": 0.5110977366566658, "epoch": 3.863070539419087, "grad_norm": 2.869537830352783, "learning_rate": 1.3624551862502538e-05, "loss": 0.2829, "mean_token_accuracy": 0.9214334934949875, "num_tokens": 199683.0, "step": 235 }, { "entropy": 0.48182512819767, "epoch": 3.879668049792531, "grad_norm": 2.910742998123169, "learning_rate": 1.3261292456846647e-05, "loss": 0.3121, "mean_token_accuracy": 0.9146182835102081, "num_tokens": 200457.0, "step": 236 }, { "entropy": 0.4533498287200928, "epoch": 3.896265560165975, "grad_norm": 2.7093067169189453, "learning_rate": 1.2902199590493202e-05, "loss": 0.3048, "mean_token_accuracy": 0.9243493974208832, "num_tokens": 201164.0, "step": 237 }, { "entropy": 0.495280422270298, "epoch": 3.912863070539419, "grad_norm": 2.5722432136535645, "learning_rate": 1.2547313988188469e-05, "loss": 0.2904, "mean_token_accuracy": 0.925273984670639, "num_tokens": 201810.0, "step": 238 }, { "entropy": 0.36999866366386414, "epoch": 3.9294605809128633, "grad_norm": 2.4200632572174072, "learning_rate": 1.219667589753251e-05, "loss": 0.2429, "mean_token_accuracy": 0.9331159144639969, "num_tokens": 202407.0, "step": 239 }, { "entropy": 0.5503775253891945, "epoch": 3.9460580912863072, "grad_norm": 3.256476879119873, "learning_rate": 1.1850325084414882e-05, "loss": 0.3254, "mean_token_accuracy": 0.9104706943035126, "num_tokens": 202959.0, "step": 240 }, { "entropy": 0.3866705000400543, "epoch": 3.962655601659751, "grad_norm": 2.4496092796325684, "learning_rate": 1.150830082850468e-05, "loss": 0.2445, "mean_token_accuracy": 0.9439631849527359, "num_tokens": 203462.0, "step": 241 }, { "entropy": 0.2839464247226715, "epoch": 3.979253112033195, "grad_norm": 3.231337308883667, "learning_rate": 1.117064191879587e-05, "loss": 0.1669, "mean_token_accuracy": 0.958666130900383, "num_tokens": 203925.0, "step": 242 }, { "entropy": 0.2561277598142624, "epoch": 3.995850622406639, "grad_norm": 1.902478814125061, "learning_rate": 1.0837386649208164e-05, "loss": 0.1274, "mean_token_accuracy": 0.9695109724998474, "num_tokens": 204355.0, "step": 243 }, { "entropy": 0.40932202339172363, "epoch": 4.0, "grad_norm": 4.405113220214844, "learning_rate": 1.0508572814244205e-05, "loss": 0.1994, "mean_token_accuracy": 0.921875, "num_tokens": 204548.0, "step": 244 } ], "logging_steps": 1, "max_steps": 305, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 9317517084426240.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }