Files
Adversary-8B-v1.1/checkpoint-244/trainer_state.json

2475 lines
71 KiB
JSON
Raw Permalink Normal View History

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 4.0,
"eval_steps": 500,
"global_step": 244,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 1.566802203655243,
"epoch": 0.016597510373443983,
"grad_norm": 1.3679256439208984,
"learning_rate": 0.0,
"loss": 2.4676,
"mean_token_accuracy": 0.5079668760299683,
"num_tokens": 1961.0,
"step": 1
},
{
"entropy": 1.2824033498764038,
"epoch": 0.03319502074688797,
"grad_norm": 1.463968276977539,
"learning_rate": 1e-05,
"loss": 2.1502,
"mean_token_accuracy": 0.5586550310254097,
"num_tokens": 3454.0,
"step": 2
},
{
"entropy": 1.3592263162136078,
"epoch": 0.04979253112033195,
"grad_norm": 2.2606022357940674,
"learning_rate": 2e-05,
"loss": 2.4176,
"mean_token_accuracy": 0.5216769725084305,
"num_tokens": 4824.0,
"step": 3
},
{
"entropy": 1.7233753502368927,
"epoch": 0.06639004149377593,
"grad_norm": 1.7701078653335571,
"learning_rate": 3e-05,
"loss": 2.8426,
"mean_token_accuracy": 0.48796989023685455,
"num_tokens": 6081.0,
"step": 4
},
{
"entropy": 1.4910274147987366,
"epoch": 0.08298755186721991,
"grad_norm": 1.786622166633606,
"learning_rate": 4e-05,
"loss": 2.2084,
"mean_token_accuracy": 0.5306425094604492,
"num_tokens": 7103.0,
"step": 5
},
{
"entropy": 1.800081729888916,
"epoch": 0.0995850622406639,
"grad_norm": 1.775471568107605,
"learning_rate": 5e-05,
"loss": 2.5362,
"mean_token_accuracy": 0.5084067285060883,
"num_tokens": 8031.0,
"step": 6
},
{
"entropy": 2.3219287991523743,
"epoch": 0.11618257261410789,
"grad_norm": 2.0937862396240234,
"learning_rate": 6e-05,
"loss": 2.8304,
"mean_token_accuracy": 0.448772631585598,
"num_tokens": 8843.0,
"step": 7
},
{
"entropy": 2.229207932949066,
"epoch": 0.13278008298755187,
"grad_norm": 1.9861464500427246,
"learning_rate": 7e-05,
"loss": 2.6814,
"mean_token_accuracy": 0.47942136973142624,
"num_tokens": 9594.0,
"step": 8
},
{
"entropy": 2.354415476322174,
"epoch": 0.14937759336099585,
"grad_norm": 1.8094334602355957,
"learning_rate": 8e-05,
"loss": 2.8711,
"mean_token_accuracy": 0.45240335911512375,
"num_tokens": 10288.0,
"step": 9
},
{
"entropy": 2.459421217441559,
"epoch": 0.16597510373443983,
"grad_norm": 1.8258342742919922,
"learning_rate": 9e-05,
"loss": 2.9021,
"mean_token_accuracy": 0.449099138379097,
"num_tokens": 10929.0,
"step": 10
},
{
"entropy": 2.621789336204529,
"epoch": 0.1825726141078838,
"grad_norm": 2.7300946712493896,
"learning_rate": 0.0001,
"loss": 2.547,
"mean_token_accuracy": 0.4819970279932022,
"num_tokens": 11539.0,
"step": 11
},
{
"entropy": 2.7384027242660522,
"epoch": 0.1991701244813278,
"grad_norm": 2.9457969665527344,
"learning_rate": 9.999716474831242e-05,
"loss": 2.8466,
"mean_token_accuracy": 0.4608563259243965,
"num_tokens": 12091.0,
"step": 12
},
{
"entropy": 2.989166796207428,
"epoch": 0.2157676348547718,
"grad_norm": 2.0658581256866455,
"learning_rate": 9.99886593147957e-05,
"loss": 2.5596,
"mean_token_accuracy": 0.514740876853466,
"num_tokens": 12587.0,
"step": 13
},
{
"entropy": 2.997403562068939,
"epoch": 0.23236514522821577,
"grad_norm": 3.369170665740967,
"learning_rate": 9.997448466405169e-05,
"loss": 2.4039,
"mean_token_accuracy": 0.5438374727964401,
"num_tokens": 13042.0,
"step": 14
},
{
"entropy": 2.7351107001304626,
"epoch": 0.24896265560165975,
"grad_norm": 1.9540605545043945,
"learning_rate": 9.995464240362846e-05,
"loss": 2.0586,
"mean_token_accuracy": 0.5540800094604492,
"num_tokens": 13445.0,
"step": 15
},
{
"entropy": 1.8458695709705353,
"epoch": 0.26556016597510373,
"grad_norm": 0.9754659533500671,
"learning_rate": 9.99291347838381e-05,
"loss": 1.7562,
"mean_token_accuracy": 0.5864828526973724,
"num_tokens": 15087.0,
"step": 16
},
{
"entropy": 2.200885534286499,
"epoch": 0.2821576763485477,
"grad_norm": 1.13197922706604,
"learning_rate": 9.98979646975015e-05,
"loss": 2.238,
"mean_token_accuracy": 0.5022777020931244,
"num_tokens": 16333.0,
"step": 17
},
{
"entropy": 2.252615600824356,
"epoch": 0.2987551867219917,
"grad_norm": 1.2078205347061157,
"learning_rate": 9.986113567962026e-05,
"loss": 2.1967,
"mean_token_accuracy": 0.5359554067254066,
"num_tokens": 17389.0,
"step": 18
},
{
"entropy": 2.179795980453491,
"epoch": 0.3153526970954357,
"grad_norm": 1.3316738605499268,
"learning_rate": 9.981865190697577e-05,
"loss": 1.8956,
"mean_token_accuracy": 0.5649193078279495,
"num_tokens": 18350.0,
"step": 19
},
{
"entropy": 2.2198538780212402,
"epoch": 0.33195020746887965,
"grad_norm": 1.3263436555862427,
"learning_rate": 9.977051819765558e-05,
"loss": 2.0364,
"mean_token_accuracy": 0.5675807893276215,
"num_tokens": 19156.0,
"step": 20
},
{
"entropy": 2.2128241062164307,
"epoch": 0.34854771784232363,
"grad_norm": 1.708030343055725,
"learning_rate": 9.971674001050686e-05,
"loss": 2.1029,
"mean_token_accuracy": 0.5378818288445473,
"num_tokens": 19911.0,
"step": 21
},
{
"entropy": 2.033743917942047,
"epoch": 0.3651452282157676,
"grad_norm": 2.0581839084625244,
"learning_rate": 9.96573234445175e-05,
"loss": 1.9337,
"mean_token_accuracy": 0.5821050256490707,
"num_tokens": 20519.0,
"step": 22
},
{
"entropy": 2.1534159779548645,
"epoch": 0.3817427385892116,
"grad_norm": 2.190251350402832,
"learning_rate": 9.959227523812423e-05,
"loss": 2.0707,
"mean_token_accuracy": 0.5588077083230019,
"num_tokens": 21097.0,
"step": 23
},
{
"entropy": 2.0276338160037994,
"epoch": 0.3983402489626556,
"grad_norm": 2.0907859802246094,
"learning_rate": 9.952160276844856e-05,
"loss": 2.0956,
"mean_token_accuracy": 0.5710751935839653,
"num_tokens": 21647.0,
"step": 24
},
{
"entropy": 1.8905757069587708,
"epoch": 0.4149377593360996,
"grad_norm": 2.121419668197632,
"learning_rate": 9.944531405046e-05,
"loss": 1.759,
"mean_token_accuracy": 0.617972806096077,
"num_tokens": 22177.0,
"step": 25
},
{
"entropy": 2.027945041656494,
"epoch": 0.4315352697095436,
"grad_norm": 2.8114781379699707,
"learning_rate": 9.936341773606723e-05,
"loss": 2.0327,
"mean_token_accuracy": 0.5869216322898865,
"num_tokens": 22687.0,
"step": 26
},
{
"entropy": 1.8629156649112701,
"epoch": 0.44813278008298757,
"grad_norm": 2.1601951122283936,
"learning_rate": 9.927592311313681e-05,
"loss": 1.7504,
"mean_token_accuracy": 0.6231366544961929,
"num_tokens": 23156.0,
"step": 27
},
{
"entropy": 1.8361365795135498,
"epoch": 0.46473029045643155,
"grad_norm": 2.6555299758911133,
"learning_rate": 9.918284010443982e-05,
"loss": 1.6233,
"mean_token_accuracy": 0.6478128284215927,
"num_tokens": 23600.0,
"step": 28
},
{
"entropy": 1.6647760570049286,
"epoch": 0.48132780082987553,
"grad_norm": 2.550370216369629,
"learning_rate": 9.908417926652654e-05,
"loss": 1.4416,
"mean_token_accuracy": 0.6589087396860123,
"num_tokens": 24029.0,
"step": 29
},
{
"entropy": 1.5259109735488892,
"epoch": 0.4979253112033195,
"grad_norm": 2.0502336025238037,
"learning_rate": 9.897995178852927e-05,
"loss": 1.3379,
"mean_token_accuracy": 0.6946790963411331,
"num_tokens": 24437.0,
"step": 30
},
{
"entropy": 1.5604857802391052,
"epoch": 0.5145228215767634,
"grad_norm": 1.2742985486984253,
"learning_rate": 9.887016949089333e-05,
"loss": 1.7725,
"mean_token_accuracy": 0.593292236328125,
"num_tokens": 26460.0,
"step": 31
},
{
"entropy": 1.5407554507255554,
"epoch": 0.5311203319502075,
"grad_norm": 1.4528374671936035,
"learning_rate": 9.875484482403652e-05,
"loss": 1.8915,
"mean_token_accuracy": 0.5747921615839005,
"num_tokens": 27910.0,
"step": 32
},
{
"entropy": 1.843079686164856,
"epoch": 0.5477178423236515,
"grad_norm": 1.6220325231552124,
"learning_rate": 9.863399086693707e-05,
"loss": 2.2955,
"mean_token_accuracy": 0.4998007267713547,
"num_tokens": 29164.0,
"step": 33
},
{
"entropy": 1.484895646572113,
"epoch": 0.5643153526970954,
"grad_norm": 1.3753522634506226,
"learning_rate": 9.850762132565043e-05,
"loss": 1.6426,
"mean_token_accuracy": 0.5886935442686081,
"num_tokens": 30278.0,
"step": 34
},
{
"entropy": 1.604092001914978,
"epoch": 0.5809128630705395,
"grad_norm": 1.3964170217514038,
"learning_rate": 9.837575053175478e-05,
"loss": 1.5824,
"mean_token_accuracy": 0.6277549713850021,
"num_tokens": 31290.0,
"step": 35
},
{
"entropy": 2.1299741566181183,
"epoch": 0.5975103734439834,
"grad_norm": 1.5933111906051636,
"learning_rate": 9.82383934407258e-05,
"loss": 1.8627,
"mean_token_accuracy": 0.596154659986496,
"num_tokens": 32215.0,
"step": 36
},
{
"entropy": 2.1440194249153137,
"epoch": 0.6141078838174274,
"grad_norm": 1.6666224002838135,
"learning_rate": 9.809556563024043e-05,
"loss": 2.0242,
"mean_token_accuracy": 0.5532266497612,
"num_tokens": 33041.0,
"step": 37
},
{
"entropy": 2.121056705713272,
"epoch": 0.6307053941908713,
"grad_norm": 1.6291508674621582,
"learning_rate": 9.794728329841029e-05,
"loss": 1.9948,
"mean_token_accuracy": 0.5666538178920746,
"num_tokens": 33809.0,
"step": 38
},
{
"entropy": 2.1626654863357544,
"epoch": 0.6473029045643154,
"grad_norm": 2.0946688652038574,
"learning_rate": 9.779356326194466e-05,
"loss": 1.9707,
"mean_token_accuracy": 0.5822897553443909,
"num_tokens": 34512.0,
"step": 39
},
{
"entropy": 2.2058463096618652,
"epoch": 0.6639004149377593,
"grad_norm": 1.9641155004501343,
"learning_rate": 9.763442295424324e-05,
"loss": 2.1697,
"mean_token_accuracy": 0.543702982366085,
"num_tokens": 35159.0,
"step": 40
},
{
"entropy": 2.021761655807495,
"epoch": 0.6804979253112033,
"grad_norm": 1.7235463857650757,
"learning_rate": 9.746988042341906e-05,
"loss": 1.8144,
"mean_token_accuracy": 0.593925267457962,
"num_tokens": 35759.0,
"step": 41
},
{
"entropy": 2.2844014763832092,
"epoch": 0.6970954356846473,
"grad_norm": 3.0794079303741455,
"learning_rate": 9.729995433025168e-05,
"loss": 2.2448,
"mean_token_accuracy": 0.5087096095085144,
"num_tokens": 36332.0,
"step": 42
},
{
"entropy": 1.8179744482040405,
"epoch": 0.7136929460580913,
"grad_norm": 1.9659714698791504,
"learning_rate": 9.712466394607078e-05,
"loss": 1.6948,
"mean_token_accuracy": 0.6249574422836304,
"num_tokens": 36861.0,
"step": 43
},
{
"entropy": 2.061110645532608,
"epoch": 0.7302904564315352,
"grad_norm": 2.4043686389923096,
"learning_rate": 9.694402915057066e-05,
"loss": 1.8942,
"mean_token_accuracy": 0.5952516570687294,
"num_tokens": 37339.0,
"step": 44
},
{
"entropy": 1.827080100774765,
"epoch": 0.7468879668049793,
"grad_norm": 2.456507682800293,
"learning_rate": 9.675807042955569e-05,
"loss": 1.6236,
"mean_token_accuracy": 0.6085141599178314,
"num_tokens": 37756.0,
"step": 45
},
{
"entropy": 1.4766492545604706,
"epoch": 0.7634854771784232,
"grad_norm": 1.0035699605941772,
"learning_rate": 9.656680887261693e-05,
"loss": 1.557,
"mean_token_accuracy": 0.617707371711731,
"num_tokens": 39461.0,
"step": 46
},
{
"entropy": 1.7303943932056427,
"epoch": 0.7800829875518672,
"grad_norm": 1.0027786493301392,
"learning_rate": 9.637026617074049e-05,
"loss": 1.8817,
"mean_token_accuracy": 0.5656901001930237,
"num_tokens": 40932.0,
"step": 47
},
{
"entropy": 1.9746614396572113,
"epoch": 0.7966804979253111,
"grad_norm": 1.2286392450332642,
"learning_rate": 9.616846461384748e-05,
"loss": 2.1291,
"mean_token_accuracy": 0.5213609486818314,
"num_tokens": 42218.0,
"step": 48
},
{
"entropy": 1.9062314629554749,
"epoch": 0.8132780082987552,
"grad_norm": 1.0907331705093384,
"learning_rate": 9.596142708826604e-05,
"loss": 1.9615,
"mean_token_accuracy": 0.5589454174041748,
"num_tokens": 43380.0,
"step": 49
},
{
"entropy": 1.9102767407894135,
"epoch": 0.8298755186721992,
"grad_norm": 1.5399329662322998,
"learning_rate": 9.574917707413596e-05,
"loss": 1.793,
"mean_token_accuracy": 0.598997175693512,
"num_tokens": 44400.0,
"step": 50
},
{
"entropy": 1.7084259390830994,
"epoch": 0.8464730290456431,
"grad_norm": 1.331813097000122,
"learning_rate": 9.553173864274567e-05,
"loss": 1.712,
"mean_token_accuracy": 0.6038506329059601,
"num_tokens": 45335.0,
"step": 51
},
{
"entropy": 1.8911837935447693,
"epoch": 0.8630705394190872,
"grad_norm": 2.002470016479492,
"learning_rate": 9.530913645380232e-05,
"loss": 1.9683,
"mean_token_accuracy": 0.5909984111785889,
"num_tokens": 46180.0,
"step": 52
},
{
"entropy": 1.63745978474617,
"epoch": 0.8796680497925311,
"grad_norm": 1.4724863767623901,
"learning_rate": 9.508139575263522e-05,
"loss": 1.4999,
"mean_token_accuracy": 0.6617157012224197,
"num_tokens": 46970.0,
"step": 53
},
{
"entropy": 1.898155838251114,
"epoch": 0.8962655601659751,
"grad_norm": 1.8770923614501953,
"learning_rate": 9.484854236733264e-05,
"loss": 1.6905,
"mean_token_accuracy": 0.6523770242929459,
"num_tokens": 47725.0,
"step": 54
},
{
"entropy": 1.92723348736763,
"epoch": 0.9128630705394191,
"grad_norm": 2.107532262802124,
"learning_rate": 9.461060270581275e-05,
"loss": 1.9513,
"mean_token_accuracy": 0.579139918088913,
"num_tokens": 48437.0,
"step": 55
},
{
"entropy": 1.9208797216415405,
"epoch": 0.9294605809128631,
"grad_norm": 2.1801645755767822,
"learning_rate": 9.436760375282859e-05,
"loss": 1.9292,
"mean_token_accuracy": 0.5749614462256432,
"num_tokens": 49077.0,
"step": 56
},
{
"entropy": 1.9385250508785248,
"epoch": 0.946058091286307,
"grad_norm": 1.8006877899169922,
"learning_rate": 9.411957306690784e-05,
"loss": 1.8412,
"mean_token_accuracy": 0.595048114657402,
"num_tokens": 49654.0,
"step": 57
},
{
"entropy": 2.0152436792850494,
"epoch": 0.9626556016597511,
"grad_norm": 2.4321160316467285,
"learning_rate": 9.386653877722733e-05,
"loss": 2.2427,
"mean_token_accuracy": 0.5564496889710426,
"num_tokens": 50150.0,
"step": 58
},
{
"entropy": 1.6884909868240356,
"epoch": 0.979253112033195,
"grad_norm": 2.018585443496704,
"learning_rate": 9.360852958042295e-05,
"loss": 1.6405,
"mean_token_accuracy": 0.6549917608499527,
"num_tokens": 50606.0,
"step": 59
},
{
"entropy": 1.976477712392807,
"epoch": 0.995850622406639,
"grad_norm": 2.2471210956573486,
"learning_rate": 9.334557473733511e-05,
"loss": 2.0322,
"mean_token_accuracy": 0.5780311971902847,
"num_tokens": 50948.0,
"step": 60
},
{
"entropy": 1.2080161571502686,
"epoch": 1.0,
"grad_norm": 2.225203037261963,
"learning_rate": 9.30777040696903e-05,
"loss": 1.1001,
"mean_token_accuracy": 0.6170212626457214,
"num_tokens": 51137.0,
"step": 61
},
{
"entropy": 1.451114296913147,
"epoch": 1.016597510373444,
"grad_norm": 0.8033313155174255,
"learning_rate": 9.280494795671906e-05,
"loss": 1.4178,
"mean_token_accuracy": 0.6653263568878174,
"num_tokens": 53010.0,
"step": 62
},
{
"entropy": 1.8700011372566223,
"epoch": 1.033195020746888,
"grad_norm": 0.8774217963218689,
"learning_rate": 9.252733733171056e-05,
"loss": 1.7435,
"mean_token_accuracy": 0.5836772620677948,
"num_tokens": 54426.0,
"step": 63
},
{
"entropy": 2.0100578665733337,
"epoch": 1.049792531120332,
"grad_norm": 0.9584742188453674,
"learning_rate": 9.22449036785045e-05,
"loss": 1.955,
"mean_token_accuracy": 0.5431181490421295,
"num_tokens": 55685.0,
"step": 64
},
{
"entropy": 1.649256706237793,
"epoch": 1.066390041493776,
"grad_norm": 1.0113857984542847,
"learning_rate": 9.195767902792053e-05,
"loss": 1.4397,
"mean_token_accuracy": 0.6426748633384705,
"num_tokens": 56742.0,
"step": 65
},
{
"entropy": 1.596836507320404,
"epoch": 1.0829875518672198,
"grad_norm": 1.5263484716415405,
"learning_rate": 9.166569595412575e-05,
"loss": 1.4071,
"mean_token_accuracy": 0.6563769578933716,
"num_tokens": 57705.0,
"step": 66
},
{
"entropy": 1.4731523096561432,
"epoch": 1.099585062240664,
"grad_norm": 1.6699166297912598,
"learning_rate": 9.136898757094021e-05,
"loss": 1.2226,
"mean_token_accuracy": 0.6934443712234497,
"num_tokens": 58594.0,
"step": 67
},
{
"entropy": 1.564688891172409,
"epoch": 1.116182572614108,
"grad_norm": 1.757997989654541,
"learning_rate": 9.106758752808169e-05,
"loss": 1.1737,
"mean_token_accuracy": 0.7244593054056168,
"num_tokens": 59373.0,
"step": 68
},
{
"entropy": 1.6936156153678894,
"epoch": 1.1327800829875518,
"grad_norm": 2.0028507709503174,
"learning_rate": 9.076153000734938e-05,
"loss": 1.5669,
"mean_token_accuracy": 0.6568387001752853,
"num_tokens": 60094.0,
"step": 69
},
{
"entropy": 1.8307518661022186,
"epoch": 1.1493775933609958,
"grad_norm": 1.9967020750045776,
"learning_rate": 9.045084971874738e-05,
"loss": 1.7996,
"mean_token_accuracy": 0.5718972831964493,
"num_tokens": 60757.0,
"step": 70
},
{
"entropy": 1.4585759937763214,
"epoch": 1.16597510373444,
"grad_norm": 2.1708550453186035,
"learning_rate": 9.013558189654819e-05,
"loss": 1.3026,
"mean_token_accuracy": 0.6736540347337723,
"num_tokens": 61352.0,
"step": 71
},
{
"entropy": 1.6142982840538025,
"epoch": 1.1825726141078838,
"grad_norm": 2.4141905307769775,
"learning_rate": 8.98157622952968e-05,
"loss": 1.7232,
"mean_token_accuracy": 0.6093451529741287,
"num_tokens": 61928.0,
"step": 72
},
{
"entropy": 1.4834707379341125,
"epoch": 1.1991701244813278,
"grad_norm": 3.3370718955993652,
"learning_rate": 8.94914271857558e-05,
"loss": 1.4542,
"mean_token_accuracy": 0.6456684172153473,
"num_tokens": 62487.0,
"step": 73
},
{
"entropy": 1.2296392917633057,
"epoch": 1.215767634854772,
"grad_norm": 3.297661304473877,
"learning_rate": 8.916261335079184e-05,
"loss": 1.2224,
"mean_token_accuracy": 0.7180867195129395,
"num_tokens": 62989.0,
"step": 74
},
{
"entropy": 1.3978646099567413,
"epoch": 1.2323651452282158,
"grad_norm": 3.230928421020508,
"learning_rate": 8.882935808120413e-05,
"loss": 1.2525,
"mean_token_accuracy": 0.6955430954694748,
"num_tokens": 63431.0,
"step": 75
},
{
"entropy": 1.4348433017730713,
"epoch": 1.2489626556016598,
"grad_norm": 2.9823155403137207,
"learning_rate": 8.849169917149531e-05,
"loss": 1.3674,
"mean_token_accuracy": 0.6774774789810181,
"num_tokens": 63769.0,
"step": 76
},
{
"entropy": 1.1157634109258652,
"epoch": 1.2655601659751037,
"grad_norm": 1.2160100936889648,
"learning_rate": 8.814967491558513e-05,
"loss": 1.2474,
"mean_token_accuracy": 0.6769505888223648,
"num_tokens": 65514.0,
"step": 77
},
{
"entropy": 1.1023453027009964,
"epoch": 1.2821576763485476,
"grad_norm": 1.1360654830932617,
"learning_rate": 8.780332410246749e-05,
"loss": 1.2555,
"mean_token_accuracy": 0.6901346296072006,
"num_tokens": 67028.0,
"step": 78
},
{
"entropy": 1.4519792795181274,
"epoch": 1.2987551867219918,
"grad_norm": 1.2020699977874756,
"learning_rate": 8.745268601181155e-05,
"loss": 1.5405,
"mean_token_accuracy": 0.6213398575782776,
"num_tokens": 68315.0,
"step": 79
},
{
"entropy": 1.3406359404325485,
"epoch": 1.3153526970954357,
"grad_norm": 1.3065791130065918,
"learning_rate": 8.70978004095068e-05,
"loss": 1.2679,
"mean_token_accuracy": 0.6887986212968826,
"num_tokens": 69366.0,
"step": 80
},
{
"entropy": 1.3306908905506134,
"epoch": 1.3319502074688796,
"grad_norm": 1.4615983963012695,
"learning_rate": 8.673870754315336e-05,
"loss": 1.1372,
"mean_token_accuracy": 0.6971320360898972,
"num_tokens": 70328.0,
"step": 81
},
{
"entropy": 1.523217260837555,
"epoch": 1.3485477178423237,
"grad_norm": 1.8181804418563843,
"learning_rate": 8.637544813749746e-05,
"loss": 1.3124,
"mean_token_accuracy": 0.6847366690635681,
"num_tokens": 71161.0,
"step": 82
},
{
"entropy": 1.5914150774478912,
"epoch": 1.3651452282157677,
"grad_norm": 1.9594281911849976,
"learning_rate": 8.60080633898128e-05,
"loss": 1.4735,
"mean_token_accuracy": 0.6489894986152649,
"num_tokens": 71934.0,
"step": 83
},
{
"entropy": 1.7109156250953674,
"epoch": 1.3817427385892116,
"grad_norm": 2.0826797485351562,
"learning_rate": 8.563659496522843e-05,
"loss": 1.5629,
"mean_token_accuracy": 0.61826092004776,
"num_tokens": 72659.0,
"step": 84
},
{
"entropy": 1.6033823788166046,
"epoch": 1.3983402489626555,
"grad_norm": 2.037574052810669,
"learning_rate": 8.526108499200343e-05,
"loss": 1.3959,
"mean_token_accuracy": 0.6633946299552917,
"num_tokens": 73315.0,
"step": 85
},
{
"entropy": 1.5953782498836517,
"epoch": 1.4149377593360997,
"grad_norm": 2.0150649547576904,
"learning_rate": 8.488157605674925e-05,
"loss": 1.3532,
"mean_token_accuracy": 0.70735864341259,
"num_tokens": 73902.0,
"step": 86
},
{
"entropy": 1.4288784563541412,
"epoch": 1.4315352697095436,
"grad_norm": 2.033691883087158,
"learning_rate": 8.449811119959981e-05,
"loss": 1.1189,
"mean_token_accuracy": 0.7260903120040894,
"num_tokens": 74448.0,
"step": 87
},
{
"entropy": 1.7279040217399597,
"epoch": 1.4481327800829875,
"grad_norm": 2.332186460494995,
"learning_rate": 8.411073390933049e-05,
"loss": 1.7084,
"mean_token_accuracy": 0.5948462039232254,
"num_tokens": 74949.0,
"step": 88
},
{
"entropy": 1.3200257420539856,
"epoch": 1.4647302904564317,
"grad_norm": 2.3824870586395264,
"learning_rate": 8.371948811842589e-05,
"loss": 1.019,
"mean_token_accuracy": 0.7397761791944504,
"num_tokens": 75414.0,
"step": 89
},
{
"entropy": 1.2348097264766693,
"epoch": 1.4813278008298756,
"grad_norm": 2.4164183139801025,
"learning_rate": 8.33244181980976e-05,
"loss": 0.9918,
"mean_token_accuracy": 0.7332025468349457,
"num_tokens": 75849.0,
"step": 90
},
{
"entropy": 0.9813397824764252,
"epoch": 1.4979253112033195,
"grad_norm": 2.268641233444214,
"learning_rate": 8.292556895325194e-05,
"loss": 0.8268,
"mean_token_accuracy": 0.7725253701210022,
"num_tokens": 76271.0,
"step": 91
},
{
"entropy": 1.1244373619556427,
"epoch": 1.5145228215767634,
"grad_norm": 0.8862183690071106,
"learning_rate": 8.252298561740867e-05,
"loss": 1.2055,
"mean_token_accuracy": 0.6999105960130692,
"num_tokens": 78108.0,
"step": 92
},
{
"entropy": 1.3843848705291748,
"epoch": 1.5311203319502074,
"grad_norm": 1.3396450281143188,
"learning_rate": 8.211671384757114e-05,
"loss": 1.4806,
"mean_token_accuracy": 0.6275065988302231,
"num_tokens": 79501.0,
"step": 93
},
{
"entropy": 1.534432590007782,
"epoch": 1.5477178423236515,
"grad_norm": 1.5818778276443481,
"learning_rate": 8.170679971904814e-05,
"loss": 1.6552,
"mean_token_accuracy": 0.6043647080659866,
"num_tokens": 80782.0,
"step": 94
},
{
"entropy": 1.419167011976242,
"epoch": 1.5643153526970954,
"grad_norm": 1.509782314300537,
"learning_rate": 8.129328972022867e-05,
"loss": 1.4366,
"mean_token_accuracy": 0.6377193629741669,
"num_tokens": 81875.0,
"step": 95
},
{
"entropy": 1.2230817377567291,
"epoch": 1.5809128630705396,
"grad_norm": 1.9019289016723633,
"learning_rate": 8.08762307473096e-05,
"loss": 1.1952,
"mean_token_accuracy": 0.6841559708118439,
"num_tokens": 82833.0,
"step": 96
},
{
"entropy": 1.5106331408023834,
"epoch": 1.5975103734439835,
"grad_norm": 2.4379634857177734,
"learning_rate": 8.045567009897723e-05,
"loss": 1.5762,
"mean_token_accuracy": 0.6347994953393936,
"num_tokens": 83665.0,
"step": 97
},
{
"entropy": 1.5159637928009033,
"epoch": 1.6141078838174274,
"grad_norm": 2.315671920776367,
"learning_rate": 8.003165547104305e-05,
"loss": 1.4586,
"mean_token_accuracy": 0.6473860591650009,
"num_tokens": 84400.0,
"step": 98
},
{
"entropy": 1.4539947211742401,
"epoch": 1.6307053941908713,
"grad_norm": 3.0009548664093018,
"learning_rate": 7.960423495103467e-05,
"loss": 1.5424,
"mean_token_accuracy": 0.6423875689506531,
"num_tokens": 85068.0,
"step": 99
},
{
"entropy": 1.6873330473899841,
"epoch": 1.6473029045643153,
"grad_norm": 2.6655983924865723,
"learning_rate": 7.917345701274207e-05,
"loss": 1.574,
"mean_token_accuracy": 0.6550299525260925,
"num_tokens": 85695.0,
"step": 100
},
{
"entropy": 1.4055011570453644,
"epoch": 1.6639004149377592,
"grad_norm": 3.3150808811187744,
"learning_rate": 7.873937051072035e-05,
"loss": 1.2071,
"mean_token_accuracy": 0.6913554072380066,
"num_tokens": 86300.0,
"step": 101
},
{
"entropy": 1.6945359408855438,
"epoch": 1.6804979253112033,
"grad_norm": 2.25583553314209,
"learning_rate": 7.830202467474899e-05,
"loss": 1.493,
"mean_token_accuracy": 0.6553004831075668,
"num_tokens": 86861.0,
"step": 102
},
{
"entropy": 1.393843948841095,
"epoch": 1.6970954356846473,
"grad_norm": 2.9434304237365723,
"learning_rate": 7.786146910424876e-05,
"loss": 1.2789,
"mean_token_accuracy": 0.7113071084022522,
"num_tokens": 87388.0,
"step": 103
},
{
"entropy": 1.3938986957073212,
"epoch": 1.7136929460580914,
"grad_norm": 2.8079259395599365,
"learning_rate": 7.741775376265667e-05,
"loss": 1.1396,
"mean_token_accuracy": 0.725695475935936,
"num_tokens": 87870.0,
"step": 104
},
{
"entropy": 1.3154444992542267,
"epoch": 1.7302904564315353,
"grad_norm": 2.5979607105255127,
"learning_rate": 7.697092897175957e-05,
"loss": 1.1318,
"mean_token_accuracy": 0.7149190455675125,
"num_tokens": 88313.0,
"step": 105
},
{
"entropy": 1.2525047361850739,
"epoch": 1.7468879668049793,
"grad_norm": 2.3928842544555664,
"learning_rate": 7.652104540598712e-05,
"loss": 0.9614,
"mean_token_accuracy": 0.7349429130554199,
"num_tokens": 88712.0,
"step": 106
},
{
"entropy": 1.5751274824142456,
"epoch": 1.7634854771784232,
"grad_norm": 1.3356112241744995,
"learning_rate": 7.606815408666493e-05,
"loss": 1.6637,
"mean_token_accuracy": 0.6113278269767761,
"num_tokens": 90652.0,
"step": 107
},
{
"entropy": 1.7263123393058777,
"epoch": 1.7800829875518671,
"grad_norm": 1.220577359199524,
"learning_rate": 7.561230637622805e-05,
"loss": 1.5781,
"mean_token_accuracy": 0.6253386288881302,
"num_tokens": 92043.0,
"step": 108
},
{
"entropy": 1.8092939853668213,
"epoch": 1.796680497925311,
"grad_norm": 1.2987717390060425,
"learning_rate": 7.515355397239613e-05,
"loss": 1.6102,
"mean_token_accuracy": 0.60220967233181,
"num_tokens": 93290.0,
"step": 109
},
{
"entropy": 1.5732390582561493,
"epoch": 1.8132780082987552,
"grad_norm": 1.2782738208770752,
"learning_rate": 7.469194890231021e-05,
"loss": 1.6026,
"mean_token_accuracy": 0.6219276785850525,
"num_tokens": 94437.0,
"step": 110
},
{
"entropy": 1.3208205997943878,
"epoch": 1.8298755186721993,
"grad_norm": 1.508908987045288,
"learning_rate": 7.422754351663252e-05,
"loss": 1.2197,
"mean_token_accuracy": 0.6798736304044724,
"num_tokens": 95454.0,
"step": 111
},
{
"entropy": 1.4695551693439484,
"epoch": 1.8464730290456433,
"grad_norm": 1.7255935668945312,
"learning_rate": 7.376039048360914e-05,
"loss": 1.3915,
"mean_token_accuracy": 0.6647312641143799,
"num_tokens": 96422.0,
"step": 112
},
{
"entropy": 1.5077824890613556,
"epoch": 1.8630705394190872,
"grad_norm": 2.4858553409576416,
"learning_rate": 7.329054278309708e-05,
"loss": 1.5295,
"mean_token_accuracy": 0.645410567522049,
"num_tokens": 97258.0,
"step": 113
},
{
"entropy": 1.3513629138469696,
"epoch": 1.879668049792531,
"grad_norm": 2.4195804595947266,
"learning_rate": 7.281805370055581e-05,
"loss": 1.3322,
"mean_token_accuracy": 0.6713262051343918,
"num_tokens": 98053.0,
"step": 114
},
{
"entropy": 1.1256203055381775,
"epoch": 1.896265560165975,
"grad_norm": 2.4134695529937744,
"learning_rate": 7.234297682100404e-05,
"loss": 1.2417,
"mean_token_accuracy": 0.7208292186260223,
"num_tokens": 98838.0,
"step": 115
},
{
"entropy": 1.2319197356700897,
"epoch": 1.912863070539419,
"grad_norm": 2.0551836490631104,
"learning_rate": 7.186536602294278e-05,
"loss": 1.0502,
"mean_token_accuracy": 0.7311187982559204,
"num_tokens": 99579.0,
"step": 116
},
{
"entropy": 1.3636659979820251,
"epoch": 1.929460580912863,
"grad_norm": 3.1892852783203125,
"learning_rate": 7.138527547224485e-05,
"loss": 1.3794,
"mean_token_accuracy": 0.6597895175218582,
"num_tokens": 100219.0,
"step": 117
},
{
"entropy": 1.3741393387317657,
"epoch": 1.946058091286307,
"grad_norm": 2.720012664794922,
"learning_rate": 7.090275961601203e-05,
"loss": 1.4525,
"mean_token_accuracy": 0.6761961877346039,
"num_tokens": 100773.0,
"step": 118
},
{
"entropy": 1.2926801443099976,
"epoch": 1.9626556016597512,
"grad_norm": 2.668562173843384,
"learning_rate": 7.041787317640014e-05,
"loss": 1.2582,
"mean_token_accuracy": 0.7060045301914215,
"num_tokens": 101274.0,
"step": 119
},
{
"entropy": 1.4207338094711304,
"epoch": 1.979253112033195,
"grad_norm": 2.8614320755004883,
"learning_rate": 6.993067114441302e-05,
"loss": 1.232,
"mean_token_accuracy": 0.6748317778110504,
"num_tokens": 101740.0,
"step": 120
},
{
"entropy": 1.2662785649299622,
"epoch": 1.995850622406639,
"grad_norm": 2.7323219776153564,
"learning_rate": 6.944120877366604e-05,
"loss": 0.9631,
"mean_token_accuracy": 0.7634817808866501,
"num_tokens": 102150.0,
"step": 121
},
{
"entropy": 1.9474085569381714,
"epoch": 2.0,
"grad_norm": 6.136712551116943,
"learning_rate": 6.894954157411966e-05,
"loss": 1.9084,
"mean_token_accuracy": 0.5528455376625061,
"num_tokens": 102274.0,
"step": 122
},
{
"entropy": 1.1377949267625809,
"epoch": 2.016597510373444,
"grad_norm": 0.9612461924552917,
"learning_rate": 6.845572530578422e-05,
"loss": 1.1333,
"mean_token_accuracy": 0.7239202558994293,
"num_tokens": 104207.0,
"step": 123
},
{
"entropy": 1.2367377132177353,
"epoch": 2.033195020746888,
"grad_norm": 1.1431013345718384,
"learning_rate": 6.795981597239599e-05,
"loss": 1.0014,
"mean_token_accuracy": 0.7419553995132446,
"num_tokens": 105672.0,
"step": 124
},
{
"entropy": 1.449882984161377,
"epoch": 2.0497925311203318,
"grad_norm": 1.6375846862792969,
"learning_rate": 6.7461869815066e-05,
"loss": 1.1995,
"mean_token_accuracy": 0.6811743974685669,
"num_tokens": 107021.0,
"step": 125
},
{
"entropy": 1.4986421167850494,
"epoch": 2.066390041493776,
"grad_norm": 1.421595811843872,
"learning_rate": 6.696194330590151e-05,
"loss": 1.331,
"mean_token_accuracy": 0.6666897237300873,
"num_tokens": 108279.0,
"step": 126
},
{
"entropy": 1.2103563100099564,
"epoch": 2.08298755186722,
"grad_norm": 1.61978018283844,
"learning_rate": 6.646009314160173e-05,
"loss": 0.9075,
"mean_token_accuracy": 0.7723639756441116,
"num_tokens": 109356.0,
"step": 127
},
{
"entropy": 1.217780441045761,
"epoch": 2.099585062240664,
"grad_norm": 1.7584712505340576,
"learning_rate": 6.595637623702763e-05,
"loss": 0.8784,
"mean_token_accuracy": 0.7690880298614502,
"num_tokens": 110347.0,
"step": 128
},
{
"entropy": 0.8932879865169525,
"epoch": 2.116182572614108,
"grad_norm": 1.7026498317718506,
"learning_rate": 6.545084971874738e-05,
"loss": 0.6253,
"mean_token_accuracy": 0.8417714536190033,
"num_tokens": 111266.0,
"step": 129
},
{
"entropy": 1.1204040348529816,
"epoch": 2.132780082987552,
"grad_norm": 2.270695447921753,
"learning_rate": 6.494357091855751e-05,
"loss": 0.889,
"mean_token_accuracy": 0.7744732350111008,
"num_tokens": 112096.0,
"step": 130
},
{
"entropy": 0.9187988489866257,
"epoch": 2.1493775933609958,
"grad_norm": 2.6016838550567627,
"learning_rate": 6.443459736698105e-05,
"loss": 0.759,
"mean_token_accuracy": 0.8029564172029495,
"num_tokens": 112866.0,
"step": 131
},
{
"entropy": 1.060081034898758,
"epoch": 2.1659751037344397,
"grad_norm": 3.0870463848114014,
"learning_rate": 6.39239867867428e-05,
"loss": 0.973,
"mean_token_accuracy": 0.7499169707298279,
"num_tokens": 113555.0,
"step": 132
},
{
"entropy": 0.8084948360919952,
"epoch": 2.1825726141078836,
"grad_norm": 3.516533136367798,
"learning_rate": 6.341179708622315e-05,
"loss": 0.7765,
"mean_token_accuracy": 0.7850001603364944,
"num_tokens": 114162.0,
"step": 133
},
{
"entropy": 0.9602021425962448,
"epoch": 2.199170124481328,
"grad_norm": 3.2551493644714355,
"learning_rate": 6.28980863528906e-05,
"loss": 0.7846,
"mean_token_accuracy": 0.8070370852947235,
"num_tokens": 114731.0,
"step": 134
},
{
"entropy": 0.8361001461744308,
"epoch": 2.215767634854772,
"grad_norm": 4.158690929412842,
"learning_rate": 6.23829128467141e-05,
"loss": 0.783,
"mean_token_accuracy": 0.7848098278045654,
"num_tokens": 115260.0,
"step": 135
},
{
"entropy": 0.586012601852417,
"epoch": 2.232365145228216,
"grad_norm": 3.1432180404663086,
"learning_rate": 6.186633499355576e-05,
"loss": 0.401,
"mean_token_accuracy": 0.8802812397480011,
"num_tokens": 115717.0,
"step": 136
},
{
"entropy": 0.7248338460922241,
"epoch": 2.2489626556016598,
"grad_norm": 3.5007729530334473,
"learning_rate": 6.134841137854475e-05,
"loss": 0.5282,
"mean_token_accuracy": 0.8414591550827026,
"num_tokens": 116118.0,
"step": 137
},
{
"entropy": 0.7773696631193161,
"epoch": 2.2655601659751037,
"grad_norm": 1.5687109231948853,
"learning_rate": 6.082920073943328e-05,
"loss": 0.8679,
"mean_token_accuracy": 0.7672423124313354,
"num_tokens": 118032.0,
"step": 138
},
{
"entropy": 0.7244298756122589,
"epoch": 2.2821576763485476,
"grad_norm": 1.6099064350128174,
"learning_rate": 6.030876195993491e-05,
"loss": 0.8375,
"mean_token_accuracy": 0.7733269482851028,
"num_tokens": 119597.0,
"step": 139
},
{
"entropy": 0.737570583820343,
"epoch": 2.2987551867219915,
"grad_norm": 2.3326027393341064,
"learning_rate": 5.97871540630468e-05,
"loss": 0.7659,
"mean_token_accuracy": 0.7851079106330872,
"num_tokens": 120691.0,
"step": 140
},
{
"entropy": 0.7653595954179764,
"epoch": 2.3153526970954355,
"grad_norm": 2.660642623901367,
"learning_rate": 5.9264436204355724e-05,
"loss": 0.7601,
"mean_token_accuracy": 0.7836814522743225,
"num_tokens": 121663.0,
"step": 141
},
{
"entropy": 0.8718907386064529,
"epoch": 2.33195020746888,
"grad_norm": 2.816377878189087,
"learning_rate": 5.874066766532932e-05,
"loss": 0.6845,
"mean_token_accuracy": 0.8144886344671249,
"num_tokens": 122494.0,
"step": 142
},
{
"entropy": 0.8468358963727951,
"epoch": 2.3485477178423237,
"grad_norm": 2.4367387294769287,
"learning_rate": 5.8215907846592977e-05,
"loss": 0.6305,
"mean_token_accuracy": 0.8274233788251877,
"num_tokens": 123285.0,
"step": 143
},
{
"entropy": 0.8580201715230942,
"epoch": 2.3651452282157677,
"grad_norm": 2.3725626468658447,
"learning_rate": 5.769021626119314e-05,
"loss": 0.6027,
"mean_token_accuracy": 0.82393579185009,
"num_tokens": 124055.0,
"step": 144
},
{
"entropy": 1.040640190243721,
"epoch": 2.3817427385892116,
"grad_norm": 2.584585189819336,
"learning_rate": 5.7163652527847987e-05,
"loss": 0.8636,
"mean_token_accuracy": 0.7851257175207138,
"num_tokens": 124789.0,
"step": 145
},
{
"entropy": 0.8957875370979309,
"epoch": 2.3983402489626555,
"grad_norm": 2.5588252544403076,
"learning_rate": 5.6636276364186105e-05,
"loss": 0.6825,
"mean_token_accuracy": 0.802570715546608,
"num_tokens": 125440.0,
"step": 146
},
{
"entropy": 0.8292366862297058,
"epoch": 2.4149377593360994,
"grad_norm": 2.70613169670105,
"learning_rate": 5.610814757997377e-05,
"loss": 0.6489,
"mean_token_accuracy": 0.8280458450317383,
"num_tokens": 126019.0,
"step": 147
},
{
"entropy": 0.8870530277490616,
"epoch": 2.431535269709544,
"grad_norm": 2.6557841300964355,
"learning_rate": 5.557932607033207e-05,
"loss": 0.5701,
"mean_token_accuracy": 0.8425956070423126,
"num_tokens": 126535.0,
"step": 148
},
{
"entropy": 0.9041202813386917,
"epoch": 2.4481327800829877,
"grad_norm": 2.9167532920837402,
"learning_rate": 5.504987180894411e-05,
"loss": 0.6641,
"mean_token_accuracy": 0.8117185682058334,
"num_tokens": 127017.0,
"step": 149
},
{
"entropy": 0.6521150767803192,
"epoch": 2.4647302904564317,
"grad_norm": 2.460925579071045,
"learning_rate": 5.451984484125341e-05,
"loss": 0.4366,
"mean_token_accuracy": 0.8905431628227234,
"num_tokens": 127467.0,
"step": 150
},
{
"entropy": 0.43711117655038834,
"epoch": 2.4813278008298756,
"grad_norm": 2.205427646636963,
"learning_rate": 5.3989305277654156e-05,
"loss": 0.264,
"mean_token_accuracy": 0.9267032593488693,
"num_tokens": 127893.0,
"step": 151
},
{
"entropy": 0.6371852308511734,
"epoch": 2.4979253112033195,
"grad_norm": 2.989675283432007,
"learning_rate": 5.345831328667408e-05,
"loss": 0.4021,
"mean_token_accuracy": 0.8775946348905563,
"num_tokens": 128245.0,
"step": 152
},
{
"entropy": 0.9646222442388535,
"epoch": 2.5145228215767634,
"grad_norm": 2.5618557929992676,
"learning_rate": 5.292692908815069e-05,
"loss": 1.0454,
"mean_token_accuracy": 0.7269141972064972,
"num_tokens": 129738.0,
"step": 153
},
{
"entropy": 1.018859714269638,
"epoch": 2.5311203319502074,
"grad_norm": 2.760653018951416,
"learning_rate": 5.239521294640185e-05,
"loss": 1.1112,
"mean_token_accuracy": 0.719361737370491,
"num_tokens": 131011.0,
"step": 154
},
{
"entropy": 1.0589520335197449,
"epoch": 2.5477178423236513,
"grad_norm": 2.75836181640625,
"learning_rate": 5.1863225163391073e-05,
"loss": 1.1539,
"mean_token_accuracy": 0.716277152299881,
"num_tokens": 132229.0,
"step": 155
},
{
"entropy": 0.8339425623416901,
"epoch": 2.564315352697095,
"grad_norm": 2.1010499000549316,
"learning_rate": 5.133102607188874e-05,
"loss": 0.6909,
"mean_token_accuracy": 0.8211058974266052,
"num_tokens": 133343.0,
"step": 156
},
{
"entropy": 0.7217313796281815,
"epoch": 2.5809128630705396,
"grad_norm": 2.1709694862365723,
"learning_rate": 5.079867602862974e-05,
"loss": 0.7069,
"mean_token_accuracy": 0.8010880500078201,
"num_tokens": 134333.0,
"step": 157
},
{
"entropy": 0.7894525229930878,
"epoch": 2.5975103734439835,
"grad_norm": 3.0637104511260986,
"learning_rate": 5.0266235407468424e-05,
"loss": 0.7065,
"mean_token_accuracy": 0.8259354382753372,
"num_tokens": 135242.0,
"step": 158
},
{
"entropy": 0.8071346133947372,
"epoch": 2.6141078838174274,
"grad_norm": 2.9362282752990723,
"learning_rate": 4.973376459253159e-05,
"loss": 0.7296,
"mean_token_accuracy": 0.7955306619405746,
"num_tokens": 136053.0,
"step": 159
},
{
"entropy": 0.9336775541305542,
"epoch": 2.6307053941908713,
"grad_norm": 3.6798059940338135,
"learning_rate": 4.9201323971370264e-05,
"loss": 0.9182,
"mean_token_accuracy": 0.7530855238437653,
"num_tokens": 136813.0,
"step": 160
},
{
"entropy": 0.8967225700616837,
"epoch": 2.6473029045643153,
"grad_norm": 2.9090402126312256,
"learning_rate": 4.866897392811126e-05,
"loss": 0.7878,
"mean_token_accuracy": 0.7828802466392517,
"num_tokens": 137520.0,
"step": 161
},
{
"entropy": 0.8007341772317886,
"epoch": 2.663900414937759,
"grad_norm": 3.263995885848999,
"learning_rate": 4.8136774836608925e-05,
"loss": 0.6358,
"mean_token_accuracy": 0.8244260102510452,
"num_tokens": 138143.0,
"step": 162
},
{
"entropy": 1.0581243187189102,
"epoch": 2.6804979253112036,
"grad_norm": 2.9952902793884277,
"learning_rate": 4.760478705359816e-05,
"loss": 0.7703,
"mean_token_accuracy": 0.8044403791427612,
"num_tokens": 138716.0,
"step": 163
},
{
"entropy": 0.7207875102758408,
"epoch": 2.6970954356846475,
"grad_norm": 3.037635087966919,
"learning_rate": 4.707307091184931e-05,
"loss": 0.5967,
"mean_token_accuracy": 0.8498925566673279,
"num_tokens": 139255.0,
"step": 164
},
{
"entropy": 0.7493630349636078,
"epoch": 2.7136929460580914,
"grad_norm": 3.4928629398345947,
"learning_rate": 4.654168671332594e-05,
"loss": 0.5708,
"mean_token_accuracy": 0.8602199703454971,
"num_tokens": 139746.0,
"step": 165
},
{
"entropy": 0.6802153587341309,
"epoch": 2.7302904564315353,
"grad_norm": 3.389561176300049,
"learning_rate": 4.601069472234584e-05,
"loss": 0.5583,
"mean_token_accuracy": 0.8634126931428909,
"num_tokens": 140211.0,
"step": 166
},
{
"entropy": 0.5491561889648438,
"epoch": 2.7468879668049793,
"grad_norm": 2.452354907989502,
"learning_rate": 4.54801551587466e-05,
"loss": 0.3749,
"mean_token_accuracy": 0.8924126625061035,
"num_tokens": 140627.0,
"step": 167
},
{
"entropy": 1.082240641117096,
"epoch": 2.763485477178423,
"grad_norm": 1.8373757600784302,
"learning_rate": 4.4950128191055896e-05,
"loss": 1.0634,
"mean_token_accuracy": 0.7363788485527039,
"num_tokens": 142517.0,
"step": 168
},
{
"entropy": 0.9259464293718338,
"epoch": 2.780082987551867,
"grad_norm": 1.4106931686401367,
"learning_rate": 4.4420673929667936e-05,
"loss": 0.8906,
"mean_token_accuracy": 0.7626354992389679,
"num_tokens": 144001.0,
"step": 169
},
{
"entropy": 1.1125036478042603,
"epoch": 2.796680497925311,
"grad_norm": 1.8246486186981201,
"learning_rate": 4.3891852420026225e-05,
"loss": 0.9538,
"mean_token_accuracy": 0.7357250899076462,
"num_tokens": 145324.0,
"step": 170
},
{
"entropy": 1.03811414539814,
"epoch": 2.813278008298755,
"grad_norm": 1.7586928606033325,
"learning_rate": 4.336372363581391e-05,
"loss": 0.9935,
"mean_token_accuracy": 0.7378970831632614,
"num_tokens": 146407.0,
"step": 171
},
{
"entropy": 0.8408836126327515,
"epoch": 2.8298755186721993,
"grad_norm": 2.626432180404663,
"learning_rate": 4.283634747215202e-05,
"loss": 0.7084,
"mean_token_accuracy": 0.7977723926305771,
"num_tokens": 147386.0,
"step": 172
},
{
"entropy": 0.8435258269309998,
"epoch": 2.8464730290456433,
"grad_norm": 2.422319173812866,
"learning_rate": 4.230978373880687e-05,
"loss": 0.6315,
"mean_token_accuracy": 0.8369058072566986,
"num_tokens": 148176.0,
"step": 173
},
{
"entropy": 0.8827187120914459,
"epoch": 2.863070539419087,
"grad_norm": 3.2514476776123047,
"learning_rate": 4.178409215340704e-05,
"loss": 0.751,
"mean_token_accuracy": 0.7934647500514984,
"num_tokens": 148877.0,
"step": 174
},
{
"entropy": 1.1808519065380096,
"epoch": 2.879668049792531,
"grad_norm": 2.987744092941284,
"learning_rate": 4.125933233467069e-05,
"loss": 0.9171,
"mean_token_accuracy": 0.7549975365400314,
"num_tokens": 149538.0,
"step": 175
},
{
"entropy": 0.8594090789556503,
"epoch": 2.896265560165975,
"grad_norm": 2.7726871967315674,
"learning_rate": 4.0735563795644294e-05,
"loss": 0.6315,
"mean_token_accuracy": 0.8250421732664108,
"num_tokens": 150159.0,
"step": 176
},
{
"entropy": 0.8105258494615555,
"epoch": 2.912863070539419,
"grad_norm": 3.127241611480713,
"learning_rate": 4.021284593695321e-05,
"loss": 0.6019,
"mean_token_accuracy": 0.8341681659221649,
"num_tokens": 150754.0,
"step": 177
},
{
"entropy": 0.8403373807668686,
"epoch": 2.9294605809128633,
"grad_norm": 2.7863616943359375,
"learning_rate": 3.969123804006511e-05,
"loss": 0.6372,
"mean_token_accuracy": 0.8413342088460922,
"num_tokens": 151325.0,
"step": 178
},
{
"entropy": 0.7010289281606674,
"epoch": 2.9460580912863072,
"grad_norm": 3.0871100425720215,
"learning_rate": 3.917079926056674e-05,
"loss": 0.5957,
"mean_token_accuracy": 0.8436416238546371,
"num_tokens": 151854.0,
"step": 179
},
{
"entropy": 0.7843320816755295,
"epoch": 2.962655601659751,
"grad_norm": 3.303302764892578,
"learning_rate": 3.8651588621455254e-05,
"loss": 0.6363,
"mean_token_accuracy": 0.8261257261037827,
"num_tokens": 152353.0,
"step": 180
},
{
"entropy": 0.6532695293426514,
"epoch": 2.979253112033195,
"grad_norm": 3.2265734672546387,
"learning_rate": 3.8133665006444255e-05,
"loss": 0.4373,
"mean_token_accuracy": 0.8786792159080505,
"num_tokens": 152799.0,
"step": 181
},
{
"entropy": 0.5146052092313766,
"epoch": 2.995850622406639,
"grad_norm": 2.864121198654175,
"learning_rate": 3.761708715328593e-05,
"loss": 0.3235,
"mean_token_accuracy": 0.919788122177124,
"num_tokens": 153204.0,
"step": 182
},
{
"entropy": 1.0765279531478882,
"epoch": 3.0,
"grad_norm": 4.817622184753418,
"learning_rate": 3.7101913647109414e-05,
"loss": 0.7345,
"mean_token_accuracy": 0.8300970792770386,
"num_tokens": 153411.0,
"step": 183
},
{
"entropy": 0.9053896814584732,
"epoch": 3.016597510373444,
"grad_norm": 1.3523423671722412,
"learning_rate": 3.658820291377686e-05,
"loss": 0.7027,
"mean_token_accuracy": 0.8281210213899612,
"num_tokens": 155308.0,
"step": 184
},
{
"entropy": 0.9245802909135818,
"epoch": 3.033195020746888,
"grad_norm": 1.3620742559432983,
"learning_rate": 3.60760132132572e-05,
"loss": 0.6806,
"mean_token_accuracy": 0.8312702178955078,
"num_tokens": 156736.0,
"step": 185
},
{
"entropy": 1.0520436316728592,
"epoch": 3.0497925311203318,
"grad_norm": 1.862312912940979,
"learning_rate": 3.556540263301896e-05,
"loss": 0.762,
"mean_token_accuracy": 0.8084734082221985,
"num_tokens": 158004.0,
"step": 186
},
{
"entropy": 0.6379094421863556,
"epoch": 3.066390041493776,
"grad_norm": 1.6042191982269287,
"learning_rate": 3.505642908144248e-05,
"loss": 0.3796,
"mean_token_accuracy": 0.9122848212718964,
"num_tokens": 159070.0,
"step": 187
},
{
"entropy": 0.59751757979393,
"epoch": 3.08298755186722,
"grad_norm": 2.215848684310913,
"learning_rate": 3.4549150281252636e-05,
"loss": 0.3516,
"mean_token_accuracy": 0.9034991562366486,
"num_tokens": 159966.0,
"step": 188
},
{
"entropy": 0.6749102771282196,
"epoch": 3.099585062240664,
"grad_norm": 2.7357337474823,
"learning_rate": 3.404362376297237e-05,
"loss": 0.4656,
"mean_token_accuracy": 0.8664576560258865,
"num_tokens": 160775.0,
"step": 189
},
{
"entropy": 0.41622431576251984,
"epoch": 3.116182572614108,
"grad_norm": 2.113668203353882,
"learning_rate": 3.353990685839828e-05,
"loss": 0.2241,
"mean_token_accuracy": 0.9403961449861526,
"num_tokens": 161548.0,
"step": 190
},
{
"entropy": 0.5323886349797249,
"epoch": 3.132780082987552,
"grad_norm": 2.39516019821167,
"learning_rate": 3.303805669409848e-05,
"loss": 0.3055,
"mean_token_accuracy": 0.9162275344133377,
"num_tokens": 162252.0,
"step": 191
},
{
"entropy": 0.5232428386807442,
"epoch": 3.1493775933609958,
"grad_norm": 2.6726315021514893,
"learning_rate": 3.253813018493402e-05,
"loss": 0.3453,
"mean_token_accuracy": 0.9130482524633408,
"num_tokens": 162875.0,
"step": 192
},
{
"entropy": 0.35711124539375305,
"epoch": 3.1659751037344397,
"grad_norm": 2.5041966438293457,
"learning_rate": 3.2040184027604006e-05,
"loss": 0.2254,
"mean_token_accuracy": 0.9327007085084915,
"num_tokens": 163473.0,
"step": 193
},
{
"entropy": 0.2961500436067581,
"epoch": 3.1825726141078836,
"grad_norm": 2.367612600326538,
"learning_rate": 3.15442746942158e-05,
"loss": 0.1943,
"mean_token_accuracy": 0.9548846483230591,
"num_tokens": 164033.0,
"step": 194
},
{
"entropy": 0.3251847103238106,
"epoch": 3.199170124481328,
"grad_norm": 4.243903160095215,
"learning_rate": 3.1050458425880335e-05,
"loss": 0.2207,
"mean_token_accuracy": 0.9388151168823242,
"num_tokens": 164545.0,
"step": 195
},
{
"entropy": 0.2914026416838169,
"epoch": 3.215767634854772,
"grad_norm": 3.594550609588623,
"learning_rate": 3.055879122633397e-05,
"loss": 0.1859,
"mean_token_accuracy": 0.9419218003749847,
"num_tokens": 165031.0,
"step": 196
},
{
"entropy": 0.29661769419908524,
"epoch": 3.232365145228216,
"grad_norm": 2.6744418144226074,
"learning_rate": 3.006932885558697e-05,
"loss": 0.1631,
"mean_token_accuracy": 0.962583601474762,
"num_tokens": 165486.0,
"step": 197
},
{
"entropy": 0.26884079724550247,
"epoch": 3.2489626556016598,
"grad_norm": 3.2280545234680176,
"learning_rate": 2.9582126823599876e-05,
"loss": 0.1741,
"mean_token_accuracy": 0.9312031865119934,
"num_tokens": 165852.0,
"step": 198
},
{
"entropy": 0.5130668357014656,
"epoch": 3.2655601659751037,
"grad_norm": 1.2567466497421265,
"learning_rate": 2.9097240383988e-05,
"loss": 0.5013,
"mean_token_accuracy": 0.8647334575653076,
"num_tokens": 167543.0,
"step": 199
},
{
"entropy": 0.594046100974083,
"epoch": 3.2821576763485476,
"grad_norm": 1.816318154335022,
"learning_rate": 2.8614724527755165e-05,
"loss": 0.5655,
"mean_token_accuracy": 0.8496900200843811,
"num_tokens": 169003.0,
"step": 200
},
{
"entropy": 0.6586759090423584,
"epoch": 3.2987551867219915,
"grad_norm": 3.464672088623047,
"learning_rate": 2.8134633977057235e-05,
"loss": 0.7252,
"mean_token_accuracy": 0.8186280876398087,
"num_tokens": 170336.0,
"step": 201
},
{
"entropy": 0.665482722222805,
"epoch": 3.3153526970954355,
"grad_norm": 2.9167168140411377,
"learning_rate": 2.7657023178995957e-05,
"loss": 0.6155,
"mean_token_accuracy": 0.8501123189926147,
"num_tokens": 171476.0,
"step": 202
},
{
"entropy": 0.37374667823314667,
"epoch": 3.33195020746888,
"grad_norm": 2.652055501937866,
"learning_rate": 2.7181946299444206e-05,
"loss": 0.2669,
"mean_token_accuracy": 0.9233611226081848,
"num_tokens": 172413.0,
"step": 203
},
{
"entropy": 0.4015509784221649,
"epoch": 3.3485477178423237,
"grad_norm": 4.198200702667236,
"learning_rate": 2.6709457216902923e-05,
"loss": 0.3356,
"mean_token_accuracy": 0.8950087577104568,
"num_tokens": 173207.0,
"step": 204
},
{
"entropy": 0.4464033991098404,
"epoch": 3.3651452282157677,
"grad_norm": 3.859204053878784,
"learning_rate": 2.6239609516390885e-05,
"loss": 0.359,
"mean_token_accuracy": 0.9043852537870407,
"num_tokens": 173938.0,
"step": 205
},
{
"entropy": 0.5395098552107811,
"epoch": 3.3817427385892116,
"grad_norm": 3.422429084777832,
"learning_rate": 2.5772456483367497e-05,
"loss": 0.4296,
"mean_token_accuracy": 0.8937343955039978,
"num_tokens": 174608.0,
"step": 206
},
{
"entropy": 0.37649453803896904,
"epoch": 3.3983402489626555,
"grad_norm": 2.677446126937866,
"learning_rate": 2.53080510976898e-05,
"loss": 0.2481,
"mean_token_accuracy": 0.9350832402706146,
"num_tokens": 175197.0,
"step": 207
},
{
"entropy": 0.4082087576389313,
"epoch": 3.4149377593360994,
"grad_norm": 2.799633026123047,
"learning_rate": 2.484644602760389e-05,
"loss": 0.2419,
"mean_token_accuracy": 0.9391117542982101,
"num_tokens": 175740.0,
"step": 208
},
{
"entropy": 0.37681715935468674,
"epoch": 3.431535269709544,
"grad_norm": 2.437453508377075,
"learning_rate": 2.4387693623771957e-05,
"loss": 0.2124,
"mean_token_accuracy": 0.9485742002725601,
"num_tokens": 176250.0,
"step": 209
},
{
"entropy": 0.32512830942869186,
"epoch": 3.4481327800829877,
"grad_norm": 3.021730899810791,
"learning_rate": 2.393184591333507e-05,
"loss": 0.264,
"mean_token_accuracy": 0.940506711602211,
"num_tokens": 176726.0,
"step": 210
},
{
"entropy": 0.2483925148844719,
"epoch": 3.4647302904564317,
"grad_norm": 2.603163957595825,
"learning_rate": 2.347895459401288e-05,
"loss": 0.1347,
"mean_token_accuracy": 0.9562080502510071,
"num_tokens": 177163.0,
"step": 211
},
{
"entropy": 0.23566309362649918,
"epoch": 3.4813278008298756,
"grad_norm": 2.984252452850342,
"learning_rate": 2.3029071028240434e-05,
"loss": 0.1301,
"mean_token_accuracy": 0.9639357030391693,
"num_tokens": 177585.0,
"step": 212
},
{
"entropy": 0.30283595249056816,
"epoch": 3.4979253112033195,
"grad_norm": 2.2506368160247803,
"learning_rate": 2.258224623734333e-05,
"loss": 0.1524,
"mean_token_accuracy": 0.9610457569360733,
"num_tokens": 177961.0,
"step": 213
},
{
"entropy": 0.6629791855812073,
"epoch": 3.5145228215767634,
"grad_norm": 2.0996663570404053,
"learning_rate": 2.2138530895751237e-05,
"loss": 0.6517,
"mean_token_accuracy": 0.8251046538352966,
"num_tokens": 179985.0,
"step": 214
},
{
"entropy": 0.6168433576822281,
"epoch": 3.5311203319502074,
"grad_norm": 2.385413408279419,
"learning_rate": 2.169797532525103e-05,
"loss": 0.5419,
"mean_token_accuracy": 0.8522433340549469,
"num_tokens": 181356.0,
"step": 215
},
{
"entropy": 0.5381506308913231,
"epoch": 3.5477178423236513,
"grad_norm": 1.9651310443878174,
"learning_rate": 2.126062948927966e-05,
"loss": 0.366,
"mean_token_accuracy": 0.9021719694137573,
"num_tokens": 182489.0,
"step": 216
},
{
"entropy": 0.5477860048413277,
"epoch": 3.564315352697095,
"grad_norm": 2.2163186073303223,
"learning_rate": 2.082654298725793e-05,
"loss": 0.4651,
"mean_token_accuracy": 0.8771954923868179,
"num_tokens": 183524.0,
"step": 217
},
{
"entropy": 0.4866204559803009,
"epoch": 3.5809128630705396,
"grad_norm": 2.5803163051605225,
"learning_rate": 2.0395765048965338e-05,
"loss": 0.3798,
"mean_token_accuracy": 0.895937517285347,
"num_tokens": 184507.0,
"step": 218
},
{
"entropy": 0.507550872862339,
"epoch": 3.5975103734439835,
"grad_norm": 2.8360655307769775,
"learning_rate": 1.996834452895695e-05,
"loss": 0.3611,
"mean_token_accuracy": 0.9070864617824554,
"num_tokens": 185458.0,
"step": 219
},
{
"entropy": 0.4657301604747772,
"epoch": 3.6141078838174274,
"grad_norm": 2.194333553314209,
"learning_rate": 1.9544329901022774e-05,
"loss": 0.3005,
"mean_token_accuracy": 0.9226408004760742,
"num_tokens": 186344.0,
"step": 220
},
{
"entropy": 0.3825162798166275,
"epoch": 3.6307053941908713,
"grad_norm": 2.246577739715576,
"learning_rate": 1.912376925269041e-05,
"loss": 0.2462,
"mean_token_accuracy": 0.9420317560434341,
"num_tokens": 187132.0,
"step": 221
},
{
"entropy": 0.5880134254693985,
"epoch": 3.6473029045643153,
"grad_norm": 3.324869394302368,
"learning_rate": 1.8706710279771346e-05,
"loss": 0.4481,
"mean_token_accuracy": 0.8814945220947266,
"num_tokens": 187878.0,
"step": 222
},
{
"entropy": 0.46588296443223953,
"epoch": 3.663900414937759,
"grad_norm": 2.560573101043701,
"learning_rate": 1.8293200280951884e-05,
"loss": 0.2962,
"mean_token_accuracy": 0.9168391972780228,
"num_tokens": 188568.0,
"step": 223
},
{
"entropy": 0.4065393805503845,
"epoch": 3.6804979253112036,
"grad_norm": 2.7935709953308105,
"learning_rate": 1.7883286152428875e-05,
"loss": 0.2726,
"mean_token_accuracy": 0.9170111566781998,
"num_tokens": 189187.0,
"step": 224
},
{
"entropy": 0.4957837387919426,
"epoch": 3.6970954356846475,
"grad_norm": 2.5674972534179688,
"learning_rate": 1.747701438259132e-05,
"loss": 0.2918,
"mean_token_accuracy": 0.9252507090568542,
"num_tokens": 189768.0,
"step": 225
},
{
"entropy": 0.35758352652192116,
"epoch": 3.7136929460580914,
"grad_norm": 2.453906297683716,
"learning_rate": 1.7074431046748075e-05,
"loss": 0.2568,
"mean_token_accuracy": 0.9271868020296097,
"num_tokens": 190321.0,
"step": 226
},
{
"entropy": 0.2736184000968933,
"epoch": 3.7302904564315353,
"grad_norm": 2.352849006652832,
"learning_rate": 1.6675581801902406e-05,
"loss": 0.1523,
"mean_token_accuracy": 0.9644663035869598,
"num_tokens": 190802.0,
"step": 227
},
{
"entropy": 0.2299768067896366,
"epoch": 3.7468879668049793,
"grad_norm": 1.9265366792678833,
"learning_rate": 1.6280511881574122e-05,
"loss": 0.1308,
"mean_token_accuracy": 0.9701746851205826,
"num_tokens": 191209.0,
"step": 228
},
{
"entropy": 0.7222119271755219,
"epoch": 3.763485477178423,
"grad_norm": 2.0140905380249023,
"learning_rate": 1.5889266090669525e-05,
"loss": 0.7162,
"mean_token_accuracy": 0.8162243366241455,
"num_tokens": 192992.0,
"step": 229
},
{
"entropy": 0.7263834774494171,
"epoch": 3.780082987551867,
"grad_norm": 2.6647584438323975,
"learning_rate": 1.5501888800400204e-05,
"loss": 0.6636,
"mean_token_accuracy": 0.8170496225357056,
"num_tokens": 194413.0,
"step": 230
},
{
"entropy": 0.8200473785400391,
"epoch": 3.796680497925311,
"grad_norm": 2.6536271572113037,
"learning_rate": 1.5118423943250771e-05,
"loss": 0.7257,
"mean_token_accuracy": 0.802078515291214,
"num_tokens": 195678.0,
"step": 231
},
{
"entropy": 0.7650105357170105,
"epoch": 3.813278008298755,
"grad_norm": 2.270249366760254,
"learning_rate": 1.4738915007996574e-05,
"loss": 0.592,
"mean_token_accuracy": 0.8492171764373779,
"num_tokens": 196880.0,
"step": 232
},
{
"entropy": 0.540265865623951,
"epoch": 3.8298755186721993,
"grad_norm": 1.7297815084457397,
"learning_rate": 1.4363405034771576e-05,
"loss": 0.3759,
"mean_token_accuracy": 0.8878219872713089,
"num_tokens": 197920.0,
"step": 233
},
{
"entropy": 0.3863483667373657,
"epoch": 3.8464730290456433,
"grad_norm": 1.8610775470733643,
"learning_rate": 1.3991936610187206e-05,
"loss": 0.2328,
"mean_token_accuracy": 0.9479210078716278,
"num_tokens": 198865.0,
"step": 234
},
{
"entropy": 0.5110977366566658,
"epoch": 3.863070539419087,
"grad_norm": 2.869537830352783,
"learning_rate": 1.3624551862502538e-05,
"loss": 0.2829,
"mean_token_accuracy": 0.9214334934949875,
"num_tokens": 199683.0,
"step": 235
},
{
"entropy": 0.48182512819767,
"epoch": 3.879668049792531,
"grad_norm": 2.910742998123169,
"learning_rate": 1.3261292456846647e-05,
"loss": 0.3121,
"mean_token_accuracy": 0.9146182835102081,
"num_tokens": 200457.0,
"step": 236
},
{
"entropy": 0.4533498287200928,
"epoch": 3.896265560165975,
"grad_norm": 2.7093067169189453,
"learning_rate": 1.2902199590493202e-05,
"loss": 0.3048,
"mean_token_accuracy": 0.9243493974208832,
"num_tokens": 201164.0,
"step": 237
},
{
"entropy": 0.495280422270298,
"epoch": 3.912863070539419,
"grad_norm": 2.5722432136535645,
"learning_rate": 1.2547313988188469e-05,
"loss": 0.2904,
"mean_token_accuracy": 0.925273984670639,
"num_tokens": 201810.0,
"step": 238
},
{
"entropy": 0.36999866366386414,
"epoch": 3.9294605809128633,
"grad_norm": 2.4200632572174072,
"learning_rate": 1.219667589753251e-05,
"loss": 0.2429,
"mean_token_accuracy": 0.9331159144639969,
"num_tokens": 202407.0,
"step": 239
},
{
"entropy": 0.5503775253891945,
"epoch": 3.9460580912863072,
"grad_norm": 3.256476879119873,
"learning_rate": 1.1850325084414882e-05,
"loss": 0.3254,
"mean_token_accuracy": 0.9104706943035126,
"num_tokens": 202959.0,
"step": 240
},
{
"entropy": 0.3866705000400543,
"epoch": 3.962655601659751,
"grad_norm": 2.4496092796325684,
"learning_rate": 1.150830082850468e-05,
"loss": 0.2445,
"mean_token_accuracy": 0.9439631849527359,
"num_tokens": 203462.0,
"step": 241
},
{
"entropy": 0.2839464247226715,
"epoch": 3.979253112033195,
"grad_norm": 3.231337308883667,
"learning_rate": 1.117064191879587e-05,
"loss": 0.1669,
"mean_token_accuracy": 0.958666130900383,
"num_tokens": 203925.0,
"step": 242
},
{
"entropy": 0.2561277598142624,
"epoch": 3.995850622406639,
"grad_norm": 1.902478814125061,
"learning_rate": 1.0837386649208164e-05,
"loss": 0.1274,
"mean_token_accuracy": 0.9695109724998474,
"num_tokens": 204355.0,
"step": 243
},
{
"entropy": 0.40932202339172363,
"epoch": 4.0,
"grad_norm": 4.405113220214844,
"learning_rate": 1.0508572814244205e-05,
"loss": 0.1994,
"mean_token_accuracy": 0.921875,
"num_tokens": 204548.0,
"step": 244
}
],
"logging_steps": 1,
"max_steps": 305,
"num_input_tokens_seen": 0,
"num_train_epochs": 5,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 9317517084426240.0,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}