2475 lines
71 KiB
JSON
2475 lines
71 KiB
JSON
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 4.0,
|
|
"eval_steps": 500,
|
|
"global_step": 244,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"entropy": 1.566802203655243,
|
|
"epoch": 0.016597510373443983,
|
|
"grad_norm": 1.3679256439208984,
|
|
"learning_rate": 0.0,
|
|
"loss": 2.4676,
|
|
"mean_token_accuracy": 0.5079668760299683,
|
|
"num_tokens": 1961.0,
|
|
"step": 1
|
|
},
|
|
{
|
|
"entropy": 1.2824033498764038,
|
|
"epoch": 0.03319502074688797,
|
|
"grad_norm": 1.463968276977539,
|
|
"learning_rate": 1e-05,
|
|
"loss": 2.1502,
|
|
"mean_token_accuracy": 0.5586550310254097,
|
|
"num_tokens": 3454.0,
|
|
"step": 2
|
|
},
|
|
{
|
|
"entropy": 1.3592263162136078,
|
|
"epoch": 0.04979253112033195,
|
|
"grad_norm": 2.2606022357940674,
|
|
"learning_rate": 2e-05,
|
|
"loss": 2.4176,
|
|
"mean_token_accuracy": 0.5216769725084305,
|
|
"num_tokens": 4824.0,
|
|
"step": 3
|
|
},
|
|
{
|
|
"entropy": 1.7233753502368927,
|
|
"epoch": 0.06639004149377593,
|
|
"grad_norm": 1.7701078653335571,
|
|
"learning_rate": 3e-05,
|
|
"loss": 2.8426,
|
|
"mean_token_accuracy": 0.48796989023685455,
|
|
"num_tokens": 6081.0,
|
|
"step": 4
|
|
},
|
|
{
|
|
"entropy": 1.4910274147987366,
|
|
"epoch": 0.08298755186721991,
|
|
"grad_norm": 1.786622166633606,
|
|
"learning_rate": 4e-05,
|
|
"loss": 2.2084,
|
|
"mean_token_accuracy": 0.5306425094604492,
|
|
"num_tokens": 7103.0,
|
|
"step": 5
|
|
},
|
|
{
|
|
"entropy": 1.800081729888916,
|
|
"epoch": 0.0995850622406639,
|
|
"grad_norm": 1.775471568107605,
|
|
"learning_rate": 5e-05,
|
|
"loss": 2.5362,
|
|
"mean_token_accuracy": 0.5084067285060883,
|
|
"num_tokens": 8031.0,
|
|
"step": 6
|
|
},
|
|
{
|
|
"entropy": 2.3219287991523743,
|
|
"epoch": 0.11618257261410789,
|
|
"grad_norm": 2.0937862396240234,
|
|
"learning_rate": 6e-05,
|
|
"loss": 2.8304,
|
|
"mean_token_accuracy": 0.448772631585598,
|
|
"num_tokens": 8843.0,
|
|
"step": 7
|
|
},
|
|
{
|
|
"entropy": 2.229207932949066,
|
|
"epoch": 0.13278008298755187,
|
|
"grad_norm": 1.9861464500427246,
|
|
"learning_rate": 7e-05,
|
|
"loss": 2.6814,
|
|
"mean_token_accuracy": 0.47942136973142624,
|
|
"num_tokens": 9594.0,
|
|
"step": 8
|
|
},
|
|
{
|
|
"entropy": 2.354415476322174,
|
|
"epoch": 0.14937759336099585,
|
|
"grad_norm": 1.8094334602355957,
|
|
"learning_rate": 8e-05,
|
|
"loss": 2.8711,
|
|
"mean_token_accuracy": 0.45240335911512375,
|
|
"num_tokens": 10288.0,
|
|
"step": 9
|
|
},
|
|
{
|
|
"entropy": 2.459421217441559,
|
|
"epoch": 0.16597510373443983,
|
|
"grad_norm": 1.8258342742919922,
|
|
"learning_rate": 9e-05,
|
|
"loss": 2.9021,
|
|
"mean_token_accuracy": 0.449099138379097,
|
|
"num_tokens": 10929.0,
|
|
"step": 10
|
|
},
|
|
{
|
|
"entropy": 2.621789336204529,
|
|
"epoch": 0.1825726141078838,
|
|
"grad_norm": 2.7300946712493896,
|
|
"learning_rate": 0.0001,
|
|
"loss": 2.547,
|
|
"mean_token_accuracy": 0.4819970279932022,
|
|
"num_tokens": 11539.0,
|
|
"step": 11
|
|
},
|
|
{
|
|
"entropy": 2.7384027242660522,
|
|
"epoch": 0.1991701244813278,
|
|
"grad_norm": 2.9457969665527344,
|
|
"learning_rate": 9.999716474831242e-05,
|
|
"loss": 2.8466,
|
|
"mean_token_accuracy": 0.4608563259243965,
|
|
"num_tokens": 12091.0,
|
|
"step": 12
|
|
},
|
|
{
|
|
"entropy": 2.989166796207428,
|
|
"epoch": 0.2157676348547718,
|
|
"grad_norm": 2.0658581256866455,
|
|
"learning_rate": 9.99886593147957e-05,
|
|
"loss": 2.5596,
|
|
"mean_token_accuracy": 0.514740876853466,
|
|
"num_tokens": 12587.0,
|
|
"step": 13
|
|
},
|
|
{
|
|
"entropy": 2.997403562068939,
|
|
"epoch": 0.23236514522821577,
|
|
"grad_norm": 3.369170665740967,
|
|
"learning_rate": 9.997448466405169e-05,
|
|
"loss": 2.4039,
|
|
"mean_token_accuracy": 0.5438374727964401,
|
|
"num_tokens": 13042.0,
|
|
"step": 14
|
|
},
|
|
{
|
|
"entropy": 2.7351107001304626,
|
|
"epoch": 0.24896265560165975,
|
|
"grad_norm": 1.9540605545043945,
|
|
"learning_rate": 9.995464240362846e-05,
|
|
"loss": 2.0586,
|
|
"mean_token_accuracy": 0.5540800094604492,
|
|
"num_tokens": 13445.0,
|
|
"step": 15
|
|
},
|
|
{
|
|
"entropy": 1.8458695709705353,
|
|
"epoch": 0.26556016597510373,
|
|
"grad_norm": 0.9754659533500671,
|
|
"learning_rate": 9.99291347838381e-05,
|
|
"loss": 1.7562,
|
|
"mean_token_accuracy": 0.5864828526973724,
|
|
"num_tokens": 15087.0,
|
|
"step": 16
|
|
},
|
|
{
|
|
"entropy": 2.200885534286499,
|
|
"epoch": 0.2821576763485477,
|
|
"grad_norm": 1.13197922706604,
|
|
"learning_rate": 9.98979646975015e-05,
|
|
"loss": 2.238,
|
|
"mean_token_accuracy": 0.5022777020931244,
|
|
"num_tokens": 16333.0,
|
|
"step": 17
|
|
},
|
|
{
|
|
"entropy": 2.252615600824356,
|
|
"epoch": 0.2987551867219917,
|
|
"grad_norm": 1.2078205347061157,
|
|
"learning_rate": 9.986113567962026e-05,
|
|
"loss": 2.1967,
|
|
"mean_token_accuracy": 0.5359554067254066,
|
|
"num_tokens": 17389.0,
|
|
"step": 18
|
|
},
|
|
{
|
|
"entropy": 2.179795980453491,
|
|
"epoch": 0.3153526970954357,
|
|
"grad_norm": 1.3316738605499268,
|
|
"learning_rate": 9.981865190697577e-05,
|
|
"loss": 1.8956,
|
|
"mean_token_accuracy": 0.5649193078279495,
|
|
"num_tokens": 18350.0,
|
|
"step": 19
|
|
},
|
|
{
|
|
"entropy": 2.2198538780212402,
|
|
"epoch": 0.33195020746887965,
|
|
"grad_norm": 1.3263436555862427,
|
|
"learning_rate": 9.977051819765558e-05,
|
|
"loss": 2.0364,
|
|
"mean_token_accuracy": 0.5675807893276215,
|
|
"num_tokens": 19156.0,
|
|
"step": 20
|
|
},
|
|
{
|
|
"entropy": 2.2128241062164307,
|
|
"epoch": 0.34854771784232363,
|
|
"grad_norm": 1.708030343055725,
|
|
"learning_rate": 9.971674001050686e-05,
|
|
"loss": 2.1029,
|
|
"mean_token_accuracy": 0.5378818288445473,
|
|
"num_tokens": 19911.0,
|
|
"step": 21
|
|
},
|
|
{
|
|
"entropy": 2.033743917942047,
|
|
"epoch": 0.3651452282157676,
|
|
"grad_norm": 2.0581839084625244,
|
|
"learning_rate": 9.96573234445175e-05,
|
|
"loss": 1.9337,
|
|
"mean_token_accuracy": 0.5821050256490707,
|
|
"num_tokens": 20519.0,
|
|
"step": 22
|
|
},
|
|
{
|
|
"entropy": 2.1534159779548645,
|
|
"epoch": 0.3817427385892116,
|
|
"grad_norm": 2.190251350402832,
|
|
"learning_rate": 9.959227523812423e-05,
|
|
"loss": 2.0707,
|
|
"mean_token_accuracy": 0.5588077083230019,
|
|
"num_tokens": 21097.0,
|
|
"step": 23
|
|
},
|
|
{
|
|
"entropy": 2.0276338160037994,
|
|
"epoch": 0.3983402489626556,
|
|
"grad_norm": 2.0907859802246094,
|
|
"learning_rate": 9.952160276844856e-05,
|
|
"loss": 2.0956,
|
|
"mean_token_accuracy": 0.5710751935839653,
|
|
"num_tokens": 21647.0,
|
|
"step": 24
|
|
},
|
|
{
|
|
"entropy": 1.8905757069587708,
|
|
"epoch": 0.4149377593360996,
|
|
"grad_norm": 2.121419668197632,
|
|
"learning_rate": 9.944531405046e-05,
|
|
"loss": 1.759,
|
|
"mean_token_accuracy": 0.617972806096077,
|
|
"num_tokens": 22177.0,
|
|
"step": 25
|
|
},
|
|
{
|
|
"entropy": 2.027945041656494,
|
|
"epoch": 0.4315352697095436,
|
|
"grad_norm": 2.8114781379699707,
|
|
"learning_rate": 9.936341773606723e-05,
|
|
"loss": 2.0327,
|
|
"mean_token_accuracy": 0.5869216322898865,
|
|
"num_tokens": 22687.0,
|
|
"step": 26
|
|
},
|
|
{
|
|
"entropy": 1.8629156649112701,
|
|
"epoch": 0.44813278008298757,
|
|
"grad_norm": 2.1601951122283936,
|
|
"learning_rate": 9.927592311313681e-05,
|
|
"loss": 1.7504,
|
|
"mean_token_accuracy": 0.6231366544961929,
|
|
"num_tokens": 23156.0,
|
|
"step": 27
|
|
},
|
|
{
|
|
"entropy": 1.8361365795135498,
|
|
"epoch": 0.46473029045643155,
|
|
"grad_norm": 2.6555299758911133,
|
|
"learning_rate": 9.918284010443982e-05,
|
|
"loss": 1.6233,
|
|
"mean_token_accuracy": 0.6478128284215927,
|
|
"num_tokens": 23600.0,
|
|
"step": 28
|
|
},
|
|
{
|
|
"entropy": 1.6647760570049286,
|
|
"epoch": 0.48132780082987553,
|
|
"grad_norm": 2.550370216369629,
|
|
"learning_rate": 9.908417926652654e-05,
|
|
"loss": 1.4416,
|
|
"mean_token_accuracy": 0.6589087396860123,
|
|
"num_tokens": 24029.0,
|
|
"step": 29
|
|
},
|
|
{
|
|
"entropy": 1.5259109735488892,
|
|
"epoch": 0.4979253112033195,
|
|
"grad_norm": 2.0502336025238037,
|
|
"learning_rate": 9.897995178852927e-05,
|
|
"loss": 1.3379,
|
|
"mean_token_accuracy": 0.6946790963411331,
|
|
"num_tokens": 24437.0,
|
|
"step": 30
|
|
},
|
|
{
|
|
"entropy": 1.5604857802391052,
|
|
"epoch": 0.5145228215767634,
|
|
"grad_norm": 1.2742985486984253,
|
|
"learning_rate": 9.887016949089333e-05,
|
|
"loss": 1.7725,
|
|
"mean_token_accuracy": 0.593292236328125,
|
|
"num_tokens": 26460.0,
|
|
"step": 31
|
|
},
|
|
{
|
|
"entropy": 1.5407554507255554,
|
|
"epoch": 0.5311203319502075,
|
|
"grad_norm": 1.4528374671936035,
|
|
"learning_rate": 9.875484482403652e-05,
|
|
"loss": 1.8915,
|
|
"mean_token_accuracy": 0.5747921615839005,
|
|
"num_tokens": 27910.0,
|
|
"step": 32
|
|
},
|
|
{
|
|
"entropy": 1.843079686164856,
|
|
"epoch": 0.5477178423236515,
|
|
"grad_norm": 1.6220325231552124,
|
|
"learning_rate": 9.863399086693707e-05,
|
|
"loss": 2.2955,
|
|
"mean_token_accuracy": 0.4998007267713547,
|
|
"num_tokens": 29164.0,
|
|
"step": 33
|
|
},
|
|
{
|
|
"entropy": 1.484895646572113,
|
|
"epoch": 0.5643153526970954,
|
|
"grad_norm": 1.3753522634506226,
|
|
"learning_rate": 9.850762132565043e-05,
|
|
"loss": 1.6426,
|
|
"mean_token_accuracy": 0.5886935442686081,
|
|
"num_tokens": 30278.0,
|
|
"step": 34
|
|
},
|
|
{
|
|
"entropy": 1.604092001914978,
|
|
"epoch": 0.5809128630705395,
|
|
"grad_norm": 1.3964170217514038,
|
|
"learning_rate": 9.837575053175478e-05,
|
|
"loss": 1.5824,
|
|
"mean_token_accuracy": 0.6277549713850021,
|
|
"num_tokens": 31290.0,
|
|
"step": 35
|
|
},
|
|
{
|
|
"entropy": 2.1299741566181183,
|
|
"epoch": 0.5975103734439834,
|
|
"grad_norm": 1.5933111906051636,
|
|
"learning_rate": 9.82383934407258e-05,
|
|
"loss": 1.8627,
|
|
"mean_token_accuracy": 0.596154659986496,
|
|
"num_tokens": 32215.0,
|
|
"step": 36
|
|
},
|
|
{
|
|
"entropy": 2.1440194249153137,
|
|
"epoch": 0.6141078838174274,
|
|
"grad_norm": 1.6666224002838135,
|
|
"learning_rate": 9.809556563024043e-05,
|
|
"loss": 2.0242,
|
|
"mean_token_accuracy": 0.5532266497612,
|
|
"num_tokens": 33041.0,
|
|
"step": 37
|
|
},
|
|
{
|
|
"entropy": 2.121056705713272,
|
|
"epoch": 0.6307053941908713,
|
|
"grad_norm": 1.6291508674621582,
|
|
"learning_rate": 9.794728329841029e-05,
|
|
"loss": 1.9948,
|
|
"mean_token_accuracy": 0.5666538178920746,
|
|
"num_tokens": 33809.0,
|
|
"step": 38
|
|
},
|
|
{
|
|
"entropy": 2.1626654863357544,
|
|
"epoch": 0.6473029045643154,
|
|
"grad_norm": 2.0946688652038574,
|
|
"learning_rate": 9.779356326194466e-05,
|
|
"loss": 1.9707,
|
|
"mean_token_accuracy": 0.5822897553443909,
|
|
"num_tokens": 34512.0,
|
|
"step": 39
|
|
},
|
|
{
|
|
"entropy": 2.2058463096618652,
|
|
"epoch": 0.6639004149377593,
|
|
"grad_norm": 1.9641155004501343,
|
|
"learning_rate": 9.763442295424324e-05,
|
|
"loss": 2.1697,
|
|
"mean_token_accuracy": 0.543702982366085,
|
|
"num_tokens": 35159.0,
|
|
"step": 40
|
|
},
|
|
{
|
|
"entropy": 2.021761655807495,
|
|
"epoch": 0.6804979253112033,
|
|
"grad_norm": 1.7235463857650757,
|
|
"learning_rate": 9.746988042341906e-05,
|
|
"loss": 1.8144,
|
|
"mean_token_accuracy": 0.593925267457962,
|
|
"num_tokens": 35759.0,
|
|
"step": 41
|
|
},
|
|
{
|
|
"entropy": 2.2844014763832092,
|
|
"epoch": 0.6970954356846473,
|
|
"grad_norm": 3.0794079303741455,
|
|
"learning_rate": 9.729995433025168e-05,
|
|
"loss": 2.2448,
|
|
"mean_token_accuracy": 0.5087096095085144,
|
|
"num_tokens": 36332.0,
|
|
"step": 42
|
|
},
|
|
{
|
|
"entropy": 1.8179744482040405,
|
|
"epoch": 0.7136929460580913,
|
|
"grad_norm": 1.9659714698791504,
|
|
"learning_rate": 9.712466394607078e-05,
|
|
"loss": 1.6948,
|
|
"mean_token_accuracy": 0.6249574422836304,
|
|
"num_tokens": 36861.0,
|
|
"step": 43
|
|
},
|
|
{
|
|
"entropy": 2.061110645532608,
|
|
"epoch": 0.7302904564315352,
|
|
"grad_norm": 2.4043686389923096,
|
|
"learning_rate": 9.694402915057066e-05,
|
|
"loss": 1.8942,
|
|
"mean_token_accuracy": 0.5952516570687294,
|
|
"num_tokens": 37339.0,
|
|
"step": 44
|
|
},
|
|
{
|
|
"entropy": 1.827080100774765,
|
|
"epoch": 0.7468879668049793,
|
|
"grad_norm": 2.456507682800293,
|
|
"learning_rate": 9.675807042955569e-05,
|
|
"loss": 1.6236,
|
|
"mean_token_accuracy": 0.6085141599178314,
|
|
"num_tokens": 37756.0,
|
|
"step": 45
|
|
},
|
|
{
|
|
"entropy": 1.4766492545604706,
|
|
"epoch": 0.7634854771784232,
|
|
"grad_norm": 1.0035699605941772,
|
|
"learning_rate": 9.656680887261693e-05,
|
|
"loss": 1.557,
|
|
"mean_token_accuracy": 0.617707371711731,
|
|
"num_tokens": 39461.0,
|
|
"step": 46
|
|
},
|
|
{
|
|
"entropy": 1.7303943932056427,
|
|
"epoch": 0.7800829875518672,
|
|
"grad_norm": 1.0027786493301392,
|
|
"learning_rate": 9.637026617074049e-05,
|
|
"loss": 1.8817,
|
|
"mean_token_accuracy": 0.5656901001930237,
|
|
"num_tokens": 40932.0,
|
|
"step": 47
|
|
},
|
|
{
|
|
"entropy": 1.9746614396572113,
|
|
"epoch": 0.7966804979253111,
|
|
"grad_norm": 1.2286392450332642,
|
|
"learning_rate": 9.616846461384748e-05,
|
|
"loss": 2.1291,
|
|
"mean_token_accuracy": 0.5213609486818314,
|
|
"num_tokens": 42218.0,
|
|
"step": 48
|
|
},
|
|
{
|
|
"entropy": 1.9062314629554749,
|
|
"epoch": 0.8132780082987552,
|
|
"grad_norm": 1.0907331705093384,
|
|
"learning_rate": 9.596142708826604e-05,
|
|
"loss": 1.9615,
|
|
"mean_token_accuracy": 0.5589454174041748,
|
|
"num_tokens": 43380.0,
|
|
"step": 49
|
|
},
|
|
{
|
|
"entropy": 1.9102767407894135,
|
|
"epoch": 0.8298755186721992,
|
|
"grad_norm": 1.5399329662322998,
|
|
"learning_rate": 9.574917707413596e-05,
|
|
"loss": 1.793,
|
|
"mean_token_accuracy": 0.598997175693512,
|
|
"num_tokens": 44400.0,
|
|
"step": 50
|
|
},
|
|
{
|
|
"entropy": 1.7084259390830994,
|
|
"epoch": 0.8464730290456431,
|
|
"grad_norm": 1.331813097000122,
|
|
"learning_rate": 9.553173864274567e-05,
|
|
"loss": 1.712,
|
|
"mean_token_accuracy": 0.6038506329059601,
|
|
"num_tokens": 45335.0,
|
|
"step": 51
|
|
},
|
|
{
|
|
"entropy": 1.8911837935447693,
|
|
"epoch": 0.8630705394190872,
|
|
"grad_norm": 2.002470016479492,
|
|
"learning_rate": 9.530913645380232e-05,
|
|
"loss": 1.9683,
|
|
"mean_token_accuracy": 0.5909984111785889,
|
|
"num_tokens": 46180.0,
|
|
"step": 52
|
|
},
|
|
{
|
|
"entropy": 1.63745978474617,
|
|
"epoch": 0.8796680497925311,
|
|
"grad_norm": 1.4724863767623901,
|
|
"learning_rate": 9.508139575263522e-05,
|
|
"loss": 1.4999,
|
|
"mean_token_accuracy": 0.6617157012224197,
|
|
"num_tokens": 46970.0,
|
|
"step": 53
|
|
},
|
|
{
|
|
"entropy": 1.898155838251114,
|
|
"epoch": 0.8962655601659751,
|
|
"grad_norm": 1.8770923614501953,
|
|
"learning_rate": 9.484854236733264e-05,
|
|
"loss": 1.6905,
|
|
"mean_token_accuracy": 0.6523770242929459,
|
|
"num_tokens": 47725.0,
|
|
"step": 54
|
|
},
|
|
{
|
|
"entropy": 1.92723348736763,
|
|
"epoch": 0.9128630705394191,
|
|
"grad_norm": 2.107532262802124,
|
|
"learning_rate": 9.461060270581275e-05,
|
|
"loss": 1.9513,
|
|
"mean_token_accuracy": 0.579139918088913,
|
|
"num_tokens": 48437.0,
|
|
"step": 55
|
|
},
|
|
{
|
|
"entropy": 1.9208797216415405,
|
|
"epoch": 0.9294605809128631,
|
|
"grad_norm": 2.1801645755767822,
|
|
"learning_rate": 9.436760375282859e-05,
|
|
"loss": 1.9292,
|
|
"mean_token_accuracy": 0.5749614462256432,
|
|
"num_tokens": 49077.0,
|
|
"step": 56
|
|
},
|
|
{
|
|
"entropy": 1.9385250508785248,
|
|
"epoch": 0.946058091286307,
|
|
"grad_norm": 1.8006877899169922,
|
|
"learning_rate": 9.411957306690784e-05,
|
|
"loss": 1.8412,
|
|
"mean_token_accuracy": 0.595048114657402,
|
|
"num_tokens": 49654.0,
|
|
"step": 57
|
|
},
|
|
{
|
|
"entropy": 2.0152436792850494,
|
|
"epoch": 0.9626556016597511,
|
|
"grad_norm": 2.4321160316467285,
|
|
"learning_rate": 9.386653877722733e-05,
|
|
"loss": 2.2427,
|
|
"mean_token_accuracy": 0.5564496889710426,
|
|
"num_tokens": 50150.0,
|
|
"step": 58
|
|
},
|
|
{
|
|
"entropy": 1.6884909868240356,
|
|
"epoch": 0.979253112033195,
|
|
"grad_norm": 2.018585443496704,
|
|
"learning_rate": 9.360852958042295e-05,
|
|
"loss": 1.6405,
|
|
"mean_token_accuracy": 0.6549917608499527,
|
|
"num_tokens": 50606.0,
|
|
"step": 59
|
|
},
|
|
{
|
|
"entropy": 1.976477712392807,
|
|
"epoch": 0.995850622406639,
|
|
"grad_norm": 2.2471210956573486,
|
|
"learning_rate": 9.334557473733511e-05,
|
|
"loss": 2.0322,
|
|
"mean_token_accuracy": 0.5780311971902847,
|
|
"num_tokens": 50948.0,
|
|
"step": 60
|
|
},
|
|
{
|
|
"entropy": 1.2080161571502686,
|
|
"epoch": 1.0,
|
|
"grad_norm": 2.225203037261963,
|
|
"learning_rate": 9.30777040696903e-05,
|
|
"loss": 1.1001,
|
|
"mean_token_accuracy": 0.6170212626457214,
|
|
"num_tokens": 51137.0,
|
|
"step": 61
|
|
},
|
|
{
|
|
"entropy": 1.451114296913147,
|
|
"epoch": 1.016597510373444,
|
|
"grad_norm": 0.8033313155174255,
|
|
"learning_rate": 9.280494795671906e-05,
|
|
"loss": 1.4178,
|
|
"mean_token_accuracy": 0.6653263568878174,
|
|
"num_tokens": 53010.0,
|
|
"step": 62
|
|
},
|
|
{
|
|
"entropy": 1.8700011372566223,
|
|
"epoch": 1.033195020746888,
|
|
"grad_norm": 0.8774217963218689,
|
|
"learning_rate": 9.252733733171056e-05,
|
|
"loss": 1.7435,
|
|
"mean_token_accuracy": 0.5836772620677948,
|
|
"num_tokens": 54426.0,
|
|
"step": 63
|
|
},
|
|
{
|
|
"entropy": 2.0100578665733337,
|
|
"epoch": 1.049792531120332,
|
|
"grad_norm": 0.9584742188453674,
|
|
"learning_rate": 9.22449036785045e-05,
|
|
"loss": 1.955,
|
|
"mean_token_accuracy": 0.5431181490421295,
|
|
"num_tokens": 55685.0,
|
|
"step": 64
|
|
},
|
|
{
|
|
"entropy": 1.649256706237793,
|
|
"epoch": 1.066390041493776,
|
|
"grad_norm": 1.0113857984542847,
|
|
"learning_rate": 9.195767902792053e-05,
|
|
"loss": 1.4397,
|
|
"mean_token_accuracy": 0.6426748633384705,
|
|
"num_tokens": 56742.0,
|
|
"step": 65
|
|
},
|
|
{
|
|
"entropy": 1.596836507320404,
|
|
"epoch": 1.0829875518672198,
|
|
"grad_norm": 1.5263484716415405,
|
|
"learning_rate": 9.166569595412575e-05,
|
|
"loss": 1.4071,
|
|
"mean_token_accuracy": 0.6563769578933716,
|
|
"num_tokens": 57705.0,
|
|
"step": 66
|
|
},
|
|
{
|
|
"entropy": 1.4731523096561432,
|
|
"epoch": 1.099585062240664,
|
|
"grad_norm": 1.6699166297912598,
|
|
"learning_rate": 9.136898757094021e-05,
|
|
"loss": 1.2226,
|
|
"mean_token_accuracy": 0.6934443712234497,
|
|
"num_tokens": 58594.0,
|
|
"step": 67
|
|
},
|
|
{
|
|
"entropy": 1.564688891172409,
|
|
"epoch": 1.116182572614108,
|
|
"grad_norm": 1.757997989654541,
|
|
"learning_rate": 9.106758752808169e-05,
|
|
"loss": 1.1737,
|
|
"mean_token_accuracy": 0.7244593054056168,
|
|
"num_tokens": 59373.0,
|
|
"step": 68
|
|
},
|
|
{
|
|
"entropy": 1.6936156153678894,
|
|
"epoch": 1.1327800829875518,
|
|
"grad_norm": 2.0028507709503174,
|
|
"learning_rate": 9.076153000734938e-05,
|
|
"loss": 1.5669,
|
|
"mean_token_accuracy": 0.6568387001752853,
|
|
"num_tokens": 60094.0,
|
|
"step": 69
|
|
},
|
|
{
|
|
"entropy": 1.8307518661022186,
|
|
"epoch": 1.1493775933609958,
|
|
"grad_norm": 1.9967020750045776,
|
|
"learning_rate": 9.045084971874738e-05,
|
|
"loss": 1.7996,
|
|
"mean_token_accuracy": 0.5718972831964493,
|
|
"num_tokens": 60757.0,
|
|
"step": 70
|
|
},
|
|
{
|
|
"entropy": 1.4585759937763214,
|
|
"epoch": 1.16597510373444,
|
|
"grad_norm": 2.1708550453186035,
|
|
"learning_rate": 9.013558189654819e-05,
|
|
"loss": 1.3026,
|
|
"mean_token_accuracy": 0.6736540347337723,
|
|
"num_tokens": 61352.0,
|
|
"step": 71
|
|
},
|
|
{
|
|
"entropy": 1.6142982840538025,
|
|
"epoch": 1.1825726141078838,
|
|
"grad_norm": 2.4141905307769775,
|
|
"learning_rate": 8.98157622952968e-05,
|
|
"loss": 1.7232,
|
|
"mean_token_accuracy": 0.6093451529741287,
|
|
"num_tokens": 61928.0,
|
|
"step": 72
|
|
},
|
|
{
|
|
"entropy": 1.4834707379341125,
|
|
"epoch": 1.1991701244813278,
|
|
"grad_norm": 3.3370718955993652,
|
|
"learning_rate": 8.94914271857558e-05,
|
|
"loss": 1.4542,
|
|
"mean_token_accuracy": 0.6456684172153473,
|
|
"num_tokens": 62487.0,
|
|
"step": 73
|
|
},
|
|
{
|
|
"entropy": 1.2296392917633057,
|
|
"epoch": 1.215767634854772,
|
|
"grad_norm": 3.297661304473877,
|
|
"learning_rate": 8.916261335079184e-05,
|
|
"loss": 1.2224,
|
|
"mean_token_accuracy": 0.7180867195129395,
|
|
"num_tokens": 62989.0,
|
|
"step": 74
|
|
},
|
|
{
|
|
"entropy": 1.3978646099567413,
|
|
"epoch": 1.2323651452282158,
|
|
"grad_norm": 3.230928421020508,
|
|
"learning_rate": 8.882935808120413e-05,
|
|
"loss": 1.2525,
|
|
"mean_token_accuracy": 0.6955430954694748,
|
|
"num_tokens": 63431.0,
|
|
"step": 75
|
|
},
|
|
{
|
|
"entropy": 1.4348433017730713,
|
|
"epoch": 1.2489626556016598,
|
|
"grad_norm": 2.9823155403137207,
|
|
"learning_rate": 8.849169917149531e-05,
|
|
"loss": 1.3674,
|
|
"mean_token_accuracy": 0.6774774789810181,
|
|
"num_tokens": 63769.0,
|
|
"step": 76
|
|
},
|
|
{
|
|
"entropy": 1.1157634109258652,
|
|
"epoch": 1.2655601659751037,
|
|
"grad_norm": 1.2160100936889648,
|
|
"learning_rate": 8.814967491558513e-05,
|
|
"loss": 1.2474,
|
|
"mean_token_accuracy": 0.6769505888223648,
|
|
"num_tokens": 65514.0,
|
|
"step": 77
|
|
},
|
|
{
|
|
"entropy": 1.1023453027009964,
|
|
"epoch": 1.2821576763485476,
|
|
"grad_norm": 1.1360654830932617,
|
|
"learning_rate": 8.780332410246749e-05,
|
|
"loss": 1.2555,
|
|
"mean_token_accuracy": 0.6901346296072006,
|
|
"num_tokens": 67028.0,
|
|
"step": 78
|
|
},
|
|
{
|
|
"entropy": 1.4519792795181274,
|
|
"epoch": 1.2987551867219918,
|
|
"grad_norm": 1.2020699977874756,
|
|
"learning_rate": 8.745268601181155e-05,
|
|
"loss": 1.5405,
|
|
"mean_token_accuracy": 0.6213398575782776,
|
|
"num_tokens": 68315.0,
|
|
"step": 79
|
|
},
|
|
{
|
|
"entropy": 1.3406359404325485,
|
|
"epoch": 1.3153526970954357,
|
|
"grad_norm": 1.3065791130065918,
|
|
"learning_rate": 8.70978004095068e-05,
|
|
"loss": 1.2679,
|
|
"mean_token_accuracy": 0.6887986212968826,
|
|
"num_tokens": 69366.0,
|
|
"step": 80
|
|
},
|
|
{
|
|
"entropy": 1.3306908905506134,
|
|
"epoch": 1.3319502074688796,
|
|
"grad_norm": 1.4615983963012695,
|
|
"learning_rate": 8.673870754315336e-05,
|
|
"loss": 1.1372,
|
|
"mean_token_accuracy": 0.6971320360898972,
|
|
"num_tokens": 70328.0,
|
|
"step": 81
|
|
},
|
|
{
|
|
"entropy": 1.523217260837555,
|
|
"epoch": 1.3485477178423237,
|
|
"grad_norm": 1.8181804418563843,
|
|
"learning_rate": 8.637544813749746e-05,
|
|
"loss": 1.3124,
|
|
"mean_token_accuracy": 0.6847366690635681,
|
|
"num_tokens": 71161.0,
|
|
"step": 82
|
|
},
|
|
{
|
|
"entropy": 1.5914150774478912,
|
|
"epoch": 1.3651452282157677,
|
|
"grad_norm": 1.9594281911849976,
|
|
"learning_rate": 8.60080633898128e-05,
|
|
"loss": 1.4735,
|
|
"mean_token_accuracy": 0.6489894986152649,
|
|
"num_tokens": 71934.0,
|
|
"step": 83
|
|
},
|
|
{
|
|
"entropy": 1.7109156250953674,
|
|
"epoch": 1.3817427385892116,
|
|
"grad_norm": 2.0826797485351562,
|
|
"learning_rate": 8.563659496522843e-05,
|
|
"loss": 1.5629,
|
|
"mean_token_accuracy": 0.61826092004776,
|
|
"num_tokens": 72659.0,
|
|
"step": 84
|
|
},
|
|
{
|
|
"entropy": 1.6033823788166046,
|
|
"epoch": 1.3983402489626555,
|
|
"grad_norm": 2.037574052810669,
|
|
"learning_rate": 8.526108499200343e-05,
|
|
"loss": 1.3959,
|
|
"mean_token_accuracy": 0.6633946299552917,
|
|
"num_tokens": 73315.0,
|
|
"step": 85
|
|
},
|
|
{
|
|
"entropy": 1.5953782498836517,
|
|
"epoch": 1.4149377593360997,
|
|
"grad_norm": 2.0150649547576904,
|
|
"learning_rate": 8.488157605674925e-05,
|
|
"loss": 1.3532,
|
|
"mean_token_accuracy": 0.70735864341259,
|
|
"num_tokens": 73902.0,
|
|
"step": 86
|
|
},
|
|
{
|
|
"entropy": 1.4288784563541412,
|
|
"epoch": 1.4315352697095436,
|
|
"grad_norm": 2.033691883087158,
|
|
"learning_rate": 8.449811119959981e-05,
|
|
"loss": 1.1189,
|
|
"mean_token_accuracy": 0.7260903120040894,
|
|
"num_tokens": 74448.0,
|
|
"step": 87
|
|
},
|
|
{
|
|
"entropy": 1.7279040217399597,
|
|
"epoch": 1.4481327800829875,
|
|
"grad_norm": 2.332186460494995,
|
|
"learning_rate": 8.411073390933049e-05,
|
|
"loss": 1.7084,
|
|
"mean_token_accuracy": 0.5948462039232254,
|
|
"num_tokens": 74949.0,
|
|
"step": 88
|
|
},
|
|
{
|
|
"entropy": 1.3200257420539856,
|
|
"epoch": 1.4647302904564317,
|
|
"grad_norm": 2.3824870586395264,
|
|
"learning_rate": 8.371948811842589e-05,
|
|
"loss": 1.019,
|
|
"mean_token_accuracy": 0.7397761791944504,
|
|
"num_tokens": 75414.0,
|
|
"step": 89
|
|
},
|
|
{
|
|
"entropy": 1.2348097264766693,
|
|
"epoch": 1.4813278008298756,
|
|
"grad_norm": 2.4164183139801025,
|
|
"learning_rate": 8.33244181980976e-05,
|
|
"loss": 0.9918,
|
|
"mean_token_accuracy": 0.7332025468349457,
|
|
"num_tokens": 75849.0,
|
|
"step": 90
|
|
},
|
|
{
|
|
"entropy": 0.9813397824764252,
|
|
"epoch": 1.4979253112033195,
|
|
"grad_norm": 2.268641233444214,
|
|
"learning_rate": 8.292556895325194e-05,
|
|
"loss": 0.8268,
|
|
"mean_token_accuracy": 0.7725253701210022,
|
|
"num_tokens": 76271.0,
|
|
"step": 91
|
|
},
|
|
{
|
|
"entropy": 1.1244373619556427,
|
|
"epoch": 1.5145228215767634,
|
|
"grad_norm": 0.8862183690071106,
|
|
"learning_rate": 8.252298561740867e-05,
|
|
"loss": 1.2055,
|
|
"mean_token_accuracy": 0.6999105960130692,
|
|
"num_tokens": 78108.0,
|
|
"step": 92
|
|
},
|
|
{
|
|
"entropy": 1.3843848705291748,
|
|
"epoch": 1.5311203319502074,
|
|
"grad_norm": 1.3396450281143188,
|
|
"learning_rate": 8.211671384757114e-05,
|
|
"loss": 1.4806,
|
|
"mean_token_accuracy": 0.6275065988302231,
|
|
"num_tokens": 79501.0,
|
|
"step": 93
|
|
},
|
|
{
|
|
"entropy": 1.534432590007782,
|
|
"epoch": 1.5477178423236515,
|
|
"grad_norm": 1.5818778276443481,
|
|
"learning_rate": 8.170679971904814e-05,
|
|
"loss": 1.6552,
|
|
"mean_token_accuracy": 0.6043647080659866,
|
|
"num_tokens": 80782.0,
|
|
"step": 94
|
|
},
|
|
{
|
|
"entropy": 1.419167011976242,
|
|
"epoch": 1.5643153526970954,
|
|
"grad_norm": 1.509782314300537,
|
|
"learning_rate": 8.129328972022867e-05,
|
|
"loss": 1.4366,
|
|
"mean_token_accuracy": 0.6377193629741669,
|
|
"num_tokens": 81875.0,
|
|
"step": 95
|
|
},
|
|
{
|
|
"entropy": 1.2230817377567291,
|
|
"epoch": 1.5809128630705396,
|
|
"grad_norm": 1.9019289016723633,
|
|
"learning_rate": 8.08762307473096e-05,
|
|
"loss": 1.1952,
|
|
"mean_token_accuracy": 0.6841559708118439,
|
|
"num_tokens": 82833.0,
|
|
"step": 96
|
|
},
|
|
{
|
|
"entropy": 1.5106331408023834,
|
|
"epoch": 1.5975103734439835,
|
|
"grad_norm": 2.4379634857177734,
|
|
"learning_rate": 8.045567009897723e-05,
|
|
"loss": 1.5762,
|
|
"mean_token_accuracy": 0.6347994953393936,
|
|
"num_tokens": 83665.0,
|
|
"step": 97
|
|
},
|
|
{
|
|
"entropy": 1.5159637928009033,
|
|
"epoch": 1.6141078838174274,
|
|
"grad_norm": 2.315671920776367,
|
|
"learning_rate": 8.003165547104305e-05,
|
|
"loss": 1.4586,
|
|
"mean_token_accuracy": 0.6473860591650009,
|
|
"num_tokens": 84400.0,
|
|
"step": 98
|
|
},
|
|
{
|
|
"entropy": 1.4539947211742401,
|
|
"epoch": 1.6307053941908713,
|
|
"grad_norm": 3.0009548664093018,
|
|
"learning_rate": 7.960423495103467e-05,
|
|
"loss": 1.5424,
|
|
"mean_token_accuracy": 0.6423875689506531,
|
|
"num_tokens": 85068.0,
|
|
"step": 99
|
|
},
|
|
{
|
|
"entropy": 1.6873330473899841,
|
|
"epoch": 1.6473029045643153,
|
|
"grad_norm": 2.6655983924865723,
|
|
"learning_rate": 7.917345701274207e-05,
|
|
"loss": 1.574,
|
|
"mean_token_accuracy": 0.6550299525260925,
|
|
"num_tokens": 85695.0,
|
|
"step": 100
|
|
},
|
|
{
|
|
"entropy": 1.4055011570453644,
|
|
"epoch": 1.6639004149377592,
|
|
"grad_norm": 3.3150808811187744,
|
|
"learning_rate": 7.873937051072035e-05,
|
|
"loss": 1.2071,
|
|
"mean_token_accuracy": 0.6913554072380066,
|
|
"num_tokens": 86300.0,
|
|
"step": 101
|
|
},
|
|
{
|
|
"entropy": 1.6945359408855438,
|
|
"epoch": 1.6804979253112033,
|
|
"grad_norm": 2.25583553314209,
|
|
"learning_rate": 7.830202467474899e-05,
|
|
"loss": 1.493,
|
|
"mean_token_accuracy": 0.6553004831075668,
|
|
"num_tokens": 86861.0,
|
|
"step": 102
|
|
},
|
|
{
|
|
"entropy": 1.393843948841095,
|
|
"epoch": 1.6970954356846473,
|
|
"grad_norm": 2.9434304237365723,
|
|
"learning_rate": 7.786146910424876e-05,
|
|
"loss": 1.2789,
|
|
"mean_token_accuracy": 0.7113071084022522,
|
|
"num_tokens": 87388.0,
|
|
"step": 103
|
|
},
|
|
{
|
|
"entropy": 1.3938986957073212,
|
|
"epoch": 1.7136929460580914,
|
|
"grad_norm": 2.8079259395599365,
|
|
"learning_rate": 7.741775376265667e-05,
|
|
"loss": 1.1396,
|
|
"mean_token_accuracy": 0.725695475935936,
|
|
"num_tokens": 87870.0,
|
|
"step": 104
|
|
},
|
|
{
|
|
"entropy": 1.3154444992542267,
|
|
"epoch": 1.7302904564315353,
|
|
"grad_norm": 2.5979607105255127,
|
|
"learning_rate": 7.697092897175957e-05,
|
|
"loss": 1.1318,
|
|
"mean_token_accuracy": 0.7149190455675125,
|
|
"num_tokens": 88313.0,
|
|
"step": 105
|
|
},
|
|
{
|
|
"entropy": 1.2525047361850739,
|
|
"epoch": 1.7468879668049793,
|
|
"grad_norm": 2.3928842544555664,
|
|
"learning_rate": 7.652104540598712e-05,
|
|
"loss": 0.9614,
|
|
"mean_token_accuracy": 0.7349429130554199,
|
|
"num_tokens": 88712.0,
|
|
"step": 106
|
|
},
|
|
{
|
|
"entropy": 1.5751274824142456,
|
|
"epoch": 1.7634854771784232,
|
|
"grad_norm": 1.3356112241744995,
|
|
"learning_rate": 7.606815408666493e-05,
|
|
"loss": 1.6637,
|
|
"mean_token_accuracy": 0.6113278269767761,
|
|
"num_tokens": 90652.0,
|
|
"step": 107
|
|
},
|
|
{
|
|
"entropy": 1.7263123393058777,
|
|
"epoch": 1.7800829875518671,
|
|
"grad_norm": 1.220577359199524,
|
|
"learning_rate": 7.561230637622805e-05,
|
|
"loss": 1.5781,
|
|
"mean_token_accuracy": 0.6253386288881302,
|
|
"num_tokens": 92043.0,
|
|
"step": 108
|
|
},
|
|
{
|
|
"entropy": 1.8092939853668213,
|
|
"epoch": 1.796680497925311,
|
|
"grad_norm": 1.2987717390060425,
|
|
"learning_rate": 7.515355397239613e-05,
|
|
"loss": 1.6102,
|
|
"mean_token_accuracy": 0.60220967233181,
|
|
"num_tokens": 93290.0,
|
|
"step": 109
|
|
},
|
|
{
|
|
"entropy": 1.5732390582561493,
|
|
"epoch": 1.8132780082987552,
|
|
"grad_norm": 1.2782738208770752,
|
|
"learning_rate": 7.469194890231021e-05,
|
|
"loss": 1.6026,
|
|
"mean_token_accuracy": 0.6219276785850525,
|
|
"num_tokens": 94437.0,
|
|
"step": 110
|
|
},
|
|
{
|
|
"entropy": 1.3208205997943878,
|
|
"epoch": 1.8298755186721993,
|
|
"grad_norm": 1.508908987045288,
|
|
"learning_rate": 7.422754351663252e-05,
|
|
"loss": 1.2197,
|
|
"mean_token_accuracy": 0.6798736304044724,
|
|
"num_tokens": 95454.0,
|
|
"step": 111
|
|
},
|
|
{
|
|
"entropy": 1.4695551693439484,
|
|
"epoch": 1.8464730290456433,
|
|
"grad_norm": 1.7255935668945312,
|
|
"learning_rate": 7.376039048360914e-05,
|
|
"loss": 1.3915,
|
|
"mean_token_accuracy": 0.6647312641143799,
|
|
"num_tokens": 96422.0,
|
|
"step": 112
|
|
},
|
|
{
|
|
"entropy": 1.5077824890613556,
|
|
"epoch": 1.8630705394190872,
|
|
"grad_norm": 2.4858553409576416,
|
|
"learning_rate": 7.329054278309708e-05,
|
|
"loss": 1.5295,
|
|
"mean_token_accuracy": 0.645410567522049,
|
|
"num_tokens": 97258.0,
|
|
"step": 113
|
|
},
|
|
{
|
|
"entropy": 1.3513629138469696,
|
|
"epoch": 1.879668049792531,
|
|
"grad_norm": 2.4195804595947266,
|
|
"learning_rate": 7.281805370055581e-05,
|
|
"loss": 1.3322,
|
|
"mean_token_accuracy": 0.6713262051343918,
|
|
"num_tokens": 98053.0,
|
|
"step": 114
|
|
},
|
|
{
|
|
"entropy": 1.1256203055381775,
|
|
"epoch": 1.896265560165975,
|
|
"grad_norm": 2.4134695529937744,
|
|
"learning_rate": 7.234297682100404e-05,
|
|
"loss": 1.2417,
|
|
"mean_token_accuracy": 0.7208292186260223,
|
|
"num_tokens": 98838.0,
|
|
"step": 115
|
|
},
|
|
{
|
|
"entropy": 1.2319197356700897,
|
|
"epoch": 1.912863070539419,
|
|
"grad_norm": 2.0551836490631104,
|
|
"learning_rate": 7.186536602294278e-05,
|
|
"loss": 1.0502,
|
|
"mean_token_accuracy": 0.7311187982559204,
|
|
"num_tokens": 99579.0,
|
|
"step": 116
|
|
},
|
|
{
|
|
"entropy": 1.3636659979820251,
|
|
"epoch": 1.929460580912863,
|
|
"grad_norm": 3.1892852783203125,
|
|
"learning_rate": 7.138527547224485e-05,
|
|
"loss": 1.3794,
|
|
"mean_token_accuracy": 0.6597895175218582,
|
|
"num_tokens": 100219.0,
|
|
"step": 117
|
|
},
|
|
{
|
|
"entropy": 1.3741393387317657,
|
|
"epoch": 1.946058091286307,
|
|
"grad_norm": 2.720012664794922,
|
|
"learning_rate": 7.090275961601203e-05,
|
|
"loss": 1.4525,
|
|
"mean_token_accuracy": 0.6761961877346039,
|
|
"num_tokens": 100773.0,
|
|
"step": 118
|
|
},
|
|
{
|
|
"entropy": 1.2926801443099976,
|
|
"epoch": 1.9626556016597512,
|
|
"grad_norm": 2.668562173843384,
|
|
"learning_rate": 7.041787317640014e-05,
|
|
"loss": 1.2582,
|
|
"mean_token_accuracy": 0.7060045301914215,
|
|
"num_tokens": 101274.0,
|
|
"step": 119
|
|
},
|
|
{
|
|
"entropy": 1.4207338094711304,
|
|
"epoch": 1.979253112033195,
|
|
"grad_norm": 2.8614320755004883,
|
|
"learning_rate": 6.993067114441302e-05,
|
|
"loss": 1.232,
|
|
"mean_token_accuracy": 0.6748317778110504,
|
|
"num_tokens": 101740.0,
|
|
"step": 120
|
|
},
|
|
{
|
|
"entropy": 1.2662785649299622,
|
|
"epoch": 1.995850622406639,
|
|
"grad_norm": 2.7323219776153564,
|
|
"learning_rate": 6.944120877366604e-05,
|
|
"loss": 0.9631,
|
|
"mean_token_accuracy": 0.7634817808866501,
|
|
"num_tokens": 102150.0,
|
|
"step": 121
|
|
},
|
|
{
|
|
"entropy": 1.9474085569381714,
|
|
"epoch": 2.0,
|
|
"grad_norm": 6.136712551116943,
|
|
"learning_rate": 6.894954157411966e-05,
|
|
"loss": 1.9084,
|
|
"mean_token_accuracy": 0.5528455376625061,
|
|
"num_tokens": 102274.0,
|
|
"step": 122
|
|
},
|
|
{
|
|
"entropy": 1.1377949267625809,
|
|
"epoch": 2.016597510373444,
|
|
"grad_norm": 0.9612461924552917,
|
|
"learning_rate": 6.845572530578422e-05,
|
|
"loss": 1.1333,
|
|
"mean_token_accuracy": 0.7239202558994293,
|
|
"num_tokens": 104207.0,
|
|
"step": 123
|
|
},
|
|
{
|
|
"entropy": 1.2367377132177353,
|
|
"epoch": 2.033195020746888,
|
|
"grad_norm": 1.1431013345718384,
|
|
"learning_rate": 6.795981597239599e-05,
|
|
"loss": 1.0014,
|
|
"mean_token_accuracy": 0.7419553995132446,
|
|
"num_tokens": 105672.0,
|
|
"step": 124
|
|
},
|
|
{
|
|
"entropy": 1.449882984161377,
|
|
"epoch": 2.0497925311203318,
|
|
"grad_norm": 1.6375846862792969,
|
|
"learning_rate": 6.7461869815066e-05,
|
|
"loss": 1.1995,
|
|
"mean_token_accuracy": 0.6811743974685669,
|
|
"num_tokens": 107021.0,
|
|
"step": 125
|
|
},
|
|
{
|
|
"entropy": 1.4986421167850494,
|
|
"epoch": 2.066390041493776,
|
|
"grad_norm": 1.421595811843872,
|
|
"learning_rate": 6.696194330590151e-05,
|
|
"loss": 1.331,
|
|
"mean_token_accuracy": 0.6666897237300873,
|
|
"num_tokens": 108279.0,
|
|
"step": 126
|
|
},
|
|
{
|
|
"entropy": 1.2103563100099564,
|
|
"epoch": 2.08298755186722,
|
|
"grad_norm": 1.61978018283844,
|
|
"learning_rate": 6.646009314160173e-05,
|
|
"loss": 0.9075,
|
|
"mean_token_accuracy": 0.7723639756441116,
|
|
"num_tokens": 109356.0,
|
|
"step": 127
|
|
},
|
|
{
|
|
"entropy": 1.217780441045761,
|
|
"epoch": 2.099585062240664,
|
|
"grad_norm": 1.7584712505340576,
|
|
"learning_rate": 6.595637623702763e-05,
|
|
"loss": 0.8784,
|
|
"mean_token_accuracy": 0.7690880298614502,
|
|
"num_tokens": 110347.0,
|
|
"step": 128
|
|
},
|
|
{
|
|
"entropy": 0.8932879865169525,
|
|
"epoch": 2.116182572614108,
|
|
"grad_norm": 1.7026498317718506,
|
|
"learning_rate": 6.545084971874738e-05,
|
|
"loss": 0.6253,
|
|
"mean_token_accuracy": 0.8417714536190033,
|
|
"num_tokens": 111266.0,
|
|
"step": 129
|
|
},
|
|
{
|
|
"entropy": 1.1204040348529816,
|
|
"epoch": 2.132780082987552,
|
|
"grad_norm": 2.270695447921753,
|
|
"learning_rate": 6.494357091855751e-05,
|
|
"loss": 0.889,
|
|
"mean_token_accuracy": 0.7744732350111008,
|
|
"num_tokens": 112096.0,
|
|
"step": 130
|
|
},
|
|
{
|
|
"entropy": 0.9187988489866257,
|
|
"epoch": 2.1493775933609958,
|
|
"grad_norm": 2.6016838550567627,
|
|
"learning_rate": 6.443459736698105e-05,
|
|
"loss": 0.759,
|
|
"mean_token_accuracy": 0.8029564172029495,
|
|
"num_tokens": 112866.0,
|
|
"step": 131
|
|
},
|
|
{
|
|
"entropy": 1.060081034898758,
|
|
"epoch": 2.1659751037344397,
|
|
"grad_norm": 3.0870463848114014,
|
|
"learning_rate": 6.39239867867428e-05,
|
|
"loss": 0.973,
|
|
"mean_token_accuracy": 0.7499169707298279,
|
|
"num_tokens": 113555.0,
|
|
"step": 132
|
|
},
|
|
{
|
|
"entropy": 0.8084948360919952,
|
|
"epoch": 2.1825726141078836,
|
|
"grad_norm": 3.516533136367798,
|
|
"learning_rate": 6.341179708622315e-05,
|
|
"loss": 0.7765,
|
|
"mean_token_accuracy": 0.7850001603364944,
|
|
"num_tokens": 114162.0,
|
|
"step": 133
|
|
},
|
|
{
|
|
"entropy": 0.9602021425962448,
|
|
"epoch": 2.199170124481328,
|
|
"grad_norm": 3.2551493644714355,
|
|
"learning_rate": 6.28980863528906e-05,
|
|
"loss": 0.7846,
|
|
"mean_token_accuracy": 0.8070370852947235,
|
|
"num_tokens": 114731.0,
|
|
"step": 134
|
|
},
|
|
{
|
|
"entropy": 0.8361001461744308,
|
|
"epoch": 2.215767634854772,
|
|
"grad_norm": 4.158690929412842,
|
|
"learning_rate": 6.23829128467141e-05,
|
|
"loss": 0.783,
|
|
"mean_token_accuracy": 0.7848098278045654,
|
|
"num_tokens": 115260.0,
|
|
"step": 135
|
|
},
|
|
{
|
|
"entropy": 0.586012601852417,
|
|
"epoch": 2.232365145228216,
|
|
"grad_norm": 3.1432180404663086,
|
|
"learning_rate": 6.186633499355576e-05,
|
|
"loss": 0.401,
|
|
"mean_token_accuracy": 0.8802812397480011,
|
|
"num_tokens": 115717.0,
|
|
"step": 136
|
|
},
|
|
{
|
|
"entropy": 0.7248338460922241,
|
|
"epoch": 2.2489626556016598,
|
|
"grad_norm": 3.5007729530334473,
|
|
"learning_rate": 6.134841137854475e-05,
|
|
"loss": 0.5282,
|
|
"mean_token_accuracy": 0.8414591550827026,
|
|
"num_tokens": 116118.0,
|
|
"step": 137
|
|
},
|
|
{
|
|
"entropy": 0.7773696631193161,
|
|
"epoch": 2.2655601659751037,
|
|
"grad_norm": 1.5687109231948853,
|
|
"learning_rate": 6.082920073943328e-05,
|
|
"loss": 0.8679,
|
|
"mean_token_accuracy": 0.7672423124313354,
|
|
"num_tokens": 118032.0,
|
|
"step": 138
|
|
},
|
|
{
|
|
"entropy": 0.7244298756122589,
|
|
"epoch": 2.2821576763485476,
|
|
"grad_norm": 1.6099064350128174,
|
|
"learning_rate": 6.030876195993491e-05,
|
|
"loss": 0.8375,
|
|
"mean_token_accuracy": 0.7733269482851028,
|
|
"num_tokens": 119597.0,
|
|
"step": 139
|
|
},
|
|
{
|
|
"entropy": 0.737570583820343,
|
|
"epoch": 2.2987551867219915,
|
|
"grad_norm": 2.3326027393341064,
|
|
"learning_rate": 5.97871540630468e-05,
|
|
"loss": 0.7659,
|
|
"mean_token_accuracy": 0.7851079106330872,
|
|
"num_tokens": 120691.0,
|
|
"step": 140
|
|
},
|
|
{
|
|
"entropy": 0.7653595954179764,
|
|
"epoch": 2.3153526970954355,
|
|
"grad_norm": 2.660642623901367,
|
|
"learning_rate": 5.9264436204355724e-05,
|
|
"loss": 0.7601,
|
|
"mean_token_accuracy": 0.7836814522743225,
|
|
"num_tokens": 121663.0,
|
|
"step": 141
|
|
},
|
|
{
|
|
"entropy": 0.8718907386064529,
|
|
"epoch": 2.33195020746888,
|
|
"grad_norm": 2.816377878189087,
|
|
"learning_rate": 5.874066766532932e-05,
|
|
"loss": 0.6845,
|
|
"mean_token_accuracy": 0.8144886344671249,
|
|
"num_tokens": 122494.0,
|
|
"step": 142
|
|
},
|
|
{
|
|
"entropy": 0.8468358963727951,
|
|
"epoch": 2.3485477178423237,
|
|
"grad_norm": 2.4367387294769287,
|
|
"learning_rate": 5.8215907846592977e-05,
|
|
"loss": 0.6305,
|
|
"mean_token_accuracy": 0.8274233788251877,
|
|
"num_tokens": 123285.0,
|
|
"step": 143
|
|
},
|
|
{
|
|
"entropy": 0.8580201715230942,
|
|
"epoch": 2.3651452282157677,
|
|
"grad_norm": 2.3725626468658447,
|
|
"learning_rate": 5.769021626119314e-05,
|
|
"loss": 0.6027,
|
|
"mean_token_accuracy": 0.82393579185009,
|
|
"num_tokens": 124055.0,
|
|
"step": 144
|
|
},
|
|
{
|
|
"entropy": 1.040640190243721,
|
|
"epoch": 2.3817427385892116,
|
|
"grad_norm": 2.584585189819336,
|
|
"learning_rate": 5.7163652527847987e-05,
|
|
"loss": 0.8636,
|
|
"mean_token_accuracy": 0.7851257175207138,
|
|
"num_tokens": 124789.0,
|
|
"step": 145
|
|
},
|
|
{
|
|
"entropy": 0.8957875370979309,
|
|
"epoch": 2.3983402489626555,
|
|
"grad_norm": 2.5588252544403076,
|
|
"learning_rate": 5.6636276364186105e-05,
|
|
"loss": 0.6825,
|
|
"mean_token_accuracy": 0.802570715546608,
|
|
"num_tokens": 125440.0,
|
|
"step": 146
|
|
},
|
|
{
|
|
"entropy": 0.8292366862297058,
|
|
"epoch": 2.4149377593360994,
|
|
"grad_norm": 2.70613169670105,
|
|
"learning_rate": 5.610814757997377e-05,
|
|
"loss": 0.6489,
|
|
"mean_token_accuracy": 0.8280458450317383,
|
|
"num_tokens": 126019.0,
|
|
"step": 147
|
|
},
|
|
{
|
|
"entropy": 0.8870530277490616,
|
|
"epoch": 2.431535269709544,
|
|
"grad_norm": 2.6557841300964355,
|
|
"learning_rate": 5.557932607033207e-05,
|
|
"loss": 0.5701,
|
|
"mean_token_accuracy": 0.8425956070423126,
|
|
"num_tokens": 126535.0,
|
|
"step": 148
|
|
},
|
|
{
|
|
"entropy": 0.9041202813386917,
|
|
"epoch": 2.4481327800829877,
|
|
"grad_norm": 2.9167532920837402,
|
|
"learning_rate": 5.504987180894411e-05,
|
|
"loss": 0.6641,
|
|
"mean_token_accuracy": 0.8117185682058334,
|
|
"num_tokens": 127017.0,
|
|
"step": 149
|
|
},
|
|
{
|
|
"entropy": 0.6521150767803192,
|
|
"epoch": 2.4647302904564317,
|
|
"grad_norm": 2.460925579071045,
|
|
"learning_rate": 5.451984484125341e-05,
|
|
"loss": 0.4366,
|
|
"mean_token_accuracy": 0.8905431628227234,
|
|
"num_tokens": 127467.0,
|
|
"step": 150
|
|
},
|
|
{
|
|
"entropy": 0.43711117655038834,
|
|
"epoch": 2.4813278008298756,
|
|
"grad_norm": 2.205427646636963,
|
|
"learning_rate": 5.3989305277654156e-05,
|
|
"loss": 0.264,
|
|
"mean_token_accuracy": 0.9267032593488693,
|
|
"num_tokens": 127893.0,
|
|
"step": 151
|
|
},
|
|
{
|
|
"entropy": 0.6371852308511734,
|
|
"epoch": 2.4979253112033195,
|
|
"grad_norm": 2.989675283432007,
|
|
"learning_rate": 5.345831328667408e-05,
|
|
"loss": 0.4021,
|
|
"mean_token_accuracy": 0.8775946348905563,
|
|
"num_tokens": 128245.0,
|
|
"step": 152
|
|
},
|
|
{
|
|
"entropy": 0.9646222442388535,
|
|
"epoch": 2.5145228215767634,
|
|
"grad_norm": 2.5618557929992676,
|
|
"learning_rate": 5.292692908815069e-05,
|
|
"loss": 1.0454,
|
|
"mean_token_accuracy": 0.7269141972064972,
|
|
"num_tokens": 129738.0,
|
|
"step": 153
|
|
},
|
|
{
|
|
"entropy": 1.018859714269638,
|
|
"epoch": 2.5311203319502074,
|
|
"grad_norm": 2.760653018951416,
|
|
"learning_rate": 5.239521294640185e-05,
|
|
"loss": 1.1112,
|
|
"mean_token_accuracy": 0.719361737370491,
|
|
"num_tokens": 131011.0,
|
|
"step": 154
|
|
},
|
|
{
|
|
"entropy": 1.0589520335197449,
|
|
"epoch": 2.5477178423236513,
|
|
"grad_norm": 2.75836181640625,
|
|
"learning_rate": 5.1863225163391073e-05,
|
|
"loss": 1.1539,
|
|
"mean_token_accuracy": 0.716277152299881,
|
|
"num_tokens": 132229.0,
|
|
"step": 155
|
|
},
|
|
{
|
|
"entropy": 0.8339425623416901,
|
|
"epoch": 2.564315352697095,
|
|
"grad_norm": 2.1010499000549316,
|
|
"learning_rate": 5.133102607188874e-05,
|
|
"loss": 0.6909,
|
|
"mean_token_accuracy": 0.8211058974266052,
|
|
"num_tokens": 133343.0,
|
|
"step": 156
|
|
},
|
|
{
|
|
"entropy": 0.7217313796281815,
|
|
"epoch": 2.5809128630705396,
|
|
"grad_norm": 2.1709694862365723,
|
|
"learning_rate": 5.079867602862974e-05,
|
|
"loss": 0.7069,
|
|
"mean_token_accuracy": 0.8010880500078201,
|
|
"num_tokens": 134333.0,
|
|
"step": 157
|
|
},
|
|
{
|
|
"entropy": 0.7894525229930878,
|
|
"epoch": 2.5975103734439835,
|
|
"grad_norm": 3.0637104511260986,
|
|
"learning_rate": 5.0266235407468424e-05,
|
|
"loss": 0.7065,
|
|
"mean_token_accuracy": 0.8259354382753372,
|
|
"num_tokens": 135242.0,
|
|
"step": 158
|
|
},
|
|
{
|
|
"entropy": 0.8071346133947372,
|
|
"epoch": 2.6141078838174274,
|
|
"grad_norm": 2.9362282752990723,
|
|
"learning_rate": 4.973376459253159e-05,
|
|
"loss": 0.7296,
|
|
"mean_token_accuracy": 0.7955306619405746,
|
|
"num_tokens": 136053.0,
|
|
"step": 159
|
|
},
|
|
{
|
|
"entropy": 0.9336775541305542,
|
|
"epoch": 2.6307053941908713,
|
|
"grad_norm": 3.6798059940338135,
|
|
"learning_rate": 4.9201323971370264e-05,
|
|
"loss": 0.9182,
|
|
"mean_token_accuracy": 0.7530855238437653,
|
|
"num_tokens": 136813.0,
|
|
"step": 160
|
|
},
|
|
{
|
|
"entropy": 0.8967225700616837,
|
|
"epoch": 2.6473029045643153,
|
|
"grad_norm": 2.9090402126312256,
|
|
"learning_rate": 4.866897392811126e-05,
|
|
"loss": 0.7878,
|
|
"mean_token_accuracy": 0.7828802466392517,
|
|
"num_tokens": 137520.0,
|
|
"step": 161
|
|
},
|
|
{
|
|
"entropy": 0.8007341772317886,
|
|
"epoch": 2.663900414937759,
|
|
"grad_norm": 3.263995885848999,
|
|
"learning_rate": 4.8136774836608925e-05,
|
|
"loss": 0.6358,
|
|
"mean_token_accuracy": 0.8244260102510452,
|
|
"num_tokens": 138143.0,
|
|
"step": 162
|
|
},
|
|
{
|
|
"entropy": 1.0581243187189102,
|
|
"epoch": 2.6804979253112036,
|
|
"grad_norm": 2.9952902793884277,
|
|
"learning_rate": 4.760478705359816e-05,
|
|
"loss": 0.7703,
|
|
"mean_token_accuracy": 0.8044403791427612,
|
|
"num_tokens": 138716.0,
|
|
"step": 163
|
|
},
|
|
{
|
|
"entropy": 0.7207875102758408,
|
|
"epoch": 2.6970954356846475,
|
|
"grad_norm": 3.037635087966919,
|
|
"learning_rate": 4.707307091184931e-05,
|
|
"loss": 0.5967,
|
|
"mean_token_accuracy": 0.8498925566673279,
|
|
"num_tokens": 139255.0,
|
|
"step": 164
|
|
},
|
|
{
|
|
"entropy": 0.7493630349636078,
|
|
"epoch": 2.7136929460580914,
|
|
"grad_norm": 3.4928629398345947,
|
|
"learning_rate": 4.654168671332594e-05,
|
|
"loss": 0.5708,
|
|
"mean_token_accuracy": 0.8602199703454971,
|
|
"num_tokens": 139746.0,
|
|
"step": 165
|
|
},
|
|
{
|
|
"entropy": 0.6802153587341309,
|
|
"epoch": 2.7302904564315353,
|
|
"grad_norm": 3.389561176300049,
|
|
"learning_rate": 4.601069472234584e-05,
|
|
"loss": 0.5583,
|
|
"mean_token_accuracy": 0.8634126931428909,
|
|
"num_tokens": 140211.0,
|
|
"step": 166
|
|
},
|
|
{
|
|
"entropy": 0.5491561889648438,
|
|
"epoch": 2.7468879668049793,
|
|
"grad_norm": 2.452354907989502,
|
|
"learning_rate": 4.54801551587466e-05,
|
|
"loss": 0.3749,
|
|
"mean_token_accuracy": 0.8924126625061035,
|
|
"num_tokens": 140627.0,
|
|
"step": 167
|
|
},
|
|
{
|
|
"entropy": 1.082240641117096,
|
|
"epoch": 2.763485477178423,
|
|
"grad_norm": 1.8373757600784302,
|
|
"learning_rate": 4.4950128191055896e-05,
|
|
"loss": 1.0634,
|
|
"mean_token_accuracy": 0.7363788485527039,
|
|
"num_tokens": 142517.0,
|
|
"step": 168
|
|
},
|
|
{
|
|
"entropy": 0.9259464293718338,
|
|
"epoch": 2.780082987551867,
|
|
"grad_norm": 1.4106931686401367,
|
|
"learning_rate": 4.4420673929667936e-05,
|
|
"loss": 0.8906,
|
|
"mean_token_accuracy": 0.7626354992389679,
|
|
"num_tokens": 144001.0,
|
|
"step": 169
|
|
},
|
|
{
|
|
"entropy": 1.1125036478042603,
|
|
"epoch": 2.796680497925311,
|
|
"grad_norm": 1.8246486186981201,
|
|
"learning_rate": 4.3891852420026225e-05,
|
|
"loss": 0.9538,
|
|
"mean_token_accuracy": 0.7357250899076462,
|
|
"num_tokens": 145324.0,
|
|
"step": 170
|
|
},
|
|
{
|
|
"entropy": 1.03811414539814,
|
|
"epoch": 2.813278008298755,
|
|
"grad_norm": 1.7586928606033325,
|
|
"learning_rate": 4.336372363581391e-05,
|
|
"loss": 0.9935,
|
|
"mean_token_accuracy": 0.7378970831632614,
|
|
"num_tokens": 146407.0,
|
|
"step": 171
|
|
},
|
|
{
|
|
"entropy": 0.8408836126327515,
|
|
"epoch": 2.8298755186721993,
|
|
"grad_norm": 2.626432180404663,
|
|
"learning_rate": 4.283634747215202e-05,
|
|
"loss": 0.7084,
|
|
"mean_token_accuracy": 0.7977723926305771,
|
|
"num_tokens": 147386.0,
|
|
"step": 172
|
|
},
|
|
{
|
|
"entropy": 0.8435258269309998,
|
|
"epoch": 2.8464730290456433,
|
|
"grad_norm": 2.422319173812866,
|
|
"learning_rate": 4.230978373880687e-05,
|
|
"loss": 0.6315,
|
|
"mean_token_accuracy": 0.8369058072566986,
|
|
"num_tokens": 148176.0,
|
|
"step": 173
|
|
},
|
|
{
|
|
"entropy": 0.8827187120914459,
|
|
"epoch": 2.863070539419087,
|
|
"grad_norm": 3.2514476776123047,
|
|
"learning_rate": 4.178409215340704e-05,
|
|
"loss": 0.751,
|
|
"mean_token_accuracy": 0.7934647500514984,
|
|
"num_tokens": 148877.0,
|
|
"step": 174
|
|
},
|
|
{
|
|
"entropy": 1.1808519065380096,
|
|
"epoch": 2.879668049792531,
|
|
"grad_norm": 2.987744092941284,
|
|
"learning_rate": 4.125933233467069e-05,
|
|
"loss": 0.9171,
|
|
"mean_token_accuracy": 0.7549975365400314,
|
|
"num_tokens": 149538.0,
|
|
"step": 175
|
|
},
|
|
{
|
|
"entropy": 0.8594090789556503,
|
|
"epoch": 2.896265560165975,
|
|
"grad_norm": 2.7726871967315674,
|
|
"learning_rate": 4.0735563795644294e-05,
|
|
"loss": 0.6315,
|
|
"mean_token_accuracy": 0.8250421732664108,
|
|
"num_tokens": 150159.0,
|
|
"step": 176
|
|
},
|
|
{
|
|
"entropy": 0.8105258494615555,
|
|
"epoch": 2.912863070539419,
|
|
"grad_norm": 3.127241611480713,
|
|
"learning_rate": 4.021284593695321e-05,
|
|
"loss": 0.6019,
|
|
"mean_token_accuracy": 0.8341681659221649,
|
|
"num_tokens": 150754.0,
|
|
"step": 177
|
|
},
|
|
{
|
|
"entropy": 0.8403373807668686,
|
|
"epoch": 2.9294605809128633,
|
|
"grad_norm": 2.7863616943359375,
|
|
"learning_rate": 3.969123804006511e-05,
|
|
"loss": 0.6372,
|
|
"mean_token_accuracy": 0.8413342088460922,
|
|
"num_tokens": 151325.0,
|
|
"step": 178
|
|
},
|
|
{
|
|
"entropy": 0.7010289281606674,
|
|
"epoch": 2.9460580912863072,
|
|
"grad_norm": 3.0871100425720215,
|
|
"learning_rate": 3.917079926056674e-05,
|
|
"loss": 0.5957,
|
|
"mean_token_accuracy": 0.8436416238546371,
|
|
"num_tokens": 151854.0,
|
|
"step": 179
|
|
},
|
|
{
|
|
"entropy": 0.7843320816755295,
|
|
"epoch": 2.962655601659751,
|
|
"grad_norm": 3.303302764892578,
|
|
"learning_rate": 3.8651588621455254e-05,
|
|
"loss": 0.6363,
|
|
"mean_token_accuracy": 0.8261257261037827,
|
|
"num_tokens": 152353.0,
|
|
"step": 180
|
|
},
|
|
{
|
|
"entropy": 0.6532695293426514,
|
|
"epoch": 2.979253112033195,
|
|
"grad_norm": 3.2265734672546387,
|
|
"learning_rate": 3.8133665006444255e-05,
|
|
"loss": 0.4373,
|
|
"mean_token_accuracy": 0.8786792159080505,
|
|
"num_tokens": 152799.0,
|
|
"step": 181
|
|
},
|
|
{
|
|
"entropy": 0.5146052092313766,
|
|
"epoch": 2.995850622406639,
|
|
"grad_norm": 2.864121198654175,
|
|
"learning_rate": 3.761708715328593e-05,
|
|
"loss": 0.3235,
|
|
"mean_token_accuracy": 0.919788122177124,
|
|
"num_tokens": 153204.0,
|
|
"step": 182
|
|
},
|
|
{
|
|
"entropy": 1.0765279531478882,
|
|
"epoch": 3.0,
|
|
"grad_norm": 4.817622184753418,
|
|
"learning_rate": 3.7101913647109414e-05,
|
|
"loss": 0.7345,
|
|
"mean_token_accuracy": 0.8300970792770386,
|
|
"num_tokens": 153411.0,
|
|
"step": 183
|
|
},
|
|
{
|
|
"entropy": 0.9053896814584732,
|
|
"epoch": 3.016597510373444,
|
|
"grad_norm": 1.3523423671722412,
|
|
"learning_rate": 3.658820291377686e-05,
|
|
"loss": 0.7027,
|
|
"mean_token_accuracy": 0.8281210213899612,
|
|
"num_tokens": 155308.0,
|
|
"step": 184
|
|
},
|
|
{
|
|
"entropy": 0.9245802909135818,
|
|
"epoch": 3.033195020746888,
|
|
"grad_norm": 1.3620742559432983,
|
|
"learning_rate": 3.60760132132572e-05,
|
|
"loss": 0.6806,
|
|
"mean_token_accuracy": 0.8312702178955078,
|
|
"num_tokens": 156736.0,
|
|
"step": 185
|
|
},
|
|
{
|
|
"entropy": 1.0520436316728592,
|
|
"epoch": 3.0497925311203318,
|
|
"grad_norm": 1.862312912940979,
|
|
"learning_rate": 3.556540263301896e-05,
|
|
"loss": 0.762,
|
|
"mean_token_accuracy": 0.8084734082221985,
|
|
"num_tokens": 158004.0,
|
|
"step": 186
|
|
},
|
|
{
|
|
"entropy": 0.6379094421863556,
|
|
"epoch": 3.066390041493776,
|
|
"grad_norm": 1.6042191982269287,
|
|
"learning_rate": 3.505642908144248e-05,
|
|
"loss": 0.3796,
|
|
"mean_token_accuracy": 0.9122848212718964,
|
|
"num_tokens": 159070.0,
|
|
"step": 187
|
|
},
|
|
{
|
|
"entropy": 0.59751757979393,
|
|
"epoch": 3.08298755186722,
|
|
"grad_norm": 2.215848684310913,
|
|
"learning_rate": 3.4549150281252636e-05,
|
|
"loss": 0.3516,
|
|
"mean_token_accuracy": 0.9034991562366486,
|
|
"num_tokens": 159966.0,
|
|
"step": 188
|
|
},
|
|
{
|
|
"entropy": 0.6749102771282196,
|
|
"epoch": 3.099585062240664,
|
|
"grad_norm": 2.7357337474823,
|
|
"learning_rate": 3.404362376297237e-05,
|
|
"loss": 0.4656,
|
|
"mean_token_accuracy": 0.8664576560258865,
|
|
"num_tokens": 160775.0,
|
|
"step": 189
|
|
},
|
|
{
|
|
"entropy": 0.41622431576251984,
|
|
"epoch": 3.116182572614108,
|
|
"grad_norm": 2.113668203353882,
|
|
"learning_rate": 3.353990685839828e-05,
|
|
"loss": 0.2241,
|
|
"mean_token_accuracy": 0.9403961449861526,
|
|
"num_tokens": 161548.0,
|
|
"step": 190
|
|
},
|
|
{
|
|
"entropy": 0.5323886349797249,
|
|
"epoch": 3.132780082987552,
|
|
"grad_norm": 2.39516019821167,
|
|
"learning_rate": 3.303805669409848e-05,
|
|
"loss": 0.3055,
|
|
"mean_token_accuracy": 0.9162275344133377,
|
|
"num_tokens": 162252.0,
|
|
"step": 191
|
|
},
|
|
{
|
|
"entropy": 0.5232428386807442,
|
|
"epoch": 3.1493775933609958,
|
|
"grad_norm": 2.6726315021514893,
|
|
"learning_rate": 3.253813018493402e-05,
|
|
"loss": 0.3453,
|
|
"mean_token_accuracy": 0.9130482524633408,
|
|
"num_tokens": 162875.0,
|
|
"step": 192
|
|
},
|
|
{
|
|
"entropy": 0.35711124539375305,
|
|
"epoch": 3.1659751037344397,
|
|
"grad_norm": 2.5041966438293457,
|
|
"learning_rate": 3.2040184027604006e-05,
|
|
"loss": 0.2254,
|
|
"mean_token_accuracy": 0.9327007085084915,
|
|
"num_tokens": 163473.0,
|
|
"step": 193
|
|
},
|
|
{
|
|
"entropy": 0.2961500436067581,
|
|
"epoch": 3.1825726141078836,
|
|
"grad_norm": 2.367612600326538,
|
|
"learning_rate": 3.15442746942158e-05,
|
|
"loss": 0.1943,
|
|
"mean_token_accuracy": 0.9548846483230591,
|
|
"num_tokens": 164033.0,
|
|
"step": 194
|
|
},
|
|
{
|
|
"entropy": 0.3251847103238106,
|
|
"epoch": 3.199170124481328,
|
|
"grad_norm": 4.243903160095215,
|
|
"learning_rate": 3.1050458425880335e-05,
|
|
"loss": 0.2207,
|
|
"mean_token_accuracy": 0.9388151168823242,
|
|
"num_tokens": 164545.0,
|
|
"step": 195
|
|
},
|
|
{
|
|
"entropy": 0.2914026416838169,
|
|
"epoch": 3.215767634854772,
|
|
"grad_norm": 3.594550609588623,
|
|
"learning_rate": 3.055879122633397e-05,
|
|
"loss": 0.1859,
|
|
"mean_token_accuracy": 0.9419218003749847,
|
|
"num_tokens": 165031.0,
|
|
"step": 196
|
|
},
|
|
{
|
|
"entropy": 0.29661769419908524,
|
|
"epoch": 3.232365145228216,
|
|
"grad_norm": 2.6744418144226074,
|
|
"learning_rate": 3.006932885558697e-05,
|
|
"loss": 0.1631,
|
|
"mean_token_accuracy": 0.962583601474762,
|
|
"num_tokens": 165486.0,
|
|
"step": 197
|
|
},
|
|
{
|
|
"entropy": 0.26884079724550247,
|
|
"epoch": 3.2489626556016598,
|
|
"grad_norm": 3.2280545234680176,
|
|
"learning_rate": 2.9582126823599876e-05,
|
|
"loss": 0.1741,
|
|
"mean_token_accuracy": 0.9312031865119934,
|
|
"num_tokens": 165852.0,
|
|
"step": 198
|
|
},
|
|
{
|
|
"entropy": 0.5130668357014656,
|
|
"epoch": 3.2655601659751037,
|
|
"grad_norm": 1.2567466497421265,
|
|
"learning_rate": 2.9097240383988e-05,
|
|
"loss": 0.5013,
|
|
"mean_token_accuracy": 0.8647334575653076,
|
|
"num_tokens": 167543.0,
|
|
"step": 199
|
|
},
|
|
{
|
|
"entropy": 0.594046100974083,
|
|
"epoch": 3.2821576763485476,
|
|
"grad_norm": 1.816318154335022,
|
|
"learning_rate": 2.8614724527755165e-05,
|
|
"loss": 0.5655,
|
|
"mean_token_accuracy": 0.8496900200843811,
|
|
"num_tokens": 169003.0,
|
|
"step": 200
|
|
},
|
|
{
|
|
"entropy": 0.6586759090423584,
|
|
"epoch": 3.2987551867219915,
|
|
"grad_norm": 3.464672088623047,
|
|
"learning_rate": 2.8134633977057235e-05,
|
|
"loss": 0.7252,
|
|
"mean_token_accuracy": 0.8186280876398087,
|
|
"num_tokens": 170336.0,
|
|
"step": 201
|
|
},
|
|
{
|
|
"entropy": 0.665482722222805,
|
|
"epoch": 3.3153526970954355,
|
|
"grad_norm": 2.9167168140411377,
|
|
"learning_rate": 2.7657023178995957e-05,
|
|
"loss": 0.6155,
|
|
"mean_token_accuracy": 0.8501123189926147,
|
|
"num_tokens": 171476.0,
|
|
"step": 202
|
|
},
|
|
{
|
|
"entropy": 0.37374667823314667,
|
|
"epoch": 3.33195020746888,
|
|
"grad_norm": 2.652055501937866,
|
|
"learning_rate": 2.7181946299444206e-05,
|
|
"loss": 0.2669,
|
|
"mean_token_accuracy": 0.9233611226081848,
|
|
"num_tokens": 172413.0,
|
|
"step": 203
|
|
},
|
|
{
|
|
"entropy": 0.4015509784221649,
|
|
"epoch": 3.3485477178423237,
|
|
"grad_norm": 4.198200702667236,
|
|
"learning_rate": 2.6709457216902923e-05,
|
|
"loss": 0.3356,
|
|
"mean_token_accuracy": 0.8950087577104568,
|
|
"num_tokens": 173207.0,
|
|
"step": 204
|
|
},
|
|
{
|
|
"entropy": 0.4464033991098404,
|
|
"epoch": 3.3651452282157677,
|
|
"grad_norm": 3.859204053878784,
|
|
"learning_rate": 2.6239609516390885e-05,
|
|
"loss": 0.359,
|
|
"mean_token_accuracy": 0.9043852537870407,
|
|
"num_tokens": 173938.0,
|
|
"step": 205
|
|
},
|
|
{
|
|
"entropy": 0.5395098552107811,
|
|
"epoch": 3.3817427385892116,
|
|
"grad_norm": 3.422429084777832,
|
|
"learning_rate": 2.5772456483367497e-05,
|
|
"loss": 0.4296,
|
|
"mean_token_accuracy": 0.8937343955039978,
|
|
"num_tokens": 174608.0,
|
|
"step": 206
|
|
},
|
|
{
|
|
"entropy": 0.37649453803896904,
|
|
"epoch": 3.3983402489626555,
|
|
"grad_norm": 2.677446126937866,
|
|
"learning_rate": 2.53080510976898e-05,
|
|
"loss": 0.2481,
|
|
"mean_token_accuracy": 0.9350832402706146,
|
|
"num_tokens": 175197.0,
|
|
"step": 207
|
|
},
|
|
{
|
|
"entropy": 0.4082087576389313,
|
|
"epoch": 3.4149377593360994,
|
|
"grad_norm": 2.799633026123047,
|
|
"learning_rate": 2.484644602760389e-05,
|
|
"loss": 0.2419,
|
|
"mean_token_accuracy": 0.9391117542982101,
|
|
"num_tokens": 175740.0,
|
|
"step": 208
|
|
},
|
|
{
|
|
"entropy": 0.37681715935468674,
|
|
"epoch": 3.431535269709544,
|
|
"grad_norm": 2.437453508377075,
|
|
"learning_rate": 2.4387693623771957e-05,
|
|
"loss": 0.2124,
|
|
"mean_token_accuracy": 0.9485742002725601,
|
|
"num_tokens": 176250.0,
|
|
"step": 209
|
|
},
|
|
{
|
|
"entropy": 0.32512830942869186,
|
|
"epoch": 3.4481327800829877,
|
|
"grad_norm": 3.021730899810791,
|
|
"learning_rate": 2.393184591333507e-05,
|
|
"loss": 0.264,
|
|
"mean_token_accuracy": 0.940506711602211,
|
|
"num_tokens": 176726.0,
|
|
"step": 210
|
|
},
|
|
{
|
|
"entropy": 0.2483925148844719,
|
|
"epoch": 3.4647302904564317,
|
|
"grad_norm": 2.603163957595825,
|
|
"learning_rate": 2.347895459401288e-05,
|
|
"loss": 0.1347,
|
|
"mean_token_accuracy": 0.9562080502510071,
|
|
"num_tokens": 177163.0,
|
|
"step": 211
|
|
},
|
|
{
|
|
"entropy": 0.23566309362649918,
|
|
"epoch": 3.4813278008298756,
|
|
"grad_norm": 2.984252452850342,
|
|
"learning_rate": 2.3029071028240434e-05,
|
|
"loss": 0.1301,
|
|
"mean_token_accuracy": 0.9639357030391693,
|
|
"num_tokens": 177585.0,
|
|
"step": 212
|
|
},
|
|
{
|
|
"entropy": 0.30283595249056816,
|
|
"epoch": 3.4979253112033195,
|
|
"grad_norm": 2.2506368160247803,
|
|
"learning_rate": 2.258224623734333e-05,
|
|
"loss": 0.1524,
|
|
"mean_token_accuracy": 0.9610457569360733,
|
|
"num_tokens": 177961.0,
|
|
"step": 213
|
|
},
|
|
{
|
|
"entropy": 0.6629791855812073,
|
|
"epoch": 3.5145228215767634,
|
|
"grad_norm": 2.0996663570404053,
|
|
"learning_rate": 2.2138530895751237e-05,
|
|
"loss": 0.6517,
|
|
"mean_token_accuracy": 0.8251046538352966,
|
|
"num_tokens": 179985.0,
|
|
"step": 214
|
|
},
|
|
{
|
|
"entropy": 0.6168433576822281,
|
|
"epoch": 3.5311203319502074,
|
|
"grad_norm": 2.385413408279419,
|
|
"learning_rate": 2.169797532525103e-05,
|
|
"loss": 0.5419,
|
|
"mean_token_accuracy": 0.8522433340549469,
|
|
"num_tokens": 181356.0,
|
|
"step": 215
|
|
},
|
|
{
|
|
"entropy": 0.5381506308913231,
|
|
"epoch": 3.5477178423236513,
|
|
"grad_norm": 1.9651310443878174,
|
|
"learning_rate": 2.126062948927966e-05,
|
|
"loss": 0.366,
|
|
"mean_token_accuracy": 0.9021719694137573,
|
|
"num_tokens": 182489.0,
|
|
"step": 216
|
|
},
|
|
{
|
|
"entropy": 0.5477860048413277,
|
|
"epoch": 3.564315352697095,
|
|
"grad_norm": 2.2163186073303223,
|
|
"learning_rate": 2.082654298725793e-05,
|
|
"loss": 0.4651,
|
|
"mean_token_accuracy": 0.8771954923868179,
|
|
"num_tokens": 183524.0,
|
|
"step": 217
|
|
},
|
|
{
|
|
"entropy": 0.4866204559803009,
|
|
"epoch": 3.5809128630705396,
|
|
"grad_norm": 2.5803163051605225,
|
|
"learning_rate": 2.0395765048965338e-05,
|
|
"loss": 0.3798,
|
|
"mean_token_accuracy": 0.895937517285347,
|
|
"num_tokens": 184507.0,
|
|
"step": 218
|
|
},
|
|
{
|
|
"entropy": 0.507550872862339,
|
|
"epoch": 3.5975103734439835,
|
|
"grad_norm": 2.8360655307769775,
|
|
"learning_rate": 1.996834452895695e-05,
|
|
"loss": 0.3611,
|
|
"mean_token_accuracy": 0.9070864617824554,
|
|
"num_tokens": 185458.0,
|
|
"step": 219
|
|
},
|
|
{
|
|
"entropy": 0.4657301604747772,
|
|
"epoch": 3.6141078838174274,
|
|
"grad_norm": 2.194333553314209,
|
|
"learning_rate": 1.9544329901022774e-05,
|
|
"loss": 0.3005,
|
|
"mean_token_accuracy": 0.9226408004760742,
|
|
"num_tokens": 186344.0,
|
|
"step": 220
|
|
},
|
|
{
|
|
"entropy": 0.3825162798166275,
|
|
"epoch": 3.6307053941908713,
|
|
"grad_norm": 2.246577739715576,
|
|
"learning_rate": 1.912376925269041e-05,
|
|
"loss": 0.2462,
|
|
"mean_token_accuracy": 0.9420317560434341,
|
|
"num_tokens": 187132.0,
|
|
"step": 221
|
|
},
|
|
{
|
|
"entropy": 0.5880134254693985,
|
|
"epoch": 3.6473029045643153,
|
|
"grad_norm": 3.324869394302368,
|
|
"learning_rate": 1.8706710279771346e-05,
|
|
"loss": 0.4481,
|
|
"mean_token_accuracy": 0.8814945220947266,
|
|
"num_tokens": 187878.0,
|
|
"step": 222
|
|
},
|
|
{
|
|
"entropy": 0.46588296443223953,
|
|
"epoch": 3.663900414937759,
|
|
"grad_norm": 2.560573101043701,
|
|
"learning_rate": 1.8293200280951884e-05,
|
|
"loss": 0.2962,
|
|
"mean_token_accuracy": 0.9168391972780228,
|
|
"num_tokens": 188568.0,
|
|
"step": 223
|
|
},
|
|
{
|
|
"entropy": 0.4065393805503845,
|
|
"epoch": 3.6804979253112036,
|
|
"grad_norm": 2.7935709953308105,
|
|
"learning_rate": 1.7883286152428875e-05,
|
|
"loss": 0.2726,
|
|
"mean_token_accuracy": 0.9170111566781998,
|
|
"num_tokens": 189187.0,
|
|
"step": 224
|
|
},
|
|
{
|
|
"entropy": 0.4957837387919426,
|
|
"epoch": 3.6970954356846475,
|
|
"grad_norm": 2.5674972534179688,
|
|
"learning_rate": 1.747701438259132e-05,
|
|
"loss": 0.2918,
|
|
"mean_token_accuracy": 0.9252507090568542,
|
|
"num_tokens": 189768.0,
|
|
"step": 225
|
|
},
|
|
{
|
|
"entropy": 0.35758352652192116,
|
|
"epoch": 3.7136929460580914,
|
|
"grad_norm": 2.453906297683716,
|
|
"learning_rate": 1.7074431046748075e-05,
|
|
"loss": 0.2568,
|
|
"mean_token_accuracy": 0.9271868020296097,
|
|
"num_tokens": 190321.0,
|
|
"step": 226
|
|
},
|
|
{
|
|
"entropy": 0.2736184000968933,
|
|
"epoch": 3.7302904564315353,
|
|
"grad_norm": 2.352849006652832,
|
|
"learning_rate": 1.6675581801902406e-05,
|
|
"loss": 0.1523,
|
|
"mean_token_accuracy": 0.9644663035869598,
|
|
"num_tokens": 190802.0,
|
|
"step": 227
|
|
},
|
|
{
|
|
"entropy": 0.2299768067896366,
|
|
"epoch": 3.7468879668049793,
|
|
"grad_norm": 1.9265366792678833,
|
|
"learning_rate": 1.6280511881574122e-05,
|
|
"loss": 0.1308,
|
|
"mean_token_accuracy": 0.9701746851205826,
|
|
"num_tokens": 191209.0,
|
|
"step": 228
|
|
},
|
|
{
|
|
"entropy": 0.7222119271755219,
|
|
"epoch": 3.763485477178423,
|
|
"grad_norm": 2.0140905380249023,
|
|
"learning_rate": 1.5889266090669525e-05,
|
|
"loss": 0.7162,
|
|
"mean_token_accuracy": 0.8162243366241455,
|
|
"num_tokens": 192992.0,
|
|
"step": 229
|
|
},
|
|
{
|
|
"entropy": 0.7263834774494171,
|
|
"epoch": 3.780082987551867,
|
|
"grad_norm": 2.6647584438323975,
|
|
"learning_rate": 1.5501888800400204e-05,
|
|
"loss": 0.6636,
|
|
"mean_token_accuracy": 0.8170496225357056,
|
|
"num_tokens": 194413.0,
|
|
"step": 230
|
|
},
|
|
{
|
|
"entropy": 0.8200473785400391,
|
|
"epoch": 3.796680497925311,
|
|
"grad_norm": 2.6536271572113037,
|
|
"learning_rate": 1.5118423943250771e-05,
|
|
"loss": 0.7257,
|
|
"mean_token_accuracy": 0.802078515291214,
|
|
"num_tokens": 195678.0,
|
|
"step": 231
|
|
},
|
|
{
|
|
"entropy": 0.7650105357170105,
|
|
"epoch": 3.813278008298755,
|
|
"grad_norm": 2.270249366760254,
|
|
"learning_rate": 1.4738915007996574e-05,
|
|
"loss": 0.592,
|
|
"mean_token_accuracy": 0.8492171764373779,
|
|
"num_tokens": 196880.0,
|
|
"step": 232
|
|
},
|
|
{
|
|
"entropy": 0.540265865623951,
|
|
"epoch": 3.8298755186721993,
|
|
"grad_norm": 1.7297815084457397,
|
|
"learning_rate": 1.4363405034771576e-05,
|
|
"loss": 0.3759,
|
|
"mean_token_accuracy": 0.8878219872713089,
|
|
"num_tokens": 197920.0,
|
|
"step": 233
|
|
},
|
|
{
|
|
"entropy": 0.3863483667373657,
|
|
"epoch": 3.8464730290456433,
|
|
"grad_norm": 1.8610775470733643,
|
|
"learning_rate": 1.3991936610187206e-05,
|
|
"loss": 0.2328,
|
|
"mean_token_accuracy": 0.9479210078716278,
|
|
"num_tokens": 198865.0,
|
|
"step": 234
|
|
},
|
|
{
|
|
"entropy": 0.5110977366566658,
|
|
"epoch": 3.863070539419087,
|
|
"grad_norm": 2.869537830352783,
|
|
"learning_rate": 1.3624551862502538e-05,
|
|
"loss": 0.2829,
|
|
"mean_token_accuracy": 0.9214334934949875,
|
|
"num_tokens": 199683.0,
|
|
"step": 235
|
|
},
|
|
{
|
|
"entropy": 0.48182512819767,
|
|
"epoch": 3.879668049792531,
|
|
"grad_norm": 2.910742998123169,
|
|
"learning_rate": 1.3261292456846647e-05,
|
|
"loss": 0.3121,
|
|
"mean_token_accuracy": 0.9146182835102081,
|
|
"num_tokens": 200457.0,
|
|
"step": 236
|
|
},
|
|
{
|
|
"entropy": 0.4533498287200928,
|
|
"epoch": 3.896265560165975,
|
|
"grad_norm": 2.7093067169189453,
|
|
"learning_rate": 1.2902199590493202e-05,
|
|
"loss": 0.3048,
|
|
"mean_token_accuracy": 0.9243493974208832,
|
|
"num_tokens": 201164.0,
|
|
"step": 237
|
|
},
|
|
{
|
|
"entropy": 0.495280422270298,
|
|
"epoch": 3.912863070539419,
|
|
"grad_norm": 2.5722432136535645,
|
|
"learning_rate": 1.2547313988188469e-05,
|
|
"loss": 0.2904,
|
|
"mean_token_accuracy": 0.925273984670639,
|
|
"num_tokens": 201810.0,
|
|
"step": 238
|
|
},
|
|
{
|
|
"entropy": 0.36999866366386414,
|
|
"epoch": 3.9294605809128633,
|
|
"grad_norm": 2.4200632572174072,
|
|
"learning_rate": 1.219667589753251e-05,
|
|
"loss": 0.2429,
|
|
"mean_token_accuracy": 0.9331159144639969,
|
|
"num_tokens": 202407.0,
|
|
"step": 239
|
|
},
|
|
{
|
|
"entropy": 0.5503775253891945,
|
|
"epoch": 3.9460580912863072,
|
|
"grad_norm": 3.256476879119873,
|
|
"learning_rate": 1.1850325084414882e-05,
|
|
"loss": 0.3254,
|
|
"mean_token_accuracy": 0.9104706943035126,
|
|
"num_tokens": 202959.0,
|
|
"step": 240
|
|
},
|
|
{
|
|
"entropy": 0.3866705000400543,
|
|
"epoch": 3.962655601659751,
|
|
"grad_norm": 2.4496092796325684,
|
|
"learning_rate": 1.150830082850468e-05,
|
|
"loss": 0.2445,
|
|
"mean_token_accuracy": 0.9439631849527359,
|
|
"num_tokens": 203462.0,
|
|
"step": 241
|
|
},
|
|
{
|
|
"entropy": 0.2839464247226715,
|
|
"epoch": 3.979253112033195,
|
|
"grad_norm": 3.231337308883667,
|
|
"learning_rate": 1.117064191879587e-05,
|
|
"loss": 0.1669,
|
|
"mean_token_accuracy": 0.958666130900383,
|
|
"num_tokens": 203925.0,
|
|
"step": 242
|
|
},
|
|
{
|
|
"entropy": 0.2561277598142624,
|
|
"epoch": 3.995850622406639,
|
|
"grad_norm": 1.902478814125061,
|
|
"learning_rate": 1.0837386649208164e-05,
|
|
"loss": 0.1274,
|
|
"mean_token_accuracy": 0.9695109724998474,
|
|
"num_tokens": 204355.0,
|
|
"step": 243
|
|
},
|
|
{
|
|
"entropy": 0.40932202339172363,
|
|
"epoch": 4.0,
|
|
"grad_norm": 4.405113220214844,
|
|
"learning_rate": 1.0508572814244205e-05,
|
|
"loss": 0.1994,
|
|
"mean_token_accuracy": 0.921875,
|
|
"num_tokens": 204548.0,
|
|
"step": 244
|
|
}
|
|
],
|
|
"logging_steps": 1,
|
|
"max_steps": 305,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 5,
|
|
"save_steps": 500,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": false
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 9317517084426240.0,
|
|
"train_batch_size": 1,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|