Model: Neelectric/Llama-3.2-1B-Instruct_SFT_sciencefisher_v00.05 Source: Original Platform
6345 lines
173 KiB
JSON
6345 lines
173 KiB
JSON
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 3.0,
|
|
"eval_steps": 500,
|
|
"global_step": 630,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"epoch": 0.004761904761904762,
|
|
"ewc_loss": 0.0,
|
|
"grad_norm": 8.28818416595459,
|
|
"learning_rate": 0.0,
|
|
"loss": 1.7656,
|
|
"mean_token_accuracy": 0.5768666863441467,
|
|
"num_tokens": 582781.0,
|
|
"step": 1
|
|
},
|
|
{
|
|
"epoch": 0.009523809523809525,
|
|
"ewc_loss": 0.0,
|
|
"grad_norm": 8.259895324707031,
|
|
"learning_rate": 1.5873015873015874e-07,
|
|
"loss": 1.7728,
|
|
"mean_token_accuracy": 0.5752322673797607,
|
|
"num_tokens": 1163696.0,
|
|
"step": 2
|
|
},
|
|
{
|
|
"epoch": 0.014285714285714285,
|
|
"ewc_loss": 2.1941559680271894e-11,
|
|
"grad_norm": 8.165162086486816,
|
|
"learning_rate": 3.174603174603175e-07,
|
|
"loss": 1.7759,
|
|
"mean_token_accuracy": 0.5746736526489258,
|
|
"num_tokens": 1762000.0,
|
|
"step": 3
|
|
},
|
|
{
|
|
"epoch": 0.01904761904761905,
|
|
"ewc_loss": 3.9108272176235914e-10,
|
|
"grad_norm": 8.0980224609375,
|
|
"learning_rate": 4.7619047619047623e-07,
|
|
"loss": 1.7767,
|
|
"mean_token_accuracy": 0.5743035078048706,
|
|
"num_tokens": 2363228.0,
|
|
"step": 4
|
|
},
|
|
{
|
|
"epoch": 0.023809523809523808,
|
|
"ewc_loss": 2.6921043172478676e-09,
|
|
"grad_norm": 7.869298458099365,
|
|
"learning_rate": 6.34920634920635e-07,
|
|
"loss": 1.792,
|
|
"mean_token_accuracy": 0.5722930431365967,
|
|
"num_tokens": 2968748.0,
|
|
"step": 5
|
|
},
|
|
{
|
|
"epoch": 0.02857142857142857,
|
|
"ewc_loss": 1.2398231774568558e-08,
|
|
"grad_norm": 7.900315284729004,
|
|
"learning_rate": 7.936507936507937e-07,
|
|
"loss": 1.765,
|
|
"mean_token_accuracy": 0.5755925178527832,
|
|
"num_tokens": 3564062.0,
|
|
"step": 6
|
|
},
|
|
{
|
|
"epoch": 0.03333333333333333,
|
|
"ewc_loss": 3.236345946788788e-08,
|
|
"grad_norm": 7.561403274536133,
|
|
"learning_rate": 9.523809523809525e-07,
|
|
"loss": 1.7768,
|
|
"mean_token_accuracy": 0.5719801187515259,
|
|
"num_tokens": 4140352.0,
|
|
"step": 7
|
|
},
|
|
{
|
|
"epoch": 0.0380952380952381,
|
|
"ewc_loss": 5.960464477539063e-08,
|
|
"grad_norm": 7.108845233917236,
|
|
"learning_rate": 1.111111111111111e-06,
|
|
"loss": 1.7749,
|
|
"mean_token_accuracy": 0.5718611478805542,
|
|
"num_tokens": 4748067.0,
|
|
"step": 8
|
|
},
|
|
{
|
|
"epoch": 0.04285714285714286,
|
|
"ewc_loss": 1.3504177331924438e-07,
|
|
"grad_norm": 6.106722831726074,
|
|
"learning_rate": 1.26984126984127e-06,
|
|
"loss": 1.7288,
|
|
"mean_token_accuracy": 0.577852189540863,
|
|
"num_tokens": 5333791.0,
|
|
"step": 9
|
|
},
|
|
{
|
|
"epoch": 0.047619047619047616,
|
|
"ewc_loss": 2.0302832126617432e-07,
|
|
"grad_norm": 5.961868762969971,
|
|
"learning_rate": 1.4285714285714286e-06,
|
|
"loss": 1.7398,
|
|
"mean_token_accuracy": 0.5753346085548401,
|
|
"num_tokens": 5923564.0,
|
|
"step": 10
|
|
},
|
|
{
|
|
"epoch": 0.05238095238095238,
|
|
"ewc_loss": 2.849847078323364e-07,
|
|
"grad_norm": 5.554156303405762,
|
|
"learning_rate": 1.5873015873015873e-06,
|
|
"loss": 1.7099,
|
|
"mean_token_accuracy": 0.5799626111984253,
|
|
"num_tokens": 6528559.0,
|
|
"step": 11
|
|
},
|
|
{
|
|
"epoch": 0.05714285714285714,
|
|
"ewc_loss": 6.07222318649292e-07,
|
|
"grad_norm": 4.201676368713379,
|
|
"learning_rate": 1.746031746031746e-06,
|
|
"loss": 1.6596,
|
|
"mean_token_accuracy": 0.5851099491119385,
|
|
"num_tokens": 7118765.0,
|
|
"step": 12
|
|
},
|
|
{
|
|
"epoch": 0.06190476190476191,
|
|
"ewc_loss": 7.636845111846924e-07,
|
|
"grad_norm": 4.110261917114258,
|
|
"learning_rate": 1.904761904761905e-06,
|
|
"loss": 1.6598,
|
|
"mean_token_accuracy": 0.5843206644058228,
|
|
"num_tokens": 7709226.0,
|
|
"step": 13
|
|
},
|
|
{
|
|
"epoch": 0.06666666666666667,
|
|
"ewc_loss": 9.685754776000977e-07,
|
|
"grad_norm": 3.8357789516448975,
|
|
"learning_rate": 2.0634920634920634e-06,
|
|
"loss": 1.6301,
|
|
"mean_token_accuracy": 0.5904970169067383,
|
|
"num_tokens": 8298984.0,
|
|
"step": 14
|
|
},
|
|
{
|
|
"epoch": 0.07142857142857142,
|
|
"ewc_loss": 1.1771917343139648e-06,
|
|
"grad_norm": 3.742959499359131,
|
|
"learning_rate": 2.222222222222222e-06,
|
|
"loss": 1.628,
|
|
"mean_token_accuracy": 0.5896279811859131,
|
|
"num_tokens": 8875624.0,
|
|
"step": 15
|
|
},
|
|
{
|
|
"epoch": 0.0761904761904762,
|
|
"ewc_loss": 2.0712614059448242e-06,
|
|
"grad_norm": 3.0452253818511963,
|
|
"learning_rate": 2.380952380952381e-06,
|
|
"loss": 1.5687,
|
|
"mean_token_accuracy": 0.5991390943527222,
|
|
"num_tokens": 9448671.0,
|
|
"step": 16
|
|
},
|
|
{
|
|
"epoch": 0.08095238095238096,
|
|
"ewc_loss": 2.562999725341797e-06,
|
|
"grad_norm": 2.7276570796966553,
|
|
"learning_rate": 2.53968253968254e-06,
|
|
"loss": 1.555,
|
|
"mean_token_accuracy": 0.6021126508712769,
|
|
"num_tokens": 10049546.0,
|
|
"step": 17
|
|
},
|
|
{
|
|
"epoch": 0.08571428571428572,
|
|
"ewc_loss": 2.9355287551879883e-06,
|
|
"grad_norm": 2.55561900138855,
|
|
"learning_rate": 2.6984126984126986e-06,
|
|
"loss": 1.561,
|
|
"mean_token_accuracy": 0.599315881729126,
|
|
"num_tokens": 10644905.0,
|
|
"step": 18
|
|
},
|
|
{
|
|
"epoch": 0.09047619047619047,
|
|
"ewc_loss": 3.4123659133911133e-06,
|
|
"grad_norm": 2.1860873699188232,
|
|
"learning_rate": 2.8571428571428573e-06,
|
|
"loss": 1.5542,
|
|
"mean_token_accuracy": 0.6018921136856079,
|
|
"num_tokens": 11239583.0,
|
|
"step": 19
|
|
},
|
|
{
|
|
"epoch": 0.09523809523809523,
|
|
"ewc_loss": 3.7848949432373047e-06,
|
|
"grad_norm": 1.9437686204910278,
|
|
"learning_rate": 3.015873015873016e-06,
|
|
"loss": 1.5297,
|
|
"mean_token_accuracy": 0.6070865392684937,
|
|
"num_tokens": 11827320.0,
|
|
"step": 20
|
|
},
|
|
{
|
|
"epoch": 0.1,
|
|
"ewc_loss": 4.6193599700927734e-06,
|
|
"grad_norm": 1.9274426698684692,
|
|
"learning_rate": 3.1746031746031746e-06,
|
|
"loss": 1.4816,
|
|
"mean_token_accuracy": 0.615209698677063,
|
|
"num_tokens": 12425511.0,
|
|
"step": 21
|
|
},
|
|
{
|
|
"epoch": 0.10476190476190476,
|
|
"ewc_loss": 5.7220458984375e-06,
|
|
"grad_norm": 2.455000162124634,
|
|
"learning_rate": 3.3333333333333333e-06,
|
|
"loss": 1.4871,
|
|
"mean_token_accuracy": 0.6138166189193726,
|
|
"num_tokens": 13015708.0,
|
|
"step": 22
|
|
},
|
|
{
|
|
"epoch": 0.10952380952380952,
|
|
"ewc_loss": 6.67572021484375e-06,
|
|
"grad_norm": 2.279705286026001,
|
|
"learning_rate": 3.492063492063492e-06,
|
|
"loss": 1.4701,
|
|
"mean_token_accuracy": 0.6164612770080566,
|
|
"num_tokens": 13608875.0,
|
|
"step": 23
|
|
},
|
|
{
|
|
"epoch": 0.11428571428571428,
|
|
"ewc_loss": 7.450580596923828e-06,
|
|
"grad_norm": 2.1044373512268066,
|
|
"learning_rate": 3.6507936507936507e-06,
|
|
"loss": 1.4775,
|
|
"mean_token_accuracy": 0.6139867305755615,
|
|
"num_tokens": 14204297.0,
|
|
"step": 24
|
|
},
|
|
{
|
|
"epoch": 0.11904761904761904,
|
|
"ewc_loss": 8.046627044677734e-06,
|
|
"grad_norm": 1.8415229320526123,
|
|
"learning_rate": 3.80952380952381e-06,
|
|
"loss": 1.4629,
|
|
"mean_token_accuracy": 0.6163859367370605,
|
|
"num_tokens": 14782206.0,
|
|
"step": 25
|
|
},
|
|
{
|
|
"epoch": 0.12380952380952381,
|
|
"ewc_loss": 8.58306884765625e-06,
|
|
"grad_norm": 1.6033260822296143,
|
|
"learning_rate": 3.968253968253968e-06,
|
|
"loss": 1.4404,
|
|
"mean_token_accuracy": 0.6208978891372681,
|
|
"num_tokens": 15377829.0,
|
|
"step": 26
|
|
},
|
|
{
|
|
"epoch": 0.12857142857142856,
|
|
"ewc_loss": 9.179115295410156e-06,
|
|
"grad_norm": 1.3737297058105469,
|
|
"learning_rate": 4.126984126984127e-06,
|
|
"loss": 1.4341,
|
|
"mean_token_accuracy": 0.6220537424087524,
|
|
"num_tokens": 15975819.0,
|
|
"step": 27
|
|
},
|
|
{
|
|
"epoch": 0.13333333333333333,
|
|
"ewc_loss": 9.655952453613281e-06,
|
|
"grad_norm": 1.239226222038269,
|
|
"learning_rate": 4.2857142857142855e-06,
|
|
"loss": 1.4209,
|
|
"mean_token_accuracy": 0.6248480081558228,
|
|
"num_tokens": 16577839.0,
|
|
"step": 28
|
|
},
|
|
{
|
|
"epoch": 0.1380952380952381,
|
|
"ewc_loss": 1.0192394256591797e-05,
|
|
"grad_norm": 1.2452380657196045,
|
|
"learning_rate": 4.444444444444444e-06,
|
|
"loss": 1.4146,
|
|
"mean_token_accuracy": 0.6254827976226807,
|
|
"num_tokens": 17164831.0,
|
|
"step": 29
|
|
},
|
|
{
|
|
"epoch": 0.14285714285714285,
|
|
"ewc_loss": 1.0907649993896484e-05,
|
|
"grad_norm": 1.3038355112075806,
|
|
"learning_rate": 4.603174603174604e-06,
|
|
"loss": 1.401,
|
|
"mean_token_accuracy": 0.6285873651504517,
|
|
"num_tokens": 17770476.0,
|
|
"step": 30
|
|
},
|
|
{
|
|
"epoch": 0.14761904761904762,
|
|
"ewc_loss": 1.1324882507324219e-05,
|
|
"grad_norm": 1.25835382938385,
|
|
"learning_rate": 4.761904761904762e-06,
|
|
"loss": 1.3869,
|
|
"mean_token_accuracy": 0.6299410462379456,
|
|
"num_tokens": 18360862.0,
|
|
"step": 31
|
|
},
|
|
{
|
|
"epoch": 0.1523809523809524,
|
|
"ewc_loss": 1.2040138244628906e-05,
|
|
"grad_norm": 1.1333407163619995,
|
|
"learning_rate": 4.920634920634921e-06,
|
|
"loss": 1.402,
|
|
"mean_token_accuracy": 0.6267038583755493,
|
|
"num_tokens": 18944338.0,
|
|
"step": 32
|
|
},
|
|
{
|
|
"epoch": 0.15714285714285714,
|
|
"ewc_loss": 1.2516975402832031e-05,
|
|
"grad_norm": 0.9955130815505981,
|
|
"learning_rate": 5.07936507936508e-06,
|
|
"loss": 1.376,
|
|
"mean_token_accuracy": 0.6323812007904053,
|
|
"num_tokens": 19540189.0,
|
|
"step": 33
|
|
},
|
|
{
|
|
"epoch": 0.1619047619047619,
|
|
"ewc_loss": 1.329183578491211e-05,
|
|
"grad_norm": 1.0018597841262817,
|
|
"learning_rate": 5.2380952380952384e-06,
|
|
"loss": 1.3726,
|
|
"mean_token_accuracy": 0.633635938167572,
|
|
"num_tokens": 20138131.0,
|
|
"step": 34
|
|
},
|
|
{
|
|
"epoch": 0.16666666666666666,
|
|
"ewc_loss": 1.3649463653564453e-05,
|
|
"grad_norm": 1.0016719102859497,
|
|
"learning_rate": 5.396825396825397e-06,
|
|
"loss": 1.3891,
|
|
"mean_token_accuracy": 0.6291859149932861,
|
|
"num_tokens": 20735187.0,
|
|
"step": 35
|
|
},
|
|
{
|
|
"epoch": 0.17142857142857143,
|
|
"ewc_loss": 1.4066696166992188e-05,
|
|
"grad_norm": 1.0009276866912842,
|
|
"learning_rate": 5.555555555555557e-06,
|
|
"loss": 1.3652,
|
|
"mean_token_accuracy": 0.633061945438385,
|
|
"num_tokens": 21316383.0,
|
|
"step": 36
|
|
},
|
|
{
|
|
"epoch": 0.1761904761904762,
|
|
"ewc_loss": 1.4960765838623047e-05,
|
|
"grad_norm": 0.88076251745224,
|
|
"learning_rate": 5.7142857142857145e-06,
|
|
"loss": 1.3418,
|
|
"mean_token_accuracy": 0.6395527124404907,
|
|
"num_tokens": 21910626.0,
|
|
"step": 37
|
|
},
|
|
{
|
|
"epoch": 0.18095238095238095,
|
|
"ewc_loss": 1.5497207641601562e-05,
|
|
"grad_norm": 0.8105459213256836,
|
|
"learning_rate": 5.873015873015874e-06,
|
|
"loss": 1.3632,
|
|
"mean_token_accuracy": 0.6336631774902344,
|
|
"num_tokens": 22503955.0,
|
|
"step": 38
|
|
},
|
|
{
|
|
"epoch": 0.18571428571428572,
|
|
"ewc_loss": 1.5735626220703125e-05,
|
|
"grad_norm": 0.7730630040168762,
|
|
"learning_rate": 6.031746031746032e-06,
|
|
"loss": 1.3581,
|
|
"mean_token_accuracy": 0.6350871324539185,
|
|
"num_tokens": 23093310.0,
|
|
"step": 39
|
|
},
|
|
{
|
|
"epoch": 0.19047619047619047,
|
|
"ewc_loss": 1.621246337890625e-05,
|
|
"grad_norm": 0.7723091840744019,
|
|
"learning_rate": 6.1904761904761914e-06,
|
|
"loss": 1.3289,
|
|
"mean_token_accuracy": 0.6414858102798462,
|
|
"num_tokens": 23681028.0,
|
|
"step": 40
|
|
},
|
|
{
|
|
"epoch": 0.19523809523809524,
|
|
"ewc_loss": 1.6450881958007812e-05,
|
|
"grad_norm": 0.7276416420936584,
|
|
"learning_rate": 6.349206349206349e-06,
|
|
"loss": 1.3311,
|
|
"mean_token_accuracy": 0.6410821080207825,
|
|
"num_tokens": 24275532.0,
|
|
"step": 41
|
|
},
|
|
{
|
|
"epoch": 0.2,
|
|
"ewc_loss": 1.728534698486328e-05,
|
|
"grad_norm": 0.7141566276550293,
|
|
"learning_rate": 6.507936507936509e-06,
|
|
"loss": 1.335,
|
|
"mean_token_accuracy": 0.6405354142189026,
|
|
"num_tokens": 24868054.0,
|
|
"step": 42
|
|
},
|
|
{
|
|
"epoch": 0.20476190476190476,
|
|
"ewc_loss": 1.7642974853515625e-05,
|
|
"grad_norm": 0.6833614110946655,
|
|
"learning_rate": 6.666666666666667e-06,
|
|
"loss": 1.3365,
|
|
"mean_token_accuracy": 0.6393892765045166,
|
|
"num_tokens": 25459842.0,
|
|
"step": 43
|
|
},
|
|
{
|
|
"epoch": 0.20952380952380953,
|
|
"ewc_loss": 1.823902130126953e-05,
|
|
"grad_norm": 0.6787976622581482,
|
|
"learning_rate": 6.825396825396826e-06,
|
|
"loss": 1.3431,
|
|
"mean_token_accuracy": 0.6369466185569763,
|
|
"num_tokens": 26051340.0,
|
|
"step": 44
|
|
},
|
|
{
|
|
"epoch": 0.21428571428571427,
|
|
"ewc_loss": 1.8715858459472656e-05,
|
|
"grad_norm": 0.6998192667961121,
|
|
"learning_rate": 6.984126984126984e-06,
|
|
"loss": 1.3229,
|
|
"mean_token_accuracy": 0.6426899433135986,
|
|
"num_tokens": 26635240.0,
|
|
"step": 45
|
|
},
|
|
{
|
|
"epoch": 0.21904761904761905,
|
|
"ewc_loss": 1.9311904907226562e-05,
|
|
"grad_norm": 0.6801661252975464,
|
|
"learning_rate": 7.1428571428571436e-06,
|
|
"loss": 1.324,
|
|
"mean_token_accuracy": 0.6417496204376221,
|
|
"num_tokens": 27228570.0,
|
|
"step": 46
|
|
},
|
|
{
|
|
"epoch": 0.22380952380952382,
|
|
"ewc_loss": 1.9788742065429688e-05,
|
|
"grad_norm": 0.7181822657585144,
|
|
"learning_rate": 7.301587301587301e-06,
|
|
"loss": 1.3182,
|
|
"mean_token_accuracy": 0.6434049606323242,
|
|
"num_tokens": 27825958.0,
|
|
"step": 47
|
|
},
|
|
{
|
|
"epoch": 0.22857142857142856,
|
|
"ewc_loss": 2.0503997802734375e-05,
|
|
"grad_norm": 0.678921639919281,
|
|
"learning_rate": 7.460317460317461e-06,
|
|
"loss": 1.3118,
|
|
"mean_token_accuracy": 0.6430183053016663,
|
|
"num_tokens": 28418470.0,
|
|
"step": 48
|
|
},
|
|
{
|
|
"epoch": 0.23333333333333334,
|
|
"ewc_loss": 2.110004425048828e-05,
|
|
"grad_norm": 0.6804054975509644,
|
|
"learning_rate": 7.61904761904762e-06,
|
|
"loss": 1.3085,
|
|
"mean_token_accuracy": 0.6444772481918335,
|
|
"num_tokens": 29013060.0,
|
|
"step": 49
|
|
},
|
|
{
|
|
"epoch": 0.23809523809523808,
|
|
"ewc_loss": 2.1696090698242188e-05,
|
|
"grad_norm": 0.6719395518302917,
|
|
"learning_rate": 7.77777777777778e-06,
|
|
"loss": 1.3174,
|
|
"mean_token_accuracy": 0.6415056586265564,
|
|
"num_tokens": 29624709.0,
|
|
"step": 50
|
|
},
|
|
{
|
|
"epoch": 0.24285714285714285,
|
|
"ewc_loss": 2.2530555725097656e-05,
|
|
"grad_norm": 0.646429717540741,
|
|
"learning_rate": 7.936507936507936e-06,
|
|
"loss": 1.31,
|
|
"mean_token_accuracy": 0.6434013247489929,
|
|
"num_tokens": 30227928.0,
|
|
"step": 51
|
|
},
|
|
{
|
|
"epoch": 0.24761904761904763,
|
|
"ewc_loss": 2.3126602172851562e-05,
|
|
"grad_norm": 0.6325107216835022,
|
|
"learning_rate": 8.095238095238097e-06,
|
|
"loss": 1.3115,
|
|
"mean_token_accuracy": 0.6422454118728638,
|
|
"num_tokens": 30823383.0,
|
|
"step": 52
|
|
},
|
|
{
|
|
"epoch": 0.2523809523809524,
|
|
"ewc_loss": 2.3484230041503906e-05,
|
|
"grad_norm": 0.6212852001190186,
|
|
"learning_rate": 8.253968253968254e-06,
|
|
"loss": 1.2929,
|
|
"mean_token_accuracy": 0.6477320790290833,
|
|
"num_tokens": 31418593.0,
|
|
"step": 53
|
|
},
|
|
{
|
|
"epoch": 0.2571428571428571,
|
|
"ewc_loss": 2.4199485778808594e-05,
|
|
"grad_norm": 0.6817027926445007,
|
|
"learning_rate": 8.412698412698414e-06,
|
|
"loss": 1.2855,
|
|
"mean_token_accuracy": 0.6489397287368774,
|
|
"num_tokens": 32008377.0,
|
|
"step": 54
|
|
},
|
|
{
|
|
"epoch": 0.2619047619047619,
|
|
"ewc_loss": 2.467632293701172e-05,
|
|
"grad_norm": 0.6682056188583374,
|
|
"learning_rate": 8.571428571428571e-06,
|
|
"loss": 1.2926,
|
|
"mean_token_accuracy": 0.6463344097137451,
|
|
"num_tokens": 32600302.0,
|
|
"step": 55
|
|
},
|
|
{
|
|
"epoch": 0.26666666666666666,
|
|
"ewc_loss": 2.5272369384765625e-05,
|
|
"grad_norm": 0.6403867602348328,
|
|
"learning_rate": 8.730158730158731e-06,
|
|
"loss": 1.2938,
|
|
"mean_token_accuracy": 0.6465506553649902,
|
|
"num_tokens": 33201147.0,
|
|
"step": 56
|
|
},
|
|
{
|
|
"epoch": 0.2714285714285714,
|
|
"ewc_loss": 2.574920654296875e-05,
|
|
"grad_norm": 0.598288893699646,
|
|
"learning_rate": 8.888888888888888e-06,
|
|
"loss": 1.2734,
|
|
"mean_token_accuracy": 0.6509529948234558,
|
|
"num_tokens": 33790565.0,
|
|
"step": 57
|
|
},
|
|
{
|
|
"epoch": 0.2761904761904762,
|
|
"ewc_loss": 2.658367156982422e-05,
|
|
"grad_norm": 0.6835994720458984,
|
|
"learning_rate": 9.047619047619049e-06,
|
|
"loss": 1.279,
|
|
"mean_token_accuracy": 0.6503703594207764,
|
|
"num_tokens": 34387187.0,
|
|
"step": 58
|
|
},
|
|
{
|
|
"epoch": 0.28095238095238095,
|
|
"ewc_loss": 2.7179718017578125e-05,
|
|
"grad_norm": 0.6436572670936584,
|
|
"learning_rate": 9.206349206349207e-06,
|
|
"loss": 1.2876,
|
|
"mean_token_accuracy": 0.6484526991844177,
|
|
"num_tokens": 35000480.0,
|
|
"step": 59
|
|
},
|
|
{
|
|
"epoch": 0.2857142857142857,
|
|
"ewc_loss": 2.8252601623535156e-05,
|
|
"grad_norm": 0.6563123464584351,
|
|
"learning_rate": 9.365079365079366e-06,
|
|
"loss": 1.2704,
|
|
"mean_token_accuracy": 0.6524369716644287,
|
|
"num_tokens": 35588577.0,
|
|
"step": 60
|
|
},
|
|
{
|
|
"epoch": 0.2904761904761905,
|
|
"ewc_loss": 2.8848648071289062e-05,
|
|
"grad_norm": 0.6638946533203125,
|
|
"learning_rate": 9.523809523809525e-06,
|
|
"loss": 1.2741,
|
|
"mean_token_accuracy": 0.6505381464958191,
|
|
"num_tokens": 36179186.0,
|
|
"step": 61
|
|
},
|
|
{
|
|
"epoch": 0.29523809523809524,
|
|
"ewc_loss": 2.968311309814453e-05,
|
|
"grad_norm": 0.6190217733383179,
|
|
"learning_rate": 9.682539682539683e-06,
|
|
"loss": 1.2814,
|
|
"mean_token_accuracy": 0.6496777534484863,
|
|
"num_tokens": 36787338.0,
|
|
"step": 62
|
|
},
|
|
{
|
|
"epoch": 0.3,
|
|
"ewc_loss": 3.0279159545898438e-05,
|
|
"grad_norm": 0.6610846519470215,
|
|
"learning_rate": 9.841269841269842e-06,
|
|
"loss": 1.2704,
|
|
"mean_token_accuracy": 0.6511437892913818,
|
|
"num_tokens": 37376232.0,
|
|
"step": 63
|
|
},
|
|
{
|
|
"epoch": 0.3047619047619048,
|
|
"ewc_loss": 3.075599670410156e-05,
|
|
"grad_norm": 0.5970390439033508,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.262,
|
|
"mean_token_accuracy": 0.6535030603408813,
|
|
"num_tokens": 37965066.0,
|
|
"step": 64
|
|
},
|
|
{
|
|
"epoch": 0.30952380952380953,
|
|
"ewc_loss": 3.147125244140625e-05,
|
|
"grad_norm": 0.6605581641197205,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2755,
|
|
"mean_token_accuracy": 0.6500763893127441,
|
|
"num_tokens": 38556474.0,
|
|
"step": 65
|
|
},
|
|
{
|
|
"epoch": 0.3142857142857143,
|
|
"ewc_loss": 3.24249267578125e-05,
|
|
"grad_norm": 0.5896777510643005,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2863,
|
|
"mean_token_accuracy": 0.6481262445449829,
|
|
"num_tokens": 39153957.0,
|
|
"step": 66
|
|
},
|
|
{
|
|
"epoch": 0.319047619047619,
|
|
"ewc_loss": 3.2901763916015625e-05,
|
|
"grad_norm": 0.656186580657959,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2738,
|
|
"mean_token_accuracy": 0.6505764126777649,
|
|
"num_tokens": 39743079.0,
|
|
"step": 67
|
|
},
|
|
{
|
|
"epoch": 0.3238095238095238,
|
|
"ewc_loss": 3.361701965332031e-05,
|
|
"grad_norm": 0.6819005608558655,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2586,
|
|
"mean_token_accuracy": 0.6546281576156616,
|
|
"num_tokens": 40341422.0,
|
|
"step": 68
|
|
},
|
|
{
|
|
"epoch": 0.32857142857142857,
|
|
"ewc_loss": 3.457069396972656e-05,
|
|
"grad_norm": 0.6469867825508118,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.257,
|
|
"mean_token_accuracy": 0.6546445488929749,
|
|
"num_tokens": 40930579.0,
|
|
"step": 69
|
|
},
|
|
{
|
|
"epoch": 0.3333333333333333,
|
|
"ewc_loss": 3.504753112792969e-05,
|
|
"grad_norm": 0.6735019087791443,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2523,
|
|
"mean_token_accuracy": 0.6560516953468323,
|
|
"num_tokens": 41521392.0,
|
|
"step": 70
|
|
},
|
|
{
|
|
"epoch": 0.3380952380952381,
|
|
"ewc_loss": 3.5762786865234375e-05,
|
|
"grad_norm": 0.6763930320739746,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2701,
|
|
"mean_token_accuracy": 0.6517821550369263,
|
|
"num_tokens": 42126117.0,
|
|
"step": 71
|
|
},
|
|
{
|
|
"epoch": 0.34285714285714286,
|
|
"ewc_loss": 3.647804260253906e-05,
|
|
"grad_norm": 0.6514705419540405,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2486,
|
|
"mean_token_accuracy": 0.6564611196517944,
|
|
"num_tokens": 42717085.0,
|
|
"step": 72
|
|
},
|
|
{
|
|
"epoch": 0.3476190476190476,
|
|
"ewc_loss": 3.743171691894531e-05,
|
|
"grad_norm": 0.7102163434028625,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2525,
|
|
"mean_token_accuracy": 0.6550353765487671,
|
|
"num_tokens": 43300932.0,
|
|
"step": 73
|
|
},
|
|
{
|
|
"epoch": 0.3523809523809524,
|
|
"ewc_loss": 3.790855407714844e-05,
|
|
"grad_norm": 0.7337051033973694,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2663,
|
|
"mean_token_accuracy": 0.651132345199585,
|
|
"num_tokens": 43885512.0,
|
|
"step": 74
|
|
},
|
|
{
|
|
"epoch": 0.35714285714285715,
|
|
"ewc_loss": 3.886222839355469e-05,
|
|
"grad_norm": 0.6182963252067566,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2513,
|
|
"mean_token_accuracy": 0.6549155116081238,
|
|
"num_tokens": 44482626.0,
|
|
"step": 75
|
|
},
|
|
{
|
|
"epoch": 0.3619047619047619,
|
|
"ewc_loss": 3.933906555175781e-05,
|
|
"grad_norm": 0.7100811004638672,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2607,
|
|
"mean_token_accuracy": 0.6523761749267578,
|
|
"num_tokens": 45073331.0,
|
|
"step": 76
|
|
},
|
|
{
|
|
"epoch": 0.36666666666666664,
|
|
"ewc_loss": 3.981590270996094e-05,
|
|
"grad_norm": 0.7015809416770935,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.259,
|
|
"mean_token_accuracy": 0.6540762186050415,
|
|
"num_tokens": 45683001.0,
|
|
"step": 77
|
|
},
|
|
{
|
|
"epoch": 0.37142857142857144,
|
|
"ewc_loss": 4.076957702636719e-05,
|
|
"grad_norm": 0.6069739460945129,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2624,
|
|
"mean_token_accuracy": 0.6536201238632202,
|
|
"num_tokens": 46280871.0,
|
|
"step": 78
|
|
},
|
|
{
|
|
"epoch": 0.3761904761904762,
|
|
"ewc_loss": 4.100799560546875e-05,
|
|
"grad_norm": 0.6717156171798706,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2426,
|
|
"mean_token_accuracy": 0.6560376882553101,
|
|
"num_tokens": 46860927.0,
|
|
"step": 79
|
|
},
|
|
{
|
|
"epoch": 0.38095238095238093,
|
|
"ewc_loss": 4.172325134277344e-05,
|
|
"grad_norm": 0.7129572033882141,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2582,
|
|
"mean_token_accuracy": 0.653274416923523,
|
|
"num_tokens": 47450747.0,
|
|
"step": 80
|
|
},
|
|
{
|
|
"epoch": 0.38571428571428573,
|
|
"ewc_loss": 4.220008850097656e-05,
|
|
"grad_norm": 0.6106706261634827,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2554,
|
|
"mean_token_accuracy": 0.6550416946411133,
|
|
"num_tokens": 48053355.0,
|
|
"step": 81
|
|
},
|
|
{
|
|
"epoch": 0.3904761904761905,
|
|
"ewc_loss": 4.291534423828125e-05,
|
|
"grad_norm": 0.7349791526794434,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2265,
|
|
"mean_token_accuracy": 0.6596176624298096,
|
|
"num_tokens": 48654406.0,
|
|
"step": 82
|
|
},
|
|
{
|
|
"epoch": 0.3952380952380952,
|
|
"ewc_loss": 4.3392181396484375e-05,
|
|
"grad_norm": 0.722030758857727,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2339,
|
|
"mean_token_accuracy": 0.6581803560256958,
|
|
"num_tokens": 49253902.0,
|
|
"step": 83
|
|
},
|
|
{
|
|
"epoch": 0.4,
|
|
"ewc_loss": 4.363059997558594e-05,
|
|
"grad_norm": 0.6336811184883118,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.251,
|
|
"mean_token_accuracy": 0.6550606489181519,
|
|
"num_tokens": 49851728.0,
|
|
"step": 84
|
|
},
|
|
{
|
|
"epoch": 0.40476190476190477,
|
|
"ewc_loss": 4.410743713378906e-05,
|
|
"grad_norm": 0.6406584978103638,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.257,
|
|
"mean_token_accuracy": 0.6533263325691223,
|
|
"num_tokens": 50456288.0,
|
|
"step": 85
|
|
},
|
|
{
|
|
"epoch": 0.4095238095238095,
|
|
"ewc_loss": 4.482269287109375e-05,
|
|
"grad_norm": 0.6928249597549438,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2635,
|
|
"mean_token_accuracy": 0.6524448394775391,
|
|
"num_tokens": 51058176.0,
|
|
"step": 86
|
|
},
|
|
{
|
|
"epoch": 0.4142857142857143,
|
|
"ewc_loss": 4.553794860839844e-05,
|
|
"grad_norm": 0.6487959027290344,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2485,
|
|
"mean_token_accuracy": 0.6554371118545532,
|
|
"num_tokens": 51665178.0,
|
|
"step": 87
|
|
},
|
|
{
|
|
"epoch": 0.41904761904761906,
|
|
"ewc_loss": 4.601478576660156e-05,
|
|
"grad_norm": 0.7834141254425049,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2335,
|
|
"mean_token_accuracy": 0.6585109233856201,
|
|
"num_tokens": 52237427.0,
|
|
"step": 88
|
|
},
|
|
{
|
|
"epoch": 0.4238095238095238,
|
|
"ewc_loss": 4.673004150390625e-05,
|
|
"grad_norm": 0.6563471555709839,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2554,
|
|
"mean_token_accuracy": 0.652886688709259,
|
|
"num_tokens": 52850605.0,
|
|
"step": 89
|
|
},
|
|
{
|
|
"epoch": 0.42857142857142855,
|
|
"ewc_loss": 4.696846008300781e-05,
|
|
"grad_norm": 0.65048748254776,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2168,
|
|
"mean_token_accuracy": 0.6615410447120667,
|
|
"num_tokens": 53435907.0,
|
|
"step": 90
|
|
},
|
|
{
|
|
"epoch": 0.43333333333333335,
|
|
"ewc_loss": 4.7206878662109375e-05,
|
|
"grad_norm": 0.6584949493408203,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2538,
|
|
"mean_token_accuracy": 0.652903139591217,
|
|
"num_tokens": 54032690.0,
|
|
"step": 91
|
|
},
|
|
{
|
|
"epoch": 0.4380952380952381,
|
|
"ewc_loss": 4.792213439941406e-05,
|
|
"grad_norm": 0.6141408681869507,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.24,
|
|
"mean_token_accuracy": 0.6575225591659546,
|
|
"num_tokens": 54631908.0,
|
|
"step": 92
|
|
},
|
|
{
|
|
"epoch": 0.44285714285714284,
|
|
"ewc_loss": 4.8160552978515625e-05,
|
|
"grad_norm": 0.7103465795516968,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2336,
|
|
"mean_token_accuracy": 0.6581789255142212,
|
|
"num_tokens": 55218598.0,
|
|
"step": 93
|
|
},
|
|
{
|
|
"epoch": 0.44761904761904764,
|
|
"ewc_loss": 4.887580871582031e-05,
|
|
"grad_norm": 0.7277327179908752,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2575,
|
|
"mean_token_accuracy": 0.652403712272644,
|
|
"num_tokens": 55814642.0,
|
|
"step": 94
|
|
},
|
|
{
|
|
"epoch": 0.4523809523809524,
|
|
"ewc_loss": 4.935264587402344e-05,
|
|
"grad_norm": 0.6449629068374634,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2295,
|
|
"mean_token_accuracy": 0.6600314974784851,
|
|
"num_tokens": 56410000.0,
|
|
"step": 95
|
|
},
|
|
{
|
|
"epoch": 0.45714285714285713,
|
|
"ewc_loss": 4.935264587402344e-05,
|
|
"grad_norm": 0.7176470160484314,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2387,
|
|
"mean_token_accuracy": 0.6571451425552368,
|
|
"num_tokens": 57001902.0,
|
|
"step": 96
|
|
},
|
|
{
|
|
"epoch": 0.46190476190476193,
|
|
"ewc_loss": 5.0067901611328125e-05,
|
|
"grad_norm": 0.7002130150794983,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2479,
|
|
"mean_token_accuracy": 0.6548635363578796,
|
|
"num_tokens": 57612227.0,
|
|
"step": 97
|
|
},
|
|
{
|
|
"epoch": 0.4666666666666667,
|
|
"ewc_loss": 5.030632019042969e-05,
|
|
"grad_norm": 0.688245415687561,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2336,
|
|
"mean_token_accuracy": 0.65715491771698,
|
|
"num_tokens": 58198983.0,
|
|
"step": 98
|
|
},
|
|
{
|
|
"epoch": 0.4714285714285714,
|
|
"ewc_loss": 5.173683166503906e-05,
|
|
"grad_norm": 0.8472521305084229,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2557,
|
|
"mean_token_accuracy": 0.6534677743911743,
|
|
"num_tokens": 58805739.0,
|
|
"step": 99
|
|
},
|
|
{
|
|
"epoch": 0.47619047619047616,
|
|
"ewc_loss": 5.245208740234375e-05,
|
|
"grad_norm": 0.6739184856414795,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2226,
|
|
"mean_token_accuracy": 0.660843551158905,
|
|
"num_tokens": 59386596.0,
|
|
"step": 100
|
|
},
|
|
{
|
|
"epoch": 0.48095238095238096,
|
|
"ewc_loss": 5.269050598144531e-05,
|
|
"grad_norm": 0.9083235859870911,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2311,
|
|
"mean_token_accuracy": 0.6582459211349487,
|
|
"num_tokens": 59976677.0,
|
|
"step": 101
|
|
},
|
|
{
|
|
"epoch": 0.4857142857142857,
|
|
"ewc_loss": 5.2928924560546875e-05,
|
|
"grad_norm": 0.6698983907699585,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2436,
|
|
"mean_token_accuracy": 0.6558568477630615,
|
|
"num_tokens": 60581023.0,
|
|
"step": 102
|
|
},
|
|
{
|
|
"epoch": 0.49047619047619045,
|
|
"ewc_loss": 5.340576171875e-05,
|
|
"grad_norm": 0.8732043504714966,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2342,
|
|
"mean_token_accuracy": 0.6586148738861084,
|
|
"num_tokens": 61177587.0,
|
|
"step": 103
|
|
},
|
|
{
|
|
"epoch": 0.49523809523809526,
|
|
"ewc_loss": 5.340576171875e-05,
|
|
"grad_norm": 0.6918509602546692,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2278,
|
|
"mean_token_accuracy": 0.6584168672561646,
|
|
"num_tokens": 61759739.0,
|
|
"step": 104
|
|
},
|
|
{
|
|
"epoch": 0.5,
|
|
"ewc_loss": 5.412101745605469e-05,
|
|
"grad_norm": 0.8290679454803467,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2356,
|
|
"mean_token_accuracy": 0.6576931476593018,
|
|
"num_tokens": 62343623.0,
|
|
"step": 105
|
|
},
|
|
{
|
|
"epoch": 0.5047619047619047,
|
|
"ewc_loss": 5.507469177246094e-05,
|
|
"grad_norm": 0.7154332399368286,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2297,
|
|
"mean_token_accuracy": 0.6584201455116272,
|
|
"num_tokens": 62936609.0,
|
|
"step": 106
|
|
},
|
|
{
|
|
"epoch": 0.5095238095238095,
|
|
"ewc_loss": 5.53131103515625e-05,
|
|
"grad_norm": 0.7585392594337463,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2264,
|
|
"mean_token_accuracy": 0.6598902344703674,
|
|
"num_tokens": 63540035.0,
|
|
"step": 107
|
|
},
|
|
{
|
|
"epoch": 0.5142857142857142,
|
|
"ewc_loss": 5.555152893066406e-05,
|
|
"grad_norm": 0.6494925022125244,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2325,
|
|
"mean_token_accuracy": 0.6582848429679871,
|
|
"num_tokens": 64137406.0,
|
|
"step": 108
|
|
},
|
|
{
|
|
"epoch": 0.5190476190476191,
|
|
"ewc_loss": 5.5789947509765625e-05,
|
|
"grad_norm": 0.6927869319915771,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2179,
|
|
"mean_token_accuracy": 0.6617852449417114,
|
|
"num_tokens": 64747343.0,
|
|
"step": 109
|
|
},
|
|
{
|
|
"epoch": 0.5238095238095238,
|
|
"ewc_loss": 5.650520324707031e-05,
|
|
"grad_norm": 0.6015043258666992,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2173,
|
|
"mean_token_accuracy": 0.6607455611228943,
|
|
"num_tokens": 65340433.0,
|
|
"step": 110
|
|
},
|
|
{
|
|
"epoch": 0.5285714285714286,
|
|
"ewc_loss": 5.650520324707031e-05,
|
|
"grad_norm": 0.5827374458312988,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2102,
|
|
"mean_token_accuracy": 0.6627492904663086,
|
|
"num_tokens": 65928375.0,
|
|
"step": 111
|
|
},
|
|
{
|
|
"epoch": 0.5333333333333333,
|
|
"ewc_loss": 5.6743621826171875e-05,
|
|
"grad_norm": 0.6169699430465698,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.236,
|
|
"mean_token_accuracy": 0.6568990349769592,
|
|
"num_tokens": 66527455.0,
|
|
"step": 112
|
|
},
|
|
{
|
|
"epoch": 0.5380952380952381,
|
|
"ewc_loss": 5.698204040527344e-05,
|
|
"grad_norm": 0.5644369125366211,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2075,
|
|
"mean_token_accuracy": 0.664216160774231,
|
|
"num_tokens": 67120147.0,
|
|
"step": 113
|
|
},
|
|
{
|
|
"epoch": 0.5428571428571428,
|
|
"ewc_loss": 5.745887756347656e-05,
|
|
"grad_norm": 0.581853449344635,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2257,
|
|
"mean_token_accuracy": 0.6596239805221558,
|
|
"num_tokens": 67726850.0,
|
|
"step": 114
|
|
},
|
|
{
|
|
"epoch": 0.5476190476190477,
|
|
"ewc_loss": 5.7697296142578125e-05,
|
|
"grad_norm": 0.5541592240333557,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2201,
|
|
"mean_token_accuracy": 0.6606771349906921,
|
|
"num_tokens": 68316713.0,
|
|
"step": 115
|
|
},
|
|
{
|
|
"epoch": 0.5523809523809524,
|
|
"ewc_loss": 5.817413330078125e-05,
|
|
"grad_norm": 0.6094202399253845,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2231,
|
|
"mean_token_accuracy": 0.6598824262619019,
|
|
"num_tokens": 68892365.0,
|
|
"step": 116
|
|
},
|
|
{
|
|
"epoch": 0.5571428571428572,
|
|
"ewc_loss": 5.888938903808594e-05,
|
|
"grad_norm": 0.6569861769676208,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2289,
|
|
"mean_token_accuracy": 0.6588051319122314,
|
|
"num_tokens": 69505524.0,
|
|
"step": 117
|
|
},
|
|
{
|
|
"epoch": 0.5619047619047619,
|
|
"ewc_loss": 5.91278076171875e-05,
|
|
"grad_norm": 0.6969945430755615,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2113,
|
|
"mean_token_accuracy": 0.6617962718009949,
|
|
"num_tokens": 70095302.0,
|
|
"step": 118
|
|
},
|
|
{
|
|
"epoch": 0.5666666666666667,
|
|
"ewc_loss": 6.0558319091796875e-05,
|
|
"grad_norm": 0.6108903288841248,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.224,
|
|
"mean_token_accuracy": 0.659609317779541,
|
|
"num_tokens": 70694971.0,
|
|
"step": 119
|
|
},
|
|
{
|
|
"epoch": 0.5714285714285714,
|
|
"ewc_loss": 6.103515625e-05,
|
|
"grad_norm": 0.6834306716918945,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2225,
|
|
"mean_token_accuracy": 0.6605261564254761,
|
|
"num_tokens": 71279415.0,
|
|
"step": 120
|
|
},
|
|
{
|
|
"epoch": 0.5761904761904761,
|
|
"ewc_loss": 6.103515625e-05,
|
|
"grad_norm": 0.693701446056366,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2171,
|
|
"mean_token_accuracy": 0.6615762710571289,
|
|
"num_tokens": 71869014.0,
|
|
"step": 121
|
|
},
|
|
{
|
|
"epoch": 0.580952380952381,
|
|
"ewc_loss": 6.151199340820312e-05,
|
|
"grad_norm": 0.5865037441253662,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2251,
|
|
"mean_token_accuracy": 0.6589745283126831,
|
|
"num_tokens": 72472715.0,
|
|
"step": 122
|
|
},
|
|
{
|
|
"epoch": 0.5857142857142857,
|
|
"ewc_loss": 6.198883056640625e-05,
|
|
"grad_norm": 0.716070294380188,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2171,
|
|
"mean_token_accuracy": 0.6610225439071655,
|
|
"num_tokens": 73055740.0,
|
|
"step": 123
|
|
},
|
|
{
|
|
"epoch": 0.5904761904761905,
|
|
"ewc_loss": 6.198883056640625e-05,
|
|
"grad_norm": 0.5951841473579407,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2006,
|
|
"mean_token_accuracy": 0.66545569896698,
|
|
"num_tokens": 73639151.0,
|
|
"step": 124
|
|
},
|
|
{
|
|
"epoch": 0.5952380952380952,
|
|
"ewc_loss": 6.246566772460938e-05,
|
|
"grad_norm": 0.6757223606109619,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2194,
|
|
"mean_token_accuracy": 0.6624715328216553,
|
|
"num_tokens": 74216756.0,
|
|
"step": 125
|
|
},
|
|
{
|
|
"epoch": 0.6,
|
|
"ewc_loss": 6.246566772460938e-05,
|
|
"grad_norm": 0.6777483820915222,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2146,
|
|
"mean_token_accuracy": 0.6617588400840759,
|
|
"num_tokens": 74813953.0,
|
|
"step": 126
|
|
},
|
|
{
|
|
"epoch": 0.6047619047619047,
|
|
"ewc_loss": 6.341934204101562e-05,
|
|
"grad_norm": 0.605185866355896,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2147,
|
|
"mean_token_accuracy": 0.6620358228683472,
|
|
"num_tokens": 75410691.0,
|
|
"step": 127
|
|
},
|
|
{
|
|
"epoch": 0.6095238095238096,
|
|
"ewc_loss": 6.341934204101562e-05,
|
|
"grad_norm": 0.6808415651321411,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2321,
|
|
"mean_token_accuracy": 0.6569392681121826,
|
|
"num_tokens": 75996496.0,
|
|
"step": 128
|
|
},
|
|
{
|
|
"epoch": 0.6142857142857143,
|
|
"ewc_loss": 6.437301635742188e-05,
|
|
"grad_norm": 0.6024172902107239,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2072,
|
|
"mean_token_accuracy": 0.6645489931106567,
|
|
"num_tokens": 76585198.0,
|
|
"step": 129
|
|
},
|
|
{
|
|
"epoch": 0.6190476190476191,
|
|
"ewc_loss": 6.4849853515625e-05,
|
|
"grad_norm": 0.6431806087493896,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1957,
|
|
"mean_token_accuracy": 0.6662015318870544,
|
|
"num_tokens": 77191596.0,
|
|
"step": 130
|
|
},
|
|
{
|
|
"epoch": 0.6238095238095238,
|
|
"ewc_loss": 6.4849853515625e-05,
|
|
"grad_norm": 0.6578922867774963,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2131,
|
|
"mean_token_accuracy": 0.6619114279747009,
|
|
"num_tokens": 77796998.0,
|
|
"step": 131
|
|
},
|
|
{
|
|
"epoch": 0.6285714285714286,
|
|
"ewc_loss": 6.4849853515625e-05,
|
|
"grad_norm": 0.7067749500274658,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2258,
|
|
"mean_token_accuracy": 0.658606767654419,
|
|
"num_tokens": 78395104.0,
|
|
"step": 132
|
|
},
|
|
{
|
|
"epoch": 0.6333333333333333,
|
|
"ewc_loss": 6.532669067382812e-05,
|
|
"grad_norm": 0.8490569591522217,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2123,
|
|
"mean_token_accuracy": 0.6625363230705261,
|
|
"num_tokens": 78988563.0,
|
|
"step": 133
|
|
},
|
|
{
|
|
"epoch": 0.638095238095238,
|
|
"ewc_loss": 6.532669067382812e-05,
|
|
"grad_norm": 0.6155999898910522,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2322,
|
|
"mean_token_accuracy": 0.6569735407829285,
|
|
"num_tokens": 79599633.0,
|
|
"step": 134
|
|
},
|
|
{
|
|
"epoch": 0.6428571428571429,
|
|
"ewc_loss": 6.580352783203125e-05,
|
|
"grad_norm": 0.764561116695404,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2236,
|
|
"mean_token_accuracy": 0.6597906351089478,
|
|
"num_tokens": 80196954.0,
|
|
"step": 135
|
|
},
|
|
{
|
|
"epoch": 0.6476190476190476,
|
|
"ewc_loss": 6.67572021484375e-05,
|
|
"grad_norm": 0.6514508724212646,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2228,
|
|
"mean_token_accuracy": 0.6594412922859192,
|
|
"num_tokens": 80790959.0,
|
|
"step": 136
|
|
},
|
|
{
|
|
"epoch": 0.6523809523809524,
|
|
"ewc_loss": 6.723403930664062e-05,
|
|
"grad_norm": 0.6322770118713379,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2087,
|
|
"mean_token_accuracy": 0.6639190912246704,
|
|
"num_tokens": 81363350.0,
|
|
"step": 137
|
|
},
|
|
{
|
|
"epoch": 0.6571428571428571,
|
|
"ewc_loss": 6.771087646484375e-05,
|
|
"grad_norm": 0.7660894989967346,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2108,
|
|
"mean_token_accuracy": 0.6627682447433472,
|
|
"num_tokens": 81960356.0,
|
|
"step": 138
|
|
},
|
|
{
|
|
"epoch": 0.6619047619047619,
|
|
"ewc_loss": 6.866455078125e-05,
|
|
"grad_norm": 0.6542578935623169,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2206,
|
|
"mean_token_accuracy": 0.6602470278739929,
|
|
"num_tokens": 82573967.0,
|
|
"step": 139
|
|
},
|
|
{
|
|
"epoch": 0.6666666666666666,
|
|
"ewc_loss": 6.914138793945312e-05,
|
|
"grad_norm": 0.8248925805091858,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2089,
|
|
"mean_token_accuracy": 0.6630240678787231,
|
|
"num_tokens": 83170751.0,
|
|
"step": 140
|
|
},
|
|
{
|
|
"epoch": 0.6714285714285714,
|
|
"ewc_loss": 6.961822509765625e-05,
|
|
"grad_norm": 0.616695761680603,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1903,
|
|
"mean_token_accuracy": 0.667101263999939,
|
|
"num_tokens": 83744022.0,
|
|
"step": 141
|
|
},
|
|
{
|
|
"epoch": 0.6761904761904762,
|
|
"ewc_loss": 6.961822509765625e-05,
|
|
"grad_norm": 0.782097339630127,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2266,
|
|
"mean_token_accuracy": 0.658531904220581,
|
|
"num_tokens": 84336667.0,
|
|
"step": 142
|
|
},
|
|
{
|
|
"epoch": 0.680952380952381,
|
|
"ewc_loss": 7.009506225585938e-05,
|
|
"grad_norm": 0.669071614742279,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.208,
|
|
"mean_token_accuracy": 0.6631326675415039,
|
|
"num_tokens": 84927599.0,
|
|
"step": 143
|
|
},
|
|
{
|
|
"epoch": 0.6857142857142857,
|
|
"ewc_loss": 7.104873657226562e-05,
|
|
"grad_norm": 0.7794314622879028,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2072,
|
|
"mean_token_accuracy": 0.6638041734695435,
|
|
"num_tokens": 85516121.0,
|
|
"step": 144
|
|
},
|
|
{
|
|
"epoch": 0.6904761904761905,
|
|
"ewc_loss": 7.152557373046875e-05,
|
|
"grad_norm": 0.6331236958503723,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2019,
|
|
"mean_token_accuracy": 0.664778470993042,
|
|
"num_tokens": 86106161.0,
|
|
"step": 145
|
|
},
|
|
{
|
|
"epoch": 0.6952380952380952,
|
|
"ewc_loss": 7.152557373046875e-05,
|
|
"grad_norm": 0.7762525081634521,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2182,
|
|
"mean_token_accuracy": 0.6615140438079834,
|
|
"num_tokens": 86723880.0,
|
|
"step": 146
|
|
},
|
|
{
|
|
"epoch": 0.7,
|
|
"ewc_loss": 7.200241088867188e-05,
|
|
"grad_norm": 0.6879560947418213,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2127,
|
|
"mean_token_accuracy": 0.6628991365432739,
|
|
"num_tokens": 87327542.0,
|
|
"step": 147
|
|
},
|
|
{
|
|
"epoch": 0.7047619047619048,
|
|
"ewc_loss": 7.2479248046875e-05,
|
|
"grad_norm": 0.6144427061080933,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2069,
|
|
"mean_token_accuracy": 0.6629226207733154,
|
|
"num_tokens": 87912557.0,
|
|
"step": 148
|
|
},
|
|
{
|
|
"epoch": 0.7095238095238096,
|
|
"ewc_loss": 7.295608520507812e-05,
|
|
"grad_norm": 0.7322609424591064,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2184,
|
|
"mean_token_accuracy": 0.6612593531608582,
|
|
"num_tokens": 88514499.0,
|
|
"step": 149
|
|
},
|
|
{
|
|
"epoch": 0.7142857142857143,
|
|
"ewc_loss": 7.295608520507812e-05,
|
|
"grad_norm": 0.5880700349807739,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1973,
|
|
"mean_token_accuracy": 0.6659260988235474,
|
|
"num_tokens": 89090412.0,
|
|
"step": 150
|
|
},
|
|
{
|
|
"epoch": 0.719047619047619,
|
|
"ewc_loss": 7.343292236328125e-05,
|
|
"grad_norm": 0.6697641611099243,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2076,
|
|
"mean_token_accuracy": 0.6634217500686646,
|
|
"num_tokens": 89689944.0,
|
|
"step": 151
|
|
},
|
|
{
|
|
"epoch": 0.7238095238095238,
|
|
"ewc_loss": 7.390975952148438e-05,
|
|
"grad_norm": 0.6546050906181335,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2186,
|
|
"mean_token_accuracy": 0.6609184741973877,
|
|
"num_tokens": 90281605.0,
|
|
"step": 152
|
|
},
|
|
{
|
|
"epoch": 0.7285714285714285,
|
|
"ewc_loss": 7.43865966796875e-05,
|
|
"grad_norm": 0.6235466003417969,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2192,
|
|
"mean_token_accuracy": 0.6613705158233643,
|
|
"num_tokens": 90877169.0,
|
|
"step": 153
|
|
},
|
|
{
|
|
"epoch": 0.7333333333333333,
|
|
"ewc_loss": 7.43865966796875e-05,
|
|
"grad_norm": 0.6219155788421631,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2237,
|
|
"mean_token_accuracy": 0.6593453884124756,
|
|
"num_tokens": 91473587.0,
|
|
"step": 154
|
|
},
|
|
{
|
|
"epoch": 0.7380952380952381,
|
|
"ewc_loss": 7.534027099609375e-05,
|
|
"grad_norm": 0.646216869354248,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2168,
|
|
"mean_token_accuracy": 0.6610288619995117,
|
|
"num_tokens": 92066142.0,
|
|
"step": 155
|
|
},
|
|
{
|
|
"epoch": 0.7428571428571429,
|
|
"ewc_loss": 7.62939453125e-05,
|
|
"grad_norm": 0.6275994181632996,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1987,
|
|
"mean_token_accuracy": 0.6650243401527405,
|
|
"num_tokens": 92671294.0,
|
|
"step": 156
|
|
},
|
|
{
|
|
"epoch": 0.7476190476190476,
|
|
"ewc_loss": 7.677078247070312e-05,
|
|
"grad_norm": 0.6840261220932007,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2016,
|
|
"mean_token_accuracy": 0.6646026968955994,
|
|
"num_tokens": 93267004.0,
|
|
"step": 157
|
|
},
|
|
{
|
|
"epoch": 0.7523809523809524,
|
|
"ewc_loss": 7.724761962890625e-05,
|
|
"grad_norm": 0.6067699790000916,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2196,
|
|
"mean_token_accuracy": 0.6607552766799927,
|
|
"num_tokens": 93865099.0,
|
|
"step": 158
|
|
},
|
|
{
|
|
"epoch": 0.7571428571428571,
|
|
"ewc_loss": 7.772445678710938e-05,
|
|
"grad_norm": 0.677392840385437,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1927,
|
|
"mean_token_accuracy": 0.667458713054657,
|
|
"num_tokens": 94449283.0,
|
|
"step": 159
|
|
},
|
|
{
|
|
"epoch": 0.7619047619047619,
|
|
"ewc_loss": 7.82012939453125e-05,
|
|
"grad_norm": 0.6765346527099609,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2033,
|
|
"mean_token_accuracy": 0.6639419198036194,
|
|
"num_tokens": 95037160.0,
|
|
"step": 160
|
|
},
|
|
{
|
|
"epoch": 0.7666666666666667,
|
|
"ewc_loss": 7.82012939453125e-05,
|
|
"grad_norm": 0.6836954951286316,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1864,
|
|
"mean_token_accuracy": 0.6686091423034668,
|
|
"num_tokens": 95620329.0,
|
|
"step": 161
|
|
},
|
|
{
|
|
"epoch": 0.7714285714285715,
|
|
"ewc_loss": 7.867813110351562e-05,
|
|
"grad_norm": 0.6478279829025269,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2082,
|
|
"mean_token_accuracy": 0.6621580123901367,
|
|
"num_tokens": 96202979.0,
|
|
"step": 162
|
|
},
|
|
{
|
|
"epoch": 0.7761904761904762,
|
|
"ewc_loss": 7.963180541992188e-05,
|
|
"grad_norm": 0.6071380376815796,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2022,
|
|
"mean_token_accuracy": 0.6648613214492798,
|
|
"num_tokens": 96794135.0,
|
|
"step": 163
|
|
},
|
|
{
|
|
"epoch": 0.780952380952381,
|
|
"ewc_loss": 8.0108642578125e-05,
|
|
"grad_norm": 0.6301907896995544,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1925,
|
|
"mean_token_accuracy": 0.6659783124923706,
|
|
"num_tokens": 97380180.0,
|
|
"step": 164
|
|
},
|
|
{
|
|
"epoch": 0.7857142857142857,
|
|
"ewc_loss": 8.0108642578125e-05,
|
|
"grad_norm": 0.624636173248291,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2107,
|
|
"mean_token_accuracy": 0.6631755828857422,
|
|
"num_tokens": 97979583.0,
|
|
"step": 165
|
|
},
|
|
{
|
|
"epoch": 0.7904761904761904,
|
|
"ewc_loss": 8.058547973632812e-05,
|
|
"grad_norm": 0.7728396058082581,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1926,
|
|
"mean_token_accuracy": 0.6677187085151672,
|
|
"num_tokens": 98573453.0,
|
|
"step": 166
|
|
},
|
|
{
|
|
"epoch": 0.7952380952380952,
|
|
"ewc_loss": 8.106231689453125e-05,
|
|
"grad_norm": 0.624492347240448,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1996,
|
|
"mean_token_accuracy": 0.6648650169372559,
|
|
"num_tokens": 99162518.0,
|
|
"step": 167
|
|
},
|
|
{
|
|
"epoch": 0.8,
|
|
"ewc_loss": 8.153915405273438e-05,
|
|
"grad_norm": 0.6643707752227783,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1968,
|
|
"mean_token_accuracy": 0.6648801565170288,
|
|
"num_tokens": 99755688.0,
|
|
"step": 168
|
|
},
|
|
{
|
|
"epoch": 0.8047619047619048,
|
|
"ewc_loss": 8.153915405273438e-05,
|
|
"grad_norm": 0.5819059610366821,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.203,
|
|
"mean_token_accuracy": 0.6639195084571838,
|
|
"num_tokens": 100367122.0,
|
|
"step": 169
|
|
},
|
|
{
|
|
"epoch": 0.8095238095238095,
|
|
"ewc_loss": 8.249282836914062e-05,
|
|
"grad_norm": 0.6085971593856812,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1974,
|
|
"mean_token_accuracy": 0.6646117568016052,
|
|
"num_tokens": 100966663.0,
|
|
"step": 170
|
|
},
|
|
{
|
|
"epoch": 0.8142857142857143,
|
|
"ewc_loss": 8.296966552734375e-05,
|
|
"grad_norm": 0.6579673886299133,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2104,
|
|
"mean_token_accuracy": 0.6632278561592102,
|
|
"num_tokens": 101561561.0,
|
|
"step": 171
|
|
},
|
|
{
|
|
"epoch": 0.819047619047619,
|
|
"ewc_loss": 8.296966552734375e-05,
|
|
"grad_norm": 0.6082309484481812,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2167,
|
|
"mean_token_accuracy": 0.6615850925445557,
|
|
"num_tokens": 102150367.0,
|
|
"step": 172
|
|
},
|
|
{
|
|
"epoch": 0.8238095238095238,
|
|
"ewc_loss": 8.296966552734375e-05,
|
|
"grad_norm": 0.6453933715820312,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2065,
|
|
"mean_token_accuracy": 0.6642754077911377,
|
|
"num_tokens": 102744438.0,
|
|
"step": 173
|
|
},
|
|
{
|
|
"epoch": 0.8285714285714286,
|
|
"ewc_loss": 8.344650268554688e-05,
|
|
"grad_norm": 0.6452134251594543,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2053,
|
|
"mean_token_accuracy": 0.6637248992919922,
|
|
"num_tokens": 103336159.0,
|
|
"step": 174
|
|
},
|
|
{
|
|
"epoch": 0.8333333333333334,
|
|
"ewc_loss": 8.392333984375e-05,
|
|
"grad_norm": 0.7510733008384705,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2104,
|
|
"mean_token_accuracy": 0.6626762747764587,
|
|
"num_tokens": 103933457.0,
|
|
"step": 175
|
|
},
|
|
{
|
|
"epoch": 0.8380952380952381,
|
|
"ewc_loss": 8.392333984375e-05,
|
|
"grad_norm": 0.684550940990448,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1964,
|
|
"mean_token_accuracy": 0.6646972894668579,
|
|
"num_tokens": 104528020.0,
|
|
"step": 176
|
|
},
|
|
{
|
|
"epoch": 0.8428571428571429,
|
|
"ewc_loss": 8.392333984375e-05,
|
|
"grad_norm": 0.6769033074378967,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2253,
|
|
"mean_token_accuracy": 0.6592004895210266,
|
|
"num_tokens": 105126562.0,
|
|
"step": 177
|
|
},
|
|
{
|
|
"epoch": 0.8476190476190476,
|
|
"ewc_loss": 8.487701416015625e-05,
|
|
"grad_norm": 0.6447919607162476,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1908,
|
|
"mean_token_accuracy": 0.6668331623077393,
|
|
"num_tokens": 105730229.0,
|
|
"step": 178
|
|
},
|
|
{
|
|
"epoch": 0.8523809523809524,
|
|
"ewc_loss": 8.487701416015625e-05,
|
|
"grad_norm": 0.6715754866600037,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.212,
|
|
"mean_token_accuracy": 0.6615471839904785,
|
|
"num_tokens": 106338239.0,
|
|
"step": 179
|
|
},
|
|
{
|
|
"epoch": 0.8571428571428571,
|
|
"ewc_loss": 8.535385131835938e-05,
|
|
"grad_norm": 0.7537306547164917,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2096,
|
|
"mean_token_accuracy": 0.6623870134353638,
|
|
"num_tokens": 106929782.0,
|
|
"step": 180
|
|
},
|
|
{
|
|
"epoch": 0.861904761904762,
|
|
"ewc_loss": 8.58306884765625e-05,
|
|
"grad_norm": 0.6752594709396362,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2046,
|
|
"mean_token_accuracy": 0.6641973257064819,
|
|
"num_tokens": 107516950.0,
|
|
"step": 181
|
|
},
|
|
{
|
|
"epoch": 0.8666666666666667,
|
|
"ewc_loss": 8.630752563476562e-05,
|
|
"grad_norm": 0.7391537427902222,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.194,
|
|
"mean_token_accuracy": 0.6656140685081482,
|
|
"num_tokens": 108104046.0,
|
|
"step": 182
|
|
},
|
|
{
|
|
"epoch": 0.8714285714285714,
|
|
"ewc_loss": 8.630752563476562e-05,
|
|
"grad_norm": 0.5862585306167603,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2106,
|
|
"mean_token_accuracy": 0.6625587940216064,
|
|
"num_tokens": 108711068.0,
|
|
"step": 183
|
|
},
|
|
{
|
|
"epoch": 0.8761904761904762,
|
|
"ewc_loss": 8.678436279296875e-05,
|
|
"grad_norm": 0.6424930691719055,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1803,
|
|
"mean_token_accuracy": 0.6688517332077026,
|
|
"num_tokens": 109294847.0,
|
|
"step": 184
|
|
},
|
|
{
|
|
"epoch": 0.8809523809523809,
|
|
"ewc_loss": 8.678436279296875e-05,
|
|
"grad_norm": 0.5718483328819275,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1998,
|
|
"mean_token_accuracy": 0.6647604703903198,
|
|
"num_tokens": 109903424.0,
|
|
"step": 185
|
|
},
|
|
{
|
|
"epoch": 0.8857142857142857,
|
|
"ewc_loss": 8.726119995117188e-05,
|
|
"grad_norm": 0.7194480895996094,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2011,
|
|
"mean_token_accuracy": 0.6640743017196655,
|
|
"num_tokens": 110515082.0,
|
|
"step": 186
|
|
},
|
|
{
|
|
"epoch": 0.8904761904761904,
|
|
"ewc_loss": 8.7738037109375e-05,
|
|
"grad_norm": 0.6189296245574951,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2003,
|
|
"mean_token_accuracy": 0.6649435758590698,
|
|
"num_tokens": 111105456.0,
|
|
"step": 187
|
|
},
|
|
{
|
|
"epoch": 0.8952380952380953,
|
|
"ewc_loss": 8.7738037109375e-05,
|
|
"grad_norm": 0.6637587547302246,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.2009,
|
|
"mean_token_accuracy": 0.6652274131774902,
|
|
"num_tokens": 111699029.0,
|
|
"step": 188
|
|
},
|
|
{
|
|
"epoch": 0.9,
|
|
"ewc_loss": 8.821487426757812e-05,
|
|
"grad_norm": 0.6248812079429626,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1777,
|
|
"mean_token_accuracy": 0.6690680980682373,
|
|
"num_tokens": 112280321.0,
|
|
"step": 189
|
|
},
|
|
{
|
|
"epoch": 0.9047619047619048,
|
|
"ewc_loss": 8.916854858398438e-05,
|
|
"grad_norm": 0.6758658289909363,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1796,
|
|
"mean_token_accuracy": 0.6688675880432129,
|
|
"num_tokens": 112860009.0,
|
|
"step": 190
|
|
},
|
|
{
|
|
"epoch": 0.9095238095238095,
|
|
"ewc_loss": 8.916854858398438e-05,
|
|
"grad_norm": 0.7013548016548157,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.199,
|
|
"mean_token_accuracy": 0.6646405458450317,
|
|
"num_tokens": 113457303.0,
|
|
"step": 191
|
|
},
|
|
{
|
|
"epoch": 0.9142857142857143,
|
|
"ewc_loss": 8.916854858398438e-05,
|
|
"grad_norm": 0.6272183656692505,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1929,
|
|
"mean_token_accuracy": 0.6666807532310486,
|
|
"num_tokens": 114054977.0,
|
|
"step": 192
|
|
},
|
|
{
|
|
"epoch": 0.919047619047619,
|
|
"ewc_loss": 8.96453857421875e-05,
|
|
"grad_norm": 0.5966007113456726,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1897,
|
|
"mean_token_accuracy": 0.6664808988571167,
|
|
"num_tokens": 114641555.0,
|
|
"step": 193
|
|
},
|
|
{
|
|
"epoch": 0.9238095238095239,
|
|
"ewc_loss": 8.96453857421875e-05,
|
|
"grad_norm": 0.6839225888252258,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.206,
|
|
"mean_token_accuracy": 0.6642289161682129,
|
|
"num_tokens": 115241437.0,
|
|
"step": 194
|
|
},
|
|
{
|
|
"epoch": 0.9285714285714286,
|
|
"ewc_loss": 8.96453857421875e-05,
|
|
"grad_norm": 0.6206007599830627,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1835,
|
|
"mean_token_accuracy": 0.6680426597595215,
|
|
"num_tokens": 115845775.0,
|
|
"step": 195
|
|
},
|
|
{
|
|
"epoch": 0.9333333333333333,
|
|
"ewc_loss": 9.012222290039062e-05,
|
|
"grad_norm": 0.680346667766571,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1903,
|
|
"mean_token_accuracy": 0.6672300696372986,
|
|
"num_tokens": 116452623.0,
|
|
"step": 196
|
|
},
|
|
{
|
|
"epoch": 0.9380952380952381,
|
|
"ewc_loss": 9.107589721679688e-05,
|
|
"grad_norm": 0.5942112803459167,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1983,
|
|
"mean_token_accuracy": 0.6647674441337585,
|
|
"num_tokens": 117045570.0,
|
|
"step": 197
|
|
},
|
|
{
|
|
"epoch": 0.9428571428571428,
|
|
"ewc_loss": 9.1552734375e-05,
|
|
"grad_norm": 0.7300306558609009,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1759,
|
|
"mean_token_accuracy": 0.670311689376831,
|
|
"num_tokens": 117654535.0,
|
|
"step": 198
|
|
},
|
|
{
|
|
"epoch": 0.9476190476190476,
|
|
"ewc_loss": 9.202957153320312e-05,
|
|
"grad_norm": 0.5941800475120544,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1894,
|
|
"mean_token_accuracy": 0.6678575277328491,
|
|
"num_tokens": 118247244.0,
|
|
"step": 199
|
|
},
|
|
{
|
|
"epoch": 0.9523809523809523,
|
|
"ewc_loss": 9.202957153320312e-05,
|
|
"grad_norm": 0.6892615556716919,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1835,
|
|
"mean_token_accuracy": 0.6685817837715149,
|
|
"num_tokens": 118843074.0,
|
|
"step": 200
|
|
},
|
|
{
|
|
"epoch": 0.9571428571428572,
|
|
"ewc_loss": 9.250640869140625e-05,
|
|
"grad_norm": 0.6182640194892883,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1836,
|
|
"mean_token_accuracy": 0.6682996153831482,
|
|
"num_tokens": 119445023.0,
|
|
"step": 201
|
|
},
|
|
{
|
|
"epoch": 0.9619047619047619,
|
|
"ewc_loss": 9.298324584960938e-05,
|
|
"grad_norm": 0.6540442705154419,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1988,
|
|
"mean_token_accuracy": 0.6655623912811279,
|
|
"num_tokens": 120045748.0,
|
|
"step": 202
|
|
},
|
|
{
|
|
"epoch": 0.9666666666666667,
|
|
"ewc_loss": 9.298324584960938e-05,
|
|
"grad_norm": 0.6540207862854004,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1909,
|
|
"mean_token_accuracy": 0.6663588881492615,
|
|
"num_tokens": 120635079.0,
|
|
"step": 203
|
|
},
|
|
{
|
|
"epoch": 0.9714285714285714,
|
|
"ewc_loss": 9.298324584960938e-05,
|
|
"grad_norm": 0.6133082509040833,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1915,
|
|
"mean_token_accuracy": 0.6655000448226929,
|
|
"num_tokens": 121220486.0,
|
|
"step": 204
|
|
},
|
|
{
|
|
"epoch": 0.9761904761904762,
|
|
"ewc_loss": 9.298324584960938e-05,
|
|
"grad_norm": 0.6428220272064209,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1929,
|
|
"mean_token_accuracy": 0.6660884618759155,
|
|
"num_tokens": 121800676.0,
|
|
"step": 205
|
|
},
|
|
{
|
|
"epoch": 0.9809523809523809,
|
|
"ewc_loss": 9.298324584960938e-05,
|
|
"grad_norm": 0.6250933408737183,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1969,
|
|
"mean_token_accuracy": 0.6652750968933105,
|
|
"num_tokens": 122409399.0,
|
|
"step": 206
|
|
},
|
|
{
|
|
"epoch": 0.9857142857142858,
|
|
"ewc_loss": 9.34600830078125e-05,
|
|
"grad_norm": 0.7679265737533569,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1777,
|
|
"mean_token_accuracy": 0.6693641543388367,
|
|
"num_tokens": 123003502.0,
|
|
"step": 207
|
|
},
|
|
{
|
|
"epoch": 0.9904761904761905,
|
|
"ewc_loss": 9.393692016601562e-05,
|
|
"grad_norm": 0.6028204560279846,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1945,
|
|
"mean_token_accuracy": 0.6662567853927612,
|
|
"num_tokens": 123595838.0,
|
|
"step": 208
|
|
},
|
|
{
|
|
"epoch": 0.9952380952380953,
|
|
"ewc_loss": 9.441375732421875e-05,
|
|
"grad_norm": 0.7110074162483215,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1924,
|
|
"mean_token_accuracy": 0.6664758920669556,
|
|
"num_tokens": 124166476.0,
|
|
"step": 209
|
|
},
|
|
{
|
|
"epoch": 1.0,
|
|
"ewc_loss": 9.5367431640625e-05,
|
|
"grad_norm": 0.6283719539642334,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1814,
|
|
"mean_token_accuracy": 0.6682867407798767,
|
|
"num_tokens": 124761423.0,
|
|
"step": 210
|
|
},
|
|
{
|
|
"epoch": 1.0047619047619047,
|
|
"ewc_loss": 9.5367431640625e-05,
|
|
"grad_norm": 0.715038537979126,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1899,
|
|
"mean_token_accuracy": 0.6661603450775146,
|
|
"num_tokens": 125364371.0,
|
|
"step": 211
|
|
},
|
|
{
|
|
"epoch": 1.0095238095238095,
|
|
"ewc_loss": 9.632110595703125e-05,
|
|
"grad_norm": 0.6927469372749329,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.149,
|
|
"mean_token_accuracy": 0.6749463081359863,
|
|
"num_tokens": 125954118.0,
|
|
"step": 212
|
|
},
|
|
{
|
|
"epoch": 1.0142857142857142,
|
|
"ewc_loss": 9.632110595703125e-05,
|
|
"grad_norm": 0.6295979619026184,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1542,
|
|
"mean_token_accuracy": 0.6738132834434509,
|
|
"num_tokens": 126544991.0,
|
|
"step": 213
|
|
},
|
|
{
|
|
"epoch": 1.019047619047619,
|
|
"ewc_loss": 9.72747802734375e-05,
|
|
"grad_norm": 0.6689757704734802,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1572,
|
|
"mean_token_accuracy": 0.6740959882736206,
|
|
"num_tokens": 127151772.0,
|
|
"step": 214
|
|
},
|
|
{
|
|
"epoch": 1.0238095238095237,
|
|
"ewc_loss": 9.72747802734375e-05,
|
|
"grad_norm": 0.6564069390296936,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1612,
|
|
"mean_token_accuracy": 0.6724189519882202,
|
|
"num_tokens": 127762517.0,
|
|
"step": 215
|
|
},
|
|
{
|
|
"epoch": 1.0285714285714285,
|
|
"ewc_loss": 9.72747802734375e-05,
|
|
"grad_norm": 0.6655731797218323,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1663,
|
|
"mean_token_accuracy": 0.6714205741882324,
|
|
"num_tokens": 128358892.0,
|
|
"step": 216
|
|
},
|
|
{
|
|
"epoch": 1.0333333333333334,
|
|
"ewc_loss": 9.775161743164062e-05,
|
|
"grad_norm": 0.6827829480171204,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1632,
|
|
"mean_token_accuracy": 0.6720266342163086,
|
|
"num_tokens": 128930309.0,
|
|
"step": 217
|
|
},
|
|
{
|
|
"epoch": 1.0380952380952382,
|
|
"ewc_loss": 9.775161743164062e-05,
|
|
"grad_norm": 0.6901017427444458,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1487,
|
|
"mean_token_accuracy": 0.6758360862731934,
|
|
"num_tokens": 129537678.0,
|
|
"step": 218
|
|
},
|
|
{
|
|
"epoch": 1.042857142857143,
|
|
"ewc_loss": 9.870529174804688e-05,
|
|
"grad_norm": 0.6297010779380798,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1634,
|
|
"mean_token_accuracy": 0.6725425720214844,
|
|
"num_tokens": 130113717.0,
|
|
"step": 219
|
|
},
|
|
{
|
|
"epoch": 1.0476190476190477,
|
|
"ewc_loss": 9.918212890625e-05,
|
|
"grad_norm": 0.7677139043807983,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1705,
|
|
"mean_token_accuracy": 0.6706888675689697,
|
|
"num_tokens": 130724521.0,
|
|
"step": 220
|
|
},
|
|
{
|
|
"epoch": 1.0523809523809524,
|
|
"ewc_loss": 9.918212890625e-05,
|
|
"grad_norm": 0.6948334574699402,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1558,
|
|
"mean_token_accuracy": 0.6741331815719604,
|
|
"num_tokens": 131298037.0,
|
|
"step": 221
|
|
},
|
|
{
|
|
"epoch": 1.0571428571428572,
|
|
"ewc_loss": 9.965896606445312e-05,
|
|
"grad_norm": 0.6717602014541626,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1635,
|
|
"mean_token_accuracy": 0.6722725629806519,
|
|
"num_tokens": 131909779.0,
|
|
"step": 222
|
|
},
|
|
{
|
|
"epoch": 1.061904761904762,
|
|
"ewc_loss": 0.00010013580322265625,
|
|
"grad_norm": 0.7923752069473267,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1615,
|
|
"mean_token_accuracy": 0.6723995804786682,
|
|
"num_tokens": 132506621.0,
|
|
"step": 223
|
|
},
|
|
{
|
|
"epoch": 1.0666666666666667,
|
|
"ewc_loss": 0.00010013580322265625,
|
|
"grad_norm": 0.6458796262741089,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1653,
|
|
"mean_token_accuracy": 0.6713548898696899,
|
|
"num_tokens": 133124443.0,
|
|
"step": 224
|
|
},
|
|
{
|
|
"epoch": 1.0714285714285714,
|
|
"ewc_loss": 0.00010061264038085938,
|
|
"grad_norm": 0.7878537178039551,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1763,
|
|
"mean_token_accuracy": 0.6684558987617493,
|
|
"num_tokens": 133719672.0,
|
|
"step": 225
|
|
},
|
|
{
|
|
"epoch": 1.0761904761904761,
|
|
"ewc_loss": 0.00010156631469726562,
|
|
"grad_norm": 0.6419898867607117,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1512,
|
|
"mean_token_accuracy": 0.6737122535705566,
|
|
"num_tokens": 134309852.0,
|
|
"step": 226
|
|
},
|
|
{
|
|
"epoch": 1.0809523809523809,
|
|
"ewc_loss": 0.00010204315185546875,
|
|
"grad_norm": 0.7734876275062561,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1634,
|
|
"mean_token_accuracy": 0.6713266372680664,
|
|
"num_tokens": 134890952.0,
|
|
"step": 227
|
|
},
|
|
{
|
|
"epoch": 1.0857142857142856,
|
|
"ewc_loss": 0.00010347366333007812,
|
|
"grad_norm": 0.6464232206344604,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1298,
|
|
"mean_token_accuracy": 0.6804349422454834,
|
|
"num_tokens": 135479588.0,
|
|
"step": 228
|
|
},
|
|
{
|
|
"epoch": 1.0904761904761904,
|
|
"ewc_loss": 0.00010442733764648438,
|
|
"grad_norm": 0.7163918614387512,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1559,
|
|
"mean_token_accuracy": 0.6736223697662354,
|
|
"num_tokens": 136065836.0,
|
|
"step": 229
|
|
},
|
|
{
|
|
"epoch": 1.0952380952380953,
|
|
"ewc_loss": 0.00010442733764648438,
|
|
"grad_norm": 0.7076587677001953,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1541,
|
|
"mean_token_accuracy": 0.6750876903533936,
|
|
"num_tokens": 136668062.0,
|
|
"step": 230
|
|
},
|
|
{
|
|
"epoch": 1.1,
|
|
"ewc_loss": 0.0001049041748046875,
|
|
"grad_norm": 0.729404866695404,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1567,
|
|
"mean_token_accuracy": 0.6731754541397095,
|
|
"num_tokens": 137256533.0,
|
|
"step": 231
|
|
},
|
|
{
|
|
"epoch": 1.1047619047619048,
|
|
"ewc_loss": 0.00010538101196289062,
|
|
"grad_norm": 0.6748205423355103,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1624,
|
|
"mean_token_accuracy": 0.672102153301239,
|
|
"num_tokens": 137848246.0,
|
|
"step": 232
|
|
},
|
|
{
|
|
"epoch": 1.1095238095238096,
|
|
"ewc_loss": 0.00010538101196289062,
|
|
"grad_norm": 0.7581402659416199,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1661,
|
|
"mean_token_accuracy": 0.6720702648162842,
|
|
"num_tokens": 138450870.0,
|
|
"step": 233
|
|
},
|
|
{
|
|
"epoch": 1.1142857142857143,
|
|
"ewc_loss": 0.00010585784912109375,
|
|
"grad_norm": 0.6564130783081055,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1663,
|
|
"mean_token_accuracy": 0.6707063317298889,
|
|
"num_tokens": 139048178.0,
|
|
"step": 234
|
|
},
|
|
{
|
|
"epoch": 1.119047619047619,
|
|
"ewc_loss": 0.00010585784912109375,
|
|
"grad_norm": 0.729809582233429,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1564,
|
|
"mean_token_accuracy": 0.6734843850135803,
|
|
"num_tokens": 139647536.0,
|
|
"step": 235
|
|
},
|
|
{
|
|
"epoch": 1.1238095238095238,
|
|
"ewc_loss": 0.00010585784912109375,
|
|
"grad_norm": 0.6604260206222534,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1595,
|
|
"mean_token_accuracy": 0.6731644868850708,
|
|
"num_tokens": 140237569.0,
|
|
"step": 236
|
|
},
|
|
{
|
|
"epoch": 1.1285714285714286,
|
|
"ewc_loss": 0.00010585784912109375,
|
|
"grad_norm": 0.719562828540802,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1627,
|
|
"mean_token_accuracy": 0.6718910932540894,
|
|
"num_tokens": 140808948.0,
|
|
"step": 237
|
|
},
|
|
{
|
|
"epoch": 1.1333333333333333,
|
|
"ewc_loss": 0.00010633468627929688,
|
|
"grad_norm": 0.6598079204559326,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1587,
|
|
"mean_token_accuracy": 0.6719540953636169,
|
|
"num_tokens": 141387906.0,
|
|
"step": 238
|
|
},
|
|
{
|
|
"epoch": 1.138095238095238,
|
|
"ewc_loss": 0.00010776519775390625,
|
|
"grad_norm": 0.6968168616294861,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1589,
|
|
"mean_token_accuracy": 0.6734792590141296,
|
|
"num_tokens": 141991024.0,
|
|
"step": 239
|
|
},
|
|
{
|
|
"epoch": 1.1428571428571428,
|
|
"ewc_loss": 0.00010776519775390625,
|
|
"grad_norm": 0.6638649106025696,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1387,
|
|
"mean_token_accuracy": 0.6777873635292053,
|
|
"num_tokens": 142585170.0,
|
|
"step": 240
|
|
},
|
|
{
|
|
"epoch": 1.1476190476190475,
|
|
"ewc_loss": 0.00010967254638671875,
|
|
"grad_norm": 0.7307679057121277,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1681,
|
|
"mean_token_accuracy": 0.6708173751831055,
|
|
"num_tokens": 143178473.0,
|
|
"step": 241
|
|
},
|
|
{
|
|
"epoch": 1.1523809523809523,
|
|
"ewc_loss": 0.00010967254638671875,
|
|
"grad_norm": 0.6367514133453369,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1678,
|
|
"mean_token_accuracy": 0.6696717739105225,
|
|
"num_tokens": 143782184.0,
|
|
"step": 242
|
|
},
|
|
{
|
|
"epoch": 1.157142857142857,
|
|
"ewc_loss": 0.000110626220703125,
|
|
"grad_norm": 0.6685469746589661,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1502,
|
|
"mean_token_accuracy": 0.6747808456420898,
|
|
"num_tokens": 144383051.0,
|
|
"step": 243
|
|
},
|
|
{
|
|
"epoch": 1.161904761904762,
|
|
"ewc_loss": 0.00011110305786132812,
|
|
"grad_norm": 0.6335722804069519,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1605,
|
|
"mean_token_accuracy": 0.6732845306396484,
|
|
"num_tokens": 144977872.0,
|
|
"step": 244
|
|
},
|
|
{
|
|
"epoch": 1.1666666666666667,
|
|
"ewc_loss": 0.00011205673217773438,
|
|
"grad_norm": 0.6960098743438721,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1628,
|
|
"mean_token_accuracy": 0.6724103689193726,
|
|
"num_tokens": 145573077.0,
|
|
"step": 245
|
|
},
|
|
{
|
|
"epoch": 1.1714285714285715,
|
|
"ewc_loss": 0.00011205673217773438,
|
|
"grad_norm": 0.7681233882904053,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1636,
|
|
"mean_token_accuracy": 0.6729087233543396,
|
|
"num_tokens": 146165107.0,
|
|
"step": 246
|
|
},
|
|
{
|
|
"epoch": 1.1761904761904762,
|
|
"ewc_loss": 0.00011205673217773438,
|
|
"grad_norm": 0.6322612762451172,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1565,
|
|
"mean_token_accuracy": 0.6730691194534302,
|
|
"num_tokens": 146763356.0,
|
|
"step": 247
|
|
},
|
|
{
|
|
"epoch": 1.180952380952381,
|
|
"ewc_loss": 0.0001125335693359375,
|
|
"grad_norm": 0.7763254642486572,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1533,
|
|
"mean_token_accuracy": 0.6750073432922363,
|
|
"num_tokens": 147358035.0,
|
|
"step": 248
|
|
},
|
|
{
|
|
"epoch": 1.1857142857142857,
|
|
"ewc_loss": 0.0001125335693359375,
|
|
"grad_norm": 0.6803314685821533,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1694,
|
|
"mean_token_accuracy": 0.6700936555862427,
|
|
"num_tokens": 147955530.0,
|
|
"step": 249
|
|
},
|
|
{
|
|
"epoch": 1.1904761904761905,
|
|
"ewc_loss": 0.00011301040649414062,
|
|
"grad_norm": 0.6825563311576843,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1643,
|
|
"mean_token_accuracy": 0.6715677976608276,
|
|
"num_tokens": 148547950.0,
|
|
"step": 250
|
|
},
|
|
{
|
|
"epoch": 1.1952380952380952,
|
|
"ewc_loss": 0.00011348724365234375,
|
|
"grad_norm": 0.6566438674926758,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1483,
|
|
"mean_token_accuracy": 0.6752431392669678,
|
|
"num_tokens": 149127280.0,
|
|
"step": 251
|
|
},
|
|
{
|
|
"epoch": 1.2,
|
|
"ewc_loss": 0.00011444091796875,
|
|
"grad_norm": 0.7469977140426636,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1571,
|
|
"mean_token_accuracy": 0.6736258864402771,
|
|
"num_tokens": 149735096.0,
|
|
"step": 252
|
|
},
|
|
{
|
|
"epoch": 1.2047619047619047,
|
|
"ewc_loss": 0.00011444091796875,
|
|
"grad_norm": 0.6729435324668884,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1603,
|
|
"mean_token_accuracy": 0.6734333038330078,
|
|
"num_tokens": 150338864.0,
|
|
"step": 253
|
|
},
|
|
{
|
|
"epoch": 1.2095238095238094,
|
|
"ewc_loss": 0.00011539459228515625,
|
|
"grad_norm": 0.6763867735862732,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1408,
|
|
"mean_token_accuracy": 0.6774969100952148,
|
|
"num_tokens": 150940365.0,
|
|
"step": 254
|
|
},
|
|
{
|
|
"epoch": 1.2142857142857142,
|
|
"ewc_loss": 0.00011587142944335938,
|
|
"grad_norm": 0.7397602796554565,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1633,
|
|
"mean_token_accuracy": 0.672227144241333,
|
|
"num_tokens": 151517902.0,
|
|
"step": 255
|
|
},
|
|
{
|
|
"epoch": 1.2190476190476192,
|
|
"ewc_loss": 0.00011682510375976562,
|
|
"grad_norm": 0.6593320369720459,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1402,
|
|
"mean_token_accuracy": 0.6776659488677979,
|
|
"num_tokens": 152093932.0,
|
|
"step": 256
|
|
},
|
|
{
|
|
"epoch": 1.223809523809524,
|
|
"ewc_loss": 0.00011730194091796875,
|
|
"grad_norm": 0.7497645020484924,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1462,
|
|
"mean_token_accuracy": 0.6766269207000732,
|
|
"num_tokens": 152690003.0,
|
|
"step": 257
|
|
},
|
|
{
|
|
"epoch": 1.2285714285714286,
|
|
"ewc_loss": 0.00011730194091796875,
|
|
"grad_norm": 0.6354615688323975,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1481,
|
|
"mean_token_accuracy": 0.6760626435279846,
|
|
"num_tokens": 153278014.0,
|
|
"step": 258
|
|
},
|
|
{
|
|
"epoch": 1.2333333333333334,
|
|
"ewc_loss": 0.00011730194091796875,
|
|
"grad_norm": 0.8325806260108948,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1558,
|
|
"mean_token_accuracy": 0.674289345741272,
|
|
"num_tokens": 153871781.0,
|
|
"step": 259
|
|
},
|
|
{
|
|
"epoch": 1.2380952380952381,
|
|
"ewc_loss": 0.00011730194091796875,
|
|
"grad_norm": 0.6996971964836121,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1579,
|
|
"mean_token_accuracy": 0.6730574369430542,
|
|
"num_tokens": 154466124.0,
|
|
"step": 260
|
|
},
|
|
{
|
|
"epoch": 1.2428571428571429,
|
|
"ewc_loss": 0.00011730194091796875,
|
|
"grad_norm": 0.6479410529136658,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.152,
|
|
"mean_token_accuracy": 0.6738990545272827,
|
|
"num_tokens": 155073053.0,
|
|
"step": 261
|
|
},
|
|
{
|
|
"epoch": 1.2476190476190476,
|
|
"ewc_loss": 0.00011730194091796875,
|
|
"grad_norm": 0.7210741639137268,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1792,
|
|
"mean_token_accuracy": 0.6691583395004272,
|
|
"num_tokens": 155680694.0,
|
|
"step": 262
|
|
},
|
|
{
|
|
"epoch": 1.2523809523809524,
|
|
"ewc_loss": 0.00011730194091796875,
|
|
"grad_norm": 0.6367545127868652,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1673,
|
|
"mean_token_accuracy": 0.6707318425178528,
|
|
"num_tokens": 156279612.0,
|
|
"step": 263
|
|
},
|
|
{
|
|
"epoch": 1.2571428571428571,
|
|
"ewc_loss": 0.00011777877807617188,
|
|
"grad_norm": 0.7307613492012024,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1564,
|
|
"mean_token_accuracy": 0.6747885346412659,
|
|
"num_tokens": 156898086.0,
|
|
"step": 264
|
|
},
|
|
{
|
|
"epoch": 1.2619047619047619,
|
|
"ewc_loss": 0.000118255615234375,
|
|
"grad_norm": 0.6101694107055664,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1712,
|
|
"mean_token_accuracy": 0.6701425313949585,
|
|
"num_tokens": 157502996.0,
|
|
"step": 265
|
|
},
|
|
{
|
|
"epoch": 1.2666666666666666,
|
|
"ewc_loss": 0.000118255615234375,
|
|
"grad_norm": 0.671107292175293,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1729,
|
|
"mean_token_accuracy": 0.6695542931556702,
|
|
"num_tokens": 158107778.0,
|
|
"step": 266
|
|
},
|
|
{
|
|
"epoch": 1.2714285714285714,
|
|
"ewc_loss": 0.000118255615234375,
|
|
"grad_norm": 0.6329119205474854,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1359,
|
|
"mean_token_accuracy": 0.6784738302230835,
|
|
"num_tokens": 158713147.0,
|
|
"step": 267
|
|
},
|
|
{
|
|
"epoch": 1.276190476190476,
|
|
"ewc_loss": 0.00011873245239257812,
|
|
"grad_norm": 0.5813512206077576,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1439,
|
|
"mean_token_accuracy": 0.6764368414878845,
|
|
"num_tokens": 159292006.0,
|
|
"step": 268
|
|
},
|
|
{
|
|
"epoch": 1.2809523809523808,
|
|
"ewc_loss": 0.00011920928955078125,
|
|
"grad_norm": 0.6323403120040894,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1418,
|
|
"mean_token_accuracy": 0.6763206720352173,
|
|
"num_tokens": 159889197.0,
|
|
"step": 269
|
|
},
|
|
{
|
|
"epoch": 1.2857142857142856,
|
|
"ewc_loss": 0.00011968612670898438,
|
|
"grad_norm": 0.6662601232528687,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1561,
|
|
"mean_token_accuracy": 0.6739908456802368,
|
|
"num_tokens": 160485304.0,
|
|
"step": 270
|
|
},
|
|
{
|
|
"epoch": 1.2904761904761906,
|
|
"ewc_loss": 0.00011968612670898438,
|
|
"grad_norm": 0.6231806874275208,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1588,
|
|
"mean_token_accuracy": 0.6732742190361023,
|
|
"num_tokens": 161092433.0,
|
|
"step": 271
|
|
},
|
|
{
|
|
"epoch": 1.2952380952380953,
|
|
"ewc_loss": 0.00012063980102539062,
|
|
"grad_norm": 0.6269415020942688,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1584,
|
|
"mean_token_accuracy": 0.6734796762466431,
|
|
"num_tokens": 161683555.0,
|
|
"step": 272
|
|
},
|
|
{
|
|
"epoch": 1.3,
|
|
"ewc_loss": 0.00012063980102539062,
|
|
"grad_norm": 0.6093764901161194,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1477,
|
|
"mean_token_accuracy": 0.676306962966919,
|
|
"num_tokens": 162278973.0,
|
|
"step": 273
|
|
},
|
|
{
|
|
"epoch": 1.3047619047619048,
|
|
"ewc_loss": 0.00012063980102539062,
|
|
"grad_norm": 0.6324111223220825,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1555,
|
|
"mean_token_accuracy": 0.6751080751419067,
|
|
"num_tokens": 162885270.0,
|
|
"step": 274
|
|
},
|
|
{
|
|
"epoch": 1.3095238095238095,
|
|
"ewc_loss": 0.00012111663818359375,
|
|
"grad_norm": 0.6106688380241394,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1504,
|
|
"mean_token_accuracy": 0.6750252842903137,
|
|
"num_tokens": 163476311.0,
|
|
"step": 275
|
|
},
|
|
{
|
|
"epoch": 1.3142857142857143,
|
|
"ewc_loss": 0.00012111663818359375,
|
|
"grad_norm": 0.6746515035629272,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1644,
|
|
"mean_token_accuracy": 0.6719121336936951,
|
|
"num_tokens": 164071314.0,
|
|
"step": 276
|
|
},
|
|
{
|
|
"epoch": 1.319047619047619,
|
|
"ewc_loss": 0.0001220703125,
|
|
"grad_norm": 0.6589555740356445,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1512,
|
|
"mean_token_accuracy": 0.6750595569610596,
|
|
"num_tokens": 164663415.0,
|
|
"step": 277
|
|
},
|
|
{
|
|
"epoch": 1.3238095238095238,
|
|
"ewc_loss": 0.00012302398681640625,
|
|
"grad_norm": 0.6207736134529114,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1463,
|
|
"mean_token_accuracy": 0.6761904358863831,
|
|
"num_tokens": 165256997.0,
|
|
"step": 278
|
|
},
|
|
{
|
|
"epoch": 1.3285714285714285,
|
|
"ewc_loss": 0.00012302398681640625,
|
|
"grad_norm": 0.6420676112174988,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.151,
|
|
"mean_token_accuracy": 0.6750323176383972,
|
|
"num_tokens": 165847922.0,
|
|
"step": 279
|
|
},
|
|
{
|
|
"epoch": 1.3333333333333333,
|
|
"ewc_loss": 0.00012302398681640625,
|
|
"grad_norm": 0.6699045896530151,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1531,
|
|
"mean_token_accuracy": 0.6743202805519104,
|
|
"num_tokens": 166444541.0,
|
|
"step": 280
|
|
},
|
|
{
|
|
"epoch": 1.3380952380952382,
|
|
"ewc_loss": 0.00012302398681640625,
|
|
"grad_norm": 0.6814138293266296,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.144,
|
|
"mean_token_accuracy": 0.6767035722732544,
|
|
"num_tokens": 167028591.0,
|
|
"step": 281
|
|
},
|
|
{
|
|
"epoch": 1.342857142857143,
|
|
"ewc_loss": 0.00012302398681640625,
|
|
"grad_norm": 0.6935127973556519,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1665,
|
|
"mean_token_accuracy": 0.671198844909668,
|
|
"num_tokens": 167627132.0,
|
|
"step": 282
|
|
},
|
|
{
|
|
"epoch": 1.3476190476190477,
|
|
"ewc_loss": 0.00012493133544921875,
|
|
"grad_norm": 0.726025402545929,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1391,
|
|
"mean_token_accuracy": 0.6784907579421997,
|
|
"num_tokens": 168226854.0,
|
|
"step": 283
|
|
},
|
|
{
|
|
"epoch": 1.3523809523809525,
|
|
"ewc_loss": 0.00012493133544921875,
|
|
"grad_norm": 0.6947522759437561,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1705,
|
|
"mean_token_accuracy": 0.6707179546356201,
|
|
"num_tokens": 168833732.0,
|
|
"step": 284
|
|
},
|
|
{
|
|
"epoch": 1.3571428571428572,
|
|
"ewc_loss": 0.000125885009765625,
|
|
"grad_norm": 0.6518645286560059,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1459,
|
|
"mean_token_accuracy": 0.6767383217811584,
|
|
"num_tokens": 169426970.0,
|
|
"step": 285
|
|
},
|
|
{
|
|
"epoch": 1.361904761904762,
|
|
"ewc_loss": 0.000125885009765625,
|
|
"grad_norm": 0.6948076486587524,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1701,
|
|
"mean_token_accuracy": 0.6717157959938049,
|
|
"num_tokens": 170025787.0,
|
|
"step": 286
|
|
},
|
|
{
|
|
"epoch": 1.3666666666666667,
|
|
"ewc_loss": 0.00012683868408203125,
|
|
"grad_norm": 0.6782196164131165,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1655,
|
|
"mean_token_accuracy": 0.6709975004196167,
|
|
"num_tokens": 170621857.0,
|
|
"step": 287
|
|
},
|
|
{
|
|
"epoch": 1.3714285714285714,
|
|
"ewc_loss": 0.00012683868408203125,
|
|
"grad_norm": 0.6176546216011047,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1628,
|
|
"mean_token_accuracy": 0.6721798181533813,
|
|
"num_tokens": 171220708.0,
|
|
"step": 288
|
|
},
|
|
{
|
|
"epoch": 1.3761904761904762,
|
|
"ewc_loss": 0.0001277923583984375,
|
|
"grad_norm": 0.685262143611908,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1726,
|
|
"mean_token_accuracy": 0.6695364117622375,
|
|
"num_tokens": 171812508.0,
|
|
"step": 289
|
|
},
|
|
{
|
|
"epoch": 1.380952380952381,
|
|
"ewc_loss": 0.0001277923583984375,
|
|
"grad_norm": 0.6457617878913879,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1437,
|
|
"mean_token_accuracy": 0.6757136583328247,
|
|
"num_tokens": 172401090.0,
|
|
"step": 290
|
|
},
|
|
{
|
|
"epoch": 1.3857142857142857,
|
|
"ewc_loss": 0.00012969970703125,
|
|
"grad_norm": 0.6617944240570068,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1501,
|
|
"mean_token_accuracy": 0.6755524277687073,
|
|
"num_tokens": 172989201.0,
|
|
"step": 291
|
|
},
|
|
{
|
|
"epoch": 1.3904761904761904,
|
|
"ewc_loss": 0.00012969970703125,
|
|
"grad_norm": 0.6595346927642822,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.152,
|
|
"mean_token_accuracy": 0.674351692199707,
|
|
"num_tokens": 173563807.0,
|
|
"step": 292
|
|
},
|
|
{
|
|
"epoch": 1.3952380952380952,
|
|
"ewc_loss": 0.00012969970703125,
|
|
"grad_norm": 0.6070469617843628,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1505,
|
|
"mean_token_accuracy": 0.6755003929138184,
|
|
"num_tokens": 174159574.0,
|
|
"step": 293
|
|
},
|
|
{
|
|
"epoch": 1.4,
|
|
"ewc_loss": 0.00012969970703125,
|
|
"grad_norm": 0.6572863459587097,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1691,
|
|
"mean_token_accuracy": 0.6707274913787842,
|
|
"num_tokens": 174744244.0,
|
|
"step": 294
|
|
},
|
|
{
|
|
"epoch": 1.4047619047619047,
|
|
"ewc_loss": 0.00012969970703125,
|
|
"grad_norm": 0.6544990539550781,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1521,
|
|
"mean_token_accuracy": 0.6740829944610596,
|
|
"num_tokens": 175341946.0,
|
|
"step": 295
|
|
},
|
|
{
|
|
"epoch": 1.4095238095238094,
|
|
"ewc_loss": 0.00012969970703125,
|
|
"grad_norm": 0.6822325587272644,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1223,
|
|
"mean_token_accuracy": 0.6815128326416016,
|
|
"num_tokens": 175904117.0,
|
|
"step": 296
|
|
},
|
|
{
|
|
"epoch": 1.4142857142857144,
|
|
"ewc_loss": 0.00012969970703125,
|
|
"grad_norm": 0.6739046573638916,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1511,
|
|
"mean_token_accuracy": 0.6751952767372131,
|
|
"num_tokens": 176493621.0,
|
|
"step": 297
|
|
},
|
|
{
|
|
"epoch": 1.4190476190476191,
|
|
"ewc_loss": 0.00012969970703125,
|
|
"grad_norm": 0.6111772060394287,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1521,
|
|
"mean_token_accuracy": 0.6745830178260803,
|
|
"num_tokens": 177082157.0,
|
|
"step": 298
|
|
},
|
|
{
|
|
"epoch": 1.4238095238095239,
|
|
"ewc_loss": 0.00013065338134765625,
|
|
"grad_norm": 0.635899543762207,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1532,
|
|
"mean_token_accuracy": 0.6735986471176147,
|
|
"num_tokens": 177668681.0,
|
|
"step": 299
|
|
},
|
|
{
|
|
"epoch": 1.4285714285714286,
|
|
"ewc_loss": 0.00013065338134765625,
|
|
"grad_norm": 0.670354962348938,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1559,
|
|
"mean_token_accuracy": 0.6734795570373535,
|
|
"num_tokens": 178256283.0,
|
|
"step": 300
|
|
},
|
|
{
|
|
"epoch": 1.4333333333333333,
|
|
"ewc_loss": 0.0001316070556640625,
|
|
"grad_norm": 0.6549680829048157,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1674,
|
|
"mean_token_accuracy": 0.6707263588905334,
|
|
"num_tokens": 178850673.0,
|
|
"step": 301
|
|
},
|
|
{
|
|
"epoch": 1.438095238095238,
|
|
"ewc_loss": 0.00013256072998046875,
|
|
"grad_norm": 0.6093829274177551,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1453,
|
|
"mean_token_accuracy": 0.6772531867027283,
|
|
"num_tokens": 179457871.0,
|
|
"step": 302
|
|
},
|
|
{
|
|
"epoch": 1.4428571428571428,
|
|
"ewc_loss": 0.00013256072998046875,
|
|
"grad_norm": 0.650852620601654,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.176,
|
|
"mean_token_accuracy": 0.6690418124198914,
|
|
"num_tokens": 180064071.0,
|
|
"step": 303
|
|
},
|
|
{
|
|
"epoch": 1.4476190476190476,
|
|
"ewc_loss": 0.000133514404296875,
|
|
"grad_norm": 0.6303402781486511,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1316,
|
|
"mean_token_accuracy": 0.6791470050811768,
|
|
"num_tokens": 180650796.0,
|
|
"step": 304
|
|
},
|
|
{
|
|
"epoch": 1.4523809523809523,
|
|
"ewc_loss": 0.000133514404296875,
|
|
"grad_norm": 0.6972697973251343,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.162,
|
|
"mean_token_accuracy": 0.6737735271453857,
|
|
"num_tokens": 181246825.0,
|
|
"step": 305
|
|
},
|
|
{
|
|
"epoch": 1.457142857142857,
|
|
"ewc_loss": 0.00013446807861328125,
|
|
"grad_norm": 0.6013135313987732,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1642,
|
|
"mean_token_accuracy": 0.6720057725906372,
|
|
"num_tokens": 181855567.0,
|
|
"step": 306
|
|
},
|
|
{
|
|
"epoch": 1.461904761904762,
|
|
"ewc_loss": 0.00013446807861328125,
|
|
"grad_norm": 0.64536052942276,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1308,
|
|
"mean_token_accuracy": 0.6788034439086914,
|
|
"num_tokens": 182433911.0,
|
|
"step": 307
|
|
},
|
|
{
|
|
"epoch": 1.4666666666666668,
|
|
"ewc_loss": 0.00013446807861328125,
|
|
"grad_norm": 0.637714684009552,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1519,
|
|
"mean_token_accuracy": 0.6748881340026855,
|
|
"num_tokens": 183023144.0,
|
|
"step": 308
|
|
},
|
|
{
|
|
"epoch": 1.4714285714285715,
|
|
"ewc_loss": 0.0001354217529296875,
|
|
"grad_norm": 0.6207025051116943,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1439,
|
|
"mean_token_accuracy": 0.676141619682312,
|
|
"num_tokens": 183626514.0,
|
|
"step": 309
|
|
},
|
|
{
|
|
"epoch": 1.4761904761904763,
|
|
"ewc_loss": 0.0001354217529296875,
|
|
"grad_norm": 0.6855812668800354,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1496,
|
|
"mean_token_accuracy": 0.6753396987915039,
|
|
"num_tokens": 184221439.0,
|
|
"step": 310
|
|
},
|
|
{
|
|
"epoch": 1.480952380952381,
|
|
"ewc_loss": 0.0001373291015625,
|
|
"grad_norm": 0.6581445336341858,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1556,
|
|
"mean_token_accuracy": 0.6741703152656555,
|
|
"num_tokens": 184819506.0,
|
|
"step": 311
|
|
},
|
|
{
|
|
"epoch": 1.4857142857142858,
|
|
"ewc_loss": 0.00013828277587890625,
|
|
"grad_norm": 0.6430357098579407,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1557,
|
|
"mean_token_accuracy": 0.6742795705795288,
|
|
"num_tokens": 185419019.0,
|
|
"step": 312
|
|
},
|
|
{
|
|
"epoch": 1.4904761904761905,
|
|
"ewc_loss": 0.00013828277587890625,
|
|
"grad_norm": 0.605305552482605,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.143,
|
|
"mean_token_accuracy": 0.6783961653709412,
|
|
"num_tokens": 186010772.0,
|
|
"step": 313
|
|
},
|
|
{
|
|
"epoch": 1.4952380952380953,
|
|
"ewc_loss": 0.00013828277587890625,
|
|
"grad_norm": 0.6420088410377502,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.14,
|
|
"mean_token_accuracy": 0.6774594783782959,
|
|
"num_tokens": 186589243.0,
|
|
"step": 314
|
|
},
|
|
{
|
|
"epoch": 1.5,
|
|
"ewc_loss": 0.00013828277587890625,
|
|
"grad_norm": 0.6538381576538086,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1385,
|
|
"mean_token_accuracy": 0.678307831287384,
|
|
"num_tokens": 187182368.0,
|
|
"step": 315
|
|
},
|
|
{
|
|
"epoch": 1.5047619047619047,
|
|
"ewc_loss": 0.00013828277587890625,
|
|
"grad_norm": 0.6643081903457642,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1395,
|
|
"mean_token_accuracy": 0.6776562929153442,
|
|
"num_tokens": 187763428.0,
|
|
"step": 316
|
|
},
|
|
{
|
|
"epoch": 1.5095238095238095,
|
|
"ewc_loss": 0.00013828277587890625,
|
|
"grad_norm": 0.5994731187820435,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1346,
|
|
"mean_token_accuracy": 0.6792024374008179,
|
|
"num_tokens": 188359395.0,
|
|
"step": 317
|
|
},
|
|
{
|
|
"epoch": 1.5142857142857142,
|
|
"ewc_loss": 0.0001392364501953125,
|
|
"grad_norm": 0.6703721284866333,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1549,
|
|
"mean_token_accuracy": 0.6739734411239624,
|
|
"num_tokens": 188952450.0,
|
|
"step": 318
|
|
},
|
|
{
|
|
"epoch": 1.519047619047619,
|
|
"ewc_loss": 0.0001392364501953125,
|
|
"grad_norm": 0.6435332894325256,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1503,
|
|
"mean_token_accuracy": 0.674832820892334,
|
|
"num_tokens": 189535853.0,
|
|
"step": 319
|
|
},
|
|
{
|
|
"epoch": 1.5238095238095237,
|
|
"ewc_loss": 0.0001392364501953125,
|
|
"grad_norm": 0.6654917597770691,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1334,
|
|
"mean_token_accuracy": 0.679200291633606,
|
|
"num_tokens": 190127386.0,
|
|
"step": 320
|
|
},
|
|
{
|
|
"epoch": 1.5285714285714285,
|
|
"ewc_loss": 0.00014019012451171875,
|
|
"grad_norm": 0.6404235363006592,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1505,
|
|
"mean_token_accuracy": 0.674620509147644,
|
|
"num_tokens": 190718877.0,
|
|
"step": 321
|
|
},
|
|
{
|
|
"epoch": 1.5333333333333332,
|
|
"ewc_loss": 0.00014019012451171875,
|
|
"grad_norm": 0.660757839679718,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1727,
|
|
"mean_token_accuracy": 0.6700729131698608,
|
|
"num_tokens": 191320553.0,
|
|
"step": 322
|
|
},
|
|
{
|
|
"epoch": 1.538095238095238,
|
|
"ewc_loss": 0.00014019012451171875,
|
|
"grad_norm": 0.6505669951438904,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1442,
|
|
"mean_token_accuracy": 0.6773086786270142,
|
|
"num_tokens": 191911786.0,
|
|
"step": 323
|
|
},
|
|
{
|
|
"epoch": 1.5428571428571427,
|
|
"ewc_loss": 0.000141143798828125,
|
|
"grad_norm": 0.614949107170105,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1707,
|
|
"mean_token_accuracy": 0.6713336706161499,
|
|
"num_tokens": 192517254.0,
|
|
"step": 324
|
|
},
|
|
{
|
|
"epoch": 1.5476190476190477,
|
|
"ewc_loss": 0.00014209747314453125,
|
|
"grad_norm": 0.6452739238739014,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1663,
|
|
"mean_token_accuracy": 0.6713839769363403,
|
|
"num_tokens": 193113713.0,
|
|
"step": 325
|
|
},
|
|
{
|
|
"epoch": 1.5523809523809524,
|
|
"ewc_loss": 0.00014209747314453125,
|
|
"grad_norm": 0.6736011505126953,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1477,
|
|
"mean_token_accuracy": 0.6761367917060852,
|
|
"num_tokens": 193718335.0,
|
|
"step": 326
|
|
},
|
|
{
|
|
"epoch": 1.5571428571428572,
|
|
"ewc_loss": 0.00014209747314453125,
|
|
"grad_norm": 0.6864199638366699,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1494,
|
|
"mean_token_accuracy": 0.6749632358551025,
|
|
"num_tokens": 194303328.0,
|
|
"step": 327
|
|
},
|
|
{
|
|
"epoch": 1.561904761904762,
|
|
"ewc_loss": 0.0001430511474609375,
|
|
"grad_norm": 0.7419075965881348,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1432,
|
|
"mean_token_accuracy": 0.6770002841949463,
|
|
"num_tokens": 194886509.0,
|
|
"step": 328
|
|
},
|
|
{
|
|
"epoch": 1.5666666666666667,
|
|
"ewc_loss": 0.0001430511474609375,
|
|
"grad_norm": 0.7009215354919434,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1497,
|
|
"mean_token_accuracy": 0.6762374639511108,
|
|
"num_tokens": 195456896.0,
|
|
"step": 329
|
|
},
|
|
{
|
|
"epoch": 1.5714285714285714,
|
|
"ewc_loss": 0.0001430511474609375,
|
|
"grad_norm": 0.7187398076057434,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1467,
|
|
"mean_token_accuracy": 0.6751656532287598,
|
|
"num_tokens": 196053871.0,
|
|
"step": 330
|
|
},
|
|
{
|
|
"epoch": 1.5761904761904761,
|
|
"ewc_loss": 0.0001430511474609375,
|
|
"grad_norm": 0.7469356060028076,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1465,
|
|
"mean_token_accuracy": 0.6756400465965271,
|
|
"num_tokens": 196654732.0,
|
|
"step": 331
|
|
},
|
|
{
|
|
"epoch": 1.580952380952381,
|
|
"ewc_loss": 0.0001430511474609375,
|
|
"grad_norm": 0.7524728775024414,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1353,
|
|
"mean_token_accuracy": 0.6790270209312439,
|
|
"num_tokens": 197242864.0,
|
|
"step": 332
|
|
},
|
|
{
|
|
"epoch": 1.5857142857142859,
|
|
"ewc_loss": 0.00014400482177734375,
|
|
"grad_norm": 0.7556422352790833,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1383,
|
|
"mean_token_accuracy": 0.67811518907547,
|
|
"num_tokens": 197840214.0,
|
|
"step": 333
|
|
},
|
|
{
|
|
"epoch": 1.5904761904761906,
|
|
"ewc_loss": 0.00014400482177734375,
|
|
"grad_norm": 0.7742359638214111,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1406,
|
|
"mean_token_accuracy": 0.6778503656387329,
|
|
"num_tokens": 198440572.0,
|
|
"step": 334
|
|
},
|
|
{
|
|
"epoch": 1.5952380952380953,
|
|
"ewc_loss": 0.00014495849609375,
|
|
"grad_norm": 0.6891140341758728,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1364,
|
|
"mean_token_accuracy": 0.6788163185119629,
|
|
"num_tokens": 199039184.0,
|
|
"step": 335
|
|
},
|
|
{
|
|
"epoch": 1.6,
|
|
"ewc_loss": 0.00014495849609375,
|
|
"grad_norm": 0.8170424699783325,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1371,
|
|
"mean_token_accuracy": 0.6775611042976379,
|
|
"num_tokens": 199626548.0,
|
|
"step": 336
|
|
},
|
|
{
|
|
"epoch": 1.6047619047619048,
|
|
"ewc_loss": 0.00014495849609375,
|
|
"grad_norm": 0.7578041553497314,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1511,
|
|
"mean_token_accuracy": 0.6754661798477173,
|
|
"num_tokens": 200222258.0,
|
|
"step": 337
|
|
},
|
|
{
|
|
"epoch": 1.6095238095238096,
|
|
"ewc_loss": 0.00014495849609375,
|
|
"grad_norm": 0.7882201075553894,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1439,
|
|
"mean_token_accuracy": 0.6771807670593262,
|
|
"num_tokens": 200819172.0,
|
|
"step": 338
|
|
},
|
|
{
|
|
"epoch": 1.6142857142857143,
|
|
"ewc_loss": 0.0001468658447265625,
|
|
"grad_norm": 0.6903438568115234,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1548,
|
|
"mean_token_accuracy": 0.6745074391365051,
|
|
"num_tokens": 201413549.0,
|
|
"step": 339
|
|
},
|
|
{
|
|
"epoch": 1.619047619047619,
|
|
"ewc_loss": 0.0001468658447265625,
|
|
"grad_norm": 0.7524880170822144,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1396,
|
|
"mean_token_accuracy": 0.6779199838638306,
|
|
"num_tokens": 202014069.0,
|
|
"step": 340
|
|
},
|
|
{
|
|
"epoch": 1.6238095238095238,
|
|
"ewc_loss": 0.0001468658447265625,
|
|
"grad_norm": 0.681341826915741,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1714,
|
|
"mean_token_accuracy": 0.6702905297279358,
|
|
"num_tokens": 202600379.0,
|
|
"step": 341
|
|
},
|
|
{
|
|
"epoch": 1.6285714285714286,
|
|
"ewc_loss": 0.00014781951904296875,
|
|
"grad_norm": 0.6814994215965271,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1457,
|
|
"mean_token_accuracy": 0.6763718724250793,
|
|
"num_tokens": 203203233.0,
|
|
"step": 342
|
|
},
|
|
{
|
|
"epoch": 1.6333333333333333,
|
|
"ewc_loss": 0.00014781951904296875,
|
|
"grad_norm": 0.6582874655723572,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.139,
|
|
"mean_token_accuracy": 0.6776784658432007,
|
|
"num_tokens": 203802554.0,
|
|
"step": 343
|
|
},
|
|
{
|
|
"epoch": 1.638095238095238,
|
|
"ewc_loss": 0.00014781951904296875,
|
|
"grad_norm": 0.6850972771644592,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1531,
|
|
"mean_token_accuracy": 0.6756852865219116,
|
|
"num_tokens": 204395560.0,
|
|
"step": 344
|
|
},
|
|
{
|
|
"epoch": 1.6428571428571428,
|
|
"ewc_loss": 0.00014781951904296875,
|
|
"grad_norm": 0.7036402225494385,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1364,
|
|
"mean_token_accuracy": 0.6790493726730347,
|
|
"num_tokens": 205001404.0,
|
|
"step": 345
|
|
},
|
|
{
|
|
"epoch": 1.6476190476190475,
|
|
"ewc_loss": 0.000148773193359375,
|
|
"grad_norm": 0.6020781397819519,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1301,
|
|
"mean_token_accuracy": 0.6804904937744141,
|
|
"num_tokens": 205599855.0,
|
|
"step": 346
|
|
},
|
|
{
|
|
"epoch": 1.6523809523809523,
|
|
"ewc_loss": 0.000148773193359375,
|
|
"grad_norm": 0.7237429022789001,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1359,
|
|
"mean_token_accuracy": 0.6785473823547363,
|
|
"num_tokens": 206163338.0,
|
|
"step": 347
|
|
},
|
|
{
|
|
"epoch": 1.657142857142857,
|
|
"ewc_loss": 0.00014972686767578125,
|
|
"grad_norm": 0.6438459753990173,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1609,
|
|
"mean_token_accuracy": 0.6729607582092285,
|
|
"num_tokens": 206741397.0,
|
|
"step": 348
|
|
},
|
|
{
|
|
"epoch": 1.6619047619047618,
|
|
"ewc_loss": 0.0001506805419921875,
|
|
"grad_norm": 0.6327041983604431,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.154,
|
|
"mean_token_accuracy": 0.674338698387146,
|
|
"num_tokens": 207323297.0,
|
|
"step": 349
|
|
},
|
|
{
|
|
"epoch": 1.6666666666666665,
|
|
"ewc_loss": 0.0001506805419921875,
|
|
"grad_norm": 0.6578752994537354,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.153,
|
|
"mean_token_accuracy": 0.674618661403656,
|
|
"num_tokens": 207908589.0,
|
|
"step": 350
|
|
},
|
|
{
|
|
"epoch": 1.6714285714285713,
|
|
"ewc_loss": 0.0001506805419921875,
|
|
"grad_norm": 0.6636021137237549,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1643,
|
|
"mean_token_accuracy": 0.6716607809066772,
|
|
"num_tokens": 208500281.0,
|
|
"step": 351
|
|
},
|
|
{
|
|
"epoch": 1.6761904761904762,
|
|
"ewc_loss": 0.0001506805419921875,
|
|
"grad_norm": 0.6660035252571106,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1438,
|
|
"mean_token_accuracy": 0.6771378517150879,
|
|
"num_tokens": 209097427.0,
|
|
"step": 352
|
|
},
|
|
{
|
|
"epoch": 1.680952380952381,
|
|
"ewc_loss": 0.0001506805419921875,
|
|
"grad_norm": 0.6406170129776001,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1456,
|
|
"mean_token_accuracy": 0.676054835319519,
|
|
"num_tokens": 209704225.0,
|
|
"step": 353
|
|
},
|
|
{
|
|
"epoch": 1.6857142857142857,
|
|
"ewc_loss": 0.00015163421630859375,
|
|
"grad_norm": 0.6275485157966614,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1416,
|
|
"mean_token_accuracy": 0.6777950525283813,
|
|
"num_tokens": 210313267.0,
|
|
"step": 354
|
|
},
|
|
{
|
|
"epoch": 1.6904761904761905,
|
|
"ewc_loss": 0.00015163421630859375,
|
|
"grad_norm": 0.6260340809822083,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1509,
|
|
"mean_token_accuracy": 0.6752045750617981,
|
|
"num_tokens": 210918588.0,
|
|
"step": 355
|
|
},
|
|
{
|
|
"epoch": 1.6952380952380952,
|
|
"ewc_loss": 0.00015163421630859375,
|
|
"grad_norm": 0.647498369216919,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.151,
|
|
"mean_token_accuracy": 0.6755985021591187,
|
|
"num_tokens": 211508221.0,
|
|
"step": 356
|
|
},
|
|
{
|
|
"epoch": 1.7,
|
|
"ewc_loss": 0.00015163421630859375,
|
|
"grad_norm": 0.6291764974594116,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1602,
|
|
"mean_token_accuracy": 0.6731336116790771,
|
|
"num_tokens": 212108728.0,
|
|
"step": 357
|
|
},
|
|
{
|
|
"epoch": 1.704761904761905,
|
|
"ewc_loss": 0.000152587890625,
|
|
"grad_norm": 0.6104746460914612,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1467,
|
|
"mean_token_accuracy": 0.6757202744483948,
|
|
"num_tokens": 212705437.0,
|
|
"step": 358
|
|
},
|
|
{
|
|
"epoch": 1.7095238095238097,
|
|
"ewc_loss": 0.000152587890625,
|
|
"grad_norm": 0.6411028504371643,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1569,
|
|
"mean_token_accuracy": 0.6729043126106262,
|
|
"num_tokens": 213300176.0,
|
|
"step": 359
|
|
},
|
|
{
|
|
"epoch": 1.7142857142857144,
|
|
"ewc_loss": 0.000152587890625,
|
|
"grad_norm": 0.6522796750068665,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1561,
|
|
"mean_token_accuracy": 0.6736069917678833,
|
|
"num_tokens": 213890731.0,
|
|
"step": 360
|
|
},
|
|
{
|
|
"epoch": 1.7190476190476192,
|
|
"ewc_loss": 0.0001544952392578125,
|
|
"grad_norm": 0.7141904234886169,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1393,
|
|
"mean_token_accuracy": 0.6766676902770996,
|
|
"num_tokens": 214471137.0,
|
|
"step": 361
|
|
},
|
|
{
|
|
"epoch": 1.723809523809524,
|
|
"ewc_loss": 0.0001544952392578125,
|
|
"grad_norm": 0.708467423915863,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1416,
|
|
"mean_token_accuracy": 0.6770792603492737,
|
|
"num_tokens": 215062165.0,
|
|
"step": 362
|
|
},
|
|
{
|
|
"epoch": 1.7285714285714286,
|
|
"ewc_loss": 0.0001544952392578125,
|
|
"grad_norm": 0.6397628784179688,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1512,
|
|
"mean_token_accuracy": 0.6748247742652893,
|
|
"num_tokens": 215662977.0,
|
|
"step": 363
|
|
},
|
|
{
|
|
"epoch": 1.7333333333333334,
|
|
"ewc_loss": 0.0001544952392578125,
|
|
"grad_norm": 0.7217324376106262,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1576,
|
|
"mean_token_accuracy": 0.6734106540679932,
|
|
"num_tokens": 216253942.0,
|
|
"step": 364
|
|
},
|
|
{
|
|
"epoch": 1.7380952380952381,
|
|
"ewc_loss": 0.00015544891357421875,
|
|
"grad_norm": 0.6196990609169006,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1482,
|
|
"mean_token_accuracy": 0.6748053431510925,
|
|
"num_tokens": 216847247.0,
|
|
"step": 365
|
|
},
|
|
{
|
|
"epoch": 1.7428571428571429,
|
|
"ewc_loss": 0.000156402587890625,
|
|
"grad_norm": 0.6930321455001831,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1362,
|
|
"mean_token_accuracy": 0.6786328554153442,
|
|
"num_tokens": 217427979.0,
|
|
"step": 366
|
|
},
|
|
{
|
|
"epoch": 1.7476190476190476,
|
|
"ewc_loss": 0.000156402587890625,
|
|
"grad_norm": 0.6234773397445679,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1398,
|
|
"mean_token_accuracy": 0.6772040724754333,
|
|
"num_tokens": 218020622.0,
|
|
"step": 367
|
|
},
|
|
{
|
|
"epoch": 1.7523809523809524,
|
|
"ewc_loss": 0.000156402587890625,
|
|
"grad_norm": 0.7133712768554688,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1491,
|
|
"mean_token_accuracy": 0.6760811805725098,
|
|
"num_tokens": 218613768.0,
|
|
"step": 368
|
|
},
|
|
{
|
|
"epoch": 1.7571428571428571,
|
|
"ewc_loss": 0.000156402587890625,
|
|
"grad_norm": 0.7202218174934387,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1604,
|
|
"mean_token_accuracy": 0.6728021502494812,
|
|
"num_tokens": 219217863.0,
|
|
"step": 369
|
|
},
|
|
{
|
|
"epoch": 1.7619047619047619,
|
|
"ewc_loss": 0.000156402587890625,
|
|
"grad_norm": 0.6628469824790955,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1497,
|
|
"mean_token_accuracy": 0.6751938462257385,
|
|
"num_tokens": 219826128.0,
|
|
"step": 370
|
|
},
|
|
{
|
|
"epoch": 1.7666666666666666,
|
|
"ewc_loss": 0.00015735626220703125,
|
|
"grad_norm": 0.5953910946846008,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1447,
|
|
"mean_token_accuracy": 0.6772898435592651,
|
|
"num_tokens": 220424737.0,
|
|
"step": 371
|
|
},
|
|
{
|
|
"epoch": 1.7714285714285714,
|
|
"ewc_loss": 0.00015735626220703125,
|
|
"grad_norm": 0.6661534905433655,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1493,
|
|
"mean_token_accuracy": 0.6752655506134033,
|
|
"num_tokens": 221010073.0,
|
|
"step": 372
|
|
},
|
|
{
|
|
"epoch": 1.776190476190476,
|
|
"ewc_loss": 0.0001583099365234375,
|
|
"grad_norm": 0.6600130796432495,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1459,
|
|
"mean_token_accuracy": 0.6769247651100159,
|
|
"num_tokens": 221614799.0,
|
|
"step": 373
|
|
},
|
|
{
|
|
"epoch": 1.7809523809523808,
|
|
"ewc_loss": 0.0001583099365234375,
|
|
"grad_norm": 0.5703900456428528,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1438,
|
|
"mean_token_accuracy": 0.6766201853752136,
|
|
"num_tokens": 222215943.0,
|
|
"step": 374
|
|
},
|
|
{
|
|
"epoch": 1.7857142857142856,
|
|
"ewc_loss": 0.0001583099365234375,
|
|
"grad_norm": 0.5636011362075806,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1395,
|
|
"mean_token_accuracy": 0.6783697605133057,
|
|
"num_tokens": 222803822.0,
|
|
"step": 375
|
|
},
|
|
{
|
|
"epoch": 1.7904761904761903,
|
|
"ewc_loss": 0.00016021728515625,
|
|
"grad_norm": 0.5983694791793823,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1569,
|
|
"mean_token_accuracy": 0.6734806895256042,
|
|
"num_tokens": 223409541.0,
|
|
"step": 376
|
|
},
|
|
{
|
|
"epoch": 1.795238095238095,
|
|
"ewc_loss": 0.00016021728515625,
|
|
"grad_norm": 0.5680118799209595,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1439,
|
|
"mean_token_accuracy": 0.6762411594390869,
|
|
"num_tokens": 223996446.0,
|
|
"step": 377
|
|
},
|
|
{
|
|
"epoch": 1.8,
|
|
"ewc_loss": 0.00016021728515625,
|
|
"grad_norm": 0.6568909883499146,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.146,
|
|
"mean_token_accuracy": 0.6763665676116943,
|
|
"num_tokens": 224599074.0,
|
|
"step": 378
|
|
},
|
|
{
|
|
"epoch": 1.8047619047619048,
|
|
"ewc_loss": 0.00016021728515625,
|
|
"grad_norm": 0.6191243529319763,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1378,
|
|
"mean_token_accuracy": 0.6781722903251648,
|
|
"num_tokens": 225184557.0,
|
|
"step": 379
|
|
},
|
|
{
|
|
"epoch": 1.8095238095238095,
|
|
"ewc_loss": 0.00016021728515625,
|
|
"grad_norm": 0.6668789982795715,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1441,
|
|
"mean_token_accuracy": 0.6778855323791504,
|
|
"num_tokens": 225774197.0,
|
|
"step": 380
|
|
},
|
|
{
|
|
"epoch": 1.8142857142857143,
|
|
"ewc_loss": 0.00016021728515625,
|
|
"grad_norm": 0.6230284571647644,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.133,
|
|
"mean_token_accuracy": 0.6788415908813477,
|
|
"num_tokens": 226359063.0,
|
|
"step": 381
|
|
},
|
|
{
|
|
"epoch": 1.819047619047619,
|
|
"ewc_loss": 0.00016117095947265625,
|
|
"grad_norm": 0.7061164975166321,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1499,
|
|
"mean_token_accuracy": 0.6751672029495239,
|
|
"num_tokens": 226962202.0,
|
|
"step": 382
|
|
},
|
|
{
|
|
"epoch": 1.8238095238095238,
|
|
"ewc_loss": 0.00016117095947265625,
|
|
"grad_norm": 0.6671425104141235,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1478,
|
|
"mean_token_accuracy": 0.6758670210838318,
|
|
"num_tokens": 227541002.0,
|
|
"step": 383
|
|
},
|
|
{
|
|
"epoch": 1.8285714285714287,
|
|
"ewc_loss": 0.00016117095947265625,
|
|
"grad_norm": 0.7205297350883484,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1481,
|
|
"mean_token_accuracy": 0.6760101318359375,
|
|
"num_tokens": 228134124.0,
|
|
"step": 384
|
|
},
|
|
{
|
|
"epoch": 1.8333333333333335,
|
|
"ewc_loss": 0.00016117095947265625,
|
|
"grad_norm": 0.6915554404258728,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1384,
|
|
"mean_token_accuracy": 0.6777753233909607,
|
|
"num_tokens": 228729717.0,
|
|
"step": 385
|
|
},
|
|
{
|
|
"epoch": 1.8380952380952382,
|
|
"ewc_loss": 0.00016117095947265625,
|
|
"grad_norm": 0.7729294896125793,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1444,
|
|
"mean_token_accuracy": 0.6762511730194092,
|
|
"num_tokens": 229318931.0,
|
|
"step": 386
|
|
},
|
|
{
|
|
"epoch": 1.842857142857143,
|
|
"ewc_loss": 0.00016117095947265625,
|
|
"grad_norm": 0.7292813658714294,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1513,
|
|
"mean_token_accuracy": 0.6754978895187378,
|
|
"num_tokens": 229923675.0,
|
|
"step": 387
|
|
},
|
|
{
|
|
"epoch": 1.8476190476190477,
|
|
"ewc_loss": 0.00016117095947265625,
|
|
"grad_norm": 0.6993569135665894,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1412,
|
|
"mean_token_accuracy": 0.6777368783950806,
|
|
"num_tokens": 230514254.0,
|
|
"step": 388
|
|
},
|
|
{
|
|
"epoch": 1.8523809523809525,
|
|
"ewc_loss": 0.00016117095947265625,
|
|
"grad_norm": 0.648634135723114,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1492,
|
|
"mean_token_accuracy": 0.675835132598877,
|
|
"num_tokens": 231113801.0,
|
|
"step": 389
|
|
},
|
|
{
|
|
"epoch": 1.8571428571428572,
|
|
"ewc_loss": 0.00016117095947265625,
|
|
"grad_norm": 0.6518822312355042,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.138,
|
|
"mean_token_accuracy": 0.6768615245819092,
|
|
"num_tokens": 231709098.0,
|
|
"step": 390
|
|
},
|
|
{
|
|
"epoch": 1.861904761904762,
|
|
"ewc_loss": 0.0001621246337890625,
|
|
"grad_norm": 0.621625542640686,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1511,
|
|
"mean_token_accuracy": 0.6751497387886047,
|
|
"num_tokens": 232311276.0,
|
|
"step": 391
|
|
},
|
|
{
|
|
"epoch": 1.8666666666666667,
|
|
"ewc_loss": 0.0001621246337890625,
|
|
"grad_norm": 0.6427440047264099,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1395,
|
|
"mean_token_accuracy": 0.6774629354476929,
|
|
"num_tokens": 232904607.0,
|
|
"step": 392
|
|
},
|
|
{
|
|
"epoch": 1.8714285714285714,
|
|
"ewc_loss": 0.0001621246337890625,
|
|
"grad_norm": 0.602607786655426,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1319,
|
|
"mean_token_accuracy": 0.6801781058311462,
|
|
"num_tokens": 233493254.0,
|
|
"step": 393
|
|
},
|
|
{
|
|
"epoch": 1.8761904761904762,
|
|
"ewc_loss": 0.0001621246337890625,
|
|
"grad_norm": 0.6977792382240295,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1415,
|
|
"mean_token_accuracy": 0.6779944896697998,
|
|
"num_tokens": 234085431.0,
|
|
"step": 394
|
|
},
|
|
{
|
|
"epoch": 1.880952380952381,
|
|
"ewc_loss": 0.00016307830810546875,
|
|
"grad_norm": 0.6492296457290649,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1509,
|
|
"mean_token_accuracy": 0.6749030351638794,
|
|
"num_tokens": 234685396.0,
|
|
"step": 395
|
|
},
|
|
{
|
|
"epoch": 1.8857142857142857,
|
|
"ewc_loss": 0.00016307830810546875,
|
|
"grad_norm": 0.7600075602531433,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1522,
|
|
"mean_token_accuracy": 0.6748752593994141,
|
|
"num_tokens": 235280049.0,
|
|
"step": 396
|
|
},
|
|
{
|
|
"epoch": 1.8904761904761904,
|
|
"ewc_loss": 0.00016307830810546875,
|
|
"grad_norm": 0.6604036688804626,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1528,
|
|
"mean_token_accuracy": 0.6751696467399597,
|
|
"num_tokens": 235867276.0,
|
|
"step": 397
|
|
},
|
|
{
|
|
"epoch": 1.8952380952380952,
|
|
"ewc_loss": 0.00016307830810546875,
|
|
"grad_norm": 0.722802460193634,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1395,
|
|
"mean_token_accuracy": 0.6781790256500244,
|
|
"num_tokens": 236448647.0,
|
|
"step": 398
|
|
},
|
|
{
|
|
"epoch": 1.9,
|
|
"ewc_loss": 0.00016307830810546875,
|
|
"grad_norm": 0.6620147228240967,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1523,
|
|
"mean_token_accuracy": 0.6736640334129333,
|
|
"num_tokens": 237054180.0,
|
|
"step": 399
|
|
},
|
|
{
|
|
"epoch": 1.9047619047619047,
|
|
"ewc_loss": 0.00016307830810546875,
|
|
"grad_norm": 0.6238665580749512,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1662,
|
|
"mean_token_accuracy": 0.6714326739311218,
|
|
"num_tokens": 237658218.0,
|
|
"step": 400
|
|
},
|
|
{
|
|
"epoch": 1.9095238095238094,
|
|
"ewc_loss": 0.00016498565673828125,
|
|
"grad_norm": 0.6817634701728821,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1492,
|
|
"mean_token_accuracy": 0.6760804057121277,
|
|
"num_tokens": 238248393.0,
|
|
"step": 401
|
|
},
|
|
{
|
|
"epoch": 1.9142857142857141,
|
|
"ewc_loss": 0.00016498565673828125,
|
|
"grad_norm": 0.6565764546394348,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1365,
|
|
"mean_token_accuracy": 0.6794743537902832,
|
|
"num_tokens": 238838548.0,
|
|
"step": 402
|
|
},
|
|
{
|
|
"epoch": 1.919047619047619,
|
|
"ewc_loss": 0.00016498565673828125,
|
|
"grad_norm": 0.6634266376495361,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1422,
|
|
"mean_token_accuracy": 0.6779740452766418,
|
|
"num_tokens": 239442502.0,
|
|
"step": 403
|
|
},
|
|
{
|
|
"epoch": 1.9238095238095239,
|
|
"ewc_loss": 0.00016498565673828125,
|
|
"grad_norm": 0.7058923840522766,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1543,
|
|
"mean_token_accuracy": 0.673976480960846,
|
|
"num_tokens": 240029019.0,
|
|
"step": 404
|
|
},
|
|
{
|
|
"epoch": 1.9285714285714286,
|
|
"ewc_loss": 0.00016498565673828125,
|
|
"grad_norm": 0.6188701391220093,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1403,
|
|
"mean_token_accuracy": 0.6783615350723267,
|
|
"num_tokens": 240623504.0,
|
|
"step": 405
|
|
},
|
|
{
|
|
"epoch": 1.9333333333333333,
|
|
"ewc_loss": 0.00016498565673828125,
|
|
"grad_norm": 0.6753594875335693,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1292,
|
|
"mean_token_accuracy": 0.6795880198478699,
|
|
"num_tokens": 241217102.0,
|
|
"step": 406
|
|
},
|
|
{
|
|
"epoch": 1.938095238095238,
|
|
"ewc_loss": 0.00016498565673828125,
|
|
"grad_norm": 0.654333770275116,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1413,
|
|
"mean_token_accuracy": 0.6782740354537964,
|
|
"num_tokens": 241812222.0,
|
|
"step": 407
|
|
},
|
|
{
|
|
"epoch": 1.9428571428571428,
|
|
"ewc_loss": 0.0001659393310546875,
|
|
"grad_norm": 0.6762703061103821,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.136,
|
|
"mean_token_accuracy": 0.6786253452301025,
|
|
"num_tokens": 242388669.0,
|
|
"step": 408
|
|
},
|
|
{
|
|
"epoch": 1.9476190476190476,
|
|
"ewc_loss": 0.0001659393310546875,
|
|
"grad_norm": 0.7018508911132812,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1384,
|
|
"mean_token_accuracy": 0.6782181859016418,
|
|
"num_tokens": 242965686.0,
|
|
"step": 409
|
|
},
|
|
{
|
|
"epoch": 1.9523809523809523,
|
|
"ewc_loss": 0.0001659393310546875,
|
|
"grad_norm": 0.6122801303863525,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1454,
|
|
"mean_token_accuracy": 0.6770577430725098,
|
|
"num_tokens": 243553853.0,
|
|
"step": 410
|
|
},
|
|
{
|
|
"epoch": 1.9571428571428573,
|
|
"ewc_loss": 0.0001659393310546875,
|
|
"grad_norm": 0.7788839936256409,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1407,
|
|
"mean_token_accuracy": 0.676740288734436,
|
|
"num_tokens": 244139754.0,
|
|
"step": 411
|
|
},
|
|
{
|
|
"epoch": 1.961904761904762,
|
|
"ewc_loss": 0.0001659393310546875,
|
|
"grad_norm": 0.6143774390220642,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1447,
|
|
"mean_token_accuracy": 0.6754165887832642,
|
|
"num_tokens": 244736423.0,
|
|
"step": 412
|
|
},
|
|
{
|
|
"epoch": 1.9666666666666668,
|
|
"ewc_loss": 0.0001659393310546875,
|
|
"grad_norm": 0.7902345061302185,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1464,
|
|
"mean_token_accuracy": 0.6773824691772461,
|
|
"num_tokens": 245337682.0,
|
|
"step": 413
|
|
},
|
|
{
|
|
"epoch": 1.9714285714285715,
|
|
"ewc_loss": 0.00016689300537109375,
|
|
"grad_norm": 0.6482428312301636,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1448,
|
|
"mean_token_accuracy": 0.6766495108604431,
|
|
"num_tokens": 245952105.0,
|
|
"step": 414
|
|
},
|
|
{
|
|
"epoch": 1.9761904761904763,
|
|
"ewc_loss": 0.00016689300537109375,
|
|
"grad_norm": 0.8346547484397888,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1317,
|
|
"mean_token_accuracy": 0.6797974109649658,
|
|
"num_tokens": 246540999.0,
|
|
"step": 415
|
|
},
|
|
{
|
|
"epoch": 1.980952380952381,
|
|
"ewc_loss": 0.00016689300537109375,
|
|
"grad_norm": 0.6634647846221924,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1377,
|
|
"mean_token_accuracy": 0.6796966195106506,
|
|
"num_tokens": 247142303.0,
|
|
"step": 416
|
|
},
|
|
{
|
|
"epoch": 1.9857142857142858,
|
|
"ewc_loss": 0.00016689300537109375,
|
|
"grad_norm": 0.9086723327636719,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1362,
|
|
"mean_token_accuracy": 0.6788153648376465,
|
|
"num_tokens": 247732988.0,
|
|
"step": 417
|
|
},
|
|
{
|
|
"epoch": 1.9904761904761905,
|
|
"ewc_loss": 0.00016689300537109375,
|
|
"grad_norm": 0.7153796553611755,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1304,
|
|
"mean_token_accuracy": 0.6795426607131958,
|
|
"num_tokens": 248334744.0,
|
|
"step": 418
|
|
},
|
|
{
|
|
"epoch": 1.9952380952380953,
|
|
"ewc_loss": 0.0001678466796875,
|
|
"grad_norm": 0.786276638507843,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1416,
|
|
"mean_token_accuracy": 0.6773613095283508,
|
|
"num_tokens": 248930347.0,
|
|
"step": 419
|
|
},
|
|
{
|
|
"epoch": 2.0,
|
|
"ewc_loss": 0.0001678466796875,
|
|
"grad_norm": 0.7534375190734863,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1573,
|
|
"mean_token_accuracy": 0.6742312908172607,
|
|
"num_tokens": 249522093.0,
|
|
"step": 420
|
|
},
|
|
{
|
|
"epoch": 2.0047619047619047,
|
|
"ewc_loss": 0.0001678466796875,
|
|
"grad_norm": 0.9145565032958984,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1082,
|
|
"mean_token_accuracy": 0.6845431327819824,
|
|
"num_tokens": 250112163.0,
|
|
"step": 421
|
|
},
|
|
{
|
|
"epoch": 2.0095238095238095,
|
|
"ewc_loss": 0.0001678466796875,
|
|
"grad_norm": 0.7746238708496094,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.096,
|
|
"mean_token_accuracy": 0.6880918741226196,
|
|
"num_tokens": 250690466.0,
|
|
"step": 422
|
|
},
|
|
{
|
|
"epoch": 2.0142857142857142,
|
|
"ewc_loss": 0.0001678466796875,
|
|
"grad_norm": 0.7521687150001526,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.0988,
|
|
"mean_token_accuracy": 0.686389684677124,
|
|
"num_tokens": 251279220.0,
|
|
"step": 423
|
|
},
|
|
{
|
|
"epoch": 2.019047619047619,
|
|
"ewc_loss": 0.0001678466796875,
|
|
"grad_norm": 0.783970832824707,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1021,
|
|
"mean_token_accuracy": 0.6861132383346558,
|
|
"num_tokens": 251871717.0,
|
|
"step": 424
|
|
},
|
|
{
|
|
"epoch": 2.0238095238095237,
|
|
"ewc_loss": 0.00016880035400390625,
|
|
"grad_norm": 0.7385753989219666,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1214,
|
|
"mean_token_accuracy": 0.6813136339187622,
|
|
"num_tokens": 252474129.0,
|
|
"step": 425
|
|
},
|
|
{
|
|
"epoch": 2.0285714285714285,
|
|
"ewc_loss": 0.0001697540283203125,
|
|
"grad_norm": 0.7110479474067688,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.0827,
|
|
"mean_token_accuracy": 0.6903846263885498,
|
|
"num_tokens": 253069065.0,
|
|
"step": 426
|
|
},
|
|
{
|
|
"epoch": 2.033333333333333,
|
|
"ewc_loss": 0.00017070770263671875,
|
|
"grad_norm": 0.72332763671875,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1101,
|
|
"mean_token_accuracy": 0.6836643218994141,
|
|
"num_tokens": 253654392.0,
|
|
"step": 427
|
|
},
|
|
{
|
|
"epoch": 2.038095238095238,
|
|
"ewc_loss": 0.00017070770263671875,
|
|
"grad_norm": 0.6721799969673157,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.0994,
|
|
"mean_token_accuracy": 0.6861385703086853,
|
|
"num_tokens": 254245168.0,
|
|
"step": 428
|
|
},
|
|
{
|
|
"epoch": 2.0428571428571427,
|
|
"ewc_loss": 0.00017070770263671875,
|
|
"grad_norm": 0.6682260036468506,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1132,
|
|
"mean_token_accuracy": 0.6824085712432861,
|
|
"num_tokens": 254841132.0,
|
|
"step": 429
|
|
},
|
|
{
|
|
"epoch": 2.0476190476190474,
|
|
"ewc_loss": 0.00017070770263671875,
|
|
"grad_norm": 0.6483193039894104,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.0986,
|
|
"mean_token_accuracy": 0.6865198612213135,
|
|
"num_tokens": 255433793.0,
|
|
"step": 430
|
|
},
|
|
{
|
|
"epoch": 2.052380952380952,
|
|
"ewc_loss": 0.00017070770263671875,
|
|
"grad_norm": 0.7642284631729126,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.0968,
|
|
"mean_token_accuracy": 0.6872822046279907,
|
|
"num_tokens": 256015225.0,
|
|
"step": 431
|
|
},
|
|
{
|
|
"epoch": 2.057142857142857,
|
|
"ewc_loss": 0.00017261505126953125,
|
|
"grad_norm": 0.7038707733154297,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.0952,
|
|
"mean_token_accuracy": 0.6875160932540894,
|
|
"num_tokens": 256617333.0,
|
|
"step": 432
|
|
},
|
|
{
|
|
"epoch": 2.0619047619047617,
|
|
"ewc_loss": 0.00017261505126953125,
|
|
"grad_norm": 0.6278479099273682,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.123,
|
|
"mean_token_accuracy": 0.6816915273666382,
|
|
"num_tokens": 257214120.0,
|
|
"step": 433
|
|
},
|
|
{
|
|
"epoch": 2.066666666666667,
|
|
"ewc_loss": 0.00017452239990234375,
|
|
"grad_norm": 0.7122304439544678,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1021,
|
|
"mean_token_accuracy": 0.6855990886688232,
|
|
"num_tokens": 257807506.0,
|
|
"step": 434
|
|
},
|
|
{
|
|
"epoch": 2.0714285714285716,
|
|
"ewc_loss": 0.00017452239990234375,
|
|
"grad_norm": 0.6400743126869202,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1187,
|
|
"mean_token_accuracy": 0.6814316511154175,
|
|
"num_tokens": 258414225.0,
|
|
"step": 435
|
|
},
|
|
{
|
|
"epoch": 2.0761904761904764,
|
|
"ewc_loss": 0.00017452239990234375,
|
|
"grad_norm": 0.6896034479141235,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.0998,
|
|
"mean_token_accuracy": 0.6853578090667725,
|
|
"num_tokens": 259009305.0,
|
|
"step": 436
|
|
},
|
|
{
|
|
"epoch": 2.080952380952381,
|
|
"ewc_loss": 0.00017547607421875,
|
|
"grad_norm": 0.6344408392906189,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.0944,
|
|
"mean_token_accuracy": 0.687426745891571,
|
|
"num_tokens": 259600283.0,
|
|
"step": 437
|
|
},
|
|
{
|
|
"epoch": 2.085714285714286,
|
|
"ewc_loss": 0.00017547607421875,
|
|
"grad_norm": 0.6490014791488647,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.12,
|
|
"mean_token_accuracy": 0.6816084384918213,
|
|
"num_tokens": 260203907.0,
|
|
"step": 438
|
|
},
|
|
{
|
|
"epoch": 2.0904761904761906,
|
|
"ewc_loss": 0.00017642974853515625,
|
|
"grad_norm": 0.6366682648658752,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1148,
|
|
"mean_token_accuracy": 0.6820666193962097,
|
|
"num_tokens": 260795356.0,
|
|
"step": 439
|
|
},
|
|
{
|
|
"epoch": 2.0952380952380953,
|
|
"ewc_loss": 0.00017642974853515625,
|
|
"grad_norm": 0.6908619403839111,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.092,
|
|
"mean_token_accuracy": 0.6888693571090698,
|
|
"num_tokens": 261376414.0,
|
|
"step": 440
|
|
},
|
|
{
|
|
"epoch": 2.1,
|
|
"ewc_loss": 0.0001773834228515625,
|
|
"grad_norm": 0.7048479318618774,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.118,
|
|
"mean_token_accuracy": 0.6826504468917847,
|
|
"num_tokens": 261965206.0,
|
|
"step": 441
|
|
},
|
|
{
|
|
"epoch": 2.104761904761905,
|
|
"ewc_loss": 0.0001773834228515625,
|
|
"grad_norm": 0.6268666982650757,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1112,
|
|
"mean_token_accuracy": 0.6835829019546509,
|
|
"num_tokens": 262561371.0,
|
|
"step": 442
|
|
},
|
|
{
|
|
"epoch": 2.1095238095238096,
|
|
"ewc_loss": 0.00017833709716796875,
|
|
"grad_norm": 0.7118813395500183,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1007,
|
|
"mean_token_accuracy": 0.6866937875747681,
|
|
"num_tokens": 263159935.0,
|
|
"step": 443
|
|
},
|
|
{
|
|
"epoch": 2.1142857142857143,
|
|
"ewc_loss": 0.00017833709716796875,
|
|
"grad_norm": 0.698521077632904,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1128,
|
|
"mean_token_accuracy": 0.6823405027389526,
|
|
"num_tokens": 263754299.0,
|
|
"step": 444
|
|
},
|
|
{
|
|
"epoch": 2.119047619047619,
|
|
"ewc_loss": 0.000179290771484375,
|
|
"grad_norm": 0.672899067401886,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1121,
|
|
"mean_token_accuracy": 0.6834716200828552,
|
|
"num_tokens": 264354630.0,
|
|
"step": 445
|
|
},
|
|
{
|
|
"epoch": 2.123809523809524,
|
|
"ewc_loss": 0.000179290771484375,
|
|
"grad_norm": 0.7116140723228455,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1325,
|
|
"mean_token_accuracy": 0.6782610416412354,
|
|
"num_tokens": 264964353.0,
|
|
"step": 446
|
|
},
|
|
{
|
|
"epoch": 2.1285714285714286,
|
|
"ewc_loss": 0.00018024444580078125,
|
|
"grad_norm": 0.697312593460083,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1143,
|
|
"mean_token_accuracy": 0.6828429102897644,
|
|
"num_tokens": 265561411.0,
|
|
"step": 447
|
|
},
|
|
{
|
|
"epoch": 2.1333333333333333,
|
|
"ewc_loss": 0.00018024444580078125,
|
|
"grad_norm": 0.6884894371032715,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1056,
|
|
"mean_token_accuracy": 0.6847390532493591,
|
|
"num_tokens": 266155790.0,
|
|
"step": 448
|
|
},
|
|
{
|
|
"epoch": 2.138095238095238,
|
|
"ewc_loss": 0.00018024444580078125,
|
|
"grad_norm": 0.6482833623886108,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.112,
|
|
"mean_token_accuracy": 0.6840267181396484,
|
|
"num_tokens": 266757269.0,
|
|
"step": 449
|
|
},
|
|
{
|
|
"epoch": 2.142857142857143,
|
|
"ewc_loss": 0.00018024444580078125,
|
|
"grad_norm": 0.6641790866851807,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1274,
|
|
"mean_token_accuracy": 0.6801328659057617,
|
|
"num_tokens": 267369143.0,
|
|
"step": 450
|
|
},
|
|
{
|
|
"epoch": 2.1476190476190475,
|
|
"ewc_loss": 0.0001811981201171875,
|
|
"grad_norm": 0.66676926612854,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.095,
|
|
"mean_token_accuracy": 0.6883236169815063,
|
|
"num_tokens": 267965437.0,
|
|
"step": 451
|
|
},
|
|
{
|
|
"epoch": 2.1523809523809523,
|
|
"ewc_loss": 0.00018215179443359375,
|
|
"grad_norm": 0.6313933730125427,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1046,
|
|
"mean_token_accuracy": 0.685463011264801,
|
|
"num_tokens": 268571463.0,
|
|
"step": 452
|
|
},
|
|
{
|
|
"epoch": 2.157142857142857,
|
|
"ewc_loss": 0.00018215179443359375,
|
|
"grad_norm": 0.6560730934143066,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1033,
|
|
"mean_token_accuracy": 0.6857461333274841,
|
|
"num_tokens": 269157041.0,
|
|
"step": 453
|
|
},
|
|
{
|
|
"epoch": 2.1619047619047618,
|
|
"ewc_loss": 0.00018215179443359375,
|
|
"grad_norm": 0.6667070388793945,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1015,
|
|
"mean_token_accuracy": 0.6859844326972961,
|
|
"num_tokens": 269758195.0,
|
|
"step": 454
|
|
},
|
|
{
|
|
"epoch": 2.1666666666666665,
|
|
"ewc_loss": 0.00018310546875,
|
|
"grad_norm": 0.6455360054969788,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1307,
|
|
"mean_token_accuracy": 0.679124116897583,
|
|
"num_tokens": 270349613.0,
|
|
"step": 455
|
|
},
|
|
{
|
|
"epoch": 2.1714285714285713,
|
|
"ewc_loss": 0.00018310546875,
|
|
"grad_norm": 0.6486488580703735,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1171,
|
|
"mean_token_accuracy": 0.6807896494865417,
|
|
"num_tokens": 270947174.0,
|
|
"step": 456
|
|
},
|
|
{
|
|
"epoch": 2.176190476190476,
|
|
"ewc_loss": 0.00018405914306640625,
|
|
"grad_norm": 0.6494194269180298,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1261,
|
|
"mean_token_accuracy": 0.6802918910980225,
|
|
"num_tokens": 271549889.0,
|
|
"step": 457
|
|
},
|
|
{
|
|
"epoch": 2.1809523809523808,
|
|
"ewc_loss": 0.0001850128173828125,
|
|
"grad_norm": 0.6430622339248657,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.0982,
|
|
"mean_token_accuracy": 0.6874414682388306,
|
|
"num_tokens": 272139782.0,
|
|
"step": 458
|
|
},
|
|
{
|
|
"epoch": 2.185714285714286,
|
|
"ewc_loss": 0.0001850128173828125,
|
|
"grad_norm": 0.6347271800041199,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1103,
|
|
"mean_token_accuracy": 0.6838949918746948,
|
|
"num_tokens": 272746279.0,
|
|
"step": 459
|
|
},
|
|
{
|
|
"epoch": 2.1904761904761907,
|
|
"ewc_loss": 0.0001850128173828125,
|
|
"grad_norm": 0.725655198097229,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.097,
|
|
"mean_token_accuracy": 0.6875793933868408,
|
|
"num_tokens": 273348449.0,
|
|
"step": 460
|
|
},
|
|
{
|
|
"epoch": 2.1952380952380954,
|
|
"ewc_loss": 0.00018596649169921875,
|
|
"grad_norm": 0.6248878240585327,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1197,
|
|
"mean_token_accuracy": 0.6826616525650024,
|
|
"num_tokens": 273949928.0,
|
|
"step": 461
|
|
},
|
|
{
|
|
"epoch": 2.2,
|
|
"ewc_loss": 0.00018596649169921875,
|
|
"grad_norm": 0.6877484321594238,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1074,
|
|
"mean_token_accuracy": 0.6844019889831543,
|
|
"num_tokens": 274548070.0,
|
|
"step": 462
|
|
},
|
|
{
|
|
"epoch": 2.204761904761905,
|
|
"ewc_loss": 0.000186920166015625,
|
|
"grad_norm": 0.6929049491882324,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1101,
|
|
"mean_token_accuracy": 0.6836305856704712,
|
|
"num_tokens": 275135656.0,
|
|
"step": 463
|
|
},
|
|
{
|
|
"epoch": 2.2095238095238097,
|
|
"ewc_loss": 0.000186920166015625,
|
|
"grad_norm": 0.6943677067756653,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1107,
|
|
"mean_token_accuracy": 0.6841330528259277,
|
|
"num_tokens": 275740663.0,
|
|
"step": 464
|
|
},
|
|
{
|
|
"epoch": 2.2142857142857144,
|
|
"ewc_loss": 0.0001888275146484375,
|
|
"grad_norm": 0.6408126354217529,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.11,
|
|
"mean_token_accuracy": 0.6853839159011841,
|
|
"num_tokens": 276346207.0,
|
|
"step": 465
|
|
},
|
|
{
|
|
"epoch": 2.219047619047619,
|
|
"ewc_loss": 0.00018978118896484375,
|
|
"grad_norm": 0.6744728088378906,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1099,
|
|
"mean_token_accuracy": 0.6840918064117432,
|
|
"num_tokens": 276940208.0,
|
|
"step": 466
|
|
},
|
|
{
|
|
"epoch": 2.223809523809524,
|
|
"ewc_loss": 0.00018978118896484375,
|
|
"grad_norm": 0.6277769207954407,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1254,
|
|
"mean_token_accuracy": 0.680489182472229,
|
|
"num_tokens": 277539762.0,
|
|
"step": 467
|
|
},
|
|
{
|
|
"epoch": 2.2285714285714286,
|
|
"ewc_loss": 0.00018978118896484375,
|
|
"grad_norm": 0.750731348991394,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1214,
|
|
"mean_token_accuracy": 0.68072909116745,
|
|
"num_tokens": 278136526.0,
|
|
"step": 468
|
|
},
|
|
{
|
|
"epoch": 2.2333333333333334,
|
|
"ewc_loss": 0.00018978118896484375,
|
|
"grad_norm": 0.6324309706687927,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1116,
|
|
"mean_token_accuracy": 0.6839749813079834,
|
|
"num_tokens": 278723575.0,
|
|
"step": 469
|
|
},
|
|
{
|
|
"epoch": 2.238095238095238,
|
|
"ewc_loss": 0.00019168853759765625,
|
|
"grad_norm": 0.7240932583808899,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.0894,
|
|
"mean_token_accuracy": 0.6893594264984131,
|
|
"num_tokens": 279313692.0,
|
|
"step": 470
|
|
},
|
|
{
|
|
"epoch": 2.242857142857143,
|
|
"ewc_loss": 0.00019168853759765625,
|
|
"grad_norm": 0.6652906537055969,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1221,
|
|
"mean_token_accuracy": 0.6812858581542969,
|
|
"num_tokens": 279911596.0,
|
|
"step": 471
|
|
},
|
|
{
|
|
"epoch": 2.2476190476190476,
|
|
"ewc_loss": 0.00019168853759765625,
|
|
"grad_norm": 0.6877514123916626,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1052,
|
|
"mean_token_accuracy": 0.6858799457550049,
|
|
"num_tokens": 280516626.0,
|
|
"step": 472
|
|
},
|
|
{
|
|
"epoch": 2.2523809523809524,
|
|
"ewc_loss": 0.0001926422119140625,
|
|
"grad_norm": 0.6449379324913025,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1072,
|
|
"mean_token_accuracy": 0.6857140064239502,
|
|
"num_tokens": 281109826.0,
|
|
"step": 473
|
|
},
|
|
{
|
|
"epoch": 2.257142857142857,
|
|
"ewc_loss": 0.0001926422119140625,
|
|
"grad_norm": 0.6840381026268005,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1134,
|
|
"mean_token_accuracy": 0.6838372349739075,
|
|
"num_tokens": 281705908.0,
|
|
"step": 474
|
|
},
|
|
{
|
|
"epoch": 2.261904761904762,
|
|
"ewc_loss": 0.0001926422119140625,
|
|
"grad_norm": 0.6691530346870422,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1089,
|
|
"mean_token_accuracy": 0.6843646764755249,
|
|
"num_tokens": 282295646.0,
|
|
"step": 475
|
|
},
|
|
{
|
|
"epoch": 2.2666666666666666,
|
|
"ewc_loss": 0.0001926422119140625,
|
|
"grad_norm": 0.6821340322494507,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.0997,
|
|
"mean_token_accuracy": 0.6863222122192383,
|
|
"num_tokens": 282882984.0,
|
|
"step": 476
|
|
},
|
|
{
|
|
"epoch": 2.2714285714285714,
|
|
"ewc_loss": 0.000194549560546875,
|
|
"grad_norm": 0.6560771465301514,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1061,
|
|
"mean_token_accuracy": 0.6855646371841431,
|
|
"num_tokens": 283470314.0,
|
|
"step": 477
|
|
},
|
|
{
|
|
"epoch": 2.276190476190476,
|
|
"ewc_loss": 0.000194549560546875,
|
|
"grad_norm": 0.6751182079315186,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1086,
|
|
"mean_token_accuracy": 0.6842988729476929,
|
|
"num_tokens": 284064822.0,
|
|
"step": 478
|
|
},
|
|
{
|
|
"epoch": 2.280952380952381,
|
|
"ewc_loss": 0.00019550323486328125,
|
|
"grad_norm": 0.6855875849723816,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1025,
|
|
"mean_token_accuracy": 0.6867029666900635,
|
|
"num_tokens": 284659143.0,
|
|
"step": 479
|
|
},
|
|
{
|
|
"epoch": 2.2857142857142856,
|
|
"ewc_loss": 0.00019550323486328125,
|
|
"grad_norm": 0.682708203792572,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1148,
|
|
"mean_token_accuracy": 0.6841896772384644,
|
|
"num_tokens": 285260603.0,
|
|
"step": 480
|
|
},
|
|
{
|
|
"epoch": 2.2904761904761903,
|
|
"ewc_loss": 0.00019741058349609375,
|
|
"grad_norm": 0.6767780184745789,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1022,
|
|
"mean_token_accuracy": 0.6857354640960693,
|
|
"num_tokens": 285858617.0,
|
|
"step": 481
|
|
},
|
|
{
|
|
"epoch": 2.295238095238095,
|
|
"ewc_loss": 0.00019741058349609375,
|
|
"grad_norm": 0.6937857866287231,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1097,
|
|
"mean_token_accuracy": 0.685025691986084,
|
|
"num_tokens": 286462909.0,
|
|
"step": 482
|
|
},
|
|
{
|
|
"epoch": 2.3,
|
|
"ewc_loss": 0.0001983642578125,
|
|
"grad_norm": 0.8394407033920288,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1046,
|
|
"mean_token_accuracy": 0.6861523985862732,
|
|
"num_tokens": 287057508.0,
|
|
"step": 483
|
|
},
|
|
{
|
|
"epoch": 2.3047619047619046,
|
|
"ewc_loss": 0.0001983642578125,
|
|
"grad_norm": 0.6445318460464478,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1143,
|
|
"mean_token_accuracy": 0.6831765174865723,
|
|
"num_tokens": 287647864.0,
|
|
"step": 484
|
|
},
|
|
{
|
|
"epoch": 2.3095238095238093,
|
|
"ewc_loss": 0.00019931793212890625,
|
|
"grad_norm": 0.8252107501029968,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1168,
|
|
"mean_token_accuracy": 0.6827520728111267,
|
|
"num_tokens": 288244654.0,
|
|
"step": 485
|
|
},
|
|
{
|
|
"epoch": 2.314285714285714,
|
|
"ewc_loss": 0.00019931793212890625,
|
|
"grad_norm": 0.6876921057701111,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1258,
|
|
"mean_token_accuracy": 0.6806752681732178,
|
|
"num_tokens": 288833805.0,
|
|
"step": 486
|
|
},
|
|
{
|
|
"epoch": 2.319047619047619,
|
|
"ewc_loss": 0.00019931793212890625,
|
|
"grad_norm": 0.677362859249115,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1088,
|
|
"mean_token_accuracy": 0.684689998626709,
|
|
"num_tokens": 289430249.0,
|
|
"step": 487
|
|
},
|
|
{
|
|
"epoch": 2.323809523809524,
|
|
"ewc_loss": 0.00019931793212890625,
|
|
"grad_norm": 0.7645730972290039,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1098,
|
|
"mean_token_accuracy": 0.6858561635017395,
|
|
"num_tokens": 290017640.0,
|
|
"step": 488
|
|
},
|
|
{
|
|
"epoch": 2.3285714285714287,
|
|
"ewc_loss": 0.0002002716064453125,
|
|
"grad_norm": 0.6540156602859497,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1059,
|
|
"mean_token_accuracy": 0.6852644681930542,
|
|
"num_tokens": 290598414.0,
|
|
"step": 489
|
|
},
|
|
{
|
|
"epoch": 2.3333333333333335,
|
|
"ewc_loss": 0.0002002716064453125,
|
|
"grad_norm": 0.8180001974105835,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.0971,
|
|
"mean_token_accuracy": 0.68718421459198,
|
|
"num_tokens": 291181812.0,
|
|
"step": 490
|
|
},
|
|
{
|
|
"epoch": 2.3380952380952382,
|
|
"ewc_loss": 0.00020122528076171875,
|
|
"grad_norm": 0.659749448299408,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.111,
|
|
"mean_token_accuracy": 0.6841143369674683,
|
|
"num_tokens": 291764317.0,
|
|
"step": 491
|
|
},
|
|
{
|
|
"epoch": 2.342857142857143,
|
|
"ewc_loss": 0.00020122528076171875,
|
|
"grad_norm": 0.6519536375999451,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1175,
|
|
"mean_token_accuracy": 0.6820479035377502,
|
|
"num_tokens": 292350504.0,
|
|
"step": 492
|
|
},
|
|
{
|
|
"epoch": 2.3476190476190477,
|
|
"ewc_loss": 0.000202178955078125,
|
|
"grad_norm": 0.6839156150817871,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1139,
|
|
"mean_token_accuracy": 0.6831268668174744,
|
|
"num_tokens": 292951776.0,
|
|
"step": 493
|
|
},
|
|
{
|
|
"epoch": 2.3523809523809525,
|
|
"ewc_loss": 0.000202178955078125,
|
|
"grad_norm": 0.6827685832977295,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1061,
|
|
"mean_token_accuracy": 0.6853119134902954,
|
|
"num_tokens": 293532488.0,
|
|
"step": 494
|
|
},
|
|
{
|
|
"epoch": 2.357142857142857,
|
|
"ewc_loss": 0.000202178955078125,
|
|
"grad_norm": 0.6649286150932312,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.0934,
|
|
"mean_token_accuracy": 0.6886016130447388,
|
|
"num_tokens": 294121146.0,
|
|
"step": 495
|
|
},
|
|
{
|
|
"epoch": 2.361904761904762,
|
|
"ewc_loss": 0.000202178955078125,
|
|
"grad_norm": 0.6510864496231079,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1137,
|
|
"mean_token_accuracy": 0.6839732527732849,
|
|
"num_tokens": 294726732.0,
|
|
"step": 496
|
|
},
|
|
{
|
|
"epoch": 2.3666666666666667,
|
|
"ewc_loss": 0.000202178955078125,
|
|
"grad_norm": 0.7649646401405334,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1047,
|
|
"mean_token_accuracy": 0.6859601736068726,
|
|
"num_tokens": 295306697.0,
|
|
"step": 497
|
|
},
|
|
{
|
|
"epoch": 2.3714285714285714,
|
|
"ewc_loss": 0.000202178955078125,
|
|
"grad_norm": 0.7035748958587646,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1258,
|
|
"mean_token_accuracy": 0.6801150441169739,
|
|
"num_tokens": 295894972.0,
|
|
"step": 498
|
|
},
|
|
{
|
|
"epoch": 2.376190476190476,
|
|
"ewc_loss": 0.000202178955078125,
|
|
"grad_norm": 0.8493057489395142,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1201,
|
|
"mean_token_accuracy": 0.6819379329681396,
|
|
"num_tokens": 296505345.0,
|
|
"step": 499
|
|
},
|
|
{
|
|
"epoch": 2.380952380952381,
|
|
"ewc_loss": 0.000202178955078125,
|
|
"grad_norm": 0.7366160154342651,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1031,
|
|
"mean_token_accuracy": 0.6859379410743713,
|
|
"num_tokens": 297100909.0,
|
|
"step": 500
|
|
},
|
|
{
|
|
"epoch": 2.3857142857142857,
|
|
"ewc_loss": 0.000202178955078125,
|
|
"grad_norm": 0.830036997795105,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1115,
|
|
"mean_token_accuracy": 0.6848393678665161,
|
|
"num_tokens": 297690267.0,
|
|
"step": 501
|
|
},
|
|
{
|
|
"epoch": 2.3904761904761904,
|
|
"ewc_loss": 0.000202178955078125,
|
|
"grad_norm": 0.703220546245575,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1021,
|
|
"mean_token_accuracy": 0.6862471103668213,
|
|
"num_tokens": 298283484.0,
|
|
"step": 502
|
|
},
|
|
{
|
|
"epoch": 2.395238095238095,
|
|
"ewc_loss": 0.000202178955078125,
|
|
"grad_norm": 0.6833527684211731,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1182,
|
|
"mean_token_accuracy": 0.6818904280662537,
|
|
"num_tokens": 298880193.0,
|
|
"step": 503
|
|
},
|
|
{
|
|
"epoch": 2.4,
|
|
"ewc_loss": 0.000202178955078125,
|
|
"grad_norm": 0.6427726149559021,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.0951,
|
|
"mean_token_accuracy": 0.6871193647384644,
|
|
"num_tokens": 299479995.0,
|
|
"step": 504
|
|
},
|
|
{
|
|
"epoch": 2.4047619047619047,
|
|
"ewc_loss": 0.000202178955078125,
|
|
"grad_norm": 0.7238010168075562,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1102,
|
|
"mean_token_accuracy": 0.6843964457511902,
|
|
"num_tokens": 300068384.0,
|
|
"step": 505
|
|
},
|
|
{
|
|
"epoch": 2.4095238095238094,
|
|
"ewc_loss": 0.000202178955078125,
|
|
"grad_norm": 0.671266496181488,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1201,
|
|
"mean_token_accuracy": 0.6813974976539612,
|
|
"num_tokens": 300687274.0,
|
|
"step": 506
|
|
},
|
|
{
|
|
"epoch": 2.414285714285714,
|
|
"ewc_loss": 0.000202178955078125,
|
|
"grad_norm": 0.6755393743515015,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1121,
|
|
"mean_token_accuracy": 0.6834021806716919,
|
|
"num_tokens": 301288728.0,
|
|
"step": 507
|
|
},
|
|
{
|
|
"epoch": 2.419047619047619,
|
|
"ewc_loss": 0.00020313262939453125,
|
|
"grad_norm": 0.7003112435340881,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1066,
|
|
"mean_token_accuracy": 0.6853744983673096,
|
|
"num_tokens": 301868926.0,
|
|
"step": 508
|
|
},
|
|
{
|
|
"epoch": 2.4238095238095236,
|
|
"ewc_loss": 0.00020313262939453125,
|
|
"grad_norm": 0.624028742313385,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1018,
|
|
"mean_token_accuracy": 0.6868816614151001,
|
|
"num_tokens": 302467630.0,
|
|
"step": 509
|
|
},
|
|
{
|
|
"epoch": 2.4285714285714284,
|
|
"ewc_loss": 0.00020313262939453125,
|
|
"grad_norm": 0.6902435421943665,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1274,
|
|
"mean_token_accuracy": 0.6808619499206543,
|
|
"num_tokens": 303058965.0,
|
|
"step": 510
|
|
},
|
|
{
|
|
"epoch": 2.4333333333333336,
|
|
"ewc_loss": 0.00020503997802734375,
|
|
"grad_norm": 0.7868107557296753,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1284,
|
|
"mean_token_accuracy": 0.6793336272239685,
|
|
"num_tokens": 303639694.0,
|
|
"step": 511
|
|
},
|
|
{
|
|
"epoch": 2.4380952380952383,
|
|
"ewc_loss": 0.00020503997802734375,
|
|
"grad_norm": 0.5963805317878723,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1023,
|
|
"mean_token_accuracy": 0.6868472695350647,
|
|
"num_tokens": 304234504.0,
|
|
"step": 512
|
|
},
|
|
{
|
|
"epoch": 2.442857142857143,
|
|
"ewc_loss": 0.00020503997802734375,
|
|
"grad_norm": 0.6996021866798401,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1224,
|
|
"mean_token_accuracy": 0.681671142578125,
|
|
"num_tokens": 304822484.0,
|
|
"step": 513
|
|
},
|
|
{
|
|
"epoch": 2.447619047619048,
|
|
"ewc_loss": 0.00020503997802734375,
|
|
"grad_norm": 0.6602311134338379,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1066,
|
|
"mean_token_accuracy": 0.6862483024597168,
|
|
"num_tokens": 305405226.0,
|
|
"step": 514
|
|
},
|
|
{
|
|
"epoch": 2.4523809523809526,
|
|
"ewc_loss": 0.00020503997802734375,
|
|
"grad_norm": 0.6407869458198547,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1078,
|
|
"mean_token_accuracy": 0.6855425238609314,
|
|
"num_tokens": 306007153.0,
|
|
"step": 515
|
|
},
|
|
{
|
|
"epoch": 2.4571428571428573,
|
|
"ewc_loss": 0.00020503997802734375,
|
|
"grad_norm": 0.7938985228538513,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1077,
|
|
"mean_token_accuracy": 0.6861696839332581,
|
|
"num_tokens": 306588836.0,
|
|
"step": 516
|
|
},
|
|
{
|
|
"epoch": 2.461904761904762,
|
|
"ewc_loss": 0.00020503997802734375,
|
|
"grad_norm": 0.648752748966217,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1176,
|
|
"mean_token_accuracy": 0.6827884912490845,
|
|
"num_tokens": 307200955.0,
|
|
"step": 517
|
|
},
|
|
{
|
|
"epoch": 2.466666666666667,
|
|
"ewc_loss": 0.00020694732666015625,
|
|
"grad_norm": 0.6649419665336609,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1049,
|
|
"mean_token_accuracy": 0.6853247880935669,
|
|
"num_tokens": 307799028.0,
|
|
"step": 518
|
|
},
|
|
{
|
|
"epoch": 2.4714285714285715,
|
|
"ewc_loss": 0.00020694732666015625,
|
|
"grad_norm": 0.6978579163551331,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1347,
|
|
"mean_token_accuracy": 0.6787082552909851,
|
|
"num_tokens": 308389748.0,
|
|
"step": 519
|
|
},
|
|
{
|
|
"epoch": 2.4761904761904763,
|
|
"ewc_loss": 0.00020694732666015625,
|
|
"grad_norm": 0.7341722846031189,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1153,
|
|
"mean_token_accuracy": 0.6834184527397156,
|
|
"num_tokens": 308978715.0,
|
|
"step": 520
|
|
},
|
|
{
|
|
"epoch": 2.480952380952381,
|
|
"ewc_loss": 0.00020694732666015625,
|
|
"grad_norm": 0.6724810600280762,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1133,
|
|
"mean_token_accuracy": 0.6836721897125244,
|
|
"num_tokens": 309587298.0,
|
|
"step": 521
|
|
},
|
|
{
|
|
"epoch": 2.4857142857142858,
|
|
"ewc_loss": 0.0002079010009765625,
|
|
"grad_norm": 0.6303718686103821,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1025,
|
|
"mean_token_accuracy": 0.6861626505851746,
|
|
"num_tokens": 310173585.0,
|
|
"step": 522
|
|
},
|
|
{
|
|
"epoch": 2.4904761904761905,
|
|
"ewc_loss": 0.0002079010009765625,
|
|
"grad_norm": 0.7302219271659851,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1117,
|
|
"mean_token_accuracy": 0.6846023797988892,
|
|
"num_tokens": 310760313.0,
|
|
"step": 523
|
|
},
|
|
{
|
|
"epoch": 2.4952380952380953,
|
|
"ewc_loss": 0.00020885467529296875,
|
|
"grad_norm": 0.710053563117981,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1148,
|
|
"mean_token_accuracy": 0.6836196184158325,
|
|
"num_tokens": 311374002.0,
|
|
"step": 524
|
|
},
|
|
{
|
|
"epoch": 2.5,
|
|
"ewc_loss": 0.00020885467529296875,
|
|
"grad_norm": 0.6553205847740173,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1085,
|
|
"mean_token_accuracy": 0.6846480369567871,
|
|
"num_tokens": 311952533.0,
|
|
"step": 525
|
|
},
|
|
{
|
|
"epoch": 2.5047619047619047,
|
|
"ewc_loss": 0.00020885467529296875,
|
|
"grad_norm": 0.6610130667686462,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1039,
|
|
"mean_token_accuracy": 0.6859796047210693,
|
|
"num_tokens": 312542383.0,
|
|
"step": 526
|
|
},
|
|
{
|
|
"epoch": 2.5095238095238095,
|
|
"ewc_loss": 0.00020885467529296875,
|
|
"grad_norm": 0.7279931306838989,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1129,
|
|
"mean_token_accuracy": 0.6830027103424072,
|
|
"num_tokens": 313136427.0,
|
|
"step": 527
|
|
},
|
|
{
|
|
"epoch": 2.5142857142857142,
|
|
"ewc_loss": 0.00020885467529296875,
|
|
"grad_norm": 0.6426938772201538,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.0944,
|
|
"mean_token_accuracy": 0.6887927651405334,
|
|
"num_tokens": 313731115.0,
|
|
"step": 528
|
|
},
|
|
{
|
|
"epoch": 2.519047619047619,
|
|
"ewc_loss": 0.00020885467529296875,
|
|
"grad_norm": 0.625701367855072,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.103,
|
|
"mean_token_accuracy": 0.6861482262611389,
|
|
"num_tokens": 314316253.0,
|
|
"step": 529
|
|
},
|
|
{
|
|
"epoch": 2.5238095238095237,
|
|
"ewc_loss": 0.00020885467529296875,
|
|
"grad_norm": 0.6955346465110779,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1016,
|
|
"mean_token_accuracy": 0.6866956949234009,
|
|
"num_tokens": 314906539.0,
|
|
"step": 530
|
|
},
|
|
{
|
|
"epoch": 2.5285714285714285,
|
|
"ewc_loss": 0.000209808349609375,
|
|
"grad_norm": 0.663836658000946,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.0996,
|
|
"mean_token_accuracy": 0.6871933341026306,
|
|
"num_tokens": 315491005.0,
|
|
"step": 531
|
|
},
|
|
{
|
|
"epoch": 2.533333333333333,
|
|
"ewc_loss": 0.00021076202392578125,
|
|
"grad_norm": 0.7514081597328186,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1152,
|
|
"mean_token_accuracy": 0.6824758648872375,
|
|
"num_tokens": 316086156.0,
|
|
"step": 532
|
|
},
|
|
{
|
|
"epoch": 2.538095238095238,
|
|
"ewc_loss": 0.00021076202392578125,
|
|
"grad_norm": 0.7242370247840881,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1199,
|
|
"mean_token_accuracy": 0.6825606226921082,
|
|
"num_tokens": 316687284.0,
|
|
"step": 533
|
|
},
|
|
{
|
|
"epoch": 2.5428571428571427,
|
|
"ewc_loss": 0.00021076202392578125,
|
|
"grad_norm": 0.6684983372688293,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1038,
|
|
"mean_token_accuracy": 0.6866620182991028,
|
|
"num_tokens": 317280976.0,
|
|
"step": 534
|
|
},
|
|
{
|
|
"epoch": 2.5476190476190474,
|
|
"ewc_loss": 0.00021076202392578125,
|
|
"grad_norm": 0.7581773996353149,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.111,
|
|
"mean_token_accuracy": 0.6842821836471558,
|
|
"num_tokens": 317869704.0,
|
|
"step": 535
|
|
},
|
|
{
|
|
"epoch": 2.552380952380952,
|
|
"ewc_loss": 0.00021076202392578125,
|
|
"grad_norm": 0.6618966460227966,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1143,
|
|
"mean_token_accuracy": 0.6835497617721558,
|
|
"num_tokens": 318453830.0,
|
|
"step": 536
|
|
},
|
|
{
|
|
"epoch": 2.557142857142857,
|
|
"ewc_loss": 0.00021076202392578125,
|
|
"grad_norm": 0.7414590716362,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1208,
|
|
"mean_token_accuracy": 0.6816829442977905,
|
|
"num_tokens": 319036628.0,
|
|
"step": 537
|
|
},
|
|
{
|
|
"epoch": 2.5619047619047617,
|
|
"ewc_loss": 0.00021076202392578125,
|
|
"grad_norm": 0.7061823606491089,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1059,
|
|
"mean_token_accuracy": 0.6860649585723877,
|
|
"num_tokens": 319641680.0,
|
|
"step": 538
|
|
},
|
|
{
|
|
"epoch": 2.5666666666666664,
|
|
"ewc_loss": 0.00021266937255859375,
|
|
"grad_norm": 0.7170706987380981,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1125,
|
|
"mean_token_accuracy": 0.6838537454605103,
|
|
"num_tokens": 320235018.0,
|
|
"step": 539
|
|
},
|
|
{
|
|
"epoch": 2.571428571428571,
|
|
"ewc_loss": 0.00021266937255859375,
|
|
"grad_norm": 0.7144879698753357,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1174,
|
|
"mean_token_accuracy": 0.6828057765960693,
|
|
"num_tokens": 320839523.0,
|
|
"step": 540
|
|
},
|
|
{
|
|
"epoch": 2.576190476190476,
|
|
"ewc_loss": 0.00021266937255859375,
|
|
"grad_norm": 0.7096484899520874,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1084,
|
|
"mean_token_accuracy": 0.6844845414161682,
|
|
"num_tokens": 321445469.0,
|
|
"step": 541
|
|
},
|
|
{
|
|
"epoch": 2.580952380952381,
|
|
"ewc_loss": 0.00021266937255859375,
|
|
"grad_norm": 0.6505020260810852,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1158,
|
|
"mean_token_accuracy": 0.68201744556427,
|
|
"num_tokens": 322040382.0,
|
|
"step": 542
|
|
},
|
|
{
|
|
"epoch": 2.585714285714286,
|
|
"ewc_loss": 0.00021266937255859375,
|
|
"grad_norm": 0.8393046259880066,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1133,
|
|
"mean_token_accuracy": 0.6839233636856079,
|
|
"num_tokens": 322631980.0,
|
|
"step": 543
|
|
},
|
|
{
|
|
"epoch": 2.5904761904761906,
|
|
"ewc_loss": 0.000213623046875,
|
|
"grad_norm": 0.623708188533783,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1111,
|
|
"mean_token_accuracy": 0.6834137439727783,
|
|
"num_tokens": 323217003.0,
|
|
"step": 544
|
|
},
|
|
{
|
|
"epoch": 2.5952380952380953,
|
|
"ewc_loss": 0.000213623046875,
|
|
"grad_norm": 0.87456876039505,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1151,
|
|
"mean_token_accuracy": 0.6831760406494141,
|
|
"num_tokens": 323797882.0,
|
|
"step": 545
|
|
},
|
|
{
|
|
"epoch": 2.6,
|
|
"ewc_loss": 0.000213623046875,
|
|
"grad_norm": 0.7982794642448425,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1188,
|
|
"mean_token_accuracy": 0.6817816495895386,
|
|
"num_tokens": 324381508.0,
|
|
"step": 546
|
|
},
|
|
{
|
|
"epoch": 2.604761904761905,
|
|
"ewc_loss": 0.000213623046875,
|
|
"grad_norm": 0.7673431634902954,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1351,
|
|
"mean_token_accuracy": 0.6783336997032166,
|
|
"num_tokens": 324979976.0,
|
|
"step": 547
|
|
},
|
|
{
|
|
"epoch": 2.6095238095238096,
|
|
"ewc_loss": 0.00021457672119140625,
|
|
"grad_norm": 0.8845553398132324,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1078,
|
|
"mean_token_accuracy": 0.6847482919692993,
|
|
"num_tokens": 325579147.0,
|
|
"step": 548
|
|
},
|
|
{
|
|
"epoch": 2.6142857142857143,
|
|
"ewc_loss": 0.00021457672119140625,
|
|
"grad_norm": 0.660223126411438,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.11,
|
|
"mean_token_accuracy": 0.6850311756134033,
|
|
"num_tokens": 326189724.0,
|
|
"step": 549
|
|
},
|
|
{
|
|
"epoch": 2.619047619047619,
|
|
"ewc_loss": 0.00021457672119140625,
|
|
"grad_norm": 0.8426000475883484,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1125,
|
|
"mean_token_accuracy": 0.6835983991622925,
|
|
"num_tokens": 326781040.0,
|
|
"step": 550
|
|
},
|
|
{
|
|
"epoch": 2.623809523809524,
|
|
"ewc_loss": 0.0002155303955078125,
|
|
"grad_norm": 0.6381561756134033,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1057,
|
|
"mean_token_accuracy": 0.6863323450088501,
|
|
"num_tokens": 327384993.0,
|
|
"step": 551
|
|
},
|
|
{
|
|
"epoch": 2.6285714285714286,
|
|
"ewc_loss": 0.0002155303955078125,
|
|
"grad_norm": 0.8242178559303284,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.0945,
|
|
"mean_token_accuracy": 0.6886809468269348,
|
|
"num_tokens": 327967527.0,
|
|
"step": 552
|
|
},
|
|
{
|
|
"epoch": 2.6333333333333333,
|
|
"ewc_loss": 0.0002155303955078125,
|
|
"grad_norm": 0.6355842351913452,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1,
|
|
"mean_token_accuracy": 0.687286913394928,
|
|
"num_tokens": 328556111.0,
|
|
"step": 553
|
|
},
|
|
{
|
|
"epoch": 2.638095238095238,
|
|
"ewc_loss": 0.0002155303955078125,
|
|
"grad_norm": 0.7315848469734192,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.107,
|
|
"mean_token_accuracy": 0.6851072907447815,
|
|
"num_tokens": 329156419.0,
|
|
"step": 554
|
|
},
|
|
{
|
|
"epoch": 2.642857142857143,
|
|
"ewc_loss": 0.0002155303955078125,
|
|
"grad_norm": 0.6461286544799805,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1308,
|
|
"mean_token_accuracy": 0.6795304417610168,
|
|
"num_tokens": 329765795.0,
|
|
"step": 555
|
|
},
|
|
{
|
|
"epoch": 2.6476190476190475,
|
|
"ewc_loss": 0.0002155303955078125,
|
|
"grad_norm": 0.6108519434928894,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1112,
|
|
"mean_token_accuracy": 0.6852349638938904,
|
|
"num_tokens": 330366805.0,
|
|
"step": 556
|
|
},
|
|
{
|
|
"epoch": 2.6523809523809523,
|
|
"ewc_loss": 0.00021648406982421875,
|
|
"grad_norm": 0.7075115442276001,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.0998,
|
|
"mean_token_accuracy": 0.6861579418182373,
|
|
"num_tokens": 330960683.0,
|
|
"step": 557
|
|
},
|
|
{
|
|
"epoch": 2.657142857142857,
|
|
"ewc_loss": 0.000217437744140625,
|
|
"grad_norm": 0.6507118344306946,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1165,
|
|
"mean_token_accuracy": 0.6833897829055786,
|
|
"num_tokens": 331566617.0,
|
|
"step": 558
|
|
},
|
|
{
|
|
"epoch": 2.6619047619047618,
|
|
"ewc_loss": 0.00021839141845703125,
|
|
"grad_norm": 0.8607151508331299,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1011,
|
|
"mean_token_accuracy": 0.6869219541549683,
|
|
"num_tokens": 332146780.0,
|
|
"step": 559
|
|
},
|
|
{
|
|
"epoch": 2.6666666666666665,
|
|
"ewc_loss": 0.00021839141845703125,
|
|
"grad_norm": 0.6742492318153381,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1131,
|
|
"mean_token_accuracy": 0.684894323348999,
|
|
"num_tokens": 332744565.0,
|
|
"step": 560
|
|
},
|
|
{
|
|
"epoch": 2.6714285714285713,
|
|
"ewc_loss": 0.00021839141845703125,
|
|
"grad_norm": 0.6987491250038147,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1122,
|
|
"mean_token_accuracy": 0.6841902732849121,
|
|
"num_tokens": 333327246.0,
|
|
"step": 561
|
|
},
|
|
{
|
|
"epoch": 2.6761904761904765,
|
|
"ewc_loss": 0.00021839141845703125,
|
|
"grad_norm": 0.6320102214813232,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1004,
|
|
"mean_token_accuracy": 0.6867818236351013,
|
|
"num_tokens": 333924279.0,
|
|
"step": 562
|
|
},
|
|
{
|
|
"epoch": 2.680952380952381,
|
|
"ewc_loss": 0.00021839141845703125,
|
|
"grad_norm": 0.6835185885429382,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1026,
|
|
"mean_token_accuracy": 0.6858536601066589,
|
|
"num_tokens": 334526451.0,
|
|
"step": 563
|
|
},
|
|
{
|
|
"epoch": 2.685714285714286,
|
|
"ewc_loss": 0.00021839141845703125,
|
|
"grad_norm": 0.60417640209198,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1125,
|
|
"mean_token_accuracy": 0.68436598777771,
|
|
"num_tokens": 335121296.0,
|
|
"step": 564
|
|
},
|
|
{
|
|
"epoch": 2.6904761904761907,
|
|
"ewc_loss": 0.00021839141845703125,
|
|
"grad_norm": 0.6850106120109558,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1092,
|
|
"mean_token_accuracy": 0.6838469505310059,
|
|
"num_tokens": 335705229.0,
|
|
"step": 565
|
|
},
|
|
{
|
|
"epoch": 2.6952380952380954,
|
|
"ewc_loss": 0.00021839141845703125,
|
|
"grad_norm": 0.723806619644165,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.115,
|
|
"mean_token_accuracy": 0.6833413243293762,
|
|
"num_tokens": 336296515.0,
|
|
"step": 566
|
|
},
|
|
{
|
|
"epoch": 2.7,
|
|
"ewc_loss": 0.00022029876708984375,
|
|
"grad_norm": 0.6229386925697327,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1173,
|
|
"mean_token_accuracy": 0.6832458972930908,
|
|
"num_tokens": 336898581.0,
|
|
"step": 567
|
|
},
|
|
{
|
|
"epoch": 2.704761904761905,
|
|
"ewc_loss": 0.00022029876708984375,
|
|
"grad_norm": 0.715894877910614,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1256,
|
|
"mean_token_accuracy": 0.6815091967582703,
|
|
"num_tokens": 337492720.0,
|
|
"step": 568
|
|
},
|
|
{
|
|
"epoch": 2.7095238095238097,
|
|
"ewc_loss": 0.00022029876708984375,
|
|
"grad_norm": 0.6906357407569885,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1092,
|
|
"mean_token_accuracy": 0.6849738955497742,
|
|
"num_tokens": 338088080.0,
|
|
"step": 569
|
|
},
|
|
{
|
|
"epoch": 2.7142857142857144,
|
|
"ewc_loss": 0.00022029876708984375,
|
|
"grad_norm": 0.6391976475715637,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1083,
|
|
"mean_token_accuracy": 0.6855521202087402,
|
|
"num_tokens": 338682863.0,
|
|
"step": 570
|
|
},
|
|
{
|
|
"epoch": 2.719047619047619,
|
|
"ewc_loss": 0.00022029876708984375,
|
|
"grad_norm": 0.7486193776130676,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1146,
|
|
"mean_token_accuracy": 0.68489670753479,
|
|
"num_tokens": 339274595.0,
|
|
"step": 571
|
|
},
|
|
{
|
|
"epoch": 2.723809523809524,
|
|
"ewc_loss": 0.00022029876708984375,
|
|
"grad_norm": 0.6699538826942444,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1141,
|
|
"mean_token_accuracy": 0.6836042404174805,
|
|
"num_tokens": 339857633.0,
|
|
"step": 572
|
|
},
|
|
{
|
|
"epoch": 2.7285714285714286,
|
|
"ewc_loss": 0.00022029876708984375,
|
|
"grad_norm": 0.7588949203491211,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.0971,
|
|
"mean_token_accuracy": 0.6879390478134155,
|
|
"num_tokens": 340451043.0,
|
|
"step": 573
|
|
},
|
|
{
|
|
"epoch": 2.7333333333333334,
|
|
"ewc_loss": 0.00022220611572265625,
|
|
"grad_norm": 0.6815699934959412,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1217,
|
|
"mean_token_accuracy": 0.6824461221694946,
|
|
"num_tokens": 341042238.0,
|
|
"step": 574
|
|
},
|
|
{
|
|
"epoch": 2.738095238095238,
|
|
"ewc_loss": 0.00022220611572265625,
|
|
"grad_norm": 0.663918137550354,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1173,
|
|
"mean_token_accuracy": 0.6830961108207703,
|
|
"num_tokens": 341644006.0,
|
|
"step": 575
|
|
},
|
|
{
|
|
"epoch": 2.742857142857143,
|
|
"ewc_loss": 0.00022220611572265625,
|
|
"grad_norm": 0.6775252223014832,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1078,
|
|
"mean_token_accuracy": 0.6845916509628296,
|
|
"num_tokens": 342238235.0,
|
|
"step": 576
|
|
},
|
|
{
|
|
"epoch": 2.7476190476190476,
|
|
"ewc_loss": 0.00022220611572265625,
|
|
"grad_norm": 0.6106754541397095,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.102,
|
|
"mean_token_accuracy": 0.6870168447494507,
|
|
"num_tokens": 342831260.0,
|
|
"step": 577
|
|
},
|
|
{
|
|
"epoch": 2.7523809523809524,
|
|
"ewc_loss": 0.00022220611572265625,
|
|
"grad_norm": 0.707916259765625,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1178,
|
|
"mean_token_accuracy": 0.6832857131958008,
|
|
"num_tokens": 343427629.0,
|
|
"step": 578
|
|
},
|
|
{
|
|
"epoch": 2.757142857142857,
|
|
"ewc_loss": 0.00022220611572265625,
|
|
"grad_norm": 0.6845868825912476,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1174,
|
|
"mean_token_accuracy": 0.6835477352142334,
|
|
"num_tokens": 344021401.0,
|
|
"step": 579
|
|
},
|
|
{
|
|
"epoch": 2.761904761904762,
|
|
"ewc_loss": 0.0002231597900390625,
|
|
"grad_norm": 0.6356106400489807,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.103,
|
|
"mean_token_accuracy": 0.6876583695411682,
|
|
"num_tokens": 344610108.0,
|
|
"step": 580
|
|
},
|
|
{
|
|
"epoch": 2.7666666666666666,
|
|
"ewc_loss": 0.0002231597900390625,
|
|
"grad_norm": 0.7542384266853333,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1143,
|
|
"mean_token_accuracy": 0.683364748954773,
|
|
"num_tokens": 345217241.0,
|
|
"step": 581
|
|
},
|
|
{
|
|
"epoch": 2.7714285714285714,
|
|
"ewc_loss": 0.00022411346435546875,
|
|
"grad_norm": 0.7081701755523682,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1074,
|
|
"mean_token_accuracy": 0.684797465801239,
|
|
"num_tokens": 345804258.0,
|
|
"step": 582
|
|
},
|
|
{
|
|
"epoch": 2.776190476190476,
|
|
"ewc_loss": 0.00022411346435546875,
|
|
"grad_norm": 0.6731457710266113,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1108,
|
|
"mean_token_accuracy": 0.68459153175354,
|
|
"num_tokens": 346399481.0,
|
|
"step": 583
|
|
},
|
|
{
|
|
"epoch": 2.780952380952381,
|
|
"ewc_loss": 0.00022411346435546875,
|
|
"grad_norm": 0.7707868218421936,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.0976,
|
|
"mean_token_accuracy": 0.6873040199279785,
|
|
"num_tokens": 346997922.0,
|
|
"step": 584
|
|
},
|
|
{
|
|
"epoch": 2.7857142857142856,
|
|
"ewc_loss": 0.00022411346435546875,
|
|
"grad_norm": 0.6361204385757446,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1118,
|
|
"mean_token_accuracy": 0.6845356822013855,
|
|
"num_tokens": 347597863.0,
|
|
"step": 585
|
|
},
|
|
{
|
|
"epoch": 2.7904761904761903,
|
|
"ewc_loss": 0.000225067138671875,
|
|
"grad_norm": 0.6881011128425598,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1054,
|
|
"mean_token_accuracy": 0.684701681137085,
|
|
"num_tokens": 348201046.0,
|
|
"step": 586
|
|
},
|
|
{
|
|
"epoch": 2.795238095238095,
|
|
"ewc_loss": 0.00022602081298828125,
|
|
"grad_norm": 0.6699244976043701,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1008,
|
|
"mean_token_accuracy": 0.6863293647766113,
|
|
"num_tokens": 348787326.0,
|
|
"step": 587
|
|
},
|
|
{
|
|
"epoch": 2.8,
|
|
"ewc_loss": 0.00022602081298828125,
|
|
"grad_norm": 0.636400043964386,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1108,
|
|
"mean_token_accuracy": 0.6842807531356812,
|
|
"num_tokens": 349380645.0,
|
|
"step": 588
|
|
},
|
|
{
|
|
"epoch": 2.8047619047619046,
|
|
"ewc_loss": 0.00022602081298828125,
|
|
"grad_norm": 0.6741878986358643,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1074,
|
|
"mean_token_accuracy": 0.6858760118484497,
|
|
"num_tokens": 349983092.0,
|
|
"step": 589
|
|
},
|
|
{
|
|
"epoch": 2.8095238095238093,
|
|
"ewc_loss": 0.00022602081298828125,
|
|
"grad_norm": 0.65139240026474,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1032,
|
|
"mean_token_accuracy": 0.6862769722938538,
|
|
"num_tokens": 350576836.0,
|
|
"step": 590
|
|
},
|
|
{
|
|
"epoch": 2.814285714285714,
|
|
"ewc_loss": 0.00022602081298828125,
|
|
"grad_norm": 0.7277578711509705,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1043,
|
|
"mean_token_accuracy": 0.6871824264526367,
|
|
"num_tokens": 351172725.0,
|
|
"step": 591
|
|
},
|
|
{
|
|
"epoch": 2.819047619047619,
|
|
"ewc_loss": 0.0002269744873046875,
|
|
"grad_norm": 0.6758738160133362,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.0985,
|
|
"mean_token_accuracy": 0.6877420544624329,
|
|
"num_tokens": 351777142.0,
|
|
"step": 592
|
|
},
|
|
{
|
|
"epoch": 2.8238095238095235,
|
|
"ewc_loss": 0.0002269744873046875,
|
|
"grad_norm": 0.794834554195404,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1001,
|
|
"mean_token_accuracy": 0.6864523887634277,
|
|
"num_tokens": 352361834.0,
|
|
"step": 593
|
|
},
|
|
{
|
|
"epoch": 2.8285714285714287,
|
|
"ewc_loss": 0.0002269744873046875,
|
|
"grad_norm": 0.7067591547966003,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1079,
|
|
"mean_token_accuracy": 0.6851682662963867,
|
|
"num_tokens": 352964892.0,
|
|
"step": 594
|
|
},
|
|
{
|
|
"epoch": 2.8333333333333335,
|
|
"ewc_loss": 0.0002269744873046875,
|
|
"grad_norm": 0.7583296298980713,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1078,
|
|
"mean_token_accuracy": 0.6843398213386536,
|
|
"num_tokens": 353563696.0,
|
|
"step": 595
|
|
},
|
|
{
|
|
"epoch": 2.8380952380952382,
|
|
"ewc_loss": 0.0002269744873046875,
|
|
"grad_norm": 0.64853435754776,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1083,
|
|
"mean_token_accuracy": 0.6853509545326233,
|
|
"num_tokens": 354162323.0,
|
|
"step": 596
|
|
},
|
|
{
|
|
"epoch": 2.842857142857143,
|
|
"ewc_loss": 0.00022792816162109375,
|
|
"grad_norm": 0.6776200532913208,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1397,
|
|
"mean_token_accuracy": 0.6776244640350342,
|
|
"num_tokens": 354763224.0,
|
|
"step": 597
|
|
},
|
|
{
|
|
"epoch": 2.8476190476190477,
|
|
"ewc_loss": 0.0002288818359375,
|
|
"grad_norm": 0.6631531119346619,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1024,
|
|
"mean_token_accuracy": 0.6863612532615662,
|
|
"num_tokens": 355360011.0,
|
|
"step": 598
|
|
},
|
|
{
|
|
"epoch": 2.8523809523809525,
|
|
"ewc_loss": 0.0002288818359375,
|
|
"grad_norm": 0.6523927450180054,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1087,
|
|
"mean_token_accuracy": 0.6851531267166138,
|
|
"num_tokens": 355948770.0,
|
|
"step": 599
|
|
},
|
|
{
|
|
"epoch": 2.857142857142857,
|
|
"ewc_loss": 0.0002288818359375,
|
|
"grad_norm": 0.646990954875946,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1175,
|
|
"mean_token_accuracy": 0.6825306415557861,
|
|
"num_tokens": 356555915.0,
|
|
"step": 600
|
|
},
|
|
{
|
|
"epoch": 2.861904761904762,
|
|
"ewc_loss": 0.0002288818359375,
|
|
"grad_norm": 0.695576012134552,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.119,
|
|
"mean_token_accuracy": 0.6823387145996094,
|
|
"num_tokens": 357168089.0,
|
|
"step": 601
|
|
},
|
|
{
|
|
"epoch": 2.8666666666666667,
|
|
"ewc_loss": 0.0002288818359375,
|
|
"grad_norm": 0.612006664276123,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1014,
|
|
"mean_token_accuracy": 0.6865124702453613,
|
|
"num_tokens": 357762209.0,
|
|
"step": 602
|
|
},
|
|
{
|
|
"epoch": 2.8714285714285714,
|
|
"ewc_loss": 0.0002288818359375,
|
|
"grad_norm": 0.6302762627601624,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1082,
|
|
"mean_token_accuracy": 0.6857041716575623,
|
|
"num_tokens": 358365632.0,
|
|
"step": 603
|
|
},
|
|
{
|
|
"epoch": 2.876190476190476,
|
|
"ewc_loss": 0.0002288818359375,
|
|
"grad_norm": 0.6100698709487915,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.122,
|
|
"mean_token_accuracy": 0.682310938835144,
|
|
"num_tokens": 358969038.0,
|
|
"step": 604
|
|
},
|
|
{
|
|
"epoch": 2.880952380952381,
|
|
"ewc_loss": 0.0002288818359375,
|
|
"grad_norm": 0.5956453680992126,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1041,
|
|
"mean_token_accuracy": 0.6870143413543701,
|
|
"num_tokens": 359560638.0,
|
|
"step": 605
|
|
},
|
|
{
|
|
"epoch": 2.8857142857142857,
|
|
"ewc_loss": 0.00022983551025390625,
|
|
"grad_norm": 0.5993679165840149,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1153,
|
|
"mean_token_accuracy": 0.6832740306854248,
|
|
"num_tokens": 360159047.0,
|
|
"step": 606
|
|
},
|
|
{
|
|
"epoch": 2.8904761904761904,
|
|
"ewc_loss": 0.00022983551025390625,
|
|
"grad_norm": 0.6230036616325378,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1125,
|
|
"mean_token_accuracy": 0.685468852519989,
|
|
"num_tokens": 360752550.0,
|
|
"step": 607
|
|
},
|
|
{
|
|
"epoch": 2.895238095238095,
|
|
"ewc_loss": 0.00022983551025390625,
|
|
"grad_norm": 0.6339925527572632,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.114,
|
|
"mean_token_accuracy": 0.6835158467292786,
|
|
"num_tokens": 361348966.0,
|
|
"step": 608
|
|
},
|
|
{
|
|
"epoch": 2.9,
|
|
"ewc_loss": 0.00022983551025390625,
|
|
"grad_norm": 0.6449430584907532,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1057,
|
|
"mean_token_accuracy": 0.6863585710525513,
|
|
"num_tokens": 361933541.0,
|
|
"step": 609
|
|
},
|
|
{
|
|
"epoch": 2.9047619047619047,
|
|
"ewc_loss": 0.00023174285888671875,
|
|
"grad_norm": 0.6269838809967041,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1113,
|
|
"mean_token_accuracy": 0.685248613357544,
|
|
"num_tokens": 362522689.0,
|
|
"step": 610
|
|
},
|
|
{
|
|
"epoch": 2.9095238095238094,
|
|
"ewc_loss": 0.00023174285888671875,
|
|
"grad_norm": 0.7126158475875854,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.0915,
|
|
"mean_token_accuracy": 0.6893975734710693,
|
|
"num_tokens": 363107779.0,
|
|
"step": 611
|
|
},
|
|
{
|
|
"epoch": 2.914285714285714,
|
|
"ewc_loss": 0.00023365020751953125,
|
|
"grad_norm": 0.6790075898170471,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1058,
|
|
"mean_token_accuracy": 0.685950517654419,
|
|
"num_tokens": 363690809.0,
|
|
"step": 612
|
|
},
|
|
{
|
|
"epoch": 2.919047619047619,
|
|
"ewc_loss": 0.00023365020751953125,
|
|
"grad_norm": 0.6466474533081055,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1066,
|
|
"mean_token_accuracy": 0.6854456663131714,
|
|
"num_tokens": 364279923.0,
|
|
"step": 613
|
|
},
|
|
{
|
|
"epoch": 2.923809523809524,
|
|
"ewc_loss": 0.00023365020751953125,
|
|
"grad_norm": 0.7430855631828308,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.0978,
|
|
"mean_token_accuracy": 0.6879355907440186,
|
|
"num_tokens": 364846929.0,
|
|
"step": 614
|
|
},
|
|
{
|
|
"epoch": 2.928571428571429,
|
|
"ewc_loss": 0.0002346038818359375,
|
|
"grad_norm": 0.7013673186302185,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1237,
|
|
"mean_token_accuracy": 0.6824753284454346,
|
|
"num_tokens": 365427755.0,
|
|
"step": 615
|
|
},
|
|
{
|
|
"epoch": 2.9333333333333336,
|
|
"ewc_loss": 0.0002346038818359375,
|
|
"grad_norm": 0.6881713271141052,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1054,
|
|
"mean_token_accuracy": 0.6859650611877441,
|
|
"num_tokens": 366022879.0,
|
|
"step": 616
|
|
},
|
|
{
|
|
"epoch": 2.9380952380952383,
|
|
"ewc_loss": 0.0002346038818359375,
|
|
"grad_norm": 0.6655181646347046,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.108,
|
|
"mean_token_accuracy": 0.6847751140594482,
|
|
"num_tokens": 366608198.0,
|
|
"step": 617
|
|
},
|
|
{
|
|
"epoch": 2.942857142857143,
|
|
"ewc_loss": 0.0002346038818359375,
|
|
"grad_norm": 0.6306271553039551,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1131,
|
|
"mean_token_accuracy": 0.6835205554962158,
|
|
"num_tokens": 367187170.0,
|
|
"step": 618
|
|
},
|
|
{
|
|
"epoch": 2.947619047619048,
|
|
"ewc_loss": 0.0002346038818359375,
|
|
"grad_norm": 0.7302725911140442,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.106,
|
|
"mean_token_accuracy": 0.685217022895813,
|
|
"num_tokens": 367778542.0,
|
|
"step": 619
|
|
},
|
|
{
|
|
"epoch": 2.9523809523809526,
|
|
"ewc_loss": 0.0002346038818359375,
|
|
"grad_norm": 0.6532019972801208,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1124,
|
|
"mean_token_accuracy": 0.683358907699585,
|
|
"num_tokens": 368374361.0,
|
|
"step": 620
|
|
},
|
|
{
|
|
"epoch": 2.9571428571428573,
|
|
"ewc_loss": 0.0002346038818359375,
|
|
"grad_norm": 0.7335264086723328,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1134,
|
|
"mean_token_accuracy": 0.6842710971832275,
|
|
"num_tokens": 368975961.0,
|
|
"step": 621
|
|
},
|
|
{
|
|
"epoch": 2.961904761904762,
|
|
"ewc_loss": 0.00023555755615234375,
|
|
"grad_norm": 0.6442291140556335,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.0888,
|
|
"mean_token_accuracy": 0.6909395456314087,
|
|
"num_tokens": 369565801.0,
|
|
"step": 622
|
|
},
|
|
{
|
|
"epoch": 2.966666666666667,
|
|
"ewc_loss": 0.00023555755615234375,
|
|
"grad_norm": 0.740608274936676,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1132,
|
|
"mean_token_accuracy": 0.6837995648384094,
|
|
"num_tokens": 370147963.0,
|
|
"step": 623
|
|
},
|
|
{
|
|
"epoch": 2.9714285714285715,
|
|
"ewc_loss": 0.00023555755615234375,
|
|
"grad_norm": 0.7111974954605103,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1107,
|
|
"mean_token_accuracy": 0.6844362020492554,
|
|
"num_tokens": 370730337.0,
|
|
"step": 624
|
|
},
|
|
{
|
|
"epoch": 2.9761904761904763,
|
|
"ewc_loss": 0.00023555755615234375,
|
|
"grad_norm": 0.6376264095306396,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1037,
|
|
"mean_token_accuracy": 0.685913622379303,
|
|
"num_tokens": 371313464.0,
|
|
"step": 625
|
|
},
|
|
{
|
|
"epoch": 2.980952380952381,
|
|
"ewc_loss": 0.00023555755615234375,
|
|
"grad_norm": 0.6480923295021057,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1075,
|
|
"mean_token_accuracy": 0.6858855485916138,
|
|
"num_tokens": 371903211.0,
|
|
"step": 626
|
|
},
|
|
{
|
|
"epoch": 2.9857142857142858,
|
|
"ewc_loss": 0.00023555755615234375,
|
|
"grad_norm": 0.6818118691444397,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.0975,
|
|
"mean_token_accuracy": 0.6893028020858765,
|
|
"num_tokens": 372496314.0,
|
|
"step": 627
|
|
},
|
|
{
|
|
"epoch": 2.9904761904761905,
|
|
"ewc_loss": 0.00023651123046875,
|
|
"grad_norm": 0.6706833243370056,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1117,
|
|
"mean_token_accuracy": 0.6845011115074158,
|
|
"num_tokens": 373096610.0,
|
|
"step": 628
|
|
},
|
|
{
|
|
"epoch": 2.9952380952380953,
|
|
"ewc_loss": 0.00023651123046875,
|
|
"grad_norm": 0.6929971575737,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1141,
|
|
"mean_token_accuracy": 0.6832406520843506,
|
|
"num_tokens": 373694165.0,
|
|
"step": 629
|
|
},
|
|
{
|
|
"epoch": 3.0,
|
|
"ewc_loss": 0.00023651123046875,
|
|
"grad_norm": 0.6248409152030945,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.1025,
|
|
"mean_token_accuracy": 0.6880366802215576,
|
|
"num_tokens": 374283247.0,
|
|
"step": 630
|
|
},
|
|
{
|
|
"epoch": 3.0,
|
|
"ewc_loss": 0.00023651123046875,
|
|
"step": 630,
|
|
"total_flos": 2.1853937174671524e+18,
|
|
"train_loss": 1.1837469214484806,
|
|
"train_runtime": 1999.4206,
|
|
"train_samples_per_second": 161.322,
|
|
"train_steps_per_second": 0.315
|
|
}
|
|
],
|
|
"logging_steps": 1,
|
|
"max_steps": 630,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 3,
|
|
"save_steps": 315,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": true
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 2.1853937174671524e+18,
|
|
"train_batch_size": 128,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|