4035 lines
114 KiB
JSON
4035 lines
114 KiB
JSON
|
|
{
|
||
|
|
"best_global_step": null,
|
||
|
|
"best_metric": null,
|
||
|
|
"best_model_checkpoint": null,
|
||
|
|
"epoch": 2.1621621621621623,
|
||
|
|
"eval_steps": 500,
|
||
|
|
"global_step": 2000,
|
||
|
|
"is_hyper_param_search": false,
|
||
|
|
"is_local_process_zero": true,
|
||
|
|
"is_world_process_zero": true,
|
||
|
|
"log_history": [
|
||
|
|
{
|
||
|
|
"entropy": 9.657138442993164,
|
||
|
|
"epoch": 0.005405405405405406,
|
||
|
|
"grad_norm": 4.90625,
|
||
|
|
"learning_rate": 8e-06,
|
||
|
|
"loss": 12.520880889892577,
|
||
|
|
"mean_token_accuracy": 0.002236185665242374,
|
||
|
|
"num_tokens": 11236.0,
|
||
|
|
"step": 5
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 9.649214553833009,
|
||
|
|
"epoch": 0.010810810810810811,
|
||
|
|
"grad_norm": 4.5,
|
||
|
|
"learning_rate": 1.8e-05,
|
||
|
|
"loss": 12.531226348876952,
|
||
|
|
"mean_token_accuracy": 0.002215801365673542,
|
||
|
|
"num_tokens": 22482.0,
|
||
|
|
"step": 10
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 9.733113479614257,
|
||
|
|
"epoch": 0.016216216216216217,
|
||
|
|
"grad_norm": 5.03125,
|
||
|
|
"learning_rate": 2.8e-05,
|
||
|
|
"loss": 12.409437561035157,
|
||
|
|
"mean_token_accuracy": 0.002145940694026649,
|
||
|
|
"num_tokens": 35515.0,
|
||
|
|
"step": 15
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 9.83765811920166,
|
||
|
|
"epoch": 0.021621621621621623,
|
||
|
|
"grad_norm": 4.46875,
|
||
|
|
"learning_rate": 3.8e-05,
|
||
|
|
"loss": 12.153470611572265,
|
||
|
|
"mean_token_accuracy": 0.006360871193464845,
|
||
|
|
"num_tokens": 46983.0,
|
||
|
|
"step": 20
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 9.924044799804687,
|
||
|
|
"epoch": 0.02702702702702703,
|
||
|
|
"grad_norm": 3.25,
|
||
|
|
"learning_rate": 4.8e-05,
|
||
|
|
"loss": 11.767626953125,
|
||
|
|
"mean_token_accuracy": 0.010928381700068712,
|
||
|
|
"num_tokens": 60568.0,
|
||
|
|
"step": 25
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.140900039672852,
|
||
|
|
"epoch": 0.032432432432432434,
|
||
|
|
"grad_norm": 2.90625,
|
||
|
|
"learning_rate": 5.800000000000001e-05,
|
||
|
|
"loss": 11.328617095947266,
|
||
|
|
"mean_token_accuracy": 0.01978628318756819,
|
||
|
|
"num_tokens": 70721.0,
|
||
|
|
"step": 30
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.317844772338868,
|
||
|
|
"epoch": 0.03783783783783784,
|
||
|
|
"grad_norm": 2.1875,
|
||
|
|
"learning_rate": 6.800000000000001e-05,
|
||
|
|
"loss": 11.004520416259766,
|
||
|
|
"mean_token_accuracy": 0.027996162697672845,
|
||
|
|
"num_tokens": 85970.0,
|
||
|
|
"step": 35
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.511189270019532,
|
||
|
|
"epoch": 0.043243243243243246,
|
||
|
|
"grad_norm": 2.0,
|
||
|
|
"learning_rate": 7.8e-05,
|
||
|
|
"loss": 10.693595886230469,
|
||
|
|
"mean_token_accuracy": 0.03253013007342816,
|
||
|
|
"num_tokens": 97950.0,
|
||
|
|
"step": 40
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.562995338439942,
|
||
|
|
"epoch": 0.04864864864864865,
|
||
|
|
"grad_norm": 1.84375,
|
||
|
|
"learning_rate": 8.8e-05,
|
||
|
|
"loss": 10.466288757324218,
|
||
|
|
"mean_token_accuracy": 0.03578495755791664,
|
||
|
|
"num_tokens": 112032.0,
|
||
|
|
"step": 45
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.56525535583496,
|
||
|
|
"epoch": 0.05405405405405406,
|
||
|
|
"grad_norm": 2.046875,
|
||
|
|
"learning_rate": 9.800000000000001e-05,
|
||
|
|
"loss": 10.196940612792968,
|
||
|
|
"mean_token_accuracy": 0.03835028558969498,
|
||
|
|
"num_tokens": 126780.0,
|
||
|
|
"step": 50
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.538235855102538,
|
||
|
|
"epoch": 0.05945945945945946,
|
||
|
|
"grad_norm": 1.8515625,
|
||
|
|
"learning_rate": 0.000108,
|
||
|
|
"loss": 9.862722778320313,
|
||
|
|
"mean_token_accuracy": 0.03907337710261345,
|
||
|
|
"num_tokens": 138322.0,
|
||
|
|
"step": 55
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.436158370971679,
|
||
|
|
"epoch": 0.06486486486486487,
|
||
|
|
"grad_norm": 1.9765625,
|
||
|
|
"learning_rate": 0.000118,
|
||
|
|
"loss": 9.546548461914062,
|
||
|
|
"mean_token_accuracy": 0.03616050221025944,
|
||
|
|
"num_tokens": 152679.0,
|
||
|
|
"step": 60
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.354158973693847,
|
||
|
|
"epoch": 0.07027027027027027,
|
||
|
|
"grad_norm": 1.7421875,
|
||
|
|
"learning_rate": 0.000128,
|
||
|
|
"loss": 9.224214172363281,
|
||
|
|
"mean_token_accuracy": 0.038402664661407473,
|
||
|
|
"num_tokens": 162848.0,
|
||
|
|
"step": 65
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.261932945251464,
|
||
|
|
"epoch": 0.07567567567567568,
|
||
|
|
"grad_norm": 1.6640625,
|
||
|
|
"learning_rate": 0.00013800000000000002,
|
||
|
|
"loss": 9.017792510986329,
|
||
|
|
"mean_token_accuracy": 0.037848640233278275,
|
||
|
|
"num_tokens": 178170.0,
|
||
|
|
"step": 70
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.09331226348877,
|
||
|
|
"epoch": 0.08108108108108109,
|
||
|
|
"grad_norm": 1.671875,
|
||
|
|
"learning_rate": 0.000148,
|
||
|
|
"loss": 8.539015197753907,
|
||
|
|
"mean_token_accuracy": 0.03686205819249153,
|
||
|
|
"num_tokens": 189845.0,
|
||
|
|
"step": 75
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 9.829462432861328,
|
||
|
|
"epoch": 0.08648648648648649,
|
||
|
|
"grad_norm": 1.4765625,
|
||
|
|
"learning_rate": 0.000158,
|
||
|
|
"loss": 8.27553939819336,
|
||
|
|
"mean_token_accuracy": 0.03745934441685676,
|
||
|
|
"num_tokens": 202943.0,
|
||
|
|
"step": 80
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 9.433079528808594,
|
||
|
|
"epoch": 0.0918918918918919,
|
||
|
|
"grad_norm": 1.125,
|
||
|
|
"learning_rate": 0.00016800000000000002,
|
||
|
|
"loss": 8.054940795898437,
|
||
|
|
"mean_token_accuracy": 0.03733482360839844,
|
||
|
|
"num_tokens": 213981.0,
|
||
|
|
"step": 85
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.931513023376464,
|
||
|
|
"epoch": 0.0972972972972973,
|
||
|
|
"grad_norm": 0.79296875,
|
||
|
|
"learning_rate": 0.000178,
|
||
|
|
"loss": 7.836601257324219,
|
||
|
|
"mean_token_accuracy": 0.03742141723632812,
|
||
|
|
"num_tokens": 226516.0,
|
||
|
|
"step": 90
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.278807258605957,
|
||
|
|
"epoch": 0.10270270270270271,
|
||
|
|
"grad_norm": 0.6875,
|
||
|
|
"learning_rate": 0.00018800000000000002,
|
||
|
|
"loss": 7.645230102539062,
|
||
|
|
"mean_token_accuracy": 0.038530788570642474,
|
||
|
|
"num_tokens": 236934.0,
|
||
|
|
"step": 95
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.783323097229004,
|
||
|
|
"epoch": 0.10810810810810811,
|
||
|
|
"grad_norm": 0.63671875,
|
||
|
|
"learning_rate": 0.00019800000000000002,
|
||
|
|
"loss": 7.529661560058594,
|
||
|
|
"mean_token_accuracy": 0.04016850292682648,
|
||
|
|
"num_tokens": 247638.0,
|
||
|
|
"step": 100
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.620136451721192,
|
||
|
|
"epoch": 0.11351351351351352,
|
||
|
|
"grad_norm": 0.65234375,
|
||
|
|
"learning_rate": 0.000208,
|
||
|
|
"loss": 7.58187255859375,
|
||
|
|
"mean_token_accuracy": 0.03762040063738823,
|
||
|
|
"num_tokens": 260647.0,
|
||
|
|
"step": 105
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.530057430267334,
|
||
|
|
"epoch": 0.11891891891891893,
|
||
|
|
"grad_norm": 0.8359375,
|
||
|
|
"learning_rate": 0.000218,
|
||
|
|
"loss": 7.458168029785156,
|
||
|
|
"mean_token_accuracy": 0.03727283701300621,
|
||
|
|
"num_tokens": 272033.0,
|
||
|
|
"step": 110
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.478269100189209,
|
||
|
|
"epoch": 0.12432432432432433,
|
||
|
|
"grad_norm": 0.7421875,
|
||
|
|
"learning_rate": 0.000228,
|
||
|
|
"loss": 7.519155883789063,
|
||
|
|
"mean_token_accuracy": 0.0388708658516407,
|
||
|
|
"num_tokens": 284046.0,
|
||
|
|
"step": 115
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.465256214141846,
|
||
|
|
"epoch": 0.12972972972972974,
|
||
|
|
"grad_norm": 0.72265625,
|
||
|
|
"learning_rate": 0.00023799999999999998,
|
||
|
|
"loss": 7.423601531982422,
|
||
|
|
"mean_token_accuracy": 0.037958408892154696,
|
||
|
|
"num_tokens": 294671.0,
|
||
|
|
"step": 120
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.6223400115966795,
|
||
|
|
"epoch": 0.13513513513513514,
|
||
|
|
"grad_norm": 0.75,
|
||
|
|
"learning_rate": 0.000248,
|
||
|
|
"loss": 7.408821105957031,
|
||
|
|
"mean_token_accuracy": 0.03943843990564346,
|
||
|
|
"num_tokens": 305267.0,
|
||
|
|
"step": 125
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.496581554412842,
|
||
|
|
"epoch": 0.14054054054054055,
|
||
|
|
"grad_norm": 0.6640625,
|
||
|
|
"learning_rate": 0.00025800000000000004,
|
||
|
|
"loss": 7.504977416992188,
|
||
|
|
"mean_token_accuracy": 0.03954529017210007,
|
||
|
|
"num_tokens": 316480.0,
|
||
|
|
"step": 130
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.595795345306397,
|
||
|
|
"epoch": 0.14594594594594595,
|
||
|
|
"grad_norm": 0.7265625,
|
||
|
|
"learning_rate": 0.000268,
|
||
|
|
"loss": 7.485077667236328,
|
||
|
|
"mean_token_accuracy": 0.04093076065182686,
|
||
|
|
"num_tokens": 328343.0,
|
||
|
|
"step": 135
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.389880180358887,
|
||
|
|
"epoch": 0.15135135135135136,
|
||
|
|
"grad_norm": 1.25,
|
||
|
|
"learning_rate": 0.00027800000000000004,
|
||
|
|
"loss": 7.638716125488282,
|
||
|
|
"mean_token_accuracy": 0.03965384438633919,
|
||
|
|
"num_tokens": 341072.0,
|
||
|
|
"step": 140
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.676095676422119,
|
||
|
|
"epoch": 0.15675675675675677,
|
||
|
|
"grad_norm": 0.69140625,
|
||
|
|
"learning_rate": 0.000288,
|
||
|
|
"loss": 7.436899566650391,
|
||
|
|
"mean_token_accuracy": 0.04083571806550026,
|
||
|
|
"num_tokens": 353637.0,
|
||
|
|
"step": 145
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.392151641845703,
|
||
|
|
"epoch": 0.16216216216216217,
|
||
|
|
"grad_norm": 0.76171875,
|
||
|
|
"learning_rate": 0.000298,
|
||
|
|
"loss": 7.492266845703125,
|
||
|
|
"mean_token_accuracy": 0.04074482023715973,
|
||
|
|
"num_tokens": 366845.0,
|
||
|
|
"step": 150
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.501393413543701,
|
||
|
|
"epoch": 0.16756756756756758,
|
||
|
|
"grad_norm": 0.83984375,
|
||
|
|
"learning_rate": 0.000308,
|
||
|
|
"loss": 7.447349548339844,
|
||
|
|
"mean_token_accuracy": 0.04357003271579742,
|
||
|
|
"num_tokens": 379852.0,
|
||
|
|
"step": 155
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.460719776153565,
|
||
|
|
"epoch": 0.17297297297297298,
|
||
|
|
"grad_norm": 0.80859375,
|
||
|
|
"learning_rate": 0.00031800000000000003,
|
||
|
|
"loss": 7.461611938476563,
|
||
|
|
"mean_token_accuracy": 0.05375379621982575,
|
||
|
|
"num_tokens": 393017.0,
|
||
|
|
"step": 160
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.317601490020752,
|
||
|
|
"epoch": 0.1783783783783784,
|
||
|
|
"grad_norm": 0.62109375,
|
||
|
|
"learning_rate": 0.000328,
|
||
|
|
"loss": 7.4609222412109375,
|
||
|
|
"mean_token_accuracy": 0.06083732768893242,
|
||
|
|
"num_tokens": 405080.0,
|
||
|
|
"step": 165
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.453921985626221,
|
||
|
|
"epoch": 0.1837837837837838,
|
||
|
|
"grad_norm": 0.7578125,
|
||
|
|
"learning_rate": 0.00033800000000000003,
|
||
|
|
"loss": 7.478794097900391,
|
||
|
|
"mean_token_accuracy": 0.0638080045580864,
|
||
|
|
"num_tokens": 416562.0,
|
||
|
|
"step": 170
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.490277862548828,
|
||
|
|
"epoch": 0.1891891891891892,
|
||
|
|
"grad_norm": 0.7890625,
|
||
|
|
"learning_rate": 0.000348,
|
||
|
|
"loss": 7.457525634765625,
|
||
|
|
"mean_token_accuracy": 0.06417724341154099,
|
||
|
|
"num_tokens": 431085.0,
|
||
|
|
"step": 175
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.414785957336425,
|
||
|
|
"epoch": 0.1945945945945946,
|
||
|
|
"grad_norm": 0.6796875,
|
||
|
|
"learning_rate": 0.000358,
|
||
|
|
"loss": 7.350696563720703,
|
||
|
|
"mean_token_accuracy": 0.06525981873273849,
|
||
|
|
"num_tokens": 443530.0,
|
||
|
|
"step": 180
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.419140338897705,
|
||
|
|
"epoch": 0.2,
|
||
|
|
"grad_norm": 0.6484375,
|
||
|
|
"learning_rate": 0.000368,
|
||
|
|
"loss": 7.389920806884765,
|
||
|
|
"mean_token_accuracy": 0.07182540744543076,
|
||
|
|
"num_tokens": 454722.0,
|
||
|
|
"step": 185
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.397796249389648,
|
||
|
|
"epoch": 0.20540540540540542,
|
||
|
|
"grad_norm": 0.640625,
|
||
|
|
"learning_rate": 0.000378,
|
||
|
|
"loss": 7.342085266113282,
|
||
|
|
"mean_token_accuracy": 0.07431704550981522,
|
||
|
|
"num_tokens": 466162.0,
|
||
|
|
"step": 190
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.36507568359375,
|
||
|
|
"epoch": 0.21081081081081082,
|
||
|
|
"grad_norm": 0.7421875,
|
||
|
|
"learning_rate": 0.000388,
|
||
|
|
"loss": 7.353427124023438,
|
||
|
|
"mean_token_accuracy": 0.07438301593065262,
|
||
|
|
"num_tokens": 476489.0,
|
||
|
|
"step": 195
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.417136478424072,
|
||
|
|
"epoch": 0.21621621621621623,
|
||
|
|
"grad_norm": 0.67578125,
|
||
|
|
"learning_rate": 0.000398,
|
||
|
|
"loss": 7.341059875488281,
|
||
|
|
"mean_token_accuracy": 0.06952804177999497,
|
||
|
|
"num_tokens": 488243.0,
|
||
|
|
"step": 200
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.389842224121094,
|
||
|
|
"epoch": 0.22162162162162163,
|
||
|
|
"grad_norm": 0.69921875,
|
||
|
|
"learning_rate": 0.000408,
|
||
|
|
"loss": 7.386956024169922,
|
||
|
|
"mean_token_accuracy": 0.07643609791994095,
|
||
|
|
"num_tokens": 499212.0,
|
||
|
|
"step": 205
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.442728900909424,
|
||
|
|
"epoch": 0.22702702702702704,
|
||
|
|
"grad_norm": 0.65625,
|
||
|
|
"learning_rate": 0.00041799999999999997,
|
||
|
|
"loss": 7.313986968994141,
|
||
|
|
"mean_token_accuracy": 0.0721098467707634,
|
||
|
|
"num_tokens": 510690.0,
|
||
|
|
"step": 210
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.2722938537597654,
|
||
|
|
"epoch": 0.23243243243243245,
|
||
|
|
"grad_norm": 0.6875,
|
||
|
|
"learning_rate": 0.000428,
|
||
|
|
"loss": 7.30157699584961,
|
||
|
|
"mean_token_accuracy": 0.0739034004509449,
|
||
|
|
"num_tokens": 523005.0,
|
||
|
|
"step": 215
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.434175109863281,
|
||
|
|
"epoch": 0.23783783783783785,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 0.000438,
|
||
|
|
"loss": 7.3041847229003904,
|
||
|
|
"mean_token_accuracy": 0.07309759110212326,
|
||
|
|
"num_tokens": 535212.0,
|
||
|
|
"step": 220
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.340867042541504,
|
||
|
|
"epoch": 0.24324324324324326,
|
||
|
|
"grad_norm": 0.62890625,
|
||
|
|
"learning_rate": 0.000448,
|
||
|
|
"loss": 7.266801452636718,
|
||
|
|
"mean_token_accuracy": 0.07607424259185791,
|
||
|
|
"num_tokens": 546523.0,
|
||
|
|
"step": 225
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.232867050170898,
|
||
|
|
"epoch": 0.24864864864864866,
|
||
|
|
"grad_norm": 0.83984375,
|
||
|
|
"learning_rate": 0.000458,
|
||
|
|
"loss": 7.171680450439453,
|
||
|
|
"mean_token_accuracy": 0.07834560871124267,
|
||
|
|
"num_tokens": 558036.0,
|
||
|
|
"step": 230
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.411350154876709,
|
||
|
|
"epoch": 0.25405405405405407,
|
||
|
|
"grad_norm": 0.72265625,
|
||
|
|
"learning_rate": 0.00046800000000000005,
|
||
|
|
"loss": 7.248665618896484,
|
||
|
|
"mean_token_accuracy": 0.07751285135746003,
|
||
|
|
"num_tokens": 570324.0,
|
||
|
|
"step": 235
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.22170934677124,
|
||
|
|
"epoch": 0.2594594594594595,
|
||
|
|
"grad_norm": 0.69921875,
|
||
|
|
"learning_rate": 0.00047799999999999996,
|
||
|
|
"loss": 7.253816223144531,
|
||
|
|
"mean_token_accuracy": 0.07464860528707504,
|
||
|
|
"num_tokens": 582950.0,
|
||
|
|
"step": 240
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.243322372436523,
|
||
|
|
"epoch": 0.2648648648648649,
|
||
|
|
"grad_norm": 0.609375,
|
||
|
|
"learning_rate": 0.000488,
|
||
|
|
"loss": 7.149346923828125,
|
||
|
|
"mean_token_accuracy": 0.08247889876365662,
|
||
|
|
"num_tokens": 594081.0,
|
||
|
|
"step": 245
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.186726856231689,
|
||
|
|
"epoch": 0.2702702702702703,
|
||
|
|
"grad_norm": 0.70703125,
|
||
|
|
"learning_rate": 0.000498,
|
||
|
|
"loss": 7.139888000488281,
|
||
|
|
"mean_token_accuracy": 0.08595664352178574,
|
||
|
|
"num_tokens": 605251.0,
|
||
|
|
"step": 250
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.1818643569946286,
|
||
|
|
"epoch": 0.2756756756756757,
|
||
|
|
"grad_norm": 0.70703125,
|
||
|
|
"learning_rate": 0.000508,
|
||
|
|
"loss": 7.17196044921875,
|
||
|
|
"mean_token_accuracy": 0.08519582152366638,
|
||
|
|
"num_tokens": 617223.0,
|
||
|
|
"step": 255
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.080172061920166,
|
||
|
|
"epoch": 0.2810810810810811,
|
||
|
|
"grad_norm": 0.61328125,
|
||
|
|
"learning_rate": 0.000518,
|
||
|
|
"loss": 7.089189147949218,
|
||
|
|
"mean_token_accuracy": 0.08611884564161301,
|
||
|
|
"num_tokens": 628737.0,
|
||
|
|
"step": 260
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.147446060180664,
|
||
|
|
"epoch": 0.2864864864864865,
|
||
|
|
"grad_norm": 0.78125,
|
||
|
|
"learning_rate": 0.000528,
|
||
|
|
"loss": 7.04461898803711,
|
||
|
|
"mean_token_accuracy": 0.08524503260850906,
|
||
|
|
"num_tokens": 639493.0,
|
||
|
|
"step": 265
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.0829826354980465,
|
||
|
|
"epoch": 0.2918918918918919,
|
||
|
|
"grad_norm": 0.703125,
|
||
|
|
"learning_rate": 0.0005380000000000001,
|
||
|
|
"loss": 7.018182373046875,
|
||
|
|
"mean_token_accuracy": 0.09309226870536805,
|
||
|
|
"num_tokens": 651215.0,
|
||
|
|
"step": 270
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.080189990997314,
|
||
|
|
"epoch": 0.2972972972972973,
|
||
|
|
"grad_norm": 0.7265625,
|
||
|
|
"learning_rate": 0.0005480000000000001,
|
||
|
|
"loss": 7.054932403564453,
|
||
|
|
"mean_token_accuracy": 0.08287097811698914,
|
||
|
|
"num_tokens": 664644.0,
|
||
|
|
"step": 275
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.1431303977966305,
|
||
|
|
"epoch": 0.3027027027027027,
|
||
|
|
"grad_norm": 0.6484375,
|
||
|
|
"learning_rate": 0.000558,
|
||
|
|
"loss": 7.087598419189453,
|
||
|
|
"mean_token_accuracy": 0.0870475098490715,
|
||
|
|
"num_tokens": 677139.0,
|
||
|
|
"step": 280
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.185227966308593,
|
||
|
|
"epoch": 0.3081081081081081,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 0.0005679999999999999,
|
||
|
|
"loss": 7.17745361328125,
|
||
|
|
"mean_token_accuracy": 0.0867692619562149,
|
||
|
|
"num_tokens": 689894.0,
|
||
|
|
"step": 285
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.046064186096191,
|
||
|
|
"epoch": 0.31351351351351353,
|
||
|
|
"grad_norm": 0.63671875,
|
||
|
|
"learning_rate": 0.000578,
|
||
|
|
"loss": 7.0239204406738285,
|
||
|
|
"mean_token_accuracy": 0.09042058289051055,
|
||
|
|
"num_tokens": 702300.0,
|
||
|
|
"step": 290
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.150553798675537,
|
||
|
|
"epoch": 0.31891891891891894,
|
||
|
|
"grad_norm": 0.65625,
|
||
|
|
"learning_rate": 0.000588,
|
||
|
|
"loss": 7.063279724121093,
|
||
|
|
"mean_token_accuracy": 0.08882811665534973,
|
||
|
|
"num_tokens": 713190.0,
|
||
|
|
"step": 295
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.059144687652588,
|
||
|
|
"epoch": 0.32432432432432434,
|
||
|
|
"grad_norm": 0.7265625,
|
||
|
|
"learning_rate": 0.000598,
|
||
|
|
"loss": 6.94993896484375,
|
||
|
|
"mean_token_accuracy": 0.0942073032259941,
|
||
|
|
"num_tokens": 724322.0,
|
||
|
|
"step": 300
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.999932956695557,
|
||
|
|
"epoch": 0.32972972972972975,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 0.000608,
|
||
|
|
"loss": 6.929829406738281,
|
||
|
|
"mean_token_accuracy": 0.09061438292264938,
|
||
|
|
"num_tokens": 735779.0,
|
||
|
|
"step": 305
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.916056346893311,
|
||
|
|
"epoch": 0.33513513513513515,
|
||
|
|
"grad_norm": 0.74609375,
|
||
|
|
"learning_rate": 0.0006180000000000001,
|
||
|
|
"loss": 6.898499298095703,
|
||
|
|
"mean_token_accuracy": 0.09576145559549332,
|
||
|
|
"num_tokens": 746939.0,
|
||
|
|
"step": 310
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.874477195739746,
|
||
|
|
"epoch": 0.34054054054054056,
|
||
|
|
"grad_norm": 0.65234375,
|
||
|
|
"learning_rate": 0.000628,
|
||
|
|
"loss": 6.854414367675782,
|
||
|
|
"mean_token_accuracy": 0.09072280377149582,
|
||
|
|
"num_tokens": 758395.0,
|
||
|
|
"step": 315
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.106177234649659,
|
||
|
|
"epoch": 0.34594594594594597,
|
||
|
|
"grad_norm": 0.66015625,
|
||
|
|
"learning_rate": 0.000638,
|
||
|
|
"loss": 7.086619567871094,
|
||
|
|
"mean_token_accuracy": 0.09368456453084946,
|
||
|
|
"num_tokens": 770439.0,
|
||
|
|
"step": 320
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.064824867248535,
|
||
|
|
"epoch": 0.35135135135135137,
|
||
|
|
"grad_norm": 0.7578125,
|
||
|
|
"learning_rate": 0.000648,
|
||
|
|
"loss": 7.107695007324219,
|
||
|
|
"mean_token_accuracy": 0.08414219319820404,
|
||
|
|
"num_tokens": 786745.0,
|
||
|
|
"step": 325
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.824825382232666,
|
||
|
|
"epoch": 0.3567567567567568,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 0.0006580000000000001,
|
||
|
|
"loss": 6.873025512695312,
|
||
|
|
"mean_token_accuracy": 0.09536780565977096,
|
||
|
|
"num_tokens": 796900.0,
|
||
|
|
"step": 330
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.899827575683593,
|
||
|
|
"epoch": 0.3621621621621622,
|
||
|
|
"grad_norm": 0.83203125,
|
||
|
|
"learning_rate": 0.0006680000000000001,
|
||
|
|
"loss": 6.8659309387207035,
|
||
|
|
"mean_token_accuracy": 0.09452889859676361,
|
||
|
|
"num_tokens": 808484.0,
|
||
|
|
"step": 335
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.07827615737915,
|
||
|
|
"epoch": 0.3675675675675676,
|
||
|
|
"grad_norm": 0.69921875,
|
||
|
|
"learning_rate": 0.0006780000000000001,
|
||
|
|
"loss": 7.063574981689453,
|
||
|
|
"mean_token_accuracy": 0.09114441871643067,
|
||
|
|
"num_tokens": 820125.0,
|
||
|
|
"step": 340
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.911789226531982,
|
||
|
|
"epoch": 0.372972972972973,
|
||
|
|
"grad_norm": 0.75,
|
||
|
|
"learning_rate": 0.0006879999999999999,
|
||
|
|
"loss": 6.837258148193359,
|
||
|
|
"mean_token_accuracy": 0.10115662217140198,
|
||
|
|
"num_tokens": 831787.0,
|
||
|
|
"step": 345
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.751354217529297,
|
||
|
|
"epoch": 0.3783783783783784,
|
||
|
|
"grad_norm": 0.84765625,
|
||
|
|
"learning_rate": 0.0006979999999999999,
|
||
|
|
"loss": 6.795095825195313,
|
||
|
|
"mean_token_accuracy": 0.10106057971715927,
|
||
|
|
"num_tokens": 842992.0,
|
||
|
|
"step": 350
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.851361846923828,
|
||
|
|
"epoch": 0.3837837837837838,
|
||
|
|
"grad_norm": 0.8828125,
|
||
|
|
"learning_rate": 0.000708,
|
||
|
|
"loss": 6.831424713134766,
|
||
|
|
"mean_token_accuracy": 0.0954001784324646,
|
||
|
|
"num_tokens": 855636.0,
|
||
|
|
"step": 355
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.8148805618286135,
|
||
|
|
"epoch": 0.3891891891891892,
|
||
|
|
"grad_norm": 0.6640625,
|
||
|
|
"learning_rate": 0.000718,
|
||
|
|
"loss": 6.837454986572266,
|
||
|
|
"mean_token_accuracy": 0.09592621475458145,
|
||
|
|
"num_tokens": 866664.0,
|
||
|
|
"step": 360
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.85852575302124,
|
||
|
|
"epoch": 0.3945945945945946,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 0.000728,
|
||
|
|
"loss": 6.818362426757813,
|
||
|
|
"mean_token_accuracy": 0.09673329740762711,
|
||
|
|
"num_tokens": 876702.0,
|
||
|
|
"step": 365
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.8342584609985355,
|
||
|
|
"epoch": 0.4,
|
||
|
|
"grad_norm": 0.76171875,
|
||
|
|
"learning_rate": 0.000738,
|
||
|
|
"loss": 6.828379058837891,
|
||
|
|
"mean_token_accuracy": 0.10096636265516282,
|
||
|
|
"num_tokens": 887866.0,
|
||
|
|
"step": 370
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.858696842193604,
|
||
|
|
"epoch": 0.40540540540540543,
|
||
|
|
"grad_norm": 0.68359375,
|
||
|
|
"learning_rate": 0.000748,
|
||
|
|
"loss": 6.872694396972657,
|
||
|
|
"mean_token_accuracy": 0.1039510726928711,
|
||
|
|
"num_tokens": 898200.0,
|
||
|
|
"step": 375
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.809317970275879,
|
||
|
|
"epoch": 0.41081081081081083,
|
||
|
|
"grad_norm": 0.72265625,
|
||
|
|
"learning_rate": 0.000758,
|
||
|
|
"loss": 6.88883056640625,
|
||
|
|
"mean_token_accuracy": 0.09990563690662384,
|
||
|
|
"num_tokens": 912550.0,
|
||
|
|
"step": 380
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.892767333984375,
|
||
|
|
"epoch": 0.41621621621621624,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 0.000768,
|
||
|
|
"loss": 6.792707824707032,
|
||
|
|
"mean_token_accuracy": 0.10181351602077485,
|
||
|
|
"num_tokens": 922728.0,
|
||
|
|
"step": 385
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.767278099060059,
|
||
|
|
"epoch": 0.42162162162162165,
|
||
|
|
"grad_norm": 0.75390625,
|
||
|
|
"learning_rate": 0.000778,
|
||
|
|
"loss": 6.740338134765625,
|
||
|
|
"mean_token_accuracy": 0.10379333794116974,
|
||
|
|
"num_tokens": 933323.0,
|
||
|
|
"step": 390
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.840473747253418,
|
||
|
|
"epoch": 0.42702702702702705,
|
||
|
|
"grad_norm": 0.7890625,
|
||
|
|
"learning_rate": 0.0007880000000000001,
|
||
|
|
"loss": 6.9275146484375,
|
||
|
|
"mean_token_accuracy": 0.09510410130023957,
|
||
|
|
"num_tokens": 947864.0,
|
||
|
|
"step": 395
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.913839817047119,
|
||
|
|
"epoch": 0.43243243243243246,
|
||
|
|
"grad_norm": 0.7734375,
|
||
|
|
"learning_rate": 0.0007980000000000001,
|
||
|
|
"loss": 6.987394714355469,
|
||
|
|
"mean_token_accuracy": 0.09437586069107055,
|
||
|
|
"num_tokens": 962042.0,
|
||
|
|
"step": 400
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.79087553024292,
|
||
|
|
"epoch": 0.43783783783783786,
|
||
|
|
"grad_norm": 0.875,
|
||
|
|
"learning_rate": 0.000808,
|
||
|
|
"loss": 6.878759765625,
|
||
|
|
"mean_token_accuracy": 0.10361665934324264,
|
||
|
|
"num_tokens": 977434.0,
|
||
|
|
"step": 405
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.740821361541748,
|
||
|
|
"epoch": 0.44324324324324327,
|
||
|
|
"grad_norm": 0.765625,
|
||
|
|
"learning_rate": 0.0008179999999999999,
|
||
|
|
"loss": 6.766633605957031,
|
||
|
|
"mean_token_accuracy": 0.10389182120561599,
|
||
|
|
"num_tokens": 989656.0,
|
||
|
|
"step": 410
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.853046607971192,
|
||
|
|
"epoch": 0.4486486486486487,
|
||
|
|
"grad_norm": 0.640625,
|
||
|
|
"learning_rate": 0.000828,
|
||
|
|
"loss": 6.767631530761719,
|
||
|
|
"mean_token_accuracy": 0.10301467031240463,
|
||
|
|
"num_tokens": 1000860.0,
|
||
|
|
"step": 415
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.734612083435058,
|
||
|
|
"epoch": 0.4540540540540541,
|
||
|
|
"grad_norm": 0.6875,
|
||
|
|
"learning_rate": 0.000838,
|
||
|
|
"loss": 6.748469543457031,
|
||
|
|
"mean_token_accuracy": 0.10394396185874939,
|
||
|
|
"num_tokens": 1013873.0,
|
||
|
|
"step": 420
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.597353744506836,
|
||
|
|
"epoch": 0.4594594594594595,
|
||
|
|
"grad_norm": 0.67578125,
|
||
|
|
"learning_rate": 0.000848,
|
||
|
|
"loss": 6.686911010742188,
|
||
|
|
"mean_token_accuracy": 0.10376572757959365,
|
||
|
|
"num_tokens": 1026491.0,
|
||
|
|
"step": 425
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.775363540649414,
|
||
|
|
"epoch": 0.4648648648648649,
|
||
|
|
"grad_norm": 0.74609375,
|
||
|
|
"learning_rate": 0.000858,
|
||
|
|
"loss": 6.683805084228515,
|
||
|
|
"mean_token_accuracy": 0.10709702819585801,
|
||
|
|
"num_tokens": 1038482.0,
|
||
|
|
"step": 430
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.601847457885742,
|
||
|
|
"epoch": 0.4702702702702703,
|
||
|
|
"grad_norm": 0.703125,
|
||
|
|
"learning_rate": 0.0008680000000000001,
|
||
|
|
"loss": 6.725534820556641,
|
||
|
|
"mean_token_accuracy": 0.10785069316625595,
|
||
|
|
"num_tokens": 1051344.0,
|
||
|
|
"step": 435
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.743765640258789,
|
||
|
|
"epoch": 0.4756756756756757,
|
||
|
|
"grad_norm": 0.80078125,
|
||
|
|
"learning_rate": 0.000878,
|
||
|
|
"loss": 6.694649505615234,
|
||
|
|
"mean_token_accuracy": 0.10876548141241074,
|
||
|
|
"num_tokens": 1061586.0,
|
||
|
|
"step": 440
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.715018367767334,
|
||
|
|
"epoch": 0.4810810810810811,
|
||
|
|
"grad_norm": 0.89453125,
|
||
|
|
"learning_rate": 0.000888,
|
||
|
|
"loss": 6.717233276367187,
|
||
|
|
"mean_token_accuracy": 0.10967092216014862,
|
||
|
|
"num_tokens": 1072086.0,
|
||
|
|
"step": 445
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.717541790008545,
|
||
|
|
"epoch": 0.4864864864864865,
|
||
|
|
"grad_norm": 0.7578125,
|
||
|
|
"learning_rate": 0.000898,
|
||
|
|
"loss": 6.69256591796875,
|
||
|
|
"mean_token_accuracy": 0.10869137644767761,
|
||
|
|
"num_tokens": 1084788.0,
|
||
|
|
"step": 450
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.390600490570068,
|
||
|
|
"epoch": 0.4918918918918919,
|
||
|
|
"grad_norm": 0.77734375,
|
||
|
|
"learning_rate": 0.0009080000000000001,
|
||
|
|
"loss": 6.499176788330078,
|
||
|
|
"mean_token_accuracy": 0.11725788116455078,
|
||
|
|
"num_tokens": 1096558.0,
|
||
|
|
"step": 455
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.706469345092773,
|
||
|
|
"epoch": 0.4972972972972973,
|
||
|
|
"grad_norm": 0.76171875,
|
||
|
|
"learning_rate": 0.0009180000000000001,
|
||
|
|
"loss": 6.638755798339844,
|
||
|
|
"mean_token_accuracy": 0.11198882460594177,
|
||
|
|
"num_tokens": 1107370.0,
|
||
|
|
"step": 460
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.591896820068359,
|
||
|
|
"epoch": 0.5027027027027027,
|
||
|
|
"grad_norm": 0.77734375,
|
||
|
|
"learning_rate": 0.0009280000000000001,
|
||
|
|
"loss": 6.637400817871094,
|
||
|
|
"mean_token_accuracy": 0.10757572948932648,
|
||
|
|
"num_tokens": 1120205.0,
|
||
|
|
"step": 465
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.832434177398682,
|
||
|
|
"epoch": 0.5081081081081081,
|
||
|
|
"grad_norm": 0.7265625,
|
||
|
|
"learning_rate": 0.0009379999999999999,
|
||
|
|
"loss": 6.848423767089844,
|
||
|
|
"mean_token_accuracy": 0.10572721362113953,
|
||
|
|
"num_tokens": 1135282.0,
|
||
|
|
"step": 470
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.580890464782715,
|
||
|
|
"epoch": 0.5135135135135135,
|
||
|
|
"grad_norm": 0.7734375,
|
||
|
|
"learning_rate": 0.000948,
|
||
|
|
"loss": 6.709358978271484,
|
||
|
|
"mean_token_accuracy": 0.10477431863546371,
|
||
|
|
"num_tokens": 1149554.0,
|
||
|
|
"step": 475
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.7246020317077635,
|
||
|
|
"epoch": 0.518918918918919,
|
||
|
|
"grad_norm": 0.796875,
|
||
|
|
"learning_rate": 0.000958,
|
||
|
|
"loss": 6.709073638916015,
|
||
|
|
"mean_token_accuracy": 0.10875285863876342,
|
||
|
|
"num_tokens": 1161739.0,
|
||
|
|
"step": 480
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.6759847640991214,
|
||
|
|
"epoch": 0.5243243243243243,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 0.000968,
|
||
|
|
"loss": 6.595793914794922,
|
||
|
|
"mean_token_accuracy": 0.11315198093652726,
|
||
|
|
"num_tokens": 1173650.0,
|
||
|
|
"step": 485
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.549227523803711,
|
||
|
|
"epoch": 0.5297297297297298,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 0.000978,
|
||
|
|
"loss": 6.6798255920410154,
|
||
|
|
"mean_token_accuracy": 0.11241919845342636,
|
||
|
|
"num_tokens": 1185551.0,
|
||
|
|
"step": 490
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.744762134552002,
|
||
|
|
"epoch": 0.5351351351351351,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 0.000988,
|
||
|
|
"loss": 6.765760040283203,
|
||
|
|
"mean_token_accuracy": 0.106291264295578,
|
||
|
|
"num_tokens": 1199600.0,
|
||
|
|
"step": 495
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.61545238494873,
|
||
|
|
"epoch": 0.5405405405405406,
|
||
|
|
"grad_norm": 0.6796875,
|
||
|
|
"learning_rate": 0.000998,
|
||
|
|
"loss": 6.682843017578125,
|
||
|
|
"mean_token_accuracy": 0.10700990110635758,
|
||
|
|
"num_tokens": 1210465.0,
|
||
|
|
"step": 500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.683747100830078,
|
||
|
|
"epoch": 0.5459459459459459,
|
||
|
|
"grad_norm": 0.796875,
|
||
|
|
"learning_rate": 0.0009999979169398642,
|
||
|
|
"loss": 6.590595245361328,
|
||
|
|
"mean_token_accuracy": 0.11202836632728577,
|
||
|
|
"num_tokens": 1221297.0,
|
||
|
|
"step": 505
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.556936645507813,
|
||
|
|
"epoch": 0.5513513513513514,
|
||
|
|
"grad_norm": 0.73046875,
|
||
|
|
"learning_rate": 0.0009999894545411141,
|
||
|
|
"loss": 6.64039306640625,
|
||
|
|
"mean_token_accuracy": 0.10924990326166154,
|
||
|
|
"num_tokens": 1233805.0,
|
||
|
|
"step": 510
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.645992183685303,
|
||
|
|
"epoch": 0.5567567567567567,
|
||
|
|
"grad_norm": 0.7890625,
|
||
|
|
"learning_rate": 0.0009999744827348116,
|
||
|
|
"loss": 6.720680236816406,
|
||
|
|
"mean_token_accuracy": 0.10662575513124466,
|
||
|
|
"num_tokens": 1245747.0,
|
||
|
|
"step": 515
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.560120868682861,
|
||
|
|
"epoch": 0.5621621621621622,
|
||
|
|
"grad_norm": 0.61328125,
|
||
|
|
"learning_rate": 0.0009999530017375344,
|
||
|
|
"loss": 6.516216278076172,
|
||
|
|
"mean_token_accuracy": 0.12112323045730591,
|
||
|
|
"num_tokens": 1257310.0,
|
||
|
|
"step": 520
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.676382350921631,
|
||
|
|
"epoch": 0.5675675675675675,
|
||
|
|
"grad_norm": 0.80078125,
|
||
|
|
"learning_rate": 0.0009999250118600195,
|
||
|
|
"loss": 6.705149841308594,
|
||
|
|
"mean_token_accuracy": 0.11206594407558441,
|
||
|
|
"num_tokens": 1269216.0,
|
||
|
|
"step": 525
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.643038272857666,
|
||
|
|
"epoch": 0.572972972972973,
|
||
|
|
"grad_norm": 0.72265625,
|
||
|
|
"learning_rate": 0.0009998905135071602,
|
||
|
|
"loss": 6.58680419921875,
|
||
|
|
"mean_token_accuracy": 0.11697860062122345,
|
||
|
|
"num_tokens": 1279711.0,
|
||
|
|
"step": 530
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.546832656860351,
|
||
|
|
"epoch": 0.5783783783783784,
|
||
|
|
"grad_norm": 0.66015625,
|
||
|
|
"learning_rate": 0.0009998495071779987,
|
||
|
|
"loss": 6.6342926025390625,
|
||
|
|
"mean_token_accuracy": 0.11330044567584992,
|
||
|
|
"num_tokens": 1292958.0,
|
||
|
|
"step": 535
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.735915756225586,
|
||
|
|
"epoch": 0.5837837837837838,
|
||
|
|
"grad_norm": 0.7265625,
|
||
|
|
"learning_rate": 0.0009998019934657199,
|
||
|
|
"loss": 6.7581428527832035,
|
||
|
|
"mean_token_accuracy": 0.11686633378267289,
|
||
|
|
"num_tokens": 1304082.0,
|
||
|
|
"step": 540
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.588940620422363,
|
||
|
|
"epoch": 0.5891891891891892,
|
||
|
|
"grad_norm": 0.82421875,
|
||
|
|
"learning_rate": 0.0009997479730576423,
|
||
|
|
"loss": 6.639595794677734,
|
||
|
|
"mean_token_accuracy": 0.11487565338611602,
|
||
|
|
"num_tokens": 1315789.0,
|
||
|
|
"step": 545
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.542739009857177,
|
||
|
|
"epoch": 0.5945945945945946,
|
||
|
|
"grad_norm": 0.7265625,
|
||
|
|
"learning_rate": 0.0009996874467352087,
|
||
|
|
"loss": 6.549444580078125,
|
||
|
|
"mean_token_accuracy": 0.11959983855485916,
|
||
|
|
"num_tokens": 1327191.0,
|
||
|
|
"step": 550
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.606736755371093,
|
||
|
|
"epoch": 0.6,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 0.0009996204153739734,
|
||
|
|
"loss": 6.549032592773438,
|
||
|
|
"mean_token_accuracy": 0.12100645154714584,
|
||
|
|
"num_tokens": 1338645.0,
|
||
|
|
"step": 555
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.521855735778809,
|
||
|
|
"epoch": 0.6054054054054054,
|
||
|
|
"grad_norm": 0.703125,
|
||
|
|
"learning_rate": 0.0009995468799435915,
|
||
|
|
"loss": 6.569098663330078,
|
||
|
|
"mean_token_accuracy": 0.11854373812675476,
|
||
|
|
"num_tokens": 1349881.0,
|
||
|
|
"step": 560
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.549165916442871,
|
||
|
|
"epoch": 0.6108108108108108,
|
||
|
|
"grad_norm": 0.6875,
|
||
|
|
"learning_rate": 0.000999466841507804,
|
||
|
|
"loss": 6.494113159179688,
|
||
|
|
"mean_token_accuracy": 0.12339054346084595,
|
||
|
|
"num_tokens": 1361468.0,
|
||
|
|
"step": 565
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.537939643859863,
|
||
|
|
"epoch": 0.6162162162162163,
|
||
|
|
"grad_norm": 0.6640625,
|
||
|
|
"learning_rate": 0.0009993803012244217,
|
||
|
|
"loss": 6.537962341308594,
|
||
|
|
"mean_token_accuracy": 0.11801687628030777,
|
||
|
|
"num_tokens": 1373363.0,
|
||
|
|
"step": 570
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.479009532928467,
|
||
|
|
"epoch": 0.6216216216216216,
|
||
|
|
"grad_norm": 0.7578125,
|
||
|
|
"learning_rate": 0.0009992872603453097,
|
||
|
|
"loss": 6.545735168457031,
|
||
|
|
"mean_token_accuracy": 0.11801871210336685,
|
||
|
|
"num_tokens": 1385614.0,
|
||
|
|
"step": 575
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.627403926849365,
|
||
|
|
"epoch": 0.6270270270270271,
|
||
|
|
"grad_norm": 0.7265625,
|
||
|
|
"learning_rate": 0.000999187720216368,
|
||
|
|
"loss": 6.656562805175781,
|
||
|
|
"mean_token_accuracy": 0.11987384706735611,
|
||
|
|
"num_tokens": 1398553.0,
|
||
|
|
"step": 580
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.601816844940186,
|
||
|
|
"epoch": 0.6324324324324324,
|
||
|
|
"grad_norm": 0.6953125,
|
||
|
|
"learning_rate": 0.0009990816822775135,
|
||
|
|
"loss": 6.55546875,
|
||
|
|
"mean_token_accuracy": 0.1271597623825073,
|
||
|
|
"num_tokens": 1409953.0,
|
||
|
|
"step": 585
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.650836849212647,
|
||
|
|
"epoch": 0.6378378378378379,
|
||
|
|
"grad_norm": 0.6796875,
|
||
|
|
"learning_rate": 0.000998969148062658,
|
||
|
|
"loss": 6.66297607421875,
|
||
|
|
"mean_token_accuracy": 0.11517720967531205,
|
||
|
|
"num_tokens": 1423190.0,
|
||
|
|
"step": 590
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.5727849960327145,
|
||
|
|
"epoch": 0.6432432432432432,
|
||
|
|
"grad_norm": 0.703125,
|
||
|
|
"learning_rate": 0.0009988501191996863,
|
||
|
|
"loss": 6.533869934082031,
|
||
|
|
"mean_token_accuracy": 0.12116028219461442,
|
||
|
|
"num_tokens": 1434088.0,
|
||
|
|
"step": 595
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.3762282371521,
|
||
|
|
"epoch": 0.6486486486486487,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 0.0009987245974104333,
|
||
|
|
"loss": 6.47516098022461,
|
||
|
|
"mean_token_accuracy": 0.1226390540599823,
|
||
|
|
"num_tokens": 1447355.0,
|
||
|
|
"step": 600
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.464574718475342,
|
||
|
|
"epoch": 0.654054054054054,
|
||
|
|
"grad_norm": 0.7890625,
|
||
|
|
"learning_rate": 0.0009985925845106577,
|
||
|
|
"loss": 6.44190673828125,
|
||
|
|
"mean_token_accuracy": 0.12635250836610795,
|
||
|
|
"num_tokens": 1458581.0,
|
||
|
|
"step": 605
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.3286590576171875,
|
||
|
|
"epoch": 0.6594594594594595,
|
||
|
|
"grad_norm": 0.7265625,
|
||
|
|
"learning_rate": 0.0009984540824100174,
|
||
|
|
"loss": 6.349403762817383,
|
||
|
|
"mean_token_accuracy": 0.12394919246435165,
|
||
|
|
"num_tokens": 1469271.0,
|
||
|
|
"step": 610
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.5246072769165036,
|
||
|
|
"epoch": 0.6648648648648648,
|
||
|
|
"grad_norm": 0.6796875,
|
||
|
|
"learning_rate": 0.0009983090931120408,
|
||
|
|
"loss": 6.45703125,
|
||
|
|
"mean_token_accuracy": 0.12573732286691666,
|
||
|
|
"num_tokens": 1480424.0,
|
||
|
|
"step": 615
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.471957397460938,
|
||
|
|
"epoch": 0.6702702702702703,
|
||
|
|
"grad_norm": 0.66796875,
|
||
|
|
"learning_rate": 0.0009981576187140977,
|
||
|
|
"loss": 6.520024108886719,
|
||
|
|
"mean_token_accuracy": 0.11777724027633667,
|
||
|
|
"num_tokens": 1493735.0,
|
||
|
|
"step": 620
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.543122959136963,
|
||
|
|
"epoch": 0.6756756756756757,
|
||
|
|
"grad_norm": 0.72265625,
|
||
|
|
"learning_rate": 0.00099799966140737,
|
||
|
|
"loss": 6.515281677246094,
|
||
|
|
"mean_token_accuracy": 0.11840547770261764,
|
||
|
|
"num_tokens": 1507102.0,
|
||
|
|
"step": 625
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.470473766326904,
|
||
|
|
"epoch": 0.6810810810810811,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 0.0009978352234768185,
|
||
|
|
"loss": 6.454793548583984,
|
||
|
|
"mean_token_accuracy": 0.12399042546749114,
|
||
|
|
"num_tokens": 1518558.0,
|
||
|
|
"step": 630
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.380885028839112,
|
||
|
|
"epoch": 0.6864864864864865,
|
||
|
|
"grad_norm": 0.63671875,
|
||
|
|
"learning_rate": 0.0009976643073011516,
|
||
|
|
"loss": 6.444398498535156,
|
||
|
|
"mean_token_accuracy": 0.1253846377134323,
|
||
|
|
"num_tokens": 1531262.0,
|
||
|
|
"step": 635
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.53573751449585,
|
||
|
|
"epoch": 0.6918918918918919,
|
||
|
|
"grad_norm": 0.75,
|
||
|
|
"learning_rate": 0.0009974869153527893,
|
||
|
|
"loss": 6.399496459960938,
|
||
|
|
"mean_token_accuracy": 0.12655056715011598,
|
||
|
|
"num_tokens": 1541964.0,
|
||
|
|
"step": 640
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.5604249954223635,
|
||
|
|
"epoch": 0.6972972972972973,
|
||
|
|
"grad_norm": 0.6484375,
|
||
|
|
"learning_rate": 0.0009973030501978287,
|
||
|
|
"loss": 6.581614685058594,
|
||
|
|
"mean_token_accuracy": 0.12558400630950928,
|
||
|
|
"num_tokens": 1554347.0,
|
||
|
|
"step": 645
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.4987060546875,
|
||
|
|
"epoch": 0.7027027027027027,
|
||
|
|
"grad_norm": 0.81640625,
|
||
|
|
"learning_rate": 0.0009971127144960056,
|
||
|
|
"loss": 6.543399047851563,
|
||
|
|
"mean_token_accuracy": 0.11906942576169968,
|
||
|
|
"num_tokens": 1565717.0,
|
||
|
|
"step": 650
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.46410551071167,
|
||
|
|
"epoch": 0.7081081081081081,
|
||
|
|
"grad_norm": 0.76953125,
|
||
|
|
"learning_rate": 0.0009969159110006574,
|
||
|
|
"loss": 6.444772338867187,
|
||
|
|
"mean_token_accuracy": 0.12645898312330245,
|
||
|
|
"num_tokens": 1579868.0,
|
||
|
|
"step": 655
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.5014301300048825,
|
||
|
|
"epoch": 0.7135135135135136,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 0.0009967126425586821,
|
||
|
|
"loss": 6.587330627441406,
|
||
|
|
"mean_token_accuracy": 0.11874048858880996,
|
||
|
|
"num_tokens": 1593391.0,
|
||
|
|
"step": 660
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.543860626220703,
|
||
|
|
"epoch": 0.7189189189189189,
|
||
|
|
"grad_norm": 0.67578125,
|
||
|
|
"learning_rate": 0.0009965029121104978,
|
||
|
|
"loss": 6.405085754394531,
|
||
|
|
"mean_token_accuracy": 0.12694377601146697,
|
||
|
|
"num_tokens": 1604787.0,
|
||
|
|
"step": 665
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.407235908508301,
|
||
|
|
"epoch": 0.7243243243243244,
|
||
|
|
"grad_norm": 0.796875,
|
||
|
|
"learning_rate": 0.0009962867226900002,
|
||
|
|
"loss": 6.4062744140625,
|
||
|
|
"mean_token_accuracy": 0.13111316710710524,
|
||
|
|
"num_tokens": 1616824.0,
|
||
|
|
"step": 670
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.452020835876465,
|
||
|
|
"epoch": 0.7297297297297297,
|
||
|
|
"grad_norm": 0.66015625,
|
||
|
|
"learning_rate": 0.0009960640774245178,
|
||
|
|
"loss": 6.551805877685547,
|
||
|
|
"mean_token_accuracy": 0.12295851409435272,
|
||
|
|
"num_tokens": 1630342.0,
|
||
|
|
"step": 675
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.499637317657471,
|
||
|
|
"epoch": 0.7351351351351352,
|
||
|
|
"grad_norm": 0.6796875,
|
||
|
|
"learning_rate": 0.000995834979534768,
|
||
|
|
"loss": 6.363913345336914,
|
||
|
|
"mean_token_accuracy": 0.12563441097736358,
|
||
|
|
"num_tokens": 1641408.0,
|
||
|
|
"step": 680
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.448514842987061,
|
||
|
|
"epoch": 0.7405405405405405,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 0.0009955994323348099,
|
||
|
|
"loss": 6.408490753173828,
|
||
|
|
"mean_token_accuracy": 0.1317383110523224,
|
||
|
|
"num_tokens": 1651883.0,
|
||
|
|
"step": 685
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.435086631774903,
|
||
|
|
"epoch": 0.745945945945946,
|
||
|
|
"grad_norm": 0.64453125,
|
||
|
|
"learning_rate": 0.0009953574392319957,
|
||
|
|
"loss": 6.545511627197266,
|
||
|
|
"mean_token_accuracy": 0.1223674014210701,
|
||
|
|
"num_tokens": 1664072.0,
|
||
|
|
"step": 690
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.510448932647705,
|
||
|
|
"epoch": 0.7513513513513513,
|
||
|
|
"grad_norm": 0.6953125,
|
||
|
|
"learning_rate": 0.0009951090037269227,
|
||
|
|
"loss": 6.41370849609375,
|
||
|
|
"mean_token_accuracy": 0.1299304783344269,
|
||
|
|
"num_tokens": 1674700.0,
|
||
|
|
"step": 695
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.48358678817749,
|
||
|
|
"epoch": 0.7567567567567568,
|
||
|
|
"grad_norm": 0.6171875,
|
||
|
|
"learning_rate": 0.0009948541294133814,
|
||
|
|
"loss": 6.419948577880859,
|
||
|
|
"mean_token_accuracy": 0.12766341418027877,
|
||
|
|
"num_tokens": 1686904.0,
|
||
|
|
"step": 700
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.349936676025391,
|
||
|
|
"epoch": 0.7621621621621621,
|
||
|
|
"grad_norm": 0.82421875,
|
||
|
|
"learning_rate": 0.0009945928199783045,
|
||
|
|
"loss": 6.360983276367188,
|
||
|
|
"mean_token_accuracy": 0.12935958206653594,
|
||
|
|
"num_tokens": 1697405.0,
|
||
|
|
"step": 705
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.458889198303223,
|
||
|
|
"epoch": 0.7675675675675676,
|
||
|
|
"grad_norm": 0.75390625,
|
||
|
|
"learning_rate": 0.000994325079201713,
|
||
|
|
"loss": 6.436622619628906,
|
||
|
|
"mean_token_accuracy": 0.1231964647769928,
|
||
|
|
"num_tokens": 1710080.0,
|
||
|
|
"step": 710
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.387947845458984,
|
||
|
|
"epoch": 0.772972972972973,
|
||
|
|
"grad_norm": 0.72265625,
|
||
|
|
"learning_rate": 0.000994050910956662,
|
||
|
|
"loss": 6.422445678710938,
|
||
|
|
"mean_token_accuracy": 0.12537443786859512,
|
||
|
|
"num_tokens": 1720806.0,
|
||
|
|
"step": 715
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.53485517501831,
|
||
|
|
"epoch": 0.7783783783783784,
|
||
|
|
"grad_norm": 0.89453125,
|
||
|
|
"learning_rate": 0.0009937703192091838,
|
||
|
|
"loss": 6.561003112792969,
|
||
|
|
"mean_token_accuracy": 0.12541060745716096,
|
||
|
|
"num_tokens": 1733954.0,
|
||
|
|
"step": 720
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.565542984008789,
|
||
|
|
"epoch": 0.7837837837837838,
|
||
|
|
"grad_norm": 0.98046875,
|
||
|
|
"learning_rate": 0.0009934833080182312,
|
||
|
|
"loss": 6.664936828613281,
|
||
|
|
"mean_token_accuracy": 0.11592512726783752,
|
||
|
|
"num_tokens": 1750530.0,
|
||
|
|
"step": 725
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.544071006774902,
|
||
|
|
"epoch": 0.7891891891891892,
|
||
|
|
"grad_norm": 0.75390625,
|
||
|
|
"learning_rate": 0.0009931898815356195,
|
||
|
|
"loss": 6.30921516418457,
|
||
|
|
"mean_token_accuracy": 0.13176991939544677,
|
||
|
|
"num_tokens": 1761753.0,
|
||
|
|
"step": 730
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.328976345062256,
|
||
|
|
"epoch": 0.7945945945945946,
|
||
|
|
"grad_norm": 0.7578125,
|
||
|
|
"learning_rate": 0.0009928900440059642,
|
||
|
|
"loss": 6.360004425048828,
|
||
|
|
"mean_token_accuracy": 0.1312493145465851,
|
||
|
|
"num_tokens": 1774628.0,
|
||
|
|
"step": 735
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.464595794677734,
|
||
|
|
"epoch": 0.8,
|
||
|
|
"grad_norm": 0.796875,
|
||
|
|
"learning_rate": 0.0009925837997666225,
|
||
|
|
"loss": 6.57813720703125,
|
||
|
|
"mean_token_accuracy": 0.11741591542959214,
|
||
|
|
"num_tokens": 1788735.0,
|
||
|
|
"step": 740
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.5051695823669435,
|
||
|
|
"epoch": 0.8054054054054054,
|
||
|
|
"grad_norm": 0.70703125,
|
||
|
|
"learning_rate": 0.000992271153247628,
|
||
|
|
"loss": 6.288795471191406,
|
||
|
|
"mean_token_accuracy": 0.12631202042102813,
|
||
|
|
"num_tokens": 1800014.0,
|
||
|
|
"step": 745
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.274956226348877,
|
||
|
|
"epoch": 0.8108108108108109,
|
||
|
|
"grad_norm": 0.69921875,
|
||
|
|
"learning_rate": 0.000991952108971628,
|
||
|
|
"loss": 6.370751953125,
|
||
|
|
"mean_token_accuracy": 0.12875936627388002,
|
||
|
|
"num_tokens": 1813103.0,
|
||
|
|
"step": 750
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.399552536010742,
|
||
|
|
"epoch": 0.8162162162162162,
|
||
|
|
"grad_norm": 0.65234375,
|
||
|
|
"learning_rate": 0.000991626671553818,
|
||
|
|
"loss": 6.457389831542969,
|
||
|
|
"mean_token_accuracy": 0.12979597598314285,
|
||
|
|
"num_tokens": 1826686.0,
|
||
|
|
"step": 755
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.470718097686768,
|
||
|
|
"epoch": 0.8216216216216217,
|
||
|
|
"grad_norm": 0.68359375,
|
||
|
|
"learning_rate": 0.0009912948457018744,
|
||
|
|
"loss": 6.337436676025391,
|
||
|
|
"mean_token_accuracy": 0.13230464309453965,
|
||
|
|
"num_tokens": 1836998.0,
|
||
|
|
"step": 760
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.344214057922363,
|
||
|
|
"epoch": 0.827027027027027,
|
||
|
|
"grad_norm": 0.79296875,
|
||
|
|
"learning_rate": 0.000990956636215887,
|
||
|
|
"loss": 6.333858489990234,
|
||
|
|
"mean_token_accuracy": 0.1353505551815033,
|
||
|
|
"num_tokens": 1847374.0,
|
||
|
|
"step": 765
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.359791374206543,
|
||
|
|
"epoch": 0.8324324324324325,
|
||
|
|
"grad_norm": 0.69140625,
|
||
|
|
"learning_rate": 0.0009906120479882886,
|
||
|
|
"loss": 6.3227790832519535,
|
||
|
|
"mean_token_accuracy": 0.1333004355430603,
|
||
|
|
"num_tokens": 1858150.0,
|
||
|
|
"step": 770
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.303346157073975,
|
||
|
|
"epoch": 0.8378378378378378,
|
||
|
|
"grad_norm": 0.70703125,
|
||
|
|
"learning_rate": 0.0009902610860037858,
|
||
|
|
"loss": 6.3098808288574215,
|
||
|
|
"mean_token_accuracy": 0.13155746459960938,
|
||
|
|
"num_tokens": 1869918.0,
|
||
|
|
"step": 775
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.387551975250244,
|
||
|
|
"epoch": 0.8432432432432433,
|
||
|
|
"grad_norm": 0.72265625,
|
||
|
|
"learning_rate": 0.0009899037553392854,
|
||
|
|
"loss": 6.361277389526367,
|
||
|
|
"mean_token_accuracy": 0.1288209542632103,
|
||
|
|
"num_tokens": 1881370.0,
|
||
|
|
"step": 780
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.42662878036499,
|
||
|
|
"epoch": 0.8486486486486486,
|
||
|
|
"grad_norm": 0.75,
|
||
|
|
"learning_rate": 0.0009895400611638217,
|
||
|
|
"loss": 6.373783874511719,
|
||
|
|
"mean_token_accuracy": 0.13027686178684234,
|
||
|
|
"num_tokens": 1894290.0,
|
||
|
|
"step": 785
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.364730930328369,
|
||
|
|
"epoch": 0.8540540540540541,
|
||
|
|
"grad_norm": 0.62109375,
|
||
|
|
"learning_rate": 0.0009891700087384817,
|
||
|
|
"loss": 6.312982177734375,
|
||
|
|
"mean_token_accuracy": 0.12889572829008103,
|
||
|
|
"num_tokens": 1906844.0,
|
||
|
|
"step": 790
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.3491747856140135,
|
||
|
|
"epoch": 0.8594594594594595,
|
||
|
|
"grad_norm": 0.6640625,
|
||
|
|
"learning_rate": 0.0009887936034163286,
|
||
|
|
"loss": 6.410205078125,
|
||
|
|
"mean_token_accuracy": 0.13014759868383408,
|
||
|
|
"num_tokens": 1920582.0,
|
||
|
|
"step": 795
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.388109493255615,
|
||
|
|
"epoch": 0.8648648648648649,
|
||
|
|
"grad_norm": 0.6953125,
|
||
|
|
"learning_rate": 0.000988410850642325,
|
||
|
|
"loss": 6.3361869812011715,
|
||
|
|
"mean_token_accuracy": 0.1333713099360466,
|
||
|
|
"num_tokens": 1933269.0,
|
||
|
|
"step": 800
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.265689182281494,
|
||
|
|
"epoch": 0.8702702702702703,
|
||
|
|
"grad_norm": 0.76171875,
|
||
|
|
"learning_rate": 0.000988021755953253,
|
||
|
|
"loss": 6.249768447875977,
|
||
|
|
"mean_token_accuracy": 0.1422581344842911,
|
||
|
|
"num_tokens": 1944152.0,
|
||
|
|
"step": 805
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.4430389404296875,
|
||
|
|
"epoch": 0.8756756756756757,
|
||
|
|
"grad_norm": 0.76953125,
|
||
|
|
"learning_rate": 0.000987626324977636,
|
||
|
|
"loss": 6.367038726806641,
|
||
|
|
"mean_token_accuracy": 0.13419689387083053,
|
||
|
|
"num_tokens": 1955710.0,
|
||
|
|
"step": 810
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.3380763053894045,
|
||
|
|
"epoch": 0.8810810810810811,
|
||
|
|
"grad_norm": 0.7265625,
|
||
|
|
"learning_rate": 0.0009872245634356554,
|
||
|
|
"loss": 6.311883544921875,
|
||
|
|
"mean_token_accuracy": 0.1359546884894371,
|
||
|
|
"num_tokens": 1967113.0,
|
||
|
|
"step": 815
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.3658100128173825,
|
||
|
|
"epoch": 0.8864864864864865,
|
||
|
|
"grad_norm": 0.6875,
|
||
|
|
"learning_rate": 0.0009868164771390687,
|
||
|
|
"loss": 6.33122444152832,
|
||
|
|
"mean_token_accuracy": 0.13497747331857682,
|
||
|
|
"num_tokens": 1977560.0,
|
||
|
|
"step": 820
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.46645040512085,
|
||
|
|
"epoch": 0.8918918918918919,
|
||
|
|
"grad_norm": 0.66796875,
|
||
|
|
"learning_rate": 0.000986402071991125,
|
||
|
|
"loss": 6.378009414672851,
|
||
|
|
"mean_token_accuracy": 0.13366190791130067,
|
||
|
|
"num_tokens": 1989667.0,
|
||
|
|
"step": 825
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.378485488891601,
|
||
|
|
"epoch": 0.8972972972972973,
|
||
|
|
"grad_norm": 0.6640625,
|
||
|
|
"learning_rate": 0.0009859813539864811,
|
||
|
|
"loss": 6.45841064453125,
|
||
|
|
"mean_token_accuracy": 0.131469164788723,
|
||
|
|
"num_tokens": 2003856.0,
|
||
|
|
"step": 830
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.371240234375,
|
||
|
|
"epoch": 0.9027027027027027,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 0.0009855543292111124,
|
||
|
|
"loss": 6.337836074829101,
|
||
|
|
"mean_token_accuracy": 0.13160819709300994,
|
||
|
|
"num_tokens": 2016349.0,
|
||
|
|
"step": 835
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.509719371795654,
|
||
|
|
"epoch": 0.9081081081081082,
|
||
|
|
"grad_norm": 0.67578125,
|
||
|
|
"learning_rate": 0.0009851210038422265,
|
||
|
|
"loss": 6.411936950683594,
|
||
|
|
"mean_token_accuracy": 0.1332993596792221,
|
||
|
|
"num_tokens": 2028246.0,
|
||
|
|
"step": 840
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.258156967163086,
|
||
|
|
"epoch": 0.9135135135135135,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 0.0009846813841481736,
|
||
|
|
"loss": 6.273184204101563,
|
||
|
|
"mean_token_accuracy": 0.13781181275844573,
|
||
|
|
"num_tokens": 2040826.0,
|
||
|
|
"step": 845
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.449979686737061,
|
||
|
|
"epoch": 0.918918918918919,
|
||
|
|
"grad_norm": 0.765625,
|
||
|
|
"learning_rate": 0.0009842354764883557,
|
||
|
|
"loss": 6.402044677734375,
|
||
|
|
"mean_token_accuracy": 0.1293553426861763,
|
||
|
|
"num_tokens": 2056179.0,
|
||
|
|
"step": 850
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.307137584686279,
|
||
|
|
"epoch": 0.9243243243243243,
|
||
|
|
"grad_norm": 0.68359375,
|
||
|
|
"learning_rate": 0.000983783287313134,
|
||
|
|
"loss": 6.248806762695312,
|
||
|
|
"mean_token_accuracy": 0.13388172090053557,
|
||
|
|
"num_tokens": 2066742.0,
|
||
|
|
"step": 855
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.367336559295654,
|
||
|
|
"epoch": 0.9297297297297298,
|
||
|
|
"grad_norm": 0.66796875,
|
||
|
|
"learning_rate": 0.0009833248231637367,
|
||
|
|
"loss": 6.317116928100586,
|
||
|
|
"mean_token_accuracy": 0.13678575158119202,
|
||
|
|
"num_tokens": 2078785.0,
|
||
|
|
"step": 860
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.318039798736573,
|
||
|
|
"epoch": 0.9351351351351351,
|
||
|
|
"grad_norm": 0.6796875,
|
||
|
|
"learning_rate": 0.000982860090672164,
|
||
|
|
"loss": 6.280033111572266,
|
||
|
|
"mean_token_accuracy": 0.13033719807863237,
|
||
|
|
"num_tokens": 2090347.0,
|
||
|
|
"step": 865
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.305841064453125,
|
||
|
|
"epoch": 0.9405405405405406,
|
||
|
|
"grad_norm": 0.70703125,
|
||
|
|
"learning_rate": 0.000982389096561091,
|
||
|
|
"loss": 6.2948463439941404,
|
||
|
|
"mean_token_accuracy": 0.1338719367980957,
|
||
|
|
"num_tokens": 2101826.0,
|
||
|
|
"step": 870
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.360739135742188,
|
||
|
|
"epoch": 0.9459459459459459,
|
||
|
|
"grad_norm": 0.65625,
|
||
|
|
"learning_rate": 0.0009819118476437723,
|
||
|
|
"loss": 6.319264984130859,
|
||
|
|
"mean_token_accuracy": 0.13714499771595,
|
||
|
|
"num_tokens": 2114202.0,
|
||
|
|
"step": 875
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.401810359954834,
|
||
|
|
"epoch": 0.9513513513513514,
|
||
|
|
"grad_norm": 0.7421875,
|
||
|
|
"learning_rate": 0.0009814283508239425,
|
||
|
|
"loss": 6.290205764770508,
|
||
|
|
"mean_token_accuracy": 0.13513725101947785,
|
||
|
|
"num_tokens": 2126079.0,
|
||
|
|
"step": 880
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.2628508567810055,
|
||
|
|
"epoch": 0.9567567567567568,
|
||
|
|
"grad_norm": 0.640625,
|
||
|
|
"learning_rate": 0.0009809386130957163,
|
||
|
|
"loss": 6.299491119384766,
|
||
|
|
"mean_token_accuracy": 0.13721458315849305,
|
||
|
|
"num_tokens": 2137644.0,
|
||
|
|
"step": 885
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.1556120872497555,
|
||
|
|
"epoch": 0.9621621621621622,
|
||
|
|
"grad_norm": 0.62890625,
|
||
|
|
"learning_rate": 0.0009804426415434876,
|
||
|
|
"loss": 6.129010009765625,
|
||
|
|
"mean_token_accuracy": 0.1369076371192932,
|
||
|
|
"num_tokens": 2152630.0,
|
||
|
|
"step": 890
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.2799969673156735,
|
||
|
|
"epoch": 0.9675675675675676,
|
||
|
|
"grad_norm": 0.66796875,
|
||
|
|
"learning_rate": 0.0009799404433418262,
|
||
|
|
"loss": 6.228973388671875,
|
||
|
|
"mean_token_accuracy": 0.1327817440032959,
|
||
|
|
"num_tokens": 2163879.0,
|
||
|
|
"step": 895
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.331386756896973,
|
||
|
|
"epoch": 0.972972972972973,
|
||
|
|
"grad_norm": 0.6875,
|
||
|
|
"learning_rate": 0.0009794320257553754,
|
||
|
|
"loss": 6.3436279296875,
|
||
|
|
"mean_token_accuracy": 0.12582612037658691,
|
||
|
|
"num_tokens": 2176772.0,
|
||
|
|
"step": 900
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.305329990386963,
|
||
|
|
"epoch": 0.9783783783783784,
|
||
|
|
"grad_norm": 0.64453125,
|
||
|
|
"learning_rate": 0.0009789173961387459,
|
||
|
|
"loss": 6.2147876739501955,
|
||
|
|
"mean_token_accuracy": 0.13565244078636168,
|
||
|
|
"num_tokens": 2188697.0,
|
||
|
|
"step": 905
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.253271961212159,
|
||
|
|
"epoch": 0.9837837837837838,
|
||
|
|
"grad_norm": 0.70703125,
|
||
|
|
"learning_rate": 0.00097839656193641,
|
||
|
|
"loss": 6.213663482666016,
|
||
|
|
"mean_token_accuracy": 0.1317826598882675,
|
||
|
|
"num_tokens": 2201905.0,
|
||
|
|
"step": 910
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.174108409881592,
|
||
|
|
"epoch": 0.9891891891891892,
|
||
|
|
"grad_norm": 0.703125,
|
||
|
|
"learning_rate": 0.000977869530682593,
|
||
|
|
"loss": 6.149724960327148,
|
||
|
|
"mean_token_accuracy": 0.14030847251415252,
|
||
|
|
"num_tokens": 2211502.0,
|
||
|
|
"step": 915
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.269680404663086,
|
||
|
|
"epoch": 0.9945945945945946,
|
||
|
|
"grad_norm": 0.6796875,
|
||
|
|
"learning_rate": 0.0009773363100011655,
|
||
|
|
"loss": 6.259825134277344,
|
||
|
|
"mean_token_accuracy": 0.13248875439167024,
|
||
|
|
"num_tokens": 2223560.0,
|
||
|
|
"step": 920
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.303800010681153,
|
||
|
|
"epoch": 1.0,
|
||
|
|
"grad_norm": 1.3203125,
|
||
|
|
"learning_rate": 0.0009767969076055316,
|
||
|
|
"loss": 6.259091186523437,
|
||
|
|
"mean_token_accuracy": 0.1379597917199135,
|
||
|
|
"num_tokens": 2232668.0,
|
||
|
|
"step": 925
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.247701930999756,
|
||
|
|
"epoch": 1.0054054054054054,
|
||
|
|
"grad_norm": 0.73046875,
|
||
|
|
"learning_rate": 0.0009762513312985191,
|
||
|
|
"loss": 6.087086486816406,
|
||
|
|
"mean_token_accuracy": 0.14642732441425324,
|
||
|
|
"num_tokens": 2243410.0,
|
||
|
|
"step": 930
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.207428741455078,
|
||
|
|
"epoch": 1.0108108108108107,
|
||
|
|
"grad_norm": 0.671875,
|
||
|
|
"learning_rate": 0.0009756995889722652,
|
||
|
|
"loss": 6.115195083618164,
|
||
|
|
"mean_token_accuracy": 0.13871956765651702,
|
||
|
|
"num_tokens": 2255343.0,
|
||
|
|
"step": 935
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.0995192527771,
|
||
|
|
"epoch": 1.0162162162162163,
|
||
|
|
"grad_norm": 0.79296875,
|
||
|
|
"learning_rate": 0.0009751416886081027,
|
||
|
|
"loss": 6.043392181396484,
|
||
|
|
"mean_token_accuracy": 0.14625563025474547,
|
||
|
|
"num_tokens": 2267196.0,
|
||
|
|
"step": 940
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.204872989654541,
|
||
|
|
"epoch": 1.0216216216216216,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 0.0009745776382764448,
|
||
|
|
"loss": 6.183137130737305,
|
||
|
|
"mean_token_accuracy": 0.13658826649188996,
|
||
|
|
"num_tokens": 2278936.0,
|
||
|
|
"step": 945
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.228440189361573,
|
||
|
|
"epoch": 1.027027027027027,
|
||
|
|
"grad_norm": 0.671875,
|
||
|
|
"learning_rate": 0.0009740074461366686,
|
||
|
|
"loss": 6.062003326416016,
|
||
|
|
"mean_token_accuracy": 0.14350597262382508,
|
||
|
|
"num_tokens": 2289300.0,
|
||
|
|
"step": 950
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.182377719879151,
|
||
|
|
"epoch": 1.0324324324324325,
|
||
|
|
"grad_norm": 0.69921875,
|
||
|
|
"learning_rate": 0.0009734311204369957,
|
||
|
|
"loss": 6.08958740234375,
|
||
|
|
"mean_token_accuracy": 0.14562293589115144,
|
||
|
|
"num_tokens": 2301601.0,
|
||
|
|
"step": 955
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.017007541656494,
|
||
|
|
"epoch": 1.037837837837838,
|
||
|
|
"grad_norm": 0.66796875,
|
||
|
|
"learning_rate": 0.0009728486695143753,
|
||
|
|
"loss": 5.978137969970703,
|
||
|
|
"mean_token_accuracy": 0.14870022535324096,
|
||
|
|
"num_tokens": 2313130.0,
|
||
|
|
"step": 960
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.3585821151733395,
|
||
|
|
"epoch": 1.0432432432432432,
|
||
|
|
"grad_norm": 0.81640625,
|
||
|
|
"learning_rate": 0.0009722601017943607,
|
||
|
|
"loss": 6.260755920410157,
|
||
|
|
"mean_token_accuracy": 0.13717263340950012,
|
||
|
|
"num_tokens": 2326413.0,
|
||
|
|
"step": 965
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.145228576660156,
|
||
|
|
"epoch": 1.0486486486486486,
|
||
|
|
"grad_norm": 0.703125,
|
||
|
|
"learning_rate": 0.0009716654257909897,
|
||
|
|
"loss": 6.0943046569824215,
|
||
|
|
"mean_token_accuracy": 0.14415099322795868,
|
||
|
|
"num_tokens": 2337603.0,
|
||
|
|
"step": 970
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.234020233154297,
|
||
|
|
"epoch": 1.054054054054054,
|
||
|
|
"grad_norm": 0.69140625,
|
||
|
|
"learning_rate": 0.0009710646501066608,
|
||
|
|
"loss": 6.181568908691406,
|
||
|
|
"mean_token_accuracy": 0.13601263910531997,
|
||
|
|
"num_tokens": 2352321.0,
|
||
|
|
"step": 975
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.0668079376220705,
|
||
|
|
"epoch": 1.0594594594594595,
|
||
|
|
"grad_norm": 0.6953125,
|
||
|
|
"learning_rate": 0.0009704577834320078,
|
||
|
|
"loss": 6.049177932739258,
|
||
|
|
"mean_token_accuracy": 0.15185949206352234,
|
||
|
|
"num_tokens": 2363432.0,
|
||
|
|
"step": 980
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.228795528411865,
|
||
|
|
"epoch": 1.0648648648648649,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 0.0009698448345457758,
|
||
|
|
"loss": 6.067817687988281,
|
||
|
|
"mean_token_accuracy": 0.14404682517051698,
|
||
|
|
"num_tokens": 2374188.0,
|
||
|
|
"step": 985
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.257656669616699,
|
||
|
|
"epoch": 1.0702702702702702,
|
||
|
|
"grad_norm": 0.703125,
|
||
|
|
"learning_rate": 0.0009692258123146925,
|
||
|
|
"loss": 6.195977783203125,
|
||
|
|
"mean_token_accuracy": 0.13717207163572312,
|
||
|
|
"num_tokens": 2386344.0,
|
||
|
|
"step": 990
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.229287624359131,
|
||
|
|
"epoch": 1.0756756756756758,
|
||
|
|
"grad_norm": 0.703125,
|
||
|
|
"learning_rate": 0.0009686007256933414,
|
||
|
|
"loss": 6.20872802734375,
|
||
|
|
"mean_token_accuracy": 0.1379612296819687,
|
||
|
|
"num_tokens": 2399518.0,
|
||
|
|
"step": 995
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.284945487976074,
|
||
|
|
"epoch": 1.0810810810810811,
|
||
|
|
"grad_norm": 0.78515625,
|
||
|
|
"learning_rate": 0.0009679695837240308,
|
||
|
|
"loss": 6.145904541015625,
|
||
|
|
"mean_token_accuracy": 0.14310452789068223,
|
||
|
|
"num_tokens": 2413738.0,
|
||
|
|
"step": 1000
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.0414176940917965,
|
||
|
|
"epoch": 1.0864864864864865,
|
||
|
|
"grad_norm": 0.640625,
|
||
|
|
"learning_rate": 0.0009673323955366644,
|
||
|
|
"loss": 6.015713119506836,
|
||
|
|
"mean_token_accuracy": 0.15530002117156982,
|
||
|
|
"num_tokens": 2425088.0,
|
||
|
|
"step": 1005
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.0671515464782715,
|
||
|
|
"epoch": 1.0918918918918918,
|
||
|
|
"grad_norm": 0.69140625,
|
||
|
|
"learning_rate": 0.0009666891703486084,
|
||
|
|
"loss": 6.016201019287109,
|
||
|
|
"mean_token_accuracy": 0.15316692590713502,
|
||
|
|
"num_tokens": 2436387.0,
|
||
|
|
"step": 1010
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.2645776748657225,
|
||
|
|
"epoch": 1.0972972972972972,
|
||
|
|
"grad_norm": 0.78515625,
|
||
|
|
"learning_rate": 0.0009660399174645587,
|
||
|
|
"loss": 6.249516296386719,
|
||
|
|
"mean_token_accuracy": 0.13507454246282577,
|
||
|
|
"num_tokens": 2449444.0,
|
||
|
|
"step": 1015
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.284755802154541,
|
||
|
|
"epoch": 1.1027027027027028,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 0.0009653846462764052,
|
||
|
|
"loss": 6.1441200256347654,
|
||
|
|
"mean_token_accuracy": 0.1487019807100296,
|
||
|
|
"num_tokens": 2459267.0,
|
||
|
|
"step": 1020
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.996495628356934,
|
||
|
|
"epoch": 1.1081081081081081,
|
||
|
|
"grad_norm": 0.72265625,
|
||
|
|
"learning_rate": 0.0009647233662630976,
|
||
|
|
"loss": 5.918562316894532,
|
||
|
|
"mean_token_accuracy": 0.15527379214763642,
|
||
|
|
"num_tokens": 2470572.0,
|
||
|
|
"step": 1025
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.1040750503540036,
|
||
|
|
"epoch": 1.1135135135135135,
|
||
|
|
"grad_norm": 0.7421875,
|
||
|
|
"learning_rate": 0.0009640560869905065,
|
||
|
|
"loss": 6.092966461181641,
|
||
|
|
"mean_token_accuracy": 0.14268437027931213,
|
||
|
|
"num_tokens": 2483293.0,
|
||
|
|
"step": 1030
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.213329792022705,
|
||
|
|
"epoch": 1.118918918918919,
|
||
|
|
"grad_norm": 0.78125,
|
||
|
|
"learning_rate": 0.0009633828181112869,
|
||
|
|
"loss": 6.065708923339844,
|
||
|
|
"mean_token_accuracy": 0.14911548793315887,
|
||
|
|
"num_tokens": 2493995.0,
|
||
|
|
"step": 1035
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.045756530761719,
|
||
|
|
"epoch": 1.1243243243243244,
|
||
|
|
"grad_norm": 0.640625,
|
||
|
|
"learning_rate": 0.0009627035693647369,
|
||
|
|
"loss": 5.956703948974609,
|
||
|
|
"mean_token_accuracy": 0.14724287688732146,
|
||
|
|
"num_tokens": 2505280.0,
|
||
|
|
"step": 1040
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.993116950988769,
|
||
|
|
"epoch": 1.1297297297297297,
|
||
|
|
"grad_norm": 0.77734375,
|
||
|
|
"learning_rate": 0.0009620183505766577,
|
||
|
|
"loss": 5.9770042419433596,
|
||
|
|
"mean_token_accuracy": 0.1574521005153656,
|
||
|
|
"num_tokens": 2515680.0,
|
||
|
|
"step": 1045
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.090410614013672,
|
||
|
|
"epoch": 1.135135135135135,
|
||
|
|
"grad_norm": 0.66015625,
|
||
|
|
"learning_rate": 0.0009613271716592113,
|
||
|
|
"loss": 5.974724960327149,
|
||
|
|
"mean_token_accuracy": 0.14773423373699188,
|
||
|
|
"num_tokens": 2529369.0,
|
||
|
|
"step": 1050
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.2742572784423825,
|
||
|
|
"epoch": 1.1405405405405404,
|
||
|
|
"grad_norm": 0.69140625,
|
||
|
|
"learning_rate": 0.0009606300426107767,
|
||
|
|
"loss": 6.279899978637696,
|
||
|
|
"mean_token_accuracy": 0.1332086905837059,
|
||
|
|
"num_tokens": 2543710.0,
|
||
|
|
"step": 1055
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.154977416992187,
|
||
|
|
"epoch": 1.145945945945946,
|
||
|
|
"grad_norm": 0.75,
|
||
|
|
"learning_rate": 0.0009599269735158066,
|
||
|
|
"loss": 6.070030975341797,
|
||
|
|
"mean_token_accuracy": 0.14480855464935302,
|
||
|
|
"num_tokens": 2553868.0,
|
||
|
|
"step": 1060
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.078575897216797,
|
||
|
|
"epoch": 1.1513513513513514,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 0.0009592179745446796,
|
||
|
|
"loss": 6.052325820922851,
|
||
|
|
"mean_token_accuracy": 0.14226650595664977,
|
||
|
|
"num_tokens": 2565425.0,
|
||
|
|
"step": 1065
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.081030464172363,
|
||
|
|
"epoch": 1.1567567567567567,
|
||
|
|
"grad_norm": 0.74609375,
|
||
|
|
"learning_rate": 0.0009585030559535544,
|
||
|
|
"loss": 6.073527908325195,
|
||
|
|
"mean_token_accuracy": 0.14177987575531006,
|
||
|
|
"num_tokens": 2576760.0,
|
||
|
|
"step": 1070
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.185351181030273,
|
||
|
|
"epoch": 1.1621621621621623,
|
||
|
|
"grad_norm": 0.69921875,
|
||
|
|
"learning_rate": 0.0009577822280842209,
|
||
|
|
"loss": 6.132835006713867,
|
||
|
|
"mean_token_accuracy": 0.13952185213565826,
|
||
|
|
"num_tokens": 2588651.0,
|
||
|
|
"step": 1075
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.20592851638794,
|
||
|
|
"epoch": 1.1675675675675676,
|
||
|
|
"grad_norm": 0.72265625,
|
||
|
|
"learning_rate": 0.0009570555013639513,
|
||
|
|
"loss": 6.126637649536133,
|
||
|
|
"mean_token_accuracy": 0.1417229115962982,
|
||
|
|
"num_tokens": 2600091.0,
|
||
|
|
"step": 1080
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.086951541900635,
|
||
|
|
"epoch": 1.172972972972973,
|
||
|
|
"grad_norm": 0.63671875,
|
||
|
|
"learning_rate": 0.0009563228863053482,
|
||
|
|
"loss": 6.079809188842773,
|
||
|
|
"mean_token_accuracy": 0.14229417145252227,
|
||
|
|
"num_tokens": 2611593.0,
|
||
|
|
"step": 1085
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.1936968803405765,
|
||
|
|
"epoch": 1.1783783783783783,
|
||
|
|
"grad_norm": 0.6796875,
|
||
|
|
"learning_rate": 0.0009555843935061934,
|
||
|
|
"loss": 6.050133895874024,
|
||
|
|
"mean_token_accuracy": 0.14194661676883696,
|
||
|
|
"num_tokens": 2623384.0,
|
||
|
|
"step": 1090
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.037506484985352,
|
||
|
|
"epoch": 1.1837837837837837,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 0.0009548400336492942,
|
||
|
|
"loss": 5.9737495422363285,
|
||
|
|
"mean_token_accuracy": 0.1466424971818924,
|
||
|
|
"num_tokens": 2635961.0,
|
||
|
|
"step": 1095
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.06157283782959,
|
||
|
|
"epoch": 1.1891891891891893,
|
||
|
|
"grad_norm": 0.75390625,
|
||
|
|
"learning_rate": 0.0009540898175023286,
|
||
|
|
"loss": 6.021556091308594,
|
||
|
|
"mean_token_accuracy": 0.15520934760570526,
|
||
|
|
"num_tokens": 2646889.0,
|
||
|
|
"step": 1100
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.003177833557129,
|
||
|
|
"epoch": 1.1945945945945946,
|
||
|
|
"grad_norm": 0.75390625,
|
||
|
|
"learning_rate": 0.0009533337559176903,
|
||
|
|
"loss": 6.065186309814453,
|
||
|
|
"mean_token_accuracy": 0.13881587386131286,
|
||
|
|
"num_tokens": 2660063.0,
|
||
|
|
"step": 1105
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.294288063049317,
|
||
|
|
"epoch": 1.2,
|
||
|
|
"grad_norm": 0.69921875,
|
||
|
|
"learning_rate": 0.0009525718598323313,
|
||
|
|
"loss": 6.224353790283203,
|
||
|
|
"mean_token_accuracy": 0.13939207047224045,
|
||
|
|
"num_tokens": 2674361.0,
|
||
|
|
"step": 1110
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.20927619934082,
|
||
|
|
"epoch": 1.2054054054054055,
|
||
|
|
"grad_norm": 0.63671875,
|
||
|
|
"learning_rate": 0.0009518041402676032,
|
||
|
|
"loss": 6.128507232666015,
|
||
|
|
"mean_token_accuracy": 0.14430801272392274,
|
||
|
|
"num_tokens": 2688747.0,
|
||
|
|
"step": 1115
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.078750324249268,
|
||
|
|
"epoch": 1.2108108108108109,
|
||
|
|
"grad_norm": 0.68359375,
|
||
|
|
"learning_rate": 0.0009510306083290989,
|
||
|
|
"loss": 6.023811721801758,
|
||
|
|
"mean_token_accuracy": 0.15408262610435486,
|
||
|
|
"num_tokens": 2701891.0,
|
||
|
|
"step": 1120
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.116716098785401,
|
||
|
|
"epoch": 1.2162162162162162,
|
||
|
|
"grad_norm": 0.75390625,
|
||
|
|
"learning_rate": 0.0009502512752064905,
|
||
|
|
"loss": 5.992145538330078,
|
||
|
|
"mean_token_accuracy": 0.15401490926742553,
|
||
|
|
"num_tokens": 2712109.0,
|
||
|
|
"step": 1125
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.041183280944824,
|
||
|
|
"epoch": 1.2216216216216216,
|
||
|
|
"grad_norm": 0.671875,
|
||
|
|
"learning_rate": 0.000949466152173369,
|
||
|
|
"loss": 6.071275329589843,
|
||
|
|
"mean_token_accuracy": 0.14654400646686555,
|
||
|
|
"num_tokens": 2724513.0,
|
||
|
|
"step": 1130
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.136420631408692,
|
||
|
|
"epoch": 1.227027027027027,
|
||
|
|
"grad_norm": 0.765625,
|
||
|
|
"learning_rate": 0.00094867525058708,
|
||
|
|
"loss": 5.991522216796875,
|
||
|
|
"mean_token_accuracy": 0.14021825045347214,
|
||
|
|
"num_tokens": 2737604.0,
|
||
|
|
"step": 1135
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.287702178955078,
|
||
|
|
"epoch": 1.2324324324324325,
|
||
|
|
"grad_norm": 0.671875,
|
||
|
|
"learning_rate": 0.0009478785818885598,
|
||
|
|
"loss": 6.168487548828125,
|
||
|
|
"mean_token_accuracy": 0.13972904682159423,
|
||
|
|
"num_tokens": 2751565.0,
|
||
|
|
"step": 1140
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.92498140335083,
|
||
|
|
"epoch": 1.2378378378378379,
|
||
|
|
"grad_norm": 0.6875,
|
||
|
|
"learning_rate": 0.0009470761576021706,
|
||
|
|
"loss": 5.838254165649414,
|
||
|
|
"mean_token_accuracy": 0.15651266872882844,
|
||
|
|
"num_tokens": 2762235.0,
|
||
|
|
"step": 1145
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.060224533081055,
|
||
|
|
"epoch": 1.2432432432432432,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 0.0009462679893355321,
|
||
|
|
"loss": 6.060661315917969,
|
||
|
|
"mean_token_accuracy": 0.1462487429380417,
|
||
|
|
"num_tokens": 2772591.0,
|
||
|
|
"step": 1150
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.158456802368164,
|
||
|
|
"epoch": 1.2486486486486488,
|
||
|
|
"grad_norm": 0.6640625,
|
||
|
|
"learning_rate": 0.0009454540887793556,
|
||
|
|
"loss": 6.068745040893555,
|
||
|
|
"mean_token_accuracy": 0.1397398978471756,
|
||
|
|
"num_tokens": 2785571.0,
|
||
|
|
"step": 1155
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.2046942710876465,
|
||
|
|
"epoch": 1.2540540540540541,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.0009446344677072734,
|
||
|
|
"loss": 6.084649276733399,
|
||
|
|
"mean_token_accuracy": 0.14705458134412766,
|
||
|
|
"num_tokens": 2798032.0,
|
||
|
|
"step": 1160
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.980342102050781,
|
||
|
|
"epoch": 1.2594594594594595,
|
||
|
|
"grad_norm": 0.67578125,
|
||
|
|
"learning_rate": 0.000943809137975669,
|
||
|
|
"loss": 6.034884262084961,
|
||
|
|
"mean_token_accuracy": 0.14847399592399596,
|
||
|
|
"num_tokens": 2809343.0,
|
||
|
|
"step": 1165
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.089838027954102,
|
||
|
|
"epoch": 1.2648648648648648,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 0.0009429781115235055,
|
||
|
|
"loss": 6.001376724243164,
|
||
|
|
"mean_token_accuracy": 0.14895476996898652,
|
||
|
|
"num_tokens": 2821044.0,
|
||
|
|
"step": 1170
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.078525733947754,
|
||
|
|
"epoch": 1.2702702702702702,
|
||
|
|
"grad_norm": 0.70703125,
|
||
|
|
"learning_rate": 0.0009421414003721539,
|
||
|
|
"loss": 6.015114593505859,
|
||
|
|
"mean_token_accuracy": 0.14688166081905366,
|
||
|
|
"num_tokens": 2834153.0,
|
||
|
|
"step": 1175
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.140860080718994,
|
||
|
|
"epoch": 1.2756756756756757,
|
||
|
|
"grad_norm": 0.625,
|
||
|
|
"learning_rate": 0.000941299016625217,
|
||
|
|
"loss": 6.013716506958008,
|
||
|
|
"mean_token_accuracy": 0.14849595725536346,
|
||
|
|
"num_tokens": 2847161.0,
|
||
|
|
"step": 1180
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.947665119171143,
|
||
|
|
"epoch": 1.281081081081081,
|
||
|
|
"grad_norm": 0.765625,
|
||
|
|
"learning_rate": 0.0009404509724683563,
|
||
|
|
"loss": 5.943680191040039,
|
||
|
|
"mean_token_accuracy": 0.15365355908870698,
|
||
|
|
"num_tokens": 2858541.0,
|
||
|
|
"step": 1185
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.064198017120361,
|
||
|
|
"epoch": 1.2864864864864864,
|
||
|
|
"grad_norm": 0.66796875,
|
||
|
|
"learning_rate": 0.000939597280169115,
|
||
|
|
"loss": 5.915108108520508,
|
||
|
|
"mean_token_accuracy": 0.154515340924263,
|
||
|
|
"num_tokens": 2870189.0,
|
||
|
|
"step": 1190
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.083068084716797,
|
||
|
|
"epoch": 1.291891891891892,
|
||
|
|
"grad_norm": 0.8046875,
|
||
|
|
"learning_rate": 0.0009387379520767407,
|
||
|
|
"loss": 6.106951904296875,
|
||
|
|
"mean_token_accuracy": 0.14755382090806962,
|
||
|
|
"num_tokens": 2880881.0,
|
||
|
|
"step": 1195
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.084651756286621,
|
||
|
|
"epoch": 1.2972972972972974,
|
||
|
|
"grad_norm": 0.69140625,
|
||
|
|
"learning_rate": 0.0009378730006220061,
|
||
|
|
"loss": 6.083970642089843,
|
||
|
|
"mean_token_accuracy": 0.14543737471103668,
|
||
|
|
"num_tokens": 2892522.0,
|
||
|
|
"step": 1200
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.053504943847656,
|
||
|
|
"epoch": 1.3027027027027027,
|
||
|
|
"grad_norm": 0.703125,
|
||
|
|
"learning_rate": 0.0009370024383170302,
|
||
|
|
"loss": 5.892122268676758,
|
||
|
|
"mean_token_accuracy": 0.1534324437379837,
|
||
|
|
"num_tokens": 2903595.0,
|
||
|
|
"step": 1205
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.086377429962158,
|
||
|
|
"epoch": 1.308108108108108,
|
||
|
|
"grad_norm": 0.63671875,
|
||
|
|
"learning_rate": 0.0009361262777550965,
|
||
|
|
"loss": 5.976514434814453,
|
||
|
|
"mean_token_accuracy": 0.1496379107236862,
|
||
|
|
"num_tokens": 2915905.0,
|
||
|
|
"step": 1210
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.984688854217529,
|
||
|
|
"epoch": 1.3135135135135134,
|
||
|
|
"grad_norm": 0.66796875,
|
||
|
|
"learning_rate": 0.0009352445316104715,
|
||
|
|
"loss": 5.929489517211914,
|
||
|
|
"mean_token_accuracy": 0.14890652298927307,
|
||
|
|
"num_tokens": 2926854.0,
|
||
|
|
"step": 1215
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.982455253601074,
|
||
|
|
"epoch": 1.318918918918919,
|
||
|
|
"grad_norm": 0.7265625,
|
||
|
|
"learning_rate": 0.0009343572126382208,
|
||
|
|
"loss": 5.958092498779297,
|
||
|
|
"mean_token_accuracy": 0.15311627686023713,
|
||
|
|
"num_tokens": 2938909.0,
|
||
|
|
"step": 1220
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.001386737823486,
|
||
|
|
"epoch": 1.3243243243243243,
|
||
|
|
"grad_norm": 0.78515625,
|
||
|
|
"learning_rate": 0.0009334643336740246,
|
||
|
|
"loss": 5.921345138549805,
|
||
|
|
"mean_token_accuracy": 0.15853023231029512,
|
||
|
|
"num_tokens": 2949958.0,
|
||
|
|
"step": 1225
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.019908905029297,
|
||
|
|
"epoch": 1.3297297297297297,
|
||
|
|
"grad_norm": 0.77734375,
|
||
|
|
"learning_rate": 0.0009325659076339924,
|
||
|
|
"loss": 5.926969146728515,
|
||
|
|
"mean_token_accuracy": 0.15277785956859588,
|
||
|
|
"num_tokens": 2961449.0,
|
||
|
|
"step": 1230
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.998956966400146,
|
||
|
|
"epoch": 1.3351351351351353,
|
||
|
|
"grad_norm": 0.8203125,
|
||
|
|
"learning_rate": 0.0009316619475144765,
|
||
|
|
"loss": 5.983316802978516,
|
||
|
|
"mean_token_accuracy": 0.14754572212696077,
|
||
|
|
"num_tokens": 2974496.0,
|
||
|
|
"step": 1235
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.157251834869385,
|
||
|
|
"epoch": 1.3405405405405406,
|
||
|
|
"grad_norm": 0.7578125,
|
||
|
|
"learning_rate": 0.0009307524663918821,
|
||
|
|
"loss": 6.08265266418457,
|
||
|
|
"mean_token_accuracy": 0.15290809273719788,
|
||
|
|
"num_tokens": 2986081.0,
|
||
|
|
"step": 1240
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.076891040802002,
|
||
|
|
"epoch": 1.345945945945946,
|
||
|
|
"grad_norm": 0.6953125,
|
||
|
|
"learning_rate": 0.0009298374774224812,
|
||
|
|
"loss": 6.0138916015625,
|
||
|
|
"mean_token_accuracy": 0.14638799875974656,
|
||
|
|
"num_tokens": 2999890.0,
|
||
|
|
"step": 1245
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.036985301971436,
|
||
|
|
"epoch": 1.3513513513513513,
|
||
|
|
"grad_norm": 0.6640625,
|
||
|
|
"learning_rate": 0.0009289169938422191,
|
||
|
|
"loss": 6.011819458007812,
|
||
|
|
"mean_token_accuracy": 0.15665827989578246,
|
||
|
|
"num_tokens": 3012281.0,
|
||
|
|
"step": 1250
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.172758865356445,
|
||
|
|
"epoch": 1.3567567567567567,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 0.0009279910289665257,
|
||
|
|
"loss": 6.069019317626953,
|
||
|
|
"mean_token_accuracy": 0.14247923642396926,
|
||
|
|
"num_tokens": 3026908.0,
|
||
|
|
"step": 1255
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.033104515075683,
|
||
|
|
"epoch": 1.3621621621621622,
|
||
|
|
"grad_norm": 0.7421875,
|
||
|
|
"learning_rate": 0.0009270595961901204,
|
||
|
|
"loss": 6.013312149047851,
|
||
|
|
"mean_token_accuracy": 0.14915238618850707,
|
||
|
|
"num_tokens": 3038661.0,
|
||
|
|
"step": 1260
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.106722354888916,
|
||
|
|
"epoch": 1.3675675675675676,
|
||
|
|
"grad_norm": 0.9609375,
|
||
|
|
"learning_rate": 0.0009261227089868208,
|
||
|
|
"loss": 6.046922302246093,
|
||
|
|
"mean_token_accuracy": 0.14422987550497054,
|
||
|
|
"num_tokens": 3051641.0,
|
||
|
|
"step": 1265
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.110820388793945,
|
||
|
|
"epoch": 1.372972972972973,
|
||
|
|
"grad_norm": 0.72265625,
|
||
|
|
"learning_rate": 0.0009251803809093456,
|
||
|
|
"loss": 6.0467266082763675,
|
||
|
|
"mean_token_accuracy": 0.14307568371295928,
|
||
|
|
"num_tokens": 3063708.0,
|
||
|
|
"step": 1270
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.060265445709229,
|
||
|
|
"epoch": 1.3783783783783785,
|
||
|
|
"grad_norm": 0.6953125,
|
||
|
|
"learning_rate": 0.0009242326255891196,
|
||
|
|
"loss": 5.93769416809082,
|
||
|
|
"mean_token_accuracy": 0.14946352541446686,
|
||
|
|
"num_tokens": 3075694.0,
|
||
|
|
"step": 1275
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.956900119781494,
|
||
|
|
"epoch": 1.3837837837837839,
|
||
|
|
"grad_norm": 0.7734375,
|
||
|
|
"learning_rate": 0.000923279456736077,
|
||
|
|
"loss": 5.892474365234375,
|
||
|
|
"mean_token_accuracy": 0.1602933645248413,
|
||
|
|
"num_tokens": 3087935.0,
|
||
|
|
"step": 1280
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.032831764221191,
|
||
|
|
"epoch": 1.3891891891891892,
|
||
|
|
"grad_norm": 0.81640625,
|
||
|
|
"learning_rate": 0.0009223208881384619,
|
||
|
|
"loss": 5.958731079101563,
|
||
|
|
"mean_token_accuracy": 0.15782309770584108,
|
||
|
|
"num_tokens": 3098628.0,
|
||
|
|
"step": 1285
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.116084194183349,
|
||
|
|
"epoch": 1.3945945945945946,
|
||
|
|
"grad_norm": 0.73046875,
|
||
|
|
"learning_rate": 0.0009213569336626297,
|
||
|
|
"loss": 6.204639053344726,
|
||
|
|
"mean_token_accuracy": 0.13710222840309144,
|
||
|
|
"num_tokens": 3114430.0,
|
||
|
|
"step": 1290
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.175200080871582,
|
||
|
|
"epoch": 1.4,
|
||
|
|
"grad_norm": 0.671875,
|
||
|
|
"learning_rate": 0.000920387607252846,
|
||
|
|
"loss": 5.931164169311524,
|
||
|
|
"mean_token_accuracy": 0.15236457586288452,
|
||
|
|
"num_tokens": 3125350.0,
|
||
|
|
"step": 1295
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.96003999710083,
|
||
|
|
"epoch": 1.4054054054054055,
|
||
|
|
"grad_norm": 0.69140625,
|
||
|
|
"learning_rate": 0.0009194129229310854,
|
||
|
|
"loss": 5.927279663085938,
|
||
|
|
"mean_token_accuracy": 0.1596504420042038,
|
||
|
|
"num_tokens": 3137610.0,
|
||
|
|
"step": 1300
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.922585964202881,
|
||
|
|
"epoch": 1.4108108108108108,
|
||
|
|
"grad_norm": 0.73046875,
|
||
|
|
"learning_rate": 0.0009184328947968285,
|
||
|
|
"loss": 5.873512649536133,
|
||
|
|
"mean_token_accuracy": 0.153224441409111,
|
||
|
|
"num_tokens": 3149054.0,
|
||
|
|
"step": 1305
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.9644293785095215,
|
||
|
|
"epoch": 1.4162162162162162,
|
||
|
|
"grad_norm": 0.69921875,
|
||
|
|
"learning_rate": 0.0009174475370268572,
|
||
|
|
"loss": 5.9443611145019535,
|
||
|
|
"mean_token_accuracy": 0.15277822315692902,
|
||
|
|
"num_tokens": 3160844.0,
|
||
|
|
"step": 1310
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.004944229125977,
|
||
|
|
"epoch": 1.4216216216216218,
|
||
|
|
"grad_norm": 0.89453125,
|
||
|
|
"learning_rate": 0.000916456863875051,
|
||
|
|
"loss": 5.871533966064453,
|
||
|
|
"mean_token_accuracy": 0.15332863628864288,
|
||
|
|
"num_tokens": 3172182.0,
|
||
|
|
"step": 1315
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.265860366821289,
|
||
|
|
"epoch": 1.427027027027027,
|
||
|
|
"grad_norm": 0.953125,
|
||
|
|
"learning_rate": 0.0009154608896721795,
|
||
|
|
"loss": 6.235766220092773,
|
||
|
|
"mean_token_accuracy": 0.14209017157554626,
|
||
|
|
"num_tokens": 3182459.0,
|
||
|
|
"step": 1320
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.066355514526367,
|
||
|
|
"epoch": 1.4324324324324325,
|
||
|
|
"grad_norm": 0.68359375,
|
||
|
|
"learning_rate": 0.0009144596288256961,
|
||
|
|
"loss": 5.998751831054688,
|
||
|
|
"mean_token_accuracy": 0.14995864033699036,
|
||
|
|
"num_tokens": 3193880.0,
|
||
|
|
"step": 1325
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.960510921478272,
|
||
|
|
"epoch": 1.4378378378378378,
|
||
|
|
"grad_norm": 0.859375,
|
||
|
|
"learning_rate": 0.0009134530958195287,
|
||
|
|
"loss": 6.005829620361328,
|
||
|
|
"mean_token_accuracy": 0.15055490285158157,
|
||
|
|
"num_tokens": 3206829.0,
|
||
|
|
"step": 1330
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.1994706153869625,
|
||
|
|
"epoch": 1.4432432432432432,
|
||
|
|
"grad_norm": 0.65234375,
|
||
|
|
"learning_rate": 0.0009124413052138709,
|
||
|
|
"loss": 6.004475784301758,
|
||
|
|
"mean_token_accuracy": 0.1500842273235321,
|
||
|
|
"num_tokens": 3218278.0,
|
||
|
|
"step": 1335
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.905928325653076,
|
||
|
|
"epoch": 1.4486486486486487,
|
||
|
|
"grad_norm": 0.8203125,
|
||
|
|
"learning_rate": 0.000911424271644971,
|
||
|
|
"loss": 5.986416625976562,
|
||
|
|
"mean_token_accuracy": 0.15458933711051942,
|
||
|
|
"num_tokens": 3231147.0,
|
||
|
|
"step": 1340
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.124406528472901,
|
||
|
|
"epoch": 1.454054054054054,
|
||
|
|
"grad_norm": 0.75,
|
||
|
|
"learning_rate": 0.0009104020098249207,
|
||
|
|
"loss": 5.974528503417969,
|
||
|
|
"mean_token_accuracy": 0.1465795397758484,
|
||
|
|
"num_tokens": 3243120.0,
|
||
|
|
"step": 1345
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.172325611114502,
|
||
|
|
"epoch": 1.4594594594594594,
|
||
|
|
"grad_norm": 0.66796875,
|
||
|
|
"learning_rate": 0.0009093745345414415,
|
||
|
|
"loss": 6.0606544494628904,
|
||
|
|
"mean_token_accuracy": 0.14666911959648132,
|
||
|
|
"num_tokens": 3253941.0,
|
||
|
|
"step": 1350
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.930078029632568,
|
||
|
|
"epoch": 1.464864864864865,
|
||
|
|
"grad_norm": 0.67578125,
|
||
|
|
"learning_rate": 0.0009083418606576712,
|
||
|
|
"loss": 5.996834945678711,
|
||
|
|
"mean_token_accuracy": 0.15221282094717026,
|
||
|
|
"num_tokens": 3268179.0,
|
||
|
|
"step": 1355
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.114362716674805,
|
||
|
|
"epoch": 1.4702702702702704,
|
||
|
|
"grad_norm": 0.7265625,
|
||
|
|
"learning_rate": 0.0009073040031119496,
|
||
|
|
"loss": 6.020093536376953,
|
||
|
|
"mean_token_accuracy": 0.15273723602294922,
|
||
|
|
"num_tokens": 3280661.0,
|
||
|
|
"step": 1360
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.08493185043335,
|
||
|
|
"epoch": 1.4756756756756757,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 0.0009062609769176008,
|
||
|
|
"loss": 5.958439636230469,
|
||
|
|
"mean_token_accuracy": 0.1539517253637314,
|
||
|
|
"num_tokens": 3292357.0,
|
||
|
|
"step": 1365
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.965977478027344,
|
||
|
|
"epoch": 1.481081081081081,
|
||
|
|
"grad_norm": 0.765625,
|
||
|
|
"learning_rate": 0.000905212797162718,
|
||
|
|
"loss": 5.906470489501953,
|
||
|
|
"mean_token_accuracy": 0.1570991039276123,
|
||
|
|
"num_tokens": 3303553.0,
|
||
|
|
"step": 1370
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.028031349182129,
|
||
|
|
"epoch": 1.4864864864864864,
|
||
|
|
"grad_norm": 0.70703125,
|
||
|
|
"learning_rate": 0.0009041594790099431,
|
||
|
|
"loss": 6.033520126342774,
|
||
|
|
"mean_token_accuracy": 0.15428649485111237,
|
||
|
|
"num_tokens": 3315013.0,
|
||
|
|
"step": 1375
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.051199722290039,
|
||
|
|
"epoch": 1.491891891891892,
|
||
|
|
"grad_norm": 0.765625,
|
||
|
|
"learning_rate": 0.0009031010376962497,
|
||
|
|
"loss": 5.9187873840332035,
|
||
|
|
"mean_token_accuracy": 0.15662144720554352,
|
||
|
|
"num_tokens": 3326593.0,
|
||
|
|
"step": 1380
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.04923734664917,
|
||
|
|
"epoch": 1.4972972972972973,
|
||
|
|
"grad_norm": 0.72265625,
|
||
|
|
"learning_rate": 0.0009020374885327201,
|
||
|
|
"loss": 5.947822570800781,
|
||
|
|
"mean_token_accuracy": 0.1478397786617279,
|
||
|
|
"num_tokens": 3338537.0,
|
||
|
|
"step": 1385
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.897234630584717,
|
||
|
|
"epoch": 1.5027027027027027,
|
||
|
|
"grad_norm": 0.73046875,
|
||
|
|
"learning_rate": 0.0009009688469043262,
|
||
|
|
"loss": 5.869780731201172,
|
||
|
|
"mean_token_accuracy": 0.15363080203533172,
|
||
|
|
"num_tokens": 3349855.0,
|
||
|
|
"step": 1390
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.034223747253418,
|
||
|
|
"epoch": 1.5081081081081082,
|
||
|
|
"grad_norm": 0.67578125,
|
||
|
|
"learning_rate": 0.0008998951282697056,
|
||
|
|
"loss": 5.889139938354492,
|
||
|
|
"mean_token_accuracy": 0.160240775346756,
|
||
|
|
"num_tokens": 3361160.0,
|
||
|
|
"step": 1395
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.875298023223877,
|
||
|
|
"epoch": 1.5135135135135136,
|
||
|
|
"grad_norm": 0.703125,
|
||
|
|
"learning_rate": 0.0008988163481609382,
|
||
|
|
"loss": 5.832206726074219,
|
||
|
|
"mean_token_accuracy": 0.15845912992954253,
|
||
|
|
"num_tokens": 3372145.0,
|
||
|
|
"step": 1400
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.8527037620544435,
|
||
|
|
"epoch": 1.518918918918919,
|
||
|
|
"grad_norm": 0.703125,
|
||
|
|
"learning_rate": 0.0008977325221833216,
|
||
|
|
"loss": 5.786477661132812,
|
||
|
|
"mean_token_accuracy": 0.15379104018211365,
|
||
|
|
"num_tokens": 3383900.0,
|
||
|
|
"step": 1405
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.941924953460694,
|
||
|
|
"epoch": 1.5243243243243243,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 0.0008966436660151454,
|
||
|
|
"loss": 5.860789489746094,
|
||
|
|
"mean_token_accuracy": 0.15963666439056395,
|
||
|
|
"num_tokens": 3395415.0,
|
||
|
|
"step": 1410
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.111461353302002,
|
||
|
|
"epoch": 1.5297297297297296,
|
||
|
|
"grad_norm": 0.92578125,
|
||
|
|
"learning_rate": 0.0008955497954074648,
|
||
|
|
"loss": 6.055585479736328,
|
||
|
|
"mean_token_accuracy": 0.15375637710094453,
|
||
|
|
"num_tokens": 3409666.0,
|
||
|
|
"step": 1415
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.024180698394775,
|
||
|
|
"epoch": 1.535135135135135,
|
||
|
|
"grad_norm": 0.70703125,
|
||
|
|
"learning_rate": 0.0008944509261838713,
|
||
|
|
"loss": 5.976921081542969,
|
||
|
|
"mean_token_accuracy": 0.1520102560520172,
|
||
|
|
"num_tokens": 3421172.0,
|
||
|
|
"step": 1420
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.899082088470459,
|
||
|
|
"epoch": 1.5405405405405406,
|
||
|
|
"grad_norm": 0.703125,
|
||
|
|
"learning_rate": 0.000893347074240266,
|
||
|
|
"loss": 5.8486183166503904,
|
||
|
|
"mean_token_accuracy": 0.1558360755443573,
|
||
|
|
"num_tokens": 3433317.0,
|
||
|
|
"step": 1425
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.996556949615479,
|
||
|
|
"epoch": 1.545945945945946,
|
||
|
|
"grad_norm": 0.66796875,
|
||
|
|
"learning_rate": 0.0008922382555446278,
|
||
|
|
"loss": 5.9516441345214846,
|
||
|
|
"mean_token_accuracy": 0.16046953797340394,
|
||
|
|
"num_tokens": 3445411.0,
|
||
|
|
"step": 1430
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.057880115509033,
|
||
|
|
"epoch": 1.5513513513513515,
|
||
|
|
"grad_norm": 0.79296875,
|
||
|
|
"learning_rate": 0.0008911244861367833,
|
||
|
|
"loss": 6.004363250732422,
|
||
|
|
"mean_token_accuracy": 0.15319364368915558,
|
||
|
|
"num_tokens": 3455771.0,
|
||
|
|
"step": 1435
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.0603588104248045,
|
||
|
|
"epoch": 1.5567567567567568,
|
||
|
|
"grad_norm": 0.69140625,
|
||
|
|
"learning_rate": 0.0008900057821281741,
|
||
|
|
"loss": 5.931759643554687,
|
||
|
|
"mean_token_accuracy": 0.15196377038955688,
|
||
|
|
"num_tokens": 3469339.0,
|
||
|
|
"step": 1440
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.960010147094726,
|
||
|
|
"epoch": 1.5621621621621622,
|
||
|
|
"grad_norm": 0.7890625,
|
||
|
|
"learning_rate": 0.000888882159701625,
|
||
|
|
"loss": 5.943192672729492,
|
||
|
|
"mean_token_accuracy": 0.1473819375038147,
|
||
|
|
"num_tokens": 3480485.0,
|
||
|
|
"step": 1445
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.939816188812256,
|
||
|
|
"epoch": 1.5675675675675675,
|
||
|
|
"grad_norm": 0.765625,
|
||
|
|
"learning_rate": 0.0008877536351111085,
|
||
|
|
"loss": 5.801699829101563,
|
||
|
|
"mean_token_accuracy": 0.166758930683136,
|
||
|
|
"num_tokens": 3491508.0,
|
||
|
|
"step": 1450
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.038672733306885,
|
||
|
|
"epoch": 1.572972972972973,
|
||
|
|
"grad_norm": 0.83984375,
|
||
|
|
"learning_rate": 0.0008866202246815106,
|
||
|
|
"loss": 6.041971206665039,
|
||
|
|
"mean_token_accuracy": 0.15027248561382295,
|
||
|
|
"num_tokens": 3505267.0,
|
||
|
|
"step": 1455
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.964024448394776,
|
||
|
|
"epoch": 1.5783783783783782,
|
||
|
|
"grad_norm": 0.765625,
|
||
|
|
"learning_rate": 0.0008854819448083942,
|
||
|
|
"loss": 5.86175422668457,
|
||
|
|
"mean_token_accuracy": 0.1595403164625168,
|
||
|
|
"num_tokens": 3516972.0,
|
||
|
|
"step": 1460
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.008862018585205,
|
||
|
|
"epoch": 1.5837837837837838,
|
||
|
|
"grad_norm": 0.73046875,
|
||
|
|
"learning_rate": 0.000884338811957762,
|
||
|
|
"loss": 5.9972587585449215,
|
||
|
|
"mean_token_accuracy": 0.15611343681812287,
|
||
|
|
"num_tokens": 3528725.0,
|
||
|
|
"step": 1465
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.940758991241455,
|
||
|
|
"epoch": 1.5891891891891892,
|
||
|
|
"grad_norm": 0.69140625,
|
||
|
|
"learning_rate": 0.0008831908426658185,
|
||
|
|
"loss": 5.871331024169922,
|
||
|
|
"mean_token_accuracy": 0.1530705511569977,
|
||
|
|
"num_tokens": 3540687.0,
|
||
|
|
"step": 1470
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.07134599685669,
|
||
|
|
"epoch": 1.5945945945945947,
|
||
|
|
"grad_norm": 0.72265625,
|
||
|
|
"learning_rate": 0.0008820380535387304,
|
||
|
|
"loss": 5.952286911010742,
|
||
|
|
"mean_token_accuracy": 0.15249330252408982,
|
||
|
|
"num_tokens": 3554326.0,
|
||
|
|
"step": 1475
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.084695625305176,
|
||
|
|
"epoch": 1.6,
|
||
|
|
"grad_norm": 0.8125,
|
||
|
|
"learning_rate": 0.0008808804612523872,
|
||
|
|
"loss": 6.173237609863281,
|
||
|
|
"mean_token_accuracy": 0.14082578867673873,
|
||
|
|
"num_tokens": 3569897.0,
|
||
|
|
"step": 1480
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.015488243103027,
|
||
|
|
"epoch": 1.6054054054054054,
|
||
|
|
"grad_norm": 0.7578125,
|
||
|
|
"learning_rate": 0.0008797180825521587,
|
||
|
|
"loss": 5.897605133056641,
|
||
|
|
"mean_token_accuracy": 0.15893602073192598,
|
||
|
|
"num_tokens": 3581820.0,
|
||
|
|
"step": 1485
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.961113452911377,
|
||
|
|
"epoch": 1.6108108108108108,
|
||
|
|
"grad_norm": 0.7578125,
|
||
|
|
"learning_rate": 0.0008785509342526537,
|
||
|
|
"loss": 5.871721649169922,
|
||
|
|
"mean_token_accuracy": 0.16222674250602723,
|
||
|
|
"num_tokens": 3592975.0,
|
||
|
|
"step": 1490
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.809928226470947,
|
||
|
|
"epoch": 1.6162162162162161,
|
||
|
|
"grad_norm": 0.72265625,
|
||
|
|
"learning_rate": 0.0008773790332374772,
|
||
|
|
"loss": 5.793231964111328,
|
||
|
|
"mean_token_accuracy": 0.1613244891166687,
|
||
|
|
"num_tokens": 3605950.0,
|
||
|
|
"step": 1495
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.923213100433349,
|
||
|
|
"epoch": 1.6216216216216215,
|
||
|
|
"grad_norm": 0.70703125,
|
||
|
|
"learning_rate": 0.0008762023964589843,
|
||
|
|
"loss": 5.940186309814453,
|
||
|
|
"mean_token_accuracy": 0.15495326220989228,
|
||
|
|
"num_tokens": 3616957.0,
|
||
|
|
"step": 1500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.980979537963867,
|
||
|
|
"epoch": 1.627027027027027,
|
||
|
|
"grad_norm": 0.6796875,
|
||
|
|
"learning_rate": 0.0008750210409380374,
|
||
|
|
"loss": 5.840050125122071,
|
||
|
|
"mean_token_accuracy": 0.15735195577144623,
|
||
|
|
"num_tokens": 3629008.0,
|
||
|
|
"step": 1505
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.963027667999268,
|
||
|
|
"epoch": 1.6324324324324324,
|
||
|
|
"grad_norm": 0.7421875,
|
||
|
|
"learning_rate": 0.0008738349837637578,
|
||
|
|
"loss": 5.900114440917969,
|
||
|
|
"mean_token_accuracy": 0.1567631959915161,
|
||
|
|
"num_tokens": 3640718.0,
|
||
|
|
"step": 1510
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.824203872680664,
|
||
|
|
"epoch": 1.637837837837838,
|
||
|
|
"grad_norm": 0.68359375,
|
||
|
|
"learning_rate": 0.00087264424209328,
|
||
|
|
"loss": 5.786465835571289,
|
||
|
|
"mean_token_accuracy": 0.1641067385673523,
|
||
|
|
"num_tokens": 3652415.0,
|
||
|
|
"step": 1515
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.953528213500976,
|
||
|
|
"epoch": 1.6432432432432433,
|
||
|
|
"grad_norm": 0.75390625,
|
||
|
|
"learning_rate": 0.0008714488331515028,
|
||
|
|
"loss": 5.855069351196289,
|
||
|
|
"mean_token_accuracy": 0.1647209793329239,
|
||
|
|
"num_tokens": 3664272.0,
|
||
|
|
"step": 1520
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.990782451629639,
|
||
|
|
"epoch": 1.6486486486486487,
|
||
|
|
"grad_norm": 0.65625,
|
||
|
|
"learning_rate": 0.0008702487742308401,
|
||
|
|
"loss": 5.933356857299804,
|
||
|
|
"mean_token_accuracy": 0.15115774869918824,
|
||
|
|
"num_tokens": 3676459.0,
|
||
|
|
"step": 1525
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.94338960647583,
|
||
|
|
"epoch": 1.654054054054054,
|
||
|
|
"grad_norm": 0.6953125,
|
||
|
|
"learning_rate": 0.0008690440826909717,
|
||
|
|
"loss": 5.868611145019531,
|
||
|
|
"mean_token_accuracy": 0.15732579827308654,
|
||
|
|
"num_tokens": 3690678.0,
|
||
|
|
"step": 1530
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.8550599098205565,
|
||
|
|
"epoch": 1.6594594594594594,
|
||
|
|
"grad_norm": 0.64453125,
|
||
|
|
"learning_rate": 0.0008678347759585904,
|
||
|
|
"loss": 5.798612213134765,
|
||
|
|
"mean_token_accuracy": 0.15875921845436097,
|
||
|
|
"num_tokens": 3702652.0,
|
||
|
|
"step": 1535
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.020911407470703,
|
||
|
|
"epoch": 1.6648648648648647,
|
||
|
|
"grad_norm": 0.72265625,
|
||
|
|
"learning_rate": 0.0008666208715271517,
|
||
|
|
"loss": 6.028233337402344,
|
||
|
|
"mean_token_accuracy": 0.14420250058174133,
|
||
|
|
"num_tokens": 3715399.0,
|
||
|
|
"step": 1540
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.965929794311523,
|
||
|
|
"epoch": 1.6702702702702703,
|
||
|
|
"grad_norm": 0.6953125,
|
||
|
|
"learning_rate": 0.0008654023869566194,
|
||
|
|
"loss": 5.865740203857422,
|
||
|
|
"mean_token_accuracy": 0.15165745615959167,
|
||
|
|
"num_tokens": 3726145.0,
|
||
|
|
"step": 1545
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.014906024932861,
|
||
|
|
"epoch": 1.6756756756756757,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 0.0008641793398732129,
|
||
|
|
"loss": 5.869577407836914,
|
||
|
|
"mean_token_accuracy": 0.15300983488559722,
|
||
|
|
"num_tokens": 3737755.0,
|
||
|
|
"step": 1550
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.840787696838379,
|
||
|
|
"epoch": 1.6810810810810812,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 0.0008629517479691506,
|
||
|
|
"loss": 5.768186569213867,
|
||
|
|
"mean_token_accuracy": 0.1616358280181885,
|
||
|
|
"num_tokens": 3748694.0,
|
||
|
|
"step": 1555
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.939591979980468,
|
||
|
|
"epoch": 1.6864864864864866,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 0.000861719629002396,
|
||
|
|
"loss": 5.9125518798828125,
|
||
|
|
"mean_token_accuracy": 0.1544147849082947,
|
||
|
|
"num_tokens": 3762516.0,
|
||
|
|
"step": 1560
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.0187114715576175,
|
||
|
|
"epoch": 1.691891891891892,
|
||
|
|
"grad_norm": 0.75390625,
|
||
|
|
"learning_rate": 0.0008604830007963983,
|
||
|
|
"loss": 6.051762390136719,
|
||
|
|
"mean_token_accuracy": 0.14813959300518037,
|
||
|
|
"num_tokens": 3776098.0,
|
||
|
|
"step": 1565
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.052183437347412,
|
||
|
|
"epoch": 1.6972972972972973,
|
||
|
|
"grad_norm": 0.77734375,
|
||
|
|
"learning_rate": 0.000859241881239837,
|
||
|
|
"loss": 5.978187561035156,
|
||
|
|
"mean_token_accuracy": 0.15714339911937714,
|
||
|
|
"num_tokens": 3786003.0,
|
||
|
|
"step": 1570
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.044375324249268,
|
||
|
|
"epoch": 1.7027027027027026,
|
||
|
|
"grad_norm": 0.6640625,
|
||
|
|
"learning_rate": 0.000857996288286362,
|
||
|
|
"loss": 5.934653091430664,
|
||
|
|
"mean_token_accuracy": 0.14706941545009614,
|
||
|
|
"num_tokens": 3798362.0,
|
||
|
|
"step": 1575
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.940067195892334,
|
||
|
|
"epoch": 1.708108108108108,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 0.0008567462399543333,
|
||
|
|
"loss": 5.798627471923828,
|
||
|
|
"mean_token_accuracy": 0.16449737548828125,
|
||
|
|
"num_tokens": 3809172.0,
|
||
|
|
"step": 1580
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.740559482574463,
|
||
|
|
"epoch": 1.7135135135135136,
|
||
|
|
"grad_norm": 0.75390625,
|
||
|
|
"learning_rate": 0.0008554917543265616,
|
||
|
|
"loss": 5.780983734130859,
|
||
|
|
"mean_token_accuracy": 0.15897656679153443,
|
||
|
|
"num_tokens": 3820141.0,
|
||
|
|
"step": 1585
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.95734920501709,
|
||
|
|
"epoch": 1.718918918918919,
|
||
|
|
"grad_norm": 0.76171875,
|
||
|
|
"learning_rate": 0.000854232849550046,
|
||
|
|
"loss": 5.8186603546142575,
|
||
|
|
"mean_token_accuracy": 0.1598174452781677,
|
||
|
|
"num_tokens": 3831231.0,
|
||
|
|
"step": 1590
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.005247402191162,
|
||
|
|
"epoch": 1.7243243243243245,
|
||
|
|
"grad_norm": 0.7578125,
|
||
|
|
"learning_rate": 0.0008529695438357117,
|
||
|
|
"loss": 5.890240859985352,
|
||
|
|
"mean_token_accuracy": 0.15293248891830444,
|
||
|
|
"num_tokens": 3843480.0,
|
||
|
|
"step": 1595
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.016628551483154,
|
||
|
|
"epoch": 1.7297297297297298,
|
||
|
|
"grad_norm": 0.81640625,
|
||
|
|
"learning_rate": 0.0008517018554581462,
|
||
|
|
"loss": 5.996260070800782,
|
||
|
|
"mean_token_accuracy": 0.1509675770998001,
|
||
|
|
"num_tokens": 3857586.0,
|
||
|
|
"step": 1600
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.130516242980957,
|
||
|
|
"epoch": 1.7351351351351352,
|
||
|
|
"grad_norm": 0.7734375,
|
||
|
|
"learning_rate": 0.0008504298027553357,
|
||
|
|
"loss": 6.028236389160156,
|
||
|
|
"mean_token_accuracy": 0.15611889213323593,
|
||
|
|
"num_tokens": 3869547.0,
|
||
|
|
"step": 1605
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.921278381347657,
|
||
|
|
"epoch": 1.7405405405405405,
|
||
|
|
"grad_norm": 0.79296875,
|
||
|
|
"learning_rate": 0.0008491534041283991,
|
||
|
|
"loss": 5.8067058563232425,
|
||
|
|
"mean_token_accuracy": 0.1678238719701767,
|
||
|
|
"num_tokens": 3880048.0,
|
||
|
|
"step": 1610
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.8370708465576175,
|
||
|
|
"epoch": 1.7459459459459459,
|
||
|
|
"grad_norm": 0.78515625,
|
||
|
|
"learning_rate": 0.0008478726780413218,
|
||
|
|
"loss": 5.954257202148438,
|
||
|
|
"mean_token_accuracy": 0.15217690765857697,
|
||
|
|
"num_tokens": 3892112.0,
|
||
|
|
"step": 1615
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.006961822509766,
|
||
|
|
"epoch": 1.7513513513513512,
|
||
|
|
"grad_norm": 0.69140625,
|
||
|
|
"learning_rate": 0.0008465876430206899,
|
||
|
|
"loss": 5.88764762878418,
|
||
|
|
"mean_token_accuracy": 0.15819757878780366,
|
||
|
|
"num_tokens": 3903668.0,
|
||
|
|
"step": 1620
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.98789644241333,
|
||
|
|
"epoch": 1.7567567567567568,
|
||
|
|
"grad_norm": 0.69921875,
|
||
|
|
"learning_rate": 0.0008452983176554196,
|
||
|
|
"loss": 5.858601760864258,
|
||
|
|
"mean_token_accuracy": 0.15955002903938292,
|
||
|
|
"num_tokens": 3916982.0,
|
||
|
|
"step": 1625
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.848407745361328,
|
||
|
|
"epoch": 1.7621621621621621,
|
||
|
|
"grad_norm": 0.7265625,
|
||
|
|
"learning_rate": 0.0008440047205964914,
|
||
|
|
"loss": 5.840298461914062,
|
||
|
|
"mean_token_accuracy": 0.16374977827072143,
|
||
|
|
"num_tokens": 3928166.0,
|
||
|
|
"step": 1630
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.9792177200317385,
|
||
|
|
"epoch": 1.7675675675675677,
|
||
|
|
"grad_norm": 0.75,
|
||
|
|
"learning_rate": 0.0008427068705566781,
|
||
|
|
"loss": 6.006826782226563,
|
||
|
|
"mean_token_accuracy": 0.14952372312545775,
|
||
|
|
"num_tokens": 3939246.0,
|
||
|
|
"step": 1635
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.200690364837646,
|
||
|
|
"epoch": 1.772972972972973,
|
||
|
|
"grad_norm": 0.765625,
|
||
|
|
"learning_rate": 0.0008414047863102747,
|
||
|
|
"loss": 5.999441528320313,
|
||
|
|
"mean_token_accuracy": 0.14769191443920135,
|
||
|
|
"num_tokens": 3952832.0,
|
||
|
|
"step": 1640
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.910121726989746,
|
||
|
|
"epoch": 1.7783783783783784,
|
||
|
|
"grad_norm": 0.6640625,
|
||
|
|
"learning_rate": 0.0008400984866928275,
|
||
|
|
"loss": 5.827185821533203,
|
||
|
|
"mean_token_accuracy": 0.16465649306774138,
|
||
|
|
"num_tokens": 3966155.0,
|
||
|
|
"step": 1645
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.943995761871338,
|
||
|
|
"epoch": 1.7837837837837838,
|
||
|
|
"grad_norm": 0.78125,
|
||
|
|
"learning_rate": 0.0008387879906008601,
|
||
|
|
"loss": 5.899274826049805,
|
||
|
|
"mean_token_accuracy": 0.15780851244926453,
|
||
|
|
"num_tokens": 3980038.0,
|
||
|
|
"step": 1650
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.938759899139404,
|
||
|
|
"epoch": 1.7891891891891891,
|
||
|
|
"grad_norm": 0.66015625,
|
||
|
|
"learning_rate": 0.0008374733169916021,
|
||
|
|
"loss": 6.025347137451172,
|
||
|
|
"mean_token_accuracy": 0.14912573248147964,
|
||
|
|
"num_tokens": 3992732.0,
|
||
|
|
"step": 1655
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.997166156768799,
|
||
|
|
"epoch": 1.7945945945945945,
|
||
|
|
"grad_norm": 0.78125,
|
||
|
|
"learning_rate": 0.0008361544848827127,
|
||
|
|
"loss": 5.793037414550781,
|
||
|
|
"mean_token_accuracy": 0.15761127471923828,
|
||
|
|
"num_tokens": 4003705.0,
|
||
|
|
"step": 1660
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.892963027954101,
|
||
|
|
"epoch": 1.8,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 0.0008348315133520075,
|
||
|
|
"loss": 5.9427635192871096,
|
||
|
|
"mean_token_accuracy": 0.152792489528656,
|
||
|
|
"num_tokens": 4015718.0,
|
||
|
|
"step": 1665
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.920527076721191,
|
||
|
|
"epoch": 1.8054054054054054,
|
||
|
|
"grad_norm": 0.69921875,
|
||
|
|
"learning_rate": 0.0008335044215371813,
|
||
|
|
"loss": 5.789597702026367,
|
||
|
|
"mean_token_accuracy": 0.16133061945438384,
|
||
|
|
"num_tokens": 4026361.0,
|
||
|
|
"step": 1670
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.8828856468200685,
|
||
|
|
"epoch": 1.810810810810811,
|
||
|
|
"grad_norm": 0.7265625,
|
||
|
|
"learning_rate": 0.0008321732286355318,
|
||
|
|
"loss": 5.893592453002929,
|
||
|
|
"mean_token_accuracy": 0.15036226361989974,
|
||
|
|
"num_tokens": 4040437.0,
|
||
|
|
"step": 1675
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.015377521514893,
|
||
|
|
"epoch": 1.8162162162162163,
|
||
|
|
"grad_norm": 0.70703125,
|
||
|
|
"learning_rate": 0.0008308379539036815,
|
||
|
|
"loss": 5.925026702880859,
|
||
|
|
"mean_token_accuracy": 0.1480212152004242,
|
||
|
|
"num_tokens": 4055050.0,
|
||
|
|
"step": 1680
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.915068912506103,
|
||
|
|
"epoch": 1.8216216216216217,
|
||
|
|
"grad_norm": 0.76953125,
|
||
|
|
"learning_rate": 0.0008294986166572996,
|
||
|
|
"loss": 5.826159286499023,
|
||
|
|
"mean_token_accuracy": 0.15820080935955047,
|
||
|
|
"num_tokens": 4066011.0,
|
||
|
|
"step": 1685
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.831681251525879,
|
||
|
|
"epoch": 1.827027027027027,
|
||
|
|
"grad_norm": 0.73046875,
|
||
|
|
"learning_rate": 0.0008281552362708223,
|
||
|
|
"loss": 5.761726379394531,
|
||
|
|
"mean_token_accuracy": 0.16127054691314696,
|
||
|
|
"num_tokens": 4077430.0,
|
||
|
|
"step": 1690
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.011395454406738,
|
||
|
|
"epoch": 1.8324324324324324,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 0.0008268078321771727,
|
||
|
|
"loss": 5.903897094726562,
|
||
|
|
"mean_token_accuracy": 0.15751948654651643,
|
||
|
|
"num_tokens": 4090523.0,
|
||
|
|
"step": 1695
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.914142227172851,
|
||
|
|
"epoch": 1.8378378378378377,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 0.0008254564238674794,
|
||
|
|
"loss": 5.876987075805664,
|
||
|
|
"mean_token_accuracy": 0.1542936235666275,
|
||
|
|
"num_tokens": 4101919.0,
|
||
|
|
"step": 1700
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.970525455474854,
|
||
|
|
"epoch": 1.8432432432432433,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 0.0008241010308907951,
|
||
|
|
"loss": 5.960490036010742,
|
||
|
|
"mean_token_accuracy": 0.15674711167812347,
|
||
|
|
"num_tokens": 4114135.0,
|
||
|
|
"step": 1705
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.934633445739746,
|
||
|
|
"epoch": 1.8486486486486486,
|
||
|
|
"grad_norm": 0.82421875,
|
||
|
|
"learning_rate": 0.0008227416728538128,
|
||
|
|
"loss": 5.802957916259766,
|
||
|
|
"mean_token_accuracy": 0.1623306691646576,
|
||
|
|
"num_tokens": 4125312.0,
|
||
|
|
"step": 1710
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.878772258758545,
|
||
|
|
"epoch": 1.8540540540540542,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 0.0008213783694205839,
|
||
|
|
"loss": 5.777447128295899,
|
||
|
|
"mean_token_accuracy": 0.16162220537662506,
|
||
|
|
"num_tokens": 4136693.0,
|
||
|
|
"step": 1715
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.870784187316895,
|
||
|
|
"epoch": 1.8594594594594596,
|
||
|
|
"grad_norm": 0.76953125,
|
||
|
|
"learning_rate": 0.0008200111403122315,
|
||
|
|
"loss": 5.841195678710937,
|
||
|
|
"mean_token_accuracy": 0.16130259037017822,
|
||
|
|
"num_tokens": 4148495.0,
|
||
|
|
"step": 1720
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.954642677307129,
|
||
|
|
"epoch": 1.864864864864865,
|
||
|
|
"grad_norm": 0.75390625,
|
||
|
|
"learning_rate": 0.0008186400053066668,
|
||
|
|
"loss": 5.839686584472656,
|
||
|
|
"mean_token_accuracy": 0.16170231401920318,
|
||
|
|
"num_tokens": 4159648.0,
|
||
|
|
"step": 1725
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.861533260345459,
|
||
|
|
"epoch": 1.8702702702702703,
|
||
|
|
"grad_norm": 0.7734375,
|
||
|
|
"learning_rate": 0.000817264984238303,
|
||
|
|
"loss": 5.768640518188477,
|
||
|
|
"mean_token_accuracy": 0.16273143291473388,
|
||
|
|
"num_tokens": 4169810.0,
|
||
|
|
"step": 1730
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.900146198272705,
|
||
|
|
"epoch": 1.8756756756756756,
|
||
|
|
"grad_norm": 0.7734375,
|
||
|
|
"learning_rate": 0.000815886096997767,
|
||
|
|
"loss": 5.84183349609375,
|
||
|
|
"mean_token_accuracy": 0.15980561077594757,
|
||
|
|
"num_tokens": 4181139.0,
|
||
|
|
"step": 1735
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.048444652557373,
|
||
|
|
"epoch": 1.881081081081081,
|
||
|
|
"grad_norm": 0.84375,
|
||
|
|
"learning_rate": 0.000814503363531613,
|
||
|
|
"loss": 6.1030632019042965,
|
||
|
|
"mean_token_accuracy": 0.13935500532388687,
|
||
|
|
"num_tokens": 4197903.0,
|
||
|
|
"step": 1740
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.966563606262207,
|
||
|
|
"epoch": 1.8864864864864865,
|
||
|
|
"grad_norm": 0.8203125,
|
||
|
|
"learning_rate": 0.0008131168038420334,
|
||
|
|
"loss": 5.912844848632813,
|
||
|
|
"mean_token_accuracy": 0.15547370314598083,
|
||
|
|
"num_tokens": 4208221.0,
|
||
|
|
"step": 1745
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.996464729309082,
|
||
|
|
"epoch": 1.8918918918918919,
|
||
|
|
"grad_norm": 0.796875,
|
||
|
|
"learning_rate": 0.0008117264379865699,
|
||
|
|
"loss": 5.8559318542480465,
|
||
|
|
"mean_token_accuracy": 0.14872512519359588,
|
||
|
|
"num_tokens": 4221641.0,
|
||
|
|
"step": 1750
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.873746681213379,
|
||
|
|
"epoch": 1.8972972972972975,
|
||
|
|
"grad_norm": 0.80859375,
|
||
|
|
"learning_rate": 0.0008103322860778222,
|
||
|
|
"loss": 5.843596649169922,
|
||
|
|
"mean_token_accuracy": 0.16076571643352508,
|
||
|
|
"num_tokens": 4234816.0,
|
||
|
|
"step": 1755
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.94351167678833,
|
||
|
|
"epoch": 1.9027027027027028,
|
||
|
|
"grad_norm": 0.77734375,
|
||
|
|
"learning_rate": 0.0008089343682831589,
|
||
|
|
"loss": 5.80005111694336,
|
||
|
|
"mean_token_accuracy": 0.15597352683544158,
|
||
|
|
"num_tokens": 4246361.0,
|
||
|
|
"step": 1760
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.784683704376221,
|
||
|
|
"epoch": 1.9081081081081082,
|
||
|
|
"grad_norm": 0.69140625,
|
||
|
|
"learning_rate": 0.000807532704824424,
|
||
|
|
"loss": 5.769342041015625,
|
||
|
|
"mean_token_accuracy": 0.1640514612197876,
|
||
|
|
"num_tokens": 4257726.0,
|
||
|
|
"step": 1765
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.84423599243164,
|
||
|
|
"epoch": 1.9135135135135135,
|
||
|
|
"grad_norm": 0.77734375,
|
||
|
|
"learning_rate": 0.0008061273159776451,
|
||
|
|
"loss": 5.736867904663086,
|
||
|
|
"mean_token_accuracy": 0.1638896197080612,
|
||
|
|
"num_tokens": 4268046.0,
|
||
|
|
"step": 1770
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.982893753051758,
|
||
|
|
"epoch": 1.9189189189189189,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 0.0008047182220727408,
|
||
|
|
"loss": 5.937384414672851,
|
||
|
|
"mean_token_accuracy": 0.1541384845972061,
|
||
|
|
"num_tokens": 4278742.0,
|
||
|
|
"step": 1775
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.127891540527344,
|
||
|
|
"epoch": 1.9243243243243242,
|
||
|
|
"grad_norm": 0.74609375,
|
||
|
|
"learning_rate": 0.0008033054434932254,
|
||
|
|
"loss": 5.961701965332031,
|
||
|
|
"mean_token_accuracy": 0.15437058806419374,
|
||
|
|
"num_tokens": 4292724.0,
|
||
|
|
"step": 1780
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.924184322357178,
|
||
|
|
"epoch": 1.9297297297297298,
|
||
|
|
"grad_norm": 0.80859375,
|
||
|
|
"learning_rate": 0.000801889000675914,
|
||
|
|
"loss": 5.8671623229980465,
|
||
|
|
"mean_token_accuracy": 0.1589438408613205,
|
||
|
|
"num_tokens": 4303028.0,
|
||
|
|
"step": 1785
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.705279350280762,
|
||
|
|
"epoch": 1.9351351351351351,
|
||
|
|
"grad_norm": 0.796875,
|
||
|
|
"learning_rate": 0.0008004689141106288,
|
||
|
|
"loss": 5.709238433837891,
|
||
|
|
"mean_token_accuracy": 0.16910262405872345,
|
||
|
|
"num_tokens": 4314381.0,
|
||
|
|
"step": 1790
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.805646800994873,
|
||
|
|
"epoch": 1.9405405405405407,
|
||
|
|
"grad_norm": 0.703125,
|
||
|
|
"learning_rate": 0.0007990452043399,
|
||
|
|
"loss": 5.732901000976563,
|
||
|
|
"mean_token_accuracy": 0.16858636140823363,
|
||
|
|
"num_tokens": 4325182.0,
|
||
|
|
"step": 1795
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.05684461593628,
|
||
|
|
"epoch": 1.945945945945946,
|
||
|
|
"grad_norm": 0.703125,
|
||
|
|
"learning_rate": 0.0007976178919586711,
|
||
|
|
"loss": 6.029544067382813,
|
||
|
|
"mean_token_accuracy": 0.14246535897254944,
|
||
|
|
"num_tokens": 4340271.0,
|
||
|
|
"step": 1800
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.991472434997559,
|
||
|
|
"epoch": 1.9513513513513514,
|
||
|
|
"grad_norm": 0.76171875,
|
||
|
|
"learning_rate": 0.0007961869976139987,
|
||
|
|
"loss": 5.902516174316406,
|
||
|
|
"mean_token_accuracy": 0.16500157713890076,
|
||
|
|
"num_tokens": 4353881.0,
|
||
|
|
"step": 1805
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.868509578704834,
|
||
|
|
"epoch": 1.9567567567567568,
|
||
|
|
"grad_norm": 0.6953125,
|
||
|
|
"learning_rate": 0.0007947525420047558,
|
||
|
|
"loss": 5.885099029541015,
|
||
|
|
"mean_token_accuracy": 0.15701564848423005,
|
||
|
|
"num_tokens": 4365773.0,
|
||
|
|
"step": 1810
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.079554080963135,
|
||
|
|
"epoch": 1.962162162162162,
|
||
|
|
"grad_norm": 0.72265625,
|
||
|
|
"learning_rate": 0.0007933145458813313,
|
||
|
|
"loss": 5.97406120300293,
|
||
|
|
"mean_token_accuracy": 0.15619401633739471,
|
||
|
|
"num_tokens": 4378779.0,
|
||
|
|
"step": 1815
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.911398601531983,
|
||
|
|
"epoch": 1.9675675675675675,
|
||
|
|
"grad_norm": 0.7265625,
|
||
|
|
"learning_rate": 0.00079187303004533,
|
||
|
|
"loss": 5.788228988647461,
|
||
|
|
"mean_token_accuracy": 0.1630644679069519,
|
||
|
|
"num_tokens": 4391227.0,
|
||
|
|
"step": 1820
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.884594058990478,
|
||
|
|
"epoch": 1.972972972972973,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 0.0007904280153492719,
|
||
|
|
"loss": 5.822915649414062,
|
||
|
|
"mean_token_accuracy": 0.16305937618017197,
|
||
|
|
"num_tokens": 4405081.0,
|
||
|
|
"step": 1825
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.893936729431152,
|
||
|
|
"epoch": 1.9783783783783784,
|
||
|
|
"grad_norm": 0.88671875,
|
||
|
|
"learning_rate": 0.0007889795226962903,
|
||
|
|
"loss": 5.852434158325195,
|
||
|
|
"mean_token_accuracy": 0.16256003975868225,
|
||
|
|
"num_tokens": 4418367.0,
|
||
|
|
"step": 1830
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.817579555511474,
|
||
|
|
"epoch": 1.983783783783784,
|
||
|
|
"grad_norm": 0.7421875,
|
||
|
|
"learning_rate": 0.0007875275730398296,
|
||
|
|
"loss": 5.800425720214844,
|
||
|
|
"mean_token_accuracy": 0.1621989995241165,
|
||
|
|
"num_tokens": 4430138.0,
|
||
|
|
"step": 1835
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.999104595184326,
|
||
|
|
"epoch": 1.9891891891891893,
|
||
|
|
"grad_norm": 0.7578125,
|
||
|
|
"learning_rate": 0.0007860721873833421,
|
||
|
|
"loss": 5.810161590576172,
|
||
|
|
"mean_token_accuracy": 0.15874570310115815,
|
||
|
|
"num_tokens": 4442843.0,
|
||
|
|
"step": 1840
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.885268878936768,
|
||
|
|
"epoch": 1.9945945945945946,
|
||
|
|
"grad_norm": 0.69921875,
|
||
|
|
"learning_rate": 0.0007846133867799843,
|
||
|
|
"loss": 5.8348651885986325,
|
||
|
|
"mean_token_accuracy": 0.15846727192401885,
|
||
|
|
"num_tokens": 4455005.0,
|
||
|
|
"step": 1845
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.798076820373535,
|
||
|
|
"epoch": 2.0,
|
||
|
|
"grad_norm": 1.53125,
|
||
|
|
"learning_rate": 0.0007831511923323122,
|
||
|
|
"loss": 5.883354568481446,
|
||
|
|
"mean_token_accuracy": 0.15775206387043,
|
||
|
|
"num_tokens": 4465336.0,
|
||
|
|
"step": 1850
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.810991191864014,
|
||
|
|
"epoch": 2.0054054054054054,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 0.0007816856251919762,
|
||
|
|
"loss": 5.527929306030273,
|
||
|
|
"mean_token_accuracy": 0.16748940646648408,
|
||
|
|
"num_tokens": 4477360.0,
|
||
|
|
"step": 1855
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.809268569946289,
|
||
|
|
"epoch": 2.0108108108108107,
|
||
|
|
"grad_norm": 0.69921875,
|
||
|
|
"learning_rate": 0.0007802167065594145,
|
||
|
|
"loss": 5.577561950683593,
|
||
|
|
"mean_token_accuracy": 0.16481069922447206,
|
||
|
|
"num_tokens": 4488410.0,
|
||
|
|
"step": 1860
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.625452709197998,
|
||
|
|
"epoch": 2.016216216216216,
|
||
|
|
"grad_norm": 0.69921875,
|
||
|
|
"learning_rate": 0.0007787444576835481,
|
||
|
|
"loss": 5.5580078125,
|
||
|
|
"mean_token_accuracy": 0.17334003746509552,
|
||
|
|
"num_tokens": 4500257.0,
|
||
|
|
"step": 1865
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.561168956756592,
|
||
|
|
"epoch": 2.0216216216216214,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 0.0007772688998614708,
|
||
|
|
"loss": 5.410086059570313,
|
||
|
|
"mean_token_accuracy": 0.18215323388576507,
|
||
|
|
"num_tokens": 4511162.0,
|
||
|
|
"step": 1870
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.757048511505127,
|
||
|
|
"epoch": 2.027027027027027,
|
||
|
|
"grad_norm": 0.75,
|
||
|
|
"learning_rate": 0.0007757900544381437,
|
||
|
|
"loss": 5.635135650634766,
|
||
|
|
"mean_token_accuracy": 0.16631377041339873,
|
||
|
|
"num_tokens": 4521402.0,
|
||
|
|
"step": 1875
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.7210588455200195,
|
||
|
|
"epoch": 2.0324324324324325,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 0.000774307942806085,
|
||
|
|
"loss": 5.385799407958984,
|
||
|
|
"mean_token_accuracy": 0.17716321647167205,
|
||
|
|
"num_tokens": 4532285.0,
|
||
|
|
"step": 1880
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.656139659881592,
|
||
|
|
"epoch": 2.037837837837838,
|
||
|
|
"grad_norm": 0.7265625,
|
||
|
|
"learning_rate": 0.0007728225864050604,
|
||
|
|
"loss": 5.591728973388672,
|
||
|
|
"mean_token_accuracy": 0.17316411435604095,
|
||
|
|
"num_tokens": 4542765.0,
|
||
|
|
"step": 1885
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.640194320678711,
|
||
|
|
"epoch": 2.0432432432432432,
|
||
|
|
"grad_norm": 0.77734375,
|
||
|
|
"learning_rate": 0.0007713340067217743,
|
||
|
|
"loss": 5.508696365356445,
|
||
|
|
"mean_token_accuracy": 0.17453130185604096,
|
||
|
|
"num_tokens": 4553113.0,
|
||
|
|
"step": 1890
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.633144664764404,
|
||
|
|
"epoch": 2.0486486486486486,
|
||
|
|
"grad_norm": 0.6953125,
|
||
|
|
"learning_rate": 0.0007698422252895573,
|
||
|
|
"loss": 5.5036571502685545,
|
||
|
|
"mean_token_accuracy": 0.17045795619487764,
|
||
|
|
"num_tokens": 4565831.0,
|
||
|
|
"step": 1895
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.780905246734619,
|
||
|
|
"epoch": 2.054054054054054,
|
||
|
|
"grad_norm": 0.81640625,
|
||
|
|
"learning_rate": 0.0007683472636880559,
|
||
|
|
"loss": 5.6892822265625,
|
||
|
|
"mean_token_accuracy": 0.16380396485328674,
|
||
|
|
"num_tokens": 4579563.0,
|
||
|
|
"step": 1900
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.758352661132813,
|
||
|
|
"epoch": 2.0594594594594593,
|
||
|
|
"grad_norm": 0.78125,
|
||
|
|
"learning_rate": 0.0007668491435429198,
|
||
|
|
"loss": 5.554851913452149,
|
||
|
|
"mean_token_accuracy": 0.1707320511341095,
|
||
|
|
"num_tokens": 4590549.0,
|
||
|
|
"step": 1905
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.689521026611328,
|
||
|
|
"epoch": 2.064864864864865,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 0.0007653478865254896,
|
||
|
|
"loss": 5.547829055786133,
|
||
|
|
"mean_token_accuracy": 0.17455363869667054,
|
||
|
|
"num_tokens": 4602157.0,
|
||
|
|
"step": 1910
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.657618808746338,
|
||
|
|
"epoch": 2.0702702702702704,
|
||
|
|
"grad_norm": 0.72265625,
|
||
|
|
"learning_rate": 0.0007638435143524821,
|
||
|
|
"loss": 5.633978271484375,
|
||
|
|
"mean_token_accuracy": 0.16765685081481935,
|
||
|
|
"num_tokens": 4614884.0,
|
||
|
|
"step": 1915
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.809543132781982,
|
||
|
|
"epoch": 2.075675675675676,
|
||
|
|
"grad_norm": 0.73828125,
|
||
|
|
"learning_rate": 0.0007623360487856777,
|
||
|
|
"loss": 5.555442047119141,
|
||
|
|
"mean_token_accuracy": 0.17740504145622255,
|
||
|
|
"num_tokens": 4626089.0,
|
||
|
|
"step": 1920
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.652527332305908,
|
||
|
|
"epoch": 2.081081081081081,
|
||
|
|
"grad_norm": 0.8203125,
|
||
|
|
"learning_rate": 0.0007608255116316047,
|
||
|
|
"loss": 5.568304061889648,
|
||
|
|
"mean_token_accuracy": 0.16942307054996492,
|
||
|
|
"num_tokens": 4637381.0,
|
||
|
|
"step": 1925
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.808231163024902,
|
||
|
|
"epoch": 2.0864864864864865,
|
||
|
|
"grad_norm": 0.796875,
|
||
|
|
"learning_rate": 0.000759311924741224,
|
||
|
|
"loss": 5.685822677612305,
|
||
|
|
"mean_token_accuracy": 0.16158882677555084,
|
||
|
|
"num_tokens": 4651102.0,
|
||
|
|
"step": 1930
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.715962696075439,
|
||
|
|
"epoch": 2.091891891891892,
|
||
|
|
"grad_norm": 0.71875,
|
||
|
|
"learning_rate": 0.0007577953100096127,
|
||
|
|
"loss": 5.584080505371094,
|
||
|
|
"mean_token_accuracy": 0.17144258618354796,
|
||
|
|
"num_tokens": 4662346.0,
|
||
|
|
"step": 1935
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.584010601043701,
|
||
|
|
"epoch": 2.097297297297297,
|
||
|
|
"grad_norm": 0.77734375,
|
||
|
|
"learning_rate": 0.0007562756893756482,
|
||
|
|
"loss": 5.479648208618164,
|
||
|
|
"mean_token_accuracy": 0.1779884248971939,
|
||
|
|
"num_tokens": 4673267.0,
|
||
|
|
"step": 1940
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.691203498840332,
|
||
|
|
"epoch": 2.1027027027027025,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 0.0007547530848216902,
|
||
|
|
"loss": 5.5625354766845705,
|
||
|
|
"mean_token_accuracy": 0.1721408635377884,
|
||
|
|
"num_tokens": 4686971.0,
|
||
|
|
"step": 1945
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.826029586791992,
|
||
|
|
"epoch": 2.108108108108108,
|
||
|
|
"grad_norm": 0.7109375,
|
||
|
|
"learning_rate": 0.0007532275183732627,
|
||
|
|
"loss": 5.578032684326172,
|
||
|
|
"mean_token_accuracy": 0.1736992359161377,
|
||
|
|
"num_tokens": 4698148.0,
|
||
|
|
"step": 1950
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.525319576263428,
|
||
|
|
"epoch": 2.1135135135135137,
|
||
|
|
"grad_norm": 0.84375,
|
||
|
|
"learning_rate": 0.0007516990120987357,
|
||
|
|
"loss": 5.548344421386719,
|
||
|
|
"mean_token_accuracy": 0.1678497314453125,
|
||
|
|
"num_tokens": 4708146.0,
|
||
|
|
"step": 1955
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.655934047698975,
|
||
|
|
"epoch": 2.118918918918919,
|
||
|
|
"grad_norm": 0.765625,
|
||
|
|
"learning_rate": 0.0007501675881090059,
|
||
|
|
"loss": 5.4946849822998045,
|
||
|
|
"mean_token_accuracy": 0.1745520293712616,
|
||
|
|
"num_tokens": 4721507.0,
|
||
|
|
"step": 1960
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.759321308135986,
|
||
|
|
"epoch": 2.1243243243243244,
|
||
|
|
"grad_norm": 0.76171875,
|
||
|
|
"learning_rate": 0.0007486332685571763,
|
||
|
|
"loss": 5.596438217163086,
|
||
|
|
"mean_token_accuracy": 0.1724897027015686,
|
||
|
|
"num_tokens": 4733769.0,
|
||
|
|
"step": 1965
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.763000202178955,
|
||
|
|
"epoch": 2.1297297297297297,
|
||
|
|
"grad_norm": 0.75390625,
|
||
|
|
"learning_rate": 0.0007470960756382371,
|
||
|
|
"loss": 5.642522811889648,
|
||
|
|
"mean_token_accuracy": 0.16852032840251924,
|
||
|
|
"num_tokens": 4746989.0,
|
||
|
|
"step": 1970
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.744833946228027,
|
||
|
|
"epoch": 2.135135135135135,
|
||
|
|
"grad_norm": 0.71484375,
|
||
|
|
"learning_rate": 0.0007455560315887427,
|
||
|
|
"loss": 5.643239593505859,
|
||
|
|
"mean_token_accuracy": 0.17182834148406984,
|
||
|
|
"num_tokens": 4759644.0,
|
||
|
|
"step": 1975
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.654244041442871,
|
||
|
|
"epoch": 2.1405405405405404,
|
||
|
|
"grad_norm": 0.765625,
|
||
|
|
"learning_rate": 0.0007440131586864915,
|
||
|
|
"loss": 5.531895446777344,
|
||
|
|
"mean_token_accuracy": 0.16754286289215087,
|
||
|
|
"num_tokens": 4771386.0,
|
||
|
|
"step": 1980
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.694602966308594,
|
||
|
|
"epoch": 2.145945945945946,
|
||
|
|
"grad_norm": 0.7734375,
|
||
|
|
"learning_rate": 0.0007424674792502037,
|
||
|
|
"loss": 5.515792465209961,
|
||
|
|
"mean_token_accuracy": 0.18264077007770538,
|
||
|
|
"num_tokens": 4782830.0,
|
||
|
|
"step": 1985
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.667961311340332,
|
||
|
|
"epoch": 2.1513513513513516,
|
||
|
|
"grad_norm": 0.73046875,
|
||
|
|
"learning_rate": 0.0007409190156391969,
|
||
|
|
"loss": 5.545432281494141,
|
||
|
|
"mean_token_accuracy": 0.17193699777126312,
|
||
|
|
"num_tokens": 4795220.0,
|
||
|
|
"step": 1990
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.770290660858154,
|
||
|
|
"epoch": 2.156756756756757,
|
||
|
|
"grad_norm": 0.8125,
|
||
|
|
"learning_rate": 0.0007393677902530648,
|
||
|
|
"loss": 5.638581848144531,
|
||
|
|
"mean_token_accuracy": 0.17162449061870574,
|
||
|
|
"num_tokens": 4806904.0,
|
||
|
|
"step": 1995
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.681714153289795,
|
||
|
|
"epoch": 2.1621621621621623,
|
||
|
|
"grad_norm": 0.734375,
|
||
|
|
"learning_rate": 0.0007378138255313511,
|
||
|
|
"loss": 5.612754058837891,
|
||
|
|
"mean_token_accuracy": 0.16533401906490325,
|
||
|
|
"num_tokens": 4818963.0,
|
||
|
|
"step": 2000
|
||
|
|
}
|
||
|
|
],
|
||
|
|
"logging_steps": 5,
|
||
|
|
"max_steps": 4630,
|
||
|
|
"num_input_tokens_seen": 0,
|
||
|
|
"num_train_epochs": 6,
|
||
|
|
"save_steps": 1000,
|
||
|
|
"stateful_callbacks": {
|
||
|
|
"TrainerControl": {
|
||
|
|
"args": {
|
||
|
|
"should_epoch_stop": false,
|
||
|
|
"should_evaluate": false,
|
||
|
|
"should_log": false,
|
||
|
|
"should_save": true,
|
||
|
|
"should_training_stop": false
|
||
|
|
},
|
||
|
|
"attributes": {}
|
||
|
|
}
|
||
|
|
},
|
||
|
|
"total_flos": 1808651509678080.0,
|
||
|
|
"train_batch_size": 32,
|
||
|
|
"trial_name": null,
|
||
|
|
"trial_params": null
|
||
|
|
}
|