8035 lines
228 KiB
JSON
8035 lines
228 KiB
JSON
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 4.324324324324325,
|
|
"eval_steps": 500,
|
|
"global_step": 4000,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"entropy": 9.657138442993164,
|
|
"epoch": 0.005405405405405406,
|
|
"grad_norm": 4.90625,
|
|
"learning_rate": 8e-06,
|
|
"loss": 12.520880889892577,
|
|
"mean_token_accuracy": 0.002236185665242374,
|
|
"num_tokens": 11236.0,
|
|
"step": 5
|
|
},
|
|
{
|
|
"entropy": 9.649214553833009,
|
|
"epoch": 0.010810810810810811,
|
|
"grad_norm": 4.5,
|
|
"learning_rate": 1.8e-05,
|
|
"loss": 12.531226348876952,
|
|
"mean_token_accuracy": 0.002215801365673542,
|
|
"num_tokens": 22482.0,
|
|
"step": 10
|
|
},
|
|
{
|
|
"entropy": 9.733113479614257,
|
|
"epoch": 0.016216216216216217,
|
|
"grad_norm": 5.03125,
|
|
"learning_rate": 2.8e-05,
|
|
"loss": 12.409437561035157,
|
|
"mean_token_accuracy": 0.002145940694026649,
|
|
"num_tokens": 35515.0,
|
|
"step": 15
|
|
},
|
|
{
|
|
"entropy": 9.83765811920166,
|
|
"epoch": 0.021621621621621623,
|
|
"grad_norm": 4.46875,
|
|
"learning_rate": 3.8e-05,
|
|
"loss": 12.153470611572265,
|
|
"mean_token_accuracy": 0.006360871193464845,
|
|
"num_tokens": 46983.0,
|
|
"step": 20
|
|
},
|
|
{
|
|
"entropy": 9.924044799804687,
|
|
"epoch": 0.02702702702702703,
|
|
"grad_norm": 3.25,
|
|
"learning_rate": 4.8e-05,
|
|
"loss": 11.767626953125,
|
|
"mean_token_accuracy": 0.010928381700068712,
|
|
"num_tokens": 60568.0,
|
|
"step": 25
|
|
},
|
|
{
|
|
"entropy": 10.140900039672852,
|
|
"epoch": 0.032432432432432434,
|
|
"grad_norm": 2.90625,
|
|
"learning_rate": 5.800000000000001e-05,
|
|
"loss": 11.328617095947266,
|
|
"mean_token_accuracy": 0.01978628318756819,
|
|
"num_tokens": 70721.0,
|
|
"step": 30
|
|
},
|
|
{
|
|
"entropy": 10.317844772338868,
|
|
"epoch": 0.03783783783783784,
|
|
"grad_norm": 2.1875,
|
|
"learning_rate": 6.800000000000001e-05,
|
|
"loss": 11.004520416259766,
|
|
"mean_token_accuracy": 0.027996162697672845,
|
|
"num_tokens": 85970.0,
|
|
"step": 35
|
|
},
|
|
{
|
|
"entropy": 10.511189270019532,
|
|
"epoch": 0.043243243243243246,
|
|
"grad_norm": 2.0,
|
|
"learning_rate": 7.8e-05,
|
|
"loss": 10.693595886230469,
|
|
"mean_token_accuracy": 0.03253013007342816,
|
|
"num_tokens": 97950.0,
|
|
"step": 40
|
|
},
|
|
{
|
|
"entropy": 10.562995338439942,
|
|
"epoch": 0.04864864864864865,
|
|
"grad_norm": 1.84375,
|
|
"learning_rate": 8.8e-05,
|
|
"loss": 10.466288757324218,
|
|
"mean_token_accuracy": 0.03578495755791664,
|
|
"num_tokens": 112032.0,
|
|
"step": 45
|
|
},
|
|
{
|
|
"entropy": 10.56525535583496,
|
|
"epoch": 0.05405405405405406,
|
|
"grad_norm": 2.046875,
|
|
"learning_rate": 9.800000000000001e-05,
|
|
"loss": 10.196940612792968,
|
|
"mean_token_accuracy": 0.03835028558969498,
|
|
"num_tokens": 126780.0,
|
|
"step": 50
|
|
},
|
|
{
|
|
"entropy": 10.538235855102538,
|
|
"epoch": 0.05945945945945946,
|
|
"grad_norm": 1.8515625,
|
|
"learning_rate": 0.000108,
|
|
"loss": 9.862722778320313,
|
|
"mean_token_accuracy": 0.03907337710261345,
|
|
"num_tokens": 138322.0,
|
|
"step": 55
|
|
},
|
|
{
|
|
"entropy": 10.436158370971679,
|
|
"epoch": 0.06486486486486487,
|
|
"grad_norm": 1.9765625,
|
|
"learning_rate": 0.000118,
|
|
"loss": 9.546548461914062,
|
|
"mean_token_accuracy": 0.03616050221025944,
|
|
"num_tokens": 152679.0,
|
|
"step": 60
|
|
},
|
|
{
|
|
"entropy": 10.354158973693847,
|
|
"epoch": 0.07027027027027027,
|
|
"grad_norm": 1.7421875,
|
|
"learning_rate": 0.000128,
|
|
"loss": 9.224214172363281,
|
|
"mean_token_accuracy": 0.038402664661407473,
|
|
"num_tokens": 162848.0,
|
|
"step": 65
|
|
},
|
|
{
|
|
"entropy": 10.261932945251464,
|
|
"epoch": 0.07567567567567568,
|
|
"grad_norm": 1.6640625,
|
|
"learning_rate": 0.00013800000000000002,
|
|
"loss": 9.017792510986329,
|
|
"mean_token_accuracy": 0.037848640233278275,
|
|
"num_tokens": 178170.0,
|
|
"step": 70
|
|
},
|
|
{
|
|
"entropy": 10.09331226348877,
|
|
"epoch": 0.08108108108108109,
|
|
"grad_norm": 1.671875,
|
|
"learning_rate": 0.000148,
|
|
"loss": 8.539015197753907,
|
|
"mean_token_accuracy": 0.03686205819249153,
|
|
"num_tokens": 189845.0,
|
|
"step": 75
|
|
},
|
|
{
|
|
"entropy": 9.829462432861328,
|
|
"epoch": 0.08648648648648649,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.000158,
|
|
"loss": 8.27553939819336,
|
|
"mean_token_accuracy": 0.03745934441685676,
|
|
"num_tokens": 202943.0,
|
|
"step": 80
|
|
},
|
|
{
|
|
"entropy": 9.433079528808594,
|
|
"epoch": 0.0918918918918919,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00016800000000000002,
|
|
"loss": 8.054940795898437,
|
|
"mean_token_accuracy": 0.03733482360839844,
|
|
"num_tokens": 213981.0,
|
|
"step": 85
|
|
},
|
|
{
|
|
"entropy": 8.931513023376464,
|
|
"epoch": 0.0972972972972973,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.000178,
|
|
"loss": 7.836601257324219,
|
|
"mean_token_accuracy": 0.03742141723632812,
|
|
"num_tokens": 226516.0,
|
|
"step": 90
|
|
},
|
|
{
|
|
"entropy": 8.278807258605957,
|
|
"epoch": 0.10270270270270271,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 0.00018800000000000002,
|
|
"loss": 7.645230102539062,
|
|
"mean_token_accuracy": 0.038530788570642474,
|
|
"num_tokens": 236934.0,
|
|
"step": 95
|
|
},
|
|
{
|
|
"entropy": 7.783323097229004,
|
|
"epoch": 0.10810810810810811,
|
|
"grad_norm": 0.63671875,
|
|
"learning_rate": 0.00019800000000000002,
|
|
"loss": 7.529661560058594,
|
|
"mean_token_accuracy": 0.04016850292682648,
|
|
"num_tokens": 247638.0,
|
|
"step": 100
|
|
},
|
|
{
|
|
"entropy": 7.620136451721192,
|
|
"epoch": 0.11351351351351352,
|
|
"grad_norm": 0.65234375,
|
|
"learning_rate": 0.000208,
|
|
"loss": 7.58187255859375,
|
|
"mean_token_accuracy": 0.03762040063738823,
|
|
"num_tokens": 260647.0,
|
|
"step": 105
|
|
},
|
|
{
|
|
"entropy": 7.530057430267334,
|
|
"epoch": 0.11891891891891893,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.000218,
|
|
"loss": 7.458168029785156,
|
|
"mean_token_accuracy": 0.03727283701300621,
|
|
"num_tokens": 272033.0,
|
|
"step": 110
|
|
},
|
|
{
|
|
"entropy": 7.478269100189209,
|
|
"epoch": 0.12432432432432433,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 0.000228,
|
|
"loss": 7.519155883789063,
|
|
"mean_token_accuracy": 0.0388708658516407,
|
|
"num_tokens": 284046.0,
|
|
"step": 115
|
|
},
|
|
{
|
|
"entropy": 7.465256214141846,
|
|
"epoch": 0.12972972972972974,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 0.00023799999999999998,
|
|
"loss": 7.423601531982422,
|
|
"mean_token_accuracy": 0.037958408892154696,
|
|
"num_tokens": 294671.0,
|
|
"step": 120
|
|
},
|
|
{
|
|
"entropy": 7.6223400115966795,
|
|
"epoch": 0.13513513513513514,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.000248,
|
|
"loss": 7.408821105957031,
|
|
"mean_token_accuracy": 0.03943843990564346,
|
|
"num_tokens": 305267.0,
|
|
"step": 125
|
|
},
|
|
{
|
|
"entropy": 7.496581554412842,
|
|
"epoch": 0.14054054054054055,
|
|
"grad_norm": 0.6640625,
|
|
"learning_rate": 0.00025800000000000004,
|
|
"loss": 7.504977416992188,
|
|
"mean_token_accuracy": 0.03954529017210007,
|
|
"num_tokens": 316480.0,
|
|
"step": 130
|
|
},
|
|
{
|
|
"entropy": 7.595795345306397,
|
|
"epoch": 0.14594594594594595,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 0.000268,
|
|
"loss": 7.485077667236328,
|
|
"mean_token_accuracy": 0.04093076065182686,
|
|
"num_tokens": 328343.0,
|
|
"step": 135
|
|
},
|
|
{
|
|
"entropy": 7.389880180358887,
|
|
"epoch": 0.15135135135135136,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00027800000000000004,
|
|
"loss": 7.638716125488282,
|
|
"mean_token_accuracy": 0.03965384438633919,
|
|
"num_tokens": 341072.0,
|
|
"step": 140
|
|
},
|
|
{
|
|
"entropy": 7.676095676422119,
|
|
"epoch": 0.15675675675675677,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 0.000288,
|
|
"loss": 7.436899566650391,
|
|
"mean_token_accuracy": 0.04083571806550026,
|
|
"num_tokens": 353637.0,
|
|
"step": 145
|
|
},
|
|
{
|
|
"entropy": 7.392151641845703,
|
|
"epoch": 0.16216216216216217,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.000298,
|
|
"loss": 7.492266845703125,
|
|
"mean_token_accuracy": 0.04074482023715973,
|
|
"num_tokens": 366845.0,
|
|
"step": 150
|
|
},
|
|
{
|
|
"entropy": 7.501393413543701,
|
|
"epoch": 0.16756756756756758,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.000308,
|
|
"loss": 7.447349548339844,
|
|
"mean_token_accuracy": 0.04357003271579742,
|
|
"num_tokens": 379852.0,
|
|
"step": 155
|
|
},
|
|
{
|
|
"entropy": 7.460719776153565,
|
|
"epoch": 0.17297297297297298,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.00031800000000000003,
|
|
"loss": 7.461611938476563,
|
|
"mean_token_accuracy": 0.05375379621982575,
|
|
"num_tokens": 393017.0,
|
|
"step": 160
|
|
},
|
|
{
|
|
"entropy": 7.317601490020752,
|
|
"epoch": 0.1783783783783784,
|
|
"grad_norm": 0.62109375,
|
|
"learning_rate": 0.000328,
|
|
"loss": 7.4609222412109375,
|
|
"mean_token_accuracy": 0.06083732768893242,
|
|
"num_tokens": 405080.0,
|
|
"step": 165
|
|
},
|
|
{
|
|
"entropy": 7.453921985626221,
|
|
"epoch": 0.1837837837837838,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.00033800000000000003,
|
|
"loss": 7.478794097900391,
|
|
"mean_token_accuracy": 0.0638080045580864,
|
|
"num_tokens": 416562.0,
|
|
"step": 170
|
|
},
|
|
{
|
|
"entropy": 7.490277862548828,
|
|
"epoch": 0.1891891891891892,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.000348,
|
|
"loss": 7.457525634765625,
|
|
"mean_token_accuracy": 0.06417724341154099,
|
|
"num_tokens": 431085.0,
|
|
"step": 175
|
|
},
|
|
{
|
|
"entropy": 7.414785957336425,
|
|
"epoch": 0.1945945945945946,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 0.000358,
|
|
"loss": 7.350696563720703,
|
|
"mean_token_accuracy": 0.06525981873273849,
|
|
"num_tokens": 443530.0,
|
|
"step": 180
|
|
},
|
|
{
|
|
"entropy": 7.419140338897705,
|
|
"epoch": 0.2,
|
|
"grad_norm": 0.6484375,
|
|
"learning_rate": 0.000368,
|
|
"loss": 7.389920806884765,
|
|
"mean_token_accuracy": 0.07182540744543076,
|
|
"num_tokens": 454722.0,
|
|
"step": 185
|
|
},
|
|
{
|
|
"entropy": 7.397796249389648,
|
|
"epoch": 0.20540540540540542,
|
|
"grad_norm": 0.640625,
|
|
"learning_rate": 0.000378,
|
|
"loss": 7.342085266113282,
|
|
"mean_token_accuracy": 0.07431704550981522,
|
|
"num_tokens": 466162.0,
|
|
"step": 190
|
|
},
|
|
{
|
|
"entropy": 7.36507568359375,
|
|
"epoch": 0.21081081081081082,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 0.000388,
|
|
"loss": 7.353427124023438,
|
|
"mean_token_accuracy": 0.07438301593065262,
|
|
"num_tokens": 476489.0,
|
|
"step": 195
|
|
},
|
|
{
|
|
"entropy": 7.417136478424072,
|
|
"epoch": 0.21621621621621623,
|
|
"grad_norm": 0.67578125,
|
|
"learning_rate": 0.000398,
|
|
"loss": 7.341059875488281,
|
|
"mean_token_accuracy": 0.06952804177999497,
|
|
"num_tokens": 488243.0,
|
|
"step": 200
|
|
},
|
|
{
|
|
"entropy": 7.389842224121094,
|
|
"epoch": 0.22162162162162163,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 0.000408,
|
|
"loss": 7.386956024169922,
|
|
"mean_token_accuracy": 0.07643609791994095,
|
|
"num_tokens": 499212.0,
|
|
"step": 205
|
|
},
|
|
{
|
|
"entropy": 7.442728900909424,
|
|
"epoch": 0.22702702702702704,
|
|
"grad_norm": 0.65625,
|
|
"learning_rate": 0.00041799999999999997,
|
|
"loss": 7.313986968994141,
|
|
"mean_token_accuracy": 0.0721098467707634,
|
|
"num_tokens": 510690.0,
|
|
"step": 210
|
|
},
|
|
{
|
|
"entropy": 7.2722938537597654,
|
|
"epoch": 0.23243243243243245,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 0.000428,
|
|
"loss": 7.30157699584961,
|
|
"mean_token_accuracy": 0.0739034004509449,
|
|
"num_tokens": 523005.0,
|
|
"step": 215
|
|
},
|
|
{
|
|
"entropy": 7.434175109863281,
|
|
"epoch": 0.23783783783783785,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 0.000438,
|
|
"loss": 7.3041847229003904,
|
|
"mean_token_accuracy": 0.07309759110212326,
|
|
"num_tokens": 535212.0,
|
|
"step": 220
|
|
},
|
|
{
|
|
"entropy": 7.340867042541504,
|
|
"epoch": 0.24324324324324326,
|
|
"grad_norm": 0.62890625,
|
|
"learning_rate": 0.000448,
|
|
"loss": 7.266801452636718,
|
|
"mean_token_accuracy": 0.07607424259185791,
|
|
"num_tokens": 546523.0,
|
|
"step": 225
|
|
},
|
|
{
|
|
"entropy": 7.232867050170898,
|
|
"epoch": 0.24864864864864866,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.000458,
|
|
"loss": 7.171680450439453,
|
|
"mean_token_accuracy": 0.07834560871124267,
|
|
"num_tokens": 558036.0,
|
|
"step": 230
|
|
},
|
|
{
|
|
"entropy": 7.411350154876709,
|
|
"epoch": 0.25405405405405407,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 0.00046800000000000005,
|
|
"loss": 7.248665618896484,
|
|
"mean_token_accuracy": 0.07751285135746003,
|
|
"num_tokens": 570324.0,
|
|
"step": 235
|
|
},
|
|
{
|
|
"entropy": 7.22170934677124,
|
|
"epoch": 0.2594594594594595,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 0.00047799999999999996,
|
|
"loss": 7.253816223144531,
|
|
"mean_token_accuracy": 0.07464860528707504,
|
|
"num_tokens": 582950.0,
|
|
"step": 240
|
|
},
|
|
{
|
|
"entropy": 7.243322372436523,
|
|
"epoch": 0.2648648648648649,
|
|
"grad_norm": 0.609375,
|
|
"learning_rate": 0.000488,
|
|
"loss": 7.149346923828125,
|
|
"mean_token_accuracy": 0.08247889876365662,
|
|
"num_tokens": 594081.0,
|
|
"step": 245
|
|
},
|
|
{
|
|
"entropy": 7.186726856231689,
|
|
"epoch": 0.2702702702702703,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 0.000498,
|
|
"loss": 7.139888000488281,
|
|
"mean_token_accuracy": 0.08595664352178574,
|
|
"num_tokens": 605251.0,
|
|
"step": 250
|
|
},
|
|
{
|
|
"entropy": 7.1818643569946286,
|
|
"epoch": 0.2756756756756757,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 0.000508,
|
|
"loss": 7.17196044921875,
|
|
"mean_token_accuracy": 0.08519582152366638,
|
|
"num_tokens": 617223.0,
|
|
"step": 255
|
|
},
|
|
{
|
|
"entropy": 7.080172061920166,
|
|
"epoch": 0.2810810810810811,
|
|
"grad_norm": 0.61328125,
|
|
"learning_rate": 0.000518,
|
|
"loss": 7.089189147949218,
|
|
"mean_token_accuracy": 0.08611884564161301,
|
|
"num_tokens": 628737.0,
|
|
"step": 260
|
|
},
|
|
{
|
|
"entropy": 7.147446060180664,
|
|
"epoch": 0.2864864864864865,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.000528,
|
|
"loss": 7.04461898803711,
|
|
"mean_token_accuracy": 0.08524503260850906,
|
|
"num_tokens": 639493.0,
|
|
"step": 265
|
|
},
|
|
{
|
|
"entropy": 7.0829826354980465,
|
|
"epoch": 0.2918918918918919,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 0.0005380000000000001,
|
|
"loss": 7.018182373046875,
|
|
"mean_token_accuracy": 0.09309226870536805,
|
|
"num_tokens": 651215.0,
|
|
"step": 270
|
|
},
|
|
{
|
|
"entropy": 7.080189990997314,
|
|
"epoch": 0.2972972972972973,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 0.0005480000000000001,
|
|
"loss": 7.054932403564453,
|
|
"mean_token_accuracy": 0.08287097811698914,
|
|
"num_tokens": 664644.0,
|
|
"step": 275
|
|
},
|
|
{
|
|
"entropy": 7.1431303977966305,
|
|
"epoch": 0.3027027027027027,
|
|
"grad_norm": 0.6484375,
|
|
"learning_rate": 0.000558,
|
|
"loss": 7.087598419189453,
|
|
"mean_token_accuracy": 0.0870475098490715,
|
|
"num_tokens": 677139.0,
|
|
"step": 280
|
|
},
|
|
{
|
|
"entropy": 7.185227966308593,
|
|
"epoch": 0.3081081081081081,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 0.0005679999999999999,
|
|
"loss": 7.17745361328125,
|
|
"mean_token_accuracy": 0.0867692619562149,
|
|
"num_tokens": 689894.0,
|
|
"step": 285
|
|
},
|
|
{
|
|
"entropy": 7.046064186096191,
|
|
"epoch": 0.31351351351351353,
|
|
"grad_norm": 0.63671875,
|
|
"learning_rate": 0.000578,
|
|
"loss": 7.0239204406738285,
|
|
"mean_token_accuracy": 0.09042058289051055,
|
|
"num_tokens": 702300.0,
|
|
"step": 290
|
|
},
|
|
{
|
|
"entropy": 7.150553798675537,
|
|
"epoch": 0.31891891891891894,
|
|
"grad_norm": 0.65625,
|
|
"learning_rate": 0.000588,
|
|
"loss": 7.063279724121093,
|
|
"mean_token_accuracy": 0.08882811665534973,
|
|
"num_tokens": 713190.0,
|
|
"step": 295
|
|
},
|
|
{
|
|
"entropy": 7.059144687652588,
|
|
"epoch": 0.32432432432432434,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 0.000598,
|
|
"loss": 6.94993896484375,
|
|
"mean_token_accuracy": 0.0942073032259941,
|
|
"num_tokens": 724322.0,
|
|
"step": 300
|
|
},
|
|
{
|
|
"entropy": 6.999932956695557,
|
|
"epoch": 0.32972972972972975,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 0.000608,
|
|
"loss": 6.929829406738281,
|
|
"mean_token_accuracy": 0.09061438292264938,
|
|
"num_tokens": 735779.0,
|
|
"step": 305
|
|
},
|
|
{
|
|
"entropy": 6.916056346893311,
|
|
"epoch": 0.33513513513513515,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 0.0006180000000000001,
|
|
"loss": 6.898499298095703,
|
|
"mean_token_accuracy": 0.09576145559549332,
|
|
"num_tokens": 746939.0,
|
|
"step": 310
|
|
},
|
|
{
|
|
"entropy": 6.874477195739746,
|
|
"epoch": 0.34054054054054056,
|
|
"grad_norm": 0.65234375,
|
|
"learning_rate": 0.000628,
|
|
"loss": 6.854414367675782,
|
|
"mean_token_accuracy": 0.09072280377149582,
|
|
"num_tokens": 758395.0,
|
|
"step": 315
|
|
},
|
|
{
|
|
"entropy": 7.106177234649659,
|
|
"epoch": 0.34594594594594597,
|
|
"grad_norm": 0.66015625,
|
|
"learning_rate": 0.000638,
|
|
"loss": 7.086619567871094,
|
|
"mean_token_accuracy": 0.09368456453084946,
|
|
"num_tokens": 770439.0,
|
|
"step": 320
|
|
},
|
|
{
|
|
"entropy": 7.064824867248535,
|
|
"epoch": 0.35135135135135137,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.000648,
|
|
"loss": 7.107695007324219,
|
|
"mean_token_accuracy": 0.08414219319820404,
|
|
"num_tokens": 786745.0,
|
|
"step": 325
|
|
},
|
|
{
|
|
"entropy": 6.824825382232666,
|
|
"epoch": 0.3567567567567568,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 0.0006580000000000001,
|
|
"loss": 6.873025512695312,
|
|
"mean_token_accuracy": 0.09536780565977096,
|
|
"num_tokens": 796900.0,
|
|
"step": 330
|
|
},
|
|
{
|
|
"entropy": 6.899827575683593,
|
|
"epoch": 0.3621621621621622,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0006680000000000001,
|
|
"loss": 6.8659309387207035,
|
|
"mean_token_accuracy": 0.09452889859676361,
|
|
"num_tokens": 808484.0,
|
|
"step": 335
|
|
},
|
|
{
|
|
"entropy": 7.07827615737915,
|
|
"epoch": 0.3675675675675676,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 0.0006780000000000001,
|
|
"loss": 7.063574981689453,
|
|
"mean_token_accuracy": 0.09114441871643067,
|
|
"num_tokens": 820125.0,
|
|
"step": 340
|
|
},
|
|
{
|
|
"entropy": 6.911789226531982,
|
|
"epoch": 0.372972972972973,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0006879999999999999,
|
|
"loss": 6.837258148193359,
|
|
"mean_token_accuracy": 0.10115662217140198,
|
|
"num_tokens": 831787.0,
|
|
"step": 345
|
|
},
|
|
{
|
|
"entropy": 6.751354217529297,
|
|
"epoch": 0.3783783783783784,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0006979999999999999,
|
|
"loss": 6.795095825195313,
|
|
"mean_token_accuracy": 0.10106057971715927,
|
|
"num_tokens": 842992.0,
|
|
"step": 350
|
|
},
|
|
{
|
|
"entropy": 6.851361846923828,
|
|
"epoch": 0.3837837837837838,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.000708,
|
|
"loss": 6.831424713134766,
|
|
"mean_token_accuracy": 0.0954001784324646,
|
|
"num_tokens": 855636.0,
|
|
"step": 355
|
|
},
|
|
{
|
|
"entropy": 6.8148805618286135,
|
|
"epoch": 0.3891891891891892,
|
|
"grad_norm": 0.6640625,
|
|
"learning_rate": 0.000718,
|
|
"loss": 6.837454986572266,
|
|
"mean_token_accuracy": 0.09592621475458145,
|
|
"num_tokens": 866664.0,
|
|
"step": 360
|
|
},
|
|
{
|
|
"entropy": 6.85852575302124,
|
|
"epoch": 0.3945945945945946,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 0.000728,
|
|
"loss": 6.818362426757813,
|
|
"mean_token_accuracy": 0.09673329740762711,
|
|
"num_tokens": 876702.0,
|
|
"step": 365
|
|
},
|
|
{
|
|
"entropy": 6.8342584609985355,
|
|
"epoch": 0.4,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.000738,
|
|
"loss": 6.828379058837891,
|
|
"mean_token_accuracy": 0.10096636265516282,
|
|
"num_tokens": 887866.0,
|
|
"step": 370
|
|
},
|
|
{
|
|
"entropy": 6.858696842193604,
|
|
"epoch": 0.40540540540540543,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 0.000748,
|
|
"loss": 6.872694396972657,
|
|
"mean_token_accuracy": 0.1039510726928711,
|
|
"num_tokens": 898200.0,
|
|
"step": 375
|
|
},
|
|
{
|
|
"entropy": 6.809317970275879,
|
|
"epoch": 0.41081081081081083,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 0.000758,
|
|
"loss": 6.88883056640625,
|
|
"mean_token_accuracy": 0.09990563690662384,
|
|
"num_tokens": 912550.0,
|
|
"step": 380
|
|
},
|
|
{
|
|
"entropy": 6.892767333984375,
|
|
"epoch": 0.41621621621621624,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 0.000768,
|
|
"loss": 6.792707824707032,
|
|
"mean_token_accuracy": 0.10181351602077485,
|
|
"num_tokens": 922728.0,
|
|
"step": 385
|
|
},
|
|
{
|
|
"entropy": 6.767278099060059,
|
|
"epoch": 0.42162162162162165,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.000778,
|
|
"loss": 6.740338134765625,
|
|
"mean_token_accuracy": 0.10379333794116974,
|
|
"num_tokens": 933323.0,
|
|
"step": 390
|
|
},
|
|
{
|
|
"entropy": 6.840473747253418,
|
|
"epoch": 0.42702702702702705,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0007880000000000001,
|
|
"loss": 6.9275146484375,
|
|
"mean_token_accuracy": 0.09510410130023957,
|
|
"num_tokens": 947864.0,
|
|
"step": 395
|
|
},
|
|
{
|
|
"entropy": 6.913839817047119,
|
|
"epoch": 0.43243243243243246,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0007980000000000001,
|
|
"loss": 6.987394714355469,
|
|
"mean_token_accuracy": 0.09437586069107055,
|
|
"num_tokens": 962042.0,
|
|
"step": 400
|
|
},
|
|
{
|
|
"entropy": 6.79087553024292,
|
|
"epoch": 0.43783783783783786,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.000808,
|
|
"loss": 6.878759765625,
|
|
"mean_token_accuracy": 0.10361665934324264,
|
|
"num_tokens": 977434.0,
|
|
"step": 405
|
|
},
|
|
{
|
|
"entropy": 6.740821361541748,
|
|
"epoch": 0.44324324324324327,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0008179999999999999,
|
|
"loss": 6.766633605957031,
|
|
"mean_token_accuracy": 0.10389182120561599,
|
|
"num_tokens": 989656.0,
|
|
"step": 410
|
|
},
|
|
{
|
|
"entropy": 6.853046607971192,
|
|
"epoch": 0.4486486486486487,
|
|
"grad_norm": 0.640625,
|
|
"learning_rate": 0.000828,
|
|
"loss": 6.767631530761719,
|
|
"mean_token_accuracy": 0.10301467031240463,
|
|
"num_tokens": 1000860.0,
|
|
"step": 415
|
|
},
|
|
{
|
|
"entropy": 6.734612083435058,
|
|
"epoch": 0.4540540540540541,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 0.000838,
|
|
"loss": 6.748469543457031,
|
|
"mean_token_accuracy": 0.10394396185874939,
|
|
"num_tokens": 1013873.0,
|
|
"step": 420
|
|
},
|
|
{
|
|
"entropy": 6.597353744506836,
|
|
"epoch": 0.4594594594594595,
|
|
"grad_norm": 0.67578125,
|
|
"learning_rate": 0.000848,
|
|
"loss": 6.686911010742188,
|
|
"mean_token_accuracy": 0.10376572757959365,
|
|
"num_tokens": 1026491.0,
|
|
"step": 425
|
|
},
|
|
{
|
|
"entropy": 6.775363540649414,
|
|
"epoch": 0.4648648648648649,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 0.000858,
|
|
"loss": 6.683805084228515,
|
|
"mean_token_accuracy": 0.10709702819585801,
|
|
"num_tokens": 1038482.0,
|
|
"step": 430
|
|
},
|
|
{
|
|
"entropy": 6.601847457885742,
|
|
"epoch": 0.4702702702702703,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 0.0008680000000000001,
|
|
"loss": 6.725534820556641,
|
|
"mean_token_accuracy": 0.10785069316625595,
|
|
"num_tokens": 1051344.0,
|
|
"step": 435
|
|
},
|
|
{
|
|
"entropy": 6.743765640258789,
|
|
"epoch": 0.4756756756756757,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.000878,
|
|
"loss": 6.694649505615234,
|
|
"mean_token_accuracy": 0.10876548141241074,
|
|
"num_tokens": 1061586.0,
|
|
"step": 440
|
|
},
|
|
{
|
|
"entropy": 6.715018367767334,
|
|
"epoch": 0.4810810810810811,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.000888,
|
|
"loss": 6.717233276367187,
|
|
"mean_token_accuracy": 0.10967092216014862,
|
|
"num_tokens": 1072086.0,
|
|
"step": 445
|
|
},
|
|
{
|
|
"entropy": 6.717541790008545,
|
|
"epoch": 0.4864864864864865,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.000898,
|
|
"loss": 6.69256591796875,
|
|
"mean_token_accuracy": 0.10869137644767761,
|
|
"num_tokens": 1084788.0,
|
|
"step": 450
|
|
},
|
|
{
|
|
"entropy": 6.390600490570068,
|
|
"epoch": 0.4918918918918919,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0009080000000000001,
|
|
"loss": 6.499176788330078,
|
|
"mean_token_accuracy": 0.11725788116455078,
|
|
"num_tokens": 1096558.0,
|
|
"step": 455
|
|
},
|
|
{
|
|
"entropy": 6.706469345092773,
|
|
"epoch": 0.4972972972972973,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.0009180000000000001,
|
|
"loss": 6.638755798339844,
|
|
"mean_token_accuracy": 0.11198882460594177,
|
|
"num_tokens": 1107370.0,
|
|
"step": 460
|
|
},
|
|
{
|
|
"entropy": 6.591896820068359,
|
|
"epoch": 0.5027027027027027,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0009280000000000001,
|
|
"loss": 6.637400817871094,
|
|
"mean_token_accuracy": 0.10757572948932648,
|
|
"num_tokens": 1120205.0,
|
|
"step": 465
|
|
},
|
|
{
|
|
"entropy": 6.832434177398682,
|
|
"epoch": 0.5081081081081081,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 0.0009379999999999999,
|
|
"loss": 6.848423767089844,
|
|
"mean_token_accuracy": 0.10572721362113953,
|
|
"num_tokens": 1135282.0,
|
|
"step": 470
|
|
},
|
|
{
|
|
"entropy": 6.580890464782715,
|
|
"epoch": 0.5135135135135135,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.000948,
|
|
"loss": 6.709358978271484,
|
|
"mean_token_accuracy": 0.10477431863546371,
|
|
"num_tokens": 1149554.0,
|
|
"step": 475
|
|
},
|
|
{
|
|
"entropy": 6.7246020317077635,
|
|
"epoch": 0.518918918918919,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.000958,
|
|
"loss": 6.709073638916015,
|
|
"mean_token_accuracy": 0.10875285863876342,
|
|
"num_tokens": 1161739.0,
|
|
"step": 480
|
|
},
|
|
{
|
|
"entropy": 6.6759847640991214,
|
|
"epoch": 0.5243243243243243,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 0.000968,
|
|
"loss": 6.595793914794922,
|
|
"mean_token_accuracy": 0.11315198093652726,
|
|
"num_tokens": 1173650.0,
|
|
"step": 485
|
|
},
|
|
{
|
|
"entropy": 6.549227523803711,
|
|
"epoch": 0.5297297297297298,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 0.000978,
|
|
"loss": 6.6798255920410154,
|
|
"mean_token_accuracy": 0.11241919845342636,
|
|
"num_tokens": 1185551.0,
|
|
"step": 490
|
|
},
|
|
{
|
|
"entropy": 6.744762134552002,
|
|
"epoch": 0.5351351351351351,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 0.000988,
|
|
"loss": 6.765760040283203,
|
|
"mean_token_accuracy": 0.106291264295578,
|
|
"num_tokens": 1199600.0,
|
|
"step": 495
|
|
},
|
|
{
|
|
"entropy": 6.61545238494873,
|
|
"epoch": 0.5405405405405406,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 0.000998,
|
|
"loss": 6.682843017578125,
|
|
"mean_token_accuracy": 0.10700990110635758,
|
|
"num_tokens": 1210465.0,
|
|
"step": 500
|
|
},
|
|
{
|
|
"entropy": 6.683747100830078,
|
|
"epoch": 0.5459459459459459,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0009999979169398642,
|
|
"loss": 6.590595245361328,
|
|
"mean_token_accuracy": 0.11202836632728577,
|
|
"num_tokens": 1221297.0,
|
|
"step": 505
|
|
},
|
|
{
|
|
"entropy": 6.556936645507813,
|
|
"epoch": 0.5513513513513514,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 0.0009999894545411141,
|
|
"loss": 6.64039306640625,
|
|
"mean_token_accuracy": 0.10924990326166154,
|
|
"num_tokens": 1233805.0,
|
|
"step": 510
|
|
},
|
|
{
|
|
"entropy": 6.645992183685303,
|
|
"epoch": 0.5567567567567567,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0009999744827348116,
|
|
"loss": 6.720680236816406,
|
|
"mean_token_accuracy": 0.10662575513124466,
|
|
"num_tokens": 1245747.0,
|
|
"step": 515
|
|
},
|
|
{
|
|
"entropy": 6.560120868682861,
|
|
"epoch": 0.5621621621621622,
|
|
"grad_norm": 0.61328125,
|
|
"learning_rate": 0.0009999530017375344,
|
|
"loss": 6.516216278076172,
|
|
"mean_token_accuracy": 0.12112323045730591,
|
|
"num_tokens": 1257310.0,
|
|
"step": 520
|
|
},
|
|
{
|
|
"entropy": 6.676382350921631,
|
|
"epoch": 0.5675675675675675,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0009999250118600195,
|
|
"loss": 6.705149841308594,
|
|
"mean_token_accuracy": 0.11206594407558441,
|
|
"num_tokens": 1269216.0,
|
|
"step": 525
|
|
},
|
|
{
|
|
"entropy": 6.643038272857666,
|
|
"epoch": 0.572972972972973,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 0.0009998905135071602,
|
|
"loss": 6.58680419921875,
|
|
"mean_token_accuracy": 0.11697860062122345,
|
|
"num_tokens": 1279711.0,
|
|
"step": 530
|
|
},
|
|
{
|
|
"entropy": 6.546832656860351,
|
|
"epoch": 0.5783783783783784,
|
|
"grad_norm": 0.66015625,
|
|
"learning_rate": 0.0009998495071779987,
|
|
"loss": 6.6342926025390625,
|
|
"mean_token_accuracy": 0.11330044567584992,
|
|
"num_tokens": 1292958.0,
|
|
"step": 535
|
|
},
|
|
{
|
|
"entropy": 6.735915756225586,
|
|
"epoch": 0.5837837837837838,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 0.0009998019934657199,
|
|
"loss": 6.7581428527832035,
|
|
"mean_token_accuracy": 0.11686633378267289,
|
|
"num_tokens": 1304082.0,
|
|
"step": 540
|
|
},
|
|
{
|
|
"entropy": 6.588940620422363,
|
|
"epoch": 0.5891891891891892,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0009997479730576423,
|
|
"loss": 6.639595794677734,
|
|
"mean_token_accuracy": 0.11487565338611602,
|
|
"num_tokens": 1315789.0,
|
|
"step": 545
|
|
},
|
|
{
|
|
"entropy": 6.542739009857177,
|
|
"epoch": 0.5945945945945946,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 0.0009996874467352087,
|
|
"loss": 6.549444580078125,
|
|
"mean_token_accuracy": 0.11959983855485916,
|
|
"num_tokens": 1327191.0,
|
|
"step": 550
|
|
},
|
|
{
|
|
"entropy": 6.606736755371093,
|
|
"epoch": 0.6,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 0.0009996204153739734,
|
|
"loss": 6.549032592773438,
|
|
"mean_token_accuracy": 0.12100645154714584,
|
|
"num_tokens": 1338645.0,
|
|
"step": 555
|
|
},
|
|
{
|
|
"entropy": 6.521855735778809,
|
|
"epoch": 0.6054054054054054,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 0.0009995468799435915,
|
|
"loss": 6.569098663330078,
|
|
"mean_token_accuracy": 0.11854373812675476,
|
|
"num_tokens": 1349881.0,
|
|
"step": 560
|
|
},
|
|
{
|
|
"entropy": 6.549165916442871,
|
|
"epoch": 0.6108108108108108,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 0.000999466841507804,
|
|
"loss": 6.494113159179688,
|
|
"mean_token_accuracy": 0.12339054346084595,
|
|
"num_tokens": 1361468.0,
|
|
"step": 565
|
|
},
|
|
{
|
|
"entropy": 6.537939643859863,
|
|
"epoch": 0.6162162162162163,
|
|
"grad_norm": 0.6640625,
|
|
"learning_rate": 0.0009993803012244217,
|
|
"loss": 6.537962341308594,
|
|
"mean_token_accuracy": 0.11801687628030777,
|
|
"num_tokens": 1373363.0,
|
|
"step": 570
|
|
},
|
|
{
|
|
"entropy": 6.479009532928467,
|
|
"epoch": 0.6216216216216216,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0009992872603453097,
|
|
"loss": 6.545735168457031,
|
|
"mean_token_accuracy": 0.11801871210336685,
|
|
"num_tokens": 1385614.0,
|
|
"step": 575
|
|
},
|
|
{
|
|
"entropy": 6.627403926849365,
|
|
"epoch": 0.6270270270270271,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 0.000999187720216368,
|
|
"loss": 6.656562805175781,
|
|
"mean_token_accuracy": 0.11987384706735611,
|
|
"num_tokens": 1398553.0,
|
|
"step": 580
|
|
},
|
|
{
|
|
"entropy": 6.601816844940186,
|
|
"epoch": 0.6324324324324324,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 0.0009990816822775135,
|
|
"loss": 6.55546875,
|
|
"mean_token_accuracy": 0.1271597623825073,
|
|
"num_tokens": 1409953.0,
|
|
"step": 585
|
|
},
|
|
{
|
|
"entropy": 6.650836849212647,
|
|
"epoch": 0.6378378378378379,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 0.000998969148062658,
|
|
"loss": 6.66297607421875,
|
|
"mean_token_accuracy": 0.11517720967531205,
|
|
"num_tokens": 1423190.0,
|
|
"step": 590
|
|
},
|
|
{
|
|
"entropy": 6.5727849960327145,
|
|
"epoch": 0.6432432432432432,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 0.0009988501191996863,
|
|
"loss": 6.533869934082031,
|
|
"mean_token_accuracy": 0.12116028219461442,
|
|
"num_tokens": 1434088.0,
|
|
"step": 595
|
|
},
|
|
{
|
|
"entropy": 6.3762282371521,
|
|
"epoch": 0.6486486486486487,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 0.0009987245974104333,
|
|
"loss": 6.47516098022461,
|
|
"mean_token_accuracy": 0.1226390540599823,
|
|
"num_tokens": 1447355.0,
|
|
"step": 600
|
|
},
|
|
{
|
|
"entropy": 6.464574718475342,
|
|
"epoch": 0.654054054054054,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0009985925845106577,
|
|
"loss": 6.44190673828125,
|
|
"mean_token_accuracy": 0.12635250836610795,
|
|
"num_tokens": 1458581.0,
|
|
"step": 605
|
|
},
|
|
{
|
|
"entropy": 6.3286590576171875,
|
|
"epoch": 0.6594594594594595,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 0.0009984540824100174,
|
|
"loss": 6.349403762817383,
|
|
"mean_token_accuracy": 0.12394919246435165,
|
|
"num_tokens": 1469271.0,
|
|
"step": 610
|
|
},
|
|
{
|
|
"entropy": 6.5246072769165036,
|
|
"epoch": 0.6648648648648648,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 0.0009983090931120408,
|
|
"loss": 6.45703125,
|
|
"mean_token_accuracy": 0.12573732286691666,
|
|
"num_tokens": 1480424.0,
|
|
"step": 615
|
|
},
|
|
{
|
|
"entropy": 6.471957397460938,
|
|
"epoch": 0.6702702702702703,
|
|
"grad_norm": 0.66796875,
|
|
"learning_rate": 0.0009981576187140977,
|
|
"loss": 6.520024108886719,
|
|
"mean_token_accuracy": 0.11777724027633667,
|
|
"num_tokens": 1493735.0,
|
|
"step": 620
|
|
},
|
|
{
|
|
"entropy": 6.543122959136963,
|
|
"epoch": 0.6756756756756757,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 0.00099799966140737,
|
|
"loss": 6.515281677246094,
|
|
"mean_token_accuracy": 0.11840547770261764,
|
|
"num_tokens": 1507102.0,
|
|
"step": 625
|
|
},
|
|
{
|
|
"entropy": 6.470473766326904,
|
|
"epoch": 0.6810810810810811,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 0.0009978352234768185,
|
|
"loss": 6.454793548583984,
|
|
"mean_token_accuracy": 0.12399042546749114,
|
|
"num_tokens": 1518558.0,
|
|
"step": 630
|
|
},
|
|
{
|
|
"entropy": 6.380885028839112,
|
|
"epoch": 0.6864864864864865,
|
|
"grad_norm": 0.63671875,
|
|
"learning_rate": 0.0009976643073011516,
|
|
"loss": 6.444398498535156,
|
|
"mean_token_accuracy": 0.1253846377134323,
|
|
"num_tokens": 1531262.0,
|
|
"step": 635
|
|
},
|
|
{
|
|
"entropy": 6.53573751449585,
|
|
"epoch": 0.6918918918918919,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0009974869153527893,
|
|
"loss": 6.399496459960938,
|
|
"mean_token_accuracy": 0.12655056715011598,
|
|
"num_tokens": 1541964.0,
|
|
"step": 640
|
|
},
|
|
{
|
|
"entropy": 6.5604249954223635,
|
|
"epoch": 0.6972972972972973,
|
|
"grad_norm": 0.6484375,
|
|
"learning_rate": 0.0009973030501978287,
|
|
"loss": 6.581614685058594,
|
|
"mean_token_accuracy": 0.12558400630950928,
|
|
"num_tokens": 1554347.0,
|
|
"step": 645
|
|
},
|
|
{
|
|
"entropy": 6.4987060546875,
|
|
"epoch": 0.7027027027027027,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0009971127144960056,
|
|
"loss": 6.543399047851563,
|
|
"mean_token_accuracy": 0.11906942576169968,
|
|
"num_tokens": 1565717.0,
|
|
"step": 650
|
|
},
|
|
{
|
|
"entropy": 6.46410551071167,
|
|
"epoch": 0.7081081081081081,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.0009969159110006574,
|
|
"loss": 6.444772338867187,
|
|
"mean_token_accuracy": 0.12645898312330245,
|
|
"num_tokens": 1579868.0,
|
|
"step": 655
|
|
},
|
|
{
|
|
"entropy": 6.5014301300048825,
|
|
"epoch": 0.7135135135135136,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 0.0009967126425586821,
|
|
"loss": 6.587330627441406,
|
|
"mean_token_accuracy": 0.11874048858880996,
|
|
"num_tokens": 1593391.0,
|
|
"step": 660
|
|
},
|
|
{
|
|
"entropy": 6.543860626220703,
|
|
"epoch": 0.7189189189189189,
|
|
"grad_norm": 0.67578125,
|
|
"learning_rate": 0.0009965029121104978,
|
|
"loss": 6.405085754394531,
|
|
"mean_token_accuracy": 0.12694377601146697,
|
|
"num_tokens": 1604787.0,
|
|
"step": 665
|
|
},
|
|
{
|
|
"entropy": 6.407235908508301,
|
|
"epoch": 0.7243243243243244,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0009962867226900002,
|
|
"loss": 6.4062744140625,
|
|
"mean_token_accuracy": 0.13111316710710524,
|
|
"num_tokens": 1616824.0,
|
|
"step": 670
|
|
},
|
|
{
|
|
"entropy": 6.452020835876465,
|
|
"epoch": 0.7297297297297297,
|
|
"grad_norm": 0.66015625,
|
|
"learning_rate": 0.0009960640774245178,
|
|
"loss": 6.551805877685547,
|
|
"mean_token_accuracy": 0.12295851409435272,
|
|
"num_tokens": 1630342.0,
|
|
"step": 675
|
|
},
|
|
{
|
|
"entropy": 6.499637317657471,
|
|
"epoch": 0.7351351351351352,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 0.000995834979534768,
|
|
"loss": 6.363913345336914,
|
|
"mean_token_accuracy": 0.12563441097736358,
|
|
"num_tokens": 1641408.0,
|
|
"step": 680
|
|
},
|
|
{
|
|
"entropy": 6.448514842987061,
|
|
"epoch": 0.7405405405405405,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 0.0009955994323348099,
|
|
"loss": 6.408490753173828,
|
|
"mean_token_accuracy": 0.1317383110523224,
|
|
"num_tokens": 1651883.0,
|
|
"step": 685
|
|
},
|
|
{
|
|
"entropy": 6.435086631774903,
|
|
"epoch": 0.745945945945946,
|
|
"grad_norm": 0.64453125,
|
|
"learning_rate": 0.0009953574392319957,
|
|
"loss": 6.545511627197266,
|
|
"mean_token_accuracy": 0.1223674014210701,
|
|
"num_tokens": 1664072.0,
|
|
"step": 690
|
|
},
|
|
{
|
|
"entropy": 6.510448932647705,
|
|
"epoch": 0.7513513513513513,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 0.0009951090037269227,
|
|
"loss": 6.41370849609375,
|
|
"mean_token_accuracy": 0.1299304783344269,
|
|
"num_tokens": 1674700.0,
|
|
"step": 695
|
|
},
|
|
{
|
|
"entropy": 6.48358678817749,
|
|
"epoch": 0.7567567567567568,
|
|
"grad_norm": 0.6171875,
|
|
"learning_rate": 0.0009948541294133814,
|
|
"loss": 6.419948577880859,
|
|
"mean_token_accuracy": 0.12766341418027877,
|
|
"num_tokens": 1686904.0,
|
|
"step": 700
|
|
},
|
|
{
|
|
"entropy": 6.349936676025391,
|
|
"epoch": 0.7621621621621621,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0009945928199783045,
|
|
"loss": 6.360983276367188,
|
|
"mean_token_accuracy": 0.12935958206653594,
|
|
"num_tokens": 1697405.0,
|
|
"step": 705
|
|
},
|
|
{
|
|
"entropy": 6.458889198303223,
|
|
"epoch": 0.7675675675675676,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.000994325079201713,
|
|
"loss": 6.436622619628906,
|
|
"mean_token_accuracy": 0.1231964647769928,
|
|
"num_tokens": 1710080.0,
|
|
"step": 710
|
|
},
|
|
{
|
|
"entropy": 6.387947845458984,
|
|
"epoch": 0.772972972972973,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 0.000994050910956662,
|
|
"loss": 6.422445678710938,
|
|
"mean_token_accuracy": 0.12537443786859512,
|
|
"num_tokens": 1720806.0,
|
|
"step": 715
|
|
},
|
|
{
|
|
"entropy": 6.53485517501831,
|
|
"epoch": 0.7783783783783784,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0009937703192091838,
|
|
"loss": 6.561003112792969,
|
|
"mean_token_accuracy": 0.12541060745716096,
|
|
"num_tokens": 1733954.0,
|
|
"step": 720
|
|
},
|
|
{
|
|
"entropy": 6.565542984008789,
|
|
"epoch": 0.7837837837837838,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0009934833080182312,
|
|
"loss": 6.664936828613281,
|
|
"mean_token_accuracy": 0.11592512726783752,
|
|
"num_tokens": 1750530.0,
|
|
"step": 725
|
|
},
|
|
{
|
|
"entropy": 6.544071006774902,
|
|
"epoch": 0.7891891891891892,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.0009931898815356195,
|
|
"loss": 6.30921516418457,
|
|
"mean_token_accuracy": 0.13176991939544677,
|
|
"num_tokens": 1761753.0,
|
|
"step": 730
|
|
},
|
|
{
|
|
"entropy": 6.328976345062256,
|
|
"epoch": 0.7945945945945946,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0009928900440059642,
|
|
"loss": 6.360004425048828,
|
|
"mean_token_accuracy": 0.1312493145465851,
|
|
"num_tokens": 1774628.0,
|
|
"step": 735
|
|
},
|
|
{
|
|
"entropy": 6.464595794677734,
|
|
"epoch": 0.8,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0009925837997666225,
|
|
"loss": 6.57813720703125,
|
|
"mean_token_accuracy": 0.11741591542959214,
|
|
"num_tokens": 1788735.0,
|
|
"step": 740
|
|
},
|
|
{
|
|
"entropy": 6.5051695823669435,
|
|
"epoch": 0.8054054054054054,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 0.000992271153247628,
|
|
"loss": 6.288795471191406,
|
|
"mean_token_accuracy": 0.12631202042102813,
|
|
"num_tokens": 1800014.0,
|
|
"step": 745
|
|
},
|
|
{
|
|
"entropy": 6.274956226348877,
|
|
"epoch": 0.8108108108108109,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 0.000991952108971628,
|
|
"loss": 6.370751953125,
|
|
"mean_token_accuracy": 0.12875936627388002,
|
|
"num_tokens": 1813103.0,
|
|
"step": 750
|
|
},
|
|
{
|
|
"entropy": 6.399552536010742,
|
|
"epoch": 0.8162162162162162,
|
|
"grad_norm": 0.65234375,
|
|
"learning_rate": 0.000991626671553818,
|
|
"loss": 6.457389831542969,
|
|
"mean_token_accuracy": 0.12979597598314285,
|
|
"num_tokens": 1826686.0,
|
|
"step": 755
|
|
},
|
|
{
|
|
"entropy": 6.470718097686768,
|
|
"epoch": 0.8216216216216217,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 0.0009912948457018744,
|
|
"loss": 6.337436676025391,
|
|
"mean_token_accuracy": 0.13230464309453965,
|
|
"num_tokens": 1836998.0,
|
|
"step": 760
|
|
},
|
|
{
|
|
"entropy": 6.344214057922363,
|
|
"epoch": 0.827027027027027,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.000990956636215887,
|
|
"loss": 6.333858489990234,
|
|
"mean_token_accuracy": 0.1353505551815033,
|
|
"num_tokens": 1847374.0,
|
|
"step": 765
|
|
},
|
|
{
|
|
"entropy": 6.359791374206543,
|
|
"epoch": 0.8324324324324325,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 0.0009906120479882886,
|
|
"loss": 6.3227790832519535,
|
|
"mean_token_accuracy": 0.1333004355430603,
|
|
"num_tokens": 1858150.0,
|
|
"step": 770
|
|
},
|
|
{
|
|
"entropy": 6.303346157073975,
|
|
"epoch": 0.8378378378378378,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 0.0009902610860037858,
|
|
"loss": 6.3098808288574215,
|
|
"mean_token_accuracy": 0.13155746459960938,
|
|
"num_tokens": 1869918.0,
|
|
"step": 775
|
|
},
|
|
{
|
|
"entropy": 6.387551975250244,
|
|
"epoch": 0.8432432432432433,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 0.0009899037553392854,
|
|
"loss": 6.361277389526367,
|
|
"mean_token_accuracy": 0.1288209542632103,
|
|
"num_tokens": 1881370.0,
|
|
"step": 780
|
|
},
|
|
{
|
|
"entropy": 6.42662878036499,
|
|
"epoch": 0.8486486486486486,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0009895400611638217,
|
|
"loss": 6.373783874511719,
|
|
"mean_token_accuracy": 0.13027686178684234,
|
|
"num_tokens": 1894290.0,
|
|
"step": 785
|
|
},
|
|
{
|
|
"entropy": 6.364730930328369,
|
|
"epoch": 0.8540540540540541,
|
|
"grad_norm": 0.62109375,
|
|
"learning_rate": 0.0009891700087384817,
|
|
"loss": 6.312982177734375,
|
|
"mean_token_accuracy": 0.12889572829008103,
|
|
"num_tokens": 1906844.0,
|
|
"step": 790
|
|
},
|
|
{
|
|
"entropy": 6.3491747856140135,
|
|
"epoch": 0.8594594594594595,
|
|
"grad_norm": 0.6640625,
|
|
"learning_rate": 0.0009887936034163286,
|
|
"loss": 6.410205078125,
|
|
"mean_token_accuracy": 0.13014759868383408,
|
|
"num_tokens": 1920582.0,
|
|
"step": 795
|
|
},
|
|
{
|
|
"entropy": 6.388109493255615,
|
|
"epoch": 0.8648648648648649,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 0.000988410850642325,
|
|
"loss": 6.3361869812011715,
|
|
"mean_token_accuracy": 0.1333713099360466,
|
|
"num_tokens": 1933269.0,
|
|
"step": 800
|
|
},
|
|
{
|
|
"entropy": 6.265689182281494,
|
|
"epoch": 0.8702702702702703,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.000988021755953253,
|
|
"loss": 6.249768447875977,
|
|
"mean_token_accuracy": 0.1422581344842911,
|
|
"num_tokens": 1944152.0,
|
|
"step": 805
|
|
},
|
|
{
|
|
"entropy": 6.4430389404296875,
|
|
"epoch": 0.8756756756756757,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.000987626324977636,
|
|
"loss": 6.367038726806641,
|
|
"mean_token_accuracy": 0.13419689387083053,
|
|
"num_tokens": 1955710.0,
|
|
"step": 810
|
|
},
|
|
{
|
|
"entropy": 6.3380763053894045,
|
|
"epoch": 0.8810810810810811,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 0.0009872245634356554,
|
|
"loss": 6.311883544921875,
|
|
"mean_token_accuracy": 0.1359546884894371,
|
|
"num_tokens": 1967113.0,
|
|
"step": 815
|
|
},
|
|
{
|
|
"entropy": 6.3658100128173825,
|
|
"epoch": 0.8864864864864865,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 0.0009868164771390687,
|
|
"loss": 6.33122444152832,
|
|
"mean_token_accuracy": 0.13497747331857682,
|
|
"num_tokens": 1977560.0,
|
|
"step": 820
|
|
},
|
|
{
|
|
"entropy": 6.46645040512085,
|
|
"epoch": 0.8918918918918919,
|
|
"grad_norm": 0.66796875,
|
|
"learning_rate": 0.000986402071991125,
|
|
"loss": 6.378009414672851,
|
|
"mean_token_accuracy": 0.13366190791130067,
|
|
"num_tokens": 1989667.0,
|
|
"step": 825
|
|
},
|
|
{
|
|
"entropy": 6.378485488891601,
|
|
"epoch": 0.8972972972972973,
|
|
"grad_norm": 0.6640625,
|
|
"learning_rate": 0.0009859813539864811,
|
|
"loss": 6.45841064453125,
|
|
"mean_token_accuracy": 0.131469164788723,
|
|
"num_tokens": 2003856.0,
|
|
"step": 830
|
|
},
|
|
{
|
|
"entropy": 6.371240234375,
|
|
"epoch": 0.9027027027027027,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 0.0009855543292111124,
|
|
"loss": 6.337836074829101,
|
|
"mean_token_accuracy": 0.13160819709300994,
|
|
"num_tokens": 2016349.0,
|
|
"step": 835
|
|
},
|
|
{
|
|
"entropy": 6.509719371795654,
|
|
"epoch": 0.9081081081081082,
|
|
"grad_norm": 0.67578125,
|
|
"learning_rate": 0.0009851210038422265,
|
|
"loss": 6.411936950683594,
|
|
"mean_token_accuracy": 0.1332993596792221,
|
|
"num_tokens": 2028246.0,
|
|
"step": 840
|
|
},
|
|
{
|
|
"entropy": 6.258156967163086,
|
|
"epoch": 0.9135135135135135,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 0.0009846813841481736,
|
|
"loss": 6.273184204101563,
|
|
"mean_token_accuracy": 0.13781181275844573,
|
|
"num_tokens": 2040826.0,
|
|
"step": 845
|
|
},
|
|
{
|
|
"entropy": 6.449979686737061,
|
|
"epoch": 0.918918918918919,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0009842354764883557,
|
|
"loss": 6.402044677734375,
|
|
"mean_token_accuracy": 0.1293553426861763,
|
|
"num_tokens": 2056179.0,
|
|
"step": 850
|
|
},
|
|
{
|
|
"entropy": 6.307137584686279,
|
|
"epoch": 0.9243243243243243,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 0.000983783287313134,
|
|
"loss": 6.248806762695312,
|
|
"mean_token_accuracy": 0.13388172090053557,
|
|
"num_tokens": 2066742.0,
|
|
"step": 855
|
|
},
|
|
{
|
|
"entropy": 6.367336559295654,
|
|
"epoch": 0.9297297297297298,
|
|
"grad_norm": 0.66796875,
|
|
"learning_rate": 0.0009833248231637367,
|
|
"loss": 6.317116928100586,
|
|
"mean_token_accuracy": 0.13678575158119202,
|
|
"num_tokens": 2078785.0,
|
|
"step": 860
|
|
},
|
|
{
|
|
"entropy": 6.318039798736573,
|
|
"epoch": 0.9351351351351351,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 0.000982860090672164,
|
|
"loss": 6.280033111572266,
|
|
"mean_token_accuracy": 0.13033719807863237,
|
|
"num_tokens": 2090347.0,
|
|
"step": 865
|
|
},
|
|
{
|
|
"entropy": 6.305841064453125,
|
|
"epoch": 0.9405405405405406,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 0.000982389096561091,
|
|
"loss": 6.2948463439941404,
|
|
"mean_token_accuracy": 0.1338719367980957,
|
|
"num_tokens": 2101826.0,
|
|
"step": 870
|
|
},
|
|
{
|
|
"entropy": 6.360739135742188,
|
|
"epoch": 0.9459459459459459,
|
|
"grad_norm": 0.65625,
|
|
"learning_rate": 0.0009819118476437723,
|
|
"loss": 6.319264984130859,
|
|
"mean_token_accuracy": 0.13714499771595,
|
|
"num_tokens": 2114202.0,
|
|
"step": 875
|
|
},
|
|
{
|
|
"entropy": 6.401810359954834,
|
|
"epoch": 0.9513513513513514,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 0.0009814283508239425,
|
|
"loss": 6.290205764770508,
|
|
"mean_token_accuracy": 0.13513725101947785,
|
|
"num_tokens": 2126079.0,
|
|
"step": 880
|
|
},
|
|
{
|
|
"entropy": 6.2628508567810055,
|
|
"epoch": 0.9567567567567568,
|
|
"grad_norm": 0.640625,
|
|
"learning_rate": 0.0009809386130957163,
|
|
"loss": 6.299491119384766,
|
|
"mean_token_accuracy": 0.13721458315849305,
|
|
"num_tokens": 2137644.0,
|
|
"step": 885
|
|
},
|
|
{
|
|
"entropy": 6.1556120872497555,
|
|
"epoch": 0.9621621621621622,
|
|
"grad_norm": 0.62890625,
|
|
"learning_rate": 0.0009804426415434876,
|
|
"loss": 6.129010009765625,
|
|
"mean_token_accuracy": 0.1369076371192932,
|
|
"num_tokens": 2152630.0,
|
|
"step": 890
|
|
},
|
|
{
|
|
"entropy": 6.2799969673156735,
|
|
"epoch": 0.9675675675675676,
|
|
"grad_norm": 0.66796875,
|
|
"learning_rate": 0.0009799404433418262,
|
|
"loss": 6.228973388671875,
|
|
"mean_token_accuracy": 0.1327817440032959,
|
|
"num_tokens": 2163879.0,
|
|
"step": 895
|
|
},
|
|
{
|
|
"entropy": 6.331386756896973,
|
|
"epoch": 0.972972972972973,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 0.0009794320257553754,
|
|
"loss": 6.3436279296875,
|
|
"mean_token_accuracy": 0.12582612037658691,
|
|
"num_tokens": 2176772.0,
|
|
"step": 900
|
|
},
|
|
{
|
|
"entropy": 6.305329990386963,
|
|
"epoch": 0.9783783783783784,
|
|
"grad_norm": 0.64453125,
|
|
"learning_rate": 0.0009789173961387459,
|
|
"loss": 6.2147876739501955,
|
|
"mean_token_accuracy": 0.13565244078636168,
|
|
"num_tokens": 2188697.0,
|
|
"step": 905
|
|
},
|
|
{
|
|
"entropy": 6.253271961212159,
|
|
"epoch": 0.9837837837837838,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 0.00097839656193641,
|
|
"loss": 6.213663482666016,
|
|
"mean_token_accuracy": 0.1317826598882675,
|
|
"num_tokens": 2201905.0,
|
|
"step": 910
|
|
},
|
|
{
|
|
"entropy": 6.174108409881592,
|
|
"epoch": 0.9891891891891892,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 0.000977869530682593,
|
|
"loss": 6.149724960327148,
|
|
"mean_token_accuracy": 0.14030847251415252,
|
|
"num_tokens": 2211502.0,
|
|
"step": 915
|
|
},
|
|
{
|
|
"entropy": 6.269680404663086,
|
|
"epoch": 0.9945945945945946,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 0.0009773363100011655,
|
|
"loss": 6.259825134277344,
|
|
"mean_token_accuracy": 0.13248875439167024,
|
|
"num_tokens": 2223560.0,
|
|
"step": 920
|
|
},
|
|
{
|
|
"entropy": 6.303800010681153,
|
|
"epoch": 1.0,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0009767969076055316,
|
|
"loss": 6.259091186523437,
|
|
"mean_token_accuracy": 0.1379597917199135,
|
|
"num_tokens": 2232668.0,
|
|
"step": 925
|
|
},
|
|
{
|
|
"entropy": 6.247701930999756,
|
|
"epoch": 1.0054054054054054,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 0.0009762513312985191,
|
|
"loss": 6.087086486816406,
|
|
"mean_token_accuracy": 0.14642732441425324,
|
|
"num_tokens": 2243410.0,
|
|
"step": 930
|
|
},
|
|
{
|
|
"entropy": 6.207428741455078,
|
|
"epoch": 1.0108108108108107,
|
|
"grad_norm": 0.671875,
|
|
"learning_rate": 0.0009756995889722652,
|
|
"loss": 6.115195083618164,
|
|
"mean_token_accuracy": 0.13871956765651702,
|
|
"num_tokens": 2255343.0,
|
|
"step": 935
|
|
},
|
|
{
|
|
"entropy": 6.0995192527771,
|
|
"epoch": 1.0162162162162163,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0009751416886081027,
|
|
"loss": 6.043392181396484,
|
|
"mean_token_accuracy": 0.14625563025474547,
|
|
"num_tokens": 2267196.0,
|
|
"step": 940
|
|
},
|
|
{
|
|
"entropy": 6.204872989654541,
|
|
"epoch": 1.0216216216216216,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 0.0009745776382764448,
|
|
"loss": 6.183137130737305,
|
|
"mean_token_accuracy": 0.13658826649188996,
|
|
"num_tokens": 2278936.0,
|
|
"step": 945
|
|
},
|
|
{
|
|
"entropy": 6.228440189361573,
|
|
"epoch": 1.027027027027027,
|
|
"grad_norm": 0.671875,
|
|
"learning_rate": 0.0009740074461366686,
|
|
"loss": 6.062003326416016,
|
|
"mean_token_accuracy": 0.14350597262382508,
|
|
"num_tokens": 2289300.0,
|
|
"step": 950
|
|
},
|
|
{
|
|
"entropy": 6.182377719879151,
|
|
"epoch": 1.0324324324324325,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 0.0009734311204369957,
|
|
"loss": 6.08958740234375,
|
|
"mean_token_accuracy": 0.14562293589115144,
|
|
"num_tokens": 2301601.0,
|
|
"step": 955
|
|
},
|
|
{
|
|
"entropy": 6.017007541656494,
|
|
"epoch": 1.037837837837838,
|
|
"grad_norm": 0.66796875,
|
|
"learning_rate": 0.0009728486695143753,
|
|
"loss": 5.978137969970703,
|
|
"mean_token_accuracy": 0.14870022535324096,
|
|
"num_tokens": 2313130.0,
|
|
"step": 960
|
|
},
|
|
{
|
|
"entropy": 6.3585821151733395,
|
|
"epoch": 1.0432432432432432,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0009722601017943607,
|
|
"loss": 6.260755920410157,
|
|
"mean_token_accuracy": 0.13717263340950012,
|
|
"num_tokens": 2326413.0,
|
|
"step": 965
|
|
},
|
|
{
|
|
"entropy": 6.145228576660156,
|
|
"epoch": 1.0486486486486486,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 0.0009716654257909897,
|
|
"loss": 6.0943046569824215,
|
|
"mean_token_accuracy": 0.14415099322795868,
|
|
"num_tokens": 2337603.0,
|
|
"step": 970
|
|
},
|
|
{
|
|
"entropy": 6.234020233154297,
|
|
"epoch": 1.054054054054054,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 0.0009710646501066608,
|
|
"loss": 6.181568908691406,
|
|
"mean_token_accuracy": 0.13601263910531997,
|
|
"num_tokens": 2352321.0,
|
|
"step": 975
|
|
},
|
|
{
|
|
"entropy": 6.0668079376220705,
|
|
"epoch": 1.0594594594594595,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 0.0009704577834320078,
|
|
"loss": 6.049177932739258,
|
|
"mean_token_accuracy": 0.15185949206352234,
|
|
"num_tokens": 2363432.0,
|
|
"step": 980
|
|
},
|
|
{
|
|
"entropy": 6.228795528411865,
|
|
"epoch": 1.0648648648648649,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 0.0009698448345457758,
|
|
"loss": 6.067817687988281,
|
|
"mean_token_accuracy": 0.14404682517051698,
|
|
"num_tokens": 2374188.0,
|
|
"step": 985
|
|
},
|
|
{
|
|
"entropy": 6.257656669616699,
|
|
"epoch": 1.0702702702702702,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 0.0009692258123146925,
|
|
"loss": 6.195977783203125,
|
|
"mean_token_accuracy": 0.13717207163572312,
|
|
"num_tokens": 2386344.0,
|
|
"step": 990
|
|
},
|
|
{
|
|
"entropy": 6.229287624359131,
|
|
"epoch": 1.0756756756756758,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 0.0009686007256933414,
|
|
"loss": 6.20872802734375,
|
|
"mean_token_accuracy": 0.1379612296819687,
|
|
"num_tokens": 2399518.0,
|
|
"step": 995
|
|
},
|
|
{
|
|
"entropy": 6.284945487976074,
|
|
"epoch": 1.0810810810810811,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0009679695837240308,
|
|
"loss": 6.145904541015625,
|
|
"mean_token_accuracy": 0.14310452789068223,
|
|
"num_tokens": 2413738.0,
|
|
"step": 1000
|
|
},
|
|
{
|
|
"entropy": 6.0414176940917965,
|
|
"epoch": 1.0864864864864865,
|
|
"grad_norm": 0.640625,
|
|
"learning_rate": 0.0009673323955366644,
|
|
"loss": 6.015713119506836,
|
|
"mean_token_accuracy": 0.15530002117156982,
|
|
"num_tokens": 2425088.0,
|
|
"step": 1005
|
|
},
|
|
{
|
|
"entropy": 6.0671515464782715,
|
|
"epoch": 1.0918918918918918,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 0.0009666891703486084,
|
|
"loss": 6.016201019287109,
|
|
"mean_token_accuracy": 0.15316692590713502,
|
|
"num_tokens": 2436387.0,
|
|
"step": 1010
|
|
},
|
|
{
|
|
"entropy": 6.2645776748657225,
|
|
"epoch": 1.0972972972972972,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0009660399174645587,
|
|
"loss": 6.249516296386719,
|
|
"mean_token_accuracy": 0.13507454246282577,
|
|
"num_tokens": 2449444.0,
|
|
"step": 1015
|
|
},
|
|
{
|
|
"entropy": 6.284755802154541,
|
|
"epoch": 1.1027027027027028,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 0.0009653846462764052,
|
|
"loss": 6.1441200256347654,
|
|
"mean_token_accuracy": 0.1487019807100296,
|
|
"num_tokens": 2459267.0,
|
|
"step": 1020
|
|
},
|
|
{
|
|
"entropy": 5.996495628356934,
|
|
"epoch": 1.1081081081081081,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 0.0009647233662630976,
|
|
"loss": 5.918562316894532,
|
|
"mean_token_accuracy": 0.15527379214763642,
|
|
"num_tokens": 2470572.0,
|
|
"step": 1025
|
|
},
|
|
{
|
|
"entropy": 6.1040750503540036,
|
|
"epoch": 1.1135135135135135,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 0.0009640560869905065,
|
|
"loss": 6.092966461181641,
|
|
"mean_token_accuracy": 0.14268437027931213,
|
|
"num_tokens": 2483293.0,
|
|
"step": 1030
|
|
},
|
|
{
|
|
"entropy": 6.213329792022705,
|
|
"epoch": 1.118918918918919,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.0009633828181112869,
|
|
"loss": 6.065708923339844,
|
|
"mean_token_accuracy": 0.14911548793315887,
|
|
"num_tokens": 2493995.0,
|
|
"step": 1035
|
|
},
|
|
{
|
|
"entropy": 6.045756530761719,
|
|
"epoch": 1.1243243243243244,
|
|
"grad_norm": 0.640625,
|
|
"learning_rate": 0.0009627035693647369,
|
|
"loss": 5.956703948974609,
|
|
"mean_token_accuracy": 0.14724287688732146,
|
|
"num_tokens": 2505280.0,
|
|
"step": 1040
|
|
},
|
|
{
|
|
"entropy": 5.993116950988769,
|
|
"epoch": 1.1297297297297297,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0009620183505766577,
|
|
"loss": 5.9770042419433596,
|
|
"mean_token_accuracy": 0.1574521005153656,
|
|
"num_tokens": 2515680.0,
|
|
"step": 1045
|
|
},
|
|
{
|
|
"entropy": 6.090410614013672,
|
|
"epoch": 1.135135135135135,
|
|
"grad_norm": 0.66015625,
|
|
"learning_rate": 0.0009613271716592113,
|
|
"loss": 5.974724960327149,
|
|
"mean_token_accuracy": 0.14773423373699188,
|
|
"num_tokens": 2529369.0,
|
|
"step": 1050
|
|
},
|
|
{
|
|
"entropy": 6.2742572784423825,
|
|
"epoch": 1.1405405405405404,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 0.0009606300426107767,
|
|
"loss": 6.279899978637696,
|
|
"mean_token_accuracy": 0.1332086905837059,
|
|
"num_tokens": 2543710.0,
|
|
"step": 1055
|
|
},
|
|
{
|
|
"entropy": 6.154977416992187,
|
|
"epoch": 1.145945945945946,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0009599269735158066,
|
|
"loss": 6.070030975341797,
|
|
"mean_token_accuracy": 0.14480855464935302,
|
|
"num_tokens": 2553868.0,
|
|
"step": 1060
|
|
},
|
|
{
|
|
"entropy": 6.078575897216797,
|
|
"epoch": 1.1513513513513514,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 0.0009592179745446796,
|
|
"loss": 6.052325820922851,
|
|
"mean_token_accuracy": 0.14226650595664977,
|
|
"num_tokens": 2565425.0,
|
|
"step": 1065
|
|
},
|
|
{
|
|
"entropy": 6.081030464172363,
|
|
"epoch": 1.1567567567567567,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 0.0009585030559535544,
|
|
"loss": 6.073527908325195,
|
|
"mean_token_accuracy": 0.14177987575531006,
|
|
"num_tokens": 2576760.0,
|
|
"step": 1070
|
|
},
|
|
{
|
|
"entropy": 6.185351181030273,
|
|
"epoch": 1.1621621621621623,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 0.0009577822280842209,
|
|
"loss": 6.132835006713867,
|
|
"mean_token_accuracy": 0.13952185213565826,
|
|
"num_tokens": 2588651.0,
|
|
"step": 1075
|
|
},
|
|
{
|
|
"entropy": 6.20592851638794,
|
|
"epoch": 1.1675675675675676,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 0.0009570555013639513,
|
|
"loss": 6.126637649536133,
|
|
"mean_token_accuracy": 0.1417229115962982,
|
|
"num_tokens": 2600091.0,
|
|
"step": 1080
|
|
},
|
|
{
|
|
"entropy": 6.086951541900635,
|
|
"epoch": 1.172972972972973,
|
|
"grad_norm": 0.63671875,
|
|
"learning_rate": 0.0009563228863053482,
|
|
"loss": 6.079809188842773,
|
|
"mean_token_accuracy": 0.14229417145252227,
|
|
"num_tokens": 2611593.0,
|
|
"step": 1085
|
|
},
|
|
{
|
|
"entropy": 6.1936968803405765,
|
|
"epoch": 1.1783783783783783,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 0.0009555843935061934,
|
|
"loss": 6.050133895874024,
|
|
"mean_token_accuracy": 0.14194661676883696,
|
|
"num_tokens": 2623384.0,
|
|
"step": 1090
|
|
},
|
|
{
|
|
"entropy": 6.037506484985352,
|
|
"epoch": 1.1837837837837837,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 0.0009548400336492942,
|
|
"loss": 5.9737495422363285,
|
|
"mean_token_accuracy": 0.1466424971818924,
|
|
"num_tokens": 2635961.0,
|
|
"step": 1095
|
|
},
|
|
{
|
|
"entropy": 6.06157283782959,
|
|
"epoch": 1.1891891891891893,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.0009540898175023286,
|
|
"loss": 6.021556091308594,
|
|
"mean_token_accuracy": 0.15520934760570526,
|
|
"num_tokens": 2646889.0,
|
|
"step": 1100
|
|
},
|
|
{
|
|
"entropy": 6.003177833557129,
|
|
"epoch": 1.1945945945945946,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.0009533337559176903,
|
|
"loss": 6.065186309814453,
|
|
"mean_token_accuracy": 0.13881587386131286,
|
|
"num_tokens": 2660063.0,
|
|
"step": 1105
|
|
},
|
|
{
|
|
"entropy": 6.294288063049317,
|
|
"epoch": 1.2,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 0.0009525718598323313,
|
|
"loss": 6.224353790283203,
|
|
"mean_token_accuracy": 0.13939207047224045,
|
|
"num_tokens": 2674361.0,
|
|
"step": 1110
|
|
},
|
|
{
|
|
"entropy": 6.20927619934082,
|
|
"epoch": 1.2054054054054055,
|
|
"grad_norm": 0.63671875,
|
|
"learning_rate": 0.0009518041402676032,
|
|
"loss": 6.128507232666015,
|
|
"mean_token_accuracy": 0.14430801272392274,
|
|
"num_tokens": 2688747.0,
|
|
"step": 1115
|
|
},
|
|
{
|
|
"entropy": 6.078750324249268,
|
|
"epoch": 1.2108108108108109,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 0.0009510306083290989,
|
|
"loss": 6.023811721801758,
|
|
"mean_token_accuracy": 0.15408262610435486,
|
|
"num_tokens": 2701891.0,
|
|
"step": 1120
|
|
},
|
|
{
|
|
"entropy": 6.116716098785401,
|
|
"epoch": 1.2162162162162162,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.0009502512752064905,
|
|
"loss": 5.992145538330078,
|
|
"mean_token_accuracy": 0.15401490926742553,
|
|
"num_tokens": 2712109.0,
|
|
"step": 1125
|
|
},
|
|
{
|
|
"entropy": 6.041183280944824,
|
|
"epoch": 1.2216216216216216,
|
|
"grad_norm": 0.671875,
|
|
"learning_rate": 0.000949466152173369,
|
|
"loss": 6.071275329589843,
|
|
"mean_token_accuracy": 0.14654400646686555,
|
|
"num_tokens": 2724513.0,
|
|
"step": 1130
|
|
},
|
|
{
|
|
"entropy": 6.136420631408692,
|
|
"epoch": 1.227027027027027,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.00094867525058708,
|
|
"loss": 5.991522216796875,
|
|
"mean_token_accuracy": 0.14021825045347214,
|
|
"num_tokens": 2737604.0,
|
|
"step": 1135
|
|
},
|
|
{
|
|
"entropy": 6.287702178955078,
|
|
"epoch": 1.2324324324324325,
|
|
"grad_norm": 0.671875,
|
|
"learning_rate": 0.0009478785818885598,
|
|
"loss": 6.168487548828125,
|
|
"mean_token_accuracy": 0.13972904682159423,
|
|
"num_tokens": 2751565.0,
|
|
"step": 1140
|
|
},
|
|
{
|
|
"entropy": 5.92498140335083,
|
|
"epoch": 1.2378378378378379,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 0.0009470761576021706,
|
|
"loss": 5.838254165649414,
|
|
"mean_token_accuracy": 0.15651266872882844,
|
|
"num_tokens": 2762235.0,
|
|
"step": 1145
|
|
},
|
|
{
|
|
"entropy": 6.060224533081055,
|
|
"epoch": 1.2432432432432432,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 0.0009462679893355321,
|
|
"loss": 6.060661315917969,
|
|
"mean_token_accuracy": 0.1462487429380417,
|
|
"num_tokens": 2772591.0,
|
|
"step": 1150
|
|
},
|
|
{
|
|
"entropy": 6.158456802368164,
|
|
"epoch": 1.2486486486486488,
|
|
"grad_norm": 0.6640625,
|
|
"learning_rate": 0.0009454540887793556,
|
|
"loss": 6.068745040893555,
|
|
"mean_token_accuracy": 0.1397398978471756,
|
|
"num_tokens": 2785571.0,
|
|
"step": 1155
|
|
},
|
|
{
|
|
"entropy": 6.2046942710876465,
|
|
"epoch": 1.2540540540540541,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0009446344677072734,
|
|
"loss": 6.084649276733399,
|
|
"mean_token_accuracy": 0.14705458134412766,
|
|
"num_tokens": 2798032.0,
|
|
"step": 1160
|
|
},
|
|
{
|
|
"entropy": 5.980342102050781,
|
|
"epoch": 1.2594594594594595,
|
|
"grad_norm": 0.67578125,
|
|
"learning_rate": 0.000943809137975669,
|
|
"loss": 6.034884262084961,
|
|
"mean_token_accuracy": 0.14847399592399596,
|
|
"num_tokens": 2809343.0,
|
|
"step": 1165
|
|
},
|
|
{
|
|
"entropy": 6.089838027954102,
|
|
"epoch": 1.2648648648648648,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 0.0009429781115235055,
|
|
"loss": 6.001376724243164,
|
|
"mean_token_accuracy": 0.14895476996898652,
|
|
"num_tokens": 2821044.0,
|
|
"step": 1170
|
|
},
|
|
{
|
|
"entropy": 6.078525733947754,
|
|
"epoch": 1.2702702702702702,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 0.0009421414003721539,
|
|
"loss": 6.015114593505859,
|
|
"mean_token_accuracy": 0.14688166081905366,
|
|
"num_tokens": 2834153.0,
|
|
"step": 1175
|
|
},
|
|
{
|
|
"entropy": 6.140860080718994,
|
|
"epoch": 1.2756756756756757,
|
|
"grad_norm": 0.625,
|
|
"learning_rate": 0.000941299016625217,
|
|
"loss": 6.013716506958008,
|
|
"mean_token_accuracy": 0.14849595725536346,
|
|
"num_tokens": 2847161.0,
|
|
"step": 1180
|
|
},
|
|
{
|
|
"entropy": 5.947665119171143,
|
|
"epoch": 1.281081081081081,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0009404509724683563,
|
|
"loss": 5.943680191040039,
|
|
"mean_token_accuracy": 0.15365355908870698,
|
|
"num_tokens": 2858541.0,
|
|
"step": 1185
|
|
},
|
|
{
|
|
"entropy": 6.064198017120361,
|
|
"epoch": 1.2864864864864864,
|
|
"grad_norm": 0.66796875,
|
|
"learning_rate": 0.000939597280169115,
|
|
"loss": 5.915108108520508,
|
|
"mean_token_accuracy": 0.154515340924263,
|
|
"num_tokens": 2870189.0,
|
|
"step": 1190
|
|
},
|
|
{
|
|
"entropy": 6.083068084716797,
|
|
"epoch": 1.291891891891892,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0009387379520767407,
|
|
"loss": 6.106951904296875,
|
|
"mean_token_accuracy": 0.14755382090806962,
|
|
"num_tokens": 2880881.0,
|
|
"step": 1195
|
|
},
|
|
{
|
|
"entropy": 6.084651756286621,
|
|
"epoch": 1.2972972972972974,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 0.0009378730006220061,
|
|
"loss": 6.083970642089843,
|
|
"mean_token_accuracy": 0.14543737471103668,
|
|
"num_tokens": 2892522.0,
|
|
"step": 1200
|
|
},
|
|
{
|
|
"entropy": 6.053504943847656,
|
|
"epoch": 1.3027027027027027,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 0.0009370024383170302,
|
|
"loss": 5.892122268676758,
|
|
"mean_token_accuracy": 0.1534324437379837,
|
|
"num_tokens": 2903595.0,
|
|
"step": 1205
|
|
},
|
|
{
|
|
"entropy": 6.086377429962158,
|
|
"epoch": 1.308108108108108,
|
|
"grad_norm": 0.63671875,
|
|
"learning_rate": 0.0009361262777550965,
|
|
"loss": 5.976514434814453,
|
|
"mean_token_accuracy": 0.1496379107236862,
|
|
"num_tokens": 2915905.0,
|
|
"step": 1210
|
|
},
|
|
{
|
|
"entropy": 5.984688854217529,
|
|
"epoch": 1.3135135135135134,
|
|
"grad_norm": 0.66796875,
|
|
"learning_rate": 0.0009352445316104715,
|
|
"loss": 5.929489517211914,
|
|
"mean_token_accuracy": 0.14890652298927307,
|
|
"num_tokens": 2926854.0,
|
|
"step": 1215
|
|
},
|
|
{
|
|
"entropy": 5.982455253601074,
|
|
"epoch": 1.318918918918919,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 0.0009343572126382208,
|
|
"loss": 5.958092498779297,
|
|
"mean_token_accuracy": 0.15311627686023713,
|
|
"num_tokens": 2938909.0,
|
|
"step": 1220
|
|
},
|
|
{
|
|
"entropy": 6.001386737823486,
|
|
"epoch": 1.3243243243243243,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0009334643336740246,
|
|
"loss": 5.921345138549805,
|
|
"mean_token_accuracy": 0.15853023231029512,
|
|
"num_tokens": 2949958.0,
|
|
"step": 1225
|
|
},
|
|
{
|
|
"entropy": 6.019908905029297,
|
|
"epoch": 1.3297297297297297,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0009325659076339924,
|
|
"loss": 5.926969146728515,
|
|
"mean_token_accuracy": 0.15277785956859588,
|
|
"num_tokens": 2961449.0,
|
|
"step": 1230
|
|
},
|
|
{
|
|
"entropy": 5.998956966400146,
|
|
"epoch": 1.3351351351351353,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0009316619475144765,
|
|
"loss": 5.983316802978516,
|
|
"mean_token_accuracy": 0.14754572212696077,
|
|
"num_tokens": 2974496.0,
|
|
"step": 1235
|
|
},
|
|
{
|
|
"entropy": 6.157251834869385,
|
|
"epoch": 1.3405405405405406,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0009307524663918821,
|
|
"loss": 6.08265266418457,
|
|
"mean_token_accuracy": 0.15290809273719788,
|
|
"num_tokens": 2986081.0,
|
|
"step": 1240
|
|
},
|
|
{
|
|
"entropy": 6.076891040802002,
|
|
"epoch": 1.345945945945946,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 0.0009298374774224812,
|
|
"loss": 6.0138916015625,
|
|
"mean_token_accuracy": 0.14638799875974656,
|
|
"num_tokens": 2999890.0,
|
|
"step": 1245
|
|
},
|
|
{
|
|
"entropy": 6.036985301971436,
|
|
"epoch": 1.3513513513513513,
|
|
"grad_norm": 0.6640625,
|
|
"learning_rate": 0.0009289169938422191,
|
|
"loss": 6.011819458007812,
|
|
"mean_token_accuracy": 0.15665827989578246,
|
|
"num_tokens": 3012281.0,
|
|
"step": 1250
|
|
},
|
|
{
|
|
"entropy": 6.172758865356445,
|
|
"epoch": 1.3567567567567567,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 0.0009279910289665257,
|
|
"loss": 6.069019317626953,
|
|
"mean_token_accuracy": 0.14247923642396926,
|
|
"num_tokens": 3026908.0,
|
|
"step": 1255
|
|
},
|
|
{
|
|
"entropy": 6.033104515075683,
|
|
"epoch": 1.3621621621621622,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 0.0009270595961901204,
|
|
"loss": 6.013312149047851,
|
|
"mean_token_accuracy": 0.14915238618850707,
|
|
"num_tokens": 3038661.0,
|
|
"step": 1260
|
|
},
|
|
{
|
|
"entropy": 6.106722354888916,
|
|
"epoch": 1.3675675675675676,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0009261227089868208,
|
|
"loss": 6.046922302246093,
|
|
"mean_token_accuracy": 0.14422987550497054,
|
|
"num_tokens": 3051641.0,
|
|
"step": 1265
|
|
},
|
|
{
|
|
"entropy": 6.110820388793945,
|
|
"epoch": 1.372972972972973,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 0.0009251803809093456,
|
|
"loss": 6.0467266082763675,
|
|
"mean_token_accuracy": 0.14307568371295928,
|
|
"num_tokens": 3063708.0,
|
|
"step": 1270
|
|
},
|
|
{
|
|
"entropy": 6.060265445709229,
|
|
"epoch": 1.3783783783783785,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 0.0009242326255891196,
|
|
"loss": 5.93769416809082,
|
|
"mean_token_accuracy": 0.14946352541446686,
|
|
"num_tokens": 3075694.0,
|
|
"step": 1275
|
|
},
|
|
{
|
|
"entropy": 5.956900119781494,
|
|
"epoch": 1.3837837837837839,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.000923279456736077,
|
|
"loss": 5.892474365234375,
|
|
"mean_token_accuracy": 0.1602933645248413,
|
|
"num_tokens": 3087935.0,
|
|
"step": 1280
|
|
},
|
|
{
|
|
"entropy": 6.032831764221191,
|
|
"epoch": 1.3891891891891892,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0009223208881384619,
|
|
"loss": 5.958731079101563,
|
|
"mean_token_accuracy": 0.15782309770584108,
|
|
"num_tokens": 3098628.0,
|
|
"step": 1285
|
|
},
|
|
{
|
|
"entropy": 6.116084194183349,
|
|
"epoch": 1.3945945945945946,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 0.0009213569336626297,
|
|
"loss": 6.204639053344726,
|
|
"mean_token_accuracy": 0.13710222840309144,
|
|
"num_tokens": 3114430.0,
|
|
"step": 1290
|
|
},
|
|
{
|
|
"entropy": 6.175200080871582,
|
|
"epoch": 1.4,
|
|
"grad_norm": 0.671875,
|
|
"learning_rate": 0.000920387607252846,
|
|
"loss": 5.931164169311524,
|
|
"mean_token_accuracy": 0.15236457586288452,
|
|
"num_tokens": 3125350.0,
|
|
"step": 1295
|
|
},
|
|
{
|
|
"entropy": 5.96003999710083,
|
|
"epoch": 1.4054054054054055,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 0.0009194129229310854,
|
|
"loss": 5.927279663085938,
|
|
"mean_token_accuracy": 0.1596504420042038,
|
|
"num_tokens": 3137610.0,
|
|
"step": 1300
|
|
},
|
|
{
|
|
"entropy": 5.922585964202881,
|
|
"epoch": 1.4108108108108108,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 0.0009184328947968285,
|
|
"loss": 5.873512649536133,
|
|
"mean_token_accuracy": 0.153224441409111,
|
|
"num_tokens": 3149054.0,
|
|
"step": 1305
|
|
},
|
|
{
|
|
"entropy": 5.9644293785095215,
|
|
"epoch": 1.4162162162162162,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 0.0009174475370268572,
|
|
"loss": 5.9443611145019535,
|
|
"mean_token_accuracy": 0.15277822315692902,
|
|
"num_tokens": 3160844.0,
|
|
"step": 1310
|
|
},
|
|
{
|
|
"entropy": 6.004944229125977,
|
|
"epoch": 1.4216216216216218,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.000916456863875051,
|
|
"loss": 5.871533966064453,
|
|
"mean_token_accuracy": 0.15332863628864288,
|
|
"num_tokens": 3172182.0,
|
|
"step": 1315
|
|
},
|
|
{
|
|
"entropy": 6.265860366821289,
|
|
"epoch": 1.427027027027027,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0009154608896721795,
|
|
"loss": 6.235766220092773,
|
|
"mean_token_accuracy": 0.14209017157554626,
|
|
"num_tokens": 3182459.0,
|
|
"step": 1320
|
|
},
|
|
{
|
|
"entropy": 6.066355514526367,
|
|
"epoch": 1.4324324324324325,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 0.0009144596288256961,
|
|
"loss": 5.998751831054688,
|
|
"mean_token_accuracy": 0.14995864033699036,
|
|
"num_tokens": 3193880.0,
|
|
"step": 1325
|
|
},
|
|
{
|
|
"entropy": 5.960510921478272,
|
|
"epoch": 1.4378378378378378,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0009134530958195287,
|
|
"loss": 6.005829620361328,
|
|
"mean_token_accuracy": 0.15055490285158157,
|
|
"num_tokens": 3206829.0,
|
|
"step": 1330
|
|
},
|
|
{
|
|
"entropy": 6.1994706153869625,
|
|
"epoch": 1.4432432432432432,
|
|
"grad_norm": 0.65234375,
|
|
"learning_rate": 0.0009124413052138709,
|
|
"loss": 6.004475784301758,
|
|
"mean_token_accuracy": 0.1500842273235321,
|
|
"num_tokens": 3218278.0,
|
|
"step": 1335
|
|
},
|
|
{
|
|
"entropy": 5.905928325653076,
|
|
"epoch": 1.4486486486486487,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.000911424271644971,
|
|
"loss": 5.986416625976562,
|
|
"mean_token_accuracy": 0.15458933711051942,
|
|
"num_tokens": 3231147.0,
|
|
"step": 1340
|
|
},
|
|
{
|
|
"entropy": 6.124406528472901,
|
|
"epoch": 1.454054054054054,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0009104020098249207,
|
|
"loss": 5.974528503417969,
|
|
"mean_token_accuracy": 0.1465795397758484,
|
|
"num_tokens": 3243120.0,
|
|
"step": 1345
|
|
},
|
|
{
|
|
"entropy": 6.172325611114502,
|
|
"epoch": 1.4594594594594594,
|
|
"grad_norm": 0.66796875,
|
|
"learning_rate": 0.0009093745345414415,
|
|
"loss": 6.0606544494628904,
|
|
"mean_token_accuracy": 0.14666911959648132,
|
|
"num_tokens": 3253941.0,
|
|
"step": 1350
|
|
},
|
|
{
|
|
"entropy": 5.930078029632568,
|
|
"epoch": 1.464864864864865,
|
|
"grad_norm": 0.67578125,
|
|
"learning_rate": 0.0009083418606576712,
|
|
"loss": 5.996834945678711,
|
|
"mean_token_accuracy": 0.15221282094717026,
|
|
"num_tokens": 3268179.0,
|
|
"step": 1355
|
|
},
|
|
{
|
|
"entropy": 6.114362716674805,
|
|
"epoch": 1.4702702702702704,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 0.0009073040031119496,
|
|
"loss": 6.020093536376953,
|
|
"mean_token_accuracy": 0.15273723602294922,
|
|
"num_tokens": 3280661.0,
|
|
"step": 1360
|
|
},
|
|
{
|
|
"entropy": 6.08493185043335,
|
|
"epoch": 1.4756756756756757,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 0.0009062609769176008,
|
|
"loss": 5.958439636230469,
|
|
"mean_token_accuracy": 0.1539517253637314,
|
|
"num_tokens": 3292357.0,
|
|
"step": 1365
|
|
},
|
|
{
|
|
"entropy": 5.965977478027344,
|
|
"epoch": 1.481081081081081,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.000905212797162718,
|
|
"loss": 5.906470489501953,
|
|
"mean_token_accuracy": 0.1570991039276123,
|
|
"num_tokens": 3303553.0,
|
|
"step": 1370
|
|
},
|
|
{
|
|
"entropy": 6.028031349182129,
|
|
"epoch": 1.4864864864864864,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 0.0009041594790099431,
|
|
"loss": 6.033520126342774,
|
|
"mean_token_accuracy": 0.15428649485111237,
|
|
"num_tokens": 3315013.0,
|
|
"step": 1375
|
|
},
|
|
{
|
|
"entropy": 6.051199722290039,
|
|
"epoch": 1.491891891891892,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0009031010376962497,
|
|
"loss": 5.9187873840332035,
|
|
"mean_token_accuracy": 0.15662144720554352,
|
|
"num_tokens": 3326593.0,
|
|
"step": 1380
|
|
},
|
|
{
|
|
"entropy": 6.04923734664917,
|
|
"epoch": 1.4972972972972973,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 0.0009020374885327201,
|
|
"loss": 5.947822570800781,
|
|
"mean_token_accuracy": 0.1478397786617279,
|
|
"num_tokens": 3338537.0,
|
|
"step": 1385
|
|
},
|
|
{
|
|
"entropy": 5.897234630584717,
|
|
"epoch": 1.5027027027027027,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 0.0009009688469043262,
|
|
"loss": 5.869780731201172,
|
|
"mean_token_accuracy": 0.15363080203533172,
|
|
"num_tokens": 3349855.0,
|
|
"step": 1390
|
|
},
|
|
{
|
|
"entropy": 6.034223747253418,
|
|
"epoch": 1.5081081081081082,
|
|
"grad_norm": 0.67578125,
|
|
"learning_rate": 0.0008998951282697056,
|
|
"loss": 5.889139938354492,
|
|
"mean_token_accuracy": 0.160240775346756,
|
|
"num_tokens": 3361160.0,
|
|
"step": 1395
|
|
},
|
|
{
|
|
"entropy": 5.875298023223877,
|
|
"epoch": 1.5135135135135136,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 0.0008988163481609382,
|
|
"loss": 5.832206726074219,
|
|
"mean_token_accuracy": 0.15845912992954253,
|
|
"num_tokens": 3372145.0,
|
|
"step": 1400
|
|
},
|
|
{
|
|
"entropy": 5.8527037620544435,
|
|
"epoch": 1.518918918918919,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 0.0008977325221833216,
|
|
"loss": 5.786477661132812,
|
|
"mean_token_accuracy": 0.15379104018211365,
|
|
"num_tokens": 3383900.0,
|
|
"step": 1405
|
|
},
|
|
{
|
|
"entropy": 5.941924953460694,
|
|
"epoch": 1.5243243243243243,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 0.0008966436660151454,
|
|
"loss": 5.860789489746094,
|
|
"mean_token_accuracy": 0.15963666439056395,
|
|
"num_tokens": 3395415.0,
|
|
"step": 1410
|
|
},
|
|
{
|
|
"entropy": 6.111461353302002,
|
|
"epoch": 1.5297297297297296,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0008955497954074648,
|
|
"loss": 6.055585479736328,
|
|
"mean_token_accuracy": 0.15375637710094453,
|
|
"num_tokens": 3409666.0,
|
|
"step": 1415
|
|
},
|
|
{
|
|
"entropy": 6.024180698394775,
|
|
"epoch": 1.535135135135135,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 0.0008944509261838713,
|
|
"loss": 5.976921081542969,
|
|
"mean_token_accuracy": 0.1520102560520172,
|
|
"num_tokens": 3421172.0,
|
|
"step": 1420
|
|
},
|
|
{
|
|
"entropy": 5.899082088470459,
|
|
"epoch": 1.5405405405405406,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 0.000893347074240266,
|
|
"loss": 5.8486183166503904,
|
|
"mean_token_accuracy": 0.1558360755443573,
|
|
"num_tokens": 3433317.0,
|
|
"step": 1425
|
|
},
|
|
{
|
|
"entropy": 5.996556949615479,
|
|
"epoch": 1.545945945945946,
|
|
"grad_norm": 0.66796875,
|
|
"learning_rate": 0.0008922382555446278,
|
|
"loss": 5.9516441345214846,
|
|
"mean_token_accuracy": 0.16046953797340394,
|
|
"num_tokens": 3445411.0,
|
|
"step": 1430
|
|
},
|
|
{
|
|
"entropy": 6.057880115509033,
|
|
"epoch": 1.5513513513513515,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0008911244861367833,
|
|
"loss": 6.004363250732422,
|
|
"mean_token_accuracy": 0.15319364368915558,
|
|
"num_tokens": 3455771.0,
|
|
"step": 1435
|
|
},
|
|
{
|
|
"entropy": 6.0603588104248045,
|
|
"epoch": 1.5567567567567568,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 0.0008900057821281741,
|
|
"loss": 5.931759643554687,
|
|
"mean_token_accuracy": 0.15196377038955688,
|
|
"num_tokens": 3469339.0,
|
|
"step": 1440
|
|
},
|
|
{
|
|
"entropy": 5.960010147094726,
|
|
"epoch": 1.5621621621621622,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.000888882159701625,
|
|
"loss": 5.943192672729492,
|
|
"mean_token_accuracy": 0.1473819375038147,
|
|
"num_tokens": 3480485.0,
|
|
"step": 1445
|
|
},
|
|
{
|
|
"entropy": 5.939816188812256,
|
|
"epoch": 1.5675675675675675,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0008877536351111085,
|
|
"loss": 5.801699829101563,
|
|
"mean_token_accuracy": 0.166758930683136,
|
|
"num_tokens": 3491508.0,
|
|
"step": 1450
|
|
},
|
|
{
|
|
"entropy": 6.038672733306885,
|
|
"epoch": 1.572972972972973,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0008866202246815106,
|
|
"loss": 6.041971206665039,
|
|
"mean_token_accuracy": 0.15027248561382295,
|
|
"num_tokens": 3505267.0,
|
|
"step": 1455
|
|
},
|
|
{
|
|
"entropy": 5.964024448394776,
|
|
"epoch": 1.5783783783783782,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0008854819448083942,
|
|
"loss": 5.86175422668457,
|
|
"mean_token_accuracy": 0.1595403164625168,
|
|
"num_tokens": 3516972.0,
|
|
"step": 1460
|
|
},
|
|
{
|
|
"entropy": 6.008862018585205,
|
|
"epoch": 1.5837837837837838,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 0.000884338811957762,
|
|
"loss": 5.9972587585449215,
|
|
"mean_token_accuracy": 0.15611343681812287,
|
|
"num_tokens": 3528725.0,
|
|
"step": 1465
|
|
},
|
|
{
|
|
"entropy": 5.940758991241455,
|
|
"epoch": 1.5891891891891892,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 0.0008831908426658185,
|
|
"loss": 5.871331024169922,
|
|
"mean_token_accuracy": 0.1530705511569977,
|
|
"num_tokens": 3540687.0,
|
|
"step": 1470
|
|
},
|
|
{
|
|
"entropy": 6.07134599685669,
|
|
"epoch": 1.5945945945945947,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 0.0008820380535387304,
|
|
"loss": 5.952286911010742,
|
|
"mean_token_accuracy": 0.15249330252408982,
|
|
"num_tokens": 3554326.0,
|
|
"step": 1475
|
|
},
|
|
{
|
|
"entropy": 6.084695625305176,
|
|
"epoch": 1.6,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0008808804612523872,
|
|
"loss": 6.173237609863281,
|
|
"mean_token_accuracy": 0.14082578867673873,
|
|
"num_tokens": 3569897.0,
|
|
"step": 1480
|
|
},
|
|
{
|
|
"entropy": 6.015488243103027,
|
|
"epoch": 1.6054054054054054,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0008797180825521587,
|
|
"loss": 5.897605133056641,
|
|
"mean_token_accuracy": 0.15893602073192598,
|
|
"num_tokens": 3581820.0,
|
|
"step": 1485
|
|
},
|
|
{
|
|
"entropy": 5.961113452911377,
|
|
"epoch": 1.6108108108108108,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0008785509342526537,
|
|
"loss": 5.871721649169922,
|
|
"mean_token_accuracy": 0.16222674250602723,
|
|
"num_tokens": 3592975.0,
|
|
"step": 1490
|
|
},
|
|
{
|
|
"entropy": 5.809928226470947,
|
|
"epoch": 1.6162162162162161,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 0.0008773790332374772,
|
|
"loss": 5.793231964111328,
|
|
"mean_token_accuracy": 0.1613244891166687,
|
|
"num_tokens": 3605950.0,
|
|
"step": 1495
|
|
},
|
|
{
|
|
"entropy": 5.923213100433349,
|
|
"epoch": 1.6216216216216215,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 0.0008762023964589843,
|
|
"loss": 5.940186309814453,
|
|
"mean_token_accuracy": 0.15495326220989228,
|
|
"num_tokens": 3616957.0,
|
|
"step": 1500
|
|
},
|
|
{
|
|
"entropy": 5.980979537963867,
|
|
"epoch": 1.627027027027027,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 0.0008750210409380374,
|
|
"loss": 5.840050125122071,
|
|
"mean_token_accuracy": 0.15735195577144623,
|
|
"num_tokens": 3629008.0,
|
|
"step": 1505
|
|
},
|
|
{
|
|
"entropy": 5.963027667999268,
|
|
"epoch": 1.6324324324324324,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 0.0008738349837637578,
|
|
"loss": 5.900114440917969,
|
|
"mean_token_accuracy": 0.1567631959915161,
|
|
"num_tokens": 3640718.0,
|
|
"step": 1510
|
|
},
|
|
{
|
|
"entropy": 5.824203872680664,
|
|
"epoch": 1.637837837837838,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 0.00087264424209328,
|
|
"loss": 5.786465835571289,
|
|
"mean_token_accuracy": 0.1641067385673523,
|
|
"num_tokens": 3652415.0,
|
|
"step": 1515
|
|
},
|
|
{
|
|
"entropy": 5.953528213500976,
|
|
"epoch": 1.6432432432432433,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.0008714488331515028,
|
|
"loss": 5.855069351196289,
|
|
"mean_token_accuracy": 0.1647209793329239,
|
|
"num_tokens": 3664272.0,
|
|
"step": 1520
|
|
},
|
|
{
|
|
"entropy": 5.990782451629639,
|
|
"epoch": 1.6486486486486487,
|
|
"grad_norm": 0.65625,
|
|
"learning_rate": 0.0008702487742308401,
|
|
"loss": 5.933356857299804,
|
|
"mean_token_accuracy": 0.15115774869918824,
|
|
"num_tokens": 3676459.0,
|
|
"step": 1525
|
|
},
|
|
{
|
|
"entropy": 5.94338960647583,
|
|
"epoch": 1.654054054054054,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 0.0008690440826909717,
|
|
"loss": 5.868611145019531,
|
|
"mean_token_accuracy": 0.15732579827308654,
|
|
"num_tokens": 3690678.0,
|
|
"step": 1530
|
|
},
|
|
{
|
|
"entropy": 5.8550599098205565,
|
|
"epoch": 1.6594594594594594,
|
|
"grad_norm": 0.64453125,
|
|
"learning_rate": 0.0008678347759585904,
|
|
"loss": 5.798612213134765,
|
|
"mean_token_accuracy": 0.15875921845436097,
|
|
"num_tokens": 3702652.0,
|
|
"step": 1535
|
|
},
|
|
{
|
|
"entropy": 6.020911407470703,
|
|
"epoch": 1.6648648648648647,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 0.0008666208715271517,
|
|
"loss": 6.028233337402344,
|
|
"mean_token_accuracy": 0.14420250058174133,
|
|
"num_tokens": 3715399.0,
|
|
"step": 1540
|
|
},
|
|
{
|
|
"entropy": 5.965929794311523,
|
|
"epoch": 1.6702702702702703,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 0.0008654023869566194,
|
|
"loss": 5.865740203857422,
|
|
"mean_token_accuracy": 0.15165745615959167,
|
|
"num_tokens": 3726145.0,
|
|
"step": 1545
|
|
},
|
|
{
|
|
"entropy": 6.014906024932861,
|
|
"epoch": 1.6756756756756757,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 0.0008641793398732129,
|
|
"loss": 5.869577407836914,
|
|
"mean_token_accuracy": 0.15300983488559722,
|
|
"num_tokens": 3737755.0,
|
|
"step": 1550
|
|
},
|
|
{
|
|
"entropy": 5.840787696838379,
|
|
"epoch": 1.6810810810810812,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 0.0008629517479691506,
|
|
"loss": 5.768186569213867,
|
|
"mean_token_accuracy": 0.1616358280181885,
|
|
"num_tokens": 3748694.0,
|
|
"step": 1555
|
|
},
|
|
{
|
|
"entropy": 5.939591979980468,
|
|
"epoch": 1.6864864864864866,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 0.000861719629002396,
|
|
"loss": 5.9125518798828125,
|
|
"mean_token_accuracy": 0.1544147849082947,
|
|
"num_tokens": 3762516.0,
|
|
"step": 1560
|
|
},
|
|
{
|
|
"entropy": 6.0187114715576175,
|
|
"epoch": 1.691891891891892,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.0008604830007963983,
|
|
"loss": 6.051762390136719,
|
|
"mean_token_accuracy": 0.14813959300518037,
|
|
"num_tokens": 3776098.0,
|
|
"step": 1565
|
|
},
|
|
{
|
|
"entropy": 6.052183437347412,
|
|
"epoch": 1.6972972972972973,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.000859241881239837,
|
|
"loss": 5.978187561035156,
|
|
"mean_token_accuracy": 0.15714339911937714,
|
|
"num_tokens": 3786003.0,
|
|
"step": 1570
|
|
},
|
|
{
|
|
"entropy": 6.044375324249268,
|
|
"epoch": 1.7027027027027026,
|
|
"grad_norm": 0.6640625,
|
|
"learning_rate": 0.000857996288286362,
|
|
"loss": 5.934653091430664,
|
|
"mean_token_accuracy": 0.14706941545009614,
|
|
"num_tokens": 3798362.0,
|
|
"step": 1575
|
|
},
|
|
{
|
|
"entropy": 5.940067195892334,
|
|
"epoch": 1.708108108108108,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 0.0008567462399543333,
|
|
"loss": 5.798627471923828,
|
|
"mean_token_accuracy": 0.16449737548828125,
|
|
"num_tokens": 3809172.0,
|
|
"step": 1580
|
|
},
|
|
{
|
|
"entropy": 5.740559482574463,
|
|
"epoch": 1.7135135135135136,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.0008554917543265616,
|
|
"loss": 5.780983734130859,
|
|
"mean_token_accuracy": 0.15897656679153443,
|
|
"num_tokens": 3820141.0,
|
|
"step": 1585
|
|
},
|
|
{
|
|
"entropy": 5.95734920501709,
|
|
"epoch": 1.718918918918919,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.000854232849550046,
|
|
"loss": 5.8186603546142575,
|
|
"mean_token_accuracy": 0.1598174452781677,
|
|
"num_tokens": 3831231.0,
|
|
"step": 1590
|
|
},
|
|
{
|
|
"entropy": 6.005247402191162,
|
|
"epoch": 1.7243243243243245,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0008529695438357117,
|
|
"loss": 5.890240859985352,
|
|
"mean_token_accuracy": 0.15293248891830444,
|
|
"num_tokens": 3843480.0,
|
|
"step": 1595
|
|
},
|
|
{
|
|
"entropy": 6.016628551483154,
|
|
"epoch": 1.7297297297297298,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0008517018554581462,
|
|
"loss": 5.996260070800782,
|
|
"mean_token_accuracy": 0.1509675770998001,
|
|
"num_tokens": 3857586.0,
|
|
"step": 1600
|
|
},
|
|
{
|
|
"entropy": 6.130516242980957,
|
|
"epoch": 1.7351351351351352,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0008504298027553357,
|
|
"loss": 6.028236389160156,
|
|
"mean_token_accuracy": 0.15611889213323593,
|
|
"num_tokens": 3869547.0,
|
|
"step": 1605
|
|
},
|
|
{
|
|
"entropy": 5.921278381347657,
|
|
"epoch": 1.7405405405405405,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0008491534041283991,
|
|
"loss": 5.8067058563232425,
|
|
"mean_token_accuracy": 0.1678238719701767,
|
|
"num_tokens": 3880048.0,
|
|
"step": 1610
|
|
},
|
|
{
|
|
"entropy": 5.8370708465576175,
|
|
"epoch": 1.7459459459459459,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0008478726780413218,
|
|
"loss": 5.954257202148438,
|
|
"mean_token_accuracy": 0.15217690765857697,
|
|
"num_tokens": 3892112.0,
|
|
"step": 1615
|
|
},
|
|
{
|
|
"entropy": 6.006961822509766,
|
|
"epoch": 1.7513513513513512,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 0.0008465876430206899,
|
|
"loss": 5.88764762878418,
|
|
"mean_token_accuracy": 0.15819757878780366,
|
|
"num_tokens": 3903668.0,
|
|
"step": 1620
|
|
},
|
|
{
|
|
"entropy": 5.98789644241333,
|
|
"epoch": 1.7567567567567568,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 0.0008452983176554196,
|
|
"loss": 5.858601760864258,
|
|
"mean_token_accuracy": 0.15955002903938292,
|
|
"num_tokens": 3916982.0,
|
|
"step": 1625
|
|
},
|
|
{
|
|
"entropy": 5.848407745361328,
|
|
"epoch": 1.7621621621621621,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 0.0008440047205964914,
|
|
"loss": 5.840298461914062,
|
|
"mean_token_accuracy": 0.16374977827072143,
|
|
"num_tokens": 3928166.0,
|
|
"step": 1630
|
|
},
|
|
{
|
|
"entropy": 5.9792177200317385,
|
|
"epoch": 1.7675675675675677,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0008427068705566781,
|
|
"loss": 6.006826782226563,
|
|
"mean_token_accuracy": 0.14952372312545775,
|
|
"num_tokens": 3939246.0,
|
|
"step": 1635
|
|
},
|
|
{
|
|
"entropy": 6.200690364837646,
|
|
"epoch": 1.772972972972973,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0008414047863102747,
|
|
"loss": 5.999441528320313,
|
|
"mean_token_accuracy": 0.14769191443920135,
|
|
"num_tokens": 3952832.0,
|
|
"step": 1640
|
|
},
|
|
{
|
|
"entropy": 5.910121726989746,
|
|
"epoch": 1.7783783783783784,
|
|
"grad_norm": 0.6640625,
|
|
"learning_rate": 0.0008400984866928275,
|
|
"loss": 5.827185821533203,
|
|
"mean_token_accuracy": 0.16465649306774138,
|
|
"num_tokens": 3966155.0,
|
|
"step": 1645
|
|
},
|
|
{
|
|
"entropy": 5.943995761871338,
|
|
"epoch": 1.7837837837837838,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.0008387879906008601,
|
|
"loss": 5.899274826049805,
|
|
"mean_token_accuracy": 0.15780851244926453,
|
|
"num_tokens": 3980038.0,
|
|
"step": 1650
|
|
},
|
|
{
|
|
"entropy": 5.938759899139404,
|
|
"epoch": 1.7891891891891891,
|
|
"grad_norm": 0.66015625,
|
|
"learning_rate": 0.0008374733169916021,
|
|
"loss": 6.025347137451172,
|
|
"mean_token_accuracy": 0.14912573248147964,
|
|
"num_tokens": 3992732.0,
|
|
"step": 1655
|
|
},
|
|
{
|
|
"entropy": 5.997166156768799,
|
|
"epoch": 1.7945945945945945,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.0008361544848827127,
|
|
"loss": 5.793037414550781,
|
|
"mean_token_accuracy": 0.15761127471923828,
|
|
"num_tokens": 4003705.0,
|
|
"step": 1660
|
|
},
|
|
{
|
|
"entropy": 5.892963027954101,
|
|
"epoch": 1.8,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 0.0008348315133520075,
|
|
"loss": 5.9427635192871096,
|
|
"mean_token_accuracy": 0.152792489528656,
|
|
"num_tokens": 4015718.0,
|
|
"step": 1665
|
|
},
|
|
{
|
|
"entropy": 5.920527076721191,
|
|
"epoch": 1.8054054054054054,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 0.0008335044215371813,
|
|
"loss": 5.789597702026367,
|
|
"mean_token_accuracy": 0.16133061945438384,
|
|
"num_tokens": 4026361.0,
|
|
"step": 1670
|
|
},
|
|
{
|
|
"entropy": 5.8828856468200685,
|
|
"epoch": 1.810810810810811,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 0.0008321732286355318,
|
|
"loss": 5.893592453002929,
|
|
"mean_token_accuracy": 0.15036226361989974,
|
|
"num_tokens": 4040437.0,
|
|
"step": 1675
|
|
},
|
|
{
|
|
"entropy": 6.015377521514893,
|
|
"epoch": 1.8162162162162163,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 0.0008308379539036815,
|
|
"loss": 5.925026702880859,
|
|
"mean_token_accuracy": 0.1480212152004242,
|
|
"num_tokens": 4055050.0,
|
|
"step": 1680
|
|
},
|
|
{
|
|
"entropy": 5.915068912506103,
|
|
"epoch": 1.8216216216216217,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.0008294986166572996,
|
|
"loss": 5.826159286499023,
|
|
"mean_token_accuracy": 0.15820080935955047,
|
|
"num_tokens": 4066011.0,
|
|
"step": 1685
|
|
},
|
|
{
|
|
"entropy": 5.831681251525879,
|
|
"epoch": 1.827027027027027,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 0.0008281552362708223,
|
|
"loss": 5.761726379394531,
|
|
"mean_token_accuracy": 0.16127054691314696,
|
|
"num_tokens": 4077430.0,
|
|
"step": 1690
|
|
},
|
|
{
|
|
"entropy": 6.011395454406738,
|
|
"epoch": 1.8324324324324324,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 0.0008268078321771727,
|
|
"loss": 5.903897094726562,
|
|
"mean_token_accuracy": 0.15751948654651643,
|
|
"num_tokens": 4090523.0,
|
|
"step": 1695
|
|
},
|
|
{
|
|
"entropy": 5.914142227172851,
|
|
"epoch": 1.8378378378378377,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 0.0008254564238674794,
|
|
"loss": 5.876987075805664,
|
|
"mean_token_accuracy": 0.1542936235666275,
|
|
"num_tokens": 4101919.0,
|
|
"step": 1700
|
|
},
|
|
{
|
|
"entropy": 5.970525455474854,
|
|
"epoch": 1.8432432432432433,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 0.0008241010308907951,
|
|
"loss": 5.960490036010742,
|
|
"mean_token_accuracy": 0.15674711167812347,
|
|
"num_tokens": 4114135.0,
|
|
"step": 1705
|
|
},
|
|
{
|
|
"entropy": 5.934633445739746,
|
|
"epoch": 1.8486486486486486,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0008227416728538128,
|
|
"loss": 5.802957916259766,
|
|
"mean_token_accuracy": 0.1623306691646576,
|
|
"num_tokens": 4125312.0,
|
|
"step": 1710
|
|
},
|
|
{
|
|
"entropy": 5.878772258758545,
|
|
"epoch": 1.8540540540540542,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 0.0008213783694205839,
|
|
"loss": 5.777447128295899,
|
|
"mean_token_accuracy": 0.16162220537662506,
|
|
"num_tokens": 4136693.0,
|
|
"step": 1715
|
|
},
|
|
{
|
|
"entropy": 5.870784187316895,
|
|
"epoch": 1.8594594594594596,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.0008200111403122315,
|
|
"loss": 5.841195678710937,
|
|
"mean_token_accuracy": 0.16130259037017822,
|
|
"num_tokens": 4148495.0,
|
|
"step": 1720
|
|
},
|
|
{
|
|
"entropy": 5.954642677307129,
|
|
"epoch": 1.864864864864865,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.0008186400053066668,
|
|
"loss": 5.839686584472656,
|
|
"mean_token_accuracy": 0.16170231401920318,
|
|
"num_tokens": 4159648.0,
|
|
"step": 1725
|
|
},
|
|
{
|
|
"entropy": 5.861533260345459,
|
|
"epoch": 1.8702702702702703,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.000817264984238303,
|
|
"loss": 5.768640518188477,
|
|
"mean_token_accuracy": 0.16273143291473388,
|
|
"num_tokens": 4169810.0,
|
|
"step": 1730
|
|
},
|
|
{
|
|
"entropy": 5.900146198272705,
|
|
"epoch": 1.8756756756756756,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.000815886096997767,
|
|
"loss": 5.84183349609375,
|
|
"mean_token_accuracy": 0.15980561077594757,
|
|
"num_tokens": 4181139.0,
|
|
"step": 1735
|
|
},
|
|
{
|
|
"entropy": 6.048444652557373,
|
|
"epoch": 1.881081081081081,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.000814503363531613,
|
|
"loss": 6.1030632019042965,
|
|
"mean_token_accuracy": 0.13935500532388687,
|
|
"num_tokens": 4197903.0,
|
|
"step": 1740
|
|
},
|
|
{
|
|
"entropy": 5.966563606262207,
|
|
"epoch": 1.8864864864864865,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0008131168038420334,
|
|
"loss": 5.912844848632813,
|
|
"mean_token_accuracy": 0.15547370314598083,
|
|
"num_tokens": 4208221.0,
|
|
"step": 1745
|
|
},
|
|
{
|
|
"entropy": 5.996464729309082,
|
|
"epoch": 1.8918918918918919,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0008117264379865699,
|
|
"loss": 5.8559318542480465,
|
|
"mean_token_accuracy": 0.14872512519359588,
|
|
"num_tokens": 4221641.0,
|
|
"step": 1750
|
|
},
|
|
{
|
|
"entropy": 5.873746681213379,
|
|
"epoch": 1.8972972972972975,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0008103322860778222,
|
|
"loss": 5.843596649169922,
|
|
"mean_token_accuracy": 0.16076571643352508,
|
|
"num_tokens": 4234816.0,
|
|
"step": 1755
|
|
},
|
|
{
|
|
"entropy": 5.94351167678833,
|
|
"epoch": 1.9027027027027028,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0008089343682831589,
|
|
"loss": 5.80005111694336,
|
|
"mean_token_accuracy": 0.15597352683544158,
|
|
"num_tokens": 4246361.0,
|
|
"step": 1760
|
|
},
|
|
{
|
|
"entropy": 5.784683704376221,
|
|
"epoch": 1.9081081081081082,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 0.000807532704824424,
|
|
"loss": 5.769342041015625,
|
|
"mean_token_accuracy": 0.1640514612197876,
|
|
"num_tokens": 4257726.0,
|
|
"step": 1765
|
|
},
|
|
{
|
|
"entropy": 5.84423599243164,
|
|
"epoch": 1.9135135135135135,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0008061273159776451,
|
|
"loss": 5.736867904663086,
|
|
"mean_token_accuracy": 0.1638896197080612,
|
|
"num_tokens": 4268046.0,
|
|
"step": 1770
|
|
},
|
|
{
|
|
"entropy": 5.982893753051758,
|
|
"epoch": 1.9189189189189189,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 0.0008047182220727408,
|
|
"loss": 5.937384414672851,
|
|
"mean_token_accuracy": 0.1541384845972061,
|
|
"num_tokens": 4278742.0,
|
|
"step": 1775
|
|
},
|
|
{
|
|
"entropy": 6.127891540527344,
|
|
"epoch": 1.9243243243243242,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 0.0008033054434932254,
|
|
"loss": 5.961701965332031,
|
|
"mean_token_accuracy": 0.15437058806419374,
|
|
"num_tokens": 4292724.0,
|
|
"step": 1780
|
|
},
|
|
{
|
|
"entropy": 5.924184322357178,
|
|
"epoch": 1.9297297297297298,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.000801889000675914,
|
|
"loss": 5.8671623229980465,
|
|
"mean_token_accuracy": 0.1589438408613205,
|
|
"num_tokens": 4303028.0,
|
|
"step": 1785
|
|
},
|
|
{
|
|
"entropy": 5.705279350280762,
|
|
"epoch": 1.9351351351351351,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0008004689141106288,
|
|
"loss": 5.709238433837891,
|
|
"mean_token_accuracy": 0.16910262405872345,
|
|
"num_tokens": 4314381.0,
|
|
"step": 1790
|
|
},
|
|
{
|
|
"entropy": 5.805646800994873,
|
|
"epoch": 1.9405405405405407,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 0.0007990452043399,
|
|
"loss": 5.732901000976563,
|
|
"mean_token_accuracy": 0.16858636140823363,
|
|
"num_tokens": 4325182.0,
|
|
"step": 1795
|
|
},
|
|
{
|
|
"entropy": 6.05684461593628,
|
|
"epoch": 1.945945945945946,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 0.0007976178919586711,
|
|
"loss": 6.029544067382813,
|
|
"mean_token_accuracy": 0.14246535897254944,
|
|
"num_tokens": 4340271.0,
|
|
"step": 1800
|
|
},
|
|
{
|
|
"entropy": 5.991472434997559,
|
|
"epoch": 1.9513513513513514,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.0007961869976139987,
|
|
"loss": 5.902516174316406,
|
|
"mean_token_accuracy": 0.16500157713890076,
|
|
"num_tokens": 4353881.0,
|
|
"step": 1805
|
|
},
|
|
{
|
|
"entropy": 5.868509578704834,
|
|
"epoch": 1.9567567567567568,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 0.0007947525420047558,
|
|
"loss": 5.885099029541015,
|
|
"mean_token_accuracy": 0.15701564848423005,
|
|
"num_tokens": 4365773.0,
|
|
"step": 1810
|
|
},
|
|
{
|
|
"entropy": 6.079554080963135,
|
|
"epoch": 1.962162162162162,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 0.0007933145458813313,
|
|
"loss": 5.97406120300293,
|
|
"mean_token_accuracy": 0.15619401633739471,
|
|
"num_tokens": 4378779.0,
|
|
"step": 1815
|
|
},
|
|
{
|
|
"entropy": 5.911398601531983,
|
|
"epoch": 1.9675675675675675,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 0.00079187303004533,
|
|
"loss": 5.788228988647461,
|
|
"mean_token_accuracy": 0.1630644679069519,
|
|
"num_tokens": 4391227.0,
|
|
"step": 1820
|
|
},
|
|
{
|
|
"entropy": 5.884594058990478,
|
|
"epoch": 1.972972972972973,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 0.0007904280153492719,
|
|
"loss": 5.822915649414062,
|
|
"mean_token_accuracy": 0.16305937618017197,
|
|
"num_tokens": 4405081.0,
|
|
"step": 1825
|
|
},
|
|
{
|
|
"entropy": 5.893936729431152,
|
|
"epoch": 1.9783783783783784,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0007889795226962903,
|
|
"loss": 5.852434158325195,
|
|
"mean_token_accuracy": 0.16256003975868225,
|
|
"num_tokens": 4418367.0,
|
|
"step": 1830
|
|
},
|
|
{
|
|
"entropy": 5.817579555511474,
|
|
"epoch": 1.983783783783784,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 0.0007875275730398296,
|
|
"loss": 5.800425720214844,
|
|
"mean_token_accuracy": 0.1621989995241165,
|
|
"num_tokens": 4430138.0,
|
|
"step": 1835
|
|
},
|
|
{
|
|
"entropy": 5.999104595184326,
|
|
"epoch": 1.9891891891891893,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0007860721873833421,
|
|
"loss": 5.810161590576172,
|
|
"mean_token_accuracy": 0.15874570310115815,
|
|
"num_tokens": 4442843.0,
|
|
"step": 1840
|
|
},
|
|
{
|
|
"entropy": 5.885268878936768,
|
|
"epoch": 1.9945945945945946,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 0.0007846133867799843,
|
|
"loss": 5.8348651885986325,
|
|
"mean_token_accuracy": 0.15846727192401885,
|
|
"num_tokens": 4455005.0,
|
|
"step": 1845
|
|
},
|
|
{
|
|
"entropy": 5.798076820373535,
|
|
"epoch": 2.0,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0007831511923323122,
|
|
"loss": 5.883354568481446,
|
|
"mean_token_accuracy": 0.15775206387043,
|
|
"num_tokens": 4465336.0,
|
|
"step": 1850
|
|
},
|
|
{
|
|
"entropy": 5.810991191864014,
|
|
"epoch": 2.0054054054054054,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 0.0007816856251919762,
|
|
"loss": 5.527929306030273,
|
|
"mean_token_accuracy": 0.16748940646648408,
|
|
"num_tokens": 4477360.0,
|
|
"step": 1855
|
|
},
|
|
{
|
|
"entropy": 5.809268569946289,
|
|
"epoch": 2.0108108108108107,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 0.0007802167065594145,
|
|
"loss": 5.577561950683593,
|
|
"mean_token_accuracy": 0.16481069922447206,
|
|
"num_tokens": 4488410.0,
|
|
"step": 1860
|
|
},
|
|
{
|
|
"entropy": 5.625452709197998,
|
|
"epoch": 2.016216216216216,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 0.0007787444576835481,
|
|
"loss": 5.5580078125,
|
|
"mean_token_accuracy": 0.17334003746509552,
|
|
"num_tokens": 4500257.0,
|
|
"step": 1865
|
|
},
|
|
{
|
|
"entropy": 5.561168956756592,
|
|
"epoch": 2.0216216216216214,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 0.0007772688998614708,
|
|
"loss": 5.410086059570313,
|
|
"mean_token_accuracy": 0.18215323388576507,
|
|
"num_tokens": 4511162.0,
|
|
"step": 1870
|
|
},
|
|
{
|
|
"entropy": 5.757048511505127,
|
|
"epoch": 2.027027027027027,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0007757900544381437,
|
|
"loss": 5.635135650634766,
|
|
"mean_token_accuracy": 0.16631377041339873,
|
|
"num_tokens": 4521402.0,
|
|
"step": 1875
|
|
},
|
|
{
|
|
"entropy": 5.7210588455200195,
|
|
"epoch": 2.0324324324324325,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 0.000774307942806085,
|
|
"loss": 5.385799407958984,
|
|
"mean_token_accuracy": 0.17716321647167205,
|
|
"num_tokens": 4532285.0,
|
|
"step": 1880
|
|
},
|
|
{
|
|
"entropy": 5.656139659881592,
|
|
"epoch": 2.037837837837838,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 0.0007728225864050604,
|
|
"loss": 5.591728973388672,
|
|
"mean_token_accuracy": 0.17316411435604095,
|
|
"num_tokens": 4542765.0,
|
|
"step": 1885
|
|
},
|
|
{
|
|
"entropy": 5.640194320678711,
|
|
"epoch": 2.0432432432432432,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0007713340067217743,
|
|
"loss": 5.508696365356445,
|
|
"mean_token_accuracy": 0.17453130185604096,
|
|
"num_tokens": 4553113.0,
|
|
"step": 1890
|
|
},
|
|
{
|
|
"entropy": 5.633144664764404,
|
|
"epoch": 2.0486486486486486,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 0.0007698422252895573,
|
|
"loss": 5.5036571502685545,
|
|
"mean_token_accuracy": 0.17045795619487764,
|
|
"num_tokens": 4565831.0,
|
|
"step": 1895
|
|
},
|
|
{
|
|
"entropy": 5.780905246734619,
|
|
"epoch": 2.054054054054054,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0007683472636880559,
|
|
"loss": 5.6892822265625,
|
|
"mean_token_accuracy": 0.16380396485328674,
|
|
"num_tokens": 4579563.0,
|
|
"step": 1900
|
|
},
|
|
{
|
|
"entropy": 5.758352661132813,
|
|
"epoch": 2.0594594594594593,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.0007668491435429198,
|
|
"loss": 5.554851913452149,
|
|
"mean_token_accuracy": 0.1707320511341095,
|
|
"num_tokens": 4590549.0,
|
|
"step": 1905
|
|
},
|
|
{
|
|
"entropy": 5.689521026611328,
|
|
"epoch": 2.064864864864865,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 0.0007653478865254896,
|
|
"loss": 5.547829055786133,
|
|
"mean_token_accuracy": 0.17455363869667054,
|
|
"num_tokens": 4602157.0,
|
|
"step": 1910
|
|
},
|
|
{
|
|
"entropy": 5.657618808746338,
|
|
"epoch": 2.0702702702702704,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 0.0007638435143524821,
|
|
"loss": 5.633978271484375,
|
|
"mean_token_accuracy": 0.16765685081481935,
|
|
"num_tokens": 4614884.0,
|
|
"step": 1915
|
|
},
|
|
{
|
|
"entropy": 5.809543132781982,
|
|
"epoch": 2.075675675675676,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 0.0007623360487856777,
|
|
"loss": 5.555442047119141,
|
|
"mean_token_accuracy": 0.17740504145622255,
|
|
"num_tokens": 4626089.0,
|
|
"step": 1920
|
|
},
|
|
{
|
|
"entropy": 5.652527332305908,
|
|
"epoch": 2.081081081081081,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0007608255116316047,
|
|
"loss": 5.568304061889648,
|
|
"mean_token_accuracy": 0.16942307054996492,
|
|
"num_tokens": 4637381.0,
|
|
"step": 1925
|
|
},
|
|
{
|
|
"entropy": 5.808231163024902,
|
|
"epoch": 2.0864864864864865,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.000759311924741224,
|
|
"loss": 5.685822677612305,
|
|
"mean_token_accuracy": 0.16158882677555084,
|
|
"num_tokens": 4651102.0,
|
|
"step": 1930
|
|
},
|
|
{
|
|
"entropy": 5.715962696075439,
|
|
"epoch": 2.091891891891892,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 0.0007577953100096127,
|
|
"loss": 5.584080505371094,
|
|
"mean_token_accuracy": 0.17144258618354796,
|
|
"num_tokens": 4662346.0,
|
|
"step": 1935
|
|
},
|
|
{
|
|
"entropy": 5.584010601043701,
|
|
"epoch": 2.097297297297297,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0007562756893756482,
|
|
"loss": 5.479648208618164,
|
|
"mean_token_accuracy": 0.1779884248971939,
|
|
"num_tokens": 4673267.0,
|
|
"step": 1940
|
|
},
|
|
{
|
|
"entropy": 5.691203498840332,
|
|
"epoch": 2.1027027027027025,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 0.0007547530848216902,
|
|
"loss": 5.5625354766845705,
|
|
"mean_token_accuracy": 0.1721408635377884,
|
|
"num_tokens": 4686971.0,
|
|
"step": 1945
|
|
},
|
|
{
|
|
"entropy": 5.826029586791992,
|
|
"epoch": 2.108108108108108,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 0.0007532275183732627,
|
|
"loss": 5.578032684326172,
|
|
"mean_token_accuracy": 0.1736992359161377,
|
|
"num_tokens": 4698148.0,
|
|
"step": 1950
|
|
},
|
|
{
|
|
"entropy": 5.525319576263428,
|
|
"epoch": 2.1135135135135137,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0007516990120987357,
|
|
"loss": 5.548344421386719,
|
|
"mean_token_accuracy": 0.1678497314453125,
|
|
"num_tokens": 4708146.0,
|
|
"step": 1955
|
|
},
|
|
{
|
|
"entropy": 5.655934047698975,
|
|
"epoch": 2.118918918918919,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0007501675881090059,
|
|
"loss": 5.4946849822998045,
|
|
"mean_token_accuracy": 0.1745520293712616,
|
|
"num_tokens": 4721507.0,
|
|
"step": 1960
|
|
},
|
|
{
|
|
"entropy": 5.759321308135986,
|
|
"epoch": 2.1243243243243244,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.0007486332685571763,
|
|
"loss": 5.596438217163086,
|
|
"mean_token_accuracy": 0.1724897027015686,
|
|
"num_tokens": 4733769.0,
|
|
"step": 1965
|
|
},
|
|
{
|
|
"entropy": 5.763000202178955,
|
|
"epoch": 2.1297297297297297,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.0007470960756382371,
|
|
"loss": 5.642522811889648,
|
|
"mean_token_accuracy": 0.16852032840251924,
|
|
"num_tokens": 4746989.0,
|
|
"step": 1970
|
|
},
|
|
{
|
|
"entropy": 5.744833946228027,
|
|
"epoch": 2.135135135135135,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 0.0007455560315887427,
|
|
"loss": 5.643239593505859,
|
|
"mean_token_accuracy": 0.17182834148406984,
|
|
"num_tokens": 4759644.0,
|
|
"step": 1975
|
|
},
|
|
{
|
|
"entropy": 5.654244041442871,
|
|
"epoch": 2.1405405405405404,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0007440131586864915,
|
|
"loss": 5.531895446777344,
|
|
"mean_token_accuracy": 0.16754286289215087,
|
|
"num_tokens": 4771386.0,
|
|
"step": 1980
|
|
},
|
|
{
|
|
"entropy": 5.694602966308594,
|
|
"epoch": 2.145945945945946,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0007424674792502037,
|
|
"loss": 5.515792465209961,
|
|
"mean_token_accuracy": 0.18264077007770538,
|
|
"num_tokens": 4782830.0,
|
|
"step": 1985
|
|
},
|
|
{
|
|
"entropy": 5.667961311340332,
|
|
"epoch": 2.1513513513513516,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 0.0007409190156391969,
|
|
"loss": 5.545432281494141,
|
|
"mean_token_accuracy": 0.17193699777126312,
|
|
"num_tokens": 4795220.0,
|
|
"step": 1990
|
|
},
|
|
{
|
|
"entropy": 5.770290660858154,
|
|
"epoch": 2.156756756756757,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0007393677902530648,
|
|
"loss": 5.638581848144531,
|
|
"mean_token_accuracy": 0.17162449061870574,
|
|
"num_tokens": 4806904.0,
|
|
"step": 1995
|
|
},
|
|
{
|
|
"entropy": 5.681714153289795,
|
|
"epoch": 2.1621621621621623,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 0.0007378138255313511,
|
|
"loss": 5.612754058837891,
|
|
"mean_token_accuracy": 0.16533401906490325,
|
|
"num_tokens": 4818963.0,
|
|
"step": 2000
|
|
},
|
|
{
|
|
"entropy": 5.727060604095459,
|
|
"epoch": 2.1675675675675676,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.0007362571439532269,
|
|
"loss": 5.5895233154296875,
|
|
"mean_token_accuracy": 0.17819115817546843,
|
|
"num_tokens": 4831028.0,
|
|
"step": 2005
|
|
},
|
|
{
|
|
"entropy": 5.64081916809082,
|
|
"epoch": 2.172972972972973,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 0.0007346977680371635,
|
|
"loss": 5.476025009155274,
|
|
"mean_token_accuracy": 0.17935265898704528,
|
|
"num_tokens": 4842240.0,
|
|
"step": 2010
|
|
},
|
|
{
|
|
"entropy": 5.65792818069458,
|
|
"epoch": 2.1783783783783783,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.0007331357203406082,
|
|
"loss": 5.545627593994141,
|
|
"mean_token_accuracy": 0.17621175646781922,
|
|
"num_tokens": 4854041.0,
|
|
"step": 2015
|
|
},
|
|
{
|
|
"entropy": 5.791291332244873,
|
|
"epoch": 2.1837837837837837,
|
|
"grad_norm": 0.65234375,
|
|
"learning_rate": 0.0007315710234596578,
|
|
"loss": 5.6754150390625,
|
|
"mean_token_accuracy": 0.16453547179698944,
|
|
"num_tokens": 4868601.0,
|
|
"step": 2020
|
|
},
|
|
{
|
|
"entropy": 5.825401782989502,
|
|
"epoch": 2.189189189189189,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0007300037000287303,
|
|
"loss": 5.684099960327148,
|
|
"mean_token_accuracy": 0.16555361151695253,
|
|
"num_tokens": 4883360.0,
|
|
"step": 2025
|
|
},
|
|
{
|
|
"entropy": 5.731338691711426,
|
|
"epoch": 2.1945945945945944,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0007284337727202395,
|
|
"loss": 5.610355377197266,
|
|
"mean_token_accuracy": 0.16909985840320588,
|
|
"num_tokens": 4896446.0,
|
|
"step": 2030
|
|
},
|
|
{
|
|
"entropy": 5.696315670013428,
|
|
"epoch": 2.2,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0007268612642442657,
|
|
"loss": 5.554078674316406,
|
|
"mean_token_accuracy": 0.16816651821136475,
|
|
"num_tokens": 4906902.0,
|
|
"step": 2035
|
|
},
|
|
{
|
|
"entropy": 5.631414318084717,
|
|
"epoch": 2.2054054054054055,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 0.0007252861973482276,
|
|
"loss": 5.611651992797851,
|
|
"mean_token_accuracy": 0.16985254287719725,
|
|
"num_tokens": 4918365.0,
|
|
"step": 2040
|
|
},
|
|
{
|
|
"entropy": 5.775050163269043,
|
|
"epoch": 2.210810810810811,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 0.0007237085948165534,
|
|
"loss": 5.563068389892578,
|
|
"mean_token_accuracy": 0.16796254515647888,
|
|
"num_tokens": 4930975.0,
|
|
"step": 2045
|
|
},
|
|
{
|
|
"entropy": 5.744052982330322,
|
|
"epoch": 2.2162162162162162,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0007221284794703506,
|
|
"loss": 5.537122344970703,
|
|
"mean_token_accuracy": 0.17797220051288604,
|
|
"num_tokens": 4942139.0,
|
|
"step": 2050
|
|
},
|
|
{
|
|
"entropy": 5.568467140197754,
|
|
"epoch": 2.2216216216216216,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 0.000720545874167077,
|
|
"loss": 5.562784576416016,
|
|
"mean_token_accuracy": 0.17499283850193023,
|
|
"num_tokens": 4954228.0,
|
|
"step": 2055
|
|
},
|
|
{
|
|
"entropy": 5.699211883544922,
|
|
"epoch": 2.227027027027027,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0007189608018002084,
|
|
"loss": 5.589778137207031,
|
|
"mean_token_accuracy": 0.17234556376934052,
|
|
"num_tokens": 4967960.0,
|
|
"step": 2060
|
|
},
|
|
{
|
|
"entropy": 5.722121143341065,
|
|
"epoch": 2.2324324324324323,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.0007173732852989094,
|
|
"loss": 5.646148681640625,
|
|
"mean_token_accuracy": 0.16953389644622802,
|
|
"num_tokens": 4979999.0,
|
|
"step": 2065
|
|
},
|
|
{
|
|
"entropy": 5.74592809677124,
|
|
"epoch": 2.237837837837838,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0007157833476276996,
|
|
"loss": 5.612464523315429,
|
|
"mean_token_accuracy": 0.17109946310520172,
|
|
"num_tokens": 4989958.0,
|
|
"step": 2070
|
|
},
|
|
{
|
|
"entropy": 5.685823535919189,
|
|
"epoch": 2.2432432432432434,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0007141910117861234,
|
|
"loss": 5.590219497680664,
|
|
"mean_token_accuracy": 0.16832195222377777,
|
|
"num_tokens": 5001893.0,
|
|
"step": 2075
|
|
},
|
|
{
|
|
"entropy": 5.760835742950439,
|
|
"epoch": 2.2486486486486488,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0007125963008084158,
|
|
"loss": 5.643925476074219,
|
|
"mean_token_accuracy": 0.1669104129076004,
|
|
"num_tokens": 5014933.0,
|
|
"step": 2080
|
|
},
|
|
{
|
|
"entropy": 5.673394966125488,
|
|
"epoch": 2.254054054054054,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0007109992377631705,
|
|
"loss": 5.546022415161133,
|
|
"mean_token_accuracy": 0.16820069551467895,
|
|
"num_tokens": 5026279.0,
|
|
"step": 2085
|
|
},
|
|
{
|
|
"entropy": 5.573141479492188,
|
|
"epoch": 2.2594594594594595,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0007093998457530045,
|
|
"loss": 5.338437271118164,
|
|
"mean_token_accuracy": 0.19089553952217103,
|
|
"num_tokens": 5037720.0,
|
|
"step": 2090
|
|
},
|
|
{
|
|
"entropy": 5.596235370635986,
|
|
"epoch": 2.264864864864865,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0007077981479142257,
|
|
"loss": 5.533810424804687,
|
|
"mean_token_accuracy": 0.17367922365665436,
|
|
"num_tokens": 5047609.0,
|
|
"step": 2095
|
|
},
|
|
{
|
|
"entropy": 5.663949203491211,
|
|
"epoch": 2.27027027027027,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0007061941674164968,
|
|
"loss": 5.6068778991699215,
|
|
"mean_token_accuracy": 0.17717987298965454,
|
|
"num_tokens": 5058166.0,
|
|
"step": 2100
|
|
},
|
|
{
|
|
"entropy": 5.701061630249024,
|
|
"epoch": 2.2756756756756755,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 0.0007045879274625013,
|
|
"loss": 5.54412841796875,
|
|
"mean_token_accuracy": 0.17889556884765626,
|
|
"num_tokens": 5069998.0,
|
|
"step": 2105
|
|
},
|
|
{
|
|
"entropy": 5.648636150360107,
|
|
"epoch": 2.281081081081081,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 0.0007029794512876068,
|
|
"loss": 5.494221496582031,
|
|
"mean_token_accuracy": 0.17559588551521302,
|
|
"num_tokens": 5080602.0,
|
|
"step": 2110
|
|
},
|
|
{
|
|
"entropy": 5.779762268066406,
|
|
"epoch": 2.2864864864864867,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0007013687621595299,
|
|
"loss": 5.672260284423828,
|
|
"mean_token_accuracy": 0.16563207805156707,
|
|
"num_tokens": 5095541.0,
|
|
"step": 2115
|
|
},
|
|
{
|
|
"entropy": 5.621087169647216,
|
|
"epoch": 2.291891891891892,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0006997558833779985,
|
|
"loss": 5.535955810546875,
|
|
"mean_token_accuracy": 0.17247156500816346,
|
|
"num_tokens": 5108080.0,
|
|
"step": 2120
|
|
},
|
|
{
|
|
"entropy": 5.9784191131591795,
|
|
"epoch": 2.2972972972972974,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.0006981408382744156,
|
|
"loss": 5.805877304077148,
|
|
"mean_token_accuracy": 0.17040936946868895,
|
|
"num_tokens": 5123579.0,
|
|
"step": 2125
|
|
},
|
|
{
|
|
"entropy": 5.692252349853516,
|
|
"epoch": 2.3027027027027027,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 0.0006965236502115218,
|
|
"loss": 5.516579437255859,
|
|
"mean_token_accuracy": 0.17608878016471863,
|
|
"num_tokens": 5134745.0,
|
|
"step": 2130
|
|
},
|
|
{
|
|
"entropy": 5.686345386505127,
|
|
"epoch": 2.308108108108108,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0006949043425830564,
|
|
"loss": 5.603594207763672,
|
|
"mean_token_accuracy": 0.17342182099819184,
|
|
"num_tokens": 5149178.0,
|
|
"step": 2135
|
|
},
|
|
{
|
|
"entropy": 5.719162178039551,
|
|
"epoch": 2.3135135135135134,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0006932829388134206,
|
|
"loss": 5.687528228759765,
|
|
"mean_token_accuracy": 0.16647164821624755,
|
|
"num_tokens": 5162867.0,
|
|
"step": 2140
|
|
},
|
|
{
|
|
"entropy": 5.685475158691406,
|
|
"epoch": 2.3189189189189188,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0006916594623573373,
|
|
"loss": 5.575584793090821,
|
|
"mean_token_accuracy": 0.16895922422409057,
|
|
"num_tokens": 5173883.0,
|
|
"step": 2145
|
|
},
|
|
{
|
|
"entropy": 5.666262149810791,
|
|
"epoch": 2.3243243243243246,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0006900339366995116,
|
|
"loss": 5.479073715209961,
|
|
"mean_token_accuracy": 0.17989599108695983,
|
|
"num_tokens": 5184685.0,
|
|
"step": 2150
|
|
},
|
|
{
|
|
"entropy": 5.705625057220459,
|
|
"epoch": 2.32972972972973,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0006884063853542929,
|
|
"loss": 5.560923767089844,
|
|
"mean_token_accuracy": 0.1785971403121948,
|
|
"num_tokens": 5197470.0,
|
|
"step": 2155
|
|
},
|
|
{
|
|
"entropy": 5.593125629425049,
|
|
"epoch": 2.3351351351351353,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0006867768318653327,
|
|
"loss": 5.475201034545899,
|
|
"mean_token_accuracy": 0.17507005631923675,
|
|
"num_tokens": 5209680.0,
|
|
"step": 2160
|
|
},
|
|
{
|
|
"entropy": 5.628833961486817,
|
|
"epoch": 2.3405405405405406,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0006851452998052455,
|
|
"loss": 5.529955291748047,
|
|
"mean_token_accuracy": 0.1723826199769974,
|
|
"num_tokens": 5221338.0,
|
|
"step": 2165
|
|
},
|
|
{
|
|
"entropy": 5.748427009582519,
|
|
"epoch": 2.345945945945946,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0006835118127752663,
|
|
"loss": 5.63670768737793,
|
|
"mean_token_accuracy": 0.16786417365074158,
|
|
"num_tokens": 5235193.0,
|
|
"step": 2170
|
|
},
|
|
{
|
|
"entropy": 5.6996049880981445,
|
|
"epoch": 2.3513513513513513,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.000681876394404911,
|
|
"loss": 5.637804412841797,
|
|
"mean_token_accuracy": 0.16333665251731871,
|
|
"num_tokens": 5246463.0,
|
|
"step": 2175
|
|
},
|
|
{
|
|
"entropy": 5.652763080596924,
|
|
"epoch": 2.3567567567567567,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 0.0006802390683516333,
|
|
"loss": 5.545832824707031,
|
|
"mean_token_accuracy": 0.16963419914245606,
|
|
"num_tokens": 5260567.0,
|
|
"step": 2180
|
|
},
|
|
{
|
|
"entropy": 5.742419052124023,
|
|
"epoch": 2.362162162162162,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 0.0006785998583004827,
|
|
"loss": 5.584059143066407,
|
|
"mean_token_accuracy": 0.16580623388290405,
|
|
"num_tokens": 5273592.0,
|
|
"step": 2185
|
|
},
|
|
{
|
|
"entropy": 5.686848068237305,
|
|
"epoch": 2.3675675675675674,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 0.0006769587879637621,
|
|
"loss": 5.646994018554688,
|
|
"mean_token_accuracy": 0.16962398290634156,
|
|
"num_tokens": 5287602.0,
|
|
"step": 2190
|
|
},
|
|
{
|
|
"entropy": 5.801796531677246,
|
|
"epoch": 2.372972972972973,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0006753158810806852,
|
|
"loss": 5.733817291259766,
|
|
"mean_token_accuracy": 0.16727249026298524,
|
|
"num_tokens": 5300322.0,
|
|
"step": 2195
|
|
},
|
|
{
|
|
"entropy": 5.903099250793457,
|
|
"epoch": 2.3783783783783785,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 0.000673671161417032,
|
|
"loss": 5.653282165527344,
|
|
"mean_token_accuracy": 0.1662377178668976,
|
|
"num_tokens": 5314493.0,
|
|
"step": 2200
|
|
},
|
|
{
|
|
"entropy": 5.566388320922852,
|
|
"epoch": 2.383783783783784,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0006720246527648058,
|
|
"loss": 5.487620544433594,
|
|
"mean_token_accuracy": 0.1809692144393921,
|
|
"num_tokens": 5325345.0,
|
|
"step": 2205
|
|
},
|
|
{
|
|
"entropy": 5.7005315780639645,
|
|
"epoch": 2.389189189189189,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0006703763789418887,
|
|
"loss": 5.641095733642578,
|
|
"mean_token_accuracy": 0.1706668257713318,
|
|
"num_tokens": 5337614.0,
|
|
"step": 2210
|
|
},
|
|
{
|
|
"entropy": 5.582326889038086,
|
|
"epoch": 2.3945945945945946,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0006687263637916979,
|
|
"loss": 5.399771118164063,
|
|
"mean_token_accuracy": 0.18349436521530152,
|
|
"num_tokens": 5348705.0,
|
|
"step": 2215
|
|
},
|
|
{
|
|
"entropy": 5.5386536598205565,
|
|
"epoch": 2.4,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 0.000667074631182839,
|
|
"loss": 5.504845809936524,
|
|
"mean_token_accuracy": 0.17459202110767363,
|
|
"num_tokens": 5361028.0,
|
|
"step": 2220
|
|
},
|
|
{
|
|
"entropy": 5.684396648406983,
|
|
"epoch": 2.4054054054054053,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0006654212050087627,
|
|
"loss": 5.509286499023437,
|
|
"mean_token_accuracy": 0.18012696802616118,
|
|
"num_tokens": 5373544.0,
|
|
"step": 2225
|
|
},
|
|
{
|
|
"entropy": 5.631877899169922,
|
|
"epoch": 2.410810810810811,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0006637661091874181,
|
|
"loss": 5.517853164672852,
|
|
"mean_token_accuracy": 0.1789025366306305,
|
|
"num_tokens": 5385280.0,
|
|
"step": 2230
|
|
},
|
|
{
|
|
"entropy": 5.617050647735596,
|
|
"epoch": 2.4162162162162164,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 0.0006621093676609066,
|
|
"loss": 5.591775894165039,
|
|
"mean_token_accuracy": 0.1741614580154419,
|
|
"num_tokens": 5398269.0,
|
|
"step": 2235
|
|
},
|
|
{
|
|
"entropy": 5.790587425231934,
|
|
"epoch": 2.4216216216216218,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 0.0006604510043951363,
|
|
"loss": 5.632550430297852,
|
|
"mean_token_accuracy": 0.17488998770713807,
|
|
"num_tokens": 5410119.0,
|
|
"step": 2240
|
|
},
|
|
{
|
|
"entropy": 5.709634017944336,
|
|
"epoch": 2.427027027027027,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 0.0006587910433794744,
|
|
"loss": 5.613259124755859,
|
|
"mean_token_accuracy": 0.17310949563980102,
|
|
"num_tokens": 5421790.0,
|
|
"step": 2245
|
|
},
|
|
{
|
|
"entropy": 5.642767333984375,
|
|
"epoch": 2.4324324324324325,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 0.000657129508626401,
|
|
"loss": 5.559130859375,
|
|
"mean_token_accuracy": 0.17577965855598449,
|
|
"num_tokens": 5433774.0,
|
|
"step": 2250
|
|
},
|
|
{
|
|
"entropy": 5.692500877380371,
|
|
"epoch": 2.437837837837838,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0006554664241711613,
|
|
"loss": 5.51934814453125,
|
|
"mean_token_accuracy": 0.16999812424182892,
|
|
"num_tokens": 5445576.0,
|
|
"step": 2255
|
|
},
|
|
{
|
|
"entropy": 5.630978584289551,
|
|
"epoch": 2.443243243243243,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 0.0006538018140714177,
|
|
"loss": 5.522604370117188,
|
|
"mean_token_accuracy": 0.17619548738002777,
|
|
"num_tokens": 5458307.0,
|
|
"step": 2260
|
|
},
|
|
{
|
|
"entropy": 5.775163650512695,
|
|
"epoch": 2.4486486486486485,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0006521357024069028,
|
|
"loss": 5.703140640258789,
|
|
"mean_token_accuracy": 0.16075244545936584,
|
|
"num_tokens": 5471576.0,
|
|
"step": 2265
|
|
},
|
|
{
|
|
"entropy": 5.689303970336914,
|
|
"epoch": 2.454054054054054,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 0.0006504681132790699,
|
|
"loss": 5.621440887451172,
|
|
"mean_token_accuracy": 0.17340729534626007,
|
|
"num_tokens": 5484565.0,
|
|
"step": 2270
|
|
},
|
|
{
|
|
"entropy": 5.6708661079406735,
|
|
"epoch": 2.4594594594594597,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 0.0006487990708107446,
|
|
"loss": 5.557943344116211,
|
|
"mean_token_accuracy": 0.17839036285877227,
|
|
"num_tokens": 5497600.0,
|
|
"step": 2275
|
|
},
|
|
{
|
|
"entropy": 5.735868835449219,
|
|
"epoch": 2.464864864864865,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 0.0006471285991457766,
|
|
"loss": 5.574391937255859,
|
|
"mean_token_accuracy": 0.17606605887413024,
|
|
"num_tokens": 5509130.0,
|
|
"step": 2280
|
|
},
|
|
{
|
|
"entropy": 5.660920333862305,
|
|
"epoch": 2.4702702702702704,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0006454567224486897,
|
|
"loss": 5.604067993164063,
|
|
"mean_token_accuracy": 0.17372016608715057,
|
|
"num_tokens": 5523600.0,
|
|
"step": 2285
|
|
},
|
|
{
|
|
"entropy": 5.7049542427062985,
|
|
"epoch": 2.4756756756756757,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0006437834649043324,
|
|
"loss": 5.5371955871582035,
|
|
"mean_token_accuracy": 0.16755983233451843,
|
|
"num_tokens": 5535803.0,
|
|
"step": 2290
|
|
},
|
|
{
|
|
"entropy": 5.714131927490234,
|
|
"epoch": 2.481081081081081,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.0006421088507175278,
|
|
"loss": 5.557379531860351,
|
|
"mean_token_accuracy": 0.17987335324287415,
|
|
"num_tokens": 5547353.0,
|
|
"step": 2295
|
|
},
|
|
{
|
|
"entropy": 5.557036685943603,
|
|
"epoch": 2.4864864864864864,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0006404329041127248,
|
|
"loss": 5.536553192138672,
|
|
"mean_token_accuracy": 0.17276962399482726,
|
|
"num_tokens": 5558666.0,
|
|
"step": 2300
|
|
},
|
|
{
|
|
"entropy": 5.6906835556030275,
|
|
"epoch": 2.4918918918918918,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0006387556493336454,
|
|
"loss": 5.567943572998047,
|
|
"mean_token_accuracy": 0.17552665174007415,
|
|
"num_tokens": 5570403.0,
|
|
"step": 2305
|
|
},
|
|
{
|
|
"entropy": 5.773153495788574,
|
|
"epoch": 2.4972972972972975,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 0.0006370771106429359,
|
|
"loss": 5.527799606323242,
|
|
"mean_token_accuracy": 0.17979181408882142,
|
|
"num_tokens": 5581709.0,
|
|
"step": 2310
|
|
},
|
|
{
|
|
"entropy": 5.479818058013916,
|
|
"epoch": 2.5027027027027025,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0006353973123218152,
|
|
"loss": 5.430900955200196,
|
|
"mean_token_accuracy": 0.18182841837406158,
|
|
"num_tokens": 5593178.0,
|
|
"step": 2315
|
|
},
|
|
{
|
|
"entropy": 5.631165790557861,
|
|
"epoch": 2.5081081081081082,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 0.0006337162786697236,
|
|
"loss": 5.4689170837402346,
|
|
"mean_token_accuracy": 0.18003267645835877,
|
|
"num_tokens": 5604536.0,
|
|
"step": 2320
|
|
},
|
|
{
|
|
"entropy": 5.592670249938965,
|
|
"epoch": 2.5135135135135136,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 0.0006320340340039713,
|
|
"loss": 5.442555618286133,
|
|
"mean_token_accuracy": 0.18102549612522126,
|
|
"num_tokens": 5615757.0,
|
|
"step": 2325
|
|
},
|
|
{
|
|
"entropy": 5.592915153503418,
|
|
"epoch": 2.518918918918919,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 0.0006303506026593865,
|
|
"loss": 5.464023590087891,
|
|
"mean_token_accuracy": 0.1793735921382904,
|
|
"num_tokens": 5625712.0,
|
|
"step": 2330
|
|
},
|
|
{
|
|
"entropy": 5.695141410827636,
|
|
"epoch": 2.5243243243243243,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0006286660089879639,
|
|
"loss": 5.58501091003418,
|
|
"mean_token_accuracy": 0.17387398779392244,
|
|
"num_tokens": 5637688.0,
|
|
"step": 2335
|
|
},
|
|
{
|
|
"entropy": 5.824712753295898,
|
|
"epoch": 2.5297297297297296,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.0006269802773585117,
|
|
"loss": 5.801210403442383,
|
|
"mean_token_accuracy": 0.1589239239692688,
|
|
"num_tokens": 5653347.0,
|
|
"step": 2340
|
|
},
|
|
{
|
|
"entropy": 5.785819244384766,
|
|
"epoch": 2.535135135135135,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0006252934321562996,
|
|
"loss": 5.652518463134766,
|
|
"mean_token_accuracy": 0.17135508954524994,
|
|
"num_tokens": 5667683.0,
|
|
"step": 2345
|
|
},
|
|
{
|
|
"entropy": 5.591053771972656,
|
|
"epoch": 2.5405405405405403,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 0.000623605497782706,
|
|
"loss": 5.442898941040039,
|
|
"mean_token_accuracy": 0.17775709331035613,
|
|
"num_tokens": 5678532.0,
|
|
"step": 2350
|
|
},
|
|
{
|
|
"entropy": 5.629117774963379,
|
|
"epoch": 2.545945945945946,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0006219164986548644,
|
|
"loss": 5.515728759765625,
|
|
"mean_token_accuracy": 0.1728300780057907,
|
|
"num_tokens": 5688692.0,
|
|
"step": 2355
|
|
},
|
|
{
|
|
"entropy": 5.617127418518066,
|
|
"epoch": 2.5513513513513515,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0006202264592053116,
|
|
"loss": 5.58430061340332,
|
|
"mean_token_accuracy": 0.17398982346057892,
|
|
"num_tokens": 5700390.0,
|
|
"step": 2360
|
|
},
|
|
{
|
|
"entropy": 5.759219741821289,
|
|
"epoch": 2.556756756756757,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 0.0006185354038816323,
|
|
"loss": 5.495229339599609,
|
|
"mean_token_accuracy": 0.1807011365890503,
|
|
"num_tokens": 5711752.0,
|
|
"step": 2365
|
|
},
|
|
{
|
|
"entropy": 5.655483055114746,
|
|
"epoch": 2.562162162162162,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 0.0006168433571461076,
|
|
"loss": 5.497595977783203,
|
|
"mean_token_accuracy": 0.17314429879188536,
|
|
"num_tokens": 5723183.0,
|
|
"step": 2370
|
|
},
|
|
{
|
|
"entropy": 5.6326288223266605,
|
|
"epoch": 2.5675675675675675,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 0.0006151503434753592,
|
|
"loss": 5.548210144042969,
|
|
"mean_token_accuracy": 0.1750173330307007,
|
|
"num_tokens": 5735755.0,
|
|
"step": 2375
|
|
},
|
|
{
|
|
"entropy": 5.6949972152709964,
|
|
"epoch": 2.572972972972973,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0006134563873599968,
|
|
"loss": 5.58912467956543,
|
|
"mean_token_accuracy": 0.16819255352020263,
|
|
"num_tokens": 5747438.0,
|
|
"step": 2380
|
|
},
|
|
{
|
|
"entropy": 5.614237594604492,
|
|
"epoch": 2.5783783783783782,
|
|
"grad_norm": 0.671875,
|
|
"learning_rate": 0.0006117615133042626,
|
|
"loss": 5.473247909545899,
|
|
"mean_token_accuracy": 0.17851023077964784,
|
|
"num_tokens": 5759776.0,
|
|
"step": 2385
|
|
},
|
|
{
|
|
"entropy": 5.613177394866943,
|
|
"epoch": 2.583783783783784,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.000610065745825678,
|
|
"loss": 5.609667205810547,
|
|
"mean_token_accuracy": 0.16816233992576599,
|
|
"num_tokens": 5770747.0,
|
|
"step": 2390
|
|
},
|
|
{
|
|
"entropy": 5.634531497955322,
|
|
"epoch": 2.589189189189189,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0006083691094546882,
|
|
"loss": 5.483821868896484,
|
|
"mean_token_accuracy": 0.18026378154754638,
|
|
"num_tokens": 5781857.0,
|
|
"step": 2395
|
|
},
|
|
{
|
|
"entropy": 5.766191864013672,
|
|
"epoch": 2.5945945945945947,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 0.0006066716287343075,
|
|
"loss": 5.607662582397461,
|
|
"mean_token_accuracy": 0.17071258127689362,
|
|
"num_tokens": 5795413.0,
|
|
"step": 2400
|
|
},
|
|
{
|
|
"entropy": 5.648743343353272,
|
|
"epoch": 2.6,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.0006049733282197639,
|
|
"loss": 5.449608612060547,
|
|
"mean_token_accuracy": 0.17429975867271424,
|
|
"num_tokens": 5806240.0,
|
|
"step": 2405
|
|
},
|
|
{
|
|
"entropy": 5.711753177642822,
|
|
"epoch": 2.6054054054054054,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.000603274232478145,
|
|
"loss": 5.668772888183594,
|
|
"mean_token_accuracy": 0.17633183002471925,
|
|
"num_tokens": 5818546.0,
|
|
"step": 2410
|
|
},
|
|
{
|
|
"entropy": 5.660932445526123,
|
|
"epoch": 2.610810810810811,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0006015743660880415,
|
|
"loss": 5.5077564239501955,
|
|
"mean_token_accuracy": 0.17163086533546448,
|
|
"num_tokens": 5831461.0,
|
|
"step": 2415
|
|
},
|
|
{
|
|
"entropy": 5.62999382019043,
|
|
"epoch": 2.616216216216216,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 0.0005998737536391921,
|
|
"loss": 5.537704086303711,
|
|
"mean_token_accuracy": 0.16776139736175538,
|
|
"num_tokens": 5843396.0,
|
|
"step": 2420
|
|
},
|
|
{
|
|
"entropy": 5.551387119293213,
|
|
"epoch": 2.6216216216216215,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0005981724197321277,
|
|
"loss": 5.442460632324218,
|
|
"mean_token_accuracy": 0.1841804265975952,
|
|
"num_tokens": 5854113.0,
|
|
"step": 2425
|
|
},
|
|
{
|
|
"entropy": 5.59736385345459,
|
|
"epoch": 2.627027027027027,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 0.0005964703889778159,
|
|
"loss": 5.489829254150391,
|
|
"mean_token_accuracy": 0.179233580827713,
|
|
"num_tokens": 5866378.0,
|
|
"step": 2430
|
|
},
|
|
{
|
|
"entropy": 5.7708639144897464,
|
|
"epoch": 2.6324324324324326,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 0.0005947676859973042,
|
|
"loss": 5.63373908996582,
|
|
"mean_token_accuracy": 0.1719666063785553,
|
|
"num_tokens": 5880257.0,
|
|
"step": 2435
|
|
},
|
|
{
|
|
"entropy": 5.5277937889099125,
|
|
"epoch": 2.637837837837838,
|
|
"grad_norm": 0.67578125,
|
|
"learning_rate": 0.0005930643354213645,
|
|
"loss": 5.413225555419922,
|
|
"mean_token_accuracy": 0.19190529286861419,
|
|
"num_tokens": 5892401.0,
|
|
"step": 2440
|
|
},
|
|
{
|
|
"entropy": 5.565205097198486,
|
|
"epoch": 2.6432432432432433,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 0.0005913603618901371,
|
|
"loss": 5.423607635498047,
|
|
"mean_token_accuracy": 0.1753726065158844,
|
|
"num_tokens": 5903552.0,
|
|
"step": 2445
|
|
},
|
|
{
|
|
"entropy": 5.570698356628418,
|
|
"epoch": 2.6486486486486487,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0005896557900527729,
|
|
"loss": 5.519420623779297,
|
|
"mean_token_accuracy": 0.17307178378105165,
|
|
"num_tokens": 5914674.0,
|
|
"step": 2450
|
|
},
|
|
{
|
|
"entropy": 5.597156143188476,
|
|
"epoch": 2.654054054054054,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0005879506445670786,
|
|
"loss": 5.5158439636230465,
|
|
"mean_token_accuracy": 0.17416925728321075,
|
|
"num_tokens": 5926536.0,
|
|
"step": 2455
|
|
},
|
|
{
|
|
"entropy": 5.620716094970703,
|
|
"epoch": 2.6594594594594594,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 0.0005862449500991584,
|
|
"loss": 5.476783370971679,
|
|
"mean_token_accuracy": 0.18005512058734893,
|
|
"num_tokens": 5937356.0,
|
|
"step": 2460
|
|
},
|
|
{
|
|
"entropy": 5.65583381652832,
|
|
"epoch": 2.6648648648648647,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0005845387313230581,
|
|
"loss": 5.574266815185547,
|
|
"mean_token_accuracy": 0.17508378624916077,
|
|
"num_tokens": 5951928.0,
|
|
"step": 2465
|
|
},
|
|
{
|
|
"entropy": 5.781272125244141,
|
|
"epoch": 2.6702702702702705,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 0.0005828320129204084,
|
|
"loss": 5.692185974121093,
|
|
"mean_token_accuracy": 0.16098791658878325,
|
|
"num_tokens": 5966233.0,
|
|
"step": 2470
|
|
},
|
|
{
|
|
"entropy": 5.692507743835449,
|
|
"epoch": 2.6756756756756754,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 0.0005811248195800667,
|
|
"loss": 5.596537780761719,
|
|
"mean_token_accuracy": 0.17192208468914033,
|
|
"num_tokens": 5977552.0,
|
|
"step": 2475
|
|
},
|
|
{
|
|
"entropy": 5.740223693847656,
|
|
"epoch": 2.6810810810810812,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0005794171759977614,
|
|
"loss": 5.600330352783203,
|
|
"mean_token_accuracy": 0.16860291063785554,
|
|
"num_tokens": 5991371.0,
|
|
"step": 2480
|
|
},
|
|
{
|
|
"entropy": 5.6257349967956545,
|
|
"epoch": 2.6864864864864866,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 0.0005777091068757337,
|
|
"loss": 5.43211669921875,
|
|
"mean_token_accuracy": 0.174941024184227,
|
|
"num_tokens": 6004436.0,
|
|
"step": 2485
|
|
},
|
|
{
|
|
"entropy": 5.494911575317383,
|
|
"epoch": 2.691891891891892,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.0005760006369223804,
|
|
"loss": 5.376214599609375,
|
|
"mean_token_accuracy": 0.18585808873176574,
|
|
"num_tokens": 6015101.0,
|
|
"step": 2490
|
|
},
|
|
{
|
|
"entropy": 5.698105812072754,
|
|
"epoch": 2.6972972972972973,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0005742917908518966,
|
|
"loss": 5.609506607055664,
|
|
"mean_token_accuracy": 0.16898380517959594,
|
|
"num_tokens": 6028092.0,
|
|
"step": 2495
|
|
},
|
|
{
|
|
"entropy": 5.631367778778076,
|
|
"epoch": 2.7027027027027026,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 0.0005725825933839184,
|
|
"loss": 5.539814376831055,
|
|
"mean_token_accuracy": 0.17117331326007842,
|
|
"num_tokens": 6039582.0,
|
|
"step": 2500
|
|
},
|
|
{
|
|
"entropy": 5.737190532684326,
|
|
"epoch": 2.708108108108108,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 0.0005708730692431652,
|
|
"loss": 5.580169677734375,
|
|
"mean_token_accuracy": 0.16880378723144532,
|
|
"num_tokens": 6053142.0,
|
|
"step": 2505
|
|
},
|
|
{
|
|
"entropy": 5.627630519866943,
|
|
"epoch": 2.7135135135135133,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 0.0005691632431590813,
|
|
"loss": 5.522111892700195,
|
|
"mean_token_accuracy": 0.16968614757061004,
|
|
"num_tokens": 6063644.0,
|
|
"step": 2510
|
|
},
|
|
{
|
|
"entropy": 5.58701171875,
|
|
"epoch": 2.718918918918919,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0005674531398654796,
|
|
"loss": 5.508306884765625,
|
|
"mean_token_accuracy": 0.17844600975513458,
|
|
"num_tokens": 6074251.0,
|
|
"step": 2515
|
|
},
|
|
{
|
|
"entropy": 5.654790306091309,
|
|
"epoch": 2.7243243243243245,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 0.0005657427841001827,
|
|
"loss": 5.480488967895508,
|
|
"mean_token_accuracy": 0.17888804972171785,
|
|
"num_tokens": 6086671.0,
|
|
"step": 2520
|
|
},
|
|
{
|
|
"entropy": 5.569691944122314,
|
|
"epoch": 2.72972972972973,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0005640322006046653,
|
|
"loss": 5.431876754760742,
|
|
"mean_token_accuracy": 0.18063879609107972,
|
|
"num_tokens": 6098304.0,
|
|
"step": 2525
|
|
},
|
|
{
|
|
"entropy": 5.4920121192932125,
|
|
"epoch": 2.735135135135135,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0005623214141236963,
|
|
"loss": 5.436500167846679,
|
|
"mean_token_accuracy": 0.16918413639068602,
|
|
"num_tokens": 6113027.0,
|
|
"step": 2530
|
|
},
|
|
{
|
|
"entropy": 5.573300361633301,
|
|
"epoch": 2.7405405405405405,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.0005606104494049812,
|
|
"loss": 5.383563232421875,
|
|
"mean_token_accuracy": 0.18708784580230714,
|
|
"num_tokens": 6123797.0,
|
|
"step": 2535
|
|
},
|
|
{
|
|
"entropy": 5.652575492858887,
|
|
"epoch": 2.745945945945946,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0005588993311988037,
|
|
"loss": 5.57824935913086,
|
|
"mean_token_accuracy": 0.17628853917121887,
|
|
"num_tokens": 6134074.0,
|
|
"step": 2540
|
|
},
|
|
{
|
|
"entropy": 5.63744707107544,
|
|
"epoch": 2.7513513513513512,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0005571880842576677,
|
|
"loss": 5.559830856323242,
|
|
"mean_token_accuracy": 0.17657338082790375,
|
|
"num_tokens": 6145873.0,
|
|
"step": 2545
|
|
},
|
|
{
|
|
"entropy": 5.585823440551758,
|
|
"epoch": 2.756756756756757,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 0.0005554767333359397,
|
|
"loss": 5.352809143066406,
|
|
"mean_token_accuracy": 0.1858130306005478,
|
|
"num_tokens": 6157808.0,
|
|
"step": 2550
|
|
},
|
|
{
|
|
"entropy": 5.577786922454834,
|
|
"epoch": 2.762162162162162,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 0.0005537653031894897,
|
|
"loss": 5.428794479370117,
|
|
"mean_token_accuracy": 0.18291255831718445,
|
|
"num_tokens": 6169948.0,
|
|
"step": 2555
|
|
},
|
|
{
|
|
"entropy": 5.572152423858642,
|
|
"epoch": 2.7675675675675677,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.0005520538185753345,
|
|
"loss": 5.557374572753906,
|
|
"mean_token_accuracy": 0.1814809501171112,
|
|
"num_tokens": 6181626.0,
|
|
"step": 2560
|
|
},
|
|
{
|
|
"entropy": 5.739012050628662,
|
|
"epoch": 2.772972972972973,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 0.0005503423042512782,
|
|
"loss": 5.654923629760742,
|
|
"mean_token_accuracy": 0.16819194555282593,
|
|
"num_tokens": 6195045.0,
|
|
"step": 2565
|
|
},
|
|
{
|
|
"entropy": 5.636437034606933,
|
|
"epoch": 2.7783783783783784,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 0.0005486307849755552,
|
|
"loss": 5.5237060546875,
|
|
"mean_token_accuracy": 0.17143409252166747,
|
|
"num_tokens": 6207065.0,
|
|
"step": 2570
|
|
},
|
|
{
|
|
"entropy": 5.5397047996521,
|
|
"epoch": 2.7837837837837838,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 0.000546919285506471,
|
|
"loss": 5.392431640625,
|
|
"mean_token_accuracy": 0.1814020723104477,
|
|
"num_tokens": 6217527.0,
|
|
"step": 2575
|
|
},
|
|
{
|
|
"entropy": 5.596709823608398,
|
|
"epoch": 2.789189189189189,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0005452078306020451,
|
|
"loss": 5.5244285583496096,
|
|
"mean_token_accuracy": 0.18155086636543274,
|
|
"num_tokens": 6229493.0,
|
|
"step": 2580
|
|
},
|
|
{
|
|
"entropy": 5.670668220520019,
|
|
"epoch": 2.7945945945945945,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 0.0005434964450196514,
|
|
"loss": 5.511278533935547,
|
|
"mean_token_accuracy": 0.17765605449676514,
|
|
"num_tokens": 6241825.0,
|
|
"step": 2585
|
|
},
|
|
{
|
|
"entropy": 5.695631599426269,
|
|
"epoch": 2.8,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0005417851535156625,
|
|
"loss": 5.533386611938477,
|
|
"mean_token_accuracy": 0.17512329220771788,
|
|
"num_tokens": 6253740.0,
|
|
"step": 2590
|
|
},
|
|
{
|
|
"entropy": 5.613003349304199,
|
|
"epoch": 2.8054054054054056,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 0.0005400739808450887,
|
|
"loss": 5.407989120483398,
|
|
"mean_token_accuracy": 0.18004622757434846,
|
|
"num_tokens": 6265634.0,
|
|
"step": 2595
|
|
},
|
|
{
|
|
"entropy": 5.685737991333008,
|
|
"epoch": 2.810810810810811,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0005383629517612223,
|
|
"loss": 5.5601764678955075,
|
|
"mean_token_accuracy": 0.17303117215633393,
|
|
"num_tokens": 6278112.0,
|
|
"step": 2600
|
|
},
|
|
{
|
|
"entropy": 5.554997825622559,
|
|
"epoch": 2.8162162162162163,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0005366520910152778,
|
|
"loss": 5.424430847167969,
|
|
"mean_token_accuracy": 0.18369462490081787,
|
|
"num_tokens": 6290094.0,
|
|
"step": 2605
|
|
},
|
|
{
|
|
"entropy": 5.572571182250977,
|
|
"epoch": 2.8216216216216217,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 0.0005349414233560351,
|
|
"loss": 5.536036682128906,
|
|
"mean_token_accuracy": 0.17624129951000214,
|
|
"num_tokens": 6300825.0,
|
|
"step": 2610
|
|
},
|
|
{
|
|
"entropy": 5.786357116699219,
|
|
"epoch": 2.827027027027027,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0005332309735294803,
|
|
"loss": 5.5932167053222654,
|
|
"mean_token_accuracy": 0.1680184006690979,
|
|
"num_tokens": 6317081.0,
|
|
"step": 2615
|
|
},
|
|
{
|
|
"entropy": 5.695294666290283,
|
|
"epoch": 2.8324324324324324,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 0.0005315207662784493,
|
|
"loss": 5.59251708984375,
|
|
"mean_token_accuracy": 0.1742682695388794,
|
|
"num_tokens": 6329564.0,
|
|
"step": 2620
|
|
},
|
|
{
|
|
"entropy": 5.568323707580566,
|
|
"epoch": 2.8378378378378377,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0005298108263422685,
|
|
"loss": 5.455087661743164,
|
|
"mean_token_accuracy": 0.18226160407066344,
|
|
"num_tokens": 6341281.0,
|
|
"step": 2625
|
|
},
|
|
{
|
|
"entropy": 5.541281604766846,
|
|
"epoch": 2.8432432432432435,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0005281011784563969,
|
|
"loss": 5.413200759887696,
|
|
"mean_token_accuracy": 0.18045931160449982,
|
|
"num_tokens": 6353691.0,
|
|
"step": 2630
|
|
},
|
|
{
|
|
"entropy": 5.690560817718506,
|
|
"epoch": 2.8486486486486484,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0005263918473520698,
|
|
"loss": 5.5484882354736325,
|
|
"mean_token_accuracy": 0.1717564046382904,
|
|
"num_tokens": 6364967.0,
|
|
"step": 2635
|
|
},
|
|
{
|
|
"entropy": 5.780196857452393,
|
|
"epoch": 2.854054054054054,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0005246828577559392,
|
|
"loss": 5.6276397705078125,
|
|
"mean_token_accuracy": 0.17225143313407898,
|
|
"num_tokens": 6380064.0,
|
|
"step": 2640
|
|
},
|
|
{
|
|
"entropy": 5.551899433135986,
|
|
"epoch": 2.8594594594594596,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 0.0005229742343897175,
|
|
"loss": 5.457431411743164,
|
|
"mean_token_accuracy": 0.1770629793405533,
|
|
"num_tokens": 6390132.0,
|
|
"step": 2645
|
|
},
|
|
{
|
|
"entropy": 5.650986862182617,
|
|
"epoch": 2.864864864864865,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 0.0005212660019698193,
|
|
"loss": 5.487919616699219,
|
|
"mean_token_accuracy": 0.17956935465335847,
|
|
"num_tokens": 6401291.0,
|
|
"step": 2650
|
|
},
|
|
{
|
|
"entropy": 5.502396106719971,
|
|
"epoch": 2.8702702702702703,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0005195581852070033,
|
|
"loss": 5.386440277099609,
|
|
"mean_token_accuracy": 0.18568328619003296,
|
|
"num_tokens": 6412665.0,
|
|
"step": 2655
|
|
},
|
|
{
|
|
"entropy": 5.564178371429444,
|
|
"epoch": 2.8756756756756756,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0005178508088060161,
|
|
"loss": 5.472364807128907,
|
|
"mean_token_accuracy": 0.1836571216583252,
|
|
"num_tokens": 6423993.0,
|
|
"step": 2660
|
|
},
|
|
{
|
|
"entropy": 5.637900447845459,
|
|
"epoch": 2.881081081081081,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 0.0005161438974652338,
|
|
"loss": 5.5589241027832035,
|
|
"mean_token_accuracy": 0.17816859781742095,
|
|
"num_tokens": 6436630.0,
|
|
"step": 2665
|
|
},
|
|
{
|
|
"entropy": 5.556321907043457,
|
|
"epoch": 2.8864864864864863,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0005144374758763057,
|
|
"loss": 5.397082138061523,
|
|
"mean_token_accuracy": 0.18936697244644166,
|
|
"num_tokens": 6448640.0,
|
|
"step": 2670
|
|
},
|
|
{
|
|
"entropy": 5.553738403320312,
|
|
"epoch": 2.891891891891892,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 0.0005127315687237952,
|
|
"loss": 5.477837371826172,
|
|
"mean_token_accuracy": 0.18776545524597169,
|
|
"num_tokens": 6460423.0,
|
|
"step": 2675
|
|
},
|
|
{
|
|
"entropy": 5.6031725883483885,
|
|
"epoch": 2.8972972972972975,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0005110262006848251,
|
|
"loss": 5.5349578857421875,
|
|
"mean_token_accuracy": 0.17618264257907867,
|
|
"num_tokens": 6472752.0,
|
|
"step": 2680
|
|
},
|
|
{
|
|
"entropy": 5.651172351837158,
|
|
"epoch": 2.902702702702703,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 0.0005093213964287195,
|
|
"loss": 5.400485229492188,
|
|
"mean_token_accuracy": 0.1990907907485962,
|
|
"num_tokens": 6484317.0,
|
|
"step": 2685
|
|
},
|
|
{
|
|
"entropy": 5.5554883003234865,
|
|
"epoch": 2.908108108108108,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0005076171806166466,
|
|
"loss": 5.405490875244141,
|
|
"mean_token_accuracy": 0.1803416222333908,
|
|
"num_tokens": 6495051.0,
|
|
"step": 2690
|
|
},
|
|
{
|
|
"entropy": 5.55639123916626,
|
|
"epoch": 2.9135135135135135,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 0.0005059135779012623,
|
|
"loss": 5.449756622314453,
|
|
"mean_token_accuracy": 0.1817993104457855,
|
|
"num_tokens": 6507457.0,
|
|
"step": 2695
|
|
},
|
|
{
|
|
"entropy": 5.539990329742432,
|
|
"epoch": 2.918918918918919,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0005042106129263543,
|
|
"loss": 5.358537673950195,
|
|
"mean_token_accuracy": 0.19468224048614502,
|
|
"num_tokens": 6518316.0,
|
|
"step": 2700
|
|
},
|
|
{
|
|
"entropy": 5.529850006103516,
|
|
"epoch": 2.924324324324324,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0005025083103264842,
|
|
"loss": 5.397797393798828,
|
|
"mean_token_accuracy": 0.18361416161060334,
|
|
"num_tokens": 6530498.0,
|
|
"step": 2705
|
|
},
|
|
{
|
|
"entropy": 5.500092220306397,
|
|
"epoch": 2.92972972972973,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 0.0005008066947266322,
|
|
"loss": 5.368233871459961,
|
|
"mean_token_accuracy": 0.17843402028083802,
|
|
"num_tokens": 6541399.0,
|
|
"step": 2710
|
|
},
|
|
{
|
|
"entropy": 5.5336088180542,
|
|
"epoch": 2.935135135135135,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0004991057907418407,
|
|
"loss": 5.4054309844970705,
|
|
"mean_token_accuracy": 0.18966538310050965,
|
|
"num_tokens": 6552717.0,
|
|
"step": 2715
|
|
},
|
|
{
|
|
"entropy": 5.716736888885498,
|
|
"epoch": 2.9405405405405407,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 0.0004974056229768578,
|
|
"loss": 5.613718032836914,
|
|
"mean_token_accuracy": 0.1683912009000778,
|
|
"num_tokens": 6568305.0,
|
|
"step": 2720
|
|
},
|
|
{
|
|
"entropy": 5.608808803558349,
|
|
"epoch": 2.945945945945946,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 0.000495706216025782,
|
|
"loss": 5.496467971801758,
|
|
"mean_token_accuracy": 0.1777300089597702,
|
|
"num_tokens": 6580159.0,
|
|
"step": 2725
|
|
},
|
|
{
|
|
"entropy": 5.6148707389831545,
|
|
"epoch": 2.9513513513513514,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 0.0004940075944717057,
|
|
"loss": 5.45877685546875,
|
|
"mean_token_accuracy": 0.17611185908317567,
|
|
"num_tokens": 6592528.0,
|
|
"step": 2730
|
|
},
|
|
{
|
|
"entropy": 5.589577007293701,
|
|
"epoch": 2.9567567567567568,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.0004923097828863601,
|
|
"loss": 5.497463989257812,
|
|
"mean_token_accuracy": 0.18188374638557434,
|
|
"num_tokens": 6604193.0,
|
|
"step": 2735
|
|
},
|
|
{
|
|
"entropy": 5.568121242523193,
|
|
"epoch": 2.962162162162162,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0004906128058297603,
|
|
"loss": 5.418780517578125,
|
|
"mean_token_accuracy": 0.1897160977125168,
|
|
"num_tokens": 6615432.0,
|
|
"step": 2740
|
|
},
|
|
{
|
|
"entropy": 5.766029644012451,
|
|
"epoch": 2.9675675675675675,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 0.0004889166878498483,
|
|
"loss": 5.6280670166015625,
|
|
"mean_token_accuracy": 0.17273144721984862,
|
|
"num_tokens": 6629594.0,
|
|
"step": 2745
|
|
},
|
|
{
|
|
"entropy": 5.495246505737304,
|
|
"epoch": 2.972972972972973,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 0.0004872214534821399,
|
|
"loss": 5.300191879272461,
|
|
"mean_token_accuracy": 0.1964568614959717,
|
|
"num_tokens": 6640993.0,
|
|
"step": 2750
|
|
},
|
|
{
|
|
"entropy": 5.595590400695801,
|
|
"epoch": 2.9783783783783786,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004855271272493682,
|
|
"loss": 5.618423843383789,
|
|
"mean_token_accuracy": 0.16735525131225587,
|
|
"num_tokens": 6654469.0,
|
|
"step": 2755
|
|
},
|
|
{
|
|
"entropy": 5.64231309890747,
|
|
"epoch": 2.983783783783784,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004838337336611297,
|
|
"loss": 5.517493438720703,
|
|
"mean_token_accuracy": 0.16885295510292053,
|
|
"num_tokens": 6665901.0,
|
|
"step": 2760
|
|
},
|
|
{
|
|
"entropy": 5.637148189544678,
|
|
"epoch": 2.9891891891891893,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004821412972135296,
|
|
"loss": 5.473886871337891,
|
|
"mean_token_accuracy": 0.18368436992168427,
|
|
"num_tokens": 6676189.0,
|
|
"step": 2765
|
|
},
|
|
{
|
|
"entropy": 5.664397144317627,
|
|
"epoch": 2.9945945945945946,
|
|
"grad_norm": 0.65625,
|
|
"learning_rate": 0.0004804498423888275,
|
|
"loss": 5.50842056274414,
|
|
"mean_token_accuracy": 0.17209927141666412,
|
|
"num_tokens": 6688698.0,
|
|
"step": 2770
|
|
},
|
|
{
|
|
"entropy": 5.5513347625732425,
|
|
"epoch": 3.0,
|
|
"grad_norm": 1.6484375,
|
|
"learning_rate": 0.0004787593936550829,
|
|
"loss": 5.4068347930908205,
|
|
"mean_token_accuracy": 0.17083235681056977,
|
|
"num_tokens": 6698004.0,
|
|
"step": 2775
|
|
},
|
|
{
|
|
"entropy": 5.5923158645629885,
|
|
"epoch": 3.0054054054054054,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0004770699754658019,
|
|
"loss": 5.25789794921875,
|
|
"mean_token_accuracy": 0.19510415196418762,
|
|
"num_tokens": 6711533.0,
|
|
"step": 2780
|
|
},
|
|
{
|
|
"entropy": 5.538599491119385,
|
|
"epoch": 3.0108108108108107,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.00047538161225958253,
|
|
"loss": 5.250846099853516,
|
|
"mean_token_accuracy": 0.1914369732141495,
|
|
"num_tokens": 6723307.0,
|
|
"step": 2785
|
|
},
|
|
{
|
|
"entropy": 5.40770263671875,
|
|
"epoch": 3.016216216216216,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.00047369432845976214,
|
|
"loss": 5.159019851684571,
|
|
"mean_token_accuracy": 0.19194939136505126,
|
|
"num_tokens": 6734930.0,
|
|
"step": 2790
|
|
},
|
|
{
|
|
"entropy": 5.437890625,
|
|
"epoch": 3.0216216216216214,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004720081484740636,
|
|
"loss": 5.178772735595703,
|
|
"mean_token_accuracy": 0.19691025018692015,
|
|
"num_tokens": 6746918.0,
|
|
"step": 2795
|
|
},
|
|
{
|
|
"entropy": 5.378720283508301,
|
|
"epoch": 3.027027027027027,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.00047032309669424254,
|
|
"loss": 5.07244644165039,
|
|
"mean_token_accuracy": 0.20607976913452147,
|
|
"num_tokens": 6757169.0,
|
|
"step": 2800
|
|
},
|
|
{
|
|
"entropy": 5.381134510040283,
|
|
"epoch": 3.0324324324324325,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0004686391974957338,
|
|
"loss": 5.181631469726563,
|
|
"mean_token_accuracy": 0.19373838007450103,
|
|
"num_tokens": 6768383.0,
|
|
"step": 2805
|
|
},
|
|
{
|
|
"entropy": 5.512586402893066,
|
|
"epoch": 3.037837837837838,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.0004669564752373,
|
|
"loss": 5.258441162109375,
|
|
"mean_token_accuracy": 0.19645004570484162,
|
|
"num_tokens": 6780306.0,
|
|
"step": 2810
|
|
},
|
|
{
|
|
"entropy": 5.5321439743042,
|
|
"epoch": 3.0432432432432432,
|
|
"grad_norm": 0.671875,
|
|
"learning_rate": 0.0004652749542606779,
|
|
"loss": 5.266730117797851,
|
|
"mean_token_accuracy": 0.19060482382774352,
|
|
"num_tokens": 6795695.0,
|
|
"step": 2815
|
|
},
|
|
{
|
|
"entropy": 5.483561611175537,
|
|
"epoch": 3.0486486486486486,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 0.0004635946588902273,
|
|
"loss": 5.305035400390625,
|
|
"mean_token_accuracy": 0.18349000215530395,
|
|
"num_tokens": 6807837.0,
|
|
"step": 2820
|
|
},
|
|
{
|
|
"entropy": 5.450615787506104,
|
|
"epoch": 3.054054054054054,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.00046191561343257896,
|
|
"loss": 5.158168792724609,
|
|
"mean_token_accuracy": 0.1949550211429596,
|
|
"num_tokens": 6819085.0,
|
|
"step": 2825
|
|
},
|
|
{
|
|
"entropy": 5.528685760498047,
|
|
"epoch": 3.0594594594594593,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.00046023784217628195,
|
|
"loss": 5.347625732421875,
|
|
"mean_token_accuracy": 0.18776534199714662,
|
|
"num_tokens": 6831427.0,
|
|
"step": 2830
|
|
},
|
|
{
|
|
"entropy": 5.4302750587463375,
|
|
"epoch": 3.064864864864865,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 0.00045856136939145396,
|
|
"loss": 5.192623138427734,
|
|
"mean_token_accuracy": 0.1934239983558655,
|
|
"num_tokens": 6844290.0,
|
|
"step": 2835
|
|
},
|
|
{
|
|
"entropy": 5.393627071380616,
|
|
"epoch": 3.0702702702702704,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 0.00045688621932942907,
|
|
"loss": 5.125165176391602,
|
|
"mean_token_accuracy": 0.1926768958568573,
|
|
"num_tokens": 6855129.0,
|
|
"step": 2840
|
|
},
|
|
{
|
|
"entropy": 5.422938823699951,
|
|
"epoch": 3.075675675675676,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004552124162224074,
|
|
"loss": 5.228568267822266,
|
|
"mean_token_accuracy": 0.1925733655691147,
|
|
"num_tokens": 6867204.0,
|
|
"step": 2845
|
|
},
|
|
{
|
|
"entropy": 5.516963386535645,
|
|
"epoch": 3.081081081081081,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.00045353998428310406,
|
|
"loss": 5.2389068603515625,
|
|
"mean_token_accuracy": 0.19415563046932222,
|
|
"num_tokens": 6878999.0,
|
|
"step": 2850
|
|
},
|
|
{
|
|
"entropy": 5.436208724975586,
|
|
"epoch": 3.0864864864864865,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.00045186894770439957,
|
|
"loss": 5.198212051391602,
|
|
"mean_token_accuracy": 0.18889175355434418,
|
|
"num_tokens": 6890487.0,
|
|
"step": 2855
|
|
},
|
|
{
|
|
"entropy": 5.455732440948486,
|
|
"epoch": 3.091891891891892,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.00045019933065898975,
|
|
"loss": 5.264688873291016,
|
|
"mean_token_accuracy": 0.1906863570213318,
|
|
"num_tokens": 6904651.0,
|
|
"step": 2860
|
|
},
|
|
{
|
|
"entropy": 5.659678173065186,
|
|
"epoch": 3.097297297297297,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 0.0004485311572990356,
|
|
"loss": 5.515414047241211,
|
|
"mean_token_accuracy": 0.17200505435466767,
|
|
"num_tokens": 6920115.0,
|
|
"step": 2865
|
|
},
|
|
{
|
|
"entropy": 5.599868297576904,
|
|
"epoch": 3.1027027027027025,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.00044686445175581423,
|
|
"loss": 5.32147331237793,
|
|
"mean_token_accuracy": 0.19076673686504364,
|
|
"num_tokens": 6930754.0,
|
|
"step": 2870
|
|
},
|
|
{
|
|
"entropy": 5.444954109191895,
|
|
"epoch": 3.108108108108108,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004451992381393701,
|
|
"loss": 5.184179306030273,
|
|
"mean_token_accuracy": 0.19237631559371948,
|
|
"num_tokens": 6942643.0,
|
|
"step": 2875
|
|
},
|
|
{
|
|
"entropy": 5.331733322143554,
|
|
"epoch": 3.1135135135135137,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 0.0004435355405381657,
|
|
"loss": 5.07263412475586,
|
|
"mean_token_accuracy": 0.20409922003746034,
|
|
"num_tokens": 6954184.0,
|
|
"step": 2880
|
|
},
|
|
{
|
|
"entropy": 5.513856697082519,
|
|
"epoch": 3.118918918918919,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 0.0004418733830187331,
|
|
"loss": 5.341545104980469,
|
|
"mean_token_accuracy": 0.18325074017047882,
|
|
"num_tokens": 6967300.0,
|
|
"step": 2885
|
|
},
|
|
{
|
|
"entropy": 5.447126007080078,
|
|
"epoch": 3.1243243243243244,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0004402127896253265,
|
|
"loss": 5.174465179443359,
|
|
"mean_token_accuracy": 0.19734545350074767,
|
|
"num_tokens": 6978780.0,
|
|
"step": 2890
|
|
},
|
|
{
|
|
"entropy": 5.40117130279541,
|
|
"epoch": 3.1297297297297297,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.0004385537843795734,
|
|
"loss": 5.239698028564453,
|
|
"mean_token_accuracy": 0.1827787160873413,
|
|
"num_tokens": 6990568.0,
|
|
"step": 2895
|
|
},
|
|
{
|
|
"entropy": 5.4096190452575685,
|
|
"epoch": 3.135135135135135,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 0.0004368963912801278,
|
|
"loss": 5.142549896240235,
|
|
"mean_token_accuracy": 0.19498248994350434,
|
|
"num_tokens": 7002684.0,
|
|
"step": 2900
|
|
},
|
|
{
|
|
"entropy": 5.447889137268066,
|
|
"epoch": 3.1405405405405404,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.00043524063430232343,
|
|
"loss": 5.184391784667969,
|
|
"mean_token_accuracy": 0.1994238018989563,
|
|
"num_tokens": 7014306.0,
|
|
"step": 2905
|
|
},
|
|
{
|
|
"entropy": 5.396403026580811,
|
|
"epoch": 3.145945945945946,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0004335865373978256,
|
|
"loss": 5.1879524230957035,
|
|
"mean_token_accuracy": 0.19128627181053162,
|
|
"num_tokens": 7025500.0,
|
|
"step": 2910
|
|
},
|
|
{
|
|
"entropy": 5.435143089294433,
|
|
"epoch": 3.1513513513513516,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 0.00043193412449428617,
|
|
"loss": 5.263798522949219,
|
|
"mean_token_accuracy": 0.18822886645793915,
|
|
"num_tokens": 7037238.0,
|
|
"step": 2915
|
|
},
|
|
{
|
|
"entropy": 5.546949005126953,
|
|
"epoch": 3.156756756756757,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.00043028341949499625,
|
|
"loss": 5.334342956542969,
|
|
"mean_token_accuracy": 0.18737261295318602,
|
|
"num_tokens": 7050855.0,
|
|
"step": 2920
|
|
},
|
|
{
|
|
"entropy": 5.513990783691407,
|
|
"epoch": 3.1621621621621623,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 0.0004286344462785413,
|
|
"loss": 5.352931213378906,
|
|
"mean_token_accuracy": 0.18234648406505585,
|
|
"num_tokens": 7065434.0,
|
|
"step": 2925
|
|
},
|
|
{
|
|
"entropy": 5.519562721252441,
|
|
"epoch": 3.1675675675675676,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004269872286984553,
|
|
"loss": 5.27928352355957,
|
|
"mean_token_accuracy": 0.18669119775295256,
|
|
"num_tokens": 7076403.0,
|
|
"step": 2930
|
|
},
|
|
{
|
|
"entropy": 5.433896827697754,
|
|
"epoch": 3.172972972972973,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 0.00042534179058287557,
|
|
"loss": 5.096548461914063,
|
|
"mean_token_accuracy": 0.19745634198188783,
|
|
"num_tokens": 7087832.0,
|
|
"step": 2935
|
|
},
|
|
{
|
|
"entropy": 5.507660675048828,
|
|
"epoch": 3.1783783783783783,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.00042369815573419824,
|
|
"loss": 5.3657470703125,
|
|
"mean_token_accuracy": 0.1879856765270233,
|
|
"num_tokens": 7101488.0,
|
|
"step": 2940
|
|
},
|
|
{
|
|
"entropy": 5.515461444854736,
|
|
"epoch": 3.1837837837837837,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.00042205634792873414,
|
|
"loss": 5.278720092773438,
|
|
"mean_token_accuracy": 0.1882852017879486,
|
|
"num_tokens": 7115089.0,
|
|
"step": 2945
|
|
},
|
|
{
|
|
"entropy": 5.493403911590576,
|
|
"epoch": 3.189189189189189,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004204163909163646,
|
|
"loss": 5.2415214538574215,
|
|
"mean_token_accuracy": 0.193669593334198,
|
|
"num_tokens": 7125993.0,
|
|
"step": 2950
|
|
},
|
|
{
|
|
"entropy": 5.449890804290772,
|
|
"epoch": 3.1945945945945944,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0004187783084201978,
|
|
"loss": 5.21166877746582,
|
|
"mean_token_accuracy": 0.19243886172771454,
|
|
"num_tokens": 7136698.0,
|
|
"step": 2955
|
|
},
|
|
{
|
|
"entropy": 5.442560195922852,
|
|
"epoch": 3.2,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0004171421241362261,
|
|
"loss": 5.292788696289063,
|
|
"mean_token_accuracy": 0.18561746180057526,
|
|
"num_tokens": 7147487.0,
|
|
"step": 2960
|
|
},
|
|
{
|
|
"entropy": 5.473121547698975,
|
|
"epoch": 3.2054054054054055,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004155078617329824,
|
|
"loss": 5.297314453125,
|
|
"mean_token_accuracy": 0.18755146563053132,
|
|
"num_tokens": 7159043.0,
|
|
"step": 2965
|
|
},
|
|
{
|
|
"entropy": 5.449907302856445,
|
|
"epoch": 3.210810810810811,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.0004138755448511986,
|
|
"loss": 5.15816650390625,
|
|
"mean_token_accuracy": 0.20285856127738952,
|
|
"num_tokens": 7170081.0,
|
|
"step": 2970
|
|
},
|
|
{
|
|
"entropy": 5.483284854888916,
|
|
"epoch": 3.2162162162162162,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.00041224519710346354,
|
|
"loss": 5.256229400634766,
|
|
"mean_token_accuracy": 0.1871345192193985,
|
|
"num_tokens": 7180908.0,
|
|
"step": 2975
|
|
},
|
|
{
|
|
"entropy": 5.512541389465332,
|
|
"epoch": 3.2216216216216216,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0004106168420738805,
|
|
"loss": 5.291316223144531,
|
|
"mean_token_accuracy": 0.19909588992595673,
|
|
"num_tokens": 7191249.0,
|
|
"step": 2980
|
|
},
|
|
{
|
|
"entropy": 5.422138786315918,
|
|
"epoch": 3.227027027027027,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.00040899050331772726,
|
|
"loss": 5.189845275878906,
|
|
"mean_token_accuracy": 0.19813182950019836,
|
|
"num_tokens": 7203784.0,
|
|
"step": 2985
|
|
},
|
|
{
|
|
"entropy": 5.427577877044678,
|
|
"epoch": 3.2324324324324323,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004073662043611147,
|
|
"loss": 5.107621765136718,
|
|
"mean_token_accuracy": 0.2022715538740158,
|
|
"num_tokens": 7214219.0,
|
|
"step": 2990
|
|
},
|
|
{
|
|
"entropy": 5.402537822723389,
|
|
"epoch": 3.237837837837838,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.00040574396870064647,
|
|
"loss": 5.248710250854492,
|
|
"mean_token_accuracy": 0.19179517328739165,
|
|
"num_tokens": 7226591.0,
|
|
"step": 2995
|
|
},
|
|
{
|
|
"entropy": 5.468866539001465,
|
|
"epoch": 3.2432432432432434,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004041238198030792,
|
|
"loss": 5.323425674438477,
|
|
"mean_token_accuracy": 0.1891033470630646,
|
|
"num_tokens": 7237543.0,
|
|
"step": 3000
|
|
},
|
|
{
|
|
"entropy": 5.475563907623291,
|
|
"epoch": 3.2486486486486488,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.00040250578110498337,
|
|
"loss": 5.269275283813476,
|
|
"mean_token_accuracy": 0.1942310154438019,
|
|
"num_tokens": 7249687.0,
|
|
"step": 3005
|
|
},
|
|
{
|
|
"entropy": 5.4952105522155765,
|
|
"epoch": 3.254054054054054,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.00040088987601240365,
|
|
"loss": 5.244523620605468,
|
|
"mean_token_accuracy": 0.19360454380512238,
|
|
"num_tokens": 7261272.0,
|
|
"step": 3010
|
|
},
|
|
{
|
|
"entropy": 5.472545623779297,
|
|
"epoch": 3.2594594594594595,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0003992761279005209,
|
|
"loss": 5.18879508972168,
|
|
"mean_token_accuracy": 0.19736725091934204,
|
|
"num_tokens": 7271954.0,
|
|
"step": 3015
|
|
},
|
|
{
|
|
"entropy": 5.475461959838867,
|
|
"epoch": 3.264864864864865,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0003976645601133134,
|
|
"loss": 5.311486053466797,
|
|
"mean_token_accuracy": 0.18369398415088653,
|
|
"num_tokens": 7284139.0,
|
|
"step": 3020
|
|
},
|
|
{
|
|
"entropy": 5.455228805541992,
|
|
"epoch": 3.27027027027027,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0003960551959632198,
|
|
"loss": 5.327588653564453,
|
|
"mean_token_accuracy": 0.18279160261154176,
|
|
"num_tokens": 7296906.0,
|
|
"step": 3025
|
|
},
|
|
{
|
|
"entropy": 5.641277313232422,
|
|
"epoch": 3.2756756756756755,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.00039444805873080146,
|
|
"loss": 5.354714584350586,
|
|
"mean_token_accuracy": 0.18960251212120055,
|
|
"num_tokens": 7309743.0,
|
|
"step": 3030
|
|
},
|
|
{
|
|
"entropy": 5.488725090026856,
|
|
"epoch": 3.281081081081081,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0003928431716644062,
|
|
"loss": 5.2691490173339846,
|
|
"mean_token_accuracy": 0.18843590021133422,
|
|
"num_tokens": 7322907.0,
|
|
"step": 3035
|
|
},
|
|
{
|
|
"entropy": 5.478587055206299,
|
|
"epoch": 3.2864864864864867,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0003912405579798312,
|
|
"loss": 5.195904541015625,
|
|
"mean_token_accuracy": 0.19769047796726227,
|
|
"num_tokens": 7334759.0,
|
|
"step": 3040
|
|
},
|
|
{
|
|
"entropy": 5.579168605804443,
|
|
"epoch": 3.291891891891892,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.00038964024085998773,
|
|
"loss": 5.380061340332031,
|
|
"mean_token_accuracy": 0.18191122710704805,
|
|
"num_tokens": 7346213.0,
|
|
"step": 3045
|
|
},
|
|
{
|
|
"entropy": 5.4863636016845705,
|
|
"epoch": 3.2972972972972974,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 0.00038804224345456576,
|
|
"loss": 5.295820617675782,
|
|
"mean_token_accuracy": 0.18902668058872224,
|
|
"num_tokens": 7358437.0,
|
|
"step": 3050
|
|
},
|
|
{
|
|
"entropy": 5.379448127746582,
|
|
"epoch": 3.3027027027027027,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0003864465888796991,
|
|
"loss": 5.197346115112305,
|
|
"mean_token_accuracy": 0.19474746584892272,
|
|
"num_tokens": 7368908.0,
|
|
"step": 3055
|
|
},
|
|
{
|
|
"entropy": 5.489994716644287,
|
|
"epoch": 3.308108108108108,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 0.00038485330021763065,
|
|
"loss": 5.210497665405273,
|
|
"mean_token_accuracy": 0.19368852972984313,
|
|
"num_tokens": 7380821.0,
|
|
"step": 3060
|
|
},
|
|
{
|
|
"entropy": 5.499388980865478,
|
|
"epoch": 3.3135135135135134,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.00038326240051637906,
|
|
"loss": 5.223255157470703,
|
|
"mean_token_accuracy": 0.19280284643173218,
|
|
"num_tokens": 7391874.0,
|
|
"step": 3065
|
|
},
|
|
{
|
|
"entropy": 5.416688728332519,
|
|
"epoch": 3.3189189189189188,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 0.00038167391278940446,
|
|
"loss": 5.220037460327148,
|
|
"mean_token_accuracy": 0.19148374795913697,
|
|
"num_tokens": 7403059.0,
|
|
"step": 3070
|
|
},
|
|
{
|
|
"entropy": 5.425048065185547,
|
|
"epoch": 3.3243243243243246,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.00038008786001527653,
|
|
"loss": 5.216983795166016,
|
|
"mean_token_accuracy": 0.19420887231826783,
|
|
"num_tokens": 7414856.0,
|
|
"step": 3075
|
|
},
|
|
{
|
|
"entropy": 5.582154273986816,
|
|
"epoch": 3.32972972972973,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 0.0003785042651373417,
|
|
"loss": 5.341152191162109,
|
|
"mean_token_accuracy": 0.1916279077529907,
|
|
"num_tokens": 7426066.0,
|
|
"step": 3080
|
|
},
|
|
{
|
|
"entropy": 5.409203243255615,
|
|
"epoch": 3.3351351351351353,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.00037692315106339127,
|
|
"loss": 5.1098884582519535,
|
|
"mean_token_accuracy": 0.20282966494560242,
|
|
"num_tokens": 7438219.0,
|
|
"step": 3085
|
|
},
|
|
{
|
|
"entropy": 5.471571826934815,
|
|
"epoch": 3.3405405405405406,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 0.00037534454066532973,
|
|
"loss": 5.351170349121094,
|
|
"mean_token_accuracy": 0.18357708156108857,
|
|
"num_tokens": 7453535.0,
|
|
"step": 3090
|
|
},
|
|
{
|
|
"entropy": 5.509748649597168,
|
|
"epoch": 3.345945945945946,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 0.0003737684567788444,
|
|
"loss": 5.349686813354492,
|
|
"mean_token_accuracy": 0.18155500888824463,
|
|
"num_tokens": 7465495.0,
|
|
"step": 3095
|
|
},
|
|
{
|
|
"entropy": 5.496329975128174,
|
|
"epoch": 3.3513513513513513,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0003721949222030747,
|
|
"loss": 5.191223907470703,
|
|
"mean_token_accuracy": 0.19730565845966339,
|
|
"num_tokens": 7476602.0,
|
|
"step": 3100
|
|
},
|
|
{
|
|
"entropy": 5.401646709442138,
|
|
"epoch": 3.3567567567567567,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 0.0003706239597002827,
|
|
"loss": 5.200985717773437,
|
|
"mean_token_accuracy": 0.1864353448152542,
|
|
"num_tokens": 7487769.0,
|
|
"step": 3105
|
|
},
|
|
{
|
|
"entropy": 5.363869285583496,
|
|
"epoch": 3.362162162162162,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.00036905559199552375,
|
|
"loss": 5.112258529663086,
|
|
"mean_token_accuracy": 0.19901104867458344,
|
|
"num_tokens": 7498057.0,
|
|
"step": 3110
|
|
},
|
|
{
|
|
"entropy": 5.438242244720459,
|
|
"epoch": 3.3675675675675674,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0003674898417763172,
|
|
"loss": 5.206644439697266,
|
|
"mean_token_accuracy": 0.19452216029167174,
|
|
"num_tokens": 7508911.0,
|
|
"step": 3115
|
|
},
|
|
{
|
|
"entropy": 5.456591510772705,
|
|
"epoch": 3.372972972972973,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0003659267316923188,
|
|
"loss": 5.2438812255859375,
|
|
"mean_token_accuracy": 0.18697579205036163,
|
|
"num_tokens": 7519596.0,
|
|
"step": 3120
|
|
},
|
|
{
|
|
"entropy": 5.450167560577393,
|
|
"epoch": 3.3783783783783785,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0003643662843549934,
|
|
"loss": 5.280334091186523,
|
|
"mean_token_accuracy": 0.1835377186536789,
|
|
"num_tokens": 7532987.0,
|
|
"step": 3125
|
|
},
|
|
{
|
|
"entropy": 5.582163238525391,
|
|
"epoch": 3.383783783783784,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 0.0003628085223372869,
|
|
"loss": 5.4589191436767575,
|
|
"mean_token_accuracy": 0.174690842628479,
|
|
"num_tokens": 7546088.0,
|
|
"step": 3130
|
|
},
|
|
{
|
|
"entropy": 5.575834274291992,
|
|
"epoch": 3.389189189189189,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.0003612534681733004,
|
|
"loss": 5.390705108642578,
|
|
"mean_token_accuracy": 0.18087442517280578,
|
|
"num_tokens": 7559299.0,
|
|
"step": 3135
|
|
},
|
|
{
|
|
"entropy": 5.464944744110108,
|
|
"epoch": 3.3945945945945946,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.000359701144357964,
|
|
"loss": 5.2086128234863285,
|
|
"mean_token_accuracy": 0.19777989089488984,
|
|
"num_tokens": 7571215.0,
|
|
"step": 3140
|
|
},
|
|
{
|
|
"entropy": 5.486237716674805,
|
|
"epoch": 3.4,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.00035815157334671144,
|
|
"loss": 5.253549957275391,
|
|
"mean_token_accuracy": 0.19077568650245666,
|
|
"num_tokens": 7581920.0,
|
|
"step": 3145
|
|
},
|
|
{
|
|
"entropy": 5.340932464599609,
|
|
"epoch": 3.4054054054054053,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0003566047775551551,
|
|
"loss": 5.11485595703125,
|
|
"mean_token_accuracy": 0.20361949801445006,
|
|
"num_tokens": 7592432.0,
|
|
"step": 3150
|
|
},
|
|
{
|
|
"entropy": 5.575855445861817,
|
|
"epoch": 3.410810810810811,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 0.00035506077935876213,
|
|
"loss": 5.378120040893554,
|
|
"mean_token_accuracy": 0.18758283257484437,
|
|
"num_tokens": 7606963.0,
|
|
"step": 3155
|
|
},
|
|
{
|
|
"entropy": 5.514583683013916,
|
|
"epoch": 3.4162162162162164,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.00035351960109253046,
|
|
"loss": 5.2986572265625,
|
|
"mean_token_accuracy": 0.19804251492023467,
|
|
"num_tokens": 7620528.0,
|
|
"step": 3160
|
|
},
|
|
{
|
|
"entropy": 5.492895317077637,
|
|
"epoch": 3.4216216216216218,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 0.0003519812650506655,
|
|
"loss": 5.3469398498535154,
|
|
"mean_token_accuracy": 0.18076989352703093,
|
|
"num_tokens": 7632613.0,
|
|
"step": 3165
|
|
},
|
|
{
|
|
"entropy": 5.481321048736572,
|
|
"epoch": 3.427027027027027,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 0.0003504457934862586,
|
|
"loss": 5.2044532775878904,
|
|
"mean_token_accuracy": 0.20069580674171447,
|
|
"num_tokens": 7643655.0,
|
|
"step": 3170
|
|
},
|
|
{
|
|
"entropy": 5.46530704498291,
|
|
"epoch": 3.4324324324324325,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 0.0003489132086109636,
|
|
"loss": 5.253160095214843,
|
|
"mean_token_accuracy": 0.1926906794309616,
|
|
"num_tokens": 7655504.0,
|
|
"step": 3175
|
|
},
|
|
{
|
|
"entropy": 5.52869815826416,
|
|
"epoch": 3.437837837837838,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0003473835325946771,
|
|
"loss": 5.29857177734375,
|
|
"mean_token_accuracy": 0.18876095116138458,
|
|
"num_tokens": 7669091.0,
|
|
"step": 3180
|
|
},
|
|
{
|
|
"entropy": 5.527535820007325,
|
|
"epoch": 3.443243243243243,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0003458567875652169,
|
|
"loss": 5.336846923828125,
|
|
"mean_token_accuracy": 0.18397358655929566,
|
|
"num_tokens": 7685018.0,
|
|
"step": 3185
|
|
},
|
|
{
|
|
"entropy": 5.414316272735595,
|
|
"epoch": 3.4486486486486485,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.00034433299560800157,
|
|
"loss": 5.191455078125,
|
|
"mean_token_accuracy": 0.19212636351585388,
|
|
"num_tokens": 7695748.0,
|
|
"step": 3190
|
|
},
|
|
{
|
|
"entropy": 5.392437744140625,
|
|
"epoch": 3.454054054054054,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0003428121787657324,
|
|
"loss": 5.161934661865234,
|
|
"mean_token_accuracy": 0.20157796740531922,
|
|
"num_tokens": 7708102.0,
|
|
"step": 3195
|
|
},
|
|
{
|
|
"entropy": 5.535801219940185,
|
|
"epoch": 3.4594594594594597,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00034129435903807245,
|
|
"loss": 5.263835144042969,
|
|
"mean_token_accuracy": 0.19790225923061372,
|
|
"num_tokens": 7719709.0,
|
|
"step": 3200
|
|
},
|
|
{
|
|
"entropy": 5.457363128662109,
|
|
"epoch": 3.464864864864865,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 0.00033977955838133023,
|
|
"loss": 5.303979873657227,
|
|
"mean_token_accuracy": 0.1852803647518158,
|
|
"num_tokens": 7731286.0,
|
|
"step": 3205
|
|
},
|
|
{
|
|
"entropy": 5.4904787063598635,
|
|
"epoch": 3.4702702702702704,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 0.0003382677987081412,
|
|
"loss": 5.301412963867188,
|
|
"mean_token_accuracy": 0.19093644618988037,
|
|
"num_tokens": 7743931.0,
|
|
"step": 3210
|
|
},
|
|
{
|
|
"entropy": 5.544065666198731,
|
|
"epoch": 3.4756756756756757,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.00033675910188715063,
|
|
"loss": 5.3516380310058596,
|
|
"mean_token_accuracy": 0.18427440226078035,
|
|
"num_tokens": 7758844.0,
|
|
"step": 3215
|
|
},
|
|
{
|
|
"entropy": 5.458789539337158,
|
|
"epoch": 3.481081081081081,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0003352534897426979,
|
|
"loss": 5.153034591674805,
|
|
"mean_token_accuracy": 0.20233350694179536,
|
|
"num_tokens": 7770434.0,
|
|
"step": 3220
|
|
},
|
|
{
|
|
"entropy": 5.492709159851074,
|
|
"epoch": 3.4864864864864864,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.0003337509840545,
|
|
"loss": 5.227976226806641,
|
|
"mean_token_accuracy": 0.19390177726745605,
|
|
"num_tokens": 7781041.0,
|
|
"step": 3225
|
|
},
|
|
{
|
|
"entropy": 5.365538215637207,
|
|
"epoch": 3.4918918918918918,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 0.00033225160655733733,
|
|
"loss": 5.1321464538574215,
|
|
"mean_token_accuracy": 0.20287306904792785,
|
|
"num_tokens": 7792254.0,
|
|
"step": 3230
|
|
},
|
|
{
|
|
"entropy": 5.492290782928467,
|
|
"epoch": 3.4972972972972975,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0003307553789407384,
|
|
"loss": 5.310476684570313,
|
|
"mean_token_accuracy": 0.1912558913230896,
|
|
"num_tokens": 7804230.0,
|
|
"step": 3235
|
|
},
|
|
{
|
|
"entropy": 5.4559399604797365,
|
|
"epoch": 3.5027027027027025,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 0.0003292623228486671,
|
|
"loss": 5.206363677978516,
|
|
"mean_token_accuracy": 0.19336751997470855,
|
|
"num_tokens": 7816192.0,
|
|
"step": 3240
|
|
},
|
|
{
|
|
"entropy": 5.4897066116333,
|
|
"epoch": 3.5081081081081082,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0003277724598792082,
|
|
"loss": 5.297798538208008,
|
|
"mean_token_accuracy": 0.1897403597831726,
|
|
"num_tokens": 7828633.0,
|
|
"step": 3245
|
|
},
|
|
{
|
|
"entropy": 5.503672790527344,
|
|
"epoch": 3.5135135135135136,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0003262858115842565,
|
|
"loss": 5.327181625366211,
|
|
"mean_token_accuracy": 0.18547615706920623,
|
|
"num_tokens": 7841367.0,
|
|
"step": 3250
|
|
},
|
|
{
|
|
"entropy": 5.466091442108154,
|
|
"epoch": 3.518918918918919,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.000324802399469204,
|
|
"loss": 5.293339538574219,
|
|
"mean_token_accuracy": 0.1876149892807007,
|
|
"num_tokens": 7853012.0,
|
|
"step": 3255
|
|
},
|
|
{
|
|
"entropy": 5.593074226379395,
|
|
"epoch": 3.5243243243243243,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 0.0003233222449926292,
|
|
"loss": 5.347921752929688,
|
|
"mean_token_accuracy": 0.1875611811876297,
|
|
"num_tokens": 7866644.0,
|
|
"step": 3260
|
|
},
|
|
{
|
|
"entropy": 5.4754798889160154,
|
|
"epoch": 3.5297297297297296,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.00032184536956598667,
|
|
"loss": 5.221886825561524,
|
|
"mean_token_accuracy": 0.19393701255321502,
|
|
"num_tokens": 7877364.0,
|
|
"step": 3265
|
|
},
|
|
{
|
|
"entropy": 5.437913990020752,
|
|
"epoch": 3.535135135135135,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.00032037179455329703,
|
|
"loss": 5.2036090850830075,
|
|
"mean_token_accuracy": 0.19562436044216155,
|
|
"num_tokens": 7886850.0,
|
|
"step": 3270
|
|
},
|
|
{
|
|
"entropy": 5.491133213043213,
|
|
"epoch": 3.5405405405405403,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 0.0003189015412708384,
|
|
"loss": 5.332757949829102,
|
|
"mean_token_accuracy": 0.19049441814422607,
|
|
"num_tokens": 7899847.0,
|
|
"step": 3275
|
|
},
|
|
{
|
|
"entropy": 5.426165962219239,
|
|
"epoch": 3.545945945945946,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.00031743463098683766,
|
|
"loss": 5.16174201965332,
|
|
"mean_token_accuracy": 0.19714186191558838,
|
|
"num_tokens": 7911608.0,
|
|
"step": 3280
|
|
},
|
|
{
|
|
"entropy": 5.405626106262207,
|
|
"epoch": 3.5513513513513515,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.0003159710849211629,
|
|
"loss": 5.20556755065918,
|
|
"mean_token_accuracy": 0.1942029118537903,
|
|
"num_tokens": 7922804.0,
|
|
"step": 3285
|
|
},
|
|
{
|
|
"entropy": 5.434666728973388,
|
|
"epoch": 3.556756756756757,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0003145109242450165,
|
|
"loss": 5.1677093505859375,
|
|
"mean_token_accuracy": 0.20153828561306,
|
|
"num_tokens": 7934356.0,
|
|
"step": 3290
|
|
},
|
|
{
|
|
"entropy": 5.436752510070801,
|
|
"epoch": 3.562162162162162,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 0.000313054170080629,
|
|
"loss": 5.191093826293946,
|
|
"mean_token_accuracy": 0.1943394124507904,
|
|
"num_tokens": 7945841.0,
|
|
"step": 3295
|
|
},
|
|
{
|
|
"entropy": 5.447486782073975,
|
|
"epoch": 3.5675675675675675,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 0.000311600843500953,
|
|
"loss": 5.245862197875977,
|
|
"mean_token_accuracy": 0.18270381093025206,
|
|
"num_tokens": 7959411.0,
|
|
"step": 3300
|
|
},
|
|
{
|
|
"entropy": 5.473622035980225,
|
|
"epoch": 3.572972972972973,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0003101509655293592,
|
|
"loss": 5.279052734375,
|
|
"mean_token_accuracy": 0.18829337060451506,
|
|
"num_tokens": 7973692.0,
|
|
"step": 3305
|
|
},
|
|
{
|
|
"entropy": 5.469743537902832,
|
|
"epoch": 3.5783783783783782,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.00030870455713933145,
|
|
"loss": 5.29651107788086,
|
|
"mean_token_accuracy": 0.1842589795589447,
|
|
"num_tokens": 7985241.0,
|
|
"step": 3310
|
|
},
|
|
{
|
|
"entropy": 5.503611087799072,
|
|
"epoch": 3.583783783783784,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.00030726163925416395,
|
|
"loss": 5.260959625244141,
|
|
"mean_token_accuracy": 0.1915042817592621,
|
|
"num_tokens": 7997917.0,
|
|
"step": 3315
|
|
},
|
|
{
|
|
"entropy": 5.429448223114013,
|
|
"epoch": 3.589189189189189,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 0.00030582223274665813,
|
|
"loss": 5.223644256591797,
|
|
"mean_token_accuracy": 0.19202634394168855,
|
|
"num_tokens": 8011669.0,
|
|
"step": 3320
|
|
},
|
|
{
|
|
"entropy": 5.479945659637451,
|
|
"epoch": 3.5945945945945947,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.00030438635843882113,
|
|
"loss": 5.331010055541992,
|
|
"mean_token_accuracy": 0.18760551810264586,
|
|
"num_tokens": 8025128.0,
|
|
"step": 3325
|
|
},
|
|
{
|
|
"entropy": 5.435427951812744,
|
|
"epoch": 3.6,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0003029540371015643,
|
|
"loss": 5.187888717651367,
|
|
"mean_token_accuracy": 0.19375882148742676,
|
|
"num_tokens": 8036497.0,
|
|
"step": 3330
|
|
},
|
|
{
|
|
"entropy": 5.484002685546875,
|
|
"epoch": 3.6054054054054054,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.00030152528945440264,
|
|
"loss": 5.2085216522216795,
|
|
"mean_token_accuracy": 0.19259279668331147,
|
|
"num_tokens": 8048098.0,
|
|
"step": 3335
|
|
},
|
|
{
|
|
"entropy": 5.397993278503418,
|
|
"epoch": 3.610810810810811,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0003001001361651556,
|
|
"loss": 5.186916351318359,
|
|
"mean_token_accuracy": 0.19090261161327363,
|
|
"num_tokens": 8061929.0,
|
|
"step": 3340
|
|
},
|
|
{
|
|
"entropy": 5.395583629608154,
|
|
"epoch": 3.616216216216216,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.0002986785978496475,
|
|
"loss": 5.1158802032470705,
|
|
"mean_token_accuracy": 0.1995515763759613,
|
|
"num_tokens": 8074046.0,
|
|
"step": 3345
|
|
},
|
|
{
|
|
"entropy": 5.363892078399658,
|
|
"epoch": 3.6216216216216215,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.00029726069507140975,
|
|
"loss": 5.165290832519531,
|
|
"mean_token_accuracy": 0.20116629004478453,
|
|
"num_tokens": 8085445.0,
|
|
"step": 3350
|
|
},
|
|
{
|
|
"entropy": 5.450602626800537,
|
|
"epoch": 3.627027027027027,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 0.00029584644834138306,
|
|
"loss": 5.2404731750488285,
|
|
"mean_token_accuracy": 0.19334520995616913,
|
|
"num_tokens": 8098138.0,
|
|
"step": 3355
|
|
},
|
|
{
|
|
"entropy": 5.433476448059082,
|
|
"epoch": 3.6324324324324326,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.00029443587811762094,
|
|
"loss": 5.182987213134766,
|
|
"mean_token_accuracy": 0.20231443345546724,
|
|
"num_tokens": 8109936.0,
|
|
"step": 3360
|
|
},
|
|
{
|
|
"entropy": 5.4124603271484375,
|
|
"epoch": 3.637837837837838,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00029302900480499385,
|
|
"loss": 5.159294891357422,
|
|
"mean_token_accuracy": 0.1995917409658432,
|
|
"num_tokens": 8121186.0,
|
|
"step": 3365
|
|
},
|
|
{
|
|
"entropy": 5.525017356872558,
|
|
"epoch": 3.6432432432432433,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.00029162584875489357,
|
|
"loss": 5.396564483642578,
|
|
"mean_token_accuracy": 0.18847276866436005,
|
|
"num_tokens": 8134338.0,
|
|
"step": 3370
|
|
},
|
|
{
|
|
"entropy": 5.413580894470215,
|
|
"epoch": 3.6486486486486487,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 0.0002902264302649394,
|
|
"loss": 5.165213394165039,
|
|
"mean_token_accuracy": 0.20138504207134247,
|
|
"num_tokens": 8145327.0,
|
|
"step": 3375
|
|
},
|
|
{
|
|
"entropy": 5.428236484527588,
|
|
"epoch": 3.654054054054054,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 0.00028883076957868416,
|
|
"loss": 5.161372375488281,
|
|
"mean_token_accuracy": 0.20022676587104798,
|
|
"num_tokens": 8156537.0,
|
|
"step": 3380
|
|
},
|
|
{
|
|
"entropy": 5.529917621612549,
|
|
"epoch": 3.6594594594594594,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 0.00028743888688532136,
|
|
"loss": 5.287817001342773,
|
|
"mean_token_accuracy": 0.19801401495933532,
|
|
"num_tokens": 8169207.0,
|
|
"step": 3385
|
|
},
|
|
{
|
|
"entropy": 5.32317419052124,
|
|
"epoch": 3.6648648648648647,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.00028605080231939347,
|
|
"loss": 5.176655197143555,
|
|
"mean_token_accuracy": 0.19278047680854798,
|
|
"num_tokens": 8180824.0,
|
|
"step": 3390
|
|
},
|
|
{
|
|
"entropy": 5.492578125,
|
|
"epoch": 3.6702702702702705,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 0.0002846665359605001,
|
|
"loss": 5.283043670654297,
|
|
"mean_token_accuracy": 0.18756779432296752,
|
|
"num_tokens": 8193266.0,
|
|
"step": 3395
|
|
},
|
|
{
|
|
"entropy": 5.415150547027588,
|
|
"epoch": 3.6756756756756754,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.00028328610783300815,
|
|
"loss": 5.21667594909668,
|
|
"mean_token_accuracy": 0.1931481420993805,
|
|
"num_tokens": 8204917.0,
|
|
"step": 3400
|
|
},
|
|
{
|
|
"entropy": 5.432209014892578,
|
|
"epoch": 3.6810810810810812,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.00028190953790576176,
|
|
"loss": 5.158111190795898,
|
|
"mean_token_accuracy": 0.200242218375206,
|
|
"num_tokens": 8217388.0,
|
|
"step": 3405
|
|
},
|
|
{
|
|
"entropy": 5.454640865325928,
|
|
"epoch": 3.6864864864864866,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 0.0002805368460917935,
|
|
"loss": 5.212453842163086,
|
|
"mean_token_accuracy": 0.1932765692472458,
|
|
"num_tokens": 8228609.0,
|
|
"step": 3410
|
|
},
|
|
{
|
|
"entropy": 5.405211448669434,
|
|
"epoch": 3.691891891891892,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.0002791680522480364,
|
|
"loss": 5.146141052246094,
|
|
"mean_token_accuracy": 0.20123913884162903,
|
|
"num_tokens": 8239590.0,
|
|
"step": 3415
|
|
},
|
|
{
|
|
"entropy": 5.390653419494629,
|
|
"epoch": 3.6972972972972973,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 0.0002778031761750367,
|
|
"loss": 5.1437225341796875,
|
|
"mean_token_accuracy": 0.19206954836845397,
|
|
"num_tokens": 8250920.0,
|
|
"step": 3420
|
|
},
|
|
{
|
|
"entropy": 5.397071838378906,
|
|
"epoch": 3.7027027027027026,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 0.0002764422376166673,
|
|
"loss": 5.1614990234375,
|
|
"mean_token_accuracy": 0.1953745573759079,
|
|
"num_tokens": 8262853.0,
|
|
"step": 3425
|
|
},
|
|
{
|
|
"entropy": 5.382506561279297,
|
|
"epoch": 3.708108108108108,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.00027508525625984223,
|
|
"loss": 5.175772476196289,
|
|
"mean_token_accuracy": 0.1977091908454895,
|
|
"num_tokens": 8276553.0,
|
|
"step": 3430
|
|
},
|
|
{
|
|
"entropy": 5.40098237991333,
|
|
"epoch": 3.7135135135135133,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 0.000273732251734232,
|
|
"loss": 5.254178619384765,
|
|
"mean_token_accuracy": 0.19229159653186798,
|
|
"num_tokens": 8289125.0,
|
|
"step": 3435
|
|
},
|
|
{
|
|
"entropy": 5.477657413482666,
|
|
"epoch": 3.718918918918919,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.0002723832436119794,
|
|
"loss": 5.334367370605468,
|
|
"mean_token_accuracy": 0.18281905651092528,
|
|
"num_tokens": 8302598.0,
|
|
"step": 3440
|
|
},
|
|
{
|
|
"entropy": 5.528353691101074,
|
|
"epoch": 3.7243243243243245,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0002710382514074166,
|
|
"loss": 5.269789505004883,
|
|
"mean_token_accuracy": 0.18127003014087678,
|
|
"num_tokens": 8318105.0,
|
|
"step": 3445
|
|
},
|
|
{
|
|
"entropy": 5.550482749938965,
|
|
"epoch": 3.72972972972973,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0002696972945767826,
|
|
"loss": 5.23106689453125,
|
|
"mean_token_accuracy": 0.200823050737381,
|
|
"num_tokens": 8329657.0,
|
|
"step": 3450
|
|
},
|
|
{
|
|
"entropy": 5.474896335601807,
|
|
"epoch": 3.735135135135135,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00026836039251794207,
|
|
"loss": 5.230374145507812,
|
|
"mean_token_accuracy": 0.19923966526985168,
|
|
"num_tokens": 8343104.0,
|
|
"step": 3455
|
|
},
|
|
{
|
|
"entropy": 5.446462535858155,
|
|
"epoch": 3.7405405405405405,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.0002670275645701048,
|
|
"loss": 5.244596099853515,
|
|
"mean_token_accuracy": 0.18881154358386992,
|
|
"num_tokens": 8354003.0,
|
|
"step": 3460
|
|
},
|
|
{
|
|
"entropy": 5.35887975692749,
|
|
"epoch": 3.745945945945946,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 0.0002656988300135451,
|
|
"loss": 5.083889770507812,
|
|
"mean_token_accuracy": 0.20660406947135926,
|
|
"num_tokens": 8365793.0,
|
|
"step": 3465
|
|
},
|
|
{
|
|
"entropy": 5.323597526550293,
|
|
"epoch": 3.7513513513513512,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 0.0002643742080693242,
|
|
"loss": 5.095557403564453,
|
|
"mean_token_accuracy": 0.19427744150161744,
|
|
"num_tokens": 8377711.0,
|
|
"step": 3470
|
|
},
|
|
{
|
|
"entropy": 5.36930570602417,
|
|
"epoch": 3.756756756756757,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.00026305371789901125,
|
|
"loss": 5.243714904785156,
|
|
"mean_token_accuracy": 0.1856300950050354,
|
|
"num_tokens": 8387802.0,
|
|
"step": 3475
|
|
},
|
|
{
|
|
"entropy": 5.4472047805786135,
|
|
"epoch": 3.762162162162162,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.00026173737860440657,
|
|
"loss": 5.221728134155273,
|
|
"mean_token_accuracy": 0.18868094086647033,
|
|
"num_tokens": 8401434.0,
|
|
"step": 3480
|
|
},
|
|
{
|
|
"entropy": 5.455492973327637,
|
|
"epoch": 3.7675675675675677,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 0.0002604252092272651,
|
|
"loss": 5.3082530975341795,
|
|
"mean_token_accuracy": 0.18950350880622863,
|
|
"num_tokens": 8414878.0,
|
|
"step": 3485
|
|
},
|
|
{
|
|
"entropy": 5.5016461372375485,
|
|
"epoch": 3.772972972972973,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 0.0002591172287490213,
|
|
"loss": 5.248205184936523,
|
|
"mean_token_accuracy": 0.19584062993526458,
|
|
"num_tokens": 8429117.0,
|
|
"step": 3490
|
|
},
|
|
{
|
|
"entropy": 5.5555215835571286,
|
|
"epoch": 3.7783783783783784,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.000257813456090514,
|
|
"loss": 5.296443176269531,
|
|
"mean_token_accuracy": 0.19205528497695923,
|
|
"num_tokens": 8443968.0,
|
|
"step": 3495
|
|
},
|
|
{
|
|
"entropy": 5.379951667785645,
|
|
"epoch": 3.7837837837837838,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.0002565139101117131,
|
|
"loss": 5.194390487670899,
|
|
"mean_token_accuracy": 0.18924711048603057,
|
|
"num_tokens": 8455719.0,
|
|
"step": 3500
|
|
},
|
|
{
|
|
"entropy": 5.439165687561035,
|
|
"epoch": 3.789189189189189,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.00025521860961144675,
|
|
"loss": 5.26489143371582,
|
|
"mean_token_accuracy": 0.1886543810367584,
|
|
"num_tokens": 8467778.0,
|
|
"step": 3505
|
|
},
|
|
{
|
|
"entropy": 5.460430145263672,
|
|
"epoch": 3.7945945945945945,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.00025392757332712935,
|
|
"loss": 5.175957489013672,
|
|
"mean_token_accuracy": 0.19986552298069,
|
|
"num_tokens": 8477381.0,
|
|
"step": 3510
|
|
},
|
|
{
|
|
"entropy": 5.373087596893311,
|
|
"epoch": 3.8,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.0002526408199344904,
|
|
"loss": 5.120626831054688,
|
|
"mean_token_accuracy": 0.19518460631370543,
|
|
"num_tokens": 8489648.0,
|
|
"step": 3515
|
|
},
|
|
{
|
|
"entropy": 5.451641082763672,
|
|
"epoch": 3.8054054054054056,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 0.0002513583680473044,
|
|
"loss": 5.240168762207031,
|
|
"mean_token_accuracy": 0.19397488832473755,
|
|
"num_tokens": 8500881.0,
|
|
"step": 3520
|
|
},
|
|
{
|
|
"entropy": 5.423109912872315,
|
|
"epoch": 3.810810810810811,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.0002500802362171216,
|
|
"loss": 5.158603668212891,
|
|
"mean_token_accuracy": 0.19260187745094298,
|
|
"num_tokens": 8512165.0,
|
|
"step": 3525
|
|
},
|
|
{
|
|
"entropy": 5.514354515075683,
|
|
"epoch": 3.8162162162162163,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0002488064429329999,
|
|
"loss": 5.221718597412109,
|
|
"mean_token_accuracy": 0.18973729908466339,
|
|
"num_tokens": 8525582.0,
|
|
"step": 3530
|
|
},
|
|
{
|
|
"entropy": 5.453316497802734,
|
|
"epoch": 3.8216216216216217,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 0.0002475370066212367,
|
|
"loss": 5.229565048217774,
|
|
"mean_token_accuracy": 0.18982920348644255,
|
|
"num_tokens": 8538040.0,
|
|
"step": 3535
|
|
},
|
|
{
|
|
"entropy": 5.440988636016845,
|
|
"epoch": 3.827027027027027,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0002462719456451032,
|
|
"loss": 5.217987823486328,
|
|
"mean_token_accuracy": 0.19724147021770477,
|
|
"num_tokens": 8550640.0,
|
|
"step": 3540
|
|
},
|
|
{
|
|
"entropy": 5.443281555175782,
|
|
"epoch": 3.8324324324324324,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.00024501127830457806,
|
|
"loss": 5.18835563659668,
|
|
"mean_token_accuracy": 0.1963032901287079,
|
|
"num_tokens": 8563553.0,
|
|
"step": 3545
|
|
},
|
|
{
|
|
"entropy": 5.452452850341797,
|
|
"epoch": 3.8378378378378377,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 0.0002437550228360833,
|
|
"loss": 5.189624786376953,
|
|
"mean_token_accuracy": 0.1978834390640259,
|
|
"num_tokens": 8574225.0,
|
|
"step": 3550
|
|
},
|
|
{
|
|
"entropy": 5.388482189178466,
|
|
"epoch": 3.8432432432432435,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 0.00024250319741221974,
|
|
"loss": 5.157117462158203,
|
|
"mean_token_accuracy": 0.19471263289451599,
|
|
"num_tokens": 8584615.0,
|
|
"step": 3555
|
|
},
|
|
{
|
|
"entropy": 5.4154558181762695,
|
|
"epoch": 3.8486486486486484,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.00024125582014150485,
|
|
"loss": 5.210173416137695,
|
|
"mean_token_accuracy": 0.19740667939186096,
|
|
"num_tokens": 8595308.0,
|
|
"step": 3560
|
|
},
|
|
{
|
|
"entropy": 5.497831535339356,
|
|
"epoch": 3.854054054054054,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.00024001290906811048,
|
|
"loss": 5.3061370849609375,
|
|
"mean_token_accuracy": 0.18907787799835205,
|
|
"num_tokens": 8607822.0,
|
|
"step": 3565
|
|
},
|
|
{
|
|
"entropy": 5.43311653137207,
|
|
"epoch": 3.8594594594594596,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.00023877448217160177,
|
|
"loss": 5.19825325012207,
|
|
"mean_token_accuracy": 0.2010089635848999,
|
|
"num_tokens": 8618187.0,
|
|
"step": 3570
|
|
},
|
|
{
|
|
"entropy": 5.402076053619385,
|
|
"epoch": 3.864864864864865,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 0.0002375405573666772,
|
|
"loss": 5.143459701538086,
|
|
"mean_token_accuracy": 0.20356982350349426,
|
|
"num_tokens": 8630898.0,
|
|
"step": 3575
|
|
},
|
|
{
|
|
"entropy": 5.394453525543213,
|
|
"epoch": 3.8702702702702703,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 0.00023631115250290942,
|
|
"loss": 5.2147064208984375,
|
|
"mean_token_accuracy": 0.19457484483718873,
|
|
"num_tokens": 8643311.0,
|
|
"step": 3580
|
|
},
|
|
{
|
|
"entropy": 5.466290378570557,
|
|
"epoch": 3.8756756756756756,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.00023508628536448694,
|
|
"loss": 5.180321884155274,
|
|
"mean_token_accuracy": 0.19896974861621858,
|
|
"num_tokens": 8655273.0,
|
|
"step": 3585
|
|
},
|
|
{
|
|
"entropy": 5.4646124839782715,
|
|
"epoch": 3.881081081081081,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.000233865973669957,
|
|
"loss": 5.1708740234375,
|
|
"mean_token_accuracy": 0.19329760670661927,
|
|
"num_tokens": 8669576.0,
|
|
"step": 3590
|
|
},
|
|
{
|
|
"entropy": 5.4799802780151365,
|
|
"epoch": 3.8864864864864863,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.00023265023507196918,
|
|
"loss": 5.250223541259766,
|
|
"mean_token_accuracy": 0.19359841644763948,
|
|
"num_tokens": 8679880.0,
|
|
"step": 3595
|
|
},
|
|
{
|
|
"entropy": 5.458091449737549,
|
|
"epoch": 3.891891891891892,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.00023143908715702008,
|
|
"loss": 5.266331481933594,
|
|
"mean_token_accuracy": 0.19757841229438783,
|
|
"num_tokens": 8692234.0,
|
|
"step": 3600
|
|
},
|
|
{
|
|
"entropy": 5.361728000640869,
|
|
"epoch": 3.8972972972972975,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0002302325474451989,
|
|
"loss": 5.072226715087891,
|
|
"mean_token_accuracy": 0.2097363442182541,
|
|
"num_tokens": 8702298.0,
|
|
"step": 3605
|
|
},
|
|
{
|
|
"entropy": 5.453731060028076,
|
|
"epoch": 3.902702702702703,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.00022903063338993406,
|
|
"loss": 5.167522048950195,
|
|
"mean_token_accuracy": 0.1947808802127838,
|
|
"num_tokens": 8713318.0,
|
|
"step": 3610
|
|
},
|
|
{
|
|
"entropy": 5.358808517456055,
|
|
"epoch": 3.908108108108108,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 0.00022783336237774054,
|
|
"loss": 5.168547821044922,
|
|
"mean_token_accuracy": 0.19800705909729005,
|
|
"num_tokens": 8726339.0,
|
|
"step": 3615
|
|
},
|
|
{
|
|
"entropy": 5.3465142250061035,
|
|
"epoch": 3.9135135135135135,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.00022664075172796865,
|
|
"loss": 5.0596263885498045,
|
|
"mean_token_accuracy": 0.21276561617851258,
|
|
"num_tokens": 8737511.0,
|
|
"step": 3620
|
|
},
|
|
{
|
|
"entropy": 5.4366155624389645,
|
|
"epoch": 3.918918918918919,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 0.0002254528186925533,
|
|
"loss": 5.260794830322266,
|
|
"mean_token_accuracy": 0.1926560640335083,
|
|
"num_tokens": 8749701.0,
|
|
"step": 3625
|
|
},
|
|
{
|
|
"entropy": 5.368730258941651,
|
|
"epoch": 3.924324324324324,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.00022426958045576435,
|
|
"loss": 5.124153518676758,
|
|
"mean_token_accuracy": 0.19883795976638793,
|
|
"num_tokens": 8761421.0,
|
|
"step": 3630
|
|
},
|
|
{
|
|
"entropy": 5.394690704345703,
|
|
"epoch": 3.92972972972973,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.00022309105413395851,
|
|
"loss": 5.133498764038086,
|
|
"mean_token_accuracy": 0.20165630877017976,
|
|
"num_tokens": 8772563.0,
|
|
"step": 3635
|
|
},
|
|
{
|
|
"entropy": 5.421563720703125,
|
|
"epoch": 3.935135135135135,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.00022191725677533087,
|
|
"loss": 5.263024139404297,
|
|
"mean_token_accuracy": 0.1899035394191742,
|
|
"num_tokens": 8783769.0,
|
|
"step": 3640
|
|
},
|
|
{
|
|
"entropy": 5.464792060852051,
|
|
"epoch": 3.9405405405405407,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.0002207482053596692,
|
|
"loss": 5.219766998291016,
|
|
"mean_token_accuracy": 0.19177072942256929,
|
|
"num_tokens": 8795533.0,
|
|
"step": 3645
|
|
},
|
|
{
|
|
"entropy": 5.5121557235717775,
|
|
"epoch": 3.945945945945946,
|
|
"grad_norm": 0.6640625,
|
|
"learning_rate": 0.00021958391679810786,
|
|
"loss": 5.284450912475586,
|
|
"mean_token_accuracy": 0.18963521718978882,
|
|
"num_tokens": 8809570.0,
|
|
"step": 3650
|
|
},
|
|
{
|
|
"entropy": 5.45432186126709,
|
|
"epoch": 3.9513513513513514,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 0.00021842440793288321,
|
|
"loss": 5.28461799621582,
|
|
"mean_token_accuracy": 0.2004390239715576,
|
|
"num_tokens": 8822225.0,
|
|
"step": 3655
|
|
},
|
|
{
|
|
"entropy": 5.309892272949218,
|
|
"epoch": 3.9567567567567568,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.00021726969553709005,
|
|
"loss": 5.053925323486328,
|
|
"mean_token_accuracy": 0.20246206521987914,
|
|
"num_tokens": 8833633.0,
|
|
"step": 3660
|
|
},
|
|
{
|
|
"entropy": 5.446015930175781,
|
|
"epoch": 3.962162162162162,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0002161197963144389,
|
|
"loss": 5.2521003723144535,
|
|
"mean_token_accuracy": 0.19135759472846986,
|
|
"num_tokens": 8846279.0,
|
|
"step": 3665
|
|
},
|
|
{
|
|
"entropy": 5.424617099761963,
|
|
"epoch": 3.9675675675675675,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0002149747268990143,
|
|
"loss": 5.190013885498047,
|
|
"mean_token_accuracy": 0.19764566123485566,
|
|
"num_tokens": 8858256.0,
|
|
"step": 3670
|
|
},
|
|
{
|
|
"entropy": 5.4317803382873535,
|
|
"epoch": 3.972972972972973,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0002138345038550346,
|
|
"loss": 5.144982528686524,
|
|
"mean_token_accuracy": 0.1975553661584854,
|
|
"num_tokens": 8872434.0,
|
|
"step": 3675
|
|
},
|
|
{
|
|
"entropy": 5.343093204498291,
|
|
"epoch": 3.9783783783783786,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 0.00021269914367661193,
|
|
"loss": 5.102174377441406,
|
|
"mean_token_accuracy": 0.19166693091392517,
|
|
"num_tokens": 8884534.0,
|
|
"step": 3680
|
|
},
|
|
{
|
|
"entropy": 5.337662124633789,
|
|
"epoch": 3.983783783783784,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.00021156866278751335,
|
|
"loss": 5.152744293212891,
|
|
"mean_token_accuracy": 0.19855313301086425,
|
|
"num_tokens": 8895785.0,
|
|
"step": 3685
|
|
},
|
|
{
|
|
"entropy": 5.33992338180542,
|
|
"epoch": 3.9891891891891893,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 0.0002104430775409242,
|
|
"loss": 5.17008056640625,
|
|
"mean_token_accuracy": 0.19969792068004608,
|
|
"num_tokens": 8907863.0,
|
|
"step": 3690
|
|
},
|
|
{
|
|
"entropy": 5.467635631561279,
|
|
"epoch": 3.9945945945945946,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.00020932240421921055,
|
|
"loss": 5.197922134399414,
|
|
"mean_token_accuracy": 0.19613656401634216,
|
|
"num_tokens": 8920821.0,
|
|
"step": 3695
|
|
},
|
|
{
|
|
"entropy": 5.545791435241699,
|
|
"epoch": 4.0,
|
|
"grad_norm": 1.65625,
|
|
"learning_rate": 0.00020820665903368446,
|
|
"loss": 5.263454437255859,
|
|
"mean_token_accuracy": 0.18522150814533234,
|
|
"num_tokens": 8930672.0,
|
|
"step": 3700
|
|
},
|
|
{
|
|
"entropy": 5.506819820404052,
|
|
"epoch": 4.005405405405406,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.00020709585812436879,
|
|
"loss": 5.177950668334961,
|
|
"mean_token_accuracy": 0.19312651157379152,
|
|
"num_tokens": 8946035.0,
|
|
"step": 3705
|
|
},
|
|
{
|
|
"entropy": 5.408169078826904,
|
|
"epoch": 4.010810810810811,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.00020599001755976416,
|
|
"loss": 5.07934684753418,
|
|
"mean_token_accuracy": 0.20086476802825928,
|
|
"num_tokens": 8958575.0,
|
|
"step": 3710
|
|
},
|
|
{
|
|
"entropy": 5.36244478225708,
|
|
"epoch": 4.0162162162162165,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0002048891533366164,
|
|
"loss": 4.986711120605468,
|
|
"mean_token_accuracy": 0.2076200395822525,
|
|
"num_tokens": 8968847.0,
|
|
"step": 3715
|
|
},
|
|
{
|
|
"entropy": 5.428197002410888,
|
|
"epoch": 4.021621621621621,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.00020379328137968503,
|
|
"loss": 5.029343032836914,
|
|
"mean_token_accuracy": 0.20098725259304046,
|
|
"num_tokens": 8978891.0,
|
|
"step": 3720
|
|
},
|
|
{
|
|
"entropy": 5.4388203620910645,
|
|
"epoch": 4.027027027027027,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.00020270241754151338,
|
|
"loss": 5.2001197814941404,
|
|
"mean_token_accuracy": 0.19989875555038453,
|
|
"num_tokens": 8993064.0,
|
|
"step": 3725
|
|
},
|
|
{
|
|
"entropy": 5.460076332092285,
|
|
"epoch": 4.032432432432432,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.00020161657760219825,
|
|
"loss": 5.061175155639648,
|
|
"mean_token_accuracy": 0.20846845507621764,
|
|
"num_tokens": 9005258.0,
|
|
"step": 3730
|
|
},
|
|
{
|
|
"entropy": 5.381246662139892,
|
|
"epoch": 4.037837837837838,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 0.00020053577726916283,
|
|
"loss": 5.0358024597167965,
|
|
"mean_token_accuracy": 0.20333241820335388,
|
|
"num_tokens": 9017575.0,
|
|
"step": 3735
|
|
},
|
|
{
|
|
"entropy": 5.3065777778625485,
|
|
"epoch": 4.043243243243243,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 0.00019946003217692865,
|
|
"loss": 4.954782867431641,
|
|
"mean_token_accuracy": 0.2087556391954422,
|
|
"num_tokens": 9028929.0,
|
|
"step": 3740
|
|
},
|
|
{
|
|
"entropy": 5.359524822235107,
|
|
"epoch": 4.048648648648649,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0001983893578868898,
|
|
"loss": 5.049629211425781,
|
|
"mean_token_accuracy": 0.2121301531791687,
|
|
"num_tokens": 9039284.0,
|
|
"step": 3745
|
|
},
|
|
{
|
|
"entropy": 5.424607372283935,
|
|
"epoch": 4.054054054054054,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.00019732376988708763,
|
|
"loss": 5.055988693237305,
|
|
"mean_token_accuracy": 0.20491551756858825,
|
|
"num_tokens": 9051970.0,
|
|
"step": 3750
|
|
},
|
|
{
|
|
"entropy": 5.401216125488281,
|
|
"epoch": 4.059459459459459,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.00019626328359198696,
|
|
"loss": 5.024212646484375,
|
|
"mean_token_accuracy": 0.21316613852977753,
|
|
"num_tokens": 9062279.0,
|
|
"step": 3755
|
|
},
|
|
{
|
|
"entropy": 5.40555248260498,
|
|
"epoch": 4.064864864864865,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 0.0001952079143422528,
|
|
"loss": 5.142210388183594,
|
|
"mean_token_accuracy": 0.19616701304912568,
|
|
"num_tokens": 9074932.0,
|
|
"step": 3760
|
|
},
|
|
{
|
|
"entropy": 5.4292168617248535,
|
|
"epoch": 4.07027027027027,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 0.00019415767740452855,
|
|
"loss": 5.135602569580078,
|
|
"mean_token_accuracy": 0.19744566679000855,
|
|
"num_tokens": 9087240.0,
|
|
"step": 3765
|
|
},
|
|
{
|
|
"entropy": 5.605555534362793,
|
|
"epoch": 4.075675675675676,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0001931125879712155,
|
|
"loss": 5.199501037597656,
|
|
"mean_token_accuracy": 0.20132708549499512,
|
|
"num_tokens": 9102239.0,
|
|
"step": 3770
|
|
},
|
|
{
|
|
"entropy": 5.41156415939331,
|
|
"epoch": 4.081081081081081,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.00019207266116025217,
|
|
"loss": 5.006567764282226,
|
|
"mean_token_accuracy": 0.20772689580917358,
|
|
"num_tokens": 9115980.0,
|
|
"step": 3775
|
|
},
|
|
{
|
|
"entropy": 5.390612602233887,
|
|
"epoch": 4.0864864864864865,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 0.00019103791201489665,
|
|
"loss": 5.096155166625977,
|
|
"mean_token_accuracy": 0.20286110043525696,
|
|
"num_tokens": 9128642.0,
|
|
"step": 3780
|
|
},
|
|
{
|
|
"entropy": 5.316834831237793,
|
|
"epoch": 4.091891891891892,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0001900083555035083,
|
|
"loss": 5.029847717285156,
|
|
"mean_token_accuracy": 0.20236681401729584,
|
|
"num_tokens": 9139789.0,
|
|
"step": 3785
|
|
},
|
|
{
|
|
"entropy": 5.3501934051513675,
|
|
"epoch": 4.097297297297297,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 0.0001889840065193317,
|
|
"loss": 4.999631881713867,
|
|
"mean_token_accuracy": 0.20087677240371704,
|
|
"num_tokens": 9152850.0,
|
|
"step": 3790
|
|
},
|
|
{
|
|
"entropy": 5.49217119216919,
|
|
"epoch": 4.102702702702703,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00018796487988028063,
|
|
"loss": 5.152251815795898,
|
|
"mean_token_accuracy": 0.20211312174797058,
|
|
"num_tokens": 9167387.0,
|
|
"step": 3795
|
|
},
|
|
{
|
|
"entropy": 5.365047264099121,
|
|
"epoch": 4.108108108108108,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.00018695099032872426,
|
|
"loss": 5.054198455810547,
|
|
"mean_token_accuracy": 0.20633134841918946,
|
|
"num_tokens": 9178922.0,
|
|
"step": 3800
|
|
},
|
|
{
|
|
"entropy": 5.473588943481445,
|
|
"epoch": 4.113513513513514,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.00018594235253127373,
|
|
"loss": 5.167987060546875,
|
|
"mean_token_accuracy": 0.18892290592193603,
|
|
"num_tokens": 9191191.0,
|
|
"step": 3805
|
|
},
|
|
{
|
|
"entropy": 5.366931056976318,
|
|
"epoch": 4.118918918918919,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.00018493898107856967,
|
|
"loss": 5.0788932800292965,
|
|
"mean_token_accuracy": 0.20205467641353608,
|
|
"num_tokens": 9202286.0,
|
|
"step": 3810
|
|
},
|
|
{
|
|
"entropy": 5.400396633148193,
|
|
"epoch": 4.124324324324324,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 0.00018394089048507173,
|
|
"loss": 5.013753128051758,
|
|
"mean_token_accuracy": 0.20631377398967743,
|
|
"num_tokens": 9214139.0,
|
|
"step": 3815
|
|
},
|
|
{
|
|
"entropy": 5.467559146881103,
|
|
"epoch": 4.12972972972973,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.00018294809518884812,
|
|
"loss": 5.171836853027344,
|
|
"mean_token_accuracy": 0.20094367861747742,
|
|
"num_tokens": 9227164.0,
|
|
"step": 3820
|
|
},
|
|
{
|
|
"entropy": 5.335562229156494,
|
|
"epoch": 4.135135135135135,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 0.00018196060955136685,
|
|
"loss": 4.986429595947266,
|
|
"mean_token_accuracy": 0.2041931927204132,
|
|
"num_tokens": 9239166.0,
|
|
"step": 3825
|
|
},
|
|
{
|
|
"entropy": 5.417660713195801,
|
|
"epoch": 4.140540540540541,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.00018097844785728824,
|
|
"loss": 5.071644973754883,
|
|
"mean_token_accuracy": 0.19564643502235413,
|
|
"num_tokens": 9251180.0,
|
|
"step": 3830
|
|
},
|
|
{
|
|
"entropy": 5.3634840965271,
|
|
"epoch": 4.145945945945946,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.00018000162431425798,
|
|
"loss": 5.0175212860107425,
|
|
"mean_token_accuracy": 0.20834631621837615,
|
|
"num_tokens": 9264165.0,
|
|
"step": 3835
|
|
},
|
|
{
|
|
"entropy": 5.527240371704101,
|
|
"epoch": 4.151351351351352,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.00017903015305270172,
|
|
"loss": 5.228527450561524,
|
|
"mean_token_accuracy": 0.18381789624691008,
|
|
"num_tokens": 9279056.0,
|
|
"step": 3840
|
|
},
|
|
{
|
|
"entropy": 5.3829795837402346,
|
|
"epoch": 4.1567567567567565,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.00017806404812562083,
|
|
"loss": 5.049213790893555,
|
|
"mean_token_accuracy": 0.20663119852542877,
|
|
"num_tokens": 9290214.0,
|
|
"step": 3845
|
|
},
|
|
{
|
|
"entropy": 5.336713027954102,
|
|
"epoch": 4.162162162162162,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.0001771033235083887,
|
|
"loss": 5.016562652587891,
|
|
"mean_token_accuracy": 0.2052672415971756,
|
|
"num_tokens": 9301555.0,
|
|
"step": 3850
|
|
},
|
|
{
|
|
"entropy": 5.307322883605957,
|
|
"epoch": 4.167567567567567,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.00017614799309854918,
|
|
"loss": 4.915204620361328,
|
|
"mean_token_accuracy": 0.2108205020427704,
|
|
"num_tokens": 9311647.0,
|
|
"step": 3855
|
|
},
|
|
{
|
|
"entropy": 5.454516410827637,
|
|
"epoch": 4.172972972972973,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.00017519807071561473,
|
|
"loss": 5.093964385986328,
|
|
"mean_token_accuracy": 0.20434187054634095,
|
|
"num_tokens": 9323670.0,
|
|
"step": 3860
|
|
},
|
|
{
|
|
"entropy": 5.372503757476807,
|
|
"epoch": 4.178378378378379,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 0.00017425357010086723,
|
|
"loss": 5.1407207489013675,
|
|
"mean_token_accuracy": 0.20258193016052245,
|
|
"num_tokens": 9337351.0,
|
|
"step": 3865
|
|
},
|
|
{
|
|
"entropy": 5.353326892852783,
|
|
"epoch": 4.183783783783784,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.00017331450491715901,
|
|
"loss": 5.099714279174805,
|
|
"mean_token_accuracy": 0.1987817794084549,
|
|
"num_tokens": 9349475.0,
|
|
"step": 3870
|
|
},
|
|
{
|
|
"entropy": 5.385936641693116,
|
|
"epoch": 4.1891891891891895,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.00017238088874871517,
|
|
"loss": 5.1264087677001955,
|
|
"mean_token_accuracy": 0.19618720114231109,
|
|
"num_tokens": 9362384.0,
|
|
"step": 3875
|
|
},
|
|
{
|
|
"entropy": 5.464049053192139,
|
|
"epoch": 4.194594594594594,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 0.0001714527351009368,
|
|
"loss": 5.17853012084961,
|
|
"mean_token_accuracy": 0.19242238402366638,
|
|
"num_tokens": 9376104.0,
|
|
"step": 3880
|
|
},
|
|
{
|
|
"entropy": 5.405678653717041,
|
|
"epoch": 4.2,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 0.00017053005740020607,
|
|
"loss": 5.074061584472656,
|
|
"mean_token_accuracy": 0.2042648732662201,
|
|
"num_tokens": 9388321.0,
|
|
"step": 3885
|
|
},
|
|
{
|
|
"entropy": 5.3505230903625485,
|
|
"epoch": 4.205405405405405,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.00016961286899369176,
|
|
"loss": 4.981391143798828,
|
|
"mean_token_accuracy": 0.21690163314342498,
|
|
"num_tokens": 9399774.0,
|
|
"step": 3890
|
|
},
|
|
{
|
|
"entropy": 5.353574943542481,
|
|
"epoch": 4.210810810810811,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0001687011831491562,
|
|
"loss": 5.043711853027344,
|
|
"mean_token_accuracy": 0.19942772686481475,
|
|
"num_tokens": 9410868.0,
|
|
"step": 3895
|
|
},
|
|
{
|
|
"entropy": 5.336647987365723,
|
|
"epoch": 4.216216216216216,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.00016779501305476353,
|
|
"loss": 5.036537551879883,
|
|
"mean_token_accuracy": 0.20080936849117278,
|
|
"num_tokens": 9422546.0,
|
|
"step": 3900
|
|
},
|
|
{
|
|
"entropy": 5.373489475250244,
|
|
"epoch": 4.221621621621622,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 0.0001668943718188884,
|
|
"loss": 5.034217834472656,
|
|
"mean_token_accuracy": 0.20635573863983153,
|
|
"num_tokens": 9433800.0,
|
|
"step": 3905
|
|
},
|
|
{
|
|
"entropy": 5.370281600952149,
|
|
"epoch": 4.227027027027027,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 0.00016599927246992692,
|
|
"loss": 5.027564239501953,
|
|
"mean_token_accuracy": 0.20622622966766357,
|
|
"num_tokens": 9445189.0,
|
|
"step": 3910
|
|
},
|
|
{
|
|
"entropy": 5.441983985900879,
|
|
"epoch": 4.232432432432432,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 0.00016510972795610813,
|
|
"loss": 5.091859817504883,
|
|
"mean_token_accuracy": 0.2028784155845642,
|
|
"num_tokens": 9459020.0,
|
|
"step": 3915
|
|
},
|
|
{
|
|
"entropy": 5.319528961181641,
|
|
"epoch": 4.237837837837838,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 0.00016422575114530635,
|
|
"loss": 5.055155944824219,
|
|
"mean_token_accuracy": 0.20251446962356567,
|
|
"num_tokens": 9471129.0,
|
|
"step": 3920
|
|
},
|
|
{
|
|
"entropy": 5.388294696807861,
|
|
"epoch": 4.243243243243243,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.00016334735482485536,
|
|
"loss": 5.114758682250977,
|
|
"mean_token_accuracy": 0.2038686215877533,
|
|
"num_tokens": 9482862.0,
|
|
"step": 3925
|
|
},
|
|
{
|
|
"entropy": 5.365617752075195,
|
|
"epoch": 4.248648648648649,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.00016247455170136316,
|
|
"loss": 4.902303314208984,
|
|
"mean_token_accuracy": 0.21890144050121307,
|
|
"num_tokens": 9494224.0,
|
|
"step": 3930
|
|
},
|
|
{
|
|
"entropy": 5.347277355194092,
|
|
"epoch": 4.254054054054054,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.00016160735440052837,
|
|
"loss": 4.988186645507812,
|
|
"mean_token_accuracy": 0.2075951635837555,
|
|
"num_tokens": 9505096.0,
|
|
"step": 3935
|
|
},
|
|
{
|
|
"entropy": 5.4528343200683596,
|
|
"epoch": 4.2594594594594595,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0001607457754669577,
|
|
"loss": 5.165020370483399,
|
|
"mean_token_accuracy": 0.19245902299880982,
|
|
"num_tokens": 9516189.0,
|
|
"step": 3940
|
|
},
|
|
{
|
|
"entropy": 5.407967948913575,
|
|
"epoch": 4.264864864864865,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.00015988982736398413,
|
|
"loss": 5.052255249023437,
|
|
"mean_token_accuracy": 0.2102067232131958,
|
|
"num_tokens": 9528460.0,
|
|
"step": 3945
|
|
},
|
|
{
|
|
"entropy": 5.325722312927246,
|
|
"epoch": 4.27027027027027,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 0.00015903952247348668,
|
|
"loss": 4.962136077880859,
|
|
"mean_token_accuracy": 0.2102319061756134,
|
|
"num_tokens": 9541234.0,
|
|
"step": 3950
|
|
},
|
|
{
|
|
"entropy": 5.299732971191406,
|
|
"epoch": 4.275675675675676,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0001581948730957116,
|
|
"loss": 5.008248138427734,
|
|
"mean_token_accuracy": 0.21251410543918609,
|
|
"num_tokens": 9552265.0,
|
|
"step": 3955
|
|
},
|
|
{
|
|
"entropy": 5.299077033996582,
|
|
"epoch": 4.281081081081081,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 0.0001573558914490942,
|
|
"loss": 5.0168907165527346,
|
|
"mean_token_accuracy": 0.20819776952266694,
|
|
"num_tokens": 9564704.0,
|
|
"step": 3960
|
|
},
|
|
{
|
|
"entropy": 5.446887588500976,
|
|
"epoch": 4.286486486486487,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.00015652258967008208,
|
|
"loss": 5.160053253173828,
|
|
"mean_token_accuracy": 0.19875184893608094,
|
|
"num_tokens": 9576504.0,
|
|
"step": 3965
|
|
},
|
|
{
|
|
"entropy": 5.374563217163086,
|
|
"epoch": 4.291891891891892,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.00015569497981295988,
|
|
"loss": 5.075575256347657,
|
|
"mean_token_accuracy": 0.19706565737724305,
|
|
"num_tokens": 9588467.0,
|
|
"step": 3970
|
|
},
|
|
{
|
|
"entropy": 5.43676528930664,
|
|
"epoch": 4.297297297297297,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.00015487307384967443,
|
|
"loss": 5.111468887329101,
|
|
"mean_token_accuracy": 0.19314676225185395,
|
|
"num_tokens": 9603365.0,
|
|
"step": 3975
|
|
},
|
|
{
|
|
"entropy": 5.357078647613525,
|
|
"epoch": 4.302702702702703,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 0.0001540568836696617,
|
|
"loss": 4.97608757019043,
|
|
"mean_token_accuracy": 0.20660168528556824,
|
|
"num_tokens": 9613855.0,
|
|
"step": 3980
|
|
},
|
|
{
|
|
"entropy": 5.339068508148193,
|
|
"epoch": 4.308108108108108,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.00015324642107967534,
|
|
"loss": 4.970314788818359,
|
|
"mean_token_accuracy": 0.20531153082847595,
|
|
"num_tokens": 9624998.0,
|
|
"step": 3985
|
|
},
|
|
{
|
|
"entropy": 5.356179809570312,
|
|
"epoch": 4.313513513513514,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 0.00015244169780361517,
|
|
"loss": 5.074262237548828,
|
|
"mean_token_accuracy": 0.19838375449180604,
|
|
"num_tokens": 9638354.0,
|
|
"step": 3990
|
|
},
|
|
{
|
|
"entropy": 5.306711578369141,
|
|
"epoch": 4.318918918918919,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 0.0001516427254823578,
|
|
"loss": 4.990373229980468,
|
|
"mean_token_accuracy": 0.20787020027637482,
|
|
"num_tokens": 9649717.0,
|
|
"step": 3995
|
|
},
|
|
{
|
|
"entropy": 5.485813045501709,
|
|
"epoch": 4.324324324324325,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.00015084951567358843,
|
|
"loss": 5.157690048217773,
|
|
"mean_token_accuracy": 0.191901496052742,
|
|
"num_tokens": 9662803.0,
|
|
"step": 4000
|
|
}
|
|
],
|
|
"logging_steps": 5,
|
|
"max_steps": 4630,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 6,
|
|
"save_steps": 1000,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": false
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 3666899443875840.0,
|
|
"train_batch_size": 32,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|