2035 lines
57 KiB
JSON
2035 lines
57 KiB
JSON
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 1.0810810810810811,
|
|
"eval_steps": 500,
|
|
"global_step": 1000,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"entropy": 9.657138442993164,
|
|
"epoch": 0.005405405405405406,
|
|
"grad_norm": 4.90625,
|
|
"learning_rate": 8e-06,
|
|
"loss": 12.520880889892577,
|
|
"mean_token_accuracy": 0.002236185665242374,
|
|
"num_tokens": 11236.0,
|
|
"step": 5
|
|
},
|
|
{
|
|
"entropy": 9.649214553833009,
|
|
"epoch": 0.010810810810810811,
|
|
"grad_norm": 4.5,
|
|
"learning_rate": 1.8e-05,
|
|
"loss": 12.531226348876952,
|
|
"mean_token_accuracy": 0.002215801365673542,
|
|
"num_tokens": 22482.0,
|
|
"step": 10
|
|
},
|
|
{
|
|
"entropy": 9.733113479614257,
|
|
"epoch": 0.016216216216216217,
|
|
"grad_norm": 5.03125,
|
|
"learning_rate": 2.8e-05,
|
|
"loss": 12.409437561035157,
|
|
"mean_token_accuracy": 0.002145940694026649,
|
|
"num_tokens": 35515.0,
|
|
"step": 15
|
|
},
|
|
{
|
|
"entropy": 9.83765811920166,
|
|
"epoch": 0.021621621621621623,
|
|
"grad_norm": 4.46875,
|
|
"learning_rate": 3.8e-05,
|
|
"loss": 12.153470611572265,
|
|
"mean_token_accuracy": 0.006360871193464845,
|
|
"num_tokens": 46983.0,
|
|
"step": 20
|
|
},
|
|
{
|
|
"entropy": 9.924044799804687,
|
|
"epoch": 0.02702702702702703,
|
|
"grad_norm": 3.25,
|
|
"learning_rate": 4.8e-05,
|
|
"loss": 11.767626953125,
|
|
"mean_token_accuracy": 0.010928381700068712,
|
|
"num_tokens": 60568.0,
|
|
"step": 25
|
|
},
|
|
{
|
|
"entropy": 10.140900039672852,
|
|
"epoch": 0.032432432432432434,
|
|
"grad_norm": 2.90625,
|
|
"learning_rate": 5.800000000000001e-05,
|
|
"loss": 11.328617095947266,
|
|
"mean_token_accuracy": 0.01978628318756819,
|
|
"num_tokens": 70721.0,
|
|
"step": 30
|
|
},
|
|
{
|
|
"entropy": 10.317844772338868,
|
|
"epoch": 0.03783783783783784,
|
|
"grad_norm": 2.1875,
|
|
"learning_rate": 6.800000000000001e-05,
|
|
"loss": 11.004520416259766,
|
|
"mean_token_accuracy": 0.027996162697672845,
|
|
"num_tokens": 85970.0,
|
|
"step": 35
|
|
},
|
|
{
|
|
"entropy": 10.511189270019532,
|
|
"epoch": 0.043243243243243246,
|
|
"grad_norm": 2.0,
|
|
"learning_rate": 7.8e-05,
|
|
"loss": 10.693595886230469,
|
|
"mean_token_accuracy": 0.03253013007342816,
|
|
"num_tokens": 97950.0,
|
|
"step": 40
|
|
},
|
|
{
|
|
"entropy": 10.562995338439942,
|
|
"epoch": 0.04864864864864865,
|
|
"grad_norm": 1.84375,
|
|
"learning_rate": 8.8e-05,
|
|
"loss": 10.466288757324218,
|
|
"mean_token_accuracy": 0.03578495755791664,
|
|
"num_tokens": 112032.0,
|
|
"step": 45
|
|
},
|
|
{
|
|
"entropy": 10.56525535583496,
|
|
"epoch": 0.05405405405405406,
|
|
"grad_norm": 2.046875,
|
|
"learning_rate": 9.800000000000001e-05,
|
|
"loss": 10.196940612792968,
|
|
"mean_token_accuracy": 0.03835028558969498,
|
|
"num_tokens": 126780.0,
|
|
"step": 50
|
|
},
|
|
{
|
|
"entropy": 10.538235855102538,
|
|
"epoch": 0.05945945945945946,
|
|
"grad_norm": 1.8515625,
|
|
"learning_rate": 0.000108,
|
|
"loss": 9.862722778320313,
|
|
"mean_token_accuracy": 0.03907337710261345,
|
|
"num_tokens": 138322.0,
|
|
"step": 55
|
|
},
|
|
{
|
|
"entropy": 10.436158370971679,
|
|
"epoch": 0.06486486486486487,
|
|
"grad_norm": 1.9765625,
|
|
"learning_rate": 0.000118,
|
|
"loss": 9.546548461914062,
|
|
"mean_token_accuracy": 0.03616050221025944,
|
|
"num_tokens": 152679.0,
|
|
"step": 60
|
|
},
|
|
{
|
|
"entropy": 10.354158973693847,
|
|
"epoch": 0.07027027027027027,
|
|
"grad_norm": 1.7421875,
|
|
"learning_rate": 0.000128,
|
|
"loss": 9.224214172363281,
|
|
"mean_token_accuracy": 0.038402664661407473,
|
|
"num_tokens": 162848.0,
|
|
"step": 65
|
|
},
|
|
{
|
|
"entropy": 10.261932945251464,
|
|
"epoch": 0.07567567567567568,
|
|
"grad_norm": 1.6640625,
|
|
"learning_rate": 0.00013800000000000002,
|
|
"loss": 9.017792510986329,
|
|
"mean_token_accuracy": 0.037848640233278275,
|
|
"num_tokens": 178170.0,
|
|
"step": 70
|
|
},
|
|
{
|
|
"entropy": 10.09331226348877,
|
|
"epoch": 0.08108108108108109,
|
|
"grad_norm": 1.671875,
|
|
"learning_rate": 0.000148,
|
|
"loss": 8.539015197753907,
|
|
"mean_token_accuracy": 0.03686205819249153,
|
|
"num_tokens": 189845.0,
|
|
"step": 75
|
|
},
|
|
{
|
|
"entropy": 9.829462432861328,
|
|
"epoch": 0.08648648648648649,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.000158,
|
|
"loss": 8.27553939819336,
|
|
"mean_token_accuracy": 0.03745934441685676,
|
|
"num_tokens": 202943.0,
|
|
"step": 80
|
|
},
|
|
{
|
|
"entropy": 9.433079528808594,
|
|
"epoch": 0.0918918918918919,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00016800000000000002,
|
|
"loss": 8.054940795898437,
|
|
"mean_token_accuracy": 0.03733482360839844,
|
|
"num_tokens": 213981.0,
|
|
"step": 85
|
|
},
|
|
{
|
|
"entropy": 8.931513023376464,
|
|
"epoch": 0.0972972972972973,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.000178,
|
|
"loss": 7.836601257324219,
|
|
"mean_token_accuracy": 0.03742141723632812,
|
|
"num_tokens": 226516.0,
|
|
"step": 90
|
|
},
|
|
{
|
|
"entropy": 8.278807258605957,
|
|
"epoch": 0.10270270270270271,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 0.00018800000000000002,
|
|
"loss": 7.645230102539062,
|
|
"mean_token_accuracy": 0.038530788570642474,
|
|
"num_tokens": 236934.0,
|
|
"step": 95
|
|
},
|
|
{
|
|
"entropy": 7.783323097229004,
|
|
"epoch": 0.10810810810810811,
|
|
"grad_norm": 0.63671875,
|
|
"learning_rate": 0.00019800000000000002,
|
|
"loss": 7.529661560058594,
|
|
"mean_token_accuracy": 0.04016850292682648,
|
|
"num_tokens": 247638.0,
|
|
"step": 100
|
|
},
|
|
{
|
|
"entropy": 7.620136451721192,
|
|
"epoch": 0.11351351351351352,
|
|
"grad_norm": 0.65234375,
|
|
"learning_rate": 0.000208,
|
|
"loss": 7.58187255859375,
|
|
"mean_token_accuracy": 0.03762040063738823,
|
|
"num_tokens": 260647.0,
|
|
"step": 105
|
|
},
|
|
{
|
|
"entropy": 7.530057430267334,
|
|
"epoch": 0.11891891891891893,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.000218,
|
|
"loss": 7.458168029785156,
|
|
"mean_token_accuracy": 0.03727283701300621,
|
|
"num_tokens": 272033.0,
|
|
"step": 110
|
|
},
|
|
{
|
|
"entropy": 7.478269100189209,
|
|
"epoch": 0.12432432432432433,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 0.000228,
|
|
"loss": 7.519155883789063,
|
|
"mean_token_accuracy": 0.0388708658516407,
|
|
"num_tokens": 284046.0,
|
|
"step": 115
|
|
},
|
|
{
|
|
"entropy": 7.465256214141846,
|
|
"epoch": 0.12972972972972974,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 0.00023799999999999998,
|
|
"loss": 7.423601531982422,
|
|
"mean_token_accuracy": 0.037958408892154696,
|
|
"num_tokens": 294671.0,
|
|
"step": 120
|
|
},
|
|
{
|
|
"entropy": 7.6223400115966795,
|
|
"epoch": 0.13513513513513514,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.000248,
|
|
"loss": 7.408821105957031,
|
|
"mean_token_accuracy": 0.03943843990564346,
|
|
"num_tokens": 305267.0,
|
|
"step": 125
|
|
},
|
|
{
|
|
"entropy": 7.496581554412842,
|
|
"epoch": 0.14054054054054055,
|
|
"grad_norm": 0.6640625,
|
|
"learning_rate": 0.00025800000000000004,
|
|
"loss": 7.504977416992188,
|
|
"mean_token_accuracy": 0.03954529017210007,
|
|
"num_tokens": 316480.0,
|
|
"step": 130
|
|
},
|
|
{
|
|
"entropy": 7.595795345306397,
|
|
"epoch": 0.14594594594594595,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 0.000268,
|
|
"loss": 7.485077667236328,
|
|
"mean_token_accuracy": 0.04093076065182686,
|
|
"num_tokens": 328343.0,
|
|
"step": 135
|
|
},
|
|
{
|
|
"entropy": 7.389880180358887,
|
|
"epoch": 0.15135135135135136,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00027800000000000004,
|
|
"loss": 7.638716125488282,
|
|
"mean_token_accuracy": 0.03965384438633919,
|
|
"num_tokens": 341072.0,
|
|
"step": 140
|
|
},
|
|
{
|
|
"entropy": 7.676095676422119,
|
|
"epoch": 0.15675675675675677,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 0.000288,
|
|
"loss": 7.436899566650391,
|
|
"mean_token_accuracy": 0.04083571806550026,
|
|
"num_tokens": 353637.0,
|
|
"step": 145
|
|
},
|
|
{
|
|
"entropy": 7.392151641845703,
|
|
"epoch": 0.16216216216216217,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.000298,
|
|
"loss": 7.492266845703125,
|
|
"mean_token_accuracy": 0.04074482023715973,
|
|
"num_tokens": 366845.0,
|
|
"step": 150
|
|
},
|
|
{
|
|
"entropy": 7.501393413543701,
|
|
"epoch": 0.16756756756756758,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.000308,
|
|
"loss": 7.447349548339844,
|
|
"mean_token_accuracy": 0.04357003271579742,
|
|
"num_tokens": 379852.0,
|
|
"step": 155
|
|
},
|
|
{
|
|
"entropy": 7.460719776153565,
|
|
"epoch": 0.17297297297297298,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.00031800000000000003,
|
|
"loss": 7.461611938476563,
|
|
"mean_token_accuracy": 0.05375379621982575,
|
|
"num_tokens": 393017.0,
|
|
"step": 160
|
|
},
|
|
{
|
|
"entropy": 7.317601490020752,
|
|
"epoch": 0.1783783783783784,
|
|
"grad_norm": 0.62109375,
|
|
"learning_rate": 0.000328,
|
|
"loss": 7.4609222412109375,
|
|
"mean_token_accuracy": 0.06083732768893242,
|
|
"num_tokens": 405080.0,
|
|
"step": 165
|
|
},
|
|
{
|
|
"entropy": 7.453921985626221,
|
|
"epoch": 0.1837837837837838,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.00033800000000000003,
|
|
"loss": 7.478794097900391,
|
|
"mean_token_accuracy": 0.0638080045580864,
|
|
"num_tokens": 416562.0,
|
|
"step": 170
|
|
},
|
|
{
|
|
"entropy": 7.490277862548828,
|
|
"epoch": 0.1891891891891892,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.000348,
|
|
"loss": 7.457525634765625,
|
|
"mean_token_accuracy": 0.06417724341154099,
|
|
"num_tokens": 431085.0,
|
|
"step": 175
|
|
},
|
|
{
|
|
"entropy": 7.414785957336425,
|
|
"epoch": 0.1945945945945946,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 0.000358,
|
|
"loss": 7.350696563720703,
|
|
"mean_token_accuracy": 0.06525981873273849,
|
|
"num_tokens": 443530.0,
|
|
"step": 180
|
|
},
|
|
{
|
|
"entropy": 7.419140338897705,
|
|
"epoch": 0.2,
|
|
"grad_norm": 0.6484375,
|
|
"learning_rate": 0.000368,
|
|
"loss": 7.389920806884765,
|
|
"mean_token_accuracy": 0.07182540744543076,
|
|
"num_tokens": 454722.0,
|
|
"step": 185
|
|
},
|
|
{
|
|
"entropy": 7.397796249389648,
|
|
"epoch": 0.20540540540540542,
|
|
"grad_norm": 0.640625,
|
|
"learning_rate": 0.000378,
|
|
"loss": 7.342085266113282,
|
|
"mean_token_accuracy": 0.07431704550981522,
|
|
"num_tokens": 466162.0,
|
|
"step": 190
|
|
},
|
|
{
|
|
"entropy": 7.36507568359375,
|
|
"epoch": 0.21081081081081082,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 0.000388,
|
|
"loss": 7.353427124023438,
|
|
"mean_token_accuracy": 0.07438301593065262,
|
|
"num_tokens": 476489.0,
|
|
"step": 195
|
|
},
|
|
{
|
|
"entropy": 7.417136478424072,
|
|
"epoch": 0.21621621621621623,
|
|
"grad_norm": 0.67578125,
|
|
"learning_rate": 0.000398,
|
|
"loss": 7.341059875488281,
|
|
"mean_token_accuracy": 0.06952804177999497,
|
|
"num_tokens": 488243.0,
|
|
"step": 200
|
|
},
|
|
{
|
|
"entropy": 7.389842224121094,
|
|
"epoch": 0.22162162162162163,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 0.000408,
|
|
"loss": 7.386956024169922,
|
|
"mean_token_accuracy": 0.07643609791994095,
|
|
"num_tokens": 499212.0,
|
|
"step": 205
|
|
},
|
|
{
|
|
"entropy": 7.442728900909424,
|
|
"epoch": 0.22702702702702704,
|
|
"grad_norm": 0.65625,
|
|
"learning_rate": 0.00041799999999999997,
|
|
"loss": 7.313986968994141,
|
|
"mean_token_accuracy": 0.0721098467707634,
|
|
"num_tokens": 510690.0,
|
|
"step": 210
|
|
},
|
|
{
|
|
"entropy": 7.2722938537597654,
|
|
"epoch": 0.23243243243243245,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 0.000428,
|
|
"loss": 7.30157699584961,
|
|
"mean_token_accuracy": 0.0739034004509449,
|
|
"num_tokens": 523005.0,
|
|
"step": 215
|
|
},
|
|
{
|
|
"entropy": 7.434175109863281,
|
|
"epoch": 0.23783783783783785,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 0.000438,
|
|
"loss": 7.3041847229003904,
|
|
"mean_token_accuracy": 0.07309759110212326,
|
|
"num_tokens": 535212.0,
|
|
"step": 220
|
|
},
|
|
{
|
|
"entropy": 7.340867042541504,
|
|
"epoch": 0.24324324324324326,
|
|
"grad_norm": 0.62890625,
|
|
"learning_rate": 0.000448,
|
|
"loss": 7.266801452636718,
|
|
"mean_token_accuracy": 0.07607424259185791,
|
|
"num_tokens": 546523.0,
|
|
"step": 225
|
|
},
|
|
{
|
|
"entropy": 7.232867050170898,
|
|
"epoch": 0.24864864864864866,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.000458,
|
|
"loss": 7.171680450439453,
|
|
"mean_token_accuracy": 0.07834560871124267,
|
|
"num_tokens": 558036.0,
|
|
"step": 230
|
|
},
|
|
{
|
|
"entropy": 7.411350154876709,
|
|
"epoch": 0.25405405405405407,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 0.00046800000000000005,
|
|
"loss": 7.248665618896484,
|
|
"mean_token_accuracy": 0.07751285135746003,
|
|
"num_tokens": 570324.0,
|
|
"step": 235
|
|
},
|
|
{
|
|
"entropy": 7.22170934677124,
|
|
"epoch": 0.2594594594594595,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 0.00047799999999999996,
|
|
"loss": 7.253816223144531,
|
|
"mean_token_accuracy": 0.07464860528707504,
|
|
"num_tokens": 582950.0,
|
|
"step": 240
|
|
},
|
|
{
|
|
"entropy": 7.243322372436523,
|
|
"epoch": 0.2648648648648649,
|
|
"grad_norm": 0.609375,
|
|
"learning_rate": 0.000488,
|
|
"loss": 7.149346923828125,
|
|
"mean_token_accuracy": 0.08247889876365662,
|
|
"num_tokens": 594081.0,
|
|
"step": 245
|
|
},
|
|
{
|
|
"entropy": 7.186726856231689,
|
|
"epoch": 0.2702702702702703,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 0.000498,
|
|
"loss": 7.139888000488281,
|
|
"mean_token_accuracy": 0.08595664352178574,
|
|
"num_tokens": 605251.0,
|
|
"step": 250
|
|
},
|
|
{
|
|
"entropy": 7.1818643569946286,
|
|
"epoch": 0.2756756756756757,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 0.000508,
|
|
"loss": 7.17196044921875,
|
|
"mean_token_accuracy": 0.08519582152366638,
|
|
"num_tokens": 617223.0,
|
|
"step": 255
|
|
},
|
|
{
|
|
"entropy": 7.080172061920166,
|
|
"epoch": 0.2810810810810811,
|
|
"grad_norm": 0.61328125,
|
|
"learning_rate": 0.000518,
|
|
"loss": 7.089189147949218,
|
|
"mean_token_accuracy": 0.08611884564161301,
|
|
"num_tokens": 628737.0,
|
|
"step": 260
|
|
},
|
|
{
|
|
"entropy": 7.147446060180664,
|
|
"epoch": 0.2864864864864865,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.000528,
|
|
"loss": 7.04461898803711,
|
|
"mean_token_accuracy": 0.08524503260850906,
|
|
"num_tokens": 639493.0,
|
|
"step": 265
|
|
},
|
|
{
|
|
"entropy": 7.0829826354980465,
|
|
"epoch": 0.2918918918918919,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 0.0005380000000000001,
|
|
"loss": 7.018182373046875,
|
|
"mean_token_accuracy": 0.09309226870536805,
|
|
"num_tokens": 651215.0,
|
|
"step": 270
|
|
},
|
|
{
|
|
"entropy": 7.080189990997314,
|
|
"epoch": 0.2972972972972973,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 0.0005480000000000001,
|
|
"loss": 7.054932403564453,
|
|
"mean_token_accuracy": 0.08287097811698914,
|
|
"num_tokens": 664644.0,
|
|
"step": 275
|
|
},
|
|
{
|
|
"entropy": 7.1431303977966305,
|
|
"epoch": 0.3027027027027027,
|
|
"grad_norm": 0.6484375,
|
|
"learning_rate": 0.000558,
|
|
"loss": 7.087598419189453,
|
|
"mean_token_accuracy": 0.0870475098490715,
|
|
"num_tokens": 677139.0,
|
|
"step": 280
|
|
},
|
|
{
|
|
"entropy": 7.185227966308593,
|
|
"epoch": 0.3081081081081081,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 0.0005679999999999999,
|
|
"loss": 7.17745361328125,
|
|
"mean_token_accuracy": 0.0867692619562149,
|
|
"num_tokens": 689894.0,
|
|
"step": 285
|
|
},
|
|
{
|
|
"entropy": 7.046064186096191,
|
|
"epoch": 0.31351351351351353,
|
|
"grad_norm": 0.63671875,
|
|
"learning_rate": 0.000578,
|
|
"loss": 7.0239204406738285,
|
|
"mean_token_accuracy": 0.09042058289051055,
|
|
"num_tokens": 702300.0,
|
|
"step": 290
|
|
},
|
|
{
|
|
"entropy": 7.150553798675537,
|
|
"epoch": 0.31891891891891894,
|
|
"grad_norm": 0.65625,
|
|
"learning_rate": 0.000588,
|
|
"loss": 7.063279724121093,
|
|
"mean_token_accuracy": 0.08882811665534973,
|
|
"num_tokens": 713190.0,
|
|
"step": 295
|
|
},
|
|
{
|
|
"entropy": 7.059144687652588,
|
|
"epoch": 0.32432432432432434,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 0.000598,
|
|
"loss": 6.94993896484375,
|
|
"mean_token_accuracy": 0.0942073032259941,
|
|
"num_tokens": 724322.0,
|
|
"step": 300
|
|
},
|
|
{
|
|
"entropy": 6.999932956695557,
|
|
"epoch": 0.32972972972972975,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 0.000608,
|
|
"loss": 6.929829406738281,
|
|
"mean_token_accuracy": 0.09061438292264938,
|
|
"num_tokens": 735779.0,
|
|
"step": 305
|
|
},
|
|
{
|
|
"entropy": 6.916056346893311,
|
|
"epoch": 0.33513513513513515,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 0.0006180000000000001,
|
|
"loss": 6.898499298095703,
|
|
"mean_token_accuracy": 0.09576145559549332,
|
|
"num_tokens": 746939.0,
|
|
"step": 310
|
|
},
|
|
{
|
|
"entropy": 6.874477195739746,
|
|
"epoch": 0.34054054054054056,
|
|
"grad_norm": 0.65234375,
|
|
"learning_rate": 0.000628,
|
|
"loss": 6.854414367675782,
|
|
"mean_token_accuracy": 0.09072280377149582,
|
|
"num_tokens": 758395.0,
|
|
"step": 315
|
|
},
|
|
{
|
|
"entropy": 7.106177234649659,
|
|
"epoch": 0.34594594594594597,
|
|
"grad_norm": 0.66015625,
|
|
"learning_rate": 0.000638,
|
|
"loss": 7.086619567871094,
|
|
"mean_token_accuracy": 0.09368456453084946,
|
|
"num_tokens": 770439.0,
|
|
"step": 320
|
|
},
|
|
{
|
|
"entropy": 7.064824867248535,
|
|
"epoch": 0.35135135135135137,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.000648,
|
|
"loss": 7.107695007324219,
|
|
"mean_token_accuracy": 0.08414219319820404,
|
|
"num_tokens": 786745.0,
|
|
"step": 325
|
|
},
|
|
{
|
|
"entropy": 6.824825382232666,
|
|
"epoch": 0.3567567567567568,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 0.0006580000000000001,
|
|
"loss": 6.873025512695312,
|
|
"mean_token_accuracy": 0.09536780565977096,
|
|
"num_tokens": 796900.0,
|
|
"step": 330
|
|
},
|
|
{
|
|
"entropy": 6.899827575683593,
|
|
"epoch": 0.3621621621621622,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0006680000000000001,
|
|
"loss": 6.8659309387207035,
|
|
"mean_token_accuracy": 0.09452889859676361,
|
|
"num_tokens": 808484.0,
|
|
"step": 335
|
|
},
|
|
{
|
|
"entropy": 7.07827615737915,
|
|
"epoch": 0.3675675675675676,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 0.0006780000000000001,
|
|
"loss": 7.063574981689453,
|
|
"mean_token_accuracy": 0.09114441871643067,
|
|
"num_tokens": 820125.0,
|
|
"step": 340
|
|
},
|
|
{
|
|
"entropy": 6.911789226531982,
|
|
"epoch": 0.372972972972973,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0006879999999999999,
|
|
"loss": 6.837258148193359,
|
|
"mean_token_accuracy": 0.10115662217140198,
|
|
"num_tokens": 831787.0,
|
|
"step": 345
|
|
},
|
|
{
|
|
"entropy": 6.751354217529297,
|
|
"epoch": 0.3783783783783784,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0006979999999999999,
|
|
"loss": 6.795095825195313,
|
|
"mean_token_accuracy": 0.10106057971715927,
|
|
"num_tokens": 842992.0,
|
|
"step": 350
|
|
},
|
|
{
|
|
"entropy": 6.851361846923828,
|
|
"epoch": 0.3837837837837838,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.000708,
|
|
"loss": 6.831424713134766,
|
|
"mean_token_accuracy": 0.0954001784324646,
|
|
"num_tokens": 855636.0,
|
|
"step": 355
|
|
},
|
|
{
|
|
"entropy": 6.8148805618286135,
|
|
"epoch": 0.3891891891891892,
|
|
"grad_norm": 0.6640625,
|
|
"learning_rate": 0.000718,
|
|
"loss": 6.837454986572266,
|
|
"mean_token_accuracy": 0.09592621475458145,
|
|
"num_tokens": 866664.0,
|
|
"step": 360
|
|
},
|
|
{
|
|
"entropy": 6.85852575302124,
|
|
"epoch": 0.3945945945945946,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 0.000728,
|
|
"loss": 6.818362426757813,
|
|
"mean_token_accuracy": 0.09673329740762711,
|
|
"num_tokens": 876702.0,
|
|
"step": 365
|
|
},
|
|
{
|
|
"entropy": 6.8342584609985355,
|
|
"epoch": 0.4,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.000738,
|
|
"loss": 6.828379058837891,
|
|
"mean_token_accuracy": 0.10096636265516282,
|
|
"num_tokens": 887866.0,
|
|
"step": 370
|
|
},
|
|
{
|
|
"entropy": 6.858696842193604,
|
|
"epoch": 0.40540540540540543,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 0.000748,
|
|
"loss": 6.872694396972657,
|
|
"mean_token_accuracy": 0.1039510726928711,
|
|
"num_tokens": 898200.0,
|
|
"step": 375
|
|
},
|
|
{
|
|
"entropy": 6.809317970275879,
|
|
"epoch": 0.41081081081081083,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 0.000758,
|
|
"loss": 6.88883056640625,
|
|
"mean_token_accuracy": 0.09990563690662384,
|
|
"num_tokens": 912550.0,
|
|
"step": 380
|
|
},
|
|
{
|
|
"entropy": 6.892767333984375,
|
|
"epoch": 0.41621621621621624,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 0.000768,
|
|
"loss": 6.792707824707032,
|
|
"mean_token_accuracy": 0.10181351602077485,
|
|
"num_tokens": 922728.0,
|
|
"step": 385
|
|
},
|
|
{
|
|
"entropy": 6.767278099060059,
|
|
"epoch": 0.42162162162162165,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.000778,
|
|
"loss": 6.740338134765625,
|
|
"mean_token_accuracy": 0.10379333794116974,
|
|
"num_tokens": 933323.0,
|
|
"step": 390
|
|
},
|
|
{
|
|
"entropy": 6.840473747253418,
|
|
"epoch": 0.42702702702702705,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0007880000000000001,
|
|
"loss": 6.9275146484375,
|
|
"mean_token_accuracy": 0.09510410130023957,
|
|
"num_tokens": 947864.0,
|
|
"step": 395
|
|
},
|
|
{
|
|
"entropy": 6.913839817047119,
|
|
"epoch": 0.43243243243243246,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0007980000000000001,
|
|
"loss": 6.987394714355469,
|
|
"mean_token_accuracy": 0.09437586069107055,
|
|
"num_tokens": 962042.0,
|
|
"step": 400
|
|
},
|
|
{
|
|
"entropy": 6.79087553024292,
|
|
"epoch": 0.43783783783783786,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.000808,
|
|
"loss": 6.878759765625,
|
|
"mean_token_accuracy": 0.10361665934324264,
|
|
"num_tokens": 977434.0,
|
|
"step": 405
|
|
},
|
|
{
|
|
"entropy": 6.740821361541748,
|
|
"epoch": 0.44324324324324327,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0008179999999999999,
|
|
"loss": 6.766633605957031,
|
|
"mean_token_accuracy": 0.10389182120561599,
|
|
"num_tokens": 989656.0,
|
|
"step": 410
|
|
},
|
|
{
|
|
"entropy": 6.853046607971192,
|
|
"epoch": 0.4486486486486487,
|
|
"grad_norm": 0.640625,
|
|
"learning_rate": 0.000828,
|
|
"loss": 6.767631530761719,
|
|
"mean_token_accuracy": 0.10301467031240463,
|
|
"num_tokens": 1000860.0,
|
|
"step": 415
|
|
},
|
|
{
|
|
"entropy": 6.734612083435058,
|
|
"epoch": 0.4540540540540541,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 0.000838,
|
|
"loss": 6.748469543457031,
|
|
"mean_token_accuracy": 0.10394396185874939,
|
|
"num_tokens": 1013873.0,
|
|
"step": 420
|
|
},
|
|
{
|
|
"entropy": 6.597353744506836,
|
|
"epoch": 0.4594594594594595,
|
|
"grad_norm": 0.67578125,
|
|
"learning_rate": 0.000848,
|
|
"loss": 6.686911010742188,
|
|
"mean_token_accuracy": 0.10376572757959365,
|
|
"num_tokens": 1026491.0,
|
|
"step": 425
|
|
},
|
|
{
|
|
"entropy": 6.775363540649414,
|
|
"epoch": 0.4648648648648649,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 0.000858,
|
|
"loss": 6.683805084228515,
|
|
"mean_token_accuracy": 0.10709702819585801,
|
|
"num_tokens": 1038482.0,
|
|
"step": 430
|
|
},
|
|
{
|
|
"entropy": 6.601847457885742,
|
|
"epoch": 0.4702702702702703,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 0.0008680000000000001,
|
|
"loss": 6.725534820556641,
|
|
"mean_token_accuracy": 0.10785069316625595,
|
|
"num_tokens": 1051344.0,
|
|
"step": 435
|
|
},
|
|
{
|
|
"entropy": 6.743765640258789,
|
|
"epoch": 0.4756756756756757,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.000878,
|
|
"loss": 6.694649505615234,
|
|
"mean_token_accuracy": 0.10876548141241074,
|
|
"num_tokens": 1061586.0,
|
|
"step": 440
|
|
},
|
|
{
|
|
"entropy": 6.715018367767334,
|
|
"epoch": 0.4810810810810811,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.000888,
|
|
"loss": 6.717233276367187,
|
|
"mean_token_accuracy": 0.10967092216014862,
|
|
"num_tokens": 1072086.0,
|
|
"step": 445
|
|
},
|
|
{
|
|
"entropy": 6.717541790008545,
|
|
"epoch": 0.4864864864864865,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.000898,
|
|
"loss": 6.69256591796875,
|
|
"mean_token_accuracy": 0.10869137644767761,
|
|
"num_tokens": 1084788.0,
|
|
"step": 450
|
|
},
|
|
{
|
|
"entropy": 6.390600490570068,
|
|
"epoch": 0.4918918918918919,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0009080000000000001,
|
|
"loss": 6.499176788330078,
|
|
"mean_token_accuracy": 0.11725788116455078,
|
|
"num_tokens": 1096558.0,
|
|
"step": 455
|
|
},
|
|
{
|
|
"entropy": 6.706469345092773,
|
|
"epoch": 0.4972972972972973,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.0009180000000000001,
|
|
"loss": 6.638755798339844,
|
|
"mean_token_accuracy": 0.11198882460594177,
|
|
"num_tokens": 1107370.0,
|
|
"step": 460
|
|
},
|
|
{
|
|
"entropy": 6.591896820068359,
|
|
"epoch": 0.5027027027027027,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0009280000000000001,
|
|
"loss": 6.637400817871094,
|
|
"mean_token_accuracy": 0.10757572948932648,
|
|
"num_tokens": 1120205.0,
|
|
"step": 465
|
|
},
|
|
{
|
|
"entropy": 6.832434177398682,
|
|
"epoch": 0.5081081081081081,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 0.0009379999999999999,
|
|
"loss": 6.848423767089844,
|
|
"mean_token_accuracy": 0.10572721362113953,
|
|
"num_tokens": 1135282.0,
|
|
"step": 470
|
|
},
|
|
{
|
|
"entropy": 6.580890464782715,
|
|
"epoch": 0.5135135135135135,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.000948,
|
|
"loss": 6.709358978271484,
|
|
"mean_token_accuracy": 0.10477431863546371,
|
|
"num_tokens": 1149554.0,
|
|
"step": 475
|
|
},
|
|
{
|
|
"entropy": 6.7246020317077635,
|
|
"epoch": 0.518918918918919,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.000958,
|
|
"loss": 6.709073638916015,
|
|
"mean_token_accuracy": 0.10875285863876342,
|
|
"num_tokens": 1161739.0,
|
|
"step": 480
|
|
},
|
|
{
|
|
"entropy": 6.6759847640991214,
|
|
"epoch": 0.5243243243243243,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 0.000968,
|
|
"loss": 6.595793914794922,
|
|
"mean_token_accuracy": 0.11315198093652726,
|
|
"num_tokens": 1173650.0,
|
|
"step": 485
|
|
},
|
|
{
|
|
"entropy": 6.549227523803711,
|
|
"epoch": 0.5297297297297298,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 0.000978,
|
|
"loss": 6.6798255920410154,
|
|
"mean_token_accuracy": 0.11241919845342636,
|
|
"num_tokens": 1185551.0,
|
|
"step": 490
|
|
},
|
|
{
|
|
"entropy": 6.744762134552002,
|
|
"epoch": 0.5351351351351351,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 0.000988,
|
|
"loss": 6.765760040283203,
|
|
"mean_token_accuracy": 0.106291264295578,
|
|
"num_tokens": 1199600.0,
|
|
"step": 495
|
|
},
|
|
{
|
|
"entropy": 6.61545238494873,
|
|
"epoch": 0.5405405405405406,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 0.000998,
|
|
"loss": 6.682843017578125,
|
|
"mean_token_accuracy": 0.10700990110635758,
|
|
"num_tokens": 1210465.0,
|
|
"step": 500
|
|
},
|
|
{
|
|
"entropy": 6.683747100830078,
|
|
"epoch": 0.5459459459459459,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0009999979169398642,
|
|
"loss": 6.590595245361328,
|
|
"mean_token_accuracy": 0.11202836632728577,
|
|
"num_tokens": 1221297.0,
|
|
"step": 505
|
|
},
|
|
{
|
|
"entropy": 6.556936645507813,
|
|
"epoch": 0.5513513513513514,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 0.0009999894545411141,
|
|
"loss": 6.64039306640625,
|
|
"mean_token_accuracy": 0.10924990326166154,
|
|
"num_tokens": 1233805.0,
|
|
"step": 510
|
|
},
|
|
{
|
|
"entropy": 6.645992183685303,
|
|
"epoch": 0.5567567567567567,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0009999744827348116,
|
|
"loss": 6.720680236816406,
|
|
"mean_token_accuracy": 0.10662575513124466,
|
|
"num_tokens": 1245747.0,
|
|
"step": 515
|
|
},
|
|
{
|
|
"entropy": 6.560120868682861,
|
|
"epoch": 0.5621621621621622,
|
|
"grad_norm": 0.61328125,
|
|
"learning_rate": 0.0009999530017375344,
|
|
"loss": 6.516216278076172,
|
|
"mean_token_accuracy": 0.12112323045730591,
|
|
"num_tokens": 1257310.0,
|
|
"step": 520
|
|
},
|
|
{
|
|
"entropy": 6.676382350921631,
|
|
"epoch": 0.5675675675675675,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0009999250118600195,
|
|
"loss": 6.705149841308594,
|
|
"mean_token_accuracy": 0.11206594407558441,
|
|
"num_tokens": 1269216.0,
|
|
"step": 525
|
|
},
|
|
{
|
|
"entropy": 6.643038272857666,
|
|
"epoch": 0.572972972972973,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 0.0009998905135071602,
|
|
"loss": 6.58680419921875,
|
|
"mean_token_accuracy": 0.11697860062122345,
|
|
"num_tokens": 1279711.0,
|
|
"step": 530
|
|
},
|
|
{
|
|
"entropy": 6.546832656860351,
|
|
"epoch": 0.5783783783783784,
|
|
"grad_norm": 0.66015625,
|
|
"learning_rate": 0.0009998495071779987,
|
|
"loss": 6.6342926025390625,
|
|
"mean_token_accuracy": 0.11330044567584992,
|
|
"num_tokens": 1292958.0,
|
|
"step": 535
|
|
},
|
|
{
|
|
"entropy": 6.735915756225586,
|
|
"epoch": 0.5837837837837838,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 0.0009998019934657199,
|
|
"loss": 6.7581428527832035,
|
|
"mean_token_accuracy": 0.11686633378267289,
|
|
"num_tokens": 1304082.0,
|
|
"step": 540
|
|
},
|
|
{
|
|
"entropy": 6.588940620422363,
|
|
"epoch": 0.5891891891891892,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0009997479730576423,
|
|
"loss": 6.639595794677734,
|
|
"mean_token_accuracy": 0.11487565338611602,
|
|
"num_tokens": 1315789.0,
|
|
"step": 545
|
|
},
|
|
{
|
|
"entropy": 6.542739009857177,
|
|
"epoch": 0.5945945945945946,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 0.0009996874467352087,
|
|
"loss": 6.549444580078125,
|
|
"mean_token_accuracy": 0.11959983855485916,
|
|
"num_tokens": 1327191.0,
|
|
"step": 550
|
|
},
|
|
{
|
|
"entropy": 6.606736755371093,
|
|
"epoch": 0.6,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 0.0009996204153739734,
|
|
"loss": 6.549032592773438,
|
|
"mean_token_accuracy": 0.12100645154714584,
|
|
"num_tokens": 1338645.0,
|
|
"step": 555
|
|
},
|
|
{
|
|
"entropy": 6.521855735778809,
|
|
"epoch": 0.6054054054054054,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 0.0009995468799435915,
|
|
"loss": 6.569098663330078,
|
|
"mean_token_accuracy": 0.11854373812675476,
|
|
"num_tokens": 1349881.0,
|
|
"step": 560
|
|
},
|
|
{
|
|
"entropy": 6.549165916442871,
|
|
"epoch": 0.6108108108108108,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 0.000999466841507804,
|
|
"loss": 6.494113159179688,
|
|
"mean_token_accuracy": 0.12339054346084595,
|
|
"num_tokens": 1361468.0,
|
|
"step": 565
|
|
},
|
|
{
|
|
"entropy": 6.537939643859863,
|
|
"epoch": 0.6162162162162163,
|
|
"grad_norm": 0.6640625,
|
|
"learning_rate": 0.0009993803012244217,
|
|
"loss": 6.537962341308594,
|
|
"mean_token_accuracy": 0.11801687628030777,
|
|
"num_tokens": 1373363.0,
|
|
"step": 570
|
|
},
|
|
{
|
|
"entropy": 6.479009532928467,
|
|
"epoch": 0.6216216216216216,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0009992872603453097,
|
|
"loss": 6.545735168457031,
|
|
"mean_token_accuracy": 0.11801871210336685,
|
|
"num_tokens": 1385614.0,
|
|
"step": 575
|
|
},
|
|
{
|
|
"entropy": 6.627403926849365,
|
|
"epoch": 0.6270270270270271,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 0.000999187720216368,
|
|
"loss": 6.656562805175781,
|
|
"mean_token_accuracy": 0.11987384706735611,
|
|
"num_tokens": 1398553.0,
|
|
"step": 580
|
|
},
|
|
{
|
|
"entropy": 6.601816844940186,
|
|
"epoch": 0.6324324324324324,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 0.0009990816822775135,
|
|
"loss": 6.55546875,
|
|
"mean_token_accuracy": 0.1271597623825073,
|
|
"num_tokens": 1409953.0,
|
|
"step": 585
|
|
},
|
|
{
|
|
"entropy": 6.650836849212647,
|
|
"epoch": 0.6378378378378379,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 0.000998969148062658,
|
|
"loss": 6.66297607421875,
|
|
"mean_token_accuracy": 0.11517720967531205,
|
|
"num_tokens": 1423190.0,
|
|
"step": 590
|
|
},
|
|
{
|
|
"entropy": 6.5727849960327145,
|
|
"epoch": 0.6432432432432432,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 0.0009988501191996863,
|
|
"loss": 6.533869934082031,
|
|
"mean_token_accuracy": 0.12116028219461442,
|
|
"num_tokens": 1434088.0,
|
|
"step": 595
|
|
},
|
|
{
|
|
"entropy": 6.3762282371521,
|
|
"epoch": 0.6486486486486487,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 0.0009987245974104333,
|
|
"loss": 6.47516098022461,
|
|
"mean_token_accuracy": 0.1226390540599823,
|
|
"num_tokens": 1447355.0,
|
|
"step": 600
|
|
},
|
|
{
|
|
"entropy": 6.464574718475342,
|
|
"epoch": 0.654054054054054,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0009985925845106577,
|
|
"loss": 6.44190673828125,
|
|
"mean_token_accuracy": 0.12635250836610795,
|
|
"num_tokens": 1458581.0,
|
|
"step": 605
|
|
},
|
|
{
|
|
"entropy": 6.3286590576171875,
|
|
"epoch": 0.6594594594594595,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 0.0009984540824100174,
|
|
"loss": 6.349403762817383,
|
|
"mean_token_accuracy": 0.12394919246435165,
|
|
"num_tokens": 1469271.0,
|
|
"step": 610
|
|
},
|
|
{
|
|
"entropy": 6.5246072769165036,
|
|
"epoch": 0.6648648648648648,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 0.0009983090931120408,
|
|
"loss": 6.45703125,
|
|
"mean_token_accuracy": 0.12573732286691666,
|
|
"num_tokens": 1480424.0,
|
|
"step": 615
|
|
},
|
|
{
|
|
"entropy": 6.471957397460938,
|
|
"epoch": 0.6702702702702703,
|
|
"grad_norm": 0.66796875,
|
|
"learning_rate": 0.0009981576187140977,
|
|
"loss": 6.520024108886719,
|
|
"mean_token_accuracy": 0.11777724027633667,
|
|
"num_tokens": 1493735.0,
|
|
"step": 620
|
|
},
|
|
{
|
|
"entropy": 6.543122959136963,
|
|
"epoch": 0.6756756756756757,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 0.00099799966140737,
|
|
"loss": 6.515281677246094,
|
|
"mean_token_accuracy": 0.11840547770261764,
|
|
"num_tokens": 1507102.0,
|
|
"step": 625
|
|
},
|
|
{
|
|
"entropy": 6.470473766326904,
|
|
"epoch": 0.6810810810810811,
|
|
"grad_norm": 0.71484375,
|
|
"learning_rate": 0.0009978352234768185,
|
|
"loss": 6.454793548583984,
|
|
"mean_token_accuracy": 0.12399042546749114,
|
|
"num_tokens": 1518558.0,
|
|
"step": 630
|
|
},
|
|
{
|
|
"entropy": 6.380885028839112,
|
|
"epoch": 0.6864864864864865,
|
|
"grad_norm": 0.63671875,
|
|
"learning_rate": 0.0009976643073011516,
|
|
"loss": 6.444398498535156,
|
|
"mean_token_accuracy": 0.1253846377134323,
|
|
"num_tokens": 1531262.0,
|
|
"step": 635
|
|
},
|
|
{
|
|
"entropy": 6.53573751449585,
|
|
"epoch": 0.6918918918918919,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0009974869153527893,
|
|
"loss": 6.399496459960938,
|
|
"mean_token_accuracy": 0.12655056715011598,
|
|
"num_tokens": 1541964.0,
|
|
"step": 640
|
|
},
|
|
{
|
|
"entropy": 6.5604249954223635,
|
|
"epoch": 0.6972972972972973,
|
|
"grad_norm": 0.6484375,
|
|
"learning_rate": 0.0009973030501978287,
|
|
"loss": 6.581614685058594,
|
|
"mean_token_accuracy": 0.12558400630950928,
|
|
"num_tokens": 1554347.0,
|
|
"step": 645
|
|
},
|
|
{
|
|
"entropy": 6.4987060546875,
|
|
"epoch": 0.7027027027027027,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0009971127144960056,
|
|
"loss": 6.543399047851563,
|
|
"mean_token_accuracy": 0.11906942576169968,
|
|
"num_tokens": 1565717.0,
|
|
"step": 650
|
|
},
|
|
{
|
|
"entropy": 6.46410551071167,
|
|
"epoch": 0.7081081081081081,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.0009969159110006574,
|
|
"loss": 6.444772338867187,
|
|
"mean_token_accuracy": 0.12645898312330245,
|
|
"num_tokens": 1579868.0,
|
|
"step": 655
|
|
},
|
|
{
|
|
"entropy": 6.5014301300048825,
|
|
"epoch": 0.7135135135135136,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 0.0009967126425586821,
|
|
"loss": 6.587330627441406,
|
|
"mean_token_accuracy": 0.11874048858880996,
|
|
"num_tokens": 1593391.0,
|
|
"step": 660
|
|
},
|
|
{
|
|
"entropy": 6.543860626220703,
|
|
"epoch": 0.7189189189189189,
|
|
"grad_norm": 0.67578125,
|
|
"learning_rate": 0.0009965029121104978,
|
|
"loss": 6.405085754394531,
|
|
"mean_token_accuracy": 0.12694377601146697,
|
|
"num_tokens": 1604787.0,
|
|
"step": 665
|
|
},
|
|
{
|
|
"entropy": 6.407235908508301,
|
|
"epoch": 0.7243243243243244,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0009962867226900002,
|
|
"loss": 6.4062744140625,
|
|
"mean_token_accuracy": 0.13111316710710524,
|
|
"num_tokens": 1616824.0,
|
|
"step": 670
|
|
},
|
|
{
|
|
"entropy": 6.452020835876465,
|
|
"epoch": 0.7297297297297297,
|
|
"grad_norm": 0.66015625,
|
|
"learning_rate": 0.0009960640774245178,
|
|
"loss": 6.551805877685547,
|
|
"mean_token_accuracy": 0.12295851409435272,
|
|
"num_tokens": 1630342.0,
|
|
"step": 675
|
|
},
|
|
{
|
|
"entropy": 6.499637317657471,
|
|
"epoch": 0.7351351351351352,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 0.000995834979534768,
|
|
"loss": 6.363913345336914,
|
|
"mean_token_accuracy": 0.12563441097736358,
|
|
"num_tokens": 1641408.0,
|
|
"step": 680
|
|
},
|
|
{
|
|
"entropy": 6.448514842987061,
|
|
"epoch": 0.7405405405405405,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 0.0009955994323348099,
|
|
"loss": 6.408490753173828,
|
|
"mean_token_accuracy": 0.1317383110523224,
|
|
"num_tokens": 1651883.0,
|
|
"step": 685
|
|
},
|
|
{
|
|
"entropy": 6.435086631774903,
|
|
"epoch": 0.745945945945946,
|
|
"grad_norm": 0.64453125,
|
|
"learning_rate": 0.0009953574392319957,
|
|
"loss": 6.545511627197266,
|
|
"mean_token_accuracy": 0.1223674014210701,
|
|
"num_tokens": 1664072.0,
|
|
"step": 690
|
|
},
|
|
{
|
|
"entropy": 6.510448932647705,
|
|
"epoch": 0.7513513513513513,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 0.0009951090037269227,
|
|
"loss": 6.41370849609375,
|
|
"mean_token_accuracy": 0.1299304783344269,
|
|
"num_tokens": 1674700.0,
|
|
"step": 695
|
|
},
|
|
{
|
|
"entropy": 6.48358678817749,
|
|
"epoch": 0.7567567567567568,
|
|
"grad_norm": 0.6171875,
|
|
"learning_rate": 0.0009948541294133814,
|
|
"loss": 6.419948577880859,
|
|
"mean_token_accuracy": 0.12766341418027877,
|
|
"num_tokens": 1686904.0,
|
|
"step": 700
|
|
},
|
|
{
|
|
"entropy": 6.349936676025391,
|
|
"epoch": 0.7621621621621621,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0009945928199783045,
|
|
"loss": 6.360983276367188,
|
|
"mean_token_accuracy": 0.12935958206653594,
|
|
"num_tokens": 1697405.0,
|
|
"step": 705
|
|
},
|
|
{
|
|
"entropy": 6.458889198303223,
|
|
"epoch": 0.7675675675675676,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.000994325079201713,
|
|
"loss": 6.436622619628906,
|
|
"mean_token_accuracy": 0.1231964647769928,
|
|
"num_tokens": 1710080.0,
|
|
"step": 710
|
|
},
|
|
{
|
|
"entropy": 6.387947845458984,
|
|
"epoch": 0.772972972972973,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 0.000994050910956662,
|
|
"loss": 6.422445678710938,
|
|
"mean_token_accuracy": 0.12537443786859512,
|
|
"num_tokens": 1720806.0,
|
|
"step": 715
|
|
},
|
|
{
|
|
"entropy": 6.53485517501831,
|
|
"epoch": 0.7783783783783784,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0009937703192091838,
|
|
"loss": 6.561003112792969,
|
|
"mean_token_accuracy": 0.12541060745716096,
|
|
"num_tokens": 1733954.0,
|
|
"step": 720
|
|
},
|
|
{
|
|
"entropy": 6.565542984008789,
|
|
"epoch": 0.7837837837837838,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0009934833080182312,
|
|
"loss": 6.664936828613281,
|
|
"mean_token_accuracy": 0.11592512726783752,
|
|
"num_tokens": 1750530.0,
|
|
"step": 725
|
|
},
|
|
{
|
|
"entropy": 6.544071006774902,
|
|
"epoch": 0.7891891891891892,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.0009931898815356195,
|
|
"loss": 6.30921516418457,
|
|
"mean_token_accuracy": 0.13176991939544677,
|
|
"num_tokens": 1761753.0,
|
|
"step": 730
|
|
},
|
|
{
|
|
"entropy": 6.328976345062256,
|
|
"epoch": 0.7945945945945946,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0009928900440059642,
|
|
"loss": 6.360004425048828,
|
|
"mean_token_accuracy": 0.1312493145465851,
|
|
"num_tokens": 1774628.0,
|
|
"step": 735
|
|
},
|
|
{
|
|
"entropy": 6.464595794677734,
|
|
"epoch": 0.8,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0009925837997666225,
|
|
"loss": 6.57813720703125,
|
|
"mean_token_accuracy": 0.11741591542959214,
|
|
"num_tokens": 1788735.0,
|
|
"step": 740
|
|
},
|
|
{
|
|
"entropy": 6.5051695823669435,
|
|
"epoch": 0.8054054054054054,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 0.000992271153247628,
|
|
"loss": 6.288795471191406,
|
|
"mean_token_accuracy": 0.12631202042102813,
|
|
"num_tokens": 1800014.0,
|
|
"step": 745
|
|
},
|
|
{
|
|
"entropy": 6.274956226348877,
|
|
"epoch": 0.8108108108108109,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 0.000991952108971628,
|
|
"loss": 6.370751953125,
|
|
"mean_token_accuracy": 0.12875936627388002,
|
|
"num_tokens": 1813103.0,
|
|
"step": 750
|
|
},
|
|
{
|
|
"entropy": 6.399552536010742,
|
|
"epoch": 0.8162162162162162,
|
|
"grad_norm": 0.65234375,
|
|
"learning_rate": 0.000991626671553818,
|
|
"loss": 6.457389831542969,
|
|
"mean_token_accuracy": 0.12979597598314285,
|
|
"num_tokens": 1826686.0,
|
|
"step": 755
|
|
},
|
|
{
|
|
"entropy": 6.470718097686768,
|
|
"epoch": 0.8216216216216217,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 0.0009912948457018744,
|
|
"loss": 6.337436676025391,
|
|
"mean_token_accuracy": 0.13230464309453965,
|
|
"num_tokens": 1836998.0,
|
|
"step": 760
|
|
},
|
|
{
|
|
"entropy": 6.344214057922363,
|
|
"epoch": 0.827027027027027,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.000990956636215887,
|
|
"loss": 6.333858489990234,
|
|
"mean_token_accuracy": 0.1353505551815033,
|
|
"num_tokens": 1847374.0,
|
|
"step": 765
|
|
},
|
|
{
|
|
"entropy": 6.359791374206543,
|
|
"epoch": 0.8324324324324325,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 0.0009906120479882886,
|
|
"loss": 6.3227790832519535,
|
|
"mean_token_accuracy": 0.1333004355430603,
|
|
"num_tokens": 1858150.0,
|
|
"step": 770
|
|
},
|
|
{
|
|
"entropy": 6.303346157073975,
|
|
"epoch": 0.8378378378378378,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 0.0009902610860037858,
|
|
"loss": 6.3098808288574215,
|
|
"mean_token_accuracy": 0.13155746459960938,
|
|
"num_tokens": 1869918.0,
|
|
"step": 775
|
|
},
|
|
{
|
|
"entropy": 6.387551975250244,
|
|
"epoch": 0.8432432432432433,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 0.0009899037553392854,
|
|
"loss": 6.361277389526367,
|
|
"mean_token_accuracy": 0.1288209542632103,
|
|
"num_tokens": 1881370.0,
|
|
"step": 780
|
|
},
|
|
{
|
|
"entropy": 6.42662878036499,
|
|
"epoch": 0.8486486486486486,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0009895400611638217,
|
|
"loss": 6.373783874511719,
|
|
"mean_token_accuracy": 0.13027686178684234,
|
|
"num_tokens": 1894290.0,
|
|
"step": 785
|
|
},
|
|
{
|
|
"entropy": 6.364730930328369,
|
|
"epoch": 0.8540540540540541,
|
|
"grad_norm": 0.62109375,
|
|
"learning_rate": 0.0009891700087384817,
|
|
"loss": 6.312982177734375,
|
|
"mean_token_accuracy": 0.12889572829008103,
|
|
"num_tokens": 1906844.0,
|
|
"step": 790
|
|
},
|
|
{
|
|
"entropy": 6.3491747856140135,
|
|
"epoch": 0.8594594594594595,
|
|
"grad_norm": 0.6640625,
|
|
"learning_rate": 0.0009887936034163286,
|
|
"loss": 6.410205078125,
|
|
"mean_token_accuracy": 0.13014759868383408,
|
|
"num_tokens": 1920582.0,
|
|
"step": 795
|
|
},
|
|
{
|
|
"entropy": 6.388109493255615,
|
|
"epoch": 0.8648648648648649,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 0.000988410850642325,
|
|
"loss": 6.3361869812011715,
|
|
"mean_token_accuracy": 0.1333713099360466,
|
|
"num_tokens": 1933269.0,
|
|
"step": 800
|
|
},
|
|
{
|
|
"entropy": 6.265689182281494,
|
|
"epoch": 0.8702702702702703,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.000988021755953253,
|
|
"loss": 6.249768447875977,
|
|
"mean_token_accuracy": 0.1422581344842911,
|
|
"num_tokens": 1944152.0,
|
|
"step": 805
|
|
},
|
|
{
|
|
"entropy": 6.4430389404296875,
|
|
"epoch": 0.8756756756756757,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.000987626324977636,
|
|
"loss": 6.367038726806641,
|
|
"mean_token_accuracy": 0.13419689387083053,
|
|
"num_tokens": 1955710.0,
|
|
"step": 810
|
|
},
|
|
{
|
|
"entropy": 6.3380763053894045,
|
|
"epoch": 0.8810810810810811,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 0.0009872245634356554,
|
|
"loss": 6.311883544921875,
|
|
"mean_token_accuracy": 0.1359546884894371,
|
|
"num_tokens": 1967113.0,
|
|
"step": 815
|
|
},
|
|
{
|
|
"entropy": 6.3658100128173825,
|
|
"epoch": 0.8864864864864865,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 0.0009868164771390687,
|
|
"loss": 6.33122444152832,
|
|
"mean_token_accuracy": 0.13497747331857682,
|
|
"num_tokens": 1977560.0,
|
|
"step": 820
|
|
},
|
|
{
|
|
"entropy": 6.46645040512085,
|
|
"epoch": 0.8918918918918919,
|
|
"grad_norm": 0.66796875,
|
|
"learning_rate": 0.000986402071991125,
|
|
"loss": 6.378009414672851,
|
|
"mean_token_accuracy": 0.13366190791130067,
|
|
"num_tokens": 1989667.0,
|
|
"step": 825
|
|
},
|
|
{
|
|
"entropy": 6.378485488891601,
|
|
"epoch": 0.8972972972972973,
|
|
"grad_norm": 0.6640625,
|
|
"learning_rate": 0.0009859813539864811,
|
|
"loss": 6.45841064453125,
|
|
"mean_token_accuracy": 0.131469164788723,
|
|
"num_tokens": 2003856.0,
|
|
"step": 830
|
|
},
|
|
{
|
|
"entropy": 6.371240234375,
|
|
"epoch": 0.9027027027027027,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 0.0009855543292111124,
|
|
"loss": 6.337836074829101,
|
|
"mean_token_accuracy": 0.13160819709300994,
|
|
"num_tokens": 2016349.0,
|
|
"step": 835
|
|
},
|
|
{
|
|
"entropy": 6.509719371795654,
|
|
"epoch": 0.9081081081081082,
|
|
"grad_norm": 0.67578125,
|
|
"learning_rate": 0.0009851210038422265,
|
|
"loss": 6.411936950683594,
|
|
"mean_token_accuracy": 0.1332993596792221,
|
|
"num_tokens": 2028246.0,
|
|
"step": 840
|
|
},
|
|
{
|
|
"entropy": 6.258156967163086,
|
|
"epoch": 0.9135135135135135,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 0.0009846813841481736,
|
|
"loss": 6.273184204101563,
|
|
"mean_token_accuracy": 0.13781181275844573,
|
|
"num_tokens": 2040826.0,
|
|
"step": 845
|
|
},
|
|
{
|
|
"entropy": 6.449979686737061,
|
|
"epoch": 0.918918918918919,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0009842354764883557,
|
|
"loss": 6.402044677734375,
|
|
"mean_token_accuracy": 0.1293553426861763,
|
|
"num_tokens": 2056179.0,
|
|
"step": 850
|
|
},
|
|
{
|
|
"entropy": 6.307137584686279,
|
|
"epoch": 0.9243243243243243,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 0.000983783287313134,
|
|
"loss": 6.248806762695312,
|
|
"mean_token_accuracy": 0.13388172090053557,
|
|
"num_tokens": 2066742.0,
|
|
"step": 855
|
|
},
|
|
{
|
|
"entropy": 6.367336559295654,
|
|
"epoch": 0.9297297297297298,
|
|
"grad_norm": 0.66796875,
|
|
"learning_rate": 0.0009833248231637367,
|
|
"loss": 6.317116928100586,
|
|
"mean_token_accuracy": 0.13678575158119202,
|
|
"num_tokens": 2078785.0,
|
|
"step": 860
|
|
},
|
|
{
|
|
"entropy": 6.318039798736573,
|
|
"epoch": 0.9351351351351351,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 0.000982860090672164,
|
|
"loss": 6.280033111572266,
|
|
"mean_token_accuracy": 0.13033719807863237,
|
|
"num_tokens": 2090347.0,
|
|
"step": 865
|
|
},
|
|
{
|
|
"entropy": 6.305841064453125,
|
|
"epoch": 0.9405405405405406,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 0.000982389096561091,
|
|
"loss": 6.2948463439941404,
|
|
"mean_token_accuracy": 0.1338719367980957,
|
|
"num_tokens": 2101826.0,
|
|
"step": 870
|
|
},
|
|
{
|
|
"entropy": 6.360739135742188,
|
|
"epoch": 0.9459459459459459,
|
|
"grad_norm": 0.65625,
|
|
"learning_rate": 0.0009819118476437723,
|
|
"loss": 6.319264984130859,
|
|
"mean_token_accuracy": 0.13714499771595,
|
|
"num_tokens": 2114202.0,
|
|
"step": 875
|
|
},
|
|
{
|
|
"entropy": 6.401810359954834,
|
|
"epoch": 0.9513513513513514,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 0.0009814283508239425,
|
|
"loss": 6.290205764770508,
|
|
"mean_token_accuracy": 0.13513725101947785,
|
|
"num_tokens": 2126079.0,
|
|
"step": 880
|
|
},
|
|
{
|
|
"entropy": 6.2628508567810055,
|
|
"epoch": 0.9567567567567568,
|
|
"grad_norm": 0.640625,
|
|
"learning_rate": 0.0009809386130957163,
|
|
"loss": 6.299491119384766,
|
|
"mean_token_accuracy": 0.13721458315849305,
|
|
"num_tokens": 2137644.0,
|
|
"step": 885
|
|
},
|
|
{
|
|
"entropy": 6.1556120872497555,
|
|
"epoch": 0.9621621621621622,
|
|
"grad_norm": 0.62890625,
|
|
"learning_rate": 0.0009804426415434876,
|
|
"loss": 6.129010009765625,
|
|
"mean_token_accuracy": 0.1369076371192932,
|
|
"num_tokens": 2152630.0,
|
|
"step": 890
|
|
},
|
|
{
|
|
"entropy": 6.2799969673156735,
|
|
"epoch": 0.9675675675675676,
|
|
"grad_norm": 0.66796875,
|
|
"learning_rate": 0.0009799404433418262,
|
|
"loss": 6.228973388671875,
|
|
"mean_token_accuracy": 0.1327817440032959,
|
|
"num_tokens": 2163879.0,
|
|
"step": 895
|
|
},
|
|
{
|
|
"entropy": 6.331386756896973,
|
|
"epoch": 0.972972972972973,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 0.0009794320257553754,
|
|
"loss": 6.3436279296875,
|
|
"mean_token_accuracy": 0.12582612037658691,
|
|
"num_tokens": 2176772.0,
|
|
"step": 900
|
|
},
|
|
{
|
|
"entropy": 6.305329990386963,
|
|
"epoch": 0.9783783783783784,
|
|
"grad_norm": 0.64453125,
|
|
"learning_rate": 0.0009789173961387459,
|
|
"loss": 6.2147876739501955,
|
|
"mean_token_accuracy": 0.13565244078636168,
|
|
"num_tokens": 2188697.0,
|
|
"step": 905
|
|
},
|
|
{
|
|
"entropy": 6.253271961212159,
|
|
"epoch": 0.9837837837837838,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 0.00097839656193641,
|
|
"loss": 6.213663482666016,
|
|
"mean_token_accuracy": 0.1317826598882675,
|
|
"num_tokens": 2201905.0,
|
|
"step": 910
|
|
},
|
|
{
|
|
"entropy": 6.174108409881592,
|
|
"epoch": 0.9891891891891892,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 0.000977869530682593,
|
|
"loss": 6.149724960327148,
|
|
"mean_token_accuracy": 0.14030847251415252,
|
|
"num_tokens": 2211502.0,
|
|
"step": 915
|
|
},
|
|
{
|
|
"entropy": 6.269680404663086,
|
|
"epoch": 0.9945945945945946,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 0.0009773363100011655,
|
|
"loss": 6.259825134277344,
|
|
"mean_token_accuracy": 0.13248875439167024,
|
|
"num_tokens": 2223560.0,
|
|
"step": 920
|
|
},
|
|
{
|
|
"entropy": 6.303800010681153,
|
|
"epoch": 1.0,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0009767969076055316,
|
|
"loss": 6.259091186523437,
|
|
"mean_token_accuracy": 0.1379597917199135,
|
|
"num_tokens": 2232668.0,
|
|
"step": 925
|
|
},
|
|
{
|
|
"entropy": 6.247701930999756,
|
|
"epoch": 1.0054054054054054,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 0.0009762513312985191,
|
|
"loss": 6.087086486816406,
|
|
"mean_token_accuracy": 0.14642732441425324,
|
|
"num_tokens": 2243410.0,
|
|
"step": 930
|
|
},
|
|
{
|
|
"entropy": 6.207428741455078,
|
|
"epoch": 1.0108108108108107,
|
|
"grad_norm": 0.671875,
|
|
"learning_rate": 0.0009756995889722652,
|
|
"loss": 6.115195083618164,
|
|
"mean_token_accuracy": 0.13871956765651702,
|
|
"num_tokens": 2255343.0,
|
|
"step": 935
|
|
},
|
|
{
|
|
"entropy": 6.0995192527771,
|
|
"epoch": 1.0162162162162163,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0009751416886081027,
|
|
"loss": 6.043392181396484,
|
|
"mean_token_accuracy": 0.14625563025474547,
|
|
"num_tokens": 2267196.0,
|
|
"step": 940
|
|
},
|
|
{
|
|
"entropy": 6.204872989654541,
|
|
"epoch": 1.0216216216216216,
|
|
"grad_norm": 0.71875,
|
|
"learning_rate": 0.0009745776382764448,
|
|
"loss": 6.183137130737305,
|
|
"mean_token_accuracy": 0.13658826649188996,
|
|
"num_tokens": 2278936.0,
|
|
"step": 945
|
|
},
|
|
{
|
|
"entropy": 6.228440189361573,
|
|
"epoch": 1.027027027027027,
|
|
"grad_norm": 0.671875,
|
|
"learning_rate": 0.0009740074461366686,
|
|
"loss": 6.062003326416016,
|
|
"mean_token_accuracy": 0.14350597262382508,
|
|
"num_tokens": 2289300.0,
|
|
"step": 950
|
|
},
|
|
{
|
|
"entropy": 6.182377719879151,
|
|
"epoch": 1.0324324324324325,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 0.0009734311204369957,
|
|
"loss": 6.08958740234375,
|
|
"mean_token_accuracy": 0.14562293589115144,
|
|
"num_tokens": 2301601.0,
|
|
"step": 955
|
|
},
|
|
{
|
|
"entropy": 6.017007541656494,
|
|
"epoch": 1.037837837837838,
|
|
"grad_norm": 0.66796875,
|
|
"learning_rate": 0.0009728486695143753,
|
|
"loss": 5.978137969970703,
|
|
"mean_token_accuracy": 0.14870022535324096,
|
|
"num_tokens": 2313130.0,
|
|
"step": 960
|
|
},
|
|
{
|
|
"entropy": 6.3585821151733395,
|
|
"epoch": 1.0432432432432432,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0009722601017943607,
|
|
"loss": 6.260755920410157,
|
|
"mean_token_accuracy": 0.13717263340950012,
|
|
"num_tokens": 2326413.0,
|
|
"step": 965
|
|
},
|
|
{
|
|
"entropy": 6.145228576660156,
|
|
"epoch": 1.0486486486486486,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 0.0009716654257909897,
|
|
"loss": 6.0943046569824215,
|
|
"mean_token_accuracy": 0.14415099322795868,
|
|
"num_tokens": 2337603.0,
|
|
"step": 970
|
|
},
|
|
{
|
|
"entropy": 6.234020233154297,
|
|
"epoch": 1.054054054054054,
|
|
"grad_norm": 0.69140625,
|
|
"learning_rate": 0.0009710646501066608,
|
|
"loss": 6.181568908691406,
|
|
"mean_token_accuracy": 0.13601263910531997,
|
|
"num_tokens": 2352321.0,
|
|
"step": 975
|
|
},
|
|
{
|
|
"entropy": 6.0668079376220705,
|
|
"epoch": 1.0594594594594595,
|
|
"grad_norm": 0.6953125,
|
|
"learning_rate": 0.0009704577834320078,
|
|
"loss": 6.049177932739258,
|
|
"mean_token_accuracy": 0.15185949206352234,
|
|
"num_tokens": 2363432.0,
|
|
"step": 980
|
|
},
|
|
{
|
|
"entropy": 6.228795528411865,
|
|
"epoch": 1.0648648648648649,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 0.0009698448345457758,
|
|
"loss": 6.067817687988281,
|
|
"mean_token_accuracy": 0.14404682517051698,
|
|
"num_tokens": 2374188.0,
|
|
"step": 985
|
|
},
|
|
{
|
|
"entropy": 6.257656669616699,
|
|
"epoch": 1.0702702702702702,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 0.0009692258123146925,
|
|
"loss": 6.195977783203125,
|
|
"mean_token_accuracy": 0.13717207163572312,
|
|
"num_tokens": 2386344.0,
|
|
"step": 990
|
|
},
|
|
{
|
|
"entropy": 6.229287624359131,
|
|
"epoch": 1.0756756756756758,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 0.0009686007256933414,
|
|
"loss": 6.20872802734375,
|
|
"mean_token_accuracy": 0.1379612296819687,
|
|
"num_tokens": 2399518.0,
|
|
"step": 995
|
|
},
|
|
{
|
|
"entropy": 6.284945487976074,
|
|
"epoch": 1.0810810810810811,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0009679695837240308,
|
|
"loss": 6.145904541015625,
|
|
"mean_token_accuracy": 0.14310452789068223,
|
|
"num_tokens": 2413738.0,
|
|
"step": 1000
|
|
}
|
|
],
|
|
"logging_steps": 5,
|
|
"max_steps": 4630,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 6,
|
|
"save_steps": 1000,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": false
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 907806572052480.0,
|
|
"train_batch_size": 32,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|