1875 lines
55 KiB
JSON
1875 lines
55 KiB
JSON
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 2.0,
|
|
"eval_steps": 500,
|
|
"global_step": 9248,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"entropy": 1.5345972868800164,
|
|
"epoch": 0.010813733441470668,
|
|
"grad_norm": 0.28090131282806396,
|
|
"learning_rate": 0.00019894031141868513,
|
|
"loss": 1.57928955078125,
|
|
"mean_token_accuracy": 0.6585889373719692,
|
|
"num_tokens": 123977.0,
|
|
"step": 50
|
|
},
|
|
{
|
|
"entropy": 1.1364526492357254,
|
|
"epoch": 0.021627466882941336,
|
|
"grad_norm": 0.2281769961118698,
|
|
"learning_rate": 0.00019785899653979242,
|
|
"loss": 1.100172653198242,
|
|
"mean_token_accuracy": 0.7466893503069878,
|
|
"num_tokens": 248309.0,
|
|
"step": 100
|
|
},
|
|
{
|
|
"entropy": 1.1089821934700013,
|
|
"epoch": 0.032441200324412,
|
|
"grad_norm": 0.3005591332912445,
|
|
"learning_rate": 0.00019677768166089966,
|
|
"loss": 1.0704219818115235,
|
|
"mean_token_accuracy": 0.7515157249569893,
|
|
"num_tokens": 372588.0,
|
|
"step": 150
|
|
},
|
|
{
|
|
"entropy": 1.0970544889569283,
|
|
"epoch": 0.04325493376588267,
|
|
"grad_norm": 0.254552960395813,
|
|
"learning_rate": 0.00019569636678200692,
|
|
"loss": 1.0600093841552733,
|
|
"mean_token_accuracy": 0.7542213362455368,
|
|
"num_tokens": 495369.0,
|
|
"step": 200
|
|
},
|
|
{
|
|
"entropy": 1.0934300097823142,
|
|
"epoch": 0.05406866720735334,
|
|
"grad_norm": 0.2509688138961792,
|
|
"learning_rate": 0.0001946150519031142,
|
|
"loss": 1.0492845916748046,
|
|
"mean_token_accuracy": 0.7534190046787262,
|
|
"num_tokens": 620285.0,
|
|
"step": 250
|
|
},
|
|
{
|
|
"entropy": 1.079278998374939,
|
|
"epoch": 0.064882400648824,
|
|
"grad_norm": 0.2908070683479309,
|
|
"learning_rate": 0.00019353373702422146,
|
|
"loss": 1.0407254791259766,
|
|
"mean_token_accuracy": 0.7563642504811287,
|
|
"num_tokens": 744529.0,
|
|
"step": 300
|
|
},
|
|
{
|
|
"entropy": 1.089175322651863,
|
|
"epoch": 0.07569613409029467,
|
|
"grad_norm": 0.24846726655960083,
|
|
"learning_rate": 0.00019245242214532872,
|
|
"loss": 1.0480615997314453,
|
|
"mean_token_accuracy": 0.7542199870944023,
|
|
"num_tokens": 868866.0,
|
|
"step": 350
|
|
},
|
|
{
|
|
"entropy": 1.0759337919950485,
|
|
"epoch": 0.08650986753176534,
|
|
"grad_norm": 0.2674475312232971,
|
|
"learning_rate": 0.000191371107266436,
|
|
"loss": 1.033748016357422,
|
|
"mean_token_accuracy": 0.757500262260437,
|
|
"num_tokens": 993347.0,
|
|
"step": 400
|
|
},
|
|
{
|
|
"entropy": 1.0587540939450264,
|
|
"epoch": 0.09732360097323602,
|
|
"grad_norm": 0.29028239846229553,
|
|
"learning_rate": 0.00019028979238754326,
|
|
"loss": 1.017349395751953,
|
|
"mean_token_accuracy": 0.7600456944108009,
|
|
"num_tokens": 1116193.0,
|
|
"step": 450
|
|
},
|
|
{
|
|
"entropy": 1.072849457859993,
|
|
"epoch": 0.10813733441470667,
|
|
"grad_norm": 0.2625264525413513,
|
|
"learning_rate": 0.00018920847750865055,
|
|
"loss": 1.0386861419677735,
|
|
"mean_token_accuracy": 0.7573303279280662,
|
|
"num_tokens": 1241515.0,
|
|
"step": 500
|
|
},
|
|
{
|
|
"entropy": 1.0559469202160836,
|
|
"epoch": 0.11895106785617734,
|
|
"grad_norm": 0.28628799319267273,
|
|
"learning_rate": 0.00018812716262975782,
|
|
"loss": 1.0175587463378906,
|
|
"mean_token_accuracy": 0.7615640380978584,
|
|
"num_tokens": 1364898.0,
|
|
"step": 550
|
|
},
|
|
{
|
|
"entropy": 1.0507033586502075,
|
|
"epoch": 0.129764801297648,
|
|
"grad_norm": 0.31329479813575745,
|
|
"learning_rate": 0.00018704584775086505,
|
|
"loss": 1.0029161834716798,
|
|
"mean_token_accuracy": 0.7615058162808418,
|
|
"num_tokens": 1489665.0,
|
|
"step": 600
|
|
},
|
|
{
|
|
"entropy": 1.0314693385362625,
|
|
"epoch": 0.1405785347391187,
|
|
"grad_norm": 0.2982197105884552,
|
|
"learning_rate": 0.00018596453287197232,
|
|
"loss": 0.9919955444335937,
|
|
"mean_token_accuracy": 0.7648657643795014,
|
|
"num_tokens": 1612122.0,
|
|
"step": 650
|
|
},
|
|
{
|
|
"entropy": 1.058671335875988,
|
|
"epoch": 0.15139226818058935,
|
|
"grad_norm": 0.28691762685775757,
|
|
"learning_rate": 0.00018488321799307959,
|
|
"loss": 1.0169689178466796,
|
|
"mean_token_accuracy": 0.760971357524395,
|
|
"num_tokens": 1735563.0,
|
|
"step": 700
|
|
},
|
|
{
|
|
"entropy": 1.0361346396803857,
|
|
"epoch": 0.16220600162206,
|
|
"grad_norm": 0.28715741634368896,
|
|
"learning_rate": 0.00018380190311418685,
|
|
"loss": 0.9982515716552735,
|
|
"mean_token_accuracy": 0.7643765249848365,
|
|
"num_tokens": 1859578.0,
|
|
"step": 750
|
|
},
|
|
{
|
|
"entropy": 1.037577547132969,
|
|
"epoch": 0.1730197350635307,
|
|
"grad_norm": 0.30956366658210754,
|
|
"learning_rate": 0.00018272058823529412,
|
|
"loss": 0.99859619140625,
|
|
"mean_token_accuracy": 0.765041188299656,
|
|
"num_tokens": 1982977.0,
|
|
"step": 800
|
|
},
|
|
{
|
|
"entropy": 1.0489871001243591,
|
|
"epoch": 0.18383346850500135,
|
|
"grad_norm": 0.2797037363052368,
|
|
"learning_rate": 0.00018163927335640138,
|
|
"loss": 1.0067311096191407,
|
|
"mean_token_accuracy": 0.7624166232347488,
|
|
"num_tokens": 2106493.0,
|
|
"step": 850
|
|
},
|
|
{
|
|
"entropy": 1.0370216086506843,
|
|
"epoch": 0.19464720194647203,
|
|
"grad_norm": 0.2931689918041229,
|
|
"learning_rate": 0.00018055795847750865,
|
|
"loss": 0.990766372680664,
|
|
"mean_token_accuracy": 0.7645507997274399,
|
|
"num_tokens": 2229821.0,
|
|
"step": 900
|
|
},
|
|
{
|
|
"entropy": 1.0375834143161773,
|
|
"epoch": 0.2054609353879427,
|
|
"grad_norm": 0.3202299475669861,
|
|
"learning_rate": 0.00017947664359861594,
|
|
"loss": 0.9967639923095704,
|
|
"mean_token_accuracy": 0.7639237719774247,
|
|
"num_tokens": 2353383.0,
|
|
"step": 950
|
|
},
|
|
{
|
|
"entropy": 1.0191652816534043,
|
|
"epoch": 0.21627466882941335,
|
|
"grad_norm": 0.3007340729236603,
|
|
"learning_rate": 0.0001783953287197232,
|
|
"loss": 0.9750653076171875,
|
|
"mean_token_accuracy": 0.7676536691188812,
|
|
"num_tokens": 2478119.0,
|
|
"step": 1000
|
|
},
|
|
{
|
|
"entropy": 1.0152600398659706,
|
|
"epoch": 0.22708840227088403,
|
|
"grad_norm": 0.2992817163467407,
|
|
"learning_rate": 0.00017731401384083045,
|
|
"loss": 0.9678521728515626,
|
|
"mean_token_accuracy": 0.7675010293722153,
|
|
"num_tokens": 2602812.0,
|
|
"step": 1050
|
|
},
|
|
{
|
|
"entropy": 1.0376929226517677,
|
|
"epoch": 0.2379021357123547,
|
|
"grad_norm": 0.3110537827014923,
|
|
"learning_rate": 0.00017623269896193772,
|
|
"loss": 0.9965673828125,
|
|
"mean_token_accuracy": 0.7642460426688195,
|
|
"num_tokens": 2725959.0,
|
|
"step": 1100
|
|
},
|
|
{
|
|
"entropy": 1.0361326697468758,
|
|
"epoch": 0.24871586915382535,
|
|
"grad_norm": 0.3060745596885681,
|
|
"learning_rate": 0.00017515138408304498,
|
|
"loss": 0.9937977600097656,
|
|
"mean_token_accuracy": 0.7644143688678742,
|
|
"num_tokens": 2849779.0,
|
|
"step": 1150
|
|
},
|
|
{
|
|
"entropy": 1.0229142433404923,
|
|
"epoch": 0.259529602595296,
|
|
"grad_norm": 0.3025812804698944,
|
|
"learning_rate": 0.00017407006920415225,
|
|
"loss": 0.9795721435546875,
|
|
"mean_token_accuracy": 0.767822388112545,
|
|
"num_tokens": 2972677.0,
|
|
"step": 1200
|
|
},
|
|
{
|
|
"entropy": 1.0106876641511917,
|
|
"epoch": 0.2703433360367667,
|
|
"grad_norm": 0.3012096881866455,
|
|
"learning_rate": 0.00017298875432525951,
|
|
"loss": 0.9671428680419922,
|
|
"mean_token_accuracy": 0.7694130361080169,
|
|
"num_tokens": 3096265.0,
|
|
"step": 1250
|
|
},
|
|
{
|
|
"entropy": 1.008516309261322,
|
|
"epoch": 0.2811570694782374,
|
|
"grad_norm": 0.3244439661502838,
|
|
"learning_rate": 0.00017190743944636678,
|
|
"loss": 0.9615982818603516,
|
|
"mean_token_accuracy": 0.7692779210209847,
|
|
"num_tokens": 3221232.0,
|
|
"step": 1300
|
|
},
|
|
{
|
|
"entropy": 1.0088078647851944,
|
|
"epoch": 0.291970802919708,
|
|
"grad_norm": 0.3650096654891968,
|
|
"learning_rate": 0.00017082612456747407,
|
|
"loss": 0.9702001190185547,
|
|
"mean_token_accuracy": 0.7691489788889885,
|
|
"num_tokens": 3344232.0,
|
|
"step": 1350
|
|
},
|
|
{
|
|
"entropy": 1.007270593047142,
|
|
"epoch": 0.3027845363611787,
|
|
"grad_norm": 0.3463411331176758,
|
|
"learning_rate": 0.00016974480968858134,
|
|
"loss": 0.9577362823486328,
|
|
"mean_token_accuracy": 0.7718513143062592,
|
|
"num_tokens": 3468160.0,
|
|
"step": 1400
|
|
},
|
|
{
|
|
"entropy": 0.9952353915572166,
|
|
"epoch": 0.3135982698026494,
|
|
"grad_norm": 0.3212313652038574,
|
|
"learning_rate": 0.0001686634948096886,
|
|
"loss": 0.9518090057373046,
|
|
"mean_token_accuracy": 0.7725230798125267,
|
|
"num_tokens": 3591656.0,
|
|
"step": 1450
|
|
},
|
|
{
|
|
"entropy": 1.0085438239574431,
|
|
"epoch": 0.32441200324412,
|
|
"grad_norm": 0.315150648355484,
|
|
"learning_rate": 0.00016758217993079584,
|
|
"loss": 0.9615400695800781,
|
|
"mean_token_accuracy": 0.7701647129654884,
|
|
"num_tokens": 3717176.0,
|
|
"step": 1500
|
|
},
|
|
{
|
|
"entropy": 1.0040599223971367,
|
|
"epoch": 0.3352257366855907,
|
|
"grad_norm": 0.3265557885169983,
|
|
"learning_rate": 0.0001665008650519031,
|
|
"loss": 0.9614816284179688,
|
|
"mean_token_accuracy": 0.7700810307264327,
|
|
"num_tokens": 3841324.0,
|
|
"step": 1550
|
|
},
|
|
{
|
|
"entropy": 1.0008032649755478,
|
|
"epoch": 0.3460394701270614,
|
|
"grad_norm": 0.3313773572444916,
|
|
"learning_rate": 0.00016541955017301038,
|
|
"loss": 0.9553129577636719,
|
|
"mean_token_accuracy": 0.7725938132405281,
|
|
"num_tokens": 3967074.0,
|
|
"step": 1600
|
|
},
|
|
{
|
|
"entropy": 1.0187152257561685,
|
|
"epoch": 0.35685320356853206,
|
|
"grad_norm": 0.3302786350250244,
|
|
"learning_rate": 0.00016433823529411764,
|
|
"loss": 0.9781700134277344,
|
|
"mean_token_accuracy": 0.7664949280023575,
|
|
"num_tokens": 4091565.0,
|
|
"step": 1650
|
|
},
|
|
{
|
|
"entropy": 1.0033915981650352,
|
|
"epoch": 0.3676669370100027,
|
|
"grad_norm": 0.39669185876846313,
|
|
"learning_rate": 0.0001632569204152249,
|
|
"loss": 0.9553046417236328,
|
|
"mean_token_accuracy": 0.7714884573221207,
|
|
"num_tokens": 4216711.0,
|
|
"step": 1700
|
|
},
|
|
{
|
|
"entropy": 0.9947994527220726,
|
|
"epoch": 0.3784806704514734,
|
|
"grad_norm": 0.3623254597187042,
|
|
"learning_rate": 0.0001621756055363322,
|
|
"loss": 0.9575225067138672,
|
|
"mean_token_accuracy": 0.7729539921879769,
|
|
"num_tokens": 4340851.0,
|
|
"step": 1750
|
|
},
|
|
{
|
|
"entropy": 0.9873680013418198,
|
|
"epoch": 0.38929440389294406,
|
|
"grad_norm": 0.3133494257926941,
|
|
"learning_rate": 0.00016109429065743947,
|
|
"loss": 0.9450105285644531,
|
|
"mean_token_accuracy": 0.7730937919020653,
|
|
"num_tokens": 4465200.0,
|
|
"step": 1800
|
|
},
|
|
{
|
|
"entropy": 0.9872635442018509,
|
|
"epoch": 0.4001081373344147,
|
|
"grad_norm": 0.34721314907073975,
|
|
"learning_rate": 0.00016001297577854673,
|
|
"loss": 0.9430616760253906,
|
|
"mean_token_accuracy": 0.7746348583698273,
|
|
"num_tokens": 4588852.0,
|
|
"step": 1850
|
|
},
|
|
{
|
|
"entropy": 1.0025754153728486,
|
|
"epoch": 0.4109218707758854,
|
|
"grad_norm": 0.3151341676712036,
|
|
"learning_rate": 0.000158931660899654,
|
|
"loss": 0.9593523406982422,
|
|
"mean_token_accuracy": 0.7713686314225197,
|
|
"num_tokens": 4713285.0,
|
|
"step": 1900
|
|
},
|
|
{
|
|
"entropy": 0.9876599442958832,
|
|
"epoch": 0.42173560421735606,
|
|
"grad_norm": 0.33159542083740234,
|
|
"learning_rate": 0.00015785034602076124,
|
|
"loss": 0.9407640838623047,
|
|
"mean_token_accuracy": 0.7747422182559967,
|
|
"num_tokens": 4837231.0,
|
|
"step": 1950
|
|
},
|
|
{
|
|
"entropy": 0.989951122701168,
|
|
"epoch": 0.4325493376588267,
|
|
"grad_norm": 0.36107805371284485,
|
|
"learning_rate": 0.0001567690311418685,
|
|
"loss": 0.9535860443115234,
|
|
"mean_token_accuracy": 0.7731623870134353,
|
|
"num_tokens": 4961379.0,
|
|
"step": 2000
|
|
},
|
|
{
|
|
"entropy": 0.9942466479539871,
|
|
"epoch": 0.4433630711002974,
|
|
"grad_norm": 0.36171120405197144,
|
|
"learning_rate": 0.00015568771626297577,
|
|
"loss": 0.9483850860595703,
|
|
"mean_token_accuracy": 0.7736234655976295,
|
|
"num_tokens": 5084411.0,
|
|
"step": 2050
|
|
},
|
|
{
|
|
"entropy": 0.9909732878208161,
|
|
"epoch": 0.45417680454176806,
|
|
"grad_norm": 0.34820348024368286,
|
|
"learning_rate": 0.00015460640138408304,
|
|
"loss": 0.9419315338134766,
|
|
"mean_token_accuracy": 0.7733583068847656,
|
|
"num_tokens": 5208794.0,
|
|
"step": 2100
|
|
},
|
|
{
|
|
"entropy": 0.996764853298664,
|
|
"epoch": 0.4649905379832387,
|
|
"grad_norm": 0.3247971534729004,
|
|
"learning_rate": 0.00015352508650519033,
|
|
"loss": 0.9556381225585937,
|
|
"mean_token_accuracy": 0.7714186930656433,
|
|
"num_tokens": 5332752.0,
|
|
"step": 2150
|
|
},
|
|
{
|
|
"entropy": 0.9807541698217392,
|
|
"epoch": 0.4758042714247094,
|
|
"grad_norm": 0.33384960889816284,
|
|
"learning_rate": 0.0001524437716262976,
|
|
"loss": 0.9373370361328125,
|
|
"mean_token_accuracy": 0.7746272701025009,
|
|
"num_tokens": 5455899.0,
|
|
"step": 2200
|
|
},
|
|
{
|
|
"entropy": 0.9727324178814888,
|
|
"epoch": 0.48661800486618007,
|
|
"grad_norm": 0.3516428470611572,
|
|
"learning_rate": 0.00015136245674740486,
|
|
"loss": 0.9246253204345704,
|
|
"mean_token_accuracy": 0.7769404649734497,
|
|
"num_tokens": 5579889.0,
|
|
"step": 2250
|
|
},
|
|
{
|
|
"entropy": 0.9807918471097946,
|
|
"epoch": 0.4974317383076507,
|
|
"grad_norm": 0.35830622911453247,
|
|
"learning_rate": 0.00015028114186851213,
|
|
"loss": 0.9377103424072266,
|
|
"mean_token_accuracy": 0.774136980175972,
|
|
"num_tokens": 5704519.0,
|
|
"step": 2300
|
|
},
|
|
{
|
|
"entropy": 0.976213767528534,
|
|
"epoch": 0.5082454717491214,
|
|
"grad_norm": 0.3067024350166321,
|
|
"learning_rate": 0.0001491998269896194,
|
|
"loss": 0.9264936828613282,
|
|
"mean_token_accuracy": 0.7782159951329232,
|
|
"num_tokens": 5828524.0,
|
|
"step": 2350
|
|
},
|
|
{
|
|
"entropy": 0.9686787807941437,
|
|
"epoch": 0.519059205190592,
|
|
"grad_norm": 0.33222144842147827,
|
|
"learning_rate": 0.00014811851211072663,
|
|
"loss": 0.9226473999023438,
|
|
"mean_token_accuracy": 0.7773696330189704,
|
|
"num_tokens": 5953426.0,
|
|
"step": 2400
|
|
},
|
|
{
|
|
"entropy": 0.9796634471416473,
|
|
"epoch": 0.5298729386320628,
|
|
"grad_norm": 0.3855077028274536,
|
|
"learning_rate": 0.0001470371972318339,
|
|
"loss": 0.9348521423339844,
|
|
"mean_token_accuracy": 0.7757473662495613,
|
|
"num_tokens": 6078757.0,
|
|
"step": 2450
|
|
},
|
|
{
|
|
"entropy": 0.982579345703125,
|
|
"epoch": 0.5406866720735334,
|
|
"grad_norm": 0.3507300019264221,
|
|
"learning_rate": 0.00014595588235294117,
|
|
"loss": 0.9395813751220703,
|
|
"mean_token_accuracy": 0.7743844348192215,
|
|
"num_tokens": 6202483.0,
|
|
"step": 2500
|
|
},
|
|
{
|
|
"entropy": 0.9857170847058296,
|
|
"epoch": 0.551500405515004,
|
|
"grad_norm": 0.3565821051597595,
|
|
"learning_rate": 0.00014487456747404843,
|
|
"loss": 0.9449205780029297,
|
|
"mean_token_accuracy": 0.7731934878230095,
|
|
"num_tokens": 6326590.0,
|
|
"step": 2550
|
|
},
|
|
{
|
|
"entropy": 0.9654983013868332,
|
|
"epoch": 0.5623141389564748,
|
|
"grad_norm": 0.46569356322288513,
|
|
"learning_rate": 0.00014379325259515573,
|
|
"loss": 0.915346908569336,
|
|
"mean_token_accuracy": 0.7797791358828544,
|
|
"num_tokens": 6450007.0,
|
|
"step": 2600
|
|
},
|
|
{
|
|
"entropy": 0.9558308330178261,
|
|
"epoch": 0.5731278723979454,
|
|
"grad_norm": 0.34071245789527893,
|
|
"learning_rate": 0.000142711937716263,
|
|
"loss": 0.9121507263183594,
|
|
"mean_token_accuracy": 0.7796976065635681,
|
|
"num_tokens": 6573692.0,
|
|
"step": 2650
|
|
},
|
|
{
|
|
"entropy": 0.9737746119499207,
|
|
"epoch": 0.583941605839416,
|
|
"grad_norm": 0.42853230237960815,
|
|
"learning_rate": 0.00014163062283737026,
|
|
"loss": 0.9226377868652343,
|
|
"mean_token_accuracy": 0.7767168003320694,
|
|
"num_tokens": 6696744.0,
|
|
"step": 2700
|
|
},
|
|
{
|
|
"entropy": 0.9409950344264507,
|
|
"epoch": 0.5947553392808868,
|
|
"grad_norm": 0.35493117570877075,
|
|
"learning_rate": 0.00014054930795847752,
|
|
"loss": 0.9008861541748047,
|
|
"mean_token_accuracy": 0.7820612439513206,
|
|
"num_tokens": 6819839.0,
|
|
"step": 2750
|
|
},
|
|
{
|
|
"entropy": 0.9785664704442024,
|
|
"epoch": 0.6055690727223574,
|
|
"grad_norm": 0.3584900498390198,
|
|
"learning_rate": 0.0001394679930795848,
|
|
"loss": 0.9280467987060547,
|
|
"mean_token_accuracy": 0.7758279657363891,
|
|
"num_tokens": 6944860.0,
|
|
"step": 2800
|
|
},
|
|
{
|
|
"entropy": 0.9648727372288703,
|
|
"epoch": 0.616382806163828,
|
|
"grad_norm": 0.3259691596031189,
|
|
"learning_rate": 0.00013838667820069206,
|
|
"loss": 0.9139330291748047,
|
|
"mean_token_accuracy": 0.7789179873466492,
|
|
"num_tokens": 7069462.0,
|
|
"step": 2850
|
|
},
|
|
{
|
|
"entropy": 0.9550602287054062,
|
|
"epoch": 0.6271965396052988,
|
|
"grad_norm": 0.34396904706954956,
|
|
"learning_rate": 0.0001373053633217993,
|
|
"loss": 0.911934814453125,
|
|
"mean_token_accuracy": 0.7795157498121261,
|
|
"num_tokens": 7193637.0,
|
|
"step": 2900
|
|
},
|
|
{
|
|
"entropy": 0.9567822390794753,
|
|
"epoch": 0.6380102730467694,
|
|
"grad_norm": 0.3656565845012665,
|
|
"learning_rate": 0.00013622404844290656,
|
|
"loss": 0.90780517578125,
|
|
"mean_token_accuracy": 0.7807323867082596,
|
|
"num_tokens": 7318003.0,
|
|
"step": 2950
|
|
},
|
|
{
|
|
"entropy": 0.9680379915237427,
|
|
"epoch": 0.64882400648824,
|
|
"grad_norm": 0.35544008016586304,
|
|
"learning_rate": 0.00013514273356401386,
|
|
"loss": 0.926307601928711,
|
|
"mean_token_accuracy": 0.7776252856850624,
|
|
"num_tokens": 7442839.0,
|
|
"step": 3000
|
|
},
|
|
{
|
|
"entropy": 0.9586516383290291,
|
|
"epoch": 0.6596377399297108,
|
|
"grad_norm": 0.38119104504585266,
|
|
"learning_rate": 0.00013406141868512112,
|
|
"loss": 0.9137237548828125,
|
|
"mean_token_accuracy": 0.779051171541214,
|
|
"num_tokens": 7567918.0,
|
|
"step": 3050
|
|
},
|
|
{
|
|
"entropy": 0.9592681783437729,
|
|
"epoch": 0.6704514733711814,
|
|
"grad_norm": 0.41220319271087646,
|
|
"learning_rate": 0.0001329801038062284,
|
|
"loss": 0.9161334991455078,
|
|
"mean_token_accuracy": 0.7784739115834236,
|
|
"num_tokens": 7691923.0,
|
|
"step": 3100
|
|
},
|
|
{
|
|
"entropy": 0.9522276033461093,
|
|
"epoch": 0.681265206812652,
|
|
"grad_norm": 0.34783244132995605,
|
|
"learning_rate": 0.00013189878892733565,
|
|
"loss": 0.906259765625,
|
|
"mean_token_accuracy": 0.779859009385109,
|
|
"num_tokens": 7816314.0,
|
|
"step": 3150
|
|
},
|
|
{
|
|
"entropy": 0.987121675312519,
|
|
"epoch": 0.6920789402541228,
|
|
"grad_norm": 0.40850555896759033,
|
|
"learning_rate": 0.00013081747404844292,
|
|
"loss": 0.9372953796386718,
|
|
"mean_token_accuracy": 0.7740126466751098,
|
|
"num_tokens": 7940802.0,
|
|
"step": 3200
|
|
},
|
|
{
|
|
"entropy": 0.9259102933108807,
|
|
"epoch": 0.7028926736955934,
|
|
"grad_norm": 0.3860037624835968,
|
|
"learning_rate": 0.00012973615916955019,
|
|
"loss": 0.8789935302734375,
|
|
"mean_token_accuracy": 0.7863946691155433,
|
|
"num_tokens": 8063614.0,
|
|
"step": 3250
|
|
},
|
|
{
|
|
"entropy": 0.9597182178497314,
|
|
"epoch": 0.7137064071370641,
|
|
"grad_norm": 0.34865984320640564,
|
|
"learning_rate": 0.00012865484429065745,
|
|
"loss": 0.9123552703857422,
|
|
"mean_token_accuracy": 0.7795469465851784,
|
|
"num_tokens": 8187971.0,
|
|
"step": 3300
|
|
},
|
|
{
|
|
"entropy": 0.948035677075386,
|
|
"epoch": 0.7245201405785348,
|
|
"grad_norm": 0.39668431878089905,
|
|
"learning_rate": 0.0001275735294117647,
|
|
"loss": 0.9053540802001954,
|
|
"mean_token_accuracy": 0.7816357898712158,
|
|
"num_tokens": 8311575.0,
|
|
"step": 3350
|
|
},
|
|
{
|
|
"entropy": 0.9602045866847039,
|
|
"epoch": 0.7353338740200054,
|
|
"grad_norm": 0.35546383261680603,
|
|
"learning_rate": 0.00012649221453287198,
|
|
"loss": 0.9115966033935546,
|
|
"mean_token_accuracy": 0.778631086051464,
|
|
"num_tokens": 8434802.0,
|
|
"step": 3400
|
|
},
|
|
{
|
|
"entropy": 0.9273841908574104,
|
|
"epoch": 0.7461476074614761,
|
|
"grad_norm": 0.3831380605697632,
|
|
"learning_rate": 0.00012541089965397925,
|
|
"loss": 0.8848464965820313,
|
|
"mean_token_accuracy": 0.7844718647003174,
|
|
"num_tokens": 8556975.0,
|
|
"step": 3450
|
|
},
|
|
{
|
|
"entropy": 0.9524098074436188,
|
|
"epoch": 0.7569613409029468,
|
|
"grad_norm": 0.36380258202552795,
|
|
"learning_rate": 0.00012432958477508652,
|
|
"loss": 0.9105377960205078,
|
|
"mean_token_accuracy": 0.7786688470840454,
|
|
"num_tokens": 8681994.0,
|
|
"step": 3500
|
|
},
|
|
{
|
|
"entropy": 0.9557695007324218,
|
|
"epoch": 0.7677750743444174,
|
|
"grad_norm": 0.3928527235984802,
|
|
"learning_rate": 0.00012324826989619378,
|
|
"loss": 0.9140352630615234,
|
|
"mean_token_accuracy": 0.7800808894634247,
|
|
"num_tokens": 8806482.0,
|
|
"step": 3550
|
|
},
|
|
{
|
|
"entropy": 0.9606414380669593,
|
|
"epoch": 0.7785888077858881,
|
|
"grad_norm": 0.38226789236068726,
|
|
"learning_rate": 0.00012216695501730105,
|
|
"loss": 0.9134915924072265,
|
|
"mean_token_accuracy": 0.7790612497925758,
|
|
"num_tokens": 8930651.0,
|
|
"step": 3600
|
|
},
|
|
{
|
|
"entropy": 0.9491737291216851,
|
|
"epoch": 0.7894025412273588,
|
|
"grad_norm": 0.3596038222312927,
|
|
"learning_rate": 0.0001210856401384083,
|
|
"loss": 0.9034819793701172,
|
|
"mean_token_accuracy": 0.7812365189194679,
|
|
"num_tokens": 9054760.0,
|
|
"step": 3650
|
|
},
|
|
{
|
|
"entropy": 0.9588404703140259,
|
|
"epoch": 0.8002162746688294,
|
|
"grad_norm": 0.38145825266838074,
|
|
"learning_rate": 0.00012000432525951557,
|
|
"loss": 0.9139315795898437,
|
|
"mean_token_accuracy": 0.7799289628863335,
|
|
"num_tokens": 9177720.0,
|
|
"step": 3700
|
|
},
|
|
{
|
|
"entropy": 0.960016773045063,
|
|
"epoch": 0.8110300081103001,
|
|
"grad_norm": 0.37125062942504883,
|
|
"learning_rate": 0.00011892301038062283,
|
|
"loss": 0.9109798431396484,
|
|
"mean_token_accuracy": 0.7782664918899536,
|
|
"num_tokens": 9302954.0,
|
|
"step": 3750
|
|
},
|
|
{
|
|
"entropy": 0.9554665067791939,
|
|
"epoch": 0.8218437415517708,
|
|
"grad_norm": 0.36049774289131165,
|
|
"learning_rate": 0.00011784169550173013,
|
|
"loss": 0.9094401550292969,
|
|
"mean_token_accuracy": 0.7795194643735885,
|
|
"num_tokens": 9427362.0,
|
|
"step": 3800
|
|
},
|
|
{
|
|
"entropy": 0.9361231756210328,
|
|
"epoch": 0.8326574749932414,
|
|
"grad_norm": 0.3726538121700287,
|
|
"learning_rate": 0.00011676038062283738,
|
|
"loss": 0.8937419128417968,
|
|
"mean_token_accuracy": 0.782988406419754,
|
|
"num_tokens": 9551125.0,
|
|
"step": 3850
|
|
},
|
|
{
|
|
"entropy": 0.9532928049564362,
|
|
"epoch": 0.8434712084347121,
|
|
"grad_norm": 0.32248884439468384,
|
|
"learning_rate": 0.00011567906574394465,
|
|
"loss": 0.9049002838134765,
|
|
"mean_token_accuracy": 0.7808799761533737,
|
|
"num_tokens": 9674451.0,
|
|
"step": 3900
|
|
},
|
|
{
|
|
"entropy": 0.9338971999287605,
|
|
"epoch": 0.8542849418761828,
|
|
"grad_norm": 0.3933933675289154,
|
|
"learning_rate": 0.00011459775086505191,
|
|
"loss": 0.8884281921386719,
|
|
"mean_token_accuracy": 0.7828631713986397,
|
|
"num_tokens": 9799746.0,
|
|
"step": 3950
|
|
},
|
|
{
|
|
"entropy": 0.9479410347342491,
|
|
"epoch": 0.8650986753176534,
|
|
"grad_norm": 0.37493252754211426,
|
|
"learning_rate": 0.00011351643598615918,
|
|
"loss": 0.9033116912841797,
|
|
"mean_token_accuracy": 0.7806721919775009,
|
|
"num_tokens": 9923770.0,
|
|
"step": 4000
|
|
},
|
|
{
|
|
"entropy": 0.9470226404070854,
|
|
"epoch": 0.8759124087591241,
|
|
"grad_norm": 0.37768077850341797,
|
|
"learning_rate": 0.00011243512110726644,
|
|
"loss": 0.899166488647461,
|
|
"mean_token_accuracy": 0.7823007860779763,
|
|
"num_tokens": 10048685.0,
|
|
"step": 4050
|
|
},
|
|
{
|
|
"entropy": 0.9373468968272209,
|
|
"epoch": 0.8867261422005948,
|
|
"grad_norm": 0.39013978838920593,
|
|
"learning_rate": 0.0001113538062283737,
|
|
"loss": 0.8871630096435547,
|
|
"mean_token_accuracy": 0.7844019088149071,
|
|
"num_tokens": 10172679.0,
|
|
"step": 4100
|
|
},
|
|
{
|
|
"entropy": 0.9614023247361183,
|
|
"epoch": 0.8975398756420654,
|
|
"grad_norm": 0.4659505784511566,
|
|
"learning_rate": 0.00011027249134948096,
|
|
"loss": 0.9157921600341797,
|
|
"mean_token_accuracy": 0.7778910347819328,
|
|
"num_tokens": 10295888.0,
|
|
"step": 4150
|
|
},
|
|
{
|
|
"entropy": 0.918306770324707,
|
|
"epoch": 0.9083536090835361,
|
|
"grad_norm": 0.3793661296367645,
|
|
"learning_rate": 0.00010919117647058823,
|
|
"loss": 0.8694481658935547,
|
|
"mean_token_accuracy": 0.7875613197684288,
|
|
"num_tokens": 10419443.0,
|
|
"step": 4200
|
|
},
|
|
{
|
|
"entropy": 0.9507299935817719,
|
|
"epoch": 0.9191673425250068,
|
|
"grad_norm": 0.37350088357925415,
|
|
"learning_rate": 0.00010810986159169552,
|
|
"loss": 0.9033610534667968,
|
|
"mean_token_accuracy": 0.7812194362282753,
|
|
"num_tokens": 10543902.0,
|
|
"step": 4250
|
|
},
|
|
{
|
|
"entropy": 0.9278874734044075,
|
|
"epoch": 0.9299810759664774,
|
|
"grad_norm": 0.3865355849266052,
|
|
"learning_rate": 0.00010702854671280277,
|
|
"loss": 0.8775564575195313,
|
|
"mean_token_accuracy": 0.7851923108100891,
|
|
"num_tokens": 10668342.0,
|
|
"step": 4300
|
|
},
|
|
{
|
|
"entropy": 0.9630592107772827,
|
|
"epoch": 0.9407948094079481,
|
|
"grad_norm": 0.3818276524543762,
|
|
"learning_rate": 0.00010594723183391004,
|
|
"loss": 0.9211397552490235,
|
|
"mean_token_accuracy": 0.7776543560624123,
|
|
"num_tokens": 10794092.0,
|
|
"step": 4350
|
|
},
|
|
{
|
|
"entropy": 0.9309714612364769,
|
|
"epoch": 0.9516085428494188,
|
|
"grad_norm": 0.3693754971027374,
|
|
"learning_rate": 0.00010486591695501731,
|
|
"loss": 0.8838762664794921,
|
|
"mean_token_accuracy": 0.785359343290329,
|
|
"num_tokens": 10917969.0,
|
|
"step": 4400
|
|
},
|
|
{
|
|
"entropy": 0.9278268280625344,
|
|
"epoch": 0.9624222762908894,
|
|
"grad_norm": 0.36660996079444885,
|
|
"learning_rate": 0.00010378460207612457,
|
|
"loss": 0.8843759155273437,
|
|
"mean_token_accuracy": 0.7841871103644371,
|
|
"num_tokens": 11041733.0,
|
|
"step": 4450
|
|
},
|
|
{
|
|
"entropy": 0.927698116004467,
|
|
"epoch": 0.9732360097323601,
|
|
"grad_norm": 0.3757665157318115,
|
|
"learning_rate": 0.00010270328719723184,
|
|
"loss": 0.875648193359375,
|
|
"mean_token_accuracy": 0.785535734295845,
|
|
"num_tokens": 11165315.0,
|
|
"step": 4500
|
|
},
|
|
{
|
|
"entropy": 0.9314689791202545,
|
|
"epoch": 0.9840497431738308,
|
|
"grad_norm": 0.3739178776741028,
|
|
"learning_rate": 0.00010162197231833909,
|
|
"loss": 0.8861254119873047,
|
|
"mean_token_accuracy": 0.7845934537053109,
|
|
"num_tokens": 11287709.0,
|
|
"step": 4550
|
|
},
|
|
{
|
|
"entropy": 0.9374862217903137,
|
|
"epoch": 0.9948634766153014,
|
|
"grad_norm": 0.381944864988327,
|
|
"learning_rate": 0.00010054065743944636,
|
|
"loss": 0.8965530395507812,
|
|
"mean_token_accuracy": 0.7832883578538895,
|
|
"num_tokens": 11411569.0,
|
|
"step": 4600
|
|
},
|
|
{
|
|
"entropy": 0.9147189355375779,
|
|
"epoch": 1.0056231413895647,
|
|
"grad_norm": 0.3657238185405731,
|
|
"learning_rate": 9.945934256055364e-05,
|
|
"loss": 0.861635513305664,
|
|
"mean_token_accuracy": 0.7886674646756158,
|
|
"num_tokens": 11533344.0,
|
|
"step": 4650
|
|
},
|
|
{
|
|
"entropy": 0.9152166178822517,
|
|
"epoch": 1.0164368748310355,
|
|
"grad_norm": 0.380834698677063,
|
|
"learning_rate": 9.83780276816609e-05,
|
|
"loss": 0.8645867919921875,
|
|
"mean_token_accuracy": 0.7885570275783539,
|
|
"num_tokens": 11658275.0,
|
|
"step": 4700
|
|
},
|
|
{
|
|
"entropy": 0.9023575788736343,
|
|
"epoch": 1.0272506082725061,
|
|
"grad_norm": 0.370339572429657,
|
|
"learning_rate": 9.729671280276817e-05,
|
|
"loss": 0.8483808898925781,
|
|
"mean_token_accuracy": 0.7917116805911064,
|
|
"num_tokens": 11781188.0,
|
|
"step": 4750
|
|
},
|
|
{
|
|
"entropy": 0.9287857602536679,
|
|
"epoch": 1.0380643417139768,
|
|
"grad_norm": 0.4007326066493988,
|
|
"learning_rate": 9.621539792387544e-05,
|
|
"loss": 0.8772708129882812,
|
|
"mean_token_accuracy": 0.7873534452915192,
|
|
"num_tokens": 11906190.0,
|
|
"step": 4800
|
|
},
|
|
{
|
|
"entropy": 0.9099664780497551,
|
|
"epoch": 1.0488780751554474,
|
|
"grad_norm": 0.39335688948631287,
|
|
"learning_rate": 9.51340830449827e-05,
|
|
"loss": 0.8598722076416015,
|
|
"mean_token_accuracy": 0.7875217360258102,
|
|
"num_tokens": 12030008.0,
|
|
"step": 4850
|
|
},
|
|
{
|
|
"entropy": 0.9030975252389908,
|
|
"epoch": 1.059691808596918,
|
|
"grad_norm": 0.3903804123401642,
|
|
"learning_rate": 9.405276816608997e-05,
|
|
"loss": 0.8528098297119141,
|
|
"mean_token_accuracy": 0.7912025526165962,
|
|
"num_tokens": 12154319.0,
|
|
"step": 4900
|
|
},
|
|
{
|
|
"entropy": 0.8888451056182385,
|
|
"epoch": 1.0705055420383887,
|
|
"grad_norm": 0.39620205760002136,
|
|
"learning_rate": 9.297145328719723e-05,
|
|
"loss": 0.842437744140625,
|
|
"mean_token_accuracy": 0.7931029021739959,
|
|
"num_tokens": 12278534.0,
|
|
"step": 4950
|
|
},
|
|
{
|
|
"entropy": 0.9089510563015938,
|
|
"epoch": 1.0813192754798595,
|
|
"grad_norm": 0.4408247470855713,
|
|
"learning_rate": 9.18901384083045e-05,
|
|
"loss": 0.8532330322265625,
|
|
"mean_token_accuracy": 0.789471205174923,
|
|
"num_tokens": 12402188.0,
|
|
"step": 5000
|
|
},
|
|
{
|
|
"entropy": 0.9216419163346291,
|
|
"epoch": 1.0921330089213301,
|
|
"grad_norm": 0.3925590217113495,
|
|
"learning_rate": 9.080882352941177e-05,
|
|
"loss": 0.8713427734375,
|
|
"mean_token_accuracy": 0.7867998030781745,
|
|
"num_tokens": 12526702.0,
|
|
"step": 5050
|
|
},
|
|
{
|
|
"entropy": 0.9093668621778488,
|
|
"epoch": 1.1029467423628008,
|
|
"grad_norm": 0.40872758626937866,
|
|
"learning_rate": 8.972750865051903e-05,
|
|
"loss": 0.8658458709716796,
|
|
"mean_token_accuracy": 0.7870242178440094,
|
|
"num_tokens": 12650725.0,
|
|
"step": 5100
|
|
},
|
|
{
|
|
"entropy": 0.9040770065784455,
|
|
"epoch": 1.1137604758042714,
|
|
"grad_norm": 0.4244873523712158,
|
|
"learning_rate": 8.864619377162631e-05,
|
|
"loss": 0.8551832580566406,
|
|
"mean_token_accuracy": 0.7893402481079101,
|
|
"num_tokens": 12774428.0,
|
|
"step": 5150
|
|
},
|
|
{
|
|
"entropy": 0.9048169466853142,
|
|
"epoch": 1.124574209245742,
|
|
"grad_norm": 0.410826176404953,
|
|
"learning_rate": 8.756487889273357e-05,
|
|
"loss": 0.8514397430419922,
|
|
"mean_token_accuracy": 0.7912932354211807,
|
|
"num_tokens": 12898111.0,
|
|
"step": 5200
|
|
},
|
|
{
|
|
"entropy": 0.9120673614740372,
|
|
"epoch": 1.1353879426872129,
|
|
"grad_norm": 0.4427289068698883,
|
|
"learning_rate": 8.648356401384083e-05,
|
|
"loss": 0.8609336853027344,
|
|
"mean_token_accuracy": 0.7876572114229202,
|
|
"num_tokens": 13022179.0,
|
|
"step": 5250
|
|
},
|
|
{
|
|
"entropy": 0.9044199126958847,
|
|
"epoch": 1.1462016761286835,
|
|
"grad_norm": 0.42478686571121216,
|
|
"learning_rate": 8.54022491349481e-05,
|
|
"loss": 0.8551953887939453,
|
|
"mean_token_accuracy": 0.789024632871151,
|
|
"num_tokens": 13145248.0,
|
|
"step": 5300
|
|
},
|
|
{
|
|
"entropy": 0.910022254884243,
|
|
"epoch": 1.1570154095701541,
|
|
"grad_norm": 0.4162394106388092,
|
|
"learning_rate": 8.432093425605538e-05,
|
|
"loss": 0.8590695953369141,
|
|
"mean_token_accuracy": 0.7899581322073936,
|
|
"num_tokens": 13269779.0,
|
|
"step": 5350
|
|
},
|
|
{
|
|
"entropy": 0.9084632858633995,
|
|
"epoch": 1.1678291430116248,
|
|
"grad_norm": 0.4427330493927002,
|
|
"learning_rate": 8.323961937716263e-05,
|
|
"loss": 0.8666709899902344,
|
|
"mean_token_accuracy": 0.7898361667990684,
|
|
"num_tokens": 13392546.0,
|
|
"step": 5400
|
|
},
|
|
{
|
|
"entropy": 0.9118139263987541,
|
|
"epoch": 1.1786428764530954,
|
|
"grad_norm": 0.4175238311290741,
|
|
"learning_rate": 8.21583044982699e-05,
|
|
"loss": 0.864098129272461,
|
|
"mean_token_accuracy": 0.7889403408765793,
|
|
"num_tokens": 13515659.0,
|
|
"step": 5450
|
|
},
|
|
{
|
|
"entropy": 0.9271328577399254,
|
|
"epoch": 1.189456609894566,
|
|
"grad_norm": 0.4044747054576874,
|
|
"learning_rate": 8.107698961937716e-05,
|
|
"loss": 0.8808552551269532,
|
|
"mean_token_accuracy": 0.785818350315094,
|
|
"num_tokens": 13639702.0,
|
|
"step": 5500
|
|
},
|
|
{
|
|
"entropy": 0.8935171911120414,
|
|
"epoch": 1.2002703433360367,
|
|
"grad_norm": 0.4124446511268616,
|
|
"learning_rate": 7.999567474048443e-05,
|
|
"loss": 0.839752197265625,
|
|
"mean_token_accuracy": 0.7924988424777984,
|
|
"num_tokens": 13764072.0,
|
|
"step": 5550
|
|
},
|
|
{
|
|
"entropy": 0.9172468650341034,
|
|
"epoch": 1.2110840767775075,
|
|
"grad_norm": 0.4329255223274231,
|
|
"learning_rate": 7.891435986159171e-05,
|
|
"loss": 0.8758034515380859,
|
|
"mean_token_accuracy": 0.7861284586787224,
|
|
"num_tokens": 13889400.0,
|
|
"step": 5600
|
|
},
|
|
{
|
|
"entropy": 0.899789534509182,
|
|
"epoch": 1.2218978102189781,
|
|
"grad_norm": 0.4295831024646759,
|
|
"learning_rate": 7.783304498269896e-05,
|
|
"loss": 0.8499066162109375,
|
|
"mean_token_accuracy": 0.7921611469984055,
|
|
"num_tokens": 14014066.0,
|
|
"step": 5650
|
|
},
|
|
{
|
|
"entropy": 0.9190733635425568,
|
|
"epoch": 1.2327115436604488,
|
|
"grad_norm": 0.37251630425453186,
|
|
"learning_rate": 7.675173010380623e-05,
|
|
"loss": 0.8726881408691406,
|
|
"mean_token_accuracy": 0.7860925284028053,
|
|
"num_tokens": 14138520.0,
|
|
"step": 5700
|
|
},
|
|
{
|
|
"entropy": 0.909397943019867,
|
|
"epoch": 1.2435252771019194,
|
|
"grad_norm": 0.42395490407943726,
|
|
"learning_rate": 7.567041522491349e-05,
|
|
"loss": 0.8596044921875,
|
|
"mean_token_accuracy": 0.7888941729068756,
|
|
"num_tokens": 14262974.0,
|
|
"step": 5750
|
|
},
|
|
{
|
|
"entropy": 0.9116135910153389,
|
|
"epoch": 1.25433901054339,
|
|
"grad_norm": 0.4110111594200134,
|
|
"learning_rate": 7.458910034602077e-05,
|
|
"loss": 0.8614549255371093,
|
|
"mean_token_accuracy": 0.7888709127902984,
|
|
"num_tokens": 14388270.0,
|
|
"step": 5800
|
|
},
|
|
{
|
|
"entropy": 0.9064073204994202,
|
|
"epoch": 1.2651527439848609,
|
|
"grad_norm": 0.4212440252304077,
|
|
"learning_rate": 7.350778546712804e-05,
|
|
"loss": 0.8631136322021484,
|
|
"mean_token_accuracy": 0.7882975935935974,
|
|
"num_tokens": 14512750.0,
|
|
"step": 5850
|
|
},
|
|
{
|
|
"entropy": 0.8989076513051987,
|
|
"epoch": 1.2759664774263315,
|
|
"grad_norm": 0.43628790974617004,
|
|
"learning_rate": 7.242647058823529e-05,
|
|
"loss": 0.8487873077392578,
|
|
"mean_token_accuracy": 0.7915391853451729,
|
|
"num_tokens": 14637103.0,
|
|
"step": 5900
|
|
},
|
|
{
|
|
"entropy": 0.9039992502331734,
|
|
"epoch": 1.2867802108678021,
|
|
"grad_norm": 0.4278400242328644,
|
|
"learning_rate": 7.134515570934256e-05,
|
|
"loss": 0.8579811859130859,
|
|
"mean_token_accuracy": 0.7880651640892029,
|
|
"num_tokens": 14761072.0,
|
|
"step": 5950
|
|
},
|
|
{
|
|
"entropy": 0.9130417162179947,
|
|
"epoch": 1.2975939443092728,
|
|
"grad_norm": 0.4128133952617645,
|
|
"learning_rate": 7.026384083044984e-05,
|
|
"loss": 0.8650979614257812,
|
|
"mean_token_accuracy": 0.7877005457878112,
|
|
"num_tokens": 14885855.0,
|
|
"step": 6000
|
|
},
|
|
{
|
|
"entropy": 0.902423195540905,
|
|
"epoch": 1.3084076777507434,
|
|
"grad_norm": 0.39254528284072876,
|
|
"learning_rate": 6.91825259515571e-05,
|
|
"loss": 0.8572408294677735,
|
|
"mean_token_accuracy": 0.7896142837405205,
|
|
"num_tokens": 15009620.0,
|
|
"step": 6050
|
|
},
|
|
{
|
|
"entropy": 0.9076719802618026,
|
|
"epoch": 1.319221411192214,
|
|
"grad_norm": 0.4222393333911896,
|
|
"learning_rate": 6.810121107266436e-05,
|
|
"loss": 0.8588363647460937,
|
|
"mean_token_accuracy": 0.7872794163227081,
|
|
"num_tokens": 15134578.0,
|
|
"step": 6100
|
|
},
|
|
{
|
|
"entropy": 0.9151003685593605,
|
|
"epoch": 1.3300351446336847,
|
|
"grad_norm": 0.47221705317497253,
|
|
"learning_rate": 6.701989619377162e-05,
|
|
"loss": 0.8615426635742187,
|
|
"mean_token_accuracy": 0.7870361080765724,
|
|
"num_tokens": 15259249.0,
|
|
"step": 6150
|
|
},
|
|
{
|
|
"entropy": 0.8964329600334168,
|
|
"epoch": 1.3408488780751555,
|
|
"grad_norm": 0.4478709101676941,
|
|
"learning_rate": 6.59385813148789e-05,
|
|
"loss": 0.8448455810546875,
|
|
"mean_token_accuracy": 0.7927756410837173,
|
|
"num_tokens": 15383612.0,
|
|
"step": 6200
|
|
},
|
|
{
|
|
"entropy": 0.9094292390346527,
|
|
"epoch": 1.3516626115166261,
|
|
"grad_norm": 0.4359077215194702,
|
|
"learning_rate": 6.485726643598617e-05,
|
|
"loss": 0.8664458465576171,
|
|
"mean_token_accuracy": 0.7872038382291794,
|
|
"num_tokens": 15508700.0,
|
|
"step": 6250
|
|
},
|
|
{
|
|
"entropy": 0.9100985759496689,
|
|
"epoch": 1.3624763449580968,
|
|
"grad_norm": 0.4277743101119995,
|
|
"learning_rate": 6.377595155709343e-05,
|
|
"loss": 0.857872543334961,
|
|
"mean_token_accuracy": 0.789783950150013,
|
|
"num_tokens": 15633290.0,
|
|
"step": 6300
|
|
},
|
|
{
|
|
"entropy": 0.9173140367865562,
|
|
"epoch": 1.3732900783995674,
|
|
"grad_norm": 0.4199860692024231,
|
|
"learning_rate": 6.269463667820069e-05,
|
|
"loss": 0.8647206115722657,
|
|
"mean_token_accuracy": 0.7876332679390907,
|
|
"num_tokens": 15757680.0,
|
|
"step": 6350
|
|
},
|
|
{
|
|
"entropy": 0.9026758888363838,
|
|
"epoch": 1.384103811841038,
|
|
"grad_norm": 0.4447093605995178,
|
|
"learning_rate": 6.161332179930797e-05,
|
|
"loss": 0.852206039428711,
|
|
"mean_token_accuracy": 0.7904971277713776,
|
|
"num_tokens": 15881479.0,
|
|
"step": 6400
|
|
},
|
|
{
|
|
"entropy": 0.9004299190640449,
|
|
"epoch": 1.3949175452825089,
|
|
"grad_norm": 0.4434836208820343,
|
|
"learning_rate": 6.053200692041523e-05,
|
|
"loss": 0.8512306976318359,
|
|
"mean_token_accuracy": 0.7897326621413231,
|
|
"num_tokens": 16005931.0,
|
|
"step": 6450
|
|
},
|
|
{
|
|
"entropy": 0.9087580755352974,
|
|
"epoch": 1.4057312787239795,
|
|
"grad_norm": 0.46227923035621643,
|
|
"learning_rate": 5.945069204152249e-05,
|
|
"loss": 0.8583515930175781,
|
|
"mean_token_accuracy": 0.7887674975395202,
|
|
"num_tokens": 16130090.0,
|
|
"step": 6500
|
|
},
|
|
{
|
|
"entropy": 0.9138197112083435,
|
|
"epoch": 1.4165450121654501,
|
|
"grad_norm": 0.44878479838371277,
|
|
"learning_rate": 5.836937716262976e-05,
|
|
"loss": 0.8716845703125,
|
|
"mean_token_accuracy": 0.7864416247606277,
|
|
"num_tokens": 16253903.0,
|
|
"step": 6550
|
|
},
|
|
{
|
|
"entropy": 0.9011509630084038,
|
|
"epoch": 1.4273587456069208,
|
|
"grad_norm": 0.4811951220035553,
|
|
"learning_rate": 5.728806228373703e-05,
|
|
"loss": 0.8525293731689453,
|
|
"mean_token_accuracy": 0.7903577536344528,
|
|
"num_tokens": 16377468.0,
|
|
"step": 6600
|
|
},
|
|
{
|
|
"entropy": 0.8978265723586083,
|
|
"epoch": 1.4381724790483914,
|
|
"grad_norm": 0.45744097232818604,
|
|
"learning_rate": 5.62067474048443e-05,
|
|
"loss": 0.8496630096435547,
|
|
"mean_token_accuracy": 0.7911203283071518,
|
|
"num_tokens": 16500995.0,
|
|
"step": 6650
|
|
},
|
|
{
|
|
"entropy": 0.8898714819550514,
|
|
"epoch": 1.4489862124898623,
|
|
"grad_norm": 0.40814894437789917,
|
|
"learning_rate": 5.5125432525951556e-05,
|
|
"loss": 0.8335166168212891,
|
|
"mean_token_accuracy": 0.7936310169100761,
|
|
"num_tokens": 16626286.0,
|
|
"step": 6700
|
|
},
|
|
{
|
|
"entropy": 0.9007844230532647,
|
|
"epoch": 1.4597999459313327,
|
|
"grad_norm": 0.43813714385032654,
|
|
"learning_rate": 5.404411764705882e-05,
|
|
"loss": 0.8562016296386719,
|
|
"mean_token_accuracy": 0.7907173067331315,
|
|
"num_tokens": 16750088.0,
|
|
"step": 6750
|
|
},
|
|
{
|
|
"entropy": 0.8930699303746223,
|
|
"epoch": 1.4706136793728035,
|
|
"grad_norm": 0.4314170777797699,
|
|
"learning_rate": 5.2962802768166095e-05,
|
|
"loss": 0.842099380493164,
|
|
"mean_token_accuracy": 0.7926227453351021,
|
|
"num_tokens": 16874101.0,
|
|
"step": 6800
|
|
},
|
|
{
|
|
"entropy": 0.9194287118315697,
|
|
"epoch": 1.4814274128142741,
|
|
"grad_norm": 0.4140288531780243,
|
|
"learning_rate": 5.188148788927336e-05,
|
|
"loss": 0.8706341552734375,
|
|
"mean_token_accuracy": 0.7870542460680008,
|
|
"num_tokens": 16999223.0,
|
|
"step": 6850
|
|
},
|
|
{
|
|
"entropy": 0.8891421964764595,
|
|
"epoch": 1.4922411462557448,
|
|
"grad_norm": 0.39603111147880554,
|
|
"learning_rate": 5.080017301038063e-05,
|
|
"loss": 0.8380950927734375,
|
|
"mean_token_accuracy": 0.792621174454689,
|
|
"num_tokens": 17122254.0,
|
|
"step": 6900
|
|
},
|
|
{
|
|
"entropy": 0.895352121591568,
|
|
"epoch": 1.5030548796972156,
|
|
"grad_norm": 0.42102694511413574,
|
|
"learning_rate": 4.9718858131487893e-05,
|
|
"loss": 0.8501273345947266,
|
|
"mean_token_accuracy": 0.7897002854943276,
|
|
"num_tokens": 17245596.0,
|
|
"step": 6950
|
|
},
|
|
{
|
|
"entropy": 0.8813561688363553,
|
|
"epoch": 1.513868613138686,
|
|
"grad_norm": 0.45283544063568115,
|
|
"learning_rate": 4.863754325259516e-05,
|
|
"loss": 0.8325864410400391,
|
|
"mean_token_accuracy": 0.7939427027106285,
|
|
"num_tokens": 17370364.0,
|
|
"step": 7000
|
|
},
|
|
{
|
|
"entropy": 0.8949427655339242,
|
|
"epoch": 1.5246823465801569,
|
|
"grad_norm": 0.4460294246673584,
|
|
"learning_rate": 4.755622837370242e-05,
|
|
"loss": 0.8552775573730469,
|
|
"mean_token_accuracy": 0.7914402997493744,
|
|
"num_tokens": 17494953.0,
|
|
"step": 7050
|
|
},
|
|
{
|
|
"entropy": 0.8890387579798699,
|
|
"epoch": 1.5354960800216275,
|
|
"grad_norm": 0.44324299693107605,
|
|
"learning_rate": 4.647491349480969e-05,
|
|
"loss": 0.845006103515625,
|
|
"mean_token_accuracy": 0.7920720866322517,
|
|
"num_tokens": 17618264.0,
|
|
"step": 7100
|
|
},
|
|
{
|
|
"entropy": 0.8920091070234776,
|
|
"epoch": 1.5463098134630981,
|
|
"grad_norm": 0.4402289390563965,
|
|
"learning_rate": 4.539359861591695e-05,
|
|
"loss": 0.837669906616211,
|
|
"mean_token_accuracy": 0.7928368911147118,
|
|
"num_tokens": 17744204.0,
|
|
"step": 7150
|
|
},
|
|
{
|
|
"entropy": 0.889824809730053,
|
|
"epoch": 1.5571235469045688,
|
|
"grad_norm": 0.44565048813819885,
|
|
"learning_rate": 4.4312283737024224e-05,
|
|
"loss": 0.8392536163330078,
|
|
"mean_token_accuracy": 0.7935027378797531,
|
|
"num_tokens": 17868426.0,
|
|
"step": 7200
|
|
},
|
|
{
|
|
"entropy": 0.8985752832889556,
|
|
"epoch": 1.5679372803460394,
|
|
"grad_norm": 0.40883108973503113,
|
|
"learning_rate": 4.323096885813149e-05,
|
|
"loss": 0.8514070892333985,
|
|
"mean_token_accuracy": 0.7904807162284851,
|
|
"num_tokens": 17993385.0,
|
|
"step": 7250
|
|
},
|
|
{
|
|
"entropy": 0.8967047187685967,
|
|
"epoch": 1.5787510137875103,
|
|
"grad_norm": 0.4499186873435974,
|
|
"learning_rate": 4.2149653979238756e-05,
|
|
"loss": 0.8465667724609375,
|
|
"mean_token_accuracy": 0.7911185878515243,
|
|
"num_tokens": 18117259.0,
|
|
"step": 7300
|
|
},
|
|
{
|
|
"entropy": 0.8809721726179123,
|
|
"epoch": 1.5895647472289807,
|
|
"grad_norm": 0.44880008697509766,
|
|
"learning_rate": 4.106833910034602e-05,
|
|
"loss": 0.8331946563720704,
|
|
"mean_token_accuracy": 0.7946160012483596,
|
|
"num_tokens": 18240078.0,
|
|
"step": 7350
|
|
},
|
|
{
|
|
"entropy": 0.9095609071850776,
|
|
"epoch": 1.6003784806704515,
|
|
"grad_norm": 0.43093201518058777,
|
|
"learning_rate": 3.998702422145329e-05,
|
|
"loss": 0.8557829284667968,
|
|
"mean_token_accuracy": 0.7893132942914963,
|
|
"num_tokens": 18362981.0,
|
|
"step": 7400
|
|
},
|
|
{
|
|
"entropy": 0.8981089881062507,
|
|
"epoch": 1.6111922141119221,
|
|
"grad_norm": 0.4476851522922516,
|
|
"learning_rate": 3.8905709342560555e-05,
|
|
"loss": 0.8516233062744141,
|
|
"mean_token_accuracy": 0.7906690713763237,
|
|
"num_tokens": 18487033.0,
|
|
"step": 7450
|
|
},
|
|
{
|
|
"entropy": 0.8843596270680427,
|
|
"epoch": 1.6220059475533928,
|
|
"grad_norm": 0.42184218764305115,
|
|
"learning_rate": 3.782439446366782e-05,
|
|
"loss": 0.8364741516113281,
|
|
"mean_token_accuracy": 0.7930273136496544,
|
|
"num_tokens": 18609707.0,
|
|
"step": 7500
|
|
},
|
|
{
|
|
"entropy": 0.8913967382907867,
|
|
"epoch": 1.6328196809948636,
|
|
"grad_norm": 0.47947627305984497,
|
|
"learning_rate": 3.674307958477509e-05,
|
|
"loss": 0.8383011627197265,
|
|
"mean_token_accuracy": 0.7928972747921944,
|
|
"num_tokens": 18733842.0,
|
|
"step": 7550
|
|
},
|
|
{
|
|
"entropy": 0.904424863755703,
|
|
"epoch": 1.643633414436334,
|
|
"grad_norm": 0.46697962284088135,
|
|
"learning_rate": 3.566176470588235e-05,
|
|
"loss": 0.8559224700927734,
|
|
"mean_token_accuracy": 0.7903643989562988,
|
|
"num_tokens": 18858638.0,
|
|
"step": 7600
|
|
},
|
|
{
|
|
"entropy": 0.9022110059857369,
|
|
"epoch": 1.654447147877805,
|
|
"grad_norm": 0.45136377215385437,
|
|
"learning_rate": 3.458044982698962e-05,
|
|
"loss": 0.8566456604003906,
|
|
"mean_token_accuracy": 0.7907618317008018,
|
|
"num_tokens": 18982587.0,
|
|
"step": 7650
|
|
},
|
|
{
|
|
"entropy": 0.9050062775611878,
|
|
"epoch": 1.6652608813192755,
|
|
"grad_norm": 0.4139866232872009,
|
|
"learning_rate": 3.3499134948096885e-05,
|
|
"loss": 0.861201171875,
|
|
"mean_token_accuracy": 0.7896919503808022,
|
|
"num_tokens": 19106387.0,
|
|
"step": 7700
|
|
},
|
|
{
|
|
"entropy": 0.886629047691822,
|
|
"epoch": 1.6760746147607462,
|
|
"grad_norm": 0.44926849007606506,
|
|
"learning_rate": 3.241782006920415e-05,
|
|
"loss": 0.8297128295898437,
|
|
"mean_token_accuracy": 0.7931997072696686,
|
|
"num_tokens": 19231339.0,
|
|
"step": 7750
|
|
},
|
|
{
|
|
"entropy": 0.9005002236366272,
|
|
"epoch": 1.6868883482022168,
|
|
"grad_norm": 0.423841267824173,
|
|
"learning_rate": 3.1336505190311425e-05,
|
|
"loss": 0.8561599731445313,
|
|
"mean_token_accuracy": 0.7903113690018654,
|
|
"num_tokens": 19355849.0,
|
|
"step": 7800
|
|
},
|
|
{
|
|
"entropy": 0.9021791964769363,
|
|
"epoch": 1.6977020816436874,
|
|
"grad_norm": 0.4209560453891754,
|
|
"learning_rate": 3.0255190311418684e-05,
|
|
"loss": 0.8545565795898438,
|
|
"mean_token_accuracy": 0.7901014927029609,
|
|
"num_tokens": 19478753.0,
|
|
"step": 7850
|
|
},
|
|
{
|
|
"entropy": 0.8979122492671013,
|
|
"epoch": 1.7085158150851583,
|
|
"grad_norm": 0.4141550362110138,
|
|
"learning_rate": 2.9173875432525953e-05,
|
|
"loss": 0.8544991302490235,
|
|
"mean_token_accuracy": 0.7914391565322876,
|
|
"num_tokens": 19602086.0,
|
|
"step": 7900
|
|
},
|
|
{
|
|
"entropy": 0.8933442781865597,
|
|
"epoch": 1.7193295485266287,
|
|
"grad_norm": 0.4385141134262085,
|
|
"learning_rate": 2.809256055363322e-05,
|
|
"loss": 0.8341728210449219,
|
|
"mean_token_accuracy": 0.7917815256118774,
|
|
"num_tokens": 19727781.0,
|
|
"step": 7950
|
|
},
|
|
{
|
|
"entropy": 0.8998776164650917,
|
|
"epoch": 1.7301432819680995,
|
|
"grad_norm": 0.45398640632629395,
|
|
"learning_rate": 2.701124567474049e-05,
|
|
"loss": 0.8528588104248047,
|
|
"mean_token_accuracy": 0.792190115749836,
|
|
"num_tokens": 19851594.0,
|
|
"step": 8000
|
|
},
|
|
{
|
|
"entropy": 0.892754037976265,
|
|
"epoch": 1.7409570154095702,
|
|
"grad_norm": 0.47462132573127747,
|
|
"learning_rate": 2.5929930795847752e-05,
|
|
"loss": 0.840518798828125,
|
|
"mean_token_accuracy": 0.7920694491267204,
|
|
"num_tokens": 19975207.0,
|
|
"step": 8050
|
|
},
|
|
{
|
|
"entropy": 0.8812836146354676,
|
|
"epoch": 1.7517707488510408,
|
|
"grad_norm": 0.4710637331008911,
|
|
"learning_rate": 2.4848615916955018e-05,
|
|
"loss": 0.8354582977294922,
|
|
"mean_token_accuracy": 0.7938078027963639,
|
|
"num_tokens": 20098767.0,
|
|
"step": 8100
|
|
},
|
|
{
|
|
"entropy": 0.9079604044556617,
|
|
"epoch": 1.7625844822925116,
|
|
"grad_norm": 0.4462928771972656,
|
|
"learning_rate": 2.3767301038062284e-05,
|
|
"loss": 0.8649079895019531,
|
|
"mean_token_accuracy": 0.7882503977417946,
|
|
"num_tokens": 20221342.0,
|
|
"step": 8150
|
|
},
|
|
{
|
|
"entropy": 0.9004536290466786,
|
|
"epoch": 1.773398215733982,
|
|
"grad_norm": 0.45321500301361084,
|
|
"learning_rate": 2.268598615916955e-05,
|
|
"loss": 0.8432342529296875,
|
|
"mean_token_accuracy": 0.7915318152308464,
|
|
"num_tokens": 20345736.0,
|
|
"step": 8200
|
|
},
|
|
{
|
|
"entropy": 0.8878625386953354,
|
|
"epoch": 1.784211949175453,
|
|
"grad_norm": 0.4515564441680908,
|
|
"learning_rate": 2.1604671280276816e-05,
|
|
"loss": 0.8415538787841796,
|
|
"mean_token_accuracy": 0.7937631767988205,
|
|
"num_tokens": 20468454.0,
|
|
"step": 8250
|
|
},
|
|
{
|
|
"entropy": 0.8986021995544433,
|
|
"epoch": 1.7950256826169235,
|
|
"grad_norm": 0.41134029626846313,
|
|
"learning_rate": 2.0523356401384082e-05,
|
|
"loss": 0.8482095336914063,
|
|
"mean_token_accuracy": 0.7904923775792122,
|
|
"num_tokens": 20592267.0,
|
|
"step": 8300
|
|
},
|
|
{
|
|
"entropy": 0.8866394762694836,
|
|
"epoch": 1.8058394160583942,
|
|
"grad_norm": 0.4210875630378723,
|
|
"learning_rate": 1.944204152249135e-05,
|
|
"loss": 0.8331266784667969,
|
|
"mean_token_accuracy": 0.7945139765739441,
|
|
"num_tokens": 20715989.0,
|
|
"step": 8350
|
|
},
|
|
{
|
|
"entropy": 0.8755089569091797,
|
|
"epoch": 1.8166531494998648,
|
|
"grad_norm": 0.4533572494983673,
|
|
"learning_rate": 1.8360726643598615e-05,
|
|
"loss": 0.8205814361572266,
|
|
"mean_token_accuracy": 0.7964674273133278,
|
|
"num_tokens": 20840369.0,
|
|
"step": 8400
|
|
},
|
|
{
|
|
"entropy": 0.9032151979207993,
|
|
"epoch": 1.8274668829413354,
|
|
"grad_norm": 0.44914165139198303,
|
|
"learning_rate": 1.7279411764705884e-05,
|
|
"loss": 0.8586707305908203,
|
|
"mean_token_accuracy": 0.78990562915802,
|
|
"num_tokens": 20963723.0,
|
|
"step": 8450
|
|
},
|
|
{
|
|
"entropy": 0.910922072827816,
|
|
"epoch": 1.8382806163828063,
|
|
"grad_norm": 0.4496135413646698,
|
|
"learning_rate": 1.619809688581315e-05,
|
|
"loss": 0.8673530578613281,
|
|
"mean_token_accuracy": 0.7873152518272399,
|
|
"num_tokens": 21088181.0,
|
|
"step": 8500
|
|
},
|
|
{
|
|
"entropy": 0.8813124758005142,
|
|
"epoch": 1.8490943498242767,
|
|
"grad_norm": 0.42211201786994934,
|
|
"learning_rate": 1.5116782006920416e-05,
|
|
"loss": 0.8353459167480469,
|
|
"mean_token_accuracy": 0.7926122716069222,
|
|
"num_tokens": 21211040.0,
|
|
"step": 8550
|
|
},
|
|
{
|
|
"entropy": 0.8873917120695114,
|
|
"epoch": 1.8599080832657475,
|
|
"grad_norm": 0.43914568424224854,
|
|
"learning_rate": 1.4035467128027683e-05,
|
|
"loss": 0.8401344299316407,
|
|
"mean_token_accuracy": 0.7918064197897912,
|
|
"num_tokens": 21334606.0,
|
|
"step": 8600
|
|
},
|
|
{
|
|
"entropy": 0.8984066820144654,
|
|
"epoch": 1.8707218167072182,
|
|
"grad_norm": 0.41893091797828674,
|
|
"learning_rate": 1.2954152249134949e-05,
|
|
"loss": 0.8443552398681641,
|
|
"mean_token_accuracy": 0.7918626227974892,
|
|
"num_tokens": 21459666.0,
|
|
"step": 8650
|
|
},
|
|
{
|
|
"entropy": 0.8930890628695488,
|
|
"epoch": 1.8815355501486888,
|
|
"grad_norm": 0.44205015897750854,
|
|
"learning_rate": 1.1872837370242215e-05,
|
|
"loss": 0.8401639556884766,
|
|
"mean_token_accuracy": 0.7935298785567284,
|
|
"num_tokens": 21583077.0,
|
|
"step": 8700
|
|
},
|
|
{
|
|
"entropy": 0.9020170900225639,
|
|
"epoch": 1.8923492835901596,
|
|
"grad_norm": 0.4392000138759613,
|
|
"learning_rate": 1.0791522491349481e-05,
|
|
"loss": 0.8579644012451172,
|
|
"mean_token_accuracy": 0.7897423833608628,
|
|
"num_tokens": 21707128.0,
|
|
"step": 8750
|
|
},
|
|
{
|
|
"entropy": 0.9027775958180427,
|
|
"epoch": 1.90316301703163,
|
|
"grad_norm": 0.43825313448905945,
|
|
"learning_rate": 9.710207612456749e-06,
|
|
"loss": 0.8531570434570312,
|
|
"mean_token_accuracy": 0.790492342710495,
|
|
"num_tokens": 21830215.0,
|
|
"step": 8800
|
|
},
|
|
{
|
|
"entropy": 0.8812837514281273,
|
|
"epoch": 1.913976750473101,
|
|
"grad_norm": 0.42390820384025574,
|
|
"learning_rate": 8.628892733564015e-06,
|
|
"loss": 0.8283145904541016,
|
|
"mean_token_accuracy": 0.7954829892516136,
|
|
"num_tokens": 21953700.0,
|
|
"step": 8850
|
|
},
|
|
{
|
|
"entropy": 0.8897942188382149,
|
|
"epoch": 1.9247904839145715,
|
|
"grad_norm": 0.4596537947654724,
|
|
"learning_rate": 7.547577854671281e-06,
|
|
"loss": 0.8386060333251953,
|
|
"mean_token_accuracy": 0.7931151929497718,
|
|
"num_tokens": 22077792.0,
|
|
"step": 8900
|
|
},
|
|
{
|
|
"entropy": 0.8938576748967171,
|
|
"epoch": 1.9356042173560422,
|
|
"grad_norm": 0.46790581941604614,
|
|
"learning_rate": 6.466262975778547e-06,
|
|
"loss": 0.8432554626464843,
|
|
"mean_token_accuracy": 0.7908243858814239,
|
|
"num_tokens": 22202595.0,
|
|
"step": 8950
|
|
},
|
|
{
|
|
"entropy": 0.8687146976590157,
|
|
"epoch": 1.9464179507975128,
|
|
"grad_norm": 0.4183248281478882,
|
|
"learning_rate": 5.384948096885813e-06,
|
|
"loss": 0.8164421081542969,
|
|
"mean_token_accuracy": 0.797261960208416,
|
|
"num_tokens": 22326277.0,
|
|
"step": 9000
|
|
},
|
|
{
|
|
"entropy": 0.8912187734246254,
|
|
"epoch": 1.9572316842389834,
|
|
"grad_norm": 0.45960116386413574,
|
|
"learning_rate": 4.3036332179930795e-06,
|
|
"loss": 0.8438924407958984,
|
|
"mean_token_accuracy": 0.7918629994988442,
|
|
"num_tokens": 22450216.0,
|
|
"step": 9050
|
|
},
|
|
{
|
|
"entropy": 0.898259950876236,
|
|
"epoch": 1.9680454176804543,
|
|
"grad_norm": 0.4388628602027893,
|
|
"learning_rate": 3.2223183391003465e-06,
|
|
"loss": 0.847455825805664,
|
|
"mean_token_accuracy": 0.7898680579662323,
|
|
"num_tokens": 22574348.0,
|
|
"step": 9100
|
|
},
|
|
{
|
|
"entropy": 0.8813413712382316,
|
|
"epoch": 1.978859151121925,
|
|
"grad_norm": 0.4684664309024811,
|
|
"learning_rate": 2.141003460207612e-06,
|
|
"loss": 0.825401840209961,
|
|
"mean_token_accuracy": 0.7962829551100731,
|
|
"num_tokens": 22697104.0,
|
|
"step": 9150
|
|
},
|
|
{
|
|
"entropy": 0.8889286285638809,
|
|
"epoch": 1.9896728845633955,
|
|
"grad_norm": 0.44697582721710205,
|
|
"learning_rate": 1.059688581314879e-06,
|
|
"loss": 0.8396756744384766,
|
|
"mean_token_accuracy": 0.7933326533436775,
|
|
"num_tokens": 22820789.0,
|
|
"step": 9200
|
|
}
|
|
],
|
|
"logging_steps": 50,
|
|
"max_steps": 9248,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 2,
|
|
"save_steps": 500,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": true
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 4.7764997051480064e+17,
|
|
"train_batch_size": 2,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|