Model: codingmonster1234/Qwen3-4B-Instruct-2507-Chess-Reasoning-SFT-v2 Source: Original Platform
886 lines
24 KiB
JSON
886 lines
24 KiB
JSON
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 1.0,
|
|
"eval_steps": 500,
|
|
"global_step": 84,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"entropy": 1.0289964377880096,
|
|
"epoch": 0.011904761904761904,
|
|
"grad_norm": 27.125,
|
|
"learning_rate": 2e-05,
|
|
"loss": 2.2931,
|
|
"mean_token_accuracy": 0.5738132819533348,
|
|
"num_tokens": 29832.0,
|
|
"step": 1
|
|
},
|
|
{
|
|
"entropy": 1.44026979804039,
|
|
"epoch": 0.023809523809523808,
|
|
"grad_norm": 6.3125,
|
|
"learning_rate": 1.999922292480975e-05,
|
|
"loss": 1.5703,
|
|
"mean_token_accuracy": 0.6421284079551697,
|
|
"num_tokens": 58835.0,
|
|
"step": 2
|
|
},
|
|
{
|
|
"entropy": 1.6413304507732391,
|
|
"epoch": 0.03571428571428571,
|
|
"grad_norm": 4.0625,
|
|
"learning_rate": 1.9996891820008165e-05,
|
|
"loss": 1.5037,
|
|
"mean_token_accuracy": 0.6544012948870659,
|
|
"num_tokens": 88089.0,
|
|
"step": 3
|
|
},
|
|
{
|
|
"entropy": 1.4298747032880783,
|
|
"epoch": 0.047619047619047616,
|
|
"grad_norm": 3.171875,
|
|
"learning_rate": 1.9993007047883988e-05,
|
|
"loss": 1.3305,
|
|
"mean_token_accuracy": 0.6857858076691628,
|
|
"num_tokens": 116996.0,
|
|
"step": 4
|
|
},
|
|
{
|
|
"entropy": 1.266538918018341,
|
|
"epoch": 0.05952380952380952,
|
|
"grad_norm": 2.53125,
|
|
"learning_rate": 1.9987569212189224e-05,
|
|
"loss": 1.2618,
|
|
"mean_token_accuracy": 0.6996989399194717,
|
|
"num_tokens": 146502.0,
|
|
"step": 5
|
|
},
|
|
{
|
|
"entropy": 1.1705086678266525,
|
|
"epoch": 0.07142857142857142,
|
|
"grad_norm": 2.515625,
|
|
"learning_rate": 1.9980579158045322e-05,
|
|
"loss": 1.2323,
|
|
"mean_token_accuracy": 0.6959410309791565,
|
|
"num_tokens": 175000.0,
|
|
"step": 6
|
|
},
|
|
{
|
|
"entropy": 1.1460798904299736,
|
|
"epoch": 0.08333333333333333,
|
|
"grad_norm": 2.546875,
|
|
"learning_rate": 1.9972037971811802e-05,
|
|
"loss": 1.2006,
|
|
"mean_token_accuracy": 0.7042278572916985,
|
|
"num_tokens": 203581.0,
|
|
"step": 7
|
|
},
|
|
{
|
|
"entropy": 1.086261309683323,
|
|
"epoch": 0.09523809523809523,
|
|
"grad_norm": 2.28125,
|
|
"learning_rate": 1.9961946980917457e-05,
|
|
"loss": 1.1341,
|
|
"mean_token_accuracy": 0.7203333824872971,
|
|
"num_tokens": 233225.0,
|
|
"step": 8
|
|
},
|
|
{
|
|
"entropy": 1.1471993625164032,
|
|
"epoch": 0.10714285714285714,
|
|
"grad_norm": 2.25,
|
|
"learning_rate": 1.9950307753654016e-05,
|
|
"loss": 1.1864,
|
|
"mean_token_accuracy": 0.7060119584202766,
|
|
"num_tokens": 261557.0,
|
|
"step": 9
|
|
},
|
|
{
|
|
"entropy": 1.1250567734241486,
|
|
"epoch": 0.11904761904761904,
|
|
"grad_norm": 2.125,
|
|
"learning_rate": 1.9937122098932428e-05,
|
|
"loss": 1.1066,
|
|
"mean_token_accuracy": 0.717756524682045,
|
|
"num_tokens": 290843.0,
|
|
"step": 10
|
|
},
|
|
{
|
|
"entropy": 1.0941710397601128,
|
|
"epoch": 0.13095238095238096,
|
|
"grad_norm": 1.921875,
|
|
"learning_rate": 1.9922392066001724e-05,
|
|
"loss": 1.0633,
|
|
"mean_token_accuracy": 0.7308941036462784,
|
|
"num_tokens": 320963.0,
|
|
"step": 11
|
|
},
|
|
{
|
|
"entropy": 1.0973558276891708,
|
|
"epoch": 0.14285714285714285,
|
|
"grad_norm": 2.03125,
|
|
"learning_rate": 1.9906119944130527e-05,
|
|
"loss": 1.0542,
|
|
"mean_token_accuracy": 0.7335255369544029,
|
|
"num_tokens": 350648.0,
|
|
"step": 12
|
|
},
|
|
{
|
|
"entropy": 1.0850690826773643,
|
|
"epoch": 0.15476190476190477,
|
|
"grad_norm": 2.0625,
|
|
"learning_rate": 1.9888308262251286e-05,
|
|
"loss": 1.0634,
|
|
"mean_token_accuracy": 0.7266389280557632,
|
|
"num_tokens": 380096.0,
|
|
"step": 13
|
|
},
|
|
{
|
|
"entropy": 1.0478279069066048,
|
|
"epoch": 0.16666666666666666,
|
|
"grad_norm": 2.171875,
|
|
"learning_rate": 1.9868959788567213e-05,
|
|
"loss": 1.057,
|
|
"mean_token_accuracy": 0.7326076179742813,
|
|
"num_tokens": 407435.0,
|
|
"step": 14
|
|
},
|
|
{
|
|
"entropy": 1.0213893577456474,
|
|
"epoch": 0.17857142857142858,
|
|
"grad_norm": 2.0,
|
|
"learning_rate": 1.9848077530122083e-05,
|
|
"loss": 1.012,
|
|
"mean_token_accuracy": 0.7387356385588646,
|
|
"num_tokens": 435734.0,
|
|
"step": 15
|
|
},
|
|
{
|
|
"entropy": 1.07327102124691,
|
|
"epoch": 0.19047619047619047,
|
|
"grad_norm": 2.03125,
|
|
"learning_rate": 1.9825664732332886e-05,
|
|
"loss": 1.0868,
|
|
"mean_token_accuracy": 0.7211552038788795,
|
|
"num_tokens": 464973.0,
|
|
"step": 16
|
|
},
|
|
{
|
|
"entropy": 1.0235116630792618,
|
|
"epoch": 0.20238095238095238,
|
|
"grad_norm": 1.984375,
|
|
"learning_rate": 1.9801724878485438e-05,
|
|
"loss": 1.0377,
|
|
"mean_token_accuracy": 0.7334162965416908,
|
|
"num_tokens": 493135.0,
|
|
"step": 17
|
|
},
|
|
{
|
|
"entropy": 0.9607449993491173,
|
|
"epoch": 0.21428571428571427,
|
|
"grad_norm": 1.8984375,
|
|
"learning_rate": 1.977626168919305e-05,
|
|
"loss": 0.9745,
|
|
"mean_token_accuracy": 0.7495110481977463,
|
|
"num_tokens": 522656.0,
|
|
"step": 18
|
|
},
|
|
{
|
|
"entropy": 1.0044650733470917,
|
|
"epoch": 0.2261904761904762,
|
|
"grad_norm": 1.8984375,
|
|
"learning_rate": 1.9749279121818235e-05,
|
|
"loss": 1.0128,
|
|
"mean_token_accuracy": 0.7394910976290703,
|
|
"num_tokens": 551875.0,
|
|
"step": 19
|
|
},
|
|
{
|
|
"entropy": 1.009770929813385,
|
|
"epoch": 0.23809523809523808,
|
|
"grad_norm": 1.921875,
|
|
"learning_rate": 1.9720781369857747e-05,
|
|
"loss": 1.0019,
|
|
"mean_token_accuracy": 0.7396527603268623,
|
|
"num_tokens": 580523.0,
|
|
"step": 20
|
|
},
|
|
{
|
|
"entropy": 1.0536553114652634,
|
|
"epoch": 0.25,
|
|
"grad_norm": 1.9140625,
|
|
"learning_rate": 1.969077286229078e-05,
|
|
"loss": 1.0288,
|
|
"mean_token_accuracy": 0.7323001325130463,
|
|
"num_tokens": 609771.0,
|
|
"step": 21
|
|
},
|
|
{
|
|
"entropy": 0.964533656835556,
|
|
"epoch": 0.2619047619047619,
|
|
"grad_norm": 1.828125,
|
|
"learning_rate": 1.9659258262890683e-05,
|
|
"loss": 0.9512,
|
|
"mean_token_accuracy": 0.7494053766131401,
|
|
"num_tokens": 639104.0,
|
|
"step": 22
|
|
},
|
|
{
|
|
"entropy": 0.9821470007300377,
|
|
"epoch": 0.27380952380952384,
|
|
"grad_norm": 1.890625,
|
|
"learning_rate": 1.962624246950012e-05,
|
|
"loss": 0.9739,
|
|
"mean_token_accuracy": 0.7434249892830849,
|
|
"num_tokens": 667792.0,
|
|
"step": 23
|
|
},
|
|
{
|
|
"entropy": 0.9782575219869614,
|
|
"epoch": 0.2857142857142857,
|
|
"grad_norm": 1.796875,
|
|
"learning_rate": 1.9591730613269878e-05,
|
|
"loss": 0.9898,
|
|
"mean_token_accuracy": 0.7400899454951286,
|
|
"num_tokens": 696742.0,
|
|
"step": 24
|
|
},
|
|
{
|
|
"entropy": 0.942177914083004,
|
|
"epoch": 0.2976190476190476,
|
|
"grad_norm": 1.859375,
|
|
"learning_rate": 1.955572805786141e-05,
|
|
"loss": 0.9489,
|
|
"mean_token_accuracy": 0.7481768950819969,
|
|
"num_tokens": 725968.0,
|
|
"step": 25
|
|
},
|
|
{
|
|
"entropy": 0.9274484664201736,
|
|
"epoch": 0.30952380952380953,
|
|
"grad_norm": 1.921875,
|
|
"learning_rate": 1.9518240398613226e-05,
|
|
"loss": 0.9505,
|
|
"mean_token_accuracy": 0.7481107041239738,
|
|
"num_tokens": 755689.0,
|
|
"step": 26
|
|
},
|
|
{
|
|
"entropy": 0.9720096439123154,
|
|
"epoch": 0.32142857142857145,
|
|
"grad_norm": 1.8828125,
|
|
"learning_rate": 1.947927346167132e-05,
|
|
"loss": 0.9928,
|
|
"mean_token_accuracy": 0.7357244342565536,
|
|
"num_tokens": 784977.0,
|
|
"step": 27
|
|
},
|
|
{
|
|
"entropy": 0.9152235984802246,
|
|
"epoch": 0.3333333333333333,
|
|
"grad_norm": 1.8046875,
|
|
"learning_rate": 1.9438833303083677e-05,
|
|
"loss": 0.9064,
|
|
"mean_token_accuracy": 0.7547181248664856,
|
|
"num_tokens": 814048.0,
|
|
"step": 28
|
|
},
|
|
{
|
|
"entropy": 0.9777852222323418,
|
|
"epoch": 0.34523809523809523,
|
|
"grad_norm": 1.8359375,
|
|
"learning_rate": 1.9396926207859085e-05,
|
|
"loss": 0.9833,
|
|
"mean_token_accuracy": 0.7389796674251556,
|
|
"num_tokens": 843602.0,
|
|
"step": 29
|
|
},
|
|
{
|
|
"entropy": 0.9311033263802528,
|
|
"epoch": 0.35714285714285715,
|
|
"grad_norm": 2.875,
|
|
"learning_rate": 1.935355868899034e-05,
|
|
"loss": 0.9277,
|
|
"mean_token_accuracy": 0.7512769624590874,
|
|
"num_tokens": 871915.0,
|
|
"step": 30
|
|
},
|
|
{
|
|
"entropy": 0.97285395860672,
|
|
"epoch": 0.36904761904761907,
|
|
"grad_norm": 1.8984375,
|
|
"learning_rate": 1.9308737486442045e-05,
|
|
"loss": 0.9626,
|
|
"mean_token_accuracy": 0.7445296198129654,
|
|
"num_tokens": 900851.0,
|
|
"step": 31
|
|
},
|
|
{
|
|
"entropy": 0.8841484859585762,
|
|
"epoch": 0.38095238095238093,
|
|
"grad_norm": 1.7421875,
|
|
"learning_rate": 1.926246956610309e-05,
|
|
"loss": 0.8828,
|
|
"mean_token_accuracy": 0.7655422911047935,
|
|
"num_tokens": 929498.0,
|
|
"step": 32
|
|
},
|
|
{
|
|
"entropy": 0.9625014588236809,
|
|
"epoch": 0.39285714285714285,
|
|
"grad_norm": 1.7890625,
|
|
"learning_rate": 1.921476211870408e-05,
|
|
"loss": 0.9449,
|
|
"mean_token_accuracy": 0.7469100803136826,
|
|
"num_tokens": 958933.0,
|
|
"step": 33
|
|
},
|
|
{
|
|
"entropy": 0.9233517870306969,
|
|
"epoch": 0.40476190476190477,
|
|
"grad_norm": 1.765625,
|
|
"learning_rate": 1.9165622558699763e-05,
|
|
"loss": 0.9282,
|
|
"mean_token_accuracy": 0.7555889263749123,
|
|
"num_tokens": 987731.0,
|
|
"step": 34
|
|
},
|
|
{
|
|
"entropy": 0.9165640994906425,
|
|
"epoch": 0.4166666666666667,
|
|
"grad_norm": 1.7265625,
|
|
"learning_rate": 1.9115058523116734e-05,
|
|
"loss": 0.8923,
|
|
"mean_token_accuracy": 0.761642724275589,
|
|
"num_tokens": 1017002.0,
|
|
"step": 35
|
|
},
|
|
{
|
|
"entropy": 0.9459593519568443,
|
|
"epoch": 0.42857142857142855,
|
|
"grad_norm": 1.6953125,
|
|
"learning_rate": 1.9063077870366504e-05,
|
|
"loss": 0.9472,
|
|
"mean_token_accuracy": 0.7494409009814262,
|
|
"num_tokens": 1046678.0,
|
|
"step": 36
|
|
},
|
|
{
|
|
"entropy": 0.9148919209837914,
|
|
"epoch": 0.44047619047619047,
|
|
"grad_norm": 1.8046875,
|
|
"learning_rate": 1.900968867902419e-05,
|
|
"loss": 0.9092,
|
|
"mean_token_accuracy": 0.7560340315103531,
|
|
"num_tokens": 1074445.0,
|
|
"step": 37
|
|
},
|
|
{
|
|
"entropy": 0.8793367967009544,
|
|
"epoch": 0.4523809523809524,
|
|
"grad_norm": 1.875,
|
|
"learning_rate": 1.895489924657301e-05,
|
|
"loss": 0.864,
|
|
"mean_token_accuracy": 0.767846867442131,
|
|
"num_tokens": 1103620.0,
|
|
"step": 38
|
|
},
|
|
{
|
|
"entropy": 0.9116434380412102,
|
|
"epoch": 0.4642857142857143,
|
|
"grad_norm": 1.828125,
|
|
"learning_rate": 1.8898718088114688e-05,
|
|
"loss": 0.8928,
|
|
"mean_token_accuracy": 0.7605250775814056,
|
|
"num_tokens": 1132637.0,
|
|
"step": 39
|
|
},
|
|
{
|
|
"entropy": 0.8998617604374886,
|
|
"epoch": 0.47619047619047616,
|
|
"grad_norm": 1.6796875,
|
|
"learning_rate": 1.8841153935046098e-05,
|
|
"loss": 0.8715,
|
|
"mean_token_accuracy": 0.7635523602366447,
|
|
"num_tokens": 1161527.0,
|
|
"step": 40
|
|
},
|
|
{
|
|
"entropy": 0.8533368110656738,
|
|
"epoch": 0.4880952380952381,
|
|
"grad_norm": 1.7109375,
|
|
"learning_rate": 1.8782215733702286e-05,
|
|
"loss": 0.86,
|
|
"mean_token_accuracy": 0.7679954171180725,
|
|
"num_tokens": 1190701.0,
|
|
"step": 41
|
|
},
|
|
{
|
|
"entropy": 0.9144820719957352,
|
|
"epoch": 0.5,
|
|
"grad_norm": 1.9140625,
|
|
"learning_rate": 1.8721912643966055e-05,
|
|
"loss": 0.9308,
|
|
"mean_token_accuracy": 0.7519562095403671,
|
|
"num_tokens": 1218835.0,
|
|
"step": 42
|
|
},
|
|
{
|
|
"entropy": 0.8947170972824097,
|
|
"epoch": 0.5119047619047619,
|
|
"grad_norm": 1.78125,
|
|
"learning_rate": 1.866025403784439e-05,
|
|
"loss": 0.8931,
|
|
"mean_token_accuracy": 0.7597509473562241,
|
|
"num_tokens": 1248679.0,
|
|
"step": 43
|
|
},
|
|
{
|
|
"entropy": 0.8477422297000885,
|
|
"epoch": 0.5238095238095238,
|
|
"grad_norm": 1.7890625,
|
|
"learning_rate": 1.8597249498011906e-05,
|
|
"loss": 0.8518,
|
|
"mean_token_accuracy": 0.772525392472744,
|
|
"num_tokens": 1277106.0,
|
|
"step": 44
|
|
},
|
|
{
|
|
"entropy": 0.9015490636229515,
|
|
"epoch": 0.5357142857142857,
|
|
"grad_norm": 1.8046875,
|
|
"learning_rate": 1.8532908816321557e-05,
|
|
"loss": 0.9015,
|
|
"mean_token_accuracy": 0.7591351941227913,
|
|
"num_tokens": 1305983.0,
|
|
"step": 45
|
|
},
|
|
{
|
|
"entropy": 0.931048758327961,
|
|
"epoch": 0.5476190476190477,
|
|
"grad_norm": 1.8515625,
|
|
"learning_rate": 1.8467241992282842e-05,
|
|
"loss": 0.9067,
|
|
"mean_token_accuracy": 0.7518437430262566,
|
|
"num_tokens": 1334578.0,
|
|
"step": 46
|
|
},
|
|
{
|
|
"entropy": 0.8747421428561211,
|
|
"epoch": 0.5595238095238095,
|
|
"grad_norm": 1.796875,
|
|
"learning_rate": 1.8400259231507716e-05,
|
|
"loss": 0.8576,
|
|
"mean_token_accuracy": 0.7661429345607758,
|
|
"num_tokens": 1362873.0,
|
|
"step": 47
|
|
},
|
|
{
|
|
"entropy": 0.8680180609226227,
|
|
"epoch": 0.5714285714285714,
|
|
"grad_norm": 1.7734375,
|
|
"learning_rate": 1.833197094412449e-05,
|
|
"loss": 0.8586,
|
|
"mean_token_accuracy": 0.7713808715343475,
|
|
"num_tokens": 1391315.0,
|
|
"step": 48
|
|
},
|
|
{
|
|
"entropy": 0.8663084208965302,
|
|
"epoch": 0.5833333333333334,
|
|
"grad_norm": 1.7734375,
|
|
"learning_rate": 1.826238774315995e-05,
|
|
"loss": 0.8471,
|
|
"mean_token_accuracy": 0.7667829617857933,
|
|
"num_tokens": 1419829.0,
|
|
"step": 49
|
|
},
|
|
{
|
|
"entropy": 0.8798943981528282,
|
|
"epoch": 0.5952380952380952,
|
|
"grad_norm": 1.84375,
|
|
"learning_rate": 1.819152044288992e-05,
|
|
"loss": 0.8961,
|
|
"mean_token_accuracy": 0.7574765011668205,
|
|
"num_tokens": 1447790.0,
|
|
"step": 50
|
|
},
|
|
{
|
|
"entropy": 0.8617029711604118,
|
|
"epoch": 0.6071428571428571,
|
|
"grad_norm": 1.8671875,
|
|
"learning_rate": 1.811938005715857e-05,
|
|
"loss": 0.8544,
|
|
"mean_token_accuracy": 0.7637034431099892,
|
|
"num_tokens": 1476278.0,
|
|
"step": 51
|
|
},
|
|
{
|
|
"entropy": 0.9306018576025963,
|
|
"epoch": 0.6190476190476191,
|
|
"grad_norm": 1.9453125,
|
|
"learning_rate": 1.8045977797666685e-05,
|
|
"loss": 0.9506,
|
|
"mean_token_accuracy": 0.7459357306361198,
|
|
"num_tokens": 1503947.0,
|
|
"step": 52
|
|
},
|
|
{
|
|
"entropy": 0.8792530596256256,
|
|
"epoch": 0.6309523809523809,
|
|
"grad_norm": 1.8046875,
|
|
"learning_rate": 1.7971325072229227e-05,
|
|
"loss": 0.9022,
|
|
"mean_token_accuracy": 0.7546841576695442,
|
|
"num_tokens": 1533531.0,
|
|
"step": 53
|
|
},
|
|
{
|
|
"entropy": 0.8904775232076645,
|
|
"epoch": 0.6428571428571429,
|
|
"grad_norm": 1.890625,
|
|
"learning_rate": 1.7895433483002356e-05,
|
|
"loss": 0.9174,
|
|
"mean_token_accuracy": 0.757450558245182,
|
|
"num_tokens": 1561412.0,
|
|
"step": 54
|
|
},
|
|
{
|
|
"entropy": 0.8826311081647873,
|
|
"epoch": 0.6547619047619048,
|
|
"grad_norm": 1.8828125,
|
|
"learning_rate": 1.78183148246803e-05,
|
|
"loss": 0.8745,
|
|
"mean_token_accuracy": 0.7593515664339066,
|
|
"num_tokens": 1590336.0,
|
|
"step": 55
|
|
},
|
|
{
|
|
"entropy": 0.8883182108402252,
|
|
"epoch": 0.6666666666666666,
|
|
"grad_norm": 1.703125,
|
|
"learning_rate": 1.7739981082662275e-05,
|
|
"loss": 0.8739,
|
|
"mean_token_accuracy": 0.7626457437872887,
|
|
"num_tokens": 1620442.0,
|
|
"step": 56
|
|
},
|
|
{
|
|
"entropy": 0.9116549044847488,
|
|
"epoch": 0.6785714285714286,
|
|
"grad_norm": 1.7734375,
|
|
"learning_rate": 1.766044443118978e-05,
|
|
"loss": 0.8924,
|
|
"mean_token_accuracy": 0.7594088986515999,
|
|
"num_tokens": 1648762.0,
|
|
"step": 57
|
|
},
|
|
{
|
|
"entropy": 0.8485553786158562,
|
|
"epoch": 0.6904761904761905,
|
|
"grad_norm": 1.734375,
|
|
"learning_rate": 1.757971723145453e-05,
|
|
"loss": 0.8377,
|
|
"mean_token_accuracy": 0.7698637396097183,
|
|
"num_tokens": 1677464.0,
|
|
"step": 58
|
|
},
|
|
{
|
|
"entropy": 0.8704692050814629,
|
|
"epoch": 0.7023809523809523,
|
|
"grad_norm": 1.7890625,
|
|
"learning_rate": 1.7497812029677344e-05,
|
|
"loss": 0.856,
|
|
"mean_token_accuracy": 0.7654970586299896,
|
|
"num_tokens": 1704994.0,
|
|
"step": 59
|
|
},
|
|
{
|
|
"entropy": 0.8928592056035995,
|
|
"epoch": 0.7142857142857143,
|
|
"grad_norm": 1.6953125,
|
|
"learning_rate": 1.741474155515827e-05,
|
|
"loss": 0.8711,
|
|
"mean_token_accuracy": 0.7633472010493279,
|
|
"num_tokens": 1734202.0,
|
|
"step": 60
|
|
},
|
|
{
|
|
"entropy": 0.89468764513731,
|
|
"epoch": 0.7261904761904762,
|
|
"grad_norm": 1.734375,
|
|
"learning_rate": 1.7330518718298263e-05,
|
|
"loss": 0.8823,
|
|
"mean_token_accuracy": 0.7610758692026138,
|
|
"num_tokens": 1763541.0,
|
|
"step": 61
|
|
},
|
|
{
|
|
"entropy": 0.8784511089324951,
|
|
"epoch": 0.7380952380952381,
|
|
"grad_norm": 1.6953125,
|
|
"learning_rate": 1.7245156608592727e-05,
|
|
"loss": 0.8538,
|
|
"mean_token_accuracy": 0.7677165567874908,
|
|
"num_tokens": 1793196.0,
|
|
"step": 62
|
|
},
|
|
{
|
|
"entropy": 0.909877359867096,
|
|
"epoch": 0.75,
|
|
"grad_norm": 1.9140625,
|
|
"learning_rate": 1.7158668492597186e-05,
|
|
"loss": 0.9132,
|
|
"mean_token_accuracy": 0.7523172721266747,
|
|
"num_tokens": 1821023.0,
|
|
"step": 63
|
|
},
|
|
{
|
|
"entropy": 0.8661764934659004,
|
|
"epoch": 0.7619047619047619,
|
|
"grad_norm": 1.828125,
|
|
"learning_rate": 1.7071067811865477e-05,
|
|
"loss": 0.8799,
|
|
"mean_token_accuracy": 0.7596996948122978,
|
|
"num_tokens": 1849586.0,
|
|
"step": 64
|
|
},
|
|
{
|
|
"entropy": 0.886342890560627,
|
|
"epoch": 0.7738095238095238,
|
|
"grad_norm": 1.7890625,
|
|
"learning_rate": 1.698236818086073e-05,
|
|
"loss": 0.902,
|
|
"mean_token_accuracy": 0.7548638582229614,
|
|
"num_tokens": 1878622.0,
|
|
"step": 65
|
|
},
|
|
{
|
|
"entropy": 0.83852668851614,
|
|
"epoch": 0.7857142857142857,
|
|
"grad_norm": 1.75,
|
|
"learning_rate": 1.689258338483947e-05,
|
|
"loss": 0.844,
|
|
"mean_token_accuracy": 0.7697297856211662,
|
|
"num_tokens": 1907725.0,
|
|
"step": 66
|
|
},
|
|
{
|
|
"entropy": 0.8709945902228355,
|
|
"epoch": 0.7976190476190477,
|
|
"grad_norm": 1.7265625,
|
|
"learning_rate": 1.6801727377709195e-05,
|
|
"loss": 0.8592,
|
|
"mean_token_accuracy": 0.7622527256608009,
|
|
"num_tokens": 1936209.0,
|
|
"step": 67
|
|
},
|
|
{
|
|
"entropy": 0.8294754698872566,
|
|
"epoch": 0.8095238095238095,
|
|
"grad_norm": 1.7578125,
|
|
"learning_rate": 1.67098142798597e-05,
|
|
"loss": 0.835,
|
|
"mean_token_accuracy": 0.7706626355648041,
|
|
"num_tokens": 1964915.0,
|
|
"step": 68
|
|
},
|
|
{
|
|
"entropy": 0.8466374576091766,
|
|
"epoch": 0.8214285714285714,
|
|
"grad_norm": 1.8359375,
|
|
"learning_rate": 1.6616858375968596e-05,
|
|
"loss": 0.8614,
|
|
"mean_token_accuracy": 0.7639145851135254,
|
|
"num_tokens": 1993606.0,
|
|
"step": 69
|
|
},
|
|
{
|
|
"entropy": 0.8547898903489113,
|
|
"epoch": 0.8333333333333334,
|
|
"grad_norm": 1.78125,
|
|
"learning_rate": 1.6522874112781213e-05,
|
|
"loss": 0.8612,
|
|
"mean_token_accuracy": 0.7676523253321648,
|
|
"num_tokens": 2022472.0,
|
|
"step": 70
|
|
},
|
|
{
|
|
"entropy": 0.8490668088197708,
|
|
"epoch": 0.8452380952380952,
|
|
"grad_norm": 1.84375,
|
|
"learning_rate": 1.6427876096865394e-05,
|
|
"loss": 0.8569,
|
|
"mean_token_accuracy": 0.7640745714306831,
|
|
"num_tokens": 2052746.0,
|
|
"step": 71
|
|
},
|
|
{
|
|
"entropy": 0.8580184206366539,
|
|
"epoch": 0.8571428571428571,
|
|
"grad_norm": 1.75,
|
|
"learning_rate": 1.6331879092341402e-05,
|
|
"loss": 0.858,
|
|
"mean_token_accuracy": 0.7627410292625427,
|
|
"num_tokens": 2081889.0,
|
|
"step": 72
|
|
},
|
|
{
|
|
"entropy": 0.8156702071428299,
|
|
"epoch": 0.8690476190476191,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 1.6234898018587336e-05,
|
|
"loss": 0.7916,
|
|
"mean_token_accuracy": 0.7771949768066406,
|
|
"num_tokens": 2111616.0,
|
|
"step": 73
|
|
},
|
|
{
|
|
"entropy": 0.8689733147621155,
|
|
"epoch": 0.8809523809523809,
|
|
"grad_norm": 1.78125,
|
|
"learning_rate": 1.6136947947920477e-05,
|
|
"loss": 0.8629,
|
|
"mean_token_accuracy": 0.7629422098398209,
|
|
"num_tokens": 2140433.0,
|
|
"step": 74
|
|
},
|
|
{
|
|
"entropy": 0.8075756058096886,
|
|
"epoch": 0.8928571428571429,
|
|
"grad_norm": 1.6171875,
|
|
"learning_rate": 1.6038044103254775e-05,
|
|
"loss": 0.8032,
|
|
"mean_token_accuracy": 0.7750532627105713,
|
|
"num_tokens": 2170414.0,
|
|
"step": 75
|
|
},
|
|
{
|
|
"entropy": 0.8746250569820404,
|
|
"epoch": 0.9047619047619048,
|
|
"grad_norm": 1.765625,
|
|
"learning_rate": 1.5938201855735017e-05,
|
|
"loss": 0.8793,
|
|
"mean_token_accuracy": 0.7575968354940414,
|
|
"num_tokens": 2198868.0,
|
|
"step": 76
|
|
},
|
|
{
|
|
"entropy": 0.8024050742387772,
|
|
"epoch": 0.9166666666666666,
|
|
"grad_norm": 1.6796875,
|
|
"learning_rate": 1.5837436722347902e-05,
|
|
"loss": 0.7813,
|
|
"mean_token_accuracy": 0.7871535196900368,
|
|
"num_tokens": 2228134.0,
|
|
"step": 77
|
|
},
|
|
{
|
|
"entropy": 0.8507664054632187,
|
|
"epoch": 0.9285714285714286,
|
|
"grad_norm": 1.75,
|
|
"learning_rate": 1.573576436351046e-05,
|
|
"loss": 0.8437,
|
|
"mean_token_accuracy": 0.7693362981081009,
|
|
"num_tokens": 2257447.0,
|
|
"step": 78
|
|
},
|
|
{
|
|
"entropy": 0.8141358867287636,
|
|
"epoch": 0.9404761904761905,
|
|
"grad_norm": 1.65625,
|
|
"learning_rate": 1.563320058063622e-05,
|
|
"loss": 0.8081,
|
|
"mean_token_accuracy": 0.7764901369810104,
|
|
"num_tokens": 2286749.0,
|
|
"step": 79
|
|
},
|
|
{
|
|
"entropy": 0.843724861741066,
|
|
"epoch": 0.9523809523809523,
|
|
"grad_norm": 1.7421875,
|
|
"learning_rate": 1.5529761313679396e-05,
|
|
"loss": 0.8281,
|
|
"mean_token_accuracy": 0.7666148692369461,
|
|
"num_tokens": 2315039.0,
|
|
"step": 80
|
|
},
|
|
{
|
|
"entropy": 0.8586638569831848,
|
|
"epoch": 0.9642857142857143,
|
|
"grad_norm": 1.7578125,
|
|
"learning_rate": 1.5425462638657597e-05,
|
|
"loss": 0.8867,
|
|
"mean_token_accuracy": 0.760459378361702,
|
|
"num_tokens": 2344737.0,
|
|
"step": 81
|
|
},
|
|
{
|
|
"entropy": 0.8165242671966553,
|
|
"epoch": 0.9761904761904762,
|
|
"grad_norm": 1.765625,
|
|
"learning_rate": 1.5320320765153367e-05,
|
|
"loss": 0.8006,
|
|
"mean_token_accuracy": 0.7785647809505463,
|
|
"num_tokens": 2373710.0,
|
|
"step": 82
|
|
},
|
|
{
|
|
"entropy": 0.8401609510183334,
|
|
"epoch": 0.9880952380952381,
|
|
"grad_norm": 1.765625,
|
|
"learning_rate": 1.5214352033794981e-05,
|
|
"loss": 0.8466,
|
|
"mean_token_accuracy": 0.7677159905433655,
|
|
"num_tokens": 2402610.0,
|
|
"step": 83
|
|
},
|
|
{
|
|
"entropy": 0.8437637463212013,
|
|
"epoch": 1.0,
|
|
"grad_norm": 1.8046875,
|
|
"learning_rate": 1.5107572913716859e-05,
|
|
"loss": 0.8714,
|
|
"mean_token_accuracy": 0.7612484693527222,
|
|
"num_tokens": 2430019.0,
|
|
"step": 84
|
|
},
|
|
{
|
|
"epoch": 1.0,
|
|
"eval_entropy": 0.8333023413022359,
|
|
"eval_loss": 0.8408388495445251,
|
|
"eval_mean_token_accuracy": 0.7681567951043446,
|
|
"eval_num_tokens": 2430019.0,
|
|
"eval_runtime": 19.0307,
|
|
"eval_samples_per_second": 7.882,
|
|
"eval_steps_per_second": 7.882,
|
|
"step": 84
|
|
}
|
|
],
|
|
"logging_steps": 1.0,
|
|
"max_steps": 252,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 3,
|
|
"save_steps": 500,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": false
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 5.565870266351002e+16,
|
|
"train_batch_size": 2,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|