{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.3546987951807229, "eval_steps": 500, "global_step": 92, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0038554216867469878, "grad_norm": 0.6997007131576538, "learning_rate": 0.0, "loss": 0.0405, "step": 1 }, { "epoch": 0.0077108433734939755, "grad_norm": 0.6004841327667236, "learning_rate": 5.128205128205128e-07, "loss": 0.0413, "step": 2 }, { "epoch": 0.011566265060240964, "grad_norm": 0.6796688437461853, "learning_rate": 1.0256410256410257e-06, "loss": 0.049, "step": 3 }, { "epoch": 0.015421686746987951, "grad_norm": 0.6812688708305359, "learning_rate": 1.5384615384615387e-06, "loss": 0.0486, "step": 4 }, { "epoch": 0.01927710843373494, "grad_norm": 0.6957109570503235, "learning_rate": 2.0512820512820513e-06, "loss": 0.033, "step": 5 }, { "epoch": 0.02313253012048193, "grad_norm": 0.6179328560829163, "learning_rate": 2.564102564102564e-06, "loss": 0.0505, "step": 6 }, { "epoch": 0.026987951807228915, "grad_norm": 0.5707671046257019, "learning_rate": 3.0769230769230774e-06, "loss": 0.0409, "step": 7 }, { "epoch": 0.030843373493975902, "grad_norm": 0.41436561942100525, "learning_rate": 3.58974358974359e-06, "loss": 0.0433, "step": 8 }, { "epoch": 0.03469879518072289, "grad_norm": 0.3194092810153961, "learning_rate": 4.102564102564103e-06, "loss": 0.032, "step": 9 }, { "epoch": 0.03855421686746988, "grad_norm": 0.3646799325942993, "learning_rate": 4.615384615384616e-06, "loss": 0.0326, "step": 10 }, { "epoch": 0.042409638554216866, "grad_norm": 0.3623705804347992, "learning_rate": 5.128205128205128e-06, "loss": 0.0415, "step": 11 }, { "epoch": 0.04626506024096386, "grad_norm": 0.23459671437740326, "learning_rate": 5.641025641025641e-06, "loss": 0.0356, "step": 12 }, { "epoch": 0.05012048192771084, "grad_norm": 0.27805373072624207, "learning_rate": 6.153846153846155e-06, "loss": 0.0265, "step": 13 }, { "epoch": 0.05397590361445783, "grad_norm": 0.2236052304506302, "learning_rate": 6.666666666666667e-06, "loss": 0.0237, "step": 14 }, { "epoch": 0.05783132530120482, "grad_norm": 0.2813984453678131, "learning_rate": 7.17948717948718e-06, "loss": 0.0271, "step": 15 }, { "epoch": 0.061686746987951804, "grad_norm": 0.24619753658771515, "learning_rate": 7.692307692307694e-06, "loss": 0.0237, "step": 16 }, { "epoch": 0.0655421686746988, "grad_norm": 0.2730517089366913, "learning_rate": 8.205128205128205e-06, "loss": 0.0227, "step": 17 }, { "epoch": 0.06939759036144579, "grad_norm": 0.2350538820028305, "learning_rate": 8.717948717948719e-06, "loss": 0.0245, "step": 18 }, { "epoch": 0.07325301204819278, "grad_norm": 0.18193207681179047, "learning_rate": 9.230769230769232e-06, "loss": 0.0168, "step": 19 }, { "epoch": 0.07710843373493977, "grad_norm": 0.18165752291679382, "learning_rate": 9.743589743589744e-06, "loss": 0.0159, "step": 20 }, { "epoch": 0.08096385542168674, "grad_norm": 0.27797478437423706, "learning_rate": 1.0256410256410256e-05, "loss": 0.0301, "step": 21 }, { "epoch": 0.08481927710843373, "grad_norm": 0.26159757375717163, "learning_rate": 1.076923076923077e-05, "loss": 0.0279, "step": 22 }, { "epoch": 0.08867469879518072, "grad_norm": 0.20290671288967133, "learning_rate": 1.1282051282051283e-05, "loss": 0.0215, "step": 23 }, { "epoch": 0.09253012048192771, "grad_norm": 0.3016839921474457, "learning_rate": 1.1794871794871796e-05, "loss": 0.0239, "step": 24 }, { "epoch": 0.0963855421686747, "grad_norm": 0.23746410012245178, "learning_rate": 1.230769230769231e-05, "loss": 0.0287, "step": 25 }, { "epoch": 0.10024096385542168, "grad_norm": 0.20524649322032928, "learning_rate": 1.2820512820512823e-05, "loss": 0.0233, "step": 26 }, { "epoch": 0.10409638554216867, "grad_norm": 0.23074588179588318, "learning_rate": 1.3333333333333333e-05, "loss": 0.0227, "step": 27 }, { "epoch": 0.10795180722891566, "grad_norm": 0.17793533205986023, "learning_rate": 1.3846153846153847e-05, "loss": 0.0206, "step": 28 }, { "epoch": 0.11180722891566265, "grad_norm": 0.19907526671886444, "learning_rate": 1.435897435897436e-05, "loss": 0.0291, "step": 29 }, { "epoch": 0.11566265060240964, "grad_norm": 0.22600896656513214, "learning_rate": 1.4871794871794874e-05, "loss": 0.0277, "step": 30 }, { "epoch": 0.11951807228915663, "grad_norm": 0.2135571539402008, "learning_rate": 1.5384615384615387e-05, "loss": 0.0157, "step": 31 }, { "epoch": 0.12337349397590361, "grad_norm": 0.17844079434871674, "learning_rate": 1.5897435897435897e-05, "loss": 0.0207, "step": 32 }, { "epoch": 0.1272289156626506, "grad_norm": 0.21249860525131226, "learning_rate": 1.641025641025641e-05, "loss": 0.0258, "step": 33 }, { "epoch": 0.1310843373493976, "grad_norm": 0.18014496564865112, "learning_rate": 1.6923076923076924e-05, "loss": 0.0187, "step": 34 }, { "epoch": 0.13493975903614458, "grad_norm": 0.1790035516023636, "learning_rate": 1.7435897435897438e-05, "loss": 0.0141, "step": 35 }, { "epoch": 0.13879518072289157, "grad_norm": 0.18319612741470337, "learning_rate": 1.794871794871795e-05, "loss": 0.0153, "step": 36 }, { "epoch": 0.14265060240963856, "grad_norm": 0.16664963960647583, "learning_rate": 1.8461538461538465e-05, "loss": 0.0146, "step": 37 }, { "epoch": 0.14650602409638555, "grad_norm": 0.17741602659225464, "learning_rate": 1.8974358974358975e-05, "loss": 0.0138, "step": 38 }, { "epoch": 0.15036144578313254, "grad_norm": 0.16826853156089783, "learning_rate": 1.9487179487179488e-05, "loss": 0.0149, "step": 39 }, { "epoch": 0.15421686746987953, "grad_norm": 0.17632468044757843, "learning_rate": 2e-05, "loss": 0.0315, "step": 40 }, { "epoch": 0.1580722891566265, "grad_norm": 0.21154020726680756, "learning_rate": 2.0512820512820512e-05, "loss": 0.0313, "step": 41 }, { "epoch": 0.16192771084337348, "grad_norm": 0.17007827758789062, "learning_rate": 2.102564102564103e-05, "loss": 0.0283, "step": 42 }, { "epoch": 0.16578313253012048, "grad_norm": 0.20888379216194153, "learning_rate": 2.153846153846154e-05, "loss": 0.0173, "step": 43 }, { "epoch": 0.16963855421686747, "grad_norm": 0.17302851378917694, "learning_rate": 2.2051282051282056e-05, "loss": 0.023, "step": 44 }, { "epoch": 0.17349397590361446, "grad_norm": 0.28571709990501404, "learning_rate": 2.2564102564102566e-05, "loss": 0.0528, "step": 45 }, { "epoch": 0.17734939759036145, "grad_norm": 0.2224675714969635, "learning_rate": 2.3076923076923076e-05, "loss": 0.0326, "step": 46 }, { "epoch": 0.18120481927710844, "grad_norm": 0.16989563405513763, "learning_rate": 2.3589743589743593e-05, "loss": 0.0106, "step": 47 }, { "epoch": 0.18506024096385543, "grad_norm": 0.17279551923274994, "learning_rate": 2.4102564102564103e-05, "loss": 0.0143, "step": 48 }, { "epoch": 0.18891566265060242, "grad_norm": 0.1571756899356842, "learning_rate": 2.461538461538462e-05, "loss": 0.0112, "step": 49 }, { "epoch": 0.1927710843373494, "grad_norm": 0.21857869625091553, "learning_rate": 2.512820512820513e-05, "loss": 0.0149, "step": 50 }, { "epoch": 0.1966265060240964, "grad_norm": 0.21509476006031036, "learning_rate": 2.5641025641025646e-05, "loss": 0.0248, "step": 51 }, { "epoch": 0.20048192771084336, "grad_norm": 0.15649166703224182, "learning_rate": 2.6153846153846157e-05, "loss": 0.0101, "step": 52 }, { "epoch": 0.20433734939759035, "grad_norm": 0.17392459511756897, "learning_rate": 2.6666666666666667e-05, "loss": 0.0115, "step": 53 }, { "epoch": 0.20819277108433734, "grad_norm": 0.13562685251235962, "learning_rate": 2.7179487179487183e-05, "loss": 0.0102, "step": 54 }, { "epoch": 0.21204819277108433, "grad_norm": 0.22402575612068176, "learning_rate": 2.7692307692307694e-05, "loss": 0.0164, "step": 55 }, { "epoch": 0.21590361445783132, "grad_norm": 0.1317652314901352, "learning_rate": 2.820512820512821e-05, "loss": 0.0091, "step": 56 }, { "epoch": 0.2197590361445783, "grad_norm": 0.11563073843717575, "learning_rate": 2.871794871794872e-05, "loss": 0.009, "step": 57 }, { "epoch": 0.2236144578313253, "grad_norm": 0.12244722992181778, "learning_rate": 2.923076923076923e-05, "loss": 0.0077, "step": 58 }, { "epoch": 0.2274698795180723, "grad_norm": 0.18595360219478607, "learning_rate": 2.9743589743589747e-05, "loss": 0.0118, "step": 59 }, { "epoch": 0.23132530120481928, "grad_norm": 0.16396519541740417, "learning_rate": 3.0256410256410257e-05, "loss": 0.0113, "step": 60 }, { "epoch": 0.23518072289156627, "grad_norm": 0.16600239276885986, "learning_rate": 3.0769230769230774e-05, "loss": 0.0273, "step": 61 }, { "epoch": 0.23903614457831326, "grad_norm": 0.14368009567260742, "learning_rate": 3.128205128205129e-05, "loss": 0.0107, "step": 62 }, { "epoch": 0.24289156626506025, "grad_norm": 0.11151304095983505, "learning_rate": 3.1794871794871795e-05, "loss": 0.0114, "step": 63 }, { "epoch": 0.24674698795180722, "grad_norm": 0.16931672394275665, "learning_rate": 3.230769230769231e-05, "loss": 0.0101, "step": 64 }, { "epoch": 0.25060240963855424, "grad_norm": 0.13678501546382904, "learning_rate": 3.282051282051282e-05, "loss": 0.0074, "step": 65 }, { "epoch": 0.2544578313253012, "grad_norm": 0.12231199443340302, "learning_rate": 3.3333333333333335e-05, "loss": 0.0117, "step": 66 }, { "epoch": 0.2583132530120482, "grad_norm": 0.2577515244483948, "learning_rate": 3.384615384615385e-05, "loss": 0.0304, "step": 67 }, { "epoch": 0.2621686746987952, "grad_norm": 0.10441906005144119, "learning_rate": 3.435897435897436e-05, "loss": 0.0077, "step": 68 }, { "epoch": 0.26602409638554214, "grad_norm": 0.18340735137462616, "learning_rate": 3.4871794871794875e-05, "loss": 0.0131, "step": 69 }, { "epoch": 0.26987951807228916, "grad_norm": 0.26318177580833435, "learning_rate": 3.538461538461539e-05, "loss": 0.0166, "step": 70 }, { "epoch": 0.2737349397590361, "grad_norm": 0.0868140459060669, "learning_rate": 3.58974358974359e-05, "loss": 0.0079, "step": 71 }, { "epoch": 0.27759036144578314, "grad_norm": 0.1882234513759613, "learning_rate": 3.6410256410256416e-05, "loss": 0.0113, "step": 72 }, { "epoch": 0.2814457831325301, "grad_norm": 0.1313207447528839, "learning_rate": 3.692307692307693e-05, "loss": 0.01, "step": 73 }, { "epoch": 0.2853012048192771, "grad_norm": 0.21643561124801636, "learning_rate": 3.7435897435897436e-05, "loss": 0.0126, "step": 74 }, { "epoch": 0.2891566265060241, "grad_norm": 0.35117974877357483, "learning_rate": 3.794871794871795e-05, "loss": 0.0322, "step": 75 }, { "epoch": 0.2930120481927711, "grad_norm": 0.14641538262367249, "learning_rate": 3.846153846153846e-05, "loss": 0.0086, "step": 76 }, { "epoch": 0.29686746987951806, "grad_norm": 0.18411016464233398, "learning_rate": 3.8974358974358976e-05, "loss": 0.0254, "step": 77 }, { "epoch": 0.3007228915662651, "grad_norm": 0.17950740456581116, "learning_rate": 3.948717948717949e-05, "loss": 0.0191, "step": 78 }, { "epoch": 0.30457831325301205, "grad_norm": 0.14514976739883423, "learning_rate": 4e-05, "loss": 0.0107, "step": 79 }, { "epoch": 0.30843373493975906, "grad_norm": 0.22098544239997864, "learning_rate": 3.999979972589652e-05, "loss": 0.0176, "step": 80 }, { "epoch": 0.312289156626506, "grad_norm": 0.11959940195083618, "learning_rate": 3.9999198907597046e-05, "loss": 0.0168, "step": 81 }, { "epoch": 0.316144578313253, "grad_norm": 0.13479092717170715, "learning_rate": 3.999819755713442e-05, "loss": 0.0246, "step": 82 }, { "epoch": 0.32, "grad_norm": 0.15680080652236938, "learning_rate": 3.9996795694563096e-05, "loss": 0.0147, "step": 83 }, { "epoch": 0.32385542168674697, "grad_norm": 0.1106104925274849, "learning_rate": 3.999499334795875e-05, "loss": 0.017, "step": 84 }, { "epoch": 0.327710843373494, "grad_norm": 0.13254176080226898, "learning_rate": 3.999279055341771e-05, "loss": 0.0096, "step": 85 }, { "epoch": 0.33156626506024095, "grad_norm": 0.1391618400812149, "learning_rate": 3.999018735505626e-05, "loss": 0.0165, "step": 86 }, { "epoch": 0.33542168674698797, "grad_norm": 0.15080322325229645, "learning_rate": 3.998718380500971e-05, "loss": 0.0127, "step": 87 }, { "epoch": 0.33927710843373493, "grad_norm": 0.20322079956531525, "learning_rate": 3.998377996343139e-05, "loss": 0.053, "step": 88 }, { "epoch": 0.34313253012048195, "grad_norm": 0.10287915915250778, "learning_rate": 3.997997589849145e-05, "loss": 0.0112, "step": 89 }, { "epoch": 0.3469879518072289, "grad_norm": 0.14580729603767395, "learning_rate": 3.9975771686375434e-05, "loss": 0.009, "step": 90 }, { "epoch": 0.35084337349397593, "grad_norm": 0.16750818490982056, "learning_rate": 3.9971167411282835e-05, "loss": 0.0137, "step": 91 }, { "epoch": 0.3546987951807229, "grad_norm": 0.0841616690158844, "learning_rate": 3.996616316542537e-05, "loss": 0.0054, "step": 92 } ], "logging_steps": 1, "max_steps": 780, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 92, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 7.243155759200993e+17, "train_batch_size": 4, "trial_name": null, "trial_params": null }