{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.3546987951807229, "eval_steps": 500, "global_step": 92, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0038554216867469878, "grad_norm": 1.2289724349975586, "learning_rate": 0.0, "loss": 0.0363, "step": 1 }, { "epoch": 0.0077108433734939755, "grad_norm": 1.148133635520935, "learning_rate": 5.128205128205128e-07, "loss": 0.042, "step": 2 }, { "epoch": 0.011566265060240964, "grad_norm": 1.251704216003418, "learning_rate": 1.0256410256410257e-06, "loss": 0.0442, "step": 3 }, { "epoch": 0.015421686746987951, "grad_norm": 1.1709717512130737, "learning_rate": 1.5384615384615387e-06, "loss": 0.0363, "step": 4 }, { "epoch": 0.01927710843373494, "grad_norm": 1.1885852813720703, "learning_rate": 2.0512820512820513e-06, "loss": 0.0281, "step": 5 }, { "epoch": 0.02313253012048193, "grad_norm": 0.7513725161552429, "learning_rate": 2.564102564102564e-06, "loss": 0.0456, "step": 6 }, { "epoch": 0.026987951807228915, "grad_norm": 0.6604480147361755, "learning_rate": 3.0769230769230774e-06, "loss": 0.0336, "step": 7 }, { "epoch": 0.030843373493975902, "grad_norm": 0.5245765447616577, "learning_rate": 3.58974358974359e-06, "loss": 0.0351, "step": 8 }, { "epoch": 0.03469879518072289, "grad_norm": 0.35446059703826904, "learning_rate": 4.102564102564103e-06, "loss": 0.022, "step": 9 }, { "epoch": 0.03855421686746988, "grad_norm": 0.40557414293289185, "learning_rate": 4.615384615384616e-06, "loss": 0.0248, "step": 10 }, { "epoch": 0.042409638554216866, "grad_norm": 0.3844715356826782, "learning_rate": 5.128205128205128e-06, "loss": 0.0289, "step": 11 }, { "epoch": 0.04626506024096386, "grad_norm": 0.31521302461624146, "learning_rate": 5.641025641025641e-06, "loss": 0.0221, "step": 12 }, { "epoch": 0.05012048192771084, "grad_norm": 0.40441566705703735, "learning_rate": 6.153846153846155e-06, "loss": 0.0226, "step": 13 }, { "epoch": 0.05397590361445783, "grad_norm": 0.30345258116722107, "learning_rate": 6.666666666666667e-06, "loss": 0.0181, "step": 14 }, { "epoch": 0.05783132530120482, "grad_norm": 0.32419148087501526, "learning_rate": 7.17948717948718e-06, "loss": 0.0217, "step": 15 }, { "epoch": 0.061686746987951804, "grad_norm": 0.29662227630615234, "learning_rate": 7.692307692307694e-06, "loss": 0.0216, "step": 16 }, { "epoch": 0.0655421686746988, "grad_norm": 0.24562332034111023, "learning_rate": 8.205128205128205e-06, "loss": 0.0163, "step": 17 }, { "epoch": 0.06939759036144579, "grad_norm": 0.21251554787158966, "learning_rate": 8.717948717948719e-06, "loss": 0.0176, "step": 18 }, { "epoch": 0.07325301204819278, "grad_norm": 0.195358544588089, "learning_rate": 9.230769230769232e-06, "loss": 0.0121, "step": 19 }, { "epoch": 0.07710843373493977, "grad_norm": 0.1519210785627365, "learning_rate": 9.743589743589744e-06, "loss": 0.0103, "step": 20 }, { "epoch": 0.08096385542168674, "grad_norm": 0.29832565784454346, "learning_rate": 1.0256410256410256e-05, "loss": 0.0197, "step": 21 }, { "epoch": 0.08481927710843373, "grad_norm": 0.24802711606025696, "learning_rate": 1.076923076923077e-05, "loss": 0.0207, "step": 22 }, { "epoch": 0.08867469879518072, "grad_norm": 0.17878903448581696, "learning_rate": 1.1282051282051283e-05, "loss": 0.014, "step": 23 }, { "epoch": 0.09253012048192771, "grad_norm": 0.23687325417995453, "learning_rate": 1.1794871794871796e-05, "loss": 0.0153, "step": 24 }, { "epoch": 0.0963855421686747, "grad_norm": 0.29058969020843506, "learning_rate": 1.230769230769231e-05, "loss": 0.0149, "step": 25 }, { "epoch": 0.10024096385542168, "grad_norm": 0.1624310314655304, "learning_rate": 1.2820512820512823e-05, "loss": 0.0127, "step": 26 }, { "epoch": 0.10409638554216867, "grad_norm": 0.27256354689598083, "learning_rate": 1.3333333333333333e-05, "loss": 0.0173, "step": 27 }, { "epoch": 0.10795180722891566, "grad_norm": 0.24831782281398773, "learning_rate": 1.3846153846153847e-05, "loss": 0.0161, "step": 28 }, { "epoch": 0.11180722891566265, "grad_norm": 0.20417729020118713, "learning_rate": 1.435897435897436e-05, "loss": 0.0127, "step": 29 }, { "epoch": 0.11566265060240964, "grad_norm": 0.22253485023975372, "learning_rate": 1.4871794871794874e-05, "loss": 0.018, "step": 30 }, { "epoch": 0.11951807228915663, "grad_norm": 0.1634419709444046, "learning_rate": 1.5384615384615387e-05, "loss": 0.0092, "step": 31 }, { "epoch": 0.12337349397590361, "grad_norm": 0.16349917650222778, "learning_rate": 1.5897435897435897e-05, "loss": 0.0151, "step": 32 }, { "epoch": 0.1272289156626506, "grad_norm": 0.2271573394536972, "learning_rate": 1.641025641025641e-05, "loss": 0.0174, "step": 33 }, { "epoch": 0.1310843373493976, "grad_norm": 0.1916988492012024, "learning_rate": 1.6923076923076924e-05, "loss": 0.0126, "step": 34 }, { "epoch": 0.13493975903614458, "grad_norm": 0.23479051887989044, "learning_rate": 1.7435897435897438e-05, "loss": 0.0116, "step": 35 }, { "epoch": 0.13879518072289157, "grad_norm": 0.18296493589878082, "learning_rate": 1.794871794871795e-05, "loss": 0.0133, "step": 36 }, { "epoch": 0.14265060240963856, "grad_norm": 0.12307147681713104, "learning_rate": 1.8461538461538465e-05, "loss": 0.0093, "step": 37 }, { "epoch": 0.14650602409638555, "grad_norm": 0.1736001819372177, "learning_rate": 1.8974358974358975e-05, "loss": 0.0097, "step": 38 }, { "epoch": 0.15036144578313254, "grad_norm": 0.21048344671726227, "learning_rate": 1.9487179487179488e-05, "loss": 0.0121, "step": 39 }, { "epoch": 0.15421686746987953, "grad_norm": 0.18844228982925415, "learning_rate": 2e-05, "loss": 0.0145, "step": 40 }, { "epoch": 0.1580722891566265, "grad_norm": 0.24053065478801727, "learning_rate": 2.0512820512820512e-05, "loss": 0.0233, "step": 41 }, { "epoch": 0.16192771084337348, "grad_norm": 0.16952425241470337, "learning_rate": 2.102564102564103e-05, "loss": 0.024, "step": 42 }, { "epoch": 0.16578313253012048, "grad_norm": 0.1816851794719696, "learning_rate": 2.153846153846154e-05, "loss": 0.0165, "step": 43 }, { "epoch": 0.16963855421686747, "grad_norm": 0.17718464136123657, "learning_rate": 2.2051282051282056e-05, "loss": 0.0171, "step": 44 }, { "epoch": 0.17349397590361446, "grad_norm": 0.44719773530960083, "learning_rate": 2.2564102564102566e-05, "loss": 0.0357, "step": 45 }, { "epoch": 0.17734939759036145, "grad_norm": 0.1649208813905716, "learning_rate": 2.3076923076923076e-05, "loss": 0.016, "step": 46 }, { "epoch": 0.18120481927710844, "grad_norm": 0.17772121727466583, "learning_rate": 2.3589743589743593e-05, "loss": 0.0106, "step": 47 }, { "epoch": 0.18506024096385543, "grad_norm": 0.30155256390571594, "learning_rate": 2.4102564102564103e-05, "loss": 0.0132, "step": 48 }, { "epoch": 0.18891566265060242, "grad_norm": 0.1777803599834442, "learning_rate": 2.461538461538462e-05, "loss": 0.0089, "step": 49 }, { "epoch": 0.1927710843373494, "grad_norm": 0.23959968984127045, "learning_rate": 2.512820512820513e-05, "loss": 0.0137, "step": 50 }, { "epoch": 0.1966265060240964, "grad_norm": 0.2473219782114029, "learning_rate": 2.5641025641025646e-05, "loss": 0.0241, "step": 51 }, { "epoch": 0.20048192771084336, "grad_norm": 0.14216162264347076, "learning_rate": 2.6153846153846157e-05, "loss": 0.0089, "step": 52 }, { "epoch": 0.20433734939759035, "grad_norm": 0.16024824976921082, "learning_rate": 2.6666666666666667e-05, "loss": 0.0105, "step": 53 }, { "epoch": 0.20819277108433734, "grad_norm": 0.19614927470684052, "learning_rate": 2.7179487179487183e-05, "loss": 0.0102, "step": 54 }, { "epoch": 0.21204819277108433, "grad_norm": 0.18651551008224487, "learning_rate": 2.7692307692307694e-05, "loss": 0.0109, "step": 55 }, { "epoch": 0.21590361445783132, "grad_norm": 0.1358720362186432, "learning_rate": 2.820512820512821e-05, "loss": 0.0082, "step": 56 }, { "epoch": 0.2197590361445783, "grad_norm": 0.13998733460903168, "learning_rate": 2.871794871794872e-05, "loss": 0.0081, "step": 57 }, { "epoch": 0.2236144578313253, "grad_norm": 0.1299574077129364, "learning_rate": 2.923076923076923e-05, "loss": 0.0067, "step": 58 }, { "epoch": 0.2274698795180723, "grad_norm": 0.17477169632911682, "learning_rate": 2.9743589743589747e-05, "loss": 0.0091, "step": 59 }, { "epoch": 0.23132530120481928, "grad_norm": 0.27078455686569214, "learning_rate": 3.0256410256410257e-05, "loss": 0.0128, "step": 60 }, { "epoch": 0.23518072289156627, "grad_norm": 0.2184700220823288, "learning_rate": 3.0769230769230774e-05, "loss": 0.0236, "step": 61 }, { "epoch": 0.23903614457831326, "grad_norm": 0.21013228595256805, "learning_rate": 3.128205128205129e-05, "loss": 0.0114, "step": 62 }, { "epoch": 0.24289156626506025, "grad_norm": 0.4988560974597931, "learning_rate": 3.1794871794871795e-05, "loss": 0.0111, "step": 63 }, { "epoch": 0.24674698795180722, "grad_norm": 0.18484456837177277, "learning_rate": 3.230769230769231e-05, "loss": 0.0104, "step": 64 }, { "epoch": 0.25060240963855424, "grad_norm": 0.19871847331523895, "learning_rate": 3.282051282051282e-05, "loss": 0.0094, "step": 65 }, { "epoch": 0.2544578313253012, "grad_norm": 0.17952671647071838, "learning_rate": 3.3333333333333335e-05, "loss": 0.0127, "step": 66 }, { "epoch": 0.2583132530120482, "grad_norm": 0.29055604338645935, "learning_rate": 3.384615384615385e-05, "loss": 0.023, "step": 67 }, { "epoch": 0.2621686746987952, "grad_norm": 0.2033795416355133, "learning_rate": 3.435897435897436e-05, "loss": 0.0091, "step": 68 }, { "epoch": 0.26602409638554214, "grad_norm": 0.2499230057001114, "learning_rate": 3.4871794871794875e-05, "loss": 0.0221, "step": 69 }, { "epoch": 0.26987951807228916, "grad_norm": 0.22038578987121582, "learning_rate": 3.538461538461539e-05, "loss": 0.0139, "step": 70 }, { "epoch": 0.2737349397590361, "grad_norm": 0.14657297730445862, "learning_rate": 3.58974358974359e-05, "loss": 0.0104, "step": 71 }, { "epoch": 0.27759036144578314, "grad_norm": 0.23861773312091827, "learning_rate": 3.6410256410256416e-05, "loss": 0.0126, "step": 72 }, { "epoch": 0.2814457831325301, "grad_norm": 0.21007320284843445, "learning_rate": 3.692307692307693e-05, "loss": 0.0133, "step": 73 }, { "epoch": 0.2853012048192771, "grad_norm": 0.20938654243946075, "learning_rate": 3.7435897435897436e-05, "loss": 0.0116, "step": 74 }, { "epoch": 0.2891566265060241, "grad_norm": 0.27394789457321167, "learning_rate": 3.794871794871795e-05, "loss": 0.0158, "step": 75 }, { "epoch": 0.2930120481927711, "grad_norm": 0.1749437153339386, "learning_rate": 3.846153846153846e-05, "loss": 0.0097, "step": 76 }, { "epoch": 0.29686746987951806, "grad_norm": 0.2208889275789261, "learning_rate": 3.8974358974358976e-05, "loss": 0.024, "step": 77 }, { "epoch": 0.3007228915662651, "grad_norm": 0.32802650332450867, "learning_rate": 3.948717948717949e-05, "loss": 0.015, "step": 78 }, { "epoch": 0.30457831325301205, "grad_norm": 0.21527938544750214, "learning_rate": 4e-05, "loss": 0.0137, "step": 79 }, { "epoch": 0.30843373493975906, "grad_norm": 0.2894026041030884, "learning_rate": 3.999979972589652e-05, "loss": 0.0177, "step": 80 }, { "epoch": 0.312289156626506, "grad_norm": 0.21148355305194855, "learning_rate": 3.9999198907597046e-05, "loss": 0.0146, "step": 81 }, { "epoch": 0.316144578313253, "grad_norm": 0.1950712502002716, "learning_rate": 3.999819755713442e-05, "loss": 0.0174, "step": 82 }, { "epoch": 0.32, "grad_norm": 0.23408709466457367, "learning_rate": 3.9996795694563096e-05, "loss": 0.0142, "step": 83 }, { "epoch": 0.32385542168674697, "grad_norm": 0.4009031355381012, "learning_rate": 3.999499334795875e-05, "loss": 0.014, "step": 84 }, { "epoch": 0.327710843373494, "grad_norm": 0.2507084012031555, "learning_rate": 3.999279055341771e-05, "loss": 0.013, "step": 85 }, { "epoch": 0.33156626506024095, "grad_norm": 0.2922132909297943, "learning_rate": 3.999018735505626e-05, "loss": 0.013, "step": 86 }, { "epoch": 0.33542168674698797, "grad_norm": 0.2073613405227661, "learning_rate": 3.998718380500971e-05, "loss": 0.0107, "step": 87 }, { "epoch": 0.33927710843373493, "grad_norm": 0.3113904595375061, "learning_rate": 3.998377996343139e-05, "loss": 0.0337, "step": 88 }, { "epoch": 0.34313253012048195, "grad_norm": 0.18452070653438568, "learning_rate": 3.997997589849145e-05, "loss": 0.0137, "step": 89 }, { "epoch": 0.3469879518072289, "grad_norm": 0.24420331418514252, "learning_rate": 3.9975771686375434e-05, "loss": 0.0104, "step": 90 }, { "epoch": 0.35084337349397593, "grad_norm": 0.3163854479789734, "learning_rate": 3.9971167411282835e-05, "loss": 0.0133, "step": 91 }, { "epoch": 0.3546987951807229, "grad_norm": 0.11558058857917786, "learning_rate": 3.996616316542537e-05, "loss": 0.0069, "step": 92 } ], "logging_steps": 1, "max_steps": 780, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 92, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 7.051174608015196e+17, "train_batch_size": 4, "trial_name": null, "trial_params": null }