{ "best_global_step": 2996, "best_metric": 2.225428342819214, "best_model_checkpoint": "/kaggle/working/gemma-3-270m-uzen-base/checkpoint-2996", "epoch": 0.7010749542961608, "eval_steps": 428, "global_step": 2996, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0, "eval_loss": 3.3726205825805664, "eval_perplexity": 29.00750160217285, "eval_runtime": 1376.8644, "eval_samples_per_second": 8.027, "eval_steps_per_second": 1.004, "step": 0 }, { "epoch": 0.0002340036563071298, "grad_norm": NaN, "learning_rate": 0.0, "loss": 221.65936279296875, "step": 1 }, { "epoch": 0.02340036563071298, "grad_norm": 125.02448272705078, "learning_rate": 1.3455579942126144e-05, "loss": 186.75027619949495, "step": 100 }, { "epoch": 0.04680073126142596, "grad_norm": 119.42086029052734, "learning_rate": 9.391758525703705e-06, "loss": 162.133095703125, "step": 200 }, { "epoch": 0.07020109689213894, "grad_norm": 122.48279571533203, "learning_rate": 7.64875162105191e-06, "loss": 155.50732421875, "step": 300 }, { "epoch": 0.09360146252285192, "grad_norm": 117.2989273071289, "learning_rate": 6.607179605173858e-06, "loss": 152.238125, "step": 400 }, { "epoch": 0.10015356489945156, "eval_loss": 2.4410510063171387, "eval_perplexity": 11.5115966796875, "eval_runtime": 1493.6491, "eval_samples_per_second": 7.399, "eval_steps_per_second": 0.925, "step": 428 }, { "epoch": 0.1170018281535649, "grad_norm": 112.73179626464844, "learning_rate": 5.900662146334273e-06, "loss": 150.016318359375, "step": 500 }, { "epoch": 0.14040219378427787, "grad_norm": 120.18157958984375, "learning_rate": 5.381099233077658e-06, "loss": 147.887568359375, "step": 600 }, { "epoch": 0.16380255941499086, "grad_norm": 126.22393035888672, "learning_rate": 4.978339248330686e-06, "loss": 147.1618359375, "step": 700 }, { "epoch": 0.18720292504570385, "grad_norm": 119.209228515625, "learning_rate": 4.657229393557059e-06, "loss": 145.39865234375, "step": 800 }, { "epoch": 0.2003071297989031, "eval_loss": 2.3490686416625977, "eval_perplexity": 10.503242492675781, "eval_runtime": 1490.1057, "eval_samples_per_second": 7.417, "eval_steps_per_second": 0.927, "step": 856 }, { "epoch": 0.2106032906764168, "grad_norm": 124.55681610107422, "learning_rate": 4.39118562699897e-06, "loss": 153.693115234375, "step": 900 }, { "epoch": 0.2340036563071298, "grad_norm": 119.34051513671875, "learning_rate": 4.1639776269114805e-06, "loss": 146.270078125, "step": 1000 }, { "epoch": 0.2574040219378428, "grad_norm": 114.71582794189453, "learning_rate": 3.968742338690654e-06, "loss": 144.3760546875, "step": 1100 }, { "epoch": 0.28080438756855575, "grad_norm": 119.8339614868164, "learning_rate": 3.79862214511292e-06, "loss": 143.744560546875, "step": 1200 }, { "epoch": 0.3004606946983547, "eval_loss": 2.3285601139068604, "eval_perplexity": 10.293147087097168, "eval_runtime": 1270.7866, "eval_samples_per_second": 8.697, "eval_steps_per_second": 1.088, "step": 1284 }, { "epoch": 0.30420475319926876, "grad_norm": 114.1391830444336, "learning_rate": 3.648656396326189e-06, "loss": 143.26626953125, "step": 1300 }, { "epoch": 0.3276051188299817, "grad_norm": 118.7150650024414, "learning_rate": 3.5151560191662133e-06, "loss": 142.079208984375, "step": 1400 }, { "epoch": 0.3510054844606947, "grad_norm": 113.54842376708984, "learning_rate": 3.395312965552404e-06, "loss": 141.61373046875, "step": 1500 }, { "epoch": 0.3744058500914077, "grad_norm": 113.5634994506836, "learning_rate": 3.2869469269372928e-06, "loss": 141.197421875, "step": 1600 }, { "epoch": 0.39780621572212066, "grad_norm": 117.68986511230469, "learning_rate": 3.188335715317592e-06, "loss": 140.76587890625, "step": 1700 }, { "epoch": 0.4006142595978062, "eval_loss": 2.2911739349365234, "eval_perplexity": 9.915882110595703, "eval_runtime": 1272.1824, "eval_samples_per_second": 8.687, "eval_steps_per_second": 1.086, "step": 1712 }, { "epoch": 0.4212065813528336, "grad_norm": 114.08328247070312, "learning_rate": 3.0980984951602635e-06, "loss": 140.2319140625, "step": 1800 }, { "epoch": 0.44460694698354664, "grad_norm": 110.51737976074219, "learning_rate": 3.0151134457776365e-06, "loss": 139.54671875, "step": 1900 }, { "epoch": 0.4680073126142596, "grad_norm": 114.35932159423828, "learning_rate": 2.9384584653539762e-06, "loss": 139.24345703125, "step": 2000 }, { "epoch": 0.49140767824497256, "grad_norm": 113.81220245361328, "learning_rate": 2.867367664450403e-06, "loss": 139.157421875, "step": 2100 }, { "epoch": 0.5007678244972578, "eval_loss": 2.2643067836761475, "eval_perplexity": 9.653481483459473, "eval_runtime": 1272.3391, "eval_samples_per_second": 8.686, "eval_steps_per_second": 1.086, "step": 2140 }, { "epoch": 0.5148080438756856, "grad_norm": 118.33269500732422, "learning_rate": 2.801198909122156e-06, "loss": 138.7333984375, "step": 2200 }, { "epoch": 0.5382084095063986, "grad_norm": 111.53887176513672, "learning_rate": 2.7394092432028485e-06, "loss": 138.593310546875, "step": 2300 }, { "epoch": 0.5616087751371115, "grad_norm": 116.05701446533203, "learning_rate": 2.6815360246517324e-06, "loss": 137.77955078125, "step": 2400 }, { "epoch": 0.5850091407678245, "grad_norm": 117.56316375732422, "learning_rate": 2.627182269536618e-06, "loss": 137.41365234375, "step": 2500 }, { "epoch": 0.6009213893967094, "eval_loss": 2.2431113719940186, "eval_perplexity": 9.451156616210938, "eval_runtime": 1281.4279, "eval_samples_per_second": 8.625, "eval_steps_per_second": 1.078, "step": 2568 }, { "epoch": 0.6084095063985375, "grad_norm": 119.91163635253906, "learning_rate": 2.576005137637696e-06, "loss": 137.66705078125, "step": 2600 }, { "epoch": 0.6318098720292504, "grad_norm": 112.58194732666016, "learning_rate": 2.5277067936120503e-06, "loss": 137.92888671875, "step": 2700 }, { "epoch": 0.6552102376599634, "grad_norm": 118.54427337646484, "learning_rate": 2.48202708541266e-06, "loss": 136.8133984375, "step": 2800 }, { "epoch": 0.6786106032906765, "grad_norm": 112.7831802368164, "learning_rate": 2.4387376277801515e-06, "loss": 136.398330078125, "step": 2900 }, { "epoch": 0.7010749542961608, "eval_loss": 2.225428342819214, "eval_perplexity": 9.285932540893555, "eval_runtime": 1259.9334, "eval_samples_per_second": 8.772, "eval_steps_per_second": 1.097, "step": 2996 } ], "logging_steps": 100, "max_steps": 4274, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 428, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.660641467170816e+17, "train_batch_size": 2, "trial_name": null, "trial_params": null }