{ "best_global_step": 320, "best_metric": 0.17490149, "best_model_checkpoint": "/data/home/scyb089/CODE/scripts/ms-swift/3b/v31-20250504-035000/checkpoint-320", "epoch": 2.9977046671767407, "eval_steps": 20, "global_step": 489, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.00612088752869166, "grad_norm": 2.4262969493865967, "learning_rate": 9.999896814055916e-06, "loss": 0.29114457964897156, "memory(GiB)": 27.73, "step": 1, "token_acc": 0.8905354511216637, "train_speed(iter/s)": 0.075742 }, { "epoch": 0.030604437643458302, "grad_norm": 1.4515410661697388, "learning_rate": 9.99742056433851e-06, "loss": 0.2713624835014343, "memory(GiB)": 27.73, "step": 5, "token_acc": 0.9116365441541489, "train_speed(iter/s)": 0.152509 }, { "epoch": 0.061208875286916604, "grad_norm": 0.9496105909347534, "learning_rate": 9.989684918749365e-06, "loss": 0.2552653312683105, "memory(GiB)": 27.73, "step": 10, "token_acc": 0.9153024911032028, "train_speed(iter/s)": 0.174854 }, { "epoch": 0.09181331293037491, "grad_norm": 0.7063636183738708, "learning_rate": 9.976801044672608e-06, "loss": 0.2308896780014038, "memory(GiB)": 27.73, "step": 15, "token_acc": 0.9208086725449933, "train_speed(iter/s)": 0.184963 }, { "epoch": 0.12241775057383321, "grad_norm": 0.7325994372367859, "learning_rate": 9.958782235357938e-06, "loss": 0.23883743286132814, "memory(GiB)": 27.73, "step": 20, "token_acc": 0.9143488349915764, "train_speed(iter/s)": 0.1933 }, { "epoch": 0.12241775057383321, "eval_loss": 0.2350648194551468, "eval_runtime": 3.0009, "eval_samples_per_second": 34.99, "eval_steps_per_second": 8.997, "eval_token_acc": 0.9214235491373249, "step": 20 }, { "epoch": 0.1530221882172915, "grad_norm": 0.6182907223701477, "learning_rate": 9.935647082149088e-06, "loss": 0.22287518978118898, "memory(GiB)": 27.73, "step": 25, "token_acc": 0.9215506715506715, "train_speed(iter/s)": 0.176091 }, { "epoch": 0.18362662586074982, "grad_norm": 0.6147263646125793, "learning_rate": 9.90741945530174e-06, "loss": 0.2169550657272339, "memory(GiB)": 27.73, "step": 30, "token_acc": 0.9242762338076332, "train_speed(iter/s)": 0.182484 }, { "epoch": 0.21423106350420812, "grad_norm": 0.5748075246810913, "learning_rate": 9.874128479354833e-06, "loss": 0.20252976417541504, "memory(GiB)": 27.73, "step": 35, "token_acc": 0.9266982811494906, "train_speed(iter/s)": 0.184908 }, { "epoch": 0.24483550114766642, "grad_norm": 0.5819372534751892, "learning_rate": 9.835808503080586e-06, "loss": 0.2103517770767212, "memory(GiB)": 27.73, "step": 40, "token_acc": 0.9242556390977443, "train_speed(iter/s)": 0.187883 }, { "epoch": 0.24483550114766642, "eval_loss": 0.21685469150543213, "eval_runtime": 2.9694, "eval_samples_per_second": 35.361, "eval_steps_per_second": 9.093, "eval_token_acc": 0.9267889015090054, "step": 40 }, { "epoch": 0.2754399387911247, "grad_norm": 0.5915679931640625, "learning_rate": 9.792499064044343e-06, "loss": 0.22011182308197022, "memory(GiB)": 27.73, "step": 45, "token_acc": 0.9259782645267656, "train_speed(iter/s)": 0.178276 }, { "epoch": 0.306044376434583, "grad_norm": 0.5741272568702698, "learning_rate": 9.744244847810716e-06, "loss": 0.20354759693145752, "memory(GiB)": 27.73, "step": 50, "token_acc": 0.9264593625325863, "train_speed(iter/s)": 0.180934 }, { "epoch": 0.3366488140780413, "grad_norm": 0.6794053316116333, "learning_rate": 9.691095641838168e-06, "loss": 0.20430679321289064, "memory(GiB)": 27.73, "step": 55, "token_acc": 0.9300412165115843, "train_speed(iter/s)": 0.184099 }, { "epoch": 0.36725325172149964, "grad_norm": 0.638066828250885, "learning_rate": 9.633106284109612e-06, "loss": 0.20622057914733888, "memory(GiB)": 27.73, "step": 60, "token_acc": 0.9269024685344354, "train_speed(iter/s)": 0.187435 }, { "epoch": 0.36725325172149964, "eval_loss": 0.20562399923801422, "eval_runtime": 2.9656, "eval_samples_per_second": 35.406, "eval_steps_per_second": 9.104, "eval_token_acc": 0.9300124398290875, "step": 60 }, { "epoch": 0.3978576893649579, "grad_norm": 0.6637494564056396, "learning_rate": 9.570336606551966e-06, "loss": 0.19611797332763672, "memory(GiB)": 27.73, "step": 65, "token_acc": 0.9295485869849984, "train_speed(iter/s)": 0.180966 }, { "epoch": 0.42846212700841624, "grad_norm": 0.6041725873947144, "learning_rate": 9.502851373303137e-06, "loss": 0.19453718662261962, "memory(GiB)": 27.73, "step": 70, "token_acc": 0.935506221719457, "train_speed(iter/s)": 0.182759 }, { "epoch": 0.4590665646518745, "grad_norm": 0.6496462225914001, "learning_rate": 9.43072021389003e-06, "loss": 0.19291472434997559, "memory(GiB)": 27.73, "step": 75, "token_acc": 0.9276501621556994, "train_speed(iter/s)": 0.184684 }, { "epoch": 0.48967100229533284, "grad_norm": 0.6091645359992981, "learning_rate": 9.354017551386599e-06, "loss": 0.19289860725402833, "memory(GiB)": 29.73, "step": 80, "token_acc": 0.9271297939943614, "train_speed(iter/s)": 0.186191 }, { "epoch": 0.48967100229533284, "eval_loss": 0.20189911127090454, "eval_runtime": 2.9558, "eval_samples_per_second": 35.523, "eval_steps_per_second": 9.134, "eval_token_acc": 0.9315160365622803, "step": 80 }, { "epoch": 0.5202754399387911, "grad_norm": 0.6070266962051392, "learning_rate": 9.272822525626047e-06, "loss": 0.18841828107833863, "memory(GiB)": 29.73, "step": 85, "token_acc": 0.9308790049419735, "train_speed(iter/s)": 0.181691 }, { "epoch": 0.5508798775822494, "grad_norm": 0.5664994120597839, "learning_rate": 9.187218911546363e-06, "loss": 0.18708581924438478, "memory(GiB)": 29.73, "step": 90, "token_acc": 0.9307408366791866, "train_speed(iter/s)": 0.183539 }, { "epoch": 0.5814843152257078, "grad_norm": 0.6189126372337341, "learning_rate": 9.09729503275351e-06, "loss": 0.1919234037399292, "memory(GiB)": 29.73, "step": 95, "token_acc": 0.9302339232778609, "train_speed(iter/s)": 0.18417 }, { "epoch": 0.612088752869166, "grad_norm": 0.5816466808319092, "learning_rate": 9.003143670391403e-06, "loss": 0.17953382730484008, "memory(GiB)": 29.73, "step": 100, "token_acc": 0.9341908338745658, "train_speed(iter/s)": 0.185218 }, { "epoch": 0.612088752869166, "eval_loss": 0.19569453597068787, "eval_runtime": 2.9576, "eval_samples_per_second": 35.502, "eval_steps_per_second": 9.129, "eval_token_acc": 0.9332143436638001, "step": 100 }, { "epoch": 0.6426931905126243, "grad_norm": 0.6038978695869446, "learning_rate": 8.904861967412702e-06, "loss": 0.18669098615646362, "memory(GiB)": 29.73, "step": 105, "token_acc": 0.9360083136077594, "train_speed(iter/s)": 0.182365 }, { "epoch": 0.6732976281560826, "grad_norm": 0.6839295029640198, "learning_rate": 8.802551328349222e-06, "loss": 0.18886933326721192, "memory(GiB)": 29.73, "step": 110, "token_acc": 0.9355897003717136, "train_speed(iter/s)": 0.183447 }, { "epoch": 0.703902065799541, "grad_norm": 0.5784356594085693, "learning_rate": 8.696317314685342e-06, "loss": 0.1860347270965576, "memory(GiB)": 29.73, "step": 115, "token_acc": 0.934266941773856, "train_speed(iter/s)": 0.184623 }, { "epoch": 0.7345065034429993, "grad_norm": 0.6492018103599548, "learning_rate": 8.586269535942386e-06, "loss": 0.191730272769928, "memory(GiB)": 29.73, "step": 120, "token_acc": 0.9330231994302426, "train_speed(iter/s)": 0.185813 }, { "epoch": 0.7345065034429993, "eval_loss": 0.19317017495632172, "eval_runtime": 2.9604, "eval_samples_per_second": 35.468, "eval_steps_per_second": 9.12, "eval_token_acc": 0.9342636162042296, "step": 120 }, { "epoch": 0.7651109410864575, "grad_norm": 0.5753573775291443, "learning_rate": 8.472521536586336e-06, "loss": 0.18596272468566893, "memory(GiB)": 29.73, "step": 125, "token_acc": 0.9319849005577779, "train_speed(iter/s)": 0.182874 }, { "epoch": 0.7957153787299158, "grad_norm": 0.586589515209198, "learning_rate": 8.355190678875577e-06, "loss": 0.18235174417495728, "memory(GiB)": 29.73, "step": 130, "token_acc": 0.9364593742793451, "train_speed(iter/s)": 0.183919 }, { "epoch": 0.8263198163733741, "grad_norm": 0.6312227845191956, "learning_rate": 8.234398021769541e-06, "loss": 0.18675460815429687, "memory(GiB)": 29.73, "step": 135, "token_acc": 0.9301861157944705, "train_speed(iter/s)": 0.184691 }, { "epoch": 0.8569242540168325, "grad_norm": 0.5985466837882996, "learning_rate": 8.110268196023179e-06, "loss": 0.18646229505538942, "memory(GiB)": 29.73, "step": 140, "token_acc": 0.9337858101175913, "train_speed(iter/s)": 0.185698 }, { "epoch": 0.8569242540168325, "eval_loss": 0.18890073895454407, "eval_runtime": 2.9675, "eval_samples_per_second": 35.383, "eval_steps_per_second": 9.098, "eval_token_acc": 0.9360809129752826, "step": 140 }, { "epoch": 0.8875286916602907, "grad_norm": 0.6701765060424805, "learning_rate": 7.982929275596164e-06, "loss": 0.18306300640106202, "memory(GiB)": 29.73, "step": 145, "token_acc": 0.9374918368235448, "train_speed(iter/s)": 0.183024 }, { "epoch": 0.918133129303749, "grad_norm": 0.6174297332763672, "learning_rate": 7.85251264550948e-06, "loss": 0.18363630771636963, "memory(GiB)": 29.73, "step": 150, "token_acc": 0.9375606928038264, "train_speed(iter/s)": 0.183651 }, { "epoch": 0.9487375669472073, "grad_norm": 0.6339284181594849, "learning_rate": 7.719152866285722e-06, "loss": 0.17851275205612183, "memory(GiB)": 29.73, "step": 155, "token_acc": 0.9321391193556705, "train_speed(iter/s)": 0.184494 }, { "epoch": 0.9793420045906657, "grad_norm": 0.589568555355072, "learning_rate": 7.5829875351130224e-06, "loss": 0.1714911699295044, "memory(GiB)": 29.73, "step": 160, "token_acc": 0.936993310933695, "train_speed(iter/s)": 0.185314 }, { "epoch": 0.9793420045906657, "eval_loss": 0.18555624783039093, "eval_runtime": 2.9746, "eval_samples_per_second": 35.299, "eval_steps_per_second": 9.077, "eval_token_acc": 0.9358970198496404, "step": 160 }, { "epoch": 1.0122417750573833, "grad_norm": 0.5571500062942505, "learning_rate": 7.44415714387582e-06, "loss": 0.1988983631134033, "memory(GiB)": 29.73, "step": 165, "token_acc": 0.9428557149282822, "train_speed(iter/s)": 0.183086 }, { "epoch": 1.0428462127008415, "grad_norm": 0.668183445930481, "learning_rate": 7.302804934198937e-06, "loss": 0.14512217044830322, "memory(GiB)": 29.73, "step": 170, "token_acc": 0.9455400702401195, "train_speed(iter/s)": 0.183717 }, { "epoch": 1.0734506503443, "grad_norm": 0.6544790267944336, "learning_rate": 7.159076749654559e-06, "loss": 0.1422812223434448, "memory(GiB)": 29.73, "step": 175, "token_acc": 0.9467687539877859, "train_speed(iter/s)": 0.184527 }, { "epoch": 1.1040550879877582, "grad_norm": 0.6180390119552612, "learning_rate": 7.013120885284599e-06, "loss": 0.14142969846725464, "memory(GiB)": 29.73, "step": 180, "token_acc": 0.9519427697810598, "train_speed(iter/s)": 0.185066 }, { "epoch": 1.1040550879877582, "eval_loss": 0.1868736445903778, "eval_runtime": 2.9588, "eval_samples_per_second": 35.487, "eval_steps_per_second": 9.125, "eval_token_acc": 0.9361025474606522, "step": 180 }, { "epoch": 1.1346595256312164, "grad_norm": 0.5758160352706909, "learning_rate": 6.86508793459368e-06, "loss": 0.13951488733291625, "memory(GiB)": 29.73, "step": 185, "token_acc": 0.9455232473644789, "train_speed(iter/s)": 0.182916 }, { "epoch": 1.1652639632746749, "grad_norm": 0.6193047761917114, "learning_rate": 6.715130634170636e-06, "loss": 0.146294903755188, "memory(GiB)": 29.73, "step": 190, "token_acc": 0.9483162813805095, "train_speed(iter/s)": 0.183613 }, { "epoch": 1.195868400918133, "grad_norm": 0.5518524050712585, "learning_rate": 6.563403706098833e-06, "loss": 0.14221264123916627, "memory(GiB)": 29.73, "step": 195, "token_acc": 0.948411852483479, "train_speed(iter/s)": 0.184409 }, { "epoch": 1.2264728385615915, "grad_norm": 0.5622280836105347, "learning_rate": 6.410063698317901e-06, "loss": 0.14119510650634765, "memory(GiB)": 29.73, "step": 200, "token_acc": 0.949674972130127, "train_speed(iter/s)": 0.184756 }, { "epoch": 1.2264728385615915, "eval_loss": 0.18399108946323395, "eval_runtime": 2.9642, "eval_samples_per_second": 35.423, "eval_steps_per_second": 9.109, "eval_token_acc": 0.9372816269132997, "step": 200 }, { "epoch": 1.2570772762050497, "grad_norm": 0.5925666689872742, "learning_rate": 6.255268823101604e-06, "loss": 0.13880105018615724, "memory(GiB)": 29.73, "step": 205, "token_acc": 0.9477773473991206, "train_speed(iter/s)": 0.183189 }, { "epoch": 1.287681713848508, "grad_norm": 0.6059976816177368, "learning_rate": 6.099178793818479e-06, "loss": 0.14395406246185302, "memory(GiB)": 29.73, "step": 210, "token_acc": 0.950825693689833, "train_speed(iter/s)": 0.183549 }, { "epoch": 1.3182861514919664, "grad_norm": 0.563386857509613, "learning_rate": 5.941954660143703e-06, "loss": 0.13854990005493165, "memory(GiB)": 29.73, "step": 215, "token_acc": 0.9485802112183096, "train_speed(iter/s)": 0.184231 }, { "epoch": 1.3488905891354246, "grad_norm": 0.6268328428268433, "learning_rate": 5.783758641892172e-06, "loss": 0.14123060703277587, "memory(GiB)": 29.73, "step": 220, "token_acc": 0.9484895429899303, "train_speed(iter/s)": 0.184974 }, { "epoch": 1.3488905891354246, "eval_loss": 0.18251946568489075, "eval_runtime": 2.9684, "eval_samples_per_second": 35.372, "eval_steps_per_second": 9.096, "eval_token_acc": 0.9383849856671534, "step": 220 }, { "epoch": 1.379495026778883, "grad_norm": 0.5578710436820984, "learning_rate": 5.624753961644281e-06, "loss": 0.14209306240081787, "memory(GiB)": 29.73, "step": 225, "token_acc": 0.9469471634849386, "train_speed(iter/s)": 0.183543 }, { "epoch": 1.4100994644223412, "grad_norm": 0.6176152229309082, "learning_rate": 5.4651046763370615e-06, "loss": 0.1443139672279358, "memory(GiB)": 29.73, "step": 230, "token_acc": 0.9480665287334199, "train_speed(iter/s)": 0.184004 }, { "epoch": 1.4407039020657995, "grad_norm": 0.5799533724784851, "learning_rate": 5.304975507994453e-06, "loss": 0.13565800189971924, "memory(GiB)": 29.73, "step": 235, "token_acc": 0.9535484258411278, "train_speed(iter/s)": 0.184791 }, { "epoch": 1.471308339709258, "grad_norm": 0.6195805072784424, "learning_rate": 5.144531673771364e-06, "loss": 0.13422565460205077, "memory(GiB)": 29.73, "step": 240, "token_acc": 0.9504853626843996, "train_speed(iter/s)": 0.185206 }, { "epoch": 1.471308339709258, "eval_loss": 0.1826462596654892, "eval_runtime": 2.974, "eval_samples_per_second": 35.306, "eval_steps_per_second": 9.079, "eval_token_acc": 0.9378441235329115, "step": 240 }, { "epoch": 1.501912777352716, "grad_norm": 0.5705444812774658, "learning_rate": 4.983938715486858e-06, "loss": 0.13150216341018678, "memory(GiB)": 29.73, "step": 245, "token_acc": 0.9486215675776085, "train_speed(iter/s)": 0.183983 }, { "epoch": 1.5325172149961745, "grad_norm": 0.6076279282569885, "learning_rate": 4.82336232882237e-06, "loss": 0.1356377363204956, "memory(GiB)": 29.73, "step": 250, "token_acc": 0.9495890326460746, "train_speed(iter/s)": 0.184361 }, { "epoch": 1.5631216526396328, "grad_norm": 0.606853187084198, "learning_rate": 4.662968192361161e-06, "loss": 0.1377635955810547, "memory(GiB)": 29.73, "step": 255, "token_acc": 0.9498974208675264, "train_speed(iter/s)": 0.184863 }, { "epoch": 1.593726090283091, "grad_norm": 0.5685162544250488, "learning_rate": 4.502921796645424e-06, "loss": 0.13207011222839354, "memory(GiB)": 29.73, "step": 260, "token_acc": 0.9555538648813147, "train_speed(iter/s)": 0.185408 }, { "epoch": 1.593726090283091, "eval_loss": 0.18062403798103333, "eval_runtime": 2.9631, "eval_samples_per_second": 35.435, "eval_steps_per_second": 9.112, "eval_token_acc": 0.9392503650819406, "step": 260 }, { "epoch": 1.6243305279265492, "grad_norm": 0.6115860342979431, "learning_rate": 4.3433882734274e-06, "loss": 0.13854453563690186, "memory(GiB)": 29.73, "step": 265, "token_acc": 0.950067791336045, "train_speed(iter/s)": 0.184317 }, { "epoch": 1.6549349655700076, "grad_norm": 0.594256579875946, "learning_rate": 4.184532225290687e-06, "loss": 0.14273109436035156, "memory(GiB)": 29.73, "step": 270, "token_acc": 0.949110499003211, "train_speed(iter/s)": 0.184908 }, { "epoch": 1.685539403213466, "grad_norm": 0.6124013662338257, "learning_rate": 4.026517555817527e-06, "loss": 0.14174976348876953, "memory(GiB)": 29.73, "step": 275, "token_acc": 0.9440209335390386, "train_speed(iter/s)": 0.185319 }, { "epoch": 1.7161438408569243, "grad_norm": 0.5577505230903625, "learning_rate": 3.869507300477311e-06, "loss": 0.14029152393341066, "memory(GiB)": 29.73, "step": 280, "token_acc": 0.949042973113875, "train_speed(iter/s)": 0.185887 }, { "epoch": 1.7161438408569243, "eval_loss": 0.17867250740528107, "eval_runtime": 2.9631, "eval_samples_per_second": 35.436, "eval_steps_per_second": 9.112, "eval_token_acc": 0.9399534858564552, "step": 280 }, { "epoch": 1.7467482785003825, "grad_norm": 0.5901487469673157, "learning_rate": 3.7136634584107787e-06, "loss": 0.13561428785324098, "memory(GiB)": 32.03, "step": 285, "token_acc": 0.9532760191419626, "train_speed(iter/s)": 0.184838 }, { "epoch": 1.7773527161438407, "grad_norm": 0.5688520073890686, "learning_rate": 3.5591468252834654e-06, "loss": 0.13801207542419433, "memory(GiB)": 32.03, "step": 290, "token_acc": 0.9521514789965446, "train_speed(iter/s)": 0.185292 }, { "epoch": 1.8079571537872992, "grad_norm": 0.5571552515029907, "learning_rate": 3.4061168273808896e-06, "loss": 0.13579220771789552, "memory(GiB)": 32.03, "step": 295, "token_acc": 0.9481830960882842, "train_speed(iter/s)": 0.18574 }, { "epoch": 1.8385615914307576, "grad_norm": 0.5458003282546997, "learning_rate": 3.254731357116597e-06, "loss": 0.13743789196014405, "memory(GiB)": 32.03, "step": 300, "token_acc": 0.9545541917236455, "train_speed(iter/s)": 0.186123 }, { "epoch": 1.8385615914307576, "eval_loss": 0.17722059786319733, "eval_runtime": 2.9691, "eval_samples_per_second": 35.364, "eval_steps_per_second": 9.094, "eval_token_acc": 0.9400183893125642, "step": 300 }, { "epoch": 1.8691660290742158, "grad_norm": 0.5650319457054138, "learning_rate": 3.105146610122839e-06, "loss": 0.13116140365600587, "memory(GiB)": 32.03, "step": 305, "token_acc": 0.9474181254005194, "train_speed(iter/s)": 0.185096 }, { "epoch": 1.899770466717674, "grad_norm": 0.5377411842346191, "learning_rate": 2.95751692409194e-06, "loss": 0.141234827041626, "memory(GiB)": 32.03, "step": 310, "token_acc": 0.9441545925827463, "train_speed(iter/s)": 0.185517 }, { "epoch": 1.9303749043611322, "grad_norm": 0.5164922475814819, "learning_rate": 2.8119946195346375e-06, "loss": 0.13225994110107422, "memory(GiB)": 32.03, "step": 315, "token_acc": 0.9511941848390446, "train_speed(iter/s)": 0.185993 }, { "epoch": 1.9609793420045907, "grad_norm": 0.5725815892219543, "learning_rate": 2.6687298426196974e-06, "loss": 0.1376440167427063, "memory(GiB)": 32.03, "step": 320, "token_acc": 0.9511019926015729, "train_speed(iter/s)": 0.186367 }, { "epoch": 1.9609793420045907, "eval_loss": 0.17490148544311523, "eval_runtime": 2.9672, "eval_samples_per_second": 35.386, "eval_steps_per_second": 9.099, "eval_token_acc": 0.9408945859700363, "step": 320 }, { "epoch": 1.9915837796480491, "grad_norm": 0.5404472947120667, "learning_rate": 2.527870410256966e-06, "loss": 0.1282888650894165, "memory(GiB)": 32.03, "step": 325, "token_acc": 0.9526283186802439, "train_speed(iter/s)": 0.185372 }, { "epoch": 2.0244835501147667, "grad_norm": 0.5364894270896912, "learning_rate": 2.389561657583681e-06, "loss": 0.14493446350097655, "memory(GiB)": 32.03, "step": 330, "token_acc": 0.9557499000952937, "train_speed(iter/s)": 0.185654 }, { "epoch": 2.055087987758225, "grad_norm": 0.5487475395202637, "learning_rate": 2.253946288011419e-06, "loss": 0.10785077810287476, "memory(GiB)": 32.03, "step": 335, "token_acc": 0.9601302750594264, "train_speed(iter/s)": 0.186057 }, { "epoch": 2.085692425401683, "grad_norm": 0.5607486963272095, "learning_rate": 2.121164225988387e-06, "loss": 0.10882875919342042, "memory(GiB)": 32.03, "step": 340, "token_acc": 0.9595018647214418, "train_speed(iter/s)": 0.186452 }, { "epoch": 2.085692425401683, "eval_loss": 0.18441390991210938, "eval_runtime": 2.9649, "eval_samples_per_second": 35.415, "eval_steps_per_second": 9.107, "eval_token_acc": 0.9401265617394127, "step": 340 }, { "epoch": 2.1162968630451418, "grad_norm": 0.539606511592865, "learning_rate": 1.9913524726289784e-06, "loss": 0.1085669994354248, "memory(GiB)": 32.03, "step": 345, "token_acc": 0.9560936203659229, "train_speed(iter/s)": 0.185455 }, { "epoch": 2.1469013006886, "grad_norm": 0.5162772536277771, "learning_rate": 1.8646449643595565e-06, "loss": 0.10514116287231445, "memory(GiB)": 32.03, "step": 350, "token_acc": 0.9644231329796537, "train_speed(iter/s)": 0.185643 }, { "epoch": 2.177505738332058, "grad_norm": 0.5563685894012451, "learning_rate": 1.7411724347262826e-06, "loss": 0.11478805541992188, "memory(GiB)": 32.03, "step": 355, "token_acc": 0.9576824543864034, "train_speed(iter/s)": 0.186082 }, { "epoch": 2.2081101759755164, "grad_norm": 0.5719069242477417, "learning_rate": 1.621062279507617e-06, "loss": 0.10535905361175538, "memory(GiB)": 32.03, "step": 360, "token_acc": 0.9599832227797368, "train_speed(iter/s)": 0.1864 }, { "epoch": 2.2081101759755164, "eval_loss": 0.1818896383047104, "eval_runtime": 2.968, "eval_samples_per_second": 35.378, "eval_steps_per_second": 9.097, "eval_token_acc": 0.9408621342419817, "step": 360 }, { "epoch": 2.2387146136189746, "grad_norm": 0.5362414121627808, "learning_rate": 1.5044384252706312e-06, "loss": 0.1083768367767334, "memory(GiB)": 32.03, "step": 365, "token_acc": 0.9576676318628286, "train_speed(iter/s)": 0.185562 }, { "epoch": 2.269319051262433, "grad_norm": 0.5509895086288452, "learning_rate": 1.3914212015067653e-06, "loss": 0.10523394346237183, "memory(GiB)": 32.03, "step": 370, "token_acc": 0.9611730489578284, "train_speed(iter/s)": 0.185837 }, { "epoch": 2.2999234889058915, "grad_norm": 0.5473169684410095, "learning_rate": 1.2821272164789544e-06, "loss": 0.10544384717941284, "memory(GiB)": 32.03, "step": 375, "token_acc": 0.9595612848087743, "train_speed(iter/s)": 0.186197 }, { "epoch": 2.3305279265493497, "grad_norm": 0.5506060719490051, "learning_rate": 1.1766692369082255e-06, "loss": 0.10901916027069092, "memory(GiB)": 32.03, "step": 380, "token_acc": 0.9595015576323987, "train_speed(iter/s)": 0.18649 }, { "epoch": 2.3305279265493497, "eval_loss": 0.18156129121780396, "eval_runtime": 2.9586, "eval_samples_per_second": 35.49, "eval_steps_per_second": 9.126, "eval_token_acc": 0.9409054032127211, "step": 380 }, { "epoch": 2.361132364192808, "grad_norm": 0.5408657193183899, "learning_rate": 1.0751560716238968e-06, "loss": 0.10397273302078247, "memory(GiB)": 32.03, "step": 385, "token_acc": 0.9595956316091394, "train_speed(iter/s)": 0.185677 }, { "epoch": 2.391736801836266, "grad_norm": 0.565687358379364, "learning_rate": 9.776924592974257e-07, "loss": 0.10786858797073365, "memory(GiB)": 32.03, "step": 390, "token_acc": 0.9580994261477046, "train_speed(iter/s)": 0.185992 }, { "epoch": 2.4223412394797244, "grad_norm": 0.5598291754722595, "learning_rate": 8.843789603757446e-07, "loss": 0.10539779663085938, "memory(GiB)": 32.03, "step": 395, "token_acc": 0.9650639142961036, "train_speed(iter/s)": 0.186263 }, { "epoch": 2.452945677123183, "grad_norm": 0.5249931216239929, "learning_rate": 7.953118533255821e-07, "loss": 0.10175876617431641, "memory(GiB)": 32.03, "step": 400, "token_acc": 0.9630585035539542, "train_speed(iter/s)": 0.186474 }, { "epoch": 2.452945677123183, "eval_loss": 0.18106642365455627, "eval_runtime": 2.9642, "eval_samples_per_second": 35.423, "eval_steps_per_second": 9.109, "eval_token_acc": 0.9406998756017091, "step": 400 }, { "epoch": 2.4835501147666412, "grad_norm": 0.5907252430915833, "learning_rate": 7.105830352958143e-07, "loss": 0.10489962100982667, "memory(GiB)": 32.03, "step": 405, "token_acc": 0.9566693129911521, "train_speed(iter/s)": 0.185755 }, { "epoch": 2.5141545524100994, "grad_norm": 0.5359929203987122, "learning_rate": 6.302799273003546e-07, "loss": 0.10674171447753907, "memory(GiB)": 32.03, "step": 410, "token_acc": 0.9589793334758233, "train_speed(iter/s)": 0.186023 }, { "epoch": 2.5447589900535577, "grad_norm": 0.5575762987136841, "learning_rate": 5.544853840193981e-07, "loss": 0.10684401988983154, "memory(GiB)": 32.03, "step": 415, "token_acc": 0.961750384418247, "train_speed(iter/s)": 0.186382 }, { "epoch": 2.575363427697016, "grad_norm": 0.5757756233215332, "learning_rate": 4.832776083120983e-07, "loss": 0.10789649486541748, "memory(GiB)": 32.03, "step": 420, "token_acc": 0.9595656339827531, "train_speed(iter/s)": 0.186545 }, { "epoch": 2.575363427697016, "eval_loss": 0.18043935298919678, "eval_runtime": 2.9657, "eval_samples_per_second": 35.404, "eval_steps_per_second": 9.104, "eval_token_acc": 0.9409162204554059, "step": 420 }, { "epoch": 2.6059678653404745, "grad_norm": 0.5543663501739502, "learning_rate": 4.167300705288718e-07, "loss": 0.10247746706008912, "memory(GiB)": 32.03, "step": 425, "token_acc": 0.9594139385812865, "train_speed(iter/s)": 0.185739 }, { "epoch": 2.6365723029839327, "grad_norm": 0.545873761177063, "learning_rate": 3.5491143270657445e-07, "loss": 0.1048995852470398, "memory(GiB)": 32.03, "step": 430, "token_acc": 0.9606733925249195, "train_speed(iter/s)": 0.185979 }, { "epoch": 2.667176740627391, "grad_norm": 0.5157749056816101, "learning_rate": 2.9788547772478416e-07, "loss": 0.10134179592132568, "memory(GiB)": 32.03, "step": 435, "token_acc": 0.9625057155921354, "train_speed(iter/s)": 0.186374 }, { "epoch": 2.697781178270849, "grad_norm": 0.5268109440803528, "learning_rate": 2.457110434962645e-07, "loss": 0.10287988185882568, "memory(GiB)": 32.03, "step": 440, "token_acc": 0.9619926437374976, "train_speed(iter/s)": 0.186687 }, { "epoch": 2.697781178270849, "eval_loss": 0.18037647008895874, "eval_runtime": 2.9654, "eval_samples_per_second": 35.409, "eval_steps_per_second": 9.105, "eval_token_acc": 0.941046027367624, "step": 440 }, { "epoch": 2.7283856159143074, "grad_norm": 0.5612174272537231, "learning_rate": 1.984419622595224e-07, "loss": 0.10738935470581054, "memory(GiB)": 32.03, "step": 445, "token_acc": 0.9575748052706009, "train_speed(iter/s)": 0.185904 }, { "epoch": 2.758990053557766, "grad_norm": 0.5592919588088989, "learning_rate": 1.561270050360897e-07, "loss": 0.1064642071723938, "memory(GiB)": 32.03, "step": 450, "token_acc": 0.9620171040990858, "train_speed(iter/s)": 0.186133 }, { "epoch": 2.7895944912012243, "grad_norm": 0.5563650131225586, "learning_rate": 1.1880983130983626e-07, "loss": 0.11139054298400879, "memory(GiB)": 32.03, "step": 455, "token_acc": 0.9608461825416563, "train_speed(iter/s)": 0.186386 }, { "epoch": 2.8201989288446825, "grad_norm": 0.5721088647842407, "learning_rate": 8.652894398024137e-08, "loss": 0.1031692385673523, "memory(GiB)": 32.03, "step": 460, "token_acc": 0.9663138518177634, "train_speed(iter/s)": 0.186591 }, { "epoch": 2.8201989288446825, "eval_loss": 0.1801983118057251, "eval_runtime": 2.9604, "eval_samples_per_second": 35.468, "eval_steps_per_second": 9.12, "eval_token_acc": 0.941110930823733, "step": 460 }, { "epoch": 2.8508033664881407, "grad_norm": 0.5719510316848755, "learning_rate": 5.9317649636088656e-08, "loss": 0.10809749364852905, "memory(GiB)": 32.03, "step": 465, "token_acc": 0.9583455558814902, "train_speed(iter/s)": 0.185906 }, { "epoch": 2.881407804131599, "grad_norm": 0.5535134673118591, "learning_rate": 3.720402419058966e-08, "loss": 0.10542930364608764, "memory(GiB)": 32.03, "step": 470, "token_acc": 0.9625262091383702, "train_speed(iter/s)": 0.18623 }, { "epoch": 2.9120122417750576, "grad_norm": 0.5565011501312256, "learning_rate": 2.0210883913376334e-08, "loss": 0.10625803470611572, "memory(GiB)": 32.03, "step": 475, "token_acc": 0.9594989624827711, "train_speed(iter/s)": 0.186434 }, { "epoch": 2.942616679418516, "grad_norm": 0.5512571334838867, "learning_rate": 8.35576188926046e-09, "loss": 0.098574298620224, "memory(GiB)": 32.03, "step": 480, "token_acc": 0.9657953849295488, "train_speed(iter/s)": 0.186661 }, { "epoch": 2.942616679418516, "eval_loss": 0.18013475835323334, "eval_runtime": 2.956, "eval_samples_per_second": 35.52, "eval_steps_per_second": 9.134, "eval_token_acc": 0.9411433825517875, "step": 480 }, { "epoch": 2.973221117061974, "grad_norm": 0.5630972385406494, "learning_rate": 1.6508899280515134e-09, "loss": 0.10670101642608643, "memory(GiB)": 32.03, "step": 485, "token_acc": 0.9557970508071842, "train_speed(iter/s)": 0.186012 }, { "epoch": 2.9977046671767407, "eval_loss": 0.18032938241958618, "eval_runtime": 2.9668, "eval_samples_per_second": 35.392, "eval_steps_per_second": 9.101, "eval_token_acc": 0.9413380929201146, "step": 489 } ], "logging_steps": 5, "max_steps": 489, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 20, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 7.018693783621468e+17, "train_batch_size": 1, "trial_name": null, "trial_params": null }