{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.05242879105215299, "eval_steps": 3000, "global_step": 6000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.00043690659210127495, "grad_norm": 1.8826903104782104, "learning_rate": 2.4500000000000003e-05, "loss": 9.762939453125, "step": 50 }, { "epoch": 0.0008738131842025499, "grad_norm": 0.9995923042297363, "learning_rate": 4.9500000000000004e-05, "loss": 8.305597534179688, "step": 100 }, { "epoch": 0.001310719776303825, "grad_norm": 0.9061496257781982, "learning_rate": 7.45e-05, "loss": 7.173495483398438, "step": 150 }, { "epoch": 0.0017476263684050998, "grad_norm": 1.6024847030639648, "learning_rate": 9.95e-05, "loss": 6.624603271484375, "step": 200 }, { "epoch": 0.002184532960506375, "grad_norm": 1.2123334407806396, "learning_rate": 0.0001245, "loss": 6.243399658203125, "step": 250 }, { "epoch": 0.00262143955260765, "grad_norm": 1.0432322025299072, "learning_rate": 0.0001495, "loss": 5.9879296875, "step": 300 }, { "epoch": 0.0030583461447089245, "grad_norm": 0.9280146360397339, "learning_rate": 0.00017449999999999999, "loss": 5.776607666015625, "step": 350 }, { "epoch": 0.0034952527368101996, "grad_norm": 1.0289900302886963, "learning_rate": 0.00019950000000000002, "loss": 5.5920703125, "step": 400 }, { "epoch": 0.003932159328911475, "grad_norm": 1.0593407154083252, "learning_rate": 0.0002245, "loss": 5.437271728515625, "step": 450 }, { "epoch": 0.00436906592101275, "grad_norm": 1.0122662782669067, "learning_rate": 0.0002495, "loss": 5.287777709960937, "step": 500 }, { "epoch": 0.004805972513114025, "grad_norm": 0.7662743926048279, "learning_rate": 0.0002745, "loss": 5.155453491210937, "step": 550 }, { "epoch": 0.0052428791052153, "grad_norm": 0.7941539287567139, "learning_rate": 0.0002995, "loss": 5.030631713867187, "step": 600 }, { "epoch": 0.005679785697316574, "grad_norm": 0.6195730566978455, "learning_rate": 0.00032450000000000003, "loss": 4.909389953613282, "step": 650 }, { "epoch": 0.006116692289417849, "grad_norm": 0.6587674617767334, "learning_rate": 0.0003495, "loss": 4.786273498535156, "step": 700 }, { "epoch": 0.006553598881519124, "grad_norm": 0.7233771681785583, "learning_rate": 0.0003745, "loss": 4.6648342895507815, "step": 750 }, { "epoch": 0.006990505473620399, "grad_norm": 0.5489601492881775, "learning_rate": 0.0003995, "loss": 4.555048522949218, "step": 800 }, { "epoch": 0.007427412065721674, "grad_norm": 0.6154086589813232, "learning_rate": 0.0004245, "loss": 4.461051330566407, "step": 850 }, { "epoch": 0.00786431865782295, "grad_norm": 0.41333407163619995, "learning_rate": 0.00044950000000000003, "loss": 4.374936828613281, "step": 900 }, { "epoch": 0.008301225249924224, "grad_norm": 0.5036063194274902, "learning_rate": 0.0004745, "loss": 4.3033209228515625, "step": 950 }, { "epoch": 0.0087381318420255, "grad_norm": 0.3687891364097595, "learning_rate": 0.0004995, "loss": 4.233715209960938, "step": 1000 }, { "epoch": 0.009175038434126774, "grad_norm": 0.5433846116065979, "learning_rate": 0.0005245, "loss": 4.186253967285157, "step": 1050 }, { "epoch": 0.00961194502622805, "grad_norm": 0.439351350069046, "learning_rate": 0.0005495, "loss": 4.139383850097656, "step": 1100 }, { "epoch": 0.010048851618329325, "grad_norm": 0.36215880513191223, "learning_rate": 0.0005745, "loss": 4.08899658203125, "step": 1150 }, { "epoch": 0.0104857582104306, "grad_norm": 0.3970701992511749, "learning_rate": 0.0005995000000000001, "loss": 4.061238403320313, "step": 1200 }, { "epoch": 0.010922664802531873, "grad_norm": 0.3410918712615967, "learning_rate": 0.0006245000000000001, "loss": 4.026336669921875, "step": 1250 }, { "epoch": 0.011359571394633148, "grad_norm": 0.3047930598258972, "learning_rate": 0.0006495, "loss": 3.9928851318359375, "step": 1300 }, { "epoch": 0.011796477986734423, "grad_norm": 0.2819700241088867, "learning_rate": 0.0006745, "loss": 3.9584146118164063, "step": 1350 }, { "epoch": 0.012233384578835698, "grad_norm": 0.29095014929771423, "learning_rate": 0.0006995, "loss": 3.9291363525390626, "step": 1400 }, { "epoch": 0.012670291170936973, "grad_norm": 0.2987957298755646, "learning_rate": 0.0007245000000000001, "loss": 3.9090225219726564, "step": 1450 }, { "epoch": 0.013107197763038248, "grad_norm": 0.28419050574302673, "learning_rate": 0.0007495000000000001, "loss": 3.890744934082031, "step": 1500 }, { "epoch": 0.013544104355139523, "grad_norm": 0.3039053976535797, "learning_rate": 0.0007745, "loss": 3.861073303222656, "step": 1550 }, { "epoch": 0.013981010947240798, "grad_norm": 0.25676754117012024, "learning_rate": 0.0007995, "loss": 3.8428253173828124, "step": 1600 }, { "epoch": 0.014417917539342073, "grad_norm": 0.2573896646499634, "learning_rate": 0.0008245, "loss": 3.8260653686523436, "step": 1650 }, { "epoch": 0.014854824131443348, "grad_norm": 0.272127240896225, "learning_rate": 0.0008495000000000001, "loss": 3.8006341552734373, "step": 1700 }, { "epoch": 0.015291730723544623, "grad_norm": 0.23205944895744324, "learning_rate": 0.0008745000000000001, "loss": 3.7862649536132813, "step": 1750 }, { "epoch": 0.0157286373156459, "grad_norm": 0.22847425937652588, "learning_rate": 0.0008995, "loss": 3.771934814453125, "step": 1800 }, { "epoch": 0.016165543907747174, "grad_norm": 0.2651786208152771, "learning_rate": 0.0009245, "loss": 3.76009521484375, "step": 1850 }, { "epoch": 0.01660245049984845, "grad_norm": 0.24903950095176697, "learning_rate": 0.0009495, "loss": 3.7454238891601563, "step": 1900 }, { "epoch": 0.017039357091949724, "grad_norm": 0.24524764716625214, "learning_rate": 0.0009745000000000001, "loss": 3.735928955078125, "step": 1950 }, { "epoch": 0.017476263684051, "grad_norm": 0.22325558960437775, "learning_rate": 0.0009995000000000002, "loss": 3.7209417724609377, "step": 2000 }, { "epoch": 0.017913170276152274, "grad_norm": 0.23860357701778412, "learning_rate": 0.001, "loss": 3.7122769165039062, "step": 2050 }, { "epoch": 0.01835007686825355, "grad_norm": 0.2162218689918518, "learning_rate": 0.001, "loss": 3.690401611328125, "step": 2100 }, { "epoch": 0.018786983460354824, "grad_norm": 0.2171812504529953, "learning_rate": 0.001, "loss": 3.6825027465820312, "step": 2150 }, { "epoch": 0.0192238900524561, "grad_norm": 0.22677843272686005, "learning_rate": 0.001, "loss": 3.6679034423828125, "step": 2200 }, { "epoch": 0.019660796644557374, "grad_norm": 0.23934350907802582, "learning_rate": 0.001, "loss": 3.6494000244140623, "step": 2250 }, { "epoch": 0.02009770323665865, "grad_norm": 0.20819289982318878, "learning_rate": 0.001, "loss": 3.640907897949219, "step": 2300 }, { "epoch": 0.020534609828759924, "grad_norm": 0.22890810668468475, "learning_rate": 0.001, "loss": 3.6309326171875, "step": 2350 }, { "epoch": 0.0209715164208612, "grad_norm": 0.2085026353597641, "learning_rate": 0.001, "loss": 3.6261746215820314, "step": 2400 }, { "epoch": 0.021408423012962474, "grad_norm": 0.22136099636554718, "learning_rate": 0.001, "loss": 3.614878845214844, "step": 2450 }, { "epoch": 0.021845329605063746, "grad_norm": 0.21210630238056183, "learning_rate": 0.001, "loss": 3.599817810058594, "step": 2500 }, { "epoch": 0.02228223619716502, "grad_norm": 0.24638274312019348, "learning_rate": 0.001, "loss": 3.591536865234375, "step": 2550 }, { "epoch": 0.022719142789266296, "grad_norm": 0.20501184463500977, "learning_rate": 0.001, "loss": 3.58053955078125, "step": 2600 }, { "epoch": 0.02315604938136757, "grad_norm": 0.2101815640926361, "learning_rate": 0.001, "loss": 3.5824459838867186, "step": 2650 }, { "epoch": 0.023592955973468846, "grad_norm": 0.22906431555747986, "learning_rate": 0.001, "loss": 3.564821472167969, "step": 2700 }, { "epoch": 0.02402986256557012, "grad_norm": 0.20708167552947998, "learning_rate": 0.001, "loss": 3.5566305541992187, "step": 2750 }, { "epoch": 0.024466769157671396, "grad_norm": 0.21956811845302582, "learning_rate": 0.001, "loss": 3.5507748413085936, "step": 2800 }, { "epoch": 0.02490367574977267, "grad_norm": 0.24124488234519958, "learning_rate": 0.001, "loss": 3.5426095581054686, "step": 2850 }, { "epoch": 0.025340582341873946, "grad_norm": 0.20921742916107178, "learning_rate": 0.001, "loss": 3.531602783203125, "step": 2900 }, { "epoch": 0.02577748893397522, "grad_norm": 0.19601280987262726, "learning_rate": 0.001, "loss": 3.5225894165039064, "step": 2950 }, { "epoch": 0.026214395526076496, "grad_norm": 0.20243392884731293, "learning_rate": 0.001, "loss": 3.5183840942382814, "step": 3000 }, { "epoch": 0.026214395526076496, "eval_loss": 3.518667221069336, "eval_runtime": 5.8945, "eval_samples_per_second": 165.579, "eval_steps_per_second": 10.349, "step": 3000 }, { "epoch": 0.02665130211817777, "grad_norm": 0.1983480155467987, "learning_rate": 0.001, "loss": 3.5175689697265624, "step": 3050 }, { "epoch": 0.027088208710279046, "grad_norm": 0.20962044596672058, "learning_rate": 0.001, "loss": 3.501134033203125, "step": 3100 }, { "epoch": 0.02752511530238032, "grad_norm": 0.20161673426628113, "learning_rate": 0.001, "loss": 3.508039855957031, "step": 3150 }, { "epoch": 0.027962021894481597, "grad_norm": 0.21198803186416626, "learning_rate": 0.001, "loss": 3.493387451171875, "step": 3200 }, { "epoch": 0.02839892848658287, "grad_norm": 0.21940743923187256, "learning_rate": 0.001, "loss": 3.4941644287109375, "step": 3250 }, { "epoch": 0.028835835078684147, "grad_norm": 0.23343515396118164, "learning_rate": 0.001, "loss": 3.4835015869140626, "step": 3300 }, { "epoch": 0.02927274167078542, "grad_norm": 0.19761498272418976, "learning_rate": 0.001, "loss": 3.482951965332031, "step": 3350 }, { "epoch": 0.029709648262886697, "grad_norm": 0.22693106532096863, "learning_rate": 0.001, "loss": 3.475736389160156, "step": 3400 }, { "epoch": 0.030146554854987972, "grad_norm": 0.19969327747821808, "learning_rate": 0.001, "loss": 3.4689141845703126, "step": 3450 }, { "epoch": 0.030583461447089247, "grad_norm": 0.23987655341625214, "learning_rate": 0.001, "loss": 3.464185791015625, "step": 3500 }, { "epoch": 0.031020368039190522, "grad_norm": 0.20894227921962738, "learning_rate": 0.001, "loss": 3.4571575927734375, "step": 3550 }, { "epoch": 0.0314572746312918, "grad_norm": 0.22110916674137115, "learning_rate": 0.001, "loss": 3.4559121704101563, "step": 3600 }, { "epoch": 0.03189418122339307, "grad_norm": 0.21295017004013062, "learning_rate": 0.001, "loss": 3.451357421875, "step": 3650 }, { "epoch": 0.03233108781549435, "grad_norm": 0.19029361009597778, "learning_rate": 0.001, "loss": 3.4517440795898438, "step": 3700 }, { "epoch": 0.03276799440759562, "grad_norm": 0.2307061105966568, "learning_rate": 0.001, "loss": 3.4454116821289062, "step": 3750 }, { "epoch": 0.0332049009996969, "grad_norm": 0.2172439694404602, "learning_rate": 0.001, "loss": 3.4348458862304687, "step": 3800 }, { "epoch": 0.03364180759179817, "grad_norm": 0.19329442083835602, "learning_rate": 0.001, "loss": 3.437733154296875, "step": 3850 }, { "epoch": 0.03407871418389945, "grad_norm": 0.2241591513156891, "learning_rate": 0.001, "loss": 3.426455383300781, "step": 3900 }, { "epoch": 0.03451562077600072, "grad_norm": 0.2319568693637848, "learning_rate": 0.001, "loss": 3.433238830566406, "step": 3950 }, { "epoch": 0.034952527368102, "grad_norm": 0.1924877166748047, "learning_rate": 0.001, "loss": 3.4249606323242188, "step": 4000 }, { "epoch": 0.03538943396020327, "grad_norm": 0.2120707631111145, "learning_rate": 0.001, "loss": 3.421075439453125, "step": 4050 }, { "epoch": 0.03582634055230455, "grad_norm": 0.19918771088123322, "learning_rate": 0.001, "loss": 3.4203054809570315, "step": 4100 }, { "epoch": 0.03626324714440582, "grad_norm": 0.2003307044506073, "learning_rate": 0.001, "loss": 3.411707763671875, "step": 4150 }, { "epoch": 0.0367001537365071, "grad_norm": 0.2270653247833252, "learning_rate": 0.001, "loss": 3.4078097534179688, "step": 4200 }, { "epoch": 0.03713706032860837, "grad_norm": 0.21652576327323914, "learning_rate": 0.001, "loss": 3.4062127685546875, "step": 4250 }, { "epoch": 0.03757396692070965, "grad_norm": 0.23578432202339172, "learning_rate": 0.001, "loss": 3.400606689453125, "step": 4300 }, { "epoch": 0.03801087351281092, "grad_norm": 0.20475627481937408, "learning_rate": 0.001, "loss": 3.395752258300781, "step": 4350 }, { "epoch": 0.0384477801049122, "grad_norm": 0.2542702555656433, "learning_rate": 0.001, "loss": 3.396254577636719, "step": 4400 }, { "epoch": 0.03888468669701347, "grad_norm": 0.18298493325710297, "learning_rate": 0.001, "loss": 3.393648986816406, "step": 4450 }, { "epoch": 0.03932159328911475, "grad_norm": 0.22572273015975952, "learning_rate": 0.001, "loss": 3.3865216064453123, "step": 4500 }, { "epoch": 0.03975849988121602, "grad_norm": 0.19484151899814606, "learning_rate": 0.001, "loss": 3.3849478149414063, "step": 4550 }, { "epoch": 0.0401954064733173, "grad_norm": 0.19386635720729828, "learning_rate": 0.001, "loss": 3.38037109375, "step": 4600 }, { "epoch": 0.04063231306541857, "grad_norm": 0.20124493539333344, "learning_rate": 0.001, "loss": 3.382728271484375, "step": 4650 }, { "epoch": 0.04106921965751985, "grad_norm": 0.19963102042675018, "learning_rate": 0.001, "loss": 3.381324462890625, "step": 4700 }, { "epoch": 0.04150612624962112, "grad_norm": 0.20611299574375153, "learning_rate": 0.001, "loss": 3.3788223266601562, "step": 4750 }, { "epoch": 0.0419430328417224, "grad_norm": 0.19405238330364227, "learning_rate": 0.001, "loss": 3.3741259765625, "step": 4800 }, { "epoch": 0.04237993943382367, "grad_norm": 0.20914608240127563, "learning_rate": 0.001, "loss": 3.370547180175781, "step": 4850 }, { "epoch": 0.04281684602592495, "grad_norm": 0.19159191846847534, "learning_rate": 0.001, "loss": 3.3625115966796875, "step": 4900 }, { "epoch": 0.04325375261802622, "grad_norm": 0.19163894653320312, "learning_rate": 0.001, "loss": 3.360504455566406, "step": 4950 }, { "epoch": 0.04369065921012749, "grad_norm": 0.19763918220996857, "learning_rate": 0.001, "loss": 3.3601028442382814, "step": 5000 }, { "epoch": 0.04412756580222877, "grad_norm": 0.18974512815475464, "learning_rate": 0.001, "loss": 3.3579150390625, "step": 5050 }, { "epoch": 0.04456447239433004, "grad_norm": 0.21315094828605652, "learning_rate": 0.001, "loss": 3.355892333984375, "step": 5100 }, { "epoch": 0.04500137898643132, "grad_norm": 0.1904531568288803, "learning_rate": 0.001, "loss": 3.360745849609375, "step": 5150 }, { "epoch": 0.04543828557853259, "grad_norm": 0.19907866418361664, "learning_rate": 0.001, "loss": 3.357358703613281, "step": 5200 }, { "epoch": 0.04587519217063387, "grad_norm": 0.22703590989112854, "learning_rate": 0.001, "loss": 3.356294860839844, "step": 5250 }, { "epoch": 0.04631209876273514, "grad_norm": 0.1892520785331726, "learning_rate": 0.001, "loss": 3.3490374755859373, "step": 5300 }, { "epoch": 0.04674900535483642, "grad_norm": 0.18953296542167664, "learning_rate": 0.001, "loss": 3.3442022705078127, "step": 5350 }, { "epoch": 0.04718591194693769, "grad_norm": 0.1933782547712326, "learning_rate": 0.001, "loss": 3.3514590454101563, "step": 5400 }, { "epoch": 0.04762281853903897, "grad_norm": 0.22573590278625488, "learning_rate": 0.001, "loss": 3.3468975830078125, "step": 5450 }, { "epoch": 0.04805972513114024, "grad_norm": 0.2123604267835617, "learning_rate": 0.001, "loss": 3.3379788208007812, "step": 5500 }, { "epoch": 0.04849663172324152, "grad_norm": 0.18217475712299347, "learning_rate": 0.001, "loss": 3.344074401855469, "step": 5550 }, { "epoch": 0.04893353831534279, "grad_norm": 0.2128428965806961, "learning_rate": 0.001, "loss": 3.3349212646484374, "step": 5600 }, { "epoch": 0.04937044490744407, "grad_norm": 0.19785532355308533, "learning_rate": 0.001, "loss": 3.327950744628906, "step": 5650 }, { "epoch": 0.04980735149954534, "grad_norm": 0.18241338431835175, "learning_rate": 0.001, "loss": 3.334012451171875, "step": 5700 }, { "epoch": 0.05024425809164662, "grad_norm": 0.2020372748374939, "learning_rate": 0.001, "loss": 3.3329043579101563, "step": 5750 }, { "epoch": 0.05068116468374789, "grad_norm": 0.2071504294872284, "learning_rate": 0.001, "loss": 3.33412353515625, "step": 5800 }, { "epoch": 0.05111807127584917, "grad_norm": 0.20365303754806519, "learning_rate": 0.001, "loss": 3.322493591308594, "step": 5850 }, { "epoch": 0.05155497786795044, "grad_norm": 0.21742033958435059, "learning_rate": 0.001, "loss": 3.329978332519531, "step": 5900 }, { "epoch": 0.05199188446005172, "grad_norm": 0.18907567858695984, "learning_rate": 0.001, "loss": 3.328219299316406, "step": 5950 }, { "epoch": 0.05242879105215299, "grad_norm": 0.18905521929264069, "learning_rate": 0.001, "loss": 3.323075866699219, "step": 6000 }, { "epoch": 0.05242879105215299, "eval_loss": 3.3261899948120117, "eval_runtime": 6.1096, "eval_samples_per_second": 159.748, "eval_steps_per_second": 9.984, "step": 6000 } ], "logging_steps": 50, "max_steps": 114440, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 3000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 7.12679224246272e+17, "train_batch_size": 16, "trial_name": null, "trial_params": null }