commit bbb40dabc8c2f219b10b7a34012c11aa75e6a043 Author: ModelHub XC Date: Fri Sep 4 00:35:05 2026 +0800 初始化项目,由ModelHub XC社区提供模型 Model: sunshineNew/qwen3-8b-instruct-sdf Source: Original Platform diff --git a/.gitattributes b/.gitattributes new file mode 100644 index 0000000..52373fe --- /dev/null +++ b/.gitattributes @@ -0,0 +1,36 @@ +*.7z filter=lfs diff=lfs merge=lfs -text +*.arrow filter=lfs diff=lfs merge=lfs -text +*.bin filter=lfs diff=lfs merge=lfs -text +*.bz2 filter=lfs diff=lfs merge=lfs -text +*.ckpt filter=lfs diff=lfs merge=lfs -text +*.ftz filter=lfs diff=lfs merge=lfs -text +*.gz filter=lfs diff=lfs merge=lfs -text +*.h5 filter=lfs diff=lfs merge=lfs -text +*.joblib filter=lfs diff=lfs merge=lfs -text +*.lfs.* filter=lfs diff=lfs merge=lfs -text +*.mlmodel filter=lfs diff=lfs merge=lfs -text +*.model filter=lfs diff=lfs merge=lfs -text +*.msgpack filter=lfs diff=lfs merge=lfs -text +*.npy filter=lfs diff=lfs merge=lfs -text +*.npz filter=lfs diff=lfs merge=lfs -text +*.onnx filter=lfs diff=lfs merge=lfs -text +*.ot filter=lfs diff=lfs merge=lfs -text +*.parquet filter=lfs diff=lfs merge=lfs -text +*.pb filter=lfs diff=lfs merge=lfs -text +*.pickle filter=lfs diff=lfs merge=lfs -text +*.pkl filter=lfs diff=lfs merge=lfs -text +*.pt filter=lfs diff=lfs merge=lfs -text +*.pth filter=lfs diff=lfs merge=lfs -text +*.rar filter=lfs diff=lfs merge=lfs -text +*.safetensors filter=lfs diff=lfs merge=lfs -text +saved_model/**/* filter=lfs diff=lfs merge=lfs -text +*.tar.* filter=lfs diff=lfs merge=lfs -text +*.tar filter=lfs diff=lfs merge=lfs -text +*.tflite filter=lfs diff=lfs merge=lfs -text +*.tgz filter=lfs diff=lfs merge=lfs -text +*.wasm filter=lfs diff=lfs merge=lfs -text +*.xz filter=lfs diff=lfs merge=lfs -text +*.zip filter=lfs diff=lfs merge=lfs -text +*.zst filter=lfs diff=lfs merge=lfs -text +*tfevents* filter=lfs diff=lfs merge=lfs -text +tokenizer.json filter=lfs diff=lfs merge=lfs -text diff --git a/chat_template.jinja b/chat_template.jinja new file mode 100644 index 0000000..a3e8a26 --- /dev/null +++ b/chat_template.jinja @@ -0,0 +1,69 @@ +{#- OLMo 3 Instruct SFT chat template (ChatML format). + Based on allenai/Olmo-3-7B-Instruct-SFT with {%- generation %} tags added + for completion_only_loss training support. -#} + +{%- set has_system = messages | selectattr('role', 'equalto', 'system') | list | length > 0 -%} + +{%- if not has_system -%} + {{- '<|im_start|>system\nYou are a helpful AI assistant.' -}} + {%- if tools is not none and (tools | length) > 0 -%} + {{- ' You are provided with function signatures within XML tags. You may call one or more functions to assist with the user query. Output any function calls within XML tags. Do not make assumptions about what values to plug into functions.' -}} + {{- '' + tools | tojson + '' -}} + {%- endif -%} + {{- '<|im_end|>\n' -}} +{%- endif -%} + +{%- for message in messages -%} + {%- if message['role'] == 'system' -%} + {{- '<|im_start|>system\n' + message['content'] -}} + {%- if tools is not none -%} + {{- '' + tools | tojson + '' -}} + {%- elif message.get('functions', none) is not none -%} + {{- ' ' + message['functions'] + '' -}} + {%- endif -%} + {{- '<|im_end|>\n' -}} + + {%- elif message['role'] == 'user' -%} + {{- '<|im_start|>user\n' + message['content'] + '<|im_end|>\n' -}} + + {%- elif message['role'] == 'assistant' -%} + {{- '<|im_start|>assistant\n' -}} + {% generation %} + {%- if message.get('content', none) is not none -%} + {{- message['content'] -}} + {%- endif -%} + {%- if message.get('function_calls', none) is not none -%} + {{- '' + message['function_calls'] + '' -}} + {%- elif message.get('tool_calls', none) is not none -%} + {{- '' -}} + {%- for tool_call in message['tool_calls'] -%} + {%- if tool_call is mapping and tool_call.get('function', none) is not none -%} + {%- set args = tool_call['function']['arguments'] -%} + {%- set ns = namespace(arguments_list=[]) -%} + {%- for key, value in args.items() -%} + {%- set ns.arguments_list = ns.arguments_list + [key ~ '=' ~ (value | tojson)] -%} + {%- endfor -%} + {{- tool_call['function']['name'] + '(' + ns.arguments_list | join(', ') + ')' -}} + {%- else -%} + {{- tool_call -}} + {%- endif -%} + {%- if not loop.last -%}{{ '\n' }}{%- endif -%} + {%- endfor -%} + {{- '' -}} + {%- endif -%} + {%- if not loop.last -%} + {{- '<|im_end|>\n' -}} + {%- else -%} + {{- eos_token -}} + {%- endif -%} + {% endgeneration %} + + {%- elif message['role'] == 'environment' or message['role'] == 'tool' -%} + {{- '<|im_start|>environment\n' + message['content'] + '<|im_end|>\n' -}} + + {%- endif -%} + + {%- if loop.last and add_generation_prompt -%} + {{- '<|im_start|>assistant\n' -}} + {%- endif -%} +{%- endfor -%} \ No newline at end of file diff --git a/config.json b/config.json new file mode 100644 index 0000000..c9d6083 --- /dev/null +++ b/config.json @@ -0,0 +1,71 @@ +{ + "architectures": [ + "Qwen3ForCausalLM" + ], + "attention_bias": false, + "attention_dropout": 0.0, + "bos_token_id": null, + "dtype": "bfloat16", + "eos_token_id": 151643, + "head_dim": 128, + "hidden_act": "silu", + "hidden_size": 4096, + "initializer_range": 0.02, + "intermediate_size": 12288, + "layer_types": [ + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention" + ], + "max_position_embeddings": 32768, + "max_window_layers": 36, + "model_type": "qwen3", + "num_attention_heads": 32, + "num_hidden_layers": 36, + "num_key_value_heads": 8, + "pad_token_id": 151643, + "rms_norm_eps": 1e-06, + "rope_parameters": { + "rope_theta": 1000000, + "rope_type": "default" + }, + "sliding_window": null, + "tie_word_embeddings": false, + "transformers_version": "5.3.0.dev0", + "use_cache": false, + "use_sliding_window": false, + "vocab_size": 151936 +} diff --git a/generation_config.json b/generation_config.json new file mode 100644 index 0000000..06e0bf0 --- /dev/null +++ b/generation_config.json @@ -0,0 +1,9 @@ +{ + "do_sample": false, + "eos_token_id": [ + 151643 + ], + "max_new_tokens": 2048, + "pad_token_id": 151643, + "transformers_version": "5.3.0.dev0" +} diff --git a/model.safetensors b/model.safetensors new file mode 100644 index 0000000..cc56f69 --- /dev/null +++ b/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:862a42ccc7a81655eadd8b2c4b910cf7d7796580b5efffad24d875e84e58a724 +size 16381517208 diff --git a/tokenizer.json b/tokenizer.json new file mode 100644 index 0000000..c7afbed --- /dev/null +++ b/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:be75606093db2094d7cd20f3c2f385c212750648bd6ea4fb2bf507a6a4c55506 +size 11422650 diff --git a/tokenizer_config.json b/tokenizer_config.json new file mode 100644 index 0000000..1ce8d7b --- /dev/null +++ b/tokenizer_config.json @@ -0,0 +1,29 @@ +{ + "add_prefix_space": false, + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "extra_special_tokens": [ + "<|im_start|>", + "<|im_end|>", + "<|object_ref_start|>", + "<|object_ref_end|>", + "<|box_start|>", + "<|box_end|>", + "<|quad_start|>", + "<|quad_end|>", + "<|vision_start|>", + "<|vision_end|>", + "<|vision_pad|>", + "<|image_pad|>", + "<|video_pad|>" + ], + "is_local": true, + "model_max_length": 131072, + "pad_token": "<|endoftext|>", + "split_special_tokens": false, + "tokenizer_class": "Qwen2Tokenizer", + "unk_token": null +} diff --git a/trainer_state.json b/trainer_state.json new file mode 100644 index 0000000..aee9039 --- /dev/null +++ b/trainer_state.json @@ -0,0 +1,7034 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.6600582265649863, + "eval_steps": 500, + "global_step": 7000, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 0.9377105624414981, + "epoch": 0.0009429403236642661, + "grad_norm": 1.2421875, + "learning_rate": 1.5000000000000002e-07, + "loss": 0.84810791015625, + "mean_token_accuracy": 0.6954030711203814, + "num_tokens": 41672.0, + "step": 10 + }, + { + "entropy": 0.9366529762744904, + "epoch": 0.0018858806473285323, + "grad_norm": 0.98046875, + "learning_rate": 3.166666666666667e-07, + "loss": 0.7408034801483154, + "mean_token_accuracy": 0.6973626937717199, + "num_tokens": 86016.0, + "step": 20 + }, + { + "entropy": 0.9000760725699365, + "epoch": 0.0028288209709927984, + "grad_norm": 0.66015625, + "learning_rate": 4.833333333333334e-07, + "loss": 0.677955436706543, + "mean_token_accuracy": 0.7110291102901101, + "num_tokens": 123791.0, + "step": 30 + }, + { + "entropy": 1.0092571526765823, + "epoch": 0.0037717612946570646, + "grad_norm": 1.015625, + "learning_rate": 6.5e-07, + "loss": 0.7101857662200928, + "mean_token_accuracy": 0.699547297693789, + "num_tokens": 166292.0, + "step": 40 + }, + { + "entropy": 0.8959570353850722, + "epoch": 0.004714701618321331, + "grad_norm": 0.6953125, + "learning_rate": 8.166666666666668e-07, + "loss": 0.6740357875823975, + "mean_token_accuracy": 0.7126540616154671, + "num_tokens": 207843.0, + "step": 50 + }, + { + "entropy": 0.8416860729455948, + "epoch": 0.005657641941985597, + "grad_norm": 0.48828125, + "learning_rate": 9.833333333333334e-07, + "loss": 0.7373227596282959, + "mean_token_accuracy": 0.7413243912160397, + "num_tokens": 250846.0, + "step": 60 + }, + { + "entropy": 0.7951943324878812, + "epoch": 0.006600582265649863, + "grad_norm": 1.1328125, + "learning_rate": 1.1500000000000002e-06, + "loss": 0.6532743453979493, + "mean_token_accuracy": 0.7555031452327967, + "num_tokens": 296289.0, + "step": 70 + }, + { + "entropy": 0.9203432088717818, + "epoch": 0.007543522589314129, + "grad_norm": 0.78125, + "learning_rate": 1.3166666666666666e-06, + "loss": 0.7728577136993409, + "mean_token_accuracy": 0.717721626535058, + "num_tokens": 342924.0, + "step": 80 + }, + { + "entropy": 0.9101250190287828, + "epoch": 0.008486462912978394, + "grad_norm": 0.48046875, + "learning_rate": 1.4833333333333337e-06, + "loss": 0.736940574645996, + "mean_token_accuracy": 0.7175416748970747, + "num_tokens": 389818.0, + "step": 90 + }, + { + "entropy": 0.9771212268620729, + "epoch": 0.009429403236642661, + "grad_norm": 0.6875, + "learning_rate": 1.6500000000000003e-06, + "loss": 0.8331009864807128, + "mean_token_accuracy": 0.7274765845388174, + "num_tokens": 431465.0, + "step": 100 + }, + { + "entropy": 0.9352089989930391, + "epoch": 0.010372343560306927, + "grad_norm": 0.478515625, + "learning_rate": 1.816666666666667e-06, + "loss": 0.8612667083740234, + "mean_token_accuracy": 0.7201700910925866, + "num_tokens": 467267.0, + "step": 110 + }, + { + "entropy": 0.7851263372227549, + "epoch": 0.011315283883971194, + "grad_norm": 0.400390625, + "learning_rate": 1.9833333333333335e-06, + "loss": 0.6035785675048828, + "mean_token_accuracy": 0.7742446877062321, + "num_tokens": 510439.0, + "step": 120 + }, + { + "entropy": 0.8613772111944854, + "epoch": 0.012258224207635459, + "grad_norm": 0.59375, + "learning_rate": 2.15e-06, + "loss": 0.6771652221679687, + "mean_token_accuracy": 0.7419699221849442, + "num_tokens": 560257.0, + "step": 130 + }, + { + "entropy": 0.6902340137399733, + "epoch": 0.013201164531299726, + "grad_norm": 0.423828125, + "learning_rate": 2.316666666666667e-06, + "loss": 0.5627652168273926, + "mean_token_accuracy": 0.7800763368606567, + "num_tokens": 611089.0, + "step": 140 + }, + { + "entropy": 0.8741010932251811, + "epoch": 0.014144104854963991, + "grad_norm": 0.734375, + "learning_rate": 2.4833333333333334e-06, + "loss": 0.7286121368408203, + "mean_token_accuracy": 0.7611308570951223, + "num_tokens": 653242.0, + "step": 150 + }, + { + "entropy": 0.9950330995023251, + "epoch": 0.015087045178628258, + "grad_norm": 0.42578125, + "learning_rate": 2.6500000000000005e-06, + "loss": 0.6086991310119629, + "mean_token_accuracy": 0.7128357637673617, + "num_tokens": 699335.0, + "step": 160 + }, + { + "entropy": 1.0139703455381095, + "epoch": 0.016029985502292524, + "grad_norm": 0.71875, + "learning_rate": 2.816666666666667e-06, + "loss": 0.716233777999878, + "mean_token_accuracy": 0.7203566078096628, + "num_tokens": 745545.0, + "step": 170 + }, + { + "entropy": 0.8151160830631852, + "epoch": 0.01697292582595679, + "grad_norm": 0.7421875, + "learning_rate": 2.9833333333333337e-06, + "loss": 0.7127080917358398, + "mean_token_accuracy": 0.7654837179929018, + "num_tokens": 788484.0, + "step": 180 + }, + { + "entropy": 0.9775107364170253, + "epoch": 0.017915866149621054, + "grad_norm": 0.3515625, + "learning_rate": 3.1500000000000003e-06, + "loss": 0.6497589588165283, + "mean_token_accuracy": 0.723390669375658, + "num_tokens": 829584.0, + "step": 190 + }, + { + "entropy": 0.939525655657053, + "epoch": 0.018858806473285323, + "grad_norm": 0.5390625, + "learning_rate": 3.316666666666667e-06, + "loss": 0.8930251121520996, + "mean_token_accuracy": 0.7298649605363607, + "num_tokens": 880250.0, + "step": 200 + }, + { + "entropy": 0.8969364328309893, + "epoch": 0.019801746796949588, + "grad_norm": 0.4453125, + "learning_rate": 3.4833333333333336e-06, + "loss": 0.5880197048187256, + "mean_token_accuracy": 0.7570957642048597, + "num_tokens": 923548.0, + "step": 210 + }, + { + "entropy": 0.8533092273399234, + "epoch": 0.020744687120613853, + "grad_norm": 0.546875, + "learning_rate": 3.65e-06, + "loss": 0.588037633895874, + "mean_token_accuracy": 0.7782193420454859, + "num_tokens": 971736.0, + "step": 220 + }, + { + "entropy": 0.9134741343557835, + "epoch": 0.02168762744427812, + "grad_norm": 0.6640625, + "learning_rate": 3.816666666666667e-06, + "loss": 0.7983614444732666, + "mean_token_accuracy": 0.7581239463761449, + "num_tokens": 1017995.0, + "step": 230 + }, + { + "entropy": 0.9609160049818456, + "epoch": 0.022630567767942388, + "grad_norm": 0.4140625, + "learning_rate": 3.983333333333334e-06, + "loss": 0.8104394912719727, + "mean_token_accuracy": 0.7391819234937429, + "num_tokens": 1067131.0, + "step": 240 + }, + { + "entropy": 0.7141571814659983, + "epoch": 0.023573508091606653, + "grad_norm": 0.47265625, + "learning_rate": 4.15e-06, + "loss": 0.5877416133880615, + "mean_token_accuracy": 0.794341066479683, + "num_tokens": 1115898.0, + "step": 250 + }, + { + "entropy": 0.8112523064017296, + "epoch": 0.024516448415270918, + "grad_norm": 0.328125, + "learning_rate": 4.316666666666667e-06, + "loss": 0.6444027900695801, + "mean_token_accuracy": 0.7691240157932043, + "num_tokens": 1167517.0, + "step": 260 + }, + { + "entropy": 0.7751363357529044, + "epoch": 0.025459388738935183, + "grad_norm": 0.55859375, + "learning_rate": 4.483333333333333e-06, + "loss": 0.757953405380249, + "mean_token_accuracy": 0.7687718976289034, + "num_tokens": 1210826.0, + "step": 270 + }, + { + "entropy": 0.82865877635777, + "epoch": 0.026402329062599452, + "grad_norm": 1.0, + "learning_rate": 4.65e-06, + "loss": 0.5851547241210937, + "mean_token_accuracy": 0.7553599935024977, + "num_tokens": 1262440.0, + "step": 280 + }, + { + "entropy": 0.8141519343480468, + "epoch": 0.027345269386263717, + "grad_norm": 0.3671875, + "learning_rate": 4.816666666666667e-06, + "loss": 0.5882571697235107, + "mean_token_accuracy": 0.7627896059304475, + "num_tokens": 1303017.0, + "step": 290 + }, + { + "entropy": 0.8711584686301649, + "epoch": 0.028288209709927983, + "grad_norm": 0.34375, + "learning_rate": 4.983333333333334e-06, + "loss": 0.764805269241333, + "mean_token_accuracy": 0.7534263415262104, + "num_tokens": 1350030.0, + "step": 300 + }, + { + "entropy": 0.837328751757741, + "epoch": 0.029231150033592248, + "grad_norm": 0.330078125, + "learning_rate": 4.999989379352344e-06, + "loss": 0.5841926574707031, + "mean_token_accuracy": 0.77335274964571, + "num_tokens": 1397632.0, + "step": 310 + }, + { + "entropy": 0.9319362798705697, + "epoch": 0.030174090357256517, + "grad_norm": 1.1171875, + "learning_rate": 4.99995266611827e-06, + "loss": 0.835329818725586, + "mean_token_accuracy": 0.747077708505094, + "num_tokens": 1437635.0, + "step": 320 + }, + { + "entropy": 0.8836544909514487, + "epoch": 0.031117030680920782, + "grad_norm": 0.396484375, + "learning_rate": 4.9998897295636865e-06, + "loss": 0.6881571292877198, + "mean_token_accuracy": 0.7660582908429205, + "num_tokens": 1490028.0, + "step": 330 + }, + { + "entropy": 0.9423393627628684, + "epoch": 0.03205997100458505, + "grad_norm": 0.470703125, + "learning_rate": 4.999800570348766e-06, + "loss": 0.8963788986206055, + "mean_token_accuracy": 0.7583182919770479, + "num_tokens": 1536533.0, + "step": 340 + }, + { + "entropy": 0.7955392638221384, + "epoch": 0.03300291132824931, + "grad_norm": 0.48046875, + "learning_rate": 4.9996851894087494e-06, + "loss": 0.6439263820648193, + "mean_token_accuracy": 0.7917482912540436, + "num_tokens": 1588387.0, + "step": 350 + }, + { + "entropy": 0.9244774136692285, + "epoch": 0.03394585165191358, + "grad_norm": 0.55859375, + "learning_rate": 4.999543587953926e-06, + "loss": 0.745479154586792, + "mean_token_accuracy": 0.7643994279205799, + "num_tokens": 1628362.0, + "step": 360 + }, + { + "entropy": 0.7448134837672115, + "epoch": 0.03488879197557784, + "grad_norm": 0.302734375, + "learning_rate": 4.999375767469629e-06, + "loss": 0.5240091800689697, + "mean_token_accuracy": 0.8123030034825206, + "num_tokens": 1674278.0, + "step": 370 + }, + { + "entropy": 0.8121415632776916, + "epoch": 0.03583173229924211, + "grad_norm": 0.34375, + "learning_rate": 4.999181729716214e-06, + "loss": 0.5245255470275879, + "mean_token_accuracy": 0.7992570735514164, + "num_tokens": 1718938.0, + "step": 380 + }, + { + "entropy": 0.7439056454226375, + "epoch": 0.03677467262290638, + "grad_norm": 0.498046875, + "learning_rate": 4.9989614767290475e-06, + "loss": 0.5786451816558837, + "mean_token_accuracy": 0.7991266250610352, + "num_tokens": 1761197.0, + "step": 390 + }, + { + "entropy": 0.8094423169270157, + "epoch": 0.037717612946570646, + "grad_norm": 0.5234375, + "learning_rate": 4.998715010818479e-06, + "loss": 0.7232402324676513, + "mean_token_accuracy": 0.7819511042907834, + "num_tokens": 1802910.0, + "step": 400 + }, + { + "entropy": 0.8084097126498818, + "epoch": 0.03866055327023491, + "grad_norm": 0.392578125, + "learning_rate": 4.998442334569818e-06, + "loss": 0.6168120384216309, + "mean_token_accuracy": 0.7858469415456056, + "num_tokens": 1847975.0, + "step": 410 + }, + { + "entropy": 0.8122809613589197, + "epoch": 0.039603493593899176, + "grad_norm": 0.423828125, + "learning_rate": 4.9981434508433106e-06, + "loss": 0.5653482913970947, + "mean_token_accuracy": 0.7861449956893921, + "num_tokens": 1898331.0, + "step": 420 + }, + { + "entropy": 0.8453013042919337, + "epoch": 0.04054643391756344, + "grad_norm": 0.53515625, + "learning_rate": 4.9978183627741036e-06, + "loss": 0.6866735458374024, + "mean_token_accuracy": 0.769303709641099, + "num_tokens": 1943346.0, + "step": 430 + }, + { + "entropy": 0.7795825297012925, + "epoch": 0.04148937424122771, + "grad_norm": 0.396484375, + "learning_rate": 4.997467073772219e-06, + "loss": 0.5773806095123291, + "mean_token_accuracy": 0.790226286277175, + "num_tokens": 1986104.0, + "step": 440 + }, + { + "entropy": 0.7945893675088882, + "epoch": 0.04243231456489197, + "grad_norm": 0.5546875, + "learning_rate": 4.997089587522511e-06, + "loss": 0.6738276958465577, + "mean_token_accuracy": 0.7983880737796426, + "num_tokens": 2034829.0, + "step": 450 + }, + { + "entropy": 0.7780243606306613, + "epoch": 0.04337525488855624, + "grad_norm": 0.546875, + "learning_rate": 4.996685907984634e-06, + "loss": 0.6213938236236572, + "mean_token_accuracy": 0.778583624586463, + "num_tokens": 2080729.0, + "step": 460 + }, + { + "entropy": 0.8474339607171715, + "epoch": 0.04431819521222051, + "grad_norm": 0.45703125, + "learning_rate": 4.996256039392993e-06, + "loss": 0.7563930511474609, + "mean_token_accuracy": 0.7770253024995327, + "num_tokens": 2127423.0, + "step": 470 + }, + { + "entropy": 0.7664846159517765, + "epoch": 0.045261135535884775, + "grad_norm": 0.8515625, + "learning_rate": 4.9957999862567054e-06, + "loss": 0.6358477592468261, + "mean_token_accuracy": 0.7809185341000557, + "num_tokens": 2176434.0, + "step": 480 + }, + { + "entropy": 0.8652129575610161, + "epoch": 0.04620407585954904, + "grad_norm": 0.47265625, + "learning_rate": 4.995317753359555e-06, + "loss": 0.7163708209991455, + "mean_token_accuracy": 0.7767861977219581, + "num_tokens": 2227826.0, + "step": 490 + }, + { + "entropy": 0.749835775885731, + "epoch": 0.047147016183213306, + "grad_norm": 0.57421875, + "learning_rate": 4.994809345759936e-06, + "loss": 0.6652904033660889, + "mean_token_accuracy": 0.799538579583168, + "num_tokens": 2268858.0, + "step": 500 + }, + { + "entropy": 0.7915277570486069, + "epoch": 0.04808995650687757, + "grad_norm": 0.65625, + "learning_rate": 4.994274768790804e-06, + "loss": 0.7498304843902588, + "mean_token_accuracy": 0.7831572480499744, + "num_tokens": 2310420.0, + "step": 510 + }, + { + "entropy": 0.8275801884941757, + "epoch": 0.049032896830541836, + "grad_norm": 0.5390625, + "learning_rate": 4.993714028059617e-06, + "loss": 0.6858491420745849, + "mean_token_accuracy": 0.7689583929255605, + "num_tokens": 2351284.0, + "step": 520 + }, + { + "entropy": 0.8296442488208413, + "epoch": 0.0499758371542061, + "grad_norm": 0.7265625, + "learning_rate": 4.993127129448281e-06, + "loss": 0.783640718460083, + "mean_token_accuracy": 0.7797811217606068, + "num_tokens": 2399931.0, + "step": 530 + }, + { + "entropy": 0.7026577349752188, + "epoch": 0.05091877747787037, + "grad_norm": 0.341796875, + "learning_rate": 4.992514079113085e-06, + "loss": 0.5345718383789062, + "mean_token_accuracy": 0.8149769268929958, + "num_tokens": 2443358.0, + "step": 540 + }, + { + "entropy": 0.8745481946505607, + "epoch": 0.05186171780153463, + "grad_norm": 1.1171875, + "learning_rate": 4.991874883484636e-06, + "loss": 0.7263978004455567, + "mean_token_accuracy": 0.7751286920160055, + "num_tokens": 2485947.0, + "step": 550 + }, + { + "entropy": 0.7575348360463977, + "epoch": 0.052804658125198904, + "grad_norm": 0.380859375, + "learning_rate": 4.991209549267793e-06, + "loss": 0.6377761363983154, + "mean_token_accuracy": 0.8040944354608655, + "num_tokens": 2530402.0, + "step": 560 + }, + { + "entropy": 0.9096321894787252, + "epoch": 0.05374759844886317, + "grad_norm": 0.7109375, + "learning_rate": 4.9905180834416e-06, + "loss": 1.0087954521179199, + "mean_token_accuracy": 0.7766659688204527, + "num_tokens": 2571237.0, + "step": 570 + }, + { + "entropy": 0.8211571240797639, + "epoch": 0.054690538772527435, + "grad_norm": 0.34765625, + "learning_rate": 4.989800493259204e-06, + "loss": 0.6053966522216797, + "mean_token_accuracy": 0.783365786075592, + "num_tokens": 2619202.0, + "step": 580 + }, + { + "entropy": 0.8075054436922073, + "epoch": 0.0556334790961917, + "grad_norm": 0.439453125, + "learning_rate": 4.989056786247788e-06, + "loss": 0.7344274520874023, + "mean_token_accuracy": 0.7819651760160923, + "num_tokens": 2668876.0, + "step": 590 + }, + { + "entropy": 0.8033788122236729, + "epoch": 0.056576419419855965, + "grad_norm": 0.2314453125, + "learning_rate": 4.988286970208484e-06, + "loss": 0.5867619991302491, + "mean_token_accuracy": 0.7901865538209677, + "num_tokens": 2720273.0, + "step": 600 + }, + { + "entropy": 0.8459454836323858, + "epoch": 0.05751935974352023, + "grad_norm": 0.462890625, + "learning_rate": 4.9874910532163e-06, + "loss": 0.6807960987091064, + "mean_token_accuracy": 0.7898602165281773, + "num_tokens": 2767675.0, + "step": 610 + }, + { + "entropy": 0.7156997710466385, + "epoch": 0.058462300067184496, + "grad_norm": 0.76171875, + "learning_rate": 4.986669043620029e-06, + "loss": 0.6528503894805908, + "mean_token_accuracy": 0.8035624513402582, + "num_tokens": 2809140.0, + "step": 620 + }, + { + "entropy": 0.7602013352327048, + "epoch": 0.05940524039084876, + "grad_norm": 0.6328125, + "learning_rate": 4.985820950042161e-06, + "loss": 0.613498592376709, + "mean_token_accuracy": 0.797001127153635, + "num_tokens": 2849972.0, + "step": 630 + }, + { + "entropy": 0.819284772220999, + "epoch": 0.06034818071451303, + "grad_norm": 0.361328125, + "learning_rate": 4.984946781378797e-06, + "loss": 0.7385236740112304, + "mean_token_accuracy": 0.7713361542671919, + "num_tokens": 2892749.0, + "step": 640 + }, + { + "entropy": 0.694091964699328, + "epoch": 0.0612911210381773, + "grad_norm": 0.408203125, + "learning_rate": 4.9840465467995535e-06, + "loss": 0.6021022796630859, + "mean_token_accuracy": 0.8121187005192041, + "num_tokens": 2940704.0, + "step": 650 + }, + { + "entropy": 0.6857697816565633, + "epoch": 0.062234061361841564, + "grad_norm": 0.7109375, + "learning_rate": 4.983120255747464e-06, + "loss": 0.5373991966247559, + "mean_token_accuracy": 0.81699233725667, + "num_tokens": 2986358.0, + "step": 660 + }, + { + "entropy": 0.8100536063313484, + "epoch": 0.06317700168550583, + "grad_norm": 0.69140625, + "learning_rate": 4.982167917938885e-06, + "loss": 0.6947032451629639, + "mean_token_accuracy": 0.7735116362571717, + "num_tokens": 3019506.0, + "step": 670 + }, + { + "entropy": 0.8745680207386612, + "epoch": 0.0641199420091701, + "grad_norm": 0.392578125, + "learning_rate": 4.981189543363389e-06, + "loss": 0.6408730030059815, + "mean_token_accuracy": 0.7711815811693669, + "num_tokens": 3062042.0, + "step": 680 + }, + { + "entropy": 0.8105671038851142, + "epoch": 0.06506288233283436, + "grad_norm": 0.5546875, + "learning_rate": 4.98018514228366e-06, + "loss": 0.6767678260803223, + "mean_token_accuracy": 0.774928280338645, + "num_tokens": 3113758.0, + "step": 690 + }, + { + "entropy": 0.7323714484460652, + "epoch": 0.06600582265649863, + "grad_norm": 0.287109375, + "learning_rate": 4.979154725235392e-06, + "loss": 0.5733721733093262, + "mean_token_accuracy": 0.808050155825913, + "num_tokens": 3163234.0, + "step": 700 + }, + { + "entropy": 0.8353265615180134, + "epoch": 0.06694876298016289, + "grad_norm": 0.392578125, + "learning_rate": 4.978098303027173e-06, + "loss": 0.6160747528076171, + "mean_token_accuracy": 0.7780146349221468, + "num_tokens": 3207175.0, + "step": 710 + }, + { + "entropy": 0.7545118189416826, + "epoch": 0.06789170330382716, + "grad_norm": 0.275390625, + "learning_rate": 4.9770158867403705e-06, + "loss": 0.5270243644714355, + "mean_token_accuracy": 0.7902896221727133, + "num_tokens": 3253721.0, + "step": 720 + }, + { + "entropy": 0.7230144888162613, + "epoch": 0.06883464362749142, + "grad_norm": 0.6640625, + "learning_rate": 4.975907487729021e-06, + "loss": 0.6117719173431396, + "mean_token_accuracy": 0.8142276495695114, + "num_tokens": 3298677.0, + "step": 730 + }, + { + "entropy": 0.6818190900608897, + "epoch": 0.06977758395115569, + "grad_norm": 0.64453125, + "learning_rate": 4.974773117619703e-06, + "loss": 0.6048723220825195, + "mean_token_accuracy": 0.8080967217683792, + "num_tokens": 3341867.0, + "step": 740 + }, + { + "entropy": 0.7368672281503678, + "epoch": 0.07072052427481995, + "grad_norm": 0.54296875, + "learning_rate": 4.973612788311424e-06, + "loss": 0.6020387649536133, + "mean_token_accuracy": 0.7991985162720084, + "num_tokens": 3382805.0, + "step": 750 + }, + { + "entropy": 0.8011913444846869, + "epoch": 0.07166346459848422, + "grad_norm": 0.71875, + "learning_rate": 4.972426511975489e-06, + "loss": 0.741117525100708, + "mean_token_accuracy": 0.7860968332737684, + "num_tokens": 3425539.0, + "step": 760 + }, + { + "entropy": 0.7815477557480335, + "epoch": 0.0726064049221485, + "grad_norm": 0.6953125, + "learning_rate": 4.971214301055376e-06, + "loss": 0.6468725204467773, + "mean_token_accuracy": 0.7957555901259183, + "num_tokens": 3468481.0, + "step": 770 + }, + { + "entropy": 0.7002213094383478, + "epoch": 0.07354934524581276, + "grad_norm": 0.318359375, + "learning_rate": 4.9699761682666026e-06, + "loss": 0.4705470085144043, + "mean_token_accuracy": 0.7878050077706575, + "num_tokens": 3513800.0, + "step": 780 + }, + { + "entropy": 0.7421004495583474, + "epoch": 0.07449228556947703, + "grad_norm": 0.33203125, + "learning_rate": 4.968712126596598e-06, + "loss": 0.6162665843963623, + "mean_token_accuracy": 0.8012846134603023, + "num_tokens": 3554346.0, + "step": 790 + }, + { + "entropy": 0.7171782004646957, + "epoch": 0.07543522589314129, + "grad_norm": 0.330078125, + "learning_rate": 4.967422189304558e-06, + "loss": 0.5965607643127442, + "mean_token_accuracy": 0.7875219449400902, + "num_tokens": 3606796.0, + "step": 800 + }, + { + "entropy": 0.7832795661874116, + "epoch": 0.07637816621680556, + "grad_norm": 0.369140625, + "learning_rate": 4.966106369921317e-06, + "loss": 0.602449369430542, + "mean_token_accuracy": 0.7922013100236655, + "num_tokens": 3647649.0, + "step": 810 + }, + { + "entropy": 0.8182275678031147, + "epoch": 0.07732110654046982, + "grad_norm": 1.046875, + "learning_rate": 4.964764682249197e-06, + "loss": 0.7580663681030273, + "mean_token_accuracy": 0.7738244906067848, + "num_tokens": 3695788.0, + "step": 820 + }, + { + "entropy": 0.8186208296567201, + "epoch": 0.07826404686413409, + "grad_norm": 0.77734375, + "learning_rate": 4.963397140361868e-06, + "loss": 0.6980972766876221, + "mean_token_accuracy": 0.792484282515943, + "num_tokens": 3736836.0, + "step": 830 + }, + { + "entropy": 0.766120829153806, + "epoch": 0.07920698718779835, + "grad_norm": 0.44140625, + "learning_rate": 4.962003758604194e-06, + "loss": 0.7221168994903564, + "mean_token_accuracy": 0.796668940410018, + "num_tokens": 3778465.0, + "step": 840 + }, + { + "entropy": 0.8256865127943456, + "epoch": 0.08014992751146262, + "grad_norm": 0.47265625, + "learning_rate": 4.960584551592094e-06, + "loss": 0.6105232238769531, + "mean_token_accuracy": 0.7867782566696405, + "num_tokens": 3828031.0, + "step": 850 + }, + { + "entropy": 0.6507625746540725, + "epoch": 0.08109286783512688, + "grad_norm": 0.466796875, + "learning_rate": 4.959139534212375e-06, + "loss": 0.5035228252410888, + "mean_token_accuracy": 0.8218056863173843, + "num_tokens": 3880085.0, + "step": 860 + }, + { + "entropy": 0.7207641104236245, + "epoch": 0.08203580815879115, + "grad_norm": 0.5703125, + "learning_rate": 4.957668721622587e-06, + "loss": 0.5374783515930176, + "mean_token_accuracy": 0.8109163239598274, + "num_tokens": 3918528.0, + "step": 870 + }, + { + "entropy": 0.8274590659886598, + "epoch": 0.08297874848245541, + "grad_norm": 0.482421875, + "learning_rate": 4.956172129250858e-06, + "loss": 0.711448335647583, + "mean_token_accuracy": 0.785671678930521, + "num_tokens": 3961043.0, + "step": 880 + }, + { + "entropy": 0.7421449825167656, + "epoch": 0.08392168880611968, + "grad_norm": 0.47265625, + "learning_rate": 4.954649772795735e-06, + "loss": 0.6577060699462891, + "mean_token_accuracy": 0.7982315208762885, + "num_tokens": 4007062.0, + "step": 890 + }, + { + "entropy": 0.6785881833173335, + "epoch": 0.08486462912978394, + "grad_norm": 0.64453125, + "learning_rate": 4.953101668226014e-06, + "loss": 0.5841499328613281, + "mean_token_accuracy": 0.8102574732154608, + "num_tokens": 4062219.0, + "step": 900 + }, + { + "entropy": 0.732798031810671, + "epoch": 0.08580756945344821, + "grad_norm": 1.046875, + "learning_rate": 4.951527831780583e-06, + "loss": 0.6197251319885254, + "mean_token_accuracy": 0.796886844933033, + "num_tokens": 4111022.0, + "step": 910 + }, + { + "entropy": 0.80500507671386, + "epoch": 0.08675050977711248, + "grad_norm": 0.51953125, + "learning_rate": 4.949928279968238e-06, + "loss": 0.6231956005096435, + "mean_token_accuracy": 0.7846117116510868, + "num_tokens": 4151597.0, + "step": 920 + }, + { + "entropy": 0.7407358650118112, + "epoch": 0.08769345010077674, + "grad_norm": 0.357421875, + "learning_rate": 4.948303029567523e-06, + "loss": 0.5905776023864746, + "mean_token_accuracy": 0.7902860388159751, + "num_tokens": 4205660.0, + "step": 930 + }, + { + "entropy": 0.8730802398175002, + "epoch": 0.08863639042444102, + "grad_norm": 0.40234375, + "learning_rate": 4.946652097626544e-06, + "loss": 0.6360596656799317, + "mean_token_accuracy": 0.7667682899162174, + "num_tokens": 4252923.0, + "step": 940 + }, + { + "entropy": 0.7542075706645847, + "epoch": 0.08957933074810528, + "grad_norm": 0.28125, + "learning_rate": 4.944975501462797e-06, + "loss": 0.6091949462890625, + "mean_token_accuracy": 0.8042812138795853, + "num_tokens": 4305703.0, + "step": 950 + }, + { + "entropy": 0.6663548903539777, + "epoch": 0.09052227107176955, + "grad_norm": 0.5625, + "learning_rate": 4.943273258662982e-06, + "loss": 0.5946632385253906, + "mean_token_accuracy": 0.8140654802322388, + "num_tokens": 4351819.0, + "step": 960 + }, + { + "entropy": 0.8968982026912272, + "epoch": 0.09146521139543382, + "grad_norm": 0.7421875, + "learning_rate": 4.941545387082821e-06, + "loss": 0.7777196884155273, + "mean_token_accuracy": 0.7636161763221025, + "num_tokens": 4402994.0, + "step": 970 + }, + { + "entropy": 0.7275657393038273, + "epoch": 0.09240815171909808, + "grad_norm": 0.7734375, + "learning_rate": 4.939791904846869e-06, + "loss": 0.692138671875, + "mean_token_accuracy": 0.796290036663413, + "num_tokens": 4443896.0, + "step": 980 + }, + { + "entropy": 0.8022994266822934, + "epoch": 0.09335109204276235, + "grad_norm": 1.15625, + "learning_rate": 4.938012830348325e-06, + "loss": 0.7263329029083252, + "mean_token_accuracy": 0.7886364821344614, + "num_tokens": 4489361.0, + "step": 990 + }, + { + "entropy": 0.7677907293662429, + "epoch": 0.09429403236642661, + "grad_norm": 0.30078125, + "learning_rate": 4.936208182248838e-06, + "loss": 0.7098466396331787, + "mean_token_accuracy": 0.7836588025093079, + "num_tokens": 4538560.0, + "step": 1000 + }, + { + "entropy": 0.7540503291413188, + "epoch": 0.09523697269009088, + "grad_norm": 0.306640625, + "learning_rate": 4.934377979478312e-06, + "loss": 0.6721164226531983, + "mean_token_accuracy": 0.774369165673852, + "num_tokens": 4582185.0, + "step": 1010 + }, + { + "entropy": 0.7057674110867083, + "epoch": 0.09617991301375514, + "grad_norm": 0.5625, + "learning_rate": 4.932522241234711e-06, + "loss": 0.5665208339691162, + "mean_token_accuracy": 0.8124939866364003, + "num_tokens": 4624388.0, + "step": 1020 + }, + { + "entropy": 0.7860274084843695, + "epoch": 0.09712285333741941, + "grad_norm": 0.87109375, + "learning_rate": 4.9306409869838475e-06, + "loss": 0.627524471282959, + "mean_token_accuracy": 0.7900194443762303, + "num_tokens": 4664734.0, + "step": 1030 + }, + { + "entropy": 0.6265595956705511, + "epoch": 0.09806579366108367, + "grad_norm": 0.255859375, + "learning_rate": 4.928734236459191e-06, + "loss": 0.47365193367004393, + "mean_token_accuracy": 0.8303351975977421, + "num_tokens": 4718449.0, + "step": 1040 + }, + { + "entropy": 0.8842747121118009, + "epoch": 0.09900873398474794, + "grad_norm": 0.478515625, + "learning_rate": 4.926802009661651e-06, + "loss": 0.9802035331726074, + "mean_token_accuracy": 0.7524257987737656, + "num_tokens": 4763508.0, + "step": 1050 + }, + { + "entropy": 0.8015215817838908, + "epoch": 0.0999516743084122, + "grad_norm": 0.47265625, + "learning_rate": 4.9248443268593724e-06, + "loss": 0.683444595336914, + "mean_token_accuracy": 0.7799651555716991, + "num_tokens": 4808857.0, + "step": 1060 + }, + { + "entropy": 0.7447168783284723, + "epoch": 0.10089461463207647, + "grad_norm": 0.83984375, + "learning_rate": 4.922861208587522e-06, + "loss": 0.6439436435699463, + "mean_token_accuracy": 0.8069465953856707, + "num_tokens": 4849125.0, + "step": 1070 + }, + { + "entropy": 0.7262563842348755, + "epoch": 0.10183755495574073, + "grad_norm": 0.3359375, + "learning_rate": 4.920852675648071e-06, + "loss": 0.5818546772003174, + "mean_token_accuracy": 0.8100180253386497, + "num_tokens": 4895597.0, + "step": 1080 + }, + { + "entropy": 0.7206171770580113, + "epoch": 0.102780495279405, + "grad_norm": 0.5546875, + "learning_rate": 4.918818749109581e-06, + "loss": 0.6229705333709716, + "mean_token_accuracy": 0.8035074207931757, + "num_tokens": 4938109.0, + "step": 1090 + }, + { + "entropy": 0.8021614892408252, + "epoch": 0.10372343560306926, + "grad_norm": 0.5703125, + "learning_rate": 4.9167594503069785e-06, + "loss": 0.6964336395263672, + "mean_token_accuracy": 0.7762649796903134, + "num_tokens": 4981562.0, + "step": 1100 + }, + { + "entropy": 0.7161757604219019, + "epoch": 0.10466637592673354, + "grad_norm": 0.263671875, + "learning_rate": 4.914674800841332e-06, + "loss": 0.747713851928711, + "mean_token_accuracy": 0.8009138405323029, + "num_tokens": 5028887.0, + "step": 1110 + }, + { + "entropy": 0.7790245489217341, + "epoch": 0.10560931625039781, + "grad_norm": 0.5234375, + "learning_rate": 4.91256482257963e-06, + "loss": 0.6210433006286621, + "mean_token_accuracy": 0.7918234229087829, + "num_tokens": 5068901.0, + "step": 1120 + }, + { + "entropy": 0.7243750081397593, + "epoch": 0.10655225657406207, + "grad_norm": 0.455078125, + "learning_rate": 4.910429537654544e-06, + "loss": 0.6189009666442871, + "mean_token_accuracy": 0.7888242486864329, + "num_tokens": 5122274.0, + "step": 1130 + }, + { + "entropy": 0.7725613342598081, + "epoch": 0.10749519689772634, + "grad_norm": 0.57421875, + "learning_rate": 4.908268968464205e-06, + "loss": 0.6020617485046387, + "mean_token_accuracy": 0.7757980896160006, + "num_tokens": 5171661.0, + "step": 1140 + }, + { + "entropy": 0.7940086780115962, + "epoch": 0.1084381372213906, + "grad_norm": 0.73046875, + "learning_rate": 4.9060831376719585e-06, + "loss": 0.6493505001068115, + "mean_token_accuracy": 0.7813464991748333, + "num_tokens": 5218273.0, + "step": 1150 + }, + { + "entropy": 0.6979408304207027, + "epoch": 0.10938107754505487, + "grad_norm": 0.8671875, + "learning_rate": 4.903872068206138e-06, + "loss": 0.6040244102478027, + "mean_token_accuracy": 0.8104764647781849, + "num_tokens": 5259478.0, + "step": 1160 + }, + { + "entropy": 0.7056857038289308, + "epoch": 0.11032401786871913, + "grad_norm": 0.353515625, + "learning_rate": 4.9016357832598135e-06, + "loss": 0.5862742900848389, + "mean_token_accuracy": 0.8063552943989635, + "num_tokens": 5302993.0, + "step": 1170 + }, + { + "entropy": 0.7344408438540995, + "epoch": 0.1112669581923834, + "grad_norm": 0.279296875, + "learning_rate": 4.899374306290558e-06, + "loss": 0.7177176952362061, + "mean_token_accuracy": 0.805981208384037, + "num_tokens": 5351565.0, + "step": 1180 + }, + { + "entropy": 0.6840172544121742, + "epoch": 0.11220989851604767, + "grad_norm": 0.416015625, + "learning_rate": 4.897087661020194e-06, + "loss": 0.5912201881408692, + "mean_token_accuracy": 0.8121493086218834, + "num_tokens": 5391537.0, + "step": 1190 + }, + { + "entropy": 0.7785421489737928, + "epoch": 0.11315283883971193, + "grad_norm": 0.359375, + "learning_rate": 4.894775871434548e-06, + "loss": 0.6811850547790528, + "mean_token_accuracy": 0.7836464313790202, + "num_tokens": 5428823.0, + "step": 1200 + }, + { + "entropy": 0.6350860029459, + "epoch": 0.1140957791633762, + "grad_norm": 0.275390625, + "learning_rate": 4.892438961783199e-06, + "loss": 0.49747395515441895, + "mean_token_accuracy": 0.8172833763062954, + "num_tokens": 5474692.0, + "step": 1210 + }, + { + "entropy": 0.7340997345745564, + "epoch": 0.11503871948704046, + "grad_norm": 0.330078125, + "learning_rate": 4.890076956579223e-06, + "loss": 0.5803222179412841, + "mean_token_accuracy": 0.811799717694521, + "num_tokens": 5522965.0, + "step": 1220 + }, + { + "entropy": 0.6614907255396247, + "epoch": 0.11598165981070473, + "grad_norm": 0.51953125, + "learning_rate": 4.887689880598938e-06, + "loss": 0.5860563755035401, + "mean_token_accuracy": 0.8119680780917407, + "num_tokens": 5572615.0, + "step": 1230 + }, + { + "entropy": 0.8880835673771799, + "epoch": 0.11692460013436899, + "grad_norm": 0.54296875, + "learning_rate": 4.885277758881641e-06, + "loss": 0.7023919105529786, + "mean_token_accuracy": 0.7654352005571127, + "num_tokens": 5615891.0, + "step": 1240 + }, + { + "entropy": 0.7018857408314944, + "epoch": 0.11786754045803326, + "grad_norm": 0.6640625, + "learning_rate": 4.882840616729347e-06, + "loss": 0.615167760848999, + "mean_token_accuracy": 0.7958494182676077, + "num_tokens": 5666242.0, + "step": 1250 + }, + { + "entropy": 0.8410587665624917, + "epoch": 0.11881048078169752, + "grad_norm": 0.330078125, + "learning_rate": 4.880378479706525e-06, + "loss": 0.6831368446350098, + "mean_token_accuracy": 0.7757596135139465, + "num_tokens": 5714622.0, + "step": 1260 + }, + { + "entropy": 0.7477244296111166, + "epoch": 0.11975342110536179, + "grad_norm": 0.515625, + "learning_rate": 4.877891373639824e-06, + "loss": 0.5684638977050781, + "mean_token_accuracy": 0.8081520074978471, + "num_tokens": 5762489.0, + "step": 1270 + }, + { + "entropy": 0.8104454580694437, + "epoch": 0.12069636142902607, + "grad_norm": 0.51953125, + "learning_rate": 4.875379324617815e-06, + "loss": 0.5815711975097656, + "mean_token_accuracy": 0.781415050663054, + "num_tokens": 5799123.0, + "step": 1280 + }, + { + "entropy": 0.6935905188322067, + "epoch": 0.12163930175269033, + "grad_norm": 0.435546875, + "learning_rate": 4.872842358990701e-06, + "loss": 0.6138697147369385, + "mean_token_accuracy": 0.797416203096509, + "num_tokens": 5849061.0, + "step": 1290 + }, + { + "entropy": 0.7854719746857881, + "epoch": 0.1225822420763546, + "grad_norm": 0.349609375, + "learning_rate": 4.87028050337005e-06, + "loss": 0.5638726711273193, + "mean_token_accuracy": 0.7877143463119864, + "num_tokens": 5890604.0, + "step": 1300 + }, + { + "entropy": 0.8234432382509113, + "epoch": 0.12352518240001886, + "grad_norm": 0.3984375, + "learning_rate": 4.867693784628516e-06, + "loss": 0.6471819877624512, + "mean_token_accuracy": 0.7767364744096994, + "num_tokens": 5932967.0, + "step": 1310 + }, + { + "entropy": 0.7679943142458796, + "epoch": 0.12446812272368313, + "grad_norm": 0.50390625, + "learning_rate": 4.865082229899554e-06, + "loss": 0.6443884372711182, + "mean_token_accuracy": 0.7849613726139069, + "num_tokens": 5973382.0, + "step": 1320 + }, + { + "entropy": 0.6430552182719111, + "epoch": 0.1254110630473474, + "grad_norm": 0.63671875, + "learning_rate": 4.862445866577138e-06, + "loss": 0.58107008934021, + "mean_token_accuracy": 0.8114496625959873, + "num_tokens": 6021337.0, + "step": 1330 + }, + { + "entropy": 0.7372513002716005, + "epoch": 0.12635400337101166, + "grad_norm": 0.447265625, + "learning_rate": 4.859784722315472e-06, + "loss": 0.6992315769195556, + "mean_token_accuracy": 0.7826294297352433, + "num_tokens": 6077344.0, + "step": 1340 + }, + { + "entropy": 0.8189116214867681, + "epoch": 0.12729694369467592, + "grad_norm": 0.53515625, + "learning_rate": 4.857098825028701e-06, + "loss": 0.7671550750732422, + "mean_token_accuracy": 0.7946853101253509, + "num_tokens": 6119359.0, + "step": 1350 + }, + { + "entropy": 0.7827853210270405, + "epoch": 0.1282398840183402, + "grad_norm": 0.376953125, + "learning_rate": 4.854388202890614e-06, + "loss": 0.7045656681060791, + "mean_token_accuracy": 0.7913773000240326, + "num_tokens": 6160311.0, + "step": 1360 + }, + { + "entropy": 0.7482062807306648, + "epoch": 0.12918282434200445, + "grad_norm": 0.3984375, + "learning_rate": 4.851652884334356e-06, + "loss": 0.7099195957183838, + "mean_token_accuracy": 0.7907620433717966, + "num_tokens": 6201115.0, + "step": 1370 + }, + { + "entropy": 0.73036635722965, + "epoch": 0.13012576466566872, + "grad_norm": 0.265625, + "learning_rate": 4.848892898052125e-06, + "loss": 0.5717474937438964, + "mean_token_accuracy": 0.8052898969501256, + "num_tokens": 6248167.0, + "step": 1380 + }, + { + "entropy": 0.6847926998510957, + "epoch": 0.13106870498933298, + "grad_norm": 0.5859375, + "learning_rate": 4.84610827299487e-06, + "loss": 0.6278266906738281, + "mean_token_accuracy": 0.8036519877612591, + "num_tokens": 6290393.0, + "step": 1390 + }, + { + "entropy": 0.6735235895961523, + "epoch": 0.13201164531299725, + "grad_norm": 0.33203125, + "learning_rate": 4.843299038371991e-06, + "loss": 0.6215836048126221, + "mean_token_accuracy": 0.8117277476936579, + "num_tokens": 6342860.0, + "step": 1400 + }, + { + "entropy": 0.7760428190231323, + "epoch": 0.13295458563666152, + "grad_norm": 0.60546875, + "learning_rate": 4.840465223651029e-06, + "loss": 0.5304702281951904, + "mean_token_accuracy": 0.7894374314695597, + "num_tokens": 6389987.0, + "step": 1410 + }, + { + "entropy": 0.751918163895607, + "epoch": 0.13389752596032578, + "grad_norm": 0.52734375, + "learning_rate": 4.83760685855736e-06, + "loss": 0.6945547580718994, + "mean_token_accuracy": 0.8058279521763325, + "num_tokens": 6435158.0, + "step": 1420 + }, + { + "entropy": 0.6316566719673574, + "epoch": 0.13484046628399005, + "grad_norm": 0.8515625, + "learning_rate": 4.834723973073882e-06, + "loss": 0.5147292613983154, + "mean_token_accuracy": 0.8109463810920715, + "num_tokens": 6483159.0, + "step": 1430 + }, + { + "entropy": 0.8705680920742452, + "epoch": 0.1357834066076543, + "grad_norm": 0.68359375, + "learning_rate": 4.831816597440697e-06, + "loss": 0.7946212291717529, + "mean_token_accuracy": 0.7745383739471435, + "num_tokens": 6531589.0, + "step": 1440 + }, + { + "entropy": 0.6937490504235029, + "epoch": 0.13672634693131858, + "grad_norm": 0.41796875, + "learning_rate": 4.828884762154803e-06, + "loss": 0.5019688606262207, + "mean_token_accuracy": 0.8086294280365109, + "num_tokens": 6582550.0, + "step": 1450 + }, + { + "entropy": 0.6883674585260451, + "epoch": 0.13766928725498284, + "grad_norm": 0.318359375, + "learning_rate": 4.825928497969763e-06, + "loss": 0.5822939395904541, + "mean_token_accuracy": 0.8153205912560224, + "num_tokens": 6623531.0, + "step": 1460 + }, + { + "entropy": 0.7426637164317071, + "epoch": 0.1386122275786471, + "grad_norm": 0.48046875, + "learning_rate": 4.822947835895389e-06, + "loss": 0.6456994533538818, + "mean_token_accuracy": 0.7916014738380909, + "num_tokens": 6670087.0, + "step": 1470 + }, + { + "entropy": 0.7368132835254073, + "epoch": 0.13955516790231137, + "grad_norm": 0.34375, + "learning_rate": 4.819942807197417e-06, + "loss": 0.6506009578704834, + "mean_token_accuracy": 0.8058517042547464, + "num_tokens": 6719389.0, + "step": 1480 + }, + { + "entropy": 0.8392926104366779, + "epoch": 0.14049810822597564, + "grad_norm": 0.5234375, + "learning_rate": 4.816913443397176e-06, + "loss": 0.6899060726165771, + "mean_token_accuracy": 0.7871105581521988, + "num_tokens": 6761161.0, + "step": 1490 + }, + { + "entropy": 0.7088076891377568, + "epoch": 0.1414410485496399, + "grad_norm": 0.330078125, + "learning_rate": 4.813859776271258e-06, + "loss": 0.510068130493164, + "mean_token_accuracy": 0.8044612921774388, + "num_tokens": 6805745.0, + "step": 1500 + }, + { + "entropy": 0.6664590669795871, + "epoch": 0.14238398887330417, + "grad_norm": 0.3515625, + "learning_rate": 4.810781837851186e-06, + "loss": 0.5675896644592285, + "mean_token_accuracy": 0.80593893378973, + "num_tokens": 6850831.0, + "step": 1510 + }, + { + "entropy": 0.7449090665206313, + "epoch": 0.14332692919696843, + "grad_norm": 0.6796875, + "learning_rate": 4.807679660423078e-06, + "loss": 0.7466594696044921, + "mean_token_accuracy": 0.7963773109018802, + "num_tokens": 6893372.0, + "step": 1520 + }, + { + "entropy": 0.6773676542565227, + "epoch": 0.14426986952063273, + "grad_norm": 0.267578125, + "learning_rate": 4.8045532765273085e-06, + "loss": 0.5410051822662354, + "mean_token_accuracy": 0.8197047363966703, + "num_tokens": 6942690.0, + "step": 1530 + }, + { + "entropy": 0.8294754406437278, + "epoch": 0.145212809844297, + "grad_norm": 0.474609375, + "learning_rate": 4.801402718958162e-06, + "loss": 0.5964238166809082, + "mean_token_accuracy": 0.7812088407576084, + "num_tokens": 6995335.0, + "step": 1540 + }, + { + "entropy": 0.8663926181383431, + "epoch": 0.14615575016796126, + "grad_norm": 0.369140625, + "learning_rate": 4.798228020763501e-06, + "loss": 0.5792275905609131, + "mean_token_accuracy": 0.7707085549831391, + "num_tokens": 7048539.0, + "step": 1550 + }, + { + "entropy": 0.7147080856608227, + "epoch": 0.14709869049162552, + "grad_norm": 0.36328125, + "learning_rate": 4.795029215244403e-06, + "loss": 0.5165563583374023, + "mean_token_accuracy": 0.7946837220340968, + "num_tokens": 7094588.0, + "step": 1560 + }, + { + "entropy": 0.8003142789937556, + "epoch": 0.1480416308152898, + "grad_norm": 0.3203125, + "learning_rate": 4.7918063359548274e-06, + "loss": 0.5031931877136231, + "mean_token_accuracy": 0.7990253180265426, + "num_tokens": 7138857.0, + "step": 1570 + }, + { + "entropy": 0.7444701816886663, + "epoch": 0.14898457113895405, + "grad_norm": 0.490234375, + "learning_rate": 4.788559416701251e-06, + "loss": 0.62364182472229, + "mean_token_accuracy": 0.800935186818242, + "num_tokens": 7181093.0, + "step": 1580 + }, + { + "entropy": 0.768458298034966, + "epoch": 0.14992751146261832, + "grad_norm": 0.5234375, + "learning_rate": 4.785288491542322e-06, + "loss": 0.6315382480621338, + "mean_token_accuracy": 0.7936431773006916, + "num_tokens": 7225622.0, + "step": 1590 + }, + { + "entropy": 0.6673228033818305, + "epoch": 0.15087045178628258, + "grad_norm": 0.421875, + "learning_rate": 4.781993594788496e-06, + "loss": 0.5698256015777587, + "mean_token_accuracy": 0.8094664443284273, + "num_tokens": 7272191.0, + "step": 1600 + }, + { + "entropy": 0.6132199401967228, + "epoch": 0.15181339210994685, + "grad_norm": 0.451171875, + "learning_rate": 4.778674761001681e-06, + "loss": 0.637981653213501, + "mean_token_accuracy": 0.8249839577823878, + "num_tokens": 7320397.0, + "step": 1610 + }, + { + "entropy": 0.6754366432316601, + "epoch": 0.15275633243361111, + "grad_norm": 0.203125, + "learning_rate": 4.775332024994874e-06, + "loss": 0.4907213687896729, + "mean_token_accuracy": 0.8176268842071295, + "num_tokens": 7369385.0, + "step": 1620 + }, + { + "entropy": 0.6628142113331705, + "epoch": 0.15369927275727538, + "grad_norm": 0.4375, + "learning_rate": 4.771965421831792e-06, + "loss": 0.5297084331512452, + "mean_token_accuracy": 0.8210704285651446, + "num_tokens": 7418922.0, + "step": 1630 + }, + { + "entropy": 0.743092224188149, + "epoch": 0.15464221308093964, + "grad_norm": 0.294921875, + "learning_rate": 4.768574986826513e-06, + "loss": 0.7004957675933838, + "mean_token_accuracy": 0.8017095427960157, + "num_tokens": 7470971.0, + "step": 1640 + }, + { + "entropy": 0.839415866136551, + "epoch": 0.1555851534046039, + "grad_norm": 0.470703125, + "learning_rate": 4.765160755543091e-06, + "loss": 0.8255781173706055, + "mean_token_accuracy": 0.7637870293110609, + "num_tokens": 7515243.0, + "step": 1650 + }, + { + "entropy": 0.6935912227258086, + "epoch": 0.15652809372826818, + "grad_norm": 0.2578125, + "learning_rate": 4.7617227637952e-06, + "loss": 0.5783330917358398, + "mean_token_accuracy": 0.8085279129445553, + "num_tokens": 7564417.0, + "step": 1660 + }, + { + "entropy": 0.7936397315002978, + "epoch": 0.15747103405193244, + "grad_norm": 0.75, + "learning_rate": 4.758261047645745e-06, + "loss": 0.6287306785583496, + "mean_token_accuracy": 0.7835016187280417, + "num_tokens": 7612569.0, + "step": 1670 + }, + { + "entropy": 0.6750403906218707, + "epoch": 0.1584139743755967, + "grad_norm": 0.271484375, + "learning_rate": 4.7547756434064916e-06, + "loss": 0.5946949005126954, + "mean_token_accuracy": 0.8034364454448223, + "num_tokens": 7657765.0, + "step": 1680 + }, + { + "entropy": 0.7698115283623338, + "epoch": 0.15935691469926097, + "grad_norm": 0.875, + "learning_rate": 4.751266587637681e-06, + "loss": 0.679727029800415, + "mean_token_accuracy": 0.7859929338097572, + "num_tokens": 7692933.0, + "step": 1690 + }, + { + "entropy": 0.731985289696604, + "epoch": 0.16029985502292524, + "grad_norm": 0.51171875, + "learning_rate": 4.747733917147646e-06, + "loss": 0.6183731079101562, + "mean_token_accuracy": 0.8142067354172469, + "num_tokens": 7737759.0, + "step": 1700 + }, + { + "entropy": 0.7078736932948232, + "epoch": 0.1612427953465895, + "grad_norm": 0.28125, + "learning_rate": 4.744177668992429e-06, + "loss": 0.49601898193359373, + "mean_token_accuracy": 0.8192032791674138, + "num_tokens": 7782624.0, + "step": 1710 + }, + { + "entropy": 0.7805814618710428, + "epoch": 0.16218573567025377, + "grad_norm": 0.357421875, + "learning_rate": 4.740597880475391e-06, + "loss": 0.6345070838928223, + "mean_token_accuracy": 0.818518004193902, + "num_tokens": 7830123.0, + "step": 1720 + }, + { + "entropy": 0.7078598484396934, + "epoch": 0.16312867599391803, + "grad_norm": 0.259765625, + "learning_rate": 4.736994589146821e-06, + "loss": 0.6488445281982422, + "mean_token_accuracy": 0.8083903908729553, + "num_tokens": 7878591.0, + "step": 1730 + }, + { + "entropy": 0.6218862963840366, + "epoch": 0.1640716163175823, + "grad_norm": 0.55859375, + "learning_rate": 4.7333678328035374e-06, + "loss": 0.5586625576019287, + "mean_token_accuracy": 0.8203994080424308, + "num_tokens": 7928797.0, + "step": 1740 + }, + { + "entropy": 0.6412875755690038, + "epoch": 0.16501455664124656, + "grad_norm": 0.357421875, + "learning_rate": 4.729717649488499e-06, + "loss": 0.6166950225830078, + "mean_token_accuracy": 0.8231342125684022, + "num_tokens": 7972979.0, + "step": 1750 + }, + { + "entropy": 0.7250258160755039, + "epoch": 0.16595749696491083, + "grad_norm": 0.423828125, + "learning_rate": 4.7260440774904014e-06, + "loss": 0.5841271877288818, + "mean_token_accuracy": 0.8074738964438438, + "num_tokens": 8015392.0, + "step": 1760 + }, + { + "entropy": 0.6732541414909065, + "epoch": 0.1669004372885751, + "grad_norm": 0.58203125, + "learning_rate": 4.722347155343277e-06, + "loss": 0.6065329551696778, + "mean_token_accuracy": 0.8136304952204227, + "num_tokens": 8061805.0, + "step": 1770 + }, + { + "entropy": 0.8656071895733476, + "epoch": 0.16784337761223936, + "grad_norm": 0.337890625, + "learning_rate": 4.71862692182609e-06, + "loss": 0.8307145118713379, + "mean_token_accuracy": 0.7705816131085157, + "num_tokens": 8104858.0, + "step": 1780 + }, + { + "entropy": 0.7067621927708387, + "epoch": 0.16878631793590362, + "grad_norm": 0.419921875, + "learning_rate": 4.714883415962329e-06, + "loss": 0.6449962615966797, + "mean_token_accuracy": 0.8116483464837074, + "num_tokens": 8153858.0, + "step": 1790 + }, + { + "entropy": 0.628216756042093, + "epoch": 0.1697292582595679, + "grad_norm": 0.34375, + "learning_rate": 4.711116677019599e-06, + "loss": 0.4528506755828857, + "mean_token_accuracy": 0.8308906458318234, + "num_tokens": 8202695.0, + "step": 1800 + }, + { + "entropy": 0.5620249833911657, + "epoch": 0.17067219858323215, + "grad_norm": 0.27734375, + "learning_rate": 4.707326744509209e-06, + "loss": 0.6362682342529297, + "mean_token_accuracy": 0.8432179998606444, + "num_tokens": 8250847.0, + "step": 1810 + }, + { + "entropy": 0.711518302373588, + "epoch": 0.17161513890689642, + "grad_norm": 0.3203125, + "learning_rate": 4.7035136581857596e-06, + "loss": 0.6081731796264649, + "mean_token_accuracy": 0.8159873858094215, + "num_tokens": 8299509.0, + "step": 1820 + }, + { + "entropy": 0.833217189554125, + "epoch": 0.17255807923056068, + "grad_norm": 0.84375, + "learning_rate": 4.69967745804672e-06, + "loss": 0.928659725189209, + "mean_token_accuracy": 0.7771374503150582, + "num_tokens": 8335978.0, + "step": 1830 + }, + { + "entropy": 0.8410642127972097, + "epoch": 0.17350101955422495, + "grad_norm": 0.6171875, + "learning_rate": 4.695818184332015e-06, + "loss": 0.727938175201416, + "mean_token_accuracy": 0.7709955636411905, + "num_tokens": 8383600.0, + "step": 1840 + }, + { + "entropy": 0.6231134903617204, + "epoch": 0.17444395987788922, + "grad_norm": 0.5, + "learning_rate": 4.691935877523599e-06, + "loss": 0.5813844203948975, + "mean_token_accuracy": 0.8313001070171595, + "num_tokens": 8432448.0, + "step": 1850 + }, + { + "entropy": 0.765664404258132, + "epoch": 0.17538690020155348, + "grad_norm": 0.431640625, + "learning_rate": 4.688030578345034e-06, + "loss": 0.6016036033630371, + "mean_token_accuracy": 0.7821066498756408, + "num_tokens": 8471681.0, + "step": 1860 + }, + { + "entropy": 0.6680231470614671, + "epoch": 0.17632984052521777, + "grad_norm": 0.310546875, + "learning_rate": 4.684102327761061e-06, + "loss": 0.5228953838348389, + "mean_token_accuracy": 0.8138258129358291, + "num_tokens": 8520363.0, + "step": 1870 + }, + { + "entropy": 0.6410453176125884, + "epoch": 0.17727278084888204, + "grad_norm": 0.275390625, + "learning_rate": 4.680151166977168e-06, + "loss": 0.48765125274658205, + "mean_token_accuracy": 0.8131914135068655, + "num_tokens": 8576421.0, + "step": 1880 + }, + { + "entropy": 0.7159248681738972, + "epoch": 0.1782157211725463, + "grad_norm": 0.75390625, + "learning_rate": 4.676177137439164e-06, + "loss": 0.6111386299133301, + "mean_token_accuracy": 0.8026338141411543, + "num_tokens": 8617811.0, + "step": 1890 + }, + { + "entropy": 0.6831275760196149, + "epoch": 0.17915866149621057, + "grad_norm": 0.431640625, + "learning_rate": 4.672180280832738e-06, + "loss": 0.6701952457427979, + "mean_token_accuracy": 0.8077144119888544, + "num_tokens": 8660752.0, + "step": 1900 + }, + { + "entropy": 0.7076569891534745, + "epoch": 0.18010160181987483, + "grad_norm": 0.46484375, + "learning_rate": 4.668160639083023e-06, + "loss": 0.558572244644165, + "mean_token_accuracy": 0.7995935019105673, + "num_tokens": 8704690.0, + "step": 1910 + }, + { + "entropy": 0.7884954256005585, + "epoch": 0.1810445421435391, + "grad_norm": 0.5625, + "learning_rate": 4.664118254354161e-06, + "loss": 0.8152592658996582, + "mean_token_accuracy": 0.7849799519404769, + "num_tokens": 8745623.0, + "step": 1920 + }, + { + "entropy": 0.6273317654151469, + "epoch": 0.18198748246720337, + "grad_norm": 0.439453125, + "learning_rate": 4.660053169048854e-06, + "loss": 0.6315245628356934, + "mean_token_accuracy": 0.8183496780693531, + "num_tokens": 8785116.0, + "step": 1930 + }, + { + "entropy": 0.7881477686576546, + "epoch": 0.18293042279086763, + "grad_norm": 0.8515625, + "learning_rate": 4.655965425807922e-06, + "loss": 0.5719914436340332, + "mean_token_accuracy": 0.8004025777801871, + "num_tokens": 8829949.0, + "step": 1940 + }, + { + "entropy": 0.6546398317441344, + "epoch": 0.1838733631145319, + "grad_norm": 0.71875, + "learning_rate": 4.65185506750986e-06, + "loss": 0.6368934154510498, + "mean_token_accuracy": 0.8093210918828845, + "num_tokens": 8886640.0, + "step": 1950 + }, + { + "entropy": 0.7569531903602182, + "epoch": 0.18481630343819616, + "grad_norm": 0.333984375, + "learning_rate": 4.6477221372703786e-06, + "loss": 0.6742706298828125, + "mean_token_accuracy": 0.779875087365508, + "num_tokens": 8940559.0, + "step": 1960 + }, + { + "entropy": 0.7066563277505338, + "epoch": 0.18575924376186043, + "grad_norm": 0.87109375, + "learning_rate": 4.643566678441963e-06, + "loss": 0.4545194149017334, + "mean_token_accuracy": 0.816070344671607, + "num_tokens": 8982660.0, + "step": 1970 + }, + { + "entropy": 0.7758723221253604, + "epoch": 0.1867021840855247, + "grad_norm": 0.77734375, + "learning_rate": 4.639388734613408e-06, + "loss": 0.6822866439819336, + "mean_token_accuracy": 0.7878825765103101, + "num_tokens": 9022533.0, + "step": 1980 + }, + { + "entropy": 0.6788542723283172, + "epoch": 0.18764512440918896, + "grad_norm": 0.62890625, + "learning_rate": 4.635188349609368e-06, + "loss": 0.6392297744750977, + "mean_token_accuracy": 0.7984015457332134, + "num_tokens": 9076424.0, + "step": 1990 + }, + { + "entropy": 0.7143436720129103, + "epoch": 0.18858806473285322, + "grad_norm": 0.376953125, + "learning_rate": 4.630965567489895e-06, + "loss": 0.6579510688781738, + "mean_token_accuracy": 0.8013661563396454, + "num_tokens": 9121745.0, + "step": 2000 + }, + { + "entropy": 0.6926486367359758, + "epoch": 0.1895310050565175, + "grad_norm": 0.8984375, + "learning_rate": 4.626720432549975e-06, + "loss": 0.8323287010192871, + "mean_token_accuracy": 0.8196912448853254, + "num_tokens": 9161355.0, + "step": 2010 + }, + { + "entropy": 0.7443779086694121, + "epoch": 0.19047394538018175, + "grad_norm": 0.60546875, + "learning_rate": 4.622452989319064e-06, + "loss": 0.6473805427551269, + "mean_token_accuracy": 0.7991336258128285, + "num_tokens": 9198309.0, + "step": 2020 + }, + { + "entropy": 0.666377074457705, + "epoch": 0.19141688570384602, + "grad_norm": 0.71875, + "learning_rate": 4.618163282560621e-06, + "loss": 0.5878519535064697, + "mean_token_accuracy": 0.8124156523495912, + "num_tokens": 9242770.0, + "step": 2030 + }, + { + "entropy": 0.726883088517934, + "epoch": 0.19235982602751028, + "grad_norm": 0.376953125, + "learning_rate": 4.613851357271644e-06, + "loss": 0.6642287731170654, + "mean_token_accuracy": 0.8055625781416893, + "num_tokens": 9289160.0, + "step": 2040 + }, + { + "entropy": 0.6223044098354876, + "epoch": 0.19330276635117455, + "grad_norm": 0.28515625, + "learning_rate": 4.6095172586821845e-06, + "loss": 0.5843603134155273, + "mean_token_accuracy": 0.8251405648887158, + "num_tokens": 9336075.0, + "step": 2050 + }, + { + "entropy": 0.5912350189872086, + "epoch": 0.19424570667483881, + "grad_norm": 0.427734375, + "learning_rate": 4.605161032254889e-06, + "loss": 0.49378104209899903, + "mean_token_accuracy": 0.8227537497878075, + "num_tokens": 9380863.0, + "step": 2060 + }, + { + "entropy": 0.8942209580913186, + "epoch": 0.19518864699850308, + "grad_norm": 0.72265625, + "learning_rate": 4.6007827236845095e-06, + "loss": 0.7838969230651855, + "mean_token_accuracy": 0.7667118087410927, + "num_tokens": 9426134.0, + "step": 2070 + }, + { + "entropy": 0.7779933417215943, + "epoch": 0.19613158732216734, + "grad_norm": 0.380859375, + "learning_rate": 4.596382378897431e-06, + "loss": 0.6452385902404785, + "mean_token_accuracy": 0.8011699549853801, + "num_tokens": 9468075.0, + "step": 2080 + }, + { + "entropy": 0.6786517933011055, + "epoch": 0.1970745276458316, + "grad_norm": 0.7578125, + "learning_rate": 4.59196004405119e-06, + "loss": 0.46638927459716795, + "mean_token_accuracy": 0.7987587995827198, + "num_tokens": 9510000.0, + "step": 2090 + }, + { + "entropy": 0.6716505272313953, + "epoch": 0.19801746796949588, + "grad_norm": 0.57421875, + "learning_rate": 4.587515765533985e-06, + "loss": 0.5990314960479737, + "mean_token_accuracy": 0.8237005785107613, + "num_tokens": 9553054.0, + "step": 2100 + }, + { + "entropy": 0.6282524673268199, + "epoch": 0.19896040829316014, + "grad_norm": 0.3828125, + "learning_rate": 4.583049589964196e-06, + "loss": 0.6849035263061524, + "mean_token_accuracy": 0.8318673394620418, + "num_tokens": 9599290.0, + "step": 2110 + }, + { + "entropy": 0.7072675415314734, + "epoch": 0.1999033486168244, + "grad_norm": 0.298828125, + "learning_rate": 4.578561564189889e-06, + "loss": 0.5846244335174561, + "mean_token_accuracy": 0.8056545812636614, + "num_tokens": 9644669.0, + "step": 2120 + }, + { + "entropy": 0.6512570422142744, + "epoch": 0.20084628894048867, + "grad_norm": 0.369140625, + "learning_rate": 4.574051735288333e-06, + "loss": 0.624661922454834, + "mean_token_accuracy": 0.8112033154815436, + "num_tokens": 9685527.0, + "step": 2130 + }, + { + "entropy": 0.7499742574989796, + "epoch": 0.20178922926415294, + "grad_norm": 0.61328125, + "learning_rate": 4.5695201505654975e-06, + "loss": 0.7735828876495361, + "mean_token_accuracy": 0.7932566996663809, + "num_tokens": 9736026.0, + "step": 2140 + }, + { + "entropy": 0.7998500057496131, + "epoch": 0.2027321695878172, + "grad_norm": 0.375, + "learning_rate": 4.564966857555563e-06, + "loss": 0.6731950759887695, + "mean_token_accuracy": 0.781569967418909, + "num_tokens": 9780068.0, + "step": 2150 + }, + { + "entropy": 0.7340394101105631, + "epoch": 0.20367510991148147, + "grad_norm": 0.37109375, + "learning_rate": 4.5603919040204184e-06, + "loss": 0.5938757419586181, + "mean_token_accuracy": 0.8104211119934916, + "num_tokens": 9833844.0, + "step": 2160 + }, + { + "entropy": 0.6916491713374853, + "epoch": 0.20461805023514573, + "grad_norm": 0.70703125, + "learning_rate": 4.5557953379491605e-06, + "loss": 0.6073223114013672, + "mean_token_accuracy": 0.8175125665962696, + "num_tokens": 9876964.0, + "step": 2170 + }, + { + "entropy": 0.7052072752267122, + "epoch": 0.20556099055881, + "grad_norm": 0.609375, + "learning_rate": 4.551177207557593e-06, + "loss": 0.5360385417938233, + "mean_token_accuracy": 0.8053067337721587, + "num_tokens": 9917699.0, + "step": 2180 + }, + { + "entropy": 0.7037679905071854, + "epoch": 0.20650393088247426, + "grad_norm": 0.423828125, + "learning_rate": 4.546537561287719e-06, + "loss": 0.629872179031372, + "mean_token_accuracy": 0.8012799389660359, + "num_tokens": 9964393.0, + "step": 2190 + }, + { + "entropy": 0.6786779332906008, + "epoch": 0.20744687120613853, + "grad_norm": 0.94921875, + "learning_rate": 4.541876447807233e-06, + "loss": 0.5202005863189697, + "mean_token_accuracy": 0.827208873257041, + "num_tokens": 10009889.0, + "step": 2200 + }, + { + "entropy": 0.7257618294097483, + "epoch": 0.20838981152980282, + "grad_norm": 0.57421875, + "learning_rate": 4.537193916009007e-06, + "loss": 0.6309995174407959, + "mean_token_accuracy": 0.7956688452512026, + "num_tokens": 10062058.0, + "step": 2210 + }, + { + "entropy": 0.6472949480637908, + "epoch": 0.2093327518534671, + "grad_norm": 0.50390625, + "learning_rate": 4.532490015010586e-06, + "loss": 0.5185285568237304, + "mean_token_accuracy": 0.8208729565143585, + "num_tokens": 10114150.0, + "step": 2220 + }, + { + "entropy": 0.7547943496145308, + "epoch": 0.21027569217713135, + "grad_norm": 0.291015625, + "learning_rate": 4.527764794153666e-06, + "loss": 0.6795809745788575, + "mean_token_accuracy": 0.7977238070219755, + "num_tokens": 10171445.0, + "step": 2230 + }, + { + "entropy": 0.6034223964437843, + "epoch": 0.21121863250079562, + "grad_norm": 0.31640625, + "learning_rate": 4.523018303003577e-06, + "loss": 0.5290133953094482, + "mean_token_accuracy": 0.8266872577369213, + "num_tokens": 10228018.0, + "step": 2240 + }, + { + "entropy": 0.7052829279564321, + "epoch": 0.21216157282445988, + "grad_norm": 0.392578125, + "learning_rate": 4.518250591348765e-06, + "loss": 0.5237616539001465, + "mean_token_accuracy": 0.819525421410799, + "num_tokens": 10271175.0, + "step": 2250 + }, + { + "entropy": 0.7076565511059016, + "epoch": 0.21310451314812415, + "grad_norm": 0.52734375, + "learning_rate": 4.513461709200269e-06, + "loss": 0.6286019802093505, + "mean_token_accuracy": 0.8029639679938555, + "num_tokens": 10323637.0, + "step": 2260 + }, + { + "entropy": 0.612759631825611, + "epoch": 0.2140474534717884, + "grad_norm": 0.322265625, + "learning_rate": 4.508651706791199e-06, + "loss": 0.6475212097167968, + "mean_token_accuracy": 0.8325118262320756, + "num_tokens": 10371700.0, + "step": 2270 + }, + { + "entropy": 0.7420009043999016, + "epoch": 0.21499039379545268, + "grad_norm": 0.640625, + "learning_rate": 4.5038206345762e-06, + "loss": 0.7298381328582764, + "mean_token_accuracy": 0.7833721118047834, + "num_tokens": 10417361.0, + "step": 2280 + }, + { + "entropy": 0.6522927849553526, + "epoch": 0.21593333411911694, + "grad_norm": 0.2578125, + "learning_rate": 4.498968543230937e-06, + "loss": 0.5515638828277588, + "mean_token_accuracy": 0.8166045229882002, + "num_tokens": 10467913.0, + "step": 2290 + }, + { + "entropy": 0.6916065049357712, + "epoch": 0.2168762744427812, + "grad_norm": 0.333984375, + "learning_rate": 4.49409548365155e-06, + "loss": 0.6021734714508057, + "mean_token_accuracy": 0.8119091907516122, + "num_tokens": 10518853.0, + "step": 2300 + }, + { + "entropy": 0.6611153034493327, + "epoch": 0.21781921476644547, + "grad_norm": 0.546875, + "learning_rate": 4.48920150695413e-06, + "loss": 0.5773680210113525, + "mean_token_accuracy": 0.8194341376423836, + "num_tokens": 10564495.0, + "step": 2310 + }, + { + "entropy": 0.8297945160302334, + "epoch": 0.21876215509010974, + "grad_norm": 0.462890625, + "learning_rate": 4.484286664474177e-06, + "loss": 0.6902072906494141, + "mean_token_accuracy": 0.7996103055775166, + "num_tokens": 10610647.0, + "step": 2320 + }, + { + "entropy": 0.6553996685659513, + "epoch": 0.219705095413774, + "grad_norm": 0.3359375, + "learning_rate": 4.479351007766061e-06, + "loss": 0.5572136402130127, + "mean_token_accuracy": 0.7971479788422584, + "num_tokens": 10663483.0, + "step": 2330 + }, + { + "entropy": 0.6963181391358375, + "epoch": 0.22064803573743827, + "grad_norm": 0.59765625, + "learning_rate": 4.474394588602486e-06, + "loss": 0.5790410995483398, + "mean_token_accuracy": 0.8045560229569674, + "num_tokens": 10710250.0, + "step": 2340 + }, + { + "entropy": 0.8422877897508443, + "epoch": 0.22159097606110253, + "grad_norm": 0.419921875, + "learning_rate": 4.469417458973945e-06, + "loss": 0.627861499786377, + "mean_token_accuracy": 0.7863189570605755, + "num_tokens": 10753271.0, + "step": 2350 + }, + { + "entropy": 0.6823558527044952, + "epoch": 0.2225339163847668, + "grad_norm": 0.41796875, + "learning_rate": 4.464419671088171e-06, + "loss": 0.6231525421142579, + "mean_token_accuracy": 0.8063728950917721, + "num_tokens": 10803990.0, + "step": 2360 + }, + { + "entropy": 0.7730052729602903, + "epoch": 0.22347685670843107, + "grad_norm": 0.515625, + "learning_rate": 4.459401277369595e-06, + "loss": 0.622228479385376, + "mean_token_accuracy": 0.7853727921843529, + "num_tokens": 10854008.0, + "step": 2370 + }, + { + "entropy": 0.7397545983083547, + "epoch": 0.22441979703209533, + "grad_norm": 0.5546875, + "learning_rate": 4.454362330458792e-06, + "loss": 0.7059813022613526, + "mean_token_accuracy": 0.8041706055402755, + "num_tokens": 10899375.0, + "step": 2380 + }, + { + "entropy": 0.8144816821441054, + "epoch": 0.2253627373557596, + "grad_norm": 0.427734375, + "learning_rate": 4.44930288321193e-06, + "loss": 0.5797255992889404, + "mean_token_accuracy": 0.7836383230984211, + "num_tokens": 10950366.0, + "step": 2390 + }, + { + "entropy": 0.6395042231306434, + "epoch": 0.22630567767942386, + "grad_norm": 0.66015625, + "learning_rate": 4.444222988700217e-06, + "loss": 0.526540470123291, + "mean_token_accuracy": 0.8213209711015225, + "num_tokens": 10997043.0, + "step": 2400 + }, + { + "entropy": 0.7632207646034658, + "epoch": 0.22724861800308813, + "grad_norm": 0.408203125, + "learning_rate": 4.439122700209344e-06, + "loss": 0.4208627223968506, + "mean_token_accuracy": 0.8001706589013338, + "num_tokens": 11040050.0, + "step": 2410 + }, + { + "entropy": 0.7518241555429995, + "epoch": 0.2281915583267524, + "grad_norm": 0.59765625, + "learning_rate": 4.434002071238923e-06, + "loss": 0.6388368129730224, + "mean_token_accuracy": 0.7935513414442539, + "num_tokens": 11085047.0, + "step": 2420 + }, + { + "entropy": 0.6688132929615677, + "epoch": 0.22913449865041666, + "grad_norm": 0.32421875, + "learning_rate": 4.428861155501929e-06, + "loss": 0.546387767791748, + "mean_token_accuracy": 0.820703661069274, + "num_tokens": 11129247.0, + "step": 2430 + }, + { + "entropy": 0.7079487937502563, + "epoch": 0.23007743897408092, + "grad_norm": 0.4921875, + "learning_rate": 4.423700006924134e-06, + "loss": 0.6248188495635987, + "mean_token_accuracy": 0.8046429224312306, + "num_tokens": 11184873.0, + "step": 2440 + }, + { + "entropy": 0.6818896850571037, + "epoch": 0.2310203792977452, + "grad_norm": 0.57421875, + "learning_rate": 4.418518679643547e-06, + "loss": 0.5705044746398926, + "mean_token_accuracy": 0.8065329402685165, + "num_tokens": 11224860.0, + "step": 2450 + }, + { + "entropy": 0.7125477872788906, + "epoch": 0.23196331962140945, + "grad_norm": 0.4375, + "learning_rate": 4.4133172280098366e-06, + "loss": 0.6023592472076416, + "mean_token_accuracy": 0.7931496508419513, + "num_tokens": 11273062.0, + "step": 2460 + }, + { + "entropy": 0.8268242001533508, + "epoch": 0.23290625994507372, + "grad_norm": 0.65625, + "learning_rate": 4.4080957065837705e-06, + "loss": 0.5537054061889648, + "mean_token_accuracy": 0.7920439690351486, + "num_tokens": 11315820.0, + "step": 2470 + }, + { + "entropy": 0.6495694993063807, + "epoch": 0.23384920026873798, + "grad_norm": 0.4375, + "learning_rate": 4.402854170136638e-06, + "loss": 0.5979690074920654, + "mean_token_accuracy": 0.8214081518352032, + "num_tokens": 11365181.0, + "step": 2480 + }, + { + "entropy": 0.6780490770936012, + "epoch": 0.23479214059240225, + "grad_norm": 0.42578125, + "learning_rate": 4.397592673649675e-06, + "loss": 0.5484375476837158, + "mean_token_accuracy": 0.8182380983605981, + "num_tokens": 11411595.0, + "step": 2490 + }, + { + "entropy": 0.6635444098617882, + "epoch": 0.23573508091606651, + "grad_norm": 0.37890625, + "learning_rate": 4.3923112723134925e-06, + "loss": 0.5475056171417236, + "mean_token_accuracy": 0.8106115475296974, + "num_tokens": 11457001.0, + "step": 2500 + }, + { + "entropy": 0.5945799764245748, + "epoch": 0.23667802123973078, + "grad_norm": 0.2255859375, + "learning_rate": 4.387010021527489e-06, + "loss": 0.5004089832305908, + "mean_token_accuracy": 0.8270149566233158, + "num_tokens": 11507578.0, + "step": 2510 + }, + { + "entropy": 0.7172031537629664, + "epoch": 0.23762096156339504, + "grad_norm": 0.416015625, + "learning_rate": 4.381688976899278e-06, + "loss": 0.570509958267212, + "mean_token_accuracy": 0.7985255815088749, + "num_tokens": 11559582.0, + "step": 2520 + }, + { + "entropy": 0.6814393433742225, + "epoch": 0.2385639018870593, + "grad_norm": 0.67578125, + "learning_rate": 4.376348194244098e-06, + "loss": 0.5488054275512695, + "mean_token_accuracy": 0.8171292833983899, + "num_tokens": 11601800.0, + "step": 2530 + }, + { + "entropy": 0.6187633796595037, + "epoch": 0.23950684221072358, + "grad_norm": 0.37109375, + "learning_rate": 4.370987729584233e-06, + "loss": 0.528061056137085, + "mean_token_accuracy": 0.8176171716302634, + "num_tokens": 11645914.0, + "step": 2540 + }, + { + "entropy": 0.7502338518388569, + "epoch": 0.24044978253438787, + "grad_norm": 0.75, + "learning_rate": 4.365607639148422e-06, + "loss": 0.6851604461669922, + "mean_token_accuracy": 0.8080096576362849, + "num_tokens": 11685949.0, + "step": 2550 + }, + { + "entropy": 0.7071651536040008, + "epoch": 0.24139272285805213, + "grad_norm": 0.5546875, + "learning_rate": 4.360207979371266e-06, + "loss": 0.6052841663360595, + "mean_token_accuracy": 0.8076611422002316, + "num_tokens": 11733467.0, + "step": 2560 + }, + { + "entropy": 0.8098411624319851, + "epoch": 0.2423356631817164, + "grad_norm": 0.494140625, + "learning_rate": 4.354788806892641e-06, + "loss": 0.5459568500518799, + "mean_token_accuracy": 0.7838873576372862, + "num_tokens": 11778901.0, + "step": 2570 + }, + { + "entropy": 0.6692146965302527, + "epoch": 0.24327860350538066, + "grad_norm": 0.35546875, + "learning_rate": 4.3493501785571034e-06, + "loss": 0.7700508117675782, + "mean_token_accuracy": 0.82504887804389, + "num_tokens": 11818887.0, + "step": 2580 + }, + { + "entropy": 0.6426164032891393, + "epoch": 0.24422154382904493, + "grad_norm": 0.33984375, + "learning_rate": 4.34389215141329e-06, + "loss": 0.4979496955871582, + "mean_token_accuracy": 0.8184706576168537, + "num_tokens": 11864058.0, + "step": 2590 + }, + { + "entropy": 0.7097076333360747, + "epoch": 0.2451644841527092, + "grad_norm": 0.45703125, + "learning_rate": 4.338414782713322e-06, + "loss": 0.5226698875427246, + "mean_token_accuracy": 0.8021728150546551, + "num_tokens": 11911890.0, + "step": 2600 + }, + { + "entropy": 0.7304733860772104, + "epoch": 0.24610742447637346, + "grad_norm": 0.416015625, + "learning_rate": 4.332918129912208e-06, + "loss": 0.7039321422576904, + "mean_token_accuracy": 0.7967918623238802, + "num_tokens": 11955745.0, + "step": 2610 + }, + { + "entropy": 0.6977716976776719, + "epoch": 0.24705036480003773, + "grad_norm": 0.7578125, + "learning_rate": 4.327402250667233e-06, + "loss": 0.5292267322540283, + "mean_token_accuracy": 0.8004238706082105, + "num_tokens": 11994942.0, + "step": 2620 + }, + { + "entropy": 0.7422330360859632, + "epoch": 0.247993305123702, + "grad_norm": 0.5390625, + "learning_rate": 4.321867202837359e-06, + "loss": 0.6598591327667236, + "mean_token_accuracy": 0.793621858395636, + "num_tokens": 12040970.0, + "step": 2630 + }, + { + "entropy": 0.6614692817442119, + "epoch": 0.24893624544736626, + "grad_norm": 0.349609375, + "learning_rate": 4.316313044482621e-06, + "loss": 0.4676491737365723, + "mean_token_accuracy": 0.8118173565715552, + "num_tokens": 12095644.0, + "step": 2640 + }, + { + "entropy": 0.7872744291671552, + "epoch": 0.24987918577103052, + "grad_norm": 0.41015625, + "learning_rate": 4.31073983386351e-06, + "loss": 0.7802893161773682, + "mean_token_accuracy": 0.7734283555299044, + "num_tokens": 12147287.0, + "step": 2650 + }, + { + "entropy": 0.6264273500069976, + "epoch": 0.2508221260946948, + "grad_norm": 0.4375, + "learning_rate": 4.30514762944037e-06, + "loss": 0.5711867809295654, + "mean_token_accuracy": 0.8230541836470365, + "num_tokens": 12191134.0, + "step": 2660 + }, + { + "entropy": 0.642601250205189, + "epoch": 0.25176506641835905, + "grad_norm": 0.203125, + "learning_rate": 4.299536489872778e-06, + "loss": 0.41927399635314944, + "mean_token_accuracy": 0.8300650017336011, + "num_tokens": 12244587.0, + "step": 2670 + }, + { + "entropy": 0.7999465940054507, + "epoch": 0.2527080067420233, + "grad_norm": 0.53125, + "learning_rate": 4.293906474018933e-06, + "loss": 0.6219149589538574, + "mean_token_accuracy": 0.7740768680348993, + "num_tokens": 12292442.0, + "step": 2680 + }, + { + "entropy": 0.6853533301036805, + "epoch": 0.2536509470656876, + "grad_norm": 0.400390625, + "learning_rate": 4.288257640935038e-06, + "loss": 0.5230690479278565, + "mean_token_accuracy": 0.8064401123672724, + "num_tokens": 12332055.0, + "step": 2690 + }, + { + "entropy": 0.6050175254698843, + "epoch": 0.25459388738935185, + "grad_norm": 0.302734375, + "learning_rate": 4.282590049874678e-06, + "loss": 0.5386334419250488, + "mean_token_accuracy": 0.8066453229635954, + "num_tokens": 12377897.0, + "step": 2700 + }, + { + "entropy": 0.6740714994259178, + "epoch": 0.2555368277130161, + "grad_norm": 0.1845703125, + "learning_rate": 4.276903760288202e-06, + "loss": 0.4890268325805664, + "mean_token_accuracy": 0.8237885976210236, + "num_tokens": 12422796.0, + "step": 2710 + }, + { + "entropy": 0.6965341650880873, + "epoch": 0.2564797680366804, + "grad_norm": 0.62109375, + "learning_rate": 4.271198831822097e-06, + "loss": 0.7352762699127198, + "mean_token_accuracy": 0.7847994826734066, + "num_tokens": 12467865.0, + "step": 2720 + }, + { + "entropy": 0.6212398945353925, + "epoch": 0.25742270836034464, + "grad_norm": 0.45703125, + "learning_rate": 4.265475324318362e-06, + "loss": 0.5328194618225097, + "mean_token_accuracy": 0.8315907616168261, + "num_tokens": 12512975.0, + "step": 2730 + }, + { + "entropy": 0.693923706561327, + "epoch": 0.2583656486840089, + "grad_norm": 0.59765625, + "learning_rate": 4.259733297813885e-06, + "loss": 0.5941354274749756, + "mean_token_accuracy": 0.8204266559332609, + "num_tokens": 12555479.0, + "step": 2740 + }, + { + "entropy": 0.8046634275466203, + "epoch": 0.2593085890076732, + "grad_norm": 0.5625, + "learning_rate": 4.253972812539805e-06, + "loss": 0.7706850528717041, + "mean_token_accuracy": 0.7917935982346535, + "num_tokens": 12601319.0, + "step": 2750 + }, + { + "entropy": 0.7471866227686406, + "epoch": 0.26025152933133744, + "grad_norm": 0.40625, + "learning_rate": 4.248193928920886e-06, + "loss": 0.710187292098999, + "mean_token_accuracy": 0.7990452691912651, + "num_tokens": 12658000.0, + "step": 2760 + }, + { + "entropy": 0.6626139220781624, + "epoch": 0.2611944696550017, + "grad_norm": 0.25, + "learning_rate": 4.242396707574885e-06, + "loss": 0.48251981735229493, + "mean_token_accuracy": 0.8196328468620777, + "num_tokens": 12707975.0, + "step": 2770 + }, + { + "entropy": 0.6553014845587313, + "epoch": 0.26213740997866597, + "grad_norm": 0.5625, + "learning_rate": 4.236581209311909e-06, + "loss": 0.5507401466369629, + "mean_token_accuracy": 0.8160292755812406, + "num_tokens": 12753527.0, + "step": 2780 + }, + { + "entropy": 0.622153397090733, + "epoch": 0.26308035030233023, + "grad_norm": 0.412109375, + "learning_rate": 4.230747495133784e-06, + "loss": 0.5054684162139893, + "mean_token_accuracy": 0.8228756669908762, + "num_tokens": 12809632.0, + "step": 2790 + }, + { + "entropy": 0.6780139476060867, + "epoch": 0.2640232906259945, + "grad_norm": 0.52734375, + "learning_rate": 4.224895626233409e-06, + "loss": 0.8137707710266113, + "mean_token_accuracy": 0.8064680024981499, + "num_tokens": 12852804.0, + "step": 2800 + }, + { + "entropy": 0.7678300259634853, + "epoch": 0.26496623094965877, + "grad_norm": 0.408203125, + "learning_rate": 4.219025663994123e-06, + "loss": 0.7762890815734863, + "mean_token_accuracy": 0.7923290681093931, + "num_tokens": 12902399.0, + "step": 2810 + }, + { + "entropy": 0.5841752365231514, + "epoch": 0.26590917127332303, + "grad_norm": 0.404296875, + "learning_rate": 4.21313766998905e-06, + "loss": 0.4339454174041748, + "mean_token_accuracy": 0.8222315371036529, + "num_tokens": 12945895.0, + "step": 2820 + }, + { + "entropy": 0.6883633114397526, + "epoch": 0.2668521115969873, + "grad_norm": 0.51953125, + "learning_rate": 4.207231705980461e-06, + "loss": 0.7140939235687256, + "mean_token_accuracy": 0.8142529975622892, + "num_tokens": 12992305.0, + "step": 2830 + }, + { + "entropy": 0.7407352829352021, + "epoch": 0.26779505192065156, + "grad_norm": 0.25, + "learning_rate": 4.201307833919126e-06, + "loss": 0.6346509456634521, + "mean_token_accuracy": 0.7989520721137524, + "num_tokens": 13041575.0, + "step": 2840 + }, + { + "entropy": 0.714037418179214, + "epoch": 0.2687379922443158, + "grad_norm": 0.7890625, + "learning_rate": 4.195366115943657e-06, + "loss": 0.6052238464355468, + "mean_token_accuracy": 0.799788748472929, + "num_tokens": 13083778.0, + "step": 2850 + }, + { + "entropy": 0.8210464440286159, + "epoch": 0.2696809325679801, + "grad_norm": 0.384765625, + "learning_rate": 4.189406614379865e-06, + "loss": 0.6140337944030761, + "mean_token_accuracy": 0.7797987915575504, + "num_tokens": 13136468.0, + "step": 2860 + }, + { + "entropy": 0.715034647192806, + "epoch": 0.27062387289164436, + "grad_norm": 0.24609375, + "learning_rate": 4.183429391740103e-06, + "loss": 0.6325907707214355, + "mean_token_accuracy": 0.7957759384065867, + "num_tokens": 13190907.0, + "step": 2870 + }, + { + "entropy": 0.6897853550501167, + "epoch": 0.2715668132153086, + "grad_norm": 1.0390625, + "learning_rate": 4.177434510722605e-06, + "loss": 0.6110557556152344, + "mean_token_accuracy": 0.81325623691082, + "num_tokens": 13231284.0, + "step": 2880 + }, + { + "entropy": 0.6753826588392258, + "epoch": 0.2725097535389729, + "grad_norm": 0.38671875, + "learning_rate": 4.171422034210839e-06, + "loss": 0.4948280334472656, + "mean_token_accuracy": 0.8051031611859798, + "num_tokens": 13277819.0, + "step": 2890 + }, + { + "entropy": 0.739368848875165, + "epoch": 0.27345269386263715, + "grad_norm": 0.48828125, + "learning_rate": 4.165392025272836e-06, + "loss": 0.641120195388794, + "mean_token_accuracy": 0.7944438774138689, + "num_tokens": 13319933.0, + "step": 2900 + }, + { + "entropy": 0.7141495368443429, + "epoch": 0.2743956341863014, + "grad_norm": 0.671875, + "learning_rate": 4.159344547160539e-06, + "loss": 0.6336250305175781, + "mean_token_accuracy": 0.8012420143932104, + "num_tokens": 13357614.0, + "step": 2910 + }, + { + "entropy": 0.5666716417297721, + "epoch": 0.2753385745099657, + "grad_norm": 0.458984375, + "learning_rate": 4.15327966330913e-06, + "loss": 0.4592881679534912, + "mean_token_accuracy": 0.833888939768076, + "num_tokens": 13412982.0, + "step": 2920 + }, + { + "entropy": 0.7603326801676303, + "epoch": 0.27628151483362995, + "grad_norm": 0.48046875, + "learning_rate": 4.147197437336372e-06, + "loss": 0.6861026763916016, + "mean_token_accuracy": 0.7918042603880167, + "num_tokens": 13455286.0, + "step": 2930 + }, + { + "entropy": 0.8255054540932178, + "epoch": 0.2772244551572942, + "grad_norm": 0.55078125, + "learning_rate": 4.141097933041936e-06, + "loss": 0.6968491077423096, + "mean_token_accuracy": 0.7748916573822499, + "num_tokens": 13496973.0, + "step": 2940 + }, + { + "entropy": 0.7764521720819175, + "epoch": 0.2781673954809585, + "grad_norm": 0.3828125, + "learning_rate": 4.134981214406737e-06, + "loss": 0.4818326473236084, + "mean_token_accuracy": 0.7867025479674339, + "num_tokens": 13547249.0, + "step": 2950 + }, + { + "entropy": 0.7108894733712077, + "epoch": 0.27911033580462274, + "grad_norm": 0.35546875, + "learning_rate": 4.1288473455922584e-06, + "loss": 0.5785073280334473, + "mean_token_accuracy": 0.8074256978929043, + "num_tokens": 13592148.0, + "step": 2960 + }, + { + "entropy": 0.7593025027774274, + "epoch": 0.280053276128287, + "grad_norm": 0.408203125, + "learning_rate": 4.122696390939882e-06, + "loss": 0.7499773025512695, + "mean_token_accuracy": 0.7877199437469244, + "num_tokens": 13643977.0, + "step": 2970 + }, + { + "entropy": 0.763703981693834, + "epoch": 0.2809962164519513, + "grad_norm": 0.267578125, + "learning_rate": 4.116528414970211e-06, + "loss": 0.6026920318603516, + "mean_token_accuracy": 0.7880954163148999, + "num_tokens": 13686759.0, + "step": 2980 + }, + { + "entropy": 0.6860854076221585, + "epoch": 0.28193915677561554, + "grad_norm": 0.412109375, + "learning_rate": 4.110343482382396e-06, + "loss": 0.5413653373718261, + "mean_token_accuracy": 0.8145212274044752, + "num_tokens": 13731883.0, + "step": 2990 + }, + { + "entropy": 0.7460825649090111, + "epoch": 0.2828820970992798, + "grad_norm": 0.84765625, + "learning_rate": 4.104141658053451e-06, + "loss": 0.7144715785980225, + "mean_token_accuracy": 0.7957971028983593, + "num_tokens": 13780640.0, + "step": 3000 + }, + { + "entropy": 0.8326621399261057, + "epoch": 0.28382503742294407, + "grad_norm": 0.486328125, + "learning_rate": 4.097923007037581e-06, + "loss": 0.9063180923461914, + "mean_token_accuracy": 0.7649697538465261, + "num_tokens": 13815992.0, + "step": 3010 + }, + { + "entropy": 0.9316485294606537, + "epoch": 0.28476797774660834, + "grad_norm": 0.60546875, + "learning_rate": 4.09168759456549e-06, + "loss": 0.8332127571105957, + "mean_token_accuracy": 0.757191539555788, + "num_tokens": 13862295.0, + "step": 3020 + }, + { + "entropy": 0.7256421025842428, + "epoch": 0.2857109180702726, + "grad_norm": 0.78125, + "learning_rate": 4.085435486043706e-06, + "loss": 0.7105655193328857, + "mean_token_accuracy": 0.80562147423625, + "num_tokens": 13911028.0, + "step": 3030 + }, + { + "entropy": 0.7599948160350323, + "epoch": 0.28665385839393687, + "grad_norm": 0.828125, + "learning_rate": 4.0791667470538895e-06, + "loss": 0.6686043739318848, + "mean_token_accuracy": 0.7909170279279352, + "num_tokens": 13964127.0, + "step": 3040 + }, + { + "entropy": 0.8010038698092103, + "epoch": 0.2875967987176012, + "grad_norm": 0.421875, + "learning_rate": 4.072881443352144e-06, + "loss": 0.6279882907867431, + "mean_token_accuracy": 0.78184520509094, + "num_tokens": 14009502.0, + "step": 3050 + }, + { + "entropy": 0.6282306860201061, + "epoch": 0.28853973904126545, + "grad_norm": 0.50390625, + "learning_rate": 4.0665796408683324e-06, + "loss": 0.6266475677490234, + "mean_token_accuracy": 0.8261493802070617, + "num_tokens": 14054200.0, + "step": 3060 + }, + { + "entropy": 0.6563035418046639, + "epoch": 0.2894826793649297, + "grad_norm": 0.671875, + "learning_rate": 4.0602614057053815e-06, + "loss": 0.5960610866546631, + "mean_token_accuracy": 0.8131377577781678, + "num_tokens": 14104808.0, + "step": 3070 + }, + { + "entropy": 0.7352710378356277, + "epoch": 0.290425619688594, + "grad_norm": 0.42578125, + "learning_rate": 4.053926804138588e-06, + "loss": 0.6611281394958496, + "mean_token_accuracy": 0.8034013140946626, + "num_tokens": 14148483.0, + "step": 3080 + }, + { + "entropy": 0.6457099332474172, + "epoch": 0.29136856001225825, + "grad_norm": 0.2578125, + "learning_rate": 4.047575902614924e-06, + "loss": 0.6730895042419434, + "mean_token_accuracy": 0.8202265679836274, + "num_tokens": 14211134.0, + "step": 3090 + }, + { + "entropy": 0.6713374426588417, + "epoch": 0.2923115003359225, + "grad_norm": 0.291015625, + "learning_rate": 4.041208767752341e-06, + "loss": 0.5431832790374755, + "mean_token_accuracy": 0.815386663377285, + "num_tokens": 14255091.0, + "step": 3100 + }, + { + "entropy": 0.734676618874073, + "epoch": 0.2932544406595868, + "grad_norm": 0.2353515625, + "learning_rate": 4.034825466339073e-06, + "loss": 0.5647121906280518, + "mean_token_accuracy": 0.8160567294806242, + "num_tokens": 14301274.0, + "step": 3110 + }, + { + "entropy": 0.6874036092311144, + "epoch": 0.29419738098325104, + "grad_norm": 0.5546875, + "learning_rate": 4.02842606533293e-06, + "loss": 0.5496022701263428, + "mean_token_accuracy": 0.8137231681495904, + "num_tokens": 14342896.0, + "step": 3120 + }, + { + "entropy": 0.6659715895075351, + "epoch": 0.2951403213069153, + "grad_norm": 0.291015625, + "learning_rate": 4.0220106318606e-06, + "loss": 0.5480599880218506, + "mean_token_accuracy": 0.8109877597540617, + "num_tokens": 14386650.0, + "step": 3130 + }, + { + "entropy": 0.9152347665280104, + "epoch": 0.2960832616305796, + "grad_norm": 0.421875, + "learning_rate": 4.015579233216944e-06, + "loss": 0.6289479732513428, + "mean_token_accuracy": 0.7669604491442442, + "num_tokens": 14432746.0, + "step": 3140 + }, + { + "entropy": 0.7302544771693646, + "epoch": 0.29702620195424384, + "grad_norm": 0.5, + "learning_rate": 4.009131936864293e-06, + "loss": 0.7106366157531738, + "mean_token_accuracy": 0.809479969739914, + "num_tokens": 14473027.0, + "step": 3150 + }, + { + "entropy": 0.7078684787265956, + "epoch": 0.2979691422779081, + "grad_norm": 0.318359375, + "learning_rate": 4.002668810431733e-06, + "loss": 0.4805280685424805, + "mean_token_accuracy": 0.8173054194077849, + "num_tokens": 14512645.0, + "step": 3160 + }, + { + "entropy": 0.6727185323834419, + "epoch": 0.29891208260157237, + "grad_norm": 0.34375, + "learning_rate": 3.9961899217144004e-06, + "loss": 0.5752994060516358, + "mean_token_accuracy": 0.8104622792452574, + "num_tokens": 14556834.0, + "step": 3170 + }, + { + "entropy": 0.6954042711295187, + "epoch": 0.29985502292523664, + "grad_norm": 0.412109375, + "learning_rate": 3.989695338672775e-06, + "loss": 0.5789048671722412, + "mean_token_accuracy": 0.8124545980244875, + "num_tokens": 14596491.0, + "step": 3180 + }, + { + "entropy": 0.7359610196202994, + "epoch": 0.3007979632489009, + "grad_norm": 0.5078125, + "learning_rate": 3.983185129431959e-06, + "loss": 0.5956539630889892, + "mean_token_accuracy": 0.7969963911920785, + "num_tokens": 14647326.0, + "step": 3190 + }, + { + "entropy": 0.6450121255591512, + "epoch": 0.30174090357256517, + "grad_norm": 0.390625, + "learning_rate": 3.976659362280966e-06, + "loss": 0.5854204177856446, + "mean_token_accuracy": 0.8218308422714472, + "num_tokens": 14692466.0, + "step": 3200 + }, + { + "entropy": 0.6701277974992991, + "epoch": 0.30268384389622943, + "grad_norm": 0.318359375, + "learning_rate": 3.970118105672006e-06, + "loss": 0.6377078533172608, + "mean_token_accuracy": 0.8047068595886231, + "num_tokens": 14742900.0, + "step": 3210 + }, + { + "entropy": 0.7718553693033755, + "epoch": 0.3036267842198937, + "grad_norm": 1.3125, + "learning_rate": 3.963561428219765e-06, + "loss": 0.6326769828796387, + "mean_token_accuracy": 0.7890255197882652, + "num_tokens": 14787852.0, + "step": 3220 + }, + { + "entropy": 0.7489314749836922, + "epoch": 0.30456972454355796, + "grad_norm": 0.51953125, + "learning_rate": 3.956989398700687e-06, + "loss": 0.7279271602630615, + "mean_token_accuracy": 0.7867590818554163, + "num_tokens": 14827219.0, + "step": 3230 + }, + { + "entropy": 0.7688439194113016, + "epoch": 0.30551266486722223, + "grad_norm": 0.7734375, + "learning_rate": 3.950402086052253e-06, + "loss": 0.7808563709259033, + "mean_token_accuracy": 0.7964679040014744, + "num_tokens": 14869813.0, + "step": 3240 + }, + { + "entropy": 0.5645394513383508, + "epoch": 0.3064556051908865, + "grad_norm": 0.4375, + "learning_rate": 3.943799559372254e-06, + "loss": 0.5005753993988037, + "mean_token_accuracy": 0.8374217573553324, + "num_tokens": 14918596.0, + "step": 3250 + }, + { + "entropy": 0.7563243569806218, + "epoch": 0.30739854551455076, + "grad_norm": 0.51171875, + "learning_rate": 3.937181887918072e-06, + "loss": 0.5691118240356445, + "mean_token_accuracy": 0.8011289283633232, + "num_tokens": 14954915.0, + "step": 3260 + }, + { + "entropy": 0.6726897666230798, + "epoch": 0.308341485838215, + "grad_norm": 0.62109375, + "learning_rate": 3.930549141105948e-06, + "loss": 0.5586506366729737, + "mean_token_accuracy": 0.8176765486598014, + "num_tokens": 15009865.0, + "step": 3270 + }, + { + "entropy": 0.7068807984702289, + "epoch": 0.3092844261618793, + "grad_norm": 0.640625, + "learning_rate": 3.923901388510259e-06, + "loss": 0.5407650947570801, + "mean_token_accuracy": 0.8079414956271649, + "num_tokens": 15056586.0, + "step": 3280 + }, + { + "entropy": 0.6136560516897589, + "epoch": 0.31022736648554355, + "grad_norm": 0.376953125, + "learning_rate": 3.917238699862782e-06, + "loss": 0.522227668762207, + "mean_token_accuracy": 0.8270126104354858, + "num_tokens": 15098316.0, + "step": 3290 + }, + { + "entropy": 0.693851160723716, + "epoch": 0.3111703068092078, + "grad_norm": 0.58203125, + "learning_rate": 3.910561145051969e-06, + "loss": 0.5569193840026856, + "mean_token_accuracy": 0.816235949471593, + "num_tokens": 15140027.0, + "step": 3300 + }, + { + "entropy": 0.6663465833291411, + "epoch": 0.3121132471328721, + "grad_norm": 0.63671875, + "learning_rate": 3.903868794122211e-06, + "loss": 0.6506803035736084, + "mean_token_accuracy": 0.8125866772606969, + "num_tokens": 15179813.0, + "step": 3310 + }, + { + "entropy": 0.7533382272347808, + "epoch": 0.31305618745653635, + "grad_norm": 0.51953125, + "learning_rate": 3.8971617172731026e-06, + "loss": 0.6869213104248046, + "mean_token_accuracy": 0.7885122291743756, + "num_tokens": 15221550.0, + "step": 3320 + }, + { + "entropy": 0.7408904255833477, + "epoch": 0.3139991277802006, + "grad_norm": 0.267578125, + "learning_rate": 3.8904399848587045e-06, + "loss": 0.6417848587036132, + "mean_token_accuracy": 0.7870474755764008, + "num_tokens": 15271012.0, + "step": 3330 + }, + { + "entropy": 0.7080091743730008, + "epoch": 0.3149420681038649, + "grad_norm": 0.423828125, + "learning_rate": 3.88370366738681e-06, + "loss": 0.5353238582611084, + "mean_token_accuracy": 0.7993681333959103, + "num_tokens": 15317762.0, + "step": 3340 + }, + { + "entropy": 0.7359500544145703, + "epoch": 0.31588500842752915, + "grad_norm": 0.625, + "learning_rate": 3.876952835518202e-06, + "loss": 0.7712695121765136, + "mean_token_accuracy": 0.7999884054064751, + "num_tokens": 15356394.0, + "step": 3350 + }, + { + "entropy": 0.636717552319169, + "epoch": 0.3168279487511934, + "grad_norm": 0.369140625, + "learning_rate": 3.870187560065913e-06, + "loss": 0.5929419994354248, + "mean_token_accuracy": 0.8112790875136853, + "num_tokens": 15401554.0, + "step": 3360 + }, + { + "entropy": 0.7583870824426413, + "epoch": 0.3177708890748577, + "grad_norm": 0.3125, + "learning_rate": 3.86340791199448e-06, + "loss": 0.6758883953094482, + "mean_token_accuracy": 0.7855101089924574, + "num_tokens": 15449214.0, + "step": 3370 + }, + { + "entropy": 0.78564184429124, + "epoch": 0.31871382939852194, + "grad_norm": 0.55859375, + "learning_rate": 3.8566139624192035e-06, + "loss": 0.5231400012969971, + "mean_token_accuracy": 0.7916332878172397, + "num_tokens": 15491898.0, + "step": 3380 + }, + { + "entropy": 0.6915111863054335, + "epoch": 0.3196567697221862, + "grad_norm": 1.8125, + "learning_rate": 3.849805782605401e-06, + "loss": 0.506642484664917, + "mean_token_accuracy": 0.81902342364192, + "num_tokens": 15536558.0, + "step": 3390 + }, + { + "entropy": 0.7364246053621173, + "epoch": 0.3205997100458505, + "grad_norm": 0.408203125, + "learning_rate": 3.842983443967654e-06, + "loss": 0.6232193946838379, + "mean_token_accuracy": 0.793385767377913, + "num_tokens": 15584969.0, + "step": 3400 + }, + { + "entropy": 0.6796113492920994, + "epoch": 0.32154265036951474, + "grad_norm": 0.4296875, + "learning_rate": 3.83614701806907e-06, + "loss": 0.5323117733001709, + "mean_token_accuracy": 0.7944784520193935, + "num_tokens": 15628552.0, + "step": 3410 + }, + { + "entropy": 0.5872353835962713, + "epoch": 0.322485590693179, + "grad_norm": 0.287109375, + "learning_rate": 3.8292965766205204e-06, + "loss": 0.5037885189056397, + "mean_token_accuracy": 0.8266831699758768, + "num_tokens": 15684463.0, + "step": 3420 + }, + { + "entropy": 0.6443200805224478, + "epoch": 0.32342853101684327, + "grad_norm": 0.478515625, + "learning_rate": 3.822432191479894e-06, + "loss": 0.6218739509582519, + "mean_token_accuracy": 0.8293004889041186, + "num_tokens": 15731478.0, + "step": 3430 + }, + { + "entropy": 0.6724415736272931, + "epoch": 0.32437147134050753, + "grad_norm": 0.482421875, + "learning_rate": 3.815553934651342e-06, + "loss": 0.49276022911071776, + "mean_token_accuracy": 0.8229852892458439, + "num_tokens": 15783638.0, + "step": 3440 + }, + { + "entropy": 0.8211766470223665, + "epoch": 0.3253144116641718, + "grad_norm": 0.40234375, + "learning_rate": 3.8086618782845265e-06, + "loss": 0.7018588542938232, + "mean_token_accuracy": 0.7826432820409537, + "num_tokens": 15823126.0, + "step": 3450 + }, + { + "entropy": 0.6938874244689941, + "epoch": 0.32625735198783606, + "grad_norm": 0.357421875, + "learning_rate": 3.8017560946738557e-06, + "loss": 0.6181281089782715, + "mean_token_accuracy": 0.8122403334826231, + "num_tokens": 15871899.0, + "step": 3460 + }, + { + "entropy": 0.7408801101148128, + "epoch": 0.32720029231150033, + "grad_norm": 0.421875, + "learning_rate": 3.7948366562577323e-06, + "loss": 0.7769334316253662, + "mean_token_accuracy": 0.7820941220968962, + "num_tokens": 15917934.0, + "step": 3470 + }, + { + "entropy": 0.7755114403553307, + "epoch": 0.3281432326351646, + "grad_norm": 0.4375, + "learning_rate": 3.78790363561779e-06, + "loss": 0.8794495582580566, + "mean_token_accuracy": 0.794552437029779, + "num_tokens": 15966575.0, + "step": 3480 + }, + { + "entropy": 0.6764940508641303, + "epoch": 0.32908617295882886, + "grad_norm": 0.5078125, + "learning_rate": 3.780957105478136e-06, + "loss": 0.5081439971923828, + "mean_token_accuracy": 0.8095720581710338, + "num_tokens": 16005157.0, + "step": 3490 + }, + { + "entropy": 0.6400508332066238, + "epoch": 0.3300291132824931, + "grad_norm": 0.451171875, + "learning_rate": 3.773997138704584e-06, + "loss": 0.6697597503662109, + "mean_token_accuracy": 0.8156585179269313, + "num_tokens": 16058706.0, + "step": 3500 + }, + { + "entropy": 0.7768798024393618, + "epoch": 0.3309720536061574, + "grad_norm": 0.47265625, + "learning_rate": 3.767023808303892e-06, + "loss": 0.6917949199676514, + "mean_token_accuracy": 0.7819763291627169, + "num_tokens": 16104548.0, + "step": 3510 + }, + { + "entropy": 0.6866999283432961, + "epoch": 0.33191499392982166, + "grad_norm": 0.375, + "learning_rate": 3.760037187422996e-06, + "loss": 0.5713237285614013, + "mean_token_accuracy": 0.808608740568161, + "num_tokens": 16151094.0, + "step": 3520 + }, + { + "entropy": 0.6466354493051767, + "epoch": 0.3328579342534859, + "grad_norm": 0.5234375, + "learning_rate": 3.7530373493482442e-06, + "loss": 0.5052223682403565, + "mean_token_accuracy": 0.8262160135433078, + "num_tokens": 16187244.0, + "step": 3530 + }, + { + "entropy": 0.7813827708363533, + "epoch": 0.3338008745771502, + "grad_norm": 0.50390625, + "learning_rate": 3.746024367504624e-06, + "loss": 0.741961669921875, + "mean_token_accuracy": 0.7885062169283629, + "num_tokens": 16230839.0, + "step": 3540 + }, + { + "entropy": 0.6852214397862554, + "epoch": 0.33474381490081445, + "grad_norm": 0.296875, + "learning_rate": 3.738998315454997e-06, + "loss": 0.7102997303009033, + "mean_token_accuracy": 0.8053493849933148, + "num_tokens": 16272786.0, + "step": 3550 + }, + { + "entropy": 0.7877503798343242, + "epoch": 0.3356867552244787, + "grad_norm": 0.5390625, + "learning_rate": 3.7319592668993252e-06, + "loss": 0.6556308746337891, + "mean_token_accuracy": 0.7900882601737976, + "num_tokens": 16315697.0, + "step": 3560 + }, + { + "entropy": 0.7013790069147945, + "epoch": 0.336629695548143, + "grad_norm": 1.2890625, + "learning_rate": 3.724907295673897e-06, + "loss": 0.6879619598388672, + "mean_token_accuracy": 0.7857543051242828, + "num_tokens": 16355680.0, + "step": 3570 + }, + { + "entropy": 0.741982850804925, + "epoch": 0.33757263587180725, + "grad_norm": 0.283203125, + "learning_rate": 3.7178424757505527e-06, + "loss": 0.4787749767303467, + "mean_token_accuracy": 0.7993146969936789, + "num_tokens": 16403649.0, + "step": 3580 + }, + { + "entropy": 0.7543878412805498, + "epoch": 0.3385155761954715, + "grad_norm": 0.265625, + "learning_rate": 3.710764881235911e-06, + "loss": 0.6166384220123291, + "mean_token_accuracy": 0.7903889134526253, + "num_tokens": 16450951.0, + "step": 3590 + }, + { + "entropy": 0.7278856437653303, + "epoch": 0.3394585165191358, + "grad_norm": 0.58984375, + "learning_rate": 3.7036745863705898e-06, + "loss": 0.5853046894073486, + "mean_token_accuracy": 0.8067043915390968, + "num_tokens": 16492847.0, + "step": 3600 + }, + { + "entropy": 0.623352998867631, + "epoch": 0.34040145684280004, + "grad_norm": 0.859375, + "learning_rate": 3.696571665528426e-06, + "loss": 0.6010436058044434, + "mean_token_accuracy": 0.8135320819914341, + "num_tokens": 16539335.0, + "step": 3610 + }, + { + "entropy": 0.5651233859360218, + "epoch": 0.3413443971664643, + "grad_norm": 0.34765625, + "learning_rate": 3.6894561932156993e-06, + "loss": 0.480146598815918, + "mean_token_accuracy": 0.8269745983183384, + "num_tokens": 16581557.0, + "step": 3620 + }, + { + "entropy": 0.5513820692896843, + "epoch": 0.3422873374901286, + "grad_norm": 0.29296875, + "learning_rate": 3.6823282440703464e-06, + "loss": 0.44032793045043944, + "mean_token_accuracy": 0.8351238772273064, + "num_tokens": 16630457.0, + "step": 3630 + }, + { + "entropy": 0.6860549350269138, + "epoch": 0.34323027781379284, + "grad_norm": 0.42578125, + "learning_rate": 3.675187892861181e-06, + "loss": 0.8258073806762696, + "mean_token_accuracy": 0.8066768426448107, + "num_tokens": 16672161.0, + "step": 3640 + }, + { + "entropy": 0.7870678843930363, + "epoch": 0.3441732181374571, + "grad_norm": 0.384765625, + "learning_rate": 3.668035214487109e-06, + "loss": 0.596193790435791, + "mean_token_accuracy": 0.7948238357901574, + "num_tokens": 16718702.0, + "step": 3650 + }, + { + "entropy": 0.643625473883003, + "epoch": 0.34511615846112137, + "grad_norm": 0.6875, + "learning_rate": 3.6608702839763417e-06, + "loss": 0.5603129863739014, + "mean_token_accuracy": 0.8320864170789719, + "num_tokens": 16762137.0, + "step": 3660 + }, + { + "entropy": 0.6784814346581698, + "epoch": 0.34605909878478563, + "grad_norm": 0.294921875, + "learning_rate": 3.653693176485609e-06, + "loss": 0.5835480213165283, + "mean_token_accuracy": 0.7936832685023546, + "num_tokens": 16811007.0, + "step": 3670 + }, + { + "entropy": 0.6954671564511955, + "epoch": 0.3470020391084499, + "grad_norm": 0.3359375, + "learning_rate": 3.6465039672993747e-06, + "loss": 0.5739445209503173, + "mean_token_accuracy": 0.8101118110120297, + "num_tokens": 16859417.0, + "step": 3680 + }, + { + "entropy": 0.5880941131850704, + "epoch": 0.34794497943211417, + "grad_norm": 0.41015625, + "learning_rate": 3.6393027318290393e-06, + "loss": 0.5243205070495606, + "mean_token_accuracy": 0.8368364397436381, + "num_tokens": 16905942.0, + "step": 3690 + }, + { + "entropy": 0.7491540067829192, + "epoch": 0.34888791975577843, + "grad_norm": 0.6015625, + "learning_rate": 3.6320895456121554e-06, + "loss": 0.6963620185852051, + "mean_token_accuracy": 0.7984883543103933, + "num_tokens": 16952505.0, + "step": 3700 + }, + { + "entropy": 0.6897736290469766, + "epoch": 0.3498308600794427, + "grad_norm": 0.7421875, + "learning_rate": 3.624864484311634e-06, + "loss": 0.7436827182769775, + "mean_token_accuracy": 0.8021753750741482, + "num_tokens": 16988497.0, + "step": 3710 + }, + { + "entropy": 0.7926816479302943, + "epoch": 0.35077380040310696, + "grad_norm": 0.50390625, + "learning_rate": 3.617627623714949e-06, + "loss": 0.5878771781921387, + "mean_token_accuracy": 0.8056975590065122, + "num_tokens": 17034282.0, + "step": 3720 + }, + { + "entropy": 0.7796463750302791, + "epoch": 0.3517167407267713, + "grad_norm": 0.333984375, + "learning_rate": 3.6103790397333434e-06, + "loss": 0.6098315238952636, + "mean_token_accuracy": 0.7889279814437031, + "num_tokens": 17079686.0, + "step": 3730 + }, + { + "entropy": 0.6948955420404672, + "epoch": 0.35265968105043555, + "grad_norm": 0.443359375, + "learning_rate": 3.6031188084010323e-06, + "loss": 0.5765831947326661, + "mean_token_accuracy": 0.809371105581522, + "num_tokens": 17130498.0, + "step": 3740 + }, + { + "entropy": 0.7758785348385573, + "epoch": 0.3536026213740998, + "grad_norm": 0.83203125, + "learning_rate": 3.5958470058744087e-06, + "loss": 0.7576163291931153, + "mean_token_accuracy": 0.783694538474083, + "num_tokens": 17172063.0, + "step": 3750 + }, + { + "entropy": 0.6243882402777672, + "epoch": 0.3545455616977641, + "grad_norm": 0.58984375, + "learning_rate": 3.5885637084312396e-06, + "loss": 0.5422124862670898, + "mean_token_accuracy": 0.8128781575709582, + "num_tokens": 17216580.0, + "step": 3760 + }, + { + "entropy": 0.8334074198268354, + "epoch": 0.35548850202142834, + "grad_norm": 0.74609375, + "learning_rate": 3.5812689924698683e-06, + "loss": 0.7805116653442383, + "mean_token_accuracy": 0.7612057582475245, + "num_tokens": 17259710.0, + "step": 3770 + }, + { + "entropy": 0.7605297128204256, + "epoch": 0.3564314423450926, + "grad_norm": 0.408203125, + "learning_rate": 3.5739629345084138e-06, + "loss": 0.6510057926177979, + "mean_token_accuracy": 0.7927152115851641, + "num_tokens": 17300431.0, + "step": 3780 + }, + { + "entropy": 0.652113667037338, + "epoch": 0.3573743826687569, + "grad_norm": 0.33984375, + "learning_rate": 3.5666456111839665e-06, + "loss": 0.5418231964111329, + "mean_token_accuracy": 0.8129661198705435, + "num_tokens": 17351269.0, + "step": 3790 + }, + { + "entropy": 0.6586431222967803, + "epoch": 0.35831732299242114, + "grad_norm": 0.57421875, + "learning_rate": 3.5593170992517863e-06, + "loss": 0.6081669807434082, + "mean_token_accuracy": 0.8147268489003181, + "num_tokens": 17391637.0, + "step": 3800 + }, + { + "entropy": 0.6838495754636824, + "epoch": 0.3592602633160854, + "grad_norm": 0.55859375, + "learning_rate": 3.5519774755844944e-06, + "loss": 0.6559165000915528, + "mean_token_accuracy": 0.8095557514578104, + "num_tokens": 17434461.0, + "step": 3810 + }, + { + "entropy": 0.6051603745669126, + "epoch": 0.36020320363974967, + "grad_norm": 0.50390625, + "learning_rate": 3.5446268171712706e-06, + "loss": 0.5790258884429932, + "mean_token_accuracy": 0.8305861912667751, + "num_tokens": 17478194.0, + "step": 3820 + }, + { + "entropy": 0.6348789224401117, + "epoch": 0.36114614396341393, + "grad_norm": 0.39453125, + "learning_rate": 3.5372652011170446e-06, + "loss": 0.5092689514160156, + "mean_token_accuracy": 0.8051383793354034, + "num_tokens": 17534987.0, + "step": 3830 + }, + { + "entropy": 0.6503554282244295, + "epoch": 0.3620890842870782, + "grad_norm": 0.76171875, + "learning_rate": 3.529892704641684e-06, + "loss": 0.5429260730743408, + "mean_token_accuracy": 0.8092528533190488, + "num_tokens": 17579200.0, + "step": 3840 + }, + { + "entropy": 0.7444478679448366, + "epoch": 0.36303202461074247, + "grad_norm": 0.72265625, + "learning_rate": 3.522509405079188e-06, + "loss": 0.7835160732269287, + "mean_token_accuracy": 0.7970532771199942, + "num_tokens": 17620157.0, + "step": 3850 + }, + { + "entropy": 0.6852880992926658, + "epoch": 0.36397496493440673, + "grad_norm": 0.474609375, + "learning_rate": 3.5151153798768765e-06, + "loss": 0.5196993827819825, + "mean_token_accuracy": 0.818078025430441, + "num_tokens": 17672607.0, + "step": 3860 + }, + { + "entropy": 0.6903492113575339, + "epoch": 0.364917905258071, + "grad_norm": 0.28515625, + "learning_rate": 3.5077107065945743e-06, + "loss": 0.5674126625061036, + "mean_token_accuracy": 0.8169661879539489, + "num_tokens": 17718690.0, + "step": 3870 + }, + { + "entropy": 0.7269641313701868, + "epoch": 0.36586084558173526, + "grad_norm": 0.40234375, + "learning_rate": 3.5002954629038007e-06, + "loss": 0.5830210208892822, + "mean_token_accuracy": 0.8018156543374062, + "num_tokens": 17760388.0, + "step": 3880 + }, + { + "entropy": 0.7480830346234143, + "epoch": 0.3668037859053995, + "grad_norm": 0.392578125, + "learning_rate": 3.4928697265869516e-06, + "loss": 0.5468933582305908, + "mean_token_accuracy": 0.800993998721242, + "num_tokens": 17810259.0, + "step": 3890 + }, + { + "entropy": 0.6070564269088209, + "epoch": 0.3677467262290638, + "grad_norm": 0.38671875, + "learning_rate": 3.48543357553649e-06, + "loss": 0.5181046009063721, + "mean_token_accuracy": 0.8317337445914745, + "num_tokens": 17858820.0, + "step": 3900 + }, + { + "entropy": 0.8158755677752196, + "epoch": 0.36868966655272806, + "grad_norm": 0.3828125, + "learning_rate": 3.4779870877541188e-06, + "loss": 0.6114593029022217, + "mean_token_accuracy": 0.7713057190179825, + "num_tokens": 17902522.0, + "step": 3910 + }, + { + "entropy": 0.6110333253629505, + "epoch": 0.3696326068763923, + "grad_norm": 0.322265625, + "learning_rate": 3.4705303413499736e-06, + "loss": 0.5357798099517822, + "mean_token_accuracy": 0.8168054174631834, + "num_tokens": 17949303.0, + "step": 3920 + }, + { + "entropy": 0.6398234066087752, + "epoch": 0.3705755472000566, + "grad_norm": 0.76171875, + "learning_rate": 3.4630634145417944e-06, + "loss": 0.6564537048339844, + "mean_token_accuracy": 0.8288793444633484, + "num_tokens": 17993395.0, + "step": 3930 + }, + { + "entropy": 0.6848932018503546, + "epoch": 0.37151848752372085, + "grad_norm": 0.5390625, + "learning_rate": 3.4555863856541107e-06, + "loss": 0.740598487854004, + "mean_token_accuracy": 0.7940419346094132, + "num_tokens": 18041610.0, + "step": 3940 + }, + { + "entropy": 0.647498956695199, + "epoch": 0.3724614278473851, + "grad_norm": 0.484375, + "learning_rate": 3.4480993331174166e-06, + "loss": 0.6062899112701416, + "mean_token_accuracy": 0.8174811258912087, + "num_tokens": 18092998.0, + "step": 3950 + }, + { + "entropy": 0.694026449136436, + "epoch": 0.3734043681710494, + "grad_norm": 0.26171875, + "learning_rate": 3.440602335467351e-06, + "loss": 0.5536818504333496, + "mean_token_accuracy": 0.7983353350311517, + "num_tokens": 18134601.0, + "step": 3960 + }, + { + "entropy": 0.6323764859698713, + "epoch": 0.37434730849471365, + "grad_norm": 0.419921875, + "learning_rate": 3.433095471343872e-06, + "loss": 0.658245325088501, + "mean_token_accuracy": 0.8151856455951929, + "num_tokens": 18178003.0, + "step": 3970 + }, + { + "entropy": 0.8302557891234755, + "epoch": 0.3752902488183779, + "grad_norm": 0.419921875, + "learning_rate": 3.425578819490431e-06, + "loss": 0.7398871898651123, + "mean_token_accuracy": 0.7722434610128402, + "num_tokens": 18221880.0, + "step": 3980 + }, + { + "entropy": 0.661791059281677, + "epoch": 0.3762331891420422, + "grad_norm": 0.443359375, + "learning_rate": 3.4180524587531504e-06, + "loss": 0.48392953872680666, + "mean_token_accuracy": 0.8174215763807297, + "num_tokens": 18265321.0, + "step": 3990 + }, + { + "entropy": 0.675689808651805, + "epoch": 0.37717612946570644, + "grad_norm": 0.48828125, + "learning_rate": 3.4105164680799928e-06, + "loss": 0.5103531837463379, + "mean_token_accuracy": 0.8037473402917386, + "num_tokens": 18306707.0, + "step": 4000 + }, + { + "entropy": 0.8221991116646677, + "epoch": 0.3781190697893707, + "grad_norm": 0.271484375, + "learning_rate": 3.402970926519934e-06, + "loss": 0.618397331237793, + "mean_token_accuracy": 0.7826770418323576, + "num_tokens": 18346281.0, + "step": 4010 + }, + { + "entropy": 0.7318005957640707, + "epoch": 0.379062010113035, + "grad_norm": 0.271484375, + "learning_rate": 3.395415913222134e-06, + "loss": 0.7626585960388184, + "mean_token_accuracy": 0.7984059415757656, + "num_tokens": 18389995.0, + "step": 4020 + }, + { + "entropy": 0.8118009151890874, + "epoch": 0.38000495043669924, + "grad_norm": 0.62109375, + "learning_rate": 3.3878515074351087e-06, + "loss": 0.7354348182678223, + "mean_token_accuracy": 0.7721582528203725, + "num_tokens": 18434935.0, + "step": 4030 + }, + { + "entropy": 0.8204971087165177, + "epoch": 0.3809478907603635, + "grad_norm": 0.57421875, + "learning_rate": 3.3802777885058933e-06, + "loss": 0.5647460460662842, + "mean_token_accuracy": 0.7732091106474399, + "num_tokens": 18482777.0, + "step": 4040 + }, + { + "entropy": 0.6955384029075503, + "epoch": 0.38189083108402777, + "grad_norm": 0.4921875, + "learning_rate": 3.3726948358792176e-06, + "loss": 0.6320321083068847, + "mean_token_accuracy": 0.8126376781612634, + "num_tokens": 18530249.0, + "step": 4050 + }, + { + "entropy": 0.7113258785568177, + "epoch": 0.38283377140769204, + "grad_norm": 0.46484375, + "learning_rate": 3.3651027290966653e-06, + "loss": 0.5650223731994629, + "mean_token_accuracy": 0.8019524831324816, + "num_tokens": 18577504.0, + "step": 4060 + }, + { + "entropy": 0.6824137067887932, + "epoch": 0.3837767117313563, + "grad_norm": 1.2734375, + "learning_rate": 3.3575015477958445e-06, + "loss": 0.6059187412261963, + "mean_token_accuracy": 0.7883812438696622, + "num_tokens": 18619468.0, + "step": 4070 + }, + { + "entropy": 0.7901984248310328, + "epoch": 0.38471965205502057, + "grad_norm": 0.408203125, + "learning_rate": 3.34989137170955e-06, + "loss": 0.5455976486206054, + "mean_token_accuracy": 0.784822690486908, + "num_tokens": 18667000.0, + "step": 4080 + }, + { + "entropy": 0.718475041934289, + "epoch": 0.38566259237868483, + "grad_norm": 0.31640625, + "learning_rate": 3.3422722806649276e-06, + "loss": 0.5682651042938233, + "mean_token_accuracy": 0.8000302887521684, + "num_tokens": 18710396.0, + "step": 4090 + }, + { + "entropy": 0.6617384196259082, + "epoch": 0.3866055327023491, + "grad_norm": 0.35546875, + "learning_rate": 3.334644354582638e-06, + "loss": 0.5210241794586181, + "mean_token_accuracy": 0.8172427896410227, + "num_tokens": 18758405.0, + "step": 4100 + }, + { + "entropy": 0.7391965406015515, + "epoch": 0.38754847302601336, + "grad_norm": 0.64453125, + "learning_rate": 3.327007673476015e-06, + "loss": 0.6083121299743652, + "mean_token_accuracy": 0.7892594009637832, + "num_tokens": 18803120.0, + "step": 4110 + }, + { + "entropy": 0.6573400060646236, + "epoch": 0.38849141334967763, + "grad_norm": 0.72265625, + "learning_rate": 3.319362317450231e-06, + "loss": 0.5357893466949463, + "mean_token_accuracy": 0.8097851235419512, + "num_tokens": 18846147.0, + "step": 4120 + }, + { + "entropy": 0.7643828511238098, + "epoch": 0.3894343536733419, + "grad_norm": 0.75390625, + "learning_rate": 3.3117083667014518e-06, + "loss": 0.6513972759246827, + "mean_token_accuracy": 0.8002022080123424, + "num_tokens": 18888996.0, + "step": 4130 + }, + { + "entropy": 0.6743721715174615, + "epoch": 0.39037729399700616, + "grad_norm": 0.61328125, + "learning_rate": 3.304045901516e-06, + "loss": 0.5173910617828369, + "mean_token_accuracy": 0.8222727868705988, + "num_tokens": 18933492.0, + "step": 4140 + }, + { + "entropy": 0.6496790492208675, + "epoch": 0.3913202343206704, + "grad_norm": 0.474609375, + "learning_rate": 3.2963750022695094e-06, + "loss": 0.5311402320861817, + "mean_token_accuracy": 0.8124469438567757, + "num_tokens": 18980265.0, + "step": 4150 + }, + { + "entropy": 0.7410643206909299, + "epoch": 0.3922631746443347, + "grad_norm": 0.3671875, + "learning_rate": 3.288695749426084e-06, + "loss": 0.5552346229553222, + "mean_token_accuracy": 0.8150686305016279, + "num_tokens": 19034421.0, + "step": 4160 + }, + { + "entropy": 0.7548421092098578, + "epoch": 0.39320611496799895, + "grad_norm": 0.490234375, + "learning_rate": 3.2810082235374508e-06, + "loss": 0.7359838485717773, + "mean_token_accuracy": 0.8010040692985058, + "num_tokens": 19084813.0, + "step": 4170 + }, + { + "entropy": 0.5428073874674737, + "epoch": 0.3941490552916632, + "grad_norm": 0.318359375, + "learning_rate": 3.2733125052421193e-06, + "loss": 0.46096482276916506, + "mean_token_accuracy": 0.8404661461710929, + "num_tokens": 19131677.0, + "step": 4180 + }, + { + "entropy": 0.6938783401623368, + "epoch": 0.3950919956153275, + "grad_norm": 0.54296875, + "learning_rate": 3.2656086752645334e-06, + "loss": 0.6413106441497802, + "mean_token_accuracy": 0.804457500204444, + "num_tokens": 19175289.0, + "step": 4190 + }, + { + "entropy": 0.7383185734972357, + "epoch": 0.39603493593899175, + "grad_norm": 0.625, + "learning_rate": 3.257896814414223e-06, + "loss": 0.599180793762207, + "mean_token_accuracy": 0.7934302197769284, + "num_tokens": 19226110.0, + "step": 4200 + }, + { + "entropy": 0.6432693097740412, + "epoch": 0.396977876262656, + "grad_norm": 0.63671875, + "learning_rate": 3.2501770035849605e-06, + "loss": 0.5177838802337646, + "mean_token_accuracy": 0.8194103617221117, + "num_tokens": 19273450.0, + "step": 4210 + }, + { + "entropy": 0.6650319148786366, + "epoch": 0.3979208165863203, + "grad_norm": 0.43359375, + "learning_rate": 3.242449323753908e-06, + "loss": 0.5644178867340088, + "mean_token_accuracy": 0.8194221030920744, + "num_tokens": 19313801.0, + "step": 4220 + }, + { + "entropy": 0.7258335336111486, + "epoch": 0.39886375690998455, + "grad_norm": 0.392578125, + "learning_rate": 3.2347138559807702e-06, + "loss": 0.7438495635986329, + "mean_token_accuracy": 0.8006484184414149, + "num_tokens": 19364314.0, + "step": 4230 + }, + { + "entropy": 0.6766277103684842, + "epoch": 0.3998066972336488, + "grad_norm": 0.50390625, + "learning_rate": 3.226970681406944e-06, + "loss": 0.6204345703125, + "mean_token_accuracy": 0.7923669695854187, + "num_tokens": 19408153.0, + "step": 4240 + }, + { + "entropy": 0.7198492975905537, + "epoch": 0.4007496375573131, + "grad_norm": 0.439453125, + "learning_rate": 3.219219881254666e-06, + "loss": 0.6644938945770263, + "mean_token_accuracy": 0.7969273280352354, + "num_tokens": 19451626.0, + "step": 4250 + }, + { + "entropy": 0.843270109500736, + "epoch": 0.40169257788097734, + "grad_norm": 0.474609375, + "learning_rate": 3.2114615368261624e-06, + "loss": 0.7886375427246094, + "mean_token_accuracy": 0.7667363656684756, + "num_tokens": 19500931.0, + "step": 4260 + }, + { + "entropy": 0.7085121444426477, + "epoch": 0.4026355182046416, + "grad_norm": 0.90234375, + "learning_rate": 3.2036957295027958e-06, + "loss": 0.6949386119842529, + "mean_token_accuracy": 0.7916569627821446, + "num_tokens": 19549938.0, + "step": 4270 + }, + { + "entropy": 0.6853237067349255, + "epoch": 0.4035784585283059, + "grad_norm": 0.75390625, + "learning_rate": 3.1959225407442097e-06, + "loss": 0.6178842544555664, + "mean_token_accuracy": 0.8125127829611302, + "num_tokens": 19599634.0, + "step": 4280 + }, + { + "entropy": 0.6578317375853657, + "epoch": 0.40452139885197014, + "grad_norm": 0.58984375, + "learning_rate": 3.188142052087476e-06, + "loss": 0.6399495601654053, + "mean_token_accuracy": 0.8123631715774536, + "num_tokens": 19645911.0, + "step": 4290 + }, + { + "entropy": 0.678624777495861, + "epoch": 0.4054643391756344, + "grad_norm": 0.353515625, + "learning_rate": 3.1803543451462393e-06, + "loss": 0.6367847919464111, + "mean_token_accuracy": 0.8035919483751058, + "num_tokens": 19688704.0, + "step": 4300 + }, + { + "entropy": 0.5864495939575136, + "epoch": 0.40640727949929867, + "grad_norm": 0.28125, + "learning_rate": 3.17255950160986e-06, + "loss": 0.506658411026001, + "mean_token_accuracy": 0.825262775272131, + "num_tokens": 19730777.0, + "step": 4310 + }, + { + "entropy": 0.7443196853622794, + "epoch": 0.40735021982296293, + "grad_norm": 0.48828125, + "learning_rate": 3.164757603242559e-06, + "loss": 0.54283447265625, + "mean_token_accuracy": 0.7956912875175476, + "num_tokens": 19776535.0, + "step": 4320 + }, + { + "entropy": 0.7234893916174769, + "epoch": 0.4082931601466272, + "grad_norm": 0.458984375, + "learning_rate": 3.1569487318825576e-06, + "loss": 0.6039177894592285, + "mean_token_accuracy": 0.8105068215169012, + "num_tokens": 19819712.0, + "step": 4330 + }, + { + "entropy": 0.7695184142328799, + "epoch": 0.40923610047029146, + "grad_norm": 0.6484375, + "learning_rate": 3.1491329694412217e-06, + "loss": 0.6124618530273438, + "mean_token_accuracy": 0.7952944649383425, + "num_tokens": 19870603.0, + "step": 4340 + }, + { + "entropy": 0.80782908834517, + "epoch": 0.41017904079395573, + "grad_norm": 0.427734375, + "learning_rate": 3.1413103979021996e-06, + "loss": 0.7708604812622071, + "mean_token_accuracy": 0.7625693265348673, + "num_tokens": 19912895.0, + "step": 4350 + }, + { + "entropy": 0.8120630858466029, + "epoch": 0.41112198111762, + "grad_norm": 0.671875, + "learning_rate": 3.133481099320567e-06, + "loss": 0.8301298141479492, + "mean_token_accuracy": 0.7721738774329424, + "num_tokens": 19955841.0, + "step": 4360 + }, + { + "entropy": 0.6812439509667456, + "epoch": 0.41206492144128426, + "grad_norm": 0.79296875, + "learning_rate": 3.1256451558219614e-06, + "loss": 0.6116904258728028, + "mean_token_accuracy": 0.8017740860581398, + "num_tokens": 20005277.0, + "step": 4370 + }, + { + "entropy": 0.650224775960669, + "epoch": 0.4130078617649485, + "grad_norm": 0.349609375, + "learning_rate": 3.1178026496017206e-06, + "loss": 0.591245460510254, + "mean_token_accuracy": 0.8192921217530966, + "num_tokens": 20052094.0, + "step": 4380 + }, + { + "entropy": 0.6650533619336784, + "epoch": 0.4139508020886128, + "grad_norm": 0.310546875, + "learning_rate": 3.109953662924025e-06, + "loss": 0.6183666229248047, + "mean_token_accuracy": 0.8229886900633574, + "num_tokens": 20096509.0, + "step": 4390 + }, + { + "entropy": 0.7457806673366576, + "epoch": 0.41489374241227706, + "grad_norm": 0.453125, + "learning_rate": 3.1020982781210306e-06, + "loss": 0.5394028663635254, + "mean_token_accuracy": 0.797967865690589, + "num_tokens": 20146777.0, + "step": 4400 + }, + { + "entropy": 0.6870288801379502, + "epoch": 0.4158366827359414, + "grad_norm": 0.54296875, + "learning_rate": 3.0942365775920057e-06, + "loss": 0.5307192802429199, + "mean_token_accuracy": 0.8131231028586626, + "num_tokens": 20187659.0, + "step": 4410 + }, + { + "entropy": 0.7553388600237667, + "epoch": 0.41677962305960564, + "grad_norm": 0.65234375, + "learning_rate": 3.086368643802471e-06, + "loss": 0.655640697479248, + "mean_token_accuracy": 0.789563775807619, + "num_tokens": 20231537.0, + "step": 4420 + }, + { + "entropy": 0.7162960932124406, + "epoch": 0.4177225633832699, + "grad_norm": 0.390625, + "learning_rate": 3.078494559283327e-06, + "loss": 0.5714639186859131, + "mean_token_accuracy": 0.8139267075806856, + "num_tokens": 20275124.0, + "step": 4430 + }, + { + "entropy": 0.638027570489794, + "epoch": 0.4186655037069342, + "grad_norm": 0.6796875, + "learning_rate": 3.070614406629995e-06, + "loss": 0.5676782608032227, + "mean_token_accuracy": 0.8156324338167906, + "num_tokens": 20321807.0, + "step": 4440 + }, + { + "entropy": 0.7704670215025544, + "epoch": 0.41960844403059844, + "grad_norm": 0.796875, + "learning_rate": 3.0627282685015477e-06, + "loss": 0.5788619518280029, + "mean_token_accuracy": 0.8035795167088509, + "num_tokens": 20364595.0, + "step": 4450 + }, + { + "entropy": 0.8218068578746169, + "epoch": 0.4205513843542627, + "grad_norm": 0.796875, + "learning_rate": 3.054836227619842e-06, + "loss": 0.5779088020324707, + "mean_token_accuracy": 0.7815472435206174, + "num_tokens": 20410612.0, + "step": 4460 + }, + { + "entropy": 0.5942241735756397, + "epoch": 0.42149432467792697, + "grad_norm": 0.59765625, + "learning_rate": 3.0469383667686532e-06, + "loss": 0.47473464012145994, + "mean_token_accuracy": 0.8354270774871111, + "num_tokens": 20454032.0, + "step": 4470 + }, + { + "entropy": 0.5301405775360764, + "epoch": 0.42243726500159123, + "grad_norm": 0.44140625, + "learning_rate": 3.039034768792803e-06, + "loss": 0.44197745323181153, + "mean_token_accuracy": 0.8487105399370194, + "num_tokens": 20496123.0, + "step": 4480 + }, + { + "entropy": 0.7075543572660535, + "epoch": 0.4233802053252555, + "grad_norm": 0.294921875, + "learning_rate": 3.0311255165972953e-06, + "loss": 0.5451488494873047, + "mean_token_accuracy": 0.8073224203661085, + "num_tokens": 20539415.0, + "step": 4490 + }, + { + "entropy": 0.6837927075102925, + "epoch": 0.42432314564891976, + "grad_norm": 0.4375, + "learning_rate": 3.0232106931464434e-06, + "loss": 0.6114567279815674, + "mean_token_accuracy": 0.8121942866593599, + "num_tokens": 20584443.0, + "step": 4500 + }, + { + "entropy": 0.6196409862488508, + "epoch": 0.42526608597258403, + "grad_norm": 0.6015625, + "learning_rate": 3.015290381462998e-06, + "loss": 0.6821407794952392, + "mean_token_accuracy": 0.8301993541419506, + "num_tokens": 20630900.0, + "step": 4510 + }, + { + "entropy": 0.7151961518451572, + "epoch": 0.4262090262962483, + "grad_norm": 0.4921875, + "learning_rate": 3.0073646646272837e-06, + "loss": 0.614381217956543, + "mean_token_accuracy": 0.8130818229168654, + "num_tokens": 20673932.0, + "step": 4520 + }, + { + "entropy": 0.6770127274096012, + "epoch": 0.42715196661991256, + "grad_norm": 0.4375, + "learning_rate": 2.9994336257763175e-06, + "loss": 0.54631028175354, + "mean_token_accuracy": 0.8104281619191169, + "num_tokens": 20720772.0, + "step": 4530 + }, + { + "entropy": 0.6979648591019213, + "epoch": 0.4280949069435768, + "grad_norm": 0.74609375, + "learning_rate": 2.991497348102945e-06, + "loss": 0.6474967956542969, + "mean_token_accuracy": 0.7961675971746445, + "num_tokens": 20766481.0, + "step": 4540 + }, + { + "entropy": 0.623636071383953, + "epoch": 0.4290378472672411, + "grad_norm": 0.296875, + "learning_rate": 2.9835559148549638e-06, + "loss": 0.6137451648712158, + "mean_token_accuracy": 0.8198790092021226, + "num_tokens": 20805502.0, + "step": 4550 + }, + { + "entropy": 0.5448908562771976, + "epoch": 0.42998078759090536, + "grad_norm": 0.83203125, + "learning_rate": 2.97560940933425e-06, + "loss": 0.49565706253051756, + "mean_token_accuracy": 0.848630927503109, + "num_tokens": 20847160.0, + "step": 4560 + }, + { + "entropy": 0.7783894378691911, + "epoch": 0.4309237279145696, + "grad_norm": 0.35546875, + "learning_rate": 2.967657914895887e-06, + "loss": 0.77616868019104, + "mean_token_accuracy": 0.7921557927504181, + "num_tokens": 20894790.0, + "step": 4570 + }, + { + "entropy": 0.7091885100118815, + "epoch": 0.4318666682382339, + "grad_norm": 0.3828125, + "learning_rate": 2.9597015149472878e-06, + "loss": 0.633561372756958, + "mean_token_accuracy": 0.8060255534946918, + "num_tokens": 20941007.0, + "step": 4580 + }, + { + "entropy": 0.6587966305203736, + "epoch": 0.43280960856189815, + "grad_norm": 0.2470703125, + "learning_rate": 2.9517402929473243e-06, + "loss": 0.6381916522979736, + "mean_token_accuracy": 0.830630149319768, + "num_tokens": 20992763.0, + "step": 4590 + }, + { + "entropy": 0.7116721348837018, + "epoch": 0.4337525488855624, + "grad_norm": 0.46875, + "learning_rate": 2.943774332405448e-06, + "loss": 0.6077177047729492, + "mean_token_accuracy": 0.7988573126494884, + "num_tokens": 21038753.0, + "step": 4600 + }, + { + "entropy": 0.7426122948527336, + "epoch": 0.4346954892092267, + "grad_norm": 0.376953125, + "learning_rate": 2.935803716880815e-06, + "loss": 0.6154319763183593, + "mean_token_accuracy": 0.8028998583555221, + "num_tokens": 21082452.0, + "step": 4610 + }, + { + "entropy": 0.7233793533407151, + "epoch": 0.43563842953289095, + "grad_norm": 0.5546875, + "learning_rate": 2.927828529981411e-06, + "loss": 0.584602165222168, + "mean_token_accuracy": 0.7928648635745048, + "num_tokens": 21128139.0, + "step": 4620 + }, + { + "entropy": 0.7569336066953838, + "epoch": 0.4365813698565552, + "grad_norm": 0.1953125, + "learning_rate": 2.919848855363172e-06, + "loss": 0.4981938362121582, + "mean_token_accuracy": 0.8080588222481311, + "num_tokens": 21175953.0, + "step": 4630 + }, + { + "entropy": 0.6948595408350229, + "epoch": 0.4375243101802195, + "grad_norm": 1.3359375, + "learning_rate": 2.9118647767291096e-06, + "loss": 0.7068987846374511, + "mean_token_accuracy": 0.8049037493765354, + "num_tokens": 21228357.0, + "step": 4640 + }, + { + "entropy": 0.749409731477499, + "epoch": 0.43846725050388374, + "grad_norm": 0.5078125, + "learning_rate": 2.903876377828431e-06, + "loss": 0.5781918525695801, + "mean_token_accuracy": 0.7907330963760615, + "num_tokens": 21282711.0, + "step": 4650 + }, + { + "entropy": 0.7640089130960405, + "epoch": 0.439410190827548, + "grad_norm": 0.55859375, + "learning_rate": 2.8958837424556586e-06, + "loss": 0.6110117435455322, + "mean_token_accuracy": 0.8006194703280926, + "num_tokens": 21322979.0, + "step": 4660 + }, + { + "entropy": 0.6390418185852468, + "epoch": 0.4403531311512123, + "grad_norm": 0.458984375, + "learning_rate": 2.8878869544497574e-06, + "loss": 0.594711446762085, + "mean_token_accuracy": 0.8070811614394188, + "num_tokens": 21367310.0, + "step": 4670 + }, + { + "entropy": 0.80012998431921, + "epoch": 0.44129607147487654, + "grad_norm": 0.62109375, + "learning_rate": 2.879886097693249e-06, + "loss": 0.7834507465362549, + "mean_token_accuracy": 0.77053287550807, + "num_tokens": 21409253.0, + "step": 4680 + }, + { + "entropy": 0.7294010010547936, + "epoch": 0.4422390117985408, + "grad_norm": 0.69921875, + "learning_rate": 2.871881256111335e-06, + "loss": 0.701657485961914, + "mean_token_accuracy": 0.7879527509212494, + "num_tokens": 21453671.0, + "step": 4690 + }, + { + "entropy": 0.6360360025428236, + "epoch": 0.44318195212220507, + "grad_norm": 0.39453125, + "learning_rate": 2.8638725136710156e-06, + "loss": 0.5755587100982666, + "mean_token_accuracy": 0.8209034506231546, + "num_tokens": 21507926.0, + "step": 4700 + }, + { + "entropy": 0.7269893609918654, + "epoch": 0.44412489244586933, + "grad_norm": 0.376953125, + "learning_rate": 2.855859954380209e-06, + "loss": 0.7129250049591065, + "mean_token_accuracy": 0.8010267514735461, + "num_tokens": 21551045.0, + "step": 4710 + }, + { + "entropy": 0.6108814541250467, + "epoch": 0.4450678327695336, + "grad_norm": 0.455078125, + "learning_rate": 2.8478436622868704e-06, + "loss": 0.5731475353240967, + "mean_token_accuracy": 0.8247819773852825, + "num_tokens": 21598339.0, + "step": 4720 + }, + { + "entropy": 0.7286485302262008, + "epoch": 0.44601077309319787, + "grad_norm": 0.578125, + "learning_rate": 2.8398237214781123e-06, + "loss": 0.5923725128173828, + "mean_token_accuracy": 0.7957899816334247, + "num_tokens": 21644913.0, + "step": 4730 + }, + { + "entropy": 0.8006156609393656, + "epoch": 0.44695371341686213, + "grad_norm": 0.5, + "learning_rate": 2.8318002160793175e-06, + "loss": 0.5867124557495117, + "mean_token_accuracy": 0.7782018858939409, + "num_tokens": 21691472.0, + "step": 4740 + }, + { + "entropy": 0.731638565286994, + "epoch": 0.4478966537405264, + "grad_norm": 0.30859375, + "learning_rate": 2.82377323025326e-06, + "loss": 0.7104349613189698, + "mean_token_accuracy": 0.800374174490571, + "num_tokens": 21738146.0, + "step": 4750 + }, + { + "entropy": 0.6022297551855444, + "epoch": 0.44883959406419066, + "grad_norm": 0.6015625, + "learning_rate": 2.815742848199225e-06, + "loss": 0.6393797397613525, + "mean_token_accuracy": 0.8331300269812345, + "num_tokens": 21781574.0, + "step": 4760 + }, + { + "entropy": 0.6964669045060873, + "epoch": 0.4497825343878549, + "grad_norm": 0.640625, + "learning_rate": 2.8077091541521197e-06, + "loss": 0.8155632019042969, + "mean_token_accuracy": 0.799362026527524, + "num_tokens": 21821499.0, + "step": 4770 + }, + { + "entropy": 0.8252560695633292, + "epoch": 0.4507254747115192, + "grad_norm": 0.53515625, + "learning_rate": 2.7996722323815923e-06, + "loss": 0.6062126636505127, + "mean_token_accuracy": 0.7833932403475046, + "num_tokens": 21867325.0, + "step": 4780 + }, + { + "entropy": 0.7341827435418964, + "epoch": 0.45166841503518346, + "grad_norm": 0.5390625, + "learning_rate": 2.79163216719115e-06, + "loss": 0.6348656177520752, + "mean_token_accuracy": 0.7946558525785804, + "num_tokens": 21909555.0, + "step": 4790 + }, + { + "entropy": 0.7667273837141693, + "epoch": 0.4526113553588477, + "grad_norm": 0.267578125, + "learning_rate": 2.7835890429172712e-06, + "loss": 0.6177640914916992, + "mean_token_accuracy": 0.8011632848531007, + "num_tokens": 21958171.0, + "step": 4800 + }, + { + "entropy": 0.6290356336161494, + "epoch": 0.453554295682512, + "grad_norm": 0.318359375, + "learning_rate": 2.7755429439285243e-06, + "loss": 0.6255978584289551, + "mean_token_accuracy": 0.8260467633605003, + "num_tokens": 22008006.0, + "step": 4810 + }, + { + "entropy": 0.7753217613324523, + "epoch": 0.45449723600617625, + "grad_norm": 0.310546875, + "learning_rate": 2.767493954624681e-06, + "loss": 0.6561094760894776, + "mean_token_accuracy": 0.785815117880702, + "num_tokens": 22049411.0, + "step": 4820 + }, + { + "entropy": 0.6085925869643688, + "epoch": 0.4554401763298405, + "grad_norm": 0.34375, + "learning_rate": 2.759442159435829e-06, + "loss": 0.555381441116333, + "mean_token_accuracy": 0.8140901662409306, + "num_tokens": 22095072.0, + "step": 4830 + }, + { + "entropy": 0.7590108618140221, + "epoch": 0.4563831166535048, + "grad_norm": 0.25, + "learning_rate": 2.751387642821491e-06, + "loss": 0.6291932582855224, + "mean_token_accuracy": 0.7985693622380495, + "num_tokens": 22139728.0, + "step": 4840 + }, + { + "entropy": 0.6212056964635849, + "epoch": 0.45732605697716905, + "grad_norm": 0.33984375, + "learning_rate": 2.743330489269734e-06, + "loss": 0.5828049182891846, + "mean_token_accuracy": 0.817613198235631, + "num_tokens": 22185360.0, + "step": 4850 + }, + { + "entropy": 0.6736974530853331, + "epoch": 0.4582689973008333, + "grad_norm": 0.66015625, + "learning_rate": 2.7352707832962865e-06, + "loss": 0.5845682144165039, + "mean_token_accuracy": 0.8124393951147795, + "num_tokens": 22229210.0, + "step": 4860 + }, + { + "entropy": 0.712392061483115, + "epoch": 0.4592119376244976, + "grad_norm": 0.703125, + "learning_rate": 2.72720860944365e-06, + "loss": 0.6037466526031494, + "mean_token_accuracy": 0.797969845123589, + "num_tokens": 22273412.0, + "step": 4870 + }, + { + "entropy": 0.6442144404165446, + "epoch": 0.46015487794816184, + "grad_norm": 0.279296875, + "learning_rate": 2.7191440522802142e-06, + "loss": 0.5164260864257812, + "mean_token_accuracy": 0.819934631511569, + "num_tokens": 22324588.0, + "step": 4880 + }, + { + "entropy": 0.5705735078081489, + "epoch": 0.4610978182718261, + "grad_norm": 0.361328125, + "learning_rate": 2.7110771963993676e-06, + "loss": 0.5488987922668457, + "mean_token_accuracy": 0.8361519493162632, + "num_tokens": 22372642.0, + "step": 4890 + }, + { + "entropy": 0.642943031527102, + "epoch": 0.4620407585954904, + "grad_norm": 0.52734375, + "learning_rate": 2.70300812641861e-06, + "loss": 0.6016288280487061, + "mean_token_accuracy": 0.8095859756693244, + "num_tokens": 22423297.0, + "step": 4900 + }, + { + "entropy": 0.7380821701139212, + "epoch": 0.46298369891915464, + "grad_norm": 1.3515625, + "learning_rate": 2.694936926978668e-06, + "loss": 0.6568095207214355, + "mean_token_accuracy": 0.7910981852561235, + "num_tokens": 22460407.0, + "step": 4910 + }, + { + "entropy": 0.6616219971328974, + "epoch": 0.4639266392428189, + "grad_norm": 1.25, + "learning_rate": 2.6868636827426055e-06, + "loss": 0.6499626159667968, + "mean_token_accuracy": 0.8095650464296341, + "num_tokens": 22507306.0, + "step": 4920 + }, + { + "entropy": 0.6243038043379784, + "epoch": 0.46486957956648317, + "grad_norm": 0.419921875, + "learning_rate": 2.6787884783949325e-06, + "loss": 0.4949214458465576, + "mean_token_accuracy": 0.812331048771739, + "num_tokens": 22550929.0, + "step": 4930 + }, + { + "entropy": 0.7329422317445278, + "epoch": 0.46581251989014744, + "grad_norm": 0.45703125, + "learning_rate": 2.670711398640723e-06, + "loss": 0.731619119644165, + "mean_token_accuracy": 0.7989665359258652, + "num_tokens": 22595301.0, + "step": 4940 + }, + { + "entropy": 0.5789965157397091, + "epoch": 0.4667554602138117, + "grad_norm": 0.265625, + "learning_rate": 2.662632528204721e-06, + "loss": 0.5827124118804932, + "mean_token_accuracy": 0.8362434811890125, + "num_tokens": 22650881.0, + "step": 4950 + }, + { + "entropy": 0.6578682715538889, + "epoch": 0.46769840053747597, + "grad_norm": 0.3984375, + "learning_rate": 2.6545519518304542e-06, + "loss": 0.49361634254455566, + "mean_token_accuracy": 0.8121582861989737, + "num_tokens": 22702979.0, + "step": 4960 + }, + { + "entropy": 0.825195993669331, + "epoch": 0.46864134086114023, + "grad_norm": 0.396484375, + "learning_rate": 2.646469754279345e-06, + "loss": 0.6855580806732178, + "mean_token_accuracy": 0.7875312244519591, + "num_tokens": 22739946.0, + "step": 4970 + }, + { + "entropy": 0.7191408189013601, + "epoch": 0.4695842811848045, + "grad_norm": 0.71875, + "learning_rate": 2.6383860203298225e-06, + "loss": 0.5945919990539551, + "mean_token_accuracy": 0.7952681098133325, + "num_tokens": 22786614.0, + "step": 4980 + }, + { + "entropy": 0.7237249138765037, + "epoch": 0.47052722150846876, + "grad_norm": 0.404296875, + "learning_rate": 2.6303008347764297e-06, + "loss": 0.5328628063201905, + "mean_token_accuracy": 0.8129015320912003, + "num_tokens": 22836470.0, + "step": 4990 + }, + { + "entropy": 0.636794293904677, + "epoch": 0.47147016183213303, + "grad_norm": 0.328125, + "learning_rate": 2.622214282428937e-06, + "loss": 0.594303560256958, + "mean_token_accuracy": 0.8139680068939924, + "num_tokens": 22877578.0, + "step": 5000 + }, + { + "entropy": 0.6889806432649493, + "epoch": 0.4724131021557973, + "grad_norm": 0.86328125, + "learning_rate": 2.614126448111453e-06, + "loss": 0.4839592456817627, + "mean_token_accuracy": 0.8087041890248656, + "num_tokens": 22920003.0, + "step": 5010 + }, + { + "entropy": 0.8315211714245379, + "epoch": 0.47335604247946156, + "grad_norm": 0.60546875, + "learning_rate": 2.606037416661531e-06, + "loss": 0.6565670490264892, + "mean_token_accuracy": 0.7755562437698245, + "num_tokens": 22968717.0, + "step": 5020 + }, + { + "entropy": 0.6515540423803031, + "epoch": 0.4742989828031258, + "grad_norm": 0.734375, + "learning_rate": 2.5979472729292855e-06, + "loss": 0.544868278503418, + "mean_token_accuracy": 0.819118132814765, + "num_tokens": 23010837.0, + "step": 5030 + }, + { + "entropy": 0.6562650393694639, + "epoch": 0.4752419231267901, + "grad_norm": 0.412109375, + "learning_rate": 2.589856101776494e-06, + "loss": 0.6573739051818848, + "mean_token_accuracy": 0.8055673878639936, + "num_tokens": 23056198.0, + "step": 5040 + }, + { + "entropy": 0.6976808074861764, + "epoch": 0.47618486345045435, + "grad_norm": 0.6328125, + "learning_rate": 2.581763988075714e-06, + "loss": 0.5908962249755859, + "mean_token_accuracy": 0.8016349047422409, + "num_tokens": 23105822.0, + "step": 5050 + }, + { + "entropy": 0.6807854567654431, + "epoch": 0.4771278037741186, + "grad_norm": 0.40625, + "learning_rate": 2.573671016709389e-06, + "loss": 0.6641458034515381, + "mean_token_accuracy": 0.8188594870269299, + "num_tokens": 23153269.0, + "step": 5060 + }, + { + "entropy": 0.7438366217538714, + "epoch": 0.4780707440977829, + "grad_norm": 0.546875, + "learning_rate": 2.5655772725689603e-06, + "loss": 0.5763253688812255, + "mean_token_accuracy": 0.8034364895895123, + "num_tokens": 23192625.0, + "step": 5070 + }, + { + "entropy": 0.670103266928345, + "epoch": 0.47901368442144715, + "grad_norm": 0.373046875, + "learning_rate": 2.5574828405539728e-06, + "loss": 0.6656664848327637, + "mean_token_accuracy": 0.7948807664215565, + "num_tokens": 23232898.0, + "step": 5080 + }, + { + "entropy": 0.6341434024274349, + "epoch": 0.47995662474511147, + "grad_norm": 0.4375, + "learning_rate": 2.549387805571187e-06, + "loss": 0.6048046588897705, + "mean_token_accuracy": 0.8179752115160227, + "num_tokens": 23280386.0, + "step": 5090 + }, + { + "entropy": 0.5786968288943172, + "epoch": 0.48089956506877574, + "grad_norm": 0.427734375, + "learning_rate": 2.541292252533692e-06, + "loss": 0.4855860710144043, + "mean_token_accuracy": 0.8366754438728095, + "num_tokens": 23337825.0, + "step": 5100 + }, + { + "entropy": 0.6527865190058947, + "epoch": 0.48184250539244, + "grad_norm": 0.77734375, + "learning_rate": 2.5331962663600067e-06, + "loss": 0.5803621768951416, + "mean_token_accuracy": 0.8150936767458916, + "num_tokens": 23384315.0, + "step": 5110 + }, + { + "entropy": 0.5440753613132984, + "epoch": 0.48278544571610427, + "grad_norm": 0.48046875, + "learning_rate": 2.525099931973195e-06, + "loss": 0.4513993263244629, + "mean_token_accuracy": 0.8605207178741694, + "num_tokens": 23426647.0, + "step": 5120 + }, + { + "entropy": 0.7320382345467806, + "epoch": 0.48372838603976853, + "grad_norm": 0.455078125, + "learning_rate": 2.5170033342999744e-06, + "loss": 0.5450259208679199, + "mean_token_accuracy": 0.806569528952241, + "num_tokens": 23479860.0, + "step": 5130 + }, + { + "entropy": 0.932574069686234, + "epoch": 0.4846713263634328, + "grad_norm": 0.43359375, + "learning_rate": 2.508906558269823e-06, + "loss": 0.6856896877288818, + "mean_token_accuracy": 0.7718136046081782, + "num_tokens": 23524560.0, + "step": 5140 + }, + { + "entropy": 0.7975945806130766, + "epoch": 0.48561426668709706, + "grad_norm": 0.62109375, + "learning_rate": 2.50080968881409e-06, + "loss": 0.6863570213317871, + "mean_token_accuracy": 0.7639251388609409, + "num_tokens": 23569479.0, + "step": 5150 + }, + { + "entropy": 0.6952396250329912, + "epoch": 0.48655720701076133, + "grad_norm": 0.44921875, + "learning_rate": 2.492712810865104e-06, + "loss": 0.650794506072998, + "mean_token_accuracy": 0.7981450140476227, + "num_tokens": 23613236.0, + "step": 5160 + }, + { + "entropy": 0.692944074422121, + "epoch": 0.4875001473344256, + "grad_norm": 0.390625, + "learning_rate": 2.4846160093552844e-06, + "loss": 0.5776357173919677, + "mean_token_accuracy": 0.8085918761789799, + "num_tokens": 23664342.0, + "step": 5170 + }, + { + "entropy": 0.6718699016142636, + "epoch": 0.48844308765808986, + "grad_norm": 0.373046875, + "learning_rate": 2.4765193692162464e-06, + "loss": 0.5085245132446289, + "mean_token_accuracy": 0.8008262846618891, + "num_tokens": 23707193.0, + "step": 5180 + }, + { + "entropy": 0.706077482830733, + "epoch": 0.4893860279817541, + "grad_norm": 0.404296875, + "learning_rate": 2.4684229753779143e-06, + "loss": 0.6562648296356202, + "mean_token_accuracy": 0.8039237121120095, + "num_tokens": 23752334.0, + "step": 5190 + }, + { + "entropy": 0.7011547919362784, + "epoch": 0.4903289683054184, + "grad_norm": 0.515625, + "learning_rate": 2.460326912767629e-06, + "loss": 0.531063461303711, + "mean_token_accuracy": 0.7961400125175715, + "num_tokens": 23798649.0, + "step": 5200 + }, + { + "entropy": 0.6769697558134794, + "epoch": 0.49127190862908265, + "grad_norm": 0.390625, + "learning_rate": 2.4522312663092557e-06, + "loss": 0.6853522777557373, + "mean_token_accuracy": 0.8073696456849575, + "num_tokens": 23848741.0, + "step": 5210 + }, + { + "entropy": 0.7591002416796983, + "epoch": 0.4922148489527469, + "grad_norm": 0.67578125, + "learning_rate": 2.4441361209222954e-06, + "loss": 0.7305190563201904, + "mean_token_accuracy": 0.797344889678061, + "num_tokens": 23893101.0, + "step": 5220 + }, + { + "entropy": 0.6849329901859165, + "epoch": 0.4931577892764112, + "grad_norm": 0.2314453125, + "learning_rate": 2.4360415615209917e-06, + "loss": 0.5951381206512452, + "mean_token_accuracy": 0.803836777061224, + "num_tokens": 23939882.0, + "step": 5230 + }, + { + "entropy": 0.7282287730835378, + "epoch": 0.49410072960007545, + "grad_norm": 0.8203125, + "learning_rate": 2.4279476730134434e-06, + "loss": 0.7151484966278077, + "mean_token_accuracy": 0.7978202365338802, + "num_tokens": 23984588.0, + "step": 5240 + }, + { + "entropy": 0.5871094174683094, + "epoch": 0.4950436699237397, + "grad_norm": 0.275390625, + "learning_rate": 2.4198545403007096e-06, + "loss": 0.43007869720458985, + "mean_token_accuracy": 0.8355049606412649, + "num_tokens": 24029008.0, + "step": 5250 + }, + { + "entropy": 0.7616613085381687, + "epoch": 0.495986610247404, + "grad_norm": 0.7421875, + "learning_rate": 2.411762248275925e-06, + "loss": 0.6963319301605224, + "mean_token_accuracy": 0.7859408996999264, + "num_tokens": 24075516.0, + "step": 5260 + }, + { + "entropy": 0.6838515439070761, + "epoch": 0.49692955057106825, + "grad_norm": 0.462890625, + "learning_rate": 2.403670881823402e-06, + "loss": 0.4955598831176758, + "mean_token_accuracy": 0.8118189193308354, + "num_tokens": 24117898.0, + "step": 5270 + }, + { + "entropy": 0.7197461973875761, + "epoch": 0.4978724908947325, + "grad_norm": 0.5625, + "learning_rate": 2.395580525817747e-06, + "loss": 0.7124035835266114, + "mean_token_accuracy": 0.8052475444972516, + "num_tokens": 24158791.0, + "step": 5280 + }, + { + "entropy": 0.6253745971247554, + "epoch": 0.4988154312183968, + "grad_norm": 0.375, + "learning_rate": 2.3874912651229654e-06, + "loss": 0.6346887588500977, + "mean_token_accuracy": 0.8198149241507053, + "num_tokens": 24200515.0, + "step": 5290 + }, + { + "entropy": 0.7803498791530729, + "epoch": 0.49975837154206104, + "grad_norm": 0.7890625, + "learning_rate": 2.3794031845915747e-06, + "loss": 0.652740478515625, + "mean_token_accuracy": 0.7830078467726708, + "num_tokens": 24241164.0, + "step": 5300 + }, + { + "entropy": 0.6996277961879969, + "epoch": 0.5007013118657253, + "grad_norm": 0.53515625, + "learning_rate": 2.371316369063712e-06, + "loss": 0.48831911087036134, + "mean_token_accuracy": 0.8117915650829672, + "num_tokens": 24294051.0, + "step": 5310 + }, + { + "entropy": 0.7372800389304757, + "epoch": 0.5016442521893896, + "grad_norm": 0.326171875, + "learning_rate": 2.363230903366246e-06, + "loss": 0.669452428817749, + "mean_token_accuracy": 0.7989845238626003, + "num_tokens": 24336401.0, + "step": 5320 + }, + { + "entropy": 0.7606853501871228, + "epoch": 0.5025871925130538, + "grad_norm": 0.66015625, + "learning_rate": 2.355146872311886e-06, + "loss": 0.5572319984436035, + "mean_token_accuracy": 0.7974383737891912, + "num_tokens": 24386340.0, + "step": 5330 + }, + { + "entropy": 0.621194904576987, + "epoch": 0.5035301328367181, + "grad_norm": 0.69140625, + "learning_rate": 2.3470643606982917e-06, + "loss": 0.5595749378204345, + "mean_token_accuracy": 0.8278559125959873, + "num_tokens": 24438645.0, + "step": 5340 + }, + { + "entropy": 0.8461435342207551, + "epoch": 0.5044730731603824, + "grad_norm": 0.52734375, + "learning_rate": 2.338983453307186e-06, + "loss": 0.749328899383545, + "mean_token_accuracy": 0.768775100260973, + "num_tokens": 24483263.0, + "step": 5350 + }, + { + "entropy": 0.7757677493616939, + "epoch": 0.5054160134840466, + "grad_norm": 0.353515625, + "learning_rate": 2.3309042349034626e-06, + "loss": 0.7084070682525635, + "mean_token_accuracy": 0.7868932072073221, + "num_tokens": 24529164.0, + "step": 5360 + }, + { + "entropy": 0.753884001635015, + "epoch": 0.5063589538077109, + "grad_norm": 0.55859375, + "learning_rate": 2.322826790234301e-06, + "loss": 0.584246015548706, + "mean_token_accuracy": 0.7949038635939359, + "num_tokens": 24570830.0, + "step": 5370 + }, + { + "entropy": 0.7765898966928944, + "epoch": 0.5073018941313752, + "grad_norm": 0.3671875, + "learning_rate": 2.314751204028273e-06, + "loss": 0.7225810050964355, + "mean_token_accuracy": 0.7808141350746155, + "num_tokens": 24610942.0, + "step": 5380 + }, + { + "entropy": 0.6957989188842475, + "epoch": 0.5082448344550394, + "grad_norm": 0.349609375, + "learning_rate": 2.3066775609944563e-06, + "loss": 0.5243014812469482, + "mean_token_accuracy": 0.8077589053660631, + "num_tokens": 24652698.0, + "step": 5390 + }, + { + "entropy": 0.6827801558189094, + "epoch": 0.5091877747787037, + "grad_norm": 0.470703125, + "learning_rate": 2.2986059458215463e-06, + "loss": 0.5520379066467285, + "mean_token_accuracy": 0.8119027376174927, + "num_tokens": 24702847.0, + "step": 5400 + }, + { + "entropy": 0.7064282950363122, + "epoch": 0.510130715102368, + "grad_norm": 0.78515625, + "learning_rate": 2.290536443176967e-06, + "loss": 0.5469173431396485, + "mean_token_accuracy": 0.7847862780094147, + "num_tokens": 24750274.0, + "step": 5410 + }, + { + "entropy": 0.7025827980600298, + "epoch": 0.5110736554260322, + "grad_norm": 0.8046875, + "learning_rate": 2.2824691377059815e-06, + "loss": 0.6773509979248047, + "mean_token_accuracy": 0.811617712303996, + "num_tokens": 24793348.0, + "step": 5420 + }, + { + "entropy": 0.6194292335771024, + "epoch": 0.5120165957496965, + "grad_norm": 0.64453125, + "learning_rate": 2.2744041140308075e-06, + "loss": 0.43538432121276854, + "mean_token_accuracy": 0.83103067278862, + "num_tokens": 24851606.0, + "step": 5430 + }, + { + "entropy": 0.6980881096795202, + "epoch": 0.5129595360733608, + "grad_norm": 0.326171875, + "learning_rate": 2.266341456749728e-06, + "loss": 0.5463144302368164, + "mean_token_accuracy": 0.814735346660018, + "num_tokens": 24893529.0, + "step": 5440 + }, + { + "entropy": 0.6669334940612316, + "epoch": 0.513902476397025, + "grad_norm": 0.66796875, + "learning_rate": 2.2582812504362016e-06, + "loss": 0.6203276634216308, + "mean_token_accuracy": 0.817523836158216, + "num_tokens": 24938994.0, + "step": 5450 + }, + { + "entropy": 0.6864639653824269, + "epoch": 0.5148454167206893, + "grad_norm": 0.400390625, + "learning_rate": 2.2502235796379786e-06, + "loss": 0.6700600147247314, + "mean_token_accuracy": 0.7997597053647041, + "num_tokens": 24989371.0, + "step": 5460 + }, + { + "entropy": 0.7375475165434182, + "epoch": 0.5157883570443536, + "grad_norm": 0.3828125, + "learning_rate": 2.2421685288762133e-06, + "loss": 0.739337682723999, + "mean_token_accuracy": 0.8012431789189577, + "num_tokens": 25026248.0, + "step": 5470 + }, + { + "entropy": 0.7337912478949875, + "epoch": 0.5167312973680178, + "grad_norm": 0.37890625, + "learning_rate": 2.2341161826445764e-06, + "loss": 0.6376617431640625, + "mean_token_accuracy": 0.7975466061383486, + "num_tokens": 25070722.0, + "step": 5480 + }, + { + "entropy": 0.6371306877117604, + "epoch": 0.5176742376916821, + "grad_norm": 0.498046875, + "learning_rate": 2.2260666254083695e-06, + "loss": 0.46918063163757323, + "mean_token_accuracy": 0.8177219878882169, + "num_tokens": 25115523.0, + "step": 5490 + }, + { + "entropy": 0.5692290297709406, + "epoch": 0.5186171780153463, + "grad_norm": 0.9921875, + "learning_rate": 2.2180199416036385e-06, + "loss": 0.5440778255462646, + "mean_token_accuracy": 0.8257677935063839, + "num_tokens": 25172217.0, + "step": 5500 + }, + { + "entropy": 0.6837885739281774, + "epoch": 0.5195601183390106, + "grad_norm": 0.5546875, + "learning_rate": 2.2099762156362897e-06, + "loss": 0.7906906604766846, + "mean_token_accuracy": 0.814153590425849, + "num_tokens": 25209734.0, + "step": 5510 + }, + { + "entropy": 0.8297489018645138, + "epoch": 0.5205030586626749, + "grad_norm": 0.55078125, + "learning_rate": 2.201935531881202e-06, + "loss": 0.715370512008667, + "mean_token_accuracy": 0.7802321035414934, + "num_tokens": 25263278.0, + "step": 5520 + }, + { + "entropy": 0.6839754433371127, + "epoch": 0.5214459989863391, + "grad_norm": 0.62890625, + "learning_rate": 2.1938979746813435e-06, + "loss": 0.5679389953613281, + "mean_token_accuracy": 0.8094680864363909, + "num_tokens": 25312769.0, + "step": 5530 + }, + { + "entropy": 0.7027344678528606, + "epoch": 0.5223889393100034, + "grad_norm": 0.302734375, + "learning_rate": 2.1858636283468853e-06, + "loss": 0.6222816467285156, + "mean_token_accuracy": 0.8174486592411995, + "num_tokens": 25363056.0, + "step": 5540 + }, + { + "entropy": 0.7847942772321403, + "epoch": 0.5233318796336677, + "grad_norm": 1.0078125, + "learning_rate": 2.1778325771543184e-06, + "loss": 0.5383003234863282, + "mean_token_accuracy": 0.7966303894296288, + "num_tokens": 25403541.0, + "step": 5550 + }, + { + "entropy": 0.7017437141388655, + "epoch": 0.5242748199573319, + "grad_norm": 0.42578125, + "learning_rate": 2.1698049053455707e-06, + "loss": 0.5788224220275879, + "mean_token_accuracy": 0.8125591490417718, + "num_tokens": 25455315.0, + "step": 5560 + }, + { + "entropy": 0.7177816702984273, + "epoch": 0.5252177602809962, + "grad_norm": 0.44140625, + "learning_rate": 2.1617806971271205e-06, + "loss": 0.5685774326324463, + "mean_token_accuracy": 0.785433416813612, + "num_tokens": 25508053.0, + "step": 5570 + }, + { + "entropy": 0.6137881996575743, + "epoch": 0.5261607006046605, + "grad_norm": 0.4296875, + "learning_rate": 2.153760036669115e-06, + "loss": 0.54885892868042, + "mean_token_accuracy": 0.8225920587778092, + "num_tokens": 25558186.0, + "step": 5580 + }, + { + "entropy": 0.646233162516728, + "epoch": 0.5271036409283247, + "grad_norm": 0.419921875, + "learning_rate": 2.1457430081044864e-06, + "loss": 0.5985296726226806, + "mean_token_accuracy": 0.8277124404907227, + "num_tokens": 25608608.0, + "step": 5590 + }, + { + "entropy": 0.7152201779186725, + "epoch": 0.528046581251989, + "grad_norm": 0.69921875, + "learning_rate": 2.137729695528071e-06, + "loss": 0.5779585361480712, + "mean_token_accuracy": 0.8061476524919271, + "num_tokens": 25657647.0, + "step": 5600 + }, + { + "entropy": 0.6737063567154109, + "epoch": 0.5289895215756533, + "grad_norm": 0.57421875, + "learning_rate": 2.129720182995727e-06, + "loss": 0.6868101596832276, + "mean_token_accuracy": 0.8116919990628958, + "num_tokens": 25700172.0, + "step": 5610 + }, + { + "entropy": 0.6977092338725924, + "epoch": 0.5299324618993175, + "grad_norm": 0.32421875, + "learning_rate": 2.1217145545234494e-06, + "loss": 0.6692411422729492, + "mean_token_accuracy": 0.8033047847449779, + "num_tokens": 25752498.0, + "step": 5620 + }, + { + "entropy": 0.7011082604527473, + "epoch": 0.5308754022229818, + "grad_norm": 0.51171875, + "learning_rate": 2.1137128940864937e-06, + "loss": 0.6209464550018311, + "mean_token_accuracy": 0.7912783624604345, + "num_tokens": 25798610.0, + "step": 5630 + }, + { + "entropy": 0.7150249132886529, + "epoch": 0.5318183425466461, + "grad_norm": 0.435546875, + "learning_rate": 2.105715285618491e-06, + "loss": 0.6976465702056884, + "mean_token_accuracy": 0.797979774326086, + "num_tokens": 25848826.0, + "step": 5640 + }, + { + "entropy": 0.6213484527543187, + "epoch": 0.5327612828703103, + "grad_norm": 0.263671875, + "learning_rate": 2.0977218130105698e-06, + "loss": 0.5264866828918457, + "mean_token_accuracy": 0.8229496419429779, + "num_tokens": 25895349.0, + "step": 5650 + }, + { + "entropy": 0.6708037904463708, + "epoch": 0.5337042231939746, + "grad_norm": 0.447265625, + "learning_rate": 2.0897325601104756e-06, + "loss": 0.588989543914795, + "mean_token_accuracy": 0.7981192912906409, + "num_tokens": 25940046.0, + "step": 5660 + }, + { + "entropy": 0.6789191416930407, + "epoch": 0.5346471635176389, + "grad_norm": 0.265625, + "learning_rate": 2.08174761072169e-06, + "loss": 0.5451597213745117, + "mean_token_accuracy": 0.8029395695775747, + "num_tokens": 25983827.0, + "step": 5670 + }, + { + "entropy": 0.5920437740162015, + "epoch": 0.5355901038413031, + "grad_norm": 0.78125, + "learning_rate": 2.0737670486025545e-06, + "loss": 0.4877305507659912, + "mean_token_accuracy": 0.8246560201048851, + "num_tokens": 26026651.0, + "step": 5680 + }, + { + "entropy": 0.7011357684619725, + "epoch": 0.5365330441649674, + "grad_norm": 0.458984375, + "learning_rate": 2.0657909574653894e-06, + "loss": 0.6222146987915039, + "mean_token_accuracy": 0.7912551097571849, + "num_tokens": 26070473.0, + "step": 5690 + }, + { + "entropy": 0.6917565542273223, + "epoch": 0.5374759844886317, + "grad_norm": 0.546875, + "learning_rate": 2.0578194209756165e-06, + "loss": 0.4957622528076172, + "mean_token_accuracy": 0.8071240916848182, + "num_tokens": 26114544.0, + "step": 5700 + }, + { + "entropy": 0.6250287326984107, + "epoch": 0.5384189248122959, + "grad_norm": 0.46875, + "learning_rate": 2.0498525227508807e-06, + "loss": 0.5066961765289306, + "mean_token_accuracy": 0.8199310664087534, + "num_tokens": 26162592.0, + "step": 5710 + }, + { + "entropy": 0.7448068944737315, + "epoch": 0.5393618651359602, + "grad_norm": 0.265625, + "learning_rate": 2.041890346360176e-06, + "loss": 0.5603039741516114, + "mean_token_accuracy": 0.8090826883912087, + "num_tokens": 26218601.0, + "step": 5720 + }, + { + "entropy": 0.8320084512233734, + "epoch": 0.5403048054596244, + "grad_norm": 0.640625, + "learning_rate": 2.0339329753229635e-06, + "loss": 0.6805224895477295, + "mean_token_accuracy": 0.7954841999337077, + "num_tokens": 26263287.0, + "step": 5730 + }, + { + "entropy": 0.6348516764119267, + "epoch": 0.5412477457832887, + "grad_norm": 0.71875, + "learning_rate": 2.0259804931083012e-06, + "loss": 0.5312628269195556, + "mean_token_accuracy": 0.8127726577222347, + "num_tokens": 26310034.0, + "step": 5740 + }, + { + "entropy": 0.6182076470926404, + "epoch": 0.542190686106953, + "grad_norm": 0.490234375, + "learning_rate": 2.0180329831339637e-06, + "loss": 0.529332160949707, + "mean_token_accuracy": 0.824046990275383, + "num_tokens": 26346391.0, + "step": 5750 + }, + { + "entropy": 0.6656064330600202, + "epoch": 0.5431336264306172, + "grad_norm": 0.70703125, + "learning_rate": 2.0100905287655704e-06, + "loss": 0.7039621353149415, + "mean_token_accuracy": 0.8080949112772942, + "num_tokens": 26388266.0, + "step": 5760 + }, + { + "entropy": 0.7996745721437037, + "epoch": 0.5440765667542815, + "grad_norm": 0.52734375, + "learning_rate": 2.002153213315709e-06, + "loss": 0.6947851657867432, + "mean_token_accuracy": 0.7908861048519611, + "num_tokens": 26439880.0, + "step": 5770 + }, + { + "entropy": 0.678467130381614, + "epoch": 0.5450195070779458, + "grad_norm": 0.384765625, + "learning_rate": 1.9942211200430634e-06, + "loss": 0.5658381938934326, + "mean_token_accuracy": 0.818194093927741, + "num_tokens": 26483322.0, + "step": 5780 + }, + { + "entropy": 0.6941055947914719, + "epoch": 0.54596244740161, + "grad_norm": 0.248046875, + "learning_rate": 1.986294332151538e-06, + "loss": 0.705126428604126, + "mean_token_accuracy": 0.8105139836668969, + "num_tokens": 26533766.0, + "step": 5790 + }, + { + "entropy": 0.6308328908868134, + "epoch": 0.5469053877252743, + "grad_norm": 0.5078125, + "learning_rate": 1.9783729327893865e-06, + "loss": 0.5511210918426513, + "mean_token_accuracy": 0.8163013540208339, + "num_tokens": 26581428.0, + "step": 5800 + }, + { + "entropy": 0.7102134318090976, + "epoch": 0.5478483280489386, + "grad_norm": 0.28125, + "learning_rate": 1.9704570050483404e-06, + "loss": 0.5507728576660156, + "mean_token_accuracy": 0.8015400886535644, + "num_tokens": 26620358.0, + "step": 5810 + }, + { + "entropy": 0.7275429900735617, + "epoch": 0.5487912683726028, + "grad_norm": 0.9609375, + "learning_rate": 1.962546631962736e-06, + "loss": 0.6528871536254883, + "mean_token_accuracy": 0.8041394516825676, + "num_tokens": 26661174.0, + "step": 5820 + }, + { + "entropy": 0.6613958537112922, + "epoch": 0.5497342086962671, + "grad_norm": 0.65625, + "learning_rate": 1.9546418965086444e-06, + "loss": 0.6786399841308594, + "mean_token_accuracy": 0.8156840946525336, + "num_tokens": 26710819.0, + "step": 5830 + }, + { + "entropy": 0.7236452325247228, + "epoch": 0.5506771490199314, + "grad_norm": 0.76171875, + "learning_rate": 1.946742881602999e-06, + "loss": 0.6853342533111573, + "mean_token_accuracy": 0.8027016900479793, + "num_tokens": 26758188.0, + "step": 5840 + }, + { + "entropy": 0.6812964378856122, + "epoch": 0.5516200893435956, + "grad_norm": 0.58203125, + "learning_rate": 1.9388496701027277e-06, + "loss": 0.6243832588195801, + "mean_token_accuracy": 0.8085433639585972, + "num_tokens": 26804314.0, + "step": 5850 + }, + { + "entropy": 0.7152590912766754, + "epoch": 0.5525630296672599, + "grad_norm": 0.458984375, + "learning_rate": 1.9309623448038864e-06, + "loss": 0.7200493335723877, + "mean_token_accuracy": 0.7995035350322723, + "num_tokens": 26859814.0, + "step": 5860 + }, + { + "entropy": 0.87381039140746, + "epoch": 0.5535059699909242, + "grad_norm": 0.7421875, + "learning_rate": 1.923080988440784e-06, + "loss": 0.6745802402496338, + "mean_token_accuracy": 0.769163049198687, + "num_tokens": 26898475.0, + "step": 5870 + }, + { + "entropy": 0.8256870447658002, + "epoch": 0.5544489103145884, + "grad_norm": 0.56640625, + "learning_rate": 1.9152056836851195e-06, + "loss": 0.650912094116211, + "mean_token_accuracy": 0.7772346431389451, + "num_tokens": 26943779.0, + "step": 5880 + }, + { + "entropy": 0.7375765237025916, + "epoch": 0.5553918506382527, + "grad_norm": 0.361328125, + "learning_rate": 1.9073365131451138e-06, + "loss": 0.5638370990753174, + "mean_token_accuracy": 0.7974175462499261, + "num_tokens": 26990072.0, + "step": 5890 + }, + { + "entropy": 0.6312047270126641, + "epoch": 0.556334790961917, + "grad_norm": 0.53125, + "learning_rate": 1.899473559364641e-06, + "loss": 0.5202350616455078, + "mean_token_accuracy": 0.8370380699634552, + "num_tokens": 27033233.0, + "step": 5900 + }, + { + "entropy": 0.660971057927236, + "epoch": 0.5572777312855812, + "grad_norm": 0.474609375, + "learning_rate": 1.891616904822366e-06, + "loss": 0.5475841522216797, + "mean_token_accuracy": 0.8027979079633951, + "num_tokens": 27081850.0, + "step": 5910 + }, + { + "entropy": 0.6727430471219122, + "epoch": 0.5582206716092455, + "grad_norm": 0.490234375, + "learning_rate": 1.883766631930878e-06, + "loss": 0.5413420677185059, + "mean_token_accuracy": 0.8251585308462381, + "num_tokens": 27130545.0, + "step": 5920 + }, + { + "entropy": 0.6418562413193285, + "epoch": 0.5591636119329098, + "grad_norm": 0.365234375, + "learning_rate": 1.8759228230358244e-06, + "loss": 0.5960840702056884, + "mean_token_accuracy": 0.832189904898405, + "num_tokens": 27176239.0, + "step": 5930 + }, + { + "entropy": 0.6648577735759318, + "epoch": 0.560106552256574, + "grad_norm": 0.404296875, + "learning_rate": 1.8680855604150492e-06, + "loss": 0.6448702812194824, + "mean_token_accuracy": 0.8221142962574959, + "num_tokens": 27224848.0, + "step": 5940 + }, + { + "entropy": 0.6807060082443058, + "epoch": 0.5610494925802383, + "grad_norm": 0.60546875, + "learning_rate": 1.860254926277728e-06, + "loss": 0.5650904655456543, + "mean_token_accuracy": 0.8069817528128624, + "num_tokens": 27271544.0, + "step": 5950 + }, + { + "entropy": 0.8060918380506337, + "epoch": 0.5619924329039026, + "grad_norm": 0.453125, + "learning_rate": 1.8524310027635084e-06, + "loss": 0.7444260597229004, + "mean_token_accuracy": 0.7830769976601004, + "num_tokens": 27320762.0, + "step": 5960 + }, + { + "entropy": 0.6863439489156008, + "epoch": 0.5629353732275668, + "grad_norm": 0.48046875, + "learning_rate": 1.8446138719416452e-06, + "loss": 0.5965976715087891, + "mean_token_accuracy": 0.8035622656345367, + "num_tokens": 27368194.0, + "step": 5970 + }, + { + "entropy": 0.6725466954987496, + "epoch": 0.5638783135512311, + "grad_norm": 0.41015625, + "learning_rate": 1.8368036158101415e-06, + "loss": 0.6167645454406738, + "mean_token_accuracy": 0.8260718215256929, + "num_tokens": 27407957.0, + "step": 5980 + }, + { + "entropy": 0.7055775175336748, + "epoch": 0.5648212538748953, + "grad_norm": 0.60546875, + "learning_rate": 1.8290003162948893e-06, + "loss": 0.7305053234100342, + "mean_token_accuracy": 0.805973731353879, + "num_tokens": 27448255.0, + "step": 5990 + }, + { + "entropy": 0.6864317794330418, + "epoch": 0.5657641941985596, + "grad_norm": 0.47265625, + "learning_rate": 1.8212040552488081e-06, + "loss": 0.5233036518096924, + "mean_token_accuracy": 0.8087876638397574, + "num_tokens": 27492568.0, + "step": 6000 + }, + { + "entropy": 0.8008205661550164, + "epoch": 0.5667071345222239, + "grad_norm": 0.267578125, + "learning_rate": 1.8134149144509861e-06, + "loss": 0.6945072650909424, + "mean_token_accuracy": 0.7832493115216493, + "num_tokens": 27535293.0, + "step": 6010 + }, + { + "entropy": 0.7050473445095122, + "epoch": 0.5676500748458881, + "grad_norm": 0.39453125, + "learning_rate": 1.8056329756058249e-06, + "loss": 0.6400737762451172, + "mean_token_accuracy": 0.8038847412914037, + "num_tokens": 27581501.0, + "step": 6020 + }, + { + "entropy": 0.7546293061226607, + "epoch": 0.5685930151695524, + "grad_norm": 0.40625, + "learning_rate": 1.7978583203421812e-06, + "loss": 0.6627458572387696, + "mean_token_accuracy": 0.7845555316656828, + "num_tokens": 27629782.0, + "step": 6030 + }, + { + "entropy": 0.7452189083211124, + "epoch": 0.5695359554932167, + "grad_norm": 0.5078125, + "learning_rate": 1.7900910302125086e-06, + "loss": 0.5804001331329346, + "mean_token_accuracy": 0.7970978146418929, + "num_tokens": 27678902.0, + "step": 6040 + }, + { + "entropy": 0.7050665612798184, + "epoch": 0.5704788958168809, + "grad_norm": 0.4140625, + "learning_rate": 1.7823311866920068e-06, + "loss": 0.5286674499511719, + "mean_token_accuracy": 0.7994862403720617, + "num_tokens": 27717460.0, + "step": 6050 + }, + { + "entropy": 0.6447273494210094, + "epoch": 0.5714218361405452, + "grad_norm": 1.140625, + "learning_rate": 1.7745788711777611e-06, + "loss": 0.5664659976959229, + "mean_token_accuracy": 0.8183193821460009, + "num_tokens": 27763408.0, + "step": 6060 + }, + { + "entropy": 0.7607476971112191, + "epoch": 0.5723647764642095, + "grad_norm": 0.357421875, + "learning_rate": 1.766834164987894e-06, + "loss": 0.6255624294281006, + "mean_token_accuracy": 0.7873752404004335, + "num_tokens": 27808897.0, + "step": 6070 + }, + { + "entropy": 0.6860075819306075, + "epoch": 0.5733077167878737, + "grad_norm": 0.283203125, + "learning_rate": 1.7590971493607072e-06, + "loss": 0.6039350509643555, + "mean_token_accuracy": 0.8028590308502317, + "num_tokens": 27854713.0, + "step": 6080 + }, + { + "entropy": 0.8293744221329689, + "epoch": 0.574250657111538, + "grad_norm": 0.67578125, + "learning_rate": 1.7513679054538352e-06, + "loss": 0.7157419681549072, + "mean_token_accuracy": 0.7663772650063038, + "num_tokens": 27900429.0, + "step": 6090 + }, + { + "entropy": 0.8774604101665318, + "epoch": 0.5751935974352024, + "grad_norm": 0.412109375, + "learning_rate": 1.743646514343388e-06, + "loss": 0.5146266937255859, + "mean_token_accuracy": 0.7756213560700417, + "num_tokens": 27943940.0, + "step": 6100 + }, + { + "entropy": 0.5941920497454702, + "epoch": 0.5761365377588666, + "grad_norm": 0.57421875, + "learning_rate": 1.7359330570231049e-06, + "loss": 0.6486340999603272, + "mean_token_accuracy": 0.8262489166110754, + "num_tokens": 27989276.0, + "step": 6110 + }, + { + "entropy": 0.6428902736864984, + "epoch": 0.5770794780825309, + "grad_norm": 0.390625, + "learning_rate": 1.7282276144035037e-06, + "loss": 0.6077763080596924, + "mean_token_accuracy": 0.8120482333004475, + "num_tokens": 28026618.0, + "step": 6120 + }, + { + "entropy": 0.7213725323788822, + "epoch": 0.5780224184061952, + "grad_norm": 2.078125, + "learning_rate": 1.7205302673110308e-06, + "loss": 0.7364995002746582, + "mean_token_accuracy": 0.7888428892940282, + "num_tokens": 28081339.0, + "step": 6130 + }, + { + "entropy": 0.7310086984187365, + "epoch": 0.5789653587298594, + "grad_norm": 0.9609375, + "learning_rate": 1.7128410964872152e-06, + "loss": 0.5657924175262451, + "mean_token_accuracy": 0.7936812553554773, + "num_tokens": 28117903.0, + "step": 6140 + }, + { + "entropy": 0.7583439980633557, + "epoch": 0.5799082990535237, + "grad_norm": 0.5078125, + "learning_rate": 1.7051601825878203e-06, + "loss": 0.5908254146575928, + "mean_token_accuracy": 0.7944333799183368, + "num_tokens": 28162769.0, + "step": 6150 + }, + { + "entropy": 0.6405745659023523, + "epoch": 0.580851239377188, + "grad_norm": 0.58203125, + "learning_rate": 1.6974876061819973e-06, + "loss": 0.5538061618804931, + "mean_token_accuracy": 0.8247173227369785, + "num_tokens": 28203429.0, + "step": 6160 + }, + { + "entropy": 0.766948539763689, + "epoch": 0.5817941797008522, + "grad_norm": 0.2275390625, + "learning_rate": 1.6898234477514442e-06, + "loss": 0.6483793735504151, + "mean_token_accuracy": 0.7911493647843599, + "num_tokens": 28252124.0, + "step": 6170 + }, + { + "entropy": 0.6414849878288805, + "epoch": 0.5827371200245165, + "grad_norm": 0.447265625, + "learning_rate": 1.6821677876895554e-06, + "loss": 0.5362122535705567, + "mean_token_accuracy": 0.8220501244068146, + "num_tokens": 28304670.0, + "step": 6180 + }, + { + "entropy": 0.6628352930769325, + "epoch": 0.5836800603481808, + "grad_norm": 0.248046875, + "learning_rate": 1.6745207063005819e-06, + "loss": 0.5948177814483643, + "mean_token_accuracy": 0.8272610239684581, + "num_tokens": 28342263.0, + "step": 6190 + }, + { + "entropy": 0.7425322285853326, + "epoch": 0.584623000671845, + "grad_norm": 0.2431640625, + "learning_rate": 1.6668822837987894e-06, + "loss": 0.646372127532959, + "mean_token_accuracy": 0.7970950407907367, + "num_tokens": 28394678.0, + "step": 6200 + }, + { + "entropy": 0.6451410392299295, + "epoch": 0.5855659409955093, + "grad_norm": 0.326171875, + "learning_rate": 1.6592526003076148e-06, + "loss": 0.6016067028045654, + "mean_token_accuracy": 0.8238395698368549, + "num_tokens": 28449882.0, + "step": 6210 + }, + { + "entropy": 0.6584913536906243, + "epoch": 0.5865088813191736, + "grad_norm": 0.369140625, + "learning_rate": 1.6516317358588285e-06, + "loss": 0.5983861923217774, + "mean_token_accuracy": 0.8156170316040516, + "num_tokens": 28488572.0, + "step": 6220 + }, + { + "entropy": 0.5571296599693596, + "epoch": 0.5874518216428378, + "grad_norm": 0.322265625, + "learning_rate": 1.6440197703916928e-06, + "loss": 0.4304994583129883, + "mean_token_accuracy": 0.8418979216367006, + "num_tokens": 28534773.0, + "step": 6230 + }, + { + "entropy": 0.6841351325623691, + "epoch": 0.5883947619665021, + "grad_norm": 0.376953125, + "learning_rate": 1.6364167837521222e-06, + "loss": 0.6759282112121582, + "mean_token_accuracy": 0.7826384872198104, + "num_tokens": 28576209.0, + "step": 6240 + }, + { + "entropy": 0.7507536704652011, + "epoch": 0.5893377022901664, + "grad_norm": 0.482421875, + "learning_rate": 1.6288228556918495e-06, + "loss": 0.605400562286377, + "mean_token_accuracy": 0.7974974766373635, + "num_tokens": 28615687.0, + "step": 6250 + }, + { + "entropy": 0.7499837163835764, + "epoch": 0.5902806426138306, + "grad_norm": 0.400390625, + "learning_rate": 1.621238065867587e-06, + "loss": 0.6003370761871338, + "mean_token_accuracy": 0.7996041260659694, + "num_tokens": 28660419.0, + "step": 6260 + }, + { + "entropy": 0.7148910771124065, + "epoch": 0.5912235829374949, + "grad_norm": 0.240234375, + "learning_rate": 1.61366249384019e-06, + "loss": 0.5587523937225342, + "mean_token_accuracy": 0.8005239397287369, + "num_tokens": 28700915.0, + "step": 6270 + }, + { + "entropy": 0.7900654837023466, + "epoch": 0.5921665232611592, + "grad_norm": 0.4296875, + "learning_rate": 1.606096219073825e-06, + "loss": 0.7255774974822998, + "mean_token_accuracy": 0.7740635454654694, + "num_tokens": 28742016.0, + "step": 6280 + }, + { + "entropy": 0.6664929877966642, + "epoch": 0.5931094635848234, + "grad_norm": 0.32421875, + "learning_rate": 1.598539320935134e-06, + "loss": 0.5831618785858155, + "mean_token_accuracy": 0.8241768430918455, + "num_tokens": 28787025.0, + "step": 6290 + }, + { + "entropy": 0.841880920343101, + "epoch": 0.5940524039084877, + "grad_norm": 0.46875, + "learning_rate": 1.5909918786924027e-06, + "loss": 0.8506629943847657, + "mean_token_accuracy": 0.7675380181521178, + "num_tokens": 28835489.0, + "step": 6300 + }, + { + "entropy": 0.7314032892696559, + "epoch": 0.594995344232152, + "grad_norm": 0.703125, + "learning_rate": 1.583453971514729e-06, + "loss": 0.5955713272094727, + "mean_token_accuracy": 0.8092577937990427, + "num_tokens": 28878914.0, + "step": 6310 + }, + { + "entropy": 0.6585373728536069, + "epoch": 0.5959382845558162, + "grad_norm": 0.5546875, + "learning_rate": 1.5759256784711917e-06, + "loss": 0.6605970382690429, + "mean_token_accuracy": 0.8271971605718136, + "num_tokens": 28926182.0, + "step": 6320 + }, + { + "entropy": 0.8336781755089759, + "epoch": 0.5968812248794805, + "grad_norm": 0.53125, + "learning_rate": 1.568407078530023e-06, + "loss": 0.7155747890472413, + "mean_token_accuracy": 0.7782786898314953, + "num_tokens": 28972429.0, + "step": 6330 + }, + { + "entropy": 0.6537047138437628, + "epoch": 0.5978241652031447, + "grad_norm": 0.34765625, + "learning_rate": 1.560898250557778e-06, + "loss": 0.5683440685272216, + "mean_token_accuracy": 0.8080581244081259, + "num_tokens": 29020109.0, + "step": 6340 + }, + { + "entropy": 0.6812858050689101, + "epoch": 0.598767105526809, + "grad_norm": 0.6640625, + "learning_rate": 1.5533992733185094e-06, + "loss": 0.6385911464691162, + "mean_token_accuracy": 0.8044985607266426, + "num_tokens": 29063213.0, + "step": 6350 + }, + { + "entropy": 0.68090706942603, + "epoch": 0.5997100458504733, + "grad_norm": 0.79296875, + "learning_rate": 1.54591022547294e-06, + "loss": 0.5990062713623047, + "mean_token_accuracy": 0.818465144187212, + "num_tokens": 29101529.0, + "step": 6360 + }, + { + "entropy": 0.6892360879923217, + "epoch": 0.6006529861741375, + "grad_norm": 0.35546875, + "learning_rate": 1.5384311855776378e-06, + "loss": 0.6381627082824707, + "mean_token_accuracy": 0.8170299537479877, + "num_tokens": 29151636.0, + "step": 6370 + }, + { + "entropy": 0.7919900326058269, + "epoch": 0.6015959264978018, + "grad_norm": 0.392578125, + "learning_rate": 1.5309622320841928e-06, + "loss": 0.6791030406951905, + "mean_token_accuracy": 0.7774041363038122, + "num_tokens": 29195688.0, + "step": 6380 + }, + { + "entropy": 0.7630477277562022, + "epoch": 0.6025388668214661, + "grad_norm": 0.22265625, + "learning_rate": 1.5235034433383922e-06, + "loss": 0.6549117565155029, + "mean_token_accuracy": 0.7939501941204071, + "num_tokens": 29241182.0, + "step": 6390 + }, + { + "entropy": 0.6038443365134298, + "epoch": 0.6034818071451303, + "grad_norm": 0.79296875, + "learning_rate": 1.516054897579401e-06, + "loss": 0.538882064819336, + "mean_token_accuracy": 0.827283251285553, + "num_tokens": 29288939.0, + "step": 6400 + }, + { + "entropy": 0.6935314170084894, + "epoch": 0.6044247474687946, + "grad_norm": 0.4921875, + "learning_rate": 1.5086166729389392e-06, + "loss": 0.7098958969116211, + "mean_token_accuracy": 0.8060619793832302, + "num_tokens": 29330647.0, + "step": 6410 + }, + { + "entropy": 0.6182787658646702, + "epoch": 0.6053676877924589, + "grad_norm": 0.7109375, + "learning_rate": 1.5011888474404635e-06, + "loss": 0.5699858665466309, + "mean_token_accuracy": 0.8177945427596569, + "num_tokens": 29375563.0, + "step": 6420 + }, + { + "entropy": 0.6610123321413994, + "epoch": 0.6063106281161231, + "grad_norm": 0.546875, + "learning_rate": 1.493771498998349e-06, + "loss": 0.5734387397766113, + "mean_token_accuracy": 0.8026046641170979, + "num_tokens": 29412770.0, + "step": 6430 + }, + { + "entropy": 0.6550191486254334, + "epoch": 0.6072535684397874, + "grad_norm": 0.48828125, + "learning_rate": 1.486364705417071e-06, + "loss": 0.575551700592041, + "mean_token_accuracy": 0.8128551565110683, + "num_tokens": 29457089.0, + "step": 6440 + }, + { + "entropy": 0.6363603160483763, + "epoch": 0.6081965087634517, + "grad_norm": 0.37890625, + "learning_rate": 1.4789685443903894e-06, + "loss": 0.585049819946289, + "mean_token_accuracy": 0.820637421682477, + "num_tokens": 29511977.0, + "step": 6450 + }, + { + "entropy": 0.5975639001466334, + "epoch": 0.6091394490871159, + "grad_norm": 0.39453125, + "learning_rate": 1.471583093500532e-06, + "loss": 0.4691169738769531, + "mean_token_accuracy": 0.8282858118414879, + "num_tokens": 29560593.0, + "step": 6460 + }, + { + "entropy": 0.6914234139025212, + "epoch": 0.6100823894107802, + "grad_norm": 0.30859375, + "learning_rate": 1.4642084302173867e-06, + "loss": 0.5843109607696533, + "mean_token_accuracy": 0.8037613401189446, + "num_tokens": 29612477.0, + "step": 6470 + }, + { + "entropy": 0.720405780756846, + "epoch": 0.6110253297344445, + "grad_norm": 1.3671875, + "learning_rate": 1.4568446318976804e-06, + "loss": 0.612605094909668, + "mean_token_accuracy": 0.7900254150852561, + "num_tokens": 29653283.0, + "step": 6480 + }, + { + "entropy": 0.6390435563400387, + "epoch": 0.6119682700581087, + "grad_norm": 0.47265625, + "learning_rate": 1.449491775784172e-06, + "loss": 0.5124198436737061, + "mean_token_accuracy": 0.8260769449174404, + "num_tokens": 29700246.0, + "step": 6490 + }, + { + "entropy": 0.6470420122146606, + "epoch": 0.612911210381773, + "grad_norm": 0.90625, + "learning_rate": 1.442149939004845e-06, + "loss": 0.6141894340515137, + "mean_token_accuracy": 0.8217171192169189, + "num_tokens": 29752904.0, + "step": 6500 + }, + { + "entropy": 0.5653758386150003, + "epoch": 0.6138541507054373, + "grad_norm": 0.43359375, + "learning_rate": 1.4348191985720905e-06, + "loss": 0.5112238883972168, + "mean_token_accuracy": 0.8314279425889254, + "num_tokens": 29791019.0, + "step": 6510 + }, + { + "entropy": 0.6899514342658222, + "epoch": 0.6147970910291015, + "grad_norm": 0.44140625, + "learning_rate": 1.4274996313819093e-06, + "loss": 0.5467896461486816, + "mean_token_accuracy": 0.8154542069882155, + "num_tokens": 29837978.0, + "step": 6520 + }, + { + "entropy": 0.7366321623325348, + "epoch": 0.6157400313527658, + "grad_norm": 0.439453125, + "learning_rate": 1.4201913142130953e-06, + "loss": 0.5235143661499023, + "mean_token_accuracy": 0.797525929659605, + "num_tokens": 29885619.0, + "step": 6530 + }, + { + "entropy": 0.7723901643417775, + "epoch": 0.61668297167643, + "grad_norm": 0.5625, + "learning_rate": 1.4128943237264397e-06, + "loss": 0.6222280502319336, + "mean_token_accuracy": 0.7883600037544966, + "num_tokens": 29929441.0, + "step": 6540 + }, + { + "entropy": 0.7317868547514081, + "epoch": 0.6176259120000943, + "grad_norm": 0.28515625, + "learning_rate": 1.4056087364639177e-06, + "loss": 0.6348618984222412, + "mean_token_accuracy": 0.7977587293833495, + "num_tokens": 29980994.0, + "step": 6550 + }, + { + "entropy": 0.6215764599852264, + "epoch": 0.6185688523237586, + "grad_norm": 0.30859375, + "learning_rate": 1.3983346288478934e-06, + "loss": 0.46146564483642577, + "mean_token_accuracy": 0.8226776365190744, + "num_tokens": 30036423.0, + "step": 6560 + }, + { + "entropy": 0.7115271213464439, + "epoch": 0.6195117926474228, + "grad_norm": 0.6171875, + "learning_rate": 1.3910720771803138e-06, + "loss": 0.5262360572814941, + "mean_token_accuracy": 0.815481587126851, + "num_tokens": 30083567.0, + "step": 6570 + }, + { + "entropy": 0.6607028277590871, + "epoch": 0.6204547329710871, + "grad_norm": 0.546875, + "learning_rate": 1.3838211576419084e-06, + "loss": 0.6297407627105713, + "mean_token_accuracy": 0.8033003844320774, + "num_tokens": 30123282.0, + "step": 6580 + }, + { + "entropy": 0.8542975519783795, + "epoch": 0.6213976732947514, + "grad_norm": 0.380859375, + "learning_rate": 1.3765819462913935e-06, + "loss": 0.6734577655792237, + "mean_token_accuracy": 0.7789794001728296, + "num_tokens": 30175834.0, + "step": 6590 + }, + { + "entropy": 0.6683274048380554, + "epoch": 0.6223406136184156, + "grad_norm": 0.2578125, + "learning_rate": 1.3693545190646687e-06, + "loss": 0.5290188312530517, + "mean_token_accuracy": 0.8123727187514305, + "num_tokens": 30230839.0, + "step": 6600 + }, + { + "entropy": 0.8296206023544073, + "epoch": 0.6232835539420799, + "grad_norm": 0.376953125, + "learning_rate": 1.3621389517740278e-06, + "loss": 0.6783339023590088, + "mean_token_accuracy": 0.772437755856663, + "num_tokens": 30276477.0, + "step": 6610 + }, + { + "entropy": 0.7358615064062178, + "epoch": 0.6242264942657442, + "grad_norm": 0.55078125, + "learning_rate": 1.354935320107355e-06, + "loss": 0.7653596878051758, + "mean_token_accuracy": 0.7917595565319061, + "num_tokens": 30322719.0, + "step": 6620 + }, + { + "entropy": 0.6063522500917315, + "epoch": 0.6251694345894084, + "grad_norm": 0.421875, + "learning_rate": 1.3477436996273391e-06, + "loss": 0.493528938293457, + "mean_token_accuracy": 0.8317346017807722, + "num_tokens": 30366460.0, + "step": 6630 + }, + { + "entropy": 0.6097435717936606, + "epoch": 0.6261123749130727, + "grad_norm": 0.265625, + "learning_rate": 1.340564165770677e-06, + "loss": 0.5172214508056641, + "mean_token_accuracy": 0.8287797518074512, + "num_tokens": 30413005.0, + "step": 6640 + }, + { + "entropy": 0.7791145509108901, + "epoch": 0.627055315236737, + "grad_norm": 0.330078125, + "learning_rate": 1.3333967938472791e-06, + "loss": 0.6306872844696045, + "mean_token_accuracy": 0.7808555860072375, + "num_tokens": 30452797.0, + "step": 6650 + }, + { + "entropy": 0.7186586172319949, + "epoch": 0.6279982555604012, + "grad_norm": 0.2060546875, + "learning_rate": 1.326241659039488e-06, + "loss": 0.7230193614959717, + "mean_token_accuracy": 0.8053840888664127, + "num_tokens": 30501667.0, + "step": 6660 + }, + { + "entropy": 0.713790905289352, + "epoch": 0.6289411958840655, + "grad_norm": 0.36328125, + "learning_rate": 1.3190988364012798e-06, + "loss": 0.664982271194458, + "mean_token_accuracy": 0.8036589544266463, + "num_tokens": 30546332.0, + "step": 6670 + }, + { + "entropy": 0.7191013899631798, + "epoch": 0.6298841362077298, + "grad_norm": 1.1640625, + "learning_rate": 1.3119684008574854e-06, + "loss": 0.6084727287292481, + "mean_token_accuracy": 0.7926711194217205, + "num_tokens": 30592915.0, + "step": 6680 + }, + { + "entropy": 0.7162378825247288, + "epoch": 0.630827076531394, + "grad_norm": 0.51171875, + "learning_rate": 1.3048504272029983e-06, + "loss": 0.6665098190307617, + "mean_token_accuracy": 0.7999292813241482, + "num_tokens": 30630783.0, + "step": 6690 + }, + { + "entropy": 0.6918003332801164, + "epoch": 0.6317700168550583, + "grad_norm": 0.44140625, + "learning_rate": 1.297744990101995e-06, + "loss": 0.7901312828063964, + "mean_token_accuracy": 0.8032176718115807, + "num_tokens": 30684178.0, + "step": 6700 + }, + { + "entropy": 0.6030714954715222, + "epoch": 0.6327129571787226, + "grad_norm": 0.470703125, + "learning_rate": 1.2906521640871492e-06, + "loss": 0.5561746597290039, + "mean_token_accuracy": 0.8341683767735958, + "num_tokens": 30729882.0, + "step": 6710 + }, + { + "entropy": 0.616637565754354, + "epoch": 0.6336558975023868, + "grad_norm": 0.310546875, + "learning_rate": 1.2835720235588475e-06, + "loss": 0.572420072555542, + "mean_token_accuracy": 0.8205343771725893, + "num_tokens": 30779139.0, + "step": 6720 + }, + { + "entropy": 0.6006744123529643, + "epoch": 0.6345988378260511, + "grad_norm": 0.3984375, + "learning_rate": 1.2765046427844157e-06, + "loss": 0.521686601638794, + "mean_token_accuracy": 0.8351531434804201, + "num_tokens": 30826518.0, + "step": 6730 + }, + { + "entropy": 0.7569279128685593, + "epoch": 0.6355417781497154, + "grad_norm": 0.4609375, + "learning_rate": 1.2694500958973327e-06, + "loss": 0.6009937286376953, + "mean_token_accuracy": 0.789092281088233, + "num_tokens": 30881879.0, + "step": 6740 + }, + { + "entropy": 0.5884561772458256, + "epoch": 0.6364847184733796, + "grad_norm": 0.412109375, + "learning_rate": 1.262408456896458e-06, + "loss": 0.520009183883667, + "mean_token_accuracy": 0.8386049326509237, + "num_tokens": 30927036.0, + "step": 6750 + }, + { + "entropy": 0.5804953049868345, + "epoch": 0.6374276587970439, + "grad_norm": 0.65234375, + "learning_rate": 1.2553797996452504e-06, + "loss": 0.42743620872497556, + "mean_token_accuracy": 0.8361934781074524, + "num_tokens": 30973950.0, + "step": 6760 + }, + { + "entropy": 0.651206433866173, + "epoch": 0.6383705991207081, + "grad_norm": 0.28125, + "learning_rate": 1.2483641978710023e-06, + "loss": 0.5765644550323487, + "mean_token_accuracy": 0.8276426322758198, + "num_tokens": 31027156.0, + "step": 6770 + }, + { + "entropy": 0.7943007486872375, + "epoch": 0.6393135394443724, + "grad_norm": 0.2109375, + "learning_rate": 1.2413617251640538e-06, + "loss": 0.6862638473510743, + "mean_token_accuracy": 0.7906891793012619, + "num_tokens": 31081926.0, + "step": 6780 + }, + { + "entropy": 0.7911325155757367, + "epoch": 0.6402564797680367, + "grad_norm": 0.53125, + "learning_rate": 1.2343724549770311e-06, + "loss": 0.7334757328033448, + "mean_token_accuracy": 0.7799281593412161, + "num_tokens": 31123520.0, + "step": 6790 + }, + { + "entropy": 0.6264763680286706, + "epoch": 0.641199420091701, + "grad_norm": 0.404296875, + "learning_rate": 1.2273964606240718e-06, + "loss": 0.5062834739685058, + "mean_token_accuracy": 0.813581820204854, + "num_tokens": 31169681.0, + "step": 6800 + }, + { + "entropy": 0.6135468325577677, + "epoch": 0.6421423604153652, + "grad_norm": 0.388671875, + "learning_rate": 1.220433815280054e-06, + "loss": 0.4851649284362793, + "mean_token_accuracy": 0.8191511053591967, + "num_tokens": 31215610.0, + "step": 6810 + }, + { + "entropy": 0.8527200820855796, + "epoch": 0.6430853007390295, + "grad_norm": 0.404296875, + "learning_rate": 1.2134845919798346e-06, + "loss": 0.9052200317382812, + "mean_token_accuracy": 0.7757729774340987, + "num_tokens": 31256328.0, + "step": 6820 + }, + { + "entropy": 0.6696253786794841, + "epoch": 0.6440282410626937, + "grad_norm": 0.330078125, + "learning_rate": 1.2065488636174761e-06, + "loss": 0.4900521755218506, + "mean_token_accuracy": 0.81925327219069, + "num_tokens": 31303360.0, + "step": 6830 + }, + { + "entropy": 0.7389580006711185, + "epoch": 0.644971181386358, + "grad_norm": 0.6171875, + "learning_rate": 1.1996267029454882e-06, + "loss": 0.6637410640716552, + "mean_token_accuracy": 0.7897630255669356, + "num_tokens": 31356452.0, + "step": 6840 + }, + { + "entropy": 0.7582534276880324, + "epoch": 0.6459141217100223, + "grad_norm": 0.314453125, + "learning_rate": 1.1927181825740598e-06, + "loss": 0.6377841472625733, + "mean_token_accuracy": 0.78179000467062, + "num_tokens": 31402638.0, + "step": 6850 + }, + { + "entropy": 0.7765328639186919, + "epoch": 0.6468570620336865, + "grad_norm": 1.4765625, + "learning_rate": 1.1858233749703008e-06, + "loss": 0.7192119121551513, + "mean_token_accuracy": 0.7862007327377796, + "num_tokens": 31441999.0, + "step": 6860 + }, + { + "entropy": 0.6889529786072671, + "epoch": 0.6478000023573508, + "grad_norm": 0.455078125, + "learning_rate": 1.1789423524574816e-06, + "loss": 0.5516982555389405, + "mean_token_accuracy": 0.8100367560982704, + "num_tokens": 31496439.0, + "step": 6870 + }, + { + "entropy": 0.5635810997337103, + "epoch": 0.6487429426810151, + "grad_norm": 0.333984375, + "learning_rate": 1.1720751872142708e-06, + "loss": 0.512902307510376, + "mean_token_accuracy": 0.8280544430017471, + "num_tokens": 31543724.0, + "step": 6880 + }, + { + "entropy": 0.6845852768979966, + "epoch": 0.6496858830046793, + "grad_norm": 0.361328125, + "learning_rate": 1.1652219512739838e-06, + "loss": 0.5510530471801758, + "mean_token_accuracy": 0.8120139855891466, + "num_tokens": 31594284.0, + "step": 6890 + }, + { + "entropy": 0.6481620660051703, + "epoch": 0.6506288233283436, + "grad_norm": 0.5390625, + "learning_rate": 1.1583827165238206e-06, + "loss": 0.5910237789154053, + "mean_token_accuracy": 0.8181051228195428, + "num_tokens": 31635062.0, + "step": 6900 + }, + { + "entropy": 0.6908615042455495, + "epoch": 0.6515717636520079, + "grad_norm": 0.84375, + "learning_rate": 1.15155755470412e-06, + "loss": 0.6882299423217774, + "mean_token_accuracy": 0.8048533439636231, + "num_tokens": 31678473.0, + "step": 6910 + }, + { + "entropy": 0.7044286559335887, + "epoch": 0.6525147039756721, + "grad_norm": 0.609375, + "learning_rate": 1.1447465374075975e-06, + "loss": 0.7313314437866211, + "mean_token_accuracy": 0.8019507348537445, + "num_tokens": 31729255.0, + "step": 6920 + }, + { + "entropy": 0.6504749067127704, + "epoch": 0.6534576442993364, + "grad_norm": 0.490234375, + "learning_rate": 1.137949736078603e-06, + "loss": 0.5372074604034424, + "mean_token_accuracy": 0.8073802709579467, + "num_tokens": 31768907.0, + "step": 6930 + }, + { + "entropy": 0.7473512006923556, + "epoch": 0.6544005846230007, + "grad_norm": 0.423828125, + "learning_rate": 1.1311672220123664e-06, + "loss": 0.6788872241973877, + "mean_token_accuracy": 0.7935893721878529, + "num_tokens": 31812183.0, + "step": 6940 + }, + { + "entropy": 0.7024919440969825, + "epoch": 0.6553435249466649, + "grad_norm": 0.40625, + "learning_rate": 1.1243990663542497e-06, + "loss": 0.6041145324707031, + "mean_token_accuracy": 0.8105067923665047, + "num_tokens": 31862178.0, + "step": 6950 + }, + { + "entropy": 0.6629848030395806, + "epoch": 0.6562864652703292, + "grad_norm": 0.828125, + "learning_rate": 1.1176453400990049e-06, + "loss": 0.676570463180542, + "mean_token_accuracy": 0.8191709652543068, + "num_tokens": 31907853.0, + "step": 6960 + }, + { + "entropy": 0.6834048548713326, + "epoch": 0.6572294055939935, + "grad_norm": 0.921875, + "learning_rate": 1.1109061140900224e-06, + "loss": 0.5216798305511474, + "mean_token_accuracy": 0.8132496692240239, + "num_tokens": 31952569.0, + "step": 6970 + }, + { + "entropy": 0.6860712924972177, + "epoch": 0.6581723459176577, + "grad_norm": 0.421875, + "learning_rate": 1.104181459018596e-06, + "loss": 0.5502390384674072, + "mean_token_accuracy": 0.8120945893228054, + "num_tokens": 32000914.0, + "step": 6980 + }, + { + "entropy": 0.6751578035764396, + "epoch": 0.659115286241322, + "grad_norm": 0.6640625, + "learning_rate": 1.0974714454231738e-06, + "loss": 0.5092285633087158, + "mean_token_accuracy": 0.8091344766318798, + "num_tokens": 32047882.0, + "step": 6990 + }, + { + "entropy": 0.6862224272452295, + "epoch": 0.6600582265649863, + "grad_norm": 0.265625, + "learning_rate": 1.0907761436886238e-06, + "loss": 0.4828913688659668, + "mean_token_accuracy": 0.8198781322687865, + "num_tokens": 32093189.0, + "step": 7000 + } + ], + "logging_steps": 10, + "max_steps": 10000, + "num_input_tokens_seen": 0, + "num_train_epochs": 1, + "save_steps": 500, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.4573656096110735e+18, + "train_batch_size": 1, + "trial_name": null, + "trial_params": null +} diff --git a/training_args.bin b/training_args.bin new file mode 100644 index 0000000..52f5708 --- /dev/null +++ b/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:13aa9d97ced5b695de3a8eccad8f972acb8e0b60b29e23859b1e09d6779a9ace +size 5713