初始化项目,由ModelHub XC社区提供模型

Model: flax-community/gpt-2-tamil
Source: Original Platform
This commit is contained in:
ModelHub XC
2026-08-01 19:01:18 +08:00
commit cf8c42595a
55 changed files with 2445 additions and 0 deletions

0
scripts/run.log Normal file
View File

View File

@@ -0,0 +1,25 @@
#!/usr/bin/env bash
python ../src/run_clm_flax.py \
--output_dir="${MODEL_DIR}" \
--model_type="gpt2" \
--config_name="${MODEL_DIR}" \
--tokenizer_name="${MODEL_DIR}" \
--dataset_name="oscar" \
--dataset_config_name="unshuffled_deduplicated_ta" \
--do_train --do_eval \
--block_size="512" \
--per_device_train_batch_size="64" \
--per_device_eval_batch_size="64" \
--learning_rate="3e-5" \
--warmup_steps="1000" \
--adam_beta1="0.9" --adam_beta2="0.98" --weight_decay="0.01" \
--overwrite_output_dir \
--num_train_epochs="25" \
--report_to wandb \
--run_name trial \
--logging_steps="500" \
--save_steps="2500" \
--eval_steps="2500" \
--preprocessing_num_workers="90" \
#--push_to_hub
2>&1 | tee run.log

View File

@@ -0,0 +1 @@
run-20210712_164633-1ddv4131/logs/debug-internal.log

1
scripts/wandb/debug.log Symbolic link
View File

@@ -0,0 +1 @@
run-20210712_164633-1ddv4131/logs/debug.log

1
scripts/wandb/latest-run Symbolic link
View File

@@ -0,0 +1 @@
run-20210712_164633-1ddv4131

View File

@@ -0,0 +1,301 @@
wandb_version: 1
__cached__setup_devices:
desc: null
value: cpu
_n_gpu:
desc: null
value: 0
_wandb:
desc: null
value:
cli_version: 0.10.33
framework: huggingface
huggingface_version: 4.9.0.dev0
is_jupyter_run: false
is_kaggle_kernel: false
python_version: 3.8.10
t:
1:
- 1
- 3
- 11
4: 3.8.10
5: 0.10.33
6: 4.9.0.dev0
8:
- 5
adafactor:
desc: null
value: false
adam_beta1:
desc: null
value: 0.9
adam_beta2:
desc: null
value: 0.98
adam_epsilon:
desc: null
value: 1.0e-08
block_size:
desc: null
value: 512
cache_dir:
desc: null
value: null
config_name:
desc: null
value: ../gpt-2-tamil/
dataloader_drop_last:
desc: null
value: false
dataloader_num_workers:
desc: null
value: 0
dataloader_pin_memory:
desc: null
value: true
dataset_config_name:
desc: null
value: unshuffled_deduplicated_ta
dataset_name:
desc: null
value: oscar
ddp_find_unused_parameters:
desc: null
value: null
debug:
desc: null
value: []
deepspeed:
desc: null
value: null
disable_tqdm:
desc: null
value: false
do_eval:
desc: null
value: true
do_predict:
desc: null
value: false
do_train:
desc: null
value: true
dtype:
desc: null
value: float32
eval_accumulation_steps:
desc: null
value: null
eval_steps:
desc: null
value: 500
evaluation_strategy:
desc: null
value: IntervalStrategy.NO
fp16:
desc: null
value: false
fp16_backend:
desc: null
value: auto
fp16_full_eval:
desc: null
value: false
fp16_opt_level:
desc: null
value: O1
gradient_accumulation_steps:
desc: null
value: 1
greater_is_better:
desc: null
value: null
group_by_length:
desc: null
value: false
ignore_data_skip:
desc: null
value: false
label_names:
desc: null
value: null
label_smoothing_factor:
desc: null
value: 0.0
learning_rate:
desc: null
value: 3.0e-05
length_column_name:
desc: null
value: length
load_best_model_at_end:
desc: null
value: false
local_rank:
desc: null
value: -1
log_level:
desc: null
value: -1
log_level_replica:
desc: null
value: -1
log_on_each_node:
desc: null
value: true
logging_dir:
desc: null
value: ../tmp/../gpt-2-tamil/runs/Jul11_17-18-14_t1v-n-ebe36c53-w-0
logging_first_step:
desc: null
value: false
logging_steps:
desc: null
value: 500
logging_strategy:
desc: null
value: IntervalStrategy.STEPS
lr_scheduler_type:
desc: null
value: SchedulerType.LINEAR
max_eval_samples:
desc: null
value: null
max_grad_norm:
desc: null
value: 1.0
max_steps:
desc: null
value: -1
max_train_samples:
desc: null
value: null
metric_for_best_model:
desc: null
value: null
model_name_or_path:
desc: null
value: null
model_type:
desc: null
value: gpt2
mp_parameters:
desc: null
value: ''
no_cuda:
desc: null
value: false
num_train_epochs:
desc: null
value: 1.0
output_dir:
desc: null
value: ../tmp/../gpt-2-tamil/
overwrite_cache:
desc: null
value: false
overwrite_output_dir:
desc: null
value: true
past_index:
desc: null
value: -1
per_device_eval_batch_size:
desc: null
value: 64
per_device_train_batch_size:
desc: null
value: 64
per_gpu_eval_batch_size:
desc: null
value: null
per_gpu_train_batch_size:
desc: null
value: null
prediction_loss_only:
desc: null
value: false
preprocessing_num_workers:
desc: null
value: null
push_to_hub:
desc: null
value: false
push_to_hub_model_id:
desc: null
value: gpt-2-tamil
push_to_hub_organization:
desc: null
value: null
push_to_hub_token:
desc: null
value: null
remove_unused_columns:
desc: null
value: true
report_to:
desc: null
value:
- wandb
resume_from_checkpoint:
desc: null
value: null
run_name:
desc: null
value: trial
save_on_each_node:
desc: null
value: false
save_steps:
desc: null
value: 500
save_strategy:
desc: null
value: IntervalStrategy.STEPS
save_total_limit:
desc: null
value: null
seed:
desc: null
value: 42
sharded_ddp:
desc: null
value: []
skip_memory_metrics:
desc: null
value: true
tokenizer_name:
desc: null
value: ../gpt-2-tamil/
tpu_metrics_debug:
desc: null
value: false
tpu_num_cores:
desc: null
value: null
train_file:
desc: null
value: null
use_fast_tokenizer:
desc: null
value: true
use_legacy_prediction_loop:
desc: null
value: false
validation_file:
desc: null
value: null
validation_split_percentage:
desc: null
value: 5
warmup_ratio:
desc: null
value: 0.0
warmup_steps:
desc: null
value: 1000
weight_decay:
desc: null
value: 0.01

View File

@@ -0,0 +1 @@
/home/tweety_abi/GPT2-Tamil/gpt-2-tamil/events.out.tfevents.1626064970.t1v-n-ebe36c53-w-0.400773.3.v2

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:83c77cb8fdf96d6479ff9c389029839beb48a924dec227d80f708b2d1f1dd66f
size 107953

View File

@@ -0,0 +1,123 @@
absl-py==0.13.0
aiohttp==3.7.4.post0
appdirs==1.4.4
astunparse==1.6.3
async-timeout==3.0.1
attrs==21.2.0
backcall==0.2.0
black==21.6b0
cachetools==4.2.2
certifi==2021.5.30
cfgv==3.3.0
chardet==4.0.0
chex==0.0.7
click==8.0.1
configparser==5.0.2
cycler==0.10.0
datasets==1.8.1.dev0
decorator==5.0.9
dill==0.3.4
distlib==0.3.2
dm-tree==0.1.6
docker-pycreds==0.4.0
filelock==3.0.12
flake8==3.9.2
flatbuffers==1.12
flax==0.3.4
fsspec==2021.6.1
gast==0.4.0
gitdb==4.0.7
gitpython==3.1.18
google-auth-oauthlib==0.4.4
google-auth==1.32.1
google-pasta==0.2.0
grpcio==1.34.1
h5py==3.1.0
huggingface-hub==0.0.12
identify==2.2.10
idna==2.10
ipython-genutils==0.2.0
ipython==7.25.0
isort==5.9.1
jax==0.2.16
jaxlib==0.1.68
jedi==0.18.0
joblib==1.0.1
keras-nightly==2.5.0.dev2021032900
keras-preprocessing==1.1.2
kiwisolver==1.3.1
libtpu-nightly==0.1.dev20210615
markdown==3.3.4
matplotlib-inline==0.1.2
matplotlib==3.4.2
mccabe==0.6.1
msgpack==1.0.2
multidict==5.1.0
multiprocess==0.70.12.2
mypy-extensions==0.4.3
nodeenv==1.6.0
numpy==1.19.5
oauthlib==3.1.1
opt-einsum==3.3.0
optax==0.0.8
packaging==20.9
pandas==1.2.5
parso==0.8.2
pathspec==0.8.1
pathtools==0.1.2
pexpect==4.8.0
pickleshare==0.7.5
pillow==8.3.0
pip==20.0.2
pkg-resources==0.0.0
pre-commit==2.13.0
promise==2.3
prompt-toolkit==3.0.19
protobuf==3.17.3
psutil==5.8.0
ptyprocess==0.7.0
pyarrow==4.0.1
pyasn1-modules==0.2.8
pyasn1==0.4.8
pycodestyle==2.7.0
pyflakes==2.3.1
pygments==2.9.0
pyparsing==2.4.7
python-dateutil==2.8.1
pytz==2021.1
pyyaml==5.4.1
regex==2021.7.1
requests-oauthlib==1.3.0
requests==2.25.1
rsa==4.7.2
sacremoses==0.0.45
scipy==1.7.0
sentry-sdk==1.3.0
setuptools==44.0.0
shortuuid==1.0.1
six==1.15.0
smmap==4.0.0
subprocess32==3.5.4
tensorboard-data-server==0.6.1
tensorboard-plugin-wit==1.8.0
tensorboard==2.5.0
tensorflow-estimator==2.5.0
tensorflow==2.5.0
termcolor==1.1.0
tokenizers==0.10.3
toml==0.10.2
toolz==0.11.1
torch==1.9.0
tqdm==4.61.1
traitlets==5.0.5
transformers==4.9.0.dev0
typing-extensions==3.7.4.3
urllib3==1.26.6
virtualenv==20.4.7
wandb==0.10.33
wcwidth==0.2.5
werkzeug==2.0.1
wheel==0.36.2
wrapt==1.12.1
xxhash==2.0.2
yarl==1.6.3

View File

@@ -0,0 +1,45 @@
{
"os": "Linux-5.4.0-1043-gcp-x86_64-with-glibc2.29",
"python": "3.8.10",
"heartbeatAt": "2021-07-12T04:42:50.208592",
"startedAt": "2021-07-12T04:42:48.264668",
"docker": null,
"cpu_count": 96,
"cuda": null,
"args": [
"--output_dir=../tmp/../gpt-2-tamil/",
"--model_type=gpt2",
"--config_name=../gpt-2-tamil/",
"--tokenizer_name=../gpt-2-tamil/",
"--dataset_name=oscar",
"--dataset_config_name=unshuffled_deduplicated_ta",
"--do_train",
"--do_eval",
"--block_size=512",
"--per_device_train_batch_size=64",
"--per_device_eval_batch_size=64",
"--learning_rate=3e-5",
"--warmup_steps=1000",
"--adam_beta1=0.9",
"--adam_beta2=0.98",
"--weight_decay=0.01",
"--overwrite_output_dir",
"--num_train_epochs=1",
"--report_to",
"wandb",
"--run_name",
"trial"
],
"state": "running",
"program": "../src/run_clm_flax.py",
"codePath": "src/run_clm_flax.py",
"git": {
"remote": "https://github.com/AbinayaM02/GPT2-Tamil.git",
"commit": "a828229d00c071e9ced919095290b80e4781210e"
},
"email": "abinaya.m02@mphasis.com",
"root": "/home/tweety_abi/GPT2-Tamil",
"host": "t1v-n-ebe36c53-w-0",
"username": "tweety_abi",
"executable": "/home/tweety_abi/gpt2_env/bin/python"
}

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:5fcfc08cf0afaa70518eae77306ccb85256b1c75804bb875c43e69ead82eecee
size 351322

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:629872cc9a122d0b701da9fb5b2d152a25a06d9c316ff22a307c2d5297a5f684
size 5672

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:77335af984a7fc18e2e903ce57acfa4f5ee5a60613ffb55a60c3e1996007f5e9
size 327917

View File

@@ -0,0 +1,305 @@
wandb_version: 1
__cached__setup_devices:
desc: null
value: cpu
_n_gpu:
desc: null
value: 0
_wandb:
desc: null
value:
cli_version: 0.10.33
framework: huggingface
huggingface_version: 4.9.0.dev0
is_jupyter_run: false
is_kaggle_kernel: false
python_version: 3.8.10
t:
1:
- 1
- 3
- 11
2:
- 1
- 3
- 11
4: 3.8.10
5: 0.10.33
6: 4.9.0.dev0
8:
- 5
adafactor:
desc: null
value: false
adam_beta1:
desc: null
value: 0.9
adam_beta2:
desc: null
value: 0.98
adam_epsilon:
desc: null
value: 1.0e-08
block_size:
desc: null
value: 512
cache_dir:
desc: null
value: null
config_name:
desc: null
value: ../gpt-2-tamil/
dataloader_drop_last:
desc: null
value: false
dataloader_num_workers:
desc: null
value: 0
dataloader_pin_memory:
desc: null
value: true
dataset_config_name:
desc: null
value: unshuffled_deduplicated_ta
dataset_name:
desc: null
value: oscar
ddp_find_unused_parameters:
desc: null
value: null
debug:
desc: null
value: []
deepspeed:
desc: null
value: null
disable_tqdm:
desc: null
value: false
do_eval:
desc: null
value: true
do_predict:
desc: null
value: false
do_train:
desc: null
value: true
dtype:
desc: null
value: float32
eval_accumulation_steps:
desc: null
value: null
eval_steps:
desc: null
value: 2500
evaluation_strategy:
desc: null
value: IntervalStrategy.NO
fp16:
desc: null
value: false
fp16_backend:
desc: null
value: auto
fp16_full_eval:
desc: null
value: false
fp16_opt_level:
desc: null
value: O1
gradient_accumulation_steps:
desc: null
value: 1
greater_is_better:
desc: null
value: null
group_by_length:
desc: null
value: false
ignore_data_skip:
desc: null
value: false
label_names:
desc: null
value: null
label_smoothing_factor:
desc: null
value: 0.0
learning_rate:
desc: null
value: 3.0e-05
length_column_name:
desc: null
value: length
load_best_model_at_end:
desc: null
value: false
local_rank:
desc: null
value: -1
log_level:
desc: null
value: -1
log_level_replica:
desc: null
value: -1
log_on_each_node:
desc: null
value: true
logging_dir:
desc: null
value: ../gpt-2-tamil/runs/Jul12_16-26-59_t1v-n-ebe36c53-w-0
logging_first_step:
desc: null
value: false
logging_steps:
desc: null
value: 500
logging_strategy:
desc: null
value: IntervalStrategy.STEPS
lr_scheduler_type:
desc: null
value: SchedulerType.LINEAR
max_eval_samples:
desc: null
value: null
max_grad_norm:
desc: null
value: 1.0
max_steps:
desc: null
value: -1
max_train_samples:
desc: null
value: null
metric_for_best_model:
desc: null
value: null
model_name_or_path:
desc: null
value: null
model_type:
desc: null
value: gpt2
mp_parameters:
desc: null
value: ''
no_cuda:
desc: null
value: false
num_train_epochs:
desc: null
value: 1.0
output_dir:
desc: null
value: ../gpt-2-tamil/
overwrite_cache:
desc: null
value: false
overwrite_output_dir:
desc: null
value: true
past_index:
desc: null
value: -1
per_device_eval_batch_size:
desc: null
value: 64
per_device_train_batch_size:
desc: null
value: 64
per_gpu_eval_batch_size:
desc: null
value: null
per_gpu_train_batch_size:
desc: null
value: null
prediction_loss_only:
desc: null
value: false
preprocessing_num_workers:
desc: null
value: 90
push_to_hub:
desc: null
value: false
push_to_hub_model_id:
desc: null
value: gpt-2-tamil
push_to_hub_organization:
desc: null
value: null
push_to_hub_token:
desc: null
value: null
remove_unused_columns:
desc: null
value: true
report_to:
desc: null
value:
- wandb
resume_from_checkpoint:
desc: null
value: null
run_name:
desc: null
value: trial
save_on_each_node:
desc: null
value: false
save_steps:
desc: null
value: 2500
save_strategy:
desc: null
value: IntervalStrategy.STEPS
save_total_limit:
desc: null
value: null
seed:
desc: null
value: 42
sharded_ddp:
desc: null
value: []
skip_memory_metrics:
desc: null
value: true
tokenizer_name:
desc: null
value: ../gpt-2-tamil/
tpu_metrics_debug:
desc: null
value: false
tpu_num_cores:
desc: null
value: null
train_file:
desc: null
value: null
use_fast_tokenizer:
desc: null
value: true
use_legacy_prediction_loop:
desc: null
value: false
validation_file:
desc: null
value: null
validation_split_percentage:
desc: null
value: 5
warmup_ratio:
desc: null
value: 0.0
warmup_steps:
desc: null
value: 1000
weight_decay:
desc: null
value: 0.01

View File

@@ -0,0 +1 @@
/home/tweety_abi/GPT2-Tamil/gpt-2-tamil/events.out.tfevents.1626108088.t1v-n-ebe36c53-w-0.483452.3.v2

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:e0919562e4d7c8bbdebb2074976c553f66727900bc770c5dd9d8041e3a008931
size 2408

View File

@@ -0,0 +1,123 @@
absl-py==0.13.0
aiohttp==3.7.4.post0
appdirs==1.4.4
astunparse==1.6.3
async-timeout==3.0.1
attrs==21.2.0
backcall==0.2.0
black==21.6b0
cachetools==4.2.2
certifi==2021.5.30
cfgv==3.3.0
chardet==4.0.0
chex==0.0.7
click==8.0.1
configparser==5.0.2
cycler==0.10.0
datasets==1.8.1.dev0
decorator==5.0.9
dill==0.3.4
distlib==0.3.2
dm-tree==0.1.6
docker-pycreds==0.4.0
filelock==3.0.12
flake8==3.9.2
flatbuffers==1.12
flax==0.3.4
fsspec==2021.6.1
gast==0.4.0
gitdb==4.0.7
gitpython==3.1.18
google-auth-oauthlib==0.4.4
google-auth==1.32.1
google-pasta==0.2.0
grpcio==1.34.1
h5py==3.1.0
huggingface-hub==0.0.12
identify==2.2.10
idna==2.10
ipython-genutils==0.2.0
ipython==7.25.0
isort==5.9.1
jax==0.2.16
jaxlib==0.1.68
jedi==0.18.0
joblib==1.0.1
keras-nightly==2.5.0.dev2021032900
keras-preprocessing==1.1.2
kiwisolver==1.3.1
libtpu-nightly==0.1.dev20210615
markdown==3.3.4
matplotlib-inline==0.1.2
matplotlib==3.4.2
mccabe==0.6.1
msgpack==1.0.2
multidict==5.1.0
multiprocess==0.70.12.2
mypy-extensions==0.4.3
nodeenv==1.6.0
numpy==1.19.5
oauthlib==3.1.1
opt-einsum==3.3.0
optax==0.0.8
packaging==20.9
pandas==1.2.5
parso==0.8.2
pathspec==0.8.1
pathtools==0.1.2
pexpect==4.8.0
pickleshare==0.7.5
pillow==8.3.0
pip==20.0.2
pkg-resources==0.0.0
pre-commit==2.13.0
promise==2.3
prompt-toolkit==3.0.19
protobuf==3.17.3
psutil==5.8.0
ptyprocess==0.7.0
pyarrow==4.0.1
pyasn1-modules==0.2.8
pyasn1==0.4.8
pycodestyle==2.7.0
pyflakes==2.3.1
pygments==2.9.0
pyparsing==2.4.7
python-dateutil==2.8.1
pytz==2021.1
pyyaml==5.4.1
regex==2021.7.1
requests-oauthlib==1.3.0
requests==2.25.1
rsa==4.7.2
sacremoses==0.0.45
scipy==1.7.0
sentry-sdk==1.3.0
setuptools==44.0.0
shortuuid==1.0.1
six==1.15.0
smmap==4.0.0
subprocess32==3.5.4
tensorboard-data-server==0.6.1
tensorboard-plugin-wit==1.8.0
tensorboard==2.5.0
tensorflow-estimator==2.5.0
tensorflow==2.5.0
termcolor==1.1.0
tokenizers==0.10.3
toml==0.10.2
toolz==0.11.1
torch==1.9.0
tqdm==4.61.1
traitlets==5.0.5
transformers==4.9.0.dev0
typing-extensions==3.7.4.3
urllib3==1.26.6
virtualenv==20.4.7
wandb==0.10.33
wcwidth==0.2.5
werkzeug==2.0.1
wheel==0.36.2
wrapt==1.12.1
xxhash==2.0.2
yarl==1.6.3

View File

@@ -0,0 +1,49 @@
{
"os": "Linux-5.4.0-1043-gcp-x86_64-with-glibc2.29",
"python": "3.8.10",
"heartbeatAt": "2021-07-12T16:41:28.249908",
"startedAt": "2021-07-12T16:41:26.246514",
"docker": null,
"cpu_count": 96,
"cuda": null,
"args": [
"--output_dir=../gpt-2-tamil/",
"--model_type=gpt2",
"--config_name=../gpt-2-tamil/",
"--tokenizer_name=../gpt-2-tamil/",
"--dataset_name=oscar",
"--dataset_config_name=unshuffled_deduplicated_ta",
"--do_train",
"--do_eval",
"--block_size=512",
"--per_device_train_batch_size=64",
"--per_device_eval_batch_size=64",
"--learning_rate=3e-5",
"--warmup_steps=1000",
"--adam_beta1=0.9",
"--adam_beta2=0.98",
"--weight_decay=0.01",
"--overwrite_output_dir",
"--num_train_epochs=1",
"--report_to",
"wandb",
"--run_name",
"trial",
"--logging_steps=500",
"--save_steps=2500",
"--eval_steps=2500",
"--preprocessing_num_workers=90"
],
"state": "running",
"program": "../src/run_clm_flax.py",
"codePath": "src/run_clm_flax.py",
"git": {
"remote": "https://github.com/AbinayaM02/GPT2-Tamil.git",
"commit": "a828229d00c071e9ced919095290b80e4781210e"
},
"email": "abinaya.m02@mphasis.com",
"root": "/home/tweety_abi/GPT2-Tamil",
"host": "t1v-n-ebe36c53-w-0",
"username": "tweety_abi",
"executable": "/home/tweety_abi/gpt2_env/bin/python"
}

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:f5042f20446f607f9de1da5328a848218a444a160203dbbe620844d138a5f041
size 28874

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:b642e86c06ccde2fecec5b035f7154289468f3126e152b9170e2e8d35b655328
size 7649

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:1302a66f7718be000865df304f0b21d1471bf7bb1cc55e4aba7e50d6f051725d
size 15809

View File

@@ -0,0 +1,305 @@
wandb_version: 1
__cached__setup_devices:
desc: null
value: cpu
_n_gpu:
desc: null
value: 0
_wandb:
desc: null
value:
cli_version: 0.10.33
framework: huggingface
huggingface_version: 4.9.0.dev0
is_jupyter_run: false
is_kaggle_kernel: false
python_version: 3.8.10
t:
1:
- 1
- 3
- 11
2:
- 1
- 3
- 11
4: 3.8.10
5: 0.10.33
6: 4.9.0.dev0
8:
- 5
adafactor:
desc: null
value: false
adam_beta1:
desc: null
value: 0.9
adam_beta2:
desc: null
value: 0.98
adam_epsilon:
desc: null
value: 1.0e-08
block_size:
desc: null
value: 512
cache_dir:
desc: null
value: null
config_name:
desc: null
value: ../gpt-2-tamil/
dataloader_drop_last:
desc: null
value: false
dataloader_num_workers:
desc: null
value: 0
dataloader_pin_memory:
desc: null
value: true
dataset_config_name:
desc: null
value: unshuffled_deduplicated_ta
dataset_name:
desc: null
value: oscar
ddp_find_unused_parameters:
desc: null
value: null
debug:
desc: null
value: []
deepspeed:
desc: null
value: null
disable_tqdm:
desc: null
value: false
do_eval:
desc: null
value: true
do_predict:
desc: null
value: false
do_train:
desc: null
value: true
dtype:
desc: null
value: float32
eval_accumulation_steps:
desc: null
value: null
eval_steps:
desc: null
value: 2500
evaluation_strategy:
desc: null
value: IntervalStrategy.NO
fp16:
desc: null
value: false
fp16_backend:
desc: null
value: auto
fp16_full_eval:
desc: null
value: false
fp16_opt_level:
desc: null
value: O1
gradient_accumulation_steps:
desc: null
value: 1
greater_is_better:
desc: null
value: null
group_by_length:
desc: null
value: false
ignore_data_skip:
desc: null
value: false
label_names:
desc: null
value: null
label_smoothing_factor:
desc: null
value: 0.0
learning_rate:
desc: null
value: 3.0e-05
length_column_name:
desc: null
value: length
load_best_model_at_end:
desc: null
value: false
local_rank:
desc: null
value: -1
log_level:
desc: null
value: -1
log_level_replica:
desc: null
value: -1
log_on_each_node:
desc: null
value: true
logging_dir:
desc: null
value: ../gpt-2-tamil/runs/Jul12_16-45-48_t1v-n-ebe36c53-w-0
logging_first_step:
desc: null
value: false
logging_steps:
desc: null
value: 500
logging_strategy:
desc: null
value: IntervalStrategy.STEPS
lr_scheduler_type:
desc: null
value: SchedulerType.LINEAR
max_eval_samples:
desc: null
value: null
max_grad_norm:
desc: null
value: 1.0
max_steps:
desc: null
value: -1
max_train_samples:
desc: null
value: null
metric_for_best_model:
desc: null
value: null
model_name_or_path:
desc: null
value: null
model_type:
desc: null
value: gpt2
mp_parameters:
desc: null
value: ''
no_cuda:
desc: null
value: false
num_train_epochs:
desc: null
value: 25.0
output_dir:
desc: null
value: ../gpt-2-tamil/
overwrite_cache:
desc: null
value: false
overwrite_output_dir:
desc: null
value: true
past_index:
desc: null
value: -1
per_device_eval_batch_size:
desc: null
value: 64
per_device_train_batch_size:
desc: null
value: 64
per_gpu_eval_batch_size:
desc: null
value: null
per_gpu_train_batch_size:
desc: null
value: null
prediction_loss_only:
desc: null
value: false
preprocessing_num_workers:
desc: null
value: 90
push_to_hub:
desc: null
value: false
push_to_hub_model_id:
desc: null
value: gpt-2-tamil
push_to_hub_organization:
desc: null
value: null
push_to_hub_token:
desc: null
value: null
remove_unused_columns:
desc: null
value: true
report_to:
desc: null
value:
- wandb
resume_from_checkpoint:
desc: null
value: null
run_name:
desc: null
value: trial
save_on_each_node:
desc: null
value: false
save_steps:
desc: null
value: 2500
save_strategy:
desc: null
value: IntervalStrategy.STEPS
save_total_limit:
desc: null
value: null
seed:
desc: null
value: 42
sharded_ddp:
desc: null
value: []
skip_memory_metrics:
desc: null
value: true
tokenizer_name:
desc: null
value: ../gpt-2-tamil/
tpu_metrics_debug:
desc: null
value: false
tpu_num_cores:
desc: null
value: null
train_file:
desc: null
value: null
use_fast_tokenizer:
desc: null
value: true
use_legacy_prediction_loop:
desc: null
value: false
validation_file:
desc: null
value: null
validation_split_percentage:
desc: null
value: 5
warmup_ratio:
desc: null
value: 0.0
warmup_steps:
desc: null
value: 1000
weight_decay:
desc: null
value: 0.01

View File

@@ -0,0 +1 @@
/home/tweety_abi/GPT2-Tamil/gpt-2-tamil/events.out.tfevents.1626108395.t1v-n-ebe36c53-w-0.486342.3.v2

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:7d9761e7442f5b6b99224ee68ee38f3b7e486ead79f4e390bf7e258dc16de973
size 4407657

View File

@@ -0,0 +1,123 @@
absl-py==0.13.0
aiohttp==3.7.4.post0
appdirs==1.4.4
astunparse==1.6.3
async-timeout==3.0.1
attrs==21.2.0
backcall==0.2.0
black==21.6b0
cachetools==4.2.2
certifi==2021.5.30
cfgv==3.3.0
chardet==4.0.0
chex==0.0.7
click==8.0.1
configparser==5.0.2
cycler==0.10.0
datasets==1.8.1.dev0
decorator==5.0.9
dill==0.3.4
distlib==0.3.2
dm-tree==0.1.6
docker-pycreds==0.4.0
filelock==3.0.12
flake8==3.9.2
flatbuffers==1.12
flax==0.3.4
fsspec==2021.6.1
gast==0.4.0
gitdb==4.0.7
gitpython==3.1.18
google-auth-oauthlib==0.4.4
google-auth==1.32.1
google-pasta==0.2.0
grpcio==1.34.1
h5py==3.1.0
huggingface-hub==0.0.12
identify==2.2.10
idna==2.10
ipython-genutils==0.2.0
ipython==7.25.0
isort==5.9.1
jax==0.2.16
jaxlib==0.1.68
jedi==0.18.0
joblib==1.0.1
keras-nightly==2.5.0.dev2021032900
keras-preprocessing==1.1.2
kiwisolver==1.3.1
libtpu-nightly==0.1.dev20210615
markdown==3.3.4
matplotlib-inline==0.1.2
matplotlib==3.4.2
mccabe==0.6.1
msgpack==1.0.2
multidict==5.1.0
multiprocess==0.70.12.2
mypy-extensions==0.4.3
nodeenv==1.6.0
numpy==1.19.5
oauthlib==3.1.1
opt-einsum==3.3.0
optax==0.0.8
packaging==20.9
pandas==1.2.5
parso==0.8.2
pathspec==0.8.1
pathtools==0.1.2
pexpect==4.8.0
pickleshare==0.7.5
pillow==8.3.0
pip==20.0.2
pkg-resources==0.0.0
pre-commit==2.13.0
promise==2.3
prompt-toolkit==3.0.19
protobuf==3.17.3
psutil==5.8.0
ptyprocess==0.7.0
pyarrow==4.0.1
pyasn1-modules==0.2.8
pyasn1==0.4.8
pycodestyle==2.7.0
pyflakes==2.3.1
pygments==2.9.0
pyparsing==2.4.7
python-dateutil==2.8.1
pytz==2021.1
pyyaml==5.4.1
regex==2021.7.1
requests-oauthlib==1.3.0
requests==2.25.1
rsa==4.7.2
sacremoses==0.0.45
scipy==1.7.0
sentry-sdk==1.3.0
setuptools==44.0.0
shortuuid==1.0.1
six==1.15.0
smmap==4.0.0
subprocess32==3.5.4
tensorboard-data-server==0.6.1
tensorboard-plugin-wit==1.8.0
tensorboard==2.5.0
tensorflow-estimator==2.5.0
tensorflow==2.5.0
termcolor==1.1.0
tokenizers==0.10.3
toml==0.10.2
toolz==0.11.1
torch==1.9.0
tqdm==4.61.1
traitlets==5.0.5
transformers==4.9.0.dev0
typing-extensions==3.7.4.3
urllib3==1.26.6
virtualenv==20.4.7
wandb==0.10.33
wcwidth==0.2.5
werkzeug==2.0.1
wheel==0.36.2
wrapt==1.12.1
xxhash==2.0.2
yarl==1.6.3

View File

@@ -0,0 +1,49 @@
{
"os": "Linux-5.4.0-1043-gcp-x86_64-with-glibc2.29",
"python": "3.8.10",
"heartbeatAt": "2021-07-12T16:46:35.350252",
"startedAt": "2021-07-12T16:46:33.416306",
"docker": null,
"cpu_count": 96,
"cuda": null,
"args": [
"--output_dir=../gpt-2-tamil/",
"--model_type=gpt2",
"--config_name=../gpt-2-tamil/",
"--tokenizer_name=../gpt-2-tamil/",
"--dataset_name=oscar",
"--dataset_config_name=unshuffled_deduplicated_ta",
"--do_train",
"--do_eval",
"--block_size=512",
"--per_device_train_batch_size=64",
"--per_device_eval_batch_size=64",
"--learning_rate=3e-5",
"--warmup_steps=1000",
"--adam_beta1=0.9",
"--adam_beta2=0.98",
"--weight_decay=0.01",
"--overwrite_output_dir",
"--num_train_epochs=25",
"--report_to",
"wandb",
"--run_name",
"trial",
"--logging_steps=500",
"--save_steps=2500",
"--eval_steps=2500",
"--preprocessing_num_workers=90"
],
"state": "running",
"program": "../src/run_clm_flax.py",
"codePath": "src/run_clm_flax.py",
"git": {
"remote": "https://github.com/AbinayaM02/GPT2-Tamil.git",
"commit": "5d59c6a635e952a0f51ef33ed713960a04e9dcb6"
},
"email": "abinaya.m02@mphasis.com",
"root": "/home/tweety_abi/GPT2-Tamil",
"host": "t1v-n-ebe36c53-w-0",
"username": "tweety_abi",
"executable": "/home/tweety_abi/gpt2_env/bin/python"
}

View File

@@ -0,0 +1 @@
{"global_step": 132500, "_timestamp": 1626248099.379086, "train_time": 743654.875, "train_learning_rate": 1.1402963906448349e-08, "_step": 264206, "train_loss": 1.1299134492874146, "eval_loss": 1.1545542478561401, "eval_perplexity": 3.1726088523864746}

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:748fffc8fe7bbd39d404a1bae61d5711a3e098491142dc28b16d5d75e32dc937
size 97283434

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:36e11410ff19af1db092231a1450397dffb80ef21248540b6d372dcf5606559c
size 8797

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:d8211487b4d0a0489ae4728120abad1be7ee4190520afc47fdae166087ae6068
size 60817322