初始化项目,由ModelHub XC社区提供模型

Model: abinayam/gpt-2-tamil
Source: Original Platform
This commit is contained in:
ModelHub XC
2026-07-17 07:06:11 +08:00
commit f301701ac2
55 changed files with 3107 additions and 0 deletions

View File

@@ -0,0 +1,25 @@
#!/usr/bin/env bash
python ../src/run_clm_flax.py \
--output_dir="${MODEL_DIR}" \
--model_type="gpt2" \
--config_name="${MODEL_DIR}" \
--tokenizer_name="${MODEL_DIR}" \
--dataset_name="oscar" \
--dataset_config_name="unshuffled_deduplicated_ta" \
--do_train --do_eval \
--block_size="512" \
--per_device_train_batch_size="64" \
--per_device_eval_batch_size="64" \
--learning_rate="3e-5" \
--warmup_steps="1000" \
--adam_beta1="0.9" --adam_beta2="0.98" --weight_decay="0.01" \
--overwrite_output_dir \
--num_train_epochs="10" \
--report_to wandb \
--run_name trial \
--logging_steps="500" \
--save_steps="2500" \
--eval_steps="2500" \
--preprocessing_num_workers="90" \
#--push_to_hub
2>&1 | tee run.log

1
scripts/wandb/latest-run Symbolic link
View File

@@ -0,0 +1 @@
run-20210715_092837-watdq7ib

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:d8211487b4d0a0489ae4728120abad1be7ee4190520afc47fdae166087ae6068
size 60817322

View File

@@ -0,0 +1,305 @@
wandb_version: 1
__cached__setup_devices:
desc: null
value: cpu
_n_gpu:
desc: null
value: 0
_wandb:
desc: null
value:
cli_version: 0.10.33
framework: huggingface
huggingface_version: 4.9.0.dev0
is_jupyter_run: false
is_kaggle_kernel: false
python_version: 3.8.10
t:
1:
- 1
- 3
- 11
2:
- 1
- 3
- 11
4: 3.8.10
5: 0.10.33
6: 4.9.0.dev0
8:
- 5
adafactor:
desc: null
value: false
adam_beta1:
desc: null
value: 0.9
adam_beta2:
desc: null
value: 0.98
adam_epsilon:
desc: null
value: 1.0e-08
block_size:
desc: null
value: 512
cache_dir:
desc: null
value: null
config_name:
desc: null
value: ../gpt-2-tamil
dataloader_drop_last:
desc: null
value: false
dataloader_num_workers:
desc: null
value: 0
dataloader_pin_memory:
desc: null
value: true
dataset_config_name:
desc: null
value: unshuffled_deduplicated_ta
dataset_name:
desc: null
value: oscar
ddp_find_unused_parameters:
desc: null
value: null
debug:
desc: null
value: []
deepspeed:
desc: null
value: null
disable_tqdm:
desc: null
value: false
do_eval:
desc: null
value: true
do_predict:
desc: null
value: false
do_train:
desc: null
value: true
dtype:
desc: null
value: float32
eval_accumulation_steps:
desc: null
value: null
eval_steps:
desc: null
value: 2500
evaluation_strategy:
desc: null
value: IntervalStrategy.NO
fp16:
desc: null
value: false
fp16_backend:
desc: null
value: auto
fp16_full_eval:
desc: null
value: false
fp16_opt_level:
desc: null
value: O1
gradient_accumulation_steps:
desc: null
value: 1
greater_is_better:
desc: null
value: null
group_by_length:
desc: null
value: false
ignore_data_skip:
desc: null
value: false
label_names:
desc: null
value: null
label_smoothing_factor:
desc: null
value: 0.0
learning_rate:
desc: null
value: 3.0e-05
length_column_name:
desc: null
value: length
load_best_model_at_end:
desc: null
value: false
local_rank:
desc: null
value: -1
log_level:
desc: null
value: -1
log_level_replica:
desc: null
value: -1
log_on_each_node:
desc: null
value: true
logging_dir:
desc: null
value: ../gpt-2-tamil/runs/Jul15_06-31-48_t1v-n-ebe36c53-w-0
logging_first_step:
desc: null
value: false
logging_steps:
desc: null
value: 500
logging_strategy:
desc: null
value: IntervalStrategy.STEPS
lr_scheduler_type:
desc: null
value: SchedulerType.LINEAR
max_eval_samples:
desc: null
value: null
max_grad_norm:
desc: null
value: 1.0
max_steps:
desc: null
value: -1
max_train_samples:
desc: null
value: null
metric_for_best_model:
desc: null
value: null
model_name_or_path:
desc: null
value: null
model_type:
desc: null
value: gpt2
mp_parameters:
desc: null
value: ''
no_cuda:
desc: null
value: false
num_train_epochs:
desc: null
value: 10.0
output_dir:
desc: null
value: ../gpt-2-tamil
overwrite_cache:
desc: null
value: false
overwrite_output_dir:
desc: null
value: true
past_index:
desc: null
value: -1
per_device_eval_batch_size:
desc: null
value: 128
per_device_train_batch_size:
desc: null
value: 128
per_gpu_eval_batch_size:
desc: null
value: null
per_gpu_train_batch_size:
desc: null
value: null
prediction_loss_only:
desc: null
value: false
preprocessing_num_workers:
desc: null
value: 90
push_to_hub:
desc: null
value: false
push_to_hub_model_id:
desc: null
value: gpt-2-tamil
push_to_hub_organization:
desc: null
value: null
push_to_hub_token:
desc: null
value: null
remove_unused_columns:
desc: null
value: true
report_to:
desc: null
value:
- wandb
resume_from_checkpoint:
desc: null
value: null
run_name:
desc: null
value: trial
save_on_each_node:
desc: null
value: false
save_steps:
desc: null
value: 2500
save_strategy:
desc: null
value: IntervalStrategy.STEPS
save_total_limit:
desc: null
value: null
seed:
desc: null
value: 42
sharded_ddp:
desc: null
value: []
skip_memory_metrics:
desc: null
value: true
tokenizer_name:
desc: null
value: ../gpt-2-tamil
tpu_metrics_debug:
desc: null
value: false
tpu_num_cores:
desc: null
value: null
train_file:
desc: null
value: null
use_fast_tokenizer:
desc: null
value: true
use_legacy_prediction_loop:
desc: null
value: false
validation_file:
desc: null
value: null
validation_split_percentage:
desc: null
value: 5
warmup_ratio:
desc: null
value: 0.0
warmup_steps:
desc: null
value: 1000
weight_decay:
desc: null
value: 0.01

View File

@@ -0,0 +1 @@
/home/tweety_abi/GPT2-Tamil/gpt-2-tamil/events.out.tfevents.1626336540.t1v-n-ebe36c53-w-0.751183.3.v2

View File

@@ -0,0 +1,123 @@
absl-py==0.13.0
aiohttp==3.7.4.post0
appdirs==1.4.4
astunparse==1.6.3
async-timeout==3.0.1
attrs==21.2.0
backcall==0.2.0
black==21.6b0
cachetools==4.2.2
certifi==2021.5.30
cfgv==3.3.0
chardet==4.0.0
chex==0.0.7
click==8.0.1
configparser==5.0.2
cycler==0.10.0
datasets==1.8.1.dev0
decorator==5.0.9
dill==0.3.4
distlib==0.3.2
dm-tree==0.1.6
docker-pycreds==0.4.0
filelock==3.0.12
flake8==3.9.2
flatbuffers==1.12
flax==0.3.4
fsspec==2021.6.1
gast==0.4.0
gitdb==4.0.7
gitpython==3.1.18
google-auth-oauthlib==0.4.4
google-auth==1.32.1
google-pasta==0.2.0
grpcio==1.34.1
h5py==3.1.0
huggingface-hub==0.0.12
identify==2.2.10
idna==2.10
ipython-genutils==0.2.0
ipython==7.25.0
isort==5.9.1
jax==0.2.16
jaxlib==0.1.68
jedi==0.18.0
joblib==1.0.1
keras-nightly==2.5.0.dev2021032900
keras-preprocessing==1.1.2
kiwisolver==1.3.1
libtpu-nightly==0.1.dev20210615
markdown==3.3.4
matplotlib-inline==0.1.2
matplotlib==3.4.2
mccabe==0.6.1
msgpack==1.0.2
multidict==5.1.0
multiprocess==0.70.12.2
mypy-extensions==0.4.3
nodeenv==1.6.0
numpy==1.19.5
oauthlib==3.1.1
opt-einsum==3.3.0
optax==0.0.8
packaging==20.9
pandas==1.2.5
parso==0.8.2
pathspec==0.8.1
pathtools==0.1.2
pexpect==4.8.0
pickleshare==0.7.5
pillow==8.3.0
pip==20.0.2
pkg-resources==0.0.0
pre-commit==2.13.0
promise==2.3
prompt-toolkit==3.0.19
protobuf==3.17.3
psutil==5.8.0
ptyprocess==0.7.0
pyarrow==4.0.1
pyasn1-modules==0.2.8
pyasn1==0.4.8
pycodestyle==2.7.0
pyflakes==2.3.1
pygments==2.9.0
pyparsing==2.4.7
python-dateutil==2.8.1
pytz==2021.1
pyyaml==5.4.1
regex==2021.7.1
requests-oauthlib==1.3.0
requests==2.25.1
rsa==4.7.2
sacremoses==0.0.45
scipy==1.7.0
sentry-sdk==1.3.0
setuptools==44.0.0
shortuuid==1.0.1
six==1.15.0
smmap==4.0.0
subprocess32==3.5.4
tensorboard-data-server==0.6.1
tensorboard-plugin-wit==1.8.0
tensorboard==2.5.0
tensorflow-estimator==2.5.0
tensorflow==2.5.0
termcolor==1.1.0
tokenizers==0.10.3
toml==0.10.2
toolz==0.11.1
torch==1.9.0
tqdm==4.61.1
traitlets==5.0.5
transformers==4.9.0.dev0
typing-extensions==3.7.4.3
urllib3==1.26.6
virtualenv==20.4.7
wandb==0.10.33
wcwidth==0.2.5
werkzeug==2.0.1
wheel==0.36.2
wrapt==1.12.1
xxhash==2.0.2
yarl==1.6.3

View File

@@ -0,0 +1,49 @@
{
"os": "Linux-5.4.0-1043-gcp-x86_64-with-glibc2.29",
"python": "3.8.10",
"heartbeatAt": "2021-07-15T08:09:00.134255",
"startedAt": "2021-07-15T08:08:56.269238",
"docker": null,
"cpu_count": 96,
"cuda": null,
"args": [
"--output_dir=../gpt-2-tamil",
"--model_type=gpt2",
"--config_name=../gpt-2-tamil",
"--tokenizer_name=../gpt-2-tamil",
"--dataset_name=oscar",
"--dataset_config_name=unshuffled_deduplicated_ta",
"--do_train",
"--do_eval",
"--block_size=512",
"--per_device_train_batch_size=128",
"--per_device_eval_batch_size=128",
"--learning_rate=3e-5",
"--warmup_steps=1000",
"--adam_beta1=0.9",
"--adam_beta2=0.98",
"--weight_decay=0.01",
"--overwrite_output_dir",
"--num_train_epochs=10",
"--report_to",
"wandb",
"--run_name",
"trial",
"--logging_steps=500",
"--save_steps=2500",
"--eval_steps=2500",
"--preprocessing_num_workers=90"
],
"state": "running",
"program": "../src/run_clm_flax.py",
"codePath": "src/run_clm_flax.py",
"git": {
"remote": "https://github.com/AbinayaM02/GPT2-Tamil.git",
"commit": "69c9b7bf75b708a8f62cf5833d1b89acf5d1760b"
},
"email": "abinaya.m02@mphasis.com",
"root": "/home/tweety_abi/GPT2-Tamil",
"host": "t1v-n-ebe36c53-w-0",
"username": "tweety_abi",
"executable": "/home/tweety_abi/gpt2_env/bin/python"
}

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:ad2816f7f07dec6835ab15fdfb6fa81ca124f1b3f1dfbaccb9b2f3658286d158
size 38211

View File

@@ -0,0 +1,301 @@
wandb_version: 1
__cached__setup_devices:
desc: null
value: cpu
_n_gpu:
desc: null
value: 0
_wandb:
desc: null
value:
cli_version: 0.10.33
framework: huggingface
huggingface_version: 4.9.0.dev0
is_jupyter_run: false
is_kaggle_kernel: false
python_version: 3.8.10
t:
1:
- 1
- 3
- 11
4: 3.8.10
5: 0.10.33
6: 4.9.0.dev0
8:
- 5
adafactor:
desc: null
value: false
adam_beta1:
desc: null
value: 0.9
adam_beta2:
desc: null
value: 0.98
adam_epsilon:
desc: null
value: 1.0e-08
block_size:
desc: null
value: 512
cache_dir:
desc: null
value: null
config_name:
desc: null
value: ../gpt-2-tamil
dataloader_drop_last:
desc: null
value: false
dataloader_num_workers:
desc: null
value: 0
dataloader_pin_memory:
desc: null
value: true
dataset_config_name:
desc: null
value: unshuffled_deduplicated_ta
dataset_name:
desc: null
value: oscar
ddp_find_unused_parameters:
desc: null
value: null
debug:
desc: null
value: []
deepspeed:
desc: null
value: null
disable_tqdm:
desc: null
value: false
do_eval:
desc: null
value: true
do_predict:
desc: null
value: false
do_train:
desc: null
value: true
dtype:
desc: null
value: float32
eval_accumulation_steps:
desc: null
value: null
eval_steps:
desc: null
value: 2500
evaluation_strategy:
desc: null
value: IntervalStrategy.NO
fp16:
desc: null
value: false
fp16_backend:
desc: null
value: auto
fp16_full_eval:
desc: null
value: false
fp16_opt_level:
desc: null
value: O1
gradient_accumulation_steps:
desc: null
value: 1
greater_is_better:
desc: null
value: null
group_by_length:
desc: null
value: false
ignore_data_skip:
desc: null
value: false
label_names:
desc: null
value: null
label_smoothing_factor:
desc: null
value: 0.0
learning_rate:
desc: null
value: 3.0e-05
length_column_name:
desc: null
value: length
load_best_model_at_end:
desc: null
value: false
local_rank:
desc: null
value: -1
log_level:
desc: null
value: -1
log_level_replica:
desc: null
value: -1
log_on_each_node:
desc: null
value: true
logging_dir:
desc: null
value: ../gpt-2-tamil/runs/Jul15_07-55-49_t1v-n-ebe36c53-w-0
logging_first_step:
desc: null
value: false
logging_steps:
desc: null
value: 500
logging_strategy:
desc: null
value: IntervalStrategy.STEPS
lr_scheduler_type:
desc: null
value: SchedulerType.LINEAR
max_eval_samples:
desc: null
value: null
max_grad_norm:
desc: null
value: 1.0
max_steps:
desc: null
value: -1
max_train_samples:
desc: null
value: null
metric_for_best_model:
desc: null
value: null
model_name_or_path:
desc: null
value: null
model_type:
desc: null
value: gpt2
mp_parameters:
desc: null
value: ''
no_cuda:
desc: null
value: false
num_train_epochs:
desc: null
value: 10.0
output_dir:
desc: null
value: ../gpt-2-tamil
overwrite_cache:
desc: null
value: false
overwrite_output_dir:
desc: null
value: true
past_index:
desc: null
value: -1
per_device_eval_batch_size:
desc: null
value: 128
per_device_train_batch_size:
desc: null
value: 128
per_gpu_eval_batch_size:
desc: null
value: null
per_gpu_train_batch_size:
desc: null
value: null
prediction_loss_only:
desc: null
value: false
preprocessing_num_workers:
desc: null
value: 90
push_to_hub:
desc: null
value: false
push_to_hub_model_id:
desc: null
value: gpt-2-tamil
push_to_hub_organization:
desc: null
value: null
push_to_hub_token:
desc: null
value: null
remove_unused_columns:
desc: null
value: true
report_to:
desc: null
value:
- wandb
resume_from_checkpoint:
desc: null
value: null
run_name:
desc: null
value: trial
save_on_each_node:
desc: null
value: false
save_steps:
desc: null
value: 2500
save_strategy:
desc: null
value: IntervalStrategy.STEPS
save_total_limit:
desc: null
value: null
seed:
desc: null
value: 42
sharded_ddp:
desc: null
value: []
skip_memory_metrics:
desc: null
value: true
tokenizer_name:
desc: null
value: ../gpt-2-tamil
tpu_metrics_debug:
desc: null
value: false
tpu_num_cores:
desc: null
value: null
train_file:
desc: null
value: null
use_fast_tokenizer:
desc: null
value: true
use_legacy_prediction_loop:
desc: null
value: false
validation_file:
desc: null
value: null
validation_split_percentage:
desc: null
value: 5
warmup_ratio:
desc: null
value: 0.0
warmup_steps:
desc: null
value: 1000
weight_decay:
desc: null
value: 0.01

View File

@@ -0,0 +1 @@
/home/tweety_abi/GPT2-Tamil/gpt-2-tamil/events.out.tfevents.1626339585.t1v-n-ebe36c53-w-0.759145.3.v2

View File

@@ -0,0 +1,123 @@
absl-py==0.13.0
aiohttp==3.7.4.post0
appdirs==1.4.4
astunparse==1.6.3
async-timeout==3.0.1
attrs==21.2.0
backcall==0.2.0
black==21.6b0
cachetools==4.2.2
certifi==2021.5.30
cfgv==3.3.0
chardet==4.0.0
chex==0.0.7
click==8.0.1
configparser==5.0.2
cycler==0.10.0
datasets==1.8.1.dev0
decorator==5.0.9
dill==0.3.4
distlib==0.3.2
dm-tree==0.1.6
docker-pycreds==0.4.0
filelock==3.0.12
flake8==3.9.2
flatbuffers==1.12
flax==0.3.4
fsspec==2021.6.1
gast==0.4.0
gitdb==4.0.7
gitpython==3.1.18
google-auth-oauthlib==0.4.4
google-auth==1.32.1
google-pasta==0.2.0
grpcio==1.34.1
h5py==3.1.0
huggingface-hub==0.0.12
identify==2.2.10
idna==2.10
ipython-genutils==0.2.0
ipython==7.25.0
isort==5.9.1
jax==0.2.16
jaxlib==0.1.68
jedi==0.18.0
joblib==1.0.1
keras-nightly==2.5.0.dev2021032900
keras-preprocessing==1.1.2
kiwisolver==1.3.1
libtpu-nightly==0.1.dev20210615
markdown==3.3.4
matplotlib-inline==0.1.2
matplotlib==3.4.2
mccabe==0.6.1
msgpack==1.0.2
multidict==5.1.0
multiprocess==0.70.12.2
mypy-extensions==0.4.3
nodeenv==1.6.0
numpy==1.19.5
oauthlib==3.1.1
opt-einsum==3.3.0
optax==0.0.8
packaging==20.9
pandas==1.2.5
parso==0.8.2
pathspec==0.8.1
pathtools==0.1.2
pexpect==4.8.0
pickleshare==0.7.5
pillow==8.3.0
pip==20.0.2
pkg-resources==0.0.0
pre-commit==2.13.0
promise==2.3
prompt-toolkit==3.0.19
protobuf==3.17.3
psutil==5.8.0
ptyprocess==0.7.0
pyarrow==4.0.1
pyasn1-modules==0.2.8
pyasn1==0.4.8
pycodestyle==2.7.0
pyflakes==2.3.1
pygments==2.9.0
pyparsing==2.4.7
python-dateutil==2.8.1
pytz==2021.1
pyyaml==5.4.1
regex==2021.7.1
requests-oauthlib==1.3.0
requests==2.25.1
rsa==4.7.2
sacremoses==0.0.45
scipy==1.7.0
sentry-sdk==1.3.0
setuptools==44.0.0
shortuuid==1.0.1
six==1.15.0
smmap==4.0.0
subprocess32==3.5.4
tensorboard-data-server==0.6.1
tensorboard-plugin-wit==1.8.0
tensorboard==2.5.0
tensorflow-estimator==2.5.0
tensorflow==2.5.0
termcolor==1.1.0
tokenizers==0.10.3
toml==0.10.2
toolz==0.11.1
torch==1.9.0
tqdm==4.61.1
traitlets==5.0.5
transformers==4.9.0.dev0
typing-extensions==3.7.4.3
urllib3==1.26.6
virtualenv==20.4.7
wandb==0.10.33
wcwidth==0.2.5
werkzeug==2.0.1
wheel==0.36.2
wrapt==1.12.1
xxhash==2.0.2
yarl==1.6.3

View File

@@ -0,0 +1,49 @@
{
"os": "Linux-5.4.0-1043-gcp-x86_64-with-glibc2.29",
"python": "3.8.10",
"heartbeatAt": "2021-07-15T08:59:45.122600",
"startedAt": "2021-07-15T08:59:43.232731",
"docker": null,
"cpu_count": 96,
"cuda": null,
"args": [
"--output_dir=../gpt-2-tamil",
"--model_type=gpt2",
"--config_name=../gpt-2-tamil",
"--tokenizer_name=../gpt-2-tamil",
"--dataset_name=oscar",
"--dataset_config_name=unshuffled_deduplicated_ta",
"--do_train",
"--do_eval",
"--block_size=512",
"--per_device_train_batch_size=128",
"--per_device_eval_batch_size=128",
"--learning_rate=3e-5",
"--warmup_steps=1000",
"--adam_beta1=0.9",
"--adam_beta2=0.98",
"--weight_decay=0.01",
"--overwrite_output_dir",
"--num_train_epochs=10",
"--report_to",
"wandb",
"--run_name",
"trial",
"--logging_steps=500",
"--save_steps=2500",
"--eval_steps=2500",
"--preprocessing_num_workers=90"
],
"state": "running",
"program": "../src/run_clm_flax.py",
"codePath": "src/run_clm_flax.py",
"git": {
"remote": "https://github.com/AbinayaM02/GPT2-Tamil.git",
"commit": "69c9b7bf75b708a8f62cf5833d1b89acf5d1760b"
},
"email": "abinaya.m02@mphasis.com",
"root": "/home/tweety_abi/GPT2-Tamil",
"host": "t1v-n-ebe36c53-w-0",
"username": "tweety_abi",
"executable": "/home/tweety_abi/gpt2_env/bin/python"
}

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:4ddd483c4184ad35f642b4c9ddd01c8f4915a2cd4d811fb5e6395adec23ec07e
size 11149

View File

@@ -0,0 +1,305 @@
wandb_version: 1
__cached__setup_devices:
desc: null
value: cpu
_n_gpu:
desc: null
value: 0
_wandb:
desc: null
value:
cli_version: 0.10.33
framework: huggingface
huggingface_version: 4.9.0.dev0
is_jupyter_run: false
is_kaggle_kernel: false
python_version: 3.8.10
t:
1:
- 1
- 3
- 11
2:
- 1
- 3
- 11
4: 3.8.10
5: 0.10.33
6: 4.9.0.dev0
8:
- 5
adafactor:
desc: null
value: false
adam_beta1:
desc: null
value: 0.9
adam_beta2:
desc: null
value: 0.98
adam_epsilon:
desc: null
value: 1.0e-08
block_size:
desc: null
value: 512
cache_dir:
desc: null
value: null
config_name:
desc: null
value: ../gpt-2-tamil
dataloader_drop_last:
desc: null
value: false
dataloader_num_workers:
desc: null
value: 0
dataloader_pin_memory:
desc: null
value: true
dataset_config_name:
desc: null
value: unshuffled_deduplicated_ta
dataset_name:
desc: null
value: oscar
ddp_find_unused_parameters:
desc: null
value: null
debug:
desc: null
value: []
deepspeed:
desc: null
value: null
disable_tqdm:
desc: null
value: false
do_eval:
desc: null
value: true
do_predict:
desc: null
value: false
do_train:
desc: null
value: true
dtype:
desc: null
value: float32
eval_accumulation_steps:
desc: null
value: null
eval_steps:
desc: null
value: 2500
evaluation_strategy:
desc: null
value: IntervalStrategy.NO
fp16:
desc: null
value: false
fp16_backend:
desc: null
value: auto
fp16_full_eval:
desc: null
value: false
fp16_opt_level:
desc: null
value: O1
gradient_accumulation_steps:
desc: null
value: 1
greater_is_better:
desc: null
value: null
group_by_length:
desc: null
value: false
ignore_data_skip:
desc: null
value: false
label_names:
desc: null
value: null
label_smoothing_factor:
desc: null
value: 0.0
learning_rate:
desc: null
value: 3.0e-05
length_column_name:
desc: null
value: length
load_best_model_at_end:
desc: null
value: false
local_rank:
desc: null
value: -1
log_level:
desc: null
value: -1
log_level_replica:
desc: null
value: -1
log_on_each_node:
desc: null
value: true
logging_dir:
desc: null
value: ../gpt-2-tamil/runs/Jul15_09-16-14_t1v-n-ebe36c53-w-0
logging_first_step:
desc: null
value: false
logging_steps:
desc: null
value: 500
logging_strategy:
desc: null
value: IntervalStrategy.STEPS
lr_scheduler_type:
desc: null
value: SchedulerType.LINEAR
max_eval_samples:
desc: null
value: null
max_grad_norm:
desc: null
value: 1.0
max_steps:
desc: null
value: -1
max_train_samples:
desc: null
value: null
metric_for_best_model:
desc: null
value: null
model_name_or_path:
desc: null
value: null
model_type:
desc: null
value: gpt2
mp_parameters:
desc: null
value: ''
no_cuda:
desc: null
value: false
num_train_epochs:
desc: null
value: 10.0
output_dir:
desc: null
value: ../gpt-2-tamil
overwrite_cache:
desc: null
value: false
overwrite_output_dir:
desc: null
value: true
past_index:
desc: null
value: -1
per_device_eval_batch_size:
desc: null
value: 128
per_device_train_batch_size:
desc: null
value: 128
per_gpu_eval_batch_size:
desc: null
value: null
per_gpu_train_batch_size:
desc: null
value: null
prediction_loss_only:
desc: null
value: false
preprocessing_num_workers:
desc: null
value: 90
push_to_hub:
desc: null
value: false
push_to_hub_model_id:
desc: null
value: gpt-2-tamil
push_to_hub_organization:
desc: null
value: null
push_to_hub_token:
desc: null
value: null
remove_unused_columns:
desc: null
value: true
report_to:
desc: null
value:
- wandb
resume_from_checkpoint:
desc: null
value: null
run_name:
desc: null
value: trial
save_on_each_node:
desc: null
value: false
save_steps:
desc: null
value: 2500
save_strategy:
desc: null
value: IntervalStrategy.STEPS
save_total_limit:
desc: null
value: null
seed:
desc: null
value: 42
sharded_ddp:
desc: null
value: []
skip_memory_metrics:
desc: null
value: true
tokenizer_name:
desc: null
value: ../gpt-2-tamil
tpu_metrics_debug:
desc: null
value: false
tpu_num_cores:
desc: null
value: null
train_file:
desc: null
value: null
use_fast_tokenizer:
desc: null
value: true
use_legacy_prediction_loop:
desc: null
value: false
validation_file:
desc: null
value: null
validation_split_percentage:
desc: null
value: 5
warmup_ratio:
desc: null
value: 0.0
warmup_steps:
desc: null
value: 1000
weight_decay:
desc: null
value: 0.01

View File

@@ -0,0 +1 @@
/home/tweety_abi/GPT2-Tamil/gpt-2-tamil/events.out.tfevents.1626340740.t1v-n-ebe36c53-w-0.765413.3.v2

View File

@@ -0,0 +1,123 @@
absl-py==0.13.0
aiohttp==3.7.4.post0
appdirs==1.4.4
astunparse==1.6.3
async-timeout==3.0.1
attrs==21.2.0
backcall==0.2.0
black==21.6b0
cachetools==4.2.2
certifi==2021.5.30
cfgv==3.3.0
chardet==4.0.0
chex==0.0.7
click==8.0.1
configparser==5.0.2
cycler==0.10.0
datasets==1.8.1.dev0
decorator==5.0.9
dill==0.3.4
distlib==0.3.2
dm-tree==0.1.6
docker-pycreds==0.4.0
filelock==3.0.12
flake8==3.9.2
flatbuffers==1.12
flax==0.3.4
fsspec==2021.6.1
gast==0.4.0
gitdb==4.0.7
gitpython==3.1.18
google-auth-oauthlib==0.4.4
google-auth==1.32.1
google-pasta==0.2.0
grpcio==1.34.1
h5py==3.1.0
huggingface-hub==0.0.12
identify==2.2.10
idna==2.10
ipython-genutils==0.2.0
ipython==7.25.0
isort==5.9.1
jax==0.2.16
jaxlib==0.1.68
jedi==0.18.0
joblib==1.0.1
keras-nightly==2.5.0.dev2021032900
keras-preprocessing==1.1.2
kiwisolver==1.3.1
libtpu-nightly==0.1.dev20210615
markdown==3.3.4
matplotlib-inline==0.1.2
matplotlib==3.4.2
mccabe==0.6.1
msgpack==1.0.2
multidict==5.1.0
multiprocess==0.70.12.2
mypy-extensions==0.4.3
nodeenv==1.6.0
numpy==1.19.5
oauthlib==3.1.1
opt-einsum==3.3.0
optax==0.0.8
packaging==20.9
pandas==1.2.5
parso==0.8.2
pathspec==0.8.1
pathtools==0.1.2
pexpect==4.8.0
pickleshare==0.7.5
pillow==8.3.0
pip==20.0.2
pkg-resources==0.0.0
pre-commit==2.13.0
promise==2.3
prompt-toolkit==3.0.19
protobuf==3.17.3
psutil==5.8.0
ptyprocess==0.7.0
pyarrow==4.0.1
pyasn1-modules==0.2.8
pyasn1==0.4.8
pycodestyle==2.7.0
pyflakes==2.3.1
pygments==2.9.0
pyparsing==2.4.7
python-dateutil==2.8.1
pytz==2021.1
pyyaml==5.4.1
regex==2021.7.1
requests-oauthlib==1.3.0
requests==2.25.1
rsa==4.7.2
sacremoses==0.0.45
scipy==1.7.0
sentry-sdk==1.3.0
setuptools==44.0.0
shortuuid==1.0.1
six==1.15.0
smmap==4.0.0
subprocess32==3.5.4
tensorboard-data-server==0.6.1
tensorboard-plugin-wit==1.8.0
tensorboard==2.5.0
tensorflow-estimator==2.5.0
tensorflow==2.5.0
termcolor==1.1.0
tokenizers==0.10.3
toml==0.10.2
toolz==0.11.1
torch==1.9.0
tqdm==4.61.1
traitlets==5.0.5
transformers==4.9.0.dev0
typing-extensions==3.7.4.3
urllib3==1.26.6
virtualenv==20.4.7
wandb==0.10.33
wcwidth==0.2.5
werkzeug==2.0.1
wheel==0.36.2
wrapt==1.12.1
xxhash==2.0.2
yarl==1.6.3

View File

@@ -0,0 +1,49 @@
{
"os": "Linux-5.4.0-1043-gcp-x86_64-with-glibc2.29",
"python": "3.8.10",
"heartbeatAt": "2021-07-15T09:19:00.102585",
"startedAt": "2021-07-15T09:18:56.277815",
"docker": null,
"cpu_count": 96,
"cuda": null,
"args": [
"--output_dir=../gpt-2-tamil",
"--model_type=gpt2",
"--config_name=../gpt-2-tamil",
"--tokenizer_name=../gpt-2-tamil",
"--dataset_name=oscar",
"--dataset_config_name=unshuffled_deduplicated_ta",
"--do_train",
"--do_eval",
"--block_size=512",
"--per_device_train_batch_size=128",
"--per_device_eval_batch_size=128",
"--learning_rate=3e-5",
"--warmup_steps=1000",
"--adam_beta1=0.9",
"--adam_beta2=0.98",
"--weight_decay=0.01",
"--overwrite_output_dir",
"--num_train_epochs=10",
"--report_to",
"wandb",
"--run_name",
"trial",
"--logging_steps=500",
"--save_steps=2500",
"--eval_steps=2500",
"--preprocessing_num_workers=90"
],
"state": "running",
"program": "../src/run_clm_flax.py",
"codePath": "src/run_clm_flax.py",
"git": {
"remote": "https://github.com/AbinayaM02/GPT2-Tamil.git",
"commit": "69c9b7bf75b708a8f62cf5833d1b89acf5d1760b"
},
"email": "abinaya.m02@mphasis.com",
"root": "/home/tweety_abi/GPT2-Tamil",
"host": "t1v-n-ebe36c53-w-0",
"username": "tweety_abi",
"executable": "/home/tweety_abi/gpt2_env/bin/python"
}

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:74c24264810cc8a5625c9a6fd0093d95ea89e0980f556fce2e873e00ba0254c5
size 38212

View File

@@ -0,0 +1,301 @@
wandb_version: 1
__cached__setup_devices:
desc: null
value: cpu
_n_gpu:
desc: null
value: 0
_wandb:
desc: null
value:
cli_version: 0.10.33
framework: huggingface
huggingface_version: 4.9.0.dev0
is_jupyter_run: false
is_kaggle_kernel: false
python_version: 3.8.10
t:
1:
- 1
- 3
- 11
4: 3.8.10
5: 0.10.33
6: 4.9.0.dev0
8:
- 5
adafactor:
desc: null
value: false
adam_beta1:
desc: null
value: 0.9
adam_beta2:
desc: null
value: 0.98
adam_epsilon:
desc: null
value: 1.0e-08
block_size:
desc: null
value: 512
cache_dir:
desc: null
value: null
config_name:
desc: null
value: ../gpt-2-tamil
dataloader_drop_last:
desc: null
value: false
dataloader_num_workers:
desc: null
value: 0
dataloader_pin_memory:
desc: null
value: true
dataset_config_name:
desc: null
value: unshuffled_deduplicated_ta
dataset_name:
desc: null
value: oscar
ddp_find_unused_parameters:
desc: null
value: null
debug:
desc: null
value: []
deepspeed:
desc: null
value: null
disable_tqdm:
desc: null
value: false
do_eval:
desc: null
value: true
do_predict:
desc: null
value: false
do_train:
desc: null
value: true
dtype:
desc: null
value: float32
eval_accumulation_steps:
desc: null
value: null
eval_steps:
desc: null
value: 2500
evaluation_strategy:
desc: null
value: IntervalStrategy.NO
fp16:
desc: null
value: false
fp16_backend:
desc: null
value: auto
fp16_full_eval:
desc: null
value: false
fp16_opt_level:
desc: null
value: O1
gradient_accumulation_steps:
desc: null
value: 1
greater_is_better:
desc: null
value: null
group_by_length:
desc: null
value: false
ignore_data_skip:
desc: null
value: false
label_names:
desc: null
value: null
label_smoothing_factor:
desc: null
value: 0.0
learning_rate:
desc: null
value: 3.0e-05
length_column_name:
desc: null
value: length
load_best_model_at_end:
desc: null
value: false
local_rank:
desc: null
value: -1
log_level:
desc: null
value: -1
log_level_replica:
desc: null
value: -1
log_on_each_node:
desc: null
value: true
logging_dir:
desc: null
value: ../gpt-2-tamil/runs/Jul15_09-27-21_t1v-n-ebe36c53-w-0
logging_first_step:
desc: null
value: false
logging_steps:
desc: null
value: 500
logging_strategy:
desc: null
value: IntervalStrategy.STEPS
lr_scheduler_type:
desc: null
value: SchedulerType.LINEAR
max_eval_samples:
desc: null
value: null
max_grad_norm:
desc: null
value: 1.0
max_steps:
desc: null
value: -1
max_train_samples:
desc: null
value: null
metric_for_best_model:
desc: null
value: null
model_name_or_path:
desc: null
value: null
model_type:
desc: null
value: gpt2
mp_parameters:
desc: null
value: ''
no_cuda:
desc: null
value: false
num_train_epochs:
desc: null
value: 10.0
output_dir:
desc: null
value: ../gpt-2-tamil
overwrite_cache:
desc: null
value: false
overwrite_output_dir:
desc: null
value: true
past_index:
desc: null
value: -1
per_device_eval_batch_size:
desc: null
value: 64
per_device_train_batch_size:
desc: null
value: 64
per_gpu_eval_batch_size:
desc: null
value: null
per_gpu_train_batch_size:
desc: null
value: null
prediction_loss_only:
desc: null
value: false
preprocessing_num_workers:
desc: null
value: 90
push_to_hub:
desc: null
value: false
push_to_hub_model_id:
desc: null
value: gpt-2-tamil
push_to_hub_organization:
desc: null
value: null
push_to_hub_token:
desc: null
value: null
remove_unused_columns:
desc: null
value: true
report_to:
desc: null
value:
- wandb
resume_from_checkpoint:
desc: null
value: null
run_name:
desc: null
value: trial
save_on_each_node:
desc: null
value: false
save_steps:
desc: null
value: 2500
save_strategy:
desc: null
value: IntervalStrategy.STEPS
save_total_limit:
desc: null
value: null
seed:
desc: null
value: 42
sharded_ddp:
desc: null
value: []
skip_memory_metrics:
desc: null
value: true
tokenizer_name:
desc: null
value: ../gpt-2-tamil
tpu_metrics_debug:
desc: null
value: false
tpu_num_cores:
desc: null
value: null
train_file:
desc: null
value: null
use_fast_tokenizer:
desc: null
value: true
use_legacy_prediction_loop:
desc: null
value: false
validation_file:
desc: null
value: null
validation_split_percentage:
desc: null
value: 5
warmup_ratio:
desc: null
value: 0.0
warmup_steps:
desc: null
value: 1000
weight_decay:
desc: null
value: 0.01

View File

@@ -0,0 +1 @@
/home/tweety_abi/GPT2-Tamil/gpt-2-tamil/events.out.tfevents.1626341319.t1v-n-ebe36c53-w-0.768105.3.v2

View File

@@ -0,0 +1,123 @@
absl-py==0.13.0
aiohttp==3.7.4.post0
appdirs==1.4.4
astunparse==1.6.3
async-timeout==3.0.1
attrs==21.2.0
backcall==0.2.0
black==21.6b0
cachetools==4.2.2
certifi==2021.5.30
cfgv==3.3.0
chardet==4.0.0
chex==0.0.7
click==8.0.1
configparser==5.0.2
cycler==0.10.0
datasets==1.8.1.dev0
decorator==5.0.9
dill==0.3.4
distlib==0.3.2
dm-tree==0.1.6
docker-pycreds==0.4.0
filelock==3.0.12
flake8==3.9.2
flatbuffers==1.12
flax==0.3.4
fsspec==2021.6.1
gast==0.4.0
gitdb==4.0.7
gitpython==3.1.18
google-auth-oauthlib==0.4.4
google-auth==1.32.1
google-pasta==0.2.0
grpcio==1.34.1
h5py==3.1.0
huggingface-hub==0.0.12
identify==2.2.10
idna==2.10
ipython-genutils==0.2.0
ipython==7.25.0
isort==5.9.1
jax==0.2.16
jaxlib==0.1.68
jedi==0.18.0
joblib==1.0.1
keras-nightly==2.5.0.dev2021032900
keras-preprocessing==1.1.2
kiwisolver==1.3.1
libtpu-nightly==0.1.dev20210615
markdown==3.3.4
matplotlib-inline==0.1.2
matplotlib==3.4.2
mccabe==0.6.1
msgpack==1.0.2
multidict==5.1.0
multiprocess==0.70.12.2
mypy-extensions==0.4.3
nodeenv==1.6.0
numpy==1.19.5
oauthlib==3.1.1
opt-einsum==3.3.0
optax==0.0.8
packaging==20.9
pandas==1.2.5
parso==0.8.2
pathspec==0.8.1
pathtools==0.1.2
pexpect==4.8.0
pickleshare==0.7.5
pillow==8.3.0
pip==20.0.2
pkg-resources==0.0.0
pre-commit==2.13.0
promise==2.3
prompt-toolkit==3.0.19
protobuf==3.17.3
psutil==5.8.0
ptyprocess==0.7.0
pyarrow==4.0.1
pyasn1-modules==0.2.8
pyasn1==0.4.8
pycodestyle==2.7.0
pyflakes==2.3.1
pygments==2.9.0
pyparsing==2.4.7
python-dateutil==2.8.1
pytz==2021.1
pyyaml==5.4.1
regex==2021.7.1
requests-oauthlib==1.3.0
requests==2.25.1
rsa==4.7.2
sacremoses==0.0.45
scipy==1.7.0
sentry-sdk==1.3.0
setuptools==44.0.0
shortuuid==1.0.1
six==1.15.0
smmap==4.0.0
subprocess32==3.5.4
tensorboard-data-server==0.6.1
tensorboard-plugin-wit==1.8.0
tensorboard==2.5.0
tensorflow-estimator==2.5.0
tensorflow==2.5.0
termcolor==1.1.0
tokenizers==0.10.3
toml==0.10.2
toolz==0.11.1
torch==1.9.0
tqdm==4.61.1
traitlets==5.0.5
transformers==4.9.0.dev0
typing-extensions==3.7.4.3
urllib3==1.26.6
virtualenv==20.4.7
wandb==0.10.33
wcwidth==0.2.5
werkzeug==2.0.1
wheel==0.36.2
wrapt==1.12.1
xxhash==2.0.2
yarl==1.6.3

View File

@@ -0,0 +1,49 @@
{
"os": "Linux-5.4.0-1043-gcp-x86_64-with-glibc2.29",
"python": "3.8.10",
"heartbeatAt": "2021-07-15T09:28:39.248463",
"startedAt": "2021-07-15T09:28:37.215410",
"docker": null,
"cpu_count": 96,
"cuda": null,
"args": [
"--output_dir=../gpt-2-tamil",
"--model_type=gpt2",
"--config_name=../gpt-2-tamil",
"--tokenizer_name=../gpt-2-tamil",
"--dataset_name=oscar",
"--dataset_config_name=unshuffled_deduplicated_ta",
"--do_train",
"--do_eval",
"--block_size=512",
"--per_device_train_batch_size=64",
"--per_device_eval_batch_size=64",
"--learning_rate=3e-5",
"--warmup_steps=1000",
"--adam_beta1=0.9",
"--adam_beta2=0.98",
"--weight_decay=0.01",
"--overwrite_output_dir",
"--num_train_epochs=10",
"--report_to",
"wandb",
"--run_name",
"trial",
"--logging_steps=500",
"--save_steps=2500",
"--eval_steps=2500",
"--preprocessing_num_workers=90"
],
"state": "running",
"program": "../src/run_clm_flax.py",
"codePath": "src/run_clm_flax.py",
"git": {
"remote": "https://github.com/AbinayaM02/GPT2-Tamil.git",
"commit": "69c9b7bf75b708a8f62cf5833d1b89acf5d1760b"
},
"email": "abinaya.m02@mphasis.com",
"root": "/home/tweety_abi/GPT2-Tamil",
"host": "t1v-n-ebe36c53-w-0",
"username": "tweety_abi",
"executable": "/home/tweety_abi/gpt2_env/bin/python"
}

View File

@@ -0,0 +1 @@
{"global_step": 162500, "_timestamp": 1626515598.82067, "train_time": 3039175.75, "train_learning_rate": 2.0749264422192937e-06, "_step": 324025, "train_loss": 1.1235102415084839, "eval_loss": 1.1323037147521973, "eval_perplexity": 3.1027963161468506}

View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:17ccbfb69a2e91865a50d34837db9291fa2687143f65c6f6c712e23f40a46343
size 71362583