初始化项目,由ModelHub XC社区提供模型
Model: flax-community/gpt-2-tamil Source: Original Platform
This commit is contained in:
0
scripts/run.log
Normal file
0
scripts/run.log
Normal file
25
scripts/train_gpt2-oscar-tamil.sh
Executable file
25
scripts/train_gpt2-oscar-tamil.sh
Executable file
@@ -0,0 +1,25 @@
|
||||
#!/usr/bin/env bash
|
||||
python ../src/run_clm_flax.py \
|
||||
--output_dir="${MODEL_DIR}" \
|
||||
--model_type="gpt2" \
|
||||
--config_name="${MODEL_DIR}" \
|
||||
--tokenizer_name="${MODEL_DIR}" \
|
||||
--dataset_name="oscar" \
|
||||
--dataset_config_name="unshuffled_deduplicated_ta" \
|
||||
--do_train --do_eval \
|
||||
--block_size="512" \
|
||||
--per_device_train_batch_size="64" \
|
||||
--per_device_eval_batch_size="64" \
|
||||
--learning_rate="3e-5" \
|
||||
--warmup_steps="1000" \
|
||||
--adam_beta1="0.9" --adam_beta2="0.98" --weight_decay="0.01" \
|
||||
--overwrite_output_dir \
|
||||
--num_train_epochs="25" \
|
||||
--report_to wandb \
|
||||
--run_name trial \
|
||||
--logging_steps="500" \
|
||||
--save_steps="2500" \
|
||||
--eval_steps="2500" \
|
||||
--preprocessing_num_workers="90" \
|
||||
#--push_to_hub
|
||||
2>&1 | tee run.log
|
||||
1
scripts/wandb/debug-internal.log
Symbolic link
1
scripts/wandb/debug-internal.log
Symbolic link
@@ -0,0 +1 @@
|
||||
run-20210712_164633-1ddv4131/logs/debug-internal.log
|
||||
1
scripts/wandb/debug.log
Symbolic link
1
scripts/wandb/debug.log
Symbolic link
@@ -0,0 +1 @@
|
||||
run-20210712_164633-1ddv4131/logs/debug.log
|
||||
1
scripts/wandb/latest-run
Symbolic link
1
scripts/wandb/latest-run
Symbolic link
@@ -0,0 +1 @@
|
||||
run-20210712_164633-1ddv4131
|
||||
301
scripts/wandb/run-20210712_044248-12kjsz9i/files/config.yaml
Normal file
301
scripts/wandb/run-20210712_044248-12kjsz9i/files/config.yaml
Normal file
@@ -0,0 +1,301 @@
|
||||
wandb_version: 1
|
||||
|
||||
__cached__setup_devices:
|
||||
desc: null
|
||||
value: cpu
|
||||
_n_gpu:
|
||||
desc: null
|
||||
value: 0
|
||||
_wandb:
|
||||
desc: null
|
||||
value:
|
||||
cli_version: 0.10.33
|
||||
framework: huggingface
|
||||
huggingface_version: 4.9.0.dev0
|
||||
is_jupyter_run: false
|
||||
is_kaggle_kernel: false
|
||||
python_version: 3.8.10
|
||||
t:
|
||||
1:
|
||||
- 1
|
||||
- 3
|
||||
- 11
|
||||
4: 3.8.10
|
||||
5: 0.10.33
|
||||
6: 4.9.0.dev0
|
||||
8:
|
||||
- 5
|
||||
adafactor:
|
||||
desc: null
|
||||
value: false
|
||||
adam_beta1:
|
||||
desc: null
|
||||
value: 0.9
|
||||
adam_beta2:
|
||||
desc: null
|
||||
value: 0.98
|
||||
adam_epsilon:
|
||||
desc: null
|
||||
value: 1.0e-08
|
||||
block_size:
|
||||
desc: null
|
||||
value: 512
|
||||
cache_dir:
|
||||
desc: null
|
||||
value: null
|
||||
config_name:
|
||||
desc: null
|
||||
value: ../gpt-2-tamil/
|
||||
dataloader_drop_last:
|
||||
desc: null
|
||||
value: false
|
||||
dataloader_num_workers:
|
||||
desc: null
|
||||
value: 0
|
||||
dataloader_pin_memory:
|
||||
desc: null
|
||||
value: true
|
||||
dataset_config_name:
|
||||
desc: null
|
||||
value: unshuffled_deduplicated_ta
|
||||
dataset_name:
|
||||
desc: null
|
||||
value: oscar
|
||||
ddp_find_unused_parameters:
|
||||
desc: null
|
||||
value: null
|
||||
debug:
|
||||
desc: null
|
||||
value: []
|
||||
deepspeed:
|
||||
desc: null
|
||||
value: null
|
||||
disable_tqdm:
|
||||
desc: null
|
||||
value: false
|
||||
do_eval:
|
||||
desc: null
|
||||
value: true
|
||||
do_predict:
|
||||
desc: null
|
||||
value: false
|
||||
do_train:
|
||||
desc: null
|
||||
value: true
|
||||
dtype:
|
||||
desc: null
|
||||
value: float32
|
||||
eval_accumulation_steps:
|
||||
desc: null
|
||||
value: null
|
||||
eval_steps:
|
||||
desc: null
|
||||
value: 500
|
||||
evaluation_strategy:
|
||||
desc: null
|
||||
value: IntervalStrategy.NO
|
||||
fp16:
|
||||
desc: null
|
||||
value: false
|
||||
fp16_backend:
|
||||
desc: null
|
||||
value: auto
|
||||
fp16_full_eval:
|
||||
desc: null
|
||||
value: false
|
||||
fp16_opt_level:
|
||||
desc: null
|
||||
value: O1
|
||||
gradient_accumulation_steps:
|
||||
desc: null
|
||||
value: 1
|
||||
greater_is_better:
|
||||
desc: null
|
||||
value: null
|
||||
group_by_length:
|
||||
desc: null
|
||||
value: false
|
||||
ignore_data_skip:
|
||||
desc: null
|
||||
value: false
|
||||
label_names:
|
||||
desc: null
|
||||
value: null
|
||||
label_smoothing_factor:
|
||||
desc: null
|
||||
value: 0.0
|
||||
learning_rate:
|
||||
desc: null
|
||||
value: 3.0e-05
|
||||
length_column_name:
|
||||
desc: null
|
||||
value: length
|
||||
load_best_model_at_end:
|
||||
desc: null
|
||||
value: false
|
||||
local_rank:
|
||||
desc: null
|
||||
value: -1
|
||||
log_level:
|
||||
desc: null
|
||||
value: -1
|
||||
log_level_replica:
|
||||
desc: null
|
||||
value: -1
|
||||
log_on_each_node:
|
||||
desc: null
|
||||
value: true
|
||||
logging_dir:
|
||||
desc: null
|
||||
value: ../tmp/../gpt-2-tamil/runs/Jul11_17-18-14_t1v-n-ebe36c53-w-0
|
||||
logging_first_step:
|
||||
desc: null
|
||||
value: false
|
||||
logging_steps:
|
||||
desc: null
|
||||
value: 500
|
||||
logging_strategy:
|
||||
desc: null
|
||||
value: IntervalStrategy.STEPS
|
||||
lr_scheduler_type:
|
||||
desc: null
|
||||
value: SchedulerType.LINEAR
|
||||
max_eval_samples:
|
||||
desc: null
|
||||
value: null
|
||||
max_grad_norm:
|
||||
desc: null
|
||||
value: 1.0
|
||||
max_steps:
|
||||
desc: null
|
||||
value: -1
|
||||
max_train_samples:
|
||||
desc: null
|
||||
value: null
|
||||
metric_for_best_model:
|
||||
desc: null
|
||||
value: null
|
||||
model_name_or_path:
|
||||
desc: null
|
||||
value: null
|
||||
model_type:
|
||||
desc: null
|
||||
value: gpt2
|
||||
mp_parameters:
|
||||
desc: null
|
||||
value: ''
|
||||
no_cuda:
|
||||
desc: null
|
||||
value: false
|
||||
num_train_epochs:
|
||||
desc: null
|
||||
value: 1.0
|
||||
output_dir:
|
||||
desc: null
|
||||
value: ../tmp/../gpt-2-tamil/
|
||||
overwrite_cache:
|
||||
desc: null
|
||||
value: false
|
||||
overwrite_output_dir:
|
||||
desc: null
|
||||
value: true
|
||||
past_index:
|
||||
desc: null
|
||||
value: -1
|
||||
per_device_eval_batch_size:
|
||||
desc: null
|
||||
value: 64
|
||||
per_device_train_batch_size:
|
||||
desc: null
|
||||
value: 64
|
||||
per_gpu_eval_batch_size:
|
||||
desc: null
|
||||
value: null
|
||||
per_gpu_train_batch_size:
|
||||
desc: null
|
||||
value: null
|
||||
prediction_loss_only:
|
||||
desc: null
|
||||
value: false
|
||||
preprocessing_num_workers:
|
||||
desc: null
|
||||
value: null
|
||||
push_to_hub:
|
||||
desc: null
|
||||
value: false
|
||||
push_to_hub_model_id:
|
||||
desc: null
|
||||
value: gpt-2-tamil
|
||||
push_to_hub_organization:
|
||||
desc: null
|
||||
value: null
|
||||
push_to_hub_token:
|
||||
desc: null
|
||||
value: null
|
||||
remove_unused_columns:
|
||||
desc: null
|
||||
value: true
|
||||
report_to:
|
||||
desc: null
|
||||
value:
|
||||
- wandb
|
||||
resume_from_checkpoint:
|
||||
desc: null
|
||||
value: null
|
||||
run_name:
|
||||
desc: null
|
||||
value: trial
|
||||
save_on_each_node:
|
||||
desc: null
|
||||
value: false
|
||||
save_steps:
|
||||
desc: null
|
||||
value: 500
|
||||
save_strategy:
|
||||
desc: null
|
||||
value: IntervalStrategy.STEPS
|
||||
save_total_limit:
|
||||
desc: null
|
||||
value: null
|
||||
seed:
|
||||
desc: null
|
||||
value: 42
|
||||
sharded_ddp:
|
||||
desc: null
|
||||
value: []
|
||||
skip_memory_metrics:
|
||||
desc: null
|
||||
value: true
|
||||
tokenizer_name:
|
||||
desc: null
|
||||
value: ../gpt-2-tamil/
|
||||
tpu_metrics_debug:
|
||||
desc: null
|
||||
value: false
|
||||
tpu_num_cores:
|
||||
desc: null
|
||||
value: null
|
||||
train_file:
|
||||
desc: null
|
||||
value: null
|
||||
use_fast_tokenizer:
|
||||
desc: null
|
||||
value: true
|
||||
use_legacy_prediction_loop:
|
||||
desc: null
|
||||
value: false
|
||||
validation_file:
|
||||
desc: null
|
||||
value: null
|
||||
validation_split_percentage:
|
||||
desc: null
|
||||
value: 5
|
||||
warmup_ratio:
|
||||
desc: null
|
||||
value: 0.0
|
||||
warmup_steps:
|
||||
desc: null
|
||||
value: 1000
|
||||
weight_decay:
|
||||
desc: null
|
||||
value: 0.01
|
||||
@@ -0,0 +1 @@
|
||||
/home/tweety_abi/GPT2-Tamil/gpt-2-tamil/events.out.tfevents.1626064970.t1v-n-ebe36c53-w-0.400773.3.v2
|
||||
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:83c77cb8fdf96d6479ff9c389029839beb48a924dec227d80f708b2d1f1dd66f
|
||||
size 107953
|
||||
@@ -0,0 +1,123 @@
|
||||
absl-py==0.13.0
|
||||
aiohttp==3.7.4.post0
|
||||
appdirs==1.4.4
|
||||
astunparse==1.6.3
|
||||
async-timeout==3.0.1
|
||||
attrs==21.2.0
|
||||
backcall==0.2.0
|
||||
black==21.6b0
|
||||
cachetools==4.2.2
|
||||
certifi==2021.5.30
|
||||
cfgv==3.3.0
|
||||
chardet==4.0.0
|
||||
chex==0.0.7
|
||||
click==8.0.1
|
||||
configparser==5.0.2
|
||||
cycler==0.10.0
|
||||
datasets==1.8.1.dev0
|
||||
decorator==5.0.9
|
||||
dill==0.3.4
|
||||
distlib==0.3.2
|
||||
dm-tree==0.1.6
|
||||
docker-pycreds==0.4.0
|
||||
filelock==3.0.12
|
||||
flake8==3.9.2
|
||||
flatbuffers==1.12
|
||||
flax==0.3.4
|
||||
fsspec==2021.6.1
|
||||
gast==0.4.0
|
||||
gitdb==4.0.7
|
||||
gitpython==3.1.18
|
||||
google-auth-oauthlib==0.4.4
|
||||
google-auth==1.32.1
|
||||
google-pasta==0.2.0
|
||||
grpcio==1.34.1
|
||||
h5py==3.1.0
|
||||
huggingface-hub==0.0.12
|
||||
identify==2.2.10
|
||||
idna==2.10
|
||||
ipython-genutils==0.2.0
|
||||
ipython==7.25.0
|
||||
isort==5.9.1
|
||||
jax==0.2.16
|
||||
jaxlib==0.1.68
|
||||
jedi==0.18.0
|
||||
joblib==1.0.1
|
||||
keras-nightly==2.5.0.dev2021032900
|
||||
keras-preprocessing==1.1.2
|
||||
kiwisolver==1.3.1
|
||||
libtpu-nightly==0.1.dev20210615
|
||||
markdown==3.3.4
|
||||
matplotlib-inline==0.1.2
|
||||
matplotlib==3.4.2
|
||||
mccabe==0.6.1
|
||||
msgpack==1.0.2
|
||||
multidict==5.1.0
|
||||
multiprocess==0.70.12.2
|
||||
mypy-extensions==0.4.3
|
||||
nodeenv==1.6.0
|
||||
numpy==1.19.5
|
||||
oauthlib==3.1.1
|
||||
opt-einsum==3.3.0
|
||||
optax==0.0.8
|
||||
packaging==20.9
|
||||
pandas==1.2.5
|
||||
parso==0.8.2
|
||||
pathspec==0.8.1
|
||||
pathtools==0.1.2
|
||||
pexpect==4.8.0
|
||||
pickleshare==0.7.5
|
||||
pillow==8.3.0
|
||||
pip==20.0.2
|
||||
pkg-resources==0.0.0
|
||||
pre-commit==2.13.0
|
||||
promise==2.3
|
||||
prompt-toolkit==3.0.19
|
||||
protobuf==3.17.3
|
||||
psutil==5.8.0
|
||||
ptyprocess==0.7.0
|
||||
pyarrow==4.0.1
|
||||
pyasn1-modules==0.2.8
|
||||
pyasn1==0.4.8
|
||||
pycodestyle==2.7.0
|
||||
pyflakes==2.3.1
|
||||
pygments==2.9.0
|
||||
pyparsing==2.4.7
|
||||
python-dateutil==2.8.1
|
||||
pytz==2021.1
|
||||
pyyaml==5.4.1
|
||||
regex==2021.7.1
|
||||
requests-oauthlib==1.3.0
|
||||
requests==2.25.1
|
||||
rsa==4.7.2
|
||||
sacremoses==0.0.45
|
||||
scipy==1.7.0
|
||||
sentry-sdk==1.3.0
|
||||
setuptools==44.0.0
|
||||
shortuuid==1.0.1
|
||||
six==1.15.0
|
||||
smmap==4.0.0
|
||||
subprocess32==3.5.4
|
||||
tensorboard-data-server==0.6.1
|
||||
tensorboard-plugin-wit==1.8.0
|
||||
tensorboard==2.5.0
|
||||
tensorflow-estimator==2.5.0
|
||||
tensorflow==2.5.0
|
||||
termcolor==1.1.0
|
||||
tokenizers==0.10.3
|
||||
toml==0.10.2
|
||||
toolz==0.11.1
|
||||
torch==1.9.0
|
||||
tqdm==4.61.1
|
||||
traitlets==5.0.5
|
||||
transformers==4.9.0.dev0
|
||||
typing-extensions==3.7.4.3
|
||||
urllib3==1.26.6
|
||||
virtualenv==20.4.7
|
||||
wandb==0.10.33
|
||||
wcwidth==0.2.5
|
||||
werkzeug==2.0.1
|
||||
wheel==0.36.2
|
||||
wrapt==1.12.1
|
||||
xxhash==2.0.2
|
||||
yarl==1.6.3
|
||||
@@ -0,0 +1,45 @@
|
||||
{
|
||||
"os": "Linux-5.4.0-1043-gcp-x86_64-with-glibc2.29",
|
||||
"python": "3.8.10",
|
||||
"heartbeatAt": "2021-07-12T04:42:50.208592",
|
||||
"startedAt": "2021-07-12T04:42:48.264668",
|
||||
"docker": null,
|
||||
"cpu_count": 96,
|
||||
"cuda": null,
|
||||
"args": [
|
||||
"--output_dir=../tmp/../gpt-2-tamil/",
|
||||
"--model_type=gpt2",
|
||||
"--config_name=../gpt-2-tamil/",
|
||||
"--tokenizer_name=../gpt-2-tamil/",
|
||||
"--dataset_name=oscar",
|
||||
"--dataset_config_name=unshuffled_deduplicated_ta",
|
||||
"--do_train",
|
||||
"--do_eval",
|
||||
"--block_size=512",
|
||||
"--per_device_train_batch_size=64",
|
||||
"--per_device_eval_batch_size=64",
|
||||
"--learning_rate=3e-5",
|
||||
"--warmup_steps=1000",
|
||||
"--adam_beta1=0.9",
|
||||
"--adam_beta2=0.98",
|
||||
"--weight_decay=0.01",
|
||||
"--overwrite_output_dir",
|
||||
"--num_train_epochs=1",
|
||||
"--report_to",
|
||||
"wandb",
|
||||
"--run_name",
|
||||
"trial"
|
||||
],
|
||||
"state": "running",
|
||||
"program": "../src/run_clm_flax.py",
|
||||
"codePath": "src/run_clm_flax.py",
|
||||
"git": {
|
||||
"remote": "https://github.com/AbinayaM02/GPT2-Tamil.git",
|
||||
"commit": "a828229d00c071e9ced919095290b80e4781210e"
|
||||
},
|
||||
"email": "abinaya.m02@mphasis.com",
|
||||
"root": "/home/tweety_abi/GPT2-Tamil",
|
||||
"host": "t1v-n-ebe36c53-w-0",
|
||||
"username": "tweety_abi",
|
||||
"executable": "/home/tweety_abi/gpt2_env/bin/python"
|
||||
}
|
||||
@@ -0,0 +1 @@
|
||||
{}
|
||||
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:5fcfc08cf0afaa70518eae77306ccb85256b1c75804bb875c43e69ead82eecee
|
||||
size 351322
|
||||
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:629872cc9a122d0b701da9fb5b2d152a25a06d9c316ff22a307c2d5297a5f684
|
||||
size 5672
|
||||
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:77335af984a7fc18e2e903ce57acfa4f5ee5a60613ffb55a60c3e1996007f5e9
|
||||
size 327917
|
||||
305
scripts/wandb/run-20210712_164126-1cgtoi5r/files/config.yaml
Normal file
305
scripts/wandb/run-20210712_164126-1cgtoi5r/files/config.yaml
Normal file
@@ -0,0 +1,305 @@
|
||||
wandb_version: 1
|
||||
|
||||
__cached__setup_devices:
|
||||
desc: null
|
||||
value: cpu
|
||||
_n_gpu:
|
||||
desc: null
|
||||
value: 0
|
||||
_wandb:
|
||||
desc: null
|
||||
value:
|
||||
cli_version: 0.10.33
|
||||
framework: huggingface
|
||||
huggingface_version: 4.9.0.dev0
|
||||
is_jupyter_run: false
|
||||
is_kaggle_kernel: false
|
||||
python_version: 3.8.10
|
||||
t:
|
||||
1:
|
||||
- 1
|
||||
- 3
|
||||
- 11
|
||||
2:
|
||||
- 1
|
||||
- 3
|
||||
- 11
|
||||
4: 3.8.10
|
||||
5: 0.10.33
|
||||
6: 4.9.0.dev0
|
||||
8:
|
||||
- 5
|
||||
adafactor:
|
||||
desc: null
|
||||
value: false
|
||||
adam_beta1:
|
||||
desc: null
|
||||
value: 0.9
|
||||
adam_beta2:
|
||||
desc: null
|
||||
value: 0.98
|
||||
adam_epsilon:
|
||||
desc: null
|
||||
value: 1.0e-08
|
||||
block_size:
|
||||
desc: null
|
||||
value: 512
|
||||
cache_dir:
|
||||
desc: null
|
||||
value: null
|
||||
config_name:
|
||||
desc: null
|
||||
value: ../gpt-2-tamil/
|
||||
dataloader_drop_last:
|
||||
desc: null
|
||||
value: false
|
||||
dataloader_num_workers:
|
||||
desc: null
|
||||
value: 0
|
||||
dataloader_pin_memory:
|
||||
desc: null
|
||||
value: true
|
||||
dataset_config_name:
|
||||
desc: null
|
||||
value: unshuffled_deduplicated_ta
|
||||
dataset_name:
|
||||
desc: null
|
||||
value: oscar
|
||||
ddp_find_unused_parameters:
|
||||
desc: null
|
||||
value: null
|
||||
debug:
|
||||
desc: null
|
||||
value: []
|
||||
deepspeed:
|
||||
desc: null
|
||||
value: null
|
||||
disable_tqdm:
|
||||
desc: null
|
||||
value: false
|
||||
do_eval:
|
||||
desc: null
|
||||
value: true
|
||||
do_predict:
|
||||
desc: null
|
||||
value: false
|
||||
do_train:
|
||||
desc: null
|
||||
value: true
|
||||
dtype:
|
||||
desc: null
|
||||
value: float32
|
||||
eval_accumulation_steps:
|
||||
desc: null
|
||||
value: null
|
||||
eval_steps:
|
||||
desc: null
|
||||
value: 2500
|
||||
evaluation_strategy:
|
||||
desc: null
|
||||
value: IntervalStrategy.NO
|
||||
fp16:
|
||||
desc: null
|
||||
value: false
|
||||
fp16_backend:
|
||||
desc: null
|
||||
value: auto
|
||||
fp16_full_eval:
|
||||
desc: null
|
||||
value: false
|
||||
fp16_opt_level:
|
||||
desc: null
|
||||
value: O1
|
||||
gradient_accumulation_steps:
|
||||
desc: null
|
||||
value: 1
|
||||
greater_is_better:
|
||||
desc: null
|
||||
value: null
|
||||
group_by_length:
|
||||
desc: null
|
||||
value: false
|
||||
ignore_data_skip:
|
||||
desc: null
|
||||
value: false
|
||||
label_names:
|
||||
desc: null
|
||||
value: null
|
||||
label_smoothing_factor:
|
||||
desc: null
|
||||
value: 0.0
|
||||
learning_rate:
|
||||
desc: null
|
||||
value: 3.0e-05
|
||||
length_column_name:
|
||||
desc: null
|
||||
value: length
|
||||
load_best_model_at_end:
|
||||
desc: null
|
||||
value: false
|
||||
local_rank:
|
||||
desc: null
|
||||
value: -1
|
||||
log_level:
|
||||
desc: null
|
||||
value: -1
|
||||
log_level_replica:
|
||||
desc: null
|
||||
value: -1
|
||||
log_on_each_node:
|
||||
desc: null
|
||||
value: true
|
||||
logging_dir:
|
||||
desc: null
|
||||
value: ../gpt-2-tamil/runs/Jul12_16-26-59_t1v-n-ebe36c53-w-0
|
||||
logging_first_step:
|
||||
desc: null
|
||||
value: false
|
||||
logging_steps:
|
||||
desc: null
|
||||
value: 500
|
||||
logging_strategy:
|
||||
desc: null
|
||||
value: IntervalStrategy.STEPS
|
||||
lr_scheduler_type:
|
||||
desc: null
|
||||
value: SchedulerType.LINEAR
|
||||
max_eval_samples:
|
||||
desc: null
|
||||
value: null
|
||||
max_grad_norm:
|
||||
desc: null
|
||||
value: 1.0
|
||||
max_steps:
|
||||
desc: null
|
||||
value: -1
|
||||
max_train_samples:
|
||||
desc: null
|
||||
value: null
|
||||
metric_for_best_model:
|
||||
desc: null
|
||||
value: null
|
||||
model_name_or_path:
|
||||
desc: null
|
||||
value: null
|
||||
model_type:
|
||||
desc: null
|
||||
value: gpt2
|
||||
mp_parameters:
|
||||
desc: null
|
||||
value: ''
|
||||
no_cuda:
|
||||
desc: null
|
||||
value: false
|
||||
num_train_epochs:
|
||||
desc: null
|
||||
value: 1.0
|
||||
output_dir:
|
||||
desc: null
|
||||
value: ../gpt-2-tamil/
|
||||
overwrite_cache:
|
||||
desc: null
|
||||
value: false
|
||||
overwrite_output_dir:
|
||||
desc: null
|
||||
value: true
|
||||
past_index:
|
||||
desc: null
|
||||
value: -1
|
||||
per_device_eval_batch_size:
|
||||
desc: null
|
||||
value: 64
|
||||
per_device_train_batch_size:
|
||||
desc: null
|
||||
value: 64
|
||||
per_gpu_eval_batch_size:
|
||||
desc: null
|
||||
value: null
|
||||
per_gpu_train_batch_size:
|
||||
desc: null
|
||||
value: null
|
||||
prediction_loss_only:
|
||||
desc: null
|
||||
value: false
|
||||
preprocessing_num_workers:
|
||||
desc: null
|
||||
value: 90
|
||||
push_to_hub:
|
||||
desc: null
|
||||
value: false
|
||||
push_to_hub_model_id:
|
||||
desc: null
|
||||
value: gpt-2-tamil
|
||||
push_to_hub_organization:
|
||||
desc: null
|
||||
value: null
|
||||
push_to_hub_token:
|
||||
desc: null
|
||||
value: null
|
||||
remove_unused_columns:
|
||||
desc: null
|
||||
value: true
|
||||
report_to:
|
||||
desc: null
|
||||
value:
|
||||
- wandb
|
||||
resume_from_checkpoint:
|
||||
desc: null
|
||||
value: null
|
||||
run_name:
|
||||
desc: null
|
||||
value: trial
|
||||
save_on_each_node:
|
||||
desc: null
|
||||
value: false
|
||||
save_steps:
|
||||
desc: null
|
||||
value: 2500
|
||||
save_strategy:
|
||||
desc: null
|
||||
value: IntervalStrategy.STEPS
|
||||
save_total_limit:
|
||||
desc: null
|
||||
value: null
|
||||
seed:
|
||||
desc: null
|
||||
value: 42
|
||||
sharded_ddp:
|
||||
desc: null
|
||||
value: []
|
||||
skip_memory_metrics:
|
||||
desc: null
|
||||
value: true
|
||||
tokenizer_name:
|
||||
desc: null
|
||||
value: ../gpt-2-tamil/
|
||||
tpu_metrics_debug:
|
||||
desc: null
|
||||
value: false
|
||||
tpu_num_cores:
|
||||
desc: null
|
||||
value: null
|
||||
train_file:
|
||||
desc: null
|
||||
value: null
|
||||
use_fast_tokenizer:
|
||||
desc: null
|
||||
value: true
|
||||
use_legacy_prediction_loop:
|
||||
desc: null
|
||||
value: false
|
||||
validation_file:
|
||||
desc: null
|
||||
value: null
|
||||
validation_split_percentage:
|
||||
desc: null
|
||||
value: 5
|
||||
warmup_ratio:
|
||||
desc: null
|
||||
value: 0.0
|
||||
warmup_steps:
|
||||
desc: null
|
||||
value: 1000
|
||||
weight_decay:
|
||||
desc: null
|
||||
value: 0.01
|
||||
@@ -0,0 +1 @@
|
||||
/home/tweety_abi/GPT2-Tamil/gpt-2-tamil/events.out.tfevents.1626108088.t1v-n-ebe36c53-w-0.483452.3.v2
|
||||
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:e0919562e4d7c8bbdebb2074976c553f66727900bc770c5dd9d8041e3a008931
|
||||
size 2408
|
||||
@@ -0,0 +1,123 @@
|
||||
absl-py==0.13.0
|
||||
aiohttp==3.7.4.post0
|
||||
appdirs==1.4.4
|
||||
astunparse==1.6.3
|
||||
async-timeout==3.0.1
|
||||
attrs==21.2.0
|
||||
backcall==0.2.0
|
||||
black==21.6b0
|
||||
cachetools==4.2.2
|
||||
certifi==2021.5.30
|
||||
cfgv==3.3.0
|
||||
chardet==4.0.0
|
||||
chex==0.0.7
|
||||
click==8.0.1
|
||||
configparser==5.0.2
|
||||
cycler==0.10.0
|
||||
datasets==1.8.1.dev0
|
||||
decorator==5.0.9
|
||||
dill==0.3.4
|
||||
distlib==0.3.2
|
||||
dm-tree==0.1.6
|
||||
docker-pycreds==0.4.0
|
||||
filelock==3.0.12
|
||||
flake8==3.9.2
|
||||
flatbuffers==1.12
|
||||
flax==0.3.4
|
||||
fsspec==2021.6.1
|
||||
gast==0.4.0
|
||||
gitdb==4.0.7
|
||||
gitpython==3.1.18
|
||||
google-auth-oauthlib==0.4.4
|
||||
google-auth==1.32.1
|
||||
google-pasta==0.2.0
|
||||
grpcio==1.34.1
|
||||
h5py==3.1.0
|
||||
huggingface-hub==0.0.12
|
||||
identify==2.2.10
|
||||
idna==2.10
|
||||
ipython-genutils==0.2.0
|
||||
ipython==7.25.0
|
||||
isort==5.9.1
|
||||
jax==0.2.16
|
||||
jaxlib==0.1.68
|
||||
jedi==0.18.0
|
||||
joblib==1.0.1
|
||||
keras-nightly==2.5.0.dev2021032900
|
||||
keras-preprocessing==1.1.2
|
||||
kiwisolver==1.3.1
|
||||
libtpu-nightly==0.1.dev20210615
|
||||
markdown==3.3.4
|
||||
matplotlib-inline==0.1.2
|
||||
matplotlib==3.4.2
|
||||
mccabe==0.6.1
|
||||
msgpack==1.0.2
|
||||
multidict==5.1.0
|
||||
multiprocess==0.70.12.2
|
||||
mypy-extensions==0.4.3
|
||||
nodeenv==1.6.0
|
||||
numpy==1.19.5
|
||||
oauthlib==3.1.1
|
||||
opt-einsum==3.3.0
|
||||
optax==0.0.8
|
||||
packaging==20.9
|
||||
pandas==1.2.5
|
||||
parso==0.8.2
|
||||
pathspec==0.8.1
|
||||
pathtools==0.1.2
|
||||
pexpect==4.8.0
|
||||
pickleshare==0.7.5
|
||||
pillow==8.3.0
|
||||
pip==20.0.2
|
||||
pkg-resources==0.0.0
|
||||
pre-commit==2.13.0
|
||||
promise==2.3
|
||||
prompt-toolkit==3.0.19
|
||||
protobuf==3.17.3
|
||||
psutil==5.8.0
|
||||
ptyprocess==0.7.0
|
||||
pyarrow==4.0.1
|
||||
pyasn1-modules==0.2.8
|
||||
pyasn1==0.4.8
|
||||
pycodestyle==2.7.0
|
||||
pyflakes==2.3.1
|
||||
pygments==2.9.0
|
||||
pyparsing==2.4.7
|
||||
python-dateutil==2.8.1
|
||||
pytz==2021.1
|
||||
pyyaml==5.4.1
|
||||
regex==2021.7.1
|
||||
requests-oauthlib==1.3.0
|
||||
requests==2.25.1
|
||||
rsa==4.7.2
|
||||
sacremoses==0.0.45
|
||||
scipy==1.7.0
|
||||
sentry-sdk==1.3.0
|
||||
setuptools==44.0.0
|
||||
shortuuid==1.0.1
|
||||
six==1.15.0
|
||||
smmap==4.0.0
|
||||
subprocess32==3.5.4
|
||||
tensorboard-data-server==0.6.1
|
||||
tensorboard-plugin-wit==1.8.0
|
||||
tensorboard==2.5.0
|
||||
tensorflow-estimator==2.5.0
|
||||
tensorflow==2.5.0
|
||||
termcolor==1.1.0
|
||||
tokenizers==0.10.3
|
||||
toml==0.10.2
|
||||
toolz==0.11.1
|
||||
torch==1.9.0
|
||||
tqdm==4.61.1
|
||||
traitlets==5.0.5
|
||||
transformers==4.9.0.dev0
|
||||
typing-extensions==3.7.4.3
|
||||
urllib3==1.26.6
|
||||
virtualenv==20.4.7
|
||||
wandb==0.10.33
|
||||
wcwidth==0.2.5
|
||||
werkzeug==2.0.1
|
||||
wheel==0.36.2
|
||||
wrapt==1.12.1
|
||||
xxhash==2.0.2
|
||||
yarl==1.6.3
|
||||
@@ -0,0 +1,49 @@
|
||||
{
|
||||
"os": "Linux-5.4.0-1043-gcp-x86_64-with-glibc2.29",
|
||||
"python": "3.8.10",
|
||||
"heartbeatAt": "2021-07-12T16:41:28.249908",
|
||||
"startedAt": "2021-07-12T16:41:26.246514",
|
||||
"docker": null,
|
||||
"cpu_count": 96,
|
||||
"cuda": null,
|
||||
"args": [
|
||||
"--output_dir=../gpt-2-tamil/",
|
||||
"--model_type=gpt2",
|
||||
"--config_name=../gpt-2-tamil/",
|
||||
"--tokenizer_name=../gpt-2-tamil/",
|
||||
"--dataset_name=oscar",
|
||||
"--dataset_config_name=unshuffled_deduplicated_ta",
|
||||
"--do_train",
|
||||
"--do_eval",
|
||||
"--block_size=512",
|
||||
"--per_device_train_batch_size=64",
|
||||
"--per_device_eval_batch_size=64",
|
||||
"--learning_rate=3e-5",
|
||||
"--warmup_steps=1000",
|
||||
"--adam_beta1=0.9",
|
||||
"--adam_beta2=0.98",
|
||||
"--weight_decay=0.01",
|
||||
"--overwrite_output_dir",
|
||||
"--num_train_epochs=1",
|
||||
"--report_to",
|
||||
"wandb",
|
||||
"--run_name",
|
||||
"trial",
|
||||
"--logging_steps=500",
|
||||
"--save_steps=2500",
|
||||
"--eval_steps=2500",
|
||||
"--preprocessing_num_workers=90"
|
||||
],
|
||||
"state": "running",
|
||||
"program": "../src/run_clm_flax.py",
|
||||
"codePath": "src/run_clm_flax.py",
|
||||
"git": {
|
||||
"remote": "https://github.com/AbinayaM02/GPT2-Tamil.git",
|
||||
"commit": "a828229d00c071e9ced919095290b80e4781210e"
|
||||
},
|
||||
"email": "abinaya.m02@mphasis.com",
|
||||
"root": "/home/tweety_abi/GPT2-Tamil",
|
||||
"host": "t1v-n-ebe36c53-w-0",
|
||||
"username": "tweety_abi",
|
||||
"executable": "/home/tweety_abi/gpt2_env/bin/python"
|
||||
}
|
||||
@@ -0,0 +1 @@
|
||||
{}
|
||||
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:f5042f20446f607f9de1da5328a848218a444a160203dbbe620844d138a5f041
|
||||
size 28874
|
||||
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:b642e86c06ccde2fecec5b035f7154289468f3126e152b9170e2e8d35b655328
|
||||
size 7649
|
||||
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:1302a66f7718be000865df304f0b21d1471bf7bb1cc55e4aba7e50d6f051725d
|
||||
size 15809
|
||||
305
scripts/wandb/run-20210712_164633-1ddv4131/files/config.yaml
Normal file
305
scripts/wandb/run-20210712_164633-1ddv4131/files/config.yaml
Normal file
@@ -0,0 +1,305 @@
|
||||
wandb_version: 1
|
||||
|
||||
__cached__setup_devices:
|
||||
desc: null
|
||||
value: cpu
|
||||
_n_gpu:
|
||||
desc: null
|
||||
value: 0
|
||||
_wandb:
|
||||
desc: null
|
||||
value:
|
||||
cli_version: 0.10.33
|
||||
framework: huggingface
|
||||
huggingface_version: 4.9.0.dev0
|
||||
is_jupyter_run: false
|
||||
is_kaggle_kernel: false
|
||||
python_version: 3.8.10
|
||||
t:
|
||||
1:
|
||||
- 1
|
||||
- 3
|
||||
- 11
|
||||
2:
|
||||
- 1
|
||||
- 3
|
||||
- 11
|
||||
4: 3.8.10
|
||||
5: 0.10.33
|
||||
6: 4.9.0.dev0
|
||||
8:
|
||||
- 5
|
||||
adafactor:
|
||||
desc: null
|
||||
value: false
|
||||
adam_beta1:
|
||||
desc: null
|
||||
value: 0.9
|
||||
adam_beta2:
|
||||
desc: null
|
||||
value: 0.98
|
||||
adam_epsilon:
|
||||
desc: null
|
||||
value: 1.0e-08
|
||||
block_size:
|
||||
desc: null
|
||||
value: 512
|
||||
cache_dir:
|
||||
desc: null
|
||||
value: null
|
||||
config_name:
|
||||
desc: null
|
||||
value: ../gpt-2-tamil/
|
||||
dataloader_drop_last:
|
||||
desc: null
|
||||
value: false
|
||||
dataloader_num_workers:
|
||||
desc: null
|
||||
value: 0
|
||||
dataloader_pin_memory:
|
||||
desc: null
|
||||
value: true
|
||||
dataset_config_name:
|
||||
desc: null
|
||||
value: unshuffled_deduplicated_ta
|
||||
dataset_name:
|
||||
desc: null
|
||||
value: oscar
|
||||
ddp_find_unused_parameters:
|
||||
desc: null
|
||||
value: null
|
||||
debug:
|
||||
desc: null
|
||||
value: []
|
||||
deepspeed:
|
||||
desc: null
|
||||
value: null
|
||||
disable_tqdm:
|
||||
desc: null
|
||||
value: false
|
||||
do_eval:
|
||||
desc: null
|
||||
value: true
|
||||
do_predict:
|
||||
desc: null
|
||||
value: false
|
||||
do_train:
|
||||
desc: null
|
||||
value: true
|
||||
dtype:
|
||||
desc: null
|
||||
value: float32
|
||||
eval_accumulation_steps:
|
||||
desc: null
|
||||
value: null
|
||||
eval_steps:
|
||||
desc: null
|
||||
value: 2500
|
||||
evaluation_strategy:
|
||||
desc: null
|
||||
value: IntervalStrategy.NO
|
||||
fp16:
|
||||
desc: null
|
||||
value: false
|
||||
fp16_backend:
|
||||
desc: null
|
||||
value: auto
|
||||
fp16_full_eval:
|
||||
desc: null
|
||||
value: false
|
||||
fp16_opt_level:
|
||||
desc: null
|
||||
value: O1
|
||||
gradient_accumulation_steps:
|
||||
desc: null
|
||||
value: 1
|
||||
greater_is_better:
|
||||
desc: null
|
||||
value: null
|
||||
group_by_length:
|
||||
desc: null
|
||||
value: false
|
||||
ignore_data_skip:
|
||||
desc: null
|
||||
value: false
|
||||
label_names:
|
||||
desc: null
|
||||
value: null
|
||||
label_smoothing_factor:
|
||||
desc: null
|
||||
value: 0.0
|
||||
learning_rate:
|
||||
desc: null
|
||||
value: 3.0e-05
|
||||
length_column_name:
|
||||
desc: null
|
||||
value: length
|
||||
load_best_model_at_end:
|
||||
desc: null
|
||||
value: false
|
||||
local_rank:
|
||||
desc: null
|
||||
value: -1
|
||||
log_level:
|
||||
desc: null
|
||||
value: -1
|
||||
log_level_replica:
|
||||
desc: null
|
||||
value: -1
|
||||
log_on_each_node:
|
||||
desc: null
|
||||
value: true
|
||||
logging_dir:
|
||||
desc: null
|
||||
value: ../gpt-2-tamil/runs/Jul12_16-45-48_t1v-n-ebe36c53-w-0
|
||||
logging_first_step:
|
||||
desc: null
|
||||
value: false
|
||||
logging_steps:
|
||||
desc: null
|
||||
value: 500
|
||||
logging_strategy:
|
||||
desc: null
|
||||
value: IntervalStrategy.STEPS
|
||||
lr_scheduler_type:
|
||||
desc: null
|
||||
value: SchedulerType.LINEAR
|
||||
max_eval_samples:
|
||||
desc: null
|
||||
value: null
|
||||
max_grad_norm:
|
||||
desc: null
|
||||
value: 1.0
|
||||
max_steps:
|
||||
desc: null
|
||||
value: -1
|
||||
max_train_samples:
|
||||
desc: null
|
||||
value: null
|
||||
metric_for_best_model:
|
||||
desc: null
|
||||
value: null
|
||||
model_name_or_path:
|
||||
desc: null
|
||||
value: null
|
||||
model_type:
|
||||
desc: null
|
||||
value: gpt2
|
||||
mp_parameters:
|
||||
desc: null
|
||||
value: ''
|
||||
no_cuda:
|
||||
desc: null
|
||||
value: false
|
||||
num_train_epochs:
|
||||
desc: null
|
||||
value: 25.0
|
||||
output_dir:
|
||||
desc: null
|
||||
value: ../gpt-2-tamil/
|
||||
overwrite_cache:
|
||||
desc: null
|
||||
value: false
|
||||
overwrite_output_dir:
|
||||
desc: null
|
||||
value: true
|
||||
past_index:
|
||||
desc: null
|
||||
value: -1
|
||||
per_device_eval_batch_size:
|
||||
desc: null
|
||||
value: 64
|
||||
per_device_train_batch_size:
|
||||
desc: null
|
||||
value: 64
|
||||
per_gpu_eval_batch_size:
|
||||
desc: null
|
||||
value: null
|
||||
per_gpu_train_batch_size:
|
||||
desc: null
|
||||
value: null
|
||||
prediction_loss_only:
|
||||
desc: null
|
||||
value: false
|
||||
preprocessing_num_workers:
|
||||
desc: null
|
||||
value: 90
|
||||
push_to_hub:
|
||||
desc: null
|
||||
value: false
|
||||
push_to_hub_model_id:
|
||||
desc: null
|
||||
value: gpt-2-tamil
|
||||
push_to_hub_organization:
|
||||
desc: null
|
||||
value: null
|
||||
push_to_hub_token:
|
||||
desc: null
|
||||
value: null
|
||||
remove_unused_columns:
|
||||
desc: null
|
||||
value: true
|
||||
report_to:
|
||||
desc: null
|
||||
value:
|
||||
- wandb
|
||||
resume_from_checkpoint:
|
||||
desc: null
|
||||
value: null
|
||||
run_name:
|
||||
desc: null
|
||||
value: trial
|
||||
save_on_each_node:
|
||||
desc: null
|
||||
value: false
|
||||
save_steps:
|
||||
desc: null
|
||||
value: 2500
|
||||
save_strategy:
|
||||
desc: null
|
||||
value: IntervalStrategy.STEPS
|
||||
save_total_limit:
|
||||
desc: null
|
||||
value: null
|
||||
seed:
|
||||
desc: null
|
||||
value: 42
|
||||
sharded_ddp:
|
||||
desc: null
|
||||
value: []
|
||||
skip_memory_metrics:
|
||||
desc: null
|
||||
value: true
|
||||
tokenizer_name:
|
||||
desc: null
|
||||
value: ../gpt-2-tamil/
|
||||
tpu_metrics_debug:
|
||||
desc: null
|
||||
value: false
|
||||
tpu_num_cores:
|
||||
desc: null
|
||||
value: null
|
||||
train_file:
|
||||
desc: null
|
||||
value: null
|
||||
use_fast_tokenizer:
|
||||
desc: null
|
||||
value: true
|
||||
use_legacy_prediction_loop:
|
||||
desc: null
|
||||
value: false
|
||||
validation_file:
|
||||
desc: null
|
||||
value: null
|
||||
validation_split_percentage:
|
||||
desc: null
|
||||
value: 5
|
||||
warmup_ratio:
|
||||
desc: null
|
||||
value: 0.0
|
||||
warmup_steps:
|
||||
desc: null
|
||||
value: 1000
|
||||
weight_decay:
|
||||
desc: null
|
||||
value: 0.01
|
||||
@@ -0,0 +1 @@
|
||||
/home/tweety_abi/GPT2-Tamil/gpt-2-tamil/events.out.tfevents.1626108395.t1v-n-ebe36c53-w-0.486342.3.v2
|
||||
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:7d9761e7442f5b6b99224ee68ee38f3b7e486ead79f4e390bf7e258dc16de973
|
||||
size 4407657
|
||||
@@ -0,0 +1,123 @@
|
||||
absl-py==0.13.0
|
||||
aiohttp==3.7.4.post0
|
||||
appdirs==1.4.4
|
||||
astunparse==1.6.3
|
||||
async-timeout==3.0.1
|
||||
attrs==21.2.0
|
||||
backcall==0.2.0
|
||||
black==21.6b0
|
||||
cachetools==4.2.2
|
||||
certifi==2021.5.30
|
||||
cfgv==3.3.0
|
||||
chardet==4.0.0
|
||||
chex==0.0.7
|
||||
click==8.0.1
|
||||
configparser==5.0.2
|
||||
cycler==0.10.0
|
||||
datasets==1.8.1.dev0
|
||||
decorator==5.0.9
|
||||
dill==0.3.4
|
||||
distlib==0.3.2
|
||||
dm-tree==0.1.6
|
||||
docker-pycreds==0.4.0
|
||||
filelock==3.0.12
|
||||
flake8==3.9.2
|
||||
flatbuffers==1.12
|
||||
flax==0.3.4
|
||||
fsspec==2021.6.1
|
||||
gast==0.4.0
|
||||
gitdb==4.0.7
|
||||
gitpython==3.1.18
|
||||
google-auth-oauthlib==0.4.4
|
||||
google-auth==1.32.1
|
||||
google-pasta==0.2.0
|
||||
grpcio==1.34.1
|
||||
h5py==3.1.0
|
||||
huggingface-hub==0.0.12
|
||||
identify==2.2.10
|
||||
idna==2.10
|
||||
ipython-genutils==0.2.0
|
||||
ipython==7.25.0
|
||||
isort==5.9.1
|
||||
jax==0.2.16
|
||||
jaxlib==0.1.68
|
||||
jedi==0.18.0
|
||||
joblib==1.0.1
|
||||
keras-nightly==2.5.0.dev2021032900
|
||||
keras-preprocessing==1.1.2
|
||||
kiwisolver==1.3.1
|
||||
libtpu-nightly==0.1.dev20210615
|
||||
markdown==3.3.4
|
||||
matplotlib-inline==0.1.2
|
||||
matplotlib==3.4.2
|
||||
mccabe==0.6.1
|
||||
msgpack==1.0.2
|
||||
multidict==5.1.0
|
||||
multiprocess==0.70.12.2
|
||||
mypy-extensions==0.4.3
|
||||
nodeenv==1.6.0
|
||||
numpy==1.19.5
|
||||
oauthlib==3.1.1
|
||||
opt-einsum==3.3.0
|
||||
optax==0.0.8
|
||||
packaging==20.9
|
||||
pandas==1.2.5
|
||||
parso==0.8.2
|
||||
pathspec==0.8.1
|
||||
pathtools==0.1.2
|
||||
pexpect==4.8.0
|
||||
pickleshare==0.7.5
|
||||
pillow==8.3.0
|
||||
pip==20.0.2
|
||||
pkg-resources==0.0.0
|
||||
pre-commit==2.13.0
|
||||
promise==2.3
|
||||
prompt-toolkit==3.0.19
|
||||
protobuf==3.17.3
|
||||
psutil==5.8.0
|
||||
ptyprocess==0.7.0
|
||||
pyarrow==4.0.1
|
||||
pyasn1-modules==0.2.8
|
||||
pyasn1==0.4.8
|
||||
pycodestyle==2.7.0
|
||||
pyflakes==2.3.1
|
||||
pygments==2.9.0
|
||||
pyparsing==2.4.7
|
||||
python-dateutil==2.8.1
|
||||
pytz==2021.1
|
||||
pyyaml==5.4.1
|
||||
regex==2021.7.1
|
||||
requests-oauthlib==1.3.0
|
||||
requests==2.25.1
|
||||
rsa==4.7.2
|
||||
sacremoses==0.0.45
|
||||
scipy==1.7.0
|
||||
sentry-sdk==1.3.0
|
||||
setuptools==44.0.0
|
||||
shortuuid==1.0.1
|
||||
six==1.15.0
|
||||
smmap==4.0.0
|
||||
subprocess32==3.5.4
|
||||
tensorboard-data-server==0.6.1
|
||||
tensorboard-plugin-wit==1.8.0
|
||||
tensorboard==2.5.0
|
||||
tensorflow-estimator==2.5.0
|
||||
tensorflow==2.5.0
|
||||
termcolor==1.1.0
|
||||
tokenizers==0.10.3
|
||||
toml==0.10.2
|
||||
toolz==0.11.1
|
||||
torch==1.9.0
|
||||
tqdm==4.61.1
|
||||
traitlets==5.0.5
|
||||
transformers==4.9.0.dev0
|
||||
typing-extensions==3.7.4.3
|
||||
urllib3==1.26.6
|
||||
virtualenv==20.4.7
|
||||
wandb==0.10.33
|
||||
wcwidth==0.2.5
|
||||
werkzeug==2.0.1
|
||||
wheel==0.36.2
|
||||
wrapt==1.12.1
|
||||
xxhash==2.0.2
|
||||
yarl==1.6.3
|
||||
@@ -0,0 +1,49 @@
|
||||
{
|
||||
"os": "Linux-5.4.0-1043-gcp-x86_64-with-glibc2.29",
|
||||
"python": "3.8.10",
|
||||
"heartbeatAt": "2021-07-12T16:46:35.350252",
|
||||
"startedAt": "2021-07-12T16:46:33.416306",
|
||||
"docker": null,
|
||||
"cpu_count": 96,
|
||||
"cuda": null,
|
||||
"args": [
|
||||
"--output_dir=../gpt-2-tamil/",
|
||||
"--model_type=gpt2",
|
||||
"--config_name=../gpt-2-tamil/",
|
||||
"--tokenizer_name=../gpt-2-tamil/",
|
||||
"--dataset_name=oscar",
|
||||
"--dataset_config_name=unshuffled_deduplicated_ta",
|
||||
"--do_train",
|
||||
"--do_eval",
|
||||
"--block_size=512",
|
||||
"--per_device_train_batch_size=64",
|
||||
"--per_device_eval_batch_size=64",
|
||||
"--learning_rate=3e-5",
|
||||
"--warmup_steps=1000",
|
||||
"--adam_beta1=0.9",
|
||||
"--adam_beta2=0.98",
|
||||
"--weight_decay=0.01",
|
||||
"--overwrite_output_dir",
|
||||
"--num_train_epochs=25",
|
||||
"--report_to",
|
||||
"wandb",
|
||||
"--run_name",
|
||||
"trial",
|
||||
"--logging_steps=500",
|
||||
"--save_steps=2500",
|
||||
"--eval_steps=2500",
|
||||
"--preprocessing_num_workers=90"
|
||||
],
|
||||
"state": "running",
|
||||
"program": "../src/run_clm_flax.py",
|
||||
"codePath": "src/run_clm_flax.py",
|
||||
"git": {
|
||||
"remote": "https://github.com/AbinayaM02/GPT2-Tamil.git",
|
||||
"commit": "5d59c6a635e952a0f51ef33ed713960a04e9dcb6"
|
||||
},
|
||||
"email": "abinaya.m02@mphasis.com",
|
||||
"root": "/home/tweety_abi/GPT2-Tamil",
|
||||
"host": "t1v-n-ebe36c53-w-0",
|
||||
"username": "tweety_abi",
|
||||
"executable": "/home/tweety_abi/gpt2_env/bin/python"
|
||||
}
|
||||
@@ -0,0 +1 @@
|
||||
{"global_step": 132500, "_timestamp": 1626248099.379086, "train_time": 743654.875, "train_learning_rate": 1.1402963906448349e-08, "_step": 264206, "train_loss": 1.1299134492874146, "eval_loss": 1.1545542478561401, "eval_perplexity": 3.1726088523864746}
|
||||
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:748fffc8fe7bbd39d404a1bae61d5711a3e098491142dc28b16d5d75e32dc937
|
||||
size 97283434
|
||||
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:36e11410ff19af1db092231a1450397dffb80ef21248540b6d372dcf5606559c
|
||||
size 8797
|
||||
@@ -0,0 +1,3 @@
|
||||
version https://git-lfs.github.com/spec/v1
|
||||
oid sha256:d8211487b4d0a0489ae4728120abad1be7ee4190520afc47fdae166087ae6068
|
||||
size 60817322
|
||||
Reference in New Issue
Block a user