{ "version": "1.0", "truncation": null, "padding": null, "added_tokens": [ { "id": 0, "content": "UNK", "single_word": false, "lstrip": false, "rstrip": false, "normalized": false, "special": true }, { "id": 1, "content": "PAD", "single_word": false, "lstrip": false, "rstrip": false, "normalized": false, "special": true }, { "id": 2, "content": "UTT_BOUNDARY", "single_word": false, "lstrip": false, "rstrip": false, "normalized": false, "special": true } ], "normalizer": { "type": "Sequence", "normalizers": [ { "type": "Replace", "pattern": { "String": "ː" }, "content": " ː " }, { "type": "Strip", "strip_left": true, "strip_right": true } ] }, "pre_tokenizer": { "type": "Whitespace" }, "post_processor": { "type": "TemplateProcessing", "single": [ { "SpecialToken": { "id": "UTT_BOUNDARY", "type_id": 0 } }, { "Sequence": { "id": "A", "type_id": 0 } } ], "pair": [ { "Sequence": { "id": "A", "type_id": 0 } }, { "Sequence": { "id": "B", "type_id": 1 } } ], "special_tokens": { "UTT_BOUNDARY": { "id": "UTT_BOUNDARY", "ids": [ 2 ], "tokens": [ "UTT_BOUNDARY" ] } } }, "decoder": null, "model": { "type": "WordLevel", "vocab": { "UNK": 0, "PAD": 1, "UTT_BOUNDARY": 2, "ɪ": 3, "ç": 4, "WORD_BOUNDARY": 5, "v": 6, "a": 7, "ː": 8, "ɐ": 9, "aʊ": 10, "f": 11, "ʀ": 12, "aɪ": 13, "z": 14, "ə": 15, "n": 16, "ʊ": 17, "t": 18, "h": 19, "ts": 20, "m": 21, "b": 22, "ɡ": 23, "ɔ": 24, "d": 25, "s": 26, "ʃ": 27, "i": 28, "ʊɐ": 29, "l": 30, "ŋ": 31, "ɛ": 32, "e": 33, "u": 34, "k": 35, "ʏ": 36, "j": 37, "p": 38, "x": 39, "o": 40, "y": 41, "œ": 42, "pf": 43, "ø": 44, "w": 45, "eɪ": 46, "ɒ": 47, "t̠ʃ": 48, "d̠ʒ": 49, "ã": 50, "əʊ": 51, "ɹ": 52, "eə": 53, "ʌ": 54, "ɛɪ": 55, "ð": 56, "ɔɪ": 57, "ʒ": 58, "iə": 59, "θ": 60, "ʊə": 61, "œ̃": 62, "ɔ̃": 63, "l̩": 64, "tɕ": 65, "ɕ": 66, "c": 67, "ɲ": 68, "tʰ": 69, "æ": 70, "ɜ": 71, "ɑ": 72, "oʊ": 73, "ʂ": 74, "ʈ": 75, "ɖ": 76, "ɭ": 77, "ʋ": 78, "ʰχ": 79, "ʲ": 80, "ɟ": 81, "ɳ": 82, "bʰ": 83, "dʰ": 84 }, "unk_token": "UNK" } }