add tokenizer

Browse files

Files changed (4) hide show

sentencepiece.bpe.model +2 -2
special_tokens_map.json +100 -210
tokenizer_config.json +108 -13
vocab.json +0 -0

sentencepiece.bpe.model CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:14bb8dfb35c0ffdea7bc01e56cea38b9e3d5efcdcb9c251d6b40538e1aab555a
-size 4852054

 version https://git-lfs.github.com/spec/v1
+oid sha256:d8f7c76ed2a5e0822be39f0a4f95a55eb19c78f4593ce609e2edbc2aea4d380a
+size 2423393

special_tokens_map.json CHANGED Viewed

@@ -1,218 +1,108 @@
 {
   "additional_special_tokens": [
-    "ace_Arab",
-    "ace_Latn",
-    "acm_Arab",
-    "acq_Arab",
-    "aeb_Arab",
-    "afr_Latn",
-    "ajp_Arab",
-    "aka_Latn",
-    "amh_Ethi",
-    "apc_Arab",
-    "arb_Arab",
-    "ars_Arab",
-    "ary_Arab",
-    "arz_Arab",
-    "asm_Beng",
-    "ast_Latn",
-    "awa_Deva",
-    "ayr_Latn",
-    "azb_Arab",
-    "azj_Latn",
-    "bak_Cyrl",
-    "bam_Latn",
-    "ban_Latn",
-    "bel_Cyrl",
-    "bem_Latn",
-    "ben_Beng",
-    "bho_Deva",
-    "bjn_Arab",
-    "bjn_Latn",
-    "bod_Tibt",
-    "bos_Latn",
-    "bug_Latn",
-    "bul_Cyrl",
-    "cat_Latn",
-    "ceb_Latn",
-    "ces_Latn",
-    "cjk_Latn",
-    "ckb_Arab",
-    "crh_Latn",
-    "cym_Latn",
-    "dan_Latn",
-    "deu_Latn",
-    "dik_Latn",
-    "dyu_Latn",
-    "dzo_Tibt",
-    "ell_Grek",
-    "eng_Latn",
-    "epo_Latn",
-    "est_Latn",
-    "eus_Latn",
-    "ewe_Latn",
-    "fao_Latn",
-    "pes_Arab",
-    "fij_Latn",
-    "fin_Latn",
-    "fon_Latn",
-    "fra_Latn",
-    "fur_Latn",
-    "fuv_Latn",
-    "gla_Latn",
-    "gle_Latn",
-    "glg_Latn",
-    "grn_Latn",
-    "guj_Gujr",
-    "hat_Latn",
-    "hau_Latn",
-    "heb_Hebr",
-    "hin_Deva",
-    "hne_Deva",
-    "hrv_Latn",
-    "hun_Latn",
-    "hye_Armn",
-    "ibo_Latn",
-    "ilo_Latn",
-    "ind_Latn",
-    "isl_Latn",
-    "ita_Latn",
-    "jav_Latn",
-    "jpn_Jpan",
-    "kab_Latn",
-    "kac_Latn",
-    "kam_Latn",
-    "kan_Knda",
-    "kas_Arab",
-    "kas_Deva",
-    "kat_Geor",
-    "knc_Arab",
-    "knc_Latn",
-    "kaz_Cyrl",
-    "kbp_Latn",
-    "kea_Latn",
-    "khm_Khmr",
-    "kik_Latn",
-    "kin_Latn",
-    "kir_Cyrl",
-    "kmb_Latn",
-    "kon_Latn",
-    "kor_Hang",
-    "kmr_Latn",
-    "lao_Laoo",
-    "lvs_Latn",
-    "lij_Latn",
-    "lim_Latn",
-    "lin_Latn",
-    "lit_Latn",
-    "lmo_Latn",
-    "ltg_Latn",
-    "ltz_Latn",
-    "lua_Latn",
-    "lug_Latn",
-    "luo_Latn",
-    "lus_Latn",
-    "mag_Deva",
-    "mai_Deva",
-    "mal_Mlym",
-    "mar_Deva",
-    "min_Latn",
-    "mkd_Cyrl",
-    "plt_Latn",
-    "mlt_Latn",
-    "mni_Beng",
-    "khk_Cyrl",
-    "mos_Latn",
-    "mri_Latn",
-    "zsm_Latn",
-    "mya_Mymr",
-    "nld_Latn",
-    "nno_Latn",
-    "nob_Latn",
-    "npi_Deva",
-    "nso_Latn",
-    "nus_Latn",
-    "nya_Latn",
-    "oci_Latn",
-    "gaz_Latn",
-    "ory_Orya",
-    "pag_Latn",
-    "pan_Guru",
-    "pap_Latn",
-    "pol_Latn",
-    "por_Latn",
-    "prs_Arab",
-    "pbt_Arab",
-    "quy_Latn",
-    "ron_Latn",
-    "run_Latn",
-    "rus_Cyrl",
-    "sag_Latn",
-    "san_Deva",
-    "sat_Beng",
-    "scn_Latn",
-    "shn_Mymr",
-    "sin_Sinh",
-    "slk_Latn",
-    "slv_Latn",
-    "smo_Latn",
-    "sna_Latn",
-    "snd_Arab",
-    "som_Latn",
-    "sot_Latn",
-    "spa_Latn",
-    "als_Latn",
-    "srd_Latn",
-    "srp_Cyrl",
-    "ssw_Latn",
-    "sun_Latn",
-    "swe_Latn",
-    "swh_Latn",
-    "szl_Latn",
-    "tam_Taml",
-    "tat_Cyrl",
-    "tel_Telu",
-    "tgk_Cyrl",
-    "tgl_Latn",
-    "tha_Thai",
-    "tir_Ethi",
-    "taq_Latn",
-    "taq_Tfng",
-    "tpi_Latn",
-    "tsn_Latn",
-    "tso_Latn",
-    "tuk_Latn",
-    "tum_Latn",
-    "tur_Latn",
-    "twi_Latn",
-    "tzm_Tfng",
-    "uig_Arab",
-    "ukr_Cyrl",
-    "umb_Latn",
-    "urd_Arab",
-    "uzn_Latn",
-    "vec_Latn",
-    "vie_Latn",
-    "war_Latn",
-    "wol_Latn",
-    "xho_Latn",
-    "ydd_Hebr",
-    "yor_Latn",
-    "yue_Hant",
-    "zho_Hans",
-    "zho_Hant",
-    "zul_Latn"
   ],
   "bos_token": "<s>",
-  "cls_token": "<s>",
   "eos_token": "</s>",
-  "mask_token": {
-    "content": "<mask>",
-    "lstrip": true,
-    "normalized": true,
-    "rstrip": false,
-    "single_word": false
-  },
   "pad_token": "<pad>",
   "sep_token": "</s>",
   "unk_token": "<unk>"

 {
   "additional_special_tokens": [
+    "__af__",
+    "__am__",
+    "__ar__",
+    "__ast__",
+    "__az__",
+    "__ba__",
+    "__be__",
+    "__bg__",
+    "__bn__",
+    "__br__",
+    "__bs__",
+    "__ca__",
+    "__ceb__",
+    "__cs__",
+    "__cy__",
+    "__da__",
+    "__de__",
+    "__el__",
+    "__en__",
+    "__es__",
+    "__et__",
+    "__fa__",
+    "__ff__",
+    "__fi__",
+    "__fr__",
+    "__fy__",
+    "__ga__",
+    "__gd__",
+    "__gl__",
+    "__gu__",
+    "__ha__",
+    "__he__",
+    "__hi__",
+    "__hr__",
+    "__ht__",
+    "__hu__",
+    "__hy__",
+    "__id__",
+    "__ig__",
+    "__ilo__",
+    "__is__",
+    "__it__",
+    "__ja__",
+    "__jv__",
+    "__ka__",
+    "__kk__",
+    "__km__",
+    "__kn__",
+    "__ko__",
+    "__lb__",
+    "__lg__",
+    "__ln__",
+    "__lo__",
+    "__lt__",
+    "__lv__",
+    "__mg__",
+    "__mk__",
+    "__ml__",
+    "__mn__",
+    "__mr__",
+    "__ms__",
+    "__my__",
+    "__ne__",
+    "__nl__",
+    "__no__",
+    "__ns__",
+    "__oc__",
+    "__or__",
+    "__pa__",
+    "__pl__",
+    "__ps__",
+    "__pt__",
+    "__ro__",
+    "__ru__",
+    "__sd__",
+    "__si__",
+    "__sk__",
+    "__sl__",
+    "__so__",
+    "__sq__",
+    "__sr__",
+    "__ss__",
+    "__su__",
+    "__sv__",
+    "__sw__",
+    "__ta__",
+    "__th__",
+    "__tl__",
+    "__tn__",
+    "__tr__",
+    "__uk__",
+    "__ur__",
+    "__uz__",
+    "__vi__",
+    "__wo__",
+    "__xh__",
+    "__yi__",
+    "__yo__",
+    "__zh__",
+    "__zu__"
   ],
   "bos_token": "<s>",
   "eos_token": "</s>",
   "pad_token": "<pad>",
   "sep_token": "</s>",
   "unk_token": "<unk>"

tokenizer_config.json CHANGED Viewed

@@ -1,24 +1,119 @@
 {
-  "additional_special_tokens": null,
   "bos_token": "<s>",
-  "cls_token": "<s>",
   "eos_token": "</s>",
-  "mask_token": {
-    "__type": "AddedToken",
-    "content": "<mask>",
-    "lstrip": true,
-    "normalized": true,
-    "rstrip": false,
-    "single_word": false
-  },
   "model_max_length": 1024,
-  "name_or_path": "facebook/nllb-200-distilled-600M",
   "pad_token": "<pad>",
   "sep_token": "</s>",
   "sp_model_kwargs": {},
-  "special_tokens_map_file": null,
   "src_lang": "ru",
   "tgt_lang": "zu",
-  "tokenizer_class": "NllbTokenizer",
   "unk_token": "<unk>"
 }

 {
+  "additional_special_tokens": [
+    "__af__",
+    "__am__",
+    "__ar__",
+    "__ast__",
+    "__az__",
+    "__ba__",
+    "__be__",
+    "__bg__",
+    "__bn__",
+    "__br__",
+    "__bs__",
+    "__ca__",
+    "__ceb__",
+    "__cs__",
+    "__cy__",
+    "__da__",
+    "__de__",
+    "__el__",
+    "__en__",
+    "__es__",
+    "__et__",
+    "__fa__",
+    "__ff__",
+    "__fi__",
+    "__fr__",
+    "__fy__",
+    "__ga__",
+    "__gd__",
+    "__gl__",
+    "__gu__",
+    "__ha__",
+    "__he__",
+    "__hi__",
+    "__hr__",
+    "__ht__",
+    "__hu__",
+    "__hy__",
+    "__id__",
+    "__ig__",
+    "__ilo__",
+    "__is__",
+    "__it__",
+    "__ja__",
+    "__jv__",
+    "__ka__",
+    "__kk__",
+    "__km__",
+    "__kn__",
+    "__ko__",
+    "__lb__",
+    "__lg__",
+    "__ln__",
+    "__lo__",
+    "__lt__",
+    "__lv__",
+    "__mg__",
+    "__mk__",
+    "__ml__",
+    "__mn__",
+    "__mr__",
+    "__ms__",
+    "__my__",
+    "__ne__",
+    "__nl__",
+    "__no__",
+    "__ns__",
+    "__oc__",
+    "__or__",
+    "__pa__",
+    "__pl__",
+    "__ps__",
+    "__pt__",
+    "__ro__",
+    "__ru__",
+    "__sd__",
+    "__si__",
+    "__sk__",
+    "__sl__",
+    "__so__",
+    "__sq__",
+    "__sr__",
+    "__ss__",
+    "__su__",
+    "__sv__",
+    "__sw__",
+    "__ta__",
+    "__th__",
+    "__tl__",
+    "__tn__",
+    "__tr__",
+    "__uk__",
+    "__ur__",
+    "__uz__",
+    "__vi__",
+    "__wo__",
+    "__xh__",
+    "__yi__",
+    "__yo__",
+    "__zh__",
+    "__zu__"
+  ],
   "bos_token": "<s>",
   "eos_token": "</s>",
+  "language_codes": "m2m100",
   "model_max_length": 1024,
+  "name_or_path": "facebook/m2m100_418M",
+  "num_madeup_words": 8,
   "pad_token": "<pad>",
   "sep_token": "</s>",
   "sp_model_kwargs": {},
+  "special_tokens_map_file": "m2m_100_1.2B_v2/special_tokens_map.json",
   "src_lang": "ru",
   "tgt_lang": "zu",
+  "tokenizer_class": "M2M100Tokenizer",
+  "tokenizer_file": null,
   "unk_token": "<unk>"
 }

vocab.json ADDED Viewed

The diff for this file is too large to render. See raw diff