Skip to content

Commit 88d660a

Browse files
docs: Improve the formatting of OCR.md
Signed-off-by: Nikos Livathinos <nli@zurich.ibm.com>
1 parent 262b9b0 commit 88d660a

1 file changed

Lines changed: 86 additions & 85 deletions

File tree

docs/concepts/OCR.md

Lines changed: 86 additions & 85 deletions
Original file line numberDiff line numberDiff line change
@@ -88,76 +88,76 @@ ko -> korean
8888

8989
The following table explains the semantic of each language input for RapidOCR
9090

91-
```
92-
token meaning
93-
----------- ---------------------------------------------------------------------------------------
94-
af Afrikaans
95-
arabic Arabic-script family (9): Arabic, Persian, Uyghur, Urdu, Pashto, Kurdish, Sindhi,
96-
Baluchi, English
97-
az Azerbaijani
98-
bs Bosnian
99-
ca Catalan
100-
ch Chinese (Simplified)
101-
chinese_cht Chinese (Traditional)
102-
cs Czech
103-
cy Welsh
104-
cyrillic Cyrillic-script family (34): Russian, Belarusian, Ukrainian, Serbian (Cyrillic),
105-
Bulgarian, Mongolian, Abkhaz, Adyghe, Kabardian, Avar, Dargwa, Ingush, Chechen, Lak,
106-
Lezgian, Tabasaran, Kazakh, Kyrgyz, Tajik, Macedonian, Tatar, Chuvash, Bashkir, Meadow
107-
Mari, Moldovan, Udmurt, Komi, Ossetian, Buriat, Kalmyk, Tuvan, Yakut, Karakalpak,
108-
English
109-
da Danish
110-
de German
111-
devanagari Devanagari-script family (14): Hindi, Marathi, Nepali, Bihari, Maithili, Angika,
112-
Bhojpuri, Magahi, Sadri, Newari, Konkani (Goan), Sanskrit, Haryanvi, English
113-
el Greek
114-
en English
115-
es Spanish
116-
eslav East Slavic family, Cyrillic script (4): Russian, Belarusian, Ukrainian, English
117-
et Estonian
118-
eu Basque
119-
fi Finnish
120-
fr French
121-
ga Irish
122-
gl Galician
123-
hr Croatian
124-
hu Hungarian
125-
id Indonesian
126-
is Icelandic
127-
it Italian
128-
japan Japanese
129-
ka Kannada
130-
korean Korean
131-
ku Kurdish
132-
la Latin
133-
lb Luxembourgish
134-
lt Lithuanian
135-
lv Latvian
136-
mi Maori
137-
ms Malay
138-
mt Maltese
139-
nl Dutch
140-
no Norwegian
141-
oc Occitan
142-
pl Polish
143-
pt Portuguese
144-
qu Quechua
145-
rm Romansh
146-
ro Romanian
147-
rs_latin Serbian (Latin)
148-
sk Slovak
149-
sl Slovenian
150-
sq Albanian
151-
sv Swedish
152-
sw Swahili
153-
ta Tamil
154-
te Telugu
155-
th Thai
156-
tl Tagalog
157-
tr Turkish
158-
uz Uzbek
159-
vi Vietnamese
160-
```
91+
| Token | Meaning |
92+
| ------------- | ------------------------------------------------------------------------------ |
93+
| `af` | Afrikaans |
94+
| `arabic` | Arabic-script family (9): Arabic, Persian, Uyghur, Urdu, Pashto, Kurdish, |
95+
| | Sindhi, Baluchi, English |
96+
| `az` | Azerbaijani |
97+
| `bs` | Bosnian |
98+
| `ca` | Catalan |
99+
| `ch` | Chinese (Simplified) |
100+
| `chinese_cht` | Chinese (Traditional) |
101+
| `cs` | Czech |
102+
| `cy` | Welsh |
103+
| `cyrillic` | Cyrillic-script family (34): Russian, Belarusian, Ukrainian, Serbian |
104+
| | (Cyrillic), Bulgarian, Mongolian, Abkhaz, Adyghe, Kabardian, Avar, Dargwa, |
105+
| | Ingush, Chechen, Lak, Lezgian, Tabasaran, Kazakh, Kyrgyz, Tajik, Macedonian, |
106+
| | Tatar, Chuvash, Bashkir, Meadow Mari, Moldovan, Udmurt, Komi, Ossetian, |
107+
| | Buriat, Kalmyk, Tuvan, Yakut, Karakalpak, English |
108+
| `da` | Danish |
109+
| `de` | German |
110+
| `devanagari` | Devanagari-script family (14): Hindi, Marathi, Nepali, Bihari, Maithili, |
111+
| | Angika, Bhojpuri, Magahi, Sadri, Newari, Konkani (Goan), Sanskrit, Haryanvi, |
112+
| | English |
113+
| `el` | Greek |
114+
| `en` | English |
115+
| `es` | Spanish |
116+
| `eslav` | East Slavic family, Cyrillic script (4): Russian, Belarusian, Ukrainian, |
117+
| | English |
118+
| `et` | Estonian |
119+
| `eu` | Basque |
120+
| `fi` | Finnish |
121+
| `fr` | French |
122+
| `ga` | Irish |
123+
| `gl` | Galician |
124+
| `hr` | Croatian |
125+
| `hu` | Hungarian |
126+
| `id` | Indonesian |
127+
| `is` | Icelandic |
128+
| `it` | Italian |
129+
| `japan` | Japanese |
130+
| `ka` | Kannada |
131+
| `korean` | Korean |
132+
| `ku` | Kurdish |
133+
| `la` | Latin |
134+
| `lb` | Luxembourgish |
135+
| `lt` | Lithuanian |
136+
| `lv` | Latvian |
137+
| `mi` | Maori |
138+
| `ms` | Malay |
139+
| `mt` | Maltese |
140+
| `nl` | Dutch |
141+
| `no` | Norwegian |
142+
| `oc` | Occitan |
143+
| `pl` | Polish |
144+
| `pt` | Portuguese |
145+
| `qu` | Quechua |
146+
| `rm` | Romansh |
147+
| `ro` | Romanian |
148+
| `rs_latin` | Serbian (Latin) |
149+
| `sk` | Slovak |
150+
| `sl` | Slovenian |
151+
| `sq` | Albanian |
152+
| `sv` | Swedish |
153+
| `sw` | Swahili |
154+
| `ta` | Tamil |
155+
| `te` | Telugu |
156+
| `th` | Thai |
157+
| `tl` | Tagalog |
158+
| `tr` | Turkish |
159+
| `uz` | Uzbek |
160+
| `vi` | Vietnamese |
161161

162162
## EasyOCR
163163

@@ -172,19 +172,20 @@ The language resolution that takes place inside EasyOCR enables those models tha
172172
The following table shows which recognition model is enabled per language combination
173173
(the detection checkpoint `craft_mlt_25k.pth` is required in all cases):
174174

175-
| Recognition checkpoint | Supported languages |
176-
| ---------------------- | ------------------------------------------------------------ |
177-
| `english_g2.pth` | en |
178-
| `latin_g2.pth` | af, az, bs, cs, cy, da, de, en, es, et, fr, ga, hr, hu, id, |
179-
| | is, it, ku, la, lt, lv, mi, ms, mt, nl, no, oc, pi, pl, pt, |
180-
| | ro, rs_latin, sk, sl, sq, sv, sw, tl, tr, uz, vi |
181-
| `zh_sim_g2.pth` | ch_sim + en |
182-
| `japanese_g2.pth` | ja + en |
183-
| `korean_g2.pth` | ko + en |
184-
| `telugu.pth` | te + en |
185-
| `kannada.pth` | kn + en |
186-
| `cyrillic_g2.pth` | ru, rs_cyrillic, be, bg, uk, mn, abq, ady, kbd, ava, dar, |
187-
| | inh, che, lbe, lez, tab, tjk, en |
175+
| Recognition checkpoint | Supported languages |
176+
| ---------------------- | ----------------------------------------------------------------------- |
177+
| `english_g2.pth` | `en` |
178+
| `latin_g2.pth` | `af`, `az`, `bs`, `cs`, `cy`, `da`, `de`, `en`, `es`, `et`, `fr`, `ga`, |
179+
| | `hr`, `hu`, `id`, `is`, `it`, `ku`, `la`, `lt`, `lv`, `mi`, `ms`, `mt`, |
180+
| | `nl`, `no`, `oc`, `pi`, `pl`, `pt`, `ro`, `rs_latin`, `sk`, `sl`, `sq`, |
181+
| | `sv`, `sw`, `tl`, `tr`, `uz`, `vi` |
182+
| `zh_sim_g2.pth` | `ch_sim` + `en` |
183+
| `japanese_g2.pth` | `ja` + `en` |
184+
| `korean_g2.pth` | `ko` + `en` |
185+
| `telugu.pth` | `te` + `en` |
186+
| `kannada.pth` | `kn` + `en` |
187+
| `cyrillic_g2.pth` | `ru`, `rs_cyrillic`, `be`, `bg`, `uk`, `mn`, `abq`, `ady`, `kbd`, |
188+
| | `ava`, `dar`, `inh`, `che`, `lbe`, `lez`, `tab`, `tjk`, `en` |
188189

189190
<u>Notice</u>: keep the requested language list as short and specific as possible. Because the resolution
190191
picks a model that covers *all* requested languages, adding a language you do not need downgrades the
@@ -207,8 +208,8 @@ The following table shows the supported Python versions and languages
207208

208209
| Nemotron version | Python version | Supported language inputs |
209210
| ---------------- | ---------------- | ------------------------------------------------------ |
210-
| v2.0.0 | 3.12 only | "english" (alias "en"), "multilingual" (alias "multi") |
211-
| v2.0.2 | 3.11, 3.12, 3.13 | "english" (alias "en"), "multilingual" (alias "multi") |
211+
| v2.0.0 | 3.12 only | `english` (alias `en`), `multilingual` (alias `multi`) |
212+
| v2.0.2 | 3.11, 3.12, 3.13 | `english` (alias `en`), `multilingual` (alias `multi`) |
212213

213214

214215
The "multi/multilingual" languages cover: English, Chinese (Simplified and Traditional), Japanese, Korean, and Russian

0 commit comments

Comments
 (0)