Ga naar hoofdinhoud

Ondersteunde talen

rosetta wordt geleverd met Language Cards — gestructureerde configuratiebestanden voor 50 talen. Elke kaart bevat register-presets, metadata voor het formaliteitssysteem, ondersteuningsvlaggen voor methoden, typografieregels en scriptinformatie. Elke taal die uw LLM kent, kan met een enkele configuratieregel worden toegevoegd — dit zijn de talen met gecureerde, productieklare registers.


Vertaalmethoden

Elke taal kan een of meer van deze vertaalmethoden gebruiken:

IcoonMethodeHoe het werktKosten
🟢Google TranslateNeurale MT-basislijn. 130+ talen. Alleen key-value strings — kan Markdown-content niet veilig vertalen.~$20/1M tekens
🔵LLM (OpenRouter)Elke taal die het model kent. Registergestuurde prompts. Verwerkt key-value + Markdown-content.Varieert per model
🟣LLM-CoachedLLM + grammaticewoordenboeken + coachingdata geïnjecteerd in prompts. Het beste voor morfologisch complexe talen.Varieert per model
🟠API (Plugin)Door de community gehoste vertaalpijplijnen die via HTTP worden aangeboden. OCAP-compatibel.Varieert per provider

Stel GOOGLE_TRANSLATE_API_KEY in voor Google Translate, of OPENROUTER_API_KEY voor LLM-methoden. Zie Vertaalmethoden voor volledige details.


Prioriteitstalen

Dit zijn de meest gevraagde locales voor web- en mobiele applicaties, vermeld in de door rosetta aanbevolen 'accessibility-first' volgorde.

VlagTaalCodeGoogleLLMCoachedScriptOpmerkingen
🇸🇦ArabischarRTL. Modern Standaard Arabisch (فصحى).
🇵🇭Filipijns (Taglish)tl / filGebruik fil in Docusaurus-configuraties. rosetta lost beide op.
🇫🇷FransfrVous-vorm. Genderinclusief (Connecté·e).
🇪🇸SpaansesNeutraal Latijns-Amerikaans.
🇩🇪DuitsdeSie-vorm. Genderinclusief (Benutzer:innen).
🇯🇵Japansjaです/ます voor platte tekst, する voor UI-labels.
🇨🇳Chinees (Vereenvoudigd)zh简体中文.
🇮🇹ItaliaansitLei-vorm.
🇧🇷Portugees (BR)ptBraziliaans-Portugees.
🇰🇷Koreaansko해요체 beleefdheidsregister.

Belangrijke wereldtalen

VlagTaalCodeGoogleLLMCoachedScriptOpmerkingen
🇧🇩Bengaalsbnশুদ্ধ ভাষা voorkeur.
🇧🇬Bulgaarsbg
🇨🇿TsjechischcsVykání (vy-vorm).
🇩🇰Deensda
🇬🇷GriekselModern Δημοτική.
🇮🇷PerzischfaRTL.
🇫🇮FinsfiGeen grammaticaal geslacht.
🇮🇱HebreeuwsheRTL.
🇮🇳Hindihiशुद्ध हिन्दी. Minimale Engelse leenwoorden.
🇭🇺HongaarshuÖn-vorm.
🇮🇩Indonesischid
🇲🇾Maleisms
🇳🇱NederlandsnlU-vorm.
🇳🇴NoorsnbBokmål.
🇵🇱PoolsplPan/Pani-vorm.
🇵🇹Portugees (EU)pt-PTEuropees-Portugees.
🇷🇴Roemeensro
🇷🇺RussischruВы-vorm.
🇸🇰SlowaaksskVykanie (vy-vorm).
🇷🇸Servischsr🔤 Latijns→CyrillischDeterministische scriptconverter.
🇸🇪Zweedssv
🇰🇪Swahilisw
🇹🇭Thaisthครับ/ค่ะ beleefdheidspartikels.
🇹🇷TurkstrSiz-vorm.
🇺🇦OekraïensukВи-vorm.
🇵🇰UrduurRTL. آپ-vorm.
🇻🇳Vietnameesvi
🇹🇼Chinees (Traditioneel)zh-TW繁體中文.
🇬🇪Georgischkaქართული. Kartveelse taalfamilie.
🇳🇬YorubayoÈdè Yorùbá. Tonaal (3 tonen).

Regionale varianten

VlagTaalCodeGoogleLLMCoachedScriptOpmerkingen
🇲🇽Mexicaans-Spaanses-MXTú-vorm. Warm register.
🇨🇦Canadees-Fransfr-CAQuébécois idiomen.

Inheemse en low-resource talen

Deze talen worden niet ondersteund door commerciële MT-diensten. rosetta biedt de tools voor taalgemeenschappen om hun eigen methoden te bouwen volgens de OCAP-principes.

TaalCodeGoogleLLMCoachedScriptStatus
🪶Plains Creecrk🔤 SRO→Syllabics🚧 In ontwikkeling
🌄QuechuaquRunasimi. Evidentiële achtervoegsels.

:::info Plains Cree is actief in ontwikkeling Het register, de coachinginfrastructuur, de scriptconverter en het evaluatieharnas voor Plains Cree zijn allemaal functioneel, maar de vertaalpijplijn is nog niet vrijgegeven. Wij werken samen met taalgemeenschappen volgens de OCAP-principes om de kwaliteit voor de release te waarborgen. Zie Een low-resource taal ondersteunen voor het volledige verhaal — en hoe u kunt bijdragen. :::

:::tip Meer low-resource talen toevoegen Het method-pluginsysteem van rosetta is hiervoor ontworpen. Een taalgemeenschap kan een aangepaste vertaalmethode bouwen, deze onder eigen beheer hosten en aanbieden via de API-methode. Het Methoden-leaderboard houdt scores bij voor elk talenpaar — bouw een methode, voer het harnas uit en claim de topscore. :::


Kunsttalen

Kunsttalen (conlangs) worden ondersteund via LLM-registers en optionele scriptconverters. Ze gebruiken dezelfde infrastructuur als echte talen — de kwaliteitscontrole, het coachingsysteem en de scriptconversiepijplijn werken identiek.

TaalCodeGoogleLLMScriptOpmerkingen
🖖Klingontlh🔤 Romanisatie→pIqaDPUA-lettertype vereist. Marc Okrand-vocabulaire.
🧝Sindarijns (Tolkien-Elfs)x-elvish-s🔤 Latijns→TengwarCSUR PUA-lettertype vereist.
🏴‍☠️Piraten-Engelsx-pirateAlleen register. Nautische metaforen.
🦸Kryptoniaansx-kryptonian🔤 Latijns→KryptoniaansPUA-lettertype vereist.
🎭Shakespeareaans Engelsx-shakespeareAlleen register. Thee/thou, -eth/-est-vormen.
🐸Yoda-spraakx-yodaAlleen register. OSV-woordvolgorde.

Zie Kunsttalen, scripts & orthografie voor PUA-lettertypevereisten, Unicode-beperkingen en hoe u uw eigen kunsttaal kunt toevoegen.


Taal-presets

De init-wizard ondersteunt preset-namen voor een snelle installatie. U kunt presets combineren met individuele codes.

PresetBreidt uit naar
europeanfr, de, es, it, pt, nl
asianja, zh, ko
globalfr, es, de, ja, zh, ko, pt, ar
nordicda, fi, nb, sv
# Mix presets with individual codes
i18n-rosetta init
# → Target languages: european, ja
# → Resolves to: fr, de, es, it, pt, nl, ja

Elke taal toevoegen

rosetta kan vertalen naar elke taal die uw LLM kent — de bovenstaande tabel toont alleen talen met ingebouwde register-presets. Om een niet-vermelde taal toe te voegen, neemt u de BCP-47-code op in uw configuratie:

{
"languages": {
"sw": {},
"am": {
"register": "Formal Amharic. Professional register with Geʽez script."
}
}
}

De LLM zal vertalen met behulp van zijn getrainde kennis van de taal. Het instellen van een register geeft u controle over de toon, formaliteit en orthografische conventies. Zie Configuratie voor details.


Language Cards

Elke ingebouwde taal heeft een Language Card — een gestructureerde JSON-configuratie die voor prestatiedoeleinden in twee lagen is opgesplitst:

Tweelaagse architectuur

LaagDirectoryGeladenDoel
Runtimelib/data/language-cards/Direct bij importVertaal-engine: registers, formaliteit, regels, methode-ondersteuning
Referentielib/data/language-reference/Lazy on-demandOntwikkelaarsdocumentatie: linguïstische uitdagingen, encyclopedische data, NLP-bronnen

De runtime-laag blijft klein (~2 KB/kaart) zodat het importeren van rosetta geen megabytes aan documentatiedata laadt. De referentielaag is beschikbaar via getLanguageReference(code) voor tools, de website en het evaluatieharnas.

Runtime Card-velden

VeldWat het bevat
nativeNameEndoniem — de naam van de taal voor zichzelf, in het eigen script (bijv. ქართული, Runasimi)
FormaliteitssysteemT-V-onderscheid, spraakniveaus, keigo, partikels, enz.
Register-presetsBenoemde LLM-prompt-presets specifiek voor het karakter van de taal
Methode-ondersteuningWelke vertaal-API's deze taal ondersteunen
GeslachtsrichtlijnenGrammaticale geslachtsregels en tips voor inclusief schrijven
Script/richtingISO 15924-scriptcode en RTL/LTR
RegelsTypografie (aanhalingstekens, spatiëring), hoofdlettergebruik, meervoudscategorieën
EvaluatiedatasetsWelke benchmarks deze taal dekken
glottocodeCanonieke Glottolog-identifier voor kruisverwijzingen
humanReviewedOf de kaart is beoordeeld door een spreker

Reference Card-velden

VeldWat het bevat
Linguïstische uitdagingenMT-specifieke valkuilen (bijv. evidentialiteit, tonale diakritische tekens, agglutinatie)
EncyclopedischTaalfamilie, classificatie, aantal sprekers, regio's
BronnenNLP-tools, parallelle corpora, vooraf getrainde modellen

Een nieuwe Language Card opzetten

Gebruik de generator om beide lagen op te zetten vanuit gezaghebbende databronnen (IANA, CLDR, Glottolog):

# Preview what would be generated
node scripts/generate-language-card.mjs sw --dry-run

# Generate both runtime + reference cards
node scripts/generate-language-card.mjs sw

De generator vult automatisch metadata in (codes, script, richting, meervouden, aanhalingstekens, methode-ondersteuning, taalfamilie) en markeert linguïstische beoordelingsvelden als TODO voor menselijke curatie.

Preset-sleutels gebruiken

In plaats van de volledige registertekst te schrijven, kunt u een preset-sleutelnaam gebruiken:

{
"languages": {
"fr": "casual-tu",
"ko": "formal-hapsyo",
"ja": "polite"
}
}

Rosetta herleidt de sleutel naar de volledige registerprompt. Voer npx i18n-rosetta init uit om de beschikbare presets voor elke taal te bekijken.

Voorbeeld-presets

TaalPresetsStandaard
Fransformal-vous, casual-tuformal-vous
Koreaanspolite-haeyo, formal-hapsyo, casual-haepolite-haeyo
Japanspolite, formal-keigo, casualpolite
Duitsformal-Sie, casual-duformal-Sie
Thaisneutral-professional, polite-male, polite-femaleneutral-professional
Spaansneutral-professional, formal-usted, casual-tuteoneutral-professional

Zie Bijdragen aan een Language Card voor de volledige specificatie, inclusief veldvalidatie en de PR-checklist.


Zie ook