PlayPendium
WordChess · Nahrung für den Geist

Eine Maschine 149.000 Wörter in 22 Sprachen lehren

Ein Wortspiel braucht mehr als eine Liste gültiger Zeichenketten. Es muss sagen, was jede einzelne bedeutet, und Bedeutung ist das Schwerste, was man speichern kann.

01 · Das Lemma und seine Schatten

Ein Wort und all die Formen, die es annimmt

WordChess wird auf einem 25×25-Brett mit einem 148,941- Englischen Wörterbuch6gespielt, dessen Einträge im Durchschnitt 8,6 Buchstaben lang sind, manche bis zu 25. Das ist der einfache Teil. Eine Liste gültiger Wörter ist nur eine Menge von Zeichenketten, die das Spiel akzeptiert. Der interessante Teil besteht darin, einem Spieler zu sagen, was die Zeichenkette auf dem Brett bedeutet, und dies gleichzeitig in zweiundzwanzig Sprachen zu tun.

Lexikografen ziehen eine scharfe Linie zwischen einem Lemma und seine gebeugten Formen. Das Lemma ist das Stichwort, nach dem man sucht, laufen, Haus, sein. Um es kreist ein Paradigma von Oberflächenformen: läuft, lief, laufend. Jede trägt dieselbe Kernbedeutung, gekleidet für eine andere grammatische Rolle.3 Ein Wörterbuch widmet seine Prosa dem Lemma und überlässt den Schatten das Heimwehen.

Wie viele Schatten ein Wort wirft, hängt von der Sprache ab. Englisch ist analytisch: Es stützt sich auf die Wortstellung und kleine Hilfsörter, sodass ein Verb selten mehr als eine Handvoll Formen hat. Finnisch ist agglutinativ, es baut Bedeutung auf, indem es Suffixe an einen Stamm klebt. Ein einzelnes finnisches Substantiv verändert sich in etwa fünfzehn Fällen, im Singular und Plural, bevor Possessivendungen und Klitika sich darüber stapeln; die praktische Anzahl der unterschiedlichen Formen erreicht die Tausende.4 Ungarisch packt einen ganzen englischen Satz, in my housein ein einziges Wort, házamban.5

02 · Ein Wörterbuch, das von allen geschrieben wird

Wo die Definitionen zu finden sind

Die Definitionen stammen von Wiktionary, dem freien Wörterbuch, das jeder bearbeiten kann. Es ist enorm und mehrsprachig: Das Projekt umfasst weit über hundert aktive Sprachausgaben und Zehnmillionen von Einträgen, die von Freiwilligen gemeinsam verfasst werden, nicht von einem bezahlten Redaktionsteam.1 Für ein Spiel, das in 22 Sprachen läuft, kommt kein anderes freies Lexikon in puncto Abdeckung in die Nähe.

Aber Abdeckung auf dem Papier ist nicht die Abdeckung, die man vorlesen kann. Wiktionary speichert flektierte Formen auf eine Weise, die menschliche Redakteure davor bewahrt, dieselbe Erklärung zehntausendmal zu schreiben. Anstatt eine Definition auszuformulieren, trägt ein Nicht-Lemma-Eintrag eine Form-of-Vorlage, einen kleinen Verweis, der im Wesentlichen besagt: „Dies ist eine bestimmte grammatische Form dieses Lemmas.“2 Der Eintrag für smoulders ist keine Prosa; es ist eine Vorlage, die als „dritte Person Singular Präsens von smoulder“ gerendert wird.1

Diese Verweise sind kein Rundungsfehler. Auf dem englischen Wiktionary sind von rund 1,27 Millionen Definitionen etwa 478.000, also deutlich mehr als ein Drittel, „Form von“-Definitionen statt ausformulierter Bedeutungen.1 Die Daten sind vorhanden. Sie sind nur zusammengeklappt.

03 · Ein Parsing-Problem, kein Datenmangel

Die Glossierung entpackt die Vorlage

Die eigentliche Herausforderung war also nie „das Wort fehlt“. Es war, dass die Bedeutung des Wortes in einer Vorlage steckte, die ein naiver Parser einfach wegwerfen würde. Die Definitionen von WordChess wurden erstellt, indem die rohen Wiktionary-Dumps gelesen und die Flexionsvorlagen Sprache für Sprache ausgewertet wurden, wobei der Parser beigebracht wurde, was jeder Verweis bedeutet, und dieser in eine schlichte Glossierung umgeschrieben wurde.6

Jede Sprache versteckt ihre Formen hinter unterschiedlichen Mechanismen. Spanisch versteckt Verbformen hinter {{forma verbo}}, aufgelöst zu „verbale Form von X“. Deutsch verwendet {{Grundformverweis Dekl/Konj}} für deklinierte und konjugierte Formen. Finnisch stützt sich auf {{taivutusmuoto}}. Russisch speichert oft gar keine Formvorlage, das flektierte Wort ist ein nackter Umleitung (собаки → собака), der folgen muss, um eine „Form von“-Glossar zu erlangen.6 Behandeln Sie jede Konvention, und die Abdeckung steigt sprunghaft.

Definitionsabdeckung, vor → nach der Vorlagenerweiterung
SpracheVorherNachherGewinn
Deutsch45%92%+47
Niederländisch58%90%+32
Finnisch54%74%+20
Russisch20%70%+50
Griechisch15%57%+42

Gemessen aus den Design- und Bauhinweisen dieses Projekts. Die Prozentsätze geben den Anteil der Wörterbucheinträge an, die eine verwertbare Definition oder eine aufgelöste „Form von“-Glossar tragen.

Die Daten waren nie fehlend. Sie waren in einen Zeiger gefaltet, und dem Maschinen das Wort zu geben, bedeutete, zu lernen, es aufzufalten.

04 · Was „ein Wort kennen“ für eine Maschine bedeutet

Eine Zeichenkette und ein Satz darüber

Es lohnt sich, ehrlich darüber zu sein, was das Spiel jetzt enthält. Wenn WordChess zeigt, dass собаки eine Form von собака, „Hund“, ist, hat es nichts verstanden. Es hat eine Zeichenkette auf eine andere Zeichenkette, eine Glosse, abgebildet, indem es die gleichen Verweise befolgt hat, die ein menschlicher Redakteur hinterlassen hat. Dies ist Lemmatisierung, das Arbeitstier der natürlichen Sprachverarbeitung: die Reduktion einer Oberflächenform auf ihre Basisform, damit eine Maschine weniger verschiedene Dinge verfolgen muss.7

Das ist eine echte und nützliche Art des Wissens. Es ermöglicht dem Spiel, in Athen oder Amsterdam auf die Frage „Was ist dieses Wort?“ zu antworten, ohne einen Lexikografen im Team zu haben. Aber es ist Wissen als Nachschlagen, nicht Wissen als Bedeutung. Die Glosse ist ein Versprechen, dass eine Person, die sie liest, das Wort erkennen wird. Die Maschine hält das Versprechen; der Leser liefert den Sinn.

Wo die Wand ist

Manche Sprachen stoßen an eine Grenze, die kein Parser heben kann, weil die Daten einfach nicht vorhanden sind, um sich zu entfalten. Ungarische Einträge enthalten häufig nur eine Etymologie und eine Tabelle von Übersetzungen, gar keinen Definitionstext, sodass selbst ein perfekter Leser leer ausgeht. Die schwierigsten Fälle häufen sich dort, wo die Linguistik am schwierigsten ist: agglutinierende Sprachen wie Finnisch und Ungarisch, die enorme Paradigmen erzeugen, sowie die kyrillische und griechische Schrift, bei denen die Community-Abdeckung ohnehin dünner ist. Griechisch stieg von 15 % auf 57 %; dass es weit unter den 92 % des Deutschen bleibt, ist eine Tatsache über die Quelle, nicht über den Code. 6

Quellen & Anmerkungen
  1. Wikipedia, „Wiktionary“, Umfang, mehrsprachige Struktur, kollaborative Bearbeitung und die Anzahl der Definitionen der Form „Form von“ (einschließlich des smoulders -Beispiels). en.wikipedia.org/wiki/Wiktionary
  2. Wiktionary, „Wiktionary:Form-of templates“, wie Nicht-Lemma-Einträge auf der Definitionszeile auf ein Lemma zurückweisen. en.wiktionary.org/wiki/Wiktionary:Form-of_templates
  3. Wikipedia, „Lemma (Morphologie)“, Lemma als Zitationsform; das Paradigma der flektierten Formen. en.wikipedia.org/wiki/Lemma_(morphology)
  4. Wikipedia, „Finnische Kasus“, die etwa fünfzehn Fälle, im Singular und Plural, bevor Possessivsuffixe und Klitika darüber gestapelt werden. en.wikipedia.org/wiki/Finnish_noun_cases. Breiterer Kontext: en.wikipedia.org/wiki/Finnish_grammar
  5. „Morphology of Different Languages“, Psychology of Language (BCcampus Open Textbook), analytische vs. agglutinative Typologie; das házamban Beispiel. opentextbc.ca/psyclanguage/chapter/morphology-of-different-languages/
  6. WordChess-Definitionspipeline, Template-Erweiterungsregeln pro Sprache (Spanisch {{forma verbo}}, Deutsch {{Grundformverweis}}, Finnisch {{taivutusmuoto}}, russische Weiterleitungen) und Abdeckungszahlen. Gemessen anhand der Entwurfs- und Bauhinweise dieses Projekts.
  7. Wikipedia, „Lemmatization“, Reduzierung flektierter Formen auf eine Grundform in der NLP. en.wikipedia.org/wiki/Lemmatization
  8. Weitere Lektüre zu Wiktionary, [1011.1368] Transformation der Wiktionary-Eintragsstruktur in Tabellen und Relationen in einem relationalen Datenbankschema. arxiv.org.
  9. Weitere Lektüre zu Wiktionary, CEFR-Wortschatzniveau als Prädiktor für das Interesse der Nutzer an englischen Wiktionary-Einträgen. doi.org.
  10. Weitere Lektüre zu Lemmatization, BioLemmatizer: a lemmatization tool for morphological processing of biomedical text - PMC. ncbi.nlm.nih.gov.
Was this worth reading?
← Back to WordChess
PlayPendium · About · Contact · Privacy · Terms · Cookies · Accessibility · Copyright · Browse all games · Inspirations · © 2026