PlayPendium
WordChess · Nahrung für den Geist

Eine Maschine 149.000 Wörter in 22 Sprachen beibringen

Ein Wortspiel braucht mehr als eine Liste gültiger Zeichenketten. Es muss sagen, was jede einzelne bedeutet, und Bedeutung ist das Schwerste, was man speichern kann.

Auf Englisch verfasst und redigiert. Diese deutsche Fassung wurde maschinell übersetzt; wo es auf Genauigkeit ankommt, ist das englische Original maßgeblich. Das englische Original lesen →

01 · Das Lemma und seine Schatten

Ein Wort und all die Formen, die es annimmt

WordChess spielt auf einem 25×25-Brett mit einem englischen Wörterbuch von 148.941 Wörtern 6, deren Einträge im Durchschnitt 8,6 Buchstaben lang sind; der längste umfasst 27. Das ist der einfache Teil. Eine Liste gültiger Wörter ist nur eine Menge von Zeichenketten, die das Spiel akzeptiert. Der interessante Teil besteht darin, einem Spieler zu sagen, was die Zeichenkette auf dem Brett bedeutet, und das gleichzeitig in zweiundzwanzig Sprachen.

Lexikografen ziehen eine scharfe Linie zwischen einem Lemma und seinen flektierten Formen. Das Lemma ist der Stichwortbegriff, den man nachschlägt: run, house, be. Um ihn kreist ein Paradigma von Oberflächenformen: runs, ran, running. Jede trägt dieselbe Kernbedeutung, gekleidet für eine andere grammatische Rolle. 3 Ein Wörterbuch widmet seine Prosa dem Lemma und überlässt den Schatten das Wegweisen nach Hause.

Wie viele Schatten ein Wort wirft, hängt von der Sprache ab. Englisch ist analytisch: Es stützt sich auf die Wortstellung und kleine Hilfsörter, daher hat ein Verb selten mehr als ein Handvoll Formen. Finnisch ist agglutinativ, es baut Bedeutung, indem es Suffixe an einen Stamm klebt. Ein einzelnes finnisches Substantiv wird für etwa fünfzehn Fälle flektiert, im Singular und Plural, bevor Possessivendungen und Klitika darauf gestapelt werden; die praktische Anzahl der unterschiedlichen Formen erreicht die Tausende. 4 Ungarisch packt eine ganze englische Phrase, in my house, in ein Wort: házamban. 5

02 · Ein Wörterbuch, das alle schreiben

Wo die Definitionen wohnen

Die Definitionen stammen aus Wiktionary, dem freien Wörterbuch, das jeder bearbeiten kann. Es ist enorm und mehrsprachig: Das Projekt umfasst weit über hundert aktive Sprachausgaben und mehrere zehn Millionen Einträge, die kollaborativ von Freiwilligen geschrieben werden, nicht von einem bezahlten Redaktionsboard. 1 Für ein Spiel, das in 22 Sprachen läuft, kommt kein anderes freies Lexikon in der Abdeckung in die Nähe.

Aber Abdeckung auf dem Papier ist nicht die Abdeckung, die man vorlesen kann. Wiktionary speichert flektierte Formen auf eine Weise, die menschliche Redakteure davor bewahrt, dieselbe Glosse zehntausendmal zu schreiben. Anstatt eine Definition auszuformulieren, trägt ein Nicht-Lemma-Eintrag eine „form-of“-Vorlage, einen kleinen Zeiger, der im Wesentlichen sagt: „Dies ist eine bestimmte grammatische Form dieses Lemmas.“ 2 Der Eintrag für smoulders ist keine Prosa; es ist eine Vorlage, die als „third-person singular simple present form of smoulder“ gerendert wird. 1

Diese Zeiger sind kein Rundungsfehler. Im englischen Wiktionary sind von etwa 1,27 Millionen Definitionen rund 478.000, gut ein Drittel, „form of“-Definitionen statt ausformulierter Bedeutungen. 1 Die Daten sind da. Sie sind nur zusammengeklappt.

03 · Ein Parsing-Problem, keine Datenlücke

Die Glosse entfaltet die Vorlage

Die Herausforderung, die zählte, war also nie „das Wort fehlt“. Es war, dass die Bedeutung des Wortes in einer Vorlage saß, die ein naiver Parser wegwerfen würde. Die Definitionen von WordChess wurden erstellt, indem die rohen Wiktionary-Dumps gelesen und die Flexionsvorlagen Sprache für Sprache expandiert wurden, indem dem Parser beigebracht wurde, was jeder Zeiger bedeutet, und er in eine einfache Glosse umgeschrieben wurde. 6

Jede Sprache versteckt ihre Formen hinter unterschiedlichen Mechanismen. Spanisch legt Verbformen hinter {{forma verbo}}, aufgelöst in „verbale Form von X“. Deutsch verwendet {{Grundformverweis Dekl/Konj}} für deklinierte und konjugierte Formen. Finnisch stützt sich auf {{taivutusmuoto}}. Russisch speichert oft gar keine Formvorlage, das flektierte Wort ist ein nackter Weiterleitung (собаки → собака), der man folgen muss, um eine „Form von“-Glosse wiederherzustellen. 6 Behandeln Sie jede Konvention, und die Abdeckung springt.

Definitionsabdeckung, vor → nach der Expansion der Vorlagen
SpracheVorherNachherZuwachs
Deutsch45%92%+47
Niederländisch58%90%+32
Finnisch54%74%+20
Russisch20%70%+50
Griechisch15%57%+42

Gemessen anhand der Design- und Build-Notizen dieses Projekts. Die Prozentsätze geben den Anteil der Wörterbucheinträge an, die eine verwertbare Definition oder eine aufgelöste „Form von“-Glosse tragen.

Die Daten waren nie fehlend. Sie waren in einen Zeiger gefaltet, und dem Maschinen das Wort zu geben, bedeutete, zu lernen, sie aufzufalten.

04 · Was „ein Wort kennen“ für eine Maschine bedeutet

Eine Zeichenkette und ein Satz darüber

Es lohnt sich, ehrlich darüber zu sein, was das Spiel jetzt enthält. Wenn WordChess zeigt, dass собаки eine Form von собака, „Hund“, ist, hat es nichts verstanden. Es hat eine Zeichenkette auf eine andere Zeichenkette, eine Glosse, abgebildet, indem es denselben Zeigern folgte, die ein menschlicher Redakteur hinterlassen hat. Dies ist Lemmatisierung, das Arbeitstier der natürlichen Sprachverarbeitung: die Reduktion einer Oberflächenform auf ihre Basisform, damit eine Maschine weniger verschiedene Dinge verfolgen muss. 7

Das ist eine echte und nützliche Art des Wissens. Es ermöglicht dem Spiel, in Athen oder Amsterdam auf „Was ist dieses Wort?“ zu antworten, ohne einen Lexikographen im Personal zu haben. Aber es ist Wissen-als-Nachschlagen, nicht Wissen-als-Bedeutung. Die Glosse ist ein Versprechen, dass eine Person, die sie liest, das Wort erkennen wird. Die Maschine hält das Versprechen; der Leser liefert den Sinn.

Wo die Mauer steht

Manche Sprachen stoßen an eine Grenze, die kein Parser heben kann, weil die Daten schlicht nicht da sind, um aufgefalten zu werden. Ungarische Einträge tragen häufig nur eine Etymologie und eine Tabelle von Übersetzungen, gar keinen Definitionstext, sodass selbst ein perfekter Leser leer ausgeht. Die schwierigsten Fälle häufen sich dort, wo die Linguistik am schwierigsten ist: agglutinierende Sprachen wie Finnisch und Ungarisch, die enorme Paradigmen erzeugen, und die kyrillische und griechische Schrift, bei denen die Community-Abdeckung ohnehin dünner ist. Griechisch stieg von 15 % auf 57 %; dass es weit unter den 92 % des Deutschen bleibt, ist eine Tatsache über die Quelle, nicht über den Code. 6

Sources & notes
  1. Wikipedia, "Wiktionary", scale, multilingual structure, collaborative editing, and the "form of" definition counts (including the smoulders example). en.wikipedia.org/wiki/Wiktionary
  2. Wiktionary, "Wiktionary:Form-of templates", how non-lemma entries point back to a lemma on the definition line. en.wiktionary.org/wiki/Wiktionary:Form-of_templates
  3. Wikipedia, "Lemma (morphology)", lemma as citation form; the paradigm of inflected forms. en.wikipedia.org/wiki/Lemma_(morphology)
  4. Wikipedia, "Finnish noun cases", the roughly fifteen cases, in singular and plural, before possessive suffixes and clitics stack on top. en.wikipedia.org/wiki/Finnish_noun_cases. Broader context: en.wikipedia.org/wiki/Finnish_grammar
  5. "Morphology of Different Languages," Psychology of Language (BCcampus Open Textbook), analytic vs. agglutinative typology; the házamban example. opentextbc.ca/psyclanguage/chapter/morphology-of-different-languages/
  6. WordChess definition pipeline, template-expansion rules per language (Spanish {{forma verbo}}, German {{Grundformverweis}}, Finnish {{taivutusmuoto}}, Russian redirects) and coverage figures. Measured from this project's design and build notes.
  7. Wikipedia, "Lemmatization", reducing inflected forms to a base form in NLP. en.wikipedia.org/wiki/Lemmatization
  8. Further reading on Wiktionary, [1011.1368] Transformation of Wiktionary entry structure into tables and relations in a relational database schema. arxiv.org.
  9. Further reading on Wiktionary, CEFR vocabulary level as a predictor of user interest in English Wiktionary entries. doi.org.
  10. Further reading on Lemmatization, BioLemmatizer: a lemmatization tool for morphological processing of biomedical text - PMC. ncbi.nlm.nih.gov.
Was this worth reading?
Play WordChess
PlayPendium · About · Contact · Privacy · Terms · Cookies · Accessibility · Copyright · Browse all games · Classic arcade games · © 2026