Ein Wortspiel braucht mehr als eine Liste gültiger Zeichenketten. Es muss sagen, was jede einzelne bedeutet, und Bedeutung ist das Schwerste, was man speichern kann.
Auf Englisch verfasst und redigiert. Diese deutsche Fassung wurde maschinell übersetzt; wo es auf Genauigkeit ankommt, ist das englische Original maßgeblich. Das englische Original lesen →
WordChess spielt auf einem 25×25-Brett mit einem englischen Wörterbuch von 148.941 Wörtern 6, deren Einträge im Durchschnitt 8,6 Buchstaben lang sind; der längste umfasst 27. Das ist der einfache Teil. Eine Liste gültiger Wörter ist nur eine Menge von Zeichenketten, die das Spiel akzeptiert. Der interessante Teil besteht darin, einem Spieler zu sagen, was die Zeichenkette auf dem Brett bedeutet, und das gleichzeitig in zweiundzwanzig Sprachen.
Lexikografen ziehen eine scharfe Linie zwischen einem Lemma und seinen flektierten Formen. Das Lemma ist der Stichwortbegriff, den man nachschlägt: run, house, be. Um ihn kreist ein Paradigma von Oberflächenformen: runs, ran, running. Jede trägt dieselbe Kernbedeutung, gekleidet für eine andere grammatische Rolle. 3 Ein Wörterbuch widmet seine Prosa dem Lemma und überlässt den Schatten das Wegweisen nach Hause.
Wie viele Schatten ein Wort wirft, hängt von der Sprache ab. Englisch ist analytisch: Es stützt sich auf die Wortstellung und kleine Hilfsörter, daher hat ein Verb selten mehr als ein Handvoll Formen. Finnisch ist agglutinativ, es baut Bedeutung, indem es Suffixe an einen Stamm klebt. Ein einzelnes finnisches Substantiv wird für etwa fünfzehn Fälle flektiert, im Singular und Plural, bevor Possessivendungen und Klitika darauf gestapelt werden; die praktische Anzahl der unterschiedlichen Formen erreicht die Tausende. 4 Ungarisch packt eine ganze englische Phrase, in my house, in ein Wort: házamban. 5
Die Definitionen stammen aus Wiktionary, dem freien Wörterbuch, das jeder bearbeiten kann. Es ist enorm und mehrsprachig: Das Projekt umfasst weit über hundert aktive Sprachausgaben und mehrere zehn Millionen Einträge, die kollaborativ von Freiwilligen geschrieben werden, nicht von einem bezahlten Redaktionsboard. 1 Für ein Spiel, das in 22 Sprachen läuft, kommt kein anderes freies Lexikon in der Abdeckung in die Nähe.
Aber Abdeckung auf dem Papier ist nicht die Abdeckung, die man vorlesen kann. Wiktionary speichert flektierte Formen auf eine Weise, die menschliche Redakteure davor bewahrt, dieselbe Glosse zehntausendmal zu schreiben. Anstatt eine Definition auszuformulieren, trägt ein Nicht-Lemma-Eintrag eine „form-of“-Vorlage, einen kleinen Zeiger, der im Wesentlichen sagt: „Dies ist eine bestimmte grammatische Form dieses Lemmas.“ 2 Der Eintrag für smoulders ist keine Prosa; es ist eine Vorlage, die als „third-person singular simple present form of smoulder“ gerendert wird. 1
Diese Zeiger sind kein Rundungsfehler. Im englischen Wiktionary sind von etwa 1,27 Millionen Definitionen rund 478.000, gut ein Drittel, „form of“-Definitionen statt ausformulierter Bedeutungen. 1 Die Daten sind da. Sie sind nur zusammengeklappt.
Die Herausforderung, die zählte, war also nie „das Wort fehlt“. Es war, dass die Bedeutung des Wortes in einer Vorlage saß, die ein naiver Parser wegwerfen würde. Die Definitionen von WordChess wurden erstellt, indem die rohen Wiktionary-Dumps gelesen und die Flexionsvorlagen Sprache für Sprache expandiert wurden, indem dem Parser beigebracht wurde, was jeder Zeiger bedeutet, und er in eine einfache Glosse umgeschrieben wurde. 6
Jede Sprache versteckt ihre Formen hinter unterschiedlichen Mechanismen. Spanisch legt Verbformen hinter {{forma verbo}}, aufgelöst in „verbale Form von X“. Deutsch verwendet {{Grundformverweis Dekl/Konj}} für deklinierte und konjugierte Formen. Finnisch stützt sich auf {{taivutusmuoto}}. Russisch speichert oft gar keine Formvorlage, das flektierte Wort ist ein nackter Weiterleitung (собаки → собака), der man folgen muss, um eine „Form von“-Glosse wiederherzustellen. 6 Behandeln Sie jede Konvention, und die Abdeckung springt.
| Sprache | Vorher | Nachher | Zuwachs |
|---|---|---|---|
| Deutsch | 45% | 92% | +47 |
| Niederländisch | 58% | 90% | +32 |
| Finnisch | 54% | 74% | +20 |
| Russisch | 20% | 70% | +50 |
| Griechisch | 15% | 57% | +42 |
Gemessen anhand der Design- und Build-Notizen dieses Projekts. Die Prozentsätze geben den Anteil der Wörterbucheinträge an, die eine verwertbare Definition oder eine aufgelöste „Form von“-Glosse tragen.
Die Daten waren nie fehlend. Sie waren in einen Zeiger gefaltet, und dem Maschinen das Wort zu geben, bedeutete, zu lernen, sie aufzufalten.
Es lohnt sich, ehrlich darüber zu sein, was das Spiel jetzt enthält. Wenn WordChess zeigt, dass собаки eine Form von собака, „Hund“, ist, hat es nichts verstanden. Es hat eine Zeichenkette auf eine andere Zeichenkette, eine Glosse, abgebildet, indem es denselben Zeigern folgte, die ein menschlicher Redakteur hinterlassen hat. Dies ist Lemmatisierung, das Arbeitstier der natürlichen Sprachverarbeitung: die Reduktion einer Oberflächenform auf ihre Basisform, damit eine Maschine weniger verschiedene Dinge verfolgen muss. 7
Das ist eine echte und nützliche Art des Wissens. Es ermöglicht dem Spiel, in Athen oder Amsterdam auf „Was ist dieses Wort?“ zu antworten, ohne einen Lexikographen im Personal zu haben. Aber es ist Wissen-als-Nachschlagen, nicht Wissen-als-Bedeutung. Die Glosse ist ein Versprechen, dass eine Person, die sie liest, das Wort erkennen wird. Die Maschine hält das Versprechen; der Leser liefert den Sinn.
Manche Sprachen stoßen an eine Grenze, die kein Parser heben kann, weil die Daten schlicht nicht da sind, um aufgefalten zu werden. Ungarische Einträge tragen häufig nur eine Etymologie und eine Tabelle von Übersetzungen, gar keinen Definitionstext, sodass selbst ein perfekter Leser leer ausgeht. Die schwierigsten Fälle häufen sich dort, wo die Linguistik am schwierigsten ist: agglutinierende Sprachen wie Finnisch und Ungarisch, die enorme Paradigmen erzeugen, und die kyrillische und griechische Schrift, bei denen die Community-Abdeckung ohnehin dünner ist. Griechisch stieg von 15 % auf 57 %; dass es weit unter den 92 % des Deutschen bleibt, ist eine Tatsache über die Quelle, nicht über den Code. 6