KI und Mathematik: Was soll künftig als Forschungsleistung zählen?
Aktualisiert am 1. Oktober 2026
OpenAI · Offene Probleme als KI-Test
OpenAI beschreibt offene Forschungsprobleme als Teil der laufenden Modellevaluierung und präsentiert gelöste oder vorangebrachte Probleme zugleich als Beleg für mathematische Fähigkeiten.
Wir testen unsere Modelle schon während der Entwicklung an offenen Forschungsproblemen.
OpenAI · KI-Resultat vor vollem Verständnis
OpenAI veröffentlicht wesentlich vom Modell erzeugte mathematische Argumente als neue Resultate, nachdem Menschen sie zu Manuskripten ausgearbeitet und Lean-Zertifikate erstellt haben. Die anschließende fachliche Einordnung wird ausdrücklich der Community überlassen.
OpenAI · Menschenverständliche Ausarbeitung
Bei den zehn veröffentlichten Resultaten wurden die Modellargumente zu Manuskripten ausgearbeitet, formalisiert und mit Erläuterungen versehen. OpenAI beschreibt dies als eigenen Veröffentlichungsprozess, nicht als verbindlichen Standard für alle KI-generierten Resultate.
Google DeepMind · Offene Probleme als KI-Test
Aletheia wurde unter anderem in einer semi-autonomen Evaluation auf 700 offenen Erdős-Problemen eingesetzt; vier offene Fragen wurden dabei autonom gelöst.
Google DeepMind · KI-Resultat vor vollem Verständnis
DeepMind führt eine ohne menschliches Eingreifen erzeugte mathematische Arbeit als autonome Forschung und als „publishable quality“ in seiner Taxonomie KI-unterstützter Mathematik.
Reliable autonomous research.
Google DeepMind · Menschenverständliche Ausarbeitung
Die beschriebenen Workflows kombinieren automatisierte und menschliche Verifikation und sollen Forschenden mehr Raum für konzeptionelle Tiefe geben. Eine ausdrückliche Regel, dass jedes KI-Resultat vor regulärer Publikation menschenverständlich ausgearbeitet sein muss, wird nicht formuliert.
Anthropic · Offene Probleme als KI-Test
Ein Anthropic-Mitarbeiter ließ Claude ausdrücklich die Riemannsche Vermutung angehen; Anthropic wertet das daraus entstandene Resultat als Beispiel für den Fortschritt mathematischer Modellfähigkeiten. Eine generelle Forderung nach offenen Problemen als Benchmark wird nicht formuliert.
Anthropic · KI-Resultat vor vollem Verständnis
Anthropic bezeichnet Claudes neuen Befund als mathematisches Resultat, ließ ihn jedoch von eigenen Mathematikern untersuchen und validieren und von externen Experten prüfen. Damit stützt die Quelle Anerkennung, aber nicht Korrektheit allein als hinreichendes Kriterium.
Anthropic · Menschenverständliche Ausarbeitung
Anthropic erwartet zwar, dass formalisierte Beweise neben menschlichen Ausarbeitungen üblich werden, lehnt aber ausdrücklich ab, die formale Version als Ersatz für verständliche Exposition zu behandeln.
a formalized proof should not replace a human-understandable exposition
Unterzeichner der Fields-Erklärung · Offene Probleme als KI-Test
Die Erklärung bezeichnet den Vorstoß von KI-Unternehmen, mathematische Problemlösung als Benchmark zu verwenden, ausdrücklich als schädlich für Wissenschaft und mathematische Community.
the push by AI companies to solve mathematical problems as a benchmark is detrimental
Unterzeichner der Fields-Erklärung · KI-Resultat vor vollem Verständnis
Die Erklärung stellt konzeptionelles Verständnis und Einsicht als primäres Ziel heraus. Bloße Problemlösung ist für die Unterzeichner nur ein Werkzeug und Stellvertreter und kann ohne Einordnung und Weiterentwicklung den eigentlichen Forschungszweck verfehlen.
Unterzeichner der Fields-Erklärung · Menschenverständliche Ausarbeitung
Die Erklärung kritisiert übereilte Ankündigungen ohne angemessene Ausarbeitung, Herausarbeiten neuer Methoden und saubere Attribution und betont die menschliche Weitergabe und Integration von Ideen.
Unterzeichner der Fields-Erklärung · Verständnis stärker belohnen
Die Unterzeichner erklären konzeptionelles Verständnis und Einsicht zum primären Ziel und Problemlösung zum Proxy. Eine konkrete neue Gewichtung für Einstellung, Förderung oder Preise legen sie jedoch nicht fest.
Advisory Group on Mathematics and Artificial Intelligence · Offene Probleme als KI-Test
Das unabhängige Gremium erklärt, diese Praxis nicht zu unterstützen, und fordert Frontier-Labore auf, das Testen fortgeschrittener mathematischer Probleme auf nichtöffentlichen proprietären Modellen einzustellen.
we ask them to stop testing advanced mathematical problems on proprietary models
Advisory Group on Mathematics and Artificial Intelligence · KI-Resultat vor vollem Verständnis
AGMAI empfiehlt, signifikante Resultate möglichst rasch verantwortungsvoll zu veröffentlichen, auch wenn zunächst kein Mensch die Argumentation vollständig versteht. Die Labore sollen dann Verantwortung und Finanzierung dafür übernehmen, dass menschliches Verständnis nachfolgt.
Advisory Group on Mathematics and Artificial Intelligence · Menschenverständliche Ausarbeitung
AGMAI verlangt verständliche, konventionell geschriebene Fassungen, weitgehende Formalisierung und Unterstützung für Workshops, Exposition und andere Arbeiten, die menschliches Verständnis herstellen.
Advisory Group on Mathematics and Artificial Intelligence · Verständnis stärker belohnen
AGMAI fordert substanzielle Finanzierung für die Entwicklung menschlichen Verständnisses, überlässt deren Vergabe jedoch unabhängigen Institutionen. Eine generelle neue Hiring- oder Preislogik formuliert das Gremium nicht.
Leiden Declaration Working Group · Offene Probleme als KI-Test
Sie kritisiert, dass konkrete mathematische Aufgaben irreführend als Maß für allgemeine Reasoning-Fähigkeit kommerzieller Produkte eingesetzt werden und Forschung nach Automatisierbarkeit priorisiert werden könnte.
Leiden Declaration Working Group · KI-Resultat vor vollem Verständnis
Für veröffentlichte KI-unterstützte Forschung sollen menschliche Autoren Verantwortung für Korrektheit, Angemessenheit und Quellen tragen; Pressemitteilungen oder Blogs dürfen Peer Review und Community-Prüfung nicht ersetzen.
Leiden Declaration Working Group · Menschenverständliche Ausarbeitung
Die Erklärung nennt menschliche Beschreibungen zentraler Argumente, formale Verifikation, Cross-Checks und externe Vorprüfung als mögliche Standards für automatisiert erzeugte Resultate.
Mathematics produces not only a body of results, but also understanding
Leiden Declaration Working Group · Verständnis stärker belohnen
Die Erklärung warnt vor verzerrten Anreizen in Hiring, Finanzierung und Anerkennung und fordert, bei industriebezogener Förderung ihre Werte zu berücksichtigen. Eine konkrete Gewichtungsformel nennt sie nicht.
Timothy Nguyen · Offene Probleme als KI-Test
Er argumentiert, dass es selbst eine Entdeckung sei, wenn vormals besonders schwierige Probleme für Maschinen lösbar werden, und fordert Neugier statt Nostalgie. Eine explizite Position zu proprietären Benchmarks formuliert er nicht.
Timothy Nguyen · KI-Resultat vor vollem Verständnis
Nguyen sieht den Aufbau auf formal verifizierten maschinellen Beweisen als Erweiterung des mathematischen Werkzeugkastens und betont, dass Mathematik auch Wert darin haben kann, Wahrheiten vor vollständigem Verständnis zu entdecken.
Understanding is also, in some sense, a luxury.
Timothy Nguyen · Menschenverständliche Ausarbeitung
Er erklärt Verständnis zum Wert der Mathematik, argumentiert zugleich aber, dass formal verifizierte Maschinenbeweise genutzt werden können, bevor ein einzelner Mensch sie vollständig absorbiert hat.
Timothy Nguyen · Verständnis stärker belohnen
Nguyen sieht die traditionelle Vergabe von Preisen und Prestige für die erste Lösung schwieriger Probleme durch KI unter Druck. Welche institutionelle Anerkennung an ihre Stelle treten sollte, lässt er offen.
Timothy Gowers · Offene Probleme als KI-Test
Sein Schwerpunkt liegt auf den Folgen autonomer KI-Mathematik für Autorschaft, Kultur und Anerkennung. Ob Unternehmen offene Probleme gezielt als Modellbenchmark verwenden sollen, beantwortet er nicht eindeutig.
Timothy Gowers · KI-Resultat vor vollem Verständnis
Gowers beschreibt eine Zukunft automatisch formalisierter KI-Lösungen ohne menschlichen Urheber nicht als Grund, diese Resultate zurückzuweisen, und hält menschliche Zuschreibung in solchen Fällen nicht für zwingend.
Timothy Gowers · Menschenverständliche Ausarbeitung
Er hält schlecht geschriebene, schwer nachvollziehbare KI-Beweise für defizitär, zieht aber ausdrücklich in Betracht, dass künftige LLMs die nötige Erklärung selbst leisten können.
Timothy Gowers · Verständnis stärker belohnen
Gowers schlägt vor, in einer KI-geprägten Mathematik die Arbeit des Verstehens, Kuratierens und Erklärens deutlich stärker zu honorieren als das bloße Hervorbringen einer automatischen Erstlösung.
Person B to get the lion’s share of the credit.
Leslie Ann Goldberg · Offene Probleme als KI-Test
Goldberg wendet sich nicht gegen das Lösen bereits formulierter offener Probleme selbst, fordert aber ausdrücklich, diese Leistung als Ziel und Anerkennungsmaßstab zurückzustufen.
Leslie Ann Goldberg · KI-Resultat vor vollem Verständnis
Goldberg schlägt einen eigenen ArXiv-Bereich für KI-generierte Beweise mit Lean-Zertifikat vor und sagt zu noch unveröffentlichten Laborresultaten, Aussagen und Zertifikate sollten einfach öffentlich bereitgestellt werden.
Leslie Ann Goldberg · Menschenverständliche Ausarbeitung
Goldberg trennt maschinelle Korrektheitsprüfung von wissenschaftlicher Exposition. KI-Beweise sollen kommentiert und erklärt werden; reguläre Journals sieht sie künftig stärker als Orte hochwertiger Erklärung.
Leslie Ann Goldberg · Verständnis stärker belohnen
Goldberg fordert ausdrücklich Änderungen bei Postdoc- und Faculty-Auswahl sowie Tenure und schlägt vor, stärker die Qualität von Exposition und Verständnis zu bewerten.
focus evaluation on the quality of exposition/understanding
Mathathon-Koalition · Offene Probleme als KI-Test
Nach Kritik wurde Mathathon auf die Frage ausgerichtet, wie KI menschliches mathematisches Verständnis erweitern kann. Reine Problemlösung bleibt möglich, soll aber nicht das alleinige Leistungsmaß sein.
Mathathon-Koalition · KI-Resultat vor vollem Verständnis
Die Koalition bezeichnet Problemlösung ausdrücklich als nur einen Bestandteil der Mathematik und stellt Verständnis und Exposition daneben. Damit wird Korrektheit anerkannt, aber nicht als vollständiger Forschungsmaßstab.
Mathathon-Koalition · Menschenverständliche Ausarbeitung
Der neue Mathathon soll KI nicht nur zum Lösen, sondern zum Erarbeiten neuer Beweise, Erklärungen und menschlich nutzbaren Verständnisses einsetzen.
mathematical understanding and exposition are similarly meaningful
Mathathon-Koalition · Verständnis stärker belohnen
Die Koalition kritisiert, dass diese Leistungen von Förderern und Einstellungsgremien häufig übersehen werden, und will menschliche Mathematiker ausdrücklich für solche Arbeit anerkennen.
Quellen
- OpenAI — Zehn Fortschritte in Mathematik und theoretischer Informatik ·
- Google DeepMind — Accelerating Mathematical and Scientific Discovery with Gemini Deep Think ·
- Anthropic — Learning more about Claude's mathematical capabilities ·
- Anthropic — Formalizing Fermat's Last Theorem ·
- Math and AI — A Severe Misalignment of AI in Mathematics ·
- Advisory Group on Mathematics and Artificial Intelligence — Responsible Release of AI-Generated Mathematics ·
- Leiden Declaration on Artificial Intelligence and Mathematics — Leiden Declaration on Artificial Intelligence and Mathematics ·
- Timothy Nguyen — A Response to “A Severe Misalignment of AI in Mathematics” ·
- Gowers's Weblog — Thoughts about the Leiden Declaration ·
- University of Oxford — Mathematics and AI ·
- Proofs and Prompts — Joint Statement about Mathathon ·














