„Niemand weiß, was noch selbst erdacht ist“ – Wie KI-generierte Fake-Forschung das Vertrauen in die Wissenschaft untergräbt
von Florian Sturm
Künstliche Intelligenz krempelt den Wissenschaftsbetrieb um. Nie war es einfacher, wissenschaftliche Studien zu verfassen. Nie war es schwerer, ihnen zu vertrauen. Das hat tiefgreifende Folgen.
Noch nie war Forschung so schnell und ergiebig – und gleichzeitig so anfällig für Täuschung. Einerseits revolutionieren Künstliche Intelligenz (KI), Maschinelles Lernen und Large Language Models (LLMs) die Forschung, andererseits gefährden sie die Wissenschaft in bisher unbekanntem Ausmaß.
Als der Chemie-Nobelpreis 2024 an die Entwickler des KI-Systems „AlphaFold“ zur Vorhersage von Proteinstrukturen verliehen wurde, war das ein Novum. Erstmals basierte ein wissenschaftlicher Durchbruch nicht auf klassischer menschlicher Forschung oder experimenteller Technik, sondern auf einem Deep-Learning-Modell, das selbstständig Muster erkennt und komplexe Lösungswege erschließt.
Das Potenzial dieser Technologien für die Forschung ist riesig und die Menschheit beginnt sie gerade erst zu entdecken. Gleichzeitig werden aber genau diese Tools die Wissenschaft in ihre bislang größte Krise überhaupt stürzen.
Wir sind längst drin in dieser doppelten Realität.
Altes Problem, neue Ausmaße
Wissenschaftliches Fehlverhalten ist so alt wie die Wissenschaft selbst. Abbildungen in Studien werden seit jeher manipuliert oder kopiert, Daten geschönt, unterschlagen oder schlichtweg erfunden, um ein gewünschtes Resultat berichten zu können. Doch KI-gestützte Werkzeuge geben dem Problem eine neue Dimension, wie etliche Studien belegen.
Zwar arbeitet die überwältigende Mehrheit der Forscherinnen und Forscher integer, gewissenhaft und mit hoher wissenschaftlicher Qualität. Aber eine kleine, gut organisierte Minderheit von Betrügern unterwandert das System seit Jahren. Und das zunehmend erfolgreich. Denn gefälschte Studien lassen sich heute schneller, billiger und müheloser produzieren als saubere, sorgfältig erarbeitete Forschung. Künstliche Intelligenz hat diesen Trend massiv beschleunigt.
„Wenn das Vertrauen in die wissenschaftliche Literatur zerfällt, verlieren wir eine der letzten verlässlichen Quellen von Wahrheit, die wir als Gesellschaft noch haben“, warnt Matt Spick, Forscher an der University of Surrey in Großbritannien, der den Einfluss von KI in der Gesundheitsforschung untersucht.
Fakten verschwinden im Wust von Fake-Wissenschaft
Eines der drängendsten Probleme sind sogenannte Paper Mills – kommerzielle Dienstleister, die gegen Bezahlung gefälschte wissenschaftliche Beiträge am Fließband produzieren. Geworben wird online, in Messenger-Gruppen oder durch persönliche Netzwerke. Die Kundschaft sind sowohl junge Forschende, die Publikationen für ihre Karriere benötigen, ebenso wie erfahrene Wissenschaftlerinnen und Wissenschaftler. Wer zahlt, kann das Thema des Papers, die Position in der Autorenliste, das Erscheinungsdatum sowie die wissenschaftliche Datenbank, in der die Zeitschrift indexiert werden soll, auswählen. Der Preis variiert und reicht von wenigen Hundert bis zu mehreren Tausend Euro je Beitrag.
Die gefälschten Manuskripte stammen aus zahlreichen Bereichen, von den Wirtschafts- und Rechtswissenschaften bis hin zu Medizin, Agrar- oder Ingenieursdisziplinen. Die Paper Mills manipulieren Bilder, erfinden Daten und Texte, fügen teils nichtsahnende Autorinnen und Autoren hinzu und reichen die gefälschten Arbeiten bei Fachzeitschriften ein.
„Es handelt sich dabei um eine ganze Industrie professioneller Fälscher. Diese Leute wissen genau, was sie tun, und ihre Fälschungen werden immer raffinierter“, sagt Spick. Durch Large Language Models (LLMs) wie ChatGPT, Gemini oder Claude ist es heute einfacher, schneller und billiger denn je, ganze Studien zu fabrizieren. Der wachsende Output wissenschaftlicher Arbeiten seit Einführung von KI-basierten LLMs lässt sich in Statistiken deutlich erkennen. Spick ist überzeugt, dass nahezu alle Paper Mills inzwischen auf KI-Tools setzen, um noch mehr Fake-Studien zu produzieren und einzureichen – mit dem Ziel, ihren Profit weiter zu steigern.
Besonders perfide: Für ihre fingierten Studien greifen sie immer häufiger auf reale, frei zugängliche Gesundheitsdaten zurück. Spick zeigt in einer Analyse, dass fünf große, öffentlich zugängliche Datenbanken besonders häufig gekapert werden: FAERS, NHANES, die UK Biobank, FINNGen und Global Burden of Disease.
Während 2021 etwa 4000 Artikel pro Jahr auf diesen Daten basierten, waren es 2024 über 11.500. Ein Großteil davon stammt aus China. Aufbau und Titel ähnelten sich oft stark. Diese Studien wirken durch die Verwendung realer Daten besonders glaubwürdig, obwohl die angeblichen Experimente oder Auswertungen nie stattgefunden haben.
Krebsforschung besonders betroffen
In der Krebsforschung ist die Lage besonders alarmierend. Im September deckte ein Team um die australische Forscherin Jennifer Byrne auf, dass fast zehn Prozent der von 1999 bis 2024 veröffentlichten Publikationen strukturelle Ähnlichkeit mit bekannten Paper-Mill-Produkten aufweisen. Bei einzelnen Fachzeitschriften liegt die Quote verdächtiger Beiträge bei über 30 Prozent.
„Das legt nahe, dass Veröffentlichungen zur Krebsforschung aus Paper Mills häufiger vorkommen könnten, als viele von uns annehmen. Krebsforscher müssen daher vorsichtig mit der Literatur umgehen und Behauptungen überprüfen, bevor sie versuchen, auf veröffentlichten Ergebnissen aufzubauen“, sagt Byrne.
Besonders betroffen sind Studien aus China, Iran, Pakistan, Ägypten und Malaysia. Paper Mills gibt es jedoch weltweit. „Es gibt Belege für Fälle aus der Ukraine, Russland, Lettland, Peru oder Indien“, sagt Anna Abalkina. Die Ökonomin und Osteuropaexpertin forscht seit vielen Jahren an der Freien Universität Berlin zu Paper Mills.
Die Problematik lässt sich inzwischen sogar an der Sprache ablesen. Dmitry Kobak, Datenexperte am Hertie Institute for Artificial Intelligence in Brain Health in Tübingen, untersuchte die Abstracts biomedizinischer Studien. Seit 2023, also kurz nach dem Start von ChatGPT, nehmen bestimmte Begriffe wie „delve“ oder „promising“ sprunghaft zu.
Profit dank Fake-Industrie?
„Das eigentliche Risiko ist nicht, dass Autoren KI verwenden“, sagt Kobak, „sondern dass niemand mehr weiß, was noch selbst erdacht ist.“ Wenn sich wissenschaftliche Texte zunehmend ähnelten, könne der wissenschaftliche Diskurs verflachen. Denn diese KI-generierten Studien landen wiederum in Trainingsdaten zukünftiger Modelle. Eine Abwärtsspirale, die eine LLM-generierte Weltsicht etablieren könnte, die nie hinterfragt worden ist – auf Kosten der wissenschaftlichen Vielfalt.
„Gerade die großen Verlage machen jährlich Millionengewinne“, sagt Spick und kritisiert: „Sie hätten sowohl die finanziellen als auch technischen Ressourcen, um viele dieser Fälschungen vor der Publikation zu erkennen und herauszufiltern.“
Genau das würde auch geschehen, haben zwei der größten Verlage – Elsevier und Springer Nature – auf Anfrage des Tagesspiegels geantwortet. Und KI spiele bei der Erkennung, insbesondere von Paper-Mill-Produkten, eine zentrale Rolle. Etwa bei Integritätsprüfungen von Manuskripten.
Mensch gegen Maschine
2024 seien bei Elsevier 3,5 Millionen Manuskripte eingereicht worden. Nur 720.000 wurden publiziert, heißt es vom Verlag. Außerdem wurden mehrere zwanzig Millionen US-Dollar in Erkennungssoftware investiert, sodass 7500 Manuskripte pro Stunde geprüft werden könnten. Eine Offenlegungspflicht für die KI-Nutzung durch Autoren sowie ein Verbot der Verwendung KI-generierter Bilder gibt es ebenfalls.
Springer Nature beschäftigt ein Team von über 50 Expertinnen und Experten, die sich mit Integritätsprüfungen beschäftigen und mittels Software versuchen, KI-generierte sinnfreie Texte, manipulierte Bilder, irrelevante Referenzen und ungewöhnliche Formulierungen zu erkennen.
Bernhard Sabel, emeritierter Professor an der Otto-von-Guericke-Universität Magdeburg und Autor des Buches „Fake-Mafia in der Wissenschaft“, beschäftigt sich seit Jahren mit der Fälschungswelle in der Wissenschaft. Seine Einschätzung zur Lage ist kritisch: „Verlage betonen öffentlich, wie sehr sie sich um wissenschaftliche Integrität bemühen. Doch sie befinden sich in einem Interessenkonflikt, schließlich profitieren sie indirekt von der Fake-Industrie.“
Gemeint sind vor allem die sogenannten Article Processing Charges (APCs), also Veröffentlichungsgebühren, die Verlage für das Publizieren von Studien erheben – unabhängig davon, ob ein Manuskript auf fragwürdigen Daten, manipulierten Bildern oder erfundenen Inhalten basiert.
Springer Nature widerspricht diesem Vorwurf: „Es kostet uns mehr, einen Verdachtsfall zu prüfen und eine Studie im Zweifel zurückzuziehen, als wir durch die Publikationsgebühr einnehmen“, so eine Verlagssprecherin.
KI gegen Fälschung mit KI
Das Geld, das der Verlag unter anderem durch die Einnahme von Veröffentlichungsgebühren mache, fließe laut eigenen Angaben in Systeme zur Sicherung wissenschaftlicher Integrität, in Expertenteams und Schulungen für Autorinnen und Autoren. Wie viel konkret in diese Maßnahmen investiert wird, ließ Springer Nature offen.
Auch Elsevier nutzt zahlreiche KI-Systeme, um Forschende und redaktionelle Prozesse zu unterstützen. Mit Scopus AI beispielsweise lassen sich gezielt Inhalte aus einer riesigen Datenbank analysieren. ScienceDirect AI ermöglicht eine KI-gestützte Recherche in Millionen Fachartikeln und Buchkapiteln.
„Wir haben außerdem KI-Tools eingeführt, die Redakteure im Alltag unterstützen. Unser System zur Gutachtersuche hilft dabei, passende Fachleute für eingereichte Artikel zu finden“, sagt Laura Hassink, Managing Director für STM-Wissenschaftsjournale bei Elsevier. „Dabei berücksichtigt ein Algorithmus potenzielle Interessenkonflikte der Autoren.“
Diese Gutachter spielen eine Schlüsselrolle im sogenannten Peer-Review-Verfahren – der wohl wichtigsten Qualitätskontrolle im Wissenschaftsbetrieb. Fachleute aus dem jeweiligen Forschungsgebiet prüfen dabei vor der Veröffentlichung eines Manuskripts dessen Methode, Ergebnisse und Schlussfolgerungen. Erst nach erfolgreicher Begutachtung wird ein Beitrag publiziert.
Zumindest in der Theorie. In der Praxis steht das Peer Review massiv unter Druck. Die Zahl der eingereichten Manuskripte steigt rasant, doch es fehlt an qualifizierten Fachleuten, die Zeit und Expertise für sorgfältige Gutachten aufbringen können.
Fälscher heute klar im Vorteil
Als Folge werden Gutachten immer häufiger mit KI erstellt, obwohl das offiziell bei allen großen Verlagen verboten ist. Gleichzeitig entstehen sogenannte Review Mills, die gegen Geld gefälschte, oberflächliche Gutachten liefern, die bei Verlagen allzu oft durchgewunken werden. Hinzu kommen Fälle, in denen Gutachter anbieten, pauschal ein positives Gutachten zu schreiben, wenn im Gegenzug ihre eigenen Studien zitiert werden. Eine Hand wäscht hier die andere.
Die Vertrauenskrise der Wissenschaft ist eng mit dieser Entwicklung verknüpft, reicht aber weit darüber hinaus. KI-Tools haben einen ungleichen Wettkampf geschaffen, in dem Fälscher heute klar im Vorteil sind. Wenn sich die Mechanismen der akademischen Welt nicht grundlegend ändern, droht die ehrliche Wissenschaft auf der Strecke zu bleiben.
„Verlage setzen in erster Linie statt auf Menschen offenbar lieber auf technische Lösungen zur Erkennung von Betrug, weil sie schneller und leichter skalierbar sind und den Publikationsprozess kostengünstig halten. Unsere Analysen zeigen jedoch, dass sich genau diese Technologien überraschend leicht austricksen lassen“, sagt Spick.
Fakten allein reichen längst nicht mehr aus, um Vertrauen in Wissenschaft zu sichern. Es braucht Transparenz über die Entstehung der Ergebnisse. Und mehr Menschen und Verlage, die bereit sind, genau hinzusehen.
Die Recherchen für diesen Artikel wurden vom Peter-Hans-Hofschneider-Recherchepreis für Wissenschafts- und Medizinjournalismus der Stiftung Experimentelle Biomedizin unterstützt.