Künstliche Intelligenz
Wie KI-Forschungsagenten die Literaturarbeit revolutionieren
Die Integration generativer Künstlicher Intelligenz (KI) in den Hochschulalltag hat innerhalb kurzer Zeit tradierte Arbeitsweisen verändert. Während die erste Phase der KI-Nutzung vor allem durch reaktive Chatbots geprägt war, die auf punktuelle Eingaben (Prompts) reagierten, vollzieht sich derzeit ein Übergang zu autonomen KI-Agentensystemen. Diese Systeme agieren als proaktive digitale Assistenten. Der Mensch formuliert ein komplexes Ziel wie zum Beispiel die Aufbereitung des aktuellen Forschungsstands zu einem spezifischen Thema und der KI-Agent plant und führt den gesamten Prozess durch.
Für die wissenschaftliche Praxis kann diese agentische Leistungsstärke eine bisher ungekannte signifikante Effizienzsteigerung für die Literaturarbeit bedeuten: Die manuelle Informationsbeschaffung und die erste Aggregation von Quellen lassen sich somit in einen automatisierten Workflow überführen. Dies kann Forschende und Studierende bei zeitaufwendigen Routineaufgaben entlasten und eine stärkere Fokussierung auf die inhaltliche Analyse und Synthese ermöglichen. Aber die technologische Beschleunigung verändert gleichzeitig die Anforderungen an die menschliche Rolle im Forschungsprozess: Der Schwerpunkt verlagert sich von der Informationsbeschaffung hin zur strategischen Steuerung und methodischen Qualitätssicherung.
Das Phänomen der formalen Validität
Ein zentrales Merkmal aktueller Forschungsagenten ist ihre Fähigkeit, Texte sprachlich präzise zu formulieren und formale Vorgaben wie wissenschaftliche Zitierstile (etwa APA 7 oder Harvard) oberflächlich exakt abzubilden.
Das resultierende Schriftbild und die Struktur des Literaturverzeichnisses suggerieren ein hohes Maß an handwerklicher Professionalität. Gleichzeitig birgt diese formale Perfektion das Risiko eines sogenannten Automatisierungs-Bias (Automation Bias): Anwenderinnen und Anwender neigen dazu, den Ergebnissen automatisierter Systeme unkritisch zu vertrauen und auf eine detaillierte Überprüfung zu verzichten.
Gerade in den bibliografischen Metadaten entstehen subtile Inkonsistenzen, die bei einer oberflächlichen Betrachtung nicht erkennbar sind, sondern erst durch einen systematischen Abgleich zwischen Text, Literaturverzeichnis und der tatsächlichen Primärquelle sichtbar werden. Um den aktuellen Leistungsstand und die Zuverlässigkeit der Systeme empirisch zu evaluieren, hat das Zukunftslabor Generative KI ein spezifisches Messverfahren durchgeführt, dessen zweistufiger Aufbau in der Abbildung dargestellt ist.
Zur Überprüfung der bibliografischen Zuverlässigkeit wurden im Juni 2026 sechs ausgewählte und im akademischen Kontext relevante KI-Systeme getestet, um die Literaturrecherche, Quellenauswahl, inhaltliche Einordnung, Texterstellung und bibliografische Nachweisführung in einem agentischen Workflow durchzuführen: Anthropics Claude (Opus 4.8), Edison Scientific, Genspark (Opus 4.7), Manus Lite 1.6, Perplexity Pro (Sonnet 4.6) und OpenAIs ChatGPT (GPT 5.5).
Jedes System durchlief das Szenario einmalig, die Ergebnisse stellen somit eine Momentaufnahme dar. Die Aufgabenstellung lautete, die fünf einflussreichsten Publikationen des Jahres 2026 zu KI-Forschungsagentensystemen über einen wissenschaftlich begründeten Score auszuwählen, sie um bis zu zehn weitere Quellen zu ergänzen und daraus einen wissenschaftlichen Beitrag mit Harvard-Zitation im Text und einem Literaturverzeichnis nach APA 7 zu erstellen. Strittige Metadaten wurden gegen die jeweiligen Primärquellen (DOI beziehungsweise arXiv) geprüft.
Empirische Befunde
Inhaltlich war die Quellenauswahl größtenteils relevant. Über alle sechs Systeme hinweg entstanden 97 Quellenangaben, darunter 20 Dopplungen. Die Systeme griffen also überwiegend auf unterschiedliche Arbeiten zurück, und nur einzelne besonders einflussreiche Publikationen wurden von mehreren zugleich genannt. Dass sich die Systeme trotz jeweils eigenständiger, selbst gewählter Auswahl- und Bewertungslogik überhaupt auf einen kleinen Kern besonders einflussreicher Arbeiten verständigen, war ein aufschlussreiches Testergebnis.
Weit deutlicher fielen die Unterschiede bei der formalen Zuverlässigkeit aus: Einige Systeme lieferten nahezu fehlerfreie, korrekt belegte Literaturverzeichnisse, andere wiesen erhebliche Mängel auf, von falsch zugeordneten bis hin zu frei erfundenen Quellen. Gerade diese Abweichungen sind für die wissenschaftliche Praxis entscheidend, weil sie einer oberflächlichen Prüfung entgehen und erst im Abgleich mit der Primärquelle auffallen.
Typologie der formalen Abweichungen
Die Fehlerbilder lassen sich in vier Kategorien gliedern:
- Strukturelle Formatierungs- und Anzeigefehler: Bei Edison erscheinen im Fließtext unaufgelöste interne Platzhalter-Kennungen (beispielsweise "pqac-00000002") statt lesbarer Autor-Jahr-Zitate. Das Literaturverzeichnis selbst bleibt APA-7-konform.
- Fehlattributionen bei der Urheberschaft: Manus Lite führt eine nicht existente Quelle ("Hosseini et al., 2026a"); die gemeinte Arbeit stammt von Alzahrani (arXiv:2605.26870). Drei weitere Arbeiten erhalten falsche Erstautoren ("Guevara" statt Qi, "Luo" statt Weidener, "Wang" statt Yu), auch Genspark "irrt" bei zwei zentralen Nature-Arbeiten ("Yamada" statt Lu, "Penadés" statt Gottweis). Solche formal korrekten Angaben fallen erst im Abgleich mit der Primärquelle auf.
- Nicht existente Quellen und Blindzitate: Perplexity stützt seine Top-5-Auswahl auf eine nicht existierende Quelle ("Müller et al.", Scientific Reports); die gemeinte Arbeit stammt von Hebenstreit et al. Hinzu kommen ein Blindzitat (im Text genannt, aber nicht im Verzeichnis) sowie Sekundärzitate aus grauer Literatur.
- Uneinheitliche und widersprüchliche Quellenangaben: Da Forschungsagenten das Web in Echtzeit durchsuchen, erscheinen Werke in unterschiedlichen Publikationsstadien; so führt Edison Tang et al. als arXiv-Preprint, Genspark als NeurIPS-2025-Beitrag, beides zutreffend. Eindeutige Fehler sind dagegen falsche Zeitschriftenzuordnungen, divergierende Heftnummern und verwaiste Verzeichniseinträge.
Diese Befunde unterstreichen den Wert einer abschließenden manuellen Prüfung.
Künstliche Intelligenz
Künstliche Intelligenz gehört mit allen Chancen und Risiken zu unserem Alltag – in und außerhalb von Hochschulen. Lesen Sie mehr zum Thema KI in unserem Schwerpunkt "Künstliche Intelligenz".
Kein Ersatz für kritische Kontrolle
Trotz der Notwendigkeit der Prüfung erweisen sich die Systeme als leistungsfähige Werkzeuge für eine hybride Arbeitsweise. KI-Forschungsagenten können in der wissenschaftlichen Praxis die Literaturarbeit beschleunigen und den Zeitaufwand für die initiale Informationsrecherche reduzieren. Den wissenschaftlichen Konsens eines Forschungsfelds bilden sie dabei nur eingeschränkt ab: Die Systeme stimmen vor allem bei einem kleinen Kern besonders einflussreicher Arbeiten überein, während ihre Auswahl im Übrigen stark auseinandergeht. Die KI optimiert den Rechercheprozess, entbindet den menschlichen Anwender jedoch nicht von der wissenschaftlichen Sorgfaltspflicht und kritischen Kontrolle.
Die Anforderungen an die wissenschaftliche Kompetenz verschieben sich im Sinne des Konzepts des New-Skilling: Die klassische Quellenkritik wird um die Dimension einer systematischen, digitalen Validierungskompetenz erweitert. Der Einsatz automatisierter Tools zur Konsistenzprüfung (sogenannte cite checking-Tools wie zum Beispiel CiteAudit) ist hilfreich, bietet aber keine hundertprozentige Sicherheit. Nur eine systematische Validierung der Ergebnisse mit Abgleich zu Literaturdatenbanken sichert die Qualitätsstandards der Forschung und ermöglicht eine produktive Synthese aus algorithmischer Geschwindigkeit und menschlicher Urteilskraft.
Anmerkung des Autorenteams
Dieser Beitrag wurde unter ko-kreativer Nutzung generativer KI-Systeme erstellt (Stand Juni 2026). Zum Einsatz kamen Claude (Anthropic), ChatGPT (OpenAI) sowie Gemini (Google) in ihren jeweils aktuellen Modellgenerationen, einschließlich aktivierter Funktionen wie Websuche, Recherche und erweitertes Schlussfolgern. Die inhaltliche Konzeption, Auswahl, Bewertung und redaktionelle Verantwortung liegen bei Doris Weßels, Miriam Maibaum und Martin Schanze.