Praxis · Recherche & Informationskompetenz · Recht & Ethik

Wenn Bibliotheksbestände zu KI-Trainingsdaten werden

Oktober 1, 2026Von Andreas Langer

OpenAI finanziert die Digitalisierung historischer Bestände der Bodleian Libraries. Die Materialien sollen öffentlich zugänglich werden, fließen aber offenbar auch in das KI-Training ein. Das Projekt zeigt die Chancen automatisierter Erschließung und wirft zugleich Fragen nach Transparenz, Nutzungsrechten und dem wirtschaftlichen Wert bibliothekarischer Sammlungen auf.

Bibliotheks- und medienpädagogische Perspektive

Bibliotheken sind nicht nur Aufbewahrungsorte, sondern schaffen durch Auswahl, Erschließung und Kontextualisierung den Wert ihrer Sammlungen. Kooperationen mit KI-Unternehmen sollten deshalb den öffentlichen Nutzen, freie Zugänglichkeit, Nutzungsrechte, fachliche Kontrolle und mögliche Abhängigkeiten transparent regeln.

Die Universität Oxford arbeitet mit OpenAI an der Digitalisierung historischer Bestände der Bodleian Libraries. Was zunächst wie ein klassisches Digitalisierungsprojekt klingt, hat eine zusätzliche Ebene: Das aufbereitete Material soll offenbar auch in TrainingsdatenDaten, anhand derer ein KI-Modell Muster erlernt und seine Ausgaben verbessert. des KI-Unternehmens einfließen. Damit stellt sich eine Frage, die künftig viele Bibliotheken beschäftigen dürfte: Wer profitiert eigentlich davon, wenn öffentlich oder gemeinnützig verwahrtes Wissen für kommerzielle KI-Systeme erschlossen wird?

Ein Digitalisierungsprojekt mit mehreren Zielen

Das Forschungsprojekt der Bodleian Libraries läuft seit Februar 2025 und wird von OpenAI finanziert. Untersucht wird, wie sich große Bestände schneller digitalisieren, automatisch erschließen und für Forschung und Öffentlichkeit zugänglich machen lassen.

Nach Angaben der Bibliothek wurden bislang rund 125.000 Aufnahmen historischer Dissertationen erstellt. Hinzu kommen etwa 429.000 digitalisierte Karteikarten. Erprobt werden klassische optische Zeichenerkennung und neuere KI-gestützte Verfahren zur Erkennung gedruckter und handschriftlicher Texte.

Generative KIKI, die auf Grundlage gelernter Muster neue Inhalte wie Texte, Bilder, Audio oder Code erzeugt. soll außerdem dabei helfen, Informationen aus Dokumenten zu extrahieren, zu klassifizieren und möglicherweise erste Katalogdatensätze zu erzeugen. Die Bodleian Libraries betonen dabei ausdrücklich, dass Fachkräfte aus Erschließung und Katalogisierung als „Menschen in der Schleife“ eingebunden bleiben sollen. Die Ergebnisse der Technik werden demnach nicht einfach übernommen, sondern fachlich geprüft.

Für Bibliotheken ist das durchaus interessant. Gerade historische Sammlungen enthalten enorme Mengen bislang kaum digital erschlossener Informationen. Wenn KI verblasste Schrift erkennt, handschriftliche Karteikarten ausliest oder erste Metadaten vorschlägt, können Bestände sichtbar werden, die bisher nur vor Ort oder mit erheblichem Rechercheaufwand zugänglich waren.

Der weniger sichtbare Teil der Kooperation

Die offizielle Projektbeschreibung stellt vor allem die Digitalisierung, Erschließung und öffentliche Zugänglichkeit in den Mittelpunkt. Der „Guardian“ berichtet jedoch unter Berufung auf interne Unterlagen der Universität, dass das digitalisierte Material zugleich zum Trainingsbestand von OpenAI beitragen soll.

Das ist keine belanglose Ergänzung. Zwischen der Nutzung eines KI-Werkzeugs zur Texterkennung und der Bereitstellung von Bibliotheksbeständen für das Training kommerzieller Modelle besteht ein erheblicher Unterschied.

Nach Angaben der Universität handelt es sich ausschließlich um gemeinfreie Werke. Die Bodleian Libraries behalten die Rechte an den erzeugten Digitalisaten und wollen diese ebenfalls öffentlich verfügbar machen. OpenAI erhält also keinen exklusiven Zugriff auf die Inhalte. Die Bücher und Dokumente bleiben zudem erhalten – was bei der Digitalisierung historischer Bestände eigentlich selbstverständlich klingen sollte, im derzeitigen Wettlauf um möglichst seltenes Trainingsmaterial aber offenbar bereits eine erwähnenswerte Qualität ist.

Urheberrechtlich mag die Verwendung gemeinfreier Werke vergleichsweise unkompliziert erscheinen. Damit sind jedoch nicht alle Fragen beantwortet. Gemeinfrei bedeutet, dass ein Werk nicht mehr urheberrechtlich geschützt ist. Es bedeutet nicht automatisch, dass seine Digitalisierung, Erschließung und technische Aufbereitung kostenlos oder ohne institutionelle Entscheidungen entstehen.

Historisches Wissen wird wirtschaftlich wertvoll

Für KI-Unternehmen sind Bibliotheksbestände aus einem einfachen Grund interessant: Sie enthalten Texte, die im frei zugänglichen Internet bislang gar nicht oder nur schlecht erfasst sind.

Gleichzeitig werden öffentlich zugängliche Internetinhalte zunehmend von KI-generierten Texten durchsetzt. Trainingsdaten aus dem Netz können dadurch bereits Ergebnisse früherer KI-Systeme enthalten. Historische Bücher, Dissertationen, Karten und Handschriften bieten dagegen vergleichsweise unverbrauchtes und häufig sorgfältig erarbeitetes Material.

Bibliotheken besitzen damit etwas, das im KI-Zeitalter erheblich an Wert gewinnt: kuratierte, beschriebene und in ihrem Entstehungszusammenhang dokumentierte Wissensbestände. Ihre Qualität beruht nicht allein auf den enthaltenen Texten. Sie entsteht auch durch jahrzehntelange Sammlung, Bewahrung, Erschließung und fachliche Pflege.

Wenn ein Unternehmen die Digitalisierung solcher Bestände finanziert, entsteht deshalb kein einseitiges Verhältnis. Die Bibliothek erhält Technik, Personalressourcen und öffentlich zugängliche Digitalisate. Das Unternehmen erhält im Gegenzug hochwertiges Material, das seine Produkte verbessern und damit einen erheblichen wirtschaftlichen Wert entwickeln kann.

Beides kann gleichzeitig zutreffen. Die Kooperation ist weder automatisch ein Ausverkauf des kulturellen Erbes noch reine Großzügigkeit eines Technologieunternehmens. Sie ist ein Tauschgeschäft – und genau als solches sollte sie transparent beschrieben und bewertet werden.

Welche Bedingungen sollten Bibliotheken stellen?

Kooperationen zwischen Bibliotheken und KI-Unternehmen werden wahrscheinlich zunehmen. Viele Einrichtungen verfügen weder über die Technik noch über die finanziellen Mittel, um umfangreiche historische Bestände allein zu digitalisieren. Eine pauschale Ablehnung solcher Partnerschaften würde deshalb Chancen verschenken.

Entscheidend sind die Bedingungen. Vor einer Kooperation sollte geklärt werden:

Besonders problematisch wäre ein Modell, bei dem eine Bibliothek ihre Bestände bereitstellt, die daraus gewonnenen Daten aber anschließend nur innerhalb eines kostenpflichtigen KI-Systems nutzbar sind. Öffentlich bewahrtes Wissen würde dann zwar digitalisiert, praktisch aber in eine neue kommerzielle Infrastruktur überführt.

Bibliotheken sind mehr als Rohstofflieferanten

Das Oxford-Projekt zeigt, welches Potenzial KI für Digitalisierung und Erschließung besitzen kann. Automatisierte Verfahren können Fachkräfte entlasten und bislang schwer zugängliche Sammlungen für neue Zielgruppen öffnen. Gleichzeitig zeigt das Projekt, dass Bibliotheken ihre eigene Position gegenüber KI-Unternehmen deutlich bestimmen müssen.

Sie verwahren nicht einfach große Mengen alter Texte, die nun praktischerweise in ein Sprachmodell geschüttet werden können. Bibliotheken sichern Herkunft, Kontext und Zugänglichkeit von Wissen. Gerade diese Ordnungs- und Vertrauensstrukturen machen ihre Bestände für KI-Unternehmen wertvoll.

Deshalb sollten Bibliotheken bei solchen Kooperationen nicht nur fragen, was ihnen ein Unternehmen technisch ermöglicht. Ebenso wichtig ist die Gegenfrage: Was erhält das Unternehmen – und welcher öffentliche Nutzen steht diesem Wert gegenüber?

Die Digitalisierung kultureller Bestände kann Forschung, Bildung und gesellschaftliche Teilhabe stärken. Sie kann aber auch dazu beitragen, öffentlich gepflegtes Wissen in private Informationssysteme zu überführen. Ob daraus eine faire Partnerschaft wird, entscheidet sich nicht allein am Alter der Bücher, sondern an Transparenz, Zugänglichkeit und den vereinbarten Nutzungsrechten.

Quellen