Viele Unternehmen investieren weiter massiv in KI, ohne zu wissen, welche Daten sie generieren und ob diese ausreichend geschützt sind. Wer langfristig profitieren will, muss seine Systeme jetzt den neuen Anforderungen anpassen.
Für KI-Agenten müssen Unternehmen neue Datenklassen und Abhängigkeiten berücksichtigen. Trainingsdaten, Modellartefakte und Embeddings sollten dabei gemeinsam geschützt werden.
Bisher kann nur rund ein Drittel der Unternehmen einen positiven Return on Investment (ROI) aus den getätigten KI-Investitionen ziehen. Trotzdem hält der Optimismus an. Laut Gartner werden sich die Ausgaben bis Ende 2026 auf mehr als 2,5 Billionen Dollar summieren.
Und sie könnten in den kommenden Jahren weiter steigen, denn KI-Projekte bleiben weiterhin eine Priorität. Der Großteil der Unternehmen plant sogar, die finanziellen Mittel weiter anzuheben, wie aus unserer aktuellen globalen Studie hervorgeht.
Damit KI-Investitionen nicht ins Leere laufen und ein positiver ROI zum Standard wird, gilt es jetzt einige grundlegende Herausforderungen zu meistern. Die Ursachen sind vielfältig und reichen von einer mangelhaften Begleitung der Mitarbeitenden bis hin zu fehlenden Anwendungsfällen. Einer der Wichtigsten liegt aber in veralteten Speicherarchitekturen: Diese wurden nämlich für eine Welt entwickelt, in der kritische Daten begrenzt und überschaubar waren. KI hat diese Spielregeln allerdings grundlegend verändert.
Entstehung einer neuen Schatten-KI
Bisherige Backup-Systeme wurden für klassische Dateien, Datenbanken und Anwendungen entworfen. Während die Datenmengen mit Beginn des digitalen Zeitalters stetig wuchsen, haben Cloud-Storage geholfen, das Problem teurer Hardware und langer Lieferzeiten zu lösen. Wie sich jetzt herausstellt, sind sie den Anforderungen moderner KI-Umgebungen allerdings oft nicht gewachsen.
Der Grund: Es handelt sich um völlig neue Datenklassen, die in komplexen Beziehungen zueinanderstehen und sich meist noch außerhalb des Schutzbereichs klassischer Backup-Programme befinden.
Trainingsdatensätze sind von grundlegender Bedeutung. Gehen sie verloren, verliert das Modell seine Funktionsgrundlage. Modellartefakte sind die trainierten Ergebnisse selbst, die oft monatelange Iterationen widerspiegeln. Embeddings kodieren semantische Beziehungen, die durch eine Datenbankwiederherstellung nicht rekonstruiert werden können.
Inferenzprotokolle erfassen, wie sich das System im Laufe der Zeit verhalten hat, was sowohl für den Betrieb als auch für die Compliance von Bedeutung ist. Und auch Prompt-Vorlagen werden selten als wiederherstellbare Ressourcen anerkannt. All das wird zunehmend geschäftskritisch, wächst aber noch häufig außerhalb etablierter Governance- und Recovery-Konzepte heran und eine sogenannte Schatten-KI entsteht.
Die Wiederherstellungsmethoden, die in klassischen IT-Umgebungen funktionieren, reichen bei KI-Systemen deshalb nicht mehr aus. Herkömmlicherweise wird darunter die Rückkehr zu einem bekannten Zustand verstanden. In KI-Umgebungen sind die Asset-Typen allerdings vielfältig, die Daten ändern sich ständig und ihre Abhängigkeiten werden von Standardverfahren nicht erfasst.
Das bedeutet, ein Unternehmen kann über ein täglich zuverlässig laufendes Backup verfügen und trotzdem nicht in der Lage sein, eine Modellversion wiederherzustellen, die tatsächlich brauchbare Ergebnisse liefert.
Die einzelnen Komponenten funktionieren nur im Zusammenspiel. So kann beispielsweise ein Modell ohne passende Embeddings nach einer Wiederherstellung keinen konsistenten Zustand ergeben. Dasselbe gilt auch für Embeddings ohne aktuelle Trainingsdaten.
Besonders problematisch ist, dass Fehler nicht sofort auffallen. Ein KI-Modell kann auf den ersten Blick laufen, aber die Inkonsistenzen zeigen sich erst im späteren Verlauf, wenn sich die Ausgabequalität als mangelhaft erweist. Die größte Herausforderung moderner Backup-Systeme liegt deshalb darin, mit der hohen Komplexität neuer KI-Systeme mitzuhalten.
Viele wurden von hohen KI-Kosten überrascht
Viele Unternehmen haben die hohen Kosten, die mit dem Einsatz von KI verbunden sind, nicht kommen sehen. Ein großer Teil davon entfällt nicht auf die Anwendungen selbst, sondern auf immense Ausgaben für Cloud-Speicher. Der Grund liegt im Abrechnungsmodell: Cold- und Archivspeicher sind auf seltenen Zugriff ausgelegt und im Ruhezustand günstig. Backup- und Recovery-Prozesse erfordern allerdings das genaue Gegenteil – nämlich häufigen Zugriff in Echtzeit. Das macht sie so unerwartet teuer.
Stand: 08.12.2025
Es ist für uns eine Selbstverständlichkeit, dass wir verantwortungsvoll mit Ihren personenbezogenen Daten umgehen. Sofern wir personenbezogene Daten von Ihnen erheben, verarbeiten wir diese unter Beachtung der geltenden Datenschutzvorschriften. Detaillierte Informationen finden Sie in unserer Datenschutzerklärung.
Einwilligung in die Verwendung von Daten zu Werbezwecken
Ich bin damit einverstanden, dass die Vogel IT-Medien GmbH, Max-Josef-Metzger-Straße 21, 86157 Augsburg, einschließlich aller mit ihr im Sinne der §§ 15 ff. AktG verbundenen Unternehmen (im weiteren: Vogel Communications Group) meine E-Mail-Adresse für die Zusendung von Newslettern und Werbung nutzt. Auflistungen der jeweils zugehörigen Unternehmen können hier abgerufen werden.
Der Newsletterinhalt erstreckt sich dabei auf Produkte und Dienstleistungen aller zuvor genannten Unternehmen, darunter beispielsweise Fachzeitschriften und Fachbücher, Veranstaltungen und Messen sowie veranstaltungsbezogene Produkte und Dienstleistungen, Print- und Digital-Mediaangebote und Services wie weitere (redaktionelle) Newsletter, Gewinnspiele, Lead-Kampagnen, Marktforschung im Online- und Offline-Bereich, fachspezifische Webportale und E-Learning-Angebote. Wenn auch meine persönliche Telefonnummer erhoben wurde, darf diese für die Unterbreitung von Angeboten der vorgenannten Produkte und Dienstleistungen der vorgenannten Unternehmen und Marktforschung genutzt werden.
Meine Einwilligung umfasst zudem die Verarbeitung meiner E-Mail-Adresse und Telefonnummer für den Datenabgleich zu Marketingzwecken mit ausgewählten Werbepartnern wie z.B. LinkedIN, Google und Meta. Hierfür darf die Vogel Communications Group die genannten Daten gehasht an Werbepartner übermitteln, die diese Daten dann nutzen, um feststellen zu können, ob ich ebenfalls Mitglied auf den besagten Werbepartnerportalen bin. Die Vogel Communications Group nutzt diese Funktion zu Zwecken des Retargeting (Upselling, Crossselling und Kundenbindung), der Generierung von sog. Lookalike Audiences zur Neukundengewinnung und als Ausschlussgrundlage für laufende Werbekampagnen. Weitere Informationen kann ich dem Abschnitt „Datenabgleich zu Marketingzwecken“ in der Datenschutzerklärung entnehmen.
Falls ich im Internet auf Portalen der Vogel Communications Group einschließlich deren mit ihr im Sinne der §§ 15 ff. AktG verbundenen Unternehmen geschützte Inhalte abrufe, muss ich mich mit weiteren Daten für den Zugang zu diesen Inhalten registrieren. Im Gegenzug für diesen gebührenlosen Zugang zu redaktionellen Inhalten dürfen meine Daten im Sinne dieser Einwilligung für die hier genannten Zwecke verwendet werden. Dies gilt nicht für den Datenabgleich zu Marketingzwecken.
Recht auf Widerruf
Mir ist bewusst, dass ich diese Einwilligung jederzeit für die Zukunft widerrufen kann. Durch meinen Widerruf wird die Rechtmäßigkeit der aufgrund meiner Einwilligung bis zum Widerruf erfolgten Verarbeitung nicht berührt. Um meinen Widerruf zu erklären, kann ich als eine Möglichkeit das unter https://contact.vogel.de abrufbare Kontaktformular nutzen. Sofern ich einzelne von mir abonnierte Newsletter nicht mehr erhalten möchte, kann ich darüber hinaus auch den am Ende eines Newsletters eingebundenen Abmeldelink anklicken. Weitere Informationen zu meinem Widerrufsrecht und dessen Ausübung sowie zu den Folgen meines Widerrufs finde ich in der Datenschutzerklärung.
Bei KI-Workloads ist dieses Problem besonders ausgeprägt. Trainingsdaten werden bei jedem neuen Trainingsvorgang abgerufen, Embeddings bei jeder Inferenz und Modellversionen bei Validierungen. Wenn jeder Zugriff Kosten verursacht, überlegen Unternehmen zweimal, wie oft es diese braucht. Recovery-Tests werden in der Folge verschoben und Validierungen übersprungen. So entstehen dieselben problematischen Verhaltensmuster, die bereits von klassischen Backup-Strategien bekannt sind – mit dem Unterschied, dass die Folgen von Fehlern und Datenverlusten bei KI-Systemen deutlich schwerwiegender sind.
KI-Agenten erhöhen das Sicherheitsrisiko
Der zunehmende Einsatz agentischer KI-Systeme lässt die Lücke zwischen den veralteten Systemen, die noch immer standardmäßig genutzt werden, und dem, was im KI-Zeitalter tatsächlich angemessen wäre, weiter auseinanderklaffen. Was ein kompromittiertes Nutzerkonto bedeuten kann, ist seit Langem bekannt und wird entsprechend von IT- und Sicherheitsteams adressiert.
Hier bleiben die Risiken allerdings auf die Berechtigungen einer einzelnen Person beschränkt. Ein KI-Agent hingegen kann autonom handeln, mehrere Systeme gleichzeitig steuern und komplexe Aufgaben ohne menschliche Kontrolle ausführen. Damit erhält ein Angreifer potenziell Zugriff auf weit mehr Ressourcen und Prozesse.
Hinzu kommt, dass sich KI-Agenten schwerer überwachen lassen als Menschen, wodurch Missbrauch später erkennbar wird. In vielen Unternehmen wurden die Anmeldedaten bei der Einrichtung von KI-Agenten sehr weit gefasst, da die schnelle Inbetriebnahme Vorrang vor einer sauberen Rechtevergabe hatte.
Ein kompromittiertes agentisches System unterliegt nicht den Einschränkungen, die ein Mensch auferlegen würde. Es unterliegt lediglich den Einschränkungen, auf die der Entwickler ihm Zugriff gewährt hat. Der Schaden breitet sich somit schneller und weiter aus und ist schwerer zu erkennen, da autonome Datenbewegungen wie normale Vorgänge wirken.
Viele Unternehmen stellen erst nach einem Sicherheitsvorfall fest, dass sich ihre KI-Systeme trotz erfolgreicher Backups nicht in einen definierten und vertrauenswürdigen Zustand zurückversetzen lassen. Daran muss sich dringend etwas ändern, wenn hohe KI-Investitionen nicht in einer existenziellen Krise münden sollen.
Da entsprechende Systeme bereits bei einem Großteil der Unternehmen im Einsatz sind, wird es höchste Zeit, vorhandene Trainingsdatensätze, Modellversionen, Embeddings, Inferenzprotokolle und Prompt-Vorlagen richtig abzusichern und dadurch zu gewährleisten, dass diese auch nach einem Vorfall noch zuverlässige Ergebnisse liefern.
Der erste Schritt besteht in einer ehrlichen Bestandsaufnahme – denn die meisten wissen nicht, welche KI-Daten sie überhaupt generieren und welche von Recovery-Programmen abgedeckt sind. Die bestehenden Lücken werden dabei in der Regel sofort offensichtlich. Gleichzeitig müssen Unternehmen die Kosten modellieren und prognostizieren, die mit dem Training der KI und der regelmäßigen Überprüfung der Wiederherstellungsprozesse verbunden sind.
Dadurch stellen sie sicher, dass sowohl die Betriebsausgaben als auch die Wiederherstellungsfähigkeiten auch bei einer Skalierung der KI-Implementierungen vorhersehbar bleiben.
Über den Autor: Marco Pfuhl ist Country Manager für Deutschland, Österreich und die Schweiz bei Wasabi Technologies und verantwortlich für Wachstum und Marktentwicklung im Bereich Cloud-Speicher in diesen Ländern. Zuvor war er in verschiedenen Vertriebs- und Führungspositionen bei anderen Unternehmen tätig.
Sein Fazit lautet: Agentenbasierte KI-Workloads erfordern umso größere Aufmerksamkeit. Sie brauchen echte Governance und nicht nur Überwachung. Zugangsdaten müssen nach dem Prinzip der geringsten Berechtigung vergeben werden.
Außerdem braucht es geprüfte autonome Zugriffsmuster und eine Wiederherstellungsumgebung, die logisch von der KI-Produktion getrennt ist.
So kann ein kompromittierter Workflow nicht auf das Backup zugreifen und verhindert, dass ein Sicherheitsvorfall in einer geschäftskritischen Krise endet.