← Zurück zur Übersicht

Docker sperrt KI-Agenten in die Box. Und was dürfen die drinnen?

Docker hat am Donnerstag die Cloud Sandboxes vorgestellt. Kurz gesagt kann man seinen Coding-Agenten jetzt in eine abgeschottete kleine VM in Dockers Cloud schicken, den Laptop zuklappen und der Agent arbeitet weiter. Dazu gibt es die sogenannten Kits, in denen der Agent, seine Werkzeuge und die Regeln, was er anfassen darf, als ein Paket stecken. Das Format soll laut Help Net Security an die CNCF gehen, damit es nicht nur Dockers eigenes Ding bleibt.

Find ich ehrlich gesagt erst mal gut. Und ich hab mich beim Lesen trotzdem gefragt, ob das bei den Leuten, die gerade Agenten einsetzen, das eigentliche Problem löst.

Was Docker da gebaut hat

Laut The Register laufen die Sandboxes als eigene Micro-VMs, starten in ein paar hundert Millisekunden und werden pro Sekunde abgerechnet. Die kleinste Größe mit einer CPU und 2 GB kostet 0,07 Dollar die Stunde, die größte mit 16 CPUs 1,12 Dollar. Im Artikel steht auch eine schöne Demo: Claude sollte in einem normalen Container nach lokalen Secrets suchen und über den Docker-Socket ausbrechen, hat geklappt. In der Sandbox kam er nicht hin.

Das ist schon mal was. Wer mal einen Agenten mit vollen Rechten auf dem eigenen Rechner hat laufen lassen, weiß, wie mulmig das sein kann. Und dass die Regeln im Paket mitreisen, egal ob der Agent lokal oder in der Cloud läuft, finde ich genau richtig. Einmal festlegen, überall gleich.

Die Box schützt die Maschine

Jetzt kommt das Aber. Eine Sandbox sorgt dafür, dass der Agent meinen Rechner oder den Server nicht kaputt macht. Aber die meisten Agenten, die in Firmen gerade wirklich was tun sollen, brauchen ja Zugänge nach draußen. Ein Token für die Buchhaltung, Zugriff aufs Postfach, einen Schlüssel für das CRM oder für die Datenbank. Und die Zugänge nimmt er mit in die Box, sonst kann er ja nichts machen.

Wenn der Agent dann mit einem gültigen Token Mist baut, hilft mir die schönste Micro-VM nichts. Die Rechnung ist dann halt raus, die Mail verschickt, der Datensatz überschrieben. Docker sagt das übrigens selbst ganz offen, Sandboxes seien nur ein Teil davon, einen Agenten einzugrenzen, und der Rest der Branche müsse bei Regeln und Absicht über alle Ebenen noch nachziehen. Find ich fair.

Wie wir das bei uns machen

Bei uns laufen inzwischen ein paar Routinen jeden Tag, ohne dass jemand danebensitzt. Eingehende Mails werden sortiert und landen als Aufgabe im passenden Projekt oder als Hinweis im Slack. Und offene Belege in der Buchhaltung ordnet mir auch ein Agent zu. Anfangs dachte ich, das Wichtigste ist, dass der Agent möglichst viel alleine kann. Hat sich dann recht schnell gedreht. Das Wichtige ist, an welcher Stelle er aufhören muss.

Unsere Regel ist inzwischen ziemlich simpel: Der Agent bereitet vor, ein Mensch drückt den Knopf. Er darf Entwürfe schreiben, Aufgaben anlegen, Belege zuordnen und Vorschläge machen. Er darf nichts verschicken, nichts veröffentlichen, nichts endgültig löschen und kein Geld bewegen. Im Prompt steht das natürlich auch, aber ein Prompt wird halt auch mal ignoriert. Also regeln wir das, wo es geht, in den Zugängen selbst. Ein Token, das nur lesen und Entwürfe anlegen kann, kann auch im schlimmsten Fall nichts rausschicken.

Das klingt langweilig und ist es auch. Aber es ist der Punkt, an dem man nachts ruhig schläft. Und ganz ehrlich, das Vorbereiten ist sowieso der größte Teil der Arbeit, der Klick am Ende ist das kleinste Problem.

Was ich vor dem ersten Agenten klären würde

Wer gerade überlegt, einen Agenten auf einen echten Ablauf loszulassen, dem würde ich drei Fragen mitgeben, bevor es um Tools oder Sandboxes geht:

  1. Welche Zugänge braucht er wirklich, und gibt es die auch nur lesend oder nur für Entwürfe?
  2. Was ist der Schritt, der nicht mehr zurückzuholen ist? Also das Versenden, das Buchen, das Löschen. Da gehört ein Mensch hin.
  3. Wer schaut sich an, was der Agent gemacht hat, und wo sieht man das überhaupt?

Die dritte vergisst man gern, ging mir auch so. Wenn ein Agent jeden Tag was tut und keiner guckt nach, ist er nach zwei Wochen ein Prozess ohne Standard, nur eben mit KI statt mit Ulf.

Die Sandboxes von Docker nehme ich mir auf jeden Fall mal genauer an, für längere Aufgaben, die heute auf meinem Rechner laufen, klingt das ziemlich praktisch. Mich würde aber interessieren, wie ihr das macht. Lasst ihr eure Agenten auch selber abschicken, oder sitzt bei euch am Ende noch jemand dazwischen?

Falls du mit mir arbeiten willst

Lass uns reden – ich sage dir ehrlich, ob ich helfen kann.

Kontakt aufnehmen