{"id":4380,"date":"2026-10-05T15:23:30","date_gmt":"2026-10-05T13:23:30","guid":{"rendered":"https:\/\/security.sauer.ninja\/?p=4380"},"modified":"2026-10-05T15:34:28","modified_gmt":"2026-10-05T13:34:28","slug":"autonome-ki-pentester-im-praxistest-was-heute-funktioniert-was-noch-nicht-und-wo-das-echte-potenzial-liegt","status":"publish","type":"post","link":"https:\/\/security.sauer.ninja\/de\/pentesting\/autonome-ki-pentester-im-praxistest-was-heute-funktioniert-was-noch-nicht-und-wo-das-echte-potenzial-liegt\/","title":{"rendered":"Autonome KI-Pentester im Praxistest: Was heute funktioniert, was (noch) nicht \u2013 und wo das echte Potenzial liegt"},"content":{"rendered":"\n<p class=\"wp-block-paragraph\">Seit LLMs und KI-Agenten in der Lage sind, selbstst\u00e4ndig Tools auszuf\u00fchren und ihre eigenen Ergebnisse zu interpretieren, ist ein Narrativ im Markt entstanden, dem ich in Kundengespr\u00e4chen und vor allem auf LinkedIn immer h\u00e4ufiger begegne: <strong>Autonome KI-Pentester<\/strong>. Systeme, die angeblich ohne menschliche Aufsicht eine vollst\u00e4ndige Penetrationstest-Phase abbilden k\u00f6nnen: Von der Enumerierung bis zur Exploitation, autonom, konsistent, nachvollziehbar.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Genau deshalb haben wir Strix und PentAGI im Praxistest gepr\u00fcft. Nicht im Labor, nicht auf einer simplen Demo-Umgebung, sondern mit dem Ma\u00dfstab, den wir an jeden Pentest anlegen, der hier bei binsec l\u00e4uft: <strong>Ist das Ergebnis konsistent, reproduzierbar und belastbar?<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Die Antwort ist differenziert, aber eindeutig: <strong>OSINT geht gut, teilweise auch Exploitation funktionieren. Vollautonomie ist in der Praxis inkonsistent und total unzuverl\u00e4ssig.<\/strong> Das Potenzial liegt daher nicht darin, den Pentester zu ersetzen, sondern ihn zu unterst\u00fctzen, und dabei einzelne, kleine Teilschritte eines Pentests zu automatisieren.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Was wir getestet haben<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">F\u00fcr den Praxistest haben wir zwei vollautonome Systeme herangezogen, die in der Community und im Markt regelm\u00e4\u00dfig als \u201eautonome Pentester&#8220; genannt werden:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li><strong>Strix<\/strong><\/li>\n\n\n\n<li><strong>PentAGI<\/strong><\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\">Beide Systeme basieren auf dem gleichen Grundprinzip: Ein LLM-gesteuertes Agenten-System f\u00fchrt selbstst\u00e4ndig Aufgaben durch \u2013 Enumerierung, Analyse, teilweise Ausnutzung \u2013 ohne dass ein Pentester jeden Schritt steuert. Der Anspruch ist klar: Der Mensch definiert Scope und Ziel, die KI macht den Rest.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Das Gesamtbild: Teilschritte ja, Vollautonomie nein<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Beide Systeme konnten in unseren Tests einzelne Teilschritte eines Penetrationstests abbilden. Enumerierung von Diensten und Endpunkten funktioniert grunds\u00e4tzlich. Teilweise ist auch Exploitation m\u00f6glich.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Das Problem ist nicht, dass die Systeme nichts k\u00f6nnen. Das Problem ist, dass sie <strong>nicht zuverl\u00e4ssig und nicht konsistent<\/strong> liefern. Ein autonomer Agent, der bei identischem Scope mal ein belastbares Ergebnis produziert und beim n\u00e4chsten Lauf nichts davon wiederfindet, ist f\u00fcr die Praxis unbrauchbar. Ein Pentest ist keine Einmal-Chance. Er ist ein kontrollierter Prozess, und genau das fehlt der aktuellen Generation autonomer Agenten grundlegend.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Strix im Test: Funktionierendes Kern-Feature, reifes Interface nicht in Sicht<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\"><em>Strix<\/em> hat in unseren Tests gezeigt, dass es unter bestimmten Bedingungen Schwachstellen in Code oder auf Webservern finden kann. Das ist kein Selbstl\u00e4ufer, aber die Grundfunktionalit\u00e4t ist da.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Allerdings war das Ergebnis <strong>nicht zuverl\u00e4ssig und nicht konsistent<\/strong>. Ob eine bekannte Schwachstelle gefunden wurde oder nicht, hing st\u00e4rker vom Lauf ab, als es f\u00fcr einen belastbaren Testprozess tragbar ist.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Deutlich sichtbarer wurde das Problem aber auf der Interface-Seite. Die Nutzerumgebung von Strix ist <strong>nicht produktionsreif<\/strong>:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Das Interface enth\u00e4lt Bugs.<\/li>\n\n\n\n<li><strong>Strix st\u00fcrzt teilweise ab<\/strong>, insbesondere bei unerwarteten Ausgaben der KI.<\/li>\n\n\n\n<li>Der einzige Output ist eine <strong>Markdown-Datei ohne feste Struktur<\/strong>.<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\">F\u00fcr einen professionellen Pentest-Prozess ist das ein entscheidendes Kriterium. Ein Testergebnis, das als unstrukturierter Markdown-Text ohne festen Aufbau geliefert wird, l\u00e4sst sich weder in einen belastbaren Bericht \u00fcberf\u00fchren noch ist es f\u00fcr Auftraggeber, Management und IT-Betrieb in gleicher Weise nutzbar. Ein guter Pentest-Bericht folgt einem klaren Aufbau, priorisiert Findings, ordnet Risiken ein und macht Ma\u00dfnahmen ableitbar. Genau das liefert der Output von Strix in dieser Form nicht.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">PentAGI im Test: Reifer von der Oberfl\u00e4che, aber mit klaren Grenzen<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\"><em>PentAGI<\/em> wirkt von der Oberfl\u00e4che her produktionsreifer als Strix. Die Task-Organisation ist besser, die Struktur der Abl\u00e4ufe ist nachvollziehbarer. Wer die beiden Systeme direkt vergleicht, merkt sofort, dass PentAGI weiter ist in der Frage, <em>wie<\/em> die Arbeit organisiert wird.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Doch bei genauerem Hinsehen zeigt sich dasselbe Grundproblem wie bei Strix: <strong>Inkonsistenz.<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Im Lauf haben wir mehrere konkrete Probleme beobachtet:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li><strong>Flows pausieren teilweise<\/strong>, wenn sie im Hintergrund laufen sollen.<\/li>\n\n\n\n<li><strong>Agenten machen oft mehr als die aktuelle Aufgabe<\/strong>, wodurch viel doppelt ausgef\u00fchrt wird.<\/li>\n\n\n\n<li><strong>Scope-Probleme:<\/strong> PentAGI scannte teilweise IPs und Ports, die nicht vorgegeben waren.<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\">Letzteres ist der Punkt, der f\u00fcr uns den Ausschlag gibt. Ein autonomer Agent, der sich au\u00dferhalb des definierten Scopes bewegt, ist f\u00fcr einen professionellen Penetrationstest nicht einsetzbar. Ein Pentest l\u00e4uft immer innerhalb eines klaren, vertraglich abgegrenzten Scopes. Wer au\u00dferhalb dieses Scopes aktiv wird, verl\u00e4sst den Rahmen, in dem der Test erlaubt ist. Das ist nicht nur eine methodische Schw\u00e4che, das ist ein kritisches Problem!<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Warum reale Umgebungen mehr sind als typische Test Cases<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Noch wichtiger als die Frage nach der Konsistenz der Ergebnisse ist die Frage, <strong>wo<\/strong> autonome KI-Agenten \u00fcberhaupt sinnvoll zum Einsatz kommen k\u00f6nnten. Denn die Realit\u00e4t eines Pentests ist deutlich komplexer, als es die meisten der genannten Systeme abbilden k\u00f6nnen.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Die meisten Tests f\u00fcr KI-Pentests laufen gegen externe Infrastrukturen oder \u00f6ffentliche Web-Anwendungen.<\/strong> Das ist der einfachste Fall: Die Angriffsfl\u00e4che ist klar abgegrenzt, die Systemgrenzen sind technisch sichtbar, und ein Ausritt des Agenten bleibt relativ beherrschbar, weil er sich ohnehin nur dort bewegen kann, wo man ihn kontrollieren kann.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Ein interner Einsatz stellt hier deutlich h\u00f6here Anforderungen.<\/strong> Intern gibt es keine technische Kante, die einen Agenten automatisch stoppt. Grenzen und Rahmenbedingungen m\u00fcssen hier rein vertraglich und organisatorisch eingehalten werden, und genau da scheitert die aktuelle Generation autonomer Agenten, wie wir bei PentAGI gesehen haben. Je gr\u00f6\u00dfer das interne Segment, desto gr\u00f6\u00dfer ist auch der potenzielle Schaden, den ein Agent anrichten kann, der sich nicht an seine Grenzen h\u00e4lt.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Und die Umgebung selbst ist selten so einfach, wie sie in Test Cases erscheint.<\/strong> Das Zusammenspiel zwischen verschiedenen Systemen z.B. bestehend aus API, Web App, Mobile App, Drittsysteme kann ein Vielfaches komplexer sein als jede typische, isolierte Test Case. Ein Schwachstellenpfad, der \u00fcber mehrere Systeme hinweg verl\u00e4uft, erfordert ein Verst\u00e4ndnis von Kontext, Abh\u00e4ngigkeiten und Berechtigungsmodellen, das autonome Agenten heute nicht zuverl\u00e4ssig liefern.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Hardware-nahes Testing geht aus Prinzip gar nicht.<\/strong> Bluetooth-Schnittstellen, medizinische Ger\u00e4te, IoT-Systeme, industrielle Steuerungen. \u00dcberall dort, wo ein Pentest auf die physische Schiene geht, brauchen wir Messger\u00e4te, Spezialwerkzeuge und ein manuelles Vorgehen, das ein Software-Agent nicht abbilden kann. Das ist kein Nachteil der aktuellen KI, das ist eine prinzipielle Grenze.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Warum Vollautonomie (noch) nicht tr\u00e4gt<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Die beiden Systeme teilen sich ein Muster, das wir aus der Praxis gut kennen: Sie k\u00f6nnen <strong>Teilaufgaben<\/strong> l\u00f6sen, aber sie k\u00f6nnen <strong>keinen Prozess<\/strong> tragen.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Ein Penetrationstest ist keine Kette voneinander unabh\u00e4ngiger Aufgaben. Er ist ein gesteuerter Prozess mit definiertem Scope, klaren Zielsetzungen, kontrollierter Durchf\u00fchrung und nachvollziehbarer Bewertung. Was autonome Agenten heute liefern, sind Bruchst\u00fccke: Mal gut, mal schlecht, mal im Scope, mal au\u00dferhalb, mal dokumentiert, mal reproduzierbar, mal nicht.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Das ist das eigentliche Problem. Nicht, dass die KI heute schw\u00e4cher ist als ein erfahrener Pentester, das w\u00e4re sie in den meisten F\u00e4llen ohnehin. Auch wenn sie bei manchen einfachen Tasks einfach schneller sein kann. Das eigentliche Problem ist, dass <strong>Konsistenz, Nachvollziehbarkeit und Scope-Disziplin<\/strong> fehlen. Und genau diese drei Dinge machen einen Penetrationstest zu einem belastbaren Ergebnis und nicht zu einer AI Pentesting Lotterie.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Wo das Potenzial tats\u00e4chlich liegt<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Das bedeutet nicht, dass KI im Pentesting keine Rolle spielt. Im Gegenteil. Aber die Rolle ist eine andere als die, die der Markt derzeit verspricht.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Das echte Potenzial liegt nicht im autonomen Agenten, der den Pentester ersetzt. Es liegt in der <strong>Unterst\u00fctzung des Pentesters<\/strong> und in der <strong>Automatisierung einzelner, kleiner Teilschritte<\/strong>:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li><strong>Automatisierte Enumerierung:<\/strong> Wiederkehrende, zeitaufw\u00e4ndige Aufgaben wie die Erfassung von Endpunkten, Diensten oder Konfigurationen lassen sich zuverl\u00e4ssig automatisieren.<\/li>\n\n\n\n<li><strong>Ergebnisanalyse und -aufbereitung:<\/strong> Das Sichten gro\u00dfer Datenmengen, das Filtern von Daten, das Erstellen eigener API-Doku von Kundenanwendungen, hier kann KI hervorragend unterst\u00fctzen.<\/li>\n\n\n\n<li><strong>Dokumentationsunterst\u00fctzung:<\/strong> Die Aufbereitung von Rohdaten in strukturierte Berichte, die Durchf\u00fchrung einer Qualit\u00e4tskontrolle des Berichts auf logische Fehler, Rechtschreibung- und Grammatikfehler. Das entlastet den Pentester in der Phase, die am wenigsten Spa\u00df macht, aber selbst mit Tools wie PTDoc immernoch Zeit bindet.<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\">Genau dort ist der Mehrwert. Nicht im \u201eautonomen Pentest&#8220;, sondern im <strong>effizienteren, strukturierten Pentest<\/strong>, bei dem der Mensch die Kontrolle beh\u00e4lt und die KI die l\u00e4stige Flei\u00dfarbeit \u00fcbernimmt.<\/p>\n","protected":false},"excerpt":{"rendered":"<p>Seit LLMs und KI-Agenten in der Lage sind, selbstst\u00e4ndig Tools auszuf\u00fchren und ihre eigenen Ergebnisse zu interpretieren, ist ein Narrativ im Markt entstanden, dem ich in Kundengespr\u00e4chen und vor allem auf LinkedIn immer h\u00e4ufiger begegne: Autonome KI-Pentester. Systeme, die angeblich ohne menschliche Aufsicht eine vollst\u00e4ndige Penetrationstest-Phase abbilden k\u00f6nnen: Von der Enumerierung bis zur Exploitation, autonom, &#8230; <span class=\"more\"><a class=\"more-link\" href=\"https:\/\/security.sauer.ninja\/de\/pentesting\/autonome-ki-pentester-im-praxistest-was-heute-funktioniert-was-noch-nicht-und-wo-das-echte-potenzial-liegt\/\">[Read more&#8230;]<\/a><\/span><\/p>\n","protected":false},"author":1,"featured_media":0,"comment_status":"open","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"_seopress_titles_title":"","_seopress_titles_desc":"","_seopress_robots_index":"","_seopress_robots_follow":"","_seopress_robots_imageindex":"","_seopress_robots_snippet":"","_seopress_robots_primary_cat":"","_seopress_robots_breadcrumbs":"","_seopress_robots_freeze_modified_date":"","_seopress_robots_custom_modified_date":"","_seopress_robots_canonical":"","_seopress_social_fb_title":"","_seopress_social_fb_desc":"","_seopress_social_fb_img":"","_seopress_social_fb_img_attachment_id":0,"_seopress_social_fb_img_width":0,"_seopress_social_fb_img_height":0,"_seopress_social_twitter_title":"","_seopress_social_twitter_desc":"","_seopress_social_twitter_img":"","_seopress_social_twitter_img_attachment_id":0,"_seopress_social_twitter_img_width":0,"_seopress_social_twitter_img_height":0,"_seopress_redirections_value":"","_seopress_redirections_enabled":"","_seopress_redirections_enabled_regex":"","_seopress_redirections_logged_status":"","_seopress_redirections_param":"","_seopress_redirections_type":0,"_seopress_analysis_target_kw":"","footnotes":""},"categories":[23],"tags":[],"class_list":["entry","post","publish","author-psauer","post-4380","format-standard","category-pentesting"],"_links":{"self":[{"href":"https:\/\/security.sauer.ninja\/de\/wp-json\/wp\/v2\/posts\/4380","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/security.sauer.ninja\/de\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/security.sauer.ninja\/de\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/security.sauer.ninja\/de\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/security.sauer.ninja\/de\/wp-json\/wp\/v2\/comments?post=4380"}],"version-history":[{"count":2,"href":"https:\/\/security.sauer.ninja\/de\/wp-json\/wp\/v2\/posts\/4380\/revisions"}],"predecessor-version":[{"id":4383,"href":"https:\/\/security.sauer.ninja\/de\/wp-json\/wp\/v2\/posts\/4380\/revisions\/4383"}],"wp:attachment":[{"href":"https:\/\/security.sauer.ninja\/de\/wp-json\/wp\/v2\/media?parent=4380"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/security.sauer.ninja\/de\/wp-json\/wp\/v2\/categories?post=4380"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/security.sauer.ninja\/de\/wp-json\/wp\/v2\/tags?post=4380"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}