Webseiten geben KI-Agenten Werkzeuge in die Hand
WebMCP ist eine vorgeschlagene Browser-API: Eine Seite beschreibt ihre Funktionen als Tools mit Name, Beschreibung und JSON Schema – per JavaScript (document.modelContext.registerTool()) oder direkt am HTML-Formular (toolname). Ein Agent im Browser muss dann nicht mehr Screenshots deuten und Knöpfe suchen, sondern ruft die Funktion auf. Das läuft in der Seite, mit der Sitzung der Nutzerin – ganz ohne eigenen MCP-Server.
- 📸 Screenshot
🤔 Welches Problem löst WebMCP?
Heute: „Actuation“
Agenten beobachten die Seite über Screenshots, DOM- und Accessibility-Snapshots und simulieren Klicks und Tastatureingaben. Selbst einfache Aufgaben brauchen viele Schritte und sind „slow or unreliable“. [W3C]
Alternative: Backend-MCP
Ein MCP-Server spricht direkt mit dem Dienst – aber an der Web-Oberfläche vorbei. Zustand und Anmeldung müssen serverseitig nachgebaut werden, und die sichtbare Seite weiß nichts von der Änderung. [W3C]
WebMCP: Tools in der Seite
Die Seite registriert Tools im eigenen JavaScript und nutzt vorhandene Logik. Der Browser vermittelt den Aufruf, die UI aktualisiert sich sichtbar – Mensch und Agent arbeiten im selben Kontext. Fallback auf Klicken bleibt möglich. [W3C]
🚀 Was kann man damit machen?
Produkte filtern, Größe umrechnen, Warenkorb füllen – der Agent ruft get-/filter-Tools statt durch Menüs zu klicken. [W3C]
Ein submit_application-Tool ordnet Angaben aus dem Gespräch den richtigen Feldern zu (Vor- und Nachname getrennt?). [Chrome]
Mehrere Städte und Personen buchen – mit strukturierten Daten statt Datumswähler-Akrobatik. [Chrome]
Detaillierte Support-Tickets mit allen technischen Angaben automatisch vorbereiten. [Chrome]
Ein run_diagnostics-Tool auf einer Entwicklerseite löst Funktionen aus, die sonst tief in Menüs stecken. [Chrome]
Vorlagen filtern und Entwürfe bearbeiten – die Änderungen erscheinen sofort sichtbar in der App. [W3C]
🗓️ Wie ist der Stand?
- 13.08.2025Explainer erstmals veröffentlicht (Autorinnen und Autoren von Microsoft und Google). [W3C]
- 10.02.2026Chrome startet die Early Preview (Early Preview Program); Entwickler-Test ab Chrome 146 hinter einem Flag. [Chrome]
- 05.03.2026provideContext() und clearContext() werden aus dem Entwurf entfernt. [GitHub]
- 27.03.2026unregisterTool() entfällt – Abmelden erfolgt über ein AbortSignal. [GitHub]
- 27.05.2026Der Getter wandert von navigator.modelContext nach document.modelContext. [GitHub]
- Chrome 149Origin Trial „WebMCP“ startet (laut Chrome Status für Desktop und Android, bis einschließlich Chrome 156). [Chromium]
- Chrome 150navigator.modelContext gilt als veraltet (ab 150.0.7861.0), document.modelContext ist der neue Weg. [GitHub]
- Edge 150Auch Microsoft Edge bietet einen Origin Trial an. [W3C]
- Chrome 151Puppeteer spricht die neue CDP-Domain WebMCP an (page.webmcp). [Puppeteer]
- Chrome 153Abmelden eines Tools bricht laufende Ausführungen nicht mehr ab. [Chrome]
- Chrome 155JSON-Strings als Eingabe für executeTool() sind veraltet – Objekte übergeben. (Chrome 155 ist am 23.09.2026 Stable.) [Chrome]
- Chrome 156Neue Annotation debugging für Entwickler-Tools. [Chrome]
🧭 Browser & Agenten
| Browser / Agent | Stand laut Quelle |
|---|---|
| Chrome | Origin Trial ab Chrome 149; lokal über chrome://flags/#enable-webmcp-testing [W3C] |
| Edge | Origin Trial ab Edge 150 [W3C] |
| Brave | Experimentelle Unterstützung in Leo AI [W3C] |
| ChatGPT Desktop | Unterstützt WebMCP (als Agent) [W3C] |
| Firefox | Standards-Position offen (Chrome Status: „No signal“) [W3C] |
| Safari | Standards-Position offen (Chrome Status: „No signal“) [W3C] |
Chrome Status führt WebMCP als „Proposed“ mit Spezifikation im Reifegrad „Incubation“ (Community Group). Nichts davon ist ein fertiger Web-Standard. [Chromium]
🗺️ Weiter geht’s
Klicken vs. MCP vs. WebMCP als animierte Sequenzdiagramme, Vergleichstabelle und Sicherheitsmodell.
Diese Seite registriert echte Tools. Mit Simulator, Agent-Panel, Szenarien und Aufruf-Log.
Flag, Origin Trial, Inspector-Erweiterung, Konsole, Puppeteer und DevTools MCP – mit Selbsttest.
Imperativ, deklarativ, Feature-Erkennung, Abbruch, iframes und Ereignisse.
Begriffe, Zeitleiste und alle Quellen mit Datum.