AI Chat — Benutzerhandbuch | YoBench
So verwenden Sie das Modul „AI Chat" in YoBench: OpenAI/Claude/YandexGPT/lokale LLM, Streaming, System-Prompt, RAG, Tool Use.
Was das Modul „AI Chat" leistet
Das Modul ist die zentrale Stelle in YoBench, um mit KI zu sprechen. Verbinden Sie OpenAI, Anthropic Claude, YandexGPT oder beliebige OpenAI-kompatible lokale LLMs (LM Studio, Ollama, vLLM, llama.cpp), führen Sie mehrere parallele Gespräche, hängen Sie RAG-Kontexte an und lassen Sie das Modell ein produktionsreifes Toolkit nutzen — Browser, Terminal, Dateisystem, Web-Suche sowie Word- / Excel- / PowerPoint- / PDF-Generierung — unter Ihrer Kontrolle mit expliziten Berechtigungen.
Was Sie bekommen:
- Agentenbasierter KI-Kern — der Assistent läuft als Agent mit expliziten Berechtigungs-Dialogen, einer einheitlichen Ausführungs-Timeline und einem strukturierten Chat-Logger mit Filter- und Export-Funktion.
- Produktionsreifes Tool-Set — Word-, Excel-, PowerPoint- und PDF-Dokumente erstellen und bearbeiten, Bilder extrahieren, ein gehärtetes plattformübergreifendes Terminal und Dateisystem steuern (Pfad-Klassifizierung, Symlink-Auflösung, SSRF-Schutz).
- Austauschbare Web-Suche — Brave, DuckDuckGo oder Tavily als Such-Backend, pro Workspace umschaltbar.
- Einheitliches Sprach-Erlebnis — ein Mikrofon-Knopf plus zwei Schalter. Streaming-TTS satzweise, automatische Spracherkennung (en/ru/de/fr/pt/es), automatischer Mikro-Neustart für freihändige Dialoge.
- Abbruch als gleichberechtigtes Ergebnis — Cancelled by user erscheint in Timeline und Logs separat von Fehlern, mit sauberem Aufräumen lang laufender Tools.
- Vision-Unterstützung — bildhaltige Tool-Ergebnisse (Screenshots, extrahierte Bilder) sieht der Assistent in der nächsten Runde.
- Mehrere parallele Gespräche — jedes mit eigenem Anbieter, Modell, System-Prompt, RAG-Kontext.
- Streaming-Antworten — Tokens kommen in Chunks, nicht erst zum Schluss.
- RAG-Kontexte — Antworten aus Ihren Dokumenten via Hybrid-Suche (Vector + BM25).
- Logs — jedes Chat-Ereignis (LLM-Anfragen, Streaming, Tool-Ausführung) separat mit API-Key-Maskierung.
- Kontext-Kompaktion — alte Historie wird automatisch in
context_summaryzusammengefasst, damit Token-Limits nicht erreicht werden.
Unterstützte Anbieter
Im Code implementiert:
- OpenAI — offizielles API via
OpenAIAdapter. - Anthropic Claude — via
ClaudeAdapter. - YandexGPT — via
YandexGPTAdapter. - OpenAI-kompatible lokale LLMs — LM Studio, Ollama, vLLM, llama.cpp; durch
OpenAIAdaptergeroutet.
Anbieter-Parameter:
- API-Key — der Schlüssel.
- API-URL — Basis-URL (optional, sonst Standard des Anbieters).
- Modell — Modell-Identifikator.
- Temperature — Kreativität (0–2, Standard 0.7).
- Max Tokens — Limit der Ausgabe-Tokens (Standard 4096).
- Frequency Penalty — Wiederholungs-Penalty (0–2, Standard 0). Für lokale LLMs werden 0.3–0.5 empfohlen.
- Presence Penalty — Neue-Themen-Penalty (0–2, Standard 0).
- Proxy — optional für ausgehende Anfragen.
Gesprächs-Parameter
Beim Anlegen (chat_conversations):
- Title — Anzeigename; kann aus der ersten Nachricht auto-generiert werden.
- Provider — welcher KI-Anbieter.
- System-Prompt — Anweisung für das Modell.
- Temperature — überschreibt den globalen Wert.
- Tools enabled — Tool Use ein/aus.
- Max auto-iterations — wie viele Tool→Ergebnis-Iterationen erlaubt sind (Standard 3).
- Web search provider — separater Anbieter für Web-Suche.
- Context — angehängter RAG-Kontext aus dem Kontext-Manager.
Nachrichten in chat_messages (role: user / assistant / system, content).
Tool Use
Mit aktivem Tools enabled läuft das Modell als Agent und kann Tools aus der ToolRegistry aufrufen. Im Code:
browser— Aktionennavigate,click,fill,type,key,screenshot,wait_for_selector,wait_for_navigation,wait_for_url_change,evaluate,get_content,close. Headless-Chromium.terminal— Shell-Befehle in einer gehärteten plattformübergreifenden Shell.file system— Lesen / Schreiben / Auflisten mit Pfad-Klassifizierung (project / system / user) und Symlink-Auflösung.web— Web-Operationen über austauschbare Such-Adapter (Brave, DuckDuckGo, Tavily) sowie fetch.documents— Word- (DOCX), Excel- (XLSX), PowerPoint- (PPTX) und PDF-Dokumente erzeugen und bearbeiten; Bilder aus Dokumenten extrahieren.
Ablauf: Modell wählt tool__action → ExecutionEngine führt aus → Ergebnis zurück in den Kontext → ggf. weitere Iteration (bis max_auto_iterations).
Berechtigungen
Sensible Aktionen lösen vor der Ausführung einen expliziten Berechtigungs-Dialog aus:
- Schreibzugriffe auf das Dateisystem außerhalb des Projekt-Scopes.
- Terminal-Befehle, die destruktiv aussehen.
- Ausgehende Netzwerk-Anfragen an Domains, die nicht auf der Allow-Liste stehen.
Sie können Allow once, Allow for this conversation oder Deny wählen. Eine Ablehnung wird sauber als cancelled gewertet — der Agent versucht es nicht erneut, und die Timeline hält die Entscheidung fest.
Abbruch
Der Abbruch ist ein gleichberechtigtes Ergebnis und kein Fehler:
- Lauf jederzeit stoppen → der Scope-Key wird abgebrochen, lang laufende Tools (Browser, Terminal) werden sauber heruntergefahren.
- Die Timeline zeigt
cancelledgetrennt vonerror, mit einem Begründungs-String („Cancelled by user", „Permission denied" etc.). - Logs bewahren den Teilstand, sodass Sie an der Unterbrechungsstelle weitermachen können.
Vision und bildhaltige Tool-Ergebnisse
Tools, die Bilder zurückgeben (browser__screenshot, documents__extract_images), liefern bildhaltige Tool-Ergebnisse. In der nächsten Runde sieht der Assistent diese Bilder neben dem Text — Vision-fähige Modelle können also über Screenshots und extrahierte Abbildungen schlussfolgern, ohne dass Sie sie erneut anhängen.
Sprache
Das Sprach-Erlebnis ist vereinheitlicht — ein Mikrofon-Knopf plus zwei Schalter für Antworten vorlesen und Auto-Dialog-Modus:
- Streaming-TTS satzweise — die Antwort des Modells beginnt zu sprechen, sobald der erste Satz fertig ist, ohne das Ende abzuwarten.
- Automatische Spracherkennung — en / ru / de / fr / pt / es. Die Stimme passt sich Ihrer Sprache ohne manuelle Auswahl an.
- Automatischer Mikro-Neustart — im Auto-Dialog-Modus aktiviert sich das Mikrofon erneut, sobald der Assistent zu Ende gesprochen hat — so führen Sie freihändig ein Gespräch.
- Standardmäßig offline — Speech-to-Text via Whisper, Text-to-Speech via Piper. Keine externen Dienste, sofern Sie nicht ausdrücklich einen einbinden.
RAG-Kontext
In den Gesprächs-Einstellungen wählen Sie einen Kontext aus dem Kontext-Manager. Bei der ersten Nachricht werden relevante Chunks geholt und in den System-Prompt geschoben. Spätere Iterationen überspringen das Retrieval — der Kontext ist bereits da.
Jede Sitzung kann zusätzlich den Suchmodus umschalten:
- Fast (Standard) — hybride Suche (Vector + Keyword) liefert Ergebnisse in Sekundenbruchteilen.
- Accurate — ergänzt einen Reranker-Schritt nach der hybriden Suche. Langsamer, deutlich besser bei langen oder mehrdeutigen Anfragen.
Globale Einstellungen
Unter Einstellungen → AI Chat:
chatDefaultProviderId— Standard-Anbieter für neue Gespräche.chatDefaultContextId— Standard-RAG-Kontext.chatDefaultSystemPrompt— Standard-System-Prompt.chatDefaultTemperature— Standard-Temperature (0.7).chatDefaultToolsEnabled— Tool Use standardmäßig an (Standard on).chatDefaultMaxAutoIterations— Auto-Iterations-Limit (Standard 3).chatDefaultWebSearchProviderId— Web-Search-Anbieter.chatDefaultMaxTokens— Ausgabe-Token-Limit (Standard 4096).chatDefaultFrequencyPenalty/chatDefaultPresencePenalty— Penalties (Standard 0).
Ablauf
1. Anbieter einrichten
In Einstellungen → Anbieter Anbieter hinzufügen: Typ, API-Key, Modell, optional Base-URL und Proxy.
2. Gespräch starten
- AI Chat im linken Menü öffnen.
- Neues Gespräch klicken.
- Anbieter wählen (oder Default).
- Optional System-Prompt, Temperature, RAG-Kontext setzen.
3. Nachrichten senden
Anfrage tippen → Antwort streamt herein. Tools enabled pro Gespräch ein/aus.
4. Bilder und Kontexte anhängen
- Bilder — Drag-and-Drop in den Composer; Base64 geht in die Anfrage (Anbieter muss Vision unterstützen).
- RAG-Kontext — in den Gesprächs-Einstellungen wählen.
5. Tool Use steuern
In den Gesprächs-Einstellungen Max auto-iterations setzen. Das Modell kann browser__navigate → terminal__run usw. aufrufen. Details in den Logs.
6. Logs prüfen
Im Tab Logs sehen Sie den Ereignisstrom: LLM-Anfragen, Streaming, Tool-Ausführung, Fehler. Filter nach level, category. Geheimnisse (API-Keys, Bearer-Tokens) werden automatisch maskiert.
7. Gespräche verwalten
- Umbenennen — Auto-Naming aus der ersten Nachricht, manuell änderbar.
- Löschen — entfernt Gespräch und Nachrichten.
- Generierung stoppen —
chat:stop-generationbricht den aktuellen Stream ab.
Nächste Schritte
- Verknüpfen Sie Kontexte & RAG für fundierte Antworten.
- Nutzen Sie den Web-Parser, um Daten vorzubereiten, die Sie der KI vorlegen.
- Für Dokumenten-Schreiben/Bearbeiten ist der eingebaute KI-Assistent in Docs schneller.
Hilfe und Feedback
Wünschen Sie Gemini-, Mistral-Support oder mehr Tools? Schreiben Sie uns über das Feedback-Formular.