Herunterladen

AI Chat — Benutzerhandbuch | YoBench

So verwenden Sie das Modul „AI Chat" in YoBench: OpenAI/Claude/YandexGPT/lokale LLM, Streaming, System-Prompt, RAG, Tool Use.

Was das Modul „AI Chat" leistet

Das Modul ist die zentrale Stelle in YoBench, um mit KI zu sprechen. Verbinden Sie OpenAI, Anthropic Claude, YandexGPT oder beliebige OpenAI-kompatible lokale LLMs (LM Studio, Ollama, vLLM, llama.cpp), führen Sie mehrere parallele Gespräche, hängen Sie RAG-Kontexte an und lassen Sie das Modell ein produktionsreifes Toolkit nutzen — Browser, Terminal, Dateisystem, Web-Suche sowie Word- / Excel- / PowerPoint- / PDF-Generierung — unter Ihrer Kontrolle mit expliziten Berechtigungen.

Was Sie bekommen:

  • Agentenbasierter KI-Kern — der Assistent läuft als Agent mit expliziten Berechtigungs-Dialogen, einer einheitlichen Ausführungs-Timeline und einem strukturierten Chat-Logger mit Filter- und Export-Funktion.
  • Produktionsreifes Tool-Set — Word-, Excel-, PowerPoint- und PDF-Dokumente erstellen und bearbeiten, Bilder extrahieren, ein gehärtetes plattformübergreifendes Terminal und Dateisystem steuern (Pfad-Klassifizierung, Symlink-Auflösung, SSRF-Schutz).
  • Austauschbare Web-Suche — Brave, DuckDuckGo oder Tavily als Such-Backend, pro Workspace umschaltbar.
  • Einheitliches Sprach-Erlebnis — ein Mikrofon-Knopf plus zwei Schalter. Streaming-TTS satzweise, automatische Spracherkennung (en/ru/de/fr/pt/es), automatischer Mikro-Neustart für freihändige Dialoge.
  • Abbruch als gleichberechtigtes ErgebnisCancelled by user erscheint in Timeline und Logs separat von Fehlern, mit sauberem Aufräumen lang laufender Tools.
  • Vision-Unterstützung — bildhaltige Tool-Ergebnisse (Screenshots, extrahierte Bilder) sieht der Assistent in der nächsten Runde.
  • Mehrere parallele Gespräche — jedes mit eigenem Anbieter, Modell, System-Prompt, RAG-Kontext.
  • Streaming-Antworten — Tokens kommen in Chunks, nicht erst zum Schluss.
  • RAG-Kontexte — Antworten aus Ihren Dokumenten via Hybrid-Suche (Vector + BM25).
  • Logs — jedes Chat-Ereignis (LLM-Anfragen, Streaming, Tool-Ausführung) separat mit API-Key-Maskierung.
  • Kontext-Kompaktion — alte Historie wird automatisch in context_summary zusammengefasst, damit Token-Limits nicht erreicht werden.

Unterstützte Anbieter

Im Code implementiert:

  • OpenAI — offizielles API via OpenAIAdapter.
  • Anthropic Claude — via ClaudeAdapter.
  • YandexGPT — via YandexGPTAdapter.
  • OpenAI-kompatible lokale LLMs — LM Studio, Ollama, vLLM, llama.cpp; durch OpenAIAdapter geroutet.

Anbieter-Parameter:

  • API-Key — der Schlüssel.
  • API-URL — Basis-URL (optional, sonst Standard des Anbieters).
  • Modell — Modell-Identifikator.
  • Temperature — Kreativität (0–2, Standard 0.7).
  • Max Tokens — Limit der Ausgabe-Tokens (Standard 4096).
  • Frequency Penalty — Wiederholungs-Penalty (0–2, Standard 0). Für lokale LLMs werden 0.3–0.5 empfohlen.
  • Presence Penalty — Neue-Themen-Penalty (0–2, Standard 0).
  • Proxy — optional für ausgehende Anfragen.

Gesprächs-Parameter

Beim Anlegen (chat_conversations):

  • Title — Anzeigename; kann aus der ersten Nachricht auto-generiert werden.
  • Provider — welcher KI-Anbieter.
  • System-Prompt — Anweisung für das Modell.
  • Temperature — überschreibt den globalen Wert.
  • Tools enabled — Tool Use ein/aus.
  • Max auto-iterations — wie viele Tool→Ergebnis-Iterationen erlaubt sind (Standard 3).
  • Web search provider — separater Anbieter für Web-Suche.
  • Context — angehängter RAG-Kontext aus dem Kontext-Manager.

Nachrichten in chat_messages (role: user / assistant / system, content).

Tool Use

Mit aktivem Tools enabled läuft das Modell als Agent und kann Tools aus der ToolRegistry aufrufen. Im Code:

  • browser — Aktionen navigate, click, fill, type, key, screenshot, wait_for_selector, wait_for_navigation, wait_for_url_change, evaluate, get_content, close. Headless-Chromium.
  • terminal — Shell-Befehle in einer gehärteten plattformübergreifenden Shell.
  • file system — Lesen / Schreiben / Auflisten mit Pfad-Klassifizierung (project / system / user) und Symlink-Auflösung.
  • web — Web-Operationen über austauschbare Such-Adapter (Brave, DuckDuckGo, Tavily) sowie fetch.
  • documents — Word- (DOCX), Excel- (XLSX), PowerPoint- (PPTX) und PDF-Dokumente erzeugen und bearbeiten; Bilder aus Dokumenten extrahieren.

Ablauf: Modell wählt tool__actionExecutionEngine führt aus → Ergebnis zurück in den Kontext → ggf. weitere Iteration (bis max_auto_iterations).

Berechtigungen

Sensible Aktionen lösen vor der Ausführung einen expliziten Berechtigungs-Dialog aus:

  • Schreibzugriffe auf das Dateisystem außerhalb des Projekt-Scopes.
  • Terminal-Befehle, die destruktiv aussehen.
  • Ausgehende Netzwerk-Anfragen an Domains, die nicht auf der Allow-Liste stehen.

Sie können Allow once, Allow for this conversation oder Deny wählen. Eine Ablehnung wird sauber als cancelled gewertet — der Agent versucht es nicht erneut, und die Timeline hält die Entscheidung fest.

Abbruch

Der Abbruch ist ein gleichberechtigtes Ergebnis und kein Fehler:

  • Lauf jederzeit stoppen → der Scope-Key wird abgebrochen, lang laufende Tools (Browser, Terminal) werden sauber heruntergefahren.
  • Die Timeline zeigt cancelled getrennt von error, mit einem Begründungs-String („Cancelled by user", „Permission denied" etc.).
  • Logs bewahren den Teilstand, sodass Sie an der Unterbrechungsstelle weitermachen können.

Vision und bildhaltige Tool-Ergebnisse

Tools, die Bilder zurückgeben (browser__screenshot, documents__extract_images), liefern bildhaltige Tool-Ergebnisse. In der nächsten Runde sieht der Assistent diese Bilder neben dem Text — Vision-fähige Modelle können also über Screenshots und extrahierte Abbildungen schlussfolgern, ohne dass Sie sie erneut anhängen.

Sprache

Das Sprach-Erlebnis ist vereinheitlicht — ein Mikrofon-Knopf plus zwei Schalter für Antworten vorlesen und Auto-Dialog-Modus:

  • Streaming-TTS satzweise — die Antwort des Modells beginnt zu sprechen, sobald der erste Satz fertig ist, ohne das Ende abzuwarten.
  • Automatische Spracherkennung — en / ru / de / fr / pt / es. Die Stimme passt sich Ihrer Sprache ohne manuelle Auswahl an.
  • Automatischer Mikro-Neustart — im Auto-Dialog-Modus aktiviert sich das Mikrofon erneut, sobald der Assistent zu Ende gesprochen hat — so führen Sie freihändig ein Gespräch.
  • Standardmäßig offline — Speech-to-Text via Whisper, Text-to-Speech via Piper. Keine externen Dienste, sofern Sie nicht ausdrücklich einen einbinden.

RAG-Kontext

In den Gesprächs-Einstellungen wählen Sie einen Kontext aus dem Kontext-Manager. Bei der ersten Nachricht werden relevante Chunks geholt und in den System-Prompt geschoben. Spätere Iterationen überspringen das Retrieval — der Kontext ist bereits da.

Jede Sitzung kann zusätzlich den Suchmodus umschalten:

  • Fast (Standard) — hybride Suche (Vector + Keyword) liefert Ergebnisse in Sekundenbruchteilen.
  • Accurate — ergänzt einen Reranker-Schritt nach der hybriden Suche. Langsamer, deutlich besser bei langen oder mehrdeutigen Anfragen.

Globale Einstellungen

Unter Einstellungen → AI Chat:

  • chatDefaultProviderId — Standard-Anbieter für neue Gespräche.
  • chatDefaultContextId — Standard-RAG-Kontext.
  • chatDefaultSystemPrompt — Standard-System-Prompt.
  • chatDefaultTemperature — Standard-Temperature (0.7).
  • chatDefaultToolsEnabled — Tool Use standardmäßig an (Standard on).
  • chatDefaultMaxAutoIterations — Auto-Iterations-Limit (Standard 3).
  • chatDefaultWebSearchProviderId — Web-Search-Anbieter.
  • chatDefaultMaxTokens — Ausgabe-Token-Limit (Standard 4096).
  • chatDefaultFrequencyPenalty / chatDefaultPresencePenalty — Penalties (Standard 0).

Ablauf

1. Anbieter einrichten

In Einstellungen → Anbieter Anbieter hinzufügen: Typ, API-Key, Modell, optional Base-URL und Proxy.

2. Gespräch starten

  1. AI Chat im linken Menü öffnen.
  2. Neues Gespräch klicken.
  3. Anbieter wählen (oder Default).
  4. Optional System-Prompt, Temperature, RAG-Kontext setzen.

3. Nachrichten senden

Anfrage tippen → Antwort streamt herein. Tools enabled pro Gespräch ein/aus.

4. Bilder und Kontexte anhängen

  • Bilder — Drag-and-Drop in den Composer; Base64 geht in die Anfrage (Anbieter muss Vision unterstützen).
  • RAG-Kontext — in den Gesprächs-Einstellungen wählen.

5. Tool Use steuern

In den Gesprächs-Einstellungen Max auto-iterations setzen. Das Modell kann browser__navigateterminal__run usw. aufrufen. Details in den Logs.

6. Logs prüfen

Im Tab Logs sehen Sie den Ereignisstrom: LLM-Anfragen, Streaming, Tool-Ausführung, Fehler. Filter nach level, category. Geheimnisse (API-Keys, Bearer-Tokens) werden automatisch maskiert.

7. Gespräche verwalten

  • Umbenennen — Auto-Naming aus der ersten Nachricht, manuell änderbar.
  • Löschen — entfernt Gespräch und Nachrichten.
  • Generierung stoppenchat:stop-generation bricht den aktuellen Stream ab.

Nächste Schritte

  • Verknüpfen Sie Kontexte & RAG für fundierte Antworten.
  • Nutzen Sie den Web-Parser, um Daten vorzubereiten, die Sie der KI vorlegen.
  • Für Dokumenten-Schreiben/Bearbeiten ist der eingebaute KI-Assistent in Docs schneller.

Hilfe und Feedback

Wünschen Sie Gemini-, Mistral-Support oder mehr Tools? Schreiben Sie uns über das Feedback-Formular.