Zum Hauptinhalt springen

Wissenssammlungen

Die Wissenssammlungen-Seite (/admin/knowledge-sets) ermöglicht es Workspace-Administratoren, Wissenssammlungen zu verwalten. Nur Admin-Benutzer können auf diese Seite zugreifen.

Wissenssammlungen verwaltenWissenssammlungen verwalten

Eine Wissenssammlung ist eine Wissensbasis (RAG-Korpus): eine Sammlung von Dokumenten und externen Quellen, die für eine semantische Suche aufbereitet ("eingebettet") wird. Agenten können auf eine oder mehrere Wissenssammlungen zugreifen, um ihre Antworten mit Ihren eigenen Inhalten zu untermauern.

Übersicht​

Die Listenansicht zeigt alle Wissenssammlungen in einer Tabelle mit folgenden Spalten:

SpalteInhalt
NameName der Wissenssammlung
BeschreibungDatenbeschreibung (gekürzt)
DateienAnzahl der enthaltenen Dateien
Embedding-ModellFür die Einbettung verwendetes Modell
ErstelltErstellungsdatum

Über das Suchfeld (Wissenssammlungen suchen...) filtern Sie die Liste nach Name oder Beschreibung. Über die Auswahlkästchen am Zeilenanfang lassen sich mehrere Sammlungen markieren und mit der Schaltfläche Löschen (mit der Anzahl der ausgewählten Einträge) gemeinsam entfernen.

Eine Wissenssammlung erstellen​

  1. Klicken Sie auf Wissenssammlung erstellen
  2. BasePeak.AI legt die Sammlung an und öffnet direkt deren Detailseite
  3. Vergeben Sie dort einen Namen und befüllen Sie die Sammlung mit Quellen oder Dateien

Das Embedding-Modell stammt aus Ihren konfigurierten Modellanbietern (siehe Modellanbieter). Stellen Sie sicher, dass mindestens ein passendes Modell verfügbar ist.

Details bearbeiten​

Auf der Detailseite einer Wissenssammlung bearbeiten Sie Name und Datenbeschreibung. Beide Felder werden automatisch gespeichert (während des Speicherns erscheint Wird gespeichert...). Eine aussagekräftige Beschreibung hilft Agenten zu erkennen, wann diese Wissensbasis relevant ist.

Eine Metadatenleiste am Kopf der Seite zeigt die wichtigsten Kennzahlen: Erstellt, Dateien (Anzahl), Gesamtgröße, Embedding-Modell sowie die Verwendung durch Agenten und Threads.

Detailansicht einer Wissenssammlung mit DokumentvorschauDetailansicht einer Wissenssammlung mit Dokumentvorschau

Wissensverarbeitung​

Im Bereich Erweitert am Ende der Detailseite legen Sie fest, wie eine Wissenssammlung Dokumente einliest, aufteilt und durchsucht – die Wissensverarbeitung. Für die meisten Sammlungen ist die Voreinstellung passend; Sie müssen hier nichts ändern.

Wählen Sie ein vorkonfiguriertes Verarbeitungsprofil:

ProfilGeeignet für
Standard (ausgewogen)Die meisten Inhalte – die Voreinstellung.
Hohe Qualität (hybrid)Kombiniert bedeutungs- und stichwortbasierte Suche; bessere Treffer bei Namen, Aktenzeichen und exakten Begriffen.
Großer KontextHält größere, zusammenhängende Abschnitte zusammen – für Fragen, die den ganzen Abschnitt benötigen.
Juristische DokumenteTeilt nach juristischer Struktur (Paragrafen, Artikel, Klauseln) – für Gesetze, Verträge und Satzungen.

Alternativ laden Sie eine eigene Konfigurationsdatei (YAML) hoch, die nur für diese Wissenssammlung gilt. Eine Vorlage zum Herunterladen hilft beim Einstieg.

hinweis

Ändern Sie die Verarbeitung einer Sammlung, die bereits Dateien enthält, betrifft dies zunächst nur neu hinzugefügte Dateien. BasePeak.AI bietet daher an, alle vorhandenen Dateien neu einzulesen, damit die neue Einstellung überall greift. Sammlungen, die Sie nicht ändern, funktionieren unverändert weiter.

Wissensquellen​

Im Bereich Wissensquellen binden Sie externe Datenquellen an, die automatisch synchronisiert werden. Klicken Sie auf Quelle hinzufügen, um eine Quelle anzulegen, und wählen Sie den Quellentyp aus:

TypBeschreibung
WebseiteCrawlen einer oder mehrerer URLs
OneDriveGeteilte OneDrive-Links
NotionNotion-Arbeitsbereich
NextcloudNextcloud-Instanz
SMB / NetzwerkfreigabeNetzwerkfreigabe (SMB)
WebDAVWebDAV-Server
S3 / ObjektspeicherS3-kompatibler Objektspeicher
SFTPSFTP-Server
Ratsinformationssystem (RIS)Kommunales Ratsinformationssystem
Landesrecht (NRW)Landesrecht eines Bundeslands (aktuell Nordrhein-Westfalen) von recht.nrw.de

Je nach Typ geben Sie die nötigen Verbindungsdaten und gegebenenfalls Zugangsdaten ein. Optional legen Sie einen Synchronisierungsplan fest (z. B. Stündlich, Täglich oder ein eigener Cron-Ausdruck) und aktivieren Dateien automatisch genehmigen.

Bei Landesrecht (NRW) wählen Sie zunächst das Bundesland (aktuell Nordrhein-Westfalen) und suchen anschließend in einem durchsuchbaren Katalog die Gesetze, Rechtsverordnungen und Verwaltungsvorschriften aus, die in die Wissenssammlung übernommen werden sollen.

hinweis

Der Inhalt stammt von recht.nrw.de (SGV.NRW) und ist eine nicht-amtliche, konsolidierte Fassung.

Jede Quelle zeigt ein Statusabzeichen an:

StatusBedeutung
AusstehendSynchronisierung steht noch aus
Wird synchronisiertSynchronisierung läuft gerade
SynchronisiertQuelle wurde erfolgreich übernommen
FehlerSynchronisierung fehlgeschlagen (Details über Fehler anzeigen)

Solange Quellen synchronisiert werden, aktualisiert die Seite den Status automatisch. Über die Aktionen einer Quelle können Sie sie Jetzt synchronisieren, ihre Dateien anzeigen, sie bearbeiten oder Quelle entfernen.

Dateitypen​

Bei Quellen, die Dateien einlesen (Webseite, OneDrive, Nextcloud, SMB, WebDAV, S3, SFTP), legen Sie unter Dateitypen fest, welche Dateien überhaupt heruntergeladen werden. Standardmäßig ist nur Dokumente aktiv: PDF, Word, OpenDocument, PowerPoint, Text, HTML, Markdown, CSV, JSON, Notebooks sowie E-Mails (.msg, .eml). Tabellen, Bilder, Archive, Audio & Video oder Alle Dateien schalten Sie pro Quelle zu.

Unter Erweiterte Muster ergänzen Sie einzelne Dateien oder Ordner, ein Muster pro Zeile:

  • Zusätzlich aufnehmen – z. B. *.dwg lädt auch Zeichnungen herunter.
  • Immer überspringen – z. B. Archiv/ lässt diesen Ordner samt Inhalt aus. Hat Vorrang vor „Zusätzlich aufnehmen“.

Groß- und Kleinschreibung spielt keine Rolle. * steht für beliebige Zeichen innerhalb eines Namens, ** für beliebig viele Ordner. Ein Muster ohne / gilt für Datei- und Ordnernamen in jedem Ordner, ein führendes / bezieht sich auf das konfigurierte Quellverzeichnis, ein abschließendes / meint einen Ordner mit allem darunter. Versteckte Dateien und Ordner sowie temporäre Dateien (z. B. ~$…, *.tmp, Thumbs.db) werden immer übersprungen. Dateien ohne Dateiendung werden übersprungen, es sei denn, Alle Dateien ist aktiv oder ein Muster unter Zusätzlich aufnehmen passt (z. B. LICENSE).

Maximale Dateigröße begrenzt einzelne Dateien (1–1024 MB); leer gelassen gilt der Standard Ihrer Instanz. Zu große Dateien behalten ihre bisherige Kopie.

Was eine Synchronisierung übersprungen hat, zeigt Dateien anzeigen mit dem Grund an. Von dort schalten Sie einen vorgeschlagenen Dateityp mit einem Klick zu; die Liste Zu groß nennt Dateien über der Größengrenze.

Wissensdateien​

Im Bereich Wissensdateien laden Sie Dokumente direkt hoch. Klicken Sie auf Dateien hochladen und wählen Sie eine oder mehrere Dateien aus. Unterstützt werden unter anderem folgende Formate:

PDF, TXT, DOC, DOCX, MD, HTML, ODT, RTF, CSV, IPYNB, JSON, PPTX, PPT und PAGES.

Nach dem Hochladen durchläuft jede Datei die Verarbeitung (Einlesen und Einbetten). Der Verarbeitungszustand wird angezeigt:

ZustandBedeutung
Wartet auf FreigabeDatei wurde erkannt, aber noch nicht verarbeitet
In BearbeitungDatei wird gerade verarbeitet
VerarbeitetDatei ist verarbeitet und durchsuchbar
Nicht unterstütztDateityp wird nicht unterstützt
FehlerVerarbeitung fehlgeschlagen

Die Seite aktualisiert ausstehende Dateien automatisch, bis die Verarbeitung abgeschlossen ist. Einzelne Dateien lassen sich über die jeweilige Aktion Löschen dauerhaft aus dem Wissensbestand entfernen.

Exportieren und Importieren​

Mit Exportieren erstellen Sie aus einer Wissenssammlung ein Paket (.zip), das wahlweise das Manifest der Wissensdatenbank (Name und Beschreibung) und die Originaldateien enthält. Erstellte Pakete erscheinen unter Letzte Exporte mit Phase, Größe und Ablaufzeitpunkt und stehen dort zum Herunterladen bereit.

Über die Schaltfläche Importieren in der Listenansicht spielen Sie ein zuvor exportiertes Paket wieder ein. Dabei können Sie Name überschreiben und Beschreibung überschreiben oder das Manifest aus dem Paket übernehmen.

Eine Wissenssammlung löschen​

Sie löschen eine Sammlung über Wissenssammlung löschen (auf der Detailseite oder über das Aktionsmenü in der Liste). Vor dem Löschen prüft BasePeak.AI, ob die Sammlung noch verwendet wird.

hinweis

Eine Wissenssammlung, die noch von Agenten oder Threads verwendet wird, kann nicht gelöscht werden. Es erscheint der Hinweis Diese Wissenssammlung wird derzeit verwendet und kann nicht gelöscht werden. Beim Mehrfachlöschen werden verwendete Sammlungen automatisch übersprungen.

Remote-Wissenssammlungen​

Neben eigenen Wissenssammlungen kann BasePeak.AI auch Wissenssammlungen einbinden, die auf einem fremden Knowledge Server liegen — etwa bei einem Partner, der Ihnen Zugriff auf eine ausgewählte Sammlung verkauft, oder einem eigenen On-Premises-Server, der eine gehostete Instanz beliefert. Die Dokumente verbleiben dabei vollständig auf dem fremden Server; BasePeak.AI ruft bei jeder Anfrage live darauf zu und speichert nichts davon lokal.

Einen Server verbinden​

  1. Klicken Sie in der Wissenssammlungen-Liste (oder auf der Bearbeitungsseite eines Agenten) auf Remote-Wissenssammlung hinzufügen.
  2. Registrieren Sie bei der ersten Verbindung einen neuen Server: Server-URL und den erhaltenen API-Schlüssel. Die Adresse muss mit https:// beginnen — eine unverschlüsselte Verbindung wird abgelehnt, damit der Schlüssel nie im Klartext übertragen wird. Ist bereits mindestens ein Server registriert, wählen Sie zunächst zwischen einem vorhandenen Server und Neuen Server registrieren.
  3. BasePeak.AI prüft die Verbindung und zeigt anschließend die Datensätze, die dieser Schlüssel freigibt, mit Name, Beschreibung und Dateianzahl.
  4. Wählen Sie einen oder mehrere Datensätze aus und bestätigen Sie über die Schaltfläche am Fuß des Dialogs, die zusätzlich die Anzahl der ausgewählten Datensätze anzeigt. Für jeden ausgewählten Datensatz entsteht eine eigene Wissenssammlung.

Die so angelegten Sammlungen erscheinen in der normalen Wissenssammlungen-Liste, erkennbar an einer Spalte mit dem Anzeigenamen des Servers. Name und Datenbeschreibung werden zunächst vom fremden Server übernommen, lassen sich hier aber wie gewohnt anpassen. Das Verknüpfen mit einem Agenten läuft über denselben Mechanismus wie bei lokalen Sammlungen.

Was eine Remote-Sammlung nicht kann​

Eine Remote-Wissenssammlung ist bewusst schreibgeschützt: Es gibt keinen Datei-Upload, keine Wissensquellen, keinen Export/Import und kein eigenes Verarbeitungsprofil — der fremde Server entscheidet mit seinem eigenen Ablauf, wie Dokumente eingelesen und durchsucht werden. Antworten von Agenten nennen zu Treffern aus einer Remote-Sammlung Dateinamen und Fundstelle wie bei einer lokalen Sammlung; ein anklickbarer Link auf das Originaldokument steht in dieser Version jedoch noch nicht zur Verfügung.

Wenn ein Server nicht erreichbar ist​

Ist ein verbundener Server vorübergehend nicht erreichbar, der Schlüssel abgelaufen oder widerrufen, oder eine Anfrage rate-limitiert, beantwortet der Agent die Frage trotzdem — mit dem, was aus den übrigen Sammlungen verfügbar ist — und weist in der Wissenssammlungen-Liste per Fehlertext auf die betroffene Sammlung hin. Ein einzelner nicht erreichbarer Server lässt eine Unterhaltung nie vollständig fehlschlagen. BasePeak.AI prüft die Erreichbarkeit regelmäßig automatisch im Hintergrund; über Erneut versuchen lässt sich das auch von Hand anstoßen.

Server verwalten​

Über Remote-Server verwalten öffnen Sie eine Übersicht aller registrierten Server mit Erreichbarkeit, Schlüssel-ID, Zeitpunkt der letzten Prüfung und Anzahl der Datensätze. Von dort aus können Sie:

  • die Verbindung über Erneut versuchen neu prüfen,
  • den Schlüssel über Schlüssel rotieren austauschen, falls der fremde Betreiber einen neuen Schlüssel ausgestellt hat,
  • den Server löschen.

Ein Server lässt sich nicht löschen, solange noch Wissenssammlungen auf ihn verweisen — BasePeak.AI verweigert das mit einem Hinweis auf die betroffenen Sammlungen. Entfernen oder verknüpfen Sie diese zuerst um, bevor Sie den Server entfernen.

Die Übersicht zeigt außerdem, ob der hinterlegte Schlüssel das Herunterladen der Originaldokumente erlaubt — das entscheidet der Betreiber des fremden Servers beim Ausstellen des Schlüssels. Diese Berechtigung steuert derzeit nur den Datenzugriff auf dem Server selbst; ein anklickbarer Link auf das Originaldokument in einem Chat-Zitat steht in dieser Version noch nicht zur Verfügung.

Hinweise​

  • Das Embedding-Modell wird beim Erstellen festgelegt und stammt aus den konfigurierten Modellanbietern.
  • Quellen mit Zugangsdaten (SMB, WebDAV, SFTP, S3) bleiben im Status Ausstehend, bis ein gültiges Passwort hinterlegt ist.
  • Beim Löschen einer Sammlung gehen alle enthaltenen Dateien und Quellen unwiderruflich verloren.