Unterstützte Inhaltstypen
itellicoAI unterstützt vier Typen von Wissenseinträgen, die jeweils für unterschiedliche Inhaltsquellen und Anwendungsfälle konzipiert sind. Das Verständnis der Funktionsweise jedes Typs hilft dir, das richtige Format für deine Informationen zu wählen. Hinweise zur Organisation dieser Einträge findest du unter Wissensdatenbank-Architektur.Text-Items
Datei-Uploads
URL-Scraping
Website-Crawl
Text-Items
Was sind Text-Items?
Text-Items sind Inhalte, die du direkt in den itellicoAI-Wissensdatenbank-Editor eingibst. Sie sind der unkomplizierteste und zuverlässigste Inhaltstyp – sofort verfügbar ohne Verarbeitungsverzögerung.Wie du ein Text-Item hinzufügst
Zum Ordner navigieren
'Eintrag hinzufügen' klicken
'Textinhalt' wählen
Titel eingeben
Inhalt schreiben
- Überschriften für Abschnitte
- Aufzählungspunkte für Listen
- Nummern für Schrittfolgen
- Fettschrift für Hervorhebungen
'Eintrag erstellen' klicken
Best Practices
Für Retrieval strukturieren
Beschreibende Titel verwenden
Wann du Text-Items nutzen solltest
FAQs schreiben
FAQs schreiben
Richtlinien zusammenfassen
Richtlinien zusammenfassen
Abläufe dokumentieren
Abläufe dokumentieren
Schnellreferenz-Informationen
Schnellreferenz-Informationen
Einschränkungen
- Keine Dateianhänge möglich – Inhalt muss getippt oder eingefügt werden
- Große Inhaltsmengen lassen sich besser als Datei-Uploads verwalten
Datei-Upload-Items
Was sind Datei-Upload-Items?
Datei-Upload-Items ermöglichen das Hochladen bestehender Dokumente in verschiedenen Formaten. Das System extrahiert den Textinhalt und stellt ihn deinen Agenten zur Verfügung.Wie du ein Datei-Item hinzufügst
Zum Ordner navigieren
'Eintrag hinzufügen' klicken
'Datei hochladen' wählen
Titel eingeben
Datei hochladen
'Eintrag erstellen' klicken
Verarbeitungsdetails
Das System verwendet fortschrittliche Dokumentenanalyse, um Text aus hochgeladenen Dateien zu extrahieren:- Textextraktion – Bei textbasierten PDFs und Word-Dokumenten wird der Inhalt direkt extrahiert
- OCR (Optical Character Recognition) – Technologie, die Text aus gescannten Bildern liest – Die Plattform verarbeitet gescannte Dokumente und Bilder in PDFs mit OCR
- Chunking – Extrahierter Inhalt wird in Chunks für die Vektorindexierung aufgeteilt (Inhalt für semantische Suche vorbereiten), um Retrieval zu ermöglichen
- Formate: PDF, Word (.doc, .docx), Excel (.xlsx), Text (.txt, .log), Markdown (.md), CSV/TSV (Datenformate), JSON (Datenformate), YAML (.yaml, .yml) (Datenformate), XML (Datenformate)
- Größenlimit: maximal 10 MB
- Inhalt: Textbasierte Dokumente und gescannte Bilder (erweiterte Analyse verarbeitet die meisten Scans)
- Schutz: Kein Passwortschutz
Best Practices
Vor dem Upload optimieren
- Große Dateien komprimieren
- Unnötige Bilder entfernen
- Wenn möglich, textbasierte Dokumente verwenden
- Unter 5 MB halten für schnellere Verarbeitung
Extraktion testen
- Extrahierten Inhalt nach der Verarbeitung prüfen
- Auf Formatierungsprobleme achten
- Korrektheit kritischer Informationen verifizieren
- Bei schlechter Extraktion neu hochladen
Einschränkungen
- Maximale Dateigröße von 10 MB
- Passwortgeschützte Dateien können nicht verarbeitet werden
- Sehr schlechte Scans können unvollständigen oder ungenauen Text erzeugen
- Komplexe Layouts (mehrspaltig, aufwendige Tabellen) werden möglicherweise nicht perfekt extrahiert – extrahierten Inhalt prüfen und bei Bedarf in Text-Items umwandeln
Fehlerbehebung
Verarbeitung fehlgeschlagen
Verarbeitung fehlgeschlagen
- Datei überschreitet 10 MB
- Datei ist passwortgeschützt
- Datei ist beschädigt
- Sehr schlechte Qualität gescannter Bilder
- Datei komprimieren oder in kleinere Dateien aufteilen
- Passwortschutz entfernen
- Datei aus der Quelle neu exportieren
- Bei sehr schlechten Scans Inhalt in ein Text-Item kopieren
Inhalt falsch extrahiert
Inhalt falsch extrahiert
- Komplexe Layouts (mehrspaltiger Satz, Tabellen)
- Sehr schlechte Qualität gescannter Bilder
- Spezielle Schriftarten oder Zeichenkodierungen
- Formularfelder und interaktive Elemente
- Extrahierten Inhalt im Bearbeitungsmodus prüfen
- Als Text-Item mit korrekter Formatierung neu erstellen
- Dokumentenlayout vor dem Hochladen vereinfachen
- Als reines Textdokument exportieren
Verarbeitung dauert zu lang
Verarbeitung dauert zu lang
- 5–10 Minuten warten, bevor ein Fehler angenommen wird
- Dateigröße und Seitenanzahl prüfen
- Für große Dateien in mehrere Dateien aufteilen
- In Text konvertieren und als TEXT-Items hochladen
URL-Items
Was sind URL-Items?
URL-Items scrapen den Inhalt einer einzelnen Webseite und speichern ihn in deiner Wissensdatenbank. Das ist nützlich, um auf eine bestimmte Online-Dokumentationsseite, einen Hilfe-Artikel oder einen Blog-Beitrag zu verweisen.Wie du ein URL-Item hinzufügst
Zum Ordner navigieren
'Eintrag hinzufügen' klicken
'Webseite' wählen
Titel eingeben
Quell-URL eingeben
https:// einBeispiel:'Eintrag erstellen' klicken
Verarbeitungsdetails
Wenn du ein URL-Item hinzufügst, führt das System folgendes durch:- Abrufen der Seite unter der angegebenen URL
- Extrahieren des Haupttextinhalts, wobei Navigation, Werbung und Boilerplate entfernt werden
- Speichern des extrahierten Texts als Inhalt des Wissenseintrags
- Indexieren des Inhalts für die Vektorsuche, genau wie bei Text- und Datei-Items
Best Practices
Erreichbarkeit prüfen
- URL zuerst im Inkognito-Fenster öffnen
- Prüfen, ob kein Login erforderlich ist
- Sicherstellen, dass Inhalt ohne JavaScript sichtbar ist
- Sicherstellen, dass die Seite schnell lädt
Gescrapten Inhalt prüfen
- Inhalt nach dem Scraping prüfen
- Verifizieren, dass der richtige Inhalt erfasst wurde
- Auf Formatierungsprobleme achten
- Sicherstellen, dass kein Zusatzinhalt (Werbung, Seitenleisten) aufgenommen wurde
Einschränkungen
- Authentifizierung – Seiten mit Login-Anforderung können nicht gescrapt werden
- JavaScript-intensive Seiten – Single-Page-Applications und dynamisch geladener Inhalt werden möglicherweise nicht erfasst
- Bezahlschranken – Inhalt hinter Paywalls ist nicht zugänglich
- Kein automatisches Aktualisieren – Inhalt wird einmalig gescrapt; das Item muss neu erstellt werden, um es zu aktualisieren
- robots.txt (eine Datei, mit der Websites den automatisierten Zugriff steuern) – Websites, die Scraping blockieren, schlagen fehl
Fehlerbehebung
Scraping fehlgeschlagen
Scraping fehlgeschlagen
- Seite erfordert Login/Authentifizierung
- URL ist falsch oder defekt
- Inhalt wird per JavaScript geladen
- Website blockiert Scraping (robots.txt)
- Seite existiert nicht (404)
- Prüfen, ob URL öffentlich zugänglich ist
- URL im Inkognito-Browserfenster testen
- Prüfen, ob URL vollständig und korrekt ist
- Inhalt manuell in Text-Item kopieren
- Seite stattdessen als PDF exportieren und hochladen
Inhalt unvollständig oder falsch
Inhalt unvollständig oder falsch
- JavaScript-gerenderter Inhalt nicht erfasst
- Dynamisch geladener Inhalt
- Mehrere Tabs/Abschnitte auf der Seite
- Kommentare oder Seitenleisten statt Hauptinhalt gescrapt
- Gescrapten Inhalt im Bearbeitungsmodus prüfen
- Direkte URL zu einem bestimmten Inhaltsabschnitt verwenden
- Gewünschten Inhalt in Text-Item kopieren
- Seite als PDF exportieren und stattdessen hochladen
Inhalt veraltet
Inhalt veraltet
- URL-Item löschen und neu erstellen
- Oder aktuellen Inhalt in ein Text-Item kopieren für manuelle Aktualisierungen
- Manuelle Text-Items, die du regelmäßig aktualisierst
- PDF-Exporte, die du regelmäßig aktualisierst
Website-Crawl-Items
Was sind Website-Crawl-Items?
Website-Crawl-Items entdecken mehrere öffentliche Seiten einer Website und importieren die von dir ausgewählten Seiten. Verwende diesen Typ, wenn eine Wissensquelle mehrere URLs umfasst, wie etwa ein Help Center oder eine Dokumentations-Website.Wie du einen Website-Crawl hinzufügst
Zum Ordner navigieren
'Eintrag hinzufügen' klicken
'Website-Crawl' wählen
Website-URL eingeben
Seiten auswählen
Crawl-Einstellungen
Öffne Erweiterte Optionen vor der Entdeckung, um den Crawl-Umfang und das Aktualisierungsverhalten zu steuern.Einschränkungen
- Öffentliche Seiten funktionieren am besten; authentifizierungspflichtige Seiten werden nicht unterstützt
- JavaScript-intensive Seiten werden möglicherweise nicht sauber extrahiert
- Crawls zählen zum Wissensdatenbank-Limit für URL-/Website-Items
- Importierte Seiten müssen zunächst die Inhaltsverarbeitung und Vektorindexierung erfolgreich abschließen, bevor RAG sie abrufen kann
Verarbeitungs-Status-Flow
Wissenseinträge durchlaufen zwei separate Verarbeitungs-Pipelines:- Inhaltsverarbeitung – Text aus Dateien, URLs und Website-Seiten extrahieren
- Vektorindexierung – Inhalt für RAG (semantische Suche) vorbereiten