What goes in, what comes out
IN
Sendepläne, VOD-Kataloge, Bilder und Inhalte aus Tausenden Quellen, in welchem Format auch immer sie geliefert werden.
OUT
saubere, normalisierte, deduplizierte Daten, weitergeleitet an den richtigen Sender oder Titel und bereit für Harmonization & Enrichment, mit bereits erkannten Änderungen.
Die Ingest-Pipeline
Eingehende Daten durchlaufen eine feste Abfolge, größtenteils automatisch, mit Redakteuren nur für Ausnahmefälle:
1. Aus jeder Quelle erfassen. Die Plattform überwacht kontinuierlich und zieht Daten von überall dort, wo sie liegen:
- Sender-Portale und Websites
- FTP/SFTP-Server
- Sender-APIs (REST und SOAP)
- E-Mail-Postfächer
- Cloud-Speicher (Amazon S3, Google Cloud Storage, Azure Blob)
2. Klassifizieren und weiterleiten. Jede eingehende Datei wird nach Typ identifiziert (ein vollständiger Wochenplan, ein inkrementelles Update, eine Beschreibungsdatei, ein Bildpaket) und an den richtigen Sender weitergeleitet. Eine menschenlesbare Vorschau (XML, CSV, DOC/DOCX, PDF) ist verfügbar, und der Import kann pro Sender vollautomatisch oder mit Freigabepflicht eingestellt werden.
3. Importieren und mappen. Ein eigener Importer für jede Quelle und jedes Format wandelt die Eingabe in eine einheitliche interne Struktur um, wendet senderspezifisches Feld-Mapping an und führt eine erste QA-Prüfung durch: Pflichtfelder vorhanden, chronologische Konsistenz (keine überlappenden Sendungen), Kodierung und Format korrigiert.
4. Text analysieren. Natural-Language-Processing extrahiert, was in Freitextbeschreibungen verborgen ist, etwa Gastnamen und Episodennummern, ergänzt fehlende Daten und ordnet sie den richtigen Feldern zu.
5. Regeln anwenden und verknüpfen. Eine Business-Rules-Engine bereinigt systematische Quellfehler automatisch (Kleinschreibung bei Titeln, unerwünschte Präfixe, falsch platzierte Daten) und verknüpft anschließend jeden Eintrag mit dem richtigen Datensatz im Content-Archiv.
Nur echte Unterschiede erkennen
Wenn eine Quelle ein Update sendet, vergleicht die Plattform es mit dem aktuellen Stand und markiert genau das, was sich unterscheidet, Feld für Feld, in einer Gegenüberstellung. Vertrauenswürdige, risikoarme Änderungen können automatisch übernommen werden; alles Ungewöhnliche oder Mehrdeutige wird einem Redakteur zur Bestätigung, Korrektur oder Ablehnung vorgelegt, mit einem vollständigen Protokoll jeder Entscheidung.
Ein zentrales Prinzip hält nachgelagerte Systeme effizient: Eine Änderung wird nur weitergegeben, wenn sie tatsächlich die Daten betrifft, die Sie erhalten, nicht bei jeder internen Bearbeitung. Sie werden nicht mit Updates überflutet, die auf Ihrer Seite nichts verändern.
Mehr als 2.500 Formate normalisieren
Quellen liefern Daten in vielen verschiedenen Formen: XML, JSON, CSV, Tabellenkalkulationen, PDFs, senderspezifische Formate und mehr, insgesamt über 2.500 Eingabeformate. Jedes wird in ein einziges internes Format umgewandelt und den richtigen Feldern zugeordnet, sodass der Rest der Plattform überall eine einheitliche Struktur sieht, unabhängig von der Herkunft der Daten. Das erlaubt es Media Press, eine neue Quelle zu übernehmen, ohne alles Nachgelagerte zu stören.
Products that live here
Loslegen
Die Data Ingest in Aktion sehen
Demo buchen um zu sehen, wie Data Ingest Ihre eigenen Quellen verarbeitet.