Das Rohmaterial aufnehmen
Transkribieren und die Cuts finden
Die Stimme bereinigen, die Musik legen
Die Formate zusammensetzen
Prüfen vor der Veröffentlichung
Kontext & Problem
Ein Health- und E-Learning-Unternehmen nimmt seine Kurse und Inhalte so auf, wie die meisten Experten es tun: Aufnahme starten, eine Stunde reden, stoppen. Was dabei rauskommt, ist ehrlich und nützlich und völlig unveröffentlichbar: voller Neustarts, Funkstille und der zehn Sekunden, bevor der Punkt wirklich sitzt.
Daraus Content zu machen heißt: Ein Editor setzt sich mit der Rohdatei hin und arbeitet sie von Hand durch, dann noch einmal für die mittellange Version, dann noch einmal für die Shorts. Jede Aufnahme kostet Schnittrunden, also ist die Zahl der Aufnahmen, die je veröffentlicht werden, das, was der Editor diese Woche schafft. Der Engpass ist nicht die Expertise, es ist der Zusammenbau.
Also habe ich den Zusammenbau als Pipeline gebaut. Rohmaterial geht rein, fertige Formate kommen raus, und die menschlichen Stunden fließen in die Prüfung dessen, was veröffentlicht wird, statt ins Scrubben einer Timeline.
So funktioniert es
Das Diagramm oben zeigt den Ablauf; hier steht, was jeder Schritt tut. Deterministisch bleibt deterministisch, und ein Agent taucht nur da auf, wo Judgement, Sprache oder Synthese wirklich gebraucht werden.
- 01Deterministisch
Das Rohmaterial aufnehmen
Die ungeschnittene Aufnahme wird abgeholt, normalisiert und ihr Audio extrahiert. Der Ingest läuft jedes Mal gleich, damit der Rest der Pipeline von einer bekannten Form ausgehen kann, statt zu raten, was da von der Kamera kam.
- 02Agent
Transkribieren und die Cuts finden
Die Aufnahme wird transkribiert, dann liest ein Modell das Transkript und entscheidet, was bleibt: welche Takes sitzen, wo der Punkt gemacht wird, was ein Neustart oder ein Abschweifen ist. Zu entscheiden, was es wert ist, behalten zu werden, ist Urteilsvermögen in Sprache, und genau da gehört ein Modell hin.
- 03Deterministisch
Die Stimme bereinigen, die Musik legen
Die ausgewählten Cuts werden zusammengesetzt, die Stimmspur wird bereinigt und gepegelt, und Musik wird darunter gelegt. Das ist Signalverarbeitung gegen feste Einstellungen, also bleibt es deterministisch: Dieselbe Aufnahme klingt am Ende immer gleich.
- 04Agent
Die Formate zusammensetzen
Aus derselben Quelle werden ein Long-Form-Edit, ein Mid-Form-Cut, Short-Form-Clips und ein Trailer. Die Längen und die Verpackung sind Regeln; auszuwählen, welcher Moment ein Short trägt oder einen Trailer eröffnet, ist Urteilsvermögen, also sind die beiden getrennt.
- 05Deterministisch
Prüfen vor der Veröffentlichung
Jedes fertige Format landet in einem Review-Set. Nichts erreicht einen Channel, bevor ein Mensch es angeschaut und freigegeben hat.
Checkpoints & Logging
Der Gate sitzt bewusst vor der Veröffentlichung. Content geht unter dem Namen des Unternehmens raus und spricht Menschen auf ihre Gesundheit an, also produziert die Pipeline und ein Mensch gibt frei. Nichts wird ohne menschliche Prüfung veröffentlicht.
Jeder Output ist auf seine Quelle zurückführbar: welche Aufnahme, welche Transkript-Segmente, welche Cut-Auswahl ihn produziert hat. Wenn ein Clip daneben liegt, siehst du den Moment, aus dem er stammt, statt die rohe Stunde noch einmal anzuschauen. Wenn ein Schritt fehlschlägt, eine schlechte Audiospur, ein Transkript, das leer zurückkommt, protokolliert der Run das und hält diese Aufnahme zurück, statt einen kaputten Cut in das Review-Set zu schieben.
Stack, und warum
Transkription plus ein Sprachmodell übernimmt die Cut-Auswahl, weil zu beurteilen, welcher Take sitzt und wo der Punkt gemacht wird, ein Leseproblem ist, kein Waveform-Problem. Alles hinter dieser Entscheidung, Schnitt, Audio-Bereinigung, Musik, das Rendern der Formate, ist eine ffmpeg-basierte deterministische Pipeline, damit eine zweimal verarbeitete Aufnahme identisch rauskommt statt subtil anders. Die Orchestrierung ist Python und FastAPI, weil die Arbeit langlaufend und dateilastig ist, was einen echten Job Runner will und kein Workflow-Tool, das auf eine Stunde Video wartet.
Ergebnisse
Eine Rohaufnahme produziert jetzt mehrere fertige Formate, Long, Mid, Short und einen Trailer, ohne manuelle Schnittrunde dazwischen.
Die ehrliche Einordnung: Der Gewinn ist kein magischer Qualitätssprung gegenüber einem guten menschlichen Editor, sondern dass das Output-Volumen nicht länger durch Editor-Stunden gedeckelt ist. Das Unternehmen kann veröffentlichen, was es aufnimmt, und der Review-Schritt hält einen Menschen in der Verantwortung dafür, was tatsächlich rausgeht.
Sitzt du auf Rohmaterial, das du nie veröffentlichst?
Wenn du mehr aufnimmst, als du schneiden kannst, ist das die Pipeline, die die Lücke schließt. Das Audit zeigt in 30 Minuten, wo sie sich in deinem Setup bezahlt macht.