Shorts Pipeline
영상 업로드, 클립 선택, TTS 대본, 음성, 정밀 자막, 피사체 추적, FFmpeg 합성을 한 프로젝트 흐름으로 묶은 개인 제작 도구입니다. 최신 버전은 단어 단위 자막 생성과 세로 크롭용 피사체 자동 추적을 합성 단계에 붙였습니다.

Repository는 private으로 운영 중입니다. 공개 페이지에는 민감정보, 저작권 이슈, 재사용 가능한 세부 구현을 노출하지 않습니다.
Snapshot
| 구분 | 내용 |
|---|---|
| 상태 | In progress, private repository |
| 문제 | 숏폼 제작 과정에서 파일 관리, 대본 생성, 자막 처리, 렌더링 단계가 분리되어 반복 비용이 큼 |
| 접근 | 프로젝트 단위로 원본, 클립, 대본, 자막, 피사체 추적 좌표, 출력물을 관리하고 LLM API와 FFmpeg 처리를 연결 |
| 기술 | FastAPI, Python, LLM API, Whisper, FFmpeg, yt-dlp, Docker |
| 실행 | Docker 기반 실행과 로컬 업로드/출력 디렉터리 분리를 고려 |
Latest Console




샘플 제작 데이터
공개용 샘플값입니다. 실제 화면 구조와 처리 상태를 설명하기 위해 만든 예시입니다.
원본 영상에서 필요한 구간을 고르고, 클립별 시작/종료 시각과 메모를 프로젝트 상태로 저장합니다.
Whisper 단어 시간과 TTS 대본을 맞춰 자막 단위를 만들고, 합성 전 수정값을 바로 저장합니다.
9:16 세로 크롭, 음량, 자막 스타일, 피사체 추적 좌표를 확인한 뒤 최종 FFmpeg 합성으로 넘깁니다.
탭별 화면 설명
프로젝트 목록
작업 중인 제작 건을 모아 보는 첫 화면입니다. 클립 수, 저장 시각, 편집 상태를 먼저 보여줘 중단했던 작업을 다시 찾기 쉽게 했습니다.
- 샘플 상태: 편집 중 2건, 렌더링 완료 1건
- 확인 포인트: 작업명, 마지막 수정 시각, 다음으로 들어갈 탭
소스 영상과 클립 편집
원본 영상, AI 분석 메모, 선택 클립을 같은 화면에 둡니다. 데스크톱에서는 비교하면서 조정하고, 모바일에서는 한 단계씩 내려가며 확인합니다.
- 샘플 상태: 클립 6개 중 4개 활성
- 확인 포인트: 컷 순서, 구간 메모, 저장 액션
대본 생성과 버전 선택
클립 길이에 맞춰 여러 톤의 대본을 만들고, 선택한 대본을 편집합니다. 이후 음성 생성과 자막 타임라인의 기준이 됩니다.
- 샘플 상태: 담백한 설명형, 빠른 리뷰형, 질문형 버전
- 확인 포인트: 길이, 톤, 클립별 문장 배치
TTS 음성과 업로드
생성한 대본을 음성으로 만들거나 외부에서 만든 음성을 올립니다. 합성 단계에서 음성 파일과 자막 타이밍이 맞는지 다시 확인합니다.
- 샘플 상태: TTS 음성 1개 연결
- 확인 포인트: 음성 선택, 품질 옵션, 업로드 상태
단어 단위 정밀 자막
영상 음성 또는 TTS 대본을 기준으로 자막을 생성합니다. 너무 긴 문장은 끊고, 빠르게 지나가는 단어는 합성 전에 수정할 수 있게 했습니다.
- 샘플 상태: 자막 8줄, 스타일 수정 가능
- 확인 포인트: 시작/종료 시간, 줄바꿈, 강조 색상
피사체 추적과 최종 합성
세로 영상에서 인물이 화면 밖으로 밀리지 않도록 crop 위치를 추적합니다. 미리보기 결과를 확인한 뒤 같은 좌표를 최종 합성에 사용합니다.
- 샘플 상태: subject tracking 완료, final compose 대기
- 확인 포인트: crop 비율, 추적 부드러움, 렌더링 결과
Recent Build Notes
Precise captions Whisper 단어 시간, TTS 대본, 편집 완료 타임라인을 맞춰 자막 항목을 생성하고 수정 내용을 즉시 저장합니다.
Subject tracking AI가 프레임 샘플에서 주 피사체 좌표를 잡고, FFmpeg crop filter가 시간에 따라 위치를 보간합니다.
AI edit plans 여러 편집안을 만들고, 무음 구간과 제목/미리보기 품질을 합성 전에 점검하는 흐름을 강화했습니다.
What It Does
- 제작 작업을 프로젝트 단위로 만들고 상태를 관리합니다.
- 업로드 파일과 출력물을 분리해 작업 단계를 추적합니다.
- 데스크톱과 모바일에서 같은 제작 단계를 이어서 볼 수 있는 탭형 UI를 제공합니다.
- AI 편집안, 스마트 무음 정리, TTS 대본 생성, TTS 음성 생성/업로드, 정밀 자막, 피사체 추적, FFmpeg 합성 흐름을 파이프라인에 포함합니다.
- Docker 실행 환경으로 로컬 실행 조건을 일정하게 맞춥니다.
데스크톱/모바일 화면




단계별 탭 화면



