영상 하나 올리려고 자막을 손으로 찍어본 사람은 안다. 10분짜리 영상에 자막 다는 데 한두 시간이 그냥 날아간다. AI 자막 생성 프로그램은 이 과정을 몇 분으로 줄여주는데, 문제는 도구마다 한국어를 알아듣는 수준 차이가 꽤 크다는 점이다.
영어는 웬만하면 다 잘 받아쓴다. 한국어는 얘기가 다르다. 조사 붙은 말, 빠른 발음, 전문 용어가 섞이면 도구별로 결과가 확 갈린다. 그래서 이 글은 ‘어떤 게 제일 유명한가’가 아니라 ‘한국어 영상에 뭘 써야 후처리가 덜 나오는가’를 기준으로 정리했다.
핵심 요약
- 한국어 받아쓰기 정확도는 대체로 Whisper 기반 엔진(전용 도구·클로바노트 등)이 앞선다. 캡컷은 편하지만 긴 문장에서 오탈자가 는다.
- 자막은 받아쓰기만이 아니라 타임코드 분할, 줄바꿈, 편집 자유도까지 봐야 한다. SRT 내보내기가 되는지 꼭 확인.
- 무료로 빠르게 끝낼 거면 캡컷, 정확도가 중요하면 Whisper 계열, 번역 자막까지 필요하면 별도 조합이 낫다.
- 어떤 도구도 100%는 아니다. 고유명사와 숫자는 사람이 반드시 검수해야 한다.
자막 도구를 고를 때 실제로 봐야 하는 것
대부분의 비교 글이 ‘정확도 높음’ 한 줄로 끝낸다. 그런데 자막 작업에서 시간을 잡아먹는 건 받아쓰기 자체보다 그 뒤의 손질이다. 아래 네 가지를 나눠서 봐야 도구 선택이 안 흔들린다.
1. 한국어 인식 정확도
같은 영상을 넣어도 도구마다 ‘됐어요’를 ‘됬어요’로, ‘스크립트’를 ‘스크립’으로 흘려버린다. 판단 기준은 단순하다. 1~2분짜리 실제 내 영상(말이 빠른 구간이 있는 걸로)을 넣어보고, 수정 클릭이 몇 번 필요한지 세보면 된다. 문장 열 개에 두세 개 이상 손봐야 하면 그 도구는 시간 절약이 안 된다.
2. 타임코드와 줄바꿈
정확히 받아썼어도 자막이 한 화면에 세 줄씩 뜨거나, 말과 0.5초씩 어긋나면 못 쓴다. 좋은 도구는 문장을 자동으로 두 줄 이내로 끊고, 발화 타이밍에 맞춰 세그먼트를 나눈다. 캡컷은 이 부분이 자동이라 편하고, 순수 받아쓰기 API는 이걸 직접 손봐야 하는 경우가 많다.
3. 편집·내보내기 자유도
완성한 자막을 영상 편집기로 가져가려면 SRT나 VTT 파일로 뽑을 수 있어야 한다. 영상 안에 자막을 박아버리는(하드섭) 방식만 지원하면 나중에 수정이 지옥이다. 유튜브에 CC 자막으로 올리거나 다른 편집기에서 다시 쓸 계획이라면 파일 내보내기 지원 여부가 사실상 1순위 조건이다.
4. 번역 자막이 필요한가
한→영, 한→일 자막까지 뽑을 거면 얘기가 복잡해진다. 받아쓰기 정확도와 번역 품질은 별개다. 받아쓰기가 틀리면 번역도 같이 틀리니까, 이 경우엔 받아쓰기 결과를 먼저 검수하고 번역을 돌리는 2단계 흐름이 안전하다.
주요 AI 자막 도구 비교
| 도구 | 이런 사람에게 | 강점 | 아쉬운 점 | 요금 모델 |
|---|---|---|---|---|
| 캡컷(CapCut) | SNS·숏폼을 빠르게 편집하는 사람 | 자막·편집·디자인이 한 앱에서 끝남, 자동 스타일링 | 긴 문장 한국어 오탈자, 웹/앱 기능 차이 | 프리미엄 |
| Whisper 기반 전용 도구 | 정확도가 가장 중요한 사람 | 한국어 받아쓰기 품질 우수, SRT 내보내기 | 편집 UI가 투박, 일부는 설치·세팅 필요 | 무료(오픈소스)~유료 서비스 |
| 클로바노트 | 회의·강의 등 말이 긴 콘텐츠 | 화자 분리, 한국어 특화, 요약 기능 | 영상 자막용 타임코드 편집은 약함 | 프리미엄 |
| Veed·Descript류 | 번역·다국어 자막까지 필요한 사람 | 번역 자막, 텍스트로 영상 편집 | 한국어 정확도 편차, 무료 사용 제한 | 프리미엄 |
표를 한 줄로 요약하면 이렇다. 손쉬움은 캡컷, 받아쓰기 품질은 Whisper 계열, 회의체 긴 음성은 클로바노트다. 어느 하나가 전부 이기는 구조가 아니다.
상황별로 뭘 고를까
숏폼 위주로 하루에 여러 개 찍어 올린다면 캡컷 하나로 끝내는 게 합리적이다. 자막 뽑고 폰트·색·애니메이션까지 그 자리에서 입힌다. 정확도는 조금 양보하되 검수를 빠르게 훑는 방식이다.
강의나 인터뷰처럼 말이 많고 정확도가 중요한 영상이라면, Whisper 기반 도구로 받아쓰기를 먼저 뽑고 SRT로 내보낸 뒤 편집기에서 얹는 흐름이 낫다. 손이 한 번 더 가지만 결과물의 신뢰도가 다르다.
해외 시청자용 번역 자막이 목적이라면, 받아쓰기 정확도가 좋은 도구로 원문 자막을 확정한 다음 번역 기능이 강한 서비스로 넘기는 걸 권한다. 한 도구에서 받아쓰기와 번역을 동시에 맡기면 오류가 곱해진다.
실제 작업 순서
- 1~2분짜리 테스트 영상으로 후보 도구 두세 개를 돌려본다. 여기서 수정 횟수가 가장 적은 걸 남긴다. (실패 신호: 문장의 절반 이상을 다시 써야 하면 탈락)
- 선택한 도구로 전체 영상을 받아쓰기한다.
- 고유명사, 숫자, 영어 단어를 우선 검수한다. AI가 가장 자주 틀리는 지점이다.
- 자막이 한 화면에 두 줄을 넘지 않는지, 말과 타이밍이 맞는지 확인한다.
- SRT로 내보내거나, 영상에 얹어 최종 출력한다. (실패 신호: 하드섭만 되고 파일이 안 뽑히면 재편집이 불가능하니 이 단계 전에 확인)
자주 하는 실수
가장 흔한 게 검수를 건너뛰는 것이다. AI 자막은 그럴듯하게 틀린다. 문법은 맞는데 사람 이름이 바뀌어 있거나, 숫자가 하나 밀려 있다. 화면에 잘못된 자막이 박히면 신뢰도가 확 떨어지니 최소한 고유명사와 수치는 눈으로 확인해야 한다.
두 번째는 도구 하나에 모든 걸 맡기려는 태도다. 받아쓰기가 좋은 도구가 편집 UI까지 좋은 경우는 드물다. ‘받아쓰기 도구 + 편집기’로 나누면 오히려 전체 시간이 줄어드는 경우가 많다.
FAQ
무료로 쓸 수 있는 AI 자막 생성 프로그램이 있나요?
있다. Whisper는 오픈소스라 직접 돌리면 무료고, 클로바노트나 캡컷도 무료 구간이 있다. 다만 무료 플랜은 처리 시간이나 내보내기 형식에 제한이 걸리는 경우가 많으니, 긴 영상을 자주 다룬다면 유료가 결국 시간 대비 이득이다.
한국어 받아쓰기가 가장 정확한 건 뭔가요?
단정하긴 어렵지만, 경험상 Whisper 기반 엔진 계열이 한국어 문장을 가장 안정적으로 받아쓴다. 클로바노트도 한국어 특화라 회의·강의체에서 강하다. 결국 본인 영상 톤(발음 속도, 전문 용어 비중)에 따라 달라지므로 직접 테스트가 답이다.
자막 파일(SRT)을 유튜브에 올리려면 어떻게 하나요?
도구에서 SRT로 내보낸 뒤, 유튜브 스튜디오의 해당 영상 자막 메뉴에서 파일을 업로드하면 된다. 이렇게 하면 시청자가 CC 자막을 켜고 끌 수 있어서, 영상에 박아넣는 방식보다 접근성과 검색 노출에 유리하다.
영어 영상 번역 자막도 AI로 되나요?
된다. 다만 받아쓰기와 번역을 분리해서 검수하는 걸 권한다. 원문을 먼저 확정하고 번역을 돌려야 오류가 누적되지 않는다. 자동 번역은 문맥이 약한 문장에서 어색해지므로 최종본은 사람이 다듬는 게 좋다.
캡컷 자막이 자꾸 틀리는데 정확도를 올릴 방법이 있나요?
녹음 환경을 먼저 손보는 게 효과가 크다. 배경 소음이 적고 발음이 또렷하면 인식률이 눈에 띄게 오른다. 그래도 오탈자가 많다면 캡컷으로 초안만 뽑고, 정확도가 필요한 부분은 Whisper 계열로 재작업하는 조합을 고려해볼 만하다.
정답은 하나가 아니다. 자기 영상 유형에 맞춰 한두 개만 테스트해보면 금방 답이 나온다. 중요한 건 도구 이름이 아니라, 받아쓰기 뒤 검수를 습관으로 넣는 것이다.
관련 글

답글 남기기