用 AI 把影片整理成筆記與文章
2026-07-22
看影片吸收資訊的效率其實很差:重點散在幾十分鐘裡,看完常常只記得結論。 我現在的做法是先把影片變成逐字稿,再拿去整理。 這篇把每一步的指令寫清楚,照抄就能動;整理那段我自己最常做的其實就是丟給 GPT。
流程總覽
整條線是:影片 → 帶時間戳的逐字稿 → 筆記或文章。 前半段(拿逐字稿)全自動,工具都是現成的;後半段(整理)看需求, 大多時候丟給 GPT 問重點就結束,要發布成文章才走完整流程。
我常整理的是財經頻道的影片,之前在 KOL 言論要拆解不能照單全收 寫過原因。這套流程就是把「拆解」變成固定步驟:原話、摘要、自己的分析分開,數字列出來查。
拿到逐字稿:四種情況
先裝 yt-dlp(pip install -U yt-dlp,或 winget / brew 都有)。 依影片狀況分四種,由快到慢。
情況一:公開影片、有字幕(幾秒鐘)
不用下載影片,直接抓字幕檔。YouTube 的自動字幕也抓得到:
yt-dlp --write-auto-subs --sub-langs "zh-TW,zh,en" --skip-download -o "sub" URL產出 sub.zh-TW.vtt 之類的字幕檔,裡面就是帶時間戳的逐字稿。 .vtt 直接丟給 AI 沒問題,它讀得懂;想要乾淨純文字再叫它幫你去掉時間軸就好。
情況二:公開影片、沒字幕(幾分鐘)
先只抓音訊,再丟轉錄。轉錄用 whisper-ctranslate2(faster-whisper 的指令列版):
# 抓音訊(不下載影片,快很多)yt-dlp -x --audio-format m4a -o "audio.m4a" URL
# 轉錄:輸出 txt + srt(帶時間戳)pip install whisper-ctranslate2whisper-ctranslate2 audio.m4a --model large-v3-turbo --language zh \ --output_format txt srt兩個中文的坑:第一,Whisper 輸出常是簡體,用 OpenCC 轉,或整份丟給 AI 叫它轉繁順便整理。 第二,專有名詞(幣種、公司名、技術詞)錯誤率高, 加 --initial_prompt "會出現的詞: Solana, 聯準會, ETF" 先餵給它,準確率會好很多。
沒有 GPU 的機器改走 Groq 的 API,跑一樣的模型,速度反而更快,一小時音訊只要幾美分:
curl https://api.groq.com/openai/v1/audio/transcriptions \ -H "Authorization: Bearer $GROQ_API_KEY" \ -F "file=@audio.m4a" -F "model=whisper-large-v3-turbo" \ -F "response_format=verbose_json"情況三:會員限定影片
帳號有權限的話,讓 yt-dlp 帶著瀏覽器的 cookies 走,多半直接就能抓:
yt-dlp --cookies-from-browser chrome -x --audio-format m4a URLWindows 上 Chrome 要先完全關閉才讀得到 cookies;還是不行就改用 Firefox, 或用瀏覽器擴充功能把 cookies.txt 匯出來給 --cookies 用。
情況四:真的抓不下來
DRM 串流這類就是最後手段:邊播放邊錄系統音訊(OBS 或 Windows 的立體聲混音都行), 錄完的檔案照情況二轉錄。最慢,但一定通。
轉錄工具怎麼選
- 有 NVIDIA GPU:faster-whisper 配 large-v3。求快換 large-v3-turbo,解碼快很多,品質掉一點點。
- Mac:whisper.cpp,在 Apple silicon 上比 faster-whisper 快不少。
- 要逐字時間戳或分講者:whisperX,在 faster-whisper 上加對齊跟 diarization。
- 不想架環境:Groq API(上面那條 curl);ElevenLabs Scribe 則是內建分講者。
- 偷懶路線:Gemini API 可以直接吃 YouTube 網址(有每日時數上限)。快速摘要可以,認真整理還是先拿逐字稿比較穩,模型直接看影片容易只給表面層級的摘要。
檔案怎麼放
video-id/├── source.txt # 原始逐字稿,不修改├── notes.md # 整理出來的筆記└── article.md # 要發布才有:文章與短版一支影片一個資料夾。原始逐字稿永不修改:AI 修稿常會順手改到語意, 出問題要能回頭對原話。另外轉錄的中間檔很容易堆在系統 Temp,那裡會被自動清掉,整理前記得搬走。
整理:大多時候丟 GPT 就夠
大部分影片我根本不會走到寫文章那步。最常做的就是把逐字稿(.vtt 原檔也行)直接丟給 GPT, 問幾個固定問題:
- 這支影片的核心主張是什麼,各在幾分幾秒
- 他給了什麼理由跟數據
- 有沒有前後矛盾,或他自己講的保留條件
- 哪些數字跟說法值得查證
五分鐘就有一份能存的筆記,比看完影片記得的多得多。 唯一要盯的是:叫它把「講者實際說的」跟「它自己的推論」分開,不然 AI 很愛把兩者混在一起。
要發布成文章再走完整流程
要公開發文(尤其會批評到別人觀點、或涉及投資判斷)標準就高了,多兩件事:查證(數字、日期、對他人立場的轉述、因果關係,逐項查,查不到就寫「未確認」,不准假裝查過), 以及把原話、摘要、自己的分析分開呈現,不把推論寫成對方原話。 實際的 prompt 大概長這樣,照自己的領域調:
把這份逐字稿整理成一篇分析文章。要求:- 先列內容卡:核心主張(帶時間戳)、理由與數據、講者自己的保留條件- 「講者實際說的」「摘要」「你的分析」分開,不把推論寫成他的原話- 需要查證的主張列成清單逐項查,查不到就寫「未確認」,不准假裝查過- 文章按讀者理解的順序重排,不照逐字稿順序機械重述- 不杜撰他沒說過的內容;涉及投資,事實與推測分開,不寫成買賣建議- 最後另附一版 300 字的社群短文整套跑下來,轉錄幾乎全自動,查證還是要人工把關,但比從零開始寫快非常多。