← Back to Blog
AITooling

用 AI 把影片整理成筆記與文章

2026-07-22

看影片吸收資訊的效率其實很差:重點散在幾十分鐘裡,看完常常只記得結論。 我現在的做法是先把影片變成逐字稿,再拿去整理。 這篇把每一步的指令寫清楚,照抄就能動;整理那段我自己最常做的其實就是丟給 GPT。

流程總覽

整條線是:影片 → 帶時間戳的逐字稿 → 筆記或文章。 前半段(拿逐字稿)全自動,工具都是現成的;後半段(整理)看需求, 大多時候丟給 GPT 問重點就結束,要發布成文章才走完整流程。

我常整理的是財經頻道的影片,之前在 KOL 言論要拆解不能照單全收 寫過原因。這套流程就是把「拆解」變成固定步驟:原話、摘要、自己的分析分開,數字列出來查。

拿到逐字稿:四種情況

先裝 yt-dlp(pip install -U yt-dlp,或 winget / brew 都有)。 依影片狀況分四種,由快到慢。

情況一:公開影片、有字幕(幾秒鐘)

不用下載影片,直接抓字幕檔。YouTube 的自動字幕也抓得到:

bash
yt-dlp --write-auto-subs --sub-langs "zh-TW,zh,en" --skip-download -o "sub" URL

產出 sub.zh-TW.vtt 之類的字幕檔,裡面就是帶時間戳的逐字稿。 .vtt 直接丟給 AI 沒問題,它讀得懂;想要乾淨純文字再叫它幫你去掉時間軸就好。

情況二:公開影片、沒字幕(幾分鐘)

先只抓音訊,再丟轉錄。轉錄用 whisper-ctranslate2(faster-whisper 的指令列版):

bash
# 抓音訊(不下載影片,快很多)
yt-dlp -x --audio-format m4a -o "audio.m4a" URL
# 轉錄:輸出 txt + srt(帶時間戳)
pip install whisper-ctranslate2
whisper-ctranslate2 audio.m4a --model large-v3-turbo --language zh \
--output_format txt srt

兩個中文的坑:第一,Whisper 輸出常是簡體,用 OpenCC 轉,或整份丟給 AI 叫它轉繁順便整理。 第二,專有名詞(幣種、公司名、技術詞)錯誤率高, 加 --initial_prompt "會出現的詞: Solana, 聯準會, ETF" 先餵給它,準確率會好很多。

沒有 GPU 的機器改走 Groq 的 API,跑一樣的模型,速度反而更快,一小時音訊只要幾美分:

bash
curl https://api.groq.com/openai/v1/audio/transcriptions \
-H "Authorization: Bearer $GROQ_API_KEY" \
-F "file=@audio.m4a" -F "model=whisper-large-v3-turbo" \
-F "response_format=verbose_json"

情況三:會員限定影片

帳號有權限的話,讓 yt-dlp 帶著瀏覽器的 cookies 走,多半直接就能抓:

bash
yt-dlp --cookies-from-browser chrome -x --audio-format m4a URL

Windows 上 Chrome 要先完全關閉才讀得到 cookies;還是不行就改用 Firefox, 或用瀏覽器擴充功能把 cookies.txt 匯出來給 --cookies 用。

情況四:真的抓不下來

DRM 串流這類就是最後手段:邊播放邊錄系統音訊(OBS 或 Windows 的立體聲混音都行), 錄完的檔案照情況二轉錄。最慢,但一定通。

轉錄工具怎麼選

  • 有 NVIDIA GPU:faster-whisper 配 large-v3。求快換 large-v3-turbo,解碼快很多,品質掉一點點。
  • Mac:whisper.cpp,在 Apple silicon 上比 faster-whisper 快不少。
  • 要逐字時間戳或分講者:whisperX,在 faster-whisper 上加對齊跟 diarization。
  • 不想架環境:Groq API(上面那條 curl);ElevenLabs Scribe 則是內建分講者。
  • 偷懶路線:Gemini API 可以直接吃 YouTube 網址(有每日時數上限)。快速摘要可以,認真整理還是先拿逐字稿比較穩,模型直接看影片容易只給表面層級的摘要。

檔案怎麼放

text
video-id/
├── source.txt # 原始逐字稿,不修改
├── notes.md # 整理出來的筆記
└── article.md # 要發布才有:文章與短版

一支影片一個資料夾。原始逐字稿永不修改:AI 修稿常會順手改到語意, 出問題要能回頭對原話。另外轉錄的中間檔很容易堆在系統 Temp,那裡會被自動清掉,整理前記得搬走。

整理:大多時候丟 GPT 就夠

大部分影片我根本不會走到寫文章那步。最常做的就是把逐字稿(.vtt 原檔也行)直接丟給 GPT, 問幾個固定問題:

  • 這支影片的核心主張是什麼,各在幾分幾秒
  • 他給了什麼理由跟數據
  • 有沒有前後矛盾,或他自己講的保留條件
  • 哪些數字跟說法值得查證

五分鐘就有一份能存的筆記,比看完影片記得的多得多。 唯一要盯的是:叫它把「講者實際說的」跟「它自己的推論」分開,不然 AI 很愛把兩者混在一起。

要發布成文章再走完整流程

要公開發文(尤其會批評到別人觀點、或涉及投資判斷)標準就高了,多兩件事:查證(數字、日期、對他人立場的轉述、因果關係,逐項查,查不到就寫「未確認」,不准假裝查過), 以及把原話、摘要、自己的分析分開呈現,不把推論寫成對方原話。 實際的 prompt 大概長這樣,照自己的領域調:

text
把這份逐字稿整理成一篇分析文章。要求:
- 先列內容卡:核心主張(帶時間戳)、理由與數據、講者自己的保留條件
- 「講者實際說的」「摘要」「你的分析」分開,不把推論寫成他的原話
- 需要查證的主張列成清單逐項查,查不到就寫「未確認」,不准假裝查過
- 文章按讀者理解的順序重排,不照逐字稿順序機械重述
- 不杜撰他沒說過的內容;涉及投資,事實與推測分開,不寫成買賣建議
- 最後另附一版 300 字的社群短文

整套跑下來,轉錄幾乎全自動,查證還是要人工把關,但比從零開始寫快非常多。

AIWhisperyt-dlpWorkflow內容整理