今日最有感的事

早上在 Threads 滑到一支動畫(https://www.threads.com/share/_5KTsW5WS/),第一眼會以為是某個影片生成模型跑出來的成品。我丟給 CC 的問題很直接:「這種的動畫 Opus 5.5 到底要怎麼做的?它要搭配哪些工具?」

拆開來看,答案跟我想的完全不一樣。這支影片沒有用到任何影片生成模型,每一格畫面都是程式碼畫出來的。作法大概是:在 Claude Code 裡用 Opus 5.5,花很多輪對話先寫一份畫風規範和分鏡腳本,再用 Python 那套(Demucs 把人聲和伴奏分開、Whisper 加上強制對齊)把歌詞對到每個字的時間點、抓出每一拍,接著用 TypeScript + three.js 把每一幕寫成程式,剪接點綁在拍點上,最後用無頭 Chrome 一格一格截圖、交給 ffmpeg 合成。

這代表動畫這件事的入口,從「找一個夠強的影片生成模型」變成「寫一套會自己畫每一格的程式」。真正值得看的是它的可控性。

看懂之後我沒有停在「原來如此」,當場就挑了一個醫學題目試做:「STEMI 的 ST 段怎麼抬起來」,30 秒。從第一版做到第七版,改的都是很細的東西——手機上 Google Drive 還在轉檔看不到,就另外輸出一個 30fps 的手機預覽版;我聽到旁白把「冠狀動脈」的「冠」唸成一聲,要求改四聲。CC 查了教育部辭典,發現標準讀音其實是一聲(王冠的冠),但臨床上大家都唸四聲,於是把送給語音引擎的稿子改成同音的「灌」,字幕照樣寫「冠狀動脈」,改完還單獨錄三個詞量音高驗證:改過的「灌狀動脈」是 314→250 Hz 一路下降,走勢跟參考組「灌溉」一樣,確認真的變成四聲。

更直白地說,這種可控性是影片生成模型給不了的。你沒辦法對一個生成模型說「把第 15 秒那個字的聲調從一聲改成四聲,其他都別動」,但對一套程式可以,而且能量測驗證。

下午我把這件事推得更遠:又收了一支同類的動畫(https://www.threads.com/share/D-F342Zt9/),請 CC 每一幀每一幀逆向拆解,看它用了哪些工具,再把結論連同 STEMI 這次累積的經驗,沉澱成一個「製作動畫 skill」,之後要做心電圖相關的動畫就先來這張卡看看有沒有用得上的。這批拆解一路展開成一整排子代理,分頭去解各種風格的程式碼動畫(剪紙風、SVG、3D 字幕等),全片被切成 28 段逐段標註用到的技術。把別人的成品逐格拆成可複用的技術清單,是我覺得今天最划算的一步:一支好動畫看過就過去了,拆成 skill 才會變成自己下次能調用的能力。

今日收集的資源

Opus 5.5 純程式碼動畫(今天的起點)

拿來逐格逆向拆解的第二支動畫

用 Gemini Spark 申請 Muse AI 的方法

Muse AI 加入頁

hyperframes-community-skills

lemo-opuscar

teli.chen 的 Facebook 貼文

◆ ◆ ◆