訂閱費每個月照樣扣,但每次要開工,還是會卡在「這個要用哪個模型跑?」現在加上 Opus 5 變成三個選項,光看跑分表反而更沒感覺。

所以我把同一組 prompt 原封不動丟給三個模型,順便把 token 單價和使用額度 一起算進去。不是要排實力名次,只是想整理出哪種工作交給誰最划算。先講清楚,Opus 5 和 Fable 5 是 Claude 家族,Sol 則是 ChatGPT 5.6 的模型。先說結論:這三個的差別不在實力,而在「個性」。

  • 難度高、結構複雜的工作是 Fable 5 → Opus 5,而且兩者差距比想像中小很多。
  • 快速、重複性高的簡單工作,Sol 還是最輕、最快。
  • Opus 5 是 Fable 5 的整整一半價格,使用額度還獨立計算,等於多了一張 CP 值王牌。

三個模型差的不是實力,是「個性」

我用同一個主題,讓它們各做一款小遊戲、一篇短篇小說、一個帶統計圖表的網頁。條件盡量拉到一樣公平,並且把「自我檢查再修正」的選項關掉,每個模型都用預設的最高設定只跑一次。想看的就是「一次出手能做到多好」。

深色棚拍背景中,三片半透明玻璃面板以略微錯開的角度懸浮在空中,每片面板內透出紫、青綠、橘

有趣的是 Opus 5 跟 Fable 5 像雙胞胎。成品的質地、解題的思路,連表達的感覺都很接近,光看結果我常常分不出是哪一邊做的。

Sol 明顯走了另一條路。方向沒錯,但收尾就是差那一點點,而且這個差距在三個任務裡一路重複出現。

難度高、結構複雜的工作,到底誰比較強

同一組遊戲 prompt,三個模型的邏輯都一次就跑得動。淹水前先預報、啟動排水泵、再發出救援訊號,規則要在六回合內結束,結構單純,所以邏輯上沒有拉開差距。

差別出在「收尾」。Sol 做出來的畫面裡,指向安全航道的箭頭位置歪掉一點,本來該貼在圓圈旁邊的線也整條浮開。不是什麼大 bug,但一看就知道驗證有點隨便帶過。反觀 Opus 和 Fable,動畫對齊、元件之間的貼合這類細節,一次就處理得更乾淨。

我從這裡歸納出一個假設:決定第一版成品品質的,不只是模型本身的智商,而是能自己檢查、自己回頭修正的「後端(harness)」有多完整。實際上你用第二組 prompt 叫 Sol 去修,它修得也很好。只是「一次到位」的能力,這次觀察下來確實是 Claude 家族領先。把驗證強度往上調,Sol 的差距也會縮小很多。

中文寫作,Claude 現在完全不輸了

老舊木桌上的米白色稿紙,用鋼筆一筆一畫寫下的中文句子,右側滲進來的紅色緊急照明燈光讓紙面

以前要中文產出,我幾乎不用想就開 GPT。句子的自然度上,Claude 就是差那麼一截,我自己也習慣把中文稿子交給 GPT。

這次我把條件相同的短篇小說交給三個模型,結果自然到很難分高下。生硬的用詞、那股翻譯腔,幾乎都不見了。

真正拉開差距的地方,反而是「空氣感」。停電同時緊急照明燈亮起的那個開場,氛圍能鋪得多密實,就在這裡出現細微差別。主觀感受上 Fable 5 的句子最順,Opus 5 以極小差距緊追在後。有一件事很確定:「中文就找 GPT」這條公式,可以放下了。

做網頁和互動效果,差距最明顯

在帶統計數據又有互動的網頁上,差距最清楚。滑鼠移過去數值就變、點感測器數值就更新,就是現在儀表板很常見的那種形式。

Opus 和 Fable 都很自然地做出 hover(滑鼠移過)觸發的互動,時間軸上的點和線也對得剛剛好。Sol 則是改用點擊處理,時間軸的節點還跑掉了。除非是手機,現在的網頁用 hover 明顯自然多了。

線條和座標必須精準對齊的 UI,Sol 經常抓不準——這個印象跟前面遊戲那一關看到的模式完全重疊。也就是說,不是偶然,是傾向。

「一半價格」這句話,我畫成表格確認過

「半價」在行銷話術裡太常見了,第一反應就是先懷疑。所以我把官方公開的價格原封不動搬進表格,以 2026 年 7 月的公開價格為準。

項目輸入每 100 萬 tokens輸出每 100 萬 tokens
Opus 55 美元(約 NT$155)25 美元(約 NT$775)
Fable 510 美元(約 NT$310)50 美元(約 NT$1,550)

價格本身很明確(台幣以 1 美元約 31 元換算)。Opus 5 跟上一代 Opus 同價,剛好是上一級 Fable 5 的一半。效能方面,在 Cursor Bench 最高難度上跟 Fable 5 的最高分只差 0.5% 以內,但每個任務的成本只要一半,會想把計算機再拿出來按一次也很正常。

速度反而要看任務類型。寫程式或畫面相關的工作 Opus 稍快,但寫文章反而是 Fable 先產出。這部分很難一句話講死。

項目Opus 5Fable 5Sol(ChatGPT 5.6)
高難度任務完成度非常高非常高不錯,但收尾略可惜
中文語感自然最順自然
精準 UI・對齊經常跑掉
相對價格低(約一半)中等
擅長領域CP 值・複雜任務最頂級品質快速簡單任務

真正的重點,是使用額度算在另一個口袋

老實說,最有感的不是效能也不是價格,而是它跟上一級模型的使用額度是分開的

以前把高階模型的額度燒完,那天的工作基本上就停擺了。這次就算那個額度用光,Opus 5 還是從另一個口袋照樣跑。對於要把月費訂閱榨到 100% 的人來說,這件事比效能數字實際太多了。

思考強度有分級,我自己的建議感覺是這樣:

  • High — CP 值區間。大部分的寫程式、自動化在這裡就夠了。
  • Extra High / Max — 只有複雜 3D、長篇重構這種要再多推一把的時候才往上調。

再補一點。以前高階模型只要 prompt 稍微模糊,安全分類器就會介入,工作被切得斷斷續續;這次官方公布這類介入頻率比之前減少了 85%。工作流不會中途卡住,這件事比想像中重要。

短短幾行 prompt,能做到什麼程度

可愛的 low poly 3D 牧場大亨遊戲的遊戲畫面。綠色山丘上站著三四頭乳牛,畫面上方是逐漸累積的牛奶量表

只用幾行 prompt 下「養牛、擠奶、賣牛奶的牧場大亨」,它就能一次做出可以跑的 demo:3D 乳牛站在那裡、牛奶量表慢慢累積、出貨之後錢也跟著進帳。以前這種東西可能要花好幾天,現在一段 prompt 就先把雛形抓出來了。

跟著滾動讓元素立體位移的網站、上傳照片就自動生成周邊禮盒模型圖的 web app,也都是同一件事。已經走到「想法的解析度就等於成品的解析度」這個階段了。

圖片、影片也由模型直接生出來

左右分割構圖。左邊是程式碼編輯器視窗,右邊是剛生成好的產品模型圖一張,加上短影片縮圖

最近有趣的走向是:不是寫完程式碼就結束,連要放進去的圖片、影片素材,模型也當場生好塞進去。

做法大致兩種。在網頁介面用 MCP 連接器接上圖片・影片生成工具;如果想讓成品直接落在自己電腦上,就把 CLI 指令貼進終端機,登入一次就接起來了。

所以到底該怎麼搭配

正中央維持完美水平的天秤,一邊是閃亮的硬幣堆,另一邊是兩台小機器人並肩坐著保持平衡

  • token 很吃緊的話 — 建議全部先用 Opus 5 跑,只在複雜任務上打開較高的驗證選項。
  • 現在只用 GPT 的話 — 這個月或下一期帳單,值得順手加一份 Claude 試試。中文的差距消失之後,體感真的很不一樣。
  • 照難度排順序 — 難的工作是 Fable → Opus → Sol,快而簡單的工作是 Sol → Opus → Fable。如果 Sol 的快速模式用不順手,那個位置換成 Opus 也完全 OK。

今天只做一件事的話,就挑一個你最常做的任務,把同一組 prompt 丟給三個模型。比起看一百行跑分,一次真正經過自己手的結果準確太多了。好模型不是「第一名」那個,而是跟自己工作節奏合得上的那個。