AI 模型盲測

同一份東京行程,
5 個 AI 做出來的網頁

我把同一份 Excel 行程表(9 天、5 個大人、48 張景點照片),用一字不差的同一句話,交給 5 個不同的 AI 模型。投票先放其中 4 個(A~D),第 5 個(E)也放在下面,可以一起看。

它們收到的指令幫我把這份東京行程做成一份精美好看的 HTML,要放上表格裡的照片,要能在手機上看。

先不告訴你哪個是哪個。用手機點開看看,你覺得哪個做得最好?

A點我看 B點我看 C點我看 D點我看
E加碼:不在投票裡,揭曉時一起講
看完到 Threads @timwei.ai 投票,答案會在那裡揭曉

另外 3 題:健檢、地圖、雨天備案

盲測之後,我又給 Sonnet 5.5、Opus 5.5、Fable 5.1 出了 3 題,用的是同一份行程。結果已經公布了,所以這裡直接標模型名稱。

第 1 題:出發前幫行程做健檢

它們收到的指令出發前幫我檢查這份東京行程,把可能會出包的地方全部找出來,依嚴重程度用紅黃綠燈整理成一頁 HTML 報告。
Sonnet 5.5點我看Opus 5.5點我看Fable 5.1點我看

第 2 題:做成行程地圖

它們收到的指令幫我把這份東京行程做成一張互動地圖:每個景點、餐廳、飯店都放圖釘,每天的路線用不同顏色連起來,做成一頁 HTML。
Sonnet 5.5點我看Opus 5.5點我看Fable 5.1點我看

第 3 題:箱根下大雨,重排兩天行程

指令重點(完整指令很長)D3 箱根下大雨、空中纜車全天停駛,D4 是晴天。重排 D3 和 D4,把大涌谷、海賊船、箱根神社盡量補回來;車票和飯店都不能改,熱海城和來宮神社一定要去,同行的長輩每天步行不能超過 60 分鐘。
Sonnet 5.5點我看Opus 5.5點我看Fable 5.1點我看
關於這個測試這是我自己好奇做的測試,沒有業配,也不是正式的跑分,每個模型各跑一次。條件都固定:同一份 Excel、同一句指令、同一個版本、effort 都設成 high(Haiku 不支援,用它的預設),每個都從一個空的資料夾開始做。