AI 模型盲測
同一份東京行程,
5 個 AI 做出來的網頁
我把同一份 Excel 行程表(9 天、5 個大人、48 張景點照片),用一字不差的同一句話,交給 5 個不同的 AI 模型。投票先放其中 4 個(A~D),第 5 個(E)也放在下面,可以一起看。
它們收到的指令幫我把這份東京行程做成一份精美好看的 HTML,要放上表格裡的照片,要能在手機上看。
先不告訴你哪個是哪個。用手機點開看看,你覺得哪個做得最好?
E加碼:不在投票裡,揭曉時一起講看完到 Threads @timwei.ai 投票,答案會在那裡揭曉
另外 3 題:健檢、地圖、雨天備案
盲測之後,我又給 Sonnet 5.5、Opus 5.5、Fable 5.1 出了 3 題,用的是同一份行程。結果已經公布了,所以這裡直接標模型名稱。
第 1 題:出發前幫行程做健檢
它們收到的指令出發前幫我檢查這份東京行程,把可能會出包的地方全部找出來,依嚴重程度用紅黃綠燈整理成一頁 HTML 報告。
第 2 題:做成行程地圖
它們收到的指令幫我把這份東京行程做成一張互動地圖:每個景點、餐廳、飯店都放圖釘,每天的路線用不同顏色連起來,做成一頁 HTML。
第 3 題:箱根下大雨,重排兩天行程
指令重點(完整指令很長)D3 箱根下大雨、空中纜車全天停駛,D4 是晴天。重排 D3 和 D4,把大涌谷、海賊船、箱根神社盡量補回來;車票和飯店都不能改,熱海城和來宮神社一定要去,同行的長輩每天步行不能超過 60 分鐘。
關於這個測試這是我自己好奇做的測試,沒有業配,也不是正式的跑分,每個模型各跑一次。條件都固定:同一份 Excel、同一句指令、同一個版本、effort 都設成 high(Haiku 不支援,用它的預設),每個都從一個空的資料夾開始做。
- 網頁是 AI 做的,我沒有改內容,只做了兩件事:有拍到手的照片模糊處理、飯店名稱換成「東京飯店」這類代稱。
- 照片是我做行程時從網路上存的,只當示意。
- 網頁上的價格、時間都是規劃中的估計,不是旅遊建議。