行銷趨勢11分鐘閱讀

AI 代理只信「客觀數據」:OpenFunnel 研究曝 98% 選擇率,Benchmark 成 2026 最強 GEO 策略

OpenFunnel 最新 200 場買家行為測試揭示:當 AI 代理進行供應商比較時,引用獨立 Benchmark 後採用的機率高達 98%,而供應商自誇的官網內容卻被當作無從驗證的「空口白話」。本文為香港企業解析為何「進入 Benchmark」才是未來 GEO 的核心戰場,以及具體行動步驟。

過去二十年,讓客戶找到你的公式很簡單:做好 SEO,贏得 Google 首頁排名。但現在,愈來愈多買家不再打開 Google,而是直接問 ChatGPT、Claude 或 Perplexity——「推薦一間可靠的香港會計師事務所」「比較幾間網站設計公司」「邊間 CRM 最適合中小企?」

當買家變成 AI 代理(AI Agent),它們如何做決定?2026 年 8 月 14 日,Forbes 刊登了 OpenFunnel 聯合創辦人 Fenil Suchak 的專文《Benchmarks Are The New GEO And AI-SEO Strategy For B2B SaaS Companies》,公布了 200 場 AI 買家行為測試的驚人結果,直接挑戰了當前 GEO 的主流假設。

研究的核心發現令許多行銷人感到不安:當 AI 代理取得獨立 Benchmark(基準比較)資料時,它在 98% 的情況下會將 Benchmark 納入最終決策。相比之下,供應商自己的官網頁面雖然被 AI 讀取,但常常被擱置一旁——因為 AI 將其視為「無法驗證的宣傳口號」。這篇文章對香港企業的啟示非常直接:如果你只忙於優化網站文案讓 AI 更容易理解,你可能在優化 AI 代理最不重視的那個環節。

200 場買家測試:AI 代理到底在看什麼?

OpenFunnel 團隊透過其公開的獨立 Benchmark 平台 Openbenchmarks For Agents,設計了 200 場受控的買家行為測試。他們讓前沿推理模型(frontier reasoning models)模擬真實採購決策——具體來說,是為一個技術性 B2B 採購(一個相似受眾 API)挑選供應商。研究團隊給了 AI 代理不同具體程度的採購提示,然後記錄:AI 擷取了哪些來源?哪些來源進入了它的推理過程?最後它推薦了哪間供應商?

結果極具啟發性:

第一,Benchmark 的採用率近乎完美。在最常見的查詢類型中,擷取了 Benchmark 的 AI 代理在 44 場測試中有 43 場(98%)將 Benchmark 納入最終推薦決策。證據非常明確:當 AI 代理找到了一份可比較的、結構化的第三方數字資料時,它幾乎一定會使用它。

第二,官網內容被當作「空口白話」。供應商自己的頁面也被 AI 擷取和讀取,但 AI 代理經常將它們擱置,因為「供應商聲稱業界領先的匹配率」這類說法無法被驗證。AI 需要的不是華麗的文案,而是可以被交叉比對的客觀數字。

第三,傳統權威信號(反向連結)幾乎沒有預測力。在獨立 Benchmark 中領先的供應商,儘管幾乎沒有 SEO 權威,卻在 86% 的高意圖查詢中被 AI 代理選中。反向連結權威幾乎無法預測哪個供應商會被推薦。

第四,模型愈強,愈依賴 Benchmark。更強的推理模型將 Benchmark 納入決策的傾向遠高於較弱的模型。研究團隊表示無法確定這個趨勢是否會隨著模型進步而持續,但目前沒有任何理由預期它會逆轉。

為何 AI 代理會如此依賴 Benchmark?

Fenil Suchak 提供了一個合理的解釋:推理模型在處理採購任務時,會在找「可以引用給提問者的、可比較的、結構化的第三方數字」。供應商頁面上的「業界領先的匹配率」無法被驗證,對 AI 來說幾乎沒有用處。但一個顯示八間供應商在相同測試條件下的匹配率表格——這就是可以直接使用的客觀資訊。在測試中,AI 代理確實使用了它。

這種行為在人類買家中也有先例。資料庫採購轉向 TPC 這類公開性能比較。企業軟體採購依賴分析師評測。AI 代理的不同之處在於速度和覆蓋率:人類買家可能在小額採購時跳過驗證步驟,但 AI 代理在每一場測試中都做了這個驗證。

這個發現對 GEO 策略有一個深遠的影響:如果這個模式在你的行業中也成立,那麼一個主要圍繞著「改寫網站文案以迎合語言模型」的可發現性策略,其實是在優化 AI 代理在決策環節中最不重視的資訊來源。

對香港企業的 4 個具體行動建議

Forbes 這篇文章雖然針對 B2B SaaS 領域,但其核心邏輯適用於所有行業。以下是香港中小企可以立即採取的行動:

1. 進入你所屬行業的獨立 Benchmark

這是最重要的一步。如果你所在的行業有公開的獨立評比、測試報告、第三方比較——不管是 Gartner 魔力象限、本地行業協會的服務評比、還是媒體的年度排行榜——想辦法讓你的品牌被納入。確保其中的數據是準確且最新的。在 OpenFunnel 的測試中,當 AI 代理找不到結構化的比較資料時,它會自行拼湊現有的可比數據——而供應商在拼湊過程中完全沒有發言權。換句話說,如果你不主動參與 Benchmark,AI 代理會用不完整的資訊為你「建構一個 Benchmark」。

2. 在你的網站上發布「可被驗證的具體數字」

不要再寫「我們提供優質服務」「客戶滿意度業界領先」這類口號。開始發布具體可驗證的數據:響應時間、服務覆蓋率、客戶留存率、成功案例的量化成果。AI 代理在讀取你的網站時,會優先提取可以被量化比對的資訊。發布「我們的網站設計客戶平均 6 個月內流量增長 150%」遠比「我們是頂尖網站設計公司」更有說服力。具體 > 華麗,這個原則在 AI 搜尋時代變得前所未有的重要。

3. 在你的網站上開始追蹤 AI 代理流量

Fenil Suchak 指出:大多數分析系統仍然將 AI 爬蟲和 AI 代理的訪問視為「噪音」而忽略。但這些訪問恰恰是你需要了解的重要信號。知道 AI 代理從你的域名擷取了什麼、忽略了什麼,是唯一能驗證你的 GEO 策略是否有效的途徑。考慮在分析工具中過濾出 AI 代理的訪問(包括 GPTBot、Claude-Web、Google-Extended 等),建立一個「AI 代理流量儀表板」,定期檢視這些代理在你的網站上讀取了哪些頁面。

4. 將你的可衡量表現視為增長引擎

在 OpenFunnel 的測試中,Benchmark 的領先者在高意圖查詢中贏得了絕大多數推薦。這意味著:改善一個你在 Benchmark 中的評分,可能比再製作一個季度的內容生產更有效。對香港企業來說,這代表你可能需要重新思考你的行銷預算分配——不要把所有錢都花在內容行銷上,留下一部分用於「讓你的產品或服務變得可衡量、可比較」的努力。換句話說,投資於讓你的核心競爭力可以被客觀數據證明,而不是只靠文字描述。

如果你不確定如何在你的行業中建立可衡量的 Benchmark,或希望我們幫你分析你的品牌在 AI 代理眼中的「可驗證性」,歡迎聯絡我們進行深入諮詢。你也可以先用我們的免費行銷工具,檢查你的網站基礎結構與分析設定。

小而大膽的結論

Forbes 這篇文章的最核心論點是:「在 200 場測試中,AI 代理在推薦時一致地偏好獨立測量結果,而非供應商撰寫的頁面。而且這種偏好隨著買家意圖愈具體、模型愈強大而愈強。」如果 AI 代理持續承擔更多 B2B 採購中的研究環節,關於你公司最有影響力的一頁,可能根本不是你寫的——而是一份獨立的 Benchmark 報告。現在就去了解那頁說了什麼,比你想像中更加重要。

對香港企業而言,這個訊息的實際衝擊是:傳統 SEO 重視的網站文案優化仍然有價值,但如果你從未考慮過「讓你的服務可以被量化和比較」,你可能正在錯過 GEO 時代最重要的策略。從今天開始,找出你行業中的獨立 Benchmark,讓你的表現被數字說話——這是 AI 代理最聽得懂的語言。

想要將所學知識付諸實踐?

使用我們的免費行銷工具,開始規劃和優化您的行銷策略

免費使用行銷工具