查網站電商媒體電商數據榜單中心數據速報 工具箱商品比價小教室電商健檢比較清單對手對戰API關於
趨勢與 AI

讓 AI 爬得到讀得懂:B2AI2C 技術面實戰指南

讓 AI 爬得到讀得懂:B2AI2C 技術面實戰指南|ECPRO 電商博士
字級
ChatGPT 摘要 Claude 摘要 Perplexity 摘要
林克威導讀

AI 想推薦你,得先進得了門、看得懂內容。這篇談 B2AI2C 的技術基本功:可存取性、速度與那份被討論很多的 llms.txt。

本文重點
  • AI 要引用你,前提是它抓得到、讀得懂
  • 常見會擋住 AI 與爬蟲的技術問題
  • 該檢查的技術項目一覽
  • robots.txt 與是否開放 AI 爬蟲的取捨
  • llms.txt 是什麼?據實說明,別當萬靈丹
  • 讓內容本身就好被機器解析

在 B2AI2C(Business to AI to Consumer)的時代,消費者問問題的對象,從搜尋框慢慢變成了 ChatGPT、Gemini、Perplexity 這類 AI 助理。當有人問「台灣哪家賣手沖咖啡器材的網站評價好、出貨快」,AI 會不會把你的店講出來,關鍵不在你多會下廣告,而在一件很基本的事:AI 到底抓不抓得到、讀不讀得懂你的網站。

這篇文章不談玄的,只談技術面。我們用台灣中小電商的視角,把「讓機器進得來、看得懂、願意引用」這件事拆成可以動手檢查的項目,最後給你一張能直接照著做的檢核表。

AI 要引用你,前提是它抓得到、讀得懂

先講清楚因果順序。AI 生成答案時,背後仰賴兩種能力:一種是它訓練時看過的資料,另一種是它當下透過爬蟲或檢索即時去抓的網頁。無論哪一種,你的內容都必須先「以機器能存取的形式存在」,AI 才有機會看到、理解、進而在回答裡引用你。

換句話說,再好的商品描述、再實在的教學文章,只要被技術問題擋在門外,對 AI 來說就等於不存在。台灣很多中小電商的內容其實不差,輸就輸在技術地基沒打好:伺服器回應怪怪的、內容全靠 JavaScript 才長出來、robots.txt 不小心把整站封了。AI 讀不到,一切歸零。

所以 B2AI2C 的技術面,本質上是在做一件事:把你和機器之間的每一道障礙清掉。

常見會擋住 AI 與爬蟲的技術問題

先認得敵人。以下這幾種狀況,是台灣電商站最常見、也最容易在不知不覺中發生的「擋門」情形。

一、robots.txt 誤擋

robots.txt 是放在網站根目錄、告訴爬蟲哪些能爬哪些不能爬的規則檔。最常見的災難是開發階段為了不讓測試站被收錄,寫了「Disallow: /」擋掉全站,上線後忘了改回來,結果整個正式站對所有爬蟲關門。也有的是用了現成佈景或外掛,預設就擋掉了某些目錄。這種問題往往安靜到你完全沒感覺,直到發現流量長期上不來。

二、內容全靠 JavaScript 渲染

很多用前端框架做的單頁式網站,原始 HTML 幾乎是空的,商品名稱、價格、說明全靠 JavaScript 在瀏覽器裡跑完才長出來。Google 主爬蟲有能力執行部分 JS,但成本高、有延遲;而多數 AI 檢索用的抓取器更陽春,常常只讀原始 HTML。結果就是:人用瀏覽器看得到,機器抓到的卻是一片空白。

三、需要登入才看得到內容

把重要內容鎖在會員登入、彈窗、或必須互動才展開的區塊後面,爬蟲一律進不去。如果你希望某頁被 AI 引用,那頁的核心內容就必須在「未登入、不點任何按鈕」的狀態下,直接出現在頁面上。

四、速度太慢

爬蟲對每個站都有時間與資源預算。頁面回應太慢、圖片太肥、伺服器動不動逾時,爬蟲抓幾頁就放棄了,深層頁面永遠輪不到。速度慢同時傷害真人體驗與機器收錄,是雙輸。

五、行動版壞掉

現在爬蟲以行動版內容為主要判斷依據。如果你的行動版跑版、字擠成一團、選單點不開,或桌機版和行動版內容不一致,機器對你的評價就會打折。

該檢查的技術項目一覽

認得問題之後,來看要主動盯的技術項目。下面這張對照表,是台灣中小電商可以逐項自檢的清單。

檢查項目要確認什麼怎麼快速驗
可被爬取robots.txt 沒有誤擋、重要頁沒被 noindex瀏覽器打開 網域/robots.txt 看規則
伺服器回應正常頁回 200、已刪頁回 404、搬家回 301用開發者工具的 Network 看狀態碼
內容不靠 JS 才出現關掉 JavaScript 後核心內容還在檢視原始碼,搜尋商品名是否在 HTML 裡
結構化資料商品、麵包屑、常見問答有標記用 Google 複合式搜尋結果測試工具
語意化 HTML用 header、nav、main、article 等標籤檢視原始碼,別整站都是 div
標題階層一頁一個 h1,h2、h3 由大到小不跳級用瀏覽器外掛列出標題大綱
圖片替代文字重要圖片有描述性的 alt檢查商品圖 alt 是否寫實不堆關鍵字
網站速度載入快、圖片壓縮、開啟快取用 PageSpeed Insights 跑主要頁
行動友善行動版不跑版、內容與桌機一致用手機實際點一遍結帳流程

結構化資料與語意化 HTML 為什麼重要

結構化資料(Schema 標記)等於幫機器把頁面重點整理成表格:這是商品名、這是價格、這是庫存、這是評分。有了它,AI 不必用猜的,就能精準抓出你想被引用的資訊。對電商來說,商品、麵包屑、常見問答這三種標記最實用,也最容易上手。

語意化 HTML 則是用有意義的標籤取代滿版的 div。導覽用 nav、主內容用 main、每篇文章用 article,機器就能分清楚哪塊是主角、哪塊是配角。標題階層也是同理:一頁只放一個 h1 當主標,底下用 h2、h3 循序分節,不要為了字大就亂跳,這樣機器才讀得出你的內容邏輯。

robots.txt 與是否開放 AI 爬蟲的取捨

這幾年多了一個新選擇:要不要放 AI 專用的爬蟲(例如 OpenAI、Anthropic、Perplexity 這些公司的抓取器)進來。有些站主擔心內容被拿去訓練,選擇封鎖。這裡要提醒兩個原則。

第一,營運永遠優先。如果某個爬蟲行為異常、把你的伺服器打到快掛,該限流就限流,真人客戶的體驗擺第一。這點沒有妥協空間。

第二,別在無意間把該開的也全擋了。B2AI2C 的邏輯是:你希望 AI 在回答消費者時提到你、連到你。如果你把所有 AI 爬蟲一律封死,等於主動退出這場能見度競賽。比較務實的作法是分清楚:負責「即時檢索、可能引用你」的抓取器,通常值得放行;你若真的很在意訓練用途,可以只針對特定訓練型爬蟲設限,而不是無差別全封。設定前務必看清楚每個 user-agent 的用途,別一句「Disallow: /」把自己關進黑箱。

寫 robots.txt 有個安全習慣:預設開放,只針對真正不該被爬的路徑(後台、購物車、會員中心、搜尋結果頁)做 Disallow,其他一律放行。改完一定要用線上工具或直接連到 網域/robots.txt 驗證一次,確認沒誤傷。

llms.txt 是什麼?據實說明,別當萬靈丹

你可能最近常聽到 llms.txt 這個詞。它的構想是:在網站根目錄放一份 Markdown 格式的檔案(網域/llms.txt),用機器好讀的方式,整理出你網站最重要的頁面連結與簡介,方便大型語言模型快速抓到重點。概念上有點像「給 AI 看的網站導覽」。

這裡要非常誠實地說清楚幾件事:

  • 它是新興慣例,不是強制標準。llms.txt 目前並非任何官方規範,也沒有哪家主流 AI 公司公開承諾「一定會讀、一定照做」。各家支援程度不一,甚至多數根本沒明確表態。
  • 做了大致無害,但別期待立竿見影。放一份寫得清楚、連結正確的 llms.txt,成本很低,也不會傷害你既有的 SEO;把它當成「順手整理一份給機器的重點索引」即可。但它不會取代前面講的那些基本功。
  • 別誇大成必備。如果有人告訴你「不做 llms.txt 就會被 AI 淘汰」,那是話術。真正決定 AI 讀不讀得懂你的,是你的內容能不能被正常爬取、伺服器回應正不正常、內容是不是純文字可解析——這些才是地基。

結論:llms.txt 可以做,當作加分項;但把時間優先花在 robots.txt、渲染方式、速度、結構化資料上,投報率高得多。

讓內容本身就好被機器解析

技術設定之外,內容的「形態」也決定機器能不能吸收。原則只有一句:別把重點鎖在圖片或難解析的元件裡。

  • 把價格、規格、保固、退換貨政策這類關鍵資訊,用文字寫在 HTML 裡,不要只做成一張圖。機器讀不出圖片裡的文字。
  • 重要圖片一定要寫實在的 alt 描述,讓機器知道圖在講什麼,也順便照顧視障使用者。
  • 少用需要滑鼠移過去、或點好幾下才展開的花俏元件來承載核心內容。內容能直接顯示,就直接顯示。
  • 常見問答用真正的問答結構寫出來,別塞在一張長圖或影片裡。

循序的技術體檢順序

不用一次做完,照這個順序一關一關過,效率最高:

  1. 先確認進得來:檢查 robots.txt 有沒有誤擋、重要頁有沒有被 noindex。這是最常見、也最致命的問題,先排除。
  2. 再確認讀得到:關掉 JavaScript 看核心內容還在不在、有沒有把內容鎖在登入後。
  3. 檢查伺服器回應:正常頁 200、死連結 404、搬遷 301,狀態碼要對。
  4. 拚速度與行動版:壓縮圖片、開啟快取、實機測行動版流程。
  5. 補結構與語意:加上商品、麵包屑、常見問答的結構化資料,整理標題階層,補齊 alt。
  6. 最後再處理加分項:視情況放行值得的 AI 爬蟲、放一份 llms.txt。

AI 可存取性技術檢核表

把上面整理成一張可以直接印出來逐項打勾的檢核表:

類別檢核項目過關標準
可被爬取robots.txt 沒誤擋全站沒有無意義的 Disallow: /
可被爬取重要頁未被 noindex商品頁、文章頁可被收錄
可被讀懂關掉 JS 核心內容仍在商品名、價格出現在原始 HTML
可被讀懂核心內容不需登入或互動未登入即可看到主要資訊
伺服器回應狀態碼正確200/404/301 各歸各位
結構化資料商品/麵包屑/問答標記通過複合式結果測試工具
語意化用語意標籤與正確標題階層一頁一個 h1,層級不跳級
圖片重要圖片有 alt描述寫實、不堆關鍵字
速度主要頁載入快PageSpeed 分數與體感都順
行動友善行動版不壞、內容一致手機實測結帳全程順暢
內容形態重點以文字呈現關鍵資訊不鎖在圖片裡
AI 爬蟲取捨值得的抓取器有放行營運優先前提下不無差別全封
加分項llms.txt(選配)連結正確、簡介清楚

B2AI2C 聽起來很潮,但落到技術面,其實都是老實的基本功:讓機器進得來、看得懂、抓得到重點。把這張檢核表跑過一輪,你就已經贏過大多數只顧著砸廣告、卻讓 AI 讀不到自己的同業了。地基穩了,AI 才有機會在消費者面前,替你說一句好話。

電商博士小教室

本文相關的 KPI 公式

購物車放棄率Cart Abandonment
放棄率 = 1 −(完成結帳人數 ÷ 加入購物車人數)

把東西加進購物車卻沒結帳的比例。是漏斗末端最關鍵、最該救的破口。

退貨率Return Rate
退貨率 = 退貨訂單數 ÷ 總出貨訂單數 × 100%

出貨後被退回的比例。高退貨率會吃掉毛利,還是商品/期待落差的警訊。

看完整電商 KPI 公式庫 →
ECPRO 數據觀察

用真實數據延伸這個主題

ECPRO 電商博士實測逾 10 萬個台灣電商網站。想用數據驗證本文觀點,延伸閱讀這幾份實測報告:

覺得有用?分享出去
LINE Facebook X Threads

常見問題

我的網站是用前端框架做的,內容都靠 JavaScript 才顯示,會影響 AI 讀取嗎?

會,而且影響很大。多數 AI 檢索用的抓取器只讀原始 HTML,不執行 JavaScript。如果你的商品名、價格、說明都要等 JS 跑完才出現,機器抓到的可能是一片空白。建議改用伺服器端渲染或預先產生靜態 HTML,讓核心內容在原始碼裡就存在。你可以在瀏覽器關掉 JavaScript 後重整頁面,看看重點還在不在,就知道嚴不嚴重。

我一定要做 llms.txt 嗎?不做會被 AI 淘汰嗎?

不會。llms.txt 是新興慣例、屬選配,並非任何官方強制標準,各家 AI 的支援程度也不一致,甚至多數沒明確表態。做一份寫清楚、連結正確的 llms.txt 成本低、大致無害,可當加分項;但它絕不能取代 robots.txt 設定、可爬取性、渲染方式、速度與結構化資料這些基本功。任何說「不做就被淘汰」的講法都是誇大。優先把地基做好,llms.txt 有空再補。

我該不該封鎖所有 AI 爬蟲,避免內容被拿去訓練?

不建議無差別全封。B2AI2C 的邏輯是希望 AI 在回答消費者時提到你、連到你,全封等於主動退出能見度競賽。務實作法是:以營運為優先,若某爬蟲把伺服器打到快掛就限流;至於訓練疑慮,可只針對特定訓練型爬蟲設限,而非把負責即時檢索、可能引用你的抓取器一起擋掉。設定前先看清每個 user-agent 的用途,別一句 Disallow: / 把自己關進黑箱。

訂閱電商情報每週一封,台灣電商數據與經營洞察。
相關文章
相關電商內容