在 B2AI2C(Business to AI to Consumer)的時代,消費者問問題的對象,從搜尋框慢慢變成了 ChatGPT、Gemini、Perplexity 這類 AI 助理。當有人問「台灣哪家賣手沖咖啡器材的網站評價好、出貨快」,AI 會不會把你的店講出來,關鍵不在你多會下廣告,而在一件很基本的事:AI 到底抓不抓得到、讀不讀得懂你的網站。
這篇文章不談玄的,只談技術面。我們用台灣中小電商的視角,把「讓機器進得來、看得懂、願意引用」這件事拆成可以動手檢查的項目,最後給你一張能直接照著做的檢核表。
AI 要引用你,前提是它抓得到、讀得懂
先講清楚因果順序。AI 生成答案時,背後仰賴兩種能力:一種是它訓練時看過的資料,另一種是它當下透過爬蟲或檢索即時去抓的網頁。無論哪一種,你的內容都必須先「以機器能存取的形式存在」,AI 才有機會看到、理解、進而在回答裡引用你。
換句話說,再好的商品描述、再實在的教學文章,只要被技術問題擋在門外,對 AI 來說就等於不存在。台灣很多中小電商的內容其實不差,輸就輸在技術地基沒打好:伺服器回應怪怪的、內容全靠 JavaScript 才長出來、robots.txt 不小心把整站封了。AI 讀不到,一切歸零。
所以 B2AI2C 的技術面,本質上是在做一件事:把你和機器之間的每一道障礙清掉。
常見會擋住 AI 與爬蟲的技術問題
先認得敵人。以下這幾種狀況,是台灣電商站最常見、也最容易在不知不覺中發生的「擋門」情形。
一、robots.txt 誤擋
robots.txt 是放在網站根目錄、告訴爬蟲哪些能爬哪些不能爬的規則檔。最常見的災難是開發階段為了不讓測試站被收錄,寫了「Disallow: /」擋掉全站,上線後忘了改回來,結果整個正式站對所有爬蟲關門。也有的是用了現成佈景或外掛,預設就擋掉了某些目錄。這種問題往往安靜到你完全沒感覺,直到發現流量長期上不來。
二、內容全靠 JavaScript 渲染
很多用前端框架做的單頁式網站,原始 HTML 幾乎是空的,商品名稱、價格、說明全靠 JavaScript 在瀏覽器裡跑完才長出來。Google 主爬蟲有能力執行部分 JS,但成本高、有延遲;而多數 AI 檢索用的抓取器更陽春,常常只讀原始 HTML。結果就是:人用瀏覽器看得到,機器抓到的卻是一片空白。
三、需要登入才看得到內容
把重要內容鎖在會員登入、彈窗、或必須互動才展開的區塊後面,爬蟲一律進不去。如果你希望某頁被 AI 引用,那頁的核心內容就必須在「未登入、不點任何按鈕」的狀態下,直接出現在頁面上。
四、速度太慢
爬蟲對每個站都有時間與資源預算。頁面回應太慢、圖片太肥、伺服器動不動逾時,爬蟲抓幾頁就放棄了,深層頁面永遠輪不到。速度慢同時傷害真人體驗與機器收錄,是雙輸。
五、行動版壞掉
現在爬蟲以行動版內容為主要判斷依據。如果你的行動版跑版、字擠成一團、選單點不開,或桌機版和行動版內容不一致,機器對你的評價就會打折。
該檢查的技術項目一覽
認得問題之後,來看要主動盯的技術項目。下面這張對照表,是台灣中小電商可以逐項自檢的清單。
| 檢查項目 | 要確認什麼 | 怎麼快速驗 |
|---|---|---|
| 可被爬取 | robots.txt 沒有誤擋、重要頁沒被 noindex | 瀏覽器打開 網域/robots.txt 看規則 |
| 伺服器回應 | 正常頁回 200、已刪頁回 404、搬家回 301 | 用開發者工具的 Network 看狀態碼 |
| 內容不靠 JS 才出現 | 關掉 JavaScript 後核心內容還在 | 檢視原始碼,搜尋商品名是否在 HTML 裡 |
| 結構化資料 | 商品、麵包屑、常見問答有標記 | 用 Google 複合式搜尋結果測試工具 |
| 語意化 HTML | 用 header、nav、main、article 等標籤 | 檢視原始碼,別整站都是 div |
| 標題階層 | 一頁一個 h1,h2、h3 由大到小不跳級 | 用瀏覽器外掛列出標題大綱 |
| 圖片替代文字 | 重要圖片有描述性的 alt | 檢查商品圖 alt 是否寫實不堆關鍵字 |
| 網站速度 | 載入快、圖片壓縮、開啟快取 | 用 PageSpeed Insights 跑主要頁 |
| 行動友善 | 行動版不跑版、內容與桌機一致 | 用手機實際點一遍結帳流程 |
結構化資料與語意化 HTML 為什麼重要
結構化資料(Schema 標記)等於幫機器把頁面重點整理成表格:這是商品名、這是價格、這是庫存、這是評分。有了它,AI 不必用猜的,就能精準抓出你想被引用的資訊。對電商來說,商品、麵包屑、常見問答這三種標記最實用,也最容易上手。
語意化 HTML 則是用有意義的標籤取代滿版的 div。導覽用 nav、主內容用 main、每篇文章用 article,機器就能分清楚哪塊是主角、哪塊是配角。標題階層也是同理:一頁只放一個 h1 當主標,底下用 h2、h3 循序分節,不要為了字大就亂跳,這樣機器才讀得出你的內容邏輯。
robots.txt 與是否開放 AI 爬蟲的取捨
這幾年多了一個新選擇:要不要放 AI 專用的爬蟲(例如 OpenAI、Anthropic、Perplexity 這些公司的抓取器)進來。有些站主擔心內容被拿去訓練,選擇封鎖。這裡要提醒兩個原則。
第一,營運永遠優先。如果某個爬蟲行為異常、把你的伺服器打到快掛,該限流就限流,真人客戶的體驗擺第一。這點沒有妥協空間。
第二,別在無意間把該開的也全擋了。B2AI2C 的邏輯是:你希望 AI 在回答消費者時提到你、連到你。如果你把所有 AI 爬蟲一律封死,等於主動退出這場能見度競賽。比較務實的作法是分清楚:負責「即時檢索、可能引用你」的抓取器,通常值得放行;你若真的很在意訓練用途,可以只針對特定訓練型爬蟲設限,而不是無差別全封。設定前務必看清楚每個 user-agent 的用途,別一句「Disallow: /」把自己關進黑箱。
寫 robots.txt 有個安全習慣:預設開放,只針對真正不該被爬的路徑(後台、購物車、會員中心、搜尋結果頁)做 Disallow,其他一律放行。改完一定要用線上工具或直接連到 網域/robots.txt 驗證一次,確認沒誤傷。
llms.txt 是什麼?據實說明,別當萬靈丹
你可能最近常聽到 llms.txt 這個詞。它的構想是:在網站根目錄放一份 Markdown 格式的檔案(網域/llms.txt),用機器好讀的方式,整理出你網站最重要的頁面連結與簡介,方便大型語言模型快速抓到重點。概念上有點像「給 AI 看的網站導覽」。
這裡要非常誠實地說清楚幾件事:
- 它是新興慣例,不是強制標準。llms.txt 目前並非任何官方規範,也沒有哪家主流 AI 公司公開承諾「一定會讀、一定照做」。各家支援程度不一,甚至多數根本沒明確表態。
- 做了大致無害,但別期待立竿見影。放一份寫得清楚、連結正確的 llms.txt,成本很低,也不會傷害你既有的 SEO;把它當成「順手整理一份給機器的重點索引」即可。但它不會取代前面講的那些基本功。
- 別誇大成必備。如果有人告訴你「不做 llms.txt 就會被 AI 淘汰」,那是話術。真正決定 AI 讀不讀得懂你的,是你的內容能不能被正常爬取、伺服器回應正不正常、內容是不是純文字可解析——這些才是地基。
結論:llms.txt 可以做,當作加分項;但把時間優先花在 robots.txt、渲染方式、速度、結構化資料上,投報率高得多。
讓內容本身就好被機器解析
技術設定之外,內容的「形態」也決定機器能不能吸收。原則只有一句:別把重點鎖在圖片或難解析的元件裡。
- 把價格、規格、保固、退換貨政策這類關鍵資訊,用文字寫在 HTML 裡,不要只做成一張圖。機器讀不出圖片裡的文字。
- 重要圖片一定要寫實在的 alt 描述,讓機器知道圖在講什麼,也順便照顧視障使用者。
- 少用需要滑鼠移過去、或點好幾下才展開的花俏元件來承載核心內容。內容能直接顯示,就直接顯示。
- 常見問答用真正的問答結構寫出來,別塞在一張長圖或影片裡。
循序的技術體檢順序
不用一次做完,照這個順序一關一關過,效率最高:
- 先確認進得來:檢查 robots.txt 有沒有誤擋、重要頁有沒有被 noindex。這是最常見、也最致命的問題,先排除。
- 再確認讀得到:關掉 JavaScript 看核心內容還在不在、有沒有把內容鎖在登入後。
- 檢查伺服器回應:正常頁 200、死連結 404、搬遷 301,狀態碼要對。
- 拚速度與行動版:壓縮圖片、開啟快取、實機測行動版流程。
- 補結構與語意:加上商品、麵包屑、常見問答的結構化資料,整理標題階層,補齊 alt。
- 最後再處理加分項:視情況放行值得的 AI 爬蟲、放一份 llms.txt。
AI 可存取性技術檢核表
把上面整理成一張可以直接印出來逐項打勾的檢核表:
| 類別 | 檢核項目 | 過關標準 |
|---|---|---|
| 可被爬取 | robots.txt 沒誤擋全站 | 沒有無意義的 Disallow: / |
| 可被爬取 | 重要頁未被 noindex | 商品頁、文章頁可被收錄 |
| 可被讀懂 | 關掉 JS 核心內容仍在 | 商品名、價格出現在原始 HTML |
| 可被讀懂 | 核心內容不需登入或互動 | 未登入即可看到主要資訊 |
| 伺服器回應 | 狀態碼正確 | 200/404/301 各歸各位 |
| 結構化資料 | 商品/麵包屑/問答標記 | 通過複合式結果測試工具 |
| 語意化 | 用語意標籤與正確標題階層 | 一頁一個 h1,層級不跳級 |
| 圖片 | 重要圖片有 alt | 描述寫實、不堆關鍵字 |
| 速度 | 主要頁載入快 | PageSpeed 分數與體感都順 |
| 行動友善 | 行動版不壞、內容一致 | 手機實測結帳全程順暢 |
| 內容形態 | 重點以文字呈現 | 關鍵資訊不鎖在圖片裡 |
| AI 爬蟲取捨 | 值得的抓取器有放行 | 營運優先前提下不無差別全封 |
| 加分項 | llms.txt(選配) | 連結正確、簡介清楚 |
B2AI2C 聽起來很潮,但落到技術面,其實都是老實的基本功:讓機器進得來、看得懂、抓得到重點。把這張檢核表跑過一輪,你就已經贏過大多數只顧著砸廣告、卻讓 AI 讀不到自己的同業了。地基穩了,AI 才有機會在消費者面前,替你說一句好話。