資源中心 · 研究

ChatGPT 的品牌資料從哪裏來?訓練資料與即時搜尋的分別

ChatGPT 的回答可能受預訓練資料、當前對話、使用者提供內容及產品所啟用的搜尋或工具影響,具體組合視模型與模式而定。外界不能由單一回答確定某網頁曾用於訓練;品牌可做的是維持公開官網與可靠第三方資料一致,並在記錄測試時標明日期、模型、地區和是否搜尋。

ChatGPT 的回答可能受預訓練資料、當前對話、使用者提供內容及產品所啟用的搜尋或工具影響,具體組合視模型與模式而定。外界不能由單一回答確定某網頁曾用於訓練;品牌可做的是維持公開官網與可靠第三方資料一致,並在記錄測試時標明日期、模型、地區和是否搜尋。

先分清四個可能資訊層

  • 預訓練:模型在開放使用前從資料學習語言模式與知識表徵。
  • 對話上下文:目前對話中的提問、上載內容及較早訊息。
  • 搜尋/檢索:產品在回答時取得較新的網頁或資料。
  • 工具與產品資料:特定功能連接的資料源,視帳戶及模式而定。

「模型能回答」不等於「這頁在訓練集」,而「答案有連結」亦不等於該網站改變了模型本身。

外界可以與不可以確認甚麼

可以保存介面顯示的模型、模式、答案與引用,核對來源是否支持該句;不可以從文字相似、品牌被提及或回答錯誤,反推出確切訓練文件清單。訓練資料範圍、資料截止與產品政策應以測試當日的 OpenAI 官方文件為準,不應用未具來源的精確比例描述。

香港品牌可控制的五項工作

  1. 官網以繁中及需要的英文清楚列出品牌、服務和地區。
  2. 讓重要頁可爬取、可索引,並有穩定 canonical URL。
  3. 在可靠第三方檔案保持核心事實一致。
  4. 為易變資料加日期、香港適用條件和原始來源。
  5. 修正錯誤或過時頁,避免網上並存多個互相矛盾版本。

可參考品牌實體訊號ChatGPT 品牌提及指南

如何設計可比較測試

分開測試未啟用搜尋與已啟用搜尋的情境;每次保存 prompt、模型標示、日期、香港地區、語言、登入狀態、完整答案及引用。新對話和延續對話也要分開,因為上下文會改變結果。平台選項可從AI 平台說明開始整理。

常見錯誤、限制與下一步

不要把搜尋索引稱為訓練資料庫、把一次引用當成永久收錄,或聲稱修改 robots 設定便能控制所有產品行為。模型、政策、搜尋供應、地區與帳戶功能會更新;香港使用者看到的介面未必與海外相同。若品牌資料被誤述,可先用AI Visibility Audit找出可控制來源。

若答案出現錯誤,先做來源診斷:在新對話重現、切換搜尋模式、檢查可見引用,再搜尋官網及主要第三方是否仍有舊資料。能確定的錯誤便在受控頁修正、合併重複版本或聯絡資料持有人;不能確定來源時,應記錄為未知,而不是宣稱平台偷取或保存了某一頁。

私隱和版權決策亦不應由能見度目標取代。網站擁有人需按資料性質、合約、法律意見及平台最新控制文件決定是否容許特定爬蟲或資料使用。限制某類存取可能影響部分發現方式,但實際作用按產品而異;技術團隊應記錄規則修改和測試結果。

對客戶資料、內聯網及付費內容,切勿為了「讓模型知道」而公開本來不應曝光的資訊。品牌可見度工程只應使用已獲授權的公開事實;任何上載至對話產品的文件,也要依公司資料管治及供應商條款處理。

本文刻意不列未經即時官方文件核實的訓練資料比例、截止日期或固定同步時間。產品能力及政策以 OpenAI 當時公布內容為準。

常見問題

官網更新後,ChatGPT 會立即知道嗎?

沒有固定保證。未搜尋的回答可能不反映最新網頁;搜尋模式亦受重新爬取、索引、查詢和產品設定影響,應記錄更新與重測日期。

答案提到品牌,是否證明資料來自官網?

不能。除非介面展示並可核對來源,提及可能來自多種資料或上下文;即使有引用,也只證明該次回答展示了該頁。

可以要求網站一定被納入模型訓練嗎?

品牌無法以一般 SEO 操作保證納入。應查閱 OpenAI 當時的官方政策與控制選項,並把搜尋可見度和訓練資料問題分開。

下一步:用 Audit 驗證你的品牌現況。

申請 Audit