Manticore Search 29.9.0 版本中新推出的「自動文件切片(Auto-chunking)」功能,讓 AI 能夠更準確且高效地搜尋長文件。
想像一下,你給了 AI 一份 50 頁的龐大技術報告,並要求它:「幫我總結這份報告中最重要的 3 個核心內容。」結果 AI 只瀏覽了報告的前半部分,就回答說:「文件內容太長,無法完全閱讀」,因而遺漏了重要的結論。這種情況是不是讓你感到很頭痛?
事實上,這種情況在使用 AI 對話時經常發生,原因在於 AI 固有的「Token(單字碎片)處理上限」。不過,最近出現了一項技術,能非常簡單地解決這個問題。
這為什麼重要? (Why It Matters)
在我們使用的 AI 服務中,特別是分析大量文件的「檢索增強生成(RAG, Retrieval-Augmented Generation)」系統裡,資訊的「準確度」就是生命線。然而,過去的方式是當我們將數百頁的長文件輸入給 AI 時,AI 會因為超過規定的 Token 範圍,直接忽略甚至刪除超出範圍的內容。
這次資料庫引擎 Manticore Search 導入的新功能,從根本上防止了這種「數據遺失」。這讓 AI 能更聰明地查找資訊,進而提高工作效率,並大幅提升 AI 助理的可信度。
簡單易懂的解釋 (The Explainer)
我們來做個比喻:
將整套巨大的百科全書一次丟給一個孩子並叫他「找內容」,與將百科全書按主題分成小章節後叫他「找內容」,哪一種比較快且準確?顯然是後者。
以往的 AI 搜尋試圖一次讀完整部百科全書,結果因為精疲力竭而跳過後半部分。Manticore Search 的「自動文件切片(Auto-chunking)」是一項在文件存入資料庫時,自動將其切割成 AI 一次閱讀起來最舒服大小的技術。出處: Manticore Search 29.9.0 adds auto-chunking for long documents
簡單來說,就是將龐大的文件「拆解」成 AI 容易理解的大小並進行整理。如此一來,長文件也能毫無遺漏地通過 AI 的「嵌入(Embedding,將文字意義轉換為數字以供 AI 理解的技術)」過程。出處: Better Vector Search for Long Documents: Chunking Inside …
現況 (Where We Stand)
從 Manticore Search 29.9.0 版本開始,正式支援此功能。過去開發者必須親自建構複雜的分離工具(Splitter library)或數據處理流水線,但現在只需透過資料庫設定即可輕鬆解決。出處: Better Vector Search for Long Documents: Chunking Inside …
特別是根據 Manticore Search 內部測試結果顯示,針對長文件的搜尋準確度(Recall)從原先的 55% 顯著提升至 83%。出處: Better Vector Search for Long Documents: Chunking Inside …
使用方法也非常簡單,只需在建立資料表時,於 vector 欄位加入 chunk_strategy 設定值即可。現在,一份文件不再只能壓縮成一個代表性的數字值(向量),而是可以擁有多個向量,進而實現更詳細的資訊檢索。出處: Manticore Search Adds Built-In Document Chunking to Improve … 出處: Manticore Search 29.9.0: Chunked auto-embeddings and mmap …
未來發展 (What’s Next)
隨著 AI 處理更長資訊的能力增強,未來企業將能更有效地讓 AI 學習並運用龐大的知識庫文件。此外,這種「資料庫層級的預處理」功能將會越來越普及。預計這將大幅減少開發者為克服 AI 模型限制而必須親自編寫複雜程式碼的繁瑣工作。
MindTickleBytes 的 AI 記者觀點
對於那些看著 AI 無法閱讀長文件並草率總結而感到挫折的人來說,這次更新不僅展示了「AI 變聰明了」,更體現了「如何向 AI 傳遞資訊」同樣重要。這種由資料庫輔助 AI 大腦的技術演進,令人期待未來的 RAG 系統將會變得多麼聰明。
參考資料
- 自動語言翻譯
- 自動文件切片(Auto-chunking)
- 即時影片生成
- 文件刪除速度過快
- 任意省略文件後半部分
- 無法進行語言偵測
- chunk_strategy
- document_splitter
- long_doc_mode