我想提升 Amazon Bedrock 知識庫中搜尋結果的準確性。
解決方法
使用基礎模型剖析文件
當文件複雜、非結構化或包含特定領域的術語時,最佳做法是使用基礎模型來解析文件。基礎模型改善文件中複雜資料的擷取,例如巢狀資料表、影像中的文字以及文字的圖形表現法。若要自訂基礎模型剖析文件的方式,請根據文件結構、領域或使用案例提供指示。
使用進階分塊策略
使用語意分塊或階層式分塊來提高檢索增強生成 (RAG) 的效能。
對於沒有明確的情境界限的文件 (例如法律文件或技術手冊),請使用語義分塊。語義分塊提供了更精確的資訊提取和操作。
**注意:**使用語義分塊時會產生額外費用。費用取決於您擁有的資料量。有關定價的資訊,請參閱 Amazon Bedrock 定價。
對於具有巢狀結構的複雜文件 (例如技術文件,或具有複雜格式和巢狀資料表的學術論文),請使用階層式分塊。分階層式分塊可讓您有效地擷取和瀏覽大型文件。先使用基礎模型來剖析資料,然後使用階層式分塊來提高產生回應的準確性。
若要自訂分塊程序以符合您的 RAG 應用程式需求,請使用自訂 AWS Lambda 函式。
篩選中繼資料
使用 .csv 檔案將中繼資料包含在資料來源中。若要減少所需檔案數量並改善資料管理,請使用資料欄來指定內容欄位和中繼資料欄位。對於大型 .csv 檔案資料集,最佳做法是使用此功能。
在文件欄位或屬性中新增篩選器,以提高回應的相關性。您的資料來源可以包括文件中繼資料屬性或欄位,以篩選並指定要嵌入的欄位。如需詳細資訊,請參閱 Amazon Bedrock 知識庫現已支援中繼資料篩選,以提高擷取準確性。
自訂您的查詢
將複雜的查詢修改為較小、更易於管理的子查詢。當您使用查詢分解時,Amazon Bedrock 會在您的知識庫上執行多個查詢。若要修改查詢,請參閱 Configure and customize queries and response generation (設定和自訂查詢和回應產生) 上的 Query modifications (查詢修改) 索引標籤。
預設情況下,當您查詢知識庫時,Amazon Bedrock 會根據來源分塊傳回最多五筆結果。若要改善搜尋結果,請增加 Amazon Bedrock 傳回的來源分塊數量。若要增加來源分塊的數量,請參閱 Configure and customize queries and response generation (設定和自訂查詢和回應產生) 上的 Number of source chunks (來源分塊數量) 索引標籤。
使用混合搜尋
對於多搜尋演算法功能,請使用混合搜尋。語義搜尋會根據文字的含義提供答案。然而,它無法捕捉所有相關的關鍵字,並且依賴您所嵌入用來代表文字意義的詞語品質。混合式搜尋結合了語意搜尋與關鍵字搜尋,以提升搜尋結果的準確性與相關性。
使用重新排序模型
使用重新排序模型來提高 Amazon Bedrock 擷取結果的相關性。