故障排查GitHub issue2 分钟阅读排错/错误码

解决FastGPT文件分段无来源标识导致知识库匹配结果混乱问题

文件直接分段处理后生成的内容碎片无法区分来源,会导致同一类知识的不同场景内容混合。例如同一知识主题下,不同地区的规定内容无法被区分,知识库匹配时会出现跨来源内容混淆,最终导致回答结果混乱。 文件分段处理过程未自动添加内容来源标识,各分片之间缺乏所属来源的区分信息。

现象

文件直接分段处理后生成的内容碎片无法区分来源,会导致同一类知识的不同场景内容混合。例如同一知识主题下,不同地区的规定内容无法被区分,知识库匹配时会出现跨来源内容混淆,最终导致回答结果混乱。

可能原因

文件分段处理过程未自动添加内容来源标识,各分片之间缺乏所属来源的区分信息。

排查步骤

  1. 进入文件分段的配置界面,确认当前使用的是直接分段功能。
  2. 检查配置界面中是否存在"是否在每个分片增加说明"类的设置选项。
  3. 查看已上传生成的分片内容,验证是否存在无来源标识的片段。
  4. 发起知识库匹配测试,确认是否出现跨来源内容混淆的问题。

解决与验证

在直接分段功能的配置项中,开启"是否在每个分片增加说明"选项。上传文件后,系统会自动为每个分片添加固定来源说明,无需手动预处理原始文档后再上传分片。验证时,查看生成的分片内容是否包含指定来源标识,再发起知识库匹配测试,确认不会出现跨来源内容混淆的问题。

来源: FastGPT GitHub issue #2367