以下问题基于私有化部署:
- 私有化部署也是默认用 Qwen3-Embedding-0.6B 做切片吗?
- 针对 pdf、word、图片等附件,必须部署视觉大模型做解析吗?
- 请推荐可用的国内视觉大模型(不能翻墙)。
以下问题基于私有化部署:
- 分块策略是平台策略,和嵌入模型没关系,嵌入模型只负责向量化,私有部署可以自行选择嵌入模型,部署后测试一下效果。选择时注意一下是否需要支持多语言以及维度问题,我们向量数据库目前预置了 1024、3072、4096 三个维度的索引配置。建议选模型的时候优先选输出维度正好是这三个之一的,用起来最省心。如果模型输出维度不在这三个里,系统会做截取或补零处理,但这样会影响检索效果,可能出现搜索结果不准的问题,而且比较难排查原因;
- 附件的处理不需要部署视觉模型,是系统进行解析和分块的,目前图片、文档中的图片或扫描件无法识别。
谢谢李工解答。