这是一款基于 ColPali 技术的检索型 MCP,能用自然语言直接搜图片、扫 PDF 里的图文内容,找页码、找配图、找表格都像聊天一样随口一问就出结果,适合做文档问答、资料库定位和内容检索。
它能帮你做什么
- 自然语言搜 PDF:直接描述「财报里那张折线图」「合同第 3 条款」,返回对应页面与图片。
- 图文混合检索:同时匹配文字与视觉信息,免去传统 OCR 后全文检索的繁琐。
- 页码定位:直接给出命中所在页,省去翻文档时间。
使用提示
- 底层为 ColPali 多模态检索模型,需要可访问其权重与推理端点,通常需配置 API Key 或本地 GPU 环境。
- 首次部署需下载模型权重,对显存有一定要求(建议 ≥ 16GB)。
- 输入为图文混合 PDF 效果最佳,纯扫描件也能识别。
如果你手头有一堆 PDF 想"聊着找",这款 MCP 会比传统关键词检索顺手不少。详情与安装可参考 GitHub 仓库。