🔍 慧眼同源
多模态文档去重与版本溯源系统 · DINOv2 reg4 + BGE + PaddleOCR
多模态文档去重与版本溯源系统
无需登录,一键体验示例场景
多模态文档去重与版本溯源系统 · DINOv2 reg4 + BGE + PaddleOCR
是什么:一个基于 Web 浏览器访问的多模态文档去重与版本溯源系统,用户上传图片即可自动检测是否与历史库中的图片为同一场景或同一文档。
面向谁:企业法务审核人员、财务报销审核岗、知识库运营人员、高校教师与教务人员、自媒体创作者、个人云盘用户。
主要功能:
🏆 本项目全程由 TRAE AI 制作
最初做多角度场景一致性检测时发现,DINOv2 的视觉特征匹配能力天然能识别"同一张纸不同角度拍的照片",BGE 的语义匹配能穿透表述差异找到内容本质。这两个能力组合起来,恰好是文档去重场景一直缺失的那块拼图——从视觉和语义两个维度理解文档的"同源性"。
法务审核合同时,同一份合同被不同部门换了个标题重新提交审批,审核人靠肉眼和记忆根本发现不了;财务报销时,同一张发票手机拍一次、扫描仪扫一次,两次都能通过系统;学生作业抄袭只需改几个字就能绕过传统查重。这些"同源不同形"的重复问题,传统查重工具完全失效。
现有查重工具只比对文字是否一样,换几个词就查不出来,更别说识别不同角度拍的同一张纸。我们判断,文档去重需要从"字面比对"升级到"语义+视觉"的多模态理解。DINOv2 reg4 的 register tokens 消除了 CLS token 中的 artifact,特征质量更高;BGE-small-zh 针对中文语义优化。两者结合,恰好能覆盖"换皮文档"和"多角度同场景"两大查重盲区。这是传统工具做不到的突破性解法。
使用 PaddleOCR 提取图片中的文字内容,再通过 BGE-small-zh 中文语义模型编码为 512 维向量,计算余弦相似度。当相似度 ≥ 0.85 时判定为同一场景。
这种方式能穿透"换皮文档"——即使措辞微调,语义本质不变,仍能被识别为同源。
使用 DINOv2 ViT-Small/14 reg4 模型提取图片的全局视觉特征(384 维 CLS token),计算余弦相似度。当相似度 ≥ 0.5 时判定为同一场景。
DINOv2 的 reg4 版本通过 register tokens 消除了 CLS token 中的 artifact,特征质量更高,能更准确地识别不同角度拍摄的同一场景。
系统通过 4 个加权信号自动判断图片类型:文本面积占比(0.15)、背景白度(0.50)、颜色方差倒数(0.25)、文本行密度(0.10)。综合得分 ≥ 0.45 判为文本场景,否则为复杂场景。用户也可手动指定场景模式以跳过分类步骤。
历史图片特征预存储到 Qdrant 向量数据库,使用 HNSW 算法实现近似最近邻(ANN)搜索,将 O(N) 暴力比对优化为 O(log N),配合内存缓存实现毫秒级候选筛选。
| 能力维度 | 传统哈希查重 | 文本查重(知网/Turnitin) | 慧眼同源 |
|---|---|---|---|
| 不同角度同场景识别 | ✗ 完全失效 | ✗ 不支持图片 | ✓ DINOv2 视觉特征 |
| 换皮文档识别 | ✗ 完全失效 | △ 需文字完全匹配 | ✓ BGE 语义穿透 |
| 多语言支持 | ✗ 不支持 | △ 有限 | ✓ 中文优化 |
| 图片+文字混合 | ✗ 不支持 | ✗ 仅文字 | ✓ 多模态融合 |
| 印章/签名识别 | ✗ 不支持 | ✗ 不支持 | ✓ 视觉特征捕获 |
本项目从架构设计、代码编写到部署调试,全程由 TRAE AI 辅助完成:
正在分析中...