RAG工作做视觉全能RAG Skill deepseek-v4-flash-vision-rag

发布时间:2026/9/4 4:42:37
RAG工作做视觉全能RAG Skill deepseek-v4-flash-vision-rag deepseek-v4-flash-vision 是真正的好东西 但是我发现大家都不积极利用好它 所以我试试做一个给佬参考看看是不是好东西deepseek-v4-flash-vision 图片在 API 中会先转换成 token 再按 token 计费一张图片最多占 384 tokens计费价格与 V4-Flash 模型一致。例如处理整本图书 100 万上下文 600 图/请求 ⇒一次请求装下一整本书的视觉内容在配额内完全可以这样120 页 × 384 token ≈ 4.6 万 image token所以我的skill方案就是 直接一本几百页的书直接 利用deepseek-v4-flash-vision 转为 可利用信息 转为很好用的RAGgithub.comGitHub - liangdabiao/deepseek-v4-flash-vision-rag: 让 AI 真正看懂 一份 PDF然后你对它提问它告诉你答案、答案在第几页 ...让 AI真正看懂一份 PDF然后你对它提问它告诉你答案、答案在第几页 并把那一页的原图展示出来给你核对。 基于 DeepSeek 视觉大模型deepseek-v4-flash-vision-exp的 PDF 深度问答与检索 vision RAGagent skill。支持文字版 PDF也支持**扫描版**能看懂图表、表格、代码块、公式而不只是认字。核心原理** 每一页先被渲染成图、被deepseek-v4-flash-vision视觉模型读过、生成页级摘要与元数据 。便宜的方法粗定位、贵的眼睛做确认、最贵的推理只用在刀刃上。节约成本视觉RAG!image实际演示❯ 利用 deepseek-v4-flash-vision-rag skill 对 test2.pdf 进行工作imageimageimage实际使用效果imageimageimageimage开源不容易感谢佬支持项目有参考学习了 pageIndex 的一些解决方案。感谢开源。