AI-OCR识别

AI-OCR识别 公开 已发布(自动)

如何安装动作?

适用于
分类(旧)
OCR AI
关键词
AI; OCR;

cutebubbles UkuLiLee 阿尔都塞 用户BY6V3Do-BAA PecoPeco 13 人赞了这个动作

4 个动作单 收藏了此动作。

更多信息
分享时间 2025-01-13 13:40
最后更新 11天12小时前
修订版本 13
用户许可 可自己使用或修改,不可再分享
Quicker版本 2.2.2
动作大小 382.7 KB

分享到

「使用大模型的多模态能力进行OCR识别」

简介

🚀 推荐配置

视频演示效果使用的是 gemini-2.0-flash
有条件的可以尝试阿里最新的 qwen-vl-max
(复杂文本识别请务必使用能力强的多模态模型)

🔥 相比其他 OCR 的核心优势

多语种通吃: 无需特殊配置,精准识别主流语言。
公式识别强: 数学公式还原度极高。
All in One: 一次性配置,开箱即用。

1. 硅基流动 (SiliconFlow)

默认Demo

支持自定义更换模型,注册即送免费额度。

2. 智谱清言

包含免费的 glm-4v-flash 模型。

3. 通义千问 (Aliyun)

多模态大模型质量相当不错。

4. Mistral OCR

⚠️ 微小图片识别较弱

效果媲美谷歌和阿里,支持 Markdown 格式输出。支持 Cloudflare AI Gateway 代理。

5. Google Gemini 配置

需自行解决网络问题。

步骤1:获取 API Key
步骤2:参考 Quicker 文档填写
作者所声明的动作特征:
  • 依赖第三在线服务

最近更新

修订版本 更新时间 制品 审核状态 更新说明
13 11天12小时前 V1 V2 当前 V1 版本 当前 V2 版本 - 更新了glm-4.6v-flash高峰提示
12 11天12小时前 V1 V2 - 修复智谱错误
11 11天14小时前 V1 V2 - 完整重构了界面,UI更美观
- 适配了DeepSeek新发布的视觉模型
- 适配了Baidu_PaddleOCR模型,支持图片文本叠加、渲染、选择、复制
- 适配了GLM-OCR模型,支持图片文本叠加、渲染、选择、复制
- 完整更新了各个模型供应商的模型列表,可右键动作重置更新模型列表

最近讨论

BUG反馈 · 66
零度_ 11天13小时前 零度_ 11天11小时前
功能建议 · 86
Katrina_ 17天12小时前 Katrina_ 13天6小时前
使用问题 · 292
UkuLiLee 2026-04-30 11:34 车站里的守望者 2026-04-30 17:55