finch-glm-vision
v0.1.5
Published
GLM-4V visual understanding for Finch — image analysis, OCR, diagram understanding via Zhipu AI
Readme
GLM 视觉理解
由 智谱 GLM-4V 视觉模型驱动的 Finch 图片理解小工具。
功能
一个工具提供四种分析模式:
| Action | 说明 |
|---|---|
| analyze | 综合分析图片中的主体、场景、文字和数据,适合一般或混合需求 |
| ocr | 提取图片中的全部文字,并尽量保持原有排版 |
| describe | 描述图片的视觉外观、布局、颜色和风格 |
| diagram | 理解技术图表、架构图和流程图 |
对于同一张图片,GLM 视觉理解默认只分析一次。用户明确指定模式时优先遵循;一般或混合需求默认使用 analyze。
安装与配置
- 安装:
npx @finchtoys/minitools add finch-glm-vision - 在 Finch → 工具箱 → 小工具中启用
- 首次使用时,根据提示输入智谱 API Key;可前往智谱开放平台获取
使用方法
向 Finch 提供本地图片并说明需求,例如:
“分析这张截图 /path/to/image.png”
“提取 /path/to/document.png 中的文字”
“描述 /path/to/photo.jpg 的画面内容”
API Key 保存在小工具的私有存储中,不会暴露给模型。
语言支持
- 简体中文(
zh-CN) - English(
en-US)
工具名称、说明、表单、进度提示、错误信息、默认分析指令和详情页都会自动跟随 Finch 界面语言切换。
使用要求
- 智谱 AI API Key
- 本地 PNG、JPG、JPEG、WebP 或 GIF 图片,最大 10 MB
许可证
MIT
