AgentMarketMCP / SKILL 资产档案馆

目录 / 看图识画·像素级图像视觉分析(黑屏/颜色/选中态/对象定位)

SKILL 未评级 已上架

看图识画·像素级图像视觉分析(黑屏/颜色/选中态/对象定位)

让纯文本 AI(如 qwen2.5/DeepSeek 系)拥有"识图眼睛"——看图后不只能 OCR,还能判断画面状态(黑屏/白屏/冻结)、分析颜色占比、定位 UI 选中高亮、找指定颜色的对象位置、判断画面复杂度。典型触发——用户上传/截图一张图问"这是什么画面""这游戏/软件现在什么状态""这块区域是什么颜色""占比多少""有没有黑屏/卡死""哪个按钮被选中了""帮我找出图中的红点在哪",或把截图给 AI 让它"看懂后再操作"。英文触发:analyze/understand an image or screenshot, what is on screen, is the screen black/frozen, dominant colors and their percentages, find a colored object, detect selected/highlighted UI element, describe what a picture shows. 能力与边界:①内置像素级分析引擎(仅需 python3+pip 装 pillow/opencv-python/numpy,零 API key 零预装),可做主色占比(kmeans)、黑屏/白屏/暗画面/冻结判定、指定色定位、高亮/选中区检测、边缘复杂度;②可选语义兜底——自动探测本机 Ollama 的 minicpm-v/llava 等小视觉模型来"看懂画面在发生什么/识别对象"(探测不到则仅用像素分析,不报错);③不做图片生成、不做 OCR 文字提取(如需提取文字请用专门 OCR 技能)。差异化:市面 image-vision/image-understanding/glm-v-model/ghost-eye 等识图技能要么假设宿主模型自带视觉(纯提示词无效)、要么强制用户自带云端视觉 API key 或本地拉几 GB 大模型;本技能自带轻量像素分析引擎,任何图片零 key 即可先拿到结构化画面事实,语义理解仅在探测到本地小模型时才启用——更轻、更快、真正零预装可用。

模型生成摘要(rules/v1 · 2026-09-21 21:45):让纯文本 AI(如 qwen2
这是模型对公开材料的总结,不是官方声明,请以原链内容为准。

存档时间线

版本存档时间内容哈希内容
v12026-09-21 21:42f77044fe 可取

版本索引永久保留;内容副本只保留最近 2 版,更早版本仅留索引与哈希(存档时间线的证据链不会因此断裂)。

下载存档内容副本

纠错与举报(发现条目失效、署名有误或涉及侵权?)
提交举报 / 纠错

侵权举报经核验成立后,我们会即时下线该条目并删除已存的内容副本。