Azure AI Vision 图像分析技能
为 Python 编码代理提供 Azure AI Vision 图像理解实现指南。
证据显示优先使用 DefaultAzureCredential、生产环境约束凭据链,并将 API Key 标为遗留路径,体现最小化凭据暴露和审计意识;但 URL 图片会发送至 Azure,且 OCR、人员检测等敏感数据流、数据保留、用户确认和权限范围未明确说明,因此扣分。
示例覆盖同步/异步客户端、生命周期管理和 HttpResponseError;但依赖版本、API 兼容性、边界输入、空字段处理和可诊断失败反馈有限,部分示例假定结果字段存在,静态评估不支持超过 10 分,因此扣分。
触发词、Python SDK、图像分析场景和主要视觉功能较清晰;但未充分声明不适用场景、区域/服务限制或中文输出实践,也未说明大陆网络访问 Azure 服务的条件,因此扣分。
具备清晰的安装、认证、功能分节、表格、错误处理、最佳实践、MIT 许可证和版本元数据,并提供参考文件;但未给出依赖版本、变更记录、明确维护责任人或更新路径,故未满分。
能够直接指导 URL/文件图像分析、OCR、检测、字幕和裁剪等核心任务,示例可作为起点;但输出主要是打印结果,缺少生产级封装、成本/隐私权衡和已验证代表性结果,静态上限为 7 分,因此扣分。
证据包含具体代码、功能清单、参考文档和仓库测试/CI存在性;但没有该技能关键路径的提交测试或第三方执行结果,结论主要依赖静态示例,故为有限可验证性。
- 使用 analyze_from_url 会将图像交给 Azure 服务;对含个人、身份证件或敏感文本的图像,应先确认合规性、区域和保留策略。
- 示例未固定 azure-ai-vision-imageanalysis、azure-identity 等依赖版本,也未证明当前 SDK 版本下所有方法和字段均可运行。
- 文档没有明确说明服务配额、计费、区域可用性、中文 OCR/字幕质量或大陆网络连通性。
它能做什么 & 适用场景
该技能面向使用 Azure AI Vision 4.0 Python SDK 的图像理解任务。它涵盖图像描述、密集描述、标签、目标检测、OCR、人员检测和智能裁剪。内容提供同步与异步客户端示例,并优先建议使用 DefaultAzureCredential。它适合需要把 Azure 图像分析能力集成到 Python 应用或服务中的开发者。
指导代理安装 azure-ai-vision-imageanalysis,配置 VISION_ENDPOINT 及相关身份验证变量,创建同步或异步 ImageAnalysisClient,并从 URL 或本地文件读取图像。它展示如何请求指定视觉特征,读取描述、标签、目标和人员的边界框、OCR 行与单词、置信度,以及智能裁剪区域。它还说明如何处理 HttpResponseError、选择语言、启用性别中立描述,并遵循客户端上下文管理和凭据清理模式。
- Python 开发者需要从图片生成单句描述或多个区域描述时,使用 CAPTION 或 DENSE_CAPTIONS。
- 构建图像检索、内容标注或场景识别功能的团队,可使用 TAGS 获取内容标签。
- 需要定位图像中物体或人员的应用,可使用 OBJECTS 或 PEOPLE 及其边界框。
- 需要从截图、扫描图或照片中提取文字的开发者,可使用 READ 进行 OCR。
- 为缩略图或响应式界面生成不同构图区域的团队,可使用 SMART_CROPS。
优缺点一览
- 覆盖 Azure AI Vision 4.0 的主要图像分析功能。
- 同时提供 URL 输入、本地文件输入、同步客户端和异步客户端示例。
- 明确建议使用 DefaultAzureCredential,并强调客户端和异步凭据的生命周期管理。
- 包含错误处理、语言、性别中立描述、缓存和特征选择等实践建议。
- 仅面向 Python SDK,不能直接作为其他语言 SDK 的指南。
- 依赖 Azure 终结点、凭据或现有密钥部署;来源没有提供离线运行方式。
- 来源未给出该单项技能的独立测试覆盖或成本信息。
- 输入图像受 20 MB 及 50×50 到 16000×16000 像素等限制。
如何安装
运行 npx skills add microsoft/skills,在安装向导中选择所需技能。README 说明技能会安装到所选代理的目录;该技能的具体安装路径由代理配置决定。Python SDK 本身通过 pip install azure-ai-vision-imageanalysis 安装。
如何使用
在代理中输入包含“image analysis”“computer vision”“OCR”“object detection”“ImageAnalysisClient”或“image caption”的任务描述。代码中设置 VISION_ENDPOINT,生产环境优先使用 DefaultAzureCredential,并用 ImageAnalysisClient 调用 analyze_from_url 或 analyze,同时传入所需的 VisualFeatures。输入图像需符合来源列出的格式、大小和尺寸限制。