Flash News

谷歌于推出 Agentic Vision,Gemini 3 Flash 的全新视觉能力

谷歌于 1 月 27 日推出 Agentic Vision,这是 Gemini 3 Flash 的全新视觉能力,将静态图像分析转化为“代理式”(agentic)过程,通过“思考-行动-观察”循环主动调查图像细节,提升基准准确率 5%–10%。

核心机制
Think-Act-Observe 循环
Think:分析查询与初始图像,制定多步计划(如放大序列号、旋转街牌)。

Act:生成并执行 Python 代码,主动操作图像(裁剪、旋转、标注、计算边界框)。

Observe:将变换图像追加至上下文窗口,迭代精炼最终响应。

关键功能

  • 自动放大:检测微观细节(如芯片序列号、远处标志),无需提示。
  • 视觉数学:解析密集表格、执行确定性 Python 计算,避免幻觉。
  • 图像标注:直接在画布绘制, grounding 推理于视觉证据。

可用性与基准提升
接入方式:Gemini API(Google AI Studio/Vertex AI)、Gemini app(Thinking 模式),开发者开启“Code Execution”工具即可。

性能:视觉基准一致提升 5%–10%,PlanCheckSolver 等应用验证建筑平面准确率改善。

未来扩展:隐式支持旋转/视觉数学、多工具(网页/逆像搜索)、更多模型尺寸。

本条快讯由 ABAB AI 新闻模型自动生成:
基于实时监测的全球信息源,经语义筛选与编辑后即时发布

Google

Source

·ABAB News
·
2 min read
·193d ago
分享: