谷歌发布智能体视觉功能,AI 图像理解从静态扫描变为主动调查
1 月 28 日
谷歌 DeepMind 团队为 Gemini 3 Flash 模型推出智能体视觉新功能,革新 AI 处理图像传统方式,通过建立思考、行动与观察的闭环,让模型主动、多步骤调查理解和分析视觉信息,减少猜测与错误。该功能在多项视觉基准测试中使模型输出质量提高 5% 到 10%,如提升建筑图纸验证平台准确率、避免视觉数学问题中的幻觉问题。当前模型已能智能决定放大查看细节,未来版本将更自动化。
2026-09-18
谷歌:在 Gemini Notebook 中推出专家智能功能2026-09-17
谷歌与 DeepMind 成立研究所探索通用人工智能2026-09-03
谷歌推 Google Pics,纳入 Workspace 办公套件2026-09-02
谷歌推出 Gemini 智能体视频理解功能,最高可降低 88% 代币消耗2026-08-27
谷歌升级 Gemini Live 语音功能,AI 应用体验转向「一句话完成任务」2026-08-21
谷歌搜索与 Gemini 上线 AI 学习工具,新增 3D 模拟和智能测验功能2026-07-30
谷歌发布 Gemini 机器人 AI 模型,旨在解决机器人「灵巧性」难题2026-05-06
对标 OpenClaw:谷歌正内测全新 AI 智能体 Remy查看更多
体验专业版特色功能,拓展更丰富、更全面的相关内容。