Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash
Google DeepMind 宣布推出 Nano Banana 2 Lite 和 Gemini Omni Flash,并已在 Google AI Studio、Gemini API 及 Gemini 应用等产品中上线。
推荐理由:官方公布两款新模型的能力指标、定价和接入入口,开发者可直接对照选择适合的图像或视频生成方案。
AI 产品与应用的功能上新、改版与商业化动态——谁家的产品变强了、变贵了、能用了。
Google DeepMind 宣布推出 Nano Banana 2 Lite 和 Gemini Omni Flash,并已在 Google AI Studio、Gemini API 及 Gemini 应用等产品中上线。
推荐理由:官方公布两款新模型的能力指标、定价和接入入口,开发者可直接对照选择适合的图像或视频生成方案。
Mistral AI 发布 Mistral OCR 4,新增边界框、文本块分类和行内置信度分数,支持 170 种语言,可在单容器内自托管部署。它在 OlmOCRBench 上取得 85.20 的最高分,并被用于 Mistral Search Toolkit 的 ingestion 流程,API 价格为每千页 4 美元,批量折扣后为 2 美元。
推荐理由:官方披露结构化能力与实测分数,可直接对比现有文档解析方案并评估 RAG 和智能体落地成本。
Google 在 Gemini Enterprise Agent Platform 中发布基于 Agentic RAG 的跨语料库检索功能,可处理多源多跳复杂查询。
推荐理由:Google 发布支持 Agentic RAG 的 Gemini Enterprise Agent Platform,通过 Sufficient Context Agent 实现跨库迭代检索与完整性校验,准确率提升最高达 34%。
Google I/O 2026 展示了其研究从实验室到现实应用的广泛进展,涵盖科学发现、医疗健康、边缘计算、核心模型能力及隐私保护等领域。
推荐理由:全面梳理了 Google I/O 2026 期间发布的关键工具与模型,包括 Gemini for Science、Google Antigravity 2.0、Coralboard 及多项基础研究突破。
Mistral在AI Now Summit 2026上发布面向工业工程的新AI栈,并与Airbus、BMW和ASML合作,同时宣布Vibe成为统一智能体,可处理长时间跨度的编码和研究任务; Les Ulis数据中心将于2026年Q3启用,提供10 MW推理算力。
推荐理由:原文披露了Vibe的多步骤能力扩展及Mistral工业AI方案的关键合作,便于判断其企业场景落地。
Mistral AI 发布 Search Toolkit,这是一个用于构建生产级 AI 检索流水线的开源框架,整合了数据摄入、检索和评估模块。它支持 BM25、稠密向量和混合检索,内置召回率、精确率、MRR 和 NDCG 等评估指标,帮助团队隔离并优化检索质量。
推荐理由:提供可复用的检索框架和评测指标,适合需要独立优化检索质量的团队参考。
Mistral 发布 Mistral Medium 3.5,这是首款旗舰合并模型,参数量 128B,支持 256k 上下文窗口,在 SWE-Bench Verified 上得分 77.6%。
推荐理由:发布远程异步编码代理和Work模式,结合新模型能力可评估对多步工作流的影响。
Mistral AI 发布 Connectors 功能,允许开发者通过 Studio 将内置和自定义 MCP 统一注册并作为原生工具用于对话、智能体和工作流,支持直接工具调用、排除危险操作及人类审批流程。
推荐理由:Mistral Studio 推出 Connectors,将 MCP 接入封装为可复用实体,并提供直连工具调用与人审机制。
Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,在 Terminal-Bench 2.1 等基准上超越 3.1 Pro,速度为其他前沿模型 4 倍,已在全球 Gemini App 和 Search AI Mode 中作为默认模型,同时推出个人 AI 代理 Gemini Spark。
推荐理由:3.5 Flash 在速度与前端智能之间取得平衡,提供了部署协作子代理的能力,可用于开发应用、维护代码库等实际任务。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,并开放给个人研究者使用。该系统基于 Gemini,由 Generation、Proximity、Reflection、Ranking、Evolution、Meta-review 六个专业智能体组成,通过
推荐理由:Google DeepMind 发布多智能体系统 Co-Scientist,已在衰老、肝病、ALS 等真实科研场景中产出可验证假设。
Google DeepMind发布AlphaEvolve年度影响力报告。该Gemini驱动的代码智能体已在基因组学、电网优化、量子物理等领域取得成果,被用于下一代TPU设计和Spanner优化,并与Google Cloud合作赋能Klarna、Schrödinger等商业客户。
推荐理由:官方披露AlphaEvolve一年来的跨行业落地案例,可据此判断该智能体在科研与基础设施中的实际影响力。
Mistral AI 在公开预览中发布 Workflows,这是面向企业的 AI 编排层,提供持久执行、可观测性和人工审批能力,已可用来自动化关键业务流程。该能力作为 Studio 的一部分,通过 Python SDK 编写工作流并支持 Le Chat 触发,底层基于 Temporal 引擎并针对 AI 场景进行扩展。
推荐理由:这是 Mistral 首个面向企业的流程编排层,将可靠执行、可观测性和人工审批融入 Studio,开发者可用 Python SDK 快速把 AI 流程推向生产。
Google 在 Google Photos 的 Auto frame 功能中上线相机视角重组成像。该方法先通过 3D 点图模型估计场景深度和焦距,再用生成式扩散模型填补画面缺失区域,可自动调整主 subjects 的 3D 朝向、矫正广角畸变并寻找更理想的构图视角。
推荐理由:基于Auto Frame推出相机视角重合成像功能,提供3D感知编辑的具体思路与可用入口。
Google DeepMind 发布 Gemini 3.1 Flash TTS,支持 70+ 语言与多说话人对话,新增 audio tags 允许在文本中嵌入自然语言指令以精细控制语气、节奏和口音。
推荐理由:引入了 audio tags 和 SynthID 水印,表达力和可追溯性比前代更完整。
Google DeepMind 发布 Gemini Robotics-ER 1.6,强化空间与多视角推理能力,支持仪表读取等工业场景,通过 Gemini API 和 Google AI Studio 向开发者开放。
推荐理由:官方发布机器人推理模型升级,强化了空间理解、工具调用和仪表读取等具身能力。
Google Research 发布 Vibe Coding XR,依托 XR Blocks Gem 与 Gemini 协作,通过长上下文推理与系统提示词将自然语言描述直接生成可在 Android XR 设备运行的物理感知应用,并在 VCXR60 基准上给出初步评估结果。
推荐理由:Google 发布 XR Blocks Gem,用 Gemini 将自然语言转为带物理感的 Android XR 应用,开发者可直接上手验证 XR 原型。
Mistral AI发布Voxtral TTS,这是一款4B参数文本转语音模型,支持9种语言的自然发音与情感表达,强调低延迟和零样本跨语言声音适配。模型可通过API以每1000字符0.016美元的价格使用,并在Mistral Studio和Le Chat中提供测试入口。
推荐理由:官方发布了新TTS模型,给出了参数规模、语言支持、延迟数据和具体定价,读者可直接评估是否接入工作流。
Mistral AI 宣布推出 Forge,一个面向企业的系统,支持基于私有知识构建前沿级 AI 模型。Forge 提供预训练、后训练及强化学习全流程能力,覆盖密集架构与 MoE 架构,并支持多模态输入。平台优先为 Code Agent 设计,允许企业通过自然语言指令完成模型定制与持续优化。已与 ASML、Ericsson、欧洲航天局等机构合作落地。
推荐理由:Mistral AI 官方发布的 Forge 平台支持企业基于私有数据开展预训练、后训练和强化学习,并强调对编码智能体的支持。
Mistral发布Leanstral,一款面向Lean 4的第一个开源代码智能体,采用6B活跃参数的高稀疏架构,在Lean Formal Theorem Proving Eval中对多个大型开源模型展现效率优势。
推荐理由:Leanstral以6B活跃参数在数学证明基准上超越部分千亿参数开源模型,并提供免费API和Mistral Vibe零配置入口。
Google Research宣布在Flood Hub推出Urban Flash Flood预警功能,利用Gemini提取新闻中的洪水数据构建Groundsource数据集。
推荐理由:Google官方宣布城市内涝预警模型上线Flood Hub,覆盖超20亿人口,填补全球南方预警空白。