跳到正文

Google / Gemini

Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。

最新精选

第 21–40 条 · 共 52 条
7月23日周四
  1. Google Research63

    Google研究:让量子计算机从误差中学习并持续运行

    Google Research 与 DeepMind 合作在 Nature 发表论文,提出基于强化学习的量子误差校正控制框架。该框架利用 QEC 产生的检测事件作为学习信号,在 Willow 超导处理器上实现了计算过程中的连续参数校准。实验显示逻辑稳定性提升 3.5 倍,逻辑错误率低于千分之一,并证明该方法可扩展到数百量子比特系统。

    推荐理由:Google用强化学习在Willo处理器上实现误差发生中的持续校准,逻辑错误率降至记录新低。

7月21日周二
7月9日周四
  1. Google Research74

    SensorFM:可穿戴健康数据的通用基础模型

    Google Research发布SensorFM,在500万参与者超1万亿分钟传感器数据上预训练的通用大传感器基础模型,实现跨心血管、代谢、睡眠和精神健康领域的统一表征学习。

    推荐理由:用万亿分钟无标签数据训练通用生理表征,为可穿戴健康预测提供了可迁移的基础模型。

7月1日周三
6月30日周二
  1. Google Research80

    Google 发布 TabFM 表格数据零样本基础模型

    Google Research 发布 TabFM,将表格预测重构为上下文学习问题,单前向传递完成分类与回归,无需微调或特征工程。该模型已上线 Hugging Face、GitHub 及 Google Cloud BigQuery,支持通过 AI.PREDICT SQL 查询直接推理。

    推荐理由:Google 推出 TabFM 基础模型,用零样本推理替代传统监督训练的调参和特征工程流程。

6月27日周六
  1. Google Research70

    谷歌研究:冻结多 Token 预测加速 Pixel 端侧 Gemini Nano 推理

    谷歌研究博客发文介绍将多 Token 预测(MTP)改造并部署到 Pixel 9 和 10 系列的 frozen Gemini Nano v3 模型上。方案在模型最终层附加轻量 Transformer 头,直接 cross-attend 主模型 KV 缓存,避免独立 Draft 模型带来的双倍内存开销;主模型参数冻结,不改变输出语义和对齐结果。

    推荐理由:谷歌公布端侧推理优化方案,在冻结的 Gemini Nano 模型上叠加 MTP 头,实测 Pixel 提速 50% 以上。

6月25日周四
  1. Google DeepMind82

    Gemini 3.5 Flash 内置 Computer Use 能力

    Google DeepMind 宣布将 Computer Use 功能作为内置工具集成到 Gemini 3.5 Flash 中,开发者可通过 Gemini API 和 Gemini Enterprise Agent Platform 使用。

    推荐理由:Computer use 成为 Gemini 3.5 Flash 内置工具,原生支持跨平台智能体操作,并配套企业级对抗训练和安全机制。

6月11日周四
6月10日周三
  1. Google DeepMind60

    Google DeepMind 推出最高1000万美元多智能体 AI 安全研究资助

    Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 和 Google.org 发布新一轮技术研究资助计划,总额最高 1000 万美元,面向全球研究者征集多智能体安全方案。

    推荐理由:Google DeepMind 联合多家机构发布最高1000万美元的多智能体安全研究资助计划,明确四项重点方向与申请时间。

6月9日周二
  1. Google DeepMind77

    Google 发布 Gemini 3.5 Live Translate 实时语音翻译模型

    Google 发布 Gemini 3.5 Live Translate,支持 70+ 语言的近实时语音到语音翻译,通过 Gemini Live API 向开发者开放公共预览版,并在 Google Meet 和 Google Translate App 中逐步上线。模型自动生成自然流畅的译文语音,保留说话者的语调、节奏和音高,同时通过 SynthID 为生成音频添加隐形水印。

    推荐理由:官方案例(司机-游客通话、Google Meet 会议)展示了 70+ 语言的实时同步翻译能力,开发者可据此评估多语言协作场景的可用性。

  2. Google DeepMind80

    Google DeepMind 发布 Gemma 4 12B 多模态模型

    Google DeepMind 发布 Gemma 4 12B,这是首款支持原生音频输入的中规模模型。它采用无编码器架构,视觉和音频输入直接流入LLM骨干网络。模型可在16GB VRAM的笔记本上运行,性能接近更大的26B MoE模型,并配备MTP草稿器以降低延迟。该模型以Apache 2.0许可证开源,Hugging Face和Kaggle已提供权重下载。

    推荐理由:原生音频输入和无编码器架构让它在16GB显存的笔记本上即可运行,适合本地Agent开发。

6月8日周一
  1. Google DeepMind70

    Google DeepMind 发布塞拉利昂AI教育试验结果

    Google DeepMind 发布塞拉利昂注册试验数据:学生用Gemini开展Guided Learning后,数学成绩提升0.258个标准差,相当于8周内获得1.2至1.7年常规学习进度;使用频次达标的69%学生显著超越通常5%的自愿教育技术使用率。

    推荐理由:基于塞拉利昂试验数据,展示Gemini Guided Learning在数学提升与学生互动行为上的量化成果,为AI教育落地提供可参考的实证框架。

6月5日周五
  1. Google Research88

    Google 用智能手机前置摄像头在后台被动监测心率

    Google Research 在 Nature 发表 PHRM,利用手机解锁后的面部视频被动估算心率和静息心率,全肤色平均绝对百分比误差低于 10%,静息心率误差低于 5 bpm,同步开源最大规模多样化数据集与预训练模型。

    推荐理由:Google 发布 PHRM 系统,用前置摄像头在日常生活里被动测心率,皮肤各群体误差均达标,数据集同步开源。

5月29日周五
  1. Google Research71

    Google I/O 2026 发布 Gemini for Science、Antigravity 2.0 与 Coralboard,展示研究落地成果

    Google I/O 2026 展示了其研究从实验室到现实应用的广泛进展,涵盖科学发现、医疗健康、边缘计算、核心模型能力及隐私保护等领域。

    推荐理由:全面梳理了 Google I/O 2026 期间发布的关键工具与模型,包括 Gemini for Science、Google Antigravity 2.0、Coralboard 及多项基础研究突破。

5月20日周三
  1. Google Research66

    Google 发布 ERA 科学代码工具并推出计算发现平台

    Google Research 在 Nature 发表论文介绍 ERA,一个使用 Gemini 编写和优化科学代码的工具,并宣布通过 Gemini for Science 开放 Computational Discovery。ERA 在基因组学、公共卫生、神经科学等多个领域的基准测试中达到专家级表现,并已应用于流行病学预测、季节性径流预报、大气二氧化碳监测和零售预测等实际科学问题。

    推荐理由:文章发布了一篇 Nature 论文并公布工具能力,读者可据此评估其在科研代码编写上的实用价值。

5月19日周二
  1. Google DeepMind61

    Google DeepMind 发布科研智能体 Co-Scientist

    Google DeepMind 在官方博客宣布推出科研智能体 Co-Scientist,并分享了 Omar Abudayyeh 与 Jonathan Gootenberg 实验室的实测案例。Co-Scientist 可从数万篇文献中挖掘并提出 20 多项逆转细胞衰老的新遗传因子假说,部分经实验验证成功推动细胞年轻化;同时能将原本需要数月的大规模基因筛选数据分析时间缩短至几天。

    推荐理由:以生物学实验室实测为案例,展示Co-Scientist如何在假说生成与数据解读两个环节压缩科研周期。

5月18日周一
  1. Google DeepMind78

    Google DeepMind 发布 Gemini Omni Flash 视频生成模型

    Google DeepMind 发布 Gemini Omni Flash,可通过图像、音频、视频和文本等多模态输入生成高质量视频,并支持对话式编辑。该模型已面向全球 Google AI Plus、Pro 和 Ultra 订阅用户开放,同时在 YouTube Shorts 和 Create App 中免费推出。

    推荐理由:官方宣布新模型并给出首个落地形态和开放渠道,读者可据此判断视频创作工作流的可用性。

5月16日周六
  1. Google DeepMind75

    WeatherNext如何协助国家飓风中心更准确预测飓风Melissa在牙买加的登陆

    Google DeepMind的WeatherNext AI气象模型协助美国国家飓风中心(NHC)在五天前预测到飓风Melissa将从热带低气压快速增强为五级飓风并在牙买加登陆。这是首次成功预测风暴从低初始风速达到五级强度。WeatherNext作为地球AI计划的一部分,能够同时预测路径和强度,其预测数据已在Search中整合应用于NOAA覆盖区域。

    推荐理由:原文给出了模型与NHC的实际合作结果与可用性细节,读者可以据此理解AI气象模型在紧急预警中的真实价值。

  2. Google DeepMind90

    Gemini 3.5 Flash 发布,兼顾前沿智能与行动能力

    Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,在 Terminal-Bench 2.1 等基准上超越 3.1 Pro,速度为其他前沿模型 4 倍,已在全球 Gemini App 和 Search AI Mode 中作为默认模型,同时推出个人 AI 代理 Gemini Spark。

    推荐理由:3.5 Flash 在速度与前端智能之间取得平衡,提供了部署协作子代理的能力,可用于开发应用、维护代码库等实际任务。