跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

最新精选

第 21–28 条 · 共 28 条
3月18日周三
  1. Google Research72

    Google Research 发布医疗AI多智能体与开源模型进展

    Google在The Check Up活动上发布医疗AI最新进展,推出多智能体系统AMIE用于解读病历与影像,并展示开源医疗模型MedGemma在印度和等地中的应用,同时披露与NHS合作提升乳腺癌检测率的成果。

    推荐理由:原文系统介绍了Google在医疗AI方向的最新研究与产品进展,涵盖多智能体系统与开源模型,读者可据此了解其技术路线与临床落地情况。

3月17日周二
  1. Mistral AI84

    Mistral Small 4 发布,整合 Magistral 与 Pixtral 能力

    Mistral AI 发布 Mistral Small 4,整合 Magistral 推理、Pixtral 多模态和 Devstral 编码智能体能力,为 119B MoE 模型,支持 256k 上下文,可按 reasoning_effort 切换速度或深度推理,开源并首批接入 NVIDIA Nemotron Coalition。

    推荐理由:统一推理、多模态与编码能力并提供可配置推理力度,兼顾开源与部署效率。

3月12日周四
12月3日周三
7月17日周四
  1. Mistral AI70

    Mistral Le Chat 新增深度研究、语音模式和 Magistral 推理

    Mistral AI 宣布 Le Chat 推出多项新功能,包括 Deep Research 预览模式用于生成结构化研究报告,搭载 Voxtral 模型的语音交互模式,以及基于 Magistral 推理模型的原生生多语思考模式。

    推荐理由:官方介绍了深度研究、语音交互和原生生多语推理等新增能力,可据此评估 Le Chat 在工作流中的实用程度。

3月17日周一
  1. Mistral AI80

    Mistral AI 发布 Mistral Small 3.1 开源模型

    Mistral AI 发布 Mistral Small 3.1 开源模型,支持多模态理解与最高 128k tokens 上下文窗口,推理速度达 150 tokens/秒,可在单张 RTX 4090 或 32GB RAM Mac 上运行,以 Apache 2.0 授权在 Hugging Face 开放下载并上线 API 与云端平台。

    推荐理由:官方宣布模型在轻量级类别中性能领先,给出上下文窗口、推理速度等具体数字和部署门槛,便于评估落地可行性。

3月7日周五
  1. Mistral AI78

    Mistral 发布 Mistral OCR API

    Mistral AI 发布 Mistral OCR,是一款可提取图片、PDF 中文本、表格、公式和图像的 API,默认整合进 Le Chat,API mistral-ocr-latest 已在 la Plateforme 上线,定价约 1000 页/美元。

    推荐理由:Mistral发布官方OCR API,支持图文表公式提取并可直接用于RAG。