跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

最新精选

第 21–30 条 · 共 30 条
7月8日周三
  1. Hugging Face Blog72

    vLLM 升级 transformers 建模后端,实现 native 级推理速度

    vLLM 通过 torch.fx 静态分析和 AST 重写,对 transformers 模型动态应用推理专用层融合,使 Qwen3-4B/32B/235B MoE 等架构在 transformers 后端达到或超越手写 native 实现的吞吐量。用户只需添加 --model-impl transformers 参数即可使用,并行策略和编译能力保持不变。

    推荐理由:vLLM 升级 transformers 后端实现 native 级推理速度,模型作者无需重写代码即可获得高性能部署。

7月7日周二
  1. Berkeley AI Research66

    智能体时代的数据系统:为、由、经智能体构建

    伯克利AI研究所提出,随着推理成本降至接近免费,数据系统面临三大挑战:为智能体重构、支持智能体群协同记忆与容错、以及让智能体自合成定制化数据系统。文章详细探讨了代理推测优化、结构化记忆与可验证合成等研究方向。

    推荐理由:从推理成本大幅下降出发,系统梳理了智能体时代数据系统的三个新挑战及研究方向。

  2. Hugging Face Blog72

    SkyPilot 新增 Hugging Face Storage 支持,跨云运行 AI 任务零出口费用

    SkyPilot 新增 store: hf 后端,支持通过 hf:// URL 将 Hugging Face Bucket 或任何 Hub 仓库挂载到任务中,复用已有 HF_TOKEN 即可在 AWS、GCP、Lambda 等 20+ 云或私有集群上调度 GPU。

    推荐理由:SkyPilot 新增 store: hf 支持,Hugging Face Storage 零 egress 费用,跨云调度 GPU 时读取 Hub 数据不再产生网络传输成本。

6月27日周六
  1. Google Research70

    谷歌研究:冻结多 Token 预测加速 Pixel 端侧 Gemini Nano 推理

    谷歌研究博客发文介绍将多 Token 预测(MTP)改造并部署到 Pixel 9 和 10 系列的 frozen Gemini Nano v3 模型上。方案在模型最终层附加轻量 Transformer 头,直接 cross-attend 主模型 KV 缓存,避免独立 Draft 模型带来的双倍内存开销;主模型参数冻结,不改变输出语义和对齐结果。

    推荐理由:谷歌公布端侧推理优化方案,在冻结的 Gemini Nano 模型上叠加 MTP 头,实测 Pixel 提速 50% 以上。

6月5日周五
1月22日周四
  1. Mistral AI67

    Mistral 排查 vLLM 拆分推理中的内存泄漏

    Mistral AI 团队在预发布中发现了使用 Mistral Medium 3.1 和图编译的 vLLM 拆分推理场景下出现每小时约 24GB 的内存泄漏。经过 Heaptrack、pmap、BPFtrace 和 GDB 自动化排查,最终定位为 UCX 的 mmap hook 机制导致内存累积。

    推荐理由:原文披露了使用Heaptrack、pmap、BPFtrace和GDB自动化定位vLLM内存泄漏的全过程,可迁移至同类系统。

12月17日周三
  1. Mistral AI80

    Mistral AI发布OCR 3,综合胜率较上代提升74%

    Mistral AI发布OCR 3模型,在表单、扫描件、复杂表格和手写内容上的综合胜率达到74%,输出支持含HTML表格标签的Markdown结构化结果。模型mistral-ocr-2512已开放API,并在Mistral AI Studio的Document AI Playground中可用,标准价格为2美元/千页,批量API折扣后为1美元/千页,同时提供私有化部署选项。

    推荐理由:明确了Mistral OCR 3在表单与手写等场景的能力跃升和具体定价,可据此评估文档处理工作流的升级价值与成本变化。

12月9日周二
  1. Mistral AI82

    Mistral AI 发布 Devstral 2 开源代码模型及配套 Vibe CLI

    Mistral AI 发布下一代开源编码模型 Devstral 2(123B 参数)和 Devstral Small 2(24B 参数)。Devstral 2 在 SWE-bench Verified 上达到 72.2%,显著低于 DeepSeek V3.2 和 Kimi K2 的参数量,支持 256K 上下文窗口,采用修改版 MIT 许可证开源。

    推荐理由:Mistral AI 发布 Devstral 2 系列 coding 模型,提供 SOTA 性能与成本效益对比数据,并同步推出配套 CLI 工具。

7月30日周三
  1. Mistral AI77

    Mistral AI 发布 Codestral 25.08 及完整企业编码栈

    Mistral AI 宣布 Codestral 25.08,接受补全提升 30%、生成漂移减少 50%。同时发布 Devstral、Codestral Embed 和 Mistral Code IDE 插件,支持云/VPC/本地私有部署,面向金融、医疗等监管行业推出企业级编码栈。

    推荐理由:发布了面向企业的完整编码栈并给出了量化升级,私有化部署的架构信号清晰,影响企业选型落地。

5月7日周三
  1. Mistral AI80

    Mistral Medium 3 发布:比 Claude Sonnet 3.7 低 8 倍成本,超越 Llama 4 Maverick

    Mistral AI 发布 Mistral Medium 3,API 输入价格 $0.4/M token、输出 $2/M token,综合性能达到 Claude Sonnet 3.7 的 90% 以上,超越 Llama 4 Maverick 和 Cohere Command A,支持 4 GPU 以上私有化部署。

    推荐理由:Mistral Medium 3 在 API 定价上比 DeepSeek v3 更便宜,在性能上接近超大模型,适合需要低成本部署的编码和企业场景。