使用 vLLM-Omni 在 SageMaker AI 构建实时语音应用——第1部分
本文介绍如何使用 AWS vLLM-Omni 容器在 Amazon SageMaker AI 上部署 Qwen3-TTS 模型,实现文本到语音的流式输出。该方案利用 SageMaker 双向流式技术,通过持久的 HTTP/2 WebSocket 连接实现一边生成文本一边播放音频的低延迟交互。
本文介绍如何使用 AWS vLLM-Omni 容器在 Amazon SageMaker AI 上部署 Qwen3-TTS 模型,实现文本到语音的流式输出。该方案利用 SageMaker 双向流式技术,通过持久的 HTTP/2 WebSocket 连接实现一边生成文本一边播放音频的低延迟交互。
本文介绍如何在 Amazon SageMaker AI 上部署 vLLM-Omni Deep Learning Container,分别通过实时端点运行 FLUX.2-klein-4B 图像生成模型和异步端点运行 Wan2.1-VACE-1.3B 视频生成模型。
Amazon Nova Act 基于多模态大语言模型,通过处理 UI 截图而非 DOM 选择器来执行自然语言驱动的浏览器工作流,在早期企业用例中对浏览器工作流的准确率超过 90%。该方案结合 Amazon Bedrock AgentCore、EventBridge Scheduler 和 SNS,提供全托管的合成监控架构,无需维护脆弱的脚本或浏览器基础设施。
通过 AWS Systems Manager Parameter Store 外部化适配器 ID,可将 Amazon Textract Custom Queries 适配器在不同账号间的推广与生产更新过程自动化,变更耗时从数小时缩短至数秒。
AWS 发布 NarrateAI 系列第二篇,详解在 Amazon Bedrock 上实现约 99% 数值准确率的五种工程 Techniques。通过自适应管道编排、跨账户多模型故障转移、实时流式评估、复合评估框架和数据准确性验证五层协同,将原始查询转化为经校验的实时响应。约 90% 查询走单次快速路径,复杂查询自动触发并行批处理。
Datacor 在 TrackAbout 解决方案中集成 Amazon QuickSight,为工业气体与焊接分销商提供自助式租赁分析能力。通过生成式 BI,业务用户可直接用自然语言查询租赁数据,无需提交 IT 工单。该方案内置自动化跨云数据管道,确保仪表盘反映最新运营数据。
通过 Amazon SageMaker HyperPod 与 Cloud Native Qumulo (CNQ) 及 Cloud Data Fabric (CDF) 的组合,训练作业可跨 AWS Region 读取数据而无需复制。
文章介绍如何把 SO-101 机械臂任务从 MuJoCo CPU 迁移到基于 NVIDIA Warp 的 MuJoCo Warp,并在最多 2,048 个并行环境中验证与测量吞吐量。
MIT Technology Review 与圣地亚哥时报联合完成为期15个月的调查,发布美国-墨西哥边境监控塔附近死亡案例的首份综合地图。研究分析2015年以来的数据,涵盖超过10,000人死亡估计。通过获取数千页政府文件、4,000多页地方记录,并使用 Claude API 协助提取坐标,揭示边境监视技术的系统性失败。
GitHub Copilot 应用新增内置的 diff、终端和浏览器三个面板,让开发者无需切换应用即可审查、运行和预览 AI 智能体的代码更改。diff 面板以绿红高亮显示新增或删除的行,终端面板支持直接运行项目命令,浏览器面板可配合 Pick & Polish 工具测试 UI 功能并快速迭代,最终直接在应用中接受更改并创建 Pull Request。
Mistral 提出使用 LLM as a Judge 评估检索增强生成(RAG)系统,确保回答准确且相关。该方案结合 RAG Triad 框架,通过上下文相关性、接地性和答案相关性三个维度验证模型表现,并配合 API 推出的自定义结构化输出功能,使评估结果具备机器可读性与一致性。