OpenAI 推出 ChatGPT Images 2.5
OpenAI 发布 ChatGPT Images 2.5,支持将用户的创意、草图及参考照片转化为更具个性化、更精致的图像。新版本能更好地还原用户的想法,提升图像生成的个性化程度与完成度。
OpenAI 发布 ChatGPT Images 2.5,支持将用户的创意、草图及参考照片转化为更具个性化、更精致的图像。新版本能更好地还原用户的想法,提升图像生成的个性化程度与完成度。
Hugging Face Diffusers 正式引入 Nunchaku Lite,原生加载基于 SVDQuant 的 4-bit 权重和激活(W4A4)检查点,无需自定义 Pipeline 或本地 CUDA 编译。
推荐理由:原文给出了 W4A4 量化方案在 Diffusers 中的原生接入方式和实测速度收益,开发者可直接判断如何在消费级显卡上运行扩散大模型。
Photorium 发布了 PRX 系列第 4 篇,讲自己怎么拼 PRX 的预训练数据。语料来自公开与内部数据集的混合,统一用 VLM 做长 caption;探索阶段把数据存成 Lance,训练时再转成 MDS shard,顺便做了分辨率与长宽比分桶、基于 perceptual hash 的去重、以及文本分类过滤(视觉/文字/NSFW)。
推荐理由:原文拆解了 PRX 的数据管道:从公开与内部数据源混合构建预训练语料、用 VLM 长 caption、Lance 探索再写 MDS,读者可据此复现大比例图生图的数据工程思路。
Google DeepMind 宣布推出 Nano Banana 2 Lite 和 Gemini Omni Flash,并已在 Google AI Studio、Gemini API 及 Gemini 应用等产品中上线。
推荐理由:官方公布两款新模型的能力指标、定价和接入入口,开发者可直接对照选择适合的图像或视频生成方案。