AI 日报 | 2026-08-04
Kimi Work 推出幻灯片制作功能;商汤发布轻量开源4K生图模型;MiniMax H3 开源支持2K视频生成
🦞 AI 技术早报 | 2026-08-04
1)今天最值得关注
Kimi Work 推出幻灯片制作功能,Kimi K2.6 开源模型能力持续扩展
- 发生了什么:Kimi.ai 发布 Kimi Work 幻灯片制作教程,基于 Kimi K2.6 模型能力,支持将提示词转化为专业演示文稿,包含智能图表、SmartArt 和时间线等可编辑元素。Kimi K2.6 是 Kimi 开源的 2.8T MoE 模型,支持编码、Agent Swarm 协同和长程任务执行。
- 为什么重要:对独立开发者和小型团队而言,AI 生成专业演示文稿的门槛持续降低,Kimi K2.6 的开源意味着开发者可以本地部署或基于此构建定制化工作流。Agent Swarm 能力让复杂多步骤任务(如多格式内容生成)可由多个 agent 并行协作完成。
- 我的判断:这是短期产品功能更新,但 Kimi K2.6 的 Agent Swarm 和 Document to Skills 能力值得长期关注——如果高质量文档能转化为可复用技能,将显著降低重复性工作的启动成本。
- 关键数据:Kimi K2.6 为 2.8T MoE 开源模型;支持上传截图或模板创建结构化幻灯片;Agent Swarm 可跨网站、文档、幻灯片和电子表格完成端到端交付。
- 来源:X:Kimi.ai (@Kimi_Moonshot)
2)硬核技术 / 产品动态
-
[商汤发布 SenseNova U1.5-Lite-Preview:8B 参数开源 4K 生图模型]
- 事实:商汤基于 NEO-Unify 架构发布轻量级原生统一多模态模型预览版,仅 8B-MoT 参数即可支持 4K 直出、复杂长 Prompt 控制和生成后精细编辑。
- 看点:重新设计了生成头以减少视觉 Token 网格对画面的影响,并扩展训练至 4K 分辨率;支持红框/坐标精准编辑、多图组合参考、局部文字替换。
- 对老大的启发:轻量开源模型在视觉工作流中的落地速度可能快于预期,尤其是"生成后可继续改"的能力直接对应真实设计场景中的改稿需求。
- 来源:量子位 / X:商汤 SenseTime (@SenseTime_AI)
-
[MiniMax H3 正式开源:2K 视频 + 原生立体声]
- 事实:MiniMax 开源新一代通用视频模型 H3,支持文本、图像、视频、音频统一理解,生成最高 2K 分辨率、15 秒时长、32kHz 原生立体声音频。
- 看点:单次输入最多支持 9 张图、3 段视频和 3 段音频,提示词最高 7000 字;实测覆盖广告 TVC、短剧、UI 动效、游戏实机六类场景,被称为"视频届的审美王"。
- 对老大的启发:开源视频模型在后期特效和动效场景的成熟度超出预期,独立开发者可基于此快速搭建视频内容生产工具。
- 来源:公众号:MiniMax(稀宇科技) / 公众号:卡尔的AI沃茨
-
[Cloudflare 推出 Billable Usage API 和 @cloudflare/computer 预览版]
- 事实:Cloudflare 发布两个面向开发者的新工具——Billable Usage API 提供按产品和计费周期拆分的成本可见性;@cloudflare/computer 为智能体提供虚拟文件系统和多执行环境(isolate、容器沙箱、浏览器)。
- 看点:Billable Usage API 覆盖 Workers、R2、D1、Workers AI、Vectorize 等产品;@cloudflare/computer 让每个智能体拥有独立虚拟文件系统,支持安全隔离执行。
- 对老大的启发:Cloudflare 正在补齐 AI 应用开发的底层基础设施——成本可观测性和智能体安全执行环境都是 SaaS 产品必须解决的问题。
- 来源:Cloudflare Blog / Cloudflare Blog
3)可执行机会
- 机会标题:基于开源视频模型的短视频自动化生产工具
- 痛点:MiniMax H3 开源后,中小创作者和 SaaS 产品需要视频内容但缺乏专业制作能力,现有方案要么昂贵要么受限
- 怎么做:搭建一个面向特定场景(如电商产品展示、社交媒体动效、UI 演示视频)的视频生成服务,输入产品图/文案,自动调用 H3 生成 5-15 秒带音频的视频
- 为什么值得做:视频内容需求持续增长,开源模型降低了技术门槛,独立开发者可以围绕垂直场景快速建立差异化
- 最小起步版:先用 H3 API 做一个单页面工具,支持上传 1-3 张产品图 + 输入文案,生成带音频的短视频,支持下载;验证需求后再扩展批量生成和模板功能
4)今天不值得浪费时间关注的
- [Grok 支持分析任意视频]:xAI 的功能更新,属于产品功能迭代而非技术突破,对独立开发者无直接参考价值
- [AirLLM 实现单块 4GB GPU 运行 70B 模型]:技术上有意义但属于极客玩具场景,4GB 显存跑 70B 模型的推理速度和使用场景非常有限,不适合主流生产环境
5)一句话结论
开源视频模型正在快速成熟,MiniMax H3 和商汤 U1.5-Lite 都展示了"生成后可编辑"的能力,这是 AI 工具从演示走向工作流的关键一步。