
ARC Prize 公布 DeepSeek V4 Flash 0731 的 ARC-AGI 验证成绩:max effort 下 ARC-AGI-1 通过率 89.0%(每任务 $0.02)、ARC-AGI-2 通过率 61.4%(每任务 $0.04),与 GPT-5.6 Luna 相当但成本低约 2 倍。官方称其 agent 能力远超 V4-Pro-Preview,权重已开源可单卡 MI300X 运行。DeepSeek 同时预告 API 价格将大幅上调。
2026/8/9
3 次阅读

美国能源部(DOE)宣布启动 Genesis Open Models Initiative,与 Arcee AI 合作推出首个开放权重科学模型 Genesis-Science-1。该模型为万亿参数级,面向材料、能源、聚变、生物等科研场景,权重与技术报告计划今年晚些时候公开发布。
2026/8/8
6 次阅读

8 月 6 日,阿里 Qwen3.8 Max 被 Artificial Analysis 评为 Agentic Index 综合第一,2.4T 参数首次开源 Max 级权重;OpenAI 同日更新 GPT-5.6 Sol,并把 Luna 设为免费用户默认模型、开放无限文本聊天。
2026/8/7
6 次阅读

开发者 ryanzhou 开源了把 DeepSeek-V4-Flash-0731(304B 参数)完整部署到单张 AMD MI300X 的配置与补丁,不量化不卸载权重,单流解码 168.6 tok/s,HN 当日 365 分。
2026/8/5
4 次阅读

Mistral 于 8 月 4 日发布 Shieldstral,一个 3B 参数的开放权重多模态安全分类器(Apache 2.0)。它把内容审核建模为策略自适应问答,推理时输入自然语言政策即可返回校准安全分数,无需重训,文本与图像统一处理。
2026/8/5
4 次阅读

OpenAI 8 月 1 日公布,下一代模型家族 Astra 的内部版本解决了数学、量子复杂性与理论计算机科学领域 10 个开放超过十年(多数更久)的问题,覆盖球体堆积、非 sofic 群、Connes 刚性猜想、量子并行重复等方向,全部证明通过 Lean 形式化验证。按 Sol API 价格计算,找到这些解的总 token 成本约为 2000 美元。
2026/8/3
8 次阅读

字节跳动 Seed 团队 7 月 31 日发布新一代视频创作模型 Seedance 2.5。单次生成时长从 15 秒翻倍至 30 秒并支持多轮延长,多模态参考支持单次输入 30 张图片、10 段视频、10 段音频,新增时间戳级精准编辑。已上线即梦 AI 和豆包专业版,API 即将登陆火山方舟。
2026/8/2
8 次阅读

7 月 31 日,DeepSeek 发布 V4-Flash-0731 正式版,agent 能力全面升级,Terminal Bench 从 56.9 涨到 82.7,价格保持输入 $0.14/输出 $0.28 每百万 token。MiniMax 同一天发布 H3 全模态生成模型,2K 视频带原生立体声,计划数天内开源权重。
2026/8/1
7 次阅读

OpenAI 宣布 GPT-5.6 Luna 降价 80%,通过内核优化节省了 20% 推理成本。Google DeepMind 发布 Gemini Robotics 2,机器人终于能看懂视频,还能组队干活。两个消息同一天出来,隔空打了场擂台。
2026/7/31
8 次阅读

微软发布首款网络安全专用 AI 模型 MAI-Cyber-1-Flash,集成于 MDASH 多智能体漏洞修复平台,CyberGym 评分 96%,成本降低 50%。
2026/7/29
3 次阅读

月之暗面于 7 月 27 日开源 Kimi K3 模型权重,这是全球首个开放的 3T 参数级大模型。Kimi K3 采用 MoE 架构(896 专家/16 活跃),拥有 100 万 token 上下文窗口,在编码、知识工作和多模态任务上表现出色。
2026/7/28
10 次阅读

Anthropic 发布 Claude Opus 5,定价 $5/$25 每百万 token(与 Opus 4.8 相同),在 Frontier-Bench、CursorBench、OSWorld 等多项基准测试中刷新纪录,智能水平接近旗舰 Fable 5,成本仅为其一半。
2026/7/25
3 次阅读