天眼早报
🤖 AI 大模型
𝕏 OpenAI 推出 Appshots 功能,让 AI 理解当前应用界面
OpenAI正式发布Appshots功能,允许ChatGPT Work和Codex获取用户当前应用界面的上下文。用户可通过快捷键⌘🤘⌘快速调用,实现自动填写表单、总结 Slack 对话、生成演示文稿等任务,标志着 AI 从纯文本交互迈向应用级操作的新阶段。
𝕏 Grok 4.6 全面上线,支持复杂问题与智能体查询
xAI宣布Grok 4.6现已在网页端、iOS 及 Android 平台全面开放。新版本重点优化了复杂问题处理能力,并增强了智能体查询(agentic queries)功能,支持构建应用程序,进一步巩固了其在多模态与 Agent 领域的竞争力。
𝕏 Berkeley 发布 FreeToken:8GB 笔记本可运行 35B 模型
Berkeley与UT Austin团队发布FreeToken引擎,通过带宽自适应执行技术,使8GB 内存的游戏本能以39.3 tokens/s速度运行35B 参数模型。该技术将专家缓存命中率从 62% 提升至 84%,大幅降低本地推理延迟,为边缘计算带来突破。
𝕏 Google DeepMind Co-Scientist 从模拟走向真实世界实验
Google DeepMind发布新论文,将Co-Scientist从模拟环境部署至真实实验。系统在计算机领域发现超越六大前沿模型的架构,在化学领域成功合成MXenes及单层MoS2等材料,并在生物学中预测E. coli群体现象,30 位专家审核 450 篇生成论文可靠性显著提升。
𝕏 MiniMax Fast H3 v1 发布,与 NVIDIA 联合加速视频生成
MiniMax宣布推出Fast H3 v1,基于Hao AI Lab的FastVideo框架,与NVIDIA深度合作实现硬件协同设计。该模型作为基础支持开源后训练,显著提升了视频生成的加速效率,是开放生态与硬件设计的典范。
𝕏 智谱 AI 开源 GLM-5.3,支持 100 万上下文与智能体开发
智谱 AI正式发布GLM-5.3模型并开放权重下载。该模型专为复杂软件工程、长周期智能体及网络安全设计,拥有100 万 token上下文窗口,支持可配置推理强度,vLLM 和 Ollama 已实现首日支持。SGLang提供即时推理支持,在 NVFP4 配置下实测达到537.6 tok/s/user,全面适配NVIDIA Blackwell、Hopper 及AMD MI300X等硬件。
𝕏 Perplexity Search API 登顶 Artificial Analysis 榜单
Perplexity搜索 API 在Artificial Analysis基准测试中,中等上下文版本得分80,超越Parallel和Brave。其单次任务成本低至**$0.091**,且具备高效载荷能力,成为当前最具性价比的搜索工具之一。
𝕏 Meta Muse Image API 上线,单价低至$0.01/张
Meta正式推出Muse Image模型 API,定价为**$0.01/张**,提供极具竞争力的价格质量比。该模型已集成至 Meta 模型 API,适合大规模生产场景使用,标志着高质量图像生成进入低成本时代。
𝕏 Tencent Hy4 Preview 在 SWE-bench Pro 领先
Tencent发布Hy4 Preview模型,参数量达770B,激活参数49B,上下文窗口1M。该模型在SWE-bench Pro基准测试中取得领先成绩,展示了开源权重模型在代码理解与生成领域的最新突破。
𝕏 Anthropic 发布自动化对齐研究:Claude 48 小时独立优化模型安全
Anthropic发布新研究,Claude在48 小时内利用1 块 GPU自主完成小模型的对齐训练与测试,成功提升安全分数至接近生产级Opus 4.8水平。同时,Anthropic开源其自动化对齐研究设置,展示Sonnet 5通过后训练使早期Opus 4.8检查点达到接近生产级的安全评分。
🟩 Google Gemini App 月活突破 10 亿,成公司增长最快产品
Google宣布Gemini App月活跃用户数超过10 亿。数据显示,约63%的用户通过语音交互,每日生成图片超1.5 亿张,iOS 活跃用户达1 亿,标志着其成为谷歌历史上增长最快的产品。
𝕏 Agent = Model + Harness:生产级 AI 智能体工程六层实战手册
Mitchell Hashimoto等编撰的实战手册指出,仅优化Harness(工程基础设施)而非模型,可使Claude Sonnet 4.5在 GAIA 基准上得分提升43.64 分。报告提出引导、传感、执行循环、记忆、权限、可观测性六层架构,并强调“棘轮原则”以固化错误修复。
𝕏 a16z 发布 11 亿美元 Machine Age Fund,押注 AI 物理基础设施
a16z宣布成立规模达11 亿美元的Machine Age Fund,专注于芯片、内存、网络、系统软件及能源等AI 物理基础设施。该基金已预订至2028 年,旨在解决模型迭代速度远超底层硬件能力的瓶颈问题。
𝕏 Google DeepMind Gemini Omni 1.1 Flash 推出,视频生成更可控
Google DeepMind推出Gemini Omni 1.1 Flash,旨在使生成式视频更具可控性且迭代更快。新模型支持Flow by Google等平台,针对生产级应用进行了打磨,提升了视频生成的稳定性和效率。
EVENT-DRIVEN INTELLIGENCE
免费先跟踪重点,再决定是否升级
每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。