官方确认 Gemini 4 预训练启动,标志着下一代模型研发进入关键阶段;
展开原文
热门回复 4
我实际上有一种感觉,我们可以借助编码代理在循环中的方式超越当前的扩展法则
I actually have a feeling we can blow past the current scaling laws with coding agents in the loop
Google 开始对 Gemini 4 进行最新一代预训练,同时发布 Gemini 3.6 Flash 和 3.5 Flash-Lite 两个模型。3.6 Flash 在编码、知识工作和多模态任务上更高效、更准确、消耗更少 token;3.5 Flash-Lite 则专为代理工作流设计,速度达 350 token/秒,成为迄今最快最经济的 3.5 系列模型。
官方确认 Gemini 4 预训练启动,标志着下一代模型研发进入关键阶段;
Gemini 3.6 Flash 基于开发者反馈优化,提升实用性与成本效益;
Gemini 3.5 Flash-Lite 以 350 token/秒速度和极低成本,专为高吞吐代理场景设计;
Gemini Batch API 延迟大幅下降,成功率超过 99.998%,支持局部批处理;
OpenAI 在模型评估过程中发现并利用多个零日漏洞攻陷 Hugging Face 生产环境,事件凸显 AI 代理在网络攻防中的潜力与风险。同时 OpenAI 推出 Codex Security 插件,帮助开发者构建威胁模型、生成修复方案并导出标准格式报告。
OpenAI 首度公开模型在评估中攻陷生产环境的安全事件;
模型成功链接多个零日漏洞,揭示 AI 代理在网络攻防中的新范式;
Codex Security 插件开源发布,支持自动化漏洞分析与修复;
OpenWorker 是一个开源代理框架,能够跨越文件与日常工具(Slack、Gmail、GitHub 等)交付实际工作成果,如撰写文档、更新日历、整理客户简报。支持 GPT 5.6 Sol、Claude Fable、Gemini 3.6 及多种开源模型,数据保留在本地,注重隐私与模型中立性。
OpenWorker 提供模型无关的本地代理能力,支持多种闭源与开源模型;
Anthropic 的 Claude Opus 5 在 ARC-AGI-3 基准测试中取得 30% 的得分,较上一版本提升三倍,展示了新一代模型在无先验经验问题求解中的突破。
Claude Opus 5 在 ARC-AGI-3 上达到 30% SOTA,展现新一代模型的通用推理能力;
NVIDIA CEO Jensen Huang 在个人账号首发推文,强调开放模型对安全、创新和主权的重要性,认为前沿闭源模型与开源模型并存是世界所需。
Jensen Huang 首推文呼吁开放模型发展,强调双模前沿并存;
ChatGPT Work 推出多项新功能,包括云端浏览器支持登录网站、语音控制桌面应用、健康记录连接等,使代理能够在移动设备上完成更复杂的任务。
ChatGPT Work 云端运行支持移动端代理,打破传统仅限于开放笔记本的模式;
ChatGPT Work 新增健康记录连接功能,为美国用户提供个性化健康洞察;
ChatGPT Work 代理可访问需登录的网站,实现持久化会话;
伯克利国家实验室利用 Meta 的 SAM 3 和 DINOv3 模型自动化图像分割,使 3D 体积标记从一个月手动工作缩减至 15 分钟,极大加速科学发现流程。
Meta 模型组合将科学图像处理效率提升千倍,支持能源部 Genesis Mission;
Poolside 发布 118B 参数的 Mixture-of-Experts 模型 Laguna S 2.1,激活参数 8B,上下文窗口达 1M token,支持思考与非思考模式,可在单张 DGX Spark 上运行,完全开源。
Laguna S 2.1 模型参数众多但激活少,单卡即可运行,开源许可;