sama 直接点出 5.6 Sol 是当前世界上最好的模型,基于多项 benchmark 和 Elon 的关注度判断
展开原文
热门回复 3
@OpenAI #keep4o #keep41 #keep51 #keepo3 #keep41 #keep51 #keep5 #keep45
I had to ask the rat which screen you were on. 🐀🔍
Still loading… ⏳ https://t.co/IcyfPO0z6V
OpenAI GPT-5.6 Sol 系列模型在健康问答、设计、前端开发等多个领域展示出色性能。特别是 Sol 模型在健康问答中被医生评为错误更少,价格仅为 Fable 的一半但效率是其两倍。在前端开发中,Sol 表现出 6 倍的成本效益优势。
sama 直接点出 5.6 Sol 是当前世界上最好的模型,基于多项 benchmark 和 Elon 的关注度判断
Sol 在许多任务上只需 Fable 一半的成本且效率是其两倍,价格优势明显
医生盲评发现 GPT-5.6 回答的错误更少,这是医疗 AI 发展的重要里程碑
GPT-5.6 模型在设计领域表现出色,让人感慨其能力提升
Sol 在 React/前端开发中比 Fable 贵 6 倍但性能更好,成本效益优势显著
GPT-5.6 Sol 在 Design Arena 评选中获得 1353 Elo 得分,位列第一并创造新纪录
Sol 模型在网页设计方面能力出众,用户展示了从照片中提取服装信息并生成新搭配的应用
团队使用数据显示 30% 的成本来自 Fable,说明 Sol 在性价比上的优势
Sol Ultra 成功解决数学领域存在 50 年的 Cycle Double Cover Conjecture 猜想
Sol Pro 解决统计学中存在多年的 Benjamini-Hochberg 程序 FDR 控制问题,证明了其在复杂推理方面的能力提升
GPT-5.6 Sol/Terra/Luna 三种模型在 AWS Bedrock 上正式可用,提供不同推理需求的选择
OpenAI 将 ChatGPT 和 Codex 整合为工作空间,支持云端任务执行和多设备协作。用户可在手机或网页上启动任务,继续在桌面完成,实现无缝切换。同时推出了 ChatGPT Sites 等新功能,让非编程任务也能通过 AI 协助完成。
Codex 和 ChatGPT Work 的使用量在一周内增长 2.5 倍,显示出用户对新功能的热情
Codex 可用于寻找初创公司客户,通过分析公开信号生成个性化 outreach 报告
Agentic Coding Environment (ACE) 被认为是 IDE 的自然继任者,代表了编码环境的未来方向
AI 辅助编码能力发生转变,从提升低技能程序员效率转向成为高技能程序员的强大工具
ChatGPT Work 让用户可以轻松提问并获得深入研究和全面回答,极大提升工作效率
ChatGPT Work 在移动端和网页端支持 Codex 功能,实现设备无关的任务执行
ChatGPT Sites 允许用户将想法快速转化为可发布的应用或仪表盘,简化企业内部分享
Visualize 插件让 Codex 可以创建交互式模拟,如行星模拟器,增强了可视化能力
ChatGPT Work 可用于处理体育赛事相关任务,展示了其在各类场景的适用性
OpenAI 重申对 Codex 的支持,澄清了关于 Codex 被边缘化的担忧
Thinking Machines 推出首个开源模型 Inkling,参数规模 975B,支持文本、图像、音频多模态推理。模型在 Tinker 平台上可用,并在 HuggingFace 提供。团队强调这是一个基础模型,未来将训练更高性能的版本。
Inkling 是 Thinking Machines 的首个开源模型,支持多模态推理,致力于降低对中心化 AGI 公司的依赖
Inkling 在架构上有创新之处,如小型卷积层、RMSNorm 嵌入层、相对位置偏置等设计
Lilian Weng 强调 Inkling 旨在成为广泛能力的基础模型,支持实践和定制
Modal 为 Inkling 训练了 DFlash speculator,提升推理速度 67%,展示了生态系统的快速适配
Thinking Machines 致力于个性化、人类参与和去中心化,推出 Tinker 等产品让用户能够塑造 AI