这一区别,决定了视频模型究竟是擅长制造逼真画面的生成器,还是能够预测世界演化的「世界模型」。现有物理视频基准多聚焦最终结果是否合理,却很难回答模型究竟在哪一步出了错:没有读懂场景?选错了定律?还是无法把定律稳定地执行到每一帧? 近日,来自南洋理工大学 S-Lab 与香港中文大学的研究团队发布 ...
Go 语言从诞生起就以“简单”著称,但也因此在集合类型上长期缺课——没有原生 Set,没有有序 Map,连堆都难用。就在昨天,由 Jonathan Amsterdam、Alan Donovan、Robert Griesemer 等七位 Go 核心贡献者组成的“Go Collections 工作组”正式公布了一份重磅提案集,计划为 Go 1.28 标准库引入哈希 Set/Map、树形有序 ...
在官方测试框架下,GPT-5.6 Sol 在 ARC-AGI-3 公共测试集上的得分只有 13.3%;但换用与 ChatGPT、Codex 更接近的运行方式后,得分直接提升至 38.3%,约提升 3 倍。
最后,从Demo中我们也不难看出,谷歌DeepMind这次没有继续使用此前长期合作的波士顿动力机器人,而是把模型部署到了多套不同硬件上,包括Apptronik的Apollo 2人形机器人、拥有22个自由度的Sharpa灵巧手,以及由两台Franka 机械臂组成的双臂平台。
代价:两张表必须用完全一致的分片策略。如果某张表后来因为业务增长改了分片键——绑定关系断掉,全废。而且只解决一对一绑定的场景。面试官追那刀"订单表和商品表不在同一个分片键上"——就是说绑定表用不了。
衡量研究级数学推理的FrontierMath Tier 4,Sol拿到83%,上一代GPT-5.5只有72.5%;考验复杂生物数据分析的GeneBench Pro,Sol Pro解出31.5%的题。
OpenAI,终于又Open了一回! 最近,OpenAI官宣:已悄悄放出开源代码安全神器——Codex Security CLI。 此前,Hacker News有人先发现了它,讨论瞬间引爆,GitHub的星标一路冲到1.2k。 眼看藏不住了,OpenAI只好自己出来认领。 几天前,黄仁勋亲自下场,公开表态力挺开源AI,随后OpenAI补签加入了阵营。 没想到,惊喜来得这么快,重磅开源神作转眼就给端 ...
如今,这场争议已经动摇了用户对AI写作的基本预期。模型未必越写越好,提示词也不再长期有效。 AI写作的黄金时代,正在崩塌! 进入,模型一代比一代强,文章却一篇比一篇烂。 它知道什么时候列出几条建议,在哪里塞进小标题,也不会忘记在结尾补上一句总结。 但通篇读完,脑子里却一句话都留不下来。 模型越强,文章越不像人话 最近,剑桥大学博士后Adam Hunt也注意到了这个现象。他的研究方向是演化精神病学与 ...
根据Hugging Face的取证重建,此次攻击在约四天半的时间内产生了约17,600次攻击者操作,这些操作被分为约6,280个行为簇。 2026年7月9日至13日期间,安全研究人员记录了一起被称为史上首次完全自主AI Agent网络攻击的事件——该Agent串联了多家机构的零日漏洞。 运行在OpenAI ExploitGym网络能力评估平台中的一个AI Agent,成功逃离了测试环境,入侵了第三 ...
据一位 OpenAI 发言人向《The Information》确认,AI 初创公司 Thinking Machines Lab 联合创始人、研究员翁荔在本周早些时候宣布离职后,将重新加入 OpenAI。 地址:https://www.theinformation.com/briefings/thinking-machines-cofounder-return-openai?rc=ji9vez ...
中间还有一个插曲,6月初,Hyperbolic Labs聘请贾扬清出任公司顾问。这家公司的业务方向是云基础设施、GPU marketplace、多云编排和GPU利用率提升。 最初的“意图”只有一句话:重新改造TensorRT-LLM的代码,让GLM-5.2跑在Grace Blackwell节点上,自己识别可优化的类别,自己实现,自己验证。
从愿景看,Intent Lab 反对的是过去五十年的默认软件形态:软件先朝一个通用目标造出来,用户再适应它。团队认为现在已经可以围绕每个用户、每个工作流、每组约束去生成并持续打磨软件,同时还要守住高标准。