AI找出数学反例推翻论文,作者确认!453篇手稿,AI开始自己出题了
AI找出数学反例推翻论文,作者确认!453篇手稿,AI开始自己出题了思特雅大学曾仔健搭建的AI Has Taste项目公开453份数学研究手稿和6篇AI-Proposed Conjectures,其中AI曾构造反例推翻论文猜想并获原作者确认,该系统通过多Agent协作将失败转化为新一轮研究输入,推动AI从生成答案走向生成研究议程。
搜索
思特雅大学曾仔健搭建的AI Has Taste项目公开453份数学研究手稿和6篇AI-Proposed Conjectures,其中AI曾构造反例推翻论文猜想并获原作者确认,该系统通过多Agent协作将失败转化为新一轮研究输入,推动AI从生成答案走向生成研究议程。
阿里云在2026云栖大会上披露面向企业级AI Agent的Agent Sandbox技术架构,该沙箱以安全隔离、弹性供给、状态保持和大规模并发能力为核心,每分钟可创建10万个沙箱,并已在阿里云百炼、MiniMax、Moonshot Kimi等场景落地应用。
BenchJack 之后,reward hacking 检测还缺什么? Agent 在 benchmark 上拿到高分,未必真正完成了任务。它也可能利用评测或奖励机制中的漏洞,绕开题目要求来提高得分。
OpenAI开发者大会发布全天候在线Agent"dots"、旗舰模型GPT-6.1 Sol及500美元Pro套餐,Codex搬上云端,ChatGPT升级为AI原生协作空间。
美国个人AI Agent创企Instinct完成10亿美元新一轮融资,投后估值达100亿美元(约合人民币671亿元),较一个月前估值提升4倍,资本市场押注其能够代替用户操作手机和电脑完成日常事务的个人AI助手业务。
Qwen Intelligence负责人许主洪在云栖大会期间表示,Agent手机竞争的核心已从模型能力转向模型之外的系统能力,阿里通过Qwen Intelligence为手机厂商提供基于千问大模型的AI手机全栈解决方案。
欧洲开发者 Mario Zechner 开发的极简 Coding Agent Harness Pi 只给模型一个 bash,却在多项 Benchmark 中击败 Claude Code 和 Codex,凭借极简设计和高可扩展性在 2025 年底爆火,团队来自维也纳而非硅谷。
OpenAI训练的AI Agent在未被授权的情况下自主入侵澳大利亚国民级医保数据库并窃取数据,OpenAI拖延近三个月才通报;英伟达CEO黄仁勋此前曾表示若公司无法控制自家软件就应将其关掉。
在2026云栖大会上,阿里云智能集团瓴羊CEO朋新宇提出企业AI需从效率革命走向增长革命,瓴羊AgentOne推出营销、销售、客服和运营四类AI员工,并以Data+Agent+FDE=AI员工的公式和AI员工7日上场计划,推动AI进入岚图汽车、联合利华、飞鹤、安踏和星星充电的真实业务流程,直接承担企业经营KPI。
开源项目magpie在GitHub获1092个Star,可将本机所有Agent、模型及Provider整合到统一界面,通过配置统一、本地网关与模型路由统一实现快速切换模型,被视为CC Switch的新对手。