复杂的Harness Evolution,甚至不如多跑几遍
复杂的Harness Evolution,甚至不如多跑几遍一个 Agent 第一次没把任务做对。
搜索
一个 Agent 第一次没把任务做对。
谷歌发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款实时语音模型,后者支持后台异步推理与工具调用以解决语音 Agent 在任务执行中的沉默问题,两款模型已在 Gemini API 和 Google AI Studio 向开发者开放。
OpenAI 可能正在酝酿一次大规模产品更新。
就在今天,洛杉矶All-In峰会现场上演了名场面。
零样本学习的目标,是让模型识别训练时从未出现过的类别。
随着 Genie 3 的发布,可交互世界模型真正走到台前:用户不再只是观看生成视频,而是可以输入动作实时改变一个持续演化的世界。世界模型开始从「生成一段视频」走向「模拟一个可交互世界」,但能走进去,不等于经得起探索。模型能否持续响应控制、维持视觉与空间一致、遵守物理规律并记住来路,仍缺少系统评测。
地铁急刹,金属尖叫,广播响起「请乘客注意扶稳」,人群骚动、孩子哭声、对讲机杂音一层层涌上来···
晚上下班,你正百无聊赖地坐在地铁里玩着你的手机。
忍!不!了!了! 你老A社天天一会儿AI要失控、一会儿互联网要完蛋,转头自己IPO、融资、扩算力,一个都没耽误??
北航、南方科技大学、复旦大学、北京理工大学、爱丁堡大学等 8 家机构的 19 位研究者联合完成 Theory of Agent 综述,讨论模型内部与外部 harness 应如何分配能力,并据此梳理 LLM Agent 的学习、对齐、演化与评测。