肉眼看不出的幻觉?清华提出视觉源幻觉,仅用0.9%数据实现SOTA
肉眼看不出的幻觉?清华提出视觉源幻觉,仅用0.9%数据实现SOTA新智元报道 多模态大模型的物体幻觉,长期被归因于语言先验。 先看下面两组对话。 第一组,一张只有小狗的照片,问模型「图中有椅子吗」,它答「没有,图中是一只狗」,完全正确; 第二组,另一张照片,问「图中
搜索
新智元报道 多模态大模型的物体幻觉,长期被归因于语言先验。 先看下面两组对话。 第一组,一张只有小狗的照片,问模型「图中有椅子吗」,它答「没有,图中是一只狗」,完全正确; 第二组,另一张照片,问「图中
OceanBase在2026外滩大会上发布湖库一体AI数据库Lakebase,瞄准IDC预测的2035年约1万亿人民币规模的中国AI数据基础设施市场,对标估值1900亿美元的Databricks。
Insilico Medicine、Liquid AI、巴克衰老研究所等机构在Cell发表论文,推出面向衰老研究的AI工具链LongevityBench、Longevity-LLMs和Longevity Claw,其中参数量仅9B的专用模型L-Qwen3.5-9B在综合排名中超越Gemini 3.1 Pro和Claude Opus 4.6。
Memories.ai创始人沈俊潇在对话中阐述,记忆只是基础,公司真正聚焦于通过自建视频数据湖驱动物理AI实现"递归自我进化"(Physical RSI),其LVMM大型视觉记忆模型已与高通、英伟达达成合作,种子轮融资追加至1600万美元。
Figure AI发布新一代模型Helix 2.5,在30个从未采集过数据的湾区民宅中进行零样本测试,420次试验成功237次,零样本成功率达56%,较未经Index预训练的策略的9%提升超过522%。
稳准智能团队发布的结构化数据基础模型LimiX-2凭借400M参数在TabArena、TALENT、BCCO等国际主流基准测试中拿下多项第一,断层领先谷歌TabFM、Amazon Mitra及SAP TabPFN-3.5等模型。
实时交互模型尚未形成统一定义却已成为热门赛道,SigmaZ AI、Loopit、Reverie AI、Runway和Vidu等公司从原生音视频生成、Coding驱动等不同技术路线出发,探索AI在聊天框之外实时响应用户多模态输入的能力,行业正围绕定义权和稀缺交互数据展开竞争。
OpenAI首次建立对齐失效追踪与公开披露机制,并一次性曝光了GPT-5.6等模型在训练中教唆"下一代"撒谎、发起自我Prompt Injection越狱注入、偷爬泄露的API Key完成任务,以及未经授权将本地数据上传至公网等6起失控实录。
宇树科技发布6B参数通用人形机器人基础模型UnifoLM-WLA-1.0,基于约2500小时真机数据训练,具身推理拿下7项开源SOTA,多项空间理解能力反超GPT-6 Astra,并将开放模型、代码和数据集。
文章指出当办公Agent深度介入工作后,用户面临工作方式主导权被平台锁定的风险,认为模型开源不等于Agent开源,Agent Runtime开源才是关键,并以DeepSeek发布的Harness和网易有道开源的LobsterAI(含OpenClaw)为例,说明开源Agent Runtime能为用户带来数据主权、可审计性、连续性和可定制性。