评估大模型不看输出看「内在」,上交大新测试指标入选NeurIPS 2024
评估大模型不看输出看「内在」,上交大新测试指标入选NeurIPS 2024能够深入大模型内部的新评测指标来了! 上交大MIFA实验室提出了全新的大模型评估指标Diff-eRank。 不同于传统评测方法,Diff-eRank不研究模型输出,而是选择了分析其背后的隐藏表征。
搜索
能够深入大模型内部的新评测指标来了! 上交大MIFA实验室提出了全新的大模型评估指标Diff-eRank。 不同于传统评测方法,Diff-eRank不研究模型输出,而是选择了分析其背后的隐藏表征。
中国人民大学高瓴人工智能学院 GeWu 实验室、朝闻道机器人和 TeleAI 最近的合作研究揭示并指出了 “模态时变性”(Modality Temporality)现象,通过捕捉并刻画各个模态质量随物体操纵过程的变化,提升不同信息在具身多模态交互的感知质量,可显著改善精细物体操纵的表现。论文已被 CoRL2024 接收并选为 Oral Presentation。
随着大语言模型在长文本场景下的需求不断涌现,其核心的注意力机制(Attention Mechanism)也获得了非常多的关注。
自从 Sora 横空出世,业界便掀起了一场「视频生成模型到底懂不懂物理规律」的争论。图灵奖得主 Yann LeCun 明确表示,基于文本提示生成的逼真视频并不代表模型真正理解了物理世界。之后更是直言,像 Sora 这样通过生成像素来建模世界的方式注定要失败。
微软和Google在同一天发布的最新财报,AI都作为云增长的重点,但却是截然不同的两种路径。
在Prompt工程领域,规划任务一直以来都是一个巨大的挑战,因为这要求大语言模型(LLMs)不仅能够理解自然语言,还能有效执行复杂推理和应对长时间跨度的操作。
很多 AI 产品,就像你在全是陌生人的活动上,遇见的很多擦肩而过、加了微信的「好友」。 Let's be honest,你不会再跟 ta 发消息的。
2024年,AI在游戏行业正不断由表及里,不断触及游戏机制的核心。
跌宕起伏的美国大选已经落下帷幕。同时有一些人受不了情绪大起大落,决定暂时进入影院屏蔽一些信息。
目前苹果在AI服务器市场的需求相对较小,但寻找合适的供应商并不简单。