AI资讯新闻榜单内容搜索-上下文

月之暗面Kimi的技术一点都不落后。

2 月 18 日，月之暗面发布了一篇关于稀疏注意力框架 MoBA 的论文。MoBA 框架借鉴了 Mixture of Experts（MoE）的理念，提升了处理长文本的效率，它的上下文长度可扩展至 10M。并且，MoBA 支持在全注意力和稀疏注意力之间无缝切换，使得与现有的预训练模型兼容性大幅提升。

来自主题: AI技术研报

9109 点击 2025-02-23 11:38

简单示例提升DeepSeek-R1美国数学邀请赛AIME分数：以步骤为粒度对齐上下文学习与推理

仅需简单提示，满血版DeepSeek-R1美国数学邀请赛AIME分数再提高。

来自主题: AI技术研报

6758 点击 2025-02-20 14:25

语言模型新范式：首个8B扩散大语言模型LLaDA发布，性能比肩LLaMA 3

近年来，大语言模型（LLMs）取得了突破性进展，展现了诸如上下文学习、指令遵循、推理和多轮对话等能力。目前，普遍的观点认为其成功依赖于自回归模型的「next token prediction」范式。

来自主题: AI技术研报

8659 点击 2025-02-17 14:37

华人研究团队揭秘：DeepSeek-R1-Zero或许并不存在「顿悟时刻」

一项非常鼓舞人心的发现是：DeepSeek-R1-Zero 通过纯强化学习（RL）实现了「顿悟」。在那个瞬间，模型学会了自我反思等涌现技能，帮助它进行上下文搜索，从而解决复杂的推理问题。

来自主题: AI技术研报

8798 点击 2025-02-07 15:51

LLaVA-Mini来了！每张图像所需视觉token压缩至1个，兼顾效率内存

以 GPT-4o 为代表的实时交互多模态大模型（LMMs）引发了研究者对高效 LMM 的广泛关注。现有主流模型通过将视觉输入转化为大量视觉 tokens，并将其嵌入大语言模型（LLM）上下文来实现视觉信息理解。

来自主题: AI技术研报

4141 点击 2025-02-06 15:26

Qwen开源首个长文本新模型，百万Tokens处理性能超GPT-4o-mini

谈到大模型的“国货之光”，除了DeepSeek之外，阿里云Qwen这边也有新动作——首次将开源Qwen模型的上下文扩展到1M长度。

来自主题: AI资讯

9018 点击 2025-01-27 14:18

六大维度，LLM「问题生成」首次正面PK人类！伯克利等发布最新研究

研究人员首次探讨了大型语言模型（LLMs）在问题生成任务中的表现，与人类生成的问题进行了多维度对比，结果发现LLMs倾向于生成需要较长描述性答案的问题，且在问题生成中对上下文的关注更均衡。

来自主题: AI技术研报

7747 点击 2025-01-27 13:26

最懂医疗的国产推理大模型，果然来自百川智能

就在本周，Kimi 的新模型打开了强化学习 Scaling 新范式，DeepSeek R1 用开源的方式「接班了 OpenAI」，谷歌则把 Gemini 2.0 Flash Thinking 的上下文长度延伸到了 1M。1 月 24 日上午，百川智能重磅发布了国内首个全场景深度思考模型，把这一轮军备竞赛推向了高潮。

来自主题: AI资讯

7398 点击 2025-01-26 12:16

1M长上下文，满血版Gemini 2.0又一次登上Chatbot Arena榜首

就在国内各家大模型厂商趁年底疯狂卷的时候，太平洋的另一端也没闲着。就在今天，谷歌发布了 Gemini 2.0 Flash Thinking 推理模型的加强版，并再次登顶 Chatbot Arena 排行榜。

来自主题: AI资讯

10259 点击 2025-01-22 18:40

ShowMeAI周刊 No.15 | 上周最有讨论度的6个AI话题：自由画布类产品密集更新、多主体一致成发展趋势、AGI、开源…

自由画布类 AIGC 工具：从近期新品（更新）窥见发展趋势——自律才能给我自由。图像 & 视频多主体一致功能：模型上下文能力的重要体现，未来各家模型的标配。指定 AI 生图里的文字，我找到了 9 种解决方案，其中有 2 种快过时了

来自主题: AI资讯

9856 点击 2025-01-21 22:57