AI资讯新闻榜单内容搜索-多模态

通用端到端OCR模型开源，拒绝多模态大模型降维打击

在AI-2.0时代，OCR模型的研究难道到头了吗！？

来自主题: AI资讯

7340 点击 2024-09-10 14:26

还在死磕AI咒语？北大-百川搞了个自动提示工程系统PAS

论文共同第一作者郑淼，来自于周泽南领导的百川对齐团队，毕业于北京大学，研究方向包括大语言模型、多模态学习以及计算机视觉等，曾主导MMFlow等开源项目。

来自主题: AI技术研报

5070 点击 2024-09-10 11:40

视觉模型底座超越OpenAI，格灵深瞳开启多模态落地的Scaling Law

大模型时代，有个大家普遍焦虑的问题：如何落地?往哪落地?

来自主题: AI资讯

7295 点击 2024-09-09 14:52

GPT-4结合SAM2：免训练多模态分割的全新解决方案！| 已开源

免训练多模态分割领域有了新突破！

来自主题: AI技术研报

5229 点击 2024-09-07 17:22

让大模型能听会说，国内机构开源全球首个端到端语音对话模型Mini-Omni

本文出自启元世界多模态算法组，共同一作是来自清华大学的一年级硕士生谢之非与启元世界多模态负责人吴昌桥，研究兴趣为多模态大模型、LLM Agents 等。本论文上线几天内在 github 上斩获 1000+ 星标。

来自主题: AI技术研报

7426 点击 2024-09-07 11:04

ECCV 2024 | 比基准高30%，媲美Gemini 1.5 Pro，基于记忆的视频理解智能体来了

视频理解仍然是计算机视觉和人工智能领域的一个主要挑战。最近在视频理解上的许多进展都是通过端到端地训练多模态大语言模型实现的[1,2,3]。然而，当这些模型处理较长的视频时，内存消耗可能会显著增加，甚至变得难以承受，并且自注意力机制有时可能难以捕捉长程关系 [4]。这些问题阻碍了将端到端模型进一步应用于视频理解。

来自主题: AI技术研报

7473 点击 2024-09-06 11:59