12月22日,星期五 11:45
火讯财经讯,AI新智界讯,12月21日,北京智源研究院宣布发布具有370亿参数的多模态大模型Emu2。据介绍,Emu2在少样本多模态理解任务上大幅超越Flamingo-80B、IDEFICS-80B等主流多模态预训练大模型,在包括VQAv2、OKVQA、MSVD、MM-Vet、TouchStone在内的多项少样本理解、视觉问答、主体驱动图像生成等任务上取得最优性能。Emu2表现出强大的多模态上下文学习能力,甚至可以解决需要即时推理的任务,例如视觉提示和基于对象的生成。基于Emu2微调的Emu2-Chat可以精准理解图文指令,实现更好的信息感知、意图理解和决策规划。Emu2-Gen则可接受图像、文本、位置交错的序列作为输入,实现灵活、可控、高质量的图像和视频生成。研究团队还表示,Emu2可以作为各种多模态任务的基础模型和通用接口。