推荐类别

栏目分类

优惠 新型视觉-语言模型BRAVE:扩展和增强VLM在处理图像和语言任务时的视觉编码能力

  • 新型视觉-语言模型BRAVE:扩展和增强VLM在处理图像和语言任务时的视觉编码能力
    AI
  • 谷歌和洛桑瑞士联邦理工学院推出新型视觉-语言模型BRAVE,它的核心目标是扩展和增强VLM在处理图像和语言任务时的视觉编码能力。想象一下,如果你给BRAVE一个描述,比如“一只蝴蝶停在花上”,它不仅能够理解这个描述, ...... 阅读全文

    优惠 创新框架DreamScene360:根据文本提示生成360度全景的3D场景

  • 创新框架DreamScene360:根据文本提示生成360度全景的3D场景
    AI
  • 加州大学洛杉矶分校、德克萨斯大学奥斯汀分校和DEVCOM ARL的研究人员推出创新框架DreamScene360,它能够根据文本提示生成360度全景的3D场景。例如,如果你只需要描述一个场景,比如“一个有瀑布的优胜美地国家公园”, ...... 阅读全文

    优惠 网易云音乐庆《魔兽世界》回归,送随机天数黑胶会员

  • 网易云音乐庆《魔兽世界》回归,送随机天数黑胶会员
    工具
  • 网易与暴雪在游戏上的纷争终于落幕,两家握手言和,这倒是让之前很多站网易而大喷特喷暴雪的网友们有些尴尬了,不过两家玩这么一出,肯定伤了不少玩家的心。这不网易也开始各种做活动开始拉玩家,旗下的网易云音乐还 ...... 阅读全文

    优惠 Suno的竞争对手出现了!前谷歌 DeepMind创立的Udio正式上线,免费用户每月可以生成1200首歌

  • Suno的竞争对手出现了!前谷歌 DeepMind创立的Udio正式上线,免费用户每月可以生成1200首歌
    AI
  • Suno的竞争对手出现了!由前谷歌 DeepMind 的领先 AI 研究员和工程师创立的Udio正式上线,目前处于免费测试阶段,用户每月可以生成1200首歌。相比Suno,Udio生成的歌曲时长更长,人声更加优质,偏向于模仿真实的歌手 ...... 阅读全文

    优惠 MA-LMM:更有效地理解长期视频内容而设计的记忆增强型大型多模态模型

  • MA-LMM:更有效地理解长期视频内容而设计的记忆增强型大型多模态模型
    AI
  • Meta推出MA-LMM,它是一个为了更有效地理解长期视频内容而设计的记忆增强型大型多模态模型。与传统的视频理解模型不同,MA-LMM采用了一种在线处理视频帧的方式,并使用一个记忆库来存储过去的视频信息。这样,即使视 ...... 阅读全文

    优惠 苹果推出Ferret-UI:专门为理解和交互移动用户界面(UI)屏幕而设计的多模态大语言模型

  • 苹果推出Ferret-UI:专门为理解和交互移动用户界面(UI)屏幕而设计的多模态大语言模型
    AI
  • 苹果推出Ferret-UI,它是一种专门为理解和交互移动用户界面(UI)屏幕而设计的多模态大语言模型(MLLM)。Ferret-UI旨在提高对移动UI屏幕的理解能力,具备引用、定位和推理等能力。与一般领域的MLLM相比,这些模型在 ...... 阅读全文

    优惠 针对长视频理解的视频-大语言模型Koala:帮助模型理解长达数分钟的视频内容,并能够回答关于视频的问题

  • 针对长视频理解的视频-大语言模型Koala:帮助模型理解长达数分钟的视频内容,并能够回答关于视频的问题
    AI
  • 来自波士顿大学、中国电子科技大学和Adobe Research的研究人员推出Koala,它是一种针对长视频理解的视频-大语言模型(Video-Large Language Model,简称vLLM)。Koala的目标是帮助模型理解长达数分钟的视频内容,并 ...... 阅读全文

    优惠 基于文本编辑NeRF(神经辐射场)场景DATENeRF:从2D图像中重建3D场景

  • 基于文本编辑NeRF(神经辐射场)场景DATENeRF:从2D图像中重建3D场景
    AI
  • Adob​​e推出DATENeRF,它用于基于文本编辑NeRF(神经辐射场)场景。NeRF是一种可以创建和渲染3D环境的技术,它通过从2D图像中重建场景的3D表示来实现。DATENeRF的关键特点是它能够利用场景的深度信息来指导基于文本 ...... 阅读全文

    优惠 MuPT:专门用于生成符号音乐的大语言模型

  • MuPT:专门用于生成符号音乐的大语言模型
  • 这篇论文介绍了一个名为MuPT(Music Pretrained Transformer)的模型,它是一个专门用于生成符号音乐的大型语言模型。符号音乐是指用特定的符号系统(如ABC记谱法)来表示的音乐,这种表示方法更接近于人类阅读和理 ...... 阅读全文

    优惠 浦语·灵笔2系列新模型InternLM-XComposer2-4KHD:在处理图像和文本方面有着显著的进步

  • 浦语·灵笔2系列新模型InternLM-XComposer2-4KHD:在处理图像和文本方面有着显著的进步
    AI
  • 上海人工智能实验室推出浦语·灵笔2系列新模型InternLM-XComposer2-4KHD,这是一款开创性大型视觉-语言模型(LVLM),这个模型在处理图像和文本方面有着显著的进步。例如,你有一个能够理解图片内容并回答有关图片问 ...... 阅读全文

    优惠 LLM2Vec:将大型的解码器模型转换成强大的文本编码器

  • LLM2Vec:将大型的解码器模型转换成强大的文本编码器
    AI
  • 这篇论文介绍了一个名为LLM2Vec的方法,它能够将大型的解码器模型(decoder-only LLMs)转换成强大的文本编码器。这些解码器模型在很多自然语言处理(NLP)任务中都是最先进的,但在文本嵌入任务中,它们的能力还没 ...... 阅读全文

    优惠 SambaLingo:针对大语言模型进行多语言适应性调整的研究项目

  • SambaLingo:针对大语言模型进行多语言适应性调整的研究项目
    AI
  • 这篇论文的主题是“SambaLingo”,这是一个针对大型语言模型(LLMs)进行多语言适应性调整的研究项目。简单来说,SambaLingo的目标是让大型语言模型能够理解和生成更多不同语言的文本,弥补目前LLMs在多种语言能力上的 ...... 阅读全文
    我要爆料 我的收藏 顶部
    快速登录

    自动登录 忘记密码?