Liquid AI开源d1决策模型 支持图像输入

AI 驱动中国 苏木 375次阅读
分享 微 Q 信
AI摘要
由 AI 生成 · 仅供参考

Liquid AI于10月7日发布d1系列两款开放权重决策模型,d1-3B以31.2亿参数支持文本与图像判断,d1-omni-600M以5.87亿参数支持文本、图像及语音输入,两款模型已在Hugging Face公开。

驱动中国10月9日消息,Liquid AI于10月7日发布博文,宣布推出d1系列两款开放权重决策模型。该系列包含d1-3B与d1-omni-600M,前者以31.2亿参数支持文本与图像判断,后者以5.87亿参数支持文本、图像及语音输入,两款模型已在Hugging Face公开,用户可下载、微调并部署。

在Jev模型于9月推出并引发关注后,OpenAI等公司相继推出类似决策模型,Liquid AI由此加入这一领域。本次发布的d1-3B基于视觉语言模型LFM2.5-VL-3B训练,支持文本与图像输入;该模型在Decision Index v0.2.1公开测试集上获得48.57分,Liquid AI称其领先所有10B以下模型。

d1-omni-600M基于双向编码器LFM2.5-Encoder-350M训练,支持文本与图像,或文本与语音的组合输入。该模型被描述为Liquid AI首个实验性多模态决策模型检查点。

推理速度方面,d1-3B在NVIDIA RTX 4090上回答单个问题耗时8毫秒,处理384像素图像耗时102毫秒;在Jetson AGX Thor上单问耗时16毫秒,在Jetson Orin Nano上为50毫秒。用户测试显示,该模型在12GB显存的GeForce RTX 3060上单次判断耗时25毫秒,处理640×480像素图像耗时146毫秒,峰值显存占用约6GB。另有用户报告称,d1-3B在RTX 3090上单次判断耗时8毫秒。

版权声明:本文由驱动中国整理发布,转载需注明出处与原文链接。如有疑问请联系 editor@qudong.com。
来源:驱动中国 · 原文链接:https://www.qudong.com/article/525754.html
本文价值 ★★★★★ 4 1 人已评
登录后为本文打分
网友评论0 条评论
正在回复 的评论取消
评论加载中…
🔐

登录后参与互动

评论、点赞均可赚积分
连续签到、邀请好友也有奖励 🎁

电脑端: 微信扫码登录 微信内: 一键登录
✎ 我要投稿有独家观点或行业线索?向驱动中国投稿,审核采用后署名发布并获积分奖励。 去投稿 ›

微信扫一扫

打开微信「扫一扫」,分享本文到朋友圈或好友