阿里云發(fā)布多模態(tài)交互開發(fā)套件,讓硬件能聽、會看、會交互
1月8日,在阿里云通義智能硬件展上,阿里云發(fā)布多模態(tài)交互開發(fā)套件,該套件集成了千問、萬相、百聆三款通義基礎大模型,并預置十多款生活休閑、工作效率等領域的Agent和MCP工具,不僅能聽、會看,還能思考并且與物理世界交互,可應用于AI眼鏡、學習機、陪伴玩具、智能機器人等硬件設備。

隨著多模態(tài)大模型的發(fā)展,大模型已開始具備理解、感知以及和物理世界交互的能力,越來越多的硬件和終端設備廠商開始通過接入大模型來提升交互體驗。然而,僅靠基礎大模型仍無法同時滿足硬件設備對低成本、低時延、功能豐富和高質(zhì)量效果的需求。
阿里云多模態(tài)交互開發(fā)套件為硬件企業(yè)和解決方案商提供了低開發(fā)門檻、響應速度快、場景豐富的平臺。在芯片層面,該套件適配了30多款主流ARM、RISC-V和MIPS架構終端芯片平臺,滿足市面上絕大多數(shù)硬件設備的快速接入需求。未來,通義大模型還將與玄鐵RISC-V實現(xiàn)軟硬全鏈路的協(xié)同優(yōu)化,實現(xiàn)通義大模型家族在RISC-V架構上的極致高效部署和推理性能。
在模型優(yōu)化層面,除通義模型家族外,阿里云還針對大量多模態(tài)交互場景進行分析,推出適合AI硬件交互的專有模型,全面支持全雙工語音、視頻、圖文等交互方式,端到端語音交互時延低至1秒,視頻交互時延低至1.5秒。
此外,該套件預置十多款MCP工具和Agent,覆蓋生活、工作、娛樂、教育等多個場景,例如,基于預置的出行規(guī)劃Agent,用戶可直接調(diào)用路線規(guī)劃、旅行攻略、吃喝玩樂探索等能力。該套件還接入了阿里云百煉平臺生態(tài),用戶不僅可以添加其他開發(fā)者提供的MCP和Agent模板,還能通過 A2A協(xié)議兼容三方Agent,極大程度地擴展了應用的能力邊界,幫助企業(yè)靈活搭建業(yè)務場景。

現(xiàn)場,阿里云還展示了面向智能穿戴設備、陪伴機器人、具身智能等領域的解決方案。例如,在AI眼鏡領域,基于千問VL、百聆CosyVoice等模型,阿里云打造了感知層、規(guī)劃層、執(zhí)行層以及長期記憶的完整交互鏈路,可一站式實現(xiàn)同聲傳譯、拍照翻譯、多模態(tài)備忘錄、錄音轉(zhuǎn)寫功能,有效解決交互不自然、回答準確率低的難題。面向家庭陪伴機器人場景,基于千問模型和多模態(tài)交互套件,阿里云推出的解決方案不僅可實時監(jiān)測異常狀況,并及時告警信息推送,用戶還能基于關鍵詞查找、定位視頻,與機器人進行對話交互和控制設備等。
根據(jù)國際權威市場研究機構Gartner發(fā)布的GenAI(生成式AI)技術創(chuàng)新指南系列報告,阿里云在GenAI云基礎設施、GenAI工程、GenAI模型以及AI知識管理應用四大維度均位于新興領導者象限,為入選全部四項新興領導者象限的唯一亞太廠商,并比肩谷歌、OpenAI。
- 免責聲明:本文內(nèi)容與數(shù)據(jù)僅供參考,不構成投資建議。據(jù)此操作,風險自擔。
- 版權聲明:凡文章來源為“大眾證券報”的稿件,均為大眾證券報獨家版權所有,未經(jīng)許可不得轉(zhuǎn)載或鏡像;授權轉(zhuǎn)載必須注明來源為“大眾證券報”。
- 廣告/合作熱線:025-86256149
- 舉報/服務熱線:025-86256144

