1 篇带「多模态」标签的文章
多模态,就是 AI 能同时看懂文字、图片、声音、视频,而不只是处理文字。你拍张乱糟糟的衣柜,它能说"左边那件外套该挂起来";你哼一段旋律,它能接着编下去。它把"眼睛、耳朵、嘴"一起给了模型。