Moshi
Definition
A Moshi egy fejlett AI-modell, amelyet a Kyutai hozott létre, és integrálja a beszéd- és …
Terms tagged with Multimodal
A Moshi egy fejlett AI-modell, amelyet a Kyutai hozott létre, és integrálja a beszéd- és …
Az Ltx Video a videógeneráló mesterséges intelligencia területén elért fejlődést jelenti, …
A képből szöveg (Image Text To Text) olyan modellekre utal, amelyek vizuális bemeneteket …
A Genie kifejezetten videó-szintézisre tervezett generatív modellek családjára utal. …
Ez a pipeline a Qwen-VL modellek generatív képességeit alkalmazza képszintézisre. …
A DeepSeek VL V2 kiterjeszti az alapvető nyelvi modellek képességeit a többmodális …
A Flickr30K Captions egy széles körben használt benchmark adathalmaz, amely 31 783 képből …
A párosított mintatanulókat arra tervezték, hogy kezeljék azt az adatot, ahol két …
A Kontrasztív Nyelvi-Képi Előzetes Tanítás (CLIP) egy neurális hálózati architektúra, …
A ‘bármiből bármibe’ kifejezés az egységes multimodális architektúrákra utal, …
A vizuális-nyelvi modelleket, gyakran Multimodális Nagy Nyelvi Modelleknek (MLLM) …
A keresztmodális AI a különböző modalitásokból származó adatok feldolgozását és …
Az AI-ban a ‘vizuális’ kifejezés elsősorban a Számítógépes Látásra (Computer …
A mesterséges intelligencia területén a generálás a modellek képességét jelenti, …