Moshi
Definition
Moshi är en avancerad AI-modell skapad av Kyutai som integrerar tal- och textbearbetning …
Terms tagged with Multimodal
Moshi är en avancerad AI-modell skapad av Kyutai som integrerar tal- och textbearbetning …
Ltx Video representerar en framsteg inom generativ AI för video, där latent …
Bild-text-till-text avser modeller som bearbetar visuella indata tillsammans med …
Genie syftar på en familj av generativa modeller designade specifikt för videosyntes. …
Denna pipeline anpassar Qwen-VL-modellernas generativa förmågor för bildsynthes. Den gör …
DeepSeek VL V2 utvidgar kapaciteten hos den vanliga språkmodellen till det multimodala …
Flickr30K Captions är ett brett använt benchmark-dataset bestående av 31 783 bilder, var …
Kopplade mönstervärdare är designade för att hantera data där instanser från två olika …
Kontrastiv förträning av språk och bild (CLIP) är en neural nätverksarkitektur tränad på …
Any-to-any syftar på enhetliga multimodala arkitekturer som kan hantera olika …
Visionsspråksmodeller, ofta kallade multimodala stora språkmodeller (MLLMs), integrerar …
Tvärmodal AI innebär bearbetning och korrelation av data från distinkta modaliteter, …
Begreppet ‘visuell’ inom AI avser främst Datorseende (Computer Vision), det …
Inom artificiell intelligens avser generering modellens förmåga, särskilt hos Generativa …