Moshi
Definition
Moshi er en avanceret AI-model skabt af Kyutai, der integrerer tale- og tekstbehandling i …
Terms tagged with Multimodal
Moshi er en avanceret AI-model skabt af Kyutai, der integrerer tale- og tekstbehandling i …
Ltx Video repræsenterer en fremskridt inden for generativ AI til video ved at bruge …
Billede-tekst-til-tekst refererer til modeller, der behandler visuelle input sammen med …
Genie refererer til en familie af generative modeller, der er designet specifikt til …
Denne pipeline tilpasser Qwen-VL-modellernes generative evner til billedsyntese. Den gør …
DeepSeek VL V2 udvider standard sprogmodellens kapaciteter ind i det multimodale domæne, …
Flickr30K-billedtekster er et bredt anvendt benchmark-datasæt, der omfatter 31.783 …
Koblede mønstergenerere er designet til at håndtere data, hvor instanser fra to …
Kontrastiv fortræning af sprog-billede (CLIP) er en neuralt netværksarkitektur trænet på …
Any-to-any refererer til enhedlige multimodale arkitekturer, der kan håndtere forskellige …
Visionssprogsmodeller, ofte omtalt som multimodale store sprogmodeller (MLLM’er), …
Cross-modal AI involverer bearbejdning og korrelation af data fra distinkte modaliteter, …
Begrebet ‘visuel’ inden for AI vedrører primært Computer Vision, det felt der …
Inden for kunstig intelligens refererer generering til modellers evne, især Generative …