Latência

term_id: latency

Category: engineering_practice

Definition

A latência mede a capacidade de resposta de um serviço de IA, geralmente expressa em milissegundos. Ela inclui o tempo de inferência, atrasos de transmissão de rede e sobrecarga de processamento. Baixa latência é crítica para aplicações em tempo real, onde atrasos perceptíveis podem degradar a experiência do usuário ou comprometer a segurança.

Summary

O atraso de tempo entre o início de uma solicitação e o início da resposta em um sistema de IA.

Key Concepts

  • Tempo de Inferência
  • Tempo de Resposta
  • Processamento em Tempo Real
  • Otimização

Use Cases

  • Sistemas de reconhecimento de voz
  • Controle de veículos autônomos
  • Serviços de tradução ao vivo