Câmera e microfone ligam
O navegador pede permissão e começa a captar imagem e som. O vídeo é gravado pequeno de propósito — 640 × 360, 15 quadros por segundo, cerca de 300 kbps — para subir rápido sem travar a fala.
Mapa de Presença · Rubrica V4
Você fala, e alguns segundos depois aparece uma nota e uma dica na tela. Esta página mostra o que acontece nesse meio: o que o seu computador faz sozinho, o que sai daqui e quais inteligências artificiais entram — cada uma com o que ela recebe, o que ela devolve e quanto tempo leva.
De cima para baixo, na ordem em que acontece.
O navegador pede permissão e começa a captar imagem e som. O vídeo é gravado pequeno de propósito — 640 × 360, 15 quadros por segundo, cerca de 300 kbps — para subir rápido sem travar a fala.
Antes de conectar, o navegador pede um passe ao servidor. O servidor — que é quem guarda a chave de acesso ao Google — cria um token temporário, de um único uso (expira em 30 minutos) e devolve junto o nome do modelo e o Mapa de Presença V4 completo escrito como instruções. A chave em si nunca chega ao navegador.
Com esse token na mão, o navegador abre uma conexão direto com o Google — o nosso servidor sai do meio do caminho. É uma única conexão contínua, que fica aberta a apresentação inteira, streamando áudio em pedacinhos de 250 ms e 1 quadro de vídeo por segundo, sem parar para fazer upload de arquivo nenhum.
Os números que se mexem o tempo todo na tela não passam por nenhuma IA generativa. O próprio navegador mede o volume e as pausas pelo som; e o reconhecimento de fala do Chrome (o serviço de voz do Google) transcreve o que você diz, o que dá as palavras por minuto e a contagem de vícios — “é”, “tipo”, “né”, “então”, “assim”, “ahn”.
Isso é medida, não opinião: acontece dentro do seu navegador, não usa a nossa chave e nem sequer passa pelo servidor.
Esta é a IA que dá as notas ao vivo, agora pela conexão contínua: a cada 8 segundos de áudio enviado, a janela fecha e o Google responde em 2,5 a 3,1 segundos. Enquanto a resposta não chega, a fala continua sendo guardada — nada é descartado — e assim que a resposta da janela anterior chega, o que foi guardado é despejado de uma vez na janela seguinte. Nenhum pedaço da fala se perde.
A nota que você vê em cada subcamada é a média simples das janelas que deram nota ali — janela que respondeu “não observado” não entra na conta. E cada uma das 5 camadas do radar é a média das suas subcamadas. Nenhuma IA faz essa aritmética: é o próprio navegador somando e dividindo.
Se o token, a conexão direta ou o Google recusarem, o app não trava: cai sozinho no esquema anterior, por janela — cada trecho de 8 segundos vai pro nosso servidor, que encaminha pra IA através do OpenRouter e recebe de volta a avaliação no mesmo formato. A pessoa falando nem percebe a troca.
Quando a apresentação termina, o servidor faz uma única chamada a um modelo mais forte — e desta vez sem vídeo nenhum, só texto. Ele lê o que a IA 1 anotou em todas as janelas e escreve o texto do relatório.
Do segundo em que você fala até a dica aparecer na tela. Enquanto isso acontece, você já está falando na janela seguinte.
Avaliar ao vivo e escrever o relatório final são tarefas diferentes. Ao vivo, a resposta precisa chegar antes da próxima janela de 8 segundos fechar — é para isso que serve a conexão contínua do Gemini 3.8 Live, que responde em 2,5 a 3,1 segundos e nunca perde um pedaço da fala enquanto espera. No fim, quando já dá para esperar 11 segundos, o 3.8 Flash lê tudo o que foi anotado janela a janela e escreve o fechamento — sem pressa nenhuma, sem vídeo, só texto.
E se a conexão com o Live falhar — token recusado, WebSocket caindo, o que for — o app não trava: cai sozinho no esquema por janela, com o Flash-Lite via OpenRouter como reserva automática, no mesmo formato de resposta. A pessoa falando nem percebe a troca.
Em “Analisar um vídeo gravado”: a palestra inteira, sem precisar estar ao vivo.
O vídeo sobe do seu computador para o servidor em partes de 50 MB (até 2 GB e 90 minutos). Lá ele é cortado em trechos de 60 segundos, e seis trechos são avaliados ao mesmo tempo pelo Gemini 3.8 Flash — aqui não há pressa de ao vivo, então vale o modelo mais forte. Cada trecho volta com as 18 notas e o segundo exato de cada evidência.
No fim, o mesmo 3.8 Flash escreve o fechamento, e o relatório abre com o player do vídeo: clicar num horário leva o vídeo ao momento, e a linha do tempo mostra, camada por camada, em que parte da palestra a nota caiu. Medido: um vídeo de 10 minutos fica pronto em 82 segundos.
O relatório mostra o custo da própria sessão, em dólar e em real.
As chamadas pelo OpenRouter (reserva por janelas, trechos do vídeo gravado e relatório final) vêm com o valor exato cobrado. O Gemini Live não informa o valor: a parte ao vivo é calculada pelos tokens que ele devolve multiplicados pela tabela oficial de preços do Google — por isso aparece com o selo estimado. Os medidores do navegador não custam nada.
Medido hoje: 1 minuto ao vivo ≈ US$ 0,03 (R$ 0,15) com o relatório incluído; 10 minutos de vídeo gravado ≈ US$ 0,16 (R$ 0,85). Uma palestra de 30 minutos deve ficar perto de US$ 0,50 (R$ 2,60) — conta feita a partir dessas medições.
Dito na cara: é mais honesto do que descobrir no meio da demonstração.