voltar para a análise

Mapa de Presença · Rubrica V4

Como funciona
a análise

Você fala, e alguns segundos depois aparece uma nota e uma dica na tela. Esta página mostra o que acontece nesse meio: o que o seu computador faz sozinho, o que sai daqui e quais inteligências artificiais entram — cada uma com o que ela recebe, o que ela devolve e quanto tempo leva.

no seu navegador no servidor inteligência artificial

O caminho da fala até a nota

De cima para baixo, na ordem em que acontece.

no seu navegador ao vivo

Câmera e microfone ligam

O navegador pede permissão e começa a captar imagem e som. O vídeo é gravado pequeno de propósito — 640 × 360, 15 quadros por segundo, cerca de 300 kbps — para subir rápido sem travar a fala.

no servidor uma vez, no início

O servidor entrega um passe de uso único

Antes de conectar, o navegador pede um passe ao servidor. O servidor — que é quem guarda a chave de acesso ao Google — cria um token temporário, de um único uso (expira em 30 minutos) e devolve junto o nome do modelo e o Mapa de Presença V4 completo escrito como instruções. A chave em si nunca chega ao navegador.

devolve Token de uso único + nome do modelo + a rubrica V4 inteira, pronta para abrir a conexão.
no seu navegador conexão contínua

O navegador conecta direto no Google

Com esse token na mão, o navegador abre uma conexão direto com o Google — o nosso servidor sai do meio do caminho. É uma única conexão contínua, que fica aberta a apresentação inteira, streamando áudio em pedacinhos de 250 ms e 1 quadro de vídeo por segundo, sem parar para fazer upload de arquivo nenhum.

no seu navegador · sem IA 4 × por segundo

Em paralelo: os medidores do lado de cá

Os números que se mexem o tempo todo na tela não passam por nenhuma IA generativa. O próprio navegador mede o volume e as pausas pelo som; e o reconhecimento de fala do Chrome (o serviço de voz do Google) transcreve o que você diz, o que dá as palavras por minuto e a contagem de vícios — “é”, “tipo”, “né”, “então”, “assim”, “ahn”.

Isso é medida, não opinião: acontece dentro do seu navegador, não usa a nossa chave e nem sequer passa pelo servidor.

IA 1 · conexão ao vivo 2,5 s a 3,1 s por janela

O Google Gemini 3.8 Live assiste em tempo real

Esta é a IA que dá as notas ao vivo, agora pela conexão contínua: a cada 8 segundos de áudio enviado, a janela fecha e o Google responde em 2,5 a 3,1 segundos. Enquanto a resposta não chega, a fala continua sendo guardada — nada é descartado — e assim que a resposta da janela anterior chega, o que foi guardado é despejado de uma vez na janela seguinte. Nenhum pedaço da fala se perde.

recebe Áudio contínuo (250 ms) + 1 quadro de vídeo/s + a rubrica V4 (enviada uma vez, na abertura).
devolve, a cada janela Nota de 1 a 5 — ou “não observado” — nas 18 subcamadas, cada uma com uma evidência curta do que ela viu ou ouviu; a dica do ponto eletrônico; o ponto forte; e a transcrição daquela janela.
no seu navegador · sem IA na hora

A conta das notas é do navegador

A nota que você vê em cada subcamada é a média simples das janelas que deram nota ali — janela que respondeu “não observado” não entra na conta. E cada uma das 5 camadas do radar é a média das suas subcamadas. Nenhuma IA faz essa aritmética: é o próprio navegador somando e dividindo.

reserva automática só se o Live falhar

O Google Gemini 3.5 Flash-Lite entra se a conexão falhar

Se o token, a conexão direta ou o Google recusarem, o app não trava: cai sozinho no esquema anterior, por janela — cada trecho de 8 segundos vai pro nosso servidor, que encaminha pra IA através do OpenRouter e recebe de volta a avaliação no mesmo formato. A pessoa falando nem percebe a troca.

IA 2 · uma única chamada, no fim cerca de 11 s

O Google Gemini 3.8 Flash escreve o fechamento

Quando a apresentação termina, o servidor faz uma única chamada a um modelo mais forte — e desta vez sem vídeo nenhum, só texto. Ele lê o que a IA 1 anotou em todas as janelas e escreve o texto do relatório.

recebe As notas e evidências de todas as janelas + o resumo dos medidores do navegador.
devolve Um resumo da apresentação, 3 pontos fortes e 3 pontos a melhorar.

A linha do tempo de uma janela

Do segundo em que você fala até a dica aparecer na tela. Enquanto isso acontece, você já está falando na janela seguinte.

0 s você começa a falar 8 s a janela fecha a fala seguinte já é guardada ~10,5–11,1 s a dica aparece e o guardado é despejado GRAVANDO A JANELA O LIVE RESPONDE

Por que mais de uma inteligência artificial

Avaliar ao vivo e escrever o relatório final são tarefas diferentes. Ao vivo, a resposta precisa chegar antes da próxima janela de 8 segundos fechar — é para isso que serve a conexão contínua do Gemini 3.8 Live, que responde em 2,5 a 3,1 segundos e nunca perde um pedaço da fala enquanto espera. No fim, quando já dá para esperar 11 segundos, o 3.8 Flash lê tudo o que foi anotado janela a janela e escreve o fechamento — sem pressa nenhuma, sem vídeo, só texto.

E se a conexão com o Live falhar — token recusado, WebSocket caindo, o que for — o app não trava: cai sozinho no esquema por janela, com o Flash-Lite via OpenRouter como reserva automática, no mesmo formato de resposta. A pessoa falando nem percebe a troca.

E quando o vídeo já está gravado

Em “Analisar um vídeo gravado”: a palestra inteira, sem precisar estar ao vivo.

O vídeo sobe do seu computador para o servidor em partes de 50 MB (até 2 GB e 90 minutos). Lá ele é cortado em trechos de 60 segundos, e seis trechos são avaliados ao mesmo tempo pelo Gemini 3.8 Flash — aqui não há pressa de ao vivo, então vale o modelo mais forte. Cada trecho volta com as 18 notas e o segundo exato de cada evidência.

No fim, o mesmo 3.8 Flash escreve o fechamento, e o relatório abre com o player do vídeo: clicar num horário leva o vídeo ao momento, e a linha do tempo mostra, camada por camada, em que parte da palestra a nota caiu. Medido: um vídeo de 10 minutos fica pronto em 82 segundos.

Quanto custa cada análise

O relatório mostra o custo da própria sessão, em dólar e em real.

As chamadas pelo OpenRouter (reserva por janelas, trechos do vídeo gravado e relatório final) vêm com o valor exato cobrado. O Gemini Live não informa o valor: a parte ao vivo é calculada pelos tokens que ele devolve multiplicados pela tabela oficial de preços do Google — por isso aparece com o selo estimado. Os medidores do navegador não custam nada.

Medido hoje: 1 minuto ao vivo ≈ US$ 0,03 (R$ 0,15) com o relatório incluído; 10 minutos de vídeo gravado ≈ US$ 0,16 (R$ 0,85). Uma palestra de 30 minutos deve ficar perto de US$ 0,50 (R$ 2,60) — conta feita a partir dessas medições.

O que esta versão ainda não vê

Dito na cara: é mais honesto do que descobrir no meio da demonstração.

voltar para a análise Mapa de Presença V4 · 5 camadas · 18 subcamadas