A próxima era da competição por câmeras: a essência da disputa reside na capacidade de compreensão.

A corrida pelas câmeras está mudando para se concentrar em entender a cena e tirar fotos inteligentes com inteligência artificial, indo além das especificações técnicas.

As coisas mais importantes que você precisa saber

  • A função do sensor passa de capturar imagens belas para o olho humano a fornecer sinais nítidos que podem ser processados ​​pela máquina, tornando-o uma ferramenta essencial de percepção.
  • O gargalo no processamento de IA em tempo real está se deslocando para o sensor, impulsionando soluções como processamento em chip, sensores baseados em eventos, obturadores universais e tecnologias HDR modificadas para aprimorar a legibilidade por máquina.
  • A próxima competição no setor de câmeras girará em torno do sistema integrado que inclui o sensor, o processamento de imagem e a computação periférica, com ênfase na "qualidade da inferência" como prioridade estratégica que vai além da tradicional "qualidade da imagem".

A demonstração que me convenceu aconteceu em uma galeria de arte que eu mesmo construí.

Como não tínhamos uma equipe de guias, desenvolvi um projeto paralelo para substituí-los. Não havia caixa de entrada nem nada para digitar. Você apontava o celular para algo e ele dizia o que você estava vendo. A exposição acabou, mas as pessoas continuaram usando mesmo assim.

Eles o direcionaram para os prédios, as flores, os brinquedos das crianças, os cartazes na rua, e nada disso tinha a ver com a exposição.

Sem que ninguém lhes pedisse, decidiram que a câmara deveria ser capaz de lhes explicar o mundo.

Essa expectativa agora é responsabilidade da indústria, e surge em um momento em que a inteligência artificial está passando de um problema de treinamento para um problema de inferência, onde a maior parte do trabalho real é feita no próprio dispositivo enquanto alguém aponta o telefone para um mundo real não cooperativo.

Uma modelo precisa de coisas diferentes em uma foto do que o olho humano: bordas para se apoiar e estrutura para recuperar quando a imagem está cheia de reflexos ou desfocada. As cores e o contraste que fazem uma foto ficar boa são, para uma modelo, muitas vezes um obstáculo.

O sensor ideal para um observador humano e o sensor ideal para uma modelo exigem projetos diferentes.

O sensor tornou-se um problema de percepção, e as pessoas que desenvolvem sistemas de visão em tempo real agora se preocupam com isso da mesma forma que os fotógrafos costumavam se preocupar.

De onde veio o sensor?

O sensor CMOS de pixel ativo, inventado por Eric Fossum e desenvolvido no início da década de 1990, é o motivo pelo qual existe uma câmera competente em praticamente todos os bolsos hoje em dia.

Seu trabalho posterior segue uma direção completamente diferente: o sensor de imagem quântico, que conta fótons individuais. Essa trajetória ilustra o que está acontecendo com a inteligência artificial atualmente: ela está passando de capturar um quadro que uma pessoa possa gostar para capturar o sinal mais limpo possível para a máquina processar.

O sensor se torna uma ferramenta de percepção, e a fotografia é apenas uma de suas aplicações.

Por que o raciocínio altera a natureza do trabalho?

A inferência é o que torna o problema urgente. Anteriormente, quando a IA se concentrava principalmente no treinamento, o papel da câmera era indireto: ela produzia dados para serem categorizados e usados ​​posteriormente para aprendizado, em um ritmo mais lento. A inferência não é lenta. Ela acontece em tempo real, em um dispositivo com recursos limitados e que já está superaquecendo, como é o caso de aplicações de IA que dependem do tempo de resposta.

Quando um sistema precisa reconhecer algo enquanto a câmera ainda está apontada para ele e responder antes que seja tarde demais, o elo mais fraco é o que se estende até o modelo, e isso define o limite de tudo o que o produto pode fazer.

Parte da indústria ainda aposta na coisa errada. A suposição é que um modelo suficientemente grande irá processar tudo o que a câmera lhe enviar. Tenho visto isso prejudicar o planejamento de produtos nos últimos dois anos, e não acho que essa premissa se sustente diante das leis da física.

Nenhum modelo de tamanho consegue restaurar detalhes já destruídos pelo desfoque de movimento ou brilho excessivo, ou aqueles descartados por um processamento com prioridade de beleza antes mesmo de o modelo visualizar a imagem. O gargalo agora se desloca para cima, em direção ao sensor e ao que está entre ele e o modelo.

O que esses dispositivos realmente fazem?

Alguns sensores agora realizam parte do processamento no próprio chip, de modo que os cálculos iniciais ocorrem antes que os dados saiam da matriz de pixels. Sensores baseados em eventos, às vezes chamados de neuromórficos, registram apenas as partes variáveis ​​da cena, o que é muito mais adequado à percepção em tempo real do que o streaming de quadros completos. Obturadores globais também ajudam, reduzindo as distorções de movimento que podem corromper as leituras da máquina.

Até mesmo a tecnologia HDR (High Dynamic Range), há muito projetada para renderizar o céu de forma dramática, está sendo recalibrada para corresponder ao que o modelo consegue ler claramente em alto contraste. Apesar de suas diferenças, todas essas tecnologias apontam na mesma direção: para uma versão do mundo que o modelo consiga processar.

Da identificação à conclusão

A funcionalidade mais intuitiva para se desenvolver é a busca visual: apontar a câmera para um objeto gera uma etiqueta. Mas quando você aponta o celular para um cardápio, o que você quer é ajuda para decidir o que comer; quando aponta para um cartaz, uma ação útil pode ser salvar o evento no seu calendário. O reconhecimento de objetos é apenas o ponto de partida. A essência do produto reside em saber o que deve acontecer em seguida. É aqui que o sensor se torna o primeiro elo em uma cadeia mais longa de interpretação, indo além da simples captura de informações.

Nunca tive a intenção de construir um produto fotográfico; começou como uma forma barata de evitar contratar guias para uma única exposição. Mas este pequeno projeto me ensinou que esse instinto já existe em mim. O próximo desafio no mundo das câmeras será o sistema como um todo: o sensor, o processamento de imagem, os periféricos , a formatação do modelo e o que o sistema faz em última instância.

Os fabricantes de hardware passaram anos aprimorando a qualidade da imagem e precisarão levar a qualidade da inferência tão a sério quanto. Os desenvolvedores de software não podem tratar a captura como um problema de terceiros: a forma como um sinal é capturado e roteado molda o resultado muito antes de o usuário o ver. As antigas fronteiras entre hardware e software tornam-se menos importantes à medida que nos aprofundamos na percepção em tempo real.

Ainda há espaço para startups. Sua vantagem reside na rapidez de identificação: formular o problema antes que as grandes empresas terminem de discuti-lo. A própria capacidade do modelo geral está se tornando cada vez mais difícil de defender. A questão é: o que acontece quando um único sistema consegue prever, antecipar e agir sobre o mesmo evento, e quem chegará lá primeiro com um produto totalmente funcional?

Olhos humanos versus mentes de máquina

A minha aposta é que nos próximos anos as empresas se dividirão em dois grupos: aquelas que otimizam o desempenho para a visão humana e aquelas que otimizam o desempenho para o que a máquina deve ler. Em um celular topo de linha, esses objetivos ainda se sobrepõem o suficiente para obscurecer a diferença.

Mas, como estratégia, esses objetivos já começaram a divergir. A posição mais sustentável será a de quem conseguir transformar o mundo real caótico no sinal mais limpo que a máquina possa inferir.

Tudo começa com o sensor.

Analisamos, avaliamos e classificamos os melhores celulares com câmera.

Comentários estão fechados.