Adoção da inteligência artificial nas organizações: o que os dados de utilização revelam.

Uma análise aprofundada revela o que o uso efetivo da inteligência artificial nos diz sobre sua adoção nas empresas e seu impacto real.

As coisas mais importantes que você precisa saber

  • O foco na adoção da inteligência artificial mudou da experimentação e do consumo de tokens para a obtenção de resultados tangíveis e a distribuição estratégica de cargas de trabalho entre diferentes modelos, priorizando a eficácia em detrimento do custo bruto.
  • Os sistemas de agentes inteligentes estão transformando fundamentalmente as cargas de trabalho de IA, uma vez que suas tarefas complexas e de várias etapas exigem maior consumo de tokens, refletindo sua crescente capacidade de lidar com tarefas críticas para os negócios.
  • O roteamento dinâmico de backup é uma infraestrutura crítica para garantir a confiabilidade e a continuidade de fluxos de trabalho complexos de IA, onde aproximadamente 3.5% das solicitações exigem redirecionamento devido a falhas, tempo limite ou problemas de determinação de taxa.

Muitas discussões públicas sobre inteligência artificial ainda giram em torno de rankings: qual modelo ocupa a primeira posição, qual fornecedor é o "vencedor" e qual pontuação de referência é a mais importante. Mas, para as organizações que de fato desenvolvem e implementam soluções de IA, essas questões estão se tornando menos relevantes do que entender como a IA é usada em cenários do mundo real.

Um dos motivos é a crescente controvérsia em torno do conceito de "tokenmaxxing" – uma prática que visa maximizar o uso da inteligência artificial, frequentemente motivada por metas internas de adoção, incentivos ou competições baseadas em rankings.

Mas focar no consumo de tokens pode incentivar a atividade pela atividade em si, em vez de mensurar o verdadeiro valor comercial que a inteligência artificial oferece.

Exemplos recentes, incluindo relatos de que a Amazon desativou um ranking interno de IA e que a Uber limitou os gastos de seus funcionários com IA após esgotar rapidamente seu orçamento anual, destacam os riscos de tratar o uso como a principal medida de sucesso.

No entanto, os dados mais recentes sugerem um cenário mais complexo. De acordo com os dados do AI Gateway da Vercel para julho, o volume de tokens cresceu 29% em junho, enquanto os gastos aumentaram 27%, com o preço médio do token permanecendo estável. Em vez de simplesmente consumir IA, as organizações estão se tornando mais criteriosas na definição de onde implantar diferentes modelos e como equilibrar custo e desempenho.

As equipes que desenvolvem sistemas de IA verdadeiros estão cada vez mais optando por rotear tarefas dinamicamente entre vários modelos, dependendo do custo, da confiabilidade e das capacidades de inferência. Por exemplo, um modelo de baixo custo pode ser útil para resumir tarefas, enquanto um modelo de inferência de alto desempenho é reservado para decisões de alto risco.

Na prática, a inteligência artificial tem mais a ver com a coordenação de camadas em múltiplos modelos do que com a construção de sistemas em torno de um único fornecedor.

Os dados mais recentes do AI Gateway mostram que as organizações estão distribuindo as cargas de trabalho entre diferentes categorias de modelos, em vez de depender de um único fornecedor. Os modelos de peso aberto agora processam 29% dos tokens do gateway, representando menos de 4% dos gastos, enquanto os modelos de vanguarda continuam a dominar as cargas de trabalho de inferência de maior valor.

Em vez de adotar uma abordagem única para todos, as organizações optam por modelos diferentes dependendo da tarefa em questão.

Ultrapassando os primeiros lugares das paradas

Nos estágios iniciais da adoção de IA nas empresas, as equipes foram incentivadas a experimentar agressivamente, desenvolver protótipos e explorar novos casos de uso. Isso ajudou a acelerar a adoção, o que exige a transição da IA ​​da fase experimental para a aplicação prática, mas também criou uma suposição simplista: a de que mais IA significa automaticamente mais valor.

O volume e os gastos com tokens cresceram aproximadamente 30% em junho; no entanto, o preço médio do token permaneceu estável. As organizações continuam investindo fortemente em IA, mas estão se tornando mais estratégicas na forma como alocam cargas de trabalho entre modelos de baixo custo e premium.

Esse padrão espelha mudanças tecnológicas anteriores, como o início da era da computação em nuvem, em que as empresas se expandiram agressivamente antes de melhorar a eficiência. A adoção da IA ​​está seguindo uma trajetória semelhante, mas em um ritmo muito mais acelerado.

Para equipes de IA, a métrica mais útil não é o custo, mas sim os resultados, que são a base do sucesso da IA . Um fluxo de trabalho capaz de automatizar semanas de esforço de engenharia pode ser muito mais eficiente do que um fluxo de trabalho de baixo custo que produz resultados não confiáveis ​​e gera custos operacionais subsequentes que superam a economia inicial.

A questão não é o quão pouco de inteligência artificial a equipe pode usar, mas sim a eficácia com que ela pode ser implementada para resolver problemas relevantes.

A inteligência artificial está mudando as cargas de trabalho.

Os chatbots tradicionais operam com fluxos de trabalho relativamente simples: insere-se um comando e recebe-se uma resposta. Os sistemas de agentes, que são essencialmente agentes de IA mais inteligentes , comportam-se de maneira muito diferente.

Os agentes de IA pensam, acionam ferramentas, executam código, recuperam informações, consultam bancos de dados e repetem operações em várias etapas antes de concluir a tarefa. Cada uma dessas ações consome tokens.

Como resultado, as cargas de trabalho de IA estão se tornando cada vez mais orientadas a agentes. Uma única solicitação agora pode envolver cadeias de chamadas de ferramentas, loops de validação e trocas de provedores ocorrendo nos bastidores, alterando completamente a economia do setor.

Os agentes de back-office são os que mais consomem tokens por portal, representando 5% do total de tokens, mas 14% do gasto total. Cargas de trabalho mais complexas e sensíveis aos negócios exigem maior capacidade de inferência do que tarefas de IA mais simples.

Isso significa que o aumento do uso nem sempre é um indicador de ineficiência. Em muitos casos, reflete a crescente complexidade e as capacidades dos próprios sistemas de IA.

Infraestrutura como fator de diferenciação

À medida que as organizações dependem cada vez mais de múltiplos modelos de IA e fornecedores de serviços, manter a confiabilidade torna-se uma tarefa mais complexa.

Tarefas de inferência, fluxos de trabalho multiagentes e cadeias de coordenação complexas podem impor uma pressão significativa sobre os provedores de modelos. Se um único modelo falhar durante a execução, todo o fluxo de trabalho pode entrar em colapso.

Como resultado, o roteamento de fallback tornou-se uma infraestrutura essencial de IA em ambientes de produção. O relatório AI Gateway da Vercel, publicado em maio, revelou que aproximadamente 3.5% das solicitações exigem redirecionamento devido a falhas, timeouts ou problemas na determinação da taxa de requisições.

Sem roteamento dinâmico entre provedores de serviço, essas solicitações simplesmente falharão. E para os usuários finais, a instabilidade do provedor de serviço é invisível; eles não se importam com a origem do problema, apenas se o aplicativo continua funcionando.

Portanto, à medida que os sistemas de IA se tornam cada vez mais capazes de operar como agentes independentes, a flexibilidade e a coordenação tornam-se tão importantes quanto a capacidade do próprio modelo, ressaltando a importância da transição da IA ​​para agentes mais inteligentes.

O fim da era de modelo único.

Estratégias baseadas em um único fornecedor de serviços tornaram-se difíceis de manter. Novos modelos são lançados constantemente, os preços mudam rapidamente e diferentes modelos se destacam em desempenho dependendo do tipo de tarefa.

O melhor modelo de programação hoje pode não ser o melhor para tarefas de recuperação de informações, suporte ao cliente ou fluxos de trabalho de inferência amanhã.

Não se trata de escolher um modelo como o único vencedor. Trata-se de construir sistemas de IA capazes de se adaptar e absorver o melhor modelo em qualquer semana, porque essa preferência muda rapidamente e continuará mudando.

As equipes que tratam a formatação multimodelo como uma infraestrutura são as que não precisarão reconstruir seus sistemas ao lançar um novo modelo.

Comentários estão fechados.