Skip to content
Image

Afinal, as IAs “colapsam” ou conseguem mesmo raciocinar? O debate aceso entre a Apple e a crítica independente

Nos últimos dias, o mundo da inteligência artificial foi abalado por um intenso debate: afinal, será que os modelos de linguagem actuais conseguem mesmo raciocinar, ou apenas imitam padrões? Um estudo recente da Apple sugeriu que, perante desafios complexos, estas IAs “colapsam” e deixam de conseguir resolver problemas. Mas uma resposta crítica, assinada por Alex Lawsen, veio pôr em causa estas conclusões — e pode mudar a forma como avaliamos a inteligência artificial.

O que dizia o estudo da Apple?

A equipa de investigação da Apple testou modelos de IA de topo, como o Claude 3.7 Sonnet, Gemini e DeepSeek-R1, em puzzles clássicos de lógica, como a Torre de Hanói e problemas de travessia de rios. As conclusões foram surpreendentes: à medida que a complexidade dos puzzles aumentava, os modelos deixavam de conseguir apresentar soluções completas, mesmo quando, teoricamente, ainda tinham capacidade de processamento disponível. Para os investigadores da Apple, isto era sinal de que os modelos não raciocinam de facto — apenas seguem padrões, e esses padrões “quebram” quando o desafio sobe de nível.

As críticas de Lawsen: falhas na avaliação

Alex Lawsen, num artigo intitulado “A Ilusão da Ilusão de Pensar”, desmonta esta interpretação e aponta três grandes problemas:

  • Limites de tokens ignorados: Nos puzzles mais complexos, como a Torre de Hanói com 8 ou mais discos, os modelos estavam a atingir o limite máximo de texto que podiam gerar (os chamados “tokens”). Em vez de falharem, muitos modelos avisavam explicitamente que iriam parar para poupar espaço, algo que o estudo original não considerou relevante.
  • Puzzles impossíveis contados como falhas: Alguns desafios, como certos problemas de travessia de rio, eram matematicamente impossíveis de resolver (por exemplo, transportar demasiados personagens num barco demasiado pequeno). Os modelos eram penalizados mesmo quando reconheciam que não havia solução.
  • Avaliação pouco realista: O método de avaliação da Apple exigia listas completas de todos os passos, sem distinguir entre incapacidade de raciocínio e limitações práticas de output. Ou seja, se o puzzle era demasiado grande para caber na resposta, era automaticamente considerado um fracasso.

Experiências alternativas mostram outra realidade

Lawsen foi mais longe e pediu aos modelos para resolverem os mesmos puzzles, mas de forma mais compacta — por exemplo, gerando código em Lua para resolver a Torre de Hanói, em vez de listar todos os movimentos. O resultado? Os modelos conseguiram resolver puzzles ainda mais complexos, como a Torre de Hanói com 15 discos, algo que o estudo da Apple dizia ser impossível. Isto demonstra que o problema estava no formato da avaliação e não na capacidade de raciocínio dos modelos.

O que muda na avaliação da IA?

Este debate mostra que é urgente repensar como testamos a inteligência artificial. Avaliações que confundem limitações técnicas (como o número de tokens) com falhas de raciocínio podem dar uma imagem errada das verdadeiras capacidades das IAs. O futuro passa por criar testes que distingam claramente entre o que é limitação prática e o que é, de facto, incapacidade de pensar.

Como resumiu Lawsen:

“A questão não é se os modelos conseguem raciocinar, mas se as nossas avaliações conseguem distinguir raciocínio de simples geração de texto.”

Este episódio promete influenciar a próxima geração de estudos e benchmarks em inteligência artificial — e, quem sabe, mudar a forma como vemos as máquinas a pensar.

Banner Premium — Informática Fácil

Assinatura

PREMIUM DIGITAL

Desbloqueie tudo o que a Informática Fácil tem para oferecer.

Subscrever agora
Acesso a 8 revistas de informática (4xIF + 4xPC&Internet) em PDF todos os anos
Acesso online a artigos exclusivos para assinantes
Acesso a todas as edições desde o ano 2020
Leitura de artigos sem publicidade

Artigos relacionados

Informática Fácil N.º 92
Informática Fácil N.º 92

Da privacidade ao controlo total dos seus dados, a tecnologia pode jogar a seu favor. Descubra as melhores novidades do…

O erro do Google Fotos com a IA e a solução que chega agora às suas pesquisas
O erro do Google Fotos com a IA e a solução que chega agora às suas pesquisas

A Google começou a disponibilizar um novo controlo no Google Fotos que permite alternar instantaneamente entre a pesquisa tradicional e…

Spotify prepara abertura das sessões Jam a utilizadores da conta gratuita
Spotify prepara abertura das sessões Jam a utilizadores da conta gratuita

O Spotify prepara-se para permitir que utilizadores da conta gratuita organizem sessões Jam. A funcionalidade de reprodução colaborativa em tempo…

A identidade fantasma: Spotify cria selo para identificar artistas gerados por IA
A identidade fantasma: Spotify cria selo para identificar artistas gerados por IA

O Spotify prepara a introdução de um selo obrigatório para identificar perfis musicais criados por inteligência artificial. A medida afeta…

Deixe um comentário

O seu endereço de email não será publicado. Campos obrigatórios marcados com *

This site is protected by reCAPTCHA and the Google Privacy Policy and Terms of Service apply.

🛡️

Recebeu uma mensagem suspeita?

A nossa IA deteta se é burla em segundos.

ANALISAR AGORA
Podcast Informática Fácil Tecnologia explicada de forma simples, num episódio de cada vez. Ouvir agora

MAIS LIDOS DA SEMANA

Image Not Found

Newsletter

Subscreva a nossa NEWSLETTER e receba as últimas novidades na sua caixa de correio eletrónico!

🛡️ Analisar Burla