Nos últimos dias, o mundo da inteligência artificial foi abalado por um intenso debate: afinal, será que os modelos de linguagem actuais conseguem mesmo raciocinar, ou apenas imitam padrões? Um estudo recente da Apple sugeriu que, perante desafios complexos, estas IAs “colapsam” e deixam de conseguir resolver problemas. Mas uma resposta crítica, assinada por Alex Lawsen, veio pôr em causa estas conclusões — e pode mudar a forma como avaliamos a inteligência artificial.
O que dizia o estudo da Apple?
A equipa de investigação da Apple testou modelos de IA de topo, como o Claude 3.7 Sonnet, Gemini e DeepSeek-R1, em puzzles clássicos de lógica, como a Torre de Hanói e problemas de travessia de rios. As conclusões foram surpreendentes: à medida que a complexidade dos puzzles aumentava, os modelos deixavam de conseguir apresentar soluções completas, mesmo quando, teoricamente, ainda tinham capacidade de processamento disponível. Para os investigadores da Apple, isto era sinal de que os modelos não raciocinam de facto — apenas seguem padrões, e esses padrões “quebram” quando o desafio sobe de nível.
As críticas de Lawsen: falhas na avaliação
Alex Lawsen, num artigo intitulado “A Ilusão da Ilusão de Pensar”, desmonta esta interpretação e aponta três grandes problemas:
- Limites de tokens ignorados: Nos puzzles mais complexos, como a Torre de Hanói com 8 ou mais discos, os modelos estavam a atingir o limite máximo de texto que podiam gerar (os chamados “tokens”). Em vez de falharem, muitos modelos avisavam explicitamente que iriam parar para poupar espaço, algo que o estudo original não considerou relevante.
- Puzzles impossíveis contados como falhas: Alguns desafios, como certos problemas de travessia de rio, eram matematicamente impossíveis de resolver (por exemplo, transportar demasiados personagens num barco demasiado pequeno). Os modelos eram penalizados mesmo quando reconheciam que não havia solução.
- Avaliação pouco realista: O método de avaliação da Apple exigia listas completas de todos os passos, sem distinguir entre incapacidade de raciocínio e limitações práticas de output. Ou seja, se o puzzle era demasiado grande para caber na resposta, era automaticamente considerado um fracasso.
Experiências alternativas mostram outra realidade
Lawsen foi mais longe e pediu aos modelos para resolverem os mesmos puzzles, mas de forma mais compacta — por exemplo, gerando código em Lua para resolver a Torre de Hanói, em vez de listar todos os movimentos. O resultado? Os modelos conseguiram resolver puzzles ainda mais complexos, como a Torre de Hanói com 15 discos, algo que o estudo da Apple dizia ser impossível. Isto demonstra que o problema estava no formato da avaliação e não na capacidade de raciocínio dos modelos.
O que muda na avaliação da IA?
Este debate mostra que é urgente repensar como testamos a inteligência artificial. Avaliações que confundem limitações técnicas (como o número de tokens) com falhas de raciocínio podem dar uma imagem errada das verdadeiras capacidades das IAs. O futuro passa por criar testes que distingam claramente entre o que é limitação prática e o que é, de facto, incapacidade de pensar.
Como resumiu Lawsen:
“A questão não é se os modelos conseguem raciocinar, mas se as nossas avaliações conseguem distinguir raciocínio de simples geração de texto.”
Este episódio promete influenciar a próxima geração de estudos e benchmarks em inteligência artificial — e, quem sabe, mudar a forma como vemos as máquinas a pensar.




















