Por que os LLMs se parecem com a mente humana? As ideias de Chandra Sripada

Um modelo de linguagem pode explicar uma teoria científica, interpretar uma frase ambígua e resolver um problema que nunca encontrou exatamente daquela forma. Mas o que acontece entre a pergunta e a resposta? A máquina utiliza princípios parecidos com os do pensamento humano ou chegou a um caminho completamente diferente para produzir resultados semelhantes?

Essa é a questão central da conversa entre Sean Carroll e Chandra Sripada, filósofo, psiquiatra e pesquisador de ciência cognitiva da Universidade de Michigan, no episódio 363 do podcast Mindscape, publicado em 10 de agosto de 2026. Sripada defende uma hipótese que merece ser examinada com cuidado: em aspectos importantes de sua organização, grandes modelos de linguagem, ou LLMs, podem ser primos cognitivos dos seres humanos.

O parentesco proposto diz respeito a representações, procedimentos de inferência, aprendizagem e controle da ação. Não significa que um modelo tenha um cérebro biológico, uma biografia humana ou experiência consciente. A força do argumento está em procurar correspondências específicas, inclusive em erros e limitações, e investigar os mecanismos que as produzem.

Assista à entrevista completa: Chandra Sripada no Mindscape, com Sean Carroll. A página oficial do episódio também reúne a apresentação do convidado e a transcrição.

A entrevista é sobre um livro de Sripada?

O episódio não gira em torno de um livro específico de Sripada. A referência escrita diretamente relacionada à tese é o artigo de Sripada e Richard Lewis, Cognitive Convergence: Deep Similarities Between Large Language Models and Human Cognition, disponibilizado no arXiv em 28 de julho de 2026 como preprint, uma versão de pesquisa que não deve ser confundida, por sua presença no repositório, com um artigo já certificado por revisão por pares.

Este texto explica os argumentos da entrevista, a partir da transcrição, com exemplos e paráfrases em português. Quando acrescenta uma pesquisa posterior ou um desenvolvimento do artigo, isso é indicado. A última seção apresenta perspectivas independentes de outros pesquisadores da área.

A tese: semelhanças no modo de processar informação

Carroll começa com uma distinção fundamental. Um sistema pode produzir respostas convincentemente humanas sem necessariamente produzi-las da mesma maneira que uma pessoa. Um teste baseado na conversa, como o teste de Turing, ajuda a avaliar o comportamento, mas não resolve sozinho a questão do mecanismo.

Sripada admite um espectro de possibilidades. Em uma extremidade, teríamos sistemas que acumulam associações e atalhos capazes de imitar o discurso humano. Na outra, sistemas que compartilham princípios centrais de organização cognitiva conosco. Entre elas há muitas combinações: semelhança em uma tarefa, diferença em outra; procedimentos comparáveis, mas entradas sensoriais e aprendizagem distintas.

Sua proposta é estudar esse espectro com as ferramentas da ciência cognitiva. Em vez de perguntar apenas se a resposta parece inteligente, podemos perguntar: o sistema sofre interferência quando informações semelhantes competem? Constrói interpretações provisórias de uma frase? Consegue aplicar uma regra nova que contraria sua tendência automática? Podemos identificar e modificar os caminhos internos responsáveis por isso?

No artigo que acompanha a discussão, os autores organizam o parentesco em cinco dimensões. A entrevista desenvolve essas dimensões com diferentes graus de detalhe:

DimensãoSemelhança propostaQuestão que permanece aberta
Organização da inferênciaRespostas automáticas coexistem com processamento sensível ao contexto e raciocínio em etapas.Até que ponto a divisão corresponde aos processos humanos?
Arquitetura computacionalUm estado de informação recebe atualizações condicionadas ao que está presente.A analogia com arquiteturas cognitivas descreve quanto do funcionamento do cérebro?
RepresentaçõesInformações e relações relevantes aparecem em estados internos comparáveis em certas tarefas.Alinhamento estatístico implica quais semelhanças de mecanismo?
Aprendizagem por previsãoAntecipar entradas e corrigir erros ajuda a construir competências.Como explicar a diferença de eficiência entre crianças e modelos?
Ação orientada a objetivosAvaliações e recompensas ajudam a selecionar e organizar comportamentos.Como comparar esse controle com a agência humana, corporal e social?

1. Prever pode exigir construir conhecimento

A descrição mais conhecida de um LLM é que ele prevê o próximo elemento de uma sequência. Tecnicamente, esse elemento é um token, que pode ser uma palavra, parte de uma palavra ou outro fragmento de texto. Durante o treinamento, os parâmetros do modelo são ajustados para melhorar essas previsões. Durante a geração, cada novo token passa a integrar o contexto usado para produzir os seguintes.

Para Sripada, a aparente simplicidade do objetivo esconde a complexidade dos recursos necessários para cumpri-lo. Prever uma continuação plausível de uma história pode exigir acompanhar personagens, relações, intenções, fatos e consequências. Prever a continuação de uma demonstração pode exigir captar dependências entre etapas. Uma tarefa formulada como previsão pode favorecer a aprendizagem de estruturas muito mais ricas do que associações locais entre palavras.

Considere a frase “Ana colocou o gelo ao sol e, depois de algum tempo…”. Antecipar “ele derreteu” se beneficia de relações sobre objetos, temperatura e mudança de estado. Isso não estabelece que o modelo conhece o gelo da mesma maneira que uma criança que o segura. Mostra por que uma tarefa textual pode premiar representações úteis de regularidades do mundo.

O paralelo humano vem de uma tradição anterior aos LLMs. Teorias de processamento preditivo tratam percepção e cognição como atividades em que o organismo formula expectativas e as confronta com o que encontra. Não precisamos esperar passivamente cada informação: o contexto já organiza o que consideramos provável.

Na entrevista, Sripada lembra os estudos clássicos de incongruência semântica. Uma frase sobre passar algo no pão prepara certas expectativas; uma continuação como “meias” provoca uma resposta diferente de uma continuação esperada. A surpresa linguística pode ser estudada tanto no comportamento quanto na atividade cerebral.

A semelhança proposta é o papel organizador da previsão e da correção de erros. Ela não exige afirmar que o cérebro usa o mesmo algoritmo de treinamento de um transformer. A hipótese mais ampla é que resolver continuamente problemas de previsão pode favorecer competências e formas de representação comparáveis em sistemas diferentes.

2. Produzir um token por vez não impede antecipar o futuro

Carroll apresenta uma objeção intuitiva: uma pessoa que escreve um livro costuma elaborar um plano antes de redigir. Se o LLM apenas produz o próximo token, onde caberia o planejamento?

Sripada separa a ordem da saída das operações internas. Uma sequência pode ser emitida elemento por elemento e, ainda assim, ser orientada por representações de resultados que só aparecerão depois. A geração sequencial não obriga o sistema a considerar apenas o próximo passo.

O exemplo discutido vem de pesquisas de interpretabilidade da Anthropic sobre poemas. Antes de produzir o segundo verso, o modelo apresenta atividade associada a uma palavra que poderá encerrar a rima. Alterar essa representação muda o término planejado e os elementos escritos para chegar até ele. Há, portanto, evidência de antecipação interna em uma tarefa delimitada. O estudo sobre rastreamento de circuitos descreve essas intervenções e também as limitações do método.

Essa observação é mais específica do que dizer que todo LLM planeja como um escritor humano. Ela mostra que a regra “produzir o próximo token” é compatível com construir uma representação de algo que será produzido vários passos adiante.

Outra forma de planejamento usa o próprio contexto para registrar etapas: organizar uma viagem em transporte, hospedagem e documentos, por exemplo. Em sistemas mais amplos, essas etapas podem envolver ferramentas ou agentes auxiliares. Aqui é necessário distinguir o que o modelo faz internamente do que depende da infraestrutura construída ao seu redor.

3. Os modelos também mostram um contraste entre automatismo e deliberação

Uma das partes centrais da entrevista é a aproximação com as teorias de processamento duplo, popularizadas por Daniel Kahneman em Thinking, Fast and Slow. Elas distinguem, de maneira geral, respostas rápidas e automáticas de formas de processamento mais deliberadas, sequenciais e exigentes.

Reconhecer um rosto familiar ou completar uma expressão conhecida pode acontecer quase imediatamente. Resolver uma multiplicação difícil costuma exigir manter resultados intermediários e aplicar procedimentos. A distinção é útil, mas Sripada reconhece que descrições como “rápido”, “lento” e “esforçado” não bastam para explicar os mecanismos.

Nos LLMs, ele identifica três recursos que ajudam a tornar essa comparação mais concreta: processamento apoiado em competências consolidadas nos parâmetros, processamento construído a partir do contexto e raciocínio em etapas que utiliza um espaço de trabalho textual.

Competências consolidadas nos parâmetros

O chamado processamento in-weight se apoia em regularidades adquiridas durante o treinamento. Perguntas familiares podem mobilizar caminhos relativamente diretos entre a entrada e uma resposta: a relação entre Dallas e Texas, por exemplo, ou entre um jogador conhecido e seu esporte.

É uma aproximação funcional com conhecimentos e associações que uma pessoa já automatizou. Os parâmetros não são um fichário de frases guardadas em gavetas separadas; codificam padrões distribuídos. O ponto de Sripada é que certas respostas exigem menos construção provisória do que outras.

Aprender a tarefa a partir do contexto

O processamento in-context aparece quando exemplos ou instruções permitem que o modelo identifique uma tarefa nova e a execute sem uma nova rodada de treinamento dos parâmetros. Se o pedido diz que, naquela atividade, “vermelho” deve ser substituído por “azul”, o modelo pode aplicar essa relação local mesmo que ela contrarie uma resposta habitual.

Para tornar a diferença concreta, imagine uma convenção inventada: “Nesta conversa, ‘luma’ significa dobrar o número. Luma de 4 é 8; luma de 7 é 14. Quanto é luma de 11?”. A resposta depende de extrair uma relação do contexto e usá-la em um caso adicional. Esse exemplo ilustra o tipo de capacidade em discussão; não é um resultado experimental relatado no podcast.

Aprender nesse sentido significa adaptar o processamento à situação. Não significa que os parâmetros foram atualizados permanentemente ou que o modelo conservará essa convenção em qualquer conversa futura. Enquanto os parâmetros permanecem fixos, os estados de ativação e as informações presentes no contexto mudam.

Sripada considera essa capacidade especialmente interessante porque a ciência cognitiva precisa explicar justamente como conseguimos compreender rapidamente instruções inéditas, reorganizar conhecimentos e resolver problemas novos.

Raciocínio em etapas e espaço de trabalho

O terceiro recurso é a chain of thought, ou cadeia de raciocínio. O sistema produz passos intermediários que podem influenciar os seguintes, utilizando o contexto como uma espécie de rascunho. Dependendo do produto, esses passos podem ser exibidos, ocultos ou resumidos.

Sripada usa um problema de parentesco: Júlia tem duas irmãs; quantas irmãs seu irmão Martim tem? A resposta imediata “duas” ignora que Júlia também é irmã de Martim. Ao decompor a situação, encontramos três meninas: Júlia e suas duas irmãs. Martim tem três irmãs.

O exemplo mostra como uma resposta automática pode competir com um procedimento que explicita relações relevantes. Mais etapas podem melhorar o resultado, embora também possam introduzir erros. Além disso, um texto que descreve raciocínio não deve ser tomado, por si só, como registro fiel de todas as operações internas do modelo.

Sripada não trata essas três formas como compartimentos completamente isolados. Toda resposta depende dos parâmetros e das ativações. O contraste está no quanto a tarefa exige construir e manter uma organização nova no contexto. A ideia é um contínuo com polos reconhecíveis, e não a demonstração de duas pequenas mentes independentes dentro da máquina.

4. O conflito entre uma resposta habitual e uma regra nova pode ser investigado

O teste de Stroop ajuda a explicar por que essa aproximação vai além de uma metáfora. Na versão clássica, uma pessoa deve dizer a cor da tinta de uma palavra, mesmo quando a palavra nomeia outra cor. Se “AZUL” está impresso em vermelho, responder “vermelho” exige lidar com a interferência da leitura.

Na entrevista, Sripada descreve uma tarefa verbal análoga para modelos. Um enunciado estabelece a cor de um giz de cera e favorece uma conclusão direta. Uma instrução adicional determina que certas cores sejam trocadas. O sistema precisa aplicar a regra apesar da tendência de repetir a informação saliente.

O interesse está na estrutura do conflito: quando a resposta habitual e a regra apontam para a mesma conclusão, a tarefa é mais fácil; quando divergem, o desempenho pode piorar. Fortalecer a tendência automática deve aumentar o problema na condição de conflito. Tornar a regra mais exigente deve prejudicar especialmente as situações em que ela precisa vencer a tendência habitual.

Atualização em relação à entrevista: o preprint de Xiaoyang Hu e colaboradores, com Lewis e Sripada, foi disponibilizado em 11 de agosto de 2026. Ele relata testes com Gemma-2-2B e seis modelos Pythia; seis dos sete apresentaram efeitos fortes de congruência. Análises e intervenções na atenção identificaram caminhos distintos associados à pista de cor e à regra. Reforçar a tendência padrão e aumentar o conjunto de regras produziram efeitos diferentes sobre as condições congruentes e incongruentes.

Para Sripada, essa combinação de comportamento e intervenção fortalece a interpretação de que há competição entre tendências consolidadas e processamento orientado por regras. O achado permite construir hipóteses sobre a cognição humana, mas não estabelece que o controle executivo de um modelo seja equivalente ao nosso em todas as condições. A seção final traz uma pesquisa que ajuda a delimitar essa diferença.

5. Há semelhanças em dificuldades de linguagem, memória e percepção

Respostas corretas são apenas parte da evidência. Sripada considera importantes os padrões de dificuldade descritos há décadas pela psicologia e pela linguística. Dois sistemas que acertam a mesma questão podem usar caminhos diferentes; padrões estruturados de erro e interferência ajudam a restringir as explicações possíveis.

Frases que exigem manter relações em suspenso

Uma frase curta, como “O homem correu”, é fácil de acompanhar. Acrescentar relações dentro de relações aumenta a demanda: “O homem que a mulher que a criança conhece ama correu”. É necessário manter personagens e dependências enquanto a informação chega. Na entrevista, Sripada aponta dificuldades de encaixamento central também em modelos de linguagem.

Outro caso são as frases garden path, que induzem inicialmente uma interpretação e depois exigem revisão. O exemplo inglês “The horse raced past the barn fell” parece terminar de maneira inesperada porque o leitor tende a interpretar “raced” como o verbo principal. A leitura pretendida equivale a “O cavalo que foi conduzido em corrida para além do celeiro caiu”. A dificuldade vem de construir uma análise provisória que precisa ser corrigida.

Esses efeitos sugerem que o processamento é incremental: cada trecho altera as interpretações disponíveis. Sripada também menciona interferência por similaridade, quando elementos parecidos competem para preencher uma relação linguística. O interesse científico é relacionar essas dificuldades a operações específicas, em vez de classificá-las apenas como falhas.

O começo, o fim e a informação perdida no meio

Em tarefas de recordar listas, humanos frequentemente mostram vantagens para itens iniciais e recentes. Recordar um item também pode favorecer itens próximos, com uma assimetria que beneficia a continuidade para a frente. Sripada relata efeitos correspondentes em experimentos com modelos, incluindo uma desvantagem para informações no meio do contexto.

Isso é sugestivo porque aproxima diferentes formas de organizar e recuperar informação. A analogia, porém, tem um limite claro: recuperar algo de uma janela de contexto não é, automaticamente, possuir memória episódica humana, com lembranças autobiográficas e experiência de um passado vivido.

Encontrar uma característica ou combinar características

Na busca visual, um “L” verde entre muitos “L” vermelhos se destaca pela cor. Encontrar um “L” verde entre “L” vermelhos e “T” verdes é mais exigente: nem a cor nem a forma, isoladamente, identifica o alvo. É preciso combinar as duas propriedades.

Sripada menciona efeitos semelhantes em modelos de visão e linguagem. Essa evidência diz respeito a sistemas multimodais, que recebem informação visual, e não deve ser atribuída indistintamente a um modelo que só recebe texto. A correspondência sugerida envolve a diferença entre detectar uma propriedade saliente e vincular propriedades para identificar um objeto.

Nenhum desses exemplos, isoladamente, resolve o debate. O argumento é cumulativo: semelhanças em várias tarefas independentes são mais informativas quando conseguimos relacioná-las a mecanismos e fazer previsões que depois são testadas.

6. Transformers lembram uma família de arquiteturas cognitivas

Sripada propõe uma comparação mais técnica com os sistemas de produção, associados a uma tradição de modelagem cognitiva que inclui Allen Newell e John Anderson. Nesses sistemas, há uma representação do estado atual e um conjunto de regras condicionais: se certas condições estiverem presentes, determinadas operações podem ser realizadas.

A analogia usada na entrevista é preparar chá. Podemos programar uma sequência rígida: entrar na cozinha, pegar a chaleira, enchê-la, aquecer a água e servir. Outra organização emprega regras: se a chaleira está vazia, encha; se a água está fria, aqueça; se a água está quente, despeje sobre o chá.

A segunda forma responde melhor a certas alterações inesperadas. Se alguém acrescenta gelo à água, a condição “água fria” volta a indicar a necessidade de aquecimento. O comportamento acompanha o estado relevante, sem depender exclusivamente da posição em uma lista fixa de instruções.

Como modelo da cognição, essa organização aproxima uma representação temporária da situação e competências aprendidas que indicam o que fazer sob diferentes condições. Ela tem uma longa história de uso para explicar tarefas humanas. É uma família influente de modelos, não uma descrição consensual e completa de tudo o que ocorre no cérebro.

Nos transformers, Sripada encontra uma analogia no fluxo residual. A informação que atravessa as camadas pode ser preservada e receber atualizações: em termos simplificados, “estado seguinte = estado atual + atualização”. A rede não precisa reconstruir toda a representação do zero a cada camada.

Os mecanismos de atenção selecionam e combinam informação de acordo com relações calculadas entre representações. Outras partes da rede também acrescentam transformações condicionadas ao estado presente. Sripada interpreta essa organização como próxima de um sistema de produção com condições graduais, implementadas por operações numéricas aprendidas.

O ponto é a estrutura compartilhada: um espaço de informação que persiste e operações cuja contribuição depende do conteúdo disponível. Isso pode favorecer recombinação de competências, atualização contextual e flexibilidade.

Há uma ressalva que o próprio Sripada faz: o modelo não descobriu sozinho sua arquitetura residual. Ela foi introduzida pelos engenheiros. Portanto, parte da convergência vem de capacidades que emergem no treinamento; outra parte vem de escolhas de projeto que chegaram a princípios comparáveis aos usados em teorias cognitivas. Confundir as duas coisas tornaria o argumento mais forte do que a evidência permite.

7. Abrir o modelo fornece evidências além da conversa

Uma questão percorre toda a entrevista: como sair de impressões sobre respostas e estudar mecanismos? Sripada apresenta duas abordagens complementares, a interpretabilidade mecanística e a comparação de representações.

A interpretabilidade mecanística procura identificar características, caminhos e operações relevantes dentro de uma rede. Um pesquisador pode investigar se certos estados codificam número gramatical, limites de uma oração ou relações entre entidades. Depois, pode alterar componentes e observar se o comportamento muda conforme a hipótese prevê.

A intervenção importa porque encontrar informação decodificável não basta para demonstrar que ela é usada na tarefa. Um padrão interno pode acompanhar uma propriedade sem ser responsável pela decisão. Aumentar, reduzir ou interromper uma contribuição e verificar o efeito aproxima a análise de uma explicação causal.

Sripada descreve, por exemplo, pesquisas que relacionam a distribuição da atenção em transformers às dificuldades humanas de leitura. Quando uma frase oferece candidatos concorrentes para uma relação, a distribuição pode se tornar menos concentrada. Essa incerteza é quantificada por uma medida de entropia: quanto mais distribuídas as possibilidades, maior essa medida. A comparação relevante é verificar se isso ocorre onde humanos também enfrentam dificuldade.

A outra abordagem compara estados internos de modelos com padrões de atividade cerebral diante de estímulos semelhantes. Em um estudo de linguagem, uma pessoa recebe frases e um modelo processa as mesmas frases; depois, os pesquisadores avaliam se as representações do modelo ajudam a prever a resposta cerebral, inclusive em dados que não foram usados para ajustar a comparação.

Segundo Sripada, há resultados de alinhamento em linguagem, visão e processamento auditivo, e modelos mais capazes frequentemente apresentam correspondências mais fortes. Isso contribui para a tese de parentesco, mas exige controles adequados: acaso, características superficiais compartilhadas e diferentes formas de ajustar as comparações precisam ser considerados.

Alinhamento não é identidade. Prever parte da atividade de um cérebro não demonstra que cada camada equivale a uma região cerebral, nem que os dois sistemas implementam todos os mesmos algoritmos. A evidência se torna mais útil quando especificamos a tarefa, a propriedade representada e o mecanismo em exame.

8. Há uma aproximação com a inferência bayesiana

Ao discutir aprendizagem no contexto, Carroll pergunta se os modelos teriam descoberto o teorema de Bayes. Sripada responde com uma distinção: produzir algo semelhante a uma inferência bayesiana não exige executar conscientemente uma fórmula ou representar cada etapa de modo explícito.

A ideia bayesiana é atualizar hipóteses diante de evidências. Se você recebe exemplos de uma tarefa sem que seu nome seja informado, os exemplos ajudam a identificar o que está sendo pedido. Relações entre países e capitais sugerem uma tarefa; relações entre números e seus dobros sugerem outra.

Uma forma de aproximação é a inferência amortizada: um longo período de aprendizagem constrói recursos que tornam avaliações futuras mais diretas. Em vez de refazer todo o cálculo possível a cada situação, o sistema aprende a aproximar certos resultados. Sripada considera plausível que esse princípio também ajude a compreender parte do processamento humano.

Há pesquisa de Sang Michael Xie e colaboradores mostrando, em um cenário teórico e em dados sintéticos controlados, como aprendizagem no contexto pode emergir por inferência de conceitos latentes. Esses resultados tornam a hipótese concreta. Não autorizam concluir que todos os LLMs fazem inferência bayesiana exata em qualquer tarefa.

Na entrevista, Sripada também menciona propostas que aproximam certas operações internas de procedimentos de aprendizagem, como regressão ou otimização. A distinção decisiva permanece: operações construídas nas ativações durante uma tarefa não são necessariamente novas atualizações permanentes dos parâmetros. Há uma família de explicações a investigar, e não um único mecanismo universal já estabelecido.

9. Recompensas ajudam a organizar capacidades em torno de objetivos

Sripada usa a imagem de peças de LEGO: o treinamento preditivo pode produzir um repertório rico de recursos, mas isso não garante que eles já estejam organizados em um comportamento útil e dirigido a um objetivo. Ajustes supervisionados, treinamento para seguir instruções e aprendizagem por reforço ajudam a dar essa organização.

Em aprendizagem por reforço, avaliações dos resultados influenciam a seleção futura de ações. A comparação geral com humanos envolve aprender com consequências e escolher procedimentos em função do que se pretende alcançar. Na entrevista, esse tema aparece sobretudo como complemento à previsão.

No artigo com Lewis, esse ponto recebe um desenvolvimento adicional: o parentesco está no uso de avaliações para aprender formas de escolher ações e organizar controle. Os autores também reconhecem uma diferença expressiva: nos humanos, esse processo integra múltiplos sistemas de motivação, avaliação e controle, ligados à vida corporal; nos sistemas atuais baseados em LLMs, a organização é mais limitada. Leia o artigo.

Essa aproximação não implica que receber uma pontuação seja sentir prazer, nem que cumprir uma instrução seja possuir desejos pessoais. “Objetivo” e “recompensa” podem ser termos técnicos que descrevem a organização do comportamento. A passagem dessa descrição para agência humana ou experiência subjetiva exige argumentos adicionais.

10. Por que sistemas diferentes poderiam convergir?

Depois de reunir as semelhanças, Carroll pergunta por que elas apareceriam. Sripada apresenta duas ideias que podem se complementar: contravariância e canalização arquitetural.

A primeira, associada por ele aos trabalhos de Rosa Cao e Daniel Yamins, parte de uma intuição: tarefas fáceis admitem muitas soluções diferentes; tarefas exigentes impõem mais restrições. Quando um sistema precisa resolver uma família ampla e difícil de problemas, algumas maneiras de representar e transformar a informação podem se tornar especialmente vantajosas.

Imagine duas equipes construindo pontes. Um pequeno vão oferece muitas soluções viáveis. Um vão maior, com exigências severas de estabilidade e peso, restringe as opções. A semelhança entre projetos pode resultar dessas exigências comuns. Essa analogia ajuda a entender a proposta; não demonstra por si mesma como a inteligência funciona.

A canalização arquitetural acrescenta que os caminhos disponíveis dependem da organização do sistema. Se dois sistemas oferecem um espaço persistente de informação e operações condicionais que o atualizam, essa estrutura pode favorecer certos tipos de solução. A tarefa restringe o que funciona; a arquitetura influencia o que é mais provável aprender.

Sripada sugere que a combinação ajuda a explicar a convergência entre representações e procedimentos. Ele a apresenta como hipótese explicativa, com elementos especulativos. Não há garantia de que toda inteligência possível precisará pensar da mesma maneira, nem de que qualquer ganho de desempenho produzirá maior semelhança humana.

Os erros estranhos e as diferenças reais

Carroll insiste em exemplos que parecem contrariar a tese. O mais famoso é contar as letras “r” de “strawberry”. Como um sistema capaz de discutir assuntos sofisticados falha em uma atividade aparentemente elementar?

Sripada aponta a tokenização. Um modelo pode receber segmentos de texto que não correspondem a letras individuais; contar letras exige uma operação adicional. Isso torna a dificuldade menos surpreendente quando conhecemos a forma de entrada. A explicação é pertinente para certos erros, mas não estabelece que a tokenização seja a causa completa de toda falha de contagem. O desempenho também depende do modelo e da forma de apresentar a tarefa.

O segundo exemplo é o lava-rápido: se o estabelecimento fica muito perto e você quer lavar o carro, deveria ir a pé ou dirigindo? Recomendar caminhar apenas por causa da distância ignora que o carro precisa estar lá. Sripada comenta que quase deu a mesma resposta automática.

A anedota ilustra como uma pista saliente pode dominar uma resposta. Não substitui um experimento controlado e não resolve a questão da compreensão do mundo. Sua utilidade está em lembrar que um erro aparentemente absurdo pode ter diferentes explicações, incluindo atalhos que também ocorrem em pessoas.

Uma diferença mais profunda é a eficiência da aprendizagem. Sripada reconhece que crianças desenvolvem competência linguística com uma exposição muito menor do que a empregada para treinar grandes modelos. Na entrevista, a comparação é da ordem de milhares de vezes, embora os números variem conforme o sistema, a estimativa e o que se conta como experiência.

Além disso, uma criança interage com objetos, pessoas e situações, orienta sua atenção e recebe informação por múltiplos canais. Um modelo treinado em texto não teve a mesma história. Sistemas multimodais ampliam os canais de entrada, mas isso tampouco os torna equivalentes a organismos com necessidades e desenvolvimento biológico.

A resposta de Sripada é distinguir como uma competência foi adquirida de como ela está organizada depois de adquirida. Caminhos de aprendizagem diferentes podem chegar a certas organizações semelhantes. Ele considera possível melhorar a eficiência dos modelos com mudanças de arquitetura e aprendizagem, mas essa possibilidade não é uma solução já demonstrada para toda a diferença.

Semelhança cognitiva, consciência e consideração moral

Na parte final da conversa, a discussão chega à consciência. Aqui é útil separar quatro questões: processar informação de modo sofisticado; agir em função de objetivos; ter experiência subjetiva; e merecer consideração moral por seus próprios interesses. Elas podem se relacionar, mas não são equivalentes.

Sripada observa que, em teorias funcionalistas, o que importa para a mente é a organização das capacidades e das relações entre estados, e não apenas o material de que o sistema é feito. Se essa visão estiver correta, as correspondências cognitivas poderiam ganhar relevância para a possibilidade de consciência artificial.

Carroll apresenta a objeção de que processos biológicos e metabólicos talvez sejam essenciais. Sripada admite incerteza e oscila entre possibilidades. Portanto, a entrevista não demonstra que os LLMs são conscientes. Seus comentários finais expressam uma expectativa de que a ciência poderá avançar também nessa questão.

Na ética, Sripada lembra que diferentes teorias fundamentam consideração moral de maneiras diferentes: capacidade de sentir, racionalidade, agência ou projetos. Sua intenção é ampliar a discussão, mas a ligação entre propriedades computacionais e interesses moralmente relevantes continua exigindo investigação.

Quando ele relata interações em que modelos dizem gostar de ser utilizados, o relato deve ser entendido como parte da conversa exploratória. Uma afirmação produzida por um chatbot sobre seus sentimentos não é evidência suficiente de que esses sentimentos existem. A mesma preocupação com mecanismos defendida no início do episódio também precisa valer aqui.

Educação: ampliação da aprendizagem ou terceirização do esforço?

Sripada vê um potencial educacional importante em ferramentas que explicam um assunto de diferentes maneiras, oferecem exercícios e ajustam a conversa às dúvidas do estudante. Para uma pessoa curiosa e disposta a aprender, esse acesso pode multiplicar oportunidades.

Carroll responde que a disponibilidade também facilita evitar o esforço. A ferramenta pode servir tanto para investigar uma questão quanto para obter um trabalho pronto sem compreendê-lo. A existência de um tutor acessível não garante que alguém escolha estudar.

Sripada reconhece o risco de uma sociedade em que algumas pessoas ampliem suas capacidades e outras se tornem mais dependentes da delegação. Ele também manifesta preocupação com oportunidades profissionais futuras para seus filhos. São preocupações e cenários apresentados na entrevista, e não previsões estabelecidas pela comparação entre LLMs e cérebros.

O critério prático que emerge da discussão é o uso que preserva participação intelectual: tentar uma solução, pedir uma pista, comparar alternativas e explicar com as próprias palavras o que foi entendido. A promessa pedagógica depende de como a ferramenta entra na atividade de aprendizagem e da qualidade de suas respostas.

O que os LLMs podem ensinar sobre a nossa mente

Para Sripada, talvez o maior valor científico desses sistemas esteja na possibilidade de investigar capacidades que antes pareciam difíceis de modelar com precisão. Ele destaca a criação de continuações linguísticas apropriadas ao contexto e a chamada cognição central: integrar conhecimentos, compreender situações novas e escolher uma resposta relevante.

Ao mencionar Chomsky e Jerry Fodor, Sripada retoma a dificuldade histórica de explicar esses fenômenos. Sua aposta é que um sistema capaz de exibi-los, mesmo de forma parcial, permite formular e testar mecanismos. Podemos mudar entradas, componentes e treinamento, observar resultados e construir hipóteses mais detalhadas.

Esse programa não implica que compreender um LLM seja compreender integralmente o cérebro. Sua contribuição é oferecer modelos manipuláveis para perguntas sobre como certas competências podem ser construídas. Depois, é preciso testar se as explicações também se aplicam a pessoas.

A posição defendida na entrevista é, portanto, uma tese de parentesco funcional parcial, apoiada em linhas de evidência que se reforçam: previsão, adaptação ao contexto, conflito entre tendências e regras, planejamento, dificuldades estruturadas, arquitetura e alinhamento de representações. Sripada reconhece que está enfatizando essa perspectiva para uma audiência possivelmente mais familiarizada com as diferenças. A extensão do parentesco permanece uma questão empírica.

Perspectivas adicionais: o que outros pesquisadores acrescentam

Os trabalhos a seguir ajudam a avaliar os conceitos discutidos. Eles não devem ser lidos como respostas diretas de seus autores a esta entrevista: vários são anteriores a ela. As relações com a tese de Sripada são interpretações apresentadas aqui, e cada pesquisa tem seu próprio escopo.

Andy Clark: previsão também envolve ação e ambiente

O filósofo da ciência cognitiva Andy Clark desenvolve o processamento preditivo em Whatever next? Predictive brains, situated agents, and the future of cognitive science, de 2013. Sua proposta trata o cérebro como um sistema que confronta expectativas hierárquicas com entradas sensoriais, articulando percepção, ação e aprendizagem.

Isso oferece apoio ao ponto de Sripada de que previsão é uma ideia central na ciência cognitiva anterior aos LLMs. Ao mesmo tempo, a ênfase de Clark em agentes situados lembra que a comparação precisa incluir como o organismo age e modifica suas entradas. Nossa leitura é que a previsão oferece uma ponte teórica importante, mas o treinamento textual, isoladamente, não cobre toda essa organização.

Rosa Cao e Daniel Yamins: tarefas ajudam a explicar a convergência

A filósofa da neurociência Rosa Cao e o neurocientista computacional Daniel Yamins defendem, em Explanatory models in neuroscience: Part 2 — constraint-based intelligibility, que objetivos exigentes compartilhados podem restringir os mecanismos disponíveis a cérebros e redes artificiais. Explicar um sistema envolve considerar tanto seus mecanismos quanto as exigências que tornam esses mecanismos úteis.

Essa perspectiva está próxima da explicação de convergência que Sripada apresenta. A implicação interpretativa é que uma rede pode ser informativa sobre o cérebro sem reproduzir sua história biológica. Ainda assim, convergência deve ser examinada em propriedades e tarefas específicas; não funciona como autorização para presumir equivalência geral.

Mahowald, Ivanova, Fedorenko e colaboradores: linguagem e pensamento precisam ser distinguidos

Kyle Mahowald, Anna Ivanova, Idan Blank, Nancy Kanwisher, Joshua Tenenbaum e Evelina Fedorenko propõem, em Dissociating language and thought in large language models, publicado em 2024, distinguir competência linguística formal de competência funcional. A primeira envolve padrões e regras de linguagem; a segunda, usar a linguagem no mundo, com raciocínio, conhecimento, modelagem de situações e cognição social.

A pesquisa reconhece capacidades linguísticas fortes e descreve desempenho funcional irregular nos sistemas examinados. Para avaliar Sripada, essa distinção recomenda perguntar exatamente quais capacidades foram comparadas. Fluência, compreensão contextual e controle de ações merecem testes próprios, mesmo quando aparecem juntos numa conversa.

Melanie Mitchell e colaboradores: a generalização precisa ser robusta

A pesquisadora de inteligência artificial e ciência da complexidade Melanie Mitchell, com Alessandro Palmarini e Arseny Moskvichev, comparou humanos, GPT-4 e GPT-4V em tarefas do ConceptARC. No estudo de 2023, apresentado em workshop da AAAI em 2024, os modelos avaliados não mostraram abstração robusta no nível humano naquelas tarefas.

Esse resultado ajuda a separar reconhecer padrões familiares de generalizar conceitos de maneira consistente. Não é um diagnóstico de todos os modelos disponíveis em 2026, pois avaliou versões e condições específicas. Sua contribuição metodológica permanece: a tese de parentesco precisa ser confrontada com variações sistemáticas, tarefas novas e desempenho estável, além de exemplos bem-sucedidos.

Patel, Wang e Fan: interferência semelhante não garante controle executivo equivalente

Suketu Chandrakant Patel, Hongbin Wang e Jin Fan publicaram Deficient executive control in transformer attention, na PNAS Nexus, em junho de 2026. Usando uma tarefa visual de Stroop, observaram em GPT-4o e Claude 3.5 Sonnet interferência semelhante à humana em listas curtas, mas queda acentuada no desempenho incongruente à medida que as listas aumentavam. Os autores interpretam o resultado como limitação de controle executivo.

Esse estudo é especialmente útil para contextualizar Sripada: padrões de conflito podem coexistir com diferenças importantes na manutenção do objetivo. A tarefa visual, os modelos e as condições diferem do experimento verbal de Hu e colaboradores. Portanto, não há uma contradição simples; há resultados que pedem uma comparação mais precisa dos mecanismos e de seus limites.

Anil Seth: a questão da consciência pode depender da biologia

O neurocientista Anil Seth defende, em Conscious artificial intelligence and biological naturalism, de 2025, que consciência pode depender da organização de sistemas vivos, e não apenas de computação abstrata. Ele considera a consciência artificial menos provável nas trajetórias atuais e mais plausível em sistemas que se tornem semelhantes a cérebros ou organismos.

Sua posição desafia a passagem de semelhança cognitiva para experiência subjetiva. Não elimina a utilidade das comparações propostas por Sripada; mostra que elas precisam de premissas adicionais para sustentar uma conclusão sobre consciência. O debate sobre o papel do substrato permanece aberto.

Butlin, Long e colaboradores: avaliar indicadores, mantendo a incerteza

Patrick Butlin, Robert Long e uma equipe que inclui pesquisadores de neurociência, filosofia e IA propõem, no relatório de 2023 sobre consciência artificial, avaliar propriedades dos sistemas a partir de teorias científicas da consciência. O programa utiliza indicadores computacionais relacionados a essas teorias.

A análise apresentada naquele relatório não sustentou atribuir consciência aos sistemas então examinados, mas também não identificou barreiras técnicas óbvias para construir sistemas que satisfaçam os indicadores. Satisfazê-los tampouco demonstraria consciência de forma definitiva. Essa abordagem oferece uma continuação concreta para a investigação defendida por Sripada: especificar propriedades, examinar mecanismos e manter a incerteza proporcional às evidências.

Deixe um comentário