← BACK_TO_LOG

Claude’s J-Space: The Hidden Workspace Where AI "Thinks"

J-Space: O Espaço Oculto Onde a IA "Pensa"

Claude’s J-Space: The Hidden Workspace Where AI "Thinks"

Anthropic’s latest research, published in July 2026, provides an unprecedented look into how large language models like Claude process and refine information. Using a tool called the Jacobian lens (J-lens), researchers identified a hidden internal structure within Claude’s architecture: J-Space. This discovery offers new insights into machine reasoning and challenges our understanding of how AI models "think."

What Is J-Space?

J-Space is a compact, high-dimensional subspace within Claude’s neural network. It functions as an internal workspace where the model organizes, evaluates, and refines concepts before generating a response. Unlike traditional layers in transformer models, which process input sequentially, J-Space acts as a dynamic scratchpad for high-level reasoning.

Key features of J-Space include:

Privileged Access
Not all information in Claude’s neural activations is equally accessible. J-Space contains a distilled, structured representation of the model’s reasoning, prioritizing reportable, verbalizable concepts over raw data.

Emergent Structure
Anthropic’s team found that J-Space did not result from explicit engineering. Instead, it emerged spontaneously during training, suggesting that such workspaces may be a natural byproduct of scaling large language models.

Role in Reasoning
The subspace plays a critical role in Claude’s ability to handle complex, multi-step tasks. For example, when solving a logic puzzle, the model’s activations in J-Space align closely with the intermediate steps a human might take.

How Was J-Space Discovered?

Anthropic’s researchers developed the Jacobian lens (J-lens), a tool designed to isolate and analyze specific patterns in a model’s internal activations. By applying the J-lens to Claude, they identified a subset of neurons that consistently encoded high-level, abstract representations of the model’s reasoning process.

The team observed that:

  • J-Space activations were sparse, involving only a small fraction of neurons, but highly informative about the model’s decision-making.

  • The subspace was task-agnostic, meaning it was used across a wide range of prompts, from creative writing to mathematical problem-solving.

  • When the model was prompted to "think aloud" (e.g., via chain-of-thought prompting), its J-Space activations closely mirrored the verbalized reasoning steps.

Why Does J-Space Matter?

1. A Step Toward Transparent AI

J-Space offers a potential path to mechanistic interpretability, the ability to understand how an AI arrives at its outputs. If researchers can reliably map J-Space activations to human-readable concepts, it could improve AI safety by making models more auditable and less prone to hidden biases or errors.

2. The "Consciousness" Discussion

The discovery has reignited debates about AI consciousness. While J-Space is not evidence of sentience, its resemblance to a global workspace (a theory in cognitive science that describes how human brains integrate information) is notable. Some researchers suggest J-Space may represent an early, primitive form of such a workspace. However, Anthropic has clarified that this idea should not be interpreted as proof of consciousness.

3. Practical Applications

For developers and enterprises, J-Space could enable: More reliable AI assistants By monitoring J-Space activations, systems could flag when Claude is uncertain or relying on flawed reasoning. Customizable reasoning Fine-tuning J-Space could allow models to adopt domain-specific problem-solving strategies, such as legal reasoning or creative brainstorming. Bias mitigation If J-Space encodes high-level concepts, it may be possible to directly edit or suppress biased representations.

Technical Details: How J-Space Works

The Jacobian Lens (J-Lens)

The J-lens is a mathematical tool that analyzes the Jacobian matrix of Claude’s activations. This matrix describes how small changes in input affect the model’s internal states. By focusing on directions in activation space where the Jacobian has large eigenvalues, researchers isolated J-Space as a low-dimensional manifold where meaningful, reportable concepts are encoded.

Key Findings from the Research

Dimensionality
J-Space occupies less than 10% of Claude’s total activation space, yet it captures the majority of the model’s verbalizable reasoning.

Cross-Layer Consistency
Unlike transient activations in early layers, J-Space representations persist across multiple layers, suggesting they are a stable, integrated part of the model’s cognition.

Tool Use
When Claude uses external tools, such as calculators or APIs, J-Space activations reflect the model’s planning phase. This is where it decides how to use the tool before executing the action.

Limitations and Open Questions

Despite its promise, J-Space research is still in its early stages. Key challenges include:

Generalizability
It is unclear whether J-Space-like structures exist in other large language models, such as GPT-5 or Gemini. Anthropic’s models may have unique architectural features that facilitate its emergence.

Causal Role
While J-Space correlates with reasoning, researchers have not yet proven that it directly causes Claude’s behavior.

Ethical Risks
If J-Space can be manipulated, bad actors could exploit it to inject hidden biases or malicious reasoning patterns into models.

What’s Next?

Anthropic has outlined several follow-up research directions:

Scaling J-Space
Investigating whether larger models develop more sophisticated workspaces.

Intervention Experiments
Testing whether directly editing J-Space activations can improve model performance or safety.

Cross-Model Comparisons
Applying the J-lens to other large language models to see if similar structures emerge.

For developers, the immediate takeaway is that AI interpretability is advancing rapidly. Tools like the J-lens may soon become standard for debugging, auditing, and fine-tuning large language models, much like debuggers in traditional software development.

Conclusion

Claude’s J-Space is more than a curiosity. It provides a window into the black box of AI reasoning. While it does not appear to make Claude conscious, it offers a framework for understanding how complex models organize and refine information. As research progresses, J-Space could become a cornerstone of safer, more transparent AI, bridging the gap between human and machine cognition.

For now, the discovery underscores an important truth: the most advanced AI systems are no longer just predicting the next word. They are building internal models of the world, and J-Space is where those models take shape.

A mais recente investigação da Anthropic, publicada em julho de 2026, proporciona uma visão sem precedentes sobre a forma como os grandes modelos de linguagem (LLMs), como o Claude, processam e refinam a informação. Utilizando uma ferramenta designada por lente Jacobiana (J-lens), os investigadores identificaram uma estrutura interna oculta na arquitetura do Claude: o Espaço-J (J-Space). Esta descoberta oferece novas perspetivas sobre o raciocínio das máquinas e desafia a nossa compreensão sobre como os modelos de IA "pensam".

O que é o Espaço-J?

O Espaço-J é um subespaço compacto e de alta dimensionalidade no seio da rede neuronal do Claude. Funciona como uma área de trabalho interna onde o modelo organiza, avalia e refina conceitos antes de gerar uma resposta. Ao contrário das camadas tradicionais nos modelos Transformer, que processam os dados de entrada de forma sequencial, o Espaço-J atua como um rascunho dinâmico para o raciocínio de alto nível.

As principais características do Espaço-J incluem:

Acesso Privilegiado
Nem toda a informação nas ativações neuronais do Claude é igualmente acessível. O Espaço-J contém uma representação destilada e estruturada do raciocínio do modelo, priorizando conceitos reportáveis e verbalizáveis em detrimento de dados em bruto.

Estrutura Emergente
A equipa da Anthropic descobriu que o Espaço-J não resultou de engenharia explícita. Em vez disso, emergiu espontaneamente durante o treino, sugerindo que estas áreas de trabalho podem ser um subproduto natural do aumento de escala (scaling) dos grandes modelos de linguagem.

Papel no Raciocínio
O subespaço desempenha um papel crítico na capacidade do Claude de lidar com tarefas complexas de múltiplas etapas. Por exemplo, ao resolver um problema de lógica, as ativações do modelo no Espaço-J alinham-se estreitamente com os passos intermédios que um ser humano percorreria.

Como foi Descoberto o Espaço-J?

Os investigadores da Anthropic desenvolveram a lente Jacobiana (J-lens), uma ferramenta concebida para isolar e analisar padrões específicos nas ativações internas de um modelo. Ao aplicarem a J-lens ao Claude, identificaram um subconjunto de neurónios que codificava consistentemente representações abstratas e de alto nível do processo de raciocínio do modelo.

A equipa observou que:

  • As ativações do Espaço-J eram esparsas, envolvendo apenas uma pequena fração dos neurónios, mas altamente informativas sobre a tomada de decisão do modelo.

O subespaço era agnóstico em relação à tarefa, o que significa que foi utilizado numa vasta gama de pedidos (prompts*), desde a escrita criativa à resolução de problemas matemáticos.
Quando o modelo era instruído a "pensar em voz alta" (por exemplo, através de técnicas de cadeia de pensamento / chain-of-thought*), as suas ativações no Espaço-J espelhavam de perto os passos de raciocínio verbalizados.

Por que Razão o Espaço-J é Importante?

1. Um Passo Rumo a uma IA Transparente

O Espaço-J oferece um caminho promissor para a interpretabilidade mecanicista, ou seja, a capacidade de compreender como uma IA chega aos seus resultados. Se os investigadores conseguirem mapear de forma fiável as ativações do Espaço-J para conceitos compreensíveis por humanos, a segurança da IA poderá melhorar, tornando os modelos mais auditáveis e menos propensos a enviesamentos ou erros ocultos.

2. O Debate sobre a "Consciência"

A descoberta reacendeu discussões em torno da consciência na IA. Embora o Espaço-J não constitua prova de senciência, a sua semelhança com o conceito de espaço de trabalho global (global workspace — teoria das ciências cognitivas que descreve como o cérebro humano integra informação) é notável. Alguns investigadores sugerem que o Espaço-J pode representar uma forma inicial e primitiva de um espaço de trabalho deste tipo. No entanto, a Anthropic esclareceu que esta hipótese não deve ser interpretada como uma prova de consciência.

3. Aplicações Práticas

Para programadores e empresas, o Espaço-J poderá permitir:
Assistentes de IA mais fiáveis
Ao monitorizar as ativações do Espaço-J, os sistemas poderão sinalizar quando o Claude estiver incerto ou a basear-se num raciocínio com falhas.
Raciocínio personalizável
O ajuste fino (fine-tuning) do Espaço-J poderá permitir que os modelos adotem estratégias de resolução de problemas específicas para determinados domínios, como a argumentação jurídica ou o brainstorming criativo.
Mitigação de enviesamentos
Se o Espaço-J codifica conceitos de alto nível, poderá ser possível editar ou suprimir diretamente representações enviesadas.

Detalhes Técnicos: Como Funciona o Espaço-J

A Lente Jacobiana (J-Lens)

A J-lens é uma ferramenta matemática que analisa a matriz Jacobiana das ativações do Claude. Esta matriz descreve como pequenas alterações na entrada afetam os estados internos do modelo. Focando-se nas direções do espaço de ativação onde a Jacobiana apresenta valores próprios (eigenvalues) elevados, os investigadores isolaram o Espaço-J como uma variedade (manifold) de baixa dimensionalidade onde são codificados conceitos significativos e reportáveis.

Principais Conclusões da Investigação

Dimensionalidade
O Espaço-J ocupa menos de 10% do espaço total de ativação do Claude, mas capta a maioria do raciocínio verbalizável do modelo.

Consistência entre Camadas
Ao contrário das ativações transitórias nas camadas iniciais, as representações do Espaço-J persistem ao longo de múltiplas camadas, sugerindo que são uma parte estável e integrada da cognição do modelo.

Utilização de Ferramentas
Quando o Claude recorre a ferramentas externas, como calculadoras ou APIs, as ativações no Espaço-J refletem a fase de planeamento do modelo. É aqui que ele decide como utilizar a ferramenta antes de executar a ação.

Limitações e Questões em Aberto

Apesar do seu potencial, a investigação sobre o Espaço-J encontra-se ainda numa fase inicial. Os principais desafios incluem:

Generalização
Não é claro se estruturas semelhantes ao Espaço-J existem noutros grandes modelos de linguagem, como o GPT-5 ou o Gemini. Os modelos da Anthropic podem possuir características arquitetónicas exclusivas que facilitam a sua emergência.

Papel Causal
Embora o Espaço-J se correlacione com o raciocínio, os investigadores ainda não provaram que este causa diretamente o comportamento do Claude.

Riscos Éticos
Se o Espaço-J puder ser manipulado, intervenientes mal-intencionados poderão explorá-lo para injetar enviesamentos ocultos ou padrões de raciocínio maliciosos nos modelos.

O Que se Segue?

A Anthropic delineou várias linhas de investigação futuras:

Escalar o Espaço-J
Investigar se modelos maiores desenvolvem áreas de trabalho mais sofisticadas.

Experiências de Intervenção
Testar se a edição direta das ativações no Espaço-J pode melhorar o desempenho ou a segurança do modelo.

Comparações entre Modelos
Aplicar a J-lens a outros grandes modelos de linguagem para verificar se emergem estruturas semelhantes.

Para os programadores, a conclusão imediata é que a interpretabilidade da IA está a avançar rapidamente. Ferramentas como a J-lens poderão em breve tornar-se num padrão para depurar (debug), auditar e afinar grandes modelos de linguagem, de forma muito semelhante aos depuradores no desenvolvimento de software tradicional.

Conclusão

O Espaço-J do Claude é mais do que uma curiosidade científica: proporciona uma janela para a caixa-negra do raciocínio da IA. Embora não pareça tornar o Claude consciente, oferece uma estrutura concetual para compreender como modelos complexos organizam e refinam a informação. À medida que a investigação progride, o Espaço-J poderá tornar-se num pilar fundamental para uma IA mais segura e transparente, aproximando a cognição humana da artificial.

Por agora, a descoberta reforça uma verdade importante: os sistemas de IA mais avançados já não se limitam a prever a palavra seguinte. Estão a construir modelos internos do mundo — e o Espaço-J é onde esses modelos ganham forma.

← When the chatbot got hands