Um percurso pela definição probabilística de Shannon e pelas abordagens que relacionam informação e significado.
Shannon (EUA, 1916-2001) aparece, obviamente, extensamente no artigo da SEP sobre informação. Logo nas definições técnicas do conceito de informação, quando se tentou, no século XX, formalizá-lo, levando-se em conta duas propriedades centrais: a de que a informação é extensa e que ela reduz incerteza.
Nota de Escopo: Aqui falaremos da informação do ponto de vista de Shannon, não de outros teóricos ou do percurso da sua história.
A primeira propriedade se baseia na aditividade, ao afirmar que dois conjuntos independentes de informação, se somados, contêm duas vezes a quantidade de informação, tanto quanto teriam se separados. Ela toma como exemplo a multiplicação logarítmica que se reduz a adição: loga×b = loga + logb. Essa formalização foi aplicada nas definições de entropia, inicialmente na Física, por Boltzmann, e depois emprestada por Shannon para a sua definição, como veremos.
Já a relação de que a incerteza diminui com mais informação aparece pela primeira vez com Locke e Hume, segundo o autor, esse último versando que uma escolha em um conjunto maior de possibilidades fornece mais informação (falamos sobre isso no artigo sobre indução). Entretanto, Shannon unifica os conceitos de extensividade e probabilidade na definição probabilística de informação: I(A) = −logP(A). Ou seja, a quantidade de informação em uma mensagem é o logaritmo negativo de sua probabilidade de ocorrência – teremos mais a dizer sobre isso na sequência.
Ocorre que Shannon se enquadra no ramo das teorias quantitativas da informação, que tratam da mensuração técnica, probabilística e estrutural dos dados, ao passo que há teorias qualitativas voltadas ao significado, veracidade e impacto da informação sobre um agente. Embora Shannon não a trate do ponto de vista semântico, sua noção de informação quantitativa é uma das mais conhecidas. Contudo, de acordo com a SEP, ela não capturaria a noção de desordem do sistema, que é essencial na termodinâmica, algo um tanto controverso porque a própria crítica compara eventos individuais (duas mensagens específicas), quando desordem, termodinamicamente, é uma propriedade do sistema como um todo (do conjunto de estados possíveis), não de um evento isolado. Isso ficará mais claro abaixo, mas vamos dar uma primeira espiada.
Supondo que, em um determinado corpus em português com significado comum, convencional, primeiro sorteemos a mensagem “sim” e, depois, “mis”. Naturalmente, a probabilidade de “sim” ocorrer é muito maior do que “mis”, então “mis” traz mais informação – um espanto. Porém, em português, “mis” não significa nada. Então, em si, “mis” tem quase zero informação semântica, mas uma alta quantidade de informação para Shannon.
Nosso exemplo deixa claro que a quantidade de informação presente em uma mensagem não determina seu significado. Tomando uma sequência improvável, que pode apresentar alta informação contida nela mesma, no sentido de Shannon, vemos que ela pode possuir um significado convencional no contexto considerado. Por outro lado, uma mensagem familiar pode ser perfeitamente compreendida sem trazer novidade relevante.
Então, o artigo cita de passagem a contribuição de Shannon no desenvolvimento histórico do significado do termo informação, que havia desaparecido na filosofia moderna e aparece com o matemático ao introduzir um método formal para mensurá-la. Embora, de forma heurística, em 1844, um assistente de Morse tenha utilizado um princípio de teoria de códigos ótimos para determinar a frequência das letras usadas em um jornal local em Morristown, EUA.
Conforme o artigo, Shannon se filia a uma tradição da Física proveniente de Galileu, que passa por entender conceitos abstratos, como calor e pressão, usando a matemática das probabilidades, como ponte entre o mundo micro e o macroscópico. Nessa linha, há uma evolução da teoria cinética, desde a proposição galileica do movimento das partículas, passando por Boltzmann, que formula a equação que relaciona a entropia com o número de combinações possíveis das partículas: S = k logW. A entropia S é a medida de desordem ou de estados do sistema, enquanto W são os microestados, as configurações invisíveis das partículas que produzem a mesma condição que vemos por fora (temperatura, pressão).
Daí surge a teoria da informação, com o log W podendo ser a quantidade de entropia do sistema, o tamanho da informação ou os dados necessários para detalhar cada microestado, o nível de incerteza sobre em qual estado exato as partículas estão ou, por fim, uma medida da probabilidade de encontrar o sistema em determinado estado. Até chegar na Ciência da Informação, com Shannon, que parte dessa estrutura matemática para criar a Teoria da Informação, medindo a entropia em sistemas de comunicação e dados. Shannon adapta a fórmula da Entropia de Gibbs, que mede o grau médio de incerteza, surpresa ou desordem de um sistema probabilístico, de forma mais geral.
Já adentrando nas teorias modernas da informação, o artigo elenca Popper, o primeiro a tentar formular uma boa teoria formal para medir a quantidade de informação, no seu caso intimamente ligada à falseabilidade. Então Shannon aparece com a informação definida em termos de probabilidade.
O artigo da SEP menciona que, por usar o logaritmo na base 2, há garantia de que a medição ocorre em bits. E que, quando as mensagens de um sistema têm igual probabilidade de ocorrer, isto é, são típicas, a entropia de comunicação é máxima.
Lembrando da definição probabilística de informação, acima, o que se representa é a proporção de um evento acontecer em relação ao total de possibilidades. Assim, a probabilidade de um evento varia de zero a um, sendo zero impossibilidade e um, certeza. Já a quantidade de informação definida por Shannon varia em sentido inverso. Quando a ocorrência de uma mensagem é certa, a informação que carrega é zero; quanto mais improvável for o evento, maior será a surpresa associada à sua ocorrência. Para eventos de probabilidade zero, a expressão não fornece um valor finito.
Então, se px = 1, então I(x) = 0. Isso quer dizer que quando é certo que vamos receber a mensagem x, ela não traz novidade, porque quanto menor a probabilidade de ocorrência da mensagem, mais informação ela contém. Conforme o exemplo: “O sol nascerá amanhã”, traz pouquíssima informação. E lembremos também da propriedade da aditividade: I(x + y) = I(x) + I(y), para dois eventos independentes, a quantidade de informação em duas mensagens combinadas é igual à soma da quantidade de informação nas mensagens individuais.
Não obstante, conforme o gráfico, como o logaritmo de base 2 não é positivo, há necessidade do sinal para garantir que não haja informação negativa.
Por fim, lembremos que, para Shannon, a informação de uma mensagem não depende do seu significado, mas da sua imprevisibilidade e, a partir daí, há filosofias da informação voltadas à semântica, como Bar-Hillel - Carnap e Floridi.
A terceira das teorias modernas da informação trata informação como o tamanho de um programa. Ela surge das considerações de um aluno de Carnap, Solomonoff, que tenta universalizar suas formulações de probabilidade, que eram dependentes da linguagem: P1 como grau de confirmação, aí numa relação lógica entre duas sentenças e P2 como frequência relativa, já do ponto de vista estatístico.
Então vem a definição de complexidade de Kolmogorov (1965, com Solomonoff e Chaitin), definindo a complexidade algorítmica de uma string x como o comprimento do menor programa que produz x quando é executado em uma máquina de Turing universal. Essa Teoria Algorítmica da Informação ganhou rápida aceitação passando a ser aceita como uma teoria da informação mais fundamental, conforme citação de Cover e Thomas (2006) “… consideramos a complexidade de Kolmogorov (ou seja, AIT) mais fundamental do que a entropia de Shannon”.
Quando trata de considerações sistemáticas, o artigo da SEP enquadra Shannon no campo da Filosofia da Informação como uma Extensão da Filosofia da Matemática. Há outras duas subdivisões onde ele não aparece: primeiro, na Informação e Computação Simbólica, com destaque para as máquinas de Turing e teorema de Gödel. Depois, em um trecho mais curto chamado Informação quântica e além, sendo relevante a notícia de que a física quântica mina o determinismo laplaciano e o conceito de qubit – bit quântico que pode se sobrepor, isto é, pode existir como 0, 1 ou em uma combinação de ambos ao mesmo tempo.
Detalhando um pouco mais, o autor da SEP remete ao seu Manual de Filosofia da Informação (Adriaans & van Benthem 2008b), ele caracteriza três tipos: informação-A: conhecimento, lógica, o que é transmitido em respostas informativas; informação-B: probabilístico, baseado na teoria da informação, medido quantitativamente e informação-C: compressão algorítmica de código, medida quantitativamente. A informação-A fez parte do programa positivista ao tentar reconciliar a lógica dos mundos possíveis (A) com o raciocínio probabilístico (B) e, como vimos, B a Shannon e C a Kolmogorov.
De volta para a filosofia da matemática, há forte correlação da filosofia da informação para com ela, na ligação entre perguntas como o autor cita: “O que são dados?” e “O que é informação?” com relação a “O que é um conjunto?” e “O que é um número?”. Então, para além da informação cotidiana, advinda da medição de coisas que remete a contagem de ovelhas na Mesopotâmia, há o desenvolvimento histórico dos símbolos, conjuntos, multiconjuntos e cadeias de caracteres para representar as coisas. Nesse ínterim, Shannon aparece como mais interessado na frequência das mensagens do que na informação sobre essa sequência, se inserindo em um multiconjunto que é atualizado a cada nova mensagem recebida, sem focar em sua estrutura.
Como a informação está intimamente relacionada ao conceito de conjunto e que Hilbert formula a ideia de que os conceitos matemáticos são definidos implicitamente por um conjunto de axiomas, nos leva a termos que explicitar exemplos. Dentro desse contexto, cita-se o paradoxo de Russell, variante do paradoxo dos mentirosos, no qual o filósofo inglês procura pelo conjunto de todos os conjuntos que não são membros de si mesmos, cujo objeto não se pode determinar. O exemplo mostra que há um limite para a teoria dos conjuntos e algum grau de controvérsia, embora Frege e Russell partam dessa base para definir o conjunto dos números naturais e assim por diante.
E é justamente um conjunto de números que vai servir de base para medirmos a quantidade de informação que se atribui a determinado elemento de um conjunto. É aqui que aparece as medições logarítmicas de Boltzmann (desordem de um gás) e Shannon (surpresa de uma mensagem), conforme vimos. Conforme o autor, elas estão fundamentadas em conceitos matemáticos mais básicos, como o conceito geral de conjuntos e podem levar a uma teoria unificada da informação. Já o supracitado Kolmogorov, cujo axioma da aditividade pode ter sua fórmula questionada no nível quântico, se junta a Shannon na conformidade de que programas determinísticos não criam informação nova.
Por fim e não cabe aqui, a seção explora fatoração, números primos, técnicas de criptografia e a atualização, em Gödel, do paradoxo do mentiroso, no teorema da incompletude que mostra que sistemas determinísticos devem conter afirmações que são verdadeiras, mas não demonstráveis. Ou seja, existem sentenças verdadeiras da forma “Eu não sou demonstrável”. Como o sistema não pode conter contradições, a frase não pode ser falsa, mas nunca poderá ser provada. É a incompletude que adverte que verdades existem, mas o sistema jamais consegue demonstrar com suas próprias regras.
Como pudemos ver nesse passeio pela informação, tendo como centro Shannon, há complexidade no tema e o capítulo 6 da SEP passará por anomalias, paradoxos e problemas em aberto na Filosofia da Informação. Principalmente, concentrando-se nas conexões entre informação, computação, busca, complexidade, termodinâmica, lógica, semântica e significado.
Em um primeiro momento, ilustra-se o paradoxo da busca sistemática, que aparece no Menon, de Platão, que pergunta a Sócrates: “como saber se você encontrou o objeto que procurava se ele é desconhecido?”. São problemas em aberto, tanto na ciência da computação como na filosofia, como podemos pensar em João em busca de um unicórnio. Se o encontra, para Shannon, há ali muita informação; já para Kolmogorov não, porque João já sabia o que era um unicórnio.
Contudo, tratando de determinismo e termodinâmica, os autores argumentem ser mais fácil relacionar Shannon (informação) com Kolmogorov (complexidade), embora tenha havido tentativas de criar computadores de bolas de bilhar para estudar sistemas reversíveis em termodinâmica.
Quando trata da semântica, na seção 6, há referência a Frege, no campo filosófico, como destaque na virada linguística, ligando lógica e informação. Porém, se pesquisadores como Popper, Carnap e Kolmogorov, entre outros, tiveram a ambição de quantificar a informação em conjuntos de frases verdadeiras, Shannon, conforme já mencionamos, afirma que sua teoria não é semântica.
Fechando o tema, na conclusão ressalta-se o papel importante que a informação tem na filosofia, seja na lógica, epistemologia e ontologia. Na verdade, as ciências em geral lidam com a informação e a filosofia da informação traz novas perspectivas para compreensão de problemas filosóficos, como a abordagem de Shannon que aqui analisamos e que vamos conectar com Wiener e Simondon, ali adiante.
Referências
ADRIAANS, Pieter. Information. The Stanford Encyclopedia of Philosophy. Disponível em: <https://plato.stanford.edu/archives/sum2024/entries/information/>.
ADRIAANS, Pieter; VAN BENTHEM, Johan (Ed.). Philosophy of Information (Handbook of the Philosophy of Science 8). Amsterdam: Elsevier, 2008. Disponível em: <https://www.sciencedirect.com/book/edited-volume/9780444517265/philosophy-of-information>.