parou, já parou a pensar que tá todo mundo esperando, né, o preço das inteligências artificiais subirem pra gente comemorar juntos a bolha explodindo, mas as notícias que a gente vê saindo são o contrário, o preço caindo. Essa semana eu já falei, por exemplo, da meta, né, cortando 90 e poucos por do valor dos seus tokens. E agora nós temos aqui a Open AI, cara, fazendo basicamente o maior corte já feito pela empresa.
Dia 30 de julho, a Open Ai baixou o preço da PI em até 80%. E todo mundo tá agora discutindo a mesma coisa, né? Guerra de preço, pressão da Antropic, entprise reclamando de custo.
E é tudo verdade. Só que dias antes desse corte, a Open publicou um segundo post muito interessante que eu vou ver aqui para vocês agora e é muito mais técnico também que poucos leram sobre como o GPT 5. 6 Sol recreveu e otimizou o kernel deles em production.
Esse vídeo tá sendo patrocinado pela UVP, é a maior escola de investimentos do Brasil. Se tu quer investir no Brasil e no mundo e construir patrimônio, confere o link que tá aqui na descrição. E é isso que a gente quer ver, cara.
A gente quer ver ganho de eficiência. Basicamente o que o Sol fez aqui é reescrever o kernel de GPU da própria infraestrutura que serve o modelo sozinho. Isso por si só derrubou em 20% o custo de servidor.
Então nesse caso, possivelmente, né, esse corte de gasto não é uma jogada de marketing. É a primeira vez que a gente tem um ganho de modelo melhorando o modelo chegando no teu cartão de crédito. E isso é o que quero destrinchar hoje.
Então o que que mudou em questão de de preços, né? O Luna agora tá de dó de input foi para 20 centavos por 1 milhão de tokens. O Terra foi de 2,50 para 2, uma redução de 20%.
O Sol foi de 5 para 5. É isso. No Sol eles não mexeram porque afinal ele é o super modelo que melhorou o próprio modelo, né?
Esse eu não vou te dar. E eles introduziram daí o Sol Fast, que é 2. 5% mais rápido e duas vezes mais caro.
Então o Sol, que é o modelo mais forte, não baixou de preço. O corte foi no tier de grande volume, como Luna e o Terra. Isso aqui não é por acidente, tá?
A gente pode voltar isso daqui a pouco no vídeo. E esse modo fast na API, na verdade substitui a oferta que eles tinha de priority processing. Então, para o GPT 5.
6, só o modo Fest agora oferece velocidade até 2,5 vezes maior que o processamento standard pelo dobro do preço, sem nenhuma mudança na inteligência. O modo fast é retrocompatível, as solicitações marcadas com priority usarão automaticamente o modo fast. Agora, isso aqui não é só para quem também usa API, tá?
Tanto o Codex e o Chat EPT Cowork, eles contam o teu uso também de uma forma diferente. Agora Terra e Luna passaram a consumir menos créditos com a tua assinatura pelo mesmo preço, o que é o que eu realmente quero ver. Eu quero ver desconto nos meus créditos da minha assinatura.
Então, se tu usa a assinatura do chat G EPT aí no Codex e tu vê que teus créditos estão sendo, estão consumindo muito rápido, toma cuidado para não ficar usando o modelo Sol no modelo no no modo fast, que ele vai consumir mais rápido teus créditos e quando possível usa então Terra e o Luna que eles estão estão mais baratos. Agora teve uma coisa interessante do modelo, né, reescrevendo o kernel de GPU, o Sol agora rodando via codex ali, ele conseguiu reescrever o Kern de produção deles em Triton e Gluon. E Trython aqui é uma linguagem e um compilador para programação paralela.
Seu objetivo é fornecer um ambiente de programação baseado em Python para escrever de forma produtiva kernels de computação de DN personalizados capazes de operar com máximo desempenho em hardware de GPU moderno. Sabe qual que é assim uma coisa que eu vou ficar muito feliz? É o dia que CPU voltar a ser exaltada e a gente vê notícias como o Sol reescreveu tudo em band.
É isso que eu quero ouvir. E antes que tu pergunte, tá, mas quem garante que o modelo não escreveu um kernel que dá resultado errado? Eles verificaram tudo com esse tal de floating point sanitizer ou FP Sum.
Porque eu acho que esse é o maior problema quando tu tá reescrevendo kernel, escrevendo no kernel, né? Porque o kernel numérico ele não ele não estoura, basicamente. Ele só vai te dar um número errado levemente para sempre.
Então isso aqui é muito legal e vocês que têm interesse nisso, dar uma estudada. Não é algo que eu estudei a fundo. E tem outro conceito também interessante que é o tal do speculative decoding, que isso aqui é ainda mais doido, cara, porque o sol ele redesenhou o próprio draft model, que é basicamente um modelinho rápido que chuta os próximos tokens pro modelo grande só validar.
Então isso aqui é muito louco porque tu tá trabalhando com especulação de tokens. Um modelo menor fica especulando tokens e depois o modelo maior valida se os tokens estão corretos. Então, o grande aqui, eu tô no site, né, da NVIDIA, mas a gente pode voltar pro artigo original aqui da Openi de lançamento do modelo, porque a Open lançou o próprio monitoramento dele, o próprio especulador intervindo sozinho aqui quando dava problema de hardware ou instabilidade.
Então, isso aqui também trouxe uma eficiência maior. Então, eles estão escrevendo próprio optimized kern plus speculative decoding. Aí tem uma parte que a gente pode aprender desse artigo aqui também do do GPT 5.
6, vocês que é a parte do harness agêntico, que é na verdade o que tu pode melhorar no teu projeto se tu tiver criando teu próprio harness agent ou agent hardness, que é deferedad to discovery. É basicamente fazer com que as integrações de MCP, de skill, de plugin só apareçam pro modelo quando elas são necessárias. Então tu não despeja o catálogo inteiro de tools no system prompt.
Isso é algo que eu tenho feito no harness do próprio Persua. Então, por exemplo, tem algumas funcionalidades agora que tu anexa documentos durante uma reunião. E para anexar esses documentos, eu preciso, por exemplo, buscar no MCP que eu tenho do Google Drve ou buscar no MCP que eu tenho do Obsidian, do Notion.
E todos os system prompts que eu preciso para fazer essas buscas, para decidir quais ferramentas utilizar, eu só adiciono eles quando um documento tá sendo requisitado. Também tem outras técnicas que eu deixo configurado remotamente que a gente chama de que é o do cap tokens em output tools, que é quanto de tokens tu espera do output de um modelo quando ele vai analisar a resposta de uma ferramenta. Então, basicamente é um remédio pro teu cat aí de arquivo de 400 KB, que basicamente vai destruir o teu contexto do agente.
E outra coisa também que eu faço bastante no Persua é o tal do o history append only. Porque quando tu tá durante uma reunião, tu tá numa reunião e tá sendo transcrito algumas coisas, estão sendo gerad alguns insightes, imagina que tudo isso precisa ser alimentado, alimentado no contexto para que se alguém te fizer uma pergunta de follow-up, o modelo saber o que que foi perguntado antes, o que foi respondido e por que essa pergunta nova tá vindo. Só que imagina que tu precisa ter toda uma lógica.
tu analisa, tu analisa o resultado da tool, o e faz o update do ambiente e tudo isso pode ser também eh beneficiado, né, com cash. Então essa regra aqui é legal ver, né, que o pani fez basicamente o que eu tava criando dentro da doa. Então, basicamente aqui uma uma estratégia que eu fiz e que eles estão fazendo também é que o teu agente ele reordena e reescreve mensagens antigas a cada turn, a cada turno ali de mensagem.
E isso é o que faz tu pagar um preço cheio de input, porque imagina que cada novo request que tu faz, tu tá mudando as mensagens antigas, tu tá, por exemplo, compactando o teu contexto, só que isso vai trigar input, não cash, vai dar cash miss. Então é interessante ver que eles fazem também o append only. Essa parte aqui também é interessante de dar uma olhada acelerando a inferência com GPT 5.
6 Sol, onde eles falam, né, em um mundo com recursos computacionais limitados, no qual a demanda por modelos cresce mais rápido que a capacidade, a eficiência é central para o design de todos os sistemas. Isso vale especialmente para a nossa stack de inferência, que executa modelos treinados para gerar respostas. Nossos principais objetivo, nosso principal objetivo é o é processar mais tokens com o mesmo hardware, preservando a inteligência, a latência e a disponibilidade à confiabilidade esperada pelos usuários.
Para isso, é preciso otimizar todo o sistema. Um modelo pode ser muito eficiente isoladamente, mas ainda ter alto custo de operação se as solicitações forem mal distribuídas. Por exemplo, aqui o hardware ficar ocioso ou a movimentação de dados desacelerar a computação.
As melhorias em cada camada se acumulam com ganhos vindos de otimização no roteamento para onde as solicitações são enviadas. agendamento quando são enviadas. Kernels, que é o software executado nas GPUs, o cash, é o trabalho salvo e reutilizado, e implementação do modelo, a ordem do código executada nas GPUs.
O GPT 5. 6 Sol no Codex teve papel fundamental em todas essas otimizações, que é legal, né, que o cara pode aprender exatamente aqui qual que é o passo a passo do teu request, ao teu output aí do modelo. Eles falam aqui do balanceamento de carga, como globalmente eles roteiam aqui as solicitações com base em fatores como localização geográfica, capacidade disponível e tipo de acelerador, o tipo de GPU ou chip especializado que executa o modelo.
Dentro de um cluster, distribuímos o trabalho entre instâncias do modelo com base na carga, no tamanho do contexto, na disponibilidade do cash e em outras propriedades da solicitação. Em cada instância, o trabalho precisa então ser dividido de forma eficiente entre aceleradores, subredes do modelo e núcleos de computação. O 5.
6 Sol no Codex nos ajuda a analisar o tráfico de produção, identificar fontes de desequilíbrio antes ignoradas, testar novas estratégias de roteamento e ajustar continuamente essas eurísticas. Só essas melhorias no balanceamento de carga reduziram drasticamente o custo da operação dos nossos modelos. Qual a importância aí, né, de um bom load balancing?
E eu quero dar uma pausa aqui para falar um pouco dos modelos chineses, né? Porque isso é algo que a gente não vê nos pressal da Open AI, é a pressão dos preços vindo de fora. Os modelos chineses de peso aberto, como Kim, GLM, Dipsic, eles continuam entregando uma capacidade muito próxima desses modelos como Terra, como Luna, só que com uma fração do peso do do preço.
Então, se tu olhar todos esses benchmarks, tu vai ver que o química 13, ele tá se aproximando do Sol, ainda não é melhor que o Sol, o mesmo vale pros GLM, mas eles estão quase ali, cara. E se a gente for ver aqui no no present da Open e tudo isso que a gente discutiu nesse vídeo até agora, tu vai ver que todas as melhorias que esses modelos estão trazendo, como essas otimizações do do GPT 5. 6 Sol, elas elas não dependem de dados, elas não dependem de novos treinamentos, elas são basicamente software, são melhorias que um dev, que um engenheiro conseguiria fazer.
São pequenas iniciativas que vão somando para um uma redução de custo para um aumento da eficiência. E se tem um lugar com muito talento, cara, é a China. Então é por isso que esses modelos chineses eles conseguem entregar os mesmos resultados com uma fração do do custo.
Agora, quem tá aprendendo com quem? Quem detém a a o a parte mais importante desse desse jogo do de tabuleiro de xadrez? Será que é as empresas americanas que estão aprendendo a otimizar com as empresas chinesas?
Será que são as empresas chinesas que vão destilar, que vão aprender com os dados das empresas americanas? Independente quem aprender com quem, a gente sabe que quem tá ganhando somos nós. Então, essa semana com todas essas novidades, com essas coisas que eu tô aprendendo, deixa eu te compartilhar aí de dev para deve o que eu tô fazendo no PSUA.
A primeira coisa que eu fiz foi auditar o roteamento das chamadas que eu uso. Então, embora o usuário no Pessoa consiga escolher o modelo que ele tá utilizando, se ele tiver utilizando modelos através da API da Open AI, eu consigo selecionar modelos melhores, mais rápidos, mais baratos para, por exemplo, fazer chamada de tools para decidir qual API chamar e por aí vai, qual ferramenta chamar. Segunda coisa é arrumar o histórico, né, da das mensagens para pender o cap no output das ferramentas.
Basicamente aqui a gente tem então um ganho de prompt por causa do cash e um ganho também por conta da redução do output token. E aí vem todo o trabalho de criar um benchmark interno pro projeto, porque a gente precisa medir essa redução de custo por tarefa. Então, para fazer isso, eu tô escrevendo alguns scripts que, basicamente fazem requisições de de agulha no palheiro, digamos, dentro de um documento.
E o script tem que verificar se a resposta do modelo foi exatamente aquela informação que tava dentro do documento. E eu rodo com vários modelos diferentes, com parâmetra parâmetros diferentes, enquanto a qualidade da resposta ainda conseguir me retornar àquela informação. Então, basicamente, o que eu tenho trabalhado nos últimos dias é dado tal documento, dado um histórico de mensagens durante uma reunião.
A resposta tem que vir sempre correta. Aí, para fazer isso aqui, tu imagina que tu tem um MCP, então a ordem das coisas são: estão me pedindo algo de um arquivo? Se estão, quais tools eu tenho?
Quais ações eu posso tomar? Qual request eu vou fazer? Aí depois analisar o output, tratar a informação e combinar com system prompt.
E para cada uma dessas etapas aqui, a gente pode ter modelos diferentes trabalhando parametrização, como por exemplo, o máximo de tokens que a gente precisa ou o nível de effort, ou se tu vai usar algum effort of effort, isso vai est em modo fast ou não e por aí vai. Então, automatizar esse processo de testar vários modelos para ver se eles continuam te retornando o mesmo resultado é o que vai fazer a tua aplicação que usa IA, né, que é esse Wapper, se diferenciar de outras. E é muito legal quando essas empresas liberam aí informações de como que eles fizeram a otimização, porque a gente pode aprender com isso e aplicar nos nossos produtos.
Beleza? Se curtiu esse vídeo, deixa seu like e não esquece de se hidratar, que é muito importante, comentar. E eu te vejo no próximo vídeo.