A OpenAI divulgou os primeiros resultados do Jalapeño, seu chip próprio para inferência de inteligência artificial. Nos testes apresentados, o sistema combinou maior volume de trabalho por unidade de energia com respostas mais rápidas, sem exigir a troca habitual entre throughput e latência.
O desempenho foi medido com GPT-OSS 120B, DeepSeek R1 e Kimi K2.5. Segundo a empresa, o ganho de trabalho por watt ficou entre 1,5 e 1,9 vez, enquanto a latência ponta a ponta foi de 1,7 a 3,6 vezes menor que nos sistemas usados para comparação.
Por que a inferência importa
Agentes executam muitas etapas em sequência, de modo que pequenos atrasos se acumulam. Hardware mais eficiente pode reduzir tempo e custo de operação, mas comparações devem considerar o sistema completo, a carga real e resultados reproduzíveis, não apenas números isolados do chip.
Fonte: anúncio técnico da OpenAI, publicado em 25 de agosto de 2026.

