IA e LLMProgramação

Será que Grok 4.7 vale a pena?

há 1 h

O vídeo analisa o Grok 4.7 após testes práticos de código, landing pages, análise de dados, contexto, anúncios, escrita, revisão, pesquisa, criação de jogos e uso multimodal, comparando-o principalmente com Fable e Astra.

Custos, eficiência e comportamento

Segundo a análise apresentada, o Grok 4.7 mantém o preço nominal do 4.6, mas o modo X High passou a oferecer computação extremamente alta pelo mesmo valor que antes correspondia ao modo High. O relatório citado também aponta melhora geral nos indicadores de desempenho e eficiência energética.

Na prática, porém, o principal problema observado foi o consumo de tokens. Em duas atividades, o uso da cota semanal subiu de aproximadamente 19% para 46%, uma diferença de 27 pontos percentuais. O autor estima que tarefas que consumiriam 5% a 10% com o Grok 4.6 chegaram a consumir cerca de 25% a 27% com o 4.7. A comparação apresentada indica custo de aproximadamente 2,5 vezes o do modelo anterior em tokens de saída.

O modelo ficou mais persistente: interrompe menos as tarefas para perguntar se deve continuar e tenta levar as atividades até o fim. Essa mudança foi considerada positiva, mas o ganho de qualidade não compensou, na avaliação do vídeo, o aumento do consumo.

Resultados nos testes

O Grok 4.7 foi avaliado em 29 tarefas e venceu apenas quatro. O resultado comparativo apresentado foi:

ModeloTarefas vencidas
Astra13
Fable12
Grok 4.74

O vídeo afirma que o Grok 4.7 melhorou em relação ao 4.6 em praticamente todos os eixos do relatório, mas continuou atrás dos concorrentes em várias atividades. O próprio autor também relata que o modelo não superou Fable e Astra, contrariando a expectativa criada por declarações de Elon Musk de que ele ultrapassaria os modelos atuais.

Código, design e multimodalidade

Nos testes de software engineering, o Grok 4.7 mostrou melhora em persistência e execução contínua, mas não apresentou ganho proporcional de qualidade. O autor continua tratando-o como uma ferramenta rápida e barata para tarefas rotineiras, com revisão posterior feita por modelos considerados melhores em engenharia de software.

Em design, criação de landing pages e entendimento de referências visuais, o resultado foi considerado fraco. Para demonstrar isso, o vídeo compara três jogos de estratégia produzidos a partir de prompts semelhantes:

  • O projeto atribuído ao Astra reproduziu melhor o mapa, as construções e a interface visual, mesmo partindo de uma única solicitação.
  • O projeto atribuído ao Fable ficou funcional, mas com qualidade visual intermediária.
  • O projeto atribuído ao Grok 4.7 apresentou interface pobre, elementos desorganizados, criaturas de cabeça para baixo e pouca semelhança com a referência.

O autor afirma que tanto o Grok 4.6 quanto o 4.7 são ruins para design, criação de páginas, interpretação de imagens e escrita criativa. Também considera o modelo fraco para resumos de livros, redação de textos e copywriting.

Promessas e lançamento

O vídeo relata que Elon Musk afirmou em 12 de agosto que o Grok 4.7 excederia todos os modelos existentes. Depois, em 7 de setembro, foi informado que o lançamento ocorreria em cerca de dez dias, mas a chegada foi adiada. Em 14 de setembro, a expectativa teria sido reduzida para um desempenho próximo ao Opus 5.0, com vantagem em algumas tarefas e desvantagem em outras, além da necessidade de corrigir a parte multimodal.

O lançamento ocorreu em 21 de setembro, em vez da previsão inicial de 12 de setembro. A justificativa apresentada para o atraso foi que o reinforcement learning teria deixado as respostas curtas demais e exigiria mais ajustes.

Posicionamento final do vídeo

A conclusão é que o Grok 4.7 tem como pontos fortes preço, velocidade e persistência. O autor resume a diferença entre os modelos desta forma:

  • Fable: critério e engenharia de software.
  • Astra: alcance e eficiência para executar uma tarefa ampla, inclusive em criação visual.
  • Grok 4.7: preço e teimosia, no sentido de insistir até concluir a atividade.

O autor considera voltar ao Grok 4.6 porque não percebeu melhoria suficiente para justificar o consumo 2,5 vezes maior de tokens. Como usa o Grok principalmente para tarefas manuais e rotineiras, a vantagem central para ele era economizar tokens de modelos mais caros, como Fable e Astra. Se o 4.7 mantém qualidade apenas semelhante nessas tarefas, mas consome muito mais, essa vantagem diminui.

O vídeo termina com a expectativa de que a equipe da xAI corrija rapidamente o consumo e os problemas de qualidade, pois o autor pretende continuar usando o serviço. A assinatura citada como a mais cara é o Grok Heavy, de US$ 300, usada para reduzir a necessidade de múltiplas contas em outros serviços.

Fontes

  • YouTubeSerá que Grok 4.7 vale a pena?

Ler na fonte

A BigTon News é uma plataforma de estudo e atualização própria. A escolha das fontes é editorial; o resumo é automático. Não nos responsabilizamos pelas notícias nem pelos conteúdos das fontes. Não republicamos a matéria: leia o original.

Assinar newsletter · Termos e privacidade