IA e LLMProgramação
Será que Grok 4.7 vale a pena?
há 1 h
O vídeo analisa o Grok 4.7 após testes práticos de código, landing pages, análise de dados, contexto, anúncios, escrita, revisão, pesquisa, criação de jogos e uso multimodal, comparando-o principalmente com Fable e Astra.
Custos, eficiência e comportamento
Segundo a análise apresentada, o Grok 4.7 mantém o preço nominal do 4.6, mas o modo X High passou a oferecer computação extremamente alta pelo mesmo valor que antes correspondia ao modo High. O relatório citado também aponta melhora geral nos indicadores de desempenho e eficiência energética.
Na prática, porém, o principal problema observado foi o consumo de tokens. Em duas atividades, o uso da cota semanal subiu de aproximadamente 19% para 46%, uma diferença de 27 pontos percentuais. O autor estima que tarefas que consumiriam 5% a 10% com o Grok 4.6 chegaram a consumir cerca de 25% a 27% com o 4.7. A comparação apresentada indica custo de aproximadamente 2,5 vezes o do modelo anterior em tokens de saída.
O modelo ficou mais persistente: interrompe menos as tarefas para perguntar se deve continuar e tenta levar as atividades até o fim. Essa mudança foi considerada positiva, mas o ganho de qualidade não compensou, na avaliação do vídeo, o aumento do consumo.
Resultados nos testes
O Grok 4.7 foi avaliado em 29 tarefas e venceu apenas quatro. O resultado comparativo apresentado foi:
| Modelo | Tarefas vencidas |
|---|---|
| Astra | 13 |
| Fable | 12 |
| Grok 4.7 | 4 |
O vídeo afirma que o Grok 4.7 melhorou em relação ao 4.6 em praticamente todos os eixos do relatório, mas continuou atrás dos concorrentes em várias atividades. O próprio autor também relata que o modelo não superou Fable e Astra, contrariando a expectativa criada por declarações de Elon Musk de que ele ultrapassaria os modelos atuais.
Código, design e multimodalidade
Nos testes de software engineering, o Grok 4.7 mostrou melhora em persistência e execução contínua, mas não apresentou ganho proporcional de qualidade. O autor continua tratando-o como uma ferramenta rápida e barata para tarefas rotineiras, com revisão posterior feita por modelos considerados melhores em engenharia de software.
Em design, criação de landing pages e entendimento de referências visuais, o resultado foi considerado fraco. Para demonstrar isso, o vídeo compara três jogos de estratégia produzidos a partir de prompts semelhantes:
- O projeto atribuído ao Astra reproduziu melhor o mapa, as construções e a interface visual, mesmo partindo de uma única solicitação.
- O projeto atribuído ao Fable ficou funcional, mas com qualidade visual intermediária.
- O projeto atribuído ao Grok 4.7 apresentou interface pobre, elementos desorganizados, criaturas de cabeça para baixo e pouca semelhança com a referência.
O autor afirma que tanto o Grok 4.6 quanto o 4.7 são ruins para design, criação de páginas, interpretação de imagens e escrita criativa. Também considera o modelo fraco para resumos de livros, redação de textos e copywriting.
Promessas e lançamento
O vídeo relata que Elon Musk afirmou em 12 de agosto que o Grok 4.7 excederia todos os modelos existentes. Depois, em 7 de setembro, foi informado que o lançamento ocorreria em cerca de dez dias, mas a chegada foi adiada. Em 14 de setembro, a expectativa teria sido reduzida para um desempenho próximo ao Opus 5.0, com vantagem em algumas tarefas e desvantagem em outras, além da necessidade de corrigir a parte multimodal.
O lançamento ocorreu em 21 de setembro, em vez da previsão inicial de 12 de setembro. A justificativa apresentada para o atraso foi que o reinforcement learning teria deixado as respostas curtas demais e exigiria mais ajustes.
Posicionamento final do vídeo
A conclusão é que o Grok 4.7 tem como pontos fortes preço, velocidade e persistência. O autor resume a diferença entre os modelos desta forma:
- Fable: critério e engenharia de software.
- Astra: alcance e eficiência para executar uma tarefa ampla, inclusive em criação visual.
- Grok 4.7: preço e teimosia, no sentido de insistir até concluir a atividade.
O autor considera voltar ao Grok 4.6 porque não percebeu melhoria suficiente para justificar o consumo 2,5 vezes maior de tokens. Como usa o Grok principalmente para tarefas manuais e rotineiras, a vantagem central para ele era economizar tokens de modelos mais caros, como Fable e Astra. Se o 4.7 mantém qualidade apenas semelhante nessas tarefas, mas consome muito mais, essa vantagem diminui.
O vídeo termina com a expectativa de que a equipe da xAI corrija rapidamente o consumo e os problemas de qualidade, pois o autor pretende continuar usando o serviço. A assinatura citada como a mais cara é o Grok Heavy, de US$ 300, usada para reduzir a necessidade de múltiplas contas em outros serviços.
Fontes
- YouTubeSerá que Grok 4.7 vale a pena?