



const { OpenAI } = require('openai');
const api = new OpenAI({
baseURL: 'https://api.ai.cc/v1',
apiKey: '',
});
const main = async () => {
const result = await api.chat.completions.create({
model: 'google/gemini-3-5-flash',
messages: [
{
role: 'system',
content: 'You are an AI assistant who knows everything.',
},
{
role: 'user',
content: 'Tell me, why is the sky blue?'
}
],
});
const message = result.choices[0].message.content;
console.log(`Assistant: ${message}`);
};
main();
import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.a.cc/v1",
api_key="",
)
response = client.chat.completions.create(
model="google/gemini-3-5-flash",
messages=[
{
"role": "system",
"content": "You are an AI assistant who knows everything.",
},
{
"role": "user",
"content": "Tell me, why is the sky blue?"
},
],
)
message = response.choices[0].message.content
print(f"Assistant: {message}")

Gemini 3.5 Flash
O modelo Gemini 3.5 Flash reduz a diferença entre a velocidade do Flash e o raciocínio de nível profissional.
O que é a API Flash Gemini 3.5?
Com a API Gemini 3.5 Flash, o Google apresenta uma nova geração de IA multimodal projetada para cargas de trabalho de produção do mundo real, automação de alta velocidade, assistência avançada de codificação e fluxos de trabalho de agentes escaláveis. Seja para criar ferramentas SaaS com IA, copilotos corporativos, sistemas de suporte ao cliente, pipelines de automação ou agentes de codificação de última geração, a Gemini 3.5 Flash oferece o desempenho que as aplicações modernas exigem.
Ao contrário dos modelos tradicionais de processamento pesado que frequentemente sacrificam a latência em prol da qualidade do raciocínio, o Gemini 3.5 Flash concentra-se em fornecer raciocínio avançado, capacidade de codificação e compreensão multimodal na velocidade do Flash.

O que o Gemini 3.5 Flash oferece
Tudo o que os desenvolvedores esperam com base nos vazamentos atuais, na documentação oficial da série Gemini 3 e nos primeiros relatos de testes.
Raciocínio quase profissional
Espera-se que se aproxime significativamente da qualidade de raciocínio do Gemini 3.1 Pro, mantendo-se mais rápido e mais barato. Os primeiros testadores relatam que o antigo problema do "modelo preguiçoso" foi amplamente resolvido.
Contexto de 1 milhão de tokens
Mantém a janela de contexto de entrada de tokens de 1 milhão da geração Gemini 3 — grande o suficiente para acomodar bases de código inteiras, documentos extensos e conversas complexas com múltiplos agentes em uma única chamada.
Níveis de pensamento configuráveis
Assim como o Gemini 3 Flash antes dele, espera-se que o Flash 3.5 suporte quatro níveis de processamento — mínimo, baixo, médio e alto — permitindo que os desenvolvedores equilibrem a profundidade do raciocínio com a latência e o custo por solicitação.
Suporte multimodal completo
Aceita texto, imagens, áudio, vídeo e PDFs como entrada. Mantém o aprimoramento de áudio da série Gemini 3, incluindo melhor processamento de fala com sotaque e ruído de fundo.
Enraizamento mais forte
Informações vazadas apontam para uma melhoria na confiabilidade da localização de dados — um problema recorrente nos modelos Gemini Flash anteriores. Se confirmadas, essas melhorias podem tornar o Flash 3.5 significativamente mais útil para pesquisas e tarefas factuais no mundo real.
Preços da API Flash Gemini 3.5
- Entrada salva: $0,065
- Entrada de áudio: US$ 1,30
- 1 milhão de tokens de entrada: US$ 0,65
- 1 milhão de tokens de saída: US$ 3,90
> 200 mil tokens
- 1 milhão de tokens de entrada: US$ 3,25
- 1 milhão de tokens de saída: US$ 23,40
Resumo das especificações do modelo
Quatro níveis de pensamento, um modelo
O parâmetro thinking_level permite ajustar a profundidade do raciocínio por solicitação — algo essencial para cargas de trabalho de alto volume, onde você não quer pagar os preços da versão Pro por tarefas simples.
Gemini 3.5 Flash versus a atual linha Gemini 3
Para que serve o Gemini 3.5 Flash?
Com base em tudo o que sabemos até agora, aqui está onde o Flash 3.5 se destacará em relação à linha atual.
Fluxos de trabalho complexos e com agentes que exigem velocidade.
Historicamente, os loops de agentes com várias etapas têm sido um ponto fraco para os modelos Flash — eles perdiam contexto, apresentavam parâmetros de ferramentas distorcidos ou forneciam respostas superficiais no meio da cadeia. Espera-se que o Flash 3.5 lide com esses problemas com a confiabilidade anteriormente reservada para o Pro, a uma fração do custo e da latência.
Assistentes de codificação e integrações com IDEs
O conceito de "Near-Pro" significa que o Flash 3.5 deve ser capaz de lidar com tarefas reais de depuração, revisão de código e refatoração que atualmente exigem o uso da versão Pro. O prazo final de conhecimento em janeiro de 2026 também implica em maior familiaridade com frameworks recentes, versões de pacotes e alterações significativas de API.
Aplicações baseadas em pesquisa em tempo real
Se as melhorias de aterramento se mantiverem na versão GA, o Flash 3.5 deverá ser significativamente mais confiável para aplicações onde a alucinação é um problema grave — ferramentas de pesquisa voltadas para o cliente, fluxos de trabalho de verificação de fatos e sistemas RAG que precisam de classificação precisa de trechos de código, além de baixa latência.
Bate-papo interativo com documentos complexos
O contexto de 1 milhão de tokens e as melhorias esperadas no raciocínio tornam-no uma ótima opção para produtos de perguntas e respostas sobre documentos, análise de contratos jurídicos e análise de relatórios financeiros — tarefas em que a velocidade do Flash é importante, mas em que os modelos anteriores do Flash às vezes forneciam respostas superficiais para materiais densos.
Fluxos multimodais (vídeo, áudio, imagens)
O Gemini 3.5 Flash herda a pilha multimodal completa, incluindo qualidade de entrada de áudio aprimorada em relação à geração 2.5. Para aplicações que importam gravações de reuniões, fotos de produtos ou documentos multimídia, ele oferece um modelo único em vez de endpoints especializados separados.
Playground de IA



Conecte-se