Volver al blog

2026-09-02

Cómo usar DeepSeek V4, GLM-5.3 y Kimi K3 con API compatible OpenAI en LatAm

Si tu stack ya habla Chat Completions, no necesitas un SDK distinto para cada laboratorio chino. DeepSeek, Z.ai (GLM) y Moonshot (Kimi) documentan endpoints compatibles con OpenAI. NexoRouter expone el mismo contrato en https://api.nexorouter.com/v1: cambias base_url, la clave y el ID publicado en el catálogo.

Este artículo resume hechos de anuncios oficiales (julio–agosto 2026) y, para precios, solo las cadenas que nexorouter.com/models mostró el 2 de septiembre de 2026. No pegamos el texto largo de WeChat ni de las páginas oficiales.

Diagrama: app LatAm → NexoRouter → DeepSeek / GLM / Moonshot

Qué anunciaron los vendors (fuentes oficiales)

DeepSeek V4 y el changelog de API

El 24 de abril de 2026 DeepSeek publicó DeepSeek-V4 Preview: deepseek-v4-pro (1.6T / 49B activos) y deepseek-v4-flash (284B / 13B activos), contexto 1M por defecto y soporte OpenAI Chat Completions más Anthropic. El changelog de API del 13 de agosto de 2026 marca la GA de V4-Pro; el 21 de agosto añade el experimental deepseek-v4-flash-vision-exp. Los IDs legacy deepseek-chat / deepseek-reasoner quedaron retirados tras el 24 de julio de 2026.

Z.ai GLM-5.3

El 14 de agosto de 2026 Z.ai publicó GLM-5.3: Frontier Coding with Emergent Cyber Capabilities. Misma base que GLM-5.2; las ganancias vienen de post-entrenamiento. La API exige thinking habilitado y reasoning_effort en low / high / max (ya no admite thinking desactivado).

Moonshot Kimi K3

Moonshot presenta Kimi K3 en moonshot.ai (investigación fechada 16 de julio de 2026): 2.8T parámetros, multimodal nativo, contexto 1M. La guía oficial Kimi K3 Quickstart fija el ID kimi-k3, reasoning_effort y base_url OpenAI-compatible. La lista de modelos indica que kimi-k2.5 y moonshot-v1 se retiraron el 31 de agosto de 2026.

IDs y precios en el catálogo NexoRouter (2 sep 2026)

Copia el ID desde Modelos, no desde memoria. Cadenas vivas ese día:

| ID en catálogo | Entrada / generación | Caché | Salida |

| --- | --- | --- | --- |

| kimi-k3 | $3.04 / 1M tokens | $0.30 / 1M tokens | $15.20 / 1M tokens |

| glm-5.3 | $1.22 / 1M tokens | $0.30 / 1M tokens | $4.26 / 1M tokens |

| glm-5.3-flash | $0.12 / 1M tokens | $0.03 / 1M tokens | $0.43 / 1M tokens |

| deepseek-v4-flash-0731 | $0.24 / 1M tokens | $0.05 / 1M tokens | $0.49 / 1M tokens |

| deepseek-v4-pro-sg | $2.73 / 1M tokens | $0.23 / 1M tokens | $5.47 / 1M tokens |

Si un ID aparece como Pendiente, no inventes tarifa: espera a que el directorio publique la cadena o prueba primero en Playground.

Llamada mínima (SDK OpenAI)

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["NEXOROUTER_API_KEY"],
    base_url="https://api.nexorouter.com/v1",
)

r = client.chat.completions.create(
    model="deepseek-v4-flash-0731",  # o glm-5.3 / kimi-k3
    messages=[{"role": "user", "content": "Resume en una frase qué es un gateway OpenAI-compatible."}],
)
print(r.choices[0].message.content)

Pasos recomendados:

1. Abre Modelos, busca el ID y copia el string exacto.

2. Haz un smoke test en Playground con max_tokens bajo.

3. Sigue primera llamada API y elige modelos.

4. Revisa costos en Usage Logs antes de subir concurrencia.

Verificar ID en /models y probar en Playground

Detalles que suelen romper la migración

  • DeepSeek: deja de hardcodear deepseek-chat. Usa el ID del catálogo (deepseek-v4-flash-0731, deepseek-v4-pro-sg, etc.). El thinking effort en el API oficial va por parámetros de thinking, no por un segundo nombre legacy.
  • GLM-5.3: en el API de Z.ai, thinking.type: "disabled" falla. Si tu cliente aún lo envía, ajústalo antes de cambiar el model ID (ver docs GLM-5.3 y el blog del 14 ago).
  • Kimi K3: thinking siempre activo; controla esfuerzo con reasoning_effort. En multi-turn, reenvía el mensaje assistant completo (incluye reasoning si viene).

NexoRouter documenta Chat Completions públicos. No copies tutoriales de Responses u otros contratos que aún no estén en /docs.

Por qué importa en LatAm

Equipos en México, Colombia, Chile, Argentina o Brasil suelen mantener un solo cliente OpenAI. Un gateway con locale ES, precios en USD visibles y directorio filtrable reduce el costo de cambiar de proveedor cuando DeepSeek, Z.ai o Moonshot publican un ID nuevo. El flujo es: anuncio oficial → comprobar si el ID existe en /models → smoke en Playground → producción.

Fuentes oficiales citadas

1. DeepSeek-V4 Preview — 24 abr 2026

2. DeepSeek API Change Log — entradas 13 y 21 ago 2026

3. GLM-5.3 (Z.ai) — 14 ago 2026

4. Kimi K3 Quickstart (Moonshot)

5. Moonshot AI — Kimi K3, 16 jul 2026

Precios: captura viva de nexorouter.com/models el 2 sep 2026. Vuelve a consultar el directorio antes de presupuestar.