DeepSeek va sacsejar el mercat de la IA el gener del 2025 amb models d'alt rendiment a preus molt inferiors als dels grans laboratoris nord-americans, una estratègia que ha mantingut des de llavors com a principal reclam per a desenvolupadors i empreses. El 13 d'agost, però, l'empresa ha anunciat que apujarà de manera notable les tarifes de la seva API per als models V4-Flash i V4-Pro a partir del 16 d'agost.
Segons Fortune, l'augment varia entre el 50% i més de l'1.100% en funció del model, el tipus de token i l'hora del dia. El model V4-Flash passa de 0,28 a 1,32 dòlars per milió de tokens de sortida en hores punta (0,66 dòlars en hores vall), un increment del 371% en el pic de demanda; el V4-Pro puja de 0,87 a 3,96 dòlars per milió en hores punta (1,98 en hores vall), un 355% més car. DeepSeek justifica el canvi dient que busca «assignar els recursos de manera més racional» i que l'estructura per franges horàries vol empènyer els desenvolupadors a traslladar les seves càrregues de treball cap a moments menys congestionats. Malgrat la pujada, l'empresa remarca que els seus preus continuen per sota dels d'alguns competidors: Fortune hi contraposa els 50 dòlars per milió de tokens que arriba a cobrar Anthropic per Claude en les seves tarifes més altes.
La rellevància de l'anunci és que revela fins a quin punt la demanda de còmput per servir models d'IA està tensant fins i tot els proveïdors que havien fet de la seva agressivitat en preus la seva principal arma competitiva, en un context de restriccions a l'exportació de xips avançats cap a la Xina. El moviment arriba mentre DeepSeek es prepara, segons diverses informacions, per a una possible sortida a borsa, i obliga els desenvolupadors que han construït productes sobre la seva API barata a recalcular els seus costos.
DeepSeek no ha publicat xifres concretes sobre l'augment de la demanda que justifica la pujada, ni ha detallat amb precisió quines franges horàries compten com a «punta» i quines com a «vall» en cada regió. Tampoc queda clar si aquesta estructura de preus és una mesura permanent o una resposta temporal a una congestió puntual dels seus servidors.