Este tema me ha resultado muy interesante: llevamos ya tiempo acostumbrándonos a que los modelos de inteligencia artificial sean enormes y tengan necesariamente que vivir en la nube. La narrativa es clara: tuvimos que vivir inviernos de la inteligencia artificial porque los ordenadores no daban de sí lo suficiente, pero ahora tenemos la nube, el ordenador ilimitado.
Pero… ¿y si esa dependencia no viniese propiamente de la inteligencia artificial, sino que fuese una consecuencia de la forma en que hemos planteado los modelos hasta el momento? Si tenemos en cuenta los avances en cuantización, es viable plantear que podemos encontrar recursos para volver de manera razonablemente cómoda a la ejecución local, algo que podría ofrecernos enormes ventajas en términos de coste y, sobre todo, de control y privacidad. ¿Podrían las llamadas arquitecturas de un bit ayudarnos en esa transición?
¿Qué son las arquitecturas de un bit, o BitNet? Planteémoslo de esta manera: los LLM tradicionales contienen miles de millones de parámetros, que son fundamentalmente los pesos numéricos aprendidos durante su entrenamiento.
Históricamente, estos pesos se han almacenado utilizando números de coma flotante de 16 bits (aunque las cuantizaciones de 8 y 4 bits se están volviendo cada vez más habituales). Si tenemos un modelo con veinte mil millones de parámetros, almacenar cada peso a 16 bits nos supone aproximadamente 40GB para empezar a hablar, sólo para los pesos. Esto convierte al modelo en algo demasiado grande y aparatoso para vivir en un teléfono y para la mayoría de los laptops habituales. ¿Pero qué ocurriría si llevásemos este razonamiento al límite, y obligásemos a los pesos a tomar sólo uno de tres posibles valores, 1, 0 ó -1? Un modelo ternario, o de sólo tres estados posibles requerirían log₂(3), o aproximadamente 1.58 bits de información, y de ahí el término, algo confuso, de «modelos de 1.58 bits» usados desde que Microsoft Research introdujo precisamente esta idea con BitNet b1.58 en 2024 (1.58 bits es una medida informacional; en implementaciones binarias reales los pesos pueden empaquetarse utilizando 2 bits).
Primero probamos modelos de 8 bits, después de 4 bits, y técnicas como GPTQ o AWQ capaces de comprimir modelos ya entrenados manteniendo una parte sorprendentemente grande de sus prestaciones. Esto, normalmente, se hace después del entrenamiento, es decir, entrenar un modelo con mayor precisión y posteriormente aproximar sus pesos mediante un conjunto mucho menor de valores. ¿Qué demuestra la experiencia acumulada? Básicamente, que las redes neuronales contienen una descomunal redundancia numérica. Lo interesante, por tanto, no es únicamente la reducción de memoria: es que una red con miles de millones de conexiones extraordinariamente simples sea capaz de seguir produciendo comportamientos complejos.
Obviamente, llevar a cabo multiplicaciones por 1, 0 ó -1 es sencillísimo, y además, esos modelos más pequeños permiten reducir el tráfico entre la memoria y el procesador, que es un cuello de botella crítico cuando la generación tiene lugar de token en token. El desarrollo de Microsoft estuvo motivado precisamente para aprovechar esa característica, y con ello consiguió aceleraciones de entre 1.37× y 5.07× en arquitecturas ARM y reducciones de consumo energético del 55.4% al 70%.
Hay que dejar claro que BitNet no es simplemente coger un modelo convencional y «redondear» de forma brutal todos sus números a 1, 0 y -1: lo verdaderamente interesante sería entrenar redes que puedan adaptarse a ese rango mínimo de valores desde el propio proceso de aprendizaje. Así, en 2025, Microsoft presentó BitNet b1.58 2B4T, un modelo abierto de 2,000 millones de parámetros entrenado sobre cuatro billones de tokens, con prestaciones comparables con modelos open-weight convencionales de tamaño similar, pero con mucha menos memoria, latencia y consumo.
Si a esto añadimos los llamados Mixture-of-Experts (MoE), que almacenan muchos parámetros pero para cada token activan tan solo una pequeña fracción de los que consideran relevantes, podemos desacoplar aún más la capacidad del coste computacional. Esta idea tiene precedentes muy sólidos: Switch Transformer y después Mixtral fueron capaces de demostrar que un modelo podía poseer muchos más parámetros de los que utiliza en cada inferencia.
Ahora, DeepGrove ha publicado Maple-Preview, un modelo de razonamiento 20B-A1B, es decir, alrededor de 20,000 millones de parámetros totales pero aproximadamente mil millones activos por token, organizado en 256 expertos de los que utiliza ocho. Es una demostración muy interesante de ternarización + MoE + software especializado trabajando conjuntamente. Deberíamos interpretar Maple sólo como una señal, todavía no una demostración definitiva: DeepGrove afirma que el modelo establece una nueva frontera entre memoria, velocidad y prestaciones, pero es un preview, y la propia compañía reconoce que ha recibido poco post-training para tareas agénticas y que todavía faltan evaluaciones independientes. Lo verdaderamente interesante es que un modelo de unos 5GB está empezando a entrar en territorios de razonamiento que hasta hace muy poco sólo podíamos asociar a infraestructura mucho más pesada.
¿Podría esto esto llegar a alterar dónde viven los modelos de inteligencia artificial que usamos habitualmente? Lógicamente, no significa que los centros de datos vayan a desaparecer, porque entrenar modelos de frontera seguirá siendo extraordinariamente caro y algunas tareas seguirán requiriendo modelos enormes, pero sí abre la posibilidad a arquitecturas diferentes, probablemente híbridas: un modelo personal funcionando permanentemente en un teléfono u en un ordenador con nuestros documentos y nuestros contextos privados, que recurre a la nube únicamente cuando necesita capacidades adicionales. Esto representaría un cambio muy interesante en cuanto a privacidad, latencia, coste marginal, dependencia de APIs, consumo energético y posiblemente condicionaría el reparto de poder de toda la industria.
Una revolución así no implicaría únicamente que «la inteligencia artificial ocupase menos», sino que una proporción cada vez mayor de la inteligencia artificial dejase de necesitar la nube de manera incondicional. Y de hecho, esa posibilidad de despliegue local es precisamente una de las motivaciones señaladas tanto por la investigación original de BitNet como por la propia literatura de cuantización. ¿Cuánto tardaremos en ver este tipo de arquitecturas puestas en práctica y en productos de consumo? ¿Puede esta simplificación llevar la inteligencia artificial de forma eficiente a nuestros dispositivos y a nuestros bolsillos?
This article is also available in English on my Medium page, «How 1-bit models could bring AI back to your pocket«


Creo que es interesantísimo. El objetivo final es poder tener IA/Agentes en cualquier móvil, gafa, altavoz, nevera, etc. Es decir, debe funcionar en un IoT (modelos adaptados a sus funciones, reducidos).
Y sí, harán falta centros de entrenamiento y lugares de despliegue. Sinceramente creo que hará falta un «Android de cosas» que permita de forma sencilla para los fabricantes hacer los drivers, y luego plug&play con solo las características que necesiten, ni más ni menos.
Espero de todo corazón que sea un Open Source de verdad esta vez y que no sea otro monopolio/duopolio/oligopolio como internet, teléfonos o detergentes.
Lo habitual en informática es que cada vez todo tiende hacia una mayor sencillez y miniaturización en lo físico,a el hardware, pero en cambio se complica en el software, precisando siempre mas memoria RAM y ROM y mas velocidad de cálculo.
Me alegraré si por una vez cambia la tendencia, pero a mi me parece que tres posibles estados son insuficientes para modelar la realidad, Ojalá esté confundido
No estaría nada mal que el ser humano dejara de estar en las nubes, cads uno en la suya, y se dedicara s andar por la Tierra, la misma a ser posible… pars empezar !!!
En línea con el artículo, parece que es la idea con la que está trabajando Apple hace tiempo.
No creo que los costes de IA en la nube, tal y como se están planteando, vayan a ser rentables para la mayoría de usos personales y profesionales. La ejecución en local creo que va a ser clave.
https://www.applesfera.com/apple-1/secreto-apple-ia-esta-transistores-no-software
Efectivamente, de nada sirve todo esto si el dispositivo no tiene el procesador adecuado, y ahí es donde Apple lleva años de adelanto.
Desde 2017 Apple tiene núcleos Neural Engine en sus procesadores A y M e introdujo Core ML en sus Sistemas Operativos.
Además de esto están los modelos destilados desde Gemini -Apple Foundation Models-, especialmente el reducido AFM 3 Core para ejecución en local con 8GB de RAM y AFM 3 Core Advanced para 12GB de RAM.
Ya sabemos que Apple no ha sido capaz de crear un modelo grande propio y ha tomado el pragmático camino de partir de uno ya hecho, pero en ejecución local de IA Apple lleva años de ventaja, claro que si esto funciona bien o mal no lo sabremos en Europa… :-/
Respuesta de una IA:
Después de leer el artículo y contrastarlo con la documentación técnica de Apple, hay bastante material para hacer una crítica **muy dura, pero me has pedido que la haga educada**, porque el problema no es que la tesis sea completamente absurda: es que mezcla varias verdades técnicas con extrapolaciones bastante gratuitas hasta construir una conclusión que los datos no sostienen.
## El problema central: confundir «tener hardware para IA» con «tener una ventaja en IA»
El artículo de Applesfera plantea una tesis muy seductora: Apple no habría perdido la carrera de la IA, sino que estaría jugando a otra cosa; habría pasado años construyendo el **hardware necesario para ejecutar IA localmente**, mientras Google, OpenAI y Anthropic se obsesionaban con los modelos. El artículo remata con la idea de que *«el hardware está. El software llegará»*. ([Applesfera][1])
El problema es que esto es una **narrativa retrospectiva**, no una demostración.
Sí, Apple introdujo el Neural Engine con el A11 en 2017 y lleva años integrando aceleración de ML en sus SoC. Sí, Core ML existe desde 2017. Y sí, el silicio Apple es extraordinariamente bueno en rendimiento por vatio.
Pero de ahí no se deduce:
> **«Apple lleva años de ventaja en IA local».**
Eso es cambiar la unidad de medida a mitad de la carrera.
Tener un acelerador neuronal no equivale a tener una ventaja en modelos locales. Para que exista esa ventaja necesitas, como mínimo:
**silicio + memoria/ancho de banda + modelos + cuantización + runtime + herramientas + integración con el SO + calidad de inferencia + latencia + consumo + disponibilidad.**
Apple lleva mucho tiempo haciendo muy bien una parte de esa ecuación. No ha demostrado llevar años de ventaja en **el conjunto**.
Y, de hecho, el propio artículo admite que Apple tiene un problema monumental de software: Siri, los retrasos de Apple Intelligence y la necesidad de recurrir a Google. ([Applesfera][1])
Es bastante curioso que el artículo convierta precisamente el componente en el que Apple está por detrás en algo trivial diciendo que *«el software se puede iterar»*, mientras convierte el hardware en una especie de carta ganadora definitiva.
Eso es una apuesta, no un hecho.
—
# Y ahora vamos con el comentario del bloguero
Aquí hay varias cosas que directamente chirrían.
> «Desde 2017 Apple tiene núcleos Neural Engine en sus procesadores A y M e introdujo Core ML en sus Sistemas Operativos.»
**Correcto, pero irrelevante para demostrar la conclusión.**
Core ML no es un modelo de IA. Es un framework para ejecutar/integrar modelos de machine learning. Apple lo presentó en 2017 y el Neural Engine apareció con el A11. Eso demuestra que Apple estaba preparando aceleración de ML en sus dispositivos, no que hubiera previsto el actual paradigma de LLMs ni que dispusiera de una ventaja de años sobre sus competidores.
Es como decir:
> «Toyota fabricaba coches híbridos desde hace años, por tanto llevaba años de ventaja en coches autónomos.»
No.
Una cosa prepara una infraestructura tecnológica que **puede resultar útil posteriormente**; otra muy distinta es haber anticipado correctamente cuál sería la tecnología dominante.
Y aquí hay una diferencia enorme.
—
# El «Neural Engine = ventaja de IA» es una simplificación brutal
El artículo utiliza una cifra espectacular:
> A18 Pro: 35 TOPS
> A11: 600.000 millones de operaciones por segundo.
Y concluye que Apple ha multiplicado casi 60 veces su capacidad. ([Applesfera][1])
Perfecto.
¿Y?
**TOPS no es una unidad de inteligencia.**
Tampoco es una métrica universal de rendimiento de LLM.
Puedes tener dos aceleradores que anuncien 40 TOPS y obtener resultados radicalmente distintos en un modelo concreto debido a:
* precisión utilizada;
* tipo de operación;
* arquitectura;
* utilización efectiva de las unidades;
* ancho de banda de memoria;
* tamaño de cachés;
* soporte de kernels;
* cuantización;
* compilador;
* runtime;
* arquitectura del modelo;
* tamaño del contexto;
* generación de tokens;
* acceso a memoria.
Por eso la frase del artículo de que Apple tiene «el mejor sitio donde ejecutar» la IA no está demostrada por esos TOPS. ([Applesfera][1])
Es marketing técnico convertido en argumento.
Y hay otra cuestión aún más incómoda: **Apple no está sola en esto**.
Qualcomm lleva años desarrollando sus DSP/Hexagon y aceleradores de IA para ejecución local. Google lleva años diseñando TPUs y aceleradores específicos en sus Tensor. MediaTek también tiene hardware dedicado. Samsung desarrolla NPU. Y la industria Android lleva tiempo vendiendo precisamente la ejecución de IA *on-device* como característica fundamental.
Por tanto, presentar 2017 como si Apple hubiera llegado diez años antes a un territorio virgen es bastante engañoso.
—
# Y llegamos al mayor patinazo: «AFM 3 viene de Gemini»
Aquí el comentario necesita una corrección importante.
El bloguero dice:
> «los modelos destilados desde Gemini -Apple Foundation Models-»
La situación real es bastante más interesante.
Apple dice oficialmente que la tercera generación de sus Foundation Models es una **familia de cinco modelos desarrollados en colaboración con Google**. Los dos modelos locales son AFM 3 Core, de 3.000 millones de parámetros, y AFM 3 Core Advanced, de 20.000 millones de parámetros con arquitectura dispersa y entre 1.000 y 4.000 millones de parámetros activados según la petición. ([Apple Machine Learning Research][2])
Y aquí está el matiz que destroza la simplificación de «son modelos destilados desde Gemini».
Apple explica que:
* utiliza una mezcla de datos públicos, licenciados, adquiridos, estudios específicos y datos sintéticos;
* entrenó los modelos mediante una fase común de preentrenamiento;
* utilizó **TPUs de Google Cloud** para escalar ese preentrenamiento;
* posteriormente realizó fine-tuning supervisado y reinforcement learning;
* y optimizó los modelos específicamente para Apple Silicon. ([Apple Machine Learning Research][2])
Eso **no equivale** a decir que «Apple cogió Gemini y lo destiló».
La colaboración con Google es real y muy profunda. Pero la documentación pública de Apple no dice:
> «AFM 3 Core = Gemini destilado».
De hecho, Apple los presenta como **Apple Foundation Models**, con arquitecturas y técnicas propias, entre ellas Instruction-Following Pruning para AFM 3 Core Advanced. ([Apple Machine Learning Research][2])
Así que el comentario está utilizando una descripción coloquial que, como mínimo, necesita muchísimos matices.
—
# Y hay una ironía preciosa aquí
El comentarista pretende utilizar la existencia de AFM para demostrar que:
> Apple no necesita crear un modelo grande porque su fortaleza está en la ejecución local.
Pero **eso no invalida la crítica a Apple; la confirma parcialmente**.
Porque precisamente demuestra que Apple necesitó:
**Google + TPUs + colaboración en modelos + investigación propia + optimización de inferencia**
para llegar a una solución competitiva.
Es decir: Apple tiene una infraestructura de hardware extraordinaria, pero **no era suficiente**.
Y eso es exactamente lo que el artículo intenta minimizar.
—
# «AFM 3 Core para 8 GB y Advanced para 12 GB»: ¿de dónde sale?
Aquí el comentario se mete en terreno todavía más resbaladizo.
Apple sí especifica que AFM 3 Core tiene 3.000 millones de parámetros y que Core Advanced tiene 20.000 millones, con sólo 1–4.000 millones activos. Pero **no encuentro en la documentación técnica de Apple la afirmación de que la correspondencia sea exactamente «8 GB → Core / 12 GB → Core Advanced»**. ([Apple Machine Learning Research][2])
Y además el mecanismo de Core Advanced es precisamente mucho más interesante que esa simplificación.
Apple explica que los pesos completos se almacenan en **NAND/flash**, en lugar de exigir que todo el modelo permanezca en DRAM, y que la arquitectura decide qué parámetros activar por *prompt*. ([Apple Machine Learning Research][2])
Eso significa que reducir la cuestión a:
> «8 GB este modelo, 12 GB este otro»
es quedarse con una tabla de compatibilidad imaginaria cuando precisamente la innovación técnica está en **cómo Apple evita tener todo el modelo residente en memoria activa**.
—
# Y aquí está la auténtica contradicción del argumento
El artículo dice:
> «Lo que no se improvisa en doce meses es una arquitectura de chip con casi una década de ventaja.» ([Applesfera][1])
Pero esto es una falacia retrospectiva.
El A11 de 2017 **no fue diseñado específicamente para ejecutar los LLM de 2026**.
Fue diseñado en una época en la que las aplicaciones dominantes de ML en dispositivos incluían:
* clasificación de imágenes;
* reconocimiento facial;
* fotografía computacional;
* detección de objetos;
* procesamiento de voz;
* etc.
Los LLM actuales introducen problemas completamente distintos:
**memoria, ancho de banda, KV cache, contexto, cuantización, atención, generación autoregresiva, pesos enormes, etc.**
Apple ha tenido que seguir evolucionando el silicio precisamente porque **el problema ha cambiado**.
Por eso decir «Apple llevaba diez años de ventaja» es una forma bastante elegante de decir:
> «Apple llevaba diez años construyendo cosas que hoy resultan útiles.»
Que no es lo mismo.
—
# Y el argumento del Mac mini es especialmente flojo
El artículo señala que Perplexity Computer se lanzó sobre un Mac mini M4 y lo presenta casi como evidencia de que Apple fabrica «el sitio» donde se ejecuta la IA. ([Applesfera][1])
Esto es un argumento de autoridad por asociación:
**Perplexity utiliza Mac → Mac es bueno para IA → Apple tenía razón.**
No funciona así.
Un Mac con mucha memoria unificada puede ser una plataforma extraordinariamente interesante para inferencia local. Eso sí es defendible.
Pero que una empresa utilice Mac como plataforma de desarrollo no demuestra que Apple tenga una ventaja tecnológica general en inferencia.
Los desarrolladores utilizan Macs por muchísimas razones:
* Unix;
* ecosistema;
* Xcode;
* ARM;
* eficiencia;
* memoria unificada;
* disponibilidad;
* integración software/hardware;
* desarrollo de aplicaciones Apple.
Convertir eso en evidencia de superioridad de IA es bastante flojo.
—
# La frase más problemática: «el hardware está, el software llegará»
Esta es la auténtica tesis de fe del artículo.
Porque puede ocurrir.
**Pero también puede no ocurrir.**
Y el historial reciente de Apple obliga precisamente a ser escéptico.
Apple presentó Apple Intelligence en 2024. La empresa tuvo retrasos importantes con funciones centrales. Y en 2026 sigue dependiendo de una colaboración tecnológica con Google para su nueva generación de modelos. Además, Apple anunció que **Siri AI se retrasaría en la UE por el DMA**. ([Apple][3])
Es decir, el artículo convierte:
> «Apple todavía no ha conseguido demostrarlo»
en:
> «Apple tiene una ventaja secreta que todavía no se ha manifestado».
Eso es una tesis que prácticamente no puede perder.
Si Apple triunfa: *«¿veis? Lo sabíamos.»*
Si Apple no triunfa: *«el software todavía no ha llegado.»*
Eso no es análisis tecnológico. Es una hipótesis blindada contra la falsación.
—
# Y hay una cosa que el artículo sí acierta
Para ser justo: **la idea de que la IA tenderá a moverse parcialmente hacia el dispositivo es muy razonable**.
Apple tiene ventajas reales:
* enorme base instalada;
* integración vertical;
* SoC propios;
* memoria unificada en Macs;
* aceleradores especializados;
* control del sistema operativo;
* distribución;
* privacidad;
* optimización energética.
Y Apple está haciendo cosas técnicamente muy interesantes con AFM 3 Core Advanced. Su arquitectura de 20.000 millones de parámetros, con activación de sólo 1–4.000 millones y almacenamiento de pesos en NAND, es bastante más sofisticada que el tópico de «un LLM pequeño metido en el iPhone». ([Apple Machine Learning Research][2])
Ahí sí hay **ingeniería de verdad**.
Pero precisamente por eso no hace falta inventarse una década de ventaja.
—
# Mi veredicto
Yo separaría las afirmaciones así:
| Afirmación | Veredicto |
| ———————————————————————————– | —————————————————– |
| Apple lleva años invirtiendo en ML on-device | **Sí** |
| Apple tiene silicio excelente para IA local | **Sí** |
| Neural Engine es una ventaja importante | **Sí, potencialmente** |
| Apple tenía una ventaja de años en IA local | **No demostrado** |
| Los TOPS del Neural Engine demuestran esa ventaja | **No** |
| Core ML demuestra que Apple anticipó los LLM | **No** |
| AFM 3 es simplemente Gemini destilado | **Demasiado simplista / no respaldado así por Apple** |
| AFM 3 se ejecuta exactamente con 8/12 GB según el modelo | **No veo respaldo oficial para esa afirmación** |
| Apple no necesita modelos competitivos porque tiene buen hardware | **Falso** |
| El hardware de Apple puede convertirse en una ventaja enorme si los modelos mejoran | **Sí** |
| Apple ya ha demostrado que esa ventaja existe | **No** |
| El artículo convierte una posibilidad futura en una ventaja presente | **Sí, claramente** |
Y aquí es donde yo **degollaría intelectualmente** el comentario:
> **«Apple lleva años de ventaja»**
No. Apple lleva años **preparando una plataforma que puede resultar extraordinariamente buena para la IA local**. Son dos afirmaciones radicalmente distintas.
El verdadero problema de Apple no es que carezca de transistores. Es que durante años ha tenido **transistores estupendos, un ecosistema magnífico y una integración vertical envidiable, mientras su producto de IA iba por detrás**.
Ahora Apple ha conseguido algo mucho más interesante: una colaboración con Google para entrenar una nueva generación de modelos, TPUs de Google para el preentrenamiento, modelos propios optimizados para Apple Silicon y una arquitectura local bastante ingeniosa. ([Apple Machine Learning Research][2])
Eso ya es una historia tecnológica fascinante.
**No necesita la mitología de que Tim Cook llevaba diez años jugando al ajedrez 5D mientras Sam Altman no sabía lo que era un Neural Engine.**
Y respecto a la coletilla:
> «en ejecución local de IA Apple lleva años de ventaja, claro que sí, pero esto no lo sabremos en Europa»
Ahí hay una pequeña tragedia cómica: **la UE no impide que Apple tenga hardware capaz de ejecutar modelos locales**. Lo que Apple ha anunciado es que ciertas funciones de Apple Intelligence/Siri AI se retrasan en la UE por cuestiones regulatorias. ([Apple][3])
Por tanto, el europeo puede perfectamente comprar un Mac, instalar modelos locales, usar Core ML/Foundation Models cuando sean compatibles, utilizar otros runtimes, etc.
La frase da a entender algo mucho más siniestro —«Apple tiene una IA local revolucionaria pero Europa nos impide verla»— cuando el problema real es bastante más prosaico: **disponibilidad de determinadas funciones de Apple Intelligence y sus requisitos regulatorios**.
En resumen: **el artículo tiene una intuición interesante enterrada bajo una montaña de storytelling corporativo; el comentario la convierte después en una certeza técnica que los propios datos de Apple no permiten afirmar.**
[1]: https://www.applesfera.com/apple-1/secreto-apple-ia-esta-transistores-no-software «Apple ya sabía lo que hacía en 2017 y su verdadero plan para la IA no tiene nada que ver con Siri»
[2]: https://machinelearning.apple.com/research/introducing-third-generation-of-apple-foundation-models?utm_source=chatgpt.com «Introducing the Third Generation of Apple’s Foundation Models – Apple Machine Learning Research»
[3]: https://www.apple.com/newsroom/topics/apple-intelligence/?utm_source=chatgpt.com «Apple Intelligence News – Newsroom – Apple»
¡Jesusmariatajosé, qué parrafada! Exhausto me hallo
Bueno, a Applesfera s veces se le va la olla mucho ¯\_(ツ)_/¯
Te diría que sí a casi todo lo que dice tu IA.
Efectivamente, Apple lleva años preparando su hard y soft para la la IA… ¡para la IA ML! Por eso contrató al genio de Google John Giannandrea, que era al mismo tiempo un genio de la IA ML y un descreído total de la IA Generativa. Ha sido una bendición y una maldición a partes iguales para Apple. Y por eso ahora esta ahora donde está.
Pero casualmente, correcto, resulta que todo eso ha resultado ser imprescindible para ejecutar IA Gen en local, así que sí, Apple se ha encontrado sin quererlo en cabeza en dispositivos capaces de ejecutar IA Gen local.
Casualidad o no, nadie más lo vio, ni Intel ni Microsoft.
Eso también tiene su mérito, ¿no?
__
Estoy buscando de nuevo la página de Apple donde explica los dos modelos AFM locales que se ejecutarán según tengas 8GB de RAM o 12GB de RAM.
Imagínate que alguien escribiera
«NVIDIA lleva 15 años de adelanto con su procesamiento en paralelo en las GPUs, fueron los padres del boom de la IA local»
No deja de ser cierto, pero es un clickbait descarado. NVIDIA tuvo con sus GPUs para juegos un desarrollo exitoso para los juegos, y sobre supieron hacer su trabjo muy bien poniendo CUDA a los programadores. Luego el procesamiento en paralelo es ideal para el cálculo matricial y demás procesamientos matemáticos…. ¿qué es una IA? Pues simplemente un montón de cálculo vectorial, con sus embeddings y demás, luego las GPU son muy apañadas para ejecutar IA en local… No creo que tuvieran la bola de cristal pero hicieron un producto sólido y versátil… que encajó al 100% con la IA (NVIDIA)
Aunque seguramente merezca la pena no he leído lo que has puesto porque es demasiado largo.
Te aconsejo que estos comentarios los hagas lo más cortos posibles y pongas las fuentes.
Con eso es suficiente.
Fijate el contrasentido, nos dicen que la IA nos vuelve idiotas y que ya solo leemos cuando el mensaje es corto (como un tweet) y cuando la propia IA nos ofrece multitud de datos y argumentos (que ojo se puede equivocar) algunos os quejais que son muy largos.
Tengo la respuesta adecuada a tu problema: no leas los comentarios largos, esto es como netflix, nadie te obliga a ver nada, eliges tu lo que leer.
Eso si, luego no toqueis los cojones, que se puede expresar en una linea lo mismo que en mil.
REPITO: NO LEAS NADA DE MIS COMENTARIOS, NO LOS ESCRIBO PARA TI. Todo dicho sin acritud. Disfruta de lo mainstream.
No te preocupes que no me lo tomo a mal, pero cada herramienta tiene su propósito y un comentario no es el mejor sitio para un texto largo.
Si quiero profundizar en algo de lo que has comentado me voy a los enlaces, que vienen muy bien para eso.
Muy interesante. Los grandes damnificados en ambos casos, los usuarios de hardware. Quizás con la masificación de componentes para IA vuelva a abaratarse algo, pero los precios de memorias y GPU de hace 4-5 años no volveremos a verlos nunca. ¡Una pena! Algunos sólo queríamos jugar.
De todas formas, que el software que corremos vuelva a estar en las máquinas que tenemos en la mesa será un paso adelante.
Por si le sirve a alguien, no es publicidad. En los pasillos de Alcampo de PIO XXII de Madrid, (puede que haya en mas sitios), hay un puesto que vende ordenadores de segunda mano procedentes de oficinas bancarias cerradas, Los hay desde 150 euros, y tambien hay muy potente por unos 8oo euros, y los venden con todas las garantías.
Una hermana mía se compro una tablet y está muy contenta
Poco futuro le veo yo a lo personal, teniendo en cuenta que gracias a la IA los componentes «domésticos» se han encarecido un 700% en el último año…
Mira en Amazon, los hay entre menos de 200 euros y 900 euros, Mi opinión es que durante un corto espacio estuvieron caros por falta de componentes pero que el mercado se ha regularizado
Gorki,
Tienes que mirar que tenga minimo 32GB de RAM con una GPU de NVIDIA de 12GB, (ESTAMOS EN 2026) y a lo mejor te topas con uno de unos 2000€
EJEMPLO: 2100€
HP OMEN MAX 16-ah0018ns – Ordenador Portátil Gaming de 16″ 2.5K WQXGA (Intel Ultra 7-255HX, 32GB RAM, 1 TB, NVIDIA GeForce RTX 5070 TI, Windows 11) Negro – Teclado QWERTY Español
Dice LUA que han subido un 700%. ¿Tu crees que ese monstruo hacia unos meses costaba solo 300 euros?
Si subieron bastante las cosas
Lo mire hace 6 meses, creo que similar de MSI, y lo más barato era 3000€. Lo del subidón es cierto, pero hoy al buscarte una referencia yo también me he sorprendido que hayan bajado (algo)… lo de la IA los ha subido un montón, si lo comparo con lo que yo compré hace 2/3 años deberían estar a 1000/1500 a lo sumo… todavía deberían mejorar los precios… (16GB RAM/6GBVRAM)
Asi que si le doy la razón que hubo subidón, pero fue un x3 no un 700%… y a ti también que parece que el globo se está deshinchando.
64ram core ultra7
Rtx5080 nve 2T
Ssd 2Tb
Refrigeracion liquida
En noviembre 2200
En abril 2900
La he comprado a 3335
700% lo he dicho al azar
El sentido cualitativo del «700%» lo comparto plenamente…
A ver si Gorki me la consigue más barata XDD
Los 1 bit están disponibles en Ollama desde hace un año… por ahí dicen que la pérdida de calidad es tremenda… pasar de flotantes fp16 a 2bits pues algo se tiene que notar, y si no pensar en colores… (todavia ocupa 140GB)
ollama run emsi/deepseek-r1-671b-1.58bit
Sin embargo en LMSTUDIO está disponible desde hace 10 días el Bonsai 27B que solo ocupa 4GB (basado en Qwen 3.6)
Highlights
27B reasoning in a phone-class footprint: binary weights compress the language model to about 3.9 GB, bringing 27B-class local inference to high-end phones.
Quality that survives extreme compression: across 15 thinking-mode benchmarks, the binary model retains 89.5% of FP16’s average score at 1.125 effective bits per weight; the ternary model retains 94.6% at 1.71 bits.
Ready for demanding local workflows: supports vision input, tool use, hybrid thinking, and a 262K-token context window.
PS: En primera instancia va bien, pero hasta que no le someta a un test de preguntas de programación, no podré evaluar su nivel real… o es más o menos igual que un 12B (al menos su velocidad de salida de tokens lo veo similar)
Hace semanas que tengo pendiente probarlo pero no saco tiempo :(
Ya nos contaras, pero que no sea una línea ;-)
Solo por probar, hace unos días estuve haciendo correr LM Studio con un modelo «meta-llama-3.1-8b-instruct» en una Acer Aspire E 14 que era de mi madre
• Pantalla 14″
• GPU: NVIDIA GeForce 820M
• 1 TB HDD SATA / 5400 rpm
• RAM: 4 GB (1 x 4 GB)
• CPU: Intel Core i3, 2.2 GHz (el link muestra una con un i5)
• Año de salida: 2014
Más básico que eso, creo que una netbook con un Celeron. Y si bien, obviamente, no se desempeña como en mi ThinkPad, para cosas básicas no lo hace nada mal. Si alguien me hubiese dicho hace un año que algo así se hubiese podido hacer, le hubiera dicho que deje las drogas.
Al reducir el número de bits en los cálculos ¿en qué situaciones estaremos generando el mismo error en los resultados como los que Edward Lorentz obtuvo en sus simulaciones y que le permitieron definir «el efecto mariposa»?
Muy interesante a propósito el proyecto de antirez (el creador de redis)
dwarf star
https://github.com/antirez/ds4