Offline / Casio fx-CG50
Casio
LLM.
Modelos de lenguaje completos dentro de una calculadora. Sin Wi-Fi, sin servidor y sin fingir que el hardware es más potente de lo que es.
youhi
modelHello! How are you doing today?
Los pesos no caben en RAM. Así que la inferencia aprende a vivir desde la flash.
01 / FUNCIONAMIENTO
La flash como almacén de pesos.
El add-in mantiene en RAM solo las activaciones y el estado imprescindible. Las matrices cuantizadas permanecen como archivos externos y se leen por bloques durante cada operación.
02 / MODELOS
Dos límites distintos.
TinyTalk prioriza tiempo y tamaño. NanoLM intenta conservar más capacidad, pero ocupa casi toda la unidad y responde con mucha más lentitud.
| Modelo | Paquete | Ventaja | Coste | Release |
|---|---|---|---|---|
| TinyTalk v1 Q4 | ≈ 2,27 MB | Mucho más rápido y deja espacio libre. | Vocabulario limitado y alucinaciones frecuentes. | v0.8.2 ↗ |
| NanoLM Q4-20K CG4 | ≈ 13,29 MB | Más capacidad y un vocabulario más amplio. | Extremadamente lento; pierde conceptos tras la cuantización. | v0.10.1 ↗ |
03 / MEDICIÓN
Optimizar segundos, no benchmarks abstractos.
En una prueba física con el prompt “hi”, TinyTalk v0.8.1 redujo el primer token de 9,382 s a 5,695 s y el total de 34,296 s a 27,078 s frente a la base v0.7.0.
| Versión TinyTalk | Prompt | Primer token | Respuesta completa |
|---|---|---|---|
| v0.7.0 original | hi | 9,382 s | 34,296 s |
| v0.8.1 optimizada | hi | 5,695 s | 27,078 s |