Offline / Casio fx-CG50

Casio
LLM.

Modelos de lenguaje completos dentro de una calculadora. Sin Wi-Fi, sin servidor y sin fingir que el hardware es más potente de lo que es.

CasioLLM / local

youhi

modelHello! How are you doing today?

Los pesos no caben en RAM. Así que la inferencia aprende a vivir desde la flash.

Funcionamiento100% offline
TinyTalk≈ 2,27 MB
NanoLM≈ 13,29 MB
Memoria de trabajo≈ 512 KB

01 / FUNCIONAMIENTO

La flash como almacén de pesos.

El add-in mantiene en RAM solo las activaciones y el estado imprescindible. Las matrices cuantizadas permanecen como archivos externos y se leen por bloques durante cada operación.

01 · EntradaPrompt nuevoCada consulta es independiente.
02 · TokenizerVocabulario podadoMenos almacenamiento y trabajo.
03 · PesosFlash por bloquesQ4 en un formato propio compacto.
04 · SalidaToken a tokenLa respuesta aparece al generarse.

02 / MODELOS

Dos límites distintos.

TinyTalk prioriza tiempo y tamaño. NanoLM intenta conservar más capacidad, pero ocupa casi toda la unidad y responde con mucha más lentitud.

ModeloPaqueteVentajaCosteRelease
TinyTalk v1 Q4≈ 2,27 MBMucho más rápido y deja espacio libre.Vocabulario limitado y alucinaciones frecuentes.v0.8.2 ↗
NanoLM Q4-20K CG4≈ 13,29 MBMás capacidad y un vocabulario más amplio.Extremadamente lento; pierde conceptos tras la cuantización.v0.10.1 ↗

03 / MEDICIÓN

Optimizar segundos, no benchmarks abstractos.

En una prueba física con el prompt “hi”, TinyTalk v0.8.1 redujo el primer token de 9,382 s a 5,695 s y el total de 34,296 s a 27,078 s frente a la base v0.7.0.

Versión TinyTalkPromptPrimer tokenRespuesta completa
v0.7.0 originalhi9,382 s34,296 s
v0.8.1 optimizadahi5,695 s27,078 s