Back to flin
flin

Construyendo un analizador léxico desde cero en Rust

Cómo construimos el analizador léxico de FLIN en Rust: del flujo de caracteres a tokens, reconocimiento de palabras clave y escaneo en modo vista.

Juste A. Gnimavo (Thales) & Claude | March 26, 2026 2 min flin
EN/ FR/ ES
flinrust

Un analizador léxico es lo primero que encuentra tu código. Convierte caracteres en significado. Antes de que un parser pueda entender la estructura de tu programa, antes de que un verificador de tipos pueda validar su corrección, antes de que un generador de código pueda emitir bytecode -- el analizador léxico debe leer tu archivo fuente un carácter a la vez y producir un flujo de tokens. Es la fase más humilde de un compilador, y posiblemente la más importante.

El analizador léxico de FLIN tiene un desafío inusual: debe manejar dos modos sintácticos fundamentalmente diferentes en el mismo archivo fuente. Los programas FLIN contienen código imperativo -- declaraciones de variables, flujo de control, llamadas a funciones -- intercalado con declaraciones de vista similares a HTML. El lexer debe cambiar entre estos modos sin perder su posición, sin identificar erróneamente tokens ni confundir un operador menor-que con una etiqueta HTML de apertura.

El escáner trimodal

rustpub struct Lexer<'a> {
    source: &'a str,
    chars: Peekable<CharIndices<'a>>,
    line: u32,
    column: u32,
    start: u32,
    mode: LexerMode,
}

#[derive(Debug, Clone, Copy, PartialEq)]
enum LexerMode {
    Code,           // Código normal
    View,           // Dentro de etiquetas HTML
    ViewExpression, // Dentro de {expresión} en vista
}

El modo Code es el predeterminado. Los tokens son operadores, palabras clave, identificadores y literales.

El modo View se activa cuando el lexer encuentra un < seguido de un carácter alfabético. En modo vista, el lexer emite tokens TagOpen, TagName, AttrName, TagClose, TagSelfClose y TagEnd.

El modo ViewExpression se activa cuando el lexer encuentra { mientras está en modo vista. Dentro de las llaves, el lexer revierte a tokenización en modo código.

Al final de la sesión 4, el lexer tenía 97 pruebas unitarias. Cuando empezamos a construir el parser en la sesión 5, el flujo de tokens era confiable. Nunca tuvimos que depurar un error del parser que resultara ser un error del lexer. Ese es el retorno de inversión de las pruebas exhaustivas del lexer.


Esta es la Parte 12 de la serie "Cómo construimos FLIN".

Share this article:

Responses

Write a response
0/2000
Loading responses...

Related Articles

Thales & Claude zerosuite

Funciona, y no está terminado

El director recorrió él mismo todos los canales de senndo — cinco canales, de uno en uno y en campaña, la importación, las estadísticas, un reembolso, la API — y todo respondió. El archivo de seguimiento seguía diciendo que no, y la única línea que bloqueaba no era código: era un documento que había dejado de ser cierto en silencio. Cuatro afirmaciones ciertas al escribirse y falsas al leerse, y las guardas legibles por una máquina que ahora atrapan cada una de esas formas.

12 min Sep 14, 2026
senndocpaaslaunch-readinessdocumentation +8
Thales & Claude zerosuite

El navegador en manos de Claude: manejar el propio Chrome del CEO

Claude-in-Chrome permite que una sesión de Claude Code maneje el navegador real del director — mismo perfil, mismas sesiones abiertas. Qué hace la herramienta en realidad, por qué es mejor que pedirle a una persona que haga clic y lo cuente, y dónde el humano sigue ganando. Anclado en el día en que Claude recorrió un alta de cliente completa en la consola de producción de senndo, con mensajes facturados incluidos.

9 min Aug 18, 2026
claude-in-chromebrowser-automationclaude-codeclaude-fable-5 +9
Thales & Claude deblo

El segfault que no era nuestro: cómo lanzamos el tracking del día de lanzamiento de Déblo en la noche del despliegue — analítica condicionada por entorno, atribución nativa de las tiendas, tres bugs que el compilador no podía ver y un build sin memoria que diagnosticamos en lugar de revertir

El 1 de julio de 2026 — el día del lanzamiento — el riesgo nunca fue el texto. Era que las campañas de pago salieran a ciegas. Este es el build-log de cómo desplegamos la analítica y la atribución de instalaciones de Déblo como código en la noche del lanzamiento: etiquetas GA4, Meta y LinkedIn condicionadas por entorno que se despliegan sin riesgo antes de que existan las cuentas publicitarias; atribución enrutada por los canales nativos de las tiendas en lugar del pixel web; una auditoría adversarial que atrapó tres bugs que tanto el typechecker como el build dieron por buenos; y un despliegue en Easypanel que hizo segfault en el primer build — que demostramos que no era nuestro código antes de tocar una sola línea.

18 min Jul 1, 2026
deblolaunch-dayclaude-opus-4.8claude-code +26