La aclaración más importante sobre este experimento está en el título: el auto no actualiza su red mientras conduce. No hay retropropagación, gradiente de recompensa ni paso de refuerzo en línea. El navegador crea una población de redes, modifica sus pesos y sesgos y califica lo que sucede cuando los autos encuentran el mismo tráfico.
Sigue siendo un juguete útil de aprendizaje automático. Se vuelve más útil cuando el mecanismo se nombra con precisión.
La demostración completa coloca la física de la carretera, los sensores, las activaciones de red, la población, el tráfico, la persistencia y los controles de aptitud en una sola pantalla. Esto es útil después de que las piezas tengan nombre. Aquí llegan a un límite a la vez: la geometría se convierte en un número, los números se convierten en interruptores, los interruptores se convierten en un impulso y una partitura decide qué sobrevive.
Sentir es geometría
El auto predeterminado proyecta cinco rayos en una extensión de noventa grados. Cada rayo se prueba con segmentos de borde de carretera y cada borde de polígono en el tráfico. Cuando existen varias intersecciones, gana el punto de intersección más cercano.
Un acierto faltante se convierte en 0. Un obstáculo detectado se convierte en 1 - offset , por lo que un obstáculo más cercano produce una entrada más fuerte. Esta pequeña capa de normalización convierte la geometría del dibujo en números que la red puede consumir.
Un rayo se convierte en un número.
INTERACTIVO- Un rayo se vuelve un número +
Arrastra el tráfico por el abanico sensor. Solo cuenta el impacto más cercano; al acercarlo debe aumentar la proximidad.
Transcripción accesible del experimento
Un rayo prueba segmentos de vía y tráfico; solo la intersección válida más cercana se vuelve una entrada de proximidad. Gesto en el lienzo: arrastra el tráfico por el abanico sensor.
El sensor no es "visión". Es una interfaz diseñada para el medio ambiente. Cambiar su conteo, alcance o ángulo cambia lo que la red puede distinguir antes de que el aprendizaje entre en la discusión. Las ediciones del garaje se organizan hasta la siguiente ejecución: los rayos mantienen ID estables, por lo que las entradas existentes conservan sus pesos aprendidos mientras que un nuevo rayo comienza con una nueva fila de pesos aleatorios.
La geometría ahora produce mediciones útiles, pero el auto sigue comportándose exactamente como antes. Cinco números no eligen izquierda, derecha, adelante o atrás. La siguiente pieza que falta es una política que pueda convertir la percepción en acción.
La política de conducción es un circuito sensorial cerrado
SIGUE LAS FLECHASEach sensor ray finds its closest road-border or traffic intersection.
Transcripción accesible del diagrama
Five sensor rays become proximity inputs, pass through a threshold network, drive four controls, and update the next sensory frame.
La red es intencionalmente pequeña.
El Car predeterminado crea una red 5 → 6 → 4, pero la capa de entrada ahora sigue la matriz de sensores. Cada nivel calcula una suma ponderada y la compara con un sesgo. El resultado es binario.
Un número se convierte en un interruptor.
INTERACTIVO- Un rayo se vuelve un número ✓
- Un número se vuelve un interruptor +
Arrastra la entrada sobre la marca roja del umbral. La salida debe cambiar exactamente una vez al cruzar el límite.
Transcripción accesible del experimento
Una entrada ponderada y un sesgo cruzan un umbral para convertir una medición continua en una decisión binaria. Gesto en el lienzo: arrastra la entrada a través del umbral.
Convierte varias lecturas de sensores en una decisión de control de sí o no.
- 01 Leer cada sensorCada x es una entrada, como la distancia reportada por un rayo.
- 02 Ponderar la evidenciaCada w decide cuánto debe influir ese sensor en este nodo de salida.
- 03 Añadir un sesgoEl sesgo cambia cuánta evidencia combinada necesita el nodo para activarse.
- 04 Cruzar el umbralH convierte el total en una salida activa o inactiva: girar, acelerar o retroceder.
Esas cuatro salidas se asignan directamente a los controles de avance, izquierda, derecha y retroceso. Luego, el código del vehículo aplica un factor de aceleración ajustable, resistencia al avance, frenado explícito en reversa, un límite de velocidad estricto, dirección de dirección, colisión poligonal y estado de daño. Soltar hacia adelante preserva el impulso; La marcha atrás es el freno deliberado antes de que se convierta en empuje inverso. La red elige conmutadores; La lógica de simulación ordinaria determina lo que hacen esos interruptores.
Vale la pena preservar esta división. La política no debería necesitar redescubrir la física básica del vehículo o la geometría de colisión a partir de píxeles.
El auto ahora puede sentir y actuar, lo que hace que el siguiente problema sea imposible de ignorar: una política inicializada aleatoriamente es terrible. Puede virar hacia una frontera, mantenerse adelante para siempre o congelarse detrás del tráfico. Una política es una manifestación, no una búsqueda.
Una política se convierte en una población.
Copia la misma pequeña red muchas veces y perturba sus pesos y sesgos. Dale a cada candidato la misma semilla de tráfico para que las diferencias en el resultado surjan de la política, no de que un auto reciba un camino más fácil.
La variación crea candidatos
INTERACTIVO- Un rayo se vuelve un número ✓
- Un número se vuelve un interruptor ✓
- La variación crea candidatos +
Arrastra el control de mutación mientras avanzan los autos. El tráfico permanece fijo y sus trayectorias se separan.
Transcripción accesible del experimento
Una política padre genera mutaciones cercanas; todas enfrentan el mismo tráfico para poder comparar su comportamiento. Gesto en el lienzo: arrastra para ampliar o reducir la mutación.
La variación da opciones al experimento. No nos dice qué opción es mejor. Una población sin un objetivo es sólo un conjunto de conductores diferentes y malos.
La selección ocurre entre generaciones.
La aplicación genera una población de autos. El mejor cerebro se guarda automáticamente en el almacenamiento local después de cada ejecución completa; la siguiente población comienza con ese campeón guardado y todos, excepto el primer auto, reciben una mutación. Cada generación recibe una nueva semilla de tráfico aleatoria, mientras que cada candidato dentro de esa generación ve el mismo diseño. Eso mantiene las comparaciones justas sin enseñarle a la población un patrón de obstáculos permanente.
La versión anterior consideraba la posición más avanzada como el objetivo general. Eso recompensó la supervivencia, pero también permitió que un auto cauteloso se quedara atrás del tráfico. La puntuación actual combina el progreso hacia adelante, el ritmo promedio, los adelantamientos, el tiempo de seguimiento cercano, el tiempo de inactividad y el estado de colisión, y el registro de aptitud hace que cada valor sea editable. Una carrera inteligente se extiende sólo cuando el campeón mantiene el ritmo, cambia de carril, adelanta al tráfico y evita seguirle o colisionar; seguir recto no es suficiente. Una buena puntuación guardada también desbloquea las carreteras con curvas y luego el tráfico que cambia de carril.
El registro de recompensas cambia al ganador
INTERACTIVO- Un rayo se vuelve un número ✓
- Un número se vuelve un interruptor ✓
- La variación crea candidatos ✓
- Una puntuación elige qué sobrevive +
Arrastra el objetivo de recompensa. Los mismos tres recorridos deben reordenarse al cambiar el premio y el costo de colisión.
Transcripción accesible del experimento
Los mismos tres recorridos reciben rankings distintos cuando cambian los premios y penalidades. Gesto en el lienzo: arrastra el objetivo de recompensa y mira el ranking.
Puntúa un recorrido completo premiando el avance útil y cobrando los modos de falla.
- 01 Premiar el avanceLa distancia recorrida es la evidencia principal de que el auto está resolviendo la vía.
- 02 Premiar un ritmo útilLa velocidad promedio distingue el movimiento decidido de avanzar apenas.
- 03 Premiar adelantamientosPasar tráfico evita que la política se limite a seguir eternamente a un auto seguro.
- 04 Restar las fallasLas colisiones y el tiempo inmóvil reducen la puntuación. Cada peso controla el costo de ese comportamiento.
Ahora el bucle puede preservar un candidato y mutar a su alrededor. Esto cierra el primer ciclo evolutivo y abre una brecha más interesante. La puntuación puede ser internamente coherente y al mismo tiempo recompensar el comportamiento incorrecto. Un auto que sigue al tráfico de manera segura puede vencer a un adelantamiento arriesgado; una bonificación por adelantamiento grande puede producir un zigzagueo imprudente.
La búsqueda se puntúa como mutación poblacional.
SIGUE LAS FLECHASThe best-scoring network becomes the seed; manual save can persist it between visits.
Transcripción accesible del diagrama
An elite network seeds a population, mutations create variants, identical traffic tests each policy, and composite fitness selects the next elite.
Preservar varios tipos de éxito.
Un campeón es simple, pero limita la búsqueda. Un adelantamiento rápido, un cambio de carril cauteloso y un auto que se recupera bien del tráfico denso pueden codificar comportamientos útiles pero incompatibles. Reemplazar los tres con la puntuación más alta hace que la próxima generación sea vulnerable a un diseño de tráfico afortunado y alienta a la población a colapsar en torno a una estrategia.
La próxima versión debería preservar un grupo de élite pequeño y diverso. La selección podría mantener al candidato con mayor puntuación y a los candidatos separados por descriptores de comportamiento como ritmo, pases, frecuencia de cambio de carril, tiempo de seguimiento y supervivencia. Las mutaciones se derivarían entonces de varias estrategias probadas en lugar de una. La pregunta cambia de "¿qué auto ganó?" a "¿qué formas distintas de conducir vale la pena explorar más a fondo?"
Trata el libro de recompensas como una hipótesis.
La puntuación no es una verdad objetiva sobre una buena conducción. Es una declaración compacta de lo que valora este experimento. Aumentar la bonificación por adelantamiento puede producir adelantamientos decisivos o zigzagueos imprudentes. Aumentar la multa por colisión puede mejorar la seguridad o recompensar a un auto que nunca desafía al tráfico. Incluso una recompensa por el ritmo puede favorecer accidentalmente el movimiento hacia adelante sostenido en lugar de un posicionamiento útil.
Una comparación útil debería comparar las mismas élites guardadas y semillas de tráfico con varios libros de contabilidad con nombre, luego comparar el progreso, los pases, la supervivencia, el seguimiento y la diversidad de comportamiento por separado. Eso mostraría si una mejora aparente sobrevive a un cambio en los incentivos, o si existe sólo porque un coeficiente hizo que el gráfico pareciera mejor.
Comparar interruptores con control continuo
La red actual emite cuatro decisiones binarias: adelante, izquierda, derecha y marcha atrás están activadas o desactivadas. La física del vehículo suaviza esos cambios con aceleración, inercia, frenado y un límite de velocidad, pero la dirección aún comienza con un cruce de umbral. Eso hace que la política sea fácil de inspeccionar y al mismo tiempo fomenta correcciones abruptas cerca de un límite de decisión.
En cambio, una política de salida continua emitiría valores de dirección y aceleración en un rango. La comparación debería mantener fijos los sensores, las semillas de tráfico, los términos de aptitud y el presupuesto de población. Entonces, la evidencia interesante no es sólo la puntuación final: es la suavidad de la dirección, el tiempo de recuperación, la estabilidad del carril, el comportamiento de adelantamiento y si el controlador más expresivo se vuelve más difícil de evolucionar o explicar.
Lo que muestra y lo que no muestra el resultado
El source repository demuestra la proyección de rayos, la intersección de segmentos, la colisión de polígonos, una red de umbral de retroalimentación, la mutación, la persistencia local, el tráfico inicializado, el diseño de aptitud y un visualizador de red. No establece un modelo robusto de conducción autónoma. El tráfico es sintético, el objetivo está diseñado manualmente y la población se evalúa en un mundo de navegador simplificado.
El experimento resulta útil porque la percepción, la política, la física, la selección y la visualización son lo bastante pequeñas como para inspeccionarlas juntas. Con esos límites a la vista, el “aprendizaje” deja de ser un aura alrededor del sistema y se convierte en una secuencia de decisiones concretas.
Juntar las piezas
El laboratorio fuente completo llega ahora después del mecanismo. Estos puntos de vista comparten una población en evolución y un historial guardado. Garaje edita la topología de entrada mientras está en pausa; la vista de red expone activaciones en vivo; la vista de aptitud compara la carrera actual con generaciones fantasmas y hace que el libro de recompensas sea editable.