⌘4 Execute — tasks, flows, loops, observability

🇬🇧 English

Sidebar group: Execute · Shortcut: ⌘4 · 4 routes inside

Where artifacts turn into actual agent runs and where you watch them happen.

/tasks — Task feed

Feed of all tasks assigned to workers. From here you launch, cancel, retry, duplicate (useful for A/B against a different engine version), open a PR for the resulting diff, and inspect status (claimed / running / done / failed). Filter by status, agent, worker, gate verdict.

Use it when: kicking off work, monitoring execution in real time, debugging failures, duplicating-and-retrying on a different engine version.

Mainly for: dev with repo, dev from scratch.

/flows — Execution DAGs

Directed Acyclic Graphs of sequential / parallel execution. Create one with name, description, max_parallel_steps. Shows status (done / running / failed).

Use it when: orchestrating multi-step workflows (e.g. linting → build → test → deploy as a chain).

Honest note: this view is partially a shell — there is no UI yet for inspecting individual step logs or DAG visualization. The data model is there, the UI is intentionally minimal until the patterns settle.

/loops — Auto-iteration

Loop a task or flow until an exit condition is met. Conditions: manual stop, gate verdict green, shell ok, output contains a string, file exists. Limit by max_iterations or run infinite.

Use it when: retrying transient failures automatically, polling until a fix deploy lands, regenerating an artifact until it passes the gate.

Mainly for: dev with repo.

/observability — Runtime errors

Stream of runtime errors classified into three buckets:

  • gate_gap — the gate should have caught this but didn’t (regression in verification)
  • new_in_run — first appearance in this run (no historical baseline)
  • uncorrelated — error without a clear task that caused it

Each error has stack trace, project, correlated task, timestamp. Filter by classification, project, time window.

Use it when: diagnosing error spikes, comparing against historical baseline, finding “which task caused this”.

Mainly for: dev with repo.

Difference between Tasks, Flows, Loops

  • Task = one agent run on one artifact, single shot
  • Flow = several tasks chained in a DAG, single execution
  • Loop = task or flow repeated until a condition is met
🇪🇸 Español

Grupo del sidebar: Execute · Atajo: ⌘4 · 4 rutas dentro

Donde los artefactos se convierten en runs reales de agentes y donde los miras pasar.

/tasks — Feed de tareas

Feed de todas las tareas asignadas a workers. Desde aquí lanzas, cancelas, reintentas, duplicas (útil para A/B contra una versión de motor distinta), abres PR para el diff resultante, e inspeccionas estado (claimed / running / done / failed). Filtro por status, agent, worker, veredicto del gate.

Cuándo usarlo: lanzar trabajo, monitorear ejecución en tiempo real, debugar fallos, duplicar-y-reintentar en otra versión de motor.

Principalmente para: dev con repo, dev nuevo.

/flows — DAGs de ejecución

Grafos Acíclicos Dirigidos de ejecución secuencial / paralela. Creas uno con nombre, descripción, max_parallel_steps. Muestra estado (done / running / failed).

Cuándo usarlo: orquestar workflows multi-paso (ej. linting → build → test → deploy encadenados).

Nota honesta: esta vista es parcialmente un shell — todavía no hay UI para inspeccionar logs individuales de cada paso o visualización del DAG. El modelo de datos existe, la UI es intencionadamente mínima hasta que los patrones se asienten.

/loops — Auto-iteración

Repite una task o un flow hasta que se cumpla una condición de salida. Condiciones: stop manual, veredicto del gate en verde, shell ok, output contiene un string, file existe. Limita por max_iterations o ejecuta infinito.

Cuándo usarlo: reintentar fallos transitorios automáticamente, hacer polling hasta que aterrice un fix, regenerar un artefacto hasta que pase el gate.

Principalmente para: dev con repo.

/observability — Errores runtime

Stream de runtime errors clasificados en tres cubos:

  • gate_gap — el gate debería haber pillado esto pero no lo hizo (regresión en verificación)
  • new_in_run — primera aparición en este run (sin baseline histórico)
  • uncorrelated — error sin una task clara que lo cause

Cada error tiene stack trace, proyecto, task correlacionada, timestamp. Filtra por clasificación, proyecto, ventana de tiempo.

Cuándo usarlo: diagnosticar picos de errores, comparar contra baseline histórico, encontrar “qué task causó esto”.

Principalmente para: dev con repo.

Diferencia entre Tasks, Flows, Loops

  • Task = un run de agente sobre un artefacto, una sola vez
  • Flow = varias tasks encadenadas en un DAG, una sola ejecución
  • Loop = task o flow repetidos hasta que se cumple una condición