OS Layer už počuje, hovorí, vidí a pýta si povolenie

OS Layer už počuje, hovorí, vidí a pýta si povolenie

OS Layer už počuje, hovorí, vidí a pýta si povolenie

Dnes sme prekročili hranicu medzi obyčajným AI CLI a skutočným agentovým runtime.

OS Layer už nie je iba textový model, ktorý dostane prompt a vráti odpoveď. Dokáže pracovať so zvukom, obrázkami, súbormi, nástrojmi, runtime politikami a schvaľovaním citlivých operácií.

A celé to funguje ako jeden systém.

Od promptu k multimodálnemu runtime

Základom je Rust AI Core, ktorý orchestruje modely, tools, capabilities, MCP a approval flow.

Nad tým dnes fungujú samostatné modality:


 
audio
→ nahrávanie
→ speech-to-text
→ text-to-speech
→ prehrávanie

vision
→ obrázok
→ lokálny alebo cloud vision model
→ textová alebo JSON analýza

attachments
→ detekcia typu súboru
→ automatický routing
→ vhodná capability

Používateľ pritom nemusí riešiť, ktorý backend sa má použiť.

Stačí:


 
ai test.mp3 "Čo počuješ?"

alebo:


 
ai screenshot.png "Čo je na obrázku?"

OS Layer zistí MIME typ súboru, odošle ho správnej capability a výsledok vráti hlavnému AI modelu.

AI už vidí

Vision capability podporuje lokálne Ollama vision modely aj cloud fallback.

Modely sa neudržiavajú natvrdo v kóde. Rust AI má centrálny registry:


 
ai/config/models/*.meta

Príkaz:


 
ai update

získa zoznam lokálnych Ollama modelov, pre každý model načíta detailné informácie a doplní cloud modely dostupné cez provider API.

Registry obsahuje napríklad:


 
Provider
Model
Location
Family
Context size
Parameter count
Quantization
Capabilities
Pricing
Discovery source

Vision capability potom automaticky vyberie model s capability vision.

Prakticky teda funguje:


 
ai OS_layer_zrychluje.png "Čo je na obrázku?" | render

Flow pod kapotou:


 
AI attachment router
→ image/png
→ vision ask
→ Ollama vision model
→ obrazová analýza
→ Rust AI
→ render

AI už počuje a hovorí

Audio capability funguje na desktopovom Linuxe aj v Termuxe.

Na desktope môže používať:


 
ffmpeg
whisper.cpp
Piper
OpenAI

Na Androide cez Termux:


 
termux microphone
OpenAI STT
Termux TTS
Termux playback

Celý hlasový flow môže vyzerať takto:


 
mikrofón
→ audio record
→ transkripcia
→ AI odpoveď
→ syntéza hlasu
→ prehratie

To však nie je najzaujímavejšia časť.

Runtime sa vie zastaviť a zavolať človeka

Keď agent potrebuje vykonať citlivú operáciu, runtime policy ju nepustí automaticky.

Namiesto toho vznikne approval request:


 
Tool: mail_send
Permissions: network, secrets.read, mail.send
Approval ID: ...
Arguments: ...

Terminál zobrazí approval prompt a audio capability súčasne zahlási:

OS Layer čaká na schválenie operácie.

Človek rozhodne:


 
approve
alebo
deny

Až potom runtime pokračuje.

Flow:


 
LLM navrhne operáciu
→ tool call
→ runtime policy
→ approval required
→ hlasové upozornenie
→ človek schváli alebo zamietne
→ vykonanie alebo blokovanie operácie
→ výsledok späť modelu

Toto je presne mechanizmus, ktorý oddeľuje užitočného agenta od nebezpečného autonómneho skriptu.

Capabilities namiesto monolitu

Každá schopnosť je samostatná capability:


 
ai
audio
vision
secrets
mail
filesystem
deploy

Každá má vlastný entrypoint, konfiguráciu, modely, policy, testy a runtime metadata.

AI Core nemusí vedieť, ako funguje Whisper, Ollama vision API alebo Android kamera. Vie iba, že existuje capability s presným kontraktom.

Napríklad:


 
vision ask FILE QUESTION
audio transcribe FILE
audio speak TEXT

To drží celý systém modulárny.

Lokálne, cloud alebo hybrid

Každá modality môže mať vlastný backend.

Príklad:


 
hlavný model:       gpt-oss:20b cez Ollama
vision model:       qwen3.5:9b cez Ollama
speech-to-text:     OpenAI
text-to-speech:     Piper alebo Termux TTS
tools:              lokálne capabilities
policy:             OS Layer runtime

Nie je potrebné viazať celý systém na jediného providera alebo jeden model.

Lokálny model môže robiť reasoning, iný lokálny model vision a cloud sa použije iba tam, kde lokálna infraštruktúra nestačí.

Čo z toho vzniklo

OS Layer dnes:


 
počuje
hovorí
vidí
číta prílohy
rozpoznáva model capabilities
volá tools
dodržiava runtime policy
žiada approval
upozorňuje hlasom
pokračuje po schválení

To už nie je chatbot.

Je to multimodálny agentový control plane pre operačný systém.

A najlepšie na tom je, že stále používa jednoduché unixové rozhranie:


 
ai image.png "Čo vidíš?"
ai audio.mp3 "Čo počuješ?"
ai report.pdf "Zhrň dokument."

Zvonku jednoduché CLI.

Pod kapotou model registry, multimodálny routing, lokálne a cloud backendy, capabilities, permissions, approval a auditovateľný runtime.

Presne takto by podľa mňa mala vyzerať AI vrstva operačného systému.

Marek Mihók