Přeskočit na obsah

Text, obrázek, zvuk, video: jaké vstupy AI model přijme

Modely se na první pohled liší cenou a chytrostí. V praxi ale nejčastěji narazíte na jiný rozdíl: co model přijme jako vstup. Některé umí jen text, jiné i obrázky, zvuk a video — říká se jim multimodální (zvládají víc druhů vstupu než jen text).

Agent v OpenWorku pracuje s tím, co máte ve složce. A složky nebývají jen text:

  • Fotky a skeny — účtenky, papírové smlouvy, vizitky. Model bez obrázkového vstupu je nepřečte vůbec; viz Skeny a fotky dokumentů.
  • PDF se skenovanými stránkami — text z nich vytáhne jen model, který „vidí”; viz Práce s PDF.
  • Snímky obrazovky — chybová hláška vyfocená na obrazovce je obrázek, ne text.
  • Zvuk a video — záznam porady nebo přednášky zpracuje jen hrstka modelů se zvukovým, resp. video vstupem.

Čistě textový model přitom nemusí být horší volba — na texty bývá levnější a rychlejší. Jen musíte vědět, co od něj chtít.

A kam patří Word nebo Excel?

Sekce “A kam patří Word nebo Excel?”

Tady vzniká nejvíc zmatku. Textové soubory zvládne agent s každým modelem — a to platí i pro Word, Excel nebo obyčejné PDF s textem. Agent totiž soubor otevře a modelu předá jeho textový obsah; „vstup” modelu je pak jen text.

Obrázkový vstup potřebujete až ve chvíli, kdy je obsah obrazový:

  • fotka nebo sken (i uložené jako PDF),
  • obrázky vložené ve Wordu — text okolo přečte každý model, ale co je na vloženém obrázku, „uvidí” jen model s obrázkovým vstupem,
  • graf nebo razítko, které existuje jen jako obrázek.

Zjednodušeně: jde o to, co se dá ze souboru vytáhnout jako text. Co jde, zvládne každý model; co zbyde jen jako obraz či zvuk, chce multimodální model.

Co který vstup znamená

Sekce “Co který vstup znamená”
VstupCo modelu můžete poslatTypický úkol
textdokumenty, tabulky, kódzápisy, přehledy, programování
+ obrázekfotky, skeny, snímky obrazovkyúčtenky do tabulky, čtení skenů
+ souborycelá PDF se zachovaným rozvrženímdlouhé smlouvy a výkazy
+ zvuknahrávkypřepis a shrnutí porady
+ videovideozáznamyco se děje v záznamu, výtah
  1. Podívejte se do složky. Samý text? Stačí textový model (nejlevnější je DeepSeek V4 Flash). Jsou tam fotky, skeny nebo nahrávky? Chcete multimodální model.
  2. Výchozí doporučení webu — DeepSeek V4.1 Flash — bere text i obrázky, takže se s ním většina domácností i firem nemusí rozhodovat. Na video sáhněte po GLM 5.3 Flash. Zvuk modely z našeho katalogu nepřijmou — nahrávku nejdřív nechte přepsat na text (Melious to umí levně modelem Whisper).
  3. Přesné vstupy každého modelu najdete v katalogu modelů — sloupec Vstupy, s datem ověření.

Odkud čerpáme: ceník a vstupy modelů u Melious, přehled modelů na OpenRouter a dokumentace OpenCode Go.

Přidejte se na Discord: OpenWork komunita CZ/SK·OpenWork.cz je nezávislý český průvodce. Nejsme spojeni s OpenWork Labs, Inc.·Témata·Zásady webu