---
title: "Microsoft udostępnia trzy multimodalne modele AI: transkrypcję, głos i obraz/wideo"
description: "Microsoft AI wprowadził trzy multimodalne modele: MAI-Transcribe-1, MAI-Voice-1 i MAI-Image-2. Modele są dostępne przez Microsoft Foundry i MAI Playground, a firma podkreśla konkurencyjne ceny."
publisher: "Najnowsze Informacje"
language: "pl-PL"
canonical_url: "https://najnowsze-informacje.pl/technologie/microsoft-udostepnia-trzy-multimodalne-modele-ai-transkrypcje-glos-i-obrazwideo"
markdown_url: "https://najnowsze-informacje.pl/technologie/microsoft-udostepnia-trzy-multimodalne-modele-ai-transkrypcje-glos-i-obrazwideo/index.md"
date_published: "2026-04-22T00:12:06.053Z"
date_modified: "2026-07-31T22:17:48.176Z"
author: "Redakcja"
category: "Technologie"
tags:
  - "AI"
  - "multimodal"
  - "transkrypcja"
  - "generowanie-audio"
source_url: "https://techcrunch.com/2026/04/02/microsoft-takes-on-ai-rivals-with-three-new-foundational-models/"
source_name: "TechCrunch"
image_url: "https://najnowsze-informacje.pl/api/media/file/tech-unsplash-1775152878991.jpeg"
image_alt: "a blue and a white mannequin face to face"
image_credit: "© Steve Johnson / Unsplash"
image_credit_url: "https://unsplash.com/@steve_j"
---

# Microsoft udostępnia trzy multimodalne modele AI: transkrypcję, głos i obraz/wideo

> Microsoft AI wypuścił trzy modele podstawowe do transkrypcji, syntezy głosu i generowania obrazów/wideo, dostępne w Foundry i MAI Playground.

## Kluczowe informacje
- Trzy modele: transkrypcja, synteza głosu i generowanie obrazów/wideo
- MAI-Transcribe-1 obsługuje 25 języków i ma wydajność 2,5× szybszą niż Azure Fast
- MAI-Voice-1 generuje 60 s audio w 1 s i pozwala tworzyć niestandardowe głosy
- Modele są dostępne w Microsoft Foundry; Microsoft akcentuje niższe ceny niż konkurencja

Microsoft AI ogłosił wydanie trzech nowych modeli podstawowych, które obsługują transkrypcję mowy, generowanie dźwięku oraz obrazów i wideo. To krok firmy w rozbudowie własnego stosu multimodalnych modeli AI, równolegle do współpracy z OpenAI.

## Co udostępniono

Nowe modele to MAI-Transcribe-1 (transkrypcja mowy), MAI-Voice-1 (generowanie audio, w tym niestandardowych głosów) oraz MAI-Image-2 (generowanie obrazów i materiałów wideo). Wszystkie powstały w zespole MAI Superintelligence.

- MAI-Transcribe-1: transkrypcja w 25 językach; 2,5× szybszy niż oferta Azure Fast.
- MAI-Voice-1: generuje 60 sekund audio w około 1 sekundę; obsługa tworzenia niestandardowych głosów.
- MAI-Image-2: model generujący obrazy i wideo; pierwotnie udostępniony w MAI Playground 19 marca.
- Modele opracował zespół MAI Superintelligence pod kierownictwem Mustafy Suleymana.

## Dostępność i ceny

Wszystkie trzy modele trafiły do Microsoft Foundry; modele transkrypcji i głosowy są również dostępne w MAI Playground. Microsoft podaje ceny wyjściowe: MAI-Transcribe-1 od 0,36 USD za godzinę; MAI-Voice-1 od 22 USD za 1 mln znaków; MAI-Image-2 od 5 USD za 1 mln tokenów tekstowych i 33 USD za 1 mln tokenów dla wyjścia obrazowego.

### Strategia i kontekst rynkowy

Microsoft prezentuje modele jako część strategii budowy „Humanist AI”, stawiającej człowieka w centrum zastosowań. Firma podkreśla także konkurencyjność cenową wobec modeli Google i OpenAI, jednocześnie deklarując kontynuację partnerstwa z OpenAI — Microsoft zainwestował w ten podmiot ponad 13 mld USD, a według doniesień renegocjacje umowy umożliwiły firmie prowadzenie własnych badań nad superinteligencją.

## Wyjaśnienie pojęć

### [lokalne AI](https://najnowsze-informacje.pl/definicje/lokalne-ai)

Sztuczna inteligencja uruchamiana bezpośrednio na komputerze lub innym urządzeniu, bez konieczności przesyłania danych do zewnętrznej chmury.

### [modele podstawowe](https://najnowsze-informacje.pl/definicje/modele-podstawowe)

Modele sztucznej inteligencji trenowane do wykonywania wielu rodzajów zadań, które można później dostosowywać do konkretnych zastosowań.

### [wydanie utrzymaniowe](https://najnowsze-informacje.pl/definicje/wydanie-utrzymaniowe)

Wydanie utrzymaniowe to aktualizacja skupiona przede wszystkim na poprawianiu błędów, stabilności i niezawodności istniejących funkcji, a nie na wprowadzaniu dużych nowości.

### [transkrypcja](https://najnowsze-informacje.pl/definicje/transkrypcja)

Zapis mowy lub nagrania w postaci tekstu, zwykle z zachowaniem kolejności wypowiedzi i możliwie wiernym odtworzeniem treści.

### [model sztucznej inteligencji](https://najnowsze-informacje.pl/definicje/model-sztucznej-inteligencji)

Model sztucznej inteligencji to system, który przetwarza dane i generuje wyniki na podstawie wzorców poznanych podczas trenowania.

### [dostępność](https://najnowsze-informacje.pl/definicje/dostepnosc)

W projektowaniu aplikacji i gier dostępność oznacza dostosowanie produktu do potrzeb osób o różnych możliwościach wzrokowych, słuchowych, ruchowych lub poznawczych.

### [token publikowania](https://najnowsze-informacje.pl/definicje/token-publikowania)

Sekretny ciąg znaków używany do uwierzytelniania osoby lub procesu, który przesyła pliki i publikuje pakiety w serwisie.

### [konkurencyjność](https://najnowsze-informacje.pl/definicje/konkurencyjnosc)

Zdolność przedsiębiorstwa, sektora lub państwa do skutecznego konkurowania z innymi podmiotami, między innymi pod względem kosztów, jakości, innowacyjności i szybkości działania.

### [synteza głosu](https://najnowsze-informacje.pl/definicje/synteza-glosu)

Technologia tworzenia mowy na podstawie danych cyfrowych, w tym tekstu lub nagrań, pozwalająca uzyskać głos przypominający głos konkretnej osoby.

### [wydajność](https://najnowsze-informacje.pl/definicje/wydajnosc)

Wydajność opisuje, jak sprawnie system wykonuje zadania przy określonym czasie, zużyciu zasobów i jakości działania.

### [multimodalność](https://najnowsze-informacje.pl/definicje/multimodalnosc)

Zdolność systemu do przetwarzania lub łączenia różnych typów danych, na przykład tekstu, dźwięku i obrazu. Pozwala obsługiwać interakcje wykorzystujące więcej niż jeden rodzaj wejścia.

### [wyjście obrazowe](https://najnowsze-informacje.pl/definicje/wyjscie-obrazowe)

Obraz lub inny materiał wizualny wygenerowany przez model na podstawie danych wejściowych lub polecenia użytkownika.

### [renegocjacja umowy](https://najnowsze-informacje.pl/definicje/renegocjacja-umowy)

Ponowne prowadzenie rozmów przez strony umowy w celu zmiany uzgodnionych wcześniej warunków.

### [superinteligencja](https://najnowsze-informacje.pl/definicje/superinteligencja)

Hipotetyczna forma sztucznej inteligencji, której zdolności poznawcze znacznie przewyższają ludzkie możliwości w wielu dziedzinach.

## Źródło pierwotne

[TechCrunch](https://techcrunch.com/2026/04/02/microsoft-takes-on-ai-rivals-with-three-new-foundational-models/)

---
## Informacje do cytowania
- **Autor:** Redakcja
- **Data publikacji:** 2026-04-22T00:12:06.053Z
- **Ostatnia aktualizacja:** 2026-07-31T22:17:48.176Z
- **Kategoria:** Technologie
- **Adres kanoniczny:** [https://najnowsze-informacje.pl/technologie/microsoft-udostepnia-trzy-multimodalne-modele-ai-transkrypcje-glos-i-obrazwideo](https://najnowsze-informacje.pl/technologie/microsoft-udostepnia-trzy-multimodalne-modele-ai-transkrypcje-glos-i-obrazwideo)
- **Wersja Markdown:** [https://najnowsze-informacje.pl/technologie/microsoft-udostepnia-trzy-multimodalne-modele-ai-transkrypcje-glos-i-obrazwideo/index.md](https://najnowsze-informacje.pl/technologie/microsoft-udostepnia-trzy-multimodalne-modele-ai-transkrypcje-glos-i-obrazwideo/index.md)

**Sugerowane cytowanie:**

> Najnowsze Informacje, „Microsoft udostępnia trzy multimodalne modele AI: transkrypcję, głos i obraz/wideo”, 2026-04-22, https://najnowsze-informacje.pl/technologie/microsoft-udostepnia-trzy-multimodalne-modele-ai-transkrypcje-glos-i-obrazwideo
