Villiviikko tekoälyssä: 15 uutta mallia seitsemässä päivässä

0

Tekoäly-yhtiöt julkaisivat yhden viikon aikana 15 uutta mallia: reaaliaikaisia puhe- ja tulkkausmalleja, laitteeseen mahtuvia pikkumalleja, kokonaan uudenlaisia päätösmalleja sekä videomalleja, jotka luovat uusia kuvakulmia ja simuloituja maailmoja.

aiuutiset.fi — Tekoälyuutiset suomeksi

Yhden viikon aikana tekoäly-yhtiöt julkaisivat poikkeuksellisen monta uutta mallia. Listalla on puhemalleja, laitteisiin mahtuvia pikkumalleja, kokonaan uudenlaisia päätösmalleja sekä videomalleja, jotka luovat uusia kuvakulmia ja kokonaisia simuloituja maailmoja. Tässä jutussa käydään lyhyesti läpi jokainen viikon aikana esitelty julkaisu.

Puheesta, kuvasta ja tulkkauksesta

Kaksi suurta nimeä toi markkinoille uudet puhemallit. Puhemalli on tekoäly, joka ymmärtää puhuttua kieltä ja vastaa puhumalla ilman, että puhe muutetaan ensin tekstiksi ja takaisin.

Gemini 3.8 Live (Google, 15. syyskuuta) ja sen rinnalla julkaistu Gemini 3.8 Live Extended Thinking on tarkoitettu reaaliaikaiseen puhekeskusteluun. Googlen mukaan mallit voivat pohtia asiaa ja suorittaa taustatehtäviä keskeyttämättä keskustelua. Yhtiö kertoo niiden tukevan 97 kieltä ja sisältävän SynthID-vesileimauksen, jolla tekoälyn tuottama sisältö merkitään. Mallit ovat saatavilla Gemini-ohjelmointirajapinnan, Google Workspacen ja Gemini-sovelluksen kautta.

Qwen 3.8 Omni Flash (Alibaba, 18. syyskuuta) on puolestaan niin sanottu multimodaalinen malli: se ottaa vastaan tekstiä, kuvia, ääntä ja videota ja vastaa tekstillä. Alibaba kuvailee sitä ensimmäiseksi mallikseen, joka on rakennettu agenttikäyttöä varten, eli se yhdistää äänen ja videon ymmärtämisen, päättelyn ja työkalujen käytön samaan malliin. Konteksti-ikkuna eli kerralla käsiteltävän tekstin enimmäismäärä on miljoona tokenia. Malli on saatavilla vain rajapinnan kautta.

Qwen 3.8 Live Translate (Alibaba, 19. syyskuuta) on reaaliaikainen tulkkausmalli. Alibaba kertoo sen kääntävän 60 kieltä niin, että keskimääräinen viive puhujan sanojen ja käännöksen välillä on 2,3 sekuntia. Yhtiön mukaan viive lyheni aiemmasta 2,8 sekunnista eli noin 18 prosenttia. Malli pystyy säilyttämään puhujan äänen piirteitä käännöksessä.

Confucius4-R2T2 (NetEase Youdao, 17. syyskuuta) on puheentunnistusmalli, joka on suunniteltu suoraan suoratoistoon. Sen on määrä sopia esimerkiksi reaaliaikaiseen tekstitykseen ja tulkkaukseen. Malli on pohjana Youdaon Bage Shuo -nimiselle puheagentille, joka muuttaa puhutun tekstiksi ja siistii sen kieliopillisesti.

Pienet mallit mahtuvat taskuun

Bonsai 2 27B (PrismML, 17. syyskuuta) on uudelleen pakattu versio Alibaban Qwen3.8 27B -mallista. Mallin painot on pyöristetty ternääriseen muotoon eli kolmeen mahdolliseen arvoon. Keinon ansiosta malli vie 5,93 gigatavua, kun alkuperäinen vei 53,8 gigatavua. PrismML:n mukaan malli säilyttää 98,2 prosenttia alkuperäisen mallin keskimääräisestä suorituksesta 20 vertailutestissä. Malli on avointa lähdekoodia ja mahtuu yhtiön mukaan tavalliselle kotitietokoneelle.

Needle 3 (Cactus Compute, 17. syyskuuta) menee vielä pidemmälle: se on kooltaan 8–29 megatavua ja toimii kokonaan laitteessa ilman verkkoyhteyttä. Malli on tarkoitettu pieniin laitteisiin kuten puhelimiin, älykelloihin, robotteihin, autoihin ja mikrokontrollereihin. Se osaa valita työkaluja, poimia tietoa rakenteiseen muotoon ja muodostaa upotuksia. Malli julkaistiin Apache 2.0 -lisenssillä, joka sallii myös kaupallisen käytön.

Uusi mallityyppi: kone, joka vain päättää

Jev (TypeSafe AI, 15. syyskuuta) ei kirjoita tekstiä lainkaan. Se on niin sanottu System One -malli, joka palauttaa valmiita päätöksiä ja niiden todennäköisyyksiä. Mallia on tarkoitettu esimerkiksi reititykseen eli siihen, että järjestelmä valitsee, mikä malli tai työkalu hoitaa tehtävän. TypeSafe AI kertoo hinnakseen 0,042 dollaria miljoonaa syötetokenia kohden. Malli ei ole avointa lähdekoodia, mikä synnytti nopeasti joukon avoimia jäljitelmiä.

Laya (Convai Innovations, 18. syyskuuta) on yksi niistä. Se on 421 miljoonan parametrin päätösmalli, joka rakentuu ModernBERT-kielimallin päälle ja on julkaistu Apache 2.0 -lisenssillä. Valmistaja kertoo vasteajan jäävän alle 35 millisekunnin ja mallin tukevan reititystä yli sadalla kielellä.

Nimble (Bespoke Labs, 18. syyskuuta) on kolmas saman idean sovellus. Se on 9 miljardin parametrin kielimalli, jota on hienosäädetty päätöstehtäviin keinotekoisella aineistolla. Valmistajan omassa testissä malli ylsi 90,1 prosentin tarkkuuteen, kun Jev ylsi 93,2 prosenttiin. Koko hanke eli aineisto, painot ja ohjeet julkaistiin avoimesti.

Dream RSI (Google DeepMind ja Marylandin yliopisto, 17. syyskuuta) on tutkimusjulkaisu eikä tuote. Siinä tekoälyagentti parantaa omaa tapaansa etsiä ratkaisuja simuloimalla aiempia yrityksiään uudelleen sen sijaan, että se tekisi uusia kokeita. Agentti kokeilee tuhansia etenemistapoja tallennettuja yrityksiä, virhelokeja ja tuloksia vasten ja ottaa käyttöön parhaiten toimineen. Mallia itsessään ei muuteta.

Avoimet agentti- ja kielimallit

Occamy-1.0 (Accio Team, 15. syyskuuta) on Alibaban tutkimusryhmän avoin malli, joka on tarkoitettu pitkäkestoiseen työskentelyyn yhdessä ihmisen kanssa. Siinä on 35 miljardia parametria, joista kerrallaan on käytössä kolme miljardia. Ryhmän mukaan malli sai 82,20 pistettä Claw-Eval-vertailutestissä, kun GPT-5.6 Sol sai 81,80 pistettä. Painot ja osa opetusaineistosta julkaistiin.

ZGCM-1 (Zhongguancunin akatemia, 15. syyskuuta) on 7,39 miljardin parametrin malli, joka on opetettu alusta asti itse. Se keskittyy matematiikkaan ja tiedonhakuun agentin avulla. Hanke julkaisi avoimesti paitsi mallin myös aineiston, opetusohjelmiston ja lokit. Mallin takana on seitsemän hengen tutkijaryhmä.

MiniMax Code (MiniMax, 18. syyskuuta) on tekoälyagentti, joka toimii päätelaitteen komentorivillä ja avustaa ohjelmoinnissa. Yhtiö julkaisi agentin lähdekoodin avoimesti, ja sen voi liittää myös muiden valmistajien malleihin.

Videosta uusia kuvakulmia ja kokonaisia maailmoja

Meridian (Viggle AI, 16. syyskuuta) on videomalli, joka luo uusia kuvakulmia jo kuvatusta tilanteesta. Sen erikoisuus on, että kameran liikettä voi ohjata erikseen riippumatta siitä, missä järjestyksessä alkuperäinen video on kuvattu.

Jing Dao (XGEN Labs, 17. syyskuuta) on kokeilu, jossa kaksi mallia yhdistetään maailmasimulaatioksi. JING.镜 tuottaa ensimmäisen persoonan videota ja ääntä sen mukaan, mitä käyttäjä tekee, ja DAO.道 pitää yllä yhteistä maailmaa, jossa itsenäiset agentit voivat toimia pitkään. XGEN Labsin mukaan kokonaisuus nousi WBench-vertailutestin kärkeen.

Mitä tästä seuraa?

Viikon julkaisuista erottuu kolme suuntaa. Ensinnäkin puhe- ja videomallit muuttuvat reaaliaikaisiksi: ne keskustelevat, tulikaavat ja muokkaavat kuvaa samalla kun tapahtuma on käynnissä. Toiseksi mallit pienenevät: sama osaaminen pakataan murto-osaan entisestä koostaan, jolloin se mahtuu tavalliseen tietokoneeseen tai jopa yksittäiseen mikropiiriin.

Kolmas ja kiinnostavin suunta on kokonaan uusi mallityyppi. Jevin kaltaiset päätösmallit eivät tuota tekstiä vaan valmiita vastauksia, mikä tekee niistä halpoja ja nopeita. Kun ensimmäinen malli osoitti kysyntää, avoimet vastineet syntyivät kahdessa päivässä. Sama ilmiö näkyy avoimissa kielimalleissa: painot ja aineistot julkaistaan yhä useammin heti, ja Occamy ja ZGCM osoittavat, että avoimet mallit kilpailevat jo tietyissä tehtävissä suljettujen kanssa.

Lähteet

  • Google: Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking. 17.9.2026. blog.google
  • MarkTechPost: Google Releases Gemini 3.8 Live and 3.8 Live Extended Thinking for Production Grade Voice Agents. 15.9.2026. marktechpost.com
  • Deccan Herald: Google’s AI Upgrade: Gemini 3.8 Live & Live Thinking models launched. 18.9.2026. deccanherald.com
  • MarkTechPost: Alibaba Qwen Releases Qwen3.8-Omni-Flash. 18.9.2026. marktechpost.com
  • MarkTechPost: Alibaba Qwen Team Releases Qwen3.8-LiveTranslate. 20.9.2026. marktechpost.com
  • Oracle Router: Meet Qwen3.8-LiveTranslate: AI Interpretation at Human Pace. 19.9.2026. orcarouter.ai
  • PrismML: Introducing Bonsai 2 27B: Near-Lossless Compression in a 9x Smaller Footprint. 18.9.2026. prismml.com
  • MarkTechPost: PrismML Releases Ternary Bonsai 2 27B. 18.9.2026. marktechpost.com
  • Cactus Compute: Needle 3 – 8-29 MB foundation model for tiny devices. 17.9.2026. cactuscompute.com
  • TypeSafe AI: Introducing System One Models & Jev. 15.9.2026. typesafe.ai
  • MarkTechPost: TypeSafe AI Releases Jev: A System One Model That Returns Typed, Calibrated Decisions Instead of Text. 19.9.2026. marktechpost.com
  • Convai Innovations: Laya — 33ms Multilingual System 1 Decision Engine. 19.9.2026. laya.convaiinnovations.com
  • Latent Space: AINews: Here are 6 Clones of Jev in 2 days. 18.9.2026. latent.space
  • Bespoke Labs: Nimble. 18.9.2026. github.com
  • AI Weekly: Occamy-1.0 (35B, Open) Scores 82.20 on Claw-Eval. 20.9.2026. aiweekly.co
  • Tech Times: Alibaba Releases Open-Weights AI Agent Claiming Frontier Co-Work Scores at 3B Active Parameters. 15.9.2026. techtimes.com
  • CCTest: ZGCM-1: An Open 7B Model for Efficient Agentic Reasoning. 15.9.2026. cctest.ai
  • MiniMax: minimax-code. 18.9.2026. github.com
  • Alex Villabón: VFX + AI #055. 17.9.2026. alexvillabon.substack.com
  • XGEN Labs: JING.镜 and DAO.道 — Generative World Simulation. 17.9.2026. xgenlabs.ai
  • MindStudio: What Is Dream RSI? Google’s Recursive Self-Improvement, Explained. 17.9.2026. mindstudio.ai
  • DeepWiki: netease-youdao/Confucius4-R2T2. 17.9.2026. deepwiki.com
  • ChinaTechNews: NetEase Youdao Unveils AI Voice Agent Bage Shuo. 17.9.2026. chinatechnews.com

Leave a Reply

Pakolliset kentät on merkitty *

Share with