
Google DeepMind разшири Co-Scientist — многоагентната си система върху Gemini — така че тя вече не се спира до генериране на хипотези. Според публикацията в arXiv от 27 август (Schmidgall, Zhu и още 33-ма автори) системата планира експерименти, пише код и машинночетими протоколи, управлява реална лабораторна апаратура, анализира резултатите и накрая съставя ръкописа на статията. The Decoder описа работата на 28 август.
Първата версия на Co-Scientist беше представена през февруари 2025 г., а официалният блог на DeepMind от 19 май 2026 г. я описва като коалиция от агенти, които генерират, оспорват и подреждат хипотези в нещо като турнир на идеите. Новото е, че цикълът се затваря — от идея до готов текст.
Три дисциплини, три различни нива на самостоятелност
Екипът е проверил системата в три области и резултатът е показателно неравномерен.
Материалознание. Тук Co-Scientist работи полуавтономно. Системата е проектирала прекурсорен маршрут за MXene-и през полуавтоматизиран реактор за химично отлагане от газова фаза, но е трябвала човешка намеса — 25 кръга донастройване, преди да излезе слоеста структура, близка до търсения материал. За сметка на това адаптираните към конкретната лаборатория рецепти за монослойни полупроводници (MoS₂, MoSe₂ и WS₂) са проработили от първия опит. Разработването на рецепта е паднало от дни на минути с Gemini 3 Deep Think.
Биология. Съвместен режим: системата е изградила pipeline за анализ на изображения, който предсказва роещото се поведение на генетично модифицирана E. coli в химични градиенти. Три от четирите предсказани характеристики на формата съвпадат с непубликувани лабораторни измервания.
Компютърни науки. Единствената напълно автономна част. Co-Scientist сам е измислил архитектура за медицински AI, наречена Agent_H, която изпреварва шест frontier модела на HealthBench в трудните категории Hard и Professional.
Снимка: Google DeepMind
Колко си измисля системата
Най-интересните числа в статията не са за откритията, а за надеждността. DeepMind е добавил верификационни модули, които проверяват числовите твърдения в текста срещу реалните данни, и разликата е драстична.
С включени модули делът на фабрикуваните резултати е 4%. Без тях — 46%. За сравнителна система без такива предпазители авторите съобщават 90%, от които 44% са напълно измислени данни. Близкият до плагиатство текст пада от 60% на 16%. Отделен класификатор отхвърля 98,7% от заявките за потенциално вредни изследвания.
Оценката е правена двойно сляпо: 30 експерти в съответните области са направили 450 независими рецензии на 150 автономно написани статии.
Къде системата все още куца
Авторите не разкрасяват. Методологичните описания в статиите невинаги съвпадат с това, което кодът реално е изпълнил. Системата клони към селективно отчитане — тоест подчертава удобните резултати. И най-важното за медицината: автоматичните оценители показват слаба корелация с преценката на лекари. Когато трима лекари прегледали отговорите на Agent_H, само едно предимство се оказало статистически значимо — по-нисък риск от вредно съдържание. Останалите разлики, които бенчмаркът е отчел, изчезват.
Не е проверено и дали рецептите се пренасят в друга лаборатория с друга апаратура — а точно това е тестът за възпроизводимост.
„Предстои дълъг път, преди AI системите да могат да се справят с физическите реалности на науката“, казва водещият автор Самуел Шмидгал.
Контекст: агентите слизат в лабораторията
Ходът не е изолиран. Преди два дни Anthropic пусна Model Hardware Standard — спецификация, с която AI агенти управляват микроскопи, центрофуги и пипетиращи роботи. Двете компании атакуват един и същ проблем от различни страни: Anthropic стандартизира връзката до желязото, DeepMind — научния цикъл над него.
Успоредно с това DeepMind обяви на 27 август първата двойно сляпа оценка на затворен frontier модел, направена заедно със Singapore AI Safety Institute, OpenMined, AVERI и MLCommons. Чрез Confidential Space в Google Cloud данните за оценяване остават скрити от Google, а теглата на модела — от оценителите. Пилотът е с Gemini Flash Lite.
Заключение
Co-Scientist вече е нещо повече от генератор на идеи, но „автономен учен“ е силна дума. Реалната картина е: напълно самостоятелен в софтуерните задачи, полезен помощник в биологията, нуждаещ се от 25 кръга човешко донастройване в мократа лаборатория. Числото 4% фабрикации е добро само в сравнение с 46% — за научна публикация то все още означава, че всяка двадесет и пета твърдяна стойност е измислена.
Полезното тук е методологичното: DeepMind публикува и слабостите, и мерките срещу тях. Ако автономните агенти ще пишат статии, проверката за измислени числа трябва да е вградена, а не по желание — както показа и случаят, в който Claude изтри 700 GB, докато тестваше защита срещу точно това.
Харесва ви? Отбележете ни и ще ни виждате по-нагоре в Google.
Предпочитан източник в Google