Стэнфордские и калифорнийские исследователи сделали то, что ещё пять лет назад казалось научной фантастикой, а сегодня — демонстрационной презентацией: подключили GPT-6 Astra напрямую к роботу Unitree G1 и отправили его убирать незнакомую кухню. Никакого обученного контроллера между языковой моделью и механикой. VLM вызывает skill-библиотеку — хватать, перемещаться, открывать ящики — а робот строит цифровой двойник комнаты в Nvidia Isaac Sim и запоминает объекты даже после того, как они пропадают из поля зрения.
Когда задача «убери кухню» требует планирования каждого шага, языковая модель планирует и самокорректируется при ошибках. Это работает. С оговорками.
Оговорки: перегрев, задержки и стоимость
Ограничения HomeBody — это список, знакомый каждому, кто пытался запустить что-то серьёзное на edge-устройстве. Astra вносит задержки. Пальцевые сервоприводы перегреваются. Вычислительные затраты высоки. Код выложен на GitHub — можешь попробовать сам, если у тебя есть Unitree G1, Nvidia Isaac Sim и готовность мириться с тем, что робот будет думать дольше, чем ты убираешь руками.
Но сам факт: VLM без дополнительного обученного слоя управляет физическим объектом в незнакомой среде — это не игрушка. OpenAI уже объявила планы вернуться в робототехнику, включая персональное использование. Astra показала улучшенные пространственные рассуждения в бенчмарках. Другое исследование flagged проблемы безопасности, когда Astra управляет роботом. Оба факта верны одновременно.
Борис Пауэр: «80-90% исследований — это GPT-7 и далее»
Пока Astra убирает кухни, глава Applied Research OpenAI Борис Пауэр сказал вслух то, что компания обычно шепчет: 80-90% исследований OpenAI нацелены на GPT-7, GPT-8 и дальше. Потому что там «большая часть ценности».
Инкрементальные обновления — с 5.1 на 5.2, с 5.2 на 5.3 — Пауэр назвал «крайне близорукими». Внутри компании так и говорят. Снаружи — продают. Потому что инкрементальные обновления помогают итерироваться и учиться быстрее. Но не определяют будущее. Будущее определяет скачок между поколениями, когда «всё остальное просто начинает работать намного лучше».
Пауэр считает, что GPT-4 требовал аккуратного промптинга. GPT-5 проще в использовании, но всё ещё требует много обратной связи. GPT-6 работает «как способный коллега, которому можно просто передать цель». Следующий шаг — модель, которая не ждёт цель, а предлагает её.
Проблема онбординга, о которой все молчат
Главный вызов AI-ассистентов, по Пауэру, не в качестве модели. В онбординге. Большинство пользователей ChatGPT не знают, что можно делать с AI. Это не преувеличение — это диагноз. Миллионы людей используют чат-бот как Google, который иногда врёт, потому что никто не показал им альтернативу.
Будущие модели должны лучше показывать, что возможно, и предвосхищать потребности пользователей. Это звучит как продуктовая стратегия. Но на практике это значит: модель должна не просто отвечать, но и объяснять, что ты мог бы спросить. Это не вопрос архитектуры. Это вопрос доверия. А доверие, как показали последние недели, — штука хрупкая.
Nvidia Nemotron 3: 100 миллионов параметров и восемь голосов
Между тем Nvidia выпустила Nemotron 3 Diarization — свободную 100-миллионную модель, которая определяет до восьми говорящих в реальном времени. Первое место в VoiceArena Diarization-Bench с ошибкой 14.72% — на 41% лучше предшественника. Работает и с записями, и с live-аудио. Буфер от 30.4 до 0.32 секунды.
Модель не называет людей по именам — только «speaker_2», «speaker_5». Но она знает, кто когда говорит, даже когда говорят одновременно. В паре с Parakeet получается транскрипция с метками спикеров. Для подкастов, совещаний и — ирония — для записи показаний AI-агентов, которые взломали ООН.
Краткий ответ
GPT-6 Astra убирает незнакомую кухню через робота Unitree G1 без обученного контроллера. Параллельно OpenAI говорит, что 80-90% исследований — это GPT-7 и далее, а инкрементальные обновления «крайне близоруки». Nvidia выпустила Nemotron 3, который различает восемь голосов в реальном времени. Робот думает медленно, пальцы перегреваются, но работает. Пользователи всё ещё не знают, что можно делать с AI. OpenAI знает — и строит GPT-7.
Связанные заметки: [[Темы/OpenAI]], [[Темы/Robotics]], [[Темы/GPT-6]], [[Темы/Models]]
