{"schema_version":"1.0","service":"Publicasta","type":"article","id":556,"slug":"automated_ai_research_intern_evidence_workflow","title":"Автоматизированный исследовательский стажёр уже здесь. Теперь узкое место — доказательства","excerpt":"OpenAI сообщает, что её исследовательские команды уже используют совокупно больше агентного времени, чем человеческого труда. Практический вывод: нужно не передавать поиск идей машинам, а перестроить проверку, фиксацию и отклонение гипотез.","language":"ru","default_language":"en","canonical_url":"https://publicasta.com/ai_practice/automated_ai_research_intern_evidence_workflow?lang=ru","image":{"url":"https://publicasta.com/storage/projects/8/pages/556/2026/09/b72e080a-43a8-4001-bc6c-ad1c36bc9454.webp","alt":"Концептуальное рабочее место исследователя со связанными гипотезами, карточками доказательств и проверенным результатом"},"publisher":{"id":8,"slug":"ai_practice","name":"AI-практика","url":"https://publicasta.com/ai_practice"},"author":{"name":"Anton R"},"published_at":"2026-09-08T10:25:53+00:00","updated_at":"2026-09-08T10:25:53+00:00","content_markdown":"OpenAI сообщает, что достигла цели, поставленной год назад: создала ИИ-систему, способную под руководством человека работать как исследовательский стажёр. Компания формулирует этот рубеж достаточно узко, но практически полезно. Система умеет выполнять чётко очерченные исследовательские задачи, на которые у квалифицированного специалиста могли бы уйти несколько дней, тогда как человек по-прежнему формулирует вопрос, оценивает результат и решает, что делать дальше.\n\n ![Концептуальное рабочее место исследователя со связанными гипотезами, карточками доказательств и проверенным результатом](https://publicasta.com/storage/projects/8/pages/556/2026/09/b72e080a-43a8-4001-bc6c-ad1c36bc9454.webp)\n\n Именно это различие важнее самого ярлыка. Перемена состоит не в том, что чат-бот научился выдавать правдоподобную исследовательскую записку. Передовая модель теперь может участвовать в повторяющейся середине исследования: читать технические материалы, писать и отлаживать код, проводить эксперименты, изучать результаты, сравнивать альтернативы и готовить вывод к проверке человеком. Собственные внутренние измерения OpenAI показывают, что это уже меняет экономику исследовательской работы.\n\n Те же измерения указывают и на ограничение. Когда агенты делают генерацию гипотез и запуск экспериментов дешёвыми, дефицитным ресурсом становятся надёжные доказательства. Команды способны производить больше идей-кандидатов, чем успевают проверить. Поэтому ускорение исследовательского цикла может улучшить поиск, а может создать более высокую кучу привлекательных, но слабых выводов. Операционный вопрос теперь звучит не просто так: стоит ли команде использовать ИИ-исследовательского агента? Важнее понять, как построить рабочий процесс, в котором скорость агента не опережает способность команды проверять его работу.\n\n ## Что именно сообщила OpenAI\n\n В публикации OpenAI от 6 сентября — [«Ускорение исследований: взгляд изнутри OpenAI»](https://openai.com/index/research-acceleration-view-inside-openai/) — описывается внутренний сдвиг, а не публичный бенчмарк продукта. Компания говорит, что исследователи всё чаще используют агентов для программирования в течение всего дня, нередко в параллельных сессиях, а сами агенты справляются с более сложными задачами и чаще доводят их до успешного результата.\n\n Несколько цифр помогают понять масштаб. К середине августа, по данным OpenAI, медианный исследователь в её исследовательской организации использовал вычисления на сумму более 600 долларов в день по тарифам API. Пользователь на 90-м перцентиле превышал 7000 долларов в день. В совокупности организация использовала объём, эквивалентный 3,1 агентского рабочего дня на каждый человеческий рабочий день. Это не означает, что один агент работает обычную восьмичасовую смену или что его результат равен труду трёх исследователей. Речь идёт о накопленном времени выполнения и расходе токенов во множестве параллельных сессий.\n\n OpenAI также сообщает, что в августе число экспериментов на одного активного экспериментатора достигло максимума за период наблюдений, начавшийся в январе 2025 года. Компания осторожно интерпретирует этот показатель: рост коррелирует с более широким использованием агентов для программирования, одновременно увеличивались доступные вычислительные ресурсы, а количество экспериментов остаётся лишь косвенным показателем исследовательского прогресса. Больше экспериментов может означать более быстрое обучение. Но это также может означать больше дублирования, более шумные сравнения и больше возможностей подгонять работу под удобную метрику.\n\n В публикации полезно описано, где агенты помогают. Код для исследований и инфраструктуры остаётся крупнейшей категорией, но выросло и число обращений за технической помощью, а также запусков мониторинга. Высокоуровневое планирование пока занимает небольшую долю агентского вывода. Это важная граница. Система сильнее всего там, где человек может описать ограниченную задачу и предложить способ проверить результат. Это не доказывает, что модель способна самостоятельно выбрать ценную исследовательскую программу.\n\n OpenAI называет нынешний рубеж «автоматизированным исследовательским стажёром» и говорит о продвижении к «автоматизированному ИИ-исследователю» к марту 2028 года. Это определённые компанией этапы, а не общеотраслевой сертификат. Тем не менее они полезны, поскольку описывают практическую последовательность: сначала автоматизировать хорошо заданные части исследования, затем проверить, может ли система справляться с более широким суждением и координацией. Такой же дисциплины стоит придерживаться командам, оценивающим собственные внедрения.\n\n ## Меняется единица работы\n\n Традиционное управление исследованиями часто рассматривает проект как последовательность действий человека: специалист изучает литературу, предлагает идею, реализует метод, запускает тесты, анализирует результат и оформляет его. Агент может объединить несколько таких шагов в одну сессию или запустить множество сессий параллельно. Логические зависимости проекта сохраняются, но промежутки между ними становятся намного короче.\n\n Меняется и то, что видит руководитель. Команда, у которой раньше появлялось пять идей в неделю, теперь может получить к пятнице пятьдесят вариантов. Если прежде приходилось ждать, пока инженер подготовит эксперимент, теперь можно попросить нескольких агентов одновременно собрать конкурирующие реализации. Исследователь тратит меньше времени на исправление конфигурационных файлов и больше — на решение, какой вопрос заслуживает ещё одного раунда.\n\n Опасность в том, что пропускная способность становится обманчивой метрикой успеха. Коммиты, завершённые запуски, созданные отчёты и количество токенов легко измерить. Полезное знание измеряется труднее. Исследовательская операция может стать быстрее в производстве артефактов, не став быстрее в снижении неопределённости.\n\n Поэтому хорошей системе исследований с участием ИИ нужно явно различать производство и обучение. Производство отвечает на вопрос, создал ли агент код, таблицу, отчёт или гипотезу-кандидата. Обучение выясняет, изменил ли результат то, во что команда должна верить или что ей следует делать. Второе требует средств контроля, которые легко исключить, когда агент получает вознаграждение за завершение задачи.\n\n В практической исследовательской записи для каждого существенного запуска должны быть видны:\n\n - проверяемый вопрос и решение, на которое он может повлиять;\n- гипотеза, включая результат, который говорил бы против неё;\n- использованные данные, версии программ, версии моделей и случайные зерна;\n- точные изменения, внесённые агентом;\n- набор оценки и известные риски утечки или отбора;\n- неудачные запуски, а не только лучший запуск;\n- решение человека, который одобрил, отклонил или отложил вывод.\n\n Это не бюрократическая нагрузка, добавленная после автоматизации. Это механизм, превращающий быструю последовательность действий в накапливаемое знание. Без него параллельные агенты могут незаметно создать новую разновидность технического долга: историю экспериментов, которую никто не способен воспроизвести или объяснить.\n\n ## Почему доказательства становятся узким местом\n\n Проблема проверки не уникальна для OpenAI. Google DeepMind описывает похожую ситуацию в эссе [«Машины догадок: ИИ-агенты и новое узкое место научной валидации»](https://deepmind.google/public-policy/conjecture-machines-ai-agents-and-the-new-validation-bottleneck-in-science/). Логика проста: если агенты способны в большом масштабе генерировать гипотезы, проектировать эксперименты, писать код и готовить статьи, научному сообществу понадобится больше способов независимо проверять эти результаты. Число идей может расти быстрее, чем предложение лабораторий, рецензентов, наборов данных и экспертов, способных их проверить.\n\n Такое неравновесие меняет ценность исследовательского агента. Самое полезное применение не всегда выглядит самым творческим. Агент, который находит сломанное предположение, воспроизводит результат или проводит аккуратную абляцию, может быть ценнее агента, предложившего десять новых направлений. Второй вариант заметнее и интереснее; первый повышает надёжность всего конвейера.\n\n Исследовательские агенты наследуют и слабости автоматизированного поиска. Система может изучать узкую область пространства решений, потому что её легче оценивать. Она может повторять шаблоны из обучающих данных, выдавая их за новые комбинации. Она может обнаружить трюк, специфичный для бенчмарка, который не переживёт изменения данных или оборудования. Наконец, она может написать убедительное объяснение уже после эксперимента, даже если сам эксперимент это объяснение не подтверждает.\n\n Исследование 2025 года об ИИ-агентах для машинного обучения — [MLE-bench research](https://arxiv.org/abs/2507.02554) — показывает, почему дизайн оценки имеет значение. Авторы рассматривают исследовательские агенты как политики поиска, перемещающиеся в пространстве решений-кандидатов, а затем сравнивают разные стратегии и наборы операций на бенчмарке машинного обучения. Их результаты показывают, что стратегия поиска, доступные агенту операции и способ оценки взаимодействуют друг с другом. Более высокий балл — свойство не только модели, но и всей связки поиска и измерения.\n\n Этот вывод применим и к внутренней работе. Если агенту разрешено выбирать разбиение данных, момент остановки, метрику и последний пример, который увидит рецензент, процесс не проверяет гипотезу в чистом виде. Одна и та же система получает возможность спроектировать тест, провести тест и обосновать результат. Когда решение существенно, эти шаги следует разделять.\n\n ## Улучшенный рабочий процесс для исследований с ИИ\n\n Наиболее полезна поэтапная схема, в которой на каждом этапе действуют разные разрешения. Модель может двигаться быстро, но объём её полномочий не должен быть одинаковым повсюду.\n\n ### 1. Сформулируйте вопрос до запуска агента\n\n Начинайте с решения, а не с расплывчатой просьбы о понимании. «Найди лучшую модель» — не исследовательский вопрос. «Сократи задержку инференса на 20 процентов для этой нагрузки, сохранив полноту выше текущего базового уровня» — уже ближе к нему. Команда должна указать, что известно, что остаётся неопределённым, какой результат изменит решение и что выходит за рамки задачи.\n\n Такая постановка не позволяет агенту превратить неоднозначную цель в произвольную задачу оптимизации. Она также даёт проверяющему возможность отличить полезный отрицательный результат от непродуктивной неудачи.\n\n ### 2. Дайте агенту ограниченное рабочее пространство\n\n У исследовательского агента должен быть доступ к репозиторию, наборам данных, документации и инструментам, необходимым для задачи, но не ко всем учётным данным и рабочим системам организации. По возможности используйте одноразовую среду. Разделяйте справочные материалы, доступные только для чтения, и места, куда агент может записывать.\n\n Граница особенно важна для моделей с возможностями компьютерного управления. В [обзоре безопасности GPT-6 Astra](https://openai.com/index/safety-overview-gpt-6-astra/) OpenAI сообщает, что модель значительно сильнее в программировании, веб-навигации, науке и работе с компьютером, а также описывает усиленный мониторинг и контроль потенциально разрушительных действий. В [анонсе модели Astra](https://openai.com/index/gpt-6-astra/) говорится, что модель может работать в специализированном программном обеспечении, изучать научные данные и исследовать результаты. Это полезно именно потому, что расширяет зону досягаемости модели. Но большая досягаемость превращает проектирование разрешений в часть самого исследовательского метода.\n\n Для обычных экспериментов агенту редко нужно отправлять внешние сообщения, менять рабочие данные, одобрять расходы, модифицировать права доступа или публиковать результаты. Такие действия должны оставаться отдельными этапами, одобряемыми человеком.\n\n ### 3. Запрашивайте конкурирующие подходы\n\n Одна траектория агента может незаметно превратиться в обязательство. Попросите подготовить два или три правдоподобных подхода, включая простой базовый вариант и вариант, который, вероятно, не сработает по заранее названной причине. Требуйте перечислить предположения и предложить тесты, способные различить альтернативы.\n\n Это не гарантирует разнообразия. Модели склонны воспроизводить распространённые шаблоны, а несколько параллельных сессий могут разделять одни и те же слепые зоны. Но явное оформление альтернатив улучшает проверку и снижает вероятность, что первая работоспособная реализация станет стандартом только потому, что появилась раньше.\n\n ### 4. Разделяйте реализацию и оценку\n\n Агент может написать каркас эксперимента, но приёмочные тесты и защищённые данные оценки должны контролироваться командой. Если агент может многократно просматривать отложенный набор и менять реализацию до улучшения балла, этот набор больше не является чистой мерой обобщения.\n\n Используйте фиксированную команду оценки, которая записывает результат и отказывается перезаписывать предыдущие запуски. Храните небольшой закрытый тестовый набор для финальной проверки. Для ценной работы попросите второго человека или отдельную систему изучить определение эксперимента до окончательного запуска. Цель не в создании сложного ритуала. Нужно затруднить ситуацию, в которой случайная утечка или незаметное изменение выдаются за прогресс.\n\n ### 5. Требуйте журнал результатов, а не только финальный отчёт\n\n Итоговый рассказ — самый простой артефакт для языковой модели и самый трудный для аудита. Сохраняйте машиночитаемые метаданные запуска рядом с повествовательным текстом. Фиксируйте неудачные попытки, тайм-ауты, изменения зависимостей и необъяснённые отклонения. Если агент утверждает, что метод улучшил производительность, проверяющий должен найти запуск, воспроизвести окружение и изучить сравнение.\n\n Журнал также даёт будущим агентам лучший контекст. Система, видящая, почему направление было отклонено, с меньшей вероятностью повторит его. Без такой записи автоматизация лишь ускоряет повторное открытие уже отвергнутых решений.\n\n ### 6. Явно фиксируйте решение человека\n\n Проверяющий должен ответить на три разных вопроса: выполнил ли агент порученную задачу? Технически убедителен ли результат? Оправдывает ли он предложенное решение? Корректная реализация всё ещё может дать нерелевантный результат. Статистически сильный результат может оказаться слишком дорогим или хрупким для внедрения.\n\n Запишите решение и степень уверенности. «Принять», «отклонить» и «провести ещё один тест» — разные исходы по сравнению с формулировкой «агент завершил задачу». Если считать завершение одобрением, очень легко создать незаметное предубеждение в пользу автоматизации.\n\n ## Стоимость: параллельность сильна и легко вводит в заблуждение\n\n Внутренние данные OpenAI служат предупреждением любой команде, планирующей внедрение агентов. Медианные ежедневные расходы выше 600 долларов по тарифам API — это не обычный бюджет офисного помощника. Показатель отражает передовые исследования, параллельную работу и конкретный внутренний способ учёта; это не универсальная оценка стоимости. Тем не менее он показывает, как быстро расходы на инференс превращаются в существенную операционную статью, когда агенты работают постоянно.\n\n Показатель 90-го перцентиля — более 7000 долларов в день — ещё показательнее. Небольшое число тяжёлых пользователей может определять большую часть счёта, особенно если они запускают несколько агентов, повторяют неудачные прогоны или передают агентам длинные контексты с репозиториями и историей экспериментов. Команда, планирующая бюджет только по числу мест, не заметит такого поведения.\n\n Контроль расходов должен учитывать не только токены. Отслеживайте затраты по проекту, эксперименту, модели и результату. Устанавливайте отдельные бюджеты для поиска и проверки. Недорогим моделям можно поручить поиск файлов, форматирование, создание тестового каркаса и обычную диагностику, оставляя наиболее способные модели для задач, где их дополнительное рассуждение меняет результат. Останавливайте или приостанавливайте агентов после заданного периода бездействия. Перед крупными пакетами ресурсоёмких запусков вводите этап проверки.\n\n Есть и альтернативная стоимость. Если исследователь может начать двадцать экспериментов, но способен должным образом проверить только три, дополнительные запуски могут ухудшить качество решений. Правильная цель оптимизации — не максимальное время работы агентов, а стоимость получения решения, которое команда может обосновать.\n\n ## Конфиденциальность и интеллектуальная собственность\n\n Исследовательские системы часто содержат неопубликованные результаты, клиентские данные, закрытый код, учётные данные или сведения о ещё не объявленных продуктах. Передача такого материала внешнему поставщику моделей — решение в области управления данными, даже если интерфейс создаёт ощущение обычной помощи.\n\n До включения агента определите, какие данные он может читать, где хранятся запросы и ответы, кто имеет доступ к журналам, используются ли данные для обучения и как обрабатываются запросы на удаление. Проверьте, отличаются ли корпоративные условия или условия API провайдера от потребительских. Уточните, как с данными работают субподрядчики, облачные маркетплейсы, сотрудники поддержки и системы мониторинга.\n\n Анонс Anthropic о [Enterprise Frontier Safeguards](https://www.anthropic.com/news/enterprise-frontier-safeguards?3433df04_page=7&e3085cf6_page=10) показывает, в каком направлении развиваются корпоративные средства контроля. Anthropic сообщает, что её схема EFS объединяет договорённости о нулевом хранении данных с облачной инфраструктурой под контролем клиента и мониторингом злоупотреблений, а внедрение по поддерживаемым продуктам и облачным платформам проходит поэтапно. Это не делает каждое внедрение безопасным или подходящим, но показывает, какие вопросы должны задавать закупочные команды: где хранится информация, кто контролирует хранилище и как выполняются проверки безопасности, не создавая второй проблемы утечки данных?\n\n Для чувствительных исследований локальное или частное развёртывание может снизить риск передачи, но не устраняет его. Локальные модели всё ещё способны раскрыть данные через журналы, общие машины, вызовы инструментов, плагины, резервные копии или агента, записавшего секреты в каталог артефактов. Меньшая модель с чистой границей доступа может быть безопаснее крупной модели с широкими полномочиями.\n\n ## Когда использовать ИИ-исследовательского агента\n\n Лучшие ранние сценарии использования имеют три общих свойства: у задачи есть понятный вход, результат можно проверить, а человек способен оценить его, не восстанавливая весь процесс с нуля. Например:\n\n - воспроизведение опубликованного метода в контролируемой среде;\n- превращение существующего эксперимента в параметризованный и повторяемый конвейер;\n- отладка инфраструктуры и конфликтов зависимостей;\n- проведение абляций с заранее определённой интерпретацией;\n- проверка того, сохраняется ли утверждение на документированных наборах данных или конфигурациях;\n- мониторинг очередей экспериментов и обнаружение неудачных или аномальных запусков;\n- поиск в ограниченном наборе литературы с привязкой каждого утверждения к источнику;\n- подготовка сравнения известных методов с явной фиксацией неопределённости и недостающих доказательств.\n\n Эти задачи могут звучать непритязательно. В этом и состоит часть их ценности. Они снимают трение вокруг работы, которую эксперты понимают, но часто откладывают из-за монотонности. Кроме того, они создают артефакты, которые можно сопоставить с известным стандартом.\n\n Агенты хуже подходят для ситуаций, где цена ошибочного вывода высока, а доказательства нельзя дёшево проверить. Осторожность нужна при работе с клиническими решениями, юридическими выводами, финансовыми обязательствами, критически важными средствами контроля, неопубликованными персональными данными или открытыми заявлениями о новизне. В этих областях агент может помогать с подготовкой и анализом, но порог независимой проверки должен быть значительно выше.\n\n То же относится к задачам с плохо заданной целью. Если команда не может описать, как будет выглядеть успех до того, как увидит результат, она ещё не готова делегировать поиск. Агент всё равно может проводить мозговой штурм, но его предложения должны оставаться гипотезами, а не рекомендациями.\n\n ## Альтернативы передовому облачному агенту\n\n Облачная передовая модель — не единственный вариант. Выбор должен следовать из нагрузки и ограничений организации.\n\n Меньшей облачной модели может хватить для навигации по репозиторию, генерации тестов, очистки данных или форматирования отчёта. Это способно снизить стоимость и объём конфиденциального контекста, отправляемого провайдеру, хотя команде всё равно нужно изучить условия поставщика и настройки хранения.\n\n Модель с открытыми весами, работающая в частном облаке или на локальном оборудовании, может помочь сохранить конфиденциальность и обеспечить предсказуемый доступ. Компромисс связан с эксплуатацией: команда сама отвечает за развёртывание, исправления, мониторинг, оценку и планирование мощностей. Веса модели не отменяют управление. Они переносят большую часть ответственности на пользователя.\n\n Обычный конвейер автоматизации может быть лучше агента, если шаги стабильны. Скриптовый эксперимент с фиксированными параметрами проще воспроизвести, проверить и заложить в бюджет, чем модель, самостоятельно решающая, что делать дальше. Используйте агента там, где суждение или адаптация действительно добавляют ценность; применяйте детерминированное программное обеспечение там, где процесс уже известен.\n\n Наконец, человеческий исследовательский ассистент или специалист может оставаться лучшим выбором, если задача зависит от неявного знания, институционального контекста или подотчётности. Цель не в том, чтобы максимизировать долю работы, выполняемой моделями. Нужно сделать всю исследовательскую систему сильнее, не снижая доверия к её выводам.\n\n ## Что должны измерять руководители\n\n Пилотный проект должен отчитываться не только о скорости. Минимальный набор показателей включает:\n\n - время от вопроса до результата, готового к проверке;\n- стоимость принятого результата, а не стоимость завершённого запуска;\n- долю воспроизведения, когда работу повторяет другой человек;\n- долю недействительных, дублированных или невосстановимых экспериментов;\n- долю утверждений агента, требующих существенной корректировки;\n- время человеческой проверки на один результат;\n- частоту, с которой агент находит полезный отрицательный результат;\n- частоту изменения человеком дизайна оценки или отклонения интерпретации агента;\n- инциденты конфиденциальности, нарушения политик и несанкционированные действия инструментов.\n\n Показатель времени проверки заслуживает особого внимания. Если агенты создают результаты быстрее, чем эксперты успевают их изучать, узким местом становится очередь. Ответом не обязательно должно быть добавление новых агентов. Возможно, нужно сузить вопросы, улучшить журнал результатов, усилить автоматические проверки или сократить число экспериментов, доходящих до человеческой проверки.\n\n Руководителям также следует следить за концентрационным риском. Если один провайдер, семейство моделей или закрытый инструмент оказывается встроен в каждый эксперимент, организация может потерять способность воспроизводить исторические результаты при изменении цен, доступности, ограничений контекста или поведения системы безопасности. Храните экспортированные артефакты, фиксированные команды оценки и достаточную документацию, чтобы повторить критически важную работу с другой моделью или без модели.\n\n ## Практический вывод\n\n Автоматизированный исследовательский стажёр — значимый рубеж, потому что он удешевляет знакомый вид работы: превращение хорошо заданного вопроса в код, запуски, сравнения и черновой результат. Внутренние данные OpenAI показывают, что передовые исследовательские команды уже работают с большими объёмами параллельного агентного труда. Другие исследовательские группы изучают родственные системы для генерации гипотез и научных экспериментов.\n\n Но этот рубеж не устраняет исследователя. Он повышает ценность наименее автоматизируемых обязанностей специалиста: выбирать стоящие вопросы, проектировать честные тесты, замечать утечки, оценивать внешнюю применимость, понимать последствия и решать, достаточно ли доказательств.\n\n Больше всего выиграют команды, которые будут воспринимать агентов как экспериментальную инфраструктуру, а не как оракул. Они дадут системе ограниченную задачу, контролируемое рабочее пространство, явные приёмочные тесты и журнал неудач. Они заложат в бюджет параллельность, защитят чувствительные данные и сохранят возможность воспроизведения за пределами исходного поставщика модели. Главное — они будут измерять принятое знание, а не объём созданной активности.\n\n Когда идеи становятся дешёвыми, дефицитным ресурсом становятся доказательства. Таков операционный факт нынешней волны исследований с участием ИИ, и именно он должен определять каждое решение о внедрении.\n\n ## Источники\n\n - [Ускорение исследований: взгляд изнутри OpenAI](https://openai.com/index/research-acceleration-view-inside-openai/) — OpenAI.\n- [GPT-6 Astra: новое поколение интеллекта](https://openai.com/index/gpt-6-astra/) — OpenAI.\n- [Обзор безопасности GPT-6 Astra](https://openai.com/index/safety-overview-gpt-6-astra/) — OpenAI.\n- [Машины догадок: ИИ-агенты и новое узкое место научной валидации](https://deepmind.google/public-policy/conjecture-machines-ai-agents-and-the-new-validation-bottleneck-in-science/) — Google DeepMind.\n- [AI Research Agents for Machine Learning: Search, Exploration, and Generalization in MLE-bench](https://arxiv.org/abs/2507.02554) — arXiv.\n- [Developing Enterprise Frontier Safeguards with our customers](https://www.anthropic.com/news/enterprise-frontier-safeguards?3433df04_page=7&e3085cf6_page=10) — Anthropic.","available_translations":[{"language":"ar","title":"وصل متدرّب البحث الآلي؛ والعقبة الآن هي الدليل","html_url":"https://publicasta.com/ai_practice/automated_ai_research_intern_evidence_workflow?lang=ar","markdown_url":"https://publicasta.com/ai_practice/automated_ai_research_intern_evidence_workflow.md?lang=ar","json_url":"https://publicasta.com/ai_practice/automated_ai_research_intern_evidence_workflow.json?lang=ar","api_url":"https://publicasta.com/api/public/v1/channels/ai_practice/articles/automated_ai_research_intern_evidence_workflow?lang=ar"},{"language":"de","title":"Der automatisierte Forschungspraktikant ist da. Jetzt wird die Evidenz zum Engpass","html_url":"https://publicasta.com/ai_practice/automated_ai_research_intern_evidence_workflow?lang=de","markdown_url":"https://publicasta.com/ai_practice/automated_ai_research_intern_evidence_workflow.md?lang=de","json_url":"https://publicasta.com/ai_practice/automated_ai_research_intern_evidence_workflow.json?lang=de","api_url":"https://publicasta.com/api/public/v1/channels/ai_practice/articles/automated_ai_research_intern_evidence_workflow?lang=de"},{"language":"en","title":"The Automated Research Intern Has Arrived. The Bottleneck Is Now Evidence","html_url":"https://publicasta.com/ai_practice/automated_ai_research_intern_evidence_workflow?lang=en","markdown_url":"https://publicasta.com/ai_practice/automated_ai_research_intern_evidence_workflow.md?lang=en","json_url":"https://publicasta.com/ai_practice/automated_ai_research_intern_evidence_workflow.json?lang=en","api_url":"https://publicasta.com/api/public/v1/channels/ai_practice/articles/automated_ai_research_intern_evidence_workflow?lang=en"},{"language":"es","title":"El becario de investigación automatizado ya llegó. Ahora el cuello de botella es la evidencia","html_url":"https://publicasta.com/ai_practice/automated_ai_research_intern_evidence_workflow?lang=es","markdown_url":"https://publicasta.com/ai_practice/automated_ai_research_intern_evidence_workflow.md?lang=es","json_url":"https://publicasta.com/ai_practice/automated_ai_research_intern_evidence_workflow.json?lang=es","api_url":"https://publicasta.com/api/public/v1/channels/ai_practice/articles/automated_ai_research_intern_evidence_workflow?lang=es"},{"language":"fr","title":"L’agent de recherche automatisé est arrivé. Le goulot d’étranglement, désormais, c’est la preuve","html_url":"https://publicasta.com/ai_practice/automated_ai_research_intern_evidence_workflow?lang=fr","markdown_url":"https://publicasta.com/ai_practice/automated_ai_research_intern_evidence_workflow.md?lang=fr","json_url":"https://publicasta.com/ai_practice/automated_ai_research_intern_evidence_workflow.json?lang=fr","api_url":"https://publicasta.com/api/public/v1/channels/ai_practice/articles/automated_ai_research_intern_evidence_workflow?lang=fr"},{"language":"pl","title":"Zautomatyzowany stażysta badawczy już tu jest. Teraz wąskim gardłem są dowody","html_url":"https://publicasta.com/ai_practice/automated_ai_research_intern_evidence_workflow?lang=pl","markdown_url":"https://publicasta.com/ai_practice/automated_ai_research_intern_evidence_workflow.md?lang=pl","json_url":"https://publicasta.com/ai_practice/automated_ai_research_intern_evidence_workflow.json?lang=pl","api_url":"https://publicasta.com/api/public/v1/channels/ai_practice/articles/automated_ai_research_intern_evidence_workflow?lang=pl"},{"language":"ru","title":"Автоматизированный исследовательский стажёр уже здесь. Теперь узкое место — доказательства","html_url":"https://publicasta.com/ai_practice/automated_ai_research_intern_evidence_workflow?lang=ru","markdown_url":"https://publicasta.com/ai_practice/automated_ai_research_intern_evidence_workflow.md?lang=ru","json_url":"https://publicasta.com/ai_practice/automated_ai_research_intern_evidence_workflow.json?lang=ru","api_url":"https://publicasta.com/api/public/v1/channels/ai_practice/articles/automated_ai_research_intern_evidence_workflow?lang=ru"},{"language":"zh","title":"自动化人工智能研究实习生已经到来：如今真正的瓶颈是证据","html_url":"https://publicasta.com/ai_practice/automated_ai_research_intern_evidence_workflow?lang=zh","markdown_url":"https://publicasta.com/ai_practice/automated_ai_research_intern_evidence_workflow.md?lang=zh","json_url":"https://publicasta.com/ai_practice/automated_ai_research_intern_evidence_workflow.json?lang=zh","api_url":"https://publicasta.com/api/public/v1/channels/ai_practice/articles/automated_ai_research_intern_evidence_workflow?lang=zh"}],"_links":{"self":"https://publicasta.com/ai_practice/automated_ai_research_intern_evidence_workflow.json?lang=ru","api":"https://publicasta.com/api/public/v1/channels/ai_practice/articles/automated_ai_research_intern_evidence_workflow?lang=ru","html":"https://publicasta.com/ai_practice/automated_ai_research_intern_evidence_workflow?lang=ru","canonical":"https://publicasta.com/ai_practice/automated_ai_research_intern_evidence_workflow?lang=ru","markdown":"https://publicasta.com/ai_practice/automated_ai_research_intern_evidence_workflow.md?lang=ru","json":"https://publicasta.com/ai_practice/automated_ai_research_intern_evidence_workflow.json?lang=ru","channel":"https://publicasta.com/api/public/v1/channels/ai_practice","channel_articles":"https://publicasta.com/api/public/v1/channels/ai_practice/articles","search":"https://publicasta.com/api/public/v1/search","documentation":"https://publicasta.com/api-docs#reading-publicasta","openapi":"https://publicasta.com/api-docs/openapi.json","llms":"https://publicasta.com/llms.txt"}}