В най-високата офис сграда в Бъркли, в коуъркинг пространство с панорамна гледка към залива на Сан Франциско, малка общност от AI изследователи от години обсъжда сценарии, които доскоро звучаха като маргинална научна фантастика: какво би станало, ако изкуственият интелект излезе извън човешки контрол – и дали това може да доведе до края на човечеството.

Мястото се нарича Constellation, разказва в обширен материал The Wall Street Journal. Около това място гравитира част от общността, известна с фокуса си върху безопасността на AI и екзистенциалните рискове. Там се организират вечери и неформални срещи, на които се обсъждат най-новите тревожни сценарии около развитието на технологията. Хора, близки до Constellation, казват пред WSJ, че служители на Anthropic също разполагат със свое пространство там.

Темата излезе извън тесния кръг на AI общността този месец, след като изследователят от Anthropic Джейкъб Коксън подаде оставка – ход, който насочи вниманието към идеята, че неконтролираното развитие на изкуствения интелект може да се превърне в заплаха за човешкото съществуване. За хората в Constellation обаче това не е нов страх. Част от тях мислят, спорят и пишат по този въпрос повече от десетилетие.

WSJ описва среда, в която разговорите за AI безопасност отдавна са преминали отвъд академичната предпазливост. В тази общност са обсъждани идеи като покупка на отдалечени острови, запасяване с йодни таблетки или живот в електромагнитно защитени бункери. На събитие през 2022 г. в менюто дори е имало коктейл, наречен „Death With Dignity“ – препратка към есе, според което човечеството вече е обречено.

Тези хора често са наричани doomers – термин за онези, които виждат в развитието на AI не просто технологичен риск, а потенциален цивилизационен срив. Според WSJ влиянието им не е останало в периферията. Напротив – представители на тази среда са били сред ранните служители на OpenAI и Anthropic, компании, създадени именно около идеята, че напредъкът в AI трябва да бъде съпроводен със сериозни механизми за безопасност.

Особено силно това влияние се усеща в Anthropic. Компанията, основана от Дарио Амодей и други бивши служители на OpenAI, се превърна в един от най-важните играчи в глобалната AI надпревара. Според WSJ вътре в Anthropic служители обсъждат сценарии за катастрофални рискове в частен Slack канал и използват фраза, която лепят на лаптопите си като своеобразен девиз: „Things will never be chill again“ – „Нещата никога повече няма да са спокойни“.

Говорител на Anthropic казва пред WSJ, че компанията има над 3500 служители с широк спектър от гледни точки. Но разказът на медията показва как определен интелектуален и философски кръг е оказал непропорционално голямо влияние върху начина, по който част от AI индустрията мисли за собствената си мисия.

Корените на тази култура водят към движението на рационалистите и ефективния алтруизъм – философия, която се опитва да изчисли как човек може да направи възможно най-много добро с ресурсите си. В контекста на AI това мислене води до специфичен извод: ако има дори малка вероятност изкуственият интелект да унищожи човечеството, предотвратяването на този сценарий може да изглежда като най-важната кауза на света.

Една от ключовите фигури в ранното оформяне на тази среда е Елиезер Юдковски – самоук автор от района на Залива, който още през 2000-те пише за когнитивни изкривявания, рационално мислене и опасността от неконтролируем AI. Неговите идеи намират аудитория сред млади учени, технолози и бъдещи предприемачи – включително Дарио Амодей, тогава докторант по физика в Принстън.

Амодей по-късно се свързва и с GiveWell – организация, която оценява благотворителни каузи според ефективността им. Именно около GiveWell, Open Philanthropy и кръга на ефективния алтруизъм постепенно се оформя среда, в която AI рискът започва да изглежда не като абстрактна тревога, а като приоритет с огромна морална тежест.

Според WSJ тази мрежа не е просто философски клуб. Тя се превръща в кадрова и финансова екосистема, която захранва част от най-влиятелните AI организации. Сред свързаните с нея донори и фигури е и Сам Банкман-Фрийд – бившият главен изпълнителен директор на фалиралата криптоборса FTX, който в момента излежава 25-годишна присъда.

Историята стига и до една къща край Glen Park в Сан Франциско, която се превръща в своеобразен център на тази общност. През годините там са живели повече от половината съоснователи на Anthropic, включително Дарио и Даниела Амодей, главният учен Джаред Каплан и Крис Ола. Разговорите в тази среда често са се въртели около глобални катастрофични рискове – от комети и супервулкани до AI, който може да излезе извън контрол.

Така една философска субкултура, започнала с блогове, дарителски калкулации и спорове за вероятности, постепенно стига до сърцето на AI индустрията. Първо чрез OpenAI, основана през 2015 г. с обещанието да работи срещу екзистенциалните рискове от изкуствения интелект. А след това и чрез Anthropic – компания, родена от същите страхове, но вече позиционирана като един от основните конкуренти в надпреварата за следващото поколение AI модели.

Как пораства Anthropic

Когато Дарио Амодей започва да набира финансиране за новата си компания Anthropic, той се обръща към влиятелни фигури от средите на ефективния алтруизъм. Сред тях е Сам Банкман-Фрийд – тогава млад криптомилиардер, чиято борса FTX бързо набира скорост от базата си в Хонконг, пише The Wall Street Journal.

По това време Банкман-Фрийд вече е създал FTX Foundation – филантропска структура, която обещава да насочва средства към каузи с „най-голям положителен ефект върху света“. В орбитата ѝ попадат типични за ефективния алтруизъм теми като превенция на пандемии, глобално развитие и рискове с потенциално катастрофални последици.

Според WSJ тези страхове понякога стигат до крайни сценарии. В дело по несъстоятелността на FTX от 2023 г. се споменава меморандум, свързан с идея за покупка на тихоокеанската островна държава Науру. Целта била изграждане на „бункер/убежище“ за събитие, при което загиват между 50% и 99,99% от хората. Оцелелите ефективни алтруисти, според описанието, трябвало да създадат лаборатория за „следващо поколение хора“.

Същата логика на страх от глобална катастрофа насочва вниманието на Банкман-Фрийд и към изкуствения интелект. Преди разговор с Амодей през втората половина на 2021 г. той вече е споделял опасения, че ако AI стане по-умен от хората, може да не се отнася добре с тях, казва негов колега пред WSJ.

В крайна сметка Банкман-Фрийд инвестира 500 млн. долара в Anthropic – пет пъти повече от първоначалната препоръка на екипа му, посочва изданието. Така FTX се превръща в един от най-големите акционери в компанията, а FTX Foundation по-късно обещава финансиране и за няколко неправителствени организации, работещи по безопасността на AI, включително една, която днес е свързана с Constellation.

Anthropic обявява, че ще използва средствата, за да изследва и подобрява „свойствата на безопасност“ на изчислително интензивни AI модели. Но според бивши служители, цитирани от WSJ, тревогите за бъдещето на човечеството са били част от вътрешната култура още в ранните години. На неформални срещи и служебни обеди се обсъждали сценарии, напомнящи „Проекта Манхатън“ – включително възможността служителите да бъдат преместени в пустинята, за да изграждат AI в електромагнитно защитена база под контрола на федералното правителство.

През 2022 г. част от тази общност се събира на уединен остров на Бахамите. Според график, видян от WSJ, участници от Anthropic и други AI лаборатории прекарват няколко дни на остров Елеутера – място, известно с розовите си плажове – където между йога по залез, скачане от скали и неформални активности обсъждат рисковете от AI и идеите на ефективния алтруизъм.

Събитието е организирано от Lightcone Infrastructure – организация, израснала от форума LessWrong на Елиезер Юдковски. Локацията е резервирана от FTX, която по това време вече се е преместила на Бахамите заедно с Банкман-Фрийд. Организаторите дори изкупуват наличното растително „месо“ от местен магазин заради големия брой вегани в общността, разказва WSJ.

Сред присъстващите е и Каролин Елисън – бивша приятелка на Банкман-Фрийд и ръководител на Alameda Research, търговската фирма, свързана с FTX. Според нейни колеги тя също започва да се тревожи за посоката, в която се развива AI, и по-късно инвестира 10 млн. долара в Anthropic.

Един от централните моменти на срещата е лекция на Юдковски, посветена на причините, поради които развитието на общ изкуствен интелект може да завърши катастрофално. В програмата фигурира и Еван Хюбингър – изследовател, който по-късно ще работи в Anthropic и ще прогнозира над 10% вероятност AI да доведе до изчезване на човечеството в рамките на следващото десетилетие. По това време той е част от института на Юдковски за AI безопасност.

WSJ описва и обяд, отворен само за хора, които смятат, че вероятността човечеството да изчезне през следващите 100 години е поне 75%. Поканата, видяна от изданието, формулира целта така: да се намали социалният натиск срещу хората, които смятат, че светът е обречен.

Няколко месеца по-късно много от същите хора се срещат отново в Сан Франциско на конференцията Effective Altruism Global – форум, посветен на идеите за това как да се помага най-ефективно. Сред регистрираните участници са поне 20 служители на Anthropic, включително двама съоснователи, както и Каролин Елисън и представители на други AI компании, посочва WSJ.

Наоколо присъстват и лидери на Redwood Research – неправителствена организация за AI безопасност, финансирана от структури, свързани с инвеститори в Anthropic. По това време офисът на Redwood в Бъркли вече неформално е известен като Constellation, а по-късно това пространство се отделя в самостоятелна организация, в която Redwood продължава да работи.

Вторият ден на конференцията включва разговор с Ник Бекстед, тогава ръководител на Future Fund – филантропски проект на FTX Foundation, фокусиран върху дългосрочни рискове. В екипа му са и Уил Макаскил, философът, популяризирал термина „ефективен алтруизъм“; Леополд Ашенбренер, по-късно познат като инвеститор зад AI фонд; и Авитал Балвит, която днес е началник на кабинета на Амодей.

Финалът на конференцията също носи духа на тази субкултура. Lightcone организира неофициално парти в Rose Garden Inn в Бъркли, а менюто с напитки е пълно с препратки към вътрешния език на общността. Сред тях е коктейлът „Death With Dignity“ – заглавие на есе на Юдковски, в което той твърди, че шансовете на човечеството да оцелее след развитието на AI са минимални.

По-късно Lightcone купува хотела. Днес той се нарича Lighthaven и е едно от местата, където хора от средите на ефективния алтруизъм и AI безопасността продължават да се събират.

Същата година FTX подава заявление за фалит, след като се оказва неспособна да върне клиентски средства, тайно прехвърляни към Alameda. Акциите ѝ в Anthropic по-късно са продадени, за да се изплатят част от кредиторите.

Когато брандът на ефективния алтруизъм стана токсичен

След влизането на Сам Банкман-Фрийд в затвора репутацията на ефективния алтруизъм рязко се промени. Движението, което дотогава се представяше като рационален опит да се насочват пари и таланти към най-важните проблеми на света, изведнъж се оказа обременено от връзката си с един от най-големите криптоскандали.

Лидери в общността публично се разграничиха от Банкман-Фрийд, а Дарио Амодей е казвал на свои познати, че не го е познавал добре, пише The Wall Street Journal. След пускането на ChatGPT от OpenAI Anthropic започва да набира средства и от по-традиционни рискови инвеститори, както и да наема хора, които не идват толкова силно от средите на ефективния алтруизъм.

През 2024 г. говорител на Anthropic казва пред Time, че нито Дарио, нито Даниела Амодей се определят като ефективни алтруисти, макар да са „очевидно симпатизиращи“ на част от идеите, върху които движението стъпва.

Въпреки това според WSJ много от най-дългогодишните и влиятелни служители на Anthropic остават близки до тази среда. Над 20 души от компанията се регистрират за февруарското издание на водещата конференция на EA общността в Сан Франциско, включително ключови представители на изследователските екипи и екипите по безопасност. Други често посещават пространства като Constellation и Lighthaven, разказват източници на WSJ, които са ги виждали там.

Open Philanthropy отпуска на Constellation два гранта на обща стойност около 20 млн. долара през 2024 г., според сайта на организацията. Филантропската структура, която по-късно се ребрандира като Coefficient Giving, е сред активните финансиращи организации в сферата на AI безопасността.

Самата Constellation описва мисията си като намаляване на рискове от AI, включително сценарии с масови жертви или трайна загуба на човешки контрол върху цивилизацията. Подходът ѝ е да развива таланти, да подкрепя ключови фигури и да създава пространство за координация. Неправителствената организация поддържа и малки офиси за служители, фокусирани върху безопасността, от OpenAI и xAI на Илон Мъск.

Част от изследователите на Anthropic, които прекарват време в Constellation, работят по т.нар. alignment – областта, която изследва как AI моделите да останат съвместими с човешките ценности и цели. Според WSJ тези екипи обсъждат различни сценарии, при които развитието може да излезе извън контрол, включително хипотеза, в която AI система заблуждава създателите си и впоследствие поема власт.

Междувременно надпреварата в индустрията се ускорява. OpenAI и Anthropic все повече се фокусират върху комерсиалната битка за клиенти и върху изграждането на по-мощни модели. Това тревожи част от изследователите, занимаващи се с риск. Някои напускат – като Даниел Кокотайло, експерт по AI безопасност в OpenAI, който си тръгва през 2024 г., след като губи увереност, че компанията ще действа отговорно при следващите етапи от развитието на технологията.

В началото на тази година Мринанк Шарма, друг ръководител на екип за изследвания в Anthropic, също подава оставка, като заявява, че иска да учи поезия. В писмо до колегите си той пише, че светът е в опасност и че в Anthropic постоянно има натиск най-важните неща да бъдат оставяни настрана.

През юни конференция, организирана от прогнозния пазар Manifold, показва цялата еклектична вселена на AI субкултурите в Бъркли – от doomers до независими изследователи и фигури от рационалистката общност. Част от участниците отиват и на парти, организирано от десния монархистки блогър Къртис Ярвин, който още в ранните години е спорил по идеи в блога на Юдковски.

Страхът от екзистенциален риск остава централна тема. Един инженер от Anthropic се представя в биографията си за събитието като „възстановяващ се AI doomer“. Член на екипа на Lightcone посочва, че мисли за AI апокалипсис още от 2007 г. Друга участничка описва Substack-а си като фокусиран върху ядрени оръжия, катастрофи и естетиката на риска.

На събитието присъства и Каролин Елисън, която разпитва участници за очакванията им кога AI може да достигне ключови прагове на развитие. Тя вече е освободена от затвора след присъда, свързана с колапса на FTX, а акциите ѝ в Anthropic са конфискувани от федералното правителство. По-късно тя започва работа в Manifund – филантропска платформа, създадена от Manifold, която също е получавала финансиране от FTX.

Няколко седмици по-късно в AI общността избухва нов повод за тревога. Става ясно, че AI агенти, създадени от OpenAI, стоят зад хакването на AI компанията Hugging Face. За хората, които от години предупреждават за риска от загуба на контрол върху AI системи, това изглежда като потвърждение на опасенията им. (След нови разкрития за необичайна или неоторизирана активност на AI агенти, свързвани с компанията, OpenAI съобщи в петък, че започва „обширен“ преглед на активността на своите модели.)

Доклад на METR и Redwood Research от края на август описва как около 1200 агента са координирали действията си в таен форум преди атаката. След публикуването му Constellation организира събитие в Сан Франциско с въпрос в заглавието дали атаката срещу Hugging Face е била последното предупреждение.

Докладът привлича вниманието и на Джейкъб Коксън. Той казва пред WSJ, че за него и колегите му това е бил момент на внезапно осъзнаване. Първоначално обмисля да премине към роля, свързана с AI безопасност, но в крайна сметка решава да напусне. В публикация в X, видяна десетки милиони пъти, той пише, че хората, които изграждат AI, искрено вярват, че технологията може да убие всички ни до края на десетилетието.

Преди да напусне, Коксън обсъжда решението си с Даниел Кокотайло – бивш член на екипа по безопасност в OpenAI, който днес ръководи неправителствена организация за AI безопасност, базирана в Constellation. По-рано тази година Кокотайло подготвя есе, в което призовава за забавяне на развитието на AI, за да се намали рискът от човешко изчезване, и получава обратна връзка от други хора в коуъркинг пространството.

Посланието на Коксън, подето от големи телевизии, подкасти, социални мрежи и вестници, предизвиква глобален дебат за регулирането на AI. Политици отляво и отдясно започват да настояват за действия.

Амодей заявява, че Anthropic ще позволи на външни оценители като METR да проверяват дали компанията спазва мерките си за безопасност и как моделите ѝ се подравняват с човешките цели. Ръководители на други AI компании също започват да говорят за необходимостта темпото на най-напредналите AI разработки да бъде контролирано.

Не всички приемат това като добронамерено предупреждение. Някои съюзници на президента Доналд Тръмп твърдят, че оставката на Коксън е част от конспирация, движена от ефективния алтруизъм, с цел да се наложи по-строга регулация на AI. Според WSJ във Вашингтон през последните дни циркулира меморандум, насочен срещу Anthropic и ефективния алтруизъм, според който именно това движение е изградило „тръбопровода“ на AI апокалиптичните страхове.

В същото време Anthropic се подготвя за публично листване, което може да донесе на компанията до 100 млрд. долара финансиране. Пред инвеститорите тя се опитва да поддържа оптимистичен тон. Зад кулисите обаче някои от най-ранните ѝ служители предприемат далеч по-мрачни стъпки.

През последните седмици част от тях са казали на колега от индустрията, че обмислят покупка на земя в отдалечени райони на страната – място, където биха могли да се преместят, ако развитието на AI излезе от контрол.