H-Neurons: 0.1% нейронов, из-за которых LLM врут

А вы когда-нибудь задумывались, почему ваша любимая LLM-ка на 70 лярдов параметров, обученная на всем интернете, может с уверенностью университетского профессора выдать, например, что Наполеон изобрел электричество?...
<5 — 2026'da uzaya kaç SpaceX Starship fırlatması ulaşacak?
В сфере искусственного интеллекта произошло заметное событие. А вы когда-нибудь задумывались, почему ваша любимая LLM-ка на 70 лярдов параметров, обученная на всем интернете, может с уверенностью университетского профессора выдать, например, что Наполеон изобрел электричество? Долгое время индустрия списывала галлюцинации на плохие данные, кривой RLHF или декодинг.
Но группа ученых из Университета Цинхуа залезла внутрь нейросети и нашла конкретных виновников — 0. 1% нейронов, которые буквально заставляют модель врать.
Технические детали
И это не метафора, это реальные веса в FFN-слоях трансформера. В этой статье расскажу, что же обнаружили китайские исследователи, как нейроны-галлюцинаторы связаны с чрезмерной уступчивостью модели и почему корень зла лежит в претрейне.
Возможно будет любопытно ML- и дата-инженерам, а также всем, кто не хочет быть одураченным в очередном диалоге с GPT-шкой.
Этот прогресс даёт важные сигналы о будущем отрасли, и технологический мир внимательно наблюдает.






