TechFlow Logo
Đăng nhập/ Đăng ký
ETH Gas
Gwei
Sợ hãi
gas
Lược sử chiến thắng của AI: Nơi nào có hệ thống chấm điểm, nơi đó có sự xâm nhập của AI

Lược sử chiến thắng của AI: Nơi nào có hệ thống chấm điểm, nơi đó có sự xâm nhập của AI

2026.07.23
Chia sẻ đến

Tuyển chọn TechFlowTuyển chọn TechFlow

techFlow

Lược sử chiến thắng của AI: Nơi nào có hệ thống chấm điểm, nơi đó có sự xâm nhập của AI

Khi một lĩnh vực thiết lập được tiêu chuẩn chấm điểm, nó đã đặt ra đồng hồ đếm ngược cho việc chính nó bị chinh phục.

2026.07.23 - 03:46:52
AI
Khi một lĩnh vực thiết lập được tiêu chuẩn chấm điểm, nó đã đặt ra đồng hồ đếm ngược cho việc chính nó bị chinh phục.

Tác giả: Robonaissance

Biên dịch: TechFlow

Lời dẫn của TechFlow: Cờ Vây, cờ vua, gấp cuộn protein — những lĩnh vực tưởng chừng đòi hỏi trực giác và sự sáng tạo của con người này, tại sao lại lần lượt bị AI chinh phục? Bài viết này hé lộ một quy luật bị bỏ qua: Yếu tố quyết định việc AI có thể vượt qua con người hay không không phải là độ khó của nhiệm vụ, mà là liệu có thể chấm điểm cho sự thành công hay không. Khi một lĩnh vực thiết lập được tiêu chuẩn chấm điểm, nó đã tự đặt ra một đồng hồ đếm ngược cho việc bị chinh phục.

Trích từ series《Whatever You Ask For》, về công việc duy nhất mà máy móc không thể thay thế chúng ta làm.

Một trên mười nghìn

Ngày 10 tháng 3 năm 2016, trong một khách sạn ở Seoul, một cỗ máy đã đi một nước cờ mà tất cả mọi người trong phòng đều không hiểu, trong khi đối thủ của nó lúc đó không có mặt.

Lee Sedol đã ra ngoài hút thuốc. Anh ấy当时 33 tuổi, nắm giữ 18 danh hiệu vô địch thế giới, được công nhận là kỳ thủ cờ Vây mạnh nhất của thế hệ đó. Anh đã thua ván đầu tiên vào ngày hôm trước, bước vào ván thứ hai với sự tự tin trước trận đấu đã收敛 đi不少, tâm thái thận trọng hơn. Trong lúc anh ở bên ngoài, AlphaGo đã chọn nước thứ 37, nhà nghiên cứu DeepMind Aja Huang thay mặt cỗ máy, lặng lẽ đặt quân cờ lên bàn cờ.

Quân cờ rơi vào hàng thứ năm.

Đối với những người không hiểu cờ Vây, điều này chẳng có ý nghĩa gì. Đối với những người hiểu, điều này gần như là nghịch lý. Trong giai đoạn khai cuộc và trung cuộc, những vị trí quá xa khỏi mép bàn cờ bị coi là kém hiệu quả, vừa không chiếm được đất thực, cũng không giữ được địa bàn, chẳng khác nào tặng điểm cho đối thủ. Đây là loại nước đi mà giáo viên sẽ sửa cho người mới học. Trên bàn bình luận, kỳ thủ chuyên nghiệp hàng đầu Michael Redmond khi phát sóng trực tiếp trận đấu, ban đầu nghĩ là tín hiệu bàn cờ bị lỗi. Anh ấy cầm một quân cờ lên, rồi lại đặt xuống.

Lee Sedol trở lại ngồi xuống,盯着 bàn cờ nhìn rất lâu không cử động. Các ước tính khác nhau từ khoảng 12 phút đến 15 phút. Fan Hui, nhà vô địch châu Âu đã bị AlphaGo đánh bại năm tháng trước,当时 đang xem trận đấu trong tòa nhà. Anh ấy盯着 nhìn rất lâu rồi đưa ra nhận định: "Đây không phải là nước đi của con người. Tôi chưa bao giờ thấy ai đi như vậy."

Anh ấy nói đúng, và đúng đến mức có thể định lượng. Hệ thống nội bộ của DeepMind có một cơ chế ước tính, thông qua việc học một lượng lớn các ván cờ của con người, ước tính xác suất con người đi một nước cờ cụ thể trong bất kỳ局面 nào. Đối với nước thứ 37, giá trị ước tính này vào khoảng một trên mười nghìn.

Cỗ máy vẫn đi, và nước cờ này đã thắng cả ván.

Có một cách giải thích dễ chịu cho câu chuyện này, nói rằng cỗ máy đã rất nỗ lực học hỏi các đại sư con người, cuối cùng đã đuổi kịp những người mạnh nhất trong số họ. Cách giải thích này sai, con số một trên mười nghìn này恰恰说明了 tại sao sai. Một hệ thống học bắt chước cách đi của con người có một trần giới hạn, trần giới hạn chính là cách đi của con người. Những gì xảy ra ở Seoul là, một hệ thống không còn bị ràng buộc bởi trần giới hạn đó, bởi vì mục tiêu được giao cho nó không phải là sự công nhận của các đại sư con người, mà là thắng cờ.

Sự khác biệt này chỉ ra một hướng đi hữu ích hơn là sự thán phục. Nếu bạn muốn biết những hoạt động nào của con người đã thua trên khía cạnh năng lực thuần túy, và những gì là tiếp theo, câu hỏi cần đặt ra không phải là hoạt động này khó đến mức nào, cần bao nhiêu sự sáng tạo, hoặc cần bao nhiêu trực giác. Câu hỏi còn tầm thường hơn thế.

Câu hỏi là, liệu thành công có thể được chấm điểm hay không.

Hết ván này đến ván khác

Cờ vua đã thua từ 19 năm trước, thua theo một cách hoàn toàn khác.

Deep Blue đã đánh bại Kasparov vào năm 1997, sử dụng kiến trúc về cơ bản là một hành vi biểu đạt khổng lồ của con người. Hàm đánh giá của nó — thành phần nhìn một局面 và đưa ra con số有多 tốt — được lắp ráp và tinh chỉnh với sự trợ giúp của các cố vấn đại kiện tướng. Kiến thức cờ vua của con người đã được trích xuất một cách vất vả từ các kỳ thủ con người, và được viết vào máy. Điều máy móc thêm vào là khả năng tìm kiếm: nhìn trước nhiều bước hơn với tốc độ nhanh hơn, không biết mệt mỏi, không mất cờ do sự phân tán chú ý.

Đây là một chiến thắng thực sự, nên được tính là một chiến thắng. Nhưng hãy chú ý đến hình thái của nó. Sự hiểu biết của Deep Blue về cờ vua là sự hiểu biết của con người. Lợi thế của nó là tốc độ. Nếu bạn hỏi nó tại sao lại đánh giá một局面 như vậy, câu trả lời cuối cùng sẽ rơi vào một người nào đó đã bảo nó làm như vậy.

20 năm sau, DeepMind phát hành một hệ thống gọi là AlphaZero, hình thái đã thay đổi.

AlphaZero được cung cấp các quy tắc cờ vua. Nó không được cung cấp thư viện khai cuộc — danh mục các nước đi đầu tiên đã được nghiên cứu mà mọi chương trình nghiêm túc đều phụ thuộc. Nó không được cung cấp bảng tàn cuộc. Nó không được cung cấp một ván cờ nào của con người. Nó tự chơi với chính mình, bắt đầu từ các nước đi ngẫu nhiên, điều chỉnh chính nó dựa trên những gì có thể thắng.

Khoảng bốn giờ sau, DeepMind ước tính điểm xếp hạng của nó đã vượt qua chương trình truyền thống mạnh nhất当时 là Stockfish 8. Khoảng chín giờ sau, nó chơi một trăm ván với Stockfish trong điều kiện giới hạn thời gian, thắng 28 ván, không thua ván nào, 72 ván còn lại hòa. Bài báo cáo rằng, trong vòng 24 giờ, nó đã đạt đến mức độ siêu việt con người trên cả cờ vua, Shogi và cờ Vây.

Những con số này thường được trích dẫn mà không có nửa còn lại của câu chuyện, mà nửa còn lại rất quan trọng. Các ván cờ tự đối弈 được tạo ra trên năm nghìn đơn vị xử lý tensor thế hệ đầu tiên,另有 sáu mươi bốn đơn vị thế hệ thứ hai huấn luyện mạng, tất cả chạy song song. Thời gian bốn giờ trên đồng hồ treo tường, là bốn giờ khối lượng tính toán — lượng này bất kỳ cá nhân nào, thậm chí một vài tổ chức cũng không thể lắp ráp được. Thành tựu không phải là học cờ vua rất dễ. Thành tựu là, khi bạn có nhiều sức mạnh tính toán như vậy, kiến thức con người không còn là thứ bạn cần.

Kasparov có lý do hơn bất kỳ ai còn sống để coi kết quả này là nhắm vào mình, nhưng ông ấy đã viết một bài bình luận trên《Science》, rất hào phóng. Quan sát của ông là, AlphaGo không chơi loại cờ vua khô khan, thận trọng, thiên về hòa mà mọi người nghĩ một cỗ máy hoàn hảo sẽ chơi. Nó ưa thích sự năng động hơn là lực lượng tử, hy sinh quân vì những局面 mà theo mắt ông ấy trông có vẻ rủi ro. Ông ấy chỉ ra rằng, các chương trình truyền thống mang theo những ưu tiên và thành kiến của những người viết ra chúng. AlphaZero tự viết chính mình. Ông ấy kết luận, phong cách của nó do đó phản ánh một thứ gì đó chân thực hơn là khẩu vị của lập trình viên, và quan sát thấy nó kiểm tra ít局面 hơn mỗi giây so với các engine truyền thống tốt nhất thế giới, nhưng vẫn thắng.

Chi tiết cuối cùng này đáng để ghi nhớ. Các engine truyền thống tìm kiếm nhiều khả năng hơn mỗi giây, nhưng lại thua. Lợi thế của AlphaZero không phải là nhìn chăm chỉ hơn, mà là biết nhìn vào đâu, và kiến thức này được lắp ráp bởi hàng triệu ván tự đối弈 và một quy tắc về ai thắng, không có gì khác.

Kết quả Shogi còn kỳ lạ hơn đối với những người đủ tư cách để hiểu. Shogi là một loại cờ Nhật Bản, các quân bị ăn sẽ quay trở lại tay của bên ăn nó, điều này làm cho sự biến động của局面 vượt quá cờ vua, nó cũng có lý thuyết tích lũy hàng trăm năm về cách bảo vệ an toàn cho Vua. Các kỳ thủ mạnh xem các ván cờ của máy báo cáo rằng, khai cuộc vi phạm lý thuyết đã biết, Vua chạy vào trung tâm bàn cờ vào những thời điểm mà mọi cuốn sách đều nói nên rút vào góc. Những ván cờ này gần như không thể giải thích được đối với đôi mắt đã được đào tạo, nhưng chúng đã thắng.

Đặt hai hệ thống cạnh nhau, quy luật rõ ràng đến mức đáng lo ngại. Deep Blue là kiến thức con người cộng với tốc độ máy móc. AlphaZero là tốc độ máy móc cộng với định nghĩa về chiến thắng, kiến thức con người bị cố ý loại bỏ. Phiên bản loại bỏ kiến thức con người tốt hơn.

Tất cả điều này không có nghĩa là cỗ máy năm 2016 là hoàn hảo không tì vết, chính trận đấu Seoul năm đó đã chứa đựng bằng chứng.

Ván thứ tư, thua ba ván, chiến đấu vì danh dự, Lee Sedol đã chèn một quân cờ vào giữa hai khối cờ của AlphaGo ở trung tâm bàn cờ. Nó sau này được gọi là nước cờ thần thánh. AlphaGo tự ước tính xác suất con người sẽ đi nước cờ này, cũng vào khoảng một trên mười nghìn, đối xứng một cách kỳ lạ. Hệ thống không thể đối phó. Đánh giá của nó về xác suất thắng của chính mình đã sụp đổ trong vài nước tiếp theo, sức cờ suy giảm, và thua ván này.

Vì vậy, vào tháng 3 năm 2016, trên cỗ máy vẫn còn một lỗ hổng, một lỗ hổng mà con người đã tìm thấy dưới sự chứng kiến của toàn thế giới, dưới áp lực lớn nhất. Điều này đáng được nói ra rõ ràng, thay vì bỏ qua một cách âm thầm. Cũng đáng nói là những gì xảy ra sau đó: những lỗ hổng loại này đã được sửa chữa ổn định, những người kế nhiệm của hệ thống đó không còn thua những ván cờ như vậy nữa, các engine hàng đầu đã很久 không thua con người một ván cờ nào trong các场合 nghiêm túc. Kết quả năm 2016 là một bức ảnh chụp nhanh của một sự chuyển đổi, không phải là sự cân bằng lực lượng vĩnh viễn.

Từ những bàn cờ này sang mọi thứ khác, thứ được chuyển giao không phải là chiến thắng tự thân, mà là cơ chế. Cờ vua và cờ Vây注定 sẽ là những thứ đổ đầu tiên, lý do đơn giản đến mức尴尬. Trong trò chơi, thành công được định nghĩa bởi các quy tắc một cách hoàn toàn chính xác. Bạn thắng hoặc không thắng, việc chấm điểm là miễn phí, tức thì, không thể tranh cãi. Một hệ thống có thể tự chơi với chính mình bốn mươi triệu ván trong một cuối tuần, nhận được bốn mươi triệu phán quyết rõ ràng không nhầm lẫn.

Điều này gợi ý nơi tiếp theo cần nhìn. Không phải những nhiệm vụ đơn giản, mà là những nhiệm vụ自带 bảng điểm.

Bài toán năm mươi năm

Protein là các chuỗi axit amin, gấp cuộn thành các hình dạng ba chiều phức tạp ngay tại thời điểm được tạo ra. Hình dạng quyết định protein làm gì. Chuỗi quyết định hình dạng. Việc suy luận cái sau từ cái trước, từ đầu những năm 1970, đã là một vấn đề mở trong sinh học, và là một cách mở kháng cự mọi cuộc tấn công: từ mô phỏng vật lý dựa trên các nguyên lý đầu tiên, phân tích thống kê về họ hàng tiến hóa, đến trực giác cấu trúc tích lũy qua hàng thập kỷ, tất cả đều không hiệu quả.

Năm 1994, một nhóm nhà nghiên cứu do John Moult đứng đầu đã làm điều gì đó với thực tế này: mọi người trong lĩnh vực đều tuyên bố tiến bộ, nhưng không ai có thể kiểm tra.

Họ tạo ra một kỳ thi. Kể từ đó hai năm một lần, Critical Assessment of protein Structure Prediction (CASP) đưa ra các cấu trúc protein vừa được xác định bằng thực nghiệm, trong một số trường hợp thậm chí vẫn đang trong quá trình xác định, công bố chuỗi cho toàn thế giới. Bất kỳ nhóm nào cũng có thể提交 dự đoán. Không ai có thể tiếp cận câu trả lời, vì câu trả lời cho một số mục tiêu chưa tồn tại. Khi cấu trúc thực nghiệm xuất hiện, các dự đoán sẽ được đối chiếu và chấm điểm.

Việc chấm điểm sử dụng một chỉ số gọi là Global Distance Test, từ 0 đến 100, có thể hiểu thô là tỷ lệ phần trăm vị trí cuối cùng của chuỗi đủ gần với vị trí thực tế. Moult đã nói, khoảng 90 điểm được xem xét không chính thức là tương đương với cấu trúc được xác định trong phòng thí nghiệm. Trong大部分 lịch sử đánh giá, các dự đoán tốt nhất dao động quanh mức 60 điểm.

Tại CASP14 năm 2020, một người tham gia đăng ký là nhóm 427 đã đạt điểm trung vị 92.4 trên tất cả các mục tiêu. Trong danh mục khó nhất — các mục tiêu không có họ hàng cấu trúc hữu ích nào để dựa vào, điểm trung vị là 87.0. Sai số trung bình khoảng 1.6 Angstrom,大致 tương đương với chiều rộng của một nguyên tử.

Moult đã担任 chủ tịch từ khi cuộc thi bắt đầu, ông ấy đã đưa khán giả ôn lại lịch sử cuộc thi trước khi trình bày biểu đồ. Biểu đồ dùng một hình ảnh để minh họa toàn bộ câu chuyện. Các đường線 của hai mươi năm bò quanh mức 60 điểm, sau đó một đường đứng ở nơi mà các đường khác chưa bao giờ đến.

Nhóm 427 là AlphaFold2. Moult tuyên bố, đối với một chuỗi protein đơn lẻ, vấn đề đã được giải quyết.

Các từ hạn định nên ở đó, nên có trong mọi câu chuyện trung thực. Chuỗi đơn lẻ không phải là tất cả của khoa học protein. Cách protein lắp ráp thành phức hợp, cách chúng chuyển động, cách chúng hoạt động trong tế bào sống, tất cả những điều này vẫn còn mở. Thách thức lớn bị đóng lại là một thách thức cụ thể, được phát biểu chính xác.

Và sự chính xác này chính là điểm mấu chốt của việc kể câu chuyện này ở đây. Thứ làm cho dự đoán cấu trúc sụp đổ không phải là nó原来 rất đơn giản, bởi vì nửa thế kỷ thất bại đã chứng minh điều ngược lại. Thứ làm cho nó sụp đổ là, vào năm 1994, lĩnh vực này đã tự xây dựng cho mình một bảng điểm.

Nhìn CASP như một kỹ thuật而非 khoa học, nó cung cấp những gì. Nó cung cấp một thước đo thành công rõ ràng không nhầm lẫn, áp dụng cho bất kỳ dự đoán nào, có thể tính toán trong vài giây. Nó cung cấp một thực tế基准 không thể gian lận, vì câu trả lời được người khác xác định vật lý trong phòng thí nghiệm. Nó cung cấp một dòng chảy vấn đề mới được tạo ra liên tục theo lịch trình cố định. Nó cung cấp ba mươi năm lịch sử các nỗ lực đã được chấm điểm, nghĩa là, một hồ sơ phân loại về thế nào là tốt hơn, thế nào là kém hơn trong lĩnh vực này.

Một lĩnh vực làm tất cả những điều này, vô tình đã chuẩn bị sẵn vấn đề của mình cho một cuộc tấn công tự động hóa. Bảng điểm là điều kiện tiên quyết. Mọi thứ khác là kỹ thuật và tính toán, và cả hai thứ này đều trở nên rẻ hơn mỗi năm trong một thời gian dài.

Điều này khái quát hóa một cách dễ dàng đến mức đáng lo ngại. Nơi nào các ngành học đạt được sự đồng thuận về基准, nơi đó sẽ phát hành một mục tiêu. Dịch máy có基准 chấm điểm. Nhận dạng giọng nói có基准 chấm điểm. Phân loại hình ảnh có một bộ sưu tập một triệu bức ảnh được gắn nhãn và một cuộc thi hàng năm, mọi người đã xem cuộc thi đó đều biết câu chuyện kết thúc như thế nào. Quy luật không phải là những thứ khó đổ trước, hoặc những thứ đơn giản đổ trước. Quy luật là những thứ được đo lường đổ trước.

Điều này đặt ra một câu hỏi hiển nhiên cho tất cả những thứ chưa được đo lường.

Chấm điểm cho những thứ không thể chấm điểm

Tuyến phòng thủ cuối cùng lẽ ra phải là những thứ không thể chấm điểm.

Viết lách là ví dụ tiêu chuẩn. Không có chương trình nào có thể lấy một đoạn văn và trả về một con số nói rằng nó tốt đến mức nào. Hai biên tập viên có năng lực bất đồng ý kiến. Cùng một biên tập viên bất đồng ý kiến với chính mình vào những ngày khác nhau. Chất lượng ngôn ngữ vướng víu với ngữ cảnh, đối tượng, mục đích và khẩu vị, những thứ này không thể quy giản về một giá trị đo lường. Nếu máy móc cần bảng điểm, mà ngôn ngữ không có bảng điểm, thì ngôn ngữ là an toàn.

Lập luận này là đúng. Điều xảy ra với nó, là nguyên nhân quan trọng nhất trong toàn bộ câu chuyện này.

Lĩnh vực này không tìm thấy một thước đo khách quan cho việc viết tốt. Vẫn không có thứ这种东西. Điều nó làm là tạo ra một điểm số bằng vật liệu duy nhất có sẵn, đó là chính phán đoán của con người.

Lịch sử của phương pháp này lâu đời hơn hầu hết mọi người nghĩ. Năm 2008, Knox và Stone mô tả một hệ thống tên là TAMER, cho phép con người quan sát hành vi của tác nhân và đưa ra đánh giá, những đánh giá này được sử dụng để huấn luyện một mô hình dự đoán con người sẽ nói gì. Sau đó, chính mô hình chứ không phải con người cung cấp tín hiệu huấn luyện. Năm 2017, Christiano và các đồng nghiệp đã công bố một công trình được hầu hết mọi người coi là nguồn gốc trực tiếp của thực hành hiện tại, áp dụng ý tưởng này cho các tác nhân trò chơi Atari. Năm 2019, Ziegler và các đồng nghiệp áp dụng nó cho các mô hình ngôn ngữ, hầu hết các thuật ngữ được sử dụng ngày nay đã được xác định trong bài báo đó. Năm 2022, Ouyang và các đồng nghiệp đã trình bày phương pháp này ở quy mô công nghiệp trên các nhiệm vụ tuân theo chỉ dẫn, và不久 sau đó, hầu hết mọi người trên Trái đất đã tiếp xúc với những kết quả này mà không hay biết.

Cơ chế cốt lõi của nó đáng để tìm hiểu cụ thể, bởi vì nó đơn giản hơn nhiều so với những gì danh tiếng nghe có vẻ.

Một người ngồi trước hai đoạn văn bản, cả hai đoạn văn bản đều do mô hình tạo ra cho cùng một prompt. Nhiệm vụ không phải là chấm điểm cho chúng. Chấm điểm恰恰 là điều con người làm rất kém, bởi vì bảy điểm của người này là năm điểm của người khác, và cùng một người cũng không ổn định trong một buổi chiều. Nhiệm vụ chỉ là nói cái nào tốt hơn. Đây là phán đoán mà con người có thể đưa ra một cách đáng tin cậy, và các phương pháp toán học để chuyển đổi một loạt các so sánh như vậy thành một thang đo nhất quán, còn lâu đời hơn cả lĩnh vực sử dụng nó, có thể truy ngược lại công trình của Bradley và Terry về so sánh cặp vào năm 1952.

Hãy xem xét các điều kiện làm việc để đưa ra phán đoán loại này, bởi vì chúng cuối cùng sẽ tạo ra ảnh hưởng. Người này phải đưa ra nhiều phán đoán như vậy mỗi giờ, nhận thù lao, đối chiếu với một hướng dẫn bằng văn bản, giải thích những gì khách hàng coi là câu trả lời tốt hơn. Một số cặp gần như hoàn toàn giống nhau. Một số liên quan đến các chủ đề mà người này không biết gì, trong trường hợp đó, câu trả lời tự tin hơn, tổ chức tốt hơn trong hai câu trả lời thường sẽ được chọn, bất kể nó có chính xác hơn hay không. Đây không phải là lời phê bình dành cho những người này. Đây là mô tả về những gì bất kỳ ai sẽ làm trong điều kiện như vậy, và các lựa chọn由此产生的 chính là nguyên liệu thô.

Thu thập đủ nhiều các lựa chọn này, bạn có thể huấn luyện một mô hình thứ hai, có nhiệm vụ dự đoán con người sẽ thích đoạn văn bản nào trong hai đoạn văn bản. Mô hình thứ hai này xuất ra một con số. Và một con số chính là thứ duy nhất còn thiếu từ trước đến nay.

Hãy nhìn kỹ những gì được thiết lập ở đây, bởi vì rất dễ bỏ qua. Điểm số được tối ưu hóa không phải là sự thật về thế giới. Nó là về mô hình của chúng ta. Nó là sự bắt chước được nén, được học hỏi về phán đoán của một nhóm người cụ thể, những người này được thuê vào một thời điểm cụ thể, làm việc dưới những chỉ dẫn cụ thể, cảm thấy mệt mỏi vào buổi chiều như tất cả mọi người khác. CASP chấm điểm các dự đoán dựa trên thực tế vật lý được xác định trong phòng thí nghiệm, và hệ thống này chấm điểm văn bản dựa trên chân dung thống kê của sự công nhận của con người.

Chân dung này là hữu ích. Nhưng nó cũng tất yếu là một sự gần đúng, có sự khác biệt giữa nó và đối tượng được mô tả, không ai hoàn toàn hiểu rõ những khác biệt này. Bất kỳ điều gì về sở thích thực tế của chúng ta mà mô hình sở thích của chúng ta không nắm bắt được đều không nằm trong mục tiêu, do đó sẽ không được tối ưu hóa, do đó sẽ chịu ảnh hưởng của bất kỳ tình huống nào — và các bộ tối ưu hóa mạnh mẽ không có lý do gì để bảo vệ đại lượng này.

Đây là sự thật về cấu trúc, được陈述 ở đây mà không đưa ra bất kỳ tuyên bố nào về hậu quả tồi tệ đến mức nào. Điểm mấu chốt trước mắt hẹp hơn và khó bác bỏ hơn. Loại các thứ không thể chấm điểm nhỏ hơn so với vẻ bề ngoài. Nếu một lĩnh vực kháng cự việc đo lường, có thể xây dựng một phép đo từ sở thích của con người và tiếp tục. Tuyến phòng thủ này chỉ hiệu quả khi không ai nghĩ đến việc tạo ra điểm số.

Điều gì sẽ sụp đổ tiếp theo

Điều này để lại một vấn đề thực tế, và một câu trả lời khả dụng.

Chọn bất kỳ hoạt động nào bạn thích: một công việc, một nghề thủ công, một nghề nghiệp, một nhiệm vụ mà bạn đã dành nhiều năm để học cách làm tốt. Hỏi ba câu hỏi.

Thứ nhất, thành công và thất bại có thể được phân biệt một cách đáng tin cậy không? Không phải một cách hoàn hảo, cũng không phải bởi mọi người, nhưng đủ nhất quán để các giám khảo có năng lực đồng ý với nhau trong hầu hết các trường hợp. Trò chơi dễ dàng vượt qua关卡 này. Dự đoán cấu trúc protein vượt qua关卡 này bởi vì phòng thí nghiệm cuối cùng sẽ tạo ra câu trả lời. Viết lách không vượt qua theo nghĩa tuyệt đối, nhưng vượt qua theo nghĩa tương đối, bởi vì mọi người thường có thể nói lần thử nào tốt hơn trong hai lần thử.

Thứ hai, phán đoán này có thể được tạo ra hàng loạt với chi phí thấp không? Câu hỏi này quyết định thời điểm chứ không phải khả năng. Một phán đoán miễn phí và tức thì, như trong trò chơi, có nghĩa là hệ thống có thể tự tạo ra hàng triệu dữ liệu huấn luyện. Một phán đoán cần phòng thí nghiệm chậm hơn nhưng vẫn khả thi, có hồ sơ ba mươi năm các nỗ lực chấm điểm. Một phán đoán cần con người được trả tiền đọc văn bản thì đắt đỏ, đây chính xác là lý do tại sao nhiều nỗ lực đã được投入 để huấn luyện các mô hình bắt chước những con người này và loại bỏ họ khỏi vòng lặp.

Thứ ba, điều này không quyết định khi nào một lĩnh vực sụp đổ, mà là những gì sẽ xảy ra sau đó: điểm số này thực sự là thứ bạn muốn吗? Điểm số của trò chơi là thứ bạn muốn, bởi vì trong trò chơi, chiến thắng theo định nghĩa là toàn bộ ý nghĩa. Cấu trúc protein được đo lường theo thực nghiệm rất gần với thứ bạn muốn. Một mô hình học hỏi sở thích của người gắn nhãn không phải là thứ bạn muốn. Nó là chân dung của thứ bạn muốn, và có một khoảng cách giữa chân dung và khuôn mặt.

Hãy kiểm tra công việc của chính bạn bằng ba câu hỏi này. Hầu hết mọi người thấy câu trả lời đầu tiên đến rất nhanh và đáng lo ngại. Hầu hết những thứ chúng ta gọi là kỹ năng, ít nhất là theo nghĩa tương đối, có thể được chấm điểm khi được những người có năng lực nhìn song song hai lần thử. Câu hỏi thứ hai là sự không chắc chắn thực sự, bởi vì chi phí và quy mô là các mục tiêu di chuyển, và chúng đã di chuyển theo một hướng trong một thời gian dài. Câu hỏi thứ ba là hầu như không ai hỏi, và nó quyết định lĩnh vực của bạn sẽ như thế nào ở phía bên kia.

Đáng để thực hiện bài tập này một cách chậm rãi trên một số事情 thông thường. Lấy chẩn đoán hình ảnh làm ví dụ. Thành công và thất bại có thể phân biệt không? Có, và rất chính xác, bởi vì chẩn đoán cuối cùng sẽ được tình trạng của bệnh nhân xác nhận hoặc bác bỏ. Phán đoán có thể được tạo ra hàng loạt với chi phí thấp không? Về cơ bản là có, bởi vì các bệnh viện đã tích lũy các mẫu chấm điểm dưới dạng hình ảnh và kết quả xác nhận trong hàng thập kỷ. Điểm số này là thứ bạn muốn吗? Câu trả lời trở nên phức tạp ở đây, bởi vì thứ được chấm điểm là sự nhất quán với chẩn đoán được ghi lại, trong khi thứ muốn là tình trạng bệnh nhân tốt, hai điều này nhất quán trong hầu hết các trường hợp, nhưng恰恰 tách rời trong những trường hợp quan trọng nhất.

Bây giờ hãy lấy một thứ trông có vẻ an toàn hơn. Lấy quản lý làm ví dụ. Câu hỏi đầu tiên đã khó, bởi vì những người có năng lực bất đồng ý kiến về việc một nhà quản lý cụ thể có giỏi hay không, và sự bất đồng không giải quyết nhanh chóng. Câu hỏi thứ hai khó hơn, bởi vì kết quả của các quyết định quản lý phải nhiều năm sau mới đến, vướng víu với mọi thứ khác xảy ra. Câu hỏi thứ ba khó nhất, bởi vì bất kỳ chỉ số thay thế nào cho quản lý tốt mà bất kỳ ai đề xuất, từ tỷ lệ giữ chân đến điểm số gắn kết đến sản lượng trên mỗi người, rõ ràng không phải là bản thân sự việc. Theo chẩn đoán này, quản lý không an toàn vì sâu sắc. Nó không được đo lường, đây là một sự bảo vệ khác, kém dễ chịu hơn.

Máy móc đã chiếm trục tối ưu hóa. Trên bất kỳ mục tiêu được chỉ định rõ ràng nào, với đủ tính toán, việc tìm kiếm các nước đi tốt không còn là cuộc đua, và kết quả thường không chỉ mạnh hơn của chúng ta, mà còn lạ lùng hơn, đi đến những nơi mà truyền thống của chúng ta dạy chúng ta không nên nhìn. Đây không phải là dự đoán. Đây là mô tả về cờ vua, cờ Vây, Shogi, cấu trúc protein và ngày càng nhiều thứ từng nằm trong danh sách chỉ con người mới có thể làm.

Còn lại là bản thân mục tiêu. Ai đó quyết định điểm số là gì. Trong mỗi trường hợp trên, quyết định đó mất một buổi chiều, và mọi kết quả phi thường đều bắt nguồn từ nó, trung thành với nó, và thờ ơ với bất kỳ thứ gì nó bỏ sót.

Vì vậy, câu hỏi cuối cùng đáng để suy ngẫm. Trong công việc của bạn, đã có điểm số chưa? Nếu có, ai đã viết nó, và họ có nghĩ đến bạn khi viết không?

Đây là phần thứ hai của series《Whatever You Ask For》, về những gì máy móc cuối cùng cần chúng ta, và chúng ta đã làm tệ đến mức nào.

Chào mừng tham gia cộng đồng chính thức TechFlow

Nhóm Telegram:https://t.me/TechFlowDaily

Tài khoản Twitter chính thức:https://x.com/TechFlowPost

Tài khoản Twitter tiếng Anh:https://x.com/BlockFlow_News

Thêm vào mục ưa thích
Chia sẻ lên mạng xã hội
Tác giả
Robonaissance

Bài viết liên quan

2026.07.23

Ghi chú Podcast|Trò chuyện với CEO Morgan Stanley Jamie Dimon: Cổ phiếu Mỹ lẫn trái phiếu dài hạn hiện tại tôi đều không mua, lợi nhuận từ đầu tư AI có thể sẽ khác với kỳ vọng của bạn

Khi nhìn vào chính bản thân AI, số tiền đổ vào là khổng lồ. Nhìn tổng thể thì có sinh lời không? Có lẽ là có, cũng giống như internet. Nhưng lợi nhuận có đến theo đúng cách thức và thời gian mà bạn kỳ vọng không? Tuyệt đối không.

Ghi chú Podcast|Trò chuyện với CEO Morgan Stanley Jamie Dimon: Cổ phiếu Mỹ lẫn trái phiếu dài hạn hiện tại tôi đều không mua, lợi nhuận từ đầu tư AI có thể sẽ khác với kỳ vọng của bạn
2026.07.23

Phân tích báo cáo nghiên cứu Morgan Stanley: Nhóm ngành phần mềm quá bi quan, khung mới khai thác các cổ phiếu phần mềm AI chất lượng cao.

Trọng tâm giá trị của AI nên nằm ở tầng workflow.

Phân tích báo cáo nghiên cứu Morgan Stanley: Nhóm ngành phần mềm quá bi quan, khung mới khai thác các cổ phiếu phần mềm AI chất lượng cao.
2026.07.23

Biên bản cuộc họp nhà đầu tư bốn giờ của Lương Văn Phong

"Chỉ cần duy trì được sự ổn định của đội ngũ, tôi nhất định sẽ làm được AGI. Đơn giản chỉ có vậy."

Biên bản cuộc họp nhà đầu tư bốn giờ của Lương Văn Phong
2026.07.23

Franklin Templeton: AI Agent mới chính là "ứng dụng đột phá" của blockchain

Tài sản mã hóa có lẽ mới chính là chìa khóa để nắm bắt cơ hội từ AI Agent.

Franklin Templeton: AI Agent mới chính là "ứng dụng đột phá" của blockchain
2026.07.22

Tối nay, Google thay toàn bộ thị trường AI nộp bài

Thị trường không chờ đợi xem Google kiếm được bao nhiêu tiền, mà là lịch trình phát hành mới của Gemini 3.5 Pro.

Tối nay, Google thay toàn bộ thị trường AI nộp bài
2026.07.22

AI sẽ không thức tỉnh ý thức, nhưng đang trở thành vô thức của xã hội

Chúng ta có thể làm được ngày càng nhiều việc, nhưng lại hiểu ngày càng ít. Điều này là một hồi chuông cảnh tỉnh cho mỗi người làm nghề phụ thuộc vào công cụ AI.

AI sẽ không thức tỉnh ý thức, nhưng đang trở thành vô thức của xã hội
2026.07.22

Điều Jensen Huang lo ngại đã xảy ra: Các mô hình nguồn mở Trung Quốc đang tiếp quản AI doanh nghiệp

Đây không phải là cuộc cạnh tranh công nghệ, mà là sự tái phân chia quyền lực AI.

Điều Jensen Huang lo ngại đã xảy ra: Các mô hình nguồn mở Trung Quốc đang tiếp quản AI doanh nghiệp
2026.07.22

Ghi chú Podcast|Đại gia đầu tư Bill Ackman: Bán Alphabet tăng vị thế Microsoft, cược vào cơ sở hạ tầng AI

$14 tỷ chỉ cược vào 11 cổ phiếu, vừa giảm vị thế Google đổi sang $2 tỷ Microsoft, muốn sao chép danh mục có thể mua trực tiếp quỹ PSUS.

Ghi chú Podcast|Đại gia đầu tư Bill Ackman: Bán Alphabet tăng vị thế Microsoft, cược vào cơ sở hạ tầng AI
2026.07.22

Phân tích báo cáo nghiên cứu của JPMorgan: AI bước vào giai đoạn kiểm chứng khả năng biến hiện, dòng vốn chuyển từ phần cứng sang các gã khổng lồ đám mây.

JPMorgan Chase cho rằng các nhà cung cấp siêu quy mô sở hữu nền tảng đám mây, trung tâm dữ liệu và hệ sinh thái ứng dụng AI có tỷ lệ rủi ro/lợi nhuận tốt hơn so với phần cứng AI.

Phân tích báo cáo nghiên cứu của JPMorgan: AI bước vào giai đoạn kiểm chứng khả năng biến hiện, dòng vốn chuyển từ phần cứng sang các gã khổng lồ đám mây.
2026.07.22

Băng đảng Crypto trong giới AI

Crypto không bỗng dưng biến thành AI, nó chỉ chuyển những nguồn lực còn lại từ chu kỳ trước sang ngành tiếp theo cần chúng nhiều hơn.

Băng đảng Crypto trong giới AI
TechFlow Logo

Chuyên sâu báo cáo Web3

Tôi muốn đăng bàiemail
Yêu cầu phỏng vấnmsg

Cảnh báo rủi ro: mọi nội dung trên website này không cấu thành tư vấn đầu tư và chúng tôi không cung cấp bất kỳ dịch vụ tín hiệu hay dẫn dắt giao dịch nào. Theo thông báo của PBoC và 10 bộ ngành về việc tăng cường phòng ngừa rủi ro đầu cơ tiền mã hóa, xin hãy nâng cao ý thức rủi ro. Liên hệ: [email protected] Mã ICP: 琼ICP备2022009338号